| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 50, |
| "global_step": 1000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": false, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.05, |
| "eval_accuracy": 0.07674803149606299, |
| "eval_loss": 59.70803451538086, |
| "eval_runtime": 27.1066, |
| "eval_samples_per_second": 4.611, |
| "eval_steps_per_second": 0.59, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.1, |
| "grad_norm": 1437.81298828125, |
| "learning_rate": 0.000264, |
| "loss": 1842.08875, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.1, |
| "eval_accuracy": 0.11214173228346457, |
| "eval_loss": 56.53706359863281, |
| "eval_runtime": 9.6201, |
| "eval_samples_per_second": 12.994, |
| "eval_steps_per_second": 1.663, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.15, |
| "eval_accuracy": 0.1248740157480315, |
| "eval_loss": 53.10245132446289, |
| "eval_runtime": 13.0919, |
| "eval_samples_per_second": 9.548, |
| "eval_steps_per_second": 1.222, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.2, |
| "grad_norm": 1170.414794921875, |
| "learning_rate": 0.0003967291041791484, |
| "loss": 1604.2784375, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.2, |
| "eval_accuracy": 0.14473228346456693, |
| "eval_loss": 49.9360237121582, |
| "eval_runtime": 9.3123, |
| "eval_samples_per_second": 13.423, |
| "eval_steps_per_second": 1.718, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.25, |
| "eval_accuracy": 0.17015748031496064, |
| "eval_loss": 47.78742218017578, |
| "eval_runtime": 10.4409, |
| "eval_samples_per_second": 11.972, |
| "eval_steps_per_second": 1.532, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.3, |
| "grad_norm": 627.5261840820312, |
| "learning_rate": 0.0003704314025795668, |
| "loss": 1458.88296875, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.3, |
| "eval_accuracy": 0.16708661417322834, |
| "eval_loss": 47.620853424072266, |
| "eval_runtime": 9.5812, |
| "eval_samples_per_second": 13.046, |
| "eval_steps_per_second": 1.67, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.35, |
| "eval_accuracy": 0.18376377952755907, |
| "eval_loss": 46.354679107666016, |
| "eval_runtime": 8.2523, |
| "eval_samples_per_second": 15.147, |
| "eval_steps_per_second": 1.939, |
| "step": 350 |
| }, |
| { |
| "epoch": 0.4, |
| "grad_norm": 1531.896484375, |
| "learning_rate": 0.0003211159956686115, |
| "loss": 1410.06390625, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.4, |
| "eval_accuracy": 0.18334645669291338, |
| "eval_loss": 45.935264587402344, |
| "eval_runtime": 9.4355, |
| "eval_samples_per_second": 13.248, |
| "eval_steps_per_second": 1.696, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.45, |
| "eval_accuracy": 0.18777165354330708, |
| "eval_loss": 45.47114944458008, |
| "eval_runtime": 14.0955, |
| "eval_samples_per_second": 8.868, |
| "eval_steps_per_second": 1.135, |
| "step": 450 |
| }, |
| { |
| "epoch": 0.5, |
| "grad_norm": 19442.306640625, |
| "learning_rate": 0.00025544320241571017, |
| "loss": 1381.1546875, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.5, |
| "eval_accuracy": 0.18888188976377954, |
| "eval_loss": 45.3370475769043, |
| "eval_runtime": 9.3555, |
| "eval_samples_per_second": 13.361, |
| "eval_steps_per_second": 1.71, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.55, |
| "eval_accuracy": 0.19033070866141732, |
| "eval_loss": 44.91364288330078, |
| "eval_runtime": 8.7783, |
| "eval_samples_per_second": 14.24, |
| "eval_steps_per_second": 1.823, |
| "step": 550 |
| }, |
| { |
| "epoch": 0.6, |
| "grad_norm": 28925.150390625, |
| "learning_rate": 0.0001822824974551769, |
| "loss": 1365.12171875, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.6, |
| "eval_accuracy": 0.19299212598425197, |
| "eval_loss": 44.67140579223633, |
| "eval_runtime": 9.3914, |
| "eval_samples_per_second": 13.31, |
| "eval_steps_per_second": 1.704, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.65, |
| "eval_accuracy": 0.19476377952755905, |
| "eval_loss": 44.36285400390625, |
| "eval_runtime": 11.8603, |
| "eval_samples_per_second": 10.539, |
| "eval_steps_per_second": 1.349, |
| "step": 650 |
| }, |
| { |
| "epoch": 0.7, |
| "grad_norm": 6494.93701171875, |
| "learning_rate": 0.0001115146393893927, |
| "loss": 1348.1965625, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.7, |
| "eval_accuracy": 0.19607086614173228, |
| "eval_loss": 44.26563262939453, |
| "eval_runtime": 9.2536, |
| "eval_samples_per_second": 13.508, |
| "eval_steps_per_second": 1.729, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.75, |
| "eval_accuracy": 0.19792125984251968, |
| "eval_loss": 44.026851654052734, |
| "eval_runtime": 13.9865, |
| "eval_samples_per_second": 8.937, |
| "eval_steps_per_second": 1.144, |
| "step": 750 |
| }, |
| { |
| "epoch": 0.8, |
| "grad_norm": 6566.00732421875, |
| "learning_rate": 5.269721958838045e-05, |
| "loss": 1335.25640625, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.8, |
| "eval_accuracy": 0.19969291338582676, |
| "eval_loss": 43.83841323852539, |
| "eval_runtime": 9.3886, |
| "eval_samples_per_second": 13.314, |
| "eval_steps_per_second": 1.704, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.85, |
| "eval_accuracy": 0.2002755905511811, |
| "eval_loss": 43.76130294799805, |
| "eval_runtime": 16.2687, |
| "eval_samples_per_second": 7.683, |
| "eval_steps_per_second": 0.983, |
| "step": 850 |
| }, |
| { |
| "epoch": 0.9, |
| "grad_norm": 5925.8193359375, |
| "learning_rate": 1.3773856514840955e-05, |
| "loss": 1328.743125, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.9, |
| "eval_accuracy": 0.20086614173228345, |
| "eval_loss": 43.69052505493164, |
| "eval_runtime": 9.3216, |
| "eval_samples_per_second": 13.41, |
| "eval_steps_per_second": 1.716, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.95, |
| "eval_accuracy": 0.2008503937007874, |
| "eval_loss": 43.665740966796875, |
| "eval_runtime": 15.4653, |
| "eval_samples_per_second": 8.083, |
| "eval_steps_per_second": 1.035, |
| "step": 950 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 6814.45703125, |
| "learning_rate": 1.3660336561915898e-09, |
| "loss": 1325.8203125, |
| "step": 1000 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_accuracy": 0.2012047244094488, |
| "eval_loss": 43.653385162353516, |
| "eval_runtime": 9.352, |
| "eval_samples_per_second": 13.366, |
| "eval_steps_per_second": 1.711, |
| "step": 1000 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 1000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 9223372036854775807, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|