{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 50, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": false, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05, "eval_accuracy": 0.07674803149606299, "eval_loss": 59.70803451538086, "eval_runtime": 27.1066, "eval_samples_per_second": 4.611, "eval_steps_per_second": 0.59, "step": 50 }, { "epoch": 0.1, "grad_norm": 1437.81298828125, "learning_rate": 0.000264, "loss": 1842.08875, "step": 100 }, { "epoch": 0.1, "eval_accuracy": 0.11214173228346457, "eval_loss": 56.53706359863281, "eval_runtime": 9.6201, "eval_samples_per_second": 12.994, "eval_steps_per_second": 1.663, "step": 100 }, { "epoch": 0.15, "eval_accuracy": 0.1248740157480315, "eval_loss": 53.10245132446289, "eval_runtime": 13.0919, "eval_samples_per_second": 9.548, "eval_steps_per_second": 1.222, "step": 150 }, { "epoch": 0.2, "grad_norm": 1170.414794921875, "learning_rate": 0.0003967291041791484, "loss": 1604.2784375, "step": 200 }, { "epoch": 0.2, "eval_accuracy": 0.14473228346456693, "eval_loss": 49.9360237121582, "eval_runtime": 9.3123, "eval_samples_per_second": 13.423, "eval_steps_per_second": 1.718, "step": 200 }, { "epoch": 0.25, "eval_accuracy": 0.17015748031496064, "eval_loss": 47.78742218017578, "eval_runtime": 10.4409, "eval_samples_per_second": 11.972, "eval_steps_per_second": 1.532, "step": 250 }, { "epoch": 0.3, "grad_norm": 627.5261840820312, "learning_rate": 0.0003704314025795668, "loss": 1458.88296875, "step": 300 }, { "epoch": 0.3, "eval_accuracy": 0.16708661417322834, "eval_loss": 47.620853424072266, "eval_runtime": 9.5812, "eval_samples_per_second": 13.046, "eval_steps_per_second": 1.67, "step": 300 }, { "epoch": 0.35, "eval_accuracy": 0.18376377952755907, "eval_loss": 46.354679107666016, "eval_runtime": 8.2523, "eval_samples_per_second": 15.147, "eval_steps_per_second": 1.939, "step": 350 }, { "epoch": 0.4, "grad_norm": 1531.896484375, "learning_rate": 0.0003211159956686115, "loss": 1410.06390625, "step": 400 }, { "epoch": 0.4, "eval_accuracy": 0.18334645669291338, "eval_loss": 45.935264587402344, "eval_runtime": 9.4355, "eval_samples_per_second": 13.248, "eval_steps_per_second": 1.696, "step": 400 }, { "epoch": 0.45, "eval_accuracy": 0.18777165354330708, "eval_loss": 45.47114944458008, "eval_runtime": 14.0955, "eval_samples_per_second": 8.868, "eval_steps_per_second": 1.135, "step": 450 }, { "epoch": 0.5, "grad_norm": 19442.306640625, "learning_rate": 0.00025544320241571017, "loss": 1381.1546875, "step": 500 }, { "epoch": 0.5, "eval_accuracy": 0.18888188976377954, "eval_loss": 45.3370475769043, "eval_runtime": 9.3555, "eval_samples_per_second": 13.361, "eval_steps_per_second": 1.71, "step": 500 }, { "epoch": 0.55, "eval_accuracy": 0.19033070866141732, "eval_loss": 44.91364288330078, "eval_runtime": 8.7783, "eval_samples_per_second": 14.24, "eval_steps_per_second": 1.823, "step": 550 }, { "epoch": 0.6, "grad_norm": 28925.150390625, "learning_rate": 0.0001822824974551769, "loss": 1365.12171875, "step": 600 }, { "epoch": 0.6, "eval_accuracy": 0.19299212598425197, "eval_loss": 44.67140579223633, "eval_runtime": 9.3914, "eval_samples_per_second": 13.31, "eval_steps_per_second": 1.704, "step": 600 }, { "epoch": 0.65, "eval_accuracy": 0.19476377952755905, "eval_loss": 44.36285400390625, "eval_runtime": 11.8603, "eval_samples_per_second": 10.539, "eval_steps_per_second": 1.349, "step": 650 }, { "epoch": 0.7, "grad_norm": 6494.93701171875, "learning_rate": 0.0001115146393893927, "loss": 1348.1965625, "step": 700 }, { "epoch": 0.7, "eval_accuracy": 0.19607086614173228, "eval_loss": 44.26563262939453, "eval_runtime": 9.2536, "eval_samples_per_second": 13.508, "eval_steps_per_second": 1.729, "step": 700 }, { "epoch": 0.75, "eval_accuracy": 0.19792125984251968, "eval_loss": 44.026851654052734, "eval_runtime": 13.9865, "eval_samples_per_second": 8.937, "eval_steps_per_second": 1.144, "step": 750 }, { "epoch": 0.8, "grad_norm": 6566.00732421875, "learning_rate": 5.269721958838045e-05, "loss": 1335.25640625, "step": 800 }, { "epoch": 0.8, "eval_accuracy": 0.19969291338582676, "eval_loss": 43.83841323852539, "eval_runtime": 9.3886, "eval_samples_per_second": 13.314, "eval_steps_per_second": 1.704, "step": 800 }, { "epoch": 0.85, "eval_accuracy": 0.2002755905511811, "eval_loss": 43.76130294799805, "eval_runtime": 16.2687, "eval_samples_per_second": 7.683, "eval_steps_per_second": 0.983, "step": 850 }, { "epoch": 0.9, "grad_norm": 5925.8193359375, "learning_rate": 1.3773856514840955e-05, "loss": 1328.743125, "step": 900 }, { "epoch": 0.9, "eval_accuracy": 0.20086614173228345, "eval_loss": 43.69052505493164, "eval_runtime": 9.3216, "eval_samples_per_second": 13.41, "eval_steps_per_second": 1.716, "step": 900 }, { "epoch": 0.95, "eval_accuracy": 0.2008503937007874, "eval_loss": 43.665740966796875, "eval_runtime": 15.4653, "eval_samples_per_second": 8.083, "eval_steps_per_second": 1.035, "step": 950 }, { "epoch": 1.0, "grad_norm": 6814.45703125, "learning_rate": 1.3660336561915898e-09, "loss": 1325.8203125, "step": 1000 }, { "epoch": 1.0, "eval_accuracy": 0.2012047244094488, "eval_loss": 43.653385162353516, "eval_runtime": 9.352, "eval_samples_per_second": 13.366, "eval_steps_per_second": 1.711, "step": 1000 } ], "logging_steps": 100, "max_steps": 1000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }