{ "best_global_step": 3000, "best_metric": 1.5481228828430176, "best_model_checkpoint": "./models/checkpoint-3000", "epoch": 3.0, "eval_steps": 500, "global_step": 9405, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.1595150741745095, "grad_norm": 6.21875, "learning_rate": 4.73471557682084e-05, "loss": 1.6533, "step": 500 }, { "epoch": 0.1595150741745095, "eval_loss": 1.670200228691101, "eval_runtime": 1.8707, "eval_samples_per_second": 53.457, "eval_steps_per_second": 13.364, "step": 500 }, { "epoch": 0.319030148349019, "grad_norm": 6.5, "learning_rate": 4.468899521531101e-05, "loss": 1.5746, "step": 1000 }, { "epoch": 0.319030148349019, "eval_loss": 1.6311461925506592, "eval_runtime": 1.8699, "eval_samples_per_second": 53.48, "eval_steps_per_second": 13.37, "step": 1000 }, { "epoch": 0.4785452225235285, "grad_norm": 6.90625, "learning_rate": 4.203083466241361e-05, "loss": 1.5591, "step": 1500 }, { "epoch": 0.4785452225235285, "eval_loss": 1.6131033897399902, "eval_runtime": 1.8703, "eval_samples_per_second": 53.466, "eval_steps_per_second": 13.367, "step": 1500 }, { "epoch": 0.638060296698038, "grad_norm": 6.0, "learning_rate": 3.9372674109516216e-05, "loss": 1.5301, "step": 2000 }, { "epoch": 0.638060296698038, "eval_loss": 1.582728624343872, "eval_runtime": 1.8741, "eval_samples_per_second": 53.358, "eval_steps_per_second": 13.34, "step": 2000 }, { "epoch": 0.7975753708725475, "grad_norm": 6.09375, "learning_rate": 3.671451355661882e-05, "loss": 1.5222, "step": 2500 }, { "epoch": 0.7975753708725475, "eval_loss": 1.5706853866577148, "eval_runtime": 1.8744, "eval_samples_per_second": 53.351, "eval_steps_per_second": 13.338, "step": 2500 }, { "epoch": 0.957090445047057, "grad_norm": 6.1875, "learning_rate": 3.405635300372142e-05, "loss": 1.4987, "step": 3000 }, { "epoch": 0.957090445047057, "eval_loss": 1.5481228828430176, "eval_runtime": 1.875, "eval_samples_per_second": 53.335, "eval_steps_per_second": 13.334, "step": 3000 }, { "epoch": 1.116446004147392, "grad_norm": 6.21875, "learning_rate": 3.1398192450824035e-05, "loss": 1.3145, "step": 3500 }, { "epoch": 1.116446004147392, "eval_loss": 1.565281629562378, "eval_runtime": 1.8772, "eval_samples_per_second": 53.272, "eval_steps_per_second": 13.318, "step": 3500 }, { "epoch": 1.2759610783219015, "grad_norm": 7.28125, "learning_rate": 2.8740031897926635e-05, "loss": 1.2554, "step": 4000 }, { "epoch": 1.2759610783219015, "eval_loss": 1.5643690824508667, "eval_runtime": 1.8766, "eval_samples_per_second": 53.287, "eval_steps_per_second": 13.322, "step": 4000 }, { "epoch": 1.435476152496411, "grad_norm": 7.0, "learning_rate": 2.608187134502924e-05, "loss": 1.2597, "step": 4500 }, { "epoch": 1.435476152496411, "eval_loss": 1.562727451324463, "eval_runtime": 1.8896, "eval_samples_per_second": 52.92, "eval_steps_per_second": 13.23, "step": 4500 }, { "epoch": 1.5949912266709205, "grad_norm": 6.84375, "learning_rate": 2.3423710792131844e-05, "loss": 1.2496, "step": 5000 }, { "epoch": 1.5949912266709205, "eval_loss": 1.560770869255066, "eval_runtime": 1.8771, "eval_samples_per_second": 53.273, "eval_steps_per_second": 13.318, "step": 5000 }, { "epoch": 1.75450630084543, "grad_norm": 6.90625, "learning_rate": 2.076555023923445e-05, "loss": 1.2422, "step": 5500 }, { "epoch": 1.75450630084543, "eval_loss": 1.5582979917526245, "eval_runtime": 1.8771, "eval_samples_per_second": 53.274, "eval_steps_per_second": 13.319, "step": 5500 }, { "epoch": 1.9140213750199395, "grad_norm": 7.4375, "learning_rate": 1.8107389686337057e-05, "loss": 1.2432, "step": 6000 }, { "epoch": 1.9140213750199395, "eval_loss": 1.5532492399215698, "eval_runtime": 1.8789, "eval_samples_per_second": 53.222, "eval_steps_per_second": 13.306, "step": 6000 }, { "epoch": 2.0733769341202746, "grad_norm": 7.5, "learning_rate": 1.544922913343966e-05, "loss": 1.1977, "step": 6500 }, { "epoch": 2.0733769341202746, "eval_loss": 1.5878651142120361, "eval_runtime": 1.8781, "eval_samples_per_second": 53.244, "eval_steps_per_second": 13.311, "step": 6500 }, { "epoch": 2.232892008294784, "grad_norm": 7.53125, "learning_rate": 1.2791068580542265e-05, "loss": 1.15, "step": 7000 }, { "epoch": 2.232892008294784, "eval_loss": 1.5915130376815796, "eval_runtime": 1.8844, "eval_samples_per_second": 53.068, "eval_steps_per_second": 13.267, "step": 7000 }, { "epoch": 2.392407082469293, "grad_norm": 7.6875, "learning_rate": 1.0132908027644871e-05, "loss": 1.1389, "step": 7500 }, { "epoch": 2.392407082469293, "eval_loss": 1.5931323766708374, "eval_runtime": 1.8778, "eval_samples_per_second": 53.255, "eval_steps_per_second": 13.314, "step": 7500 }, { "epoch": 2.551922156643803, "grad_norm": 7.4375, "learning_rate": 7.474747474747475e-06, "loss": 1.1464, "step": 8000 }, { "epoch": 2.551922156643803, "eval_loss": 1.5903747081756592, "eval_runtime": 1.8791, "eval_samples_per_second": 53.216, "eval_steps_per_second": 13.304, "step": 8000 }, { "epoch": 2.711437230818312, "grad_norm": 7.46875, "learning_rate": 4.816586921850081e-06, "loss": 1.1446, "step": 8500 }, { "epoch": 2.711437230818312, "eval_loss": 1.590154767036438, "eval_runtime": 1.8787, "eval_samples_per_second": 53.23, "eval_steps_per_second": 13.307, "step": 8500 }, { "epoch": 2.870952304992822, "grad_norm": 8.125, "learning_rate": 2.158426368952685e-06, "loss": 1.1444, "step": 9000 }, { "epoch": 2.870952304992822, "eval_loss": 1.5894922018051147, "eval_runtime": 1.8789, "eval_samples_per_second": 53.221, "eval_steps_per_second": 13.305, "step": 9000 } ], "logging_steps": 500, "max_steps": 9405, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.035763059359744e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }