{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.8324661810613944, "eval_steps": 25, "global_step": 400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002081165452653486, "grad_norm": NaN, "learning_rate": 0.0, "loss": 1.1218, "step": 1 }, { "epoch": 0.05202913631633715, "grad_norm": 112.7115707397461, "learning_rate": 1.4201183431952663e-07, "loss": 1.0823, "step": 25 }, { "epoch": 0.05202913631633715, "eval_loss": 0.7267751097679138, "eval_runtime": 17.4992, "eval_samples_per_second": 51.374, "eval_steps_per_second": 12.858, "step": 25 }, { "epoch": 0.1040582726326743, "grad_norm": 58.33771514892578, "learning_rate": 2.8994082840236686e-07, "loss": 0.8661, "step": 50 }, { "epoch": 0.1040582726326743, "eval_loss": 0.6249979734420776, "eval_runtime": 17.7916, "eval_samples_per_second": 50.529, "eval_steps_per_second": 12.646, "step": 50 }, { "epoch": 0.15608740894901144, "grad_norm": 141.5440673828125, "learning_rate": 4.378698224852071e-07, "loss": 0.7323, "step": 75 }, { "epoch": 0.15608740894901144, "eval_loss": 0.5851046442985535, "eval_runtime": 17.459, "eval_samples_per_second": 51.492, "eval_steps_per_second": 12.887, "step": 75 }, { "epoch": 0.2081165452653486, "grad_norm": 123.83263397216797, "learning_rate": 5.857988165680473e-07, "loss": 0.5271, "step": 100 }, { "epoch": 0.2081165452653486, "eval_loss": 0.605644702911377, "eval_runtime": 17.4819, "eval_samples_per_second": 51.425, "eval_steps_per_second": 12.87, "step": 100 }, { "epoch": 0.2601456815816857, "grad_norm": 48.97358703613281, "learning_rate": 7.337278106508875e-07, "loss": 0.5311, "step": 125 }, { "epoch": 0.2601456815816857, "eval_loss": 0.5933497548103333, "eval_runtime": 17.4087, "eval_samples_per_second": 51.641, "eval_steps_per_second": 12.925, "step": 125 }, { "epoch": 0.31217481789802287, "grad_norm": 113.67745208740234, "learning_rate": 8.816568047337278e-07, "loss": 0.5233, "step": 150 }, { "epoch": 0.31217481789802287, "eval_loss": 0.6305265426635742, "eval_runtime": 17.4649, "eval_samples_per_second": 51.475, "eval_steps_per_second": 12.883, "step": 150 }, { "epoch": 0.36420395421436, "grad_norm": 158.48524475097656, "learning_rate": 9.999019112527836e-07, "loss": 0.5819, "step": 175 }, { "epoch": 0.36420395421436, "eval_loss": 0.6344813108444214, "eval_runtime": 17.558, "eval_samples_per_second": 51.202, "eval_steps_per_second": 12.815, "step": 175 }, { "epoch": 0.4162330905306972, "grad_norm": 65.56009674072266, "learning_rate": 9.9647284439831e-07, "loss": 0.7013, "step": 200 }, { "epoch": 0.4162330905306972, "eval_loss": 0.5766075253486633, "eval_runtime": 17.4518, "eval_samples_per_second": 51.513, "eval_steps_per_second": 12.893, "step": 200 }, { "epoch": 0.46826222684703434, "grad_norm": 59.14521789550781, "learning_rate": 9.881777579730005e-07, "loss": 0.6697, "step": 225 }, { "epoch": 0.46826222684703434, "eval_loss": 0.5534063577651978, "eval_runtime": 17.4744, "eval_samples_per_second": 51.447, "eval_steps_per_second": 12.876, "step": 225 }, { "epoch": 0.5202913631633714, "grad_norm": 29.80727195739746, "learning_rate": 9.750979536096495e-07, "loss": 0.5794, "step": 250 }, { "epoch": 0.5202913631633714, "eval_loss": 0.5618265867233276, "eval_runtime": 17.4679, "eval_samples_per_second": 51.466, "eval_steps_per_second": 12.881, "step": 250 }, { "epoch": 0.5723204994797086, "grad_norm": 138.9149627685547, "learning_rate": 9.573616288214395e-07, "loss": 0.5292, "step": 275 }, { "epoch": 0.5723204994797086, "eval_loss": 0.621860682964325, "eval_runtime": 17.4394, "eval_samples_per_second": 51.55, "eval_steps_per_second": 12.902, "step": 275 }, { "epoch": 0.6243496357960457, "grad_norm": 67.80418395996094, "learning_rate": 9.351426205150776e-07, "loss": 0.704, "step": 300 }, { "epoch": 0.6243496357960457, "eval_loss": 0.5616322755813599, "eval_runtime": 17.4043, "eval_samples_per_second": 51.654, "eval_steps_per_second": 12.928, "step": 300 }, { "epoch": 0.676378772112383, "grad_norm": 126.93467712402344, "learning_rate": 9.086587011840308e-07, "loss": 0.5832, "step": 325 }, { "epoch": 0.676378772112383, "eval_loss": 0.5842172503471375, "eval_runtime": 17.3785, "eval_samples_per_second": 51.731, "eval_steps_per_second": 12.947, "step": 325 }, { "epoch": 0.72840790842872, "grad_norm": 173.32260131835938, "learning_rate": 8.781694444811812e-07, "loss": 0.5968, "step": 350 }, { "epoch": 0.72840790842872, "eval_loss": 0.5498592257499695, "eval_runtime": 17.3993, "eval_samples_per_second": 51.669, "eval_steps_per_second": 12.932, "step": 350 }, { "epoch": 0.7804370447450573, "grad_norm": 76.53514862060547, "learning_rate": 8.439736810908056e-07, "loss": 0.4945, "step": 375 }, { "epoch": 0.7804370447450573, "eval_loss": 0.5408959984779358, "eval_runtime": 17.4427, "eval_samples_per_second": 51.54, "eval_steps_per_second": 12.899, "step": 375 }, { "epoch": 0.8324661810613944, "grad_norm": 154.95327758789062, "learning_rate": 8.064065698353344e-07, "loss": 0.4931, "step": 400 }, { "epoch": 0.8324661810613944, "eval_loss": 0.5708575248718262, "eval_runtime": 17.4803, "eval_samples_per_second": 51.429, "eval_steps_per_second": 12.872, "step": 400 } ], "logging_steps": 25, "max_steps": 962, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 400, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4329971279462400.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }