{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 565, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08888888888888889, "grad_norm": 5.764378547668457, "learning_rate": 1.8e-05, "loss": 3.9245, "step": 10 }, { "epoch": 0.17777777777777778, "grad_norm": 4.340976715087891, "learning_rate": 3.8e-05, "loss": 3.4043, "step": 20 }, { "epoch": 0.26666666666666666, "grad_norm": 4.136200904846191, "learning_rate": 5.8e-05, "loss": 2.2864, "step": 30 }, { "epoch": 0.35555555555555557, "grad_norm": 3.0005297660827637, "learning_rate": 7.800000000000001e-05, "loss": 1.1498, "step": 40 }, { "epoch": 0.4444444444444444, "grad_norm": 1.5809401273727417, "learning_rate": 9.8e-05, "loss": 0.8409, "step": 50 }, { "epoch": 0.5333333333333333, "grad_norm": 2.0459725856781006, "learning_rate": 9.99246642311259e-05, "loss": 0.8145, "step": 60 }, { "epoch": 0.6222222222222222, "grad_norm": 0.44736912846565247, "learning_rate": 9.966453573423791e-05, "loss": 0.7908, "step": 70 }, { "epoch": 0.7111111111111111, "grad_norm": 1.8621402978897095, "learning_rate": 9.921965190244129e-05, "loss": 0.7472, "step": 80 }, { "epoch": 0.8, "grad_norm": 0.8157559037208557, "learning_rate": 9.85916677328104e-05, "loss": 0.6703, "step": 90 }, { "epoch": 0.8888888888888888, "grad_norm": 1.6298869848251343, "learning_rate": 9.77829193677024e-05, "loss": 0.546, "step": 100 }, { "epoch": 0.9777777777777777, "grad_norm": 1.996382713317871, "learning_rate": 9.679641540415427e-05, "loss": 0.341, "step": 110 }, { "epoch": 1.0, "eval_loss": 0.32163509726524353, "eval_runtime": 42.6613, "eval_samples_per_second": 2.344, "eval_steps_per_second": 0.305, "step": 113 }, { "epoch": 1.0622222222222222, "grad_norm": 0.3126855194568634, "learning_rate": 9.563582570170417e-05, "loss": 0.3204, "step": 120 }, { "epoch": 1.1511111111111112, "grad_norm": 0.3520595133304596, "learning_rate": 9.430546773027302e-05, "loss": 0.3214, "step": 130 }, { "epoch": 1.24, "grad_norm": 0.3733944594860077, "learning_rate": 9.281029050889274e-05, "loss": 0.3201, "step": 140 }, { "epoch": 1.3288888888888888, "grad_norm": 0.2799483835697174, "learning_rate": 9.115585619503039e-05, "loss": 0.321, "step": 150 }, { "epoch": 1.4177777777777778, "grad_norm": 0.21395893394947052, "learning_rate": 8.934831939299714e-05, "loss": 0.3214, "step": 160 }, { "epoch": 1.5066666666666668, "grad_norm": 0.24816612899303436, "learning_rate": 8.739440425841599e-05, "loss": 0.3192, "step": 170 }, { "epoch": 1.5955555555555554, "grad_norm": 0.11175958812236786, "learning_rate": 8.530137948392112e-05, "loss": 0.318, "step": 180 }, { "epoch": 1.6844444444444444, "grad_norm": 0.16557013988494873, "learning_rate": 8.307703125914397e-05, "loss": 0.3198, "step": 190 }, { "epoch": 1.7733333333333334, "grad_norm": 0.32549384236335754, "learning_rate": 8.072963430557636e-05, "loss": 0.3225, "step": 200 }, { "epoch": 1.8622222222222222, "grad_norm": 0.21063511073589325, "learning_rate": 7.826792109406308e-05, "loss": 0.3181, "step": 210 }, { "epoch": 1.951111111111111, "grad_norm": 0.22092826664447784, "learning_rate": 7.570104935943685e-05, "loss": 0.3187, "step": 220 }, { "epoch": 2.0, "eval_loss": 0.32037025690078735, "eval_runtime": 40.3313, "eval_samples_per_second": 2.479, "eval_steps_per_second": 0.322, "step": 226 }, { "epoch": 2.0355555555555553, "grad_norm": 0.22031903266906738, "learning_rate": 7.303856803314313e-05, "loss": 0.3273, "step": 230 }, { "epoch": 2.1244444444444444, "grad_norm": 0.16489087045192719, "learning_rate": 7.029038172058809e-05, "loss": 0.3184, "step": 240 }, { "epoch": 2.2133333333333334, "grad_norm": 0.1534615159034729, "learning_rate": 6.746671385535586e-05, "loss": 0.3185, "step": 250 }, { "epoch": 2.3022222222222224, "grad_norm": 0.13345931470394135, "learning_rate": 6.457806866736424e-05, "loss": 0.3209, "step": 260 }, { "epoch": 2.391111111111111, "grad_norm": 0.18040268123149872, "learning_rate": 6.163519210643939e-05, "loss": 0.3199, "step": 270 }, { "epoch": 2.48, "grad_norm": 0.2649783790111542, "learning_rate": 5.864903186667668e-05, "loss": 0.3207, "step": 280 }, { "epoch": 2.568888888888889, "grad_norm": 0.18706634640693665, "learning_rate": 5.5630696660299694e-05, "loss": 0.3195, "step": 290 }, { "epoch": 2.6577777777777776, "grad_norm": 0.24964497983455658, "learning_rate": 5.259141489252104e-05, "loss": 0.3216, "step": 300 }, { "epoch": 2.7466666666666666, "grad_norm": 0.13545331358909607, "learning_rate": 4.9542492891137526e-05, "loss": 0.3178, "step": 310 }, { "epoch": 2.8355555555555556, "grad_norm": 0.2153831124305725, "learning_rate": 4.6495272846248146e-05, "loss": 0.3182, "step": 320 }, { "epoch": 2.924444444444444, "grad_norm": 0.15629053115844727, "learning_rate": 4.346109061656195e-05, "loss": 0.3185, "step": 330 }, { "epoch": 3.0, "eval_loss": 0.32035037875175476, "eval_runtime": 40.3621, "eval_samples_per_second": 2.478, "eval_steps_per_second": 0.322, "step": 339 }, { "epoch": 3.008888888888889, "grad_norm": 0.13374465703964233, "learning_rate": 4.04512335592591e-05, "loss": 0.3199, "step": 340 }, { "epoch": 3.097777777777778, "grad_norm": 0.19588690996170044, "learning_rate": 3.747689854028081e-05, "loss": 0.319, "step": 350 }, { "epoch": 3.1866666666666665, "grad_norm": 0.17849618196487427, "learning_rate": 3.4549150281252636e-05, "loss": 0.3198, "step": 360 }, { "epoch": 3.2755555555555556, "grad_norm": 0.11948955059051514, "learning_rate": 3.16788801979933e-05, "loss": 0.3182, "step": 370 }, { "epoch": 3.3644444444444446, "grad_norm": 0.13129116594791412, "learning_rate": 2.8876765883732447e-05, "loss": 0.3176, "step": 380 }, { "epoch": 3.453333333333333, "grad_norm": 0.20687370002269745, "learning_rate": 2.6153231387762637e-05, "loss": 0.3197, "step": 390 }, { "epoch": 3.542222222222222, "grad_norm": 0.22439858317375183, "learning_rate": 2.3518408437291157e-05, "loss": 0.321, "step": 400 }, { "epoch": 3.631111111111111, "grad_norm": 0.16592849791049957, "learning_rate": 2.0982098746749523e-05, "loss": 0.3196, "step": 410 }, { "epoch": 3.7199999999999998, "grad_norm": 0.09099625796079636, "learning_rate": 1.8553737554771882e-05, "loss": 0.318, "step": 420 }, { "epoch": 3.8088888888888888, "grad_norm": 0.13774339854717255, "learning_rate": 1.62423585244877e-05, "loss": 0.319, "step": 430 }, { "epoch": 3.897777777777778, "grad_norm": 0.13488805294036865, "learning_rate": 1.405656013770147e-05, "loss": 0.3181, "step": 440 }, { "epoch": 3.986666666666667, "grad_norm": 0.15799656510353088, "learning_rate": 1.2004473707975761e-05, "loss": 0.3201, "step": 450 }, { "epoch": 4.0, "eval_loss": 0.31841641664505005, "eval_runtime": 40.3686, "eval_samples_per_second": 2.477, "eval_steps_per_second": 0.322, "step": 452 }, { "epoch": 4.071111111111111, "grad_norm": 0.10995037853717804, "learning_rate": 1.0093733131610622e-05, "loss": 0.3184, "step": 460 }, { "epoch": 4.16, "grad_norm": 0.15549620985984802, "learning_rate": 8.331446489047956e-06, "loss": 0.3173, "step": 470 }, { "epoch": 4.248888888888889, "grad_norm": 0.17202192544937134, "learning_rate": 6.724169602345487e-06, "loss": 0.3203, "step": 480 }, { "epoch": 4.337777777777778, "grad_norm": 0.11324512213468552, "learning_rate": 5.277881647088024e-06, "loss": 0.316, "step": 490 }, { "epoch": 4.426666666666667, "grad_norm": 0.11072061955928802, "learning_rate": 3.9979629094616115e-06, "loss": 0.3186, "step": 500 }, { "epoch": 4.515555555555555, "grad_norm": 0.13301220536231995, "learning_rate": 2.88917477123557e-06, "loss": 0.3187, "step": 510 }, { "epoch": 4.604444444444445, "grad_norm": 0.09929703176021576, "learning_rate": 1.9556419971095363e-06, "loss": 0.3195, "step": 520 }, { "epoch": 4.693333333333333, "grad_norm": 0.1245638057589531, "learning_rate": 1.2008373903178827e-06, "loss": 0.3185, "step": 530 }, { "epoch": 4.782222222222222, "grad_norm": 0.10131300240755081, "learning_rate": 6.275688735736141e-07, "loss": 0.3186, "step": 540 }, { "epoch": 4.871111111111111, "grad_norm": 0.25302281975746155, "learning_rate": 2.3796904341141235e-07, "loss": 0.3203, "step": 550 }, { "epoch": 4.96, "grad_norm": 0.12090457230806351, "learning_rate": 3.348723678847643e-08, "loss": 0.3183, "step": 560 }, { "epoch": 5.0, "eval_loss": 0.3198339641094208, "eval_runtime": 40.339, "eval_samples_per_second": 2.479, "eval_steps_per_second": 0.322, "step": 565 } ], "logging_steps": 10, "max_steps": 565, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 8.3759216984064e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }