{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9570141159582104, "eval_steps": 500, "global_step": 750, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01276018821277614, "grad_norm": 37637.11328125, "learning_rate": 9e-06, "loss": 0.6589, "step": 10 }, { "epoch": 0.02552037642555228, "grad_norm": 28946.435546875, "learning_rate": 1.9e-05, "loss": 0.6001, "step": 20 }, { "epoch": 0.038280564638328414, "grad_norm": 23968.130859375, "learning_rate": 2.9e-05, "loss": 0.478, "step": 30 }, { "epoch": 0.05104075285110456, "grad_norm": 29737.384765625, "learning_rate": 3.9000000000000006e-05, "loss": 0.3571, "step": 40 }, { "epoch": 0.06380094106388069, "grad_norm": 51756.8203125, "learning_rate": 4.9e-05, "loss": 0.2617, "step": 50 }, { "epoch": 0.07656112927665683, "grad_norm": 47605.94921875, "learning_rate": 5.9e-05, "loss": 0.3241, "step": 60 }, { "epoch": 0.08932131748943296, "grad_norm": 12073.0615234375, "learning_rate": 6.9e-05, "loss": 0.1533, "step": 70 }, { "epoch": 0.10208150570220911, "grad_norm": 5818.654296875, "learning_rate": 7.900000000000001e-05, "loss": 0.1012, "step": 80 }, { "epoch": 0.11484169391498525, "grad_norm": 4877.6806640625, "learning_rate": 8.900000000000001e-05, "loss": 0.0995, "step": 90 }, { "epoch": 0.12760188212776138, "grad_norm": 4604.2353515625, "learning_rate": 9.900000000000001e-05, "loss": 0.1039, "step": 100 }, { "epoch": 0.14036207034053752, "grad_norm": 4012.2919921875, "learning_rate": 9.995728791936504e-05, "loss": 0.0861, "step": 110 }, { "epoch": 0.15312225855331366, "grad_norm": 3052.91357421875, "learning_rate": 9.980973490458728e-05, "loss": 0.0783, "step": 120 }, { "epoch": 0.1658824467660898, "grad_norm": 3616.212158203125, "learning_rate": 9.955712478597579e-05, "loss": 0.092, "step": 130 }, { "epoch": 0.17864263497886593, "grad_norm": 4166.802734375, "learning_rate": 9.9199990360734e-05, "loss": 0.0955, "step": 140 }, { "epoch": 0.19140282319164206, "grad_norm": 4267.69677734375, "learning_rate": 9.873908488539836e-05, "loss": 0.1084, "step": 150 }, { "epoch": 0.20416301140441823, "grad_norm": 3430.815185546875, "learning_rate": 9.817538048709367e-05, "loss": 0.0884, "step": 160 }, { "epoch": 0.21692319961719436, "grad_norm": 3015.459716796875, "learning_rate": 9.751006611315356e-05, "loss": 0.0793, "step": 170 }, { "epoch": 0.2296833878299705, "grad_norm": 3575.607666015625, "learning_rate": 9.674454502343076e-05, "loss": 0.0902, "step": 180 }, { "epoch": 0.24244357604274663, "grad_norm": 3760.454833984375, "learning_rate": 9.588043183058606e-05, "loss": 0.0936, "step": 190 }, { "epoch": 0.25520376425552277, "grad_norm": 3904.21240234375, "learning_rate": 9.491954909459895e-05, "loss": 0.0995, "step": 200 }, { "epoch": 0.2679639524682989, "grad_norm": 3201.078857421875, "learning_rate": 9.386392347868215e-05, "loss": 0.0858, "step": 210 }, { "epoch": 0.28072414068107504, "grad_norm": 3236.521728515625, "learning_rate": 9.271578147470825e-05, "loss": 0.079, "step": 220 }, { "epoch": 0.2934843288938512, "grad_norm": 3096.511962890625, "learning_rate": 9.147754470716408e-05, "loss": 0.0878, "step": 230 }, { "epoch": 0.3062445171066273, "grad_norm": 3840.806396484375, "learning_rate": 9.01518248255376e-05, "loss": 0.0945, "step": 240 }, { "epoch": 0.31900470531940345, "grad_norm": 4038.00732421875, "learning_rate": 8.874141799591007e-05, "loss": 0.1045, "step": 250 }, { "epoch": 0.3317648935321796, "grad_norm": 3151.041015625, "learning_rate": 8.724929900337186e-05, "loss": 0.0817, "step": 260 }, { "epoch": 0.3445250817449557, "grad_norm": 2820.68505859375, "learning_rate": 8.567861497770053e-05, "loss": 0.0802, "step": 270 }, { "epoch": 0.35728526995773185, "grad_norm": 2988.68359375, "learning_rate": 8.403267875553519e-05, "loss": 0.0904, "step": 280 }, { "epoch": 0.370045458170508, "grad_norm": 3647.082275390625, "learning_rate": 8.231496189304704e-05, "loss": 0.0939, "step": 290 }, { "epoch": 0.3828056463832841, "grad_norm": 3880.467529296875, "learning_rate": 8.052908734384399e-05, "loss": 0.1022, "step": 300 }, { "epoch": 0.3955658345960603, "grad_norm": 2817.3056640625, "learning_rate": 7.86788218175523e-05, "loss": 0.0798, "step": 310 }, { "epoch": 0.40832602280883645, "grad_norm": 2925.299560546875, "learning_rate": 7.676806783519304e-05, "loss": 0.0804, "step": 320 }, { "epoch": 0.4210862110216126, "grad_norm": 3108.75146484375, "learning_rate": 7.480085549810897e-05, "loss": 0.0905, "step": 330 }, { "epoch": 0.4338463992343887, "grad_norm": 3450.92529296875, "learning_rate": 7.278133398780366e-05, "loss": 0.0919, "step": 340 }, { "epoch": 0.44660658744716486, "grad_norm": 4121.8212890625, "learning_rate": 7.071376281461994e-05, "loss": 0.1026, "step": 350 }, { "epoch": 0.459366775659941, "grad_norm": 2675.00390625, "learning_rate": 6.860250283371681e-05, "loss": 0.0776, "step": 360 }, { "epoch": 0.47212696387271713, "grad_norm": 3107.235595703125, "learning_rate": 6.645200704729266e-05, "loss": 0.0811, "step": 370 }, { "epoch": 0.48488715208549327, "grad_norm": 3101.115478515625, "learning_rate": 6.426681121245527e-05, "loss": 0.0849, "step": 380 }, { "epoch": 0.4976473402982694, "grad_norm": 3454.42578125, "learning_rate": 6.205152427454747e-05, "loss": 0.0911, "step": 390 }, { "epoch": 0.5104075285110455, "grad_norm": 3896.09619140625, "learning_rate": 5.98108186461068e-05, "loss": 0.103, "step": 400 }, { "epoch": 0.5231677167238217, "grad_norm": 2808.469970703125, "learning_rate": 5.7549420351961844e-05, "loss": 0.0856, "step": 410 }, { "epoch": 0.5359279049365978, "grad_norm": 2859.574951171875, "learning_rate": 5.527209906125169e-05, "loss": 0.083, "step": 420 }, { "epoch": 0.548688093149374, "grad_norm": 3273.62646484375, "learning_rate": 5.29836580273917e-05, "loss": 0.0856, "step": 430 }, { "epoch": 0.5614482813621501, "grad_norm": 3307.667236328125, "learning_rate": 5.068892395720483e-05, "loss": 0.0892, "step": 440 }, { "epoch": 0.5742084695749262, "grad_norm": 3913.605224609375, "learning_rate": 4.839273683058542e-05, "loss": 0.0994, "step": 450 }, { "epoch": 0.5869686577877024, "grad_norm": 2523.923583984375, "learning_rate": 4.6099939692168107e-05, "loss": 0.0773, "step": 460 }, { "epoch": 0.5997288460004785, "grad_norm": 2690.344482421875, "learning_rate": 4.381536843653262e-05, "loss": 0.0787, "step": 470 }, { "epoch": 0.6124890342132546, "grad_norm": 3163.53369140625, "learning_rate": 4.1543841608489075e-05, "loss": 0.0869, "step": 480 }, { "epoch": 0.6252492224260308, "grad_norm": 3396.5908203125, "learning_rate": 3.9290150239957057e-05, "loss": 0.0928, "step": 490 }, { "epoch": 0.6380094106388069, "grad_norm": 3951.349365234375, "learning_rate": 3.705904774487396e-05, "loss": 0.0986, "step": 500 }, { "epoch": 0.650769598851583, "grad_norm": 2700.265625, "learning_rate": 3.4855239893445946e-05, "loss": 0.0822, "step": 510 }, { "epoch": 0.6635297870643592, "grad_norm": 2672.4716796875, "learning_rate": 3.268337488688748e-05, "loss": 0.0768, "step": 520 }, { "epoch": 0.6762899752771353, "grad_norm": 3514.844970703125, "learning_rate": 3.0548033553583705e-05, "loss": 0.0865, "step": 530 }, { "epoch": 0.6890501634899114, "grad_norm": 3326.14501953125, "learning_rate": 2.8453719687353285e-05, "loss": 0.0916, "step": 540 }, { "epoch": 0.7018103517026876, "grad_norm": 4190.75732421875, "learning_rate": 2.6404850548190235e-05, "loss": 0.1027, "step": 550 }, { "epoch": 0.7145705399154637, "grad_norm": 2811.360595703125, "learning_rate": 2.4405747545519963e-05, "loss": 0.0796, "step": 560 }, { "epoch": 0.7273307281282398, "grad_norm": 3221.398193359375, "learning_rate": 2.246062712362043e-05, "loss": 0.0796, "step": 570 }, { "epoch": 0.740090916341016, "grad_norm": 3041.626220703125, "learning_rate": 2.0573591868432406e-05, "loss": 0.0858, "step": 580 }, { "epoch": 0.7528511045537921, "grad_norm": 3378.84375, "learning_rate": 1.874862185451608e-05, "loss": 0.0862, "step": 590 }, { "epoch": 0.7656112927665683, "grad_norm": 3626.47265625, "learning_rate": 1.6989566250404702e-05, "loss": 0.097, "step": 600 }, { "epoch": 0.7783714809793445, "grad_norm": 2655.00146484375, "learning_rate": 1.5300135200061168e-05, "loss": 0.0786, "step": 610 }, { "epoch": 0.7911316691921206, "grad_norm": 2849.29931640625, "learning_rate": 1.368389199756075e-05, "loss": 0.081, "step": 620 }, { "epoch": 0.8038918574048968, "grad_norm": 3150.29931640625, "learning_rate": 1.2144245571504898e-05, "loss": 0.0824, "step": 630 }, { "epoch": 0.8166520456176729, "grad_norm": 3491.138427734375, "learning_rate": 1.0684443295017721e-05, "loss": 0.0897, "step": 640 }, { "epoch": 0.829412233830449, "grad_norm": 4051.920166015625, "learning_rate": 9.307564136490254e-06, "loss": 0.1012, "step": 650 }, { "epoch": 0.8421724220432252, "grad_norm": 2838.83544921875, "learning_rate": 8.016512165518569e-06, "loss": 0.0764, "step": 660 }, { "epoch": 0.8549326102560013, "grad_norm": 3116.049072265625, "learning_rate": 6.814010427732786e-06, "loss": 0.0795, "step": 670 }, { "epoch": 0.8676927984687774, "grad_norm": 3072.74365234375, "learning_rate": 5.702595201436101e-06, "loss": 0.083, "step": 680 }, { "epoch": 0.8804529866815536, "grad_norm": 3425.1845703125, "learning_rate": 4.684610648167503e-06, "loss": 0.0856, "step": 690 }, { "epoch": 0.8932131748943297, "grad_norm": 4003.127197265625, "learning_rate": 3.762203868471087e-06, "loss": 0.1022, "step": 700 }, { "epoch": 0.9059733631071059, "grad_norm": 2913.515380859375, "learning_rate": 2.9373203733000232e-06, "loss": 0.0802, "step": 710 }, { "epoch": 0.918733551319882, "grad_norm": 2771.475341796875, "learning_rate": 2.211699980606946e-06, "loss": 0.0775, "step": 720 }, { "epoch": 0.9314937395326581, "grad_norm": 2954.710205078125, "learning_rate": 1.5868731457754139e-06, "loss": 0.0845, "step": 730 }, { "epoch": 0.9442539277454343, "grad_norm": 3425.241455078125, "learning_rate": 1.064157733632276e-06, "loss": 0.0877, "step": 740 }, { "epoch": 0.9570141159582104, "grad_norm": 3987.344970703125, "learning_rate": 6.44656238849195e-07, "loss": 0.1024, "step": 750 } ], "logging_steps": 10, "max_steps": 784, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.009329291264e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }