{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.03830398467840613, "eval_steps": 500, "global_step": 900, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0004255998297600681, "grad_norm": 5634.16845703125, "learning_rate": 2.4e-07, "loss": 14.1264, "step": 10 }, { "epoch": 0.0008511996595201362, "grad_norm": 2312.5771484375, "learning_rate": 1.04e-06, "loss": 13.2905, "step": 20 }, { "epoch": 0.0012767994892802044, "grad_norm": 2110.1591796875, "learning_rate": 1.84e-06, "loss": 12.6236, "step": 30 }, { "epoch": 0.0017023993190402723, "grad_norm": 1493.8431396484375, "learning_rate": 2.64e-06, "loss": 12.3954, "step": 40 }, { "epoch": 0.0021279991488003403, "grad_norm": 1430.7598876953125, "learning_rate": 3.44e-06, "loss": 12.265, "step": 50 }, { "epoch": 0.0025535989785604087, "grad_norm": 2192.621826171875, "learning_rate": 4.24e-06, "loss": 12.018, "step": 60 }, { "epoch": 0.0029791988083204767, "grad_norm": 1678.5159912109375, "learning_rate": 5.04e-06, "loss": 11.8932, "step": 70 }, { "epoch": 0.0034047986380805447, "grad_norm": 1261.883056640625, "learning_rate": 5.84e-06, "loss": 11.8077, "step": 80 }, { "epoch": 0.0038303984678406127, "grad_norm": 1710.3070068359375, "learning_rate": 6.640000000000001e-06, "loss": 11.6841, "step": 90 }, { "epoch": 0.004255998297600681, "grad_norm": 2306.063232421875, "learning_rate": 7.44e-06, "loss": 11.5426, "step": 100 }, { "epoch": 0.004681598127360749, "grad_norm": 2158.360107421875, "learning_rate": 8.24e-06, "loss": 11.4863, "step": 110 }, { "epoch": 0.0051071979571208174, "grad_norm": 2058.938232421875, "learning_rate": 9.04e-06, "loss": 11.5044, "step": 120 }, { "epoch": 0.005532797786880885, "grad_norm": 2320.1376953125, "learning_rate": 9.84e-06, "loss": 11.4696, "step": 130 }, { "epoch": 0.005958397616640953, "grad_norm": 3147.455078125, "learning_rate": 1.064e-05, "loss": 11.2994, "step": 140 }, { "epoch": 0.006383997446401022, "grad_norm": 1930.887451171875, "learning_rate": 1.144e-05, "loss": 11.2686, "step": 150 }, { "epoch": 0.006809597276161089, "grad_norm": 3005.495361328125, "learning_rate": 1.224e-05, "loss": 11.2556, "step": 160 }, { "epoch": 0.007235197105921158, "grad_norm": 1587.324462890625, "learning_rate": 1.3039999999999999e-05, "loss": 11.1593, "step": 170 }, { "epoch": 0.007660796935681225, "grad_norm": 1496.0810546875, "learning_rate": 1.384e-05, "loss": 11.0329, "step": 180 }, { "epoch": 0.008086396765441295, "grad_norm": 2397.255615234375, "learning_rate": 1.4560000000000001e-05, "loss": 11.0514, "step": 190 }, { "epoch": 0.008511996595201361, "grad_norm": 3627.1494140625, "learning_rate": 1.536e-05, "loss": 10.9684, "step": 200 }, { "epoch": 0.00893759642496143, "grad_norm": 1078.9390869140625, "learning_rate": 1.616e-05, "loss": 11.0077, "step": 210 }, { "epoch": 0.009363196254721498, "grad_norm": 1400.2003173828125, "learning_rate": 1.696e-05, "loss": 10.7138, "step": 220 }, { "epoch": 0.009788796084481566, "grad_norm": 880.6416015625, "learning_rate": 1.7760000000000003e-05, "loss": 10.4564, "step": 230 }, { "epoch": 0.010214395914241635, "grad_norm": 888.9507446289062, "learning_rate": 1.856e-05, "loss": 10.4699, "step": 240 }, { "epoch": 0.010639995744001702, "grad_norm": 604.7562255859375, "learning_rate": 1.936e-05, "loss": 10.5335, "step": 250 }, { "epoch": 0.01106559557376177, "grad_norm": 885.2161865234375, "learning_rate": 2.016e-05, "loss": 10.3258, "step": 260 }, { "epoch": 0.011491195403521838, "grad_norm": 689.9547729492188, "learning_rate": 2.0960000000000003e-05, "loss": 10.3034, "step": 270 }, { "epoch": 0.011916795233281907, "grad_norm": 1086.3548583984375, "learning_rate": 2.176e-05, "loss": 10.121, "step": 280 }, { "epoch": 0.012342395063041975, "grad_norm": 728.9247436523438, "learning_rate": 2.256e-05, "loss": 9.9983, "step": 290 }, { "epoch": 0.012767994892802044, "grad_norm": 931.4705200195312, "learning_rate": 2.336e-05, "loss": 10.1502, "step": 300 }, { "epoch": 0.01319359472256211, "grad_norm": 836.438720703125, "learning_rate": 2.4160000000000002e-05, "loss": 10.0117, "step": 310 }, { "epoch": 0.013619194552322179, "grad_norm": 481.8641662597656, "learning_rate": 2.496e-05, "loss": 10.0033, "step": 320 }, { "epoch": 0.014044794382082247, "grad_norm": 368.5486755371094, "learning_rate": 2.576e-05, "loss": 9.7842, "step": 330 }, { "epoch": 0.014470394211842316, "grad_norm": 408.945068359375, "learning_rate": 2.6560000000000003e-05, "loss": 10.0045, "step": 340 }, { "epoch": 0.014895994041602384, "grad_norm": 882.4168701171875, "learning_rate": 2.7360000000000002e-05, "loss": 9.8133, "step": 350 }, { "epoch": 0.01532159387136245, "grad_norm": 688.0091552734375, "learning_rate": 2.816e-05, "loss": 9.74, "step": 360 }, { "epoch": 0.01574719370112252, "grad_norm": 480.2123107910156, "learning_rate": 2.8960000000000004e-05, "loss": 9.7187, "step": 370 }, { "epoch": 0.01617279353088259, "grad_norm": 266.4781799316406, "learning_rate": 2.976e-05, "loss": 9.4574, "step": 380 }, { "epoch": 0.016598393360642654, "grad_norm": 426.8431091308594, "learning_rate": 3.056e-05, "loss": 9.4476, "step": 390 }, { "epoch": 0.017023993190402723, "grad_norm": 507.83984375, "learning_rate": 3.136e-05, "loss": 9.6252, "step": 400 }, { "epoch": 0.01744959302016279, "grad_norm": 345.3815612792969, "learning_rate": 3.2160000000000004e-05, "loss": 9.4701, "step": 410 }, { "epoch": 0.01787519284992286, "grad_norm": 661.6119384765625, "learning_rate": 3.296e-05, "loss": 9.2308, "step": 420 }, { "epoch": 0.018300792679682928, "grad_norm": 249.719970703125, "learning_rate": 3.376e-05, "loss": 9.2749, "step": 430 }, { "epoch": 0.018726392509442996, "grad_norm": 396.6395263671875, "learning_rate": 3.456e-05, "loss": 9.3583, "step": 440 }, { "epoch": 0.019151992339203065, "grad_norm": 317.9398193359375, "learning_rate": 3.536000000000001e-05, "loss": 9.2281, "step": 450 }, { "epoch": 0.019577592168963133, "grad_norm": 237.1824493408203, "learning_rate": 3.616e-05, "loss": 9.0913, "step": 460 }, { "epoch": 0.0200031919987232, "grad_norm": 427.8457336425781, "learning_rate": 3.696e-05, "loss": 9.0147, "step": 470 }, { "epoch": 0.02042879182848327, "grad_norm": 380.43719482421875, "learning_rate": 3.776e-05, "loss": 8.9519, "step": 480 }, { "epoch": 0.020854391658243338, "grad_norm": 222.20193481445312, "learning_rate": 3.8560000000000004e-05, "loss": 9.0848, "step": 490 }, { "epoch": 0.021279991488003403, "grad_norm": 343.4478454589844, "learning_rate": 3.936e-05, "loss": 8.8757, "step": 500 }, { "epoch": 0.02170559131776347, "grad_norm": 261.2217712402344, "learning_rate": 4.016e-05, "loss": 8.9742, "step": 510 }, { "epoch": 0.02213119114752354, "grad_norm": 263.2187805175781, "learning_rate": 4.096e-05, "loss": 8.6574, "step": 520 }, { "epoch": 0.02255679097728361, "grad_norm": 323.5589904785156, "learning_rate": 4.176000000000001e-05, "loss": 8.8006, "step": 530 }, { "epoch": 0.022982390807043677, "grad_norm": 275.9966735839844, "learning_rate": 4.256e-05, "loss": 8.3938, "step": 540 }, { "epoch": 0.023407990636803745, "grad_norm": 217.8997344970703, "learning_rate": 4.336e-05, "loss": 8.7494, "step": 550 }, { "epoch": 0.023833590466563814, "grad_norm": 238.54171752929688, "learning_rate": 4.4160000000000004e-05, "loss": 8.4978, "step": 560 }, { "epoch": 0.024259190296323882, "grad_norm": 248.50515747070312, "learning_rate": 4.496e-05, "loss": 8.4339, "step": 570 }, { "epoch": 0.02468479012608395, "grad_norm": 300.531982421875, "learning_rate": 4.576e-05, "loss": 8.5025, "step": 580 }, { "epoch": 0.02511038995584402, "grad_norm": 262.1846923828125, "learning_rate": 4.656e-05, "loss": 8.3452, "step": 590 }, { "epoch": 0.025535989785604087, "grad_norm": 236.63243103027344, "learning_rate": 4.736000000000001e-05, "loss": 8.2499, "step": 600 }, { "epoch": 0.025961589615364152, "grad_norm": 312.71343994140625, "learning_rate": 4.816e-05, "loss": 8.2303, "step": 610 }, { "epoch": 0.02638718944512422, "grad_norm": 247.94815063476562, "learning_rate": 4.8880000000000006e-05, "loss": 8.1981, "step": 620 }, { "epoch": 0.02681278927488429, "grad_norm": 230.76556396484375, "learning_rate": 4.9680000000000005e-05, "loss": 8.1115, "step": 630 }, { "epoch": 0.027238389104644357, "grad_norm": 185.8600616455078, "learning_rate": 5.0480000000000005e-05, "loss": 8.1543, "step": 640 }, { "epoch": 0.027663988934404426, "grad_norm": 210.5782470703125, "learning_rate": 5.1280000000000004e-05, "loss": 8.0605, "step": 650 }, { "epoch": 0.028089588764164494, "grad_norm": 244.0819549560547, "learning_rate": 5.208000000000001e-05, "loss": 7.9563, "step": 660 }, { "epoch": 0.028515188593924563, "grad_norm": 226.42645263671875, "learning_rate": 5.288000000000001e-05, "loss": 7.946, "step": 670 }, { "epoch": 0.02894078842368463, "grad_norm": 297.0813903808594, "learning_rate": 5.368000000000001e-05, "loss": 7.8138, "step": 680 }, { "epoch": 0.0293663882534447, "grad_norm": 250.51219177246094, "learning_rate": 5.448e-05, "loss": 7.9005, "step": 690 }, { "epoch": 0.029791988083204768, "grad_norm": 215.31597900390625, "learning_rate": 5.528e-05, "loss": 7.8383, "step": 700 }, { "epoch": 0.030217587912964836, "grad_norm": 190.99282836914062, "learning_rate": 5.608e-05, "loss": 7.8832, "step": 710 }, { "epoch": 0.0306431877427249, "grad_norm": 220.77931213378906, "learning_rate": 5.688e-05, "loss": 7.6152, "step": 720 }, { "epoch": 0.03106878757248497, "grad_norm": 239.42454528808594, "learning_rate": 5.7680000000000003e-05, "loss": 7.8036, "step": 730 }, { "epoch": 0.03149438740224504, "grad_norm": 184.58163452148438, "learning_rate": 5.848e-05, "loss": 7.8012, "step": 740 }, { "epoch": 0.031919987232005106, "grad_norm": 201.47549438476562, "learning_rate": 5.928e-05, "loss": 7.6639, "step": 750 }, { "epoch": 0.03234558706176518, "grad_norm": 157.16506958007812, "learning_rate": 6.008e-05, "loss": 7.8203, "step": 760 }, { "epoch": 0.03277118689152524, "grad_norm": 236.1090545654297, "learning_rate": 6.088000000000001e-05, "loss": 7.6494, "step": 770 }, { "epoch": 0.03319678672128531, "grad_norm": 196.18592834472656, "learning_rate": 6.168e-05, "loss": 7.7588, "step": 780 }, { "epoch": 0.03362238655104538, "grad_norm": 172.52780151367188, "learning_rate": 6.248000000000001e-05, "loss": 7.65, "step": 790 }, { "epoch": 0.034047986380805445, "grad_norm": 167.19175720214844, "learning_rate": 6.328e-05, "loss": 7.5127, "step": 800 }, { "epoch": 0.03447358621056552, "grad_norm": 156.87774658203125, "learning_rate": 6.408000000000001e-05, "loss": 7.4108, "step": 810 }, { "epoch": 0.03489918604032558, "grad_norm": 159.38601684570312, "learning_rate": 6.488e-05, "loss": 7.437, "step": 820 }, { "epoch": 0.035324785870085654, "grad_norm": 153.8631134033203, "learning_rate": 6.568000000000001e-05, "loss": 7.6065, "step": 830 }, { "epoch": 0.03575038569984572, "grad_norm": 190.62391662597656, "learning_rate": 6.648e-05, "loss": 7.5105, "step": 840 }, { "epoch": 0.03617598552960579, "grad_norm": 185.58334350585938, "learning_rate": 6.727999999999999e-05, "loss": 7.3454, "step": 850 }, { "epoch": 0.036601585359365855, "grad_norm": 250.2914581298828, "learning_rate": 6.808e-05, "loss": 7.3132, "step": 860 }, { "epoch": 0.03702718518912593, "grad_norm": 146.8917999267578, "learning_rate": 6.888e-05, "loss": 7.2683, "step": 870 }, { "epoch": 0.03745278501888599, "grad_norm": 132.48252868652344, "learning_rate": 6.968e-05, "loss": 7.2115, "step": 880 }, { "epoch": 0.03787838484864606, "grad_norm": 124.25926208496094, "learning_rate": 7.048e-05, "loss": 7.2205, "step": 890 }, { "epoch": 0.03830398467840613, "grad_norm": 134.99722290039062, "learning_rate": 7.128000000000001e-05, "loss": 7.2713, "step": 900 } ], "logging_steps": 10, "max_steps": 10000000, "num_input_tokens_seen": 0, "num_train_epochs": 426, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.3172736067584e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }