{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 20.0, "eval_steps": 500, "global_step": 2260, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08888888888888889, "grad_norm": 0.8280278444290161, "learning_rate": 1.8e-05, "loss": 0.8199, "step": 10 }, { "epoch": 0.17777777777777778, "grad_norm": 0.33694130182266235, "learning_rate": 3.8e-05, "loss": 0.7234, "step": 20 }, { "epoch": 0.26666666666666666, "grad_norm": 0.5253115296363831, "learning_rate": 5.8e-05, "loss": 0.6757, "step": 30 }, { "epoch": 0.35555555555555557, "grad_norm": 0.4070330262184143, "learning_rate": 7.800000000000001e-05, "loss": 0.5784, "step": 40 }, { "epoch": 0.4444444444444444, "grad_norm": 0.468620240688324, "learning_rate": 9.8e-05, "loss": 0.5344, "step": 50 }, { "epoch": 0.5333333333333333, "grad_norm": 0.29918837547302246, "learning_rate": 9.999590801246853e-05, "loss": 0.4592, "step": 60 }, { "epoch": 0.6222222222222222, "grad_norm": 0.46750399470329285, "learning_rate": 9.998176373027159e-05, "loss": 0.4602, "step": 70 }, { "epoch": 0.7111111111111111, "grad_norm": 0.5740944147109985, "learning_rate": 9.995751949253889e-05, "loss": 0.4043, "step": 80 }, { "epoch": 0.8, "grad_norm": 0.5454725027084351, "learning_rate": 9.99231801983717e-05, "loss": 0.3956, "step": 90 }, { "epoch": 0.8888888888888888, "grad_norm": 0.6640157103538513, "learning_rate": 9.987875278680778e-05, "loss": 0.4194, "step": 100 }, { "epoch": 0.9777777777777777, "grad_norm": 0.5255690813064575, "learning_rate": 9.982424623541908e-05, "loss": 0.3796, "step": 110 }, { "epoch": 1.0, "eval_loss": 0.3822258412837982, "eval_runtime": 24.245, "eval_samples_per_second": 4.125, "eval_steps_per_second": 0.536, "step": 113 }, { "epoch": 1.0622222222222222, "grad_norm": 0.46724095940589905, "learning_rate": 9.975967155849773e-05, "loss": 0.3253, "step": 120 }, { "epoch": 1.1511111111111112, "grad_norm": 0.40628087520599365, "learning_rate": 9.968504180483023e-05, "loss": 0.3997, "step": 130 }, { "epoch": 1.24, "grad_norm": 0.641273558139801, "learning_rate": 9.960037205506079e-05, "loss": 0.3381, "step": 140 }, { "epoch": 1.3288888888888888, "grad_norm": 0.5509289503097534, "learning_rate": 9.950567941864377e-05, "loss": 0.3444, "step": 150 }, { "epoch": 1.4177777777777778, "grad_norm": 0.49098026752471924, "learning_rate": 9.94009830303865e-05, "loss": 0.3568, "step": 160 }, { "epoch": 1.5066666666666668, "grad_norm": 0.6113401055335999, "learning_rate": 9.928630404658255e-05, "loss": 0.3037, "step": 170 }, { "epoch": 1.5955555555555554, "grad_norm": 0.41983288526535034, "learning_rate": 9.916166564073662e-05, "loss": 0.3177, "step": 180 }, { "epoch": 1.6844444444444444, "grad_norm": 0.5567779541015625, "learning_rate": 9.90270929988818e-05, "loss": 0.3761, "step": 190 }, { "epoch": 1.7733333333333334, "grad_norm": 0.4871814250946045, "learning_rate": 9.888261331449029e-05, "loss": 0.3177, "step": 200 }, { "epoch": 1.8622222222222222, "grad_norm": 0.8324890732765198, "learning_rate": 9.872825578297811e-05, "loss": 0.3103, "step": 210 }, { "epoch": 1.951111111111111, "grad_norm": 0.5431402325630188, "learning_rate": 9.85640515958057e-05, "loss": 0.3238, "step": 220 }, { "epoch": 2.0, "eval_loss": 0.3141745328903198, "eval_runtime": 22.8047, "eval_samples_per_second": 4.385, "eval_steps_per_second": 0.57, "step": 226 }, { "epoch": 2.0355555555555553, "grad_norm": 0.46945399045944214, "learning_rate": 9.839003393417486e-05, "loss": 0.3596, "step": 230 }, { "epoch": 2.1244444444444444, "grad_norm": 0.5933423042297363, "learning_rate": 9.820623796232378e-05, "loss": 0.2621, "step": 240 }, { "epoch": 2.2133333333333334, "grad_norm": 0.5787666440010071, "learning_rate": 9.80127008204213e-05, "loss": 0.2739, "step": 250 }, { "epoch": 2.3022222222222224, "grad_norm": 0.6163641810417175, "learning_rate": 9.780946161706188e-05, "loss": 0.2683, "step": 260 }, { "epoch": 2.391111111111111, "grad_norm": 0.6638880968093872, "learning_rate": 9.759656142136279e-05, "loss": 0.2813, "step": 270 }, { "epoch": 2.48, "grad_norm": 0.550884485244751, "learning_rate": 9.737404325466521e-05, "loss": 0.3166, "step": 280 }, { "epoch": 2.568888888888889, "grad_norm": 0.9437989592552185, "learning_rate": 9.714195208184076e-05, "loss": 0.286, "step": 290 }, { "epoch": 2.6577777777777776, "grad_norm": 0.6860134601593018, "learning_rate": 9.690033480220535e-05, "loss": 0.2935, "step": 300 }, { "epoch": 2.7466666666666666, "grad_norm": 0.7631677389144897, "learning_rate": 9.664924024004203e-05, "loss": 0.2836, "step": 310 }, { "epoch": 2.8355555555555556, "grad_norm": 1.093269944190979, "learning_rate": 9.638871913473501e-05, "loss": 0.2875, "step": 320 }, { "epoch": 2.924444444444444, "grad_norm": 0.7322181463241577, "learning_rate": 9.611882413051659e-05, "loss": 0.2811, "step": 330 }, { "epoch": 3.0, "eval_loss": 0.29859602451324463, "eval_runtime": 22.7936, "eval_samples_per_second": 4.387, "eval_steps_per_second": 0.57, "step": 339 }, { "epoch": 3.008888888888889, "grad_norm": 0.6508819460868835, "learning_rate": 9.583960976582913e-05, "loss": 0.2612, "step": 340 }, { "epoch": 3.097777777777778, "grad_norm": 0.813624382019043, "learning_rate": 9.555113246230442e-05, "loss": 0.2477, "step": 350 }, { "epoch": 3.1866666666666665, "grad_norm": 0.7740529775619507, "learning_rate": 9.525345051336232e-05, "loss": 0.2508, "step": 360 }, { "epoch": 3.2755555555555556, "grad_norm": 0.6230549812316895, "learning_rate": 9.494662407243129e-05, "loss": 0.2201, "step": 370 }, { "epoch": 3.3644444444444446, "grad_norm": 0.605621874332428, "learning_rate": 9.463071514079299e-05, "loss": 0.2579, "step": 380 }, { "epoch": 3.453333333333333, "grad_norm": 0.6390963196754456, "learning_rate": 9.430578755505345e-05, "loss": 0.2468, "step": 390 }, { "epoch": 3.542222222222222, "grad_norm": 0.6382352709770203, "learning_rate": 9.39719069742436e-05, "loss": 0.254, "step": 400 }, { "epoch": 3.631111111111111, "grad_norm": 1.0674622058868408, "learning_rate": 9.36291408665512e-05, "loss": 0.2817, "step": 410 }, { "epoch": 3.7199999999999998, "grad_norm": 0.6276893615722656, "learning_rate": 9.327755849568745e-05, "loss": 0.2549, "step": 420 }, { "epoch": 3.8088888888888888, "grad_norm": 0.8051192164421082, "learning_rate": 9.291723090689058e-05, "loss": 0.2707, "step": 430 }, { "epoch": 3.897777777777778, "grad_norm": 1.0645169019699097, "learning_rate": 9.25482309125696e-05, "loss": 0.2107, "step": 440 }, { "epoch": 3.986666666666667, "grad_norm": 0.9240409135818481, "learning_rate": 9.217063307759098e-05, "loss": 0.2654, "step": 450 }, { "epoch": 4.0, "eval_loss": 0.29310476779937744, "eval_runtime": 22.794, "eval_samples_per_second": 4.387, "eval_steps_per_second": 0.57, "step": 452 }, { "epoch": 4.071111111111111, "grad_norm": 0.6939980983734131, "learning_rate": 9.178451370421092e-05, "loss": 0.2052, "step": 460 }, { "epoch": 4.16, "grad_norm": 0.731479823589325, "learning_rate": 9.138995081665691e-05, "loss": 0.2145, "step": 470 }, { "epoch": 4.248888888888889, "grad_norm": 0.8955116868019104, "learning_rate": 9.098702414536107e-05, "loss": 0.2046, "step": 480 }, { "epoch": 4.337777777777778, "grad_norm": 1.1034150123596191, "learning_rate": 9.057581511084879e-05, "loss": 0.1743, "step": 490 }, { "epoch": 4.426666666666667, "grad_norm": 0.9072665572166443, "learning_rate": 9.015640680728595e-05, "loss": 0.2571, "step": 500 }, { "epoch": 4.515555555555555, "grad_norm": 1.0989047288894653, "learning_rate": 8.972888398568772e-05, "loss": 0.2083, "step": 510 }, { "epoch": 4.604444444444445, "grad_norm": 1.1180020570755005, "learning_rate": 8.929333303679276e-05, "loss": 0.2248, "step": 520 }, { "epoch": 4.693333333333333, "grad_norm": 0.9198616743087769, "learning_rate": 8.884984197360605e-05, "loss": 0.2404, "step": 530 }, { "epoch": 4.782222222222222, "grad_norm": 0.8098738789558411, "learning_rate": 8.839850041361368e-05, "loss": 0.2395, "step": 540 }, { "epoch": 4.871111111111111, "grad_norm": 0.9560163617134094, "learning_rate": 8.793939956067379e-05, "loss": 0.2291, "step": 550 }, { "epoch": 4.96, "grad_norm": 0.9346197247505188, "learning_rate": 8.747263218658661e-05, "loss": 0.2112, "step": 560 }, { "epoch": 5.0, "eval_loss": 0.2931341826915741, "eval_runtime": 22.801, "eval_samples_per_second": 4.386, "eval_steps_per_second": 0.57, "step": 565 }, { "epoch": 5.044444444444444, "grad_norm": 0.727533221244812, "learning_rate": 8.699829261234791e-05, "loss": 0.2315, "step": 570 }, { "epoch": 5.133333333333334, "grad_norm": 0.8154391050338745, "learning_rate": 8.651647668908917e-05, "loss": 0.23, "step": 580 }, { "epoch": 5.222222222222222, "grad_norm": 1.1250296831130981, "learning_rate": 8.60272817787088e-05, "loss": 0.1952, "step": 590 }, { "epoch": 5.311111111111111, "grad_norm": 1.1119612455368042, "learning_rate": 8.553080673419784e-05, "loss": 0.1742, "step": 600 }, { "epoch": 5.4, "grad_norm": 1.0984034538269043, "learning_rate": 8.502715187966455e-05, "loss": 0.2081, "step": 610 }, { "epoch": 5.488888888888889, "grad_norm": 0.9959269165992737, "learning_rate": 8.451641899006155e-05, "loss": 0.1958, "step": 620 }, { "epoch": 5.5777777777777775, "grad_norm": 0.8436211347579956, "learning_rate": 8.399871127061991e-05, "loss": 0.1772, "step": 630 }, { "epoch": 5.666666666666667, "grad_norm": 1.0537818670272827, "learning_rate": 8.347413333599419e-05, "loss": 0.1792, "step": 640 }, { "epoch": 5.7555555555555555, "grad_norm": 1.2140848636627197, "learning_rate": 8.294279118912267e-05, "loss": 0.2104, "step": 650 }, { "epoch": 5.844444444444444, "grad_norm": 1.4907416105270386, "learning_rate": 8.240479219980697e-05, "loss": 0.2044, "step": 660 }, { "epoch": 5.933333333333334, "grad_norm": 0.8753892183303833, "learning_rate": 8.186024508301564e-05, "loss": 0.1779, "step": 670 }, { "epoch": 6.0, "eval_loss": 0.30221858620643616, "eval_runtime": 22.8113, "eval_samples_per_second": 4.384, "eval_steps_per_second": 0.57, "step": 678 }, { "epoch": 6.017777777777778, "grad_norm": 1.161600112915039, "learning_rate": 8.130925987691569e-05, "loss": 0.2089, "step": 680 }, { "epoch": 6.1066666666666665, "grad_norm": 1.0779800415039062, "learning_rate": 8.0751947920637e-05, "loss": 0.1549, "step": 690 }, { "epoch": 6.195555555555556, "grad_norm": 1.244500756263733, "learning_rate": 8.018842183177363e-05, "loss": 0.1777, "step": 700 }, { "epoch": 6.2844444444444445, "grad_norm": 1.0372693538665771, "learning_rate": 7.961879548362687e-05, "loss": 0.1681, "step": 710 }, { "epoch": 6.373333333333333, "grad_norm": 1.275514841079712, "learning_rate": 7.904318398219456e-05, "loss": 0.1783, "step": 720 }, { "epoch": 6.4622222222222225, "grad_norm": 1.0903297662734985, "learning_rate": 7.84617036429113e-05, "loss": 0.1777, "step": 730 }, { "epoch": 6.551111111111111, "grad_norm": 1.1274893283843994, "learning_rate": 7.787447196714427e-05, "loss": 0.1372, "step": 740 }, { "epoch": 6.64, "grad_norm": 1.0295445919036865, "learning_rate": 7.728160761844938e-05, "loss": 0.1765, "step": 750 }, { "epoch": 6.728888888888889, "grad_norm": 0.7822284698486328, "learning_rate": 7.668323039859255e-05, "loss": 0.1741, "step": 760 }, { "epoch": 6.817777777777778, "grad_norm": 1.2998981475830078, "learning_rate": 7.607946122334115e-05, "loss": 0.1763, "step": 770 }, { "epoch": 6.906666666666666, "grad_norm": 0.9125447273254395, "learning_rate": 7.54704220980301e-05, "loss": 0.1672, "step": 780 }, { "epoch": 6.995555555555556, "grad_norm": 1.3892459869384766, "learning_rate": 7.485623609290792e-05, "loss": 0.201, "step": 790 }, { "epoch": 7.0, "eval_loss": 0.31423336267471313, "eval_runtime": 22.8119, "eval_samples_per_second": 4.384, "eval_steps_per_second": 0.57, "step": 791 }, { "epoch": 7.08, "grad_norm": 1.2177425622940063, "learning_rate": 7.423702731826764e-05, "loss": 0.161, "step": 800 }, { "epoch": 7.168888888888889, "grad_norm": 1.2349414825439453, "learning_rate": 7.361292089936748e-05, "loss": 0.1288, "step": 810 }, { "epoch": 7.257777777777778, "grad_norm": 1.3617855310440063, "learning_rate": 7.298404295114633e-05, "loss": 0.1498, "step": 820 }, { "epoch": 7.346666666666667, "grad_norm": 1.0532838106155396, "learning_rate": 7.235052055273947e-05, "loss": 0.145, "step": 830 }, { "epoch": 7.435555555555555, "grad_norm": 2.5282888412475586, "learning_rate": 7.171248172179933e-05, "loss": 0.1572, "step": 840 }, { "epoch": 7.524444444444445, "grad_norm": 1.316571831703186, "learning_rate": 7.107005538862646e-05, "loss": 0.1743, "step": 850 }, { "epoch": 7.613333333333333, "grad_norm": 1.0913692712783813, "learning_rate": 7.042337137011641e-05, "loss": 0.1319, "step": 860 }, { "epoch": 7.702222222222222, "grad_norm": 1.2439199686050415, "learning_rate": 6.977256034352712e-05, "loss": 0.1523, "step": 870 }, { "epoch": 7.791111111111111, "grad_norm": 1.400645136833191, "learning_rate": 6.911775382007274e-05, "loss": 0.1647, "step": 880 }, { "epoch": 7.88, "grad_norm": 1.1752562522888184, "learning_rate": 6.845908411834859e-05, "loss": 0.147, "step": 890 }, { "epoch": 7.968888888888889, "grad_norm": 1.1503429412841797, "learning_rate": 6.779668433759336e-05, "loss": 0.1609, "step": 900 }, { "epoch": 8.0, "eval_loss": 0.33602261543273926, "eval_runtime": 22.8016, "eval_samples_per_second": 4.386, "eval_steps_per_second": 0.57, "step": 904 }, { "epoch": 8.053333333333333, "grad_norm": 1.0708063840866089, "learning_rate": 6.713068833079333e-05, "loss": 0.146, "step": 910 }, { "epoch": 8.142222222222221, "grad_norm": 0.9203677177429199, "learning_rate": 6.646123067763417e-05, "loss": 0.13, "step": 920 }, { "epoch": 8.231111111111112, "grad_norm": 1.0815396308898926, "learning_rate": 6.578844665730629e-05, "loss": 0.1515, "step": 930 }, { "epoch": 8.32, "grad_norm": 1.0179847478866577, "learning_rate": 6.511247222116839e-05, "loss": 0.1034, "step": 940 }, { "epoch": 8.408888888888889, "grad_norm": 1.5660508871078491, "learning_rate": 6.443344396527548e-05, "loss": 0.1566, "step": 950 }, { "epoch": 8.497777777777777, "grad_norm": 1.3174259662628174, "learning_rate": 6.375149910277656e-05, "loss": 0.1555, "step": 960 }, { "epoch": 8.586666666666666, "grad_norm": 1.3149052858352661, "learning_rate": 6.306677543618742e-05, "loss": 0.1545, "step": 970 }, { "epoch": 8.675555555555556, "grad_norm": 1.0674543380737305, "learning_rate": 6.237941132954475e-05, "loss": 0.1173, "step": 980 }, { "epoch": 8.764444444444445, "grad_norm": 2.6074378490448, "learning_rate": 6.168954568044626e-05, "loss": 0.1439, "step": 990 }, { "epoch": 8.853333333333333, "grad_norm": 1.1385785341262817, "learning_rate": 6.099731789198344e-05, "loss": 0.1057, "step": 1000 }, { "epoch": 8.942222222222222, "grad_norm": 1.4166982173919678, "learning_rate": 6.030286784457191e-05, "loss": 0.1318, "step": 1010 }, { "epoch": 9.0, "eval_loss": 0.3568514883518219, "eval_runtime": 22.8151, "eval_samples_per_second": 4.383, "eval_steps_per_second": 0.57, "step": 1017 }, { "epoch": 9.026666666666667, "grad_norm": 1.4854719638824463, "learning_rate": 5.960633586768543e-05, "loss": 0.1511, "step": 1020 }, { "epoch": 9.115555555555556, "grad_norm": 1.2033461332321167, "learning_rate": 5.890786271149904e-05, "loss": 0.0962, "step": 1030 }, { "epoch": 9.204444444444444, "grad_norm": 1.3722549676895142, "learning_rate": 5.8207589518447405e-05, "loss": 0.1056, "step": 1040 }, { "epoch": 9.293333333333333, "grad_norm": 1.156151294708252, "learning_rate": 5.750565779470368e-05, "loss": 0.1185, "step": 1050 }, { "epoch": 9.382222222222222, "grad_norm": 1.1652061939239502, "learning_rate": 5.680220938158495e-05, "loss": 0.1073, "step": 1060 }, { "epoch": 9.471111111111112, "grad_norm": 1.1125752925872803, "learning_rate": 5.609738642689001e-05, "loss": 0.1081, "step": 1070 }, { "epoch": 9.56, "grad_norm": 1.2892574071884155, "learning_rate": 5.539133135617517e-05, "loss": 0.1231, "step": 1080 }, { "epoch": 9.648888888888889, "grad_norm": 1.379626989364624, "learning_rate": 5.4684186843973826e-05, "loss": 0.1066, "step": 1090 }, { "epoch": 9.737777777777778, "grad_norm": 1.0732649564743042, "learning_rate": 5.397609578496593e-05, "loss": 0.1111, "step": 1100 }, { "epoch": 9.826666666666666, "grad_norm": 1.5738511085510254, "learning_rate": 5.326720126510275e-05, "loss": 0.1213, "step": 1110 }, { "epoch": 9.915555555555555, "grad_norm": 1.2037897109985352, "learning_rate": 5.2557646532693226e-05, "loss": 0.1145, "step": 1120 }, { "epoch": 10.0, "grad_norm": 1.7668266296386719, "learning_rate": 5.184757496945726e-05, "loss": 0.142, "step": 1130 }, { "epoch": 10.0, "eval_loss": 0.38781511783599854, "eval_runtime": 22.819, "eval_samples_per_second": 4.382, "eval_steps_per_second": 0.57, "step": 1130 }, { "epoch": 10.088888888888889, "grad_norm": 1.293931245803833, "learning_rate": 5.1137130061552174e-05, "loss": 0.0851, "step": 1140 }, { "epoch": 10.177777777777777, "grad_norm": 1.5352977514266968, "learning_rate": 5.042645537057819e-05, "loss": 0.1186, "step": 1150 }, { "epoch": 10.266666666666667, "grad_norm": 1.765360951423645, "learning_rate": 4.971569450456836e-05, "loss": 0.1055, "step": 1160 }, { "epoch": 10.355555555555556, "grad_norm": 1.5278376340866089, "learning_rate": 4.9004991088969384e-05, "loss": 0.0788, "step": 1170 }, { "epoch": 10.444444444444445, "grad_norm": 1.144656777381897, "learning_rate": 4.829448873761885e-05, "loss": 0.0976, "step": 1180 }, { "epoch": 10.533333333333333, "grad_norm": 0.9775051474571228, "learning_rate": 4.758433102372466e-05, "loss": 0.0866, "step": 1190 }, { "epoch": 10.622222222222222, "grad_norm": 1.5830668210983276, "learning_rate": 4.687466145085286e-05, "loss": 0.1037, "step": 1200 }, { "epoch": 10.71111111111111, "grad_norm": 1.668695092201233, "learning_rate": 4.616562342392955e-05, "loss": 0.1323, "step": 1210 }, { "epoch": 10.8, "grad_norm": 1.8038705587387085, "learning_rate": 4.545736022026247e-05, "loss": 0.1157, "step": 1220 }, { "epoch": 10.88888888888889, "grad_norm": 1.432991862297058, "learning_rate": 4.4750014960588666e-05, "loss": 0.1234, "step": 1230 }, { "epoch": 10.977777777777778, "grad_norm": 1.264278531074524, "learning_rate": 4.404373058015371e-05, "loss": 0.1105, "step": 1240 }, { "epoch": 11.0, "eval_loss": 0.4054388403892517, "eval_runtime": 22.808, "eval_samples_per_second": 4.384, "eval_steps_per_second": 0.57, "step": 1243 }, { "epoch": 11.062222222222223, "grad_norm": 1.5953978300094604, "learning_rate": 4.333864979982825e-05, "loss": 0.1119, "step": 1250 }, { "epoch": 11.151111111111112, "grad_norm": 1.5366672277450562, "learning_rate": 4.2634915097268115e-05, "loss": 0.0805, "step": 1260 }, { "epoch": 11.24, "grad_norm": 1.175093173980713, "learning_rate": 4.193266867812346e-05, "loss": 0.1111, "step": 1270 }, { "epoch": 11.328888888888889, "grad_norm": 1.193050503730774, "learning_rate": 4.123205244730275e-05, "loss": 0.0814, "step": 1280 }, { "epoch": 11.417777777777777, "grad_norm": 1.9646860361099243, "learning_rate": 4.0533207980297724e-05, "loss": 0.0884, "step": 1290 }, { "epoch": 11.506666666666666, "grad_norm": 1.2864062786102295, "learning_rate": 3.9836276494574865e-05, "loss": 0.0811, "step": 1300 }, { "epoch": 11.595555555555556, "grad_norm": 1.9868394136428833, "learning_rate": 3.914139882103911e-05, "loss": 0.1031, "step": 1310 }, { "epoch": 11.684444444444445, "grad_norm": 1.0178577899932861, "learning_rate": 3.844871537557583e-05, "loss": 0.0779, "step": 1320 }, { "epoch": 11.773333333333333, "grad_norm": 1.2357277870178223, "learning_rate": 3.7758366130676504e-05, "loss": 0.0997, "step": 1330 }, { "epoch": 11.862222222222222, "grad_norm": 1.4548487663269043, "learning_rate": 3.7139162859371955e-05, "loss": 0.0916, "step": 1340 }, { "epoch": 11.95111111111111, "grad_norm": 1.3962253332138062, "learning_rate": 3.645363250772425e-05, "loss": 0.1056, "step": 1350 }, { "epoch": 12.0, "eval_loss": 0.4192918539047241, "eval_runtime": 22.8206, "eval_samples_per_second": 4.382, "eval_steps_per_second": 0.57, "step": 1356 }, { "epoch": 12.035555555555556, "grad_norm": 1.0945167541503906, "learning_rate": 3.5770839508645385e-05, "loss": 0.0946, "step": 1360 }, { "epoch": 12.124444444444444, "grad_norm": 1.3720024824142456, "learning_rate": 3.509092183603659e-05, "loss": 0.0843, "step": 1370 }, { "epoch": 12.213333333333333, "grad_norm": 3.5357658863067627, "learning_rate": 3.4414016882773757e-05, "loss": 0.0951, "step": 1380 }, { "epoch": 12.302222222222222, "grad_norm": 1.6700564622879028, "learning_rate": 3.37402614329441e-05, "loss": 0.0929, "step": 1390 }, { "epoch": 12.391111111111112, "grad_norm": 1.6576741933822632, "learning_rate": 3.306979163420582e-05, "loss": 0.0678, "step": 1400 }, { "epoch": 12.48, "grad_norm": 1.3355114459991455, "learning_rate": 3.2402742970276426e-05, "loss": 0.0785, "step": 1410 }, { "epoch": 12.568888888888889, "grad_norm": 1.2856038808822632, "learning_rate": 3.1739250233554996e-05, "loss": 0.0729, "step": 1420 }, { "epoch": 12.657777777777778, "grad_norm": 1.1800755262374878, "learning_rate": 3.107944749788449e-05, "loss": 0.0761, "step": 1430 }, { "epoch": 12.746666666666666, "grad_norm": 0.9438807964324951, "learning_rate": 3.0423468091458918e-05, "loss": 0.0962, "step": 1440 }, { "epoch": 12.835555555555555, "grad_norm": 1.2357594966888428, "learning_rate": 2.9771444569881413e-05, "loss": 0.0778, "step": 1450 }, { "epoch": 12.924444444444445, "grad_norm": 1.2670978307724, "learning_rate": 2.9123508689378352e-05, "loss": 0.0712, "step": 1460 }, { "epoch": 13.0, "eval_loss": 0.452305406332016, "eval_runtime": 22.8071, "eval_samples_per_second": 4.385, "eval_steps_per_second": 0.57, "step": 1469 }, { "epoch": 13.008888888888889, "grad_norm": 1.1917250156402588, "learning_rate": 2.847979138017496e-05, "loss": 0.078, "step": 1470 }, { "epoch": 13.097777777777777, "grad_norm": 1.3447437286376953, "learning_rate": 2.784042272003794e-05, "loss": 0.0705, "step": 1480 }, { "epoch": 13.186666666666667, "grad_norm": 1.989099144935608, "learning_rate": 2.720553190799019e-05, "loss": 0.066, "step": 1490 }, { "epoch": 13.275555555555556, "grad_norm": 1.0475879907608032, "learning_rate": 2.6575247238203328e-05, "loss": 0.0636, "step": 1500 }, { "epoch": 13.364444444444445, "grad_norm": 1.481781005859375, "learning_rate": 2.5949696074072786e-05, "loss": 0.0831, "step": 1510 }, { "epoch": 13.453333333333333, "grad_norm": 0.9895071387290955, "learning_rate": 2.532900482248124e-05, "loss": 0.0745, "step": 1520 }, { "epoch": 13.542222222222222, "grad_norm": 1.4489779472351074, "learning_rate": 2.471329890825514e-05, "loss": 0.0757, "step": 1530 }, { "epoch": 13.63111111111111, "grad_norm": 1.0097142457962036, "learning_rate": 2.410270274881981e-05, "loss": 0.0698, "step": 1540 }, { "epoch": 13.72, "grad_norm": 1.7415978908538818, "learning_rate": 2.3497339729058083e-05, "loss": 0.0889, "step": 1550 }, { "epoch": 13.80888888888889, "grad_norm": 1.0850639343261719, "learning_rate": 2.2897332176377528e-05, "loss": 0.0725, "step": 1560 }, { "epoch": 13.897777777777778, "grad_norm": 1.0806571245193481, "learning_rate": 2.2302801335991413e-05, "loss": 0.0894, "step": 1570 }, { "epoch": 13.986666666666666, "grad_norm": 1.1130938529968262, "learning_rate": 2.1713867346418354e-05, "loss": 0.062, "step": 1580 }, { "epoch": 14.0, "eval_loss": 0.4800405502319336, "eval_runtime": 22.8054, "eval_samples_per_second": 4.385, "eval_steps_per_second": 0.57, "step": 1582 }, { "epoch": 14.071111111111112, "grad_norm": 0.8069847226142883, "learning_rate": 2.1130649215205584e-05, "loss": 0.0638, "step": 1590 }, { "epoch": 14.16, "grad_norm": 1.0252199172973633, "learning_rate": 2.0553264794880756e-05, "loss": 0.0546, "step": 1600 }, { "epoch": 14.248888888888889, "grad_norm": 0.7054935693740845, "learning_rate": 1.9981830759137186e-05, "loss": 0.0547, "step": 1610 }, { "epoch": 14.337777777777777, "grad_norm": 1.59795343875885, "learning_rate": 1.9416462579257273e-05, "loss": 0.0669, "step": 1620 }, { "epoch": 14.426666666666666, "grad_norm": 0.9351125955581665, "learning_rate": 1.885727450077879e-05, "loss": 0.0755, "step": 1630 }, { "epoch": 14.515555555555556, "grad_norm": 1.1384128332138062, "learning_rate": 1.8304379520409087e-05, "loss": 0.07, "step": 1640 }, { "epoch": 14.604444444444445, "grad_norm": 0.9477954506874084, "learning_rate": 1.7757889363191483e-05, "loss": 0.0503, "step": 1650 }, { "epoch": 14.693333333333333, "grad_norm": 1.6113272905349731, "learning_rate": 1.7217914459928646e-05, "loss": 0.0797, "step": 1660 }, { "epoch": 14.782222222222222, "grad_norm": 2.085812568664551, "learning_rate": 1.668456392486762e-05, "loss": 0.065, "step": 1670 }, { "epoch": 14.87111111111111, "grad_norm": 1.1539088487625122, "learning_rate": 1.615794553365066e-05, "loss": 0.0776, "step": 1680 }, { "epoch": 14.96, "grad_norm": 1.685166597366333, "learning_rate": 1.5638165701536868e-05, "loss": 0.0742, "step": 1690 }, { "epoch": 15.0, "eval_loss": 0.5068357586860657, "eval_runtime": 22.7972, "eval_samples_per_second": 4.386, "eval_steps_per_second": 0.57, "step": 1695 }, { "epoch": 15.044444444444444, "grad_norm": 1.00210440158844, "learning_rate": 1.5125329461898408e-05, "loss": 0.0496, "step": 1700 }, { "epoch": 15.133333333333333, "grad_norm": 0.8724846839904785, "learning_rate": 1.4619540444996227e-05, "loss": 0.0577, "step": 1710 }, { "epoch": 15.222222222222221, "grad_norm": 1.568989872932434, "learning_rate": 1.4120900857039126e-05, "loss": 0.0679, "step": 1720 }, { "epoch": 15.311111111111112, "grad_norm": 1.4423738718032837, "learning_rate": 1.3629511459530758e-05, "loss": 0.056, "step": 1730 }, { "epoch": 15.4, "grad_norm": 1.4789477586746216, "learning_rate": 1.3145471548908345e-05, "loss": 0.0661, "step": 1740 }, { "epoch": 15.488888888888889, "grad_norm": 1.2932227849960327, "learning_rate": 1.266887893647764e-05, "loss": 0.0736, "step": 1750 }, { "epoch": 15.577777777777778, "grad_norm": 1.0465151071548462, "learning_rate": 1.2199829928647949e-05, "loss": 0.0582, "step": 1760 }, { "epoch": 15.666666666666666, "grad_norm": 1.129989504814148, "learning_rate": 1.1738419307471138e-05, "loss": 0.0612, "step": 1770 }, { "epoch": 15.755555555555556, "grad_norm": 1.283918023109436, "learning_rate": 1.1284740311488812e-05, "loss": 0.0592, "step": 1780 }, { "epoch": 15.844444444444445, "grad_norm": 0.6702640652656555, "learning_rate": 1.083888461689137e-05, "loss": 0.0609, "step": 1790 }, { "epoch": 15.933333333333334, "grad_norm": 1.0527065992355347, "learning_rate": 1.0400942318992668e-05, "loss": 0.0624, "step": 1800 }, { "epoch": 16.0, "eval_loss": 0.5388746857643127, "eval_runtime": 22.7988, "eval_samples_per_second": 4.386, "eval_steps_per_second": 0.57, "step": 1808 }, { "epoch": 16.017777777777777, "grad_norm": 0.8927621841430664, "learning_rate": 9.971001914024247e-06, "loss": 0.0542, "step": 1810 }, { "epoch": 16.106666666666666, "grad_norm": 1.9986155033111572, "learning_rate": 9.549150281252633e-06, "loss": 0.0738, "step": 1820 }, { "epoch": 16.195555555555554, "grad_norm": 0.7365565299987793, "learning_rate": 9.135472665423433e-06, "loss": 0.0536, "step": 1830 }, { "epoch": 16.284444444444443, "grad_norm": 1.414197564125061, "learning_rate": 8.730052659535675e-06, "loss": 0.0561, "step": 1840 }, { "epoch": 16.373333333333335, "grad_norm": 1.1275652647018433, "learning_rate": 8.332972187949889e-06, "loss": 0.053, "step": 1850 }, { "epoch": 16.462222222222223, "grad_norm": 1.1671727895736694, "learning_rate": 7.94431148983349e-06, "loss": 0.0655, "step": 1860 }, { "epoch": 16.551111111111112, "grad_norm": 0.7808873653411865, "learning_rate": 7.564149102946572e-06, "loss": 0.052, "step": 1870 }, { "epoch": 16.64, "grad_norm": 1.3717401027679443, "learning_rate": 7.192561847771589e-06, "loss": 0.0626, "step": 1880 }, { "epoch": 16.72888888888889, "grad_norm": 1.3122680187225342, "learning_rate": 6.829624811990038e-06, "loss": 0.0523, "step": 1890 }, { "epoch": 16.817777777777778, "grad_norm": 0.9357064366340637, "learning_rate": 6.475411335309245e-06, "loss": 0.0512, "step": 1900 }, { "epoch": 16.906666666666666, "grad_norm": 1.1543922424316406, "learning_rate": 6.129992994642425e-06, "loss": 0.0547, "step": 1910 }, { "epoch": 16.995555555555555, "grad_norm": 1.072333574295044, "learning_rate": 5.793439589644917e-06, "loss": 0.0615, "step": 1920 }, { "epoch": 17.0, "eval_loss": 0.5451540350914001, "eval_runtime": 22.8109, "eval_samples_per_second": 4.384, "eval_steps_per_second": 0.57, "step": 1921 }, { "epoch": 17.08, "grad_norm": 1.281044602394104, "learning_rate": 5.4658191286095895e-06, "loss": 0.0539, "step": 1930 }, { "epoch": 17.16888888888889, "grad_norm": 0.7179533839225769, "learning_rate": 5.1471978147241974e-06, "loss": 0.0563, "step": 1940 }, { "epoch": 17.25777777777778, "grad_norm": 0.7629289031028748, "learning_rate": 4.837640032693558e-06, "loss": 0.0577, "step": 1950 }, { "epoch": 17.346666666666668, "grad_norm": 1.0043361186981201, "learning_rate": 4.537208335729088e-06, "loss": 0.0553, "step": 1960 }, { "epoch": 17.435555555555556, "grad_norm": 1.1511973142623901, "learning_rate": 4.245963432908556e-06, "loss": 0.0529, "step": 1970 }, { "epoch": 17.524444444444445, "grad_norm": 1.298182487487793, "learning_rate": 3.963964176908391e-06, "loss": 0.0477, "step": 1980 }, { "epoch": 17.613333333333333, "grad_norm": 1.01607084274292, "learning_rate": 3.691267552111183e-06, "loss": 0.0569, "step": 1990 }, { "epoch": 17.702222222222222, "grad_norm": 1.1849422454833984, "learning_rate": 3.4279286630906572e-06, "loss": 0.0476, "step": 2000 }, { "epoch": 17.79111111111111, "grad_norm": 1.1263349056243896, "learning_rate": 3.1740007234766002e-06, "loss": 0.0534, "step": 2010 }, { "epoch": 17.88, "grad_norm": 1.0211373567581177, "learning_rate": 2.9295350452017535e-06, "loss": 0.0503, "step": 2020 }, { "epoch": 17.968888888888888, "grad_norm": 0.8752411603927612, "learning_rate": 2.6945810281331085e-06, "loss": 0.0546, "step": 2030 }, { "epoch": 18.0, "eval_loss": 0.5564368963241577, "eval_runtime": 22.789, "eval_samples_per_second": 4.388, "eval_steps_per_second": 0.57, "step": 2034 }, { "epoch": 18.053333333333335, "grad_norm": 1.052837610244751, "learning_rate": 2.4691861500895474e-06, "loss": 0.0525, "step": 2040 }, { "epoch": 18.142222222222223, "grad_norm": 0.5916168689727783, "learning_rate": 2.2533959572478392e-06, "loss": 0.0452, "step": 2050 }, { "epoch": 18.23111111111111, "grad_norm": 0.8715868592262268, "learning_rate": 2.0472540549390074e-06, "loss": 0.0504, "step": 2060 }, { "epoch": 18.32, "grad_norm": 1.3320412635803223, "learning_rate": 1.85080209883689e-06, "loss": 0.051, "step": 2070 }, { "epoch": 18.40888888888889, "grad_norm": 1.0562243461608887, "learning_rate": 1.6640797865406288e-06, "loss": 0.0564, "step": 2080 }, { "epoch": 18.497777777777777, "grad_norm": 0.8278095126152039, "learning_rate": 1.4871248495529011e-06, "loss": 0.0502, "step": 2090 }, { "epoch": 18.586666666666666, "grad_norm": 1.0500751733779907, "learning_rate": 1.3199730456553926e-06, "loss": 0.0532, "step": 2100 }, { "epoch": 18.675555555555555, "grad_norm": 1.490010380744934, "learning_rate": 1.1626581516831048e-06, "loss": 0.0647, "step": 2110 }, { "epoch": 18.764444444444443, "grad_norm": 1.9580787420272827, "learning_rate": 1.0152119566990025e-06, "loss": 0.0583, "step": 2120 }, { "epoch": 18.85333333333333, "grad_norm": 1.0863550901412964, "learning_rate": 8.776642555702985e-07, "loss": 0.0534, "step": 2130 }, { "epoch": 18.942222222222224, "grad_norm": 1.1364506483078003, "learning_rate": 7.50042842947718e-07, "loss": 0.0495, "step": 2140 }, { "epoch": 19.0, "eval_loss": 0.5644907355308533, "eval_runtime": 22.8007, "eval_samples_per_second": 4.386, "eval_steps_per_second": 0.57, "step": 2147 }, { "epoch": 19.026666666666667, "grad_norm": 0.4925549328327179, "learning_rate": 6.323735076489535e-07, "loss": 0.0476, "step": 2150 }, { "epoch": 19.115555555555556, "grad_norm": 1.1283750534057617, "learning_rate": 5.246800274474439e-07, "loss": 0.0498, "step": 2160 }, { "epoch": 19.204444444444444, "grad_norm": 1.1284992694854736, "learning_rate": 4.269841642675576e-07, "loss": 0.0521, "step": 2170 }, { "epoch": 19.293333333333333, "grad_norm": 1.0008766651153564, "learning_rate": 3.393056597870703e-07, "loss": 0.0505, "step": 2180 }, { "epoch": 19.38222222222222, "grad_norm": 0.728695809841156, "learning_rate": 2.616622314479067e-07, "loss": 0.0441, "step": 2190 }, { "epoch": 19.47111111111111, "grad_norm": 0.9185757637023926, "learning_rate": 1.9406956887595418e-07, "loss": 0.0491, "step": 2200 }, { "epoch": 19.56, "grad_norm": 0.7735620141029358, "learning_rate": 1.3654133071059893e-07, "loss": 0.0597, "step": 2210 }, { "epoch": 19.648888888888887, "grad_norm": 0.6428269743919373, "learning_rate": 8.90891418446782e-08, "loss": 0.0681, "step": 2220 }, { "epoch": 19.73777777777778, "grad_norm": 1.19765305519104, "learning_rate": 5.1722591075425986e-08, "loss": 0.0487, "step": 2230 }, { "epoch": 19.826666666666668, "grad_norm": 1.2431554794311523, "learning_rate": 2.4449229166823016e-08, "loss": 0.0523, "step": 2240 }, { "epoch": 19.915555555555557, "grad_norm": 0.572210967540741, "learning_rate": 7.2745673238006076e-09, "loss": 0.0537, "step": 2250 }, { "epoch": 20.0, "grad_norm": 1.5146510601043701, "learning_rate": 2.020760785648168e-10, "loss": 0.0445, "step": 2260 }, { "epoch": 20.0, "eval_loss": 0.5654152035713196, "eval_runtime": 22.8163, "eval_samples_per_second": 4.383, "eval_steps_per_second": 0.57, "step": 2260 } ], "logging_steps": 10, "max_steps": 2260, "num_input_tokens_seen": 0, "num_train_epochs": 20, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.67518433968128e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }