{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 150, "global_step": 2100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004761904761904762, "grad_norm": 138.4115447998047, "learning_rate": 3.4285714285714286e-07, "loss": 40.940005493164065, "step": 10 }, { "epoch": 0.009523809523809525, "grad_norm": 137.81439208984375, "learning_rate": 7.238095238095238e-07, "loss": 60.1491455078125, "step": 20 }, { "epoch": 0.014285714285714285, "grad_norm": 66.88855743408203, "learning_rate": 1.1047619047619047e-06, "loss": 41.3765869140625, "step": 30 }, { "epoch": 0.01904761904761905, "grad_norm": 61.619834899902344, "learning_rate": 1.4857142857142858e-06, "loss": 37.01522216796875, "step": 40 }, { "epoch": 0.023809523809523808, "grad_norm": 103.27572631835938, "learning_rate": 1.8666666666666667e-06, "loss": 33.547723388671876, "step": 50 }, { "epoch": 0.02857142857142857, "grad_norm": 70.52592468261719, "learning_rate": 2.2476190476190477e-06, "loss": 33.890313720703126, "step": 60 }, { "epoch": 0.03333333333333333, "grad_norm": 32.40092086791992, "learning_rate": 2.6285714285714286e-06, "loss": 32.475531005859374, "step": 70 }, { "epoch": 0.0380952380952381, "grad_norm": 48.953285217285156, "learning_rate": 3.0095238095238094e-06, "loss": 31.98614501953125, "step": 80 }, { "epoch": 0.04285714285714286, "grad_norm": 79.75335693359375, "learning_rate": 3.3904761904761903e-06, "loss": 30.443341064453126, "step": 90 }, { "epoch": 0.047619047619047616, "grad_norm": 58.47705841064453, "learning_rate": 3.771428571428571e-06, "loss": 32.29954833984375, "step": 100 }, { "epoch": 0.05238095238095238, "grad_norm": 33.17606735229492, "learning_rate": 3.999960323578798e-06, "loss": 32.247186279296876, "step": 110 }, { "epoch": 0.05714285714285714, "grad_norm": 40.67790985107422, "learning_rate": 3.999513981918989e-06, "loss": 32.20079040527344, "step": 120 }, { "epoch": 0.06190476190476191, "grad_norm": 45.4234619140625, "learning_rate": 3.998571814122654e-06, "loss": 30.031964111328126, "step": 130 }, { "epoch": 0.06666666666666667, "grad_norm": 60.951908111572266, "learning_rate": 3.997134053822277e-06, "loss": 29.55460205078125, "step": 140 }, { "epoch": 0.07142857142857142, "grad_norm": 63.76414489746094, "learning_rate": 3.995201057544064e-06, "loss": 28.688177490234374, "step": 150 }, { "epoch": 0.07142857142857142, "eval_accuracy": 0.043283464566929136, "eval_loss": 27.93197250366211, "eval_runtime": 24.8513, "eval_samples_per_second": 20.12, "eval_steps_per_second": 2.535, "step": 150 }, { "epoch": 0.0761904761904762, "grad_norm": 55.72420120239258, "learning_rate": 3.992773304619536e-06, "loss": 27.05469970703125, "step": 160 }, { "epoch": 0.08095238095238096, "grad_norm": 41.70425796508789, "learning_rate": 3.989851397066665e-06, "loss": 26.17386474609375, "step": 170 }, { "epoch": 0.08571428571428572, "grad_norm": 41.78767776489258, "learning_rate": 3.98643605944059e-06, "loss": 26.51021728515625, "step": 180 }, { "epoch": 0.09047619047619047, "grad_norm": 50.67561721801758, "learning_rate": 3.98252813865395e-06, "loss": 26.913729858398437, "step": 190 }, { "epoch": 0.09523809523809523, "grad_norm": 57.547393798828125, "learning_rate": 3.978128603766867e-06, "loss": 25.517425537109375, "step": 200 }, { "epoch": 0.1, "grad_norm": 26.557636260986328, "learning_rate": 3.97323854574665e-06, "loss": 24.818318176269532, "step": 210 }, { "epoch": 0.10476190476190476, "grad_norm": 45.89893341064453, "learning_rate": 3.967859177197259e-06, "loss": 24.499539184570313, "step": 220 }, { "epoch": 0.10952380952380952, "grad_norm": 76.51309967041016, "learning_rate": 3.961991832058617e-06, "loss": 23.831640625, "step": 230 }, { "epoch": 0.11428571428571428, "grad_norm": 36.89082336425781, "learning_rate": 3.955637965275824e-06, "loss": 23.571630859375, "step": 240 }, { "epoch": 0.11904761904761904, "grad_norm": 19.28327751159668, "learning_rate": 3.948799152438371e-06, "loss": 22.825534057617187, "step": 250 }, { "epoch": 0.12380952380952381, "grad_norm": 30.663532257080078, "learning_rate": 3.941477089389439e-06, "loss": 22.282626342773437, "step": 260 }, { "epoch": 0.12857142857142856, "grad_norm": 60.91099548339844, "learning_rate": 3.9336735918053705e-06, "loss": 22.1782470703125, "step": 270 }, { "epoch": 0.13333333333333333, "grad_norm": 68.26007843017578, "learning_rate": 3.92539059474543e-06, "loss": 22.209671020507812, "step": 280 }, { "epoch": 0.1380952380952381, "grad_norm": 24.719745635986328, "learning_rate": 3.916630152171965e-06, "loss": 21.11513671875, "step": 290 }, { "epoch": 0.14285714285714285, "grad_norm": 45.6879768371582, "learning_rate": 3.907394436441075e-06, "loss": 21.380886840820313, "step": 300 }, { "epoch": 0.14285714285714285, "eval_accuracy": 0.04578740157480315, "eval_loss": 21.396591186523438, "eval_runtime": 25.9922, "eval_samples_per_second": 19.237, "eval_steps_per_second": 2.424, "step": 300 }, { "epoch": 0.14761904761904762, "grad_norm": 59.79628372192383, "learning_rate": 3.897685737763927e-06, "loss": 21.495401000976564, "step": 310 }, { "epoch": 0.1523809523809524, "grad_norm": 52.11283874511719, "learning_rate": 3.887506463638843e-06, "loss": 21.374043273925782, "step": 320 }, { "epoch": 0.15714285714285714, "grad_norm": 17.035280227661133, "learning_rate": 3.876859138254304e-06, "loss": 20.709390258789064, "step": 330 }, { "epoch": 0.1619047619047619, "grad_norm": 47.00483322143555, "learning_rate": 3.865746401863021e-06, "loss": 20.654705810546876, "step": 340 }, { "epoch": 0.16666666666666666, "grad_norm": 47.759559631347656, "learning_rate": 3.854171010127219e-06, "loss": 20.17596435546875, "step": 350 }, { "epoch": 0.17142857142857143, "grad_norm": 47.72419738769531, "learning_rate": 3.842135833435311e-06, "loss": 20.0145751953125, "step": 360 }, { "epoch": 0.1761904761904762, "grad_norm": 51.43965148925781, "learning_rate": 3.829643856190115e-06, "loss": 20.162620544433594, "step": 370 }, { "epoch": 0.18095238095238095, "grad_norm": 77.80012512207031, "learning_rate": 3.8166981760688015e-06, "loss": 19.78917694091797, "step": 380 }, { "epoch": 0.18571428571428572, "grad_norm": 51.120635986328125, "learning_rate": 3.8033020032547535e-06, "loss": 19.7965087890625, "step": 390 }, { "epoch": 0.19047619047619047, "grad_norm": 35.47827911376953, "learning_rate": 3.7894586596415266e-06, "loss": 19.693804931640624, "step": 400 }, { "epoch": 0.19523809523809524, "grad_norm": 36.45315933227539, "learning_rate": 3.775171578009108e-06, "loss": 19.68980255126953, "step": 410 }, { "epoch": 0.2, "grad_norm": 19.75481605529785, "learning_rate": 3.7604443011726775e-06, "loss": 19.586700439453125, "step": 420 }, { "epoch": 0.20476190476190476, "grad_norm": 61.62051773071289, "learning_rate": 3.7452804811040844e-06, "loss": 19.429611206054688, "step": 430 }, { "epoch": 0.20952380952380953, "grad_norm": 20.707780838012695, "learning_rate": 3.7296838780262574e-06, "loss": 19.41503143310547, "step": 440 }, { "epoch": 0.21428571428571427, "grad_norm": 61.07346725463867, "learning_rate": 3.713658359480768e-06, "loss": 19.5462646484375, "step": 450 }, { "epoch": 0.21428571428571427, "eval_accuracy": 0.048236220472440944, "eval_loss": 18.801279067993164, "eval_runtime": 25.633, "eval_samples_per_second": 19.506, "eval_steps_per_second": 2.458, "step": 450 }, { "epoch": 0.21904761904761905, "grad_norm": 20.04033088684082, "learning_rate": 3.6972078993687815e-06, "loss": 18.968704223632812, "step": 460 }, { "epoch": 0.22380952380952382, "grad_norm": 65.65965270996094, "learning_rate": 3.680336576965642e-06, "loss": 18.938497924804686, "step": 470 }, { "epoch": 0.22857142857142856, "grad_norm": 48.90804672241211, "learning_rate": 3.663048575909311e-06, "loss": 18.844175720214842, "step": 480 }, { "epoch": 0.23333333333333334, "grad_norm": 17.749887466430664, "learning_rate": 3.645348183162947e-06, "loss": 18.766136169433594, "step": 490 }, { "epoch": 0.23809523809523808, "grad_norm": 43.13874435424805, "learning_rate": 3.627239787951847e-06, "loss": 18.34910888671875, "step": 500 }, { "epoch": 0.24285714285714285, "grad_norm": 29.883098602294922, "learning_rate": 3.608727880675036e-06, "loss": 18.39371337890625, "step": 510 }, { "epoch": 0.24761904761904763, "grad_norm": 23.2874698638916, "learning_rate": 3.58981705179177e-06, "loss": 18.52344207763672, "step": 520 }, { "epoch": 0.2523809523809524, "grad_norm": 28.679786682128906, "learning_rate": 3.570511990683222e-06, "loss": 18.389620971679687, "step": 530 }, { "epoch": 0.2571428571428571, "grad_norm": 39.36701965332031, "learning_rate": 3.550817484489643e-06, "loss": 18.337835693359374, "step": 540 }, { "epoch": 0.2619047619047619, "grad_norm": 14.972796440124512, "learning_rate": 3.5307384169232777e-06, "loss": 18.569638061523438, "step": 550 }, { "epoch": 0.26666666666666666, "grad_norm": 20.092327117919922, "learning_rate": 3.5102797670573345e-06, "loss": 18.32196044921875, "step": 560 }, { "epoch": 0.2714285714285714, "grad_norm": 42.83948516845703, "learning_rate": 3.4894466080913077e-06, "loss": 18.12080078125, "step": 570 }, { "epoch": 0.2761904761904762, "grad_norm": 150.76181030273438, "learning_rate": 3.4682441060929587e-06, "loss": 18.27479248046875, "step": 580 }, { "epoch": 0.28095238095238095, "grad_norm": 24.40485382080078, "learning_rate": 3.446677518717271e-06, "loss": 18.172178649902342, "step": 590 }, { "epoch": 0.2857142857142857, "grad_norm": 21.843042373657227, "learning_rate": 3.4247521939026897e-06, "loss": 17.919189453125, "step": 600 }, { "epoch": 0.2857142857142857, "eval_accuracy": 0.05248031496062992, "eval_loss": 17.725130081176758, "eval_runtime": 25.3949, "eval_samples_per_second": 19.689, "eval_steps_per_second": 2.481, "step": 600 }, { "epoch": 0.2904761904761905, "grad_norm": 20.064794540405273, "learning_rate": 3.4024735685449766e-06, "loss": 17.788371276855468, "step": 610 }, { "epoch": 0.29523809523809524, "grad_norm": 19.219192504882812, "learning_rate": 3.379847167149008e-06, "loss": 17.86636962890625, "step": 620 }, { "epoch": 0.3, "grad_norm": 23.365055084228516, "learning_rate": 3.3568786004588363e-06, "loss": 17.805162048339845, "step": 630 }, { "epoch": 0.3047619047619048, "grad_norm": 16.860742568969727, "learning_rate": 3.333573564066385e-06, "loss": 17.576748657226563, "step": 640 }, { "epoch": 0.30952380952380953, "grad_norm": 23.96249008178711, "learning_rate": 3.3099378369990875e-06, "loss": 17.694325256347657, "step": 650 }, { "epoch": 0.3142857142857143, "grad_norm": 16.125730514526367, "learning_rate": 3.285977280286845e-06, "loss": 17.539736938476562, "step": 660 }, { "epoch": 0.319047619047619, "grad_norm": 16.924381256103516, "learning_rate": 3.261697835508648e-06, "loss": 17.864358520507814, "step": 670 }, { "epoch": 0.3238095238095238, "grad_norm": 24.52809715270996, "learning_rate": 3.2371055233192185e-06, "loss": 17.447659301757813, "step": 680 }, { "epoch": 0.32857142857142857, "grad_norm": 24.08842658996582, "learning_rate": 3.2122064419560557e-06, "loss": 17.473863220214845, "step": 690 }, { "epoch": 0.3333333333333333, "grad_norm": 26.00309944152832, "learning_rate": 3.1870067657272295e-06, "loss": 17.199142456054688, "step": 700 }, { "epoch": 0.3380952380952381, "grad_norm": 29.389789581298828, "learning_rate": 3.1615127434803192e-06, "loss": 17.315379333496093, "step": 710 }, { "epoch": 0.34285714285714286, "grad_norm": 30.414424896240234, "learning_rate": 3.1357306970528665e-06, "loss": 17.431112670898436, "step": 720 }, { "epoch": 0.3476190476190476, "grad_norm": 32.14336395263672, "learning_rate": 3.1096670197047267e-06, "loss": 17.360943603515626, "step": 730 }, { "epoch": 0.3523809523809524, "grad_norm": 14.162923812866211, "learning_rate": 3.0833281745327123e-06, "loss": 17.168132019042968, "step": 740 }, { "epoch": 0.35714285714285715, "grad_norm": 21.957395553588867, "learning_rate": 3.056720692867918e-06, "loss": 17.510189819335938, "step": 750 }, { "epoch": 0.35714285714285715, "eval_accuracy": 0.057960629921259846, "eval_loss": 17.25590705871582, "eval_runtime": 25.9338, "eval_samples_per_second": 19.28, "eval_steps_per_second": 2.429, "step": 750 }, { "epoch": 0.3619047619047619, "grad_norm": 22.730085372924805, "learning_rate": 3.029851172656121e-06, "loss": 17.168865966796876, "step": 760 }, { "epoch": 0.36666666666666664, "grad_norm": 9.091358184814453, "learning_rate": 3.0027262768216716e-06, "loss": 17.32322540283203, "step": 770 }, { "epoch": 0.37142857142857144, "grad_norm": 46.21049118041992, "learning_rate": 2.9753527316152624e-06, "loss": 17.2936767578125, "step": 780 }, { "epoch": 0.3761904761904762, "grad_norm": 12.04414176940918, "learning_rate": 2.9477373249459973e-06, "loss": 17.235751342773437, "step": 790 }, { "epoch": 0.38095238095238093, "grad_norm": 43.7669563293457, "learning_rate": 2.919886904698173e-06, "loss": 17.19912109375, "step": 800 }, { "epoch": 0.38571428571428573, "grad_norm": 15.64034652709961, "learning_rate": 2.8918083770331857e-06, "loss": 17.119082641601562, "step": 810 }, { "epoch": 0.3904761904761905, "grad_norm": 15.29228401184082, "learning_rate": 2.8635087046769856e-06, "loss": 17.21935119628906, "step": 820 }, { "epoch": 0.3952380952380952, "grad_norm": 40.923484802246094, "learning_rate": 2.83499490519351e-06, "loss": 17.068731689453124, "step": 830 }, { "epoch": 0.4, "grad_norm": 18.847187042236328, "learning_rate": 2.8062740492445104e-06, "loss": 17.178439331054687, "step": 840 }, { "epoch": 0.40476190476190477, "grad_norm": 10.75904369354248, "learning_rate": 2.7773532588362205e-06, "loss": 17.27076873779297, "step": 850 }, { "epoch": 0.4095238095238095, "grad_norm": 22.709970474243164, "learning_rate": 2.748239705553287e-06, "loss": 17.397381591796876, "step": 860 }, { "epoch": 0.4142857142857143, "grad_norm": 22.443639755249023, "learning_rate": 2.718940608780408e-06, "loss": 17.009933471679688, "step": 870 }, { "epoch": 0.41904761904761906, "grad_norm": 9.636713027954102, "learning_rate": 2.6894632339121183e-06, "loss": 17.1143310546875, "step": 880 }, { "epoch": 0.4238095238095238, "grad_norm": 11.698447227478027, "learning_rate": 2.6598148905511656e-06, "loss": 17.266459655761718, "step": 890 }, { "epoch": 0.42857142857142855, "grad_norm": 34.808990478515625, "learning_rate": 2.6300029306959236e-06, "loss": 17.431172180175782, "step": 900 }, { "epoch": 0.42857142857142855, "eval_accuracy": 0.059070866141732285, "eval_loss": 16.987903594970703, "eval_runtime": 25.5466, "eval_samples_per_second": 19.572, "eval_steps_per_second": 2.466, "step": 900 }, { "epoch": 0.43333333333333335, "grad_norm": 9.677335739135742, "learning_rate": 2.600034746917292e-06, "loss": 17.079855346679686, "step": 910 }, { "epoch": 0.4380952380952381, "grad_norm": 24.325902938842773, "learning_rate": 2.569917770525538e-06, "loss": 16.793905639648436, "step": 920 }, { "epoch": 0.44285714285714284, "grad_norm": 32.768287658691406, "learning_rate": 2.539659469727526e-06, "loss": 17.420681762695313, "step": 930 }, { "epoch": 0.44761904761904764, "grad_norm": 11.458124160766602, "learning_rate": 2.509267347774807e-06, "loss": 17.01726837158203, "step": 940 }, { "epoch": 0.4523809523809524, "grad_norm": 47.37931442260742, "learning_rate": 2.478748941103006e-06, "loss": 16.992041015625, "step": 950 }, { "epoch": 0.45714285714285713, "grad_norm": 16.12019157409668, "learning_rate": 2.448111817462992e-06, "loss": 17.042259216308594, "step": 960 }, { "epoch": 0.46190476190476193, "grad_norm": 55.0360107421875, "learning_rate": 2.417363574044275e-06, "loss": 16.924298095703126, "step": 970 }, { "epoch": 0.4666666666666667, "grad_norm": 8.713092803955078, "learning_rate": 2.3865118355911064e-06, "loss": 16.67218780517578, "step": 980 }, { "epoch": 0.4714285714285714, "grad_norm": 30.71510887145996, "learning_rate": 2.355564252511746e-06, "loss": 16.627642822265624, "step": 990 }, { "epoch": 0.47619047619047616, "grad_norm": 11.165261268615723, "learning_rate": 2.3245284989813637e-06, "loss": 16.885775756835937, "step": 1000 }, { "epoch": 0.48095238095238096, "grad_norm": 33.494205474853516, "learning_rate": 2.293412271039051e-06, "loss": 16.8844970703125, "step": 1010 }, { "epoch": 0.4857142857142857, "grad_norm": 16.44525909423828, "learning_rate": 2.262223284679405e-06, "loss": 16.938031005859376, "step": 1020 }, { "epoch": 0.49047619047619045, "grad_norm": 56.29051208496094, "learning_rate": 2.2309692739391725e-06, "loss": 17.36894836425781, "step": 1030 }, { "epoch": 0.49523809523809526, "grad_norm": 18.217512130737305, "learning_rate": 2.1996579889794097e-06, "loss": 16.765081787109374, "step": 1040 }, { "epoch": 0.5, "grad_norm": 12.565701484680176, "learning_rate": 2.1682971941636525e-06, "loss": 17.061727905273436, "step": 1050 }, { "epoch": 0.5, "eval_accuracy": 0.06236220472440945, "eval_loss": 16.80004119873047, "eval_runtime": 25.3543, "eval_samples_per_second": 19.721, "eval_steps_per_second": 2.485, "step": 1050 }, { "epoch": 0.5047619047619047, "grad_norm": 7.379430770874023, "learning_rate": 2.1368946661325625e-06, "loss": 17.065571594238282, "step": 1060 }, { "epoch": 0.5095238095238095, "grad_norm": 33.2353515625, "learning_rate": 2.1054581918755225e-06, "loss": 16.781719970703126, "step": 1070 }, { "epoch": 0.5142857142857142, "grad_norm": 5.199227809906006, "learning_rate": 2.073995566799676e-06, "loss": 16.9568115234375, "step": 1080 }, { "epoch": 0.5190476190476191, "grad_norm": 21.680280685424805, "learning_rate": 2.042514592796871e-06, "loss": 16.72358856201172, "step": 1090 }, { "epoch": 0.5238095238095238, "grad_norm": 19.837730407714844, "learning_rate": 2.011023076309001e-06, "loss": 16.884307861328125, "step": 1100 }, { "epoch": 0.5285714285714286, "grad_norm": 12.718480110168457, "learning_rate": 1.979528826392213e-06, "loss": 16.639022827148438, "step": 1110 }, { "epoch": 0.5333333333333333, "grad_norm": 16.71331787109375, "learning_rate": 1.9480396527804736e-06, "loss": 16.607608032226562, "step": 1120 }, { "epoch": 0.5380952380952381, "grad_norm": 21.276140213012695, "learning_rate": 1.916563363948959e-06, "loss": 17.104000854492188, "step": 1130 }, { "epoch": 0.5428571428571428, "grad_norm": 22.885112762451172, "learning_rate": 1.8851077651777652e-06, "loss": 16.868312072753906, "step": 1140 }, { "epoch": 0.5476190476190477, "grad_norm": 38.87709426879883, "learning_rate": 1.8536806566164048e-06, "loss": 16.6172607421875, "step": 1150 }, { "epoch": 0.5523809523809524, "grad_norm": 20.984086990356445, "learning_rate": 1.8222898313495766e-06, "loss": 16.41285400390625, "step": 1160 }, { "epoch": 0.5571428571428572, "grad_norm": 18.480567932128906, "learning_rate": 1.7909430734646932e-06, "loss": 16.545147705078126, "step": 1170 }, { "epoch": 0.5619047619047619, "grad_norm": 10.486381530761719, "learning_rate": 1.7596481561216285e-06, "loss": 16.698062133789062, "step": 1180 }, { "epoch": 0.5666666666666667, "grad_norm": 28.246742248535156, "learning_rate": 1.7284128396251875e-06, "loss": 16.808547973632812, "step": 1190 }, { "epoch": 0.5714285714285714, "grad_norm": 14.525625228881836, "learning_rate": 1.6972448695007526e-06, "loss": 16.164341735839844, "step": 1200 }, { "epoch": 0.5714285714285714, "eval_accuracy": 0.05882677165354331, "eval_loss": 16.66090965270996, "eval_runtime": 25.3757, "eval_samples_per_second": 19.704, "eval_steps_per_second": 2.483, "step": 1200 }, { "epoch": 0.5761904761904761, "grad_norm": 16.894689559936523, "learning_rate": 1.6661519745736042e-06, "loss": 16.504466247558593, "step": 1210 }, { "epoch": 0.580952380952381, "grad_norm": 8.992559432983398, "learning_rate": 1.6351418650523748e-06, "loss": 17.111102294921874, "step": 1220 }, { "epoch": 0.5857142857142857, "grad_norm": 10.779234886169434, "learning_rate": 1.6042222306171245e-06, "loss": 16.793231201171874, "step": 1230 }, { "epoch": 0.5904761904761905, "grad_norm": 13.19653606414795, "learning_rate": 1.5734007385125066e-06, "loss": 16.616178894042967, "step": 1240 }, { "epoch": 0.5952380952380952, "grad_norm": 10.069211959838867, "learning_rate": 1.5426850316464914e-06, "loss": 16.469076538085936, "step": 1250 }, { "epoch": 0.6, "grad_norm": 11.769493103027344, "learning_rate": 1.5120827266951346e-06, "loss": 16.354193115234374, "step": 1260 }, { "epoch": 0.6047619047619047, "grad_norm": 18.091075897216797, "learning_rate": 1.4816014122138387e-06, "loss": 16.668800354003906, "step": 1270 }, { "epoch": 0.6095238095238096, "grad_norm": 40.2747802734375, "learning_rate": 1.4512486467555996e-06, "loss": 16.58080596923828, "step": 1280 }, { "epoch": 0.6142857142857143, "grad_norm": 38.875709533691406, "learning_rate": 1.4210319569966813e-06, "loss": 16.504058837890625, "step": 1290 }, { "epoch": 0.6190476190476191, "grad_norm": 20.455795288085938, "learning_rate": 1.3909588358702065e-06, "loss": 16.619796752929688, "step": 1300 }, { "epoch": 0.6238095238095238, "grad_norm": 26.14783477783203, "learning_rate": 1.3610367407081037e-06, "loss": 16.69707336425781, "step": 1310 }, { "epoch": 0.6285714285714286, "grad_norm": 12.17022705078125, "learning_rate": 1.3312730913918927e-06, "loss": 16.7201904296875, "step": 1320 }, { "epoch": 0.6333333333333333, "grad_norm": 13.315362930297852, "learning_rate": 1.3016752685127483e-06, "loss": 16.331112670898438, "step": 1330 }, { "epoch": 0.638095238095238, "grad_norm": 6.595879077911377, "learning_rate": 1.2722506115413118e-06, "loss": 16.394076538085937, "step": 1340 }, { "epoch": 0.6428571428571429, "grad_norm": 7.89982271194458, "learning_rate": 1.243006417007699e-06, "loss": 16.70445098876953, "step": 1350 }, { "epoch": 0.6428571428571429, "eval_accuracy": 0.06341732283464567, "eval_loss": 16.499183654785156, "eval_runtime": 25.1886, "eval_samples_per_second": 19.85, "eval_steps_per_second": 2.501, "step": 1350 }, { "epoch": 0.6476190476190476, "grad_norm": 9.356073379516602, "learning_rate": 1.2139499366921528e-06, "loss": 16.716755676269532, "step": 1360 }, { "epoch": 0.6523809523809524, "grad_norm": 13.010209083557129, "learning_rate": 1.185088375826799e-06, "loss": 17.275030517578124, "step": 1370 }, { "epoch": 0.6571428571428571, "grad_norm": 7.622005462646484, "learning_rate": 1.156428891308936e-06, "loss": 16.587196350097656, "step": 1380 }, { "epoch": 0.6619047619047619, "grad_norm": 11.086586952209473, "learning_rate": 1.1279785899263192e-06, "loss": 16.67912902832031, "step": 1390 }, { "epoch": 0.6666666666666666, "grad_norm": 22.962263107299805, "learning_rate": 1.099744526594867e-06, "loss": 16.530209350585938, "step": 1400 }, { "epoch": 0.6714285714285714, "grad_norm": 7.309661388397217, "learning_rate": 1.0717337026092269e-06, "loss": 16.585041809082032, "step": 1410 }, { "epoch": 0.6761904761904762, "grad_norm": 7.678780555725098, "learning_rate": 1.0439530639066418e-06, "loss": 16.243795776367186, "step": 1420 }, { "epoch": 0.680952380952381, "grad_norm": 38.843414306640625, "learning_rate": 1.0164094993445473e-06, "loss": 16.31683349609375, "step": 1430 }, { "epoch": 0.6857142857142857, "grad_norm": 8.149712562561035, "learning_rate": 9.891098389923132e-07, "loss": 16.380844116210938, "step": 1440 }, { "epoch": 0.6904761904761905, "grad_norm": 23.914464950561523, "learning_rate": 9.620608524375702e-07, "loss": 16.283917236328126, "step": 1450 }, { "epoch": 0.6952380952380952, "grad_norm": 17.59719467163086, "learning_rate": 9.352692471075336e-07, "loss": 16.381610107421874, "step": 1460 }, { "epoch": 0.7, "grad_norm": 56.93424606323242, "learning_rate": 9.087416666057417e-07, "loss": 17.249729919433594, "step": 1470 }, { "epoch": 0.7047619047619048, "grad_norm": 9.12337589263916, "learning_rate": 8.824846890646149e-07, "loss": 16.201866149902344, "step": 1480 }, { "epoch": 0.7095238095238096, "grad_norm": 10.127345085144043, "learning_rate": 8.565048255142577e-07, "loss": 16.494973754882814, "step": 1490 }, { "epoch": 0.7142857142857143, "grad_norm": 23.02049446105957, "learning_rate": 8.308085182678972e-07, "loss": 16.431625366210938, "step": 1500 }, { "epoch": 0.7142857142857143, "eval_accuracy": 0.06583464566929134, "eval_loss": 16.394376754760742, "eval_runtime": 25.1159, "eval_samples_per_second": 19.908, "eval_steps_per_second": 2.508, "step": 1500 }, { "epoch": 0.719047619047619, "grad_norm": 25.103525161743164, "learning_rate": 8.054021393243589e-07, "loss": 16.271298217773438, "step": 1510 }, { "epoch": 0.7238095238095238, "grad_norm": 20.621360778808594, "learning_rate": 7.80291988787982e-07, "loss": 16.023663330078126, "step": 1520 }, { "epoch": 0.7285714285714285, "grad_norm": 14.038392066955566, "learning_rate": 7.554842933063619e-07, "loss": 16.03165283203125, "step": 1530 }, { "epoch": 0.7333333333333333, "grad_norm": 11.327874183654785, "learning_rate": 7.30985204526309e-07, "loss": 16.745071411132812, "step": 1540 }, { "epoch": 0.7380952380952381, "grad_norm": 12.739700317382812, "learning_rate": 7.068007975684009e-07, "loss": 16.04017791748047, "step": 1550 }, { "epoch": 0.7428571428571429, "grad_norm": 9.787664413452148, "learning_rate": 6.829370695205175e-07, "loss": 16.20958251953125, "step": 1560 }, { "epoch": 0.7476190476190476, "grad_norm": 12.524157524108887, "learning_rate": 6.593999379507207e-07, "loss": 16.128921508789062, "step": 1570 }, { "epoch": 0.7523809523809524, "grad_norm": 6.589555263519287, "learning_rate": 6.3619523943986e-07, "loss": 16.84815368652344, "step": 1580 }, { "epoch": 0.7571428571428571, "grad_norm": 9.732259750366211, "learning_rate": 6.133287281342496e-07, "loss": 16.412393188476564, "step": 1590 }, { "epoch": 0.7619047619047619, "grad_norm": 13.840083122253418, "learning_rate": 5.908060743187979e-07, "loss": 16.528514099121093, "step": 1600 }, { "epoch": 0.7666666666666667, "grad_norm": 12.243499755859375, "learning_rate": 5.686328630109287e-07, "loss": 16.269061279296874, "step": 1610 }, { "epoch": 0.7714285714285715, "grad_norm": 12.514222145080566, "learning_rate": 5.468145925756424e-07, "loss": 16.259161376953124, "step": 1620 }, { "epoch": 0.7761904761904762, "grad_norm": 9.389951705932617, "learning_rate": 5.253566733620706e-07, "loss": 16.349365234375, "step": 1630 }, { "epoch": 0.780952380952381, "grad_norm": 36.1035041809082, "learning_rate": 5.042644263618525e-07, "loss": 16.16446533203125, "step": 1640 }, { "epoch": 0.7857142857142857, "grad_norm": 9.599213600158691, "learning_rate": 4.835430818896733e-07, "loss": 16.311676025390625, "step": 1650 }, { "epoch": 0.7857142857142857, "eval_accuracy": 0.06944881889763779, "eval_loss": 16.275449752807617, "eval_runtime": 26.1826, "eval_samples_per_second": 19.097, "eval_steps_per_second": 2.406, "step": 1650 }, { "epoch": 0.7904761904761904, "grad_norm": 8.050191879272461, "learning_rate": 4.6319777828628237e-07, "loss": 16.19422607421875, "step": 1660 }, { "epoch": 0.7952380952380952, "grad_norm": 15.81093692779541, "learning_rate": 4.432335606443234e-07, "loss": 16.439752197265626, "step": 1670 }, { "epoch": 0.8, "grad_norm": 16.138633728027344, "learning_rate": 4.236553795572875e-07, "loss": 16.333755493164062, "step": 1680 }, { "epoch": 0.8047619047619048, "grad_norm": 16.733367919921875, "learning_rate": 4.0446808989189485e-07, "loss": 16.334153747558595, "step": 1690 }, { "epoch": 0.8095238095238095, "grad_norm": 8.272436141967773, "learning_rate": 3.856764495842197e-07, "loss": 16.340499877929688, "step": 1700 }, { "epoch": 0.8142857142857143, "grad_norm": 34.05455017089844, "learning_rate": 3.6728511845984776e-07, "loss": 16.4441162109375, "step": 1710 }, { "epoch": 0.819047619047619, "grad_norm": 16.842851638793945, "learning_rate": 3.4929865707836535e-07, "loss": 16.022296142578124, "step": 1720 }, { "epoch": 0.8238095238095238, "grad_norm": 10.098868370056152, "learning_rate": 3.317215256024606e-07, "loss": 16.09764404296875, "step": 1730 }, { "epoch": 0.8285714285714286, "grad_norm": 8.483038902282715, "learning_rate": 3.1455808269192164e-07, "loss": 16.11446533203125, "step": 1740 }, { "epoch": 0.8333333333333334, "grad_norm": 10.998558044433594, "learning_rate": 2.9781258442280877e-07, "loss": 16.22391357421875, "step": 1750 }, { "epoch": 0.8380952380952381, "grad_norm": 10.043136596679688, "learning_rate": 2.814891832320565e-07, "loss": 16.850048828125, "step": 1760 }, { "epoch": 0.8428571428571429, "grad_norm": 13.000489234924316, "learning_rate": 2.6559192688778263e-07, "loss": 16.31856689453125, "step": 1770 }, { "epoch": 0.8476190476190476, "grad_norm": 11.428621292114258, "learning_rate": 2.5012475748554916e-07, "loss": 16.24926300048828, "step": 1780 }, { "epoch": 0.8523809523809524, "grad_norm": 21.403606414794922, "learning_rate": 2.3509151047082866e-07, "loss": 16.078160095214844, "step": 1790 }, { "epoch": 0.8571428571428571, "grad_norm": 9.761038780212402, "learning_rate": 2.2049591368791386e-07, "loss": 15.990585327148438, "step": 1800 }, { "epoch": 0.8571428571428571, "eval_accuracy": 0.0696771653543307, "eval_loss": 16.194637298583984, "eval_runtime": 25.3768, "eval_samples_per_second": 19.703, "eval_steps_per_second": 2.483, "step": 1800 }, { "epoch": 0.861904761904762, "grad_norm": 15.835714340209961, "learning_rate": 2.0634158645551358e-07, "loss": 16.231326293945312, "step": 1810 }, { "epoch": 0.8666666666666667, "grad_norm": 5.838013648986816, "learning_rate": 1.9263203866925725e-07, "loss": 16.3001220703125, "step": 1820 }, { "epoch": 0.8714285714285714, "grad_norm": 8.052929878234863, "learning_rate": 1.7937066993133553e-07, "loss": 16.139373779296875, "step": 1830 }, { "epoch": 0.8761904761904762, "grad_norm": 18.70516586303711, "learning_rate": 1.665607687074886e-07, "loss": 16.020474243164063, "step": 1840 }, { "epoch": 0.8809523809523809, "grad_norm": 17.08431053161621, "learning_rate": 1.5420551151155393e-07, "loss": 16.245944213867187, "step": 1850 }, { "epoch": 0.8857142857142857, "grad_norm": 17.282939910888672, "learning_rate": 1.4230796211777784e-07, "loss": 16.05218505859375, "step": 1860 }, { "epoch": 0.8904761904761904, "grad_norm": 13.214439392089844, "learning_rate": 1.3087107080107852e-07, "loss": 16.017184448242187, "step": 1870 }, { "epoch": 0.8952380952380953, "grad_norm": 22.98546600341797, "learning_rate": 1.1989767360545779e-07, "loss": 16.036334228515624, "step": 1880 }, { "epoch": 0.9, "grad_norm": 23.661928176879883, "learning_rate": 1.0939049164073777e-07, "loss": 15.678387451171876, "step": 1890 }, { "epoch": 0.9047619047619048, "grad_norm": 11.723611831665039, "learning_rate": 9.935213040779911e-08, "loss": 16.37012939453125, "step": 1900 }, { "epoch": 0.9095238095238095, "grad_norm": 21.208452224731445, "learning_rate": 8.978507915248434e-08, "loss": 16.12847900390625, "step": 1910 }, { "epoch": 0.9142857142857143, "grad_norm": 19.140209197998047, "learning_rate": 8.069171024833222e-08, "loss": 16.41150817871094, "step": 1920 }, { "epoch": 0.919047619047619, "grad_norm": 12.952860832214355, "learning_rate": 7.207427860829351e-08, "loss": 15.9720703125, "step": 1930 }, { "epoch": 0.9238095238095239, "grad_norm": 11.641100883483887, "learning_rate": 6.393492112557064e-08, "loss": 16.332427978515625, "step": 1940 }, { "epoch": 0.9285714285714286, "grad_norm": 10.129194259643555, "learning_rate": 5.627565614372653e-08, "loss": 16.232325744628906, "step": 1950 }, { "epoch": 0.9285714285714286, "eval_accuracy": 0.06559055118110237, "eval_loss": 16.09013557434082, "eval_runtime": 25.2262, "eval_samples_per_second": 19.821, "eval_steps_per_second": 2.497, "step": 1950 }, { "epoch": 0.9333333333333333, "grad_norm": 10.955820083618164, "learning_rate": 4.909838295618907e-08, "loss": 16.038211059570312, "step": 1960 }, { "epoch": 0.9380952380952381, "grad_norm": 10.441788673400879, "learning_rate": 4.2404881335276644e-08, "loss": 16.02879638671875, "step": 1970 }, { "epoch": 0.9428571428571428, "grad_norm": 9.26267147064209, "learning_rate": 3.619681109086237e-08, "loss": 15.950970458984376, "step": 1980 }, { "epoch": 0.9476190476190476, "grad_norm": 19.122802734375, "learning_rate": 3.0475711658785485e-08, "loss": 16.08349151611328, "step": 1990 }, { "epoch": 0.9523809523809523, "grad_norm": 18.312496185302734, "learning_rate": 2.5243001719111646e-08, "loss": 16.050738525390624, "step": 2000 }, { "epoch": 0.9571428571428572, "grad_norm": 11.455791473388672, "learning_rate": 2.049997884433985e-08, "loss": 16.05840606689453, "step": 2010 }, { "epoch": 0.9619047619047619, "grad_norm": 11.550554275512695, "learning_rate": 1.6247819177636735e-08, "loss": 16.087054443359374, "step": 2020 }, { "epoch": 0.9666666666666667, "grad_norm": 19.676589965820312, "learning_rate": 1.248757714118609e-08, "loss": 15.8768310546875, "step": 2030 }, { "epoch": 0.9714285714285714, "grad_norm": 9.593478202819824, "learning_rate": 9.220185174720453e-09, "loss": 16.02369079589844, "step": 2040 }, { "epoch": 0.9761904761904762, "grad_norm": 10.647096633911133, "learning_rate": 6.446453504299176e-09, "loss": 15.94654541015625, "step": 2050 }, { "epoch": 0.9809523809523809, "grad_norm": 6.6210713386535645, "learning_rate": 4.167069941395818e-09, "loss": 16.178671264648436, "step": 2060 }, { "epoch": 0.9857142857142858, "grad_norm": 11.91507339477539, "learning_rate": 2.38259971233834e-09, "loss": 15.88709716796875, "step": 2070 }, { "epoch": 0.9904761904761905, "grad_norm": 29.012462615966797, "learning_rate": 1.093485318147902e-09, "loss": 15.998876953125, "step": 2080 }, { "epoch": 0.9952380952380953, "grad_norm": 13.495532035827637, "learning_rate": 3.0004642481151755e-10, "loss": 15.837295532226562, "step": 2090 }, { "epoch": 1.0, "grad_norm": 10.239914894104004, "learning_rate": 2.4797840116885795e-12, "loss": 16.02972869873047, "step": 2100 }, { "epoch": 1.0, "eval_accuracy": 0.06144094488188977, "eval_loss": 16.065017700195312, "eval_runtime": 25.407, "eval_samples_per_second": 19.68, "eval_steps_per_second": 2.48, "step": 2100 } ], "logging_steps": 10, "max_steps": 2100, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }