{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 10.0, "eval_steps": 500, "global_step": 1690, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05917159763313609, "grad_norm": 2.13480806350708, "learning_rate": 0.0004973372781065089, "loss": 8.609089660644532, "step": 10 }, { "epoch": 0.11834319526627218, "grad_norm": 0.5722453594207764, "learning_rate": 0.0004943786982248521, "loss": 6.307852554321289, "step": 20 }, { "epoch": 0.17751479289940827, "grad_norm": 0.5311302542686462, "learning_rate": 0.0004914201183431953, "loss": 5.795976257324218, "step": 30 }, { "epoch": 0.23668639053254437, "grad_norm": 0.936571478843689, "learning_rate": 0.0004884615384615384, "loss": 5.6642906188964846, "step": 40 }, { "epoch": 0.2958579881656805, "grad_norm": 0.46537888050079346, "learning_rate": 0.0004855029585798817, "loss": 5.564136123657226, "step": 50 }, { "epoch": 0.35502958579881655, "grad_norm": 0.5137708783149719, "learning_rate": 0.00048254437869822486, "loss": 5.482704925537109, "step": 60 }, { "epoch": 0.41420118343195267, "grad_norm": 0.6558282971382141, "learning_rate": 0.00047958579881656805, "loss": 5.424795532226563, "step": 70 }, { "epoch": 0.47337278106508873, "grad_norm": 0.602185845375061, "learning_rate": 0.00047662721893491125, "loss": 5.312729263305664, "step": 80 }, { "epoch": 0.5325443786982249, "grad_norm": 0.49187108874320984, "learning_rate": 0.0004736686390532545, "loss": 5.2327423095703125, "step": 90 }, { "epoch": 0.591715976331361, "grad_norm": 0.5671802163124084, "learning_rate": 0.00047071005917159763, "loss": 5.180327224731445, "step": 100 }, { "epoch": 0.650887573964497, "grad_norm": 0.5761376619338989, "learning_rate": 0.0004677514792899408, "loss": 5.1113639831542965, "step": 110 }, { "epoch": 0.7100591715976331, "grad_norm": 0.6834049820899963, "learning_rate": 0.000464792899408284, "loss": 5.110577011108399, "step": 120 }, { "epoch": 0.7692307692307693, "grad_norm": 0.4934782385826111, "learning_rate": 0.00046183431952662727, "loss": 5.033809661865234, "step": 130 }, { "epoch": 0.8284023668639053, "grad_norm": 0.5475414395332336, "learning_rate": 0.0004588757396449704, "loss": 5.023288726806641, "step": 140 }, { "epoch": 0.8875739644970414, "grad_norm": 0.6682299971580505, "learning_rate": 0.0004559171597633136, "loss": 5.008454895019531, "step": 150 }, { "epoch": 0.9467455621301775, "grad_norm": 0.6575542092323303, "learning_rate": 0.00045295857988165685, "loss": 5.023602676391602, "step": 160 }, { "epoch": 1.0059171597633136, "grad_norm": 0.5498866438865662, "learning_rate": 0.00045000000000000004, "loss": 4.9478710174560545, "step": 170 }, { "epoch": 1.0650887573964498, "grad_norm": 0.5482797026634216, "learning_rate": 0.0004470414201183432, "loss": 4.826501083374024, "step": 180 }, { "epoch": 1.1242603550295858, "grad_norm": 0.473796546459198, "learning_rate": 0.0004440828402366864, "loss": 4.809365081787109, "step": 190 }, { "epoch": 1.183431952662722, "grad_norm": 0.5151321291923523, "learning_rate": 0.0004411242603550296, "loss": 4.864156723022461, "step": 200 }, { "epoch": 1.242603550295858, "grad_norm": 0.6074804663658142, "learning_rate": 0.0004381656804733728, "loss": 4.838579559326172, "step": 210 }, { "epoch": 1.301775147928994, "grad_norm": 0.5551325678825378, "learning_rate": 0.00043520710059171596, "loss": 4.841543579101563, "step": 220 }, { "epoch": 1.3609467455621302, "grad_norm": 0.566065788269043, "learning_rate": 0.00043224852071005915, "loss": 4.785538864135742, "step": 230 }, { "epoch": 1.4201183431952662, "grad_norm": 0.5819883942604065, "learning_rate": 0.0004292899408284024, "loss": 4.791210556030274, "step": 240 }, { "epoch": 1.4792899408284024, "grad_norm": 0.6059792637825012, "learning_rate": 0.0004263313609467456, "loss": 4.756925582885742, "step": 250 }, { "epoch": 1.5384615384615383, "grad_norm": 0.7058536410331726, "learning_rate": 0.00042337278106508873, "loss": 4.7325084686279295, "step": 260 }, { "epoch": 1.5976331360946747, "grad_norm": 0.5290840864181519, "learning_rate": 0.000420414201183432, "loss": 4.736005020141602, "step": 270 }, { "epoch": 1.6568047337278107, "grad_norm": 0.543929934501648, "learning_rate": 0.00041745562130177517, "loss": 4.721459197998047, "step": 280 }, { "epoch": 1.7159763313609466, "grad_norm": 0.587887704372406, "learning_rate": 0.00041449704142011837, "loss": 4.697582244873047, "step": 290 }, { "epoch": 1.7751479289940828, "grad_norm": 0.6189513802528381, "learning_rate": 0.0004115384615384615, "loss": 4.6849010467529295, "step": 300 }, { "epoch": 1.834319526627219, "grad_norm": 0.6452702879905701, "learning_rate": 0.00040857988165680475, "loss": 4.6623176574707035, "step": 310 }, { "epoch": 1.893491124260355, "grad_norm": 0.593474805355072, "learning_rate": 0.00040562130177514795, "loss": 4.680774688720703, "step": 320 }, { "epoch": 1.952662721893491, "grad_norm": 0.5981247425079346, "learning_rate": 0.00040266272189349114, "loss": 4.683719253540039, "step": 330 }, { "epoch": 2.0118343195266273, "grad_norm": 0.6405901312828064, "learning_rate": 0.0003997041420118343, "loss": 4.630902481079102, "step": 340 }, { "epoch": 2.0710059171597632, "grad_norm": 0.5495120286941528, "learning_rate": 0.0003967455621301775, "loss": 4.565330505371094, "step": 350 }, { "epoch": 2.1301775147928996, "grad_norm": 0.5600634813308716, "learning_rate": 0.0003937869822485207, "loss": 4.529523468017578, "step": 360 }, { "epoch": 2.1893491124260356, "grad_norm": 0.5625339150428772, "learning_rate": 0.0003908284023668639, "loss": 4.531766128540039, "step": 370 }, { "epoch": 2.2485207100591715, "grad_norm": 0.6504446864128113, "learning_rate": 0.00038786982248520716, "loss": 4.5285888671875, "step": 380 }, { "epoch": 2.3076923076923075, "grad_norm": 0.5576902627944946, "learning_rate": 0.0003849112426035503, "loss": 4.525382232666016, "step": 390 }, { "epoch": 2.366863905325444, "grad_norm": 0.4833173453807831, "learning_rate": 0.0003819526627218935, "loss": 4.554251480102539, "step": 400 }, { "epoch": 2.42603550295858, "grad_norm": 0.6758867502212524, "learning_rate": 0.0003789940828402367, "loss": 4.56910400390625, "step": 410 }, { "epoch": 2.485207100591716, "grad_norm": 0.6613295078277588, "learning_rate": 0.00037603550295857994, "loss": 4.526834487915039, "step": 420 }, { "epoch": 2.544378698224852, "grad_norm": 0.5260049104690552, "learning_rate": 0.0003730769230769231, "loss": 4.503446960449219, "step": 430 }, { "epoch": 2.603550295857988, "grad_norm": 0.60712069272995, "learning_rate": 0.00037011834319526627, "loss": 4.499971771240235, "step": 440 }, { "epoch": 2.662721893491124, "grad_norm": 0.5932305455207825, "learning_rate": 0.00036715976331360946, "loss": 4.478979873657226, "step": 450 }, { "epoch": 2.7218934911242605, "grad_norm": 0.6632292866706848, "learning_rate": 0.0003642011834319527, "loss": 4.521138763427734, "step": 460 }, { "epoch": 2.7810650887573964, "grad_norm": 0.6352905035018921, "learning_rate": 0.00036124260355029585, "loss": 4.520418930053711, "step": 470 }, { "epoch": 2.8402366863905324, "grad_norm": 0.5262125730514526, "learning_rate": 0.00035828402366863904, "loss": 4.479636764526367, "step": 480 }, { "epoch": 2.899408284023669, "grad_norm": 0.5989189147949219, "learning_rate": 0.0003553254437869823, "loss": 4.487276077270508, "step": 490 }, { "epoch": 2.9585798816568047, "grad_norm": 0.767411470413208, "learning_rate": 0.0003523668639053255, "loss": 4.505224227905273, "step": 500 }, { "epoch": 3.0177514792899407, "grad_norm": 0.5135788321495056, "learning_rate": 0.0003494082840236686, "loss": 4.422508621215821, "step": 510 }, { "epoch": 3.076923076923077, "grad_norm": 0.6293925046920776, "learning_rate": 0.0003464497041420118, "loss": 4.3678031921386715, "step": 520 }, { "epoch": 3.136094674556213, "grad_norm": 0.6665500998497009, "learning_rate": 0.00034349112426035507, "loss": 4.388924789428711, "step": 530 }, { "epoch": 3.195266272189349, "grad_norm": 0.5690398216247559, "learning_rate": 0.00034053254437869826, "loss": 4.389263153076172, "step": 540 }, { "epoch": 3.2544378698224854, "grad_norm": 0.6139602065086365, "learning_rate": 0.0003375739644970414, "loss": 4.390654754638672, "step": 550 }, { "epoch": 3.3136094674556213, "grad_norm": 0.5563338398933411, "learning_rate": 0.0003346153846153846, "loss": 4.337279510498047, "step": 560 }, { "epoch": 3.3727810650887573, "grad_norm": 0.5675852298736572, "learning_rate": 0.00033165680473372784, "loss": 4.345052337646484, "step": 570 }, { "epoch": 3.4319526627218933, "grad_norm": 0.5776380300521851, "learning_rate": 0.00032869822485207103, "loss": 4.363264846801758, "step": 580 }, { "epoch": 3.4911242603550297, "grad_norm": 0.6946626901626587, "learning_rate": 0.0003257396449704142, "loss": 4.355237579345703, "step": 590 }, { "epoch": 3.5502958579881656, "grad_norm": 0.6529305577278137, "learning_rate": 0.0003227810650887574, "loss": 4.337129211425781, "step": 600 }, { "epoch": 3.609467455621302, "grad_norm": 0.5602537989616394, "learning_rate": 0.0003198224852071006, "loss": 4.341841125488282, "step": 610 }, { "epoch": 3.668639053254438, "grad_norm": 0.5301386713981628, "learning_rate": 0.0003168639053254438, "loss": 4.362986755371094, "step": 620 }, { "epoch": 3.727810650887574, "grad_norm": 0.6010480523109436, "learning_rate": 0.00031390532544378695, "loss": 4.322038269042968, "step": 630 }, { "epoch": 3.78698224852071, "grad_norm": 0.6022279858589172, "learning_rate": 0.0003109467455621302, "loss": 4.359962844848633, "step": 640 }, { "epoch": 3.8461538461538463, "grad_norm": 0.56232088804245, "learning_rate": 0.0003079881656804734, "loss": 4.3375293731689455, "step": 650 }, { "epoch": 3.905325443786982, "grad_norm": 0.7015820741653442, "learning_rate": 0.0003050295857988166, "loss": 4.334150695800782, "step": 660 }, { "epoch": 3.9644970414201186, "grad_norm": 0.6077319383621216, "learning_rate": 0.0003020710059171597, "loss": 4.341176986694336, "step": 670 }, { "epoch": 4.023668639053255, "grad_norm": 0.773983359336853, "learning_rate": 0.00029911242603550297, "loss": 4.262639999389648, "step": 680 }, { "epoch": 4.0828402366863905, "grad_norm": 0.5960440635681152, "learning_rate": 0.00029615384615384616, "loss": 4.2081657409667965, "step": 690 }, { "epoch": 4.1420118343195265, "grad_norm": 0.5495953559875488, "learning_rate": 0.00029319526627218936, "loss": 4.228216171264648, "step": 700 }, { "epoch": 4.201183431952662, "grad_norm": 0.6150968074798584, "learning_rate": 0.0002902366863905325, "loss": 4.252474975585938, "step": 710 }, { "epoch": 4.260355029585799, "grad_norm": 0.7338055372238159, "learning_rate": 0.00028727810650887574, "loss": 4.226696395874024, "step": 720 }, { "epoch": 4.319526627218935, "grad_norm": 0.6750577092170715, "learning_rate": 0.00028431952662721894, "loss": 4.212493133544922, "step": 730 }, { "epoch": 4.378698224852071, "grad_norm": 0.6345236897468567, "learning_rate": 0.00028136094674556213, "loss": 4.218838500976562, "step": 740 }, { "epoch": 4.437869822485207, "grad_norm": 0.6776763200759888, "learning_rate": 0.0002784023668639054, "loss": 4.217085266113282, "step": 750 }, { "epoch": 4.497041420118343, "grad_norm": 0.6580626368522644, "learning_rate": 0.0002754437869822485, "loss": 4.237897491455078, "step": 760 }, { "epoch": 4.556213017751479, "grad_norm": 0.5971556305885315, "learning_rate": 0.0002724852071005917, "loss": 4.22449951171875, "step": 770 }, { "epoch": 4.615384615384615, "grad_norm": 0.6069461107254028, "learning_rate": 0.0002695266272189349, "loss": 4.191236877441407, "step": 780 }, { "epoch": 4.674556213017752, "grad_norm": 0.7110677361488342, "learning_rate": 0.00026656804733727815, "loss": 4.21960334777832, "step": 790 }, { "epoch": 4.733727810650888, "grad_norm": 0.6254327893257141, "learning_rate": 0.0002636094674556213, "loss": 4.211502456665039, "step": 800 }, { "epoch": 4.792899408284024, "grad_norm": 0.6190422773361206, "learning_rate": 0.0002606508875739645, "loss": 4.2044940948486325, "step": 810 }, { "epoch": 4.85207100591716, "grad_norm": 0.6811033487319946, "learning_rate": 0.0002576923076923077, "loss": 4.237732696533203, "step": 820 }, { "epoch": 4.911242603550296, "grad_norm": 0.5956006646156311, "learning_rate": 0.00025473372781065093, "loss": 4.215926742553711, "step": 830 }, { "epoch": 4.970414201183432, "grad_norm": 0.6755359172821045, "learning_rate": 0.00025177514792899407, "loss": 4.18463363647461, "step": 840 }, { "epoch": 5.029585798816568, "grad_norm": 0.6072905659675598, "learning_rate": 0.0002488165680473373, "loss": 4.154659271240234, "step": 850 }, { "epoch": 5.088757396449704, "grad_norm": 0.6316264271736145, "learning_rate": 0.00024585798816568045, "loss": 4.110084533691406, "step": 860 }, { "epoch": 5.14792899408284, "grad_norm": 0.5995630621910095, "learning_rate": 0.00024289940828402368, "loss": 4.094839477539063, "step": 870 }, { "epoch": 5.207100591715976, "grad_norm": 0.5662926435470581, "learning_rate": 0.00023994082840236687, "loss": 4.120201492309571, "step": 880 }, { "epoch": 5.266272189349112, "grad_norm": 0.5866499543190002, "learning_rate": 0.00023698224852071006, "loss": 4.091806411743164, "step": 890 }, { "epoch": 5.325443786982248, "grad_norm": 0.6538463830947876, "learning_rate": 0.00023402366863905326, "loss": 4.110548400878907, "step": 900 }, { "epoch": 5.384615384615385, "grad_norm": 0.7380921840667725, "learning_rate": 0.00023106508875739645, "loss": 4.089152145385742, "step": 910 }, { "epoch": 5.443786982248521, "grad_norm": 0.7094395756721497, "learning_rate": 0.00022810650887573964, "loss": 4.125375747680664, "step": 920 }, { "epoch": 5.502958579881657, "grad_norm": 0.6104142069816589, "learning_rate": 0.00022514792899408284, "loss": 4.108364105224609, "step": 930 }, { "epoch": 5.562130177514793, "grad_norm": 0.6437958478927612, "learning_rate": 0.00022218934911242606, "loss": 4.102787780761719, "step": 940 }, { "epoch": 5.621301775147929, "grad_norm": 0.6497628092765808, "learning_rate": 0.00021923076923076922, "loss": 4.098801803588867, "step": 950 }, { "epoch": 5.680473372781065, "grad_norm": 0.7420417666435242, "learning_rate": 0.00021627218934911244, "loss": 4.110585784912109, "step": 960 }, { "epoch": 5.739644970414201, "grad_norm": 0.6537092924118042, "learning_rate": 0.0002133136094674556, "loss": 4.079868316650391, "step": 970 }, { "epoch": 5.798816568047338, "grad_norm": 0.9173883199691772, "learning_rate": 0.00021035502958579883, "loss": 4.0837654113769535, "step": 980 }, { "epoch": 5.8579881656804735, "grad_norm": 0.6213467121124268, "learning_rate": 0.000207396449704142, "loss": 4.101559829711914, "step": 990 }, { "epoch": 5.9171597633136095, "grad_norm": 0.700158417224884, "learning_rate": 0.00020443786982248522, "loss": 4.107759475708008, "step": 1000 }, { "epoch": 5.976331360946745, "grad_norm": 0.7389625906944275, "learning_rate": 0.00020147928994082839, "loss": 4.045748901367188, "step": 1010 }, { "epoch": 6.035502958579881, "grad_norm": 0.629220724105835, "learning_rate": 0.0001985207100591716, "loss": 4.003813552856445, "step": 1020 }, { "epoch": 6.094674556213017, "grad_norm": 0.6587775349617004, "learning_rate": 0.00019556213017751477, "loss": 3.947599411010742, "step": 1030 }, { "epoch": 6.153846153846154, "grad_norm": 0.6797946691513062, "learning_rate": 0.000192603550295858, "loss": 3.9570587158203123, "step": 1040 }, { "epoch": 6.21301775147929, "grad_norm": 0.8000279068946838, "learning_rate": 0.00018964497041420121, "loss": 3.9946006774902343, "step": 1050 }, { "epoch": 6.272189349112426, "grad_norm": 0.7699520587921143, "learning_rate": 0.00018668639053254438, "loss": 3.9914344787597655, "step": 1060 }, { "epoch": 6.331360946745562, "grad_norm": 0.7474783062934875, "learning_rate": 0.0001837278106508876, "loss": 3.9896411895751953, "step": 1070 }, { "epoch": 6.390532544378698, "grad_norm": 0.6568964719772339, "learning_rate": 0.00018076923076923077, "loss": 3.9945484161376954, "step": 1080 }, { "epoch": 6.449704142011834, "grad_norm": 0.702962338924408, "learning_rate": 0.000177810650887574, "loss": 3.9896453857421874, "step": 1090 }, { "epoch": 6.508875739644971, "grad_norm": 0.8072907328605652, "learning_rate": 0.00017485207100591716, "loss": 3.9789073944091795, "step": 1100 }, { "epoch": 6.568047337278107, "grad_norm": 0.690667986869812, "learning_rate": 0.00017189349112426038, "loss": 3.9628318786621093, "step": 1110 }, { "epoch": 6.627218934911243, "grad_norm": 0.7332726716995239, "learning_rate": 0.00016893491124260354, "loss": 4.001555633544922, "step": 1120 }, { "epoch": 6.686390532544379, "grad_norm": 0.7399805784225464, "learning_rate": 0.00016597633136094676, "loss": 3.987625503540039, "step": 1130 }, { "epoch": 6.745562130177515, "grad_norm": 1.0256022214889526, "learning_rate": 0.00016301775147928993, "loss": 3.9571834564208985, "step": 1140 }, { "epoch": 6.804733727810651, "grad_norm": 0.7827850580215454, "learning_rate": 0.00016005917159763315, "loss": 3.9762195587158202, "step": 1150 }, { "epoch": 6.8639053254437865, "grad_norm": 0.7092675566673279, "learning_rate": 0.00015710059171597632, "loss": 3.9586578369140626, "step": 1160 }, { "epoch": 6.923076923076923, "grad_norm": 0.7039374709129333, "learning_rate": 0.00015414201183431954, "loss": 3.944875717163086, "step": 1170 }, { "epoch": 6.982248520710059, "grad_norm": 0.7573893070220947, "learning_rate": 0.00015118343195266273, "loss": 3.975397491455078, "step": 1180 }, { "epoch": 7.041420118343195, "grad_norm": 0.7940344214439392, "learning_rate": 0.00014822485207100592, "loss": 3.8859161376953124, "step": 1190 }, { "epoch": 7.100591715976331, "grad_norm": 0.8005825877189636, "learning_rate": 0.00014526627218934912, "loss": 3.8561363220214844, "step": 1200 }, { "epoch": 7.159763313609467, "grad_norm": 0.7510560750961304, "learning_rate": 0.0001423076923076923, "loss": 3.842996597290039, "step": 1210 }, { "epoch": 7.218934911242604, "grad_norm": 0.7474063038825989, "learning_rate": 0.0001393491124260355, "loss": 3.8655860900878904, "step": 1220 }, { "epoch": 7.27810650887574, "grad_norm": 0.7399153113365173, "learning_rate": 0.0001363905325443787, "loss": 3.8691051483154295, "step": 1230 }, { "epoch": 7.337278106508876, "grad_norm": 0.6961866021156311, "learning_rate": 0.0001334319526627219, "loss": 3.8814228057861326, "step": 1240 }, { "epoch": 7.396449704142012, "grad_norm": 0.7503266334533691, "learning_rate": 0.00013047337278106509, "loss": 3.860675811767578, "step": 1250 }, { "epoch": 7.455621301775148, "grad_norm": 0.7707279920578003, "learning_rate": 0.00012751479289940828, "loss": 3.8663909912109373, "step": 1260 }, { "epoch": 7.514792899408284, "grad_norm": 0.7248626947402954, "learning_rate": 0.00012455621301775147, "loss": 3.8687854766845704, "step": 1270 }, { "epoch": 7.57396449704142, "grad_norm": 0.7378124594688416, "learning_rate": 0.00012159763313609468, "loss": 3.853357696533203, "step": 1280 }, { "epoch": 7.633136094674557, "grad_norm": 0.7708460092544556, "learning_rate": 0.00011863905325443787, "loss": 3.8905601501464844, "step": 1290 }, { "epoch": 7.6923076923076925, "grad_norm": 0.6937795877456665, "learning_rate": 0.00011568047337278107, "loss": 3.87835578918457, "step": 1300 }, { "epoch": 7.7514792899408285, "grad_norm": 0.8977406620979309, "learning_rate": 0.00011272189349112426, "loss": 3.865726852416992, "step": 1310 }, { "epoch": 7.810650887573964, "grad_norm": 0.7240127921104431, "learning_rate": 0.00010976331360946746, "loss": 3.846134567260742, "step": 1320 }, { "epoch": 7.8698224852071, "grad_norm": 0.7820615768432617, "learning_rate": 0.00010680473372781065, "loss": 3.8235801696777343, "step": 1330 }, { "epoch": 7.928994082840236, "grad_norm": 0.7931578755378723, "learning_rate": 0.00010384615384615386, "loss": 3.852934646606445, "step": 1340 }, { "epoch": 7.988165680473373, "grad_norm": 0.7435231804847717, "learning_rate": 0.00010088757396449705, "loss": 3.8489166259765626, "step": 1350 }, { "epoch": 8.04733727810651, "grad_norm": 0.7691823244094849, "learning_rate": 9.792899408284024e-05, "loss": 3.794635009765625, "step": 1360 }, { "epoch": 8.106508875739644, "grad_norm": 0.885684609413147, "learning_rate": 9.497041420118344e-05, "loss": 3.787654495239258, "step": 1370 }, { "epoch": 8.165680473372781, "grad_norm": 0.8940234184265137, "learning_rate": 9.201183431952663e-05, "loss": 3.756052780151367, "step": 1380 }, { "epoch": 8.224852071005918, "grad_norm": 0.7225572466850281, "learning_rate": 8.905325443786982e-05, "loss": 3.724110412597656, "step": 1390 }, { "epoch": 8.284023668639053, "grad_norm": 0.792807936668396, "learning_rate": 8.609467455621302e-05, "loss": 3.75240478515625, "step": 1400 }, { "epoch": 8.34319526627219, "grad_norm": 0.8160039782524109, "learning_rate": 8.313609467455621e-05, "loss": 3.7542896270751953, "step": 1410 }, { "epoch": 8.402366863905325, "grad_norm": 0.715473473072052, "learning_rate": 8.01775147928994e-05, "loss": 3.817658233642578, "step": 1420 }, { "epoch": 8.461538461538462, "grad_norm": 0.8090062141418457, "learning_rate": 7.72189349112426e-05, "loss": 3.7604396820068358, "step": 1430 }, { "epoch": 8.520710059171599, "grad_norm": 0.726865828037262, "learning_rate": 7.426035502958579e-05, "loss": 3.7455059051513673, "step": 1440 }, { "epoch": 8.579881656804734, "grad_norm": 0.7755900621414185, "learning_rate": 7.1301775147929e-05, "loss": 3.7822811126708986, "step": 1450 }, { "epoch": 8.63905325443787, "grad_norm": 0.7525601983070374, "learning_rate": 6.834319526627219e-05, "loss": 3.7710426330566404, "step": 1460 }, { "epoch": 8.698224852071005, "grad_norm": 0.7370349764823914, "learning_rate": 6.538461538461539e-05, "loss": 3.7621829986572264, "step": 1470 }, { "epoch": 8.757396449704142, "grad_norm": 0.7664944529533386, "learning_rate": 6.242603550295858e-05, "loss": 3.7525020599365235, "step": 1480 }, { "epoch": 8.816568047337277, "grad_norm": 0.8167346119880676, "learning_rate": 5.946745562130178e-05, "loss": 3.7805561065673827, "step": 1490 }, { "epoch": 8.875739644970414, "grad_norm": 0.7823934555053711, "learning_rate": 5.6508875739644974e-05, "loss": 3.766466522216797, "step": 1500 }, { "epoch": 8.934911242603551, "grad_norm": 0.8203352093696594, "learning_rate": 5.355029585798817e-05, "loss": 3.7743297576904298, "step": 1510 }, { "epoch": 8.994082840236686, "grad_norm": 0.7480125427246094, "learning_rate": 5.059171597633136e-05, "loss": 3.7630767822265625, "step": 1520 }, { "epoch": 9.053254437869823, "grad_norm": 0.7367929220199585, "learning_rate": 4.763313609467456e-05, "loss": 3.7045642852783205, "step": 1530 }, { "epoch": 9.112426035502958, "grad_norm": 0.7291252017021179, "learning_rate": 4.4674556213017755e-05, "loss": 3.7382125854492188, "step": 1540 }, { "epoch": 9.171597633136095, "grad_norm": 0.7637320756912231, "learning_rate": 4.171597633136095e-05, "loss": 3.7042491912841795, "step": 1550 }, { "epoch": 9.23076923076923, "grad_norm": 0.7738555669784546, "learning_rate": 3.875739644970414e-05, "loss": 3.703077697753906, "step": 1560 }, { "epoch": 9.289940828402367, "grad_norm": 0.7595531940460205, "learning_rate": 3.5798816568047336e-05, "loss": 3.7166164398193358, "step": 1570 }, { "epoch": 9.349112426035504, "grad_norm": 0.7209826707839966, "learning_rate": 3.284023668639053e-05, "loss": 3.7272975921630858, "step": 1580 }, { "epoch": 9.408284023668639, "grad_norm": 0.7385886907577515, "learning_rate": 2.9881656804733726e-05, "loss": 3.710719680786133, "step": 1590 }, { "epoch": 9.467455621301776, "grad_norm": 0.7908353805541992, "learning_rate": 2.6923076923076927e-05, "loss": 3.7108623504638674, "step": 1600 }, { "epoch": 9.52662721893491, "grad_norm": 0.7293062210083008, "learning_rate": 2.396449704142012e-05, "loss": 3.6832290649414063, "step": 1610 }, { "epoch": 9.585798816568047, "grad_norm": 0.7990091443061829, "learning_rate": 2.1005917159763314e-05, "loss": 3.693344497680664, "step": 1620 }, { "epoch": 9.644970414201183, "grad_norm": 0.7727529406547546, "learning_rate": 1.804733727810651e-05, "loss": 3.704065704345703, "step": 1630 }, { "epoch": 9.70414201183432, "grad_norm": 0.7558280825614929, "learning_rate": 1.5088757396449705e-05, "loss": 3.701119232177734, "step": 1640 }, { "epoch": 9.763313609467456, "grad_norm": 0.7217801213264465, "learning_rate": 1.21301775147929e-05, "loss": 3.6759807586669924, "step": 1650 }, { "epoch": 9.822485207100591, "grad_norm": 0.7166690826416016, "learning_rate": 9.171597633136093e-06, "loss": 3.691928482055664, "step": 1660 }, { "epoch": 9.881656804733728, "grad_norm": 0.7086900472640991, "learning_rate": 6.2130177514792895e-06, "loss": 3.679682159423828, "step": 1670 }, { "epoch": 9.940828402366863, "grad_norm": 0.7332860827445984, "learning_rate": 3.2544378698224853e-06, "loss": 3.7041976928710936, "step": 1680 }, { "epoch": 10.0, "grad_norm": 0.7306056022644043, "learning_rate": 2.958579881656805e-07, "loss": 3.6652008056640626, "step": 1690 } ], "logging_steps": 10, "max_steps": 1690, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 999999, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1047519874252800.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }