{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.07864734299516908, "eval_steps": 500, "global_step": 2035, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0003864734299516908, "grad_norm": 67.77150678538916, "learning_rate": 2.910112359550562e-06, "loss": 1.7119647979736328, "step": 10 }, { "epoch": 0.0007729468599033816, "grad_norm": 112.20087349554393, "learning_rate": 3.921348314606742e-06, "loss": 1.0294610977172851, "step": 20 }, { "epoch": 0.0011594202898550724, "grad_norm": 17.998285122767445, "learning_rate": 4.932584269662922e-06, "loss": 0.9339380264282227, "step": 30 }, { "epoch": 0.0015458937198067632, "grad_norm": 44.13244966887987, "learning_rate": 5.943820224719102e-06, "loss": 0.8280322074890136, "step": 40 }, { "epoch": 0.001932367149758454, "grad_norm": 35.342167635210814, "learning_rate": 6.955056179775282e-06, "loss": 0.8310356140136719, "step": 50 }, { "epoch": 0.002318840579710145, "grad_norm": 13.961543042810325, "learning_rate": 7.966292134831462e-06, "loss": 0.8424642562866211, "step": 60 }, { "epoch": 0.002705314009661836, "grad_norm": 16.09056628824688, "learning_rate": 8.977528089887641e-06, "loss": 0.8591781616210937, "step": 70 }, { "epoch": 0.0030917874396135265, "grad_norm": 54.47103241018983, "learning_rate": 9.988764044943822e-06, "loss": 0.8048875808715821, "step": 80 }, { "epoch": 0.0034782608695652175, "grad_norm": 288.41808740691243, "learning_rate": 1.1000000000000001e-05, "loss": 0.7839107513427734, "step": 90 }, { "epoch": 0.003864734299516908, "grad_norm": 90.30364936720191, "learning_rate": 1.2011235955056182e-05, "loss": 0.8227674484252929, "step": 100 }, { "epoch": 0.004251207729468599, "grad_norm": 7.031443917093176, "learning_rate": 1.3022471910112362e-05, "loss": 0.8219305038452148, "step": 110 }, { "epoch": 0.00463768115942029, "grad_norm": 64.81590934958837, "learning_rate": 1.403370786516854e-05, "loss": 0.8873563766479492, "step": 120 }, { "epoch": 0.00502415458937198, "grad_norm": 7.4010759674397075, "learning_rate": 1.504494382022472e-05, "loss": 0.8595630645751953, "step": 130 }, { "epoch": 0.005410628019323672, "grad_norm": 19.21019328586394, "learning_rate": 1.60561797752809e-05, "loss": 0.8214578628540039, "step": 140 }, { "epoch": 0.005797101449275362, "grad_norm": 12.640756734713527, "learning_rate": 1.706741573033708e-05, "loss": 0.8313806533813477, "step": 150 }, { "epoch": 0.006183574879227053, "grad_norm": 30.722029453858426, "learning_rate": 1.8078651685393256e-05, "loss": 0.8253059387207031, "step": 160 }, { "epoch": 0.006570048309178744, "grad_norm": 9.610182761607462, "learning_rate": 1.908988764044944e-05, "loss": 0.8571659088134765, "step": 170 }, { "epoch": 0.006956521739130435, "grad_norm": 66.94480959155315, "learning_rate": 2e-05, "loss": 0.825499439239502, "step": 180 }, { "epoch": 0.007342995169082126, "grad_norm": 18.927988413767896, "learning_rate": 2e-05, "loss": 0.8307562828063965, "step": 190 }, { "epoch": 0.007729468599033816, "grad_norm": 12.259205440850302, "learning_rate": 2e-05, "loss": 0.8559392929077149, "step": 200 }, { "epoch": 0.008115942028985508, "grad_norm": 4.705925662053298, "learning_rate": 2e-05, "loss": 0.8608473777770996, "step": 210 }, { "epoch": 0.008502415458937198, "grad_norm": 2.301827055644639, "learning_rate": 2e-05, "loss": 0.8078425407409668, "step": 220 }, { "epoch": 0.008888888888888889, "grad_norm": 7.309011200551571, "learning_rate": 2e-05, "loss": 0.8398617744445801, "step": 230 }, { "epoch": 0.00927536231884058, "grad_norm": 6.173820350919054, "learning_rate": 2e-05, "loss": 0.8554814338684082, "step": 240 }, { "epoch": 0.00966183574879227, "grad_norm": 6.755722543096072, "learning_rate": 2e-05, "loss": 0.8236814498901367, "step": 250 }, { "epoch": 0.01004830917874396, "grad_norm": 8.495921320038692, "learning_rate": 2e-05, "loss": 0.8807731628417969, "step": 260 }, { "epoch": 0.010434782608695653, "grad_norm": 6.836865467270201, "learning_rate": 2e-05, "loss": 0.8989522933959961, "step": 270 }, { "epoch": 0.010821256038647344, "grad_norm": 14.122874054097522, "learning_rate": 2e-05, "loss": 0.8458233833312988, "step": 280 }, { "epoch": 0.011207729468599034, "grad_norm": 16.985124793104738, "learning_rate": 2e-05, "loss": 0.8226848602294922, "step": 290 }, { "epoch": 0.011594202898550725, "grad_norm": 41.65329788058193, "learning_rate": 2e-05, "loss": 0.8596689224243164, "step": 300 }, { "epoch": 0.011980676328502415, "grad_norm": 4.572131278336222, "learning_rate": 2e-05, "loss": 0.8586993217468262, "step": 310 }, { "epoch": 0.012367149758454106, "grad_norm": 15.52553197362288, "learning_rate": 2e-05, "loss": 0.8715810775756836, "step": 320 }, { "epoch": 0.012753623188405797, "grad_norm": 2.099292672310561, "learning_rate": 2e-05, "loss": 0.859681510925293, "step": 330 }, { "epoch": 0.013140096618357487, "grad_norm": 2.9884282294816904, "learning_rate": 2e-05, "loss": 0.8609855651855469, "step": 340 }, { "epoch": 0.01352657004830918, "grad_norm": 2.13249355879509, "learning_rate": 2e-05, "loss": 0.8378034591674804, "step": 350 }, { "epoch": 0.01391304347826087, "grad_norm": 1.6770141008927584, "learning_rate": 2e-05, "loss": 0.8262413024902344, "step": 360 }, { "epoch": 0.01429951690821256, "grad_norm": 4.682041458440538, "learning_rate": 2e-05, "loss": 0.8071828842163086, "step": 370 }, { "epoch": 0.014685990338164251, "grad_norm": 1.8513588195141903, "learning_rate": 2e-05, "loss": 0.7924742698669434, "step": 380 }, { "epoch": 0.015072463768115942, "grad_norm": 2.4641373360496774, "learning_rate": 2e-05, "loss": 0.8004615783691407, "step": 390 }, { "epoch": 0.015458937198067632, "grad_norm": 2.3004772602625914, "learning_rate": 2e-05, "loss": 0.7985801219940185, "step": 400 }, { "epoch": 0.015845410628019325, "grad_norm": 2.0543279811562636, "learning_rate": 2e-05, "loss": 0.8145970344543457, "step": 410 }, { "epoch": 0.016231884057971015, "grad_norm": 11.830783545012162, "learning_rate": 2e-05, "loss": 0.8268651962280273, "step": 420 }, { "epoch": 0.016618357487922706, "grad_norm": 23.315575489389328, "learning_rate": 2e-05, "loss": 0.8241431236267089, "step": 430 }, { "epoch": 0.017004830917874397, "grad_norm": 21.42157001872646, "learning_rate": 2e-05, "loss": 0.8197898864746094, "step": 440 }, { "epoch": 0.017391304347826087, "grad_norm": 6.089448482941218, "learning_rate": 2e-05, "loss": 0.799440574645996, "step": 450 }, { "epoch": 0.017777777777777778, "grad_norm": 2.0297328988872207, "learning_rate": 2e-05, "loss": 0.7915650844573975, "step": 460 }, { "epoch": 0.01816425120772947, "grad_norm": 2.5804977642175406, "learning_rate": 2e-05, "loss": 0.8292923927307129, "step": 470 }, { "epoch": 0.01855072463768116, "grad_norm": 2.038221241470096, "learning_rate": 2e-05, "loss": 0.8466601371765137, "step": 480 }, { "epoch": 0.01893719806763285, "grad_norm": 2.6279678065101404, "learning_rate": 2e-05, "loss": 0.7829755306243896, "step": 490 }, { "epoch": 0.01932367149758454, "grad_norm": 3.6287666464295207, "learning_rate": 2e-05, "loss": 0.8295025825500488, "step": 500 }, { "epoch": 0.01971014492753623, "grad_norm": 5.056996216526932, "learning_rate": 2e-05, "loss": 0.8213679313659668, "step": 510 }, { "epoch": 0.02009661835748792, "grad_norm": 3.2319172805464556, "learning_rate": 2e-05, "loss": 0.8206055641174317, "step": 520 }, { "epoch": 0.020483091787439612, "grad_norm": 8.57107033721087, "learning_rate": 2e-05, "loss": 0.8187108039855957, "step": 530 }, { "epoch": 0.020869565217391306, "grad_norm": 2.3249597398057866, "learning_rate": 2e-05, "loss": 0.8607352256774903, "step": 540 }, { "epoch": 0.021256038647342997, "grad_norm": 4.207073762673164, "learning_rate": 2e-05, "loss": 0.803462028503418, "step": 550 }, { "epoch": 0.021642512077294687, "grad_norm": 2.16004233284329, "learning_rate": 2e-05, "loss": 0.8118793487548828, "step": 560 }, { "epoch": 0.022028985507246378, "grad_norm": 5.922676764922052, "learning_rate": 2e-05, "loss": 0.8660179138183594, "step": 570 }, { "epoch": 0.02241545893719807, "grad_norm": 2.8910298488294783, "learning_rate": 2e-05, "loss": 0.8383306503295899, "step": 580 }, { "epoch": 0.02280193236714976, "grad_norm": 10.435855529697001, "learning_rate": 2e-05, "loss": 0.8274753570556641, "step": 590 }, { "epoch": 0.02318840579710145, "grad_norm": 5.716952677601055, "learning_rate": 2e-05, "loss": 0.8341848373413085, "step": 600 }, { "epoch": 0.02357487922705314, "grad_norm": 1.7990410820641871, "learning_rate": 2e-05, "loss": 0.8170646667480469, "step": 610 }, { "epoch": 0.02396135265700483, "grad_norm": 2.5141846970054984, "learning_rate": 2e-05, "loss": 0.8089756965637207, "step": 620 }, { "epoch": 0.02434782608695652, "grad_norm": 1.644941789727098, "learning_rate": 2e-05, "loss": 0.7915188789367675, "step": 630 }, { "epoch": 0.024734299516908212, "grad_norm": 4.69436608310746, "learning_rate": 2e-05, "loss": 0.8204584121704102, "step": 640 }, { "epoch": 0.025120772946859903, "grad_norm": 14.985321654813715, "learning_rate": 2e-05, "loss": 0.8408443450927734, "step": 650 }, { "epoch": 0.025507246376811593, "grad_norm": 3.606103990135419, "learning_rate": 2e-05, "loss": 0.8335097312927247, "step": 660 }, { "epoch": 0.025893719806763284, "grad_norm": 302.2907667494139, "learning_rate": 2e-05, "loss": 0.8303115844726563, "step": 670 }, { "epoch": 0.026280193236714974, "grad_norm": 5.094641064796761, "learning_rate": 2e-05, "loss": 0.8183450698852539, "step": 680 }, { "epoch": 0.02666666666666667, "grad_norm": 7.71531360876406, "learning_rate": 2e-05, "loss": 0.8168371200561524, "step": 690 }, { "epoch": 0.02705314009661836, "grad_norm": 27.557957472594705, "learning_rate": 2e-05, "loss": 0.8344195365905762, "step": 700 }, { "epoch": 0.02743961352657005, "grad_norm": 6.340736949473045, "learning_rate": 2e-05, "loss": 0.8478621482849121, "step": 710 }, { "epoch": 0.02782608695652174, "grad_norm": 84.49603950900422, "learning_rate": 2e-05, "loss": 0.8494409561157227, "step": 720 }, { "epoch": 0.02821256038647343, "grad_norm": 5.239994048119582, "learning_rate": 2e-05, "loss": 0.8430055618286133, "step": 730 }, { "epoch": 0.02859903381642512, "grad_norm": 6.81571454851921, "learning_rate": 2e-05, "loss": 0.8379552841186524, "step": 740 }, { "epoch": 0.028985507246376812, "grad_norm": 13.230544669517375, "learning_rate": 2e-05, "loss": 0.8137977600097657, "step": 750 }, { "epoch": 0.029371980676328503, "grad_norm": 10.83917272801397, "learning_rate": 2e-05, "loss": 0.8010368347167969, "step": 760 }, { "epoch": 0.029758454106280193, "grad_norm": 4.561007311907072, "learning_rate": 2e-05, "loss": 0.8132765769958497, "step": 770 }, { "epoch": 0.030144927536231884, "grad_norm": 5.052478275742948, "learning_rate": 2e-05, "loss": 0.8024440765380859, "step": 780 }, { "epoch": 0.030531400966183574, "grad_norm": 39.20779782791551, "learning_rate": 2e-05, "loss": 0.8082746505737305, "step": 790 }, { "epoch": 0.030917874396135265, "grad_norm": 6.722990812199062, "learning_rate": 2e-05, "loss": 0.7964837551116943, "step": 800 }, { "epoch": 0.03130434782608696, "grad_norm": 6.263608751717215, "learning_rate": 2e-05, "loss": 0.8117972373962402, "step": 810 }, { "epoch": 0.03169082125603865, "grad_norm": 6.362861042949148, "learning_rate": 2e-05, "loss": 0.8188319206237793, "step": 820 }, { "epoch": 0.03207729468599034, "grad_norm": 6.379235603582932, "learning_rate": 2e-05, "loss": 0.7999361991882324, "step": 830 }, { "epoch": 0.03246376811594203, "grad_norm": 7.771520162515829, "learning_rate": 2e-05, "loss": 0.8278095245361328, "step": 840 }, { "epoch": 0.03285024154589372, "grad_norm": 3.6283672901509307, "learning_rate": 2e-05, "loss": 0.8165772438049317, "step": 850 }, { "epoch": 0.03323671497584541, "grad_norm": 24.13531059310475, "learning_rate": 2e-05, "loss": 0.8282254219055176, "step": 860 }, { "epoch": 0.0336231884057971, "grad_norm": 6.38211185754252, "learning_rate": 2e-05, "loss": 0.857562255859375, "step": 870 }, { "epoch": 0.03400966183574879, "grad_norm": 8.151353292941916, "learning_rate": 2e-05, "loss": 0.8778319358825684, "step": 880 }, { "epoch": 0.034396135265700484, "grad_norm": 2.6425732312042793, "learning_rate": 2e-05, "loss": 0.8224431991577148, "step": 890 }, { "epoch": 0.034782608695652174, "grad_norm": 3.5769751025573835, "learning_rate": 2e-05, "loss": 0.8090167999267578, "step": 900 }, { "epoch": 0.035169082125603865, "grad_norm": 4.710064964796984, "learning_rate": 2e-05, "loss": 0.7755887508392334, "step": 910 }, { "epoch": 0.035555555555555556, "grad_norm": 2.85171049842582, "learning_rate": 2e-05, "loss": 0.80325927734375, "step": 920 }, { "epoch": 0.035942028985507246, "grad_norm": 2.7025040213443625, "learning_rate": 2e-05, "loss": 0.8224540710449219, "step": 930 }, { "epoch": 0.03632850241545894, "grad_norm": 4.365935909605305, "learning_rate": 2e-05, "loss": 0.8001300811767578, "step": 940 }, { "epoch": 0.03671497584541063, "grad_norm": 4.205991130813683, "learning_rate": 2e-05, "loss": 0.8388648986816406, "step": 950 }, { "epoch": 0.03710144927536232, "grad_norm": 9.511180584595577, "learning_rate": 2e-05, "loss": 0.8006820678710938, "step": 960 }, { "epoch": 0.03748792270531401, "grad_norm": 1.8991371909927346, "learning_rate": 2e-05, "loss": 0.7927989959716797, "step": 970 }, { "epoch": 0.0378743961352657, "grad_norm": 1.7204963535857005, "learning_rate": 2e-05, "loss": 0.7866291046142578, "step": 980 }, { "epoch": 0.03826086956521739, "grad_norm": 4.982975467165141, "learning_rate": 2e-05, "loss": 0.8541565895080566, "step": 990 }, { "epoch": 0.03864734299516908, "grad_norm": 1.4823804814569383, "learning_rate": 2e-05, "loss": 0.7768624782562256, "step": 1000 }, { "epoch": 0.03903381642512077, "grad_norm": 1.6741186213295625, "learning_rate": 2e-05, "loss": 0.7901049613952636, "step": 1010 }, { "epoch": 0.03942028985507246, "grad_norm": 2.4322679920118455, "learning_rate": 2e-05, "loss": 0.7638983726501465, "step": 1020 }, { "epoch": 0.03980676328502415, "grad_norm": 3.3701720746584383, "learning_rate": 2e-05, "loss": 0.7828890800476074, "step": 1030 }, { "epoch": 0.04019323671497584, "grad_norm": 2.0742844849026607, "learning_rate": 2e-05, "loss": 0.8018475532531738, "step": 1040 }, { "epoch": 0.04057971014492753, "grad_norm": 2.1569898099072904, "learning_rate": 2e-05, "loss": 0.7848191738128663, "step": 1050 }, { "epoch": 0.040966183574879224, "grad_norm": 1.3882337646082599, "learning_rate": 2e-05, "loss": 0.7792089462280274, "step": 1060 }, { "epoch": 0.041352657004830914, "grad_norm": 2.662094444417472, "learning_rate": 2e-05, "loss": 0.793889045715332, "step": 1070 }, { "epoch": 0.04173913043478261, "grad_norm": 2.587246330505362, "learning_rate": 2e-05, "loss": 0.7864011287689209, "step": 1080 }, { "epoch": 0.0421256038647343, "grad_norm": 1.0896303438627253, "learning_rate": 2e-05, "loss": 0.7887033462524414, "step": 1090 }, { "epoch": 0.04251207729468599, "grad_norm": 1.6180241575772059, "learning_rate": 2e-05, "loss": 0.7555316925048828, "step": 1100 }, { "epoch": 0.042898550724637684, "grad_norm": 5.15524054228135, "learning_rate": 2e-05, "loss": 0.7596688747406006, "step": 1110 }, { "epoch": 0.043285024154589374, "grad_norm": 3.791811827235934, "learning_rate": 2e-05, "loss": 0.7762317180633544, "step": 1120 }, { "epoch": 0.043671497584541065, "grad_norm": 3.8840676386572754, "learning_rate": 2e-05, "loss": 0.7993937492370605, "step": 1130 }, { "epoch": 0.044057971014492756, "grad_norm": 1.7203756023551415, "learning_rate": 2e-05, "loss": 0.8044867515563965, "step": 1140 }, { "epoch": 0.044444444444444446, "grad_norm": 1.8455815673442082, "learning_rate": 2e-05, "loss": 0.7740165710449218, "step": 1150 }, { "epoch": 0.04483091787439614, "grad_norm": 1.2497425235654502, "learning_rate": 2e-05, "loss": 0.7792739868164062, "step": 1160 }, { "epoch": 0.04521739130434783, "grad_norm": 3.582519109266027, "learning_rate": 2e-05, "loss": 0.7844886302947998, "step": 1170 }, { "epoch": 0.04560386473429952, "grad_norm": 1.7447476237477404, "learning_rate": 2e-05, "loss": 0.7678474426269531, "step": 1180 }, { "epoch": 0.04599033816425121, "grad_norm": 2.3052344816348285, "learning_rate": 2e-05, "loss": 0.7841787338256836, "step": 1190 }, { "epoch": 0.0463768115942029, "grad_norm": 6.171873978979098, "learning_rate": 2e-05, "loss": 0.7667727470397949, "step": 1200 }, { "epoch": 0.04676328502415459, "grad_norm": 2.5238752863132166, "learning_rate": 2e-05, "loss": 0.7614020824432373, "step": 1210 }, { "epoch": 0.04714975845410628, "grad_norm": 3.3006024749410345, "learning_rate": 2e-05, "loss": 0.7787034988403321, "step": 1220 }, { "epoch": 0.04753623188405797, "grad_norm": 1.7800834333389988, "learning_rate": 2e-05, "loss": 0.781245756149292, "step": 1230 }, { "epoch": 0.04792270531400966, "grad_norm": 4.086703804045758, "learning_rate": 2e-05, "loss": 0.7704942226409912, "step": 1240 }, { "epoch": 0.04830917874396135, "grad_norm": 1.8232412748458093, "learning_rate": 2e-05, "loss": 0.830727481842041, "step": 1250 }, { "epoch": 0.04869565217391304, "grad_norm": 1.438606233505821, "learning_rate": 2e-05, "loss": 0.7969734191894531, "step": 1260 }, { "epoch": 0.04908212560386473, "grad_norm": 14.874207481468607, "learning_rate": 2e-05, "loss": 0.7737374305725098, "step": 1270 }, { "epoch": 0.049468599033816424, "grad_norm": 1.8577472378752176, "learning_rate": 2e-05, "loss": 0.7808979034423829, "step": 1280 }, { "epoch": 0.049855072463768114, "grad_norm": 1.1647916231280007, "learning_rate": 2e-05, "loss": 0.7798149108886718, "step": 1290 }, { "epoch": 0.050241545893719805, "grad_norm": 1.8949891297132515, "learning_rate": 2e-05, "loss": 0.7773360252380371, "step": 1300 }, { "epoch": 0.050628019323671496, "grad_norm": 1.8051946173023403, "learning_rate": 2e-05, "loss": 0.7962361812591553, "step": 1310 }, { "epoch": 0.051014492753623186, "grad_norm": 8.517857032168914, "learning_rate": 2e-05, "loss": 0.7579530715942383, "step": 1320 }, { "epoch": 0.05140096618357488, "grad_norm": 1.2056710567353992, "learning_rate": 2e-05, "loss": 0.7956658840179444, "step": 1330 }, { "epoch": 0.05178743961352657, "grad_norm": 1.5620096177153822, "learning_rate": 2e-05, "loss": 0.7909909248352051, "step": 1340 }, { "epoch": 0.05217391304347826, "grad_norm": 1.2051599267987412, "learning_rate": 2e-05, "loss": 0.802952766418457, "step": 1350 }, { "epoch": 0.05256038647342995, "grad_norm": 1.442909003316718, "learning_rate": 2e-05, "loss": 0.792842435836792, "step": 1360 }, { "epoch": 0.05294685990338164, "grad_norm": 1.8033837673657727, "learning_rate": 2e-05, "loss": 0.8045886039733887, "step": 1370 }, { "epoch": 0.05333333333333334, "grad_norm": 1.7301184849803795, "learning_rate": 2e-05, "loss": 0.7730770111083984, "step": 1380 }, { "epoch": 0.05371980676328503, "grad_norm": 2.593314064685021, "learning_rate": 2e-05, "loss": 0.7898385524749756, "step": 1390 }, { "epoch": 0.05410628019323672, "grad_norm": 2.6612126149781123, "learning_rate": 2e-05, "loss": 0.7972373008728028, "step": 1400 }, { "epoch": 0.05449275362318841, "grad_norm": 4.014591492016486, "learning_rate": 2e-05, "loss": 0.7940009593963623, "step": 1410 }, { "epoch": 0.0548792270531401, "grad_norm": 1.88666817691601, "learning_rate": 2e-05, "loss": 0.7976803779602051, "step": 1420 }, { "epoch": 0.05526570048309179, "grad_norm": 1.6808638117085843, "learning_rate": 2e-05, "loss": 0.7751292228698731, "step": 1430 }, { "epoch": 0.05565217391304348, "grad_norm": 2.8607658596215573, "learning_rate": 2e-05, "loss": 0.7797608375549316, "step": 1440 }, { "epoch": 0.05603864734299517, "grad_norm": 1.743259772518007, "learning_rate": 2e-05, "loss": 0.7893115520477295, "step": 1450 }, { "epoch": 0.05642512077294686, "grad_norm": 4.094105063418816, "learning_rate": 2e-05, "loss": 0.7623452186584473, "step": 1460 }, { "epoch": 0.05681159420289855, "grad_norm": 1.0326374629324264, "learning_rate": 2e-05, "loss": 0.8003641128540039, "step": 1470 }, { "epoch": 0.05719806763285024, "grad_norm": 1.5470981584627885, "learning_rate": 2e-05, "loss": 0.7471415519714355, "step": 1480 }, { "epoch": 0.05758454106280193, "grad_norm": 4.233012132760419, "learning_rate": 2e-05, "loss": 0.8017045974731445, "step": 1490 }, { "epoch": 0.057971014492753624, "grad_norm": 1.5670919578440439, "learning_rate": 2e-05, "loss": 0.7809749603271484, "step": 1500 }, { "epoch": 0.058357487922705314, "grad_norm": 1.1146358925152047, "learning_rate": 2e-05, "loss": 0.8092234611511231, "step": 1510 }, { "epoch": 0.058743961352657005, "grad_norm": 1.8519058887339446, "learning_rate": 2e-05, "loss": 0.7762881755828858, "step": 1520 }, { "epoch": 0.059130434782608696, "grad_norm": 1.842244630499373, "learning_rate": 2e-05, "loss": 0.7717338085174561, "step": 1530 }, { "epoch": 0.059516908212560386, "grad_norm": 1.8659924669555197, "learning_rate": 2e-05, "loss": 0.8045551300048828, "step": 1540 }, { "epoch": 0.05990338164251208, "grad_norm": 1.789268515534286, "learning_rate": 2e-05, "loss": 0.802666187286377, "step": 1550 }, { "epoch": 0.06028985507246377, "grad_norm": 3.049390694136811, "learning_rate": 2e-05, "loss": 0.7977540493011475, "step": 1560 }, { "epoch": 0.06067632850241546, "grad_norm": 1.1550233137997092, "learning_rate": 2e-05, "loss": 0.759410810470581, "step": 1570 }, { "epoch": 0.06106280193236715, "grad_norm": 1.4840972042589198, "learning_rate": 2e-05, "loss": 0.7568341255187988, "step": 1580 }, { "epoch": 0.06144927536231884, "grad_norm": 2.4324918941876517, "learning_rate": 2e-05, "loss": 0.7721347808837891, "step": 1590 }, { "epoch": 0.06183574879227053, "grad_norm": 1.3236007075392429, "learning_rate": 2e-05, "loss": 0.7291332244873047, "step": 1600 }, { "epoch": 0.06222222222222222, "grad_norm": 1.8825475500130031, "learning_rate": 2e-05, "loss": 0.7765389919281006, "step": 1610 }, { "epoch": 0.06260869565217392, "grad_norm": 1.5021722283739194, "learning_rate": 2e-05, "loss": 0.7942019939422608, "step": 1620 }, { "epoch": 0.0629951690821256, "grad_norm": 1.3488892169893916, "learning_rate": 2e-05, "loss": 0.7698382377624512, "step": 1630 }, { "epoch": 0.0633816425120773, "grad_norm": 2.412898234110765, "learning_rate": 2e-05, "loss": 0.7915114402770996, "step": 1640 }, { "epoch": 0.06376811594202898, "grad_norm": 4.032177721449734, "learning_rate": 2e-05, "loss": 0.767926549911499, "step": 1650 }, { "epoch": 0.06415458937198068, "grad_norm": 3.3886389099102976, "learning_rate": 2e-05, "loss": 0.7934833526611328, "step": 1660 }, { "epoch": 0.06454106280193236, "grad_norm": 1.8196514648355098, "learning_rate": 2e-05, "loss": 0.8287544250488281, "step": 1670 }, { "epoch": 0.06492753623188406, "grad_norm": 1.933296233701157, "learning_rate": 2e-05, "loss": 0.7792496681213379, "step": 1680 }, { "epoch": 0.06531400966183575, "grad_norm": 5.5160092569417944, "learning_rate": 2e-05, "loss": 0.7874814987182617, "step": 1690 }, { "epoch": 0.06570048309178744, "grad_norm": 2.6740319109507054, "learning_rate": 2e-05, "loss": 0.7673942565917968, "step": 1700 }, { "epoch": 0.06608695652173913, "grad_norm": 4.46192092842804, "learning_rate": 2e-05, "loss": 0.7866016387939453, "step": 1710 }, { "epoch": 0.06647342995169082, "grad_norm": 9.393669028550853, "learning_rate": 2e-05, "loss": 0.7943299770355224, "step": 1720 }, { "epoch": 0.06685990338164251, "grad_norm": 2.805958882681691, "learning_rate": 2e-05, "loss": 0.7814671993255615, "step": 1730 }, { "epoch": 0.0672463768115942, "grad_norm": 8.944621163352808, "learning_rate": 2e-05, "loss": 0.7775825500488281, "step": 1740 }, { "epoch": 0.06763285024154589, "grad_norm": 1.3932999773436152, "learning_rate": 2e-05, "loss": 0.813438606262207, "step": 1750 }, { "epoch": 0.06801932367149759, "grad_norm": 1.1571499874919873, "learning_rate": 2e-05, "loss": 0.7704301834106445, "step": 1760 }, { "epoch": 0.06840579710144927, "grad_norm": 16.767188751455745, "learning_rate": 2e-05, "loss": 0.778882360458374, "step": 1770 }, { "epoch": 0.06879227053140097, "grad_norm": 1.8040160227751316, "learning_rate": 2e-05, "loss": 0.7672492980957031, "step": 1780 }, { "epoch": 0.06917874396135265, "grad_norm": 1.9003065034750897, "learning_rate": 2e-05, "loss": 0.7559861183166504, "step": 1790 }, { "epoch": 0.06956521739130435, "grad_norm": 4.328779850300501, "learning_rate": 2e-05, "loss": 0.7670548439025879, "step": 1800 }, { "epoch": 0.06995169082125603, "grad_norm": 1.5009521124497522, "learning_rate": 2e-05, "loss": 0.7466334342956543, "step": 1810 }, { "epoch": 0.07033816425120773, "grad_norm": 0.9373529421029959, "learning_rate": 2e-05, "loss": 0.7706023216247558, "step": 1820 }, { "epoch": 0.07072463768115941, "grad_norm": 2.5673019538259636, "learning_rate": 2e-05, "loss": 0.7813019752502441, "step": 1830 }, { "epoch": 0.07111111111111111, "grad_norm": 10.595792073325587, "learning_rate": 2e-05, "loss": 0.7712044715881348, "step": 1840 }, { "epoch": 0.07149758454106281, "grad_norm": 1.4549261759502392, "learning_rate": 2e-05, "loss": 0.7399177551269531, "step": 1850 }, { "epoch": 0.07188405797101449, "grad_norm": 1.3679794209107425, "learning_rate": 2e-05, "loss": 0.7697343349456787, "step": 1860 }, { "epoch": 0.07227053140096619, "grad_norm": 25.30685684908231, "learning_rate": 2e-05, "loss": 0.7722678661346436, "step": 1870 }, { "epoch": 0.07265700483091787, "grad_norm": 5.813362887543927, "learning_rate": 2e-05, "loss": 0.8079950332641601, "step": 1880 }, { "epoch": 0.07304347826086957, "grad_norm": 7.55091986778727, "learning_rate": 2e-05, "loss": 0.7749129295349121, "step": 1890 }, { "epoch": 0.07342995169082125, "grad_norm": 2.576691425426098, "learning_rate": 2e-05, "loss": 0.7901420593261719, "step": 1900 }, { "epoch": 0.07381642512077295, "grad_norm": 2.850989381932755, "learning_rate": 2e-05, "loss": 0.7870397567749023, "step": 1910 }, { "epoch": 0.07420289855072464, "grad_norm": 2.8388031664275593, "learning_rate": 2e-05, "loss": 0.798320722579956, "step": 1920 }, { "epoch": 0.07458937198067633, "grad_norm": 1.2660870766825572, "learning_rate": 2e-05, "loss": 0.7990159034729004, "step": 1930 }, { "epoch": 0.07497584541062802, "grad_norm": 7.521731822457599, "learning_rate": 2e-05, "loss": 0.8066888809204101, "step": 1940 }, { "epoch": 0.07536231884057971, "grad_norm": 2.2847479728174886, "learning_rate": 2e-05, "loss": 0.7807460784912109, "step": 1950 }, { "epoch": 0.0757487922705314, "grad_norm": 36.52969282187383, "learning_rate": 2e-05, "loss": 0.7917587280273437, "step": 1960 }, { "epoch": 0.0761352657004831, "grad_norm": 3.301236759706295, "learning_rate": 2e-05, "loss": 0.7987814903259277, "step": 1970 }, { "epoch": 0.07652173913043478, "grad_norm": 2.9129761845971176, "learning_rate": 2e-05, "loss": 0.7681584358215332, "step": 1980 }, { "epoch": 0.07690821256038648, "grad_norm": 2.124239464203845, "learning_rate": 2e-05, "loss": 0.7853168487548828, "step": 1990 }, { "epoch": 0.07729468599033816, "grad_norm": 6.0767545983301225, "learning_rate": 2e-05, "loss": 0.7794623374938965, "step": 2000 }, { "epoch": 0.07768115942028986, "grad_norm": 1.3709998398850736, "learning_rate": 2e-05, "loss": 0.7739840984344483, "step": 2010 }, { "epoch": 0.07806763285024154, "grad_norm": 1.5709783521988716, "learning_rate": 2e-05, "loss": 0.7280101776123047, "step": 2020 }, { "epoch": 0.07845410628019324, "grad_norm": 2.0426823491051156, "learning_rate": 2e-05, "loss": 0.7502191066741943, "step": 2030 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 963613493821440.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }