{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.05579775712209701, "eval_steps": 500, "global_step": 2035, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0002741904526884374, "grad_norm": 533.0549778145878, "learning_rate": 2.910112359550562e-06, "loss": 2.0392507553100585, "step": 10 }, { "epoch": 0.0005483809053768748, "grad_norm": 129.62802977018143, "learning_rate": 3.921348314606742e-06, "loss": 1.1088291168212892, "step": 20 }, { "epoch": 0.0008225713580653121, "grad_norm": 37.028700378797375, "learning_rate": 4.932584269662922e-06, "loss": 0.8763736724853516, "step": 30 }, { "epoch": 0.0010967618107537496, "grad_norm": 11.415105214785655, "learning_rate": 5.943820224719102e-06, "loss": 0.8334451675415039, "step": 40 }, { "epoch": 0.0013709522634421868, "grad_norm": 168.0092220161655, "learning_rate": 6.955056179775282e-06, "loss": 0.841560173034668, "step": 50 }, { "epoch": 0.0016451427161306242, "grad_norm": 10.9544582922062, "learning_rate": 7.966292134831462e-06, "loss": 0.7757131099700928, "step": 60 }, { "epoch": 0.0019193331688190617, "grad_norm": 52.12017293008163, "learning_rate": 8.977528089887641e-06, "loss": 0.7379593849182129, "step": 70 }, { "epoch": 0.0021935236215074993, "grad_norm": 24.23368291019739, "learning_rate": 9.988764044943822e-06, "loss": 0.871122169494629, "step": 80 }, { "epoch": 0.0024677140741959365, "grad_norm": 44.606225719656116, "learning_rate": 1.1000000000000001e-05, "loss": 0.8103988647460938, "step": 90 }, { "epoch": 0.0027419045268843737, "grad_norm": 19.394878252919106, "learning_rate": 1.2011235955056182e-05, "loss": 0.8088878631591797, "step": 100 }, { "epoch": 0.0030160949795728113, "grad_norm": 154.65284754287825, "learning_rate": 1.3022471910112362e-05, "loss": 0.7940959930419922, "step": 110 }, { "epoch": 0.0032902854322612485, "grad_norm": 58.453168158560985, "learning_rate": 1.403370786516854e-05, "loss": 0.8113164901733398, "step": 120 }, { "epoch": 0.003564475884949686, "grad_norm": 121.71906195134056, "learning_rate": 1.504494382022472e-05, "loss": 0.802008056640625, "step": 130 }, { "epoch": 0.0038386663376381233, "grad_norm": 7.063904217729592, "learning_rate": 1.60561797752809e-05, "loss": 0.7886086940765381, "step": 140 }, { "epoch": 0.004112856790326561, "grad_norm": 5.886231107848548, "learning_rate": 1.706741573033708e-05, "loss": 0.8553682327270508, "step": 150 }, { "epoch": 0.004387047243014999, "grad_norm": 17.479053516912124, "learning_rate": 1.8078651685393256e-05, "loss": 0.878786849975586, "step": 160 }, { "epoch": 0.004661237695703435, "grad_norm": 15.809884339669948, "learning_rate": 1.908988764044944e-05, "loss": 0.8892171859741211, "step": 170 }, { "epoch": 0.004935428148391873, "grad_norm": 15.552804520715554, "learning_rate": 2e-05, "loss": 0.907989501953125, "step": 180 }, { "epoch": 0.005209618601080311, "grad_norm": 8.234516558585694, "learning_rate": 2e-05, "loss": 0.8959874153137207, "step": 190 }, { "epoch": 0.005483809053768747, "grad_norm": 47.07479845477993, "learning_rate": 2e-05, "loss": 0.7972547054290772, "step": 200 }, { "epoch": 0.005757999506457185, "grad_norm": 14.678891090428264, "learning_rate": 2e-05, "loss": 0.7945639610290527, "step": 210 }, { "epoch": 0.006032189959145623, "grad_norm": 17.99623194706809, "learning_rate": 2e-05, "loss": 0.8467901229858399, "step": 220 }, { "epoch": 0.00630638041183406, "grad_norm": 51.95652459415379, "learning_rate": 2e-05, "loss": 0.7964937210083007, "step": 230 }, { "epoch": 0.006580570864522497, "grad_norm": 10.738865490640423, "learning_rate": 2e-05, "loss": 0.7535751342773438, "step": 240 }, { "epoch": 0.006854761317210935, "grad_norm": 10.795608734038868, "learning_rate": 2e-05, "loss": 0.828792953491211, "step": 250 }, { "epoch": 0.007128951769899372, "grad_norm": 14.551689425739292, "learning_rate": 2e-05, "loss": 0.8123558044433594, "step": 260 }, { "epoch": 0.00740314222258781, "grad_norm": 26.532992867443514, "learning_rate": 2e-05, "loss": 0.8517896652221679, "step": 270 }, { "epoch": 0.007677332675276247, "grad_norm": 34.07990246963607, "learning_rate": 2e-05, "loss": 0.8389625549316406, "step": 280 }, { "epoch": 0.007951523127964684, "grad_norm": 27.19116883891022, "learning_rate": 2e-05, "loss": 0.8190082550048828, "step": 290 }, { "epoch": 0.008225713580653122, "grad_norm": 16.718638113526183, "learning_rate": 2e-05, "loss": 0.8008914947509765, "step": 300 }, { "epoch": 0.00849990403334156, "grad_norm": 27.009662680205103, "learning_rate": 2e-05, "loss": 0.8091920852661133, "step": 310 }, { "epoch": 0.008774094486029997, "grad_norm": 9.031648650732553, "learning_rate": 2e-05, "loss": 0.8081918716430664, "step": 320 }, { "epoch": 0.009048284938718433, "grad_norm": 15.927828911998665, "learning_rate": 2e-05, "loss": 0.7878878593444825, "step": 330 }, { "epoch": 0.00932247539140687, "grad_norm": 6.019580282287438, "learning_rate": 2e-05, "loss": 0.8092373847961426, "step": 340 }, { "epoch": 0.009596665844095308, "grad_norm": 10.097656044283081, "learning_rate": 2e-05, "loss": 0.8236124038696289, "step": 350 }, { "epoch": 0.009870856296783746, "grad_norm": 3.898510274122292, "learning_rate": 2e-05, "loss": 0.8201662063598633, "step": 360 }, { "epoch": 0.010145046749472184, "grad_norm": 10.433240846124043, "learning_rate": 2e-05, "loss": 0.7954160213470459, "step": 370 }, { "epoch": 0.010419237202160621, "grad_norm": 3.9109175859167626, "learning_rate": 2e-05, "loss": 0.8451309204101562, "step": 380 }, { "epoch": 0.010693427654849059, "grad_norm": 19.47785359214917, "learning_rate": 2e-05, "loss": 0.8227203369140625, "step": 390 }, { "epoch": 0.010967618107537495, "grad_norm": 1.9979422322935754, "learning_rate": 2e-05, "loss": 0.7947024345397949, "step": 400 }, { "epoch": 0.011241808560225932, "grad_norm": 2.1152537387703063, "learning_rate": 2e-05, "loss": 0.7340120315551758, "step": 410 }, { "epoch": 0.01151599901291437, "grad_norm": 2.457083494187141, "learning_rate": 2e-05, "loss": 0.7300191879272461, "step": 420 }, { "epoch": 0.011790189465602808, "grad_norm": 17.457321034227927, "learning_rate": 2e-05, "loss": 0.7896897315979003, "step": 430 }, { "epoch": 0.012064379918291245, "grad_norm": 3.7757446450653047, "learning_rate": 2e-05, "loss": 0.7420886039733887, "step": 440 }, { "epoch": 0.012338570370979683, "grad_norm": 10.718659609403895, "learning_rate": 2e-05, "loss": 0.7464280605316163, "step": 450 }, { "epoch": 0.01261276082366812, "grad_norm": 13.096467752661693, "learning_rate": 2e-05, "loss": 0.7420991420745849, "step": 460 }, { "epoch": 0.012886951276356558, "grad_norm": 7.554114077938612, "learning_rate": 2e-05, "loss": 0.7896678924560547, "step": 470 }, { "epoch": 0.013161141729044994, "grad_norm": 1.9610155148576782, "learning_rate": 2e-05, "loss": 0.7641692161560059, "step": 480 }, { "epoch": 0.013435332181733432, "grad_norm": 3.743726960430974, "learning_rate": 2e-05, "loss": 0.7724472999572753, "step": 490 }, { "epoch": 0.01370952263442187, "grad_norm": 3.6205794374072897, "learning_rate": 2e-05, "loss": 0.7726649284362793, "step": 500 }, { "epoch": 0.013983713087110307, "grad_norm": 2.751894400685354, "learning_rate": 2e-05, "loss": 0.7311810970306396, "step": 510 }, { "epoch": 0.014257903539798744, "grad_norm": 15.8354606407861, "learning_rate": 2e-05, "loss": 0.7479830741882324, "step": 520 }, { "epoch": 0.014532093992487182, "grad_norm": 9.741291005928273, "learning_rate": 2e-05, "loss": 0.758505916595459, "step": 530 }, { "epoch": 0.01480628444517562, "grad_norm": 6.361558235058739, "learning_rate": 2e-05, "loss": 0.7497701644897461, "step": 540 }, { "epoch": 0.015080474897864056, "grad_norm": 12.406630096904701, "learning_rate": 2e-05, "loss": 0.7578043937683105, "step": 550 }, { "epoch": 0.015354665350552493, "grad_norm": 5.437533111150059, "learning_rate": 2e-05, "loss": 0.7494767665863037, "step": 560 }, { "epoch": 0.015628855803240933, "grad_norm": 5.385414434765143, "learning_rate": 2e-05, "loss": 0.76002197265625, "step": 570 }, { "epoch": 0.01590304625592937, "grad_norm": 2.514872003150109, "learning_rate": 2e-05, "loss": 0.753857946395874, "step": 580 }, { "epoch": 0.016177236708617804, "grad_norm": 7.350990110651167, "learning_rate": 2e-05, "loss": 0.7598513603210449, "step": 590 }, { "epoch": 0.016451427161306244, "grad_norm": 9.359850474100211, "learning_rate": 2e-05, "loss": 0.7978845596313476, "step": 600 }, { "epoch": 0.01672561761399468, "grad_norm": 2.5927971608846243, "learning_rate": 2e-05, "loss": 0.7353355407714843, "step": 610 }, { "epoch": 0.01699980806668312, "grad_norm": 13.580441280433185, "learning_rate": 2e-05, "loss": 0.7530646800994873, "step": 620 }, { "epoch": 0.017273998519371555, "grad_norm": 7.032504711444772, "learning_rate": 2e-05, "loss": 0.7999831199645996, "step": 630 }, { "epoch": 0.017548188972059994, "grad_norm": 3.7623518166414134, "learning_rate": 2e-05, "loss": 0.7583576202392578, "step": 640 }, { "epoch": 0.01782237942474843, "grad_norm": 9.996121547764488, "learning_rate": 2e-05, "loss": 0.7126437187194824, "step": 650 }, { "epoch": 0.018096569877436866, "grad_norm": 3.8005663709948423, "learning_rate": 2e-05, "loss": 0.7714213371276856, "step": 660 }, { "epoch": 0.018370760330125305, "grad_norm": 2.2803953101797445, "learning_rate": 2e-05, "loss": 0.735899829864502, "step": 670 }, { "epoch": 0.01864495078281374, "grad_norm": 2.2804717033812687, "learning_rate": 2e-05, "loss": 0.7463047981262207, "step": 680 }, { "epoch": 0.01891914123550218, "grad_norm": 2.6630744686256174, "learning_rate": 2e-05, "loss": 0.7112466812133789, "step": 690 }, { "epoch": 0.019193331688190617, "grad_norm": 8.59421748677637, "learning_rate": 2e-05, "loss": 0.8032501220703125, "step": 700 }, { "epoch": 0.019467522140879056, "grad_norm": 6.839099911030037, "learning_rate": 2e-05, "loss": 0.7257285118103027, "step": 710 }, { "epoch": 0.019741712593567492, "grad_norm": 6.527196880605798, "learning_rate": 2e-05, "loss": 0.7394065856933594, "step": 720 }, { "epoch": 0.020015903046255928, "grad_norm": 4.91546686150854, "learning_rate": 2e-05, "loss": 0.7233449459075928, "step": 730 }, { "epoch": 0.020290093498944367, "grad_norm": 9.615722695591046, "learning_rate": 2e-05, "loss": 0.714713191986084, "step": 740 }, { "epoch": 0.020564283951632803, "grad_norm": 2.6469047522209244, "learning_rate": 2e-05, "loss": 0.7250522613525391, "step": 750 }, { "epoch": 0.020838474404321242, "grad_norm": 27.513230581702402, "learning_rate": 2e-05, "loss": 0.709619665145874, "step": 760 }, { "epoch": 0.021112664857009678, "grad_norm": 2.3305572520941102, "learning_rate": 2e-05, "loss": 0.7650126457214356, "step": 770 }, { "epoch": 0.021386855309698118, "grad_norm": 1.7645473455518579, "learning_rate": 2e-05, "loss": 0.7501170635223389, "step": 780 }, { "epoch": 0.021661045762386553, "grad_norm": 2.706703322701269, "learning_rate": 2e-05, "loss": 0.7390304565429687, "step": 790 }, { "epoch": 0.02193523621507499, "grad_norm": 1.343452945442269, "learning_rate": 2e-05, "loss": 0.7560922145843506, "step": 800 }, { "epoch": 0.02220942666776343, "grad_norm": 1.8131674161495455, "learning_rate": 2e-05, "loss": 0.7617329597473145, "step": 810 }, { "epoch": 0.022483617120451865, "grad_norm": 6.6257304148619, "learning_rate": 2e-05, "loss": 0.7030315399169922, "step": 820 }, { "epoch": 0.022757807573140304, "grad_norm": 2.7477972541714237, "learning_rate": 2e-05, "loss": 0.7051456451416016, "step": 830 }, { "epoch": 0.02303199802582874, "grad_norm": 1.8551689554260649, "learning_rate": 2e-05, "loss": 0.790980863571167, "step": 840 }, { "epoch": 0.02330618847851718, "grad_norm": 4.091035715965749, "learning_rate": 2e-05, "loss": 0.7167482376098633, "step": 850 }, { "epoch": 0.023580378931205615, "grad_norm": 3.13444342764459, "learning_rate": 2e-05, "loss": 0.7428287506103516, "step": 860 }, { "epoch": 0.023854569383894055, "grad_norm": 7.428502868185567, "learning_rate": 2e-05, "loss": 0.7720952510833741, "step": 870 }, { "epoch": 0.02412875983658249, "grad_norm": 2.738880412295684, "learning_rate": 2e-05, "loss": 0.7307533264160156, "step": 880 }, { "epoch": 0.024402950289270926, "grad_norm": 5.442319700482665, "learning_rate": 2e-05, "loss": 0.7590367794036865, "step": 890 }, { "epoch": 0.024677140741959366, "grad_norm": 4.209775631505361, "learning_rate": 2e-05, "loss": 0.7398377418518066, "step": 900 }, { "epoch": 0.0249513311946478, "grad_norm": 3.317366374639838, "learning_rate": 2e-05, "loss": 0.7573592662811279, "step": 910 }, { "epoch": 0.02522552164733624, "grad_norm": 2.21708523073645, "learning_rate": 2e-05, "loss": 0.7442788124084473, "step": 920 }, { "epoch": 0.025499712100024677, "grad_norm": 5.003510596258695, "learning_rate": 2e-05, "loss": 0.7208542823791504, "step": 930 }, { "epoch": 0.025773902552713116, "grad_norm": 1.8666696979850983, "learning_rate": 2e-05, "loss": 0.7219260215759278, "step": 940 }, { "epoch": 0.026048093005401552, "grad_norm": 2.319707094464392, "learning_rate": 2e-05, "loss": 0.705035400390625, "step": 950 }, { "epoch": 0.026322283458089988, "grad_norm": 1.559433923602148, "learning_rate": 2e-05, "loss": 0.7253781795501709, "step": 960 }, { "epoch": 0.026596473910778427, "grad_norm": 3.1103622605289294, "learning_rate": 2e-05, "loss": 0.7434506416320801, "step": 970 }, { "epoch": 0.026870664363466863, "grad_norm": 4.482952591971397, "learning_rate": 2e-05, "loss": 0.7423406600952148, "step": 980 }, { "epoch": 0.027144854816155303, "grad_norm": 2.349643537640656, "learning_rate": 2e-05, "loss": 0.7380632400512696, "step": 990 }, { "epoch": 0.02741904526884374, "grad_norm": 6.624084473754211, "learning_rate": 2e-05, "loss": 0.7448741912841796, "step": 1000 }, { "epoch": 0.027693235721532178, "grad_norm": 1.959542744744174, "learning_rate": 2e-05, "loss": 0.7620717048645019, "step": 1010 }, { "epoch": 0.027967426174220614, "grad_norm": 1.9359370487542638, "learning_rate": 2e-05, "loss": 0.7283543586730957, "step": 1020 }, { "epoch": 0.02824161662690905, "grad_norm": 3.7510091510273424, "learning_rate": 2e-05, "loss": 0.7341510772705078, "step": 1030 }, { "epoch": 0.02851580707959749, "grad_norm": 1.645233108914731, "learning_rate": 2e-05, "loss": 0.7321323394775391, "step": 1040 }, { "epoch": 0.028789997532285925, "grad_norm": 5.060129114701537, "learning_rate": 2e-05, "loss": 0.7923129558563232, "step": 1050 }, { "epoch": 0.029064187984974364, "grad_norm": 6.767343077930711, "learning_rate": 2e-05, "loss": 0.7364850997924804, "step": 1060 }, { "epoch": 0.0293383784376628, "grad_norm": 7.157354259172915, "learning_rate": 2e-05, "loss": 0.7175948143005371, "step": 1070 }, { "epoch": 0.02961256889035124, "grad_norm": 10.118526445754803, "learning_rate": 2e-05, "loss": 0.6956705093383789, "step": 1080 }, { "epoch": 0.029886759343039675, "grad_norm": 3.2975128574851205, "learning_rate": 2e-05, "loss": 0.7435084342956543, "step": 1090 }, { "epoch": 0.03016094979572811, "grad_norm": 3.79438108252297, "learning_rate": 2e-05, "loss": 0.7209542274475098, "step": 1100 }, { "epoch": 0.03043514024841655, "grad_norm": 3.6413783178286896, "learning_rate": 2e-05, "loss": 0.7462982177734375, "step": 1110 }, { "epoch": 0.030709330701104987, "grad_norm": 2.4359365603997323, "learning_rate": 2e-05, "loss": 0.7772771835327148, "step": 1120 }, { "epoch": 0.030983521153793426, "grad_norm": 2.067253539210089, "learning_rate": 2e-05, "loss": 0.754563283920288, "step": 1130 }, { "epoch": 0.031257711606481865, "grad_norm": 1.3603842511083, "learning_rate": 2e-05, "loss": 0.7163387298583984, "step": 1140 }, { "epoch": 0.0315319020591703, "grad_norm": 7.634204958345298, "learning_rate": 2e-05, "loss": 0.7153648376464844, "step": 1150 }, { "epoch": 0.03180609251185874, "grad_norm": 2.224287938133906, "learning_rate": 2e-05, "loss": 0.7743209838867188, "step": 1160 }, { "epoch": 0.03208028296454717, "grad_norm": 8.328106347948369, "learning_rate": 2e-05, "loss": 0.7125131130218506, "step": 1170 }, { "epoch": 0.03235447341723561, "grad_norm": 4.9140382117559716, "learning_rate": 2e-05, "loss": 0.734964656829834, "step": 1180 }, { "epoch": 0.03262866386992405, "grad_norm": 1.6437427011396712, "learning_rate": 2e-05, "loss": 0.736287260055542, "step": 1190 }, { "epoch": 0.03290285432261249, "grad_norm": 1.7984413046378422, "learning_rate": 2e-05, "loss": 0.6888255119323731, "step": 1200 }, { "epoch": 0.03317704477530092, "grad_norm": 3.003273429621072, "learning_rate": 2e-05, "loss": 0.7354516506195068, "step": 1210 }, { "epoch": 0.03345123522798936, "grad_norm": 1.581766516298146, "learning_rate": 2e-05, "loss": 0.7175889492034913, "step": 1220 }, { "epoch": 0.0337254256806778, "grad_norm": 2.3247470513343185, "learning_rate": 2e-05, "loss": 0.714189863204956, "step": 1230 }, { "epoch": 0.03399961613336624, "grad_norm": 7.9334494235192325, "learning_rate": 2e-05, "loss": 0.7136695861816407, "step": 1240 }, { "epoch": 0.034273806586054674, "grad_norm": 49.62487496955337, "learning_rate": 2e-05, "loss": 0.7086945533752441, "step": 1250 }, { "epoch": 0.03454799703874311, "grad_norm": 2.890774584879648, "learning_rate": 2e-05, "loss": 0.7269087791442871, "step": 1260 }, { "epoch": 0.034822187491431546, "grad_norm": 4.796531005737684, "learning_rate": 2e-05, "loss": 0.7484929084777832, "step": 1270 }, { "epoch": 0.03509637794411999, "grad_norm": 1.6372708148105157, "learning_rate": 2e-05, "loss": 0.6999114036560059, "step": 1280 }, { "epoch": 0.035370568396808424, "grad_norm": 4.162341191850801, "learning_rate": 2e-05, "loss": 0.7129648208618165, "step": 1290 }, { "epoch": 0.03564475884949686, "grad_norm": 4.017056556093628, "learning_rate": 2e-05, "loss": 0.7217267036437989, "step": 1300 }, { "epoch": 0.035918949302185296, "grad_norm": 9.786655951652824, "learning_rate": 2e-05, "loss": 0.7361152648925782, "step": 1310 }, { "epoch": 0.03619313975487373, "grad_norm": 17.798888728639277, "learning_rate": 2e-05, "loss": 0.7423253059387207, "step": 1320 }, { "epoch": 0.036467330207562175, "grad_norm": 25.98230175781132, "learning_rate": 2e-05, "loss": 0.7079302787780761, "step": 1330 }, { "epoch": 0.03674152066025061, "grad_norm": 4.107909151191186, "learning_rate": 2e-05, "loss": 0.7637813568115235, "step": 1340 }, { "epoch": 0.03701571111293905, "grad_norm": 1.8177555687046802, "learning_rate": 2e-05, "loss": 0.7440331459045411, "step": 1350 }, { "epoch": 0.03728990156562748, "grad_norm": 6.631474920460703, "learning_rate": 2e-05, "loss": 0.7420357704162598, "step": 1360 }, { "epoch": 0.037564092018315925, "grad_norm": 1.182591249805126, "learning_rate": 2e-05, "loss": 0.7243555068969727, "step": 1370 }, { "epoch": 0.03783828247100436, "grad_norm": 1.5239290367740697, "learning_rate": 2e-05, "loss": 0.7780046463012695, "step": 1380 }, { "epoch": 0.0381124729236928, "grad_norm": 1.9611702789468477, "learning_rate": 2e-05, "loss": 0.7606742858886719, "step": 1390 }, { "epoch": 0.03838666337638123, "grad_norm": 3.4538398959809564, "learning_rate": 2e-05, "loss": 0.7161018371582031, "step": 1400 }, { "epoch": 0.03866085382906967, "grad_norm": 6.74405592418129, "learning_rate": 2e-05, "loss": 0.7269341945648193, "step": 1410 }, { "epoch": 0.03893504428175811, "grad_norm": 5.0613023509206, "learning_rate": 2e-05, "loss": 0.7150623321533203, "step": 1420 }, { "epoch": 0.03920923473444655, "grad_norm": 15.935601654785444, "learning_rate": 2e-05, "loss": 0.6991084098815918, "step": 1430 }, { "epoch": 0.039483425187134984, "grad_norm": 189.58206876056943, "learning_rate": 2e-05, "loss": 0.715428352355957, "step": 1440 }, { "epoch": 0.03975761563982342, "grad_norm": 13.224258279776146, "learning_rate": 2e-05, "loss": 0.7448666572570801, "step": 1450 }, { "epoch": 0.040031806092511855, "grad_norm": 15.23890210961455, "learning_rate": 2e-05, "loss": 0.7545663833618164, "step": 1460 }, { "epoch": 0.0403059965452003, "grad_norm": 2.089772579003186, "learning_rate": 2e-05, "loss": 0.7143968105316162, "step": 1470 }, { "epoch": 0.040580186997888734, "grad_norm": 672.5570249806746, "learning_rate": 2e-05, "loss": 0.6955307960510254, "step": 1480 }, { "epoch": 0.04085437745057717, "grad_norm": 2.499047720535622, "learning_rate": 2e-05, "loss": 0.7183216094970704, "step": 1490 }, { "epoch": 0.041128567903265606, "grad_norm": 1.6820671266931866, "learning_rate": 2e-05, "loss": 0.7442133903503418, "step": 1500 }, { "epoch": 0.04140275835595405, "grad_norm": 1.6322487359391142, "learning_rate": 2e-05, "loss": 0.7415005683898925, "step": 1510 }, { "epoch": 0.041676948808642485, "grad_norm": 2.0768691766562974, "learning_rate": 2e-05, "loss": 0.7350949764251709, "step": 1520 }, { "epoch": 0.04195113926133092, "grad_norm": 3.462638107939682, "learning_rate": 2e-05, "loss": 0.6958516597747803, "step": 1530 }, { "epoch": 0.042225329714019356, "grad_norm": 1.9410342316482636, "learning_rate": 2e-05, "loss": 0.7019001960754394, "step": 1540 }, { "epoch": 0.04249952016670779, "grad_norm": 2.2435234267896944, "learning_rate": 2e-05, "loss": 0.7038233757019043, "step": 1550 }, { "epoch": 0.042773710619396235, "grad_norm": 50.31729516447788, "learning_rate": 2e-05, "loss": 0.6971765041351319, "step": 1560 }, { "epoch": 0.04304790107208467, "grad_norm": 6.726153221416043, "learning_rate": 2e-05, "loss": 0.7901406764984131, "step": 1570 }, { "epoch": 0.04332209152477311, "grad_norm": 25.290061958502374, "learning_rate": 2e-05, "loss": 0.7404637813568116, "step": 1580 }, { "epoch": 0.04359628197746154, "grad_norm": 11.648387859593914, "learning_rate": 2e-05, "loss": 0.7325190544128418, "step": 1590 }, { "epoch": 0.04387047243014998, "grad_norm": 3.998377511327454, "learning_rate": 2e-05, "loss": 0.6938001155853272, "step": 1600 }, { "epoch": 0.04414466288283842, "grad_norm": 1.4609573707991412, "learning_rate": 2e-05, "loss": 0.6974159240722656, "step": 1610 }, { "epoch": 0.04441885333552686, "grad_norm": 1.2908767847499276, "learning_rate": 2e-05, "loss": 0.735476303100586, "step": 1620 }, { "epoch": 0.04469304378821529, "grad_norm": 1.5263587301999937, "learning_rate": 2e-05, "loss": 0.6849418640136719, "step": 1630 }, { "epoch": 0.04496723424090373, "grad_norm": 2.71012026891521, "learning_rate": 2e-05, "loss": 0.6952274322509766, "step": 1640 }, { "epoch": 0.04524142469359217, "grad_norm": 1.5738552850120824, "learning_rate": 2e-05, "loss": 0.7284816265106201, "step": 1650 }, { "epoch": 0.04551561514628061, "grad_norm": 1.5435257666345013, "learning_rate": 2e-05, "loss": 0.7115949153900146, "step": 1660 }, { "epoch": 0.045789805598969044, "grad_norm": 1.516425220632835, "learning_rate": 2e-05, "loss": 0.6966533660888672, "step": 1670 }, { "epoch": 0.04606399605165748, "grad_norm": 1.4858677693562772, "learning_rate": 2e-05, "loss": 0.712862491607666, "step": 1680 }, { "epoch": 0.046338186504345916, "grad_norm": 1.1928774431737874, "learning_rate": 2e-05, "loss": 0.715973949432373, "step": 1690 }, { "epoch": 0.04661237695703436, "grad_norm": 1.3801750667103458, "learning_rate": 2e-05, "loss": 0.6785056114196777, "step": 1700 }, { "epoch": 0.046886567409722794, "grad_norm": 1.1562227123885702, "learning_rate": 2e-05, "loss": 0.6806015014648438, "step": 1710 }, { "epoch": 0.04716075786241123, "grad_norm": 1.966065169897555, "learning_rate": 2e-05, "loss": 0.6789681911468506, "step": 1720 }, { "epoch": 0.047434948315099666, "grad_norm": 1.796240102087905, "learning_rate": 2e-05, "loss": 0.6643640041351319, "step": 1730 }, { "epoch": 0.04770913876778811, "grad_norm": 1.4714599948408273, "learning_rate": 2e-05, "loss": 0.672383975982666, "step": 1740 }, { "epoch": 0.047983329220476545, "grad_norm": 1.05613596470809, "learning_rate": 2e-05, "loss": 0.6921384334564209, "step": 1750 }, { "epoch": 0.04825751967316498, "grad_norm": 1.168321764739896, "learning_rate": 2e-05, "loss": 0.6853407859802246, "step": 1760 }, { "epoch": 0.04853171012585342, "grad_norm": 1.304231611987027, "learning_rate": 2e-05, "loss": 0.6831422328948975, "step": 1770 }, { "epoch": 0.04880590057854185, "grad_norm": 1.271885101891083, "learning_rate": 2e-05, "loss": 0.7312606811523438, "step": 1780 }, { "epoch": 0.049080091031230295, "grad_norm": 1.1274168419233672, "learning_rate": 2e-05, "loss": 0.7195809841156006, "step": 1790 }, { "epoch": 0.04935428148391873, "grad_norm": 2.1060356897000196, "learning_rate": 2e-05, "loss": 0.6862109184265137, "step": 1800 }, { "epoch": 0.04962847193660717, "grad_norm": 1.1668574261874323, "learning_rate": 2e-05, "loss": 0.7068725109100342, "step": 1810 }, { "epoch": 0.0499026623892956, "grad_norm": 3.1583477159166673, "learning_rate": 2e-05, "loss": 0.7150220394134521, "step": 1820 }, { "epoch": 0.05017685284198404, "grad_norm": 1.5843620172233683, "learning_rate": 2e-05, "loss": 0.66549072265625, "step": 1830 }, { "epoch": 0.05045104329467248, "grad_norm": 1.2547928536390052, "learning_rate": 2e-05, "loss": 0.7375857353210449, "step": 1840 }, { "epoch": 0.05072523374736092, "grad_norm": 4.29725259279178, "learning_rate": 2e-05, "loss": 0.6876885890960693, "step": 1850 }, { "epoch": 0.050999424200049354, "grad_norm": 1.9025925412069744, "learning_rate": 2e-05, "loss": 0.7387830734252929, "step": 1860 }, { "epoch": 0.05127361465273779, "grad_norm": 1.5406949311604028, "learning_rate": 2e-05, "loss": 0.6733179092407227, "step": 1870 }, { "epoch": 0.05154780510542623, "grad_norm": 20.215212215144863, "learning_rate": 2e-05, "loss": 0.7654403686523438, "step": 1880 }, { "epoch": 0.05182199555811467, "grad_norm": 1.5669531048405803, "learning_rate": 2e-05, "loss": 0.7350390911102295, "step": 1890 }, { "epoch": 0.052096186010803104, "grad_norm": 7.2191546562371425, "learning_rate": 2e-05, "loss": 0.7414397716522216, "step": 1900 }, { "epoch": 0.05237037646349154, "grad_norm": 1.2325274169727398, "learning_rate": 2e-05, "loss": 0.7655929088592529, "step": 1910 }, { "epoch": 0.052644566916179976, "grad_norm": 1.1944179026527708, "learning_rate": 2e-05, "loss": 0.7075240135192871, "step": 1920 }, { "epoch": 0.05291875736886842, "grad_norm": 1.302822879313398, "learning_rate": 2e-05, "loss": 0.6797014236450195, "step": 1930 }, { "epoch": 0.053192947821556855, "grad_norm": 2.0168747405099747, "learning_rate": 2e-05, "loss": 0.7000571727752686, "step": 1940 }, { "epoch": 0.05346713827424529, "grad_norm": 1.6344897385611805, "learning_rate": 2e-05, "loss": 0.7235137939453125, "step": 1950 }, { "epoch": 0.053741328726933726, "grad_norm": 3.5766753006414125, "learning_rate": 2e-05, "loss": 0.7371991634368896, "step": 1960 }, { "epoch": 0.05401551917962216, "grad_norm": 1.4953479982574733, "learning_rate": 2e-05, "loss": 0.7229987621307373, "step": 1970 }, { "epoch": 0.054289709632310605, "grad_norm": 1.6598347475638233, "learning_rate": 2e-05, "loss": 0.6758342742919922, "step": 1980 }, { "epoch": 0.05456390008499904, "grad_norm": 1.3876361065240026, "learning_rate": 2e-05, "loss": 0.6621166229248047, "step": 1990 }, { "epoch": 0.05483809053768748, "grad_norm": 1.2953540155757288, "learning_rate": 2e-05, "loss": 0.701081657409668, "step": 2000 }, { "epoch": 0.05511228099037591, "grad_norm": 1.0757376098134102, "learning_rate": 2e-05, "loss": 0.6949031829833985, "step": 2010 }, { "epoch": 0.055386471443064356, "grad_norm": 1.3515745918409625, "learning_rate": 2e-05, "loss": 0.6849285125732422, "step": 2020 }, { "epoch": 0.05566066189575279, "grad_norm": 3.4678908742290884, "learning_rate": 2e-05, "loss": 0.6919690608978272, "step": 2030 } ], "logging_steps": 10, "max_steps": 5935, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2035, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 963613493821440.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }