rqadri's picture
Upload folder using huggingface_hub
168e068 verified
Raw
History Blame Contribute Delete
35.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.05579775712209701,
"eval_steps": 500,
"global_step": 2035,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0002741904526884374,
"grad_norm": 533.0549778145878,
"learning_rate": 2.910112359550562e-06,
"loss": 2.0392507553100585,
"step": 10
},
{
"epoch": 0.0005483809053768748,
"grad_norm": 129.62802977018143,
"learning_rate": 3.921348314606742e-06,
"loss": 1.1088291168212892,
"step": 20
},
{
"epoch": 0.0008225713580653121,
"grad_norm": 37.028700378797375,
"learning_rate": 4.932584269662922e-06,
"loss": 0.8763736724853516,
"step": 30
},
{
"epoch": 0.0010967618107537496,
"grad_norm": 11.415105214785655,
"learning_rate": 5.943820224719102e-06,
"loss": 0.8334451675415039,
"step": 40
},
{
"epoch": 0.0013709522634421868,
"grad_norm": 168.0092220161655,
"learning_rate": 6.955056179775282e-06,
"loss": 0.841560173034668,
"step": 50
},
{
"epoch": 0.0016451427161306242,
"grad_norm": 10.9544582922062,
"learning_rate": 7.966292134831462e-06,
"loss": 0.7757131099700928,
"step": 60
},
{
"epoch": 0.0019193331688190617,
"grad_norm": 52.12017293008163,
"learning_rate": 8.977528089887641e-06,
"loss": 0.7379593849182129,
"step": 70
},
{
"epoch": 0.0021935236215074993,
"grad_norm": 24.23368291019739,
"learning_rate": 9.988764044943822e-06,
"loss": 0.871122169494629,
"step": 80
},
{
"epoch": 0.0024677140741959365,
"grad_norm": 44.606225719656116,
"learning_rate": 1.1000000000000001e-05,
"loss": 0.8103988647460938,
"step": 90
},
{
"epoch": 0.0027419045268843737,
"grad_norm": 19.394878252919106,
"learning_rate": 1.2011235955056182e-05,
"loss": 0.8088878631591797,
"step": 100
},
{
"epoch": 0.0030160949795728113,
"grad_norm": 154.65284754287825,
"learning_rate": 1.3022471910112362e-05,
"loss": 0.7940959930419922,
"step": 110
},
{
"epoch": 0.0032902854322612485,
"grad_norm": 58.453168158560985,
"learning_rate": 1.403370786516854e-05,
"loss": 0.8113164901733398,
"step": 120
},
{
"epoch": 0.003564475884949686,
"grad_norm": 121.71906195134056,
"learning_rate": 1.504494382022472e-05,
"loss": 0.802008056640625,
"step": 130
},
{
"epoch": 0.0038386663376381233,
"grad_norm": 7.063904217729592,
"learning_rate": 1.60561797752809e-05,
"loss": 0.7886086940765381,
"step": 140
},
{
"epoch": 0.004112856790326561,
"grad_norm": 5.886231107848548,
"learning_rate": 1.706741573033708e-05,
"loss": 0.8553682327270508,
"step": 150
},
{
"epoch": 0.004387047243014999,
"grad_norm": 17.479053516912124,
"learning_rate": 1.8078651685393256e-05,
"loss": 0.878786849975586,
"step": 160
},
{
"epoch": 0.004661237695703435,
"grad_norm": 15.809884339669948,
"learning_rate": 1.908988764044944e-05,
"loss": 0.8892171859741211,
"step": 170
},
{
"epoch": 0.004935428148391873,
"grad_norm": 15.552804520715554,
"learning_rate": 2e-05,
"loss": 0.907989501953125,
"step": 180
},
{
"epoch": 0.005209618601080311,
"grad_norm": 8.234516558585694,
"learning_rate": 2e-05,
"loss": 0.8959874153137207,
"step": 190
},
{
"epoch": 0.005483809053768747,
"grad_norm": 47.07479845477993,
"learning_rate": 2e-05,
"loss": 0.7972547054290772,
"step": 200
},
{
"epoch": 0.005757999506457185,
"grad_norm": 14.678891090428264,
"learning_rate": 2e-05,
"loss": 0.7945639610290527,
"step": 210
},
{
"epoch": 0.006032189959145623,
"grad_norm": 17.99623194706809,
"learning_rate": 2e-05,
"loss": 0.8467901229858399,
"step": 220
},
{
"epoch": 0.00630638041183406,
"grad_norm": 51.95652459415379,
"learning_rate": 2e-05,
"loss": 0.7964937210083007,
"step": 230
},
{
"epoch": 0.006580570864522497,
"grad_norm": 10.738865490640423,
"learning_rate": 2e-05,
"loss": 0.7535751342773438,
"step": 240
},
{
"epoch": 0.006854761317210935,
"grad_norm": 10.795608734038868,
"learning_rate": 2e-05,
"loss": 0.828792953491211,
"step": 250
},
{
"epoch": 0.007128951769899372,
"grad_norm": 14.551689425739292,
"learning_rate": 2e-05,
"loss": 0.8123558044433594,
"step": 260
},
{
"epoch": 0.00740314222258781,
"grad_norm": 26.532992867443514,
"learning_rate": 2e-05,
"loss": 0.8517896652221679,
"step": 270
},
{
"epoch": 0.007677332675276247,
"grad_norm": 34.07990246963607,
"learning_rate": 2e-05,
"loss": 0.8389625549316406,
"step": 280
},
{
"epoch": 0.007951523127964684,
"grad_norm": 27.19116883891022,
"learning_rate": 2e-05,
"loss": 0.8190082550048828,
"step": 290
},
{
"epoch": 0.008225713580653122,
"grad_norm": 16.718638113526183,
"learning_rate": 2e-05,
"loss": 0.8008914947509765,
"step": 300
},
{
"epoch": 0.00849990403334156,
"grad_norm": 27.009662680205103,
"learning_rate": 2e-05,
"loss": 0.8091920852661133,
"step": 310
},
{
"epoch": 0.008774094486029997,
"grad_norm": 9.031648650732553,
"learning_rate": 2e-05,
"loss": 0.8081918716430664,
"step": 320
},
{
"epoch": 0.009048284938718433,
"grad_norm": 15.927828911998665,
"learning_rate": 2e-05,
"loss": 0.7878878593444825,
"step": 330
},
{
"epoch": 0.00932247539140687,
"grad_norm": 6.019580282287438,
"learning_rate": 2e-05,
"loss": 0.8092373847961426,
"step": 340
},
{
"epoch": 0.009596665844095308,
"grad_norm": 10.097656044283081,
"learning_rate": 2e-05,
"loss": 0.8236124038696289,
"step": 350
},
{
"epoch": 0.009870856296783746,
"grad_norm": 3.898510274122292,
"learning_rate": 2e-05,
"loss": 0.8201662063598633,
"step": 360
},
{
"epoch": 0.010145046749472184,
"grad_norm": 10.433240846124043,
"learning_rate": 2e-05,
"loss": 0.7954160213470459,
"step": 370
},
{
"epoch": 0.010419237202160621,
"grad_norm": 3.9109175859167626,
"learning_rate": 2e-05,
"loss": 0.8451309204101562,
"step": 380
},
{
"epoch": 0.010693427654849059,
"grad_norm": 19.47785359214917,
"learning_rate": 2e-05,
"loss": 0.8227203369140625,
"step": 390
},
{
"epoch": 0.010967618107537495,
"grad_norm": 1.9979422322935754,
"learning_rate": 2e-05,
"loss": 0.7947024345397949,
"step": 400
},
{
"epoch": 0.011241808560225932,
"grad_norm": 2.1152537387703063,
"learning_rate": 2e-05,
"loss": 0.7340120315551758,
"step": 410
},
{
"epoch": 0.01151599901291437,
"grad_norm": 2.457083494187141,
"learning_rate": 2e-05,
"loss": 0.7300191879272461,
"step": 420
},
{
"epoch": 0.011790189465602808,
"grad_norm": 17.457321034227927,
"learning_rate": 2e-05,
"loss": 0.7896897315979003,
"step": 430
},
{
"epoch": 0.012064379918291245,
"grad_norm": 3.7757446450653047,
"learning_rate": 2e-05,
"loss": 0.7420886039733887,
"step": 440
},
{
"epoch": 0.012338570370979683,
"grad_norm": 10.718659609403895,
"learning_rate": 2e-05,
"loss": 0.7464280605316163,
"step": 450
},
{
"epoch": 0.01261276082366812,
"grad_norm": 13.096467752661693,
"learning_rate": 2e-05,
"loss": 0.7420991420745849,
"step": 460
},
{
"epoch": 0.012886951276356558,
"grad_norm": 7.554114077938612,
"learning_rate": 2e-05,
"loss": 0.7896678924560547,
"step": 470
},
{
"epoch": 0.013161141729044994,
"grad_norm": 1.9610155148576782,
"learning_rate": 2e-05,
"loss": 0.7641692161560059,
"step": 480
},
{
"epoch": 0.013435332181733432,
"grad_norm": 3.743726960430974,
"learning_rate": 2e-05,
"loss": 0.7724472999572753,
"step": 490
},
{
"epoch": 0.01370952263442187,
"grad_norm": 3.6205794374072897,
"learning_rate": 2e-05,
"loss": 0.7726649284362793,
"step": 500
},
{
"epoch": 0.013983713087110307,
"grad_norm": 2.751894400685354,
"learning_rate": 2e-05,
"loss": 0.7311810970306396,
"step": 510
},
{
"epoch": 0.014257903539798744,
"grad_norm": 15.8354606407861,
"learning_rate": 2e-05,
"loss": 0.7479830741882324,
"step": 520
},
{
"epoch": 0.014532093992487182,
"grad_norm": 9.741291005928273,
"learning_rate": 2e-05,
"loss": 0.758505916595459,
"step": 530
},
{
"epoch": 0.01480628444517562,
"grad_norm": 6.361558235058739,
"learning_rate": 2e-05,
"loss": 0.7497701644897461,
"step": 540
},
{
"epoch": 0.015080474897864056,
"grad_norm": 12.406630096904701,
"learning_rate": 2e-05,
"loss": 0.7578043937683105,
"step": 550
},
{
"epoch": 0.015354665350552493,
"grad_norm": 5.437533111150059,
"learning_rate": 2e-05,
"loss": 0.7494767665863037,
"step": 560
},
{
"epoch": 0.015628855803240933,
"grad_norm": 5.385414434765143,
"learning_rate": 2e-05,
"loss": 0.76002197265625,
"step": 570
},
{
"epoch": 0.01590304625592937,
"grad_norm": 2.514872003150109,
"learning_rate": 2e-05,
"loss": 0.753857946395874,
"step": 580
},
{
"epoch": 0.016177236708617804,
"grad_norm": 7.350990110651167,
"learning_rate": 2e-05,
"loss": 0.7598513603210449,
"step": 590
},
{
"epoch": 0.016451427161306244,
"grad_norm": 9.359850474100211,
"learning_rate": 2e-05,
"loss": 0.7978845596313476,
"step": 600
},
{
"epoch": 0.01672561761399468,
"grad_norm": 2.5927971608846243,
"learning_rate": 2e-05,
"loss": 0.7353355407714843,
"step": 610
},
{
"epoch": 0.01699980806668312,
"grad_norm": 13.580441280433185,
"learning_rate": 2e-05,
"loss": 0.7530646800994873,
"step": 620
},
{
"epoch": 0.017273998519371555,
"grad_norm": 7.032504711444772,
"learning_rate": 2e-05,
"loss": 0.7999831199645996,
"step": 630
},
{
"epoch": 0.017548188972059994,
"grad_norm": 3.7623518166414134,
"learning_rate": 2e-05,
"loss": 0.7583576202392578,
"step": 640
},
{
"epoch": 0.01782237942474843,
"grad_norm": 9.996121547764488,
"learning_rate": 2e-05,
"loss": 0.7126437187194824,
"step": 650
},
{
"epoch": 0.018096569877436866,
"grad_norm": 3.8005663709948423,
"learning_rate": 2e-05,
"loss": 0.7714213371276856,
"step": 660
},
{
"epoch": 0.018370760330125305,
"grad_norm": 2.2803953101797445,
"learning_rate": 2e-05,
"loss": 0.735899829864502,
"step": 670
},
{
"epoch": 0.01864495078281374,
"grad_norm": 2.2804717033812687,
"learning_rate": 2e-05,
"loss": 0.7463047981262207,
"step": 680
},
{
"epoch": 0.01891914123550218,
"grad_norm": 2.6630744686256174,
"learning_rate": 2e-05,
"loss": 0.7112466812133789,
"step": 690
},
{
"epoch": 0.019193331688190617,
"grad_norm": 8.59421748677637,
"learning_rate": 2e-05,
"loss": 0.8032501220703125,
"step": 700
},
{
"epoch": 0.019467522140879056,
"grad_norm": 6.839099911030037,
"learning_rate": 2e-05,
"loss": 0.7257285118103027,
"step": 710
},
{
"epoch": 0.019741712593567492,
"grad_norm": 6.527196880605798,
"learning_rate": 2e-05,
"loss": 0.7394065856933594,
"step": 720
},
{
"epoch": 0.020015903046255928,
"grad_norm": 4.91546686150854,
"learning_rate": 2e-05,
"loss": 0.7233449459075928,
"step": 730
},
{
"epoch": 0.020290093498944367,
"grad_norm": 9.615722695591046,
"learning_rate": 2e-05,
"loss": 0.714713191986084,
"step": 740
},
{
"epoch": 0.020564283951632803,
"grad_norm": 2.6469047522209244,
"learning_rate": 2e-05,
"loss": 0.7250522613525391,
"step": 750
},
{
"epoch": 0.020838474404321242,
"grad_norm": 27.513230581702402,
"learning_rate": 2e-05,
"loss": 0.709619665145874,
"step": 760
},
{
"epoch": 0.021112664857009678,
"grad_norm": 2.3305572520941102,
"learning_rate": 2e-05,
"loss": 0.7650126457214356,
"step": 770
},
{
"epoch": 0.021386855309698118,
"grad_norm": 1.7645473455518579,
"learning_rate": 2e-05,
"loss": 0.7501170635223389,
"step": 780
},
{
"epoch": 0.021661045762386553,
"grad_norm": 2.706703322701269,
"learning_rate": 2e-05,
"loss": 0.7390304565429687,
"step": 790
},
{
"epoch": 0.02193523621507499,
"grad_norm": 1.343452945442269,
"learning_rate": 2e-05,
"loss": 0.7560922145843506,
"step": 800
},
{
"epoch": 0.02220942666776343,
"grad_norm": 1.8131674161495455,
"learning_rate": 2e-05,
"loss": 0.7617329597473145,
"step": 810
},
{
"epoch": 0.022483617120451865,
"grad_norm": 6.6257304148619,
"learning_rate": 2e-05,
"loss": 0.7030315399169922,
"step": 820
},
{
"epoch": 0.022757807573140304,
"grad_norm": 2.7477972541714237,
"learning_rate": 2e-05,
"loss": 0.7051456451416016,
"step": 830
},
{
"epoch": 0.02303199802582874,
"grad_norm": 1.8551689554260649,
"learning_rate": 2e-05,
"loss": 0.790980863571167,
"step": 840
},
{
"epoch": 0.02330618847851718,
"grad_norm": 4.091035715965749,
"learning_rate": 2e-05,
"loss": 0.7167482376098633,
"step": 850
},
{
"epoch": 0.023580378931205615,
"grad_norm": 3.13444342764459,
"learning_rate": 2e-05,
"loss": 0.7428287506103516,
"step": 860
},
{
"epoch": 0.023854569383894055,
"grad_norm": 7.428502868185567,
"learning_rate": 2e-05,
"loss": 0.7720952510833741,
"step": 870
},
{
"epoch": 0.02412875983658249,
"grad_norm": 2.738880412295684,
"learning_rate": 2e-05,
"loss": 0.7307533264160156,
"step": 880
},
{
"epoch": 0.024402950289270926,
"grad_norm": 5.442319700482665,
"learning_rate": 2e-05,
"loss": 0.7590367794036865,
"step": 890
},
{
"epoch": 0.024677140741959366,
"grad_norm": 4.209775631505361,
"learning_rate": 2e-05,
"loss": 0.7398377418518066,
"step": 900
},
{
"epoch": 0.0249513311946478,
"grad_norm": 3.317366374639838,
"learning_rate": 2e-05,
"loss": 0.7573592662811279,
"step": 910
},
{
"epoch": 0.02522552164733624,
"grad_norm": 2.21708523073645,
"learning_rate": 2e-05,
"loss": 0.7442788124084473,
"step": 920
},
{
"epoch": 0.025499712100024677,
"grad_norm": 5.003510596258695,
"learning_rate": 2e-05,
"loss": 0.7208542823791504,
"step": 930
},
{
"epoch": 0.025773902552713116,
"grad_norm": 1.8666696979850983,
"learning_rate": 2e-05,
"loss": 0.7219260215759278,
"step": 940
},
{
"epoch": 0.026048093005401552,
"grad_norm": 2.319707094464392,
"learning_rate": 2e-05,
"loss": 0.705035400390625,
"step": 950
},
{
"epoch": 0.026322283458089988,
"grad_norm": 1.559433923602148,
"learning_rate": 2e-05,
"loss": 0.7253781795501709,
"step": 960
},
{
"epoch": 0.026596473910778427,
"grad_norm": 3.1103622605289294,
"learning_rate": 2e-05,
"loss": 0.7434506416320801,
"step": 970
},
{
"epoch": 0.026870664363466863,
"grad_norm": 4.482952591971397,
"learning_rate": 2e-05,
"loss": 0.7423406600952148,
"step": 980
},
{
"epoch": 0.027144854816155303,
"grad_norm": 2.349643537640656,
"learning_rate": 2e-05,
"loss": 0.7380632400512696,
"step": 990
},
{
"epoch": 0.02741904526884374,
"grad_norm": 6.624084473754211,
"learning_rate": 2e-05,
"loss": 0.7448741912841796,
"step": 1000
},
{
"epoch": 0.027693235721532178,
"grad_norm": 1.959542744744174,
"learning_rate": 2e-05,
"loss": 0.7620717048645019,
"step": 1010
},
{
"epoch": 0.027967426174220614,
"grad_norm": 1.9359370487542638,
"learning_rate": 2e-05,
"loss": 0.7283543586730957,
"step": 1020
},
{
"epoch": 0.02824161662690905,
"grad_norm": 3.7510091510273424,
"learning_rate": 2e-05,
"loss": 0.7341510772705078,
"step": 1030
},
{
"epoch": 0.02851580707959749,
"grad_norm": 1.645233108914731,
"learning_rate": 2e-05,
"loss": 0.7321323394775391,
"step": 1040
},
{
"epoch": 0.028789997532285925,
"grad_norm": 5.060129114701537,
"learning_rate": 2e-05,
"loss": 0.7923129558563232,
"step": 1050
},
{
"epoch": 0.029064187984974364,
"grad_norm": 6.767343077930711,
"learning_rate": 2e-05,
"loss": 0.7364850997924804,
"step": 1060
},
{
"epoch": 0.0293383784376628,
"grad_norm": 7.157354259172915,
"learning_rate": 2e-05,
"loss": 0.7175948143005371,
"step": 1070
},
{
"epoch": 0.02961256889035124,
"grad_norm": 10.118526445754803,
"learning_rate": 2e-05,
"loss": 0.6956705093383789,
"step": 1080
},
{
"epoch": 0.029886759343039675,
"grad_norm": 3.2975128574851205,
"learning_rate": 2e-05,
"loss": 0.7435084342956543,
"step": 1090
},
{
"epoch": 0.03016094979572811,
"grad_norm": 3.79438108252297,
"learning_rate": 2e-05,
"loss": 0.7209542274475098,
"step": 1100
},
{
"epoch": 0.03043514024841655,
"grad_norm": 3.6413783178286896,
"learning_rate": 2e-05,
"loss": 0.7462982177734375,
"step": 1110
},
{
"epoch": 0.030709330701104987,
"grad_norm": 2.4359365603997323,
"learning_rate": 2e-05,
"loss": 0.7772771835327148,
"step": 1120
},
{
"epoch": 0.030983521153793426,
"grad_norm": 2.067253539210089,
"learning_rate": 2e-05,
"loss": 0.754563283920288,
"step": 1130
},
{
"epoch": 0.031257711606481865,
"grad_norm": 1.3603842511083,
"learning_rate": 2e-05,
"loss": 0.7163387298583984,
"step": 1140
},
{
"epoch": 0.0315319020591703,
"grad_norm": 7.634204958345298,
"learning_rate": 2e-05,
"loss": 0.7153648376464844,
"step": 1150
},
{
"epoch": 0.03180609251185874,
"grad_norm": 2.224287938133906,
"learning_rate": 2e-05,
"loss": 0.7743209838867188,
"step": 1160
},
{
"epoch": 0.03208028296454717,
"grad_norm": 8.328106347948369,
"learning_rate": 2e-05,
"loss": 0.7125131130218506,
"step": 1170
},
{
"epoch": 0.03235447341723561,
"grad_norm": 4.9140382117559716,
"learning_rate": 2e-05,
"loss": 0.734964656829834,
"step": 1180
},
{
"epoch": 0.03262866386992405,
"grad_norm": 1.6437427011396712,
"learning_rate": 2e-05,
"loss": 0.736287260055542,
"step": 1190
},
{
"epoch": 0.03290285432261249,
"grad_norm": 1.7984413046378422,
"learning_rate": 2e-05,
"loss": 0.6888255119323731,
"step": 1200
},
{
"epoch": 0.03317704477530092,
"grad_norm": 3.003273429621072,
"learning_rate": 2e-05,
"loss": 0.7354516506195068,
"step": 1210
},
{
"epoch": 0.03345123522798936,
"grad_norm": 1.581766516298146,
"learning_rate": 2e-05,
"loss": 0.7175889492034913,
"step": 1220
},
{
"epoch": 0.0337254256806778,
"grad_norm": 2.3247470513343185,
"learning_rate": 2e-05,
"loss": 0.714189863204956,
"step": 1230
},
{
"epoch": 0.03399961613336624,
"grad_norm": 7.9334494235192325,
"learning_rate": 2e-05,
"loss": 0.7136695861816407,
"step": 1240
},
{
"epoch": 0.034273806586054674,
"grad_norm": 49.62487496955337,
"learning_rate": 2e-05,
"loss": 0.7086945533752441,
"step": 1250
},
{
"epoch": 0.03454799703874311,
"grad_norm": 2.890774584879648,
"learning_rate": 2e-05,
"loss": 0.7269087791442871,
"step": 1260
},
{
"epoch": 0.034822187491431546,
"grad_norm": 4.796531005737684,
"learning_rate": 2e-05,
"loss": 0.7484929084777832,
"step": 1270
},
{
"epoch": 0.03509637794411999,
"grad_norm": 1.6372708148105157,
"learning_rate": 2e-05,
"loss": 0.6999114036560059,
"step": 1280
},
{
"epoch": 0.035370568396808424,
"grad_norm": 4.162341191850801,
"learning_rate": 2e-05,
"loss": 0.7129648208618165,
"step": 1290
},
{
"epoch": 0.03564475884949686,
"grad_norm": 4.017056556093628,
"learning_rate": 2e-05,
"loss": 0.7217267036437989,
"step": 1300
},
{
"epoch": 0.035918949302185296,
"grad_norm": 9.786655951652824,
"learning_rate": 2e-05,
"loss": 0.7361152648925782,
"step": 1310
},
{
"epoch": 0.03619313975487373,
"grad_norm": 17.798888728639277,
"learning_rate": 2e-05,
"loss": 0.7423253059387207,
"step": 1320
},
{
"epoch": 0.036467330207562175,
"grad_norm": 25.98230175781132,
"learning_rate": 2e-05,
"loss": 0.7079302787780761,
"step": 1330
},
{
"epoch": 0.03674152066025061,
"grad_norm": 4.107909151191186,
"learning_rate": 2e-05,
"loss": 0.7637813568115235,
"step": 1340
},
{
"epoch": 0.03701571111293905,
"grad_norm": 1.8177555687046802,
"learning_rate": 2e-05,
"loss": 0.7440331459045411,
"step": 1350
},
{
"epoch": 0.03728990156562748,
"grad_norm": 6.631474920460703,
"learning_rate": 2e-05,
"loss": 0.7420357704162598,
"step": 1360
},
{
"epoch": 0.037564092018315925,
"grad_norm": 1.182591249805126,
"learning_rate": 2e-05,
"loss": 0.7243555068969727,
"step": 1370
},
{
"epoch": 0.03783828247100436,
"grad_norm": 1.5239290367740697,
"learning_rate": 2e-05,
"loss": 0.7780046463012695,
"step": 1380
},
{
"epoch": 0.0381124729236928,
"grad_norm": 1.9611702789468477,
"learning_rate": 2e-05,
"loss": 0.7606742858886719,
"step": 1390
},
{
"epoch": 0.03838666337638123,
"grad_norm": 3.4538398959809564,
"learning_rate": 2e-05,
"loss": 0.7161018371582031,
"step": 1400
},
{
"epoch": 0.03866085382906967,
"grad_norm": 6.74405592418129,
"learning_rate": 2e-05,
"loss": 0.7269341945648193,
"step": 1410
},
{
"epoch": 0.03893504428175811,
"grad_norm": 5.0613023509206,
"learning_rate": 2e-05,
"loss": 0.7150623321533203,
"step": 1420
},
{
"epoch": 0.03920923473444655,
"grad_norm": 15.935601654785444,
"learning_rate": 2e-05,
"loss": 0.6991084098815918,
"step": 1430
},
{
"epoch": 0.039483425187134984,
"grad_norm": 189.58206876056943,
"learning_rate": 2e-05,
"loss": 0.715428352355957,
"step": 1440
},
{
"epoch": 0.03975761563982342,
"grad_norm": 13.224258279776146,
"learning_rate": 2e-05,
"loss": 0.7448666572570801,
"step": 1450
},
{
"epoch": 0.040031806092511855,
"grad_norm": 15.23890210961455,
"learning_rate": 2e-05,
"loss": 0.7545663833618164,
"step": 1460
},
{
"epoch": 0.0403059965452003,
"grad_norm": 2.089772579003186,
"learning_rate": 2e-05,
"loss": 0.7143968105316162,
"step": 1470
},
{
"epoch": 0.040580186997888734,
"grad_norm": 672.5570249806746,
"learning_rate": 2e-05,
"loss": 0.6955307960510254,
"step": 1480
},
{
"epoch": 0.04085437745057717,
"grad_norm": 2.499047720535622,
"learning_rate": 2e-05,
"loss": 0.7183216094970704,
"step": 1490
},
{
"epoch": 0.041128567903265606,
"grad_norm": 1.6820671266931866,
"learning_rate": 2e-05,
"loss": 0.7442133903503418,
"step": 1500
},
{
"epoch": 0.04140275835595405,
"grad_norm": 1.6322487359391142,
"learning_rate": 2e-05,
"loss": 0.7415005683898925,
"step": 1510
},
{
"epoch": 0.041676948808642485,
"grad_norm": 2.0768691766562974,
"learning_rate": 2e-05,
"loss": 0.7350949764251709,
"step": 1520
},
{
"epoch": 0.04195113926133092,
"grad_norm": 3.462638107939682,
"learning_rate": 2e-05,
"loss": 0.6958516597747803,
"step": 1530
},
{
"epoch": 0.042225329714019356,
"grad_norm": 1.9410342316482636,
"learning_rate": 2e-05,
"loss": 0.7019001960754394,
"step": 1540
},
{
"epoch": 0.04249952016670779,
"grad_norm": 2.2435234267896944,
"learning_rate": 2e-05,
"loss": 0.7038233757019043,
"step": 1550
},
{
"epoch": 0.042773710619396235,
"grad_norm": 50.31729516447788,
"learning_rate": 2e-05,
"loss": 0.6971765041351319,
"step": 1560
},
{
"epoch": 0.04304790107208467,
"grad_norm": 6.726153221416043,
"learning_rate": 2e-05,
"loss": 0.7901406764984131,
"step": 1570
},
{
"epoch": 0.04332209152477311,
"grad_norm": 25.290061958502374,
"learning_rate": 2e-05,
"loss": 0.7404637813568116,
"step": 1580
},
{
"epoch": 0.04359628197746154,
"grad_norm": 11.648387859593914,
"learning_rate": 2e-05,
"loss": 0.7325190544128418,
"step": 1590
},
{
"epoch": 0.04387047243014998,
"grad_norm": 3.998377511327454,
"learning_rate": 2e-05,
"loss": 0.6938001155853272,
"step": 1600
},
{
"epoch": 0.04414466288283842,
"grad_norm": 1.4609573707991412,
"learning_rate": 2e-05,
"loss": 0.6974159240722656,
"step": 1610
},
{
"epoch": 0.04441885333552686,
"grad_norm": 1.2908767847499276,
"learning_rate": 2e-05,
"loss": 0.735476303100586,
"step": 1620
},
{
"epoch": 0.04469304378821529,
"grad_norm": 1.5263587301999937,
"learning_rate": 2e-05,
"loss": 0.6849418640136719,
"step": 1630
},
{
"epoch": 0.04496723424090373,
"grad_norm": 2.71012026891521,
"learning_rate": 2e-05,
"loss": 0.6952274322509766,
"step": 1640
},
{
"epoch": 0.04524142469359217,
"grad_norm": 1.5738552850120824,
"learning_rate": 2e-05,
"loss": 0.7284816265106201,
"step": 1650
},
{
"epoch": 0.04551561514628061,
"grad_norm": 1.5435257666345013,
"learning_rate": 2e-05,
"loss": 0.7115949153900146,
"step": 1660
},
{
"epoch": 0.045789805598969044,
"grad_norm": 1.516425220632835,
"learning_rate": 2e-05,
"loss": 0.6966533660888672,
"step": 1670
},
{
"epoch": 0.04606399605165748,
"grad_norm": 1.4858677693562772,
"learning_rate": 2e-05,
"loss": 0.712862491607666,
"step": 1680
},
{
"epoch": 0.046338186504345916,
"grad_norm": 1.1928774431737874,
"learning_rate": 2e-05,
"loss": 0.715973949432373,
"step": 1690
},
{
"epoch": 0.04661237695703436,
"grad_norm": 1.3801750667103458,
"learning_rate": 2e-05,
"loss": 0.6785056114196777,
"step": 1700
},
{
"epoch": 0.046886567409722794,
"grad_norm": 1.1562227123885702,
"learning_rate": 2e-05,
"loss": 0.6806015014648438,
"step": 1710
},
{
"epoch": 0.04716075786241123,
"grad_norm": 1.966065169897555,
"learning_rate": 2e-05,
"loss": 0.6789681911468506,
"step": 1720
},
{
"epoch": 0.047434948315099666,
"grad_norm": 1.796240102087905,
"learning_rate": 2e-05,
"loss": 0.6643640041351319,
"step": 1730
},
{
"epoch": 0.04770913876778811,
"grad_norm": 1.4714599948408273,
"learning_rate": 2e-05,
"loss": 0.672383975982666,
"step": 1740
},
{
"epoch": 0.047983329220476545,
"grad_norm": 1.05613596470809,
"learning_rate": 2e-05,
"loss": 0.6921384334564209,
"step": 1750
},
{
"epoch": 0.04825751967316498,
"grad_norm": 1.168321764739896,
"learning_rate": 2e-05,
"loss": 0.6853407859802246,
"step": 1760
},
{
"epoch": 0.04853171012585342,
"grad_norm": 1.304231611987027,
"learning_rate": 2e-05,
"loss": 0.6831422328948975,
"step": 1770
},
{
"epoch": 0.04880590057854185,
"grad_norm": 1.271885101891083,
"learning_rate": 2e-05,
"loss": 0.7312606811523438,
"step": 1780
},
{
"epoch": 0.049080091031230295,
"grad_norm": 1.1274168419233672,
"learning_rate": 2e-05,
"loss": 0.7195809841156006,
"step": 1790
},
{
"epoch": 0.04935428148391873,
"grad_norm": 2.1060356897000196,
"learning_rate": 2e-05,
"loss": 0.6862109184265137,
"step": 1800
},
{
"epoch": 0.04962847193660717,
"grad_norm": 1.1668574261874323,
"learning_rate": 2e-05,
"loss": 0.7068725109100342,
"step": 1810
},
{
"epoch": 0.0499026623892956,
"grad_norm": 3.1583477159166673,
"learning_rate": 2e-05,
"loss": 0.7150220394134521,
"step": 1820
},
{
"epoch": 0.05017685284198404,
"grad_norm": 1.5843620172233683,
"learning_rate": 2e-05,
"loss": 0.66549072265625,
"step": 1830
},
{
"epoch": 0.05045104329467248,
"grad_norm": 1.2547928536390052,
"learning_rate": 2e-05,
"loss": 0.7375857353210449,
"step": 1840
},
{
"epoch": 0.05072523374736092,
"grad_norm": 4.29725259279178,
"learning_rate": 2e-05,
"loss": 0.6876885890960693,
"step": 1850
},
{
"epoch": 0.050999424200049354,
"grad_norm": 1.9025925412069744,
"learning_rate": 2e-05,
"loss": 0.7387830734252929,
"step": 1860
},
{
"epoch": 0.05127361465273779,
"grad_norm": 1.5406949311604028,
"learning_rate": 2e-05,
"loss": 0.6733179092407227,
"step": 1870
},
{
"epoch": 0.05154780510542623,
"grad_norm": 20.215212215144863,
"learning_rate": 2e-05,
"loss": 0.7654403686523438,
"step": 1880
},
{
"epoch": 0.05182199555811467,
"grad_norm": 1.5669531048405803,
"learning_rate": 2e-05,
"loss": 0.7350390911102295,
"step": 1890
},
{
"epoch": 0.052096186010803104,
"grad_norm": 7.2191546562371425,
"learning_rate": 2e-05,
"loss": 0.7414397716522216,
"step": 1900
},
{
"epoch": 0.05237037646349154,
"grad_norm": 1.2325274169727398,
"learning_rate": 2e-05,
"loss": 0.7655929088592529,
"step": 1910
},
{
"epoch": 0.052644566916179976,
"grad_norm": 1.1944179026527708,
"learning_rate": 2e-05,
"loss": 0.7075240135192871,
"step": 1920
},
{
"epoch": 0.05291875736886842,
"grad_norm": 1.302822879313398,
"learning_rate": 2e-05,
"loss": 0.6797014236450195,
"step": 1930
},
{
"epoch": 0.053192947821556855,
"grad_norm": 2.0168747405099747,
"learning_rate": 2e-05,
"loss": 0.7000571727752686,
"step": 1940
},
{
"epoch": 0.05346713827424529,
"grad_norm": 1.6344897385611805,
"learning_rate": 2e-05,
"loss": 0.7235137939453125,
"step": 1950
},
{
"epoch": 0.053741328726933726,
"grad_norm": 3.5766753006414125,
"learning_rate": 2e-05,
"loss": 0.7371991634368896,
"step": 1960
},
{
"epoch": 0.05401551917962216,
"grad_norm": 1.4953479982574733,
"learning_rate": 2e-05,
"loss": 0.7229987621307373,
"step": 1970
},
{
"epoch": 0.054289709632310605,
"grad_norm": 1.6598347475638233,
"learning_rate": 2e-05,
"loss": 0.6758342742919922,
"step": 1980
},
{
"epoch": 0.05456390008499904,
"grad_norm": 1.3876361065240026,
"learning_rate": 2e-05,
"loss": 0.6621166229248047,
"step": 1990
},
{
"epoch": 0.05483809053768748,
"grad_norm": 1.2953540155757288,
"learning_rate": 2e-05,
"loss": 0.701081657409668,
"step": 2000
},
{
"epoch": 0.05511228099037591,
"grad_norm": 1.0757376098134102,
"learning_rate": 2e-05,
"loss": 0.6949031829833985,
"step": 2010
},
{
"epoch": 0.055386471443064356,
"grad_norm": 1.3515745918409625,
"learning_rate": 2e-05,
"loss": 0.6849285125732422,
"step": 2020
},
{
"epoch": 0.05566066189575279,
"grad_norm": 3.4678908742290884,
"learning_rate": 2e-05,
"loss": 0.6919690608978272,
"step": 2030
}
],
"logging_steps": 10,
"max_steps": 5935,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 2035,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 963613493821440.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}