Gemma2-9b-cv93 / trainer_state.json
FMZGL's picture
refactor: track tokenizer.json using Git LFS
4889745
Raw
History Blame Contribute Delete
115 kB
{
"best_global_step": 3600,
"best_metric": 0.36828258633613586,
"best_model_checkpoint": "saves/Gemma-2-9B/lora_seqcls/train_seqcls/checkpoint-1000",
"epoch": 2.9603014399138745,
"eval_steps": 100,
"global_step": 5500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0053828556048983985,
"grad_norm": 198.63441467285156,
"learning_rate": 6.474820143884892e-06,
"loss": 19.1404296875,
"step": 10
},
{
"epoch": 0.010765711209796797,
"grad_norm": 130.11439514160156,
"learning_rate": 1.366906474820144e-05,
"loss": 16.12879333496094,
"step": 20
},
{
"epoch": 0.016148566814695196,
"grad_norm": 94.73497009277344,
"learning_rate": 2.0863309352517988e-05,
"loss": 11.966738891601562,
"step": 30
},
{
"epoch": 0.021531422419593594,
"grad_norm": 55.8490104675293,
"learning_rate": 2.805755395683453e-05,
"loss": 9.874456787109375,
"step": 40
},
{
"epoch": 0.02691427802449199,
"grad_norm": 53.740142822265625,
"learning_rate": 3.5251798561151075e-05,
"loss": 7.273980712890625,
"step": 50
},
{
"epoch": 0.03229713362939039,
"grad_norm": 83.30630493164062,
"learning_rate": 4.244604316546763e-05,
"loss": 6.787509155273438,
"step": 60
},
{
"epoch": 0.03767998923428879,
"grad_norm": 96.4136734008789,
"learning_rate": 4.964028776978418e-05,
"loss": 6.7754661560058596,
"step": 70
},
{
"epoch": 0.04306284483918719,
"grad_norm": 77.66259765625,
"learning_rate": 5.683453237410072e-05,
"loss": 5.704140853881836,
"step": 80
},
{
"epoch": 0.04844570044408559,
"grad_norm": 46.28746032714844,
"learning_rate": 6.402877697841726e-05,
"loss": 4.287641906738282,
"step": 90
},
{
"epoch": 0.05382855604898398,
"grad_norm": 121.80719757080078,
"learning_rate": 7.122302158273382e-05,
"loss": 4.469888305664062,
"step": 100
},
{
"epoch": 0.05382855604898398,
"eval_loss": 1.1105364561080933,
"eval_runtime": 64.1061,
"eval_samples_per_second": 51.524,
"eval_steps_per_second": 12.885,
"step": 100
},
{
"epoch": 0.059211411653882384,
"grad_norm": 82.3691635131836,
"learning_rate": 7.841726618705037e-05,
"loss": 4.892630767822266,
"step": 110
},
{
"epoch": 0.06459426725878079,
"grad_norm": 53.88746643066406,
"learning_rate": 8.561151079136692e-05,
"loss": 3.885559844970703,
"step": 120
},
{
"epoch": 0.06997712286367919,
"grad_norm": 59.405372619628906,
"learning_rate": 9.280575539568345e-05,
"loss": 3.8151809692382814,
"step": 130
},
{
"epoch": 0.07535997846857757,
"grad_norm": 85.99320220947266,
"learning_rate": 0.0001,
"loss": 4.0115612030029295,
"step": 140
},
{
"epoch": 0.08074283407347597,
"grad_norm": 40.51960754394531,
"learning_rate": 0.00010719424460431656,
"loss": 3.4070945739746095,
"step": 150
},
{
"epoch": 0.08612568967837438,
"grad_norm": 73.72062683105469,
"learning_rate": 0.00011438848920863309,
"loss": 4.7824043273925785,
"step": 160
},
{
"epoch": 0.09150854528327278,
"grad_norm": 62.74378204345703,
"learning_rate": 0.00012158273381294964,
"loss": 4.632376480102539,
"step": 170
},
{
"epoch": 0.09689140088817118,
"grad_norm": 41.6406364440918,
"learning_rate": 0.0001287769784172662,
"loss": 3.02130126953125,
"step": 180
},
{
"epoch": 0.10227425649306958,
"grad_norm": 55.67851257324219,
"learning_rate": 0.00013597122302158273,
"loss": 4.105777359008789,
"step": 190
},
{
"epoch": 0.10765711209796797,
"grad_norm": 88.68601989746094,
"learning_rate": 0.0001431654676258993,
"loss": 3.745909881591797,
"step": 200
},
{
"epoch": 0.10765711209796797,
"eval_loss": 1.129400610923767,
"eval_runtime": 64.0494,
"eval_samples_per_second": 51.57,
"eval_steps_per_second": 12.896,
"step": 200
},
{
"epoch": 0.11303996770286637,
"grad_norm": 44.12594223022461,
"learning_rate": 0.00015035971223021583,
"loss": 4.0704700469970705,
"step": 210
},
{
"epoch": 0.11842282330776477,
"grad_norm": 41.71208572387695,
"learning_rate": 0.00015755395683453237,
"loss": 3.3986480712890623,
"step": 220
},
{
"epoch": 0.12380567891266317,
"grad_norm": 51.5625,
"learning_rate": 0.00016474820143884893,
"loss": 3.7478317260742187,
"step": 230
},
{
"epoch": 0.12918853451756157,
"grad_norm": 54.59484100341797,
"learning_rate": 0.00017194244604316547,
"loss": 4.002623748779297,
"step": 240
},
{
"epoch": 0.13457139012245997,
"grad_norm": 34.029727935791016,
"learning_rate": 0.000179136690647482,
"loss": 3.538894271850586,
"step": 250
},
{
"epoch": 0.13995424572735837,
"grad_norm": 19.37107276916504,
"learning_rate": 0.00018633093525179857,
"loss": 3.356983184814453,
"step": 260
},
{
"epoch": 0.14533710133225677,
"grad_norm": 58.17410659790039,
"learning_rate": 0.0001935251798561151,
"loss": 3.4610286712646485,
"step": 270
},
{
"epoch": 0.15071995693715515,
"grad_norm": 115.1293716430664,
"learning_rate": 0.00019999998240562744,
"loss": 4.566124343872071,
"step": 280
},
{
"epoch": 0.15610281254205355,
"grad_norm": 52.380348205566406,
"learning_rate": 0.0001999978710884105,
"loss": 4.061540222167968,
"step": 290
},
{
"epoch": 0.16148566814695195,
"grad_norm": 63.469581604003906,
"learning_rate": 0.00019999224098180877,
"loss": 3.930801773071289,
"step": 300
},
{
"epoch": 0.16148566814695195,
"eval_loss": 0.9815971255302429,
"eval_runtime": 64.185,
"eval_samples_per_second": 51.461,
"eval_steps_per_second": 12.869,
"step": 300
},
{
"epoch": 0.16686852375185035,
"grad_norm": 18.164447784423828,
"learning_rate": 0.00019998309228393805,
"loss": 4.083843612670899,
"step": 310
},
{
"epoch": 0.17225137935674875,
"grad_norm": 93.28253936767578,
"learning_rate": 0.00019997042531672858,
"loss": 3.1324670791625975,
"step": 320
},
{
"epoch": 0.17763423496164715,
"grad_norm": 49.66929626464844,
"learning_rate": 0.00019995424052591376,
"loss": 4.83184928894043,
"step": 330
},
{
"epoch": 0.18301709056654555,
"grad_norm": 43.669410705566406,
"learning_rate": 0.00019993453848101442,
"loss": 3.0538238525390624,
"step": 340
},
{
"epoch": 0.18839994617144395,
"grad_norm": 28.3753719329834,
"learning_rate": 0.00019991131987531877,
"loss": 3.760041427612305,
"step": 350
},
{
"epoch": 0.19378280177634236,
"grad_norm": 26.99091148376465,
"learning_rate": 0.00019988458552585808,
"loss": 3.3557403564453123,
"step": 360
},
{
"epoch": 0.19916565738124076,
"grad_norm": 42.94520568847656,
"learning_rate": 0.00019985433637337776,
"loss": 3.5249252319335938,
"step": 370
},
{
"epoch": 0.20454851298613916,
"grad_norm": 34.760292053222656,
"learning_rate": 0.00019982057348230447,
"loss": 3.889664077758789,
"step": 380
},
{
"epoch": 0.20993136859103753,
"grad_norm": 22.45956802368164,
"learning_rate": 0.00019978329804070858,
"loss": 3.2252212524414063,
"step": 390
},
{
"epoch": 0.21531422419593593,
"grad_norm": 54.65021514892578,
"learning_rate": 0.0001997425113602622,
"loss": 3.99298095703125,
"step": 400
},
{
"epoch": 0.21531422419593593,
"eval_loss": 0.8698179721832275,
"eval_runtime": 64.4139,
"eval_samples_per_second": 51.278,
"eval_steps_per_second": 12.823,
"step": 400
},
{
"epoch": 0.22069707980083433,
"grad_norm": 37.18206024169922,
"learning_rate": 0.0001996982148761933,
"loss": 2.9811370849609373,
"step": 410
},
{
"epoch": 0.22607993540573273,
"grad_norm": 33.8664436340332,
"learning_rate": 0.0001996504101472351,
"loss": 2.5169837951660154,
"step": 420
},
{
"epoch": 0.23146279101063114,
"grad_norm": 45.07470703125,
"learning_rate": 0.00019959909885557112,
"loss": 3.458451843261719,
"step": 430
},
{
"epoch": 0.23684564661552954,
"grad_norm": 25.689266204833984,
"learning_rate": 0.00019954428280677603,
"loss": 3.2378326416015626,
"step": 440
},
{
"epoch": 0.24222850222042794,
"grad_norm": 53.7376594543457,
"learning_rate": 0.0001994859639297522,
"loss": 3.302751159667969,
"step": 450
},
{
"epoch": 0.24761135782532634,
"grad_norm": 49.085391998291016,
"learning_rate": 0.00019942414427666187,
"loss": 2.930678939819336,
"step": 460
},
{
"epoch": 0.2529942134302247,
"grad_norm": 23.53020477294922,
"learning_rate": 0.00019935882602285462,
"loss": 3.5229896545410155,
"step": 470
},
{
"epoch": 0.25837706903512314,
"grad_norm": 42.54838562011719,
"learning_rate": 0.00019929001146679127,
"loss": 3.073961639404297,
"step": 480
},
{
"epoch": 0.2637599246400215,
"grad_norm": 36.783966064453125,
"learning_rate": 0.0001992177030299626,
"loss": 2.839693069458008,
"step": 490
},
{
"epoch": 0.26914278024491994,
"grad_norm": 29.89275360107422,
"learning_rate": 0.0001991419032568044,
"loss": 3.5954513549804688,
"step": 500
},
{
"epoch": 0.26914278024491994,
"eval_loss": 0.7735958099365234,
"eval_runtime": 64.2996,
"eval_samples_per_second": 51.369,
"eval_steps_per_second": 12.846,
"step": 500
},
{
"epoch": 0.2745256358498183,
"grad_norm": 15.766196250915527,
"learning_rate": 0.0001990626148146078,
"loss": 2.6433101654052735,
"step": 510
},
{
"epoch": 0.27990849145471675,
"grad_norm": 15.622676849365234,
"learning_rate": 0.00019897984049342552,
"loss": 2.2897308349609373,
"step": 520
},
{
"epoch": 0.2852913470596151,
"grad_norm": 64.56971740722656,
"learning_rate": 0.0001988935832059736,
"loss": 4.1805778503417965,
"step": 530
},
{
"epoch": 0.29067420266451355,
"grad_norm": 30.153961181640625,
"learning_rate": 0.0001988038459875289,
"loss": 2.8382762908935546,
"step": 540
},
{
"epoch": 0.2960570582694119,
"grad_norm": 28.525348663330078,
"learning_rate": 0.00019871063199582237,
"loss": 3.3420616149902345,
"step": 550
},
{
"epoch": 0.3014399138743103,
"grad_norm": 25.80811882019043,
"learning_rate": 0.0001986139445109279,
"loss": 2.491804504394531,
"step": 560
},
{
"epoch": 0.3068227694792087,
"grad_norm": 42.330684661865234,
"learning_rate": 0.00019851378693514686,
"loss": 3.0271644592285156,
"step": 570
},
{
"epoch": 0.3122056250841071,
"grad_norm": 40.063087463378906,
"learning_rate": 0.00019841016279288846,
"loss": 2.38574161529541,
"step": 580
},
{
"epoch": 0.3175884806890055,
"grad_norm": 36.078636169433594,
"learning_rate": 0.0001983030757305456,
"loss": 2.8599777221679688,
"step": 590
},
{
"epoch": 0.3229713362939039,
"grad_norm": 37.90999984741211,
"learning_rate": 0.0001981925295163667,
"loss": 3.3058528900146484,
"step": 600
},
{
"epoch": 0.3229713362939039,
"eval_loss": 0.724442720413208,
"eval_runtime": 64.0896,
"eval_samples_per_second": 51.537,
"eval_steps_per_second": 12.888,
"step": 600
},
{
"epoch": 0.32835419189880233,
"grad_norm": 34.73746871948242,
"learning_rate": 0.00019807852804032305,
"loss": 3.4641307830810546,
"step": 610
},
{
"epoch": 0.3337370475037007,
"grad_norm": 72.2687759399414,
"learning_rate": 0.00019796107531397188,
"loss": 4.683813858032226,
"step": 620
},
{
"epoch": 0.33911990310859913,
"grad_norm": 30.93055534362793,
"learning_rate": 0.00019784017547031522,
"loss": 2.6965951919555664,
"step": 630
},
{
"epoch": 0.3445027587134975,
"grad_norm": 18.676742553710938,
"learning_rate": 0.00019771583276365453,
"loss": 2.5014991760253906,
"step": 640
},
{
"epoch": 0.34988561431839593,
"grad_norm": 42.73445510864258,
"learning_rate": 0.0001975880515694409,
"loss": 3.033338737487793,
"step": 650
},
{
"epoch": 0.3552684699232943,
"grad_norm": 47.229732513427734,
"learning_rate": 0.00019745683638412116,
"loss": 3.065496635437012,
"step": 660
},
{
"epoch": 0.3606513255281927,
"grad_norm": 36.450660705566406,
"learning_rate": 0.00019732219182497964,
"loss": 2.9941673278808594,
"step": 670
},
{
"epoch": 0.3660341811330911,
"grad_norm": 45.24620056152344,
"learning_rate": 0.00019718412262997566,
"loss": 2.664113998413086,
"step": 680
},
{
"epoch": 0.3714170367379895,
"grad_norm": 22.437503814697266,
"learning_rate": 0.0001970426336575768,
"loss": 1.6834583282470703,
"step": 690
},
{
"epoch": 0.3767998923428879,
"grad_norm": 36.59716033935547,
"learning_rate": 0.000196897729886588,
"loss": 2.480428123474121,
"step": 700
},
{
"epoch": 0.3767998923428879,
"eval_loss": 0.6947948932647705,
"eval_runtime": 64.1166,
"eval_samples_per_second": 51.516,
"eval_steps_per_second": 12.883,
"step": 700
},
{
"epoch": 0.3821827479477863,
"grad_norm": 45.49883270263672,
"learning_rate": 0.00019674941641597638,
"loss": 2.7860897064208983,
"step": 710
},
{
"epoch": 0.3875656035526847,
"grad_norm": 33.21625518798828,
"learning_rate": 0.00019659769846469164,
"loss": 3.083520698547363,
"step": 720
},
{
"epoch": 0.3929484591575831,
"grad_norm": 16.77117919921875,
"learning_rate": 0.00019644258137148263,
"loss": 2.312260055541992,
"step": 730
},
{
"epoch": 0.3983313147624815,
"grad_norm": 51.02537536621094,
"learning_rate": 0.00019628407059470938,
"loss": 3.675634002685547,
"step": 740
},
{
"epoch": 0.4037141703673799,
"grad_norm": 20.05516242980957,
"learning_rate": 0.00019612217171215094,
"loss": 2.1038530349731444,
"step": 750
},
{
"epoch": 0.4090970259722783,
"grad_norm": 35.98112869262695,
"learning_rate": 0.00019595689042080944,
"loss": 2.4246122360229494,
"step": 760
},
{
"epoch": 0.4144798815771767,
"grad_norm": 27.854074478149414,
"learning_rate": 0.0001957882325367091,
"loss": 2.453342056274414,
"step": 770
},
{
"epoch": 0.41986273718207506,
"grad_norm": 40.96638870239258,
"learning_rate": 0.000195616203994692,
"loss": 2.2066173553466797,
"step": 780
},
{
"epoch": 0.4252455927869735,
"grad_norm": 19.81163215637207,
"learning_rate": 0.00019544081084820915,
"loss": 2.4471906661987304,
"step": 790
},
{
"epoch": 0.43062844839187187,
"grad_norm": 42.2238883972168,
"learning_rate": 0.00019526205926910734,
"loss": 2.8852027893066405,
"step": 800
},
{
"epoch": 0.43062844839187187,
"eval_loss": 0.7064014077186584,
"eval_runtime": 64.4405,
"eval_samples_per_second": 51.257,
"eval_steps_per_second": 12.818,
"step": 800
},
{
"epoch": 0.4360113039967703,
"grad_norm": 32.852134704589844,
"learning_rate": 0.00019507995554741205,
"loss": 2.385086441040039,
"step": 810
},
{
"epoch": 0.44139415960166867,
"grad_norm": 6.121428489685059,
"learning_rate": 0.00019489450609110618,
"loss": 1.8915294647216796,
"step": 820
},
{
"epoch": 0.4467770152065671,
"grad_norm": 24.810670852661133,
"learning_rate": 0.00019470571742590437,
"loss": 2.8130746841430665,
"step": 830
},
{
"epoch": 0.45215987081146547,
"grad_norm": 32.280818939208984,
"learning_rate": 0.0001945135961950236,
"loss": 2.450386619567871,
"step": 840
},
{
"epoch": 0.4575427264163639,
"grad_norm": 48.205787658691406,
"learning_rate": 0.0001943181491589493,
"loss": 3.0519411087036135,
"step": 850
},
{
"epoch": 0.46292558202126227,
"grad_norm": 22.858253479003906,
"learning_rate": 0.00019411938319519734,
"loss": 2.4671669006347656,
"step": 860
},
{
"epoch": 0.4683084376261607,
"grad_norm": 45.50665283203125,
"learning_rate": 0.00019391730529807238,
"loss": 2.972084808349609,
"step": 870
},
{
"epoch": 0.4736912932310591,
"grad_norm": 19.182138442993164,
"learning_rate": 0.0001937119225784213,
"loss": 1.9543575286865233,
"step": 880
},
{
"epoch": 0.4790741488359575,
"grad_norm": 53.60784149169922,
"learning_rate": 0.00019350324226338338,
"loss": 3.198233413696289,
"step": 890
},
{
"epoch": 0.4844570044408559,
"grad_norm": 28.96963882446289,
"learning_rate": 0.00019329127169613564,
"loss": 3.061937141418457,
"step": 900
},
{
"epoch": 0.4844570044408559,
"eval_loss": 0.6995744109153748,
"eval_runtime": 64.1823,
"eval_samples_per_second": 51.463,
"eval_steps_per_second": 12.87,
"step": 900
},
{
"epoch": 0.48983986004575425,
"grad_norm": 42.73357009887695,
"learning_rate": 0.00019307601833563475,
"loss": 3.221673583984375,
"step": 910
},
{
"epoch": 0.4952227156506527,
"grad_norm": 21.203781127929688,
"learning_rate": 0.00019285748975635437,
"loss": 2.1903615951538087,
"step": 920
},
{
"epoch": 0.500605571255551,
"grad_norm": 21.64086151123047,
"learning_rate": 0.0001926356936480186,
"loss": 2.1224742889404298,
"step": 930
},
{
"epoch": 0.5059884268604494,
"grad_norm": 35.52275466918945,
"learning_rate": 0.0001924106378153316,
"loss": 3.230604553222656,
"step": 940
},
{
"epoch": 0.5113712824653479,
"grad_norm": 26.517505645751953,
"learning_rate": 0.00019218233017770264,
"loss": 2.1124088287353517,
"step": 950
},
{
"epoch": 0.5167541380702463,
"grad_norm": 27.521711349487305,
"learning_rate": 0.0001919507787689677,
"loss": 2.729749298095703,
"step": 960
},
{
"epoch": 0.5221369936751447,
"grad_norm": 33.03516387939453,
"learning_rate": 0.00019171599173710662,
"loss": 1.914764976501465,
"step": 970
},
{
"epoch": 0.527519849280043,
"grad_norm": 28.447750091552734,
"learning_rate": 0.00019147797734395648,
"loss": 1.99549560546875,
"step": 980
},
{
"epoch": 0.5329027048849415,
"grad_norm": 19.028818130493164,
"learning_rate": 0.0001912367439649207,
"loss": 1.8732738494873047,
"step": 990
},
{
"epoch": 0.5382855604898399,
"grad_norm": 26.41012191772461,
"learning_rate": 0.00019099230008867463,
"loss": 2.936910057067871,
"step": 1000
},
{
"epoch": 0.5382855604898399,
"eval_loss": 0.6647254228591919,
"eval_runtime": 64.3533,
"eval_samples_per_second": 51.326,
"eval_steps_per_second": 12.835,
"step": 1000
},
{
"epoch": 0.5436684160947383,
"grad_norm": 29.55500602722168,
"learning_rate": 0.00019074465431686652,
"loss": 2.9467599868774412,
"step": 1010
},
{
"epoch": 0.5490512716996366,
"grad_norm": 15.729572296142578,
"learning_rate": 0.00019049381536381503,
"loss": 2.841005325317383,
"step": 1020
},
{
"epoch": 0.554434127304535,
"grad_norm": 7.53200626373291,
"learning_rate": 0.0001902397920562025,
"loss": 1.8715387344360352,
"step": 1030
},
{
"epoch": 0.5598169829094335,
"grad_norm": 35.68206787109375,
"learning_rate": 0.0001899825933327644,
"loss": 2.8048942565917967,
"step": 1040
},
{
"epoch": 0.5651998385143319,
"grad_norm": 46.12540054321289,
"learning_rate": 0.00018972222824397485,
"loss": 2.888982963562012,
"step": 1050
},
{
"epoch": 0.5705826941192302,
"grad_norm": 28.082979202270508,
"learning_rate": 0.00018945870595172797,
"loss": 2.8277057647705077,
"step": 1060
},
{
"epoch": 0.5759655497241286,
"grad_norm": 8.667706489562988,
"learning_rate": 0.00018919203572901559,
"loss": 1.7566593170166016,
"step": 1070
},
{
"epoch": 0.5813484053290271,
"grad_norm": 32.86021423339844,
"learning_rate": 0.000188922226959601,
"loss": 2.00911922454834,
"step": 1080
},
{
"epoch": 0.5867312609339255,
"grad_norm": 20.026046752929688,
"learning_rate": 0.00018864928913768866,
"loss": 3.050994873046875,
"step": 1090
},
{
"epoch": 0.5921141165388238,
"grad_norm": 34.74673843383789,
"learning_rate": 0.00018837323186759016,
"loss": 2.7538400650024415,
"step": 1100
},
{
"epoch": 0.5921141165388238,
"eval_loss": 0.671667754650116,
"eval_runtime": 64.3041,
"eval_samples_per_second": 51.365,
"eval_steps_per_second": 12.845,
"step": 1100
},
{
"epoch": 0.5974969721437222,
"grad_norm": 26.802404403686523,
"learning_rate": 0.00018809406486338618,
"loss": 2.579293060302734,
"step": 1110
},
{
"epoch": 0.6028798277486206,
"grad_norm": 37.77304458618164,
"learning_rate": 0.00018781179794858478,
"loss": 2.3671943664550783,
"step": 1120
},
{
"epoch": 0.6082626833535191,
"grad_norm": 40.37071228027344,
"learning_rate": 0.00018752644105577565,
"loss": 1.8490634918212892,
"step": 1130
},
{
"epoch": 0.6136455389584174,
"grad_norm": 58.33607482910156,
"learning_rate": 0.0001872380042262806,
"loss": 2.5194568634033203,
"step": 1140
},
{
"epoch": 0.6190283945633158,
"grad_norm": 18.999311447143555,
"learning_rate": 0.0001869464976098003,
"loss": 2.8447465896606445,
"step": 1150
},
{
"epoch": 0.6244112501682142,
"grad_norm": 9.258393287658691,
"learning_rate": 0.00018665193146405695,
"loss": 1.3028793334960938,
"step": 1160
},
{
"epoch": 0.6297941057731127,
"grad_norm": 36.751834869384766,
"learning_rate": 0.00018635431615443354,
"loss": 2.4607158660888673,
"step": 1170
},
{
"epoch": 0.635176961378011,
"grad_norm": 32.03705596923828,
"learning_rate": 0.00018605366215360887,
"loss": 2.4548139572143555,
"step": 1180
},
{
"epoch": 0.6405598169829094,
"grad_norm": 83.0655746459961,
"learning_rate": 0.00018574998004118932,
"loss": 4.094330215454102,
"step": 1190
},
{
"epoch": 0.6459426725878078,
"grad_norm": 16.984663009643555,
"learning_rate": 0.00018544328050333625,
"loss": 2.0978935241699217,
"step": 1200
},
{
"epoch": 0.6459426725878078,
"eval_loss": 0.5826177597045898,
"eval_runtime": 64.1932,
"eval_samples_per_second": 51.454,
"eval_steps_per_second": 12.867,
"step": 1200
},
{
"epoch": 0.6513255281927063,
"grad_norm": 31.547466278076172,
"learning_rate": 0.00018513357433239022,
"loss": 2.314143753051758,
"step": 1210
},
{
"epoch": 0.6567083837976047,
"grad_norm": 50.67429733276367,
"learning_rate": 0.00018482087242649117,
"loss": 4.206168746948242,
"step": 1220
},
{
"epoch": 0.662091239402503,
"grad_norm": 31.81623649597168,
"learning_rate": 0.00018450518578919475,
"loss": 2.8035467147827147,
"step": 1230
},
{
"epoch": 0.6674740950074014,
"grad_norm": 24.316707611083984,
"learning_rate": 0.00018418652552908537,
"loss": 2.3980735778808593,
"step": 1240
},
{
"epoch": 0.6728569506122998,
"grad_norm": 34.293701171875,
"learning_rate": 0.00018386490285938516,
"loss": 2.651681900024414,
"step": 1250
},
{
"epoch": 0.6782398062171983,
"grad_norm": 34.4983024597168,
"learning_rate": 0.0001835403290975594,
"loss": 2.2850324630737306,
"step": 1260
},
{
"epoch": 0.6836226618220966,
"grad_norm": 31.51317596435547,
"learning_rate": 0.00018321281566491835,
"loss": 1.8678964614868163,
"step": 1270
},
{
"epoch": 0.689005517426995,
"grad_norm": 88.34801483154297,
"learning_rate": 0.0001828823740862152,
"loss": 2.051138496398926,
"step": 1280
},
{
"epoch": 0.6943883730318934,
"grad_norm": 23.922054290771484,
"learning_rate": 0.00018254901598924078,
"loss": 1.466459083557129,
"step": 1290
},
{
"epoch": 0.6997712286367919,
"grad_norm": 39.07735824584961,
"learning_rate": 0.00018221275310441405,
"loss": 2.2651920318603516,
"step": 1300
},
{
"epoch": 0.6997712286367919,
"eval_loss": 0.6614837646484375,
"eval_runtime": 63.9775,
"eval_samples_per_second": 51.628,
"eval_steps_per_second": 12.911,
"step": 1300
},
{
"epoch": 0.7051540842416902,
"grad_norm": 51.51314926147461,
"learning_rate": 0.0001818735972643697,
"loss": 2.400813102722168,
"step": 1310
},
{
"epoch": 0.7105369398465886,
"grad_norm": 27.827117919921875,
"learning_rate": 0.0001815315604035414,
"loss": 2.1232112884521483,
"step": 1320
},
{
"epoch": 0.715919795451487,
"grad_norm": 39.04352951049805,
"learning_rate": 0.00018118665455774227,
"loss": 2.0058998107910155,
"step": 1330
},
{
"epoch": 0.7213026510563854,
"grad_norm": 21.7037296295166,
"learning_rate": 0.00018083889186374088,
"loss": 4.023828125,
"step": 1340
},
{
"epoch": 0.7266855066612838,
"grad_norm": 23.27933120727539,
"learning_rate": 0.00018048828455883455,
"loss": 2.1123376846313477,
"step": 1350
},
{
"epoch": 0.7320683622661822,
"grad_norm": 23.154111862182617,
"learning_rate": 0.00018013484498041854,
"loss": 2.0040388107299805,
"step": 1360
},
{
"epoch": 0.7374512178710806,
"grad_norm": 36.17502212524414,
"learning_rate": 0.000179778585565552,
"loss": 1.7808284759521484,
"step": 1370
},
{
"epoch": 0.742834073475979,
"grad_norm": 46.8353385925293,
"learning_rate": 0.0001794195188505203,
"loss": 2.6809072494506836,
"step": 1380
},
{
"epoch": 0.7482169290808774,
"grad_norm": 19.901514053344727,
"learning_rate": 0.00017905765747039385,
"loss": 2.2484678268432616,
"step": 1390
},
{
"epoch": 0.7535997846857758,
"grad_norm": 31.01380729675293,
"learning_rate": 0.0001786930141585836,
"loss": 1.9935230255126952,
"step": 1400
},
{
"epoch": 0.7535997846857758,
"eval_loss": 0.5672405362129211,
"eval_runtime": 64.147,
"eval_samples_per_second": 51.491,
"eval_steps_per_second": 12.877,
"step": 1400
},
{
"epoch": 0.7589826402906742,
"grad_norm": 40.08690643310547,
"learning_rate": 0.00017832560174639282,
"loss": 2.275004577636719,
"step": 1410
},
{
"epoch": 0.7643654958955726,
"grad_norm": 33.389278411865234,
"learning_rate": 0.00017795543316256578,
"loss": 2.6517934799194336,
"step": 1420
},
{
"epoch": 0.769748351500471,
"grad_norm": 24.02670669555664,
"learning_rate": 0.0001775825214328326,
"loss": 1.8687612533569335,
"step": 1430
},
{
"epoch": 0.7751312071053694,
"grad_norm": 39.74971008300781,
"learning_rate": 0.00017720687967945093,
"loss": 2.8546443939208985,
"step": 1440
},
{
"epoch": 0.7805140627102678,
"grad_norm": 42.48725891113281,
"learning_rate": 0.0001768285211207444,
"loss": 2.515781784057617,
"step": 1450
},
{
"epoch": 0.7858969183151662,
"grad_norm": 24.863798141479492,
"learning_rate": 0.00017644745907063723,
"loss": 1.927882766723633,
"step": 1460
},
{
"epoch": 0.7912797739200645,
"grad_norm": 9.220629692077637,
"learning_rate": 0.00017606370693818584,
"loss": 1.976559829711914,
"step": 1470
},
{
"epoch": 0.796662629524963,
"grad_norm": 48.26815414428711,
"learning_rate": 0.000175677278227107,
"loss": 2.111470413208008,
"step": 1480
},
{
"epoch": 0.8020454851298614,
"grad_norm": 39.00963592529297,
"learning_rate": 0.00017528818653530273,
"loss": 1.7109893798828124,
"step": 1490
},
{
"epoch": 0.8074283407347598,
"grad_norm": 24.070545196533203,
"learning_rate": 0.0001748964455543816,
"loss": 3.191597747802734,
"step": 1500
},
{
"epoch": 0.8074283407347598,
"eval_loss": 0.5993195176124573,
"eval_runtime": 63.9501,
"eval_samples_per_second": 51.65,
"eval_steps_per_second": 12.916,
"step": 1500
},
{
"epoch": 0.8128111963396581,
"grad_norm": 12.18187141418457,
"learning_rate": 0.00017450206906917713,
"loss": 2.0544879913330076,
"step": 1510
},
{
"epoch": 0.8181940519445566,
"grad_norm": 28.476694107055664,
"learning_rate": 0.0001741050709572627,
"loss": 2.3975988388061524,
"step": 1520
},
{
"epoch": 0.823576907549455,
"grad_norm": 24.376489639282227,
"learning_rate": 0.0001737054651884631,
"loss": 1.8688972473144532,
"step": 1530
},
{
"epoch": 0.8289597631543534,
"grad_norm": 38.94839096069336,
"learning_rate": 0.00017330326582436304,
"loss": 2.3757015228271485,
"step": 1540
},
{
"epoch": 0.8343426187592518,
"grad_norm": 37.19301223754883,
"learning_rate": 0.00017289848701781244,
"loss": 2.7712066650390623,
"step": 1550
},
{
"epoch": 0.8397254743641501,
"grad_norm": 23.972366333007812,
"learning_rate": 0.0001724911430124281,
"loss": 2.109449005126953,
"step": 1560
},
{
"epoch": 0.8451083299690486,
"grad_norm": 37.52610397338867,
"learning_rate": 0.0001720812481420929,
"loss": 1.802728271484375,
"step": 1570
},
{
"epoch": 0.850491185573947,
"grad_norm": 16.366283416748047,
"learning_rate": 0.00017166881683045103,
"loss": 2.741063117980957,
"step": 1580
},
{
"epoch": 0.8558740411788454,
"grad_norm": 38.8548469543457,
"learning_rate": 0.00017125386359040067,
"loss": 1.7972919464111328,
"step": 1590
},
{
"epoch": 0.8612568967837437,
"grad_norm": 22.872310638427734,
"learning_rate": 0.00017083640302358326,
"loss": 2.159262275695801,
"step": 1600
},
{
"epoch": 0.8612568967837437,
"eval_loss": 0.4924517571926117,
"eval_runtime": 64.2275,
"eval_samples_per_second": 51.427,
"eval_steps_per_second": 12.861,
"step": 1600
},
{
"epoch": 0.8666397523886422,
"grad_norm": 27.983964920043945,
"learning_rate": 0.00017041644981986967,
"loss": 1.717204475402832,
"step": 1610
},
{
"epoch": 0.8720226079935406,
"grad_norm": 21.148286819458008,
"learning_rate": 0.00016999401875684316,
"loss": 2.8551345825195313,
"step": 1620
},
{
"epoch": 0.877405463598439,
"grad_norm": 80.67280578613281,
"learning_rate": 0.0001695691246992797,
"loss": 2.6277225494384764,
"step": 1630
},
{
"epoch": 0.8827883192033373,
"grad_norm": 18.69855308532715,
"learning_rate": 0.0001691417825986245,
"loss": 2.1024648666381838,
"step": 1640
},
{
"epoch": 0.8881711748082358,
"grad_norm": 34.107303619384766,
"learning_rate": 0.00016871200749246626,
"loss": 2.2313766479492188,
"step": 1650
},
{
"epoch": 0.8935540304131342,
"grad_norm": 40.186038970947266,
"learning_rate": 0.00016827981450400774,
"loss": 2.4880607604980467,
"step": 1660
},
{
"epoch": 0.8989368860180326,
"grad_norm": 70.78448486328125,
"learning_rate": 0.00016784521884153362,
"loss": 2.738982582092285,
"step": 1670
},
{
"epoch": 0.9043197416229309,
"grad_norm": 36.99370193481445,
"learning_rate": 0.00016740823579787558,
"loss": 2.254520606994629,
"step": 1680
},
{
"epoch": 0.9097025972278293,
"grad_norm": 39.36662673950195,
"learning_rate": 0.00016696888074987392,
"loss": 1.8448904037475586,
"step": 1690
},
{
"epoch": 0.9150854528327278,
"grad_norm": 61.377532958984375,
"learning_rate": 0.00016652716915783658,
"loss": 2.130519485473633,
"step": 1700
},
{
"epoch": 0.9150854528327278,
"eval_loss": 0.532718300819397,
"eval_runtime": 64.1771,
"eval_samples_per_second": 51.467,
"eval_steps_per_second": 12.871,
"step": 1700
},
{
"epoch": 0.9204683084376262,
"grad_norm": 40.985164642333984,
"learning_rate": 0.00016608311656499504,
"loss": 3.142055702209473,
"step": 1710
},
{
"epoch": 0.9258511640425245,
"grad_norm": 15.224512100219727,
"learning_rate": 0.0001656367385969575,
"loss": 2.681681823730469,
"step": 1720
},
{
"epoch": 0.9312340196474229,
"grad_norm": 30.765071868896484,
"learning_rate": 0.00016518805096115888,
"loss": 2.4531631469726562,
"step": 1730
},
{
"epoch": 0.9366168752523214,
"grad_norm": 39.2271614074707,
"learning_rate": 0.00016473706944630822,
"loss": 1.7306629180908204,
"step": 1740
},
{
"epoch": 0.9419997308572198,
"grad_norm": 28.554643630981445,
"learning_rate": 0.00016428380992183304,
"loss": 2.5790334701538087,
"step": 1750
},
{
"epoch": 0.9473825864621181,
"grad_norm": 31.55245590209961,
"learning_rate": 0.0001638282883373209,
"loss": 2.3022281646728517,
"step": 1760
},
{
"epoch": 0.9527654420670165,
"grad_norm": 29.733423233032227,
"learning_rate": 0.00016337052072195823,
"loss": 1.7397018432617188,
"step": 1770
},
{
"epoch": 0.958148297671915,
"grad_norm": 28.3569393157959,
"learning_rate": 0.00016291052318396625,
"loss": 2.331684112548828,
"step": 1780
},
{
"epoch": 0.9635311532768134,
"grad_norm": 31.536741256713867,
"learning_rate": 0.00016244831191003406,
"loss": 1.9013969421386718,
"step": 1790
},
{
"epoch": 0.9689140088817118,
"grad_norm": 27.39286231994629,
"learning_rate": 0.0001619839031647491,
"loss": 1.9535322189331055,
"step": 1800
},
{
"epoch": 0.9689140088817118,
"eval_loss": 0.4878155589103699,
"eval_runtime": 63.9092,
"eval_samples_per_second": 51.683,
"eval_steps_per_second": 12.925,
"step": 1800
},
{
"epoch": 0.9742968644866101,
"grad_norm": 35.60191345214844,
"learning_rate": 0.00016151731329002505,
"loss": 2.3475147247314454,
"step": 1810
},
{
"epoch": 0.9796797200915085,
"grad_norm": 54.64162826538086,
"learning_rate": 0.0001610485587045263,
"loss": 2.4532806396484377,
"step": 1820
},
{
"epoch": 0.985062575696407,
"grad_norm": 24.01209831237793,
"learning_rate": 0.00016057765590309067,
"loss": 1.9294677734375,
"step": 1830
},
{
"epoch": 0.9904454313013054,
"grad_norm": 28.77838706970215,
"learning_rate": 0.00016010462145614872,
"loss": 2.6661401748657227,
"step": 1840
},
{
"epoch": 0.9958282869062037,
"grad_norm": 23.397241592407227,
"learning_rate": 0.0001596294720091407,
"loss": 2.083774375915527,
"step": 1850
},
{
"epoch": 1.0010765711209797,
"grad_norm": 24.451494216918945,
"learning_rate": 0.0001591522242819309,
"loss": 1.6308988571166991,
"step": 1860
},
{
"epoch": 1.0064594267258782,
"grad_norm": 35.17308044433594,
"learning_rate": 0.00015867289506821914,
"loss": 2.0649885177612304,
"step": 1870
},
{
"epoch": 1.0118422823307764,
"grad_norm": 18.505117416381836,
"learning_rate": 0.00015819150123495005,
"loss": 1.7077461242675782,
"step": 1880
},
{
"epoch": 1.017225137935675,
"grad_norm": 32.787864685058594,
"learning_rate": 0.00015770805972171935,
"loss": 1.5830881118774414,
"step": 1890
},
{
"epoch": 1.0226079935405732,
"grad_norm": 49.975154876708984,
"learning_rate": 0.00015722258754017783,
"loss": 2.320701026916504,
"step": 1900
},
{
"epoch": 1.0226079935405732,
"eval_loss": 0.5473566055297852,
"eval_runtime": 64.1602,
"eval_samples_per_second": 51.481,
"eval_steps_per_second": 12.874,
"step": 1900
},
{
"epoch": 1.0279908491454717,
"grad_norm": 95.95193481445312,
"learning_rate": 0.00015673510177343283,
"loss": 2.1278076171875,
"step": 1910
},
{
"epoch": 1.0333737047503702,
"grad_norm": 38.54022979736328,
"learning_rate": 0.00015624561957544686,
"loss": 1.865066146850586,
"step": 1920
},
{
"epoch": 1.0387565603552684,
"grad_norm": 42.10824203491211,
"learning_rate": 0.0001557541581704343,
"loss": 2.5854557037353514,
"step": 1930
},
{
"epoch": 1.044139415960167,
"grad_norm": 29.79697608947754,
"learning_rate": 0.00015526073485225506,
"loss": 1.4342741012573241,
"step": 1940
},
{
"epoch": 1.0495222715650652,
"grad_norm": 19.559640884399414,
"learning_rate": 0.0001547653669838061,
"loss": 1.4350951194763184,
"step": 1950
},
{
"epoch": 1.0549051271699637,
"grad_norm": 36.87428665161133,
"learning_rate": 0.0001542680719964105,
"loss": 1.7127342224121094,
"step": 1960
},
{
"epoch": 1.0602879827748621,
"grad_norm": 20.139524459838867,
"learning_rate": 0.000153768867389204,
"loss": 1.6490812301635742,
"step": 1970
},
{
"epoch": 1.0656708383797604,
"grad_norm": 32.64472579956055,
"learning_rate": 0.0001532677707285194,
"loss": 1.6485609054565429,
"step": 1980
},
{
"epoch": 1.0710536939846589,
"grad_norm": 42.68798828125,
"learning_rate": 0.00015276479964726808,
"loss": 2.758069610595703,
"step": 1990
},
{
"epoch": 1.0764365495895571,
"grad_norm": 39.17344284057617,
"learning_rate": 0.0001522599718443199,
"loss": 2.326355743408203,
"step": 2000
},
{
"epoch": 1.0764365495895571,
"eval_loss": 0.5851911306381226,
"eval_runtime": 63.9143,
"eval_samples_per_second": 51.679,
"eval_steps_per_second": 12.924,
"step": 2000
},
{
"epoch": 1.0818194051944556,
"grad_norm": 26.366891860961914,
"learning_rate": 0.0001517533050838802,
"loss": 1.368880844116211,
"step": 2010
},
{
"epoch": 1.0872022607993541,
"grad_norm": 50.400123596191406,
"learning_rate": 0.00015124481719486465,
"loss": 1.787089729309082,
"step": 2020
},
{
"epoch": 1.0925851164042524,
"grad_norm": 9.160683631896973,
"learning_rate": 0.00015073452607027214,
"loss": 1.864046859741211,
"step": 2030
},
{
"epoch": 1.0979679720091509,
"grad_norm": 19.865297317504883,
"learning_rate": 0.00015022244966655482,
"loss": 1.632607650756836,
"step": 2040
},
{
"epoch": 1.1033508276140493,
"grad_norm": 49.69865036010742,
"learning_rate": 0.00014970860600298642,
"loss": 1.7247093200683594,
"step": 2050
},
{
"epoch": 1.1087336832189476,
"grad_norm": 43.50836181640625,
"learning_rate": 0.0001491930131610282,
"loss": 1.298050880432129,
"step": 2060
},
{
"epoch": 1.114116538823846,
"grad_norm": 55.050758361816406,
"learning_rate": 0.00014867568928369256,
"loss": 1.6693323135375977,
"step": 2070
},
{
"epoch": 1.1194993944287444,
"grad_norm": 66.28153228759766,
"learning_rate": 0.00014815665257490482,
"loss": 2.2023120880126954,
"step": 2080
},
{
"epoch": 1.1248822500336428,
"grad_norm": 38.08374786376953,
"learning_rate": 0.00014763592129886228,
"loss": 1.427632713317871,
"step": 2090
},
{
"epoch": 1.1302651056385413,
"grad_norm": 42.69854736328125,
"learning_rate": 0.000147113513779392,
"loss": 2.1791011810302736,
"step": 2100
},
{
"epoch": 1.1302651056385413,
"eval_loss": 0.5500441789627075,
"eval_runtime": 63.9044,
"eval_samples_per_second": 51.687,
"eval_steps_per_second": 12.926,
"step": 2100
},
{
"epoch": 1.1356479612434396,
"grad_norm": 27.943300247192383,
"learning_rate": 0.0001465894483993057,
"loss": 1.6217365264892578,
"step": 2110
},
{
"epoch": 1.141030816848338,
"grad_norm": 34.99180221557617,
"learning_rate": 0.00014606374359975286,
"loss": 2.2697931289672852,
"step": 2120
},
{
"epoch": 1.1464136724532366,
"grad_norm": 27.82872772216797,
"learning_rate": 0.000145536417879572,
"loss": 2.0169490814208983,
"step": 2130
},
{
"epoch": 1.1517965280581348,
"grad_norm": 18.295881271362305,
"learning_rate": 0.00014500748979463966,
"loss": 1.2729131698608398,
"step": 2140
},
{
"epoch": 1.1571793836630333,
"grad_norm": 18.062448501586914,
"learning_rate": 0.00014447697795721737,
"loss": 2.3540084838867186,
"step": 2150
},
{
"epoch": 1.1625622392679316,
"grad_norm": 41.10131072998047,
"learning_rate": 0.00014394490103529676,
"loss": 2.1076675415039063,
"step": 2160
},
{
"epoch": 1.16794509487283,
"grad_norm": 39.552982330322266,
"learning_rate": 0.0001434112777519427,
"loss": 2.1465015411376953,
"step": 2170
},
{
"epoch": 1.1733279504777285,
"grad_norm": 28.34930419921875,
"learning_rate": 0.0001428761268846344,
"loss": 1.4876040458679198,
"step": 2180
},
{
"epoch": 1.1787108060826268,
"grad_norm": 26.313669204711914,
"learning_rate": 0.00014233946726460462,
"loss": 1.5450728416442872,
"step": 2190
},
{
"epoch": 1.1840936616875253,
"grad_norm": 14.592830657958984,
"learning_rate": 0.00014180131777617716,
"loss": 2.097823715209961,
"step": 2200
},
{
"epoch": 1.1840936616875253,
"eval_loss": 0.4937271177768707,
"eval_runtime": 64.1972,
"eval_samples_per_second": 51.451,
"eval_steps_per_second": 12.867,
"step": 2200
},
{
"epoch": 1.1894765172924235,
"grad_norm": 57.555904388427734,
"learning_rate": 0.00014126169735610225,
"loss": 1.3126806259155273,
"step": 2210
},
{
"epoch": 1.194859372897322,
"grad_norm": 49.10297775268555,
"learning_rate": 0.00014072062499289023,
"loss": 1.8571784973144532,
"step": 2220
},
{
"epoch": 1.2002422285022205,
"grad_norm": 63.582420349121094,
"learning_rate": 0.00014017811972614325,
"loss": 1.6554574966430664,
"step": 2230
},
{
"epoch": 1.2056250841071188,
"grad_norm": 38.78810501098633,
"learning_rate": 0.0001396342006458855,
"loss": 1.6202888488769531,
"step": 2240
},
{
"epoch": 1.2110079397120173,
"grad_norm": 27.394638061523438,
"learning_rate": 0.00013908888689189133,
"loss": 2.127480697631836,
"step": 2250
},
{
"epoch": 1.2163907953169155,
"grad_norm": 48.140830993652344,
"learning_rate": 0.00013854219765301165,
"loss": 1.8078197479248046,
"step": 2260
},
{
"epoch": 1.221773650921814,
"grad_norm": 44.98652267456055,
"learning_rate": 0.00013799415216649897,
"loss": 2.2878448486328127,
"step": 2270
},
{
"epoch": 1.2271565065267125,
"grad_norm": 10.705018043518066,
"learning_rate": 0.0001374447697173303,
"loss": 2.145868682861328,
"step": 2280
},
{
"epoch": 1.2325393621316107,
"grad_norm": 27.23916244506836,
"learning_rate": 0.00013689406963752844,
"loss": 1.3377301216125488,
"step": 2290
},
{
"epoch": 1.2379222177365092,
"grad_norm": 34.806480407714844,
"learning_rate": 0.00013634207130548194,
"loss": 1.9754547119140624,
"step": 2300
},
{
"epoch": 1.2379222177365092,
"eval_loss": 0.47936686873435974,
"eval_runtime": 64.2268,
"eval_samples_per_second": 51.427,
"eval_steps_per_second": 12.861,
"step": 2300
},
{
"epoch": 1.2433050733414075,
"grad_norm": 32.58279037475586,
"learning_rate": 0.00013578879414526292,
"loss": 1.7109735488891602,
"step": 2310
},
{
"epoch": 1.248687928946306,
"grad_norm": 33.94943618774414,
"learning_rate": 0.000135234257625944,
"loss": 2.3083892822265626,
"step": 2320
},
{
"epoch": 1.2540707845512045,
"grad_norm": 35.721805572509766,
"learning_rate": 0.00013467848126091266,
"loss": 1.966238021850586,
"step": 2330
},
{
"epoch": 1.259453640156103,
"grad_norm": 22.220964431762695,
"learning_rate": 0.00013412148460718507,
"loss": 1.9786643981933594,
"step": 2340
},
{
"epoch": 1.2648364957610012,
"grad_norm": 22.529788970947266,
"learning_rate": 0.00013356328726471753,
"loss": 2.2097476959228515,
"step": 2350
},
{
"epoch": 1.2702193513658995,
"grad_norm": 14.958813667297363,
"learning_rate": 0.00013300390887571715,
"loss": 1.8351505279541016,
"step": 2360
},
{
"epoch": 1.275602206970798,
"grad_norm": 17.01559829711914,
"learning_rate": 0.00013244336912395026,
"loss": 1.9661121368408203,
"step": 2370
},
{
"epoch": 1.2809850625756964,
"grad_norm": 28.454547882080078,
"learning_rate": 0.00013188168773405008,
"loss": 1.6221160888671875,
"step": 2380
},
{
"epoch": 1.286367918180595,
"grad_norm": 41.18201446533203,
"learning_rate": 0.00013131888447082254,
"loss": 1.636754035949707,
"step": 2390
},
{
"epoch": 1.2917507737854932,
"grad_norm": 34.558536529541016,
"learning_rate": 0.00013075497913855072,
"loss": 1.8497133255004883,
"step": 2400
},
{
"epoch": 1.2917507737854932,
"eval_loss": 0.5467978119850159,
"eval_runtime": 64.2912,
"eval_samples_per_second": 51.376,
"eval_steps_per_second": 12.848,
"step": 2400
},
{
"epoch": 1.2971336293903917,
"grad_norm": 43.164146423339844,
"learning_rate": 0.00013018999158029802,
"loss": 2.0868755340576173,
"step": 2410
},
{
"epoch": 1.30251648499529,
"grad_norm": 13.502433776855469,
"learning_rate": 0.00012962394167720997,
"loss": 2.3471694946289063,
"step": 2420
},
{
"epoch": 1.3078993406001884,
"grad_norm": 11.673425674438477,
"learning_rate": 0.00012905684934781447,
"loss": 0.8880938529968262,
"step": 2430
},
{
"epoch": 1.313282196205087,
"grad_norm": 24.767826080322266,
"learning_rate": 0.00012848873454732106,
"loss": 1.9171413421630858,
"step": 2440
},
{
"epoch": 1.3186650518099852,
"grad_norm": 31.41339111328125,
"learning_rate": 0.0001279196172669186,
"loss": 1.550046443939209,
"step": 2450
},
{
"epoch": 1.3240479074148837,
"grad_norm": 42.19283676147461,
"learning_rate": 0.00012734951753307194,
"loss": 1.5069122314453125,
"step": 2460
},
{
"epoch": 1.329430763019782,
"grad_norm": 34.4764289855957,
"learning_rate": 0.00012677845540681702,
"loss": 1.5139981269836427,
"step": 2470
},
{
"epoch": 1.3348136186246804,
"grad_norm": 45.293399810791016,
"learning_rate": 0.00012620645098305514,
"loss": 2.5238950729370115,
"step": 2480
},
{
"epoch": 1.3401964742295789,
"grad_norm": 21.721302032470703,
"learning_rate": 0.0001256335243898458,
"loss": 2.452337646484375,
"step": 2490
},
{
"epoch": 1.3455793298344771,
"grad_norm": 32.277462005615234,
"learning_rate": 0.00012505969578769827,
"loss": 1.747513198852539,
"step": 2500
},
{
"epoch": 1.3455793298344771,
"eval_loss": 0.5084195137023926,
"eval_runtime": 64.3491,
"eval_samples_per_second": 51.329,
"eval_steps_per_second": 12.836,
"step": 2500
},
{
"epoch": 1.3509621854393756,
"grad_norm": 28.49180793762207,
"learning_rate": 0.00012448498536886242,
"loss": 1.7691278457641602,
"step": 2510
},
{
"epoch": 1.356345041044274,
"grad_norm": 19.427194595336914,
"learning_rate": 0.00012390941335661793,
"loss": 1.7051538467407226,
"step": 2520
},
{
"epoch": 1.3617278966491724,
"grad_norm": 25.067476272583008,
"learning_rate": 0.00012333300000456294,
"loss": 1.2319503784179688,
"step": 2530
},
{
"epoch": 1.3671107522540709,
"grad_norm": 43.21786880493164,
"learning_rate": 0.00012275576559590107,
"loss": 1.9394664764404297,
"step": 2540
},
{
"epoch": 1.3724936078589691,
"grad_norm": 33.55292510986328,
"learning_rate": 0.0001221777304427278,
"loss": 1.6529422760009767,
"step": 2550
},
{
"epoch": 1.3778764634638676,
"grad_norm": 17.388324737548828,
"learning_rate": 0.00012159891488531583,
"loss": 1.6362987518310548,
"step": 2560
},
{
"epoch": 1.3832593190687659,
"grad_norm": 11.812196731567383,
"learning_rate": 0.00012101933929139911,
"loss": 1.3777896881103515,
"step": 2570
},
{
"epoch": 1.3886421746736644,
"grad_norm": 10.543932914733887,
"learning_rate": 0.00012043902405545635,
"loss": 1.7387680053710937,
"step": 2580
},
{
"epoch": 1.3940250302785628,
"grad_norm": 25.3862247467041,
"learning_rate": 0.00011985798959799315,
"loss": 1.6691925048828125,
"step": 2590
},
{
"epoch": 1.399407885883461,
"grad_norm": 44.17007064819336,
"learning_rate": 0.00011927625636482364,
"loss": 1.8721656799316406,
"step": 2600
},
{
"epoch": 1.399407885883461,
"eval_loss": 0.5541885495185852,
"eval_runtime": 63.9819,
"eval_samples_per_second": 51.624,
"eval_steps_per_second": 12.91,
"step": 2600
},
{
"epoch": 1.4047907414883596,
"grad_norm": 30.539979934692383,
"learning_rate": 0.00011869384482635087,
"loss": 1.5085716247558594,
"step": 2610
},
{
"epoch": 1.4101735970932578,
"grad_norm": 39.790950775146484,
"learning_rate": 0.00011811077547684652,
"loss": 1.9276805877685548,
"step": 2620
},
{
"epoch": 1.4155564526981563,
"grad_norm": 26.07389259338379,
"learning_rate": 0.00011752706883372975,
"loss": 1.6762975692749023,
"step": 2630
},
{
"epoch": 1.4209393083030548,
"grad_norm": 19.482772827148438,
"learning_rate": 0.00011694274543684525,
"loss": 1.6249858856201171,
"step": 2640
},
{
"epoch": 1.4263221639079533,
"grad_norm": 27.41213607788086,
"learning_rate": 0.00011635782584774042,
"loss": 1.7710115432739257,
"step": 2650
},
{
"epoch": 1.4317050195128516,
"grad_norm": 44.63675308227539,
"learning_rate": 0.00011577233064894184,
"loss": 1.3814048767089844,
"step": 2660
},
{
"epoch": 1.43708787511775,
"grad_norm": 35.491634368896484,
"learning_rate": 0.00011518628044323105,
"loss": 2.505926322937012,
"step": 2670
},
{
"epoch": 1.4424707307226483,
"grad_norm": 19.543800354003906,
"learning_rate": 0.00011459969585291952,
"loss": 1.4784714698791503,
"step": 2680
},
{
"epoch": 1.4478535863275468,
"grad_norm": 17.39204978942871,
"learning_rate": 0.00011401259751912294,
"loss": 1.8356576919555665,
"step": 2690
},
{
"epoch": 1.4532364419324453,
"grad_norm": 30.696813583374023,
"learning_rate": 0.000113425006101035,
"loss": 1.7911975860595704,
"step": 2700
},
{
"epoch": 1.4532364419324453,
"eval_loss": 0.4373091459274292,
"eval_runtime": 63.9584,
"eval_samples_per_second": 51.643,
"eval_steps_per_second": 12.915,
"step": 2700
},
{
"epoch": 1.4586192975373435,
"grad_norm": 62.493797302246094,
"learning_rate": 0.00011283694227520032,
"loss": 1.1635123252868653,
"step": 2710
},
{
"epoch": 1.464002153142242,
"grad_norm": 37.97821807861328,
"learning_rate": 0.00011224842673478692,
"loss": 1.40887451171875,
"step": 2720
},
{
"epoch": 1.4693850087471403,
"grad_norm": 29.938425064086914,
"learning_rate": 0.00011165948018885803,
"loss": 1.6324567794799805,
"step": 2730
},
{
"epoch": 1.4747678643520388,
"grad_norm": 20.280174255371094,
"learning_rate": 0.00011107012336164342,
"loss": 1.2600415229797364,
"step": 2740
},
{
"epoch": 1.4801507199569373,
"grad_norm": 37.221309661865234,
"learning_rate": 0.00011048037699181007,
"loss": 1.7051061630249023,
"step": 2750
},
{
"epoch": 1.4855335755618355,
"grad_norm": 10.49577808380127,
"learning_rate": 0.00010989026183173241,
"loss": 1.4941570281982421,
"step": 2760
},
{
"epoch": 1.490916431166734,
"grad_norm": 22.56839370727539,
"learning_rate": 0.00010929979864676214,
"loss": 1.240116786956787,
"step": 2770
},
{
"epoch": 1.4962992867716323,
"grad_norm": 19.91226577758789,
"learning_rate": 0.00010870900821449747,
"loss": 1.3393290519714356,
"step": 2780
},
{
"epoch": 1.5016821423765307,
"grad_norm": 32.016357421875,
"learning_rate": 0.00010811791132405202,
"loss": 1.7406791687011718,
"step": 2790
},
{
"epoch": 1.5070649979814292,
"grad_norm": 50.24219512939453,
"learning_rate": 0.00010752652877532318,
"loss": 1.9366174697875977,
"step": 2800
},
{
"epoch": 1.5070649979814292,
"eval_loss": 0.43302831053733826,
"eval_runtime": 63.946,
"eval_samples_per_second": 51.653,
"eval_steps_per_second": 12.917,
"step": 2800
},
{
"epoch": 1.5124478535863275,
"grad_norm": 35.96293258666992,
"learning_rate": 0.00010693488137826042,
"loss": 1.8892341613769532,
"step": 2810
},
{
"epoch": 1.517830709191226,
"grad_norm": 20.087125778198242,
"learning_rate": 0.00010634298995213267,
"loss": 1.5483041763305665,
"step": 2820
},
{
"epoch": 1.5232135647961242,
"grad_norm": 44.48786926269531,
"learning_rate": 0.00010575087532479608,
"loss": 2.049909210205078,
"step": 2830
},
{
"epoch": 1.5285964204010227,
"grad_norm": 13.480371475219727,
"learning_rate": 0.0001051585583319608,
"loss": 1.4279634475708007,
"step": 2840
},
{
"epoch": 1.5339792760059212,
"grad_norm": 12.939706802368164,
"learning_rate": 0.0001045660598164581,
"loss": 1.3665541648864745,
"step": 2850
},
{
"epoch": 1.5393621316108197,
"grad_norm": 12.383955001831055,
"learning_rate": 0.00010397340062750666,
"loss": 1.9608146667480468,
"step": 2860
},
{
"epoch": 1.544744987215718,
"grad_norm": 31.020015716552734,
"learning_rate": 0.00010338060161997911,
"loss": 1.3746890068054198,
"step": 2870
},
{
"epoch": 1.5501278428206162,
"grad_norm": 38.224365234375,
"learning_rate": 0.00010278768365366809,
"loss": 1.9677223205566405,
"step": 2880
},
{
"epoch": 1.5555106984255147,
"grad_norm": 16.846071243286133,
"learning_rate": 0.00010219466759255225,
"loss": 2.040707588195801,
"step": 2890
},
{
"epoch": 1.5608935540304132,
"grad_norm": 14.602941513061523,
"learning_rate": 0.00010160157430406201,
"loss": 1.4509224891662598,
"step": 2900
},
{
"epoch": 1.5608935540304132,
"eval_loss": 0.4190095067024231,
"eval_runtime": 63.6149,
"eval_samples_per_second": 51.922,
"eval_steps_per_second": 12.984,
"step": 2900
},
{
"epoch": 1.5662764096353117,
"grad_norm": 6.937775611877441,
"learning_rate": 0.00010100842465834537,
"loss": 1.9573307037353516,
"step": 2910
},
{
"epoch": 1.57165926524021,
"grad_norm": 30.520694732666016,
"learning_rate": 0.00010041523952753346,
"loss": 1.8950252532958984,
"step": 2920
},
{
"epoch": 1.5770421208451082,
"grad_norm": 38.1561279296875,
"learning_rate": 9.982203978500608e-05,
"loss": 1.7020187377929688,
"step": 2930
},
{
"epoch": 1.5824249764500067,
"grad_norm": 27.7998104095459,
"learning_rate": 9.922884630465717e-05,
"loss": 1.7406475067138671,
"step": 2940
},
{
"epoch": 1.5878078320549052,
"grad_norm": 20.777448654174805,
"learning_rate": 9.86356799601603e-05,
"loss": 1.344972515106201,
"step": 2950
},
{
"epoch": 1.5931906876598037,
"grad_norm": 18.08922004699707,
"learning_rate": 9.804256162423427e-05,
"loss": 1.6805049896240234,
"step": 2960
},
{
"epoch": 1.598573543264702,
"grad_norm": 15.266389846801758,
"learning_rate": 9.744951216790837e-05,
"loss": 1.569887638092041,
"step": 2970
},
{
"epoch": 1.6039563988696002,
"grad_norm": 24.077733993530273,
"learning_rate": 9.685655245978823e-05,
"loss": 1.4327526092529297,
"step": 2980
},
{
"epoch": 1.6093392544744987,
"grad_norm": 29.76258087158203,
"learning_rate": 9.626370336532132e-05,
"loss": 1.696345901489258,
"step": 2990
},
{
"epoch": 1.6147221100793971,
"grad_norm": 22.80702781677246,
"learning_rate": 9.567098574606279e-05,
"loss": 0.9164070129394531,
"step": 3000
},
{
"epoch": 1.6147221100793971,
"eval_loss": 0.45202314853668213,
"eval_runtime": 63.7845,
"eval_samples_per_second": 51.784,
"eval_steps_per_second": 12.95,
"step": 3000
},
{
"epoch": 1.6201049656842956,
"grad_norm": 28.408498764038086,
"learning_rate": 9.507842045894128e-05,
"loss": 1.2415037155151367,
"step": 3010
},
{
"epoch": 1.625487821289194,
"grad_norm": 17.381816864013672,
"learning_rate": 9.448602835552512e-05,
"loss": 1.1174392700195312,
"step": 3020
},
{
"epoch": 1.6308706768940922,
"grad_norm": 41.50532913208008,
"learning_rate": 9.389383028128866e-05,
"loss": 2.0566314697265624,
"step": 3030
},
{
"epoch": 1.6362535324989906,
"grad_norm": 43.86766052246094,
"learning_rate": 9.330184707487837e-05,
"loss": 1.5256672859191895,
"step": 3040
},
{
"epoch": 1.6416363881038891,
"grad_norm": 22.702362060546875,
"learning_rate": 9.271009956738004e-05,
"loss": 1.5772756576538085,
"step": 3050
},
{
"epoch": 1.6470192437087876,
"grad_norm": 20.469390869140625,
"learning_rate": 9.211860858158538e-05,
"loss": 1.4132847785949707,
"step": 3060
},
{
"epoch": 1.6524020993136859,
"grad_norm": 23.878665924072266,
"learning_rate": 9.152739493125962e-05,
"loss": 1.7029796600341798,
"step": 3070
},
{
"epoch": 1.6577849549185844,
"grad_norm": 20.67031478881836,
"learning_rate": 9.09364794204087e-05,
"loss": 1.7173995971679688,
"step": 3080
},
{
"epoch": 1.6631678105234826,
"grad_norm": 26.168128967285156,
"learning_rate": 9.034588284254765e-05,
"loss": 1.3580098152160645,
"step": 3090
},
{
"epoch": 1.668550666128381,
"grad_norm": 36.75242233276367,
"learning_rate": 8.975562597996855e-05,
"loss": 1.6930839538574218,
"step": 3100
},
{
"epoch": 1.668550666128381,
"eval_loss": 0.4625987410545349,
"eval_runtime": 63.5645,
"eval_samples_per_second": 51.963,
"eval_steps_per_second": 12.995,
"step": 3100
},
{
"epoch": 1.6739335217332796,
"grad_norm": 26.191268920898438,
"learning_rate": 8.916572960300947e-05,
"loss": 2.067066955566406,
"step": 3110
},
{
"epoch": 1.679316377338178,
"grad_norm": 30.239843368530273,
"learning_rate": 8.857621446932334e-05,
"loss": 1.3582192420959474,
"step": 3120
},
{
"epoch": 1.6846992329430763,
"grad_norm": 11.36849308013916,
"learning_rate": 8.798710132314778e-05,
"loss": 1.4313419342041016,
"step": 3130
},
{
"epoch": 1.6900820885479746,
"grad_norm": 24.18775177001953,
"learning_rate": 8.739841089457494e-05,
"loss": 1.6131771087646485,
"step": 3140
},
{
"epoch": 1.695464944152873,
"grad_norm": 17.61792755126953,
"learning_rate": 8.681016389882217e-05,
"loss": 1.5064881324768067,
"step": 3150
},
{
"epoch": 1.7008477997577716,
"grad_norm": 36.965396881103516,
"learning_rate": 8.622238103550293e-05,
"loss": 2.0960357666015623,
"step": 3160
},
{
"epoch": 1.70623065536267,
"grad_norm": 15.143284797668457,
"learning_rate": 8.563508298789865e-05,
"loss": 1.0306715011596679,
"step": 3170
},
{
"epoch": 1.7116135109675683,
"grad_norm": 21.073841094970703,
"learning_rate": 8.504829042223055e-05,
"loss": 1.4934981346130372,
"step": 3180
},
{
"epoch": 1.7169963665724666,
"grad_norm": 14.031085968017578,
"learning_rate": 8.44620239869328e-05,
"loss": 1.470815372467041,
"step": 3190
},
{
"epoch": 1.722379222177365,
"grad_norm": 12.69394302368164,
"learning_rate": 8.387630431192562e-05,
"loss": 1.4816364288330077,
"step": 3200
},
{
"epoch": 1.722379222177365,
"eval_loss": 0.4099518358707428,
"eval_runtime": 63.7017,
"eval_samples_per_second": 51.851,
"eval_steps_per_second": 12.967,
"step": 3200
},
{
"epoch": 1.7277620777822635,
"grad_norm": 36.04399871826172,
"learning_rate": 8.329115200788962e-05,
"loss": 1.2866575241088867,
"step": 3210
},
{
"epoch": 1.733144933387162,
"grad_norm": 15.661164283752441,
"learning_rate": 8.270658766554023e-05,
"loss": 1.2794793128967286,
"step": 3220
},
{
"epoch": 1.7385277889920603,
"grad_norm": 14.594550132751465,
"learning_rate": 8.212263185490347e-05,
"loss": 0.900571060180664,
"step": 3230
},
{
"epoch": 1.7439106445969585,
"grad_norm": 23.809280395507812,
"learning_rate": 8.153930512459182e-05,
"loss": 1.2999605178833007,
"step": 3240
},
{
"epoch": 1.749293500201857,
"grad_norm": 24.3289737701416,
"learning_rate": 8.095662800108141e-05,
"loss": 0.756270456314087,
"step": 3250
},
{
"epoch": 1.7546763558067555,
"grad_norm": 55.45784378051758,
"learning_rate": 8.037462098798942e-05,
"loss": 1.5912586212158204,
"step": 3260
},
{
"epoch": 1.760059211411654,
"grad_norm": 20.93805694580078,
"learning_rate": 7.97933045653529e-05,
"loss": 1.602321243286133,
"step": 3270
},
{
"epoch": 1.7654420670165523,
"grad_norm": 37.905189514160156,
"learning_rate": 7.92126991889079e-05,
"loss": 1.5339111328125,
"step": 3280
},
{
"epoch": 1.7708249226214505,
"grad_norm": 24.21660804748535,
"learning_rate": 7.863282528936978e-05,
"loss": 1.646210289001465,
"step": 3290
},
{
"epoch": 1.776207778226349,
"grad_norm": 18.371828079223633,
"learning_rate": 7.805370327171402e-05,
"loss": 1.3416717529296875,
"step": 3300
},
{
"epoch": 1.776207778226349,
"eval_loss": 0.4250826835632324,
"eval_runtime": 63.8411,
"eval_samples_per_second": 51.738,
"eval_steps_per_second": 12.938,
"step": 3300
},
{
"epoch": 1.7815906338312475,
"grad_norm": 37.405426025390625,
"learning_rate": 7.747535351445871e-05,
"loss": 1.5578692436218262,
"step": 3310
},
{
"epoch": 1.786973489436146,
"grad_norm": 62.97222900390625,
"learning_rate": 7.689779636894687e-05,
"loss": 2.0751113891601562,
"step": 3320
},
{
"epoch": 1.7923563450410442,
"grad_norm": 24.98927879333496,
"learning_rate": 7.632105215863072e-05,
"loss": 1.8148933410644532,
"step": 3330
},
{
"epoch": 1.7977392006459427,
"grad_norm": 17.803342819213867,
"learning_rate": 7.57451411783564e-05,
"loss": 1.1781111717224122,
"step": 3340
},
{
"epoch": 1.803122056250841,
"grad_norm": 31.60127067565918,
"learning_rate": 7.517008369364973e-05,
"loss": 1.2258566856384276,
"step": 3350
},
{
"epoch": 1.8085049118557395,
"grad_norm": 21.834125518798828,
"learning_rate": 7.459589994000331e-05,
"loss": 1.8756603240966796,
"step": 3360
},
{
"epoch": 1.813887767460638,
"grad_norm": 8.82114315032959,
"learning_rate": 7.402261012216418e-05,
"loss": 1.5807505607604981,
"step": 3370
},
{
"epoch": 1.8192706230655362,
"grad_norm": 6.503419399261475,
"learning_rate": 7.345023441342312e-05,
"loss": 1.110390567779541,
"step": 3380
},
{
"epoch": 1.8246534786704347,
"grad_norm": 17.47008514404297,
"learning_rate": 7.287879295490454e-05,
"loss": 1.7794336318969726,
"step": 3390
},
{
"epoch": 1.830036334275333,
"grad_norm": 20.7091121673584,
"learning_rate": 7.230830585485799e-05,
"loss": 1.1825596809387207,
"step": 3400
},
{
"epoch": 1.830036334275333,
"eval_loss": 0.3694857954978943,
"eval_runtime": 63.578,
"eval_samples_per_second": 51.952,
"eval_steps_per_second": 12.992,
"step": 3400
},
{
"epoch": 1.8354191898802314,
"grad_norm": 26.3618221282959,
"learning_rate": 7.173879318795027e-05,
"loss": 1.3671013832092285,
"step": 3410
},
{
"epoch": 1.84080204548513,
"grad_norm": 14.309059143066406,
"learning_rate": 7.117027499455938e-05,
"loss": 1.7152782440185548,
"step": 3420
},
{
"epoch": 1.8461849010900284,
"grad_norm": 14.735411643981934,
"learning_rate": 7.060277128006896e-05,
"loss": 1.2705150604248048,
"step": 3430
},
{
"epoch": 1.8515677566949267,
"grad_norm": 37.376731872558594,
"learning_rate": 7.003630201416469e-05,
"loss": 0.823548698425293,
"step": 3440
},
{
"epoch": 1.856950612299825,
"grad_norm": 30.746421813964844,
"learning_rate": 6.947088713013127e-05,
"loss": 1.9406600952148438,
"step": 3450
},
{
"epoch": 1.8623334679047234,
"grad_norm": 28.229276657104492,
"learning_rate": 6.89065465241513e-05,
"loss": 1.542259120941162,
"step": 3460
},
{
"epoch": 1.867716323509622,
"grad_norm": 6.486597537994385,
"learning_rate": 6.834330005460472e-05,
"loss": 1.522111701965332,
"step": 3470
},
{
"epoch": 1.8730991791145204,
"grad_norm": 21.441097259521484,
"learning_rate": 6.778116754137058e-05,
"loss": 1.2606025695800782,
"step": 3480
},
{
"epoch": 1.8784820347194187,
"grad_norm": 7.534696102142334,
"learning_rate": 6.722016876512916e-05,
"loss": 1.5245902061462402,
"step": 3490
},
{
"epoch": 1.883864890324317,
"grad_norm": 32.19171142578125,
"learning_rate": 6.666032346666613e-05,
"loss": 1.5431558609008789,
"step": 3500
},
{
"epoch": 1.883864890324317,
"eval_loss": 0.37625691294670105,
"eval_runtime": 63.829,
"eval_samples_per_second": 51.748,
"eval_steps_per_second": 12.941,
"step": 3500
},
{
"epoch": 1.8892477459292154,
"grad_norm": 23.33196258544922,
"learning_rate": 6.610165134617778e-05,
"loss": 1.21827974319458,
"step": 3510
},
{
"epoch": 1.894630601534114,
"grad_norm": 40.78279113769531,
"learning_rate": 6.554417206257795e-05,
"loss": 1.7008653640747071,
"step": 3520
},
{
"epoch": 1.9000134571390124,
"grad_norm": 23.865211486816406,
"learning_rate": 6.498790523280607e-05,
"loss": 1.0905473709106446,
"step": 3530
},
{
"epoch": 1.9053963127439106,
"grad_norm": 26.986589431762695,
"learning_rate": 6.44328704311371e-05,
"loss": 1.2692423820495606,
"step": 3540
},
{
"epoch": 1.910779168348809,
"grad_norm": 15.614501953125,
"learning_rate": 6.387908718849239e-05,
"loss": 1.1699938774108887,
"step": 3550
},
{
"epoch": 1.9161620239537074,
"grad_norm": 16.81165313720703,
"learning_rate": 6.332657499175291e-05,
"loss": 1.7018922805786132,
"step": 3560
},
{
"epoch": 1.9215448795586059,
"grad_norm": 23.331390380859375,
"learning_rate": 6.277535328307296e-05,
"loss": 1.1255874633789062,
"step": 3570
},
{
"epoch": 1.9269277351635044,
"grad_norm": 24.57452964782715,
"learning_rate": 6.222544145919653e-05,
"loss": 2.053675079345703,
"step": 3580
},
{
"epoch": 1.9323105907684026,
"grad_norm": 13.287324905395508,
"learning_rate": 6.167685887077444e-05,
"loss": 1.2274766921997071,
"step": 3590
},
{
"epoch": 1.9376934463733009,
"grad_norm": 18.1403865814209,
"learning_rate": 6.112962482168356e-05,
"loss": 1.2781085968017578,
"step": 3600
},
{
"epoch": 1.9376934463733009,
"eval_loss": 0.36828258633613586,
"eval_runtime": 63.8932,
"eval_samples_per_second": 51.696,
"eval_steps_per_second": 12.928,
"step": 3600
},
{
"epoch": 1.9430763019781994,
"grad_norm": 19.552724838256836,
"learning_rate": 6.058375856834742e-05,
"loss": 1.5518939971923829,
"step": 3610
},
{
"epoch": 1.9484591575830978,
"grad_norm": 25.114530563354492,
"learning_rate": 6.003927931905875e-05,
"loss": 1.3678104400634765,
"step": 3620
},
{
"epoch": 1.9538420131879963,
"grad_norm": 24.832029342651367,
"learning_rate": 5.949620623330351e-05,
"loss": 1.3850306510925292,
"step": 3630
},
{
"epoch": 1.9592248687928946,
"grad_norm": 28.975635528564453,
"learning_rate": 5.895455842108656e-05,
"loss": 2.144721031188965,
"step": 3640
},
{
"epoch": 1.964607724397793,
"grad_norm": 20.551748275756836,
"learning_rate": 5.841435494225946e-05,
"loss": 1.024734878540039,
"step": 3650
},
{
"epoch": 1.9699905800026913,
"grad_norm": 28.49460792541504,
"learning_rate": 5.7875614805849464e-05,
"loss": 1.2350109100341797,
"step": 3660
},
{
"epoch": 1.9753734356075898,
"grad_norm": 46.727195739746094,
"learning_rate": 5.7338356969390996e-05,
"loss": 1.4352140426635742,
"step": 3670
},
{
"epoch": 1.9807562912124883,
"grad_norm": 22.224246978759766,
"learning_rate": 5.680260033825819e-05,
"loss": 1.4729737281799316,
"step": 3680
},
{
"epoch": 1.9861391468173866,
"grad_norm": 21.090652465820312,
"learning_rate": 5.626836376499991e-05,
"loss": 1.332131576538086,
"step": 3690
},
{
"epoch": 1.991522002422285,
"grad_norm": 19.748018264770508,
"learning_rate": 5.573566604867616e-05,
"loss": 1.1651579856872558,
"step": 3700
},
{
"epoch": 1.991522002422285,
"eval_loss": 0.3755303621292114,
"eval_runtime": 63.642,
"eval_samples_per_second": 51.9,
"eval_steps_per_second": 12.979,
"step": 3700
},
{
"epoch": 1.9969048580271833,
"grad_norm": 26.874662399291992,
"learning_rate": 5.5204525934196715e-05,
"loss": 1.8782270431518555,
"step": 3710
},
{
"epoch": 2.0021531422419594,
"grad_norm": 11.230367660522461,
"learning_rate": 5.4674962111661396e-05,
"loss": 1.1111202239990234,
"step": 3720
},
{
"epoch": 2.007535997846858,
"grad_norm": 11.470046043395996,
"learning_rate": 5.4146993215702614e-05,
"loss": 1.2164538383483887,
"step": 3730
},
{
"epoch": 2.0129188534517564,
"grad_norm": 14.980729103088379,
"learning_rate": 5.362063782482918e-05,
"loss": 0.72305908203125,
"step": 3740
},
{
"epoch": 2.0183017090566544,
"grad_norm": 22.74243927001953,
"learning_rate": 5.309591446077316e-05,
"loss": 0.9697726249694825,
"step": 3750
},
{
"epoch": 2.023684564661553,
"grad_norm": 39.94514083862305,
"learning_rate": 5.257284158783764e-05,
"loss": 1.0772478103637695,
"step": 3760
},
{
"epoch": 2.0290674202664514,
"grad_norm": 14.271464347839355,
"learning_rate": 5.20514376122472e-05,
"loss": 0.7649795055389405,
"step": 3770
},
{
"epoch": 2.03445027587135,
"grad_norm": 46.278282165527344,
"learning_rate": 5.1531720881500156e-05,
"loss": 1.7668495178222656,
"step": 3780
},
{
"epoch": 2.0398331314762483,
"grad_norm": 26.685871124267578,
"learning_rate": 5.1013709683723044e-05,
"loss": 0.9311368942260743,
"step": 3790
},
{
"epoch": 2.0452159870811464,
"grad_norm": 19.982656478881836,
"learning_rate": 5.0497422247026895e-05,
"loss": 1.1055089950561523,
"step": 3800
},
{
"epoch": 2.0452159870811464,
"eval_loss": 0.4047035276889801,
"eval_runtime": 63.58,
"eval_samples_per_second": 51.95,
"eval_steps_per_second": 12.992,
"step": 3800
},
{
"epoch": 2.050598842686045,
"grad_norm": 12.345768928527832,
"learning_rate": 4.9982876738866094e-05,
"loss": 0.7015519618988038,
"step": 3810
},
{
"epoch": 2.0559816982909433,
"grad_norm": 33.307762145996094,
"learning_rate": 4.9470091265398754e-05,
"loss": 0.6976238250732422,
"step": 3820
},
{
"epoch": 2.061364553895842,
"grad_norm": 38.2665901184082,
"learning_rate": 4.8959083870849864e-05,
"loss": 1.1541186332702638,
"step": 3830
},
{
"epoch": 2.0667474095007403,
"grad_norm": 22.593074798583984,
"learning_rate": 4.844987253687618e-05,
"loss": 0.4699763298034668,
"step": 3840
},
{
"epoch": 2.0721302651056384,
"grad_norm": 21.039308547973633,
"learning_rate": 4.794247518193353e-05,
"loss": 0.8926765441894531,
"step": 3850
},
{
"epoch": 2.077513120710537,
"grad_norm": 24.009326934814453,
"learning_rate": 4.743690966064626e-05,
"loss": 0.7189272403717041,
"step": 3860
},
{
"epoch": 2.0828959763154353,
"grad_norm": 8.515445709228516,
"learning_rate": 4.6933193763179105e-05,
"loss": 0.5480011940002442,
"step": 3870
},
{
"epoch": 2.088278831920334,
"grad_norm": 19.915380477905273,
"learning_rate": 4.64313452146108e-05,
"loss": 0.7470302581787109,
"step": 3880
},
{
"epoch": 2.0936616875252323,
"grad_norm": 5.266428470611572,
"learning_rate": 4.593138167431087e-05,
"loss": 0.592840576171875,
"step": 3890
},
{
"epoch": 2.0990445431301303,
"grad_norm": 38.52595520019531,
"learning_rate": 4.54333207353178e-05,
"loss": 0.9797579765319824,
"step": 3900
},
{
"epoch": 2.0990445431301303,
"eval_loss": 0.4082370102405548,
"eval_runtime": 63.7106,
"eval_samples_per_second": 51.844,
"eval_steps_per_second": 12.965,
"step": 3900
},
{
"epoch": 2.104427398735029,
"grad_norm": 38.00594711303711,
"learning_rate": 4.493717992372014e-05,
"loss": 0.6796042919158936,
"step": 3910
},
{
"epoch": 2.1098102543399273,
"grad_norm": 22.110828399658203,
"learning_rate": 4.444297669803981e-05,
"loss": 1.6094877243041992,
"step": 3920
},
{
"epoch": 2.115193109944826,
"grad_norm": 14.167129516601562,
"learning_rate": 4.395072844861762e-05,
"loss": 0.752195167541504,
"step": 3930
},
{
"epoch": 2.1205759655497243,
"grad_norm": 13.590848922729492,
"learning_rate": 4.3460452497001546e-05,
"loss": 0.9873428344726562,
"step": 3940
},
{
"epoch": 2.1259588211546223,
"grad_norm": 21.298370361328125,
"learning_rate": 4.2972166095336996e-05,
"loss": 0.7805982112884522,
"step": 3950
},
{
"epoch": 2.131341676759521,
"grad_norm": 26.588743209838867,
"learning_rate": 4.2485886425759824e-05,
"loss": 0.8509333610534668,
"step": 3960
},
{
"epoch": 2.1367245323644193,
"grad_norm": 14.079202651977539,
"learning_rate": 4.200163059979168e-05,
"loss": 0.46779747009277345,
"step": 3970
},
{
"epoch": 2.1421073879693178,
"grad_norm": 16.043773651123047,
"learning_rate": 4.1519415657738026e-05,
"loss": 0.4787121295928955,
"step": 3980
},
{
"epoch": 2.1474902435742163,
"grad_norm": 21.35724449157715,
"learning_rate": 4.103925856808817e-05,
"loss": 0.9199463844299316,
"step": 3990
},
{
"epoch": 2.1528730991791143,
"grad_norm": 27.052135467529297,
"learning_rate": 4.056117622691863e-05,
"loss": 1.4920102119445802,
"step": 4000
},
{
"epoch": 2.1528730991791143,
"eval_loss": 0.4048362374305725,
"eval_runtime": 63.48,
"eval_samples_per_second": 52.032,
"eval_steps_per_second": 13.012,
"step": 4000
},
{
"epoch": 2.1582559547840128,
"grad_norm": 1.1041878461837769,
"learning_rate": 4.008518545729818e-05,
"loss": 0.5191349029541016,
"step": 4010
},
{
"epoch": 2.1636388103889113,
"grad_norm": 19.768545150756836,
"learning_rate": 3.9611303008696073e-05,
"loss": 0.9854854583740235,
"step": 4020
},
{
"epoch": 2.1690216659938097,
"grad_norm": 55.555599212646484,
"learning_rate": 3.913954555639263e-05,
"loss": 0.7864606857299805,
"step": 4030
},
{
"epoch": 2.1744045215987082,
"grad_norm": 38.11814880371094,
"learning_rate": 3.866992970089238e-05,
"loss": 1.094459342956543,
"step": 4040
},
{
"epoch": 2.1797873772036067,
"grad_norm": 25.64844512939453,
"learning_rate": 3.8202471967340004e-05,
"loss": 0.7594769477844239,
"step": 4050
},
{
"epoch": 2.1851702328085048,
"grad_norm": 39.07038879394531,
"learning_rate": 3.773718880493883e-05,
"loss": 0.767018985748291,
"step": 4060
},
{
"epoch": 2.1905530884134032,
"grad_norm": 11.75182819366455,
"learning_rate": 3.727409658637194e-05,
"loss": 1.0294831275939942,
"step": 4070
},
{
"epoch": 2.1959359440183017,
"grad_norm": 20.518577575683594,
"learning_rate": 3.681321160722606e-05,
"loss": 0.6886996746063232,
"step": 4080
},
{
"epoch": 2.2013187996232,
"grad_norm": 38.67143630981445,
"learning_rate": 3.6354550085418207e-05,
"loss": 1.033548069000244,
"step": 4090
},
{
"epoch": 2.2067016552280987,
"grad_norm": 37.95046615600586,
"learning_rate": 3.589812816062489e-05,
"loss": 1.114480209350586,
"step": 4100
},
{
"epoch": 2.2067016552280987,
"eval_loss": 0.40899786353111267,
"eval_runtime": 63.5021,
"eval_samples_per_second": 52.014,
"eval_steps_per_second": 13.007,
"step": 4100
},
{
"epoch": 2.2120845108329967,
"grad_norm": 11.148638725280762,
"learning_rate": 3.544396189371425e-05,
"loss": 0.6971592426300048,
"step": 4110
},
{
"epoch": 2.217467366437895,
"grad_norm": 22.88878631591797,
"learning_rate": 3.4992067266181015e-05,
"loss": 0.669145917892456,
"step": 4120
},
{
"epoch": 2.2228502220427937,
"grad_norm": 6.007533550262451,
"learning_rate": 3.454246017958376e-05,
"loss": 0.627226448059082,
"step": 4130
},
{
"epoch": 2.228233077647692,
"grad_norm": 6.372663497924805,
"learning_rate": 3.409515645498583e-05,
"loss": 0.4246776580810547,
"step": 4140
},
{
"epoch": 2.2336159332525907,
"grad_norm": 37.81616973876953,
"learning_rate": 3.3650171832398284e-05,
"loss": 0.8943648338317871,
"step": 4150
},
{
"epoch": 2.2389987888574887,
"grad_norm": 35.7336540222168,
"learning_rate": 3.3207521970226104e-05,
"loss": 1.005715560913086,
"step": 4160
},
{
"epoch": 2.244381644462387,
"grad_norm": 25.88532066345215,
"learning_rate": 3.2767222444717295e-05,
"loss": 0.6161307334899903,
"step": 4170
},
{
"epoch": 2.2497645000672857,
"grad_norm": 1.1592823266983032,
"learning_rate": 3.232928874941463e-05,
"loss": 0.35333144664764404,
"step": 4180
},
{
"epoch": 2.255147355672184,
"grad_norm": 18.25936508178711,
"learning_rate": 3.189373629461056e-05,
"loss": 0.603509521484375,
"step": 4190
},
{
"epoch": 2.2605302112770826,
"grad_norm": 18.44670295715332,
"learning_rate": 3.1460580406804975e-05,
"loss": 0.9603145599365235,
"step": 4200
},
{
"epoch": 2.2605302112770826,
"eval_loss": 0.461373895406723,
"eval_runtime": 63.6154,
"eval_samples_per_second": 51.921,
"eval_steps_per_second": 12.984,
"step": 4200
},
{
"epoch": 2.265913066881981,
"grad_norm": 7.78346586227417,
"learning_rate": 3.102983632816573e-05,
"loss": 0.832798957824707,
"step": 4210
},
{
"epoch": 2.271295922486879,
"grad_norm": 23.0885066986084,
"learning_rate": 3.060151921599241e-05,
"loss": 0.9533357620239258,
"step": 4220
},
{
"epoch": 2.2766787780917777,
"grad_norm": 18.10384750366211,
"learning_rate": 3.017564414218299e-05,
"loss": 0.64031081199646,
"step": 4230
},
{
"epoch": 2.282061633696676,
"grad_norm": 38.35786437988281,
"learning_rate": 2.975222609270335e-05,
"loss": 0.6714494705200196,
"step": 4240
},
{
"epoch": 2.2874444893015746,
"grad_norm": 30.549135208129883,
"learning_rate": 2.9331279967060132e-05,
"loss": 0.6489608764648438,
"step": 4250
},
{
"epoch": 2.292827344906473,
"grad_norm": 22.884374618530273,
"learning_rate": 2.8912820577776234e-05,
"loss": 0.6908737182617187,
"step": 4260
},
{
"epoch": 2.298210200511371,
"grad_norm": 3.388777732849121,
"learning_rate": 2.8496862649869706e-05,
"loss": 0.52658109664917,
"step": 4270
},
{
"epoch": 2.3035930561162696,
"grad_norm": 49.91218948364258,
"learning_rate": 2.808342082033556e-05,
"loss": 1.008077049255371,
"step": 4280
},
{
"epoch": 2.308975911721168,
"grad_norm": 10.552830696105957,
"learning_rate": 2.767250963763075e-05,
"loss": 0.8219211578369141,
"step": 4290
},
{
"epoch": 2.3143587673260666,
"grad_norm": 52.01408386230469,
"learning_rate": 2.7264143561162136e-05,
"loss": 1.2357698440551759,
"step": 4300
},
{
"epoch": 2.3143587673260666,
"eval_loss": 0.4524453580379486,
"eval_runtime": 63.5057,
"eval_samples_per_second": 52.011,
"eval_steps_per_second": 13.007,
"step": 4300
},
{
"epoch": 2.319741622930965,
"grad_norm": 8.435943603515625,
"learning_rate": 2.6858336960777863e-05,
"loss": 0.7867340087890625,
"step": 4310
},
{
"epoch": 2.325124478535863,
"grad_norm": 25.12037467956543,
"learning_rate": 2.6455104116261477e-05,
"loss": 0.6435882091522217,
"step": 4320
},
{
"epoch": 2.3305073341407616,
"grad_norm": 19.58714485168457,
"learning_rate": 2.6054459216829573e-05,
"loss": 0.7821506977081298,
"step": 4330
},
{
"epoch": 2.33589018974566,
"grad_norm": 17.670440673828125,
"learning_rate": 2.5656416360632494e-05,
"loss": 0.7270960807800293,
"step": 4340
},
{
"epoch": 2.3412730453505586,
"grad_norm": 19.895416259765625,
"learning_rate": 2.5260989554258185e-05,
"loss": 1.1800201416015625,
"step": 4350
},
{
"epoch": 2.346655900955457,
"grad_norm": 27.924663543701172,
"learning_rate": 2.4868192712239348e-05,
"loss": 0.891145896911621,
"step": 4360
},
{
"epoch": 2.352038756560355,
"grad_norm": 24.85103988647461,
"learning_rate": 2.44780396565639e-05,
"loss": 0.9543925285339355,
"step": 4370
},
{
"epoch": 2.3574216121652536,
"grad_norm": 23.492963790893555,
"learning_rate": 2.409054411618831e-05,
"loss": 1.0963412284851075,
"step": 4380
},
{
"epoch": 2.362804467770152,
"grad_norm": 23.491336822509766,
"learning_rate": 2.370571972655489e-05,
"loss": 0.7562737464904785,
"step": 4390
},
{
"epoch": 2.3681873233750506,
"grad_norm": 9.930757522583008,
"learning_rate": 2.332358002911167e-05,
"loss": 0.5512786388397217,
"step": 4400
},
{
"epoch": 2.3681873233750506,
"eval_loss": 0.43738052248954773,
"eval_runtime": 63.71,
"eval_samples_per_second": 51.844,
"eval_steps_per_second": 12.965,
"step": 4400
},
{
"epoch": 2.373570178979949,
"grad_norm": 24.945201873779297,
"learning_rate": 2.294413847083604e-05,
"loss": 0.719010305404663,
"step": 4410
},
{
"epoch": 2.378953034584847,
"grad_norm": 18.582550048828125,
"learning_rate": 2.2567408403761526e-05,
"loss": 0.9431358337402344,
"step": 4420
},
{
"epoch": 2.3843358901897456,
"grad_norm": 3.468303680419922,
"learning_rate": 2.2193403084507947e-05,
"loss": 0.6178753852844239,
"step": 4430
},
{
"epoch": 2.389718745794644,
"grad_norm": 22.029281616210938,
"learning_rate": 2.1822135673814948e-05,
"loss": 1.0714486122131348,
"step": 4440
},
{
"epoch": 2.3951016013995425,
"grad_norm": 19.43686294555664,
"learning_rate": 2.1453619236078937e-05,
"loss": 0.831718635559082,
"step": 4450
},
{
"epoch": 2.400484457004441,
"grad_norm": 20.41507911682129,
"learning_rate": 2.1087866738893246e-05,
"loss": 0.7316448211669921,
"step": 4460
},
{
"epoch": 2.405867312609339,
"grad_norm": 24.05844497680664,
"learning_rate": 2.072489105259192e-05,
"loss": 0.5118863582611084,
"step": 4470
},
{
"epoch": 2.4112501682142375,
"grad_norm": 4.802274703979492,
"learning_rate": 2.036470494979681e-05,
"loss": 0.4543926239013672,
"step": 4480
},
{
"epoch": 2.416633023819136,
"grad_norm": 6.404051780700684,
"learning_rate": 2.000732110496808e-05,
"loss": 0.6312252521514893,
"step": 4490
},
{
"epoch": 2.4220158794240345,
"grad_norm": 23.455795288085938,
"learning_rate": 1.9652752093958225e-05,
"loss": 0.5971816062927247,
"step": 4500
},
{
"epoch": 2.4220158794240345,
"eval_loss": 0.4342218041419983,
"eval_runtime": 63.961,
"eval_samples_per_second": 51.641,
"eval_steps_per_second": 12.914,
"step": 4500
},
{
"epoch": 2.427398735028933,
"grad_norm": 35.069087982177734,
"learning_rate": 1.9301010393569676e-05,
"loss": 0.763551664352417,
"step": 4510
},
{
"epoch": 2.432781590633831,
"grad_norm": 22.598342895507812,
"learning_rate": 1.895210838111544e-05,
"loss": 1.073389434814453,
"step": 4520
},
{
"epoch": 2.4381644462387295,
"grad_norm": 15.471684455871582,
"learning_rate": 1.8606058333983946e-05,
"loss": 0.8500160217285156,
"step": 4530
},
{
"epoch": 2.443547301843628,
"grad_norm": 38.8491325378418,
"learning_rate": 1.8262872429206734e-05,
"loss": 1.3663853645324706,
"step": 4540
},
{
"epoch": 2.4489301574485265,
"grad_norm": 22.642866134643555,
"learning_rate": 1.7922562743030057e-05,
"loss": 0.6329252243041992,
"step": 4550
},
{
"epoch": 2.454313013053425,
"grad_norm": 16.064590454101562,
"learning_rate": 1.7585141250490022e-05,
"loss": 0.8116084098815918,
"step": 4560
},
{
"epoch": 2.459695868658323,
"grad_norm": 26.74970245361328,
"learning_rate": 1.725061982499103e-05,
"loss": 0.8728569984436035,
"step": 4570
},
{
"epoch": 2.4650787242632215,
"grad_norm": 13.955748558044434,
"learning_rate": 1.69190102378881e-05,
"loss": 0.7079121589660644,
"step": 4580
},
{
"epoch": 2.47046157986812,
"grad_norm": 30.616897583007812,
"learning_rate": 1.6590324158072603e-05,
"loss": 0.8990015029907227,
"step": 4590
},
{
"epoch": 2.4758444354730185,
"grad_norm": 20.03752899169922,
"learning_rate": 1.6264573151561648e-05,
"loss": 1.1187437057495118,
"step": 4600
},
{
"epoch": 2.4758444354730185,
"eval_loss": 0.39977964758872986,
"eval_runtime": 63.806,
"eval_samples_per_second": 51.766,
"eval_steps_per_second": 12.945,
"step": 4600
},
{
"epoch": 2.481227291077917,
"grad_norm": 18.699827194213867,
"learning_rate": 1.5941768681091085e-05,
"loss": 0.7999272346496582,
"step": 4610
},
{
"epoch": 2.486610146682815,
"grad_norm": 4.604935646057129,
"learning_rate": 1.562192210571225e-05,
"loss": 0.8284183502197265,
"step": 4620
},
{
"epoch": 2.4919930022877135,
"grad_norm": 29.9500732421875,
"learning_rate": 1.5305044680392e-05,
"loss": 0.8354525566101074,
"step": 4630
},
{
"epoch": 2.497375857892612,
"grad_norm": 37.695804595947266,
"learning_rate": 1.499114755561699e-05,
"loss": 0.8016999244689942,
"step": 4640
},
{
"epoch": 2.5027587134975104,
"grad_norm": 4.899083614349365,
"learning_rate": 1.4680241777001059e-05,
"loss": 0.9540206909179687,
"step": 4650
},
{
"epoch": 2.508141569102409,
"grad_norm": 26.045948028564453,
"learning_rate": 1.4372338284896647e-05,
"loss": 0.5969816684722901,
"step": 4660
},
{
"epoch": 2.513524424707307,
"grad_norm": 23.402122497558594,
"learning_rate": 1.4067447914009823e-05,
"loss": 0.7931214809417725,
"step": 4670
},
{
"epoch": 2.518907280312206,
"grad_norm": 5.232571601867676,
"learning_rate": 1.3765581393018978e-05,
"loss": 0.6403655052185059,
"step": 4680
},
{
"epoch": 2.524290135917104,
"grad_norm": 11.179905891418457,
"learning_rate": 1.3466749344197339e-05,
"loss": 0.5316050529479981,
"step": 4690
},
{
"epoch": 2.5296729915220024,
"grad_norm": 21.05845069885254,
"learning_rate": 1.3170962283039235e-05,
"loss": 1.0778657913208007,
"step": 4700
},
{
"epoch": 2.5296729915220024,
"eval_loss": 0.40597495436668396,
"eval_runtime": 63.8788,
"eval_samples_per_second": 51.707,
"eval_steps_per_second": 12.931,
"step": 4700
},
{
"epoch": 2.535055847126901,
"grad_norm": 17.45840072631836,
"learning_rate": 1.2878230617889918e-05,
"loss": 1.3090163230895997,
"step": 4710
},
{
"epoch": 2.540438702731799,
"grad_norm": 13.649649620056152,
"learning_rate": 1.2588564649579449e-05,
"loss": 0.6182886600494385,
"step": 4720
},
{
"epoch": 2.545821558336698,
"grad_norm": 30.202678680419922,
"learning_rate": 1.2301974571060181e-05,
"loss": 0.8260242462158203,
"step": 4730
},
{
"epoch": 2.551204413941596,
"grad_norm": 9.608967781066895,
"learning_rate": 1.2018470467048072e-05,
"loss": 0.5750818729400635,
"step": 4740
},
{
"epoch": 2.5565872695464944,
"grad_norm": 12.897671699523926,
"learning_rate": 1.1738062313667786e-05,
"loss": 0.8292213439941406,
"step": 4750
},
{
"epoch": 2.561970125151393,
"grad_norm": 48.488006591796875,
"learning_rate": 1.1460759978101787e-05,
"loss": 0.8127927780151367,
"step": 4760
},
{
"epoch": 2.5673529807562914,
"grad_norm": 30.89815330505371,
"learning_rate": 1.118657321824289e-05,
"loss": 0.710633659362793,
"step": 4770
},
{
"epoch": 2.57273583636119,
"grad_norm": 17.691478729248047,
"learning_rate": 1.0915511682351142e-05,
"loss": 0.6440166473388672,
"step": 4780
},
{
"epoch": 2.578118691966088,
"grad_norm": 27.643741607666016,
"learning_rate": 1.0647584908714148e-05,
"loss": 0.679203987121582,
"step": 4790
},
{
"epoch": 2.5835015475709864,
"grad_norm": 27.048784255981445,
"learning_rate": 1.0382802325311491e-05,
"loss": 0.9150435447692871,
"step": 4800
},
{
"epoch": 2.5835015475709864,
"eval_loss": 0.40863797068595886,
"eval_runtime": 63.903,
"eval_samples_per_second": 51.688,
"eval_steps_per_second": 12.926,
"step": 4800
},
{
"epoch": 2.588884403175885,
"grad_norm": 17.041791915893555,
"learning_rate": 1.0121173249482962e-05,
"loss": 0.8509119987487793,
"step": 4810
},
{
"epoch": 2.5942672587807833,
"grad_norm": 28.006967544555664,
"learning_rate": 9.862706887600714e-06,
"loss": 0.8236183166503906,
"step": 4820
},
{
"epoch": 2.599650114385682,
"grad_norm": 36.17509078979492,
"learning_rate": 9.607412334745235e-06,
"loss": 0.839243221282959,
"step": 4830
},
{
"epoch": 2.60503296999058,
"grad_norm": 1.2139636278152466,
"learning_rate": 9.355298574385474e-06,
"loss": 0.49801297187805177,
"step": 4840
},
{
"epoch": 2.6104158255954784,
"grad_norm": 24.570405960083008,
"learning_rate": 9.106374478062485e-06,
"loss": 0.7030567169189453,
"step": 4850
},
{
"epoch": 2.615798681200377,
"grad_norm": 25.26799201965332,
"learning_rate": 8.86064880507742e-06,
"loss": 0.8722931861877441,
"step": 4860
},
{
"epoch": 2.6211815368052753,
"grad_norm": 18.12640380859375,
"learning_rate": 8.618130202183317e-06,
"loss": 0.8933378219604492,
"step": 4870
},
{
"epoch": 2.626564392410174,
"grad_norm": 33.00815200805664,
"learning_rate": 8.378827203280625e-06,
"loss": 0.7595347881317138,
"step": 4880
},
{
"epoch": 2.631947248015072,
"grad_norm": 1.4025450944900513,
"learning_rate": 8.142748229117192e-06,
"loss": 1.158553695678711,
"step": 4890
},
{
"epoch": 2.6373301036199703,
"grad_norm": 2.04663348197937,
"learning_rate": 7.909901586991752e-06,
"loss": 0.495909595489502,
"step": 4900
},
{
"epoch": 2.6373301036199703,
"eval_loss": 0.4060768187046051,
"eval_runtime": 63.9323,
"eval_samples_per_second": 51.664,
"eval_steps_per_second": 12.92,
"step": 4900
},
{
"epoch": 2.642712959224869,
"grad_norm": 34.9760856628418,
"learning_rate": 7.680295470461651e-06,
"loss": 0.8339058876037597,
"step": 4910
},
{
"epoch": 2.6480958148297673,
"grad_norm": 7.547365665435791,
"learning_rate": 7.4539379590545575e-06,
"loss": 1.0124500274658204,
"step": 4920
},
{
"epoch": 2.653478670434666,
"grad_norm": 36.673561096191406,
"learning_rate": 7.230837017984127e-06,
"loss": 0.9258150100708008,
"step": 4930
},
{
"epoch": 2.658861526039564,
"grad_norm": 12.191123962402344,
"learning_rate": 7.011000497869691e-06,
"loss": 0.7174896240234375,
"step": 4940
},
{
"epoch": 2.6642443816444623,
"grad_norm": 27.09784507751465,
"learning_rate": 6.794436134460125e-06,
"loss": 0.7737472534179688,
"step": 4950
},
{
"epoch": 2.669627237249361,
"grad_norm": 1.9672365188598633,
"learning_rate": 6.581151548361475e-06,
"loss": 0.7733006954193116,
"step": 4960
},
{
"epoch": 2.6750100928542593,
"grad_norm": 24.851816177368164,
"learning_rate": 6.3711542447688956e-06,
"loss": 0.976164436340332,
"step": 4970
},
{
"epoch": 2.6803929484591578,
"grad_norm": 4.714712142944336,
"learning_rate": 6.164451613202515e-06,
"loss": 1.361710262298584,
"step": 4980
},
{
"epoch": 2.685775804064056,
"grad_norm": 33.14804458618164,
"learning_rate": 5.961050927247458e-06,
"loss": 1.0757354736328124,
"step": 4990
},
{
"epoch": 2.6911586596689543,
"grad_norm": 19.453475952148438,
"learning_rate": 5.760959344297811e-06,
"loss": 0.7794712543487549,
"step": 5000
},
{
"epoch": 2.6911586596689543,
"eval_loss": 0.3953015208244324,
"eval_runtime": 63.9175,
"eval_samples_per_second": 51.676,
"eval_steps_per_second": 12.923,
"step": 5000
},
{
"epoch": 2.6965415152738528,
"grad_norm": 38.8685302734375,
"learning_rate": 5.56418390530492e-06,
"loss": 0.8262761116027832,
"step": 5010
},
{
"epoch": 2.7019243708787513,
"grad_norm": 42.21137237548828,
"learning_rate": 5.370731534529383e-06,
"loss": 0.9226728439331054,
"step": 5020
},
{
"epoch": 2.7073072264836497,
"grad_norm": 11.871996879577637,
"learning_rate": 5.180609039297646e-06,
"loss": 0.4317474365234375,
"step": 5030
},
{
"epoch": 2.712690082088548,
"grad_norm": 1.4888293743133545,
"learning_rate": 4.993823109762319e-06,
"loss": 1.047317886352539,
"step": 5040
},
{
"epoch": 2.7180729376934463,
"grad_norm": 31.726903915405273,
"learning_rate": 4.810380318666774e-06,
"loss": 0.9913960456848144,
"step": 5050
},
{
"epoch": 2.7234557932983448,
"grad_norm": 30.20676040649414,
"learning_rate": 4.630287121113897e-06,
"loss": 0.6376973628997803,
"step": 5060
},
{
"epoch": 2.7288386489032432,
"grad_norm": 29.86091423034668,
"learning_rate": 4.453549854338934e-06,
"loss": 0.8093062400817871,
"step": 5070
},
{
"epoch": 2.7342215045081417,
"grad_norm": 3.3067686557769775,
"learning_rate": 4.280174737486442e-06,
"loss": 1.0463817596435547,
"step": 5080
},
{
"epoch": 2.7396043601130398,
"grad_norm": 0.369608610868454,
"learning_rate": 4.110167871391546e-06,
"loss": 0.7146965980529785,
"step": 5090
},
{
"epoch": 2.7449872157179382,
"grad_norm": 17.710023880004883,
"learning_rate": 3.943535238365137e-06,
"loss": 0.4951002597808838,
"step": 5100
},
{
"epoch": 2.7449872157179382,
"eval_loss": 0.3943323791027069,
"eval_runtime": 63.9034,
"eval_samples_per_second": 51.687,
"eval_steps_per_second": 12.926,
"step": 5100
},
{
"epoch": 2.7503700713228367,
"grad_norm": 13.03876781463623,
"learning_rate": 3.780282701983462e-06,
"loss": 0.8074542045593261,
"step": 5110
},
{
"epoch": 2.755752926927735,
"grad_norm": 36.00669860839844,
"learning_rate": 3.620416006881722e-06,
"loss": 1.496070957183838,
"step": 5120
},
{
"epoch": 2.7611357825326337,
"grad_norm": 20.361572265625,
"learning_rate": 3.4639407785519774e-06,
"loss": 1.3481143951416015,
"step": 5130
},
{
"epoch": 2.7665186381375317,
"grad_norm": 20.532785415649414,
"learning_rate": 3.310862523145197e-06,
"loss": 0.5495355129241943,
"step": 5140
},
{
"epoch": 2.7719014937424302,
"grad_norm": 17.233598709106445,
"learning_rate": 3.161186627277435e-06,
"loss": 0.9931418418884277,
"step": 5150
},
{
"epoch": 2.7772843493473287,
"grad_norm": 10.674700736999512,
"learning_rate": 3.014918357840368e-06,
"loss": 0.6294282913208008,
"step": 5160
},
{
"epoch": 2.782667204952227,
"grad_norm": 29.000959396362305,
"learning_rate": 2.872062861815905e-06,
"loss": 0.7137054920196533,
"step": 5170
},
{
"epoch": 2.7880500605571257,
"grad_norm": 27.14993667602539,
"learning_rate": 2.732625166095093e-06,
"loss": 0.7461415767669678,
"step": 5180
},
{
"epoch": 2.7934329161620237,
"grad_norm": 19.03074073791504,
"learning_rate": 2.5966101773012064e-06,
"loss": 0.9058383941650391,
"step": 5190
},
{
"epoch": 2.798815771766922,
"grad_norm": 25.3709659576416,
"learning_rate": 2.464022681617162e-06,
"loss": 0.9319804191589356,
"step": 5200
},
{
"epoch": 2.798815771766922,
"eval_loss": 0.39116066694259644,
"eval_runtime": 63.7425,
"eval_samples_per_second": 51.818,
"eval_steps_per_second": 12.958,
"step": 5200
},
{
"epoch": 2.8041986273718207,
"grad_norm": 24.770858764648438,
"learning_rate": 2.334867344616998e-06,
"loss": 0.8134791374206543,
"step": 5210
},
{
"epoch": 2.809581482976719,
"grad_norm": 32.360477447509766,
"learning_rate": 2.2091487111017383e-06,
"loss": 0.9853259086608886,
"step": 5220
},
{
"epoch": 2.8149643385816177,
"grad_norm": 26.975568771362305,
"learning_rate": 2.086871204939511e-06,
"loss": 0.3680762767791748,
"step": 5230
},
{
"epoch": 2.8203471941865157,
"grad_norm": 40.22636413574219,
"learning_rate": 1.9680391289098266e-06,
"loss": 0.7327807426452637,
"step": 5240
},
{
"epoch": 2.8257300497914146,
"grad_norm": 27.841876983642578,
"learning_rate": 1.852656664552166e-06,
"loss": 1.114755630493164,
"step": 5250
},
{
"epoch": 2.8311129053963127,
"grad_norm": 23.36740493774414,
"learning_rate": 1.740727872018899e-06,
"loss": 1.0058785438537599,
"step": 5260
},
{
"epoch": 2.836495761001211,
"grad_norm": 3.433856725692749,
"learning_rate": 1.632256689932321e-06,
"loss": 0.6553703784942627,
"step": 5270
},
{
"epoch": 2.8418786166061096,
"grad_norm": 28.19014549255371,
"learning_rate": 1.5272469352461517e-06,
"loss": 0.5715783119201661,
"step": 5280
},
{
"epoch": 2.8472614722110077,
"grad_norm": 33.08034133911133,
"learning_rate": 1.4257023031111538e-06,
"loss": 1.0896245002746583,
"step": 5290
},
{
"epoch": 2.8526443278159066,
"grad_norm": 29.616188049316406,
"learning_rate": 1.3276263667451272e-06,
"loss": 0.575172758102417,
"step": 5300
},
{
"epoch": 2.8526443278159066,
"eval_loss": 0.39213913679122925,
"eval_runtime": 63.7458,
"eval_samples_per_second": 51.815,
"eval_steps_per_second": 12.958,
"step": 5300
},
{
"epoch": 2.8580271834208046,
"grad_norm": 24.045257568359375,
"learning_rate": 1.2330225773071858e-06,
"loss": 0.6139691352844239,
"step": 5310
},
{
"epoch": 2.863410039025703,
"grad_norm": 32.76106643676758,
"learning_rate": 1.1418942637763109e-06,
"loss": 0.6473401069641114,
"step": 5320
},
{
"epoch": 2.8687928946306016,
"grad_norm": 17.230541229248047,
"learning_rate": 1.054244632834167e-06,
"loss": 0.6802839279174805,
"step": 5330
},
{
"epoch": 2.8741757502355,
"grad_norm": 14.499601364135742,
"learning_rate": 9.700767687523483e-07,
"loss": 0.8065154075622558,
"step": 5340
},
{
"epoch": 2.8795586058403986,
"grad_norm": 16.937408447265625,
"learning_rate": 8.893936332837749e-07,
"loss": 1.2557835578918457,
"step": 5350
},
{
"epoch": 2.8849414614452966,
"grad_norm": 18.08892250061035,
"learning_rate": 8.121980655584783e-07,
"loss": 0.5564064979553223,
"step": 5360
},
{
"epoch": 2.890324317050195,
"grad_norm": 5.15496826171875,
"learning_rate": 7.384927819837461e-07,
"loss": 0.7302708625793457,
"step": 5370
},
{
"epoch": 2.8957071726550936,
"grad_norm": 0.6171675324440002,
"learning_rate": 6.68280376148489e-07,
"loss": 0.46964249610900877,
"step": 5380
},
{
"epoch": 2.901090028259992,
"grad_norm": 12.738670349121094,
"learning_rate": 6.01563318731968e-07,
"loss": 0.8759981155395508,
"step": 5390
},
{
"epoch": 2.9064728838648906,
"grad_norm": 8.0991849899292,
"learning_rate": 5.383439574169313e-07,
"loss": 0.3772397994995117,
"step": 5400
},
{
"epoch": 2.9064728838648906,
"eval_loss": 0.39079996943473816,
"eval_runtime": 63.7806,
"eval_samples_per_second": 51.787,
"eval_steps_per_second": 12.951,
"step": 5400
},
{
"epoch": 2.9118557394697886,
"grad_norm": 2.8664917945861816,
"learning_rate": 4.786245168068804e-07,
"loss": 0.6327933311462403,
"step": 5410
},
{
"epoch": 2.917238595074687,
"grad_norm": 15.887563705444336,
"learning_rate": 4.2240709834791004e-07,
"loss": 0.8755616188049317,
"step": 5420
},
{
"epoch": 2.9226214506795856,
"grad_norm": 10.990631103515625,
"learning_rate": 3.696936802546902e-07,
"loss": 0.9237110137939453,
"step": 5430
},
{
"epoch": 2.928004306284484,
"grad_norm": 36.54423141479492,
"learning_rate": 3.204861174408547e-07,
"loss": 0.6388278484344483,
"step": 5440
},
{
"epoch": 2.9333871618893825,
"grad_norm": 25.8781795501709,
"learning_rate": 2.747861414537756e-07,
"loss": 0.8046004295349121,
"step": 5450
},
{
"epoch": 2.9387700174942806,
"grad_norm": 14.25063419342041,
"learning_rate": 2.3259536041357888e-07,
"loss": 1.015383243560791,
"step": 5460
},
{
"epoch": 2.944152873099179,
"grad_norm": 49.4938850402832,
"learning_rate": 1.9391525895661178e-07,
"loss": 0.9852633476257324,
"step": 5470
},
{
"epoch": 2.9495357287040775,
"grad_norm": 8.794760704040527,
"learning_rate": 1.587471981831512e-07,
"loss": 0.7090904235839843,
"step": 5480
},
{
"epoch": 2.954918584308976,
"grad_norm": 20.00497055053711,
"learning_rate": 1.27092415609531e-07,
"loss": 0.8313823699951172,
"step": 5490
},
{
"epoch": 2.9603014399138745,
"grad_norm": 33.549407958984375,
"learning_rate": 9.89520251245879e-08,
"loss": 0.7701246261596679,
"step": 5500
},
{
"epoch": 2.9603014399138745,
"eval_loss": 0.3912367820739746,
"eval_runtime": 63.5041,
"eval_samples_per_second": 52.012,
"eval_steps_per_second": 13.007,
"step": 5500
}
],
"logging_steps": 10,
"max_steps": 5574,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.246694746194002e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}