VibaoAI-CPT / trainer_state.json
Toilatop1sever's picture
CPT checkpoint step 47000
69a0aa8 verified
Raw
History Blame Contribute Delete
186 kB
Invalid JSON:Unexpected token 'I', ..."ad_norm": Infinity, "... is not valid JSON
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.9802814527681807,
"eval_steps": 1000,
"global_step": 47000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0021066823965618943,
"grad_norm": 0.7183173298835754,
"learning_rate": 1.225e-05,
"loss": 3.2731781005859375,
"step": 50
},
{
"epoch": 0.004213364793123789,
"grad_norm": 0.6987810134887695,
"learning_rate": 2.4750000000000002e-05,
"loss": 3.2310821533203127,
"step": 100
},
{
"epoch": 0.006320047189685683,
"grad_norm": 0.7160114645957947,
"learning_rate": 3.7250000000000004e-05,
"loss": 3.2143896484375,
"step": 150
},
{
"epoch": 0.008426729586247577,
"grad_norm": 0.7347292900085449,
"learning_rate": 4.975e-05,
"loss": 3.1949951171875,
"step": 200
},
{
"epoch": 0.010533411982809472,
"grad_norm": 0.7420850992202759,
"learning_rate": 4.999986741211794e-05,
"loss": 3.1873373413085937,
"step": 250
},
{
"epoch": 0.012640094379371365,
"grad_norm": 0.6894696354866028,
"learning_rate": 4.9999458771223715e-05,
"loss": 3.1542486572265624,
"step": 300
},
{
"epoch": 0.01474677677593326,
"grad_norm": 0.7430497407913208,
"learning_rate": 4.9998774026608505e-05,
"loss": 3.1673529052734377,
"step": 350
},
{
"epoch": 0.016853459172495155,
"grad_norm": 0.7466180920600891,
"learning_rate": 4.999781318583491e-05,
"loss": 3.172335205078125,
"step": 400
},
{
"epoch": 0.018960141569057048,
"grad_norm": 0.7113528251647949,
"learning_rate": 4.999657625951482e-05,
"loss": 3.1631011962890625,
"step": 450
},
{
"epoch": 0.021066823965618944,
"grad_norm": 0.7085075974464417,
"learning_rate": 4.9995063261309336e-05,
"loss": 3.15373779296875,
"step": 500
},
{
"epoch": 0.023173506362180837,
"grad_norm": 0.7303823232650757,
"learning_rate": 4.999327420792859e-05,
"loss": 3.1551800537109376,
"step": 550
},
{
"epoch": 0.02528018875874273,
"grad_norm": 0.7048414945602417,
"learning_rate": 4.999120911913159e-05,
"loss": 3.144339599609375,
"step": 600
},
{
"epoch": 0.027386871155304627,
"grad_norm": 0.6965512633323669,
"learning_rate": 4.998886801772597e-05,
"loss": 3.135062255859375,
"step": 650
},
{
"epoch": 0.02949355355186652,
"grad_norm": 0.7184078097343445,
"learning_rate": 4.9986250929567766e-05,
"loss": 3.1415130615234377,
"step": 700
},
{
"epoch": 0.031600235948428416,
"grad_norm": 0.7143896222114563,
"learning_rate": 4.998335788356112e-05,
"loss": 3.148109130859375,
"step": 750
},
{
"epoch": 0.03370691834499031,
"grad_norm": 0.720639705657959,
"learning_rate": 4.9980188911657936e-05,
"loss": 3.1356280517578123,
"step": 800
},
{
"epoch": 0.0358136007415522,
"grad_norm": 0.7260337471961975,
"learning_rate": 4.997674404885759e-05,
"loss": 3.10700927734375,
"step": 850
},
{
"epoch": 0.037920283138114096,
"grad_norm": 0.7433862090110779,
"learning_rate": 4.997302333320648e-05,
"loss": 3.129173583984375,
"step": 900
},
{
"epoch": 0.040026965534675996,
"grad_norm": 0.6927924752235413,
"learning_rate": 4.996902680579762e-05,
"loss": 3.115341796875,
"step": 950
},
{
"epoch": 0.04213364793123789,
"grad_norm": 0.7047356963157654,
"learning_rate": 4.996475451077022e-05,
"loss": 3.1260260009765624,
"step": 1000
},
{
"epoch": 0.04213364793123789,
"eval_loss": 2.956613063812256,
"eval_runtime": 129.4336,
"eval_samples_per_second": 118.54,
"eval_steps_per_second": 3.708,
"step": 1000
},
{
"epoch": 0.04424033032779978,
"grad_norm": 0.7373839616775513,
"learning_rate": 4.9960206495309156e-05,
"loss": 3.109400634765625,
"step": 1050
},
{
"epoch": 0.046347012724361675,
"grad_norm": 0.700670063495636,
"learning_rate": 4.995538280964449e-05,
"loss": 3.115065612792969,
"step": 1100
},
{
"epoch": 0.04845369512092357,
"grad_norm": 0.6800923943519592,
"learning_rate": 4.995028350705086e-05,
"loss": 3.103834228515625,
"step": 1150
},
{
"epoch": 0.05056037751748546,
"grad_norm": 0.6795762181282043,
"learning_rate": 4.9944908643846954e-05,
"loss": 3.0806964111328123,
"step": 1200
},
{
"epoch": 0.05266705991404736,
"grad_norm": 0.6991699934005737,
"learning_rate": 4.993925827939484e-05,
"loss": 3.1230282592773437,
"step": 1250
},
{
"epoch": 0.054773742310609254,
"grad_norm": 0.7005462646484375,
"learning_rate": 4.9933332476099336e-05,
"loss": 3.0986212158203124,
"step": 1300
},
{
"epoch": 0.05688042470717115,
"grad_norm": 0.7109544277191162,
"learning_rate": 4.992713129940731e-05,
"loss": 3.12240966796875,
"step": 1350
},
{
"epoch": 0.05898710710373304,
"grad_norm": 0.7147893905639648,
"learning_rate": 4.9920654817806975e-05,
"loss": 3.113079833984375,
"step": 1400
},
{
"epoch": 0.06109378950029493,
"grad_norm": 0.7276305556297302,
"learning_rate": 4.99139031028271e-05,
"loss": 3.10232421875,
"step": 1450
},
{
"epoch": 0.06320047189685683,
"grad_norm": 0.6964511871337891,
"learning_rate": 4.9906876229036234e-05,
"loss": 3.091283874511719,
"step": 1500
},
{
"epoch": 0.06530715429341873,
"grad_norm": 0.7357209920883179,
"learning_rate": 4.9899574274041906e-05,
"loss": 3.1123638916015626,
"step": 1550
},
{
"epoch": 0.06741383668998062,
"grad_norm": 0.7081229090690613,
"learning_rate": 4.989199731848975e-05,
"loss": 3.0990875244140623,
"step": 1600
},
{
"epoch": 0.06952051908654251,
"grad_norm": 0.7206143736839294,
"learning_rate": 4.988414544606258e-05,
"loss": 3.106065673828125,
"step": 1650
},
{
"epoch": 0.0716272014831044,
"grad_norm": 0.7044396996498108,
"learning_rate": 4.9876018743479535e-05,
"loss": 3.118277893066406,
"step": 1700
},
{
"epoch": 0.0737338838796663,
"grad_norm": 0.7007234692573547,
"learning_rate": 4.986761730049507e-05,
"loss": 3.107901611328125,
"step": 1750
},
{
"epoch": 0.07584056627622819,
"grad_norm": 0.7111091613769531,
"learning_rate": 4.985894120989798e-05,
"loss": 3.0930078125,
"step": 1800
},
{
"epoch": 0.07794724867279008,
"grad_norm": 0.6917787790298462,
"learning_rate": 4.984999056751037e-05,
"loss": 3.0914599609375,
"step": 1850
},
{
"epoch": 0.08005393106935199,
"grad_norm": 0.7268196940422058,
"learning_rate": 4.9840765472186624e-05,
"loss": 3.096241455078125,
"step": 1900
},
{
"epoch": 0.08216061346591388,
"grad_norm": 0.700495183467865,
"learning_rate": 4.983126602581226e-05,
"loss": 3.0989410400390627,
"step": 1950
},
{
"epoch": 0.08426729586247578,
"grad_norm": 0.697629988193512,
"learning_rate": 4.9821492333302845e-05,
"loss": 3.0934375,
"step": 2000
},
{
"epoch": 0.08426729586247578,
"eval_loss": 2.9592740535736084,
"eval_runtime": 128.7893,
"eval_samples_per_second": 119.133,
"eval_steps_per_second": 3.727,
"step": 2000
},
{
"epoch": 0.08637397825903767,
"grad_norm": 0.7469701170921326,
"learning_rate": 4.981144450260283e-05,
"loss": 3.0795492553710937,
"step": 2050
},
{
"epoch": 0.08848066065559956,
"grad_norm": 0.7168535590171814,
"learning_rate": 4.980112264468437e-05,
"loss": 3.095859375,
"step": 2100
},
{
"epoch": 0.09058734305216146,
"grad_norm": 0.7082321047782898,
"learning_rate": 4.9790526873546056e-05,
"loss": 3.090489501953125,
"step": 2150
},
{
"epoch": 0.09269402544872335,
"grad_norm": 0.7243888974189758,
"learning_rate": 4.9779657306211704e-05,
"loss": 3.06650390625,
"step": 2200
},
{
"epoch": 0.09480070784528524,
"grad_norm": 0.7053064107894897,
"learning_rate": 4.976851406272902e-05,
"loss": 3.0657330322265626,
"step": 2250
},
{
"epoch": 0.09690739024184714,
"grad_norm": 0.6817116141319275,
"learning_rate": 4.975709726616831e-05,
"loss": 3.094239501953125,
"step": 2300
},
{
"epoch": 0.09901407263840903,
"grad_norm": 0.7089473605155945,
"learning_rate": 4.974540704262112e-05,
"loss": 3.0672488403320313,
"step": 2350
},
{
"epoch": 0.10112075503497092,
"grad_norm": 0.7032839059829712,
"learning_rate": 4.97334435211988e-05,
"loss": 3.0685894775390623,
"step": 2400
},
{
"epoch": 0.10322743743153283,
"grad_norm": 0.7137486934661865,
"learning_rate": 4.972120683403112e-05,
"loss": 3.1034426879882813,
"step": 2450
},
{
"epoch": 0.10533411982809472,
"grad_norm": 0.6994624733924866,
"learning_rate": 4.97086971162648e-05,
"loss": 3.079570617675781,
"step": 2500
},
{
"epoch": 0.10744080222465661,
"grad_norm": 0.7199147343635559,
"learning_rate": 4.9695914506062035e-05,
"loss": 3.0958953857421876,
"step": 2550
},
{
"epoch": 0.10954748462121851,
"grad_norm": 0.7233619689941406,
"learning_rate": 4.968285914459891e-05,
"loss": 3.0878173828125,
"step": 2600
},
{
"epoch": 0.1116541670177804,
"grad_norm": 0.7326440811157227,
"learning_rate": 4.966953117606391e-05,
"loss": 3.0890634155273435,
"step": 2650
},
{
"epoch": 0.1137608494143423,
"grad_norm": 0.6974560022354126,
"learning_rate": 4.9655930747656286e-05,
"loss": 3.0775030517578124,
"step": 2700
},
{
"epoch": 0.11586753181090419,
"grad_norm": 0.7033624053001404,
"learning_rate": 4.9642058009584444e-05,
"loss": 3.0849713134765624,
"step": 2750
},
{
"epoch": 0.11797421420746608,
"grad_norm": 0.6946061253547668,
"learning_rate": 4.96279131150643e-05,
"loss": 3.069232177734375,
"step": 2800
},
{
"epoch": 0.12008089660402797,
"grad_norm": 0.7199132442474365,
"learning_rate": 4.9613496220317536e-05,
"loss": 3.0727505493164062,
"step": 2850
},
{
"epoch": 0.12218757900058987,
"grad_norm": 0.7373772263526917,
"learning_rate": 4.959880748456994e-05,
"loss": 3.065733642578125,
"step": 2900
},
{
"epoch": 0.12429426139715176,
"grad_norm": 0.7177034616470337,
"learning_rate": 4.958384707004962e-05,
"loss": 3.07641845703125,
"step": 2950
},
{
"epoch": 0.12640094379371367,
"grad_norm": 0.6991363167762756,
"learning_rate": 4.956861514198518e-05,
"loss": 3.0732962036132814,
"step": 3000
},
{
"epoch": 0.12640094379371367,
"eval_loss": 2.960636615753174,
"eval_runtime": 129.7441,
"eval_samples_per_second": 118.256,
"eval_steps_per_second": 3.7,
"step": 3000
},
{
"epoch": 0.12850762619027556,
"grad_norm": 0.7046240568161011,
"learning_rate": 4.9553111868603944e-05,
"loss": 3.072054748535156,
"step": 3050
},
{
"epoch": 0.13061430858683745,
"grad_norm": 0.7022120356559753,
"learning_rate": 4.953733742113008e-05,
"loss": 3.0696722412109376,
"step": 3100
},
{
"epoch": 0.13272099098339935,
"grad_norm": 0.7111489772796631,
"learning_rate": 4.9521291973782705e-05,
"loss": 3.08820556640625,
"step": 3150
},
{
"epoch": 0.13482767337996124,
"grad_norm": 0.6908293962478638,
"learning_rate": 4.950497570377397e-05,
"loss": 3.0887225341796873,
"step": 3200
},
{
"epoch": 0.13693435577652313,
"grad_norm": 0.6781262159347534,
"learning_rate": 4.9488388791307096e-05,
"loss": 3.068189697265625,
"step": 3250
},
{
"epoch": 0.13904103817308502,
"grad_norm": 0.6849786639213562,
"learning_rate": 4.9471531419574356e-05,
"loss": 3.0767697143554686,
"step": 3300
},
{
"epoch": 0.14114772056964692,
"grad_norm": 0.6951805949211121,
"learning_rate": 4.945440377475513e-05,
"loss": 3.064984130859375,
"step": 3350
},
{
"epoch": 0.1432544029662088,
"grad_norm": 0.7169398069381714,
"learning_rate": 4.943700604601375e-05,
"loss": 3.073297119140625,
"step": 3400
},
{
"epoch": 0.1453610853627707,
"grad_norm": 0.6996468305587769,
"learning_rate": 4.9419338425497494e-05,
"loss": 3.083929443359375,
"step": 3450
},
{
"epoch": 0.1474677677593326,
"grad_norm": 0.7052185535430908,
"learning_rate": 4.940140110833442e-05,
"loss": 3.0852130126953123,
"step": 3500
},
{
"epoch": 0.1495744501558945,
"grad_norm": 0.7242560386657715,
"learning_rate": 4.93831942926312e-05,
"loss": 3.087889404296875,
"step": 3550
},
{
"epoch": 0.15168113255245638,
"grad_norm": 0.7300705909729004,
"learning_rate": 4.936471817947099e-05,
"loss": 3.038572998046875,
"step": 3600
},
{
"epoch": 0.15378781494901828,
"grad_norm": 0.7155873775482178,
"learning_rate": 4.934597297291114e-05,
"loss": 3.0702294921875,
"step": 3650
},
{
"epoch": 0.15589449734558017,
"grad_norm": 0.685499906539917,
"learning_rate": 4.932695887998098e-05,
"loss": 3.0512451171875,
"step": 3700
},
{
"epoch": 0.15800117974214206,
"grad_norm": 0.7155754566192627,
"learning_rate": 4.9307676110679535e-05,
"loss": 3.0650628662109374,
"step": 3750
},
{
"epoch": 0.16010786213870398,
"grad_norm": 0.7290592789649963,
"learning_rate": 4.928812487797319e-05,
"loss": 3.0623654174804686,
"step": 3800
},
{
"epoch": 0.16221454453526588,
"grad_norm": 0.7060722708702087,
"learning_rate": 4.926830539779335e-05,
"loss": 3.0404345703125,
"step": 3850
},
{
"epoch": 0.16432122693182777,
"grad_norm": 0.7160583734512329,
"learning_rate": 4.924821788903402e-05,
"loss": 3.032493896484375,
"step": 3900
},
{
"epoch": 0.16642790932838966,
"grad_norm": 0.7150232195854187,
"learning_rate": 4.922786257354947e-05,
"loss": 3.0439007568359373,
"step": 3950
},
{
"epoch": 0.16853459172495155,
"grad_norm": 0.712369978427887,
"learning_rate": 4.920723967615168e-05,
"loss": 3.04423095703125,
"step": 4000
},
{
"epoch": 0.16853459172495155,
"eval_loss": 2.961803674697876,
"eval_runtime": 124.6859,
"eval_samples_per_second": 123.053,
"eval_steps_per_second": 3.85,
"step": 4000
},
{
"epoch": 0.17064127412151345,
"grad_norm": 0.7305163145065308,
"learning_rate": 4.9186349424607934e-05,
"loss": 3.074200439453125,
"step": 4050
},
{
"epoch": 0.17274795651807534,
"grad_norm": 0.7282182574272156,
"learning_rate": 4.916519204963828e-05,
"loss": 3.0275787353515624,
"step": 4100
},
{
"epoch": 0.17485463891463723,
"grad_norm": 0.7124244570732117,
"learning_rate": 4.9143767784912965e-05,
"loss": 3.058924560546875,
"step": 4150
},
{
"epoch": 0.17696132131119913,
"grad_norm": 0.7103128433227539,
"learning_rate": 4.9122076867049884e-05,
"loss": 3.0691461181640625,
"step": 4200
},
{
"epoch": 0.17906800370776102,
"grad_norm": 0.7060617208480835,
"learning_rate": 4.910011953561195e-05,
"loss": 3.0494329833984377,
"step": 4250
},
{
"epoch": 0.1811746861043229,
"grad_norm": 0.7271001935005188,
"learning_rate": 4.9077896033104455e-05,
"loss": 3.055644226074219,
"step": 4300
},
{
"epoch": 0.1832813685008848,
"grad_norm": 0.7033340334892273,
"learning_rate": 4.905540660497238e-05,
"loss": 3.050093994140625,
"step": 4350
},
{
"epoch": 0.1853880508974467,
"grad_norm": 0.7435086369514465,
"learning_rate": 4.903265149959768e-05,
"loss": 3.0552102661132814,
"step": 4400
},
{
"epoch": 0.1874947332940086,
"grad_norm": 0.7204045057296753,
"learning_rate": 4.9009630968296584e-05,
"loss": 3.0501980590820312,
"step": 4450
},
{
"epoch": 0.18960141569057049,
"grad_norm": 0.7094113230705261,
"learning_rate": 4.898634526531676e-05,
"loss": 3.055870361328125,
"step": 4500
},
{
"epoch": 0.19170809808713238,
"grad_norm": 0.6945235729217529,
"learning_rate": 4.896279464783455e-05,
"loss": 3.05148193359375,
"step": 4550
},
{
"epoch": 0.19381478048369427,
"grad_norm": 0.721178412437439,
"learning_rate": 4.893897937595211e-05,
"loss": 3.0516928100585936,
"step": 4600
},
{
"epoch": 0.19592146288025616,
"grad_norm": 0.7072880864143372,
"learning_rate": 4.891489971269453e-05,
"loss": 3.0531573486328125,
"step": 4650
},
{
"epoch": 0.19802814527681806,
"grad_norm": 0.6985597014427185,
"learning_rate": 4.889055592400697e-05,
"loss": 3.0319134521484377,
"step": 4700
},
{
"epoch": 0.20013482767337995,
"grad_norm": 0.6876893043518066,
"learning_rate": 4.886594827875167e-05,
"loss": 3.05040283203125,
"step": 4750
},
{
"epoch": 0.20224151006994184,
"grad_norm": 0.7180494666099548,
"learning_rate": 4.8841077048705004e-05,
"loss": 3.05064697265625,
"step": 4800
},
{
"epoch": 0.20434819246650374,
"grad_norm": 0.7060564160346985,
"learning_rate": 4.881594250855449e-05,
"loss": 3.060054931640625,
"step": 4850
},
{
"epoch": 0.20645487486306566,
"grad_norm": 0.7116970419883728,
"learning_rate": 4.879054493589574e-05,
"loss": 3.05646484375,
"step": 4900
},
{
"epoch": 0.20856155725962755,
"grad_norm": 0.7381977438926697,
"learning_rate": 4.8764884611229404e-05,
"loss": 3.0426617431640626,
"step": 4950
},
{
"epoch": 0.21066823965618944,
"grad_norm": 0.7227292656898499,
"learning_rate": 4.8738961817958056e-05,
"loss": 3.070029296875,
"step": 5000
},
{
"epoch": 0.21066823965618944,
"eval_loss": 2.959958791732788,
"eval_runtime": 124.7155,
"eval_samples_per_second": 123.024,
"eval_steps_per_second": 3.849,
"step": 5000
},
{
"epoch": 0.21277492205275134,
"grad_norm": 0.7169764637947083,
"learning_rate": 4.871277684238308e-05,
"loss": 3.06226318359375,
"step": 5050
},
{
"epoch": 0.21488160444931323,
"grad_norm": 0.7150042057037354,
"learning_rate": 4.868632997370151e-05,
"loss": 3.05496337890625,
"step": 5100
},
{
"epoch": 0.21698828684587512,
"grad_norm": 0.7077784538269043,
"learning_rate": 4.865962150400282e-05,
"loss": 3.0570599365234377,
"step": 5150
},
{
"epoch": 0.21909496924243702,
"grad_norm": 0.7164002656936646,
"learning_rate": 4.863265172826571e-05,
"loss": 3.0604672241210937,
"step": 5200
},
{
"epoch": 0.2212016516389989,
"grad_norm": 0.717158854007721,
"learning_rate": 4.860542094435485e-05,
"loss": 3.0436383056640626,
"step": 5250
},
{
"epoch": 0.2233083340355608,
"grad_norm": 0.7141779065132141,
"learning_rate": 4.857792945301758e-05,
"loss": 3.042879638671875,
"step": 5300
},
{
"epoch": 0.2254150164321227,
"grad_norm": 0.7105504870414734,
"learning_rate": 4.85501775578806e-05,
"loss": 3.040563049316406,
"step": 5350
},
{
"epoch": 0.2275216988286846,
"grad_norm": 0.7205433249473572,
"learning_rate": 4.852216556544659e-05,
"loss": 3.0424761962890625,
"step": 5400
},
{
"epoch": 0.22962838122524648,
"grad_norm": 0.7419236898422241,
"learning_rate": 4.849389378509088e-05,
"loss": 3.057305908203125,
"step": 5450
},
{
"epoch": 0.23173506362180837,
"grad_norm": 0.7136011123657227,
"learning_rate": 4.8465362529057966e-05,
"loss": 3.05100341796875,
"step": 5500
},
{
"epoch": 0.23384174601837027,
"grad_norm": 0.7066657543182373,
"learning_rate": 4.843657211245811e-05,
"loss": 3.0470831298828127,
"step": 5550
},
{
"epoch": 0.23594842841493216,
"grad_norm": 0.7254061698913574,
"learning_rate": 4.840752285326385e-05,
"loss": 3.0324981689453123,
"step": 5600
},
{
"epoch": 0.23805511081149405,
"grad_norm": 0.7086924314498901,
"learning_rate": 4.837821507230648e-05,
"loss": 3.0507342529296877,
"step": 5650
},
{
"epoch": 0.24016179320805595,
"grad_norm": 0.7063336968421936,
"learning_rate": 4.834864909327248e-05,
"loss": 3.030625,
"step": 5700
},
{
"epoch": 0.24226847560461784,
"grad_norm": 0.7155880928039551,
"learning_rate": 4.83188252427e-05,
"loss": 3.0367218017578126,
"step": 5750
},
{
"epoch": 0.24437515800117973,
"grad_norm": 0.7138485908508301,
"learning_rate": 4.8288743849975236e-05,
"loss": 3.023646240234375,
"step": 5800
},
{
"epoch": 0.24648184039774163,
"grad_norm": 0.7371372580528259,
"learning_rate": 4.8258405247328734e-05,
"loss": 3.0523486328125,
"step": 5850
},
{
"epoch": 0.24858852279430352,
"grad_norm": 0.7491302490234375,
"learning_rate": 4.82278097698318e-05,
"loss": 3.0256768798828126,
"step": 5900
},
{
"epoch": 0.2506952051908654,
"grad_norm": 0.7265546321868896,
"learning_rate": 4.819695775539276e-05,
"loss": 3.039449462890625,
"step": 5950
},
{
"epoch": 0.25280188758742733,
"grad_norm": 0.7091307044029236,
"learning_rate": 4.816584954475323e-05,
"loss": 3.03005615234375,
"step": 6000
},
{
"epoch": 0.25280188758742733,
"eval_loss": 2.9590306282043457,
"eval_runtime": 124.9212,
"eval_samples_per_second": 122.821,
"eval_steps_per_second": 3.842,
"step": 6000
},
{
"epoch": 0.2549085699839892,
"grad_norm": 0.7203435897827148,
"learning_rate": 4.813448548148435e-05,
"loss": 3.0497561645507814,
"step": 6050
},
{
"epoch": 0.2570152523805511,
"grad_norm": 0.712683916091919,
"learning_rate": 4.8102865911983e-05,
"loss": 3.0374334716796874,
"step": 6100
},
{
"epoch": 0.259121934777113,
"grad_norm": 0.737154483795166,
"learning_rate": 4.8071631178264684e-05,
"loss": 3.0338262939453124,
"step": 6150
},
{
"epoch": 0.2612286171736749,
"grad_norm": 0.7363243103027344,
"learning_rate": 4.8039506739404214e-05,
"loss": 3.038179931640625,
"step": 6200
},
{
"epoch": 0.26333529957023677,
"grad_norm": 0.7131369709968567,
"learning_rate": 4.800712784329335e-05,
"loss": 3.04284912109375,
"step": 6250
},
{
"epoch": 0.2654419819667987,
"grad_norm": 0.7210983633995056,
"learning_rate": 4.7974494847537186e-05,
"loss": 3.037200622558594,
"step": 6300
},
{
"epoch": 0.26754866436336056,
"grad_norm": 0.7105332016944885,
"learning_rate": 4.7941608112547176e-05,
"loss": 3.050509338378906,
"step": 6350
},
{
"epoch": 0.2696553467599225,
"grad_norm": 0.7372371554374695,
"learning_rate": 4.79084680015372e-05,
"loss": 3.0444134521484374,
"step": 6400
},
{
"epoch": 0.27176202915648434,
"grad_norm": 0.7344969511032104,
"learning_rate": 4.787507488051949e-05,
"loss": 3.0304275512695313,
"step": 6450
},
{
"epoch": 0.27386871155304626,
"grad_norm": 0.728776216506958,
"learning_rate": 4.7841429118300625e-05,
"loss": 3.042907409667969,
"step": 6500
},
{
"epoch": 0.2759753939496082,
"grad_norm": 0.7331499457359314,
"learning_rate": 4.780753108647746e-05,
"loss": 3.0423983764648437,
"step": 6550
},
{
"epoch": 0.27808207634617005,
"grad_norm": 0.7019347548484802,
"learning_rate": 4.777338115943301e-05,
"loss": 3.0304049682617187,
"step": 6600
},
{
"epoch": 0.28018875874273197,
"grad_norm": 0.7327196598052979,
"learning_rate": 4.773897971433231e-05,
"loss": 3.037353210449219,
"step": 6650
},
{
"epoch": 0.28229544113929383,
"grad_norm": 0.724443793296814,
"learning_rate": 4.770432713111828e-05,
"loss": 3.027728271484375,
"step": 6700
},
{
"epoch": 0.28440212353585576,
"grad_norm": 0.7023022174835205,
"learning_rate": 4.7669423792507476e-05,
"loss": 3.039205322265625,
"step": 6750
},
{
"epoch": 0.2865088059324176,
"grad_norm": 0.6965822577476501,
"learning_rate": 4.763427008398592e-05,
"loss": 3.04097900390625,
"step": 6800
},
{
"epoch": 0.28861548832897954,
"grad_norm": 0.710150420665741,
"learning_rate": 4.7598866393804804e-05,
"loss": 3.060494384765625,
"step": 6850
},
{
"epoch": 0.2907221707255414,
"grad_norm": 0.7383567690849304,
"learning_rate": 4.756321311297621e-05,
"loss": 3.0389471435546875,
"step": 6900
},
{
"epoch": 0.2928288531221033,
"grad_norm": 0.7048441767692566,
"learning_rate": 4.752731063526882e-05,
"loss": 3.03699951171875,
"step": 6950
},
{
"epoch": 0.2949355355186652,
"grad_norm": 0.7232741713523865,
"learning_rate": 4.7491159357203516e-05,
"loss": 3.0090789794921875,
"step": 7000
},
{
"epoch": 0.2949355355186652,
"eval_loss": 2.95876407623291,
"eval_runtime": 125.3781,
"eval_samples_per_second": 122.374,
"eval_steps_per_second": 3.828,
"step": 7000
},
{
"epoch": 0.2970422179152271,
"grad_norm": 0.7183651924133301,
"learning_rate": 4.7454759678049034e-05,
"loss": 3.0392718505859375,
"step": 7050
},
{
"epoch": 0.299148900311789,
"grad_norm": 0.7372629046440125,
"learning_rate": 4.741811199981755e-05,
"loss": 3.032550048828125,
"step": 7100
},
{
"epoch": 0.3012555827083509,
"grad_norm": 0.7527030110359192,
"learning_rate": 4.738121672726025e-05,
"loss": 3.0378472900390623,
"step": 7150
},
{
"epoch": 0.30336226510491276,
"grad_norm": 0.7273029685020447,
"learning_rate": 4.734407426786282e-05,
"loss": 3.0402880859375,
"step": 7200
},
{
"epoch": 0.3054689475014747,
"grad_norm": 0.7418842911720276,
"learning_rate": 4.730668503184102e-05,
"loss": 3.05841064453125,
"step": 7250
},
{
"epoch": 0.30757562989803655,
"grad_norm": 0.7132033109664917,
"learning_rate": 4.7269049432136035e-05,
"loss": 3.039431457519531,
"step": 7300
},
{
"epoch": 0.30968231229459847,
"grad_norm": 0.7326894998550415,
"learning_rate": 4.723116788441007e-05,
"loss": 3.051656494140625,
"step": 7350
},
{
"epoch": 0.31178899469116034,
"grad_norm": 0.732483983039856,
"learning_rate": 4.719304080704161e-05,
"loss": 3.0274822998046873,
"step": 7400
},
{
"epoch": 0.31389567708772226,
"grad_norm": 0.7055999040603638,
"learning_rate": 4.71546686211209e-05,
"loss": 3.014556884765625,
"step": 7450
},
{
"epoch": 0.3160023594842841,
"grad_norm": 0.7180454730987549,
"learning_rate": 4.7116051750445245e-05,
"loss": 3.0318145751953125,
"step": 7500
},
{
"epoch": 0.31810904188084604,
"grad_norm": 0.7178027629852295,
"learning_rate": 4.707719062151434e-05,
"loss": 3.0280184936523438,
"step": 7550
},
{
"epoch": 0.32021572427740796,
"grad_norm": 0.6923954486846924,
"learning_rate": 4.703808566352557e-05,
"loss": 3.014013671875,
"step": 7600
},
{
"epoch": 0.32232240667396983,
"grad_norm": 0.7218888401985168,
"learning_rate": 4.699873730836926e-05,
"loss": 3.0315927124023436,
"step": 7650
},
{
"epoch": 0.32442908907053175,
"grad_norm": 0.7266069650650024,
"learning_rate": 4.695914599062392e-05,
"loss": 3.038184814453125,
"step": 7700
},
{
"epoch": 0.3265357714670936,
"grad_norm": 0.71517413854599,
"learning_rate": 4.691931214755141e-05,
"loss": 3.019275817871094,
"step": 7750
},
{
"epoch": 0.32864245386365554,
"grad_norm": 0.7297743558883667,
"learning_rate": 4.687923621909216e-05,
"loss": 3.0307427978515626,
"step": 7800
},
{
"epoch": 0.3307491362602174,
"grad_norm": 0.7044832706451416,
"learning_rate": 4.683891864786025e-05,
"loss": 3.0128753662109373,
"step": 7850
},
{
"epoch": 0.3328558186567793,
"grad_norm": 0.7655161023139954,
"learning_rate": 4.6798359879138596e-05,
"loss": 3.0257077026367187,
"step": 7900
},
{
"epoch": 0.3349625010533412,
"grad_norm": 0.7163241505622864,
"learning_rate": 4.675756036087397e-05,
"loss": 3.0375396728515627,
"step": 7950
},
{
"epoch": 0.3370691834499031,
"grad_norm": 0.7311005592346191,
"learning_rate": 4.671652054367207e-05,
"loss": 3.040563049316406,
"step": 8000
},
{
"epoch": 0.3370691834499031,
"eval_loss": 2.9559757709503174,
"eval_runtime": 125.7203,
"eval_samples_per_second": 122.041,
"eval_steps_per_second": 3.818,
"step": 8000
},
{
"epoch": 0.339175865846465,
"grad_norm": 0.7203993201255798,
"learning_rate": 4.667524088079257e-05,
"loss": 3.04523193359375,
"step": 8050
},
{
"epoch": 0.3412825482430269,
"grad_norm": 0.7433794736862183,
"learning_rate": 4.663372182814407e-05,
"loss": 3.0348739624023438,
"step": 8100
},
{
"epoch": 0.34338923063958876,
"grad_norm": 0.7451913952827454,
"learning_rate": 4.659196384427911e-05,
"loss": 3.03673583984375,
"step": 8150
},
{
"epoch": 0.3454959130361507,
"grad_norm": 0.7146168351173401,
"learning_rate": 4.6550809653477414e-05,
"loss": 3.04627685546875,
"step": 8200
},
{
"epoch": 0.34760259543271255,
"grad_norm": 0.7409563660621643,
"learning_rate": 4.650857994894889e-05,
"loss": 3.04489501953125,
"step": 8250
},
{
"epoch": 0.34970927782927447,
"grad_norm": 0.7260156273841858,
"learning_rate": 4.646611269531936e-05,
"loss": 3.0275424194335936,
"step": 8300
},
{
"epoch": 0.35181596022583633,
"grad_norm": 0.7213459610939026,
"learning_rate": 4.642340836161364e-05,
"loss": 3.02736572265625,
"step": 8350
},
{
"epoch": 0.35392264262239825,
"grad_norm": 0.7113795876502991,
"learning_rate": 4.638046741947497e-05,
"loss": 3.0393060302734374,
"step": 8400
},
{
"epoch": 0.3560293250189601,
"grad_norm": 0.7787646651268005,
"learning_rate": 4.6337290343159766e-05,
"loss": 3.027384033203125,
"step": 8450
},
{
"epoch": 0.35813600741552204,
"grad_norm": 0.7401567697525024,
"learning_rate": 4.629387760953241e-05,
"loss": 3.0250250244140626,
"step": 8500
},
{
"epoch": 0.3602426898120839,
"grad_norm": 0.7389817833900452,
"learning_rate": 4.6250229698059976e-05,
"loss": 3.03439697265625,
"step": 8550
},
{
"epoch": 0.3623493722086458,
"grad_norm": 0.7421659231185913,
"learning_rate": 4.620634709080692e-05,
"loss": 3.0239453125,
"step": 8600
},
{
"epoch": 0.36445605460520775,
"grad_norm": 0.7072033882141113,
"learning_rate": 4.616223027242981e-05,
"loss": 3.0333843994140626,
"step": 8650
},
{
"epoch": 0.3665627370017696,
"grad_norm": 0.7407162189483643,
"learning_rate": 4.611787973017187e-05,
"loss": 3.035455627441406,
"step": 8700
},
{
"epoch": 0.36866941939833153,
"grad_norm": 0.7319179773330688,
"learning_rate": 4.60732959538577e-05,
"loss": 3.02468994140625,
"step": 8750
},
{
"epoch": 0.3707761017948934,
"grad_norm": 0.7243380546569824,
"learning_rate": 4.602847943588784e-05,
"loss": 3.0051629638671873,
"step": 8800
},
{
"epoch": 0.3728827841914553,
"grad_norm": 0.7503135204315186,
"learning_rate": 4.598343067123328e-05,
"loss": 3.004599609375,
"step": 8850
},
{
"epoch": 0.3749894665880172,
"grad_norm": 0.7377141714096069,
"learning_rate": 4.593815015743007e-05,
"loss": 3.027547607421875,
"step": 8900
},
{
"epoch": 0.3770961489845791,
"grad_norm": 0.6959289312362671,
"learning_rate": 4.589263839457375e-05,
"loss": 3.012759094238281,
"step": 8950
},
{
"epoch": 0.37920283138114097,
"grad_norm": 0.7330695390701294,
"learning_rate": 4.584689588531391e-05,
"loss": 3.01300537109375,
"step": 9000
},
{
"epoch": 0.37920283138114097,
"eval_loss": 2.9561047554016113,
"eval_runtime": 125.3383,
"eval_samples_per_second": 122.413,
"eval_steps_per_second": 3.83,
"step": 9000
},
{
"epoch": 0.3813095137777029,
"grad_norm": 0.7340759634971619,
"learning_rate": 4.580092313484855e-05,
"loss": 3.0100698852539063,
"step": 9050
},
{
"epoch": 0.38341619617426476,
"grad_norm": 0.7195578813552856,
"learning_rate": 4.575472065091857e-05,
"loss": 3.002470703125,
"step": 9100
},
{
"epoch": 0.3855228785708267,
"grad_norm": 0.7334921956062317,
"learning_rate": 4.5708288943802116e-05,
"loss": 3.029892578125,
"step": 9150
},
{
"epoch": 0.38762956096738854,
"grad_norm": 0.748664915561676,
"learning_rate": 4.5661628526308984e-05,
"loss": 3.032738037109375,
"step": 9200
},
{
"epoch": 0.38973624336395046,
"grad_norm": 0.7079982757568359,
"learning_rate": 4.561473991377492e-05,
"loss": 3.023472900390625,
"step": 9250
},
{
"epoch": 0.39184292576051233,
"grad_norm": 0.7562114596366882,
"learning_rate": 4.556762362405595e-05,
"loss": 3.0230252075195314,
"step": 9300
},
{
"epoch": 0.39394960815707425,
"grad_norm": 0.7204853892326355,
"learning_rate": 4.5520280177522667e-05,
"loss": 3.030900573730469,
"step": 9350
},
{
"epoch": 0.3960562905536361,
"grad_norm": 0.7344993948936462,
"learning_rate": 4.547271009705445e-05,
"loss": 3.015901794433594,
"step": 9400
},
{
"epoch": 0.39816297295019804,
"grad_norm": 0.7169850468635559,
"learning_rate": 4.542491390803373e-05,
"loss": 3.005645751953125,
"step": 9450
},
{
"epoch": 0.4002696553467599,
"grad_norm": 0.7306743264198303,
"learning_rate": 4.537689213834015e-05,
"loss": 3.0204693603515627,
"step": 9500
},
{
"epoch": 0.4023763377433218,
"grad_norm": 0.7161615490913391,
"learning_rate": 4.532864531834478e-05,
"loss": 3.0287905883789064,
"step": 9550
},
{
"epoch": 0.4044830201398837,
"grad_norm": 0.7508752942085266,
"learning_rate": 4.5280173980904194e-05,
"loss": 3.0213604736328126,
"step": 9600
},
{
"epoch": 0.4065897025364456,
"grad_norm": 0.7092886567115784,
"learning_rate": 4.523147866135467e-05,
"loss": 3.0126605224609375,
"step": 9650
},
{
"epoch": 0.4086963849330075,
"grad_norm": 0.7355290651321411,
"learning_rate": 4.518255989750619e-05,
"loss": 3.04287109375,
"step": 9700
},
{
"epoch": 0.4108030673295694,
"grad_norm": 0.749024510383606,
"learning_rate": 4.513341822963657e-05,
"loss": 3.0261370849609377,
"step": 9750
},
{
"epoch": 0.4129097497261313,
"grad_norm": 0.7423744201660156,
"learning_rate": 4.5084054200485446e-05,
"loss": 3.0240179443359376,
"step": 9800
},
{
"epoch": 0.4150164321226932,
"grad_norm": 0.7616035342216492,
"learning_rate": 4.503446835524832e-05,
"loss": 3.005235595703125,
"step": 9850
},
{
"epoch": 0.4171231145192551,
"grad_norm": 0.7451797127723694,
"learning_rate": 4.498466124157049e-05,
"loss": 3.0096875,
"step": 9900
},
{
"epoch": 0.41922979691581697,
"grad_norm": 0.701125979423523,
"learning_rate": 4.493463340954105e-05,
"loss": 3.0305224609375,
"step": 9950
},
{
"epoch": 0.4213364793123789,
"grad_norm": 0.768416166305542,
"learning_rate": 4.488438541168678e-05,
"loss": 3.00571044921875,
"step": 10000
},
{
"epoch": 0.4213364793123789,
"eval_loss": 2.9549593925476074,
"eval_runtime": 118.9296,
"eval_samples_per_second": 129.009,
"eval_steps_per_second": 4.036,
"step": 10000
},
{
"epoch": 0.42344316170894075,
"grad_norm": 0.7294694185256958,
"learning_rate": 4.4833917802966056e-05,
"loss": 3.018519287109375,
"step": 10050
},
{
"epoch": 0.4255498441055027,
"grad_norm": 0.7414897084236145,
"learning_rate": 4.478323114076274e-05,
"loss": 3.031895751953125,
"step": 10100
},
{
"epoch": 0.42765652650206454,
"grad_norm": 0.7361171245574951,
"learning_rate": 4.4732325984879984e-05,
"loss": 3.0415203857421873,
"step": 10150
},
{
"epoch": 0.42976320889862646,
"grad_norm": 0.7098096609115601,
"learning_rate": 4.468120289753409e-05,
"loss": 2.997996826171875,
"step": 10200
},
{
"epoch": 0.4318698912951883,
"grad_norm": Infinity,
"learning_rate": 4.4629862443348246e-05,
"loss": 3.0266912841796874,
"step": 10250
},
{
"epoch": 0.43397657369175024,
"grad_norm": 0.7545154690742493,
"learning_rate": 4.457933845538554e-05,
"loss": 3.024451904296875,
"step": 10300
},
{
"epoch": 0.4360832560883121,
"grad_norm": 0.7749207615852356,
"learning_rate": 4.452756928999812e-05,
"loss": 3.0368328857421876,
"step": 10350
},
{
"epoch": 0.43818993848487403,
"grad_norm": 0.7240240573883057,
"learning_rate": 4.447558445455993e-05,
"loss": 3.0295269775390623,
"step": 10400
},
{
"epoch": 0.4402966208814359,
"grad_norm": 0.733327329158783,
"learning_rate": 4.4423384523211644e-05,
"loss": 3.02707275390625,
"step": 10450
},
{
"epoch": 0.4424033032779978,
"grad_norm": 0.7605792284011841,
"learning_rate": 4.4370970072469575e-05,
"loss": 3.0108306884765623,
"step": 10500
},
{
"epoch": 0.4445099856745597,
"grad_norm": 0.7699744701385498,
"learning_rate": 4.431834168121923e-05,
"loss": 3.0396319580078126,
"step": 10550
},
{
"epoch": 0.4466166680711216,
"grad_norm": 0.7354220747947693,
"learning_rate": 4.426549993070899e-05,
"loss": 3.0158978271484376,
"step": 10600
},
{
"epoch": 0.44872335046768347,
"grad_norm": 0.7274487614631653,
"learning_rate": 4.4212445404543654e-05,
"loss": 3.0322219848632814,
"step": 10650
},
{
"epoch": 0.4508300328642454,
"grad_norm": 0.7341009974479675,
"learning_rate": 4.415917868867797e-05,
"loss": 3.003311767578125,
"step": 10700
},
{
"epoch": 0.45293671526080725,
"grad_norm": 0.7555328607559204,
"learning_rate": 4.410570037141023e-05,
"loss": 3.030812072753906,
"step": 10750
},
{
"epoch": 0.4550433976573692,
"grad_norm": 0.7357707619667053,
"learning_rate": 4.405201104337572e-05,
"loss": 3.0104705810546877,
"step": 10800
},
{
"epoch": 0.4571500800539311,
"grad_norm": 0.7414904236793518,
"learning_rate": 4.399811129754018e-05,
"loss": 3.0151333618164062,
"step": 10850
},
{
"epoch": 0.45925676245049296,
"grad_norm": 0.7394636273384094,
"learning_rate": 4.3944001729193345e-05,
"loss": 3.003218688964844,
"step": 10900
},
{
"epoch": 0.4613634448470549,
"grad_norm": 0.7744182348251343,
"learning_rate": 4.388968293594226e-05,
"loss": 3.0157513427734375,
"step": 10950
},
{
"epoch": 0.46347012724361675,
"grad_norm": 0.7719476819038391,
"learning_rate": 4.3835155517704755e-05,
"loss": 3.027322082519531,
"step": 11000
},
{
"epoch": 0.46347012724361675,
"eval_loss": 2.951545000076294,
"eval_runtime": 118.9579,
"eval_samples_per_second": 128.978,
"eval_steps_per_second": 4.035,
"step": 11000
},
{
"epoch": 0.46557680964017867,
"grad_norm": 0.7172340154647827,
"learning_rate": 4.378042007670279e-05,
"loss": 3.0138421630859376,
"step": 11050
},
{
"epoch": 0.46768349203674053,
"grad_norm": 0.7303726673126221,
"learning_rate": 4.372547721745582e-05,
"loss": 3.001175537109375,
"step": 11100
},
{
"epoch": 0.46979017443330245,
"grad_norm": 0.7603186964988708,
"learning_rate": 4.3670327546774074e-05,
"loss": 3.0162783813476564,
"step": 11150
},
{
"epoch": 0.4718968568298643,
"grad_norm": 0.7521427869796753,
"learning_rate": 4.361497167375193e-05,
"loss": 2.99423095703125,
"step": 11200
},
{
"epoch": 0.47400353922642624,
"grad_norm": 0.7517786622047424,
"learning_rate": 4.355941020976111e-05,
"loss": 3.019745178222656,
"step": 11250
},
{
"epoch": 0.4761102216229881,
"grad_norm": 0.7296441197395325,
"learning_rate": 4.3503643768443996e-05,
"loss": 3.001739196777344,
"step": 11300
},
{
"epoch": 0.47821690401955,
"grad_norm": 0.7638827562332153,
"learning_rate": 4.344767296570678e-05,
"loss": 3.013392028808594,
"step": 11350
},
{
"epoch": 0.4803235864161119,
"grad_norm": 0.7276263236999512,
"learning_rate": 4.339149841971274e-05,
"loss": 3.0166070556640623,
"step": 11400
},
{
"epoch": 0.4824302688126738,
"grad_norm": 0.7221875786781311,
"learning_rate": 4.333512075087533e-05,
"loss": 2.996725769042969,
"step": 11450
},
{
"epoch": 0.4845369512092357,
"grad_norm": 0.7310070395469666,
"learning_rate": 4.327854058185141e-05,
"loss": 3.000296325683594,
"step": 11500
},
{
"epoch": 0.4866436336057976,
"grad_norm": 0.7462596893310547,
"learning_rate": 4.3221758537534324e-05,
"loss": 3.02200439453125,
"step": 11550
},
{
"epoch": 0.48875031600235946,
"grad_norm": 0.759739100933075,
"learning_rate": 4.3164775245046986e-05,
"loss": 3.010010986328125,
"step": 11600
},
{
"epoch": 0.4908569983989214,
"grad_norm": 0.7589168548583984,
"learning_rate": 4.310759133373499e-05,
"loss": 3.007271728515625,
"step": 11650
},
{
"epoch": 0.49296368079548325,
"grad_norm": 0.7378042340278625,
"learning_rate": 4.305020743515963e-05,
"loss": 3.025714111328125,
"step": 11700
},
{
"epoch": 0.49507036319204517,
"grad_norm": 0.741910457611084,
"learning_rate": 4.299262418309095e-05,
"loss": 3.006583251953125,
"step": 11750
},
{
"epoch": 0.49717704558860704,
"grad_norm": 0.7760137915611267,
"learning_rate": 4.293484221350072e-05,
"loss": 3.01525634765625,
"step": 11800
},
{
"epoch": 0.49928372798516896,
"grad_norm": 0.7366864085197449,
"learning_rate": 4.2876862164555434e-05,
"loss": 3.025040283203125,
"step": 11850
},
{
"epoch": 0.5013904103817308,
"grad_norm": 0.7541459798812866,
"learning_rate": 4.2818684676609234e-05,
"loss": 3.004857177734375,
"step": 11900
},
{
"epoch": 0.5034970927782928,
"grad_norm": 0.751621663570404,
"learning_rate": 4.276031039219688e-05,
"loss": 3.0031988525390627,
"step": 11950
},
{
"epoch": 0.5056037751748547,
"grad_norm": 0.7406221628189087,
"learning_rate": 4.270173995602661e-05,
"loss": 3.0164361572265626,
"step": 12000
},
{
"epoch": 0.5056037751748547,
"eval_loss": 2.950573205947876,
"eval_runtime": 118.9842,
"eval_samples_per_second": 128.95,
"eval_steps_per_second": 4.034,
"step": 12000
},
{
"epoch": 0.5077104575714165,
"grad_norm": 0.7495478391647339,
"learning_rate": 4.2642974014973036e-05,
"loss": 3.002237548828125,
"step": 12050
},
{
"epoch": 0.5098171399679784,
"grad_norm": 0.7460280060768127,
"learning_rate": 4.258401321807002e-05,
"loss": 3.0048617553710937,
"step": 12100
},
{
"epoch": 0.5119238223645404,
"grad_norm": 0.7655878663063049,
"learning_rate": 4.252485821650347e-05,
"loss": 3.003458251953125,
"step": 12150
},
{
"epoch": 0.5140305047611022,
"grad_norm": 0.757357656955719,
"learning_rate": 4.2465509663604174e-05,
"loss": 3.004598388671875,
"step": 12200
},
{
"epoch": 0.5161371871576641,
"grad_norm": 0.7318490743637085,
"learning_rate": 4.2405968214840575e-05,
"loss": 3.0216680908203126,
"step": 12250
},
{
"epoch": 0.518243869554226,
"grad_norm": 0.7530907392501831,
"learning_rate": 4.2346234527811516e-05,
"loss": 3.007520751953125,
"step": 12300
},
{
"epoch": 0.5203505519507879,
"grad_norm": 0.7272404432296753,
"learning_rate": 4.228750964074293e-05,
"loss": 3.0171267700195314,
"step": 12350
},
{
"epoch": 0.5224572343473498,
"grad_norm": 0.7328222393989563,
"learning_rate": 4.222739727029933e-05,
"loss": 3.0320773315429688,
"step": 12400
},
{
"epoch": 0.5245639167439117,
"grad_norm": 0.7220742702484131,
"learning_rate": 4.216709463379709e-05,
"loss": 3.0238848876953126,
"step": 12450
},
{
"epoch": 0.5266705991404735,
"grad_norm": 0.7630252242088318,
"learning_rate": 4.210660239724189e-05,
"loss": 2.9925677490234377,
"step": 12500
},
{
"epoch": 0.5287772815370355,
"grad_norm": 0.7353333830833435,
"learning_rate": 4.204592122873347e-05,
"loss": 3.0201007080078126,
"step": 12550
},
{
"epoch": 0.5308839639335974,
"grad_norm": 0.7585554122924805,
"learning_rate": 4.1985051798458194e-05,
"loss": 3.0046511840820314,
"step": 12600
},
{
"epoch": 0.5329906463301592,
"grad_norm": 0.7346253991127014,
"learning_rate": 4.1923994778681675e-05,
"loss": 3.0252825927734377,
"step": 12650
},
{
"epoch": 0.5350973287267211,
"grad_norm": 0.7465812563896179,
"learning_rate": 4.186275084374131e-05,
"loss": 2.9988339233398436,
"step": 12700
},
{
"epoch": 0.5372040111232831,
"grad_norm": 0.7695534229278564,
"learning_rate": 4.180132067003887e-05,
"loss": 3.013394775390625,
"step": 12750
},
{
"epoch": 0.539310693519845,
"grad_norm": 0.756037712097168,
"learning_rate": 4.1739704936033044e-05,
"loss": 3.00047119140625,
"step": 12800
},
{
"epoch": 0.5414173759164068,
"grad_norm": 0.7378901243209839,
"learning_rate": 4.1677904322231886e-05,
"loss": 2.9985260009765624,
"step": 12850
},
{
"epoch": 0.5435240583129687,
"grad_norm": 0.7396430969238281,
"learning_rate": 4.161591951118536e-05,
"loss": 3.01582275390625,
"step": 12900
},
{
"epoch": 0.5456307407095307,
"grad_norm": 0.7484205365180969,
"learning_rate": 4.1553751187477774e-05,
"loss": 3.00086669921875,
"step": 12950
},
{
"epoch": 0.5477374231060925,
"grad_norm": 0.7418805956840515,
"learning_rate": 4.1491400037720194e-05,
"loss": 2.985556640625,
"step": 13000
},
{
"epoch": 0.5477374231060925,
"eval_loss": 2.9498443603515625,
"eval_runtime": 118.9076,
"eval_samples_per_second": 129.033,
"eval_steps_per_second": 4.037,
"step": 13000
},
{
"epoch": 0.5498441055026544,
"grad_norm": 0.7477849721908569,
"learning_rate": 4.142886675054291e-05,
"loss": 3.006175537109375,
"step": 13050
},
{
"epoch": 0.5519507878992164,
"grad_norm": 0.7623112201690674,
"learning_rate": 4.136615201658781e-05,
"loss": 3.0172186279296875,
"step": 13100
},
{
"epoch": 0.5540574702957782,
"grad_norm": 0.7711979746818542,
"learning_rate": 4.130325652850075e-05,
"loss": 2.9972796630859375,
"step": 13150
},
{
"epoch": 0.5561641526923401,
"grad_norm": 0.7240932583808899,
"learning_rate": 4.124018098092388e-05,
"loss": 2.9975146484375,
"step": 13200
},
{
"epoch": 0.558270835088902,
"grad_norm": 0.7590881586074829,
"learning_rate": 4.117692607048804e-05,
"loss": 3.007953796386719,
"step": 13250
},
{
"epoch": 0.5603775174854639,
"grad_norm": 0.7551672458648682,
"learning_rate": 4.1113492495804986e-05,
"loss": 3.0047311401367187,
"step": 13300
},
{
"epoch": 0.5624841998820258,
"grad_norm": 0.7241302132606506,
"learning_rate": 4.104988095745974e-05,
"loss": 2.968081359863281,
"step": 13350
},
{
"epoch": 0.5645908822785877,
"grad_norm": 0.7135413289070129,
"learning_rate": 4.0986092158002784e-05,
"loss": 3.018740234375,
"step": 13400
},
{
"epoch": 0.5666975646751495,
"grad_norm": 0.7576137781143188,
"learning_rate": 4.092212680194239e-05,
"loss": 2.992593994140625,
"step": 13450
},
{
"epoch": 0.5688042470717115,
"grad_norm": 0.727250337600708,
"learning_rate": 4.085798559573676e-05,
"loss": 3.0134197998046877,
"step": 13500
},
{
"epoch": 0.5709109294682734,
"grad_norm": 0.7550929188728333,
"learning_rate": 4.0793669247786245e-05,
"loss": 2.98953857421875,
"step": 13550
},
{
"epoch": 0.5730176118648352,
"grad_norm": 0.7384030818939209,
"learning_rate": 4.072917846842556e-05,
"loss": 3.01269287109375,
"step": 13600
},
{
"epoch": 0.5751242942613971,
"grad_norm": 0.7186519503593445,
"learning_rate": 4.066451396991588e-05,
"loss": 3.01514404296875,
"step": 13650
},
{
"epoch": 0.5772309766579591,
"grad_norm": 0.7442272901535034,
"learning_rate": 4.059967646643701e-05,
"loss": 2.9887322998046875,
"step": 13700
},
{
"epoch": 0.579337659054521,
"grad_norm": 0.7435423731803894,
"learning_rate": 4.05346666740795e-05,
"loss": 3.0130267333984375,
"step": 13750
},
{
"epoch": 0.5814443414510828,
"grad_norm": 0.7321817874908447,
"learning_rate": 4.046948531083672e-05,
"loss": 2.9902178955078127,
"step": 13800
},
{
"epoch": 0.5835510238476447,
"grad_norm": 0.7547968029975891,
"learning_rate": 4.0404133096596917e-05,
"loss": 3.0112127685546874,
"step": 13850
},
{
"epoch": 0.5856577062442067,
"grad_norm": 0.7581467032432556,
"learning_rate": 4.033861075313531e-05,
"loss": 2.987550048828125,
"step": 13900
},
{
"epoch": 0.5877643886407685,
"grad_norm": 0.7501505613327026,
"learning_rate": 4.027291900410607e-05,
"loss": 2.976295166015625,
"step": 13950
},
{
"epoch": 0.5898710710373304,
"grad_norm": 0.7598941326141357,
"learning_rate": 4.0207058575034366e-05,
"loss": 2.9963720703125,
"step": 14000
},
{
"epoch": 0.5898710710373304,
"eval_loss": 2.9478862285614014,
"eval_runtime": 119.1263,
"eval_samples_per_second": 128.796,
"eval_steps_per_second": 4.029,
"step": 14000
},
{
"epoch": 0.5919777534338923,
"grad_norm": 0.7242246270179749,
"learning_rate": 4.0141030193308324e-05,
"loss": 3.017314453125,
"step": 14050
},
{
"epoch": 0.5940844358304542,
"grad_norm": 0.7500660419464111,
"learning_rate": 4.007483458817101e-05,
"loss": 3.000011291503906,
"step": 14100
},
{
"epoch": 0.5961911182270161,
"grad_norm": 0.750382661819458,
"learning_rate": 4.0008472490712355e-05,
"loss": 3.004837646484375,
"step": 14150
},
{
"epoch": 0.598297800623578,
"grad_norm": 0.7483128309249878,
"learning_rate": 3.9941944633861126e-05,
"loss": 3.0029196166992187,
"step": 14200
},
{
"epoch": 0.6004044830201399,
"grad_norm": 0.7319640517234802,
"learning_rate": 3.9875251752376765e-05,
"loss": 2.9899969482421875,
"step": 14250
},
{
"epoch": 0.6025111654167018,
"grad_norm": 0.7555121779441833,
"learning_rate": 3.9808394582841345e-05,
"loss": 2.984419860839844,
"step": 14300
},
{
"epoch": 0.6046178478132637,
"grad_norm": 0.7269479036331177,
"learning_rate": 3.9741373863651366e-05,
"loss": 2.9930014038085937,
"step": 14350
},
{
"epoch": 0.6067245302098255,
"grad_norm": 0.7246697545051575,
"learning_rate": 3.967419033500966e-05,
"loss": 3.01332763671875,
"step": 14400
},
{
"epoch": 0.6088312126063875,
"grad_norm": 0.7506778240203857,
"learning_rate": 3.960684473891719e-05,
"loss": 3.005030517578125,
"step": 14450
},
{
"epoch": 0.6109378950029494,
"grad_norm": 0.7472758293151855,
"learning_rate": 3.954068953371231e-05,
"loss": 2.998134765625,
"step": 14500
},
{
"epoch": 0.6130445773995112,
"grad_norm": 0.7576263546943665,
"learning_rate": 3.9473025240116325e-05,
"loss": 2.966005859375,
"step": 14550
},
{
"epoch": 0.6151512597960731,
"grad_norm": 0.73203045129776,
"learning_rate": 3.9405201100814915e-05,
"loss": 2.988453369140625,
"step": 14600
},
{
"epoch": 0.6172579421926351,
"grad_norm": 0.7592427730560303,
"learning_rate": 3.933721786488418e-05,
"loss": 3.00134765625,
"step": 14650
},
{
"epoch": 0.6193646245891969,
"grad_norm": 0.7523754239082336,
"learning_rate": 3.9269076283157355e-05,
"loss": 2.987010498046875,
"step": 14700
},
{
"epoch": 0.6214713069857588,
"grad_norm": 0.7665632367134094,
"learning_rate": 3.9200777108216505e-05,
"loss": 2.9885418701171873,
"step": 14750
},
{
"epoch": 0.6235779893823207,
"grad_norm": 0.7370322942733765,
"learning_rate": 3.913232109438422e-05,
"loss": 2.9893780517578126,
"step": 14800
},
{
"epoch": 0.6256846717788827,
"grad_norm": 0.7885867953300476,
"learning_rate": 3.906370899771526e-05,
"loss": 2.986861572265625,
"step": 14850
},
{
"epoch": 0.6277913541754445,
"grad_norm": 0.7267576456069946,
"learning_rate": 3.8996318441698775e-05,
"loss": 2.979769287109375,
"step": 14900
},
{
"epoch": 0.6298980365720064,
"grad_norm": 0.7535339593887329,
"learning_rate": 3.8927399538264976e-05,
"loss": 3.0014642333984374,
"step": 14950
},
{
"epoch": 0.6320047189685682,
"grad_norm": 0.7546215057373047,
"learning_rate": 3.885832681522767e-05,
"loss": 3.002267150878906,
"step": 15000
},
{
"epoch": 0.6320047189685682,
"eval_loss": 2.947200059890747,
"eval_runtime": 119.0412,
"eval_samples_per_second": 128.888,
"eval_steps_per_second": 4.032,
"step": 15000
},
{
"epoch": 0.6341114013651302,
"grad_norm": 0.7570881843566895,
"learning_rate": 3.878910103545281e-05,
"loss": 2.9890081787109377,
"step": 15050
},
{
"epoch": 0.6362180837616921,
"grad_norm": 0.7803136706352234,
"learning_rate": 3.871972296349676e-05,
"loss": 2.991712646484375,
"step": 15100
},
{
"epoch": 0.638324766158254,
"grad_norm": 0.7539452910423279,
"learning_rate": 3.8650193365597864e-05,
"loss": 3.0010919189453125,
"step": 15150
},
{
"epoch": 0.6404314485548159,
"grad_norm": 0.7635869383811951,
"learning_rate": 3.8580513009667976e-05,
"loss": 2.9745663452148436,
"step": 15200
},
{
"epoch": 0.6425381309513778,
"grad_norm": 0.7659322023391724,
"learning_rate": 3.8510682665283984e-05,
"loss": 3.023065185546875,
"step": 15250
},
{
"epoch": 0.6446448133479397,
"grad_norm": 0.7653759121894836,
"learning_rate": 3.844070310367927e-05,
"loss": 2.991380615234375,
"step": 15300
},
{
"epoch": 0.6467514957445015,
"grad_norm": 0.7359285354614258,
"learning_rate": 3.83705750977353e-05,
"loss": 3.0079351806640626,
"step": 15350
},
{
"epoch": 0.6488581781410635,
"grad_norm": 0.7472555637359619,
"learning_rate": 3.830029942197297e-05,
"loss": 2.9910882568359374,
"step": 15400
},
{
"epoch": 0.6509648605376254,
"grad_norm": 0.7436686158180237,
"learning_rate": 3.822987685254409e-05,
"loss": 2.9968963623046876,
"step": 15450
},
{
"epoch": 0.6530715429341872,
"grad_norm": 0.7502424120903015,
"learning_rate": 3.8159308167222845e-05,
"loss": 2.982164001464844,
"step": 15500
},
{
"epoch": 0.6551782253307491,
"grad_norm": 0.7380735278129578,
"learning_rate": 3.808859414539717e-05,
"loss": 2.9850360107421876,
"step": 15550
},
{
"epoch": 0.6572849077273111,
"grad_norm": 0.7413625121116638,
"learning_rate": 3.8017735568060155e-05,
"loss": 2.9962612915039064,
"step": 15600
},
{
"epoch": 0.6593915901238729,
"grad_norm": 0.7653988003730774,
"learning_rate": 3.7946733217801414e-05,
"loss": 3.0060968017578125,
"step": 15650
},
{
"epoch": 0.6614982725204348,
"grad_norm": 0.7521942257881165,
"learning_rate": 3.787558787879846e-05,
"loss": 3.0134130859375,
"step": 15700
},
{
"epoch": 0.6636049549169967,
"grad_norm": 0.7369142770767212,
"learning_rate": 3.780430033680801e-05,
"loss": 2.991086730957031,
"step": 15750
},
{
"epoch": 0.6657116373135586,
"grad_norm": 0.7535198330879211,
"learning_rate": 3.773287137915732e-05,
"loss": 2.99282470703125,
"step": 15800
},
{
"epoch": 0.6678183197101205,
"grad_norm": 0.7708492875099182,
"learning_rate": 3.766130179473553e-05,
"loss": 3.0071200561523437,
"step": 15850
},
{
"epoch": 0.6699250021066824,
"grad_norm": 0.7468549609184265,
"learning_rate": 3.758959237398488e-05,
"loss": 2.9987628173828127,
"step": 15900
},
{
"epoch": 0.6720316845032442,
"grad_norm": 0.7619309425354004,
"learning_rate": 3.751774390889205e-05,
"loss": 3.015542297363281,
"step": 15950
},
{
"epoch": 0.6741383668998062,
"grad_norm": 0.7726176977157593,
"learning_rate": 3.7445757192979336e-05,
"loss": 3.007193298339844,
"step": 16000
},
{
"epoch": 0.6741383668998062,
"eval_loss": 2.9454808235168457,
"eval_runtime": 118.9703,
"eval_samples_per_second": 128.965,
"eval_steps_per_second": 4.035,
"step": 16000
},
{
"epoch": 0.6762450492963681,
"grad_norm": 0.7481387257575989,
"learning_rate": 3.7373633021295975e-05,
"loss": 2.9904840087890623,
"step": 16050
},
{
"epoch": 0.67835173169293,
"grad_norm": 0.7400880455970764,
"learning_rate": 3.730137219040929e-05,
"loss": 2.991521301269531,
"step": 16100
},
{
"epoch": 0.6804584140894918,
"grad_norm": 0.7606403827667236,
"learning_rate": 3.722897549839593e-05,
"loss": 2.99654541015625,
"step": 16150
},
{
"epoch": 0.6825650964860538,
"grad_norm": 0.7475659847259521,
"learning_rate": 3.715644374483305e-05,
"loss": 2.98114990234375,
"step": 16200
},
{
"epoch": 0.6846717788826157,
"grad_norm": 0.7718997001647949,
"learning_rate": 3.708377773078947e-05,
"loss": 2.9824609375,
"step": 16250
},
{
"epoch": 0.6867784612791775,
"grad_norm": 0.7612332105636597,
"learning_rate": 3.7010978258816855e-05,
"loss": 2.9789178466796873,
"step": 16300
},
{
"epoch": 0.6888851436757395,
"grad_norm": 0.73729407787323,
"learning_rate": 3.693804613294079e-05,
"loss": 2.992366943359375,
"step": 16350
},
{
"epoch": 0.6909918260723014,
"grad_norm": 0.7615039944648743,
"learning_rate": 3.6864982158651986e-05,
"loss": 3.0145358276367187,
"step": 16400
},
{
"epoch": 0.6930985084688632,
"grad_norm": 0.7860649824142456,
"learning_rate": 3.679178714289732e-05,
"loss": 2.9808953857421874,
"step": 16450
},
{
"epoch": 0.6952051908654251,
"grad_norm": 0.7659120559692383,
"learning_rate": 3.671846189407093e-05,
"loss": 3.0128125,
"step": 16500
},
{
"epoch": 0.6973118732619871,
"grad_norm": 0.7645251154899597,
"learning_rate": 3.664500722200531e-05,
"loss": 3.0033697509765624,
"step": 16550
},
{
"epoch": 0.6994185556585489,
"grad_norm": 0.7724819779396057,
"learning_rate": 3.657142393796236e-05,
"loss": 3.01952880859375,
"step": 16600
},
{
"epoch": 0.7015252380551108,
"grad_norm": 0.7801803946495056,
"learning_rate": 3.649771285462441e-05,
"loss": 2.9940887451171876,
"step": 16650
},
{
"epoch": 0.7036319204516727,
"grad_norm": 0.7721547484397888,
"learning_rate": 3.642387478608527e-05,
"loss": 2.99277587890625,
"step": 16700
},
{
"epoch": 0.7057386028482346,
"grad_norm": 0.7836876511573792,
"learning_rate": 3.634991054784121e-05,
"loss": 2.9915655517578124,
"step": 16750
},
{
"epoch": 0.7078452852447965,
"grad_norm": 0.7785339951515198,
"learning_rate": 3.627582095678197e-05,
"loss": 2.98688232421875,
"step": 16800
},
{
"epoch": 0.7099519676413584,
"grad_norm": 0.7511887550354004,
"learning_rate": 3.620160683118172e-05,
"loss": 2.9928399658203126,
"step": 16850
},
{
"epoch": 0.7120586500379202,
"grad_norm": 0.7539852857589722,
"learning_rate": 3.6127268990690075e-05,
"loss": 2.9907171630859377,
"step": 16900
},
{
"epoch": 0.7141653324344822,
"grad_norm": 0.7648764252662659,
"learning_rate": 3.605280825632299e-05,
"loss": 2.9792535400390623,
"step": 16950
},
{
"epoch": 0.7162720148310441,
"grad_norm": 0.7702951431274414,
"learning_rate": 3.5978225450453675e-05,
"loss": 2.990997314453125,
"step": 17000
},
{
"epoch": 0.7162720148310441,
"eval_loss": 2.943453788757324,
"eval_runtime": 118.9878,
"eval_samples_per_second": 128.946,
"eval_steps_per_second": 4.034,
"step": 17000
},
{
"epoch": 0.718378697227606,
"grad_norm": 0.7571023106575012,
"learning_rate": 3.5903521396803586e-05,
"loss": 3.00954345703125,
"step": 17050
},
{
"epoch": 0.7204853796241678,
"grad_norm": 0.7798113226890564,
"learning_rate": 3.582869692043328e-05,
"loss": 2.991300048828125,
"step": 17100
},
{
"epoch": 0.7225920620207298,
"grad_norm": 0.757226824760437,
"learning_rate": 3.5753752847733286e-05,
"loss": 2.976229248046875,
"step": 17150
},
{
"epoch": 0.7246987444172917,
"grad_norm": 0.7685642838478088,
"learning_rate": 3.567869000641503e-05,
"loss": 2.970736083984375,
"step": 17200
},
{
"epoch": 0.7268054268138535,
"grad_norm": 0.7552573084831238,
"learning_rate": 3.5603509225501635e-05,
"loss": 3.0016534423828123,
"step": 17250
},
{
"epoch": 0.7289121092104155,
"grad_norm": 0.7572063207626343,
"learning_rate": 3.552821133531883e-05,
"loss": 2.974124755859375,
"step": 17300
},
{
"epoch": 0.7310187916069774,
"grad_norm": 0.7647002935409546,
"learning_rate": 3.545279716748572e-05,
"loss": 2.9755426025390626,
"step": 17350
},
{
"epoch": 0.7331254740035392,
"grad_norm": 0.7891484498977661,
"learning_rate": 3.537726755490562e-05,
"loss": 2.987391357421875,
"step": 17400
},
{
"epoch": 0.7352321564001011,
"grad_norm": 0.7644563913345337,
"learning_rate": 3.530162333175688e-05,
"loss": 3.000482177734375,
"step": 17450
},
{
"epoch": 0.7373388387966631,
"grad_norm": 0.7742002010345459,
"learning_rate": 3.5225865333483656e-05,
"loss": 2.993226318359375,
"step": 17500
},
{
"epoch": 0.7394455211932249,
"grad_norm": 0.760245144367218,
"learning_rate": 3.514999439678666e-05,
"loss": 2.986939697265625,
"step": 17550
},
{
"epoch": 0.7415522035897868,
"grad_norm": 0.774545431137085,
"learning_rate": 3.5074011359613936e-05,
"loss": 2.995418701171875,
"step": 17600
},
{
"epoch": 0.7436588859863487,
"grad_norm": 0.7995437383651733,
"learning_rate": 3.4997917061151644e-05,
"loss": 2.9880685424804687,
"step": 17650
},
{
"epoch": 0.7457655683829106,
"grad_norm": 0.7373849749565125,
"learning_rate": 3.492171234181474e-05,
"loss": 3.004322509765625,
"step": 17700
},
{
"epoch": 0.7478722507794725,
"grad_norm": 0.7646380662918091,
"learning_rate": 3.484539804323769e-05,
"loss": 2.99695556640625,
"step": 17750
},
{
"epoch": 0.7499789331760344,
"grad_norm": 0.7866349220275879,
"learning_rate": 3.476897500826522e-05,
"loss": 2.988021240234375,
"step": 17800
},
{
"epoch": 0.7520856155725962,
"grad_norm": 0.7696439623832703,
"learning_rate": 3.469244408094299e-05,
"loss": 2.9982611083984376,
"step": 17850
},
{
"epoch": 0.7541922979691582,
"grad_norm": 0.7706558108329773,
"learning_rate": 3.461580610650822e-05,
"loss": 2.9865411376953124,
"step": 17900
},
{
"epoch": 0.7562989803657201,
"grad_norm": 0.7493193745613098,
"learning_rate": 3.453906193138046e-05,
"loss": 2.9728173828125,
"step": 17950
},
{
"epoch": 0.7584056627622819,
"grad_norm": 0.7709448933601379,
"learning_rate": 3.446221240315213e-05,
"loss": 2.99363525390625,
"step": 18000
},
{
"epoch": 0.7584056627622819,
"eval_loss": 2.943455457687378,
"eval_runtime": 118.6655,
"eval_samples_per_second": 129.296,
"eval_steps_per_second": 4.045,
"step": 18000
},
{
"epoch": 0.7605123451588438,
"grad_norm": 0.7643709182739258,
"learning_rate": 3.438525837057924e-05,
"loss": 2.97694580078125,
"step": 18050
},
{
"epoch": 0.7626190275554058,
"grad_norm": 0.7416406869888306,
"learning_rate": 3.430820068357199e-05,
"loss": 2.9764605712890626,
"step": 18100
},
{
"epoch": 0.7647257099519676,
"grad_norm": 0.7561569809913635,
"learning_rate": 3.423104019318537e-05,
"loss": 2.9853375244140623,
"step": 18150
},
{
"epoch": 0.7668323923485295,
"grad_norm": 0.752541720867157,
"learning_rate": 3.415377775160975e-05,
"loss": 2.9886016845703125,
"step": 18200
},
{
"epoch": 0.7689390747450914,
"grad_norm": 0.7720414400100708,
"learning_rate": 3.407641421216152e-05,
"loss": 2.973192138671875,
"step": 18250
},
{
"epoch": 0.7710457571416534,
"grad_norm": 0.7412005662918091,
"learning_rate": 3.399895042927362e-05,
"loss": 2.9741815185546874,
"step": 18300
},
{
"epoch": 0.7731524395382152,
"grad_norm": 0.7541579604148865,
"learning_rate": 3.3921387258486125e-05,
"loss": 2.984752197265625,
"step": 18350
},
{
"epoch": 0.7752591219347771,
"grad_norm": 0.7787860631942749,
"learning_rate": 3.3843725556436784e-05,
"loss": 2.98060791015625,
"step": 18400
},
{
"epoch": 0.7773658043313391,
"grad_norm": 0.7794627547264099,
"learning_rate": 3.376596618085155e-05,
"loss": 2.996499328613281,
"step": 18450
},
{
"epoch": 0.7794724867279009,
"grad_norm": 0.7562053799629211,
"learning_rate": 3.368810999053514e-05,
"loss": 2.996988525390625,
"step": 18500
},
{
"epoch": 0.7815791691244628,
"grad_norm": 0.7913422584533691,
"learning_rate": 3.361015784536153e-05,
"loss": 2.9749346923828126,
"step": 18550
},
{
"epoch": 0.7836858515210247,
"grad_norm": 0.7462142705917358,
"learning_rate": 3.353211060626444e-05,
"loss": 2.949781494140625,
"step": 18600
},
{
"epoch": 0.7857925339175866,
"grad_norm": 0.7861297130584717,
"learning_rate": 3.345396913522786e-05,
"loss": 2.981492919921875,
"step": 18650
},
{
"epoch": 0.7878992163141485,
"grad_norm": 0.7630501985549927,
"learning_rate": 3.337573429527652e-05,
"loss": 2.97427978515625,
"step": 18700
},
{
"epoch": 0.7900058987107104,
"grad_norm": 0.782783567905426,
"learning_rate": 3.329740695046632e-05,
"loss": 2.9570343017578127,
"step": 18750
},
{
"epoch": 0.7921125811072722,
"grad_norm": 0.7517935633659363,
"learning_rate": 3.321898796587488e-05,
"loss": 2.9745233154296873,
"step": 18800
},
{
"epoch": 0.7942192635038342,
"grad_norm": 0.7612478733062744,
"learning_rate": 3.314047820759185e-05,
"loss": 2.9816546630859375,
"step": 18850
},
{
"epoch": 0.7963259459003961,
"grad_norm": 0.7646007537841797,
"learning_rate": 3.306187854270948e-05,
"loss": 3.006817626953125,
"step": 18900
},
{
"epoch": 0.7984326282969579,
"grad_norm": 0.7654311060905457,
"learning_rate": 3.298318983931295e-05,
"loss": 2.9936016845703124,
"step": 18950
},
{
"epoch": 0.8005393106935198,
"grad_norm": 0.7550582885742188,
"learning_rate": 3.290441296647083e-05,
"loss": 2.9723480224609373,
"step": 19000
},
{
"epoch": 0.8005393106935198,
"eval_loss": 2.9402308464050293,
"eval_runtime": 119.1534,
"eval_samples_per_second": 128.767,
"eval_steps_per_second": 4.028,
"step": 19000
},
{
"epoch": 0.8026459930900818,
"grad_norm": 0.754814863204956,
"learning_rate": 3.2827126927572445e-05,
"loss": 2.9910968017578123,
"step": 19050
},
{
"epoch": 0.8047526754866436,
"grad_norm": 0.7622116804122925,
"learning_rate": 3.274817804695623e-05,
"loss": 2.9905078125,
"step": 19100
},
{
"epoch": 0.8068593578832055,
"grad_norm": 0.7846131920814514,
"learning_rate": 3.266914359245583e-05,
"loss": 2.9857449340820312,
"step": 19150
},
{
"epoch": 0.8089660402797674,
"grad_norm": 0.7798764705657959,
"learning_rate": 3.2590024436958436e-05,
"loss": 2.9960977172851564,
"step": 19200
},
{
"epoch": 0.8110727226763293,
"grad_norm": 0.7347792387008667,
"learning_rate": 3.2510821454286665e-05,
"loss": 2.9629473876953125,
"step": 19250
},
{
"epoch": 0.8131794050728912,
"grad_norm": 0.7740408182144165,
"learning_rate": 3.243153551918901e-05,
"loss": 2.989219055175781,
"step": 19300
},
{
"epoch": 0.8152860874694531,
"grad_norm": 0.7646519541740417,
"learning_rate": 3.235216750733009e-05,
"loss": 2.983004150390625,
"step": 19350
},
{
"epoch": 0.817392769866015,
"grad_norm": 0.7489182353019714,
"learning_rate": 3.2272718295281e-05,
"loss": 2.97353515625,
"step": 19400
},
{
"epoch": 0.8194994522625769,
"grad_norm": 0.7974159717559814,
"learning_rate": 3.2193188760509686e-05,
"loss": 2.984364013671875,
"step": 19450
},
{
"epoch": 0.8216061346591388,
"grad_norm": 0.7829204797744751,
"learning_rate": 3.211357978137117e-05,
"loss": 2.973402099609375,
"step": 19500
},
{
"epoch": 0.8237128170557007,
"grad_norm": 0.7689785361289978,
"learning_rate": 3.2033892237097895e-05,
"loss": 2.9742327880859376,
"step": 19550
},
{
"epoch": 0.8258194994522626,
"grad_norm": 0.743333101272583,
"learning_rate": 3.195572306799289e-05,
"loss": 2.98500732421875,
"step": 19600
},
{
"epoch": 0.8279261818488245,
"grad_norm": 0.7535820007324219,
"learning_rate": 3.1875882562051194e-05,
"loss": 2.96677978515625,
"step": 19650
},
{
"epoch": 0.8300328642453864,
"grad_norm": 0.755489706993103,
"learning_rate": 3.179596611619505e-05,
"loss": 2.9761566162109374,
"step": 19700
},
{
"epoch": 0.8321395466419482,
"grad_norm": 0.7670351266860962,
"learning_rate": 3.171597461305269e-05,
"loss": 2.9710345458984375,
"step": 19750
},
{
"epoch": 0.8342462290385102,
"grad_norm": 0.7711771726608276,
"learning_rate": 3.1635908936081306e-05,
"loss": 2.988819885253906,
"step": 19800
},
{
"epoch": 0.8363529114350721,
"grad_norm": 0.7788257002830505,
"learning_rate": 3.155576996955729e-05,
"loss": 2.9836825561523437,
"step": 19850
},
{
"epoch": 0.8384595938316339,
"grad_norm": 0.8039634823799133,
"learning_rate": 3.147555859856648e-05,
"loss": 2.9674588012695313,
"step": 19900
},
{
"epoch": 0.8405662762281958,
"grad_norm": 0.7871184349060059,
"learning_rate": 3.139527570899438e-05,
"loss": 2.993527526855469,
"step": 19950
},
{
"epoch": 0.8426729586247578,
"grad_norm": 0.7455061078071594,
"learning_rate": 3.131492218751635e-05,
"loss": 2.9716851806640623,
"step": 20000
},
{
"epoch": 0.8426729586247578,
"eval_loss": 2.938898801803589,
"eval_runtime": 118.9917,
"eval_samples_per_second": 128.942,
"eval_steps_per_second": 4.034,
"step": 20000
},
{
"epoch": 0.8447796410213196,
"grad_norm": 0.7597523927688599,
"learning_rate": 3.123449892158788e-05,
"loss": 2.984842529296875,
"step": 20050
},
{
"epoch": 0.8468863234178815,
"grad_norm": 0.7505768537521362,
"learning_rate": 3.115400679943469e-05,
"loss": 2.9934478759765626,
"step": 20100
},
{
"epoch": 0.8489930058144434,
"grad_norm": 0.7709312438964844,
"learning_rate": 3.107344671004303e-05,
"loss": 2.96940673828125,
"step": 20150
},
{
"epoch": 0.8510996882110053,
"grad_norm": 0.7617827653884888,
"learning_rate": 3.0992819543149765e-05,
"loss": 2.983475341796875,
"step": 20200
},
{
"epoch": 0.8532063706075672,
"grad_norm": 0.7898280024528503,
"learning_rate": 3.091212618923261e-05,
"loss": 2.9768841552734373,
"step": 20250
},
{
"epoch": 0.8553130530041291,
"grad_norm": 0.7669104337692261,
"learning_rate": 3.083136753950026e-05,
"loss": 2.9685321044921875,
"step": 20300
},
{
"epoch": 0.8574197354006909,
"grad_norm": 0.7699618339538574,
"learning_rate": 3.0750544485882585e-05,
"loss": 2.9848779296875,
"step": 20350
},
{
"epoch": 0.8595264177972529,
"grad_norm": 0.7880122661590576,
"learning_rate": 3.066965792102073e-05,
"loss": 2.985040283203125,
"step": 20400
},
{
"epoch": 0.8616331001938148,
"grad_norm": 0.760508120059967,
"learning_rate": 3.0588708738257324e-05,
"loss": 2.9629864501953125,
"step": 20450
},
{
"epoch": 0.8637397825903766,
"grad_norm": 0.7696555852890015,
"learning_rate": 3.0507697831626507e-05,
"loss": 2.988545227050781,
"step": 20500
},
{
"epoch": 0.8658464649869386,
"grad_norm": 0.7843043804168701,
"learning_rate": 3.042662609584418e-05,
"loss": 2.995951843261719,
"step": 20550
},
{
"epoch": 0.8679531473835005,
"grad_norm": 0.7505366206169128,
"learning_rate": 3.0345494426298045e-05,
"loss": 2.9777276611328123,
"step": 20600
},
{
"epoch": 0.8700598297800624,
"grad_norm": 0.7813105583190918,
"learning_rate": 3.0264303719037733e-05,
"loss": 2.98427734375,
"step": 20650
},
{
"epoch": 0.8721665121766242,
"grad_norm": 0.7776883244514465,
"learning_rate": 3.018305487076491e-05,
"loss": 2.9737237548828124,
"step": 20700
},
{
"epoch": 0.8742731945731862,
"grad_norm": 0.7753885388374329,
"learning_rate": 3.0101748778823374e-05,
"loss": 3.0072528076171876,
"step": 20750
},
{
"epoch": 0.8763798769697481,
"grad_norm": 0.7814272046089172,
"learning_rate": 3.0020386341189154e-05,
"loss": 2.9858108520507813,
"step": 20800
},
{
"epoch": 0.8784865593663099,
"grad_norm": 0.7478072047233582,
"learning_rate": 2.993896845646057e-05,
"loss": 3.0002532958984376,
"step": 20850
},
{
"epoch": 0.8805932417628718,
"grad_norm": 0.7745850086212158,
"learning_rate": 2.9857496023848323e-05,
"loss": 2.971799621582031,
"step": 20900
},
{
"epoch": 0.8826999241594338,
"grad_norm": 0.7583919763565063,
"learning_rate": 2.9775969943165572e-05,
"loss": 2.975789794921875,
"step": 20950
},
{
"epoch": 0.8848066065559956,
"grad_norm": 0.757747232913971,
"learning_rate": 2.9694391114817966e-05,
"loss": 2.957315673828125,
"step": 21000
},
{
"epoch": 0.8848066065559956,
"eval_loss": 2.9376776218414307,
"eval_runtime": 119.1894,
"eval_samples_per_second": 128.728,
"eval_steps_per_second": 4.027,
"step": 21000
},
{
"epoch": 0.8869132889525575,
"grad_norm": 0.7598838210105896,
"learning_rate": 2.9612760439793753e-05,
"loss": 2.96072998046875,
"step": 21050
},
{
"epoch": 0.8890199713491194,
"grad_norm": 0.7845181822776794,
"learning_rate": 2.953107881965376e-05,
"loss": 2.9771969604492186,
"step": 21100
},
{
"epoch": 0.8911266537456813,
"grad_norm": 0.7929947376251221,
"learning_rate": 2.9449347156521502e-05,
"loss": 2.9737921142578125,
"step": 21150
},
{
"epoch": 0.8932333361422432,
"grad_norm": 0.7893011569976807,
"learning_rate": 2.9367566353073155e-05,
"loss": 2.9805047607421873,
"step": 21200
},
{
"epoch": 0.8953400185388051,
"grad_norm": 0.7605388760566711,
"learning_rate": 2.928573731252766e-05,
"loss": 2.981062927246094,
"step": 21250
},
{
"epoch": 0.8974467009353669,
"grad_norm": 0.7496638298034668,
"learning_rate": 2.920386093863666e-05,
"loss": 2.977832946777344,
"step": 21300
},
{
"epoch": 0.8995533833319289,
"grad_norm": 0.7931700348854065,
"learning_rate": 2.9121938135674614e-05,
"loss": 2.9760317993164063,
"step": 21350
},
{
"epoch": 0.9016600657284908,
"grad_norm": 0.7766400575637817,
"learning_rate": 2.903996980842873e-05,
"loss": 2.959849548339844,
"step": 21400
},
{
"epoch": 0.9037667481250526,
"grad_norm": 0.7383178472518921,
"learning_rate": 2.8957956862189012e-05,
"loss": 2.972950134277344,
"step": 21450
},
{
"epoch": 0.9058734305216145,
"grad_norm": 0.7554975748062134,
"learning_rate": 2.8875900202738253e-05,
"loss": 2.9869000244140627,
"step": 21500
},
{
"epoch": 0.9079801129181765,
"grad_norm": 0.7777841687202454,
"learning_rate": 2.8793800736342037e-05,
"loss": 2.9726498413085936,
"step": 21550
},
{
"epoch": 0.9100867953147384,
"grad_norm": 0.7751466035842896,
"learning_rate": 2.871165936973872e-05,
"loss": 2.9812335205078124,
"step": 21600
},
{
"epoch": 0.9121934777113002,
"grad_norm": 0.7738240957260132,
"learning_rate": 2.862947701012943e-05,
"loss": 2.9768447875976562,
"step": 21650
},
{
"epoch": 0.9143001601078622,
"grad_norm": 0.7454856038093567,
"learning_rate": 2.8547254565168007e-05,
"loss": 2.9890667724609377,
"step": 21700
},
{
"epoch": 0.9164068425044241,
"grad_norm": 0.7908093333244324,
"learning_rate": 2.846499294295104e-05,
"loss": 2.965343017578125,
"step": 21750
},
{
"epoch": 0.9185135249009859,
"grad_norm": 0.7969614863395691,
"learning_rate": 2.838269305200781e-05,
"loss": 2.983328857421875,
"step": 21800
},
{
"epoch": 0.9206202072975478,
"grad_norm": 0.7719734311103821,
"learning_rate": 2.8300355801290218e-05,
"loss": 2.9759671020507814,
"step": 21850
},
{
"epoch": 0.9227268896941098,
"grad_norm": 0.770438015460968,
"learning_rate": 2.8217982100162822e-05,
"loss": 2.9574295043945313,
"step": 21900
},
{
"epoch": 0.9248335720906716,
"grad_norm": 0.7770126461982727,
"learning_rate": 2.8135572858392722e-05,
"loss": 2.9908953857421876,
"step": 21950
},
{
"epoch": 0.9269402544872335,
"grad_norm": 0.7843868732452393,
"learning_rate": 2.805312898613956e-05,
"loss": 2.98980224609375,
"step": 22000
},
{
"epoch": 0.9269402544872335,
"eval_loss": 2.9365010261535645,
"eval_runtime": 119.2163,
"eval_samples_per_second": 128.699,
"eval_steps_per_second": 4.026,
"step": 22000
},
{
"epoch": 0.9290469368837954,
"grad_norm": 0.771686315536499,
"learning_rate": 2.797065139394544e-05,
"loss": 2.9799072265625,
"step": 22050
},
{
"epoch": 0.9311536192803573,
"grad_norm": 0.7738041877746582,
"learning_rate": 2.78881409927249e-05,
"loss": 2.9672747802734376,
"step": 22100
},
{
"epoch": 0.9332603016769192,
"grad_norm": 0.7904272079467773,
"learning_rate": 2.7805598693754798e-05,
"loss": 2.9740606689453126,
"step": 22150
},
{
"epoch": 0.9353669840734811,
"grad_norm": 0.7471991181373596,
"learning_rate": 2.7723025408664317e-05,
"loss": 2.9706402587890626,
"step": 22200
},
{
"epoch": 0.9374736664700429,
"grad_norm": 0.7692591547966003,
"learning_rate": 2.764042204942485e-05,
"loss": 2.969313659667969,
"step": 22250
},
{
"epoch": 0.9395803488666049,
"grad_norm": 0.7923398613929749,
"learning_rate": 2.755778952833995e-05,
"loss": 2.9702215576171875,
"step": 22300
},
{
"epoch": 0.9416870312631668,
"grad_norm": 0.7700166702270508,
"learning_rate": 2.7475128758035223e-05,
"loss": 2.9864556884765623,
"step": 22350
},
{
"epoch": 0.9437937136597286,
"grad_norm": 0.7593397498130798,
"learning_rate": 2.7392440651448288e-05,
"loss": 2.9608709716796877,
"step": 22400
},
{
"epoch": 0.9459003960562905,
"grad_norm": 0.788577139377594,
"learning_rate": 2.7309726121818674e-05,
"loss": 2.9901824951171876,
"step": 22450
},
{
"epoch": 0.9480070784528525,
"grad_norm": 0.7750556468963623,
"learning_rate": 2.7226986082677734e-05,
"loss": 2.9944754028320313,
"step": 22500
},
{
"epoch": 0.9501137608494143,
"grad_norm": 0.7848498225212097,
"learning_rate": 2.7144221447838565e-05,
"loss": 2.9570849609375,
"step": 22550
},
{
"epoch": 0.9522204432459762,
"grad_norm": 0.7730944752693176,
"learning_rate": 2.7061433131385888e-05,
"loss": 2.976864013671875,
"step": 22600
},
{
"epoch": 0.9543271256425381,
"grad_norm": 0.7930340766906738,
"learning_rate": 2.6978622047665996e-05,
"loss": 2.96012451171875,
"step": 22650
},
{
"epoch": 0.9564338080391,
"grad_norm": 0.788257896900177,
"learning_rate": 2.6895789111276627e-05,
"loss": 2.957564697265625,
"step": 22700
},
{
"epoch": 0.9585404904356619,
"grad_norm": 0.7802656292915344,
"learning_rate": 2.6812935237056852e-05,
"loss": 2.955384521484375,
"step": 22750
},
{
"epoch": 0.9606471728322238,
"grad_norm": 0.7437043190002441,
"learning_rate": 2.6730061340077013e-05,
"loss": 2.973957824707031,
"step": 22800
},
{
"epoch": 0.9627538552287858,
"grad_norm": 0.7454256415367126,
"learning_rate": 2.6647168335628562e-05,
"loss": 2.960787048339844,
"step": 22850
},
{
"epoch": 0.9648605376253476,
"grad_norm": 0.7836768627166748,
"learning_rate": 2.656425713921402e-05,
"loss": 2.96308349609375,
"step": 22900
},
{
"epoch": 0.9669672200219095,
"grad_norm": 0.7823575139045715,
"learning_rate": 2.6481328666536792e-05,
"loss": 3.0113314819335937,
"step": 22950
},
{
"epoch": 0.9690739024184714,
"grad_norm": 0.8028575778007507,
"learning_rate": 2.6398383833491104e-05,
"loss": 2.96595458984375,
"step": 23000
},
{
"epoch": 0.9690739024184714,
"eval_loss": 2.933638334274292,
"eval_runtime": 119.4147,
"eval_samples_per_second": 128.485,
"eval_steps_per_second": 4.02,
"step": 23000
},
{
"epoch": 0.9711805848150333,
"grad_norm": 0.7629191875457764,
"learning_rate": 2.6315423556151864e-05,
"loss": 2.973958740234375,
"step": 23050
},
{
"epoch": 0.9732872672115952,
"grad_norm": 0.7664568424224854,
"learning_rate": 2.623244875076457e-05,
"loss": 2.965931396484375,
"step": 23100
},
{
"epoch": 0.9753939496081571,
"grad_norm": 0.7835934162139893,
"learning_rate": 2.6149460333735154e-05,
"loss": 2.9625234985351563,
"step": 23150
},
{
"epoch": 0.9775006320047189,
"grad_norm": 0.7699547410011292,
"learning_rate": 2.606645922161989e-05,
"loss": 2.963145446777344,
"step": 23200
},
{
"epoch": 0.9796073144012809,
"grad_norm": 0.7824780941009521,
"learning_rate": 2.5983446331115257e-05,
"loss": 2.9785943603515626,
"step": 23250
},
{
"epoch": 0.9817139967978428,
"grad_norm": 0.7860645055770874,
"learning_rate": 2.5900422579047824e-05,
"loss": 2.9981890869140626,
"step": 23300
},
{
"epoch": 0.9838206791944046,
"grad_norm": 0.7866495251655579,
"learning_rate": 2.581738888236412e-05,
"loss": 2.9776904296875,
"step": 23350
},
{
"epoch": 0.9859273615909665,
"grad_norm": 0.7753951549530029,
"learning_rate": 2.5734346158120497e-05,
"loss": 2.9835089111328124,
"step": 23400
},
{
"epoch": 0.9880340439875285,
"grad_norm": 0.7717190384864807,
"learning_rate": 2.5651295323473025e-05,
"loss": 2.954573974609375,
"step": 23450
},
{
"epoch": 0.9901407263840903,
"grad_norm": 0.825840950012207,
"learning_rate": 2.5568237295667335e-05,
"loss": 2.984539794921875,
"step": 23500
},
{
"epoch": 0.9922474087806522,
"grad_norm": 0.7789013981819153,
"learning_rate": 2.548517299202851e-05,
"loss": 2.97105224609375,
"step": 23550
},
{
"epoch": 0.9943540911772141,
"grad_norm": 0.7816980481147766,
"learning_rate": 2.5402103329950944e-05,
"loss": 2.9745220947265625,
"step": 23600
},
{
"epoch": 0.996460773573776,
"grad_norm": 0.7796857953071594,
"learning_rate": 2.5320690746536783e-05,
"loss": 2.957999267578125,
"step": 23650
},
{
"epoch": 0.9985674559703379,
"grad_norm": 0.7736715078353882,
"learning_rate": 2.5237613181469354e-05,
"loss": 2.9646710205078124,
"step": 23700
},
{
"epoch": 1.0006741383668998,
"grad_norm": 0.7790223956108093,
"learning_rate": 2.5154532992109774e-05,
"loss": 2.9590081787109375,
"step": 23750
},
{
"epoch": 1.0027808207634616,
"grad_norm": 0.7563338279724121,
"learning_rate": 2.5071451096027883e-05,
"loss": 2.96490234375,
"step": 23800
},
{
"epoch": 1.0048875031600235,
"grad_norm": 0.7708901166915894,
"learning_rate": 2.4988368410812367e-05,
"loss": 2.9566876220703127,
"step": 23850
},
{
"epoch": 1.0069941855565856,
"grad_norm": 0.779563844203949,
"learning_rate": 2.4905285854060623e-05,
"loss": 2.967255859375,
"step": 23900
},
{
"epoch": 1.0091008679531475,
"grad_norm": 0.7678179740905762,
"learning_rate": 2.4822204343368666e-05,
"loss": 2.9493267822265623,
"step": 23950
},
{
"epoch": 1.0112075503497093,
"grad_norm": 0.7816394567489624,
"learning_rate": 2.47391247963209e-05,
"loss": 2.951517333984375,
"step": 24000
},
{
"epoch": 1.0112075503497093,
"eval_loss": 2.931684970855713,
"eval_runtime": 119.3409,
"eval_samples_per_second": 128.564,
"eval_steps_per_second": 4.022,
"step": 24000
},
{
"epoch": 1.0133142327462712,
"grad_norm": 0.7653071880340576,
"learning_rate": 2.46560481304801e-05,
"loss": 2.9472750854492187,
"step": 24050
},
{
"epoch": 1.015420915142833,
"grad_norm": 0.7852833867073059,
"learning_rate": 2.4572975263377175e-05,
"loss": 2.9459237670898437,
"step": 24100
},
{
"epoch": 1.017527597539395,
"grad_norm": 0.8014306426048279,
"learning_rate": 2.4489907112501097e-05,
"loss": 2.950411071777344,
"step": 24150
},
{
"epoch": 1.0196342799359568,
"grad_norm": 0.7756820917129517,
"learning_rate": 2.440850578448941e-05,
"loss": 2.969849853515625,
"step": 24200
},
{
"epoch": 1.0217409623325187,
"grad_norm": 0.7699014544487,
"learning_rate": 2.4325449678304885e-05,
"loss": 2.9526519775390625,
"step": 24250
},
{
"epoch": 1.0238476447290807,
"grad_norm": 0.788263738155365,
"learning_rate": 2.424240102211579e-05,
"loss": 2.9390045166015626,
"step": 24300
},
{
"epoch": 1.0259543271256426,
"grad_norm": 0.782202959060669,
"learning_rate": 2.415936073314372e-05,
"loss": 2.9497976684570313,
"step": 24350
},
{
"epoch": 1.0280610095222045,
"grad_norm": 0.7703037261962891,
"learning_rate": 2.4076329728517826e-05,
"loss": 2.9414105224609375,
"step": 24400
},
{
"epoch": 1.0301676919187663,
"grad_norm": 0.7838400602340698,
"learning_rate": 2.3993308925264746e-05,
"loss": 2.939110107421875,
"step": 24450
},
{
"epoch": 1.0322743743153282,
"grad_norm": 0.795155942440033,
"learning_rate": 2.391029924029842e-05,
"loss": 2.9515594482421874,
"step": 24500
},
{
"epoch": 1.03438105671189,
"grad_norm": 0.7806478142738342,
"learning_rate": 2.3827301590410032e-05,
"loss": 2.9430780029296875,
"step": 24550
},
{
"epoch": 1.036487739108452,
"grad_norm": 0.7851158380508423,
"learning_rate": 2.3744316892257814e-05,
"loss": 2.9436154174804687,
"step": 24600
},
{
"epoch": 1.0385944215050138,
"grad_norm": 0.7663733959197998,
"learning_rate": 2.3661346062356965e-05,
"loss": 2.9495138549804687,
"step": 24650
},
{
"epoch": 1.0407011039015759,
"grad_norm": 0.7458925247192383,
"learning_rate": 2.357839001706953e-05,
"loss": 2.954429931640625,
"step": 24700
},
{
"epoch": 1.0428077862981378,
"grad_norm": 0.7798863649368286,
"learning_rate": 2.3495449672594243e-05,
"loss": 2.94943603515625,
"step": 24750
},
{
"epoch": 1.0449144686946996,
"grad_norm": 0.7786155939102173,
"learning_rate": 2.341252594495645e-05,
"loss": 2.934886474609375,
"step": 24800
},
{
"epoch": 1.0470211510912615,
"grad_norm": 0.7668699026107788,
"learning_rate": 2.3329619749997954e-05,
"loss": 2.9515509033203124,
"step": 24850
},
{
"epoch": 1.0491278334878233,
"grad_norm": 0.793624997138977,
"learning_rate": 2.3246732003366962e-05,
"loss": 2.9429592895507812,
"step": 24900
},
{
"epoch": 1.0512345158843852,
"grad_norm": 0.78849196434021,
"learning_rate": 2.3163863620507886e-05,
"loss": 2.961234130859375,
"step": 24950
},
{
"epoch": 1.053341198280947,
"grad_norm": 0.8046838045120239,
"learning_rate": 2.30810155166513e-05,
"loss": 2.965606994628906,
"step": 25000
},
{
"epoch": 1.053341198280947,
"eval_loss": 2.930619239807129,
"eval_runtime": 119.2511,
"eval_samples_per_second": 128.661,
"eval_steps_per_second": 4.025,
"step": 25000
},
{
"epoch": 1.0554478806775092,
"grad_norm": 0.7959691286087036,
"learning_rate": 2.299818860680379e-05,
"loss": 2.95442626953125,
"step": 25050
},
{
"epoch": 1.057554563074071,
"grad_norm": 0.79048752784729,
"learning_rate": 2.2915383805737886e-05,
"loss": 2.945472412109375,
"step": 25100
},
{
"epoch": 1.059661245470633,
"grad_norm": 0.802245020866394,
"learning_rate": 2.2832602027981955e-05,
"loss": 2.949869384765625,
"step": 25150
},
{
"epoch": 1.0617679278671948,
"grad_norm": 0.7903581857681274,
"learning_rate": 2.2749844187810038e-05,
"loss": 2.9403094482421874,
"step": 25200
},
{
"epoch": 1.0638746102637566,
"grad_norm": 0.7770790457725525,
"learning_rate": 2.2667111199231848e-05,
"loss": 2.9359564208984374,
"step": 25250
},
{
"epoch": 1.0659812926603185,
"grad_norm": 0.7775770425796509,
"learning_rate": 2.2584403975982582e-05,
"loss": 2.951751403808594,
"step": 25300
},
{
"epoch": 1.0680879750568804,
"grad_norm": 0.8019676208496094,
"learning_rate": 2.2501723431512923e-05,
"loss": 2.928594665527344,
"step": 25350
},
{
"epoch": 1.0701946574534422,
"grad_norm": 0.790306568145752,
"learning_rate": 2.2419070478978868e-05,
"loss": 2.9543621826171873,
"step": 25400
},
{
"epoch": 1.0723013398500043,
"grad_norm": 0.7839942574501038,
"learning_rate": 2.2336446031231695e-05,
"loss": 2.9492529296875,
"step": 25450
},
{
"epoch": 1.0744080222465662,
"grad_norm": 0.790597677230835,
"learning_rate": 2.225385100080784e-05,
"loss": 2.9704766845703126,
"step": 25500
},
{
"epoch": 1.076514704643128,
"grad_norm": 0.7874144911766052,
"learning_rate": 2.2171286299918884e-05,
"loss": 2.9508425903320314,
"step": 25550
},
{
"epoch": 1.07862138703969,
"grad_norm": 0.7846702337265015,
"learning_rate": 2.2088752840441408e-05,
"loss": 2.939859619140625,
"step": 25600
},
{
"epoch": 1.0807280694362518,
"grad_norm": 0.7921671271324158,
"learning_rate": 2.200625153390694e-05,
"loss": 2.940799560546875,
"step": 25650
},
{
"epoch": 1.0828347518328136,
"grad_norm": 0.792601466178894,
"learning_rate": 2.1923783291491944e-05,
"loss": 2.9628338623046875,
"step": 25700
},
{
"epoch": 1.0849414342293755,
"grad_norm": 0.7859891057014465,
"learning_rate": 2.1841349024007652e-05,
"loss": 2.942427062988281,
"step": 25750
},
{
"epoch": 1.0870481166259376,
"grad_norm": 0.7772258520126343,
"learning_rate": 2.175894964189012e-05,
"loss": 2.9303094482421876,
"step": 25800
},
{
"epoch": 1.0891547990224995,
"grad_norm": 0.7993125915527344,
"learning_rate": 2.167658605519007e-05,
"loss": 2.9263409423828124,
"step": 25850
},
{
"epoch": 1.0912614814190613,
"grad_norm": 0.7829107046127319,
"learning_rate": 2.159425917356292e-05,
"loss": 2.9401812744140625,
"step": 25900
},
{
"epoch": 1.0933681638156232,
"grad_norm": 0.79358971118927,
"learning_rate": 2.1511969906258675e-05,
"loss": 2.951754455566406,
"step": 25950
},
{
"epoch": 1.095474846212185,
"grad_norm": 0.7937335968017578,
"learning_rate": 2.142971916211194e-05,
"loss": 2.9429083251953125,
"step": 26000
},
{
"epoch": 1.095474846212185,
"eval_loss": 2.929333209991455,
"eval_runtime": 119.3254,
"eval_samples_per_second": 128.581,
"eval_steps_per_second": 4.023,
"step": 26000
},
{
"epoch": 1.097581528608747,
"grad_norm": 0.7786532640457153,
"learning_rate": 2.1347507849531834e-05,
"loss": 2.9413037109375,
"step": 26050
},
{
"epoch": 1.0996882110053088,
"grad_norm": 0.7673649191856384,
"learning_rate": 2.126533687649198e-05,
"loss": 2.9261761474609376,
"step": 26100
},
{
"epoch": 1.1017948934018706,
"grad_norm": 0.785383403301239,
"learning_rate": 2.1183207150520502e-05,
"loss": 2.941805114746094,
"step": 26150
},
{
"epoch": 1.1039015757984325,
"grad_norm": 0.786217451095581,
"learning_rate": 2.1101119578689937e-05,
"loss": 2.9692947387695314,
"step": 26200
},
{
"epoch": 1.1060082581949946,
"grad_norm": 0.7452182173728943,
"learning_rate": 2.1019075067607285e-05,
"loss": 2.9329632568359374,
"step": 26250
},
{
"epoch": 1.1081149405915565,
"grad_norm": 0.7984647154808044,
"learning_rate": 2.0937074523403937e-05,
"loss": 2.9429800415039065,
"step": 26300
},
{
"epoch": 1.1102216229881183,
"grad_norm": 0.7744592428207397,
"learning_rate": 2.085511885172574e-05,
"loss": 2.94785400390625,
"step": 26350
},
{
"epoch": 1.1123283053846802,
"grad_norm": 0.7572144865989685,
"learning_rate": 2.07732089577229e-05,
"loss": 2.9520443725585936,
"step": 26400
},
{
"epoch": 1.114434987781242,
"grad_norm": 0.7689366936683655,
"learning_rate": 2.0691345746040077e-05,
"loss": 2.9589193725585936,
"step": 26450
},
{
"epoch": 1.116541670177804,
"grad_norm": 0.780914306640625,
"learning_rate": 2.060953012080634e-05,
"loss": 2.940218505859375,
"step": 26500
},
{
"epoch": 1.1186483525743658,
"grad_norm": 0.787312924861908,
"learning_rate": 2.0527762985625186e-05,
"loss": 2.941663818359375,
"step": 26550
},
{
"epoch": 1.1207550349709279,
"grad_norm": 0.7888234853744507,
"learning_rate": 2.044604524356459e-05,
"loss": 2.9333465576171873,
"step": 26600
},
{
"epoch": 1.1228617173674897,
"grad_norm": 0.7970293760299683,
"learning_rate": 2.036437779714698e-05,
"loss": 2.947113037109375,
"step": 26650
},
{
"epoch": 1.1249683997640516,
"grad_norm": 0.8074147701263428,
"learning_rate": 2.0282761548339333e-05,
"loss": 2.9566986083984377,
"step": 26700
},
{
"epoch": 1.1270750821606135,
"grad_norm": 0.7938132882118225,
"learning_rate": 2.020119739854314e-05,
"loss": 2.9510516357421874,
"step": 26750
},
{
"epoch": 1.1291817645571753,
"grad_norm": 0.7867845296859741,
"learning_rate": 2.0119686248584544e-05,
"loss": 2.926278076171875,
"step": 26800
},
{
"epoch": 1.1312884469537372,
"grad_norm": 0.7708490490913391,
"learning_rate": 2.0038228998704284e-05,
"loss": 2.9552883911132812,
"step": 26850
},
{
"epoch": 1.133395129350299,
"grad_norm": 0.7819187045097351,
"learning_rate": 1.9956826548547826e-05,
"loss": 2.9469345092773436,
"step": 26900
},
{
"epoch": 1.135501811746861,
"grad_norm": 0.7773310542106628,
"learning_rate": 1.987547979715543e-05,
"loss": 2.954520263671875,
"step": 26950
},
{
"epoch": 1.137608494143423,
"grad_norm": 0.7851362228393555,
"learning_rate": 1.979418964295216e-05,
"loss": 2.93560791015625,
"step": 27000
},
{
"epoch": 1.137608494143423,
"eval_loss": 2.927694320678711,
"eval_runtime": 119.2829,
"eval_samples_per_second": 128.627,
"eval_steps_per_second": 4.024,
"step": 27000
},
{
"epoch": 1.1397151765399849,
"grad_norm": 0.7849646806716919,
"learning_rate": 1.9712956983738023e-05,
"loss": 2.932006530761719,
"step": 27050
},
{
"epoch": 1.1418218589365468,
"grad_norm": 0.7975698709487915,
"learning_rate": 1.9631782716678004e-05,
"loss": 2.9447900390625,
"step": 27100
},
{
"epoch": 1.1439285413331086,
"grad_norm": 0.7575515508651733,
"learning_rate": 1.9550667738292225e-05,
"loss": 2.9597747802734373,
"step": 27150
},
{
"epoch": 1.1460352237296705,
"grad_norm": 0.8183218836784363,
"learning_rate": 1.9469612944445948e-05,
"loss": 2.9584356689453126,
"step": 27200
},
{
"epoch": 1.1481419061262323,
"grad_norm": 0.7996168732643127,
"learning_rate": 1.9388619230339793e-05,
"loss": 2.9178704833984375,
"step": 27250
},
{
"epoch": 1.1502485885227942,
"grad_norm": 0.7881982326507568,
"learning_rate": 1.9307687490499723e-05,
"loss": 2.9272723388671875,
"step": 27300
},
{
"epoch": 1.1523552709193563,
"grad_norm": 0.8170751929283142,
"learning_rate": 1.9226818618767298e-05,
"loss": 2.9390142822265624,
"step": 27350
},
{
"epoch": 1.1544619533159182,
"grad_norm": 0.7902806997299194,
"learning_rate": 1.914601350828969e-05,
"loss": 2.9641290283203126,
"step": 27400
},
{
"epoch": 1.15656863571248,
"grad_norm": 0.7922801971435547,
"learning_rate": 1.9065273051509898e-05,
"loss": 2.9279544067382814,
"step": 27450
},
{
"epoch": 1.158675318109042,
"grad_norm": 0.79641193151474,
"learning_rate": 1.8984598140156853e-05,
"loss": 2.93123291015625,
"step": 27500
},
{
"epoch": 1.1607820005056038,
"grad_norm": 0.7968478202819824,
"learning_rate": 1.8903989665235554e-05,
"loss": 2.9517864990234375,
"step": 27550
},
{
"epoch": 1.1628886829021656,
"grad_norm": 0.8142721652984619,
"learning_rate": 1.8823448517017298e-05,
"loss": 2.9202032470703125,
"step": 27600
},
{
"epoch": 1.1649953652987275,
"grad_norm": 0.7819079756736755,
"learning_rate": 1.8742975585029748e-05,
"loss": 2.9275604248046876,
"step": 27650
},
{
"epoch": 1.1671020476952894,
"grad_norm": 0.7684738636016846,
"learning_rate": 1.8662571758047193e-05,
"loss": 2.9260235595703126,
"step": 27700
},
{
"epoch": 1.1692087300918514,
"grad_norm": 0.772836446762085,
"learning_rate": 1.858223792408068e-05,
"loss": 2.9181884765625,
"step": 27750
},
{
"epoch": 1.1713154124884133,
"grad_norm": 0.7890585064888,
"learning_rate": 1.8503579529081115e-05,
"loss": 2.9714337158203126,
"step": 27800
},
{
"epoch": 1.1734220948849752,
"grad_norm": 0.7656514048576355,
"learning_rate": 1.842338689806163e-05,
"loss": 2.944093017578125,
"step": 27850
},
{
"epoch": 1.175528777281537,
"grad_norm": 0.8071841597557068,
"learning_rate": 1.8343266901708566e-05,
"loss": 2.9365826416015626,
"step": 27900
},
{
"epoch": 1.177635459678099,
"grad_norm": 0.7989082336425781,
"learning_rate": 1.8263220424898265e-05,
"loss": 2.9464288330078126,
"step": 27950
},
{
"epoch": 1.1797421420746608,
"grad_norm": 0.7741073966026306,
"learning_rate": 1.8183248351695063e-05,
"loss": 2.9338690185546876,
"step": 28000
},
{
"epoch": 1.1797421420746608,
"eval_loss": 2.9263670444488525,
"eval_runtime": 119.1397,
"eval_samples_per_second": 128.782,
"eval_steps_per_second": 4.029,
"step": 28000
},
{
"epoch": 1.1818488244712226,
"grad_norm": 0.782497227191925,
"learning_rate": 1.810335156534155e-05,
"loss": 2.9569940185546875,
"step": 28050
},
{
"epoch": 1.1839555068677847,
"grad_norm": 0.8218105435371399,
"learning_rate": 1.8023530948248848e-05,
"loss": 2.9056085205078124,
"step": 28100
},
{
"epoch": 1.1860621892643466,
"grad_norm": 0.7782419919967651,
"learning_rate": 1.7943787381986808e-05,
"loss": 2.9361358642578126,
"step": 28150
},
{
"epoch": 1.1881688716609085,
"grad_norm": 0.8223652839660645,
"learning_rate": 1.7864121747274314e-05,
"loss": 2.932328186035156,
"step": 28200
},
{
"epoch": 1.1902755540574703,
"grad_norm": 0.8126109838485718,
"learning_rate": 1.778453492396953e-05,
"loss": 2.948155517578125,
"step": 28250
},
{
"epoch": 1.1923822364540322,
"grad_norm": 0.7880218029022217,
"learning_rate": 1.7705027791060232e-05,
"loss": 2.9344052124023436,
"step": 28300
},
{
"epoch": 1.194488918850594,
"grad_norm": 0.7809317111968994,
"learning_rate": 1.7625601226654015e-05,
"loss": 2.9467529296875,
"step": 28350
},
{
"epoch": 1.196595601247156,
"grad_norm": 0.7934635877609253,
"learning_rate": 1.7546256107968682e-05,
"loss": 2.9407623291015623,
"step": 28400
},
{
"epoch": 1.1987022836437178,
"grad_norm": 0.7794665694236755,
"learning_rate": 1.746699331132251e-05,
"loss": 2.9444644165039064,
"step": 28450
},
{
"epoch": 1.2008089660402796,
"grad_norm": 0.8297936916351318,
"learning_rate": 1.738781371212455e-05,
"loss": 2.9417449951171877,
"step": 28500
},
{
"epoch": 1.2029156484368417,
"grad_norm": 0.8044422268867493,
"learning_rate": 1.7308718184865048e-05,
"loss": 2.9425592041015625,
"step": 28550
},
{
"epoch": 1.2050223308334036,
"grad_norm": 0.8233380913734436,
"learning_rate": 1.7229707603105667e-05,
"loss": 2.9383099365234373,
"step": 28600
},
{
"epoch": 1.2071290132299655,
"grad_norm": 0.7789031267166138,
"learning_rate": 1.715078283946993e-05,
"loss": 2.932237548828125,
"step": 28650
},
{
"epoch": 1.2092356956265273,
"grad_norm": 0.7915503978729248,
"learning_rate": 1.7071944765633534e-05,
"loss": 2.9309442138671873,
"step": 28700
},
{
"epoch": 1.2113423780230892,
"grad_norm": 0.7797256112098694,
"learning_rate": 1.6993194252314776e-05,
"loss": 2.927774658203125,
"step": 28750
},
{
"epoch": 1.213449060419651,
"grad_norm": 0.7625344395637512,
"learning_rate": 1.6914532169264853e-05,
"loss": 2.9445306396484376,
"step": 28800
},
{
"epoch": 1.2155557428162131,
"grad_norm": 0.7801703214645386,
"learning_rate": 1.6835959385258327e-05,
"loss": 2.9501434326171876,
"step": 28850
},
{
"epoch": 1.217662425212775,
"grad_norm": 0.7768624424934387,
"learning_rate": 1.6757476768083525e-05,
"loss": 2.9339080810546876,
"step": 28900
},
{
"epoch": 1.2197691076093369,
"grad_norm": 0.7735788226127625,
"learning_rate": 1.66790851845329e-05,
"loss": 2.929815368652344,
"step": 28950
},
{
"epoch": 1.2218757900058987,
"grad_norm": 0.7853214740753174,
"learning_rate": 1.6600785500393527e-05,
"loss": 2.95386962890625,
"step": 29000
},
{
"epoch": 1.2218757900058987,
"eval_loss": 2.9254322052001953,
"eval_runtime": 119.1358,
"eval_samples_per_second": 128.786,
"eval_steps_per_second": 4.029,
"step": 29000
},
{
"epoch": 1.2239824724024606,
"grad_norm": 0.7844828963279724,
"learning_rate": 1.652257858043747e-05,
"loss": 2.937286376953125,
"step": 29050
},
{
"epoch": 1.2260891547990225,
"grad_norm": 0.7900869846343994,
"learning_rate": 1.6444465288412315e-05,
"loss": 2.9779071044921874,
"step": 29100
},
{
"epoch": 1.2281958371955843,
"grad_norm": 0.7900272011756897,
"learning_rate": 1.6366446487031546e-05,
"loss": 2.9597027587890623,
"step": 29150
},
{
"epoch": 1.2303025195921462,
"grad_norm": 0.8046372532844543,
"learning_rate": 1.6288523037965092e-05,
"loss": 2.9388983154296877,
"step": 29200
},
{
"epoch": 1.232409201988708,
"grad_norm": 0.7946169972419739,
"learning_rate": 1.6210695801829737e-05,
"loss": 2.9342681884765627,
"step": 29250
},
{
"epoch": 1.2345158843852702,
"grad_norm": 0.7965327501296997,
"learning_rate": 1.613296563817967e-05,
"loss": 2.953227233886719,
"step": 29300
},
{
"epoch": 1.236622566781832,
"grad_norm": 0.7878540754318237,
"learning_rate": 1.6055333405496985e-05,
"loss": 2.958277587890625,
"step": 29350
},
{
"epoch": 1.2387292491783939,
"grad_norm": 0.8178039789199829,
"learning_rate": 1.5977799961182165e-05,
"loss": 2.938063659667969,
"step": 29400
},
{
"epoch": 1.2408359315749558,
"grad_norm": 0.7918407320976257,
"learning_rate": 1.590036616154466e-05,
"loss": 2.93583251953125,
"step": 29450
},
{
"epoch": 1.2429426139715176,
"grad_norm": 0.7985025644302368,
"learning_rate": 1.582303286179337e-05,
"loss": 2.931334228515625,
"step": 29500
},
{
"epoch": 1.2450492963680795,
"grad_norm": 0.7899501323699951,
"learning_rate": 1.574580091602729e-05,
"loss": 2.9419769287109374,
"step": 29550
},
{
"epoch": 1.2471559787646413,
"grad_norm": 0.807771623134613,
"learning_rate": 1.566867117722596e-05,
"loss": 2.925600891113281,
"step": 29600
},
{
"epoch": 1.2492626611612034,
"grad_norm": 0.7778540253639221,
"learning_rate": 1.5591644497240153e-05,
"loss": 2.9385748291015625,
"step": 29650
},
{
"epoch": 1.2513693435577653,
"grad_norm": 0.8029125332832336,
"learning_rate": 1.55147217267824e-05,
"loss": 2.931204833984375,
"step": 29700
},
{
"epoch": 1.2534760259543272,
"grad_norm": 0.767647922039032,
"learning_rate": 1.5437903715417622e-05,
"loss": 2.9307843017578126,
"step": 29750
},
{
"epoch": 1.255582708350889,
"grad_norm": 0.8017622232437134,
"learning_rate": 1.536119131155374e-05,
"loss": 2.9459600830078125,
"step": 29800
},
{
"epoch": 1.257689390747451,
"grad_norm": 0.7804931998252869,
"learning_rate": 1.528458536243229e-05,
"loss": 2.9380758666992186,
"step": 29850
},
{
"epoch": 1.2597960731440128,
"grad_norm": 0.7753841876983643,
"learning_rate": 1.5208086714119113e-05,
"loss": 2.9388946533203124,
"step": 29900
},
{
"epoch": 1.2619027555405746,
"grad_norm": 0.7983092665672302,
"learning_rate": 1.5131696211494933e-05,
"loss": 2.936572265625,
"step": 29950
},
{
"epoch": 1.2640094379371365,
"grad_norm": 0.7694459557533264,
"learning_rate": 1.5055414698246123e-05,
"loss": 2.9460601806640625,
"step": 30000
},
{
"epoch": 1.2640094379371365,
"eval_loss": 2.9237051010131836,
"eval_runtime": 119.3333,
"eval_samples_per_second": 128.573,
"eval_steps_per_second": 4.022,
"step": 30000
},
{
"epoch": 1.2661161203336984,
"grad_norm": 0.8067724108695984,
"learning_rate": 1.4979243016855288e-05,
"loss": 2.941827392578125,
"step": 30050
},
{
"epoch": 1.2682228027302604,
"grad_norm": 0.7834928631782532,
"learning_rate": 1.4903182008592037e-05,
"loss": 2.9663165283203123,
"step": 30100
},
{
"epoch": 1.2703294851268223,
"grad_norm": 0.8025876879692078,
"learning_rate": 1.4827232513503636e-05,
"loss": 2.9382012939453124,
"step": 30150
},
{
"epoch": 1.2724361675233842,
"grad_norm": 0.8243033289909363,
"learning_rate": 1.4751395370405796e-05,
"loss": 2.928963928222656,
"step": 30200
},
{
"epoch": 1.274542849919946,
"grad_norm": 0.7702295780181885,
"learning_rate": 1.4675671416873338e-05,
"loss": 2.9373565673828126,
"step": 30250
},
{
"epoch": 1.276649532316508,
"grad_norm": 0.7878978848457336,
"learning_rate": 1.4600061489230971e-05,
"loss": 2.9364288330078123,
"step": 30300
},
{
"epoch": 1.27875621471307,
"grad_norm": 0.7720517516136169,
"learning_rate": 1.4524566422544082e-05,
"loss": 2.9434030151367185,
"step": 30350
},
{
"epoch": 1.2808628971096319,
"grad_norm": 0.7778488993644714,
"learning_rate": 1.4449187050609458e-05,
"loss": 2.944191589355469,
"step": 30400
},
{
"epoch": 1.2829695795061937,
"grad_norm": 0.7929774522781372,
"learning_rate": 1.437392420594615e-05,
"loss": 2.9433721923828124,
"step": 30450
},
{
"epoch": 1.2850762619027556,
"grad_norm": 0.8068262934684753,
"learning_rate": 1.4298778719786194e-05,
"loss": 2.9357684326171873,
"step": 30500
},
{
"epoch": 1.2871829442993175,
"grad_norm": 0.80678790807724,
"learning_rate": 1.4223751422065496e-05,
"loss": 2.9380233764648436,
"step": 30550
},
{
"epoch": 1.2892896266958793,
"grad_norm": 0.769245982170105,
"learning_rate": 1.4148843141414627e-05,
"loss": 2.9365478515625,
"step": 30600
},
{
"epoch": 1.2913963090924412,
"grad_norm": 0.8063893914222717,
"learning_rate": 1.407405470514972e-05,
"loss": 2.949693603515625,
"step": 30650
},
{
"epoch": 1.293502991489003,
"grad_norm": 0.8096292614936829,
"learning_rate": 1.3999386939263256e-05,
"loss": 2.93534423828125,
"step": 30700
},
{
"epoch": 1.295609673885565,
"grad_norm": 0.7904254198074341,
"learning_rate": 1.392484066841502e-05,
"loss": 2.9535675048828125,
"step": 30750
},
{
"epoch": 1.2977163562821268,
"grad_norm": 0.7776016592979431,
"learning_rate": 1.3850416715922956e-05,
"loss": 2.930771484375,
"step": 30800
},
{
"epoch": 1.2998230386786889,
"grad_norm": 0.8131218552589417,
"learning_rate": 1.377611590375405e-05,
"loss": 2.925182189941406,
"step": 30850
},
{
"epoch": 1.3019297210752507,
"grad_norm": 0.7831723093986511,
"learning_rate": 1.370193905251531e-05,
"loss": 2.9488519287109374,
"step": 30900
},
{
"epoch": 1.3040364034718126,
"grad_norm": 0.7675512433052063,
"learning_rate": 1.3627886981444652e-05,
"loss": 2.9460296630859375,
"step": 30950
},
{
"epoch": 1.3061430858683745,
"grad_norm": 0.7997528314590454,
"learning_rate": 1.3553960508401875e-05,
"loss": 2.953719482421875,
"step": 31000
},
{
"epoch": 1.3061430858683745,
"eval_loss": 2.9219441413879395,
"eval_runtime": 133.5018,
"eval_samples_per_second": 114.927,
"eval_steps_per_second": 3.595,
"step": 31000
},
{
"epoch": 1.3082497682649363,
"grad_norm": 0.7918239831924438,
"learning_rate": 1.3480160449859616e-05,
"loss": 2.932680969238281,
"step": 31050
},
{
"epoch": 1.3103564506614982,
"grad_norm": 0.7773085832595825,
"learning_rate": 1.3406487620894375e-05,
"loss": 2.925394287109375,
"step": 31100
},
{
"epoch": 1.3124631330580603,
"grad_norm": 0.7864688038825989,
"learning_rate": 1.3332942835177431e-05,
"loss": 2.925726318359375,
"step": 31150
},
{
"epoch": 1.3145698154546221,
"grad_norm": 0.7832627892494202,
"learning_rate": 1.325952690496594e-05,
"loss": 2.947120361328125,
"step": 31200
},
{
"epoch": 1.316676497851184,
"grad_norm": 0.7992543578147888,
"learning_rate": 1.3186240641093927e-05,
"loss": 2.9400369262695314,
"step": 31250
},
{
"epoch": 1.3187831802477459,
"grad_norm": 0.8116305470466614,
"learning_rate": 1.3113084852963304e-05,
"loss": 2.9369207763671876,
"step": 31300
},
{
"epoch": 1.3208898626443077,
"grad_norm": 0.7965041995048523,
"learning_rate": 1.3040060348534987e-05,
"loss": 2.948853759765625,
"step": 31350
},
{
"epoch": 1.3229965450408696,
"grad_norm": 0.8035820126533508,
"learning_rate": 1.2967167934319935e-05,
"loss": 2.950780029296875,
"step": 31400
},
{
"epoch": 1.3251032274374315,
"grad_norm": 0.7838873267173767,
"learning_rate": 1.2894408415370234e-05,
"loss": 2.916210021972656,
"step": 31450
},
{
"epoch": 1.3272099098339933,
"grad_norm": 0.834223210811615,
"learning_rate": 1.2821782595270238e-05,
"loss": 2.9532537841796875,
"step": 31500
},
{
"epoch": 1.3293165922305552,
"grad_norm": 0.807707667350769,
"learning_rate": 1.274929127612769e-05,
"loss": 2.9319525146484375,
"step": 31550
},
{
"epoch": 1.3314232746271173,
"grad_norm": 0.7963380217552185,
"learning_rate": 1.2676935258564832e-05,
"loss": 2.950096435546875,
"step": 31600
},
{
"epoch": 1.3335299570236792,
"grad_norm": 0.7738616466522217,
"learning_rate": 1.2604715341709592e-05,
"loss": 2.9467239379882812,
"step": 31650
},
{
"epoch": 1.335636639420241,
"grad_norm": 0.7763379812240601,
"learning_rate": 1.2532632323186761e-05,
"loss": 2.9259683227539064,
"step": 31700
},
{
"epoch": 1.3377433218168029,
"grad_norm": 0.7878997325897217,
"learning_rate": 1.2460686999109154e-05,
"loss": 2.9317642211914063,
"step": 31750
},
{
"epoch": 1.3398500042133648,
"grad_norm": 0.8008918762207031,
"learning_rate": 1.2388880164068836e-05,
"loss": 2.926044921875,
"step": 31800
},
{
"epoch": 1.3419566866099266,
"grad_norm": 0.7763420939445496,
"learning_rate": 1.2317212611128343e-05,
"loss": 2.9527883911132813,
"step": 31850
},
{
"epoch": 1.3440633690064887,
"grad_norm": 0.783769428730011,
"learning_rate": 1.2245685131811951e-05,
"loss": 2.9466986083984374,
"step": 31900
},
{
"epoch": 1.3461700514030506,
"grad_norm": 0.7776080369949341,
"learning_rate": 1.2174298516096869e-05,
"loss": 2.95081787109375,
"step": 31950
},
{
"epoch": 1.3482767337996124,
"grad_norm": 0.78815096616745,
"learning_rate": 1.2104477058396635e-05,
"loss": 2.9214215087890625,
"step": 32000
},
{
"epoch": 1.3482767337996124,
"eval_loss": 2.9208405017852783,
"eval_runtime": 133.39,
"eval_samples_per_second": 115.024,
"eval_steps_per_second": 3.598,
"step": 32000
},
{
"epoch": 1.3503834161961743,
"grad_norm": 0.7701238989830017,
"learning_rate": 1.2033371677105546e-05,
"loss": 2.93294677734375,
"step": 32050
},
{
"epoch": 1.3524900985927362,
"grad_norm": 0.7919666767120361,
"learning_rate": 1.1962409504287925e-05,
"loss": 2.9343310546875,
"step": 32100
},
{
"epoch": 1.354596780989298,
"grad_norm": 0.785975456237793,
"learning_rate": 1.189159132367755e-05,
"loss": 2.9307794189453125,
"step": 32150
},
{
"epoch": 1.35670346338586,
"grad_norm": 0.827540397644043,
"learning_rate": 1.1820917917417889e-05,
"loss": 2.9201791381835935,
"step": 32200
},
{
"epoch": 1.3588101457824218,
"grad_norm": 0.7883698344230652,
"learning_rate": 1.1750390066053452e-05,
"loss": 2.94340576171875,
"step": 32250
},
{
"epoch": 1.3609168281789836,
"grad_norm": 0.7953295111656189,
"learning_rate": 1.1680008548521185e-05,
"loss": 2.93116455078125,
"step": 32300
},
{
"epoch": 1.3630235105755455,
"grad_norm": 0.7758684754371643,
"learning_rate": 1.1609774142141867e-05,
"loss": 2.943220520019531,
"step": 32350
},
{
"epoch": 1.3651301929721076,
"grad_norm": 0.8139975666999817,
"learning_rate": 1.1539687622611543e-05,
"loss": 2.94186767578125,
"step": 32400
},
{
"epoch": 1.3672368753686694,
"grad_norm": 0.8057471513748169,
"learning_rate": 1.1469749763992904e-05,
"loss": 2.9390771484375,
"step": 32450
},
{
"epoch": 1.3693435577652313,
"grad_norm": 0.820174515247345,
"learning_rate": 1.139996133870682e-05,
"loss": 2.944349365234375,
"step": 32500
},
{
"epoch": 1.3714502401617932,
"grad_norm": 0.8091501593589783,
"learning_rate": 1.1330323117523706e-05,
"loss": 2.9372442626953124,
"step": 32550
},
{
"epoch": 1.373556922558355,
"grad_norm": 0.8005126714706421,
"learning_rate": 1.1260835869555106e-05,
"loss": 2.9346054077148436,
"step": 32600
},
{
"epoch": 1.3756636049549171,
"grad_norm": 0.8052904605865479,
"learning_rate": 1.1191500362245152e-05,
"loss": 2.9285906982421874,
"step": 32650
},
{
"epoch": 1.377770287351479,
"grad_norm": 0.780090868473053,
"learning_rate": 1.1122317361362075e-05,
"loss": 2.9148419189453123,
"step": 32700
},
{
"epoch": 1.3798769697480409,
"grad_norm": 0.7812498807907104,
"learning_rate": 1.1053287630989775e-05,
"loss": 2.91372314453125,
"step": 32750
},
{
"epoch": 1.3819836521446027,
"grad_norm": 0.7818878889083862,
"learning_rate": 1.0984411933519368e-05,
"loss": 2.922346496582031,
"step": 32800
},
{
"epoch": 1.3840903345411646,
"grad_norm": 0.7950148582458496,
"learning_rate": 1.091569102964079e-05,
"loss": 2.93470458984375,
"step": 32850
},
{
"epoch": 1.3861970169377265,
"grad_norm": 0.8164188265800476,
"learning_rate": 1.0847125678334347e-05,
"loss": 2.9304373168945315,
"step": 32900
},
{
"epoch": 1.3883036993342883,
"grad_norm": 0.7998409271240234,
"learning_rate": 1.0778716636862395e-05,
"loss": 2.9494195556640626,
"step": 32950
},
{
"epoch": 1.3904103817308502,
"grad_norm": 0.7881671786308289,
"learning_rate": 1.0710464660760914e-05,
"loss": 2.924466552734375,
"step": 33000
},
{
"epoch": 1.3904103817308502,
"eval_loss": 2.9189743995666504,
"eval_runtime": 133.7151,
"eval_samples_per_second": 114.744,
"eval_steps_per_second": 3.59,
"step": 33000
},
{
"epoch": 1.392517064127412,
"grad_norm": 0.7967885136604309,
"learning_rate": 1.0642370503831217e-05,
"loss": 2.9310653686523436,
"step": 33050
},
{
"epoch": 1.394623746523974,
"grad_norm": 0.7761057019233704,
"learning_rate": 1.0574434918131585e-05,
"loss": 2.922852783203125,
"step": 33100
},
{
"epoch": 1.396730428920536,
"grad_norm": 0.8000385165214539,
"learning_rate": 1.0506658653968967e-05,
"loss": 2.93267822265625,
"step": 33150
},
{
"epoch": 1.3988371113170979,
"grad_norm": 0.7959194779396057,
"learning_rate": 1.0439042459890741e-05,
"loss": 2.95590087890625,
"step": 33200
},
{
"epoch": 1.4009437937136597,
"grad_norm": 0.7842496633529663,
"learning_rate": 1.0371587082676367e-05,
"loss": 2.9364727783203124,
"step": 33250
},
{
"epoch": 1.4030504761102216,
"grad_norm": 0.8106942176818848,
"learning_rate": 1.0304293267329219e-05,
"loss": 2.944447021484375,
"step": 33300
},
{
"epoch": 1.4051571585067835,
"grad_norm": 0.8099303245544434,
"learning_rate": 1.0237161757068273e-05,
"loss": 2.914239807128906,
"step": 33350
},
{
"epoch": 1.4072638409033453,
"grad_norm": 0.791988730430603,
"learning_rate": 1.0170193293319999e-05,
"loss": 2.9319525146484375,
"step": 33400
},
{
"epoch": 1.4093705232999074,
"grad_norm": 0.7973111271858215,
"learning_rate": 1.0103388615710068e-05,
"loss": 2.93970703125,
"step": 33450
},
{
"epoch": 1.4114772056964693,
"grad_norm": 0.8064714074134827,
"learning_rate": 1.0036748462055276e-05,
"loss": 2.9383502197265625,
"step": 33500
},
{
"epoch": 1.4135838880930311,
"grad_norm": 0.8036237359046936,
"learning_rate": 9.970273568355321e-06,
"loss": 2.9164556884765624,
"step": 33550
},
{
"epoch": 1.415690570489593,
"grad_norm": 0.8388088345527649,
"learning_rate": 9.90396466878471e-06,
"loss": 2.9235543823242187,
"step": 33600
},
{
"epoch": 1.4177972528861549,
"grad_norm": 0.7946650981903076,
"learning_rate": 9.837822495684671e-06,
"loss": 2.9373529052734373,
"step": 33650
},
{
"epoch": 1.4199039352827167,
"grad_norm": 0.8091840744018555,
"learning_rate": 9.771847779555005e-06,
"loss": 2.957337646484375,
"step": 33700
},
{
"epoch": 1.4220106176792786,
"grad_norm": 0.8072313666343689,
"learning_rate": 9.706041249046088e-06,
"loss": 2.932064208984375,
"step": 33750
},
{
"epoch": 1.4241173000758405,
"grad_norm": 0.786514937877655,
"learning_rate": 9.640403630950756e-06,
"loss": 2.9320501708984374,
"step": 33800
},
{
"epoch": 1.4262239824724023,
"grad_norm": 0.7859194874763489,
"learning_rate": 9.574935650196346e-06,
"loss": 2.952900390625,
"step": 33850
},
{
"epoch": 1.4283306648689644,
"grad_norm": 0.7723864912986755,
"learning_rate": 9.509638029836612e-06,
"loss": 2.926435546875,
"step": 33900
},
{
"epoch": 1.4304373472655263,
"grad_norm": 0.7824335694313049,
"learning_rate": 9.444511491043828e-06,
"loss": 2.9314031982421875,
"step": 33950
},
{
"epoch": 1.4325440296620882,
"grad_norm": 0.8018701672554016,
"learning_rate": 9.38085415956809e-06,
"loss": 2.92718017578125,
"step": 34000
},
{
"epoch": 1.4325440296620882,
"eval_loss": 2.918320417404175,
"eval_runtime": 132.6789,
"eval_samples_per_second": 115.64,
"eval_steps_per_second": 3.618,
"step": 34000
},
{
"epoch": 1.43465071205865,
"grad_norm": 0.7768269181251526,
"learning_rate": 9.316068482477261e-06,
"loss": 2.924657897949219,
"step": 34050
},
{
"epoch": 1.436757394455212,
"grad_norm": 0.8097816109657288,
"learning_rate": 9.251456024810538e-06,
"loss": 2.927236328125,
"step": 34100
},
{
"epoch": 1.4388640768517738,
"grad_norm": 0.8051019906997681,
"learning_rate": 9.187017500172984e-06,
"loss": 2.944189453125,
"step": 34150
},
{
"epoch": 1.4409707592483358,
"grad_norm": 0.8041905760765076,
"learning_rate": 9.122753620248647e-06,
"loss": 2.9382794189453123,
"step": 34200
},
{
"epoch": 1.4430774416448977,
"grad_norm": 0.7908426523208618,
"learning_rate": 9.058665094792768e-06,
"loss": 2.9181817626953124,
"step": 34250
},
{
"epoch": 1.4451841240414596,
"grad_norm": 0.8021414875984192,
"learning_rate": 8.994752631623862e-06,
"loss": 2.9588043212890627,
"step": 34300
},
{
"epoch": 1.4472908064380214,
"grad_norm": 0.8225296139717102,
"learning_rate": 8.93101693661599e-06,
"loss": 2.93732666015625,
"step": 34350
},
{
"epoch": 1.4493974888345833,
"grad_norm": 0.7841650247573853,
"learning_rate": 8.86745871369087e-06,
"loss": 2.9336138916015626,
"step": 34400
},
{
"epoch": 1.4515041712311452,
"grad_norm": 0.7821727991104126,
"learning_rate": 8.804078664810193e-06,
"loss": 2.942218017578125,
"step": 34450
},
{
"epoch": 1.453610853627707,
"grad_norm": 0.796100914478302,
"learning_rate": 8.740877489967797e-06,
"loss": 2.93341064453125,
"step": 34500
},
{
"epoch": 1.455717536024269,
"grad_norm": 0.763460636138916,
"learning_rate": 8.677855887181967e-06,
"loss": 2.932227783203125,
"step": 34550
},
{
"epoch": 1.4578242184208308,
"grad_norm": 0.8215290904045105,
"learning_rate": 8.615014552487751e-06,
"loss": 2.930343017578125,
"step": 34600
},
{
"epoch": 1.4599309008173929,
"grad_norm": 0.799164891242981,
"learning_rate": 8.552354179929212e-06,
"loss": 2.922919921875,
"step": 34650
},
{
"epoch": 1.4620375832139547,
"grad_norm": 0.8057267069816589,
"learning_rate": 8.489875461551827e-06,
"loss": 2.9110009765625,
"step": 34700
},
{
"epoch": 1.4641442656105166,
"grad_norm": 0.7977777719497681,
"learning_rate": 8.427579087394782e-06,
"loss": 2.947958984375,
"step": 34750
},
{
"epoch": 1.4662509480070784,
"grad_norm": 0.7965235710144043,
"learning_rate": 8.365465745483422e-06,
"loss": 2.940159912109375,
"step": 34800
},
{
"epoch": 1.4683576304036403,
"grad_norm": 0.786981463432312,
"learning_rate": 8.303536121821579e-06,
"loss": 2.9247445678710937,
"step": 34850
},
{
"epoch": 1.4704643128002022,
"grad_norm": 0.7833293676376343,
"learning_rate": 8.241790900384041e-06,
"loss": 2.933876647949219,
"step": 34900
},
{
"epoch": 1.4725709951967643,
"grad_norm": 0.8161737322807312,
"learning_rate": 8.180230763108984e-06,
"loss": 2.9441455078125,
"step": 34950
},
{
"epoch": 1.4746776775933261,
"grad_norm": 0.8140338659286499,
"learning_rate": 8.11885638989045e-06,
"loss": 2.9499853515625,
"step": 35000
},
{
"epoch": 1.4746776775933261,
"eval_loss": 2.9171628952026367,
"eval_runtime": 132.8636,
"eval_samples_per_second": 115.479,
"eval_steps_per_second": 3.613,
"step": 35000
},
{
"epoch": 1.476784359989888,
"grad_norm": 0.8166197538375854,
"learning_rate": 8.057668458570836e-06,
"loss": 2.9236883544921874,
"step": 35050
},
{
"epoch": 1.4788910423864499,
"grad_norm": 0.8071980476379395,
"learning_rate": 7.996667644933375e-06,
"loss": 2.9362152099609373,
"step": 35100
},
{
"epoch": 1.4809977247830117,
"grad_norm": 0.7924031615257263,
"learning_rate": 7.935854622694735e-06,
"loss": 2.9321023559570314,
"step": 35150
},
{
"epoch": 1.4831044071795736,
"grad_norm": 0.7746392488479614,
"learning_rate": 7.87523006349751e-06,
"loss": 2.9222271728515623,
"step": 35200
},
{
"epoch": 1.4852110895761355,
"grad_norm": 0.8078408241271973,
"learning_rate": 7.814794636902864e-06,
"loss": 2.943782958984375,
"step": 35250
},
{
"epoch": 1.4873177719726973,
"grad_norm": 0.8177636861801147,
"learning_rate": 7.754549010383086e-06,
"loss": 2.9366082763671875,
"step": 35300
},
{
"epoch": 1.4894244543692592,
"grad_norm": 0.8233819007873535,
"learning_rate": 7.694493849314249e-06,
"loss": 2.949815368652344,
"step": 35350
},
{
"epoch": 1.491531136765821,
"grad_norm": 0.7855923175811768,
"learning_rate": 7.634629816968843e-06,
"loss": 2.9289474487304688,
"step": 35400
},
{
"epoch": 1.4936378191623831,
"grad_norm": 0.7993690967559814,
"learning_rate": 7.5749575745084704e-06,
"loss": 2.9322943115234374,
"step": 35450
},
{
"epoch": 1.495744501558945,
"grad_norm": 0.8059825897216797,
"learning_rate": 7.515477780976532e-06,
"loss": 2.93564697265625,
"step": 35500
},
{
"epoch": 1.4978511839555069,
"grad_norm": 0.806198239326477,
"learning_rate": 7.456191093290932e-06,
"loss": 2.91688720703125,
"step": 35550
},
{
"epoch": 1.4999578663520687,
"grad_norm": 0.7923563122749329,
"learning_rate": 7.39709816623686e-06,
"loss": 2.9082913208007812,
"step": 35600
},
{
"epoch": 1.5020645487486306,
"grad_norm": 0.8135302066802979,
"learning_rate": 7.338199652459521e-06,
"loss": 2.9541253662109375,
"step": 35650
},
{
"epoch": 1.5041712311451927,
"grad_norm": 0.7841634154319763,
"learning_rate": 7.279496202456948e-06,
"loss": 2.9492755126953125,
"step": 35700
},
{
"epoch": 1.5062779135417546,
"grad_norm": 0.8015527725219727,
"learning_rate": 7.220988464572812e-06,
"loss": 2.9421246337890623,
"step": 35750
},
{
"epoch": 1.5083845959383164,
"grad_norm": 0.8087325692176819,
"learning_rate": 7.162677084989283e-06,
"loss": 2.94099609375,
"step": 35800
},
{
"epoch": 1.5104912783348783,
"grad_norm": 0.7978482246398926,
"learning_rate": 7.104562707719839e-06,
"loss": 2.943082275390625,
"step": 35850
},
{
"epoch": 1.5125979607314401,
"grad_norm": 0.802884578704834,
"learning_rate": 7.04664597460222e-06,
"loss": 2.915927734375,
"step": 35900
},
{
"epoch": 1.514704643128002,
"grad_norm": 0.8194138407707214,
"learning_rate": 6.9889275252913e-06,
"loss": 2.93603515625,
"step": 35950
},
{
"epoch": 1.5168113255245639,
"grad_norm": 0.7744643092155457,
"learning_rate": 6.93140799725201e-06,
"loss": 2.9371746826171874,
"step": 36000
},
{
"epoch": 1.5168113255245639,
"eval_loss": 2.9163427352905273,
"eval_runtime": 132.434,
"eval_samples_per_second": 115.854,
"eval_steps_per_second": 3.624,
"step": 36000
},
{
"epoch": 1.5189180079211257,
"grad_norm": 0.7795388102531433,
"learning_rate": 6.874088025752346e-06,
"loss": 2.9265447998046876,
"step": 36050
},
{
"epoch": 1.5210246903176876,
"grad_norm": 0.8050419092178345,
"learning_rate": 6.8169682438563006e-06,
"loss": 2.9376104736328124,
"step": 36100
},
{
"epoch": 1.5231313727142495,
"grad_norm": 0.790391743183136,
"learning_rate": 6.760049282416911e-06,
"loss": 2.943501281738281,
"step": 36150
},
{
"epoch": 1.5252380551108113,
"grad_norm": 0.8023267984390259,
"learning_rate": 6.703331770069251e-06,
"loss": 2.934488525390625,
"step": 36200
},
{
"epoch": 1.5273447375073734,
"grad_norm": 0.808557391166687,
"learning_rate": 6.646816333223557e-06,
"loss": 2.925758056640625,
"step": 36250
},
{
"epoch": 1.5294514199039353,
"grad_norm": 0.7777003049850464,
"learning_rate": 6.59162786031825e-06,
"loss": 2.923520202636719,
"step": 36300
},
{
"epoch": 1.5315581023004972,
"grad_norm": 0.8037623763084412,
"learning_rate": 6.535514372260088e-06,
"loss": 2.946346435546875,
"step": 36350
},
{
"epoch": 1.533664784697059,
"grad_norm": 0.8090129494667053,
"learning_rate": 6.479604813144327e-06,
"loss": 2.93824462890625,
"step": 36400
},
{
"epoch": 1.5357714670936211,
"grad_norm": 0.818238377571106,
"learning_rate": 6.423899800457817e-06,
"loss": 2.9253659057617187,
"step": 36450
},
{
"epoch": 1.537878149490183,
"grad_norm": 0.8148744106292725,
"learning_rate": 6.368399949428333e-06,
"loss": 2.91279052734375,
"step": 36500
},
{
"epoch": 1.5399848318867448,
"grad_norm": 0.781205952167511,
"learning_rate": 6.313105873017769e-06,
"loss": 2.940987854003906,
"step": 36550
},
{
"epoch": 1.5420915142833067,
"grad_norm": 0.784307062625885,
"learning_rate": 6.258018181915351e-06,
"loss": 2.9270831298828126,
"step": 36600
},
{
"epoch": 1.5441981966798686,
"grad_norm": 0.777840793132782,
"learning_rate": 6.203137484530905e-06,
"loss": 2.9171002197265623,
"step": 36650
},
{
"epoch": 1.5463048790764304,
"grad_norm": 0.789941668510437,
"learning_rate": 6.14846438698814e-06,
"loss": 2.932503356933594,
"step": 36700
},
{
"epoch": 1.5484115614729923,
"grad_norm": 0.7811296582221985,
"learning_rate": 6.093999493117969e-06,
"loss": 2.9210369873046873,
"step": 36750
},
{
"epoch": 1.5505182438695542,
"grad_norm": 0.7956785559654236,
"learning_rate": 6.039743404451795e-06,
"loss": 2.935350341796875,
"step": 36800
},
{
"epoch": 1.552624926266116,
"grad_norm": 0.8070129752159119,
"learning_rate": 5.985696720214923e-06,
"loss": 2.936260070800781,
"step": 36850
},
{
"epoch": 1.554731608662678,
"grad_norm": 0.808233380317688,
"learning_rate": 5.931860037319886e-06,
"loss": 2.9369403076171876,
"step": 36900
},
{
"epoch": 1.5568382910592398,
"grad_norm": 0.8150511384010315,
"learning_rate": 5.878233950359901e-06,
"loss": 2.9321359252929686,
"step": 36950
},
{
"epoch": 1.5589449734558019,
"grad_norm": 0.79117351770401,
"learning_rate": 5.824819051602287e-06,
"loss": 2.921833190917969,
"step": 37000
},
{
"epoch": 1.5589449734558019,
"eval_loss": 2.9154181480407715,
"eval_runtime": 110.7687,
"eval_samples_per_second": 138.514,
"eval_steps_per_second": 4.333,
"step": 37000
},
{
"epoch": 1.5610516558523637,
"grad_norm": 0.7824537754058838,
"learning_rate": 5.7716159309819e-06,
"loss": 2.912900390625,
"step": 37050
},
{
"epoch": 1.5631583382489256,
"grad_norm": 0.7897117137908936,
"learning_rate": 5.718625176094639e-06,
"loss": 2.9198175048828126,
"step": 37100
},
{
"epoch": 1.5652650206454874,
"grad_norm": 0.8109549283981323,
"learning_rate": 5.665847372190955e-06,
"loss": 2.9246038818359374,
"step": 37150
},
{
"epoch": 1.5673717030420495,
"grad_norm": 0.7990185022354126,
"learning_rate": 5.613283102169406e-06,
"loss": 2.9372125244140626,
"step": 37200
},
{
"epoch": 1.5694783854386114,
"grad_norm": 0.790890097618103,
"learning_rate": 5.56093294657016e-06,
"loss": 2.933094482421875,
"step": 37250
},
{
"epoch": 1.5715850678351733,
"grad_norm": 0.8145341277122498,
"learning_rate": 5.508797483568665e-06,
"loss": 2.9228143310546875,
"step": 37300
},
{
"epoch": 1.5736917502317351,
"grad_norm": 0.7912366986274719,
"learning_rate": 5.4568772889691836e-06,
"loss": 2.929857177734375,
"step": 37350
},
{
"epoch": 1.575798432628297,
"grad_norm": 0.8049252033233643,
"learning_rate": 5.405172936198502e-06,
"loss": 2.94720947265625,
"step": 37400
},
{
"epoch": 1.5779051150248589,
"grad_norm": 0.7895810604095459,
"learning_rate": 5.353684996299541e-06,
"loss": 2.940379638671875,
"step": 37450
},
{
"epoch": 1.5800117974214207,
"grad_norm": 0.805823802947998,
"learning_rate": 5.302414037925077e-06,
"loss": 2.916343994140625,
"step": 37500
},
{
"epoch": 1.5821184798179826,
"grad_norm": 0.8166496157646179,
"learning_rate": 5.251360627331478e-06,
"loss": 2.93001220703125,
"step": 37550
},
{
"epoch": 1.5842251622145445,
"grad_norm": 0.81240314245224,
"learning_rate": 5.200525328372405e-06,
"loss": 2.906513671875,
"step": 37600
},
{
"epoch": 1.5863318446111063,
"grad_norm": 0.8053615689277649,
"learning_rate": 5.149908702492631e-06,
"loss": 2.9357623291015624,
"step": 37650
},
{
"epoch": 1.5884385270076682,
"grad_norm": 0.802976131439209,
"learning_rate": 5.0995113087217966e-06,
"loss": 2.9226223754882814,
"step": 37700
},
{
"epoch": 1.59054520940423,
"grad_norm": 0.7880696058273315,
"learning_rate": 5.049333703668285e-06,
"loss": 2.92947265625,
"step": 37750
},
{
"epoch": 1.5926518918007921,
"grad_norm": 0.8215526342391968,
"learning_rate": 4.999376441513015e-06,
"loss": 2.9145855712890625,
"step": 37800
},
{
"epoch": 1.594758574197354,
"grad_norm": 0.7832110524177551,
"learning_rate": 4.949640074003389e-06,
"loss": 2.9458853149414064,
"step": 37850
},
{
"epoch": 1.5968652565939159,
"grad_norm": 0.8030633330345154,
"learning_rate": 4.9001251504471325e-06,
"loss": 2.918009948730469,
"step": 37900
},
{
"epoch": 1.598971938990478,
"grad_norm": 0.80305415391922,
"learning_rate": 4.850832217706267e-06,
"loss": 2.928319396972656,
"step": 37950
},
{
"epoch": 1.6010786213870398,
"grad_norm": 0.7899791598320007,
"learning_rate": 4.801761820191072e-06,
"loss": 2.9024557495117187,
"step": 38000
},
{
"epoch": 1.6010786213870398,
"eval_loss": 2.9146671295166016,
"eval_runtime": 110.9544,
"eval_samples_per_second": 138.282,
"eval_steps_per_second": 4.326,
"step": 38000
},
{
"epoch": 1.6031853037836017,
"grad_norm": 0.8066175580024719,
"learning_rate": 4.75291449985405e-06,
"loss": 2.9117437744140626,
"step": 38050
},
{
"epoch": 1.6052919861801636,
"grad_norm": 0.7874099612236023,
"learning_rate": 4.704290796183963e-06,
"loss": 2.945263671875,
"step": 38100
},
{
"epoch": 1.6073986685767254,
"grad_norm": 0.8120174407958984,
"learning_rate": 4.655891246199845e-06,
"loss": 2.9389337158203124,
"step": 38150
},
{
"epoch": 1.6095053509732873,
"grad_norm": 0.7942776679992676,
"learning_rate": 4.6077163844451184e-06,
"loss": 2.943665771484375,
"step": 38200
},
{
"epoch": 1.6116120333698492,
"grad_norm": 0.797516405582428,
"learning_rate": 4.559766742981639e-06,
"loss": 2.928199462890625,
"step": 38250
},
{
"epoch": 1.613718715766411,
"grad_norm": 0.7932865023612976,
"learning_rate": 4.512042851383835e-06,
"loss": 2.9346612548828124,
"step": 38300
},
{
"epoch": 1.6158253981629729,
"grad_norm": 0.7972375154495239,
"learning_rate": 4.465492968114715e-06,
"loss": 2.9239166259765623,
"step": 38350
},
{
"epoch": 1.6179320805595347,
"grad_norm": 0.790519118309021,
"learning_rate": 4.418217613837431e-06,
"loss": 2.920374755859375,
"step": 38400
},
{
"epoch": 1.6200387629560966,
"grad_norm": 0.7743920087814331,
"learning_rate": 4.3711695727493225e-06,
"loss": 2.9266815185546875,
"step": 38450
},
{
"epoch": 1.6221454453526585,
"grad_norm": 0.7905875444412231,
"learning_rate": 4.324349364467223e-06,
"loss": 2.918923645019531,
"step": 38500
},
{
"epoch": 1.6242521277492206,
"grad_norm": 0.795048713684082,
"learning_rate": 4.277757506091659e-06,
"loss": 2.91831787109375,
"step": 38550
},
{
"epoch": 1.6263588101457824,
"grad_norm": 0.8047122955322266,
"learning_rate": 4.231394512201204e-06,
"loss": 2.917353515625,
"step": 38600
},
{
"epoch": 1.6284654925423443,
"grad_norm": 0.7855550646781921,
"learning_rate": 4.185260894846732e-06,
"loss": 2.9392071533203126,
"step": 38650
},
{
"epoch": 1.6305721749389062,
"grad_norm": 0.8067252039909363,
"learning_rate": 4.139357163545829e-06,
"loss": 2.926513671875,
"step": 38700
},
{
"epoch": 1.6326788573354682,
"grad_norm": 0.8326886296272278,
"learning_rate": 4.093683825277098e-06,
"loss": 2.9286224365234377,
"step": 38750
},
{
"epoch": 1.6347855397320301,
"grad_norm": 0.811650812625885,
"learning_rate": 4.048241384474613e-06,
"loss": 2.90252685546875,
"step": 38800
},
{
"epoch": 1.636892222128592,
"grad_norm": 0.8090134263038635,
"learning_rate": 4.0030303430223186e-06,
"loss": 2.906116943359375,
"step": 38850
},
{
"epoch": 1.6389989045251538,
"grad_norm": 0.7756823897361755,
"learning_rate": 3.958051200248483e-06,
"loss": 2.9276080322265625,
"step": 38900
},
{
"epoch": 1.6411055869217157,
"grad_norm": 0.7710340023040771,
"learning_rate": 3.9133044529202275e-06,
"loss": 2.9258453369140627,
"step": 38950
},
{
"epoch": 1.6432122693182776,
"grad_norm": 0.7959493398666382,
"learning_rate": 3.868790595237973e-06,
"loss": 2.937237548828125,
"step": 39000
},
{
"epoch": 1.6432122693182776,
"eval_loss": 2.913990020751953,
"eval_runtime": 109.3408,
"eval_samples_per_second": 140.323,
"eval_steps_per_second": 4.39,
"step": 39000
},
{
"epoch": 1.6453189517148394,
"grad_norm": 0.7863781452178955,
"learning_rate": 3.824510118830047e-06,
"loss": 2.9218255615234376,
"step": 39050
},
{
"epoch": 1.6474256341114013,
"grad_norm": 0.7998809814453125,
"learning_rate": 3.7804635127471926e-06,
"loss": 2.937727355957031,
"step": 39100
},
{
"epoch": 1.6495323165079632,
"grad_norm": 0.7936866283416748,
"learning_rate": 3.7366512634572306e-06,
"loss": 2.952947998046875,
"step": 39150
},
{
"epoch": 1.651638998904525,
"grad_norm": 0.7903639078140259,
"learning_rate": 3.693073854839629e-06,
"loss": 2.93330078125,
"step": 39200
},
{
"epoch": 1.653745681301087,
"grad_norm": 0.7985586524009705,
"learning_rate": 3.6497317681802008e-06,
"loss": 2.925899658203125,
"step": 39250
},
{
"epoch": 1.655852363697649,
"grad_norm": 0.7784944176673889,
"learning_rate": 3.6066254821657514e-06,
"loss": 2.956893005371094,
"step": 39300
},
{
"epoch": 1.6579590460942109,
"grad_norm": 0.8026953339576721,
"learning_rate": 3.563755472878838e-06,
"loss": 2.928978271484375,
"step": 39350
},
{
"epoch": 1.6600657284907727,
"grad_norm": 0.788847804069519,
"learning_rate": 3.521122213792477e-06,
"loss": 2.9353936767578124,
"step": 39400
},
{
"epoch": 1.6621724108873346,
"grad_norm": 0.8241669535636902,
"learning_rate": 3.4787261757649097e-06,
"loss": 2.934281311035156,
"step": 39450
},
{
"epoch": 1.6642790932838967,
"grad_norm": 0.7957674264907837,
"learning_rate": 3.4365678270344396e-06,
"loss": 2.9192974853515623,
"step": 39500
},
{
"epoch": 1.6663857756804585,
"grad_norm": 0.7936614751815796,
"learning_rate": 3.394647633214215e-06,
"loss": 2.9286676025390626,
"step": 39550
},
{
"epoch": 1.6684924580770204,
"grad_norm": 0.7859033346176147,
"learning_rate": 3.3529660572871267e-06,
"loss": 2.9341552734375,
"step": 39600
},
{
"epoch": 1.6705991404735823,
"grad_norm": 0.7885980010032654,
"learning_rate": 3.3115235596006654e-06,
"loss": 2.912452392578125,
"step": 39650
},
{
"epoch": 1.6727058228701441,
"grad_norm": 0.7956350445747375,
"learning_rate": 3.2703205978618534e-06,
"loss": 2.9545343017578123,
"step": 39700
},
{
"epoch": 1.674812505266706,
"grad_norm": 0.832351565361023,
"learning_rate": 3.229357627132176e-06,
"loss": 2.9165264892578127,
"step": 39750
},
{
"epoch": 1.6769191876632679,
"grad_norm": 0.7851858139038086,
"learning_rate": 3.1886350998225844e-06,
"loss": 2.921520080566406,
"step": 39800
},
{
"epoch": 1.6790258700598297,
"grad_norm": 0.8115505576133728,
"learning_rate": 3.148153465688469e-06,
"loss": 2.9139031982421875,
"step": 39850
},
{
"epoch": 1.6811325524563916,
"grad_norm": 0.7883580923080444,
"learning_rate": 3.107913171824692e-06,
"loss": 2.9267724609375,
"step": 39900
},
{
"epoch": 1.6832392348529535,
"grad_norm": 0.8143483996391296,
"learning_rate": 3.0679146626606784e-06,
"loss": 2.9394415283203124,
"step": 39950
},
{
"epoch": 1.6853459172495153,
"grad_norm": 0.811782717704773,
"learning_rate": 3.0281583799554786e-06,
"loss": 2.9455914306640625,
"step": 40000
},
{
"epoch": 1.6853459172495153,
"eval_loss": 2.9129562377929688,
"eval_runtime": 109.4554,
"eval_samples_per_second": 140.176,
"eval_steps_per_second": 4.385,
"step": 40000
},
{
"epoch": 1.6874525996460774,
"grad_norm": 0.7961781620979309,
"learning_rate": 2.9886447627929e-06,
"loss": 2.9425677490234374,
"step": 40050
},
{
"epoch": 1.6895592820426393,
"grad_norm": 0.80986487865448,
"learning_rate": 2.9493742475766557e-06,
"loss": 2.95297119140625,
"step": 40100
},
{
"epoch": 1.6916659644392011,
"grad_norm": 0.8379704356193542,
"learning_rate": 2.9103472680255595e-06,
"loss": 2.94047119140625,
"step": 40150
},
{
"epoch": 1.693772646835763,
"grad_norm": 0.8274521827697754,
"learning_rate": 2.8715642551687016e-06,
"loss": 2.9236444091796874,
"step": 40200
},
{
"epoch": 1.695879329232325,
"grad_norm": 0.8155441284179688,
"learning_rate": 2.8330256373407304e-06,
"loss": 2.91578369140625,
"step": 40250
},
{
"epoch": 1.697986011628887,
"grad_norm": 0.7939282655715942,
"learning_rate": 2.794731840177095e-06,
"loss": 2.9297991943359376,
"step": 40300
},
{
"epoch": 1.7000926940254488,
"grad_norm": 0.8066977858543396,
"learning_rate": 2.756683286609335e-06,
"loss": 2.928181457519531,
"step": 40350
},
{
"epoch": 1.7021993764220107,
"grad_norm": 0.8126586079597473,
"learning_rate": 2.7188803968604516e-06,
"loss": 2.935025634765625,
"step": 40400
},
{
"epoch": 1.7043060588185726,
"grad_norm": 0.8066821694374084,
"learning_rate": 2.682072310324235e-06,
"loss": 2.93519775390625,
"step": 40450
},
{
"epoch": 1.7064127412151344,
"grad_norm": 0.811872661113739,
"learning_rate": 2.644757064054837e-06,
"loss": 2.939276123046875,
"step": 40500
},
{
"epoch": 1.7085194236116963,
"grad_norm": 0.7744365930557251,
"learning_rate": 2.6076887177609283e-06,
"loss": 2.94591796875,
"step": 40550
},
{
"epoch": 1.7106261060082582,
"grad_norm": 0.7963656187057495,
"learning_rate": 2.570867680839703e-06,
"loss": 2.9264068603515625,
"step": 40600
},
{
"epoch": 1.71273278840482,
"grad_norm": 0.8092783093452454,
"learning_rate": 2.53429435995699e-06,
"loss": 2.9164804077148436,
"step": 40650
},
{
"epoch": 1.7148394708013819,
"grad_norm": 0.8073092699050903,
"learning_rate": 2.497969159042718e-06,
"loss": 2.9387576293945314,
"step": 40700
},
{
"epoch": 1.7169461531979437,
"grad_norm": 0.8129700422286987,
"learning_rate": 2.4618924792865093e-06,
"loss": 2.9286749267578127,
"step": 40750
},
{
"epoch": 1.7190528355945056,
"grad_norm": 0.7984380722045898,
"learning_rate": 2.426064719133203e-06,
"loss": 2.9281085205078123,
"step": 40800
},
{
"epoch": 1.7211595179910677,
"grad_norm": 0.7834457159042358,
"learning_rate": 2.3904862742784835e-06,
"loss": 2.936934509277344,
"step": 40850
},
{
"epoch": 1.7232662003876296,
"grad_norm": 0.8101183176040649,
"learning_rate": 2.355157537664507e-06,
"loss": 2.9396533203125,
"step": 40900
},
{
"epoch": 1.7253728827841914,
"grad_norm": 0.7983947992324829,
"learning_rate": 2.3200788994755364e-06,
"loss": 2.9327899169921876,
"step": 40950
},
{
"epoch": 1.7274795651807533,
"grad_norm": 0.8090130686759949,
"learning_rate": 2.285250747133663e-06,
"loss": 2.9282513427734376,
"step": 41000
},
{
"epoch": 1.7274795651807533,
"eval_loss": 2.9124667644500732,
"eval_runtime": 109.1218,
"eval_samples_per_second": 140.604,
"eval_steps_per_second": 4.399,
"step": 41000
},
{
"epoch": 1.7295862475773154,
"grad_norm": 0.8032718300819397,
"learning_rate": 2.250673465294509e-06,
"loss": 2.913149719238281,
"step": 41050
},
{
"epoch": 1.7316929299738772,
"grad_norm": 0.8181055784225464,
"learning_rate": 2.2163474358429944e-06,
"loss": 2.9339990234375,
"step": 41100
},
{
"epoch": 1.7337996123704391,
"grad_norm": 0.8013983368873596,
"learning_rate": 2.182273037889099e-06,
"loss": 2.9100967407226563,
"step": 41150
},
{
"epoch": 1.735906294767001,
"grad_norm": 0.836780846118927,
"learning_rate": 2.1484506477637002e-06,
"loss": 2.925872802734375,
"step": 41200
},
{
"epoch": 1.7380129771635628,
"grad_norm": 0.7955629229545593,
"learning_rate": 2.114880639014388e-06,
"loss": 2.9159527587890626,
"step": 41250
},
{
"epoch": 1.7401196595601247,
"grad_norm": 0.8006013035774231,
"learning_rate": 2.081563382401366e-06,
"loss": 2.90957763671875,
"step": 41300
},
{
"epoch": 1.7422263419566866,
"grad_norm": 0.8277612924575806,
"learning_rate": 2.048499245893343e-06,
"loss": 2.928201904296875,
"step": 41350
},
{
"epoch": 1.7443330243532484,
"grad_norm": 0.7843561768531799,
"learning_rate": 2.0156885946634703e-06,
"loss": 2.9217242431640624,
"step": 41400
},
{
"epoch": 1.7464397067498103,
"grad_norm": 0.7751513123512268,
"learning_rate": 1.9831317910853046e-06,
"loss": 2.9333505249023437,
"step": 41450
},
{
"epoch": 1.7485463891463722,
"grad_norm": 0.7870394587516785,
"learning_rate": 1.950829194728812e-06,
"loss": 2.9505987548828125,
"step": 41500
},
{
"epoch": 1.750653071542934,
"grad_norm": 0.7850804924964905,
"learning_rate": 1.918781162356409e-06,
"loss": 2.90233154296875,
"step": 41550
},
{
"epoch": 1.7527597539394961,
"grad_norm": 0.794102668762207,
"learning_rate": 1.8869880479189834e-06,
"loss": 2.94618408203125,
"step": 41600
},
{
"epoch": 1.754866436336058,
"grad_norm": 0.8069368600845337,
"learning_rate": 1.8554502025520394e-06,
"loss": 2.9230780029296874,
"step": 41650
},
{
"epoch": 1.7569731187326199,
"grad_norm": 0.7900083065032959,
"learning_rate": 1.8241679745717639e-06,
"loss": 2.9422222900390627,
"step": 41700
},
{
"epoch": 1.7590798011291817,
"grad_norm": 0.828949511051178,
"learning_rate": 1.7931417094712271e-06,
"loss": 2.905482177734375,
"step": 41750
},
{
"epoch": 1.7611864835257438,
"grad_norm": 0.8181668519973755,
"learning_rate": 1.762371749916536e-06,
"loss": 2.9306365966796877,
"step": 41800
},
{
"epoch": 1.7632931659223057,
"grad_norm": 0.7998356223106384,
"learning_rate": 1.7318584357430529e-06,
"loss": 2.905430908203125,
"step": 41850
},
{
"epoch": 1.7653998483188675,
"grad_norm": 0.7857435345649719,
"learning_rate": 1.7016021039516689e-06,
"loss": 2.9229693603515625,
"step": 41900
},
{
"epoch": 1.7675065307154294,
"grad_norm": 0.8163794279098511,
"learning_rate": 1.6716030887050372e-06,
"loss": 2.935548095703125,
"step": 41950
},
{
"epoch": 1.7696132131119913,
"grad_norm": 0.8158469796180725,
"learning_rate": 1.6418617213239313e-06,
"loss": 2.9157159423828123,
"step": 42000
},
{
"epoch": 1.7696132131119913,
"eval_loss": 2.9121968746185303,
"eval_runtime": 108.9624,
"eval_samples_per_second": 140.81,
"eval_steps_per_second": 4.405,
"step": 42000
},
{
"epoch": 1.7717198955085531,
"grad_norm": 0.7961393594741821,
"learning_rate": 1.61237833028354e-06,
"loss": 2.9196566772460937,
"step": 42050
},
{
"epoch": 1.773826577905115,
"grad_norm": 0.7808844447135925,
"learning_rate": 1.5831532412098838e-06,
"loss": 2.926371765136719,
"step": 42100
},
{
"epoch": 1.7759332603016769,
"grad_norm": 0.7773975729942322,
"learning_rate": 1.5541867768761736e-06,
"loss": 2.932283935546875,
"step": 42150
},
{
"epoch": 1.7780399426982387,
"grad_norm": 0.7964804768562317,
"learning_rate": 1.525479257199286e-06,
"loss": 2.9389453125,
"step": 42200
},
{
"epoch": 1.7801466250948006,
"grad_norm": 0.8084786534309387,
"learning_rate": 1.4970309992362014e-06,
"loss": 2.91684326171875,
"step": 42250
},
{
"epoch": 1.7822533074913625,
"grad_norm": 0.7834380269050598,
"learning_rate": 1.4688423171805132e-06,
"loss": 2.9197119140625,
"step": 42300
},
{
"epoch": 1.7843599898879245,
"grad_norm": 0.8210534453392029,
"learning_rate": 1.4409135223589694e-06,
"loss": 2.932439270019531,
"step": 42350
},
{
"epoch": 1.7864666722844864,
"grad_norm": 0.8303399682044983,
"learning_rate": 1.4132449232280103e-06,
"loss": 2.9323825073242187,
"step": 42400
},
{
"epoch": 1.7885733546810483,
"grad_norm": 0.7951374053955078,
"learning_rate": 1.3858368253703791e-06,
"loss": 2.933565673828125,
"step": 42450
},
{
"epoch": 1.7906800370776101,
"grad_norm": 0.7852106094360352,
"learning_rate": 1.3586895314917414e-06,
"loss": 2.9080514526367187,
"step": 42500
},
{
"epoch": 1.7927867194741722,
"grad_norm": 0.7875521183013916,
"learning_rate": 1.3318033414173425e-06,
"loss": 2.9189569091796876,
"step": 42550
},
{
"epoch": 1.794893401870734,
"grad_norm": 0.797749936580658,
"learning_rate": 1.3051785520886983e-06,
"loss": 2.929200439453125,
"step": 42600
},
{
"epoch": 1.797000084267296,
"grad_norm": 0.8121727108955383,
"learning_rate": 1.2788154575603062e-06,
"loss": 2.9154443359375,
"step": 42650
},
{
"epoch": 1.7991067666638578,
"grad_norm": 0.799733579158783,
"learning_rate": 1.2532338018359263e-06,
"loss": 2.931458740234375,
"step": 42700
},
{
"epoch": 1.8012134490604197,
"grad_norm": 0.7826681137084961,
"learning_rate": 1.227389719216271e-06,
"loss": 2.9412982177734377,
"step": 42750
},
{
"epoch": 1.8033201314569816,
"grad_norm": 0.7729964852333069,
"learning_rate": 1.2018081905269152e-06,
"loss": 2.9225433349609373,
"step": 42800
},
{
"epoch": 1.8054268138535434,
"grad_norm": 0.8305932879447937,
"learning_rate": 1.17648949830019e-06,
"loss": 2.954083251953125,
"step": 42850
},
{
"epoch": 1.8075334962501053,
"grad_norm": 0.8129289150238037,
"learning_rate": 1.1514339221655512e-06,
"loss": 2.933909606933594,
"step": 42900
},
{
"epoch": 1.8096401786466672,
"grad_norm": 0.7922786474227905,
"learning_rate": 1.1266417388465067e-06,
"loss": 2.9360870361328124,
"step": 42950
},
{
"epoch": 1.811746861043229,
"grad_norm": 0.8204851150512695,
"learning_rate": 1.1021132221575387e-06,
"loss": 2.9386032104492186,
"step": 43000
},
{
"epoch": 1.811746861043229,
"eval_loss": 2.9120566844940186,
"eval_runtime": 127.9465,
"eval_samples_per_second": 119.917,
"eval_steps_per_second": 3.752,
"step": 43000
},
{
"epoch": 1.8138535434397909,
"grad_norm": 0.7862714529037476,
"learning_rate": 1.0778486430011113e-06,
"loss": 2.905498046875,
"step": 43050
},
{
"epoch": 1.8159602258363527,
"grad_norm": 0.8294594883918762,
"learning_rate": 1.0538482693646435e-06,
"loss": 2.9325042724609376,
"step": 43100
},
{
"epoch": 1.8180669082329148,
"grad_norm": 0.8204466104507446,
"learning_rate": 1.0301123663175705e-06,
"loss": 2.927686767578125,
"step": 43150
},
{
"epoch": 1.8201735906294767,
"grad_norm": 0.8042780756950378,
"learning_rate": 1.0066411960084205e-06,
"loss": 2.9334552001953127,
"step": 43200
},
{
"epoch": 1.8222802730260386,
"grad_norm": 0.8087170124053955,
"learning_rate": 9.834350176618962e-07,
"loss": 2.9226800537109376,
"step": 43250
},
{
"epoch": 1.8243869554226007,
"grad_norm": 0.7973117828369141,
"learning_rate": 9.604940875760415e-07,
"loss": 2.9171844482421876,
"step": 43300
},
{
"epoch": 1.8264936378191625,
"grad_norm": 0.8308363556861877,
"learning_rate": 9.378186591193827e-07,
"loss": 2.9369036865234377,
"step": 43350
},
{
"epoch": 1.8286003202157244,
"grad_norm": 0.7975155115127563,
"learning_rate": 9.154089827281498e-07,
"loss": 2.933402099609375,
"step": 43400
},
{
"epoch": 1.8307070026122862,
"grad_norm": 0.7863073945045471,
"learning_rate": 8.932653059035013e-07,
"loss": 2.9464892578125,
"step": 43450
},
{
"epoch": 1.8328136850088481,
"grad_norm": 0.7683363556861877,
"learning_rate": 8.71387873208801e-07,
"loss": 2.9376263427734375,
"step": 43500
},
{
"epoch": 1.83492036740541,
"grad_norm": 0.8093059062957764,
"learning_rate": 8.497769262668959e-07,
"loss": 2.9380569458007812,
"step": 43550
},
{
"epoch": 1.8370270498019718,
"grad_norm": 0.8482558131217957,
"learning_rate": 8.284327037574646e-07,
"loss": 2.9273577880859376,
"step": 43600
},
{
"epoch": 1.8391337321985337,
"grad_norm": 0.7909052968025208,
"learning_rate": 8.073554414143897e-07,
"loss": 2.918182067871094,
"step": 43650
},
{
"epoch": 1.8412404145950956,
"grad_norm": 0.7663418054580688,
"learning_rate": 7.865453720231286e-07,
"loss": 2.919114685058594,
"step": 43700
},
{
"epoch": 1.8433470969916574,
"grad_norm": 0.7878078818321228,
"learning_rate": 7.660027254181634e-07,
"loss": 2.90847900390625,
"step": 43750
},
{
"epoch": 1.8454537793882193,
"grad_norm": 0.8218978047370911,
"learning_rate": 7.45727728480447e-07,
"loss": 2.92931396484375,
"step": 43800
},
{
"epoch": 1.8475604617847812,
"grad_norm": 0.781768798828125,
"learning_rate": 7.257206051349163e-07,
"loss": 2.9267474365234376,
"step": 43850
},
{
"epoch": 1.8496671441813433,
"grad_norm": 0.8082556128501892,
"learning_rate": 7.059815763479999e-07,
"loss": 2.901339111328125,
"step": 43900
},
{
"epoch": 1.8517738265779051,
"grad_norm": 0.8154715299606323,
"learning_rate": 6.865108601251918e-07,
"loss": 2.9370611572265624,
"step": 43950
},
{
"epoch": 1.853880508974467,
"grad_norm": 0.8003249168395996,
"learning_rate": 6.673086715086374e-07,
"loss": 2.9026998901367187,
"step": 44000
},
{
"epoch": 1.853880508974467,
"eval_loss": 2.911797523498535,
"eval_runtime": 128.0728,
"eval_samples_per_second": 119.799,
"eval_steps_per_second": 3.748,
"step": 44000
},
{
"epoch": 1.8559871913710289,
"grad_norm": 0.7780888676643372,
"learning_rate": 6.483752225747486e-07,
"loss": 2.9130596923828125,
"step": 44050
},
{
"epoch": 1.858093873767591,
"grad_norm": 0.7948802709579468,
"learning_rate": 6.297107224318893e-07,
"loss": 2.9231292724609377,
"step": 44100
},
{
"epoch": 1.8602005561641528,
"grad_norm": 0.7986658215522766,
"learning_rate": 6.113153772180358e-07,
"loss": 2.9504754638671873,
"step": 44150
},
{
"epoch": 1.8623072385607147,
"grad_norm": 0.8019037842750549,
"learning_rate": 5.93189390098517e-07,
"loss": 2.9416473388671873,
"step": 44200
},
{
"epoch": 1.8644139209572765,
"grad_norm": 0.7774601578712463,
"learning_rate": 5.753329612637664e-07,
"loss": 2.936625671386719,
"step": 44250
},
{
"epoch": 1.8665206033538384,
"grad_norm": 0.7865827679634094,
"learning_rate": 5.577462879271162e-07,
"loss": 2.9374444580078123,
"step": 44300
},
{
"epoch": 1.8686272857504003,
"grad_norm": 0.7820749282836914,
"learning_rate": 5.404295643226004e-07,
"loss": 2.9128753662109377,
"step": 44350
},
{
"epoch": 1.8707339681469621,
"grad_norm": 0.7874165177345276,
"learning_rate": 5.233829817028413e-07,
"loss": 2.908509521484375,
"step": 44400
},
{
"epoch": 1.872840650543524,
"grad_norm": 0.792330801486969,
"learning_rate": 5.06606728336903e-07,
"loss": 2.923705749511719,
"step": 44450
},
{
"epoch": 1.8749473329400859,
"grad_norm": 0.8028748631477356,
"learning_rate": 4.901009895082382e-07,
"loss": 2.9056796264648437,
"step": 44500
},
{
"epoch": 1.8770540153366477,
"grad_norm": 0.7632665038108826,
"learning_rate": 4.738659475126306e-07,
"loss": 2.93132568359375,
"step": 44550
},
{
"epoch": 1.8791606977332096,
"grad_norm": 0.7705265879631042,
"learning_rate": 4.579017816561837e-07,
"loss": 2.91453857421875,
"step": 44600
},
{
"epoch": 1.8812673801297717,
"grad_norm": 0.781696081161499,
"learning_rate": 4.4220866825333826e-07,
"loss": 2.9119244384765626,
"step": 44650
},
{
"epoch": 1.8833740625263335,
"grad_norm": 0.790869414806366,
"learning_rate": 4.267867806249215e-07,
"loss": 2.9221722412109377,
"step": 44700
},
{
"epoch": 1.8854807449228954,
"grad_norm": 0.7911215424537659,
"learning_rate": 4.116362890962511e-07,
"loss": 2.935125732421875,
"step": 44750
},
{
"epoch": 1.8875874273194573,
"grad_norm": 0.7805041670799255,
"learning_rate": 3.967573609952258e-07,
"loss": 2.9434979248046873,
"step": 44800
},
{
"epoch": 1.8896941097160194,
"grad_norm": 0.774147629737854,
"learning_rate": 3.8243964067696815e-07,
"loss": 2.9308935546875,
"step": 44850
},
{
"epoch": 1.8918007921125812,
"grad_norm": 0.8052771687507629,
"learning_rate": 3.6809889007286825e-07,
"loss": 2.93390380859375,
"step": 44900
},
{
"epoch": 1.893907474509143,
"grad_norm": 0.7773950695991516,
"learning_rate": 3.540301837403392e-07,
"loss": 2.91735595703125,
"step": 44950
},
{
"epoch": 1.896014156905705,
"grad_norm": 0.8081435561180115,
"learning_rate": 3.4023367705963707e-07,
"loss": 2.9174813842773437,
"step": 45000
},
{
"epoch": 1.896014156905705,
"eval_loss": 2.911701202392578,
"eval_runtime": 119.8001,
"eval_samples_per_second": 128.072,
"eval_steps_per_second": 4.007,
"step": 45000
},
{
"epoch": 1.8981208393022668,
"grad_norm": 0.79304438829422,
"learning_rate": 3.2670952240472505e-07,
"loss": 2.922022705078125,
"step": 45050
},
{
"epoch": 1.9002275216988287,
"grad_norm": 0.796622097492218,
"learning_rate": 3.134578691416201e-07,
"loss": 2.9227664184570314,
"step": 45100
},
{
"epoch": 1.9023342040953906,
"grad_norm": 0.7990376353263855,
"learning_rate": 3.004788636267242e-07,
"loss": 2.917940673828125,
"step": 45150
},
{
"epoch": 1.9044408864919524,
"grad_norm": 0.8256587386131287,
"learning_rate": 2.8777264920520354e-07,
"loss": 2.922840576171875,
"step": 45200
},
{
"epoch": 1.9065475688885143,
"grad_norm": 0.8110597133636475,
"learning_rate": 2.7533936620942334e-07,
"loss": 2.9242098999023436,
"step": 45250
},
{
"epoch": 1.9086542512850762,
"grad_norm": 0.7913885116577148,
"learning_rate": 2.631791519573823e-07,
"loss": 2.9055206298828127,
"step": 45300
},
{
"epoch": 1.910760933681638,
"grad_norm": 0.8255484700202942,
"learning_rate": 2.512921407512053e-07,
"loss": 2.9211932373046876,
"step": 45350
},
{
"epoch": 1.9128676160782,
"grad_norm": 0.815882682800293,
"learning_rate": 2.396784638756505e-07,
"loss": 2.9394482421875,
"step": 45400
},
{
"epoch": 1.914974298474762,
"grad_norm": 0.7824210524559021,
"learning_rate": 2.283382495966796e-07,
"loss": 2.9364703369140623,
"step": 45450
},
{
"epoch": 1.9170809808713238,
"grad_norm": 0.7879770994186401,
"learning_rate": 2.1727162316001193e-07,
"loss": 2.92824951171875,
"step": 45500
},
{
"epoch": 1.9191876632678857,
"grad_norm": 0.8016529679298401,
"learning_rate": 2.0647870678976444e-07,
"loss": 2.911627197265625,
"step": 45550
},
{
"epoch": 1.9212943456644478,
"grad_norm": 0.8015576004981995,
"learning_rate": 1.9595961968709442e-07,
"loss": 2.926610107421875,
"step": 45600
},
{
"epoch": 1.9234010280610097,
"grad_norm": 0.7970701456069946,
"learning_rate": 1.8571447802887832e-07,
"loss": 2.9195391845703127,
"step": 45650
},
{
"epoch": 1.9255077104575715,
"grad_norm": 0.7912192344665527,
"learning_rate": 1.7574339496643777e-07,
"loss": 2.9200799560546873,
"step": 45700
},
{
"epoch": 1.9276143928541334,
"grad_norm": 0.8180844783782959,
"learning_rate": 1.6604648062427675e-07,
"loss": 2.9211965942382814,
"step": 45750
},
{
"epoch": 1.9297210752506953,
"grad_norm": 0.806681215763092,
"learning_rate": 1.5662384209888802e-07,
"loss": 2.9474331665039064,
"step": 45800
},
{
"epoch": 1.9318277576472571,
"grad_norm": 0.7923222184181213,
"learning_rate": 1.4747558345753754e-07,
"loss": 2.9127471923828123,
"step": 45850
},
{
"epoch": 1.933934440043819,
"grad_norm": 0.7819007635116577,
"learning_rate": 1.3860180573714855e-07,
"loss": 2.9185443115234375,
"step": 45900
},
{
"epoch": 1.9360411224403808,
"grad_norm": 0.7989100813865662,
"learning_rate": 1.3000260694316367e-07,
"loss": 2.90548095703125,
"step": 45950
},
{
"epoch": 1.9381478048369427,
"grad_norm": 0.7897266745567322,
"learning_rate": 1.216780820484681e-07,
"loss": 2.924876403808594,
"step": 46000
},
{
"epoch": 1.9381478048369427,
"eval_loss": 2.9114933013916016,
"eval_runtime": 119.4231,
"eval_samples_per_second": 128.476,
"eval_steps_per_second": 4.019,
"step": 46000
},
{
"epoch": 1.9402544872335046,
"grad_norm": 0.7921951413154602,
"learning_rate": 1.1362832299234572e-07,
"loss": 2.933022155761719,
"step": 46050
},
{
"epoch": 1.9423611696300664,
"grad_norm": 0.7944632172584534,
"learning_rate": 1.0585341867946075e-07,
"loss": 2.9296893310546874,
"step": 46100
},
{
"epoch": 1.9444678520266283,
"grad_norm": 0.7957251071929932,
"learning_rate": 9.83534549788695e-08,
"loss": 2.9290631103515623,
"step": 46150
},
{
"epoch": 1.9465745344231904,
"grad_norm": 0.8100662231445312,
"learning_rate": 9.112851472308225e-08,
"loss": 2.921019287109375,
"step": 46200
},
{
"epoch": 1.9486812168197523,
"grad_norm": 0.7996461391448975,
"learning_rate": 8.417867770714182e-08,
"loss": 2.9238427734375,
"step": 46250
},
{
"epoch": 1.9507878992163141,
"grad_norm": 0.7716062664985657,
"learning_rate": 7.750402068774088e-08,
"loss": 2.917015380859375,
"step": 46300
},
{
"epoch": 1.952894581612876,
"grad_norm": 0.7902867197990417,
"learning_rate": 7.11046173823865e-08,
"loss": 2.9637591552734377,
"step": 46350
},
{
"epoch": 1.955001264009438,
"grad_norm": 0.7814793586730957,
"learning_rate": 6.498053846856756e-08,
"loss": 2.8917889404296875,
"step": 46400
},
{
"epoch": 1.957107946406,
"grad_norm": 0.8013756275177002,
"learning_rate": 5.9131851582988616e-08,
"loss": 2.915605163574219,
"step": 46450
},
{
"epoch": 1.9592146288025618,
"grad_norm": 0.796045184135437,
"learning_rate": 5.355862132081502e-08,
"loss": 2.9377127075195313,
"step": 46500
},
{
"epoch": 1.9613213111991237,
"grad_norm": 0.8041338324546814,
"learning_rate": 4.8260909234967845e-08,
"loss": 2.9272357177734376,
"step": 46550
},
{
"epoch": 1.9634279935956855,
"grad_norm": 0.7950087189674377,
"learning_rate": 4.323877383543284e-08,
"loss": 2.921788635253906,
"step": 46600
},
{
"epoch": 1.9655346759922474,
"grad_norm": 0.808857262134552,
"learning_rate": 3.849227058861926e-08,
"loss": 2.9121929931640627,
"step": 46650
},
{
"epoch": 1.9676413583888093,
"grad_norm": 0.7998260855674744,
"learning_rate": 3.402145191675199e-08,
"loss": 2.910013427734375,
"step": 46700
},
{
"epoch": 1.9697480407853711,
"grad_norm": 0.8039520978927612,
"learning_rate": 2.982636719728593e-08,
"loss": 2.9208221435546875,
"step": 46750
},
{
"epoch": 1.971854723181933,
"grad_norm": 0.7953173518180847,
"learning_rate": 2.590706276236754e-08,
"loss": 2.9036734008789065,
"step": 46800
},
{
"epoch": 1.9739614055784949,
"grad_norm": 0.8002514839172363,
"learning_rate": 2.2263581898310236e-08,
"loss": 2.919159240722656,
"step": 46850
},
{
"epoch": 1.9760680879750567,
"grad_norm": 0.8161515593528748,
"learning_rate": 1.8960613475257904e-08,
"loss": 2.9043402099609374,
"step": 46900
},
{
"epoch": 1.9781747703716188,
"grad_norm": 0.7810516357421875,
"learning_rate": 1.586337906136215e-08,
"loss": 2.914085693359375,
"step": 46950
},
{
"epoch": 1.9802814527681807,
"grad_norm": 0.7850042581558228,
"learning_rate": 1.3042079144670594e-08,
"loss": 2.9438748168945312,
"step": 47000
},
{
"epoch": 1.9802814527681807,
"eval_loss": 2.9114818572998047,
"eval_runtime": 119.604,
"eval_samples_per_second": 128.282,
"eval_steps_per_second": 4.013,
"step": 47000
}
],
"logging_steps": 50,
"max_steps": 47466,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7.85966432256e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}