HybridTimeScaleModel / last-checkpoint /trainer_state.json
CodeIsAbstract's picture
Training in progress, step 77000, checkpoint
ebc7090 verified
Raw
History Blame Contribute Delete
161 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.012987012987012988,
"eval_steps": 1000,
"global_step": 77000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0009090909090909091,
"grad_norm": 0.5637483596801758,
"learning_rate": 0.00066,
"loss": 7.38281005859375,
"step": 100
},
{
"epoch": 0.0018181818181818182,
"grad_norm": 0.6073591709136963,
"learning_rate": 0.000999999509056267,
"loss": 5.783165283203125,
"step": 200
},
{
"epoch": 0.0027272727272727275,
"grad_norm": 0.480266273021698,
"learning_rate": 0.0009999954604635122,
"loss": 5.232196044921875,
"step": 300
},
{
"epoch": 0.0036363636363636364,
"grad_norm": 0.45949065685272217,
"learning_rate": 0.0009999873224161853,
"loss": 4.946490478515625,
"step": 400
},
{
"epoch": 0.004545454545454545,
"grad_norm": 0.41542109847068787,
"learning_rate": 0.000999975094980847,
"loss": 4.719376831054688,
"step": 500
},
{
"epoch": 0.005454545454545455,
"grad_norm": 0.40697741508483887,
"learning_rate": 0.0009999587782575051,
"loss": 4.591694030761719,
"step": 600
},
{
"epoch": 0.006363636363636364,
"grad_norm": 0.3962944447994232,
"learning_rate": 0.0009999383723796143,
"loss": 4.466532592773437,
"step": 700
},
{
"epoch": 0.007272727272727273,
"grad_norm": 0.6857792139053345,
"learning_rate": 0.0009999138775140734,
"loss": 4.349520874023438,
"step": 800
},
{
"epoch": 0.008181818181818182,
"grad_norm": 0.4181463420391083,
"learning_rate": 0.000999885293861226,
"loss": 4.234326782226563,
"step": 900
},
{
"epoch": 0.00909090909090909,
"grad_norm": 0.3620698153972626,
"learning_rate": 0.0009998526216548572,
"loss": 4.120015869140625,
"step": 1000
},
{
"epoch": 0.00909090909090909,
"eval_loss": 4.375123977661133,
"eval_runtime": 6.9666,
"eval_samples_per_second": 82.681,
"eval_steps_per_second": 20.67,
"step": 1000
},
{
"epoch": 0.01,
"grad_norm": 0.3509594798088074,
"learning_rate": 0.0009998158611621922,
"loss": 3.993647155761719,
"step": 1100
},
{
"epoch": 0.01090909090909091,
"grad_norm": 0.3581515848636627,
"learning_rate": 0.0009997750126838946,
"loss": 3.9498220825195314,
"step": 1200
},
{
"epoch": 0.011818181818181818,
"grad_norm": 0.36733096837997437,
"learning_rate": 0.0009997300765540635,
"loss": 3.831287841796875,
"step": 1300
},
{
"epoch": 0.012727272727272728,
"grad_norm": 0.29147249460220337,
"learning_rate": 0.0009996810531402306,
"loss": 3.7590908813476562,
"step": 1400
},
{
"epoch": 0.013636363636363636,
"grad_norm": 0.29391637444496155,
"learning_rate": 0.0009996279428433578,
"loss": 3.722886047363281,
"step": 1500
},
{
"epoch": 0.014545454545454545,
"grad_norm": 0.3317511975765228,
"learning_rate": 0.000999570746097833,
"loss": 3.7012667846679688,
"step": 1600
},
{
"epoch": 0.015454545454545455,
"grad_norm": 0.32525742053985596,
"learning_rate": 0.0009995094633714677,
"loss": 3.6526870727539062,
"step": 1700
},
{
"epoch": 0.016363636363636365,
"grad_norm": 0.3586934208869934,
"learning_rate": 0.0009994440951654924,
"loss": 3.6262481689453123,
"step": 1800
},
{
"epoch": 0.017272727272727273,
"grad_norm": 0.30995482206344604,
"learning_rate": 0.0009993746420145523,
"loss": 3.594487609863281,
"step": 1900
},
{
"epoch": 0.01818181818181818,
"grad_norm": 0.3067973852157593,
"learning_rate": 0.0009993011044867038,
"loss": 3.5707028198242186,
"step": 2000
},
{
"epoch": 0.01818181818181818,
"eval_loss": 3.896928548812866,
"eval_runtime": 6.7872,
"eval_samples_per_second": 84.865,
"eval_steps_per_second": 21.216,
"step": 2000
},
{
"epoch": 0.019090909090909092,
"grad_norm": 0.2716964781284332,
"learning_rate": 0.000999223483183409,
"loss": 3.5685223388671874,
"step": 2100
},
{
"epoch": 0.02,
"grad_norm": 0.2595560550689697,
"learning_rate": 0.000999141778739531,
"loss": 3.533115234375,
"step": 2200
},
{
"epoch": 0.02090909090909091,
"grad_norm": 0.2871851325035095,
"learning_rate": 0.0009990559918233294,
"loss": 3.51209716796875,
"step": 2300
},
{
"epoch": 0.02181818181818182,
"grad_norm": 0.2916632890701294,
"learning_rate": 0.0009989661231364542,
"loss": 3.4977175903320314,
"step": 2400
},
{
"epoch": 0.022727272727272728,
"grad_norm": 0.2674938440322876,
"learning_rate": 0.0009988721734139395,
"loss": 3.4819268798828125,
"step": 2500
},
{
"epoch": 0.023636363636363636,
"grad_norm": 0.28354012966156006,
"learning_rate": 0.0009987741434241983,
"loss": 3.4985772705078126,
"step": 2600
},
{
"epoch": 0.024545454545454544,
"grad_norm": 0.250453919172287,
"learning_rate": 0.000998672033969017,
"loss": 3.4824765014648436,
"step": 2700
},
{
"epoch": 0.025454545454545455,
"grad_norm": 0.25479111075401306,
"learning_rate": 0.0009985658458835465,
"loss": 3.43513916015625,
"step": 2800
},
{
"epoch": 0.026363636363636363,
"grad_norm": 0.5312749743461609,
"learning_rate": 0.0009984555800362977,
"loss": 3.4338519287109377,
"step": 2900
},
{
"epoch": 0.02727272727272727,
"grad_norm": 0.24919964373111725,
"learning_rate": 0.0009983412373291332,
"loss": 3.394432373046875,
"step": 3000
},
{
"epoch": 0.02727272727272727,
"eval_loss": 3.7320191860198975,
"eval_runtime": 6.8112,
"eval_samples_per_second": 84.566,
"eval_steps_per_second": 21.142,
"step": 3000
},
{
"epoch": 0.028181818181818183,
"grad_norm": 0.2345028668642044,
"learning_rate": 0.0009982228186972597,
"loss": 3.3772811889648438,
"step": 3100
},
{
"epoch": 0.02909090909090909,
"grad_norm": 0.2587430775165558,
"learning_rate": 0.0009981003251092215,
"loss": 3.368675537109375,
"step": 3200
},
{
"epoch": 0.03,
"grad_norm": 0.25332900881767273,
"learning_rate": 0.0009979737575668917,
"loss": 3.3781060791015625,
"step": 3300
},
{
"epoch": 0.03090909090909091,
"grad_norm": 0.2273174375295639,
"learning_rate": 0.000997843117105464,
"loss": 3.328343505859375,
"step": 3400
},
{
"epoch": 0.031818181818181815,
"grad_norm": 0.2621140778064728,
"learning_rate": 0.0009977084047934448,
"loss": 3.3511767578125,
"step": 3500
},
{
"epoch": 0.03272727272727273,
"grad_norm": 0.22301150858402252,
"learning_rate": 0.0009975696217326435,
"loss": 3.3483154296875,
"step": 3600
},
{
"epoch": 0.03363636363636364,
"grad_norm": 0.22785483300685883,
"learning_rate": 0.0009974267690581644,
"loss": 3.351199951171875,
"step": 3700
},
{
"epoch": 0.034545454545454546,
"grad_norm": 0.24507705867290497,
"learning_rate": 0.0009972798479383977,
"loss": 3.311331787109375,
"step": 3800
},
{
"epoch": 0.035454545454545454,
"grad_norm": 0.22445634007453918,
"learning_rate": 0.0009971288595750083,
"loss": 3.2849237060546876,
"step": 3900
},
{
"epoch": 0.03636363636363636,
"grad_norm": 0.2134762406349182,
"learning_rate": 0.0009969738052029277,
"loss": 3.2534124755859377,
"step": 4000
},
{
"epoch": 0.03636363636363636,
"eval_loss": 3.6267645359039307,
"eval_runtime": 6.8001,
"eval_samples_per_second": 84.704,
"eval_steps_per_second": 21.176,
"step": 4000
},
{
"epoch": 0.03727272727272727,
"grad_norm": 0.2137739211320877,
"learning_rate": 0.000996814686090343,
"loss": 3.288787841796875,
"step": 4100
},
{
"epoch": 0.038181818181818185,
"grad_norm": 0.20396745204925537,
"learning_rate": 0.0009966515035386867,
"loss": 3.277693786621094,
"step": 4200
},
{
"epoch": 0.03909090909090909,
"grad_norm": 0.20048071444034576,
"learning_rate": 0.0009964842588826267,
"loss": 3.2614068603515625,
"step": 4300
},
{
"epoch": 0.04,
"grad_norm": 0.2545357346534729,
"learning_rate": 0.0009963129534900535,
"loss": 3.241942138671875,
"step": 4400
},
{
"epoch": 0.04090909090909091,
"grad_norm": 0.21150407195091248,
"learning_rate": 0.0009961375887620715,
"loss": 3.254181213378906,
"step": 4500
},
{
"epoch": 0.04181818181818182,
"grad_norm": 0.25913697481155396,
"learning_rate": 0.0009959581661329855,
"loss": 3.256631164550781,
"step": 4600
},
{
"epoch": 0.042727272727272725,
"grad_norm": 0.21662315726280212,
"learning_rate": 0.000995774687070291,
"loss": 3.246457214355469,
"step": 4700
},
{
"epoch": 0.04363636363636364,
"grad_norm": 0.21578437089920044,
"learning_rate": 0.0009955871530746593,
"loss": 3.2591009521484375,
"step": 4800
},
{
"epoch": 0.04454545454545455,
"grad_norm": 0.2277086228132248,
"learning_rate": 0.0009953955656799285,
"loss": 3.2139767456054686,
"step": 4900
},
{
"epoch": 0.045454545454545456,
"grad_norm": 0.21145710349082947,
"learning_rate": 0.0009951999264530885,
"loss": 3.217757263183594,
"step": 5000
},
{
"epoch": 0.045454545454545456,
"eval_loss": 3.559657573699951,
"eval_runtime": 6.8094,
"eval_samples_per_second": 84.589,
"eval_steps_per_second": 21.147,
"step": 5000
},
{
"epoch": 0.046363636363636364,
"grad_norm": 0.2059008628129959,
"learning_rate": 0.0009950002369942693,
"loss": 3.2310595703125,
"step": 5100
},
{
"epoch": 0.04727272727272727,
"grad_norm": 0.31273841857910156,
"learning_rate": 0.0009947964989367275,
"loss": 3.236092529296875,
"step": 5200
},
{
"epoch": 0.04818181818181818,
"grad_norm": 0.20427817106246948,
"learning_rate": 0.0009945887139468335,
"loss": 3.20990966796875,
"step": 5300
},
{
"epoch": 0.04909090909090909,
"grad_norm": 0.21813584864139557,
"learning_rate": 0.0009943768837240572,
"loss": 3.23782470703125,
"step": 5400
},
{
"epoch": 0.05,
"grad_norm": 0.21357640624046326,
"learning_rate": 0.0009941610100009546,
"loss": 3.2014178466796874,
"step": 5500
},
{
"epoch": 0.05090909090909091,
"grad_norm": 0.19788503646850586,
"learning_rate": 0.0009939410945431532,
"loss": 3.201743469238281,
"step": 5600
},
{
"epoch": 0.05181818181818182,
"grad_norm": 0.2109798789024353,
"learning_rate": 0.0009937171391493375,
"loss": 3.1780130004882814,
"step": 5700
},
{
"epoch": 0.05272727272727273,
"grad_norm": 0.1952320784330368,
"learning_rate": 0.0009934891456512356,
"loss": 3.1811758422851564,
"step": 5800
},
{
"epoch": 0.053636363636363635,
"grad_norm": 0.19197046756744385,
"learning_rate": 0.0009932571159136023,
"loss": 3.1767172241210937,
"step": 5900
},
{
"epoch": 0.05454545454545454,
"grad_norm": 0.20798423886299133,
"learning_rate": 0.0009930210518342049,
"loss": 3.1700228881835937,
"step": 6000
},
{
"epoch": 0.05454545454545454,
"eval_loss": 3.494601249694824,
"eval_runtime": 6.8416,
"eval_samples_per_second": 84.191,
"eval_steps_per_second": 21.048,
"step": 6000
},
{
"epoch": 0.05545454545454546,
"grad_norm": 0.18669773638248444,
"learning_rate": 0.0009927809553438077,
"loss": 3.1545779418945314,
"step": 6100
},
{
"epoch": 0.056363636363636366,
"grad_norm": 0.2077275514602661,
"learning_rate": 0.0009925368284061555,
"loss": 3.160372619628906,
"step": 6200
},
{
"epoch": 0.057272727272727274,
"grad_norm": 0.18006086349487305,
"learning_rate": 0.000992288673017959,
"loss": 3.1383782958984376,
"step": 6300
},
{
"epoch": 0.05818181818181818,
"grad_norm": 0.19835108518600464,
"learning_rate": 0.000992036491208877,
"loss": 3.15177001953125,
"step": 6400
},
{
"epoch": 0.05909090909090909,
"grad_norm": 0.19680027663707733,
"learning_rate": 0.0009917802850414998,
"loss": 3.16474365234375,
"step": 6500
},
{
"epoch": 0.06,
"grad_norm": 0.28204840421676636,
"learning_rate": 0.0009915200566113338,
"loss": 3.1483929443359373,
"step": 6600
},
{
"epoch": 0.060909090909090906,
"grad_norm": 0.18320120871067047,
"learning_rate": 0.000991255808046783,
"loss": 3.150434875488281,
"step": 6700
},
{
"epoch": 0.06181818181818182,
"grad_norm": 0.19188480079174042,
"learning_rate": 0.000990987541509132,
"loss": 3.118103332519531,
"step": 6800
},
{
"epoch": 0.06272727272727273,
"grad_norm": 0.1749107539653778,
"learning_rate": 0.0009907152591925282,
"loss": 3.1161154174804686,
"step": 6900
},
{
"epoch": 0.06363636363636363,
"grad_norm": 0.17627771198749542,
"learning_rate": 0.0009904389633239644,
"loss": 3.140033874511719,
"step": 7000
},
{
"epoch": 0.06363636363636363,
"eval_loss": 3.460543632507324,
"eval_runtime": 6.8262,
"eval_samples_per_second": 84.381,
"eval_steps_per_second": 21.095,
"step": 7000
},
{
"epoch": 0.06454545454545454,
"grad_norm": 0.19298093020915985,
"learning_rate": 0.0009901586561632597,
"loss": 3.1127783203125,
"step": 7100
},
{
"epoch": 0.06545454545454546,
"grad_norm": 0.2005312442779541,
"learning_rate": 0.0009898743400030417,
"loss": 3.131772155761719,
"step": 7200
},
{
"epoch": 0.06636363636363636,
"grad_norm": 0.20932316780090332,
"learning_rate": 0.0009895860171687276,
"loss": 3.1065127563476564,
"step": 7300
},
{
"epoch": 0.06727272727272728,
"grad_norm": 0.1870882213115692,
"learning_rate": 0.0009892936900185053,
"loss": 3.1155380249023437,
"step": 7400
},
{
"epoch": 0.06818181818181818,
"grad_norm": 0.18347717821598053,
"learning_rate": 0.0009889973609433136,
"loss": 3.094842529296875,
"step": 7500
},
{
"epoch": 0.06909090909090909,
"grad_norm": 0.20144793391227722,
"learning_rate": 0.000988697032366823,
"loss": 3.1140432739257813,
"step": 7600
},
{
"epoch": 0.07,
"grad_norm": 0.17255835235118866,
"learning_rate": 0.0009883927067454157,
"loss": 3.0936923217773438,
"step": 7700
},
{
"epoch": 0.07090909090909091,
"grad_norm": 0.19149735569953918,
"learning_rate": 0.0009880843865681666,
"loss": 3.0889437866210936,
"step": 7800
},
{
"epoch": 0.07181818181818182,
"grad_norm": 0.18358978629112244,
"learning_rate": 0.0009877720743568204,
"loss": 3.0625601196289063,
"step": 7900
},
{
"epoch": 0.07272727272727272,
"grad_norm": 0.16700264811515808,
"learning_rate": 0.0009874557726657744,
"loss": 3.0754776000976562,
"step": 8000
},
{
"epoch": 0.07272727272727272,
"eval_loss": 3.418283700942993,
"eval_runtime": 6.8139,
"eval_samples_per_second": 84.533,
"eval_steps_per_second": 21.133,
"step": 8000
},
{
"epoch": 0.07363636363636364,
"grad_norm": 0.18711890280246735,
"learning_rate": 0.0009871354840820543,
"loss": 3.0751129150390626,
"step": 8100
},
{
"epoch": 0.07454545454545454,
"grad_norm": 0.19081872701644897,
"learning_rate": 0.0009868112112252953,
"loss": 3.069129638671875,
"step": 8200
},
{
"epoch": 0.07545454545454545,
"grad_norm": 0.18380340933799744,
"learning_rate": 0.0009864829567477196,
"loss": 3.0967727661132813,
"step": 8300
},
{
"epoch": 0.07636363636363637,
"grad_norm": 0.1662234514951706,
"learning_rate": 0.0009861507233341154,
"loss": 3.0465274047851563,
"step": 8400
},
{
"epoch": 0.07727272727272727,
"grad_norm": 0.1769150197505951,
"learning_rate": 0.0009858145137018137,
"loss": 3.05833251953125,
"step": 8500
},
{
"epoch": 0.07818181818181819,
"grad_norm": 0.18805448710918427,
"learning_rate": 0.0009854743306006682,
"loss": 3.0252114868164064,
"step": 8600
},
{
"epoch": 0.07909090909090909,
"grad_norm": 0.18553867936134338,
"learning_rate": 0.0009851301768130304,
"loss": 3.0619546508789064,
"step": 8700
},
{
"epoch": 0.08,
"grad_norm": 0.18448372185230255,
"learning_rate": 0.0009847820551537288,
"loss": 3.076944580078125,
"step": 8800
},
{
"epoch": 0.0809090909090909,
"grad_norm": 0.18073825538158417,
"learning_rate": 0.0009844299684700442,
"loss": 3.04953857421875,
"step": 8900
},
{
"epoch": 0.08181818181818182,
"grad_norm": 0.18676605820655823,
"learning_rate": 0.000984073919641688,
"loss": 3.052662658691406,
"step": 9000
},
{
"epoch": 0.08181818181818182,
"eval_loss": 3.390735626220703,
"eval_runtime": 6.8573,
"eval_samples_per_second": 83.999,
"eval_steps_per_second": 21.0,
"step": 9000
},
{
"epoch": 0.08272727272727273,
"grad_norm": 0.1843118667602539,
"learning_rate": 0.0009837139115807777,
"loss": 3.0578955078125,
"step": 9100
},
{
"epoch": 0.08363636363636363,
"grad_norm": 0.1908266246318817,
"learning_rate": 0.0009833499472318129,
"loss": 3.0461907958984376,
"step": 9200
},
{
"epoch": 0.08454545454545455,
"grad_norm": 0.17415334284305573,
"learning_rate": 0.0009829820295716525,
"loss": 3.0242233276367188,
"step": 9300
},
{
"epoch": 0.08545454545454545,
"grad_norm": 0.161512091755867,
"learning_rate": 0.0009826101616094885,
"loss": 3.06851806640625,
"step": 9400
},
{
"epoch": 0.08636363636363636,
"grad_norm": 0.17435242235660553,
"learning_rate": 0.000982234346386823,
"loss": 3.04041015625,
"step": 9500
},
{
"epoch": 0.08727272727272728,
"grad_norm": 0.17635726928710938,
"learning_rate": 0.0009818545869774427,
"loss": 3.0322161865234376,
"step": 9600
},
{
"epoch": 0.08818181818181818,
"grad_norm": 0.19083574414253235,
"learning_rate": 0.000981470886487393,
"loss": 3.0362371826171874,
"step": 9700
},
{
"epoch": 0.0890909090909091,
"grad_norm": 0.1669977903366089,
"learning_rate": 0.000981083248054954,
"loss": 3.0415472412109374,
"step": 9800
},
{
"epoch": 0.09,
"grad_norm": 0.1624830961227417,
"learning_rate": 0.000980691674850614,
"loss": 3.03228271484375,
"step": 9900
},
{
"epoch": 0.09090909090909091,
"grad_norm": 0.20320835709571838,
"learning_rate": 0.000980296170077044,
"loss": 3.0213031005859374,
"step": 10000
},
{
"epoch": 0.09090909090909091,
"eval_loss": 3.3655972480773926,
"eval_runtime": 6.8194,
"eval_samples_per_second": 84.465,
"eval_steps_per_second": 21.116,
"step": 10000
},
{
"epoch": 0.09181818181818181,
"grad_norm": 0.1716221123933792,
"learning_rate": 0.000979896736969071,
"loss": 3.018829345703125,
"step": 10100
},
{
"epoch": 0.09272727272727273,
"grad_norm": 0.18420584499835968,
"learning_rate": 0.0009794933787936513,
"loss": 3.0364111328125,
"step": 10200
},
{
"epoch": 0.09363636363636364,
"grad_norm": 0.16853921115398407,
"learning_rate": 0.000979086098849845,
"loss": 2.9975177001953126,
"step": 10300
},
{
"epoch": 0.09454545454545454,
"grad_norm": 0.17749086022377014,
"learning_rate": 0.000978674900468788,
"loss": 3.025662536621094,
"step": 10400
},
{
"epoch": 0.09545454545454546,
"grad_norm": 0.17817527055740356,
"learning_rate": 0.0009782597870136652,
"loss": 3.0068899536132814,
"step": 10500
},
{
"epoch": 0.09636363636363636,
"grad_norm": 0.16383598744869232,
"learning_rate": 0.0009778407618796824,
"loss": 2.9598651123046875,
"step": 10600
},
{
"epoch": 0.09727272727272727,
"grad_norm": 0.18420074880123138,
"learning_rate": 0.0009774178284940392,
"loss": 2.9876394653320313,
"step": 10700
},
{
"epoch": 0.09818181818181818,
"grad_norm": 0.16747510433197021,
"learning_rate": 0.0009769909903159007,
"loss": 3.0132855224609374,
"step": 10800
},
{
"epoch": 0.09909090909090909,
"grad_norm": 0.15621648728847504,
"learning_rate": 0.0009765602508363697,
"loss": 3.0095565795898436,
"step": 10900
},
{
"epoch": 0.1,
"grad_norm": 0.1697891354560852,
"learning_rate": 0.0009761256135784568,
"loss": 3.0590411376953126,
"step": 11000
},
{
"epoch": 0.1,
"eval_loss": 3.3478543758392334,
"eval_runtime": 6.8379,
"eval_samples_per_second": 84.236,
"eval_steps_per_second": 21.059,
"step": 11000
},
{
"epoch": 0.1009090909090909,
"grad_norm": 0.15818284451961517,
"learning_rate": 0.0009756870820970532,
"loss": 3.015447692871094,
"step": 11100
},
{
"epoch": 0.10181818181818182,
"grad_norm": 0.16059984266757965,
"learning_rate": 0.0009752446599789003,
"loss": 2.9939862060546876,
"step": 11200
},
{
"epoch": 0.10272727272727272,
"grad_norm": 0.16179029643535614,
"learning_rate": 0.0009747983508425615,
"loss": 2.989024963378906,
"step": 11300
},
{
"epoch": 0.10363636363636364,
"grad_norm": 0.16419965028762817,
"learning_rate": 0.0009743481583383919,
"loss": 2.9855859375,
"step": 11400
},
{
"epoch": 0.10454545454545454,
"grad_norm": 0.17154866456985474,
"learning_rate": 0.0009738940861485082,
"loss": 2.9723300170898437,
"step": 11500
},
{
"epoch": 0.10545454545454545,
"grad_norm": 0.16613702476024628,
"learning_rate": 0.0009734361379867597,
"loss": 3.022707214355469,
"step": 11600
},
{
"epoch": 0.10636363636363637,
"grad_norm": 0.16711774468421936,
"learning_rate": 0.0009729743175986965,
"loss": 2.99096923828125,
"step": 11700
},
{
"epoch": 0.10727272727272727,
"grad_norm": 0.16586251556873322,
"learning_rate": 0.00097250862876154,
"loss": 2.977761535644531,
"step": 11800
},
{
"epoch": 0.10818181818181818,
"grad_norm": 0.1719771921634674,
"learning_rate": 0.0009720390752841515,
"loss": 2.97351318359375,
"step": 11900
},
{
"epoch": 0.10909090909090909,
"grad_norm": 0.17710699141025543,
"learning_rate": 0.000971565661007001,
"loss": 2.976995849609375,
"step": 12000
},
{
"epoch": 0.10909090909090909,
"eval_loss": 3.324172019958496,
"eval_runtime": 6.855,
"eval_samples_per_second": 84.026,
"eval_steps_per_second": 21.006,
"step": 12000
},
{
"epoch": 0.11,
"grad_norm": 0.16330398619174957,
"learning_rate": 0.0009710883898021361,
"loss": 2.98108154296875,
"step": 12100
},
{
"epoch": 0.11090909090909092,
"grad_norm": 0.16032378375530243,
"learning_rate": 0.0009706072655731501,
"loss": 2.975714111328125,
"step": 12200
},
{
"epoch": 0.11181818181818182,
"grad_norm": 0.15098635852336884,
"learning_rate": 0.00097012229225515,
"loss": 2.967715148925781,
"step": 12300
},
{
"epoch": 0.11272727272727273,
"grad_norm": 0.16129878163337708,
"learning_rate": 0.0009696334738147246,
"loss": 2.9537789916992185,
"step": 12400
},
{
"epoch": 0.11363636363636363,
"grad_norm": 0.1677810102701187,
"learning_rate": 0.0009691408142499116,
"loss": 2.9610797119140626,
"step": 12500
},
{
"epoch": 0.11454545454545455,
"grad_norm": 0.176312655210495,
"learning_rate": 0.0009686443175901656,
"loss": 3.0001925659179687,
"step": 12600
},
{
"epoch": 0.11545454545454545,
"grad_norm": 0.16458939015865326,
"learning_rate": 0.0009681439878963245,
"loss": 2.932486572265625,
"step": 12700
},
{
"epoch": 0.11636363636363636,
"grad_norm": 0.1687006801366806,
"learning_rate": 0.0009676398292605766,
"loss": 2.96806396484375,
"step": 12800
},
{
"epoch": 0.11727272727272728,
"grad_norm": 0.15523017942905426,
"learning_rate": 0.0009671318458064269,
"loss": 2.977980651855469,
"step": 12900
},
{
"epoch": 0.11818181818181818,
"grad_norm": 0.15686143934726715,
"learning_rate": 0.0009666200416886638,
"loss": 2.9614358520507813,
"step": 13000
},
{
"epoch": 0.11818181818181818,
"eval_loss": 3.310213565826416,
"eval_runtime": 6.7958,
"eval_samples_per_second": 84.758,
"eval_steps_per_second": 21.19,
"step": 13000
},
{
"epoch": 0.1190909090909091,
"grad_norm": 0.15569010376930237,
"learning_rate": 0.0009661044210933246,
"loss": 2.950162658691406,
"step": 13100
},
{
"epoch": 0.12,
"grad_norm": 0.15551169216632843,
"learning_rate": 0.0009655849882376615,
"loss": 2.9463400268554687,
"step": 13200
},
{
"epoch": 0.12090909090909091,
"grad_norm": 0.1576288491487503,
"learning_rate": 0.0009650617473701073,
"loss": 2.9366680908203127,
"step": 13300
},
{
"epoch": 0.12181818181818181,
"grad_norm": 0.16019435226917267,
"learning_rate": 0.0009645347027702405,
"loss": 2.9609390258789063,
"step": 13400
},
{
"epoch": 0.12272727272727273,
"grad_norm": 0.19406898319721222,
"learning_rate": 0.0009640038587487499,
"loss": 2.9381414794921876,
"step": 13500
},
{
"epoch": 0.12363636363636364,
"grad_norm": 0.14867821335792542,
"learning_rate": 0.0009634692196474001,
"loss": 2.943419189453125,
"step": 13600
},
{
"epoch": 0.12454545454545454,
"grad_norm": 0.14702503383159637,
"learning_rate": 0.0009629307898389953,
"loss": 2.923211669921875,
"step": 13700
},
{
"epoch": 0.12545454545454546,
"grad_norm": 0.19858944416046143,
"learning_rate": 0.0009623885737273442,
"loss": 2.9624624633789063,
"step": 13800
},
{
"epoch": 0.12636363636363637,
"grad_norm": 0.15279068052768707,
"learning_rate": 0.0009618425757472229,
"loss": 2.9194540405273437,
"step": 13900
},
{
"epoch": 0.12727272727272726,
"grad_norm": 0.16745012998580933,
"learning_rate": 0.0009612928003643404,
"loss": 2.950616760253906,
"step": 14000
},
{
"epoch": 0.12727272727272726,
"eval_loss": 3.294524669647217,
"eval_runtime": 6.7865,
"eval_samples_per_second": 84.874,
"eval_steps_per_second": 21.218,
"step": 14000
},
{
"epoch": 0.12818181818181817,
"grad_norm": 0.15464717149734497,
"learning_rate": 0.0009607392520753,
"loss": 2.936573791503906,
"step": 14100
},
{
"epoch": 0.1290909090909091,
"grad_norm": 0.17451342940330505,
"learning_rate": 0.0009601819354075643,
"loss": 2.9196566772460937,
"step": 14200
},
{
"epoch": 0.13,
"grad_norm": 0.15395045280456543,
"learning_rate": 0.0009596208549194167,
"loss": 2.9657086181640624,
"step": 14300
},
{
"epoch": 0.13090909090909092,
"grad_norm": 0.16990916430950165,
"learning_rate": 0.0009590560151999256,
"loss": 2.9283480834960938,
"step": 14400
},
{
"epoch": 0.1318181818181818,
"grad_norm": 0.14847813546657562,
"learning_rate": 0.0009584874208689055,
"loss": 2.9426678466796874,
"step": 14500
},
{
"epoch": 0.13272727272727272,
"grad_norm": 0.21499793231487274,
"learning_rate": 0.00095791507657688,
"loss": 2.9166836547851562,
"step": 14600
},
{
"epoch": 0.13363636363636364,
"grad_norm": 0.14092333614826202,
"learning_rate": 0.0009573389870050435,
"loss": 2.9289419555664065,
"step": 14700
},
{
"epoch": 0.13454545454545455,
"grad_norm": 0.15405072271823883,
"learning_rate": 0.0009567591568652231,
"loss": 2.9462161254882813,
"step": 14800
},
{
"epoch": 0.13545454545454547,
"grad_norm": 0.15389932692050934,
"learning_rate": 0.00095617559089984,
"loss": 2.9510357666015623,
"step": 14900
},
{
"epoch": 0.13636363636363635,
"grad_norm": 0.157777339220047,
"learning_rate": 0.0009555882938818703,
"loss": 2.9332815551757814,
"step": 15000
},
{
"epoch": 0.13636363636363635,
"eval_loss": 3.2715365886688232,
"eval_runtime": 6.8421,
"eval_samples_per_second": 84.184,
"eval_steps_per_second": 21.046,
"step": 15000
},
{
"epoch": 0.13727272727272727,
"grad_norm": 0.15498115122318268,
"learning_rate": 0.0009549972706148067,
"loss": 2.9289910888671873,
"step": 15100
},
{
"epoch": 0.13818181818181818,
"grad_norm": 0.17162440717220306,
"learning_rate": 0.0009544025259326188,
"loss": 2.9223281860351564,
"step": 15200
},
{
"epoch": 0.1390909090909091,
"grad_norm": 0.16399726271629333,
"learning_rate": 0.0009538040646997133,
"loss": 2.910879821777344,
"step": 15300
},
{
"epoch": 0.14,
"grad_norm": 0.20758388936519623,
"learning_rate": 0.0009532018918108949,
"loss": 2.9101876831054687,
"step": 15400
},
{
"epoch": 0.1409090909090909,
"grad_norm": 0.15389910340309143,
"learning_rate": 0.0009525960121913253,
"loss": 2.9736376953125,
"step": 15500
},
{
"epoch": 0.14181818181818182,
"grad_norm": 0.14939367771148682,
"learning_rate": 0.0009519864307964842,
"loss": 2.9354534912109376,
"step": 15600
},
{
"epoch": 0.14272727272727273,
"grad_norm": 0.18233561515808105,
"learning_rate": 0.0009513731526121277,
"loss": 2.9248681640625,
"step": 15700
},
{
"epoch": 0.14363636363636365,
"grad_norm": 0.16295863687992096,
"learning_rate": 0.0009507561826542477,
"loss": 2.92017578125,
"step": 15800
},
{
"epoch": 0.14454545454545453,
"grad_norm": 0.15371564030647278,
"learning_rate": 0.0009501355259690314,
"loss": 2.910662841796875,
"step": 15900
},
{
"epoch": 0.14545454545454545,
"grad_norm": 0.15596537292003632,
"learning_rate": 0.0009495111876328195,
"loss": 2.898775939941406,
"step": 16000
},
{
"epoch": 0.14545454545454545,
"eval_loss": 3.2674407958984375,
"eval_runtime": 6.8454,
"eval_samples_per_second": 84.143,
"eval_steps_per_second": 21.036,
"step": 16000
},
{
"epoch": 0.14636363636363636,
"grad_norm": 0.23435284197330475,
"learning_rate": 0.0009488831727520647,
"loss": 2.925650939941406,
"step": 16100
},
{
"epoch": 0.14727272727272728,
"grad_norm": 0.1385786384344101,
"learning_rate": 0.0009482514864632905,
"loss": 2.935544738769531,
"step": 16200
},
{
"epoch": 0.1481818181818182,
"grad_norm": 0.15425068140029907,
"learning_rate": 0.0009476161339330484,
"loss": 2.8958169555664064,
"step": 16300
},
{
"epoch": 0.14909090909090908,
"grad_norm": 0.16746921837329865,
"learning_rate": 0.0009469771203578765,
"loss": 2.886453857421875,
"step": 16400
},
{
"epoch": 0.15,
"grad_norm": 0.15813444554805756,
"learning_rate": 0.000946334450964256,
"loss": 2.8945297241210937,
"step": 16500
},
{
"epoch": 0.1509090909090909,
"grad_norm": 0.16391652822494507,
"learning_rate": 0.0009456881310085692,
"loss": 2.871600341796875,
"step": 16600
},
{
"epoch": 0.15181818181818182,
"grad_norm": 0.14185769855976105,
"learning_rate": 0.0009450381657770563,
"loss": 2.8975213623046874,
"step": 16700
},
{
"epoch": 0.15272727272727274,
"grad_norm": 0.16267341375350952,
"learning_rate": 0.0009443845605857722,
"loss": 2.894129333496094,
"step": 16800
},
{
"epoch": 0.15363636363636363,
"grad_norm": 0.15159358084201813,
"learning_rate": 0.0009437273207805428,
"loss": 2.9036929321289064,
"step": 16900
},
{
"epoch": 0.15454545454545454,
"grad_norm": 0.19526581466197968,
"learning_rate": 0.0009430664517369216,
"loss": 2.9116668701171875,
"step": 17000
},
{
"epoch": 0.15454545454545454,
"eval_loss": 3.2496325969696045,
"eval_runtime": 6.8339,
"eval_samples_per_second": 84.285,
"eval_steps_per_second": 21.071,
"step": 17000
},
{
"epoch": 0.15545454545454546,
"grad_norm": 0.1410096138715744,
"learning_rate": 0.0009424019588601458,
"loss": 2.879241943359375,
"step": 17100
},
{
"epoch": 0.15636363636363637,
"grad_norm": 0.1442963033914566,
"learning_rate": 0.0009417338475850911,
"loss": 2.892339172363281,
"step": 17200
},
{
"epoch": 0.1572727272727273,
"grad_norm": 0.16006037592887878,
"learning_rate": 0.000941062123376229,
"loss": 2.8745999145507812,
"step": 17300
},
{
"epoch": 0.15818181818181817,
"grad_norm": 0.15137411653995514,
"learning_rate": 0.0009403867917275805,
"loss": 2.9007733154296873,
"step": 17400
},
{
"epoch": 0.1590909090909091,
"grad_norm": 0.15556079149246216,
"learning_rate": 0.0009397078581626718,
"loss": 2.8890725708007814,
"step": 17500
},
{
"epoch": 0.16,
"grad_norm": 0.1370605081319809,
"learning_rate": 0.0009390253282344894,
"loss": 2.8879302978515624,
"step": 17600
},
{
"epoch": 0.16090909090909092,
"grad_norm": 0.15012328326702118,
"learning_rate": 0.0009383392075254342,
"loss": 2.870147399902344,
"step": 17700
},
{
"epoch": 0.1618181818181818,
"grad_norm": 0.15628907084465027,
"learning_rate": 0.0009376495016472762,
"loss": 2.899383239746094,
"step": 17800
},
{
"epoch": 0.16272727272727272,
"grad_norm": 0.172128364443779,
"learning_rate": 0.0009369562162411083,
"loss": 2.8812881469726563,
"step": 17900
},
{
"epoch": 0.16363636363636364,
"grad_norm": 0.15035715699195862,
"learning_rate": 0.0009362593569773001,
"loss": 2.893328857421875,
"step": 18000
},
{
"epoch": 0.16363636363636364,
"eval_loss": 3.241589069366455,
"eval_runtime": 6.7941,
"eval_samples_per_second": 84.779,
"eval_steps_per_second": 21.195,
"step": 18000
},
{
"epoch": 0.16454545454545455,
"grad_norm": 0.14139075577259064,
"learning_rate": 0.0009355589295554522,
"loss": 2.9356817626953124,
"step": 18100
},
{
"epoch": 0.16545454545454547,
"grad_norm": 0.22561536729335785,
"learning_rate": 0.0009348549397043489,
"loss": 2.8875466918945314,
"step": 18200
},
{
"epoch": 0.16636363636363635,
"grad_norm": 0.1523270159959793,
"learning_rate": 0.0009341473931819113,
"loss": 2.917890930175781,
"step": 18300
},
{
"epoch": 0.16727272727272727,
"grad_norm": 0.14544081687927246,
"learning_rate": 0.0009334362957751506,
"loss": 2.901419677734375,
"step": 18400
},
{
"epoch": 0.16818181818181818,
"grad_norm": 0.13483288884162903,
"learning_rate": 0.000932721653300121,
"loss": 2.9169821166992187,
"step": 18500
},
{
"epoch": 0.1690909090909091,
"grad_norm": 0.17061568796634674,
"learning_rate": 0.0009320034716018713,
"loss": 2.865706481933594,
"step": 18600
},
{
"epoch": 0.17,
"grad_norm": 0.15831294655799866,
"learning_rate": 0.0009312817565543976,
"loss": 2.9071807861328125,
"step": 18700
},
{
"epoch": 0.1709090909090909,
"grad_norm": 0.1500754952430725,
"learning_rate": 0.0009305565140605957,
"loss": 2.8990237426757814,
"step": 18800
},
{
"epoch": 0.17181818181818181,
"grad_norm": 0.16387759149074554,
"learning_rate": 0.0009298277500522112,
"loss": 2.884671325683594,
"step": 18900
},
{
"epoch": 0.17272727272727273,
"grad_norm": 0.13598468899726868,
"learning_rate": 0.0009290954704897934,
"loss": 2.886610412597656,
"step": 19000
},
{
"epoch": 0.17272727272727273,
"eval_loss": 3.222428560256958,
"eval_runtime": 6.8544,
"eval_samples_per_second": 84.034,
"eval_steps_per_second": 21.008,
"step": 19000
},
{
"epoch": 0.17363636363636364,
"grad_norm": 0.17809490859508514,
"learning_rate": 0.0009283596813626444,
"loss": 2.8785455322265623,
"step": 19100
},
{
"epoch": 0.17454545454545456,
"grad_norm": 0.15393967926502228,
"learning_rate": 0.0009276203886887714,
"loss": 2.9021951293945314,
"step": 19200
},
{
"epoch": 0.17545454545454545,
"grad_norm": 0.1531384289264679,
"learning_rate": 0.0009268775985148369,
"loss": 2.900225830078125,
"step": 19300
},
{
"epoch": 0.17636363636363636,
"grad_norm": 0.1720549464225769,
"learning_rate": 0.0009261313169161094,
"loss": 2.8924365234375,
"step": 19400
},
{
"epoch": 0.17727272727272728,
"grad_norm": 0.17175054550170898,
"learning_rate": 0.0009253815499964135,
"loss": 2.8840255737304688,
"step": 19500
},
{
"epoch": 0.1781818181818182,
"grad_norm": 0.1715477555990219,
"learning_rate": 0.0009246283038880809,
"loss": 2.8627389526367186,
"step": 19600
},
{
"epoch": 0.17909090909090908,
"grad_norm": 0.17474284768104553,
"learning_rate": 0.0009238715847518984,
"loss": 2.887270812988281,
"step": 19700
},
{
"epoch": 0.18,
"grad_norm": 0.15692177414894104,
"learning_rate": 0.0009231113987770599,
"loss": 2.890269775390625,
"step": 19800
},
{
"epoch": 0.1809090909090909,
"grad_norm": 0.15938249230384827,
"learning_rate": 0.0009223477521811132,
"loss": 2.9025338745117186,
"step": 19900
},
{
"epoch": 0.18181818181818182,
"grad_norm": 0.14352673292160034,
"learning_rate": 0.0009215806512099115,
"loss": 2.9029974365234374,
"step": 20000
},
{
"epoch": 0.18181818181818182,
"eval_loss": 3.218810558319092,
"eval_runtime": 6.8249,
"eval_samples_per_second": 84.397,
"eval_steps_per_second": 21.099,
"step": 20000
},
{
"epoch": 0.18272727272727274,
"grad_norm": 0.1414630264043808,
"learning_rate": 0.000920810102137561,
"loss": 2.8807022094726564,
"step": 20100
},
{
"epoch": 0.18363636363636363,
"grad_norm": 0.1559121161699295,
"learning_rate": 0.0009200361112663695,
"loss": 2.845583190917969,
"step": 20200
},
{
"epoch": 0.18454545454545454,
"grad_norm": 0.13616813719272614,
"learning_rate": 0.0009192586849267957,
"loss": 2.8783746337890626,
"step": 20300
},
{
"epoch": 0.18545454545454546,
"grad_norm": 0.15556134283542633,
"learning_rate": 0.0009184778294773968,
"loss": 2.84674072265625,
"step": 20400
},
{
"epoch": 0.18636363636363637,
"grad_norm": 0.1401907503604889,
"learning_rate": 0.0009176935513047762,
"loss": 2.8818963623046874,
"step": 20500
},
{
"epoch": 0.18727272727272729,
"grad_norm": 0.1431131362915039,
"learning_rate": 0.0009169058568235323,
"loss": 2.8781854248046876,
"step": 20600
},
{
"epoch": 0.18818181818181817,
"grad_norm": 0.17515692114830017,
"learning_rate": 0.0009161147524762053,
"loss": 2.85051025390625,
"step": 20700
},
{
"epoch": 0.1890909090909091,
"grad_norm": 0.1567743867635727,
"learning_rate": 0.0009153202447332243,
"loss": 2.8653643798828123,
"step": 20800
},
{
"epoch": 0.19,
"grad_norm": 0.14393377304077148,
"learning_rate": 0.000914522340092855,
"loss": 2.881787109375,
"step": 20900
},
{
"epoch": 0.19090909090909092,
"grad_norm": 0.1467711478471756,
"learning_rate": 0.0009137210450811462,
"loss": 2.9003524780273438,
"step": 21000
},
{
"epoch": 0.19090909090909092,
"eval_loss": 3.210813283920288,
"eval_runtime": 6.8446,
"eval_samples_per_second": 84.154,
"eval_steps_per_second": 21.038,
"step": 21000
},
{
"epoch": 0.1918181818181818,
"grad_norm": 0.14093157649040222,
"learning_rate": 0.0009129163662518766,
"loss": 2.834397277832031,
"step": 21100
},
{
"epoch": 0.19272727272727272,
"grad_norm": 0.14963804185390472,
"learning_rate": 0.000912108310186501,
"loss": 2.869900817871094,
"step": 21200
},
{
"epoch": 0.19363636363636363,
"grad_norm": 0.13998101651668549,
"learning_rate": 0.0009112968834940965,
"loss": 2.8689230346679686,
"step": 21300
},
{
"epoch": 0.19454545454545455,
"grad_norm": 0.13820187747478485,
"learning_rate": 0.0009104820928113083,
"loss": 2.840967102050781,
"step": 21400
},
{
"epoch": 0.19545454545454546,
"grad_norm": 0.1391438990831375,
"learning_rate": 0.0009096639448022963,
"loss": 2.839700927734375,
"step": 21500
},
{
"epoch": 0.19636363636363635,
"grad_norm": 0.15131688117980957,
"learning_rate": 0.0009088424461586793,
"loss": 2.8546661376953124,
"step": 21600
},
{
"epoch": 0.19727272727272727,
"grad_norm": 0.14853839576244354,
"learning_rate": 0.000908017603599481,
"loss": 2.8781912231445315,
"step": 21700
},
{
"epoch": 0.19818181818181818,
"grad_norm": 0.16618646681308746,
"learning_rate": 0.0009071894238710749,
"loss": 2.8425857543945314,
"step": 21800
},
{
"epoch": 0.1990909090909091,
"grad_norm": 0.13768044114112854,
"learning_rate": 0.0009063579137471296,
"loss": 2.8587716674804686,
"step": 21900
},
{
"epoch": 0.2,
"grad_norm": 0.1462126523256302,
"learning_rate": 0.0009055230800285523,
"loss": 2.854002685546875,
"step": 22000
},
{
"epoch": 0.2,
"eval_loss": 3.1955888271331787,
"eval_runtime": 6.8048,
"eval_samples_per_second": 84.646,
"eval_steps_per_second": 21.161,
"step": 22000
},
{
"epoch": 0.2009090909090909,
"grad_norm": 0.1481468826532364,
"learning_rate": 0.0009046849295434343,
"loss": 2.848748779296875,
"step": 22100
},
{
"epoch": 0.2018181818181818,
"grad_norm": 0.13478662073612213,
"learning_rate": 0.0009038434691469946,
"loss": 2.859345703125,
"step": 22200
},
{
"epoch": 0.20272727272727273,
"grad_norm": 0.1626402586698532,
"learning_rate": 0.0009029987057215234,
"loss": 2.879791259765625,
"step": 22300
},
{
"epoch": 0.20363636363636364,
"grad_norm": 0.1763114631175995,
"learning_rate": 0.0009021506461763272,
"loss": 2.8198529052734376,
"step": 22400
},
{
"epoch": 0.20454545454545456,
"grad_norm": 0.1592358946800232,
"learning_rate": 0.0009012992974476706,
"loss": 2.8292422485351563,
"step": 22500
},
{
"epoch": 0.20545454545454545,
"grad_norm": 0.16374371945858002,
"learning_rate": 0.0009004446664987209,
"loss": 2.839366149902344,
"step": 22600
},
{
"epoch": 0.20636363636363636,
"grad_norm": 0.16180269420146942,
"learning_rate": 0.0008995867603194905,
"loss": 2.824099426269531,
"step": 22700
},
{
"epoch": 0.20727272727272728,
"grad_norm": 0.1817290335893631,
"learning_rate": 0.0008987255859267796,
"loss": 2.852536926269531,
"step": 22800
},
{
"epoch": 0.2081818181818182,
"grad_norm": 0.1729678362607956,
"learning_rate": 0.0008978611503641194,
"loss": 2.87031005859375,
"step": 22900
},
{
"epoch": 0.20909090909090908,
"grad_norm": 0.13794034719467163,
"learning_rate": 0.000896993460701714,
"loss": 2.820664367675781,
"step": 23000
},
{
"epoch": 0.20909090909090908,
"eval_loss": 3.189971923828125,
"eval_runtime": 6.8545,
"eval_samples_per_second": 84.032,
"eval_steps_per_second": 21.008,
"step": 23000
},
{
"epoch": 0.21,
"grad_norm": 0.14675737917423248,
"learning_rate": 0.0008961225240363826,
"loss": 2.834775390625,
"step": 23100
},
{
"epoch": 0.2109090909090909,
"grad_norm": 0.14198128879070282,
"learning_rate": 0.0008952483474915021,
"loss": 2.8415087890625,
"step": 23200
},
{
"epoch": 0.21181818181818182,
"grad_norm": 0.15185648202896118,
"learning_rate": 0.0008943709382169476,
"loss": 2.8519711303710937,
"step": 23300
},
{
"epoch": 0.21272727272727274,
"grad_norm": 0.15163777768611908,
"learning_rate": 0.0008934903033890352,
"loss": 2.8500375366210937,
"step": 23400
},
{
"epoch": 0.21363636363636362,
"grad_norm": 0.15410897135734558,
"learning_rate": 0.0008926064502104623,
"loss": 2.8353033447265625,
"step": 23500
},
{
"epoch": 0.21454545454545454,
"grad_norm": 0.22796989977359772,
"learning_rate": 0.0008917193859102497,
"loss": 2.8228555297851563,
"step": 23600
},
{
"epoch": 0.21545454545454545,
"grad_norm": 0.1605440229177475,
"learning_rate": 0.0008908291177436813,
"loss": 2.8567230224609377,
"step": 23700
},
{
"epoch": 0.21636363636363637,
"grad_norm": 0.16412964463233948,
"learning_rate": 0.0008899356529922459,
"loss": 2.8504483032226564,
"step": 23800
},
{
"epoch": 0.21727272727272728,
"grad_norm": 0.13510747253894806,
"learning_rate": 0.0008890389989635767,
"loss": 2.87345458984375,
"step": 23900
},
{
"epoch": 0.21818181818181817,
"grad_norm": 0.14522412419319153,
"learning_rate": 0.0008881391629913921,
"loss": 2.827217712402344,
"step": 24000
},
{
"epoch": 0.21818181818181817,
"eval_loss": 3.1835873126983643,
"eval_runtime": 6.8315,
"eval_samples_per_second": 84.315,
"eval_steps_per_second": 21.079,
"step": 24000
},
{
"epoch": 0.2190909090909091,
"grad_norm": 0.15911774337291718,
"learning_rate": 0.0008872361524354357,
"loss": 2.8208258056640627,
"step": 24100
},
{
"epoch": 0.22,
"grad_norm": 0.14365383982658386,
"learning_rate": 0.0008863299746814158,
"loss": 2.82010986328125,
"step": 24200
},
{
"epoch": 0.22090909090909092,
"grad_norm": 0.16335056722164154,
"learning_rate": 0.0008854206371409452,
"loss": 2.863214416503906,
"step": 24300
},
{
"epoch": 0.22181818181818183,
"grad_norm": 0.15806064009666443,
"learning_rate": 0.0008845081472514806,
"loss": 2.8272698974609374,
"step": 24400
},
{
"epoch": 0.22272727272727272,
"grad_norm": 0.1631830632686615,
"learning_rate": 0.0008835925124762616,
"loss": 2.8286688232421877,
"step": 24500
},
{
"epoch": 0.22363636363636363,
"grad_norm": 0.142561137676239,
"learning_rate": 0.0008826737403042499,
"loss": 2.823035888671875,
"step": 24600
},
{
"epoch": 0.22454545454545455,
"grad_norm": 0.17523014545440674,
"learning_rate": 0.0008817518382500677,
"loss": 2.830491027832031,
"step": 24700
},
{
"epoch": 0.22545454545454546,
"grad_norm": 0.15598313510417938,
"learning_rate": 0.0008808268138539369,
"loss": 2.8227529907226563,
"step": 24800
},
{
"epoch": 0.22636363636363635,
"grad_norm": 0.1439158320426941,
"learning_rate": 0.0008798986746816162,
"loss": 2.8210317993164065,
"step": 24900
},
{
"epoch": 0.22727272727272727,
"grad_norm": 0.14227908849716187,
"learning_rate": 0.0008789674283243409,
"loss": 2.8191732788085937,
"step": 25000
},
{
"epoch": 0.22727272727272727,
"eval_loss": 3.1780831813812256,
"eval_runtime": 6.8053,
"eval_samples_per_second": 84.639,
"eval_steps_per_second": 21.16,
"step": 25000
},
{
"epoch": 0.22818181818181818,
"grad_norm": 0.15105608105659485,
"learning_rate": 0.0008780330823987592,
"loss": 2.8317742919921876,
"step": 25100
},
{
"epoch": 0.2290909090909091,
"grad_norm": 0.16510829329490662,
"learning_rate": 0.0008770956445468713,
"loss": 2.8396697998046876,
"step": 25200
},
{
"epoch": 0.23,
"grad_norm": 0.13736529648303986,
"learning_rate": 0.0008761551224359657,
"loss": 2.859419860839844,
"step": 25300
},
{
"epoch": 0.2309090909090909,
"grad_norm": 0.17783844470977783,
"learning_rate": 0.0008752115237585567,
"loss": 2.813878173828125,
"step": 25400
},
{
"epoch": 0.2318181818181818,
"grad_norm": 0.15228304266929626,
"learning_rate": 0.0008742648562323228,
"loss": 2.7972647094726564,
"step": 25500
},
{
"epoch": 0.23272727272727273,
"grad_norm": 0.17638841271400452,
"learning_rate": 0.0008733151276000417,
"loss": 2.84191650390625,
"step": 25600
},
{
"epoch": 0.23363636363636364,
"grad_norm": 0.15283086895942688,
"learning_rate": 0.0008723623456295282,
"loss": 2.8249298095703126,
"step": 25700
},
{
"epoch": 0.23454545454545456,
"grad_norm": 0.15044672787189484,
"learning_rate": 0.0008714065181135701,
"loss": 2.8220599365234373,
"step": 25800
},
{
"epoch": 0.23545454545454544,
"grad_norm": 0.149523064494133,
"learning_rate": 0.0008704476528698649,
"loss": 2.7989315795898437,
"step": 25900
},
{
"epoch": 0.23636363636363636,
"grad_norm": 0.15856775641441345,
"learning_rate": 0.0008694857577409556,
"loss": 2.7933050537109376,
"step": 26000
},
{
"epoch": 0.23636363636363636,
"eval_loss": 3.1705970764160156,
"eval_runtime": 6.8357,
"eval_samples_per_second": 84.264,
"eval_steps_per_second": 21.066,
"step": 26000
},
{
"epoch": 0.23727272727272727,
"grad_norm": 0.15482839941978455,
"learning_rate": 0.0008685208405941662,
"loss": 2.8198681640625,
"step": 26100
},
{
"epoch": 0.2381818181818182,
"grad_norm": 0.14043229818344116,
"learning_rate": 0.0008675529093215384,
"loss": 2.8507424926757814,
"step": 26200
},
{
"epoch": 0.2390909090909091,
"grad_norm": 0.13602057099342346,
"learning_rate": 0.0008665819718397658,
"loss": 2.841172180175781,
"step": 26300
},
{
"epoch": 0.24,
"grad_norm": 0.1507735699415207,
"learning_rate": 0.0008656080360901299,
"loss": 2.8332550048828127,
"step": 26400
},
{
"epoch": 0.2409090909090909,
"grad_norm": 0.14570394158363342,
"learning_rate": 0.0008646311100384352,
"loss": 2.815726013183594,
"step": 26500
},
{
"epoch": 0.24181818181818182,
"grad_norm": 0.15119144320487976,
"learning_rate": 0.0008636512016749436,
"loss": 2.7973052978515627,
"step": 26600
},
{
"epoch": 0.24272727272727274,
"grad_norm": 0.1478470116853714,
"learning_rate": 0.0008626683190143092,
"loss": 2.8057537841796876,
"step": 26700
},
{
"epoch": 0.24363636363636362,
"grad_norm": 0.17405441403388977,
"learning_rate": 0.0008616824700955132,
"loss": 2.8201614379882813,
"step": 26800
},
{
"epoch": 0.24454545454545454,
"grad_norm": 0.1828102022409439,
"learning_rate": 0.0008606936629817973,
"loss": 2.817716064453125,
"step": 26900
},
{
"epoch": 0.24545454545454545,
"grad_norm": 0.1402510702610016,
"learning_rate": 0.0008597019057605986,
"loss": 2.8126416015625,
"step": 27000
},
{
"epoch": 0.24545454545454545,
"eval_loss": 3.1654067039489746,
"eval_runtime": 6.8224,
"eval_samples_per_second": 84.428,
"eval_steps_per_second": 21.107,
"step": 27000
},
{
"epoch": 0.24636363636363637,
"grad_norm": 0.15282770991325378,
"learning_rate": 0.000858707206543483,
"loss": 2.814878234863281,
"step": 27100
},
{
"epoch": 0.24727272727272728,
"grad_norm": 0.1374608278274536,
"learning_rate": 0.0008577095734660788,
"loss": 2.8010260009765626,
"step": 27200
},
{
"epoch": 0.24818181818181817,
"grad_norm": 0.14548851549625397,
"learning_rate": 0.0008567090146880105,
"loss": 2.828005676269531,
"step": 27300
},
{
"epoch": 0.24909090909090909,
"grad_norm": 0.1567397266626358,
"learning_rate": 0.0008557055383928316,
"loss": 2.78892578125,
"step": 27400
},
{
"epoch": 0.25,
"grad_norm": 0.17172624170780182,
"learning_rate": 0.0008546991527879581,
"loss": 2.8362548828125,
"step": 27500
},
{
"epoch": 0.2509090909090909,
"grad_norm": 0.1834629327058792,
"learning_rate": 0.000853689866104601,
"loss": 2.799326171875,
"step": 27600
},
{
"epoch": 0.25181818181818183,
"grad_norm": 0.14964266121387482,
"learning_rate": 0.0008526776865976997,
"loss": 2.7806500244140624,
"step": 27700
},
{
"epoch": 0.25272727272727274,
"grad_norm": 0.1613718867301941,
"learning_rate": 0.0008516626225458535,
"loss": 2.8114141845703124,
"step": 27800
},
{
"epoch": 0.25363636363636366,
"grad_norm": 0.15746520459651947,
"learning_rate": 0.0008506446822512541,
"loss": 2.7960455322265627,
"step": 27900
},
{
"epoch": 0.2545454545454545,
"grad_norm": 0.14515548944473267,
"learning_rate": 0.0008496238740396188,
"loss": 2.848003234863281,
"step": 28000
},
{
"epoch": 0.2545454545454545,
"eval_loss": 3.1647140979766846,
"eval_runtime": 6.7942,
"eval_samples_per_second": 84.778,
"eval_steps_per_second": 21.195,
"step": 28000
},
{
"epoch": 0.25545454545454543,
"grad_norm": 0.1713736206293106,
"learning_rate": 0.0008486002062601203,
"loss": 2.8171258544921876,
"step": 28100
},
{
"epoch": 0.25636363636363635,
"grad_norm": 0.18038378655910492,
"learning_rate": 0.000847573687285321,
"loss": 2.8066680908203123,
"step": 28200
},
{
"epoch": 0.25727272727272726,
"grad_norm": 0.1601206362247467,
"learning_rate": 0.0008465443255111025,
"loss": 2.8091595458984373,
"step": 28300
},
{
"epoch": 0.2581818181818182,
"grad_norm": 0.15122343599796295,
"learning_rate": 0.0008455121293565974,
"loss": 2.8354150390625,
"step": 28400
},
{
"epoch": 0.2590909090909091,
"grad_norm": 0.1411023885011673,
"learning_rate": 0.000844477107264121,
"loss": 2.805926513671875,
"step": 28500
},
{
"epoch": 0.26,
"grad_norm": 0.1714688241481781,
"learning_rate": 0.0008434392676991018,
"loss": 2.774625244140625,
"step": 28600
},
{
"epoch": 0.2609090909090909,
"grad_norm": 0.14336396753787994,
"learning_rate": 0.0008423986191500126,
"loss": 2.806527099609375,
"step": 28700
},
{
"epoch": 0.26181818181818184,
"grad_norm": 0.14724823832511902,
"learning_rate": 0.0008413551701283003,
"loss": 2.7858685302734374,
"step": 28800
},
{
"epoch": 0.26272727272727275,
"grad_norm": 0.1667833775281906,
"learning_rate": 0.0008403089291683173,
"loss": 2.788014221191406,
"step": 28900
},
{
"epoch": 0.2636363636363636,
"grad_norm": 0.13815470039844513,
"learning_rate": 0.0008392599048272509,
"loss": 2.7937637329101563,
"step": 29000
},
{
"epoch": 0.2636363636363636,
"eval_loss": 3.1548070907592773,
"eval_runtime": 6.8019,
"eval_samples_per_second": 84.682,
"eval_steps_per_second": 21.171,
"step": 29000
},
{
"epoch": 0.26454545454545453,
"grad_norm": 0.1442345827817917,
"learning_rate": 0.0008382081056850541,
"loss": 2.77263671875,
"step": 29100
},
{
"epoch": 0.26545454545454544,
"grad_norm": 0.14780735969543457,
"learning_rate": 0.0008371535403443743,
"loss": 2.8082760620117186,
"step": 29200
},
{
"epoch": 0.26636363636363636,
"grad_norm": 0.13575103878974915,
"learning_rate": 0.000836096217430484,
"loss": 2.7685586547851564,
"step": 29300
},
{
"epoch": 0.2672727272727273,
"grad_norm": 0.131728395819664,
"learning_rate": 0.0008350361455912099,
"loss": 2.771170349121094,
"step": 29400
},
{
"epoch": 0.2681818181818182,
"grad_norm": 0.18209482729434967,
"learning_rate": 0.0008339733334968619,
"loss": 2.7749264526367186,
"step": 29500
},
{
"epoch": 0.2690909090909091,
"grad_norm": 0.14567936956882477,
"learning_rate": 0.0008329077898401624,
"loss": 2.8004241943359376,
"step": 29600
},
{
"epoch": 0.27,
"grad_norm": 0.1705045998096466,
"learning_rate": 0.0008318395233361753,
"loss": 2.8070437622070314,
"step": 29700
},
{
"epoch": 0.27090909090909093,
"grad_norm": 0.1700645238161087,
"learning_rate": 0.0008307685427222345,
"loss": 2.769403991699219,
"step": 29800
},
{
"epoch": 0.2718181818181818,
"grad_norm": 0.2213045209646225,
"learning_rate": 0.000829694856757873,
"loss": 2.75067138671875,
"step": 29900
},
{
"epoch": 0.2727272727272727,
"grad_norm": 0.1627679318189621,
"learning_rate": 0.0008286184742247502,
"loss": 2.782334899902344,
"step": 30000
},
{
"epoch": 0.2727272727272727,
"eval_loss": 3.1495797634124756,
"eval_runtime": 6.8699,
"eval_samples_per_second": 83.844,
"eval_steps_per_second": 20.961,
"step": 30000
},
{
"epoch": 0.2736363636363636,
"grad_norm": 0.1445474475622177,
"learning_rate": 0.0008275394039265813,
"loss": 2.80556396484375,
"step": 30100
},
{
"epoch": 0.27454545454545454,
"grad_norm": 0.14685708284378052,
"learning_rate": 0.0008264576546890639,
"loss": 2.776888732910156,
"step": 30200
},
{
"epoch": 0.27545454545454545,
"grad_norm": 0.1347658634185791,
"learning_rate": 0.0008253732353598072,
"loss": 2.7627569580078126,
"step": 30300
},
{
"epoch": 0.27636363636363637,
"grad_norm": 0.13901016116142273,
"learning_rate": 0.0008242861548082591,
"loss": 2.780741882324219,
"step": 30400
},
{
"epoch": 0.2772727272727273,
"grad_norm": 0.13585121929645538,
"learning_rate": 0.0008231964219256331,
"loss": 2.804005432128906,
"step": 30500
},
{
"epoch": 0.2781818181818182,
"grad_norm": 0.15015123784542084,
"learning_rate": 0.0008221040456248367,
"loss": 2.7642987060546873,
"step": 30600
},
{
"epoch": 0.2790909090909091,
"grad_norm": 0.13883176445960999,
"learning_rate": 0.0008210090348403973,
"loss": 2.79775146484375,
"step": 30700
},
{
"epoch": 0.28,
"grad_norm": 0.1524442732334137,
"learning_rate": 0.0008199113985283902,
"loss": 2.7866134643554688,
"step": 30800
},
{
"epoch": 0.2809090909090909,
"grad_norm": 0.14497579634189606,
"learning_rate": 0.0008188111456663641,
"loss": 2.770282897949219,
"step": 30900
},
{
"epoch": 0.2818181818181818,
"grad_norm": 0.1663127839565277,
"learning_rate": 0.0008177082852532691,
"loss": 2.7479037475585937,
"step": 31000
},
{
"epoch": 0.2818181818181818,
"eval_loss": 3.1455507278442383,
"eval_runtime": 6.8464,
"eval_samples_per_second": 84.131,
"eval_steps_per_second": 21.033,
"step": 31000
},
{
"epoch": 0.2827272727272727,
"grad_norm": 0.3059700131416321,
"learning_rate": 0.0008166028263093825,
"loss": 2.786407775878906,
"step": 31100
},
{
"epoch": 0.28363636363636363,
"grad_norm": 0.1757507622241974,
"learning_rate": 0.0008154947778762343,
"loss": 2.7669387817382813,
"step": 31200
},
{
"epoch": 0.28454545454545455,
"grad_norm": 0.1763867884874344,
"learning_rate": 0.0008143841490165344,
"loss": 2.763365478515625,
"step": 31300
},
{
"epoch": 0.28545454545454546,
"grad_norm": 0.1497093141078949,
"learning_rate": 0.0008132709488140977,
"loss": 2.7558905029296876,
"step": 31400
},
{
"epoch": 0.2863636363636364,
"grad_norm": 0.15906350314617157,
"learning_rate": 0.0008121551863737704,
"loss": 2.7421307373046875,
"step": 31500
},
{
"epoch": 0.2872727272727273,
"grad_norm": 0.14353445172309875,
"learning_rate": 0.0008110368708213548,
"loss": 2.7798092651367186,
"step": 31600
},
{
"epoch": 0.2881818181818182,
"grad_norm": 0.1670762598514557,
"learning_rate": 0.0008099160113035353,
"loss": 2.764653625488281,
"step": 31700
},
{
"epoch": 0.28909090909090907,
"grad_norm": 0.15554283559322357,
"learning_rate": 0.000808792616987803,
"loss": 2.76354736328125,
"step": 31800
},
{
"epoch": 0.29,
"grad_norm": 0.14061635732650757,
"learning_rate": 0.0008076666970623821,
"loss": 2.764184875488281,
"step": 31900
},
{
"epoch": 0.2909090909090909,
"grad_norm": 0.18086077272891998,
"learning_rate": 0.0008065382607361523,
"loss": 2.7778125,
"step": 32000
},
{
"epoch": 0.2909090909090909,
"eval_loss": 3.1462559700012207,
"eval_runtime": 6.8321,
"eval_samples_per_second": 84.308,
"eval_steps_per_second": 21.077,
"step": 32000
},
{
"epoch": 0.0009090909090909091,
"grad_norm": 0.22038772702217102,
"learning_rate": 0.0008054073172385756,
"loss": 2.794765625,
"step": 32100
},
{
"epoch": 0.0018181818181818182,
"grad_norm": 0.15077297389507294,
"learning_rate": 0.0008042738758196204,
"loss": 2.7949072265625,
"step": 32200
},
{
"epoch": 0.0027272727272727275,
"grad_norm": 0.1514005959033966,
"learning_rate": 0.0008031379457496854,
"loss": 2.8156253051757814,
"step": 32300
},
{
"epoch": 0.0036363636363636364,
"grad_norm": 0.13997957110404968,
"learning_rate": 0.0008019995363195234,
"loss": 2.8109649658203124,
"step": 32400
},
{
"epoch": 0.004545454545454545,
"grad_norm": 0.14847084879875183,
"learning_rate": 0.0008008586568401662,
"loss": 2.7742608642578124,
"step": 32500
},
{
"epoch": 0.005454545454545455,
"grad_norm": 0.13216467201709747,
"learning_rate": 0.0007997153166428485,
"loss": 2.7673321533203126,
"step": 32600
},
{
"epoch": 0.006363636363636364,
"grad_norm": 0.16374439001083374,
"learning_rate": 0.0007985695250789306,
"loss": 2.78884521484375,
"step": 32700
},
{
"epoch": 0.007272727272727273,
"grad_norm": 0.1394331306219101,
"learning_rate": 0.0007974212915198225,
"loss": 2.779542236328125,
"step": 32800
},
{
"epoch": 0.008181818181818182,
"grad_norm": 0.1565932035446167,
"learning_rate": 0.0007962706253569077,
"loss": 2.815880126953125,
"step": 32900
},
{
"epoch": 0.00909090909090909,
"grad_norm": 0.17284399271011353,
"learning_rate": 0.0007951175360014656,
"loss": 2.769788818359375,
"step": 33000
},
{
"epoch": 0.00909090909090909,
"eval_loss": 3.1402082443237305,
"eval_runtime": 7.4554,
"eval_samples_per_second": 77.259,
"eval_steps_per_second": 19.315,
"step": 33000
},
{
"epoch": 0.01,
"grad_norm": 0.15111324191093445,
"learning_rate": 0.0007939620328845948,
"loss": 2.7730609130859376,
"step": 33100
},
{
"epoch": 0.01090909090909091,
"grad_norm": 0.160688117146492,
"learning_rate": 0.0007928041254571361,
"loss": 2.787190246582031,
"step": 33200
},
{
"epoch": 0.011818181818181818,
"grad_norm": 0.17507240176200867,
"learning_rate": 0.0007916438231895952,
"loss": 2.766163330078125,
"step": 33300
},
{
"epoch": 0.012727272727272728,
"grad_norm": 0.15393611788749695,
"learning_rate": 0.0007904811355720652,
"loss": 2.7740924072265627,
"step": 33400
},
{
"epoch": 0.013636363636363636,
"grad_norm": 0.14618468284606934,
"learning_rate": 0.0007893160721141486,
"loss": 2.7595263671875,
"step": 33500
},
{
"epoch": 0.014545454545454545,
"grad_norm": 0.1701638251543045,
"learning_rate": 0.0007881486423448802,
"loss": 2.7771051025390623,
"step": 33600
},
{
"epoch": 0.015454545454545455,
"grad_norm": 0.15899600088596344,
"learning_rate": 0.0007869788558126487,
"loss": 2.754100646972656,
"step": 33700
},
{
"epoch": 0.016363636363636365,
"grad_norm": 0.14573192596435547,
"learning_rate": 0.0007858067220851188,
"loss": 2.7869033813476562,
"step": 33800
},
{
"epoch": 0.017272727272727273,
"grad_norm": 0.16796821355819702,
"learning_rate": 0.0007846322507491528,
"loss": 2.7748208618164063,
"step": 33900
},
{
"epoch": 0.01818181818181818,
"grad_norm": 0.1425439566373825,
"learning_rate": 0.000783455451410732,
"loss": 2.773130187988281,
"step": 34000
},
{
"epoch": 0.01818181818181818,
"eval_loss": 3.13128399848938,
"eval_runtime": 7.4414,
"eval_samples_per_second": 77.405,
"eval_steps_per_second": 19.351,
"step": 34000
},
{
"epoch": 0.019090909090909092,
"grad_norm": 0.15474802255630493,
"learning_rate": 0.000782276333694879,
"loss": 2.7699960327148436,
"step": 34100
},
{
"epoch": 0.02,
"grad_norm": 0.1559676229953766,
"learning_rate": 0.0007810949072455778,
"loss": 2.7731719970703126,
"step": 34200
},
{
"epoch": 0.02090909090909091,
"grad_norm": 0.1522807478904724,
"learning_rate": 0.0007799111817256959,
"loss": 2.7761361694335935,
"step": 34300
},
{
"epoch": 0.02181818181818182,
"grad_norm": 0.15091344714164734,
"learning_rate": 0.0007787251668169043,
"loss": 2.7527685546875,
"step": 34400
},
{
"epoch": 0.022727272727272728,
"grad_norm": 0.15074443817138672,
"learning_rate": 0.0007775368722195997,
"loss": 2.7675704956054688,
"step": 34500
},
{
"epoch": 0.023636363636363636,
"grad_norm": 0.1461259126663208,
"learning_rate": 0.0007763463076528237,
"loss": 2.76167236328125,
"step": 34600
},
{
"epoch": 0.024545454545454544,
"grad_norm": 0.15030233561992645,
"learning_rate": 0.0007751534828541842,
"loss": 2.7275946044921877,
"step": 34700
},
{
"epoch": 0.025454545454545455,
"grad_norm": 0.14424681663513184,
"learning_rate": 0.0007739584075797753,
"loss": 2.736708679199219,
"step": 34800
},
{
"epoch": 0.026363636363636363,
"grad_norm": 0.15576180815696716,
"learning_rate": 0.0007727610916040981,
"loss": 2.7289297485351565,
"step": 34900
},
{
"epoch": 0.02727272727272727,
"grad_norm": 0.1324995905160904,
"learning_rate": 0.0007715615447199798,
"loss": 2.7693435668945314,
"step": 35000
},
{
"epoch": 0.02727272727272727,
"eval_loss": 3.1262025833129883,
"eval_runtime": 7.4365,
"eval_samples_per_second": 77.456,
"eval_steps_per_second": 19.364,
"step": 35000
},
{
"epoch": 0.028181818181818183,
"grad_norm": 0.1613311767578125,
"learning_rate": 0.0007703597767384945,
"loss": 2.7539468383789063,
"step": 35100
},
{
"epoch": 0.02909090909090909,
"grad_norm": 0.16793298721313477,
"learning_rate": 0.0007691557974888825,
"loss": 2.7785479736328127,
"step": 35200
},
{
"epoch": 0.03,
"grad_norm": 0.14937831461429596,
"learning_rate": 0.0007679496168184705,
"loss": 2.7587347412109375,
"step": 35300
},
{
"epoch": 0.03090909090909091,
"grad_norm": 0.1619419902563095,
"learning_rate": 0.0007667412445925898,
"loss": 2.7732388305664064,
"step": 35400
},
{
"epoch": 0.031818181818181815,
"grad_norm": 0.15758360922336578,
"learning_rate": 0.000765530690694497,
"loss": 2.74038818359375,
"step": 35500
},
{
"epoch": 0.03272727272727273,
"grad_norm": 0.1523827463388443,
"learning_rate": 0.000764317965025292,
"loss": 2.7354312133789063,
"step": 35600
},
{
"epoch": 0.03363636363636364,
"grad_norm": 0.1685842126607895,
"learning_rate": 0.0007631030775038383,
"loss": 2.7525250244140627,
"step": 35700
},
{
"epoch": 0.034545454545454546,
"grad_norm": 0.1396898627281189,
"learning_rate": 0.0007618860380666808,
"loss": 2.737476501464844,
"step": 35800
},
{
"epoch": 0.035454545454545454,
"grad_norm": 0.15296360850334167,
"learning_rate": 0.0007606668566679644,
"loss": 2.747691955566406,
"step": 35900
},
{
"epoch": 0.03636363636363636,
"grad_norm": 0.1561899036169052,
"learning_rate": 0.0007594455432793539,
"loss": 2.7320767211914063,
"step": 36000
},
{
"epoch": 0.03636363636363636,
"eval_loss": 3.1245434284210205,
"eval_runtime": 7.4489,
"eval_samples_per_second": 77.327,
"eval_steps_per_second": 19.332,
"step": 36000
},
{
"epoch": 0.0009090909090909091,
"grad_norm": 0.20997287333011627,
"learning_rate": 0.0007582221078899511,
"loss": 2.71048828125,
"step": 36100
},
{
"epoch": 0.0018181818181818182,
"grad_norm": 0.1532030999660492,
"learning_rate": 0.0007569965605062139,
"loss": 2.7088739013671876,
"step": 36200
},
{
"epoch": 0.0027272727272727275,
"grad_norm": 0.14671523869037628,
"learning_rate": 0.000755768911151874,
"loss": 2.730252990722656,
"step": 36300
},
{
"epoch": 0.0036363636363636364,
"grad_norm": 0.1369636058807373,
"learning_rate": 0.0007545391698678547,
"loss": 2.7253591918945315,
"step": 36400
},
{
"epoch": 0.004545454545454545,
"grad_norm": 0.16328130662441254,
"learning_rate": 0.00075330734671219,
"loss": 2.6905337524414064,
"step": 36500
},
{
"epoch": 0.005454545454545455,
"grad_norm": 0.13856680691242218,
"learning_rate": 0.0007520734517599409,
"loss": 2.6842236328125,
"step": 36600
},
{
"epoch": 0.006363636363636364,
"grad_norm": 0.14775875210762024,
"learning_rate": 0.0007508374951031139,
"loss": 2.7059420776367187,
"step": 36700
},
{
"epoch": 0.007272727272727273,
"grad_norm": 0.14245547354221344,
"learning_rate": 0.0007495994868505774,
"loss": 2.6968829345703127,
"step": 36800
},
{
"epoch": 0.008181818181818182,
"grad_norm": 0.15311609208583832,
"learning_rate": 0.000748359437127981,
"loss": 2.7318048095703125,
"step": 36900
},
{
"epoch": 0.00909090909090909,
"grad_norm": 0.1730499267578125,
"learning_rate": 0.0007471173560776705,
"loss": 2.6874020385742186,
"step": 37000
},
{
"epoch": 0.00909090909090909,
"eval_loss": 3.13167405128479,
"eval_runtime": 7.5047,
"eval_samples_per_second": 76.752,
"eval_steps_per_second": 19.188,
"step": 37000
},
{
"epoch": 0.01,
"grad_norm": 0.15705707669258118,
"learning_rate": 0.0007458732538586064,
"loss": 2.692235107421875,
"step": 37100
},
{
"epoch": 0.01090909090909091,
"grad_norm": 0.1563568264245987,
"learning_rate": 0.0007446271406462797,
"loss": 2.706945495605469,
"step": 37200
},
{
"epoch": 0.011818181818181818,
"grad_norm": 0.16822531819343567,
"learning_rate": 0.00074337902663263,
"loss": 2.685476989746094,
"step": 37300
},
{
"epoch": 0.012727272727272728,
"grad_norm": 0.14851588010787964,
"learning_rate": 0.000742128922025961,
"loss": 2.692755126953125,
"step": 37400
},
{
"epoch": 0.013636363636363636,
"grad_norm": 0.1650208979845047,
"learning_rate": 0.0007408768370508576,
"loss": 2.68127197265625,
"step": 37500
},
{
"epoch": 0.014545454545454545,
"grad_norm": 0.1679512858390808,
"learning_rate": 0.0007396227819481021,
"loss": 2.697837219238281,
"step": 37600
},
{
"epoch": 0.015454545454545455,
"grad_norm": 0.1745394617319107,
"learning_rate": 0.00073836676697459,
"loss": 2.6750924682617185,
"step": 37700
},
{
"epoch": 0.016363636363636365,
"grad_norm": 0.14067143201828003,
"learning_rate": 0.0007371088024032475,
"loss": 2.7095330810546874,
"step": 37800
},
{
"epoch": 0.017272727272727273,
"grad_norm": 0.16379132866859436,
"learning_rate": 0.0007358488985229455,
"loss": 2.6968374633789063,
"step": 37900
},
{
"epoch": 0.01818181818181818,
"grad_norm": 0.15668943524360657,
"learning_rate": 0.000734587065638417,
"loss": 2.697041320800781,
"step": 38000
},
{
"epoch": 0.01818181818181818,
"eval_loss": 3.128469467163086,
"eval_runtime": 7.47,
"eval_samples_per_second": 77.109,
"eval_steps_per_second": 19.277,
"step": 38000
},
{
"epoch": 0.019090909090909092,
"grad_norm": 0.1642797887325287,
"learning_rate": 0.0007333233140701722,
"loss": 2.6924237060546874,
"step": 38100
},
{
"epoch": 0.02,
"grad_norm": 0.16816826164722443,
"learning_rate": 0.0007320576541544144,
"loss": 2.69775634765625,
"step": 38200
},
{
"epoch": 0.02090909090909091,
"grad_norm": 0.1469792127609253,
"learning_rate": 0.000730790096242955,
"loss": 2.6987783813476565,
"step": 38300
},
{
"epoch": 0.02181818181818182,
"grad_norm": 0.15169106423854828,
"learning_rate": 0.0007295206507031289,
"loss": 2.6766021728515623,
"step": 38400
},
{
"epoch": 0.022727272727272728,
"grad_norm": 0.14681929349899292,
"learning_rate": 0.0007282493279177103,
"loss": 2.691963806152344,
"step": 38500
},
{
"epoch": 0.023636363636363636,
"grad_norm": 0.1452484130859375,
"learning_rate": 0.000726976138284827,
"loss": 2.6880203247070313,
"step": 38600
},
{
"epoch": 0.024545454545454544,
"grad_norm": 0.15825141966342926,
"learning_rate": 0.0007257010922178762,
"loss": 2.65422119140625,
"step": 38700
},
{
"epoch": 0.025454545454545455,
"grad_norm": 0.15018871426582336,
"learning_rate": 0.000724424200145438,
"loss": 2.663526611328125,
"step": 38800
},
{
"epoch": 0.026363636363636363,
"grad_norm": 0.16328509151935577,
"learning_rate": 0.0007231454725111919,
"loss": 2.6569583129882814,
"step": 38900
},
{
"epoch": 0.02727272727272727,
"grad_norm": 0.14703254401683807,
"learning_rate": 0.0007218649197738298,
"loss": 2.69577392578125,
"step": 39000
},
{
"epoch": 0.02727272727272727,
"eval_loss": 3.1291093826293945,
"eval_runtime": 7.4103,
"eval_samples_per_second": 77.729,
"eval_steps_per_second": 19.432,
"step": 39000
},
{
"epoch": 0.028181818181818183,
"grad_norm": 0.1588928997516632,
"learning_rate": 0.0007205825524069714,
"loss": 2.6820574951171876,
"step": 39100
},
{
"epoch": 0.02909090909090909,
"grad_norm": 0.18345706164836884,
"learning_rate": 0.0007192983808990781,
"loss": 2.7058285522460936,
"step": 39200
},
{
"epoch": 0.03,
"grad_norm": 0.1431887000799179,
"learning_rate": 0.0007180124157533671,
"loss": 2.6863577270507815,
"step": 39300
},
{
"epoch": 0.03090909090909091,
"grad_norm": 0.15360857546329498,
"learning_rate": 0.0007167246674877264,
"loss": 2.6997265625,
"step": 39400
},
{
"epoch": 0.031818181818181815,
"grad_norm": 0.15961426496505737,
"learning_rate": 0.0007154351466346273,
"loss": 2.66740966796875,
"step": 39500
},
{
"epoch": 0.03272727272727273,
"grad_norm": 0.15588298439979553,
"learning_rate": 0.0007141438637410398,
"loss": 2.6652230834960937,
"step": 39600
},
{
"epoch": 0.03363636363636364,
"grad_norm": 0.1670597940683365,
"learning_rate": 0.000712850829368345,
"loss": 2.681721496582031,
"step": 39700
},
{
"epoch": 0.034545454545454546,
"grad_norm": 0.15003304183483124,
"learning_rate": 0.0007115560540922497,
"loss": 2.6677728271484376,
"step": 39800
},
{
"epoch": 0.035454545454545454,
"grad_norm": 0.1557546705007553,
"learning_rate": 0.0007102595485026993,
"loss": 2.6783493041992186,
"step": 39900
},
{
"epoch": 0.03636363636363636,
"grad_norm": 0.1732822060585022,
"learning_rate": 0.0007089613232037915,
"loss": 2.6648553466796874,
"step": 40000
},
{
"epoch": 0.03636363636363636,
"eval_loss": 3.129150867462158,
"eval_runtime": 7.5094,
"eval_samples_per_second": 76.703,
"eval_steps_per_second": 19.176,
"step": 40000
},
{
"epoch": 0.03727272727272727,
"grad_norm": 0.15226680040359497,
"learning_rate": 0.0007076613888136895,
"loss": 2.7523992919921874,
"step": 40100
},
{
"epoch": 0.038181818181818185,
"grad_norm": 0.16509854793548584,
"learning_rate": 0.0007063597559645352,
"loss": 2.7390933227539063,
"step": 40200
},
{
"epoch": 0.03909090909090909,
"grad_norm": 0.1810932159423828,
"learning_rate": 0.0007050564353023619,
"loss": 2.7575619506835936,
"step": 40300
},
{
"epoch": 0.04,
"grad_norm": 0.14917488396167755,
"learning_rate": 0.0007037514374870077,
"loss": 2.700941162109375,
"step": 40400
},
{
"epoch": 0.04090909090909091,
"grad_norm": 0.1438620686531067,
"learning_rate": 0.0007024447731920284,
"loss": 2.7219302368164064,
"step": 40500
},
{
"epoch": 0.04181818181818182,
"grad_norm": 0.1588471382856369,
"learning_rate": 0.000701136453104609,
"loss": 2.7354092407226562,
"step": 40600
},
{
"epoch": 0.042727272727272725,
"grad_norm": 0.18232181668281555,
"learning_rate": 0.0006998264879254782,
"loss": 2.7257977294921876,
"step": 40700
},
{
"epoch": 0.04363636363636364,
"grad_norm": 0.15463081002235413,
"learning_rate": 0.0006985148883688194,
"loss": 2.7430325317382813,
"step": 40800
},
{
"epoch": 0.04454545454545455,
"grad_norm": 0.16292454302310944,
"learning_rate": 0.0006972016651621834,
"loss": 2.725971374511719,
"step": 40900
},
{
"epoch": 0.045454545454545456,
"grad_norm": 0.14817778766155243,
"learning_rate": 0.0006958868290464014,
"loss": 2.7598446655273436,
"step": 41000
},
{
"epoch": 0.045454545454545456,
"eval_loss": 3.1211743354797363,
"eval_runtime": 7.424,
"eval_samples_per_second": 77.586,
"eval_steps_per_second": 19.396,
"step": 41000
},
{
"epoch": 0.046363636363636364,
"grad_norm": 0.1458057463169098,
"learning_rate": 0.0006945703907754957,
"loss": 2.7241558837890625,
"step": 41100
},
{
"epoch": 0.04727272727272727,
"grad_norm": 0.1644594669342041,
"learning_rate": 0.0006932523611165934,
"loss": 2.737247314453125,
"step": 41200
},
{
"epoch": 0.04818181818181818,
"grad_norm": 0.1583612859249115,
"learning_rate": 0.000691932750849837,
"loss": 2.7208633422851562,
"step": 41300
},
{
"epoch": 0.04909090909090909,
"grad_norm": 0.15082280337810516,
"learning_rate": 0.000690611570768297,
"loss": 2.7353948974609374,
"step": 41400
},
{
"epoch": 0.05,
"grad_norm": 0.16890287399291992,
"learning_rate": 0.0006892888316778836,
"loss": 2.7053826904296874,
"step": 41500
},
{
"epoch": 0.05090909090909091,
"grad_norm": 0.15229052305221558,
"learning_rate": 0.0006879645443972575,
"loss": 2.6989901733398436,
"step": 41600
},
{
"epoch": 0.05181818181818182,
"grad_norm": 0.15202166140079498,
"learning_rate": 0.0006866387197577427,
"loss": 2.7251095581054687,
"step": 41700
},
{
"epoch": 0.05272727272727273,
"grad_norm": 0.1463591307401657,
"learning_rate": 0.0006853113686032368,
"loss": 2.7278387451171877,
"step": 41800
},
{
"epoch": 0.053636363636363635,
"grad_norm": 0.14916226267814636,
"learning_rate": 0.0006839825017901229,
"loss": 2.71453369140625,
"step": 41900
},
{
"epoch": 0.05454545454545454,
"grad_norm": 0.15262916684150696,
"learning_rate": 0.0006826521301871804,
"loss": 2.712431640625,
"step": 42000
},
{
"epoch": 0.05454545454545454,
"eval_loss": 3.1164402961730957,
"eval_runtime": 7.416,
"eval_samples_per_second": 77.67,
"eval_steps_per_second": 19.418,
"step": 42000
},
{
"epoch": 0.05545454545454546,
"grad_norm": 0.14367501437664032,
"learning_rate": 0.0006813202646754969,
"loss": 2.770457458496094,
"step": 42100
},
{
"epoch": 0.056363636363636366,
"grad_norm": 0.16685152053833008,
"learning_rate": 0.000679986916148378,
"loss": 2.7458120727539064,
"step": 42200
},
{
"epoch": 0.057272727272727274,
"grad_norm": 0.1416223794221878,
"learning_rate": 0.0006786520955112592,
"loss": 2.737471923828125,
"step": 42300
},
{
"epoch": 0.05818181818181818,
"grad_norm": 0.19099284708499908,
"learning_rate": 0.0006773158136816167,
"loss": 2.7410955810546875,
"step": 42400
},
{
"epoch": 0.05909090909090909,
"grad_norm": 0.14040355384349823,
"learning_rate": 0.0006759780815888771,
"loss": 2.7524224853515626,
"step": 42500
},
{
"epoch": 0.06,
"grad_norm": 0.14514034986495972,
"learning_rate": 0.0006746389101743291,
"loss": 2.7450900268554688,
"step": 42600
},
{
"epoch": 0.060909090909090906,
"grad_norm": 0.1578412503004074,
"learning_rate": 0.0006732983103910333,
"loss": 2.7615512084960936,
"step": 42700
},
{
"epoch": 0.06181818181818182,
"grad_norm": 0.18139956891536713,
"learning_rate": 0.0006719562932037332,
"loss": 2.709564514160156,
"step": 42800
},
{
"epoch": 0.06272727272727273,
"grad_norm": 0.15958115458488464,
"learning_rate": 0.000670612869588765,
"loss": 2.7086691284179687,
"step": 42900
},
{
"epoch": 0.06363636363636363,
"grad_norm": 0.18487316370010376,
"learning_rate": 0.0006692680505339684,
"loss": 2.7571722412109376,
"step": 43000
},
{
"epoch": 0.06363636363636363,
"eval_loss": 3.1164326667785645,
"eval_runtime": 7.4455,
"eval_samples_per_second": 77.362,
"eval_steps_per_second": 19.34,
"step": 43000
},
{
"epoch": 0.06454545454545454,
"grad_norm": 0.14378763735294342,
"learning_rate": 0.0006679218470385959,
"loss": 2.713703308105469,
"step": 43100
},
{
"epoch": 0.06545454545454546,
"grad_norm": 0.14831411838531494,
"learning_rate": 0.0006665742701132233,
"loss": 2.7057376098632813,
"step": 43200
},
{
"epoch": 0.06636363636363636,
"grad_norm": 0.14014075696468353,
"learning_rate": 0.0006652253307796605,
"loss": 2.732189025878906,
"step": 43300
},
{
"epoch": 0.06727272727272728,
"grad_norm": 0.1462206244468689,
"learning_rate": 0.0006638750400708597,
"loss": 2.735457763671875,
"step": 43400
},
{
"epoch": 0.06818181818181818,
"grad_norm": 0.15208710730075836,
"learning_rate": 0.0006625234090308261,
"loss": 2.7204766845703126,
"step": 43500
},
{
"epoch": 0.06909090909090909,
"grad_norm": 0.17330685257911682,
"learning_rate": 0.0006611704487145273,
"loss": 2.7174346923828123,
"step": 43600
},
{
"epoch": 0.07,
"grad_norm": 0.14701761305332184,
"learning_rate": 0.000659816170187804,
"loss": 2.7171310424804687,
"step": 43700
},
{
"epoch": 0.07090909090909091,
"grad_norm": 0.15500852465629578,
"learning_rate": 0.0006584605845272769,
"loss": 2.7264663696289064,
"step": 43800
},
{
"epoch": 0.07181818181818182,
"grad_norm": 0.173856720328331,
"learning_rate": 0.0006571037028202593,
"loss": 2.7247988891601564,
"step": 43900
},
{
"epoch": 0.07272727272727272,
"grad_norm": 0.152163565158844,
"learning_rate": 0.0006557455361646638,
"loss": 2.7246688842773437,
"step": 44000
},
{
"epoch": 0.07272727272727272,
"eval_loss": 3.1064937114715576,
"eval_runtime": 7.4422,
"eval_samples_per_second": 77.396,
"eval_steps_per_second": 19.349,
"step": 44000
},
{
"epoch": 0.07363636363636364,
"grad_norm": 0.14658956229686737,
"learning_rate": 0.0006543860956689131,
"loss": 2.7102786254882814,
"step": 44100
},
{
"epoch": 0.07454545454545454,
"grad_norm": 0.1424274891614914,
"learning_rate": 0.0006530253924518484,
"loss": 2.682833557128906,
"step": 44200
},
{
"epoch": 0.07545454545454545,
"grad_norm": 0.1558665931224823,
"learning_rate": 0.0006516634376426387,
"loss": 2.7235848999023435,
"step": 44300
},
{
"epoch": 0.07636363636363637,
"grad_norm": 0.1660631000995636,
"learning_rate": 0.0006503002423806897,
"loss": 2.6941436767578124,
"step": 44400
},
{
"epoch": 0.07727272727272727,
"grad_norm": 0.15640541911125183,
"learning_rate": 0.0006489358178155531,
"loss": 2.7176858520507814,
"step": 44500
},
{
"epoch": 0.07818181818181819,
"grad_norm": 0.1507701575756073,
"learning_rate": 0.0006475701751068345,
"loss": 2.72189697265625,
"step": 44600
},
{
"epoch": 0.07909090909090909,
"grad_norm": 0.1533944010734558,
"learning_rate": 0.000646203325424103,
"loss": 2.6939328002929686,
"step": 44700
},
{
"epoch": 0.08,
"grad_norm": 0.13101057708263397,
"learning_rate": 0.0006448352799467994,
"loss": 2.743724365234375,
"step": 44800
},
{
"epoch": 0.0809090909090909,
"grad_norm": 0.15205194056034088,
"learning_rate": 0.0006434660498641453,
"loss": 2.6808477783203126,
"step": 44900
},
{
"epoch": 0.08181818181818182,
"grad_norm": 0.16786165535449982,
"learning_rate": 0.0006420956463750505,
"loss": 2.7101092529296875,
"step": 45000
},
{
"epoch": 0.08181818181818182,
"eval_loss": 3.100367307662964,
"eval_runtime": 7.4121,
"eval_samples_per_second": 77.711,
"eval_steps_per_second": 19.428,
"step": 45000
},
{
"epoch": 0.08272727272727273,
"grad_norm": 0.1478699892759323,
"learning_rate": 0.0006407240806880225,
"loss": 2.717208251953125,
"step": 45100
},
{
"epoch": 0.08363636363636363,
"grad_norm": 0.1527082324028015,
"learning_rate": 0.0006393513640210743,
"loss": 2.7066421508789062,
"step": 45200
},
{
"epoch": 0.08454545454545455,
"grad_norm": 0.16474194824695587,
"learning_rate": 0.0006379775076016327,
"loss": 2.6989260864257814,
"step": 45300
},
{
"epoch": 0.08545454545454545,
"grad_norm": 0.17212653160095215,
"learning_rate": 0.0006366025226664465,
"loss": 2.72157958984375,
"step": 45400
},
{
"epoch": 0.08636363636363636,
"grad_norm": 0.1925841122865677,
"learning_rate": 0.0006352264204614946,
"loss": 2.7147427368164063,
"step": 45500
},
{
"epoch": 0.08727272727272728,
"grad_norm": 0.19100086390972137,
"learning_rate": 0.0006338492122418944,
"loss": 2.6837368774414063,
"step": 45600
},
{
"epoch": 0.08818181818181818,
"grad_norm": 0.15223105251789093,
"learning_rate": 0.0006324709092718088,
"loss": 2.6951806640625,
"step": 45700
},
{
"epoch": 0.0890909090909091,
"grad_norm": 0.16720791161060333,
"learning_rate": 0.000631091522824355,
"loss": 2.6881533813476564,
"step": 45800
},
{
"epoch": 0.09,
"grad_norm": 0.28359341621398926,
"learning_rate": 0.0006297110641815118,
"loss": 2.695024108886719,
"step": 45900
},
{
"epoch": 0.09090909090909091,
"grad_norm": 0.16058634221553802,
"learning_rate": 0.0006283295446340276,
"loss": 2.694168701171875,
"step": 46000
},
{
"epoch": 0.09090909090909091,
"eval_loss": 3.092599630355835,
"eval_runtime": 7.4402,
"eval_samples_per_second": 77.417,
"eval_steps_per_second": 19.354,
"step": 46000
},
{
"epoch": 0.09181818181818181,
"grad_norm": 0.14820711314678192,
"learning_rate": 0.0006269469754813277,
"loss": 2.678899841308594,
"step": 46100
},
{
"epoch": 0.09272727272727273,
"grad_norm": 0.14676456153392792,
"learning_rate": 0.0006255633680314226,
"loss": 2.6948358154296876,
"step": 46200
},
{
"epoch": 0.09363636363636364,
"grad_norm": 0.14033126831054688,
"learning_rate": 0.0006241787336008143,
"loss": 2.6942843627929687,
"step": 46300
},
{
"epoch": 0.09454545454545454,
"grad_norm": 0.15463101863861084,
"learning_rate": 0.000622793083514405,
"loss": 2.6831298828125,
"step": 46400
},
{
"epoch": 0.09545454545454546,
"grad_norm": 0.1568794697523117,
"learning_rate": 0.0006214064291054039,
"loss": 2.6844097900390627,
"step": 46500
},
{
"epoch": 0.09636363636363636,
"grad_norm": 0.15985362231731415,
"learning_rate": 0.0006200187817152341,
"loss": 2.6705093383789062,
"step": 46600
},
{
"epoch": 0.09727272727272727,
"grad_norm": 0.18481206893920898,
"learning_rate": 0.0006186301526934407,
"loss": 2.7399118041992185,
"step": 46700
},
{
"epoch": 0.09818181818181818,
"grad_norm": 0.17036649584770203,
"learning_rate": 0.0006172405533975973,
"loss": 2.7174920654296875,
"step": 46800
},
{
"epoch": 0.09909090909090909,
"grad_norm": 0.21465139091014862,
"learning_rate": 0.0006158499951932138,
"loss": 2.7115213012695314,
"step": 46900
},
{
"epoch": 0.1,
"grad_norm": 0.16568434238433838,
"learning_rate": 0.0006144584894536423,
"loss": 2.7298922729492188,
"step": 47000
},
{
"epoch": 0.1,
"eval_loss": 3.0938024520874023,
"eval_runtime": 7.4616,
"eval_samples_per_second": 77.195,
"eval_steps_per_second": 19.299,
"step": 47000
},
{
"epoch": 0.1009090909090909,
"grad_norm": 0.14605851471424103,
"learning_rate": 0.0006130660475599854,
"loss": 2.7149703979492186,
"step": 47100
},
{
"epoch": 0.10181818181818182,
"grad_norm": 0.21608054637908936,
"learning_rate": 0.0006116726809010022,
"loss": 2.7035641479492187,
"step": 47200
},
{
"epoch": 0.10272727272727272,
"grad_norm": 0.1545097827911377,
"learning_rate": 0.0006102784008730155,
"loss": 2.6880255126953125,
"step": 47300
},
{
"epoch": 0.10363636363636364,
"grad_norm": 0.14439067244529724,
"learning_rate": 0.0006088832188798183,
"loss": 2.6835076904296873,
"step": 47400
},
{
"epoch": 0.10454545454545454,
"grad_norm": 0.17214855551719666,
"learning_rate": 0.0006074871463325809,
"loss": 2.6864669799804686,
"step": 47500
},
{
"epoch": 0.10545454545454545,
"grad_norm": 0.15308986604213715,
"learning_rate": 0.0006060901946497581,
"loss": 2.6995504760742186,
"step": 47600
},
{
"epoch": 0.10636363636363637,
"grad_norm": 0.21875260770320892,
"learning_rate": 0.000604692375256994,
"loss": 2.6868545532226564,
"step": 47700
},
{
"epoch": 0.10727272727272727,
"grad_norm": 0.1660732924938202,
"learning_rate": 0.0006032936995870303,
"loss": 2.718809814453125,
"step": 47800
},
{
"epoch": 0.10818181818181818,
"grad_norm": 0.1624031513929367,
"learning_rate": 0.000601894179079612,
"loss": 2.718572692871094,
"step": 47900
},
{
"epoch": 0.10909090909090909,
"grad_norm": 0.17190197110176086,
"learning_rate": 0.0006004938251813943,
"loss": 2.7020748901367186,
"step": 48000
},
{
"epoch": 0.10909090909090909,
"eval_loss": 3.089716911315918,
"eval_runtime": 7.4415,
"eval_samples_per_second": 77.404,
"eval_steps_per_second": 19.351,
"step": 48000
},
{
"epoch": 0.11,
"grad_norm": 0.1616736799478531,
"learning_rate": 0.0005990926493458485,
"loss": 2.7104031372070314,
"step": 48100
},
{
"epoch": 0.11090909090909092,
"grad_norm": 0.15068742632865906,
"learning_rate": 0.0005976906630331684,
"loss": 2.6817190551757815,
"step": 48200
},
{
"epoch": 0.11181818181818182,
"grad_norm": 0.1564316600561142,
"learning_rate": 0.0005962878777101768,
"loss": 2.699707336425781,
"step": 48300
},
{
"epoch": 0.11272727272727273,
"grad_norm": 0.1532757431268692,
"learning_rate": 0.0005948843048502316,
"loss": 2.7237933349609373,
"step": 48400
},
{
"epoch": 0.11363636363636363,
"grad_norm": 0.18864984810352325,
"learning_rate": 0.0005934799559331318,
"loss": 2.7044161987304687,
"step": 48500
},
{
"epoch": 0.11454545454545455,
"grad_norm": 0.1558079868555069,
"learning_rate": 0.0005920748424450241,
"loss": 2.7322943115234377,
"step": 48600
},
{
"epoch": 0.11545454545454545,
"grad_norm": 0.14599354565143585,
"learning_rate": 0.0005906689758783081,
"loss": 2.6957037353515627,
"step": 48700
},
{
"epoch": 0.11636363636363636,
"grad_norm": 0.16394606232643127,
"learning_rate": 0.0005892623677315435,
"loss": 2.735413818359375,
"step": 48800
},
{
"epoch": 0.11727272727272728,
"grad_norm": 0.16016560792922974,
"learning_rate": 0.0005878550295093547,
"loss": 2.743086853027344,
"step": 48900
},
{
"epoch": 0.11818181818181818,
"grad_norm": 0.1616428941488266,
"learning_rate": 0.0005864469727223377,
"loss": 2.6787353515625,
"step": 49000
},
{
"epoch": 0.11818181818181818,
"eval_loss": 3.087231159210205,
"eval_runtime": 7.451,
"eval_samples_per_second": 77.305,
"eval_steps_per_second": 19.326,
"step": 49000
},
{
"epoch": 0.1190909090909091,
"grad_norm": 0.1776418387889862,
"learning_rate": 0.0005850382088869656,
"loss": 2.6989129638671874,
"step": 49100
},
{
"epoch": 0.12,
"grad_norm": 0.14982151985168457,
"learning_rate": 0.0005836287495254947,
"loss": 2.6925369262695313,
"step": 49200
},
{
"epoch": 0.12090909090909091,
"grad_norm": 0.15882854163646698,
"learning_rate": 0.0005822186061658693,
"loss": 2.7088381958007814,
"step": 49300
},
{
"epoch": 0.12181818181818181,
"grad_norm": 0.17874722182750702,
"learning_rate": 0.0005808077903416286,
"loss": 2.6966705322265625,
"step": 49400
},
{
"epoch": 0.12272727272727273,
"grad_norm": 0.17074082791805267,
"learning_rate": 0.0005793963135918122,
"loss": 2.7259332275390626,
"step": 49500
},
{
"epoch": 0.12363636363636364,
"grad_norm": 0.15236154198646545,
"learning_rate": 0.0005779841874608646,
"loss": 2.7060787963867186,
"step": 49600
},
{
"epoch": 0.12454545454545454,
"grad_norm": 0.15823383629322052,
"learning_rate": 0.0005765714234985422,
"loss": 2.681339111328125,
"step": 49700
},
{
"epoch": 0.12545454545454546,
"grad_norm": 0.21889136731624603,
"learning_rate": 0.0005751580332598178,
"loss": 2.693275146484375,
"step": 49800
},
{
"epoch": 0.12636363636363637,
"grad_norm": 0.1490192860364914,
"learning_rate": 0.000573744028304787,
"loss": 2.6937310791015623,
"step": 49900
},
{
"epoch": 0.12727272727272726,
"grad_norm": 0.1623009741306305,
"learning_rate": 0.0005723294201985724,
"loss": 2.678116760253906,
"step": 50000
},
{
"epoch": 0.12727272727272726,
"eval_loss": 3.082812786102295,
"eval_runtime": 7.4452,
"eval_samples_per_second": 77.366,
"eval_steps_per_second": 19.341,
"step": 50000
},
{
"epoch": 0.12818181818181817,
"grad_norm": 0.1424219161272049,
"learning_rate": 0.0005709142205112308,
"loss": 2.690723876953125,
"step": 50100
},
{
"epoch": 0.1290909090909091,
"grad_norm": 0.15792372822761536,
"learning_rate": 0.0005694984408176566,
"loss": 2.7299853515625,
"step": 50200
},
{
"epoch": 0.13,
"grad_norm": 0.151839479804039,
"learning_rate": 0.0005680820926974884,
"loss": 2.665604248046875,
"step": 50300
},
{
"epoch": 0.13090909090909092,
"grad_norm": 0.1519307941198349,
"learning_rate": 0.0005666651877350139,
"loss": 2.6907989501953127,
"step": 50400
},
{
"epoch": 0.1318181818181818,
"grad_norm": 0.14843234419822693,
"learning_rate": 0.0005652477375190755,
"loss": 2.684622802734375,
"step": 50500
},
{
"epoch": 0.13272727272727272,
"grad_norm": 0.1492377370595932,
"learning_rate": 0.000563829753642975,
"loss": 2.68843994140625,
"step": 50600
},
{
"epoch": 0.13363636363636364,
"grad_norm": 0.1397194117307663,
"learning_rate": 0.0005624112477043789,
"loss": 2.6910018920898438,
"step": 50700
},
{
"epoch": 0.13454545454545455,
"grad_norm": 0.14176790416240692,
"learning_rate": 0.0005609922313052237,
"loss": 2.6935055541992186,
"step": 50800
},
{
"epoch": 0.13545454545454547,
"grad_norm": 0.16330276429653168,
"learning_rate": 0.0005595727160516208,
"loss": 2.6888656616210938,
"step": 50900
},
{
"epoch": 0.13636363636363635,
"grad_norm": 0.1529064178466797,
"learning_rate": 0.0005581527135537623,
"loss": 2.709434814453125,
"step": 51000
},
{
"epoch": 0.13636363636363635,
"eval_loss": 3.07966685295105,
"eval_runtime": 7.3998,
"eval_samples_per_second": 77.84,
"eval_steps_per_second": 19.46,
"step": 51000
},
{
"epoch": 0.13727272727272727,
"grad_norm": 0.1499529331922531,
"learning_rate": 0.0005567322354258249,
"loss": 2.694036560058594,
"step": 51100
},
{
"epoch": 0.13818181818181818,
"grad_norm": 0.1941758096218109,
"learning_rate": 0.0005553112932858754,
"loss": 2.679619140625,
"step": 51200
},
{
"epoch": 0.1390909090909091,
"grad_norm": 0.1703883409500122,
"learning_rate": 0.0005538898987557763,
"loss": 2.7490829467773437,
"step": 51300
},
{
"epoch": 0.14,
"grad_norm": 0.1707204133272171,
"learning_rate": 0.0005524680634610897,
"loss": 2.701058349609375,
"step": 51400
},
{
"epoch": 0.1409090909090909,
"grad_norm": 0.1748669594526291,
"learning_rate": 0.0005510457990309829,
"loss": 2.6962744140625,
"step": 51500
},
{
"epoch": 0.14181818181818182,
"grad_norm": 0.16774185001850128,
"learning_rate": 0.0005496231170981329,
"loss": 2.6645233154296877,
"step": 51600
},
{
"epoch": 0.14272727272727273,
"grad_norm": 0.15208636224269867,
"learning_rate": 0.000548200029298632,
"loss": 2.6871743774414063,
"step": 51700
},
{
"epoch": 0.14363636363636365,
"grad_norm": 0.17048777639865875,
"learning_rate": 0.0005467765472718914,
"loss": 2.6941012573242187,
"step": 51800
},
{
"epoch": 0.14454545454545453,
"grad_norm": 0.1853557974100113,
"learning_rate": 0.000545352682660547,
"loss": 2.669810791015625,
"step": 51900
},
{
"epoch": 0.14545454545454545,
"grad_norm": 0.18524755537509918,
"learning_rate": 0.0005439284471103641,
"loss": 2.714384765625,
"step": 52000
},
{
"epoch": 0.14545454545454545,
"eval_loss": 3.08223819732666,
"eval_runtime": 7.441,
"eval_samples_per_second": 77.409,
"eval_steps_per_second": 19.352,
"step": 52000
},
{
"epoch": 0.14636363636363636,
"grad_norm": 0.15897710621356964,
"learning_rate": 0.0005425038522701411,
"loss": 2.6896728515625,
"step": 52100
},
{
"epoch": 0.14727272727272728,
"grad_norm": 0.1507830172777176,
"learning_rate": 0.0005410789097916161,
"loss": 2.661712341308594,
"step": 52200
},
{
"epoch": 0.1481818181818182,
"grad_norm": 0.1556272655725479,
"learning_rate": 0.0005396536313293696,
"loss": 2.6831851196289063,
"step": 52300
},
{
"epoch": 0.14909090909090908,
"grad_norm": 0.15099219977855682,
"learning_rate": 0.0005382280285407307,
"loss": 2.6684881591796876,
"step": 52400
},
{
"epoch": 0.15,
"grad_norm": 0.15491120517253876,
"learning_rate": 0.0005368021130856809,
"loss": 2.673580322265625,
"step": 52500
},
{
"epoch": 0.1509090909090909,
"grad_norm": 0.1487579345703125,
"learning_rate": 0.0005353758966267588,
"loss": 2.690845642089844,
"step": 52600
},
{
"epoch": 0.15181818181818182,
"grad_norm": 0.1554812639951706,
"learning_rate": 0.0005339493908289656,
"loss": 2.67916748046875,
"step": 52700
},
{
"epoch": 0.15272727272727274,
"grad_norm": 0.15371479094028473,
"learning_rate": 0.0005325226073596681,
"loss": 2.6689898681640627,
"step": 52800
},
{
"epoch": 0.15363636363636363,
"grad_norm": 0.21308736503124237,
"learning_rate": 0.0005310955578885049,
"loss": 2.696147766113281,
"step": 52900
},
{
"epoch": 0.15454545454545454,
"grad_norm": 0.15344563126564026,
"learning_rate": 0.0005296682540872898,
"loss": 2.6800167846679686,
"step": 53000
},
{
"epoch": 0.15454545454545454,
"eval_loss": 3.073288917541504,
"eval_runtime": 7.4514,
"eval_samples_per_second": 77.301,
"eval_steps_per_second": 19.325,
"step": 53000
},
{
"epoch": 0.15545454545454546,
"grad_norm": 0.14833194017410278,
"learning_rate": 0.000528240707629917,
"loss": 2.6591696166992187,
"step": 53100
},
{
"epoch": 0.15636363636363637,
"grad_norm": 0.200588196516037,
"learning_rate": 0.0005268129301922651,
"loss": 2.652269287109375,
"step": 53200
},
{
"epoch": 0.1572727272727273,
"grad_norm": 0.1412370204925537,
"learning_rate": 0.0005253849334521023,
"loss": 2.674943542480469,
"step": 53300
},
{
"epoch": 0.15818181818181817,
"grad_norm": 0.1481807678937912,
"learning_rate": 0.0005239567290889901,
"loss": 2.6497378540039063,
"step": 53400
},
{
"epoch": 0.1590909090909091,
"grad_norm": 0.1553225964307785,
"learning_rate": 0.0005225283287841883,
"loss": 2.655411682128906,
"step": 53500
},
{
"epoch": 0.16,
"grad_norm": 0.1549694985151291,
"learning_rate": 0.0005210997442205594,
"loss": 2.654962158203125,
"step": 53600
},
{
"epoch": 0.16090909090909092,
"grad_norm": 0.1860799938440323,
"learning_rate": 0.0005196709870824726,
"loss": 2.6886834716796875,
"step": 53700
},
{
"epoch": 0.1618181818181818,
"grad_norm": 0.14446097612380981,
"learning_rate": 0.0005182420690557091,
"loss": 2.6884750366210937,
"step": 53800
},
{
"epoch": 0.16272727272727272,
"grad_norm": 0.14465349912643433,
"learning_rate": 0.0005168130018273655,
"loss": 2.677554931640625,
"step": 53900
},
{
"epoch": 0.16363636363636364,
"grad_norm": 0.14523738622665405,
"learning_rate": 0.0005153837970857591,
"loss": 2.66891357421875,
"step": 54000
},
{
"epoch": 0.16363636363636364,
"eval_loss": 3.070340394973755,
"eval_runtime": 7.4203,
"eval_samples_per_second": 77.625,
"eval_steps_per_second": 19.406,
"step": 54000
},
{
"epoch": 0.16454545454545455,
"grad_norm": 0.14817142486572266,
"learning_rate": 0.0005139544665203315,
"loss": 2.69839599609375,
"step": 54100
},
{
"epoch": 0.16545454545454547,
"grad_norm": 0.18234474956989288,
"learning_rate": 0.0005125250218215538,
"loss": 2.667855224609375,
"step": 54200
},
{
"epoch": 0.16636363636363635,
"grad_norm": 0.16814777255058289,
"learning_rate": 0.0005110954746808307,
"loss": 2.683269348144531,
"step": 54300
},
{
"epoch": 0.16727272727272727,
"grad_norm": 0.1632496416568756,
"learning_rate": 0.0005096658367904042,
"loss": 2.670632629394531,
"step": 54400
},
{
"epoch": 0.16818181818181818,
"grad_norm": 0.15290036797523499,
"learning_rate": 0.0005082361198432592,
"loss": 2.6895196533203123,
"step": 54500
},
{
"epoch": 0.1690909090909091,
"grad_norm": 0.15638327598571777,
"learning_rate": 0.0005068063355330264,
"loss": 2.676280212402344,
"step": 54600
},
{
"epoch": 0.17,
"grad_norm": 0.14327116310596466,
"learning_rate": 0.0005053764955538885,
"loss": 2.693046875,
"step": 54700
},
{
"epoch": 0.1709090909090909,
"grad_norm": 0.1540258675813675,
"learning_rate": 0.0005039466116004827,
"loss": 2.6647442626953124,
"step": 54800
},
{
"epoch": 0.17181818181818181,
"grad_norm": 0.14872531592845917,
"learning_rate": 0.0005025166953678061,
"loss": 2.669239501953125,
"step": 54900
},
{
"epoch": 0.17272727272727273,
"grad_norm": 0.15456752479076385,
"learning_rate": 0.0005010867585511199,
"loss": 2.6779644775390623,
"step": 55000
},
{
"epoch": 0.17272727272727273,
"eval_loss": 3.070594072341919,
"eval_runtime": 7.4584,
"eval_samples_per_second": 77.229,
"eval_steps_per_second": 19.307,
"step": 55000
},
{
"epoch": 0.17363636363636364,
"grad_norm": 0.14803044497966766,
"learning_rate": 0.0004996568128458535,
"loss": 2.698114013671875,
"step": 55100
},
{
"epoch": 0.17454545454545456,
"grad_norm": 0.14924941956996918,
"learning_rate": 0.0004982268699475092,
"loss": 2.638841247558594,
"step": 55200
},
{
"epoch": 0.17545454545454545,
"grad_norm": 0.15640807151794434,
"learning_rate": 0.0004967969415515659,
"loss": 2.6517404174804686,
"step": 55300
},
{
"epoch": 0.17636363636363636,
"grad_norm": 0.18078777194023132,
"learning_rate": 0.0004953670393533846,
"loss": 2.6669937133789063,
"step": 55400
},
{
"epoch": 0.17727272727272728,
"grad_norm": 0.15050143003463745,
"learning_rate": 0.0004939371750481115,
"loss": 2.6495355224609374,
"step": 55500
},
{
"epoch": 0.1781818181818182,
"grad_norm": 0.15939530730247498,
"learning_rate": 0.0004925073603305833,
"loss": 2.673974609375,
"step": 55600
},
{
"epoch": 0.17909090909090908,
"grad_norm": 0.7551309466362,
"learning_rate": 0.0004910776068952304,
"loss": 2.6610736083984374,
"step": 55700
},
{
"epoch": 0.18,
"grad_norm": 0.14220239222049713,
"learning_rate": 0.0004896479264359827,
"loss": 2.7120089721679688,
"step": 55800
},
{
"epoch": 0.1809090909090909,
"grad_norm": 0.17650385200977325,
"learning_rate": 0.0004882183306461728,
"loss": 2.6712158203125,
"step": 55900
},
{
"epoch": 0.18181818181818182,
"grad_norm": 0.15496277809143066,
"learning_rate": 0.00048678883121844096,
"loss": 2.6805792236328125,
"step": 56000
},
{
"epoch": 0.18181818181818182,
"eval_loss": 3.068009614944458,
"eval_runtime": 7.4586,
"eval_samples_per_second": 77.227,
"eval_steps_per_second": 19.307,
"step": 56000
},
{
"epoch": 0.18272727272727274,
"grad_norm": 0.15831124782562256,
"learning_rate": 0.00048535943984463943,
"loss": 2.685963134765625,
"step": 56100
},
{
"epoch": 0.18363636363636363,
"grad_norm": 0.17237283289432526,
"learning_rate": 0.00048393016821573625,
"loss": 2.652848205566406,
"step": 56200
},
{
"epoch": 0.18454545454545454,
"grad_norm": 0.172745019197464,
"learning_rate": 0.00048250102802172067,
"loss": 2.6385073852539063,
"step": 56300
},
{
"epoch": 0.18545454545454546,
"grad_norm": 0.16651754081249237,
"learning_rate": 0.00048107203095150636,
"loss": 2.6532525634765625,
"step": 56400
},
{
"epoch": 0.18636363636363637,
"grad_norm": 0.16987019777297974,
"learning_rate": 0.00047964318869283683,
"loss": 2.690726623535156,
"step": 56500
},
{
"epoch": 0.18727272727272729,
"grad_norm": 0.15424904227256775,
"learning_rate": 0.000478214512932189,
"loss": 2.6622409057617187,
"step": 56600
},
{
"epoch": 0.18818181818181817,
"grad_norm": 0.1839853674173355,
"learning_rate": 0.0004767860153546783,
"loss": 2.683760681152344,
"step": 56700
},
{
"epoch": 0.1890909090909091,
"grad_norm": 0.15451455116271973,
"learning_rate": 0.0004753577076439628,
"loss": 2.6614370727539063,
"step": 56800
},
{
"epoch": 0.19,
"grad_norm": 0.19505156576633453,
"learning_rate": 0.0004739296014821474,
"loss": 2.65382080078125,
"step": 56900
},
{
"epoch": 0.19090909090909092,
"grad_norm": 0.20561884343624115,
"learning_rate": 0.0004725017085496889,
"loss": 2.70877685546875,
"step": 57000
},
{
"epoch": 0.19090909090909092,
"eval_loss": 3.0625686645507812,
"eval_runtime": 7.4104,
"eval_samples_per_second": 77.728,
"eval_steps_per_second": 19.432,
"step": 57000
},
{
"epoch": 0.1918181818181818,
"grad_norm": 0.1769583523273468,
"learning_rate": 0.00047107404052529957,
"loss": 2.6674728393554688,
"step": 57100
},
{
"epoch": 0.19272727272727272,
"grad_norm": 0.15023104846477509,
"learning_rate": 0.0004696466090858528,
"loss": 2.6564959716796874,
"step": 57200
},
{
"epoch": 0.19363636363636363,
"grad_norm": 0.1738213300704956,
"learning_rate": 0.00046821942590628645,
"loss": 2.6518304443359373,
"step": 57300
},
{
"epoch": 0.19454545454545455,
"grad_norm": 0.15652106702327728,
"learning_rate": 0.00046679250265950815,
"loss": 2.6429074096679686,
"step": 57400
},
{
"epoch": 0.19545454545454546,
"grad_norm": 0.20546045899391174,
"learning_rate": 0.00046536585101629945,
"loss": 2.66235107421875,
"step": 57500
},
{
"epoch": 0.19636363636363635,
"grad_norm": 0.15202665328979492,
"learning_rate": 0.0004639394826452204,
"loss": 2.635772399902344,
"step": 57600
},
{
"epoch": 0.19727272727272727,
"grad_norm": 0.1581605225801468,
"learning_rate": 0.00046251340921251436,
"loss": 2.6710745239257814,
"step": 57700
},
{
"epoch": 0.19818181818181818,
"grad_norm": 0.19863693416118622,
"learning_rate": 0.000461087642382012,
"loss": 2.645235595703125,
"step": 57800
},
{
"epoch": 0.1990909090909091,
"grad_norm": 0.14989744126796722,
"learning_rate": 0.00045966219381503694,
"loss": 2.6374029541015624,
"step": 57900
},
{
"epoch": 0.2,
"grad_norm": 0.18618331849575043,
"learning_rate": 0.000458237075170309,
"loss": 2.6277200317382814,
"step": 58000
},
{
"epoch": 0.2,
"eval_loss": 3.0661063194274902,
"eval_runtime": 7.4551,
"eval_samples_per_second": 77.262,
"eval_steps_per_second": 19.316,
"step": 58000
},
{
"epoch": 0.2009090909090909,
"grad_norm": 0.16106659173965454,
"learning_rate": 0.00045681229810385005,
"loss": 2.6352557373046874,
"step": 58100
},
{
"epoch": 0.2018181818181818,
"grad_norm": 0.14770276844501495,
"learning_rate": 0.000455387874268888,
"loss": 2.627791442871094,
"step": 58200
},
{
"epoch": 0.20272727272727273,
"grad_norm": 0.17903557419776917,
"learning_rate": 0.0004539638153157621,
"loss": 2.638799133300781,
"step": 58300
},
{
"epoch": 0.20363636363636364,
"grad_norm": 0.16185429692268372,
"learning_rate": 0.0004525401328918264,
"loss": 2.635686340332031,
"step": 58400
},
{
"epoch": 0.20454545454545456,
"grad_norm": 0.17657916247844696,
"learning_rate": 0.00045111683864135617,
"loss": 2.6360543823242186,
"step": 58500
},
{
"epoch": 0.20545454545454545,
"grad_norm": 0.14804042875766754,
"learning_rate": 0.0004496939442054514,
"loss": 2.643255310058594,
"step": 58600
},
{
"epoch": 0.20636363636363636,
"grad_norm": 0.16301922500133514,
"learning_rate": 0.0004482714612219419,
"loss": 2.64661376953125,
"step": 58700
},
{
"epoch": 0.20727272727272728,
"grad_norm": 0.1726071685552597,
"learning_rate": 0.00044684940132529264,
"loss": 2.6665936279296876,
"step": 58800
},
{
"epoch": 0.2081818181818182,
"grad_norm": 0.16906021535396576,
"learning_rate": 0.0004454277761465076,
"loss": 2.65294921875,
"step": 58900
},
{
"epoch": 0.20909090909090908,
"grad_norm": 0.17039760947227478,
"learning_rate": 0.0004440065973130358,
"loss": 2.6539688110351562,
"step": 59000
},
{
"epoch": 0.20909090909090908,
"eval_loss": 3.057651996612549,
"eval_runtime": 7.4341,
"eval_samples_per_second": 77.481,
"eval_steps_per_second": 19.37,
"step": 59000
},
{
"epoch": 0.21,
"grad_norm": 0.1761595457792282,
"learning_rate": 0.0004425858764486751,
"loss": 2.6766180419921874,
"step": 59100
},
{
"epoch": 0.2109090909090909,
"grad_norm": 0.16640876233577728,
"learning_rate": 0.00044116562517347796,
"loss": 2.6426458740234375,
"step": 59200
},
{
"epoch": 0.21181818181818182,
"grad_norm": 0.1541028618812561,
"learning_rate": 0.00043974585510365614,
"loss": 2.6716134643554685,
"step": 59300
},
{
"epoch": 0.21272727272727274,
"grad_norm": 0.16134560108184814,
"learning_rate": 0.0004383265778514852,
"loss": 2.6808517456054686,
"step": 59400
},
{
"epoch": 0.21363636363636362,
"grad_norm": 0.1456531435251236,
"learning_rate": 0.0004369078050252105,
"loss": 2.684778747558594,
"step": 59500
},
{
"epoch": 0.21454545454545454,
"grad_norm": 0.1792006641626358,
"learning_rate": 0.00043548954822895117,
"loss": 2.649779052734375,
"step": 59600
},
{
"epoch": 0.21545454545454545,
"grad_norm": 0.18216730654239655,
"learning_rate": 0.00043407181906260627,
"loss": 2.677138671875,
"step": 59700
},
{
"epoch": 0.21636363636363637,
"grad_norm": 0.1598980575799942,
"learning_rate": 0.0004326546291217589,
"loss": 2.6525616455078125,
"step": 59800
},
{
"epoch": 0.21727272727272728,
"grad_norm": 0.16436710953712463,
"learning_rate": 0.0004312379899975821,
"loss": 2.6850616455078127,
"step": 59900
},
{
"epoch": 0.21818181818181817,
"grad_norm": 0.175828754901886,
"learning_rate": 0.00042982191327674404,
"loss": 2.6756378173828126,
"step": 60000
},
{
"epoch": 0.21818181818181817,
"eval_loss": 3.0540809631347656,
"eval_runtime": 7.4118,
"eval_samples_per_second": 77.714,
"eval_steps_per_second": 19.429,
"step": 60000
},
{
"epoch": 0.2190909090909091,
"grad_norm": 0.16105052828788757,
"learning_rate": 0.0004284064105413123,
"loss": 2.6820413208007814,
"step": 60100
},
{
"epoch": 0.22,
"grad_norm": 0.17260073125362396,
"learning_rate": 0.00042699149336866053,
"loss": 2.705378112792969,
"step": 60200
},
{
"epoch": 0.22090909090909092,
"grad_norm": 0.1929374486207962,
"learning_rate": 0.0004255771733313727,
"loss": 2.6583901977539064,
"step": 60300
},
{
"epoch": 0.22181818181818183,
"grad_norm": 0.15301187336444855,
"learning_rate": 0.00042416346199714895,
"loss": 2.6433419799804687,
"step": 60400
},
{
"epoch": 0.22272727272727272,
"grad_norm": 0.16559265553951263,
"learning_rate": 0.0004227503709287107,
"loss": 2.6537457275390626,
"step": 60500
},
{
"epoch": 0.22363636363636363,
"grad_norm": 0.16312868893146515,
"learning_rate": 0.0004213379116837065,
"loss": 2.642680969238281,
"step": 60600
},
{
"epoch": 0.22454545454545455,
"grad_norm": 0.1596183180809021,
"learning_rate": 0.00041992609581461714,
"loss": 2.6479568481445312,
"step": 60700
},
{
"epoch": 0.22545454545454546,
"grad_norm": 0.1691562980413437,
"learning_rate": 0.00041851493486866093,
"loss": 2.668114013671875,
"step": 60800
},
{
"epoch": 0.22636363636363635,
"grad_norm": 0.17783690989017487,
"learning_rate": 0.00041710444038770006,
"loss": 2.6744537353515625,
"step": 60900
},
{
"epoch": 0.22727272727272727,
"grad_norm": 0.14821407198905945,
"learning_rate": 0.00041569462390814507,
"loss": 2.6778204345703127,
"step": 61000
},
{
"epoch": 0.22727272727272727,
"eval_loss": 3.0541512966156006,
"eval_runtime": 7.4401,
"eval_samples_per_second": 77.419,
"eval_steps_per_second": 19.355,
"step": 61000
},
{
"epoch": 0.22818181818181818,
"grad_norm": 0.15560130774974823,
"learning_rate": 0.00041428549696086213,
"loss": 2.6814599609375,
"step": 61100
},
{
"epoch": 0.2290909090909091,
"grad_norm": 0.16080529987812042,
"learning_rate": 0.0004128770710710768,
"loss": 2.6637908935546877,
"step": 61200
},
{
"epoch": 0.23,
"grad_norm": 0.15518587827682495,
"learning_rate": 0.0004114693577582812,
"loss": 2.6588839721679687,
"step": 61300
},
{
"epoch": 0.2309090909090909,
"grad_norm": 0.16887351870536804,
"learning_rate": 0.000410062368536139,
"loss": 2.674110107421875,
"step": 61400
},
{
"epoch": 0.2318181818181818,
"grad_norm": 0.1643567532300949,
"learning_rate": 0.0004086561149123919,
"loss": 2.6627960205078125,
"step": 61500
},
{
"epoch": 0.23272727272727273,
"grad_norm": 0.17247343063354492,
"learning_rate": 0.0004072506083887647,
"loss": 2.680544738769531,
"step": 61600
},
{
"epoch": 0.23363636363636364,
"grad_norm": 0.17303307354450226,
"learning_rate": 0.0004058458604608721,
"loss": 2.6711715698242187,
"step": 61700
},
{
"epoch": 0.23454545454545456,
"grad_norm": 0.15602687001228333,
"learning_rate": 0.0004044418826181241,
"loss": 2.6567123413085936,
"step": 61800
},
{
"epoch": 0.23545454545454544,
"grad_norm": 0.17260140180587769,
"learning_rate": 0.0004030386863436319,
"loss": 2.6413006591796875,
"step": 61900
},
{
"epoch": 0.23636363636363636,
"grad_norm": 0.15273793041706085,
"learning_rate": 0.000401636283114115,
"loss": 2.6535302734375,
"step": 62000
},
{
"epoch": 0.23636363636363636,
"eval_loss": 3.0504443645477295,
"eval_runtime": 7.4706,
"eval_samples_per_second": 77.102,
"eval_steps_per_second": 19.276,
"step": 62000
},
{
"epoch": 0.23727272727272727,
"grad_norm": 0.1516442894935608,
"learning_rate": 0.0004002346843998058,
"loss": 2.65826416015625,
"step": 62100
},
{
"epoch": 0.2381818181818182,
"grad_norm": 0.16887111961841583,
"learning_rate": 0.0003988339016643571,
"loss": 2.65544189453125,
"step": 62200
},
{
"epoch": 0.2390909090909091,
"grad_norm": 0.17878231406211853,
"learning_rate": 0.00039743394636474735,
"loss": 2.6390304565429688,
"step": 62300
},
{
"epoch": 0.24,
"grad_norm": 0.14858455955982208,
"learning_rate": 0.00039603482995118793,
"loss": 2.6456539916992186,
"step": 62400
},
{
"epoch": 0.2409090909090909,
"grad_norm": 0.16330905258655548,
"learning_rate": 0.0003946365638670289,
"loss": 2.6405880737304686,
"step": 62500
},
{
"epoch": 0.24181818181818182,
"grad_norm": 0.17122872173786163,
"learning_rate": 0.00039323915954866506,
"loss": 2.6345315551757813,
"step": 62600
},
{
"epoch": 0.24272727272727274,
"grad_norm": 0.15139397978782654,
"learning_rate": 0.00039184262842544346,
"loss": 2.617703857421875,
"step": 62700
},
{
"epoch": 0.24363636363636362,
"grad_norm": 0.14694419503211975,
"learning_rate": 0.0003904469819195686,
"loss": 2.6260647583007812,
"step": 62800
},
{
"epoch": 0.24454545454545454,
"grad_norm": 0.1512179970741272,
"learning_rate": 0.00038905223144601044,
"loss": 2.6326007080078124,
"step": 62900
},
{
"epoch": 0.24545454545454545,
"grad_norm": 0.1644383668899536,
"learning_rate": 0.00038765838841240964,
"loss": 2.655694885253906,
"step": 63000
},
{
"epoch": 0.24545454545454545,
"eval_loss": 3.050816774368286,
"eval_runtime": 7.4114,
"eval_samples_per_second": 77.718,
"eval_steps_per_second": 19.43,
"step": 63000
},
{
"epoch": 0.24636363636363637,
"grad_norm": 0.16079971194267273,
"learning_rate": 0.00038626546421898547,
"loss": 2.6361544799804686,
"step": 63100
},
{
"epoch": 0.24727272727272728,
"grad_norm": 0.16880013048648834,
"learning_rate": 0.0003848734702584417,
"loss": 2.6428652954101564,
"step": 63200
},
{
"epoch": 0.24818181818181817,
"grad_norm": 0.15799115598201752,
"learning_rate": 0.00038348241791587377,
"loss": 2.63120361328125,
"step": 63300
},
{
"epoch": 0.24909090909090909,
"grad_norm": 0.1738392412662506,
"learning_rate": 0.00038209231856867594,
"loss": 2.6429544067382813,
"step": 63400
},
{
"epoch": 0.25,
"grad_norm": 0.16007262468338013,
"learning_rate": 0.0003807031835864474,
"loss": 2.6346502685546875,
"step": 63500
},
{
"epoch": 0.2509090909090909,
"grad_norm": 0.16581037640571594,
"learning_rate": 0.0003793150243309002,
"loss": 2.625074462890625,
"step": 63600
},
{
"epoch": 0.25181818181818183,
"grad_norm": 0.14953260123729706,
"learning_rate": 0.00037792785215576605,
"loss": 2.6320794677734374,
"step": 63700
},
{
"epoch": 0.25272727272727274,
"grad_norm": 0.15426383912563324,
"learning_rate": 0.0003765416784067028,
"loss": 2.6317816162109375,
"step": 63800
},
{
"epoch": 0.25363636363636366,
"grad_norm": 0.1912180483341217,
"learning_rate": 0.0003751565144212027,
"loss": 2.63588623046875,
"step": 63900
},
{
"epoch": 0.2545454545454545,
"grad_norm": 0.1402943879365921,
"learning_rate": 0.0003737723715284992,
"loss": 2.644476013183594,
"step": 64000
},
{
"epoch": 0.2545454545454545,
"eval_loss": 3.0472707748413086,
"eval_runtime": 7.4723,
"eval_samples_per_second": 77.085,
"eval_steps_per_second": 19.271,
"step": 64000
},
{
"epoch": 0.25545454545454543,
"grad_norm": 0.15801353752613068,
"learning_rate": 0.0003723892610494738,
"loss": 2.6523193359375,
"step": 64100
},
{
"epoch": 0.25636363636363635,
"grad_norm": 0.16160622239112854,
"learning_rate": 0.00037100719429656416,
"loss": 2.620086669921875,
"step": 64200
},
{
"epoch": 0.25727272727272726,
"grad_norm": 0.17042121291160583,
"learning_rate": 0.00036962618257367153,
"loss": 2.634929504394531,
"step": 64300
},
{
"epoch": 0.2581818181818182,
"grad_norm": 0.16742800176143646,
"learning_rate": 0.00036824623717606755,
"loss": 2.6305416870117186,
"step": 64400
},
{
"epoch": 0.2590909090909091,
"grad_norm": 0.15466608107089996,
"learning_rate": 0.000366867369390303,
"loss": 2.673544921875,
"step": 64500
},
{
"epoch": 0.26,
"grad_norm": 0.16298887133598328,
"learning_rate": 0.00036548959049411447,
"loss": 2.629702453613281,
"step": 64600
},
{
"epoch": 0.2609090909090909,
"grad_norm": 0.1554904580116272,
"learning_rate": 0.00036411291175633275,
"loss": 2.664700927734375,
"step": 64700
},
{
"epoch": 0.26181818181818184,
"grad_norm": 0.16158753633499146,
"learning_rate": 0.0003627373444367902,
"loss": 2.632271423339844,
"step": 64800
},
{
"epoch": 0.26272727272727275,
"grad_norm": 0.1622844785451889,
"learning_rate": 0.00036136289978622925,
"loss": 2.626861877441406,
"step": 64900
},
{
"epoch": 0.2636363636363636,
"grad_norm": 0.16394828259944916,
"learning_rate": 0.0003599895890462101,
"loss": 2.648804016113281,
"step": 65000
},
{
"epoch": 0.2636363636363636,
"eval_loss": 3.0462276935577393,
"eval_runtime": 7.4377,
"eval_samples_per_second": 77.444,
"eval_steps_per_second": 19.361,
"step": 65000
},
{
"epoch": 0.26454545454545453,
"grad_norm": 0.15556195378303528,
"learning_rate": 0.000358617423449018,
"loss": 2.6247119140625,
"step": 65100
},
{
"epoch": 0.26545454545454544,
"grad_norm": 0.1603025197982788,
"learning_rate": 0.00035724641421757314,
"loss": 2.6453323364257812,
"step": 65200
},
{
"epoch": 0.26636363636363636,
"grad_norm": 0.17644956707954407,
"learning_rate": 0.0003558765725653368,
"loss": 2.67004638671875,
"step": 65300
},
{
"epoch": 0.2672727272727273,
"grad_norm": 0.17642109096050262,
"learning_rate": 0.0003545079096962215,
"loss": 2.6238552856445314,
"step": 65400
},
{
"epoch": 0.2681818181818182,
"grad_norm": 0.16550812125205994,
"learning_rate": 0.00035314043680449773,
"loss": 2.635771484375,
"step": 65500
},
{
"epoch": 0.2690909090909091,
"grad_norm": 0.18358127772808075,
"learning_rate": 0.0003517741650747038,
"loss": 2.673054504394531,
"step": 65600
},
{
"epoch": 0.27,
"grad_norm": 0.14490514993667603,
"learning_rate": 0.0003504091056815537,
"loss": 2.6274179077148436,
"step": 65700
},
{
"epoch": 0.27090909090909093,
"grad_norm": 0.15338118374347687,
"learning_rate": 0.00034904526978984517,
"loss": 2.6343759155273436,
"step": 65800
},
{
"epoch": 0.2718181818181818,
"grad_norm": 0.1604444533586502,
"learning_rate": 0.00034768266855436967,
"loss": 2.643642578125,
"step": 65900
},
{
"epoch": 0.2727272727272727,
"grad_norm": 0.16554522514343262,
"learning_rate": 0.0003463213131198198,
"loss": 2.645709228515625,
"step": 66000
},
{
"epoch": 0.2727272727272727,
"eval_loss": 3.0441606044769287,
"eval_runtime": 7.4053,
"eval_samples_per_second": 77.782,
"eval_steps_per_second": 19.445,
"step": 66000
},
{
"epoch": 0.2736363636363636,
"grad_norm": 0.16071894764900208,
"learning_rate": 0.00034496121462069916,
"loss": 2.6328436279296876,
"step": 66100
},
{
"epoch": 0.27454545454545454,
"grad_norm": 0.1610708087682724,
"learning_rate": 0.000343602384181231,
"loss": 2.650054626464844,
"step": 66200
},
{
"epoch": 0.27545454545454545,
"grad_norm": 0.1581074744462967,
"learning_rate": 0.00034224483291526666,
"loss": 2.6330722045898436,
"step": 66300
},
{
"epoch": 0.27636363636363637,
"grad_norm": 0.16902528703212738,
"learning_rate": 0.0003408885719261956,
"loss": 2.60602783203125,
"step": 66400
},
{
"epoch": 0.2772727272727273,
"grad_norm": 0.1647139936685562,
"learning_rate": 0.0003395336123068537,
"loss": 2.6406063842773437,
"step": 66500
},
{
"epoch": 0.2781818181818182,
"grad_norm": 0.16128414869308472,
"learning_rate": 0.0003381799651394335,
"loss": 2.6316217041015624,
"step": 66600
},
{
"epoch": 0.2790909090909091,
"grad_norm": 0.1957395374774933,
"learning_rate": 0.0003368276414953922,
"loss": 2.6092684936523436,
"step": 66700
},
{
"epoch": 0.28,
"grad_norm": 0.14507023990154266,
"learning_rate": 0.0003354766524353632,
"loss": 2.602089538574219,
"step": 66800
},
{
"epoch": 0.2809090909090909,
"grad_norm": 0.17211727797985077,
"learning_rate": 0.0003341270090090631,
"loss": 2.65368896484375,
"step": 66900
},
{
"epoch": 0.2818181818181818,
"grad_norm": 0.15183623135089874,
"learning_rate": 0.0003327787222552032,
"loss": 2.647850341796875,
"step": 67000
},
{
"epoch": 0.2818181818181818,
"eval_loss": 3.037811279296875,
"eval_runtime": 7.4649,
"eval_samples_per_second": 77.161,
"eval_steps_per_second": 19.29,
"step": 67000
},
{
"epoch": 0.2827272727272727,
"grad_norm": 0.147422194480896,
"learning_rate": 0.0003314318032013985,
"loss": 2.63864501953125,
"step": 67100
},
{
"epoch": 0.28363636363636363,
"grad_norm": 0.15864703059196472,
"learning_rate": 0.00033008626286407756,
"loss": 2.6240463256835938,
"step": 67200
},
{
"epoch": 0.28454545454545455,
"grad_norm": 0.15877065062522888,
"learning_rate": 0.0003287421122483924,
"loss": 2.640238952636719,
"step": 67300
},
{
"epoch": 0.28545454545454546,
"grad_norm": 0.15702606737613678,
"learning_rate": 0.00032739936234812863,
"loss": 2.6432769775390623,
"step": 67400
},
{
"epoch": 0.2863636363636364,
"grad_norm": 0.17382535338401794,
"learning_rate": 0.0003260580241456155,
"loss": 2.6252288818359375,
"step": 67500
},
{
"epoch": 0.2872727272727273,
"grad_norm": 0.15588997304439545,
"learning_rate": 0.00032471810861163573,
"loss": 2.6104010009765624,
"step": 67600
},
{
"epoch": 0.2881818181818182,
"grad_norm": 0.17598041892051697,
"learning_rate": 0.0003233796267053365,
"loss": 2.6319580078125,
"step": 67700
},
{
"epoch": 0.28909090909090907,
"grad_norm": 0.15314966440200806,
"learning_rate": 0.0003220425893741388,
"loss": 2.6283184814453127,
"step": 67800
},
{
"epoch": 0.29,
"grad_norm": 0.17279887199401855,
"learning_rate": 0.000320707007553649,
"loss": 2.6345831298828126,
"step": 67900
},
{
"epoch": 0.2909090909090909,
"grad_norm": 0.20019470155239105,
"learning_rate": 0.0003193728921675685,
"loss": 2.630293273925781,
"step": 68000
},
{
"epoch": 0.2909090909090909,
"eval_loss": 3.0448532104492188,
"eval_runtime": 7.4367,
"eval_samples_per_second": 77.454,
"eval_steps_per_second": 19.363,
"step": 68000
},
{
"epoch": 0.2918181818181818,
"grad_norm": 0.18501834571361542,
"learning_rate": 0.0003180402541276048,
"loss": 2.650793151855469,
"step": 68100
},
{
"epoch": 0.2927272727272727,
"grad_norm": 0.14561575651168823,
"learning_rate": 0.00031670910433338273,
"loss": 2.6040188598632814,
"step": 68200
},
{
"epoch": 0.29363636363636364,
"grad_norm": 0.16025520861148834,
"learning_rate": 0.00031537945367235393,
"loss": 2.6409112548828126,
"step": 68300
},
{
"epoch": 0.29454545454545455,
"grad_norm": 0.15475542843341827,
"learning_rate": 0.00031405131301970936,
"loss": 2.6054486083984374,
"step": 68400
},
{
"epoch": 0.29545454545454547,
"grad_norm": 0.15857645869255066,
"learning_rate": 0.0003127246932382891,
"loss": 2.616719055175781,
"step": 68500
},
{
"epoch": 0.2963636363636364,
"grad_norm": 0.19392845034599304,
"learning_rate": 0.0003113996051784945,
"loss": 2.60544921875,
"step": 68600
},
{
"epoch": 0.2972727272727273,
"grad_norm": 0.19967029988765717,
"learning_rate": 0.00031007605967819896,
"loss": 2.6308856201171875,
"step": 68700
},
{
"epoch": 0.29818181818181816,
"grad_norm": 0.19477345049381256,
"learning_rate": 0.00030875406756265887,
"loss": 2.6351129150390626,
"step": 68800
},
{
"epoch": 0.2990909090909091,
"grad_norm": 0.15118417143821716,
"learning_rate": 0.000307433639644426,
"loss": 2.614127197265625,
"step": 68900
},
{
"epoch": 0.3,
"grad_norm": 0.15570956468582153,
"learning_rate": 0.0003061147867232582,
"loss": 2.608861389160156,
"step": 69000
},
{
"epoch": 0.3,
"eval_loss": 3.0342400074005127,
"eval_runtime": 7.4253,
"eval_samples_per_second": 77.572,
"eval_steps_per_second": 19.393,
"step": 69000
},
{
"epoch": 0.3009090909090909,
"grad_norm": 0.1571355015039444,
"learning_rate": 0.0003047975195860318,
"loss": 2.606195983886719,
"step": 69100
},
{
"epoch": 0.3018181818181818,
"grad_norm": 0.15814636647701263,
"learning_rate": 0.0003034818490066527,
"loss": 2.5954779052734374,
"step": 69200
},
{
"epoch": 0.30272727272727273,
"grad_norm": 0.14323082566261292,
"learning_rate": 0.00030216778574596883,
"loss": 2.6024984741210937,
"step": 69300
},
{
"epoch": 0.30363636363636365,
"grad_norm": 0.17691482603549957,
"learning_rate": 0.00030085534055168184,
"loss": 2.602333984375,
"step": 69400
},
{
"epoch": 0.30454545454545456,
"grad_norm": 0.17705939710140228,
"learning_rate": 0.00029954452415825896,
"loss": 2.628582763671875,
"step": 69500
},
{
"epoch": 0.3054545454545455,
"grad_norm": 0.16018672287464142,
"learning_rate": 0.00029823534728684587,
"loss": 2.617008056640625,
"step": 69600
},
{
"epoch": 0.30636363636363634,
"grad_norm": 0.16868868470191956,
"learning_rate": 0.0002969278206451786,
"loss": 2.597875671386719,
"step": 69700
},
{
"epoch": 0.30727272727272725,
"grad_norm": 0.1678052544593811,
"learning_rate": 0.0002956219549274957,
"loss": 2.59896728515625,
"step": 69800
},
{
"epoch": 0.30818181818181817,
"grad_norm": 0.15835554897785187,
"learning_rate": 0.00029431776081445104,
"loss": 2.6005072021484374,
"step": 69900
},
{
"epoch": 0.3090909090909091,
"grad_norm": 0.148189514875412,
"learning_rate": 0.0002930152489730271,
"loss": 2.596640625,
"step": 70000
},
{
"epoch": 0.3090909090909091,
"eval_loss": 3.034733772277832,
"eval_runtime": 7.4478,
"eval_samples_per_second": 77.338,
"eval_steps_per_second": 19.335,
"step": 70000
},
{
"epoch": 0.31,
"grad_norm": 0.1630752682685852,
"learning_rate": 0.0002917144300564461,
"loss": 2.6199655151367187,
"step": 70100
},
{
"epoch": 0.3109090909090909,
"grad_norm": 0.16336363554000854,
"learning_rate": 0.00029041531470408465,
"loss": 2.595935974121094,
"step": 70200
},
{
"epoch": 0.3118181818181818,
"grad_norm": 0.19114582240581512,
"learning_rate": 0.00028911791354138574,
"loss": 2.6245462036132814,
"step": 70300
},
{
"epoch": 0.31272727272727274,
"grad_norm": 0.15327058732509613,
"learning_rate": 0.0002878222371797716,
"loss": 2.606686706542969,
"step": 70400
},
{
"epoch": 0.31363636363636366,
"grad_norm": 0.16627787053585052,
"learning_rate": 0.00028652829621655793,
"loss": 2.6142779541015626,
"step": 70500
},
{
"epoch": 0.3145454545454546,
"grad_norm": 0.17076851427555084,
"learning_rate": 0.0002852361012348663,
"loss": 2.6306427001953123,
"step": 70600
},
{
"epoch": 0.31545454545454543,
"grad_norm": 0.15905171632766724,
"learning_rate": 0.0002839456628035381,
"loss": 2.646249084472656,
"step": 70700
},
{
"epoch": 0.31636363636363635,
"grad_norm": 0.15757545828819275,
"learning_rate": 0.000282656991477048,
"loss": 2.6342782592773437,
"step": 70800
},
{
"epoch": 0.31727272727272726,
"grad_norm": 0.1566353142261505,
"learning_rate": 0.000281370097795417,
"loss": 2.5926519775390626,
"step": 70900
},
{
"epoch": 0.3181818181818182,
"grad_norm": 0.1587604433298111,
"learning_rate": 0.0002800849922841273,
"loss": 2.62255615234375,
"step": 71000
},
{
"epoch": 0.3181818181818182,
"eval_loss": 3.0347187519073486,
"eval_runtime": 7.4419,
"eval_samples_per_second": 77.4,
"eval_steps_per_second": 19.35,
"step": 71000
},
{
"epoch": 0.3190909090909091,
"grad_norm": 0.15599116683006287,
"learning_rate": 0.0002788016854540356,
"loss": 2.6368426513671874,
"step": 71100
},
{
"epoch": 0.32,
"grad_norm": 0.15771758556365967,
"learning_rate": 0.0002775201878012872,
"loss": 2.6378125,
"step": 71200
},
{
"epoch": 0.3209090909090909,
"grad_norm": 0.16494904458522797,
"learning_rate": 0.0002762405098072303,
"loss": 2.6372637939453125,
"step": 71300
},
{
"epoch": 0.32181818181818184,
"grad_norm": 0.18344129621982574,
"learning_rate": 0.0002749626619383296,
"loss": 2.6274960327148436,
"step": 71400
},
{
"epoch": 0.32272727272727275,
"grad_norm": 0.19829513132572174,
"learning_rate": 0.00027368665464608174,
"loss": 2.652212829589844,
"step": 71500
},
{
"epoch": 0.3236363636363636,
"grad_norm": 0.170766219496727,
"learning_rate": 0.0002724124983669292,
"loss": 2.6236361694335937,
"step": 71600
},
{
"epoch": 0.3245454545454545,
"grad_norm": 0.15507978200912476,
"learning_rate": 0.0002711402035221751,
"loss": 2.612099304199219,
"step": 71700
},
{
"epoch": 0.32545454545454544,
"grad_norm": 0.17562313377857208,
"learning_rate": 0.00026986978051789804,
"loss": 2.651109313964844,
"step": 71800
},
{
"epoch": 0.32636363636363636,
"grad_norm": 0.16349823772907257,
"learning_rate": 0.0002686012397448662,
"loss": 2.652076416015625,
"step": 71900
},
{
"epoch": 0.32727272727272727,
"grad_norm": 0.1562015861272812,
"learning_rate": 0.00026733459157845385,
"loss": 2.6174331665039063,
"step": 72000
},
{
"epoch": 0.32727272727272727,
"eval_loss": 3.030982255935669,
"eval_runtime": 7.4103,
"eval_samples_per_second": 77.729,
"eval_steps_per_second": 19.432,
"step": 72000
},
{
"epoch": 0.3281818181818182,
"grad_norm": 0.15797623991966248,
"learning_rate": 0.0002660698463785552,
"loss": 2.619053955078125,
"step": 72100
},
{
"epoch": 0.3290909090909091,
"grad_norm": 0.1555212438106537,
"learning_rate": 0.0002648070144895005,
"loss": 2.632798156738281,
"step": 72200
},
{
"epoch": 0.33,
"grad_norm": 0.19114950299263,
"learning_rate": 0.00026354610623997046,
"loss": 2.6581826782226563,
"step": 72300
},
{
"epoch": 0.33090909090909093,
"grad_norm": 0.17001217603683472,
"learning_rate": 0.00026228713194291253,
"loss": 2.65262939453125,
"step": 72400
},
{
"epoch": 0.33181818181818185,
"grad_norm": 0.1753956377506256,
"learning_rate": 0.0002610301018954573,
"loss": 2.6327615356445313,
"step": 72500
},
{
"epoch": 0.3327272727272727,
"grad_norm": 0.19001173973083496,
"learning_rate": 0.00025977502637883234,
"loss": 2.6356915283203124,
"step": 72600
},
{
"epoch": 0.3336363636363636,
"grad_norm": 0.17613352835178375,
"learning_rate": 0.00025852191565827934,
"loss": 2.6278375244140624,
"step": 72700
},
{
"epoch": 0.33454545454545453,
"grad_norm": 0.16500087082386017,
"learning_rate": 0.0002572707799829701,
"loss": 2.6458389282226564,
"step": 72800
},
{
"epoch": 0.33545454545454545,
"grad_norm": 0.16459618508815765,
"learning_rate": 0.00025602162958592256,
"loss": 2.6154913330078124,
"step": 72900
},
{
"epoch": 0.33636363636363636,
"grad_norm": 0.16172908246517181,
"learning_rate": 0.0002547744746839172,
"loss": 2.617068176269531,
"step": 73000
},
{
"epoch": 0.33636363636363636,
"eval_loss": 3.033856153488159,
"eval_runtime": 7.4432,
"eval_samples_per_second": 77.386,
"eval_steps_per_second": 19.346,
"step": 73000
},
{
"epoch": 0.3372727272727273,
"grad_norm": 0.1543026864528656,
"learning_rate": 0.0002535293254774134,
"loss": 2.626250915527344,
"step": 73100
},
{
"epoch": 0.3381818181818182,
"grad_norm": 0.1827453225851059,
"learning_rate": 0.00025228619215046546,
"loss": 2.6261016845703127,
"step": 73200
},
{
"epoch": 0.3390909090909091,
"grad_norm": 0.1937389373779297,
"learning_rate": 0.0002510450848706404,
"loss": 2.6204208374023437,
"step": 73300
},
{
"epoch": 0.34,
"grad_norm": 0.17227666079998016,
"learning_rate": 0.000249806013788934,
"loss": 2.6471063232421876,
"step": 73400
},
{
"epoch": 0.3409090909090909,
"grad_norm": 0.17451529204845428,
"learning_rate": 0.00024856898903968843,
"loss": 2.6337734985351564,
"step": 73500
},
{
"epoch": 0.3418181818181818,
"grad_norm": 0.24337761104106903,
"learning_rate": 0.00024733402074050815,
"loss": 2.6101370239257813,
"step": 73600
},
{
"epoch": 0.3427272727272727,
"grad_norm": 0.14900852739810944,
"learning_rate": 0.00024610111899217845,
"loss": 2.64669677734375,
"step": 73700
},
{
"epoch": 0.34363636363636363,
"grad_norm": 0.15780414640903473,
"learning_rate": 0.0002448702938785824,
"loss": 2.61236328125,
"step": 73800
},
{
"epoch": 0.34454545454545454,
"grad_norm": 0.194599449634552,
"learning_rate": 0.0002436415554666181,
"loss": 2.603551940917969,
"step": 73900
},
{
"epoch": 0.34545454545454546,
"grad_norm": 0.14722345769405365,
"learning_rate": 0.0002424149138061168,
"loss": 2.613863220214844,
"step": 74000
},
{
"epoch": 0.34545454545454546,
"eval_loss": 3.027711868286133,
"eval_runtime": 7.4441,
"eval_samples_per_second": 77.376,
"eval_steps_per_second": 19.344,
"step": 74000
},
{
"epoch": 0.3463636363636364,
"grad_norm": 0.1645086705684662,
"learning_rate": 0.00024119037892975998,
"loss": 2.59792724609375,
"step": 74100
},
{
"epoch": 0.3472727272727273,
"grad_norm": 0.1647663712501526,
"learning_rate": 0.00023996796085299821,
"loss": 2.611474609375,
"step": 74200
},
{
"epoch": 0.3481818181818182,
"grad_norm": 0.17553652822971344,
"learning_rate": 0.0002387476695739687,
"loss": 2.6507049560546876,
"step": 74300
},
{
"epoch": 0.3490909090909091,
"grad_norm": 0.15945149958133698,
"learning_rate": 0.00023752951507341352,
"loss": 2.643914794921875,
"step": 74400
},
{
"epoch": 0.35,
"grad_norm": 0.16624271869659424,
"learning_rate": 0.00023631350731459827,
"loss": 2.641552734375,
"step": 74500
},
{
"epoch": 0.3509090909090909,
"grad_norm": 0.15819379687309265,
"learning_rate": 0.00023509965624322993,
"loss": 2.5745086669921875,
"step": 74600
},
{
"epoch": 0.3518181818181818,
"grad_norm": 0.17103050649166107,
"learning_rate": 0.00023388797178737635,
"loss": 2.5839889526367186,
"step": 74700
},
{
"epoch": 0.3527272727272727,
"grad_norm": 0.17305444180965424,
"learning_rate": 0.00023267846385738474,
"loss": 2.610628662109375,
"step": 74800
},
{
"epoch": 0.35363636363636364,
"grad_norm": 0.19914712011814117,
"learning_rate": 0.00023147114234580023,
"loss": 2.6196224975585936,
"step": 74900
},
{
"epoch": 0.35454545454545455,
"grad_norm": 0.15575388073921204,
"learning_rate": 0.00023026601712728567,
"loss": 2.590400390625,
"step": 75000
},
{
"epoch": 0.35454545454545455,
"eval_loss": 3.025919198989868,
"eval_runtime": 7.4339,
"eval_samples_per_second": 77.483,
"eval_steps_per_second": 19.371,
"step": 75000
},
{
"epoch": 0.35545454545454547,
"grad_norm": 0.16681872308254242,
"learning_rate": 0.00022906309805853986,
"loss": 2.60665771484375,
"step": 75100
},
{
"epoch": 0.3563636363636364,
"grad_norm": 0.18523137271404266,
"learning_rate": 0.00022786239497821808,
"loss": 2.613553771972656,
"step": 75200
},
{
"epoch": 0.3572727272727273,
"grad_norm": 0.18534353375434875,
"learning_rate": 0.0002266639177068509,
"loss": 2.6336288452148438,
"step": 75300
},
{
"epoch": 0.35818181818181816,
"grad_norm": 0.17340436577796936,
"learning_rate": 0.00022546767604676398,
"loss": 2.596582336425781,
"step": 75400
},
{
"epoch": 0.35909090909090907,
"grad_norm": 0.15971297025680542,
"learning_rate": 0.00022427367978199804,
"loss": 2.629716491699219,
"step": 75500
},
{
"epoch": 0.36,
"grad_norm": 0.17461271584033966,
"learning_rate": 0.00022308193867822873,
"loss": 2.613475341796875,
"step": 75600
},
{
"epoch": 0.3609090909090909,
"grad_norm": 0.169435515999794,
"learning_rate": 0.00022189246248268673,
"loss": 2.597880859375,
"step": 75700
},
{
"epoch": 0.3618181818181818,
"grad_norm": 0.17688947916030884,
"learning_rate": 0.00022070526092407835,
"loss": 2.589518737792969,
"step": 75800
},
{
"epoch": 0.36272727272727273,
"grad_norm": 0.1569153070449829,
"learning_rate": 0.0002195203437125049,
"loss": 2.6041824340820314,
"step": 75900
},
{
"epoch": 0.36363636363636365,
"grad_norm": 0.1733204573392868,
"learning_rate": 0.00021833772053938495,
"loss": 2.594022521972656,
"step": 76000
},
{
"epoch": 0.36363636363636365,
"eval_loss": 3.0241539478302,
"eval_runtime": 7.4745,
"eval_samples_per_second": 77.062,
"eval_steps_per_second": 19.266,
"step": 76000
},
{
"epoch": 0.0012987012987012987,
"grad_norm": 0.16393087804317474,
"learning_rate": 3.391192895308981e-07,
"loss": 2.6057958984375,
"step": 76100
},
{
"epoch": 0.0025974025974025974,
"grad_norm": 0.1581353396177292,
"learning_rate": 2.6802681023424534e-07,
"loss": 2.6045050048828124,
"step": 76200
},
{
"epoch": 0.003896103896103896,
"grad_norm": 0.16540294885635376,
"learning_rate": 2.0528552419035728e-07,
"loss": 2.6286279296875,
"step": 76300
},
{
"epoch": 0.005194805194805195,
"grad_norm": 0.1575717329978943,
"learning_rate": 1.508964798905832e-07,
"loss": 2.624171142578125,
"step": 76400
},
{
"epoch": 0.006493506493506494,
"grad_norm": 0.15712368488311768,
"learning_rate": 1.0486058624897821e-07,
"loss": 2.590557861328125,
"step": 76500
},
{
"epoch": 0.007792207792207792,
"grad_norm": 0.14502283930778503,
"learning_rate": 6.717861258720426e-08,
"loss": 2.5785467529296877,
"step": 76600
},
{
"epoch": 0.00909090909090909,
"grad_norm": 0.16336509585380554,
"learning_rate": 3.7851188621707e-08,
"loss": 2.6053866577148437,
"step": 76700
},
{
"epoch": 0.01038961038961039,
"grad_norm": 0.1576337367296219,
"learning_rate": 1.6878804453168694e-08,
"loss": 2.595892028808594,
"step": 76800
},
{
"epoch": 0.011688311688311689,
"grad_norm": 0.15049995481967926,
"learning_rate": 4.261810558348067e-09,
"loss": 2.629699401855469,
"step": 76900
},
{
"epoch": 0.012987012987012988,
"grad_norm": 0.1851549744606018,
"learning_rate": 4.177841961272577e-13,
"loss": 2.5818411254882814,
"step": 77000
},
{
"epoch": 0.012987012987012988,
"eval_loss": 3.022578001022339,
"eval_runtime": 7.458,
"eval_samples_per_second": 77.233,
"eval_steps_per_second": 19.308,
"step": 77000
}
],
"logging_steps": 100,
"max_steps": 77000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 4000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.918422736699392e+18,
"train_batch_size": 22,
"trial_name": null,
"trial_params": null
}