CodeIsAbstract's picture
Training in progress, step 2400, checkpoint
d396226 verified
Raw
History Blame Contribute Delete
87.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.48,
"eval_steps": 150,
"global_step": 2400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.001,
"grad_norm": 0.27235767245292664,
"learning_rate": 6.4e-08,
"loss": 10.786966705322266,
"step": 5
},
{
"epoch": 0.002,
"grad_norm": 0.36470845341682434,
"learning_rate": 1.44e-07,
"loss": 10.004191589355468,
"step": 10
},
{
"epoch": 0.003,
"grad_norm": 0.18794603645801544,
"learning_rate": 2.24e-07,
"loss": 9.357711791992188,
"step": 15
},
{
"epoch": 0.004,
"grad_norm": 0.15133747458457947,
"learning_rate": 3.0399999999999997e-07,
"loss": 9.077755737304688,
"step": 20
},
{
"epoch": 0.005,
"grad_norm": 0.13880157470703125,
"learning_rate": 3.84e-07,
"loss": 8.826399993896484,
"step": 25
},
{
"epoch": 0.006,
"grad_norm": 0.12539362907409668,
"learning_rate": 4.64e-07,
"loss": 8.724310302734375,
"step": 30
},
{
"epoch": 0.007,
"grad_norm": 0.11178825795650482,
"learning_rate": 5.44e-07,
"loss": 8.595573425292969,
"step": 35
},
{
"epoch": 0.008,
"grad_norm": 0.16203832626342773,
"learning_rate": 6.24e-07,
"loss": 8.613536834716797,
"step": 40
},
{
"epoch": 0.009,
"grad_norm": 0.11954408138990402,
"learning_rate": 7.04e-07,
"loss": 8.435651397705078,
"step": 45
},
{
"epoch": 0.01,
"grad_norm": 0.09399693459272385,
"learning_rate": 7.84e-07,
"loss": 8.369234466552735,
"step": 50
},
{
"epoch": 0.011,
"grad_norm": 0.08723891526460648,
"learning_rate": 8.639999999999999e-07,
"loss": 8.335379791259765,
"step": 55
},
{
"epoch": 0.012,
"grad_norm": 0.09454073011875153,
"learning_rate": 9.439999999999999e-07,
"loss": 8.253787231445312,
"step": 60
},
{
"epoch": 0.013,
"grad_norm": 0.09540031850337982,
"learning_rate": 1.024e-06,
"loss": 8.186421966552734,
"step": 65
},
{
"epoch": 0.014,
"grad_norm": 0.11653102189302444,
"learning_rate": 1.1040000000000001e-06,
"loss": 8.132817840576172,
"step": 70
},
{
"epoch": 0.015,
"grad_norm": 0.08094990253448486,
"learning_rate": 1.1839999999999998e-06,
"loss": 8.107611846923827,
"step": 75
},
{
"epoch": 0.016,
"grad_norm": 0.10092103481292725,
"learning_rate": 1.2639999999999999e-06,
"loss": 8.071889495849609,
"step": 80
},
{
"epoch": 0.017,
"grad_norm": 0.09236462414264679,
"learning_rate": 1.344e-06,
"loss": 8.15390625,
"step": 85
},
{
"epoch": 0.018,
"grad_norm": 0.08973367512226105,
"learning_rate": 1.4239999999999998e-06,
"loss": 8.073948669433594,
"step": 90
},
{
"epoch": 0.019,
"grad_norm": 0.08046946674585342,
"learning_rate": 1.504e-06,
"loss": 7.942198944091797,
"step": 95
},
{
"epoch": 0.02,
"grad_norm": 0.07841245085000992,
"learning_rate": 1.584e-06,
"loss": 7.894329071044922,
"step": 100
},
{
"epoch": 0.021,
"grad_norm": 0.07948298752307892,
"learning_rate": 1.6639999999999999e-06,
"loss": 7.908601379394531,
"step": 105
},
{
"epoch": 0.022,
"grad_norm": 0.07720845937728882,
"learning_rate": 1.744e-06,
"loss": 7.923919677734375,
"step": 110
},
{
"epoch": 0.023,
"grad_norm": 0.09289873391389847,
"learning_rate": 1.824e-06,
"loss": 7.866429138183594,
"step": 115
},
{
"epoch": 0.024,
"grad_norm": 0.07957543432712555,
"learning_rate": 1.904e-06,
"loss": 7.828727722167969,
"step": 120
},
{
"epoch": 0.025,
"grad_norm": 0.07522212713956833,
"learning_rate": 1.984e-06,
"loss": 7.83117446899414,
"step": 125
},
{
"epoch": 0.026,
"grad_norm": 0.09532520920038223,
"learning_rate": 2.064e-06,
"loss": 7.8716987609863285,
"step": 130
},
{
"epoch": 0.027,
"grad_norm": 0.07470740377902985,
"learning_rate": 2.144e-06,
"loss": 7.834799194335938,
"step": 135
},
{
"epoch": 0.028,
"grad_norm": 0.07192815095186234,
"learning_rate": 2.2240000000000002e-06,
"loss": 7.736669921875,
"step": 140
},
{
"epoch": 0.029,
"grad_norm": 0.09201541543006897,
"learning_rate": 2.304e-06,
"loss": 7.6827842712402346,
"step": 145
},
{
"epoch": 0.03,
"grad_norm": 0.09225732833147049,
"learning_rate": 2.384e-06,
"loss": 7.745516967773438,
"step": 150
},
{
"epoch": 0.03,
"eval_accuracy": 0.11922344322344322,
"eval_loss": 7.651349067687988,
"eval_runtime": 10.4261,
"eval_samples_per_second": 9.591,
"eval_steps_per_second": 1.631,
"step": 150
},
{
"epoch": 0.031,
"grad_norm": 0.08881130814552307,
"learning_rate": 2.464e-06,
"loss": 7.674343872070312,
"step": 155
},
{
"epoch": 0.032,
"grad_norm": 0.07704972475767136,
"learning_rate": 2.544e-06,
"loss": 7.681053161621094,
"step": 160
},
{
"epoch": 0.033,
"grad_norm": 0.09186960011720657,
"learning_rate": 2.624e-06,
"loss": 7.690374755859375,
"step": 165
},
{
"epoch": 0.034,
"grad_norm": 0.08565036207437515,
"learning_rate": 2.704e-06,
"loss": 7.603900146484375,
"step": 170
},
{
"epoch": 0.035,
"grad_norm": 0.1499108374118805,
"learning_rate": 2.7839999999999995e-06,
"loss": 7.505958557128906,
"step": 175
},
{
"epoch": 0.036,
"grad_norm": 0.06643059849739075,
"learning_rate": 2.8639999999999996e-06,
"loss": 7.573754119873047,
"step": 180
},
{
"epoch": 0.037,
"grad_norm": 0.11821448802947998,
"learning_rate": 2.9439999999999997e-06,
"loss": 7.752062225341797,
"step": 185
},
{
"epoch": 0.038,
"grad_norm": 0.08827198296785355,
"learning_rate": 3.0239999999999998e-06,
"loss": 7.5669189453125,
"step": 190
},
{
"epoch": 0.039,
"grad_norm": 0.07519616931676865,
"learning_rate": 3.104e-06,
"loss": 7.571305847167968,
"step": 195
},
{
"epoch": 0.04,
"grad_norm": 0.075102798640728,
"learning_rate": 3.184e-06,
"loss": 7.518638610839844,
"step": 200
},
{
"epoch": 0.041,
"grad_norm": 0.10685888677835464,
"learning_rate": 3.2639999999999996e-06,
"loss": 7.512000274658203,
"step": 205
},
{
"epoch": 0.042,
"grad_norm": 0.10541684180498123,
"learning_rate": 3.3439999999999997e-06,
"loss": 7.564778137207031,
"step": 210
},
{
"epoch": 0.043,
"grad_norm": 0.09155019372701645,
"learning_rate": 3.4239999999999997e-06,
"loss": 7.4674217224121096,
"step": 215
},
{
"epoch": 0.044,
"grad_norm": 0.11373615264892578,
"learning_rate": 3.504e-06,
"loss": 7.450457000732422,
"step": 220
},
{
"epoch": 0.045,
"grad_norm": 0.07444982975721359,
"learning_rate": 3.584e-06,
"loss": 7.397786712646484,
"step": 225
},
{
"epoch": 0.046,
"grad_norm": 0.08052903413772583,
"learning_rate": 3.664e-06,
"loss": 7.415688323974609,
"step": 230
},
{
"epoch": 0.047,
"grad_norm": 0.08429361879825592,
"learning_rate": 3.744e-06,
"loss": 7.411205291748047,
"step": 235
},
{
"epoch": 0.048,
"grad_norm": 0.08501375466585159,
"learning_rate": 3.823999999999999e-06,
"loss": 7.406707763671875,
"step": 240
},
{
"epoch": 0.049,
"grad_norm": 0.10457716882228851,
"learning_rate": 3.903999999999999e-06,
"loss": 7.312602233886719,
"step": 245
},
{
"epoch": 0.05,
"grad_norm": 0.09624126553535461,
"learning_rate": 3.9839999999999995e-06,
"loss": 7.360851287841797,
"step": 250
},
{
"epoch": 0.051,
"grad_norm": 0.08660672605037689,
"learning_rate": 3.99999300106024e-06,
"loss": 7.353035736083984,
"step": 255
},
{
"epoch": 0.052,
"grad_norm": 0.08430126309394836,
"learning_rate": 3.9999645679514235e-06,
"loss": 7.384159088134766,
"step": 260
},
{
"epoch": 0.053,
"grad_norm": 0.07826503366231918,
"learning_rate": 3.999914263550513e-06,
"loss": 7.4195198059082035,
"step": 265
},
{
"epoch": 0.054,
"grad_norm": 0.08577796816825867,
"learning_rate": 3.9998420884076325e-06,
"loss": 7.362513732910156,
"step": 270
},
{
"epoch": 0.055,
"grad_norm": 0.0649741068482399,
"learning_rate": 3.999748043312075e-06,
"loss": 7.275961303710938,
"step": 275
},
{
"epoch": 0.056,
"grad_norm": 0.07203389704227448,
"learning_rate": 3.999632129292304e-06,
"loss": 7.263797760009766,
"step": 280
},
{
"epoch": 0.057,
"grad_norm": 0.12281067669391632,
"learning_rate": 3.9994943476159364e-06,
"loss": 7.287098693847656,
"step": 285
},
{
"epoch": 0.058,
"grad_norm": 0.07184985280036926,
"learning_rate": 3.999334699789731e-06,
"loss": 7.240232849121094,
"step": 290
},
{
"epoch": 0.059,
"grad_norm": 0.07799801975488663,
"learning_rate": 3.99915318755957e-06,
"loss": 7.2740531921386715,
"step": 295
},
{
"epoch": 0.06,
"grad_norm": 0.0761650875210762,
"learning_rate": 3.9989498129104425e-06,
"loss": 7.299461364746094,
"step": 300
},
{
"epoch": 0.06,
"eval_accuracy": 0.12382905982905983,
"eval_loss": 7.217157363891602,
"eval_runtime": 10.4259,
"eval_samples_per_second": 9.591,
"eval_steps_per_second": 1.631,
"step": 300
},
{
"epoch": 0.061,
"grad_norm": 0.0692087933421135,
"learning_rate": 3.998724578066421e-06,
"loss": 7.243695831298828,
"step": 305
},
{
"epoch": 0.062,
"grad_norm": 0.08431071788072586,
"learning_rate": 3.998477485490638e-06,
"loss": 7.292684173583984,
"step": 310
},
{
"epoch": 0.063,
"grad_norm": 0.08417057991027832,
"learning_rate": 3.998208537885259e-06,
"loss": 7.222378540039062,
"step": 315
},
{
"epoch": 0.064,
"grad_norm": 0.07904339581727982,
"learning_rate": 3.997917738191449e-06,
"loss": 7.278653717041015,
"step": 320
},
{
"epoch": 0.065,
"grad_norm": 0.13258706033229828,
"learning_rate": 3.99760508958935e-06,
"loss": 7.202552795410156,
"step": 325
},
{
"epoch": 0.066,
"grad_norm": 0.0901857390999794,
"learning_rate": 3.997270595498036e-06,
"loss": 7.205686950683594,
"step": 330
},
{
"epoch": 0.067,
"grad_norm": 0.07317949831485748,
"learning_rate": 3.99691425957548e-06,
"loss": 7.293389892578125,
"step": 335
},
{
"epoch": 0.068,
"grad_norm": 0.11255510151386261,
"learning_rate": 3.996536085718516e-06,
"loss": 7.229725646972656,
"step": 340
},
{
"epoch": 0.069,
"grad_norm": 0.07706659287214279,
"learning_rate": 3.996136078062792e-06,
"loss": 7.257555389404297,
"step": 345
},
{
"epoch": 0.07,
"grad_norm": 0.08863229304552078,
"learning_rate": 3.995714240982727e-06,
"loss": 7.257266235351563,
"step": 350
},
{
"epoch": 0.071,
"grad_norm": 0.08663391321897507,
"learning_rate": 3.995270579091465e-06,
"loss": 7.118687438964844,
"step": 355
},
{
"epoch": 0.072,
"grad_norm": 0.08917262405157089,
"learning_rate": 3.99480509724082e-06,
"loss": 7.238731384277344,
"step": 360
},
{
"epoch": 0.073,
"grad_norm": 0.09512999653816223,
"learning_rate": 3.994317800521228e-06,
"loss": 7.2104545593261715,
"step": 365
},
{
"epoch": 0.074,
"grad_norm": 0.10050003230571747,
"learning_rate": 3.993808694261687e-06,
"loss": 7.186836242675781,
"step": 370
},
{
"epoch": 0.075,
"grad_norm": 0.12758338451385498,
"learning_rate": 3.993277784029702e-06,
"loss": 7.171599578857422,
"step": 375
},
{
"epoch": 0.076,
"grad_norm": 0.08614124357700348,
"learning_rate": 3.992725075631223e-06,
"loss": 7.201605224609375,
"step": 380
},
{
"epoch": 0.077,
"grad_norm": 0.07332151383161545,
"learning_rate": 3.992150575110579e-06,
"loss": 7.026101684570312,
"step": 385
},
{
"epoch": 0.078,
"grad_norm": 0.0854375809431076,
"learning_rate": 3.991554288750416e-06,
"loss": 7.223291015625,
"step": 390
},
{
"epoch": 0.079,
"grad_norm": 0.09470361471176147,
"learning_rate": 3.990936223071627e-06,
"loss": 7.0966438293457035,
"step": 395
},
{
"epoch": 0.08,
"grad_norm": 0.06626710295677185,
"learning_rate": 3.990296384833279e-06,
"loss": 7.142760467529297,
"step": 400
},
{
"epoch": 0.081,
"grad_norm": 0.13561668992042542,
"learning_rate": 3.989634781032539e-06,
"loss": 7.0024574279785154,
"step": 405
},
{
"epoch": 0.082,
"grad_norm": 0.09113086760044098,
"learning_rate": 3.9889514189046015e-06,
"loss": 7.137001800537109,
"step": 410
},
{
"epoch": 0.083,
"grad_norm": 0.07085978239774704,
"learning_rate": 3.988246305922606e-06,
"loss": 7.029933929443359,
"step": 415
},
{
"epoch": 0.084,
"grad_norm": 0.06468215584754944,
"learning_rate": 3.987519449797554e-06,
"loss": 7.02655029296875,
"step": 420
},
{
"epoch": 0.085,
"grad_norm": 0.12091367691755295,
"learning_rate": 3.986770858478227e-06,
"loss": 7.116294097900391,
"step": 425
},
{
"epoch": 0.086,
"grad_norm": 0.10934042185544968,
"learning_rate": 3.986000540151101e-06,
"loss": 7.093238067626953,
"step": 430
},
{
"epoch": 0.087,
"grad_norm": 0.07274443656206131,
"learning_rate": 3.985208503240253e-06,
"loss": 7.123175048828125,
"step": 435
},
{
"epoch": 0.088,
"grad_norm": 0.0802014172077179,
"learning_rate": 3.9843947564072725e-06,
"loss": 7.188668060302734,
"step": 440
},
{
"epoch": 0.089,
"grad_norm": 0.06854639202356339,
"learning_rate": 3.983559308551164e-06,
"loss": 7.106547546386719,
"step": 445
},
{
"epoch": 0.09,
"grad_norm": 0.07703255116939545,
"learning_rate": 3.982702168808252e-06,
"loss": 7.064980316162109,
"step": 450
},
{
"epoch": 0.09,
"eval_accuracy": 0.12983638583638585,
"eval_loss": 6.963926315307617,
"eval_runtime": 10.3988,
"eval_samples_per_second": 9.616,
"eval_steps_per_second": 1.635,
"step": 450
},
{
"epoch": 0.091,
"grad_norm": 0.08548009395599365,
"learning_rate": 3.981823346552078e-06,
"loss": 7.028290557861328,
"step": 455
},
{
"epoch": 0.092,
"grad_norm": 0.08591306209564209,
"learning_rate": 3.980922851393302e-06,
"loss": 7.01605453491211,
"step": 460
},
{
"epoch": 0.093,
"grad_norm": 0.07920879870653152,
"learning_rate": 3.9800006931795954e-06,
"loss": 6.990329742431641,
"step": 465
},
{
"epoch": 0.094,
"grad_norm": 0.07192882895469666,
"learning_rate": 3.979056881995533e-06,
"loss": 6.953098297119141,
"step": 470
},
{
"epoch": 0.095,
"grad_norm": 0.06649420410394669,
"learning_rate": 3.978091428162482e-06,
"loss": 6.951087951660156,
"step": 475
},
{
"epoch": 0.096,
"grad_norm": 0.08228413760662079,
"learning_rate": 3.97710434223849e-06,
"loss": 7.034120178222656,
"step": 480
},
{
"epoch": 0.097,
"grad_norm": 0.10376594960689545,
"learning_rate": 3.976095635018172e-06,
"loss": 6.995967864990234,
"step": 485
},
{
"epoch": 0.098,
"grad_norm": 0.06993073225021362,
"learning_rate": 3.975065317532588e-06,
"loss": 6.952136993408203,
"step": 490
},
{
"epoch": 0.099,
"grad_norm": 0.08720093965530396,
"learning_rate": 3.974013401049125e-06,
"loss": 6.902699279785156,
"step": 495
},
{
"epoch": 0.1,
"grad_norm": 0.1016659289598465,
"learning_rate": 3.972939897071373e-06,
"loss": 6.927466583251953,
"step": 500
},
{
"epoch": 0.101,
"grad_norm": 0.06847221404314041,
"learning_rate": 3.971844817338999e-06,
"loss": 6.902294921875,
"step": 505
},
{
"epoch": 0.102,
"grad_norm": 0.07875518500804901,
"learning_rate": 3.97072817382762e-06,
"loss": 6.962755584716797,
"step": 510
},
{
"epoch": 0.103,
"grad_norm": 0.08157093822956085,
"learning_rate": 3.969589978748671e-06,
"loss": 6.956285095214843,
"step": 515
},
{
"epoch": 0.104,
"grad_norm": 0.08181696385145187,
"learning_rate": 3.968430244549271e-06,
"loss": 6.970890808105469,
"step": 520
},
{
"epoch": 0.105,
"grad_norm": 0.06938958913087845,
"learning_rate": 3.967248983912086e-06,
"loss": 6.917367553710937,
"step": 525
},
{
"epoch": 0.106,
"grad_norm": 0.10486883670091629,
"learning_rate": 3.966046209755195e-06,
"loss": 6.8495323181152346,
"step": 530
},
{
"epoch": 0.107,
"grad_norm": 0.08114153891801834,
"learning_rate": 3.964821935231942e-06,
"loss": 7.0064338684082035,
"step": 535
},
{
"epoch": 0.108,
"grad_norm": 0.07422944903373718,
"learning_rate": 3.963576173730798e-06,
"loss": 6.89477767944336,
"step": 540
},
{
"epoch": 0.109,
"grad_norm": 0.0750703290104866,
"learning_rate": 3.9623089388752105e-06,
"loss": 7.047392272949219,
"step": 545
},
{
"epoch": 0.11,
"grad_norm": 0.07453129440546036,
"learning_rate": 3.961020244523458e-06,
"loss": 6.892961883544922,
"step": 550
},
{
"epoch": 0.111,
"grad_norm": 0.08709228038787842,
"learning_rate": 3.959710104768493e-06,
"loss": 6.973309326171875,
"step": 555
},
{
"epoch": 0.112,
"grad_norm": 0.06008852645754814,
"learning_rate": 3.958378533937797e-06,
"loss": 6.845113372802734,
"step": 560
},
{
"epoch": 0.113,
"grad_norm": 0.09065559506416321,
"learning_rate": 3.957025546593213e-06,
"loss": 6.88427505493164,
"step": 565
},
{
"epoch": 0.114,
"grad_norm": 0.12213204056024551,
"learning_rate": 3.9556511575307956e-06,
"loss": 6.970057678222656,
"step": 570
},
{
"epoch": 0.115,
"grad_norm": 0.10695669054985046,
"learning_rate": 3.954255381780641e-06,
"loss": 6.839192199707031,
"step": 575
},
{
"epoch": 0.116,
"grad_norm": 0.07049612700939178,
"learning_rate": 3.952838234606732e-06,
"loss": 6.857762145996094,
"step": 580
},
{
"epoch": 0.117,
"grad_norm": 0.07053842395544052,
"learning_rate": 3.951399731506761e-06,
"loss": 6.933798217773438,
"step": 585
},
{
"epoch": 0.118,
"grad_norm": 0.09034952521324158,
"learning_rate": 3.949939888211968e-06,
"loss": 6.888163757324219,
"step": 590
},
{
"epoch": 0.119,
"grad_norm": 0.10722323507070541,
"learning_rate": 3.948458720686966e-06,
"loss": 6.820646667480469,
"step": 595
},
{
"epoch": 0.12,
"grad_norm": 0.0687774196267128,
"learning_rate": 3.946956245129566e-06,
"loss": 6.872308349609375,
"step": 600
},
{
"epoch": 0.12,
"eval_accuracy": 0.13161660561660563,
"eval_loss": 6.804003715515137,
"eval_runtime": 10.4302,
"eval_samples_per_second": 9.588,
"eval_steps_per_second": 1.63,
"step": 600
},
{
"epoch": 0.121,
"grad_norm": 0.08994954824447632,
"learning_rate": 3.945432477970598e-06,
"loss": 6.806103515625,
"step": 605
},
{
"epoch": 0.122,
"grad_norm": 0.07370273023843765,
"learning_rate": 3.943887435873737e-06,
"loss": 6.822203063964844,
"step": 610
},
{
"epoch": 0.123,
"grad_norm": 0.07430048286914825,
"learning_rate": 3.942321135735316e-06,
"loss": 6.78031005859375,
"step": 615
},
{
"epoch": 0.124,
"grad_norm": 0.1099916398525238,
"learning_rate": 3.940733594684141e-06,
"loss": 6.9381248474121096,
"step": 620
},
{
"epoch": 0.125,
"grad_norm": 0.08312584459781647,
"learning_rate": 3.939124830081308e-06,
"loss": 6.797595977783203,
"step": 625
},
{
"epoch": 0.126,
"grad_norm": 0.06789983063936234,
"learning_rate": 3.937494859520009e-06,
"loss": 6.870149230957031,
"step": 630
},
{
"epoch": 0.127,
"grad_norm": 0.07728736847639084,
"learning_rate": 3.93584370082534e-06,
"loss": 6.83870849609375,
"step": 635
},
{
"epoch": 0.128,
"grad_norm": 0.0719357579946518,
"learning_rate": 3.934171372054108e-06,
"loss": 6.799946594238281,
"step": 640
},
{
"epoch": 0.129,
"grad_norm": 0.06783469766378403,
"learning_rate": 3.932477891494634e-06,
"loss": 6.865572357177735,
"step": 645
},
{
"epoch": 0.13,
"grad_norm": 0.0726066380739212,
"learning_rate": 3.930763277666547e-06,
"loss": 6.877969360351562,
"step": 650
},
{
"epoch": 0.131,
"grad_norm": 0.07925975322723389,
"learning_rate": 3.9290275493205925e-06,
"loss": 6.854046630859375,
"step": 655
},
{
"epoch": 0.132,
"grad_norm": 0.09406735748052597,
"learning_rate": 3.927270725438417e-06,
"loss": 6.818197631835938,
"step": 660
},
{
"epoch": 0.133,
"grad_norm": 0.07139192521572113,
"learning_rate": 3.925492825232363e-06,
"loss": 6.8501945495605465,
"step": 665
},
{
"epoch": 0.134,
"grad_norm": 0.07504747807979584,
"learning_rate": 3.923693868145263e-06,
"loss": 6.735340881347656,
"step": 670
},
{
"epoch": 0.135,
"grad_norm": 0.08873208612203598,
"learning_rate": 3.921873873850225e-06,
"loss": 6.871774291992187,
"step": 675
},
{
"epoch": 0.136,
"grad_norm": 0.06658565998077393,
"learning_rate": 3.920032862250413e-06,
"loss": 6.893667602539063,
"step": 680
},
{
"epoch": 0.137,
"grad_norm": 0.08774610608816147,
"learning_rate": 3.918170853478837e-06,
"loss": 6.7974403381347654,
"step": 685
},
{
"epoch": 0.138,
"grad_norm": 0.09726791083812714,
"learning_rate": 3.9162878678981245e-06,
"loss": 6.884765625,
"step": 690
},
{
"epoch": 0.139,
"grad_norm": 0.07077678292989731,
"learning_rate": 3.914383926100305e-06,
"loss": 6.812703704833984,
"step": 695
},
{
"epoch": 0.14,
"grad_norm": 0.07094477862119675,
"learning_rate": 3.912459048906582e-06,
"loss": 6.804354095458985,
"step": 700
},
{
"epoch": 0.141,
"grad_norm": 0.09806753695011139,
"learning_rate": 3.910513257367103e-06,
"loss": 6.849080657958984,
"step": 705
},
{
"epoch": 0.142,
"grad_norm": 0.18241384625434875,
"learning_rate": 3.908546572760732e-06,
"loss": 6.818512725830078,
"step": 710
},
{
"epoch": 0.143,
"grad_norm": 0.13180814683437347,
"learning_rate": 3.906559016594818e-06,
"loss": 6.707421875,
"step": 715
},
{
"epoch": 0.144,
"grad_norm": 0.12693838775157928,
"learning_rate": 3.904550610604957e-06,
"loss": 6.848756408691406,
"step": 720
},
{
"epoch": 0.145,
"grad_norm": 0.10394909232854843,
"learning_rate": 3.902521376754754e-06,
"loss": 6.815328979492188,
"step": 725
},
{
"epoch": 0.146,
"grad_norm": 0.07995420694351196,
"learning_rate": 3.900471337235584e-06,
"loss": 6.754273986816406,
"step": 730
},
{
"epoch": 0.147,
"grad_norm": 0.07130531221628189,
"learning_rate": 3.898400514466355e-06,
"loss": 6.76672134399414,
"step": 735
},
{
"epoch": 0.148,
"grad_norm": 0.09754687547683716,
"learning_rate": 3.896308931093249e-06,
"loss": 6.763739776611328,
"step": 740
},
{
"epoch": 0.149,
"grad_norm": 0.1489243358373642,
"learning_rate": 3.8941966099894884e-06,
"loss": 6.877587127685547,
"step": 745
},
{
"epoch": 0.15,
"grad_norm": 0.1504446268081665,
"learning_rate": 3.892063574255079e-06,
"loss": 6.799798583984375,
"step": 750
},
{
"epoch": 0.15,
"eval_accuracy": 0.13552625152625153,
"eval_loss": 6.6949238777160645,
"eval_runtime": 10.4885,
"eval_samples_per_second": 9.534,
"eval_steps_per_second": 1.621,
"step": 750
},
{
"epoch": 0.151,
"grad_norm": 0.09069617837667465,
"learning_rate": 3.889909847216555e-06,
"loss": 6.758820343017578,
"step": 755
},
{
"epoch": 0.152,
"grad_norm": 0.09917005896568298,
"learning_rate": 3.887735452426733e-06,
"loss": 6.7119590759277346,
"step": 760
},
{
"epoch": 0.153,
"grad_norm": 0.1238972544670105,
"learning_rate": 3.885540413664445e-06,
"loss": 6.766522979736328,
"step": 765
},
{
"epoch": 0.154,
"grad_norm": 0.07523474842309952,
"learning_rate": 3.8833247549342845e-06,
"loss": 6.868996429443359,
"step": 770
},
{
"epoch": 0.155,
"grad_norm": 0.06490049511194229,
"learning_rate": 3.8810885004663384e-06,
"loss": 6.904286193847656,
"step": 775
},
{
"epoch": 0.156,
"grad_norm": 0.08743885904550552,
"learning_rate": 3.878831674715929e-06,
"loss": 6.790882873535156,
"step": 780
},
{
"epoch": 0.157,
"grad_norm": 0.07870012521743774,
"learning_rate": 3.87655430236334e-06,
"loss": 6.777058410644531,
"step": 785
},
{
"epoch": 0.158,
"grad_norm": 0.07427074015140533,
"learning_rate": 3.87425640831355e-06,
"loss": 6.888807678222657,
"step": 790
},
{
"epoch": 0.159,
"grad_norm": 0.07057588547468185,
"learning_rate": 3.8719380176959615e-06,
"loss": 6.771605682373047,
"step": 795
},
{
"epoch": 0.16,
"grad_norm": 0.07889208197593689,
"learning_rate": 3.869599155864123e-06,
"loss": 6.67206039428711,
"step": 800
},
{
"epoch": 0.161,
"grad_norm": 0.07260162383317947,
"learning_rate": 3.867239848395452e-06,
"loss": 6.824806976318359,
"step": 805
},
{
"epoch": 0.162,
"grad_norm": 0.07244172692298889,
"learning_rate": 3.8648601210909575e-06,
"loss": 6.776896667480469,
"step": 810
},
{
"epoch": 0.163,
"grad_norm": 0.11525345593690872,
"learning_rate": 3.862459999974956e-06,
"loss": 6.852814483642578,
"step": 815
},
{
"epoch": 0.164,
"grad_norm": 0.0778544470667839,
"learning_rate": 3.860039511294787e-06,
"loss": 6.725788116455078,
"step": 820
},
{
"epoch": 0.165,
"grad_norm": 0.06785336136817932,
"learning_rate": 3.857598681520527e-06,
"loss": 6.7376350402832035,
"step": 825
},
{
"epoch": 0.166,
"grad_norm": 0.08495451509952545,
"learning_rate": 3.855137537344699e-06,
"loss": 6.7077491760253904,
"step": 830
},
{
"epoch": 0.167,
"grad_norm": 0.06992894411087036,
"learning_rate": 3.8526561056819825e-06,
"loss": 6.713374328613281,
"step": 835
},
{
"epoch": 0.168,
"grad_norm": 0.0781623125076294,
"learning_rate": 3.850154413668916e-06,
"loss": 6.7144775390625,
"step": 840
},
{
"epoch": 0.169,
"grad_norm": 0.0706086978316307,
"learning_rate": 3.847632488663602e-06,
"loss": 6.768795776367187,
"step": 845
},
{
"epoch": 0.17,
"grad_norm": 0.11462926864624023,
"learning_rate": 3.84509035824541e-06,
"loss": 6.714561462402344,
"step": 850
},
{
"epoch": 0.171,
"grad_norm": 0.06380539387464523,
"learning_rate": 3.842528050214669e-06,
"loss": 6.754435729980469,
"step": 855
},
{
"epoch": 0.172,
"grad_norm": 0.0771062970161438,
"learning_rate": 3.83994559259237e-06,
"loss": 6.693482208251953,
"step": 860
},
{
"epoch": 0.173,
"grad_norm": 0.07977370917797089,
"learning_rate": 3.837343013619856e-06,
"loss": 6.782911682128907,
"step": 865
},
{
"epoch": 0.174,
"grad_norm": 0.09431219846010208,
"learning_rate": 3.834720341758513e-06,
"loss": 6.771470642089843,
"step": 870
},
{
"epoch": 0.175,
"grad_norm": 0.16286598145961761,
"learning_rate": 3.832077605689461e-06,
"loss": 6.584927368164062,
"step": 875
},
{
"epoch": 0.176,
"grad_norm": 0.06504693627357483,
"learning_rate": 3.829414834313237e-06,
"loss": 6.703968811035156,
"step": 880
},
{
"epoch": 0.177,
"grad_norm": 0.08418609946966171,
"learning_rate": 3.826732056749485e-06,
"loss": 6.592996215820312,
"step": 885
},
{
"epoch": 0.178,
"grad_norm": 0.06050467491149902,
"learning_rate": 3.824029302336628e-06,
"loss": 6.760212707519531,
"step": 890
},
{
"epoch": 0.179,
"grad_norm": 0.08373371511697769,
"learning_rate": 3.821306600631556e-06,
"loss": 6.631327819824219,
"step": 895
},
{
"epoch": 0.18,
"grad_norm": 0.08372713625431061,
"learning_rate": 3.818563981409298e-06,
"loss": 6.716769409179688,
"step": 900
},
{
"epoch": 0.18,
"eval_accuracy": 0.13533333333333333,
"eval_loss": 6.627016544342041,
"eval_runtime": 10.3756,
"eval_samples_per_second": 9.638,
"eval_steps_per_second": 1.638,
"step": 900
},
{
"epoch": 0.181,
"grad_norm": 0.068506620824337,
"learning_rate": 3.8158014746627e-06,
"loss": 6.659144592285156,
"step": 905
},
{
"epoch": 0.182,
"grad_norm": 0.06771203130483627,
"learning_rate": 3.8130191106020916e-06,
"loss": 6.752458190917968,
"step": 910
},
{
"epoch": 0.183,
"grad_norm": 0.07365380972623825,
"learning_rate": 3.8102169196549606e-06,
"loss": 6.792449951171875,
"step": 915
},
{
"epoch": 0.184,
"grad_norm": 0.09057911485433578,
"learning_rate": 3.8073949324656187e-06,
"loss": 6.750059509277344,
"step": 920
},
{
"epoch": 0.185,
"grad_norm": 0.1145537868142128,
"learning_rate": 3.8045531798948662e-06,
"loss": 6.659918212890625,
"step": 925
},
{
"epoch": 0.186,
"grad_norm": 0.07206426560878754,
"learning_rate": 3.8016916930196535e-06,
"loss": 6.64384765625,
"step": 930
},
{
"epoch": 0.187,
"grad_norm": 0.08511226624250412,
"learning_rate": 3.798810503132742e-06,
"loss": 6.741066741943359,
"step": 935
},
{
"epoch": 0.188,
"grad_norm": 0.07708951085805893,
"learning_rate": 3.795909641742363e-06,
"loss": 6.7345428466796875,
"step": 940
},
{
"epoch": 0.189,
"grad_norm": 0.10781801491975784,
"learning_rate": 3.7929891405718725e-06,
"loss": 6.796640014648437,
"step": 945
},
{
"epoch": 0.19,
"grad_norm": 0.07551534473896027,
"learning_rate": 3.790049031559403e-06,
"loss": 6.666252899169922,
"step": 950
},
{
"epoch": 0.191,
"grad_norm": 0.0841158851981163,
"learning_rate": 3.787089346857515e-06,
"loss": 6.701302337646484,
"step": 955
},
{
"epoch": 0.192,
"grad_norm": 0.0862930417060852,
"learning_rate": 3.7841101188328477e-06,
"loss": 6.614484405517578,
"step": 960
},
{
"epoch": 0.193,
"grad_norm": 0.07389580458402634,
"learning_rate": 3.7811113800657597e-06,
"loss": 6.6798454284667965,
"step": 965
},
{
"epoch": 0.194,
"grad_norm": 0.07656016200780869,
"learning_rate": 3.778093163349979e-06,
"loss": 6.734007263183594,
"step": 970
},
{
"epoch": 0.195,
"grad_norm": 0.06616536527872086,
"learning_rate": 3.7750555016922397e-06,
"loss": 6.699456787109375,
"step": 975
},
{
"epoch": 0.196,
"grad_norm": 0.0683082565665245,
"learning_rate": 3.7719984283119227e-06,
"loss": 6.68050537109375,
"step": 980
},
{
"epoch": 0.197,
"grad_norm": 0.1232413798570633,
"learning_rate": 3.768921976640693e-06,
"loss": 6.699308776855469,
"step": 985
},
{
"epoch": 0.198,
"grad_norm": 0.07576856017112732,
"learning_rate": 3.7658261803221327e-06,
"loss": 6.67384033203125,
"step": 990
},
{
"epoch": 0.199,
"grad_norm": 0.11441260576248169,
"learning_rate": 3.7627110732113748e-06,
"loss": 6.6964164733886715,
"step": 995
},
{
"epoch": 0.2,
"grad_norm": 0.16522112488746643,
"learning_rate": 3.7595766893747325e-06,
"loss": 6.660438537597656,
"step": 1000
},
{
"epoch": 0.201,
"grad_norm": 0.08984258025884628,
"learning_rate": 3.7564230630893235e-06,
"loss": 6.695003509521484,
"step": 1005
},
{
"epoch": 0.202,
"grad_norm": 0.1421244740486145,
"learning_rate": 3.753250228842701e-06,
"loss": 6.6853515625,
"step": 1010
},
{
"epoch": 0.203,
"grad_norm": 0.07362934201955795,
"learning_rate": 3.7500582213324704e-06,
"loss": 6.669375610351563,
"step": 1015
},
{
"epoch": 0.204,
"grad_norm": 0.08078701794147491,
"learning_rate": 3.7468470754659164e-06,
"loss": 6.731100463867188,
"step": 1020
},
{
"epoch": 0.205,
"grad_norm": 0.07613933831453323,
"learning_rate": 3.743616826359614e-06,
"loss": 6.699374389648438,
"step": 1025
},
{
"epoch": 0.206,
"grad_norm": 0.0956382229924202,
"learning_rate": 3.740367509339051e-06,
"loss": 6.7087150573730465,
"step": 1030
},
{
"epoch": 0.207,
"grad_norm": 0.06961136311292648,
"learning_rate": 3.7370991599382374e-06,
"loss": 6.619333648681641,
"step": 1035
},
{
"epoch": 0.208,
"grad_norm": 0.08904080837965012,
"learning_rate": 3.7338118138993187e-06,
"loss": 6.6525390625,
"step": 1040
},
{
"epoch": 0.209,
"grad_norm": 0.08716033399105072,
"learning_rate": 3.7305055071721843e-06,
"loss": 6.656343078613281,
"step": 1045
},
{
"epoch": 0.21,
"grad_norm": 0.06856364011764526,
"learning_rate": 3.727180275914075e-06,
"loss": 6.584860992431641,
"step": 1050
},
{
"epoch": 0.21,
"eval_accuracy": 0.13902075702075703,
"eval_loss": 6.554867744445801,
"eval_runtime": 10.4147,
"eval_samples_per_second": 9.602,
"eval_steps_per_second": 1.632,
"step": 1050
},
{
"epoch": 0.211,
"grad_norm": 0.13052572309970856,
"learning_rate": 3.723836156489187e-06,
"loss": 6.7243499755859375,
"step": 1055
},
{
"epoch": 0.212,
"grad_norm": 0.09087914228439331,
"learning_rate": 3.7204731854682744e-06,
"loss": 6.679405975341797,
"step": 1060
},
{
"epoch": 0.213,
"grad_norm": 0.08263049274682999,
"learning_rate": 3.71709139962825e-06,
"loss": 6.654142761230469,
"step": 1065
},
{
"epoch": 0.214,
"grad_norm": 0.07467084378004074,
"learning_rate": 3.713690835951782e-06,
"loss": 6.614359283447266,
"step": 1070
},
{
"epoch": 0.215,
"grad_norm": 0.073064424097538,
"learning_rate": 3.710271531626889e-06,
"loss": 6.567655944824219,
"step": 1075
},
{
"epoch": 0.216,
"grad_norm": 0.06931977719068527,
"learning_rate": 3.706833524046536e-06,
"loss": 6.589354705810547,
"step": 1080
},
{
"epoch": 0.217,
"grad_norm": 0.07509584724903107,
"learning_rate": 3.703376850808223e-06,
"loss": 6.710356903076172,
"step": 1085
},
{
"epoch": 0.218,
"grad_norm": 0.09575289487838745,
"learning_rate": 3.699901549713575e-06,
"loss": 6.6289726257324215,
"step": 1090
},
{
"epoch": 0.219,
"grad_norm": 0.09864190220832825,
"learning_rate": 3.6964076587679268e-06,
"loss": 6.5806831359863285,
"step": 1095
},
{
"epoch": 0.22,
"grad_norm": 0.23898720741271973,
"learning_rate": 3.6928952161799113e-06,
"loss": 6.584079742431641,
"step": 1100
},
{
"epoch": 0.221,
"grad_norm": 0.12194394320249557,
"learning_rate": 3.6893642603610374e-06,
"loss": 6.62684326171875,
"step": 1105
},
{
"epoch": 0.222,
"grad_norm": 0.07811807841062546,
"learning_rate": 3.685814829925272e-06,
"loss": 6.622457122802734,
"step": 1110
},
{
"epoch": 0.223,
"grad_norm": 0.0715632289648056,
"learning_rate": 3.682246963688618e-06,
"loss": 6.651722717285156,
"step": 1115
},
{
"epoch": 0.224,
"grad_norm": 0.10769006609916687,
"learning_rate": 3.6786607006686895e-06,
"loss": 6.6332145690917965,
"step": 1120
},
{
"epoch": 0.225,
"grad_norm": 0.06909330189228058,
"learning_rate": 3.6750560800842837e-06,
"loss": 6.65299072265625,
"step": 1125
},
{
"epoch": 0.226,
"grad_norm": 0.07310458272695541,
"learning_rate": 3.671433141354953e-06,
"loss": 6.617790985107422,
"step": 1130
},
{
"epoch": 0.227,
"grad_norm": 0.0946388989686966,
"learning_rate": 3.667791924100576e-06,
"loss": 6.5729728698730465,
"step": 1135
},
{
"epoch": 0.228,
"grad_norm": 0.10393473505973816,
"learning_rate": 3.6641324681409215e-06,
"loss": 6.568301391601563,
"step": 1140
},
{
"epoch": 0.229,
"grad_norm": 0.06355820596218109,
"learning_rate": 3.6604548134952125e-06,
"loss": 6.632942199707031,
"step": 1145
},
{
"epoch": 0.23,
"grad_norm": 0.06845368444919586,
"learning_rate": 3.656759000381691e-06,
"loss": 6.537193298339844,
"step": 1150
},
{
"epoch": 0.231,
"grad_norm": 0.0652310699224472,
"learning_rate": 3.6530450692171787e-06,
"loss": 6.58575668334961,
"step": 1155
},
{
"epoch": 0.232,
"grad_norm": 0.07378797978162766,
"learning_rate": 3.64931306061663e-06,
"loss": 6.643540954589843,
"step": 1160
},
{
"epoch": 0.233,
"grad_norm": 0.07988571375608444,
"learning_rate": 3.6455630153926943e-06,
"loss": 6.519971466064453,
"step": 1165
},
{
"epoch": 0.234,
"grad_norm": 0.06847741454839706,
"learning_rate": 3.6417949745552638e-06,
"loss": 6.616749572753906,
"step": 1170
},
{
"epoch": 0.235,
"grad_norm": 0.09600138664245605,
"learning_rate": 3.6380089793110307e-06,
"loss": 6.599732971191406,
"step": 1175
},
{
"epoch": 0.236,
"grad_norm": 0.09037528187036514,
"learning_rate": 3.634205071063032e-06,
"loss": 6.518192291259766,
"step": 1180
},
{
"epoch": 0.237,
"grad_norm": 0.12540659308433533,
"learning_rate": 3.6303832914102e-06,
"loss": 6.674017333984375,
"step": 1185
},
{
"epoch": 0.238,
"grad_norm": 0.07415056228637695,
"learning_rate": 3.626543682146903e-06,
"loss": 6.6067352294921875,
"step": 1190
},
{
"epoch": 0.239,
"grad_norm": 0.084800586104393,
"learning_rate": 3.6226862852624927e-06,
"loss": 6.528235626220703,
"step": 1195
},
{
"epoch": 0.24,
"grad_norm": 0.0605861060321331,
"learning_rate": 3.6188111429408448e-06,
"loss": 6.609767913818359,
"step": 1200
},
{
"epoch": 0.24,
"eval_accuracy": 0.13638827838827838,
"eval_loss": 6.499367713928223,
"eval_runtime": 10.4681,
"eval_samples_per_second": 9.553,
"eval_steps_per_second": 1.624,
"step": 1200
},
{
"epoch": 0.241,
"grad_norm": 0.06398201733827591,
"learning_rate": 3.6149182975598944e-06,
"loss": 6.538330841064453,
"step": 1205
},
{
"epoch": 0.242,
"grad_norm": 0.10430450737476349,
"learning_rate": 3.6110077916911736e-06,
"loss": 6.606370544433593,
"step": 1210
},
{
"epoch": 0.243,
"grad_norm": 0.06399216502904892,
"learning_rate": 3.6070796680993503e-06,
"loss": 6.5816490173339846,
"step": 1215
},
{
"epoch": 0.244,
"grad_norm": 0.08809840679168701,
"learning_rate": 3.6031339697417533e-06,
"loss": 6.556430053710938,
"step": 1220
},
{
"epoch": 0.245,
"grad_norm": 0.0840051919221878,
"learning_rate": 3.599170739767907e-06,
"loss": 6.665988159179688,
"step": 1225
},
{
"epoch": 0.246,
"grad_norm": 0.08308332413434982,
"learning_rate": 3.5951900215190614e-06,
"loss": 6.544137573242187,
"step": 1230
},
{
"epoch": 0.247,
"grad_norm": 0.0652918890118599,
"learning_rate": 3.5911918585277125e-06,
"loss": 6.496437835693359,
"step": 1235
},
{
"epoch": 0.248,
"grad_norm": 0.07509986311197281,
"learning_rate": 3.58717629451713e-06,
"loss": 6.490621185302734,
"step": 1240
},
{
"epoch": 0.249,
"grad_norm": 0.09300875663757324,
"learning_rate": 3.583143373400879e-06,
"loss": 6.5218017578125,
"step": 1245
},
{
"epoch": 0.25,
"grad_norm": 0.09340658783912659,
"learning_rate": 3.5790931392823376e-06,
"loss": 6.703663635253906,
"step": 1250
},
{
"epoch": 0.251,
"grad_norm": 0.09822723269462585,
"learning_rate": 3.5750256364542196e-06,
"loss": 6.545758819580078,
"step": 1255
},
{
"epoch": 0.252,
"grad_norm": 0.07032929360866547,
"learning_rate": 3.5709409093980814e-06,
"loss": 6.586306762695313,
"step": 1260
},
{
"epoch": 0.253,
"grad_norm": 0.100587859749794,
"learning_rate": 3.5668390027838457e-06,
"loss": 6.500570678710938,
"step": 1265
},
{
"epoch": 0.254,
"grad_norm": 0.08588574081659317,
"learning_rate": 3.5627199614693055e-06,
"loss": 6.516835784912109,
"step": 1270
},
{
"epoch": 0.255,
"grad_norm": 0.05896945297718048,
"learning_rate": 3.5585838304996356e-06,
"loss": 6.462747192382812,
"step": 1275
},
{
"epoch": 0.256,
"grad_norm": 0.07021471858024597,
"learning_rate": 3.5544306551069037e-06,
"loss": 6.572966003417969,
"step": 1280
},
{
"epoch": 0.257,
"grad_norm": 0.09236051887273788,
"learning_rate": 3.5502604807095687e-06,
"loss": 6.615792083740234,
"step": 1285
},
{
"epoch": 0.258,
"grad_norm": 0.07293561100959778,
"learning_rate": 3.5460733529119908e-06,
"loss": 6.55091552734375,
"step": 1290
},
{
"epoch": 0.259,
"grad_norm": 0.0651378184556961,
"learning_rate": 3.541869317503928e-06,
"loss": 6.545086669921875,
"step": 1295
},
{
"epoch": 0.26,
"grad_norm": 0.0653856098651886,
"learning_rate": 3.537648420460038e-06,
"loss": 6.5654754638671875,
"step": 1300
},
{
"epoch": 0.261,
"grad_norm": 0.08197472244501114,
"learning_rate": 3.5334107079393755e-06,
"loss": 6.614053344726562,
"step": 1305
},
{
"epoch": 0.262,
"grad_norm": 0.07018602639436722,
"learning_rate": 3.5291562262848845e-06,
"loss": 6.489773559570312,
"step": 1310
},
{
"epoch": 0.263,
"grad_norm": 0.07549969106912613,
"learning_rate": 3.5248850220228957e-06,
"loss": 6.4777587890625,
"step": 1315
},
{
"epoch": 0.264,
"grad_norm": 0.07509016990661621,
"learning_rate": 3.5205971418626145e-06,
"loss": 6.554988861083984,
"step": 1320
},
{
"epoch": 0.265,
"grad_norm": 0.07180987298488617,
"learning_rate": 3.51629263269561e-06,
"loss": 6.668986511230469,
"step": 1325
},
{
"epoch": 0.266,
"grad_norm": 0.07208196818828583,
"learning_rate": 3.511971541595307e-06,
"loss": 6.480735778808594,
"step": 1330
},
{
"epoch": 0.267,
"grad_norm": 0.08938033133745193,
"learning_rate": 3.5076339158164635e-06,
"loss": 6.487246704101563,
"step": 1335
},
{
"epoch": 0.268,
"grad_norm": 0.0639733299612999,
"learning_rate": 3.503279802794662e-06,
"loss": 6.5667259216308596,
"step": 1340
},
{
"epoch": 0.269,
"grad_norm": 0.11628873646259308,
"learning_rate": 3.4989092501457832e-06,
"loss": 6.565748596191407,
"step": 1345
},
{
"epoch": 0.27,
"grad_norm": 0.0958283543586731,
"learning_rate": 3.4945223056654914e-06,
"loss": 6.564359283447265,
"step": 1350
},
{
"epoch": 0.27,
"eval_accuracy": 0.1386959706959707,
"eval_loss": 6.456244945526123,
"eval_runtime": 10.3332,
"eval_samples_per_second": 9.678,
"eval_steps_per_second": 1.645,
"step": 1350
},
{
"epoch": 0.271,
"grad_norm": 0.08361370116472244,
"learning_rate": 3.4901190173287086e-06,
"loss": 6.599095153808594,
"step": 1355
},
{
"epoch": 0.272,
"grad_norm": 0.07728071510791779,
"learning_rate": 3.48569943328909e-06,
"loss": 6.567552185058593,
"step": 1360
},
{
"epoch": 0.273,
"grad_norm": 0.23476524651050568,
"learning_rate": 3.4812636018784994e-06,
"loss": 6.519585418701172,
"step": 1365
},
{
"epoch": 0.274,
"grad_norm": 0.08214252442121506,
"learning_rate": 3.476811571606478e-06,
"loss": 6.542357635498047,
"step": 1370
},
{
"epoch": 0.275,
"grad_norm": 0.07677047699689865,
"learning_rate": 3.4723433911597163e-06,
"loss": 6.5419761657714846,
"step": 1375
},
{
"epoch": 0.276,
"grad_norm": 0.11742841452360153,
"learning_rate": 3.4678591094015187e-06,
"loss": 6.5219581604003904,
"step": 1380
},
{
"epoch": 0.277,
"grad_norm": 0.09686063230037689,
"learning_rate": 3.4633587753712717e-06,
"loss": 6.592768859863281,
"step": 1385
},
{
"epoch": 0.278,
"grad_norm": 0.09387538582086563,
"learning_rate": 3.458842438283909e-06,
"loss": 6.60013427734375,
"step": 1390
},
{
"epoch": 0.279,
"grad_norm": 0.0723787397146225,
"learning_rate": 3.4543101475293682e-06,
"loss": 6.4840553283691404,
"step": 1395
},
{
"epoch": 0.28,
"grad_norm": 0.06756219267845154,
"learning_rate": 3.449761952672055e-06,
"loss": 6.542083740234375,
"step": 1400
},
{
"epoch": 0.281,
"grad_norm": 0.0757589340209961,
"learning_rate": 3.4451979034502994e-06,
"loss": 6.548152923583984,
"step": 1405
},
{
"epoch": 0.282,
"grad_norm": 0.08698936551809311,
"learning_rate": 3.440618049775814e-06,
"loss": 6.562844085693359,
"step": 1410
},
{
"epoch": 0.283,
"grad_norm": 0.08987753838300705,
"learning_rate": 3.436022441733143e-06,
"loss": 6.502987670898437,
"step": 1415
},
{
"epoch": 0.284,
"grad_norm": 0.07419227808713913,
"learning_rate": 3.43141112957912e-06,
"loss": 6.47925033569336,
"step": 1420
},
{
"epoch": 0.285,
"grad_norm": 0.0743662565946579,
"learning_rate": 3.4267841637423166e-06,
"loss": 6.590135955810547,
"step": 1425
},
{
"epoch": 0.286,
"grad_norm": 0.09506815671920776,
"learning_rate": 3.422141594822489e-06,
"loss": 6.4904052734375,
"step": 1430
},
{
"epoch": 0.287,
"grad_norm": 0.06352763622999191,
"learning_rate": 3.4174834735900283e-06,
"loss": 6.492788696289063,
"step": 1435
},
{
"epoch": 0.288,
"grad_norm": 0.1327190101146698,
"learning_rate": 3.4128098509854014e-06,
"loss": 6.528990936279297,
"step": 1440
},
{
"epoch": 0.289,
"grad_norm": 0.1287909299135208,
"learning_rate": 3.4081207781185963e-06,
"loss": 6.511381530761719,
"step": 1445
},
{
"epoch": 0.29,
"grad_norm": 0.05822750926017761,
"learning_rate": 3.4034163062685623e-06,
"loss": 6.534752655029297,
"step": 1450
},
{
"epoch": 0.291,
"grad_norm": 0.08409831672906876,
"learning_rate": 3.3986964868826498e-06,
"loss": 6.494256591796875,
"step": 1455
},
{
"epoch": 0.292,
"grad_norm": 0.11647513508796692,
"learning_rate": 3.393961371576048e-06,
"loss": 6.531385040283203,
"step": 1460
},
{
"epoch": 0.293,
"grad_norm": 0.06273698806762695,
"learning_rate": 3.3892110121312196e-06,
"loss": 6.5295967102050785,
"step": 1465
},
{
"epoch": 0.294,
"grad_norm": 0.06390611082315445,
"learning_rate": 3.3844454604973327e-06,
"loss": 6.487610626220703,
"step": 1470
},
{
"epoch": 0.295,
"grad_norm": 0.0920199602842331,
"learning_rate": 3.3796647687896982e-06,
"loss": 6.561590576171875,
"step": 1475
},
{
"epoch": 0.296,
"grad_norm": 0.07950405776500702,
"learning_rate": 3.3748689892891945e-06,
"loss": 6.498722839355469,
"step": 1480
},
{
"epoch": 0.297,
"grad_norm": 0.0956474170088768,
"learning_rate": 3.3700581744416966e-06,
"loss": 6.526725006103516,
"step": 1485
},
{
"epoch": 0.298,
"grad_norm": 0.07354336977005005,
"learning_rate": 3.3652323768575066e-06,
"loss": 6.478034210205078,
"step": 1490
},
{
"epoch": 0.299,
"grad_norm": 0.07010781019926071,
"learning_rate": 3.360391649310772e-06,
"loss": 6.511841583251953,
"step": 1495
},
{
"epoch": 0.3,
"grad_norm": 0.07634287327528,
"learning_rate": 3.355536044738915e-06,
"loss": 6.506979370117188,
"step": 1500
},
{
"epoch": 0.3,
"eval_accuracy": 0.138991452991453,
"eval_loss": 6.424478530883789,
"eval_runtime": 10.3935,
"eval_samples_per_second": 9.621,
"eval_steps_per_second": 1.636,
"step": 1500
},
{
"epoch": 0.301,
"grad_norm": 0.07124020904302597,
"learning_rate": 3.3506656162420487e-06,
"loss": 6.548468780517578,
"step": 1505
},
{
"epoch": 0.302,
"grad_norm": 0.08137217909097672,
"learning_rate": 3.345780417082399e-06,
"loss": 6.5169837951660154,
"step": 1510
},
{
"epoch": 0.303,
"grad_norm": 0.07528692483901978,
"learning_rate": 3.3408805006837212e-06,
"loss": 6.5109718322753904,
"step": 1515
},
{
"epoch": 0.304,
"grad_norm": 0.09413464367389679,
"learning_rate": 3.335965920630716e-06,
"loss": 6.50414810180664,
"step": 1520
},
{
"epoch": 0.305,
"grad_norm": 0.11192154139280319,
"learning_rate": 3.3310367306684432e-06,
"loss": 6.555927276611328,
"step": 1525
},
{
"epoch": 0.306,
"grad_norm": 0.09222781658172607,
"learning_rate": 3.3260929847017352e-06,
"loss": 6.508258056640625,
"step": 1530
},
{
"epoch": 0.307,
"grad_norm": 0.0601465106010437,
"learning_rate": 3.3211347367946046e-06,
"loss": 6.509712219238281,
"step": 1535
},
{
"epoch": 0.308,
"grad_norm": 0.07379843294620514,
"learning_rate": 3.3161620411696573e-06,
"loss": 6.513530731201172,
"step": 1540
},
{
"epoch": 0.309,
"grad_norm": 0.07197915762662888,
"learning_rate": 3.311174952207496e-06,
"loss": 6.489860534667969,
"step": 1545
},
{
"epoch": 0.31,
"grad_norm": 0.0705137625336647,
"learning_rate": 3.3061735244461258e-06,
"loss": 6.491265106201172,
"step": 1550
},
{
"epoch": 0.311,
"grad_norm": 0.062279585748910904,
"learning_rate": 3.3011578125803596e-06,
"loss": 6.476299285888672,
"step": 1555
},
{
"epoch": 0.312,
"grad_norm": 0.07427375763654709,
"learning_rate": 3.2961278714612193e-06,
"loss": 6.456025695800781,
"step": 1560
},
{
"epoch": 0.313,
"grad_norm": 0.07860921323299408,
"learning_rate": 3.2910837560953345e-06,
"loss": 6.443370056152344,
"step": 1565
},
{
"epoch": 0.314,
"grad_norm": 0.0653812438249588,
"learning_rate": 3.2860255216443427e-06,
"loss": 6.486808013916016,
"step": 1570
},
{
"epoch": 0.315,
"grad_norm": 0.07543846219778061,
"learning_rate": 3.2809532234242863e-06,
"loss": 6.4591796875,
"step": 1575
},
{
"epoch": 0.316,
"grad_norm": 0.06522826105356216,
"learning_rate": 3.275866916905005e-06,
"loss": 6.500060272216797,
"step": 1580
},
{
"epoch": 0.317,
"grad_norm": 0.05764804780483246,
"learning_rate": 3.2707666577095326e-06,
"loss": 6.507598876953125,
"step": 1585
},
{
"epoch": 0.318,
"grad_norm": 0.0758504718542099,
"learning_rate": 3.265652501613486e-06,
"loss": 6.476622009277344,
"step": 1590
},
{
"epoch": 0.319,
"grad_norm": 0.06581117957830429,
"learning_rate": 3.2605245045444574e-06,
"loss": 6.449163818359375,
"step": 1595
},
{
"epoch": 0.32,
"grad_norm": 0.2182990163564682,
"learning_rate": 3.255382722581401e-06,
"loss": 6.435308837890625,
"step": 1600
},
{
"epoch": 0.321,
"grad_norm": 0.07734459638595581,
"learning_rate": 3.2502272119540204e-06,
"loss": 6.482182312011719,
"step": 1605
},
{
"epoch": 0.322,
"grad_norm": 0.09094393253326416,
"learning_rate": 3.245058029042154e-06,
"loss": 6.544580078125,
"step": 1610
},
{
"epoch": 0.323,
"grad_norm": 0.08472870290279388,
"learning_rate": 3.239875230375158e-06,
"loss": 6.462835693359375,
"step": 1615
},
{
"epoch": 0.324,
"grad_norm": 0.08265180140733719,
"learning_rate": 3.2346788726312887e-06,
"loss": 6.495674133300781,
"step": 1620
},
{
"epoch": 0.325,
"grad_norm": 0.10989709943532944,
"learning_rate": 3.2294690126370806e-06,
"loss": 6.509843444824218,
"step": 1625
},
{
"epoch": 0.326,
"grad_norm": 0.11295666545629501,
"learning_rate": 3.2242457073667287e-06,
"loss": 6.541798400878906,
"step": 1630
},
{
"epoch": 0.327,
"grad_norm": 0.08597501367330551,
"learning_rate": 3.2190090139414627e-06,
"loss": 6.481275177001953,
"step": 1635
},
{
"epoch": 0.328,
"grad_norm": 0.06690355390310287,
"learning_rate": 3.213758989628923e-06,
"loss": 6.45312271118164,
"step": 1640
},
{
"epoch": 0.329,
"grad_norm": 0.0718226209282875,
"learning_rate": 3.2084956918425335e-06,
"loss": 6.4438018798828125,
"step": 1645
},
{
"epoch": 0.33,
"grad_norm": 0.11290576308965683,
"learning_rate": 3.203219178140877e-06,
"loss": 6.5095054626464846,
"step": 1650
},
{
"epoch": 0.33,
"eval_accuracy": 0.14094505494505494,
"eval_loss": 6.380516529083252,
"eval_runtime": 10.3519,
"eval_samples_per_second": 9.66,
"eval_steps_per_second": 1.642,
"step": 1650
},
{
"epoch": 0.331,
"grad_norm": 0.06508518010377884,
"learning_rate": 3.1979295062270603e-06,
"loss": 6.427039337158203,
"step": 1655
},
{
"epoch": 0.332,
"grad_norm": 0.06661232560873032,
"learning_rate": 3.1926267339480895e-06,
"loss": 6.569775390625,
"step": 1660
},
{
"epoch": 0.333,
"grad_norm": 0.07158288359642029,
"learning_rate": 3.1873109192942307e-06,
"loss": 6.505144500732422,
"step": 1665
},
{
"epoch": 0.334,
"grad_norm": 0.06938688457012177,
"learning_rate": 3.1819821203983843e-06,
"loss": 6.410604858398438,
"step": 1670
},
{
"epoch": 0.335,
"grad_norm": 0.08378569036722183,
"learning_rate": 3.176640395535438e-06,
"loss": 6.493407440185547,
"step": 1675
},
{
"epoch": 0.336,
"grad_norm": 0.08100678771734238,
"learning_rate": 3.171285803121641e-06,
"loss": 6.4384620666503904,
"step": 1680
},
{
"epoch": 0.337,
"grad_norm": 0.07643549144268036,
"learning_rate": 3.165918401713958e-06,
"loss": 6.493080139160156,
"step": 1685
},
{
"epoch": 0.338,
"grad_norm": 0.0757737085223198,
"learning_rate": 3.16053825000943e-06,
"loss": 6.489937591552734,
"step": 1690
},
{
"epoch": 0.339,
"grad_norm": 0.0830363929271698,
"learning_rate": 3.155145406844535e-06,
"loss": 6.443827819824219,
"step": 1695
},
{
"epoch": 0.34,
"grad_norm": 0.09771528095006943,
"learning_rate": 3.1497399311945412e-06,
"loss": 6.492597961425782,
"step": 1700
},
{
"epoch": 0.341,
"grad_norm": 0.10129442065954208,
"learning_rate": 3.144321882172865e-06,
"loss": 6.537218475341797,
"step": 1705
},
{
"epoch": 0.342,
"grad_norm": 0.06285049766302109,
"learning_rate": 3.138891319030421e-06,
"loss": 6.446696472167969,
"step": 1710
},
{
"epoch": 0.343,
"grad_norm": 0.07542657852172852,
"learning_rate": 3.133448301154979e-06,
"loss": 6.419207000732422,
"step": 1715
},
{
"epoch": 0.344,
"grad_norm": 0.07626835256814957,
"learning_rate": 3.1279928880705104e-06,
"loss": 6.4702308654785154,
"step": 1720
},
{
"epoch": 0.345,
"grad_norm": 0.08218275755643845,
"learning_rate": 3.1225251394365383e-06,
"loss": 6.416409301757812,
"step": 1725
},
{
"epoch": 0.346,
"grad_norm": 0.07094059139490128,
"learning_rate": 3.1170451150474853e-06,
"loss": 6.4315032958984375,
"step": 1730
},
{
"epoch": 0.347,
"grad_norm": 0.07319115102291107,
"learning_rate": 3.1115528748320205e-06,
"loss": 6.402560424804688,
"step": 1735
},
{
"epoch": 0.348,
"grad_norm": 0.10192760825157166,
"learning_rate": 3.1060484788524034e-06,
"loss": 6.432094573974609,
"step": 1740
},
{
"epoch": 0.349,
"grad_norm": 0.07734037935733795,
"learning_rate": 3.100531987303826e-06,
"loss": 6.432294464111328,
"step": 1745
},
{
"epoch": 0.35,
"grad_norm": 0.07318601757287979,
"learning_rate": 3.0950034605137563e-06,
"loss": 6.447303009033203,
"step": 1750
},
{
"epoch": 0.351,
"grad_norm": 0.06598563492298126,
"learning_rate": 3.0894629589412776e-06,
"loss": 6.5047248840332035,
"step": 1755
},
{
"epoch": 0.352,
"grad_norm": 0.10212764143943787,
"learning_rate": 3.0839105431764273e-06,
"loss": 6.521588134765625,
"step": 1760
},
{
"epoch": 0.353,
"grad_norm": 0.0771833136677742,
"learning_rate": 3.0783462739395347e-06,
"loss": 6.516807556152344,
"step": 1765
},
{
"epoch": 0.354,
"grad_norm": 0.10352446138858795,
"learning_rate": 3.072770212080556e-06,
"loss": 6.434762573242187,
"step": 1770
},
{
"epoch": 0.355,
"grad_norm": 0.08731052279472351,
"learning_rate": 3.067182418578412e-06,
"loss": 6.497015380859375,
"step": 1775
},
{
"epoch": 0.356,
"grad_norm": 0.09280135482549667,
"learning_rate": 3.0615829545403154e-06,
"loss": 6.473223876953125,
"step": 1780
},
{
"epoch": 0.357,
"grad_norm": 0.07267135381698608,
"learning_rate": 3.055971881201109e-06,
"loss": 6.508274841308594,
"step": 1785
},
{
"epoch": 0.358,
"grad_norm": 0.06757643818855286,
"learning_rate": 3.0503492599225916e-06,
"loss": 6.476979827880859,
"step": 1790
},
{
"epoch": 0.359,
"grad_norm": 0.06268265843391418,
"learning_rate": 3.0447151521928475e-06,
"loss": 6.417572784423828,
"step": 1795
},
{
"epoch": 0.36,
"grad_norm": 0.0907832533121109,
"learning_rate": 3.0390696196255786e-06,
"loss": 6.457040405273437,
"step": 1800
},
{
"epoch": 0.36,
"eval_accuracy": 0.1416092796092796,
"eval_loss": 6.360020637512207,
"eval_runtime": 10.3268,
"eval_samples_per_second": 9.684,
"eval_steps_per_second": 1.646,
"step": 1800
},
{
"epoch": 0.361,
"grad_norm": 0.06729965656995773,
"learning_rate": 3.033412723959422e-06,
"loss": 6.357138442993164,
"step": 1805
},
{
"epoch": 0.362,
"grad_norm": 0.12906977534294128,
"learning_rate": 3.027744527057284e-06,
"loss": 6.433673858642578,
"step": 1810
},
{
"epoch": 0.363,
"grad_norm": 0.07005853205919266,
"learning_rate": 3.0220650909056574e-06,
"loss": 6.411043548583985,
"step": 1815
},
{
"epoch": 0.364,
"grad_norm": 0.07833214104175568,
"learning_rate": 3.0163744776139457e-06,
"loss": 6.432377624511719,
"step": 1820
},
{
"epoch": 0.365,
"grad_norm": 0.08222617954015732,
"learning_rate": 3.010672749413785e-06,
"loss": 6.4166709899902346,
"step": 1825
},
{
"epoch": 0.366,
"grad_norm": 0.07129046320915222,
"learning_rate": 3.00495996865836e-06,
"loss": 6.371786880493164,
"step": 1830
},
{
"epoch": 0.367,
"grad_norm": 0.07886160910129547,
"learning_rate": 2.999236197821727e-06,
"loss": 6.4869743347167965,
"step": 1835
},
{
"epoch": 0.368,
"grad_norm": 0.0706927478313446,
"learning_rate": 2.9935014994981264e-06,
"loss": 6.370818328857422,
"step": 1840
},
{
"epoch": 0.369,
"grad_norm": 0.06873773038387299,
"learning_rate": 2.9877559364013003e-06,
"loss": 6.457371520996094,
"step": 1845
},
{
"epoch": 0.37,
"grad_norm": 0.06985519826412201,
"learning_rate": 2.981999571363806e-06,
"loss": 6.5107368469238285,
"step": 1850
},
{
"epoch": 0.371,
"grad_norm": 0.07739956676959991,
"learning_rate": 2.9762324673363294e-06,
"loss": 6.502996826171875,
"step": 1855
},
{
"epoch": 0.372,
"grad_norm": 0.07745375484228134,
"learning_rate": 2.9704546873869973e-06,
"loss": 6.466319274902344,
"step": 1860
},
{
"epoch": 0.373,
"grad_norm": 0.07050798833370209,
"learning_rate": 2.964666294700683e-06,
"loss": 6.417623901367188,
"step": 1865
},
{
"epoch": 0.374,
"grad_norm": 0.08847381919622421,
"learning_rate": 2.9588673525783243e-06,
"loss": 6.471012878417969,
"step": 1870
},
{
"epoch": 0.375,
"grad_norm": 0.06258077919483185,
"learning_rate": 2.953057924436222e-06,
"loss": 6.468167114257812,
"step": 1875
},
{
"epoch": 0.376,
"grad_norm": 0.10755794495344162,
"learning_rate": 2.9472380738053507e-06,
"loss": 6.4053596496582035,
"step": 1880
},
{
"epoch": 0.377,
"grad_norm": 0.07566042244434357,
"learning_rate": 2.9414078643306656e-06,
"loss": 6.423107147216797,
"step": 1885
},
{
"epoch": 0.378,
"grad_norm": 0.06413055211305618,
"learning_rate": 2.935567359770402e-06,
"loss": 6.366802215576172,
"step": 1890
},
{
"epoch": 0.379,
"grad_norm": 0.07258564233779907,
"learning_rate": 2.929716623995384e-06,
"loss": 6.4979804992675785,
"step": 1895
},
{
"epoch": 0.38,
"grad_norm": 0.07089866697788239,
"learning_rate": 2.92385572098832e-06,
"loss": 6.426543426513672,
"step": 1900
},
{
"epoch": 0.381,
"grad_norm": 0.1062646433711052,
"learning_rate": 2.917984714843106e-06,
"loss": 6.410246276855469,
"step": 1905
},
{
"epoch": 0.382,
"grad_norm": 0.06609494239091873,
"learning_rate": 2.9121036697641246e-06,
"loss": 6.521483612060547,
"step": 1910
},
{
"epoch": 0.383,
"grad_norm": 0.10069076716899872,
"learning_rate": 2.9062126500655423e-06,
"loss": 6.415631103515625,
"step": 1915
},
{
"epoch": 0.384,
"grad_norm": 0.09040419012308121,
"learning_rate": 2.900311720170607e-06,
"loss": 6.462349700927734,
"step": 1920
},
{
"epoch": 0.385,
"grad_norm": 0.07208941876888275,
"learning_rate": 2.8944009446109422e-06,
"loss": 6.416206359863281,
"step": 1925
},
{
"epoch": 0.386,
"grad_norm": 0.07884255051612854,
"learning_rate": 2.888480388025844e-06,
"loss": 6.340870666503906,
"step": 1930
},
{
"epoch": 0.387,
"grad_norm": 0.0692768543958664,
"learning_rate": 2.8825501151615683e-06,
"loss": 6.401695251464844,
"step": 1935
},
{
"epoch": 0.388,
"grad_norm": 0.07506253570318222,
"learning_rate": 2.8766101908706305e-06,
"loss": 6.508678436279297,
"step": 1940
},
{
"epoch": 0.389,
"grad_norm": 0.0661938264966011,
"learning_rate": 2.8706606801110913e-06,
"loss": 6.381354141235351,
"step": 1945
},
{
"epoch": 0.39,
"grad_norm": 0.06145844608545303,
"learning_rate": 2.8647016479458466e-06,
"loss": 6.404244232177734,
"step": 1950
},
{
"epoch": 0.39,
"eval_accuracy": 0.14162881562881563,
"eval_loss": 6.339434623718262,
"eval_runtime": 10.2887,
"eval_samples_per_second": 9.719,
"eval_steps_per_second": 1.652,
"step": 1950
},
{
"epoch": 0.391,
"grad_norm": 0.07143565267324448,
"learning_rate": 2.858733159541917e-06,
"loss": 6.414325714111328,
"step": 1955
},
{
"epoch": 0.392,
"grad_norm": 0.09751276671886444,
"learning_rate": 2.8527552801697353e-06,
"loss": 6.454493713378906,
"step": 1960
},
{
"epoch": 0.393,
"grad_norm": 0.07358941435813904,
"learning_rate": 2.846768075202434e-06,
"loss": 6.389128494262695,
"step": 1965
},
{
"epoch": 0.394,
"grad_norm": 0.10593241453170776,
"learning_rate": 2.8407716101151263e-06,
"loss": 6.536373138427734,
"step": 1970
},
{
"epoch": 0.395,
"grad_norm": 0.08145789057016373,
"learning_rate": 2.834765950484194e-06,
"loss": 6.53704605102539,
"step": 1975
},
{
"epoch": 0.396,
"grad_norm": 0.08613098412752151,
"learning_rate": 2.8287511619865686e-06,
"loss": 6.46817626953125,
"step": 1980
},
{
"epoch": 0.397,
"grad_norm": 0.0659852847456932,
"learning_rate": 2.8227273103990125e-06,
"loss": 6.42239990234375,
"step": 1985
},
{
"epoch": 0.398,
"grad_norm": 0.07967545092105865,
"learning_rate": 2.8166944615974036e-06,
"loss": 6.402915191650391,
"step": 1990
},
{
"epoch": 0.399,
"grad_norm": 0.08329648524522781,
"learning_rate": 2.810652681556008e-06,
"loss": 6.374594116210938,
"step": 1995
},
{
"epoch": 0.4,
"grad_norm": 0.11066129803657532,
"learning_rate": 2.804602036346765e-06,
"loss": 6.40692138671875,
"step": 2000
},
{
"epoch": 0.401,
"grad_norm": 0.07232162356376648,
"learning_rate": 2.7985425921385614e-06,
"loss": 6.517178344726562,
"step": 2005
},
{
"epoch": 0.402,
"grad_norm": 0.08892683684825897,
"learning_rate": 2.7924744151965082e-06,
"loss": 6.389472198486328,
"step": 2010
},
{
"epoch": 0.403,
"grad_norm": 0.07714874297380447,
"learning_rate": 2.7863975718812157e-06,
"loss": 6.390988159179687,
"step": 2015
},
{
"epoch": 0.404,
"grad_norm": 0.07850048691034317,
"learning_rate": 2.7803121286480694e-06,
"loss": 6.434590148925781,
"step": 2020
},
{
"epoch": 0.405,
"grad_norm": 0.09433537721633911,
"learning_rate": 2.774218152046501e-06,
"loss": 6.42537841796875,
"step": 2025
},
{
"epoch": 0.406,
"grad_norm": 0.08464869856834412,
"learning_rate": 2.7681157087192627e-06,
"loss": 6.396466827392578,
"step": 2030
},
{
"epoch": 0.407,
"grad_norm": 0.07773975282907486,
"learning_rate": 2.7620048654016962e-06,
"loss": 6.33466796875,
"step": 2035
},
{
"epoch": 0.408,
"grad_norm": 0.07614398002624512,
"learning_rate": 2.7558856889210064e-06,
"loss": 6.456300354003906,
"step": 2040
},
{
"epoch": 0.409,
"grad_norm": 0.13619555532932281,
"learning_rate": 2.749758246195526e-06,
"loss": 6.360931396484375,
"step": 2045
},
{
"epoch": 0.41,
"grad_norm": 0.06665536761283875,
"learning_rate": 2.7436226042339875e-06,
"loss": 6.435082244873047,
"step": 2050
},
{
"epoch": 0.411,
"grad_norm": 0.07151633501052856,
"learning_rate": 2.737478830134787e-06,
"loss": 6.470430755615235,
"step": 2055
},
{
"epoch": 0.412,
"grad_norm": 0.06864432990550995,
"learning_rate": 2.7313269910852557e-06,
"loss": 6.375028228759765,
"step": 2060
},
{
"epoch": 0.413,
"grad_norm": 0.07884984463453293,
"learning_rate": 2.725167154360918e-06,
"loss": 6.419892120361328,
"step": 2065
},
{
"epoch": 0.414,
"grad_norm": 0.09694062173366547,
"learning_rate": 2.7189993873247627e-06,
"loss": 6.416704559326172,
"step": 2070
},
{
"epoch": 0.415,
"grad_norm": 0.08397479355335236,
"learning_rate": 2.712823757426501e-06,
"loss": 6.319974517822265,
"step": 2075
},
{
"epoch": 0.416,
"grad_norm": 0.07720082998275757,
"learning_rate": 2.706640332201834e-06,
"loss": 6.391875839233398,
"step": 2080
},
{
"epoch": 0.417,
"grad_norm": 0.07131435722112656,
"learning_rate": 2.700449179271706e-06,
"loss": 6.3818107604980465,
"step": 2085
},
{
"epoch": 0.418,
"grad_norm": 0.22894398868083954,
"learning_rate": 2.694250366341577e-06,
"loss": 6.468603515625,
"step": 2090
},
{
"epoch": 0.419,
"grad_norm": 0.08977403491735458,
"learning_rate": 2.688043961200669e-06,
"loss": 6.402335357666016,
"step": 2095
},
{
"epoch": 0.42,
"grad_norm": 0.06067352741956711,
"learning_rate": 2.681830031721236e-06,
"loss": 6.368752288818359,
"step": 2100
},
{
"epoch": 0.42,
"eval_accuracy": 0.1413943833943834,
"eval_loss": 6.312870979309082,
"eval_runtime": 10.3742,
"eval_samples_per_second": 9.639,
"eval_steps_per_second": 1.639,
"step": 2100
},
{
"epoch": 0.421,
"grad_norm": 0.08158699423074722,
"learning_rate": 2.675608645857815e-06,
"loss": 6.372353363037109,
"step": 2105
},
{
"epoch": 0.422,
"grad_norm": 0.06957968324422836,
"learning_rate": 2.6693798716464858e-06,
"loss": 6.340359497070312,
"step": 2110
},
{
"epoch": 0.423,
"grad_norm": 0.08563192933797836,
"learning_rate": 2.6631437772041238e-06,
"loss": 6.318928909301758,
"step": 2115
},
{
"epoch": 0.424,
"grad_norm": 0.11714059859514236,
"learning_rate": 2.656900430727659e-06,
"loss": 6.435954284667969,
"step": 2120
},
{
"epoch": 0.425,
"grad_norm": 0.11297214776277542,
"learning_rate": 2.650649900493329e-06,
"loss": 6.496327972412109,
"step": 2125
},
{
"epoch": 0.426,
"grad_norm": 0.08787044882774353,
"learning_rate": 2.6443922548559303e-06,
"loss": 6.389971160888672,
"step": 2130
},
{
"epoch": 0.427,
"grad_norm": 0.07244838774204254,
"learning_rate": 2.638127562248073e-06,
"loss": 6.446420288085937,
"step": 2135
},
{
"epoch": 0.428,
"grad_norm": 0.06608100235462189,
"learning_rate": 2.6318558911794333e-06,
"loss": 6.427850341796875,
"step": 2140
},
{
"epoch": 0.429,
"grad_norm": 0.07050882279872894,
"learning_rate": 2.625577310235998e-06,
"loss": 6.362213516235352,
"step": 2145
},
{
"epoch": 0.43,
"grad_norm": 0.08506868034601212,
"learning_rate": 2.619291888079326e-06,
"loss": 6.363969039916992,
"step": 2150
},
{
"epoch": 0.431,
"grad_norm": 0.08637284487485886,
"learning_rate": 2.612999693445784e-06,
"loss": 6.497118377685547,
"step": 2155
},
{
"epoch": 0.432,
"grad_norm": 0.10498792678117752,
"learning_rate": 2.606700795145807e-06,
"loss": 6.395422744750976,
"step": 2160
},
{
"epoch": 0.433,
"grad_norm": 0.0660381093621254,
"learning_rate": 2.6003952620631354e-06,
"loss": 6.355922698974609,
"step": 2165
},
{
"epoch": 0.434,
"grad_norm": 0.1197703629732132,
"learning_rate": 2.5940831631540697e-06,
"loss": 6.523306274414063,
"step": 2170
},
{
"epoch": 0.435,
"grad_norm": 0.1967087686061859,
"learning_rate": 2.5877645674467124e-06,
"loss": 6.463238525390625,
"step": 2175
},
{
"epoch": 0.436,
"grad_norm": 0.09303022921085358,
"learning_rate": 2.581439544040214e-06,
"loss": 6.421237182617188,
"step": 2180
},
{
"epoch": 0.437,
"grad_norm": 0.09917596727609634,
"learning_rate": 2.575108162104017e-06,
"loss": 6.473545074462891,
"step": 2185
},
{
"epoch": 0.438,
"grad_norm": 0.072263203561306,
"learning_rate": 2.568770490877099e-06,
"loss": 6.432736206054687,
"step": 2190
},
{
"epoch": 0.439,
"grad_norm": 0.1333879828453064,
"learning_rate": 2.5624265996672183e-06,
"loss": 6.448049926757813,
"step": 2195
},
{
"epoch": 0.44,
"grad_norm": 0.08322051167488098,
"learning_rate": 2.556076557850152e-06,
"loss": 6.379525375366211,
"step": 2200
},
{
"epoch": 0.441,
"grad_norm": 0.09212733060121536,
"learning_rate": 2.5497204348689403e-06,
"loss": 6.376298141479492,
"step": 2205
},
{
"epoch": 0.442,
"grad_norm": 0.1000766009092331,
"learning_rate": 2.5433583002331268e-06,
"loss": 6.45618896484375,
"step": 2210
},
{
"epoch": 0.443,
"grad_norm": 0.07744766026735306,
"learning_rate": 2.5369902235179948e-06,
"loss": 6.418743133544922,
"step": 2215
},
{
"epoch": 0.444,
"grad_norm": 0.09729813784360886,
"learning_rate": 2.530616274363813e-06,
"loss": 6.469072723388672,
"step": 2220
},
{
"epoch": 0.445,
"grad_norm": 0.10913117229938507,
"learning_rate": 2.5242365224750657e-06,
"loss": 6.3639171600341795,
"step": 2225
},
{
"epoch": 0.446,
"grad_norm": 0.07157459110021591,
"learning_rate": 2.5178510376196997e-06,
"loss": 6.399369430541992,
"step": 2230
},
{
"epoch": 0.447,
"grad_norm": 0.07375568896532059,
"learning_rate": 2.5114598896283524e-06,
"loss": 6.35676383972168,
"step": 2235
},
{
"epoch": 0.448,
"grad_norm": 0.09739139676094055,
"learning_rate": 2.505063148393595e-06,
"loss": 6.3606117248535154,
"step": 2240
},
{
"epoch": 0.449,
"grad_norm": 0.08083254098892212,
"learning_rate": 2.4986608838691663e-06,
"loss": 6.317353439331055,
"step": 2245
},
{
"epoch": 0.45,
"grad_norm": 0.07497039437294006,
"learning_rate": 2.4922531660692034e-06,
"loss": 6.349576187133789,
"step": 2250
},
{
"epoch": 0.45,
"eval_accuracy": 0.14222466422466423,
"eval_loss": 6.2949748039245605,
"eval_runtime": 10.4132,
"eval_samples_per_second": 9.603,
"eval_steps_per_second": 1.633,
"step": 2250
},
{
"epoch": 0.451,
"grad_norm": 0.0646035447716713,
"learning_rate": 2.4858400650674826e-06,
"loss": 6.4240165710449215,
"step": 2255
},
{
"epoch": 0.452,
"grad_norm": 0.08820938318967819,
"learning_rate": 2.4794216509966485e-06,
"loss": 6.355297470092774,
"step": 2260
},
{
"epoch": 0.453,
"grad_norm": 0.09034152328968048,
"learning_rate": 2.4729979940474495e-06,
"loss": 6.415824890136719,
"step": 2265
},
{
"epoch": 0.454,
"grad_norm": 0.07817864418029785,
"learning_rate": 2.4665691644679685e-06,
"loss": 6.402967071533203,
"step": 2270
},
{
"epoch": 0.455,
"grad_norm": 0.08539751917123795,
"learning_rate": 2.460135232562856e-06,
"loss": 6.40893783569336,
"step": 2275
},
{
"epoch": 0.456,
"grad_norm": 0.11367590725421906,
"learning_rate": 2.4536962686925595e-06,
"loss": 6.441493225097656,
"step": 2280
},
{
"epoch": 0.457,
"grad_norm": 0.09240754693746567,
"learning_rate": 2.4472523432725577e-06,
"loss": 6.361612319946289,
"step": 2285
},
{
"epoch": 0.458,
"grad_norm": 0.12638594210147858,
"learning_rate": 2.4408035267725862e-06,
"loss": 6.414551544189453,
"step": 2290
},
{
"epoch": 0.459,
"grad_norm": 0.10394217073917389,
"learning_rate": 2.434349889715869e-06,
"loss": 6.383968734741211,
"step": 2295
},
{
"epoch": 0.46,
"grad_norm": 0.12000339478254318,
"learning_rate": 2.4278915026783463e-06,
"loss": 6.412042236328125,
"step": 2300
},
{
"epoch": 0.461,
"grad_norm": 0.07175832241773605,
"learning_rate": 2.421428436287905e-06,
"loss": 6.3555866241455075,
"step": 2305
},
{
"epoch": 0.462,
"grad_norm": 0.10095806419849396,
"learning_rate": 2.4149607612236027e-06,
"loss": 6.40416259765625,
"step": 2310
},
{
"epoch": 0.463,
"grad_norm": 0.12205059826374054,
"learning_rate": 2.408488548214899e-06,
"loss": 6.329568862915039,
"step": 2315
},
{
"epoch": 0.464,
"grad_norm": 0.06791554391384125,
"learning_rate": 2.4020118680408777e-06,
"loss": 6.424092102050781,
"step": 2320
},
{
"epoch": 0.465,
"grad_norm": 0.08330659568309784,
"learning_rate": 2.395530791529475e-06,
"loss": 6.388699722290039,
"step": 2325
},
{
"epoch": 0.466,
"grad_norm": 0.10129342973232269,
"learning_rate": 2.389045389556706e-06,
"loss": 6.319640350341797,
"step": 2330
},
{
"epoch": 0.467,
"grad_norm": 0.07156874239444733,
"learning_rate": 2.3825557330458873e-06,
"loss": 6.517421722412109,
"step": 2335
},
{
"epoch": 0.468,
"grad_norm": 0.10998792201280594,
"learning_rate": 2.376061892966863e-06,
"loss": 6.415800476074219,
"step": 2340
},
{
"epoch": 0.469,
"grad_norm": 0.07388386875391006,
"learning_rate": 2.3695639403352275e-06,
"loss": 6.389354705810547,
"step": 2345
},
{
"epoch": 0.47,
"grad_norm": 0.07077425718307495,
"learning_rate": 2.36306194621155e-06,
"loss": 6.414984130859375,
"step": 2350
},
{
"epoch": 0.471,
"grad_norm": 0.1409406214952469,
"learning_rate": 2.3565559817005965e-06,
"loss": 6.4110252380371096,
"step": 2355
},
{
"epoch": 0.472,
"grad_norm": 0.12504221498966217,
"learning_rate": 2.350046117950552e-06,
"loss": 6.524173736572266,
"step": 2360
},
{
"epoch": 0.473,
"grad_norm": 0.09057491272687912,
"learning_rate": 2.3435324261522446e-06,
"loss": 6.359022521972657,
"step": 2365
},
{
"epoch": 0.474,
"grad_norm": 0.08076512813568115,
"learning_rate": 2.337014977538363e-06,
"loss": 6.364510345458984,
"step": 2370
},
{
"epoch": 0.475,
"grad_norm": 0.07883577793836594,
"learning_rate": 2.330493843382682e-06,
"loss": 6.344949340820312,
"step": 2375
},
{
"epoch": 0.476,
"grad_norm": 0.07244715094566345,
"learning_rate": 2.323969094999279e-06,
"loss": 6.497917938232422,
"step": 2380
},
{
"epoch": 0.477,
"grad_norm": 0.06551758199930191,
"learning_rate": 2.3174408037417577e-06,
"loss": 6.289946746826172,
"step": 2385
},
{
"epoch": 0.478,
"grad_norm": 0.08715993165969849,
"learning_rate": 2.310909041002466e-06,
"loss": 6.448321533203125,
"step": 2390
},
{
"epoch": 0.479,
"grad_norm": 0.08652404695749283,
"learning_rate": 2.3043738782117127e-06,
"loss": 6.329542922973633,
"step": 2395
},
{
"epoch": 0.48,
"grad_norm": 0.06743095815181732,
"learning_rate": 2.297835386836993e-06,
"loss": 6.365715026855469,
"step": 2400
},
{
"epoch": 0.48,
"eval_accuracy": 0.1423003663003663,
"eval_loss": 6.278029441833496,
"eval_runtime": 10.2925,
"eval_samples_per_second": 9.716,
"eval_steps_per_second": 1.652,
"step": 2400
}
],
"logging_steps": 5,
"max_steps": 5000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 300,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 6,
"trial_name": null,
"trial_params": null
}