CodeIsAbstract's picture
Training in progress, step 1500, checkpoint
b9ff3bc verified
Raw
History Blame
54.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.3,
"eval_steps": 150,
"global_step": 1500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.001,
"grad_norm": 0.27235767245292664,
"learning_rate": 6.4e-08,
"loss": 10.786966705322266,
"step": 5
},
{
"epoch": 0.002,
"grad_norm": 0.36470845341682434,
"learning_rate": 1.44e-07,
"loss": 10.004191589355468,
"step": 10
},
{
"epoch": 0.003,
"grad_norm": 0.18794603645801544,
"learning_rate": 2.24e-07,
"loss": 9.357711791992188,
"step": 15
},
{
"epoch": 0.004,
"grad_norm": 0.15133747458457947,
"learning_rate": 3.0399999999999997e-07,
"loss": 9.077755737304688,
"step": 20
},
{
"epoch": 0.005,
"grad_norm": 0.13880157470703125,
"learning_rate": 3.84e-07,
"loss": 8.826399993896484,
"step": 25
},
{
"epoch": 0.006,
"grad_norm": 0.12539362907409668,
"learning_rate": 4.64e-07,
"loss": 8.724310302734375,
"step": 30
},
{
"epoch": 0.007,
"grad_norm": 0.11178825795650482,
"learning_rate": 5.44e-07,
"loss": 8.595573425292969,
"step": 35
},
{
"epoch": 0.008,
"grad_norm": 0.16203832626342773,
"learning_rate": 6.24e-07,
"loss": 8.613536834716797,
"step": 40
},
{
"epoch": 0.009,
"grad_norm": 0.11954408138990402,
"learning_rate": 7.04e-07,
"loss": 8.435651397705078,
"step": 45
},
{
"epoch": 0.01,
"grad_norm": 0.09399693459272385,
"learning_rate": 7.84e-07,
"loss": 8.369234466552735,
"step": 50
},
{
"epoch": 0.011,
"grad_norm": 0.08723891526460648,
"learning_rate": 8.639999999999999e-07,
"loss": 8.335379791259765,
"step": 55
},
{
"epoch": 0.012,
"grad_norm": 0.09454073011875153,
"learning_rate": 9.439999999999999e-07,
"loss": 8.253787231445312,
"step": 60
},
{
"epoch": 0.013,
"grad_norm": 0.09540031850337982,
"learning_rate": 1.024e-06,
"loss": 8.186421966552734,
"step": 65
},
{
"epoch": 0.014,
"grad_norm": 0.11653102189302444,
"learning_rate": 1.1040000000000001e-06,
"loss": 8.132817840576172,
"step": 70
},
{
"epoch": 0.015,
"grad_norm": 0.08094990253448486,
"learning_rate": 1.1839999999999998e-06,
"loss": 8.107611846923827,
"step": 75
},
{
"epoch": 0.016,
"grad_norm": 0.10092103481292725,
"learning_rate": 1.2639999999999999e-06,
"loss": 8.071889495849609,
"step": 80
},
{
"epoch": 0.017,
"grad_norm": 0.09236462414264679,
"learning_rate": 1.344e-06,
"loss": 8.15390625,
"step": 85
},
{
"epoch": 0.018,
"grad_norm": 0.08973367512226105,
"learning_rate": 1.4239999999999998e-06,
"loss": 8.073948669433594,
"step": 90
},
{
"epoch": 0.019,
"grad_norm": 0.08046946674585342,
"learning_rate": 1.504e-06,
"loss": 7.942198944091797,
"step": 95
},
{
"epoch": 0.02,
"grad_norm": 0.07841245085000992,
"learning_rate": 1.584e-06,
"loss": 7.894329071044922,
"step": 100
},
{
"epoch": 0.021,
"grad_norm": 0.07948298752307892,
"learning_rate": 1.6639999999999999e-06,
"loss": 7.908601379394531,
"step": 105
},
{
"epoch": 0.022,
"grad_norm": 0.07720845937728882,
"learning_rate": 1.744e-06,
"loss": 7.923919677734375,
"step": 110
},
{
"epoch": 0.023,
"grad_norm": 0.09289873391389847,
"learning_rate": 1.824e-06,
"loss": 7.866429138183594,
"step": 115
},
{
"epoch": 0.024,
"grad_norm": 0.07957543432712555,
"learning_rate": 1.904e-06,
"loss": 7.828727722167969,
"step": 120
},
{
"epoch": 0.025,
"grad_norm": 0.07522212713956833,
"learning_rate": 1.984e-06,
"loss": 7.83117446899414,
"step": 125
},
{
"epoch": 0.026,
"grad_norm": 0.09532520920038223,
"learning_rate": 2.064e-06,
"loss": 7.8716987609863285,
"step": 130
},
{
"epoch": 0.027,
"grad_norm": 0.07470740377902985,
"learning_rate": 2.144e-06,
"loss": 7.834799194335938,
"step": 135
},
{
"epoch": 0.028,
"grad_norm": 0.07192815095186234,
"learning_rate": 2.2240000000000002e-06,
"loss": 7.736669921875,
"step": 140
},
{
"epoch": 0.029,
"grad_norm": 0.09201541543006897,
"learning_rate": 2.304e-06,
"loss": 7.6827842712402346,
"step": 145
},
{
"epoch": 0.03,
"grad_norm": 0.09225732833147049,
"learning_rate": 2.384e-06,
"loss": 7.745516967773438,
"step": 150
},
{
"epoch": 0.03,
"eval_accuracy": 0.11922344322344322,
"eval_loss": 7.651349067687988,
"eval_runtime": 10.4261,
"eval_samples_per_second": 9.591,
"eval_steps_per_second": 1.631,
"step": 150
},
{
"epoch": 0.031,
"grad_norm": 0.08881130814552307,
"learning_rate": 2.464e-06,
"loss": 7.674343872070312,
"step": 155
},
{
"epoch": 0.032,
"grad_norm": 0.07704972475767136,
"learning_rate": 2.544e-06,
"loss": 7.681053161621094,
"step": 160
},
{
"epoch": 0.033,
"grad_norm": 0.09186960011720657,
"learning_rate": 2.624e-06,
"loss": 7.690374755859375,
"step": 165
},
{
"epoch": 0.034,
"grad_norm": 0.08565036207437515,
"learning_rate": 2.704e-06,
"loss": 7.603900146484375,
"step": 170
},
{
"epoch": 0.035,
"grad_norm": 0.1499108374118805,
"learning_rate": 2.7839999999999995e-06,
"loss": 7.505958557128906,
"step": 175
},
{
"epoch": 0.036,
"grad_norm": 0.06643059849739075,
"learning_rate": 2.8639999999999996e-06,
"loss": 7.573754119873047,
"step": 180
},
{
"epoch": 0.037,
"grad_norm": 0.11821448802947998,
"learning_rate": 2.9439999999999997e-06,
"loss": 7.752062225341797,
"step": 185
},
{
"epoch": 0.038,
"grad_norm": 0.08827198296785355,
"learning_rate": 3.0239999999999998e-06,
"loss": 7.5669189453125,
"step": 190
},
{
"epoch": 0.039,
"grad_norm": 0.07519616931676865,
"learning_rate": 3.104e-06,
"loss": 7.571305847167968,
"step": 195
},
{
"epoch": 0.04,
"grad_norm": 0.075102798640728,
"learning_rate": 3.184e-06,
"loss": 7.518638610839844,
"step": 200
},
{
"epoch": 0.041,
"grad_norm": 0.10685888677835464,
"learning_rate": 3.2639999999999996e-06,
"loss": 7.512000274658203,
"step": 205
},
{
"epoch": 0.042,
"grad_norm": 0.10541684180498123,
"learning_rate": 3.3439999999999997e-06,
"loss": 7.564778137207031,
"step": 210
},
{
"epoch": 0.043,
"grad_norm": 0.09155019372701645,
"learning_rate": 3.4239999999999997e-06,
"loss": 7.4674217224121096,
"step": 215
},
{
"epoch": 0.044,
"grad_norm": 0.11373615264892578,
"learning_rate": 3.504e-06,
"loss": 7.450457000732422,
"step": 220
},
{
"epoch": 0.045,
"grad_norm": 0.07444982975721359,
"learning_rate": 3.584e-06,
"loss": 7.397786712646484,
"step": 225
},
{
"epoch": 0.046,
"grad_norm": 0.08052903413772583,
"learning_rate": 3.664e-06,
"loss": 7.415688323974609,
"step": 230
},
{
"epoch": 0.047,
"grad_norm": 0.08429361879825592,
"learning_rate": 3.744e-06,
"loss": 7.411205291748047,
"step": 235
},
{
"epoch": 0.048,
"grad_norm": 0.08501375466585159,
"learning_rate": 3.823999999999999e-06,
"loss": 7.406707763671875,
"step": 240
},
{
"epoch": 0.049,
"grad_norm": 0.10457716882228851,
"learning_rate": 3.903999999999999e-06,
"loss": 7.312602233886719,
"step": 245
},
{
"epoch": 0.05,
"grad_norm": 0.09624126553535461,
"learning_rate": 3.9839999999999995e-06,
"loss": 7.360851287841797,
"step": 250
},
{
"epoch": 0.051,
"grad_norm": 0.08660672605037689,
"learning_rate": 3.99999300106024e-06,
"loss": 7.353035736083984,
"step": 255
},
{
"epoch": 0.052,
"grad_norm": 0.08430126309394836,
"learning_rate": 3.9999645679514235e-06,
"loss": 7.384159088134766,
"step": 260
},
{
"epoch": 0.053,
"grad_norm": 0.07826503366231918,
"learning_rate": 3.999914263550513e-06,
"loss": 7.4195198059082035,
"step": 265
},
{
"epoch": 0.054,
"grad_norm": 0.08577796816825867,
"learning_rate": 3.9998420884076325e-06,
"loss": 7.362513732910156,
"step": 270
},
{
"epoch": 0.055,
"grad_norm": 0.0649741068482399,
"learning_rate": 3.999748043312075e-06,
"loss": 7.275961303710938,
"step": 275
},
{
"epoch": 0.056,
"grad_norm": 0.07203389704227448,
"learning_rate": 3.999632129292304e-06,
"loss": 7.263797760009766,
"step": 280
},
{
"epoch": 0.057,
"grad_norm": 0.12281067669391632,
"learning_rate": 3.9994943476159364e-06,
"loss": 7.287098693847656,
"step": 285
},
{
"epoch": 0.058,
"grad_norm": 0.07184985280036926,
"learning_rate": 3.999334699789731e-06,
"loss": 7.240232849121094,
"step": 290
},
{
"epoch": 0.059,
"grad_norm": 0.07799801975488663,
"learning_rate": 3.99915318755957e-06,
"loss": 7.2740531921386715,
"step": 295
},
{
"epoch": 0.06,
"grad_norm": 0.0761650875210762,
"learning_rate": 3.9989498129104425e-06,
"loss": 7.299461364746094,
"step": 300
},
{
"epoch": 0.06,
"eval_accuracy": 0.12382905982905983,
"eval_loss": 7.217157363891602,
"eval_runtime": 10.4259,
"eval_samples_per_second": 9.591,
"eval_steps_per_second": 1.631,
"step": 300
},
{
"epoch": 0.061,
"grad_norm": 0.0692087933421135,
"learning_rate": 3.998724578066421e-06,
"loss": 7.243695831298828,
"step": 305
},
{
"epoch": 0.062,
"grad_norm": 0.08431071788072586,
"learning_rate": 3.998477485490638e-06,
"loss": 7.292684173583984,
"step": 310
},
{
"epoch": 0.063,
"grad_norm": 0.08417057991027832,
"learning_rate": 3.998208537885259e-06,
"loss": 7.222378540039062,
"step": 315
},
{
"epoch": 0.064,
"grad_norm": 0.07904339581727982,
"learning_rate": 3.997917738191449e-06,
"loss": 7.278653717041015,
"step": 320
},
{
"epoch": 0.065,
"grad_norm": 0.13258706033229828,
"learning_rate": 3.99760508958935e-06,
"loss": 7.202552795410156,
"step": 325
},
{
"epoch": 0.066,
"grad_norm": 0.0901857390999794,
"learning_rate": 3.997270595498036e-06,
"loss": 7.205686950683594,
"step": 330
},
{
"epoch": 0.067,
"grad_norm": 0.07317949831485748,
"learning_rate": 3.99691425957548e-06,
"loss": 7.293389892578125,
"step": 335
},
{
"epoch": 0.068,
"grad_norm": 0.11255510151386261,
"learning_rate": 3.996536085718516e-06,
"loss": 7.229725646972656,
"step": 340
},
{
"epoch": 0.069,
"grad_norm": 0.07706659287214279,
"learning_rate": 3.996136078062792e-06,
"loss": 7.257555389404297,
"step": 345
},
{
"epoch": 0.07,
"grad_norm": 0.08863229304552078,
"learning_rate": 3.995714240982727e-06,
"loss": 7.257266235351563,
"step": 350
},
{
"epoch": 0.071,
"grad_norm": 0.08663391321897507,
"learning_rate": 3.995270579091465e-06,
"loss": 7.118687438964844,
"step": 355
},
{
"epoch": 0.072,
"grad_norm": 0.08917262405157089,
"learning_rate": 3.99480509724082e-06,
"loss": 7.238731384277344,
"step": 360
},
{
"epoch": 0.073,
"grad_norm": 0.09512999653816223,
"learning_rate": 3.994317800521228e-06,
"loss": 7.2104545593261715,
"step": 365
},
{
"epoch": 0.074,
"grad_norm": 0.10050003230571747,
"learning_rate": 3.993808694261687e-06,
"loss": 7.186836242675781,
"step": 370
},
{
"epoch": 0.075,
"grad_norm": 0.12758338451385498,
"learning_rate": 3.993277784029702e-06,
"loss": 7.171599578857422,
"step": 375
},
{
"epoch": 0.076,
"grad_norm": 0.08614124357700348,
"learning_rate": 3.992725075631223e-06,
"loss": 7.201605224609375,
"step": 380
},
{
"epoch": 0.077,
"grad_norm": 0.07332151383161545,
"learning_rate": 3.992150575110579e-06,
"loss": 7.026101684570312,
"step": 385
},
{
"epoch": 0.078,
"grad_norm": 0.0854375809431076,
"learning_rate": 3.991554288750416e-06,
"loss": 7.223291015625,
"step": 390
},
{
"epoch": 0.079,
"grad_norm": 0.09470361471176147,
"learning_rate": 3.990936223071627e-06,
"loss": 7.0966438293457035,
"step": 395
},
{
"epoch": 0.08,
"grad_norm": 0.06626710295677185,
"learning_rate": 3.990296384833279e-06,
"loss": 7.142760467529297,
"step": 400
},
{
"epoch": 0.081,
"grad_norm": 0.13561668992042542,
"learning_rate": 3.989634781032539e-06,
"loss": 7.0024574279785154,
"step": 405
},
{
"epoch": 0.082,
"grad_norm": 0.09113086760044098,
"learning_rate": 3.9889514189046015e-06,
"loss": 7.137001800537109,
"step": 410
},
{
"epoch": 0.083,
"grad_norm": 0.07085978239774704,
"learning_rate": 3.988246305922606e-06,
"loss": 7.029933929443359,
"step": 415
},
{
"epoch": 0.084,
"grad_norm": 0.06468215584754944,
"learning_rate": 3.987519449797554e-06,
"loss": 7.02655029296875,
"step": 420
},
{
"epoch": 0.085,
"grad_norm": 0.12091367691755295,
"learning_rate": 3.986770858478227e-06,
"loss": 7.116294097900391,
"step": 425
},
{
"epoch": 0.086,
"grad_norm": 0.10934042185544968,
"learning_rate": 3.986000540151101e-06,
"loss": 7.093238067626953,
"step": 430
},
{
"epoch": 0.087,
"grad_norm": 0.07274443656206131,
"learning_rate": 3.985208503240253e-06,
"loss": 7.123175048828125,
"step": 435
},
{
"epoch": 0.088,
"grad_norm": 0.0802014172077179,
"learning_rate": 3.9843947564072725e-06,
"loss": 7.188668060302734,
"step": 440
},
{
"epoch": 0.089,
"grad_norm": 0.06854639202356339,
"learning_rate": 3.983559308551164e-06,
"loss": 7.106547546386719,
"step": 445
},
{
"epoch": 0.09,
"grad_norm": 0.07703255116939545,
"learning_rate": 3.982702168808252e-06,
"loss": 7.064980316162109,
"step": 450
},
{
"epoch": 0.09,
"eval_accuracy": 0.12983638583638585,
"eval_loss": 6.963926315307617,
"eval_runtime": 10.3988,
"eval_samples_per_second": 9.616,
"eval_steps_per_second": 1.635,
"step": 450
},
{
"epoch": 0.091,
"grad_norm": 0.08548009395599365,
"learning_rate": 3.981823346552078e-06,
"loss": 7.028290557861328,
"step": 455
},
{
"epoch": 0.092,
"grad_norm": 0.08591306209564209,
"learning_rate": 3.980922851393302e-06,
"loss": 7.01605453491211,
"step": 460
},
{
"epoch": 0.093,
"grad_norm": 0.07920879870653152,
"learning_rate": 3.9800006931795954e-06,
"loss": 6.990329742431641,
"step": 465
},
{
"epoch": 0.094,
"grad_norm": 0.07192882895469666,
"learning_rate": 3.979056881995533e-06,
"loss": 6.953098297119141,
"step": 470
},
{
"epoch": 0.095,
"grad_norm": 0.06649420410394669,
"learning_rate": 3.978091428162482e-06,
"loss": 6.951087951660156,
"step": 475
},
{
"epoch": 0.096,
"grad_norm": 0.08228413760662079,
"learning_rate": 3.97710434223849e-06,
"loss": 7.034120178222656,
"step": 480
},
{
"epoch": 0.097,
"grad_norm": 0.10376594960689545,
"learning_rate": 3.976095635018172e-06,
"loss": 6.995967864990234,
"step": 485
},
{
"epoch": 0.098,
"grad_norm": 0.06993073225021362,
"learning_rate": 3.975065317532588e-06,
"loss": 6.952136993408203,
"step": 490
},
{
"epoch": 0.099,
"grad_norm": 0.08720093965530396,
"learning_rate": 3.974013401049125e-06,
"loss": 6.902699279785156,
"step": 495
},
{
"epoch": 0.1,
"grad_norm": 0.1016659289598465,
"learning_rate": 3.972939897071373e-06,
"loss": 6.927466583251953,
"step": 500
},
{
"epoch": 0.101,
"grad_norm": 0.06847221404314041,
"learning_rate": 3.971844817338999e-06,
"loss": 6.902294921875,
"step": 505
},
{
"epoch": 0.102,
"grad_norm": 0.07875518500804901,
"learning_rate": 3.97072817382762e-06,
"loss": 6.962755584716797,
"step": 510
},
{
"epoch": 0.103,
"grad_norm": 0.08157093822956085,
"learning_rate": 3.969589978748671e-06,
"loss": 6.956285095214843,
"step": 515
},
{
"epoch": 0.104,
"grad_norm": 0.08181696385145187,
"learning_rate": 3.968430244549271e-06,
"loss": 6.970890808105469,
"step": 520
},
{
"epoch": 0.105,
"grad_norm": 0.06938958913087845,
"learning_rate": 3.967248983912086e-06,
"loss": 6.917367553710937,
"step": 525
},
{
"epoch": 0.106,
"grad_norm": 0.10486883670091629,
"learning_rate": 3.966046209755195e-06,
"loss": 6.8495323181152346,
"step": 530
},
{
"epoch": 0.107,
"grad_norm": 0.08114153891801834,
"learning_rate": 3.964821935231942e-06,
"loss": 7.0064338684082035,
"step": 535
},
{
"epoch": 0.108,
"grad_norm": 0.07422944903373718,
"learning_rate": 3.963576173730798e-06,
"loss": 6.89477767944336,
"step": 540
},
{
"epoch": 0.109,
"grad_norm": 0.0750703290104866,
"learning_rate": 3.9623089388752105e-06,
"loss": 7.047392272949219,
"step": 545
},
{
"epoch": 0.11,
"grad_norm": 0.07453129440546036,
"learning_rate": 3.961020244523458e-06,
"loss": 6.892961883544922,
"step": 550
},
{
"epoch": 0.111,
"grad_norm": 0.08709228038787842,
"learning_rate": 3.959710104768493e-06,
"loss": 6.973309326171875,
"step": 555
},
{
"epoch": 0.112,
"grad_norm": 0.06008852645754814,
"learning_rate": 3.958378533937797e-06,
"loss": 6.845113372802734,
"step": 560
},
{
"epoch": 0.113,
"grad_norm": 0.09065559506416321,
"learning_rate": 3.957025546593213e-06,
"loss": 6.88427505493164,
"step": 565
},
{
"epoch": 0.114,
"grad_norm": 0.12213204056024551,
"learning_rate": 3.9556511575307956e-06,
"loss": 6.970057678222656,
"step": 570
},
{
"epoch": 0.115,
"grad_norm": 0.10695669054985046,
"learning_rate": 3.954255381780641e-06,
"loss": 6.839192199707031,
"step": 575
},
{
"epoch": 0.116,
"grad_norm": 0.07049612700939178,
"learning_rate": 3.952838234606732e-06,
"loss": 6.857762145996094,
"step": 580
},
{
"epoch": 0.117,
"grad_norm": 0.07053842395544052,
"learning_rate": 3.951399731506761e-06,
"loss": 6.933798217773438,
"step": 585
},
{
"epoch": 0.118,
"grad_norm": 0.09034952521324158,
"learning_rate": 3.949939888211968e-06,
"loss": 6.888163757324219,
"step": 590
},
{
"epoch": 0.119,
"grad_norm": 0.10722323507070541,
"learning_rate": 3.948458720686966e-06,
"loss": 6.820646667480469,
"step": 595
},
{
"epoch": 0.12,
"grad_norm": 0.0687774196267128,
"learning_rate": 3.946956245129566e-06,
"loss": 6.872308349609375,
"step": 600
},
{
"epoch": 0.12,
"eval_accuracy": 0.13161660561660563,
"eval_loss": 6.804003715515137,
"eval_runtime": 10.4302,
"eval_samples_per_second": 9.588,
"eval_steps_per_second": 1.63,
"step": 600
},
{
"epoch": 0.121,
"grad_norm": 0.08994954824447632,
"learning_rate": 3.945432477970598e-06,
"loss": 6.806103515625,
"step": 605
},
{
"epoch": 0.122,
"grad_norm": 0.07370273023843765,
"learning_rate": 3.943887435873737e-06,
"loss": 6.822203063964844,
"step": 610
},
{
"epoch": 0.123,
"grad_norm": 0.07430048286914825,
"learning_rate": 3.942321135735316e-06,
"loss": 6.78031005859375,
"step": 615
},
{
"epoch": 0.124,
"grad_norm": 0.1099916398525238,
"learning_rate": 3.940733594684141e-06,
"loss": 6.9381248474121096,
"step": 620
},
{
"epoch": 0.125,
"grad_norm": 0.08312584459781647,
"learning_rate": 3.939124830081308e-06,
"loss": 6.797595977783203,
"step": 625
},
{
"epoch": 0.126,
"grad_norm": 0.06789983063936234,
"learning_rate": 3.937494859520009e-06,
"loss": 6.870149230957031,
"step": 630
},
{
"epoch": 0.127,
"grad_norm": 0.07728736847639084,
"learning_rate": 3.93584370082534e-06,
"loss": 6.83870849609375,
"step": 635
},
{
"epoch": 0.128,
"grad_norm": 0.0719357579946518,
"learning_rate": 3.934171372054108e-06,
"loss": 6.799946594238281,
"step": 640
},
{
"epoch": 0.129,
"grad_norm": 0.06783469766378403,
"learning_rate": 3.932477891494634e-06,
"loss": 6.865572357177735,
"step": 645
},
{
"epoch": 0.13,
"grad_norm": 0.0726066380739212,
"learning_rate": 3.930763277666547e-06,
"loss": 6.877969360351562,
"step": 650
},
{
"epoch": 0.131,
"grad_norm": 0.07925975322723389,
"learning_rate": 3.9290275493205925e-06,
"loss": 6.854046630859375,
"step": 655
},
{
"epoch": 0.132,
"grad_norm": 0.09406735748052597,
"learning_rate": 3.927270725438417e-06,
"loss": 6.818197631835938,
"step": 660
},
{
"epoch": 0.133,
"grad_norm": 0.07139192521572113,
"learning_rate": 3.925492825232363e-06,
"loss": 6.8501945495605465,
"step": 665
},
{
"epoch": 0.134,
"grad_norm": 0.07504747807979584,
"learning_rate": 3.923693868145263e-06,
"loss": 6.735340881347656,
"step": 670
},
{
"epoch": 0.135,
"grad_norm": 0.08873208612203598,
"learning_rate": 3.921873873850225e-06,
"loss": 6.871774291992187,
"step": 675
},
{
"epoch": 0.136,
"grad_norm": 0.06658565998077393,
"learning_rate": 3.920032862250413e-06,
"loss": 6.893667602539063,
"step": 680
},
{
"epoch": 0.137,
"grad_norm": 0.08774610608816147,
"learning_rate": 3.918170853478837e-06,
"loss": 6.7974403381347654,
"step": 685
},
{
"epoch": 0.138,
"grad_norm": 0.09726791083812714,
"learning_rate": 3.9162878678981245e-06,
"loss": 6.884765625,
"step": 690
},
{
"epoch": 0.139,
"grad_norm": 0.07077678292989731,
"learning_rate": 3.914383926100305e-06,
"loss": 6.812703704833984,
"step": 695
},
{
"epoch": 0.14,
"grad_norm": 0.07094477862119675,
"learning_rate": 3.912459048906582e-06,
"loss": 6.804354095458985,
"step": 700
},
{
"epoch": 0.141,
"grad_norm": 0.09806753695011139,
"learning_rate": 3.910513257367103e-06,
"loss": 6.849080657958984,
"step": 705
},
{
"epoch": 0.142,
"grad_norm": 0.18241384625434875,
"learning_rate": 3.908546572760732e-06,
"loss": 6.818512725830078,
"step": 710
},
{
"epoch": 0.143,
"grad_norm": 0.13180814683437347,
"learning_rate": 3.906559016594818e-06,
"loss": 6.707421875,
"step": 715
},
{
"epoch": 0.144,
"grad_norm": 0.12693838775157928,
"learning_rate": 3.904550610604957e-06,
"loss": 6.848756408691406,
"step": 720
},
{
"epoch": 0.145,
"grad_norm": 0.10394909232854843,
"learning_rate": 3.902521376754754e-06,
"loss": 6.815328979492188,
"step": 725
},
{
"epoch": 0.146,
"grad_norm": 0.07995420694351196,
"learning_rate": 3.900471337235584e-06,
"loss": 6.754273986816406,
"step": 730
},
{
"epoch": 0.147,
"grad_norm": 0.07130531221628189,
"learning_rate": 3.898400514466355e-06,
"loss": 6.76672134399414,
"step": 735
},
{
"epoch": 0.148,
"grad_norm": 0.09754687547683716,
"learning_rate": 3.896308931093249e-06,
"loss": 6.763739776611328,
"step": 740
},
{
"epoch": 0.149,
"grad_norm": 0.1489243358373642,
"learning_rate": 3.8941966099894884e-06,
"loss": 6.877587127685547,
"step": 745
},
{
"epoch": 0.15,
"grad_norm": 0.1504446268081665,
"learning_rate": 3.892063574255079e-06,
"loss": 6.799798583984375,
"step": 750
},
{
"epoch": 0.15,
"eval_accuracy": 0.13552625152625153,
"eval_loss": 6.6949238777160645,
"eval_runtime": 10.4885,
"eval_samples_per_second": 9.534,
"eval_steps_per_second": 1.621,
"step": 750
},
{
"epoch": 0.151,
"grad_norm": 0.09069617837667465,
"learning_rate": 3.889909847216555e-06,
"loss": 6.758820343017578,
"step": 755
},
{
"epoch": 0.152,
"grad_norm": 0.09917005896568298,
"learning_rate": 3.887735452426733e-06,
"loss": 6.7119590759277346,
"step": 760
},
{
"epoch": 0.153,
"grad_norm": 0.1238972544670105,
"learning_rate": 3.885540413664445e-06,
"loss": 6.766522979736328,
"step": 765
},
{
"epoch": 0.154,
"grad_norm": 0.07523474842309952,
"learning_rate": 3.8833247549342845e-06,
"loss": 6.868996429443359,
"step": 770
},
{
"epoch": 0.155,
"grad_norm": 0.06490049511194229,
"learning_rate": 3.8810885004663384e-06,
"loss": 6.904286193847656,
"step": 775
},
{
"epoch": 0.156,
"grad_norm": 0.08743885904550552,
"learning_rate": 3.878831674715929e-06,
"loss": 6.790882873535156,
"step": 780
},
{
"epoch": 0.157,
"grad_norm": 0.07870012521743774,
"learning_rate": 3.87655430236334e-06,
"loss": 6.777058410644531,
"step": 785
},
{
"epoch": 0.158,
"grad_norm": 0.07427074015140533,
"learning_rate": 3.87425640831355e-06,
"loss": 6.888807678222657,
"step": 790
},
{
"epoch": 0.159,
"grad_norm": 0.07057588547468185,
"learning_rate": 3.8719380176959615e-06,
"loss": 6.771605682373047,
"step": 795
},
{
"epoch": 0.16,
"grad_norm": 0.07889208197593689,
"learning_rate": 3.869599155864123e-06,
"loss": 6.67206039428711,
"step": 800
},
{
"epoch": 0.161,
"grad_norm": 0.07260162383317947,
"learning_rate": 3.867239848395452e-06,
"loss": 6.824806976318359,
"step": 805
},
{
"epoch": 0.162,
"grad_norm": 0.07244172692298889,
"learning_rate": 3.8648601210909575e-06,
"loss": 6.776896667480469,
"step": 810
},
{
"epoch": 0.163,
"grad_norm": 0.11525345593690872,
"learning_rate": 3.862459999974956e-06,
"loss": 6.852814483642578,
"step": 815
},
{
"epoch": 0.164,
"grad_norm": 0.0778544470667839,
"learning_rate": 3.860039511294787e-06,
"loss": 6.725788116455078,
"step": 820
},
{
"epoch": 0.165,
"grad_norm": 0.06785336136817932,
"learning_rate": 3.857598681520527e-06,
"loss": 6.7376350402832035,
"step": 825
},
{
"epoch": 0.166,
"grad_norm": 0.08495451509952545,
"learning_rate": 3.855137537344699e-06,
"loss": 6.7077491760253904,
"step": 830
},
{
"epoch": 0.167,
"grad_norm": 0.06992894411087036,
"learning_rate": 3.8526561056819825e-06,
"loss": 6.713374328613281,
"step": 835
},
{
"epoch": 0.168,
"grad_norm": 0.0781623125076294,
"learning_rate": 3.850154413668916e-06,
"loss": 6.7144775390625,
"step": 840
},
{
"epoch": 0.169,
"grad_norm": 0.0706086978316307,
"learning_rate": 3.847632488663602e-06,
"loss": 6.768795776367187,
"step": 845
},
{
"epoch": 0.17,
"grad_norm": 0.11462926864624023,
"learning_rate": 3.84509035824541e-06,
"loss": 6.714561462402344,
"step": 850
},
{
"epoch": 0.171,
"grad_norm": 0.06380539387464523,
"learning_rate": 3.842528050214669e-06,
"loss": 6.754435729980469,
"step": 855
},
{
"epoch": 0.172,
"grad_norm": 0.0771062970161438,
"learning_rate": 3.83994559259237e-06,
"loss": 6.693482208251953,
"step": 860
},
{
"epoch": 0.173,
"grad_norm": 0.07977370917797089,
"learning_rate": 3.837343013619856e-06,
"loss": 6.782911682128907,
"step": 865
},
{
"epoch": 0.174,
"grad_norm": 0.09431219846010208,
"learning_rate": 3.834720341758513e-06,
"loss": 6.771470642089843,
"step": 870
},
{
"epoch": 0.175,
"grad_norm": 0.16286598145961761,
"learning_rate": 3.832077605689461e-06,
"loss": 6.584927368164062,
"step": 875
},
{
"epoch": 0.176,
"grad_norm": 0.06504693627357483,
"learning_rate": 3.829414834313237e-06,
"loss": 6.703968811035156,
"step": 880
},
{
"epoch": 0.177,
"grad_norm": 0.08418609946966171,
"learning_rate": 3.826732056749485e-06,
"loss": 6.592996215820312,
"step": 885
},
{
"epoch": 0.178,
"grad_norm": 0.06050467491149902,
"learning_rate": 3.824029302336628e-06,
"loss": 6.760212707519531,
"step": 890
},
{
"epoch": 0.179,
"grad_norm": 0.08373371511697769,
"learning_rate": 3.821306600631556e-06,
"loss": 6.631327819824219,
"step": 895
},
{
"epoch": 0.18,
"grad_norm": 0.08372713625431061,
"learning_rate": 3.818563981409298e-06,
"loss": 6.716769409179688,
"step": 900
},
{
"epoch": 0.18,
"eval_accuracy": 0.13533333333333333,
"eval_loss": 6.627016544342041,
"eval_runtime": 10.3756,
"eval_samples_per_second": 9.638,
"eval_steps_per_second": 1.638,
"step": 900
},
{
"epoch": 0.181,
"grad_norm": 0.068506620824337,
"learning_rate": 3.8158014746627e-06,
"loss": 6.659144592285156,
"step": 905
},
{
"epoch": 0.182,
"grad_norm": 0.06771203130483627,
"learning_rate": 3.8130191106020916e-06,
"loss": 6.752458190917968,
"step": 910
},
{
"epoch": 0.183,
"grad_norm": 0.07365380972623825,
"learning_rate": 3.8102169196549606e-06,
"loss": 6.792449951171875,
"step": 915
},
{
"epoch": 0.184,
"grad_norm": 0.09057911485433578,
"learning_rate": 3.8073949324656187e-06,
"loss": 6.750059509277344,
"step": 920
},
{
"epoch": 0.185,
"grad_norm": 0.1145537868142128,
"learning_rate": 3.8045531798948662e-06,
"loss": 6.659918212890625,
"step": 925
},
{
"epoch": 0.186,
"grad_norm": 0.07206426560878754,
"learning_rate": 3.8016916930196535e-06,
"loss": 6.64384765625,
"step": 930
},
{
"epoch": 0.187,
"grad_norm": 0.08511226624250412,
"learning_rate": 3.798810503132742e-06,
"loss": 6.741066741943359,
"step": 935
},
{
"epoch": 0.188,
"grad_norm": 0.07708951085805893,
"learning_rate": 3.795909641742363e-06,
"loss": 6.7345428466796875,
"step": 940
},
{
"epoch": 0.189,
"grad_norm": 0.10781801491975784,
"learning_rate": 3.7929891405718725e-06,
"loss": 6.796640014648437,
"step": 945
},
{
"epoch": 0.19,
"grad_norm": 0.07551534473896027,
"learning_rate": 3.790049031559403e-06,
"loss": 6.666252899169922,
"step": 950
},
{
"epoch": 0.191,
"grad_norm": 0.0841158851981163,
"learning_rate": 3.787089346857515e-06,
"loss": 6.701302337646484,
"step": 955
},
{
"epoch": 0.192,
"grad_norm": 0.0862930417060852,
"learning_rate": 3.7841101188328477e-06,
"loss": 6.614484405517578,
"step": 960
},
{
"epoch": 0.193,
"grad_norm": 0.07389580458402634,
"learning_rate": 3.7811113800657597e-06,
"loss": 6.6798454284667965,
"step": 965
},
{
"epoch": 0.194,
"grad_norm": 0.07656016200780869,
"learning_rate": 3.778093163349979e-06,
"loss": 6.734007263183594,
"step": 970
},
{
"epoch": 0.195,
"grad_norm": 0.06616536527872086,
"learning_rate": 3.7750555016922397e-06,
"loss": 6.699456787109375,
"step": 975
},
{
"epoch": 0.196,
"grad_norm": 0.0683082565665245,
"learning_rate": 3.7719984283119227e-06,
"loss": 6.68050537109375,
"step": 980
},
{
"epoch": 0.197,
"grad_norm": 0.1232413798570633,
"learning_rate": 3.768921976640693e-06,
"loss": 6.699308776855469,
"step": 985
},
{
"epoch": 0.198,
"grad_norm": 0.07576856017112732,
"learning_rate": 3.7658261803221327e-06,
"loss": 6.67384033203125,
"step": 990
},
{
"epoch": 0.199,
"grad_norm": 0.11441260576248169,
"learning_rate": 3.7627110732113748e-06,
"loss": 6.6964164733886715,
"step": 995
},
{
"epoch": 0.2,
"grad_norm": 0.16522112488746643,
"learning_rate": 3.7595766893747325e-06,
"loss": 6.660438537597656,
"step": 1000
},
{
"epoch": 0.201,
"grad_norm": 0.08984258025884628,
"learning_rate": 3.7564230630893235e-06,
"loss": 6.695003509521484,
"step": 1005
},
{
"epoch": 0.202,
"grad_norm": 0.1421244740486145,
"learning_rate": 3.753250228842701e-06,
"loss": 6.6853515625,
"step": 1010
},
{
"epoch": 0.203,
"grad_norm": 0.07362934201955795,
"learning_rate": 3.7500582213324704e-06,
"loss": 6.669375610351563,
"step": 1015
},
{
"epoch": 0.204,
"grad_norm": 0.08078701794147491,
"learning_rate": 3.7468470754659164e-06,
"loss": 6.731100463867188,
"step": 1020
},
{
"epoch": 0.205,
"grad_norm": 0.07613933831453323,
"learning_rate": 3.743616826359614e-06,
"loss": 6.699374389648438,
"step": 1025
},
{
"epoch": 0.206,
"grad_norm": 0.0956382229924202,
"learning_rate": 3.740367509339051e-06,
"loss": 6.7087150573730465,
"step": 1030
},
{
"epoch": 0.207,
"grad_norm": 0.06961136311292648,
"learning_rate": 3.7370991599382374e-06,
"loss": 6.619333648681641,
"step": 1035
},
{
"epoch": 0.208,
"grad_norm": 0.08904080837965012,
"learning_rate": 3.7338118138993187e-06,
"loss": 6.6525390625,
"step": 1040
},
{
"epoch": 0.209,
"grad_norm": 0.08716033399105072,
"learning_rate": 3.7305055071721843e-06,
"loss": 6.656343078613281,
"step": 1045
},
{
"epoch": 0.21,
"grad_norm": 0.06856364011764526,
"learning_rate": 3.727180275914075e-06,
"loss": 6.584860992431641,
"step": 1050
},
{
"epoch": 0.21,
"eval_accuracy": 0.13902075702075703,
"eval_loss": 6.554867744445801,
"eval_runtime": 10.4147,
"eval_samples_per_second": 9.602,
"eval_steps_per_second": 1.632,
"step": 1050
},
{
"epoch": 0.211,
"grad_norm": 0.13052572309970856,
"learning_rate": 3.723836156489187e-06,
"loss": 6.7243499755859375,
"step": 1055
},
{
"epoch": 0.212,
"grad_norm": 0.09087914228439331,
"learning_rate": 3.7204731854682744e-06,
"loss": 6.679405975341797,
"step": 1060
},
{
"epoch": 0.213,
"grad_norm": 0.08263049274682999,
"learning_rate": 3.71709139962825e-06,
"loss": 6.654142761230469,
"step": 1065
},
{
"epoch": 0.214,
"grad_norm": 0.07467084378004074,
"learning_rate": 3.713690835951782e-06,
"loss": 6.614359283447266,
"step": 1070
},
{
"epoch": 0.215,
"grad_norm": 0.073064424097538,
"learning_rate": 3.710271531626889e-06,
"loss": 6.567655944824219,
"step": 1075
},
{
"epoch": 0.216,
"grad_norm": 0.06931977719068527,
"learning_rate": 3.706833524046536e-06,
"loss": 6.589354705810547,
"step": 1080
},
{
"epoch": 0.217,
"grad_norm": 0.07509584724903107,
"learning_rate": 3.703376850808223e-06,
"loss": 6.710356903076172,
"step": 1085
},
{
"epoch": 0.218,
"grad_norm": 0.09575289487838745,
"learning_rate": 3.699901549713575e-06,
"loss": 6.6289726257324215,
"step": 1090
},
{
"epoch": 0.219,
"grad_norm": 0.09864190220832825,
"learning_rate": 3.6964076587679268e-06,
"loss": 6.5806831359863285,
"step": 1095
},
{
"epoch": 0.22,
"grad_norm": 0.23898720741271973,
"learning_rate": 3.6928952161799113e-06,
"loss": 6.584079742431641,
"step": 1100
},
{
"epoch": 0.221,
"grad_norm": 0.12194394320249557,
"learning_rate": 3.6893642603610374e-06,
"loss": 6.62684326171875,
"step": 1105
},
{
"epoch": 0.222,
"grad_norm": 0.07811807841062546,
"learning_rate": 3.685814829925272e-06,
"loss": 6.622457122802734,
"step": 1110
},
{
"epoch": 0.223,
"grad_norm": 0.0715632289648056,
"learning_rate": 3.682246963688618e-06,
"loss": 6.651722717285156,
"step": 1115
},
{
"epoch": 0.224,
"grad_norm": 0.10769006609916687,
"learning_rate": 3.6786607006686895e-06,
"loss": 6.6332145690917965,
"step": 1120
},
{
"epoch": 0.225,
"grad_norm": 0.06909330189228058,
"learning_rate": 3.6750560800842837e-06,
"loss": 6.65299072265625,
"step": 1125
},
{
"epoch": 0.226,
"grad_norm": 0.07310458272695541,
"learning_rate": 3.671433141354953e-06,
"loss": 6.617790985107422,
"step": 1130
},
{
"epoch": 0.227,
"grad_norm": 0.0946388989686966,
"learning_rate": 3.667791924100576e-06,
"loss": 6.5729728698730465,
"step": 1135
},
{
"epoch": 0.228,
"grad_norm": 0.10393473505973816,
"learning_rate": 3.6641324681409215e-06,
"loss": 6.568301391601563,
"step": 1140
},
{
"epoch": 0.229,
"grad_norm": 0.06355820596218109,
"learning_rate": 3.6604548134952125e-06,
"loss": 6.632942199707031,
"step": 1145
},
{
"epoch": 0.23,
"grad_norm": 0.06845368444919586,
"learning_rate": 3.656759000381691e-06,
"loss": 6.537193298339844,
"step": 1150
},
{
"epoch": 0.231,
"grad_norm": 0.0652310699224472,
"learning_rate": 3.6530450692171787e-06,
"loss": 6.58575668334961,
"step": 1155
},
{
"epoch": 0.232,
"grad_norm": 0.07378797978162766,
"learning_rate": 3.64931306061663e-06,
"loss": 6.643540954589843,
"step": 1160
},
{
"epoch": 0.233,
"grad_norm": 0.07988571375608444,
"learning_rate": 3.6455630153926943e-06,
"loss": 6.519971466064453,
"step": 1165
},
{
"epoch": 0.234,
"grad_norm": 0.06847741454839706,
"learning_rate": 3.6417949745552638e-06,
"loss": 6.616749572753906,
"step": 1170
},
{
"epoch": 0.235,
"grad_norm": 0.09600138664245605,
"learning_rate": 3.6380089793110307e-06,
"loss": 6.599732971191406,
"step": 1175
},
{
"epoch": 0.236,
"grad_norm": 0.09037528187036514,
"learning_rate": 3.634205071063032e-06,
"loss": 6.518192291259766,
"step": 1180
},
{
"epoch": 0.237,
"grad_norm": 0.12540659308433533,
"learning_rate": 3.6303832914102e-06,
"loss": 6.674017333984375,
"step": 1185
},
{
"epoch": 0.238,
"grad_norm": 0.07415056228637695,
"learning_rate": 3.626543682146903e-06,
"loss": 6.6067352294921875,
"step": 1190
},
{
"epoch": 0.239,
"grad_norm": 0.084800586104393,
"learning_rate": 3.6226862852624927e-06,
"loss": 6.528235626220703,
"step": 1195
},
{
"epoch": 0.24,
"grad_norm": 0.0605861060321331,
"learning_rate": 3.6188111429408448e-06,
"loss": 6.609767913818359,
"step": 1200
},
{
"epoch": 0.24,
"eval_accuracy": 0.13638827838827838,
"eval_loss": 6.499367713928223,
"eval_runtime": 10.4681,
"eval_samples_per_second": 9.553,
"eval_steps_per_second": 1.624,
"step": 1200
},
{
"epoch": 0.241,
"grad_norm": 0.06398201733827591,
"learning_rate": 3.6149182975598944e-06,
"loss": 6.538330841064453,
"step": 1205
},
{
"epoch": 0.242,
"grad_norm": 0.10430450737476349,
"learning_rate": 3.6110077916911736e-06,
"loss": 6.606370544433593,
"step": 1210
},
{
"epoch": 0.243,
"grad_norm": 0.06399216502904892,
"learning_rate": 3.6070796680993503e-06,
"loss": 6.5816490173339846,
"step": 1215
},
{
"epoch": 0.244,
"grad_norm": 0.08809840679168701,
"learning_rate": 3.6031339697417533e-06,
"loss": 6.556430053710938,
"step": 1220
},
{
"epoch": 0.245,
"grad_norm": 0.0840051919221878,
"learning_rate": 3.599170739767907e-06,
"loss": 6.665988159179688,
"step": 1225
},
{
"epoch": 0.246,
"grad_norm": 0.08308332413434982,
"learning_rate": 3.5951900215190614e-06,
"loss": 6.544137573242187,
"step": 1230
},
{
"epoch": 0.247,
"grad_norm": 0.0652918890118599,
"learning_rate": 3.5911918585277125e-06,
"loss": 6.496437835693359,
"step": 1235
},
{
"epoch": 0.248,
"grad_norm": 0.07509986311197281,
"learning_rate": 3.58717629451713e-06,
"loss": 6.490621185302734,
"step": 1240
},
{
"epoch": 0.249,
"grad_norm": 0.09300875663757324,
"learning_rate": 3.583143373400879e-06,
"loss": 6.5218017578125,
"step": 1245
},
{
"epoch": 0.25,
"grad_norm": 0.09340658783912659,
"learning_rate": 3.5790931392823376e-06,
"loss": 6.703663635253906,
"step": 1250
},
{
"epoch": 0.251,
"grad_norm": 0.09822723269462585,
"learning_rate": 3.5750256364542196e-06,
"loss": 6.545758819580078,
"step": 1255
},
{
"epoch": 0.252,
"grad_norm": 0.07032929360866547,
"learning_rate": 3.5709409093980814e-06,
"loss": 6.586306762695313,
"step": 1260
},
{
"epoch": 0.253,
"grad_norm": 0.100587859749794,
"learning_rate": 3.5668390027838457e-06,
"loss": 6.500570678710938,
"step": 1265
},
{
"epoch": 0.254,
"grad_norm": 0.08588574081659317,
"learning_rate": 3.5627199614693055e-06,
"loss": 6.516835784912109,
"step": 1270
},
{
"epoch": 0.255,
"grad_norm": 0.05896945297718048,
"learning_rate": 3.5585838304996356e-06,
"loss": 6.462747192382812,
"step": 1275
},
{
"epoch": 0.256,
"grad_norm": 0.07021471858024597,
"learning_rate": 3.5544306551069037e-06,
"loss": 6.572966003417969,
"step": 1280
},
{
"epoch": 0.257,
"grad_norm": 0.09236051887273788,
"learning_rate": 3.5502604807095687e-06,
"loss": 6.615792083740234,
"step": 1285
},
{
"epoch": 0.258,
"grad_norm": 0.07293561100959778,
"learning_rate": 3.5460733529119908e-06,
"loss": 6.55091552734375,
"step": 1290
},
{
"epoch": 0.259,
"grad_norm": 0.0651378184556961,
"learning_rate": 3.541869317503928e-06,
"loss": 6.545086669921875,
"step": 1295
},
{
"epoch": 0.26,
"grad_norm": 0.0653856098651886,
"learning_rate": 3.537648420460038e-06,
"loss": 6.5654754638671875,
"step": 1300
},
{
"epoch": 0.261,
"grad_norm": 0.08197472244501114,
"learning_rate": 3.5334107079393755e-06,
"loss": 6.614053344726562,
"step": 1305
},
{
"epoch": 0.262,
"grad_norm": 0.07018602639436722,
"learning_rate": 3.5291562262848845e-06,
"loss": 6.489773559570312,
"step": 1310
},
{
"epoch": 0.263,
"grad_norm": 0.07549969106912613,
"learning_rate": 3.5248850220228957e-06,
"loss": 6.4777587890625,
"step": 1315
},
{
"epoch": 0.264,
"grad_norm": 0.07509016990661621,
"learning_rate": 3.5205971418626145e-06,
"loss": 6.554988861083984,
"step": 1320
},
{
"epoch": 0.265,
"grad_norm": 0.07180987298488617,
"learning_rate": 3.51629263269561e-06,
"loss": 6.668986511230469,
"step": 1325
},
{
"epoch": 0.266,
"grad_norm": 0.07208196818828583,
"learning_rate": 3.511971541595307e-06,
"loss": 6.480735778808594,
"step": 1330
},
{
"epoch": 0.267,
"grad_norm": 0.08938033133745193,
"learning_rate": 3.5076339158164635e-06,
"loss": 6.487246704101563,
"step": 1335
},
{
"epoch": 0.268,
"grad_norm": 0.0639733299612999,
"learning_rate": 3.503279802794662e-06,
"loss": 6.5667259216308596,
"step": 1340
},
{
"epoch": 0.269,
"grad_norm": 0.11628873646259308,
"learning_rate": 3.4989092501457832e-06,
"loss": 6.565748596191407,
"step": 1345
},
{
"epoch": 0.27,
"grad_norm": 0.0958283543586731,
"learning_rate": 3.4945223056654914e-06,
"loss": 6.564359283447265,
"step": 1350
},
{
"epoch": 0.27,
"eval_accuracy": 0.1386959706959707,
"eval_loss": 6.456244945526123,
"eval_runtime": 10.3332,
"eval_samples_per_second": 9.678,
"eval_steps_per_second": 1.645,
"step": 1350
},
{
"epoch": 0.271,
"grad_norm": 0.08361370116472244,
"learning_rate": 3.4901190173287086e-06,
"loss": 6.599095153808594,
"step": 1355
},
{
"epoch": 0.272,
"grad_norm": 0.07728071510791779,
"learning_rate": 3.48569943328909e-06,
"loss": 6.567552185058593,
"step": 1360
},
{
"epoch": 0.273,
"grad_norm": 0.23476524651050568,
"learning_rate": 3.4812636018784994e-06,
"loss": 6.519585418701172,
"step": 1365
},
{
"epoch": 0.274,
"grad_norm": 0.08214252442121506,
"learning_rate": 3.476811571606478e-06,
"loss": 6.542357635498047,
"step": 1370
},
{
"epoch": 0.275,
"grad_norm": 0.07677047699689865,
"learning_rate": 3.4723433911597163e-06,
"loss": 6.5419761657714846,
"step": 1375
},
{
"epoch": 0.276,
"grad_norm": 0.11742841452360153,
"learning_rate": 3.4678591094015187e-06,
"loss": 6.5219581604003904,
"step": 1380
},
{
"epoch": 0.277,
"grad_norm": 0.09686063230037689,
"learning_rate": 3.4633587753712717e-06,
"loss": 6.592768859863281,
"step": 1385
},
{
"epoch": 0.278,
"grad_norm": 0.09387538582086563,
"learning_rate": 3.458842438283909e-06,
"loss": 6.60013427734375,
"step": 1390
},
{
"epoch": 0.279,
"grad_norm": 0.0723787397146225,
"learning_rate": 3.4543101475293682e-06,
"loss": 6.4840553283691404,
"step": 1395
},
{
"epoch": 0.28,
"grad_norm": 0.06756219267845154,
"learning_rate": 3.449761952672055e-06,
"loss": 6.542083740234375,
"step": 1400
},
{
"epoch": 0.281,
"grad_norm": 0.0757589340209961,
"learning_rate": 3.4451979034502994e-06,
"loss": 6.548152923583984,
"step": 1405
},
{
"epoch": 0.282,
"grad_norm": 0.08698936551809311,
"learning_rate": 3.440618049775814e-06,
"loss": 6.562844085693359,
"step": 1410
},
{
"epoch": 0.283,
"grad_norm": 0.08987753838300705,
"learning_rate": 3.436022441733143e-06,
"loss": 6.502987670898437,
"step": 1415
},
{
"epoch": 0.284,
"grad_norm": 0.07419227808713913,
"learning_rate": 3.43141112957912e-06,
"loss": 6.47925033569336,
"step": 1420
},
{
"epoch": 0.285,
"grad_norm": 0.0743662565946579,
"learning_rate": 3.4267841637423166e-06,
"loss": 6.590135955810547,
"step": 1425
},
{
"epoch": 0.286,
"grad_norm": 0.09506815671920776,
"learning_rate": 3.422141594822489e-06,
"loss": 6.4904052734375,
"step": 1430
},
{
"epoch": 0.287,
"grad_norm": 0.06352763622999191,
"learning_rate": 3.4174834735900283e-06,
"loss": 6.492788696289063,
"step": 1435
},
{
"epoch": 0.288,
"grad_norm": 0.1327190101146698,
"learning_rate": 3.4128098509854014e-06,
"loss": 6.528990936279297,
"step": 1440
},
{
"epoch": 0.289,
"grad_norm": 0.1287909299135208,
"learning_rate": 3.4081207781185963e-06,
"loss": 6.511381530761719,
"step": 1445
},
{
"epoch": 0.29,
"grad_norm": 0.05822750926017761,
"learning_rate": 3.4034163062685623e-06,
"loss": 6.534752655029297,
"step": 1450
},
{
"epoch": 0.291,
"grad_norm": 0.08409831672906876,
"learning_rate": 3.3986964868826498e-06,
"loss": 6.494256591796875,
"step": 1455
},
{
"epoch": 0.292,
"grad_norm": 0.11647513508796692,
"learning_rate": 3.393961371576048e-06,
"loss": 6.531385040283203,
"step": 1460
},
{
"epoch": 0.293,
"grad_norm": 0.06273698806762695,
"learning_rate": 3.3892110121312196e-06,
"loss": 6.5295967102050785,
"step": 1465
},
{
"epoch": 0.294,
"grad_norm": 0.06390611082315445,
"learning_rate": 3.3844454604973327e-06,
"loss": 6.487610626220703,
"step": 1470
},
{
"epoch": 0.295,
"grad_norm": 0.0920199602842331,
"learning_rate": 3.3796647687896982e-06,
"loss": 6.561590576171875,
"step": 1475
},
{
"epoch": 0.296,
"grad_norm": 0.07950405776500702,
"learning_rate": 3.3748689892891945e-06,
"loss": 6.498722839355469,
"step": 1480
},
{
"epoch": 0.297,
"grad_norm": 0.0956474170088768,
"learning_rate": 3.3700581744416966e-06,
"loss": 6.526725006103516,
"step": 1485
},
{
"epoch": 0.298,
"grad_norm": 0.07354336977005005,
"learning_rate": 3.3652323768575066e-06,
"loss": 6.478034210205078,
"step": 1490
},
{
"epoch": 0.299,
"grad_norm": 0.07010781019926071,
"learning_rate": 3.360391649310772e-06,
"loss": 6.511841583251953,
"step": 1495
},
{
"epoch": 0.3,
"grad_norm": 0.07634287327528,
"learning_rate": 3.355536044738915e-06,
"loss": 6.506979370117188,
"step": 1500
},
{
"epoch": 0.3,
"eval_accuracy": 0.138991452991453,
"eval_loss": 6.424478530883789,
"eval_runtime": 10.3935,
"eval_samples_per_second": 9.621,
"eval_steps_per_second": 1.636,
"step": 1500
}
],
"logging_steps": 5,
"max_steps": 5000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 300,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 6,
"trial_name": null,
"trial_params": null
}