{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.48, "eval_steps": 150, "global_step": 2400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.001, "grad_norm": 0.27235767245292664, "learning_rate": 6.4e-08, "loss": 10.786966705322266, "step": 5 }, { "epoch": 0.002, "grad_norm": 0.36470845341682434, "learning_rate": 1.44e-07, "loss": 10.004191589355468, "step": 10 }, { "epoch": 0.003, "grad_norm": 0.18794603645801544, "learning_rate": 2.24e-07, "loss": 9.357711791992188, "step": 15 }, { "epoch": 0.004, "grad_norm": 0.15133747458457947, "learning_rate": 3.0399999999999997e-07, "loss": 9.077755737304688, "step": 20 }, { "epoch": 0.005, "grad_norm": 0.13880157470703125, "learning_rate": 3.84e-07, "loss": 8.826399993896484, "step": 25 }, { "epoch": 0.006, "grad_norm": 0.12539362907409668, "learning_rate": 4.64e-07, "loss": 8.724310302734375, "step": 30 }, { "epoch": 0.007, "grad_norm": 0.11178825795650482, "learning_rate": 5.44e-07, "loss": 8.595573425292969, "step": 35 }, { "epoch": 0.008, "grad_norm": 0.16203832626342773, "learning_rate": 6.24e-07, "loss": 8.613536834716797, "step": 40 }, { "epoch": 0.009, "grad_norm": 0.11954408138990402, "learning_rate": 7.04e-07, "loss": 8.435651397705078, "step": 45 }, { "epoch": 0.01, "grad_norm": 0.09399693459272385, "learning_rate": 7.84e-07, "loss": 8.369234466552735, "step": 50 }, { "epoch": 0.011, "grad_norm": 0.08723891526460648, "learning_rate": 8.639999999999999e-07, "loss": 8.335379791259765, "step": 55 }, { "epoch": 0.012, "grad_norm": 0.09454073011875153, "learning_rate": 9.439999999999999e-07, "loss": 8.253787231445312, "step": 60 }, { "epoch": 0.013, "grad_norm": 0.09540031850337982, "learning_rate": 1.024e-06, "loss": 8.186421966552734, "step": 65 }, { "epoch": 0.014, "grad_norm": 0.11653102189302444, "learning_rate": 1.1040000000000001e-06, "loss": 8.132817840576172, "step": 70 }, { "epoch": 0.015, "grad_norm": 0.08094990253448486, "learning_rate": 1.1839999999999998e-06, "loss": 8.107611846923827, "step": 75 }, { "epoch": 0.016, "grad_norm": 0.10092103481292725, "learning_rate": 1.2639999999999999e-06, "loss": 8.071889495849609, "step": 80 }, { "epoch": 0.017, "grad_norm": 0.09236462414264679, "learning_rate": 1.344e-06, "loss": 8.15390625, "step": 85 }, { "epoch": 0.018, "grad_norm": 0.08973367512226105, "learning_rate": 1.4239999999999998e-06, "loss": 8.073948669433594, "step": 90 }, { "epoch": 0.019, "grad_norm": 0.08046946674585342, "learning_rate": 1.504e-06, "loss": 7.942198944091797, "step": 95 }, { "epoch": 0.02, "grad_norm": 0.07841245085000992, "learning_rate": 1.584e-06, "loss": 7.894329071044922, "step": 100 }, { "epoch": 0.021, "grad_norm": 0.07948298752307892, "learning_rate": 1.6639999999999999e-06, "loss": 7.908601379394531, "step": 105 }, { "epoch": 0.022, "grad_norm": 0.07720845937728882, "learning_rate": 1.744e-06, "loss": 7.923919677734375, "step": 110 }, { "epoch": 0.023, "grad_norm": 0.09289873391389847, "learning_rate": 1.824e-06, "loss": 7.866429138183594, "step": 115 }, { "epoch": 0.024, "grad_norm": 0.07957543432712555, "learning_rate": 1.904e-06, "loss": 7.828727722167969, "step": 120 }, { "epoch": 0.025, "grad_norm": 0.07522212713956833, "learning_rate": 1.984e-06, "loss": 7.83117446899414, "step": 125 }, { "epoch": 0.026, "grad_norm": 0.09532520920038223, "learning_rate": 2.064e-06, "loss": 7.8716987609863285, "step": 130 }, { "epoch": 0.027, "grad_norm": 0.07470740377902985, "learning_rate": 2.144e-06, "loss": 7.834799194335938, "step": 135 }, { "epoch": 0.028, "grad_norm": 0.07192815095186234, "learning_rate": 2.2240000000000002e-06, "loss": 7.736669921875, "step": 140 }, { "epoch": 0.029, "grad_norm": 0.09201541543006897, "learning_rate": 2.304e-06, "loss": 7.6827842712402346, "step": 145 }, { "epoch": 0.03, "grad_norm": 0.09225732833147049, "learning_rate": 2.384e-06, "loss": 7.745516967773438, "step": 150 }, { "epoch": 0.03, "eval_accuracy": 0.11922344322344322, "eval_loss": 7.651349067687988, "eval_runtime": 10.4261, "eval_samples_per_second": 9.591, "eval_steps_per_second": 1.631, "step": 150 }, { "epoch": 0.031, "grad_norm": 0.08881130814552307, "learning_rate": 2.464e-06, "loss": 7.674343872070312, "step": 155 }, { "epoch": 0.032, "grad_norm": 0.07704972475767136, "learning_rate": 2.544e-06, "loss": 7.681053161621094, "step": 160 }, { "epoch": 0.033, "grad_norm": 0.09186960011720657, "learning_rate": 2.624e-06, "loss": 7.690374755859375, "step": 165 }, { "epoch": 0.034, "grad_norm": 0.08565036207437515, "learning_rate": 2.704e-06, "loss": 7.603900146484375, "step": 170 }, { "epoch": 0.035, "grad_norm": 0.1499108374118805, "learning_rate": 2.7839999999999995e-06, "loss": 7.505958557128906, "step": 175 }, { "epoch": 0.036, "grad_norm": 0.06643059849739075, "learning_rate": 2.8639999999999996e-06, "loss": 7.573754119873047, "step": 180 }, { "epoch": 0.037, "grad_norm": 0.11821448802947998, "learning_rate": 2.9439999999999997e-06, "loss": 7.752062225341797, "step": 185 }, { "epoch": 0.038, "grad_norm": 0.08827198296785355, "learning_rate": 3.0239999999999998e-06, "loss": 7.5669189453125, "step": 190 }, { "epoch": 0.039, "grad_norm": 0.07519616931676865, "learning_rate": 3.104e-06, "loss": 7.571305847167968, "step": 195 }, { "epoch": 0.04, "grad_norm": 0.075102798640728, "learning_rate": 3.184e-06, "loss": 7.518638610839844, "step": 200 }, { "epoch": 0.041, "grad_norm": 0.10685888677835464, "learning_rate": 3.2639999999999996e-06, "loss": 7.512000274658203, "step": 205 }, { "epoch": 0.042, "grad_norm": 0.10541684180498123, "learning_rate": 3.3439999999999997e-06, "loss": 7.564778137207031, "step": 210 }, { "epoch": 0.043, "grad_norm": 0.09155019372701645, "learning_rate": 3.4239999999999997e-06, "loss": 7.4674217224121096, "step": 215 }, { "epoch": 0.044, "grad_norm": 0.11373615264892578, "learning_rate": 3.504e-06, "loss": 7.450457000732422, "step": 220 }, { "epoch": 0.045, "grad_norm": 0.07444982975721359, "learning_rate": 3.584e-06, "loss": 7.397786712646484, "step": 225 }, { "epoch": 0.046, "grad_norm": 0.08052903413772583, "learning_rate": 3.664e-06, "loss": 7.415688323974609, "step": 230 }, { "epoch": 0.047, "grad_norm": 0.08429361879825592, "learning_rate": 3.744e-06, "loss": 7.411205291748047, "step": 235 }, { "epoch": 0.048, "grad_norm": 0.08501375466585159, "learning_rate": 3.823999999999999e-06, "loss": 7.406707763671875, "step": 240 }, { "epoch": 0.049, "grad_norm": 0.10457716882228851, "learning_rate": 3.903999999999999e-06, "loss": 7.312602233886719, "step": 245 }, { "epoch": 0.05, "grad_norm": 0.09624126553535461, "learning_rate": 3.9839999999999995e-06, "loss": 7.360851287841797, "step": 250 }, { "epoch": 0.051, "grad_norm": 0.08660672605037689, "learning_rate": 3.99999300106024e-06, "loss": 7.353035736083984, "step": 255 }, { "epoch": 0.052, "grad_norm": 0.08430126309394836, "learning_rate": 3.9999645679514235e-06, "loss": 7.384159088134766, "step": 260 }, { "epoch": 0.053, "grad_norm": 0.07826503366231918, "learning_rate": 3.999914263550513e-06, "loss": 7.4195198059082035, "step": 265 }, { "epoch": 0.054, "grad_norm": 0.08577796816825867, "learning_rate": 3.9998420884076325e-06, "loss": 7.362513732910156, "step": 270 }, { "epoch": 0.055, "grad_norm": 0.0649741068482399, "learning_rate": 3.999748043312075e-06, "loss": 7.275961303710938, "step": 275 }, { "epoch": 0.056, "grad_norm": 0.07203389704227448, "learning_rate": 3.999632129292304e-06, "loss": 7.263797760009766, "step": 280 }, { "epoch": 0.057, "grad_norm": 0.12281067669391632, "learning_rate": 3.9994943476159364e-06, "loss": 7.287098693847656, "step": 285 }, { "epoch": 0.058, "grad_norm": 0.07184985280036926, "learning_rate": 3.999334699789731e-06, "loss": 7.240232849121094, "step": 290 }, { "epoch": 0.059, "grad_norm": 0.07799801975488663, "learning_rate": 3.99915318755957e-06, "loss": 7.2740531921386715, "step": 295 }, { "epoch": 0.06, "grad_norm": 0.0761650875210762, "learning_rate": 3.9989498129104425e-06, "loss": 7.299461364746094, "step": 300 }, { "epoch": 0.06, "eval_accuracy": 0.12382905982905983, "eval_loss": 7.217157363891602, "eval_runtime": 10.4259, "eval_samples_per_second": 9.591, "eval_steps_per_second": 1.631, "step": 300 }, { "epoch": 0.061, "grad_norm": 0.0692087933421135, "learning_rate": 3.998724578066421e-06, "loss": 7.243695831298828, "step": 305 }, { "epoch": 0.062, "grad_norm": 0.08431071788072586, "learning_rate": 3.998477485490638e-06, "loss": 7.292684173583984, "step": 310 }, { "epoch": 0.063, "grad_norm": 0.08417057991027832, "learning_rate": 3.998208537885259e-06, "loss": 7.222378540039062, "step": 315 }, { "epoch": 0.064, "grad_norm": 0.07904339581727982, "learning_rate": 3.997917738191449e-06, "loss": 7.278653717041015, "step": 320 }, { "epoch": 0.065, "grad_norm": 0.13258706033229828, "learning_rate": 3.99760508958935e-06, "loss": 7.202552795410156, "step": 325 }, { "epoch": 0.066, "grad_norm": 0.0901857390999794, "learning_rate": 3.997270595498036e-06, "loss": 7.205686950683594, "step": 330 }, { "epoch": 0.067, "grad_norm": 0.07317949831485748, "learning_rate": 3.99691425957548e-06, "loss": 7.293389892578125, "step": 335 }, { "epoch": 0.068, "grad_norm": 0.11255510151386261, "learning_rate": 3.996536085718516e-06, "loss": 7.229725646972656, "step": 340 }, { "epoch": 0.069, "grad_norm": 0.07706659287214279, "learning_rate": 3.996136078062792e-06, "loss": 7.257555389404297, "step": 345 }, { "epoch": 0.07, "grad_norm": 0.08863229304552078, "learning_rate": 3.995714240982727e-06, "loss": 7.257266235351563, "step": 350 }, { "epoch": 0.071, "grad_norm": 0.08663391321897507, "learning_rate": 3.995270579091465e-06, "loss": 7.118687438964844, "step": 355 }, { "epoch": 0.072, "grad_norm": 0.08917262405157089, "learning_rate": 3.99480509724082e-06, "loss": 7.238731384277344, "step": 360 }, { "epoch": 0.073, "grad_norm": 0.09512999653816223, "learning_rate": 3.994317800521228e-06, "loss": 7.2104545593261715, "step": 365 }, { "epoch": 0.074, "grad_norm": 0.10050003230571747, "learning_rate": 3.993808694261687e-06, "loss": 7.186836242675781, "step": 370 }, { "epoch": 0.075, "grad_norm": 0.12758338451385498, "learning_rate": 3.993277784029702e-06, "loss": 7.171599578857422, "step": 375 }, { "epoch": 0.076, "grad_norm": 0.08614124357700348, "learning_rate": 3.992725075631223e-06, "loss": 7.201605224609375, "step": 380 }, { "epoch": 0.077, "grad_norm": 0.07332151383161545, "learning_rate": 3.992150575110579e-06, "loss": 7.026101684570312, "step": 385 }, { "epoch": 0.078, "grad_norm": 0.0854375809431076, "learning_rate": 3.991554288750416e-06, "loss": 7.223291015625, "step": 390 }, { "epoch": 0.079, "grad_norm": 0.09470361471176147, "learning_rate": 3.990936223071627e-06, "loss": 7.0966438293457035, "step": 395 }, { "epoch": 0.08, "grad_norm": 0.06626710295677185, "learning_rate": 3.990296384833279e-06, "loss": 7.142760467529297, "step": 400 }, { "epoch": 0.081, "grad_norm": 0.13561668992042542, "learning_rate": 3.989634781032539e-06, "loss": 7.0024574279785154, "step": 405 }, { "epoch": 0.082, "grad_norm": 0.09113086760044098, "learning_rate": 3.9889514189046015e-06, "loss": 7.137001800537109, "step": 410 }, { "epoch": 0.083, "grad_norm": 0.07085978239774704, "learning_rate": 3.988246305922606e-06, "loss": 7.029933929443359, "step": 415 }, { "epoch": 0.084, "grad_norm": 0.06468215584754944, "learning_rate": 3.987519449797554e-06, "loss": 7.02655029296875, "step": 420 }, { "epoch": 0.085, "grad_norm": 0.12091367691755295, "learning_rate": 3.986770858478227e-06, "loss": 7.116294097900391, "step": 425 }, { "epoch": 0.086, "grad_norm": 0.10934042185544968, "learning_rate": 3.986000540151101e-06, "loss": 7.093238067626953, "step": 430 }, { "epoch": 0.087, "grad_norm": 0.07274443656206131, "learning_rate": 3.985208503240253e-06, "loss": 7.123175048828125, "step": 435 }, { "epoch": 0.088, "grad_norm": 0.0802014172077179, "learning_rate": 3.9843947564072725e-06, "loss": 7.188668060302734, "step": 440 }, { "epoch": 0.089, "grad_norm": 0.06854639202356339, "learning_rate": 3.983559308551164e-06, "loss": 7.106547546386719, "step": 445 }, { "epoch": 0.09, "grad_norm": 0.07703255116939545, "learning_rate": 3.982702168808252e-06, "loss": 7.064980316162109, "step": 450 }, { "epoch": 0.09, "eval_accuracy": 0.12983638583638585, "eval_loss": 6.963926315307617, "eval_runtime": 10.3988, "eval_samples_per_second": 9.616, "eval_steps_per_second": 1.635, "step": 450 }, { "epoch": 0.091, "grad_norm": 0.08548009395599365, "learning_rate": 3.981823346552078e-06, "loss": 7.028290557861328, "step": 455 }, { "epoch": 0.092, "grad_norm": 0.08591306209564209, "learning_rate": 3.980922851393302e-06, "loss": 7.01605453491211, "step": 460 }, { "epoch": 0.093, "grad_norm": 0.07920879870653152, "learning_rate": 3.9800006931795954e-06, "loss": 6.990329742431641, "step": 465 }, { "epoch": 0.094, "grad_norm": 0.07192882895469666, "learning_rate": 3.979056881995533e-06, "loss": 6.953098297119141, "step": 470 }, { "epoch": 0.095, "grad_norm": 0.06649420410394669, "learning_rate": 3.978091428162482e-06, "loss": 6.951087951660156, "step": 475 }, { "epoch": 0.096, "grad_norm": 0.08228413760662079, "learning_rate": 3.97710434223849e-06, "loss": 7.034120178222656, "step": 480 }, { "epoch": 0.097, "grad_norm": 0.10376594960689545, "learning_rate": 3.976095635018172e-06, "loss": 6.995967864990234, "step": 485 }, { "epoch": 0.098, "grad_norm": 0.06993073225021362, "learning_rate": 3.975065317532588e-06, "loss": 6.952136993408203, "step": 490 }, { "epoch": 0.099, "grad_norm": 0.08720093965530396, "learning_rate": 3.974013401049125e-06, "loss": 6.902699279785156, "step": 495 }, { "epoch": 0.1, "grad_norm": 0.1016659289598465, "learning_rate": 3.972939897071373e-06, "loss": 6.927466583251953, "step": 500 }, { "epoch": 0.101, "grad_norm": 0.06847221404314041, "learning_rate": 3.971844817338999e-06, "loss": 6.902294921875, "step": 505 }, { "epoch": 0.102, "grad_norm": 0.07875518500804901, "learning_rate": 3.97072817382762e-06, "loss": 6.962755584716797, "step": 510 }, { "epoch": 0.103, "grad_norm": 0.08157093822956085, "learning_rate": 3.969589978748671e-06, "loss": 6.956285095214843, "step": 515 }, { "epoch": 0.104, "grad_norm": 0.08181696385145187, "learning_rate": 3.968430244549271e-06, "loss": 6.970890808105469, "step": 520 }, { "epoch": 0.105, "grad_norm": 0.06938958913087845, "learning_rate": 3.967248983912086e-06, "loss": 6.917367553710937, "step": 525 }, { "epoch": 0.106, "grad_norm": 0.10486883670091629, "learning_rate": 3.966046209755195e-06, "loss": 6.8495323181152346, "step": 530 }, { "epoch": 0.107, "grad_norm": 0.08114153891801834, "learning_rate": 3.964821935231942e-06, "loss": 7.0064338684082035, "step": 535 }, { "epoch": 0.108, "grad_norm": 0.07422944903373718, "learning_rate": 3.963576173730798e-06, "loss": 6.89477767944336, "step": 540 }, { "epoch": 0.109, "grad_norm": 0.0750703290104866, "learning_rate": 3.9623089388752105e-06, "loss": 7.047392272949219, "step": 545 }, { "epoch": 0.11, "grad_norm": 0.07453129440546036, "learning_rate": 3.961020244523458e-06, "loss": 6.892961883544922, "step": 550 }, { "epoch": 0.111, "grad_norm": 0.08709228038787842, "learning_rate": 3.959710104768493e-06, "loss": 6.973309326171875, "step": 555 }, { "epoch": 0.112, "grad_norm": 0.06008852645754814, "learning_rate": 3.958378533937797e-06, "loss": 6.845113372802734, "step": 560 }, { "epoch": 0.113, "grad_norm": 0.09065559506416321, "learning_rate": 3.957025546593213e-06, "loss": 6.88427505493164, "step": 565 }, { "epoch": 0.114, "grad_norm": 0.12213204056024551, "learning_rate": 3.9556511575307956e-06, "loss": 6.970057678222656, "step": 570 }, { "epoch": 0.115, "grad_norm": 0.10695669054985046, "learning_rate": 3.954255381780641e-06, "loss": 6.839192199707031, "step": 575 }, { "epoch": 0.116, "grad_norm": 0.07049612700939178, "learning_rate": 3.952838234606732e-06, "loss": 6.857762145996094, "step": 580 }, { "epoch": 0.117, "grad_norm": 0.07053842395544052, "learning_rate": 3.951399731506761e-06, "loss": 6.933798217773438, "step": 585 }, { "epoch": 0.118, "grad_norm": 0.09034952521324158, "learning_rate": 3.949939888211968e-06, "loss": 6.888163757324219, "step": 590 }, { "epoch": 0.119, "grad_norm": 0.10722323507070541, "learning_rate": 3.948458720686966e-06, "loss": 6.820646667480469, "step": 595 }, { "epoch": 0.12, "grad_norm": 0.0687774196267128, "learning_rate": 3.946956245129566e-06, "loss": 6.872308349609375, "step": 600 }, { "epoch": 0.12, "eval_accuracy": 0.13161660561660563, "eval_loss": 6.804003715515137, "eval_runtime": 10.4302, "eval_samples_per_second": 9.588, "eval_steps_per_second": 1.63, "step": 600 }, { "epoch": 0.121, "grad_norm": 0.08994954824447632, "learning_rate": 3.945432477970598e-06, "loss": 6.806103515625, "step": 605 }, { "epoch": 0.122, "grad_norm": 0.07370273023843765, "learning_rate": 3.943887435873737e-06, "loss": 6.822203063964844, "step": 610 }, { "epoch": 0.123, "grad_norm": 0.07430048286914825, "learning_rate": 3.942321135735316e-06, "loss": 6.78031005859375, "step": 615 }, { "epoch": 0.124, "grad_norm": 0.1099916398525238, "learning_rate": 3.940733594684141e-06, "loss": 6.9381248474121096, "step": 620 }, { "epoch": 0.125, "grad_norm": 0.08312584459781647, "learning_rate": 3.939124830081308e-06, "loss": 6.797595977783203, "step": 625 }, { "epoch": 0.126, "grad_norm": 0.06789983063936234, "learning_rate": 3.937494859520009e-06, "loss": 6.870149230957031, "step": 630 }, { "epoch": 0.127, "grad_norm": 0.07728736847639084, "learning_rate": 3.93584370082534e-06, "loss": 6.83870849609375, "step": 635 }, { "epoch": 0.128, "grad_norm": 0.0719357579946518, "learning_rate": 3.934171372054108e-06, "loss": 6.799946594238281, "step": 640 }, { "epoch": 0.129, "grad_norm": 0.06783469766378403, "learning_rate": 3.932477891494634e-06, "loss": 6.865572357177735, "step": 645 }, { "epoch": 0.13, "grad_norm": 0.0726066380739212, "learning_rate": 3.930763277666547e-06, "loss": 6.877969360351562, "step": 650 }, { "epoch": 0.131, "grad_norm": 0.07925975322723389, "learning_rate": 3.9290275493205925e-06, "loss": 6.854046630859375, "step": 655 }, { "epoch": 0.132, "grad_norm": 0.09406735748052597, "learning_rate": 3.927270725438417e-06, "loss": 6.818197631835938, "step": 660 }, { "epoch": 0.133, "grad_norm": 0.07139192521572113, "learning_rate": 3.925492825232363e-06, "loss": 6.8501945495605465, "step": 665 }, { "epoch": 0.134, "grad_norm": 0.07504747807979584, "learning_rate": 3.923693868145263e-06, "loss": 6.735340881347656, "step": 670 }, { "epoch": 0.135, "grad_norm": 0.08873208612203598, "learning_rate": 3.921873873850225e-06, "loss": 6.871774291992187, "step": 675 }, { "epoch": 0.136, "grad_norm": 0.06658565998077393, "learning_rate": 3.920032862250413e-06, "loss": 6.893667602539063, "step": 680 }, { "epoch": 0.137, "grad_norm": 0.08774610608816147, "learning_rate": 3.918170853478837e-06, "loss": 6.7974403381347654, "step": 685 }, { "epoch": 0.138, "grad_norm": 0.09726791083812714, "learning_rate": 3.9162878678981245e-06, "loss": 6.884765625, "step": 690 }, { "epoch": 0.139, "grad_norm": 0.07077678292989731, "learning_rate": 3.914383926100305e-06, "loss": 6.812703704833984, "step": 695 }, { "epoch": 0.14, "grad_norm": 0.07094477862119675, "learning_rate": 3.912459048906582e-06, "loss": 6.804354095458985, "step": 700 }, { "epoch": 0.141, "grad_norm": 0.09806753695011139, "learning_rate": 3.910513257367103e-06, "loss": 6.849080657958984, "step": 705 }, { "epoch": 0.142, "grad_norm": 0.18241384625434875, "learning_rate": 3.908546572760732e-06, "loss": 6.818512725830078, "step": 710 }, { "epoch": 0.143, "grad_norm": 0.13180814683437347, "learning_rate": 3.906559016594818e-06, "loss": 6.707421875, "step": 715 }, { "epoch": 0.144, "grad_norm": 0.12693838775157928, "learning_rate": 3.904550610604957e-06, "loss": 6.848756408691406, "step": 720 }, { "epoch": 0.145, "grad_norm": 0.10394909232854843, "learning_rate": 3.902521376754754e-06, "loss": 6.815328979492188, "step": 725 }, { "epoch": 0.146, "grad_norm": 0.07995420694351196, "learning_rate": 3.900471337235584e-06, "loss": 6.754273986816406, "step": 730 }, { "epoch": 0.147, "grad_norm": 0.07130531221628189, "learning_rate": 3.898400514466355e-06, "loss": 6.76672134399414, "step": 735 }, { "epoch": 0.148, "grad_norm": 0.09754687547683716, "learning_rate": 3.896308931093249e-06, "loss": 6.763739776611328, "step": 740 }, { "epoch": 0.149, "grad_norm": 0.1489243358373642, "learning_rate": 3.8941966099894884e-06, "loss": 6.877587127685547, "step": 745 }, { "epoch": 0.15, "grad_norm": 0.1504446268081665, "learning_rate": 3.892063574255079e-06, "loss": 6.799798583984375, "step": 750 }, { "epoch": 0.15, "eval_accuracy": 0.13552625152625153, "eval_loss": 6.6949238777160645, "eval_runtime": 10.4885, "eval_samples_per_second": 9.534, "eval_steps_per_second": 1.621, "step": 750 }, { "epoch": 0.151, "grad_norm": 0.09069617837667465, "learning_rate": 3.889909847216555e-06, "loss": 6.758820343017578, "step": 755 }, { "epoch": 0.152, "grad_norm": 0.09917005896568298, "learning_rate": 3.887735452426733e-06, "loss": 6.7119590759277346, "step": 760 }, { "epoch": 0.153, "grad_norm": 0.1238972544670105, "learning_rate": 3.885540413664445e-06, "loss": 6.766522979736328, "step": 765 }, { "epoch": 0.154, "grad_norm": 0.07523474842309952, "learning_rate": 3.8833247549342845e-06, "loss": 6.868996429443359, "step": 770 }, { "epoch": 0.155, "grad_norm": 0.06490049511194229, "learning_rate": 3.8810885004663384e-06, "loss": 6.904286193847656, "step": 775 }, { "epoch": 0.156, "grad_norm": 0.08743885904550552, "learning_rate": 3.878831674715929e-06, "loss": 6.790882873535156, "step": 780 }, { "epoch": 0.157, "grad_norm": 0.07870012521743774, "learning_rate": 3.87655430236334e-06, "loss": 6.777058410644531, "step": 785 }, { "epoch": 0.158, "grad_norm": 0.07427074015140533, "learning_rate": 3.87425640831355e-06, "loss": 6.888807678222657, "step": 790 }, { "epoch": 0.159, "grad_norm": 0.07057588547468185, "learning_rate": 3.8719380176959615e-06, "loss": 6.771605682373047, "step": 795 }, { "epoch": 0.16, "grad_norm": 0.07889208197593689, "learning_rate": 3.869599155864123e-06, "loss": 6.67206039428711, "step": 800 }, { "epoch": 0.161, "grad_norm": 0.07260162383317947, "learning_rate": 3.867239848395452e-06, "loss": 6.824806976318359, "step": 805 }, { "epoch": 0.162, "grad_norm": 0.07244172692298889, "learning_rate": 3.8648601210909575e-06, "loss": 6.776896667480469, "step": 810 }, { "epoch": 0.163, "grad_norm": 0.11525345593690872, "learning_rate": 3.862459999974956e-06, "loss": 6.852814483642578, "step": 815 }, { "epoch": 0.164, "grad_norm": 0.0778544470667839, "learning_rate": 3.860039511294787e-06, "loss": 6.725788116455078, "step": 820 }, { "epoch": 0.165, "grad_norm": 0.06785336136817932, "learning_rate": 3.857598681520527e-06, "loss": 6.7376350402832035, "step": 825 }, { "epoch": 0.166, "grad_norm": 0.08495451509952545, "learning_rate": 3.855137537344699e-06, "loss": 6.7077491760253904, "step": 830 }, { "epoch": 0.167, "grad_norm": 0.06992894411087036, "learning_rate": 3.8526561056819825e-06, "loss": 6.713374328613281, "step": 835 }, { "epoch": 0.168, "grad_norm": 0.0781623125076294, "learning_rate": 3.850154413668916e-06, "loss": 6.7144775390625, "step": 840 }, { "epoch": 0.169, "grad_norm": 0.0706086978316307, "learning_rate": 3.847632488663602e-06, "loss": 6.768795776367187, "step": 845 }, { "epoch": 0.17, "grad_norm": 0.11462926864624023, "learning_rate": 3.84509035824541e-06, "loss": 6.714561462402344, "step": 850 }, { "epoch": 0.171, "grad_norm": 0.06380539387464523, "learning_rate": 3.842528050214669e-06, "loss": 6.754435729980469, "step": 855 }, { "epoch": 0.172, "grad_norm": 0.0771062970161438, "learning_rate": 3.83994559259237e-06, "loss": 6.693482208251953, "step": 860 }, { "epoch": 0.173, "grad_norm": 0.07977370917797089, "learning_rate": 3.837343013619856e-06, "loss": 6.782911682128907, "step": 865 }, { "epoch": 0.174, "grad_norm": 0.09431219846010208, "learning_rate": 3.834720341758513e-06, "loss": 6.771470642089843, "step": 870 }, { "epoch": 0.175, "grad_norm": 0.16286598145961761, "learning_rate": 3.832077605689461e-06, "loss": 6.584927368164062, "step": 875 }, { "epoch": 0.176, "grad_norm": 0.06504693627357483, "learning_rate": 3.829414834313237e-06, "loss": 6.703968811035156, "step": 880 }, { "epoch": 0.177, "grad_norm": 0.08418609946966171, "learning_rate": 3.826732056749485e-06, "loss": 6.592996215820312, "step": 885 }, { "epoch": 0.178, "grad_norm": 0.06050467491149902, "learning_rate": 3.824029302336628e-06, "loss": 6.760212707519531, "step": 890 }, { "epoch": 0.179, "grad_norm": 0.08373371511697769, "learning_rate": 3.821306600631556e-06, "loss": 6.631327819824219, "step": 895 }, { "epoch": 0.18, "grad_norm": 0.08372713625431061, "learning_rate": 3.818563981409298e-06, "loss": 6.716769409179688, "step": 900 }, { "epoch": 0.18, "eval_accuracy": 0.13533333333333333, "eval_loss": 6.627016544342041, "eval_runtime": 10.3756, "eval_samples_per_second": 9.638, "eval_steps_per_second": 1.638, "step": 900 }, { "epoch": 0.181, "grad_norm": 0.068506620824337, "learning_rate": 3.8158014746627e-06, "loss": 6.659144592285156, "step": 905 }, { "epoch": 0.182, "grad_norm": 0.06771203130483627, "learning_rate": 3.8130191106020916e-06, "loss": 6.752458190917968, "step": 910 }, { "epoch": 0.183, "grad_norm": 0.07365380972623825, "learning_rate": 3.8102169196549606e-06, "loss": 6.792449951171875, "step": 915 }, { "epoch": 0.184, "grad_norm": 0.09057911485433578, "learning_rate": 3.8073949324656187e-06, "loss": 6.750059509277344, "step": 920 }, { "epoch": 0.185, "grad_norm": 0.1145537868142128, "learning_rate": 3.8045531798948662e-06, "loss": 6.659918212890625, "step": 925 }, { "epoch": 0.186, "grad_norm": 0.07206426560878754, "learning_rate": 3.8016916930196535e-06, "loss": 6.64384765625, "step": 930 }, { "epoch": 0.187, "grad_norm": 0.08511226624250412, "learning_rate": 3.798810503132742e-06, "loss": 6.741066741943359, "step": 935 }, { "epoch": 0.188, "grad_norm": 0.07708951085805893, "learning_rate": 3.795909641742363e-06, "loss": 6.7345428466796875, "step": 940 }, { "epoch": 0.189, "grad_norm": 0.10781801491975784, "learning_rate": 3.7929891405718725e-06, "loss": 6.796640014648437, "step": 945 }, { "epoch": 0.19, "grad_norm": 0.07551534473896027, "learning_rate": 3.790049031559403e-06, "loss": 6.666252899169922, "step": 950 }, { "epoch": 0.191, "grad_norm": 0.0841158851981163, "learning_rate": 3.787089346857515e-06, "loss": 6.701302337646484, "step": 955 }, { "epoch": 0.192, "grad_norm": 0.0862930417060852, "learning_rate": 3.7841101188328477e-06, "loss": 6.614484405517578, "step": 960 }, { "epoch": 0.193, "grad_norm": 0.07389580458402634, "learning_rate": 3.7811113800657597e-06, "loss": 6.6798454284667965, "step": 965 }, { "epoch": 0.194, "grad_norm": 0.07656016200780869, "learning_rate": 3.778093163349979e-06, "loss": 6.734007263183594, "step": 970 }, { "epoch": 0.195, "grad_norm": 0.06616536527872086, "learning_rate": 3.7750555016922397e-06, "loss": 6.699456787109375, "step": 975 }, { "epoch": 0.196, "grad_norm": 0.0683082565665245, "learning_rate": 3.7719984283119227e-06, "loss": 6.68050537109375, "step": 980 }, { "epoch": 0.197, "grad_norm": 0.1232413798570633, "learning_rate": 3.768921976640693e-06, "loss": 6.699308776855469, "step": 985 }, { "epoch": 0.198, "grad_norm": 0.07576856017112732, "learning_rate": 3.7658261803221327e-06, "loss": 6.67384033203125, "step": 990 }, { "epoch": 0.199, "grad_norm": 0.11441260576248169, "learning_rate": 3.7627110732113748e-06, "loss": 6.6964164733886715, "step": 995 }, { "epoch": 0.2, "grad_norm": 0.16522112488746643, "learning_rate": 3.7595766893747325e-06, "loss": 6.660438537597656, "step": 1000 }, { "epoch": 0.201, "grad_norm": 0.08984258025884628, "learning_rate": 3.7564230630893235e-06, "loss": 6.695003509521484, "step": 1005 }, { "epoch": 0.202, "grad_norm": 0.1421244740486145, "learning_rate": 3.753250228842701e-06, "loss": 6.6853515625, "step": 1010 }, { "epoch": 0.203, "grad_norm": 0.07362934201955795, "learning_rate": 3.7500582213324704e-06, "loss": 6.669375610351563, "step": 1015 }, { "epoch": 0.204, "grad_norm": 0.08078701794147491, "learning_rate": 3.7468470754659164e-06, "loss": 6.731100463867188, "step": 1020 }, { "epoch": 0.205, "grad_norm": 0.07613933831453323, "learning_rate": 3.743616826359614e-06, "loss": 6.699374389648438, "step": 1025 }, { "epoch": 0.206, "grad_norm": 0.0956382229924202, "learning_rate": 3.740367509339051e-06, "loss": 6.7087150573730465, "step": 1030 }, { "epoch": 0.207, "grad_norm": 0.06961136311292648, "learning_rate": 3.7370991599382374e-06, "loss": 6.619333648681641, "step": 1035 }, { "epoch": 0.208, "grad_norm": 0.08904080837965012, "learning_rate": 3.7338118138993187e-06, "loss": 6.6525390625, "step": 1040 }, { "epoch": 0.209, "grad_norm": 0.08716033399105072, "learning_rate": 3.7305055071721843e-06, "loss": 6.656343078613281, "step": 1045 }, { "epoch": 0.21, "grad_norm": 0.06856364011764526, "learning_rate": 3.727180275914075e-06, "loss": 6.584860992431641, "step": 1050 }, { "epoch": 0.21, "eval_accuracy": 0.13902075702075703, "eval_loss": 6.554867744445801, "eval_runtime": 10.4147, "eval_samples_per_second": 9.602, "eval_steps_per_second": 1.632, "step": 1050 }, { "epoch": 0.211, "grad_norm": 0.13052572309970856, "learning_rate": 3.723836156489187e-06, "loss": 6.7243499755859375, "step": 1055 }, { "epoch": 0.212, "grad_norm": 0.09087914228439331, "learning_rate": 3.7204731854682744e-06, "loss": 6.679405975341797, "step": 1060 }, { "epoch": 0.213, "grad_norm": 0.08263049274682999, "learning_rate": 3.71709139962825e-06, "loss": 6.654142761230469, "step": 1065 }, { "epoch": 0.214, "grad_norm": 0.07467084378004074, "learning_rate": 3.713690835951782e-06, "loss": 6.614359283447266, "step": 1070 }, { "epoch": 0.215, "grad_norm": 0.073064424097538, "learning_rate": 3.710271531626889e-06, "loss": 6.567655944824219, "step": 1075 }, { "epoch": 0.216, "grad_norm": 0.06931977719068527, "learning_rate": 3.706833524046536e-06, "loss": 6.589354705810547, "step": 1080 }, { "epoch": 0.217, "grad_norm": 0.07509584724903107, "learning_rate": 3.703376850808223e-06, "loss": 6.710356903076172, "step": 1085 }, { "epoch": 0.218, "grad_norm": 0.09575289487838745, "learning_rate": 3.699901549713575e-06, "loss": 6.6289726257324215, "step": 1090 }, { "epoch": 0.219, "grad_norm": 0.09864190220832825, "learning_rate": 3.6964076587679268e-06, "loss": 6.5806831359863285, "step": 1095 }, { "epoch": 0.22, "grad_norm": 0.23898720741271973, "learning_rate": 3.6928952161799113e-06, "loss": 6.584079742431641, "step": 1100 }, { "epoch": 0.221, "grad_norm": 0.12194394320249557, "learning_rate": 3.6893642603610374e-06, "loss": 6.62684326171875, "step": 1105 }, { "epoch": 0.222, "grad_norm": 0.07811807841062546, "learning_rate": 3.685814829925272e-06, "loss": 6.622457122802734, "step": 1110 }, { "epoch": 0.223, "grad_norm": 0.0715632289648056, "learning_rate": 3.682246963688618e-06, "loss": 6.651722717285156, "step": 1115 }, { "epoch": 0.224, "grad_norm": 0.10769006609916687, "learning_rate": 3.6786607006686895e-06, "loss": 6.6332145690917965, "step": 1120 }, { "epoch": 0.225, "grad_norm": 0.06909330189228058, "learning_rate": 3.6750560800842837e-06, "loss": 6.65299072265625, "step": 1125 }, { "epoch": 0.226, "grad_norm": 0.07310458272695541, "learning_rate": 3.671433141354953e-06, "loss": 6.617790985107422, "step": 1130 }, { "epoch": 0.227, "grad_norm": 0.0946388989686966, "learning_rate": 3.667791924100576e-06, "loss": 6.5729728698730465, "step": 1135 }, { "epoch": 0.228, "grad_norm": 0.10393473505973816, "learning_rate": 3.6641324681409215e-06, "loss": 6.568301391601563, "step": 1140 }, { "epoch": 0.229, "grad_norm": 0.06355820596218109, "learning_rate": 3.6604548134952125e-06, "loss": 6.632942199707031, "step": 1145 }, { "epoch": 0.23, "grad_norm": 0.06845368444919586, "learning_rate": 3.656759000381691e-06, "loss": 6.537193298339844, "step": 1150 }, { "epoch": 0.231, "grad_norm": 0.0652310699224472, "learning_rate": 3.6530450692171787e-06, "loss": 6.58575668334961, "step": 1155 }, { "epoch": 0.232, "grad_norm": 0.07378797978162766, "learning_rate": 3.64931306061663e-06, "loss": 6.643540954589843, "step": 1160 }, { "epoch": 0.233, "grad_norm": 0.07988571375608444, "learning_rate": 3.6455630153926943e-06, "loss": 6.519971466064453, "step": 1165 }, { "epoch": 0.234, "grad_norm": 0.06847741454839706, "learning_rate": 3.6417949745552638e-06, "loss": 6.616749572753906, "step": 1170 }, { "epoch": 0.235, "grad_norm": 0.09600138664245605, "learning_rate": 3.6380089793110307e-06, "loss": 6.599732971191406, "step": 1175 }, { "epoch": 0.236, "grad_norm": 0.09037528187036514, "learning_rate": 3.634205071063032e-06, "loss": 6.518192291259766, "step": 1180 }, { "epoch": 0.237, "grad_norm": 0.12540659308433533, "learning_rate": 3.6303832914102e-06, "loss": 6.674017333984375, "step": 1185 }, { "epoch": 0.238, "grad_norm": 0.07415056228637695, "learning_rate": 3.626543682146903e-06, "loss": 6.6067352294921875, "step": 1190 }, { "epoch": 0.239, "grad_norm": 0.084800586104393, "learning_rate": 3.6226862852624927e-06, "loss": 6.528235626220703, "step": 1195 }, { "epoch": 0.24, "grad_norm": 0.0605861060321331, "learning_rate": 3.6188111429408448e-06, "loss": 6.609767913818359, "step": 1200 }, { "epoch": 0.24, "eval_accuracy": 0.13638827838827838, "eval_loss": 6.499367713928223, "eval_runtime": 10.4681, "eval_samples_per_second": 9.553, "eval_steps_per_second": 1.624, "step": 1200 }, { "epoch": 0.241, "grad_norm": 0.06398201733827591, "learning_rate": 3.6149182975598944e-06, "loss": 6.538330841064453, "step": 1205 }, { "epoch": 0.242, "grad_norm": 0.10430450737476349, "learning_rate": 3.6110077916911736e-06, "loss": 6.606370544433593, "step": 1210 }, { "epoch": 0.243, "grad_norm": 0.06399216502904892, "learning_rate": 3.6070796680993503e-06, "loss": 6.5816490173339846, "step": 1215 }, { "epoch": 0.244, "grad_norm": 0.08809840679168701, "learning_rate": 3.6031339697417533e-06, "loss": 6.556430053710938, "step": 1220 }, { "epoch": 0.245, "grad_norm": 0.0840051919221878, "learning_rate": 3.599170739767907e-06, "loss": 6.665988159179688, "step": 1225 }, { "epoch": 0.246, "grad_norm": 0.08308332413434982, "learning_rate": 3.5951900215190614e-06, "loss": 6.544137573242187, "step": 1230 }, { "epoch": 0.247, "grad_norm": 0.0652918890118599, "learning_rate": 3.5911918585277125e-06, "loss": 6.496437835693359, "step": 1235 }, { "epoch": 0.248, "grad_norm": 0.07509986311197281, "learning_rate": 3.58717629451713e-06, "loss": 6.490621185302734, "step": 1240 }, { "epoch": 0.249, "grad_norm": 0.09300875663757324, "learning_rate": 3.583143373400879e-06, "loss": 6.5218017578125, "step": 1245 }, { "epoch": 0.25, "grad_norm": 0.09340658783912659, "learning_rate": 3.5790931392823376e-06, "loss": 6.703663635253906, "step": 1250 }, { "epoch": 0.251, "grad_norm": 0.09822723269462585, "learning_rate": 3.5750256364542196e-06, "loss": 6.545758819580078, "step": 1255 }, { "epoch": 0.252, "grad_norm": 0.07032929360866547, "learning_rate": 3.5709409093980814e-06, "loss": 6.586306762695313, "step": 1260 }, { "epoch": 0.253, "grad_norm": 0.100587859749794, "learning_rate": 3.5668390027838457e-06, "loss": 6.500570678710938, "step": 1265 }, { "epoch": 0.254, "grad_norm": 0.08588574081659317, "learning_rate": 3.5627199614693055e-06, "loss": 6.516835784912109, "step": 1270 }, { "epoch": 0.255, "grad_norm": 0.05896945297718048, "learning_rate": 3.5585838304996356e-06, "loss": 6.462747192382812, "step": 1275 }, { "epoch": 0.256, "grad_norm": 0.07021471858024597, "learning_rate": 3.5544306551069037e-06, "loss": 6.572966003417969, "step": 1280 }, { "epoch": 0.257, "grad_norm": 0.09236051887273788, "learning_rate": 3.5502604807095687e-06, "loss": 6.615792083740234, "step": 1285 }, { "epoch": 0.258, "grad_norm": 0.07293561100959778, "learning_rate": 3.5460733529119908e-06, "loss": 6.55091552734375, "step": 1290 }, { "epoch": 0.259, "grad_norm": 0.0651378184556961, "learning_rate": 3.541869317503928e-06, "loss": 6.545086669921875, "step": 1295 }, { "epoch": 0.26, "grad_norm": 0.0653856098651886, "learning_rate": 3.537648420460038e-06, "loss": 6.5654754638671875, "step": 1300 }, { "epoch": 0.261, "grad_norm": 0.08197472244501114, "learning_rate": 3.5334107079393755e-06, "loss": 6.614053344726562, "step": 1305 }, { "epoch": 0.262, "grad_norm": 0.07018602639436722, "learning_rate": 3.5291562262848845e-06, "loss": 6.489773559570312, "step": 1310 }, { "epoch": 0.263, "grad_norm": 0.07549969106912613, "learning_rate": 3.5248850220228957e-06, "loss": 6.4777587890625, "step": 1315 }, { "epoch": 0.264, "grad_norm": 0.07509016990661621, "learning_rate": 3.5205971418626145e-06, "loss": 6.554988861083984, "step": 1320 }, { "epoch": 0.265, "grad_norm": 0.07180987298488617, "learning_rate": 3.51629263269561e-06, "loss": 6.668986511230469, "step": 1325 }, { "epoch": 0.266, "grad_norm": 0.07208196818828583, "learning_rate": 3.511971541595307e-06, "loss": 6.480735778808594, "step": 1330 }, { "epoch": 0.267, "grad_norm": 0.08938033133745193, "learning_rate": 3.5076339158164635e-06, "loss": 6.487246704101563, "step": 1335 }, { "epoch": 0.268, "grad_norm": 0.0639733299612999, "learning_rate": 3.503279802794662e-06, "loss": 6.5667259216308596, "step": 1340 }, { "epoch": 0.269, "grad_norm": 0.11628873646259308, "learning_rate": 3.4989092501457832e-06, "loss": 6.565748596191407, "step": 1345 }, { "epoch": 0.27, "grad_norm": 0.0958283543586731, "learning_rate": 3.4945223056654914e-06, "loss": 6.564359283447265, "step": 1350 }, { "epoch": 0.27, "eval_accuracy": 0.1386959706959707, "eval_loss": 6.456244945526123, "eval_runtime": 10.3332, "eval_samples_per_second": 9.678, "eval_steps_per_second": 1.645, "step": 1350 }, { "epoch": 0.271, "grad_norm": 0.08361370116472244, "learning_rate": 3.4901190173287086e-06, "loss": 6.599095153808594, "step": 1355 }, { "epoch": 0.272, "grad_norm": 0.07728071510791779, "learning_rate": 3.48569943328909e-06, "loss": 6.567552185058593, "step": 1360 }, { "epoch": 0.273, "grad_norm": 0.23476524651050568, "learning_rate": 3.4812636018784994e-06, "loss": 6.519585418701172, "step": 1365 }, { "epoch": 0.274, "grad_norm": 0.08214252442121506, "learning_rate": 3.476811571606478e-06, "loss": 6.542357635498047, "step": 1370 }, { "epoch": 0.275, "grad_norm": 0.07677047699689865, "learning_rate": 3.4723433911597163e-06, "loss": 6.5419761657714846, "step": 1375 }, { "epoch": 0.276, "grad_norm": 0.11742841452360153, "learning_rate": 3.4678591094015187e-06, "loss": 6.5219581604003904, "step": 1380 }, { "epoch": 0.277, "grad_norm": 0.09686063230037689, "learning_rate": 3.4633587753712717e-06, "loss": 6.592768859863281, "step": 1385 }, { "epoch": 0.278, "grad_norm": 0.09387538582086563, "learning_rate": 3.458842438283909e-06, "loss": 6.60013427734375, "step": 1390 }, { "epoch": 0.279, "grad_norm": 0.0723787397146225, "learning_rate": 3.4543101475293682e-06, "loss": 6.4840553283691404, "step": 1395 }, { "epoch": 0.28, "grad_norm": 0.06756219267845154, "learning_rate": 3.449761952672055e-06, "loss": 6.542083740234375, "step": 1400 }, { "epoch": 0.281, "grad_norm": 0.0757589340209961, "learning_rate": 3.4451979034502994e-06, "loss": 6.548152923583984, "step": 1405 }, { "epoch": 0.282, "grad_norm": 0.08698936551809311, "learning_rate": 3.440618049775814e-06, "loss": 6.562844085693359, "step": 1410 }, { "epoch": 0.283, "grad_norm": 0.08987753838300705, "learning_rate": 3.436022441733143e-06, "loss": 6.502987670898437, "step": 1415 }, { "epoch": 0.284, "grad_norm": 0.07419227808713913, "learning_rate": 3.43141112957912e-06, "loss": 6.47925033569336, "step": 1420 }, { "epoch": 0.285, "grad_norm": 0.0743662565946579, "learning_rate": 3.4267841637423166e-06, "loss": 6.590135955810547, "step": 1425 }, { "epoch": 0.286, "grad_norm": 0.09506815671920776, "learning_rate": 3.422141594822489e-06, "loss": 6.4904052734375, "step": 1430 }, { "epoch": 0.287, "grad_norm": 0.06352763622999191, "learning_rate": 3.4174834735900283e-06, "loss": 6.492788696289063, "step": 1435 }, { "epoch": 0.288, "grad_norm": 0.1327190101146698, "learning_rate": 3.4128098509854014e-06, "loss": 6.528990936279297, "step": 1440 }, { "epoch": 0.289, "grad_norm": 0.1287909299135208, "learning_rate": 3.4081207781185963e-06, "loss": 6.511381530761719, "step": 1445 }, { "epoch": 0.29, "grad_norm": 0.05822750926017761, "learning_rate": 3.4034163062685623e-06, "loss": 6.534752655029297, "step": 1450 }, { "epoch": 0.291, "grad_norm": 0.08409831672906876, "learning_rate": 3.3986964868826498e-06, "loss": 6.494256591796875, "step": 1455 }, { "epoch": 0.292, "grad_norm": 0.11647513508796692, "learning_rate": 3.393961371576048e-06, "loss": 6.531385040283203, "step": 1460 }, { "epoch": 0.293, "grad_norm": 0.06273698806762695, "learning_rate": 3.3892110121312196e-06, "loss": 6.5295967102050785, "step": 1465 }, { "epoch": 0.294, "grad_norm": 0.06390611082315445, "learning_rate": 3.3844454604973327e-06, "loss": 6.487610626220703, "step": 1470 }, { "epoch": 0.295, "grad_norm": 0.0920199602842331, "learning_rate": 3.3796647687896982e-06, "loss": 6.561590576171875, "step": 1475 }, { "epoch": 0.296, "grad_norm": 0.07950405776500702, "learning_rate": 3.3748689892891945e-06, "loss": 6.498722839355469, "step": 1480 }, { "epoch": 0.297, "grad_norm": 0.0956474170088768, "learning_rate": 3.3700581744416966e-06, "loss": 6.526725006103516, "step": 1485 }, { "epoch": 0.298, "grad_norm": 0.07354336977005005, "learning_rate": 3.3652323768575066e-06, "loss": 6.478034210205078, "step": 1490 }, { "epoch": 0.299, "grad_norm": 0.07010781019926071, "learning_rate": 3.360391649310772e-06, "loss": 6.511841583251953, "step": 1495 }, { "epoch": 0.3, "grad_norm": 0.07634287327528, "learning_rate": 3.355536044738915e-06, "loss": 6.506979370117188, "step": 1500 }, { "epoch": 0.3, "eval_accuracy": 0.138991452991453, "eval_loss": 6.424478530883789, "eval_runtime": 10.3935, "eval_samples_per_second": 9.621, "eval_steps_per_second": 1.636, "step": 1500 }, { "epoch": 0.301, "grad_norm": 0.07124020904302597, "learning_rate": 3.3506656162420487e-06, "loss": 6.548468780517578, "step": 1505 }, { "epoch": 0.302, "grad_norm": 0.08137217909097672, "learning_rate": 3.345780417082399e-06, "loss": 6.5169837951660154, "step": 1510 }, { "epoch": 0.303, "grad_norm": 0.07528692483901978, "learning_rate": 3.3408805006837212e-06, "loss": 6.5109718322753904, "step": 1515 }, { "epoch": 0.304, "grad_norm": 0.09413464367389679, "learning_rate": 3.335965920630716e-06, "loss": 6.50414810180664, "step": 1520 }, { "epoch": 0.305, "grad_norm": 0.11192154139280319, "learning_rate": 3.3310367306684432e-06, "loss": 6.555927276611328, "step": 1525 }, { "epoch": 0.306, "grad_norm": 0.09222781658172607, "learning_rate": 3.3260929847017352e-06, "loss": 6.508258056640625, "step": 1530 }, { "epoch": 0.307, "grad_norm": 0.0601465106010437, "learning_rate": 3.3211347367946046e-06, "loss": 6.509712219238281, "step": 1535 }, { "epoch": 0.308, "grad_norm": 0.07379843294620514, "learning_rate": 3.3161620411696573e-06, "loss": 6.513530731201172, "step": 1540 }, { "epoch": 0.309, "grad_norm": 0.07197915762662888, "learning_rate": 3.311174952207496e-06, "loss": 6.489860534667969, "step": 1545 }, { "epoch": 0.31, "grad_norm": 0.0705137625336647, "learning_rate": 3.3061735244461258e-06, "loss": 6.491265106201172, "step": 1550 }, { "epoch": 0.311, "grad_norm": 0.062279585748910904, "learning_rate": 3.3011578125803596e-06, "loss": 6.476299285888672, "step": 1555 }, { "epoch": 0.312, "grad_norm": 0.07427375763654709, "learning_rate": 3.2961278714612193e-06, "loss": 6.456025695800781, "step": 1560 }, { "epoch": 0.313, "grad_norm": 0.07860921323299408, "learning_rate": 3.2910837560953345e-06, "loss": 6.443370056152344, "step": 1565 }, { "epoch": 0.314, "grad_norm": 0.0653812438249588, "learning_rate": 3.2860255216443427e-06, "loss": 6.486808013916016, "step": 1570 }, { "epoch": 0.315, "grad_norm": 0.07543846219778061, "learning_rate": 3.2809532234242863e-06, "loss": 6.4591796875, "step": 1575 }, { "epoch": 0.316, "grad_norm": 0.06522826105356216, "learning_rate": 3.275866916905005e-06, "loss": 6.500060272216797, "step": 1580 }, { "epoch": 0.317, "grad_norm": 0.05764804780483246, "learning_rate": 3.2707666577095326e-06, "loss": 6.507598876953125, "step": 1585 }, { "epoch": 0.318, "grad_norm": 0.0758504718542099, "learning_rate": 3.265652501613486e-06, "loss": 6.476622009277344, "step": 1590 }, { "epoch": 0.319, "grad_norm": 0.06581117957830429, "learning_rate": 3.2605245045444574e-06, "loss": 6.449163818359375, "step": 1595 }, { "epoch": 0.32, "grad_norm": 0.2182990163564682, "learning_rate": 3.255382722581401e-06, "loss": 6.435308837890625, "step": 1600 }, { "epoch": 0.321, "grad_norm": 0.07734459638595581, "learning_rate": 3.2502272119540204e-06, "loss": 6.482182312011719, "step": 1605 }, { "epoch": 0.322, "grad_norm": 0.09094393253326416, "learning_rate": 3.245058029042154e-06, "loss": 6.544580078125, "step": 1610 }, { "epoch": 0.323, "grad_norm": 0.08472870290279388, "learning_rate": 3.239875230375158e-06, "loss": 6.462835693359375, "step": 1615 }, { "epoch": 0.324, "grad_norm": 0.08265180140733719, "learning_rate": 3.2346788726312887e-06, "loss": 6.495674133300781, "step": 1620 }, { "epoch": 0.325, "grad_norm": 0.10989709943532944, "learning_rate": 3.2294690126370806e-06, "loss": 6.509843444824218, "step": 1625 }, { "epoch": 0.326, "grad_norm": 0.11295666545629501, "learning_rate": 3.2242457073667287e-06, "loss": 6.541798400878906, "step": 1630 }, { "epoch": 0.327, "grad_norm": 0.08597501367330551, "learning_rate": 3.2190090139414627e-06, "loss": 6.481275177001953, "step": 1635 }, { "epoch": 0.328, "grad_norm": 0.06690355390310287, "learning_rate": 3.213758989628923e-06, "loss": 6.45312271118164, "step": 1640 }, { "epoch": 0.329, "grad_norm": 0.0718226209282875, "learning_rate": 3.2084956918425335e-06, "loss": 6.4438018798828125, "step": 1645 }, { "epoch": 0.33, "grad_norm": 0.11290576308965683, "learning_rate": 3.203219178140877e-06, "loss": 6.5095054626464846, "step": 1650 }, { "epoch": 0.33, "eval_accuracy": 0.14094505494505494, "eval_loss": 6.380516529083252, "eval_runtime": 10.3519, "eval_samples_per_second": 9.66, "eval_steps_per_second": 1.642, "step": 1650 }, { "epoch": 0.331, "grad_norm": 0.06508518010377884, "learning_rate": 3.1979295062270603e-06, "loss": 6.427039337158203, "step": 1655 }, { "epoch": 0.332, "grad_norm": 0.06661232560873032, "learning_rate": 3.1926267339480895e-06, "loss": 6.569775390625, "step": 1660 }, { "epoch": 0.333, "grad_norm": 0.07158288359642029, "learning_rate": 3.1873109192942307e-06, "loss": 6.505144500732422, "step": 1665 }, { "epoch": 0.334, "grad_norm": 0.06938688457012177, "learning_rate": 3.1819821203983843e-06, "loss": 6.410604858398438, "step": 1670 }, { "epoch": 0.335, "grad_norm": 0.08378569036722183, "learning_rate": 3.176640395535438e-06, "loss": 6.493407440185547, "step": 1675 }, { "epoch": 0.336, "grad_norm": 0.08100678771734238, "learning_rate": 3.171285803121641e-06, "loss": 6.4384620666503904, "step": 1680 }, { "epoch": 0.337, "grad_norm": 0.07643549144268036, "learning_rate": 3.165918401713958e-06, "loss": 6.493080139160156, "step": 1685 }, { "epoch": 0.338, "grad_norm": 0.0757737085223198, "learning_rate": 3.16053825000943e-06, "loss": 6.489937591552734, "step": 1690 }, { "epoch": 0.339, "grad_norm": 0.0830363929271698, "learning_rate": 3.155145406844535e-06, "loss": 6.443827819824219, "step": 1695 }, { "epoch": 0.34, "grad_norm": 0.09771528095006943, "learning_rate": 3.1497399311945412e-06, "loss": 6.492597961425782, "step": 1700 }, { "epoch": 0.341, "grad_norm": 0.10129442065954208, "learning_rate": 3.144321882172865e-06, "loss": 6.537218475341797, "step": 1705 }, { "epoch": 0.342, "grad_norm": 0.06285049766302109, "learning_rate": 3.138891319030421e-06, "loss": 6.446696472167969, "step": 1710 }, { "epoch": 0.343, "grad_norm": 0.07542657852172852, "learning_rate": 3.133448301154979e-06, "loss": 6.419207000732422, "step": 1715 }, { "epoch": 0.344, "grad_norm": 0.07626835256814957, "learning_rate": 3.1279928880705104e-06, "loss": 6.4702308654785154, "step": 1720 }, { "epoch": 0.345, "grad_norm": 0.08218275755643845, "learning_rate": 3.1225251394365383e-06, "loss": 6.416409301757812, "step": 1725 }, { "epoch": 0.346, "grad_norm": 0.07094059139490128, "learning_rate": 3.1170451150474853e-06, "loss": 6.4315032958984375, "step": 1730 }, { "epoch": 0.347, "grad_norm": 0.07319115102291107, "learning_rate": 3.1115528748320205e-06, "loss": 6.402560424804688, "step": 1735 }, { "epoch": 0.348, "grad_norm": 0.10192760825157166, "learning_rate": 3.1060484788524034e-06, "loss": 6.432094573974609, "step": 1740 }, { "epoch": 0.349, "grad_norm": 0.07734037935733795, "learning_rate": 3.100531987303826e-06, "loss": 6.432294464111328, "step": 1745 }, { "epoch": 0.35, "grad_norm": 0.07318601757287979, "learning_rate": 3.0950034605137563e-06, "loss": 6.447303009033203, "step": 1750 }, { "epoch": 0.351, "grad_norm": 0.06598563492298126, "learning_rate": 3.0894629589412776e-06, "loss": 6.5047248840332035, "step": 1755 }, { "epoch": 0.352, "grad_norm": 0.10212764143943787, "learning_rate": 3.0839105431764273e-06, "loss": 6.521588134765625, "step": 1760 }, { "epoch": 0.353, "grad_norm": 0.0771833136677742, "learning_rate": 3.0783462739395347e-06, "loss": 6.516807556152344, "step": 1765 }, { "epoch": 0.354, "grad_norm": 0.10352446138858795, "learning_rate": 3.072770212080556e-06, "loss": 6.434762573242187, "step": 1770 }, { "epoch": 0.355, "grad_norm": 0.08731052279472351, "learning_rate": 3.067182418578412e-06, "loss": 6.497015380859375, "step": 1775 }, { "epoch": 0.356, "grad_norm": 0.09280135482549667, "learning_rate": 3.0615829545403154e-06, "loss": 6.473223876953125, "step": 1780 }, { "epoch": 0.357, "grad_norm": 0.07267135381698608, "learning_rate": 3.055971881201109e-06, "loss": 6.508274841308594, "step": 1785 }, { "epoch": 0.358, "grad_norm": 0.06757643818855286, "learning_rate": 3.0503492599225916e-06, "loss": 6.476979827880859, "step": 1790 }, { "epoch": 0.359, "grad_norm": 0.06268265843391418, "learning_rate": 3.0447151521928475e-06, "loss": 6.417572784423828, "step": 1795 }, { "epoch": 0.36, "grad_norm": 0.0907832533121109, "learning_rate": 3.0390696196255786e-06, "loss": 6.457040405273437, "step": 1800 }, { "epoch": 0.36, "eval_accuracy": 0.1416092796092796, "eval_loss": 6.360020637512207, "eval_runtime": 10.3268, "eval_samples_per_second": 9.684, "eval_steps_per_second": 1.646, "step": 1800 }, { "epoch": 0.361, "grad_norm": 0.06729965656995773, "learning_rate": 3.033412723959422e-06, "loss": 6.357138442993164, "step": 1805 }, { "epoch": 0.362, "grad_norm": 0.12906977534294128, "learning_rate": 3.027744527057284e-06, "loss": 6.433673858642578, "step": 1810 }, { "epoch": 0.363, "grad_norm": 0.07005853205919266, "learning_rate": 3.0220650909056574e-06, "loss": 6.411043548583985, "step": 1815 }, { "epoch": 0.364, "grad_norm": 0.07833214104175568, "learning_rate": 3.0163744776139457e-06, "loss": 6.432377624511719, "step": 1820 }, { "epoch": 0.365, "grad_norm": 0.08222617954015732, "learning_rate": 3.010672749413785e-06, "loss": 6.4166709899902346, "step": 1825 }, { "epoch": 0.366, "grad_norm": 0.07129046320915222, "learning_rate": 3.00495996865836e-06, "loss": 6.371786880493164, "step": 1830 }, { "epoch": 0.367, "grad_norm": 0.07886160910129547, "learning_rate": 2.999236197821727e-06, "loss": 6.4869743347167965, "step": 1835 }, { "epoch": 0.368, "grad_norm": 0.0706927478313446, "learning_rate": 2.9935014994981264e-06, "loss": 6.370818328857422, "step": 1840 }, { "epoch": 0.369, "grad_norm": 0.06873773038387299, "learning_rate": 2.9877559364013003e-06, "loss": 6.457371520996094, "step": 1845 }, { "epoch": 0.37, "grad_norm": 0.06985519826412201, "learning_rate": 2.981999571363806e-06, "loss": 6.5107368469238285, "step": 1850 }, { "epoch": 0.371, "grad_norm": 0.07739956676959991, "learning_rate": 2.9762324673363294e-06, "loss": 6.502996826171875, "step": 1855 }, { "epoch": 0.372, "grad_norm": 0.07745375484228134, "learning_rate": 2.9704546873869973e-06, "loss": 6.466319274902344, "step": 1860 }, { "epoch": 0.373, "grad_norm": 0.07050798833370209, "learning_rate": 2.964666294700683e-06, "loss": 6.417623901367188, "step": 1865 }, { "epoch": 0.374, "grad_norm": 0.08847381919622421, "learning_rate": 2.9588673525783243e-06, "loss": 6.471012878417969, "step": 1870 }, { "epoch": 0.375, "grad_norm": 0.06258077919483185, "learning_rate": 2.953057924436222e-06, "loss": 6.468167114257812, "step": 1875 }, { "epoch": 0.376, "grad_norm": 0.10755794495344162, "learning_rate": 2.9472380738053507e-06, "loss": 6.4053596496582035, "step": 1880 }, { "epoch": 0.377, "grad_norm": 0.07566042244434357, "learning_rate": 2.9414078643306656e-06, "loss": 6.423107147216797, "step": 1885 }, { "epoch": 0.378, "grad_norm": 0.06413055211305618, "learning_rate": 2.935567359770402e-06, "loss": 6.366802215576172, "step": 1890 }, { "epoch": 0.379, "grad_norm": 0.07258564233779907, "learning_rate": 2.929716623995384e-06, "loss": 6.4979804992675785, "step": 1895 }, { "epoch": 0.38, "grad_norm": 0.07089866697788239, "learning_rate": 2.92385572098832e-06, "loss": 6.426543426513672, "step": 1900 }, { "epoch": 0.381, "grad_norm": 0.1062646433711052, "learning_rate": 2.917984714843106e-06, "loss": 6.410246276855469, "step": 1905 }, { "epoch": 0.382, "grad_norm": 0.06609494239091873, "learning_rate": 2.9121036697641246e-06, "loss": 6.521483612060547, "step": 1910 }, { "epoch": 0.383, "grad_norm": 0.10069076716899872, "learning_rate": 2.9062126500655423e-06, "loss": 6.415631103515625, "step": 1915 }, { "epoch": 0.384, "grad_norm": 0.09040419012308121, "learning_rate": 2.900311720170607e-06, "loss": 6.462349700927734, "step": 1920 }, { "epoch": 0.385, "grad_norm": 0.07208941876888275, "learning_rate": 2.8944009446109422e-06, "loss": 6.416206359863281, "step": 1925 }, { "epoch": 0.386, "grad_norm": 0.07884255051612854, "learning_rate": 2.888480388025844e-06, "loss": 6.340870666503906, "step": 1930 }, { "epoch": 0.387, "grad_norm": 0.0692768543958664, "learning_rate": 2.8825501151615683e-06, "loss": 6.401695251464844, "step": 1935 }, { "epoch": 0.388, "grad_norm": 0.07506253570318222, "learning_rate": 2.8766101908706305e-06, "loss": 6.508678436279297, "step": 1940 }, { "epoch": 0.389, "grad_norm": 0.0661938264966011, "learning_rate": 2.8706606801110913e-06, "loss": 6.381354141235351, "step": 1945 }, { "epoch": 0.39, "grad_norm": 0.06145844608545303, "learning_rate": 2.8647016479458466e-06, "loss": 6.404244232177734, "step": 1950 }, { "epoch": 0.39, "eval_accuracy": 0.14162881562881563, "eval_loss": 6.339434623718262, "eval_runtime": 10.2887, "eval_samples_per_second": 9.719, "eval_steps_per_second": 1.652, "step": 1950 }, { "epoch": 0.391, "grad_norm": 0.07143565267324448, "learning_rate": 2.858733159541917e-06, "loss": 6.414325714111328, "step": 1955 }, { "epoch": 0.392, "grad_norm": 0.09751276671886444, "learning_rate": 2.8527552801697353e-06, "loss": 6.454493713378906, "step": 1960 }, { "epoch": 0.393, "grad_norm": 0.07358941435813904, "learning_rate": 2.846768075202434e-06, "loss": 6.389128494262695, "step": 1965 }, { "epoch": 0.394, "grad_norm": 0.10593241453170776, "learning_rate": 2.8407716101151263e-06, "loss": 6.536373138427734, "step": 1970 }, { "epoch": 0.395, "grad_norm": 0.08145789057016373, "learning_rate": 2.834765950484194e-06, "loss": 6.53704605102539, "step": 1975 }, { "epoch": 0.396, "grad_norm": 0.08613098412752151, "learning_rate": 2.8287511619865686e-06, "loss": 6.46817626953125, "step": 1980 }, { "epoch": 0.397, "grad_norm": 0.0659852847456932, "learning_rate": 2.8227273103990125e-06, "loss": 6.42239990234375, "step": 1985 }, { "epoch": 0.398, "grad_norm": 0.07967545092105865, "learning_rate": 2.8166944615974036e-06, "loss": 6.402915191650391, "step": 1990 }, { "epoch": 0.399, "grad_norm": 0.08329648524522781, "learning_rate": 2.810652681556008e-06, "loss": 6.374594116210938, "step": 1995 }, { "epoch": 0.4, "grad_norm": 0.11066129803657532, "learning_rate": 2.804602036346765e-06, "loss": 6.40692138671875, "step": 2000 }, { "epoch": 0.401, "grad_norm": 0.07232162356376648, "learning_rate": 2.7985425921385614e-06, "loss": 6.517178344726562, "step": 2005 }, { "epoch": 0.402, "grad_norm": 0.08892683684825897, "learning_rate": 2.7924744151965082e-06, "loss": 6.389472198486328, "step": 2010 }, { "epoch": 0.403, "grad_norm": 0.07714874297380447, "learning_rate": 2.7863975718812157e-06, "loss": 6.390988159179687, "step": 2015 }, { "epoch": 0.404, "grad_norm": 0.07850048691034317, "learning_rate": 2.7803121286480694e-06, "loss": 6.434590148925781, "step": 2020 }, { "epoch": 0.405, "grad_norm": 0.09433537721633911, "learning_rate": 2.774218152046501e-06, "loss": 6.42537841796875, "step": 2025 }, { "epoch": 0.406, "grad_norm": 0.08464869856834412, "learning_rate": 2.7681157087192627e-06, "loss": 6.396466827392578, "step": 2030 }, { "epoch": 0.407, "grad_norm": 0.07773975282907486, "learning_rate": 2.7620048654016962e-06, "loss": 6.33466796875, "step": 2035 }, { "epoch": 0.408, "grad_norm": 0.07614398002624512, "learning_rate": 2.7558856889210064e-06, "loss": 6.456300354003906, "step": 2040 }, { "epoch": 0.409, "grad_norm": 0.13619555532932281, "learning_rate": 2.749758246195526e-06, "loss": 6.360931396484375, "step": 2045 }, { "epoch": 0.41, "grad_norm": 0.06665536761283875, "learning_rate": 2.7436226042339875e-06, "loss": 6.435082244873047, "step": 2050 }, { "epoch": 0.411, "grad_norm": 0.07151633501052856, "learning_rate": 2.737478830134787e-06, "loss": 6.470430755615235, "step": 2055 }, { "epoch": 0.412, "grad_norm": 0.06864432990550995, "learning_rate": 2.7313269910852557e-06, "loss": 6.375028228759765, "step": 2060 }, { "epoch": 0.413, "grad_norm": 0.07884984463453293, "learning_rate": 2.725167154360918e-06, "loss": 6.419892120361328, "step": 2065 }, { "epoch": 0.414, "grad_norm": 0.09694062173366547, "learning_rate": 2.7189993873247627e-06, "loss": 6.416704559326172, "step": 2070 }, { "epoch": 0.415, "grad_norm": 0.08397479355335236, "learning_rate": 2.712823757426501e-06, "loss": 6.319974517822265, "step": 2075 }, { "epoch": 0.416, "grad_norm": 0.07720082998275757, "learning_rate": 2.706640332201834e-06, "loss": 6.391875839233398, "step": 2080 }, { "epoch": 0.417, "grad_norm": 0.07131435722112656, "learning_rate": 2.700449179271706e-06, "loss": 6.3818107604980465, "step": 2085 }, { "epoch": 0.418, "grad_norm": 0.22894398868083954, "learning_rate": 2.694250366341577e-06, "loss": 6.468603515625, "step": 2090 }, { "epoch": 0.419, "grad_norm": 0.08977403491735458, "learning_rate": 2.688043961200669e-06, "loss": 6.402335357666016, "step": 2095 }, { "epoch": 0.42, "grad_norm": 0.06067352741956711, "learning_rate": 2.681830031721236e-06, "loss": 6.368752288818359, "step": 2100 }, { "epoch": 0.42, "eval_accuracy": 0.1413943833943834, "eval_loss": 6.312870979309082, "eval_runtime": 10.3742, "eval_samples_per_second": 9.639, "eval_steps_per_second": 1.639, "step": 2100 }, { "epoch": 0.421, "grad_norm": 0.08158699423074722, "learning_rate": 2.675608645857815e-06, "loss": 6.372353363037109, "step": 2105 }, { "epoch": 0.422, "grad_norm": 0.06957968324422836, "learning_rate": 2.6693798716464858e-06, "loss": 6.340359497070312, "step": 2110 }, { "epoch": 0.423, "grad_norm": 0.08563192933797836, "learning_rate": 2.6631437772041238e-06, "loss": 6.318928909301758, "step": 2115 }, { "epoch": 0.424, "grad_norm": 0.11714059859514236, "learning_rate": 2.656900430727659e-06, "loss": 6.435954284667969, "step": 2120 }, { "epoch": 0.425, "grad_norm": 0.11297214776277542, "learning_rate": 2.650649900493329e-06, "loss": 6.496327972412109, "step": 2125 }, { "epoch": 0.426, "grad_norm": 0.08787044882774353, "learning_rate": 2.6443922548559303e-06, "loss": 6.389971160888672, "step": 2130 }, { "epoch": 0.427, "grad_norm": 0.07244838774204254, "learning_rate": 2.638127562248073e-06, "loss": 6.446420288085937, "step": 2135 }, { "epoch": 0.428, "grad_norm": 0.06608100235462189, "learning_rate": 2.6318558911794333e-06, "loss": 6.427850341796875, "step": 2140 }, { "epoch": 0.429, "grad_norm": 0.07050882279872894, "learning_rate": 2.625577310235998e-06, "loss": 6.362213516235352, "step": 2145 }, { "epoch": 0.43, "grad_norm": 0.08506868034601212, "learning_rate": 2.619291888079326e-06, "loss": 6.363969039916992, "step": 2150 }, { "epoch": 0.431, "grad_norm": 0.08637284487485886, "learning_rate": 2.612999693445784e-06, "loss": 6.497118377685547, "step": 2155 }, { "epoch": 0.432, "grad_norm": 0.10498792678117752, "learning_rate": 2.606700795145807e-06, "loss": 6.395422744750976, "step": 2160 }, { "epoch": 0.433, "grad_norm": 0.0660381093621254, "learning_rate": 2.6003952620631354e-06, "loss": 6.355922698974609, "step": 2165 }, { "epoch": 0.434, "grad_norm": 0.1197703629732132, "learning_rate": 2.5940831631540697e-06, "loss": 6.523306274414063, "step": 2170 }, { "epoch": 0.435, "grad_norm": 0.1967087686061859, "learning_rate": 2.5877645674467124e-06, "loss": 6.463238525390625, "step": 2175 }, { "epoch": 0.436, "grad_norm": 0.09303022921085358, "learning_rate": 2.581439544040214e-06, "loss": 6.421237182617188, "step": 2180 }, { "epoch": 0.437, "grad_norm": 0.09917596727609634, "learning_rate": 2.575108162104017e-06, "loss": 6.473545074462891, "step": 2185 }, { "epoch": 0.438, "grad_norm": 0.072263203561306, "learning_rate": 2.568770490877099e-06, "loss": 6.432736206054687, "step": 2190 }, { "epoch": 0.439, "grad_norm": 0.1333879828453064, "learning_rate": 2.5624265996672183e-06, "loss": 6.448049926757813, "step": 2195 }, { "epoch": 0.44, "grad_norm": 0.08322051167488098, "learning_rate": 2.556076557850152e-06, "loss": 6.379525375366211, "step": 2200 }, { "epoch": 0.441, "grad_norm": 0.09212733060121536, "learning_rate": 2.5497204348689403e-06, "loss": 6.376298141479492, "step": 2205 }, { "epoch": 0.442, "grad_norm": 0.1000766009092331, "learning_rate": 2.5433583002331268e-06, "loss": 6.45618896484375, "step": 2210 }, { "epoch": 0.443, "grad_norm": 0.07744766026735306, "learning_rate": 2.5369902235179948e-06, "loss": 6.418743133544922, "step": 2215 }, { "epoch": 0.444, "grad_norm": 0.09729813784360886, "learning_rate": 2.530616274363813e-06, "loss": 6.469072723388672, "step": 2220 }, { "epoch": 0.445, "grad_norm": 0.10913117229938507, "learning_rate": 2.5242365224750657e-06, "loss": 6.3639171600341795, "step": 2225 }, { "epoch": 0.446, "grad_norm": 0.07157459110021591, "learning_rate": 2.5178510376196997e-06, "loss": 6.399369430541992, "step": 2230 }, { "epoch": 0.447, "grad_norm": 0.07375568896532059, "learning_rate": 2.5114598896283524e-06, "loss": 6.35676383972168, "step": 2235 }, { "epoch": 0.448, "grad_norm": 0.09739139676094055, "learning_rate": 2.505063148393595e-06, "loss": 6.3606117248535154, "step": 2240 }, { "epoch": 0.449, "grad_norm": 0.08083254098892212, "learning_rate": 2.4986608838691663e-06, "loss": 6.317353439331055, "step": 2245 }, { "epoch": 0.45, "grad_norm": 0.07497039437294006, "learning_rate": 2.4922531660692034e-06, "loss": 6.349576187133789, "step": 2250 }, { "epoch": 0.45, "eval_accuracy": 0.14222466422466423, "eval_loss": 6.2949748039245605, "eval_runtime": 10.4132, "eval_samples_per_second": 9.603, "eval_steps_per_second": 1.633, "step": 2250 }, { "epoch": 0.451, "grad_norm": 0.0646035447716713, "learning_rate": 2.4858400650674826e-06, "loss": 6.4240165710449215, "step": 2255 }, { "epoch": 0.452, "grad_norm": 0.08820938318967819, "learning_rate": 2.4794216509966485e-06, "loss": 6.355297470092774, "step": 2260 }, { "epoch": 0.453, "grad_norm": 0.09034152328968048, "learning_rate": 2.4729979940474495e-06, "loss": 6.415824890136719, "step": 2265 }, { "epoch": 0.454, "grad_norm": 0.07817864418029785, "learning_rate": 2.4665691644679685e-06, "loss": 6.402967071533203, "step": 2270 }, { "epoch": 0.455, "grad_norm": 0.08539751917123795, "learning_rate": 2.460135232562856e-06, "loss": 6.40893783569336, "step": 2275 }, { "epoch": 0.456, "grad_norm": 0.11367590725421906, "learning_rate": 2.4536962686925595e-06, "loss": 6.441493225097656, "step": 2280 }, { "epoch": 0.457, "grad_norm": 0.09240754693746567, "learning_rate": 2.4472523432725577e-06, "loss": 6.361612319946289, "step": 2285 }, { "epoch": 0.458, "grad_norm": 0.12638594210147858, "learning_rate": 2.4408035267725862e-06, "loss": 6.414551544189453, "step": 2290 }, { "epoch": 0.459, "grad_norm": 0.10394217073917389, "learning_rate": 2.434349889715869e-06, "loss": 6.383968734741211, "step": 2295 }, { "epoch": 0.46, "grad_norm": 0.12000339478254318, "learning_rate": 2.4278915026783463e-06, "loss": 6.412042236328125, "step": 2300 }, { "epoch": 0.461, "grad_norm": 0.07175832241773605, "learning_rate": 2.421428436287905e-06, "loss": 6.3555866241455075, "step": 2305 }, { "epoch": 0.462, "grad_norm": 0.10095806419849396, "learning_rate": 2.4149607612236027e-06, "loss": 6.40416259765625, "step": 2310 }, { "epoch": 0.463, "grad_norm": 0.12205059826374054, "learning_rate": 2.408488548214899e-06, "loss": 6.329568862915039, "step": 2315 }, { "epoch": 0.464, "grad_norm": 0.06791554391384125, "learning_rate": 2.4020118680408777e-06, "loss": 6.424092102050781, "step": 2320 }, { "epoch": 0.465, "grad_norm": 0.08330659568309784, "learning_rate": 2.395530791529475e-06, "loss": 6.388699722290039, "step": 2325 }, { "epoch": 0.466, "grad_norm": 0.10129342973232269, "learning_rate": 2.389045389556706e-06, "loss": 6.319640350341797, "step": 2330 }, { "epoch": 0.467, "grad_norm": 0.07156874239444733, "learning_rate": 2.3825557330458873e-06, "loss": 6.517421722412109, "step": 2335 }, { "epoch": 0.468, "grad_norm": 0.10998792201280594, "learning_rate": 2.376061892966863e-06, "loss": 6.415800476074219, "step": 2340 }, { "epoch": 0.469, "grad_norm": 0.07388386875391006, "learning_rate": 2.3695639403352275e-06, "loss": 6.389354705810547, "step": 2345 }, { "epoch": 0.47, "grad_norm": 0.07077425718307495, "learning_rate": 2.36306194621155e-06, "loss": 6.414984130859375, "step": 2350 }, { "epoch": 0.471, "grad_norm": 0.1409406214952469, "learning_rate": 2.3565559817005965e-06, "loss": 6.4110252380371096, "step": 2355 }, { "epoch": 0.472, "grad_norm": 0.12504221498966217, "learning_rate": 2.350046117950552e-06, "loss": 6.524173736572266, "step": 2360 }, { "epoch": 0.473, "grad_norm": 0.09057491272687912, "learning_rate": 2.3435324261522446e-06, "loss": 6.359022521972657, "step": 2365 }, { "epoch": 0.474, "grad_norm": 0.08076512813568115, "learning_rate": 2.337014977538363e-06, "loss": 6.364510345458984, "step": 2370 }, { "epoch": 0.475, "grad_norm": 0.07883577793836594, "learning_rate": 2.330493843382682e-06, "loss": 6.344949340820312, "step": 2375 }, { "epoch": 0.476, "grad_norm": 0.07244715094566345, "learning_rate": 2.323969094999279e-06, "loss": 6.497917938232422, "step": 2380 }, { "epoch": 0.477, "grad_norm": 0.06551758199930191, "learning_rate": 2.3174408037417577e-06, "loss": 6.289946746826172, "step": 2385 }, { "epoch": 0.478, "grad_norm": 0.08715993165969849, "learning_rate": 2.310909041002466e-06, "loss": 6.448321533203125, "step": 2390 }, { "epoch": 0.479, "grad_norm": 0.08652404695749283, "learning_rate": 2.3043738782117127e-06, "loss": 6.329542922973633, "step": 2395 }, { "epoch": 0.48, "grad_norm": 0.06743095815181732, "learning_rate": 2.297835386836993e-06, "loss": 6.365715026855469, "step": 2400 }, { "epoch": 0.48, "eval_accuracy": 0.1423003663003663, "eval_loss": 6.278029441833496, "eval_runtime": 10.2925, "eval_samples_per_second": 9.716, "eval_steps_per_second": 1.652, "step": 2400 } ], "logging_steps": 5, "max_steps": 5000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 6, "trial_name": null, "trial_params": null }