{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3, "eval_steps": 150, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.001, "grad_norm": 0.27235767245292664, "learning_rate": 6.4e-08, "loss": 10.786966705322266, "step": 5 }, { "epoch": 0.002, "grad_norm": 0.36470845341682434, "learning_rate": 1.44e-07, "loss": 10.004191589355468, "step": 10 }, { "epoch": 0.003, "grad_norm": 0.18794603645801544, "learning_rate": 2.24e-07, "loss": 9.357711791992188, "step": 15 }, { "epoch": 0.004, "grad_norm": 0.15133747458457947, "learning_rate": 3.0399999999999997e-07, "loss": 9.077755737304688, "step": 20 }, { "epoch": 0.005, "grad_norm": 0.13880157470703125, "learning_rate": 3.84e-07, "loss": 8.826399993896484, "step": 25 }, { "epoch": 0.006, "grad_norm": 0.12539362907409668, "learning_rate": 4.64e-07, "loss": 8.724310302734375, "step": 30 }, { "epoch": 0.007, "grad_norm": 0.11178825795650482, "learning_rate": 5.44e-07, "loss": 8.595573425292969, "step": 35 }, { "epoch": 0.008, "grad_norm": 0.16203832626342773, "learning_rate": 6.24e-07, "loss": 8.613536834716797, "step": 40 }, { "epoch": 0.009, "grad_norm": 0.11954408138990402, "learning_rate": 7.04e-07, "loss": 8.435651397705078, "step": 45 }, { "epoch": 0.01, "grad_norm": 0.09399693459272385, "learning_rate": 7.84e-07, "loss": 8.369234466552735, "step": 50 }, { "epoch": 0.011, "grad_norm": 0.08723891526460648, "learning_rate": 8.639999999999999e-07, "loss": 8.335379791259765, "step": 55 }, { "epoch": 0.012, "grad_norm": 0.09454073011875153, "learning_rate": 9.439999999999999e-07, "loss": 8.253787231445312, "step": 60 }, { "epoch": 0.013, "grad_norm": 0.09540031850337982, "learning_rate": 1.024e-06, "loss": 8.186421966552734, "step": 65 }, { "epoch": 0.014, "grad_norm": 0.11653102189302444, "learning_rate": 1.1040000000000001e-06, "loss": 8.132817840576172, "step": 70 }, { "epoch": 0.015, "grad_norm": 0.08094990253448486, "learning_rate": 1.1839999999999998e-06, "loss": 8.107611846923827, "step": 75 }, { "epoch": 0.016, "grad_norm": 0.10092103481292725, "learning_rate": 1.2639999999999999e-06, "loss": 8.071889495849609, "step": 80 }, { "epoch": 0.017, "grad_norm": 0.09236462414264679, "learning_rate": 1.344e-06, "loss": 8.15390625, "step": 85 }, { "epoch": 0.018, "grad_norm": 0.08973367512226105, "learning_rate": 1.4239999999999998e-06, "loss": 8.073948669433594, "step": 90 }, { "epoch": 0.019, "grad_norm": 0.08046946674585342, "learning_rate": 1.504e-06, "loss": 7.942198944091797, "step": 95 }, { "epoch": 0.02, "grad_norm": 0.07841245085000992, "learning_rate": 1.584e-06, "loss": 7.894329071044922, "step": 100 }, { "epoch": 0.021, "grad_norm": 0.07948298752307892, "learning_rate": 1.6639999999999999e-06, "loss": 7.908601379394531, "step": 105 }, { "epoch": 0.022, "grad_norm": 0.07720845937728882, "learning_rate": 1.744e-06, "loss": 7.923919677734375, "step": 110 }, { "epoch": 0.023, "grad_norm": 0.09289873391389847, "learning_rate": 1.824e-06, "loss": 7.866429138183594, "step": 115 }, { "epoch": 0.024, "grad_norm": 0.07957543432712555, "learning_rate": 1.904e-06, "loss": 7.828727722167969, "step": 120 }, { "epoch": 0.025, "grad_norm": 0.07522212713956833, "learning_rate": 1.984e-06, "loss": 7.83117446899414, "step": 125 }, { "epoch": 0.026, "grad_norm": 0.09532520920038223, "learning_rate": 2.064e-06, "loss": 7.8716987609863285, "step": 130 }, { "epoch": 0.027, "grad_norm": 0.07470740377902985, "learning_rate": 2.144e-06, "loss": 7.834799194335938, "step": 135 }, { "epoch": 0.028, "grad_norm": 0.07192815095186234, "learning_rate": 2.2240000000000002e-06, "loss": 7.736669921875, "step": 140 }, { "epoch": 0.029, "grad_norm": 0.09201541543006897, "learning_rate": 2.304e-06, "loss": 7.6827842712402346, "step": 145 }, { "epoch": 0.03, "grad_norm": 0.09225732833147049, "learning_rate": 2.384e-06, "loss": 7.745516967773438, "step": 150 }, { "epoch": 0.03, "eval_accuracy": 0.11922344322344322, "eval_loss": 7.651349067687988, "eval_runtime": 10.4261, "eval_samples_per_second": 9.591, "eval_steps_per_second": 1.631, "step": 150 }, { "epoch": 0.031, "grad_norm": 0.08881130814552307, "learning_rate": 2.464e-06, "loss": 7.674343872070312, "step": 155 }, { "epoch": 0.032, "grad_norm": 0.07704972475767136, "learning_rate": 2.544e-06, "loss": 7.681053161621094, "step": 160 }, { "epoch": 0.033, "grad_norm": 0.09186960011720657, "learning_rate": 2.624e-06, "loss": 7.690374755859375, "step": 165 }, { "epoch": 0.034, "grad_norm": 0.08565036207437515, "learning_rate": 2.704e-06, "loss": 7.603900146484375, "step": 170 }, { "epoch": 0.035, "grad_norm": 0.1499108374118805, "learning_rate": 2.7839999999999995e-06, "loss": 7.505958557128906, "step": 175 }, { "epoch": 0.036, "grad_norm": 0.06643059849739075, "learning_rate": 2.8639999999999996e-06, "loss": 7.573754119873047, "step": 180 }, { "epoch": 0.037, "grad_norm": 0.11821448802947998, "learning_rate": 2.9439999999999997e-06, "loss": 7.752062225341797, "step": 185 }, { "epoch": 0.038, "grad_norm": 0.08827198296785355, "learning_rate": 3.0239999999999998e-06, "loss": 7.5669189453125, "step": 190 }, { "epoch": 0.039, "grad_norm": 0.07519616931676865, "learning_rate": 3.104e-06, "loss": 7.571305847167968, "step": 195 }, { "epoch": 0.04, "grad_norm": 0.075102798640728, "learning_rate": 3.184e-06, "loss": 7.518638610839844, "step": 200 }, { "epoch": 0.041, "grad_norm": 0.10685888677835464, "learning_rate": 3.2639999999999996e-06, "loss": 7.512000274658203, "step": 205 }, { "epoch": 0.042, "grad_norm": 0.10541684180498123, "learning_rate": 3.3439999999999997e-06, "loss": 7.564778137207031, "step": 210 }, { "epoch": 0.043, "grad_norm": 0.09155019372701645, "learning_rate": 3.4239999999999997e-06, "loss": 7.4674217224121096, "step": 215 }, { "epoch": 0.044, "grad_norm": 0.11373615264892578, "learning_rate": 3.504e-06, "loss": 7.450457000732422, "step": 220 }, { "epoch": 0.045, "grad_norm": 0.07444982975721359, "learning_rate": 3.584e-06, "loss": 7.397786712646484, "step": 225 }, { "epoch": 0.046, "grad_norm": 0.08052903413772583, "learning_rate": 3.664e-06, "loss": 7.415688323974609, "step": 230 }, { "epoch": 0.047, "grad_norm": 0.08429361879825592, "learning_rate": 3.744e-06, "loss": 7.411205291748047, "step": 235 }, { "epoch": 0.048, "grad_norm": 0.08501375466585159, "learning_rate": 3.823999999999999e-06, "loss": 7.406707763671875, "step": 240 }, { "epoch": 0.049, "grad_norm": 0.10457716882228851, "learning_rate": 3.903999999999999e-06, "loss": 7.312602233886719, "step": 245 }, { "epoch": 0.05, "grad_norm": 0.09624126553535461, "learning_rate": 3.9839999999999995e-06, "loss": 7.360851287841797, "step": 250 }, { "epoch": 0.051, "grad_norm": 0.08660672605037689, "learning_rate": 3.99999300106024e-06, "loss": 7.353035736083984, "step": 255 }, { "epoch": 0.052, "grad_norm": 0.08430126309394836, "learning_rate": 3.9999645679514235e-06, "loss": 7.384159088134766, "step": 260 }, { "epoch": 0.053, "grad_norm": 0.07826503366231918, "learning_rate": 3.999914263550513e-06, "loss": 7.4195198059082035, "step": 265 }, { "epoch": 0.054, "grad_norm": 0.08577796816825867, "learning_rate": 3.9998420884076325e-06, "loss": 7.362513732910156, "step": 270 }, { "epoch": 0.055, "grad_norm": 0.0649741068482399, "learning_rate": 3.999748043312075e-06, "loss": 7.275961303710938, "step": 275 }, { "epoch": 0.056, "grad_norm": 0.07203389704227448, "learning_rate": 3.999632129292304e-06, "loss": 7.263797760009766, "step": 280 }, { "epoch": 0.057, "grad_norm": 0.12281067669391632, "learning_rate": 3.9994943476159364e-06, "loss": 7.287098693847656, "step": 285 }, { "epoch": 0.058, "grad_norm": 0.07184985280036926, "learning_rate": 3.999334699789731e-06, "loss": 7.240232849121094, "step": 290 }, { "epoch": 0.059, "grad_norm": 0.07799801975488663, "learning_rate": 3.99915318755957e-06, "loss": 7.2740531921386715, "step": 295 }, { "epoch": 0.06, "grad_norm": 0.0761650875210762, "learning_rate": 3.9989498129104425e-06, "loss": 7.299461364746094, "step": 300 }, { "epoch": 0.06, "eval_accuracy": 0.12382905982905983, "eval_loss": 7.217157363891602, "eval_runtime": 10.4259, "eval_samples_per_second": 9.591, "eval_steps_per_second": 1.631, "step": 300 }, { "epoch": 0.061, "grad_norm": 0.0692087933421135, "learning_rate": 3.998724578066421e-06, "loss": 7.243695831298828, "step": 305 }, { "epoch": 0.062, "grad_norm": 0.08431071788072586, "learning_rate": 3.998477485490638e-06, "loss": 7.292684173583984, "step": 310 }, { "epoch": 0.063, "grad_norm": 0.08417057991027832, "learning_rate": 3.998208537885259e-06, "loss": 7.222378540039062, "step": 315 }, { "epoch": 0.064, "grad_norm": 0.07904339581727982, "learning_rate": 3.997917738191449e-06, "loss": 7.278653717041015, "step": 320 }, { "epoch": 0.065, "grad_norm": 0.13258706033229828, "learning_rate": 3.99760508958935e-06, "loss": 7.202552795410156, "step": 325 }, { "epoch": 0.066, "grad_norm": 0.0901857390999794, "learning_rate": 3.997270595498036e-06, "loss": 7.205686950683594, "step": 330 }, { "epoch": 0.067, "grad_norm": 0.07317949831485748, "learning_rate": 3.99691425957548e-06, "loss": 7.293389892578125, "step": 335 }, { "epoch": 0.068, "grad_norm": 0.11255510151386261, "learning_rate": 3.996536085718516e-06, "loss": 7.229725646972656, "step": 340 }, { "epoch": 0.069, "grad_norm": 0.07706659287214279, "learning_rate": 3.996136078062792e-06, "loss": 7.257555389404297, "step": 345 }, { "epoch": 0.07, "grad_norm": 0.08863229304552078, "learning_rate": 3.995714240982727e-06, "loss": 7.257266235351563, "step": 350 }, { "epoch": 0.071, "grad_norm": 0.08663391321897507, "learning_rate": 3.995270579091465e-06, "loss": 7.118687438964844, "step": 355 }, { "epoch": 0.072, "grad_norm": 0.08917262405157089, "learning_rate": 3.99480509724082e-06, "loss": 7.238731384277344, "step": 360 }, { "epoch": 0.073, "grad_norm": 0.09512999653816223, "learning_rate": 3.994317800521228e-06, "loss": 7.2104545593261715, "step": 365 }, { "epoch": 0.074, "grad_norm": 0.10050003230571747, "learning_rate": 3.993808694261687e-06, "loss": 7.186836242675781, "step": 370 }, { "epoch": 0.075, "grad_norm": 0.12758338451385498, "learning_rate": 3.993277784029702e-06, "loss": 7.171599578857422, "step": 375 }, { "epoch": 0.076, "grad_norm": 0.08614124357700348, "learning_rate": 3.992725075631223e-06, "loss": 7.201605224609375, "step": 380 }, { "epoch": 0.077, "grad_norm": 0.07332151383161545, "learning_rate": 3.992150575110579e-06, "loss": 7.026101684570312, "step": 385 }, { "epoch": 0.078, "grad_norm": 0.0854375809431076, "learning_rate": 3.991554288750416e-06, "loss": 7.223291015625, "step": 390 }, { "epoch": 0.079, "grad_norm": 0.09470361471176147, "learning_rate": 3.990936223071627e-06, "loss": 7.0966438293457035, "step": 395 }, { "epoch": 0.08, "grad_norm": 0.06626710295677185, "learning_rate": 3.990296384833279e-06, "loss": 7.142760467529297, "step": 400 }, { "epoch": 0.081, "grad_norm": 0.13561668992042542, "learning_rate": 3.989634781032539e-06, "loss": 7.0024574279785154, "step": 405 }, { "epoch": 0.082, "grad_norm": 0.09113086760044098, "learning_rate": 3.9889514189046015e-06, "loss": 7.137001800537109, "step": 410 }, { "epoch": 0.083, "grad_norm": 0.07085978239774704, "learning_rate": 3.988246305922606e-06, "loss": 7.029933929443359, "step": 415 }, { "epoch": 0.084, "grad_norm": 0.06468215584754944, "learning_rate": 3.987519449797554e-06, "loss": 7.02655029296875, "step": 420 }, { "epoch": 0.085, "grad_norm": 0.12091367691755295, "learning_rate": 3.986770858478227e-06, "loss": 7.116294097900391, "step": 425 }, { "epoch": 0.086, "grad_norm": 0.10934042185544968, "learning_rate": 3.986000540151101e-06, "loss": 7.093238067626953, "step": 430 }, { "epoch": 0.087, "grad_norm": 0.07274443656206131, "learning_rate": 3.985208503240253e-06, "loss": 7.123175048828125, "step": 435 }, { "epoch": 0.088, "grad_norm": 0.0802014172077179, "learning_rate": 3.9843947564072725e-06, "loss": 7.188668060302734, "step": 440 }, { "epoch": 0.089, "grad_norm": 0.06854639202356339, "learning_rate": 3.983559308551164e-06, "loss": 7.106547546386719, "step": 445 }, { "epoch": 0.09, "grad_norm": 0.07703255116939545, "learning_rate": 3.982702168808252e-06, "loss": 7.064980316162109, "step": 450 }, { "epoch": 0.09, "eval_accuracy": 0.12983638583638585, "eval_loss": 6.963926315307617, "eval_runtime": 10.3988, "eval_samples_per_second": 9.616, "eval_steps_per_second": 1.635, "step": 450 }, { "epoch": 0.091, "grad_norm": 0.08548009395599365, "learning_rate": 3.981823346552078e-06, "loss": 7.028290557861328, "step": 455 }, { "epoch": 0.092, "grad_norm": 0.08591306209564209, "learning_rate": 3.980922851393302e-06, "loss": 7.01605453491211, "step": 460 }, { "epoch": 0.093, "grad_norm": 0.07920879870653152, "learning_rate": 3.9800006931795954e-06, "loss": 6.990329742431641, "step": 465 }, { "epoch": 0.094, "grad_norm": 0.07192882895469666, "learning_rate": 3.979056881995533e-06, "loss": 6.953098297119141, "step": 470 }, { "epoch": 0.095, "grad_norm": 0.06649420410394669, "learning_rate": 3.978091428162482e-06, "loss": 6.951087951660156, "step": 475 }, { "epoch": 0.096, "grad_norm": 0.08228413760662079, "learning_rate": 3.97710434223849e-06, "loss": 7.034120178222656, "step": 480 }, { "epoch": 0.097, "grad_norm": 0.10376594960689545, "learning_rate": 3.976095635018172e-06, "loss": 6.995967864990234, "step": 485 }, { "epoch": 0.098, "grad_norm": 0.06993073225021362, "learning_rate": 3.975065317532588e-06, "loss": 6.952136993408203, "step": 490 }, { "epoch": 0.099, "grad_norm": 0.08720093965530396, "learning_rate": 3.974013401049125e-06, "loss": 6.902699279785156, "step": 495 }, { "epoch": 0.1, "grad_norm": 0.1016659289598465, "learning_rate": 3.972939897071373e-06, "loss": 6.927466583251953, "step": 500 }, { "epoch": 0.101, "grad_norm": 0.06847221404314041, "learning_rate": 3.971844817338999e-06, "loss": 6.902294921875, "step": 505 }, { "epoch": 0.102, "grad_norm": 0.07875518500804901, "learning_rate": 3.97072817382762e-06, "loss": 6.962755584716797, "step": 510 }, { "epoch": 0.103, "grad_norm": 0.08157093822956085, "learning_rate": 3.969589978748671e-06, "loss": 6.956285095214843, "step": 515 }, { "epoch": 0.104, "grad_norm": 0.08181696385145187, "learning_rate": 3.968430244549271e-06, "loss": 6.970890808105469, "step": 520 }, { "epoch": 0.105, "grad_norm": 0.06938958913087845, "learning_rate": 3.967248983912086e-06, "loss": 6.917367553710937, "step": 525 }, { "epoch": 0.106, "grad_norm": 0.10486883670091629, "learning_rate": 3.966046209755195e-06, "loss": 6.8495323181152346, "step": 530 }, { "epoch": 0.107, "grad_norm": 0.08114153891801834, "learning_rate": 3.964821935231942e-06, "loss": 7.0064338684082035, "step": 535 }, { "epoch": 0.108, "grad_norm": 0.07422944903373718, "learning_rate": 3.963576173730798e-06, "loss": 6.89477767944336, "step": 540 }, { "epoch": 0.109, "grad_norm": 0.0750703290104866, "learning_rate": 3.9623089388752105e-06, "loss": 7.047392272949219, "step": 545 }, { "epoch": 0.11, "grad_norm": 0.07453129440546036, "learning_rate": 3.961020244523458e-06, "loss": 6.892961883544922, "step": 550 }, { "epoch": 0.111, "grad_norm": 0.08709228038787842, "learning_rate": 3.959710104768493e-06, "loss": 6.973309326171875, "step": 555 }, { "epoch": 0.112, "grad_norm": 0.06008852645754814, "learning_rate": 3.958378533937797e-06, "loss": 6.845113372802734, "step": 560 }, { "epoch": 0.113, "grad_norm": 0.09065559506416321, "learning_rate": 3.957025546593213e-06, "loss": 6.88427505493164, "step": 565 }, { "epoch": 0.114, "grad_norm": 0.12213204056024551, "learning_rate": 3.9556511575307956e-06, "loss": 6.970057678222656, "step": 570 }, { "epoch": 0.115, "grad_norm": 0.10695669054985046, "learning_rate": 3.954255381780641e-06, "loss": 6.839192199707031, "step": 575 }, { "epoch": 0.116, "grad_norm": 0.07049612700939178, "learning_rate": 3.952838234606732e-06, "loss": 6.857762145996094, "step": 580 }, { "epoch": 0.117, "grad_norm": 0.07053842395544052, "learning_rate": 3.951399731506761e-06, "loss": 6.933798217773438, "step": 585 }, { "epoch": 0.118, "grad_norm": 0.09034952521324158, "learning_rate": 3.949939888211968e-06, "loss": 6.888163757324219, "step": 590 }, { "epoch": 0.119, "grad_norm": 0.10722323507070541, "learning_rate": 3.948458720686966e-06, "loss": 6.820646667480469, "step": 595 }, { "epoch": 0.12, "grad_norm": 0.0687774196267128, "learning_rate": 3.946956245129566e-06, "loss": 6.872308349609375, "step": 600 }, { "epoch": 0.12, "eval_accuracy": 0.13161660561660563, "eval_loss": 6.804003715515137, "eval_runtime": 10.4302, "eval_samples_per_second": 9.588, "eval_steps_per_second": 1.63, "step": 600 }, { "epoch": 0.121, "grad_norm": 0.08994954824447632, "learning_rate": 3.945432477970598e-06, "loss": 6.806103515625, "step": 605 }, { "epoch": 0.122, "grad_norm": 0.07370273023843765, "learning_rate": 3.943887435873737e-06, "loss": 6.822203063964844, "step": 610 }, { "epoch": 0.123, "grad_norm": 0.07430048286914825, "learning_rate": 3.942321135735316e-06, "loss": 6.78031005859375, "step": 615 }, { "epoch": 0.124, "grad_norm": 0.1099916398525238, "learning_rate": 3.940733594684141e-06, "loss": 6.9381248474121096, "step": 620 }, { "epoch": 0.125, "grad_norm": 0.08312584459781647, "learning_rate": 3.939124830081308e-06, "loss": 6.797595977783203, "step": 625 }, { "epoch": 0.126, "grad_norm": 0.06789983063936234, "learning_rate": 3.937494859520009e-06, "loss": 6.870149230957031, "step": 630 }, { "epoch": 0.127, "grad_norm": 0.07728736847639084, "learning_rate": 3.93584370082534e-06, "loss": 6.83870849609375, "step": 635 }, { "epoch": 0.128, "grad_norm": 0.0719357579946518, "learning_rate": 3.934171372054108e-06, "loss": 6.799946594238281, "step": 640 }, { "epoch": 0.129, "grad_norm": 0.06783469766378403, "learning_rate": 3.932477891494634e-06, "loss": 6.865572357177735, "step": 645 }, { "epoch": 0.13, "grad_norm": 0.0726066380739212, "learning_rate": 3.930763277666547e-06, "loss": 6.877969360351562, "step": 650 }, { "epoch": 0.131, "grad_norm": 0.07925975322723389, "learning_rate": 3.9290275493205925e-06, "loss": 6.854046630859375, "step": 655 }, { "epoch": 0.132, "grad_norm": 0.09406735748052597, "learning_rate": 3.927270725438417e-06, "loss": 6.818197631835938, "step": 660 }, { "epoch": 0.133, "grad_norm": 0.07139192521572113, "learning_rate": 3.925492825232363e-06, "loss": 6.8501945495605465, "step": 665 }, { "epoch": 0.134, "grad_norm": 0.07504747807979584, "learning_rate": 3.923693868145263e-06, "loss": 6.735340881347656, "step": 670 }, { "epoch": 0.135, "grad_norm": 0.08873208612203598, "learning_rate": 3.921873873850225e-06, "loss": 6.871774291992187, "step": 675 }, { "epoch": 0.136, "grad_norm": 0.06658565998077393, "learning_rate": 3.920032862250413e-06, "loss": 6.893667602539063, "step": 680 }, { "epoch": 0.137, "grad_norm": 0.08774610608816147, "learning_rate": 3.918170853478837e-06, "loss": 6.7974403381347654, "step": 685 }, { "epoch": 0.138, "grad_norm": 0.09726791083812714, "learning_rate": 3.9162878678981245e-06, "loss": 6.884765625, "step": 690 }, { "epoch": 0.139, "grad_norm": 0.07077678292989731, "learning_rate": 3.914383926100305e-06, "loss": 6.812703704833984, "step": 695 }, { "epoch": 0.14, "grad_norm": 0.07094477862119675, "learning_rate": 3.912459048906582e-06, "loss": 6.804354095458985, "step": 700 }, { "epoch": 0.141, "grad_norm": 0.09806753695011139, "learning_rate": 3.910513257367103e-06, "loss": 6.849080657958984, "step": 705 }, { "epoch": 0.142, "grad_norm": 0.18241384625434875, "learning_rate": 3.908546572760732e-06, "loss": 6.818512725830078, "step": 710 }, { "epoch": 0.143, "grad_norm": 0.13180814683437347, "learning_rate": 3.906559016594818e-06, "loss": 6.707421875, "step": 715 }, { "epoch": 0.144, "grad_norm": 0.12693838775157928, "learning_rate": 3.904550610604957e-06, "loss": 6.848756408691406, "step": 720 }, { "epoch": 0.145, "grad_norm": 0.10394909232854843, "learning_rate": 3.902521376754754e-06, "loss": 6.815328979492188, "step": 725 }, { "epoch": 0.146, "grad_norm": 0.07995420694351196, "learning_rate": 3.900471337235584e-06, "loss": 6.754273986816406, "step": 730 }, { "epoch": 0.147, "grad_norm": 0.07130531221628189, "learning_rate": 3.898400514466355e-06, "loss": 6.76672134399414, "step": 735 }, { "epoch": 0.148, "grad_norm": 0.09754687547683716, "learning_rate": 3.896308931093249e-06, "loss": 6.763739776611328, "step": 740 }, { "epoch": 0.149, "grad_norm": 0.1489243358373642, "learning_rate": 3.8941966099894884e-06, "loss": 6.877587127685547, "step": 745 }, { "epoch": 0.15, "grad_norm": 0.1504446268081665, "learning_rate": 3.892063574255079e-06, "loss": 6.799798583984375, "step": 750 }, { "epoch": 0.15, "eval_accuracy": 0.13552625152625153, "eval_loss": 6.6949238777160645, "eval_runtime": 10.4885, "eval_samples_per_second": 9.534, "eval_steps_per_second": 1.621, "step": 750 }, { "epoch": 0.151, "grad_norm": 0.09069617837667465, "learning_rate": 3.889909847216555e-06, "loss": 6.758820343017578, "step": 755 }, { "epoch": 0.152, "grad_norm": 0.09917005896568298, "learning_rate": 3.887735452426733e-06, "loss": 6.7119590759277346, "step": 760 }, { "epoch": 0.153, "grad_norm": 0.1238972544670105, "learning_rate": 3.885540413664445e-06, "loss": 6.766522979736328, "step": 765 }, { "epoch": 0.154, "grad_norm": 0.07523474842309952, "learning_rate": 3.8833247549342845e-06, "loss": 6.868996429443359, "step": 770 }, { "epoch": 0.155, "grad_norm": 0.06490049511194229, "learning_rate": 3.8810885004663384e-06, "loss": 6.904286193847656, "step": 775 }, { "epoch": 0.156, "grad_norm": 0.08743885904550552, "learning_rate": 3.878831674715929e-06, "loss": 6.790882873535156, "step": 780 }, { "epoch": 0.157, "grad_norm": 0.07870012521743774, "learning_rate": 3.87655430236334e-06, "loss": 6.777058410644531, "step": 785 }, { "epoch": 0.158, "grad_norm": 0.07427074015140533, "learning_rate": 3.87425640831355e-06, "loss": 6.888807678222657, "step": 790 }, { "epoch": 0.159, "grad_norm": 0.07057588547468185, "learning_rate": 3.8719380176959615e-06, "loss": 6.771605682373047, "step": 795 }, { "epoch": 0.16, "grad_norm": 0.07889208197593689, "learning_rate": 3.869599155864123e-06, "loss": 6.67206039428711, "step": 800 }, { "epoch": 0.161, "grad_norm": 0.07260162383317947, "learning_rate": 3.867239848395452e-06, "loss": 6.824806976318359, "step": 805 }, { "epoch": 0.162, "grad_norm": 0.07244172692298889, "learning_rate": 3.8648601210909575e-06, "loss": 6.776896667480469, "step": 810 }, { "epoch": 0.163, "grad_norm": 0.11525345593690872, "learning_rate": 3.862459999974956e-06, "loss": 6.852814483642578, "step": 815 }, { "epoch": 0.164, "grad_norm": 0.0778544470667839, "learning_rate": 3.860039511294787e-06, "loss": 6.725788116455078, "step": 820 }, { "epoch": 0.165, "grad_norm": 0.06785336136817932, "learning_rate": 3.857598681520527e-06, "loss": 6.7376350402832035, "step": 825 }, { "epoch": 0.166, "grad_norm": 0.08495451509952545, "learning_rate": 3.855137537344699e-06, "loss": 6.7077491760253904, "step": 830 }, { "epoch": 0.167, "grad_norm": 0.06992894411087036, "learning_rate": 3.8526561056819825e-06, "loss": 6.713374328613281, "step": 835 }, { "epoch": 0.168, "grad_norm": 0.0781623125076294, "learning_rate": 3.850154413668916e-06, "loss": 6.7144775390625, "step": 840 }, { "epoch": 0.169, "grad_norm": 0.0706086978316307, "learning_rate": 3.847632488663602e-06, "loss": 6.768795776367187, "step": 845 }, { "epoch": 0.17, "grad_norm": 0.11462926864624023, "learning_rate": 3.84509035824541e-06, "loss": 6.714561462402344, "step": 850 }, { "epoch": 0.171, "grad_norm": 0.06380539387464523, "learning_rate": 3.842528050214669e-06, "loss": 6.754435729980469, "step": 855 }, { "epoch": 0.172, "grad_norm": 0.0771062970161438, "learning_rate": 3.83994559259237e-06, "loss": 6.693482208251953, "step": 860 }, { "epoch": 0.173, "grad_norm": 0.07977370917797089, "learning_rate": 3.837343013619856e-06, "loss": 6.782911682128907, "step": 865 }, { "epoch": 0.174, "grad_norm": 0.09431219846010208, "learning_rate": 3.834720341758513e-06, "loss": 6.771470642089843, "step": 870 }, { "epoch": 0.175, "grad_norm": 0.16286598145961761, "learning_rate": 3.832077605689461e-06, "loss": 6.584927368164062, "step": 875 }, { "epoch": 0.176, "grad_norm": 0.06504693627357483, "learning_rate": 3.829414834313237e-06, "loss": 6.703968811035156, "step": 880 }, { "epoch": 0.177, "grad_norm": 0.08418609946966171, "learning_rate": 3.826732056749485e-06, "loss": 6.592996215820312, "step": 885 }, { "epoch": 0.178, "grad_norm": 0.06050467491149902, "learning_rate": 3.824029302336628e-06, "loss": 6.760212707519531, "step": 890 }, { "epoch": 0.179, "grad_norm": 0.08373371511697769, "learning_rate": 3.821306600631556e-06, "loss": 6.631327819824219, "step": 895 }, { "epoch": 0.18, "grad_norm": 0.08372713625431061, "learning_rate": 3.818563981409298e-06, "loss": 6.716769409179688, "step": 900 }, { "epoch": 0.18, "eval_accuracy": 0.13533333333333333, "eval_loss": 6.627016544342041, "eval_runtime": 10.3756, "eval_samples_per_second": 9.638, "eval_steps_per_second": 1.638, "step": 900 }, { "epoch": 0.181, "grad_norm": 0.068506620824337, "learning_rate": 3.8158014746627e-06, "loss": 6.659144592285156, "step": 905 }, { "epoch": 0.182, "grad_norm": 0.06771203130483627, "learning_rate": 3.8130191106020916e-06, "loss": 6.752458190917968, "step": 910 }, { "epoch": 0.183, "grad_norm": 0.07365380972623825, "learning_rate": 3.8102169196549606e-06, "loss": 6.792449951171875, "step": 915 }, { "epoch": 0.184, "grad_norm": 0.09057911485433578, "learning_rate": 3.8073949324656187e-06, "loss": 6.750059509277344, "step": 920 }, { "epoch": 0.185, "grad_norm": 0.1145537868142128, "learning_rate": 3.8045531798948662e-06, "loss": 6.659918212890625, "step": 925 }, { "epoch": 0.186, "grad_norm": 0.07206426560878754, "learning_rate": 3.8016916930196535e-06, "loss": 6.64384765625, "step": 930 }, { "epoch": 0.187, "grad_norm": 0.08511226624250412, "learning_rate": 3.798810503132742e-06, "loss": 6.741066741943359, "step": 935 }, { "epoch": 0.188, "grad_norm": 0.07708951085805893, "learning_rate": 3.795909641742363e-06, "loss": 6.7345428466796875, "step": 940 }, { "epoch": 0.189, "grad_norm": 0.10781801491975784, "learning_rate": 3.7929891405718725e-06, "loss": 6.796640014648437, "step": 945 }, { "epoch": 0.19, "grad_norm": 0.07551534473896027, "learning_rate": 3.790049031559403e-06, "loss": 6.666252899169922, "step": 950 }, { "epoch": 0.191, "grad_norm": 0.0841158851981163, "learning_rate": 3.787089346857515e-06, "loss": 6.701302337646484, "step": 955 }, { "epoch": 0.192, "grad_norm": 0.0862930417060852, "learning_rate": 3.7841101188328477e-06, "loss": 6.614484405517578, "step": 960 }, { "epoch": 0.193, "grad_norm": 0.07389580458402634, "learning_rate": 3.7811113800657597e-06, "loss": 6.6798454284667965, "step": 965 }, { "epoch": 0.194, "grad_norm": 0.07656016200780869, "learning_rate": 3.778093163349979e-06, "loss": 6.734007263183594, "step": 970 }, { "epoch": 0.195, "grad_norm": 0.06616536527872086, "learning_rate": 3.7750555016922397e-06, "loss": 6.699456787109375, "step": 975 }, { "epoch": 0.196, "grad_norm": 0.0683082565665245, "learning_rate": 3.7719984283119227e-06, "loss": 6.68050537109375, "step": 980 }, { "epoch": 0.197, "grad_norm": 0.1232413798570633, "learning_rate": 3.768921976640693e-06, "loss": 6.699308776855469, "step": 985 }, { "epoch": 0.198, "grad_norm": 0.07576856017112732, "learning_rate": 3.7658261803221327e-06, "loss": 6.67384033203125, "step": 990 }, { "epoch": 0.199, "grad_norm": 0.11441260576248169, "learning_rate": 3.7627110732113748e-06, "loss": 6.6964164733886715, "step": 995 }, { "epoch": 0.2, "grad_norm": 0.16522112488746643, "learning_rate": 3.7595766893747325e-06, "loss": 6.660438537597656, "step": 1000 }, { "epoch": 0.201, "grad_norm": 0.08984258025884628, "learning_rate": 3.7564230630893235e-06, "loss": 6.695003509521484, "step": 1005 }, { "epoch": 0.202, "grad_norm": 0.1421244740486145, "learning_rate": 3.753250228842701e-06, "loss": 6.6853515625, "step": 1010 }, { "epoch": 0.203, "grad_norm": 0.07362934201955795, "learning_rate": 3.7500582213324704e-06, "loss": 6.669375610351563, "step": 1015 }, { "epoch": 0.204, "grad_norm": 0.08078701794147491, "learning_rate": 3.7468470754659164e-06, "loss": 6.731100463867188, "step": 1020 }, { "epoch": 0.205, "grad_norm": 0.07613933831453323, "learning_rate": 3.743616826359614e-06, "loss": 6.699374389648438, "step": 1025 }, { "epoch": 0.206, "grad_norm": 0.0956382229924202, "learning_rate": 3.740367509339051e-06, "loss": 6.7087150573730465, "step": 1030 }, { "epoch": 0.207, "grad_norm": 0.06961136311292648, "learning_rate": 3.7370991599382374e-06, "loss": 6.619333648681641, "step": 1035 }, { "epoch": 0.208, "grad_norm": 0.08904080837965012, "learning_rate": 3.7338118138993187e-06, "loss": 6.6525390625, "step": 1040 }, { "epoch": 0.209, "grad_norm": 0.08716033399105072, "learning_rate": 3.7305055071721843e-06, "loss": 6.656343078613281, "step": 1045 }, { "epoch": 0.21, "grad_norm": 0.06856364011764526, "learning_rate": 3.727180275914075e-06, "loss": 6.584860992431641, "step": 1050 }, { "epoch": 0.21, "eval_accuracy": 0.13902075702075703, "eval_loss": 6.554867744445801, "eval_runtime": 10.4147, "eval_samples_per_second": 9.602, "eval_steps_per_second": 1.632, "step": 1050 }, { "epoch": 0.211, "grad_norm": 0.13052572309970856, "learning_rate": 3.723836156489187e-06, "loss": 6.7243499755859375, "step": 1055 }, { "epoch": 0.212, "grad_norm": 0.09087914228439331, "learning_rate": 3.7204731854682744e-06, "loss": 6.679405975341797, "step": 1060 }, { "epoch": 0.213, "grad_norm": 0.08263049274682999, "learning_rate": 3.71709139962825e-06, "loss": 6.654142761230469, "step": 1065 }, { "epoch": 0.214, "grad_norm": 0.07467084378004074, "learning_rate": 3.713690835951782e-06, "loss": 6.614359283447266, "step": 1070 }, { "epoch": 0.215, "grad_norm": 0.073064424097538, "learning_rate": 3.710271531626889e-06, "loss": 6.567655944824219, "step": 1075 }, { "epoch": 0.216, "grad_norm": 0.06931977719068527, "learning_rate": 3.706833524046536e-06, "loss": 6.589354705810547, "step": 1080 }, { "epoch": 0.217, "grad_norm": 0.07509584724903107, "learning_rate": 3.703376850808223e-06, "loss": 6.710356903076172, "step": 1085 }, { "epoch": 0.218, "grad_norm": 0.09575289487838745, "learning_rate": 3.699901549713575e-06, "loss": 6.6289726257324215, "step": 1090 }, { "epoch": 0.219, "grad_norm": 0.09864190220832825, "learning_rate": 3.6964076587679268e-06, "loss": 6.5806831359863285, "step": 1095 }, { "epoch": 0.22, "grad_norm": 0.23898720741271973, "learning_rate": 3.6928952161799113e-06, "loss": 6.584079742431641, "step": 1100 }, { "epoch": 0.221, "grad_norm": 0.12194394320249557, "learning_rate": 3.6893642603610374e-06, "loss": 6.62684326171875, "step": 1105 }, { "epoch": 0.222, "grad_norm": 0.07811807841062546, "learning_rate": 3.685814829925272e-06, "loss": 6.622457122802734, "step": 1110 }, { "epoch": 0.223, "grad_norm": 0.0715632289648056, "learning_rate": 3.682246963688618e-06, "loss": 6.651722717285156, "step": 1115 }, { "epoch": 0.224, "grad_norm": 0.10769006609916687, "learning_rate": 3.6786607006686895e-06, "loss": 6.6332145690917965, "step": 1120 }, { "epoch": 0.225, "grad_norm": 0.06909330189228058, "learning_rate": 3.6750560800842837e-06, "loss": 6.65299072265625, "step": 1125 }, { "epoch": 0.226, "grad_norm": 0.07310458272695541, "learning_rate": 3.671433141354953e-06, "loss": 6.617790985107422, "step": 1130 }, { "epoch": 0.227, "grad_norm": 0.0946388989686966, "learning_rate": 3.667791924100576e-06, "loss": 6.5729728698730465, "step": 1135 }, { "epoch": 0.228, "grad_norm": 0.10393473505973816, "learning_rate": 3.6641324681409215e-06, "loss": 6.568301391601563, "step": 1140 }, { "epoch": 0.229, "grad_norm": 0.06355820596218109, "learning_rate": 3.6604548134952125e-06, "loss": 6.632942199707031, "step": 1145 }, { "epoch": 0.23, "grad_norm": 0.06845368444919586, "learning_rate": 3.656759000381691e-06, "loss": 6.537193298339844, "step": 1150 }, { "epoch": 0.231, "grad_norm": 0.0652310699224472, "learning_rate": 3.6530450692171787e-06, "loss": 6.58575668334961, "step": 1155 }, { "epoch": 0.232, "grad_norm": 0.07378797978162766, "learning_rate": 3.64931306061663e-06, "loss": 6.643540954589843, "step": 1160 }, { "epoch": 0.233, "grad_norm": 0.07988571375608444, "learning_rate": 3.6455630153926943e-06, "loss": 6.519971466064453, "step": 1165 }, { "epoch": 0.234, "grad_norm": 0.06847741454839706, "learning_rate": 3.6417949745552638e-06, "loss": 6.616749572753906, "step": 1170 }, { "epoch": 0.235, "grad_norm": 0.09600138664245605, "learning_rate": 3.6380089793110307e-06, "loss": 6.599732971191406, "step": 1175 }, { "epoch": 0.236, "grad_norm": 0.09037528187036514, "learning_rate": 3.634205071063032e-06, "loss": 6.518192291259766, "step": 1180 }, { "epoch": 0.237, "grad_norm": 0.12540659308433533, "learning_rate": 3.6303832914102e-06, "loss": 6.674017333984375, "step": 1185 }, { "epoch": 0.238, "grad_norm": 0.07415056228637695, "learning_rate": 3.626543682146903e-06, "loss": 6.6067352294921875, "step": 1190 }, { "epoch": 0.239, "grad_norm": 0.084800586104393, "learning_rate": 3.6226862852624927e-06, "loss": 6.528235626220703, "step": 1195 }, { "epoch": 0.24, "grad_norm": 0.0605861060321331, "learning_rate": 3.6188111429408448e-06, "loss": 6.609767913818359, "step": 1200 }, { "epoch": 0.24, "eval_accuracy": 0.13638827838827838, "eval_loss": 6.499367713928223, "eval_runtime": 10.4681, "eval_samples_per_second": 9.553, "eval_steps_per_second": 1.624, "step": 1200 }, { "epoch": 0.241, "grad_norm": 0.06398201733827591, "learning_rate": 3.6149182975598944e-06, "loss": 6.538330841064453, "step": 1205 }, { "epoch": 0.242, "grad_norm": 0.10430450737476349, "learning_rate": 3.6110077916911736e-06, "loss": 6.606370544433593, "step": 1210 }, { "epoch": 0.243, "grad_norm": 0.06399216502904892, "learning_rate": 3.6070796680993503e-06, "loss": 6.5816490173339846, "step": 1215 }, { "epoch": 0.244, "grad_norm": 0.08809840679168701, "learning_rate": 3.6031339697417533e-06, "loss": 6.556430053710938, "step": 1220 }, { "epoch": 0.245, "grad_norm": 0.0840051919221878, "learning_rate": 3.599170739767907e-06, "loss": 6.665988159179688, "step": 1225 }, { "epoch": 0.246, "grad_norm": 0.08308332413434982, "learning_rate": 3.5951900215190614e-06, "loss": 6.544137573242187, "step": 1230 }, { "epoch": 0.247, "grad_norm": 0.0652918890118599, "learning_rate": 3.5911918585277125e-06, "loss": 6.496437835693359, "step": 1235 }, { "epoch": 0.248, "grad_norm": 0.07509986311197281, "learning_rate": 3.58717629451713e-06, "loss": 6.490621185302734, "step": 1240 }, { "epoch": 0.249, "grad_norm": 0.09300875663757324, "learning_rate": 3.583143373400879e-06, "loss": 6.5218017578125, "step": 1245 }, { "epoch": 0.25, "grad_norm": 0.09340658783912659, "learning_rate": 3.5790931392823376e-06, "loss": 6.703663635253906, "step": 1250 }, { "epoch": 0.251, "grad_norm": 0.09822723269462585, "learning_rate": 3.5750256364542196e-06, "loss": 6.545758819580078, "step": 1255 }, { "epoch": 0.252, "grad_norm": 0.07032929360866547, "learning_rate": 3.5709409093980814e-06, "loss": 6.586306762695313, "step": 1260 }, { "epoch": 0.253, "grad_norm": 0.100587859749794, "learning_rate": 3.5668390027838457e-06, "loss": 6.500570678710938, "step": 1265 }, { "epoch": 0.254, "grad_norm": 0.08588574081659317, "learning_rate": 3.5627199614693055e-06, "loss": 6.516835784912109, "step": 1270 }, { "epoch": 0.255, "grad_norm": 0.05896945297718048, "learning_rate": 3.5585838304996356e-06, "loss": 6.462747192382812, "step": 1275 }, { "epoch": 0.256, "grad_norm": 0.07021471858024597, "learning_rate": 3.5544306551069037e-06, "loss": 6.572966003417969, "step": 1280 }, { "epoch": 0.257, "grad_norm": 0.09236051887273788, "learning_rate": 3.5502604807095687e-06, "loss": 6.615792083740234, "step": 1285 }, { "epoch": 0.258, "grad_norm": 0.07293561100959778, "learning_rate": 3.5460733529119908e-06, "loss": 6.55091552734375, "step": 1290 }, { "epoch": 0.259, "grad_norm": 0.0651378184556961, "learning_rate": 3.541869317503928e-06, "loss": 6.545086669921875, "step": 1295 }, { "epoch": 0.26, "grad_norm": 0.0653856098651886, "learning_rate": 3.537648420460038e-06, "loss": 6.5654754638671875, "step": 1300 }, { "epoch": 0.261, "grad_norm": 0.08197472244501114, "learning_rate": 3.5334107079393755e-06, "loss": 6.614053344726562, "step": 1305 }, { "epoch": 0.262, "grad_norm": 0.07018602639436722, "learning_rate": 3.5291562262848845e-06, "loss": 6.489773559570312, "step": 1310 }, { "epoch": 0.263, "grad_norm": 0.07549969106912613, "learning_rate": 3.5248850220228957e-06, "loss": 6.4777587890625, "step": 1315 }, { "epoch": 0.264, "grad_norm": 0.07509016990661621, "learning_rate": 3.5205971418626145e-06, "loss": 6.554988861083984, "step": 1320 }, { "epoch": 0.265, "grad_norm": 0.07180987298488617, "learning_rate": 3.51629263269561e-06, "loss": 6.668986511230469, "step": 1325 }, { "epoch": 0.266, "grad_norm": 0.07208196818828583, "learning_rate": 3.511971541595307e-06, "loss": 6.480735778808594, "step": 1330 }, { "epoch": 0.267, "grad_norm": 0.08938033133745193, "learning_rate": 3.5076339158164635e-06, "loss": 6.487246704101563, "step": 1335 }, { "epoch": 0.268, "grad_norm": 0.0639733299612999, "learning_rate": 3.503279802794662e-06, "loss": 6.5667259216308596, "step": 1340 }, { "epoch": 0.269, "grad_norm": 0.11628873646259308, "learning_rate": 3.4989092501457832e-06, "loss": 6.565748596191407, "step": 1345 }, { "epoch": 0.27, "grad_norm": 0.0958283543586731, "learning_rate": 3.4945223056654914e-06, "loss": 6.564359283447265, "step": 1350 }, { "epoch": 0.27, "eval_accuracy": 0.1386959706959707, "eval_loss": 6.456244945526123, "eval_runtime": 10.3332, "eval_samples_per_second": 9.678, "eval_steps_per_second": 1.645, "step": 1350 }, { "epoch": 0.271, "grad_norm": 0.08361370116472244, "learning_rate": 3.4901190173287086e-06, "loss": 6.599095153808594, "step": 1355 }, { "epoch": 0.272, "grad_norm": 0.07728071510791779, "learning_rate": 3.48569943328909e-06, "loss": 6.567552185058593, "step": 1360 }, { "epoch": 0.273, "grad_norm": 0.23476524651050568, "learning_rate": 3.4812636018784994e-06, "loss": 6.519585418701172, "step": 1365 }, { "epoch": 0.274, "grad_norm": 0.08214252442121506, "learning_rate": 3.476811571606478e-06, "loss": 6.542357635498047, "step": 1370 }, { "epoch": 0.275, "grad_norm": 0.07677047699689865, "learning_rate": 3.4723433911597163e-06, "loss": 6.5419761657714846, "step": 1375 }, { "epoch": 0.276, "grad_norm": 0.11742841452360153, "learning_rate": 3.4678591094015187e-06, "loss": 6.5219581604003904, "step": 1380 }, { "epoch": 0.277, "grad_norm": 0.09686063230037689, "learning_rate": 3.4633587753712717e-06, "loss": 6.592768859863281, "step": 1385 }, { "epoch": 0.278, "grad_norm": 0.09387538582086563, "learning_rate": 3.458842438283909e-06, "loss": 6.60013427734375, "step": 1390 }, { "epoch": 0.279, "grad_norm": 0.0723787397146225, "learning_rate": 3.4543101475293682e-06, "loss": 6.4840553283691404, "step": 1395 }, { "epoch": 0.28, "grad_norm": 0.06756219267845154, "learning_rate": 3.449761952672055e-06, "loss": 6.542083740234375, "step": 1400 }, { "epoch": 0.281, "grad_norm": 0.0757589340209961, "learning_rate": 3.4451979034502994e-06, "loss": 6.548152923583984, "step": 1405 }, { "epoch": 0.282, "grad_norm": 0.08698936551809311, "learning_rate": 3.440618049775814e-06, "loss": 6.562844085693359, "step": 1410 }, { "epoch": 0.283, "grad_norm": 0.08987753838300705, "learning_rate": 3.436022441733143e-06, "loss": 6.502987670898437, "step": 1415 }, { "epoch": 0.284, "grad_norm": 0.07419227808713913, "learning_rate": 3.43141112957912e-06, "loss": 6.47925033569336, "step": 1420 }, { "epoch": 0.285, "grad_norm": 0.0743662565946579, "learning_rate": 3.4267841637423166e-06, "loss": 6.590135955810547, "step": 1425 }, { "epoch": 0.286, "grad_norm": 0.09506815671920776, "learning_rate": 3.422141594822489e-06, "loss": 6.4904052734375, "step": 1430 }, { "epoch": 0.287, "grad_norm": 0.06352763622999191, "learning_rate": 3.4174834735900283e-06, "loss": 6.492788696289063, "step": 1435 }, { "epoch": 0.288, "grad_norm": 0.1327190101146698, "learning_rate": 3.4128098509854014e-06, "loss": 6.528990936279297, "step": 1440 }, { "epoch": 0.289, "grad_norm": 0.1287909299135208, "learning_rate": 3.4081207781185963e-06, "loss": 6.511381530761719, "step": 1445 }, { "epoch": 0.29, "grad_norm": 0.05822750926017761, "learning_rate": 3.4034163062685623e-06, "loss": 6.534752655029297, "step": 1450 }, { "epoch": 0.291, "grad_norm": 0.08409831672906876, "learning_rate": 3.3986964868826498e-06, "loss": 6.494256591796875, "step": 1455 }, { "epoch": 0.292, "grad_norm": 0.11647513508796692, "learning_rate": 3.393961371576048e-06, "loss": 6.531385040283203, "step": 1460 }, { "epoch": 0.293, "grad_norm": 0.06273698806762695, "learning_rate": 3.3892110121312196e-06, "loss": 6.5295967102050785, "step": 1465 }, { "epoch": 0.294, "grad_norm": 0.06390611082315445, "learning_rate": 3.3844454604973327e-06, "loss": 6.487610626220703, "step": 1470 }, { "epoch": 0.295, "grad_norm": 0.0920199602842331, "learning_rate": 3.3796647687896982e-06, "loss": 6.561590576171875, "step": 1475 }, { "epoch": 0.296, "grad_norm": 0.07950405776500702, "learning_rate": 3.3748689892891945e-06, "loss": 6.498722839355469, "step": 1480 }, { "epoch": 0.297, "grad_norm": 0.0956474170088768, "learning_rate": 3.3700581744416966e-06, "loss": 6.526725006103516, "step": 1485 }, { "epoch": 0.298, "grad_norm": 0.07354336977005005, "learning_rate": 3.3652323768575066e-06, "loss": 6.478034210205078, "step": 1490 }, { "epoch": 0.299, "grad_norm": 0.07010781019926071, "learning_rate": 3.360391649310772e-06, "loss": 6.511841583251953, "step": 1495 }, { "epoch": 0.3, "grad_norm": 0.07634287327528, "learning_rate": 3.355536044738915e-06, "loss": 6.506979370117188, "step": 1500 }, { "epoch": 0.3, "eval_accuracy": 0.138991452991453, "eval_loss": 6.424478530883789, "eval_runtime": 10.3935, "eval_samples_per_second": 9.621, "eval_steps_per_second": 1.636, "step": 1500 } ], "logging_steps": 5, "max_steps": 5000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 6, "trial_name": null, "trial_params": null }