{ "best_metric": null, "best_model_checkpoint": null, "epoch": 2.9931630082763583, "eval_steps": 500, "global_step": 1041, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01439366678661389, "grad_norm": 0.2171054631471634, "learning_rate": 1.5625e-06, "loss": 0.7856, "num_input_tokens_seen": 1344864, "step": 5 }, { "epoch": 0.02878733357322778, "grad_norm": 0.14643871784210205, "learning_rate": 3.125e-06, "loss": 0.7815, "num_input_tokens_seen": 2610336, "step": 10 }, { "epoch": 0.04318100035984167, "grad_norm": 0.08721674233675003, "learning_rate": 4.6875000000000004e-06, "loss": 0.7299, "num_input_tokens_seen": 3942464, "step": 15 }, { "epoch": 0.05757466714645556, "grad_norm": 0.057898711413145065, "learning_rate": 6.25e-06, "loss": 0.6649, "num_input_tokens_seen": 5290176, "step": 20 }, { "epoch": 0.07196833393306945, "grad_norm": 0.06339031457901001, "learning_rate": 7.8125e-06, "loss": 0.6129, "num_input_tokens_seen": 6599904, "step": 25 }, { "epoch": 0.08636200071968334, "grad_norm": 0.04165177047252655, "learning_rate": 9.375000000000001e-06, "loss": 0.5695, "num_input_tokens_seen": 7953088, "step": 30 }, { "epoch": 0.10075566750629723, "grad_norm": 0.032423749566078186, "learning_rate": 9.99978187935494e-06, "loss": 0.5424, "num_input_tokens_seen": 9272512, "step": 35 }, { "epoch": 0.11514933429291112, "grad_norm": 0.03219545632600784, "learning_rate": 9.998448988774289e-06, "loss": 0.5248, "num_input_tokens_seen": 10609728, "step": 40 }, { "epoch": 0.12954300107952502, "grad_norm": 0.022432563826441765, "learning_rate": 9.99590470838777e-06, "loss": 0.5156, "num_input_tokens_seen": 11942432, "step": 45 }, { "epoch": 0.1439366678661389, "grad_norm": 0.024161117151379585, "learning_rate": 9.99214965480972e-06, "loss": 0.511, "num_input_tokens_seen": 13244192, "step": 50 }, { "epoch": 0.15833033465275279, "grad_norm": 0.020490078255534172, "learning_rate": 9.987184738089166e-06, "loss": 0.5043, "num_input_tokens_seen": 14608992, "step": 55 }, { "epoch": 0.17272400143936667, "grad_norm": 0.020698031410574913, "learning_rate": 9.981011161489262e-06, "loss": 0.4918, "num_input_tokens_seen": 15935040, "step": 60 }, { "epoch": 0.18711766822598058, "grad_norm": 0.022265350446105003, "learning_rate": 9.973630421195679e-06, "loss": 0.4842, "num_input_tokens_seen": 17230080, "step": 65 }, { "epoch": 0.20151133501259447, "grad_norm": 0.021687887609004974, "learning_rate": 9.965044305954002e-06, "loss": 0.4874, "num_input_tokens_seen": 18514400, "step": 70 }, { "epoch": 0.21590500179920835, "grad_norm": 0.020277954638004303, "learning_rate": 9.955254896636217e-06, "loss": 0.4777, "num_input_tokens_seen": 19896928, "step": 75 }, { "epoch": 0.23029866858582224, "grad_norm": 0.019190184772014618, "learning_rate": 9.944264565736406e-06, "loss": 0.4779, "num_input_tokens_seen": 21225632, "step": 80 }, { "epoch": 0.24469233537243612, "grad_norm": 0.022239679470658302, "learning_rate": 9.93207597679577e-06, "loss": 0.4758, "num_input_tokens_seen": 22554912, "step": 85 }, { "epoch": 0.25908600215905003, "grad_norm": 0.020835548639297485, "learning_rate": 9.918692083757105e-06, "loss": 0.4724, "num_input_tokens_seen": 23877056, "step": 90 }, { "epoch": 0.2734796689456639, "grad_norm": 0.02221113070845604, "learning_rate": 9.904116130248913e-06, "loss": 0.4671, "num_input_tokens_seen": 25170944, "step": 95 }, { "epoch": 0.2878733357322778, "grad_norm": 0.02158268541097641, "learning_rate": 9.888351648799288e-06, "loss": 0.4667, "num_input_tokens_seen": 26483136, "step": 100 }, { "epoch": 0.3022670025188917, "grad_norm": 0.022542718797922134, "learning_rate": 9.871402459979804e-06, "loss": 0.4724, "num_input_tokens_seen": 27788864, "step": 105 }, { "epoch": 0.31666066930550557, "grad_norm": 0.023939669132232666, "learning_rate": 9.853272671479588e-06, "loss": 0.4612, "num_input_tokens_seen": 29122624, "step": 110 }, { "epoch": 0.3310543360921195, "grad_norm": 0.0231157299131155, "learning_rate": 9.833966677109805e-06, "loss": 0.4628, "num_input_tokens_seen": 30425088, "step": 115 }, { "epoch": 0.34544800287873334, "grad_norm": 0.023111021146178246, "learning_rate": 9.813489155738801e-06, "loss": 0.4565, "num_input_tokens_seen": 31758464, "step": 120 }, { "epoch": 0.35984166966534725, "grad_norm": 0.027539370581507683, "learning_rate": 9.791845070158175e-06, "loss": 0.4634, "num_input_tokens_seen": 33056384, "step": 125 }, { "epoch": 0.37423533645196116, "grad_norm": 0.02168864756822586, "learning_rate": 9.769039665880024e-06, "loss": 0.4519, "num_input_tokens_seen": 34398336, "step": 130 }, { "epoch": 0.388629003238575, "grad_norm": 0.02182694338262081, "learning_rate": 9.745078469865673e-06, "loss": 0.4498, "num_input_tokens_seen": 35751168, "step": 135 }, { "epoch": 0.40302267002518893, "grad_norm": 0.02402554452419281, "learning_rate": 9.719967289186211e-06, "loss": 0.4495, "num_input_tokens_seen": 37065920, "step": 140 }, { "epoch": 0.4174163368118028, "grad_norm": 0.023280750960111618, "learning_rate": 9.69371220961511e-06, "loss": 0.4485, "num_input_tokens_seen": 38387392, "step": 145 }, { "epoch": 0.4318100035984167, "grad_norm": 0.023174723610281944, "learning_rate": 9.666319594153342e-06, "loss": 0.4512, "num_input_tokens_seen": 39642272, "step": 150 }, { "epoch": 0.44620367038503056, "grad_norm": 0.02440543845295906, "learning_rate": 9.637796081487263e-06, "loss": 0.4452, "num_input_tokens_seen": 40974912, "step": 155 }, { "epoch": 0.46059733717164447, "grad_norm": 0.022896092385053635, "learning_rate": 9.608148584379724e-06, "loss": 0.447, "num_input_tokens_seen": 42268032, "step": 160 }, { "epoch": 0.4749910039582584, "grad_norm": 0.022509625181555748, "learning_rate": 9.577384287994733e-06, "loss": 0.4451, "num_input_tokens_seen": 43600032, "step": 165 }, { "epoch": 0.48938467074487224, "grad_norm": 0.023523326963186264, "learning_rate": 9.545510648156106e-06, "loss": 0.4425, "num_input_tokens_seen": 44907424, "step": 170 }, { "epoch": 0.5037783375314862, "grad_norm": 0.021728025749325752, "learning_rate": 9.512535389540532e-06, "loss": 0.4463, "num_input_tokens_seen": 46205760, "step": 175 }, { "epoch": 0.5181720043181001, "grad_norm": 0.024059342220425606, "learning_rate": 9.478466503805467e-06, "loss": 0.4453, "num_input_tokens_seen": 47539584, "step": 180 }, { "epoch": 0.532565671104714, "grad_norm": 0.02262093313038349, "learning_rate": 9.443312247652335e-06, "loss": 0.4434, "num_input_tokens_seen": 48862784, "step": 185 }, { "epoch": 0.5469593378913278, "grad_norm": 0.022450478747487068, "learning_rate": 9.407081140825485e-06, "loss": 0.4478, "num_input_tokens_seen": 50147328, "step": 190 }, { "epoch": 0.5613530046779417, "grad_norm": 0.024132946506142616, "learning_rate": 9.36978196404741e-06, "loss": 0.4365, "num_input_tokens_seen": 51466592, "step": 195 }, { "epoch": 0.5757466714645556, "grad_norm": 0.023225655779242516, "learning_rate": 9.331423756890715e-06, "loss": 0.4373, "num_input_tokens_seen": 52771040, "step": 200 }, { "epoch": 0.5901403382511695, "grad_norm": 0.022450394928455353, "learning_rate": 9.292015815587326e-06, "loss": 0.4371, "num_input_tokens_seen": 54068448, "step": 205 }, { "epoch": 0.6045340050377834, "grad_norm": 0.023069795221090317, "learning_rate": 9.251567690775554e-06, "loss": 0.4455, "num_input_tokens_seen": 55357024, "step": 210 }, { "epoch": 0.6189276718243972, "grad_norm": 0.022140709683299065, "learning_rate": 9.210089185185436e-06, "loss": 0.4374, "num_input_tokens_seen": 56672224, "step": 215 }, { "epoch": 0.6333213386110111, "grad_norm": 0.024554293602705002, "learning_rate": 9.167590351263031e-06, "loss": 0.4376, "num_input_tokens_seen": 58019776, "step": 220 }, { "epoch": 0.647715005397625, "grad_norm": 0.023237934336066246, "learning_rate": 9.124081488734173e-06, "loss": 0.4445, "num_input_tokens_seen": 59296576, "step": 225 }, { "epoch": 0.662108672184239, "grad_norm": 0.022342730313539505, "learning_rate": 9.0795731421083e-06, "loss": 0.4328, "num_input_tokens_seen": 60602464, "step": 230 }, { "epoch": 0.6765023389708529, "grad_norm": 0.02406766451895237, "learning_rate": 9.034076098122954e-06, "loss": 0.4324, "num_input_tokens_seen": 61909408, "step": 235 }, { "epoch": 0.6908960057574667, "grad_norm": 0.024235686287283897, "learning_rate": 8.987601383129597e-06, "loss": 0.439, "num_input_tokens_seen": 63190624, "step": 240 }, { "epoch": 0.7052896725440806, "grad_norm": 0.02430051937699318, "learning_rate": 8.940160260421315e-06, "loss": 0.4368, "num_input_tokens_seen": 64515360, "step": 245 }, { "epoch": 0.7196833393306945, "grad_norm": 0.0284462608397007, "learning_rate": 8.891764227503148e-06, "loss": 0.4353, "num_input_tokens_seen": 65839808, "step": 250 }, { "epoch": 0.7340770061173084, "grad_norm": 0.02868458814918995, "learning_rate": 8.842425013305624e-06, "loss": 0.438, "num_input_tokens_seen": 67134624, "step": 255 }, { "epoch": 0.7484706729039223, "grad_norm": 0.023997368291020393, "learning_rate": 8.79215457534221e-06, "loss": 0.4329, "num_input_tokens_seen": 68459808, "step": 260 }, { "epoch": 0.7628643396905361, "grad_norm": 0.02359464205801487, "learning_rate": 8.740965096811376e-06, "loss": 0.4303, "num_input_tokens_seen": 69771232, "step": 265 }, { "epoch": 0.77725800647715, "grad_norm": 0.02255072444677353, "learning_rate": 8.688868983643966e-06, "loss": 0.4347, "num_input_tokens_seen": 71097184, "step": 270 }, { "epoch": 0.791651673263764, "grad_norm": 0.02909056842327118, "learning_rate": 8.635878861496566e-06, "loss": 0.4295, "num_input_tokens_seen": 72420160, "step": 275 }, { "epoch": 0.8060453400503779, "grad_norm": 0.02871478721499443, "learning_rate": 8.582007572691655e-06, "loss": 0.4357, "num_input_tokens_seen": 73747168, "step": 280 }, { "epoch": 0.8204390068369917, "grad_norm": 0.024725815281271935, "learning_rate": 8.52726817310521e-06, "loss": 0.434, "num_input_tokens_seen": 75051072, "step": 285 }, { "epoch": 0.8348326736236056, "grad_norm": 0.02208642102777958, "learning_rate": 8.47167392900258e-06, "loss": 0.4292, "num_input_tokens_seen": 76366528, "step": 290 }, { "epoch": 0.8492263404102195, "grad_norm": 0.021869095042347908, "learning_rate": 8.415238313823375e-06, "loss": 0.4316, "num_input_tokens_seen": 77698080, "step": 295 }, { "epoch": 0.8636200071968334, "grad_norm": 0.02422597073018551, "learning_rate": 8.357975004916122e-06, "loss": 0.4358, "num_input_tokens_seen": 79019904, "step": 300 }, { "epoch": 0.8780136739834473, "grad_norm": 0.02404642663896084, "learning_rate": 8.29989788022352e-06, "loss": 0.4257, "num_input_tokens_seen": 80331968, "step": 305 }, { "epoch": 0.8924073407700611, "grad_norm": 0.02266016975045204, "learning_rate": 8.241021014919085e-06, "loss": 0.4327, "num_input_tokens_seen": 81645536, "step": 310 }, { "epoch": 0.906801007556675, "grad_norm": 0.02396400086581707, "learning_rate": 8.18135867799597e-06, "loss": 0.4221, "num_input_tokens_seen": 82977024, "step": 315 }, { "epoch": 0.9211946743432889, "grad_norm": 0.023356642574071884, "learning_rate": 8.120925328808855e-06, "loss": 0.4208, "num_input_tokens_seen": 84297760, "step": 320 }, { "epoch": 0.9355883411299029, "grad_norm": 0.022813964635133743, "learning_rate": 8.059735613569651e-06, "loss": 0.4274, "num_input_tokens_seen": 85651136, "step": 325 }, { "epoch": 0.9499820079165168, "grad_norm": 0.024049192667007446, "learning_rate": 7.997804361797964e-06, "loss": 0.4244, "num_input_tokens_seen": 86960544, "step": 330 }, { "epoch": 0.9643756747031306, "grad_norm": 0.026242297142744064, "learning_rate": 7.935146582727103e-06, "loss": 0.4209, "num_input_tokens_seen": 88266560, "step": 335 }, { "epoch": 0.9787693414897445, "grad_norm": 0.02622361294925213, "learning_rate": 7.87177746166655e-06, "loss": 0.4284, "num_input_tokens_seen": 89625792, "step": 340 }, { "epoch": 0.9931630082763584, "grad_norm": 0.024003153666853905, "learning_rate": 7.80771235632175e-06, "loss": 0.4215, "num_input_tokens_seen": 90982112, "step": 345 }, { "epoch": 1.0057574667146456, "grad_norm": 0.023372355848550797, "learning_rate": 7.742966793072131e-06, "loss": 0.4126, "num_input_tokens_seen": 92150080, "step": 350 }, { "epoch": 1.0201511335012594, "grad_norm": 0.027405107393860817, "learning_rate": 7.677556463208221e-06, "loss": 0.4132, "num_input_tokens_seen": 93492992, "step": 355 }, { "epoch": 1.0345448002878734, "grad_norm": 0.024137645959854126, "learning_rate": 7.61149721912883e-06, "loss": 0.4077, "num_input_tokens_seen": 94826144, "step": 360 }, { "epoch": 1.0489384670744872, "grad_norm": 0.02278914861381054, "learning_rate": 7.544805070499166e-06, "loss": 0.41, "num_input_tokens_seen": 96118176, "step": 365 }, { "epoch": 1.063332133861101, "grad_norm": 0.025209598243236542, "learning_rate": 7.477496180370838e-06, "loss": 0.4096, "num_input_tokens_seen": 97416544, "step": 370 }, { "epoch": 1.077725800647715, "grad_norm": 0.02380400151014328, "learning_rate": 7.409586861264696e-06, "loss": 0.4032, "num_input_tokens_seen": 98709184, "step": 375 }, { "epoch": 1.0921194674343289, "grad_norm": 0.023542974144220352, "learning_rate": 7.3410935712174405e-06, "loss": 0.4085, "num_input_tokens_seen": 100030944, "step": 380 }, { "epoch": 1.1065131342209429, "grad_norm": 0.022723505273461342, "learning_rate": 7.272032909792956e-06, "loss": 0.4068, "num_input_tokens_seen": 101338976, "step": 385 }, { "epoch": 1.1209068010075567, "grad_norm": 0.02252861298620701, "learning_rate": 7.202421614059369e-06, "loss": 0.4138, "num_input_tokens_seen": 102671264, "step": 390 }, { "epoch": 1.1353004677941705, "grad_norm": 0.022021252661943436, "learning_rate": 7.1322765545327555e-06, "loss": 0.4138, "num_input_tokens_seen": 103992480, "step": 395 }, { "epoch": 1.1496941345807845, "grad_norm": 0.02324511669576168, "learning_rate": 7.061614731088523e-06, "loss": 0.4042, "num_input_tokens_seen": 105268512, "step": 400 }, { "epoch": 1.1640878013673983, "grad_norm": 0.02369946427643299, "learning_rate": 6.990453268841438e-06, "loss": 0.4053, "num_input_tokens_seen": 106601248, "step": 405 }, { "epoch": 1.1784814681540121, "grad_norm": 0.024191929027438164, "learning_rate": 6.918809413995299e-06, "loss": 0.407, "num_input_tokens_seen": 107951040, "step": 410 }, { "epoch": 1.1928751349406261, "grad_norm": 0.022732459008693695, "learning_rate": 6.846700529663265e-06, "loss": 0.4042, "num_input_tokens_seen": 109235744, "step": 415 }, { "epoch": 1.20726880172724, "grad_norm": 0.02548997662961483, "learning_rate": 6.774144091659853e-06, "loss": 0.4047, "num_input_tokens_seen": 110547552, "step": 420 }, { "epoch": 1.221662468513854, "grad_norm": 0.022845694795250893, "learning_rate": 6.701157684265613e-06, "loss": 0.404, "num_input_tokens_seen": 111895104, "step": 425 }, { "epoch": 1.2360561353004678, "grad_norm": 0.023235999047756195, "learning_rate": 6.627758995965533e-06, "loss": 0.4091, "num_input_tokens_seen": 113164800, "step": 430 }, { "epoch": 1.2504498020870818, "grad_norm": 0.02374238334596157, "learning_rate": 6.553965815162167e-06, "loss": 0.3971, "num_input_tokens_seen": 114495584, "step": 435 }, { "epoch": 1.2648434688736956, "grad_norm": 0.02480175346136093, "learning_rate": 6.479796025864569e-06, "loss": 0.408, "num_input_tokens_seen": 115789632, "step": 440 }, { "epoch": 1.2792371356603094, "grad_norm": 0.022774415090680122, "learning_rate": 6.405267603354044e-06, "loss": 0.4018, "num_input_tokens_seen": 117138208, "step": 445 }, { "epoch": 1.2936308024469234, "grad_norm": 0.0250807274132967, "learning_rate": 6.330398609827779e-06, "loss": 0.4039, "num_input_tokens_seen": 118444480, "step": 450 }, { "epoch": 1.3080244692335372, "grad_norm": 0.023115675896406174, "learning_rate": 6.255207190021421e-06, "loss": 0.4123, "num_input_tokens_seen": 119739520, "step": 455 }, { "epoch": 1.322418136020151, "grad_norm": 0.024381371214985847, "learning_rate": 6.179711566811637e-06, "loss": 0.4102, "num_input_tokens_seen": 121046112, "step": 460 }, { "epoch": 1.336811802806765, "grad_norm": 0.022843407467007637, "learning_rate": 6.103930036799739e-06, "loss": 0.4099, "num_input_tokens_seen": 122359872, "step": 465 }, { "epoch": 1.3512054695933788, "grad_norm": 0.024828806519508362, "learning_rate": 6.027880965877457e-06, "loss": 0.4109, "num_input_tokens_seen": 123711808, "step": 470 }, { "epoch": 1.3655991363799929, "grad_norm": 0.023335138335824013, "learning_rate": 5.951582784775896e-06, "loss": 0.4071, "num_input_tokens_seen": 125011520, "step": 475 }, { "epoch": 1.3799928031666067, "grad_norm": 0.02501983381807804, "learning_rate": 5.8750539845987945e-06, "loss": 0.3966, "num_input_tokens_seen": 126367392, "step": 480 }, { "epoch": 1.3943864699532207, "grad_norm": 0.025398626923561096, "learning_rate": 5.798313112341153e-06, "loss": 0.404, "num_input_tokens_seen": 127709088, "step": 485 }, { "epoch": 1.4087801367398345, "grad_norm": 0.02458963729441166, "learning_rate": 5.721378766394301e-06, "loss": 0.4067, "num_input_tokens_seen": 129039552, "step": 490 }, { "epoch": 1.4231738035264483, "grad_norm": 0.024260446429252625, "learning_rate": 5.644269592038528e-06, "loss": 0.4076, "num_input_tokens_seen": 130363232, "step": 495 }, { "epoch": 1.4375674703130623, "grad_norm": 0.024336043745279312, "learning_rate": 5.5670042769243375e-06, "loss": 0.4005, "num_input_tokens_seen": 131699264, "step": 500 }, { "epoch": 1.4519611370996761, "grad_norm": 0.023921623826026917, "learning_rate": 5.48960154654343e-06, "loss": 0.3988, "num_input_tokens_seen": 133018144, "step": 505 }, { "epoch": 1.46635480388629, "grad_norm": 0.022856013849377632, "learning_rate": 5.412080159690537e-06, "loss": 0.4037, "num_input_tokens_seen": 134316896, "step": 510 }, { "epoch": 1.480748470672904, "grad_norm": 0.025158999487757683, "learning_rate": 5.33445890391715e-06, "loss": 0.4049, "num_input_tokens_seen": 135591968, "step": 515 }, { "epoch": 1.4951421374595177, "grad_norm": 0.026123400777578354, "learning_rate": 5.25675659097831e-06, "loss": 0.3969, "num_input_tokens_seen": 136903264, "step": 520 }, { "epoch": 1.5095358042461315, "grad_norm": 0.02351614274084568, "learning_rate": 5.178992052273519e-06, "loss": 0.4091, "num_input_tokens_seen": 138205280, "step": 525 }, { "epoch": 1.5239294710327456, "grad_norm": 0.020864520221948624, "learning_rate": 5.101184134282884e-06, "loss": 0.3982, "num_input_tokens_seen": 139582816, "step": 530 }, { "epoch": 1.5383231378193596, "grad_norm": 0.021669739857316017, "learning_rate": 5.023351693999621e-06, "loss": 0.4013, "num_input_tokens_seen": 140928864, "step": 535 }, { "epoch": 1.5527168046059734, "grad_norm": 0.023181382566690445, "learning_rate": 4.945513594360001e-06, "loss": 0.4067, "num_input_tokens_seen": 142234624, "step": 540 }, { "epoch": 1.5671104713925872, "grad_norm": 0.02232653833925724, "learning_rate": 4.867688699671857e-06, "loss": 0.4046, "num_input_tokens_seen": 143542944, "step": 545 }, { "epoch": 1.5815041381792012, "grad_norm": 0.024279937148094177, "learning_rate": 4.78989587104276e-06, "loss": 0.4062, "num_input_tokens_seen": 144867168, "step": 550 }, { "epoch": 1.595897804965815, "grad_norm": 0.02459154650568962, "learning_rate": 4.712153961808974e-06, "loss": 0.4, "num_input_tokens_seen": 146167296, "step": 555 }, { "epoch": 1.6102914717524288, "grad_norm": 0.02406412921845913, "learning_rate": 4.63448181296628e-06, "loss": 0.4059, "num_input_tokens_seen": 147549760, "step": 560 }, { "epoch": 1.6246851385390428, "grad_norm": 0.024887846782803535, "learning_rate": 4.556898248603818e-06, "loss": 0.4065, "num_input_tokens_seen": 148877888, "step": 565 }, { "epoch": 1.6390788053256569, "grad_norm": 0.024574384093284607, "learning_rate": 4.479422071341996e-06, "loss": 0.4059, "num_input_tokens_seen": 150175264, "step": 570 }, { "epoch": 1.6534724721122704, "grad_norm": 0.02655833028256893, "learning_rate": 4.402072057775625e-06, "loss": 0.4024, "num_input_tokens_seen": 151492896, "step": 575 }, { "epoch": 1.6678661388988845, "grad_norm": 0.025273198261857033, "learning_rate": 4.324866953923343e-06, "loss": 0.403, "num_input_tokens_seen": 152796480, "step": 580 }, { "epoch": 1.6822598056854985, "grad_norm": 0.021906346082687378, "learning_rate": 4.247825470684465e-06, "loss": 0.403, "num_input_tokens_seen": 154123680, "step": 585 }, { "epoch": 1.6966534724721123, "grad_norm": 0.024103475734591484, "learning_rate": 4.170966279304343e-06, "loss": 0.4009, "num_input_tokens_seen": 155415008, "step": 590 }, { "epoch": 1.711047139258726, "grad_norm": 0.025105420500040054, "learning_rate": 4.094308006849314e-06, "loss": 0.408, "num_input_tokens_seen": 156700384, "step": 595 }, { "epoch": 1.7254408060453401, "grad_norm": 0.021644530817866325, "learning_rate": 4.017869231692393e-06, "loss": 0.4069, "num_input_tokens_seen": 158013984, "step": 600 }, { "epoch": 1.739834472831954, "grad_norm": 0.023105325177311897, "learning_rate": 3.9416684790107315e-06, "loss": 0.3992, "num_input_tokens_seen": 159346592, "step": 605 }, { "epoch": 1.7542281396185677, "grad_norm": 0.022883733734488487, "learning_rate": 3.8657242162959845e-06, "loss": 0.4027, "num_input_tokens_seen": 160641984, "step": 610 }, { "epoch": 1.7686218064051817, "grad_norm": 0.024626722559332848, "learning_rate": 3.79005484887866e-06, "loss": 0.4021, "num_input_tokens_seen": 161957600, "step": 615 }, { "epoch": 1.7830154731917958, "grad_norm": 0.023260436952114105, "learning_rate": 3.714678715467529e-06, "loss": 0.3975, "num_input_tokens_seen": 163285344, "step": 620 }, { "epoch": 1.7974091399784093, "grad_norm": 0.024760698899626732, "learning_rate": 3.639614083705178e-06, "loss": 0.3955, "num_input_tokens_seen": 164588128, "step": 625 }, { "epoch": 1.8118028067650234, "grad_norm": 0.02492666058242321, "learning_rate": 3.564879145740794e-06, "loss": 0.3975, "num_input_tokens_seen": 165879776, "step": 630 }, { "epoch": 1.8261964735516374, "grad_norm": 0.02142232283949852, "learning_rate": 3.490492013821234e-06, "loss": 0.4005, "num_input_tokens_seen": 167185216, "step": 635 }, { "epoch": 1.8405901403382512, "grad_norm": 0.02252054214477539, "learning_rate": 3.4164707159014675e-06, "loss": 0.3958, "num_input_tokens_seen": 168526560, "step": 640 }, { "epoch": 1.854983807124865, "grad_norm": 0.022308630868792534, "learning_rate": 3.3428331912754507e-06, "loss": 0.4019, "num_input_tokens_seen": 169859840, "step": 645 }, { "epoch": 1.869377473911479, "grad_norm": 0.024216335266828537, "learning_rate": 3.2695972862284707e-06, "loss": 0.402, "num_input_tokens_seen": 171171200, "step": 650 }, { "epoch": 1.8837711406980928, "grad_norm": 0.022730115801095963, "learning_rate": 3.196780749712054e-06, "loss": 0.4038, "num_input_tokens_seen": 172496352, "step": 655 }, { "epoch": 1.8981648074847066, "grad_norm": 0.02168315462768078, "learning_rate": 3.124401229042443e-06, "loss": 0.4011, "num_input_tokens_seen": 173819584, "step": 660 }, { "epoch": 1.9125584742713206, "grad_norm": 0.022848892956972122, "learning_rate": 3.0524762656237184e-06, "loss": 0.3986, "num_input_tokens_seen": 175124000, "step": 665 }, { "epoch": 1.9269521410579347, "grad_norm": 0.0229133740067482, "learning_rate": 2.9810232906965875e-06, "loss": 0.4003, "num_input_tokens_seen": 176404544, "step": 670 }, { "epoch": 1.9413458078445482, "grad_norm": 0.02141651324927807, "learning_rate": 2.9100596211138576e-06, "loss": 0.3969, "num_input_tokens_seen": 177685600, "step": 675 }, { "epoch": 1.9557394746311623, "grad_norm": 0.022065116092562675, "learning_rate": 2.83960245514366e-06, "loss": 0.3999, "num_input_tokens_seen": 179014656, "step": 680 }, { "epoch": 1.9701331414177763, "grad_norm": 0.02093074843287468, "learning_rate": 2.769668868301374e-06, "loss": 0.3954, "num_input_tokens_seen": 180367968, "step": 685 }, { "epoch": 1.98452680820439, "grad_norm": 0.022384867072105408, "learning_rate": 2.700275809211343e-06, "loss": 0.3929, "num_input_tokens_seen": 181711616, "step": 690 }, { "epoch": 1.998920474991004, "grad_norm": 0.022776221856474876, "learning_rate": 2.631440095499306e-06, "loss": 0.3939, "num_input_tokens_seen": 183020704, "step": 695 }, { "epoch": 2.011514933429291, "grad_norm": 0.022738846018910408, "learning_rate": 2.5631784097166024e-06, "loss": 0.386, "num_input_tokens_seen": 184150656, "step": 700 }, { "epoch": 2.025908600215905, "grad_norm": 0.022992299869656563, "learning_rate": 2.4955072952970993e-06, "loss": 0.3836, "num_input_tokens_seen": 185492128, "step": 705 }, { "epoch": 2.040302267002519, "grad_norm": 0.022360729053616524, "learning_rate": 2.42844315254784e-06, "loss": 0.3827, "num_input_tokens_seen": 186797280, "step": 710 }, { "epoch": 2.054695933789133, "grad_norm": 0.02626909501850605, "learning_rate": 2.3620022346743816e-06, "loss": 0.3839, "num_input_tokens_seen": 188086176, "step": 715 }, { "epoch": 2.069089600575747, "grad_norm": 0.02516692690551281, "learning_rate": 2.2962006438417704e-06, "loss": 0.3898, "num_input_tokens_seen": 189416160, "step": 720 }, { "epoch": 2.0834832673623604, "grad_norm": 0.022893643006682396, "learning_rate": 2.231054327272141e-06, "loss": 0.3891, "num_input_tokens_seen": 190743328, "step": 725 }, { "epoch": 2.0978769341489745, "grad_norm": 0.02225966565310955, "learning_rate": 2.1665790733798497e-06, "loss": 0.3868, "num_input_tokens_seen": 192065504, "step": 730 }, { "epoch": 2.1122706009355885, "grad_norm": 0.021935859695076942, "learning_rate": 2.102790507945107e-06, "loss": 0.38, "num_input_tokens_seen": 193379392, "step": 735 }, { "epoch": 2.126664267722202, "grad_norm": 0.02270529605448246, "learning_rate": 2.039704090327024e-06, "loss": 0.3818, "num_input_tokens_seen": 194720576, "step": 740 }, { "epoch": 2.141057934508816, "grad_norm": 0.021578673273324966, "learning_rate": 1.9773351097169785e-06, "loss": 0.3856, "num_input_tokens_seen": 196051456, "step": 745 }, { "epoch": 2.15545160129543, "grad_norm": 0.0224690530449152, "learning_rate": 1.9156986814332374e-06, "loss": 0.3904, "num_input_tokens_seen": 197369120, "step": 750 }, { "epoch": 2.1698452680820437, "grad_norm": 0.02468658983707428, "learning_rate": 1.8548097432577162e-06, "loss": 0.3877, "num_input_tokens_seen": 198667648, "step": 755 }, { "epoch": 2.1842389348686577, "grad_norm": 0.022155508399009705, "learning_rate": 1.7946830518157505e-06, "loss": 0.3857, "num_input_tokens_seen": 200011808, "step": 760 }, { "epoch": 2.1986326016552717, "grad_norm": 0.023383986204862595, "learning_rate": 1.7353331789997869e-06, "loss": 0.3825, "num_input_tokens_seen": 201308992, "step": 765 }, { "epoch": 2.2130262684418858, "grad_norm": 0.022762874141335487, "learning_rate": 1.6767745084378445e-06, "loss": 0.3912, "num_input_tokens_seen": 202606848, "step": 770 }, { "epoch": 2.2274199352284993, "grad_norm": 0.02270393818616867, "learning_rate": 1.6190212320075871e-06, "loss": 0.3827, "num_input_tokens_seen": 203913536, "step": 775 }, { "epoch": 2.2418136020151134, "grad_norm": 0.02072157897055149, "learning_rate": 1.5620873463968827e-06, "loss": 0.3797, "num_input_tokens_seen": 205247360, "step": 780 }, { "epoch": 2.2562072688017274, "grad_norm": 0.023383304476737976, "learning_rate": 1.5059866497116627e-06, "loss": 0.3851, "num_input_tokens_seen": 206580224, "step": 785 }, { "epoch": 2.270600935588341, "grad_norm": 0.024877682328224182, "learning_rate": 1.450732738131904e-06, "loss": 0.386, "num_input_tokens_seen": 207907776, "step": 790 }, { "epoch": 2.284994602374955, "grad_norm": 0.025071872398257256, "learning_rate": 1.3963390026165596e-06, "loss": 0.3829, "num_input_tokens_seen": 209219040, "step": 795 }, { "epoch": 2.299388269161569, "grad_norm": 0.022932719439268112, "learning_rate": 1.3428186256582088e-06, "loss": 0.3847, "num_input_tokens_seen": 210560096, "step": 800 }, { "epoch": 2.3137819359481826, "grad_norm": 0.02210652269423008, "learning_rate": 1.2901845780882427e-06, "loss": 0.3885, "num_input_tokens_seen": 211866176, "step": 805 }, { "epoch": 2.3281756027347966, "grad_norm": 0.02213803492486477, "learning_rate": 1.238449615933343e-06, "loss": 0.3822, "num_input_tokens_seen": 213155808, "step": 810 }, { "epoch": 2.3425692695214106, "grad_norm": 0.021066095679998398, "learning_rate": 1.1876262773240172e-06, "loss": 0.3848, "num_input_tokens_seen": 214440704, "step": 815 }, { "epoch": 2.3569629363080242, "grad_norm": 0.02134723588824272, "learning_rate": 1.1377268794559476e-06, "loss": 0.3856, "num_input_tokens_seen": 215759424, "step": 820 }, { "epoch": 2.3713566030946382, "grad_norm": 0.021346207708120346, "learning_rate": 1.0887635156048736e-06, "loss": 0.3879, "num_input_tokens_seen": 217098240, "step": 825 }, { "epoch": 2.3857502698812523, "grad_norm": 0.021947264671325684, "learning_rate": 1.040748052195752e-06, "loss": 0.3906, "num_input_tokens_seen": 218389984, "step": 830 }, { "epoch": 2.4001439366678663, "grad_norm": 0.023333607241511345, "learning_rate": 9.936921259268944e-07, "loss": 0.3903, "num_input_tokens_seen": 219692384, "step": 835 }, { "epoch": 2.41453760345448, "grad_norm": 0.020792281255126, "learning_rate": 9.476071409497712e-07, "loss": 0.3871, "num_input_tokens_seen": 221013216, "step": 840 }, { "epoch": 2.428931270241094, "grad_norm": 0.022382711991667747, "learning_rate": 9.025042661051808e-07, "loss": 0.3861, "num_input_tokens_seen": 222396512, "step": 845 }, { "epoch": 2.443324937027708, "grad_norm": 0.02197764627635479, "learning_rate": 8.583944322164528e-07, "loss": 0.3842, "num_input_tokens_seen": 223696512, "step": 850 }, { "epoch": 2.457718603814322, "grad_norm": 0.023145312443375587, "learning_rate": 8.15288329440318e-07, "loss": 0.3875, "num_input_tokens_seen": 225019840, "step": 855 }, { "epoch": 2.4721122706009355, "grad_norm": 0.02280507981777191, "learning_rate": 7.731964046761231e-07, "loss": 0.3896, "num_input_tokens_seen": 226347936, "step": 860 }, { "epoch": 2.4865059373875495, "grad_norm": 0.021663593128323555, "learning_rate": 7.321288590339898e-07, "loss": 0.3883, "num_input_tokens_seen": 227650912, "step": 865 }, { "epoch": 2.5008996041741636, "grad_norm": 0.022594928741455078, "learning_rate": 6.920956453625405e-07, "loss": 0.3908, "num_input_tokens_seen": 228960704, "step": 870 }, { "epoch": 2.515293270960777, "grad_norm": 0.022745080292224884, "learning_rate": 6.531064658368019e-07, "loss": 0.3805, "num_input_tokens_seen": 230283136, "step": 875 }, { "epoch": 2.529686937747391, "grad_norm": 0.02337946556508541, "learning_rate": 6.151707696068443e-07, "loss": 0.3892, "num_input_tokens_seen": 231587968, "step": 880 }, { "epoch": 2.544080604534005, "grad_norm": 0.023571399971842766, "learning_rate": 5.782977505077536e-07, "loss": 0.3846, "num_input_tokens_seen": 232939360, "step": 885 }, { "epoch": 2.5584742713206188, "grad_norm": 0.022394301369786263, "learning_rate": 5.42496344831478e-07, "loss": 0.3877, "num_input_tokens_seen": 234292896, "step": 890 }, { "epoch": 2.572867938107233, "grad_norm": 0.020835287868976593, "learning_rate": 5.077752291610854e-07, "loss": 0.3872, "num_input_tokens_seen": 235640864, "step": 895 }, { "epoch": 2.587261604893847, "grad_norm": 0.021807711571455002, "learning_rate": 4.741428182679736e-07, "loss": 0.377, "num_input_tokens_seen": 237012928, "step": 900 }, { "epoch": 2.6016552716804604, "grad_norm": 0.020575975999236107, "learning_rate": 4.416072630725166e-07, "loss": 0.3794, "num_input_tokens_seen": 238318656, "step": 905 }, { "epoch": 2.6160489384670744, "grad_norm": 0.02090187929570675, "learning_rate": 4.101764486686649e-07, "loss": 0.3875, "num_input_tokens_seen": 239625440, "step": 910 }, { "epoch": 2.6304426052536884, "grad_norm": 0.021241318434476852, "learning_rate": 3.798579924129736e-07, "loss": 0.3855, "num_input_tokens_seen": 240930400, "step": 915 }, { "epoch": 2.644836272040302, "grad_norm": 0.022065874189138412, "learning_rate": 3.5065924207850486e-07, "loss": 0.3896, "num_input_tokens_seen": 242234048, "step": 920 }, { "epoch": 2.659229938826916, "grad_norm": 0.02141835354268551, "learning_rate": 3.225872740740754e-07, "loss": 0.3804, "num_input_tokens_seen": 243557280, "step": 925 }, { "epoch": 2.67362360561353, "grad_norm": 0.021051181480288506, "learning_rate": 2.9564889172926993e-07, "loss": 0.3912, "num_input_tokens_seen": 244847776, "step": 930 }, { "epoch": 2.688017272400144, "grad_norm": 0.0236518532037735, "learning_rate": 2.6985062364562607e-07, "loss": 0.3857, "num_input_tokens_seen": 246166048, "step": 935 }, { "epoch": 2.7024109391867577, "grad_norm": 0.021910812705755234, "learning_rate": 2.451987221144109e-07, "loss": 0.3771, "num_input_tokens_seen": 247482240, "step": 940 }, { "epoch": 2.7168046059733717, "grad_norm": 0.022103767842054367, "learning_rate": 2.2169916160136029e-07, "loss": 0.3895, "num_input_tokens_seen": 248809152, "step": 945 }, { "epoch": 2.7311982727599857, "grad_norm": 0.021742546930909157, "learning_rate": 1.9935763729874435e-07, "loss": 0.3884, "num_input_tokens_seen": 250120896, "step": 950 }, { "epoch": 2.7455919395465997, "grad_norm": 0.02116556093096733, "learning_rate": 1.7817956374512334e-07, "loss": 0.3859, "num_input_tokens_seen": 251476704, "step": 955 }, { "epoch": 2.7599856063332133, "grad_norm": 0.021673424169421196, "learning_rate": 1.5817007351311476e-07, "loss": 0.3904, "num_input_tokens_seen": 252782176, "step": 960 }, { "epoch": 2.7743792731198273, "grad_norm": 0.02117246761918068, "learning_rate": 1.393340159654999e-07, "loss": 0.3873, "num_input_tokens_seen": 254045792, "step": 965 }, { "epoch": 2.7887729399064414, "grad_norm": 0.0224041398614645, "learning_rate": 1.2167595607996296e-07, "loss": 0.3852, "num_input_tokens_seen": 255355648, "step": 970 }, { "epoch": 2.803166606693055, "grad_norm": 0.0252470001578331, "learning_rate": 1.0520017334275823e-07, "loss": 0.3793, "num_input_tokens_seen": 256681600, "step": 975 }, { "epoch": 2.817560273479669, "grad_norm": 0.02181648090481758, "learning_rate": 8.991066071156074e-08, "loss": 0.3807, "num_input_tokens_seen": 258015936, "step": 980 }, { "epoch": 2.831953940266283, "grad_norm": 0.022744813933968544, "learning_rate": 7.581112364776044e-08, "loss": 0.3773, "num_input_tokens_seen": 259346816, "step": 985 }, { "epoch": 2.8463476070528966, "grad_norm": 0.02034585550427437, "learning_rate": 6.290497921843219e-08, "loss": 0.3845, "num_input_tokens_seen": 260673024, "step": 990 }, { "epoch": 2.8607412738395106, "grad_norm": 0.021828465163707733, "learning_rate": 5.1195355268199854e-08, "loss": 0.3876, "num_input_tokens_seen": 262019872, "step": 995 }, { "epoch": 2.8751349406261246, "grad_norm": 0.02159695513546467, "learning_rate": 4.0685089661192114e-08, "loss": 0.3851, "num_input_tokens_seen": 263341824, "step": 1000 }, { "epoch": 2.889528607412738, "grad_norm": 0.020134858787059784, "learning_rate": 3.1376729593276534e-08, "loss": 0.3864, "num_input_tokens_seen": 264677152, "step": 1005 }, { "epoch": 2.9039222741993522, "grad_norm": 0.022702520713210106, "learning_rate": 2.327253097474169e-08, "loss": 0.3858, "num_input_tokens_seen": 265961984, "step": 1010 }, { "epoch": 2.9183159409859663, "grad_norm": 0.022232618182897568, "learning_rate": 1.637445788356673e-08, "loss": 0.3828, "num_input_tokens_seen": 267219008, "step": 1015 }, { "epoch": 2.93270960777258, "grad_norm": 0.02198317088186741, "learning_rate": 1.0684182089423234e-08, "loss": 0.3857, "num_input_tokens_seen": 268533920, "step": 1020 }, { "epoch": 2.947103274559194, "grad_norm": 0.021084170788526535, "learning_rate": 6.20308264851488e-09, "loss": 0.3855, "num_input_tokens_seen": 269851232, "step": 1025 }, { "epoch": 2.961496941345808, "grad_norm": 0.02216101624071598, "learning_rate": 2.932245569360892e-09, "loss": 0.3884, "num_input_tokens_seen": 271148416, "step": 1030 }, { "epoch": 2.975890608132422, "grad_norm": 0.020568687468767166, "learning_rate": 8.724635495965805e-10, "loss": 0.3831, "num_input_tokens_seen": 272442080, "step": 1035 }, { "epoch": 2.9902842749190355, "grad_norm": 0.02233074977993965, "learning_rate": 2.4235783861459304e-11, "loss": 0.3872, "num_input_tokens_seen": 273768608, "step": 1040 } ], "logging_steps": 5, "max_steps": 1041, "num_input_tokens_seen": 274036096, "num_train_epochs": 3, "save_steps": -1041, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.0672503407966683e+19, "train_batch_size": 4, "trial_name": null, "trial_params": null }