{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 12.0, "eval_steps": 500, "global_step": 504, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "aux_loss": 8.045117378234863, "entropy": 0.05226727016270161, "epoch": 0.024096385542168676, "grad_norm": 0.5021907687187195, "learning_rate": 0.0, "loss": 0.09741637855768204, "mean_token_accuracy": 0.9888820052146912, "num_tokens": 154362.0, "step": 1 }, { "aux_loss": 8.047614574432373, "entropy": 0.05835266411304474, "epoch": 0.04819277108433735, "grad_norm": 0.551396369934082, "learning_rate": 1.4500000000000001e-07, "loss": 0.09991507232189178, "mean_token_accuracy": 0.9883801937103271, "num_tokens": 310702.0, "step": 2 }, { "aux_loss": 8.049727439880371, "entropy": 0.052583809942007065, "epoch": 0.07228915662650602, "grad_norm": 0.4750031530857086, "learning_rate": 2.9000000000000003e-07, "loss": 0.09806497395038605, "mean_token_accuracy": 0.9886206984519958, "num_tokens": 493904.0, "step": 3 }, { "aux_loss": 8.047826766967773, "entropy": 0.05231792479753494, "epoch": 0.0963855421686747, "grad_norm": 0.4863564074039459, "learning_rate": 4.35e-07, "loss": 0.09776315838098526, "mean_token_accuracy": 0.9888334274291992, "num_tokens": 663136.0, "step": 4 }, { "aux_loss": 8.047198295593262, "entropy": 0.04943128302693367, "epoch": 0.12048192771084337, "grad_norm": 0.5010114908218384, "learning_rate": 5.800000000000001e-07, "loss": 0.09543517231941223, "mean_token_accuracy": 0.9894405901432037, "num_tokens": 812532.0, "step": 5 }, { "aux_loss": 8.049106121063232, "entropy": 0.063042301684618, "epoch": 0.14457831325301204, "grad_norm": 0.5165722966194153, "learning_rate": 7.25e-07, "loss": 0.10346449911594391, "mean_token_accuracy": 0.987544983625412, "num_tokens": 973071.0, "step": 6 }, { "aux_loss": 8.047893047332764, "entropy": 0.0672433041036129, "epoch": 0.1686746987951807, "grad_norm": 0.5849524736404419, "learning_rate": 8.7e-07, "loss": 0.10626787692308426, "mean_token_accuracy": 0.9862557649612427, "num_tokens": 1110326.0, "step": 7 }, { "aux_loss": 8.04862642288208, "entropy": 0.06088166497647762, "epoch": 0.1927710843373494, "grad_norm": 0.48005586862564087, "learning_rate": 1.015e-06, "loss": 0.1021210104227066, "mean_token_accuracy": 0.9877255260944366, "num_tokens": 1259440.0, "step": 8 }, { "aux_loss": 8.047185897827148, "entropy": 0.049826065078377724, "epoch": 0.21686746987951808, "grad_norm": 0.43366947770118713, "learning_rate": 1.1600000000000001e-06, "loss": 0.09475715458393097, "mean_token_accuracy": 0.9898165464401245, "num_tokens": 1417756.0, "step": 9 }, { "aux_loss": 8.04772663116455, "entropy": 0.054957231506705284, "epoch": 0.24096385542168675, "grad_norm": 0.4529463052749634, "learning_rate": 1.3050000000000002e-06, "loss": 0.09896557033061981, "mean_token_accuracy": 0.9889253675937653, "num_tokens": 1579862.0, "step": 10 }, { "aux_loss": 8.047585487365723, "entropy": 0.05796742998063564, "epoch": 0.26506024096385544, "grad_norm": 0.45284125208854675, "learning_rate": 1.45e-06, "loss": 0.10001235455274582, "mean_token_accuracy": 0.9876790642738342, "num_tokens": 1731184.0, "step": 11 }, { "aux_loss": 8.04898738861084, "entropy": 0.05215233750641346, "epoch": 0.2891566265060241, "grad_norm": 0.4420299828052521, "learning_rate": 1.4499995904705798e-06, "loss": 0.09724222123622894, "mean_token_accuracy": 0.9884337782859802, "num_tokens": 1893932.0, "step": 12 }, { "aux_loss": 8.04798412322998, "entropy": 0.05265074409544468, "epoch": 0.3132530120481928, "grad_norm": 0.40204742550849915, "learning_rate": 1.4499983618832442e-06, "loss": 0.0970243290066719, "mean_token_accuracy": 0.989496260881424, "num_tokens": 2053005.0, "step": 13 }, { "aux_loss": 8.05030107498169, "entropy": 0.049178898334503174, "epoch": 0.3373493975903614, "grad_norm": 0.4108814597129822, "learning_rate": 1.4499963142407692e-06, "loss": 0.09499870240688324, "mean_token_accuracy": 0.9897345900535583, "num_tokens": 2217039.0, "step": 14 }, { "aux_loss": 8.046091079711914, "entropy": 0.0504351407289505, "epoch": 0.3614457831325301, "grad_norm": 0.4030505418777466, "learning_rate": 1.4499934475477814e-06, "loss": 0.09597203135490417, "mean_token_accuracy": 0.9898054599761963, "num_tokens": 2386769.0, "step": 15 }, { "aux_loss": 8.047934532165527, "entropy": 0.04648676887154579, "epoch": 0.3855421686746988, "grad_norm": 0.4123123586177826, "learning_rate": 1.4499897618107582e-06, "loss": 0.09345895051956177, "mean_token_accuracy": 0.989924967288971, "num_tokens": 2551093.0, "step": 16 }, { "aux_loss": 8.04793405532837, "entropy": 0.04946734011173248, "epoch": 0.40963855421686746, "grad_norm": 0.42739129066467285, "learning_rate": 1.4499852570380272e-06, "loss": 0.09633760154247284, "mean_token_accuracy": 0.9889810979366302, "num_tokens": 2704860.0, "step": 17 }, { "aux_loss": 8.048253536224365, "entropy": 0.0546275470405817, "epoch": 0.43373493975903615, "grad_norm": 0.44881728291511536, "learning_rate": 1.449979933239767e-06, "loss": 0.09820500761270523, "mean_token_accuracy": 0.9885384142398834, "num_tokens": 2850860.0, "step": 18 }, { "aux_loss": 8.050773620605469, "entropy": 0.05041976273059845, "epoch": 0.4578313253012048, "grad_norm": 0.46621593832969666, "learning_rate": 1.4499737904280063e-06, "loss": 0.09671641141176224, "mean_token_accuracy": 0.9887768924236298, "num_tokens": 3039323.0, "step": 19 }, { "aux_loss": 8.050614356994629, "entropy": 0.050554944202303886, "epoch": 0.4819277108433735, "grad_norm": 0.47147253155708313, "learning_rate": 1.449966828616625e-06, "loss": 0.09628961980342865, "mean_token_accuracy": 0.9888468682765961, "num_tokens": 3195488.0, "step": 20 }, { "aux_loss": 8.050609111785889, "entropy": 0.04489951767027378, "epoch": 0.5060240963855421, "grad_norm": 0.4890425503253937, "learning_rate": 1.4499590478213525e-06, "loss": 0.09394823014736176, "mean_token_accuracy": 0.9896246194839478, "num_tokens": 3369627.0, "step": 21 }, { "aux_loss": 8.047994613647461, "entropy": 0.0530005544424057, "epoch": 0.5301204819277109, "grad_norm": 0.5181686878204346, "learning_rate": 1.4499504480597702e-06, "loss": 0.09846185147762299, "mean_token_accuracy": 0.9879846572875977, "num_tokens": 3520643.0, "step": 22 }, { "aux_loss": 8.049047946929932, "entropy": 0.039870962500572205, "epoch": 0.5542168674698795, "grad_norm": 0.41603270173072815, "learning_rate": 1.4499410293513081e-06, "loss": 0.09075028449296951, "mean_token_accuracy": 0.9908623099327087, "num_tokens": 3702510.0, "step": 23 }, { "aux_loss": 8.050177097320557, "entropy": 0.05053388141095638, "epoch": 0.5783132530120482, "grad_norm": 0.4234795570373535, "learning_rate": 1.449930791717248e-06, "loss": 0.09689382463693619, "mean_token_accuracy": 0.9886369109153748, "num_tokens": 3867610.0, "step": 24 }, { "aux_loss": 8.048462867736816, "entropy": 0.049235520884394646, "epoch": 0.6024096385542169, "grad_norm": 0.4375890791416168, "learning_rate": 1.4499197351807219e-06, "loss": 0.09504671394824982, "mean_token_accuracy": 0.9891063868999481, "num_tokens": 4021186.0, "step": 25 }, { "aux_loss": 8.050186157226562, "entropy": 0.048021236434578896, "epoch": 0.6265060240963856, "grad_norm": 0.42389488220214844, "learning_rate": 1.449907859766711e-06, "loss": 0.09462042152881622, "mean_token_accuracy": 0.9893973469734192, "num_tokens": 4183102.0, "step": 26 }, { "aux_loss": 8.04945182800293, "entropy": 0.042689668014645576, "epoch": 0.6506024096385542, "grad_norm": 0.40038207173347473, "learning_rate": 1.4498951655020479e-06, "loss": 0.09214234352111816, "mean_token_accuracy": 0.9904394745826721, "num_tokens": 4348628.0, "step": 27 }, { "aux_loss": 8.050597667694092, "entropy": 0.05143065005540848, "epoch": 0.6746987951807228, "grad_norm": 0.4422961473464966, "learning_rate": 1.4498816524154148e-06, "loss": 0.09722501039505005, "mean_token_accuracy": 0.9888282418251038, "num_tokens": 4511217.0, "step": 28 }, { "aux_loss": 8.048704147338867, "entropy": 0.044764744117856026, "epoch": 0.6987951807228916, "grad_norm": 0.4279940128326416, "learning_rate": 1.4498673205373443e-06, "loss": 0.09300120174884796, "mean_token_accuracy": 0.9899511337280273, "num_tokens": 4684266.0, "step": 29 }, { "aux_loss": 8.047113418579102, "entropy": 0.04995520040392876, "epoch": 0.7228915662650602, "grad_norm": 0.45497408509254456, "learning_rate": 1.4498521699002187e-06, "loss": 0.0966445729136467, "mean_token_accuracy": 0.9883378744125366, "num_tokens": 4858009.0, "step": 30 }, { "aux_loss": 8.050236701965332, "entropy": 0.04773502238094807, "epoch": 0.7469879518072289, "grad_norm": 0.40059739351272583, "learning_rate": 1.4498362005382707e-06, "loss": 0.09425598382949829, "mean_token_accuracy": 0.9895853698253632, "num_tokens": 5041560.0, "step": 31 }, { "aux_loss": 8.0483078956604, "entropy": 0.04463958367705345, "epoch": 0.7710843373493976, "grad_norm": 0.421403706073761, "learning_rate": 1.4498194124875822e-06, "loss": 0.0921817421913147, "mean_token_accuracy": 0.9903146624565125, "num_tokens": 5207925.0, "step": 32 }, { "aux_loss": 8.051517486572266, "entropy": 0.0455746091902256, "epoch": 0.7951807228915663, "grad_norm": 0.39467114210128784, "learning_rate": 1.449801805786086e-06, "loss": 0.09311801195144653, "mean_token_accuracy": 0.9897293448448181, "num_tokens": 5410900.0, "step": 33 }, { "aux_loss": 8.047285079956055, "entropy": 0.04475598596036434, "epoch": 0.8192771084337349, "grad_norm": 0.3885505795478821, "learning_rate": 1.4497833804735631e-06, "loss": 0.09283807128667831, "mean_token_accuracy": 0.9904457926750183, "num_tokens": 5579379.0, "step": 34 }, { "aux_loss": 8.049206733703613, "entropy": 0.045768845826387405, "epoch": 0.8433734939759037, "grad_norm": 0.38822969794273376, "learning_rate": 1.4497641365916457e-06, "loss": 0.0930660218000412, "mean_token_accuracy": 0.9898505806922913, "num_tokens": 5756181.0, "step": 35 }, { "aux_loss": 8.049548149108887, "entropy": 0.0442772526293993, "epoch": 0.8674698795180723, "grad_norm": 0.42765918374061584, "learning_rate": 1.4497440741838147e-06, "loss": 0.09213966131210327, "mean_token_accuracy": 0.9906859695911407, "num_tokens": 5913888.0, "step": 36 }, { "aux_loss": 8.047310829162598, "entropy": 0.05137152969837189, "epoch": 0.891566265060241, "grad_norm": 0.46749433875083923, "learning_rate": 1.4497231932954002e-06, "loss": 0.09635019302368164, "mean_token_accuracy": 0.9894134104251862, "num_tokens": 6073822.0, "step": 37 }, { "aux_loss": 8.04575777053833, "entropy": 0.04952680319547653, "epoch": 0.9156626506024096, "grad_norm": 0.40102288126945496, "learning_rate": 1.4497014939735825e-06, "loss": 0.09520888328552246, "mean_token_accuracy": 0.9900149703025818, "num_tokens": 6228998.0, "step": 38 }, { "aux_loss": 8.05048656463623, "entropy": 0.05141362361609936, "epoch": 0.9397590361445783, "grad_norm": 0.45891159772872925, "learning_rate": 1.4496789762673903e-06, "loss": 0.09608915448188782, "mean_token_accuracy": 0.9895050525665283, "num_tokens": 6380479.0, "step": 39 }, { "aux_loss": 8.049390316009521, "entropy": 0.0542642492800951, "epoch": 0.963855421686747, "grad_norm": 0.4678654968738556, "learning_rate": 1.4496556402277018e-06, "loss": 0.0986521765589714, "mean_token_accuracy": 0.9882148206233978, "num_tokens": 6514347.0, "step": 40 }, { "aux_loss": 8.047286033630371, "entropy": 0.04129311256110668, "epoch": 0.9879518072289156, "grad_norm": 0.42529988288879395, "learning_rate": 1.4496314859072443e-06, "loss": 0.09138549864292145, "mean_token_accuracy": 0.9908298254013062, "num_tokens": 6684739.0, "step": 41 }, { "aux_loss": 8.050637245178223, "entropy": 0.04988313093781471, "epoch": 1.0, "grad_norm": 0.5628013610839844, "learning_rate": 1.4496065133605937e-06, "loss": 0.06163128837943077, "mean_token_accuracy": 0.9887231588363647, "num_tokens": 6741463.0, "step": 42 }, { "aux_loss": 8.047677040100098, "entropy": 0.04833286814391613, "epoch": 1.0240963855421688, "grad_norm": 0.43433839082717896, "learning_rate": 1.4495807226441745e-06, "loss": 0.09322302043437958, "mean_token_accuracy": 0.9907335042953491, "num_tokens": 6872162.0, "step": 43 }, { "aux_loss": 8.049845218658447, "entropy": 0.04814961925148964, "epoch": 1.0481927710843373, "grad_norm": 0.38683706521987915, "learning_rate": 1.4495541138162606e-06, "loss": 0.09274052828550339, "mean_token_accuracy": 0.9911822378635406, "num_tokens": 7044917.0, "step": 44 }, { "aux_loss": 8.045840740203857, "entropy": 0.04862277954816818, "epoch": 1.072289156626506, "grad_norm": 0.43781232833862305, "learning_rate": 1.4495266869369737e-06, "loss": 0.09285125136375427, "mean_token_accuracy": 0.991097629070282, "num_tokens": 7207551.0, "step": 45 }, { "aux_loss": 8.047110080718994, "entropy": 0.04816548526287079, "epoch": 1.0963855421686748, "grad_norm": 0.4117249846458435, "learning_rate": 1.4494984420682841e-06, "loss": 0.09330926835536957, "mean_token_accuracy": 0.990231990814209, "num_tokens": 7376391.0, "step": 46 }, { "aux_loss": 8.046239852905273, "entropy": 0.04640440456569195, "epoch": 1.1204819277108433, "grad_norm": 0.3918110728263855, "learning_rate": 1.4494693792740101e-06, "loss": 0.09266579151153564, "mean_token_accuracy": 0.9905861914157867, "num_tokens": 7544885.0, "step": 47 }, { "aux_loss": 8.045721054077148, "entropy": 0.04254587180912495, "epoch": 1.144578313253012, "grad_norm": 0.3635147213935852, "learning_rate": 1.4494394986198189e-06, "loss": 0.08964599668979645, "mean_token_accuracy": 0.9919890761375427, "num_tokens": 7718825.0, "step": 48 }, { "aux_loss": 8.04783582687378, "entropy": 0.0457068495452404, "epoch": 1.1686746987951806, "grad_norm": 0.37491077184677124, "learning_rate": 1.4494088001732242e-06, "loss": 0.0912659764289856, "mean_token_accuracy": 0.9914940893650055, "num_tokens": 7884797.0, "step": 49 }, { "aux_loss": 8.048118591308594, "entropy": 0.05809796415269375, "epoch": 1.1927710843373494, "grad_norm": 0.442947119474411, "learning_rate": 1.449377284003589e-06, "loss": 0.09830181300640106, "mean_token_accuracy": 0.9896205961704254, "num_tokens": 8037756.0, "step": 50 }, { "aux_loss": 8.045411109924316, "entropy": 0.04734855704009533, "epoch": 1.216867469879518, "grad_norm": 0.3778594732284546, "learning_rate": 1.449344950182123e-06, "loss": 0.09220214188098907, "mean_token_accuracy": 0.9912082552909851, "num_tokens": 8201900.0, "step": 51 }, { "aux_loss": 8.051240921020508, "entropy": 0.04616173356771469, "epoch": 1.2409638554216866, "grad_norm": 0.39906826615333557, "learning_rate": 1.4493117987818833e-06, "loss": 0.09254124015569687, "mean_token_accuracy": 0.9910232424736023, "num_tokens": 8368482.0, "step": 52 }, { "aux_loss": 8.048255443572998, "entropy": 0.04362104274332523, "epoch": 1.2650602409638554, "grad_norm": 0.4132522642612457, "learning_rate": 1.449277829877775e-06, "loss": 0.08969354629516602, "mean_token_accuracy": 0.9923582375049591, "num_tokens": 8532083.0, "step": 53 }, { "aux_loss": 8.049753189086914, "entropy": 0.05157726630568504, "epoch": 1.2891566265060241, "grad_norm": 0.42263299226760864, "learning_rate": 1.4492430435465495e-06, "loss": 0.09429101645946503, "mean_token_accuracy": 0.9907614588737488, "num_tokens": 8707916.0, "step": 54 }, { "aux_loss": 8.04571533203125, "entropy": 0.04540949687361717, "epoch": 1.3132530120481927, "grad_norm": 0.415887713432312, "learning_rate": 1.4492074398668059e-06, "loss": 0.09169892221689224, "mean_token_accuracy": 0.9909594357013702, "num_tokens": 8868293.0, "step": 55 }, { "aux_loss": 8.047487258911133, "entropy": 0.042821500450372696, "epoch": 1.3373493975903614, "grad_norm": 0.3941069543361664, "learning_rate": 1.4491710189189896e-06, "loss": 0.08963996917009354, "mean_token_accuracy": 0.9915030598640442, "num_tokens": 9040400.0, "step": 56 }, { "aux_loss": 8.046500205993652, "entropy": 0.04034057445824146, "epoch": 1.3614457831325302, "grad_norm": 0.3714058995246887, "learning_rate": 1.4491337807853928e-06, "loss": 0.08831468969583511, "mean_token_accuracy": 0.9924418330192566, "num_tokens": 9210005.0, "step": 57 }, { "aux_loss": 8.04520559310913, "entropy": 0.04288036748766899, "epoch": 1.3855421686746987, "grad_norm": 0.4117484986782074, "learning_rate": 1.4490957255501541e-06, "loss": 0.09062028676271439, "mean_token_accuracy": 0.9908726513385773, "num_tokens": 9354587.0, "step": 58 }, { "aux_loss": 8.048189163208008, "entropy": 0.04117992892861366, "epoch": 1.4096385542168675, "grad_norm": 0.3880350589752197, "learning_rate": 1.449056853299258e-06, "loss": 0.08878283947706223, "mean_token_accuracy": 0.9918811917304993, "num_tokens": 9530098.0, "step": 59 }, { "aux_loss": 8.046634674072266, "entropy": 0.046307843178510666, "epoch": 1.4337349397590362, "grad_norm": 0.41205379366874695, "learning_rate": 1.4490171641205356e-06, "loss": 0.0928514301776886, "mean_token_accuracy": 0.99020916223526, "num_tokens": 9696846.0, "step": 60 }, { "aux_loss": 8.04638147354126, "entropy": 0.03861385025084019, "epoch": 1.4578313253012047, "grad_norm": 0.3674647808074951, "learning_rate": 1.4489766581036633e-06, "loss": 0.08779378235340118, "mean_token_accuracy": 0.9924313127994537, "num_tokens": 9868180.0, "step": 61 }, { "aux_loss": 8.048831462860107, "entropy": 0.04485859349370003, "epoch": 1.4819277108433735, "grad_norm": 0.4122410714626312, "learning_rate": 1.4489353353401633e-06, "loss": 0.09213700890541077, "mean_token_accuracy": 0.9905197322368622, "num_tokens": 10041207.0, "step": 62 }, { "aux_loss": 8.045693397521973, "entropy": 0.04181382618844509, "epoch": 1.5060240963855422, "grad_norm": 0.41252797842025757, "learning_rate": 1.4488931959234036e-06, "loss": 0.08966240286827087, "mean_token_accuracy": 0.9918944835662842, "num_tokens": 10216601.0, "step": 63 }, { "aux_loss": 8.045026779174805, "entropy": 0.04367237165570259, "epoch": 1.5301204819277108, "grad_norm": 0.7194992899894714, "learning_rate": 1.4488502399485967e-06, "loss": 0.09064353257417679, "mean_token_accuracy": 0.9913205206394196, "num_tokens": 10373157.0, "step": 64 }, { "aux_loss": 8.046749591827393, "entropy": 0.049618642777204514, "epoch": 1.5542168674698795, "grad_norm": 0.4409625828266144, "learning_rate": 1.4488064675128008e-06, "loss": 0.09418876469135284, "mean_token_accuracy": 0.98995640873909, "num_tokens": 10513760.0, "step": 65 }, { "aux_loss": 8.04750108718872, "entropy": 0.045051392167806625, "epoch": 1.5783132530120483, "grad_norm": 0.4379954934120178, "learning_rate": 1.4487618787149178e-06, "loss": 0.09229664504528046, "mean_token_accuracy": 0.990358978509903, "num_tokens": 10667072.0, "step": 66 }, { "aux_loss": 8.0473952293396, "entropy": 0.03963223472237587, "epoch": 1.6024096385542168, "grad_norm": 0.3720748722553253, "learning_rate": 1.4487164736556958e-06, "loss": 0.08866938948631287, "mean_token_accuracy": 0.9920879304409027, "num_tokens": 10839108.0, "step": 67 }, { "aux_loss": 8.047708511352539, "entropy": 0.04451095871627331, "epoch": 1.6265060240963856, "grad_norm": 0.4250375032424927, "learning_rate": 1.4486702524377257e-06, "loss": 0.09129409492015839, "mean_token_accuracy": 0.9904707074165344, "num_tokens": 11001747.0, "step": 68 }, { "aux_loss": 8.045770645141602, "entropy": 0.041699016466736794, "epoch": 1.6506024096385543, "grad_norm": 0.5749812722206116, "learning_rate": 1.4486232151654433e-06, "loss": 0.08955338597297668, "mean_token_accuracy": 0.9914253950119019, "num_tokens": 11163010.0, "step": 69 }, { "aux_loss": 8.048367977142334, "entropy": 0.0460666548460722, "epoch": 1.6746987951807228, "grad_norm": 0.412992388010025, "learning_rate": 1.448575361945128e-06, "loss": 0.09151523560285568, "mean_token_accuracy": 0.9911079108715057, "num_tokens": 11326488.0, "step": 70 }, { "aux_loss": 8.047677040100098, "entropy": 0.039530523121356964, "epoch": 1.6987951807228916, "grad_norm": 0.3757312297821045, "learning_rate": 1.4485266928849028e-06, "loss": 0.08811481297016144, "mean_token_accuracy": 0.9917347729206085, "num_tokens": 11501286.0, "step": 71 }, { "aux_loss": 8.046856880187988, "entropy": 0.041672926396131516, "epoch": 1.7228915662650603, "grad_norm": 0.38275983929634094, "learning_rate": 1.448477208094734e-06, "loss": 0.08906584978103638, "mean_token_accuracy": 0.9918383359909058, "num_tokens": 11668188.0, "step": 72 }, { "aux_loss": 8.04528522491455, "entropy": 0.047908855602145195, "epoch": 1.7469879518072289, "grad_norm": 0.4008839726448059, "learning_rate": 1.4484269076864313e-06, "loss": 0.09260185062885284, "mean_token_accuracy": 0.9907302260398865, "num_tokens": 11834809.0, "step": 73 }, { "aux_loss": 8.047989845275879, "entropy": 0.049024928361177444, "epoch": 1.7710843373493976, "grad_norm": 0.43533122539520264, "learning_rate": 1.448375791773647e-06, "loss": 0.09409160912036896, "mean_token_accuracy": 0.9904188215732574, "num_tokens": 12004510.0, "step": 74 }, { "aux_loss": 8.045915126800537, "entropy": 0.05250510759651661, "epoch": 1.7951807228915664, "grad_norm": 0.4690086841583252, "learning_rate": 1.4483238604718765e-06, "loss": 0.0955488458275795, "mean_token_accuracy": 0.9906903803348541, "num_tokens": 12137534.0, "step": 75 }, { "aux_loss": 8.044984817504883, "entropy": 0.0376634681597352, "epoch": 1.819277108433735, "grad_norm": 0.35793742537498474, "learning_rate": 1.4482711138984564e-06, "loss": 0.08688877522945404, "mean_token_accuracy": 0.9927193224430084, "num_tokens": 12325369.0, "step": 76 }, { "aux_loss": 8.04779052734375, "entropy": 0.04571797512471676, "epoch": 1.8433734939759037, "grad_norm": 0.4300045371055603, "learning_rate": 1.4482175521725665e-06, "loss": 0.09217096120119095, "mean_token_accuracy": 0.9905279278755188, "num_tokens": 12488806.0, "step": 77 }, { "aux_loss": 8.044951915740967, "entropy": 0.05060774274170399, "epoch": 1.8674698795180724, "grad_norm": 0.423297643661499, "learning_rate": 1.4481631754152286e-06, "loss": 0.0944666936993599, "mean_token_accuracy": 0.990161120891571, "num_tokens": 12640695.0, "step": 78 }, { "aux_loss": 8.047436714172363, "entropy": 0.04260541498661041, "epoch": 1.891566265060241, "grad_norm": 0.39964279532432556, "learning_rate": 1.4481079837493048e-06, "loss": 0.08988695591688156, "mean_token_accuracy": 0.9916346371173859, "num_tokens": 12823930.0, "step": 79 }, { "aux_loss": 8.047076225280762, "entropy": 0.04447777755558491, "epoch": 1.9156626506024095, "grad_norm": 0.3796585202217102, "learning_rate": 1.4480519772994993e-06, "loss": 0.09115425497293472, "mean_token_accuracy": 0.9917284250259399, "num_tokens": 12998419.0, "step": 80 }, { "aux_loss": 8.04789924621582, "entropy": 0.04236619919538498, "epoch": 1.9397590361445785, "grad_norm": 0.418720543384552, "learning_rate": 1.4479951561923573e-06, "loss": 0.0903579443693161, "mean_token_accuracy": 0.9915480315685272, "num_tokens": 13148913.0, "step": 81 }, { "aux_loss": 8.045738697052002, "entropy": 0.04441889189183712, "epoch": 1.963855421686747, "grad_norm": 0.3862975835800171, "learning_rate": 1.4479375205562642e-06, "loss": 0.09073998779058456, "mean_token_accuracy": 0.9912832081317902, "num_tokens": 13304132.0, "step": 82 }, { "aux_loss": 8.046059608459473, "entropy": 0.05218968167901039, "epoch": 1.9879518072289155, "grad_norm": 0.4317293167114258, "learning_rate": 1.4478790705214464e-06, "loss": 0.09526760876178741, "mean_token_accuracy": 0.9900495111942291, "num_tokens": 13453623.0, "step": 83 }, { "aux_loss": 8.05069351196289, "entropy": 0.039391469210386276, "epoch": 2.0, "grad_norm": 0.6828374266624451, "learning_rate": 1.4478198062199706e-06, "loss": 0.05737518146634102, "mean_token_accuracy": 0.9917781352996826, "num_tokens": 13482926.0, "step": 84 }, { "aux_loss": 8.045267105102539, "entropy": 0.053030213341116905, "epoch": 2.0240963855421685, "grad_norm": 0.40254807472229004, "learning_rate": 1.4477597277857421e-06, "loss": 0.09399621188640594, "mean_token_accuracy": 0.9910189509391785, "num_tokens": 13616336.0, "step": 85 }, { "aux_loss": 8.04813003540039, "entropy": 0.04406110197305679, "epoch": 2.0481927710843375, "grad_norm": 0.36270391941070557, "learning_rate": 1.4476988353545068e-06, "loss": 0.08861124515533447, "mean_token_accuracy": 0.9931189119815826, "num_tokens": 13775230.0, "step": 86 }, { "aux_loss": 8.044662952423096, "entropy": 0.03888658061623573, "epoch": 2.072289156626506, "grad_norm": 0.3652919828891754, "learning_rate": 1.4476371290638496e-06, "loss": 0.08651480078697205, "mean_token_accuracy": 0.9931168258190155, "num_tokens": 13935092.0, "step": 87 }, { "aux_loss": 8.048104763031006, "entropy": 0.047589803114533424, "epoch": 2.0963855421686746, "grad_norm": 0.4187248647212982, "learning_rate": 1.447574609053194e-06, "loss": 0.09169710427522659, "mean_token_accuracy": 0.9922028183937073, "num_tokens": 14097222.0, "step": 88 }, { "aux_loss": 8.044262409210205, "entropy": 0.04133613780140877, "epoch": 2.1204819277108435, "grad_norm": 0.3797593414783478, "learning_rate": 1.4475112754638022e-06, "loss": 0.08802482485771179, "mean_token_accuracy": 0.9926626980304718, "num_tokens": 14255553.0, "step": 89 }, { "aux_loss": 8.046658515930176, "entropy": 0.04000333696603775, "epoch": 2.144578313253012, "grad_norm": 0.4277676045894623, "learning_rate": 1.447447128438775e-06, "loss": 0.08734406530857086, "mean_token_accuracy": 0.993060439825058, "num_tokens": 14431608.0, "step": 90 }, { "aux_loss": 8.045912265777588, "entropy": 0.041802020743489265, "epoch": 2.1686746987951806, "grad_norm": 0.37397268414497375, "learning_rate": 1.4473821681230506e-06, "loss": 0.08865631371736526, "mean_token_accuracy": 0.9919825196266174, "num_tokens": 14615993.0, "step": 91 }, { "aux_loss": 8.044597625732422, "entropy": 0.04039378650486469, "epoch": 2.1927710843373496, "grad_norm": 0.423145592212677, "learning_rate": 1.4473163946634052e-06, "loss": 0.0880887508392334, "mean_token_accuracy": 0.9921639561653137, "num_tokens": 14766575.0, "step": 92 }, { "aux_loss": 8.04832410812378, "entropy": 0.04441938176751137, "epoch": 2.216867469879518, "grad_norm": 0.3814225196838379, "learning_rate": 1.4472498082084518e-06, "loss": 0.08906400948762894, "mean_token_accuracy": 0.9928748905658722, "num_tokens": 14931445.0, "step": 93 }, { "aux_loss": 8.042942523956299, "entropy": 0.046976158395409584, "epoch": 2.2409638554216866, "grad_norm": 0.3922480344772339, "learning_rate": 1.4471824089086415e-06, "loss": 0.09150424599647522, "mean_token_accuracy": 0.9916513860225677, "num_tokens": 15091210.0, "step": 94 }, { "aux_loss": 8.045757293701172, "entropy": 0.035969141870737076, "epoch": 2.2650602409638556, "grad_norm": 0.3510456681251526, "learning_rate": 1.44711419691626e-06, "loss": 0.0854613184928894, "mean_token_accuracy": 0.9934249818325043, "num_tokens": 15260222.0, "step": 95 }, { "aux_loss": 8.044999122619629, "entropy": 0.03909716196358204, "epoch": 2.289156626506024, "grad_norm": 0.3629781901836395, "learning_rate": 1.4470451723854314e-06, "loss": 0.08637961745262146, "mean_token_accuracy": 0.9935233891010284, "num_tokens": 15455860.0, "step": 96 }, { "aux_loss": 8.04701280593872, "entropy": 0.04057766683399677, "epoch": 2.3132530120481927, "grad_norm": 0.36879613995552063, "learning_rate": 1.4469753354721144e-06, "loss": 0.087168388068676, "mean_token_accuracy": 0.9932206869125366, "num_tokens": 15631021.0, "step": 97 }, { "aux_loss": 8.047924518585205, "entropy": 0.04564652778208256, "epoch": 2.337349397590361, "grad_norm": 0.41153064370155334, "learning_rate": 1.4469046863341036e-06, "loss": 0.08925162255764008, "mean_token_accuracy": 0.9921718537807465, "num_tokens": 15789136.0, "step": 98 }, { "aux_loss": 8.0452880859375, "entropy": 0.04301636107265949, "epoch": 2.36144578313253, "grad_norm": 0.376197874546051, "learning_rate": 1.4468332251310286e-06, "loss": 0.08848991990089417, "mean_token_accuracy": 0.9930213391780853, "num_tokens": 15938397.0, "step": 99 }, { "aux_loss": 8.043729782104492, "entropy": 0.04113657400012016, "epoch": 2.3855421686746987, "grad_norm": 0.3817802667617798, "learning_rate": 1.4467609520243544e-06, "loss": 0.08791770040988922, "mean_token_accuracy": 0.9926939308643341, "num_tokens": 16114803.0, "step": 100 }, { "aux_loss": 8.044564247131348, "entropy": 0.04448202811181545, "epoch": 2.4096385542168672, "grad_norm": 0.41418957710266113, "learning_rate": 1.44668786717738e-06, "loss": 0.08933436870574951, "mean_token_accuracy": 0.9923655092716217, "num_tokens": 16267681.0, "step": 101 }, { "aux_loss": 8.045689105987549, "entropy": 0.043511977419257164, "epoch": 2.433734939759036, "grad_norm": 0.3912562429904938, "learning_rate": 1.4466139707552382e-06, "loss": 0.08852104097604752, "mean_token_accuracy": 0.9933134019374847, "num_tokens": 16435524.0, "step": 102 }, { "aux_loss": 8.04603910446167, "entropy": 0.03945927880704403, "epoch": 2.4578313253012047, "grad_norm": 0.37696266174316406, "learning_rate": 1.4465392629248964e-06, "loss": 0.08802925050258636, "mean_token_accuracy": 0.9925020635128021, "num_tokens": 16601843.0, "step": 103 }, { "aux_loss": 8.041633129119873, "entropy": 0.042852023616433144, "epoch": 2.4819277108433733, "grad_norm": 0.42523500323295593, "learning_rate": 1.446463743855155e-06, "loss": 0.08881749212741852, "mean_token_accuracy": 0.9926598370075226, "num_tokens": 16749225.0, "step": 104 }, { "aux_loss": 8.044000625610352, "entropy": 0.04509095661342144, "epoch": 2.5060240963855422, "grad_norm": 0.43666303157806396, "learning_rate": 1.4463874137166468e-06, "loss": 0.09076739847660065, "mean_token_accuracy": 0.9915396869182587, "num_tokens": 16897018.0, "step": 105 }, { "aux_loss": 8.044254302978516, "entropy": 0.04391391761600971, "epoch": 2.5301204819277108, "grad_norm": 0.4111824333667755, "learning_rate": 1.4463102726818382e-06, "loss": 0.08995572477579117, "mean_token_accuracy": 0.9917828142642975, "num_tokens": 17065753.0, "step": 106 }, { "aux_loss": 8.045661926269531, "entropy": 0.04082946851849556, "epoch": 2.5542168674698793, "grad_norm": 0.3910435438156128, "learning_rate": 1.4462323209250268e-06, "loss": 0.08806779235601425, "mean_token_accuracy": 0.9928287863731384, "num_tokens": 17235799.0, "step": 107 }, { "aux_loss": 8.043983459472656, "entropy": 0.045222554355859756, "epoch": 2.5783132530120483, "grad_norm": 0.4386132061481476, "learning_rate": 1.4461535586223427e-06, "loss": 0.090940460562706, "mean_token_accuracy": 0.9915510416030884, "num_tokens": 17376992.0, "step": 108 }, { "aux_loss": 8.0429105758667, "entropy": 0.04239073768258095, "epoch": 2.602409638554217, "grad_norm": 0.39754438400268555, "learning_rate": 1.4460739859517472e-06, "loss": 0.08899098634719849, "mean_token_accuracy": 0.9922184944152832, "num_tokens": 17537095.0, "step": 109 }, { "aux_loss": 8.046865940093994, "entropy": 0.04032203182578087, "epoch": 2.6265060240963853, "grad_norm": 0.4198264181613922, "learning_rate": 1.4459936030930326e-06, "loss": 0.08784371614456177, "mean_token_accuracy": 0.9927988350391388, "num_tokens": 17697756.0, "step": 110 }, { "aux_loss": 8.045022964477539, "entropy": 0.04641672037541866, "epoch": 2.6506024096385543, "grad_norm": 0.41483283042907715, "learning_rate": 1.4459124102278213e-06, "loss": 0.0906679630279541, "mean_token_accuracy": 0.9918768405914307, "num_tokens": 17862032.0, "step": 111 }, { "aux_loss": 8.046215057373047, "entropy": 0.038604725152254105, "epoch": 2.674698795180723, "grad_norm": 0.38772159814834595, "learning_rate": 1.4458304075395668e-06, "loss": 0.08620807528495789, "mean_token_accuracy": 0.9930865466594696, "num_tokens": 18014648.0, "step": 112 }, { "aux_loss": 8.04534912109375, "entropy": 0.047094520181417465, "epoch": 2.6987951807228914, "grad_norm": 0.4265570342540741, "learning_rate": 1.445747595213552e-06, "loss": 0.09142982959747314, "mean_token_accuracy": 0.9916557669639587, "num_tokens": 18170137.0, "step": 113 }, { "aux_loss": 8.045645713806152, "entropy": 0.037863900884985924, "epoch": 2.7228915662650603, "grad_norm": 0.3691053092479706, "learning_rate": 1.4456639734368888e-06, "loss": 0.08656749129295349, "mean_token_accuracy": 0.9931949079036713, "num_tokens": 18341196.0, "step": 114 }, { "aux_loss": 8.04396677017212, "entropy": 0.04190782643854618, "epoch": 2.746987951807229, "grad_norm": 0.38775166869163513, "learning_rate": 1.4455795423985187e-06, "loss": 0.08832530677318573, "mean_token_accuracy": 0.9925132691860199, "num_tokens": 18499534.0, "step": 115 }, { "aux_loss": 8.046361446380615, "entropy": 0.044008735567331314, "epoch": 2.7710843373493974, "grad_norm": 0.3934473395347595, "learning_rate": 1.445494302289211e-06, "loss": 0.08926442265510559, "mean_token_accuracy": 0.9925075769424438, "num_tokens": 18659760.0, "step": 116 }, { "aux_loss": 8.044501304626465, "entropy": 0.04429285787045956, "epoch": 2.7951807228915664, "grad_norm": 0.4424228072166443, "learning_rate": 1.4454082533015636e-06, "loss": 0.08979617059230804, "mean_token_accuracy": 0.9921565651893616, "num_tokens": 18831165.0, "step": 117 }, { "aux_loss": 8.042979717254639, "entropy": 0.040504178032279015, "epoch": 2.819277108433735, "grad_norm": 0.4018898904323578, "learning_rate": 1.4453213956300015e-06, "loss": 0.08786608278751373, "mean_token_accuracy": 0.992399662733078, "num_tokens": 18984127.0, "step": 118 }, { "aux_loss": 8.045685768127441, "entropy": 0.041042402386665344, "epoch": 2.8433734939759034, "grad_norm": 0.5288944840431213, "learning_rate": 1.4452337294707773e-06, "loss": 0.08859241008758545, "mean_token_accuracy": 0.9921814501285553, "num_tokens": 19160419.0, "step": 119 }, { "aux_loss": 8.046215057373047, "entropy": 0.04414335638284683, "epoch": 2.8674698795180724, "grad_norm": 0.4066352844238281, "learning_rate": 1.4451452550219706e-06, "loss": 0.08978652209043503, "mean_token_accuracy": 0.9923945069313049, "num_tokens": 19335546.0, "step": 120 }, { "aux_loss": 8.044774055480957, "entropy": 0.03940526768565178, "epoch": 2.891566265060241, "grad_norm": 0.4042900800704956, "learning_rate": 1.445055972483487e-06, "loss": 0.08746181428432465, "mean_token_accuracy": 0.9926989078521729, "num_tokens": 19496314.0, "step": 121 }, { "aux_loss": 8.043519020080566, "entropy": 0.03671685978770256, "epoch": 2.9156626506024095, "grad_norm": 0.3954128921031952, "learning_rate": 1.4449658820570577e-06, "loss": 0.08653290569782257, "mean_token_accuracy": 0.9926026463508606, "num_tokens": 19661718.0, "step": 122 }, { "aux_loss": 8.045527458190918, "entropy": 0.04113632068037987, "epoch": 2.9397590361445785, "grad_norm": 0.39803871512413025, "learning_rate": 1.4448749839462395e-06, "loss": 0.08833590149879456, "mean_token_accuracy": 0.9923411309719086, "num_tokens": 19847373.0, "step": 123 }, { "aux_loss": 8.044186115264893, "entropy": 0.03642796538770199, "epoch": 2.963855421686747, "grad_norm": 0.3793511390686035, "learning_rate": 1.4447832783564146e-06, "loss": 0.086070716381073, "mean_token_accuracy": 0.9930998384952545, "num_tokens": 20025875.0, "step": 124 }, { "aux_loss": 8.046002388000488, "entropy": 0.047230470925569534, "epoch": 2.9879518072289155, "grad_norm": 0.4477235972881317, "learning_rate": 1.444690765494789e-06, "loss": 0.09117428958415985, "mean_token_accuracy": 0.9920151233673096, "num_tokens": 20182590.0, "step": 125 }, { "aux_loss": 8.042522430419922, "entropy": 0.040220800787210464, "epoch": 3.0, "grad_norm": 0.5846906900405884, "learning_rate": 1.4445974455703927e-06, "loss": 0.0573921799659729, "mean_token_accuracy": 0.9929695129394531, "num_tokens": 20224389.0, "step": 126 }, { "aux_loss": 8.044944763183594, "entropy": 0.039370276033878326, "epoch": 3.0240963855421685, "grad_norm": 0.3742491900920868, "learning_rate": 1.44450331879408e-06, "loss": 0.08556805551052094, "mean_token_accuracy": 0.9942886531352997, "num_tokens": 20380640.0, "step": 127 }, { "aux_loss": 8.043789863586426, "entropy": 0.045225948095321655, "epoch": 3.0481927710843375, "grad_norm": 0.38408586382865906, "learning_rate": 1.4444083853785277e-06, "loss": 0.08862867951393127, "mean_token_accuracy": 0.9931619465351105, "num_tokens": 20532981.0, "step": 128 }, { "aux_loss": 8.042508125305176, "entropy": 0.0450060423463583, "epoch": 3.072289156626506, "grad_norm": 0.37083542346954346, "learning_rate": 1.444312645538235e-06, "loss": 0.08864334225654602, "mean_token_accuracy": 0.9928875267505646, "num_tokens": 20683874.0, "step": 129 }, { "aux_loss": 8.041747093200684, "entropy": 0.04171221703290939, "epoch": 3.0963855421686746, "grad_norm": 0.36446937918663025, "learning_rate": 1.4442160994895236e-06, "loss": 0.08605008572340012, "mean_token_accuracy": 0.9937500953674316, "num_tokens": 20836727.0, "step": 130 }, { "aux_loss": 8.042478561401367, "entropy": 0.04033582843840122, "epoch": 3.1204819277108435, "grad_norm": 0.37039053440093994, "learning_rate": 1.4441187474505368e-06, "loss": 0.08619973808526993, "mean_token_accuracy": 0.9936582446098328, "num_tokens": 20989173.0, "step": 131 }, { "aux_loss": 8.04190444946289, "entropy": 0.04400304704904556, "epoch": 3.144578313253012, "grad_norm": 0.39441367983818054, "learning_rate": 1.4440205896412386e-06, "loss": 0.08861161768436432, "mean_token_accuracy": 0.993509829044342, "num_tokens": 21137746.0, "step": 132 }, { "aux_loss": 8.042577743530273, "entropy": 0.0362233929336071, "epoch": 3.1686746987951806, "grad_norm": 0.3513298034667969, "learning_rate": 1.4439216262834142e-06, "loss": 0.08395665884017944, "mean_token_accuracy": 0.9942896068096161, "num_tokens": 21303083.0, "step": 133 }, { "aux_loss": 8.045822143554688, "entropy": 0.044513555243611336, "epoch": 3.1927710843373496, "grad_norm": 0.4062028229236603, "learning_rate": 1.4438218576006684e-06, "loss": 0.08783506602048874, "mean_token_accuracy": 0.9932784140110016, "num_tokens": 21465720.0, "step": 134 }, { "aux_loss": 8.042749881744385, "entropy": 0.03609209880232811, "epoch": 3.216867469879518, "grad_norm": 0.36185288429260254, "learning_rate": 1.4437212838184255e-06, "loss": 0.08398795872926712, "mean_token_accuracy": 0.9942994117736816, "num_tokens": 21634832.0, "step": 135 }, { "aux_loss": 8.046396255493164, "entropy": 0.039127200841903687, "epoch": 3.2409638554216866, "grad_norm": 0.3764151334762573, "learning_rate": 1.44361990516393e-06, "loss": 0.08616587519645691, "mean_token_accuracy": 0.993415892124176, "num_tokens": 21801355.0, "step": 136 }, { "aux_loss": 8.043558597564697, "entropy": 0.03838344104588032, "epoch": 3.2650602409638556, "grad_norm": 0.3657795786857605, "learning_rate": 1.4435177218662435e-06, "loss": 0.08551836758852005, "mean_token_accuracy": 0.9938235878944397, "num_tokens": 21973015.0, "step": 137 }, { "aux_loss": 8.043213367462158, "entropy": 0.04633874632418156, "epoch": 3.289156626506024, "grad_norm": 0.38201189041137695, "learning_rate": 1.4434147341562468e-06, "loss": 0.08937641978263855, "mean_token_accuracy": 0.9929512739181519, "num_tokens": 22134914.0, "step": 138 }, { "aux_loss": 8.04480266571045, "entropy": 0.03689238056540489, "epoch": 3.3132530120481927, "grad_norm": 0.35625335574150085, "learning_rate": 1.4433109422666374e-06, "loss": 0.08385109901428223, "mean_token_accuracy": 0.9944583773612976, "num_tokens": 22302240.0, "step": 139 }, { "aux_loss": 8.042608261108398, "entropy": 0.04020004719495773, "epoch": 3.337349397590361, "grad_norm": 0.3919045925140381, "learning_rate": 1.4432063464319306e-06, "loss": 0.0874231606721878, "mean_token_accuracy": 0.9931889474391937, "num_tokens": 22471698.0, "step": 140 }, { "aux_loss": 8.042847156524658, "entropy": 0.03685566782951355, "epoch": 3.36144578313253, "grad_norm": 0.3515630066394806, "learning_rate": 1.4431009468884578e-06, "loss": 0.0849953442811966, "mean_token_accuracy": 0.9941838085651398, "num_tokens": 22653073.0, "step": 141 }, { "aux_loss": 8.043398380279541, "entropy": 0.0423385389149189, "epoch": 3.3855421686746987, "grad_norm": 0.41736137866973877, "learning_rate": 1.442994743874366e-06, "loss": 0.08791652321815491, "mean_token_accuracy": 0.9927142858505249, "num_tokens": 22810578.0, "step": 142 }, { "aux_loss": 8.04459524154663, "entropy": 0.04449957422912121, "epoch": 3.4096385542168672, "grad_norm": 0.4232349693775177, "learning_rate": 1.4428877376296185e-06, "loss": 0.08924206346273422, "mean_token_accuracy": 0.9924839735031128, "num_tokens": 22953794.0, "step": 143 }, { "aux_loss": 8.041166305541992, "entropy": 0.04270816035568714, "epoch": 3.433734939759036, "grad_norm": 0.3914850354194641, "learning_rate": 1.4427799283959926e-06, "loss": 0.08785770833492279, "mean_token_accuracy": 0.9931382238864899, "num_tokens": 23120357.0, "step": 144 }, { "aux_loss": 8.04544448852539, "entropy": 0.03356307931244373, "epoch": 3.4578313253012047, "grad_norm": 0.3500516712665558, "learning_rate": 1.4426713164170808e-06, "loss": 0.08334299921989441, "mean_token_accuracy": 0.9946193993091583, "num_tokens": 23300231.0, "step": 145 }, { "aux_loss": 8.04530382156372, "entropy": 0.044576091691851616, "epoch": 3.4819277108433733, "grad_norm": 0.41992995142936707, "learning_rate": 1.4425619019382884e-06, "loss": 0.08873672783374786, "mean_token_accuracy": 0.9929416477680206, "num_tokens": 23453268.0, "step": 146 }, { "aux_loss": 8.044836044311523, "entropy": 0.03937925212085247, "epoch": 3.5060240963855422, "grad_norm": 0.37806037068367004, "learning_rate": 1.4424516852068346e-06, "loss": 0.08648265898227692, "mean_token_accuracy": 0.9935058355331421, "num_tokens": 23625257.0, "step": 147 }, { "aux_loss": 8.04463529586792, "entropy": 0.0399188157171011, "epoch": 3.5301204819277108, "grad_norm": 0.37204214930534363, "learning_rate": 1.442340666471751e-06, "loss": 0.08639834821224213, "mean_token_accuracy": 0.9933888912200928, "num_tokens": 23820327.0, "step": 148 }, { "aux_loss": 8.044984340667725, "entropy": 0.036087172105908394, "epoch": 3.5542168674698793, "grad_norm": 0.36808425188064575, "learning_rate": 1.4422288459838816e-06, "loss": 0.08478154242038727, "mean_token_accuracy": 0.9945113360881805, "num_tokens": 23979995.0, "step": 149 }, { "aux_loss": 8.043323993682861, "entropy": 0.04419667460024357, "epoch": 3.5783132530120483, "grad_norm": 0.41120970249176025, "learning_rate": 1.4421162239958818e-06, "loss": 0.0894618034362793, "mean_token_accuracy": 0.9925802052021027, "num_tokens": 24125572.0, "step": 150 }, { "aux_loss": 8.042481422424316, "entropy": 0.03813181072473526, "epoch": 3.602409638554217, "grad_norm": 0.3920314610004425, "learning_rate": 1.4420028007622175e-06, "loss": 0.08617769181728363, "mean_token_accuracy": 0.9939529597759247, "num_tokens": 24283705.0, "step": 151 }, { "aux_loss": 8.043877601623535, "entropy": 0.03504548221826553, "epoch": 3.6265060240963853, "grad_norm": 0.38018906116485596, "learning_rate": 1.4418885765391659e-06, "loss": 0.08467784523963928, "mean_token_accuracy": 0.993707150220871, "num_tokens": 24472505.0, "step": 152 }, { "aux_loss": 8.042401313781738, "entropy": 0.04122787527740002, "epoch": 3.6506024096385543, "grad_norm": 0.39765456318855286, "learning_rate": 1.4417735515848131e-06, "loss": 0.08704474568367004, "mean_token_accuracy": 0.9933643937110901, "num_tokens": 24643360.0, "step": 153 }, { "aux_loss": 8.043309688568115, "entropy": 0.04166724532842636, "epoch": 3.674698795180723, "grad_norm": 0.3905385136604309, "learning_rate": 1.4416577261590549e-06, "loss": 0.08706511557102203, "mean_token_accuracy": 0.9933055341243744, "num_tokens": 24802344.0, "step": 154 }, { "aux_loss": 8.040821552276611, "entropy": 0.03833147883415222, "epoch": 3.6987951807228914, "grad_norm": 0.4488506615161896, "learning_rate": 1.4415411005235958e-06, "loss": 0.08571713417768478, "mean_token_accuracy": 0.9934513568878174, "num_tokens": 24956387.0, "step": 155 }, { "aux_loss": 8.043232440948486, "entropy": 0.03610091283917427, "epoch": 3.7228915662650603, "grad_norm": 0.3729538023471832, "learning_rate": 1.4414236749419483e-06, "loss": 0.08453528583049774, "mean_token_accuracy": 0.9941688776016235, "num_tokens": 25118460.0, "step": 156 }, { "aux_loss": 8.042871475219727, "entropy": 0.04386945813894272, "epoch": 3.746987951807229, "grad_norm": 0.4113171100616455, "learning_rate": 1.441305449679432e-06, "loss": 0.08860649913549423, "mean_token_accuracy": 0.9927978813648224, "num_tokens": 25276453.0, "step": 157 }, { "aux_loss": 8.04326343536377, "entropy": 0.03775089047849178, "epoch": 3.7710843373493974, "grad_norm": 0.3969726860523224, "learning_rate": 1.441186425003174e-06, "loss": 0.08585880696773529, "mean_token_accuracy": 0.9934997260570526, "num_tokens": 25465189.0, "step": 158 }, { "aux_loss": 8.041276931762695, "entropy": 0.03554354049265385, "epoch": 3.7951807228915664, "grad_norm": 0.37212640047073364, "learning_rate": 1.4410666011821071e-06, "loss": 0.08398972451686859, "mean_token_accuracy": 0.9942491948604584, "num_tokens": 25647091.0, "step": 159 }, { "aux_loss": 8.04280948638916, "entropy": 0.03362584114074707, "epoch": 3.819277108433735, "grad_norm": 0.37804487347602844, "learning_rate": 1.44094597848697e-06, "loss": 0.08355149626731873, "mean_token_accuracy": 0.9944404661655426, "num_tokens": 25812959.0, "step": 160 }, { "aux_loss": 8.041194915771484, "entropy": 0.04549684002995491, "epoch": 3.8433734939759034, "grad_norm": 0.4044184982776642, "learning_rate": 1.4408245571903066e-06, "loss": 0.08932945877313614, "mean_token_accuracy": 0.9926709532737732, "num_tokens": 25975077.0, "step": 161 }, { "aux_loss": 8.040953636169434, "entropy": 0.04158872179687023, "epoch": 3.8674698795180724, "grad_norm": 0.4143630564212799, "learning_rate": 1.4407023375664644e-06, "loss": 0.08703690767288208, "mean_token_accuracy": 0.993314117193222, "num_tokens": 26133481.0, "step": 162 }, { "aux_loss": 8.042658805847168, "entropy": 0.04513395018875599, "epoch": 3.891566265060241, "grad_norm": 0.4163261651992798, "learning_rate": 1.440579319891596e-06, "loss": 0.08887109160423279, "mean_token_accuracy": 0.9932331144809723, "num_tokens": 26285677.0, "step": 163 }, { "aux_loss": 8.044297218322754, "entropy": 0.03768927603960037, "epoch": 3.9156626506024095, "grad_norm": 0.3762443959712982, "learning_rate": 1.440455504443656e-06, "loss": 0.08547879010438919, "mean_token_accuracy": 0.9941076934337616, "num_tokens": 26456101.0, "step": 164 }, { "aux_loss": 8.040573596954346, "entropy": 0.040223028510808945, "epoch": 3.9397590361445785, "grad_norm": 0.44806984066963196, "learning_rate": 1.4403308915024023e-06, "loss": 0.08660810440778732, "mean_token_accuracy": 0.9934520721435547, "num_tokens": 26599076.0, "step": 165 }, { "aux_loss": 8.042471408843994, "entropy": 0.038684969767928123, "epoch": 3.963855421686747, "grad_norm": 0.40352219343185425, "learning_rate": 1.4402054813493942e-06, "loss": 0.08614273369312286, "mean_token_accuracy": 0.9937964081764221, "num_tokens": 26769500.0, "step": 166 }, { "aux_loss": 8.041973114013672, "entropy": 0.037965722382068634, "epoch": 3.9879518072289155, "grad_norm": 0.38133445382118225, "learning_rate": 1.4400792742679925e-06, "loss": 0.08504779636859894, "mean_token_accuracy": 0.9941068291664124, "num_tokens": 26942979.0, "step": 167 }, { "aux_loss": 8.039653778076172, "entropy": 0.046194545924663544, "epoch": 4.0, "grad_norm": 0.5609819889068604, "learning_rate": 1.439952270543359e-06, "loss": 0.053759872913360596, "mean_token_accuracy": 0.9936670064926147, "num_tokens": 26965852.0, "step": 168 }, { "aux_loss": 8.043168544769287, "entropy": 0.03969798795878887, "epoch": 4.024096385542169, "grad_norm": 0.5476467609405518, "learning_rate": 1.4398244704624548e-06, "loss": 0.08540086448192596, "mean_token_accuracy": 0.9945910573005676, "num_tokens": 27138361.0, "step": 169 }, { "aux_loss": 8.041584968566895, "entropy": 0.037986068055033684, "epoch": 4.048192771084337, "grad_norm": 0.3398607075214386, "learning_rate": 1.4396958743140407e-06, "loss": 0.08402132987976074, "mean_token_accuracy": 0.9951412975788116, "num_tokens": 27298070.0, "step": 170 }, { "aux_loss": 8.041838645935059, "entropy": 0.03689403831958771, "epoch": 4.072289156626506, "grad_norm": 0.3282793462276459, "learning_rate": 1.4395664823886764e-06, "loss": 0.08331362903118134, "mean_token_accuracy": 0.9951364398002625, "num_tokens": 27477493.0, "step": 171 }, { "aux_loss": 8.042462825775146, "entropy": 0.04227207601070404, "epoch": 4.096385542168675, "grad_norm": 0.3614228367805481, "learning_rate": 1.4394362949787193e-06, "loss": 0.08635450899600983, "mean_token_accuracy": 0.9946377873420715, "num_tokens": 27650870.0, "step": 172 }, { "aux_loss": 8.040101051330566, "entropy": 0.039225177839398384, "epoch": 4.120481927710843, "grad_norm": 0.3621145486831665, "learning_rate": 1.4393053123783242e-06, "loss": 0.08554555475711823, "mean_token_accuracy": 0.9942145347595215, "num_tokens": 27809889.0, "step": 173 }, { "aux_loss": 8.042874336242676, "entropy": 0.04224075563251972, "epoch": 4.144578313253012, "grad_norm": 0.3778877854347229, "learning_rate": 1.439173534883443e-06, "loss": 0.08607605844736099, "mean_token_accuracy": 0.9945782423019409, "num_tokens": 27957420.0, "step": 174 }, { "aux_loss": 8.040241718292236, "entropy": 0.03377825953066349, "epoch": 4.168674698795181, "grad_norm": 0.34376251697540283, "learning_rate": 1.439040962791823e-06, "loss": 0.08279868215322495, "mean_token_accuracy": 0.9951018989086151, "num_tokens": 28127629.0, "step": 175 }, { "aux_loss": 8.042171955108643, "entropy": 0.03661440312862396, "epoch": 4.192771084337349, "grad_norm": 0.3872918486595154, "learning_rate": 1.4389075964030074e-06, "loss": 0.08358034491539001, "mean_token_accuracy": 0.9953621327877045, "num_tokens": 28293076.0, "step": 176 }, { "aux_loss": 8.040359020233154, "entropy": 0.035597002133727074, "epoch": 4.216867469879518, "grad_norm": 0.357154905796051, "learning_rate": 1.438773436018334e-06, "loss": 0.0828801617026329, "mean_token_accuracy": 0.9952186346054077, "num_tokens": 28453952.0, "step": 177 }, { "aux_loss": 8.042491912841797, "entropy": 0.04073164612054825, "epoch": 4.240963855421687, "grad_norm": 0.3982166349887848, "learning_rate": 1.438638481940934e-06, "loss": 0.08584737777709961, "mean_token_accuracy": 0.9942737519741058, "num_tokens": 28604320.0, "step": 178 }, { "aux_loss": 8.040094375610352, "entropy": 0.03856072202324867, "epoch": 4.265060240963855, "grad_norm": 0.3902375102043152, "learning_rate": 1.4385027344757331e-06, "loss": 0.08460918813943863, "mean_token_accuracy": 0.994719922542572, "num_tokens": 28756892.0, "step": 179 }, { "aux_loss": 8.040781497955322, "entropy": 0.035547565668821335, "epoch": 4.289156626506024, "grad_norm": 0.3302716016769409, "learning_rate": 1.438366193929449e-06, "loss": 0.0830703154206276, "mean_token_accuracy": 0.995084673166275, "num_tokens": 28930439.0, "step": 180 }, { "aux_loss": 8.039629459381104, "entropy": 0.04048551991581917, "epoch": 4.313253012048193, "grad_norm": 0.4318244457244873, "learning_rate": 1.4382288606105908e-06, "loss": 0.08579900115728378, "mean_token_accuracy": 0.9941352307796478, "num_tokens": 29092853.0, "step": 181 }, { "aux_loss": 8.040911674499512, "entropy": 0.03764263913035393, "epoch": 4.337349397590361, "grad_norm": 0.42847853899002075, "learning_rate": 1.4380907348294597e-06, "loss": 0.0839407742023468, "mean_token_accuracy": 0.9944304823875427, "num_tokens": 29226583.0, "step": 182 }, { "aux_loss": 8.039612770080566, "entropy": 0.03596244379878044, "epoch": 4.36144578313253, "grad_norm": 0.36768803000450134, "learning_rate": 1.4379518168981469e-06, "loss": 0.08371734619140625, "mean_token_accuracy": 0.9946404695510864, "num_tokens": 29381987.0, "step": 183 }, { "aux_loss": 8.040324211120605, "entropy": 0.038307564333081245, "epoch": 4.385542168674699, "grad_norm": 0.38769692182540894, "learning_rate": 1.437812107130534e-06, "loss": 0.08458788692951202, "mean_token_accuracy": 0.9944848418235779, "num_tokens": 29540073.0, "step": 184 }, { "aux_loss": 8.040425777435303, "entropy": 0.03475116938352585, "epoch": 4.409638554216867, "grad_norm": 0.3598844110965729, "learning_rate": 1.437671605842291e-06, "loss": 0.083564393222332, "mean_token_accuracy": 0.9947148263454437, "num_tokens": 29701935.0, "step": 185 }, { "aux_loss": 8.041619300842285, "entropy": 0.037232447415590286, "epoch": 4.433734939759036, "grad_norm": 0.4138000011444092, "learning_rate": 1.4375303133508774e-06, "loss": 0.08460228890180588, "mean_token_accuracy": 0.9941424429416656, "num_tokens": 29843884.0, "step": 186 }, { "aux_loss": 8.04134750366211, "entropy": 0.036806127056479454, "epoch": 4.457831325301205, "grad_norm": 0.4106656610965729, "learning_rate": 1.437388229975539e-06, "loss": 0.08441147208213806, "mean_token_accuracy": 0.9946633577346802, "num_tokens": 29987812.0, "step": 187 }, { "aux_loss": 8.039554119110107, "entropy": 0.03547658585011959, "epoch": 4.481927710843373, "grad_norm": 0.3592974841594696, "learning_rate": 1.4372453560373097e-06, "loss": 0.0837140679359436, "mean_token_accuracy": 0.9946017563343048, "num_tokens": 30149270.0, "step": 188 }, { "aux_loss": 8.041821479797363, "entropy": 0.035800814628601074, "epoch": 4.506024096385542, "grad_norm": 0.36003249883651733, "learning_rate": 1.437101691859009e-06, "loss": 0.08376017212867737, "mean_token_accuracy": 0.9945588111877441, "num_tokens": 30307956.0, "step": 189 }, { "aux_loss": 8.042970180511475, "entropy": 0.040934668853878975, "epoch": 4.530120481927711, "grad_norm": 0.42162829637527466, "learning_rate": 1.4369572377652423e-06, "loss": 0.08601701259613037, "mean_token_accuracy": 0.9943284690380096, "num_tokens": 30494893.0, "step": 190 }, { "aux_loss": 8.041118144989014, "entropy": 0.03687039390206337, "epoch": 4.554216867469879, "grad_norm": 0.370378315448761, "learning_rate": 1.4368119940823998e-06, "loss": 0.08406563103199005, "mean_token_accuracy": 0.9943959414958954, "num_tokens": 30672420.0, "step": 191 }, { "aux_loss": 8.040582656860352, "entropy": 0.03540595434606075, "epoch": 4.578313253012048, "grad_norm": 0.38017594814300537, "learning_rate": 1.4366659611386557e-06, "loss": 0.08305495977401733, "mean_token_accuracy": 0.9947693049907684, "num_tokens": 30847054.0, "step": 192 }, { "aux_loss": 8.042843341827393, "entropy": 0.04187178239226341, "epoch": 4.602409638554217, "grad_norm": 0.3843596577644348, "learning_rate": 1.436519139263967e-06, "loss": 0.08659607917070389, "mean_token_accuracy": 0.9939823746681213, "num_tokens": 31000786.0, "step": 193 }, { "aux_loss": 8.041165351867676, "entropy": 0.034371569752693176, "epoch": 4.626506024096385, "grad_norm": 0.37609967589378357, "learning_rate": 1.4363715287900742e-06, "loss": 0.08291493356227875, "mean_token_accuracy": 0.9949217736721039, "num_tokens": 31180147.0, "step": 194 }, { "aux_loss": 8.040238380432129, "entropy": 0.03516504354774952, "epoch": 4.650602409638554, "grad_norm": 0.3637091815471649, "learning_rate": 1.4362231300504988e-06, "loss": 0.08338074386119843, "mean_token_accuracy": 0.9948630630970001, "num_tokens": 31343986.0, "step": 195 }, { "aux_loss": 8.041361808776855, "entropy": 0.04160070978105068, "epoch": 4.674698795180722, "grad_norm": 0.4149928390979767, "learning_rate": 1.4360739433805439e-06, "loss": 0.08658482134342194, "mean_token_accuracy": 0.9941949248313904, "num_tokens": 31512880.0, "step": 196 }, { "aux_loss": 8.040586948394775, "entropy": 0.04432631470263004, "epoch": 4.698795180722891, "grad_norm": 0.40140870213508606, "learning_rate": 1.4359239691172926e-06, "loss": 0.08757840096950531, "mean_token_accuracy": 0.9936575889587402, "num_tokens": 31661985.0, "step": 197 }, { "aux_loss": 8.040112018585205, "entropy": 0.037308650091290474, "epoch": 4.72289156626506, "grad_norm": 0.39514875411987305, "learning_rate": 1.4357732075996076e-06, "loss": 0.08466262370347977, "mean_token_accuracy": 0.9945145845413208, "num_tokens": 31842845.0, "step": 198 }, { "aux_loss": 8.041626930236816, "entropy": 0.04097534902393818, "epoch": 4.746987951807229, "grad_norm": 0.405231237411499, "learning_rate": 1.4356216591681305e-06, "loss": 0.08651918172836304, "mean_token_accuracy": 0.9938961267471313, "num_tokens": 31994483.0, "step": 199 }, { "aux_loss": 8.038835525512695, "entropy": 0.03753245994448662, "epoch": 4.771084337349397, "grad_norm": 0.3914196789264679, "learning_rate": 1.4354693241652809e-06, "loss": 0.08507226407527924, "mean_token_accuracy": 0.9937683045864105, "num_tokens": 32153186.0, "step": 200 }, { "aux_loss": 8.039247989654541, "entropy": 0.037701187655329704, "epoch": 4.795180722891566, "grad_norm": 0.3929915130138397, "learning_rate": 1.4353162029352554e-06, "loss": 0.0845346599817276, "mean_token_accuracy": 0.9943271279335022, "num_tokens": 32309805.0, "step": 201 }, { "aux_loss": 8.04191780090332, "entropy": 0.04091975465416908, "epoch": 4.8192771084337345, "grad_norm": 0.4561111032962799, "learning_rate": 1.4351622958240273e-06, "loss": 0.08624639362096786, "mean_token_accuracy": 0.9937124252319336, "num_tokens": 32483341.0, "step": 202 }, { "aux_loss": 8.04048204421997, "entropy": 0.034330458380281925, "epoch": 4.843373493975903, "grad_norm": 0.367446631193161, "learning_rate": 1.4350076031793456e-06, "loss": 0.08318167924880981, "mean_token_accuracy": 0.9946629703044891, "num_tokens": 32647509.0, "step": 203 }, { "aux_loss": 8.04125452041626, "entropy": 0.03692132607102394, "epoch": 4.867469879518072, "grad_norm": 0.403191477060318, "learning_rate": 1.4348521253507344e-06, "loss": 0.08472205698490143, "mean_token_accuracy": 0.9941362142562866, "num_tokens": 32839256.0, "step": 204 }, { "aux_loss": 8.039531230926514, "entropy": 0.038704318925738335, "epoch": 4.891566265060241, "grad_norm": 0.39772483706474304, "learning_rate": 1.434695862689491e-06, "loss": 0.08526815474033356, "mean_token_accuracy": 0.9942019283771515, "num_tokens": 33003150.0, "step": 205 }, { "aux_loss": 8.040374755859375, "entropy": 0.03595581278204918, "epoch": 4.9156626506024095, "grad_norm": 0.4022948741912842, "learning_rate": 1.4345388155486866e-06, "loss": 0.08391736447811127, "mean_token_accuracy": 0.9942536056041718, "num_tokens": 33179546.0, "step": 206 }, { "aux_loss": 8.039075374603271, "entropy": 0.03800219111144543, "epoch": 4.9397590361445785, "grad_norm": 0.380649209022522, "learning_rate": 1.4343809842831657e-06, "loss": 0.08527541905641556, "mean_token_accuracy": 0.9943437278270721, "num_tokens": 33351836.0, "step": 207 }, { "aux_loss": 8.043510913848877, "entropy": 0.04215468093752861, "epoch": 4.9638554216867465, "grad_norm": 0.41969671845436096, "learning_rate": 1.4342223692495428e-06, "loss": 0.08674986660480499, "mean_token_accuracy": 0.9934200346469879, "num_tokens": 33505025.0, "step": 208 }, { "aux_loss": 8.039401054382324, "entropy": 0.03880974091589451, "epoch": 4.9879518072289155, "grad_norm": 0.37678730487823486, "learning_rate": 1.4340629708062048e-06, "loss": 0.08524405211210251, "mean_token_accuracy": 0.9945527911186218, "num_tokens": 33660485.0, "step": 209 }, { "aux_loss": 8.04077434539795, "entropy": 0.03518826887011528, "epoch": 5.0, "grad_norm": 0.48134711384773254, "learning_rate": 1.433902789313308e-06, "loss": 0.050809722393751144, "mean_token_accuracy": 0.9939299821853638, "num_tokens": 33707315.0, "step": 210 }, { "aux_loss": 8.039217472076416, "entropy": 0.03736879117786884, "epoch": 5.024096385542169, "grad_norm": 0.3484879732131958, "learning_rate": 1.433741825132778e-06, "loss": 0.08324334025382996, "mean_token_accuracy": 0.9955032467842102, "num_tokens": 33863394.0, "step": 211 }, { "aux_loss": 8.038911819458008, "entropy": 0.03610601648688316, "epoch": 5.048192771084337, "grad_norm": 0.3639015555381775, "learning_rate": 1.4335800786283092e-06, "loss": 0.08297591656446457, "mean_token_accuracy": 0.9954032003879547, "num_tokens": 34014983.0, "step": 212 }, { "aux_loss": 8.038973808288574, "entropy": 0.0321112684905529, "epoch": 5.072289156626506, "grad_norm": 0.3035561144351959, "learning_rate": 1.433417550165363e-06, "loss": 0.080979123711586, "mean_token_accuracy": 0.9960999488830566, "num_tokens": 34202386.0, "step": 213 }, { "aux_loss": 8.037017822265625, "entropy": 0.03347293473780155, "epoch": 5.096385542168675, "grad_norm": 0.32014161348342896, "learning_rate": 1.4332542401111685e-06, "loss": 0.0811787024140358, "mean_token_accuracy": 0.9961134791374207, "num_tokens": 34369320.0, "step": 214 }, { "aux_loss": 8.04166555404663, "entropy": 0.03581018000841141, "epoch": 5.120481927710843, "grad_norm": 0.3393751084804535, "learning_rate": 1.43309014883472e-06, "loss": 0.0826868787407875, "mean_token_accuracy": 0.9955731332302094, "num_tokens": 34545517.0, "step": 215 }, { "aux_loss": 8.0395827293396, "entropy": 0.03482176177203655, "epoch": 5.144578313253012, "grad_norm": 0.37512803077697754, "learning_rate": 1.4329252767067773e-06, "loss": 0.08189767599105835, "mean_token_accuracy": 0.995861828327179, "num_tokens": 34730633.0, "step": 216 }, { "aux_loss": 8.040324211120605, "entropy": 0.03882727213203907, "epoch": 5.168674698795181, "grad_norm": 0.34391677379608154, "learning_rate": 1.4327596240998645e-06, "loss": 0.08408463001251221, "mean_token_accuracy": 0.9951691627502441, "num_tokens": 34897938.0, "step": 217 }, { "aux_loss": 8.038958549499512, "entropy": 0.03700985945761204, "epoch": 5.192771084337349, "grad_norm": 0.3792520761489868, "learning_rate": 1.4325931913882691e-06, "loss": 0.08347566425800323, "mean_token_accuracy": 0.9954339861869812, "num_tokens": 35042500.0, "step": 218 }, { "aux_loss": 8.039316177368164, "entropy": 0.04214794747531414, "epoch": 5.216867469879518, "grad_norm": 0.38034358620643616, "learning_rate": 1.4324259789480415e-06, "loss": 0.08621414750814438, "mean_token_accuracy": 0.9948817193508148, "num_tokens": 35199253.0, "step": 219 }, { "aux_loss": 8.040565967559814, "entropy": 0.03364016301929951, "epoch": 5.240963855421687, "grad_norm": 0.33803656697273254, "learning_rate": 1.4322579871569933e-06, "loss": 0.08156892657279968, "mean_token_accuracy": 0.9959030747413635, "num_tokens": 35368834.0, "step": 220 }, { "aux_loss": 8.038960933685303, "entropy": 0.033280991949141026, "epoch": 5.265060240963855, "grad_norm": 0.3262208104133606, "learning_rate": 1.4320892163946975e-06, "loss": 0.08120635151863098, "mean_token_accuracy": 0.9958637356758118, "num_tokens": 35535515.0, "step": 221 }, { "aux_loss": 8.038169860839844, "entropy": 0.031326593831181526, "epoch": 5.289156626506024, "grad_norm": 0.342752069234848, "learning_rate": 1.431919667042487e-06, "loss": 0.07946254312992096, "mean_token_accuracy": 0.9960636794567108, "num_tokens": 35700534.0, "step": 222 }, { "aux_loss": 8.039755821228027, "entropy": 0.034905584529042244, "epoch": 5.313253012048193, "grad_norm": 0.3462710678577423, "learning_rate": 1.431749339483454e-06, "loss": 0.08242812752723694, "mean_token_accuracy": 0.9953078627586365, "num_tokens": 35880129.0, "step": 223 }, { "aux_loss": 8.03895616531372, "entropy": 0.037569453939795494, "epoch": 5.337349397590361, "grad_norm": 0.3580102026462555, "learning_rate": 1.4315782341024486e-06, "loss": 0.08401724696159363, "mean_token_accuracy": 0.9949289560317993, "num_tokens": 36049636.0, "step": 224 }, { "aux_loss": 8.035909175872803, "entropy": 0.03622467443346977, "epoch": 5.36144578313253, "grad_norm": 0.3741055727005005, "learning_rate": 1.4314063512860793e-06, "loss": 0.08327938616275787, "mean_token_accuracy": 0.994949609041214, "num_tokens": 36198666.0, "step": 225 }, { "aux_loss": 8.03954553604126, "entropy": 0.03737705014646053, "epoch": 5.385542168674699, "grad_norm": 0.3866511583328247, "learning_rate": 1.4312336914227104e-06, "loss": 0.0833113044500351, "mean_token_accuracy": 0.9953556656837463, "num_tokens": 36338753.0, "step": 226 }, { "aux_loss": 8.040770053863525, "entropy": 0.03640630468726158, "epoch": 5.409638554216867, "grad_norm": 0.37529176473617554, "learning_rate": 1.4310602549024621e-06, "loss": 0.0830492153763771, "mean_token_accuracy": 0.9955044686794281, "num_tokens": 36498867.0, "step": 227 }, { "aux_loss": 8.038099765777588, "entropy": 0.03481042757630348, "epoch": 5.433734939759036, "grad_norm": 0.3607235252857208, "learning_rate": 1.4308860421172094e-06, "loss": 0.08244866877794266, "mean_token_accuracy": 0.995325118303299, "num_tokens": 36682484.0, "step": 228 }, { "aux_loss": 8.03747844696045, "entropy": 0.036855777725577354, "epoch": 5.457831325301205, "grad_norm": 0.5099928379058838, "learning_rate": 1.4307110534605815e-06, "loss": 0.08275534957647324, "mean_token_accuracy": 0.9952235817909241, "num_tokens": 36839247.0, "step": 229 }, { "aux_loss": 8.039116859436035, "entropy": 0.044368937611579895, "epoch": 5.481927710843373, "grad_norm": 0.39856716990470886, "learning_rate": 1.4305352893279603e-06, "loss": 0.08694414794445038, "mean_token_accuracy": 0.9942440986633301, "num_tokens": 36984989.0, "step": 230 }, { "aux_loss": 8.04021692276001, "entropy": 0.03966960869729519, "epoch": 5.506024096385542, "grad_norm": 0.3691135048866272, "learning_rate": 1.4303587501164801e-06, "loss": 0.08465172350406647, "mean_token_accuracy": 0.9948685467243195, "num_tokens": 37136734.0, "step": 231 }, { "aux_loss": 8.038138389587402, "entropy": 0.03791094198822975, "epoch": 5.530120481927711, "grad_norm": 0.37443944811820984, "learning_rate": 1.4301814362250267e-06, "loss": 0.08411930501461029, "mean_token_accuracy": 0.9945204854011536, "num_tokens": 37306594.0, "step": 232 }, { "aux_loss": 8.04017972946167, "entropy": 0.03802665323019028, "epoch": 5.554216867469879, "grad_norm": 0.40194767713546753, "learning_rate": 1.4300033480542355e-06, "loss": 0.08439681679010391, "mean_token_accuracy": 0.9948781728744507, "num_tokens": 37482014.0, "step": 233 }, { "aux_loss": 8.037278175354004, "entropy": 0.0383224431425333, "epoch": 5.578313253012048, "grad_norm": 0.4007725715637207, "learning_rate": 1.4298244860064922e-06, "loss": 0.08417156338691711, "mean_token_accuracy": 0.9947126507759094, "num_tokens": 37655390.0, "step": 234 }, { "aux_loss": 8.038545608520508, "entropy": 0.03560042753815651, "epoch": 5.602409638554217, "grad_norm": 0.4014568030834198, "learning_rate": 1.4296448504859306e-06, "loss": 0.08304604887962341, "mean_token_accuracy": 0.9949043989181519, "num_tokens": 37807861.0, "step": 235 }, { "aux_loss": 8.039902210235596, "entropy": 0.03399462066590786, "epoch": 5.626506024096385, "grad_norm": 0.353241890668869, "learning_rate": 1.4294644418984323e-06, "loss": 0.08209338784217834, "mean_token_accuracy": 0.9952429831027985, "num_tokens": 37993700.0, "step": 236 }, { "aux_loss": 8.039174556732178, "entropy": 0.033101960085332394, "epoch": 5.650602409638554, "grad_norm": 0.3676363229751587, "learning_rate": 1.4292832606516255e-06, "loss": 0.08126258105039597, "mean_token_accuracy": 0.9955662786960602, "num_tokens": 38168498.0, "step": 237 }, { "aux_loss": 8.038545608520508, "entropy": 0.035288846120238304, "epoch": 5.674698795180722, "grad_norm": 0.36642128229141235, "learning_rate": 1.4291013071548844e-06, "loss": 0.08272764086723328, "mean_token_accuracy": 0.9954147934913635, "num_tokens": 38340718.0, "step": 238 }, { "aux_loss": 8.038650035858154, "entropy": 0.03259859047830105, "epoch": 5.698795180722891, "grad_norm": 0.37624770402908325, "learning_rate": 1.428918581819328e-06, "loss": 0.08136217296123505, "mean_token_accuracy": 0.9960896074771881, "num_tokens": 38491373.0, "step": 239 }, { "aux_loss": 8.038266658782959, "entropy": 0.04310726746916771, "epoch": 5.72289156626506, "grad_norm": 0.43467146158218384, "learning_rate": 1.4287350850578186e-06, "loss": 0.08748319000005722, "mean_token_accuracy": 0.9937043190002441, "num_tokens": 38639028.0, "step": 240 }, { "aux_loss": 8.039052963256836, "entropy": 0.038960253819823265, "epoch": 5.746987951807229, "grad_norm": 0.40311357378959656, "learning_rate": 1.4285508172849628e-06, "loss": 0.08427684009075165, "mean_token_accuracy": 0.9949110746383667, "num_tokens": 38800330.0, "step": 241 }, { "aux_loss": 8.038615703582764, "entropy": 0.038292521610856056, "epoch": 5.771084337349397, "grad_norm": 0.37565159797668457, "learning_rate": 1.4283657789171085e-06, "loss": 0.08385735750198364, "mean_token_accuracy": 0.9953287243843079, "num_tokens": 38948505.0, "step": 242 }, { "aux_loss": 8.039562702178955, "entropy": 0.03734001237899065, "epoch": 5.795180722891566, "grad_norm": 0.49312564730644226, "learning_rate": 1.4281799703723446e-06, "loss": 0.08247716724872589, "mean_token_accuracy": 0.9953389167785645, "num_tokens": 39093422.0, "step": 243 }, { "aux_loss": 8.038256645202637, "entropy": 0.03265094570815563, "epoch": 5.8192771084337345, "grad_norm": 0.3904739022254944, "learning_rate": 1.4279933920705006e-06, "loss": 0.08162276446819305, "mean_token_accuracy": 0.9952907860279083, "num_tokens": 39267459.0, "step": 244 }, { "aux_loss": 8.037330627441406, "entropy": 0.03682544641196728, "epoch": 5.843373493975903, "grad_norm": 0.397100031375885, "learning_rate": 1.4278060444331451e-06, "loss": 0.08333480358123779, "mean_token_accuracy": 0.9949441850185394, "num_tokens": 39422907.0, "step": 245 }, { "aux_loss": 8.038883686065674, "entropy": 0.04045848548412323, "epoch": 5.867469879518072, "grad_norm": 0.4215233623981476, "learning_rate": 1.4276179278835848e-06, "loss": 0.08535461127758026, "mean_token_accuracy": 0.9943825006484985, "num_tokens": 39579636.0, "step": 246 }, { "aux_loss": 8.039095878601074, "entropy": 0.033118318766355515, "epoch": 5.891566265060241, "grad_norm": 0.3765990138053894, "learning_rate": 1.427429042846864e-06, "loss": 0.08269308507442474, "mean_token_accuracy": 0.9951244592666626, "num_tokens": 39753106.0, "step": 247 }, { "aux_loss": 8.037528038024902, "entropy": 0.03207779489457607, "epoch": 5.9156626506024095, "grad_norm": 0.3518119156360626, "learning_rate": 1.4272393897497632e-06, "loss": 0.08054585009813309, "mean_token_accuracy": 0.9962049722671509, "num_tokens": 39912952.0, "step": 248 }, { "aux_loss": 8.037781715393066, "entropy": 0.035104215145111084, "epoch": 5.9397590361445785, "grad_norm": 0.3629360795021057, "learning_rate": 1.4270489690207984e-06, "loss": 0.0826537013053894, "mean_token_accuracy": 0.9953400492668152, "num_tokens": 40083911.0, "step": 249 }, { "aux_loss": 8.03683614730835, "entropy": 0.034510133787989616, "epoch": 5.9638554216867465, "grad_norm": 0.37607911229133606, "learning_rate": 1.4268577810902201e-06, "loss": 0.08266992121934891, "mean_token_accuracy": 0.9955215454101562, "num_tokens": 40245447.0, "step": 250 }, { "aux_loss": 8.036605834960938, "entropy": 0.03547329269349575, "epoch": 5.9879518072289155, "grad_norm": 0.3630676567554474, "learning_rate": 1.4266658263900122e-06, "loss": 0.08295561373233795, "mean_token_accuracy": 0.995036780834198, "num_tokens": 40406226.0, "step": 251 }, { "aux_loss": 8.03968620300293, "entropy": 0.04327882453799248, "epoch": 6.0, "grad_norm": 0.5565012693405151, "learning_rate": 1.426473105353891e-06, "loss": 0.05327405780553818, "mean_token_accuracy": 0.9942361116409302, "num_tokens": 40448778.0, "step": 252 }, { "aux_loss": 8.037991523742676, "entropy": 0.03559446148574352, "epoch": 6.024096385542169, "grad_norm": 0.360224187374115, "learning_rate": 1.4262796184173047e-06, "loss": 0.08191978931427002, "mean_token_accuracy": 0.9960768818855286, "num_tokens": 40621399.0, "step": 253 }, { "aux_loss": 8.036860942840576, "entropy": 0.03401390090584755, "epoch": 6.048192771084337, "grad_norm": 0.337534099817276, "learning_rate": 1.4260853660174314e-06, "loss": 0.08101242035627365, "mean_token_accuracy": 0.9961624443531036, "num_tokens": 40775180.0, "step": 254 }, { "aux_loss": 8.03651237487793, "entropy": 0.03811703994870186, "epoch": 6.072289156626506, "grad_norm": 0.3574149012565613, "learning_rate": 1.4258903485931792e-06, "loss": 0.08330834656953812, "mean_token_accuracy": 0.9954338371753693, "num_tokens": 40924568.0, "step": 255 }, { "aux_loss": 8.036168575286865, "entropy": 0.03353409469127655, "epoch": 6.096385542168675, "grad_norm": 0.3296172618865967, "learning_rate": 1.4256945665851847e-06, "loss": 0.08137848973274231, "mean_token_accuracy": 0.9961557686328888, "num_tokens": 41090965.0, "step": 256 }, { "aux_loss": 8.037352561950684, "entropy": 0.032407025806605816, "epoch": 6.120481927710843, "grad_norm": 0.3700825870037079, "learning_rate": 1.425498020435812e-06, "loss": 0.08028987050056458, "mean_token_accuracy": 0.9963049590587616, "num_tokens": 41260686.0, "step": 257 }, { "aux_loss": 8.037732124328613, "entropy": 0.03817327693104744, "epoch": 6.144578313253012, "grad_norm": 0.4077751934528351, "learning_rate": 1.4253007105891516e-06, "loss": 0.08337738364934921, "mean_token_accuracy": 0.9955407381057739, "num_tokens": 41389101.0, "step": 258 }, { "aux_loss": 8.03888988494873, "entropy": 0.033729828894138336, "epoch": 6.168674698795181, "grad_norm": 0.36580121517181396, "learning_rate": 1.4251026374910198e-06, "loss": 0.08104156702756882, "mean_token_accuracy": 0.9964797794818878, "num_tokens": 41559499.0, "step": 259 }, { "aux_loss": 8.036795616149902, "entropy": 0.03791739046573639, "epoch": 6.192771084337349, "grad_norm": 0.37497496604919434, "learning_rate": 1.4249038015889575e-06, "loss": 0.08325420320034027, "mean_token_accuracy": 0.9954448640346527, "num_tokens": 41705274.0, "step": 260 }, { "aux_loss": 8.037520408630371, "entropy": 0.03363081254065037, "epoch": 6.216867469879518, "grad_norm": 0.3485323488712311, "learning_rate": 1.4247042033322288e-06, "loss": 0.08111946284770966, "mean_token_accuracy": 0.9960795640945435, "num_tokens": 41861920.0, "step": 261 }, { "aux_loss": 8.037950038909912, "entropy": 0.032483769580721855, "epoch": 6.240963855421687, "grad_norm": 0.32457178831100464, "learning_rate": 1.4245038431718204e-06, "loss": 0.07976509630680084, "mean_token_accuracy": 0.9964925646781921, "num_tokens": 42030201.0, "step": 262 }, { "aux_loss": 8.037893772125244, "entropy": 0.04124067164957523, "epoch": 6.265060240963855, "grad_norm": 0.4116523563861847, "learning_rate": 1.424302721560441e-06, "loss": 0.0846301019191742, "mean_token_accuracy": 0.9952834844589233, "num_tokens": 42177436.0, "step": 263 }, { "aux_loss": 8.037344932556152, "entropy": 0.03193550743162632, "epoch": 6.289156626506024, "grad_norm": 0.34990963339805603, "learning_rate": 1.424100838952519e-06, "loss": 0.08070550858974457, "mean_token_accuracy": 0.9957850873470306, "num_tokens": 42351445.0, "step": 264 }, { "aux_loss": 8.036174774169922, "entropy": 0.03807485289871693, "epoch": 6.313253012048193, "grad_norm": 0.39334771037101746, "learning_rate": 1.4238981958042027e-06, "loss": 0.0833045095205307, "mean_token_accuracy": 0.9958217740058899, "num_tokens": 42498981.0, "step": 265 }, { "aux_loss": 8.03799819946289, "entropy": 0.036790693178772926, "epoch": 6.337349397590361, "grad_norm": 0.36928167939186096, "learning_rate": 1.423694792573359e-06, "loss": 0.08284773677587509, "mean_token_accuracy": 0.9955715537071228, "num_tokens": 42691804.0, "step": 266 }, { "aux_loss": 8.036050796508789, "entropy": 0.03653477132320404, "epoch": 6.36144578313253, "grad_norm": 0.38227298855781555, "learning_rate": 1.4234906297195716e-06, "loss": 0.08240111172199249, "mean_token_accuracy": 0.9956892132759094, "num_tokens": 42839877.0, "step": 267 }, { "aux_loss": 8.036399364471436, "entropy": 0.03486090246587992, "epoch": 6.385542168674699, "grad_norm": 0.35526585578918457, "learning_rate": 1.4232857077041412e-06, "loss": 0.08210219442844391, "mean_token_accuracy": 0.9954483807086945, "num_tokens": 42997903.0, "step": 268 }, { "aux_loss": 8.03887128829956, "entropy": 0.031132452189922333, "epoch": 6.409638554216867, "grad_norm": 0.32824158668518066, "learning_rate": 1.4230800269900832e-06, "loss": 0.08031217753887177, "mean_token_accuracy": 0.9960026741027832, "num_tokens": 43184524.0, "step": 269 }, { "aux_loss": 8.037085056304932, "entropy": 0.03395012393593788, "epoch": 6.433734939759036, "grad_norm": 0.39305827021598816, "learning_rate": 1.422873588042128e-06, "loss": 0.0817105770111084, "mean_token_accuracy": 0.9954641461372375, "num_tokens": 43352033.0, "step": 270 }, { "aux_loss": 8.03740119934082, "entropy": 0.033392174169421196, "epoch": 6.457831325301205, "grad_norm": 0.341763436794281, "learning_rate": 1.422666391326718e-06, "loss": 0.08093781024217606, "mean_token_accuracy": 0.9962793290615082, "num_tokens": 43528223.0, "step": 271 }, { "aux_loss": 8.035551071166992, "entropy": 0.03841528482735157, "epoch": 6.481927710843373, "grad_norm": 0.40078938007354736, "learning_rate": 1.4224584373120093e-06, "loss": 0.08335836231708527, "mean_token_accuracy": 0.9956542551517487, "num_tokens": 43672878.0, "step": 272 }, { "aux_loss": 8.036177158355713, "entropy": 0.03540636785328388, "epoch": 6.506024096385542, "grad_norm": 0.37283870577812195, "learning_rate": 1.4222497264678678e-06, "loss": 0.08214269578456879, "mean_token_accuracy": 0.9954660832881927, "num_tokens": 43815578.0, "step": 273 }, { "aux_loss": 8.034242630004883, "entropy": 0.03531269542872906, "epoch": 6.530120481927711, "grad_norm": 0.38215646147727966, "learning_rate": 1.4220402592658704e-06, "loss": 0.08176004141569138, "mean_token_accuracy": 0.996109277009964, "num_tokens": 43962507.0, "step": 274 }, { "aux_loss": 8.03614330291748, "entropy": 0.03466031700372696, "epoch": 6.554216867469879, "grad_norm": 0.3749046325683594, "learning_rate": 1.421830036179302e-06, "loss": 0.08171263337135315, "mean_token_accuracy": 0.9958585798740387, "num_tokens": 44131399.0, "step": 275 }, { "aux_loss": 8.037889957427979, "entropy": 0.03461333829909563, "epoch": 6.578313253012048, "grad_norm": 0.34714046120643616, "learning_rate": 1.4216190576831563e-06, "loss": 0.081275574862957, "mean_token_accuracy": 0.9961965978145599, "num_tokens": 44286358.0, "step": 276 }, { "aux_loss": 8.03689432144165, "entropy": 0.034249075688421726, "epoch": 6.602409638554217, "grad_norm": 0.32196035981178284, "learning_rate": 1.4214073242541331e-06, "loss": 0.08108819276094437, "mean_token_accuracy": 0.9961409270763397, "num_tokens": 44456280.0, "step": 277 }, { "aux_loss": 8.039196014404297, "entropy": 0.03051491640508175, "epoch": 6.626506024096385, "grad_norm": 0.3290470838546753, "learning_rate": 1.421194836370639e-06, "loss": 0.08000116050243378, "mean_token_accuracy": 0.996231198310852, "num_tokens": 44651684.0, "step": 278 }, { "aux_loss": 8.033888816833496, "entropy": 0.03408683463931084, "epoch": 6.650602409638554, "grad_norm": 0.3726556599140167, "learning_rate": 1.4209815945127836e-06, "loss": 0.08141613751649857, "mean_token_accuracy": 0.9959953725337982, "num_tokens": 44794109.0, "step": 279 }, { "aux_loss": 8.035766124725342, "entropy": 0.028662268072366714, "epoch": 6.674698795180722, "grad_norm": 0.34546366333961487, "learning_rate": 1.4207675991623816e-06, "loss": 0.07919106632471085, "mean_token_accuracy": 0.9962852001190186, "num_tokens": 44967068.0, "step": 280 }, { "aux_loss": 8.036411762237549, "entropy": 0.03132207505404949, "epoch": 6.698795180722891, "grad_norm": 0.3478906750679016, "learning_rate": 1.4205528508029496e-06, "loss": 0.07999314367771149, "mean_token_accuracy": 0.9962101578712463, "num_tokens": 45141741.0, "step": 281 }, { "aux_loss": 8.03869342803955, "entropy": 0.03163009416311979, "epoch": 6.72289156626506, "grad_norm": 0.3555811941623688, "learning_rate": 1.4203373499197057e-06, "loss": 0.08022312819957733, "mean_token_accuracy": 0.9961192905902863, "num_tokens": 45317687.0, "step": 282 }, { "aux_loss": 8.036246299743652, "entropy": 0.029239365831017494, "epoch": 6.746987951807229, "grad_norm": 0.34071168303489685, "learning_rate": 1.4201210969995682e-06, "loss": 0.0793105736374855, "mean_token_accuracy": 0.9963167905807495, "num_tokens": 45504365.0, "step": 283 }, { "aux_loss": 8.03716516494751, "entropy": 0.03523336164653301, "epoch": 6.771084337349397, "grad_norm": 0.3549567461013794, "learning_rate": 1.4199040925311544e-06, "loss": 0.08193039894104004, "mean_token_accuracy": 0.9957601726055145, "num_tokens": 45690787.0, "step": 284 }, { "aux_loss": 8.036113262176514, "entropy": 0.03256150148808956, "epoch": 6.795180722891566, "grad_norm": 0.36457401514053345, "learning_rate": 1.4196863370047803e-06, "loss": 0.08117170631885529, "mean_token_accuracy": 0.9957631528377533, "num_tokens": 45850417.0, "step": 285 }, { "aux_loss": 8.035535335540771, "entropy": 0.03171788528561592, "epoch": 6.8192771084337345, "grad_norm": 0.351662278175354, "learning_rate": 1.4194678309124583e-06, "loss": 0.0804198831319809, "mean_token_accuracy": 0.9961467385292053, "num_tokens": 46013319.0, "step": 286 }, { "aux_loss": 8.033803462982178, "entropy": 0.035000565461814404, "epoch": 6.843373493975903, "grad_norm": 0.3920998275279999, "learning_rate": 1.4192485747478974e-06, "loss": 0.08269241452217102, "mean_token_accuracy": 0.9949135482311249, "num_tokens": 46188144.0, "step": 287 }, { "aux_loss": 8.03599739074707, "entropy": 0.03238750249147415, "epoch": 6.867469879518072, "grad_norm": 0.35797789692878723, "learning_rate": 1.4190285690065004e-06, "loss": 0.08076779544353485, "mean_token_accuracy": 0.9960897862911224, "num_tokens": 46341440.0, "step": 288 }, { "aux_loss": 8.035959243774414, "entropy": 0.03638170100748539, "epoch": 6.891566265060241, "grad_norm": 0.3702660799026489, "learning_rate": 1.4188078141853645e-06, "loss": 0.08285987377166748, "mean_token_accuracy": 0.9956148564815521, "num_tokens": 46502026.0, "step": 289 }, { "aux_loss": 8.034866333007812, "entropy": 0.034105464816093445, "epoch": 6.9156626506024095, "grad_norm": 0.3803676962852478, "learning_rate": 1.418586310783279e-06, "loss": 0.08216661214828491, "mean_token_accuracy": 0.9953741133213043, "num_tokens": 46670197.0, "step": 290 }, { "aux_loss": 8.038596153259277, "entropy": 0.03966710343956947, "epoch": 6.9397590361445785, "grad_norm": 0.3919319808483124, "learning_rate": 1.4183640593007253e-06, "loss": 0.08459129929542542, "mean_token_accuracy": 0.9947242140769958, "num_tokens": 46827184.0, "step": 291 }, { "aux_loss": 8.035058975219727, "entropy": 0.0370329562574625, "epoch": 6.9638554216867465, "grad_norm": 0.3695419132709503, "learning_rate": 1.418141060239874e-06, "loss": 0.08234144747257233, "mean_token_accuracy": 0.9958735704421997, "num_tokens": 46975123.0, "step": 292 }, { "aux_loss": 8.034956932067871, "entropy": 0.03599015064537525, "epoch": 6.9879518072289155, "grad_norm": 0.372112512588501, "learning_rate": 1.4179173141045854e-06, "loss": 0.08284641802310944, "mean_token_accuracy": 0.9954551458358765, "num_tokens": 47143463.0, "step": 293 }, { "aux_loss": 8.03744888305664, "entropy": 0.030542269349098206, "epoch": 7.0, "grad_norm": 0.47627538442611694, "learning_rate": 1.417692821400408e-06, "loss": 0.04683445766568184, "mean_token_accuracy": 0.995657205581665, "num_tokens": 47190241.0, "step": 294 }, { "aux_loss": 8.033048629760742, "entropy": 0.035450490191578865, "epoch": 7.024096385542169, "grad_norm": 0.34915679693222046, "learning_rate": 1.417467582634577e-06, "loss": 0.08114811033010483, "mean_token_accuracy": 0.9963439106941223, "num_tokens": 47348345.0, "step": 295 }, { "aux_loss": 8.034916877746582, "entropy": 0.03222184535115957, "epoch": 7.048192771084337, "grad_norm": 0.32226625084877014, "learning_rate": 1.417241598316013e-06, "loss": 0.07955966889858246, "mean_token_accuracy": 0.9968876838684082, "num_tokens": 47515241.0, "step": 296 }, { "aux_loss": 8.035215377807617, "entropy": 0.03598351962864399, "epoch": 7.072289156626506, "grad_norm": 0.34765782952308655, "learning_rate": 1.4170148689553215e-06, "loss": 0.08156674355268478, "mean_token_accuracy": 0.9967100620269775, "num_tokens": 47663653.0, "step": 297 }, { "aux_loss": 8.035448551177979, "entropy": 0.032758140936493874, "epoch": 7.096385542168675, "grad_norm": 0.338187038898468, "learning_rate": 1.4167873950647913e-06, "loss": 0.07984046638011932, "mean_token_accuracy": 0.9966485798358917, "num_tokens": 47828224.0, "step": 298 }, { "aux_loss": 8.03564167022705, "entropy": 0.0363839715719223, "epoch": 7.120481927710843, "grad_norm": 0.3636642396450043, "learning_rate": 1.4165591771583934e-06, "loss": 0.0818038135766983, "mean_token_accuracy": 0.9960289299488068, "num_tokens": 47965572.0, "step": 299 }, { "aux_loss": 8.037732124328613, "entropy": 0.03432103618979454, "epoch": 7.144578313253012, "grad_norm": 0.36236822605133057, "learning_rate": 1.41633021575178e-06, "loss": 0.08107459545135498, "mean_token_accuracy": 0.996305376291275, "num_tokens": 48137642.0, "step": 300 }, { "aux_loss": 8.036556720733643, "entropy": 0.03693149797618389, "epoch": 7.168674698795181, "grad_norm": 0.34610867500305176, "learning_rate": 1.416100511362283e-06, "loss": 0.0821981430053711, "mean_token_accuracy": 0.99636110663414, "num_tokens": 48324625.0, "step": 301 }, { "aux_loss": 8.034196376800537, "entropy": 0.029057555831968784, "epoch": 7.192771084337349, "grad_norm": 0.32378068566322327, "learning_rate": 1.4158700645089132e-06, "loss": 0.07781493663787842, "mean_token_accuracy": 0.9974943101406097, "num_tokens": 48469198.0, "step": 302 }, { "aux_loss": 8.036748886108398, "entropy": 0.03262832574546337, "epoch": 7.216867469879518, "grad_norm": 0.3372521996498108, "learning_rate": 1.415638875712359e-06, "loss": 0.08014824986457825, "mean_token_accuracy": 0.9964551031589508, "num_tokens": 48634260.0, "step": 303 }, { "aux_loss": 8.037166595458984, "entropy": 0.032166702672839165, "epoch": 7.240963855421687, "grad_norm": 0.34929683804512024, "learning_rate": 1.4154069454949852e-06, "loss": 0.08027002215385437, "mean_token_accuracy": 0.996328204870224, "num_tokens": 48804133.0, "step": 304 }, { "aux_loss": 8.03482961654663, "entropy": 0.03405679203569889, "epoch": 7.265060240963855, "grad_norm": 0.34674111008644104, "learning_rate": 1.415174274380832e-06, "loss": 0.08115323632955551, "mean_token_accuracy": 0.9964562058448792, "num_tokens": 48964195.0, "step": 305 }, { "aux_loss": 8.032870292663574, "entropy": 0.030429409816861153, "epoch": 7.289156626506024, "grad_norm": 0.3174818158149719, "learning_rate": 1.4149408628956132e-06, "loss": 0.07890744507312775, "mean_token_accuracy": 0.9967007339000702, "num_tokens": 49129035.0, "step": 306 }, { "aux_loss": 8.035819053649902, "entropy": 0.028406686149537563, "epoch": 7.313253012048193, "grad_norm": 0.3168235123157501, "learning_rate": 1.4147067115667155e-06, "loss": 0.07822935283184052, "mean_token_accuracy": 0.996906578540802, "num_tokens": 49300740.0, "step": 307 }, { "aux_loss": 8.03471565246582, "entropy": 0.03468763642013073, "epoch": 7.337349397590361, "grad_norm": 0.3807547092437744, "learning_rate": 1.4144718209231978e-06, "loss": 0.08181793242692947, "mean_token_accuracy": 0.9959447979927063, "num_tokens": 49446228.0, "step": 308 }, { "aux_loss": 8.035276889801025, "entropy": 0.03498452343046665, "epoch": 7.36144578313253, "grad_norm": 0.37493276596069336, "learning_rate": 1.4142361914957885e-06, "loss": 0.0809975117444992, "mean_token_accuracy": 0.9967085421085358, "num_tokens": 49620124.0, "step": 309 }, { "aux_loss": 8.03686237335205, "entropy": 0.03699825517833233, "epoch": 7.385542168674699, "grad_norm": 0.380402147769928, "learning_rate": 1.4139998238168866e-06, "loss": 0.08249437808990479, "mean_token_accuracy": 0.9959370195865631, "num_tokens": 49785119.0, "step": 310 }, { "aux_loss": 8.03669023513794, "entropy": 0.03257426247000694, "epoch": 7.409638554216867, "grad_norm": 0.3667578101158142, "learning_rate": 1.413762718420558e-06, "loss": 0.08071167767047882, "mean_token_accuracy": 0.9963789582252502, "num_tokens": 49952981.0, "step": 311 }, { "aux_loss": 8.034005641937256, "entropy": 0.02788942214101553, "epoch": 7.433734939759036, "grad_norm": 0.2974223494529724, "learning_rate": 1.4135248758425359e-06, "loss": 0.07806290686130524, "mean_token_accuracy": 0.99703049659729, "num_tokens": 50143595.0, "step": 312 }, { "aux_loss": 8.033695697784424, "entropy": 0.03359641693532467, "epoch": 7.457831325301205, "grad_norm": 0.3415364623069763, "learning_rate": 1.413286296620219e-06, "loss": 0.0807826817035675, "mean_token_accuracy": 0.9961223006248474, "num_tokens": 50297111.0, "step": 313 }, { "aux_loss": 8.034516334533691, "entropy": 0.03204282093793154, "epoch": 7.481927710843373, "grad_norm": 0.37344956398010254, "learning_rate": 1.4130469812926708e-06, "loss": 0.08044802397489548, "mean_token_accuracy": 0.9963233172893524, "num_tokens": 50448811.0, "step": 314 }, { "aux_loss": 8.033761978149414, "entropy": 0.031184443272650242, "epoch": 7.506024096385542, "grad_norm": 0.34687599539756775, "learning_rate": 1.4128069304006176e-06, "loss": 0.07920951396226883, "mean_token_accuracy": 0.9964482486248016, "num_tokens": 50609715.0, "step": 315 }, { "aux_loss": 8.034749031066895, "entropy": 0.029387577436864376, "epoch": 7.530120481927711, "grad_norm": 0.31832030415534973, "learning_rate": 1.4125661444864477e-06, "loss": 0.07884480059146881, "mean_token_accuracy": 0.9967005848884583, "num_tokens": 50772691.0, "step": 316 }, { "aux_loss": 8.03644847869873, "entropy": 0.03081085067242384, "epoch": 7.554216867469879, "grad_norm": 0.3318593204021454, "learning_rate": 1.4123246240942104e-06, "loss": 0.07955613732337952, "mean_token_accuracy": 0.996260017156601, "num_tokens": 50946461.0, "step": 317 }, { "aux_loss": 8.03480863571167, "entropy": 0.029540213756263256, "epoch": 7.578313253012048, "grad_norm": 0.3266274631023407, "learning_rate": 1.4120823697696144e-06, "loss": 0.07922594994306564, "mean_token_accuracy": 0.9967344701290131, "num_tokens": 51132312.0, "step": 318 }, { "aux_loss": 8.034060955047607, "entropy": 0.032534703612327576, "epoch": 7.602409638554217, "grad_norm": 0.35959550738334656, "learning_rate": 1.4118393820600268e-06, "loss": 0.08021605014801025, "mean_token_accuracy": 0.9963286817073822, "num_tokens": 51292228.0, "step": 319 }, { "aux_loss": 8.034628868103027, "entropy": 0.03200039733201265, "epoch": 7.626506024096385, "grad_norm": 0.3670026957988739, "learning_rate": 1.4115956615144717e-06, "loss": 0.0801118016242981, "mean_token_accuracy": 0.9965364933013916, "num_tokens": 51460338.0, "step": 320 }, { "aux_loss": 8.0361909866333, "entropy": 0.029335936531424522, "epoch": 7.650602409638554, "grad_norm": 0.35437721014022827, "learning_rate": 1.4113512086836288e-06, "loss": 0.07883332669734955, "mean_token_accuracy": 0.9966942071914673, "num_tokens": 51619895.0, "step": 321 }, { "aux_loss": 8.035427570343018, "entropy": 0.032436246052384377, "epoch": 7.674698795180722, "grad_norm": 0.34983742237091064, "learning_rate": 1.4111060241198329e-06, "loss": 0.08025002479553223, "mean_token_accuracy": 0.9963445365428925, "num_tokens": 51785833.0, "step": 322 }, { "aux_loss": 8.033997058868408, "entropy": 0.03502529673278332, "epoch": 7.698795180722891, "grad_norm": 0.39680731296539307, "learning_rate": 1.4108601083770718e-06, "loss": 0.08174897730350494, "mean_token_accuracy": 0.9958369731903076, "num_tokens": 51950251.0, "step": 323 }, { "aux_loss": 8.03468132019043, "entropy": 0.039487240836024284, "epoch": 7.72289156626506, "grad_norm": 0.3813090920448303, "learning_rate": 1.4106134620109848e-06, "loss": 0.08411987125873566, "mean_token_accuracy": 0.9956846833229065, "num_tokens": 52104274.0, "step": 324 }, { "aux_loss": 8.034347534179688, "entropy": 0.0300306910648942, "epoch": 7.746987951807229, "grad_norm": 0.3322348892688751, "learning_rate": 1.4103660855788636e-06, "loss": 0.07942084223031998, "mean_token_accuracy": 0.9967765212059021, "num_tokens": 52266704.0, "step": 325 }, { "aux_loss": 8.032934665679932, "entropy": 0.030973643995821476, "epoch": 7.771084337349397, "grad_norm": 0.3334362208843231, "learning_rate": 1.4101179796396477e-06, "loss": 0.07914458960294724, "mean_token_accuracy": 0.9966495633125305, "num_tokens": 52446376.0, "step": 326 }, { "aux_loss": 8.032021522521973, "entropy": 0.030552386306226254, "epoch": 7.795180722891566, "grad_norm": 0.37135079503059387, "learning_rate": 1.409869144753926e-06, "loss": 0.07951807975769043, "mean_token_accuracy": 0.9962173700332642, "num_tokens": 52600001.0, "step": 327 }, { "aux_loss": 8.035574913024902, "entropy": 0.03106264304369688, "epoch": 7.8192771084337345, "grad_norm": 0.3528701663017273, "learning_rate": 1.4096195814839339e-06, "loss": 0.0800810307264328, "mean_token_accuracy": 0.996282309293747, "num_tokens": 52768318.0, "step": 328 }, { "aux_loss": 8.035249710083008, "entropy": 0.03810280002653599, "epoch": 7.843373493975903, "grad_norm": 0.38768336176872253, "learning_rate": 1.4093692903935533e-06, "loss": 0.08325342833995819, "mean_token_accuracy": 0.9957176744937897, "num_tokens": 52937588.0, "step": 329 }, { "aux_loss": 8.033713340759277, "entropy": 0.034183334559202194, "epoch": 7.867469879518072, "grad_norm": 0.35069799423217773, "learning_rate": 1.4091182720483095e-06, "loss": 0.08079741895198822, "mean_token_accuracy": 0.9960699379444122, "num_tokens": 53089655.0, "step": 330 }, { "aux_loss": 8.032924175262451, "entropy": 0.03523244708776474, "epoch": 7.891566265060241, "grad_norm": 0.39111587405204773, "learning_rate": 1.4088665270153717e-06, "loss": 0.08104196190834045, "mean_token_accuracy": 0.9962975680828094, "num_tokens": 53248483.0, "step": 331 }, { "aux_loss": 8.033989906311035, "entropy": 0.03644202649593353, "epoch": 7.9156626506024095, "grad_norm": 0.3810213506221771, "learning_rate": 1.4086140558635514e-06, "loss": 0.08186738193035126, "mean_token_accuracy": 0.9956882297992706, "num_tokens": 53411522.0, "step": 332 }, { "aux_loss": 8.034379005432129, "entropy": 0.03020784631371498, "epoch": 7.9397590361445785, "grad_norm": 0.3371445834636688, "learning_rate": 1.4083608591632996e-06, "loss": 0.07884131371974945, "mean_token_accuracy": 0.9969273209571838, "num_tokens": 53574408.0, "step": 333 }, { "aux_loss": 8.03269910812378, "entropy": 0.031987156718969345, "epoch": 7.9638554216867465, "grad_norm": 0.368277370929718, "learning_rate": 1.4081069374867079e-06, "loss": 0.07966729998588562, "mean_token_accuracy": 0.9962456524372101, "num_tokens": 53736277.0, "step": 334 }, { "aux_loss": 8.032955646514893, "entropy": 0.034337449818849564, "epoch": 7.9879518072289155, "grad_norm": 0.34589219093322754, "learning_rate": 1.407852291407505e-06, "loss": 0.08137495815753937, "mean_token_accuracy": 0.9959911406040192, "num_tokens": 53893541.0, "step": 335 }, { "aux_loss": 8.037422180175781, "entropy": 0.03607993572950363, "epoch": 8.0, "grad_norm": 0.48692095279693604, "learning_rate": 1.4075969215010567e-06, "loss": 0.04885231703519821, "mean_token_accuracy": 0.9962315559387207, "num_tokens": 53931704.0, "step": 336 }, { "aux_loss": 8.03453254699707, "entropy": 0.03251357935369015, "epoch": 8.024096385542169, "grad_norm": 0.31673136353492737, "learning_rate": 1.4073408283443648e-06, "loss": 0.07995766401290894, "mean_token_accuracy": 0.9967318177223206, "num_tokens": 54091047.0, "step": 337 }, { "aux_loss": 8.032040119171143, "entropy": 0.03007432259619236, "epoch": 8.048192771084338, "grad_norm": 0.30801841616630554, "learning_rate": 1.4070840125160644e-06, "loss": 0.07856522500514984, "mean_token_accuracy": 0.997085839509964, "num_tokens": 54251503.0, "step": 338 }, { "aux_loss": 8.033209323883057, "entropy": 0.0301275672391057, "epoch": 8.072289156626505, "grad_norm": 0.32101917266845703, "learning_rate": 1.4068264745964238e-06, "loss": 0.07812288403511047, "mean_token_accuracy": 0.9971620738506317, "num_tokens": 54431460.0, "step": 339 }, { "aux_loss": 8.03450059890747, "entropy": 0.037498150020837784, "epoch": 8.096385542168674, "grad_norm": 0.3406485617160797, "learning_rate": 1.4065682151673432e-06, "loss": 0.08174111694097519, "mean_token_accuracy": 0.9965010583400726, "num_tokens": 54590360.0, "step": 340 }, { "aux_loss": 8.035029888153076, "entropy": 0.031323011964559555, "epoch": 8.120481927710843, "grad_norm": 0.48250916600227356, "learning_rate": 1.4063092348123523e-06, "loss": 0.07874792069196701, "mean_token_accuracy": 0.9969989359378815, "num_tokens": 54752146.0, "step": 341 }, { "aux_loss": 8.034884929656982, "entropy": 0.030849049799144268, "epoch": 8.144578313253012, "grad_norm": 0.3505721688270569, "learning_rate": 1.4060495341166107e-06, "loss": 0.07901881635189056, "mean_token_accuracy": 0.9968648850917816, "num_tokens": 54910384.0, "step": 342 }, { "aux_loss": 8.031527996063232, "entropy": 0.03027996141463518, "epoch": 8.168674698795181, "grad_norm": 0.3279053568840027, "learning_rate": 1.4057891136669046e-06, "loss": 0.0783233493566513, "mean_token_accuracy": 0.9972791373729706, "num_tokens": 55074547.0, "step": 343 }, { "aux_loss": 8.032787322998047, "entropy": 0.03463793359696865, "epoch": 8.19277108433735, "grad_norm": 0.37317872047424316, "learning_rate": 1.4055279740516467e-06, "loss": 0.08077745139598846, "mean_token_accuracy": 0.9964223802089691, "num_tokens": 55223107.0, "step": 344 }, { "aux_loss": 8.032590866088867, "entropy": 0.03586240112781525, "epoch": 8.216867469879517, "grad_norm": 0.3791426420211792, "learning_rate": 1.4052661158608755e-06, "loss": 0.08125555515289307, "mean_token_accuracy": 0.9962078630924225, "num_tokens": 55367867.0, "step": 345 }, { "aux_loss": 8.033146858215332, "entropy": 0.03275267221033573, "epoch": 8.240963855421686, "grad_norm": 0.3555714786052704, "learning_rate": 1.4050035396862518e-06, "loss": 0.0799730122089386, "mean_token_accuracy": 0.9965274631977081, "num_tokens": 55531222.0, "step": 346 }, { "aux_loss": 8.033248901367188, "entropy": 0.029476456344127655, "epoch": 8.265060240963855, "grad_norm": 0.323041707277298, "learning_rate": 1.4047402461210596e-06, "loss": 0.07879751920700073, "mean_token_accuracy": 0.9967617392539978, "num_tokens": 55707018.0, "step": 347 }, { "aux_loss": 8.034295558929443, "entropy": 0.034110626205801964, "epoch": 8.289156626506024, "grad_norm": 0.3517826199531555, "learning_rate": 1.4044762357602033e-06, "loss": 0.08017922937870026, "mean_token_accuracy": 0.9966349303722382, "num_tokens": 55859239.0, "step": 348 }, { "aux_loss": 8.031924724578857, "entropy": 0.02905238326638937, "epoch": 8.313253012048193, "grad_norm": 0.3139900863170624, "learning_rate": 1.4042115092002074e-06, "loss": 0.07803536206483841, "mean_token_accuracy": 0.9969979524612427, "num_tokens": 56002942.0, "step": 349 }, { "aux_loss": 8.03225040435791, "entropy": 0.030559261329472065, "epoch": 8.337349397590362, "grad_norm": 0.34452271461486816, "learning_rate": 1.403946067039214e-06, "loss": 0.07925976067781448, "mean_token_accuracy": 0.9967726767063141, "num_tokens": 56159221.0, "step": 350 }, { "aux_loss": 8.033653736114502, "entropy": 0.036190446466207504, "epoch": 8.36144578313253, "grad_norm": 0.3688271939754486, "learning_rate": 1.4036799098769828e-06, "loss": 0.08133170008659363, "mean_token_accuracy": 0.9966385960578918, "num_tokens": 56326889.0, "step": 351 }, { "aux_loss": 8.032990455627441, "entropy": 0.03038295917212963, "epoch": 8.385542168674698, "grad_norm": 0.3074115812778473, "learning_rate": 1.4034130383148882e-06, "loss": 0.0787685215473175, "mean_token_accuracy": 0.9970142543315887, "num_tokens": 56498544.0, "step": 352 }, { "aux_loss": 8.03279447555542, "entropy": 0.03136066906154156, "epoch": 8.409638554216867, "grad_norm": 0.3597790002822876, "learning_rate": 1.4031454529559193e-06, "loss": 0.07899552583694458, "mean_token_accuracy": 0.9971287846565247, "num_tokens": 56661229.0, "step": 353 }, { "aux_loss": 8.03244400024414, "entropy": 0.03564039617776871, "epoch": 8.433734939759036, "grad_norm": 0.36866894364356995, "learning_rate": 1.4028771544046781e-06, "loss": 0.08136041462421417, "mean_token_accuracy": 0.9964535534381866, "num_tokens": 56809009.0, "step": 354 }, { "aux_loss": 8.033175945281982, "entropy": 0.03262287098914385, "epoch": 8.457831325301205, "grad_norm": 0.3500673770904541, "learning_rate": 1.4026081432673777e-06, "loss": 0.08022792637348175, "mean_token_accuracy": 0.9964220225811005, "num_tokens": 56974040.0, "step": 355 }, { "aux_loss": 8.034413814544678, "entropy": 0.03208298236131668, "epoch": 8.481927710843374, "grad_norm": 0.3360278308391571, "learning_rate": 1.4023384201518416e-06, "loss": 0.07970739901065826, "mean_token_accuracy": 0.9968045651912689, "num_tokens": 57140951.0, "step": 356 }, { "aux_loss": 8.033014297485352, "entropy": 0.030674396082758904, "epoch": 8.506024096385541, "grad_norm": 0.3344880938529968, "learning_rate": 1.4020679856675015e-06, "loss": 0.07849317789077759, "mean_token_accuracy": 0.9969932436943054, "num_tokens": 57282214.0, "step": 357 }, { "aux_loss": 8.031963348388672, "entropy": 0.03275129199028015, "epoch": 8.53012048192771, "grad_norm": 0.3430642783641815, "learning_rate": 1.401796840425397e-06, "loss": 0.07970772683620453, "mean_token_accuracy": 0.9970153570175171, "num_tokens": 57430073.0, "step": 358 }, { "aux_loss": 8.032482147216797, "entropy": 0.02784721739590168, "epoch": 8.55421686746988, "grad_norm": 0.33207616209983826, "learning_rate": 1.401524985038173e-06, "loss": 0.0774514451622963, "mean_token_accuracy": 0.9972799718379974, "num_tokens": 57611033.0, "step": 359 }, { "aux_loss": 8.032303810119629, "entropy": 0.02809650544077158, "epoch": 8.578313253012048, "grad_norm": 0.36203494668006897, "learning_rate": 1.4012524201200799e-06, "loss": 0.07764801383018494, "mean_token_accuracy": 0.9973397850990295, "num_tokens": 57775590.0, "step": 360 }, { "aux_loss": 8.03242826461792, "entropy": 0.03094232641160488, "epoch": 8.602409638554217, "grad_norm": 0.3259294033050537, "learning_rate": 1.40097914628697e-06, "loss": 0.07914900034666061, "mean_token_accuracy": 0.9970998764038086, "num_tokens": 57943047.0, "step": 361 }, { "aux_loss": 8.03185749053955, "entropy": 0.027600662782788277, "epoch": 8.626506024096386, "grad_norm": 0.30300894379615784, "learning_rate": 1.4007051641562986e-06, "loss": 0.07772274315357208, "mean_token_accuracy": 0.9973132312297821, "num_tokens": 58120845.0, "step": 362 }, { "aux_loss": 8.033005237579346, "entropy": 0.030716686509549618, "epoch": 8.650602409638553, "grad_norm": 0.41477662324905396, "learning_rate": 1.4004304743471206e-06, "loss": 0.07921659201383591, "mean_token_accuracy": 0.9964025318622589, "num_tokens": 58290435.0, "step": 363 }, { "aux_loss": 8.031022548675537, "entropy": 0.032445063814520836, "epoch": 8.674698795180722, "grad_norm": 0.36098530888557434, "learning_rate": 1.4001550774800902e-06, "loss": 0.07978940010070801, "mean_token_accuracy": 0.9963515102863312, "num_tokens": 58446144.0, "step": 364 }, { "aux_loss": 8.03183650970459, "entropy": 0.028307861648499966, "epoch": 8.698795180722891, "grad_norm": 0.37047818303108215, "learning_rate": 1.399878974177459e-06, "loss": 0.07777097821235657, "mean_token_accuracy": 0.997242659330368, "num_tokens": 58623005.0, "step": 365 }, { "aux_loss": 8.032839298248291, "entropy": 0.03144409507513046, "epoch": 8.72289156626506, "grad_norm": 0.33840411901474, "learning_rate": 1.3996021650630748e-06, "loss": 0.07940583676099777, "mean_token_accuracy": 0.9966592788696289, "num_tokens": 58781686.0, "step": 366 }, { "aux_loss": 8.030786514282227, "entropy": 0.027757197618484497, "epoch": 8.74698795180723, "grad_norm": 0.3691762387752533, "learning_rate": 1.3993246507623804e-06, "loss": 0.07730717957019806, "mean_token_accuracy": 0.9969027042388916, "num_tokens": 58924651.0, "step": 367 }, { "aux_loss": 8.032029628753662, "entropy": 0.02889639139175415, "epoch": 8.771084337349398, "grad_norm": 0.3496450185775757, "learning_rate": 1.3990464319024116e-06, "loss": 0.07893317937850952, "mean_token_accuracy": 0.9967939853668213, "num_tokens": 59083066.0, "step": 368 }, { "aux_loss": 8.031221866607666, "entropy": 0.030891859903931618, "epoch": 8.795180722891565, "grad_norm": 0.3323741555213928, "learning_rate": 1.3987675091117965e-06, "loss": 0.07858480513095856, "mean_token_accuracy": 0.9969135522842407, "num_tokens": 59256385.0, "step": 369 }, { "aux_loss": 8.032551288604736, "entropy": 0.03319684974849224, "epoch": 8.819277108433734, "grad_norm": 0.34501487016677856, "learning_rate": 1.3984878830207534e-06, "loss": 0.08011599630117416, "mean_token_accuracy": 0.996588408946991, "num_tokens": 59427852.0, "step": 370 }, { "aux_loss": 8.032721519470215, "entropy": 0.03409439139068127, "epoch": 8.843373493975903, "grad_norm": 0.3768217861652374, "learning_rate": 1.39820755426109e-06, "loss": 0.08085048198699951, "mean_token_accuracy": 0.9963680505752563, "num_tokens": 59595387.0, "step": 371 }, { "aux_loss": 8.032885551452637, "entropy": 0.03258616290986538, "epoch": 8.867469879518072, "grad_norm": 0.3588944375514984, "learning_rate": 1.3979265234662012e-06, "loss": 0.0799306333065033, "mean_token_accuracy": 0.9965479075908661, "num_tokens": 59779351.0, "step": 372 }, { "aux_loss": 8.030370235443115, "entropy": 0.029054300859570503, "epoch": 8.891566265060241, "grad_norm": 0.33350667357444763, "learning_rate": 1.3976447912710685e-06, "loss": 0.07802186906337738, "mean_token_accuracy": 0.9969941079616547, "num_tokens": 59949200.0, "step": 373 }, { "aux_loss": 8.02937126159668, "entropy": 0.028985220938920975, "epoch": 8.91566265060241, "grad_norm": 0.3544178605079651, "learning_rate": 1.3973623583122578e-06, "loss": 0.07832932472229004, "mean_token_accuracy": 0.9969984292984009, "num_tokens": 60109064.0, "step": 374 }, { "aux_loss": 8.03177261352539, "entropy": 0.029587114229798317, "epoch": 8.939759036144578, "grad_norm": 0.3520343005657196, "learning_rate": 1.3970792252279195e-06, "loss": 0.07858137786388397, "mean_token_accuracy": 0.996891975402832, "num_tokens": 60274692.0, "step": 375 }, { "aux_loss": 8.035192966461182, "entropy": 0.03562385682016611, "epoch": 8.963855421686747, "grad_norm": 0.35002952814102173, "learning_rate": 1.3967953926577841e-06, "loss": 0.08112400025129318, "mean_token_accuracy": 0.996430367231369, "num_tokens": 60441996.0, "step": 376 }, { "aux_loss": 8.033750534057617, "entropy": 0.029073555022478104, "epoch": 8.987951807228916, "grad_norm": 0.346101850271225, "learning_rate": 1.3965108612431643e-06, "loss": 0.07820385694503784, "mean_token_accuracy": 0.9969233572483063, "num_tokens": 60627910.0, "step": 377 }, { "aux_loss": 8.03187370300293, "entropy": 0.02936927229166031, "epoch": 9.0, "grad_norm": 0.46344229578971863, "learning_rate": 1.3962256316269505e-06, "loss": 0.04597163945436478, "mean_token_accuracy": 0.9973151087760925, "num_tokens": 60673167.0, "step": 378 }, { "aux_loss": 8.03305721282959, "entropy": 0.028284212574362755, "epoch": 9.024096385542169, "grad_norm": 0.31423506140708923, "learning_rate": 1.3959397044536114e-06, "loss": 0.07713969051837921, "mean_token_accuracy": 0.9977681040763855, "num_tokens": 60836716.0, "step": 379 }, { "aux_loss": 8.032850742340088, "entropy": 0.026606920175254345, "epoch": 9.048192771084338, "grad_norm": 0.2880466878414154, "learning_rate": 1.3956530803691917e-06, "loss": 0.0765802338719368, "mean_token_accuracy": 0.9976675510406494, "num_tokens": 61000573.0, "step": 380 }, { "aux_loss": 8.031289100646973, "entropy": 0.030671123415231705, "epoch": 9.072289156626505, "grad_norm": 0.30061787366867065, "learning_rate": 1.3953657600213106e-06, "loss": 0.07775267213582993, "mean_token_accuracy": 0.9975506663322449, "num_tokens": 61154706.0, "step": 381 }, { "aux_loss": 8.032238960266113, "entropy": 0.027959519997239113, "epoch": 9.096385542168674, "grad_norm": 0.28902363777160645, "learning_rate": 1.3950777440591605e-06, "loss": 0.07733355462551117, "mean_token_accuracy": 0.9973697662353516, "num_tokens": 61333594.0, "step": 382 }, { "aux_loss": 8.030166625976562, "entropy": 0.032277317717671394, "epoch": 9.120481927710843, "grad_norm": 0.34240710735321045, "learning_rate": 1.394789033133506e-06, "loss": 0.07901263236999512, "mean_token_accuracy": 0.9973782598972321, "num_tokens": 61490776.0, "step": 383 }, { "aux_loss": 8.032149314880371, "entropy": 0.02693926077336073, "epoch": 9.144578313253012, "grad_norm": 0.29341667890548706, "learning_rate": 1.3944996278966811e-06, "loss": 0.076640784740448, "mean_token_accuracy": 0.9978146553039551, "num_tokens": 61669552.0, "step": 384 }, { "aux_loss": 8.031457901000977, "entropy": 0.03191028628498316, "epoch": 9.168674698795181, "grad_norm": 0.3397424519062042, "learning_rate": 1.394209529002589e-06, "loss": 0.07893210649490356, "mean_token_accuracy": 0.9971943795681, "num_tokens": 61843274.0, "step": 385 }, { "aux_loss": 8.03022575378418, "entropy": 0.028519313782453537, "epoch": 9.19277108433735, "grad_norm": 0.30692535638809204, "learning_rate": 1.3939187371067007e-06, "loss": 0.07746940851211548, "mean_token_accuracy": 0.9976769387722015, "num_tokens": 61998707.0, "step": 386 }, { "aux_loss": 8.031204223632812, "entropy": 0.03095682244747877, "epoch": 9.216867469879517, "grad_norm": 0.3476795554161072, "learning_rate": 1.393627252866052e-06, "loss": 0.07881052792072296, "mean_token_accuracy": 0.9969981908798218, "num_tokens": 62173983.0, "step": 387 }, { "aux_loss": 8.027823448181152, "entropy": 0.02978881075978279, "epoch": 9.240963855421686, "grad_norm": 0.3190312683582306, "learning_rate": 1.3933350769392442e-06, "loss": 0.07773149758577347, "mean_token_accuracy": 0.9973650872707367, "num_tokens": 62324901.0, "step": 388 }, { "aux_loss": 8.031431674957275, "entropy": 0.027737611904740334, "epoch": 9.265060240963855, "grad_norm": 0.38071316480636597, "learning_rate": 1.39304220998644e-06, "loss": 0.07697569578886032, "mean_token_accuracy": 0.9974884390830994, "num_tokens": 62485228.0, "step": 389 }, { "aux_loss": 8.030527114868164, "entropy": 0.02737813163548708, "epoch": 9.289156626506024, "grad_norm": 0.2937212586402893, "learning_rate": 1.3927486526693647e-06, "loss": 0.0766058936715126, "mean_token_accuracy": 0.9978461861610413, "num_tokens": 62647707.0, "step": 390 }, { "aux_loss": 8.030436038970947, "entropy": 0.030430599115788937, "epoch": 9.313253012048193, "grad_norm": 0.30997201800346375, "learning_rate": 1.3924544056513032e-06, "loss": 0.0783412903547287, "mean_token_accuracy": 0.9975597560405731, "num_tokens": 62816112.0, "step": 391 }, { "aux_loss": 8.03123950958252, "entropy": 0.026135905645787716, "epoch": 9.337349397590362, "grad_norm": 0.3543896973133087, "learning_rate": 1.3921594695970985e-06, "loss": 0.07653771340847015, "mean_token_accuracy": 0.997521847486496, "num_tokens": 62950912.0, "step": 392 }, { "aux_loss": 8.02945613861084, "entropy": 0.03068769257515669, "epoch": 9.36144578313253, "grad_norm": 0.3361717462539673, "learning_rate": 1.3918638451731505e-06, "loss": 0.07847397774457932, "mean_token_accuracy": 0.9971339702606201, "num_tokens": 63106341.0, "step": 393 }, { "aux_loss": 8.031757354736328, "entropy": 0.03277725353837013, "epoch": 9.385542168674698, "grad_norm": 0.3406221866607666, "learning_rate": 1.3915675330474142e-06, "loss": 0.0791986957192421, "mean_token_accuracy": 0.9971778690814972, "num_tokens": 63284372.0, "step": 394 }, { "aux_loss": 8.030030727386475, "entropy": 0.026919249445199966, "epoch": 9.409638554216867, "grad_norm": 0.31440675258636475, "learning_rate": 1.3912705338893993e-06, "loss": 0.07689384371042252, "mean_token_accuracy": 0.9976073503494263, "num_tokens": 63455837.0, "step": 395 }, { "aux_loss": 8.031475067138672, "entropy": 0.033060451969504356, "epoch": 9.433734939759036, "grad_norm": 0.3352949023246765, "learning_rate": 1.3909728483701666e-06, "loss": 0.07927119731903076, "mean_token_accuracy": 0.9972446262836456, "num_tokens": 63618970.0, "step": 396 }, { "aux_loss": 8.029807567596436, "entropy": 0.03108399175107479, "epoch": 9.457831325301205, "grad_norm": 0.32964977622032166, "learning_rate": 1.3906744771623291e-06, "loss": 0.07835537195205688, "mean_token_accuracy": 0.9973717033863068, "num_tokens": 63781997.0, "step": 397 }, { "aux_loss": 8.031740665435791, "entropy": 0.03269661497324705, "epoch": 9.481927710843374, "grad_norm": 0.3676154911518097, "learning_rate": 1.3903754209400482e-06, "loss": 0.07965146005153656, "mean_token_accuracy": 0.9964734315872192, "num_tokens": 63932105.0, "step": 398 }, { "aux_loss": 8.033281803131104, "entropy": 0.03186710365116596, "epoch": 9.506024096385541, "grad_norm": 0.35776206851005554, "learning_rate": 1.390075680379033e-06, "loss": 0.07902336865663528, "mean_token_accuracy": 0.9969694018363953, "num_tokens": 64093887.0, "step": 399 }, { "aux_loss": 8.032399654388428, "entropy": 0.024799546226859093, "epoch": 9.53012048192771, "grad_norm": 0.3226422369480133, "learning_rate": 1.3897752561565394e-06, "loss": 0.07591937482357025, "mean_token_accuracy": 0.9975130259990692, "num_tokens": 64273357.0, "step": 400 }, { "aux_loss": 8.033264636993408, "entropy": 0.0295121967792511, "epoch": 9.55421686746988, "grad_norm": 0.3351059854030609, "learning_rate": 1.3894741489513673e-06, "loss": 0.07776688039302826, "mean_token_accuracy": 0.997167706489563, "num_tokens": 64448304.0, "step": 401 }, { "aux_loss": 8.029650211334229, "entropy": 0.02971556317061186, "epoch": 9.578313253012048, "grad_norm": 0.32523661851882935, "learning_rate": 1.3891723594438605e-06, "loss": 0.07813172787427902, "mean_token_accuracy": 0.9973180294036865, "num_tokens": 64596938.0, "step": 402 }, { "aux_loss": 8.031736373901367, "entropy": 0.02978976722806692, "epoch": 9.602409638554217, "grad_norm": 0.3332604169845581, "learning_rate": 1.3888698883159043e-06, "loss": 0.07776395231485367, "mean_token_accuracy": 0.9974326193332672, "num_tokens": 64769145.0, "step": 403 }, { "aux_loss": 8.033589839935303, "entropy": 0.032476719468832016, "epoch": 9.626506024096386, "grad_norm": 0.3411960005760193, "learning_rate": 1.3885667362509237e-06, "loss": 0.07948120683431625, "mean_token_accuracy": 0.9970299303531647, "num_tokens": 64932386.0, "step": 404 }, { "aux_loss": 8.030903816223145, "entropy": 0.03362698294222355, "epoch": 9.650602409638553, "grad_norm": 0.3845645487308502, "learning_rate": 1.3882629039338825e-06, "loss": 0.08039066195487976, "mean_token_accuracy": 0.9965060353279114, "num_tokens": 65085807.0, "step": 405 }, { "aux_loss": 8.029520034790039, "entropy": 0.0270113842561841, "epoch": 9.674698795180722, "grad_norm": 0.34778332710266113, "learning_rate": 1.3879583920512816e-06, "loss": 0.077044278383255, "mean_token_accuracy": 0.9973159432411194, "num_tokens": 65246006.0, "step": 406 }, { "aux_loss": 8.030782699584961, "entropy": 0.03195221349596977, "epoch": 9.698795180722891, "grad_norm": 0.35124245285987854, "learning_rate": 1.3876532012911574e-06, "loss": 0.07930511981248856, "mean_token_accuracy": 0.9969338178634644, "num_tokens": 65411013.0, "step": 407 }, { "aux_loss": 8.029433727264404, "entropy": 0.03094009030610323, "epoch": 9.72289156626506, "grad_norm": 0.4142710268497467, "learning_rate": 1.3873473323430797e-06, "loss": 0.07911791652441025, "mean_token_accuracy": 0.9967486560344696, "num_tokens": 65571476.0, "step": 408 }, { "aux_loss": 8.030499935150146, "entropy": 0.027457045391201973, "epoch": 9.74698795180723, "grad_norm": 0.3272239863872528, "learning_rate": 1.3870407858981514e-06, "loss": 0.07713578641414642, "mean_token_accuracy": 0.9972514510154724, "num_tokens": 65742609.0, "step": 409 }, { "aux_loss": 8.029773712158203, "entropy": 0.030966890044510365, "epoch": 9.771084337349398, "grad_norm": 0.42443791031837463, "learning_rate": 1.3867335626490055e-06, "loss": 0.07875967025756836, "mean_token_accuracy": 0.9968508183956146, "num_tokens": 65891366.0, "step": 410 }, { "aux_loss": 8.029150009155273, "entropy": 0.03328642249107361, "epoch": 9.795180722891565, "grad_norm": 0.3802852928638458, "learning_rate": 1.3864256632898051e-06, "loss": 0.07969282567501068, "mean_token_accuracy": 0.9970137476921082, "num_tokens": 66041964.0, "step": 411 }, { "aux_loss": 8.030668258666992, "entropy": 0.02882132213562727, "epoch": 9.819277108433734, "grad_norm": 0.3516421616077423, "learning_rate": 1.3861170885162396e-06, "loss": 0.07771005481481552, "mean_token_accuracy": 0.9975076615810394, "num_tokens": 66231004.0, "step": 412 }, { "aux_loss": 8.029856204986572, "entropy": 0.028738058172166348, "epoch": 9.843373493975903, "grad_norm": 0.34768593311309814, "learning_rate": 1.3858078390255256e-06, "loss": 0.07793055474758148, "mean_token_accuracy": 0.9971697330474854, "num_tokens": 66399510.0, "step": 413 }, { "aux_loss": 8.030166625976562, "entropy": 0.03400828316807747, "epoch": 9.867469879518072, "grad_norm": 0.37204456329345703, "learning_rate": 1.3854979155164043e-06, "loss": 0.08015817403793335, "mean_token_accuracy": 0.9967809617519379, "num_tokens": 66547156.0, "step": 414 }, { "aux_loss": 8.032981872558594, "entropy": 0.03100480604916811, "epoch": 9.891566265060241, "grad_norm": 0.3481873869895935, "learning_rate": 1.3851873186891386e-06, "loss": 0.07907165586948395, "mean_token_accuracy": 0.9964969456195831, "num_tokens": 66718160.0, "step": 415 }, { "aux_loss": 8.028274536132812, "entropy": 0.030552691780030727, "epoch": 9.91566265060241, "grad_norm": 0.33890053629875183, "learning_rate": 1.3848760492455145e-06, "loss": 0.07868947088718414, "mean_token_accuracy": 0.9966758191585541, "num_tokens": 66873016.0, "step": 416 }, { "aux_loss": 8.02976369857788, "entropy": 0.03107893466949463, "epoch": 9.939759036144578, "grad_norm": 0.3599156141281128, "learning_rate": 1.384564107888836e-06, "loss": 0.078771211206913, "mean_token_accuracy": 0.9969359636306763, "num_tokens": 67038673.0, "step": 417 }, { "aux_loss": 8.02978229522705, "entropy": 0.028388715349137783, "epoch": 9.963855421686747, "grad_norm": 0.35516616702079773, "learning_rate": 1.384251495323926e-06, "loss": 0.0778445154428482, "mean_token_accuracy": 0.9971783459186554, "num_tokens": 67218897.0, "step": 418 }, { "aux_loss": 8.031276226043701, "entropy": 0.03284810110926628, "epoch": 9.987951807228916, "grad_norm": 0.3593505024909973, "learning_rate": 1.3839382122571248e-06, "loss": 0.0795031189918518, "mean_token_accuracy": 0.9974339604377747, "num_tokens": 67376548.0, "step": 419 }, { "aux_loss": 8.033153533935547, "entropy": 0.029837898910045624, "epoch": 10.0, "grad_norm": 0.4149579107761383, "learning_rate": 1.3836242593962863e-06, "loss": 0.04504719376564026, "mean_token_accuracy": 0.997219443321228, "num_tokens": 67414630.0, "step": 420 }, { "aux_loss": 8.03052043914795, "entropy": 0.026807748712599277, "epoch": 10.024096385542169, "grad_norm": 0.3050729036331177, "learning_rate": 1.3833096374507787e-06, "loss": 0.07622632384300232, "mean_token_accuracy": 0.9978890419006348, "num_tokens": 67588234.0, "step": 421 }, { "aux_loss": 8.031226634979248, "entropy": 0.033840239979326725, "epoch": 10.048192771084338, "grad_norm": 0.3194749653339386, "learning_rate": 1.3829943471314814e-06, "loss": 0.07884673774242401, "mean_token_accuracy": 0.9978678822517395, "num_tokens": 67757352.0, "step": 422 }, { "aux_loss": 8.029906272888184, "entropy": 0.027255422435700893, "epoch": 10.072289156626505, "grad_norm": 0.30284735560417175, "learning_rate": 1.3826783891507848e-06, "loss": 0.07626917958259583, "mean_token_accuracy": 0.9980226457118988, "num_tokens": 67920553.0, "step": 423 }, { "aux_loss": 8.02976942062378, "entropy": 0.027208078652620316, "epoch": 10.096385542168674, "grad_norm": 0.29062679409980774, "learning_rate": 1.3823617642225866e-06, "loss": 0.07693935185670853, "mean_token_accuracy": 0.9976333379745483, "num_tokens": 68081290.0, "step": 424 }, { "aux_loss": 8.029796123504639, "entropy": 0.0285436250269413, "epoch": 10.120481927710843, "grad_norm": 0.2950977683067322, "learning_rate": 1.3820444730622926e-06, "loss": 0.07694471627473831, "mean_token_accuracy": 0.9980784356594086, "num_tokens": 68271566.0, "step": 425 }, { "aux_loss": 8.031370639801025, "entropy": 0.03286069352179766, "epoch": 10.144578313253012, "grad_norm": 0.3592938780784607, "learning_rate": 1.3817265163868138e-06, "loss": 0.07915187627077103, "mean_token_accuracy": 0.9973708391189575, "num_tokens": 68410627.0, "step": 426 }, { "aux_loss": 8.02876901626587, "entropy": 0.033930208534002304, "epoch": 10.168674698795181, "grad_norm": 0.3631734549999237, "learning_rate": 1.381407894914564e-06, "loss": 0.07949021458625793, "mean_token_accuracy": 0.9971204400062561, "num_tokens": 68547059.0, "step": 427 }, { "aux_loss": 8.028857231140137, "entropy": 0.03004965092986822, "epoch": 10.19277108433735, "grad_norm": 0.32348141074180603, "learning_rate": 1.3810886093654599e-06, "loss": 0.07751224935054779, "mean_token_accuracy": 0.997689813375473, "num_tokens": 68719122.0, "step": 428 }, { "aux_loss": 8.0299711227417, "entropy": 0.025603781454265118, "epoch": 10.216867469879517, "grad_norm": 0.2847801148891449, "learning_rate": 1.3807686604609185e-06, "loss": 0.07599260658025742, "mean_token_accuracy": 0.9978285729885101, "num_tokens": 68903105.0, "step": 429 }, { "aux_loss": 8.02917766571045, "entropy": 0.02435719594359398, "epoch": 10.240963855421686, "grad_norm": 0.31084614992141724, "learning_rate": 1.3804480489238556e-06, "loss": 0.07491791248321533, "mean_token_accuracy": 0.9980163872241974, "num_tokens": 69086727.0, "step": 430 }, { "aux_loss": 8.029499530792236, "entropy": 0.02250757720321417, "epoch": 10.265060240963855, "grad_norm": 0.2934803366661072, "learning_rate": 1.3801267754786845e-06, "loss": 0.07460962235927582, "mean_token_accuracy": 0.9981854856014252, "num_tokens": 69255826.0, "step": 431 }, { "aux_loss": 8.028985023498535, "entropy": 0.026835591532289982, "epoch": 10.289156626506024, "grad_norm": 0.31175994873046875, "learning_rate": 1.3798048408513135e-06, "loss": 0.0759553462266922, "mean_token_accuracy": 0.9978678524494171, "num_tokens": 69429204.0, "step": 432 }, { "aux_loss": 8.029627323150635, "entropy": 0.02608797326683998, "epoch": 10.313253012048193, "grad_norm": 0.28849494457244873, "learning_rate": 1.3794822457691448e-06, "loss": 0.07554003596305847, "mean_token_accuracy": 0.9981241524219513, "num_tokens": 69615147.0, "step": 433 }, { "aux_loss": 8.027892589569092, "entropy": 0.029431588016450405, "epoch": 10.337349397590362, "grad_norm": 0.3519872725009918, "learning_rate": 1.3791589909610738e-06, "loss": 0.07704924046993256, "mean_token_accuracy": 0.9977331459522247, "num_tokens": 69763662.0, "step": 434 }, { "aux_loss": 8.028160095214844, "entropy": 0.030695267021656036, "epoch": 10.36144578313253, "grad_norm": 0.35359182953834534, "learning_rate": 1.3788350771574854e-06, "loss": 0.0779634341597557, "mean_token_accuracy": 0.9976026713848114, "num_tokens": 69923670.0, "step": 435 }, { "aux_loss": 8.028687000274658, "entropy": 0.030781088396906853, "epoch": 10.385542168674698, "grad_norm": 0.3456423878669739, "learning_rate": 1.3785105050902542e-06, "loss": 0.07804363965988159, "mean_token_accuracy": 0.9974770545959473, "num_tokens": 70070248.0, "step": 436 }, { "aux_loss": 8.03036642074585, "entropy": 0.025892925448715687, "epoch": 10.409638554216867, "grad_norm": 0.42847299575805664, "learning_rate": 1.3781852754927418e-06, "loss": 0.07700430601835251, "mean_token_accuracy": 0.9975075125694275, "num_tokens": 70249380.0, "step": 437 }, { "aux_loss": 8.031606197357178, "entropy": 0.0267898328602314, "epoch": 10.433734939759036, "grad_norm": 0.29486900568008423, "learning_rate": 1.3778593890997959e-06, "loss": 0.07694413512945175, "mean_token_accuracy": 0.9977473318576813, "num_tokens": 70413199.0, "step": 438 }, { "aux_loss": 8.029096126556396, "entropy": 0.027300704270601273, "epoch": 10.457831325301205, "grad_norm": 0.3215588331222534, "learning_rate": 1.3775328466477474e-06, "loss": 0.07631190121173859, "mean_token_accuracy": 0.997810572385788, "num_tokens": 70586808.0, "step": 439 }, { "aux_loss": 8.030426025390625, "entropy": 0.02695034071803093, "epoch": 10.481927710843374, "grad_norm": 0.309374064207077, "learning_rate": 1.3772056488744102e-06, "loss": 0.07675328850746155, "mean_token_accuracy": 0.9976034462451935, "num_tokens": 70763440.0, "step": 440 }, { "aux_loss": 8.028189659118652, "entropy": 0.028853912837803364, "epoch": 10.506024096385541, "grad_norm": 0.335868239402771, "learning_rate": 1.3768777965190792e-06, "loss": 0.07752006500959396, "mean_token_accuracy": 0.9972420930862427, "num_tokens": 70910457.0, "step": 441 }, { "aux_loss": 8.029743194580078, "entropy": 0.025770947337150574, "epoch": 10.53012048192771, "grad_norm": 0.3330857455730438, "learning_rate": 1.3765492903225272e-06, "loss": 0.07615037262439728, "mean_token_accuracy": 0.9975591003894806, "num_tokens": 71067271.0, "step": 442 }, { "aux_loss": 8.027770519256592, "entropy": 0.02995127160102129, "epoch": 10.55421686746988, "grad_norm": 0.3459339737892151, "learning_rate": 1.3762201310270052e-06, "loss": 0.0779542475938797, "mean_token_accuracy": 0.9972722232341766, "num_tokens": 71225176.0, "step": 443 }, { "aux_loss": 8.02858829498291, "entropy": 0.024707495234906673, "epoch": 10.578313253012048, "grad_norm": 0.32370665669441223, "learning_rate": 1.3758903193762397e-06, "loss": 0.0753905326128006, "mean_token_accuracy": 0.9975995123386383, "num_tokens": 71391719.0, "step": 444 }, { "aux_loss": 8.029046535491943, "entropy": 0.02720453217625618, "epoch": 10.602409638554217, "grad_norm": 0.31780052185058594, "learning_rate": 1.3755598561154312e-06, "loss": 0.077033132314682, "mean_token_accuracy": 0.9974277913570404, "num_tokens": 71561690.0, "step": 445 }, { "aux_loss": 8.030248165130615, "entropy": 0.029147695749998093, "epoch": 10.626506024096386, "grad_norm": 0.3248000741004944, "learning_rate": 1.3752287419912521e-06, "loss": 0.07753097265958786, "mean_token_accuracy": 0.9971960484981537, "num_tokens": 71710468.0, "step": 446 }, { "aux_loss": 8.028928279876709, "entropy": 0.029994006268680096, "epoch": 10.650602409638553, "grad_norm": 0.33071792125701904, "learning_rate": 1.3748969777518458e-06, "loss": 0.07808565348386765, "mean_token_accuracy": 0.9973722398281097, "num_tokens": 71875559.0, "step": 447 }, { "aux_loss": 8.030104637145996, "entropy": 0.025511790066957474, "epoch": 10.674698795180722, "grad_norm": 0.32101917266845703, "learning_rate": 1.3745645641468248e-06, "loss": 0.07576514780521393, "mean_token_accuracy": 0.9978866875171661, "num_tokens": 72045798.0, "step": 448 }, { "aux_loss": 8.028583526611328, "entropy": 0.028393504209816456, "epoch": 10.698795180722891, "grad_norm": 0.31367799639701843, "learning_rate": 1.3742315019272683e-06, "loss": 0.07735928893089294, "mean_token_accuracy": 0.9973789155483246, "num_tokens": 72218153.0, "step": 449 }, { "aux_loss": 8.02676010131836, "entropy": 0.03315955400466919, "epoch": 10.72289156626506, "grad_norm": 0.33943045139312744, "learning_rate": 1.3738977918457213e-06, "loss": 0.07943802326917648, "mean_token_accuracy": 0.9972104430198669, "num_tokens": 72360308.0, "step": 450 }, { "aux_loss": 8.028342247009277, "entropy": 0.037015119567513466, "epoch": 10.74698795180723, "grad_norm": 0.35264134407043457, "learning_rate": 1.3735634346561928e-06, "loss": 0.08016332238912582, "mean_token_accuracy": 0.9973889291286469, "num_tokens": 72523679.0, "step": 451 }, { "aux_loss": 8.028265953063965, "entropy": 0.030274370685219765, "epoch": 10.771084337349398, "grad_norm": 0.31121376156806946, "learning_rate": 1.3732284311141535e-06, "loss": 0.0778329148888588, "mean_token_accuracy": 0.997382640838623, "num_tokens": 72676307.0, "step": 452 }, { "aux_loss": 8.028914451599121, "entropy": 0.02892636600881815, "epoch": 10.795180722891565, "grad_norm": 0.32904553413391113, "learning_rate": 1.3728927819765347e-06, "loss": 0.07730700075626373, "mean_token_accuracy": 0.9975307881832123, "num_tokens": 72827705.0, "step": 453 }, { "aux_loss": 8.028653144836426, "entropy": 0.026827383786439896, "epoch": 10.819277108433734, "grad_norm": 0.3565026521682739, "learning_rate": 1.3725564880017268e-06, "loss": 0.07710254937410355, "mean_token_accuracy": 0.9978848695755005, "num_tokens": 72984162.0, "step": 454 }, { "aux_loss": 8.027618408203125, "entropy": 0.03206733614206314, "epoch": 10.843373493975903, "grad_norm": 0.33514919877052307, "learning_rate": 1.3722195499495765e-06, "loss": 0.0789363905787468, "mean_token_accuracy": 0.9969374537467957, "num_tokens": 73141852.0, "step": 455 }, { "aux_loss": 8.030162811279297, "entropy": 0.027127815410494804, "epoch": 10.867469879518072, "grad_norm": 0.32852309942245483, "learning_rate": 1.3718819685813862e-06, "loss": 0.07681447267532349, "mean_token_accuracy": 0.9976330995559692, "num_tokens": 73318634.0, "step": 456 }, { "aux_loss": 8.028889179229736, "entropy": 0.02808957453817129, "epoch": 10.891566265060241, "grad_norm": 0.428763747215271, "learning_rate": 1.371543744659912e-06, "loss": 0.07722076028585434, "mean_token_accuracy": 0.9971847534179688, "num_tokens": 73467288.0, "step": 457 }, { "aux_loss": 8.028523445129395, "entropy": 0.033010026440024376, "epoch": 10.91566265060241, "grad_norm": 0.332423597574234, "learning_rate": 1.371204878949361e-06, "loss": 0.07916770875453949, "mean_token_accuracy": 0.9972398281097412, "num_tokens": 73624957.0, "step": 458 }, { "aux_loss": 8.027756214141846, "entropy": 0.03013605810701847, "epoch": 10.939759036144578, "grad_norm": 0.4300965666770935, "learning_rate": 1.3708653722153918e-06, "loss": 0.07825049012899399, "mean_token_accuracy": 0.9971310496330261, "num_tokens": 73772800.0, "step": 459 }, { "aux_loss": 8.030034065246582, "entropy": 0.027245910838246346, "epoch": 10.963855421686747, "grad_norm": 0.32759150862693787, "learning_rate": 1.3705252252251102e-06, "loss": 0.076337531208992, "mean_token_accuracy": 0.997997373342514, "num_tokens": 73971847.0, "step": 460 }, { "aux_loss": 8.029091358184814, "entropy": 0.03214616421610117, "epoch": 10.987951807228916, "grad_norm": 0.36098340153694153, "learning_rate": 1.370184438747069e-06, "loss": 0.07857733964920044, "mean_token_accuracy": 0.9973133206367493, "num_tokens": 74122193.0, "step": 461 }, { "aux_loss": 8.02614974975586, "entropy": 0.035153578966856, "epoch": 11.0, "grad_norm": 0.46866685152053833, "learning_rate": 1.3698430135512658e-06, "loss": 0.04593968391418457, "mean_token_accuracy": 0.9968705773353577, "num_tokens": 74156093.0, "step": 462 }, { "aux_loss": 8.027415752410889, "entropy": 0.028158558532595634, "epoch": 11.024096385542169, "grad_norm": 0.30607613921165466, "learning_rate": 1.369500950409142e-06, "loss": 0.07637624442577362, "mean_token_accuracy": 0.9978108406066895, "num_tokens": 74313575.0, "step": 463 }, { "aux_loss": 8.027459621429443, "entropy": 0.029599015600979328, "epoch": 11.048192771084338, "grad_norm": 0.357259064912796, "learning_rate": 1.3691582500935793e-06, "loss": 0.07699000835418701, "mean_token_accuracy": 0.9981439709663391, "num_tokens": 74470458.0, "step": 464 }, { "aux_loss": 8.026456356048584, "entropy": 0.028655465692281723, "epoch": 11.072289156626505, "grad_norm": 0.29174235463142395, "learning_rate": 1.3688149133789e-06, "loss": 0.07684057950973511, "mean_token_accuracy": 0.9977833330631256, "num_tokens": 74620787.0, "step": 465 }, { "aux_loss": 8.029138088226318, "entropy": 0.022806944325566292, "epoch": 11.096385542168674, "grad_norm": 0.2944920063018799, "learning_rate": 1.368470941040864e-06, "loss": 0.07433664798736572, "mean_token_accuracy": 0.9983370304107666, "num_tokens": 74777566.0, "step": 466 }, { "aux_loss": 8.026599407196045, "entropy": 0.025663558393716812, "epoch": 11.120481927710843, "grad_norm": 0.2916056513786316, "learning_rate": 1.3681263338566675e-06, "loss": 0.07559385895729065, "mean_token_accuracy": 0.9982210993766785, "num_tokens": 74948804.0, "step": 467 }, { "aux_loss": 8.026897430419922, "entropy": 0.03057689778506756, "epoch": 11.144578313253012, "grad_norm": 0.31129932403564453, "learning_rate": 1.3677810926049408e-06, "loss": 0.0773526206612587, "mean_token_accuracy": 0.99770787358284, "num_tokens": 75097224.0, "step": 468 }, { "aux_loss": 8.024751663208008, "entropy": 0.028811393305659294, "epoch": 11.168674698795181, "grad_norm": 0.3139060437679291, "learning_rate": 1.3674352180657472e-06, "loss": 0.07690249383449554, "mean_token_accuracy": 0.997710257768631, "num_tokens": 75237910.0, "step": 469 }, { "aux_loss": 8.026570796966553, "entropy": 0.027774027548730373, "epoch": 11.19277108433735, "grad_norm": 0.30671951174736023, "learning_rate": 1.367088711020581e-06, "loss": 0.07627267390489578, "mean_token_accuracy": 0.9979667663574219, "num_tokens": 75384961.0, "step": 470 }, { "aux_loss": 8.029362201690674, "entropy": 0.028830256313085556, "epoch": 11.216867469879517, "grad_norm": 0.3399089574813843, "learning_rate": 1.3667415722523648e-06, "loss": 0.07696400582790375, "mean_token_accuracy": 0.9977167546749115, "num_tokens": 75547412.0, "step": 471 }, { "aux_loss": 8.029022693634033, "entropy": 0.026009133085608482, "epoch": 11.240963855421686, "grad_norm": 0.2968512177467346, "learning_rate": 1.3663938025454495e-06, "loss": 0.07592800259590149, "mean_token_accuracy": 0.997904509305954, "num_tokens": 75721807.0, "step": 472 }, { "aux_loss": 8.027937889099121, "entropy": 0.03286511264741421, "epoch": 11.265060240963855, "grad_norm": 0.3452129662036896, "learning_rate": 1.3660454026856114e-06, "loss": 0.0784171000123024, "mean_token_accuracy": 0.9975327253341675, "num_tokens": 75877734.0, "step": 473 }, { "aux_loss": 8.028258323669434, "entropy": 0.025823739357292652, "epoch": 11.289156626506024, "grad_norm": 0.3015165328979492, "learning_rate": 1.3656963734600503e-06, "loss": 0.07567039132118225, "mean_token_accuracy": 0.9982956647872925, "num_tokens": 76034122.0, "step": 474 }, { "aux_loss": 8.026177406311035, "entropy": 0.03207191079854965, "epoch": 11.313253012048193, "grad_norm": 0.3374171853065491, "learning_rate": 1.3653467156573882e-06, "loss": 0.07849003374576569, "mean_token_accuracy": 0.9976714849472046, "num_tokens": 76192441.0, "step": 475 }, { "aux_loss": 8.027956008911133, "entropy": 0.026211952790617943, "epoch": 11.337349397590362, "grad_norm": 0.35711753368377686, "learning_rate": 1.3649964300676674e-06, "loss": 0.07585370540618896, "mean_token_accuracy": 0.9977020621299744, "num_tokens": 76356381.0, "step": 476 }, { "aux_loss": 8.02691650390625, "entropy": 0.03026073705404997, "epoch": 11.36144578313253, "grad_norm": 0.3285326361656189, "learning_rate": 1.3646455174823483e-06, "loss": 0.07800611853599548, "mean_token_accuracy": 0.9974254965782166, "num_tokens": 76515766.0, "step": 477 }, { "aux_loss": 8.028995513916016, "entropy": 0.02668727468699217, "epoch": 11.385542168674698, "grad_norm": 0.3030661642551422, "learning_rate": 1.3642939786943089e-06, "loss": 0.07588149607181549, "mean_token_accuracy": 0.9981980621814728, "num_tokens": 76672811.0, "step": 478 }, { "aux_loss": 8.028472423553467, "entropy": 0.02798299677670002, "epoch": 11.409638554216867, "grad_norm": 0.30959540605545044, "learning_rate": 1.363941814497841e-06, "loss": 0.07691517472267151, "mean_token_accuracy": 0.9976131021976471, "num_tokens": 76846962.0, "step": 479 }, { "aux_loss": 8.027761459350586, "entropy": 0.023294473066926003, "epoch": 11.433734939759036, "grad_norm": 0.2890002429485321, "learning_rate": 1.3635890256886501e-06, "loss": 0.07428885996341705, "mean_token_accuracy": 0.9982883036136627, "num_tokens": 77020669.0, "step": 480 }, { "aux_loss": 8.027469635009766, "entropy": 0.028372498229146004, "epoch": 11.457831325301205, "grad_norm": 0.3321754038333893, "learning_rate": 1.3632356130638528e-06, "loss": 0.07671969383955002, "mean_token_accuracy": 0.9977000951766968, "num_tokens": 77181204.0, "step": 481 }, { "aux_loss": 8.027999877929688, "entropy": 0.024836488999426365, "epoch": 11.481927710843374, "grad_norm": 0.2997661232948303, "learning_rate": 1.3628815774219754e-06, "loss": 0.07534407079219818, "mean_token_accuracy": 0.9979956150054932, "num_tokens": 77365065.0, "step": 482 }, { "aux_loss": 8.027578830718994, "entropy": 0.025402785278856754, "epoch": 11.506024096385541, "grad_norm": 0.3166537880897522, "learning_rate": 1.3625269195629517e-06, "loss": 0.07534520328044891, "mean_token_accuracy": 0.9980738162994385, "num_tokens": 77534153.0, "step": 483 }, { "aux_loss": 8.028955936431885, "entropy": 0.027941882610321045, "epoch": 11.53012048192771, "grad_norm": 0.3131483495235443, "learning_rate": 1.3621716402881215e-06, "loss": 0.0763813927769661, "mean_token_accuracy": 0.9981589615345001, "num_tokens": 77697477.0, "step": 484 }, { "aux_loss": 8.028358459472656, "entropy": 0.023258808068931103, "epoch": 11.55421686746988, "grad_norm": 0.28977909684181213, "learning_rate": 1.3618157404002283e-06, "loss": 0.07519376277923584, "mean_token_accuracy": 0.9978441596031189, "num_tokens": 77884159.0, "step": 485 }, { "aux_loss": 8.027586460113525, "entropy": 0.028671267442405224, "epoch": 11.578313253012048, "grad_norm": 0.3253847658634186, "learning_rate": 1.3614592207034186e-06, "loss": 0.07729551196098328, "mean_token_accuracy": 0.9978532791137695, "num_tokens": 78051531.0, "step": 486 }, { "aux_loss": 8.025540828704834, "entropy": 0.02651071920990944, "epoch": 11.602409638554217, "grad_norm": 0.31019577383995056, "learning_rate": 1.3611020820032388e-06, "loss": 0.07641060650348663, "mean_token_accuracy": 0.9979585409164429, "num_tokens": 78225093.0, "step": 487 }, { "aux_loss": 8.02729320526123, "entropy": 0.029389088042080402, "epoch": 11.626506024096386, "grad_norm": 0.3609655499458313, "learning_rate": 1.360744325106634e-06, "loss": 0.07722356915473938, "mean_token_accuracy": 0.9975888133049011, "num_tokens": 78382804.0, "step": 488 }, { "aux_loss": 8.027955532073975, "entropy": 0.029173430055379868, "epoch": 11.650602409638553, "grad_norm": 0.34442952275276184, "learning_rate": 1.360385950821946e-06, "loss": 0.07752852886915207, "mean_token_accuracy": 0.9973673522472382, "num_tokens": 78541939.0, "step": 489 }, { "aux_loss": 8.026641368865967, "entropy": 0.02798728458583355, "epoch": 11.674698795180722, "grad_norm": 0.34241095185279846, "learning_rate": 1.3600269599589116e-06, "loss": 0.07710593938827515, "mean_token_accuracy": 0.997597724199295, "num_tokens": 78699528.0, "step": 490 }, { "aux_loss": 8.02653169631958, "entropy": 0.022601360455155373, "epoch": 11.698795180722891, "grad_norm": 0.35648760199546814, "learning_rate": 1.3596673533286612e-06, "loss": 0.07467810064554214, "mean_token_accuracy": 0.9981017708778381, "num_tokens": 78883699.0, "step": 491 }, { "aux_loss": 8.02663803100586, "entropy": 0.024978790432214737, "epoch": 11.72289156626506, "grad_norm": 0.3188750445842743, "learning_rate": 1.3593071317437159e-06, "loss": 0.07513359189033508, "mean_token_accuracy": 0.9980481863021851, "num_tokens": 79053318.0, "step": 492 }, { "aux_loss": 8.027148246765137, "entropy": 0.025895356200635433, "epoch": 11.74698795180723, "grad_norm": 0.3157801628112793, "learning_rate": 1.3589462960179868e-06, "loss": 0.0758017897605896, "mean_token_accuracy": 0.9976556599140167, "num_tokens": 79210267.0, "step": 493 }, { "aux_loss": 8.026412010192871, "entropy": 0.026703675277531147, "epoch": 11.771084337349398, "grad_norm": 0.29264572262763977, "learning_rate": 1.358584846966772e-06, "loss": 0.07661619037389755, "mean_token_accuracy": 0.9978971779346466, "num_tokens": 79382574.0, "step": 494 }, { "aux_loss": 8.02318811416626, "entropy": 0.029082953929901123, "epoch": 11.795180722891565, "grad_norm": 0.3202921748161316, "learning_rate": 1.358222785406756e-06, "loss": 0.07708336412906647, "mean_token_accuracy": 0.9975403249263763, "num_tokens": 79539742.0, "step": 495 }, { "aux_loss": 8.028156757354736, "entropy": 0.03219949174672365, "epoch": 11.819277108433734, "grad_norm": 0.347214013338089, "learning_rate": 1.3578601121560066e-06, "loss": 0.07849562168121338, "mean_token_accuracy": 0.9975992739200592, "num_tokens": 79715225.0, "step": 496 }, { "aux_loss": 8.02785062789917, "entropy": 0.03248244524002075, "epoch": 11.843373493975903, "grad_norm": 0.36930665373802185, "learning_rate": 1.3574968280339748e-06, "loss": 0.07867126166820526, "mean_token_accuracy": 0.9975761771202087, "num_tokens": 79863950.0, "step": 497 }, { "aux_loss": 8.026073455810547, "entropy": 0.02557132299989462, "epoch": 11.867469879518072, "grad_norm": 0.3051406145095825, "learning_rate": 1.3571329338614906e-06, "loss": 0.07562849670648575, "mean_token_accuracy": 0.9980701208114624, "num_tokens": 80030537.0, "step": 498 }, { "aux_loss": 8.02685546875, "entropy": 0.02724768966436386, "epoch": 11.891566265060241, "grad_norm": 0.32025477290153503, "learning_rate": 1.356768430460763e-06, "loss": 0.07616618275642395, "mean_token_accuracy": 0.9980640113353729, "num_tokens": 80201317.0, "step": 499 }, { "aux_loss": 8.026135921478271, "entropy": 0.03000323288142681, "epoch": 11.91566265060241, "grad_norm": 0.3271973133087158, "learning_rate": 1.3564033186553776e-06, "loss": 0.07745539397001266, "mean_token_accuracy": 0.9974850416183472, "num_tokens": 80348643.0, "step": 500 }, { "aux_loss": 8.02552318572998, "entropy": 0.027183019556105137, "epoch": 11.939759036144578, "grad_norm": 0.33340510725975037, "learning_rate": 1.3560375992702945e-06, "loss": 0.07644230127334595, "mean_token_accuracy": 0.9975429177284241, "num_tokens": 80511188.0, "step": 501 }, { "aux_loss": 8.02660322189331, "entropy": 0.025949115864932537, "epoch": 11.963855421686747, "grad_norm": 0.30572640895843506, "learning_rate": 1.3556712731318467e-06, "loss": 0.0758323073387146, "mean_token_accuracy": 0.9978821277618408, "num_tokens": 80685850.0, "step": 502 }, { "aux_loss": 8.02736520767212, "entropy": 0.026593544520437717, "epoch": 11.987951807228916, "grad_norm": 0.3319381773471832, "learning_rate": 1.3553043410677378e-06, "loss": 0.07625584304332733, "mean_token_accuracy": 0.9979047179222107, "num_tokens": 80858074.0, "step": 503 }, { "aux_loss": 8.02574348449707, "entropy": 0.026809921488165855, "epoch": 12.0, "grad_norm": 0.43141719698905945, "learning_rate": 1.3549368039070411e-06, "loss": 0.04325544089078903, "mean_token_accuracy": 0.9976990818977356, "num_tokens": 80897556.0, "step": 504 } ], "logging_steps": 1, "max_steps": 2100, "num_input_tokens_seen": 0, "num_train_epochs": 50, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.6774226325878604e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }