{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 84, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "aux_loss": 8.045117378234863, "entropy": 0.05226727016270161, "epoch": 0.024096385542168676, "grad_norm": 0.5021907687187195, "learning_rate": 0.0, "loss": 0.09741637855768204, "mean_token_accuracy": 0.9888820052146912, "num_tokens": 154362.0, "step": 1 }, { "aux_loss": 8.047614574432373, "entropy": 0.05835266411304474, "epoch": 0.04819277108433735, "grad_norm": 0.551396369934082, "learning_rate": 1.4500000000000001e-07, "loss": 0.09991507232189178, "mean_token_accuracy": 0.9883801937103271, "num_tokens": 310702.0, "step": 2 }, { "aux_loss": 8.049727439880371, "entropy": 0.052583809942007065, "epoch": 0.07228915662650602, "grad_norm": 0.4750031530857086, "learning_rate": 2.9000000000000003e-07, "loss": 0.09806497395038605, "mean_token_accuracy": 0.9886206984519958, "num_tokens": 493904.0, "step": 3 }, { "aux_loss": 8.047826766967773, "entropy": 0.05231792479753494, "epoch": 0.0963855421686747, "grad_norm": 0.4863564074039459, "learning_rate": 4.35e-07, "loss": 0.09776315838098526, "mean_token_accuracy": 0.9888334274291992, "num_tokens": 663136.0, "step": 4 }, { "aux_loss": 8.047198295593262, "entropy": 0.04943128302693367, "epoch": 0.12048192771084337, "grad_norm": 0.5010114908218384, "learning_rate": 5.800000000000001e-07, "loss": 0.09543517231941223, "mean_token_accuracy": 0.9894405901432037, "num_tokens": 812532.0, "step": 5 }, { "aux_loss": 8.049106121063232, "entropy": 0.063042301684618, "epoch": 0.14457831325301204, "grad_norm": 0.5165722966194153, "learning_rate": 7.25e-07, "loss": 0.10346449911594391, "mean_token_accuracy": 0.987544983625412, "num_tokens": 973071.0, "step": 6 }, { "aux_loss": 8.047893047332764, "entropy": 0.0672433041036129, "epoch": 0.1686746987951807, "grad_norm": 0.5849524736404419, "learning_rate": 8.7e-07, "loss": 0.10626787692308426, "mean_token_accuracy": 0.9862557649612427, "num_tokens": 1110326.0, "step": 7 }, { "aux_loss": 8.04862642288208, "entropy": 0.06088166497647762, "epoch": 0.1927710843373494, "grad_norm": 0.48005586862564087, "learning_rate": 1.015e-06, "loss": 0.1021210104227066, "mean_token_accuracy": 0.9877255260944366, "num_tokens": 1259440.0, "step": 8 }, { "aux_loss": 8.047185897827148, "entropy": 0.049826065078377724, "epoch": 0.21686746987951808, "grad_norm": 0.43366947770118713, "learning_rate": 1.1600000000000001e-06, "loss": 0.09475715458393097, "mean_token_accuracy": 0.9898165464401245, "num_tokens": 1417756.0, "step": 9 }, { "aux_loss": 8.04772663116455, "entropy": 0.054957231506705284, "epoch": 0.24096385542168675, "grad_norm": 0.4529463052749634, "learning_rate": 1.3050000000000002e-06, "loss": 0.09896557033061981, "mean_token_accuracy": 0.9889253675937653, "num_tokens": 1579862.0, "step": 10 }, { "aux_loss": 8.047585487365723, "entropy": 0.05796742998063564, "epoch": 0.26506024096385544, "grad_norm": 0.45284125208854675, "learning_rate": 1.45e-06, "loss": 0.10001235455274582, "mean_token_accuracy": 0.9876790642738342, "num_tokens": 1731184.0, "step": 11 }, { "aux_loss": 8.04898738861084, "entropy": 0.05215233750641346, "epoch": 0.2891566265060241, "grad_norm": 0.4420299828052521, "learning_rate": 1.4499995904705798e-06, "loss": 0.09724222123622894, "mean_token_accuracy": 0.9884337782859802, "num_tokens": 1893932.0, "step": 12 }, { "aux_loss": 8.04798412322998, "entropy": 0.05265074409544468, "epoch": 0.3132530120481928, "grad_norm": 0.40204742550849915, "learning_rate": 1.4499983618832442e-06, "loss": 0.0970243290066719, "mean_token_accuracy": 0.989496260881424, "num_tokens": 2053005.0, "step": 13 }, { "aux_loss": 8.05030107498169, "entropy": 0.049178898334503174, "epoch": 0.3373493975903614, "grad_norm": 0.4108814597129822, "learning_rate": 1.4499963142407692e-06, "loss": 0.09499870240688324, "mean_token_accuracy": 0.9897345900535583, "num_tokens": 2217039.0, "step": 14 }, { "aux_loss": 8.046091079711914, "entropy": 0.0504351407289505, "epoch": 0.3614457831325301, "grad_norm": 0.4030505418777466, "learning_rate": 1.4499934475477814e-06, "loss": 0.09597203135490417, "mean_token_accuracy": 0.9898054599761963, "num_tokens": 2386769.0, "step": 15 }, { "aux_loss": 8.047934532165527, "entropy": 0.04648676887154579, "epoch": 0.3855421686746988, "grad_norm": 0.4123123586177826, "learning_rate": 1.4499897618107582e-06, "loss": 0.09345895051956177, "mean_token_accuracy": 0.989924967288971, "num_tokens": 2551093.0, "step": 16 }, { "aux_loss": 8.04793405532837, "entropy": 0.04946734011173248, "epoch": 0.40963855421686746, "grad_norm": 0.42739129066467285, "learning_rate": 1.4499852570380272e-06, "loss": 0.09633760154247284, "mean_token_accuracy": 0.9889810979366302, "num_tokens": 2704860.0, "step": 17 }, { "aux_loss": 8.048253536224365, "entropy": 0.0546275470405817, "epoch": 0.43373493975903615, "grad_norm": 0.44881728291511536, "learning_rate": 1.449979933239767e-06, "loss": 0.09820500761270523, "mean_token_accuracy": 0.9885384142398834, "num_tokens": 2850860.0, "step": 18 }, { "aux_loss": 8.050773620605469, "entropy": 0.05041976273059845, "epoch": 0.4578313253012048, "grad_norm": 0.46621593832969666, "learning_rate": 1.4499737904280063e-06, "loss": 0.09671641141176224, "mean_token_accuracy": 0.9887768924236298, "num_tokens": 3039323.0, "step": 19 }, { "aux_loss": 8.050614356994629, "entropy": 0.050554944202303886, "epoch": 0.4819277108433735, "grad_norm": 0.47147253155708313, "learning_rate": 1.449966828616625e-06, "loss": 0.09628961980342865, "mean_token_accuracy": 0.9888468682765961, "num_tokens": 3195488.0, "step": 20 }, { "aux_loss": 8.050609111785889, "entropy": 0.04489951767027378, "epoch": 0.5060240963855421, "grad_norm": 0.4890425503253937, "learning_rate": 1.4499590478213525e-06, "loss": 0.09394823014736176, "mean_token_accuracy": 0.9896246194839478, "num_tokens": 3369627.0, "step": 21 }, { "aux_loss": 8.047994613647461, "entropy": 0.0530005544424057, "epoch": 0.5301204819277109, "grad_norm": 0.5181686878204346, "learning_rate": 1.4499504480597702e-06, "loss": 0.09846185147762299, "mean_token_accuracy": 0.9879846572875977, "num_tokens": 3520643.0, "step": 22 }, { "aux_loss": 8.049047946929932, "entropy": 0.039870962500572205, "epoch": 0.5542168674698795, "grad_norm": 0.41603270173072815, "learning_rate": 1.4499410293513081e-06, "loss": 0.09075028449296951, "mean_token_accuracy": 0.9908623099327087, "num_tokens": 3702510.0, "step": 23 }, { "aux_loss": 8.050177097320557, "entropy": 0.05053388141095638, "epoch": 0.5783132530120482, "grad_norm": 0.4234795570373535, "learning_rate": 1.449930791717248e-06, "loss": 0.09689382463693619, "mean_token_accuracy": 0.9886369109153748, "num_tokens": 3867610.0, "step": 24 }, { "aux_loss": 8.048462867736816, "entropy": 0.049235520884394646, "epoch": 0.6024096385542169, "grad_norm": 0.4375890791416168, "learning_rate": 1.4499197351807219e-06, "loss": 0.09504671394824982, "mean_token_accuracy": 0.9891063868999481, "num_tokens": 4021186.0, "step": 25 }, { "aux_loss": 8.050186157226562, "entropy": 0.048021236434578896, "epoch": 0.6265060240963856, "grad_norm": 0.42389488220214844, "learning_rate": 1.449907859766711e-06, "loss": 0.09462042152881622, "mean_token_accuracy": 0.9893973469734192, "num_tokens": 4183102.0, "step": 26 }, { "aux_loss": 8.04945182800293, "entropy": 0.042689668014645576, "epoch": 0.6506024096385542, "grad_norm": 0.40038207173347473, "learning_rate": 1.4498951655020479e-06, "loss": 0.09214234352111816, "mean_token_accuracy": 0.9904394745826721, "num_tokens": 4348628.0, "step": 27 }, { "aux_loss": 8.050597667694092, "entropy": 0.05143065005540848, "epoch": 0.6746987951807228, "grad_norm": 0.4422961473464966, "learning_rate": 1.4498816524154148e-06, "loss": 0.09722501039505005, "mean_token_accuracy": 0.9888282418251038, "num_tokens": 4511217.0, "step": 28 }, { "aux_loss": 8.048704147338867, "entropy": 0.044764744117856026, "epoch": 0.6987951807228916, "grad_norm": 0.4279940128326416, "learning_rate": 1.4498673205373443e-06, "loss": 0.09300120174884796, "mean_token_accuracy": 0.9899511337280273, "num_tokens": 4684266.0, "step": 29 }, { "aux_loss": 8.047113418579102, "entropy": 0.04995520040392876, "epoch": 0.7228915662650602, "grad_norm": 0.45497408509254456, "learning_rate": 1.4498521699002187e-06, "loss": 0.0966445729136467, "mean_token_accuracy": 0.9883378744125366, "num_tokens": 4858009.0, "step": 30 }, { "aux_loss": 8.050236701965332, "entropy": 0.04773502238094807, "epoch": 0.7469879518072289, "grad_norm": 0.40059739351272583, "learning_rate": 1.4498362005382707e-06, "loss": 0.09425598382949829, "mean_token_accuracy": 0.9895853698253632, "num_tokens": 5041560.0, "step": 31 }, { "aux_loss": 8.0483078956604, "entropy": 0.04463958367705345, "epoch": 0.7710843373493976, "grad_norm": 0.421403706073761, "learning_rate": 1.4498194124875822e-06, "loss": 0.0921817421913147, "mean_token_accuracy": 0.9903146624565125, "num_tokens": 5207925.0, "step": 32 }, { "aux_loss": 8.051517486572266, "entropy": 0.0455746091902256, "epoch": 0.7951807228915663, "grad_norm": 0.39467114210128784, "learning_rate": 1.449801805786086e-06, "loss": 0.09311801195144653, "mean_token_accuracy": 0.9897293448448181, "num_tokens": 5410900.0, "step": 33 }, { "aux_loss": 8.047285079956055, "entropy": 0.04475598596036434, "epoch": 0.8192771084337349, "grad_norm": 0.3885505795478821, "learning_rate": 1.4497833804735631e-06, "loss": 0.09283807128667831, "mean_token_accuracy": 0.9904457926750183, "num_tokens": 5579379.0, "step": 34 }, { "aux_loss": 8.049206733703613, "entropy": 0.045768845826387405, "epoch": 0.8433734939759037, "grad_norm": 0.38822969794273376, "learning_rate": 1.4497641365916457e-06, "loss": 0.0930660218000412, "mean_token_accuracy": 0.9898505806922913, "num_tokens": 5756181.0, "step": 35 }, { "aux_loss": 8.049548149108887, "entropy": 0.0442772526293993, "epoch": 0.8674698795180723, "grad_norm": 0.42765918374061584, "learning_rate": 1.4497440741838147e-06, "loss": 0.09213966131210327, "mean_token_accuracy": 0.9906859695911407, "num_tokens": 5913888.0, "step": 36 }, { "aux_loss": 8.047310829162598, "entropy": 0.05137152969837189, "epoch": 0.891566265060241, "grad_norm": 0.46749433875083923, "learning_rate": 1.4497231932954002e-06, "loss": 0.09635019302368164, "mean_token_accuracy": 0.9894134104251862, "num_tokens": 6073822.0, "step": 37 }, { "aux_loss": 8.04575777053833, "entropy": 0.04952680319547653, "epoch": 0.9156626506024096, "grad_norm": 0.40102288126945496, "learning_rate": 1.4497014939735825e-06, "loss": 0.09520888328552246, "mean_token_accuracy": 0.9900149703025818, "num_tokens": 6228998.0, "step": 38 }, { "aux_loss": 8.05048656463623, "entropy": 0.05141362361609936, "epoch": 0.9397590361445783, "grad_norm": 0.45891159772872925, "learning_rate": 1.4496789762673903e-06, "loss": 0.09608915448188782, "mean_token_accuracy": 0.9895050525665283, "num_tokens": 6380479.0, "step": 39 }, { "aux_loss": 8.049390316009521, "entropy": 0.0542642492800951, "epoch": 0.963855421686747, "grad_norm": 0.4678654968738556, "learning_rate": 1.4496556402277018e-06, "loss": 0.0986521765589714, "mean_token_accuracy": 0.9882148206233978, "num_tokens": 6514347.0, "step": 40 }, { "aux_loss": 8.047286033630371, "entropy": 0.04129311256110668, "epoch": 0.9879518072289156, "grad_norm": 0.42529988288879395, "learning_rate": 1.4496314859072443e-06, "loss": 0.09138549864292145, "mean_token_accuracy": 0.9908298254013062, "num_tokens": 6684739.0, "step": 41 }, { "aux_loss": 8.050637245178223, "entropy": 0.04988313093781471, "epoch": 1.0, "grad_norm": 0.5628013610839844, "learning_rate": 1.4496065133605937e-06, "loss": 0.06163128837943077, "mean_token_accuracy": 0.9887231588363647, "num_tokens": 6741463.0, "step": 42 }, { "aux_loss": 8.047677040100098, "entropy": 0.04833286814391613, "epoch": 1.0240963855421688, "grad_norm": 0.43433839082717896, "learning_rate": 1.4495807226441745e-06, "loss": 0.09322302043437958, "mean_token_accuracy": 0.9907335042953491, "num_tokens": 6872162.0, "step": 43 }, { "aux_loss": 8.049845218658447, "entropy": 0.04814961925148964, "epoch": 1.0481927710843373, "grad_norm": 0.38683706521987915, "learning_rate": 1.4495541138162606e-06, "loss": 0.09274052828550339, "mean_token_accuracy": 0.9911822378635406, "num_tokens": 7044917.0, "step": 44 }, { "aux_loss": 8.045840740203857, "entropy": 0.04862277954816818, "epoch": 1.072289156626506, "grad_norm": 0.43781232833862305, "learning_rate": 1.4495266869369737e-06, "loss": 0.09285125136375427, "mean_token_accuracy": 0.991097629070282, "num_tokens": 7207551.0, "step": 45 }, { "aux_loss": 8.047110080718994, "entropy": 0.04816548526287079, "epoch": 1.0963855421686748, "grad_norm": 0.4117249846458435, "learning_rate": 1.4494984420682841e-06, "loss": 0.09330926835536957, "mean_token_accuracy": 0.990231990814209, "num_tokens": 7376391.0, "step": 46 }, { "aux_loss": 8.046239852905273, "entropy": 0.04640440456569195, "epoch": 1.1204819277108433, "grad_norm": 0.3918110728263855, "learning_rate": 1.4494693792740101e-06, "loss": 0.09266579151153564, "mean_token_accuracy": 0.9905861914157867, "num_tokens": 7544885.0, "step": 47 }, { "aux_loss": 8.045721054077148, "entropy": 0.04254587180912495, "epoch": 1.144578313253012, "grad_norm": 0.3635147213935852, "learning_rate": 1.4494394986198189e-06, "loss": 0.08964599668979645, "mean_token_accuracy": 0.9919890761375427, "num_tokens": 7718825.0, "step": 48 }, { "aux_loss": 8.04783582687378, "entropy": 0.0457068495452404, "epoch": 1.1686746987951806, "grad_norm": 0.37491077184677124, "learning_rate": 1.4494088001732242e-06, "loss": 0.0912659764289856, "mean_token_accuracy": 0.9914940893650055, "num_tokens": 7884797.0, "step": 49 }, { "aux_loss": 8.048118591308594, "entropy": 0.05809796415269375, "epoch": 1.1927710843373494, "grad_norm": 0.442947119474411, "learning_rate": 1.449377284003589e-06, "loss": 0.09830181300640106, "mean_token_accuracy": 0.9896205961704254, "num_tokens": 8037756.0, "step": 50 }, { "aux_loss": 8.045411109924316, "entropy": 0.04734855704009533, "epoch": 1.216867469879518, "grad_norm": 0.3778594732284546, "learning_rate": 1.449344950182123e-06, "loss": 0.09220214188098907, "mean_token_accuracy": 0.9912082552909851, "num_tokens": 8201900.0, "step": 51 }, { "aux_loss": 8.051240921020508, "entropy": 0.04616173356771469, "epoch": 1.2409638554216866, "grad_norm": 0.39906826615333557, "learning_rate": 1.4493117987818833e-06, "loss": 0.09254124015569687, "mean_token_accuracy": 0.9910232424736023, "num_tokens": 8368482.0, "step": 52 }, { "aux_loss": 8.048255443572998, "entropy": 0.04362104274332523, "epoch": 1.2650602409638554, "grad_norm": 0.4132522642612457, "learning_rate": 1.449277829877775e-06, "loss": 0.08969354629516602, "mean_token_accuracy": 0.9923582375049591, "num_tokens": 8532083.0, "step": 53 }, { "aux_loss": 8.049753189086914, "entropy": 0.05157726630568504, "epoch": 1.2891566265060241, "grad_norm": 0.42263299226760864, "learning_rate": 1.4492430435465495e-06, "loss": 0.09429101645946503, "mean_token_accuracy": 0.9907614588737488, "num_tokens": 8707916.0, "step": 54 }, { "aux_loss": 8.04571533203125, "entropy": 0.04540949687361717, "epoch": 1.3132530120481927, "grad_norm": 0.415887713432312, "learning_rate": 1.4492074398668059e-06, "loss": 0.09169892221689224, "mean_token_accuracy": 0.9909594357013702, "num_tokens": 8868293.0, "step": 55 }, { "aux_loss": 8.047487258911133, "entropy": 0.042821500450372696, "epoch": 1.3373493975903614, "grad_norm": 0.3941069543361664, "learning_rate": 1.4491710189189896e-06, "loss": 0.08963996917009354, "mean_token_accuracy": 0.9915030598640442, "num_tokens": 9040400.0, "step": 56 }, { "aux_loss": 8.046500205993652, "entropy": 0.04034057445824146, "epoch": 1.3614457831325302, "grad_norm": 0.3714058995246887, "learning_rate": 1.4491337807853928e-06, "loss": 0.08831468969583511, "mean_token_accuracy": 0.9924418330192566, "num_tokens": 9210005.0, "step": 57 }, { "aux_loss": 8.04520559310913, "entropy": 0.04288036748766899, "epoch": 1.3855421686746987, "grad_norm": 0.4117484986782074, "learning_rate": 1.4490957255501541e-06, "loss": 0.09062028676271439, "mean_token_accuracy": 0.9908726513385773, "num_tokens": 9354587.0, "step": 58 }, { "aux_loss": 8.048189163208008, "entropy": 0.04117992892861366, "epoch": 1.4096385542168675, "grad_norm": 0.3880350589752197, "learning_rate": 1.449056853299258e-06, "loss": 0.08878283947706223, "mean_token_accuracy": 0.9918811917304993, "num_tokens": 9530098.0, "step": 59 }, { "aux_loss": 8.046634674072266, "entropy": 0.046307843178510666, "epoch": 1.4337349397590362, "grad_norm": 0.41205379366874695, "learning_rate": 1.4490171641205356e-06, "loss": 0.0928514301776886, "mean_token_accuracy": 0.99020916223526, "num_tokens": 9696846.0, "step": 60 }, { "aux_loss": 8.04638147354126, "entropy": 0.03861385025084019, "epoch": 1.4578313253012047, "grad_norm": 0.3674647808074951, "learning_rate": 1.4489766581036633e-06, "loss": 0.08779378235340118, "mean_token_accuracy": 0.9924313127994537, "num_tokens": 9868180.0, "step": 61 }, { "aux_loss": 8.048831462860107, "entropy": 0.04485859349370003, "epoch": 1.4819277108433735, "grad_norm": 0.4122410714626312, "learning_rate": 1.4489353353401633e-06, "loss": 0.09213700890541077, "mean_token_accuracy": 0.9905197322368622, "num_tokens": 10041207.0, "step": 62 }, { "aux_loss": 8.045693397521973, "entropy": 0.04181382618844509, "epoch": 1.5060240963855422, "grad_norm": 0.41252797842025757, "learning_rate": 1.4488931959234036e-06, "loss": 0.08966240286827087, "mean_token_accuracy": 0.9918944835662842, "num_tokens": 10216601.0, "step": 63 }, { "aux_loss": 8.045026779174805, "entropy": 0.04367237165570259, "epoch": 1.5301204819277108, "grad_norm": 0.7194992899894714, "learning_rate": 1.4488502399485967e-06, "loss": 0.09064353257417679, "mean_token_accuracy": 0.9913205206394196, "num_tokens": 10373157.0, "step": 64 }, { "aux_loss": 8.046749591827393, "entropy": 0.049618642777204514, "epoch": 1.5542168674698795, "grad_norm": 0.4409625828266144, "learning_rate": 1.4488064675128008e-06, "loss": 0.09418876469135284, "mean_token_accuracy": 0.98995640873909, "num_tokens": 10513760.0, "step": 65 }, { "aux_loss": 8.04750108718872, "entropy": 0.045051392167806625, "epoch": 1.5783132530120483, "grad_norm": 0.4379954934120178, "learning_rate": 1.4487618787149178e-06, "loss": 0.09229664504528046, "mean_token_accuracy": 0.990358978509903, "num_tokens": 10667072.0, "step": 66 }, { "aux_loss": 8.0473952293396, "entropy": 0.03963223472237587, "epoch": 1.6024096385542168, "grad_norm": 0.3720748722553253, "learning_rate": 1.4487164736556958e-06, "loss": 0.08866938948631287, "mean_token_accuracy": 0.9920879304409027, "num_tokens": 10839108.0, "step": 67 }, { "aux_loss": 8.047708511352539, "entropy": 0.04451095871627331, "epoch": 1.6265060240963856, "grad_norm": 0.4250375032424927, "learning_rate": 1.4486702524377257e-06, "loss": 0.09129409492015839, "mean_token_accuracy": 0.9904707074165344, "num_tokens": 11001747.0, "step": 68 }, { "aux_loss": 8.045770645141602, "entropy": 0.041699016466736794, "epoch": 1.6506024096385543, "grad_norm": 0.5749812722206116, "learning_rate": 1.4486232151654433e-06, "loss": 0.08955338597297668, "mean_token_accuracy": 0.9914253950119019, "num_tokens": 11163010.0, "step": 69 }, { "aux_loss": 8.048367977142334, "entropy": 0.0460666548460722, "epoch": 1.6746987951807228, "grad_norm": 0.412992388010025, "learning_rate": 1.448575361945128e-06, "loss": 0.09151523560285568, "mean_token_accuracy": 0.9911079108715057, "num_tokens": 11326488.0, "step": 70 }, { "aux_loss": 8.047677040100098, "entropy": 0.039530523121356964, "epoch": 1.6987951807228916, "grad_norm": 0.3757312297821045, "learning_rate": 1.4485266928849028e-06, "loss": 0.08811481297016144, "mean_token_accuracy": 0.9917347729206085, "num_tokens": 11501286.0, "step": 71 }, { "aux_loss": 8.046856880187988, "entropy": 0.041672926396131516, "epoch": 1.7228915662650603, "grad_norm": 0.38275983929634094, "learning_rate": 1.448477208094734e-06, "loss": 0.08906584978103638, "mean_token_accuracy": 0.9918383359909058, "num_tokens": 11668188.0, "step": 72 }, { "aux_loss": 8.04528522491455, "entropy": 0.047908855602145195, "epoch": 1.7469879518072289, "grad_norm": 0.4008839726448059, "learning_rate": 1.4484269076864313e-06, "loss": 0.09260185062885284, "mean_token_accuracy": 0.9907302260398865, "num_tokens": 11834809.0, "step": 73 }, { "aux_loss": 8.047989845275879, "entropy": 0.049024928361177444, "epoch": 1.7710843373493976, "grad_norm": 0.43533122539520264, "learning_rate": 1.448375791773647e-06, "loss": 0.09409160912036896, "mean_token_accuracy": 0.9904188215732574, "num_tokens": 12004510.0, "step": 74 }, { "aux_loss": 8.045915126800537, "entropy": 0.05250510759651661, "epoch": 1.7951807228915664, "grad_norm": 0.4690086841583252, "learning_rate": 1.4483238604718765e-06, "loss": 0.0955488458275795, "mean_token_accuracy": 0.9906903803348541, "num_tokens": 12137534.0, "step": 75 }, { "aux_loss": 8.044984817504883, "entropy": 0.0376634681597352, "epoch": 1.819277108433735, "grad_norm": 0.35793742537498474, "learning_rate": 1.4482711138984564e-06, "loss": 0.08688877522945404, "mean_token_accuracy": 0.9927193224430084, "num_tokens": 12325369.0, "step": 76 }, { "aux_loss": 8.04779052734375, "entropy": 0.04571797512471676, "epoch": 1.8433734939759037, "grad_norm": 0.4300045371055603, "learning_rate": 1.4482175521725665e-06, "loss": 0.09217096120119095, "mean_token_accuracy": 0.9905279278755188, "num_tokens": 12488806.0, "step": 77 }, { "aux_loss": 8.044951915740967, "entropy": 0.05060774274170399, "epoch": 1.8674698795180724, "grad_norm": 0.423297643661499, "learning_rate": 1.4481631754152286e-06, "loss": 0.0944666936993599, "mean_token_accuracy": 0.990161120891571, "num_tokens": 12640695.0, "step": 78 }, { "aux_loss": 8.047436714172363, "entropy": 0.04260541498661041, "epoch": 1.891566265060241, "grad_norm": 0.39964279532432556, "learning_rate": 1.4481079837493048e-06, "loss": 0.08988695591688156, "mean_token_accuracy": 0.9916346371173859, "num_tokens": 12823930.0, "step": 79 }, { "aux_loss": 8.047076225280762, "entropy": 0.04447777755558491, "epoch": 1.9156626506024095, "grad_norm": 0.3796585202217102, "learning_rate": 1.4480519772994993e-06, "loss": 0.09115425497293472, "mean_token_accuracy": 0.9917284250259399, "num_tokens": 12998419.0, "step": 80 }, { "aux_loss": 8.04789924621582, "entropy": 0.04236619919538498, "epoch": 1.9397590361445785, "grad_norm": 0.418720543384552, "learning_rate": 1.4479951561923573e-06, "loss": 0.0903579443693161, "mean_token_accuracy": 0.9915480315685272, "num_tokens": 13148913.0, "step": 81 }, { "aux_loss": 8.045738697052002, "entropy": 0.04441889189183712, "epoch": 1.963855421686747, "grad_norm": 0.3862975835800171, "learning_rate": 1.4479375205562642e-06, "loss": 0.09073998779058456, "mean_token_accuracy": 0.9912832081317902, "num_tokens": 13304132.0, "step": 82 }, { "aux_loss": 8.046059608459473, "entropy": 0.05218968167901039, "epoch": 1.9879518072289155, "grad_norm": 0.4317293167114258, "learning_rate": 1.4478790705214464e-06, "loss": 0.09526760876178741, "mean_token_accuracy": 0.9900495111942291, "num_tokens": 13453623.0, "step": 83 }, { "aux_loss": 8.05069351196289, "entropy": 0.039391469210386276, "epoch": 2.0, "grad_norm": 0.6828374266624451, "learning_rate": 1.4478198062199706e-06, "loss": 0.05737518146634102, "mean_token_accuracy": 0.9917781352996826, "num_tokens": 13482926.0, "step": 84 } ], "logging_steps": 1, "max_steps": 2100, "num_input_tokens_seen": 0, "num_train_epochs": 50, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.7916711350774006e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }