{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0095, "eval_steps": 500, "global_step": 9500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "aux_loss": 8.092667961120606, "entropy": 0.2859670266509056, "epoch": 5e-06, "grad_norm": 2.4607067108154297, "learning_rate": 8.000000000000001e-07, "loss": 1.162985134124756, "mean_token_accuracy": 0.8323121547698975, "num_tokens": 81020.0, "step": 5 }, { "aux_loss": 8.10206651687622, "entropy": 0.3462228536605835, "epoch": 1e-05, "grad_norm": 2.7678725719451904, "learning_rate": 1.8000000000000001e-06, "loss": 1.4827698707580566, "mean_token_accuracy": 0.7950647979974746, "num_tokens": 162205.0, "step": 10 }, { "aux_loss": 8.108795881271362, "entropy": 0.38629237115383147, "epoch": 1.5e-05, "grad_norm": 3.27398681640625, "learning_rate": 2.8000000000000003e-06, "loss": 1.6987945556640625, "mean_token_accuracy": 0.7703906655311584, "num_tokens": 243180.0, "step": 15 }, { "aux_loss": 8.126577138900757, "entropy": 0.44169870764017105, "epoch": 2e-05, "grad_norm": 3.469611644744873, "learning_rate": 3.8000000000000005e-06, "loss": 1.8818172454833983, "mean_token_accuracy": 0.745928606390953, "num_tokens": 323659.0, "step": 20 }, { "aux_loss": 8.139866304397582, "entropy": 0.4981244429945946, "epoch": 2.5e-05, "grad_norm": 3.9781763553619385, "learning_rate": 4.800000000000001e-06, "loss": 1.963961410522461, "mean_token_accuracy": 0.7302836388349533, "num_tokens": 404012.0, "step": 25 }, { "aux_loss": 8.1594473361969, "entropy": 0.612455278635025, "epoch": 3e-05, "grad_norm": 4.717221736907959, "learning_rate": 5.8e-06, "loss": 2.052127647399902, "mean_token_accuracy": 0.702911964058876, "num_tokens": 484061.0, "step": 30 }, { "aux_loss": 8.10626163482666, "entropy": 0.43849745094776155, "epoch": 3.5e-05, "grad_norm": 1.3155338764190674, "learning_rate": 6.800000000000001e-06, "loss": 1.0553879737854004, "mean_token_accuracy": 0.8176445186138153, "num_tokens": 561596.0, "step": 35 }, { "aux_loss": 8.10414137840271, "entropy": 0.5332785502076149, "epoch": 4e-05, "grad_norm": 1.514621615409851, "learning_rate": 7.800000000000002e-06, "loss": 1.0922231674194336, "mean_token_accuracy": 0.7994577556848526, "num_tokens": 643068.0, "step": 40 }, { "aux_loss": 8.110194063186645, "entropy": 0.6411030411720275, "epoch": 4.5e-05, "grad_norm": 1.3585166931152344, "learning_rate": 8.8e-06, "loss": 1.1537811279296875, "mean_token_accuracy": 0.7801551461219788, "num_tokens": 723967.0, "step": 45 }, { "aux_loss": 8.122820091247558, "entropy": 0.762116265296936, "epoch": 5e-05, "grad_norm": 1.0342539548873901, "learning_rate": 9.800000000000001e-06, "loss": 1.17335844039917, "mean_token_accuracy": 0.7652206391096115, "num_tokens": 804455.0, "step": 50 }, { "aux_loss": 8.138481664657593, "entropy": 0.8767565250396728, "epoch": 5.5e-05, "grad_norm": 0.8618419766426086, "learning_rate": 1.0800000000000002e-05, "loss": 1.1562211990356446, "mean_token_accuracy": 0.7581683337688446, "num_tokens": 885084.0, "step": 55 }, { "aux_loss": 8.161038303375244, "entropy": 0.9870363444089889, "epoch": 6e-05, "grad_norm": 0.9211753010749817, "learning_rate": 1.18e-05, "loss": 1.1537209510803224, "mean_token_accuracy": 0.7541291087865829, "num_tokens": 965552.0, "step": 60 }, { "aux_loss": 8.108438205718993, "entropy": 0.6005895540118218, "epoch": 6.5e-05, "grad_norm": 0.5573590397834778, "learning_rate": 1.2800000000000001e-05, "loss": 0.6857633113861084, "mean_token_accuracy": 0.8443360924720764, "num_tokens": 1045440.0, "step": 65 }, { "aux_loss": 8.097761487960815, "entropy": 0.5134793236851692, "epoch": 7e-05, "grad_norm": 0.8289216756820679, "learning_rate": 1.38e-05, "loss": 0.6059335708618164, "mean_token_accuracy": 0.8547728210687637, "num_tokens": 1126198.0, "step": 70 }, { "aux_loss": 8.109341192245484, "entropy": 0.49506455659866333, "epoch": 7.5e-05, "grad_norm": 0.7367376089096069, "learning_rate": 1.48e-05, "loss": 0.5785280227661133, "mean_token_accuracy": 0.8590773671865464, "num_tokens": 1206891.0, "step": 75 }, { "aux_loss": 8.126173639297486, "entropy": 0.47545491009950636, "epoch": 8e-05, "grad_norm": 0.5796106457710266, "learning_rate": 1.58e-05, "loss": 0.5134618282318115, "mean_token_accuracy": 0.8742193549871444, "num_tokens": 1287594.0, "step": 80 }, { "aux_loss": 8.144159412384033, "entropy": 0.4454115808010101, "epoch": 8.5e-05, "grad_norm": 0.37113332748413086, "learning_rate": 1.6800000000000002e-05, "loss": 0.47019548416137696, "mean_token_accuracy": 0.8867231249809265, "num_tokens": 1368588.0, "step": 85 }, { "aux_loss": 8.16485824584961, "entropy": 0.42590916603803636, "epoch": 9e-05, "grad_norm": 0.37275785207748413, "learning_rate": 1.7800000000000002e-05, "loss": 0.4420657157897949, "mean_token_accuracy": 0.8914682984352111, "num_tokens": 1448962.0, "step": 90 }, { "aux_loss": 8.138917446136475, "entropy": 0.32791209444403646, "epoch": 9.5e-05, "grad_norm": 0.181448832154274, "learning_rate": 1.88e-05, "loss": 0.34783947467803955, "mean_token_accuracy": 0.911352476477623, "num_tokens": 1527530.0, "step": 95 }, { "aux_loss": 8.104297828674316, "entropy": 0.2813743956387043, "epoch": 0.0001, "grad_norm": 0.22963790595531464, "learning_rate": 1.98e-05, "loss": 0.31741673946380616, "mean_token_accuracy": 0.9149413764476776, "num_tokens": 1608627.0, "step": 100 }, { "aux_loss": 8.11442060470581, "entropy": 0.2937369041144848, "epoch": 0.000105, "grad_norm": 0.24627141654491425, "learning_rate": 2e-05, "loss": 0.32099955081939696, "mean_token_accuracy": 0.9122195959091186, "num_tokens": 1689020.0, "step": 105 }, { "aux_loss": 8.135867309570312, "entropy": 0.2759621672332287, "epoch": 0.00011, "grad_norm": 0.2679576873779297, "learning_rate": 2e-05, "loss": 0.3021723508834839, "mean_token_accuracy": 0.9157016634941101, "num_tokens": 1769747.0, "step": 110 }, { "aux_loss": 8.152368021011352, "entropy": 0.2531339399516582, "epoch": 0.000115, "grad_norm": 0.14514628052711487, "learning_rate": 2e-05, "loss": 0.2765481948852539, "mean_token_accuracy": 0.9218116343021393, "num_tokens": 1850938.0, "step": 115 }, { "aux_loss": 8.1763521194458, "entropy": 0.2417703628540039, "epoch": 0.00012, "grad_norm": 0.13516604900360107, "learning_rate": 2e-05, "loss": 0.26600430011749265, "mean_token_accuracy": 0.9240559995174408, "num_tokens": 1931354.0, "step": 120 }, { "aux_loss": 8.152435255050658, "entropy": 0.22490062788128853, "epoch": 0.000125, "grad_norm": 0.13898135721683502, "learning_rate": 2e-05, "loss": 0.2723809242248535, "mean_token_accuracy": 0.9253725618124008, "num_tokens": 2011951.0, "step": 125 }, { "aux_loss": 8.103985023498534, "entropy": 0.21289734095335006, "epoch": 0.00013, "grad_norm": 0.11599434912204742, "learning_rate": 2e-05, "loss": 0.2714021444320679, "mean_token_accuracy": 0.925862830877304, "num_tokens": 2093277.0, "step": 130 }, { "aux_loss": 8.117699193954468, "entropy": 0.23202661350369452, "epoch": 0.000135, "grad_norm": 0.11791031807661057, "learning_rate": 2e-05, "loss": 0.2785206317901611, "mean_token_accuracy": 0.9215139657258987, "num_tokens": 2174577.0, "step": 135 }, { "aux_loss": 8.131106090545654, "entropy": 0.22132659405469896, "epoch": 0.00014, "grad_norm": 0.09535504132509232, "learning_rate": 2e-05, "loss": 0.2573246002197266, "mean_token_accuracy": 0.925444370508194, "num_tokens": 2255453.0, "step": 140 }, { "aux_loss": 8.153035163879395, "entropy": 0.2323688253760338, "epoch": 0.000145, "grad_norm": 0.11295939981937408, "learning_rate": 2e-05, "loss": 0.2621062517166138, "mean_token_accuracy": 0.9242130070924759, "num_tokens": 2335773.0, "step": 145 }, { "aux_loss": 8.169135093688965, "entropy": 0.23263223320245743, "epoch": 0.00015, "grad_norm": 0.10522045195102692, "learning_rate": 2e-05, "loss": 0.267002010345459, "mean_token_accuracy": 0.9240644991397857, "num_tokens": 2416318.0, "step": 150 }, { "aux_loss": 8.183323335647582, "entropy": 0.2133930116891861, "epoch": 0.000155, "grad_norm": 0.11165736615657806, "learning_rate": 2e-05, "loss": 0.24688491821289063, "mean_token_accuracy": 0.9294364064931869, "num_tokens": 2496506.0, "step": 155 }, { "aux_loss": 8.095394563674926, "entropy": 0.19811301529407502, "epoch": 0.00016, "grad_norm": 0.12067431211471558, "learning_rate": 2e-05, "loss": 0.2500493288040161, "mean_token_accuracy": 0.9307984799146652, "num_tokens": 2577798.0, "step": 160 }, { "aux_loss": 8.118247032165527, "entropy": 0.2177561827003956, "epoch": 0.000165, "grad_norm": 0.11767563968896866, "learning_rate": 2e-05, "loss": 0.2695132255554199, "mean_token_accuracy": 0.9233422338962555, "num_tokens": 2659301.0, "step": 165 }, { "aux_loss": 8.132621622085571, "entropy": 0.22528393045067788, "epoch": 0.00017, "grad_norm": 0.1076337918639183, "learning_rate": 2e-05, "loss": 0.2669530391693115, "mean_token_accuracy": 0.9225011795759201, "num_tokens": 2740256.0, "step": 170 }, { "aux_loss": 8.148080205917358, "entropy": 0.22090085670351983, "epoch": 0.000175, "grad_norm": 0.10490445792675018, "learning_rate": 2e-05, "loss": 0.2574422836303711, "mean_token_accuracy": 0.9257927656173706, "num_tokens": 2820851.0, "step": 175 }, { "aux_loss": 8.163924217224121, "entropy": 0.22146919295191764, "epoch": 0.00018, "grad_norm": 0.1082926020026207, "learning_rate": 2e-05, "loss": 0.250842022895813, "mean_token_accuracy": 0.9289938122034073, "num_tokens": 2901081.0, "step": 180 }, { "aux_loss": 8.191630840301514, "entropy": 0.21994876563549043, "epoch": 0.000185, "grad_norm": 0.13312949240207672, "learning_rate": 2e-05, "loss": 0.24324214458465576, "mean_token_accuracy": 0.9298162490129471, "num_tokens": 2981067.0, "step": 185 }, { "aux_loss": 8.111298513412475, "entropy": 0.19961925223469734, "epoch": 0.00019, "grad_norm": 0.14753255248069763, "learning_rate": 2e-05, "loss": 0.25237910747528075, "mean_token_accuracy": 0.9300692468881607, "num_tokens": 3059730.0, "step": 190 }, { "aux_loss": 8.112194967269897, "entropy": 0.21024976968765258, "epoch": 0.000195, "grad_norm": 0.10278994590044022, "learning_rate": 2e-05, "loss": 0.2596331357955933, "mean_token_accuracy": 0.9263428509235382, "num_tokens": 3140878.0, "step": 195 }, { "aux_loss": 8.126857614517212, "entropy": 0.2193007118999958, "epoch": 0.0002, "grad_norm": 0.11093388497829437, "learning_rate": 2e-05, "loss": 0.2619086742401123, "mean_token_accuracy": 0.9256764084100724, "num_tokens": 3221992.0, "step": 200 }, { "aux_loss": 8.144866943359375, "entropy": 0.21325586959719658, "epoch": 0.000205, "grad_norm": 0.10353685915470123, "learning_rate": 2e-05, "loss": 0.2519110441207886, "mean_token_accuracy": 0.9273806542158127, "num_tokens": 3302738.0, "step": 205 }, { "aux_loss": 8.165263128280639, "entropy": 0.21110628470778464, "epoch": 0.00021, "grad_norm": 0.09743088483810425, "learning_rate": 2e-05, "loss": 0.23808212280273439, "mean_token_accuracy": 0.9318860292434692, "num_tokens": 3383596.0, "step": 210 }, { "aux_loss": 8.185856103897095, "entropy": 0.21532292664051056, "epoch": 0.000215, "grad_norm": 0.11625949293375015, "learning_rate": 2e-05, "loss": 0.23955197334289552, "mean_token_accuracy": 0.9299207180738449, "num_tokens": 3463857.0, "step": 215 }, { "aux_loss": 8.122901678085327, "entropy": 0.19247540533542634, "epoch": 0.00022, "grad_norm": 0.12606287002563477, "learning_rate": 2e-05, "loss": 0.23701121807098388, "mean_token_accuracy": 0.9341312944889069, "num_tokens": 3544682.0, "step": 220 }, { "aux_loss": 8.113785791397095, "entropy": 0.20620187148451805, "epoch": 0.000225, "grad_norm": 0.10787980258464813, "learning_rate": 2e-05, "loss": 0.2567843198776245, "mean_token_accuracy": 0.9279820889234542, "num_tokens": 3625248.0, "step": 225 }, { "aux_loss": 8.12384238243103, "entropy": 0.21107216626405717, "epoch": 0.00023, "grad_norm": 0.10271225869655609, "learning_rate": 2e-05, "loss": 0.2494570255279541, "mean_token_accuracy": 0.9288909673690796, "num_tokens": 3706159.0, "step": 230 }, { "aux_loss": 8.142868852615356, "entropy": 0.21522793173789978, "epoch": 0.000235, "grad_norm": 0.10796686261892319, "learning_rate": 2e-05, "loss": 0.24782259464263917, "mean_token_accuracy": 0.9284009218215943, "num_tokens": 3786934.0, "step": 235 }, { "aux_loss": 8.161288928985595, "entropy": 0.21401349380612372, "epoch": 0.00024, "grad_norm": 0.10282823443412781, "learning_rate": 2e-05, "loss": 0.23868253231048583, "mean_token_accuracy": 0.9310090273618699, "num_tokens": 3867737.0, "step": 240 }, { "aux_loss": 8.182607841491699, "entropy": 0.20493827313184737, "epoch": 0.000245, "grad_norm": 0.11914316564798355, "learning_rate": 2e-05, "loss": 0.2305370330810547, "mean_token_accuracy": 0.933690196275711, "num_tokens": 3948051.0, "step": 245 }, { "aux_loss": 8.1415030002594, "entropy": 0.1825829602777958, "epoch": 0.00025, "grad_norm": 0.11836111545562744, "learning_rate": 2e-05, "loss": 0.22231316566467285, "mean_token_accuracy": 0.9372205168008805, "num_tokens": 4027476.0, "step": 250 }, { "aux_loss": 8.11691393852234, "entropy": 0.19727027863264085, "epoch": 0.000255, "grad_norm": 0.12442458420991898, "learning_rate": 2e-05, "loss": 0.2484445333480835, "mean_token_accuracy": 0.9305040508508682, "num_tokens": 4107946.0, "step": 255 }, { "aux_loss": 8.125603771209716, "entropy": 0.20766830518841745, "epoch": 0.00026, "grad_norm": 0.09718529134988785, "learning_rate": 2e-05, "loss": 0.25551691055297854, "mean_token_accuracy": 0.9271604478359222, "num_tokens": 4188909.0, "step": 260 }, { "aux_loss": 8.1395188331604, "entropy": 0.20430102646350862, "epoch": 0.000265, "grad_norm": 0.10315221548080444, "learning_rate": 2e-05, "loss": 0.23392271995544434, "mean_token_accuracy": 0.9329472333192825, "num_tokens": 4269781.0, "step": 265 }, { "aux_loss": 8.156323575973511, "entropy": 0.20779709219932557, "epoch": 0.00027, "grad_norm": 0.10915031284093857, "learning_rate": 2e-05, "loss": 0.23439457416534423, "mean_token_accuracy": 0.9330718845129014, "num_tokens": 4350638.0, "step": 270 }, { "aux_loss": 8.177580308914184, "entropy": 0.20390753895044328, "epoch": 0.000275, "grad_norm": 0.11818801611661911, "learning_rate": 2e-05, "loss": 0.22784197330474854, "mean_token_accuracy": 0.9339498370885849, "num_tokens": 4430597.0, "step": 275 }, { "aux_loss": 8.151418304443359, "entropy": 0.18322188295423986, "epoch": 0.00028, "grad_norm": 0.12752026319503784, "learning_rate": 2e-05, "loss": 0.2191540241241455, "mean_token_accuracy": 0.9375271767377853, "num_tokens": 4509115.0, "step": 280 }, { "aux_loss": 8.10854730606079, "entropy": 0.2067515507340431, "epoch": 0.000285, "grad_norm": 0.1464259922504425, "learning_rate": 2e-05, "loss": 0.26910512447357177, "mean_token_accuracy": 0.9251548409461975, "num_tokens": 4589888.0, "step": 285 }, { "aux_loss": 8.123592424392701, "entropy": 0.21190579310059549, "epoch": 0.00029, "grad_norm": 0.12418748438358307, "learning_rate": 2e-05, "loss": 0.24806389808654786, "mean_token_accuracy": 0.9289951413869858, "num_tokens": 4670831.0, "step": 290 }, { "aux_loss": 8.134210300445556, "entropy": 0.2096714936196804, "epoch": 0.000295, "grad_norm": 0.09857596457004547, "learning_rate": 2e-05, "loss": 0.24017581939697266, "mean_token_accuracy": 0.931833091378212, "num_tokens": 4751506.0, "step": 295 }, { "aux_loss": 8.1527024269104, "entropy": 0.2133574441075325, "epoch": 0.0003, "grad_norm": 0.12382720410823822, "learning_rate": 2e-05, "loss": 0.23982751369476318, "mean_token_accuracy": 0.9317940264940262, "num_tokens": 4832077.0, "step": 300 }, { "aux_loss": 8.172873163223267, "entropy": 0.2010139726102352, "epoch": 0.000305, "grad_norm": 0.1136835366487503, "learning_rate": 2e-05, "loss": 0.2233577013015747, "mean_token_accuracy": 0.9361098736524582, "num_tokens": 4913061.0, "step": 305 }, { "aux_loss": 8.17594952583313, "entropy": 0.1964607909321785, "epoch": 0.00031, "grad_norm": 0.14149561524391174, "learning_rate": 2e-05, "loss": 0.2333085536956787, "mean_token_accuracy": 0.9334494590759277, "num_tokens": 4989644.0, "step": 310 }, { "aux_loss": 8.103254461288453, "entropy": 0.1957407720386982, "epoch": 0.000315, "grad_norm": 0.13898971676826477, "learning_rate": 2e-05, "loss": 0.2496751070022583, "mean_token_accuracy": 0.9303697794675827, "num_tokens": 5070985.0, "step": 315 }, { "aux_loss": 8.121169662475586, "entropy": 0.21436288058757783, "epoch": 0.00032, "grad_norm": 0.10650767385959625, "learning_rate": 2e-05, "loss": 0.2578300476074219, "mean_token_accuracy": 0.9276322662830353, "num_tokens": 5151799.0, "step": 320 }, { "aux_loss": 8.133362054824829, "entropy": 0.20707877054810525, "epoch": 0.000325, "grad_norm": 0.10141773521900177, "learning_rate": 2e-05, "loss": 0.2367786169052124, "mean_token_accuracy": 0.9322249799966812, "num_tokens": 5232787.0, "step": 325 }, { "aux_loss": 8.152495861053467, "entropy": 0.20323231145739556, "epoch": 0.00033, "grad_norm": 0.1185888797044754, "learning_rate": 2e-05, "loss": 0.231177020072937, "mean_token_accuracy": 0.9329827636480331, "num_tokens": 5313384.0, "step": 330 }, { "aux_loss": 8.174307060241699, "entropy": 0.19869768768548965, "epoch": 0.000335, "grad_norm": 0.11668054759502411, "learning_rate": 2e-05, "loss": 0.2284449815750122, "mean_token_accuracy": 0.934393760561943, "num_tokens": 5394275.0, "step": 335 }, { "aux_loss": 8.171902513504028, "entropy": 0.19377838149666787, "epoch": 0.00034, "grad_norm": 0.12018025666475296, "learning_rate": 2e-05, "loss": 0.22451364994049072, "mean_token_accuracy": 0.9363054871559143, "num_tokens": 5472436.0, "step": 340 }, { "aux_loss": 8.103836250305175, "entropy": 0.2022476501762867, "epoch": 0.000345, "grad_norm": 0.12494606524705887, "learning_rate": 2e-05, "loss": 0.2549619436264038, "mean_token_accuracy": 0.9293957650661469, "num_tokens": 5553488.0, "step": 345 }, { "aux_loss": 8.11767029762268, "entropy": 0.20732319429516793, "epoch": 0.00035, "grad_norm": 0.10775358974933624, "learning_rate": 2e-05, "loss": 0.2460080623626709, "mean_token_accuracy": 0.9307799786329269, "num_tokens": 5634296.0, "step": 350 }, { "aux_loss": 8.13014645576477, "entropy": 0.20114240497350694, "epoch": 0.000355, "grad_norm": 0.10871438682079315, "learning_rate": 2e-05, "loss": 0.23498148918151857, "mean_token_accuracy": 0.9330670058727264, "num_tokens": 5714763.0, "step": 355 }, { "aux_loss": 8.151902627944946, "entropy": 0.19216700047254562, "epoch": 0.00036, "grad_norm": 0.1080172136425972, "learning_rate": 2e-05, "loss": 0.21803610324859618, "mean_token_accuracy": 0.9378397405147553, "num_tokens": 5795149.0, "step": 360 }, { "aux_loss": 8.171459436416626, "entropy": 0.20071458742022513, "epoch": 0.000365, "grad_norm": 0.11842406541109085, "learning_rate": 2e-05, "loss": 0.23490922451019286, "mean_token_accuracy": 0.9331449836492538, "num_tokens": 5875713.0, "step": 365 }, { "aux_loss": 8.188628768920898, "entropy": 0.18819867298007012, "epoch": 0.00037, "grad_norm": 0.11708404123783112, "learning_rate": 2e-05, "loss": 0.21983647346496582, "mean_token_accuracy": 0.9381567299365997, "num_tokens": 5955091.0, "step": 370 }, { "aux_loss": 8.103630065917969, "entropy": 0.17806926667690276, "epoch": 0.000375, "grad_norm": 0.11385245621204376, "learning_rate": 2e-05, "loss": 0.2229466438293457, "mean_token_accuracy": 0.9370234042406083, "num_tokens": 6036204.0, "step": 375 }, { "aux_loss": 8.118957471847533, "entropy": 0.19929006695747375, "epoch": 0.00038, "grad_norm": 0.11459151655435562, "learning_rate": 2e-05, "loss": 0.24367763996124267, "mean_token_accuracy": 0.9314134418964386, "num_tokens": 6117453.0, "step": 380 }, { "aux_loss": 8.131189393997193, "entropy": 0.19944887161254882, "epoch": 0.000385, "grad_norm": 0.11293925344944, "learning_rate": 2e-05, "loss": 0.23520164489746093, "mean_token_accuracy": 0.932736599445343, "num_tokens": 6198381.0, "step": 385 }, { "aux_loss": 8.145823335647583, "entropy": 0.20357693061232568, "epoch": 0.00039, "grad_norm": 0.1089092567563057, "learning_rate": 2e-05, "loss": 0.22967128753662108, "mean_token_accuracy": 0.9340643346309662, "num_tokens": 6279079.0, "step": 390 }, { "aux_loss": 8.167986011505127, "entropy": 0.1950391486287117, "epoch": 0.000395, "grad_norm": 0.11145143955945969, "learning_rate": 2e-05, "loss": 0.22251276969909667, "mean_token_accuracy": 0.9362853616476059, "num_tokens": 6359105.0, "step": 395 }, { "aux_loss": 8.193504858016968, "entropy": 0.19332419708371162, "epoch": 0.0004, "grad_norm": 0.1461859792470932, "learning_rate": 2e-05, "loss": 0.22106502056121827, "mean_token_accuracy": 0.9367363721132278, "num_tokens": 6439228.0, "step": 400 }, { "aux_loss": 8.104427671432495, "entropy": 0.18344127163290977, "epoch": 0.000405, "grad_norm": 0.1249011904001236, "learning_rate": 2e-05, "loss": 0.22748680114746095, "mean_token_accuracy": 0.9364313662052155, "num_tokens": 6519620.0, "step": 405 }, { "aux_loss": 8.115176773071289, "entropy": 0.1931718721985817, "epoch": 0.00041, "grad_norm": 0.11378726363182068, "learning_rate": 2e-05, "loss": 0.23756885528564453, "mean_token_accuracy": 0.9335996091365815, "num_tokens": 6600777.0, "step": 410 }, { "aux_loss": 8.128407907485961, "entropy": 0.2001208856701851, "epoch": 0.000415, "grad_norm": 0.11233960092067719, "learning_rate": 2e-05, "loss": 0.2344135284423828, "mean_token_accuracy": 0.9312853068113327, "num_tokens": 6681796.0, "step": 415 }, { "aux_loss": 8.14580340385437, "entropy": 0.19529841765761374, "epoch": 0.00042, "grad_norm": 0.12032654881477356, "learning_rate": 2e-05, "loss": 0.22535357475280762, "mean_token_accuracy": 0.9345941811800003, "num_tokens": 6762546.0, "step": 420 }, { "aux_loss": 8.167212009429932, "entropy": 0.20289452597498894, "epoch": 0.000425, "grad_norm": 0.11672218888998032, "learning_rate": 2e-05, "loss": 0.22811779975891114, "mean_token_accuracy": 0.9348306357860565, "num_tokens": 6843084.0, "step": 425 }, { "aux_loss": 8.18767786026001, "entropy": 0.18519736900925637, "epoch": 0.00043, "grad_norm": 0.12846212089061737, "learning_rate": 2e-05, "loss": 0.21719591617584227, "mean_token_accuracy": 0.9371245980262757, "num_tokens": 6923337.0, "step": 430 }, { "aux_loss": 8.120493125915527, "entropy": 0.1844749353826046, "epoch": 0.000435, "grad_norm": 0.14547668397426605, "learning_rate": 2e-05, "loss": 0.23188719749450684, "mean_token_accuracy": 0.9346409678459168, "num_tokens": 7002600.0, "step": 435 }, { "aux_loss": 8.116820049285888, "entropy": 0.20214365869760514, "epoch": 0.00044, "grad_norm": 0.1273147016763687, "learning_rate": 2e-05, "loss": 0.24130103588104249, "mean_token_accuracy": 0.9309691965579987, "num_tokens": 7083762.0, "step": 440 }, { "aux_loss": 8.130047225952149, "entropy": 0.21163361221551896, "epoch": 0.000445, "grad_norm": 0.11172276735305786, "learning_rate": 2e-05, "loss": 0.24803059101104735, "mean_token_accuracy": 0.9303495198488235, "num_tokens": 7164904.0, "step": 445 }, { "aux_loss": 8.146463441848756, "entropy": 0.20141847357153891, "epoch": 0.00045, "grad_norm": 0.11067729443311691, "learning_rate": 2e-05, "loss": 0.2322296380996704, "mean_token_accuracy": 0.934284684062004, "num_tokens": 7245505.0, "step": 450 }, { "aux_loss": 8.159644889831544, "entropy": 0.19601927921175957, "epoch": 0.000455, "grad_norm": 0.11938250809907913, "learning_rate": 2e-05, "loss": 0.22233147621154786, "mean_token_accuracy": 0.9349738001823426, "num_tokens": 7325901.0, "step": 455 }, { "aux_loss": 8.181401491165161, "entropy": 0.188271477073431, "epoch": 0.00046, "grad_norm": 0.13487257063388824, "learning_rate": 2e-05, "loss": 0.213454270362854, "mean_token_accuracy": 0.9380605906248093, "num_tokens": 7405893.0, "step": 460 }, { "aux_loss": 8.13626651763916, "entropy": 0.17855463474988936, "epoch": 0.000465, "grad_norm": 0.14394786953926086, "learning_rate": 2e-05, "loss": 0.22088232040405273, "mean_token_accuracy": 0.9383244127035141, "num_tokens": 7484471.0, "step": 465 }, { "aux_loss": 8.11563949584961, "entropy": 0.19367720708251, "epoch": 0.00047, "grad_norm": 0.12225597351789474, "learning_rate": 2e-05, "loss": 0.2356712579727173, "mean_token_accuracy": 0.9334611773490906, "num_tokens": 7565565.0, "step": 470 }, { "aux_loss": 8.126933383941651, "entropy": 0.19567672535777092, "epoch": 0.000475, "grad_norm": 0.10960134863853455, "learning_rate": 2e-05, "loss": 0.2261427640914917, "mean_token_accuracy": 0.9353327989578247, "num_tokens": 7646830.0, "step": 475 }, { "aux_loss": 8.141116952896118, "entropy": 0.19941989183425904, "epoch": 0.00048, "grad_norm": 0.1227649673819542, "learning_rate": 2e-05, "loss": 0.228026819229126, "mean_token_accuracy": 0.935494351387024, "num_tokens": 7727875.0, "step": 480 }, { "aux_loss": 8.162264680862426, "entropy": 0.19571123644709587, "epoch": 0.000485, "grad_norm": 0.12896135449409485, "learning_rate": 2e-05, "loss": 0.229170560836792, "mean_token_accuracy": 0.9355918109416962, "num_tokens": 7808288.0, "step": 485 }, { "aux_loss": 8.186082220077514, "entropy": 0.18303756937384605, "epoch": 0.00049, "grad_norm": 0.12394686043262482, "learning_rate": 2e-05, "loss": 0.20925889015197754, "mean_token_accuracy": 0.9398917376995086, "num_tokens": 7888831.0, "step": 490 }, { "aux_loss": 8.130529880523682, "entropy": 0.17214761935174466, "epoch": 0.000495, "grad_norm": 0.12712115049362183, "learning_rate": 2e-05, "loss": 0.21500439643859864, "mean_token_accuracy": 0.9404178261756897, "num_tokens": 7967750.0, "step": 495 }, { "aux_loss": 8.108060312271117, "entropy": 0.21055722162127494, "epoch": 0.0005, "grad_norm": 0.13972988724708557, "learning_rate": 2e-05, "loss": 0.2587005615234375, "mean_token_accuracy": 0.9271103173494339, "num_tokens": 8049056.0, "step": 500 }, { "aux_loss": 8.123171758651733, "entropy": 0.2044980011880398, "epoch": 0.000505, "grad_norm": 0.11161034554243088, "learning_rate": 2e-05, "loss": 0.23147244453430177, "mean_token_accuracy": 0.9337287068367004, "num_tokens": 8130294.0, "step": 505 }, { "aux_loss": 8.136773443222046, "entropy": 0.19301708787679672, "epoch": 0.00051, "grad_norm": 0.11636194586753845, "learning_rate": 2e-05, "loss": 0.2207319736480713, "mean_token_accuracy": 0.9375490337610245, "num_tokens": 8210854.0, "step": 510 }, { "aux_loss": 8.149327182769776, "entropy": 0.18693748190999032, "epoch": 0.000515, "grad_norm": 0.13859185576438904, "learning_rate": 2e-05, "loss": 0.22074565887451172, "mean_token_accuracy": 0.9367436707019806, "num_tokens": 8291598.0, "step": 515 }, { "aux_loss": 8.175821590423585, "entropy": 0.1823076017200947, "epoch": 0.00052, "grad_norm": 0.14429710805416107, "learning_rate": 2e-05, "loss": 0.21230535507202147, "mean_token_accuracy": 0.9388055384159089, "num_tokens": 8371590.0, "step": 520 }, { "aux_loss": 8.148676204681397, "entropy": 0.18088727369904517, "epoch": 0.000525, "grad_norm": 0.1233874037861824, "learning_rate": 2e-05, "loss": 0.2183612823486328, "mean_token_accuracy": 0.9389139652252197, "num_tokens": 8448788.0, "step": 525 }, { "aux_loss": 8.11525845527649, "entropy": 0.1864571325480938, "epoch": 0.00053, "grad_norm": 0.12095758318901062, "learning_rate": 2e-05, "loss": 0.22606940269470216, "mean_token_accuracy": 0.9359039962291718, "num_tokens": 8530095.0, "step": 530 }, { "aux_loss": 8.119484186172485, "entropy": 0.2005111776292324, "epoch": 0.000535, "grad_norm": 0.12065824866294861, "learning_rate": 2e-05, "loss": 0.23620870113372802, "mean_token_accuracy": 0.9338431239128113, "num_tokens": 8610731.0, "step": 535 }, { "aux_loss": 8.133606958389283, "entropy": 0.19584577158093452, "epoch": 0.00054, "grad_norm": 0.12134315818548203, "learning_rate": 2e-05, "loss": 0.22811131477355956, "mean_token_accuracy": 0.93468978703022, "num_tokens": 8691103.0, "step": 540 }, { "aux_loss": 8.153080463409424, "entropy": 0.19136801436543466, "epoch": 0.000545, "grad_norm": 0.13523323833942413, "learning_rate": 2e-05, "loss": 0.22138473987579346, "mean_token_accuracy": 0.9364001035690308, "num_tokens": 8771839.0, "step": 545 }, { "aux_loss": 8.168652248382568, "entropy": 0.1879940316081047, "epoch": 0.00055, "grad_norm": 0.13683131337165833, "learning_rate": 2e-05, "loss": 0.21518070697784425, "mean_token_accuracy": 0.9380461663007736, "num_tokens": 8852541.0, "step": 550 }, { "aux_loss": 8.163324642181397, "entropy": 0.1806576546281576, "epoch": 0.000555, "grad_norm": 0.12295546382665634, "learning_rate": 2e-05, "loss": 0.21502649784088135, "mean_token_accuracy": 0.9389211475849152, "num_tokens": 8930934.0, "step": 555 }, { "aux_loss": 8.106051921844482, "entropy": 0.17880526185035706, "epoch": 0.00056, "grad_norm": 0.1354513019323349, "learning_rate": 2e-05, "loss": 0.2253559112548828, "mean_token_accuracy": 0.9372707158327103, "num_tokens": 9012314.0, "step": 560 }, { "aux_loss": 8.11518898010254, "entropy": 0.20097925364971161, "epoch": 0.000565, "grad_norm": 0.1232772096991539, "learning_rate": 2e-05, "loss": 0.24141240119934082, "mean_token_accuracy": 0.9333308070898056, "num_tokens": 9093472.0, "step": 565 }, { "aux_loss": 8.129575252532959, "entropy": 0.2135834276676178, "epoch": 0.00057, "grad_norm": 0.12575826048851013, "learning_rate": 2e-05, "loss": 0.2407468318939209, "mean_token_accuracy": 0.9321556568145752, "num_tokens": 9174479.0, "step": 570 }, { "aux_loss": 8.141605377197266, "entropy": 0.1949714571237564, "epoch": 0.000575, "grad_norm": 0.12399072200059891, "learning_rate": 2e-05, "loss": 0.22630493640899657, "mean_token_accuracy": 0.9361388981342316, "num_tokens": 9255274.0, "step": 575 }, { "aux_loss": 8.161956882476806, "entropy": 0.18306322023272514, "epoch": 0.00058, "grad_norm": 0.1358226090669632, "learning_rate": 2e-05, "loss": 0.21267693042755126, "mean_token_accuracy": 0.9395399630069733, "num_tokens": 9336087.0, "step": 580 }, { "aux_loss": 8.178706502914428, "entropy": 0.17525342367589475, "epoch": 0.000585, "grad_norm": 0.13497048616409302, "learning_rate": 2e-05, "loss": 0.20523464679718018, "mean_token_accuracy": 0.9408984541893005, "num_tokens": 9415415.0, "step": 585 }, { "aux_loss": 8.097288703918457, "entropy": 0.17932368852198124, "epoch": 0.00059, "grad_norm": 0.13442210853099823, "learning_rate": 2e-05, "loss": 0.22426512241363525, "mean_token_accuracy": 0.9379236102104187, "num_tokens": 9496545.0, "step": 590 }, { "aux_loss": 8.115752935409546, "entropy": 0.1957818239927292, "epoch": 0.000595, "grad_norm": 0.1318245828151703, "learning_rate": 2e-05, "loss": 0.23539261817932128, "mean_token_accuracy": 0.9342283546924591, "num_tokens": 9577562.0, "step": 595 }, { "aux_loss": 8.121268844604492, "entropy": 0.20243508517742156, "epoch": 0.0006, "grad_norm": 0.12045804411172867, "learning_rate": 2e-05, "loss": 0.2283019781112671, "mean_token_accuracy": 0.9349256962537765, "num_tokens": 9658735.0, "step": 600 }, { "aux_loss": 8.138788747787476, "entropy": 0.19625149294734, "epoch": 0.000605, "grad_norm": 0.1283811777830124, "learning_rate": 2e-05, "loss": 0.22196848392486573, "mean_token_accuracy": 0.936600586771965, "num_tokens": 9739325.0, "step": 605 }, { "aux_loss": 8.153925466537476, "entropy": 0.1859537072479725, "epoch": 0.00061, "grad_norm": 0.1319660097360611, "learning_rate": 2e-05, "loss": 0.21823840141296386, "mean_token_accuracy": 0.9378139019012451, "num_tokens": 9819316.0, "step": 610 }, { "aux_loss": 8.181534004211425, "entropy": 0.1830529935657978, "epoch": 0.000615, "grad_norm": 0.1498909741640091, "learning_rate": 2e-05, "loss": 0.21233899593353273, "mean_token_accuracy": 0.9398808598518371, "num_tokens": 9899847.0, "step": 615 }, { "aux_loss": 8.115496301651001, "entropy": 0.1680178303271532, "epoch": 0.00062, "grad_norm": 0.13132670521736145, "learning_rate": 2e-05, "loss": 0.2065460205078125, "mean_token_accuracy": 0.9419705748558045, "num_tokens": 9979438.0, "step": 620 }, { "aux_loss": 8.112633323669433, "entropy": 0.19637811034917832, "epoch": 0.000625, "grad_norm": 0.11578872054815292, "learning_rate": 2e-05, "loss": 0.23919968605041503, "mean_token_accuracy": 0.9333801180124283, "num_tokens": 10060958.0, "step": 625 }, { "aux_loss": 8.12286148071289, "entropy": 0.20346488654613495, "epoch": 0.00063, "grad_norm": 0.11164384335279465, "learning_rate": 2e-05, "loss": 0.23783347606658936, "mean_token_accuracy": 0.9328191936016083, "num_tokens": 10141992.0, "step": 630 }, { "aux_loss": 8.13811559677124, "entropy": 0.19954773262143136, "epoch": 0.000635, "grad_norm": 0.12549450993537903, "learning_rate": 2e-05, "loss": 0.22470993995666505, "mean_token_accuracy": 0.9348821938037872, "num_tokens": 10222969.0, "step": 635 }, { "aux_loss": 8.154943752288819, "entropy": 0.1856667123734951, "epoch": 0.00064, "grad_norm": 0.1315392553806305, "learning_rate": 2e-05, "loss": 0.21411411762237548, "mean_token_accuracy": 0.9383790761232376, "num_tokens": 10303283.0, "step": 640 }, { "aux_loss": 8.175086259841919, "entropy": 0.18237411677837373, "epoch": 0.000645, "grad_norm": 0.13341780006885529, "learning_rate": 2e-05, "loss": 0.21301708221435547, "mean_token_accuracy": 0.9392763644456863, "num_tokens": 10383851.0, "step": 645 }, { "aux_loss": 8.12028365135193, "entropy": 0.17168023064732552, "epoch": 0.00065, "grad_norm": 0.13317014276981354, "learning_rate": 2e-05, "loss": 0.21729826927185059, "mean_token_accuracy": 0.9406512379646301, "num_tokens": 10461204.0, "step": 650 }, { "aux_loss": 8.111561059951782, "entropy": 0.2008303001523018, "epoch": 0.000655, "grad_norm": 0.13740909099578857, "learning_rate": 2e-05, "loss": 0.24498250484466552, "mean_token_accuracy": 0.9311482429504394, "num_tokens": 10542394.0, "step": 655 }, { "aux_loss": 8.121409940719605, "entropy": 0.2036907948553562, "epoch": 0.00066, "grad_norm": 0.11630047112703323, "learning_rate": 2e-05, "loss": 0.22815239429473877, "mean_token_accuracy": 0.9339557975530625, "num_tokens": 10623242.0, "step": 660 }, { "aux_loss": 8.135656070709228, "entropy": 0.1957025058567524, "epoch": 0.000665, "grad_norm": 0.11823663860559464, "learning_rate": 2e-05, "loss": 0.22408857345581054, "mean_token_accuracy": 0.9361691862344742, "num_tokens": 10703802.0, "step": 665 }, { "aux_loss": 8.155420827865601, "entropy": 0.19255246967077255, "epoch": 0.00067, "grad_norm": 0.1313610076904297, "learning_rate": 2e-05, "loss": 0.2256295919418335, "mean_token_accuracy": 0.9346400886774063, "num_tokens": 10784336.0, "step": 670 }, { "aux_loss": 8.172291088104249, "entropy": 0.1758721239864826, "epoch": 0.000675, "grad_norm": 0.12752971053123474, "learning_rate": 2e-05, "loss": 0.20256171226501465, "mean_token_accuracy": 0.9408331990242005, "num_tokens": 10864297.0, "step": 675 }, { "aux_loss": 8.12908205986023, "entropy": 0.1669745821505785, "epoch": 0.00068, "grad_norm": 0.1285611391067505, "learning_rate": 2e-05, "loss": 0.20708107948303223, "mean_token_accuracy": 0.9414781242609024, "num_tokens": 10944480.0, "step": 680 }, { "aux_loss": 8.110326957702636, "entropy": 0.19593036100268363, "epoch": 0.000685, "grad_norm": 0.1288689821958542, "learning_rate": 2e-05, "loss": 0.2419433116912842, "mean_token_accuracy": 0.9323927283287048, "num_tokens": 11025645.0, "step": 685 }, { "aux_loss": 8.118507814407348, "entropy": 0.20737494602799417, "epoch": 0.00069, "grad_norm": 0.12270528078079224, "learning_rate": 2e-05, "loss": 0.24025404453277588, "mean_token_accuracy": 0.9311066091060638, "num_tokens": 11106719.0, "step": 690 }, { "aux_loss": 8.131222677230834, "entropy": 0.19384507685899735, "epoch": 0.000695, "grad_norm": 0.11885134130716324, "learning_rate": 2e-05, "loss": 0.22150125503540039, "mean_token_accuracy": 0.9368506163358689, "num_tokens": 11187483.0, "step": 695 }, { "aux_loss": 8.152690219879151, "entropy": 0.1862498939037323, "epoch": 0.0007, "grad_norm": 0.13085342943668365, "learning_rate": 2e-05, "loss": 0.21512579917907715, "mean_token_accuracy": 0.9381736785173416, "num_tokens": 11267923.0, "step": 700 }, { "aux_loss": 8.175735139846802, "entropy": 0.18144834637641907, "epoch": 0.000705, "grad_norm": 0.157309427857399, "learning_rate": 2e-05, "loss": 0.21283621788024903, "mean_token_accuracy": 0.9390768080949783, "num_tokens": 11348330.0, "step": 705 }, { "aux_loss": 8.131483697891236, "entropy": 0.169484831020236, "epoch": 0.00071, "grad_norm": 0.12376774102449417, "learning_rate": 2e-05, "loss": 0.20716946125030516, "mean_token_accuracy": 0.942305651307106, "num_tokens": 11427342.0, "step": 710 }, { "aux_loss": 8.102163362503052, "entropy": 0.20284102559089662, "epoch": 0.000715, "grad_norm": 0.1368631273508072, "learning_rate": 2e-05, "loss": 0.2438335657119751, "mean_token_accuracy": 0.9310838371515274, "num_tokens": 11508525.0, "step": 715 }, { "aux_loss": 8.116524744033814, "entropy": 0.1933087445795536, "epoch": 0.00072, "grad_norm": 0.11646907031536102, "learning_rate": 2e-05, "loss": 0.22562990188598633, "mean_token_accuracy": 0.9347972393035888, "num_tokens": 11589651.0, "step": 720 }, { "aux_loss": 8.130318403244019, "entropy": 0.20118043795228005, "epoch": 0.000725, "grad_norm": 0.12211769074201584, "learning_rate": 2e-05, "loss": 0.22835359573364258, "mean_token_accuracy": 0.9346433848142623, "num_tokens": 11670537.0, "step": 725 }, { "aux_loss": 8.145296144485474, "entropy": 0.18327361345291138, "epoch": 0.00073, "grad_norm": 0.14909130334854126, "learning_rate": 2e-05, "loss": 0.22180075645446778, "mean_token_accuracy": 0.9366574764251709, "num_tokens": 11751080.0, "step": 730 }, { "aux_loss": 8.16052017211914, "entropy": 0.17084143832325935, "epoch": 0.000735, "grad_norm": 0.14019134640693665, "learning_rate": 2e-05, "loss": 0.2031708002090454, "mean_token_accuracy": 0.9429173946380616, "num_tokens": 11831584.0, "step": 735 }, { "aux_loss": 8.145300006866455, "entropy": 0.16553889848291875, "epoch": 0.00074, "grad_norm": 0.12312433123588562, "learning_rate": 2e-05, "loss": 0.1950891613960266, "mean_token_accuracy": 0.945001271367073, "num_tokens": 11912161.0, "step": 740 }, { "aux_loss": 8.100783348083496, "entropy": 0.18602003231644632, "epoch": 0.000745, "grad_norm": 0.16615012288093567, "learning_rate": 2e-05, "loss": 0.23647782802581788, "mean_token_accuracy": 0.9346523225307465, "num_tokens": 11993125.0, "step": 745 }, { "aux_loss": 8.119870710372926, "entropy": 0.20997865498065948, "epoch": 0.00075, "grad_norm": 0.12530550360679626, "learning_rate": 2e-05, "loss": 0.2479936122894287, "mean_token_accuracy": 0.9292480409145355, "num_tokens": 12074082.0, "step": 750 }, { "aux_loss": 8.132441186904908, "entropy": 0.20384614467620848, "epoch": 0.000755, "grad_norm": 0.14014708995819092, "learning_rate": 2e-05, "loss": 0.2232731342315674, "mean_token_accuracy": 0.9353633552789689, "num_tokens": 12154977.0, "step": 755 }, { "aux_loss": 8.147329187393188, "entropy": 0.1960611179471016, "epoch": 0.00076, "grad_norm": 0.141123428940773, "learning_rate": 2e-05, "loss": 0.2233285427093506, "mean_token_accuracy": 0.9361371099948883, "num_tokens": 12235552.0, "step": 760 }, { "aux_loss": 8.164418029785157, "entropy": 0.177785038203001, "epoch": 0.000765, "grad_norm": 0.13308079540729523, "learning_rate": 2e-05, "loss": 0.21046712398529052, "mean_token_accuracy": 0.9409039944410325, "num_tokens": 12316296.0, "step": 765 }, { "aux_loss": 8.148503684997559, "entropy": 0.17363472767174243, "epoch": 0.00077, "grad_norm": 0.14745160937309265, "learning_rate": 2e-05, "loss": 0.20947306156158446, "mean_token_accuracy": 0.9408982396125793, "num_tokens": 12396200.0, "step": 770 }, { "aux_loss": 8.100437784194947, "entropy": 0.18707914352416993, "epoch": 0.000775, "grad_norm": 0.13240523636341095, "learning_rate": 2e-05, "loss": 0.23113799095153809, "mean_token_accuracy": 0.9352542102336884, "num_tokens": 12477581.0, "step": 775 }, { "aux_loss": 8.109345197677612, "entropy": 0.20186578631401061, "epoch": 0.00078, "grad_norm": 0.1274145543575287, "learning_rate": 2e-05, "loss": 0.238570499420166, "mean_token_accuracy": 0.9327393889427185, "num_tokens": 12558633.0, "step": 780 }, { "aux_loss": 8.122262763977051, "entropy": 0.19397404193878173, "epoch": 0.000785, "grad_norm": 0.1275504231452942, "learning_rate": 2e-05, "loss": 0.21904168128967286, "mean_token_accuracy": 0.9374355524778366, "num_tokens": 12639315.0, "step": 785 }, { "aux_loss": 8.143395376205444, "entropy": 0.1881797805428505, "epoch": 0.00079, "grad_norm": 0.133524551987648, "learning_rate": 2e-05, "loss": 0.2175664186477661, "mean_token_accuracy": 0.9382498949766159, "num_tokens": 12719815.0, "step": 790 }, { "aux_loss": 8.156324195861817, "entropy": 0.17355761900544167, "epoch": 0.000795, "grad_norm": 0.13200172781944275, "learning_rate": 2e-05, "loss": 0.20816025733947754, "mean_token_accuracy": 0.9410201340913773, "num_tokens": 12800294.0, "step": 795 }, { "aux_loss": 8.171008968353272, "entropy": 0.17404237911105155, "epoch": 0.0008, "grad_norm": 0.14056964218616486, "learning_rate": 2e-05, "loss": 0.20798285007476808, "mean_token_accuracy": 0.9413327813148499, "num_tokens": 12878773.0, "step": 800 }, { "aux_loss": 8.093837356567382, "entropy": 0.1741633154451847, "epoch": 0.000805, "grad_norm": 0.13568736612796783, "learning_rate": 2e-05, "loss": 0.2179255723953247, "mean_token_accuracy": 0.9385777384042739, "num_tokens": 12959682.0, "step": 805 }, { "aux_loss": 8.111591148376466, "entropy": 0.19361605867743492, "epoch": 0.00081, "grad_norm": 0.12338358908891678, "learning_rate": 2e-05, "loss": 0.22942121028900148, "mean_token_accuracy": 0.9353196829557419, "num_tokens": 13041028.0, "step": 810 }, { "aux_loss": 8.12508053779602, "entropy": 0.19188614636659623, "epoch": 0.000815, "grad_norm": 0.12431506812572479, "learning_rate": 2e-05, "loss": 0.21545052528381348, "mean_token_accuracy": 0.9393882095813751, "num_tokens": 13121701.0, "step": 815 }, { "aux_loss": 8.13652834892273, "entropy": 0.19292113482952117, "epoch": 0.00082, "grad_norm": 0.1260223686695099, "learning_rate": 2e-05, "loss": 0.22584521770477295, "mean_token_accuracy": 0.9350881546735763, "num_tokens": 13202292.0, "step": 820 }, { "aux_loss": 8.149944734573364, "entropy": 0.17534302845597266, "epoch": 0.000825, "grad_norm": 0.13426516950130463, "learning_rate": 2e-05, "loss": 0.20456910133361816, "mean_token_accuracy": 0.941878753900528, "num_tokens": 13282210.0, "step": 825 }, { "aux_loss": 8.178964471817016, "entropy": 0.1746487282216549, "epoch": 0.00083, "grad_norm": 0.15093551576137543, "learning_rate": 2e-05, "loss": 0.20533223152160646, "mean_token_accuracy": 0.9409088015556335, "num_tokens": 13362632.0, "step": 830 }, { "aux_loss": 8.11063618659973, "entropy": 0.18316879943013192, "epoch": 0.000835, "grad_norm": 0.14530125260353088, "learning_rate": 2e-05, "loss": 0.22833695411682128, "mean_token_accuracy": 0.9373126685619354, "num_tokens": 13439754.0, "step": 835 }, { "aux_loss": 8.109144926071167, "entropy": 0.19589049592614174, "epoch": 0.00084, "grad_norm": 0.1471167951822281, "learning_rate": 2e-05, "loss": 0.2323617696762085, "mean_token_accuracy": 0.935021448135376, "num_tokens": 13521162.0, "step": 840 }, { "aux_loss": 8.11714415550232, "entropy": 0.20246537178754806, "epoch": 0.000845, "grad_norm": 0.12362229079008102, "learning_rate": 2e-05, "loss": 0.23810834884643556, "mean_token_accuracy": 0.9331830322742463, "num_tokens": 13601917.0, "step": 845 }, { "aux_loss": 8.133970737457275, "entropy": 0.1931244671344757, "epoch": 0.00085, "grad_norm": 0.13273629546165466, "learning_rate": 2e-05, "loss": 0.22032694816589354, "mean_token_accuracy": 0.936900520324707, "num_tokens": 13682685.0, "step": 850 }, { "aux_loss": 8.143550634384155, "entropy": 0.18127841055393218, "epoch": 0.000855, "grad_norm": 0.13045166432857513, "learning_rate": 2e-05, "loss": 0.2100224494934082, "mean_token_accuracy": 0.9403670132160187, "num_tokens": 13763113.0, "step": 855 }, { "aux_loss": 8.167861986160279, "entropy": 0.1719556473195553, "epoch": 0.00086, "grad_norm": 0.1533770114183426, "learning_rate": 2e-05, "loss": 0.2010368824005127, "mean_token_accuracy": 0.9427653759717941, "num_tokens": 13843381.0, "step": 860 }, { "aux_loss": 8.11334171295166, "entropy": 0.17256785109639167, "epoch": 0.000865, "grad_norm": 0.1296316236257553, "learning_rate": 2e-05, "loss": 0.22134318351745605, "mean_token_accuracy": 0.939113312959671, "num_tokens": 13922305.0, "step": 865 }, { "aux_loss": 8.108716487884521, "entropy": 0.1922435976564884, "epoch": 0.00087, "grad_norm": 0.1125635877251625, "learning_rate": 2e-05, "loss": 0.2310950994491577, "mean_token_accuracy": 0.9351043969392776, "num_tokens": 14003490.0, "step": 870 }, { "aux_loss": 8.115301895141602, "entropy": 0.2005027063190937, "epoch": 0.000875, "grad_norm": 0.12468750029802322, "learning_rate": 2e-05, "loss": 0.22837119102478026, "mean_token_accuracy": 0.9355538696050644, "num_tokens": 14084716.0, "step": 875 }, { "aux_loss": 8.126211452484132, "entropy": 0.19354628697037696, "epoch": 0.00088, "grad_norm": 0.13211360573768616, "learning_rate": 2e-05, "loss": 0.2266221523284912, "mean_token_accuracy": 0.9371717393398284, "num_tokens": 14165484.0, "step": 880 }, { "aux_loss": 8.14353904724121, "entropy": 0.18160487785935403, "epoch": 0.000885, "grad_norm": 0.14947129786014557, "learning_rate": 2e-05, "loss": 0.2137932538986206, "mean_token_accuracy": 0.9408360600471497, "num_tokens": 14245987.0, "step": 885 }, { "aux_loss": 8.163965654373168, "entropy": 0.17387786507606506, "epoch": 0.00089, "grad_norm": 0.15340450406074524, "learning_rate": 2e-05, "loss": 0.2016824245452881, "mean_token_accuracy": 0.9424707919359208, "num_tokens": 14326178.0, "step": 890 }, { "aux_loss": 8.119355916976929, "entropy": 0.17598350942134858, "epoch": 0.000895, "grad_norm": 0.14417360723018646, "learning_rate": 2e-05, "loss": 0.21732549667358397, "mean_token_accuracy": 0.9407132625579834, "num_tokens": 14405313.0, "step": 895 }, { "aux_loss": 8.109018659591674, "entropy": 0.20914908573031427, "epoch": 0.0009, "grad_norm": 0.12596318125724792, "learning_rate": 2e-05, "loss": 0.24976136684417724, "mean_token_accuracy": 0.9293664872646332, "num_tokens": 14486566.0, "step": 900 }, { "aux_loss": 8.115027236938477, "entropy": 0.20074048563838004, "epoch": 0.000905, "grad_norm": 0.12749867141246796, "learning_rate": 2e-05, "loss": 0.2284632921218872, "mean_token_accuracy": 0.9368485689163208, "num_tokens": 14567772.0, "step": 905 }, { "aux_loss": 8.127698040008545, "entropy": 0.19091494828462602, "epoch": 0.00091, "grad_norm": 0.1260538548231125, "learning_rate": 2e-05, "loss": 0.22049989700317382, "mean_token_accuracy": 0.9376890927553176, "num_tokens": 14648419.0, "step": 910 }, { "aux_loss": 8.13921823501587, "entropy": 0.1774464137852192, "epoch": 0.000915, "grad_norm": 0.12893904745578766, "learning_rate": 2e-05, "loss": 0.20832493305206298, "mean_token_accuracy": 0.9396044939756394, "num_tokens": 14729366.0, "step": 915 }, { "aux_loss": 8.16345157623291, "entropy": 0.17128808721899985, "epoch": 0.00092, "grad_norm": 0.14869266748428345, "learning_rate": 2e-05, "loss": 0.20440850257873536, "mean_token_accuracy": 0.9419215887784957, "num_tokens": 14809681.0, "step": 920 }, { "aux_loss": 8.12254056930542, "entropy": 0.17211619690060614, "epoch": 0.000925, "grad_norm": 0.14314009249210358, "learning_rate": 2e-05, "loss": 0.20708854198455812, "mean_token_accuracy": 0.943778908252716, "num_tokens": 14888981.0, "step": 925 }, { "aux_loss": 8.102337169647218, "entropy": 0.1863011859357357, "epoch": 0.00093, "grad_norm": 0.12896594405174255, "learning_rate": 2e-05, "loss": 0.22866301536560057, "mean_token_accuracy": 0.9369279652833938, "num_tokens": 14970153.0, "step": 930 }, { "aux_loss": 8.112103414535522, "entropy": 0.20329497009515762, "epoch": 0.000935, "grad_norm": 0.13223311305046082, "learning_rate": 2e-05, "loss": 0.23256449699401854, "mean_token_accuracy": 0.934928897023201, "num_tokens": 15051345.0, "step": 935 }, { "aux_loss": 8.12607283592224, "entropy": 0.18796944245696068, "epoch": 0.00094, "grad_norm": 0.14386539161205292, "learning_rate": 2e-05, "loss": 0.21558585166931152, "mean_token_accuracy": 0.9385993003845214, "num_tokens": 15131948.0, "step": 940 }, { "aux_loss": 8.143296909332275, "entropy": 0.18020025864243508, "epoch": 0.000945, "grad_norm": 0.1396578699350357, "learning_rate": 2e-05, "loss": 0.21119444370269774, "mean_token_accuracy": 0.9392522275447845, "num_tokens": 15211936.0, "step": 945 }, { "aux_loss": 8.155585670471192, "entropy": 0.17179183289408684, "epoch": 0.00095, "grad_norm": 0.1429106742143631, "learning_rate": 2e-05, "loss": 0.20406196117401124, "mean_token_accuracy": 0.9423564583063125, "num_tokens": 15291992.0, "step": 950 }, { "aux_loss": 8.129588842391968, "entropy": 0.17628065794706343, "epoch": 0.000955, "grad_norm": 0.13858522474765778, "learning_rate": 2e-05, "loss": 0.21669340133666992, "mean_token_accuracy": 0.9396115422248841, "num_tokens": 15372441.0, "step": 955 }, { "aux_loss": 8.100811052322388, "entropy": 0.1907297946512699, "epoch": 0.00096, "grad_norm": 0.14532077312469482, "learning_rate": 2e-05, "loss": 0.2299985408782959, "mean_token_accuracy": 0.9367765963077546, "num_tokens": 15453322.0, "step": 960 }, { "aux_loss": 8.109273386001586, "entropy": 0.20441971346735954, "epoch": 0.000965, "grad_norm": 0.12614189088344574, "learning_rate": 2e-05, "loss": 0.23587870597839355, "mean_token_accuracy": 0.9339224755764007, "num_tokens": 15534402.0, "step": 965 }, { "aux_loss": 8.121965646743774, "entropy": 0.1921239286661148, "epoch": 0.00097, "grad_norm": 0.14098156988620758, "learning_rate": 2e-05, "loss": 0.21978702545166015, "mean_token_accuracy": 0.937722310423851, "num_tokens": 15614958.0, "step": 970 }, { "aux_loss": 8.135463666915893, "entropy": 0.181341952085495, "epoch": 0.000975, "grad_norm": 0.13644331693649292, "learning_rate": 2e-05, "loss": 0.21015706062316894, "mean_token_accuracy": 0.9399736613035202, "num_tokens": 15695868.0, "step": 975 }, { "aux_loss": 8.154515409469605, "entropy": 0.17385695725679398, "epoch": 0.00098, "grad_norm": 0.1496136635541916, "learning_rate": 2e-05, "loss": 0.20413517951965332, "mean_token_accuracy": 0.9421140640974045, "num_tokens": 15776187.0, "step": 980 }, { "aux_loss": 8.142510080337525, "entropy": 0.1882740218192339, "epoch": 0.000985, "grad_norm": 0.13687245547771454, "learning_rate": 2e-05, "loss": 0.2333993673324585, "mean_token_accuracy": 0.9334321290254592, "num_tokens": 15854768.0, "step": 985 }, { "aux_loss": 8.09783320426941, "entropy": 0.181090035289526, "epoch": 0.00099, "grad_norm": 0.1412193477153778, "learning_rate": 2e-05, "loss": 0.2248934507369995, "mean_token_accuracy": 0.9371724635362625, "num_tokens": 15936013.0, "step": 990 }, { "aux_loss": 8.108890724182128, "entropy": 0.1935890458524227, "epoch": 0.000995, "grad_norm": 0.1459343284368515, "learning_rate": 2e-05, "loss": 0.21834125518798828, "mean_token_accuracy": 0.9386760383844376, "num_tokens": 16016975.0, "step": 995 }, { "aux_loss": 8.11813826560974, "entropy": 0.18227510675787925, "epoch": 0.001, "grad_norm": 0.13530665636062622, "learning_rate": 2e-05, "loss": 0.2158998966217041, "mean_token_accuracy": 0.9394854247570038, "num_tokens": 16097623.0, "step": 1000 }, { "aux_loss": 8.132675504684448, "entropy": 0.18303612917661666, "epoch": 0.001005, "grad_norm": 0.1295279860496521, "learning_rate": 2e-05, "loss": 0.21372718811035157, "mean_token_accuracy": 0.9388361543416976, "num_tokens": 16178571.0, "step": 1005 }, { "aux_loss": 8.148015975952148, "entropy": 0.1663380205631256, "epoch": 0.00101, "grad_norm": 0.1477927565574646, "learning_rate": 2e-05, "loss": 0.19427905082702637, "mean_token_accuracy": 0.944655567407608, "num_tokens": 16259014.0, "step": 1010 }, { "aux_loss": 8.15143895149231, "entropy": 0.1644660137593746, "epoch": 0.001015, "grad_norm": 0.14161117374897003, "learning_rate": 2e-05, "loss": 0.19924207925796508, "mean_token_accuracy": 0.9437342047691345, "num_tokens": 16335868.0, "step": 1015 }, { "aux_loss": 8.0966055393219, "entropy": 0.18626073226332665, "epoch": 0.00102, "grad_norm": 0.14405575394630432, "learning_rate": 2e-05, "loss": 0.2318559169769287, "mean_token_accuracy": 0.9360893279314041, "num_tokens": 16416964.0, "step": 1020 }, { "aux_loss": 8.109320878982544, "entropy": 0.20917314514517785, "epoch": 0.001025, "grad_norm": 0.13582730293273926, "learning_rate": 2e-05, "loss": 0.24025216102600097, "mean_token_accuracy": 0.9321926653385162, "num_tokens": 16497864.0, "step": 1025 }, { "aux_loss": 8.120928478240966, "entropy": 0.19562898352742195, "epoch": 0.00103, "grad_norm": 0.14005805552005768, "learning_rate": 2e-05, "loss": 0.22124676704406737, "mean_token_accuracy": 0.9378227382898331, "num_tokens": 16578957.0, "step": 1030 }, { "aux_loss": 8.131659936904907, "entropy": 0.1797639399766922, "epoch": 0.001035, "grad_norm": 0.1292354166507721, "learning_rate": 2e-05, "loss": 0.20929946899414062, "mean_token_accuracy": 0.9413349151611328, "num_tokens": 16659600.0, "step": 1035 }, { "aux_loss": 8.150179290771485, "entropy": 0.17218540385365486, "epoch": 0.00104, "grad_norm": 0.14203843474388123, "learning_rate": 2e-05, "loss": 0.2047133207321167, "mean_token_accuracy": 0.9421777725219727, "num_tokens": 16740165.0, "step": 1040 }, { "aux_loss": 8.14911766052246, "entropy": 0.17258057817816735, "epoch": 0.001045, "grad_norm": 0.15955905616283417, "learning_rate": 2e-05, "loss": 0.20898404121398925, "mean_token_accuracy": 0.9419188648462296, "num_tokens": 16818770.0, "step": 1045 }, { "aux_loss": 8.100459671020507, "entropy": 0.18287332057952882, "epoch": 0.00105, "grad_norm": 0.13039886951446533, "learning_rate": 2e-05, "loss": 0.2245183229446411, "mean_token_accuracy": 0.9368477880954742, "num_tokens": 16899620.0, "step": 1050 }, { "aux_loss": 8.104825401306153, "entropy": 0.20207613930106164, "epoch": 0.001055, "grad_norm": 0.1333446055650711, "learning_rate": 2e-05, "loss": 0.2343914747238159, "mean_token_accuracy": 0.9339895784854889, "num_tokens": 16980428.0, "step": 1055 }, { "aux_loss": 8.121085977554321, "entropy": 0.18368163779377938, "epoch": 0.00106, "grad_norm": 0.14122816920280457, "learning_rate": 2e-05, "loss": 0.20634570121765136, "mean_token_accuracy": 0.9415034621953964, "num_tokens": 17061163.0, "step": 1060 }, { "aux_loss": 8.13550944328308, "entropy": 0.17058610990643502, "epoch": 0.001065, "grad_norm": 0.13418757915496826, "learning_rate": 2e-05, "loss": 0.20201709270477294, "mean_token_accuracy": 0.942056930065155, "num_tokens": 17142015.0, "step": 1065 }, { "aux_loss": 8.153172969818115, "entropy": 0.1640140824019909, "epoch": 0.00107, "grad_norm": 0.1374797224998474, "learning_rate": 2e-05, "loss": 0.1974026918411255, "mean_token_accuracy": 0.9445619136095047, "num_tokens": 17222876.0, "step": 1070 }, { "aux_loss": 8.147079563140869, "entropy": 0.16375502794981003, "epoch": 0.001075, "grad_norm": 0.149629145860672, "learning_rate": 2e-05, "loss": 0.19806833267211915, "mean_token_accuracy": 0.9455973088741303, "num_tokens": 17299616.0, "step": 1075 }, { "aux_loss": 8.09938554763794, "entropy": 0.18405816331505775, "epoch": 0.00108, "grad_norm": 0.1336614340543747, "learning_rate": 2e-05, "loss": 0.22501940727233888, "mean_token_accuracy": 0.9368825078010559, "num_tokens": 17381036.0, "step": 1080 }, { "aux_loss": 8.105483961105346, "entropy": 0.20805612877011298, "epoch": 0.001085, "grad_norm": 0.14559486508369446, "learning_rate": 2e-05, "loss": 0.23807644844055176, "mean_token_accuracy": 0.932142361998558, "num_tokens": 17461835.0, "step": 1085 }, { "aux_loss": 8.114073085784913, "entropy": 0.19431799054145812, "epoch": 0.00109, "grad_norm": 0.1483253389596939, "learning_rate": 2e-05, "loss": 0.224235463142395, "mean_token_accuracy": 0.9369283556938172, "num_tokens": 17542394.0, "step": 1090 }, { "aux_loss": 8.13317642211914, "entropy": 0.18543633222579955, "epoch": 0.001095, "grad_norm": 0.13417592644691467, "learning_rate": 2e-05, "loss": 0.21352875232696533, "mean_token_accuracy": 0.9396424561738967, "num_tokens": 17623111.0, "step": 1095 }, { "aux_loss": 8.143168830871582, "entropy": 0.16634368896484375, "epoch": 0.0011, "grad_norm": 0.15244615077972412, "learning_rate": 2e-05, "loss": 0.19832861423492432, "mean_token_accuracy": 0.9432316929101944, "num_tokens": 17703783.0, "step": 1100 }, { "aux_loss": 8.154546213150024, "entropy": 0.1635368935763836, "epoch": 0.001105, "grad_norm": 0.12932510673999786, "learning_rate": 2e-05, "loss": 0.19644242525100708, "mean_token_accuracy": 0.9460396349430085, "num_tokens": 17780357.0, "step": 1105 }, { "aux_loss": 8.091581392288209, "entropy": 0.16594813540577888, "epoch": 0.00111, "grad_norm": 0.1556437462568283, "learning_rate": 2e-05, "loss": 0.2127126932144165, "mean_token_accuracy": 0.9413120537996292, "num_tokens": 17861703.0, "step": 1110 }, { "aux_loss": 8.103971719741821, "entropy": 0.18995240107178687, "epoch": 0.001115, "grad_norm": 0.13781099021434784, "learning_rate": 2e-05, "loss": 0.22258846759796141, "mean_token_accuracy": 0.9372970789670945, "num_tokens": 17942701.0, "step": 1115 }, { "aux_loss": 8.116778898239136, "entropy": 0.18525892719626427, "epoch": 0.00112, "grad_norm": 0.13170120120048523, "learning_rate": 2e-05, "loss": 0.21453588008880614, "mean_token_accuracy": 0.9394149154424667, "num_tokens": 18023228.0, "step": 1120 }, { "aux_loss": 8.129170846939086, "entropy": 0.18442671671509742, "epoch": 0.001125, "grad_norm": 0.13744796812534332, "learning_rate": 2e-05, "loss": 0.2131723165512085, "mean_token_accuracy": 0.9389948576688767, "num_tokens": 18104109.0, "step": 1125 }, { "aux_loss": 8.143761157989502, "entropy": 0.17146908715367318, "epoch": 0.00113, "grad_norm": 0.1306254118680954, "learning_rate": 2e-05, "loss": 0.20081534385681152, "mean_token_accuracy": 0.9426989138126374, "num_tokens": 18185131.0, "step": 1130 }, { "aux_loss": 8.155526971817016, "entropy": 0.17061771005392073, "epoch": 0.001135, "grad_norm": 0.15940193831920624, "learning_rate": 2e-05, "loss": 0.20533814430236816, "mean_token_accuracy": 0.9431990951299667, "num_tokens": 18262808.0, "step": 1135 }, { "aux_loss": 8.088939094543457, "entropy": 0.162516987323761, "epoch": 0.00114, "grad_norm": 0.13790178298950195, "learning_rate": 2e-05, "loss": 0.2050339937210083, "mean_token_accuracy": 0.9429171621799469, "num_tokens": 18343894.0, "step": 1140 }, { "aux_loss": 8.099242973327637, "entropy": 0.1909376263618469, "epoch": 0.001145, "grad_norm": 0.13040708005428314, "learning_rate": 2e-05, "loss": 0.23065586090087892, "mean_token_accuracy": 0.9361128509044647, "num_tokens": 18425420.0, "step": 1145 }, { "aux_loss": 8.109739398956298, "entropy": 0.19257219433784484, "epoch": 0.00115, "grad_norm": 0.13617382943630219, "learning_rate": 2e-05, "loss": 0.2169320821762085, "mean_token_accuracy": 0.9386547476053237, "num_tokens": 18506048.0, "step": 1150 }, { "aux_loss": 8.119318962097168, "entropy": 0.17985256910324096, "epoch": 0.001155, "grad_norm": 0.1464129090309143, "learning_rate": 2e-05, "loss": 0.20620300769805908, "mean_token_accuracy": 0.9404237031936645, "num_tokens": 18586609.0, "step": 1155 }, { "aux_loss": 8.136944580078126, "entropy": 0.17993081212043763, "epoch": 0.00116, "grad_norm": 0.1385568082332611, "learning_rate": 2e-05, "loss": 0.21773624420166016, "mean_token_accuracy": 0.9385370492935181, "num_tokens": 18666884.0, "step": 1160 }, { "aux_loss": 8.16204137802124, "entropy": 0.1734834022819996, "epoch": 0.001165, "grad_norm": 0.16297543048858643, "learning_rate": 2e-05, "loss": 0.19739640951156617, "mean_token_accuracy": 0.9443773657083512, "num_tokens": 18747693.0, "step": 1165 }, { "aux_loss": 8.095090389251709, "entropy": 0.17245537899434565, "epoch": 0.00117, "grad_norm": 0.1412307322025299, "learning_rate": 2e-05, "loss": 0.2139646053314209, "mean_token_accuracy": 0.9405614197254181, "num_tokens": 18826580.0, "step": 1170 }, { "aux_loss": 8.09668779373169, "entropy": 0.1829852543771267, "epoch": 0.001175, "grad_norm": 0.1572728455066681, "learning_rate": 2e-05, "loss": 0.22257506847381592, "mean_token_accuracy": 0.9376355350017548, "num_tokens": 18907868.0, "step": 1175 }, { "aux_loss": 8.104577207565308, "entropy": 0.18904553726315498, "epoch": 0.00118, "grad_norm": 0.13721878826618195, "learning_rate": 2e-05, "loss": 0.2151425838470459, "mean_token_accuracy": 0.9397189229726791, "num_tokens": 18988636.0, "step": 1180 }, { "aux_loss": 8.118225622177125, "entropy": 0.18333376720547676, "epoch": 0.001185, "grad_norm": 0.14412416517734528, "learning_rate": 2e-05, "loss": 0.21259968280792235, "mean_token_accuracy": 0.9398420035839081, "num_tokens": 19069174.0, "step": 1185 }, { "aux_loss": 8.134906196594239, "entropy": 0.17814260721206665, "epoch": 0.00119, "grad_norm": 0.13498298823833466, "learning_rate": 2e-05, "loss": 0.2124964714050293, "mean_token_accuracy": 0.9405255049467087, "num_tokens": 19149371.0, "step": 1190 }, { "aux_loss": 8.156946563720703, "entropy": 0.1696353040635586, "epoch": 0.001195, "grad_norm": 0.16295582056045532, "learning_rate": 2e-05, "loss": 0.19403015375137328, "mean_token_accuracy": 0.9445232212543487, "num_tokens": 19229674.0, "step": 1195 }, { "aux_loss": 8.112064218521118, "entropy": 0.1671122845262289, "epoch": 0.0012, "grad_norm": 0.14335326850414276, "learning_rate": 2e-05, "loss": 0.2131701946258545, "mean_token_accuracy": 0.9426359623670578, "num_tokens": 19306860.0, "step": 1200 }, { "aux_loss": 8.102148056030273, "entropy": 0.17936039455235003, "epoch": 0.001205, "grad_norm": 0.138744056224823, "learning_rate": 2e-05, "loss": 0.2263488292694092, "mean_token_accuracy": 0.9367114216089248, "num_tokens": 19388241.0, "step": 1205 }, { "aux_loss": 8.107982635498047, "entropy": 0.18988944292068483, "epoch": 0.00121, "grad_norm": 0.1490761637687683, "learning_rate": 2e-05, "loss": 0.211828875541687, "mean_token_accuracy": 0.9403735935688019, "num_tokens": 19469572.0, "step": 1210 }, { "aux_loss": 8.120537662506104, "entropy": 0.18598054051399232, "epoch": 0.001215, "grad_norm": 0.13718858361244202, "learning_rate": 2e-05, "loss": 0.21541576385498046, "mean_token_accuracy": 0.9391979366540909, "num_tokens": 19550158.0, "step": 1215 }, { "aux_loss": 8.129882097244263, "entropy": 0.1692873366177082, "epoch": 0.00122, "grad_norm": 0.1462230086326599, "learning_rate": 2e-05, "loss": 0.19773582220077515, "mean_token_accuracy": 0.9440513670444488, "num_tokens": 19630593.0, "step": 1220 }, { "aux_loss": 8.150879144668579, "entropy": 0.1672566942870617, "epoch": 0.001225, "grad_norm": 0.1628735363483429, "learning_rate": 2e-05, "loss": 0.20410618782043458, "mean_token_accuracy": 0.9435446441173554, "num_tokens": 19710578.0, "step": 1225 }, { "aux_loss": 8.112903356552124, "entropy": 0.16016247272491455, "epoch": 0.00123, "grad_norm": 0.13584807515144348, "learning_rate": 2e-05, "loss": 0.19806501865386963, "mean_token_accuracy": 0.9454169005155564, "num_tokens": 19790178.0, "step": 1230 }, { "aux_loss": 8.097063112258912, "entropy": 0.1896512873470783, "epoch": 0.001235, "grad_norm": 0.13905711472034454, "learning_rate": 2e-05, "loss": 0.22745237350463868, "mean_token_accuracy": 0.9353796660900116, "num_tokens": 19871450.0, "step": 1235 }, { "aux_loss": 8.103591251373292, "entropy": 0.18758923336863517, "epoch": 0.00124, "grad_norm": 0.14005883038043976, "learning_rate": 2e-05, "loss": 0.21161456108093263, "mean_token_accuracy": 0.9404743552207947, "num_tokens": 19952818.0, "step": 1240 }, { "aux_loss": 8.119750118255615, "entropy": 0.17323974296450614, "epoch": 0.001245, "grad_norm": 0.14812205731868744, "learning_rate": 2e-05, "loss": 0.20181419849395751, "mean_token_accuracy": 0.943002137541771, "num_tokens": 20033581.0, "step": 1245 }, { "aux_loss": 8.13001561164856, "entropy": 0.17530782744288445, "epoch": 0.00125, "grad_norm": 0.13251017034053802, "learning_rate": 2e-05, "loss": 0.21283555030822754, "mean_token_accuracy": 0.9399103164672852, "num_tokens": 20114398.0, "step": 1250 }, { "aux_loss": 8.147759580612183, "entropy": 0.16442596018314362, "epoch": 0.001255, "grad_norm": 0.15714676678180695, "learning_rate": 2e-05, "loss": 0.18702534437179566, "mean_token_accuracy": 0.9467514336109162, "num_tokens": 20194434.0, "step": 1255 }, { "aux_loss": 8.109157800674438, "entropy": 0.1626373641192913, "epoch": 0.00126, "grad_norm": 0.1565043330192566, "learning_rate": 2e-05, "loss": 0.21089496612548828, "mean_token_accuracy": 0.942788028717041, "num_tokens": 20275698.0, "step": 1260 }, { "aux_loss": 8.093947696685792, "entropy": 0.19617915898561478, "epoch": 0.001265, "grad_norm": 0.1432366520166397, "learning_rate": 2e-05, "loss": 0.24150006771087645, "mean_token_accuracy": 0.9325732469558716, "num_tokens": 20356606.0, "step": 1265 }, { "aux_loss": 8.100923013687133, "entropy": 0.20489457100629807, "epoch": 0.00127, "grad_norm": 0.142571359872818, "learning_rate": 2e-05, "loss": 0.22859885692596435, "mean_token_accuracy": 0.9360031843185425, "num_tokens": 20437492.0, "step": 1270 }, { "aux_loss": 8.113832139968872, "entropy": 0.18682107999920844, "epoch": 0.001275, "grad_norm": 0.15194223821163177, "learning_rate": 2e-05, "loss": 0.21301717758178712, "mean_token_accuracy": 0.93876693546772, "num_tokens": 20518204.0, "step": 1275 }, { "aux_loss": 8.12835898399353, "entropy": 0.172673948854208, "epoch": 0.00128, "grad_norm": 0.14351797103881836, "learning_rate": 2e-05, "loss": 0.20544931888580323, "mean_token_accuracy": 0.9409793645143509, "num_tokens": 20598785.0, "step": 1280 }, { "aux_loss": 8.146044445037841, "entropy": 0.1725030966103077, "epoch": 0.001285, "grad_norm": 0.14401860535144806, "learning_rate": 2e-05, "loss": 0.20696258544921875, "mean_token_accuracy": 0.9420131802558899, "num_tokens": 20678911.0, "step": 1285 }, { "aux_loss": 8.123119592666626, "entropy": 0.17102996557950972, "epoch": 0.00129, "grad_norm": 0.1375003606081009, "learning_rate": 2e-05, "loss": 0.20492122173309327, "mean_token_accuracy": 0.9413111358880997, "num_tokens": 20755503.0, "step": 1290 }, { "aux_loss": 8.0912504196167, "entropy": 0.17658306807279586, "epoch": 0.001295, "grad_norm": 0.13257145881652832, "learning_rate": 2e-05, "loss": 0.20998308658599854, "mean_token_accuracy": 0.940663531422615, "num_tokens": 20836245.0, "step": 1295 }, { "aux_loss": 8.099381446838379, "entropy": 0.1868967518210411, "epoch": 0.0013, "grad_norm": 0.14198297262191772, "learning_rate": 2e-05, "loss": 0.21974670886993408, "mean_token_accuracy": 0.9376268059015274, "num_tokens": 20917294.0, "step": 1300 }, { "aux_loss": 8.108508634567261, "entropy": 0.18228753432631492, "epoch": 0.001305, "grad_norm": 0.13187234103679657, "learning_rate": 2e-05, "loss": 0.21817548274993898, "mean_token_accuracy": 0.9392153471708298, "num_tokens": 20997680.0, "step": 1305 }, { "aux_loss": 8.122104930877686, "entropy": 0.18339259847998618, "epoch": 0.00131, "grad_norm": 0.1490059345960617, "learning_rate": 2e-05, "loss": 0.21026885509490967, "mean_token_accuracy": 0.9402256816625595, "num_tokens": 21078472.0, "step": 1310 }, { "aux_loss": 8.134609413146972, "entropy": 0.17264059111475943, "epoch": 0.001315, "grad_norm": 0.1463150978088379, "learning_rate": 2e-05, "loss": 0.20235130786895753, "mean_token_accuracy": 0.9432796269655228, "num_tokens": 21158851.0, "step": 1315 }, { "aux_loss": 8.132504081726074, "entropy": 0.15988932885229587, "epoch": 0.00132, "grad_norm": 0.14908353984355927, "learning_rate": 2e-05, "loss": 0.1955566883087158, "mean_token_accuracy": 0.9455756425857544, "num_tokens": 21236649.0, "step": 1320 }, { "aux_loss": 8.091651821136475, "entropy": 0.16718392595648765, "epoch": 0.001325, "grad_norm": 0.15275311470031738, "learning_rate": 2e-05, "loss": 0.21028823852539064, "mean_token_accuracy": 0.9421744287014008, "num_tokens": 21317997.0, "step": 1325 }, { "aux_loss": 8.095997381210328, "entropy": 0.1901338778436184, "epoch": 0.00133, "grad_norm": 0.14271008968353271, "learning_rate": 2e-05, "loss": 0.2200601577758789, "mean_token_accuracy": 0.9385367631912231, "num_tokens": 21399182.0, "step": 1330 }, { "aux_loss": 8.110585117340088, "entropy": 0.20013106390833854, "epoch": 0.001335, "grad_norm": 0.13731908798217773, "learning_rate": 2e-05, "loss": 0.22662696838378907, "mean_token_accuracy": 0.9368092805147171, "num_tokens": 21480251.0, "step": 1335 }, { "aux_loss": 8.120805788040162, "entropy": 0.1727154590189457, "epoch": 0.00134, "grad_norm": 0.1378210335969925, "learning_rate": 2e-05, "loss": 0.20113024711608887, "mean_token_accuracy": 0.9439943104982376, "num_tokens": 21561156.0, "step": 1340 }, { "aux_loss": 8.133132648468017, "entropy": 0.1674143709242344, "epoch": 0.001345, "grad_norm": 0.1513887643814087, "learning_rate": 2e-05, "loss": 0.20577425956726075, "mean_token_accuracy": 0.942402470111847, "num_tokens": 21642185.0, "step": 1345 }, { "aux_loss": 8.139795017242431, "entropy": 0.17304934822022916, "epoch": 0.00135, "grad_norm": 0.12145114690065384, "learning_rate": 2e-05, "loss": 0.20785124301910402, "mean_token_accuracy": 0.942343357205391, "num_tokens": 21719162.0, "step": 1350 }, { "aux_loss": 8.08781909942627, "entropy": 0.1742361642420292, "epoch": 0.001355, "grad_norm": 0.14099696278572083, "learning_rate": 2e-05, "loss": 0.2182718276977539, "mean_token_accuracy": 0.940433731675148, "num_tokens": 21800626.0, "step": 1355 }, { "aux_loss": 8.098934936523438, "entropy": 0.20285899192094803, "epoch": 0.00136, "grad_norm": 0.15401683747768402, "learning_rate": 2e-05, "loss": 0.23468153476715087, "mean_token_accuracy": 0.9335884660482406, "num_tokens": 21881696.0, "step": 1360 }, { "aux_loss": 8.106411504745484, "entropy": 0.18526409342885017, "epoch": 0.001365, "grad_norm": 0.1306249499320984, "learning_rate": 2e-05, "loss": 0.21111090183258058, "mean_token_accuracy": 0.9408644020557404, "num_tokens": 21962450.0, "step": 1365 }, { "aux_loss": 8.121489858627319, "entropy": 0.18036528900265694, "epoch": 0.00137, "grad_norm": 0.14501120150089264, "learning_rate": 2e-05, "loss": 0.21063520908355712, "mean_token_accuracy": 0.9411169201135635, "num_tokens": 22042655.0, "step": 1370 }, { "aux_loss": 8.132449626922607, "entropy": 0.16052772253751754, "epoch": 0.001375, "grad_norm": 0.142227441072464, "learning_rate": 2e-05, "loss": 0.19645824432373046, "mean_token_accuracy": 0.94445960521698, "num_tokens": 22123291.0, "step": 1375 }, { "aux_loss": 8.15138282775879, "entropy": 0.16159301958978176, "epoch": 0.00138, "grad_norm": 0.13989758491516113, "learning_rate": 2e-05, "loss": 0.1932361364364624, "mean_token_accuracy": 0.9453170746564865, "num_tokens": 22202462.0, "step": 1380 }, { "aux_loss": 8.08789939880371, "entropy": 0.17011022567749023, "epoch": 0.001385, "grad_norm": 0.14079993963241577, "learning_rate": 2e-05, "loss": 0.20923681259155275, "mean_token_accuracy": 0.9421351909637451, "num_tokens": 22283958.0, "step": 1385 }, { "aux_loss": 8.095738554000855, "entropy": 0.18748774603009224, "epoch": 0.00139, "grad_norm": 0.1360437422990799, "learning_rate": 2e-05, "loss": 0.2199646234512329, "mean_token_accuracy": 0.9384114235639572, "num_tokens": 22365454.0, "step": 1390 }, { "aux_loss": 8.10390763282776, "entropy": 0.1814654491841793, "epoch": 0.001395, "grad_norm": 0.12834835052490234, "learning_rate": 2e-05, "loss": 0.21202080249786376, "mean_token_accuracy": 0.9412189185619354, "num_tokens": 22446565.0, "step": 1395 }, { "aux_loss": 8.116164302825927, "entropy": 0.17915418669581412, "epoch": 0.0014, "grad_norm": 0.1470014899969101, "learning_rate": 2e-05, "loss": 0.20995094776153564, "mean_token_accuracy": 0.9401764899492264, "num_tokens": 22527025.0, "step": 1400 }, { "aux_loss": 8.131404733657837, "entropy": 0.17990972548723222, "epoch": 0.001405, "grad_norm": 0.14340564608573914, "learning_rate": 2e-05, "loss": 0.2145388126373291, "mean_token_accuracy": 0.9400021612644196, "num_tokens": 22607222.0, "step": 1405 }, { "aux_loss": 8.152696418762208, "entropy": 0.1697441078722477, "epoch": 0.00141, "grad_norm": 0.1787918657064438, "learning_rate": 2e-05, "loss": 0.19432330131530762, "mean_token_accuracy": 0.9452683657407761, "num_tokens": 22687723.0, "step": 1410 }, { "aux_loss": 8.087120485305785, "entropy": 0.17364331483840942, "epoch": 0.001415, "grad_norm": 0.14804264903068542, "learning_rate": 2e-05, "loss": 0.22220132350921631, "mean_token_accuracy": 0.9390887200832367, "num_tokens": 22766548.0, "step": 1415 }, { "aux_loss": 8.093894338607788, "entropy": 0.18652292788028718, "epoch": 0.00142, "grad_norm": 0.14664113521575928, "learning_rate": 2e-05, "loss": 0.2241745948791504, "mean_token_accuracy": 0.9366730749607086, "num_tokens": 22847865.0, "step": 1420 }, { "aux_loss": 8.102896785736084, "entropy": 0.19468777775764465, "epoch": 0.001425, "grad_norm": 0.1493048369884491, "learning_rate": 2e-05, "loss": 0.21715831756591797, "mean_token_accuracy": 0.9390844434499741, "num_tokens": 22928761.0, "step": 1425 }, { "aux_loss": 8.116300249099732, "entropy": 0.18231945857405663, "epoch": 0.00143, "grad_norm": 0.13884210586547852, "learning_rate": 2e-05, "loss": 0.2111462116241455, "mean_token_accuracy": 0.939801424741745, "num_tokens": 23009438.0, "step": 1430 }, { "aux_loss": 8.132174634933472, "entropy": 0.16873669773340225, "epoch": 0.001435, "grad_norm": 0.16086970269680023, "learning_rate": 2e-05, "loss": 0.1996437430381775, "mean_token_accuracy": 0.944518530368805, "num_tokens": 23089375.0, "step": 1435 }, { "aux_loss": 8.149925804138183, "entropy": 0.16066225245594978, "epoch": 0.00144, "grad_norm": 0.16884085536003113, "learning_rate": 2e-05, "loss": 0.19438048601150512, "mean_token_accuracy": 0.9448157876729966, "num_tokens": 23170066.0, "step": 1440 }, { "aux_loss": 8.09245195388794, "entropy": 0.15585733875632285, "epoch": 0.001445, "grad_norm": 0.14111007750034332, "learning_rate": 2e-05, "loss": 0.19613447189331054, "mean_token_accuracy": 0.9457630664110184, "num_tokens": 23250511.0, "step": 1445 }, { "aux_loss": 8.091105413436889, "entropy": 0.1920392207801342, "epoch": 0.00145, "grad_norm": 0.15117305517196655, "learning_rate": 2e-05, "loss": 0.2302844524383545, "mean_token_accuracy": 0.9350064992904663, "num_tokens": 23332036.0, "step": 1450 }, { "aux_loss": 8.103524017333985, "entropy": 0.17666609063744546, "epoch": 0.001455, "grad_norm": 0.15425564348697662, "learning_rate": 2e-05, "loss": 0.20472273826599122, "mean_token_accuracy": 0.9426793485879899, "num_tokens": 23412945.0, "step": 1455 }, { "aux_loss": 8.113294744491578, "entropy": 0.1808626964688301, "epoch": 0.00146, "grad_norm": 0.14899621903896332, "learning_rate": 2e-05, "loss": 0.21448283195495604, "mean_token_accuracy": 0.9400674223899841, "num_tokens": 23493932.0, "step": 1460 }, { "aux_loss": 8.12929720878601, "entropy": 0.1730622112751007, "epoch": 0.001465, "grad_norm": 0.15310509502887726, "learning_rate": 2e-05, "loss": 0.1996227025985718, "mean_token_accuracy": 0.943952077627182, "num_tokens": 23574061.0, "step": 1465 }, { "aux_loss": 8.151718235015869, "entropy": 0.16063716560602187, "epoch": 0.00147, "grad_norm": 0.16773603856563568, "learning_rate": 2e-05, "loss": 0.189278507232666, "mean_token_accuracy": 0.9467889577150345, "num_tokens": 23654574.0, "step": 1470 }, { "aux_loss": 8.094487380981445, "entropy": 0.15401179529726505, "epoch": 0.001475, "grad_norm": 0.14586107432842255, "learning_rate": 2e-05, "loss": 0.20016000270843506, "mean_token_accuracy": 0.9449825167655945, "num_tokens": 23733817.0, "step": 1475 }, { "aux_loss": 8.091149282455444, "entropy": 0.19360100850462914, "epoch": 0.00148, "grad_norm": 0.14854799211025238, "learning_rate": 2e-05, "loss": 0.23483653068542482, "mean_token_accuracy": 0.9342969328165054, "num_tokens": 23815269.0, "step": 1480 }, { "aux_loss": 8.098963975906372, "entropy": 0.1929106667637825, "epoch": 0.001485, "grad_norm": 0.13886724412441254, "learning_rate": 2e-05, "loss": 0.21658732891082763, "mean_token_accuracy": 0.939777034521103, "num_tokens": 23896528.0, "step": 1485 }, { "aux_loss": 8.108890295028687, "entropy": 0.18312879726290704, "epoch": 0.00149, "grad_norm": 0.14512109756469727, "learning_rate": 2e-05, "loss": 0.2098008394241333, "mean_token_accuracy": 0.9403581470251083, "num_tokens": 23977386.0, "step": 1490 }, { "aux_loss": 8.12533917427063, "entropy": 0.16724784225225447, "epoch": 0.001495, "grad_norm": 0.14004266262054443, "learning_rate": 2e-05, "loss": 0.2040783405303955, "mean_token_accuracy": 0.9425091087818146, "num_tokens": 24057921.0, "step": 1495 }, { "aux_loss": 8.14401888847351, "entropy": 0.16301089823246, "epoch": 0.0015, "grad_norm": 0.16092567145824432, "learning_rate": 2e-05, "loss": 0.19011870622634888, "mean_token_accuracy": 0.9468242824077606, "num_tokens": 24138053.0, "step": 1500 }, { "aux_loss": 8.108096361160278, "entropy": 0.1561386350542307, "epoch": 0.001505, "grad_norm": 0.15491639077663422, "learning_rate": 2e-05, "loss": 0.19484918117523192, "mean_token_accuracy": 0.9462997406721115, "num_tokens": 24215221.0, "step": 1505 }, { "aux_loss": 8.088674736022949, "entropy": 0.17986297979950905, "epoch": 0.00151, "grad_norm": 0.14700467884540558, "learning_rate": 2e-05, "loss": 0.2231841802597046, "mean_token_accuracy": 0.9368600070476532, "num_tokens": 24296079.0, "step": 1510 }, { "aux_loss": 8.095492744445801, "entropy": 0.18229425847530364, "epoch": 0.001515, "grad_norm": 0.14003045856952667, "learning_rate": 2e-05, "loss": 0.20808348655700684, "mean_token_accuracy": 0.9413382917642593, "num_tokens": 24377526.0, "step": 1515 }, { "aux_loss": 8.10906138420105, "entropy": 0.18038261011242868, "epoch": 0.00152, "grad_norm": 0.15010018646717072, "learning_rate": 2e-05, "loss": 0.20852205753326417, "mean_token_accuracy": 0.9413996934890747, "num_tokens": 24458627.0, "step": 1520 }, { "aux_loss": 8.123844289779663, "entropy": 0.17206328213214875, "epoch": 0.001525, "grad_norm": 0.14683103561401367, "learning_rate": 2e-05, "loss": 0.20467498302459716, "mean_token_accuracy": 0.9411923170089722, "num_tokens": 24539422.0, "step": 1525 }, { "aux_loss": 8.140221214294433, "entropy": 0.1623208202421665, "epoch": 0.00153, "grad_norm": 0.16020053625106812, "learning_rate": 2e-05, "loss": 0.1922840356826782, "mean_token_accuracy": 0.945524924993515, "num_tokens": 24619704.0, "step": 1530 }, { "aux_loss": 8.112646102905273, "entropy": 0.15188264660537243, "epoch": 0.001535, "grad_norm": 0.1351615935564041, "learning_rate": 2e-05, "loss": 0.18567148447036744, "mean_token_accuracy": 0.9497504830360413, "num_tokens": 24700558.0, "step": 1535 }, { "aux_loss": 8.093827390670777, "entropy": 0.18044227585196496, "epoch": 0.00154, "grad_norm": 0.1527668535709381, "learning_rate": 2e-05, "loss": 0.22727639675140382, "mean_token_accuracy": 0.9360405266284942, "num_tokens": 24781672.0, "step": 1540 }, { "aux_loss": 8.094546461105347, "entropy": 0.20025886446237565, "epoch": 0.001545, "grad_norm": 0.14517077803611755, "learning_rate": 2e-05, "loss": 0.2319253444671631, "mean_token_accuracy": 0.9350155264139175, "num_tokens": 24862726.0, "step": 1545 }, { "aux_loss": 8.110199642181396, "entropy": 0.1861427828669548, "epoch": 0.00155, "grad_norm": 0.15331503748893738, "learning_rate": 2e-05, "loss": 0.21457738876342775, "mean_token_accuracy": 0.9389505892992019, "num_tokens": 24943775.0, "step": 1550 }, { "aux_loss": 8.120828199386597, "entropy": 0.1685674399137497, "epoch": 0.001555, "grad_norm": 0.1569015085697174, "learning_rate": 2e-05, "loss": 0.19857349395751953, "mean_token_accuracy": 0.9437560766935349, "num_tokens": 25024772.0, "step": 1555 }, { "aux_loss": 8.13948163986206, "entropy": 0.15821726694703103, "epoch": 0.00156, "grad_norm": 0.16434122622013092, "learning_rate": 2e-05, "loss": 0.1915326476097107, "mean_token_accuracy": 0.9459531784057618, "num_tokens": 25105051.0, "step": 1560 }, { "aux_loss": 8.127675104141236, "entropy": 0.1545293591916561, "epoch": 0.001565, "grad_norm": 0.15886199474334717, "learning_rate": 2e-05, "loss": 0.19543263912200928, "mean_token_accuracy": 0.9462945342063904, "num_tokens": 25184642.0, "step": 1565 }, { "aux_loss": 8.08992862701416, "entropy": 0.17979532293975353, "epoch": 0.00157, "grad_norm": 0.13161753118038177, "learning_rate": 2e-05, "loss": 0.21586837768554687, "mean_token_accuracy": 0.9389263749122619, "num_tokens": 25266000.0, "step": 1570 }, { "aux_loss": 8.09758381843567, "entropy": 0.20703106448054315, "epoch": 0.001575, "grad_norm": 0.13990826904773712, "learning_rate": 2e-05, "loss": 0.23759994506835938, "mean_token_accuracy": 0.9331592172384262, "num_tokens": 25346583.0, "step": 1575 }, { "aux_loss": 8.106312370300293, "entropy": 0.1796684518456459, "epoch": 0.00158, "grad_norm": 0.14089328050613403, "learning_rate": 2e-05, "loss": 0.2043560266494751, "mean_token_accuracy": 0.942157757282257, "num_tokens": 25427514.0, "step": 1580 }, { "aux_loss": 8.124406957626343, "entropy": 0.17517981231212615, "epoch": 0.001585, "grad_norm": 0.14138734340667725, "learning_rate": 2e-05, "loss": 0.20602011680603027, "mean_token_accuracy": 0.9417855650186538, "num_tokens": 25508402.0, "step": 1585 }, { "aux_loss": 8.14156994819641, "entropy": 0.159897642955184, "epoch": 0.00159, "grad_norm": 0.14980235695838928, "learning_rate": 2e-05, "loss": 0.18918629884719848, "mean_token_accuracy": 0.9464654803276062, "num_tokens": 25588248.0, "step": 1590 }, { "aux_loss": 8.132224559783936, "entropy": 0.15646722465753554, "epoch": 0.001595, "grad_norm": 0.14346034824848175, "learning_rate": 2e-05, "loss": 0.19590044021606445, "mean_token_accuracy": 0.9455728471279145, "num_tokens": 25668812.0, "step": 1595 }, { "aux_loss": 8.091664552688599, "entropy": 0.16691523045301437, "epoch": 0.0016, "grad_norm": 0.14989890158176422, "learning_rate": 2e-05, "loss": 0.20818891525268554, "mean_token_accuracy": 0.9413408249616623, "num_tokens": 25750022.0, "step": 1600 }, { "aux_loss": 8.093881845474243, "entropy": 0.19223699048161508, "epoch": 0.001605, "grad_norm": 0.15126468241214752, "learning_rate": 2e-05, "loss": 0.22417640686035156, "mean_token_accuracy": 0.9378127545118332, "num_tokens": 25830960.0, "step": 1605 }, { "aux_loss": 8.106926345825196, "entropy": 0.18031547740101814, "epoch": 0.00161, "grad_norm": 0.14342601597309113, "learning_rate": 2e-05, "loss": 0.20777347087860107, "mean_token_accuracy": 0.9411538213491439, "num_tokens": 25912001.0, "step": 1610 }, { "aux_loss": 8.118624687194824, "entropy": 0.17412861213088035, "epoch": 0.001615, "grad_norm": 0.14276643097400665, "learning_rate": 2e-05, "loss": 0.20309576988220215, "mean_token_accuracy": 0.9427552461624146, "num_tokens": 25992996.0, "step": 1615 }, { "aux_loss": 8.134443330764771, "entropy": 0.1625348597764969, "epoch": 0.00162, "grad_norm": 0.16904227435588837, "learning_rate": 2e-05, "loss": 0.19113484621047974, "mean_token_accuracy": 0.946293231844902, "num_tokens": 26073465.0, "step": 1620 }, { "aux_loss": 8.128686761856079, "entropy": 0.14892494566738607, "epoch": 0.001625, "grad_norm": 0.14239241182804108, "learning_rate": 2e-05, "loss": 0.18040697574615477, "mean_token_accuracy": 0.9493981957435608, "num_tokens": 26152691.0, "step": 1625 }, { "aux_loss": 8.086278486251832, "entropy": 0.17021566741168498, "epoch": 0.00163, "grad_norm": 0.14199447631835938, "learning_rate": 2e-05, "loss": 0.22021899223327637, "mean_token_accuracy": 0.9390756160020828, "num_tokens": 26233800.0, "step": 1630 }, { "aux_loss": 8.091834163665771, "entropy": 0.19363221898674965, "epoch": 0.001635, "grad_norm": 0.141326442360878, "learning_rate": 2e-05, "loss": 0.2295623540878296, "mean_token_accuracy": 0.9363398462533951, "num_tokens": 26314237.0, "step": 1635 }, { "aux_loss": 8.099656438827514, "entropy": 0.1877741038799286, "epoch": 0.00164, "grad_norm": 0.13307121396064758, "learning_rate": 2e-05, "loss": 0.21384093761444092, "mean_token_accuracy": 0.9402267515659333, "num_tokens": 26395203.0, "step": 1640 }, { "aux_loss": 8.112567138671874, "entropy": 0.17270937636494638, "epoch": 0.001645, "grad_norm": 0.1454281508922577, "learning_rate": 2e-05, "loss": 0.19741926193237305, "mean_token_accuracy": 0.9443966925144196, "num_tokens": 26475783.0, "step": 1645 }, { "aux_loss": 8.130879163742065, "entropy": 0.16381614953279494, "epoch": 0.00165, "grad_norm": 0.15070879459381104, "learning_rate": 2e-05, "loss": 0.19763474464416503, "mean_token_accuracy": 0.9448977142572403, "num_tokens": 26556693.0, "step": 1650 }, { "aux_loss": 8.136204147338868, "entropy": 0.15377900041639805, "epoch": 0.001655, "grad_norm": 0.12270507216453552, "learning_rate": 2e-05, "loss": 0.18577005863189697, "mean_token_accuracy": 0.9487336248159408, "num_tokens": 26636170.0, "step": 1655 }, { "aux_loss": 8.082316684722901, "entropy": 0.1666357085108757, "epoch": 0.00166, "grad_norm": 0.1402491331100464, "learning_rate": 2e-05, "loss": 0.2062994956970215, "mean_token_accuracy": 0.9427699983119965, "num_tokens": 26717546.0, "step": 1660 }, { "aux_loss": 8.094042301177979, "entropy": 0.18402569144964218, "epoch": 0.001665, "grad_norm": 0.1399538666009903, "learning_rate": 2e-05, "loss": 0.22184386253356933, "mean_token_accuracy": 0.9360486805438996, "num_tokens": 26798880.0, "step": 1665 }, { "aux_loss": 8.096484851837157, "entropy": 0.17516063004732133, "epoch": 0.00167, "grad_norm": 0.1460048258304596, "learning_rate": 2e-05, "loss": 0.20700514316558838, "mean_token_accuracy": 0.9405145049095154, "num_tokens": 26879876.0, "step": 1670 }, { "aux_loss": 8.108837652206422, "entropy": 0.17554794177412986, "epoch": 0.001675, "grad_norm": 0.14934812486171722, "learning_rate": 2e-05, "loss": 0.1992682099342346, "mean_token_accuracy": 0.9441122353076935, "num_tokens": 26960459.0, "step": 1675 }, { "aux_loss": 8.122825431823731, "entropy": 0.16358745619654655, "epoch": 0.00168, "grad_norm": 0.1521233320236206, "learning_rate": 2e-05, "loss": 0.1915867567062378, "mean_token_accuracy": 0.945333406329155, "num_tokens": 27041160.0, "step": 1680 }, { "aux_loss": 8.144129180908203, "entropy": 0.156498297303915, "epoch": 0.001685, "grad_norm": 0.1905045360326767, "learning_rate": 2e-05, "loss": 0.19240328073501586, "mean_token_accuracy": 0.9464808136224747, "num_tokens": 27120205.0, "step": 1685 }, { "aux_loss": 8.077440357208252, "entropy": 0.16339176818728446, "epoch": 0.00169, "grad_norm": 0.15257541835308075, "learning_rate": 2e-05, "loss": 0.21015667915344238, "mean_token_accuracy": 0.9428196430206299, "num_tokens": 27201641.0, "step": 1690 }, { "aux_loss": 8.091274213790893, "entropy": 0.1816990975290537, "epoch": 0.001695, "grad_norm": 0.15236543118953705, "learning_rate": 2e-05, "loss": 0.21230292320251465, "mean_token_accuracy": 0.9404520213603973, "num_tokens": 27282918.0, "step": 1695 }, { "aux_loss": 8.102615594863892, "entropy": 0.1775689408183098, "epoch": 0.0017, "grad_norm": 0.14349766075611115, "learning_rate": 2e-05, "loss": 0.20254044532775878, "mean_token_accuracy": 0.9426239758729935, "num_tokens": 27363680.0, "step": 1700 }, { "aux_loss": 8.108851909637451, "entropy": 0.16214391365647315, "epoch": 0.001705, "grad_norm": 0.15616129338741302, "learning_rate": 2e-05, "loss": 0.1956779718399048, "mean_token_accuracy": 0.9449942111968994, "num_tokens": 27444588.0, "step": 1705 }, { "aux_loss": 8.122281932830811, "entropy": 0.16567001715302468, "epoch": 0.00171, "grad_norm": 0.15975213050842285, "learning_rate": 2e-05, "loss": 0.20318365097045898, "mean_token_accuracy": 0.9430002510547638, "num_tokens": 27524930.0, "step": 1710 }, { "aux_loss": 8.146432733535766, "entropy": 0.16198174953460692, "epoch": 0.001715, "grad_norm": 0.21213486790657043, "learning_rate": 2e-05, "loss": 0.19222015142440796, "mean_token_accuracy": 0.9461041837930679, "num_tokens": 27605483.0, "step": 1715 }, { "aux_loss": 8.08912272453308, "entropy": 0.16188026033341885, "epoch": 0.00172, "grad_norm": 0.1400371640920639, "learning_rate": 2e-05, "loss": 0.19799292087554932, "mean_token_accuracy": 0.9432717949151993, "num_tokens": 27682781.0, "step": 1720 }, { "aux_loss": 8.090563344955445, "entropy": 0.19338417798280716, "epoch": 0.001725, "grad_norm": 0.13796886801719666, "learning_rate": 2e-05, "loss": 0.22614567279815673, "mean_token_accuracy": 0.935646939277649, "num_tokens": 27763895.0, "step": 1725 }, { "aux_loss": 8.098656415939331, "entropy": 0.18461048305034639, "epoch": 0.00173, "grad_norm": 0.14468136429786682, "learning_rate": 2e-05, "loss": 0.213616943359375, "mean_token_accuracy": 0.9396229416131974, "num_tokens": 27844834.0, "step": 1730 }, { "aux_loss": 8.107629537582397, "entropy": 0.17966359108686447, "epoch": 0.001735, "grad_norm": 0.1427018791437149, "learning_rate": 2e-05, "loss": 0.21277756690979005, "mean_token_accuracy": 0.9404060482978821, "num_tokens": 27925652.0, "step": 1735 }, { "aux_loss": 8.12034010887146, "entropy": 0.17336866483092309, "epoch": 0.00174, "grad_norm": 0.1495121866464615, "learning_rate": 2e-05, "loss": 0.20275940895080566, "mean_token_accuracy": 0.9420665025711059, "num_tokens": 28005982.0, "step": 1740 }, { "aux_loss": 8.13797106742859, "entropy": 0.16741465479135514, "epoch": 0.001745, "grad_norm": 0.15425525605678558, "learning_rate": 2e-05, "loss": 0.19253748655319214, "mean_token_accuracy": 0.9453565120697022, "num_tokens": 28086419.0, "step": 1745 }, { "aux_loss": 8.09626030921936, "entropy": 0.15883845277130604, "epoch": 0.00175, "grad_norm": 0.14984235167503357, "learning_rate": 2e-05, "loss": 0.20106861591339112, "mean_token_accuracy": 0.9447483986616134, "num_tokens": 28166183.0, "step": 1750 }, { "aux_loss": 8.087971305847168, "entropy": 0.17699833139777182, "epoch": 0.001755, "grad_norm": 0.14571627974510193, "learning_rate": 2e-05, "loss": 0.22462019920349122, "mean_token_accuracy": 0.937322124838829, "num_tokens": 28247260.0, "step": 1755 }, { "aux_loss": 8.096086835861206, "entropy": 0.18670467361807824, "epoch": 0.00176, "grad_norm": 0.13775542378425598, "learning_rate": 2e-05, "loss": 0.21440637111663818, "mean_token_accuracy": 0.9395901650190354, "num_tokens": 28328086.0, "step": 1760 }, { "aux_loss": 8.105480766296386, "entropy": 0.18005181178450586, "epoch": 0.001765, "grad_norm": 0.13863572478294373, "learning_rate": 2e-05, "loss": 0.20243821144104004, "mean_token_accuracy": 0.9433570712804794, "num_tokens": 28409087.0, "step": 1765 }, { "aux_loss": 8.116328716278076, "entropy": 0.17669251263141633, "epoch": 0.00177, "grad_norm": 0.1435736119747162, "learning_rate": 2e-05, "loss": 0.2058091640472412, "mean_token_accuracy": 0.9422786742448807, "num_tokens": 28489547.0, "step": 1770 }, { "aux_loss": 8.138267469406127, "entropy": 0.16357129886746408, "epoch": 0.001775, "grad_norm": 0.1697431057691574, "learning_rate": 2e-05, "loss": 0.1961698889732361, "mean_token_accuracy": 0.9445254772901535, "num_tokens": 28569719.0, "step": 1775 }, { "aux_loss": 8.095318269729614, "entropy": 0.15334185361862182, "epoch": 0.00178, "grad_norm": 0.14353254437446594, "learning_rate": 2e-05, "loss": 0.19230631589889527, "mean_token_accuracy": 0.9462363421916962, "num_tokens": 28649541.0, "step": 1780 }, { "aux_loss": 8.084946012496948, "entropy": 0.18362632989883423, "epoch": 0.001785, "grad_norm": 0.13997416198253632, "learning_rate": 2e-05, "loss": 0.22572917938232423, "mean_token_accuracy": 0.9371131926774978, "num_tokens": 28730801.0, "step": 1785 }, { "aux_loss": 8.094417142868043, "entropy": 0.1935125134885311, "epoch": 0.00179, "grad_norm": 0.14033225178718567, "learning_rate": 2e-05, "loss": 0.22036070823669435, "mean_token_accuracy": 0.9385657787322998, "num_tokens": 28812114.0, "step": 1790 }, { "aux_loss": 8.10587649345398, "entropy": 0.17012702152132989, "epoch": 0.001795, "grad_norm": 0.1463741660118103, "learning_rate": 2e-05, "loss": 0.19968732595443725, "mean_token_accuracy": 0.9432043999433517, "num_tokens": 28893187.0, "step": 1795 }, { "aux_loss": 8.123018264770508, "entropy": 0.1629740722477436, "epoch": 0.0018, "grad_norm": 0.15700559318065643, "learning_rate": 2e-05, "loss": 0.19563982486724854, "mean_token_accuracy": 0.9459733098745347, "num_tokens": 28973708.0, "step": 1800 }, { "aux_loss": 8.141767835617065, "entropy": 0.1542024113237858, "epoch": 0.001805, "grad_norm": 0.1794741153717041, "learning_rate": 2e-05, "loss": 0.18798991441726684, "mean_token_accuracy": 0.9461712419986725, "num_tokens": 29054450.0, "step": 1805 }, { "aux_loss": 8.097171592712403, "entropy": 0.14869276769459247, "epoch": 0.00181, "grad_norm": 0.15480752289295197, "learning_rate": 2e-05, "loss": 0.18727688789367675, "mean_token_accuracy": 0.9484751909971237, "num_tokens": 29135641.0, "step": 1810 }, { "aux_loss": 8.085370969772338, "entropy": 0.18647595047950744, "epoch": 0.001815, "grad_norm": 0.14736691117286682, "learning_rate": 2e-05, "loss": 0.22024307250976563, "mean_token_accuracy": 0.9377060443162918, "num_tokens": 29216504.0, "step": 1815 }, { "aux_loss": 8.093893194198609, "entropy": 0.19387242645025254, "epoch": 0.00182, "grad_norm": 0.14280001819133759, "learning_rate": 2e-05, "loss": 0.22777719497680665, "mean_token_accuracy": 0.937128022313118, "num_tokens": 29297660.0, "step": 1820 }, { "aux_loss": 8.103721952438354, "entropy": 0.17211199477314948, "epoch": 0.001825, "grad_norm": 0.153641477227211, "learning_rate": 2e-05, "loss": 0.19921499490737915, "mean_token_accuracy": 0.9442539513111115, "num_tokens": 29378679.0, "step": 1825 }, { "aux_loss": 8.121135091781616, "entropy": 0.17612731233239173, "epoch": 0.00183, "grad_norm": 0.16757187247276306, "learning_rate": 2e-05, "loss": 0.20550386905670165, "mean_token_accuracy": 0.9418410420417785, "num_tokens": 29459520.0, "step": 1830 }, { "aux_loss": 8.134055376052856, "entropy": 0.15651994571089745, "epoch": 0.001835, "grad_norm": 0.16769260168075562, "learning_rate": 2e-05, "loss": 0.1892096519470215, "mean_token_accuracy": 0.9467572629451751, "num_tokens": 29539625.0, "step": 1835 }, { "aux_loss": 8.108575201034546, "entropy": 0.15799305215477943, "epoch": 0.00184, "grad_norm": 0.14953041076660156, "learning_rate": 2e-05, "loss": 0.20081510543823242, "mean_token_accuracy": 0.9454599142074585, "num_tokens": 29620351.0, "step": 1840 }, { "aux_loss": 8.090334177017212, "entropy": 0.18302324786782265, "epoch": 0.001845, "grad_norm": 0.14703971147537231, "learning_rate": 2e-05, "loss": 0.22612268924713136, "mean_token_accuracy": 0.9370312541723251, "num_tokens": 29701395.0, "step": 1845 }, { "aux_loss": 8.092384195327758, "entropy": 0.19149321541190148, "epoch": 0.00185, "grad_norm": 0.14011870324611664, "learning_rate": 2e-05, "loss": 0.21809930801391603, "mean_token_accuracy": 0.93871491253376, "num_tokens": 29782863.0, "step": 1850 }, { "aux_loss": 8.104417562484741, "entropy": 0.17967173233628272, "epoch": 0.001855, "grad_norm": 0.1392931342124939, "learning_rate": 2e-05, "loss": 0.2052596092224121, "mean_token_accuracy": 0.9424006640911102, "num_tokens": 29863853.0, "step": 1855 }, { "aux_loss": 8.115437746047974, "entropy": 0.17473116293549537, "epoch": 0.00186, "grad_norm": 0.15456846356391907, "learning_rate": 2e-05, "loss": 0.20883481502532958, "mean_token_accuracy": 0.9422131240367889, "num_tokens": 29944494.0, "step": 1860 }, { "aux_loss": 8.130228281021118, "entropy": 0.1598011538386345, "epoch": 0.001865, "grad_norm": 0.15138360857963562, "learning_rate": 2e-05, "loss": 0.19179458618164064, "mean_token_accuracy": 0.9459455698728562, "num_tokens": 30024871.0, "step": 1865 }, { "aux_loss": 8.114875078201294, "entropy": 0.15188466049730778, "epoch": 0.00187, "grad_norm": 0.1505664438009262, "learning_rate": 2e-05, "loss": 0.1842581272125244, "mean_token_accuracy": 0.9483438968658447, "num_tokens": 30103012.0, "step": 1870 }, { "aux_loss": 8.087232494354248, "entropy": 0.16997748129069806, "epoch": 0.001875, "grad_norm": 0.14826248586177826, "learning_rate": 2e-05, "loss": 0.2133951187133789, "mean_token_accuracy": 0.9409424215555191, "num_tokens": 30184174.0, "step": 1875 }, { "aux_loss": 8.091681003570557, "entropy": 0.18082854598760606, "epoch": 0.00188, "grad_norm": 0.1385442465543747, "learning_rate": 2e-05, "loss": 0.21204240322113038, "mean_token_accuracy": 0.9416619211435318, "num_tokens": 30264898.0, "step": 1880 }, { "aux_loss": 8.100720834732055, "entropy": 0.1882795512676239, "epoch": 0.001885, "grad_norm": 0.14320985972881317, "learning_rate": 2e-05, "loss": 0.21383564472198485, "mean_token_accuracy": 0.9398417532444, "num_tokens": 30345836.0, "step": 1885 }, { "aux_loss": 8.11526861190796, "entropy": 0.17213281691074372, "epoch": 0.00189, "grad_norm": 0.143971249461174, "learning_rate": 2e-05, "loss": 0.20359275341033936, "mean_token_accuracy": 0.94215886592865, "num_tokens": 30426658.0, "step": 1890 }, { "aux_loss": 8.128854751586914, "entropy": 0.15709721222519873, "epoch": 0.001895, "grad_norm": 0.169982448220253, "learning_rate": 2e-05, "loss": 0.18121217489242553, "mean_token_accuracy": 0.948867654800415, "num_tokens": 30506978.0, "step": 1895 }, { "aux_loss": 8.122401666641235, "entropy": 0.15198111161589622, "epoch": 0.0019, "grad_norm": 0.2494894117116928, "learning_rate": 2e-05, "loss": 0.18944740295410156, "mean_token_accuracy": 0.9484657168388366, "num_tokens": 30584707.0, "step": 1900 }, { "aux_loss": 8.08495569229126, "entropy": 0.16648186147212982, "epoch": 0.001905, "grad_norm": 0.14557261765003204, "learning_rate": 2e-05, "loss": 0.21277298927307128, "mean_token_accuracy": 0.9397358149290085, "num_tokens": 30665855.0, "step": 1905 }, { "aux_loss": 8.089331197738648, "entropy": 0.18394614458084108, "epoch": 0.00191, "grad_norm": 0.14418573677539825, "learning_rate": 2e-05, "loss": 0.22145624160766603, "mean_token_accuracy": 0.9384402185678482, "num_tokens": 30746741.0, "step": 1910 }, { "aux_loss": 8.099579572677612, "entropy": 0.18058552592992783, "epoch": 0.001915, "grad_norm": 0.14464372396469116, "learning_rate": 2e-05, "loss": 0.19679237604141236, "mean_token_accuracy": 0.9442365169525146, "num_tokens": 30827519.0, "step": 1915 }, { "aux_loss": 8.111036348342896, "entropy": 0.16745228171348572, "epoch": 0.00192, "grad_norm": 0.1453181803226471, "learning_rate": 2e-05, "loss": 0.19425774812698365, "mean_token_accuracy": 0.9451937824487686, "num_tokens": 30908391.0, "step": 1920 }, { "aux_loss": 8.12428812980652, "entropy": 0.15277336463332175, "epoch": 0.001925, "grad_norm": 0.17287026345729828, "learning_rate": 2e-05, "loss": 0.19231228828430175, "mean_token_accuracy": 0.9467857658863068, "num_tokens": 30988775.0, "step": 1925 }, { "aux_loss": 8.128771543502808, "entropy": 0.14848360568284988, "epoch": 0.00193, "grad_norm": 0.12818454205989838, "learning_rate": 2e-05, "loss": 0.17717504501342773, "mean_token_accuracy": 0.9506623685359955, "num_tokens": 31066517.0, "step": 1930 }, { "aux_loss": 8.07816481590271, "entropy": 0.17916654124855996, "epoch": 0.001935, "grad_norm": 0.1318196952342987, "learning_rate": 2e-05, "loss": 0.22017006874084472, "mean_token_accuracy": 0.9393600344657898, "num_tokens": 31148198.0, "step": 1935 }, { "aux_loss": 8.085155296325684, "entropy": 0.18373383060097695, "epoch": 0.00194, "grad_norm": 0.13922302424907684, "learning_rate": 2e-05, "loss": 0.2204740285873413, "mean_token_accuracy": 0.9385798037052154, "num_tokens": 31228701.0, "step": 1940 }, { "aux_loss": 8.093752336502074, "entropy": 0.18153189793229102, "epoch": 0.001945, "grad_norm": 0.14095920324325562, "learning_rate": 2e-05, "loss": 0.20607366561889648, "mean_token_accuracy": 0.9425692021846771, "num_tokens": 31309643.0, "step": 1945 }, { "aux_loss": 8.109092903137206, "entropy": 0.17216213867068292, "epoch": 0.00195, "grad_norm": 0.1501334309577942, "learning_rate": 2e-05, "loss": 0.20081067085266113, "mean_token_accuracy": 0.9431844651699066, "num_tokens": 31390333.0, "step": 1950 }, { "aux_loss": 8.121693420410157, "entropy": 0.16054480373859406, "epoch": 0.001955, "grad_norm": 0.14425206184387207, "learning_rate": 2e-05, "loss": 0.19371211528778076, "mean_token_accuracy": 0.9458245187997818, "num_tokens": 31471108.0, "step": 1955 }, { "aux_loss": 8.131749486923217, "entropy": 0.1476591568440199, "epoch": 0.00196, "grad_norm": 0.13990935683250427, "learning_rate": 2e-05, "loss": 0.18084168434143066, "mean_token_accuracy": 0.9503275483846665, "num_tokens": 31551156.0, "step": 1960 }, { "aux_loss": 8.079078769683838, "entropy": 0.15950408726930618, "epoch": 0.001965, "grad_norm": 0.1457347720861435, "learning_rate": 2e-05, "loss": 0.20008344650268556, "mean_token_accuracy": 0.9451485365629196, "num_tokens": 31632531.0, "step": 1965 }, { "aux_loss": 8.090669679641724, "entropy": 0.17626864910125734, "epoch": 0.00197, "grad_norm": 0.14180968701839447, "learning_rate": 2e-05, "loss": 0.21406903266906738, "mean_token_accuracy": 0.9399964392185212, "num_tokens": 31713571.0, "step": 1970 }, { "aux_loss": 8.094075250625611, "entropy": 0.17952204570174218, "epoch": 0.001975, "grad_norm": 0.14584553241729736, "learning_rate": 2e-05, "loss": 0.2037555456161499, "mean_token_accuracy": 0.9423517286777496, "num_tokens": 31794181.0, "step": 1975 }, { "aux_loss": 8.108042097091674, "entropy": 0.17397107556462288, "epoch": 0.00198, "grad_norm": 0.13913865387439728, "learning_rate": 2e-05, "loss": 0.20009984970092773, "mean_token_accuracy": 0.9435578137636185, "num_tokens": 31874688.0, "step": 1980 }, { "aux_loss": 8.124657011032104, "entropy": 0.16394528411328793, "epoch": 0.001985, "grad_norm": 0.16476790606975555, "learning_rate": 2e-05, "loss": 0.19735250473022461, "mean_token_accuracy": 0.9441554218530654, "num_tokens": 31955614.0, "step": 1985 }, { "aux_loss": 8.139951753616334, "entropy": 0.16006705798208715, "epoch": 0.00199, "grad_norm": 0.16014958918094635, "learning_rate": 2e-05, "loss": 0.193767249584198, "mean_token_accuracy": 0.9465360701084137, "num_tokens": 32033705.0, "step": 1990 }, { "aux_loss": 8.076089763641358, "entropy": 0.16580818742513656, "epoch": 0.001995, "grad_norm": 0.14132636785507202, "learning_rate": 2e-05, "loss": 0.20737054347991943, "mean_token_accuracy": 0.9432087421417237, "num_tokens": 32115159.0, "step": 1995 }, { "aux_loss": 8.089388179779053, "entropy": 0.17119593992829324, "epoch": 0.002, "grad_norm": 0.13946352899074554, "learning_rate": 2e-05, "loss": 0.2031093120574951, "mean_token_accuracy": 0.9424938827753067, "num_tokens": 32195875.0, "step": 2000 }, { "aux_loss": 8.099317407608032, "entropy": 0.17812084034085274, "epoch": 0.002005, "grad_norm": 0.13404801487922668, "learning_rate": 2e-05, "loss": 0.2054826498031616, "mean_token_accuracy": 0.9427031606435776, "num_tokens": 32276639.0, "step": 2005 }, { "aux_loss": 8.11078701019287, "entropy": 0.16636469662189485, "epoch": 0.00201, "grad_norm": 0.1405758410692215, "learning_rate": 2e-05, "loss": 0.1961885690689087, "mean_token_accuracy": 0.9454802840948104, "num_tokens": 32357510.0, "step": 2010 }, { "aux_loss": 8.124329996109008, "entropy": 0.16409692093729972, "epoch": 0.002015, "grad_norm": 0.1530579924583435, "learning_rate": 2e-05, "loss": 0.19761037826538086, "mean_token_accuracy": 0.9441994547843933, "num_tokens": 32438571.0, "step": 2015 }, { "aux_loss": 8.134271717071533, "entropy": 0.15539358295500277, "epoch": 0.00202, "grad_norm": 0.1314486712217331, "learning_rate": 2e-05, "loss": 0.18882243633270263, "mean_token_accuracy": 0.9479888468980789, "num_tokens": 32516933.0, "step": 2020 }, { "aux_loss": 8.076760530471802, "entropy": 0.160697041451931, "epoch": 0.002025, "grad_norm": 0.1575176864862442, "learning_rate": 2e-05, "loss": 0.20129084587097168, "mean_token_accuracy": 0.9434007734060288, "num_tokens": 32598260.0, "step": 2025 }, { "aux_loss": 8.088034677505494, "entropy": 0.18619557917118074, "epoch": 0.00203, "grad_norm": 0.1533048450946808, "learning_rate": 2e-05, "loss": 0.22235991954803466, "mean_token_accuracy": 0.9385304391384125, "num_tokens": 32679421.0, "step": 2030 }, { "aux_loss": 8.09389386177063, "entropy": 0.1984347604215145, "epoch": 0.002035, "grad_norm": 0.13730265200138092, "learning_rate": 2e-05, "loss": 0.22851157188415527, "mean_token_accuracy": 0.9353628069162369, "num_tokens": 32760105.0, "step": 2035 }, { "aux_loss": 8.10667643547058, "entropy": 0.1851852796971798, "epoch": 0.00204, "grad_norm": 0.136952742934227, "learning_rate": 2e-05, "loss": 0.20700442790985107, "mean_token_accuracy": 0.9416122794151306, "num_tokens": 32840448.0, "step": 2040 }, { "aux_loss": 8.119586324691772, "entropy": 0.1611733615398407, "epoch": 0.002045, "grad_norm": 0.15282323956489563, "learning_rate": 2e-05, "loss": 0.19286082983016967, "mean_token_accuracy": 0.9459655225276947, "num_tokens": 32920963.0, "step": 2045 }, { "aux_loss": 8.142139720916749, "entropy": 0.1511260338127613, "epoch": 0.00205, "grad_norm": 0.20718199014663696, "learning_rate": 2e-05, "loss": 0.18599768877029418, "mean_token_accuracy": 0.9473131716251373, "num_tokens": 32999796.0, "step": 2050 }, { "aux_loss": 8.073504304885864, "entropy": 0.15352291576564311, "epoch": 0.002055, "grad_norm": 0.1586863100528717, "learning_rate": 2e-05, "loss": 0.20044825077056885, "mean_token_accuracy": 0.9450691044330597, "num_tokens": 33081090.0, "step": 2055 }, { "aux_loss": 8.085515308380128, "entropy": 0.19169245585799216, "epoch": 0.00206, "grad_norm": 0.14856073260307312, "learning_rate": 2e-05, "loss": 0.2272887945175171, "mean_token_accuracy": 0.9367268264293671, "num_tokens": 33162496.0, "step": 2060 }, { "aux_loss": 8.090879011154176, "entropy": 0.1914783239364624, "epoch": 0.002065, "grad_norm": 0.13699573278427124, "learning_rate": 2e-05, "loss": 0.21631879806518556, "mean_token_accuracy": 0.9397626191377639, "num_tokens": 33243363.0, "step": 2065 }, { "aux_loss": 8.102555894851685, "entropy": 0.17537787184119225, "epoch": 0.00207, "grad_norm": 0.14345507323741913, "learning_rate": 2e-05, "loss": 0.20378334522247316, "mean_token_accuracy": 0.9429430037736892, "num_tokens": 33324009.0, "step": 2070 }, { "aux_loss": 8.116124439239503, "entropy": 0.16216097101569177, "epoch": 0.002075, "grad_norm": 0.15001976490020752, "learning_rate": 2e-05, "loss": 0.1955229640007019, "mean_token_accuracy": 0.945282730460167, "num_tokens": 33404354.0, "step": 2075 }, { "aux_loss": 8.13131160736084, "entropy": 0.15755471885204314, "epoch": 0.00208, "grad_norm": 0.1630067080259323, "learning_rate": 2e-05, "loss": 0.18815797567367554, "mean_token_accuracy": 0.9474914819002151, "num_tokens": 33485370.0, "step": 2080 }, { "aux_loss": 8.085240173339844, "entropy": 0.1570974349975586, "epoch": 0.002085, "grad_norm": 0.16560609638690948, "learning_rate": 2e-05, "loss": 0.19717142581939698, "mean_token_accuracy": 0.9450071066617965, "num_tokens": 33563829.0, "step": 2085 }, { "aux_loss": 8.079175758361817, "entropy": 0.1813222225755453, "epoch": 0.00209, "grad_norm": 0.15199394524097443, "learning_rate": 2e-05, "loss": 0.22196767330169678, "mean_token_accuracy": 0.9381584227085114, "num_tokens": 33645265.0, "step": 2090 }, { "aux_loss": 8.089537858963013, "entropy": 0.1975115083158016, "epoch": 0.002095, "grad_norm": 0.14169766008853912, "learning_rate": 2e-05, "loss": 0.2236358642578125, "mean_token_accuracy": 0.9374071359634399, "num_tokens": 33726036.0, "step": 2095 }, { "aux_loss": 8.101109313964844, "entropy": 0.1791003830730915, "epoch": 0.0021, "grad_norm": 0.1525634527206421, "learning_rate": 2e-05, "loss": 0.20314218997955322, "mean_token_accuracy": 0.9433953523635864, "num_tokens": 33806473.0, "step": 2100 }, { "aux_loss": 8.115503787994385, "entropy": 0.15914352983236313, "epoch": 0.002105, "grad_norm": 0.15232878923416138, "learning_rate": 2e-05, "loss": 0.1909801483154297, "mean_token_accuracy": 0.9463894724845886, "num_tokens": 33886645.0, "step": 2105 }, { "aux_loss": 8.136928987503051, "entropy": 0.1533144772052765, "epoch": 0.00211, "grad_norm": 0.16553930938243866, "learning_rate": 2e-05, "loss": 0.187789249420166, "mean_token_accuracy": 0.9473093211650848, "num_tokens": 33967099.0, "step": 2110 }, { "aux_loss": 8.085592317581177, "entropy": 0.15226773768663407, "epoch": 0.002115, "grad_norm": 0.1545340120792389, "learning_rate": 2e-05, "loss": 0.19702117443084716, "mean_token_accuracy": 0.9462773114442825, "num_tokens": 34047867.0, "step": 2115 }, { "aux_loss": 8.084630918502807, "entropy": 0.17928903549909592, "epoch": 0.00212, "grad_norm": 0.14029167592525482, "learning_rate": 2e-05, "loss": 0.21474015712738037, "mean_token_accuracy": 0.9403113484382629, "num_tokens": 34129348.0, "step": 2120 }, { "aux_loss": 8.092728471755981, "entropy": 0.18752039447426797, "epoch": 0.002125, "grad_norm": 0.16090719401836395, "learning_rate": 2e-05, "loss": 0.21388823986053468, "mean_token_accuracy": 0.9389720141887665, "num_tokens": 34209888.0, "step": 2125 }, { "aux_loss": 8.105613899230956, "entropy": 0.17475795224308968, "epoch": 0.00213, "grad_norm": 0.15447764098644257, "learning_rate": 2e-05, "loss": 0.20451686382293702, "mean_token_accuracy": 0.9426469892263413, "num_tokens": 34290780.0, "step": 2130 }, { "aux_loss": 8.117050743103027, "entropy": 0.1618360310792923, "epoch": 0.002135, "grad_norm": 0.1479986011981964, "learning_rate": 2e-05, "loss": 0.1921260714530945, "mean_token_accuracy": 0.9462061405181885, "num_tokens": 34371120.0, "step": 2135 }, { "aux_loss": 8.137471532821655, "entropy": 0.15500931218266487, "epoch": 0.00214, "grad_norm": 0.1681438386440277, "learning_rate": 2e-05, "loss": 0.18469098806381226, "mean_token_accuracy": 0.9486718863248825, "num_tokens": 34451650.0, "step": 2140 }, { "aux_loss": 8.082095575332641, "entropy": 0.14619569703936577, "epoch": 0.002145, "grad_norm": 0.15538665652275085, "learning_rate": 2e-05, "loss": 0.19378514289855958, "mean_token_accuracy": 0.9471194446086884, "num_tokens": 34532208.0, "step": 2145 }, { "aux_loss": 8.085667753219605, "entropy": 0.17372070737183093, "epoch": 0.00215, "grad_norm": 0.14733856916427612, "learning_rate": 2e-05, "loss": 0.21246514320373536, "mean_token_accuracy": 0.9406029522418976, "num_tokens": 34613186.0, "step": 2150 }, { "aux_loss": 8.090953254699707, "entropy": 0.18648151084780692, "epoch": 0.002155, "grad_norm": 0.13900934159755707, "learning_rate": 2e-05, "loss": 0.21289048194885254, "mean_token_accuracy": 0.9395630806684494, "num_tokens": 34694000.0, "step": 2155 }, { "aux_loss": 8.099458074569702, "entropy": 0.179243303835392, "epoch": 0.00216, "grad_norm": 0.1422865390777588, "learning_rate": 2e-05, "loss": 0.20033249855041504, "mean_token_accuracy": 0.9438653618097306, "num_tokens": 34774874.0, "step": 2160 }, { "aux_loss": 8.11012306213379, "entropy": 0.16056850105524062, "epoch": 0.002165, "grad_norm": 0.1500975340604782, "learning_rate": 2e-05, "loss": 0.1950578808784485, "mean_token_accuracy": 0.9458033829927445, "num_tokens": 34855714.0, "step": 2165 }, { "aux_loss": 8.128828239440917, "entropy": 0.15131179094314576, "epoch": 0.00217, "grad_norm": 0.17130112648010254, "learning_rate": 2e-05, "loss": 0.1841041088104248, "mean_token_accuracy": 0.9479575306177139, "num_tokens": 34936115.0, "step": 2170 }, { "aux_loss": 8.096973991394043, "entropy": 0.1353026580065489, "epoch": 0.002175, "grad_norm": 0.14092183113098145, "learning_rate": 2e-05, "loss": 0.1694318413734436, "mean_token_accuracy": 0.953260064125061, "num_tokens": 35016252.0, "step": 2175 }, { "aux_loss": 8.082904958724976, "entropy": 0.18240192383527756, "epoch": 0.00218, "grad_norm": 0.14787666499614716, "learning_rate": 2e-05, "loss": 0.2253516674041748, "mean_token_accuracy": 0.9372398585081101, "num_tokens": 35097431.0, "step": 2180 }, { "aux_loss": 8.090396499633789, "entropy": 0.188712240755558, "epoch": 0.002185, "grad_norm": 0.17046400904655457, "learning_rate": 2e-05, "loss": 0.2209940195083618, "mean_token_accuracy": 0.9375521659851074, "num_tokens": 35178778.0, "step": 2185 }, { "aux_loss": 8.098586225509644, "entropy": 0.17917247265577316, "epoch": 0.00219, "grad_norm": 0.13856396079063416, "learning_rate": 2e-05, "loss": 0.20676376819610595, "mean_token_accuracy": 0.9419531643390655, "num_tokens": 35259574.0, "step": 2190 }, { "aux_loss": 8.111574029922485, "entropy": 0.17405206337571144, "epoch": 0.002195, "grad_norm": 0.14484310150146484, "learning_rate": 2e-05, "loss": 0.20087049007415772, "mean_token_accuracy": 0.9425794541835785, "num_tokens": 35340171.0, "step": 2195 }, { "aux_loss": 8.12577714920044, "entropy": 0.15521480180323124, "epoch": 0.0022, "grad_norm": 0.18309779465198517, "learning_rate": 2e-05, "loss": 0.1860737681388855, "mean_token_accuracy": 0.9473440408706665, "num_tokens": 35420499.0, "step": 2200 }, { "aux_loss": 8.106541919708253, "entropy": 0.15410314984619616, "epoch": 0.002205, "grad_norm": 0.16265305876731873, "learning_rate": 2e-05, "loss": 0.19503383636474608, "mean_token_accuracy": 0.9455761820077896, "num_tokens": 35499651.0, "step": 2205 }, { "aux_loss": 8.081146049499512, "entropy": 0.17743488028645515, "epoch": 0.00221, "grad_norm": 0.15264394879341125, "learning_rate": 2e-05, "loss": 0.22179040908813477, "mean_token_accuracy": 0.9375330954790115, "num_tokens": 35581141.0, "step": 2210 }, { "aux_loss": 8.089364290237427, "entropy": 0.19082226306200029, "epoch": 0.002215, "grad_norm": 0.13382941484451294, "learning_rate": 2e-05, "loss": 0.22009677886962892, "mean_token_accuracy": 0.9386865109205246, "num_tokens": 35661933.0, "step": 2215 }, { "aux_loss": 8.09914779663086, "entropy": 0.18173426166176795, "epoch": 0.00222, "grad_norm": 0.13940785825252533, "learning_rate": 2e-05, "loss": 0.20357420444488525, "mean_token_accuracy": 0.9428389191627502, "num_tokens": 35742852.0, "step": 2220 }, { "aux_loss": 8.109477663040161, "entropy": 0.16557887718081474, "epoch": 0.002225, "grad_norm": 0.1517818123102188, "learning_rate": 2e-05, "loss": 0.19582066535949708, "mean_token_accuracy": 0.9441197693347931, "num_tokens": 35823590.0, "step": 2225 }, { "aux_loss": 8.124861478805542, "entropy": 0.15990642234683036, "epoch": 0.00223, "grad_norm": 0.16026835143566132, "learning_rate": 2e-05, "loss": 0.19691332578659057, "mean_token_accuracy": 0.9450530737638474, "num_tokens": 35903659.0, "step": 2230 }, { "aux_loss": 8.110028553009034, "entropy": 0.14880426675081254, "epoch": 0.002235, "grad_norm": 0.14345495402812958, "learning_rate": 2e-05, "loss": 0.17638733386993408, "mean_token_accuracy": 0.951531520485878, "num_tokens": 35980742.0, "step": 2235 }, { "aux_loss": 8.076312446594239, "entropy": 0.1716868907213211, "epoch": 0.00224, "grad_norm": 0.15603093802928925, "learning_rate": 2e-05, "loss": 0.21976280212402344, "mean_token_accuracy": 0.939437958598137, "num_tokens": 36061594.0, "step": 2240 }, { "aux_loss": 8.084784698486327, "entropy": 0.17795654386281967, "epoch": 0.002245, "grad_norm": 0.13866472244262695, "learning_rate": 2e-05, "loss": 0.20380654335021972, "mean_token_accuracy": 0.9432132840156555, "num_tokens": 36142538.0, "step": 2245 }, { "aux_loss": 8.096397113800048, "entropy": 0.1781972512602806, "epoch": 0.00225, "grad_norm": 0.1484403908252716, "learning_rate": 2e-05, "loss": 0.20842454433441163, "mean_token_accuracy": 0.9416657865047455, "num_tokens": 36223141.0, "step": 2250 }, { "aux_loss": 8.106841039657592, "entropy": 0.17267693802714348, "epoch": 0.002255, "grad_norm": 0.1455325186252594, "learning_rate": 2e-05, "loss": 0.20392305850982667, "mean_token_accuracy": 0.94244185090065, "num_tokens": 36303819.0, "step": 2255 }, { "aux_loss": 8.123301219940185, "entropy": 0.1638832077383995, "epoch": 0.00226, "grad_norm": 0.15240441262722015, "learning_rate": 2e-05, "loss": 0.19455764293670655, "mean_token_accuracy": 0.9457614630460739, "num_tokens": 36383712.0, "step": 2260 }, { "aux_loss": 8.109774494171143, "entropy": 0.15629686638712884, "epoch": 0.002265, "grad_norm": 0.14580827951431274, "learning_rate": 2e-05, "loss": 0.19248292446136475, "mean_token_accuracy": 0.9473178863525391, "num_tokens": 36462413.0, "step": 2265 }, { "aux_loss": 8.080343246459961, "entropy": 0.17776158899068834, "epoch": 0.00227, "grad_norm": 0.15754243731498718, "learning_rate": 2e-05, "loss": 0.21568129062652588, "mean_token_accuracy": 0.9400018811225891, "num_tokens": 36543608.0, "step": 2270 }, { "aux_loss": 8.084667730331422, "entropy": 0.18670802041888238, "epoch": 0.002275, "grad_norm": 0.13676391541957855, "learning_rate": 2e-05, "loss": 0.21331896781921386, "mean_token_accuracy": 0.9408599764108658, "num_tokens": 36624156.0, "step": 2275 }, { "aux_loss": 8.094764137268067, "entropy": 0.1731523796916008, "epoch": 0.00228, "grad_norm": 0.16389347612857819, "learning_rate": 2e-05, "loss": 0.20079305171966552, "mean_token_accuracy": 0.9436883717775345, "num_tokens": 36705126.0, "step": 2280 }, { "aux_loss": 8.10275354385376, "entropy": 0.16792446225881577, "epoch": 0.002285, "grad_norm": 0.14619581401348114, "learning_rate": 2e-05, "loss": 0.19990408420562744, "mean_token_accuracy": 0.9430625677108765, "num_tokens": 36786106.0, "step": 2285 }, { "aux_loss": 8.118331623077392, "entropy": 0.16288357749581336, "epoch": 0.00229, "grad_norm": 0.16086938977241516, "learning_rate": 2e-05, "loss": 0.19735727310180665, "mean_token_accuracy": 0.9458436697721482, "num_tokens": 36867047.0, "step": 2290 }, { "aux_loss": 8.118902730941773, "entropy": 0.15250914059579374, "epoch": 0.002295, "grad_norm": 0.14330445230007172, "learning_rate": 2e-05, "loss": 0.18190444707870485, "mean_token_accuracy": 0.9490704566240311, "num_tokens": 36944943.0, "step": 2295 }, { "aux_loss": 8.075653839111329, "entropy": 0.1593605875968933, "epoch": 0.0023, "grad_norm": 0.13995373249053955, "learning_rate": 2e-05, "loss": 0.2039646625518799, "mean_token_accuracy": 0.9433200567960739, "num_tokens": 37025984.0, "step": 2300 }, { "aux_loss": 8.087512254714966, "entropy": 0.1860686607658863, "epoch": 0.002305, "grad_norm": 0.13759204745292664, "learning_rate": 2e-05, "loss": 0.22247304916381835, "mean_token_accuracy": 0.9367720305919647, "num_tokens": 37106861.0, "step": 2305 }, { "aux_loss": 8.095287132263184, "entropy": 0.18836626335978507, "epoch": 0.00231, "grad_norm": 0.15044982731342316, "learning_rate": 2e-05, "loss": 0.21037421226501465, "mean_token_accuracy": 0.9411572962999344, "num_tokens": 37187899.0, "step": 2310 }, { "aux_loss": 8.108015441894532, "entropy": 0.18079396188259125, "epoch": 0.002315, "grad_norm": 0.14435166120529175, "learning_rate": 2e-05, "loss": 0.21002936363220215, "mean_token_accuracy": 0.9402021259069443, "num_tokens": 37268517.0, "step": 2315 }, { "aux_loss": 8.118687677383424, "entropy": 0.1508309967815876, "epoch": 0.00232, "grad_norm": 0.1588558554649353, "learning_rate": 2e-05, "loss": 0.18262405395507814, "mean_token_accuracy": 0.9487547636032104, "num_tokens": 37348643.0, "step": 2320 }, { "aux_loss": 8.11876459121704, "entropy": 0.15192754790186883, "epoch": 0.002325, "grad_norm": 0.14980925619602203, "learning_rate": 2e-05, "loss": 0.19291154146194459, "mean_token_accuracy": 0.9454974114894867, "num_tokens": 37426287.0, "step": 2325 }, { "aux_loss": 8.072935342788696, "entropy": 0.15959618985652924, "epoch": 0.00233, "grad_norm": 0.14502452313899994, "learning_rate": 2e-05, "loss": 0.20303568840026856, "mean_token_accuracy": 0.9447141468524933, "num_tokens": 37507440.0, "step": 2330 }, { "aux_loss": 8.083228874206544, "entropy": 0.18669020012021065, "epoch": 0.002335, "grad_norm": 0.14419959485530853, "learning_rate": 2e-05, "loss": 0.2143770456314087, "mean_token_accuracy": 0.939791139960289, "num_tokens": 37588258.0, "step": 2335 }, { "aux_loss": 8.092568063735962, "entropy": 0.18322967886924743, "epoch": 0.00234, "grad_norm": 0.1554855853319168, "learning_rate": 2e-05, "loss": 0.2063164472579956, "mean_token_accuracy": 0.9414166659116745, "num_tokens": 37668728.0, "step": 2340 }, { "aux_loss": 8.102509689331054, "entropy": 0.16345815286040305, "epoch": 0.002345, "grad_norm": 0.1634492725133896, "learning_rate": 2e-05, "loss": 0.20011322498321532, "mean_token_accuracy": 0.9438972026109695, "num_tokens": 37748838.0, "step": 2345 }, { "aux_loss": 8.11418375968933, "entropy": 0.16603684350848197, "epoch": 0.00235, "grad_norm": 0.14245444536209106, "learning_rate": 2e-05, "loss": 0.1968133568763733, "mean_token_accuracy": 0.9455876886844635, "num_tokens": 37829396.0, "step": 2350 }, { "aux_loss": 8.131700086593629, "entropy": 0.15448009595274925, "epoch": 0.002355, "grad_norm": 0.1676913946866989, "learning_rate": 2e-05, "loss": 0.1844778060913086, "mean_token_accuracy": 0.9480048835277557, "num_tokens": 37906525.0, "step": 2355 }, { "aux_loss": 8.073725318908691, "entropy": 0.16473549902439116, "epoch": 0.00236, "grad_norm": 0.14581012725830078, "learning_rate": 2e-05, "loss": 0.2133479118347168, "mean_token_accuracy": 0.9407844752073288, "num_tokens": 37987845.0, "step": 2360 }, { "aux_loss": 8.079457998275757, "entropy": 0.18857136219739914, "epoch": 0.002365, "grad_norm": 0.14681008458137512, "learning_rate": 2e-05, "loss": 0.22654881477355956, "mean_token_accuracy": 0.93775754570961, "num_tokens": 38068960.0, "step": 2365 }, { "aux_loss": 8.087099742889404, "entropy": 0.17707170620560647, "epoch": 0.00237, "grad_norm": 0.1334906816482544, "learning_rate": 2e-05, "loss": 0.20186762809753417, "mean_token_accuracy": 0.9438526868820191, "num_tokens": 38149738.0, "step": 2370 }, { "aux_loss": 8.09603304862976, "entropy": 0.1817078672349453, "epoch": 0.002375, "grad_norm": 0.15234078466892242, "learning_rate": 2e-05, "loss": 0.20077755451202392, "mean_token_accuracy": 0.9430094093084336, "num_tokens": 38229880.0, "step": 2375 }, { "aux_loss": 8.11332926750183, "entropy": 0.15103389993309974, "epoch": 0.00238, "grad_norm": 0.16679836809635162, "learning_rate": 2e-05, "loss": 0.1859709620475769, "mean_token_accuracy": 0.9472784757614136, "num_tokens": 38310817.0, "step": 2380 }, { "aux_loss": 8.128608703613281, "entropy": 0.14925035387277602, "epoch": 0.002385, "grad_norm": 0.14778488874435425, "learning_rate": 2e-05, "loss": 0.18576887845993043, "mean_token_accuracy": 0.9485006332397461, "num_tokens": 38391282.0, "step": 2385 }, { "aux_loss": 8.078663730621338, "entropy": 0.1730654701590538, "epoch": 0.00239, "grad_norm": 0.15327969193458557, "learning_rate": 2e-05, "loss": 0.21485276222229005, "mean_token_accuracy": 0.9404427438974381, "num_tokens": 38472686.0, "step": 2390 }, { "aux_loss": 8.07740821838379, "entropy": 0.19329795911908149, "epoch": 0.002395, "grad_norm": 0.145245760679245, "learning_rate": 2e-05, "loss": 0.23386235237121583, "mean_token_accuracy": 0.9349213540554047, "num_tokens": 38553848.0, "step": 2395 }, { "aux_loss": 8.083292770385743, "entropy": 0.19434554129838943, "epoch": 0.0024, "grad_norm": 0.13770611584186554, "learning_rate": 2e-05, "loss": 0.22028076648712158, "mean_token_accuracy": 0.9392184466123581, "num_tokens": 38634744.0, "step": 2400 }, { "aux_loss": 8.097694253921508, "entropy": 0.18237790688872338, "epoch": 0.002405, "grad_norm": 0.1487669199705124, "learning_rate": 2e-05, "loss": 0.2100670576095581, "mean_token_accuracy": 0.9413860589265823, "num_tokens": 38715496.0, "step": 2405 }, { "aux_loss": 8.10801305770874, "entropy": 0.16891746148467063, "epoch": 0.00241, "grad_norm": 0.14763256907463074, "learning_rate": 2e-05, "loss": 0.20151259899139404, "mean_token_accuracy": 0.9435642391443253, "num_tokens": 38796096.0, "step": 2410 }, { "aux_loss": 8.12585744857788, "entropy": 0.15316050089895725, "epoch": 0.002415, "grad_norm": 0.1634683907032013, "learning_rate": 2e-05, "loss": 0.18161994218826294, "mean_token_accuracy": 0.949803501367569, "num_tokens": 38876276.0, "step": 2415 }, { "aux_loss": 8.077015113830566, "entropy": 0.1525297023355961, "epoch": 0.00242, "grad_norm": 0.1803746074438095, "learning_rate": 2e-05, "loss": 0.20174922943115234, "mean_token_accuracy": 0.9449002683162689, "num_tokens": 38957001.0, "step": 2420 }, { "aux_loss": 8.078759098052979, "entropy": 0.1808013513684273, "epoch": 0.002425, "grad_norm": 0.1409953236579895, "learning_rate": 2e-05, "loss": 0.22260196208953859, "mean_token_accuracy": 0.9379542499780655, "num_tokens": 39038111.0, "step": 2425 }, { "aux_loss": 8.088305902481078, "entropy": 0.1743409626185894, "epoch": 0.00243, "grad_norm": 0.14868317544460297, "learning_rate": 2e-05, "loss": 0.1922954797744751, "mean_token_accuracy": 0.94639051258564, "num_tokens": 39119062.0, "step": 2430 }, { "aux_loss": 8.099035120010376, "entropy": 0.1727360025048256, "epoch": 0.002435, "grad_norm": 0.15608380734920502, "learning_rate": 2e-05, "loss": 0.19858545064926147, "mean_token_accuracy": 0.9447236627340316, "num_tokens": 39199781.0, "step": 2435 }, { "aux_loss": 8.109528255462646, "entropy": 0.16413209736347198, "epoch": 0.00244, "grad_norm": 0.1472751945257187, "learning_rate": 2e-05, "loss": 0.20274732112884522, "mean_token_accuracy": 0.9434846758842468, "num_tokens": 39280279.0, "step": 2440 }, { "aux_loss": 8.127269220352172, "entropy": 0.1620781935751438, "epoch": 0.002445, "grad_norm": 0.14663583040237427, "learning_rate": 2e-05, "loss": 0.1924894332885742, "mean_token_accuracy": 0.9457176208496094, "num_tokens": 39360400.0, "step": 2445 }, { "aux_loss": 8.089293003082275, "entropy": 0.18135993257164956, "epoch": 0.00245, "grad_norm": 0.15306329727172852, "learning_rate": 2e-05, "loss": 0.21985092163085937, "mean_token_accuracy": 0.9400442719459534, "num_tokens": 39440866.0, "step": 2450 }, { "aux_loss": 8.076449537277222, "entropy": 0.1844419553875923, "epoch": 0.002455, "grad_norm": 0.13918258249759674, "learning_rate": 2e-05, "loss": 0.22127432823181153, "mean_token_accuracy": 0.9395702898502349, "num_tokens": 39522161.0, "step": 2455 }, { "aux_loss": 8.084309816360474, "entropy": 0.18715021312236785, "epoch": 0.00246, "grad_norm": 0.14264462888240814, "learning_rate": 2e-05, "loss": 0.21688578128814698, "mean_token_accuracy": 0.9393721938133239, "num_tokens": 39603268.0, "step": 2460 }, { "aux_loss": 8.09578332901001, "entropy": 0.1833598129451275, "epoch": 0.002465, "grad_norm": 0.13851940631866455, "learning_rate": 2e-05, "loss": 0.20649237632751466, "mean_token_accuracy": 0.9424688786268234, "num_tokens": 39683887.0, "step": 2465 }, { "aux_loss": 8.112656593322754, "entropy": 0.16445145159959793, "epoch": 0.00247, "grad_norm": 0.14665396511554718, "learning_rate": 2e-05, "loss": 0.19205303192138673, "mean_token_accuracy": 0.945525485277176, "num_tokens": 39764133.0, "step": 2470 }, { "aux_loss": 8.122511672973634, "entropy": 0.1466979943215847, "epoch": 0.002475, "grad_norm": 0.14952561259269714, "learning_rate": 2e-05, "loss": 0.1791680335998535, "mean_token_accuracy": 0.9493878811597825, "num_tokens": 39844487.0, "step": 2475 }, { "aux_loss": 8.092697048187256, "entropy": 0.13941412158310412, "epoch": 0.00248, "grad_norm": 0.1423688679933548, "learning_rate": 2e-05, "loss": 0.18052189350128173, "mean_token_accuracy": 0.949979031085968, "num_tokens": 39922970.0, "step": 2480 }, { "aux_loss": 8.077152633666993, "entropy": 0.17317311018705367, "epoch": 0.002485, "grad_norm": 0.1295267641544342, "learning_rate": 2e-05, "loss": 0.21593210697174073, "mean_token_accuracy": 0.9398978143930435, "num_tokens": 40004037.0, "step": 2485 }, { "aux_loss": 8.079712390899658, "entropy": 0.17868908829987049, "epoch": 0.00249, "grad_norm": 0.14083313941955566, "learning_rate": 2e-05, "loss": 0.2062427282333374, "mean_token_accuracy": 0.9426745235919952, "num_tokens": 40084736.0, "step": 2490 }, { "aux_loss": 8.089857292175292, "entropy": 0.1889190748333931, "epoch": 0.002495, "grad_norm": 0.1387125551700592, "learning_rate": 2e-05, "loss": 0.21451432704925538, "mean_token_accuracy": 0.9401138484477997, "num_tokens": 40165274.0, "step": 2495 }, { "aux_loss": 8.10280442237854, "entropy": 0.17657697722315788, "epoch": 0.0025, "grad_norm": 0.1414203643798828, "learning_rate": 2e-05, "loss": 0.20892417430877686, "mean_token_accuracy": 0.941176226735115, "num_tokens": 40245693.0, "step": 2500 }, { "aux_loss": 8.118335151672364, "entropy": 0.1604831449687481, "epoch": 0.002505, "grad_norm": 0.1640281230211258, "learning_rate": 2e-05, "loss": 0.1901395082473755, "mean_token_accuracy": 0.9472380697727203, "num_tokens": 40326091.0, "step": 2505 }, { "aux_loss": 8.095034790039062, "entropy": 0.15698655024170877, "epoch": 0.00251, "grad_norm": 0.15623047947883606, "learning_rate": 2e-05, "loss": 0.20149469375610352, "mean_token_accuracy": 0.9449017673730851, "num_tokens": 40407165.0, "step": 2510 }, { "aux_loss": 8.076070404052734, "entropy": 0.18253343403339387, "epoch": 0.002515, "grad_norm": 0.14557181298732758, "learning_rate": 2e-05, "loss": 0.22407917976379393, "mean_token_accuracy": 0.9371753901243209, "num_tokens": 40488218.0, "step": 2515 }, { "aux_loss": 8.079090929031372, "entropy": 0.1965438723564148, "epoch": 0.00252, "grad_norm": 0.15903256833553314, "learning_rate": 2e-05, "loss": 0.22432379722595214, "mean_token_accuracy": 0.9371412605047226, "num_tokens": 40569357.0, "step": 2520 }, { "aux_loss": 8.092989253997803, "entropy": 0.1891261577606201, "epoch": 0.002525, "grad_norm": 0.13752049207687378, "learning_rate": 2e-05, "loss": 0.20952942371368408, "mean_token_accuracy": 0.9412952989339829, "num_tokens": 40650473.0, "step": 2525 }, { "aux_loss": 8.10186824798584, "entropy": 0.16528766751289367, "epoch": 0.00253, "grad_norm": 0.1446021944284439, "learning_rate": 2e-05, "loss": 0.1990690588951111, "mean_token_accuracy": 0.9436188697814941, "num_tokens": 40731040.0, "step": 2530 }, { "aux_loss": 8.115973663330077, "entropy": 0.15740383863449098, "epoch": 0.002535, "grad_norm": 0.14759008586406708, "learning_rate": 2e-05, "loss": 0.18687137365341186, "mean_token_accuracy": 0.9475764125585556, "num_tokens": 40811409.0, "step": 2535 }, { "aux_loss": 8.113844347000121, "entropy": 0.15397238209843636, "epoch": 0.00254, "grad_norm": 0.15065361559391022, "learning_rate": 2e-05, "loss": 0.1924121141433716, "mean_token_accuracy": 0.9462917983531952, "num_tokens": 40889180.0, "step": 2540 }, { "aux_loss": 8.073805284500121, "entropy": 0.18016892522573472, "epoch": 0.002545, "grad_norm": 0.15082381665706635, "learning_rate": 2e-05, "loss": 0.2252495765686035, "mean_token_accuracy": 0.9375465750694275, "num_tokens": 40969964.0, "step": 2545 }, { "aux_loss": 8.079817867279052, "entropy": 0.19116854891180993, "epoch": 0.00255, "grad_norm": 0.13598640263080597, "learning_rate": 2e-05, "loss": 0.22265090942382812, "mean_token_accuracy": 0.9392884552478791, "num_tokens": 41050990.0, "step": 2550 }, { "aux_loss": 8.091651058197021, "entropy": 0.19393812492489815, "epoch": 0.002555, "grad_norm": 0.1380283236503601, "learning_rate": 2e-05, "loss": 0.22394993305206298, "mean_token_accuracy": 0.9375712990760803, "num_tokens": 41131628.0, "step": 2555 }, { "aux_loss": 8.099888706207276, "entropy": 0.17336956933140754, "epoch": 0.00256, "grad_norm": 0.13645745813846588, "learning_rate": 2e-05, "loss": 0.2004483938217163, "mean_token_accuracy": 0.9430395931005477, "num_tokens": 41212285.0, "step": 2560 }, { "aux_loss": 8.111267566680908, "entropy": 0.16155279204249381, "epoch": 0.002565, "grad_norm": 0.14703181385993958, "learning_rate": 2e-05, "loss": 0.189046311378479, "mean_token_accuracy": 0.9468112826347351, "num_tokens": 41292841.0, "step": 2565 }, { "aux_loss": 8.109141540527343, "entropy": 0.1456486813724041, "epoch": 0.00257, "grad_norm": 0.14463473856449127, "learning_rate": 2e-05, "loss": 0.18097591400146484, "mean_token_accuracy": 0.9507924824953079, "num_tokens": 41372172.0, "step": 2570 }, { "aux_loss": 8.073219919204712, "entropy": 0.18117170445621014, "epoch": 0.002575, "grad_norm": 0.1482602208852768, "learning_rate": 2e-05, "loss": 0.22767367362976074, "mean_token_accuracy": 0.935913696885109, "num_tokens": 41453307.0, "step": 2575 }, { "aux_loss": 8.075421333312988, "entropy": 0.19263429790735245, "epoch": 0.00258, "grad_norm": 0.1455337107181549, "learning_rate": 2e-05, "loss": 0.22617831230163574, "mean_token_accuracy": 0.9362822055816651, "num_tokens": 41534026.0, "step": 2580 }, { "aux_loss": 8.087105178833008, "entropy": 0.17997874394059182, "epoch": 0.002585, "grad_norm": 0.14783543348312378, "learning_rate": 2e-05, "loss": 0.20190536975860596, "mean_token_accuracy": 0.9435222715139389, "num_tokens": 41614804.0, "step": 2585 }, { "aux_loss": 8.100873613357544, "entropy": 0.17839294150471688, "epoch": 0.00259, "grad_norm": 0.15630635619163513, "learning_rate": 2e-05, "loss": 0.21114187240600585, "mean_token_accuracy": 0.9409147024154663, "num_tokens": 41695832.0, "step": 2590 }, { "aux_loss": 8.111894226074218, "entropy": 0.16124511361122132, "epoch": 0.002595, "grad_norm": 0.15398986637592316, "learning_rate": 2e-05, "loss": 0.19127076864242554, "mean_token_accuracy": 0.9467630207538604, "num_tokens": 41776558.0, "step": 2595 }, { "aux_loss": 8.11488184928894, "entropy": 0.14952887110412122, "epoch": 0.0026, "grad_norm": 0.12254941463470459, "learning_rate": 2e-05, "loss": 0.18442397117614745, "mean_token_accuracy": 0.9494154214859009, "num_tokens": 41856347.0, "step": 2600 }, { "aux_loss": 8.070796585083007, "entropy": 0.17625901177525521, "epoch": 0.002605, "grad_norm": 0.15750719606876373, "learning_rate": 2e-05, "loss": 0.2269012451171875, "mean_token_accuracy": 0.9383298277854919, "num_tokens": 41937637.0, "step": 2605 }, { "aux_loss": 8.078232192993164, "entropy": 0.20892537087202073, "epoch": 0.00261, "grad_norm": 0.14309179782867432, "learning_rate": 2e-05, "loss": 0.2362462043762207, "mean_token_accuracy": 0.933705860376358, "num_tokens": 42018224.0, "step": 2610 }, { "aux_loss": 8.088038635253906, "entropy": 0.18252842277288436, "epoch": 0.002615, "grad_norm": 0.13642433285713196, "learning_rate": 2e-05, "loss": 0.2050029754638672, "mean_token_accuracy": 0.9437324970960617, "num_tokens": 42098789.0, "step": 2615 }, { "aux_loss": 8.101947784423828, "entropy": 0.18167223706841468, "epoch": 0.00262, "grad_norm": 0.14701588451862335, "learning_rate": 2e-05, "loss": 0.2142505407333374, "mean_token_accuracy": 0.939968267083168, "num_tokens": 42179697.0, "step": 2620 }, { "aux_loss": 8.112688302993774, "entropy": 0.1608296036720276, "epoch": 0.002625, "grad_norm": 0.15386417508125305, "learning_rate": 2e-05, "loss": 0.1939125895500183, "mean_token_accuracy": 0.9460368245840073, "num_tokens": 42260272.0, "step": 2625 }, { "aux_loss": 8.120966529846191, "entropy": 0.15800306014716625, "epoch": 0.00263, "grad_norm": 0.14041326940059662, "learning_rate": 2e-05, "loss": 0.19136632680892945, "mean_token_accuracy": 0.9471804887056351, "num_tokens": 42339732.0, "step": 2630 }, { "aux_loss": 8.071980142593384, "entropy": 0.18256490118801594, "epoch": 0.002635, "grad_norm": 0.154375359416008, "learning_rate": 2e-05, "loss": 0.2265719175338745, "mean_token_accuracy": 0.9373707473278046, "num_tokens": 42421141.0, "step": 2635 }, { "aux_loss": 8.075599956512452, "entropy": 0.19487906619906425, "epoch": 0.00264, "grad_norm": 0.1399112492799759, "learning_rate": 2e-05, "loss": 0.2332533836364746, "mean_token_accuracy": 0.9351333647966384, "num_tokens": 42502206.0, "step": 2640 }, { "aux_loss": 8.084503602981567, "entropy": 0.19292669147253036, "epoch": 0.002645, "grad_norm": 0.1477968543767929, "learning_rate": 2e-05, "loss": 0.2195763349533081, "mean_token_accuracy": 0.9394425630569458, "num_tokens": 42582876.0, "step": 2645 }, { "aux_loss": 8.09777274131775, "entropy": 0.17275489643216133, "epoch": 0.00265, "grad_norm": 0.14520341157913208, "learning_rate": 2e-05, "loss": 0.19572608470916747, "mean_token_accuracy": 0.9456899732351303, "num_tokens": 42663373.0, "step": 2650 }, { "aux_loss": 8.110652685165405, "entropy": 0.16136607751250268, "epoch": 0.002655, "grad_norm": 0.1658102571964264, "learning_rate": 2e-05, "loss": 0.19246256351470947, "mean_token_accuracy": 0.945327153801918, "num_tokens": 42744168.0, "step": 2655 }, { "aux_loss": 8.12573184967041, "entropy": 0.14542376026511192, "epoch": 0.00266, "grad_norm": 0.1605246365070343, "learning_rate": 2e-05, "loss": 0.17110786437988282, "mean_token_accuracy": 0.9521415412425995, "num_tokens": 42822630.0, "step": 2660 }, { "aux_loss": 8.069727516174316, "entropy": 0.17552723549306393, "epoch": 0.002665, "grad_norm": 0.2469029575586319, "learning_rate": 2e-05, "loss": 0.2253035306930542, "mean_token_accuracy": 0.9392019242048264, "num_tokens": 42903872.0, "step": 2665 }, { "aux_loss": 8.07782793045044, "entropy": 0.19894684851169586, "epoch": 0.00267, "grad_norm": 0.13871465623378754, "learning_rate": 2e-05, "loss": 0.23623056411743165, "mean_token_accuracy": 0.9340197622776032, "num_tokens": 42985349.0, "step": 2670 }, { "aux_loss": 8.085161781311035, "entropy": 0.19190286472439766, "epoch": 0.002675, "grad_norm": 0.14929887652397156, "learning_rate": 2e-05, "loss": 0.21718759536743165, "mean_token_accuracy": 0.9392900198698044, "num_tokens": 43066375.0, "step": 2675 }, { "aux_loss": 8.096126270294189, "entropy": 0.19029331654310228, "epoch": 0.00268, "grad_norm": 0.1458783745765686, "learning_rate": 2e-05, "loss": 0.21430518627166747, "mean_token_accuracy": 0.9394995540380477, "num_tokens": 43147219.0, "step": 2680 }, { "aux_loss": 8.107530117034912, "entropy": 0.15586493760347367, "epoch": 0.002685, "grad_norm": 0.1702526956796646, "learning_rate": 2e-05, "loss": 0.1878519892692566, "mean_token_accuracy": 0.9479204326868057, "num_tokens": 43227344.0, "step": 2685 }, { "aux_loss": 8.130838680267335, "entropy": 0.15244097486138344, "epoch": 0.00269, "grad_norm": 0.16751837730407715, "learning_rate": 2e-05, "loss": 0.1854215145111084, "mean_token_accuracy": 0.9483686149120331, "num_tokens": 43307625.0, "step": 2690 }, { "aux_loss": 8.078331851959229, "entropy": 0.1527701273560524, "epoch": 0.002695, "grad_norm": 0.14889752864837646, "learning_rate": 2e-05, "loss": 0.19740285873413085, "mean_token_accuracy": 0.9465331047773361, "num_tokens": 43388342.0, "step": 2695 }, { "aux_loss": 8.078295803070068, "entropy": 0.18069629594683648, "epoch": 0.0027, "grad_norm": 0.14572887122631073, "learning_rate": 2e-05, "loss": 0.21931033134460448, "mean_token_accuracy": 0.9392302930355072, "num_tokens": 43469497.0, "step": 2700 }, { "aux_loss": 8.083542346954346, "entropy": 0.18787576258182526, "epoch": 0.002705, "grad_norm": 0.13534726202487946, "learning_rate": 2e-05, "loss": 0.2157909631729126, "mean_token_accuracy": 0.9400046467781067, "num_tokens": 43550520.0, "step": 2705 }, { "aux_loss": 8.098087263107299, "entropy": 0.18121880441904067, "epoch": 0.00271, "grad_norm": 0.14448904991149902, "learning_rate": 2e-05, "loss": 0.20662832260131836, "mean_token_accuracy": 0.941738149523735, "num_tokens": 43631338.0, "step": 2710 }, { "aux_loss": 8.112855195999146, "entropy": 0.1707596518099308, "epoch": 0.002715, "grad_norm": 0.1639878749847412, "learning_rate": 2e-05, "loss": 0.2031870126724243, "mean_token_accuracy": 0.9440413445234299, "num_tokens": 43711619.0, "step": 2715 }, { "aux_loss": 8.126987075805664, "entropy": 0.15146464705467225, "epoch": 0.00272, "grad_norm": 0.15374919772148132, "learning_rate": 2e-05, "loss": 0.17934576272964478, "mean_token_accuracy": 0.9499849855899811, "num_tokens": 43792031.0, "step": 2720 }, { "aux_loss": 8.08648157119751, "entropy": 0.16811617240309715, "epoch": 0.002725, "grad_norm": 0.16933873295783997, "learning_rate": 2e-05, "loss": 0.20919368267059327, "mean_token_accuracy": 0.9438339740037918, "num_tokens": 43871936.0, "step": 2725 }, { "aux_loss": 8.075786447525024, "entropy": 0.19027187675237656, "epoch": 0.00273, "grad_norm": 0.15974991023540497, "learning_rate": 2e-05, "loss": 0.2363669157028198, "mean_token_accuracy": 0.9353165745735168, "num_tokens": 43952962.0, "step": 2730 }, { "aux_loss": 8.080311822891236, "entropy": 0.198441019654274, "epoch": 0.002735, "grad_norm": 0.15618927776813507, "learning_rate": 2e-05, "loss": 0.2246633768081665, "mean_token_accuracy": 0.9376106888055802, "num_tokens": 44034116.0, "step": 2735 }, { "aux_loss": 8.0945152759552, "entropy": 0.19126661866903305, "epoch": 0.00274, "grad_norm": 0.14107875525951385, "learning_rate": 2e-05, "loss": 0.21505730152130126, "mean_token_accuracy": 0.9397924184799195, "num_tokens": 44115130.0, "step": 2740 }, { "aux_loss": 8.10862979888916, "entropy": 0.1707291953265667, "epoch": 0.002745, "grad_norm": 0.15384399890899658, "learning_rate": 2e-05, "loss": 0.19822795391082765, "mean_token_accuracy": 0.9442929923534393, "num_tokens": 44195401.0, "step": 2745 }, { "aux_loss": 8.125518846511842, "entropy": 0.14779275730252267, "epoch": 0.00275, "grad_norm": 0.16695097088813782, "learning_rate": 2e-05, "loss": 0.1799459218978882, "mean_token_accuracy": 0.9499589592218399, "num_tokens": 44275896.0, "step": 2750 }, { "aux_loss": 8.091786193847657, "entropy": 0.1664949256926775, "epoch": 0.002755, "grad_norm": 0.16463322937488556, "learning_rate": 2e-05, "loss": 0.21682701110839844, "mean_token_accuracy": 0.940763384103775, "num_tokens": 44354850.0, "step": 2755 }, { "aux_loss": 8.078452444076538, "entropy": 0.19329728484153746, "epoch": 0.00276, "grad_norm": 0.13854876160621643, "learning_rate": 2e-05, "loss": 0.23405907154083253, "mean_token_accuracy": 0.9349021703004837, "num_tokens": 44435935.0, "step": 2760 }, { "aux_loss": 8.081658744812012, "entropy": 0.19469547793269157, "epoch": 0.002765, "grad_norm": 0.13840121030807495, "learning_rate": 2e-05, "loss": 0.21995303630828858, "mean_token_accuracy": 0.9390068531036377, "num_tokens": 44516956.0, "step": 2765 }, { "aux_loss": 8.094853734970092, "entropy": 0.18673215955495834, "epoch": 0.00277, "grad_norm": 0.14616280794143677, "learning_rate": 2e-05, "loss": 0.21082022190093994, "mean_token_accuracy": 0.9406619310379029, "num_tokens": 44597778.0, "step": 2770 }, { "aux_loss": 8.106273174285889, "entropy": 0.16729313060641288, "epoch": 0.002775, "grad_norm": 0.16103743016719818, "learning_rate": 2e-05, "loss": 0.19992878437042236, "mean_token_accuracy": 0.944680991768837, "num_tokens": 44678107.0, "step": 2775 }, { "aux_loss": 8.1201500415802, "entropy": 0.1520601712167263, "epoch": 0.00278, "grad_norm": 0.15789227187633514, "learning_rate": 2e-05, "loss": 0.1843225598335266, "mean_token_accuracy": 0.9481644630432129, "num_tokens": 44757973.0, "step": 2780 }, { "aux_loss": 8.096934032440185, "entropy": 0.14989367127418518, "epoch": 0.002785, "grad_norm": 0.15040884912014008, "learning_rate": 2e-05, "loss": 0.18910366296768188, "mean_token_accuracy": 0.9482103943824768, "num_tokens": 44836566.0, "step": 2785 }, { "aux_loss": 8.076406717300415, "entropy": 0.19880288168787957, "epoch": 0.00279, "grad_norm": 0.14457979798316956, "learning_rate": 2e-05, "loss": 0.24200451374053955, "mean_token_accuracy": 0.9328301399946213, "num_tokens": 44917514.0, "step": 2790 }, { "aux_loss": 8.084968185424804, "entropy": 0.18911403678357602, "epoch": 0.002795, "grad_norm": 0.14090609550476074, "learning_rate": 2e-05, "loss": 0.21615207195281982, "mean_token_accuracy": 0.939749613404274, "num_tokens": 44998413.0, "step": 2795 }, { "aux_loss": 8.091570806503295, "entropy": 0.18450974449515342, "epoch": 0.0028, "grad_norm": 0.14722010493278503, "learning_rate": 2e-05, "loss": 0.2080524444580078, "mean_token_accuracy": 0.9409097254276275, "num_tokens": 45079215.0, "step": 2800 }, { "aux_loss": 8.100802278518676, "entropy": 0.1651144064962864, "epoch": 0.002805, "grad_norm": 0.14703086018562317, "learning_rate": 2e-05, "loss": 0.1942728877067566, "mean_token_accuracy": 0.9462512761354447, "num_tokens": 45159778.0, "step": 2805 }, { "aux_loss": 8.116804504394532, "entropy": 0.15706228241324424, "epoch": 0.00281, "grad_norm": 0.16164728999137878, "learning_rate": 2e-05, "loss": 0.19007450342178345, "mean_token_accuracy": 0.9475653886795044, "num_tokens": 45239925.0, "step": 2810 }, { "aux_loss": 8.105684089660645, "entropy": 0.15516949817538261, "epoch": 0.002815, "grad_norm": 0.1553998589515686, "learning_rate": 2e-05, "loss": 0.19682148694992066, "mean_token_accuracy": 0.9462418019771576, "num_tokens": 45318777.0, "step": 2815 }, { "aux_loss": 8.06877179145813, "entropy": 0.17810099869966506, "epoch": 0.00282, "grad_norm": 0.15135815739631653, "learning_rate": 2e-05, "loss": 0.22194890975952147, "mean_token_accuracy": 0.9384380996227264, "num_tokens": 45400058.0, "step": 2820 }, { "aux_loss": 8.078272819519043, "entropy": 0.19753627777099608, "epoch": 0.002825, "grad_norm": 0.13577862083911896, "learning_rate": 2e-05, "loss": 0.23035862445831298, "mean_token_accuracy": 0.935256740450859, "num_tokens": 45480492.0, "step": 2825 }, { "aux_loss": 8.088609981536866, "entropy": 0.17886079102754593, "epoch": 0.00283, "grad_norm": 0.1576220989227295, "learning_rate": 2e-05, "loss": 0.19549431800842285, "mean_token_accuracy": 0.9454530507326127, "num_tokens": 45561258.0, "step": 2830 }, { "aux_loss": 8.098433589935302, "entropy": 0.17717600762844085, "epoch": 0.002835, "grad_norm": 0.14695903658866882, "learning_rate": 2e-05, "loss": 0.2073725700378418, "mean_token_accuracy": 0.9411997050046921, "num_tokens": 45641626.0, "step": 2835 }, { "aux_loss": 8.112347507476807, "entropy": 0.15916404463350772, "epoch": 0.00284, "grad_norm": 0.16437484323978424, "learning_rate": 2e-05, "loss": 0.19357267618179322, "mean_token_accuracy": 0.9453988254070282, "num_tokens": 45722304.0, "step": 2840 }, { "aux_loss": 8.113294410705567, "entropy": 0.14726108722388745, "epoch": 0.002845, "grad_norm": 0.13739712536334991, "learning_rate": 2e-05, "loss": 0.18099336624145507, "mean_token_accuracy": 0.950264859199524, "num_tokens": 45802174.0, "step": 2845 }, { "aux_loss": 8.067266464233398, "entropy": 0.16752013862133025, "epoch": 0.00285, "grad_norm": 0.1620785892009735, "learning_rate": 2e-05, "loss": 0.21951792240142823, "mean_token_accuracy": 0.9401003777980804, "num_tokens": 45883444.0, "step": 2850 }, { "aux_loss": 8.073601818084716, "entropy": 0.18826278373599054, "epoch": 0.002855, "grad_norm": 0.14571647346019745, "learning_rate": 2e-05, "loss": 0.21801767349243165, "mean_token_accuracy": 0.9387796074151993, "num_tokens": 45964043.0, "step": 2855 }, { "aux_loss": 8.087750053405761, "entropy": 0.19014779180288316, "epoch": 0.00286, "grad_norm": 0.14232376217842102, "learning_rate": 2e-05, "loss": 0.21073970794677735, "mean_token_accuracy": 0.9416055470705033, "num_tokens": 46044722.0, "step": 2860 }, { "aux_loss": 8.097754430770873, "entropy": 0.1776500701904297, "epoch": 0.002865, "grad_norm": 0.17109878361225128, "learning_rate": 2e-05, "loss": 0.20462331771850586, "mean_token_accuracy": 0.9429490447044373, "num_tokens": 46125391.0, "step": 2865 }, { "aux_loss": 8.109619522094727, "entropy": 0.1521120510995388, "epoch": 0.00287, "grad_norm": 0.15355637669563293, "learning_rate": 2e-05, "loss": 0.1853906273841858, "mean_token_accuracy": 0.9488934278488159, "num_tokens": 46205778.0, "step": 2870 }, { "aux_loss": 8.12909483909607, "entropy": 0.15182966738939285, "epoch": 0.002875, "grad_norm": 0.15022306144237518, "learning_rate": 2e-05, "loss": 0.17824344635009765, "mean_token_accuracy": 0.9494897872209549, "num_tokens": 46282933.0, "step": 2875 }, { "aux_loss": 8.072309017181396, "entropy": 0.16922202073037623, "epoch": 0.00288, "grad_norm": 0.1451803594827652, "learning_rate": 2e-05, "loss": 0.21520595550537108, "mean_token_accuracy": 0.9406840562820434, "num_tokens": 46364260.0, "step": 2880 }, { "aux_loss": 8.07764573097229, "entropy": 0.1865469954907894, "epoch": 0.002885, "grad_norm": 0.1395547091960907, "learning_rate": 2e-05, "loss": 0.22133069038391112, "mean_token_accuracy": 0.9387134283781051, "num_tokens": 46444829.0, "step": 2885 }, { "aux_loss": 8.087185287475586, "entropy": 0.18829575702548026, "epoch": 0.00289, "grad_norm": 0.15173520147800446, "learning_rate": 2e-05, "loss": 0.21082444190979005, "mean_token_accuracy": 0.9413496106863022, "num_tokens": 46525629.0, "step": 2890 }, { "aux_loss": 8.098417282104492, "entropy": 0.17964600697159766, "epoch": 0.002895, "grad_norm": 0.1490006297826767, "learning_rate": 2e-05, "loss": 0.20410447120666503, "mean_token_accuracy": 0.9433809965848923, "num_tokens": 46606117.0, "step": 2895 }, { "aux_loss": 8.108289337158203, "entropy": 0.15851739272475243, "epoch": 0.0029, "grad_norm": 0.16662052273750305, "learning_rate": 2e-05, "loss": 0.19273626804351807, "mean_token_accuracy": 0.9464959114789963, "num_tokens": 46685972.0, "step": 2900 }, { "aux_loss": 8.125025749206543, "entropy": 0.1530994538217783, "epoch": 0.002905, "grad_norm": 0.15623949468135834, "learning_rate": 2e-05, "loss": 0.1868635892868042, "mean_token_accuracy": 0.9484824895858764, "num_tokens": 46766456.0, "step": 2905 }, { "aux_loss": 8.075625801086426, "entropy": 0.16139253973960876, "epoch": 0.00291, "grad_norm": 0.14356064796447754, "learning_rate": 2e-05, "loss": 0.20534379482269288, "mean_token_accuracy": 0.9439013361930847, "num_tokens": 46847537.0, "step": 2910 }, { "aux_loss": 8.076686811447143, "entropy": 0.18802704960107802, "epoch": 0.002915, "grad_norm": 0.1410534828901291, "learning_rate": 2e-05, "loss": 0.22646405696868896, "mean_token_accuracy": 0.9367367178201675, "num_tokens": 46928461.0, "step": 2915 }, { "aux_loss": 8.08428888320923, "entropy": 0.1758427046239376, "epoch": 0.00292, "grad_norm": 0.14738109707832336, "learning_rate": 2e-05, "loss": 0.20100624561309816, "mean_token_accuracy": 0.9441363543272019, "num_tokens": 47009106.0, "step": 2920 }, { "aux_loss": 8.095292329788208, "entropy": 0.18274475634098053, "epoch": 0.002925, "grad_norm": 0.15297847986221313, "learning_rate": 2e-05, "loss": 0.2086167335510254, "mean_token_accuracy": 0.9418325036764145, "num_tokens": 47089327.0, "step": 2925 }, { "aux_loss": 8.107821607589722, "entropy": 0.15642909482121467, "epoch": 0.00293, "grad_norm": 0.14811629056930542, "learning_rate": 2e-05, "loss": 0.1830051898956299, "mean_token_accuracy": 0.9496629565954209, "num_tokens": 47170193.0, "step": 2930 }, { "aux_loss": 8.131646299362183, "entropy": 0.15163895227015017, "epoch": 0.002935, "grad_norm": 0.22720278799533844, "learning_rate": 2e-05, "loss": 0.19013959169387817, "mean_token_accuracy": 0.9475005149841309, "num_tokens": 47247385.0, "step": 2935 }, { "aux_loss": 8.076407861709594, "entropy": 0.16601541228592395, "epoch": 0.00294, "grad_norm": 0.16172954440116882, "learning_rate": 2e-05, "loss": 0.2110731601715088, "mean_token_accuracy": 0.9428413033485412, "num_tokens": 47328897.0, "step": 2940 }, { "aux_loss": 8.080685424804688, "entropy": 0.16975508704781533, "epoch": 0.002945, "grad_norm": 0.13648611307144165, "learning_rate": 2e-05, "loss": 0.20457279682159424, "mean_token_accuracy": 0.9430114537477493, "num_tokens": 47409920.0, "step": 2945 }, { "aux_loss": 8.08769178390503, "entropy": 0.17321218699216842, "epoch": 0.00295, "grad_norm": 0.1371011734008789, "learning_rate": 2e-05, "loss": 0.20059237480163575, "mean_token_accuracy": 0.944344025850296, "num_tokens": 47490216.0, "step": 2950 }, { "aux_loss": 8.09835376739502, "entropy": 0.17534421011805534, "epoch": 0.002955, "grad_norm": 0.14919205009937286, "learning_rate": 2e-05, "loss": 0.20029969215393068, "mean_token_accuracy": 0.9436137437820434, "num_tokens": 47570540.0, "step": 2955 }, { "aux_loss": 8.108619117736817, "entropy": 0.15632903352379798, "epoch": 0.00296, "grad_norm": 0.17632590234279633, "learning_rate": 2e-05, "loss": 0.1897244095802307, "mean_token_accuracy": 0.9480899810791016, "num_tokens": 47651290.0, "step": 2960 }, { "aux_loss": 8.126777124404907, "entropy": 0.15064034573733806, "epoch": 0.002965, "grad_norm": 0.16173529624938965, "learning_rate": 2e-05, "loss": 0.18522897958755494, "mean_token_accuracy": 0.9485573321580887, "num_tokens": 47731384.0, "step": 2965 }, { "aux_loss": 8.069377374649047, "entropy": 0.17484852522611619, "epoch": 0.00297, "grad_norm": 0.14227241277694702, "learning_rate": 2e-05, "loss": 0.22020425796508789, "mean_token_accuracy": 0.9394288778305053, "num_tokens": 47812737.0, "step": 2970 }, { "aux_loss": 8.074917316436768, "entropy": 0.1867200769484043, "epoch": 0.002975, "grad_norm": 0.1428276002407074, "learning_rate": 2e-05, "loss": 0.2199643850326538, "mean_token_accuracy": 0.9371882557868958, "num_tokens": 47893883.0, "step": 2975 }, { "aux_loss": 8.08695330619812, "entropy": 0.185770183801651, "epoch": 0.00298, "grad_norm": 0.1431232988834381, "learning_rate": 2e-05, "loss": 0.21032371520996093, "mean_token_accuracy": 0.9413160055875778, "num_tokens": 47974773.0, "step": 2980 }, { "aux_loss": 8.093664646148682, "entropy": 0.17664483636617662, "epoch": 0.002985, "grad_norm": 0.14912278950214386, "learning_rate": 2e-05, "loss": 0.20335035324096679, "mean_token_accuracy": 0.9418219566345215, "num_tokens": 48055120.0, "step": 2985 }, { "aux_loss": 8.10689287185669, "entropy": 0.15533287599682807, "epoch": 0.00299, "grad_norm": 0.14180661737918854, "learning_rate": 2e-05, "loss": 0.18206703662872314, "mean_token_accuracy": 0.9497777760028839, "num_tokens": 48135634.0, "step": 2990 }, { "aux_loss": 8.128514432907105, "entropy": 0.15512944869697093, "epoch": 0.002995, "grad_norm": 0.23194196820259094, "learning_rate": 2e-05, "loss": 0.1939287304878235, "mean_token_accuracy": 0.9470187544822692, "num_tokens": 48212781.0, "step": 2995 }, { "aux_loss": 8.074347972869873, "entropy": 0.14761393442749976, "epoch": 0.003, "grad_norm": 0.16289988160133362, "learning_rate": 2e-05, "loss": 0.19531513452529908, "mean_token_accuracy": 0.9461183100938797, "num_tokens": 48293983.0, "step": 3000 }, { "aux_loss": 8.074123859405518, "entropy": 0.17624220326542855, "epoch": 0.003005, "grad_norm": 0.1353483945131302, "learning_rate": 2e-05, "loss": 0.20937368869781495, "mean_token_accuracy": 0.941815647482872, "num_tokens": 48374979.0, "step": 3005 }, { "aux_loss": 8.084510660171508, "entropy": 0.18216314911842346, "epoch": 0.00301, "grad_norm": 0.14181570708751678, "learning_rate": 2e-05, "loss": 0.20339524745941162, "mean_token_accuracy": 0.9437639027833938, "num_tokens": 48455692.0, "step": 3010 }, { "aux_loss": 8.094678926467896, "entropy": 0.1740648839622736, "epoch": 0.003015, "grad_norm": 0.15326496958732605, "learning_rate": 2e-05, "loss": 0.2038062334060669, "mean_token_accuracy": 0.9432501882314682, "num_tokens": 48536353.0, "step": 3015 }, { "aux_loss": 8.106809997558594, "entropy": 0.16099482402205467, "epoch": 0.00302, "grad_norm": 0.17165681719779968, "learning_rate": 2e-05, "loss": 0.19483649730682373, "mean_token_accuracy": 0.946119824051857, "num_tokens": 48616858.0, "step": 3020 }, { "aux_loss": 8.123516130447388, "entropy": 0.14078146517276763, "epoch": 0.003025, "grad_norm": 0.17677168548107147, "learning_rate": 2e-05, "loss": 0.1703662395477295, "mean_token_accuracy": 0.9534485638141632, "num_tokens": 48697699.0, "step": 3025 }, { "aux_loss": 8.073600101470948, "entropy": 0.1642740063369274, "epoch": 0.00303, "grad_norm": 0.15738898515701294, "learning_rate": 2e-05, "loss": 0.20547797679901122, "mean_token_accuracy": 0.9430563062429428, "num_tokens": 48776328.0, "step": 3030 }, { "aux_loss": 8.074311685562133, "entropy": 0.1766006827354431, "epoch": 0.003035, "grad_norm": 0.13500206172466278, "learning_rate": 2e-05, "loss": 0.21654367446899414, "mean_token_accuracy": 0.939488896727562, "num_tokens": 48857588.0, "step": 3035 }, { "aux_loss": 8.08253984451294, "entropy": 0.1705415889620781, "epoch": 0.00304, "grad_norm": 0.13991662859916687, "learning_rate": 2e-05, "loss": 0.19832667112350463, "mean_token_accuracy": 0.9440321087837219, "num_tokens": 48938218.0, "step": 3040 }, { "aux_loss": 8.09462513923645, "entropy": 0.1893142431974411, "epoch": 0.003045, "grad_norm": 0.1491444706916809, "learning_rate": 2e-05, "loss": 0.21176254749298096, "mean_token_accuracy": 0.9404118835926056, "num_tokens": 49018629.0, "step": 3045 }, { "aux_loss": 8.106306886672973, "entropy": 0.16372528150677682, "epoch": 0.00305, "grad_norm": 0.14525392651557922, "learning_rate": 2e-05, "loss": 0.18929215669631957, "mean_token_accuracy": 0.9470975756645202, "num_tokens": 49099554.0, "step": 3050 }, { "aux_loss": 8.121476459503175, "entropy": 0.14607863649725913, "epoch": 0.003055, "grad_norm": 0.172555610537529, "learning_rate": 2e-05, "loss": 0.17976579666137696, "mean_token_accuracy": 0.9501303941011429, "num_tokens": 49179679.0, "step": 3055 }, { "aux_loss": 8.070800018310546, "entropy": 0.1742791451513767, "epoch": 0.00306, "grad_norm": 0.16902503371238708, "learning_rate": 2e-05, "loss": 0.22889356613159179, "mean_token_accuracy": 0.9380523175001144, "num_tokens": 49259841.0, "step": 3060 }, { "aux_loss": 8.075080823898315, "entropy": 0.18140368089079856, "epoch": 0.003065, "grad_norm": 0.14427874982357025, "learning_rate": 2e-05, "loss": 0.21710011959075928, "mean_token_accuracy": 0.9395097434520722, "num_tokens": 49340761.0, "step": 3065 }, { "aux_loss": 8.080142736434937, "entropy": 0.17514398097991943, "epoch": 0.00307, "grad_norm": 0.1458827555179596, "learning_rate": 2e-05, "loss": 0.20087404251098634, "mean_token_accuracy": 0.9440953344106674, "num_tokens": 49421716.0, "step": 3070 }, { "aux_loss": 8.094359970092773, "entropy": 0.18348851203918456, "epoch": 0.003075, "grad_norm": 0.1496962159872055, "learning_rate": 2e-05, "loss": 0.2093740224838257, "mean_token_accuracy": 0.9411183804273605, "num_tokens": 49502346.0, "step": 3075 }, { "aux_loss": 8.107255792617797, "entropy": 0.1585214577615261, "epoch": 0.00308, "grad_norm": 0.14572924375534058, "learning_rate": 2e-05, "loss": 0.18582788705825806, "mean_token_accuracy": 0.9484485566616059, "num_tokens": 49582931.0, "step": 3080 }, { "aux_loss": 8.125768804550171, "entropy": 0.1524410367012024, "epoch": 0.003085, "grad_norm": 0.19554057717323303, "learning_rate": 2e-05, "loss": 0.18749512434005738, "mean_token_accuracy": 0.9487124681472778, "num_tokens": 49662038.0, "step": 3085 }, { "aux_loss": 8.065309143066406, "entropy": 0.1476170975714922, "epoch": 0.00309, "grad_norm": 0.1500067263841629, "learning_rate": 2e-05, "loss": 0.1956866502761841, "mean_token_accuracy": 0.9471260637044907, "num_tokens": 49743454.0, "step": 3090 }, { "aux_loss": 8.070446252822876, "entropy": 0.18643608838319778, "epoch": 0.003095, "grad_norm": 0.12826579809188843, "learning_rate": 2e-05, "loss": 0.22123312950134277, "mean_token_accuracy": 0.9385463774204255, "num_tokens": 49824814.0, "step": 3095 }, { "aux_loss": 8.083160877227783, "entropy": 0.18798451498150826, "epoch": 0.0031, "grad_norm": 0.14452606439590454, "learning_rate": 2e-05, "loss": 0.21503002643585206, "mean_token_accuracy": 0.9404649019241333, "num_tokens": 49905807.0, "step": 3100 }, { "aux_loss": 8.092270660400391, "entropy": 0.18032723516225815, "epoch": 0.003105, "grad_norm": 0.1419580727815628, "learning_rate": 2e-05, "loss": 0.2056110382080078, "mean_token_accuracy": 0.9420620232820511, "num_tokens": 49986673.0, "step": 3105 }, { "aux_loss": 8.102667379379273, "entropy": 0.16459283158183097, "epoch": 0.00311, "grad_norm": 0.14356949925422668, "learning_rate": 2e-05, "loss": 0.19574639797210694, "mean_token_accuracy": 0.9458548665046692, "num_tokens": 50067358.0, "step": 3110 }, { "aux_loss": 8.119340229034425, "entropy": 0.15142956078052522, "epoch": 0.003115, "grad_norm": 0.16615331172943115, "learning_rate": 2e-05, "loss": 0.17887283563613893, "mean_token_accuracy": 0.9498388588428497, "num_tokens": 50147498.0, "step": 3115 }, { "aux_loss": 8.083586502075196, "entropy": 0.15965948812663555, "epoch": 0.00312, "grad_norm": 0.15895089507102966, "learning_rate": 2e-05, "loss": 0.20383920669555664, "mean_token_accuracy": 0.943869486451149, "num_tokens": 50228432.0, "step": 3120 }, { "aux_loss": 8.079378700256347, "entropy": 0.17228425592184066, "epoch": 0.003125, "grad_norm": 0.14265304803848267, "learning_rate": 2e-05, "loss": 0.21231956481933595, "mean_token_accuracy": 0.9405779361724853, "num_tokens": 50309758.0, "step": 3125 }, { "aux_loss": 8.081025695800781, "entropy": 0.18083779141306877, "epoch": 0.00313, "grad_norm": 0.149937704205513, "learning_rate": 2e-05, "loss": 0.2152872323989868, "mean_token_accuracy": 0.9383395344018937, "num_tokens": 50390948.0, "step": 3130 }, { "aux_loss": 8.091249132156372, "entropy": 0.17624640986323356, "epoch": 0.003135, "grad_norm": 0.1447724848985672, "learning_rate": 2e-05, "loss": 0.1994763970375061, "mean_token_accuracy": 0.9429386019706726, "num_tokens": 50472129.0, "step": 3135 }, { "aux_loss": 8.101275825500489, "entropy": 0.1689361333847046, "epoch": 0.00314, "grad_norm": 0.1408073753118515, "learning_rate": 2e-05, "loss": 0.19626353979110717, "mean_token_accuracy": 0.9448360979557038, "num_tokens": 50553021.0, "step": 3140 }, { "aux_loss": 8.11643452644348, "entropy": 0.14498640932142734, "epoch": 0.003145, "grad_norm": 0.15813784301280975, "learning_rate": 2e-05, "loss": 0.171815824508667, "mean_token_accuracy": 0.951966792345047, "num_tokens": 50633262.0, "step": 3145 }, { "aux_loss": 8.091406774520873, "entropy": 0.1517676327377558, "epoch": 0.00315, "grad_norm": 0.1492190659046173, "learning_rate": 2e-05, "loss": 0.1973658561706543, "mean_token_accuracy": 0.9443111538887023, "num_tokens": 50710671.0, "step": 3150 }, { "aux_loss": 8.072928285598755, "entropy": 0.17895912900567054, "epoch": 0.003155, "grad_norm": 0.13991013169288635, "learning_rate": 2e-05, "loss": 0.22549657821655272, "mean_token_accuracy": 0.9366275131702423, "num_tokens": 50791741.0, "step": 3155 }, { "aux_loss": 8.078258371353149, "entropy": 0.1867855153977871, "epoch": 0.00316, "grad_norm": 0.13619062304496765, "learning_rate": 2e-05, "loss": 0.21175603866577147, "mean_token_accuracy": 0.9412827521562577, "num_tokens": 50872809.0, "step": 3160 }, { "aux_loss": 8.088674831390382, "entropy": 0.17993197366595268, "epoch": 0.003165, "grad_norm": 0.13888010382652283, "learning_rate": 2e-05, "loss": 0.2040722131729126, "mean_token_accuracy": 0.9433172762393951, "num_tokens": 50953775.0, "step": 3165 }, { "aux_loss": 8.101012372970581, "entropy": 0.17506337612867356, "epoch": 0.00317, "grad_norm": 0.15246519446372986, "learning_rate": 2e-05, "loss": 0.20098731517791749, "mean_token_accuracy": 0.9440871596336364, "num_tokens": 51034235.0, "step": 3170 }, { "aux_loss": 8.11236925125122, "entropy": 0.1487548641860485, "epoch": 0.003175, "grad_norm": 0.162531778216362, "learning_rate": 2e-05, "loss": 0.17819650173187257, "mean_token_accuracy": 0.9502140015363694, "num_tokens": 51114583.0, "step": 3175 }, { "aux_loss": 8.091565465927124, "entropy": 0.1420391496270895, "epoch": 0.00318, "grad_norm": 0.14105230569839478, "learning_rate": 2e-05, "loss": 0.1813441276550293, "mean_token_accuracy": 0.9506178289651871, "num_tokens": 51193495.0, "step": 3180 }, { "aux_loss": 8.07268500328064, "entropy": 0.17803226746618747, "epoch": 0.003185, "grad_norm": 0.15835879743099213, "learning_rate": 2e-05, "loss": 0.23109543323516846, "mean_token_accuracy": 0.9360948204994202, "num_tokens": 51274914.0, "step": 3185 }, { "aux_loss": 8.079576635360718, "entropy": 0.16796971559524537, "epoch": 0.00319, "grad_norm": 0.14183682203292847, "learning_rate": 2e-05, "loss": 0.1991797685623169, "mean_token_accuracy": 0.9444876432418823, "num_tokens": 51356123.0, "step": 3190 }, { "aux_loss": 8.0917893409729, "entropy": 0.19391123130917548, "epoch": 0.003195, "grad_norm": 0.14483098685741425, "learning_rate": 2e-05, "loss": 0.21371831893920898, "mean_token_accuracy": 0.9389345049858093, "num_tokens": 51436905.0, "step": 3195 }, { "aux_loss": 8.096118450164795, "entropy": 0.1660480782389641, "epoch": 0.0032, "grad_norm": 0.13997644186019897, "learning_rate": 2e-05, "loss": 0.18765841722488402, "mean_token_accuracy": 0.9476926326751709, "num_tokens": 51517505.0, "step": 3200 }, { "aux_loss": 8.113101434707641, "entropy": 0.14779697582125664, "epoch": 0.003205, "grad_norm": 0.1604810208082199, "learning_rate": 2e-05, "loss": 0.18181984424591063, "mean_token_accuracy": 0.9491806507110596, "num_tokens": 51597899.0, "step": 3205 }, { "aux_loss": 8.091599655151366, "entropy": 0.1628108948469162, "epoch": 0.00321, "grad_norm": 0.15442314743995667, "learning_rate": 2e-05, "loss": 0.2045971155166626, "mean_token_accuracy": 0.9435444265604019, "num_tokens": 51674792.0, "step": 3210 }, { "aux_loss": 8.073364400863648, "entropy": 0.16871255934238433, "epoch": 0.003215, "grad_norm": 0.1368168443441391, "learning_rate": 2e-05, "loss": 0.21433780193328858, "mean_token_accuracy": 0.9394196689128875, "num_tokens": 51756132.0, "step": 3215 }, { "aux_loss": 8.079710388183594, "entropy": 0.18508594259619712, "epoch": 0.00322, "grad_norm": 0.1367693841457367, "learning_rate": 2e-05, "loss": 0.21680617332458496, "mean_token_accuracy": 0.9394427359104156, "num_tokens": 51837220.0, "step": 3220 }, { "aux_loss": 8.088467407226563, "entropy": 0.18197764903306962, "epoch": 0.003225, "grad_norm": 0.1577661782503128, "learning_rate": 2e-05, "loss": 0.20405569076538085, "mean_token_accuracy": 0.9435792595148087, "num_tokens": 51917893.0, "step": 3225 }, { "aux_loss": 8.099485826492309, "entropy": 0.15860071107745172, "epoch": 0.00323, "grad_norm": 0.14509201049804688, "learning_rate": 2e-05, "loss": 0.1842892050743103, "mean_token_accuracy": 0.9479869216680527, "num_tokens": 51998477.0, "step": 3230 }, { "aux_loss": 8.114618968963622, "entropy": 0.15259107425808907, "epoch": 0.003235, "grad_norm": 0.1713511049747467, "learning_rate": 2e-05, "loss": 0.18523633480072021, "mean_token_accuracy": 0.9479565292596817, "num_tokens": 52079119.0, "step": 3235 }, { "aux_loss": 8.089430856704713, "entropy": 0.14369250796735286, "epoch": 0.00324, "grad_norm": 0.15875156223773956, "learning_rate": 2e-05, "loss": 0.18524037599563598, "mean_token_accuracy": 0.9484268635511398, "num_tokens": 52159396.0, "step": 3240 }, { "aux_loss": 8.072626447677612, "entropy": 0.1836976647377014, "epoch": 0.003245, "grad_norm": 0.14659079909324646, "learning_rate": 2e-05, "loss": 0.22915871143341066, "mean_token_accuracy": 0.9364413321018219, "num_tokens": 52240466.0, "step": 3245 }, { "aux_loss": 8.078272390365601, "entropy": 0.1815402589738369, "epoch": 0.00325, "grad_norm": 0.1364625096321106, "learning_rate": 2e-05, "loss": 0.20854880809783935, "mean_token_accuracy": 0.9424823135137558, "num_tokens": 52321440.0, "step": 3250 }, { "aux_loss": 8.0862726688385, "entropy": 0.17093037217855453, "epoch": 0.003255, "grad_norm": 0.146819069981575, "learning_rate": 2e-05, "loss": 0.19406936168670655, "mean_token_accuracy": 0.9462387025356293, "num_tokens": 52402267.0, "step": 3255 }, { "aux_loss": 8.100034379959107, "entropy": 0.1684187613427639, "epoch": 0.00326, "grad_norm": 0.1474911868572235, "learning_rate": 2e-05, "loss": 0.19510631561279296, "mean_token_accuracy": 0.9447874993085861, "num_tokens": 52482738.0, "step": 3260 }, { "aux_loss": 8.113502073287965, "entropy": 0.14618208706378938, "epoch": 0.003265, "grad_norm": 0.14918093383312225, "learning_rate": 2e-05, "loss": 0.17784619331359863, "mean_token_accuracy": 0.9503018856048584, "num_tokens": 52563073.0, "step": 3265 }, { "aux_loss": 8.086842918395996, "entropy": 0.1440690655261278, "epoch": 0.00327, "grad_norm": 0.14992688596248627, "learning_rate": 2e-05, "loss": 0.18557535409927367, "mean_token_accuracy": 0.9500605285167694, "num_tokens": 52642342.0, "step": 3270 }, { "aux_loss": 8.069199800491333, "entropy": 0.16331303752958776, "epoch": 0.003275, "grad_norm": 0.15484365820884705, "learning_rate": 2e-05, "loss": 0.20972805023193358, "mean_token_accuracy": 0.9413518786430359, "num_tokens": 52723373.0, "step": 3275 }, { "aux_loss": 8.07596459388733, "entropy": 0.17387017607688904, "epoch": 0.00328, "grad_norm": 0.13718627393245697, "learning_rate": 2e-05, "loss": 0.2032240152359009, "mean_token_accuracy": 0.9430759161710739, "num_tokens": 52804217.0, "step": 3280 }, { "aux_loss": 8.083146572113037, "entropy": 0.17956893593072892, "epoch": 0.003285, "grad_norm": 0.1390460878610611, "learning_rate": 2e-05, "loss": 0.20335347652435304, "mean_token_accuracy": 0.9434962630271911, "num_tokens": 52884823.0, "step": 3285 }, { "aux_loss": 8.096046590805054, "entropy": 0.1636742062866688, "epoch": 0.00329, "grad_norm": 0.15083882212638855, "learning_rate": 2e-05, "loss": 0.18862991333007811, "mean_token_accuracy": 0.9463885605335236, "num_tokens": 52965238.0, "step": 3290 }, { "aux_loss": 8.109536933898926, "entropy": 0.14898678436875343, "epoch": 0.003295, "grad_norm": 0.1536809504032135, "learning_rate": 2e-05, "loss": 0.17851805686950684, "mean_token_accuracy": 0.9510477185249329, "num_tokens": 53045705.0, "step": 3295 }, { "aux_loss": 8.088180685043335, "entropy": 0.16010745838284493, "epoch": 0.0033, "grad_norm": 0.14198707044124603, "learning_rate": 2e-05, "loss": 0.19941191673278807, "mean_token_accuracy": 0.9460611671209336, "num_tokens": 53126029.0, "step": 3300 }, { "aux_loss": 8.072169733047485, "entropy": 0.17422449737787246, "epoch": 0.003305, "grad_norm": 0.1427670568227768, "learning_rate": 2e-05, "loss": 0.21760165691375732, "mean_token_accuracy": 0.9400460362434387, "num_tokens": 53207154.0, "step": 3305 }, { "aux_loss": 8.077490329742432, "entropy": 0.1694101832807064, "epoch": 0.00331, "grad_norm": 0.1344936639070511, "learning_rate": 2e-05, "loss": 0.20693485736846923, "mean_token_accuracy": 0.9421370506286622, "num_tokens": 53288152.0, "step": 3310 }, { "aux_loss": 8.08360242843628, "entropy": 0.1677086018025875, "epoch": 0.003315, "grad_norm": 0.13482902944087982, "learning_rate": 2e-05, "loss": 0.19454469680786132, "mean_token_accuracy": 0.9452098190784455, "num_tokens": 53369094.0, "step": 3315 }, { "aux_loss": 8.094222927093506, "entropy": 0.17268427312374116, "epoch": 0.00332, "grad_norm": 0.1527445763349533, "learning_rate": 2e-05, "loss": 0.19566521644592286, "mean_token_accuracy": 0.945321798324585, "num_tokens": 53449882.0, "step": 3320 }, { "aux_loss": 8.110411405563354, "entropy": 0.15340660512447357, "epoch": 0.003325, "grad_norm": 0.163923978805542, "learning_rate": 2e-05, "loss": 0.18321604728698732, "mean_token_accuracy": 0.9484834492206573, "num_tokens": 53530134.0, "step": 3325 }, { "aux_loss": 8.09237003326416, "entropy": 0.15732431635260583, "epoch": 0.00333, "grad_norm": 0.13197200000286102, "learning_rate": 2e-05, "loss": 0.19181399345397948, "mean_token_accuracy": 0.948565936088562, "num_tokens": 53607669.0, "step": 3330 }, { "aux_loss": 8.073115730285645, "entropy": 0.18500021658837795, "epoch": 0.003335, "grad_norm": 0.14987976849079132, "learning_rate": 2e-05, "loss": 0.2311016082763672, "mean_token_accuracy": 0.9357433319091797, "num_tokens": 53689066.0, "step": 3335 }, { "aux_loss": 8.077186584472656, "entropy": 0.1729499664157629, "epoch": 0.00334, "grad_norm": 0.13073405623435974, "learning_rate": 2e-05, "loss": 0.20392858982086182, "mean_token_accuracy": 0.9428721487522125, "num_tokens": 53770472.0, "step": 3340 }, { "aux_loss": 8.086996364593507, "entropy": 0.1811000734567642, "epoch": 0.003345, "grad_norm": 0.13385631144046783, "learning_rate": 2e-05, "loss": 0.20783238410949706, "mean_token_accuracy": 0.9418109148740769, "num_tokens": 53851149.0, "step": 3345 }, { "aux_loss": 8.096043014526368, "entropy": 0.167522644251585, "epoch": 0.00335, "grad_norm": 0.14239554107189178, "learning_rate": 2e-05, "loss": 0.18875793218612671, "mean_token_accuracy": 0.9475765883922577, "num_tokens": 53931702.0, "step": 3350 }, { "aux_loss": 8.111851119995118, "entropy": 0.1472678080201149, "epoch": 0.003355, "grad_norm": 0.1470818966627121, "learning_rate": 2e-05, "loss": 0.1803680419921875, "mean_token_accuracy": 0.949494594335556, "num_tokens": 54011870.0, "step": 3355 }, { "aux_loss": 8.096990203857422, "entropy": 0.13597517758607863, "epoch": 0.00336, "grad_norm": 0.14512929320335388, "learning_rate": 2e-05, "loss": 0.177366304397583, "mean_token_accuracy": 0.9522892445325851, "num_tokens": 54091666.0, "step": 3360 }, { "aux_loss": 8.069016027450562, "entropy": 0.16606580428779125, "epoch": 0.003365, "grad_norm": 0.1469336450099945, "learning_rate": 2e-05, "loss": 0.2099947452545166, "mean_token_accuracy": 0.9417406618595123, "num_tokens": 54172689.0, "step": 3365 }, { "aux_loss": 8.073838710784912, "entropy": 0.1717648908495903, "epoch": 0.00337, "grad_norm": 0.13721416890621185, "learning_rate": 2e-05, "loss": 0.2064809560775757, "mean_token_accuracy": 0.9425877064466477, "num_tokens": 54253733.0, "step": 3370 }, { "aux_loss": 8.08399519920349, "entropy": 0.17570768669247627, "epoch": 0.003375, "grad_norm": 0.1387743204832077, "learning_rate": 2e-05, "loss": 0.2002772331237793, "mean_token_accuracy": 0.9443808704614639, "num_tokens": 54334687.0, "step": 3375 }, { "aux_loss": 8.093376922607423, "entropy": 0.17167234867811204, "epoch": 0.00338, "grad_norm": 0.14760684967041016, "learning_rate": 2e-05, "loss": 0.19618290662765503, "mean_token_accuracy": 0.9448229610919953, "num_tokens": 54415453.0, "step": 3380 }, { "aux_loss": 8.107440710067749, "entropy": 0.15284837558865547, "epoch": 0.003385, "grad_norm": 0.14630548655986786, "learning_rate": 2e-05, "loss": 0.1791166067123413, "mean_token_accuracy": 0.9502524435520172, "num_tokens": 54495604.0, "step": 3385 }, { "aux_loss": 8.091902589797973, "entropy": 0.14478393606841564, "epoch": 0.00339, "grad_norm": 0.16304811835289001, "learning_rate": 2e-05, "loss": 0.18242955207824707, "mean_token_accuracy": 0.9496553808450698, "num_tokens": 54576298.0, "step": 3390 }, { "aux_loss": 8.067150974273682, "entropy": 0.1716588746756315, "epoch": 0.003395, "grad_norm": 0.16855032742023468, "learning_rate": 2e-05, "loss": 0.2224963426589966, "mean_token_accuracy": 0.9379703015089035, "num_tokens": 54657649.0, "step": 3395 }, { "aux_loss": 8.074144315719604, "entropy": 0.17227399796247483, "epoch": 0.0034, "grad_norm": 0.14275826513767242, "learning_rate": 2e-05, "loss": 0.2041255474090576, "mean_token_accuracy": 0.9419350147247314, "num_tokens": 54738703.0, "step": 3400 }, { "aux_loss": 8.084643983840943, "entropy": 0.1803322732448578, "epoch": 0.003405, "grad_norm": 0.1536228209733963, "learning_rate": 2e-05, "loss": 0.20024464130401612, "mean_token_accuracy": 0.9435871928930283, "num_tokens": 54819670.0, "step": 3405 }, { "aux_loss": 8.096064472198487, "entropy": 0.16384155228734015, "epoch": 0.00341, "grad_norm": 0.1480627804994583, "learning_rate": 2e-05, "loss": 0.18860028982162474, "mean_token_accuracy": 0.9474248379468918, "num_tokens": 54900088.0, "step": 3410 }, { "aux_loss": 8.109060859680175, "entropy": 0.14899858981370925, "epoch": 0.003415, "grad_norm": 0.15656854212284088, "learning_rate": 2e-05, "loss": 0.18060693740844727, "mean_token_accuracy": 0.9499949842691422, "num_tokens": 54980631.0, "step": 3415 }, { "aux_loss": 8.095376110076904, "entropy": 0.13952750600874425, "epoch": 0.00342, "grad_norm": 0.14643265306949615, "learning_rate": 2e-05, "loss": 0.17561327219009398, "mean_token_accuracy": 0.9521472573280334, "num_tokens": 55059774.0, "step": 3420 }, { "aux_loss": 8.070878791809083, "entropy": 0.1734847042709589, "epoch": 0.003425, "grad_norm": 0.14761346578598022, "learning_rate": 2e-05, "loss": 0.22200329303741456, "mean_token_accuracy": 0.9386822372674942, "num_tokens": 55140940.0, "step": 3425 }, { "aux_loss": 8.071926259994507, "entropy": 0.18360228911042215, "epoch": 0.00343, "grad_norm": 0.1406898945569992, "learning_rate": 2e-05, "loss": 0.21827876567840576, "mean_token_accuracy": 0.9393490523099899, "num_tokens": 55221990.0, "step": 3430 }, { "aux_loss": 8.083148193359374, "entropy": 0.16763183027505874, "epoch": 0.003435, "grad_norm": 0.14203479886054993, "learning_rate": 2e-05, "loss": 0.1955203652381897, "mean_token_accuracy": 0.9449512451887131, "num_tokens": 55302530.0, "step": 3435 }, { "aux_loss": 8.091049718856812, "entropy": 0.16986002177000045, "epoch": 0.00344, "grad_norm": 0.14416195452213287, "learning_rate": 2e-05, "loss": 0.19449214935302733, "mean_token_accuracy": 0.9441195905208588, "num_tokens": 55383244.0, "step": 3440 }, { "aux_loss": 8.105107021331786, "entropy": 0.15056025087833405, "epoch": 0.003445, "grad_norm": 0.15131866931915283, "learning_rate": 2e-05, "loss": 0.17404098510742189, "mean_token_accuracy": 0.9523547291755676, "num_tokens": 55463258.0, "step": 3445 }, { "aux_loss": 8.098848581314087, "entropy": 0.1485459551215172, "epoch": 0.00345, "grad_norm": 0.1486630141735077, "learning_rate": 2e-05, "loss": 0.18512657880783082, "mean_token_accuracy": 0.9497396767139434, "num_tokens": 55542988.0, "step": 3450 }, { "aux_loss": 8.071794891357422, "entropy": 0.1657637305557728, "epoch": 0.003455, "grad_norm": 0.1553289145231247, "learning_rate": 2e-05, "loss": 0.21695096492767335, "mean_token_accuracy": 0.9409345209598541, "num_tokens": 55624496.0, "step": 3455 }, { "aux_loss": 8.07252402305603, "entropy": 0.16912850216031075, "epoch": 0.00346, "grad_norm": 0.14527633786201477, "learning_rate": 2e-05, "loss": 0.20679042339324952, "mean_token_accuracy": 0.9425709515810012, "num_tokens": 55705532.0, "step": 3460 }, { "aux_loss": 8.080512189865113, "entropy": 0.17733409106731415, "epoch": 0.003465, "grad_norm": 0.14004933834075928, "learning_rate": 2e-05, "loss": 0.20295884609222412, "mean_token_accuracy": 0.9436537146568298, "num_tokens": 55786302.0, "step": 3465 }, { "aux_loss": 8.09162197113037, "entropy": 0.17465185448527337, "epoch": 0.00347, "grad_norm": 0.14595374464988708, "learning_rate": 2e-05, "loss": 0.19612003564834596, "mean_token_accuracy": 0.9450876235961914, "num_tokens": 55867205.0, "step": 3470 }, { "aux_loss": 8.104484224319458, "entropy": 0.15324413031339645, "epoch": 0.003475, "grad_norm": 0.14978156983852386, "learning_rate": 2e-05, "loss": 0.18199578523635865, "mean_token_accuracy": 0.9488621115684509, "num_tokens": 55947604.0, "step": 3475 }, { "aux_loss": 8.105511283874511, "entropy": 0.14812915921211242, "epoch": 0.00348, "grad_norm": 0.13192299008369446, "learning_rate": 2e-05, "loss": 0.17839200496673585, "mean_token_accuracy": 0.9508434116840363, "num_tokens": 56024999.0, "step": 3480 }, { "aux_loss": 8.066703128814698, "entropy": 0.1732874248176813, "epoch": 0.003485, "grad_norm": 0.1783316731452942, "learning_rate": 2e-05, "loss": 0.22596149444580077, "mean_token_accuracy": 0.9383738577365875, "num_tokens": 56106248.0, "step": 3485 }, { "aux_loss": 8.074977588653564, "entropy": 0.1672011435031891, "epoch": 0.00349, "grad_norm": 0.12999005615711212, "learning_rate": 2e-05, "loss": 0.20716416835784912, "mean_token_accuracy": 0.9420315384864807, "num_tokens": 56187356.0, "step": 3490 }, { "aux_loss": 8.084104919433594, "entropy": 0.17579501047730445, "epoch": 0.003495, "grad_norm": 0.14199404418468475, "learning_rate": 2e-05, "loss": 0.19671993255615233, "mean_token_accuracy": 0.946016663312912, "num_tokens": 56268163.0, "step": 3495 }, { "aux_loss": 8.095600652694703, "entropy": 0.1678522802889347, "epoch": 0.0035, "grad_norm": 0.14334514737129211, "learning_rate": 2e-05, "loss": 0.1883704900741577, "mean_token_accuracy": 0.9474934220314026, "num_tokens": 56348970.0, "step": 3500 }, { "aux_loss": 8.109538269042968, "entropy": 0.14645420126616954, "epoch": 0.003505, "grad_norm": 0.15478180348873138, "learning_rate": 2e-05, "loss": 0.17634756565093995, "mean_token_accuracy": 0.9506915777921676, "num_tokens": 56429279.0, "step": 3505 }, { "aux_loss": 8.102639722824097, "entropy": 0.1441028606146574, "epoch": 0.00351, "grad_norm": 0.13839173316955566, "learning_rate": 2e-05, "loss": 0.1813260793685913, "mean_token_accuracy": 0.9499836087226867, "num_tokens": 56509051.0, "step": 3510 }, { "aux_loss": 8.074317789077758, "entropy": 0.17779307663440705, "epoch": 0.003515, "grad_norm": 0.14687684178352356, "learning_rate": 2e-05, "loss": 0.22249352931976318, "mean_token_accuracy": 0.9384042322635651, "num_tokens": 56590270.0, "step": 3515 }, { "aux_loss": 8.078415966033935, "entropy": 0.1729664221405983, "epoch": 0.00352, "grad_norm": 0.13611707091331482, "learning_rate": 2e-05, "loss": 0.20582201480865478, "mean_token_accuracy": 0.9415476769208908, "num_tokens": 56671323.0, "step": 3520 }, { "aux_loss": 8.087087154388428, "entropy": 0.1833976648747921, "epoch": 0.003525, "grad_norm": 0.1398952603340149, "learning_rate": 2e-05, "loss": 0.2122587203979492, "mean_token_accuracy": 0.9403575837612153, "num_tokens": 56752246.0, "step": 3525 }, { "aux_loss": 8.096710443496704, "entropy": 0.17299836575984956, "epoch": 0.00353, "grad_norm": 0.13910555839538574, "learning_rate": 2e-05, "loss": 0.19738600254058838, "mean_token_accuracy": 0.9448669463396072, "num_tokens": 56832808.0, "step": 3530 }, { "aux_loss": 8.10430006980896, "entropy": 0.15525901839137077, "epoch": 0.003535, "grad_norm": 0.15603163838386536, "learning_rate": 2e-05, "loss": 0.1801411509513855, "mean_token_accuracy": 0.9500389933586121, "num_tokens": 56913267.0, "step": 3535 }, { "aux_loss": 8.091502237319947, "entropy": 0.14775969237089157, "epoch": 0.00354, "grad_norm": 0.13365484774112701, "learning_rate": 2e-05, "loss": 0.18674581050872802, "mean_token_accuracy": 0.9489086121320724, "num_tokens": 56994050.0, "step": 3540 }, { "aux_loss": 8.068204164505005, "entropy": 0.1635946251451969, "epoch": 0.003545, "grad_norm": 0.15203210711479187, "learning_rate": 2e-05, "loss": 0.21183254718780517, "mean_token_accuracy": 0.9427683711051941, "num_tokens": 57075181.0, "step": 3545 }, { "aux_loss": 8.076211643218993, "entropy": 0.17809797935187816, "epoch": 0.00355, "grad_norm": 0.1417941451072693, "learning_rate": 2e-05, "loss": 0.21140050888061523, "mean_token_accuracy": 0.9404971837997437, "num_tokens": 57156292.0, "step": 3550 }, { "aux_loss": 8.084080123901368, "entropy": 0.17739937528967858, "epoch": 0.003555, "grad_norm": 0.1385902315378189, "learning_rate": 2e-05, "loss": 0.20577735900878907, "mean_token_accuracy": 0.9431796312332154, "num_tokens": 57237218.0, "step": 3555 }, { "aux_loss": 8.094055414199829, "entropy": 0.1631332315504551, "epoch": 0.00356, "grad_norm": 0.14270524680614471, "learning_rate": 2e-05, "loss": 0.18669048547744752, "mean_token_accuracy": 0.9465743929147721, "num_tokens": 57318047.0, "step": 3560 }, { "aux_loss": 8.10590057373047, "entropy": 0.1550621699541807, "epoch": 0.003565, "grad_norm": 0.14862309396266937, "learning_rate": 2e-05, "loss": 0.18273617029190065, "mean_token_accuracy": 0.9494030088186264, "num_tokens": 57398501.0, "step": 3565 }, { "aux_loss": 8.1013503074646, "entropy": 0.15278596021234989, "epoch": 0.00357, "grad_norm": 0.1578340083360672, "learning_rate": 2e-05, "loss": 0.19054425954818727, "mean_token_accuracy": 0.9464311182498932, "num_tokens": 57476607.0, "step": 3570 }, { "aux_loss": 8.06883101463318, "entropy": 0.16016253717243673, "epoch": 0.003575, "grad_norm": 0.13430093228816986, "learning_rate": 2e-05, "loss": 0.20853614807128906, "mean_token_accuracy": 0.9426379173994064, "num_tokens": 57557852.0, "step": 3575 }, { "aux_loss": 8.073803567886353, "entropy": 0.16622515581548214, "epoch": 0.00358, "grad_norm": 0.1397142857313156, "learning_rate": 2e-05, "loss": 0.2018742084503174, "mean_token_accuracy": 0.9440779864788056, "num_tokens": 57638613.0, "step": 3580 }, { "aux_loss": 8.085051679611206, "entropy": 0.16953913792967795, "epoch": 0.003585, "grad_norm": 0.13832564651966095, "learning_rate": 2e-05, "loss": 0.20050559043884278, "mean_token_accuracy": 0.9444626539945602, "num_tokens": 57719544.0, "step": 3585 }, { "aux_loss": 8.095213031768798, "entropy": 0.17049626186490058, "epoch": 0.00359, "grad_norm": 0.1392274647951126, "learning_rate": 2e-05, "loss": 0.19836210012435912, "mean_token_accuracy": 0.9441302388906478, "num_tokens": 57800028.0, "step": 3590 }, { "aux_loss": 8.1052903175354, "entropy": 0.15605995878577233, "epoch": 0.003595, "grad_norm": 0.14226338267326355, "learning_rate": 2e-05, "loss": 0.18160698413848878, "mean_token_accuracy": 0.9485923439264298, "num_tokens": 57880482.0, "step": 3595 }, { "aux_loss": 8.103016996383667, "entropy": 0.1513067062944174, "epoch": 0.0036, "grad_norm": 0.13649244606494904, "learning_rate": 2e-05, "loss": 0.1775503635406494, "mean_token_accuracy": 0.9513054430484772, "num_tokens": 57958701.0, "step": 3600 }, { "aux_loss": 8.068546104431153, "entropy": 0.1584773451089859, "epoch": 0.003605, "grad_norm": 0.14773598313331604, "learning_rate": 2e-05, "loss": 0.20502164363861083, "mean_token_accuracy": 0.9424826383590699, "num_tokens": 58039900.0, "step": 3605 }, { "aux_loss": 8.07251763343811, "entropy": 0.16773774065077304, "epoch": 0.00361, "grad_norm": 0.13793109357357025, "learning_rate": 2e-05, "loss": 0.21010069847106932, "mean_token_accuracy": 0.9423064380884171, "num_tokens": 58120837.0, "step": 3610 }, { "aux_loss": 8.081832790374756, "entropy": 0.16447483748197556, "epoch": 0.003615, "grad_norm": 0.12927091121673584, "learning_rate": 2e-05, "loss": 0.19288171529769899, "mean_token_accuracy": 0.9468847870826721, "num_tokens": 58201567.0, "step": 3615 }, { "aux_loss": 8.092286443710327, "entropy": 0.1687350258231163, "epoch": 0.00362, "grad_norm": 0.14320580661296844, "learning_rate": 2e-05, "loss": 0.1897109031677246, "mean_token_accuracy": 0.9469810336828232, "num_tokens": 58282395.0, "step": 3620 }, { "aux_loss": 8.10400595664978, "entropy": 0.15696103647351264, "epoch": 0.003625, "grad_norm": 0.1543847620487213, "learning_rate": 2e-05, "loss": 0.1850444793701172, "mean_token_accuracy": 0.9474167734384537, "num_tokens": 58362730.0, "step": 3625 }, { "aux_loss": 8.10280966758728, "entropy": 0.1554012343287468, "epoch": 0.00363, "grad_norm": 0.1395951807498932, "learning_rate": 2e-05, "loss": 0.1888120412826538, "mean_token_accuracy": 0.947870847582817, "num_tokens": 58439441.0, "step": 3630 }, { "aux_loss": 8.07128839492798, "entropy": 0.16419425942003726, "epoch": 0.003635, "grad_norm": 0.15131539106369019, "learning_rate": 2e-05, "loss": 0.20569977760314942, "mean_token_accuracy": 0.94364333152771, "num_tokens": 58520811.0, "step": 3635 }, { "aux_loss": 8.074514245986938, "entropy": 0.1789974257349968, "epoch": 0.00364, "grad_norm": 0.1431204080581665, "learning_rate": 2e-05, "loss": 0.22197389602661133, "mean_token_accuracy": 0.9386385768651963, "num_tokens": 58601757.0, "step": 3640 }, { "aux_loss": 8.079972505569458, "entropy": 0.17981437221169472, "epoch": 0.003645, "grad_norm": 0.13867253065109253, "learning_rate": 2e-05, "loss": 0.2087554931640625, "mean_token_accuracy": 0.9421653658151626, "num_tokens": 58682738.0, "step": 3645 }, { "aux_loss": 8.09368281364441, "entropy": 0.17152813225984573, "epoch": 0.00365, "grad_norm": 0.14049142599105835, "learning_rate": 2e-05, "loss": 0.1897148847579956, "mean_token_accuracy": 0.9465822011232377, "num_tokens": 58763483.0, "step": 3650 }, { "aux_loss": 8.101623916625977, "entropy": 0.1555980086326599, "epoch": 0.003655, "grad_norm": 0.1593800038099289, "learning_rate": 2e-05, "loss": 0.18208436965942382, "mean_token_accuracy": 0.9497519314289093, "num_tokens": 58844426.0, "step": 3655 }, { "aux_loss": 8.104884815216064, "entropy": 0.14434664137661457, "epoch": 0.00366, "grad_norm": 0.12744976580142975, "learning_rate": 2e-05, "loss": 0.17775565385818481, "mean_token_accuracy": 0.9501483708620071, "num_tokens": 58921220.0, "step": 3660 }, { "aux_loss": 8.065509510040282, "entropy": 0.17364537231624128, "epoch": 0.003665, "grad_norm": 0.14052312076091766, "learning_rate": 2e-05, "loss": 0.21997876167297364, "mean_token_accuracy": 0.9393134415149689, "num_tokens": 59002459.0, "step": 3665 }, { "aux_loss": 8.074805450439452, "entropy": 0.16845594197511674, "epoch": 0.00367, "grad_norm": 0.13931669294834137, "learning_rate": 2e-05, "loss": 0.20685987472534179, "mean_token_accuracy": 0.9421530127525329, "num_tokens": 59083041.0, "step": 3670 }, { "aux_loss": 8.080971336364746, "entropy": 0.17533733174204827, "epoch": 0.003675, "grad_norm": 0.136427640914917, "learning_rate": 2e-05, "loss": 0.2057826042175293, "mean_token_accuracy": 0.9421284943819046, "num_tokens": 59164100.0, "step": 3675 }, { "aux_loss": 8.092462491989135, "entropy": 0.16860179007053375, "epoch": 0.00368, "grad_norm": 0.13490749895572662, "learning_rate": 2e-05, "loss": 0.19366698265075682, "mean_token_accuracy": 0.9455673635005951, "num_tokens": 59244953.0, "step": 3680 }, { "aux_loss": 8.102824401855468, "entropy": 0.14722870886325837, "epoch": 0.003685, "grad_norm": 0.14679794013500214, "learning_rate": 2e-05, "loss": 0.17461202144622803, "mean_token_accuracy": 0.9518853396177291, "num_tokens": 59325485.0, "step": 3685 }, { "aux_loss": 8.103275966644286, "entropy": 0.13416015766561032, "epoch": 0.00369, "grad_norm": 0.12525036931037903, "learning_rate": 2e-05, "loss": 0.1626958131790161, "mean_token_accuracy": 0.9550653249025345, "num_tokens": 59405516.0, "step": 3690 }, { "aux_loss": 8.067550325393677, "entropy": 0.1654042899608612, "epoch": 0.003695, "grad_norm": 0.13868121802806854, "learning_rate": 2e-05, "loss": 0.20632545948028563, "mean_token_accuracy": 0.9427901446819306, "num_tokens": 59486998.0, "step": 3695 }, { "aux_loss": 8.075068044662476, "entropy": 0.16679728627204896, "epoch": 0.0037, "grad_norm": 0.15251266956329346, "learning_rate": 2e-05, "loss": 0.21037230491638184, "mean_token_accuracy": 0.941617614030838, "num_tokens": 59567565.0, "step": 3700 }, { "aux_loss": 8.079337167739869, "entropy": 0.17589445263147355, "epoch": 0.003705, "grad_norm": 0.139875590801239, "learning_rate": 2e-05, "loss": 0.2073918104171753, "mean_token_accuracy": 0.9415038168430329, "num_tokens": 59648671.0, "step": 3705 }, { "aux_loss": 8.089571523666383, "entropy": 0.17697745338082313, "epoch": 0.00371, "grad_norm": 0.14507681131362915, "learning_rate": 2e-05, "loss": 0.2054443597793579, "mean_token_accuracy": 0.9419445693492889, "num_tokens": 59729407.0, "step": 3710 }, { "aux_loss": 8.099748992919922, "entropy": 0.16234676837921141, "epoch": 0.003715, "grad_norm": 0.14972840249538422, "learning_rate": 2e-05, "loss": 0.18711310625076294, "mean_token_accuracy": 0.9482452005147934, "num_tokens": 59810060.0, "step": 3715 }, { "aux_loss": 8.108324575424195, "entropy": 0.14043421484529972, "epoch": 0.00372, "grad_norm": 0.12313748896121979, "learning_rate": 2e-05, "loss": 0.16772583723068238, "mean_token_accuracy": 0.9538856446743011, "num_tokens": 59886481.0, "step": 3720 }, { "aux_loss": 8.066444635391235, "entropy": 0.16332019604742526, "epoch": 0.003725, "grad_norm": 0.1655113846063614, "learning_rate": 2e-05, "loss": 0.21046555042266846, "mean_token_accuracy": 0.9426675111055374, "num_tokens": 59968013.0, "step": 3725 }, { "aux_loss": 8.071371078491211, "entropy": 0.17669796496629714, "epoch": 0.00373, "grad_norm": 0.14448584616184235, "learning_rate": 2e-05, "loss": 0.22329461574554443, "mean_token_accuracy": 0.9376091629266738, "num_tokens": 60048893.0, "step": 3730 }, { "aux_loss": 8.07760648727417, "entropy": 0.1781152181327343, "epoch": 0.003735, "grad_norm": 0.13516509532928467, "learning_rate": 2e-05, "loss": 0.20711853504180908, "mean_token_accuracy": 0.9421719670295715, "num_tokens": 60129799.0, "step": 3735 }, { "aux_loss": 8.092101621627808, "entropy": 0.17709542885422708, "epoch": 0.00374, "grad_norm": 0.14650335907936096, "learning_rate": 2e-05, "loss": 0.19788501262664795, "mean_token_accuracy": 0.9451971143484116, "num_tokens": 60210518.0, "step": 3740 }, { "aux_loss": 8.099432039260865, "entropy": 0.15634507611393927, "epoch": 0.003745, "grad_norm": 0.13907134532928467, "learning_rate": 2e-05, "loss": 0.17914718389511108, "mean_token_accuracy": 0.9502253204584121, "num_tokens": 60291392.0, "step": 3745 }, { "aux_loss": 8.110324239730835, "entropy": 0.13975763842463493, "epoch": 0.00375, "grad_norm": 0.13600419461727142, "learning_rate": 2e-05, "loss": 0.16946213245391845, "mean_token_accuracy": 0.9522726953029632, "num_tokens": 60368839.0, "step": 3750 }, { "aux_loss": 8.067803287506104, "entropy": 0.17291736453771592, "epoch": 0.003755, "grad_norm": 0.19572490453720093, "learning_rate": 2e-05, "loss": 0.22342123985290527, "mean_token_accuracy": 0.9385370045900345, "num_tokens": 60449738.0, "step": 3755 }, { "aux_loss": 8.075034904479981, "entropy": 0.16723310016095638, "epoch": 0.00376, "grad_norm": 0.15154753625392914, "learning_rate": 2e-05, "loss": 0.20492987632751464, "mean_token_accuracy": 0.9426275312900543, "num_tokens": 60530692.0, "step": 3760 }, { "aux_loss": 8.079753303527832, "entropy": 0.17016384825110437, "epoch": 0.003765, "grad_norm": 0.1361101269721985, "learning_rate": 2e-05, "loss": 0.1980854630470276, "mean_token_accuracy": 0.9451626509428024, "num_tokens": 60611814.0, "step": 3765 }, { "aux_loss": 8.090311813354493, "entropy": 0.18353770449757575, "epoch": 0.00377, "grad_norm": 0.1370791345834732, "learning_rate": 2e-05, "loss": 0.20895819664001464, "mean_token_accuracy": 0.9414872795343399, "num_tokens": 60692659.0, "step": 3770 }, { "aux_loss": 8.101877975463868, "entropy": 0.15832723006606103, "epoch": 0.003775, "grad_norm": 0.1525694727897644, "learning_rate": 2e-05, "loss": 0.18391293287277222, "mean_token_accuracy": 0.9479856729507447, "num_tokens": 60773046.0, "step": 3775 }, { "aux_loss": 8.103589153289795, "entropy": 0.14184964299201966, "epoch": 0.00378, "grad_norm": 0.12755383551120758, "learning_rate": 2e-05, "loss": 0.16912662982940674, "mean_token_accuracy": 0.9529174774885177, "num_tokens": 60850842.0, "step": 3780 }, { "aux_loss": 8.067220973968507, "entropy": 0.17528922557830812, "epoch": 0.003785, "grad_norm": 0.14482465386390686, "learning_rate": 2e-05, "loss": 0.22777693271636962, "mean_token_accuracy": 0.9383696466684341, "num_tokens": 60932278.0, "step": 3785 }, { "aux_loss": 8.072800445556641, "entropy": 0.17815810069441795, "epoch": 0.00379, "grad_norm": 0.14308401942253113, "learning_rate": 2e-05, "loss": 0.22371666431427, "mean_token_accuracy": 0.9380281120538712, "num_tokens": 61012759.0, "step": 3790 }, { "aux_loss": 8.076924514770507, "entropy": 0.17671712972223758, "epoch": 0.003795, "grad_norm": 0.1398933380842209, "learning_rate": 2e-05, "loss": 0.2038175106048584, "mean_token_accuracy": 0.9430381059646606, "num_tokens": 61093403.0, "step": 3795 }, { "aux_loss": 8.087810611724853, "entropy": 0.18333133086562156, "epoch": 0.0038, "grad_norm": 0.14304576814174652, "learning_rate": 2e-05, "loss": 0.20525126457214354, "mean_token_accuracy": 0.9424682438373566, "num_tokens": 61173942.0, "step": 3800 }, { "aux_loss": 8.097368049621583, "entropy": 0.1570002555847168, "epoch": 0.003805, "grad_norm": 0.1716916561126709, "learning_rate": 2e-05, "loss": 0.18336018323898315, "mean_token_accuracy": 0.948911139369011, "num_tokens": 61254576.0, "step": 3805 }, { "aux_loss": 8.106603574752807, "entropy": 0.14477055370807648, "epoch": 0.00381, "grad_norm": 0.13840284943580627, "learning_rate": 2e-05, "loss": 0.17411131858825685, "mean_token_accuracy": 0.9516070276498795, "num_tokens": 61330978.0, "step": 3810 }, { "aux_loss": 8.06417441368103, "entropy": 0.18448591083288193, "epoch": 0.003815, "grad_norm": 0.1575627475976944, "learning_rate": 2e-05, "loss": 0.22809510231018065, "mean_token_accuracy": 0.9370896995067597, "num_tokens": 61412024.0, "step": 3815 }, { "aux_loss": 8.066959285736084, "entropy": 0.18426196910440923, "epoch": 0.00382, "grad_norm": 0.1520664542913437, "learning_rate": 2e-05, "loss": 0.22588849067687988, "mean_token_accuracy": 0.937090840935707, "num_tokens": 61492663.0, "step": 3820 }, { "aux_loss": 8.077086305618286, "entropy": 0.18012150302529334, "epoch": 0.003825, "grad_norm": 0.13913986086845398, "learning_rate": 2e-05, "loss": 0.21055953502655028, "mean_token_accuracy": 0.9416161686182022, "num_tokens": 61573614.0, "step": 3825 }, { "aux_loss": 8.084502267837525, "entropy": 0.17572448030114174, "epoch": 0.00383, "grad_norm": 0.1395370364189148, "learning_rate": 2e-05, "loss": 0.20020182132720948, "mean_token_accuracy": 0.9457064777612686, "num_tokens": 61654548.0, "step": 3830 }, { "aux_loss": 8.09701132774353, "entropy": 0.160580874979496, "epoch": 0.003835, "grad_norm": 0.14620131254196167, "learning_rate": 2e-05, "loss": 0.1879928946495056, "mean_token_accuracy": 0.9474564075469971, "num_tokens": 61734815.0, "step": 3835 }, { "aux_loss": 8.113717746734618, "entropy": 0.1552987787872553, "epoch": 0.00384, "grad_norm": 0.16251729428768158, "learning_rate": 2e-05, "loss": 0.18154183626174927, "mean_token_accuracy": 0.950005042552948, "num_tokens": 61813093.0, "step": 3840 }, { "aux_loss": 8.068704652786256, "entropy": 0.17081396877765656, "epoch": 0.003845, "grad_norm": 0.13388794660568237, "learning_rate": 2e-05, "loss": 0.21023707389831542, "mean_token_accuracy": 0.9419908076524734, "num_tokens": 61894066.0, "step": 3845 }, { "aux_loss": 8.07093186378479, "entropy": 0.17962607443332673, "epoch": 0.00385, "grad_norm": 0.14779174327850342, "learning_rate": 2e-05, "loss": 0.22672898769378663, "mean_token_accuracy": 0.9358665734529495, "num_tokens": 61975158.0, "step": 3850 }, { "aux_loss": 8.076707983016968, "entropy": 0.17310950197279454, "epoch": 0.003855, "grad_norm": 0.140579491853714, "learning_rate": 2e-05, "loss": 0.20651617050170898, "mean_token_accuracy": 0.9428789287805557, "num_tokens": 62055831.0, "step": 3855 }, { "aux_loss": 8.086752367019653, "entropy": 0.18669826090335845, "epoch": 0.00386, "grad_norm": 0.13994470238685608, "learning_rate": 2e-05, "loss": 0.2107757329940796, "mean_token_accuracy": 0.9407466769218444, "num_tokens": 62136632.0, "step": 3860 }, { "aux_loss": 8.092320489883424, "entropy": 0.16844304874539376, "epoch": 0.003865, "grad_norm": 0.1472175419330597, "learning_rate": 2e-05, "loss": 0.19181419610977174, "mean_token_accuracy": 0.9457267761230469, "num_tokens": 62216811.0, "step": 3865 }, { "aux_loss": 8.111100244522095, "entropy": 0.15630946606397628, "epoch": 0.00387, "grad_norm": 0.1743493378162384, "learning_rate": 2e-05, "loss": 0.18492677211761474, "mean_token_accuracy": 0.9484911233186721, "num_tokens": 62297082.0, "step": 3870 }, { "aux_loss": 8.071560907363892, "entropy": 0.17498248666524888, "epoch": 0.003875, "grad_norm": 0.14743833243846893, "learning_rate": 2e-05, "loss": 0.21595487594604493, "mean_token_accuracy": 0.9405759006738663, "num_tokens": 62375241.0, "step": 3875 }, { "aux_loss": 8.06474723815918, "entropy": 0.201045473664999, "epoch": 0.00388, "grad_norm": 0.14226999878883362, "learning_rate": 2e-05, "loss": 0.2451887845993042, "mean_token_accuracy": 0.9316706866025924, "num_tokens": 62456545.0, "step": 3880 }, { "aux_loss": 8.077294397354127, "entropy": 0.1726114943623543, "epoch": 0.003885, "grad_norm": 0.13420595228672028, "learning_rate": 2e-05, "loss": 0.20281989574432374, "mean_token_accuracy": 0.943801012635231, "num_tokens": 62537361.0, "step": 3885 }, { "aux_loss": 8.084831619262696, "entropy": 0.17151982635259627, "epoch": 0.00389, "grad_norm": 0.14446011185646057, "learning_rate": 2e-05, "loss": 0.19781169891357422, "mean_token_accuracy": 0.9445989429950714, "num_tokens": 62618051.0, "step": 3890 }, { "aux_loss": 8.095459461212158, "entropy": 0.16679829508066177, "epoch": 0.003895, "grad_norm": 0.14256325364112854, "learning_rate": 2e-05, "loss": 0.18840779066085817, "mean_token_accuracy": 0.9474774956703186, "num_tokens": 62698436.0, "step": 3895 }, { "aux_loss": 8.112070798873901, "entropy": 0.14683061018586158, "epoch": 0.0039, "grad_norm": 0.16215519607067108, "learning_rate": 2e-05, "loss": 0.17416359186172486, "mean_token_accuracy": 0.9515390157699585, "num_tokens": 62779041.0, "step": 3900 }, { "aux_loss": 8.068126726150513, "entropy": 0.16317534297704697, "epoch": 0.003905, "grad_norm": 0.1673935055732727, "learning_rate": 2e-05, "loss": 0.20950429439544677, "mean_token_accuracy": 0.9425682723522186, "num_tokens": 62858638.0, "step": 3905 }, { "aux_loss": 8.067454957962036, "entropy": 0.17523740008473396, "epoch": 0.00391, "grad_norm": 0.1550503373146057, "learning_rate": 2e-05, "loss": 0.22011191844940187, "mean_token_accuracy": 0.938545498251915, "num_tokens": 62939766.0, "step": 3910 }, { "aux_loss": 8.07533793449402, "entropy": 0.18380124494433403, "epoch": 0.003915, "grad_norm": 0.13432689011096954, "learning_rate": 2e-05, "loss": 0.21724610328674315, "mean_token_accuracy": 0.9401372313499451, "num_tokens": 63020707.0, "step": 3915 }, { "aux_loss": 8.086825227737426, "entropy": 0.18134923428297042, "epoch": 0.00392, "grad_norm": 0.13876844942569733, "learning_rate": 2e-05, "loss": 0.20158858299255372, "mean_token_accuracy": 0.943289241194725, "num_tokens": 63101008.0, "step": 3920 }, { "aux_loss": 8.093204641342163, "entropy": 0.17062823176383973, "epoch": 0.003925, "grad_norm": 0.15416906774044037, "learning_rate": 2e-05, "loss": 0.19223999977111816, "mean_token_accuracy": 0.9459930211305618, "num_tokens": 63180814.0, "step": 3925 }, { "aux_loss": 8.106504344940186, "entropy": 0.15065026395022868, "epoch": 0.00393, "grad_norm": 0.13469359278678894, "learning_rate": 2e-05, "loss": 0.18335039615631105, "mean_token_accuracy": 0.9487786680459976, "num_tokens": 63260847.0, "step": 3930 }, { "aux_loss": 8.07407112121582, "entropy": 0.17284853234887124, "epoch": 0.003935, "grad_norm": 0.155502051115036, "learning_rate": 2e-05, "loss": 0.21779682636260986, "mean_token_accuracy": 0.9408769845962525, "num_tokens": 63338365.0, "step": 3935 }, { "aux_loss": 8.064867067337037, "entropy": 0.17973878383636474, "epoch": 0.00394, "grad_norm": 0.1558724343776703, "learning_rate": 2e-05, "loss": 0.22478768825531006, "mean_token_accuracy": 0.9373753875494003, "num_tokens": 63420001.0, "step": 3940 }, { "aux_loss": 8.07354006767273, "entropy": 0.18883172050118446, "epoch": 0.003945, "grad_norm": 0.1374303549528122, "learning_rate": 2e-05, "loss": 0.21975882053375245, "mean_token_accuracy": 0.9390784353017807, "num_tokens": 63500945.0, "step": 3945 }, { "aux_loss": 8.081611967086792, "entropy": 0.1774898014962673, "epoch": 0.00395, "grad_norm": 0.13622717559337616, "learning_rate": 2e-05, "loss": 0.2004019498825073, "mean_token_accuracy": 0.9445203125476838, "num_tokens": 63581595.0, "step": 3950 }, { "aux_loss": 8.094461631774902, "entropy": 0.1645282708108425, "epoch": 0.003955, "grad_norm": 0.14535793662071228, "learning_rate": 2e-05, "loss": 0.19013161659240724, "mean_token_accuracy": 0.9472324132919312, "num_tokens": 63661915.0, "step": 3955 }, { "aux_loss": 8.110036945343017, "entropy": 0.15100119560956954, "epoch": 0.00396, "grad_norm": 0.15752434730529785, "learning_rate": 2e-05, "loss": 0.18374007940292358, "mean_token_accuracy": 0.9492660373449325, "num_tokens": 63742004.0, "step": 3960 }, { "aux_loss": 8.072049474716186, "entropy": 0.1649086859077215, "epoch": 0.003965, "grad_norm": 0.1616693139076233, "learning_rate": 2e-05, "loss": 0.20715844631195068, "mean_token_accuracy": 0.9433943182229996, "num_tokens": 63822259.0, "step": 3965 }, { "aux_loss": 8.065539264678955, "entropy": 0.1898988239467144, "epoch": 0.00397, "grad_norm": 0.14644716680049896, "learning_rate": 2e-05, "loss": 0.23113880157470704, "mean_token_accuracy": 0.9356475621461868, "num_tokens": 63903211.0, "step": 3970 }, { "aux_loss": 8.072787141799926, "entropy": 0.1908182680606842, "epoch": 0.003975, "grad_norm": 0.13250933587551117, "learning_rate": 2e-05, "loss": 0.22197015285491944, "mean_token_accuracy": 0.939109081029892, "num_tokens": 63984548.0, "step": 3975 }, { "aux_loss": 8.082742023468018, "entropy": 0.17957219183444978, "epoch": 0.00398, "grad_norm": 0.13384675979614258, "learning_rate": 2e-05, "loss": 0.20482177734375, "mean_token_accuracy": 0.9431985884904861, "num_tokens": 64065346.0, "step": 3980 }, { "aux_loss": 8.090649700164795, "entropy": 0.16390545591711997, "epoch": 0.003985, "grad_norm": 0.13855285942554474, "learning_rate": 2e-05, "loss": 0.19011374711990356, "mean_token_accuracy": 0.9466467708349228, "num_tokens": 64145867.0, "step": 3985 }, { "aux_loss": 8.106703615188598, "entropy": 0.16054214015603066, "epoch": 0.00399, "grad_norm": 0.15388259291648865, "learning_rate": 2e-05, "loss": 0.18943867683410645, "mean_token_accuracy": 0.9464708685874939, "num_tokens": 64226088.0, "step": 3990 }, { "aux_loss": 8.081350135803223, "entropy": 0.1579239446669817, "epoch": 0.003995, "grad_norm": 0.14588339626789093, "learning_rate": 2e-05, "loss": 0.19378492832183838, "mean_token_accuracy": 0.9476122468709945, "num_tokens": 64303351.0, "step": 3995 }, { "aux_loss": 8.06923942565918, "entropy": 0.17941427305340768, "epoch": 0.004, "grad_norm": 0.14514535665512085, "learning_rate": 2e-05, "loss": 0.22122440338134766, "mean_token_accuracy": 0.9387730300426483, "num_tokens": 64384402.0, "step": 4000 }, { "aux_loss": 8.069340658187866, "entropy": 0.18155089989304543, "epoch": 0.004005, "grad_norm": 0.14123430848121643, "learning_rate": 2e-05, "loss": 0.21901488304138184, "mean_token_accuracy": 0.9397453844547272, "num_tokens": 64465427.0, "step": 4005 }, { "aux_loss": 8.08221082687378, "entropy": 0.1821060985326767, "epoch": 0.00401, "grad_norm": 0.13074013590812683, "learning_rate": 2e-05, "loss": 0.2080132007598877, "mean_token_accuracy": 0.9409109026193618, "num_tokens": 64546356.0, "step": 4010 }, { "aux_loss": 8.090443134307861, "entropy": 0.16765516772866249, "epoch": 0.004015, "grad_norm": 0.1483263075351715, "learning_rate": 2e-05, "loss": 0.1874303102493286, "mean_token_accuracy": 0.9475386768579483, "num_tokens": 64626873.0, "step": 4015 }, { "aux_loss": 8.10508303642273, "entropy": 0.15679123848676682, "epoch": 0.00402, "grad_norm": 0.1835867166519165, "learning_rate": 2e-05, "loss": 0.19097511768341063, "mean_token_accuracy": 0.9467210471630096, "num_tokens": 64707233.0, "step": 4020 }, { "aux_loss": 8.083331775665282, "entropy": 0.15017431192100048, "epoch": 0.004025, "grad_norm": 0.13776715099811554, "learning_rate": 2e-05, "loss": 0.18937180042266846, "mean_token_accuracy": 0.948642173409462, "num_tokens": 64788031.0, "step": 4025 }, { "aux_loss": 8.070507955551147, "entropy": 0.19104250706732273, "epoch": 0.00403, "grad_norm": 0.14764906466007233, "learning_rate": 2e-05, "loss": 0.23659148216247558, "mean_token_accuracy": 0.9353424161672592, "num_tokens": 64869070.0, "step": 4030 }, { "aux_loss": 8.069948101043702, "entropy": 0.17851735912263395, "epoch": 0.004035, "grad_norm": 0.13509583473205566, "learning_rate": 2e-05, "loss": 0.21018548011779786, "mean_token_accuracy": 0.9413766711950302, "num_tokens": 64949884.0, "step": 4035 }, { "aux_loss": 8.081086015701294, "entropy": 0.184680961817503, "epoch": 0.00404, "grad_norm": 0.13973838090896606, "learning_rate": 2e-05, "loss": 0.21257233619689941, "mean_token_accuracy": 0.9408496230840683, "num_tokens": 65030661.0, "step": 4040 }, { "aux_loss": 8.087134504318238, "entropy": 0.17623230963945388, "epoch": 0.004045, "grad_norm": 0.1628706008195877, "learning_rate": 2e-05, "loss": 0.20290110111236573, "mean_token_accuracy": 0.9433736443519593, "num_tokens": 65111662.0, "step": 4045 }, { "aux_loss": 8.10088005065918, "entropy": 0.159989033639431, "epoch": 0.00405, "grad_norm": 0.14700080454349518, "learning_rate": 2e-05, "loss": 0.18420116901397704, "mean_token_accuracy": 0.9484766960144043, "num_tokens": 65191660.0, "step": 4050 }, { "aux_loss": 8.09033432006836, "entropy": 0.174098851531744, "epoch": 0.004055, "grad_norm": 0.152372345328331, "learning_rate": 2e-05, "loss": 0.20993974208831787, "mean_token_accuracy": 0.9438207447528839, "num_tokens": 65269913.0, "step": 4055 }, { "aux_loss": 8.06638798713684, "entropy": 0.19519088454544545, "epoch": 0.00406, "grad_norm": 0.1604108065366745, "learning_rate": 2e-05, "loss": 0.2431988000869751, "mean_token_accuracy": 0.9322654813528061, "num_tokens": 65350862.0, "step": 4060 }, { "aux_loss": 8.070633697509766, "entropy": 0.1889781817793846, "epoch": 0.004065, "grad_norm": 0.12792906165122986, "learning_rate": 2e-05, "loss": 0.22586872577667236, "mean_token_accuracy": 0.9373369872570038, "num_tokens": 65432074.0, "step": 4065 }, { "aux_loss": 8.07981243133545, "entropy": 0.1819232426583767, "epoch": 0.00407, "grad_norm": 0.136160746216774, "learning_rate": 2e-05, "loss": 0.20806806087493895, "mean_token_accuracy": 0.9421541363000869, "num_tokens": 65512746.0, "step": 4070 }, { "aux_loss": 8.08708896636963, "entropy": 0.1701486200094223, "epoch": 0.004075, "grad_norm": 0.1507285088300705, "learning_rate": 2e-05, "loss": 0.19780858755111694, "mean_token_accuracy": 0.9454937070608139, "num_tokens": 65593234.0, "step": 4075 }, { "aux_loss": 8.099062633514404, "entropy": 0.1580248475074768, "epoch": 0.00408, "grad_norm": 0.15038086473941803, "learning_rate": 2e-05, "loss": 0.18610332012176514, "mean_token_accuracy": 0.9480824947357178, "num_tokens": 65673733.0, "step": 4080 }, { "aux_loss": 8.091101217269898, "entropy": 0.15355209447443485, "epoch": 0.004085, "grad_norm": 0.1268012821674347, "learning_rate": 2e-05, "loss": 0.18365161418914794, "mean_token_accuracy": 0.9506066590547562, "num_tokens": 65750893.0, "step": 4085 }, { "aux_loss": 8.064303636550903, "entropy": 0.18075645230710508, "epoch": 0.00409, "grad_norm": 0.14601679146289825, "learning_rate": 2e-05, "loss": 0.22333426475524903, "mean_token_accuracy": 0.9376881331205368, "num_tokens": 65832039.0, "step": 4090 }, { "aux_loss": 8.068262529373168, "entropy": 0.19310965687036513, "epoch": 0.004095, "grad_norm": 0.13745450973510742, "learning_rate": 2e-05, "loss": 0.23399546146392822, "mean_token_accuracy": 0.9342675775289535, "num_tokens": 65913070.0, "step": 4095 }, { "aux_loss": 8.074833726882934, "entropy": 0.17377459220588207, "epoch": 0.0041, "grad_norm": 0.13420403003692627, "learning_rate": 2e-05, "loss": 0.20697827339172364, "mean_token_accuracy": 0.9427221775054931, "num_tokens": 65993809.0, "step": 4100 }, { "aux_loss": 8.08429675102234, "entropy": 0.1748849056661129, "epoch": 0.004105, "grad_norm": 0.13983213901519775, "learning_rate": 2e-05, "loss": 0.19947532415390015, "mean_token_accuracy": 0.943372043967247, "num_tokens": 66074604.0, "step": 4105 }, { "aux_loss": 8.094364404678345, "entropy": 0.15670294016599656, "epoch": 0.00411, "grad_norm": 0.1450595110654831, "learning_rate": 2e-05, "loss": 0.17926582098007202, "mean_token_accuracy": 0.9512201547622681, "num_tokens": 66155539.0, "step": 4110 }, { "aux_loss": 8.101194286346436, "entropy": 0.1474872872233391, "epoch": 0.004115, "grad_norm": 0.13709039986133575, "learning_rate": 2e-05, "loss": 0.1780955672264099, "mean_token_accuracy": 0.9507912933826447, "num_tokens": 66234447.0, "step": 4115 }, { "aux_loss": 8.057816457748412, "entropy": 0.1664051443338394, "epoch": 0.00412, "grad_norm": 0.1568625420331955, "learning_rate": 2e-05, "loss": 0.2139223575592041, "mean_token_accuracy": 0.9409090608358384, "num_tokens": 66315669.0, "step": 4120 }, { "aux_loss": 8.069647598266602, "entropy": 0.19159175381064414, "epoch": 0.004125, "grad_norm": 0.1470678448677063, "learning_rate": 2e-05, "loss": 0.23636178970336913, "mean_token_accuracy": 0.9345293343067169, "num_tokens": 66396554.0, "step": 4125 }, { "aux_loss": 8.072778749465943, "entropy": 0.18799845278263091, "epoch": 0.00413, "grad_norm": 0.13189157843589783, "learning_rate": 2e-05, "loss": 0.21511499881744384, "mean_token_accuracy": 0.9406137645244599, "num_tokens": 66477671.0, "step": 4130 }, { "aux_loss": 8.08385615348816, "entropy": 0.1776302933692932, "epoch": 0.004135, "grad_norm": 0.13385000824928284, "learning_rate": 2e-05, "loss": 0.19926952123641967, "mean_token_accuracy": 0.9443440586328506, "num_tokens": 66558415.0, "step": 4135 }, { "aux_loss": 8.092693519592284, "entropy": 0.165148364007473, "epoch": 0.00414, "grad_norm": 0.14408499002456665, "learning_rate": 2e-05, "loss": 0.19295555353164673, "mean_token_accuracy": 0.9458460479974746, "num_tokens": 66639392.0, "step": 4140 }, { "aux_loss": 8.10185284614563, "entropy": 0.15802374631166458, "epoch": 0.004145, "grad_norm": 0.12628768384456635, "learning_rate": 2e-05, "loss": 0.18807635307312012, "mean_token_accuracy": 0.9486256182193756, "num_tokens": 66717706.0, "step": 4145 }, { "aux_loss": 8.061801862716674, "entropy": 0.17386738657951356, "epoch": 0.00415, "grad_norm": 0.14630699157714844, "learning_rate": 2e-05, "loss": 0.21836941242218016, "mean_token_accuracy": 0.940554091334343, "num_tokens": 66798955.0, "step": 4150 }, { "aux_loss": 8.070080280303955, "entropy": 0.16589830182492732, "epoch": 0.004155, "grad_norm": 0.15465304255485535, "learning_rate": 2e-05, "loss": 0.20467777252197267, "mean_token_accuracy": 0.9426725238561631, "num_tokens": 66879375.0, "step": 4155 }, { "aux_loss": 8.07814974784851, "entropy": 0.17901213020086287, "epoch": 0.00416, "grad_norm": 0.13934604823589325, "learning_rate": 2e-05, "loss": 0.21030039787292482, "mean_token_accuracy": 0.9412366211414337, "num_tokens": 66960058.0, "step": 4160 }, { "aux_loss": 8.088335704803466, "entropy": 0.1755394533276558, "epoch": 0.004165, "grad_norm": 0.14618510007858276, "learning_rate": 2e-05, "loss": 0.20091817378997803, "mean_token_accuracy": 0.9444429874420166, "num_tokens": 67041056.0, "step": 4165 }, { "aux_loss": 8.093344831466675, "entropy": 0.15623823255300523, "epoch": 0.00417, "grad_norm": 0.14904572069644928, "learning_rate": 2e-05, "loss": 0.18160520792007445, "mean_token_accuracy": 0.9495443314313888, "num_tokens": 67122012.0, "step": 4170 }, { "aux_loss": 8.102756452560424, "entropy": 0.1416645497083664, "epoch": 0.004175, "grad_norm": 0.12421419471502304, "learning_rate": 2e-05, "loss": 0.17385153770446776, "mean_token_accuracy": 0.9521195501089096, "num_tokens": 67200616.0, "step": 4175 }, { "aux_loss": 8.062928533554077, "entropy": 0.1789213791489601, "epoch": 0.00418, "grad_norm": 0.13390590250492096, "learning_rate": 2e-05, "loss": 0.22279748916625977, "mean_token_accuracy": 0.9387729048728943, "num_tokens": 67281934.0, "step": 4180 }, { "aux_loss": 8.067456197738647, "entropy": 0.19295660853385926, "epoch": 0.004185, "grad_norm": 0.15121915936470032, "learning_rate": 2e-05, "loss": 0.2366931676864624, "mean_token_accuracy": 0.9342221319675446, "num_tokens": 67362931.0, "step": 4185 }, { "aux_loss": 8.07349090576172, "entropy": 0.19296474382281303, "epoch": 0.00419, "grad_norm": 0.13033528625965118, "learning_rate": 2e-05, "loss": 0.22286410331726075, "mean_token_accuracy": 0.9372146010398865, "num_tokens": 67443902.0, "step": 4190 }, { "aux_loss": 8.078996515274047, "entropy": 0.17323909923434258, "epoch": 0.004195, "grad_norm": 0.1359061300754547, "learning_rate": 2e-05, "loss": 0.19408833980560303, "mean_token_accuracy": 0.9463406056165695, "num_tokens": 67524610.0, "step": 4195 }, { "aux_loss": 8.091639518737793, "entropy": 0.16558289527893066, "epoch": 0.0042, "grad_norm": 0.14134995639324188, "learning_rate": 2e-05, "loss": 0.18870824575424194, "mean_token_accuracy": 0.9481595456600189, "num_tokens": 67605394.0, "step": 4200 }, { "aux_loss": 8.11300106048584, "entropy": 0.156542756408453, "epoch": 0.004205, "grad_norm": 0.1970505714416504, "learning_rate": 2e-05, "loss": 0.18325804471969603, "mean_token_accuracy": 0.9480713158845901, "num_tokens": 67682390.0, "step": 4205 }, { "aux_loss": 8.062799263000489, "entropy": 0.18372222259640694, "epoch": 0.00421, "grad_norm": 0.16438975930213928, "learning_rate": 2e-05, "loss": 0.23308656215667725, "mean_token_accuracy": 0.936217337846756, "num_tokens": 67763766.0, "step": 4210 }, { "aux_loss": 8.065517807006836, "entropy": 0.2014029435813427, "epoch": 0.004215, "grad_norm": 0.13802672922611237, "learning_rate": 2e-05, "loss": 0.24253413677215577, "mean_token_accuracy": 0.9319497972726822, "num_tokens": 67845050.0, "step": 4215 }, { "aux_loss": 8.071827507019043, "entropy": 0.19400066658854484, "epoch": 0.00422, "grad_norm": 0.13618911802768707, "learning_rate": 2e-05, "loss": 0.2283384084701538, "mean_token_accuracy": 0.9372434586286544, "num_tokens": 67926012.0, "step": 4220 }, { "aux_loss": 8.079135036468506, "entropy": 0.17796122208237647, "epoch": 0.004225, "grad_norm": 0.134163960814476, "learning_rate": 2e-05, "loss": 0.20136067867279053, "mean_token_accuracy": 0.9438400983810424, "num_tokens": 68006576.0, "step": 4225 }, { "aux_loss": 8.089920711517333, "entropy": 0.16169902980327605, "epoch": 0.00423, "grad_norm": 0.1498737633228302, "learning_rate": 2e-05, "loss": 0.1858538269996643, "mean_token_accuracy": 0.9484745532274246, "num_tokens": 68086579.0, "step": 4230 }, { "aux_loss": 8.105748748779297, "entropy": 0.15697465613484382, "epoch": 0.004235, "grad_norm": 0.15838921070098877, "learning_rate": 2e-05, "loss": 0.18612390756607056, "mean_token_accuracy": 0.9480006545782089, "num_tokens": 68167179.0, "step": 4235 }, { "aux_loss": 8.064301204681396, "entropy": 0.1899186883121729, "epoch": 0.00424, "grad_norm": 0.1430978775024414, "learning_rate": 2e-05, "loss": 0.2342383623123169, "mean_token_accuracy": 0.9365141242742538, "num_tokens": 68247740.0, "step": 4240 }, { "aux_loss": 8.071315956115722, "entropy": 0.19949283003807067, "epoch": 0.004245, "grad_norm": 0.14402714371681213, "learning_rate": 2e-05, "loss": 0.24164390563964844, "mean_token_accuracy": 0.9334080964326859, "num_tokens": 68328781.0, "step": 4245 }, { "aux_loss": 8.07277536392212, "entropy": 0.1642709244042635, "epoch": 0.00425, "grad_norm": 0.13262556493282318, "learning_rate": 2e-05, "loss": 0.1938338041305542, "mean_token_accuracy": 0.9459922581911087, "num_tokens": 68409641.0, "step": 4250 }, { "aux_loss": 8.081375312805175, "entropy": 0.17299794778227806, "epoch": 0.004255, "grad_norm": 0.14518195390701294, "learning_rate": 2e-05, "loss": 0.20028214454650878, "mean_token_accuracy": 0.9443636804819107, "num_tokens": 68490108.0, "step": 4255 }, { "aux_loss": 8.088916969299316, "entropy": 0.1673464857041836, "epoch": 0.00426, "grad_norm": 0.1402788609266281, "learning_rate": 2e-05, "loss": 0.19545431137084962, "mean_token_accuracy": 0.945445927977562, "num_tokens": 68570407.0, "step": 4260 }, { "aux_loss": 8.104100513458253, "entropy": 0.1506233938038349, "epoch": 0.004265, "grad_norm": 0.16530829668045044, "learning_rate": 2e-05, "loss": 0.17668191194534302, "mean_token_accuracy": 0.9513014763593673, "num_tokens": 68650835.0, "step": 4265 }, { "aux_loss": 8.062661266326904, "entropy": 0.16357909217476846, "epoch": 0.00427, "grad_norm": 0.14734461903572083, "learning_rate": 2e-05, "loss": 0.20471456050872802, "mean_token_accuracy": 0.9446876019239425, "num_tokens": 68731722.0, "step": 4270 }, { "aux_loss": 8.064127683639526, "entropy": 0.1830916054546833, "epoch": 0.004275, "grad_norm": 0.13832776248455048, "learning_rate": 2e-05, "loss": 0.22243731021881102, "mean_token_accuracy": 0.9390664726495743, "num_tokens": 68813208.0, "step": 4275 }, { "aux_loss": 8.069669198989867, "entropy": 0.17019328102469444, "epoch": 0.00428, "grad_norm": 0.13978317379951477, "learning_rate": 2e-05, "loss": 0.20442538261413573, "mean_token_accuracy": 0.9432233452796936, "num_tokens": 68894144.0, "step": 4280 }, { "aux_loss": 8.080967378616332, "entropy": 0.17591089904308319, "epoch": 0.004285, "grad_norm": 0.13872495293617249, "learning_rate": 2e-05, "loss": 0.2043544292449951, "mean_token_accuracy": 0.9426625460386276, "num_tokens": 68974842.0, "step": 4285 }, { "aux_loss": 8.088066577911377, "entropy": 0.15964294224977493, "epoch": 0.00429, "grad_norm": 0.14347712695598602, "learning_rate": 2e-05, "loss": 0.18445612192153932, "mean_token_accuracy": 0.9482874900102616, "num_tokens": 69054956.0, "step": 4290 }, { "aux_loss": 8.10286865234375, "entropy": 0.1529075898230076, "epoch": 0.004295, "grad_norm": 0.16215908527374268, "learning_rate": 2e-05, "loss": 0.17725415229797364, "mean_token_accuracy": 0.9505029529333114, "num_tokens": 69135438.0, "step": 4295 }, { "aux_loss": 8.064771461486817, "entropy": 0.1863943636417389, "epoch": 0.0043, "grad_norm": 0.14068421721458435, "learning_rate": 2e-05, "loss": 0.22935824394226073, "mean_token_accuracy": 0.9385807782411575, "num_tokens": 69215103.0, "step": 4300 }, { "aux_loss": 8.070622444152832, "entropy": 0.1977604880928993, "epoch": 0.004305, "grad_norm": 0.1485324501991272, "learning_rate": 2e-05, "loss": 0.24191112518310548, "mean_token_accuracy": 0.9326848983764648, "num_tokens": 69296223.0, "step": 4305 }, { "aux_loss": 8.068218088150024, "entropy": 0.17825442291796206, "epoch": 0.00431, "grad_norm": 0.13282841444015503, "learning_rate": 2e-05, "loss": 0.21320128440856934, "mean_token_accuracy": 0.9405946582555771, "num_tokens": 69377141.0, "step": 4310 }, { "aux_loss": 8.079132413864135, "entropy": 0.176223087310791, "epoch": 0.004315, "grad_norm": 0.1335696429014206, "learning_rate": 2e-05, "loss": 0.20367257595062255, "mean_token_accuracy": 0.9429424643516541, "num_tokens": 69457684.0, "step": 4315 }, { "aux_loss": 8.088479137420654, "entropy": 0.16690649688243867, "epoch": 0.00432, "grad_norm": 0.1405257135629654, "learning_rate": 2e-05, "loss": 0.19091715812683105, "mean_token_accuracy": 0.9464767873287201, "num_tokens": 69538378.0, "step": 4320 }, { "aux_loss": 8.09993510246277, "entropy": 0.1499143972992897, "epoch": 0.004325, "grad_norm": 0.15144208073616028, "learning_rate": 2e-05, "loss": 0.17648680210113527, "mean_token_accuracy": 0.9506325542926788, "num_tokens": 69618500.0, "step": 4325 }, { "aux_loss": 8.075860214233398, "entropy": 0.17051323652267455, "epoch": 0.00433, "grad_norm": 0.16274310648441315, "learning_rate": 2e-05, "loss": 0.20888113975524902, "mean_token_accuracy": 0.9421725541353225, "num_tokens": 69698610.0, "step": 4330 }, { "aux_loss": 8.067101573944091, "entropy": 0.18359835296869279, "epoch": 0.004335, "grad_norm": 0.14738775789737701, "learning_rate": 2e-05, "loss": 0.22505500316619872, "mean_token_accuracy": 0.9374961674213409, "num_tokens": 69779681.0, "step": 4335 }, { "aux_loss": 8.069784450531007, "entropy": 0.18074525594711305, "epoch": 0.00434, "grad_norm": 0.13869988918304443, "learning_rate": 2e-05, "loss": 0.2161696195602417, "mean_token_accuracy": 0.9398662030696869, "num_tokens": 69860607.0, "step": 4340 }, { "aux_loss": 8.079578924179078, "entropy": 0.1802871987223625, "epoch": 0.004345, "grad_norm": 0.13982544839382172, "learning_rate": 2e-05, "loss": 0.20732157230377196, "mean_token_accuracy": 0.9423238128423691, "num_tokens": 69941509.0, "step": 4345 }, { "aux_loss": 8.08824462890625, "entropy": 0.16554139778017998, "epoch": 0.00435, "grad_norm": 0.1411389410495758, "learning_rate": 2e-05, "loss": 0.18847463130950928, "mean_token_accuracy": 0.9479102939367294, "num_tokens": 70021906.0, "step": 4350 }, { "aux_loss": 8.102502489089966, "entropy": 0.15165012702345848, "epoch": 0.004355, "grad_norm": 0.17146232724189758, "learning_rate": 2e-05, "loss": 0.18178340196609497, "mean_token_accuracy": 0.9504520446062088, "num_tokens": 70102174.0, "step": 4355 }, { "aux_loss": 8.080121850967407, "entropy": 0.17862374149262905, "epoch": 0.00436, "grad_norm": 0.154321551322937, "learning_rate": 2e-05, "loss": 0.22329416275024414, "mean_token_accuracy": 0.9388250648975373, "num_tokens": 70179755.0, "step": 4360 }, { "aux_loss": 8.065065860748291, "entropy": 0.19679731577634813, "epoch": 0.004365, "grad_norm": 0.1517145186662674, "learning_rate": 2e-05, "loss": 0.2374509811401367, "mean_token_accuracy": 0.9333733379840851, "num_tokens": 70261012.0, "step": 4365 }, { "aux_loss": 8.071874523162842, "entropy": 0.1774231106042862, "epoch": 0.00437, "grad_norm": 0.13734932243824005, "learning_rate": 2e-05, "loss": 0.20597360134124756, "mean_token_accuracy": 0.9424983054399491, "num_tokens": 70342063.0, "step": 4370 }, { "aux_loss": 8.075448513031006, "entropy": 0.17250633724033831, "epoch": 0.004375, "grad_norm": 0.13557101786136627, "learning_rate": 2e-05, "loss": 0.19838166236877441, "mean_token_accuracy": 0.9442262798547745, "num_tokens": 70422480.0, "step": 4375 }, { "aux_loss": 8.085636949539184, "entropy": 0.1633521683514118, "epoch": 0.00438, "grad_norm": 0.14496545493602753, "learning_rate": 2e-05, "loss": 0.19115960597991943, "mean_token_accuracy": 0.9469558268785476, "num_tokens": 70502787.0, "step": 4380 }, { "aux_loss": 8.098505687713622, "entropy": 0.14625002555549144, "epoch": 0.004385, "grad_norm": 0.15544292330741882, "learning_rate": 2e-05, "loss": 0.17514681816101074, "mean_token_accuracy": 0.9512954622507095, "num_tokens": 70583182.0, "step": 4385 }, { "aux_loss": 8.079198598861694, "entropy": 0.16400582976639272, "epoch": 0.00439, "grad_norm": 0.15685784816741943, "learning_rate": 2e-05, "loss": 0.2038726329803467, "mean_token_accuracy": 0.944197016954422, "num_tokens": 70661098.0, "step": 4390 }, { "aux_loss": 8.063077163696288, "entropy": 0.18995024338364602, "epoch": 0.004395, "grad_norm": 0.1617853045463562, "learning_rate": 2e-05, "loss": 0.23596880435943604, "mean_token_accuracy": 0.9353494733572006, "num_tokens": 70742372.0, "step": 4395 }, { "aux_loss": 8.068993473052979, "entropy": 0.18315186426043512, "epoch": 0.0044, "grad_norm": 0.14959554374217987, "learning_rate": 2e-05, "loss": 0.21350929737091065, "mean_token_accuracy": 0.9409860402345658, "num_tokens": 70823521.0, "step": 4400 }, { "aux_loss": 8.076430606842042, "entropy": 0.1799841694533825, "epoch": 0.004405, "grad_norm": 0.13897870481014252, "learning_rate": 2e-05, "loss": 0.20462429523468018, "mean_token_accuracy": 0.9430956065654754, "num_tokens": 70904491.0, "step": 4405 }, { "aux_loss": 8.087015199661256, "entropy": 0.16791487634181976, "epoch": 0.00441, "grad_norm": 0.1454988569021225, "learning_rate": 2e-05, "loss": 0.19633032083511354, "mean_token_accuracy": 0.9444218277931213, "num_tokens": 70985017.0, "step": 4410 }, { "aux_loss": 8.099424028396607, "entropy": 0.15029532685875893, "epoch": 0.004415, "grad_norm": 0.15232595801353455, "learning_rate": 2e-05, "loss": 0.17951246500015258, "mean_token_accuracy": 0.9501245677471161, "num_tokens": 71065525.0, "step": 4415 }, { "aux_loss": 8.077301216125488, "entropy": 0.17666647508740424, "epoch": 0.00442, "grad_norm": 0.14066213369369507, "learning_rate": 2e-05, "loss": 0.21807899475097656, "mean_token_accuracy": 0.9400651812553406, "num_tokens": 71144378.0, "step": 4420 }, { "aux_loss": 8.062133598327637, "entropy": 0.19724079072475434, "epoch": 0.004425, "grad_norm": 0.13821446895599365, "learning_rate": 2e-05, "loss": 0.24060750007629395, "mean_token_accuracy": 0.9340013116598129, "num_tokens": 71225128.0, "step": 4425 }, { "aux_loss": 8.067744398117066, "entropy": 0.18977774679660797, "epoch": 0.00443, "grad_norm": 0.13182908296585083, "learning_rate": 2e-05, "loss": 0.2200251579284668, "mean_token_accuracy": 0.9383378446102142, "num_tokens": 71305827.0, "step": 4430 }, { "aux_loss": 8.074538040161134, "entropy": 0.17881755754351616, "epoch": 0.004435, "grad_norm": 0.13338777422904968, "learning_rate": 2e-05, "loss": 0.20556602478027344, "mean_token_accuracy": 0.9426519364118576, "num_tokens": 71386866.0, "step": 4435 }, { "aux_loss": 8.084324836730957, "entropy": 0.17350154370069504, "epoch": 0.00444, "grad_norm": 0.13931666314601898, "learning_rate": 2e-05, "loss": 0.20212831497192382, "mean_token_accuracy": 0.9437998682260513, "num_tokens": 71467809.0, "step": 4440 }, { "aux_loss": 8.09551944732666, "entropy": 0.15271651223301888, "epoch": 0.004445, "grad_norm": 0.14519935846328735, "learning_rate": 2e-05, "loss": 0.17921783924102783, "mean_token_accuracy": 0.949969157576561, "num_tokens": 71547991.0, "step": 4445 }, { "aux_loss": 8.085372018814088, "entropy": 0.16865719333291054, "epoch": 0.00445, "grad_norm": 0.1393231302499771, "learning_rate": 2e-05, "loss": 0.2130376100540161, "mean_token_accuracy": 0.941288697719574, "num_tokens": 71626670.0, "step": 4450 }, { "aux_loss": 8.066629123687743, "entropy": 0.21009229570627214, "epoch": 0.004455, "grad_norm": 0.14402218163013458, "learning_rate": 2e-05, "loss": 0.2533489465713501, "mean_token_accuracy": 0.9295083075761795, "num_tokens": 71707870.0, "step": 4455 }, { "aux_loss": 8.070453786849976, "entropy": 0.1969396859407425, "epoch": 0.00446, "grad_norm": 0.14154215157032013, "learning_rate": 2e-05, "loss": 0.22565038204193116, "mean_token_accuracy": 0.9378685653209686, "num_tokens": 71788873.0, "step": 4460 }, { "aux_loss": 8.076510000228883, "entropy": 0.18202112466096879, "epoch": 0.004465, "grad_norm": 0.14607785642147064, "learning_rate": 2e-05, "loss": 0.2105297327041626, "mean_token_accuracy": 0.9412449181079865, "num_tokens": 71869739.0, "step": 4465 }, { "aux_loss": 8.084033250808716, "entropy": 0.16639509126544, "epoch": 0.00447, "grad_norm": 0.13450272381305695, "learning_rate": 2e-05, "loss": 0.18952665328979493, "mean_token_accuracy": 0.9482693105936051, "num_tokens": 71950652.0, "step": 4470 }, { "aux_loss": 8.096046972274781, "entropy": 0.1618128690868616, "epoch": 0.004475, "grad_norm": 0.14755448698997498, "learning_rate": 2e-05, "loss": 0.1920398950576782, "mean_token_accuracy": 0.9457824021577835, "num_tokens": 72030610.0, "step": 4475 }, { "aux_loss": 8.083650875091553, "entropy": 0.1595099586993456, "epoch": 0.00448, "grad_norm": 0.1382610946893692, "learning_rate": 2e-05, "loss": 0.19593231678009032, "mean_token_accuracy": 0.9457450628280639, "num_tokens": 72107579.0, "step": 4480 }, { "aux_loss": 8.062685012817383, "entropy": 0.19694138392806054, "epoch": 0.004485, "grad_norm": 0.15121030807495117, "learning_rate": 2e-05, "loss": 0.24766852855682372, "mean_token_accuracy": 0.932568433880806, "num_tokens": 72188409.0, "step": 4485 }, { "aux_loss": 8.066452789306641, "entropy": 0.1974887542426586, "epoch": 0.00449, "grad_norm": 0.14627841114997864, "learning_rate": 2e-05, "loss": 0.22699663639068604, "mean_token_accuracy": 0.9374784499406814, "num_tokens": 72269638.0, "step": 4490 }, { "aux_loss": 8.072482252120972, "entropy": 0.19781241416931153, "epoch": 0.004495, "grad_norm": 0.1398935765028, "learning_rate": 2e-05, "loss": 0.22060873508453369, "mean_token_accuracy": 0.9392734676599502, "num_tokens": 72350725.0, "step": 4495 }, { "aux_loss": 8.082854652404786, "entropy": 0.1693793423473835, "epoch": 0.0045, "grad_norm": 0.14737220108509064, "learning_rate": 2e-05, "loss": 0.19731720685958862, "mean_token_accuracy": 0.9453026652336121, "num_tokens": 72431768.0, "step": 4500 }, { "aux_loss": 8.091933298110963, "entropy": 0.15824628472328187, "epoch": 0.004505, "grad_norm": 0.15237073600292206, "learning_rate": 2e-05, "loss": 0.1889147400856018, "mean_token_accuracy": 0.9477914452552796, "num_tokens": 72512635.0, "step": 4505 }, { "aux_loss": 8.095367622375488, "entropy": 0.1589428626000881, "epoch": 0.00451, "grad_norm": 0.14845195412635803, "learning_rate": 2e-05, "loss": 0.194513738155365, "mean_token_accuracy": 0.9472707033157348, "num_tokens": 72589799.0, "step": 4510 }, { "aux_loss": 8.063193702697754, "entropy": 0.19799885898828506, "epoch": 0.004515, "grad_norm": 0.15138953924179077, "learning_rate": 2e-05, "loss": 0.24119656085968016, "mean_token_accuracy": 0.9317484855651855, "num_tokens": 72670741.0, "step": 4515 }, { "aux_loss": 8.06618161201477, "entropy": 0.18955951258540155, "epoch": 0.00452, "grad_norm": 0.13983069360256195, "learning_rate": 2e-05, "loss": 0.2227219820022583, "mean_token_accuracy": 0.9374795973300933, "num_tokens": 72751380.0, "step": 4520 }, { "aux_loss": 8.07211389541626, "entropy": 0.19891044422984122, "epoch": 0.004525, "grad_norm": 0.1337806135416031, "learning_rate": 2e-05, "loss": 0.22794482707977295, "mean_token_accuracy": 0.9362816601991654, "num_tokens": 72832575.0, "step": 4525 }, { "aux_loss": 8.081197166442871, "entropy": 0.1760702535510063, "epoch": 0.00453, "grad_norm": 0.1429797112941742, "learning_rate": 2e-05, "loss": 0.20033011436462403, "mean_token_accuracy": 0.9451403826475143, "num_tokens": 72913402.0, "step": 4530 }, { "aux_loss": 8.092799615859985, "entropy": 0.15617439076304435, "epoch": 0.004535, "grad_norm": 0.15613104403018951, "learning_rate": 2e-05, "loss": 0.18931454420089722, "mean_token_accuracy": 0.9478604257106781, "num_tokens": 72994260.0, "step": 4535 }, { "aux_loss": 8.090886211395263, "entropy": 0.15939540602266788, "epoch": 0.00454, "grad_norm": 0.1329685002565384, "learning_rate": 2e-05, "loss": 0.19394994974136354, "mean_token_accuracy": 0.9464447289705277, "num_tokens": 73073334.0, "step": 4540 }, { "aux_loss": 8.056928014755249, "entropy": 0.17319882661104202, "epoch": 0.004545, "grad_norm": 0.14538465440273285, "learning_rate": 2e-05, "loss": 0.21885814666748046, "mean_token_accuracy": 0.9401337534189225, "num_tokens": 73154244.0, "step": 4545 }, { "aux_loss": 8.064096784591674, "entropy": 0.18502655103802682, "epoch": 0.00455, "grad_norm": 0.13656294345855713, "learning_rate": 2e-05, "loss": 0.22055163383483886, "mean_token_accuracy": 0.9385868400335312, "num_tokens": 73235183.0, "step": 4550 }, { "aux_loss": 8.072021579742431, "entropy": 0.18931702598929406, "epoch": 0.004555, "grad_norm": 0.13566571474075317, "learning_rate": 2e-05, "loss": 0.2179636240005493, "mean_token_accuracy": 0.9405626714229584, "num_tokens": 73316031.0, "step": 4555 }, { "aux_loss": 8.079217147827148, "entropy": 0.18022140115499496, "epoch": 0.00456, "grad_norm": 0.14091147482395172, "learning_rate": 2e-05, "loss": 0.20822691917419434, "mean_token_accuracy": 0.9418215036392212, "num_tokens": 73396740.0, "step": 4560 }, { "aux_loss": 8.089881706237794, "entropy": 0.1692284107208252, "epoch": 0.004565, "grad_norm": 0.13896194100379944, "learning_rate": 2e-05, "loss": 0.1954060673713684, "mean_token_accuracy": 0.9457089990377426, "num_tokens": 73477466.0, "step": 4565 }, { "aux_loss": 8.096963691711426, "entropy": 0.15040182694792747, "epoch": 0.00457, "grad_norm": 0.13605912029743195, "learning_rate": 2e-05, "loss": 0.17977070808410645, "mean_token_accuracy": 0.950329777598381, "num_tokens": 73556185.0, "step": 4570 }, { "aux_loss": 8.062443923950195, "entropy": 0.19017603173851966, "epoch": 0.004575, "grad_norm": 0.14468735456466675, "learning_rate": 2e-05, "loss": 0.23940153121948243, "mean_token_accuracy": 0.9329633384943008, "num_tokens": 73637641.0, "step": 4575 }, { "aux_loss": 8.066125631332397, "entropy": 0.19175320342183114, "epoch": 0.00458, "grad_norm": 0.13012750446796417, "learning_rate": 2e-05, "loss": 0.23033366203308106, "mean_token_accuracy": 0.9355287790298462, "num_tokens": 73718521.0, "step": 4580 }, { "aux_loss": 8.071811771392822, "entropy": 0.1796797424554825, "epoch": 0.004585, "grad_norm": 0.13333414494991302, "learning_rate": 2e-05, "loss": 0.20581986904144287, "mean_token_accuracy": 0.9426154911518096, "num_tokens": 73799328.0, "step": 4585 }, { "aux_loss": 8.080306148529052, "entropy": 0.19109393954277037, "epoch": 0.00459, "grad_norm": 0.1370532512664795, "learning_rate": 2e-05, "loss": 0.21568603515625, "mean_token_accuracy": 0.9396095305681229, "num_tokens": 73879633.0, "step": 4590 }, { "aux_loss": 8.088784456253052, "entropy": 0.16321615129709244, "epoch": 0.004595, "grad_norm": 0.13728748261928558, "learning_rate": 2e-05, "loss": 0.18967210054397582, "mean_token_accuracy": 0.9470471858978271, "num_tokens": 73959933.0, "step": 4595 }, { "aux_loss": 8.108656072616578, "entropy": 0.14840723127126693, "epoch": 0.0046, "grad_norm": 0.17282789945602417, "learning_rate": 2e-05, "loss": 0.17800523042678834, "mean_token_accuracy": 0.9506584674119949, "num_tokens": 74036968.0, "step": 4600 }, { "aux_loss": 8.06267852783203, "entropy": 0.1675733968615532, "epoch": 0.004605, "grad_norm": 0.14014120399951935, "learning_rate": 2e-05, "loss": 0.2125887393951416, "mean_token_accuracy": 0.9414013952016831, "num_tokens": 74118273.0, "step": 4605 }, { "aux_loss": 8.063804531097412, "entropy": 0.2013581320643425, "epoch": 0.00461, "grad_norm": 0.14335060119628906, "learning_rate": 2e-05, "loss": 0.2425384283065796, "mean_token_accuracy": 0.9319942027330399, "num_tokens": 74199507.0, "step": 4610 }, { "aux_loss": 8.071268701553345, "entropy": 0.1975974678993225, "epoch": 0.004615, "grad_norm": 0.13530243933200836, "learning_rate": 2e-05, "loss": 0.2292879819869995, "mean_token_accuracy": 0.9366386622190476, "num_tokens": 74280396.0, "step": 4615 }, { "aux_loss": 8.076024723052978, "entropy": 0.18943899720907212, "epoch": 0.00462, "grad_norm": 0.1392260193824768, "learning_rate": 2e-05, "loss": 0.21794638633728028, "mean_token_accuracy": 0.9395203143358231, "num_tokens": 74361468.0, "step": 4620 }, { "aux_loss": 8.085432767868042, "entropy": 0.174921815097332, "epoch": 0.004625, "grad_norm": 0.1396854817867279, "learning_rate": 2e-05, "loss": 0.19981579780578612, "mean_token_accuracy": 0.944375878572464, "num_tokens": 74442097.0, "step": 4625 }, { "aux_loss": 8.096465492248536, "entropy": 0.15287185683846474, "epoch": 0.00463, "grad_norm": 0.14518404006958008, "learning_rate": 2e-05, "loss": 0.17887674570083617, "mean_token_accuracy": 0.9504520565271377, "num_tokens": 74522340.0, "step": 4630 }, { "aux_loss": 8.077925872802734, "entropy": 0.15998136401176452, "epoch": 0.004635, "grad_norm": 0.14441661536693573, "learning_rate": 2e-05, "loss": 0.194937002658844, "mean_token_accuracy": 0.9472737938165665, "num_tokens": 74600424.0, "step": 4635 }, { "aux_loss": 8.063422870635986, "entropy": 0.18733035810291768, "epoch": 0.00464, "grad_norm": 0.14657369256019592, "learning_rate": 2e-05, "loss": 0.23482840061187743, "mean_token_accuracy": 0.9350446581840515, "num_tokens": 74681412.0, "step": 4640 }, { "aux_loss": 8.065973854064941, "entropy": 0.17998111471533776, "epoch": 0.004645, "grad_norm": 0.13485363125801086, "learning_rate": 2e-05, "loss": 0.2157827854156494, "mean_token_accuracy": 0.940943318605423, "num_tokens": 74762360.0, "step": 4645 }, { "aux_loss": 8.074100160598755, "entropy": 0.17944046780467032, "epoch": 0.00465, "grad_norm": 0.13718393445014954, "learning_rate": 2e-05, "loss": 0.20702033042907714, "mean_token_accuracy": 0.9419519454240799, "num_tokens": 74843171.0, "step": 4650 }, { "aux_loss": 8.086026668548584, "entropy": 0.18462952673435212, "epoch": 0.004655, "grad_norm": 0.1488821804523468, "learning_rate": 2e-05, "loss": 0.2104006290435791, "mean_token_accuracy": 0.9410360902547836, "num_tokens": 74924206.0, "step": 4655 }, { "aux_loss": 8.096301364898682, "entropy": 0.15810611769556998, "epoch": 0.00466, "grad_norm": 0.14179250597953796, "learning_rate": 2e-05, "loss": 0.18454512357711791, "mean_token_accuracy": 0.9477861642837524, "num_tokens": 75004486.0, "step": 4660 }, { "aux_loss": 8.07915906906128, "entropy": 0.15486926287412645, "epoch": 0.004665, "grad_norm": 0.13104258477687836, "learning_rate": 2e-05, "loss": 0.18867655992507934, "mean_token_accuracy": 0.9478426486253738, "num_tokens": 75083410.0, "step": 4665 }, { "aux_loss": 8.063070440292359, "entropy": 0.18661090694367885, "epoch": 0.00467, "grad_norm": 0.1346316635608673, "learning_rate": 2e-05, "loss": 0.23294384479522706, "mean_token_accuracy": 0.9356189996004105, "num_tokens": 75164368.0, "step": 4670 }, { "aux_loss": 8.06877965927124, "entropy": 0.19713190719485282, "epoch": 0.004675, "grad_norm": 0.1399718075990677, "learning_rate": 2e-05, "loss": 0.2288973331451416, "mean_token_accuracy": 0.9362384736537933, "num_tokens": 75245552.0, "step": 4675 }, { "aux_loss": 8.072309732437134, "entropy": 0.1855604901909828, "epoch": 0.00468, "grad_norm": 0.1335286647081375, "learning_rate": 2e-05, "loss": 0.21088075637817383, "mean_token_accuracy": 0.9411711722612381, "num_tokens": 75326295.0, "step": 4680 }, { "aux_loss": 8.081314134597779, "entropy": 0.17673607021570206, "epoch": 0.004685, "grad_norm": 0.13869231939315796, "learning_rate": 2e-05, "loss": 0.20768117904663086, "mean_token_accuracy": 0.9430624306201935, "num_tokens": 75406987.0, "step": 4685 }, { "aux_loss": 8.094422912597656, "entropy": 0.15325603298842908, "epoch": 0.00469, "grad_norm": 0.15016576647758484, "learning_rate": 2e-05, "loss": 0.17913633584976196, "mean_token_accuracy": 0.9492972373962403, "num_tokens": 75486875.0, "step": 4690 }, { "aux_loss": 8.085892486572266, "entropy": 0.15288294851779938, "epoch": 0.004695, "grad_norm": 0.13211746513843536, "learning_rate": 2e-05, "loss": 0.1904144287109375, "mean_token_accuracy": 0.9474628537893295, "num_tokens": 75567676.0, "step": 4695 }, { "aux_loss": 8.05788812637329, "entropy": 0.18550010696053504, "epoch": 0.0047, "grad_norm": 0.1705792248249054, "learning_rate": 2e-05, "loss": 0.2348736047744751, "mean_token_accuracy": 0.9357887744903565, "num_tokens": 75648822.0, "step": 4700 }, { "aux_loss": 8.064849948883056, "entropy": 0.19827280640602113, "epoch": 0.004705, "grad_norm": 0.13893216848373413, "learning_rate": 2e-05, "loss": 0.23682036399841308, "mean_token_accuracy": 0.934507954120636, "num_tokens": 75729826.0, "step": 4705 }, { "aux_loss": 8.06988878250122, "entropy": 0.18553285971283912, "epoch": 0.00471, "grad_norm": 0.14590932428836823, "learning_rate": 2e-05, "loss": 0.21061787605285645, "mean_token_accuracy": 0.9408619731664658, "num_tokens": 75810376.0, "step": 4710 }, { "aux_loss": 8.079116249084473, "entropy": 0.1813324846327305, "epoch": 0.004715, "grad_norm": 0.15733754634857178, "learning_rate": 2e-05, "loss": 0.20513761043548584, "mean_token_accuracy": 0.9425485312938691, "num_tokens": 75891195.0, "step": 4715 }, { "aux_loss": 8.090752458572387, "entropy": 0.15269932709634304, "epoch": 0.00472, "grad_norm": 0.1568419337272644, "learning_rate": 2e-05, "loss": 0.17674895524978637, "mean_token_accuracy": 0.9509547144174576, "num_tokens": 75971569.0, "step": 4720 }, { "aux_loss": 8.096448373794555, "entropy": 0.14826879277825356, "epoch": 0.004725, "grad_norm": 0.12922972440719604, "learning_rate": 2e-05, "loss": 0.18003151416778565, "mean_token_accuracy": 0.9500920981168747, "num_tokens": 76048280.0, "step": 4725 }, { "aux_loss": 8.062775564193725, "entropy": 0.17861160933971404, "epoch": 0.00473, "grad_norm": 0.15754659473896027, "learning_rate": 2e-05, "loss": 0.2280363082885742, "mean_token_accuracy": 0.9365868926048279, "num_tokens": 76129158.0, "step": 4730 }, { "aux_loss": 8.066216230392456, "entropy": 0.18023304902017118, "epoch": 0.004735, "grad_norm": 0.1284816414117813, "learning_rate": 2e-05, "loss": 0.21792955398559571, "mean_token_accuracy": 0.9398057073354721, "num_tokens": 76210467.0, "step": 4735 }, { "aux_loss": 8.074613666534423, "entropy": 0.18975592032074928, "epoch": 0.00474, "grad_norm": 0.13700903952121735, "learning_rate": 2e-05, "loss": 0.2202444076538086, "mean_token_accuracy": 0.9387628763914109, "num_tokens": 76291112.0, "step": 4740 }, { "aux_loss": 8.078449916839599, "entropy": 0.17308646738529204, "epoch": 0.004745, "grad_norm": 0.13061454892158508, "learning_rate": 2e-05, "loss": 0.19888010025024414, "mean_token_accuracy": 0.944050857424736, "num_tokens": 76371992.0, "step": 4745 }, { "aux_loss": 8.090685415267945, "entropy": 0.15347178801894187, "epoch": 0.00475, "grad_norm": 0.15530313551425934, "learning_rate": 2e-05, "loss": 0.17448859214782714, "mean_token_accuracy": 0.9517248034477234, "num_tokens": 76452652.0, "step": 4750 }, { "aux_loss": 8.095803833007812, "entropy": 0.1440520141273737, "epoch": 0.004755, "grad_norm": 0.1254265159368515, "learning_rate": 2e-05, "loss": 0.17638027667999268, "mean_token_accuracy": 0.9516173630952836, "num_tokens": 76530326.0, "step": 4755 }, { "aux_loss": 8.061766147613525, "entropy": 0.1593510240316391, "epoch": 0.00476, "grad_norm": 0.1422550082206726, "learning_rate": 2e-05, "loss": 0.20485897064208985, "mean_token_accuracy": 0.9428268611431122, "num_tokens": 76611731.0, "step": 4760 }, { "aux_loss": 8.065559148788452, "entropy": 0.18134529888629913, "epoch": 0.004765, "grad_norm": 0.14673522114753723, "learning_rate": 2e-05, "loss": 0.22229044437408446, "mean_token_accuracy": 0.937855190038681, "num_tokens": 76692544.0, "step": 4765 }, { "aux_loss": 8.069455003738403, "entropy": 0.19137707054615022, "epoch": 0.00477, "grad_norm": 0.13313166797161102, "learning_rate": 2e-05, "loss": 0.22386796474456788, "mean_token_accuracy": 0.9381320953369141, "num_tokens": 76773321.0, "step": 4770 }, { "aux_loss": 8.08010835647583, "entropy": 0.18328376412391661, "epoch": 0.004775, "grad_norm": 0.13736172020435333, "learning_rate": 2e-05, "loss": 0.20520222187042236, "mean_token_accuracy": 0.9428687363862991, "num_tokens": 76854322.0, "step": 4775 }, { "aux_loss": 8.086656522750854, "entropy": 0.16473961025476455, "epoch": 0.00478, "grad_norm": 0.14471887052059174, "learning_rate": 2e-05, "loss": 0.19400408267974853, "mean_token_accuracy": 0.9451741725206375, "num_tokens": 76935072.0, "step": 4780 }, { "aux_loss": 8.094878768920898, "entropy": 0.14804205670952797, "epoch": 0.004785, "grad_norm": 0.1242397353053093, "learning_rate": 2e-05, "loss": 0.17491521835327148, "mean_token_accuracy": 0.9517376780509949, "num_tokens": 77014990.0, "step": 4785 }, { "aux_loss": 8.05673713684082, "entropy": 0.17769003957509993, "epoch": 0.00479, "grad_norm": 0.13810604810714722, "learning_rate": 2e-05, "loss": 0.22061588764190673, "mean_token_accuracy": 0.9399046152830124, "num_tokens": 77096204.0, "step": 4790 }, { "aux_loss": 8.063803243637086, "entropy": 0.1688243556767702, "epoch": 0.004795, "grad_norm": 0.14647211134433746, "learning_rate": 2e-05, "loss": 0.2114875316619873, "mean_token_accuracy": 0.9427297741174698, "num_tokens": 77177244.0, "step": 4795 }, { "aux_loss": 8.071053886413575, "entropy": 0.1860219307243824, "epoch": 0.0048, "grad_norm": 0.1336272656917572, "learning_rate": 2e-05, "loss": 0.2182929754257202, "mean_token_accuracy": 0.9387612760066986, "num_tokens": 77258308.0, "step": 4800 }, { "aux_loss": 8.077130365371705, "entropy": 0.17437779307365417, "epoch": 0.004805, "grad_norm": 0.14074093103408813, "learning_rate": 2e-05, "loss": 0.2036818027496338, "mean_token_accuracy": 0.9434036195278168, "num_tokens": 77338936.0, "step": 4805 }, { "aux_loss": 8.08580207824707, "entropy": 0.16227206736803054, "epoch": 0.00481, "grad_norm": 0.1438792198896408, "learning_rate": 2e-05, "loss": 0.187655246257782, "mean_token_accuracy": 0.9477988064289093, "num_tokens": 77419517.0, "step": 4810 }, { "aux_loss": 8.100102949142457, "entropy": 0.14868246652185918, "epoch": 0.004815, "grad_norm": 0.14531210064888, "learning_rate": 2e-05, "loss": 0.17584103345870972, "mean_token_accuracy": 0.9517533600330352, "num_tokens": 77498691.0, "step": 4815 }, { "aux_loss": 8.06145749092102, "entropy": 0.17999815195798874, "epoch": 0.00482, "grad_norm": 0.15414494276046753, "learning_rate": 2e-05, "loss": 0.22422258853912352, "mean_token_accuracy": 0.9383078992366791, "num_tokens": 77580251.0, "step": 4820 }, { "aux_loss": 8.062994575500488, "entropy": 0.19598802849650382, "epoch": 0.004825, "grad_norm": 0.13477541506290436, "learning_rate": 2e-05, "loss": 0.23447961807250978, "mean_token_accuracy": 0.9342438578605652, "num_tokens": 77661720.0, "step": 4825 }, { "aux_loss": 8.06834659576416, "entropy": 0.19157903753221034, "epoch": 0.00483, "grad_norm": 0.13233202695846558, "learning_rate": 2e-05, "loss": 0.2236931562423706, "mean_token_accuracy": 0.9371049910783767, "num_tokens": 77742821.0, "step": 4830 }, { "aux_loss": 8.079009389877319, "entropy": 0.19248158112168312, "epoch": 0.004835, "grad_norm": 0.14351986348628998, "learning_rate": 2e-05, "loss": 0.21961729526519774, "mean_token_accuracy": 0.9385960161685943, "num_tokens": 77823431.0, "step": 4835 }, { "aux_loss": 8.0873046875, "entropy": 0.16416383236646653, "epoch": 0.00484, "grad_norm": 0.1315767765045166, "learning_rate": 2e-05, "loss": 0.18500778675079346, "mean_token_accuracy": 0.9487603038549424, "num_tokens": 77904075.0, "step": 4840 }, { "aux_loss": 8.105883741378785, "entropy": 0.15333222597837448, "epoch": 0.004845, "grad_norm": 0.1693802773952484, "learning_rate": 2e-05, "loss": 0.1815592885017395, "mean_token_accuracy": 0.9489593893289566, "num_tokens": 77984572.0, "step": 4845 }, { "aux_loss": 8.063505125045776, "entropy": 0.1847516719251871, "epoch": 0.00485, "grad_norm": 0.14307129383087158, "learning_rate": 2e-05, "loss": 0.22595858573913574, "mean_token_accuracy": 0.938094162940979, "num_tokens": 78062556.0, "step": 4850 }, { "aux_loss": 8.06514253616333, "entropy": 0.18040362000465393, "epoch": 0.004855, "grad_norm": 0.15260963141918182, "learning_rate": 2e-05, "loss": 0.22822363376617433, "mean_token_accuracy": 0.9371621757745743, "num_tokens": 78143960.0, "step": 4855 }, { "aux_loss": 8.069723987579346, "entropy": 0.16827748566865922, "epoch": 0.00486, "grad_norm": 0.13363219797611237, "learning_rate": 2e-05, "loss": 0.20340406894683838, "mean_token_accuracy": 0.9436208039522171, "num_tokens": 78225141.0, "step": 4860 }, { "aux_loss": 8.07733221054077, "entropy": 0.18799750804901122, "epoch": 0.004865, "grad_norm": 0.13352744281291962, "learning_rate": 2e-05, "loss": 0.21118266582489015, "mean_token_accuracy": 0.9427341043949127, "num_tokens": 78305728.0, "step": 4865 }, { "aux_loss": 8.08578381538391, "entropy": 0.17517005577683448, "epoch": 0.00487, "grad_norm": 0.14015154540538788, "learning_rate": 2e-05, "loss": 0.1990761399269104, "mean_token_accuracy": 0.9440957307815552, "num_tokens": 78386350.0, "step": 4870 }, { "aux_loss": 8.0989990234375, "entropy": 0.1563259456306696, "epoch": 0.004875, "grad_norm": 0.15986883640289307, "learning_rate": 2e-05, "loss": 0.18830337524414062, "mean_token_accuracy": 0.948091197013855, "num_tokens": 78466611.0, "step": 4875 }, { "aux_loss": 8.068572950363158, "entropy": 0.16635826528072356, "epoch": 0.00488, "grad_norm": 0.1429399698972702, "learning_rate": 2e-05, "loss": 0.20412166118621827, "mean_token_accuracy": 0.9434427320957184, "num_tokens": 78545911.0, "step": 4880 }, { "aux_loss": 8.063074445724487, "entropy": 0.19215986505150795, "epoch": 0.004885, "grad_norm": 0.14082340896129608, "learning_rate": 2e-05, "loss": 0.2396674394607544, "mean_token_accuracy": 0.9329192250967026, "num_tokens": 78627110.0, "step": 4885 }, { "aux_loss": 8.069276094436646, "entropy": 0.18511325493454933, "epoch": 0.00489, "grad_norm": 0.12917843461036682, "learning_rate": 2e-05, "loss": 0.2201209306716919, "mean_token_accuracy": 0.9387602388858796, "num_tokens": 78708416.0, "step": 4890 }, { "aux_loss": 8.074924802780151, "entropy": 0.19096734598279, "epoch": 0.004895, "grad_norm": 0.13760483264923096, "learning_rate": 2e-05, "loss": 0.21770994663238524, "mean_token_accuracy": 0.9395693838596344, "num_tokens": 78789288.0, "step": 4895 }, { "aux_loss": 8.084355926513672, "entropy": 0.1727454349398613, "epoch": 0.0049, "grad_norm": 0.13361328840255737, "learning_rate": 2e-05, "loss": 0.195175838470459, "mean_token_accuracy": 0.9459042578935624, "num_tokens": 78870329.0, "step": 4900 }, { "aux_loss": 8.09723253250122, "entropy": 0.152843826264143, "epoch": 0.004905, "grad_norm": 0.1537516564130783, "learning_rate": 2e-05, "loss": 0.17511388063430786, "mean_token_accuracy": 0.9508573204278946, "num_tokens": 78950772.0, "step": 4905 }, { "aux_loss": 8.075333881378175, "entropy": 0.15962165966629982, "epoch": 0.00491, "grad_norm": 0.15547269582748413, "learning_rate": 2e-05, "loss": 0.20460450649261475, "mean_token_accuracy": 0.9436504900455475, "num_tokens": 79028899.0, "step": 4910 }, { "aux_loss": 8.065459394454956, "entropy": 0.17354790680110455, "epoch": 0.004915, "grad_norm": 0.15293730795383453, "learning_rate": 2e-05, "loss": 0.22032437324523926, "mean_token_accuracy": 0.9393253415822983, "num_tokens": 79110116.0, "step": 4915 }, { "aux_loss": 8.070332384109497, "entropy": 0.18256853595376016, "epoch": 0.00492, "grad_norm": 0.128585085272789, "learning_rate": 2e-05, "loss": 0.2146277904510498, "mean_token_accuracy": 0.9398369520902634, "num_tokens": 79191137.0, "step": 4920 }, { "aux_loss": 8.07633810043335, "entropy": 0.1892526388168335, "epoch": 0.004925, "grad_norm": 0.1317615956068039, "learning_rate": 2e-05, "loss": 0.2122637987136841, "mean_token_accuracy": 0.9413473963737488, "num_tokens": 79272063.0, "step": 4925 }, { "aux_loss": 8.083935403823853, "entropy": 0.17361845299601555, "epoch": 0.00493, "grad_norm": 0.14347580075263977, "learning_rate": 2e-05, "loss": 0.20168979167938234, "mean_token_accuracy": 0.9447771817445755, "num_tokens": 79352811.0, "step": 4930 }, { "aux_loss": 8.092362785339356, "entropy": 0.15533897280693054, "epoch": 0.004935, "grad_norm": 0.15174630284309387, "learning_rate": 2e-05, "loss": 0.18947105407714843, "mean_token_accuracy": 0.9474773168563843, "num_tokens": 79432879.0, "step": 4935 }, { "aux_loss": 8.081296300888061, "entropy": 0.16013988479971886, "epoch": 0.00494, "grad_norm": 0.1388075351715088, "learning_rate": 2e-05, "loss": 0.1940844774246216, "mean_token_accuracy": 0.947017589211464, "num_tokens": 79513506.0, "step": 4940 }, { "aux_loss": 8.064167737960815, "entropy": 0.18577812500298024, "epoch": 0.004945, "grad_norm": 0.1492556631565094, "learning_rate": 2e-05, "loss": 0.22762320041656495, "mean_token_accuracy": 0.9366672039031982, "num_tokens": 79594247.0, "step": 4945 }, { "aux_loss": 8.068421649932862, "entropy": 0.19005856439471244, "epoch": 0.00495, "grad_norm": 0.13822248578071594, "learning_rate": 2e-05, "loss": 0.22751774787902831, "mean_token_accuracy": 0.9371238201856613, "num_tokens": 79675230.0, "step": 4950 }, { "aux_loss": 8.072866487503052, "entropy": 0.18283550590276718, "epoch": 0.004955, "grad_norm": 0.13207697868347168, "learning_rate": 2e-05, "loss": 0.20969955921173095, "mean_token_accuracy": 0.9412348508834839, "num_tokens": 79755840.0, "step": 4955 }, { "aux_loss": 8.082518911361694, "entropy": 0.1677012600004673, "epoch": 0.00496, "grad_norm": 0.13073845207691193, "learning_rate": 2e-05, "loss": 0.18848557472229005, "mean_token_accuracy": 0.947378334403038, "num_tokens": 79836457.0, "step": 4960 }, { "aux_loss": 8.093623876571655, "entropy": 0.14853578731417655, "epoch": 0.004965, "grad_norm": 0.15753896534442902, "learning_rate": 2e-05, "loss": 0.17656341791152955, "mean_token_accuracy": 0.9510572373867034, "num_tokens": 79917044.0, "step": 4965 }, { "aux_loss": 8.076998138427735, "entropy": 0.1635641474276781, "epoch": 0.00497, "grad_norm": 0.14596302807331085, "learning_rate": 2e-05, "loss": 0.20475146770477295, "mean_token_accuracy": 0.9442510575056076, "num_tokens": 79997860.0, "step": 4970 }, { "aux_loss": 8.05983076095581, "entropy": 0.18420847207307817, "epoch": 0.004975, "grad_norm": 0.1406341940164566, "learning_rate": 2e-05, "loss": 0.22545886039733887, "mean_token_accuracy": 0.938109427690506, "num_tokens": 80078637.0, "step": 4975 }, { "aux_loss": 8.065752983093262, "entropy": 0.20092643201351165, "epoch": 0.00498, "grad_norm": 0.13014748692512512, "learning_rate": 2e-05, "loss": 0.24155800342559813, "mean_token_accuracy": 0.9334942549467087, "num_tokens": 80159684.0, "step": 4980 }, { "aux_loss": 8.069738149642944, "entropy": 0.18131208866834642, "epoch": 0.004985, "grad_norm": 0.128971129655838, "learning_rate": 2e-05, "loss": 0.206261944770813, "mean_token_accuracy": 0.9428774952888489, "num_tokens": 80240406.0, "step": 4985 }, { "aux_loss": 8.080774974822997, "entropy": 0.17356322705745697, "epoch": 0.00499, "grad_norm": 0.13693855702877045, "learning_rate": 2e-05, "loss": 0.19833028316497803, "mean_token_accuracy": 0.9450587689876556, "num_tokens": 80321090.0, "step": 4990 }, { "aux_loss": 8.088388538360595, "entropy": 0.1589390866458416, "epoch": 0.004995, "grad_norm": 0.144724503159523, "learning_rate": 2e-05, "loss": 0.1885025382041931, "mean_token_accuracy": 0.9478643119335175, "num_tokens": 80401591.0, "step": 4995 }, { "aux_loss": 8.086220598220825, "entropy": 0.1696808345615864, "epoch": 0.005, "grad_norm": 0.14380449056625366, "learning_rate": 2e-05, "loss": 0.20389807224273682, "mean_token_accuracy": 0.9446290701627731, "num_tokens": 80481663.0, "step": 5000 }, { "aux_loss": 8.061460494995117, "entropy": 0.17909952998161316, "epoch": 0.005005, "grad_norm": 0.1437544822692871, "learning_rate": 2e-05, "loss": 0.22281675338745116, "mean_token_accuracy": 0.937743729352951, "num_tokens": 80562998.0, "step": 5005 }, { "aux_loss": 8.062940502166748, "entropy": 0.17133663594722748, "epoch": 0.00501, "grad_norm": 0.13513287901878357, "learning_rate": 2e-05, "loss": 0.20670864582061768, "mean_token_accuracy": 0.942376172542572, "num_tokens": 80643879.0, "step": 5010 }, { "aux_loss": 8.07051615715027, "entropy": 0.18950156792998313, "epoch": 0.005015, "grad_norm": 0.1351640522480011, "learning_rate": 2e-05, "loss": 0.2214902639389038, "mean_token_accuracy": 0.9381137132644654, "num_tokens": 80724362.0, "step": 5015 }, { "aux_loss": 8.077671670913697, "entropy": 0.1622502975165844, "epoch": 0.00502, "grad_norm": 0.1385820209980011, "learning_rate": 2e-05, "loss": 0.1887761116027832, "mean_token_accuracy": 0.9463288217782975, "num_tokens": 80804977.0, "step": 5020 }, { "aux_loss": 8.087444496154784, "entropy": 0.164411199092865, "epoch": 0.005025, "grad_norm": 0.14165249466896057, "learning_rate": 2e-05, "loss": 0.1889095425605774, "mean_token_accuracy": 0.9469385474920273, "num_tokens": 80885739.0, "step": 5025 }, { "aux_loss": 8.089562845230102, "entropy": 0.14132896289229394, "epoch": 0.00503, "grad_norm": 0.12848259508609772, "learning_rate": 2e-05, "loss": 0.17200437784194947, "mean_token_accuracy": 0.9527578234672547, "num_tokens": 80965365.0, "step": 5030 }, { "aux_loss": 8.059129858016968, "entropy": 0.18484954573214055, "epoch": 0.005035, "grad_norm": 0.15159401297569275, "learning_rate": 2e-05, "loss": 0.23313052654266359, "mean_token_accuracy": 0.9361837476491928, "num_tokens": 81046759.0, "step": 5035 }, { "aux_loss": 8.065659332275391, "entropy": 0.18609695509076118, "epoch": 0.00504, "grad_norm": 0.13380348682403564, "learning_rate": 2e-05, "loss": 0.22719082832336426, "mean_token_accuracy": 0.9366167664527894, "num_tokens": 81127339.0, "step": 5040 }, { "aux_loss": 8.071785831451416, "entropy": 0.18999304734170436, "epoch": 0.005045, "grad_norm": 0.12963952124118805, "learning_rate": 2e-05, "loss": 0.2202707290649414, "mean_token_accuracy": 0.9385194927453995, "num_tokens": 81208150.0, "step": 5045 }, { "aux_loss": 8.075503396987916, "entropy": 0.17498328685760497, "epoch": 0.00505, "grad_norm": 0.13342489302158356, "learning_rate": 2e-05, "loss": 0.20067176818847657, "mean_token_accuracy": 0.944417205452919, "num_tokens": 81288788.0, "step": 5050 }, { "aux_loss": 8.085416507720947, "entropy": 0.1612071469426155, "epoch": 0.005055, "grad_norm": 0.13029880821704865, "learning_rate": 2e-05, "loss": 0.18787113428115845, "mean_token_accuracy": 0.9476497143507003, "num_tokens": 81369821.0, "step": 5055 }, { "aux_loss": 8.094400930404664, "entropy": 0.14648021943867207, "epoch": 0.00506, "grad_norm": 0.12763769924640656, "learning_rate": 2e-05, "loss": 0.17607131004333496, "mean_token_accuracy": 0.9516687840223312, "num_tokens": 81447752.0, "step": 5060 }, { "aux_loss": 8.056461143493653, "entropy": 0.1861129380762577, "epoch": 0.005065, "grad_norm": 0.14374208450317383, "learning_rate": 2e-05, "loss": 0.23259367942810058, "mean_token_accuracy": 0.9371941596269607, "num_tokens": 81529164.0, "step": 5065 }, { "aux_loss": 8.06020212173462, "entropy": 0.1942598707973957, "epoch": 0.00507, "grad_norm": 0.13377441465854645, "learning_rate": 2e-05, "loss": 0.23065507411956787, "mean_token_accuracy": 0.9355861335992813, "num_tokens": 81609913.0, "step": 5070 }, { "aux_loss": 8.068313694000244, "entropy": 0.19032789394259453, "epoch": 0.005075, "grad_norm": 0.13738398253917694, "learning_rate": 2e-05, "loss": 0.2128575325012207, "mean_token_accuracy": 0.9400048702955246, "num_tokens": 81690581.0, "step": 5075 }, { "aux_loss": 8.078317451477051, "entropy": 0.18149514123797417, "epoch": 0.00508, "grad_norm": 0.14576472342014313, "learning_rate": 2e-05, "loss": 0.21017444133758545, "mean_token_accuracy": 0.9409641116857529, "num_tokens": 81770764.0, "step": 5080 }, { "aux_loss": 8.087953996658324, "entropy": 0.16609180569648743, "epoch": 0.005085, "grad_norm": 0.14495544135570526, "learning_rate": 2e-05, "loss": 0.19417307376861573, "mean_token_accuracy": 0.9456107228994369, "num_tokens": 81851547.0, "step": 5085 }, { "aux_loss": 8.098352146148681, "entropy": 0.14779425226151943, "epoch": 0.00509, "grad_norm": 0.1287878304719925, "learning_rate": 2e-05, "loss": 0.17721613645553588, "mean_token_accuracy": 0.9516434460878372, "num_tokens": 81930829.0, "step": 5090 }, { "aux_loss": 8.057374095916748, "entropy": 0.17751976512372494, "epoch": 0.005095, "grad_norm": 0.14047560095787048, "learning_rate": 2e-05, "loss": 0.22454257011413575, "mean_token_accuracy": 0.9388383090496063, "num_tokens": 82012400.0, "step": 5095 }, { "aux_loss": 8.061855792999268, "entropy": 0.1945471465587616, "epoch": 0.0051, "grad_norm": 0.14557085931301117, "learning_rate": 2e-05, "loss": 0.2323601245880127, "mean_token_accuracy": 0.9356596738100051, "num_tokens": 82093115.0, "step": 5100 }, { "aux_loss": 8.068995046615601, "entropy": 0.18055291585624217, "epoch": 0.005105, "grad_norm": 0.1313052773475647, "learning_rate": 2e-05, "loss": 0.21209371089935303, "mean_token_accuracy": 0.9422195374965667, "num_tokens": 82173958.0, "step": 5105 }, { "aux_loss": 8.08045072555542, "entropy": 0.1748869799077511, "epoch": 0.00511, "grad_norm": 0.1337028592824936, "learning_rate": 2e-05, "loss": 0.1990726947784424, "mean_token_accuracy": 0.9446351289749145, "num_tokens": 82254669.0, "step": 5110 }, { "aux_loss": 8.086453580856324, "entropy": 0.15801681503653525, "epoch": 0.005115, "grad_norm": 0.1370856761932373, "learning_rate": 2e-05, "loss": 0.18352211713790895, "mean_token_accuracy": 0.9489396572113037, "num_tokens": 82335264.0, "step": 5115 }, { "aux_loss": 8.097521829605103, "entropy": 0.1501435101032257, "epoch": 0.00512, "grad_norm": 0.1464599072933197, "learning_rate": 2e-05, "loss": 0.18293447494506837, "mean_token_accuracy": 0.9493194729089737, "num_tokens": 82412840.0, "step": 5120 }, { "aux_loss": 8.0606849193573, "entropy": 0.18269062973558903, "epoch": 0.005125, "grad_norm": 0.14097903668880463, "learning_rate": 2e-05, "loss": 0.22738711833953856, "mean_token_accuracy": 0.9382804304361343, "num_tokens": 82494410.0, "step": 5125 }, { "aux_loss": 8.05986065864563, "entropy": 0.20089913681149482, "epoch": 0.00513, "grad_norm": 0.13728372752666473, "learning_rate": 2e-05, "loss": 0.24180009365081787, "mean_token_accuracy": 0.9336772918701172, "num_tokens": 82575568.0, "step": 5130 }, { "aux_loss": 8.06652398109436, "entropy": 0.19021136164665223, "epoch": 0.005135, "grad_norm": 0.13539330661296844, "learning_rate": 2e-05, "loss": 0.22068052291870116, "mean_token_accuracy": 0.93862384557724, "num_tokens": 82656732.0, "step": 5135 }, { "aux_loss": 8.076739740371703, "entropy": 0.18896769285202025, "epoch": 0.00514, "grad_norm": 0.14026601612567902, "learning_rate": 2e-05, "loss": 0.21176626682281494, "mean_token_accuracy": 0.9415340900421143, "num_tokens": 82737361.0, "step": 5140 }, { "aux_loss": 8.085612916946411, "entropy": 0.16142391487956048, "epoch": 0.005145, "grad_norm": 0.14975136518478394, "learning_rate": 2e-05, "loss": 0.18413556814193727, "mean_token_accuracy": 0.9488928973674774, "num_tokens": 82817843.0, "step": 5145 }, { "aux_loss": 8.102252101898193, "entropy": 0.14715617932379246, "epoch": 0.00515, "grad_norm": 0.18000397086143494, "learning_rate": 2e-05, "loss": 0.17973248958587645, "mean_token_accuracy": 0.9500347584486007, "num_tokens": 82895353.0, "step": 5150 }, { "aux_loss": 8.057420682907104, "entropy": 0.1684798751026392, "epoch": 0.005155, "grad_norm": 0.15003588795661926, "learning_rate": 2e-05, "loss": 0.2151956081390381, "mean_token_accuracy": 0.9406437695026397, "num_tokens": 82977015.0, "step": 5155 }, { "aux_loss": 8.05977005958557, "entropy": 0.19859195798635482, "epoch": 0.00516, "grad_norm": 0.13261450827121735, "learning_rate": 2e-05, "loss": 0.24169466495513917, "mean_token_accuracy": 0.9339892268180847, "num_tokens": 83058388.0, "step": 5160 }, { "aux_loss": 8.066183423995971, "entropy": 0.20120759382843972, "epoch": 0.005165, "grad_norm": 0.1291927993297577, "learning_rate": 2e-05, "loss": 0.2316272497177124, "mean_token_accuracy": 0.9348942846059799, "num_tokens": 83139193.0, "step": 5165 }, { "aux_loss": 8.07408447265625, "entropy": 0.1641852840781212, "epoch": 0.00517, "grad_norm": 0.12719838321208954, "learning_rate": 2e-05, "loss": 0.18633654117584228, "mean_token_accuracy": 0.9486995756626129, "num_tokens": 83219768.0, "step": 5170 }, { "aux_loss": 8.085832214355468, "entropy": 0.16438565030694008, "epoch": 0.005175, "grad_norm": 0.14058950543403625, "learning_rate": 2e-05, "loss": 0.19205108880996705, "mean_token_accuracy": 0.9463698744773865, "num_tokens": 83300341.0, "step": 5175 }, { "aux_loss": 8.092932653427123, "entropy": 0.14931646287441253, "epoch": 0.00518, "grad_norm": 0.14637906849384308, "learning_rate": 2e-05, "loss": 0.17636841535568237, "mean_token_accuracy": 0.9511190354824066, "num_tokens": 83380113.0, "step": 5180 }, { "aux_loss": 8.071480417251587, "entropy": 0.16499637849628926, "epoch": 0.005185, "grad_norm": 0.14911912381649017, "learning_rate": 2e-05, "loss": 0.20396580696105956, "mean_token_accuracy": 0.9451363801956176, "num_tokens": 83461026.0, "step": 5185 }, { "aux_loss": 8.063604736328125, "entropy": 0.18016661144793034, "epoch": 0.00519, "grad_norm": 0.15766309201717377, "learning_rate": 2e-05, "loss": 0.22609267234802247, "mean_token_accuracy": 0.9369242399930954, "num_tokens": 83541945.0, "step": 5190 }, { "aux_loss": 8.064621305465698, "entropy": 0.1844883807003498, "epoch": 0.005195, "grad_norm": 0.13181759417057037, "learning_rate": 2e-05, "loss": 0.217124342918396, "mean_token_accuracy": 0.9403899610042572, "num_tokens": 83622962.0, "step": 5195 }, { "aux_loss": 8.071509265899659, "entropy": 0.19331589862704276, "epoch": 0.0052, "grad_norm": 0.1289542019367218, "learning_rate": 2e-05, "loss": 0.21748409271240235, "mean_token_accuracy": 0.9402452617883682, "num_tokens": 83703623.0, "step": 5200 }, { "aux_loss": 8.077685022354126, "entropy": 0.17031075283885003, "epoch": 0.005205, "grad_norm": 0.1487719863653183, "learning_rate": 2e-05, "loss": 0.19834980964660645, "mean_token_accuracy": 0.9444656133651733, "num_tokens": 83784228.0, "step": 5205 }, { "aux_loss": 8.086824178695679, "entropy": 0.16505861431360244, "epoch": 0.00521, "grad_norm": 0.1417459398508072, "learning_rate": 2e-05, "loss": 0.1932835340499878, "mean_token_accuracy": 0.9459480851888656, "num_tokens": 83864661.0, "step": 5210 }, { "aux_loss": 8.082101011276245, "entropy": 0.1893757451325655, "epoch": 0.005215, "grad_norm": 0.1346246898174286, "learning_rate": 2e-05, "loss": 0.22587037086486816, "mean_token_accuracy": 0.9373359382152557, "num_tokens": 83945040.0, "step": 5215 }, { "aux_loss": 8.060264587402344, "entropy": 0.18647052422165872, "epoch": 0.00522, "grad_norm": 0.13630251586437225, "learning_rate": 2e-05, "loss": 0.229781174659729, "mean_token_accuracy": 0.9363776117563247, "num_tokens": 84025943.0, "step": 5220 }, { "aux_loss": 8.063036727905274, "entropy": 0.18653476648032666, "epoch": 0.005225, "grad_norm": 0.13629674911499023, "learning_rate": 2e-05, "loss": 0.22703688144683837, "mean_token_accuracy": 0.9371970355510711, "num_tokens": 84107044.0, "step": 5225 }, { "aux_loss": 8.070794439315796, "entropy": 0.18378162607550622, "epoch": 0.00523, "grad_norm": 0.13028231263160706, "learning_rate": 2e-05, "loss": 0.2100696563720703, "mean_token_accuracy": 0.941874486207962, "num_tokens": 84188012.0, "step": 5230 }, { "aux_loss": 8.077144384384155, "entropy": 0.17059426307678222, "epoch": 0.005235, "grad_norm": 0.12864133715629578, "learning_rate": 2e-05, "loss": 0.1947857141494751, "mean_token_accuracy": 0.9454405397176743, "num_tokens": 84268484.0, "step": 5235 }, { "aux_loss": 8.088841867446899, "entropy": 0.1648114152252674, "epoch": 0.00524, "grad_norm": 0.14165791869163513, "learning_rate": 2e-05, "loss": 0.19274320602416992, "mean_token_accuracy": 0.9462246894836426, "num_tokens": 84349041.0, "step": 5240 }, { "aux_loss": 8.083983564376831, "entropy": 0.15550471656024456, "epoch": 0.005245, "grad_norm": 0.12493729591369629, "learning_rate": 2e-05, "loss": 0.18871302604675294, "mean_token_accuracy": 0.9482835561037064, "num_tokens": 84428624.0, "step": 5245 }, { "aux_loss": 8.058908605575562, "entropy": 0.2004340335726738, "epoch": 0.00525, "grad_norm": 0.13948389887809753, "learning_rate": 2e-05, "loss": 0.24442296028137206, "mean_token_accuracy": 0.93235542178154, "num_tokens": 84509816.0, "step": 5250 }, { "aux_loss": 8.064950942993164, "entropy": 0.19418388232588768, "epoch": 0.005255, "grad_norm": 0.13848178088665009, "learning_rate": 2e-05, "loss": 0.23547282218933105, "mean_token_accuracy": 0.9355094879865646, "num_tokens": 84591063.0, "step": 5255 }, { "aux_loss": 8.071905946731567, "entropy": 0.188873939961195, "epoch": 0.00526, "grad_norm": 0.13631193339824677, "learning_rate": 2e-05, "loss": 0.21399741172790526, "mean_token_accuracy": 0.9406247943639755, "num_tokens": 84672185.0, "step": 5260 }, { "aux_loss": 8.078228664398193, "entropy": 0.17337775602936745, "epoch": 0.005265, "grad_norm": 0.1347685158252716, "learning_rate": 2e-05, "loss": 0.19666157960891723, "mean_token_accuracy": 0.9445564061403274, "num_tokens": 84753131.0, "step": 5265 }, { "aux_loss": 8.090518760681153, "entropy": 0.15564620941877366, "epoch": 0.00527, "grad_norm": 0.14129430055618286, "learning_rate": 2e-05, "loss": 0.18422791957855225, "mean_token_accuracy": 0.9499352663755417, "num_tokens": 84833759.0, "step": 5270 }, { "aux_loss": 8.08458776473999, "entropy": 0.1570093970745802, "epoch": 0.005275, "grad_norm": 0.16710075736045837, "learning_rate": 2e-05, "loss": 0.1880483865737915, "mean_token_accuracy": 0.9488036781549454, "num_tokens": 84913344.0, "step": 5275 }, { "aux_loss": 8.063005447387695, "entropy": 0.183569348603487, "epoch": 0.00528, "grad_norm": 0.14091730117797852, "learning_rate": 2e-05, "loss": 0.22685303688049316, "mean_token_accuracy": 0.9369056910276413, "num_tokens": 84994646.0, "step": 5280 }, { "aux_loss": 8.064584589004516, "entropy": 0.17309212908148766, "epoch": 0.005285, "grad_norm": 0.1365366280078888, "learning_rate": 2e-05, "loss": 0.21304657459259033, "mean_token_accuracy": 0.9410705208778382, "num_tokens": 85075695.0, "step": 5285 }, { "aux_loss": 8.074301385879517, "entropy": 0.1822326511144638, "epoch": 0.00529, "grad_norm": 0.13143017888069153, "learning_rate": 2e-05, "loss": 0.21302130222320556, "mean_token_accuracy": 0.9400135189294815, "num_tokens": 85156515.0, "step": 5290 }, { "aux_loss": 8.07977910041809, "entropy": 0.17323933616280557, "epoch": 0.005295, "grad_norm": 0.13945405185222626, "learning_rate": 2e-05, "loss": 0.19553561210632325, "mean_token_accuracy": 0.9454155951738358, "num_tokens": 85237456.0, "step": 5295 }, { "aux_loss": 8.089977407455445, "entropy": 0.159903197363019, "epoch": 0.0053, "grad_norm": 0.14117389917373657, "learning_rate": 2e-05, "loss": 0.1822801947593689, "mean_token_accuracy": 0.9490360617637634, "num_tokens": 85317735.0, "step": 5300 }, { "aux_loss": 8.084252834320068, "entropy": 0.16214874982833863, "epoch": 0.005305, "grad_norm": 0.1376124620437622, "learning_rate": 2e-05, "loss": 0.1983538508415222, "mean_token_accuracy": 0.9464780122041703, "num_tokens": 85396313.0, "step": 5305 }, { "aux_loss": 8.060075807571412, "entropy": 0.18716093078255652, "epoch": 0.00531, "grad_norm": 0.14581257104873657, "learning_rate": 2e-05, "loss": 0.23828446865081787, "mean_token_accuracy": 0.934212327003479, "num_tokens": 85477074.0, "step": 5310 }, { "aux_loss": 8.066683912277222, "entropy": 0.18466987274587154, "epoch": 0.005315, "grad_norm": 0.12460780888795853, "learning_rate": 2e-05, "loss": 0.22361156940460206, "mean_token_accuracy": 0.9388301581144333, "num_tokens": 85557935.0, "step": 5315 }, { "aux_loss": 8.070351076126098, "entropy": 0.18355950862169265, "epoch": 0.00532, "grad_norm": 0.13842551410198212, "learning_rate": 2e-05, "loss": 0.20714399814605713, "mean_token_accuracy": 0.9423571646213531, "num_tokens": 85638600.0, "step": 5320 }, { "aux_loss": 8.080270481109618, "entropy": 0.16325409561395646, "epoch": 0.005325, "grad_norm": 0.13353529572486877, "learning_rate": 2e-05, "loss": 0.18565356731414795, "mean_token_accuracy": 0.9481933623552322, "num_tokens": 85719369.0, "step": 5325 }, { "aux_loss": 8.085492944717407, "entropy": 0.16201958134770394, "epoch": 0.00533, "grad_norm": 0.137704998254776, "learning_rate": 2e-05, "loss": 0.19290823936462403, "mean_token_accuracy": 0.9460921108722686, "num_tokens": 85799996.0, "step": 5330 }, { "aux_loss": 8.087014818191529, "entropy": 0.14468047209084034, "epoch": 0.005335, "grad_norm": 0.12653417885303497, "learning_rate": 2e-05, "loss": 0.17807286977767944, "mean_token_accuracy": 0.9512067526578903, "num_tokens": 85880492.0, "step": 5335 }, { "aux_loss": 8.060007762908935, "entropy": 0.18660878837108613, "epoch": 0.00534, "grad_norm": 0.13945764303207397, "learning_rate": 2e-05, "loss": 0.23587532043457032, "mean_token_accuracy": 0.9343234062194824, "num_tokens": 85961912.0, "step": 5340 }, { "aux_loss": 8.062325048446656, "entropy": 0.1941206455230713, "epoch": 0.005345, "grad_norm": 0.13073861598968506, "learning_rate": 2e-05, "loss": 0.2310464859008789, "mean_token_accuracy": 0.936710524559021, "num_tokens": 86042465.0, "step": 5345 }, { "aux_loss": 8.07067289352417, "entropy": 0.18799100294709206, "epoch": 0.00535, "grad_norm": 0.13589370250701904, "learning_rate": 2e-05, "loss": 0.21719734668731688, "mean_token_accuracy": 0.9395054072141648, "num_tokens": 86123253.0, "step": 5350 }, { "aux_loss": 8.077297639846801, "entropy": 0.17483488768339156, "epoch": 0.005355, "grad_norm": 0.13774454593658447, "learning_rate": 2e-05, "loss": 0.197356116771698, "mean_token_accuracy": 0.9447283208370209, "num_tokens": 86204153.0, "step": 5355 }, { "aux_loss": 8.085671281814575, "entropy": 0.15701987519860267, "epoch": 0.00536, "grad_norm": 0.1307866871356964, "learning_rate": 2e-05, "loss": 0.1806653618812561, "mean_token_accuracy": 0.9495237529277801, "num_tokens": 86285077.0, "step": 5360 }, { "aux_loss": 8.090608692169189, "entropy": 0.14949651174247264, "epoch": 0.005365, "grad_norm": 0.13744370639324188, "learning_rate": 2e-05, "loss": 0.18164455890655518, "mean_token_accuracy": 0.9505838185548783, "num_tokens": 86362910.0, "step": 5365 }, { "aux_loss": 8.059525680541991, "entropy": 0.1972865153104067, "epoch": 0.00537, "grad_norm": 0.144741028547287, "learning_rate": 2e-05, "loss": 0.2484058618545532, "mean_token_accuracy": 0.9318668723106385, "num_tokens": 86444017.0, "step": 5370 }, { "aux_loss": 8.06361231803894, "entropy": 0.18635189421474935, "epoch": 0.005375, "grad_norm": 0.1357920914888382, "learning_rate": 2e-05, "loss": 0.22629961967468262, "mean_token_accuracy": 0.9371060013771058, "num_tokens": 86524770.0, "step": 5375 }, { "aux_loss": 8.07099962234497, "entropy": 0.18715228661894798, "epoch": 0.00538, "grad_norm": 0.1337023675441742, "learning_rate": 2e-05, "loss": 0.21162376403808594, "mean_token_accuracy": 0.9418139934539795, "num_tokens": 86605479.0, "step": 5380 }, { "aux_loss": 8.07848834991455, "entropy": 0.17354466021060944, "epoch": 0.005385, "grad_norm": 0.13858440518379211, "learning_rate": 2e-05, "loss": 0.19837032556533812, "mean_token_accuracy": 0.9447529882192611, "num_tokens": 86686227.0, "step": 5385 }, { "aux_loss": 8.087332487106323, "entropy": 0.16211861222982407, "epoch": 0.00539, "grad_norm": 0.14103250205516815, "learning_rate": 2e-05, "loss": 0.19104729890823363, "mean_token_accuracy": 0.9458187043666839, "num_tokens": 86766849.0, "step": 5390 }, { "aux_loss": 8.094975423812866, "entropy": 0.14273872263729573, "epoch": 0.005395, "grad_norm": 0.12239940464496613, "learning_rate": 2e-05, "loss": 0.16792721748352052, "mean_token_accuracy": 0.9539982408285141, "num_tokens": 86845433.0, "step": 5395 }, { "aux_loss": 8.056214094161987, "entropy": 0.1847220130264759, "epoch": 0.0054, "grad_norm": 0.1403694897890091, "learning_rate": 2e-05, "loss": 0.22664308547973633, "mean_token_accuracy": 0.9382877796888351, "num_tokens": 86926653.0, "step": 5400 }, { "aux_loss": 8.065641975402832, "entropy": 0.17645796462893487, "epoch": 0.005405, "grad_norm": 0.14281390607357025, "learning_rate": 2e-05, "loss": 0.21644015312194825, "mean_token_accuracy": 0.939283487200737, "num_tokens": 87007776.0, "step": 5405 }, { "aux_loss": 8.066926908493041, "entropy": 0.18893500715494155, "epoch": 0.00541, "grad_norm": 0.1328655183315277, "learning_rate": 2e-05, "loss": 0.22411150932312013, "mean_token_accuracy": 0.9372498899698257, "num_tokens": 87088607.0, "step": 5410 }, { "aux_loss": 8.073578310012817, "entropy": 0.18239122703671456, "epoch": 0.005415, "grad_norm": 0.1392800509929657, "learning_rate": 2e-05, "loss": 0.2100072145462036, "mean_token_accuracy": 0.9420152723789215, "num_tokens": 87169734.0, "step": 5415 }, { "aux_loss": 8.084091281890869, "entropy": 0.16939120516180992, "epoch": 0.00542, "grad_norm": 0.13912147283554077, "learning_rate": 2e-05, "loss": 0.18994629383087158, "mean_token_accuracy": 0.9470632135868072, "num_tokens": 87250032.0, "step": 5420 }, { "aux_loss": 8.100236654281616, "entropy": 0.14679208323359488, "epoch": 0.005425, "grad_norm": 0.1625506728887558, "learning_rate": 2e-05, "loss": 0.17082153558731078, "mean_token_accuracy": 0.9530383318662643, "num_tokens": 87330203.0, "step": 5425 }, { "aux_loss": 8.065205430984497, "entropy": 0.16032120436429978, "epoch": 0.00543, "grad_norm": 0.14751924574375153, "learning_rate": 2e-05, "loss": 0.2046891927719116, "mean_token_accuracy": 0.9443695902824402, "num_tokens": 87408106.0, "step": 5430 }, { "aux_loss": 8.061290168762207, "entropy": 0.18574356958270072, "epoch": 0.005435, "grad_norm": 0.15134435892105103, "learning_rate": 2e-05, "loss": 0.23141441345214844, "mean_token_accuracy": 0.9357331395149231, "num_tokens": 87489430.0, "step": 5435 }, { "aux_loss": 8.065538454055787, "entropy": 0.18175650313496589, "epoch": 0.00544, "grad_norm": 0.13342812657356262, "learning_rate": 2e-05, "loss": 0.21436078548431398, "mean_token_accuracy": 0.939489334821701, "num_tokens": 87570553.0, "step": 5440 }, { "aux_loss": 8.074884796142578, "entropy": 0.1787301439791918, "epoch": 0.005445, "grad_norm": 0.1371317058801651, "learning_rate": 2e-05, "loss": 0.20495855808258057, "mean_token_accuracy": 0.9420325130224227, "num_tokens": 87651757.0, "step": 5445 }, { "aux_loss": 8.08654351234436, "entropy": 0.1611557759344578, "epoch": 0.00545, "grad_norm": 0.14200739562511444, "learning_rate": 2e-05, "loss": 0.1845611810684204, "mean_token_accuracy": 0.9484672844409943, "num_tokens": 87731849.0, "step": 5450 }, { "aux_loss": 8.096723937988282, "entropy": 0.1464724324643612, "epoch": 0.005455, "grad_norm": 0.1508539766073227, "learning_rate": 2e-05, "loss": 0.1742676854133606, "mean_token_accuracy": 0.951809149980545, "num_tokens": 87812673.0, "step": 5455 }, { "aux_loss": 8.066505670547485, "entropy": 0.15454460829496383, "epoch": 0.00546, "grad_norm": 0.13381434977054596, "learning_rate": 2e-05, "loss": 0.19344613552093506, "mean_token_accuracy": 0.9480178236961365, "num_tokens": 87891413.0, "step": 5460 }, { "aux_loss": 8.062973499298096, "entropy": 0.17748164683580397, "epoch": 0.005465, "grad_norm": 0.1435805857181549, "learning_rate": 2e-05, "loss": 0.2242818832397461, "mean_token_accuracy": 0.9377706199884415, "num_tokens": 87972408.0, "step": 5465 }, { "aux_loss": 8.064704418182373, "entropy": 0.1739771731197834, "epoch": 0.00547, "grad_norm": 0.1375543177127838, "learning_rate": 2e-05, "loss": 0.2104339599609375, "mean_token_accuracy": 0.9420272171497345, "num_tokens": 88053615.0, "step": 5470 }, { "aux_loss": 8.07089900970459, "entropy": 0.16684116907417773, "epoch": 0.005475, "grad_norm": 0.1268276870250702, "learning_rate": 2e-05, "loss": 0.18953068256378175, "mean_token_accuracy": 0.9469234615564346, "num_tokens": 88134384.0, "step": 5475 }, { "aux_loss": 8.080683755874634, "entropy": 0.17217904850840568, "epoch": 0.00548, "grad_norm": 0.13503451645374298, "learning_rate": 2e-05, "loss": 0.19765374660491944, "mean_token_accuracy": 0.9450942516326905, "num_tokens": 88215085.0, "step": 5480 }, { "aux_loss": 8.092326545715332, "entropy": 0.15209664180874824, "epoch": 0.005485, "grad_norm": 0.1457759141921997, "learning_rate": 2e-05, "loss": 0.180171000957489, "mean_token_accuracy": 0.9496074229478836, "num_tokens": 88295455.0, "step": 5485 }, { "aux_loss": 8.071015930175781, "entropy": 0.16407919004559518, "epoch": 0.00549, "grad_norm": 0.1388535499572754, "learning_rate": 2e-05, "loss": 0.19918595552444457, "mean_token_accuracy": 0.9456561833620072, "num_tokens": 88373371.0, "step": 5490 }, { "aux_loss": 8.058560371398926, "entropy": 0.20277629159390925, "epoch": 0.005495, "grad_norm": 0.14603985846042633, "learning_rate": 2e-05, "loss": 0.2442614793777466, "mean_token_accuracy": 0.9321949660778046, "num_tokens": 88454172.0, "step": 5495 }, { "aux_loss": 8.060793733596801, "entropy": 0.17903067097067832, "epoch": 0.0055, "grad_norm": 0.14053769409656525, "learning_rate": 2e-05, "loss": 0.216259765625, "mean_token_accuracy": 0.9401715993881226, "num_tokens": 88535183.0, "step": 5500 }, { "aux_loss": 8.071125936508178, "entropy": 0.18102438598871232, "epoch": 0.005505, "grad_norm": 0.13056859374046326, "learning_rate": 2e-05, "loss": 0.2098301887512207, "mean_token_accuracy": 0.9413354009389877, "num_tokens": 88615999.0, "step": 5505 }, { "aux_loss": 8.078808498382568, "entropy": 0.1832273855805397, "epoch": 0.00551, "grad_norm": 0.14732852578163147, "learning_rate": 2e-05, "loss": 0.20819444656372071, "mean_token_accuracy": 0.9419064611196518, "num_tokens": 88696463.0, "step": 5510 }, { "aux_loss": 8.087247800827026, "entropy": 0.1631258063018322, "epoch": 0.005515, "grad_norm": 0.14680707454681396, "learning_rate": 2e-05, "loss": 0.1912326216697693, "mean_token_accuracy": 0.9472010612487793, "num_tokens": 88776951.0, "step": 5515 }, { "aux_loss": 8.078309249877929, "entropy": 0.15659815147519113, "epoch": 0.00552, "grad_norm": 0.15139469504356384, "learning_rate": 2e-05, "loss": 0.19072411060333253, "mean_token_accuracy": 0.9476257890462876, "num_tokens": 88856044.0, "step": 5520 }, { "aux_loss": 8.062022686004639, "entropy": 0.17389807254076003, "epoch": 0.005525, "grad_norm": 0.1451343446969986, "learning_rate": 2e-05, "loss": 0.220885705947876, "mean_token_accuracy": 0.9391647338867187, "num_tokens": 88937315.0, "step": 5525 }, { "aux_loss": 8.06127314567566, "entropy": 0.17330899611115455, "epoch": 0.00553, "grad_norm": 0.1304226815700531, "learning_rate": 2e-05, "loss": 0.21205427646636962, "mean_token_accuracy": 0.941293078660965, "num_tokens": 89018380.0, "step": 5530 }, { "aux_loss": 8.066385984420776, "entropy": 0.17221021950244902, "epoch": 0.005535, "grad_norm": 0.12877008318901062, "learning_rate": 2e-05, "loss": 0.2028797149658203, "mean_token_accuracy": 0.9435760766267777, "num_tokens": 89099215.0, "step": 5535 }, { "aux_loss": 8.074336624145507, "entropy": 0.17517672404646872, "epoch": 0.00554, "grad_norm": 0.13778316974639893, "learning_rate": 2e-05, "loss": 0.19934819936752318, "mean_token_accuracy": 0.9456212908029556, "num_tokens": 89180428.0, "step": 5540 }, { "aux_loss": 8.086762952804566, "entropy": 0.16597272530198098, "epoch": 0.005545, "grad_norm": 0.14513112604618073, "learning_rate": 2e-05, "loss": 0.18906669616699218, "mean_token_accuracy": 0.9467913210391998, "num_tokens": 89260792.0, "step": 5545 }, { "aux_loss": 8.084904623031616, "entropy": 0.15381703563034535, "epoch": 0.00555, "grad_norm": 0.13529625535011292, "learning_rate": 2e-05, "loss": 0.1874503254890442, "mean_token_accuracy": 0.948190101981163, "num_tokens": 89337942.0, "step": 5550 }, { "aux_loss": 8.063801765441895, "entropy": 0.20141154229640962, "epoch": 0.005555, "grad_norm": 0.14477373659610748, "learning_rate": 2e-05, "loss": 0.24707629680633544, "mean_token_accuracy": 0.9326157689094543, "num_tokens": 89418892.0, "step": 5555 }, { "aux_loss": 8.062500095367431, "entropy": 0.1710236206650734, "epoch": 0.00556, "grad_norm": 0.14716032147407532, "learning_rate": 2e-05, "loss": 0.21237616539001464, "mean_token_accuracy": 0.9414898663759231, "num_tokens": 89499950.0, "step": 5560 }, { "aux_loss": 8.071409225463867, "entropy": 0.18398527428507805, "epoch": 0.005565, "grad_norm": 0.12915635108947754, "learning_rate": 2e-05, "loss": 0.2138502597808838, "mean_token_accuracy": 0.9398818194866181, "num_tokens": 89580930.0, "step": 5565 }, { "aux_loss": 8.08089838027954, "entropy": 0.1699889160692692, "epoch": 0.00557, "grad_norm": 0.13302767276763916, "learning_rate": 2e-05, "loss": 0.19393314123153688, "mean_token_accuracy": 0.9458663403987885, "num_tokens": 89661544.0, "step": 5570 }, { "aux_loss": 8.087613248825074, "entropy": 0.15916759930551053, "epoch": 0.005575, "grad_norm": 0.15169700980186462, "learning_rate": 2e-05, "loss": 0.18777084350585938, "mean_token_accuracy": 0.9470723569393158, "num_tokens": 89741791.0, "step": 5575 }, { "aux_loss": 8.083750867843628, "entropy": 0.15333622619509696, "epoch": 0.00558, "grad_norm": 0.13448326289653778, "learning_rate": 2e-05, "loss": 0.18871968984603882, "mean_token_accuracy": 0.9483475059270858, "num_tokens": 89821499.0, "step": 5580 }, { "aux_loss": 8.062133312225342, "entropy": 0.18548016324639321, "epoch": 0.005585, "grad_norm": 0.1459362506866455, "learning_rate": 2e-05, "loss": 0.22562904357910157, "mean_token_accuracy": 0.9373085409402847, "num_tokens": 89902521.0, "step": 5585 }, { "aux_loss": 8.060822057724, "entropy": 0.1857463113963604, "epoch": 0.00559, "grad_norm": 0.1406942456960678, "learning_rate": 2e-05, "loss": 0.21963930130004883, "mean_token_accuracy": 0.9383396595716477, "num_tokens": 89982753.0, "step": 5590 }, { "aux_loss": 8.068700551986694, "entropy": 0.17866287454962732, "epoch": 0.005595, "grad_norm": 0.14183767139911652, "learning_rate": 2e-05, "loss": 0.2091233253479004, "mean_token_accuracy": 0.9427858710289001, "num_tokens": 90063839.0, "step": 5595 }, { "aux_loss": 8.073639488220214, "entropy": 0.1639278568327427, "epoch": 0.0056, "grad_norm": 0.13105636835098267, "learning_rate": 2e-05, "loss": 0.19065216779708863, "mean_token_accuracy": 0.9459737181663513, "num_tokens": 90144830.0, "step": 5600 }, { "aux_loss": 8.083618307113648, "entropy": 0.15334885641932489, "epoch": 0.005605, "grad_norm": 0.1375649869441986, "learning_rate": 2e-05, "loss": 0.17763084173202515, "mean_token_accuracy": 0.9501822859048843, "num_tokens": 90225731.0, "step": 5605 }, { "aux_loss": 8.09196228981018, "entropy": 0.14317901767790317, "epoch": 0.00561, "grad_norm": 0.12069131433963776, "learning_rate": 2e-05, "loss": 0.1715116024017334, "mean_token_accuracy": 0.952927190065384, "num_tokens": 90303347.0, "step": 5610 }, { "aux_loss": 8.061731386184693, "entropy": 0.17649685703217982, "epoch": 0.005615, "grad_norm": 0.1547907143831253, "learning_rate": 2e-05, "loss": 0.2208183526992798, "mean_token_accuracy": 0.9393579095602036, "num_tokens": 90384904.0, "step": 5615 }, { "aux_loss": 8.0631507396698, "entropy": 0.1872194517403841, "epoch": 0.00562, "grad_norm": 0.1439310759305954, "learning_rate": 2e-05, "loss": 0.23037052154541016, "mean_token_accuracy": 0.9356203705072403, "num_tokens": 90465586.0, "step": 5620 }, { "aux_loss": 8.067120122909547, "entropy": 0.18145886287093163, "epoch": 0.005625, "grad_norm": 0.1358509361743927, "learning_rate": 2e-05, "loss": 0.21520378589630126, "mean_token_accuracy": 0.9384305089712143, "num_tokens": 90546069.0, "step": 5625 }, { "aux_loss": 8.075404167175293, "entropy": 0.17724177688360215, "epoch": 0.00563, "grad_norm": 0.13912159204483032, "learning_rate": 2e-05, "loss": 0.19740923643112182, "mean_token_accuracy": 0.9450008779764175, "num_tokens": 90626910.0, "step": 5630 }, { "aux_loss": 8.084629440307618, "entropy": 0.1531679518520832, "epoch": 0.005635, "grad_norm": 0.13781334459781647, "learning_rate": 2e-05, "loss": 0.17628220319747925, "mean_token_accuracy": 0.9514947712421418, "num_tokens": 90707845.0, "step": 5635 }, { "aux_loss": 8.095353937149047, "entropy": 0.14077298939228058, "epoch": 0.00564, "grad_norm": 0.331421434879303, "learning_rate": 2e-05, "loss": 0.17239704132080078, "mean_token_accuracy": 0.9524759769439697, "num_tokens": 90786711.0, "step": 5640 }, { "aux_loss": 8.05805230140686, "entropy": 0.17784008271992208, "epoch": 0.005645, "grad_norm": 0.13844691216945648, "learning_rate": 2e-05, "loss": 0.22189898490905763, "mean_token_accuracy": 0.937601524591446, "num_tokens": 90868301.0, "step": 5645 }, { "aux_loss": 8.064334726333618, "entropy": 0.1882697395980358, "epoch": 0.00565, "grad_norm": 0.13702885806560516, "learning_rate": 2e-05, "loss": 0.23438878059387208, "mean_token_accuracy": 0.9356648206710816, "num_tokens": 90949176.0, "step": 5650 }, { "aux_loss": 8.067155647277833, "entropy": 0.18150743171572686, "epoch": 0.005655, "grad_norm": 0.13390353322029114, "learning_rate": 2e-05, "loss": 0.20990867614746095, "mean_token_accuracy": 0.9414841532707214, "num_tokens": 91029644.0, "step": 5655 }, { "aux_loss": 8.074916362762451, "entropy": 0.1758174940943718, "epoch": 0.00566, "grad_norm": 0.13451914489269257, "learning_rate": 2e-05, "loss": 0.2010176420211792, "mean_token_accuracy": 0.9433561027050018, "num_tokens": 91110401.0, "step": 5660 }, { "aux_loss": 8.082951211929322, "entropy": 0.16548511534929275, "epoch": 0.005665, "grad_norm": 0.14417754113674164, "learning_rate": 2e-05, "loss": 0.18805559873580932, "mean_token_accuracy": 0.9471803724765777, "num_tokens": 91191163.0, "step": 5665 }, { "aux_loss": 8.094138383865356, "entropy": 0.1513815179467201, "epoch": 0.00567, "grad_norm": 0.1468878984451294, "learning_rate": 2e-05, "loss": 0.18069925308227539, "mean_token_accuracy": 0.9499895632266998, "num_tokens": 91269061.0, "step": 5670 }, { "aux_loss": 8.056322288513183, "entropy": 0.17581670098006724, "epoch": 0.005675, "grad_norm": 0.14119933545589447, "learning_rate": 2e-05, "loss": 0.2202775478363037, "mean_token_accuracy": 0.93985455930233, "num_tokens": 91350350.0, "step": 5675 }, { "aux_loss": 8.059354782104492, "entropy": 0.18535528592765332, "epoch": 0.00568, "grad_norm": 0.13150428235530853, "learning_rate": 2e-05, "loss": 0.22885429859161377, "mean_token_accuracy": 0.9363972008228302, "num_tokens": 91431249.0, "step": 5680 }, { "aux_loss": 8.068913793563842, "entropy": 0.18798594176769257, "epoch": 0.005685, "grad_norm": 0.13334661722183228, "learning_rate": 2e-05, "loss": 0.2183297395706177, "mean_token_accuracy": 0.9391392350196839, "num_tokens": 91511768.0, "step": 5685 }, { "aux_loss": 8.073178625106811, "entropy": 0.17933037132024765, "epoch": 0.00569, "grad_norm": 0.1362065076828003, "learning_rate": 2e-05, "loss": 0.2034616470336914, "mean_token_accuracy": 0.9438274651765823, "num_tokens": 91592991.0, "step": 5690 }, { "aux_loss": 8.080089426040649, "entropy": 0.1637831013649702, "epoch": 0.005695, "grad_norm": 0.14167571067810059, "learning_rate": 2e-05, "loss": 0.1888332724571228, "mean_token_accuracy": 0.9474999457597733, "num_tokens": 91673276.0, "step": 5695 }, { "aux_loss": 8.09348554611206, "entropy": 0.14930419959127902, "epoch": 0.0057, "grad_norm": 0.1610335260629654, "learning_rate": 2e-05, "loss": 0.18102054595947265, "mean_token_accuracy": 0.9492920756340026, "num_tokens": 91753593.0, "step": 5700 }, { "aux_loss": 8.054687738418579, "entropy": 0.17351944260299207, "epoch": 0.005705, "grad_norm": 0.15405237674713135, "learning_rate": 2e-05, "loss": 0.2203193187713623, "mean_token_accuracy": 0.9391676157712936, "num_tokens": 91835086.0, "step": 5705 }, { "aux_loss": 8.061115980148315, "entropy": 0.18555759713053704, "epoch": 0.00571, "grad_norm": 0.1384715735912323, "learning_rate": 2e-05, "loss": 0.22710886001586914, "mean_token_accuracy": 0.9366005331277847, "num_tokens": 91916369.0, "step": 5710 }, { "aux_loss": 8.066951417922974, "entropy": 0.19230927899479866, "epoch": 0.005715, "grad_norm": 0.12675443291664124, "learning_rate": 2e-05, "loss": 0.21959903240203857, "mean_token_accuracy": 0.9389223873615264, "num_tokens": 91997062.0, "step": 5715 }, { "aux_loss": 8.07173776626587, "entropy": 0.1709363006055355, "epoch": 0.00572, "grad_norm": 0.13290657103061676, "learning_rate": 2e-05, "loss": 0.19522292613983155, "mean_token_accuracy": 0.9457512766122818, "num_tokens": 92078160.0, "step": 5720 }, { "aux_loss": 8.081733465194702, "entropy": 0.15775464847683907, "epoch": 0.005725, "grad_norm": 0.13461284339427948, "learning_rate": 2e-05, "loss": 0.18419874906539918, "mean_token_accuracy": 0.9491376131772995, "num_tokens": 92158400.0, "step": 5725 }, { "aux_loss": 8.09744577407837, "entropy": 0.15009067244827748, "epoch": 0.00573, "grad_norm": 0.1676807850599289, "learning_rate": 2e-05, "loss": 0.1772789478302002, "mean_token_accuracy": 0.9510623186826705, "num_tokens": 92239268.0, "step": 5730 }, { "aux_loss": 8.061673212051392, "entropy": 0.15475926585495473, "epoch": 0.005735, "grad_norm": 0.1452476531267166, "learning_rate": 2e-05, "loss": 0.193684720993042, "mean_token_accuracy": 0.946747025847435, "num_tokens": 92320198.0, "step": 5735 }, { "aux_loss": 8.060331678390503, "entropy": 0.17048021629452706, "epoch": 0.00574, "grad_norm": 0.1505119800567627, "learning_rate": 2e-05, "loss": 0.21258339881896973, "mean_token_accuracy": 0.942168366909027, "num_tokens": 92401220.0, "step": 5740 }, { "aux_loss": 8.064356708526612, "entropy": 0.17428167089819907, "epoch": 0.005745, "grad_norm": 0.13418808579444885, "learning_rate": 2e-05, "loss": 0.21015555858612062, "mean_token_accuracy": 0.9408140420913697, "num_tokens": 92482191.0, "step": 5745 }, { "aux_loss": 8.073054027557372, "entropy": 0.1741316296160221, "epoch": 0.00575, "grad_norm": 0.1389142870903015, "learning_rate": 2e-05, "loss": 0.20202784538269042, "mean_token_accuracy": 0.9437748968601227, "num_tokens": 92562836.0, "step": 5750 }, { "aux_loss": 8.080522537231445, "entropy": 0.1635540872812271, "epoch": 0.005755, "grad_norm": 0.14265964925289154, "learning_rate": 2e-05, "loss": 0.18728913068771363, "mean_token_accuracy": 0.9472408413887023, "num_tokens": 92643436.0, "step": 5755 }, { "aux_loss": 8.092672872543336, "entropy": 0.14982328303158282, "epoch": 0.00576, "grad_norm": 0.14974676072597504, "learning_rate": 2e-05, "loss": 0.173487389087677, "mean_token_accuracy": 0.9515981703996659, "num_tokens": 92723306.0, "step": 5760 }, { "aux_loss": 8.063954257965088, "entropy": 0.16390583664178848, "epoch": 0.005765, "grad_norm": 0.1341383159160614, "learning_rate": 2e-05, "loss": 0.2032714605331421, "mean_token_accuracy": 0.9443684726953506, "num_tokens": 92802842.0, "step": 5765 }, { "aux_loss": 8.06337742805481, "entropy": 0.1663944326341152, "epoch": 0.00577, "grad_norm": 0.14594364166259766, "learning_rate": 2e-05, "loss": 0.20972006320953368, "mean_token_accuracy": 0.9422449350357056, "num_tokens": 92883987.0, "step": 5770 }, { "aux_loss": 8.06315712928772, "entropy": 0.17991503998637198, "epoch": 0.005775, "grad_norm": 0.15171870589256287, "learning_rate": 2e-05, "loss": 0.21673328876495362, "mean_token_accuracy": 0.9400419503450393, "num_tokens": 92965089.0, "step": 5775 }, { "aux_loss": 8.068653440475464, "entropy": 0.1760217808187008, "epoch": 0.00578, "grad_norm": 0.13597488403320312, "learning_rate": 2e-05, "loss": 0.20551862716674804, "mean_token_accuracy": 0.9422009438276291, "num_tokens": 93045989.0, "step": 5780 }, { "aux_loss": 8.07674880027771, "entropy": 0.1621110685169697, "epoch": 0.005785, "grad_norm": 0.13650666177272797, "learning_rate": 2e-05, "loss": 0.19024025201797484, "mean_token_accuracy": 0.9472737580537796, "num_tokens": 93127019.0, "step": 5785 }, { "aux_loss": 8.089992189407349, "entropy": 0.15284370705485345, "epoch": 0.00579, "grad_norm": 0.14131860435009003, "learning_rate": 2e-05, "loss": 0.17998089790344238, "mean_token_accuracy": 0.9499067604541779, "num_tokens": 93207117.0, "step": 5790 }, { "aux_loss": 8.072627401351928, "entropy": 0.16572054252028465, "epoch": 0.005795, "grad_norm": 0.13508719205856323, "learning_rate": 2e-05, "loss": 0.197525954246521, "mean_token_accuracy": 0.9458871275186539, "num_tokens": 93287901.0, "step": 5795 }, { "aux_loss": 8.063549137115478, "entropy": 0.16287589445710182, "epoch": 0.0058, "grad_norm": 0.1373695582151413, "learning_rate": 2e-05, "loss": 0.204803991317749, "mean_token_accuracy": 0.9441636741161347, "num_tokens": 93368746.0, "step": 5800 }, { "aux_loss": 8.06470890045166, "entropy": 0.17902035936713218, "epoch": 0.005805, "grad_norm": 0.14767873287200928, "learning_rate": 2e-05, "loss": 0.22090959548950195, "mean_token_accuracy": 0.9376872271299362, "num_tokens": 93449568.0, "step": 5805 }, { "aux_loss": 8.069039487838745, "entropy": 0.1771714173257351, "epoch": 0.00581, "grad_norm": 0.13491499423980713, "learning_rate": 2e-05, "loss": 0.20453858375549316, "mean_token_accuracy": 0.9425706744194031, "num_tokens": 93530412.0, "step": 5810 }, { "aux_loss": 8.078837060928345, "entropy": 0.17171581760048865, "epoch": 0.005815, "grad_norm": 0.14088688790798187, "learning_rate": 2e-05, "loss": 0.19795360565185546, "mean_token_accuracy": 0.9439451515674591, "num_tokens": 93611214.0, "step": 5815 }, { "aux_loss": 8.086272764205933, "entropy": 0.15185713097453118, "epoch": 0.00582, "grad_norm": 0.14482736587524414, "learning_rate": 2e-05, "loss": 0.1787477970123291, "mean_token_accuracy": 0.9499908089637756, "num_tokens": 93691899.0, "step": 5820 }, { "aux_loss": 8.085255575180053, "entropy": 0.1480364143848419, "epoch": 0.005825, "grad_norm": 0.1324480175971985, "learning_rate": 2e-05, "loss": 0.18043410778045654, "mean_token_accuracy": 0.9507531315088272, "num_tokens": 93770107.0, "step": 5825 }, { "aux_loss": 8.055831813812256, "entropy": 0.183095084130764, "epoch": 0.00583, "grad_norm": 0.15179389715194702, "learning_rate": 2e-05, "loss": 0.2280038833618164, "mean_token_accuracy": 0.9371652454137802, "num_tokens": 93851643.0, "step": 5830 }, { "aux_loss": 8.063481044769286, "entropy": 0.18543468043208122, "epoch": 0.005835, "grad_norm": 0.12911377847194672, "learning_rate": 2e-05, "loss": 0.21943447589874268, "mean_token_accuracy": 0.938288950920105, "num_tokens": 93932478.0, "step": 5835 }, { "aux_loss": 8.065958642959595, "entropy": 0.17744500562548637, "epoch": 0.00584, "grad_norm": 0.1379033476114273, "learning_rate": 2e-05, "loss": 0.2041388988494873, "mean_token_accuracy": 0.9421236902475357, "num_tokens": 94013130.0, "step": 5840 }, { "aux_loss": 8.072461032867432, "entropy": 0.1693294659256935, "epoch": 0.005845, "grad_norm": 0.14475242793560028, "learning_rate": 2e-05, "loss": 0.19758639335632325, "mean_token_accuracy": 0.9444235742092133, "num_tokens": 94093276.0, "step": 5845 }, { "aux_loss": 8.082824802398681, "entropy": 0.15156857818365096, "epoch": 0.00585, "grad_norm": 0.14044874906539917, "learning_rate": 2e-05, "loss": 0.17861695289611818, "mean_token_accuracy": 0.9495580226182938, "num_tokens": 94173881.0, "step": 5850 }, { "aux_loss": 8.091250610351562, "entropy": 0.14027350395917892, "epoch": 0.005855, "grad_norm": 0.11501962691545486, "learning_rate": 2e-05, "loss": 0.1679123282432556, "mean_token_accuracy": 0.9536539733409881, "num_tokens": 94252994.0, "step": 5855 }, { "aux_loss": 8.055892133712769, "entropy": 0.17486198730766772, "epoch": 0.00586, "grad_norm": 0.14729391038417816, "learning_rate": 2e-05, "loss": 0.21825242042541504, "mean_token_accuracy": 0.938835597038269, "num_tokens": 94334247.0, "step": 5860 }, { "aux_loss": 8.06143307685852, "entropy": 0.1837987508624792, "epoch": 0.005865, "grad_norm": 0.12966404855251312, "learning_rate": 2e-05, "loss": 0.22734589576721193, "mean_token_accuracy": 0.9369234770536423, "num_tokens": 94415628.0, "step": 5865 }, { "aux_loss": 8.063664722442628, "entropy": 0.1713401522487402, "epoch": 0.00587, "grad_norm": 0.13503432273864746, "learning_rate": 2e-05, "loss": 0.20385169982910156, "mean_token_accuracy": 0.9436463266611099, "num_tokens": 94496544.0, "step": 5870 }, { "aux_loss": 8.070697546005249, "entropy": 0.1775601290166378, "epoch": 0.005875, "grad_norm": 0.12884454429149628, "learning_rate": 2e-05, "loss": 0.20616636276245118, "mean_token_accuracy": 0.9421791166067124, "num_tokens": 94577478.0, "step": 5875 }, { "aux_loss": 8.081576299667358, "entropy": 0.1703704960644245, "epoch": 0.00588, "grad_norm": 0.14574073255062103, "learning_rate": 2e-05, "loss": 0.19270837306976318, "mean_token_accuracy": 0.9460537075996399, "num_tokens": 94657487.0, "step": 5880 }, { "aux_loss": 8.097192907333374, "entropy": 0.1473420437425375, "epoch": 0.005885, "grad_norm": 0.17822988331317902, "learning_rate": 2e-05, "loss": 0.17440905570983886, "mean_token_accuracy": 0.9511974841356278, "num_tokens": 94735178.0, "step": 5885 }, { "aux_loss": 8.058767366409302, "entropy": 0.1708623431622982, "epoch": 0.00589, "grad_norm": 0.13845281302928925, "learning_rate": 2e-05, "loss": 0.21285016536712648, "mean_token_accuracy": 0.9420379728078843, "num_tokens": 94816378.0, "step": 5890 }, { "aux_loss": 8.061467742919922, "entropy": 0.18202443197369575, "epoch": 0.005895, "grad_norm": 0.13410122692584991, "learning_rate": 2e-05, "loss": 0.21937117576599122, "mean_token_accuracy": 0.9389735221862793, "num_tokens": 94897959.0, "step": 5895 }, { "aux_loss": 8.063257217407227, "entropy": 0.17064057104289532, "epoch": 0.0059, "grad_norm": 0.1352560818195343, "learning_rate": 2e-05, "loss": 0.20185585021972657, "mean_token_accuracy": 0.9441125452518463, "num_tokens": 94979042.0, "step": 5900 }, { "aux_loss": 8.072481775283814, "entropy": 0.16953162774443625, "epoch": 0.005905, "grad_norm": 0.13705940544605255, "learning_rate": 2e-05, "loss": 0.19920376539230347, "mean_token_accuracy": 0.9433676153421402, "num_tokens": 95059868.0, "step": 5905 }, { "aux_loss": 8.078711700439452, "entropy": 0.15986860617995263, "epoch": 0.00591, "grad_norm": 0.14904817938804626, "learning_rate": 2e-05, "loss": 0.19004034996032715, "mean_token_accuracy": 0.9468602746725082, "num_tokens": 95140070.0, "step": 5910 }, { "aux_loss": 8.092806434631347, "entropy": 0.1493261508643627, "epoch": 0.005915, "grad_norm": 0.14852458238601685, "learning_rate": 2e-05, "loss": 0.17741813659667968, "mean_token_accuracy": 0.9513360589742661, "num_tokens": 95220308.0, "step": 5915 }, { "aux_loss": 8.065175008773803, "entropy": 0.17146045416593553, "epoch": 0.00592, "grad_norm": 0.1456707864999771, "learning_rate": 2e-05, "loss": 0.2067434310913086, "mean_token_accuracy": 0.9436594158411026, "num_tokens": 95299270.0, "step": 5920 }, { "aux_loss": 8.06174168586731, "entropy": 0.1672132160514593, "epoch": 0.005925, "grad_norm": 0.1400015652179718, "learning_rate": 2e-05, "loss": 0.20917375087738038, "mean_token_accuracy": 0.9424566030502319, "num_tokens": 95380537.0, "step": 5925 }, { "aux_loss": 8.066592931747437, "entropy": 0.17035450227558613, "epoch": 0.00593, "grad_norm": 0.13348719477653503, "learning_rate": 2e-05, "loss": 0.20101003646850585, "mean_token_accuracy": 0.9435734242200852, "num_tokens": 95461363.0, "step": 5930 }, { "aux_loss": 8.072800540924073, "entropy": 0.17302406653761865, "epoch": 0.005935, "grad_norm": 0.1358296424150467, "learning_rate": 2e-05, "loss": 0.2002587080001831, "mean_token_accuracy": 0.9450927078723907, "num_tokens": 95542166.0, "step": 5935 }, { "aux_loss": 8.080530643463135, "entropy": 0.1578762486577034, "epoch": 0.00594, "grad_norm": 0.13561034202575684, "learning_rate": 2e-05, "loss": 0.18470389842987062, "mean_token_accuracy": 0.9497940570116044, "num_tokens": 95622653.0, "step": 5940 }, { "aux_loss": 8.091456985473632, "entropy": 0.15263076946139337, "epoch": 0.005945, "grad_norm": 0.1546875685453415, "learning_rate": 2e-05, "loss": 0.18000965118408202, "mean_token_accuracy": 0.9487313568592072, "num_tokens": 95703334.0, "step": 5945 }, { "aux_loss": 8.067452478408814, "entropy": 0.16000871136784553, "epoch": 0.00595, "grad_norm": 0.14300614595413208, "learning_rate": 2e-05, "loss": 0.1960815668106079, "mean_token_accuracy": 0.9453659981489182, "num_tokens": 95780602.0, "step": 5950 }, { "aux_loss": 8.062563467025758, "entropy": 0.18366865627467632, "epoch": 0.005955, "grad_norm": 0.1349765509366989, "learning_rate": 2e-05, "loss": 0.224930477142334, "mean_token_accuracy": 0.9381143927574158, "num_tokens": 95861860.0, "step": 5955 }, { "aux_loss": 8.061886882781982, "entropy": 0.17511266022920607, "epoch": 0.00596, "grad_norm": 0.12589815258979797, "learning_rate": 2e-05, "loss": 0.20954318046569825, "mean_token_accuracy": 0.9415994316339493, "num_tokens": 95943070.0, "step": 5960 }, { "aux_loss": 8.068562984466553, "entropy": 0.16178049817681311, "epoch": 0.005965, "grad_norm": 0.12789005041122437, "learning_rate": 2e-05, "loss": 0.1920637607574463, "mean_token_accuracy": 0.9466611444950104, "num_tokens": 96024218.0, "step": 5965 }, { "aux_loss": 8.07816834449768, "entropy": 0.15705137699842453, "epoch": 0.00597, "grad_norm": 0.13880205154418945, "learning_rate": 2e-05, "loss": 0.1792244791984558, "mean_token_accuracy": 0.9492392539978027, "num_tokens": 96104912.0, "step": 5970 }, { "aux_loss": 8.090532302856445, "entropy": 0.1515044815838337, "epoch": 0.005975, "grad_norm": 0.14545196294784546, "learning_rate": 2e-05, "loss": 0.17885712385177613, "mean_token_accuracy": 0.9505871325731278, "num_tokens": 96185410.0, "step": 5975 }, { "aux_loss": 8.072143363952637, "entropy": 0.14746857099235058, "epoch": 0.00598, "grad_norm": 0.12406041473150253, "learning_rate": 2e-05, "loss": 0.18974361419677735, "mean_token_accuracy": 0.9486129403114318, "num_tokens": 96262450.0, "step": 5980 }, { "aux_loss": 8.053602933883667, "entropy": 0.18247710466384887, "epoch": 0.005985, "grad_norm": 0.12539565563201904, "learning_rate": 2e-05, "loss": 0.22521460056304932, "mean_token_accuracy": 0.9376156717538834, "num_tokens": 96342965.0, "step": 5985 }, { "aux_loss": 8.061638069152831, "entropy": 0.1799737609922886, "epoch": 0.00599, "grad_norm": 0.13107004761695862, "learning_rate": 2e-05, "loss": 0.2145768880844116, "mean_token_accuracy": 0.9398253291845322, "num_tokens": 96424174.0, "step": 5990 }, { "aux_loss": 8.06684627532959, "entropy": 0.17635875716805458, "epoch": 0.005995, "grad_norm": 0.13319900631904602, "learning_rate": 2e-05, "loss": 0.20265119075775145, "mean_token_accuracy": 0.9436583459377289, "num_tokens": 96505120.0, "step": 5995 }, { "aux_loss": 8.07758674621582, "entropy": 0.17258130609989167, "epoch": 0.006, "grad_norm": 0.12928390502929688, "learning_rate": 2e-05, "loss": 0.19766595363616943, "mean_token_accuracy": 0.9446023225784301, "num_tokens": 96586037.0, "step": 6000 }, { "aux_loss": 8.08571252822876, "entropy": 0.15081175677478315, "epoch": 0.006005, "grad_norm": 0.1503567397594452, "learning_rate": 2e-05, "loss": 0.17959368228912354, "mean_token_accuracy": 0.9497321128845215, "num_tokens": 96666252.0, "step": 6005 }, { "aux_loss": 8.07593240737915, "entropy": 0.14692696668207644, "epoch": 0.00601, "grad_norm": 0.1549401730298996, "learning_rate": 2e-05, "loss": 0.18516803979873658, "mean_token_accuracy": 0.9497349351644516, "num_tokens": 96746963.0, "step": 6010 }, { "aux_loss": 8.060930681228637, "entropy": 0.1806217808276415, "epoch": 0.006015, "grad_norm": 0.13608407974243164, "learning_rate": 2e-05, "loss": 0.2211301803588867, "mean_token_accuracy": 0.937987893819809, "num_tokens": 96827662.0, "step": 6015 }, { "aux_loss": 8.063177013397217, "entropy": 0.17464426308870315, "epoch": 0.00602, "grad_norm": 0.13371874392032623, "learning_rate": 2e-05, "loss": 0.20847699642181397, "mean_token_accuracy": 0.9415706694126129, "num_tokens": 96908701.0, "step": 6020 }, { "aux_loss": 8.068975162506103, "entropy": 0.1864542119204998, "epoch": 0.006025, "grad_norm": 0.1279734969139099, "learning_rate": 2e-05, "loss": 0.2206197500228882, "mean_token_accuracy": 0.9386757463216782, "num_tokens": 96989269.0, "step": 6025 }, { "aux_loss": 8.07884931564331, "entropy": 0.17818933054804803, "epoch": 0.00603, "grad_norm": 0.13667216897010803, "learning_rate": 2e-05, "loss": 0.20026471614837646, "mean_token_accuracy": 0.9444550067186356, "num_tokens": 97069757.0, "step": 6030 }, { "aux_loss": 8.084789896011353, "entropy": 0.15738881714642047, "epoch": 0.006035, "grad_norm": 0.13657960295677185, "learning_rate": 2e-05, "loss": 0.1845165014266968, "mean_token_accuracy": 0.9477501511573792, "num_tokens": 97149843.0, "step": 6035 }, { "aux_loss": 8.077795934677123, "entropy": 0.1544258899986744, "epoch": 0.00604, "grad_norm": 0.14422611892223358, "learning_rate": 2e-05, "loss": 0.18736767768859863, "mean_token_accuracy": 0.9476096302270889, "num_tokens": 97227475.0, "step": 6040 }, { "aux_loss": 8.064987087249756, "entropy": 0.16860076040029526, "epoch": 0.006045, "grad_norm": 0.15342532098293304, "learning_rate": 2e-05, "loss": 0.2130617618560791, "mean_token_accuracy": 0.9399748772382737, "num_tokens": 97308306.0, "step": 6045 }, { "aux_loss": 8.060701751708985, "entropy": 0.1847734682261944, "epoch": 0.00605, "grad_norm": 0.1469544619321823, "learning_rate": 2e-05, "loss": 0.21930246353149413, "mean_token_accuracy": 0.9377886474132537, "num_tokens": 97389210.0, "step": 6050 }, { "aux_loss": 8.066556262969971, "entropy": 0.1651120275259018, "epoch": 0.006055, "grad_norm": 0.14201335608959198, "learning_rate": 2e-05, "loss": 0.19273279905319213, "mean_token_accuracy": 0.9464361488819122, "num_tokens": 97470207.0, "step": 6055 }, { "aux_loss": 8.075764894485474, "entropy": 0.1742984712123871, "epoch": 0.00606, "grad_norm": 0.14166109263896942, "learning_rate": 2e-05, "loss": 0.20348267555236815, "mean_token_accuracy": 0.9441876828670501, "num_tokens": 97550879.0, "step": 6060 }, { "aux_loss": 8.080997848510743, "entropy": 0.1588553436100483, "epoch": 0.006065, "grad_norm": 0.13352887332439423, "learning_rate": 2e-05, "loss": 0.18576077222824097, "mean_token_accuracy": 0.9482071310281753, "num_tokens": 97631362.0, "step": 6065 }, { "aux_loss": 8.08425498008728, "entropy": 0.14988943040370942, "epoch": 0.00607, "grad_norm": 0.132766455411911, "learning_rate": 2e-05, "loss": 0.1825609564781189, "mean_token_accuracy": 0.9494982123374939, "num_tokens": 97709729.0, "step": 6070 }, { "aux_loss": 8.055536222457885, "entropy": 0.1706943243741989, "epoch": 0.006075, "grad_norm": 0.14236465096473694, "learning_rate": 2e-05, "loss": 0.21214184761047364, "mean_token_accuracy": 0.9419941782951355, "num_tokens": 97791098.0, "step": 6075 }, { "aux_loss": 8.058393096923828, "entropy": 0.1728857483714819, "epoch": 0.00608, "grad_norm": 0.12840798497200012, "learning_rate": 2e-05, "loss": 0.2110762357711792, "mean_token_accuracy": 0.9423777967691421, "num_tokens": 97871896.0, "step": 6080 }, { "aux_loss": 8.065342998504638, "entropy": 0.17374960109591484, "epoch": 0.006085, "grad_norm": 0.13968020677566528, "learning_rate": 2e-05, "loss": 0.20638532638549806, "mean_token_accuracy": 0.9422299891710282, "num_tokens": 97952649.0, "step": 6085 }, { "aux_loss": 8.07047872543335, "entropy": 0.17087947130203246, "epoch": 0.00609, "grad_norm": 0.13061648607254028, "learning_rate": 2e-05, "loss": 0.19820499420166016, "mean_token_accuracy": 0.9450456500053406, "num_tokens": 98033617.0, "step": 6090 }, { "aux_loss": 8.081618547439575, "entropy": 0.16440374180674552, "epoch": 0.006095, "grad_norm": 0.13969780504703522, "learning_rate": 2e-05, "loss": 0.1900782108306885, "mean_token_accuracy": 0.9466186791658402, "num_tokens": 98113780.0, "step": 6095 }, { "aux_loss": 8.088514423370361, "entropy": 0.14573372192680836, "epoch": 0.0061, "grad_norm": 0.13671861588954926, "learning_rate": 2e-05, "loss": 0.17280199527740478, "mean_token_accuracy": 0.9539888024330139, "num_tokens": 98190540.0, "step": 6100 }, { "aux_loss": 8.058065843582153, "entropy": 0.17734894305467605, "epoch": 0.006105, "grad_norm": 0.14421439170837402, "learning_rate": 2e-05, "loss": 0.22198522090911865, "mean_token_accuracy": 0.9395839691162109, "num_tokens": 98271598.0, "step": 6105 }, { "aux_loss": 8.06196870803833, "entropy": 0.17928044497966766, "epoch": 0.00611, "grad_norm": 0.13943056762218475, "learning_rate": 2e-05, "loss": 0.22034146785736083, "mean_token_accuracy": 0.9395325124263764, "num_tokens": 98352898.0, "step": 6110 }, { "aux_loss": 8.065202140808106, "entropy": 0.17982555776834488, "epoch": 0.006115, "grad_norm": 0.14371375739574432, "learning_rate": 2e-05, "loss": 0.21403896808624268, "mean_token_accuracy": 0.9406698137521744, "num_tokens": 98433784.0, "step": 6115 }, { "aux_loss": 8.067698335647583, "entropy": 0.173493380099535, "epoch": 0.00612, "grad_norm": 0.14029116928577423, "learning_rate": 2e-05, "loss": 0.19781092405319214, "mean_token_accuracy": 0.9440387845039367, "num_tokens": 98514535.0, "step": 6120 }, { "aux_loss": 8.077132511138917, "entropy": 0.16261643767356873, "epoch": 0.006125, "grad_norm": 0.1420287787914276, "learning_rate": 2e-05, "loss": 0.18982197046279908, "mean_token_accuracy": 0.947833177447319, "num_tokens": 98594371.0, "step": 6125 }, { "aux_loss": 8.093416452407837, "entropy": 0.15497832894325256, "epoch": 0.00613, "grad_norm": 0.16165927052497864, "learning_rate": 2e-05, "loss": 0.17958693504333495, "mean_token_accuracy": 0.9492352396249771, "num_tokens": 98673792.0, "step": 6130 }, { "aux_loss": 8.055329036712646, "entropy": 0.1695503953844309, "epoch": 0.006135, "grad_norm": 0.1473519653081894, "learning_rate": 2e-05, "loss": 0.2120358943939209, "mean_token_accuracy": 0.9426074802875519, "num_tokens": 98754618.0, "step": 6135 }, { "aux_loss": 8.061479568481445, "entropy": 0.1997602991759777, "epoch": 0.00614, "grad_norm": 0.13871872425079346, "learning_rate": 2e-05, "loss": 0.24574472904205322, "mean_token_accuracy": 0.9321439087390899, "num_tokens": 98835844.0, "step": 6140 }, { "aux_loss": 8.059854507446289, "entropy": 0.19934454634785653, "epoch": 0.006145, "grad_norm": 0.13629339635372162, "learning_rate": 2e-05, "loss": 0.22751383781433104, "mean_token_accuracy": 0.936464735865593, "num_tokens": 98916650.0, "step": 6145 }, { "aux_loss": 8.067006635665894, "entropy": 0.18546929582953453, "epoch": 0.00615, "grad_norm": 0.1268135905265808, "learning_rate": 2e-05, "loss": 0.2111495018005371, "mean_token_accuracy": 0.9414886891841888, "num_tokens": 98997540.0, "step": 6150 }, { "aux_loss": 8.078183698654176, "entropy": 0.16131289191544057, "epoch": 0.006155, "grad_norm": 0.1337651014328003, "learning_rate": 2e-05, "loss": 0.18758971691131593, "mean_token_accuracy": 0.9483745336532593, "num_tokens": 99077962.0, "step": 6155 }, { "aux_loss": 8.089561986923218, "entropy": 0.1473751597106457, "epoch": 0.00616, "grad_norm": 0.146542489528656, "learning_rate": 2e-05, "loss": 0.17467809915542604, "mean_token_accuracy": 0.9505683511495591, "num_tokens": 99158018.0, "step": 6160 }, { "aux_loss": 8.063340997695922, "entropy": 0.16819728650152682, "epoch": 0.006165, "grad_norm": 0.13880492746829987, "learning_rate": 2e-05, "loss": 0.20851426124572753, "mean_token_accuracy": 0.9430805325508118, "num_tokens": 99238930.0, "step": 6165 }, { "aux_loss": 8.057694911956787, "entropy": 0.18912734240293502, "epoch": 0.00617, "grad_norm": 0.134108304977417, "learning_rate": 2e-05, "loss": 0.23240768909454346, "mean_token_accuracy": 0.9356161594390869, "num_tokens": 99319755.0, "step": 6170 }, { "aux_loss": 8.05859932899475, "entropy": 0.18864412009716033, "epoch": 0.006175, "grad_norm": 0.12981119751930237, "learning_rate": 2e-05, "loss": 0.2230241060256958, "mean_token_accuracy": 0.9389087319374084, "num_tokens": 99400974.0, "step": 6175 }, { "aux_loss": 8.06623592376709, "entropy": 0.1835307776927948, "epoch": 0.00618, "grad_norm": 0.14064079523086548, "learning_rate": 2e-05, "loss": 0.212884521484375, "mean_token_accuracy": 0.9408647507429123, "num_tokens": 99481987.0, "step": 6180 }, { "aux_loss": 8.072245693206787, "entropy": 0.15626964047551156, "epoch": 0.006185, "grad_norm": 0.13499991595745087, "learning_rate": 2e-05, "loss": 0.18445948362350464, "mean_token_accuracy": 0.9477288573980331, "num_tokens": 99562468.0, "step": 6185 }, { "aux_loss": 8.084248924255371, "entropy": 0.15240877121686935, "epoch": 0.00619, "grad_norm": 0.13890454173088074, "learning_rate": 2e-05, "loss": 0.1771385431289673, "mean_token_accuracy": 0.9499257773160934, "num_tokens": 99642977.0, "step": 6190 }, { "aux_loss": 8.074431467056275, "entropy": 0.167390775680542, "epoch": 0.006195, "grad_norm": 0.12660688161849976, "learning_rate": 2e-05, "loss": 0.19968509674072266, "mean_token_accuracy": 0.9451132565736771, "num_tokens": 99721646.0, "step": 6195 }, { "aux_loss": 8.059612607955932, "entropy": 0.18690274953842162, "epoch": 0.0062, "grad_norm": 0.13673487305641174, "learning_rate": 2e-05, "loss": 0.2261310338973999, "mean_token_accuracy": 0.9381637156009675, "num_tokens": 99802848.0, "step": 6200 }, { "aux_loss": 8.060397386550903, "entropy": 0.1755303718149662, "epoch": 0.006205, "grad_norm": 0.14175184071063995, "learning_rate": 2e-05, "loss": 0.216101336479187, "mean_token_accuracy": 0.9398821413516998, "num_tokens": 99883821.0, "step": 6205 }, { "aux_loss": 8.070406627655029, "entropy": 0.17731958478689194, "epoch": 0.00621, "grad_norm": 0.13555993139743805, "learning_rate": 2e-05, "loss": 0.20861904621124266, "mean_token_accuracy": 0.9407115608453751, "num_tokens": 99964762.0, "step": 6210 }, { "aux_loss": 8.078168630599976, "entropy": 0.16126366034150125, "epoch": 0.006215, "grad_norm": 0.12997405230998993, "learning_rate": 2e-05, "loss": 0.18080706596374513, "mean_token_accuracy": 0.9492483675479889, "num_tokens": 100045203.0, "step": 6215 }, { "aux_loss": 8.088132619857788, "entropy": 0.14728614166378975, "epoch": 0.00622, "grad_norm": 0.14376845955848694, "learning_rate": 2e-05, "loss": 0.17079941034317017, "mean_token_accuracy": 0.9525896340608597, "num_tokens": 100125157.0, "step": 6220 }, { "aux_loss": 8.072662687301635, "entropy": 0.15450909920036793, "epoch": 0.006225, "grad_norm": 0.1307871788740158, "learning_rate": 2e-05, "loss": 0.19495983123779298, "mean_token_accuracy": 0.9467739045619965, "num_tokens": 100206074.0, "step": 6225 }, { "aux_loss": 8.061028575897216, "entropy": 0.1787221372127533, "epoch": 0.00623, "grad_norm": 0.14120079576969147, "learning_rate": 2e-05, "loss": 0.22198593616485596, "mean_token_accuracy": 0.9384955644607544, "num_tokens": 100286699.0, "step": 6230 }, { "aux_loss": 8.06080503463745, "entropy": 0.1750737138092518, "epoch": 0.006235, "grad_norm": 0.13577698171138763, "learning_rate": 2e-05, "loss": 0.21695075035095215, "mean_token_accuracy": 0.9401729851961136, "num_tokens": 100367634.0, "step": 6235 }, { "aux_loss": 8.067031860351562, "entropy": 0.16431664153933526, "epoch": 0.00624, "grad_norm": 0.12588439881801605, "learning_rate": 2e-05, "loss": 0.19172556400299073, "mean_token_accuracy": 0.9468090206384658, "num_tokens": 100448579.0, "step": 6240 }, { "aux_loss": 8.074049615859986, "entropy": 0.1671641945838928, "epoch": 0.006245, "grad_norm": 0.1321130394935608, "learning_rate": 2e-05, "loss": 0.19521715641021728, "mean_token_accuracy": 0.9454416334629059, "num_tokens": 100529476.0, "step": 6245 }, { "aux_loss": 8.084184312820435, "entropy": 0.15946810208261014, "epoch": 0.00625, "grad_norm": 0.1479744017124176, "learning_rate": 2e-05, "loss": 0.1840827465057373, "mean_token_accuracy": 0.9490292429924011, "num_tokens": 100610102.0, "step": 6250 }, { "aux_loss": 8.077231216430665, "entropy": 0.14674910046160222, "epoch": 0.006255, "grad_norm": 0.12755580246448517, "learning_rate": 2e-05, "loss": 0.17703778743743898, "mean_token_accuracy": 0.9516955465078354, "num_tokens": 100688691.0, "step": 6255 }, { "aux_loss": 8.059980821609496, "entropy": 0.17733871527016162, "epoch": 0.00626, "grad_norm": 0.14013931155204773, "learning_rate": 2e-05, "loss": 0.2219689130783081, "mean_token_accuracy": 0.938349649310112, "num_tokens": 100769628.0, "step": 6260 }, { "aux_loss": 8.063177871704102, "entropy": 0.1751440867781639, "epoch": 0.006265, "grad_norm": 0.14352500438690186, "learning_rate": 2e-05, "loss": 0.21170456409454347, "mean_token_accuracy": 0.9407127380371094, "num_tokens": 100850505.0, "step": 6265 }, { "aux_loss": 8.065592050552368, "entropy": 0.18136587142944335, "epoch": 0.00627, "grad_norm": 0.13016898930072784, "learning_rate": 2e-05, "loss": 0.21362464427947997, "mean_token_accuracy": 0.9404471904039383, "num_tokens": 100931559.0, "step": 6270 }, { "aux_loss": 8.071725225448608, "entropy": 0.1680338393896818, "epoch": 0.006275, "grad_norm": 0.13893038034439087, "learning_rate": 2e-05, "loss": 0.19443680047988893, "mean_token_accuracy": 0.9450006574392319, "num_tokens": 101012279.0, "step": 6275 }, { "aux_loss": 8.082179164886474, "entropy": 0.15971801355481147, "epoch": 0.00628, "grad_norm": 0.1487090140581131, "learning_rate": 2e-05, "loss": 0.18496278524398804, "mean_token_accuracy": 0.9478775680065155, "num_tokens": 101093008.0, "step": 6280 }, { "aux_loss": 8.083986186981202, "entropy": 0.16268995590507984, "epoch": 0.006285, "grad_norm": 0.13213466107845306, "learning_rate": 2e-05, "loss": 0.1961376667022705, "mean_token_accuracy": 0.9464788019657135, "num_tokens": 101170521.0, "step": 6285 }, { "aux_loss": 8.059894895553589, "entropy": 0.17033642530441284, "epoch": 0.00629, "grad_norm": 0.13566872477531433, "learning_rate": 2e-05, "loss": 0.21158432960510254, "mean_token_accuracy": 0.9407631993293762, "num_tokens": 101251626.0, "step": 6290 }, { "aux_loss": 8.059821033477784, "entropy": 0.17324242703616619, "epoch": 0.006295, "grad_norm": 0.14442917704582214, "learning_rate": 2e-05, "loss": 0.21338980197906493, "mean_token_accuracy": 0.9399789214134217, "num_tokens": 101332185.0, "step": 6295 }, { "aux_loss": 8.064768934249878, "entropy": 0.18178710490465164, "epoch": 0.0063, "grad_norm": 0.14033494889736176, "learning_rate": 2e-05, "loss": 0.21303117275238037, "mean_token_accuracy": 0.9392391294240952, "num_tokens": 101413044.0, "step": 6300 }, { "aux_loss": 8.07487931251526, "entropy": 0.1670963678508997, "epoch": 0.006305, "grad_norm": 0.13624851405620575, "learning_rate": 2e-05, "loss": 0.19358983039855956, "mean_token_accuracy": 0.9451935350894928, "num_tokens": 101493841.0, "step": 6305 }, { "aux_loss": 8.080358409881592, "entropy": 0.15010572001338005, "epoch": 0.00631, "grad_norm": 0.13583829998970032, "learning_rate": 2e-05, "loss": 0.17737114429473877, "mean_token_accuracy": 0.9494899690151215, "num_tokens": 101574315.0, "step": 6310 }, { "aux_loss": 8.08941583633423, "entropy": 0.15250032395124435, "epoch": 0.006315, "grad_norm": 0.14238521456718445, "learning_rate": 2e-05, "loss": 0.18297399282455445, "mean_token_accuracy": 0.949578019976616, "num_tokens": 101650808.0, "step": 6315 }, { "aux_loss": 8.05661997795105, "entropy": 0.1723372034728527, "epoch": 0.00632, "grad_norm": 0.13784413039684296, "learning_rate": 2e-05, "loss": 0.2155602216720581, "mean_token_accuracy": 0.9406784355640412, "num_tokens": 101732175.0, "step": 6320 }, { "aux_loss": 8.056038904190064, "entropy": 0.17770125046372415, "epoch": 0.006325, "grad_norm": 0.1384645253419876, "learning_rate": 2e-05, "loss": 0.2155226230621338, "mean_token_accuracy": 0.940444940328598, "num_tokens": 101813586.0, "step": 6325 }, { "aux_loss": 8.061874866485596, "entropy": 0.17923748418688773, "epoch": 0.00633, "grad_norm": 0.14557155966758728, "learning_rate": 2e-05, "loss": 0.2121119499206543, "mean_token_accuracy": 0.9412698000669479, "num_tokens": 101894258.0, "step": 6330 }, { "aux_loss": 8.067919588088989, "entropy": 0.16947432681918145, "epoch": 0.006335, "grad_norm": 0.1293715536594391, "learning_rate": 2e-05, "loss": 0.1959705114364624, "mean_token_accuracy": 0.9455020755529404, "num_tokens": 101975137.0, "step": 6335 }, { "aux_loss": 8.075682258605957, "entropy": 0.16904918551445008, "epoch": 0.00634, "grad_norm": 0.1394459307193756, "learning_rate": 2e-05, "loss": 0.19398807287216185, "mean_token_accuracy": 0.9463216930627822, "num_tokens": 102055325.0, "step": 6340 }, { "aux_loss": 8.088437271118163, "entropy": 0.14480783976614475, "epoch": 0.006345, "grad_norm": 0.1445549726486206, "learning_rate": 2e-05, "loss": 0.17504599094390869, "mean_token_accuracy": 0.9519671112298965, "num_tokens": 102133231.0, "step": 6345 }, { "aux_loss": 8.053894186019898, "entropy": 0.17075674533843993, "epoch": 0.00635, "grad_norm": 0.13737104833126068, "learning_rate": 2e-05, "loss": 0.21471831798553467, "mean_token_accuracy": 0.9409557968378067, "num_tokens": 102214602.0, "step": 6350 }, { "aux_loss": 8.059332466125488, "entropy": 0.18495972119271756, "epoch": 0.006355, "grad_norm": 0.13046260178089142, "learning_rate": 2e-05, "loss": 0.22336864471435547, "mean_token_accuracy": 0.9380752146244049, "num_tokens": 102296034.0, "step": 6355 }, { "aux_loss": 8.062976837158203, "entropy": 0.18716762810945511, "epoch": 0.00636, "grad_norm": 0.12837707996368408, "learning_rate": 2e-05, "loss": 0.21661136150360108, "mean_token_accuracy": 0.93944251537323, "num_tokens": 102377116.0, "step": 6360 }, { "aux_loss": 8.069791984558105, "entropy": 0.18775770887732507, "epoch": 0.006365, "grad_norm": 0.13980534672737122, "learning_rate": 2e-05, "loss": 0.21184928417205812, "mean_token_accuracy": 0.9406641364097595, "num_tokens": 102457851.0, "step": 6365 }, { "aux_loss": 8.076382970809936, "entropy": 0.15570278875529767, "epoch": 0.00637, "grad_norm": 0.1451767235994339, "learning_rate": 2e-05, "loss": 0.1806432008743286, "mean_token_accuracy": 0.9495420396327973, "num_tokens": 102538278.0, "step": 6370 }, { "aux_loss": 8.093045139312744, "entropy": 0.14868444874882697, "epoch": 0.006375, "grad_norm": 0.1694030910730362, "learning_rate": 2e-05, "loss": 0.17895843982696533, "mean_token_accuracy": 0.950489941239357, "num_tokens": 102618109.0, "step": 6375 }, { "aux_loss": 8.05609827041626, "entropy": 0.15887579768896104, "epoch": 0.00638, "grad_norm": 0.13222035765647888, "learning_rate": 2e-05, "loss": 0.19839054346084595, "mean_token_accuracy": 0.9463102877140045, "num_tokens": 102699390.0, "step": 6380 }, { "aux_loss": 8.058115196228027, "entropy": 0.1806506983935833, "epoch": 0.006385, "grad_norm": 0.13981851935386658, "learning_rate": 2e-05, "loss": 0.22575092315673828, "mean_token_accuracy": 0.9366847574710846, "num_tokens": 102780414.0, "step": 6385 }, { "aux_loss": 8.060818958282471, "entropy": 0.17934260740876198, "epoch": 0.00639, "grad_norm": 0.1297139823436737, "learning_rate": 2e-05, "loss": 0.21333825588226318, "mean_token_accuracy": 0.9409090429544449, "num_tokens": 102860940.0, "step": 6390 }, { "aux_loss": 8.06777834892273, "entropy": 0.1966196946799755, "epoch": 0.006395, "grad_norm": 0.1342628300189972, "learning_rate": 2e-05, "loss": 0.22602782249450684, "mean_token_accuracy": 0.9370049566030503, "num_tokens": 102941531.0, "step": 6395 }, { "aux_loss": 8.073350095748902, "entropy": 0.16740402728319168, "epoch": 0.0064, "grad_norm": 0.1337825208902359, "learning_rate": 2e-05, "loss": 0.19232274293899537, "mean_token_accuracy": 0.9470282524824143, "num_tokens": 103022099.0, "step": 6400 }, { "aux_loss": 8.085779571533203, "entropy": 0.15219030603766442, "epoch": 0.006405, "grad_norm": 0.1452208161354065, "learning_rate": 2e-05, "loss": 0.1763453245162964, "mean_token_accuracy": 0.9512188225984574, "num_tokens": 103102334.0, "step": 6405 }, { "aux_loss": 8.065481805801392, "entropy": 0.1620359502732754, "epoch": 0.00641, "grad_norm": 0.1380251795053482, "learning_rate": 2e-05, "loss": 0.20248186588287354, "mean_token_accuracy": 0.9455227285623551, "num_tokens": 103183019.0, "step": 6410 }, { "aux_loss": 8.060709190368652, "entropy": 0.1893113970756531, "epoch": 0.006415, "grad_norm": 0.14346621930599213, "learning_rate": 2e-05, "loss": 0.2336345672607422, "mean_token_accuracy": 0.9357190012931824, "num_tokens": 103263812.0, "step": 6415 }, { "aux_loss": 8.060740518569947, "entropy": 0.20097941234707833, "epoch": 0.00642, "grad_norm": 0.1351483017206192, "learning_rate": 2e-05, "loss": 0.2385958194732666, "mean_token_accuracy": 0.9341014057397843, "num_tokens": 103344593.0, "step": 6420 }, { "aux_loss": 8.06397876739502, "entropy": 0.1782874498516321, "epoch": 0.006425, "grad_norm": 0.12901869416236877, "learning_rate": 2e-05, "loss": 0.20582175254821777, "mean_token_accuracy": 0.9428041458129883, "num_tokens": 103425352.0, "step": 6425 }, { "aux_loss": 8.073601055145264, "entropy": 0.17462822794914246, "epoch": 0.00643, "grad_norm": 0.1316116601228714, "learning_rate": 2e-05, "loss": 0.20616085529327394, "mean_token_accuracy": 0.9420482069253922, "num_tokens": 103505951.0, "step": 6430 }, { "aux_loss": 8.080321311950684, "entropy": 0.1603805750608444, "epoch": 0.006435, "grad_norm": 0.13217490911483765, "learning_rate": 2e-05, "loss": 0.18733654022216797, "mean_token_accuracy": 0.9473046660423279, "num_tokens": 103586403.0, "step": 6435 }, { "aux_loss": 8.074872922897338, "entropy": 0.15219646506011486, "epoch": 0.00644, "grad_norm": 0.1349012553691864, "learning_rate": 2e-05, "loss": 0.1850438594818115, "mean_token_accuracy": 0.9502466320991516, "num_tokens": 103663739.0, "step": 6440 }, { "aux_loss": 8.055966472625732, "entropy": 0.20168813094496726, "epoch": 0.006445, "grad_norm": 0.13414886593818665, "learning_rate": 2e-05, "loss": 0.24502916336059571, "mean_token_accuracy": 0.9330766826868058, "num_tokens": 103744688.0, "step": 6445 }, { "aux_loss": 8.059682655334473, "entropy": 0.1899139355868101, "epoch": 0.00645, "grad_norm": 0.13743431866168976, "learning_rate": 2e-05, "loss": 0.22691383361816406, "mean_token_accuracy": 0.9376573890447617, "num_tokens": 103825465.0, "step": 6450 }, { "aux_loss": 8.066794633865356, "entropy": 0.17871159315109253, "epoch": 0.006455, "grad_norm": 0.13151606917381287, "learning_rate": 2e-05, "loss": 0.2089684247970581, "mean_token_accuracy": 0.9403085857629776, "num_tokens": 103906392.0, "step": 6455 }, { "aux_loss": 8.07235927581787, "entropy": 0.17127743512392044, "epoch": 0.00646, "grad_norm": 0.12921243906021118, "learning_rate": 2e-05, "loss": 0.1983320951461792, "mean_token_accuracy": 0.9451368868350982, "num_tokens": 103987013.0, "step": 6460 }, { "aux_loss": 8.079568862915039, "entropy": 0.15652903616428376, "epoch": 0.006465, "grad_norm": 0.13730360567569733, "learning_rate": 2e-05, "loss": 0.18192354440689087, "mean_token_accuracy": 0.9490347474813461, "num_tokens": 104067556.0, "step": 6465 }, { "aux_loss": 8.08714051246643, "entropy": 0.14996255822479726, "epoch": 0.00647, "grad_norm": 0.12541280686855316, "learning_rate": 2e-05, "loss": 0.17527691125869752, "mean_token_accuracy": 0.9513368755578995, "num_tokens": 104144236.0, "step": 6470 }, { "aux_loss": 8.059282493591308, "entropy": 0.17776259817183018, "epoch": 0.006475, "grad_norm": 0.13069605827331543, "learning_rate": 2e-05, "loss": 0.2222141981124878, "mean_token_accuracy": 0.9384141057729721, "num_tokens": 104225446.0, "step": 6475 }, { "aux_loss": 8.054843664169312, "entropy": 0.1879831813275814, "epoch": 0.00648, "grad_norm": 0.1447993963956833, "learning_rate": 2e-05, "loss": 0.2318018913269043, "mean_token_accuracy": 0.9365807831287384, "num_tokens": 104306350.0, "step": 6480 }, { "aux_loss": 8.058440113067627, "entropy": 0.1796765249222517, "epoch": 0.006485, "grad_norm": 0.13044868409633636, "learning_rate": 2e-05, "loss": 0.21003224849700927, "mean_token_accuracy": 0.9415479063987732, "num_tokens": 104387085.0, "step": 6485 }, { "aux_loss": 8.067186880111695, "entropy": 0.16888436824083328, "epoch": 0.00649, "grad_norm": 0.1329645812511444, "learning_rate": 2e-05, "loss": 0.19239667654037476, "mean_token_accuracy": 0.9472585588693618, "num_tokens": 104467319.0, "step": 6490 }, { "aux_loss": 8.074488878250122, "entropy": 0.15988884083926677, "epoch": 0.006495, "grad_norm": 0.1404368132352829, "learning_rate": 2e-05, "loss": 0.18557705879211425, "mean_token_accuracy": 0.9484501391649246, "num_tokens": 104546959.0, "step": 6495 }, { "aux_loss": 8.08824725151062, "entropy": 0.1398022759705782, "epoch": 0.0065, "grad_norm": 0.12826049327850342, "learning_rate": 2e-05, "loss": 0.1691373825073242, "mean_token_accuracy": 0.9537356555461883, "num_tokens": 104627237.0, "step": 6500 }, { "aux_loss": 8.052957391738891, "entropy": 0.18530977740883828, "epoch": 0.006505, "grad_norm": 0.1500970721244812, "learning_rate": 2e-05, "loss": 0.23158650398254393, "mean_token_accuracy": 0.9359501153230667, "num_tokens": 104708198.0, "step": 6505 }, { "aux_loss": 8.056018400192261, "entropy": 0.1863008677959442, "epoch": 0.00651, "grad_norm": 0.1350659728050232, "learning_rate": 2e-05, "loss": 0.22994539737701417, "mean_token_accuracy": 0.9373692750930787, "num_tokens": 104789530.0, "step": 6510 }, { "aux_loss": 8.06305227279663, "entropy": 0.19534257426857948, "epoch": 0.006515, "grad_norm": 0.12743796408176422, "learning_rate": 2e-05, "loss": 0.22684235572814943, "mean_token_accuracy": 0.9365925937891006, "num_tokens": 104870440.0, "step": 6515 }, { "aux_loss": 8.070610857009887, "entropy": 0.1902066335082054, "epoch": 0.00652, "grad_norm": 0.13365595042705536, "learning_rate": 2e-05, "loss": 0.2153306007385254, "mean_token_accuracy": 0.939258161187172, "num_tokens": 104950859.0, "step": 6520 }, { "aux_loss": 8.073332023620605, "entropy": 0.17365288510918617, "epoch": 0.006525, "grad_norm": 0.13237911462783813, "learning_rate": 2e-05, "loss": 0.1991954565048218, "mean_token_accuracy": 0.944195294380188, "num_tokens": 105030900.0, "step": 6525 }, { "aux_loss": 8.086445665359497, "entropy": 0.15020677708089353, "epoch": 0.00653, "grad_norm": 0.14996060729026794, "learning_rate": 2e-05, "loss": 0.17386245727539062, "mean_token_accuracy": 0.9523511111736298, "num_tokens": 105110880.0, "step": 6530 }, { "aux_loss": 8.054518985748292, "entropy": 0.1636942494660616, "epoch": 0.006535, "grad_norm": 0.139048233628273, "learning_rate": 2e-05, "loss": 0.20500919818878174, "mean_token_accuracy": 0.9441078394651413, "num_tokens": 105188071.0, "step": 6535 }, { "aux_loss": 8.058283233642578, "entropy": 0.18873534649610518, "epoch": 0.00654, "grad_norm": 0.1392601728439331, "learning_rate": 2e-05, "loss": 0.23121559619903564, "mean_token_accuracy": 0.9366243630647659, "num_tokens": 105269529.0, "step": 6540 }, { "aux_loss": 8.058865451812744, "entropy": 0.16948034428060055, "epoch": 0.006545, "grad_norm": 0.12779845297336578, "learning_rate": 2e-05, "loss": 0.2034911870956421, "mean_token_accuracy": 0.9437923997640609, "num_tokens": 105350826.0, "step": 6545 }, { "aux_loss": 8.067020893096924, "entropy": 0.1822333849966526, "epoch": 0.00655, "grad_norm": 0.1375105381011963, "learning_rate": 2e-05, "loss": 0.20614545345306395, "mean_token_accuracy": 0.9421275317668915, "num_tokens": 105431431.0, "step": 6550 }, { "aux_loss": 8.07479681968689, "entropy": 0.17016190513968468, "epoch": 0.006555, "grad_norm": 0.13541489839553833, "learning_rate": 2e-05, "loss": 0.19411683082580566, "mean_token_accuracy": 0.9465625077486038, "num_tokens": 105511533.0, "step": 6555 }, { "aux_loss": 8.08745527267456, "entropy": 0.15058867894113065, "epoch": 0.00656, "grad_norm": 0.15061993896961212, "learning_rate": 2e-05, "loss": 0.1770238995552063, "mean_token_accuracy": 0.9511159539222718, "num_tokens": 105591922.0, "step": 6560 }, { "aux_loss": 8.066929578781128, "entropy": 0.17327417582273483, "epoch": 0.006565, "grad_norm": 0.13963890075683594, "learning_rate": 2e-05, "loss": 0.2097869873046875, "mean_token_accuracy": 0.9418965160846711, "num_tokens": 105669729.0, "step": 6565 }, { "aux_loss": 8.059988069534302, "entropy": 0.1767417922616005, "epoch": 0.00657, "grad_norm": 0.13648806512355804, "learning_rate": 2e-05, "loss": 0.2210536479949951, "mean_token_accuracy": 0.939487236738205, "num_tokens": 105751040.0, "step": 6570 }, { "aux_loss": 8.060567808151244, "entropy": 0.18365311175584792, "epoch": 0.006575, "grad_norm": 0.13076962530612946, "learning_rate": 2e-05, "loss": 0.22124106884002687, "mean_token_accuracy": 0.938056617975235, "num_tokens": 105832440.0, "step": 6575 }, { "aux_loss": 8.06791181564331, "entropy": 0.18670534677803516, "epoch": 0.00658, "grad_norm": 0.12424053251743317, "learning_rate": 2e-05, "loss": 0.212841796875, "mean_token_accuracy": 0.9406958937644958, "num_tokens": 105913085.0, "step": 6580 }, { "aux_loss": 8.074774360656738, "entropy": 0.1809455320239067, "epoch": 0.006585, "grad_norm": 0.13560666143894196, "learning_rate": 2e-05, "loss": 0.2035428285598755, "mean_token_accuracy": 0.9440999895334243, "num_tokens": 105993790.0, "step": 6585 }, { "aux_loss": 8.08399920463562, "entropy": 0.15627671107649804, "epoch": 0.00659, "grad_norm": 0.15000271797180176, "learning_rate": 2e-05, "loss": 0.18291122913360597, "mean_token_accuracy": 0.9494013279676438, "num_tokens": 106073949.0, "step": 6590 }, { "aux_loss": 8.072545909881592, "entropy": 0.1805926974862814, "epoch": 0.006595, "grad_norm": 0.1438024938106537, "learning_rate": 2e-05, "loss": 0.21861820220947265, "mean_token_accuracy": 0.9400606960058212, "num_tokens": 106152757.0, "step": 6595 }, { "aux_loss": 8.057387018203736, "entropy": 0.19217270687222482, "epoch": 0.0066, "grad_norm": 0.1483086347579956, "learning_rate": 2e-05, "loss": 0.23820018768310547, "mean_token_accuracy": 0.9352487921714783, "num_tokens": 106233759.0, "step": 6600 }, { "aux_loss": 8.061714553833008, "entropy": 0.19212173148989678, "epoch": 0.006605, "grad_norm": 0.12826994061470032, "learning_rate": 2e-05, "loss": 0.22636728286743163, "mean_token_accuracy": 0.9375009626150131, "num_tokens": 106314761.0, "step": 6605 }, { "aux_loss": 8.063360214233398, "entropy": 0.19681259840726853, "epoch": 0.00661, "grad_norm": 0.12922720611095428, "learning_rate": 2e-05, "loss": 0.22415735721588134, "mean_token_accuracy": 0.9371958076953888, "num_tokens": 106395504.0, "step": 6610 }, { "aux_loss": 8.067996263504028, "entropy": 0.18302029445767404, "epoch": 0.006615, "grad_norm": 0.1312997043132782, "learning_rate": 2e-05, "loss": 0.2081216096878052, "mean_token_accuracy": 0.9416180312633514, "num_tokens": 106476323.0, "step": 6615 }, { "aux_loss": 8.075970935821534, "entropy": 0.1569758526980877, "epoch": 0.00662, "grad_norm": 0.15728217363357544, "learning_rate": 2e-05, "loss": 0.18248648643493653, "mean_token_accuracy": 0.9502352803945542, "num_tokens": 106556954.0, "step": 6620 }, { "aux_loss": 8.081261444091798, "entropy": 0.15056833885610105, "epoch": 0.006625, "grad_norm": 0.13029922544956207, "learning_rate": 2e-05, "loss": 0.17897058725357057, "mean_token_accuracy": 0.9469171613454819, "num_tokens": 106633460.0, "step": 6625 }, { "aux_loss": 8.056975650787354, "entropy": 0.20196614861488343, "epoch": 0.00663, "grad_norm": 0.14535565674304962, "learning_rate": 2e-05, "loss": 0.2484807014465332, "mean_token_accuracy": 0.9315470159053802, "num_tokens": 106714714.0, "step": 6630 }, { "aux_loss": 8.059915542602539, "entropy": 0.1933729939162731, "epoch": 0.006635, "grad_norm": 0.13469654321670532, "learning_rate": 2e-05, "loss": 0.22994585037231446, "mean_token_accuracy": 0.9362727642059326, "num_tokens": 106796062.0, "step": 6635 }, { "aux_loss": 8.064970064163209, "entropy": 0.1833428829908371, "epoch": 0.00664, "grad_norm": 0.1303439885377884, "learning_rate": 2e-05, "loss": 0.213004469871521, "mean_token_accuracy": 0.9411578148603439, "num_tokens": 106877213.0, "step": 6640 }, { "aux_loss": 8.073453855514526, "entropy": 0.18130681216716765, "epoch": 0.006645, "grad_norm": 0.1338777095079422, "learning_rate": 2e-05, "loss": 0.20527844429016112, "mean_token_accuracy": 0.94286450445652, "num_tokens": 106958021.0, "step": 6645 }, { "aux_loss": 8.081600046157837, "entropy": 0.1550985224545002, "epoch": 0.00665, "grad_norm": 0.14633561670780182, "learning_rate": 2e-05, "loss": 0.17817087173461915, "mean_token_accuracy": 0.9505529850721359, "num_tokens": 107038583.0, "step": 6650 }, { "aux_loss": 8.08010368347168, "entropy": 0.14544684253633022, "epoch": 0.006655, "grad_norm": 0.12753990292549133, "learning_rate": 2e-05, "loss": 0.17821503877639772, "mean_token_accuracy": 0.9524681568145752, "num_tokens": 107115835.0, "step": 6655 }, { "aux_loss": 8.058242654800415, "entropy": 0.19374196976423264, "epoch": 0.00666, "grad_norm": 0.14286461472511292, "learning_rate": 2e-05, "loss": 0.2412653923034668, "mean_token_accuracy": 0.9333578646183014, "num_tokens": 107197217.0, "step": 6660 }, { "aux_loss": 8.058524560928344, "entropy": 0.193814517557621, "epoch": 0.006665, "grad_norm": 0.14072448015213013, "learning_rate": 2e-05, "loss": 0.23591794967651367, "mean_token_accuracy": 0.9340570271015167, "num_tokens": 107277838.0, "step": 6665 }, { "aux_loss": 8.060419511795043, "entropy": 0.19526009038090705, "epoch": 0.00667, "grad_norm": 0.1275109201669693, "learning_rate": 2e-05, "loss": 0.2266437292098999, "mean_token_accuracy": 0.9376020550727844, "num_tokens": 107358411.0, "step": 6670 }, { "aux_loss": 8.068568563461303, "entropy": 0.178493682295084, "epoch": 0.006675, "grad_norm": 0.13420528173446655, "learning_rate": 2e-05, "loss": 0.20035793781280517, "mean_token_accuracy": 0.9438051968812943, "num_tokens": 107439121.0, "step": 6675 }, { "aux_loss": 8.077151107788087, "entropy": 0.17396341487765313, "epoch": 0.00668, "grad_norm": 0.1457800567150116, "learning_rate": 2e-05, "loss": 0.2007878303527832, "mean_token_accuracy": 0.9430379956960678, "num_tokens": 107520306.0, "step": 6680 }, { "aux_loss": 8.083810710906983, "entropy": 0.14405076950788498, "epoch": 0.006685, "grad_norm": 0.12061306834220886, "learning_rate": 2e-05, "loss": 0.1787621021270752, "mean_token_accuracy": 0.9509928166866303, "num_tokens": 107597366.0, "step": 6685 }, { "aux_loss": 8.056791305541992, "entropy": 0.21013906523585318, "epoch": 0.00669, "grad_norm": 0.14182820916175842, "learning_rate": 2e-05, "loss": 0.25118963718414306, "mean_token_accuracy": 0.9320299386978149, "num_tokens": 107678724.0, "step": 6690 }, { "aux_loss": 8.059663486480712, "entropy": 0.20437658838927747, "epoch": 0.006695, "grad_norm": 0.12801802158355713, "learning_rate": 2e-05, "loss": 0.23997869491577148, "mean_token_accuracy": 0.9333798080682755, "num_tokens": 107759944.0, "step": 6695 }, { "aux_loss": 8.060472249984741, "entropy": 0.1899130627512932, "epoch": 0.0067, "grad_norm": 0.13734589517116547, "learning_rate": 2e-05, "loss": 0.2205308198928833, "mean_token_accuracy": 0.9388278216123581, "num_tokens": 107840832.0, "step": 6700 }, { "aux_loss": 8.068573808670044, "entropy": 0.18932122439146043, "epoch": 0.006705, "grad_norm": 0.14030024409294128, "learning_rate": 2e-05, "loss": 0.2195117712020874, "mean_token_accuracy": 0.9391480773687363, "num_tokens": 107921401.0, "step": 6705 }, { "aux_loss": 8.076237630844116, "entropy": 0.16646337546408177, "epoch": 0.00671, "grad_norm": 0.12890629470348358, "learning_rate": 2e-05, "loss": 0.19483060836791993, "mean_token_accuracy": 0.9460500359535218, "num_tokens": 108001687.0, "step": 6710 }, { "aux_loss": 8.089707183837891, "entropy": 0.1615411765873432, "epoch": 0.006715, "grad_norm": 0.21329468488693237, "learning_rate": 2e-05, "loss": 0.1896498680114746, "mean_token_accuracy": 0.9470278322696686, "num_tokens": 108080166.0, "step": 6715 }, { "aux_loss": 8.053832149505615, "entropy": 0.17431953698396682, "epoch": 0.00672, "grad_norm": 0.13431163132190704, "learning_rate": 2e-05, "loss": 0.21453843116760254, "mean_token_accuracy": 0.9422074437141419, "num_tokens": 108161359.0, "step": 6720 }, { "aux_loss": 8.056922817230225, "entropy": 0.1907948836684227, "epoch": 0.006725, "grad_norm": 0.13440436124801636, "learning_rate": 2e-05, "loss": 0.2308185577392578, "mean_token_accuracy": 0.9372014433145524, "num_tokens": 108242649.0, "step": 6725 }, { "aux_loss": 8.060697078704834, "entropy": 0.1860272318124771, "epoch": 0.00673, "grad_norm": 0.12962786853313446, "learning_rate": 2e-05, "loss": 0.21740972995758057, "mean_token_accuracy": 0.939772167801857, "num_tokens": 108323689.0, "step": 6730 }, { "aux_loss": 8.067785120010376, "entropy": 0.20486112534999848, "epoch": 0.006735, "grad_norm": 0.14315727353096008, "learning_rate": 2e-05, "loss": 0.2384364128112793, "mean_token_accuracy": 0.9337804347276688, "num_tokens": 108404556.0, "step": 6735 }, { "aux_loss": 8.070926666259766, "entropy": 0.16807297691702844, "epoch": 0.00674, "grad_norm": 0.1316627562046051, "learning_rate": 2e-05, "loss": 0.1896495819091797, "mean_token_accuracy": 0.9470909118652344, "num_tokens": 108485280.0, "step": 6740 }, { "aux_loss": 8.083463144302367, "entropy": 0.15742594823241235, "epoch": 0.006745, "grad_norm": 0.1355815976858139, "learning_rate": 2e-05, "loss": 0.18207114934921265, "mean_token_accuracy": 0.9488089293241501, "num_tokens": 108565343.0, "step": 6745 }, { "aux_loss": 8.065484142303466, "entropy": 0.17837621867656708, "epoch": 0.00675, "grad_norm": 0.13580040633678436, "learning_rate": 2e-05, "loss": 0.2193075656890869, "mean_token_accuracy": 0.9402038544416428, "num_tokens": 108644820.0, "step": 6750 }, { "aux_loss": 8.059473514556885, "entropy": 0.19034894444048406, "epoch": 0.006755, "grad_norm": 0.14436422288417816, "learning_rate": 2e-05, "loss": 0.23359949588775636, "mean_token_accuracy": 0.935259535908699, "num_tokens": 108726002.0, "step": 6755 }, { "aux_loss": 8.057626676559448, "entropy": 0.18970154076814652, "epoch": 0.00676, "grad_norm": 0.13981929421424866, "learning_rate": 2e-05, "loss": 0.22816820144653321, "mean_token_accuracy": 0.9363198816776276, "num_tokens": 108806816.0, "step": 6760 }, { "aux_loss": 8.063619422912598, "entropy": 0.1876445196568966, "epoch": 0.006765, "grad_norm": 0.12872658669948578, "learning_rate": 2e-05, "loss": 0.2164677858352661, "mean_token_accuracy": 0.9406172186136246, "num_tokens": 108887661.0, "step": 6765 }, { "aux_loss": 8.07038254737854, "entropy": 0.1758854180574417, "epoch": 0.00677, "grad_norm": 0.12422648072242737, "learning_rate": 2e-05, "loss": 0.19471333026885987, "mean_token_accuracy": 0.9462656289339065, "num_tokens": 108968469.0, "step": 6770 }, { "aux_loss": 8.080739402770996, "entropy": 0.14386206939816476, "epoch": 0.006775, "grad_norm": 0.13551288843154907, "learning_rate": 2e-05, "loss": 0.1684157967567444, "mean_token_accuracy": 0.9528355211019516, "num_tokens": 109048940.0, "step": 6775 }, { "aux_loss": 8.07333745956421, "entropy": 0.16987128220498562, "epoch": 0.00678, "grad_norm": 0.12569330632686615, "learning_rate": 2e-05, "loss": 0.21025750637054444, "mean_token_accuracy": 0.9418981492519378, "num_tokens": 109128048.0, "step": 6780 }, { "aux_loss": 8.057387399673463, "entropy": 0.18619118109345437, "epoch": 0.006785, "grad_norm": 0.13500316441059113, "learning_rate": 2e-05, "loss": 0.22751965522766113, "mean_token_accuracy": 0.9370787292718887, "num_tokens": 109209432.0, "step": 6785 }, { "aux_loss": 8.060741424560547, "entropy": 0.19404347911477088, "epoch": 0.00679, "grad_norm": 0.13726806640625, "learning_rate": 2e-05, "loss": 0.23631765842437744, "mean_token_accuracy": 0.9343833029270172, "num_tokens": 109290434.0, "step": 6790 }, { "aux_loss": 8.065060949325561, "entropy": 0.18128382861614228, "epoch": 0.006795, "grad_norm": 0.12944266200065613, "learning_rate": 2e-05, "loss": 0.2106311321258545, "mean_token_accuracy": 0.9406280428171158, "num_tokens": 109371345.0, "step": 6795 }, { "aux_loss": 8.067907905578613, "entropy": 0.17607021257281302, "epoch": 0.0068, "grad_norm": 0.1292889565229416, "learning_rate": 2e-05, "loss": 0.20047850608825685, "mean_token_accuracy": 0.943754893541336, "num_tokens": 109451740.0, "step": 6800 }, { "aux_loss": 8.07772216796875, "entropy": 0.15810563787817955, "epoch": 0.006805, "grad_norm": 0.13309086859226227, "learning_rate": 2e-05, "loss": 0.18045300245285034, "mean_token_accuracy": 0.9496598452329635, "num_tokens": 109531905.0, "step": 6805 }, { "aux_loss": 8.070142364501953, "entropy": 0.16251008845865728, "epoch": 0.00681, "grad_norm": 0.1362977772951126, "learning_rate": 2e-05, "loss": 0.1953115940093994, "mean_token_accuracy": 0.9467148929834366, "num_tokens": 109610227.0, "step": 6810 }, { "aux_loss": 8.05427656173706, "entropy": 0.20478485673666, "epoch": 0.006815, "grad_norm": 0.1396312266588211, "learning_rate": 2e-05, "loss": 0.25188241004943845, "mean_token_accuracy": 0.9313136786222458, "num_tokens": 109691387.0, "step": 6815 }, { "aux_loss": 8.058727979660034, "entropy": 0.2000688396394253, "epoch": 0.00682, "grad_norm": 0.12259568274021149, "learning_rate": 2e-05, "loss": 0.2394339323043823, "mean_token_accuracy": 0.9337880730628967, "num_tokens": 109772332.0, "step": 6820 }, { "aux_loss": 8.06331491470337, "entropy": 0.20067718476057053, "epoch": 0.006825, "grad_norm": 0.13288083672523499, "learning_rate": 2e-05, "loss": 0.22876579761505128, "mean_token_accuracy": 0.9371572852134704, "num_tokens": 109853329.0, "step": 6825 }, { "aux_loss": 8.068853902816773, "entropy": 0.18307801187038422, "epoch": 0.00683, "grad_norm": 0.13197623193264008, "learning_rate": 2e-05, "loss": 0.21064381599426268, "mean_token_accuracy": 0.9424758553504944, "num_tokens": 109934003.0, "step": 6830 }, { "aux_loss": 8.080074024200439, "entropy": 0.1613745927810669, "epoch": 0.006835, "grad_norm": 0.1528049111366272, "learning_rate": 2e-05, "loss": 0.18981387615203857, "mean_token_accuracy": 0.9484105855226517, "num_tokens": 110013900.0, "step": 6835 }, { "aux_loss": 8.078043985366822, "entropy": 0.14951721727848052, "epoch": 0.00684, "grad_norm": 0.13994275033473969, "learning_rate": 2e-05, "loss": 0.18397578001022338, "mean_token_accuracy": 0.9501771062612534, "num_tokens": 110092248.0, "step": 6840 }, { "aux_loss": 8.055387353897094, "entropy": 0.19120416045188904, "epoch": 0.006845, "grad_norm": 0.14257748425006866, "learning_rate": 2e-05, "loss": 0.23187901973724365, "mean_token_accuracy": 0.9358863234519958, "num_tokens": 110173065.0, "step": 6845 }, { "aux_loss": 8.056835651397705, "entropy": 0.18925052024424077, "epoch": 0.00685, "grad_norm": 0.13090164959430695, "learning_rate": 2e-05, "loss": 0.22437198162078859, "mean_token_accuracy": 0.9382225751876831, "num_tokens": 110254084.0, "step": 6850 }, { "aux_loss": 8.06151032447815, "entropy": 0.1916178446263075, "epoch": 0.006855, "grad_norm": 0.13993686437606812, "learning_rate": 2e-05, "loss": 0.223028826713562, "mean_token_accuracy": 0.9386214166879654, "num_tokens": 110334504.0, "step": 6855 }, { "aux_loss": 8.065795183181763, "entropy": 0.18025753945112227, "epoch": 0.00686, "grad_norm": 0.1293414980173111, "learning_rate": 2e-05, "loss": 0.2055180311203003, "mean_token_accuracy": 0.9433819651603699, "num_tokens": 110415448.0, "step": 6860 }, { "aux_loss": 8.072910642623901, "entropy": 0.16579332202672958, "epoch": 0.006865, "grad_norm": 0.15642303228378296, "learning_rate": 2e-05, "loss": 0.192667818069458, "mean_token_accuracy": 0.9462066143751144, "num_tokens": 110496544.0, "step": 6865 }, { "aux_loss": 8.079344987869263, "entropy": 0.14516615755856038, "epoch": 0.00687, "grad_norm": 0.13828928768634796, "learning_rate": 2e-05, "loss": 0.1700227975845337, "mean_token_accuracy": 0.9530481725931168, "num_tokens": 110573773.0, "step": 6870 }, { "aux_loss": 8.050804615020752, "entropy": 0.1830222938209772, "epoch": 0.006875, "grad_norm": 0.13731269538402557, "learning_rate": 2e-05, "loss": 0.22500884532928467, "mean_token_accuracy": 0.9397697508335113, "num_tokens": 110655033.0, "step": 6875 }, { "aux_loss": 8.053100633621217, "entropy": 0.19751237854361534, "epoch": 0.00688, "grad_norm": 0.13944876194000244, "learning_rate": 2e-05, "loss": 0.2381190538406372, "mean_token_accuracy": 0.9329667806625366, "num_tokens": 110736212.0, "step": 6880 }, { "aux_loss": 8.058423900604248, "entropy": 0.18282825984060763, "epoch": 0.006885, "grad_norm": 0.12871089577674866, "learning_rate": 2e-05, "loss": 0.2117380142211914, "mean_token_accuracy": 0.9409862369298935, "num_tokens": 110817125.0, "step": 6885 }, { "aux_loss": 8.063421773910523, "entropy": 0.17388938404619694, "epoch": 0.00689, "grad_norm": 0.13460378348827362, "learning_rate": 2e-05, "loss": 0.19637068510055541, "mean_token_accuracy": 0.9451661705970764, "num_tokens": 110897779.0, "step": 6890 }, { "aux_loss": 8.071660709381103, "entropy": 0.1595969472080469, "epoch": 0.006895, "grad_norm": 0.1393076479434967, "learning_rate": 2e-05, "loss": 0.18909016847610474, "mean_token_accuracy": 0.9462069272994995, "num_tokens": 110978080.0, "step": 6895 }, { "aux_loss": 8.086488819122314, "entropy": 0.15020788870751858, "epoch": 0.0069, "grad_norm": 0.15149039030075073, "learning_rate": 2e-05, "loss": 0.1846014976501465, "mean_token_accuracy": 0.9486435681581498, "num_tokens": 111057346.0, "step": 6900 }, { "aux_loss": 8.055602884292602, "entropy": 0.1961719837039709, "epoch": 0.006905, "grad_norm": 0.14332440495491028, "learning_rate": 2e-05, "loss": 0.24031534194946289, "mean_token_accuracy": 0.9335872083902359, "num_tokens": 111138608.0, "step": 6905 }, { "aux_loss": 8.059308862686157, "entropy": 0.20703301578760147, "epoch": 0.00691, "grad_norm": 0.12914623320102692, "learning_rate": 2e-05, "loss": 0.24857690334320068, "mean_token_accuracy": 0.931088387966156, "num_tokens": 111219408.0, "step": 6910 }, { "aux_loss": 8.059395360946656, "entropy": 0.202732365578413, "epoch": 0.006915, "grad_norm": 0.1352163404226303, "learning_rate": 2e-05, "loss": 0.2315981149673462, "mean_token_accuracy": 0.9357743471860885, "num_tokens": 111300285.0, "step": 6915 }, { "aux_loss": 8.062900590896607, "entropy": 0.18121012523770333, "epoch": 0.00692, "grad_norm": 0.13391900062561035, "learning_rate": 2e-05, "loss": 0.2070383310317993, "mean_token_accuracy": 0.943183696269989, "num_tokens": 111381188.0, "step": 6920 }, { "aux_loss": 8.06819167137146, "entropy": 0.16773489862680435, "epoch": 0.006925, "grad_norm": 0.1380244940519333, "learning_rate": 2e-05, "loss": 0.19404807090759277, "mean_token_accuracy": 0.9467169791460037, "num_tokens": 111461254.0, "step": 6925 }, { "aux_loss": 8.083512306213379, "entropy": 0.14787791818380355, "epoch": 0.00693, "grad_norm": 0.15291079878807068, "learning_rate": 2e-05, "loss": 0.17515230178833008, "mean_token_accuracy": 0.951891052722931, "num_tokens": 111541466.0, "step": 6930 }, { "aux_loss": 8.063453865051269, "entropy": 0.15990073122084142, "epoch": 0.006935, "grad_norm": 0.13127268850803375, "learning_rate": 2e-05, "loss": 0.19819576740264894, "mean_token_accuracy": 0.9464002907276153, "num_tokens": 111621110.0, "step": 6935 }, { "aux_loss": 8.056852865219117, "entropy": 0.19791870787739754, "epoch": 0.00694, "grad_norm": 0.14063888788223267, "learning_rate": 2e-05, "loss": 0.24480123519897462, "mean_token_accuracy": 0.9323440104722976, "num_tokens": 111702240.0, "step": 6940 }, { "aux_loss": 8.058293867111207, "entropy": 0.19194333180785178, "epoch": 0.006945, "grad_norm": 0.13223256170749664, "learning_rate": 2e-05, "loss": 0.2275765895843506, "mean_token_accuracy": 0.937348023056984, "num_tokens": 111783161.0, "step": 6945 }, { "aux_loss": 8.064247035980225, "entropy": 0.18550173714756965, "epoch": 0.00695, "grad_norm": 0.12810027599334717, "learning_rate": 2e-05, "loss": 0.20763940811157228, "mean_token_accuracy": 0.9421748757362366, "num_tokens": 111864063.0, "step": 6950 }, { "aux_loss": 8.070037651062012, "entropy": 0.17414481341838836, "epoch": 0.006955, "grad_norm": 0.14044809341430664, "learning_rate": 2e-05, "loss": 0.20043206214904785, "mean_token_accuracy": 0.9433826714754104, "num_tokens": 111944599.0, "step": 6955 }, { "aux_loss": 8.079628562927246, "entropy": 0.15028354302048683, "epoch": 0.00696, "grad_norm": 0.153854638338089, "learning_rate": 2e-05, "loss": 0.18153855800628663, "mean_token_accuracy": 0.9484508752822876, "num_tokens": 112024764.0, "step": 6960 }, { "aux_loss": 8.061726951599121, "entropy": 0.16690603084862232, "epoch": 0.006965, "grad_norm": 0.13620921969413757, "learning_rate": 2e-05, "loss": 0.20388710498809814, "mean_token_accuracy": 0.9443705022335053, "num_tokens": 112103878.0, "step": 6965 }, { "aux_loss": 8.058962440490722, "entropy": 0.19669478423893452, "epoch": 0.00697, "grad_norm": 0.13166803121566772, "learning_rate": 2e-05, "loss": 0.23782813549041748, "mean_token_accuracy": 0.9345280230045319, "num_tokens": 112185391.0, "step": 6970 }, { "aux_loss": 8.057507133483886, "entropy": 0.1985299989581108, "epoch": 0.006975, "grad_norm": 0.12910211086273193, "learning_rate": 2e-05, "loss": 0.23177578449249267, "mean_token_accuracy": 0.9366781413555145, "num_tokens": 112266553.0, "step": 6975 }, { "aux_loss": 8.063517522811889, "entropy": 0.18326300829648973, "epoch": 0.00698, "grad_norm": 0.1300823986530304, "learning_rate": 2e-05, "loss": 0.21248078346252441, "mean_token_accuracy": 0.9411573708057404, "num_tokens": 112347294.0, "step": 6980 }, { "aux_loss": 8.07069435119629, "entropy": 0.1764574684202671, "epoch": 0.006985, "grad_norm": 0.13278327882289886, "learning_rate": 2e-05, "loss": 0.20272331237792968, "mean_token_accuracy": 0.9434526592493058, "num_tokens": 112428013.0, "step": 6985 }, { "aux_loss": 8.081476879119872, "entropy": 0.15756783448159695, "epoch": 0.00699, "grad_norm": 0.1429092139005661, "learning_rate": 2e-05, "loss": 0.18209214210510255, "mean_token_accuracy": 0.9492216110229492, "num_tokens": 112508231.0, "step": 6990 }, { "aux_loss": 8.06993646621704, "entropy": 0.16216953173279763, "epoch": 0.006995, "grad_norm": 0.12714068591594696, "learning_rate": 2e-05, "loss": 0.1991791009902954, "mean_token_accuracy": 0.9440642416477203, "num_tokens": 112586809.0, "step": 6995 }, { "aux_loss": 8.052938604354859, "entropy": 0.20342568233609198, "epoch": 0.007, "grad_norm": 0.1341390162706375, "learning_rate": 2e-05, "loss": 0.2487004280090332, "mean_token_accuracy": 0.9307210355997085, "num_tokens": 112668141.0, "step": 7000 }, { "aux_loss": 8.057039022445679, "entropy": 0.1822150766849518, "epoch": 0.007005, "grad_norm": 0.1320662498474121, "learning_rate": 2e-05, "loss": 0.21836693286895753, "mean_token_accuracy": 0.939070850610733, "num_tokens": 112749233.0, "step": 7005 }, { "aux_loss": 8.060214424133301, "entropy": 0.17933097407221793, "epoch": 0.00701, "grad_norm": 0.1267113983631134, "learning_rate": 2e-05, "loss": 0.20422806739807128, "mean_token_accuracy": 0.9432374060153961, "num_tokens": 112830244.0, "step": 7010 }, { "aux_loss": 8.067915773391723, "entropy": 0.17348047643899916, "epoch": 0.007015, "grad_norm": 0.1358555406332016, "learning_rate": 2e-05, "loss": 0.19757884740829468, "mean_token_accuracy": 0.9455861330032349, "num_tokens": 112911185.0, "step": 7015 }, { "aux_loss": 8.07640118598938, "entropy": 0.14997454285621642, "epoch": 0.00702, "grad_norm": 0.14231212437152863, "learning_rate": 2e-05, "loss": 0.1767973780632019, "mean_token_accuracy": 0.9509914219379425, "num_tokens": 112991404.0, "step": 7020 }, { "aux_loss": 8.070006895065308, "entropy": 0.1480850413441658, "epoch": 0.007025, "grad_norm": 0.13705086708068848, "learning_rate": 2e-05, "loss": 0.18057994842529296, "mean_token_accuracy": 0.9501135468482971, "num_tokens": 113069054.0, "step": 7025 }, { "aux_loss": 8.054139804840087, "entropy": 0.17381192483007907, "epoch": 0.00703, "grad_norm": 0.14269228279590607, "learning_rate": 2e-05, "loss": 0.21657919883728027, "mean_token_accuracy": 0.9390967428684235, "num_tokens": 113150161.0, "step": 7030 }, { "aux_loss": 8.055738592147828, "entropy": 0.19614654183387756, "epoch": 0.007035, "grad_norm": 0.12956149876117706, "learning_rate": 2e-05, "loss": 0.23727197647094728, "mean_token_accuracy": 0.9344140857458114, "num_tokens": 113230726.0, "step": 7035 }, { "aux_loss": 8.058074474334717, "entropy": 0.18538858070969583, "epoch": 0.00704, "grad_norm": 0.13408729434013367, "learning_rate": 2e-05, "loss": 0.21406421661376954, "mean_token_accuracy": 0.940402963757515, "num_tokens": 113311589.0, "step": 7040 }, { "aux_loss": 8.068364429473878, "entropy": 0.1827181063592434, "epoch": 0.007045, "grad_norm": 0.14206305146217346, "learning_rate": 2e-05, "loss": 0.20695745944976807, "mean_token_accuracy": 0.941447052359581, "num_tokens": 113392472.0, "step": 7045 }, { "aux_loss": 8.073644208908082, "entropy": 0.16167523339390755, "epoch": 0.00705, "grad_norm": 0.1369583010673523, "learning_rate": 2e-05, "loss": 0.18708597421646117, "mean_token_accuracy": 0.9479620009660721, "num_tokens": 113473166.0, "step": 7050 }, { "aux_loss": 8.079384756088256, "entropy": 0.15518963374197484, "epoch": 0.007055, "grad_norm": 0.126423180103302, "learning_rate": 2e-05, "loss": 0.18250396251678466, "mean_token_accuracy": 0.9494188785552978, "num_tokens": 113551458.0, "step": 7055 }, { "aux_loss": 8.052441120147705, "entropy": 0.20016354694962502, "epoch": 0.00706, "grad_norm": 0.1303359568119049, "learning_rate": 2e-05, "loss": 0.24556608200073243, "mean_token_accuracy": 0.9331448823213577, "num_tokens": 113633087.0, "step": 7060 }, { "aux_loss": 8.056761503219604, "entropy": 0.19472678676247596, "epoch": 0.007065, "grad_norm": 0.1315099149942398, "learning_rate": 2e-05, "loss": 0.2353368043899536, "mean_token_accuracy": 0.9340995758771896, "num_tokens": 113714117.0, "step": 7065 }, { "aux_loss": 8.060474061965943, "entropy": 0.17509630098938941, "epoch": 0.00707, "grad_norm": 0.12468890845775604, "learning_rate": 2e-05, "loss": 0.20644593238830566, "mean_token_accuracy": 0.9434526115655899, "num_tokens": 113794646.0, "step": 7070 }, { "aux_loss": 8.068728876113891, "entropy": 0.1740468643605709, "epoch": 0.007075, "grad_norm": 0.13405142724514008, "learning_rate": 2e-05, "loss": 0.1977548360824585, "mean_token_accuracy": 0.9444215714931488, "num_tokens": 113875078.0, "step": 7075 }, { "aux_loss": 8.074010181427003, "entropy": 0.15743556693196298, "epoch": 0.00708, "grad_norm": 0.1447540819644928, "learning_rate": 2e-05, "loss": 0.18424359560012818, "mean_token_accuracy": 0.9496011435985565, "num_tokens": 113955611.0, "step": 7080 }, { "aux_loss": 8.083940553665162, "entropy": 0.14909599982202054, "epoch": 0.007085, "grad_norm": 0.12713557481765747, "learning_rate": 2e-05, "loss": 0.1818614959716797, "mean_token_accuracy": 0.9497849643230438, "num_tokens": 114034251.0, "step": 7085 }, { "aux_loss": 8.049956130981446, "entropy": 0.18191827796399593, "epoch": 0.00709, "grad_norm": 0.13210304081439972, "learning_rate": 2e-05, "loss": 0.2215649127960205, "mean_token_accuracy": 0.9386815667152405, "num_tokens": 114115770.0, "step": 7090 }, { "aux_loss": 8.056961631774902, "entropy": 0.20289888903498648, "epoch": 0.007095, "grad_norm": 0.13716211915016174, "learning_rate": 2e-05, "loss": 0.24096074104309081, "mean_token_accuracy": 0.9343296110630035, "num_tokens": 114196903.0, "step": 7095 }, { "aux_loss": 8.057987880706786, "entropy": 0.18323367536067964, "epoch": 0.0071, "grad_norm": 0.12688027322292328, "learning_rate": 2e-05, "loss": 0.21829211711883545, "mean_token_accuracy": 0.9390118360519409, "num_tokens": 114277890.0, "step": 7100 }, { "aux_loss": 8.062729549407958, "entropy": 0.1816129706799984, "epoch": 0.007105, "grad_norm": 0.1281527578830719, "learning_rate": 2e-05, "loss": 0.21081395149230958, "mean_token_accuracy": 0.9405385702848434, "num_tokens": 114358553.0, "step": 7105 }, { "aux_loss": 8.070510625839233, "entropy": 0.1619888201355934, "epoch": 0.00711, "grad_norm": 0.1359483003616333, "learning_rate": 2e-05, "loss": 0.18314563035964965, "mean_token_accuracy": 0.9491298496723175, "num_tokens": 114439175.0, "step": 7110 }, { "aux_loss": 8.089284420013428, "entropy": 0.15384032763540745, "epoch": 0.007115, "grad_norm": 0.15055975317955017, "learning_rate": 2e-05, "loss": 0.1828370451927185, "mean_token_accuracy": 0.9485554873943329, "num_tokens": 114519315.0, "step": 7115 }, { "aux_loss": 8.050078392028809, "entropy": 0.181279044598341, "epoch": 0.00712, "grad_norm": 0.13102883100509644, "learning_rate": 2e-05, "loss": 0.22407925128936768, "mean_token_accuracy": 0.9366942703723907, "num_tokens": 114600595.0, "step": 7120 }, { "aux_loss": 8.05292468070984, "entropy": 0.19039197117090226, "epoch": 0.007125, "grad_norm": 0.14553800225257874, "learning_rate": 2e-05, "loss": 0.2279196262359619, "mean_token_accuracy": 0.9349955052137375, "num_tokens": 114681650.0, "step": 7125 }, { "aux_loss": 8.056312847137452, "entropy": 0.1868167079985142, "epoch": 0.00713, "grad_norm": 0.12976329028606415, "learning_rate": 2e-05, "loss": 0.22218914031982423, "mean_token_accuracy": 0.9386069148778915, "num_tokens": 114762443.0, "step": 7130 }, { "aux_loss": 8.064145469665528, "entropy": 0.17997071743011475, "epoch": 0.007135, "grad_norm": 0.13100044429302216, "learning_rate": 2e-05, "loss": 0.20837724208831787, "mean_token_accuracy": 0.9420854121446609, "num_tokens": 114843149.0, "step": 7135 }, { "aux_loss": 8.072184228897095, "entropy": 0.15913472957909108, "epoch": 0.00714, "grad_norm": 0.1354636549949646, "learning_rate": 2e-05, "loss": 0.18547892570495605, "mean_token_accuracy": 0.9483176797628403, "num_tokens": 114923306.0, "step": 7140 }, { "aux_loss": 8.08354058265686, "entropy": 0.14665511325001718, "epoch": 0.007145, "grad_norm": 0.1437242180109024, "learning_rate": 2e-05, "loss": 0.1727093815803528, "mean_token_accuracy": 0.9517208278179169, "num_tokens": 115003325.0, "step": 7145 }, { "aux_loss": 8.05896463394165, "entropy": 0.1686363026499748, "epoch": 0.00715, "grad_norm": 0.15330128371715546, "learning_rate": 2e-05, "loss": 0.21119279861450196, "mean_token_accuracy": 0.9434751361608505, "num_tokens": 115081108.0, "step": 7150 }, { "aux_loss": 8.054275941848754, "entropy": 0.17525300458073617, "epoch": 0.007155, "grad_norm": 0.14003179967403412, "learning_rate": 2e-05, "loss": 0.21937448978424073, "mean_token_accuracy": 0.9394598424434661, "num_tokens": 115162274.0, "step": 7155 }, { "aux_loss": 8.056509160995484, "entropy": 0.1968074031174183, "epoch": 0.00716, "grad_norm": 0.1276974380016327, "learning_rate": 2e-05, "loss": 0.23514800071716307, "mean_token_accuracy": 0.9346697181463242, "num_tokens": 115243231.0, "step": 7160 }, { "aux_loss": 8.062007665634155, "entropy": 0.17011548653244973, "epoch": 0.007165, "grad_norm": 0.1272108405828476, "learning_rate": 2e-05, "loss": 0.19616918563842772, "mean_token_accuracy": 0.9454666316509247, "num_tokens": 115324054.0, "step": 7165 }, { "aux_loss": 8.068539762496949, "entropy": 0.16745559722185135, "epoch": 0.00717, "grad_norm": 0.12922310829162598, "learning_rate": 2e-05, "loss": 0.18886666297912597, "mean_token_accuracy": 0.9473625183105469, "num_tokens": 115404540.0, "step": 7170 }, { "aux_loss": 8.078390312194824, "entropy": 0.15166331827640533, "epoch": 0.007175, "grad_norm": 0.1345159262418747, "learning_rate": 2e-05, "loss": 0.17675564289093018, "mean_token_accuracy": 0.9505210280418396, "num_tokens": 115484724.0, "step": 7175 }, { "aux_loss": 8.06920928955078, "entropy": 0.16094010695815086, "epoch": 0.00718, "grad_norm": 0.13655336201190948, "learning_rate": 2e-05, "loss": 0.1940350890159607, "mean_token_accuracy": 0.9466844081878663, "num_tokens": 115562335.0, "step": 7180 }, { "aux_loss": 8.054381799697875, "entropy": 0.17820226773619652, "epoch": 0.007185, "grad_norm": 0.14267687499523163, "learning_rate": 2e-05, "loss": 0.22416069507598876, "mean_token_accuracy": 0.9382634341716767, "num_tokens": 115643339.0, "step": 7185 }, { "aux_loss": 8.057310247421265, "entropy": 0.19102592542767524, "epoch": 0.00719, "grad_norm": 0.14033392071723938, "learning_rate": 2e-05, "loss": 0.23336381912231446, "mean_token_accuracy": 0.9354314297437668, "num_tokens": 115724316.0, "step": 7190 }, { "aux_loss": 8.059385013580322, "entropy": 0.19008596166968345, "epoch": 0.007195, "grad_norm": 0.12919111549854279, "learning_rate": 2e-05, "loss": 0.21567316055297853, "mean_token_accuracy": 0.9399946600198745, "num_tokens": 115805291.0, "step": 7195 }, { "aux_loss": 8.062178421020509, "entropy": 0.1773022785782814, "epoch": 0.0072, "grad_norm": 0.1276605874300003, "learning_rate": 2e-05, "loss": 0.20061724185943602, "mean_token_accuracy": 0.9441809803247452, "num_tokens": 115886098.0, "step": 7200 }, { "aux_loss": 8.072524499893188, "entropy": 0.15648553147912025, "epoch": 0.007205, "grad_norm": 0.13309496641159058, "learning_rate": 2e-05, "loss": 0.1798306107521057, "mean_token_accuracy": 0.9506972104310989, "num_tokens": 115966782.0, "step": 7205 }, { "aux_loss": 8.072466135025024, "entropy": 0.1448201522231102, "epoch": 0.00721, "grad_norm": 0.13043193519115448, "learning_rate": 2e-05, "loss": 0.17662678956985473, "mean_token_accuracy": 0.9528814524412155, "num_tokens": 116046137.0, "step": 7210 }, { "aux_loss": 8.054290866851806, "entropy": 0.1953566338866949, "epoch": 0.007215, "grad_norm": 0.15037333965301514, "learning_rate": 2e-05, "loss": 0.24480528831481935, "mean_token_accuracy": 0.9315298944711685, "num_tokens": 116127333.0, "step": 7215 }, { "aux_loss": 8.055727910995483, "entropy": 0.18882788643240928, "epoch": 0.00722, "grad_norm": 0.13716623187065125, "learning_rate": 2e-05, "loss": 0.23057069778442382, "mean_token_accuracy": 0.937417060136795, "num_tokens": 116208330.0, "step": 7220 }, { "aux_loss": 8.059576272964478, "entropy": 0.1771923318505287, "epoch": 0.007225, "grad_norm": 0.1354140043258667, "learning_rate": 2e-05, "loss": 0.20474693775177003, "mean_token_accuracy": 0.9419525802135468, "num_tokens": 116289165.0, "step": 7225 }, { "aux_loss": 8.065571212768555, "entropy": 0.18347064033150673, "epoch": 0.00723, "grad_norm": 0.13612456619739532, "learning_rate": 2e-05, "loss": 0.2070516586303711, "mean_token_accuracy": 0.94222591817379, "num_tokens": 116369854.0, "step": 7230 }, { "aux_loss": 8.074532508850098, "entropy": 0.1525070745497942, "epoch": 0.007235, "grad_norm": 0.13450807332992554, "learning_rate": 2e-05, "loss": 0.17552847862243653, "mean_token_accuracy": 0.9517581731081008, "num_tokens": 116450659.0, "step": 7235 }, { "aux_loss": 8.07882218360901, "entropy": 0.14312020763754846, "epoch": 0.00724, "grad_norm": 0.1265956610441208, "learning_rate": 2e-05, "loss": 0.17811346054077148, "mean_token_accuracy": 0.9513128101825714, "num_tokens": 116529257.0, "step": 7240 }, { "aux_loss": 8.059095239639282, "entropy": 0.19069296047091483, "epoch": 0.007245, "grad_norm": 0.14973682165145874, "learning_rate": 2e-05, "loss": 0.2341454267501831, "mean_token_accuracy": 0.9352933436632156, "num_tokens": 116610855.0, "step": 7245 }, { "aux_loss": 8.055321168899535, "entropy": 0.18375627025961877, "epoch": 0.00725, "grad_norm": 0.12588109076023102, "learning_rate": 2e-05, "loss": 0.2217010259628296, "mean_token_accuracy": 0.93807832300663, "num_tokens": 116691708.0, "step": 7250 }, { "aux_loss": 8.059062385559082, "entropy": 0.17112191617488862, "epoch": 0.007255, "grad_norm": 0.12933211028575897, "learning_rate": 2e-05, "loss": 0.20111255645751952, "mean_token_accuracy": 0.9439534664154052, "num_tokens": 116772246.0, "step": 7255 }, { "aux_loss": 8.064316415786744, "entropy": 0.1701140858232975, "epoch": 0.00726, "grad_norm": 0.13094095885753632, "learning_rate": 2e-05, "loss": 0.19298509359359742, "mean_token_accuracy": 0.9466363191604614, "num_tokens": 116852645.0, "step": 7260 }, { "aux_loss": 8.070601797103881, "entropy": 0.16739392802119255, "epoch": 0.007265, "grad_norm": 0.14695289731025696, "learning_rate": 2e-05, "loss": 0.1961276888847351, "mean_token_accuracy": 0.945297583937645, "num_tokens": 116933229.0, "step": 7265 }, { "aux_loss": 8.08184199333191, "entropy": 0.1523813996464014, "epoch": 0.00727, "grad_norm": 0.13648247718811035, "learning_rate": 2e-05, "loss": 0.18260360956192018, "mean_token_accuracy": 0.9500061243772506, "num_tokens": 117011076.0, "step": 7270 }, { "aux_loss": 8.056529569625855, "entropy": 0.18706797063350677, "epoch": 0.007275, "grad_norm": 0.13587868213653564, "learning_rate": 2e-05, "loss": 0.23394424915313722, "mean_token_accuracy": 0.9364314496517181, "num_tokens": 117092640.0, "step": 7275 }, { "aux_loss": 8.05380277633667, "entropy": 0.18629618287086486, "epoch": 0.00728, "grad_norm": 0.17872829735279083, "learning_rate": 2e-05, "loss": 0.2321547508239746, "mean_token_accuracy": 0.936711460351944, "num_tokens": 117173746.0, "step": 7280 }, { "aux_loss": 8.05741114616394, "entropy": 0.1780652090907097, "epoch": 0.007285, "grad_norm": 0.12533755600452423, "learning_rate": 2e-05, "loss": 0.20582013130187987, "mean_token_accuracy": 0.9429244548082352, "num_tokens": 117254458.0, "step": 7285 }, { "aux_loss": 8.065899991989136, "entropy": 0.18077191561460496, "epoch": 0.00729, "grad_norm": 0.13414017856121063, "learning_rate": 2e-05, "loss": 0.20282549858093263, "mean_token_accuracy": 0.9424093931913375, "num_tokens": 117335127.0, "step": 7290 }, { "aux_loss": 8.071962690353393, "entropy": 0.16169586554169654, "epoch": 0.007295, "grad_norm": 0.1344667673110962, "learning_rate": 2e-05, "loss": 0.18243684768676757, "mean_token_accuracy": 0.9489847272634506, "num_tokens": 117416024.0, "step": 7295 }, { "aux_loss": 8.083722734451294, "entropy": 0.14176189824938773, "epoch": 0.0073, "grad_norm": 0.13662175834178925, "learning_rate": 2e-05, "loss": 0.17092795372009278, "mean_token_accuracy": 0.9530090302228927, "num_tokens": 117496453.0, "step": 7300 }, { "aux_loss": 8.057459402084351, "entropy": 0.17937030084431171, "epoch": 0.007305, "grad_norm": 0.13250751793384552, "learning_rate": 2e-05, "loss": 0.22172956466674804, "mean_token_accuracy": 0.9390877991914749, "num_tokens": 117577913.0, "step": 7305 }, { "aux_loss": 8.057992649078368, "entropy": 0.1838606558740139, "epoch": 0.00731, "grad_norm": 0.13557037711143494, "learning_rate": 2e-05, "loss": 0.23216652870178223, "mean_token_accuracy": 0.9359318941831589, "num_tokens": 117658940.0, "step": 7310 }, { "aux_loss": 8.056634569168091, "entropy": 0.17050421684980394, "epoch": 0.007315, "grad_norm": 0.127749502658844, "learning_rate": 2e-05, "loss": 0.20294065475463868, "mean_token_accuracy": 0.9430437445640564, "num_tokens": 117739805.0, "step": 7315 }, { "aux_loss": 8.063086032867432, "entropy": 0.17265646159648895, "epoch": 0.00732, "grad_norm": 0.12932780385017395, "learning_rate": 2e-05, "loss": 0.20049242973327636, "mean_token_accuracy": 0.9436680555343628, "num_tokens": 117819931.0, "step": 7320 }, { "aux_loss": 8.070355701446534, "entropy": 0.1700688511133194, "epoch": 0.007325, "grad_norm": 0.13648325204849243, "learning_rate": 2e-05, "loss": 0.19605551958084105, "mean_token_accuracy": 0.9448462516069412, "num_tokens": 117900606.0, "step": 7325 }, { "aux_loss": 8.08477554321289, "entropy": 0.151838706061244, "epoch": 0.00733, "grad_norm": 0.1555393785238266, "learning_rate": 2e-05, "loss": 0.17659342288970947, "mean_token_accuracy": 0.950711703300476, "num_tokens": 117981034.0, "step": 7330 }, { "aux_loss": 8.053568506240845, "entropy": 0.17783264219760894, "epoch": 0.007335, "grad_norm": 0.13863061368465424, "learning_rate": 2e-05, "loss": 0.21795213222503662, "mean_token_accuracy": 0.94056396484375, "num_tokens": 118058681.0, "step": 7335 }, { "aux_loss": 8.056577110290528, "entropy": 0.18549672774970533, "epoch": 0.00734, "grad_norm": 0.13383427262306213, "learning_rate": 2e-05, "loss": 0.22846200466156005, "mean_token_accuracy": 0.9356410890817642, "num_tokens": 118139985.0, "step": 7340 }, { "aux_loss": 8.055075359344482, "entropy": 0.18474764078855516, "epoch": 0.007345, "grad_norm": 0.1304062455892563, "learning_rate": 2e-05, "loss": 0.2212611675262451, "mean_token_accuracy": 0.9390469253063202, "num_tokens": 118220716.0, "step": 7345 }, { "aux_loss": 8.062121868133545, "entropy": 0.17709342762827873, "epoch": 0.00735, "grad_norm": 0.13126607239246368, "learning_rate": 2e-05, "loss": 0.20466187000274658, "mean_token_accuracy": 0.9431264877319336, "num_tokens": 118301339.0, "step": 7350 }, { "aux_loss": 8.069013690948486, "entropy": 0.16827764362096786, "epoch": 0.007355, "grad_norm": 0.13136102259159088, "learning_rate": 2e-05, "loss": 0.19352166652679442, "mean_token_accuracy": 0.9460424661636353, "num_tokens": 118382054.0, "step": 7355 }, { "aux_loss": 8.079519033432007, "entropy": 0.14911518841981888, "epoch": 0.00736, "grad_norm": 0.14757278561592102, "learning_rate": 2e-05, "loss": 0.17423219680786134, "mean_token_accuracy": 0.9520506620407104, "num_tokens": 118462143.0, "step": 7360 }, { "aux_loss": 8.061421775817871, "entropy": 0.15900407992303373, "epoch": 0.007365, "grad_norm": 0.1237441748380661, "learning_rate": 2e-05, "loss": 0.19232628345489503, "mean_token_accuracy": 0.9466270864009857, "num_tokens": 118541586.0, "step": 7365 }, { "aux_loss": 8.051958465576172, "entropy": 0.18195629641413688, "epoch": 0.00737, "grad_norm": 0.1475217193365097, "learning_rate": 2e-05, "loss": 0.2241210699081421, "mean_token_accuracy": 0.9381725996732712, "num_tokens": 118622519.0, "step": 7370 }, { "aux_loss": 8.054046058654786, "entropy": 0.17723673954606056, "epoch": 0.007375, "grad_norm": 0.127950981259346, "learning_rate": 2e-05, "loss": 0.21344656944274903, "mean_token_accuracy": 0.9404371291399002, "num_tokens": 118703590.0, "step": 7375 }, { "aux_loss": 8.062593698501587, "entropy": 0.17338769212365152, "epoch": 0.00738, "grad_norm": 0.13531026244163513, "learning_rate": 2e-05, "loss": 0.20329663753509522, "mean_token_accuracy": 0.9436062783002853, "num_tokens": 118784188.0, "step": 7380 }, { "aux_loss": 8.068348217010499, "entropy": 0.16674674972891806, "epoch": 0.007385, "grad_norm": 0.1276444047689438, "learning_rate": 2e-05, "loss": 0.18860353231430055, "mean_token_accuracy": 0.9473716080188751, "num_tokens": 118865016.0, "step": 7385 }, { "aux_loss": 8.079969835281371, "entropy": 0.15172515511512757, "epoch": 0.00739, "grad_norm": 0.15022414922714233, "learning_rate": 2e-05, "loss": 0.17702598571777345, "mean_token_accuracy": 0.9499790847301484, "num_tokens": 118944694.0, "step": 7390 }, { "aux_loss": 8.066068696975709, "entropy": 0.16314495652914046, "epoch": 0.007395, "grad_norm": 0.1417473405599594, "learning_rate": 2e-05, "loss": 0.20094895362854004, "mean_token_accuracy": 0.9441868036985397, "num_tokens": 119022092.0, "step": 7395 }, { "aux_loss": 8.052758121490479, "entropy": 0.1985016480088234, "epoch": 0.0074, "grad_norm": 0.13020913302898407, "learning_rate": 2e-05, "loss": 0.2348928451538086, "mean_token_accuracy": 0.9354265242815017, "num_tokens": 119103277.0, "step": 7400 }, { "aux_loss": 8.056073951721192, "entropy": 0.18207105696201326, "epoch": 0.007405, "grad_norm": 0.12403420358896255, "learning_rate": 2e-05, "loss": 0.22015740871429443, "mean_token_accuracy": 0.938755315542221, "num_tokens": 119184370.0, "step": 7405 }, { "aux_loss": 8.05927095413208, "entropy": 0.17326905950903893, "epoch": 0.00741, "grad_norm": 0.12449563294649124, "learning_rate": 2e-05, "loss": 0.2053593158721924, "mean_token_accuracy": 0.9431898385286331, "num_tokens": 119265148.0, "step": 7410 }, { "aux_loss": 8.068750143051147, "entropy": 0.17745597884058953, "epoch": 0.007415, "grad_norm": 0.13368143141269684, "learning_rate": 2e-05, "loss": 0.20241856575012207, "mean_token_accuracy": 0.9431264072656631, "num_tokens": 119346114.0, "step": 7415 }, { "aux_loss": 8.076086902618409, "entropy": 0.15370094850659372, "epoch": 0.00742, "grad_norm": 0.13952258229255676, "learning_rate": 2e-05, "loss": 0.18110870122909545, "mean_token_accuracy": 0.9495438784360886, "num_tokens": 119426614.0, "step": 7420 }, { "aux_loss": 8.067528915405273, "entropy": 0.15559654757380487, "epoch": 0.007425, "grad_norm": 0.14000247418880463, "learning_rate": 2e-05, "loss": 0.18898707628250122, "mean_token_accuracy": 0.9487629324197769, "num_tokens": 119506486.0, "step": 7425 }, { "aux_loss": 8.05845079421997, "entropy": 0.1831148162484169, "epoch": 0.00743, "grad_norm": 0.13033998012542725, "learning_rate": 2e-05, "loss": 0.22222542762756348, "mean_token_accuracy": 0.9379464477300644, "num_tokens": 119587735.0, "step": 7430 }, { "aux_loss": 8.05538592338562, "entropy": 0.2005470596253872, "epoch": 0.007435, "grad_norm": 0.14411033689975739, "learning_rate": 2e-05, "loss": 0.2414017915725708, "mean_token_accuracy": 0.9326531320810318, "num_tokens": 119668293.0, "step": 7435 }, { "aux_loss": 8.058018922805786, "entropy": 0.1771654523909092, "epoch": 0.00744, "grad_norm": 0.12871888279914856, "learning_rate": 2e-05, "loss": 0.20639445781707763, "mean_token_accuracy": 0.9422460258007049, "num_tokens": 119749331.0, "step": 7440 }, { "aux_loss": 8.064875555038451, "entropy": 0.17126045003533363, "epoch": 0.007445, "grad_norm": 0.13269393146038055, "learning_rate": 2e-05, "loss": 0.1968636155128479, "mean_token_accuracy": 0.9442877054214478, "num_tokens": 119829926.0, "step": 7445 }, { "aux_loss": 8.0713294506073, "entropy": 0.15380880497395993, "epoch": 0.00745, "grad_norm": 0.13929136097431183, "learning_rate": 2e-05, "loss": 0.18095406293869018, "mean_token_accuracy": 0.9498785108327865, "num_tokens": 119910651.0, "step": 7450 }, { "aux_loss": 8.074373769760133, "entropy": 0.16200978085398673, "epoch": 0.007455, "grad_norm": 0.12612785398960114, "learning_rate": 2e-05, "loss": 0.1933169960975647, "mean_token_accuracy": 0.9484478265047074, "num_tokens": 119988727.0, "step": 7455 }, { "aux_loss": 8.051265430450439, "entropy": 0.17319760657846928, "epoch": 0.00746, "grad_norm": 0.13716913759708405, "learning_rate": 2e-05, "loss": 0.21310434341430665, "mean_token_accuracy": 0.9411862343549728, "num_tokens": 120070092.0, "step": 7460 }, { "aux_loss": 8.053029489517211, "entropy": 0.19725120663642884, "epoch": 0.007465, "grad_norm": 0.13327398896217346, "learning_rate": 2e-05, "loss": 0.2380702018737793, "mean_token_accuracy": 0.9335362702608109, "num_tokens": 120151478.0, "step": 7465 }, { "aux_loss": 8.057619667053222, "entropy": 0.17242650762200357, "epoch": 0.00747, "grad_norm": 0.13533847033977509, "learning_rate": 2e-05, "loss": 0.20545673370361328, "mean_token_accuracy": 0.9422155261039734, "num_tokens": 120232252.0, "step": 7470 }, { "aux_loss": 8.064508438110352, "entropy": 0.17887631431221962, "epoch": 0.007475, "grad_norm": 0.13431933522224426, "learning_rate": 2e-05, "loss": 0.20763728618621827, "mean_token_accuracy": 0.941964665055275, "num_tokens": 120312653.0, "step": 7475 }, { "aux_loss": 8.071344709396362, "entropy": 0.16794106587767602, "epoch": 0.00748, "grad_norm": 0.15036065876483917, "learning_rate": 2e-05, "loss": 0.19158920049667358, "mean_token_accuracy": 0.9471013605594635, "num_tokens": 120392736.0, "step": 7480 }, { "aux_loss": 8.079354572296143, "entropy": 0.1548157688230276, "epoch": 0.007485, "grad_norm": 0.12153560668230057, "learning_rate": 2e-05, "loss": 0.18247909545898439, "mean_token_accuracy": 0.9490600466728211, "num_tokens": 120473263.0, "step": 7485 }, { "aux_loss": 8.051816368103028, "entropy": 0.176940343901515, "epoch": 0.00749, "grad_norm": 0.14291629195213318, "learning_rate": 2e-05, "loss": 0.21626551151275636, "mean_token_accuracy": 0.9405858308076859, "num_tokens": 120554642.0, "step": 7490 }, { "aux_loss": 8.054406261444091, "entropy": 0.1862452931702137, "epoch": 0.007495, "grad_norm": 0.1422058492898941, "learning_rate": 2e-05, "loss": 0.23038835525512696, "mean_token_accuracy": 0.9352040529251099, "num_tokens": 120635636.0, "step": 7495 }, { "aux_loss": 8.056235361099244, "entropy": 0.1768251147121191, "epoch": 0.0075, "grad_norm": 0.12467633932828903, "learning_rate": 2e-05, "loss": 0.21371710300445557, "mean_token_accuracy": 0.940923273563385, "num_tokens": 120716640.0, "step": 7500 }, { "aux_loss": 8.064361953735352, "entropy": 0.17170063331723212, "epoch": 0.007505, "grad_norm": 0.1362258344888687, "learning_rate": 2e-05, "loss": 0.19958794116973877, "mean_token_accuracy": 0.9444036543369293, "num_tokens": 120797337.0, "step": 7505 }, { "aux_loss": 8.071210527420044, "entropy": 0.16280821934342385, "epoch": 0.00751, "grad_norm": 0.1373574137687683, "learning_rate": 2e-05, "loss": 0.1837894558906555, "mean_token_accuracy": 0.9482373565435409, "num_tokens": 120877833.0, "step": 7510 }, { "aux_loss": 8.082080364227295, "entropy": 0.14672463983297349, "epoch": 0.007515, "grad_norm": 0.14578260481357574, "learning_rate": 2e-05, "loss": 0.16725674867630005, "mean_token_accuracy": 0.9539514601230621, "num_tokens": 120956989.0, "step": 7515 }, { "aux_loss": 8.047899627685547, "entropy": 0.1632910158485174, "epoch": 0.00752, "grad_norm": 0.14295019209384918, "learning_rate": 2e-05, "loss": 0.20444486141204835, "mean_token_accuracy": 0.9441313356161117, "num_tokens": 121038244.0, "step": 7520 }, { "aux_loss": 8.051692342758178, "entropy": 0.18788138255476952, "epoch": 0.007525, "grad_norm": 0.1524629294872284, "learning_rate": 2e-05, "loss": 0.23267843723297119, "mean_token_accuracy": 0.9353946089744568, "num_tokens": 121119392.0, "step": 7525 }, { "aux_loss": 8.056363153457642, "entropy": 0.18160314559936525, "epoch": 0.00753, "grad_norm": 0.13505490124225616, "learning_rate": 2e-05, "loss": 0.21701672077178955, "mean_token_accuracy": 0.9390973597764969, "num_tokens": 121200362.0, "step": 7530 }, { "aux_loss": 8.060441398620606, "entropy": 0.16757689155638217, "epoch": 0.007535, "grad_norm": 0.1300678253173828, "learning_rate": 2e-05, "loss": 0.19440244436264037, "mean_token_accuracy": 0.9457934498786926, "num_tokens": 121281028.0, "step": 7535 }, { "aux_loss": 8.068178510665893, "entropy": 0.17026686370372773, "epoch": 0.00754, "grad_norm": 0.13784855604171753, "learning_rate": 2e-05, "loss": 0.199432373046875, "mean_token_accuracy": 0.9441833674907685, "num_tokens": 121361445.0, "step": 7540 }, { "aux_loss": 8.075921297073364, "entropy": 0.14733664877712727, "epoch": 0.007545, "grad_norm": 0.14461226761341095, "learning_rate": 2e-05, "loss": 0.1730791449546814, "mean_token_accuracy": 0.9519186556339264, "num_tokens": 121441239.0, "step": 7545 }, { "aux_loss": 8.067001104354858, "entropy": 0.1626121636480093, "epoch": 0.00755, "grad_norm": 0.14616137742996216, "learning_rate": 2e-05, "loss": 0.20098023414611815, "mean_token_accuracy": 0.944268774986267, "num_tokens": 121518539.0, "step": 7550 }, { "aux_loss": 8.054377555847168, "entropy": 0.18031487762928008, "epoch": 0.007555, "grad_norm": 0.14393800497055054, "learning_rate": 2e-05, "loss": 0.22135207653045655, "mean_token_accuracy": 0.9373565286397934, "num_tokens": 121599628.0, "step": 7555 }, { "aux_loss": 8.05363154411316, "entropy": 0.17373102754354477, "epoch": 0.00756, "grad_norm": 0.13420702517032623, "learning_rate": 2e-05, "loss": 0.2052135467529297, "mean_token_accuracy": 0.9428716838359833, "num_tokens": 121680685.0, "step": 7560 }, { "aux_loss": 8.063855361938476, "entropy": 0.16535890772938727, "epoch": 0.007565, "grad_norm": 0.13558802008628845, "learning_rate": 2e-05, "loss": 0.19632102251052858, "mean_token_accuracy": 0.9453599065542221, "num_tokens": 121761568.0, "step": 7565 }, { "aux_loss": 8.070244646072387, "entropy": 0.16432089656591414, "epoch": 0.00757, "grad_norm": 0.13941632211208344, "learning_rate": 2e-05, "loss": 0.19304463863372803, "mean_token_accuracy": 0.9463385283946991, "num_tokens": 121842146.0, "step": 7570 }, { "aux_loss": 8.07728853225708, "entropy": 0.14477277621626855, "epoch": 0.007575, "grad_norm": 0.1449158489704132, "learning_rate": 2e-05, "loss": 0.16983110904693605, "mean_token_accuracy": 0.9528191447257995, "num_tokens": 121922136.0, "step": 7575 }, { "aux_loss": 8.065555381774903, "entropy": 0.15253821276128293, "epoch": 0.00758, "grad_norm": 0.12851905822753906, "learning_rate": 2e-05, "loss": 0.18775851726531984, "mean_token_accuracy": 0.9485505431890487, "num_tokens": 122002609.0, "step": 7580 }, { "aux_loss": 8.053164148330689, "entropy": 0.18466558493673801, "epoch": 0.007585, "grad_norm": 0.1372760385274887, "learning_rate": 2e-05, "loss": 0.22767891883850097, "mean_token_accuracy": 0.9371002525091171, "num_tokens": 122083285.0, "step": 7585 }, { "aux_loss": 8.055616188049317, "entropy": 0.1753864422440529, "epoch": 0.00759, "grad_norm": 0.1325058937072754, "learning_rate": 2e-05, "loss": 0.2120638370513916, "mean_token_accuracy": 0.940838199853897, "num_tokens": 122164375.0, "step": 7590 }, { "aux_loss": 8.060683679580688, "entropy": 0.169303497672081, "epoch": 0.007595, "grad_norm": 0.1259465217590332, "learning_rate": 2e-05, "loss": 0.19654493331909179, "mean_token_accuracy": 0.9455428004264832, "num_tokens": 122244917.0, "step": 7595 }, { "aux_loss": 8.065549325942992, "entropy": 0.15612652525305748, "epoch": 0.0076, "grad_norm": 0.12974722683429718, "learning_rate": 2e-05, "loss": 0.18145638704299927, "mean_token_accuracy": 0.9491685390472412, "num_tokens": 122325668.0, "step": 7600 }, { "aux_loss": 8.072974014282227, "entropy": 0.15129366442561148, "epoch": 0.007605, "grad_norm": 0.13044056296348572, "learning_rate": 2e-05, "loss": 0.18290570974349976, "mean_token_accuracy": 0.9489581197500229, "num_tokens": 122405878.0, "step": 7605 }, { "aux_loss": 8.066445779800414, "entropy": 0.16404522247612477, "epoch": 0.00761, "grad_norm": 0.12882989645004272, "learning_rate": 2e-05, "loss": 0.1982866883277893, "mean_token_accuracy": 0.9456588923931122, "num_tokens": 122484204.0, "step": 7610 }, { "aux_loss": 8.056326627731323, "entropy": 0.21864307895302773, "epoch": 0.007615, "grad_norm": 0.13727900385856628, "learning_rate": 2e-05, "loss": 0.2567129373550415, "mean_token_accuracy": 0.9283473819494248, "num_tokens": 122565009.0, "step": 7615 }, { "aux_loss": 8.05384349822998, "entropy": 0.1832655794918537, "epoch": 0.00762, "grad_norm": 0.13248056173324585, "learning_rate": 2e-05, "loss": 0.21849074363708496, "mean_token_accuracy": 0.9386864900588989, "num_tokens": 122645726.0, "step": 7620 }, { "aux_loss": 8.05781512260437, "entropy": 0.16786095947027208, "epoch": 0.007625, "grad_norm": 0.12765242159366608, "learning_rate": 2e-05, "loss": 0.19740880727767945, "mean_token_accuracy": 0.9447900116443634, "num_tokens": 122726776.0, "step": 7625 }, { "aux_loss": 8.065768098831176, "entropy": 0.1635085940361023, "epoch": 0.00763, "grad_norm": 0.1307392120361328, "learning_rate": 2e-05, "loss": 0.19003418684005738, "mean_token_accuracy": 0.9469250172376633, "num_tokens": 122807539.0, "step": 7630 }, { "aux_loss": 8.073894548416138, "entropy": 0.1470636773854494, "epoch": 0.007635, "grad_norm": 0.14527620375156403, "learning_rate": 2e-05, "loss": 0.17303662300109862, "mean_token_accuracy": 0.9513357639312744, "num_tokens": 122888085.0, "step": 7635 }, { "aux_loss": 8.072463321685792, "entropy": 0.14796018600463867, "epoch": 0.00764, "grad_norm": 0.15510867536067963, "learning_rate": 2e-05, "loss": 0.1794682741165161, "mean_token_accuracy": 0.9507189899682998, "num_tokens": 122966503.0, "step": 7640 }, { "aux_loss": 8.052925539016723, "entropy": 0.16258029043674468, "epoch": 0.007645, "grad_norm": 0.13088901340961456, "learning_rate": 2e-05, "loss": 0.2010512113571167, "mean_token_accuracy": 0.9435966789722443, "num_tokens": 123047905.0, "step": 7645 }, { "aux_loss": 8.054289102554321, "entropy": 0.18538018241524695, "epoch": 0.00765, "grad_norm": 0.15072676539421082, "learning_rate": 2e-05, "loss": 0.22367489337921143, "mean_token_accuracy": 0.9375688791275024, "num_tokens": 123129027.0, "step": 7650 }, { "aux_loss": 8.057654905319215, "entropy": 0.17644346468150615, "epoch": 0.007655, "grad_norm": 0.12897905707359314, "learning_rate": 2e-05, "loss": 0.21030006408691407, "mean_token_accuracy": 0.9423573017120361, "num_tokens": 123209763.0, "step": 7655 }, { "aux_loss": 8.067772102355956, "entropy": 0.17088019102811813, "epoch": 0.00766, "grad_norm": 0.1275871992111206, "learning_rate": 2e-05, "loss": 0.19940216541290284, "mean_token_accuracy": 0.944449645280838, "num_tokens": 123290106.0, "step": 7660 }, { "aux_loss": 8.07044243812561, "entropy": 0.15822128541767597, "epoch": 0.007665, "grad_norm": 0.1283460557460785, "learning_rate": 2e-05, "loss": 0.18370022773742675, "mean_token_accuracy": 0.9491430759429932, "num_tokens": 123370909.0, "step": 7665 }, { "aux_loss": 8.078686094284057, "entropy": 0.14930059984326363, "epoch": 0.00767, "grad_norm": 0.12206239998340607, "learning_rate": 2e-05, "loss": 0.17540135383605956, "mean_token_accuracy": 0.9517033100128174, "num_tokens": 123451278.0, "step": 7670 }, { "aux_loss": 8.051547527313232, "entropy": 0.17841746509075165, "epoch": 0.007675, "grad_norm": 0.12721508741378784, "learning_rate": 2e-05, "loss": 0.21916866302490234, "mean_token_accuracy": 0.9399241238832474, "num_tokens": 123532686.0, "step": 7675 }, { "aux_loss": 8.054313230514527, "entropy": 0.1667678453028202, "epoch": 0.00768, "grad_norm": 0.1395113617181778, "learning_rate": 2e-05, "loss": 0.20610229969024657, "mean_token_accuracy": 0.9425065070390701, "num_tokens": 123613871.0, "step": 7680 }, { "aux_loss": 8.05824065208435, "entropy": 0.1794706739485264, "epoch": 0.007685, "grad_norm": 0.13812685012817383, "learning_rate": 2e-05, "loss": 0.21608576774597169, "mean_token_accuracy": 0.9394313514232635, "num_tokens": 123694867.0, "step": 7685 }, { "aux_loss": 8.061620092391967, "entropy": 0.15949661284685135, "epoch": 0.00769, "grad_norm": 0.1312873512506485, "learning_rate": 2e-05, "loss": 0.18671815395355223, "mean_token_accuracy": 0.9473142325878143, "num_tokens": 123775333.0, "step": 7690 }, { "aux_loss": 8.069132089614868, "entropy": 0.16831732913851738, "epoch": 0.007695, "grad_norm": 0.1347435712814331, "learning_rate": 2e-05, "loss": 0.19773918390274048, "mean_token_accuracy": 0.9447491824626922, "num_tokens": 123855686.0, "step": 7695 }, { "aux_loss": 8.081768035888672, "entropy": 0.1415973886847496, "epoch": 0.0077, "grad_norm": 0.15629427134990692, "learning_rate": 2e-05, "loss": 0.16426509618759155, "mean_token_accuracy": 0.9545311212539673, "num_tokens": 123933075.0, "step": 7700 }, { "aux_loss": 8.051624774932861, "entropy": 0.17327583506703376, "epoch": 0.007705, "grad_norm": 0.12539736926555634, "learning_rate": 2e-05, "loss": 0.21044507026672363, "mean_token_accuracy": 0.9425005942583085, "num_tokens": 124014183.0, "step": 7705 }, { "aux_loss": 8.053359985351562, "entropy": 0.19304492510855198, "epoch": 0.00771, "grad_norm": 0.14401879906654358, "learning_rate": 2e-05, "loss": 0.2403738260269165, "mean_token_accuracy": 0.9334207534790039, "num_tokens": 124095638.0, "step": 7710 }, { "aux_loss": 8.053791809082032, "entropy": 0.1789645031094551, "epoch": 0.007715, "grad_norm": 0.12512809038162231, "learning_rate": 2e-05, "loss": 0.2131068229675293, "mean_token_accuracy": 0.9400732308626175, "num_tokens": 124176537.0, "step": 7715 }, { "aux_loss": 8.059452676773072, "entropy": 0.173047836124897, "epoch": 0.00772, "grad_norm": 0.12605106830596924, "learning_rate": 2e-05, "loss": 0.20206212997436523, "mean_token_accuracy": 0.9426600307226181, "num_tokens": 124257414.0, "step": 7720 }, { "aux_loss": 8.065120697021484, "entropy": 0.16913856267929078, "epoch": 0.007725, "grad_norm": 0.1334429383277893, "learning_rate": 2e-05, "loss": 0.19155629873275756, "mean_token_accuracy": 0.946245226264, "num_tokens": 124337538.0, "step": 7725 }, { "aux_loss": 8.078563451766968, "entropy": 0.15281990244984628, "epoch": 0.00773, "grad_norm": 0.16049043834209442, "learning_rate": 2e-05, "loss": 0.17544158697128295, "mean_token_accuracy": 0.9512608706951141, "num_tokens": 124417699.0, "step": 7730 }, { "aux_loss": 8.057663822174073, "entropy": 0.15443732179701328, "epoch": 0.007735, "grad_norm": 0.1292727142572403, "learning_rate": 2e-05, "loss": 0.19397801160812378, "mean_token_accuracy": 0.9491463840007782, "num_tokens": 124494889.0, "step": 7735 }, { "aux_loss": 8.052012920379639, "entropy": 0.17123932167887687, "epoch": 0.00774, "grad_norm": 0.1302178055047989, "learning_rate": 2e-05, "loss": 0.2160214900970459, "mean_token_accuracy": 0.9405649453401566, "num_tokens": 124576113.0, "step": 7740 }, { "aux_loss": 8.058313179016114, "entropy": 0.1709307014942169, "epoch": 0.007745, "grad_norm": 0.13111530244350433, "learning_rate": 2e-05, "loss": 0.20689597129821777, "mean_token_accuracy": 0.9426312148571014, "num_tokens": 124656747.0, "step": 7745 }, { "aux_loss": 8.057962608337402, "entropy": 0.17740309238433838, "epoch": 0.00775, "grad_norm": 0.1303430199623108, "learning_rate": 2e-05, "loss": 0.20656147003173828, "mean_token_accuracy": 0.9424556732177735, "num_tokens": 124737374.0, "step": 7750 }, { "aux_loss": 8.064849615097046, "entropy": 0.15833495184779167, "epoch": 0.007755, "grad_norm": 0.124373659491539, "learning_rate": 2e-05, "loss": 0.18394724130630494, "mean_token_accuracy": 0.9486096560955047, "num_tokens": 124817976.0, "step": 7755 }, { "aux_loss": 8.072395133972169, "entropy": 0.14352682642638684, "epoch": 0.00776, "grad_norm": 0.13774539530277252, "learning_rate": 2e-05, "loss": 0.1703740954399109, "mean_token_accuracy": 0.9524211406707763, "num_tokens": 124897912.0, "step": 7760 }, { "aux_loss": 8.066678285598755, "entropy": 0.16153050549328327, "epoch": 0.007765, "grad_norm": 0.13381630182266235, "learning_rate": 2e-05, "loss": 0.19915086030960083, "mean_token_accuracy": 0.9459080785512924, "num_tokens": 124978157.0, "step": 7765 }, { "aux_loss": 8.053351259231567, "entropy": 0.17324205189943315, "epoch": 0.00777, "grad_norm": 0.1400909423828125, "learning_rate": 2e-05, "loss": 0.215484094619751, "mean_token_accuracy": 0.9400692701339721, "num_tokens": 125058705.0, "step": 7770 }, { "aux_loss": 8.05493893623352, "entropy": 0.1917740911245346, "epoch": 0.007775, "grad_norm": 0.12173166126012802, "learning_rate": 2e-05, "loss": 0.22488539218902587, "mean_token_accuracy": 0.9369278907775879, "num_tokens": 125139991.0, "step": 7775 }, { "aux_loss": 8.058575105667114, "entropy": 0.1666221559047699, "epoch": 0.00778, "grad_norm": 0.13220971822738647, "learning_rate": 2e-05, "loss": 0.196097469329834, "mean_token_accuracy": 0.9448536068201066, "num_tokens": 125220978.0, "step": 7780 }, { "aux_loss": 8.065988111495972, "entropy": 0.16583029180765152, "epoch": 0.007785, "grad_norm": 0.1359696388244629, "learning_rate": 2e-05, "loss": 0.1912519931793213, "mean_token_accuracy": 0.946163147687912, "num_tokens": 125302057.0, "step": 7785 }, { "aux_loss": 8.07320785522461, "entropy": 0.15409406274557114, "epoch": 0.00779, "grad_norm": 0.1364138424396515, "learning_rate": 2e-05, "loss": 0.1849233865737915, "mean_token_accuracy": 0.9479338139295578, "num_tokens": 125382267.0, "step": 7790 }, { "aux_loss": 8.069149160385132, "entropy": 0.14468498453497886, "epoch": 0.007795, "grad_norm": 0.13282909989356995, "learning_rate": 2e-05, "loss": 0.1789170742034912, "mean_token_accuracy": 0.9510094195604324, "num_tokens": 125460965.0, "step": 7795 }, { "aux_loss": 8.052641677856446, "entropy": 0.1654026973992586, "epoch": 0.0078, "grad_norm": 0.13480037450790405, "learning_rate": 2e-05, "loss": 0.2051823377609253, "mean_token_accuracy": 0.9445670366287231, "num_tokens": 125542449.0, "step": 7800 }, { "aux_loss": 8.055175399780273, "entropy": 0.18958356529474257, "epoch": 0.007805, "grad_norm": 0.13398399949073792, "learning_rate": 2e-05, "loss": 0.22677903175354003, "mean_token_accuracy": 0.9368277102708816, "num_tokens": 125623439.0, "step": 7805 }, { "aux_loss": 8.056657552719116, "entropy": 0.18027772307395934, "epoch": 0.00781, "grad_norm": 0.12332537770271301, "learning_rate": 2e-05, "loss": 0.21051394939422607, "mean_token_accuracy": 0.9407501101493836, "num_tokens": 125704018.0, "step": 7810 }, { "aux_loss": 8.064786958694459, "entropy": 0.16789413020014762, "epoch": 0.007815, "grad_norm": 0.12678587436676025, "learning_rate": 2e-05, "loss": 0.19255117177963257, "mean_token_accuracy": 0.9461271107196808, "num_tokens": 125784608.0, "step": 7815 }, { "aux_loss": 8.070134830474853, "entropy": 0.1539592742919922, "epoch": 0.00782, "grad_norm": 0.1389128416776657, "learning_rate": 2e-05, "loss": 0.17781422138214112, "mean_token_accuracy": 0.9500072836875916, "num_tokens": 125865019.0, "step": 7820 }, { "aux_loss": 8.074520206451416, "entropy": 0.14029172472655774, "epoch": 0.007825, "grad_norm": 0.1327447146177292, "learning_rate": 2e-05, "loss": 0.17502390146255492, "mean_token_accuracy": 0.9525757849216461, "num_tokens": 125943171.0, "step": 7825 }, { "aux_loss": 8.052855587005615, "entropy": 0.1754423726350069, "epoch": 0.00783, "grad_norm": 0.1373121738433838, "learning_rate": 2e-05, "loss": 0.22010231018066406, "mean_token_accuracy": 0.9398065447807312, "num_tokens": 126024596.0, "step": 7830 }, { "aux_loss": 8.049565553665161, "entropy": 0.1772006146609783, "epoch": 0.007835, "grad_norm": 0.12699949741363525, "learning_rate": 2e-05, "loss": 0.21540539264678954, "mean_token_accuracy": 0.9408989787101746, "num_tokens": 126105305.0, "step": 7835 }, { "aux_loss": 8.05538649559021, "entropy": 0.1763097494840622, "epoch": 0.00784, "grad_norm": 0.1293422281742096, "learning_rate": 2e-05, "loss": 0.20866866111755372, "mean_token_accuracy": 0.9412191480398178, "num_tokens": 126185985.0, "step": 7840 }, { "aux_loss": 8.062546110153198, "entropy": 0.17701613903045654, "epoch": 0.007845, "grad_norm": 0.12797299027442932, "learning_rate": 2e-05, "loss": 0.20301802158355714, "mean_token_accuracy": 0.9436441868543625, "num_tokens": 126266332.0, "step": 7845 }, { "aux_loss": 8.068743419647216, "entropy": 0.15298430100083352, "epoch": 0.00785, "grad_norm": 0.13106869161128998, "learning_rate": 2e-05, "loss": 0.17925429344177246, "mean_token_accuracy": 0.9499890148639679, "num_tokens": 126346300.0, "step": 7850 }, { "aux_loss": 8.075567436218261, "entropy": 0.14626502506434919, "epoch": 0.007855, "grad_norm": 0.12238899618387222, "learning_rate": 2e-05, "loss": 0.17421101331710814, "mean_token_accuracy": 0.9522601574659347, "num_tokens": 126425009.0, "step": 7855 }, { "aux_loss": 8.054703283309937, "entropy": 0.1732068732380867, "epoch": 0.00786, "grad_norm": 0.13118509948253632, "learning_rate": 2e-05, "loss": 0.21082921028137208, "mean_token_accuracy": 0.9412829577922821, "num_tokens": 126506479.0, "step": 7860 }, { "aux_loss": 8.0575541973114, "entropy": 0.183889240026474, "epoch": 0.007865, "grad_norm": 0.16069471836090088, "learning_rate": 2e-05, "loss": 0.2293248653411865, "mean_token_accuracy": 0.9364004522562027, "num_tokens": 126587524.0, "step": 7865 }, { "aux_loss": 8.056588840484618, "entropy": 0.17077396139502526, "epoch": 0.00787, "grad_norm": 0.13866876065731049, "learning_rate": 2e-05, "loss": 0.20553219318389893, "mean_token_accuracy": 0.9434812992811203, "num_tokens": 126668412.0, "step": 7870 }, { "aux_loss": 8.06143045425415, "entropy": 0.17998394519090652, "epoch": 0.007875, "grad_norm": 0.13197578489780426, "learning_rate": 2e-05, "loss": 0.20621256828308104, "mean_token_accuracy": 0.9409545570611954, "num_tokens": 126749257.0, "step": 7875 }, { "aux_loss": 8.06725378036499, "entropy": 0.15875052027404307, "epoch": 0.00788, "grad_norm": 0.1366870254278183, "learning_rate": 2e-05, "loss": 0.18191620111465454, "mean_token_accuracy": 0.9497178018093109, "num_tokens": 126829294.0, "step": 7880 }, { "aux_loss": 8.076392650604248, "entropy": 0.14412251934409143, "epoch": 0.007885, "grad_norm": 0.1481265127658844, "learning_rate": 2e-05, "loss": 0.1692441701889038, "mean_token_accuracy": 0.9525374323129654, "num_tokens": 126909412.0, "step": 7885 }, { "aux_loss": 8.052158451080322, "entropy": 0.16255763173103333, "epoch": 0.00789, "grad_norm": 0.1406784951686859, "learning_rate": 2e-05, "loss": 0.20298330783843993, "mean_token_accuracy": 0.9450664490461349, "num_tokens": 126990584.0, "step": 7890 }, { "aux_loss": 8.050649499893188, "entropy": 0.18288838416337966, "epoch": 0.007895, "grad_norm": 0.1396569311618805, "learning_rate": 2e-05, "loss": 0.2286553144454956, "mean_token_accuracy": 0.9361393839120865, "num_tokens": 127071982.0, "step": 7895 }, { "aux_loss": 8.05613989830017, "entropy": 0.1704040512442589, "epoch": 0.0079, "grad_norm": 0.13003630936145782, "learning_rate": 2e-05, "loss": 0.202703857421875, "mean_token_accuracy": 0.9429990768432617, "num_tokens": 127152972.0, "step": 7900 }, { "aux_loss": 8.060097646713256, "entropy": 0.16928130351006984, "epoch": 0.007905, "grad_norm": 0.12603473663330078, "learning_rate": 2e-05, "loss": 0.19504098892211913, "mean_token_accuracy": 0.9456968605518341, "num_tokens": 127233770.0, "step": 7905 }, { "aux_loss": 8.06521725654602, "entropy": 0.15720516219735145, "epoch": 0.00791, "grad_norm": 0.13574708998203278, "learning_rate": 2e-05, "loss": 0.18702263832092286, "mean_token_accuracy": 0.9477150440216064, "num_tokens": 127313889.0, "step": 7910 }, { "aux_loss": 8.076163482666015, "entropy": 0.1441133599728346, "epoch": 0.007915, "grad_norm": 0.1436004936695099, "learning_rate": 2e-05, "loss": 0.172634494304657, "mean_token_accuracy": 0.9515066981315613, "num_tokens": 127394272.0, "step": 7915 }, { "aux_loss": 8.056488227844238, "entropy": 0.14625754654407502, "epoch": 0.00792, "grad_norm": 0.1260545551776886, "learning_rate": 2e-05, "loss": 0.1745867133140564, "mean_token_accuracy": 0.9520705491304398, "num_tokens": 127472076.0, "step": 7920 }, { "aux_loss": 8.053277969360352, "entropy": 0.18621368780732156, "epoch": 0.007925, "grad_norm": 0.12595397233963013, "learning_rate": 2e-05, "loss": 0.22350747585296632, "mean_token_accuracy": 0.9376633852720261, "num_tokens": 127552974.0, "step": 7925 }, { "aux_loss": 8.052712059020996, "entropy": 0.1803848709911108, "epoch": 0.00793, "grad_norm": 0.1303734928369522, "learning_rate": 2e-05, "loss": 0.2149219512939453, "mean_token_accuracy": 0.9405826300382614, "num_tokens": 127633891.0, "step": 7930 }, { "aux_loss": 8.056089830398559, "entropy": 0.1527490597218275, "epoch": 0.007935, "grad_norm": 0.13994599878787994, "learning_rate": 2e-05, "loss": 0.18676354885101318, "mean_token_accuracy": 0.9470791161060333, "num_tokens": 127714652.0, "step": 7935 }, { "aux_loss": 8.060953140258789, "entropy": 0.16185988783836364, "epoch": 0.00794, "grad_norm": 0.13381613790988922, "learning_rate": 2e-05, "loss": 0.19044151306152343, "mean_token_accuracy": 0.9470368057489396, "num_tokens": 127795393.0, "step": 7940 }, { "aux_loss": 8.070991706848144, "entropy": 0.15282550193369387, "epoch": 0.007945, "grad_norm": 0.1395682543516159, "learning_rate": 2e-05, "loss": 0.1772878050804138, "mean_token_accuracy": 0.9517181694507599, "num_tokens": 127875299.0, "step": 7945 }, { "aux_loss": 8.065530252456664, "entropy": 0.149153945595026, "epoch": 0.00795, "grad_norm": 0.13513027131557465, "learning_rate": 2e-05, "loss": 0.18359854221343994, "mean_token_accuracy": 0.9488667905330658, "num_tokens": 127956214.0, "step": 7950 }, { "aux_loss": 8.051602363586426, "entropy": 0.17141111344099044, "epoch": 0.007955, "grad_norm": 0.13007114827632904, "learning_rate": 2e-05, "loss": 0.21193037033081055, "mean_token_accuracy": 0.941623193025589, "num_tokens": 128037138.0, "step": 7955 }, { "aux_loss": 8.055979585647583, "entropy": 0.16566436626017095, "epoch": 0.00796, "grad_norm": 0.12722444534301758, "learning_rate": 2e-05, "loss": 0.19971907138824463, "mean_token_accuracy": 0.9445472031831741, "num_tokens": 128118108.0, "step": 7960 }, { "aux_loss": 8.057784366607667, "entropy": 0.1565207026898861, "epoch": 0.007965, "grad_norm": 0.12743087112903595, "learning_rate": 2e-05, "loss": 0.18870077133178711, "mean_token_accuracy": 0.947584468126297, "num_tokens": 128198916.0, "step": 7965 }, { "aux_loss": 8.065590524673462, "entropy": 0.1583856925368309, "epoch": 0.00797, "grad_norm": 0.1353423297405243, "learning_rate": 2e-05, "loss": 0.18316779136657715, "mean_token_accuracy": 0.9478757351636886, "num_tokens": 128279609.0, "step": 7970 }, { "aux_loss": 8.072882652282715, "entropy": 0.14844279438257219, "epoch": 0.007975, "grad_norm": 0.14464455842971802, "learning_rate": 2e-05, "loss": 0.17363022565841674, "mean_token_accuracy": 0.9515461266040802, "num_tokens": 128359551.0, "step": 7975 }, { "aux_loss": 8.0706711769104, "entropy": 0.143844673037529, "epoch": 0.00798, "grad_norm": 0.1265324205160141, "learning_rate": 2e-05, "loss": 0.1778017044067383, "mean_token_accuracy": 0.9520799815654755, "num_tokens": 128437018.0, "step": 7980 }, { "aux_loss": 8.053995752334595, "entropy": 0.16581640467047692, "epoch": 0.007985, "grad_norm": 0.14176373183727264, "learning_rate": 2e-05, "loss": 0.21161484718322754, "mean_token_accuracy": 0.9414434880018234, "num_tokens": 128518006.0, "step": 7985 }, { "aux_loss": 8.051170873641968, "entropy": 0.17790948115289212, "epoch": 0.00799, "grad_norm": 0.1317165195941925, "learning_rate": 2e-05, "loss": 0.21526544094085692, "mean_token_accuracy": 0.9398356437683105, "num_tokens": 128598913.0, "step": 7990 }, { "aux_loss": 8.054621934890747, "entropy": 0.16488940343260766, "epoch": 0.007995, "grad_norm": 0.12735776603221893, "learning_rate": 2e-05, "loss": 0.19196200370788574, "mean_token_accuracy": 0.9462250411510468, "num_tokens": 128679788.0, "step": 7995 }, { "aux_loss": 8.060392284393311, "entropy": 0.1674186483025551, "epoch": 0.008, "grad_norm": 0.13624000549316406, "learning_rate": 2e-05, "loss": 0.1934329390525818, "mean_token_accuracy": 0.9455029308795929, "num_tokens": 128760490.0, "step": 8000 }, { "aux_loss": 8.070809412002564, "entropy": 0.1470926396548748, "epoch": 0.008005, "grad_norm": 0.13767880201339722, "learning_rate": 2e-05, "loss": 0.17155596017837524, "mean_token_accuracy": 0.9519717872142792, "num_tokens": 128840501.0, "step": 8005 }, { "aux_loss": 8.070143985748292, "entropy": 0.14362324588000774, "epoch": 0.00801, "grad_norm": 0.11937398463487625, "learning_rate": 2e-05, "loss": 0.17357660531997682, "mean_token_accuracy": 0.9517420142889023, "num_tokens": 128919701.0, "step": 8010 }, { "aux_loss": 8.05161256790161, "entropy": 0.1736305795609951, "epoch": 0.008015, "grad_norm": 0.14193867146968842, "learning_rate": 2e-05, "loss": 0.21575624942779542, "mean_token_accuracy": 0.9399879932403564, "num_tokens": 129001254.0, "step": 8015 }, { "aux_loss": 8.052344560623169, "entropy": 0.17643555104732514, "epoch": 0.00802, "grad_norm": 0.1344258338212967, "learning_rate": 2e-05, "loss": 0.21650593280792235, "mean_token_accuracy": 0.9389111161231994, "num_tokens": 129082013.0, "step": 8020 }, { "aux_loss": 8.055804872512818, "entropy": 0.16876336000859737, "epoch": 0.008025, "grad_norm": 0.1343068927526474, "learning_rate": 2e-05, "loss": 0.20226428508758545, "mean_token_accuracy": 0.9438631623983383, "num_tokens": 129163035.0, "step": 8025 }, { "aux_loss": 8.059794282913208, "entropy": 0.16408565491437913, "epoch": 0.00803, "grad_norm": 0.13268572092056274, "learning_rate": 2e-05, "loss": 0.1947793483734131, "mean_token_accuracy": 0.9456487149000168, "num_tokens": 129243298.0, "step": 8030 }, { "aux_loss": 8.068254852294922, "entropy": 0.15262793451547624, "epoch": 0.008035, "grad_norm": 0.134384423494339, "learning_rate": 2e-05, "loss": 0.17796486616134644, "mean_token_accuracy": 0.9506339967250824, "num_tokens": 129323881.0, "step": 8035 }, { "aux_loss": 8.0743483543396, "entropy": 0.14847229681909085, "epoch": 0.00804, "grad_norm": 0.12602965533733368, "learning_rate": 2e-05, "loss": 0.17821271419525148, "mean_token_accuracy": 0.9505399107933045, "num_tokens": 129403401.0, "step": 8040 }, { "aux_loss": 8.048740434646607, "entropy": 0.1746581345796585, "epoch": 0.008045, "grad_norm": 0.13220183551311493, "learning_rate": 2e-05, "loss": 0.21524398326873778, "mean_token_accuracy": 0.9402400761842727, "num_tokens": 129484815.0, "step": 8045 }, { "aux_loss": 8.051606273651123, "entropy": 0.19396723434329033, "epoch": 0.00805, "grad_norm": 0.15582771599292755, "learning_rate": 2e-05, "loss": 0.23267974853515624, "mean_token_accuracy": 0.9352190732955933, "num_tokens": 129566009.0, "step": 8050 }, { "aux_loss": 8.053307962417602, "entropy": 0.1655742671340704, "epoch": 0.008055, "grad_norm": 0.12590418756008148, "learning_rate": 2e-05, "loss": 0.1977403163909912, "mean_token_accuracy": 0.9455384075641632, "num_tokens": 129647119.0, "step": 8055 }, { "aux_loss": 8.056657075881958, "entropy": 0.16041493639349938, "epoch": 0.00806, "grad_norm": 0.12716123461723328, "learning_rate": 2e-05, "loss": 0.1873391389846802, "mean_token_accuracy": 0.9478627860546112, "num_tokens": 129727915.0, "step": 8060 }, { "aux_loss": 8.06365156173706, "entropy": 0.1458283070474863, "epoch": 0.008065, "grad_norm": 0.13084760308265686, "learning_rate": 2e-05, "loss": 0.1737341284751892, "mean_token_accuracy": 0.9514607548713684, "num_tokens": 129808142.0, "step": 8065 }, { "aux_loss": 8.072865676879882, "entropy": 0.1436923887580633, "epoch": 0.00807, "grad_norm": 0.12995615601539612, "learning_rate": 2e-05, "loss": 0.17381809949874877, "mean_token_accuracy": 0.9522612005472183, "num_tokens": 129888034.0, "step": 8070 }, { "aux_loss": 8.050793600082397, "entropy": 0.16842188835144042, "epoch": 0.008075, "grad_norm": 0.13960705697536469, "learning_rate": 2e-05, "loss": 0.2096801519393921, "mean_token_accuracy": 0.9427917838096619, "num_tokens": 129969336.0, "step": 8075 }, { "aux_loss": 8.051363229751587, "entropy": 0.16905580945312976, "epoch": 0.00808, "grad_norm": 0.13340699672698975, "learning_rate": 2e-05, "loss": 0.20787465572357178, "mean_token_accuracy": 0.9414985030889511, "num_tokens": 130050704.0, "step": 8080 }, { "aux_loss": 8.05513892173767, "entropy": 0.17234189957380294, "epoch": 0.008085, "grad_norm": 0.12723803520202637, "learning_rate": 2e-05, "loss": 0.205952787399292, "mean_token_accuracy": 0.9429928481578826, "num_tokens": 130131685.0, "step": 8085 }, { "aux_loss": 8.060874843597412, "entropy": 0.16077012233436108, "epoch": 0.00809, "grad_norm": 0.12754301726818085, "learning_rate": 2e-05, "loss": 0.18734116554260255, "mean_token_accuracy": 0.947236305475235, "num_tokens": 130212333.0, "step": 8090 }, { "aux_loss": 8.067550802230835, "entropy": 0.1531975518912077, "epoch": 0.008095, "grad_norm": 0.13674671947956085, "learning_rate": 2e-05, "loss": 0.17868854999542236, "mean_token_accuracy": 0.950370478630066, "num_tokens": 130292662.0, "step": 8095 }, { "aux_loss": 8.078342294692993, "entropy": 0.13891354911029338, "epoch": 0.0081, "grad_norm": 0.1541026383638382, "learning_rate": 2e-05, "loss": 0.16874922513961793, "mean_token_accuracy": 0.9530214101076127, "num_tokens": 130372981.0, "step": 8100 }, { "aux_loss": 8.051136112213134, "entropy": 0.1572195865213871, "epoch": 0.008105, "grad_norm": 0.14138002693653107, "learning_rate": 2e-05, "loss": 0.19828492403030396, "mean_token_accuracy": 0.9464273273944854, "num_tokens": 130454458.0, "step": 8105 }, { "aux_loss": 8.054611682891846, "entropy": 0.1773559059947729, "epoch": 0.00811, "grad_norm": 0.13690850138664246, "learning_rate": 2e-05, "loss": 0.21153836250305175, "mean_token_accuracy": 0.9408694803714752, "num_tokens": 130535536.0, "step": 8110 }, { "aux_loss": 8.0561372756958, "entropy": 0.18155391663312911, "epoch": 0.008115, "grad_norm": 0.13156554102897644, "learning_rate": 2e-05, "loss": 0.21547298431396483, "mean_token_accuracy": 0.940059581398964, "num_tokens": 130616282.0, "step": 8115 }, { "aux_loss": 8.061676025390625, "entropy": 0.15969658866524697, "epoch": 0.00812, "grad_norm": 0.12900713086128235, "learning_rate": 2e-05, "loss": 0.18574862480163573, "mean_token_accuracy": 0.948108771443367, "num_tokens": 130697326.0, "step": 8120 }, { "aux_loss": 8.068650913238525, "entropy": 0.15999038219451905, "epoch": 0.008125, "grad_norm": 0.14218170940876007, "learning_rate": 2e-05, "loss": 0.18584848642349244, "mean_token_accuracy": 0.9481202960014343, "num_tokens": 130777453.0, "step": 8125 }, { "aux_loss": 8.077187442779541, "entropy": 0.14273985028266906, "epoch": 0.00813, "grad_norm": 0.13563385605812073, "learning_rate": 2e-05, "loss": 0.17152726650238037, "mean_token_accuracy": 0.9528078377246857, "num_tokens": 130857778.0, "step": 8130 }, { "aux_loss": 8.053657245635986, "entropy": 0.14082985408604146, "epoch": 0.008135, "grad_norm": 0.14208555221557617, "learning_rate": 2e-05, "loss": 0.1782923698425293, "mean_token_accuracy": 0.9514079868793488, "num_tokens": 130936964.0, "step": 8135 }, { "aux_loss": 8.055822563171386, "entropy": 0.17075503170490264, "epoch": 0.00814, "grad_norm": 0.1350121647119522, "learning_rate": 2e-05, "loss": 0.20721492767333985, "mean_token_accuracy": 0.9425066232681274, "num_tokens": 131018374.0, "step": 8140 }, { "aux_loss": 8.053418064117432, "entropy": 0.15526145249605178, "epoch": 0.008145, "grad_norm": 0.13038256764411926, "learning_rate": 2e-05, "loss": 0.18912750482559204, "mean_token_accuracy": 0.9473474532365799, "num_tokens": 131099411.0, "step": 8145 }, { "aux_loss": 8.057427453994752, "entropy": 0.15396433770656587, "epoch": 0.00815, "grad_norm": 0.1316199153661728, "learning_rate": 2e-05, "loss": 0.18397905826568603, "mean_token_accuracy": 0.9487013101577759, "num_tokens": 131179905.0, "step": 8150 }, { "aux_loss": 8.063847064971924, "entropy": 0.1535062536597252, "epoch": 0.008155, "grad_norm": 0.1289980262517929, "learning_rate": 2e-05, "loss": 0.184206759929657, "mean_token_accuracy": 0.9487711012363433, "num_tokens": 131260460.0, "step": 8155 }, { "aux_loss": 8.072390508651733, "entropy": 0.14371876530349253, "epoch": 0.00816, "grad_norm": 0.1354750245809555, "learning_rate": 2e-05, "loss": 0.16831915378570556, "mean_token_accuracy": 0.9534879624843597, "num_tokens": 131340247.0, "step": 8160 }, { "aux_loss": 8.063643741607667, "entropy": 0.16286289542913437, "epoch": 0.008165, "grad_norm": 0.13989847898483276, "learning_rate": 2e-05, "loss": 0.19906128644943238, "mean_token_accuracy": 0.9450865864753724, "num_tokens": 131419822.0, "step": 8165 }, { "aux_loss": 8.052569580078124, "entropy": 0.17371668070554733, "epoch": 0.00817, "grad_norm": 0.13841158151626587, "learning_rate": 2e-05, "loss": 0.21525461673736573, "mean_token_accuracy": 0.9402058362960816, "num_tokens": 131501314.0, "step": 8170 }, { "aux_loss": 8.05364236831665, "entropy": 0.16507818698883056, "epoch": 0.008175, "grad_norm": 0.12713953852653503, "learning_rate": 2e-05, "loss": 0.19896907806396485, "mean_token_accuracy": 0.9446077913045883, "num_tokens": 131582432.0, "step": 8175 }, { "aux_loss": 8.05719633102417, "entropy": 0.15961042642593384, "epoch": 0.00818, "grad_norm": 0.12847581505775452, "learning_rate": 2e-05, "loss": 0.18849375247955322, "mean_token_accuracy": 0.9474297881126403, "num_tokens": 131662760.0, "step": 8180 }, { "aux_loss": 8.065714836120605, "entropy": 0.15520738139748574, "epoch": 0.008185, "grad_norm": 0.128628671169281, "learning_rate": 2e-05, "loss": 0.18253229856491088, "mean_token_accuracy": 0.9487132281064987, "num_tokens": 131743360.0, "step": 8185 }, { "aux_loss": 8.073528146743774, "entropy": 0.14960686787962912, "epoch": 0.00819, "grad_norm": 0.13791678845882416, "learning_rate": 2e-05, "loss": 0.1772822380065918, "mean_token_accuracy": 0.9508191347122192, "num_tokens": 131823293.0, "step": 8190 }, { "aux_loss": 8.069000148773194, "entropy": 0.14849095791578293, "epoch": 0.008195, "grad_norm": 0.1389141082763672, "learning_rate": 2e-05, "loss": 0.17870173454284669, "mean_token_accuracy": 0.95055011510849, "num_tokens": 131900144.0, "step": 8195 }, { "aux_loss": 8.05020546913147, "entropy": 0.1647246763110161, "epoch": 0.0082, "grad_norm": 0.13321228325366974, "learning_rate": 2e-05, "loss": 0.2091508388519287, "mean_token_accuracy": 0.9420828849077225, "num_tokens": 131980926.0, "step": 8200 }, { "aux_loss": 8.053854846954346, "entropy": 0.15634859763085843, "epoch": 0.008205, "grad_norm": 0.13224320113658905, "learning_rate": 2e-05, "loss": 0.19497339725494384, "mean_token_accuracy": 0.9453929275274277, "num_tokens": 132062090.0, "step": 8205 }, { "aux_loss": 8.054818630218506, "entropy": 0.1541820175945759, "epoch": 0.00821, "grad_norm": 0.12972988188266754, "learning_rate": 2e-05, "loss": 0.18355741500854492, "mean_token_accuracy": 0.9486854493618011, "num_tokens": 132142939.0, "step": 8210 }, { "aux_loss": 8.062036609649658, "entropy": 0.15288175493478776, "epoch": 0.008215, "grad_norm": 0.11998964101076126, "learning_rate": 2e-05, "loss": 0.1793956995010376, "mean_token_accuracy": 0.9495918989181519, "num_tokens": 132223672.0, "step": 8215 }, { "aux_loss": 8.073719263076782, "entropy": 0.14733343049883843, "epoch": 0.00822, "grad_norm": 0.14416344463825226, "learning_rate": 2e-05, "loss": 0.17541441917419434, "mean_token_accuracy": 0.950934499502182, "num_tokens": 132303650.0, "step": 8220 }, { "aux_loss": 8.063137292861938, "entropy": 0.14231124371290207, "epoch": 0.008225, "grad_norm": 0.12300004810094833, "learning_rate": 2e-05, "loss": 0.17548067569732667, "mean_token_accuracy": 0.9528339743614197, "num_tokens": 132383299.0, "step": 8225 }, { "aux_loss": 8.054024934768677, "entropy": 0.1865336313843727, "epoch": 0.00823, "grad_norm": 0.12891030311584473, "learning_rate": 2e-05, "loss": 0.2253323793411255, "mean_token_accuracy": 0.936671644449234, "num_tokens": 132464255.0, "step": 8230 }, { "aux_loss": 8.052585649490357, "entropy": 0.1659695204347372, "epoch": 0.008235, "grad_norm": 0.1280297040939331, "learning_rate": 2e-05, "loss": 0.20176198482513427, "mean_token_accuracy": 0.9440831243991852, "num_tokens": 132545373.0, "step": 8235 }, { "aux_loss": 8.057102346420288, "entropy": 0.15998641178011894, "epoch": 0.00824, "grad_norm": 0.12822078168392181, "learning_rate": 2e-05, "loss": 0.18847664594650268, "mean_token_accuracy": 0.9475738674402236, "num_tokens": 132625981.0, "step": 8240 }, { "aux_loss": 8.060812997817994, "entropy": 0.16090417951345443, "epoch": 0.008245, "grad_norm": 0.12101796269416809, "learning_rate": 2e-05, "loss": 0.1924592971801758, "mean_token_accuracy": 0.9462516725063324, "num_tokens": 132706743.0, "step": 8245 }, { "aux_loss": 8.070701217651367, "entropy": 0.145225390791893, "epoch": 0.00825, "grad_norm": 0.14184513688087463, "learning_rate": 2e-05, "loss": 0.17299001216888427, "mean_token_accuracy": 0.9512601137161255, "num_tokens": 132787061.0, "step": 8250 }, { "aux_loss": 8.070589399337768, "entropy": 0.13938662335276603, "epoch": 0.008255, "grad_norm": 0.12141731381416321, "learning_rate": 2e-05, "loss": 0.1703873634338379, "mean_token_accuracy": 0.9535843312740326, "num_tokens": 132866564.0, "step": 8255 }, { "aux_loss": 8.052244663238525, "entropy": 0.17886133380234243, "epoch": 0.00826, "grad_norm": 0.1335018426179886, "learning_rate": 2e-05, "loss": 0.21689348220825194, "mean_token_accuracy": 0.9410188883543015, "num_tokens": 132947556.0, "step": 8260 }, { "aux_loss": 8.050800132751466, "entropy": 0.1688988868147135, "epoch": 0.008265, "grad_norm": 0.1476362943649292, "learning_rate": 2e-05, "loss": 0.20815763473510743, "mean_token_accuracy": 0.942469248175621, "num_tokens": 133028724.0, "step": 8265 }, { "aux_loss": 8.057167053222656, "entropy": 0.16154177039861678, "epoch": 0.00827, "grad_norm": 0.13477906584739685, "learning_rate": 2e-05, "loss": 0.1949950337409973, "mean_token_accuracy": 0.9448888748884201, "num_tokens": 133109722.0, "step": 8270 }, { "aux_loss": 8.06676697731018, "entropy": 0.15860776528716086, "epoch": 0.008275, "grad_norm": 0.13367654383182526, "learning_rate": 2e-05, "loss": 0.18534401655197144, "mean_token_accuracy": 0.9481903582811355, "num_tokens": 133190601.0, "step": 8275 }, { "aux_loss": 8.070173358917236, "entropy": 0.14624718800187111, "epoch": 0.00828, "grad_norm": 0.13547837734222412, "learning_rate": 2e-05, "loss": 0.1699145793914795, "mean_token_accuracy": 0.9528974741697311, "num_tokens": 133270725.0, "step": 8280 }, { "aux_loss": 8.068696594238281, "entropy": 0.14652694389224052, "epoch": 0.008285, "grad_norm": 0.12477568536996841, "learning_rate": 2e-05, "loss": 0.17745449542999267, "mean_token_accuracy": 0.9509728610515594, "num_tokens": 133350981.0, "step": 8285 }, { "aux_loss": 8.051817417144775, "entropy": 0.16215978749096394, "epoch": 0.00829, "grad_norm": 0.13373258709907532, "learning_rate": 2e-05, "loss": 0.20403625965118408, "mean_token_accuracy": 0.9429250538349152, "num_tokens": 133432006.0, "step": 8290 }, { "aux_loss": 8.052235221862793, "entropy": 0.16459218487143518, "epoch": 0.008295, "grad_norm": 0.13437971472740173, "learning_rate": 2e-05, "loss": 0.20010752677917482, "mean_token_accuracy": 0.9441726863384247, "num_tokens": 133513057.0, "step": 8295 }, { "aux_loss": 8.056406164169312, "entropy": 0.16486706621944905, "epoch": 0.0083, "grad_norm": 0.13076648116111755, "learning_rate": 2e-05, "loss": 0.19752124547958375, "mean_token_accuracy": 0.9446148037910461, "num_tokens": 133593871.0, "step": 8300 }, { "aux_loss": 8.061829566955566, "entropy": 0.15138532780110836, "epoch": 0.008305, "grad_norm": 0.1317295879125595, "learning_rate": 2e-05, "loss": 0.1803811311721802, "mean_token_accuracy": 0.9497204631567001, "num_tokens": 133674497.0, "step": 8305 }, { "aux_loss": 8.069890785217286, "entropy": 0.14223296083509923, "epoch": 0.00831, "grad_norm": 0.13315069675445557, "learning_rate": 2e-05, "loss": 0.16793813705444335, "mean_token_accuracy": 0.9531345009803772, "num_tokens": 133754710.0, "step": 8310 }, { "aux_loss": 8.069337129592896, "entropy": 0.14927798248827456, "epoch": 0.008315, "grad_norm": 0.1374337375164032, "learning_rate": 2e-05, "loss": 0.1796567440032959, "mean_token_accuracy": 0.9504870891571044, "num_tokens": 133834987.0, "step": 8315 }, { "aux_loss": 8.053461647033691, "entropy": 0.16906164549291133, "epoch": 0.00832, "grad_norm": 0.13867270946502686, "learning_rate": 2e-05, "loss": 0.21054699420928955, "mean_token_accuracy": 0.9407571345567703, "num_tokens": 133916106.0, "step": 8320 }, { "aux_loss": 8.0525053024292, "entropy": 0.16746328137814998, "epoch": 0.008325, "grad_norm": 0.13184724748134613, "learning_rate": 2e-05, "loss": 0.20621328353881835, "mean_token_accuracy": 0.9427377462387085, "num_tokens": 133996984.0, "step": 8325 }, { "aux_loss": 8.055532121658326, "entropy": 0.1552527479827404, "epoch": 0.00833, "grad_norm": 0.12123899161815643, "learning_rate": 2e-05, "loss": 0.1862831234931946, "mean_token_accuracy": 0.9481147855520249, "num_tokens": 134077744.0, "step": 8330 }, { "aux_loss": 8.060292482376099, "entropy": 0.15543766990303992, "epoch": 0.008335, "grad_norm": 0.13376720249652863, "learning_rate": 2e-05, "loss": 0.18655211925506593, "mean_token_accuracy": 0.948227059841156, "num_tokens": 134158621.0, "step": 8335 }, { "aux_loss": 8.065773534774781, "entropy": 0.14543639309704304, "epoch": 0.00834, "grad_norm": 0.1333523690700531, "learning_rate": 2e-05, "loss": 0.17411571741104126, "mean_token_accuracy": 0.9517302125692367, "num_tokens": 134239428.0, "step": 8340 }, { "aux_loss": 8.07011046409607, "entropy": 0.13980746679008008, "epoch": 0.008345, "grad_norm": 0.13500382006168365, "learning_rate": 2e-05, "loss": 0.16771507263183594, "mean_token_accuracy": 0.9539576590061187, "num_tokens": 134318586.0, "step": 8345 }, { "aux_loss": 8.050806093215943, "entropy": 0.1748618222773075, "epoch": 0.00835, "grad_norm": 0.12813574075698853, "learning_rate": 2e-05, "loss": 0.21088182926177979, "mean_token_accuracy": 0.9425250440835953, "num_tokens": 134399942.0, "step": 8350 }, { "aux_loss": 8.050401067733764, "entropy": 0.16043828427791595, "epoch": 0.008355, "grad_norm": 0.1389087438583374, "learning_rate": 2e-05, "loss": 0.20061631202697755, "mean_token_accuracy": 0.944438835978508, "num_tokens": 134480226.0, "step": 8355 }, { "aux_loss": 8.055367946624756, "entropy": 0.16035865880548955, "epoch": 0.00836, "grad_norm": 0.13739383220672607, "learning_rate": 2e-05, "loss": 0.19648418426513672, "mean_token_accuracy": 0.9449416488409043, "num_tokens": 134560975.0, "step": 8360 }, { "aux_loss": 8.060657596588134, "entropy": 0.15242384225130082, "epoch": 0.008365, "grad_norm": 0.12526613473892212, "learning_rate": 2e-05, "loss": 0.17871508598327637, "mean_token_accuracy": 0.9498950958251953, "num_tokens": 134641902.0, "step": 8365 }, { "aux_loss": 8.066985416412354, "entropy": 0.14445665068924426, "epoch": 0.00837, "grad_norm": 0.12973423302173615, "learning_rate": 2e-05, "loss": 0.16594820022583007, "mean_token_accuracy": 0.9540929168462753, "num_tokens": 134722740.0, "step": 8370 }, { "aux_loss": 8.07032914161682, "entropy": 0.13631007261574268, "epoch": 0.008375, "grad_norm": 0.1262480467557907, "learning_rate": 2e-05, "loss": 0.1668606996536255, "mean_token_accuracy": 0.9549294799566269, "num_tokens": 134802594.0, "step": 8375 }, { "aux_loss": 8.051563024520874, "entropy": 0.15825699903070928, "epoch": 0.00838, "grad_norm": 0.14672711491584778, "learning_rate": 2e-05, "loss": 0.1998654007911682, "mean_token_accuracy": 0.9451659232378006, "num_tokens": 134884114.0, "step": 8380 }, { "aux_loss": 8.054048776626587, "entropy": 0.15660641267895697, "epoch": 0.008385, "grad_norm": 0.12988872826099396, "learning_rate": 2e-05, "loss": 0.19593580961227416, "mean_token_accuracy": 0.9451469659805298, "num_tokens": 134965204.0, "step": 8385 }, { "aux_loss": 8.05440993309021, "entropy": 0.15677015855908394, "epoch": 0.00839, "grad_norm": 0.1295607089996338, "learning_rate": 2e-05, "loss": 0.1928365111351013, "mean_token_accuracy": 0.9462762326002121, "num_tokens": 135045536.0, "step": 8390 }, { "aux_loss": 8.062279844284058, "entropy": 0.1617270179092884, "epoch": 0.008395, "grad_norm": 0.12894052267074585, "learning_rate": 2e-05, "loss": 0.1873775005340576, "mean_token_accuracy": 0.9466507911682129, "num_tokens": 135126285.0, "step": 8395 }, { "aux_loss": 8.067923831939698, "entropy": 0.14252947755157946, "epoch": 0.0084, "grad_norm": 0.13394547998905182, "learning_rate": 2e-05, "loss": 0.1701805353164673, "mean_token_accuracy": 0.9530052065849304, "num_tokens": 135206887.0, "step": 8400 }, { "aux_loss": 8.075802040100097, "entropy": 0.13822566233575345, "epoch": 0.008405, "grad_norm": 0.13011668622493744, "learning_rate": 2e-05, "loss": 0.1682661294937134, "mean_token_accuracy": 0.9539941906929016, "num_tokens": 135286660.0, "step": 8405 }, { "aux_loss": 8.051136493682861, "entropy": 0.17228760942816734, "epoch": 0.00841, "grad_norm": 0.1299499124288559, "learning_rate": 2e-05, "loss": 0.21304645538330078, "mean_token_accuracy": 0.9413011193275451, "num_tokens": 135367984.0, "step": 8410 }, { "aux_loss": 8.050592994689941, "entropy": 0.16765848957002163, "epoch": 0.008415, "grad_norm": 0.13136902451515198, "learning_rate": 2e-05, "loss": 0.2054699420928955, "mean_token_accuracy": 0.9424240410327911, "num_tokens": 135448603.0, "step": 8415 }, { "aux_loss": 8.052868938446045, "entropy": 0.1590926930308342, "epoch": 0.00842, "grad_norm": 0.1242709681391716, "learning_rate": 2e-05, "loss": 0.1873373031616211, "mean_token_accuracy": 0.9476733565330505, "num_tokens": 135529829.0, "step": 8420 }, { "aux_loss": 8.061859369277954, "entropy": 0.15883804187178613, "epoch": 0.008425, "grad_norm": 0.136344775557518, "learning_rate": 2e-05, "loss": 0.1884535789489746, "mean_token_accuracy": 0.9476337909698487, "num_tokens": 135610568.0, "step": 8425 }, { "aux_loss": 8.067611932754517, "entropy": 0.14792343154549598, "epoch": 0.00843, "grad_norm": 0.1428966373205185, "learning_rate": 2e-05, "loss": 0.17854593992233275, "mean_token_accuracy": 0.9499095141887665, "num_tokens": 135691584.0, "step": 8430 }, { "aux_loss": 8.077659225463867, "entropy": 0.136220546066761, "epoch": 0.008435, "grad_norm": 0.13112741708755493, "learning_rate": 2e-05, "loss": 0.16483110189437866, "mean_token_accuracy": 0.9541334748268128, "num_tokens": 135770218.0, "step": 8435 }, { "aux_loss": 8.04805555343628, "entropy": 0.17007865346968173, "epoch": 0.00844, "grad_norm": 0.12503069639205933, "learning_rate": 2e-05, "loss": 0.20843098163604737, "mean_token_accuracy": 0.941634801030159, "num_tokens": 135851612.0, "step": 8440 }, { "aux_loss": 8.049964237213135, "entropy": 0.17655111774802207, "epoch": 0.008445, "grad_norm": 0.1310964673757553, "learning_rate": 2e-05, "loss": 0.21329019069671631, "mean_token_accuracy": 0.9415773063898086, "num_tokens": 135932161.0, "step": 8445 }, { "aux_loss": 8.052983236312866, "entropy": 0.16025624498724939, "epoch": 0.00845, "grad_norm": 0.13463611900806427, "learning_rate": 2e-05, "loss": 0.1935208797454834, "mean_token_accuracy": 0.945856460928917, "num_tokens": 136013260.0, "step": 8450 }, { "aux_loss": 8.061661100387573, "entropy": 0.15678115971386433, "epoch": 0.008455, "grad_norm": 0.12999224662780762, "learning_rate": 2e-05, "loss": 0.18524272441864015, "mean_token_accuracy": 0.9482613444328308, "num_tokens": 136093767.0, "step": 8455 }, { "aux_loss": 8.066637802124024, "entropy": 0.13855443336069584, "epoch": 0.00846, "grad_norm": 0.13254959881305695, "learning_rate": 2e-05, "loss": 0.16542829275131227, "mean_token_accuracy": 0.9536194920539856, "num_tokens": 136174562.0, "step": 8460 }, { "aux_loss": 8.08025507926941, "entropy": 0.1366057839244604, "epoch": 0.008465, "grad_norm": 0.1474137157201767, "learning_rate": 2e-05, "loss": 0.1648195743560791, "mean_token_accuracy": 0.9535883605480194, "num_tokens": 136251997.0, "step": 8465 }, { "aux_loss": 8.050443744659423, "entropy": 0.1504580620676279, "epoch": 0.00847, "grad_norm": 0.12698541581630707, "learning_rate": 2e-05, "loss": 0.19243426322937013, "mean_token_accuracy": 0.9472835689783097, "num_tokens": 136333090.0, "step": 8470 }, { "aux_loss": 8.051616382598876, "entropy": 0.1817252304404974, "epoch": 0.008475, "grad_norm": 0.13129396736621857, "learning_rate": 2e-05, "loss": 0.22213666439056395, "mean_token_accuracy": 0.9386663466691971, "num_tokens": 136414015.0, "step": 8475 }, { "aux_loss": 8.05089349746704, "entropy": 0.16867434233427048, "epoch": 0.00848, "grad_norm": 0.13452528417110443, "learning_rate": 2e-05, "loss": 0.1958939552307129, "mean_token_accuracy": 0.9444753050804138, "num_tokens": 136495101.0, "step": 8480 }, { "aux_loss": 8.053499364852906, "entropy": 0.1629290573298931, "epoch": 0.008485, "grad_norm": 0.1275554746389389, "learning_rate": 2e-05, "loss": 0.19197280406951905, "mean_token_accuracy": 0.9465134739875793, "num_tokens": 136575540.0, "step": 8485 }, { "aux_loss": 8.064253425598144, "entropy": 0.1574890699237585, "epoch": 0.00849, "grad_norm": 0.1433914452791214, "learning_rate": 2e-05, "loss": 0.1865792989730835, "mean_token_accuracy": 0.9476440668106079, "num_tokens": 136656189.0, "step": 8490 }, { "aux_loss": 8.074000263214112, "entropy": 0.1440015934407711, "epoch": 0.008495, "grad_norm": 0.13831086456775665, "learning_rate": 2e-05, "loss": 0.17209904193878173, "mean_token_accuracy": 0.9527287960052491, "num_tokens": 136736909.0, "step": 8495 }, { "aux_loss": 8.062353897094727, "entropy": 0.15502053014934064, "epoch": 0.0085, "grad_norm": 0.12684522569179535, "learning_rate": 2e-05, "loss": 0.18892711400985718, "mean_token_accuracy": 0.9479603826999664, "num_tokens": 136815132.0, "step": 8500 }, { "aux_loss": 8.05538215637207, "entropy": 0.16450981870293618, "epoch": 0.008505, "grad_norm": 0.1259032040834427, "learning_rate": 2e-05, "loss": 0.19836450815200807, "mean_token_accuracy": 0.9436654269695282, "num_tokens": 136896292.0, "step": 8505 }, { "aux_loss": 8.050623846054076, "entropy": 0.16529802270233632, "epoch": 0.00851, "grad_norm": 0.13030876219272614, "learning_rate": 2e-05, "loss": 0.20448694229125977, "mean_token_accuracy": 0.9423883527517318, "num_tokens": 136977300.0, "step": 8510 }, { "aux_loss": 8.054156970977782, "entropy": 0.16047285869717598, "epoch": 0.008515, "grad_norm": 0.1274743676185608, "learning_rate": 2e-05, "loss": 0.1904818296432495, "mean_token_accuracy": 0.9465765982866288, "num_tokens": 137058037.0, "step": 8515 }, { "aux_loss": 8.063240242004394, "entropy": 0.16352380365133284, "epoch": 0.00852, "grad_norm": 0.12635862827301025, "learning_rate": 2e-05, "loss": 0.1896214723587036, "mean_token_accuracy": 0.9474231600761414, "num_tokens": 137138516.0, "step": 8520 }, { "aux_loss": 8.07029881477356, "entropy": 0.1384718779474497, "epoch": 0.008525, "grad_norm": 0.1427355408668518, "learning_rate": 2e-05, "loss": 0.16541393995285034, "mean_token_accuracy": 0.9543010950088501, "num_tokens": 137218756.0, "step": 8525 }, { "aux_loss": 8.065940237045288, "entropy": 0.15036954395473004, "epoch": 0.00853, "grad_norm": 0.1259373277425766, "learning_rate": 2e-05, "loss": 0.18651095628738404, "mean_token_accuracy": 0.9489887952804565, "num_tokens": 137297311.0, "step": 8530 }, { "aux_loss": 8.050931978225709, "entropy": 0.17691235840320588, "epoch": 0.008535, "grad_norm": 0.13844381272792816, "learning_rate": 2e-05, "loss": 0.216611909866333, "mean_token_accuracy": 0.9383084505796433, "num_tokens": 137378163.0, "step": 8535 }, { "aux_loss": 8.052419710159302, "entropy": 0.16057549603283405, "epoch": 0.00854, "grad_norm": 0.12409794330596924, "learning_rate": 2e-05, "loss": 0.1939744234085083, "mean_token_accuracy": 0.9457886725664139, "num_tokens": 137459014.0, "step": 8540 }, { "aux_loss": 8.05696759223938, "entropy": 0.15709731429815293, "epoch": 0.008545, "grad_norm": 0.12415891885757446, "learning_rate": 2e-05, "loss": 0.18806880712509155, "mean_token_accuracy": 0.9476287961006165, "num_tokens": 137539713.0, "step": 8545 }, { "aux_loss": 8.06216320991516, "entropy": 0.1605144962668419, "epoch": 0.00855, "grad_norm": 0.1295788288116455, "learning_rate": 2e-05, "loss": 0.18548530340194702, "mean_token_accuracy": 0.948658874630928, "num_tokens": 137620469.0, "step": 8550 }, { "aux_loss": 8.07037444114685, "entropy": 0.14625077769160272, "epoch": 0.008555, "grad_norm": 0.1383758783340454, "learning_rate": 2e-05, "loss": 0.1735527515411377, "mean_token_accuracy": 0.9521961241960526, "num_tokens": 137700728.0, "step": 8555 }, { "aux_loss": 8.070580625534058, "entropy": 0.12732557877898215, "epoch": 0.00856, "grad_norm": 0.1281554400920868, "learning_rate": 2e-05, "loss": 0.15901296138763427, "mean_token_accuracy": 0.9563904017210006, "num_tokens": 137780886.0, "step": 8560 }, { "aux_loss": 8.053347492218018, "entropy": 0.15632971115410327, "epoch": 0.008565, "grad_norm": 0.1276077926158905, "learning_rate": 2e-05, "loss": 0.20193641185760497, "mean_token_accuracy": 0.9426657378673553, "num_tokens": 137862342.0, "step": 8565 }, { "aux_loss": 8.056013822555542, "entropy": 0.15691122002899646, "epoch": 0.00857, "grad_norm": 0.13058046996593475, "learning_rate": 2e-05, "loss": 0.19218190908432006, "mean_token_accuracy": 0.9463227838277817, "num_tokens": 137943351.0, "step": 8570 }, { "aux_loss": 8.054302597045899, "entropy": 0.16809199415147305, "epoch": 0.008575, "grad_norm": 0.12302262336015701, "learning_rate": 2e-05, "loss": 0.20412819385528563, "mean_token_accuracy": 0.9438839465379715, "num_tokens": 138023937.0, "step": 8575 }, { "aux_loss": 8.059054136276245, "entropy": 0.15220602191984653, "epoch": 0.00858, "grad_norm": 0.1288856863975525, "learning_rate": 2e-05, "loss": 0.18049123287200927, "mean_token_accuracy": 0.9497587084770203, "num_tokens": 138104329.0, "step": 8580 }, { "aux_loss": 8.066953325271607, "entropy": 0.14887753091752529, "epoch": 0.008585, "grad_norm": 0.13680119812488556, "learning_rate": 2e-05, "loss": 0.17565748691558838, "mean_token_accuracy": 0.9511402636766434, "num_tokens": 138185089.0, "step": 8585 }, { "aux_loss": 8.07802700996399, "entropy": 0.14214944653213024, "epoch": 0.00859, "grad_norm": 0.12327562272548676, "learning_rate": 2e-05, "loss": 0.16872937679290773, "mean_token_accuracy": 0.952862823009491, "num_tokens": 138263094.0, "step": 8590 }, { "aux_loss": 8.053894662857056, "entropy": 0.17544727213680744, "epoch": 0.008595, "grad_norm": 0.12496910989284515, "learning_rate": 2e-05, "loss": 0.21347546577453613, "mean_token_accuracy": 0.9417501091957092, "num_tokens": 138344538.0, "step": 8595 }, { "aux_loss": 8.054403495788574, "entropy": 0.16302029825747014, "epoch": 0.0086, "grad_norm": 0.12998966872692108, "learning_rate": 2e-05, "loss": 0.19678072929382323, "mean_token_accuracy": 0.9450888693332672, "num_tokens": 138425256.0, "step": 8600 }, { "aux_loss": 8.053652095794678, "entropy": 0.15328414253890515, "epoch": 0.008605, "grad_norm": 0.1274077296257019, "learning_rate": 2e-05, "loss": 0.18891308307647706, "mean_token_accuracy": 0.9469194948673249, "num_tokens": 138505465.0, "step": 8605 }, { "aux_loss": 8.064128017425537, "entropy": 0.15721628814935684, "epoch": 0.00861, "grad_norm": 0.1264345645904541, "learning_rate": 2e-05, "loss": 0.1871870279312134, "mean_token_accuracy": 0.9478241115808487, "num_tokens": 138586320.0, "step": 8610 }, { "aux_loss": 8.068868494033813, "entropy": 0.14275341480970383, "epoch": 0.008615, "grad_norm": 0.13732150197029114, "learning_rate": 2e-05, "loss": 0.16966525316238404, "mean_token_accuracy": 0.9530564188957215, "num_tokens": 138667068.0, "step": 8615 }, { "aux_loss": 8.075186586380005, "entropy": 0.142410034686327, "epoch": 0.00862, "grad_norm": 0.11204396188259125, "learning_rate": 2e-05, "loss": 0.16834025382995604, "mean_token_accuracy": 0.9537007331848144, "num_tokens": 138743979.0, "step": 8620 }, { "aux_loss": 8.050409317016602, "entropy": 0.17698446996510028, "epoch": 0.008625, "grad_norm": 0.1299743801355362, "learning_rate": 2e-05, "loss": 0.21800837516784669, "mean_token_accuracy": 0.9389644712209702, "num_tokens": 138825070.0, "step": 8625 }, { "aux_loss": 8.051132202148438, "entropy": 0.1597856990993023, "epoch": 0.00863, "grad_norm": 0.13730962574481964, "learning_rate": 2e-05, "loss": 0.19670662879943848, "mean_token_accuracy": 0.9442116737365722, "num_tokens": 138905312.0, "step": 8630 }, { "aux_loss": 8.058001804351807, "entropy": 0.15900781080126764, "epoch": 0.008635, "grad_norm": 0.14008685946464539, "learning_rate": 2e-05, "loss": 0.19398657083511353, "mean_token_accuracy": 0.9463704049587249, "num_tokens": 138986333.0, "step": 8635 }, { "aux_loss": 8.05928988456726, "entropy": 0.16415026746690273, "epoch": 0.00864, "grad_norm": 0.12896999716758728, "learning_rate": 2e-05, "loss": 0.192586088180542, "mean_token_accuracy": 0.9446914702653885, "num_tokens": 139066909.0, "step": 8640 }, { "aux_loss": 8.068218898773193, "entropy": 0.14910345450043677, "epoch": 0.008645, "grad_norm": 0.13533496856689453, "learning_rate": 2e-05, "loss": 0.1701783299446106, "mean_token_accuracy": 0.9525663197040558, "num_tokens": 139147854.0, "step": 8645 }, { "aux_loss": 8.07570676803589, "entropy": 0.13731190077960492, "epoch": 0.00865, "grad_norm": 0.12068255245685577, "learning_rate": 2e-05, "loss": 0.16553701162338258, "mean_token_accuracy": 0.9541501373052597, "num_tokens": 139225902.0, "step": 8650 }, { "aux_loss": 8.05265121459961, "entropy": 0.16186390668153763, "epoch": 0.008655, "grad_norm": 0.1321835219860077, "learning_rate": 2e-05, "loss": 0.20611445903778075, "mean_token_accuracy": 0.9439223557710648, "num_tokens": 139307121.0, "step": 8655 }, { "aux_loss": 8.048187494277954, "entropy": 0.16961295604705812, "epoch": 0.00866, "grad_norm": 0.12428125739097595, "learning_rate": 2e-05, "loss": 0.21001293659210205, "mean_token_accuracy": 0.9411908566951752, "num_tokens": 139388288.0, "step": 8660 }, { "aux_loss": 8.054498624801635, "entropy": 0.16876161135733128, "epoch": 0.008665, "grad_norm": 0.1274934709072113, "learning_rate": 2e-05, "loss": 0.20555145740509034, "mean_token_accuracy": 0.9421246469020843, "num_tokens": 139468718.0, "step": 8665 }, { "aux_loss": 8.059780836105347, "entropy": 0.16027447320520877, "epoch": 0.00867, "grad_norm": 0.12797242403030396, "learning_rate": 2e-05, "loss": 0.1871555209159851, "mean_token_accuracy": 0.9473997086286545, "num_tokens": 139549670.0, "step": 8670 }, { "aux_loss": 8.064860773086547, "entropy": 0.14896807856857777, "epoch": 0.008675, "grad_norm": 0.13439537584781647, "learning_rate": 2e-05, "loss": 0.17393001317977905, "mean_token_accuracy": 0.9516429126262664, "num_tokens": 139629546.0, "step": 8675 }, { "aux_loss": 8.07807092666626, "entropy": 0.1481859538704157, "epoch": 0.00868, "grad_norm": 0.14601923525333405, "learning_rate": 2e-05, "loss": 0.1798541784286499, "mean_token_accuracy": 0.9498418360948563, "num_tokens": 139707364.0, "step": 8680 }, { "aux_loss": 8.05081205368042, "entropy": 0.1466105841100216, "epoch": 0.008685, "grad_norm": 0.1306084543466568, "learning_rate": 2e-05, "loss": 0.17915236949920654, "mean_token_accuracy": 0.95189129114151, "num_tokens": 139788612.0, "step": 8685 }, { "aux_loss": 8.052356147766114, "entropy": 0.16529877707362176, "epoch": 0.00869, "grad_norm": 0.13377101719379425, "learning_rate": 2e-05, "loss": 0.20282554626464844, "mean_token_accuracy": 0.9433024913072586, "num_tokens": 139869885.0, "step": 8690 }, { "aux_loss": 8.050832414627076, "entropy": 0.16516531445086002, "epoch": 0.008695, "grad_norm": 0.12875154614448547, "learning_rate": 2e-05, "loss": 0.20171666145324707, "mean_token_accuracy": 0.9431208789348602, "num_tokens": 139950740.0, "step": 8695 }, { "aux_loss": 8.056227970123292, "entropy": 0.1561167225241661, "epoch": 0.0087, "grad_norm": 0.13064496219158173, "learning_rate": 2e-05, "loss": 0.18403198719024658, "mean_token_accuracy": 0.9483417361974716, "num_tokens": 140031451.0, "step": 8700 }, { "aux_loss": 8.063406038284302, "entropy": 0.14633053094148635, "epoch": 0.008705, "grad_norm": 0.12414082139730453, "learning_rate": 2e-05, "loss": 0.1717940092086792, "mean_token_accuracy": 0.9514490932226181, "num_tokens": 140112273.0, "step": 8705 }, { "aux_loss": 8.07530369758606, "entropy": 0.14537588655948638, "epoch": 0.00871, "grad_norm": 0.14689278602600098, "learning_rate": 2e-05, "loss": 0.17688130140304564, "mean_token_accuracy": 0.9504638940095902, "num_tokens": 140192712.0, "step": 8710 }, { "aux_loss": 8.053073024749756, "entropy": 0.1428489603102207, "epoch": 0.008715, "grad_norm": 0.12161094695329666, "learning_rate": 2e-05, "loss": 0.1810328483581543, "mean_token_accuracy": 0.9500407069921494, "num_tokens": 140270661.0, "step": 8715 }, { "aux_loss": 8.051481294631959, "entropy": 0.16562087461352348, "epoch": 0.00872, "grad_norm": 0.1386113166809082, "learning_rate": 2e-05, "loss": 0.20505356788635254, "mean_token_accuracy": 0.9423316895961762, "num_tokens": 140352134.0, "step": 8720 }, { "aux_loss": 8.049740409851074, "entropy": 0.1607420913875103, "epoch": 0.008725, "grad_norm": 0.1264772266149521, "learning_rate": 2e-05, "loss": 0.19718654155731202, "mean_token_accuracy": 0.9457148790359498, "num_tokens": 140432667.0, "step": 8725 }, { "aux_loss": 8.056254959106445, "entropy": 0.15717368833720685, "epoch": 0.00873, "grad_norm": 0.13263815641403198, "learning_rate": 2e-05, "loss": 0.18402861356735228, "mean_token_accuracy": 0.9484142869710922, "num_tokens": 140513406.0, "step": 8730 }, { "aux_loss": 8.060372877120972, "entropy": 0.15108941197395326, "epoch": 0.008735, "grad_norm": 0.13129562139511108, "learning_rate": 2e-05, "loss": 0.17795922756195068, "mean_token_accuracy": 0.951002436876297, "num_tokens": 140593343.0, "step": 8735 }, { "aux_loss": 8.068865633010864, "entropy": 0.13550023287534713, "epoch": 0.00874, "grad_norm": 0.14219635725021362, "learning_rate": 2e-05, "loss": 0.16220284700393678, "mean_token_accuracy": 0.9552569538354874, "num_tokens": 140673906.0, "step": 8740 }, { "aux_loss": 8.055937242507934, "entropy": 0.1420279834419489, "epoch": 0.008745, "grad_norm": 0.12697762250900269, "learning_rate": 2e-05, "loss": 0.18226102590560914, "mean_token_accuracy": 0.9506237059831619, "num_tokens": 140754779.0, "step": 8745 }, { "aux_loss": 8.046888780593871, "entropy": 0.16474676579236985, "epoch": 0.00875, "grad_norm": 0.1317567527294159, "learning_rate": 2e-05, "loss": 0.2031479597091675, "mean_token_accuracy": 0.9435187935829162, "num_tokens": 140836322.0, "step": 8750 }, { "aux_loss": 8.049375629425048, "entropy": 0.1640807218849659, "epoch": 0.008755, "grad_norm": 0.12557213008403778, "learning_rate": 2e-05, "loss": 0.19852058887481688, "mean_token_accuracy": 0.9439573079347611, "num_tokens": 140917371.0, "step": 8755 }, { "aux_loss": 8.052918243408204, "entropy": 0.16071385629475116, "epoch": 0.00876, "grad_norm": 0.12216376513242722, "learning_rate": 2e-05, "loss": 0.18771981000900267, "mean_token_accuracy": 0.9486925154924393, "num_tokens": 140998020.0, "step": 8760 }, { "aux_loss": 8.059798336029052, "entropy": 0.13861278481781483, "epoch": 0.008765, "grad_norm": 0.1295582801103592, "learning_rate": 2e-05, "loss": 0.16302660703659058, "mean_token_accuracy": 0.9547215700149536, "num_tokens": 141078039.0, "step": 8765 }, { "aux_loss": 8.069599533081055, "entropy": 0.13799573630094528, "epoch": 0.00877, "grad_norm": 0.1403513103723526, "learning_rate": 2e-05, "loss": 0.16963460445404052, "mean_token_accuracy": 0.9537664920091629, "num_tokens": 141158150.0, "step": 8770 }, { "aux_loss": 8.063237476348878, "entropy": 0.15479829013347626, "epoch": 0.008775, "grad_norm": 0.13407620787620544, "learning_rate": 2e-05, "loss": 0.18906344175338746, "mean_token_accuracy": 0.946771365404129, "num_tokens": 141236398.0, "step": 8775 }, { "aux_loss": 8.04686884880066, "entropy": 0.17361192852258683, "epoch": 0.00878, "grad_norm": 0.1317320466041565, "learning_rate": 2e-05, "loss": 0.21579275131225586, "mean_token_accuracy": 0.9400768518447876, "num_tokens": 141317447.0, "step": 8780 }, { "aux_loss": 8.05041151046753, "entropy": 0.16427178904414177, "epoch": 0.008785, "grad_norm": 0.12869320809841156, "learning_rate": 2e-05, "loss": 0.19875767230987548, "mean_token_accuracy": 0.9443625956773758, "num_tokens": 141398194.0, "step": 8785 }, { "aux_loss": 8.056263542175293, "entropy": 0.16415370851755143, "epoch": 0.00879, "grad_norm": 0.13013140857219696, "learning_rate": 2e-05, "loss": 0.19186978340148925, "mean_token_accuracy": 0.9460722267627716, "num_tokens": 141479065.0, "step": 8790 }, { "aux_loss": 8.059855604171753, "entropy": 0.15008809715509414, "epoch": 0.008795, "grad_norm": 0.13298286497592926, "learning_rate": 2e-05, "loss": 0.17762097120285034, "mean_token_accuracy": 0.9506973773241043, "num_tokens": 141559578.0, "step": 8795 }, { "aux_loss": 8.070141315460205, "entropy": 0.1445841770619154, "epoch": 0.0088, "grad_norm": 0.13302505016326904, "learning_rate": 2e-05, "loss": 0.1716432213783264, "mean_token_accuracy": 0.9523935735225677, "num_tokens": 141639537.0, "step": 8800 }, { "aux_loss": 8.062156009674073, "entropy": 0.1437410395592451, "epoch": 0.008805, "grad_norm": 0.12990376353263855, "learning_rate": 2e-05, "loss": 0.1756006360054016, "mean_token_accuracy": 0.9523844093084335, "num_tokens": 141719918.0, "step": 8805 }, { "aux_loss": 8.050819587707519, "entropy": 0.16217534951865673, "epoch": 0.00881, "grad_norm": 0.14529691636562347, "learning_rate": 2e-05, "loss": 0.20822794437408448, "mean_token_accuracy": 0.9423745334148407, "num_tokens": 141800620.0, "step": 8810 }, { "aux_loss": 8.051668262481689, "entropy": 0.15166816152632237, "epoch": 0.008815, "grad_norm": 0.12711620330810547, "learning_rate": 2e-05, "loss": 0.1852765917778015, "mean_token_accuracy": 0.9483495861291885, "num_tokens": 141881777.0, "step": 8815 }, { "aux_loss": 8.053888511657714, "entropy": 0.1557618010789156, "epoch": 0.00882, "grad_norm": 0.1266649067401886, "learning_rate": 2e-05, "loss": 0.18496228456497193, "mean_token_accuracy": 0.9490999162197113, "num_tokens": 141962642.0, "step": 8820 }, { "aux_loss": 8.06244354248047, "entropy": 0.15281456038355828, "epoch": 0.008825, "grad_norm": 0.1309521198272705, "learning_rate": 2e-05, "loss": 0.18130017518997193, "mean_token_accuracy": 0.9499205708503723, "num_tokens": 142043191.0, "step": 8825 }, { "aux_loss": 8.070529413223266, "entropy": 0.14602159895002842, "epoch": 0.00883, "grad_norm": 0.13235162198543549, "learning_rate": 2e-05, "loss": 0.17312501668930053, "mean_token_accuracy": 0.9522285014390945, "num_tokens": 142123628.0, "step": 8830 }, { "aux_loss": 8.065625190734863, "entropy": 0.15181401334702968, "epoch": 0.008835, "grad_norm": 0.13476738333702087, "learning_rate": 2e-05, "loss": 0.18659589290618897, "mean_token_accuracy": 0.9489993035793305, "num_tokens": 142203232.0, "step": 8835 }, { "aux_loss": 8.051854848861694, "entropy": 0.15467614158988, "epoch": 0.00884, "grad_norm": 0.1443680375814438, "learning_rate": 2e-05, "loss": 0.19742339849472046, "mean_token_accuracy": 0.9460978031158447, "num_tokens": 142283945.0, "step": 8840 }, { "aux_loss": 8.050033140182496, "entropy": 0.1654368791729212, "epoch": 0.008845, "grad_norm": 0.12915019690990448, "learning_rate": 2e-05, "loss": 0.20108115673065186, "mean_token_accuracy": 0.9435195207595826, "num_tokens": 142365144.0, "step": 8845 }, { "aux_loss": 8.05650281906128, "entropy": 0.15751716382801534, "epoch": 0.00885, "grad_norm": 0.12440650165081024, "learning_rate": 2e-05, "loss": 0.1870269298553467, "mean_token_accuracy": 0.9477470695972443, "num_tokens": 142445969.0, "step": 8850 }, { "aux_loss": 8.05877652168274, "entropy": 0.15325161516666413, "epoch": 0.008855, "grad_norm": 0.12807123363018036, "learning_rate": 2e-05, "loss": 0.18139255046844482, "mean_token_accuracy": 0.9493809968233109, "num_tokens": 142526769.0, "step": 8855 }, { "aux_loss": 8.068867444992065, "entropy": 0.14166127592325212, "epoch": 0.00886, "grad_norm": 0.1370983123779297, "learning_rate": 2e-05, "loss": 0.16508629322052001, "mean_token_accuracy": 0.9536879241466523, "num_tokens": 142606917.0, "step": 8860 }, { "aux_loss": 8.068143367767334, "entropy": 0.13985994793474674, "epoch": 0.008865, "grad_norm": 0.1331673115491867, "learning_rate": 2e-05, "loss": 0.17156301736831664, "mean_token_accuracy": 0.9526797980070114, "num_tokens": 142686149.0, "step": 8865 }, { "aux_loss": 8.051418209075928, "entropy": 0.16913191936910152, "epoch": 0.00887, "grad_norm": 0.13198046386241913, "learning_rate": 2e-05, "loss": 0.2088552474975586, "mean_token_accuracy": 0.9411212980747223, "num_tokens": 142767589.0, "step": 8870 }, { "aux_loss": 8.047991275787354, "entropy": 0.17505197674036027, "epoch": 0.008875, "grad_norm": 0.13860420882701874, "learning_rate": 2e-05, "loss": 0.21608192920684816, "mean_token_accuracy": 0.9397012293338776, "num_tokens": 142848136.0, "step": 8875 }, { "aux_loss": 8.051774311065675, "entropy": 0.16211238801479338, "epoch": 0.00888, "grad_norm": 0.1306205838918686, "learning_rate": 2e-05, "loss": 0.19351627826690673, "mean_token_accuracy": 0.9458301037549972, "num_tokens": 142929218.0, "step": 8880 }, { "aux_loss": 8.060734033584595, "entropy": 0.15532847866415977, "epoch": 0.008885, "grad_norm": 0.13024985790252686, "learning_rate": 2e-05, "loss": 0.18095829486846923, "mean_token_accuracy": 0.9493039816617965, "num_tokens": 143010029.0, "step": 8885 }, { "aux_loss": 8.066394472122193, "entropy": 0.13877962827682494, "epoch": 0.00889, "grad_norm": 0.13255876302719116, "learning_rate": 2e-05, "loss": 0.1647440552711487, "mean_token_accuracy": 0.9544006258249282, "num_tokens": 143090694.0, "step": 8890 }, { "aux_loss": 8.071954727172852, "entropy": 0.1325362291187048, "epoch": 0.008895, "grad_norm": 0.12084479629993439, "learning_rate": 2e-05, "loss": 0.15787626504898072, "mean_token_accuracy": 0.9556850016117096, "num_tokens": 143168492.0, "step": 8895 }, { "aux_loss": 8.04944043159485, "entropy": 0.1741876568645239, "epoch": 0.0089, "grad_norm": 0.13142059743404388, "learning_rate": 2e-05, "loss": 0.22046067714691162, "mean_token_accuracy": 0.9394972771406174, "num_tokens": 143249591.0, "step": 8900 }, { "aux_loss": 8.0515212059021, "entropy": 0.151621338352561, "epoch": 0.008905, "grad_norm": 0.13156643509864807, "learning_rate": 2e-05, "loss": 0.1894966959953308, "mean_token_accuracy": 0.9466851204633713, "num_tokens": 143330373.0, "step": 8905 }, { "aux_loss": 8.052351999282838, "entropy": 0.15956550613045692, "epoch": 0.00891, "grad_norm": 0.12576551735401154, "learning_rate": 2e-05, "loss": 0.19171146154403687, "mean_token_accuracy": 0.9459272176027298, "num_tokens": 143411203.0, "step": 8910 }, { "aux_loss": 8.055167388916015, "entropy": 0.16308680921792984, "epoch": 0.008915, "grad_norm": 0.13080812990665436, "learning_rate": 2e-05, "loss": 0.19286198616027833, "mean_token_accuracy": 0.9454808354377746, "num_tokens": 143491925.0, "step": 8915 }, { "aux_loss": 8.064648008346557, "entropy": 0.1466072913259268, "epoch": 0.00892, "grad_norm": 0.13442130386829376, "learning_rate": 2e-05, "loss": 0.17161482572555542, "mean_token_accuracy": 0.9522063434123993, "num_tokens": 143572940.0, "step": 8920 }, { "aux_loss": 8.07026448249817, "entropy": 0.140037352591753, "epoch": 0.008925, "grad_norm": 0.11821462213993073, "learning_rate": 2e-05, "loss": 0.16644347906112672, "mean_token_accuracy": 0.9547454357147217, "num_tokens": 143651762.0, "step": 8925 }, { "aux_loss": 8.049960374832153, "entropy": 0.168941380828619, "epoch": 0.00893, "grad_norm": 0.13707335293293, "learning_rate": 2e-05, "loss": 0.21055347919464112, "mean_token_accuracy": 0.9414200127124787, "num_tokens": 143733269.0, "step": 8930 }, { "aux_loss": 8.047146701812744, "entropy": 0.1807384926825762, "epoch": 0.008935, "grad_norm": 0.17462655901908875, "learning_rate": 2e-05, "loss": 0.2216662883758545, "mean_token_accuracy": 0.9369146227836609, "num_tokens": 143813814.0, "step": 8935 }, { "aux_loss": 8.053944206237793, "entropy": 0.15766459032893182, "epoch": 0.00894, "grad_norm": 0.13653764128684998, "learning_rate": 2e-05, "loss": 0.19147311449050902, "mean_token_accuracy": 0.946722275018692, "num_tokens": 143894598.0, "step": 8940 }, { "aux_loss": 8.056559181213379, "entropy": 0.1534650482237339, "epoch": 0.008945, "grad_norm": 0.12604378163814545, "learning_rate": 2e-05, "loss": 0.18191812038421631, "mean_token_accuracy": 0.9490950018167496, "num_tokens": 143975134.0, "step": 8945 }, { "aux_loss": 8.062952136993408, "entropy": 0.1457659013569355, "epoch": 0.00895, "grad_norm": 0.12857455015182495, "learning_rate": 2e-05, "loss": 0.16952617168426515, "mean_token_accuracy": 0.9529273092746735, "num_tokens": 144055863.0, "step": 8950 }, { "aux_loss": 8.073321533203124, "entropy": 0.13516576513648032, "epoch": 0.008955, "grad_norm": 0.12914860248565674, "learning_rate": 2e-05, "loss": 0.16308298110961914, "mean_token_accuracy": 0.9545054614543915, "num_tokens": 144133736.0, "step": 8955 }, { "aux_loss": 8.047145748138428, "entropy": 0.1553576286882162, "epoch": 0.00896, "grad_norm": 0.13375549018383026, "learning_rate": 2e-05, "loss": 0.19422754049301147, "mean_token_accuracy": 0.9465140253305435, "num_tokens": 144215187.0, "step": 8960 }, { "aux_loss": 8.048073196411133, "entropy": 0.1687317706644535, "epoch": 0.008965, "grad_norm": 0.1284179538488388, "learning_rate": 2e-05, "loss": 0.20868115425109862, "mean_token_accuracy": 0.9416483998298645, "num_tokens": 144296078.0, "step": 8965 }, { "aux_loss": 8.051653337478637, "entropy": 0.17172398492693902, "epoch": 0.00897, "grad_norm": 0.13168437778949738, "learning_rate": 2e-05, "loss": 0.2059194564819336, "mean_token_accuracy": 0.942954096198082, "num_tokens": 144376988.0, "step": 8970 }, { "aux_loss": 8.056134557723999, "entropy": 0.16314014792442322, "epoch": 0.008975, "grad_norm": 0.1363796591758728, "learning_rate": 2e-05, "loss": 0.19433751106262206, "mean_token_accuracy": 0.9456538796424866, "num_tokens": 144457297.0, "step": 8975 }, { "aux_loss": 8.064738988876343, "entropy": 0.15046918019652367, "epoch": 0.00898, "grad_norm": 0.12787559628486633, "learning_rate": 2e-05, "loss": 0.1770918607711792, "mean_token_accuracy": 0.9500804215669632, "num_tokens": 144538120.0, "step": 8980 }, { "aux_loss": 8.078823328018188, "entropy": 0.14470162987709045, "epoch": 0.008985, "grad_norm": 0.15308259427547455, "learning_rate": 2e-05, "loss": 0.17147524356842042, "mean_token_accuracy": 0.9527350008487702, "num_tokens": 144615756.0, "step": 8985 }, { "aux_loss": 8.053917407989502, "entropy": 0.16611836478114128, "epoch": 0.00899, "grad_norm": 0.14119122922420502, "learning_rate": 2e-05, "loss": 0.20463342666625978, "mean_token_accuracy": 0.9434159636497498, "num_tokens": 144696882.0, "step": 8990 }, { "aux_loss": 8.05145330429077, "entropy": 0.1684564959257841, "epoch": 0.008995, "grad_norm": 0.1359567940235138, "learning_rate": 2e-05, "loss": 0.20629723072052003, "mean_token_accuracy": 0.9411316961050034, "num_tokens": 144778403.0, "step": 8995 }, { "aux_loss": 8.051396226882934, "entropy": 0.16917419098317624, "epoch": 0.009, "grad_norm": 0.12857814133167267, "learning_rate": 2e-05, "loss": 0.20049822330474854, "mean_token_accuracy": 0.9434998363256455, "num_tokens": 144859171.0, "step": 9000 }, { "aux_loss": 8.055720281600951, "entropy": 0.16034072861075402, "epoch": 0.009005, "grad_norm": 0.13157115876674652, "learning_rate": 2e-05, "loss": 0.1890867233276367, "mean_token_accuracy": 0.9466980814933776, "num_tokens": 144939851.0, "step": 9005 }, { "aux_loss": 8.061790704727173, "entropy": 0.1485297095030546, "epoch": 0.00901, "grad_norm": 0.12871001660823822, "learning_rate": 2e-05, "loss": 0.17670243978500366, "mean_token_accuracy": 0.9509409308433533, "num_tokens": 145020422.0, "step": 9010 }, { "aux_loss": 8.071242952346802, "entropy": 0.14230466708540918, "epoch": 0.009015, "grad_norm": 0.13953736424446106, "learning_rate": 2e-05, "loss": 0.17031856775283813, "mean_token_accuracy": 0.9534539580345154, "num_tokens": 145100765.0, "step": 9015 }, { "aux_loss": 8.053312683105469, "entropy": 0.14188128374516965, "epoch": 0.00902, "grad_norm": 0.1283850222826004, "learning_rate": 2e-05, "loss": 0.18063976764678955, "mean_token_accuracy": 0.9500974535942077, "num_tokens": 145181867.0, "step": 9020 }, { "aux_loss": 8.050068616867065, "entropy": 0.15850713439285755, "epoch": 0.009025, "grad_norm": 0.1412983387708664, "learning_rate": 2e-05, "loss": 0.19685086011886596, "mean_token_accuracy": 0.9451803863048553, "num_tokens": 145263150.0, "step": 9025 }, { "aux_loss": 8.046318244934081, "entropy": 0.1529967050999403, "epoch": 0.00903, "grad_norm": 0.1289587765932083, "learning_rate": 2e-05, "loss": 0.1920097589492798, "mean_token_accuracy": 0.9464766293764114, "num_tokens": 145344167.0, "step": 9030 }, { "aux_loss": 8.05451159477234, "entropy": 0.1611484669148922, "epoch": 0.009035, "grad_norm": 0.12812398374080658, "learning_rate": 2e-05, "loss": 0.19337185621261596, "mean_token_accuracy": 0.9459359347820282, "num_tokens": 145424886.0, "step": 9035 }, { "aux_loss": 8.063358736038207, "entropy": 0.1576306439936161, "epoch": 0.00904, "grad_norm": 0.12644045054912567, "learning_rate": 2e-05, "loss": 0.1833519458770752, "mean_token_accuracy": 0.9484833687543869, "num_tokens": 145505588.0, "step": 9040 }, { "aux_loss": 8.069869709014892, "entropy": 0.13947059065103531, "epoch": 0.009045, "grad_norm": 0.136777862906456, "learning_rate": 2e-05, "loss": 0.16213153600692748, "mean_token_accuracy": 0.954826545715332, "num_tokens": 145585934.0, "step": 9045 }, { "aux_loss": 8.054084968566894, "entropy": 0.15392575040459633, "epoch": 0.00905, "grad_norm": 0.1301695853471756, "learning_rate": 2e-05, "loss": 0.19046540260314943, "mean_token_accuracy": 0.9471210896968841, "num_tokens": 145666589.0, "step": 9050 }, { "aux_loss": 8.04963812828064, "entropy": 0.1462317556142807, "epoch": 0.009055, "grad_norm": 0.14226828515529633, "learning_rate": 2e-05, "loss": 0.18507881164550782, "mean_token_accuracy": 0.9491311490535737, "num_tokens": 145747944.0, "step": 9055 }, { "aux_loss": 8.049897718429566, "entropy": 0.1655551202595234, "epoch": 0.00906, "grad_norm": 0.13290181756019592, "learning_rate": 2e-05, "loss": 0.20115478038787843, "mean_token_accuracy": 0.9442602813243866, "num_tokens": 145828834.0, "step": 9060 }, { "aux_loss": 8.053511095046996, "entropy": 0.15808416530489922, "epoch": 0.009065, "grad_norm": 0.125838503241539, "learning_rate": 2e-05, "loss": 0.1863319158554077, "mean_token_accuracy": 0.948188191652298, "num_tokens": 145909366.0, "step": 9065 }, { "aux_loss": 8.058942651748657, "entropy": 0.1557976320385933, "epoch": 0.00907, "grad_norm": 0.1331806480884552, "learning_rate": 2e-05, "loss": 0.1798400640487671, "mean_token_accuracy": 0.9495758682489395, "num_tokens": 145989592.0, "step": 9070 }, { "aux_loss": 8.070401811599732, "entropy": 0.14249608814716339, "epoch": 0.009075, "grad_norm": 0.1402416229248047, "learning_rate": 2e-05, "loss": 0.17083990573883057, "mean_token_accuracy": 0.9521846741437912, "num_tokens": 146070084.0, "step": 9075 }, { "aux_loss": 8.052979326248169, "entropy": 0.1582282304763794, "epoch": 0.00908, "grad_norm": 0.12918207049369812, "learning_rate": 2e-05, "loss": 0.19609121084213257, "mean_token_accuracy": 0.9468253374099731, "num_tokens": 146150901.0, "step": 9080 }, { "aux_loss": 8.046459197998047, "entropy": 0.15578912794589997, "epoch": 0.009085, "grad_norm": 0.13867315649986267, "learning_rate": 2e-05, "loss": 0.19550650119781493, "mean_token_accuracy": 0.9448387354612351, "num_tokens": 146232225.0, "step": 9085 }, { "aux_loss": 8.048712778091431, "entropy": 0.1605131860822439, "epoch": 0.00909, "grad_norm": 0.12908585369586945, "learning_rate": 2e-05, "loss": 0.19709932804107666, "mean_token_accuracy": 0.9448313176631927, "num_tokens": 146312867.0, "step": 9090 }, { "aux_loss": 8.05649242401123, "entropy": 0.16510931104421617, "epoch": 0.009095, "grad_norm": 0.12659822404384613, "learning_rate": 2e-05, "loss": 0.19316548109054565, "mean_token_accuracy": 0.9458854496479034, "num_tokens": 146393782.0, "step": 9095 }, { "aux_loss": 8.060756492614747, "entropy": 0.15448057651519775, "epoch": 0.0091, "grad_norm": 0.13716357946395874, "learning_rate": 2e-05, "loss": 0.18324564695358275, "mean_token_accuracy": 0.9493474274873733, "num_tokens": 146474610.0, "step": 9100 }, { "aux_loss": 8.069791078567505, "entropy": 0.14029395207762718, "epoch": 0.009105, "grad_norm": 0.15031740069389343, "learning_rate": 2e-05, "loss": 0.16438581943511962, "mean_token_accuracy": 0.9537094175815582, "num_tokens": 146554908.0, "step": 9105 }, { "aux_loss": 8.051681613922119, "entropy": 0.15240961983799933, "epoch": 0.00911, "grad_norm": 0.1311596930027008, "learning_rate": 2e-05, "loss": 0.19222482442855834, "mean_token_accuracy": 0.9482855081558228, "num_tokens": 146635858.0, "step": 9110 }, { "aux_loss": 8.046053886413574, "entropy": 0.17746356800198554, "epoch": 0.009115, "grad_norm": 0.13681170344352722, "learning_rate": 2e-05, "loss": 0.21867761611938477, "mean_token_accuracy": 0.9398280680179596, "num_tokens": 146717222.0, "step": 9115 }, { "aux_loss": 8.047878742218018, "entropy": 0.14980819076299667, "epoch": 0.00912, "grad_norm": 0.12490449845790863, "learning_rate": 2e-05, "loss": 0.1871268033981323, "mean_token_accuracy": 0.9484641134738923, "num_tokens": 146798068.0, "step": 9120 }, { "aux_loss": 8.057613420486451, "entropy": 0.16235484033823014, "epoch": 0.009125, "grad_norm": 0.13405996561050415, "learning_rate": 2e-05, "loss": 0.19359736442565917, "mean_token_accuracy": 0.9450442284345627, "num_tokens": 146878773.0, "step": 9125 }, { "aux_loss": 8.060540294647216, "entropy": 0.1512028731405735, "epoch": 0.00913, "grad_norm": 0.13461905717849731, "learning_rate": 2e-05, "loss": 0.17625993490219116, "mean_token_accuracy": 0.9509659796953202, "num_tokens": 146959463.0, "step": 9130 }, { "aux_loss": 8.071784734725952, "entropy": 0.15256218314170839, "epoch": 0.009135, "grad_norm": 0.1549593210220337, "learning_rate": 2e-05, "loss": 0.1816193699836731, "mean_token_accuracy": 0.9490591704845428, "num_tokens": 147040075.0, "step": 9135 }, { "aux_loss": 8.054101610183716, "entropy": 0.1635272864252329, "epoch": 0.00914, "grad_norm": 0.1223096251487732, "learning_rate": 2e-05, "loss": 0.200970458984375, "mean_token_accuracy": 0.9452550083398819, "num_tokens": 147120148.0, "step": 9140 }, { "aux_loss": 8.047113227844239, "entropy": 0.1671906251460314, "epoch": 0.009145, "grad_norm": 0.1311800479888916, "learning_rate": 2e-05, "loss": 0.202933931350708, "mean_token_accuracy": 0.9446672409772873, "num_tokens": 147201725.0, "step": 9145 }, { "aux_loss": 8.051253843307496, "entropy": 0.17207262180745603, "epoch": 0.00915, "grad_norm": 0.13126836717128754, "learning_rate": 2e-05, "loss": 0.20531783103942872, "mean_token_accuracy": 0.9422431230545044, "num_tokens": 147282800.0, "step": 9150 }, { "aux_loss": 8.05524377822876, "entropy": 0.15392919145524503, "epoch": 0.009155, "grad_norm": 0.1381392627954483, "learning_rate": 2e-05, "loss": 0.18467797040939332, "mean_token_accuracy": 0.9486317545175552, "num_tokens": 147363409.0, "step": 9155 }, { "aux_loss": 8.060203075408936, "entropy": 0.14846806265413762, "epoch": 0.00916, "grad_norm": 0.1275726705789566, "learning_rate": 2e-05, "loss": 0.17700949907302857, "mean_token_accuracy": 0.9502640396356583, "num_tokens": 147443900.0, "step": 9160 }, { "aux_loss": 8.066796827316285, "entropy": 0.14137993082404138, "epoch": 0.009165, "grad_norm": 0.1385326385498047, "learning_rate": 2e-05, "loss": 0.16897222995758057, "mean_token_accuracy": 0.9529264569282532, "num_tokens": 147524202.0, "step": 9165 }, { "aux_loss": 8.055108118057252, "entropy": 0.17844887264072895, "epoch": 0.00917, "grad_norm": 0.1283971071243286, "learning_rate": 2e-05, "loss": 0.21684696674346923, "mean_token_accuracy": 0.9413057148456574, "num_tokens": 147604113.0, "step": 9170 }, { "aux_loss": 8.048505544662476, "entropy": 0.16603213101625441, "epoch": 0.009175, "grad_norm": 0.12222763895988464, "learning_rate": 2e-05, "loss": 0.20498316287994384, "mean_token_accuracy": 0.9432746320962906, "num_tokens": 147685017.0, "step": 9175 }, { "aux_loss": 8.048001146316528, "entropy": 0.1670322071760893, "epoch": 0.00918, "grad_norm": 0.1308424472808838, "learning_rate": 2e-05, "loss": 0.20279350280761718, "mean_token_accuracy": 0.9437865585088729, "num_tokens": 147766105.0, "step": 9180 }, { "aux_loss": 8.054187297821045, "entropy": 0.1686132237315178, "epoch": 0.009185, "grad_norm": 0.1288473904132843, "learning_rate": 2e-05, "loss": 0.19990822076797485, "mean_token_accuracy": 0.9437294691801071, "num_tokens": 147847262.0, "step": 9185 }, { "aux_loss": 8.059163904190063, "entropy": 0.15092508792877196, "epoch": 0.00919, "grad_norm": 0.1380072981119156, "learning_rate": 2e-05, "loss": 0.17768815755844117, "mean_token_accuracy": 0.9510469049215317, "num_tokens": 147927576.0, "step": 9190 }, { "aux_loss": 8.065919303894043, "entropy": 0.14715459160506725, "epoch": 0.009195, "grad_norm": 0.14201250672340393, "learning_rate": 2e-05, "loss": 0.17172386646270751, "mean_token_accuracy": 0.9520582288503647, "num_tokens": 148007903.0, "step": 9195 }, { "aux_loss": 8.05676827430725, "entropy": 0.15409750305116177, "epoch": 0.0092, "grad_norm": 0.12849180400371552, "learning_rate": 2e-05, "loss": 0.19143229722976685, "mean_token_accuracy": 0.9480628252029419, "num_tokens": 148088823.0, "step": 9200 }, { "aux_loss": 8.05044469833374, "entropy": 0.19112828448414804, "epoch": 0.009205, "grad_norm": 0.13316133618354797, "learning_rate": 2e-05, "loss": 0.23454911708831788, "mean_token_accuracy": 0.9347047060728073, "num_tokens": 148170251.0, "step": 9205 }, { "aux_loss": 8.049229526519776, "entropy": 0.16306887194514275, "epoch": 0.00921, "grad_norm": 0.12697415053844452, "learning_rate": 2e-05, "loss": 0.19756876230239867, "mean_token_accuracy": 0.9448862552642823, "num_tokens": 148250965.0, "step": 9210 }, { "aux_loss": 8.05115294456482, "entropy": 0.15382013358175756, "epoch": 0.009215, "grad_norm": 0.1288222223520279, "learning_rate": 2e-05, "loss": 0.18505736589431762, "mean_token_accuracy": 0.9490427553653717, "num_tokens": 148332150.0, "step": 9215 }, { "aux_loss": 8.057027864456177, "entropy": 0.1658315747976303, "epoch": 0.00922, "grad_norm": 0.12217347323894501, "learning_rate": 2e-05, "loss": 0.189755117893219, "mean_token_accuracy": 0.9472373455762864, "num_tokens": 148412683.0, "step": 9220 }, { "aux_loss": 8.065322017669677, "entropy": 0.1417682718485594, "epoch": 0.009225, "grad_norm": 0.14299456775188446, "learning_rate": 2e-05, "loss": 0.1710767388343811, "mean_token_accuracy": 0.9516008555889129, "num_tokens": 148493362.0, "step": 9225 }, { "aux_loss": 8.064607858657837, "entropy": 0.13697895631194115, "epoch": 0.00923, "grad_norm": 0.1288357973098755, "learning_rate": 2e-05, "loss": 0.16802023649215697, "mean_token_accuracy": 0.954392597079277, "num_tokens": 148573368.0, "step": 9230 }, { "aux_loss": 8.051961183547974, "entropy": 0.16174781173467637, "epoch": 0.009235, "grad_norm": 0.12534639239311218, "learning_rate": 2e-05, "loss": 0.19824026823043822, "mean_token_accuracy": 0.945355799794197, "num_tokens": 148654770.0, "step": 9235 }, { "aux_loss": 8.047585153579712, "entropy": 0.18336153365671634, "epoch": 0.00924, "grad_norm": 0.12391963601112366, "learning_rate": 2e-05, "loss": 0.22359731197357177, "mean_token_accuracy": 0.9378106683492661, "num_tokens": 148735336.0, "step": 9240 }, { "aux_loss": 8.050562191009522, "entropy": 0.16212284602224827, "epoch": 0.009245, "grad_norm": 0.12470485270023346, "learning_rate": 2e-05, "loss": 0.1927903413772583, "mean_token_accuracy": 0.9465355992317199, "num_tokens": 148816387.0, "step": 9245 }, { "aux_loss": 8.057068967819214, "entropy": 0.15883617624640464, "epoch": 0.00925, "grad_norm": 0.13021220266819, "learning_rate": 2e-05, "loss": 0.1838752031326294, "mean_token_accuracy": 0.94894839823246, "num_tokens": 148897298.0, "step": 9250 }, { "aux_loss": 8.062517213821412, "entropy": 0.14380777589976787, "epoch": 0.009255, "grad_norm": 0.13678789138793945, "learning_rate": 2e-05, "loss": 0.17271702289581298, "mean_token_accuracy": 0.9515684425830842, "num_tokens": 148978453.0, "step": 9255 }, { "aux_loss": 8.0665846824646, "entropy": 0.14376781955361367, "epoch": 0.00926, "grad_norm": 0.12270132452249527, "learning_rate": 2e-05, "loss": 0.1778918147087097, "mean_token_accuracy": 0.9517032414674759, "num_tokens": 149057082.0, "step": 9260 }, { "aux_loss": 8.05322332382202, "entropy": 0.16869215443730354, "epoch": 0.009265, "grad_norm": 0.14173255860805511, "learning_rate": 2e-05, "loss": 0.20956835746765137, "mean_token_accuracy": 0.9413413912057876, "num_tokens": 149138132.0, "step": 9265 }, { "aux_loss": 8.046040391921997, "entropy": 0.16795603334903716, "epoch": 0.00927, "grad_norm": 0.12431542575359344, "learning_rate": 2e-05, "loss": 0.20726256370544432, "mean_token_accuracy": 0.9420913815498352, "num_tokens": 149219229.0, "step": 9270 }, { "aux_loss": 8.052736711502074, "entropy": 0.1785639014095068, "epoch": 0.009275, "grad_norm": 0.13082771003246307, "learning_rate": 2e-05, "loss": 0.20987801551818847, "mean_token_accuracy": 0.9412637978792191, "num_tokens": 149300103.0, "step": 9275 }, { "aux_loss": 8.055554676055909, "entropy": 0.1684865839779377, "epoch": 0.00928, "grad_norm": 0.12718334794044495, "learning_rate": 2e-05, "loss": 0.19301304817199708, "mean_token_accuracy": 0.9460320919752121, "num_tokens": 149380463.0, "step": 9280 }, { "aux_loss": 8.060051774978637, "entropy": 0.16233376264572144, "epoch": 0.009285, "grad_norm": 0.13252019882202148, "learning_rate": 2e-05, "loss": 0.18949836492538452, "mean_token_accuracy": 0.9469490438699723, "num_tokens": 149460212.0, "step": 9285 }, { "aux_loss": 8.073284721374511, "entropy": 0.1458605956286192, "epoch": 0.00929, "grad_norm": 0.15022385120391846, "learning_rate": 2e-05, "loss": 0.17203078269958497, "mean_token_accuracy": 0.951647412776947, "num_tokens": 149538025.0, "step": 9290 }, { "aux_loss": 8.04990553855896, "entropy": 0.1576648410409689, "epoch": 0.009295, "grad_norm": 0.13055454194545746, "learning_rate": 2e-05, "loss": 0.19502304792404174, "mean_token_accuracy": 0.9459043979644776, "num_tokens": 149619267.0, "step": 9295 }, { "aux_loss": 8.051372957229614, "entropy": 0.18589525669813156, "epoch": 0.0093, "grad_norm": 0.12683400511741638, "learning_rate": 2e-05, "loss": 0.22710530757904052, "mean_token_accuracy": 0.9372732311487197, "num_tokens": 149700369.0, "step": 9300 }, { "aux_loss": 8.049410343170166, "entropy": 0.16699933186173438, "epoch": 0.009305, "grad_norm": 0.13137462735176086, "learning_rate": 2e-05, "loss": 0.2062304735183716, "mean_token_accuracy": 0.9432043164968491, "num_tokens": 149781352.0, "step": 9305 }, { "aux_loss": 8.055490255355835, "entropy": 0.15752097703516482, "epoch": 0.00931, "grad_norm": 0.13234452903270721, "learning_rate": 2e-05, "loss": 0.18671668767929078, "mean_token_accuracy": 0.9475500673055649, "num_tokens": 149862178.0, "step": 9310 }, { "aux_loss": 8.061890697479248, "entropy": 0.16386120915412902, "epoch": 0.009315, "grad_norm": 0.1288726031780243, "learning_rate": 2e-05, "loss": 0.18764032125473024, "mean_token_accuracy": 0.9478613406419754, "num_tokens": 149942677.0, "step": 9315 }, { "aux_loss": 8.06913390159607, "entropy": 0.1462075099349022, "epoch": 0.00932, "grad_norm": 0.14157095551490784, "learning_rate": 2e-05, "loss": 0.16920729875564575, "mean_token_accuracy": 0.9530714064836502, "num_tokens": 150023246.0, "step": 9320 }, { "aux_loss": 8.057884168624877, "entropy": 0.161289606615901, "epoch": 0.009325, "grad_norm": 0.15061193704605103, "learning_rate": 2e-05, "loss": 0.1942088484764099, "mean_token_accuracy": 0.9444399297237396, "num_tokens": 150100414.0, "step": 9325 }, { "aux_loss": 8.047045135498047, "entropy": 0.1670971255749464, "epoch": 0.00933, "grad_norm": 0.14655718207359314, "learning_rate": 2e-05, "loss": 0.20956218242645264, "mean_token_accuracy": 0.9412062048912049, "num_tokens": 150181739.0, "step": 9330 }, { "aux_loss": 8.0474187374115, "entropy": 0.17152599543333052, "epoch": 0.009335, "grad_norm": 0.13407909870147705, "learning_rate": 2e-05, "loss": 0.20760955810546874, "mean_token_accuracy": 0.9430797725915909, "num_tokens": 150262474.0, "step": 9335 }, { "aux_loss": 8.052974796295166, "entropy": 0.16562261804938316, "epoch": 0.00934, "grad_norm": 0.12974247336387634, "learning_rate": 2e-05, "loss": 0.1965591073036194, "mean_token_accuracy": 0.944324043393135, "num_tokens": 150343156.0, "step": 9340 }, { "aux_loss": 8.059053182601929, "entropy": 0.16600474789738656, "epoch": 0.009345, "grad_norm": 0.13165518641471863, "learning_rate": 2e-05, "loss": 0.18874115943908693, "mean_token_accuracy": 0.9474812120199203, "num_tokens": 150423862.0, "step": 9345 }, { "aux_loss": 8.068104648590088, "entropy": 0.14390633776783943, "epoch": 0.00935, "grad_norm": 0.1445103883743286, "learning_rate": 2e-05, "loss": 0.17139971256256104, "mean_token_accuracy": 0.951501852273941, "num_tokens": 150503705.0, "step": 9350 }, { "aux_loss": 8.054257488250732, "entropy": 0.17811726741492748, "epoch": 0.009355, "grad_norm": 0.1314753293991089, "learning_rate": 2e-05, "loss": 0.21900644302368164, "mean_token_accuracy": 0.9397265940904618, "num_tokens": 150584678.0, "step": 9355 }, { "aux_loss": 8.048040676116944, "entropy": 0.17390961721539497, "epoch": 0.00936, "grad_norm": 0.12444669008255005, "learning_rate": 2e-05, "loss": 0.20949745178222656, "mean_token_accuracy": 0.9416788220405579, "num_tokens": 150665669.0, "step": 9360 }, { "aux_loss": 8.051009035110473, "entropy": 0.1653123665601015, "epoch": 0.009365, "grad_norm": 0.12438629567623138, "learning_rate": 2e-05, "loss": 0.2017763614654541, "mean_token_accuracy": 0.9444821387529373, "num_tokens": 150746692.0, "step": 9365 }, { "aux_loss": 8.056476259231568, "entropy": 0.16538954228162767, "epoch": 0.00937, "grad_norm": 0.1241748109459877, "learning_rate": 2e-05, "loss": 0.1942046880722046, "mean_token_accuracy": 0.9446871757507325, "num_tokens": 150827509.0, "step": 9370 }, { "aux_loss": 8.059260368347168, "entropy": 0.1478948902338743, "epoch": 0.009375, "grad_norm": 0.1315631866455078, "learning_rate": 2e-05, "loss": 0.1773110508918762, "mean_token_accuracy": 0.9499401599168777, "num_tokens": 150908359.0, "step": 9375 }, { "aux_loss": 8.067628479003906, "entropy": 0.14016885533928872, "epoch": 0.00938, "grad_norm": 0.1329381763935089, "learning_rate": 2e-05, "loss": 0.1666790008544922, "mean_token_accuracy": 0.9528997659683227, "num_tokens": 150988255.0, "step": 9380 }, { "aux_loss": 8.064125585556031, "entropy": 0.16074576787650585, "epoch": 0.009385, "grad_norm": 0.12546353042125702, "learning_rate": 2e-05, "loss": 0.1952120542526245, "mean_token_accuracy": 0.9466593503952027, "num_tokens": 151067831.0, "step": 9385 }, { "aux_loss": 8.045863056182862, "entropy": 0.16810012757778167, "epoch": 0.00939, "grad_norm": 0.13055840134620667, "learning_rate": 2e-05, "loss": 0.2092730760574341, "mean_token_accuracy": 0.9432838469743728, "num_tokens": 151148899.0, "step": 9390 }, { "aux_loss": 8.04754114151001, "entropy": 0.18048907145857812, "epoch": 0.009395, "grad_norm": 0.12861719727516174, "learning_rate": 2e-05, "loss": 0.21951625347137452, "mean_token_accuracy": 0.9389490485191345, "num_tokens": 151229743.0, "step": 9395 }, { "aux_loss": 8.051449251174926, "entropy": 0.16877450346946715, "epoch": 0.0094, "grad_norm": 0.12695060670375824, "learning_rate": 2e-05, "loss": 0.19677878618240358, "mean_token_accuracy": 0.9440664023160934, "num_tokens": 151310549.0, "step": 9400 }, { "aux_loss": 8.055356740951538, "entropy": 0.149481039121747, "epoch": 0.009405, "grad_norm": 0.12921400368213654, "learning_rate": 2e-05, "loss": 0.1782172441482544, "mean_token_accuracy": 0.9512036591768265, "num_tokens": 151391373.0, "step": 9405 }, { "aux_loss": 8.061852836608887, "entropy": 0.143968391045928, "epoch": 0.00941, "grad_norm": 0.13102933764457703, "learning_rate": 2e-05, "loss": 0.17220641374588014, "mean_token_accuracy": 0.9524245947599411, "num_tokens": 151472193.0, "step": 9410 }, { "aux_loss": 8.061843824386596, "entropy": 0.14332425817847252, "epoch": 0.009415, "grad_norm": 0.12662266194820404, "learning_rate": 2e-05, "loss": 0.1767818808555603, "mean_token_accuracy": 0.9512009918689728, "num_tokens": 151552749.0, "step": 9415 }, { "aux_loss": 8.047246408462524, "entropy": 0.1688066367059946, "epoch": 0.00942, "grad_norm": 0.12467551231384277, "learning_rate": 2e-05, "loss": 0.20529661178588868, "mean_token_accuracy": 0.9429667621850968, "num_tokens": 151633940.0, "step": 9420 }, { "aux_loss": 8.046308708190917, "entropy": 0.1844594843685627, "epoch": 0.009425, "grad_norm": 0.12745779752731323, "learning_rate": 2e-05, "loss": 0.22105760574340821, "mean_token_accuracy": 0.9385595500469208, "num_tokens": 151714556.0, "step": 9425 }, { "aux_loss": 8.04946813583374, "entropy": 0.16270146295428276, "epoch": 0.00943, "grad_norm": 0.12307646870613098, "learning_rate": 2e-05, "loss": 0.1920972943305969, "mean_token_accuracy": 0.9450286716222763, "num_tokens": 151795279.0, "step": 9430 }, { "aux_loss": 8.057387161254884, "entropy": 0.1639138750731945, "epoch": 0.009435, "grad_norm": 0.12869898974895477, "learning_rate": 2e-05, "loss": 0.1896457076072693, "mean_token_accuracy": 0.9474249124526978, "num_tokens": 151876130.0, "step": 9435 }, { "aux_loss": 8.06136450767517, "entropy": 0.13895124793052674, "epoch": 0.00944, "grad_norm": 0.13967812061309814, "learning_rate": 2e-05, "loss": 0.1674266815185547, "mean_token_accuracy": 0.9536738961935043, "num_tokens": 151956699.0, "step": 9440 }, { "aux_loss": 8.068367719650269, "entropy": 0.13663856834173202, "epoch": 0.009445, "grad_norm": 0.1271567940711975, "learning_rate": 2e-05, "loss": 0.16691681146621704, "mean_token_accuracy": 0.9556272029876709, "num_tokens": 152033952.0, "step": 9445 }, { "aux_loss": 8.050022172927857, "entropy": 0.16802804507315158, "epoch": 0.00945, "grad_norm": 0.13574174046516418, "learning_rate": 2e-05, "loss": 0.21252655982971191, "mean_token_accuracy": 0.9412559688091278, "num_tokens": 152115171.0, "step": 9450 }, { "aux_loss": 8.04716248512268, "entropy": 0.166149490699172, "epoch": 0.009455, "grad_norm": 0.13551300764083862, "learning_rate": 2e-05, "loss": 0.20771293640136718, "mean_token_accuracy": 0.9421769857406617, "num_tokens": 152196226.0, "step": 9455 }, { "aux_loss": 8.050882148742676, "entropy": 0.17923564054071903, "epoch": 0.00946, "grad_norm": 0.12311870604753494, "learning_rate": 2e-05, "loss": 0.2105072021484375, "mean_token_accuracy": 0.9422770380973816, "num_tokens": 152277324.0, "step": 9460 }, { "aux_loss": 8.055430030822754, "entropy": 0.17071404084563255, "epoch": 0.009465, "grad_norm": 0.1360500305891037, "learning_rate": 2e-05, "loss": 0.19662503004074097, "mean_token_accuracy": 0.9438480734825134, "num_tokens": 152357789.0, "step": 9465 }, { "aux_loss": 8.060851955413819, "entropy": 0.15003802850842476, "epoch": 0.00947, "grad_norm": 0.13290728628635406, "learning_rate": 2e-05, "loss": 0.1774725317955017, "mean_token_accuracy": 0.9489647716283798, "num_tokens": 152438001.0, "step": 9470 }, { "aux_loss": 8.069437170028687, "entropy": 0.1424240183085203, "epoch": 0.009475, "grad_norm": 0.1440083533525467, "learning_rate": 2e-05, "loss": 0.1703614592552185, "mean_token_accuracy": 0.9517173022031784, "num_tokens": 152517099.0, "step": 9475 }, { "aux_loss": 8.049043893814087, "entropy": 0.17002014629542828, "epoch": 0.00948, "grad_norm": 0.12988366186618805, "learning_rate": 2e-05, "loss": 0.20711610317230225, "mean_token_accuracy": 0.9426903814077378, "num_tokens": 152597797.0, "step": 9480 }, { "aux_loss": 8.04736876487732, "entropy": 0.16849479153752328, "epoch": 0.009485, "grad_norm": 0.12628424167633057, "learning_rate": 2e-05, "loss": 0.2082036018371582, "mean_token_accuracy": 0.9422867804765701, "num_tokens": 152679166.0, "step": 9485 }, { "aux_loss": 8.050393438339233, "entropy": 0.16659751236438752, "epoch": 0.00949, "grad_norm": 0.13501644134521484, "learning_rate": 2e-05, "loss": 0.2020411729812622, "mean_token_accuracy": 0.944596815109253, "num_tokens": 152759962.0, "step": 9490 }, { "aux_loss": 8.052613925933837, "entropy": 0.1595939502120018, "epoch": 0.009495, "grad_norm": 0.11969030648469925, "learning_rate": 2e-05, "loss": 0.18960103988647461, "mean_token_accuracy": 0.9479102104902267, "num_tokens": 152840713.0, "step": 9495 }, { "aux_loss": 8.058992767333985, "entropy": 0.14904571026563646, "epoch": 0.0095, "grad_norm": 0.12419265508651733, "learning_rate": 2e-05, "loss": 0.17722588777542114, "mean_token_accuracy": 0.9507673263549805, "num_tokens": 152921053.0, "step": 9500 } ], "logging_steps": 5, "max_steps": 1000000, "num_input_tokens_seen": 0, "num_train_epochs": 9223372036854775807, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.7777590941142225e+19, "train_batch_size": 1, "trial_name": null, "trial_params": null }