Instructions to use greyAll/test-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use greyAll/test-lora with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("greyAll/test-lora", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 23.0, | |
| "eval_steps": 500, | |
| "global_step": 966, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "aux_loss": 8.045117378234863, | |
| "entropy": 0.05226727016270161, | |
| "epoch": 0.024096385542168676, | |
| "grad_norm": 0.5021907687187195, | |
| "learning_rate": 0.0, | |
| "loss": 0.09741637855768204, | |
| "mean_token_accuracy": 0.9888820052146912, | |
| "num_tokens": 154362.0, | |
| "step": 1 | |
| }, | |
| { | |
| "aux_loss": 8.047614574432373, | |
| "entropy": 0.05835266411304474, | |
| "epoch": 0.04819277108433735, | |
| "grad_norm": 0.551396369934082, | |
| "learning_rate": 1.4500000000000001e-07, | |
| "loss": 0.09991507232189178, | |
| "mean_token_accuracy": 0.9883801937103271, | |
| "num_tokens": 310702.0, | |
| "step": 2 | |
| }, | |
| { | |
| "aux_loss": 8.049727439880371, | |
| "entropy": 0.052583809942007065, | |
| "epoch": 0.07228915662650602, | |
| "grad_norm": 0.4750031530857086, | |
| "learning_rate": 2.9000000000000003e-07, | |
| "loss": 0.09806497395038605, | |
| "mean_token_accuracy": 0.9886206984519958, | |
| "num_tokens": 493904.0, | |
| "step": 3 | |
| }, | |
| { | |
| "aux_loss": 8.047826766967773, | |
| "entropy": 0.05231792479753494, | |
| "epoch": 0.0963855421686747, | |
| "grad_norm": 0.4863564074039459, | |
| "learning_rate": 4.35e-07, | |
| "loss": 0.09776315838098526, | |
| "mean_token_accuracy": 0.9888334274291992, | |
| "num_tokens": 663136.0, | |
| "step": 4 | |
| }, | |
| { | |
| "aux_loss": 8.047198295593262, | |
| "entropy": 0.04943128302693367, | |
| "epoch": 0.12048192771084337, | |
| "grad_norm": 0.5010114908218384, | |
| "learning_rate": 5.800000000000001e-07, | |
| "loss": 0.09543517231941223, | |
| "mean_token_accuracy": 0.9894405901432037, | |
| "num_tokens": 812532.0, | |
| "step": 5 | |
| }, | |
| { | |
| "aux_loss": 8.049106121063232, | |
| "entropy": 0.063042301684618, | |
| "epoch": 0.14457831325301204, | |
| "grad_norm": 0.5165722966194153, | |
| "learning_rate": 7.25e-07, | |
| "loss": 0.10346449911594391, | |
| "mean_token_accuracy": 0.987544983625412, | |
| "num_tokens": 973071.0, | |
| "step": 6 | |
| }, | |
| { | |
| "aux_loss": 8.047893047332764, | |
| "entropy": 0.0672433041036129, | |
| "epoch": 0.1686746987951807, | |
| "grad_norm": 0.5849524736404419, | |
| "learning_rate": 8.7e-07, | |
| "loss": 0.10626787692308426, | |
| "mean_token_accuracy": 0.9862557649612427, | |
| "num_tokens": 1110326.0, | |
| "step": 7 | |
| }, | |
| { | |
| "aux_loss": 8.04862642288208, | |
| "entropy": 0.06088166497647762, | |
| "epoch": 0.1927710843373494, | |
| "grad_norm": 0.48005586862564087, | |
| "learning_rate": 1.015e-06, | |
| "loss": 0.1021210104227066, | |
| "mean_token_accuracy": 0.9877255260944366, | |
| "num_tokens": 1259440.0, | |
| "step": 8 | |
| }, | |
| { | |
| "aux_loss": 8.047185897827148, | |
| "entropy": 0.049826065078377724, | |
| "epoch": 0.21686746987951808, | |
| "grad_norm": 0.43366947770118713, | |
| "learning_rate": 1.1600000000000001e-06, | |
| "loss": 0.09475715458393097, | |
| "mean_token_accuracy": 0.9898165464401245, | |
| "num_tokens": 1417756.0, | |
| "step": 9 | |
| }, | |
| { | |
| "aux_loss": 8.04772663116455, | |
| "entropy": 0.054957231506705284, | |
| "epoch": 0.24096385542168675, | |
| "grad_norm": 0.4529463052749634, | |
| "learning_rate": 1.3050000000000002e-06, | |
| "loss": 0.09896557033061981, | |
| "mean_token_accuracy": 0.9889253675937653, | |
| "num_tokens": 1579862.0, | |
| "step": 10 | |
| }, | |
| { | |
| "aux_loss": 8.047585487365723, | |
| "entropy": 0.05796742998063564, | |
| "epoch": 0.26506024096385544, | |
| "grad_norm": 0.45284125208854675, | |
| "learning_rate": 1.45e-06, | |
| "loss": 0.10001235455274582, | |
| "mean_token_accuracy": 0.9876790642738342, | |
| "num_tokens": 1731184.0, | |
| "step": 11 | |
| }, | |
| { | |
| "aux_loss": 8.04898738861084, | |
| "entropy": 0.05215233750641346, | |
| "epoch": 0.2891566265060241, | |
| "grad_norm": 0.4420299828052521, | |
| "learning_rate": 1.4499995904705798e-06, | |
| "loss": 0.09724222123622894, | |
| "mean_token_accuracy": 0.9884337782859802, | |
| "num_tokens": 1893932.0, | |
| "step": 12 | |
| }, | |
| { | |
| "aux_loss": 8.04798412322998, | |
| "entropy": 0.05265074409544468, | |
| "epoch": 0.3132530120481928, | |
| "grad_norm": 0.40204742550849915, | |
| "learning_rate": 1.4499983618832442e-06, | |
| "loss": 0.0970243290066719, | |
| "mean_token_accuracy": 0.989496260881424, | |
| "num_tokens": 2053005.0, | |
| "step": 13 | |
| }, | |
| { | |
| "aux_loss": 8.05030107498169, | |
| "entropy": 0.049178898334503174, | |
| "epoch": 0.3373493975903614, | |
| "grad_norm": 0.4108814597129822, | |
| "learning_rate": 1.4499963142407692e-06, | |
| "loss": 0.09499870240688324, | |
| "mean_token_accuracy": 0.9897345900535583, | |
| "num_tokens": 2217039.0, | |
| "step": 14 | |
| }, | |
| { | |
| "aux_loss": 8.046091079711914, | |
| "entropy": 0.0504351407289505, | |
| "epoch": 0.3614457831325301, | |
| "grad_norm": 0.4030505418777466, | |
| "learning_rate": 1.4499934475477814e-06, | |
| "loss": 0.09597203135490417, | |
| "mean_token_accuracy": 0.9898054599761963, | |
| "num_tokens": 2386769.0, | |
| "step": 15 | |
| }, | |
| { | |
| "aux_loss": 8.047934532165527, | |
| "entropy": 0.04648676887154579, | |
| "epoch": 0.3855421686746988, | |
| "grad_norm": 0.4123123586177826, | |
| "learning_rate": 1.4499897618107582e-06, | |
| "loss": 0.09345895051956177, | |
| "mean_token_accuracy": 0.989924967288971, | |
| "num_tokens": 2551093.0, | |
| "step": 16 | |
| }, | |
| { | |
| "aux_loss": 8.04793405532837, | |
| "entropy": 0.04946734011173248, | |
| "epoch": 0.40963855421686746, | |
| "grad_norm": 0.42739129066467285, | |
| "learning_rate": 1.4499852570380272e-06, | |
| "loss": 0.09633760154247284, | |
| "mean_token_accuracy": 0.9889810979366302, | |
| "num_tokens": 2704860.0, | |
| "step": 17 | |
| }, | |
| { | |
| "aux_loss": 8.048253536224365, | |
| "entropy": 0.0546275470405817, | |
| "epoch": 0.43373493975903615, | |
| "grad_norm": 0.44881728291511536, | |
| "learning_rate": 1.449979933239767e-06, | |
| "loss": 0.09820500761270523, | |
| "mean_token_accuracy": 0.9885384142398834, | |
| "num_tokens": 2850860.0, | |
| "step": 18 | |
| }, | |
| { | |
| "aux_loss": 8.050773620605469, | |
| "entropy": 0.05041976273059845, | |
| "epoch": 0.4578313253012048, | |
| "grad_norm": 0.46621593832969666, | |
| "learning_rate": 1.4499737904280063e-06, | |
| "loss": 0.09671641141176224, | |
| "mean_token_accuracy": 0.9887768924236298, | |
| "num_tokens": 3039323.0, | |
| "step": 19 | |
| }, | |
| { | |
| "aux_loss": 8.050614356994629, | |
| "entropy": 0.050554944202303886, | |
| "epoch": 0.4819277108433735, | |
| "grad_norm": 0.47147253155708313, | |
| "learning_rate": 1.449966828616625e-06, | |
| "loss": 0.09628961980342865, | |
| "mean_token_accuracy": 0.9888468682765961, | |
| "num_tokens": 3195488.0, | |
| "step": 20 | |
| }, | |
| { | |
| "aux_loss": 8.050609111785889, | |
| "entropy": 0.04489951767027378, | |
| "epoch": 0.5060240963855421, | |
| "grad_norm": 0.4890425503253937, | |
| "learning_rate": 1.4499590478213525e-06, | |
| "loss": 0.09394823014736176, | |
| "mean_token_accuracy": 0.9896246194839478, | |
| "num_tokens": 3369627.0, | |
| "step": 21 | |
| }, | |
| { | |
| "aux_loss": 8.047994613647461, | |
| "entropy": 0.0530005544424057, | |
| "epoch": 0.5301204819277109, | |
| "grad_norm": 0.5181686878204346, | |
| "learning_rate": 1.4499504480597702e-06, | |
| "loss": 0.09846185147762299, | |
| "mean_token_accuracy": 0.9879846572875977, | |
| "num_tokens": 3520643.0, | |
| "step": 22 | |
| }, | |
| { | |
| "aux_loss": 8.049047946929932, | |
| "entropy": 0.039870962500572205, | |
| "epoch": 0.5542168674698795, | |
| "grad_norm": 0.41603270173072815, | |
| "learning_rate": 1.4499410293513081e-06, | |
| "loss": 0.09075028449296951, | |
| "mean_token_accuracy": 0.9908623099327087, | |
| "num_tokens": 3702510.0, | |
| "step": 23 | |
| }, | |
| { | |
| "aux_loss": 8.050177097320557, | |
| "entropy": 0.05053388141095638, | |
| "epoch": 0.5783132530120482, | |
| "grad_norm": 0.4234795570373535, | |
| "learning_rate": 1.449930791717248e-06, | |
| "loss": 0.09689382463693619, | |
| "mean_token_accuracy": 0.9886369109153748, | |
| "num_tokens": 3867610.0, | |
| "step": 24 | |
| }, | |
| { | |
| "aux_loss": 8.048462867736816, | |
| "entropy": 0.049235520884394646, | |
| "epoch": 0.6024096385542169, | |
| "grad_norm": 0.4375890791416168, | |
| "learning_rate": 1.4499197351807219e-06, | |
| "loss": 0.09504671394824982, | |
| "mean_token_accuracy": 0.9891063868999481, | |
| "num_tokens": 4021186.0, | |
| "step": 25 | |
| }, | |
| { | |
| "aux_loss": 8.050186157226562, | |
| "entropy": 0.048021236434578896, | |
| "epoch": 0.6265060240963856, | |
| "grad_norm": 0.42389488220214844, | |
| "learning_rate": 1.449907859766711e-06, | |
| "loss": 0.09462042152881622, | |
| "mean_token_accuracy": 0.9893973469734192, | |
| "num_tokens": 4183102.0, | |
| "step": 26 | |
| }, | |
| { | |
| "aux_loss": 8.04945182800293, | |
| "entropy": 0.042689668014645576, | |
| "epoch": 0.6506024096385542, | |
| "grad_norm": 0.40038207173347473, | |
| "learning_rate": 1.4498951655020479e-06, | |
| "loss": 0.09214234352111816, | |
| "mean_token_accuracy": 0.9904394745826721, | |
| "num_tokens": 4348628.0, | |
| "step": 27 | |
| }, | |
| { | |
| "aux_loss": 8.050597667694092, | |
| "entropy": 0.05143065005540848, | |
| "epoch": 0.6746987951807228, | |
| "grad_norm": 0.4422961473464966, | |
| "learning_rate": 1.4498816524154148e-06, | |
| "loss": 0.09722501039505005, | |
| "mean_token_accuracy": 0.9888282418251038, | |
| "num_tokens": 4511217.0, | |
| "step": 28 | |
| }, | |
| { | |
| "aux_loss": 8.048704147338867, | |
| "entropy": 0.044764744117856026, | |
| "epoch": 0.6987951807228916, | |
| "grad_norm": 0.4279940128326416, | |
| "learning_rate": 1.4498673205373443e-06, | |
| "loss": 0.09300120174884796, | |
| "mean_token_accuracy": 0.9899511337280273, | |
| "num_tokens": 4684266.0, | |
| "step": 29 | |
| }, | |
| { | |
| "aux_loss": 8.047113418579102, | |
| "entropy": 0.04995520040392876, | |
| "epoch": 0.7228915662650602, | |
| "grad_norm": 0.45497408509254456, | |
| "learning_rate": 1.4498521699002187e-06, | |
| "loss": 0.0966445729136467, | |
| "mean_token_accuracy": 0.9883378744125366, | |
| "num_tokens": 4858009.0, | |
| "step": 30 | |
| }, | |
| { | |
| "aux_loss": 8.050236701965332, | |
| "entropy": 0.04773502238094807, | |
| "epoch": 0.7469879518072289, | |
| "grad_norm": 0.40059739351272583, | |
| "learning_rate": 1.4498362005382707e-06, | |
| "loss": 0.09425598382949829, | |
| "mean_token_accuracy": 0.9895853698253632, | |
| "num_tokens": 5041560.0, | |
| "step": 31 | |
| }, | |
| { | |
| "aux_loss": 8.0483078956604, | |
| "entropy": 0.04463958367705345, | |
| "epoch": 0.7710843373493976, | |
| "grad_norm": 0.421403706073761, | |
| "learning_rate": 1.4498194124875822e-06, | |
| "loss": 0.0921817421913147, | |
| "mean_token_accuracy": 0.9903146624565125, | |
| "num_tokens": 5207925.0, | |
| "step": 32 | |
| }, | |
| { | |
| "aux_loss": 8.051517486572266, | |
| "entropy": 0.0455746091902256, | |
| "epoch": 0.7951807228915663, | |
| "grad_norm": 0.39467114210128784, | |
| "learning_rate": 1.449801805786086e-06, | |
| "loss": 0.09311801195144653, | |
| "mean_token_accuracy": 0.9897293448448181, | |
| "num_tokens": 5410900.0, | |
| "step": 33 | |
| }, | |
| { | |
| "aux_loss": 8.047285079956055, | |
| "entropy": 0.04475598596036434, | |
| "epoch": 0.8192771084337349, | |
| "grad_norm": 0.3885505795478821, | |
| "learning_rate": 1.4497833804735631e-06, | |
| "loss": 0.09283807128667831, | |
| "mean_token_accuracy": 0.9904457926750183, | |
| "num_tokens": 5579379.0, | |
| "step": 34 | |
| }, | |
| { | |
| "aux_loss": 8.049206733703613, | |
| "entropy": 0.045768845826387405, | |
| "epoch": 0.8433734939759037, | |
| "grad_norm": 0.38822969794273376, | |
| "learning_rate": 1.4497641365916457e-06, | |
| "loss": 0.0930660218000412, | |
| "mean_token_accuracy": 0.9898505806922913, | |
| "num_tokens": 5756181.0, | |
| "step": 35 | |
| }, | |
| { | |
| "aux_loss": 8.049548149108887, | |
| "entropy": 0.0442772526293993, | |
| "epoch": 0.8674698795180723, | |
| "grad_norm": 0.42765918374061584, | |
| "learning_rate": 1.4497440741838147e-06, | |
| "loss": 0.09213966131210327, | |
| "mean_token_accuracy": 0.9906859695911407, | |
| "num_tokens": 5913888.0, | |
| "step": 36 | |
| }, | |
| { | |
| "aux_loss": 8.047310829162598, | |
| "entropy": 0.05137152969837189, | |
| "epoch": 0.891566265060241, | |
| "grad_norm": 0.46749433875083923, | |
| "learning_rate": 1.4497231932954002e-06, | |
| "loss": 0.09635019302368164, | |
| "mean_token_accuracy": 0.9894134104251862, | |
| "num_tokens": 6073822.0, | |
| "step": 37 | |
| }, | |
| { | |
| "aux_loss": 8.04575777053833, | |
| "entropy": 0.04952680319547653, | |
| "epoch": 0.9156626506024096, | |
| "grad_norm": 0.40102288126945496, | |
| "learning_rate": 1.4497014939735825e-06, | |
| "loss": 0.09520888328552246, | |
| "mean_token_accuracy": 0.9900149703025818, | |
| "num_tokens": 6228998.0, | |
| "step": 38 | |
| }, | |
| { | |
| "aux_loss": 8.05048656463623, | |
| "entropy": 0.05141362361609936, | |
| "epoch": 0.9397590361445783, | |
| "grad_norm": 0.45891159772872925, | |
| "learning_rate": 1.4496789762673903e-06, | |
| "loss": 0.09608915448188782, | |
| "mean_token_accuracy": 0.9895050525665283, | |
| "num_tokens": 6380479.0, | |
| "step": 39 | |
| }, | |
| { | |
| "aux_loss": 8.049390316009521, | |
| "entropy": 0.0542642492800951, | |
| "epoch": 0.963855421686747, | |
| "grad_norm": 0.4678654968738556, | |
| "learning_rate": 1.4496556402277018e-06, | |
| "loss": 0.0986521765589714, | |
| "mean_token_accuracy": 0.9882148206233978, | |
| "num_tokens": 6514347.0, | |
| "step": 40 | |
| }, | |
| { | |
| "aux_loss": 8.047286033630371, | |
| "entropy": 0.04129311256110668, | |
| "epoch": 0.9879518072289156, | |
| "grad_norm": 0.42529988288879395, | |
| "learning_rate": 1.4496314859072443e-06, | |
| "loss": 0.09138549864292145, | |
| "mean_token_accuracy": 0.9908298254013062, | |
| "num_tokens": 6684739.0, | |
| "step": 41 | |
| }, | |
| { | |
| "aux_loss": 8.050637245178223, | |
| "entropy": 0.04988313093781471, | |
| "epoch": 1.0, | |
| "grad_norm": 0.5628013610839844, | |
| "learning_rate": 1.4496065133605937e-06, | |
| "loss": 0.06163128837943077, | |
| "mean_token_accuracy": 0.9887231588363647, | |
| "num_tokens": 6741463.0, | |
| "step": 42 | |
| }, | |
| { | |
| "aux_loss": 8.047677040100098, | |
| "entropy": 0.04833286814391613, | |
| "epoch": 1.0240963855421688, | |
| "grad_norm": 0.43433839082717896, | |
| "learning_rate": 1.4495807226441745e-06, | |
| "loss": 0.09322302043437958, | |
| "mean_token_accuracy": 0.9907335042953491, | |
| "num_tokens": 6872162.0, | |
| "step": 43 | |
| }, | |
| { | |
| "aux_loss": 8.049845218658447, | |
| "entropy": 0.04814961925148964, | |
| "epoch": 1.0481927710843373, | |
| "grad_norm": 0.38683706521987915, | |
| "learning_rate": 1.4495541138162606e-06, | |
| "loss": 0.09274052828550339, | |
| "mean_token_accuracy": 0.9911822378635406, | |
| "num_tokens": 7044917.0, | |
| "step": 44 | |
| }, | |
| { | |
| "aux_loss": 8.045840740203857, | |
| "entropy": 0.04862277954816818, | |
| "epoch": 1.072289156626506, | |
| "grad_norm": 0.43781232833862305, | |
| "learning_rate": 1.4495266869369737e-06, | |
| "loss": 0.09285125136375427, | |
| "mean_token_accuracy": 0.991097629070282, | |
| "num_tokens": 7207551.0, | |
| "step": 45 | |
| }, | |
| { | |
| "aux_loss": 8.047110080718994, | |
| "entropy": 0.04816548526287079, | |
| "epoch": 1.0963855421686748, | |
| "grad_norm": 0.4117249846458435, | |
| "learning_rate": 1.4494984420682841e-06, | |
| "loss": 0.09330926835536957, | |
| "mean_token_accuracy": 0.990231990814209, | |
| "num_tokens": 7376391.0, | |
| "step": 46 | |
| }, | |
| { | |
| "aux_loss": 8.046239852905273, | |
| "entropy": 0.04640440456569195, | |
| "epoch": 1.1204819277108433, | |
| "grad_norm": 0.3918110728263855, | |
| "learning_rate": 1.4494693792740101e-06, | |
| "loss": 0.09266579151153564, | |
| "mean_token_accuracy": 0.9905861914157867, | |
| "num_tokens": 7544885.0, | |
| "step": 47 | |
| }, | |
| { | |
| "aux_loss": 8.045721054077148, | |
| "entropy": 0.04254587180912495, | |
| "epoch": 1.144578313253012, | |
| "grad_norm": 0.3635147213935852, | |
| "learning_rate": 1.4494394986198189e-06, | |
| "loss": 0.08964599668979645, | |
| "mean_token_accuracy": 0.9919890761375427, | |
| "num_tokens": 7718825.0, | |
| "step": 48 | |
| }, | |
| { | |
| "aux_loss": 8.04783582687378, | |
| "entropy": 0.0457068495452404, | |
| "epoch": 1.1686746987951806, | |
| "grad_norm": 0.37491077184677124, | |
| "learning_rate": 1.4494088001732242e-06, | |
| "loss": 0.0912659764289856, | |
| "mean_token_accuracy": 0.9914940893650055, | |
| "num_tokens": 7884797.0, | |
| "step": 49 | |
| }, | |
| { | |
| "aux_loss": 8.048118591308594, | |
| "entropy": 0.05809796415269375, | |
| "epoch": 1.1927710843373494, | |
| "grad_norm": 0.442947119474411, | |
| "learning_rate": 1.449377284003589e-06, | |
| "loss": 0.09830181300640106, | |
| "mean_token_accuracy": 0.9896205961704254, | |
| "num_tokens": 8037756.0, | |
| "step": 50 | |
| }, | |
| { | |
| "aux_loss": 8.045411109924316, | |
| "entropy": 0.04734855704009533, | |
| "epoch": 1.216867469879518, | |
| "grad_norm": 0.3778594732284546, | |
| "learning_rate": 1.449344950182123e-06, | |
| "loss": 0.09220214188098907, | |
| "mean_token_accuracy": 0.9912082552909851, | |
| "num_tokens": 8201900.0, | |
| "step": 51 | |
| }, | |
| { | |
| "aux_loss": 8.051240921020508, | |
| "entropy": 0.04616173356771469, | |
| "epoch": 1.2409638554216866, | |
| "grad_norm": 0.39906826615333557, | |
| "learning_rate": 1.4493117987818833e-06, | |
| "loss": 0.09254124015569687, | |
| "mean_token_accuracy": 0.9910232424736023, | |
| "num_tokens": 8368482.0, | |
| "step": 52 | |
| }, | |
| { | |
| "aux_loss": 8.048255443572998, | |
| "entropy": 0.04362104274332523, | |
| "epoch": 1.2650602409638554, | |
| "grad_norm": 0.4132522642612457, | |
| "learning_rate": 1.449277829877775e-06, | |
| "loss": 0.08969354629516602, | |
| "mean_token_accuracy": 0.9923582375049591, | |
| "num_tokens": 8532083.0, | |
| "step": 53 | |
| }, | |
| { | |
| "aux_loss": 8.049753189086914, | |
| "entropy": 0.05157726630568504, | |
| "epoch": 1.2891566265060241, | |
| "grad_norm": 0.42263299226760864, | |
| "learning_rate": 1.4492430435465495e-06, | |
| "loss": 0.09429101645946503, | |
| "mean_token_accuracy": 0.9907614588737488, | |
| "num_tokens": 8707916.0, | |
| "step": 54 | |
| }, | |
| { | |
| "aux_loss": 8.04571533203125, | |
| "entropy": 0.04540949687361717, | |
| "epoch": 1.3132530120481927, | |
| "grad_norm": 0.415887713432312, | |
| "learning_rate": 1.4492074398668059e-06, | |
| "loss": 0.09169892221689224, | |
| "mean_token_accuracy": 0.9909594357013702, | |
| "num_tokens": 8868293.0, | |
| "step": 55 | |
| }, | |
| { | |
| "aux_loss": 8.047487258911133, | |
| "entropy": 0.042821500450372696, | |
| "epoch": 1.3373493975903614, | |
| "grad_norm": 0.3941069543361664, | |
| "learning_rate": 1.4491710189189896e-06, | |
| "loss": 0.08963996917009354, | |
| "mean_token_accuracy": 0.9915030598640442, | |
| "num_tokens": 9040400.0, | |
| "step": 56 | |
| }, | |
| { | |
| "aux_loss": 8.046500205993652, | |
| "entropy": 0.04034057445824146, | |
| "epoch": 1.3614457831325302, | |
| "grad_norm": 0.3714058995246887, | |
| "learning_rate": 1.4491337807853928e-06, | |
| "loss": 0.08831468969583511, | |
| "mean_token_accuracy": 0.9924418330192566, | |
| "num_tokens": 9210005.0, | |
| "step": 57 | |
| }, | |
| { | |
| "aux_loss": 8.04520559310913, | |
| "entropy": 0.04288036748766899, | |
| "epoch": 1.3855421686746987, | |
| "grad_norm": 0.4117484986782074, | |
| "learning_rate": 1.4490957255501541e-06, | |
| "loss": 0.09062028676271439, | |
| "mean_token_accuracy": 0.9908726513385773, | |
| "num_tokens": 9354587.0, | |
| "step": 58 | |
| }, | |
| { | |
| "aux_loss": 8.048189163208008, | |
| "entropy": 0.04117992892861366, | |
| "epoch": 1.4096385542168675, | |
| "grad_norm": 0.3880350589752197, | |
| "learning_rate": 1.449056853299258e-06, | |
| "loss": 0.08878283947706223, | |
| "mean_token_accuracy": 0.9918811917304993, | |
| "num_tokens": 9530098.0, | |
| "step": 59 | |
| }, | |
| { | |
| "aux_loss": 8.046634674072266, | |
| "entropy": 0.046307843178510666, | |
| "epoch": 1.4337349397590362, | |
| "grad_norm": 0.41205379366874695, | |
| "learning_rate": 1.4490171641205356e-06, | |
| "loss": 0.0928514301776886, | |
| "mean_token_accuracy": 0.99020916223526, | |
| "num_tokens": 9696846.0, | |
| "step": 60 | |
| }, | |
| { | |
| "aux_loss": 8.04638147354126, | |
| "entropy": 0.03861385025084019, | |
| "epoch": 1.4578313253012047, | |
| "grad_norm": 0.3674647808074951, | |
| "learning_rate": 1.4489766581036633e-06, | |
| "loss": 0.08779378235340118, | |
| "mean_token_accuracy": 0.9924313127994537, | |
| "num_tokens": 9868180.0, | |
| "step": 61 | |
| }, | |
| { | |
| "aux_loss": 8.048831462860107, | |
| "entropy": 0.04485859349370003, | |
| "epoch": 1.4819277108433735, | |
| "grad_norm": 0.4122410714626312, | |
| "learning_rate": 1.4489353353401633e-06, | |
| "loss": 0.09213700890541077, | |
| "mean_token_accuracy": 0.9905197322368622, | |
| "num_tokens": 10041207.0, | |
| "step": 62 | |
| }, | |
| { | |
| "aux_loss": 8.045693397521973, | |
| "entropy": 0.04181382618844509, | |
| "epoch": 1.5060240963855422, | |
| "grad_norm": 0.41252797842025757, | |
| "learning_rate": 1.4488931959234036e-06, | |
| "loss": 0.08966240286827087, | |
| "mean_token_accuracy": 0.9918944835662842, | |
| "num_tokens": 10216601.0, | |
| "step": 63 | |
| }, | |
| { | |
| "aux_loss": 8.045026779174805, | |
| "entropy": 0.04367237165570259, | |
| "epoch": 1.5301204819277108, | |
| "grad_norm": 0.7194992899894714, | |
| "learning_rate": 1.4488502399485967e-06, | |
| "loss": 0.09064353257417679, | |
| "mean_token_accuracy": 0.9913205206394196, | |
| "num_tokens": 10373157.0, | |
| "step": 64 | |
| }, | |
| { | |
| "aux_loss": 8.046749591827393, | |
| "entropy": 0.049618642777204514, | |
| "epoch": 1.5542168674698795, | |
| "grad_norm": 0.4409625828266144, | |
| "learning_rate": 1.4488064675128008e-06, | |
| "loss": 0.09418876469135284, | |
| "mean_token_accuracy": 0.98995640873909, | |
| "num_tokens": 10513760.0, | |
| "step": 65 | |
| }, | |
| { | |
| "aux_loss": 8.04750108718872, | |
| "entropy": 0.045051392167806625, | |
| "epoch": 1.5783132530120483, | |
| "grad_norm": 0.4379954934120178, | |
| "learning_rate": 1.4487618787149178e-06, | |
| "loss": 0.09229664504528046, | |
| "mean_token_accuracy": 0.990358978509903, | |
| "num_tokens": 10667072.0, | |
| "step": 66 | |
| }, | |
| { | |
| "aux_loss": 8.0473952293396, | |
| "entropy": 0.03963223472237587, | |
| "epoch": 1.6024096385542168, | |
| "grad_norm": 0.3720748722553253, | |
| "learning_rate": 1.4487164736556958e-06, | |
| "loss": 0.08866938948631287, | |
| "mean_token_accuracy": 0.9920879304409027, | |
| "num_tokens": 10839108.0, | |
| "step": 67 | |
| }, | |
| { | |
| "aux_loss": 8.047708511352539, | |
| "entropy": 0.04451095871627331, | |
| "epoch": 1.6265060240963856, | |
| "grad_norm": 0.4250375032424927, | |
| "learning_rate": 1.4486702524377257e-06, | |
| "loss": 0.09129409492015839, | |
| "mean_token_accuracy": 0.9904707074165344, | |
| "num_tokens": 11001747.0, | |
| "step": 68 | |
| }, | |
| { | |
| "aux_loss": 8.045770645141602, | |
| "entropy": 0.041699016466736794, | |
| "epoch": 1.6506024096385543, | |
| "grad_norm": 0.5749812722206116, | |
| "learning_rate": 1.4486232151654433e-06, | |
| "loss": 0.08955338597297668, | |
| "mean_token_accuracy": 0.9914253950119019, | |
| "num_tokens": 11163010.0, | |
| "step": 69 | |
| }, | |
| { | |
| "aux_loss": 8.048367977142334, | |
| "entropy": 0.0460666548460722, | |
| "epoch": 1.6746987951807228, | |
| "grad_norm": 0.412992388010025, | |
| "learning_rate": 1.448575361945128e-06, | |
| "loss": 0.09151523560285568, | |
| "mean_token_accuracy": 0.9911079108715057, | |
| "num_tokens": 11326488.0, | |
| "step": 70 | |
| }, | |
| { | |
| "aux_loss": 8.047677040100098, | |
| "entropy": 0.039530523121356964, | |
| "epoch": 1.6987951807228916, | |
| "grad_norm": 0.3757312297821045, | |
| "learning_rate": 1.4485266928849028e-06, | |
| "loss": 0.08811481297016144, | |
| "mean_token_accuracy": 0.9917347729206085, | |
| "num_tokens": 11501286.0, | |
| "step": 71 | |
| }, | |
| { | |
| "aux_loss": 8.046856880187988, | |
| "entropy": 0.041672926396131516, | |
| "epoch": 1.7228915662650603, | |
| "grad_norm": 0.38275983929634094, | |
| "learning_rate": 1.448477208094734e-06, | |
| "loss": 0.08906584978103638, | |
| "mean_token_accuracy": 0.9918383359909058, | |
| "num_tokens": 11668188.0, | |
| "step": 72 | |
| }, | |
| { | |
| "aux_loss": 8.04528522491455, | |
| "entropy": 0.047908855602145195, | |
| "epoch": 1.7469879518072289, | |
| "grad_norm": 0.4008839726448059, | |
| "learning_rate": 1.4484269076864313e-06, | |
| "loss": 0.09260185062885284, | |
| "mean_token_accuracy": 0.9907302260398865, | |
| "num_tokens": 11834809.0, | |
| "step": 73 | |
| }, | |
| { | |
| "aux_loss": 8.047989845275879, | |
| "entropy": 0.049024928361177444, | |
| "epoch": 1.7710843373493976, | |
| "grad_norm": 0.43533122539520264, | |
| "learning_rate": 1.448375791773647e-06, | |
| "loss": 0.09409160912036896, | |
| "mean_token_accuracy": 0.9904188215732574, | |
| "num_tokens": 12004510.0, | |
| "step": 74 | |
| }, | |
| { | |
| "aux_loss": 8.045915126800537, | |
| "entropy": 0.05250510759651661, | |
| "epoch": 1.7951807228915664, | |
| "grad_norm": 0.4690086841583252, | |
| "learning_rate": 1.4483238604718765e-06, | |
| "loss": 0.0955488458275795, | |
| "mean_token_accuracy": 0.9906903803348541, | |
| "num_tokens": 12137534.0, | |
| "step": 75 | |
| }, | |
| { | |
| "aux_loss": 8.044984817504883, | |
| "entropy": 0.0376634681597352, | |
| "epoch": 1.819277108433735, | |
| "grad_norm": 0.35793742537498474, | |
| "learning_rate": 1.4482711138984564e-06, | |
| "loss": 0.08688877522945404, | |
| "mean_token_accuracy": 0.9927193224430084, | |
| "num_tokens": 12325369.0, | |
| "step": 76 | |
| }, | |
| { | |
| "aux_loss": 8.04779052734375, | |
| "entropy": 0.04571797512471676, | |
| "epoch": 1.8433734939759037, | |
| "grad_norm": 0.4300045371055603, | |
| "learning_rate": 1.4482175521725665e-06, | |
| "loss": 0.09217096120119095, | |
| "mean_token_accuracy": 0.9905279278755188, | |
| "num_tokens": 12488806.0, | |
| "step": 77 | |
| }, | |
| { | |
| "aux_loss": 8.044951915740967, | |
| "entropy": 0.05060774274170399, | |
| "epoch": 1.8674698795180724, | |
| "grad_norm": 0.423297643661499, | |
| "learning_rate": 1.4481631754152286e-06, | |
| "loss": 0.0944666936993599, | |
| "mean_token_accuracy": 0.990161120891571, | |
| "num_tokens": 12640695.0, | |
| "step": 78 | |
| }, | |
| { | |
| "aux_loss": 8.047436714172363, | |
| "entropy": 0.04260541498661041, | |
| "epoch": 1.891566265060241, | |
| "grad_norm": 0.39964279532432556, | |
| "learning_rate": 1.4481079837493048e-06, | |
| "loss": 0.08988695591688156, | |
| "mean_token_accuracy": 0.9916346371173859, | |
| "num_tokens": 12823930.0, | |
| "step": 79 | |
| }, | |
| { | |
| "aux_loss": 8.047076225280762, | |
| "entropy": 0.04447777755558491, | |
| "epoch": 1.9156626506024095, | |
| "grad_norm": 0.3796585202217102, | |
| "learning_rate": 1.4480519772994993e-06, | |
| "loss": 0.09115425497293472, | |
| "mean_token_accuracy": 0.9917284250259399, | |
| "num_tokens": 12998419.0, | |
| "step": 80 | |
| }, | |
| { | |
| "aux_loss": 8.04789924621582, | |
| "entropy": 0.04236619919538498, | |
| "epoch": 1.9397590361445785, | |
| "grad_norm": 0.418720543384552, | |
| "learning_rate": 1.4479951561923573e-06, | |
| "loss": 0.0903579443693161, | |
| "mean_token_accuracy": 0.9915480315685272, | |
| "num_tokens": 13148913.0, | |
| "step": 81 | |
| }, | |
| { | |
| "aux_loss": 8.045738697052002, | |
| "entropy": 0.04441889189183712, | |
| "epoch": 1.963855421686747, | |
| "grad_norm": 0.3862975835800171, | |
| "learning_rate": 1.4479375205562642e-06, | |
| "loss": 0.09073998779058456, | |
| "mean_token_accuracy": 0.9912832081317902, | |
| "num_tokens": 13304132.0, | |
| "step": 82 | |
| }, | |
| { | |
| "aux_loss": 8.046059608459473, | |
| "entropy": 0.05218968167901039, | |
| "epoch": 1.9879518072289155, | |
| "grad_norm": 0.4317293167114258, | |
| "learning_rate": 1.4478790705214464e-06, | |
| "loss": 0.09526760876178741, | |
| "mean_token_accuracy": 0.9900495111942291, | |
| "num_tokens": 13453623.0, | |
| "step": 83 | |
| }, | |
| { | |
| "aux_loss": 8.05069351196289, | |
| "entropy": 0.039391469210386276, | |
| "epoch": 2.0, | |
| "grad_norm": 0.6828374266624451, | |
| "learning_rate": 1.4478198062199706e-06, | |
| "loss": 0.05737518146634102, | |
| "mean_token_accuracy": 0.9917781352996826, | |
| "num_tokens": 13482926.0, | |
| "step": 84 | |
| }, | |
| { | |
| "aux_loss": 8.045267105102539, | |
| "entropy": 0.053030213341116905, | |
| "epoch": 2.0240963855421685, | |
| "grad_norm": 0.40254807472229004, | |
| "learning_rate": 1.4477597277857421e-06, | |
| "loss": 0.09399621188640594, | |
| "mean_token_accuracy": 0.9910189509391785, | |
| "num_tokens": 13616336.0, | |
| "step": 85 | |
| }, | |
| { | |
| "aux_loss": 8.04813003540039, | |
| "entropy": 0.04406110197305679, | |
| "epoch": 2.0481927710843375, | |
| "grad_norm": 0.36270391941070557, | |
| "learning_rate": 1.4476988353545068e-06, | |
| "loss": 0.08861124515533447, | |
| "mean_token_accuracy": 0.9931189119815826, | |
| "num_tokens": 13775230.0, | |
| "step": 86 | |
| }, | |
| { | |
| "aux_loss": 8.044662952423096, | |
| "entropy": 0.03888658061623573, | |
| "epoch": 2.072289156626506, | |
| "grad_norm": 0.3652919828891754, | |
| "learning_rate": 1.4476371290638496e-06, | |
| "loss": 0.08651480078697205, | |
| "mean_token_accuracy": 0.9931168258190155, | |
| "num_tokens": 13935092.0, | |
| "step": 87 | |
| }, | |
| { | |
| "aux_loss": 8.048104763031006, | |
| "entropy": 0.047589803114533424, | |
| "epoch": 2.0963855421686746, | |
| "grad_norm": 0.4187248647212982, | |
| "learning_rate": 1.447574609053194e-06, | |
| "loss": 0.09169710427522659, | |
| "mean_token_accuracy": 0.9922028183937073, | |
| "num_tokens": 14097222.0, | |
| "step": 88 | |
| }, | |
| { | |
| "aux_loss": 8.044262409210205, | |
| "entropy": 0.04133613780140877, | |
| "epoch": 2.1204819277108435, | |
| "grad_norm": 0.3797593414783478, | |
| "learning_rate": 1.4475112754638022e-06, | |
| "loss": 0.08802482485771179, | |
| "mean_token_accuracy": 0.9926626980304718, | |
| "num_tokens": 14255553.0, | |
| "step": 89 | |
| }, | |
| { | |
| "aux_loss": 8.046658515930176, | |
| "entropy": 0.04000333696603775, | |
| "epoch": 2.144578313253012, | |
| "grad_norm": 0.4277676045894623, | |
| "learning_rate": 1.447447128438775e-06, | |
| "loss": 0.08734406530857086, | |
| "mean_token_accuracy": 0.993060439825058, | |
| "num_tokens": 14431608.0, | |
| "step": 90 | |
| }, | |
| { | |
| "aux_loss": 8.045912265777588, | |
| "entropy": 0.041802020743489265, | |
| "epoch": 2.1686746987951806, | |
| "grad_norm": 0.37397268414497375, | |
| "learning_rate": 1.4473821681230506e-06, | |
| "loss": 0.08865631371736526, | |
| "mean_token_accuracy": 0.9919825196266174, | |
| "num_tokens": 14615993.0, | |
| "step": 91 | |
| }, | |
| { | |
| "aux_loss": 8.044597625732422, | |
| "entropy": 0.04039378650486469, | |
| "epoch": 2.1927710843373496, | |
| "grad_norm": 0.423145592212677, | |
| "learning_rate": 1.4473163946634052e-06, | |
| "loss": 0.0880887508392334, | |
| "mean_token_accuracy": 0.9921639561653137, | |
| "num_tokens": 14766575.0, | |
| "step": 92 | |
| }, | |
| { | |
| "aux_loss": 8.04832410812378, | |
| "entropy": 0.04441938176751137, | |
| "epoch": 2.216867469879518, | |
| "grad_norm": 0.3814225196838379, | |
| "learning_rate": 1.4472498082084518e-06, | |
| "loss": 0.08906400948762894, | |
| "mean_token_accuracy": 0.9928748905658722, | |
| "num_tokens": 14931445.0, | |
| "step": 93 | |
| }, | |
| { | |
| "aux_loss": 8.042942523956299, | |
| "entropy": 0.046976158395409584, | |
| "epoch": 2.2409638554216866, | |
| "grad_norm": 0.3922480344772339, | |
| "learning_rate": 1.4471824089086415e-06, | |
| "loss": 0.09150424599647522, | |
| "mean_token_accuracy": 0.9916513860225677, | |
| "num_tokens": 15091210.0, | |
| "step": 94 | |
| }, | |
| { | |
| "aux_loss": 8.045757293701172, | |
| "entropy": 0.035969141870737076, | |
| "epoch": 2.2650602409638556, | |
| "grad_norm": 0.3510456681251526, | |
| "learning_rate": 1.44711419691626e-06, | |
| "loss": 0.0854613184928894, | |
| "mean_token_accuracy": 0.9934249818325043, | |
| "num_tokens": 15260222.0, | |
| "step": 95 | |
| }, | |
| { | |
| "aux_loss": 8.044999122619629, | |
| "entropy": 0.03909716196358204, | |
| "epoch": 2.289156626506024, | |
| "grad_norm": 0.3629781901836395, | |
| "learning_rate": 1.4470451723854314e-06, | |
| "loss": 0.08637961745262146, | |
| "mean_token_accuracy": 0.9935233891010284, | |
| "num_tokens": 15455860.0, | |
| "step": 96 | |
| }, | |
| { | |
| "aux_loss": 8.04701280593872, | |
| "entropy": 0.04057766683399677, | |
| "epoch": 2.3132530120481927, | |
| "grad_norm": 0.36879613995552063, | |
| "learning_rate": 1.4469753354721144e-06, | |
| "loss": 0.087168388068676, | |
| "mean_token_accuracy": 0.9932206869125366, | |
| "num_tokens": 15631021.0, | |
| "step": 97 | |
| }, | |
| { | |
| "aux_loss": 8.047924518585205, | |
| "entropy": 0.04564652778208256, | |
| "epoch": 2.337349397590361, | |
| "grad_norm": 0.41153064370155334, | |
| "learning_rate": 1.4469046863341036e-06, | |
| "loss": 0.08925162255764008, | |
| "mean_token_accuracy": 0.9921718537807465, | |
| "num_tokens": 15789136.0, | |
| "step": 98 | |
| }, | |
| { | |
| "aux_loss": 8.0452880859375, | |
| "entropy": 0.04301636107265949, | |
| "epoch": 2.36144578313253, | |
| "grad_norm": 0.376197874546051, | |
| "learning_rate": 1.4468332251310286e-06, | |
| "loss": 0.08848991990089417, | |
| "mean_token_accuracy": 0.9930213391780853, | |
| "num_tokens": 15938397.0, | |
| "step": 99 | |
| }, | |
| { | |
| "aux_loss": 8.043729782104492, | |
| "entropy": 0.04113657400012016, | |
| "epoch": 2.3855421686746987, | |
| "grad_norm": 0.3817802667617798, | |
| "learning_rate": 1.4467609520243544e-06, | |
| "loss": 0.08791770040988922, | |
| "mean_token_accuracy": 0.9926939308643341, | |
| "num_tokens": 16114803.0, | |
| "step": 100 | |
| }, | |
| { | |
| "aux_loss": 8.044564247131348, | |
| "entropy": 0.04448202811181545, | |
| "epoch": 2.4096385542168672, | |
| "grad_norm": 0.41418957710266113, | |
| "learning_rate": 1.44668786717738e-06, | |
| "loss": 0.08933436870574951, | |
| "mean_token_accuracy": 0.9923655092716217, | |
| "num_tokens": 16267681.0, | |
| "step": 101 | |
| }, | |
| { | |
| "aux_loss": 8.045689105987549, | |
| "entropy": 0.043511977419257164, | |
| "epoch": 2.433734939759036, | |
| "grad_norm": 0.3912562429904938, | |
| "learning_rate": 1.4466139707552382e-06, | |
| "loss": 0.08852104097604752, | |
| "mean_token_accuracy": 0.9933134019374847, | |
| "num_tokens": 16435524.0, | |
| "step": 102 | |
| }, | |
| { | |
| "aux_loss": 8.04603910446167, | |
| "entropy": 0.03945927880704403, | |
| "epoch": 2.4578313253012047, | |
| "grad_norm": 0.37696266174316406, | |
| "learning_rate": 1.4465392629248964e-06, | |
| "loss": 0.08802925050258636, | |
| "mean_token_accuracy": 0.9925020635128021, | |
| "num_tokens": 16601843.0, | |
| "step": 103 | |
| }, | |
| { | |
| "aux_loss": 8.041633129119873, | |
| "entropy": 0.042852023616433144, | |
| "epoch": 2.4819277108433733, | |
| "grad_norm": 0.42523500323295593, | |
| "learning_rate": 1.446463743855155e-06, | |
| "loss": 0.08881749212741852, | |
| "mean_token_accuracy": 0.9926598370075226, | |
| "num_tokens": 16749225.0, | |
| "step": 104 | |
| }, | |
| { | |
| "aux_loss": 8.044000625610352, | |
| "entropy": 0.04509095661342144, | |
| "epoch": 2.5060240963855422, | |
| "grad_norm": 0.43666303157806396, | |
| "learning_rate": 1.4463874137166468e-06, | |
| "loss": 0.09076739847660065, | |
| "mean_token_accuracy": 0.9915396869182587, | |
| "num_tokens": 16897018.0, | |
| "step": 105 | |
| }, | |
| { | |
| "aux_loss": 8.044254302978516, | |
| "entropy": 0.04391391761600971, | |
| "epoch": 2.5301204819277108, | |
| "grad_norm": 0.4111824333667755, | |
| "learning_rate": 1.4463102726818382e-06, | |
| "loss": 0.08995572477579117, | |
| "mean_token_accuracy": 0.9917828142642975, | |
| "num_tokens": 17065753.0, | |
| "step": 106 | |
| }, | |
| { | |
| "aux_loss": 8.045661926269531, | |
| "entropy": 0.04082946851849556, | |
| "epoch": 2.5542168674698793, | |
| "grad_norm": 0.3910435438156128, | |
| "learning_rate": 1.4462323209250268e-06, | |
| "loss": 0.08806779235601425, | |
| "mean_token_accuracy": 0.9928287863731384, | |
| "num_tokens": 17235799.0, | |
| "step": 107 | |
| }, | |
| { | |
| "aux_loss": 8.043983459472656, | |
| "entropy": 0.045222554355859756, | |
| "epoch": 2.5783132530120483, | |
| "grad_norm": 0.4386132061481476, | |
| "learning_rate": 1.4461535586223427e-06, | |
| "loss": 0.090940460562706, | |
| "mean_token_accuracy": 0.9915510416030884, | |
| "num_tokens": 17376992.0, | |
| "step": 108 | |
| }, | |
| { | |
| "aux_loss": 8.0429105758667, | |
| "entropy": 0.04239073768258095, | |
| "epoch": 2.602409638554217, | |
| "grad_norm": 0.39754438400268555, | |
| "learning_rate": 1.4460739859517472e-06, | |
| "loss": 0.08899098634719849, | |
| "mean_token_accuracy": 0.9922184944152832, | |
| "num_tokens": 17537095.0, | |
| "step": 109 | |
| }, | |
| { | |
| "aux_loss": 8.046865940093994, | |
| "entropy": 0.04032203182578087, | |
| "epoch": 2.6265060240963853, | |
| "grad_norm": 0.4198264181613922, | |
| "learning_rate": 1.4459936030930326e-06, | |
| "loss": 0.08784371614456177, | |
| "mean_token_accuracy": 0.9927988350391388, | |
| "num_tokens": 17697756.0, | |
| "step": 110 | |
| }, | |
| { | |
| "aux_loss": 8.045022964477539, | |
| "entropy": 0.04641672037541866, | |
| "epoch": 2.6506024096385543, | |
| "grad_norm": 0.41483283042907715, | |
| "learning_rate": 1.4459124102278213e-06, | |
| "loss": 0.0906679630279541, | |
| "mean_token_accuracy": 0.9918768405914307, | |
| "num_tokens": 17862032.0, | |
| "step": 111 | |
| }, | |
| { | |
| "aux_loss": 8.046215057373047, | |
| "entropy": 0.038604725152254105, | |
| "epoch": 2.674698795180723, | |
| "grad_norm": 0.38772159814834595, | |
| "learning_rate": 1.4458304075395668e-06, | |
| "loss": 0.08620807528495789, | |
| "mean_token_accuracy": 0.9930865466594696, | |
| "num_tokens": 18014648.0, | |
| "step": 112 | |
| }, | |
| { | |
| "aux_loss": 8.04534912109375, | |
| "entropy": 0.047094520181417465, | |
| "epoch": 2.6987951807228914, | |
| "grad_norm": 0.4265570342540741, | |
| "learning_rate": 1.445747595213552e-06, | |
| "loss": 0.09142982959747314, | |
| "mean_token_accuracy": 0.9916557669639587, | |
| "num_tokens": 18170137.0, | |
| "step": 113 | |
| }, | |
| { | |
| "aux_loss": 8.045645713806152, | |
| "entropy": 0.037863900884985924, | |
| "epoch": 2.7228915662650603, | |
| "grad_norm": 0.3691053092479706, | |
| "learning_rate": 1.4456639734368888e-06, | |
| "loss": 0.08656749129295349, | |
| "mean_token_accuracy": 0.9931949079036713, | |
| "num_tokens": 18341196.0, | |
| "step": 114 | |
| }, | |
| { | |
| "aux_loss": 8.04396677017212, | |
| "entropy": 0.04190782643854618, | |
| "epoch": 2.746987951807229, | |
| "grad_norm": 0.38775166869163513, | |
| "learning_rate": 1.4455795423985187e-06, | |
| "loss": 0.08832530677318573, | |
| "mean_token_accuracy": 0.9925132691860199, | |
| "num_tokens": 18499534.0, | |
| "step": 115 | |
| }, | |
| { | |
| "aux_loss": 8.046361446380615, | |
| "entropy": 0.044008735567331314, | |
| "epoch": 2.7710843373493974, | |
| "grad_norm": 0.3934473395347595, | |
| "learning_rate": 1.445494302289211e-06, | |
| "loss": 0.08926442265510559, | |
| "mean_token_accuracy": 0.9925075769424438, | |
| "num_tokens": 18659760.0, | |
| "step": 116 | |
| }, | |
| { | |
| "aux_loss": 8.044501304626465, | |
| "entropy": 0.04429285787045956, | |
| "epoch": 2.7951807228915664, | |
| "grad_norm": 0.4424228072166443, | |
| "learning_rate": 1.4454082533015636e-06, | |
| "loss": 0.08979617059230804, | |
| "mean_token_accuracy": 0.9921565651893616, | |
| "num_tokens": 18831165.0, | |
| "step": 117 | |
| }, | |
| { | |
| "aux_loss": 8.042979717254639, | |
| "entropy": 0.040504178032279015, | |
| "epoch": 2.819277108433735, | |
| "grad_norm": 0.4018898904323578, | |
| "learning_rate": 1.4453213956300015e-06, | |
| "loss": 0.08786608278751373, | |
| "mean_token_accuracy": 0.992399662733078, | |
| "num_tokens": 18984127.0, | |
| "step": 118 | |
| }, | |
| { | |
| "aux_loss": 8.045685768127441, | |
| "entropy": 0.041042402386665344, | |
| "epoch": 2.8433734939759034, | |
| "grad_norm": 0.5288944840431213, | |
| "learning_rate": 1.4452337294707773e-06, | |
| "loss": 0.08859241008758545, | |
| "mean_token_accuracy": 0.9921814501285553, | |
| "num_tokens": 19160419.0, | |
| "step": 119 | |
| }, | |
| { | |
| "aux_loss": 8.046215057373047, | |
| "entropy": 0.04414335638284683, | |
| "epoch": 2.8674698795180724, | |
| "grad_norm": 0.4066352844238281, | |
| "learning_rate": 1.4451452550219706e-06, | |
| "loss": 0.08978652209043503, | |
| "mean_token_accuracy": 0.9923945069313049, | |
| "num_tokens": 19335546.0, | |
| "step": 120 | |
| }, | |
| { | |
| "aux_loss": 8.044774055480957, | |
| "entropy": 0.03940526768565178, | |
| "epoch": 2.891566265060241, | |
| "grad_norm": 0.4042900800704956, | |
| "learning_rate": 1.445055972483487e-06, | |
| "loss": 0.08746181428432465, | |
| "mean_token_accuracy": 0.9926989078521729, | |
| "num_tokens": 19496314.0, | |
| "step": 121 | |
| }, | |
| { | |
| "aux_loss": 8.043519020080566, | |
| "entropy": 0.03671685978770256, | |
| "epoch": 2.9156626506024095, | |
| "grad_norm": 0.3954128921031952, | |
| "learning_rate": 1.4449658820570577e-06, | |
| "loss": 0.08653290569782257, | |
| "mean_token_accuracy": 0.9926026463508606, | |
| "num_tokens": 19661718.0, | |
| "step": 122 | |
| }, | |
| { | |
| "aux_loss": 8.045527458190918, | |
| "entropy": 0.04113632068037987, | |
| "epoch": 2.9397590361445785, | |
| "grad_norm": 0.39803871512413025, | |
| "learning_rate": 1.4448749839462395e-06, | |
| "loss": 0.08833590149879456, | |
| "mean_token_accuracy": 0.9923411309719086, | |
| "num_tokens": 19847373.0, | |
| "step": 123 | |
| }, | |
| { | |
| "aux_loss": 8.044186115264893, | |
| "entropy": 0.03642796538770199, | |
| "epoch": 2.963855421686747, | |
| "grad_norm": 0.3793511390686035, | |
| "learning_rate": 1.4447832783564146e-06, | |
| "loss": 0.086070716381073, | |
| "mean_token_accuracy": 0.9930998384952545, | |
| "num_tokens": 20025875.0, | |
| "step": 124 | |
| }, | |
| { | |
| "aux_loss": 8.046002388000488, | |
| "entropy": 0.047230470925569534, | |
| "epoch": 2.9879518072289155, | |
| "grad_norm": 0.4477235972881317, | |
| "learning_rate": 1.444690765494789e-06, | |
| "loss": 0.09117428958415985, | |
| "mean_token_accuracy": 0.9920151233673096, | |
| "num_tokens": 20182590.0, | |
| "step": 125 | |
| }, | |
| { | |
| "aux_loss": 8.042522430419922, | |
| "entropy": 0.040220800787210464, | |
| "epoch": 3.0, | |
| "grad_norm": 0.5846906900405884, | |
| "learning_rate": 1.4445974455703927e-06, | |
| "loss": 0.0573921799659729, | |
| "mean_token_accuracy": 0.9929695129394531, | |
| "num_tokens": 20224389.0, | |
| "step": 126 | |
| }, | |
| { | |
| "aux_loss": 8.044944763183594, | |
| "entropy": 0.039370276033878326, | |
| "epoch": 3.0240963855421685, | |
| "grad_norm": 0.3742491900920868, | |
| "learning_rate": 1.44450331879408e-06, | |
| "loss": 0.08556805551052094, | |
| "mean_token_accuracy": 0.9942886531352997, | |
| "num_tokens": 20380640.0, | |
| "step": 127 | |
| }, | |
| { | |
| "aux_loss": 8.043789863586426, | |
| "entropy": 0.045225948095321655, | |
| "epoch": 3.0481927710843375, | |
| "grad_norm": 0.38408586382865906, | |
| "learning_rate": 1.4444083853785277e-06, | |
| "loss": 0.08862867951393127, | |
| "mean_token_accuracy": 0.9931619465351105, | |
| "num_tokens": 20532981.0, | |
| "step": 128 | |
| }, | |
| { | |
| "aux_loss": 8.042508125305176, | |
| "entropy": 0.0450060423463583, | |
| "epoch": 3.072289156626506, | |
| "grad_norm": 0.37083542346954346, | |
| "learning_rate": 1.444312645538235e-06, | |
| "loss": 0.08864334225654602, | |
| "mean_token_accuracy": 0.9928875267505646, | |
| "num_tokens": 20683874.0, | |
| "step": 129 | |
| }, | |
| { | |
| "aux_loss": 8.041747093200684, | |
| "entropy": 0.04171221703290939, | |
| "epoch": 3.0963855421686746, | |
| "grad_norm": 0.36446937918663025, | |
| "learning_rate": 1.4442160994895236e-06, | |
| "loss": 0.08605008572340012, | |
| "mean_token_accuracy": 0.9937500953674316, | |
| "num_tokens": 20836727.0, | |
| "step": 130 | |
| }, | |
| { | |
| "aux_loss": 8.042478561401367, | |
| "entropy": 0.04033582843840122, | |
| "epoch": 3.1204819277108435, | |
| "grad_norm": 0.37039053440093994, | |
| "learning_rate": 1.4441187474505368e-06, | |
| "loss": 0.08619973808526993, | |
| "mean_token_accuracy": 0.9936582446098328, | |
| "num_tokens": 20989173.0, | |
| "step": 131 | |
| }, | |
| { | |
| "aux_loss": 8.04190444946289, | |
| "entropy": 0.04400304704904556, | |
| "epoch": 3.144578313253012, | |
| "grad_norm": 0.39441367983818054, | |
| "learning_rate": 1.4440205896412386e-06, | |
| "loss": 0.08861161768436432, | |
| "mean_token_accuracy": 0.993509829044342, | |
| "num_tokens": 21137746.0, | |
| "step": 132 | |
| }, | |
| { | |
| "aux_loss": 8.042577743530273, | |
| "entropy": 0.0362233929336071, | |
| "epoch": 3.1686746987951806, | |
| "grad_norm": 0.3513298034667969, | |
| "learning_rate": 1.4439216262834142e-06, | |
| "loss": 0.08395665884017944, | |
| "mean_token_accuracy": 0.9942896068096161, | |
| "num_tokens": 21303083.0, | |
| "step": 133 | |
| }, | |
| { | |
| "aux_loss": 8.045822143554688, | |
| "entropy": 0.044513555243611336, | |
| "epoch": 3.1927710843373496, | |
| "grad_norm": 0.4062028229236603, | |
| "learning_rate": 1.4438218576006684e-06, | |
| "loss": 0.08783506602048874, | |
| "mean_token_accuracy": 0.9932784140110016, | |
| "num_tokens": 21465720.0, | |
| "step": 134 | |
| }, | |
| { | |
| "aux_loss": 8.042749881744385, | |
| "entropy": 0.03609209880232811, | |
| "epoch": 3.216867469879518, | |
| "grad_norm": 0.36185288429260254, | |
| "learning_rate": 1.4437212838184255e-06, | |
| "loss": 0.08398795872926712, | |
| "mean_token_accuracy": 0.9942994117736816, | |
| "num_tokens": 21634832.0, | |
| "step": 135 | |
| }, | |
| { | |
| "aux_loss": 8.046396255493164, | |
| "entropy": 0.039127200841903687, | |
| "epoch": 3.2409638554216866, | |
| "grad_norm": 0.3764151334762573, | |
| "learning_rate": 1.44361990516393e-06, | |
| "loss": 0.08616587519645691, | |
| "mean_token_accuracy": 0.993415892124176, | |
| "num_tokens": 21801355.0, | |
| "step": 136 | |
| }, | |
| { | |
| "aux_loss": 8.043558597564697, | |
| "entropy": 0.03838344104588032, | |
| "epoch": 3.2650602409638556, | |
| "grad_norm": 0.3657795786857605, | |
| "learning_rate": 1.4435177218662435e-06, | |
| "loss": 0.08551836758852005, | |
| "mean_token_accuracy": 0.9938235878944397, | |
| "num_tokens": 21973015.0, | |
| "step": 137 | |
| }, | |
| { | |
| "aux_loss": 8.043213367462158, | |
| "entropy": 0.04633874632418156, | |
| "epoch": 3.289156626506024, | |
| "grad_norm": 0.38201189041137695, | |
| "learning_rate": 1.4434147341562468e-06, | |
| "loss": 0.08937641978263855, | |
| "mean_token_accuracy": 0.9929512739181519, | |
| "num_tokens": 22134914.0, | |
| "step": 138 | |
| }, | |
| { | |
| "aux_loss": 8.04480266571045, | |
| "entropy": 0.03689238056540489, | |
| "epoch": 3.3132530120481927, | |
| "grad_norm": 0.35625335574150085, | |
| "learning_rate": 1.4433109422666374e-06, | |
| "loss": 0.08385109901428223, | |
| "mean_token_accuracy": 0.9944583773612976, | |
| "num_tokens": 22302240.0, | |
| "step": 139 | |
| }, | |
| { | |
| "aux_loss": 8.042608261108398, | |
| "entropy": 0.04020004719495773, | |
| "epoch": 3.337349397590361, | |
| "grad_norm": 0.3919045925140381, | |
| "learning_rate": 1.4432063464319306e-06, | |
| "loss": 0.0874231606721878, | |
| "mean_token_accuracy": 0.9931889474391937, | |
| "num_tokens": 22471698.0, | |
| "step": 140 | |
| }, | |
| { | |
| "aux_loss": 8.042847156524658, | |
| "entropy": 0.03685566782951355, | |
| "epoch": 3.36144578313253, | |
| "grad_norm": 0.3515630066394806, | |
| "learning_rate": 1.4431009468884578e-06, | |
| "loss": 0.0849953442811966, | |
| "mean_token_accuracy": 0.9941838085651398, | |
| "num_tokens": 22653073.0, | |
| "step": 141 | |
| }, | |
| { | |
| "aux_loss": 8.043398380279541, | |
| "entropy": 0.0423385389149189, | |
| "epoch": 3.3855421686746987, | |
| "grad_norm": 0.41736137866973877, | |
| "learning_rate": 1.442994743874366e-06, | |
| "loss": 0.08791652321815491, | |
| "mean_token_accuracy": 0.9927142858505249, | |
| "num_tokens": 22810578.0, | |
| "step": 142 | |
| }, | |
| { | |
| "aux_loss": 8.04459524154663, | |
| "entropy": 0.04449957422912121, | |
| "epoch": 3.4096385542168672, | |
| "grad_norm": 0.4232349693775177, | |
| "learning_rate": 1.4428877376296185e-06, | |
| "loss": 0.08924206346273422, | |
| "mean_token_accuracy": 0.9924839735031128, | |
| "num_tokens": 22953794.0, | |
| "step": 143 | |
| }, | |
| { | |
| "aux_loss": 8.041166305541992, | |
| "entropy": 0.04270816035568714, | |
| "epoch": 3.433734939759036, | |
| "grad_norm": 0.3914850354194641, | |
| "learning_rate": 1.4427799283959926e-06, | |
| "loss": 0.08785770833492279, | |
| "mean_token_accuracy": 0.9931382238864899, | |
| "num_tokens": 23120357.0, | |
| "step": 144 | |
| }, | |
| { | |
| "aux_loss": 8.04544448852539, | |
| "entropy": 0.03356307931244373, | |
| "epoch": 3.4578313253012047, | |
| "grad_norm": 0.3500516712665558, | |
| "learning_rate": 1.4426713164170808e-06, | |
| "loss": 0.08334299921989441, | |
| "mean_token_accuracy": 0.9946193993091583, | |
| "num_tokens": 23300231.0, | |
| "step": 145 | |
| }, | |
| { | |
| "aux_loss": 8.04530382156372, | |
| "entropy": 0.044576091691851616, | |
| "epoch": 3.4819277108433733, | |
| "grad_norm": 0.41992995142936707, | |
| "learning_rate": 1.4425619019382884e-06, | |
| "loss": 0.08873672783374786, | |
| "mean_token_accuracy": 0.9929416477680206, | |
| "num_tokens": 23453268.0, | |
| "step": 146 | |
| }, | |
| { | |
| "aux_loss": 8.044836044311523, | |
| "entropy": 0.03937925212085247, | |
| "epoch": 3.5060240963855422, | |
| "grad_norm": 0.37806037068367004, | |
| "learning_rate": 1.4424516852068346e-06, | |
| "loss": 0.08648265898227692, | |
| "mean_token_accuracy": 0.9935058355331421, | |
| "num_tokens": 23625257.0, | |
| "step": 147 | |
| }, | |
| { | |
| "aux_loss": 8.04463529586792, | |
| "entropy": 0.0399188157171011, | |
| "epoch": 3.5301204819277108, | |
| "grad_norm": 0.37204214930534363, | |
| "learning_rate": 1.442340666471751e-06, | |
| "loss": 0.08639834821224213, | |
| "mean_token_accuracy": 0.9933888912200928, | |
| "num_tokens": 23820327.0, | |
| "step": 148 | |
| }, | |
| { | |
| "aux_loss": 8.044984340667725, | |
| "entropy": 0.036087172105908394, | |
| "epoch": 3.5542168674698793, | |
| "grad_norm": 0.36808425188064575, | |
| "learning_rate": 1.4422288459838816e-06, | |
| "loss": 0.08478154242038727, | |
| "mean_token_accuracy": 0.9945113360881805, | |
| "num_tokens": 23979995.0, | |
| "step": 149 | |
| }, | |
| { | |
| "aux_loss": 8.043323993682861, | |
| "entropy": 0.04419667460024357, | |
| "epoch": 3.5783132530120483, | |
| "grad_norm": 0.41120970249176025, | |
| "learning_rate": 1.4421162239958818e-06, | |
| "loss": 0.0894618034362793, | |
| "mean_token_accuracy": 0.9925802052021027, | |
| "num_tokens": 24125572.0, | |
| "step": 150 | |
| }, | |
| { | |
| "aux_loss": 8.042481422424316, | |
| "entropy": 0.03813181072473526, | |
| "epoch": 3.602409638554217, | |
| "grad_norm": 0.3920314610004425, | |
| "learning_rate": 1.4420028007622175e-06, | |
| "loss": 0.08617769181728363, | |
| "mean_token_accuracy": 0.9939529597759247, | |
| "num_tokens": 24283705.0, | |
| "step": 151 | |
| }, | |
| { | |
| "aux_loss": 8.043877601623535, | |
| "entropy": 0.03504548221826553, | |
| "epoch": 3.6265060240963853, | |
| "grad_norm": 0.38018906116485596, | |
| "learning_rate": 1.4418885765391659e-06, | |
| "loss": 0.08467784523963928, | |
| "mean_token_accuracy": 0.993707150220871, | |
| "num_tokens": 24472505.0, | |
| "step": 152 | |
| }, | |
| { | |
| "aux_loss": 8.042401313781738, | |
| "entropy": 0.04122787527740002, | |
| "epoch": 3.6506024096385543, | |
| "grad_norm": 0.39765456318855286, | |
| "learning_rate": 1.4417735515848131e-06, | |
| "loss": 0.08704474568367004, | |
| "mean_token_accuracy": 0.9933643937110901, | |
| "num_tokens": 24643360.0, | |
| "step": 153 | |
| }, | |
| { | |
| "aux_loss": 8.043309688568115, | |
| "entropy": 0.04166724532842636, | |
| "epoch": 3.674698795180723, | |
| "grad_norm": 0.3905385136604309, | |
| "learning_rate": 1.4416577261590549e-06, | |
| "loss": 0.08706511557102203, | |
| "mean_token_accuracy": 0.9933055341243744, | |
| "num_tokens": 24802344.0, | |
| "step": 154 | |
| }, | |
| { | |
| "aux_loss": 8.040821552276611, | |
| "entropy": 0.03833147883415222, | |
| "epoch": 3.6987951807228914, | |
| "grad_norm": 0.4488506615161896, | |
| "learning_rate": 1.4415411005235958e-06, | |
| "loss": 0.08571713417768478, | |
| "mean_token_accuracy": 0.9934513568878174, | |
| "num_tokens": 24956387.0, | |
| "step": 155 | |
| }, | |
| { | |
| "aux_loss": 8.043232440948486, | |
| "entropy": 0.03610091283917427, | |
| "epoch": 3.7228915662650603, | |
| "grad_norm": 0.3729538023471832, | |
| "learning_rate": 1.4414236749419483e-06, | |
| "loss": 0.08453528583049774, | |
| "mean_token_accuracy": 0.9941688776016235, | |
| "num_tokens": 25118460.0, | |
| "step": 156 | |
| }, | |
| { | |
| "aux_loss": 8.042871475219727, | |
| "entropy": 0.04386945813894272, | |
| "epoch": 3.746987951807229, | |
| "grad_norm": 0.4113171100616455, | |
| "learning_rate": 1.441305449679432e-06, | |
| "loss": 0.08860649913549423, | |
| "mean_token_accuracy": 0.9927978813648224, | |
| "num_tokens": 25276453.0, | |
| "step": 157 | |
| }, | |
| { | |
| "aux_loss": 8.04326343536377, | |
| "entropy": 0.03775089047849178, | |
| "epoch": 3.7710843373493974, | |
| "grad_norm": 0.3969726860523224, | |
| "learning_rate": 1.441186425003174e-06, | |
| "loss": 0.08585880696773529, | |
| "mean_token_accuracy": 0.9934997260570526, | |
| "num_tokens": 25465189.0, | |
| "step": 158 | |
| }, | |
| { | |
| "aux_loss": 8.041276931762695, | |
| "entropy": 0.03554354049265385, | |
| "epoch": 3.7951807228915664, | |
| "grad_norm": 0.37212640047073364, | |
| "learning_rate": 1.4410666011821071e-06, | |
| "loss": 0.08398972451686859, | |
| "mean_token_accuracy": 0.9942491948604584, | |
| "num_tokens": 25647091.0, | |
| "step": 159 | |
| }, | |
| { | |
| "aux_loss": 8.04280948638916, | |
| "entropy": 0.03362584114074707, | |
| "epoch": 3.819277108433735, | |
| "grad_norm": 0.37804487347602844, | |
| "learning_rate": 1.44094597848697e-06, | |
| "loss": 0.08355149626731873, | |
| "mean_token_accuracy": 0.9944404661655426, | |
| "num_tokens": 25812959.0, | |
| "step": 160 | |
| }, | |
| { | |
| "aux_loss": 8.041194915771484, | |
| "entropy": 0.04549684002995491, | |
| "epoch": 3.8433734939759034, | |
| "grad_norm": 0.4044184982776642, | |
| "learning_rate": 1.4408245571903066e-06, | |
| "loss": 0.08932945877313614, | |
| "mean_token_accuracy": 0.9926709532737732, | |
| "num_tokens": 25975077.0, | |
| "step": 161 | |
| }, | |
| { | |
| "aux_loss": 8.040953636169434, | |
| "entropy": 0.04158872179687023, | |
| "epoch": 3.8674698795180724, | |
| "grad_norm": 0.4143630564212799, | |
| "learning_rate": 1.4407023375664644e-06, | |
| "loss": 0.08703690767288208, | |
| "mean_token_accuracy": 0.993314117193222, | |
| "num_tokens": 26133481.0, | |
| "step": 162 | |
| }, | |
| { | |
| "aux_loss": 8.042658805847168, | |
| "entropy": 0.04513395018875599, | |
| "epoch": 3.891566265060241, | |
| "grad_norm": 0.4163261651992798, | |
| "learning_rate": 1.440579319891596e-06, | |
| "loss": 0.08887109160423279, | |
| "mean_token_accuracy": 0.9932331144809723, | |
| "num_tokens": 26285677.0, | |
| "step": 163 | |
| }, | |
| { | |
| "aux_loss": 8.044297218322754, | |
| "entropy": 0.03768927603960037, | |
| "epoch": 3.9156626506024095, | |
| "grad_norm": 0.3762443959712982, | |
| "learning_rate": 1.440455504443656e-06, | |
| "loss": 0.08547879010438919, | |
| "mean_token_accuracy": 0.9941076934337616, | |
| "num_tokens": 26456101.0, | |
| "step": 164 | |
| }, | |
| { | |
| "aux_loss": 8.040573596954346, | |
| "entropy": 0.040223028510808945, | |
| "epoch": 3.9397590361445785, | |
| "grad_norm": 0.44806984066963196, | |
| "learning_rate": 1.4403308915024023e-06, | |
| "loss": 0.08660810440778732, | |
| "mean_token_accuracy": 0.9934520721435547, | |
| "num_tokens": 26599076.0, | |
| "step": 165 | |
| }, | |
| { | |
| "aux_loss": 8.042471408843994, | |
| "entropy": 0.038684969767928123, | |
| "epoch": 3.963855421686747, | |
| "grad_norm": 0.40352219343185425, | |
| "learning_rate": 1.4402054813493942e-06, | |
| "loss": 0.08614273369312286, | |
| "mean_token_accuracy": 0.9937964081764221, | |
| "num_tokens": 26769500.0, | |
| "step": 166 | |
| }, | |
| { | |
| "aux_loss": 8.041973114013672, | |
| "entropy": 0.037965722382068634, | |
| "epoch": 3.9879518072289155, | |
| "grad_norm": 0.38133445382118225, | |
| "learning_rate": 1.4400792742679925e-06, | |
| "loss": 0.08504779636859894, | |
| "mean_token_accuracy": 0.9941068291664124, | |
| "num_tokens": 26942979.0, | |
| "step": 167 | |
| }, | |
| { | |
| "aux_loss": 8.039653778076172, | |
| "entropy": 0.046194545924663544, | |
| "epoch": 4.0, | |
| "grad_norm": 0.5609819889068604, | |
| "learning_rate": 1.439952270543359e-06, | |
| "loss": 0.053759872913360596, | |
| "mean_token_accuracy": 0.9936670064926147, | |
| "num_tokens": 26965852.0, | |
| "step": 168 | |
| }, | |
| { | |
| "aux_loss": 8.043168544769287, | |
| "entropy": 0.03969798795878887, | |
| "epoch": 4.024096385542169, | |
| "grad_norm": 0.5476467609405518, | |
| "learning_rate": 1.4398244704624548e-06, | |
| "loss": 0.08540086448192596, | |
| "mean_token_accuracy": 0.9945910573005676, | |
| "num_tokens": 27138361.0, | |
| "step": 169 | |
| }, | |
| { | |
| "aux_loss": 8.041584968566895, | |
| "entropy": 0.037986068055033684, | |
| "epoch": 4.048192771084337, | |
| "grad_norm": 0.3398607075214386, | |
| "learning_rate": 1.4396958743140407e-06, | |
| "loss": 0.08402132987976074, | |
| "mean_token_accuracy": 0.9951412975788116, | |
| "num_tokens": 27298070.0, | |
| "step": 170 | |
| }, | |
| { | |
| "aux_loss": 8.041838645935059, | |
| "entropy": 0.03689403831958771, | |
| "epoch": 4.072289156626506, | |
| "grad_norm": 0.3282793462276459, | |
| "learning_rate": 1.4395664823886764e-06, | |
| "loss": 0.08331362903118134, | |
| "mean_token_accuracy": 0.9951364398002625, | |
| "num_tokens": 27477493.0, | |
| "step": 171 | |
| }, | |
| { | |
| "aux_loss": 8.042462825775146, | |
| "entropy": 0.04227207601070404, | |
| "epoch": 4.096385542168675, | |
| "grad_norm": 0.3614228367805481, | |
| "learning_rate": 1.4394362949787193e-06, | |
| "loss": 0.08635450899600983, | |
| "mean_token_accuracy": 0.9946377873420715, | |
| "num_tokens": 27650870.0, | |
| "step": 172 | |
| }, | |
| { | |
| "aux_loss": 8.040101051330566, | |
| "entropy": 0.039225177839398384, | |
| "epoch": 4.120481927710843, | |
| "grad_norm": 0.3621145486831665, | |
| "learning_rate": 1.4393053123783242e-06, | |
| "loss": 0.08554555475711823, | |
| "mean_token_accuracy": 0.9942145347595215, | |
| "num_tokens": 27809889.0, | |
| "step": 173 | |
| }, | |
| { | |
| "aux_loss": 8.042874336242676, | |
| "entropy": 0.04224075563251972, | |
| "epoch": 4.144578313253012, | |
| "grad_norm": 0.3778877854347229, | |
| "learning_rate": 1.439173534883443e-06, | |
| "loss": 0.08607605844736099, | |
| "mean_token_accuracy": 0.9945782423019409, | |
| "num_tokens": 27957420.0, | |
| "step": 174 | |
| }, | |
| { | |
| "aux_loss": 8.040241718292236, | |
| "entropy": 0.03377825953066349, | |
| "epoch": 4.168674698795181, | |
| "grad_norm": 0.34376251697540283, | |
| "learning_rate": 1.439040962791823e-06, | |
| "loss": 0.08279868215322495, | |
| "mean_token_accuracy": 0.9951018989086151, | |
| "num_tokens": 28127629.0, | |
| "step": 175 | |
| }, | |
| { | |
| "aux_loss": 8.042171955108643, | |
| "entropy": 0.03661440312862396, | |
| "epoch": 4.192771084337349, | |
| "grad_norm": 0.3872918486595154, | |
| "learning_rate": 1.4389075964030074e-06, | |
| "loss": 0.08358034491539001, | |
| "mean_token_accuracy": 0.9953621327877045, | |
| "num_tokens": 28293076.0, | |
| "step": 176 | |
| }, | |
| { | |
| "aux_loss": 8.040359020233154, | |
| "entropy": 0.035597002133727074, | |
| "epoch": 4.216867469879518, | |
| "grad_norm": 0.357154905796051, | |
| "learning_rate": 1.438773436018334e-06, | |
| "loss": 0.0828801617026329, | |
| "mean_token_accuracy": 0.9952186346054077, | |
| "num_tokens": 28453952.0, | |
| "step": 177 | |
| }, | |
| { | |
| "aux_loss": 8.042491912841797, | |
| "entropy": 0.04073164612054825, | |
| "epoch": 4.240963855421687, | |
| "grad_norm": 0.3982166349887848, | |
| "learning_rate": 1.438638481940934e-06, | |
| "loss": 0.08584737777709961, | |
| "mean_token_accuracy": 0.9942737519741058, | |
| "num_tokens": 28604320.0, | |
| "step": 178 | |
| }, | |
| { | |
| "aux_loss": 8.040094375610352, | |
| "entropy": 0.03856072202324867, | |
| "epoch": 4.265060240963855, | |
| "grad_norm": 0.3902375102043152, | |
| "learning_rate": 1.4385027344757331e-06, | |
| "loss": 0.08460918813943863, | |
| "mean_token_accuracy": 0.994719922542572, | |
| "num_tokens": 28756892.0, | |
| "step": 179 | |
| }, | |
| { | |
| "aux_loss": 8.040781497955322, | |
| "entropy": 0.035547565668821335, | |
| "epoch": 4.289156626506024, | |
| "grad_norm": 0.3302716016769409, | |
| "learning_rate": 1.438366193929449e-06, | |
| "loss": 0.0830703154206276, | |
| "mean_token_accuracy": 0.995084673166275, | |
| "num_tokens": 28930439.0, | |
| "step": 180 | |
| }, | |
| { | |
| "aux_loss": 8.039629459381104, | |
| "entropy": 0.04048551991581917, | |
| "epoch": 4.313253012048193, | |
| "grad_norm": 0.4318244457244873, | |
| "learning_rate": 1.4382288606105908e-06, | |
| "loss": 0.08579900115728378, | |
| "mean_token_accuracy": 0.9941352307796478, | |
| "num_tokens": 29092853.0, | |
| "step": 181 | |
| }, | |
| { | |
| "aux_loss": 8.040911674499512, | |
| "entropy": 0.03764263913035393, | |
| "epoch": 4.337349397590361, | |
| "grad_norm": 0.42847853899002075, | |
| "learning_rate": 1.4380907348294597e-06, | |
| "loss": 0.0839407742023468, | |
| "mean_token_accuracy": 0.9944304823875427, | |
| "num_tokens": 29226583.0, | |
| "step": 182 | |
| }, | |
| { | |
| "aux_loss": 8.039612770080566, | |
| "entropy": 0.03596244379878044, | |
| "epoch": 4.36144578313253, | |
| "grad_norm": 0.36768803000450134, | |
| "learning_rate": 1.4379518168981469e-06, | |
| "loss": 0.08371734619140625, | |
| "mean_token_accuracy": 0.9946404695510864, | |
| "num_tokens": 29381987.0, | |
| "step": 183 | |
| }, | |
| { | |
| "aux_loss": 8.040324211120605, | |
| "entropy": 0.038307564333081245, | |
| "epoch": 4.385542168674699, | |
| "grad_norm": 0.38769692182540894, | |
| "learning_rate": 1.437812107130534e-06, | |
| "loss": 0.08458788692951202, | |
| "mean_token_accuracy": 0.9944848418235779, | |
| "num_tokens": 29540073.0, | |
| "step": 184 | |
| }, | |
| { | |
| "aux_loss": 8.040425777435303, | |
| "entropy": 0.03475116938352585, | |
| "epoch": 4.409638554216867, | |
| "grad_norm": 0.3598844110965729, | |
| "learning_rate": 1.437671605842291e-06, | |
| "loss": 0.083564393222332, | |
| "mean_token_accuracy": 0.9947148263454437, | |
| "num_tokens": 29701935.0, | |
| "step": 185 | |
| }, | |
| { | |
| "aux_loss": 8.041619300842285, | |
| "entropy": 0.037232447415590286, | |
| "epoch": 4.433734939759036, | |
| "grad_norm": 0.4138000011444092, | |
| "learning_rate": 1.4375303133508774e-06, | |
| "loss": 0.08460228890180588, | |
| "mean_token_accuracy": 0.9941424429416656, | |
| "num_tokens": 29843884.0, | |
| "step": 186 | |
| }, | |
| { | |
| "aux_loss": 8.04134750366211, | |
| "entropy": 0.036806127056479454, | |
| "epoch": 4.457831325301205, | |
| "grad_norm": 0.4106656610965729, | |
| "learning_rate": 1.437388229975539e-06, | |
| "loss": 0.08441147208213806, | |
| "mean_token_accuracy": 0.9946633577346802, | |
| "num_tokens": 29987812.0, | |
| "step": 187 | |
| }, | |
| { | |
| "aux_loss": 8.039554119110107, | |
| "entropy": 0.03547658585011959, | |
| "epoch": 4.481927710843373, | |
| "grad_norm": 0.3592974841594696, | |
| "learning_rate": 1.4372453560373097e-06, | |
| "loss": 0.0837140679359436, | |
| "mean_token_accuracy": 0.9946017563343048, | |
| "num_tokens": 30149270.0, | |
| "step": 188 | |
| }, | |
| { | |
| "aux_loss": 8.041821479797363, | |
| "entropy": 0.035800814628601074, | |
| "epoch": 4.506024096385542, | |
| "grad_norm": 0.36003249883651733, | |
| "learning_rate": 1.437101691859009e-06, | |
| "loss": 0.08376017212867737, | |
| "mean_token_accuracy": 0.9945588111877441, | |
| "num_tokens": 30307956.0, | |
| "step": 189 | |
| }, | |
| { | |
| "aux_loss": 8.042970180511475, | |
| "entropy": 0.040934668853878975, | |
| "epoch": 4.530120481927711, | |
| "grad_norm": 0.42162829637527466, | |
| "learning_rate": 1.4369572377652423e-06, | |
| "loss": 0.08601701259613037, | |
| "mean_token_accuracy": 0.9943284690380096, | |
| "num_tokens": 30494893.0, | |
| "step": 190 | |
| }, | |
| { | |
| "aux_loss": 8.041118144989014, | |
| "entropy": 0.03687039390206337, | |
| "epoch": 4.554216867469879, | |
| "grad_norm": 0.370378315448761, | |
| "learning_rate": 1.4368119940823998e-06, | |
| "loss": 0.08406563103199005, | |
| "mean_token_accuracy": 0.9943959414958954, | |
| "num_tokens": 30672420.0, | |
| "step": 191 | |
| }, | |
| { | |
| "aux_loss": 8.040582656860352, | |
| "entropy": 0.03540595434606075, | |
| "epoch": 4.578313253012048, | |
| "grad_norm": 0.38017594814300537, | |
| "learning_rate": 1.4366659611386557e-06, | |
| "loss": 0.08305495977401733, | |
| "mean_token_accuracy": 0.9947693049907684, | |
| "num_tokens": 30847054.0, | |
| "step": 192 | |
| }, | |
| { | |
| "aux_loss": 8.042843341827393, | |
| "entropy": 0.04187178239226341, | |
| "epoch": 4.602409638554217, | |
| "grad_norm": 0.3843596577644348, | |
| "learning_rate": 1.436519139263967e-06, | |
| "loss": 0.08659607917070389, | |
| "mean_token_accuracy": 0.9939823746681213, | |
| "num_tokens": 31000786.0, | |
| "step": 193 | |
| }, | |
| { | |
| "aux_loss": 8.041165351867676, | |
| "entropy": 0.034371569752693176, | |
| "epoch": 4.626506024096385, | |
| "grad_norm": 0.37609967589378357, | |
| "learning_rate": 1.4363715287900742e-06, | |
| "loss": 0.08291493356227875, | |
| "mean_token_accuracy": 0.9949217736721039, | |
| "num_tokens": 31180147.0, | |
| "step": 194 | |
| }, | |
| { | |
| "aux_loss": 8.040238380432129, | |
| "entropy": 0.03516504354774952, | |
| "epoch": 4.650602409638554, | |
| "grad_norm": 0.3637091815471649, | |
| "learning_rate": 1.4362231300504988e-06, | |
| "loss": 0.08338074386119843, | |
| "mean_token_accuracy": 0.9948630630970001, | |
| "num_tokens": 31343986.0, | |
| "step": 195 | |
| }, | |
| { | |
| "aux_loss": 8.041361808776855, | |
| "entropy": 0.04160070978105068, | |
| "epoch": 4.674698795180722, | |
| "grad_norm": 0.4149928390979767, | |
| "learning_rate": 1.4360739433805439e-06, | |
| "loss": 0.08658482134342194, | |
| "mean_token_accuracy": 0.9941949248313904, | |
| "num_tokens": 31512880.0, | |
| "step": 196 | |
| }, | |
| { | |
| "aux_loss": 8.040586948394775, | |
| "entropy": 0.04432631470263004, | |
| "epoch": 4.698795180722891, | |
| "grad_norm": 0.40140870213508606, | |
| "learning_rate": 1.4359239691172926e-06, | |
| "loss": 0.08757840096950531, | |
| "mean_token_accuracy": 0.9936575889587402, | |
| "num_tokens": 31661985.0, | |
| "step": 197 | |
| }, | |
| { | |
| "aux_loss": 8.040112018585205, | |
| "entropy": 0.037308650091290474, | |
| "epoch": 4.72289156626506, | |
| "grad_norm": 0.39514875411987305, | |
| "learning_rate": 1.4357732075996076e-06, | |
| "loss": 0.08466262370347977, | |
| "mean_token_accuracy": 0.9945145845413208, | |
| "num_tokens": 31842845.0, | |
| "step": 198 | |
| }, | |
| { | |
| "aux_loss": 8.041626930236816, | |
| "entropy": 0.04097534902393818, | |
| "epoch": 4.746987951807229, | |
| "grad_norm": 0.405231237411499, | |
| "learning_rate": 1.4356216591681305e-06, | |
| "loss": 0.08651918172836304, | |
| "mean_token_accuracy": 0.9938961267471313, | |
| "num_tokens": 31994483.0, | |
| "step": 199 | |
| }, | |
| { | |
| "aux_loss": 8.038835525512695, | |
| "entropy": 0.03753245994448662, | |
| "epoch": 4.771084337349397, | |
| "grad_norm": 0.3914196789264679, | |
| "learning_rate": 1.4354693241652809e-06, | |
| "loss": 0.08507226407527924, | |
| "mean_token_accuracy": 0.9937683045864105, | |
| "num_tokens": 32153186.0, | |
| "step": 200 | |
| }, | |
| { | |
| "aux_loss": 8.039247989654541, | |
| "entropy": 0.037701187655329704, | |
| "epoch": 4.795180722891566, | |
| "grad_norm": 0.3929915130138397, | |
| "learning_rate": 1.4353162029352554e-06, | |
| "loss": 0.0845346599817276, | |
| "mean_token_accuracy": 0.9943271279335022, | |
| "num_tokens": 32309805.0, | |
| "step": 201 | |
| }, | |
| { | |
| "aux_loss": 8.04191780090332, | |
| "entropy": 0.04091975465416908, | |
| "epoch": 4.8192771084337345, | |
| "grad_norm": 0.4561111032962799, | |
| "learning_rate": 1.4351622958240273e-06, | |
| "loss": 0.08624639362096786, | |
| "mean_token_accuracy": 0.9937124252319336, | |
| "num_tokens": 32483341.0, | |
| "step": 202 | |
| }, | |
| { | |
| "aux_loss": 8.04048204421997, | |
| "entropy": 0.034330458380281925, | |
| "epoch": 4.843373493975903, | |
| "grad_norm": 0.367446631193161, | |
| "learning_rate": 1.4350076031793456e-06, | |
| "loss": 0.08318167924880981, | |
| "mean_token_accuracy": 0.9946629703044891, | |
| "num_tokens": 32647509.0, | |
| "step": 203 | |
| }, | |
| { | |
| "aux_loss": 8.04125452041626, | |
| "entropy": 0.03692132607102394, | |
| "epoch": 4.867469879518072, | |
| "grad_norm": 0.403191477060318, | |
| "learning_rate": 1.4348521253507344e-06, | |
| "loss": 0.08472205698490143, | |
| "mean_token_accuracy": 0.9941362142562866, | |
| "num_tokens": 32839256.0, | |
| "step": 204 | |
| }, | |
| { | |
| "aux_loss": 8.039531230926514, | |
| "entropy": 0.038704318925738335, | |
| "epoch": 4.891566265060241, | |
| "grad_norm": 0.39772483706474304, | |
| "learning_rate": 1.434695862689491e-06, | |
| "loss": 0.08526815474033356, | |
| "mean_token_accuracy": 0.9942019283771515, | |
| "num_tokens": 33003150.0, | |
| "step": 205 | |
| }, | |
| { | |
| "aux_loss": 8.040374755859375, | |
| "entropy": 0.03595581278204918, | |
| "epoch": 4.9156626506024095, | |
| "grad_norm": 0.4022948741912842, | |
| "learning_rate": 1.4345388155486866e-06, | |
| "loss": 0.08391736447811127, | |
| "mean_token_accuracy": 0.9942536056041718, | |
| "num_tokens": 33179546.0, | |
| "step": 206 | |
| }, | |
| { | |
| "aux_loss": 8.039075374603271, | |
| "entropy": 0.03800219111144543, | |
| "epoch": 4.9397590361445785, | |
| "grad_norm": 0.380649209022522, | |
| "learning_rate": 1.4343809842831657e-06, | |
| "loss": 0.08527541905641556, | |
| "mean_token_accuracy": 0.9943437278270721, | |
| "num_tokens": 33351836.0, | |
| "step": 207 | |
| }, | |
| { | |
| "aux_loss": 8.043510913848877, | |
| "entropy": 0.04215468093752861, | |
| "epoch": 4.9638554216867465, | |
| "grad_norm": 0.41969671845436096, | |
| "learning_rate": 1.4342223692495428e-06, | |
| "loss": 0.08674986660480499, | |
| "mean_token_accuracy": 0.9934200346469879, | |
| "num_tokens": 33505025.0, | |
| "step": 208 | |
| }, | |
| { | |
| "aux_loss": 8.039401054382324, | |
| "entropy": 0.03880974091589451, | |
| "epoch": 4.9879518072289155, | |
| "grad_norm": 0.37678730487823486, | |
| "learning_rate": 1.4340629708062048e-06, | |
| "loss": 0.08524405211210251, | |
| "mean_token_accuracy": 0.9945527911186218, | |
| "num_tokens": 33660485.0, | |
| "step": 209 | |
| }, | |
| { | |
| "aux_loss": 8.04077434539795, | |
| "entropy": 0.03518826887011528, | |
| "epoch": 5.0, | |
| "grad_norm": 0.48134711384773254, | |
| "learning_rate": 1.433902789313308e-06, | |
| "loss": 0.050809722393751144, | |
| "mean_token_accuracy": 0.9939299821853638, | |
| "num_tokens": 33707315.0, | |
| "step": 210 | |
| }, | |
| { | |
| "aux_loss": 8.039217472076416, | |
| "entropy": 0.03736879117786884, | |
| "epoch": 5.024096385542169, | |
| "grad_norm": 0.3484879732131958, | |
| "learning_rate": 1.433741825132778e-06, | |
| "loss": 0.08324334025382996, | |
| "mean_token_accuracy": 0.9955032467842102, | |
| "num_tokens": 33863394.0, | |
| "step": 211 | |
| }, | |
| { | |
| "aux_loss": 8.038911819458008, | |
| "entropy": 0.03610601648688316, | |
| "epoch": 5.048192771084337, | |
| "grad_norm": 0.3639015555381775, | |
| "learning_rate": 1.4335800786283092e-06, | |
| "loss": 0.08297591656446457, | |
| "mean_token_accuracy": 0.9954032003879547, | |
| "num_tokens": 34014983.0, | |
| "step": 212 | |
| }, | |
| { | |
| "aux_loss": 8.038973808288574, | |
| "entropy": 0.0321112684905529, | |
| "epoch": 5.072289156626506, | |
| "grad_norm": 0.3035561144351959, | |
| "learning_rate": 1.433417550165363e-06, | |
| "loss": 0.080979123711586, | |
| "mean_token_accuracy": 0.9960999488830566, | |
| "num_tokens": 34202386.0, | |
| "step": 213 | |
| }, | |
| { | |
| "aux_loss": 8.037017822265625, | |
| "entropy": 0.03347293473780155, | |
| "epoch": 5.096385542168675, | |
| "grad_norm": 0.32014161348342896, | |
| "learning_rate": 1.4332542401111685e-06, | |
| "loss": 0.0811787024140358, | |
| "mean_token_accuracy": 0.9961134791374207, | |
| "num_tokens": 34369320.0, | |
| "step": 214 | |
| }, | |
| { | |
| "aux_loss": 8.04166555404663, | |
| "entropy": 0.03581018000841141, | |
| "epoch": 5.120481927710843, | |
| "grad_norm": 0.3393751084804535, | |
| "learning_rate": 1.43309014883472e-06, | |
| "loss": 0.0826868787407875, | |
| "mean_token_accuracy": 0.9955731332302094, | |
| "num_tokens": 34545517.0, | |
| "step": 215 | |
| }, | |
| { | |
| "aux_loss": 8.0395827293396, | |
| "entropy": 0.03482176177203655, | |
| "epoch": 5.144578313253012, | |
| "grad_norm": 0.37512803077697754, | |
| "learning_rate": 1.4329252767067773e-06, | |
| "loss": 0.08189767599105835, | |
| "mean_token_accuracy": 0.995861828327179, | |
| "num_tokens": 34730633.0, | |
| "step": 216 | |
| }, | |
| { | |
| "aux_loss": 8.040324211120605, | |
| "entropy": 0.03882727213203907, | |
| "epoch": 5.168674698795181, | |
| "grad_norm": 0.34391677379608154, | |
| "learning_rate": 1.4327596240998645e-06, | |
| "loss": 0.08408463001251221, | |
| "mean_token_accuracy": 0.9951691627502441, | |
| "num_tokens": 34897938.0, | |
| "step": 217 | |
| }, | |
| { | |
| "aux_loss": 8.038958549499512, | |
| "entropy": 0.03700985945761204, | |
| "epoch": 5.192771084337349, | |
| "grad_norm": 0.3792520761489868, | |
| "learning_rate": 1.4325931913882691e-06, | |
| "loss": 0.08347566425800323, | |
| "mean_token_accuracy": 0.9954339861869812, | |
| "num_tokens": 35042500.0, | |
| "step": 218 | |
| }, | |
| { | |
| "aux_loss": 8.039316177368164, | |
| "entropy": 0.04214794747531414, | |
| "epoch": 5.216867469879518, | |
| "grad_norm": 0.38034358620643616, | |
| "learning_rate": 1.4324259789480415e-06, | |
| "loss": 0.08621414750814438, | |
| "mean_token_accuracy": 0.9948817193508148, | |
| "num_tokens": 35199253.0, | |
| "step": 219 | |
| }, | |
| { | |
| "aux_loss": 8.040565967559814, | |
| "entropy": 0.03364016301929951, | |
| "epoch": 5.240963855421687, | |
| "grad_norm": 0.33803656697273254, | |
| "learning_rate": 1.4322579871569933e-06, | |
| "loss": 0.08156892657279968, | |
| "mean_token_accuracy": 0.9959030747413635, | |
| "num_tokens": 35368834.0, | |
| "step": 220 | |
| }, | |
| { | |
| "aux_loss": 8.038960933685303, | |
| "entropy": 0.033280991949141026, | |
| "epoch": 5.265060240963855, | |
| "grad_norm": 0.3262208104133606, | |
| "learning_rate": 1.4320892163946975e-06, | |
| "loss": 0.08120635151863098, | |
| "mean_token_accuracy": 0.9958637356758118, | |
| "num_tokens": 35535515.0, | |
| "step": 221 | |
| }, | |
| { | |
| "aux_loss": 8.038169860839844, | |
| "entropy": 0.031326593831181526, | |
| "epoch": 5.289156626506024, | |
| "grad_norm": 0.342752069234848, | |
| "learning_rate": 1.431919667042487e-06, | |
| "loss": 0.07946254312992096, | |
| "mean_token_accuracy": 0.9960636794567108, | |
| "num_tokens": 35700534.0, | |
| "step": 222 | |
| }, | |
| { | |
| "aux_loss": 8.039755821228027, | |
| "entropy": 0.034905584529042244, | |
| "epoch": 5.313253012048193, | |
| "grad_norm": 0.3462710678577423, | |
| "learning_rate": 1.431749339483454e-06, | |
| "loss": 0.08242812752723694, | |
| "mean_token_accuracy": 0.9953078627586365, | |
| "num_tokens": 35880129.0, | |
| "step": 223 | |
| }, | |
| { | |
| "aux_loss": 8.03895616531372, | |
| "entropy": 0.037569453939795494, | |
| "epoch": 5.337349397590361, | |
| "grad_norm": 0.3580102026462555, | |
| "learning_rate": 1.4315782341024486e-06, | |
| "loss": 0.08401724696159363, | |
| "mean_token_accuracy": 0.9949289560317993, | |
| "num_tokens": 36049636.0, | |
| "step": 224 | |
| }, | |
| { | |
| "aux_loss": 8.035909175872803, | |
| "entropy": 0.03622467443346977, | |
| "epoch": 5.36144578313253, | |
| "grad_norm": 0.3741055727005005, | |
| "learning_rate": 1.4314063512860793e-06, | |
| "loss": 0.08327938616275787, | |
| "mean_token_accuracy": 0.994949609041214, | |
| "num_tokens": 36198666.0, | |
| "step": 225 | |
| }, | |
| { | |
| "aux_loss": 8.03954553604126, | |
| "entropy": 0.03737705014646053, | |
| "epoch": 5.385542168674699, | |
| "grad_norm": 0.3866511583328247, | |
| "learning_rate": 1.4312336914227104e-06, | |
| "loss": 0.0833113044500351, | |
| "mean_token_accuracy": 0.9953556656837463, | |
| "num_tokens": 36338753.0, | |
| "step": 226 | |
| }, | |
| { | |
| "aux_loss": 8.040770053863525, | |
| "entropy": 0.03640630468726158, | |
| "epoch": 5.409638554216867, | |
| "grad_norm": 0.37529176473617554, | |
| "learning_rate": 1.4310602549024621e-06, | |
| "loss": 0.0830492153763771, | |
| "mean_token_accuracy": 0.9955044686794281, | |
| "num_tokens": 36498867.0, | |
| "step": 227 | |
| }, | |
| { | |
| "aux_loss": 8.038099765777588, | |
| "entropy": 0.03481042757630348, | |
| "epoch": 5.433734939759036, | |
| "grad_norm": 0.3607235252857208, | |
| "learning_rate": 1.4308860421172094e-06, | |
| "loss": 0.08244866877794266, | |
| "mean_token_accuracy": 0.995325118303299, | |
| "num_tokens": 36682484.0, | |
| "step": 228 | |
| }, | |
| { | |
| "aux_loss": 8.03747844696045, | |
| "entropy": 0.036855777725577354, | |
| "epoch": 5.457831325301205, | |
| "grad_norm": 0.5099928379058838, | |
| "learning_rate": 1.4307110534605815e-06, | |
| "loss": 0.08275534957647324, | |
| "mean_token_accuracy": 0.9952235817909241, | |
| "num_tokens": 36839247.0, | |
| "step": 229 | |
| }, | |
| { | |
| "aux_loss": 8.039116859436035, | |
| "entropy": 0.044368937611579895, | |
| "epoch": 5.481927710843373, | |
| "grad_norm": 0.39856716990470886, | |
| "learning_rate": 1.4305352893279603e-06, | |
| "loss": 0.08694414794445038, | |
| "mean_token_accuracy": 0.9942440986633301, | |
| "num_tokens": 36984989.0, | |
| "step": 230 | |
| }, | |
| { | |
| "aux_loss": 8.04021692276001, | |
| "entropy": 0.03966960869729519, | |
| "epoch": 5.506024096385542, | |
| "grad_norm": 0.3691135048866272, | |
| "learning_rate": 1.4303587501164801e-06, | |
| "loss": 0.08465172350406647, | |
| "mean_token_accuracy": 0.9948685467243195, | |
| "num_tokens": 37136734.0, | |
| "step": 231 | |
| }, | |
| { | |
| "aux_loss": 8.038138389587402, | |
| "entropy": 0.03791094198822975, | |
| "epoch": 5.530120481927711, | |
| "grad_norm": 0.37443944811820984, | |
| "learning_rate": 1.4301814362250267e-06, | |
| "loss": 0.08411930501461029, | |
| "mean_token_accuracy": 0.9945204854011536, | |
| "num_tokens": 37306594.0, | |
| "step": 232 | |
| }, | |
| { | |
| "aux_loss": 8.04017972946167, | |
| "entropy": 0.03802665323019028, | |
| "epoch": 5.554216867469879, | |
| "grad_norm": 0.40194767713546753, | |
| "learning_rate": 1.4300033480542355e-06, | |
| "loss": 0.08439681679010391, | |
| "mean_token_accuracy": 0.9948781728744507, | |
| "num_tokens": 37482014.0, | |
| "step": 233 | |
| }, | |
| { | |
| "aux_loss": 8.037278175354004, | |
| "entropy": 0.0383224431425333, | |
| "epoch": 5.578313253012048, | |
| "grad_norm": 0.4007725715637207, | |
| "learning_rate": 1.4298244860064922e-06, | |
| "loss": 0.08417156338691711, | |
| "mean_token_accuracy": 0.9947126507759094, | |
| "num_tokens": 37655390.0, | |
| "step": 234 | |
| }, | |
| { | |
| "aux_loss": 8.038545608520508, | |
| "entropy": 0.03560042753815651, | |
| "epoch": 5.602409638554217, | |
| "grad_norm": 0.4014568030834198, | |
| "learning_rate": 1.4296448504859306e-06, | |
| "loss": 0.08304604887962341, | |
| "mean_token_accuracy": 0.9949043989181519, | |
| "num_tokens": 37807861.0, | |
| "step": 235 | |
| }, | |
| { | |
| "aux_loss": 8.039902210235596, | |
| "entropy": 0.03399462066590786, | |
| "epoch": 5.626506024096385, | |
| "grad_norm": 0.353241890668869, | |
| "learning_rate": 1.4294644418984323e-06, | |
| "loss": 0.08209338784217834, | |
| "mean_token_accuracy": 0.9952429831027985, | |
| "num_tokens": 37993700.0, | |
| "step": 236 | |
| }, | |
| { | |
| "aux_loss": 8.039174556732178, | |
| "entropy": 0.033101960085332394, | |
| "epoch": 5.650602409638554, | |
| "grad_norm": 0.3676363229751587, | |
| "learning_rate": 1.4292832606516255e-06, | |
| "loss": 0.08126258105039597, | |
| "mean_token_accuracy": 0.9955662786960602, | |
| "num_tokens": 38168498.0, | |
| "step": 237 | |
| }, | |
| { | |
| "aux_loss": 8.038545608520508, | |
| "entropy": 0.035288846120238304, | |
| "epoch": 5.674698795180722, | |
| "grad_norm": 0.36642128229141235, | |
| "learning_rate": 1.4291013071548844e-06, | |
| "loss": 0.08272764086723328, | |
| "mean_token_accuracy": 0.9954147934913635, | |
| "num_tokens": 38340718.0, | |
| "step": 238 | |
| }, | |
| { | |
| "aux_loss": 8.038650035858154, | |
| "entropy": 0.03259859047830105, | |
| "epoch": 5.698795180722891, | |
| "grad_norm": 0.37624770402908325, | |
| "learning_rate": 1.428918581819328e-06, | |
| "loss": 0.08136217296123505, | |
| "mean_token_accuracy": 0.9960896074771881, | |
| "num_tokens": 38491373.0, | |
| "step": 239 | |
| }, | |
| { | |
| "aux_loss": 8.038266658782959, | |
| "entropy": 0.04310726746916771, | |
| "epoch": 5.72289156626506, | |
| "grad_norm": 0.43467146158218384, | |
| "learning_rate": 1.4287350850578186e-06, | |
| "loss": 0.08748319000005722, | |
| "mean_token_accuracy": 0.9937043190002441, | |
| "num_tokens": 38639028.0, | |
| "step": 240 | |
| }, | |
| { | |
| "aux_loss": 8.039052963256836, | |
| "entropy": 0.038960253819823265, | |
| "epoch": 5.746987951807229, | |
| "grad_norm": 0.40311357378959656, | |
| "learning_rate": 1.4285508172849628e-06, | |
| "loss": 0.08427684009075165, | |
| "mean_token_accuracy": 0.9949110746383667, | |
| "num_tokens": 38800330.0, | |
| "step": 241 | |
| }, | |
| { | |
| "aux_loss": 8.038615703582764, | |
| "entropy": 0.038292521610856056, | |
| "epoch": 5.771084337349397, | |
| "grad_norm": 0.37565159797668457, | |
| "learning_rate": 1.4283657789171085e-06, | |
| "loss": 0.08385735750198364, | |
| "mean_token_accuracy": 0.9953287243843079, | |
| "num_tokens": 38948505.0, | |
| "step": 242 | |
| }, | |
| { | |
| "aux_loss": 8.039562702178955, | |
| "entropy": 0.03734001237899065, | |
| "epoch": 5.795180722891566, | |
| "grad_norm": 0.49312564730644226, | |
| "learning_rate": 1.4281799703723446e-06, | |
| "loss": 0.08247716724872589, | |
| "mean_token_accuracy": 0.9953389167785645, | |
| "num_tokens": 39093422.0, | |
| "step": 243 | |
| }, | |
| { | |
| "aux_loss": 8.038256645202637, | |
| "entropy": 0.03265094570815563, | |
| "epoch": 5.8192771084337345, | |
| "grad_norm": 0.3904739022254944, | |
| "learning_rate": 1.4279933920705006e-06, | |
| "loss": 0.08162276446819305, | |
| "mean_token_accuracy": 0.9952907860279083, | |
| "num_tokens": 39267459.0, | |
| "step": 244 | |
| }, | |
| { | |
| "aux_loss": 8.037330627441406, | |
| "entropy": 0.03682544641196728, | |
| "epoch": 5.843373493975903, | |
| "grad_norm": 0.397100031375885, | |
| "learning_rate": 1.4278060444331451e-06, | |
| "loss": 0.08333480358123779, | |
| "mean_token_accuracy": 0.9949441850185394, | |
| "num_tokens": 39422907.0, | |
| "step": 245 | |
| }, | |
| { | |
| "aux_loss": 8.038883686065674, | |
| "entropy": 0.04045848548412323, | |
| "epoch": 5.867469879518072, | |
| "grad_norm": 0.4215233623981476, | |
| "learning_rate": 1.4276179278835848e-06, | |
| "loss": 0.08535461127758026, | |
| "mean_token_accuracy": 0.9943825006484985, | |
| "num_tokens": 39579636.0, | |
| "step": 246 | |
| }, | |
| { | |
| "aux_loss": 8.039095878601074, | |
| "entropy": 0.033118318766355515, | |
| "epoch": 5.891566265060241, | |
| "grad_norm": 0.3765990138053894, | |
| "learning_rate": 1.427429042846864e-06, | |
| "loss": 0.08269308507442474, | |
| "mean_token_accuracy": 0.9951244592666626, | |
| "num_tokens": 39753106.0, | |
| "step": 247 | |
| }, | |
| { | |
| "aux_loss": 8.037528038024902, | |
| "entropy": 0.03207779489457607, | |
| "epoch": 5.9156626506024095, | |
| "grad_norm": 0.3518119156360626, | |
| "learning_rate": 1.4272393897497632e-06, | |
| "loss": 0.08054585009813309, | |
| "mean_token_accuracy": 0.9962049722671509, | |
| "num_tokens": 39912952.0, | |
| "step": 248 | |
| }, | |
| { | |
| "aux_loss": 8.037781715393066, | |
| "entropy": 0.035104215145111084, | |
| "epoch": 5.9397590361445785, | |
| "grad_norm": 0.3629360795021057, | |
| "learning_rate": 1.4270489690207984e-06, | |
| "loss": 0.0826537013053894, | |
| "mean_token_accuracy": 0.9953400492668152, | |
| "num_tokens": 40083911.0, | |
| "step": 249 | |
| }, | |
| { | |
| "aux_loss": 8.03683614730835, | |
| "entropy": 0.034510133787989616, | |
| "epoch": 5.9638554216867465, | |
| "grad_norm": 0.37607911229133606, | |
| "learning_rate": 1.4268577810902201e-06, | |
| "loss": 0.08266992121934891, | |
| "mean_token_accuracy": 0.9955215454101562, | |
| "num_tokens": 40245447.0, | |
| "step": 250 | |
| }, | |
| { | |
| "aux_loss": 8.036605834960938, | |
| "entropy": 0.03547329269349575, | |
| "epoch": 5.9879518072289155, | |
| "grad_norm": 0.3630676567554474, | |
| "learning_rate": 1.4266658263900122e-06, | |
| "loss": 0.08295561373233795, | |
| "mean_token_accuracy": 0.995036780834198, | |
| "num_tokens": 40406226.0, | |
| "step": 251 | |
| }, | |
| { | |
| "aux_loss": 8.03968620300293, | |
| "entropy": 0.04327882453799248, | |
| "epoch": 6.0, | |
| "grad_norm": 0.5565012693405151, | |
| "learning_rate": 1.426473105353891e-06, | |
| "loss": 0.05327405780553818, | |
| "mean_token_accuracy": 0.9942361116409302, | |
| "num_tokens": 40448778.0, | |
| "step": 252 | |
| }, | |
| { | |
| "aux_loss": 8.037991523742676, | |
| "entropy": 0.03559446148574352, | |
| "epoch": 6.024096385542169, | |
| "grad_norm": 0.360224187374115, | |
| "learning_rate": 1.4262796184173047e-06, | |
| "loss": 0.08191978931427002, | |
| "mean_token_accuracy": 0.9960768818855286, | |
| "num_tokens": 40621399.0, | |
| "step": 253 | |
| }, | |
| { | |
| "aux_loss": 8.036860942840576, | |
| "entropy": 0.03401390090584755, | |
| "epoch": 6.048192771084337, | |
| "grad_norm": 0.337534099817276, | |
| "learning_rate": 1.4260853660174314e-06, | |
| "loss": 0.08101242035627365, | |
| "mean_token_accuracy": 0.9961624443531036, | |
| "num_tokens": 40775180.0, | |
| "step": 254 | |
| }, | |
| { | |
| "aux_loss": 8.03651237487793, | |
| "entropy": 0.03811703994870186, | |
| "epoch": 6.072289156626506, | |
| "grad_norm": 0.3574149012565613, | |
| "learning_rate": 1.4258903485931792e-06, | |
| "loss": 0.08330834656953812, | |
| "mean_token_accuracy": 0.9954338371753693, | |
| "num_tokens": 40924568.0, | |
| "step": 255 | |
| }, | |
| { | |
| "aux_loss": 8.036168575286865, | |
| "entropy": 0.03353409469127655, | |
| "epoch": 6.096385542168675, | |
| "grad_norm": 0.3296172618865967, | |
| "learning_rate": 1.4256945665851847e-06, | |
| "loss": 0.08137848973274231, | |
| "mean_token_accuracy": 0.9961557686328888, | |
| "num_tokens": 41090965.0, | |
| "step": 256 | |
| }, | |
| { | |
| "aux_loss": 8.037352561950684, | |
| "entropy": 0.032407025806605816, | |
| "epoch": 6.120481927710843, | |
| "grad_norm": 0.3700825870037079, | |
| "learning_rate": 1.425498020435812e-06, | |
| "loss": 0.08028987050056458, | |
| "mean_token_accuracy": 0.9963049590587616, | |
| "num_tokens": 41260686.0, | |
| "step": 257 | |
| }, | |
| { | |
| "aux_loss": 8.037732124328613, | |
| "entropy": 0.03817327693104744, | |
| "epoch": 6.144578313253012, | |
| "grad_norm": 0.4077751934528351, | |
| "learning_rate": 1.4253007105891516e-06, | |
| "loss": 0.08337738364934921, | |
| "mean_token_accuracy": 0.9955407381057739, | |
| "num_tokens": 41389101.0, | |
| "step": 258 | |
| }, | |
| { | |
| "aux_loss": 8.03888988494873, | |
| "entropy": 0.033729828894138336, | |
| "epoch": 6.168674698795181, | |
| "grad_norm": 0.36580121517181396, | |
| "learning_rate": 1.4251026374910198e-06, | |
| "loss": 0.08104156702756882, | |
| "mean_token_accuracy": 0.9964797794818878, | |
| "num_tokens": 41559499.0, | |
| "step": 259 | |
| }, | |
| { | |
| "aux_loss": 8.036795616149902, | |
| "entropy": 0.03791739046573639, | |
| "epoch": 6.192771084337349, | |
| "grad_norm": 0.37497496604919434, | |
| "learning_rate": 1.4249038015889575e-06, | |
| "loss": 0.08325420320034027, | |
| "mean_token_accuracy": 0.9954448640346527, | |
| "num_tokens": 41705274.0, | |
| "step": 260 | |
| }, | |
| { | |
| "aux_loss": 8.037520408630371, | |
| "entropy": 0.03363081254065037, | |
| "epoch": 6.216867469879518, | |
| "grad_norm": 0.3485323488712311, | |
| "learning_rate": 1.4247042033322288e-06, | |
| "loss": 0.08111946284770966, | |
| "mean_token_accuracy": 0.9960795640945435, | |
| "num_tokens": 41861920.0, | |
| "step": 261 | |
| }, | |
| { | |
| "aux_loss": 8.037950038909912, | |
| "entropy": 0.032483769580721855, | |
| "epoch": 6.240963855421687, | |
| "grad_norm": 0.32457178831100464, | |
| "learning_rate": 1.4245038431718204e-06, | |
| "loss": 0.07976509630680084, | |
| "mean_token_accuracy": 0.9964925646781921, | |
| "num_tokens": 42030201.0, | |
| "step": 262 | |
| }, | |
| { | |
| "aux_loss": 8.037893772125244, | |
| "entropy": 0.04124067164957523, | |
| "epoch": 6.265060240963855, | |
| "grad_norm": 0.4116523563861847, | |
| "learning_rate": 1.424302721560441e-06, | |
| "loss": 0.0846301019191742, | |
| "mean_token_accuracy": 0.9952834844589233, | |
| "num_tokens": 42177436.0, | |
| "step": 263 | |
| }, | |
| { | |
| "aux_loss": 8.037344932556152, | |
| "entropy": 0.03193550743162632, | |
| "epoch": 6.289156626506024, | |
| "grad_norm": 0.34990963339805603, | |
| "learning_rate": 1.424100838952519e-06, | |
| "loss": 0.08070550858974457, | |
| "mean_token_accuracy": 0.9957850873470306, | |
| "num_tokens": 42351445.0, | |
| "step": 264 | |
| }, | |
| { | |
| "aux_loss": 8.036174774169922, | |
| "entropy": 0.03807485289871693, | |
| "epoch": 6.313253012048193, | |
| "grad_norm": 0.39334771037101746, | |
| "learning_rate": 1.4238981958042027e-06, | |
| "loss": 0.0833045095205307, | |
| "mean_token_accuracy": 0.9958217740058899, | |
| "num_tokens": 42498981.0, | |
| "step": 265 | |
| }, | |
| { | |
| "aux_loss": 8.03799819946289, | |
| "entropy": 0.036790693178772926, | |
| "epoch": 6.337349397590361, | |
| "grad_norm": 0.36928167939186096, | |
| "learning_rate": 1.423694792573359e-06, | |
| "loss": 0.08284773677587509, | |
| "mean_token_accuracy": 0.9955715537071228, | |
| "num_tokens": 42691804.0, | |
| "step": 266 | |
| }, | |
| { | |
| "aux_loss": 8.036050796508789, | |
| "entropy": 0.03653477132320404, | |
| "epoch": 6.36144578313253, | |
| "grad_norm": 0.38227298855781555, | |
| "learning_rate": 1.4234906297195716e-06, | |
| "loss": 0.08240111172199249, | |
| "mean_token_accuracy": 0.9956892132759094, | |
| "num_tokens": 42839877.0, | |
| "step": 267 | |
| }, | |
| { | |
| "aux_loss": 8.036399364471436, | |
| "entropy": 0.03486090246587992, | |
| "epoch": 6.385542168674699, | |
| "grad_norm": 0.35526585578918457, | |
| "learning_rate": 1.4232857077041412e-06, | |
| "loss": 0.08210219442844391, | |
| "mean_token_accuracy": 0.9954483807086945, | |
| "num_tokens": 42997903.0, | |
| "step": 268 | |
| }, | |
| { | |
| "aux_loss": 8.03887128829956, | |
| "entropy": 0.031132452189922333, | |
| "epoch": 6.409638554216867, | |
| "grad_norm": 0.32824158668518066, | |
| "learning_rate": 1.4230800269900832e-06, | |
| "loss": 0.08031217753887177, | |
| "mean_token_accuracy": 0.9960026741027832, | |
| "num_tokens": 43184524.0, | |
| "step": 269 | |
| }, | |
| { | |
| "aux_loss": 8.037085056304932, | |
| "entropy": 0.03395012393593788, | |
| "epoch": 6.433734939759036, | |
| "grad_norm": 0.39305827021598816, | |
| "learning_rate": 1.422873588042128e-06, | |
| "loss": 0.0817105770111084, | |
| "mean_token_accuracy": 0.9954641461372375, | |
| "num_tokens": 43352033.0, | |
| "step": 270 | |
| }, | |
| { | |
| "aux_loss": 8.03740119934082, | |
| "entropy": 0.033392174169421196, | |
| "epoch": 6.457831325301205, | |
| "grad_norm": 0.341763436794281, | |
| "learning_rate": 1.422666391326718e-06, | |
| "loss": 0.08093781024217606, | |
| "mean_token_accuracy": 0.9962793290615082, | |
| "num_tokens": 43528223.0, | |
| "step": 271 | |
| }, | |
| { | |
| "aux_loss": 8.035551071166992, | |
| "entropy": 0.03841528482735157, | |
| "epoch": 6.481927710843373, | |
| "grad_norm": 0.40078938007354736, | |
| "learning_rate": 1.4224584373120093e-06, | |
| "loss": 0.08335836231708527, | |
| "mean_token_accuracy": 0.9956542551517487, | |
| "num_tokens": 43672878.0, | |
| "step": 272 | |
| }, | |
| { | |
| "aux_loss": 8.036177158355713, | |
| "entropy": 0.03540636785328388, | |
| "epoch": 6.506024096385542, | |
| "grad_norm": 0.37283870577812195, | |
| "learning_rate": 1.4222497264678678e-06, | |
| "loss": 0.08214269578456879, | |
| "mean_token_accuracy": 0.9954660832881927, | |
| "num_tokens": 43815578.0, | |
| "step": 273 | |
| }, | |
| { | |
| "aux_loss": 8.034242630004883, | |
| "entropy": 0.03531269542872906, | |
| "epoch": 6.530120481927711, | |
| "grad_norm": 0.38215646147727966, | |
| "learning_rate": 1.4220402592658704e-06, | |
| "loss": 0.08176004141569138, | |
| "mean_token_accuracy": 0.996109277009964, | |
| "num_tokens": 43962507.0, | |
| "step": 274 | |
| }, | |
| { | |
| "aux_loss": 8.03614330291748, | |
| "entropy": 0.03466031700372696, | |
| "epoch": 6.554216867469879, | |
| "grad_norm": 0.3749046325683594, | |
| "learning_rate": 1.421830036179302e-06, | |
| "loss": 0.08171263337135315, | |
| "mean_token_accuracy": 0.9958585798740387, | |
| "num_tokens": 44131399.0, | |
| "step": 275 | |
| }, | |
| { | |
| "aux_loss": 8.037889957427979, | |
| "entropy": 0.03461333829909563, | |
| "epoch": 6.578313253012048, | |
| "grad_norm": 0.34714046120643616, | |
| "learning_rate": 1.4216190576831563e-06, | |
| "loss": 0.081275574862957, | |
| "mean_token_accuracy": 0.9961965978145599, | |
| "num_tokens": 44286358.0, | |
| "step": 276 | |
| }, | |
| { | |
| "aux_loss": 8.03689432144165, | |
| "entropy": 0.034249075688421726, | |
| "epoch": 6.602409638554217, | |
| "grad_norm": 0.32196035981178284, | |
| "learning_rate": 1.4214073242541331e-06, | |
| "loss": 0.08108819276094437, | |
| "mean_token_accuracy": 0.9961409270763397, | |
| "num_tokens": 44456280.0, | |
| "step": 277 | |
| }, | |
| { | |
| "aux_loss": 8.039196014404297, | |
| "entropy": 0.03051491640508175, | |
| "epoch": 6.626506024096385, | |
| "grad_norm": 0.3290470838546753, | |
| "learning_rate": 1.421194836370639e-06, | |
| "loss": 0.08000116050243378, | |
| "mean_token_accuracy": 0.996231198310852, | |
| "num_tokens": 44651684.0, | |
| "step": 278 | |
| }, | |
| { | |
| "aux_loss": 8.033888816833496, | |
| "entropy": 0.03408683463931084, | |
| "epoch": 6.650602409638554, | |
| "grad_norm": 0.3726556599140167, | |
| "learning_rate": 1.4209815945127836e-06, | |
| "loss": 0.08141613751649857, | |
| "mean_token_accuracy": 0.9959953725337982, | |
| "num_tokens": 44794109.0, | |
| "step": 279 | |
| }, | |
| { | |
| "aux_loss": 8.035766124725342, | |
| "entropy": 0.028662268072366714, | |
| "epoch": 6.674698795180722, | |
| "grad_norm": 0.34546366333961487, | |
| "learning_rate": 1.4207675991623816e-06, | |
| "loss": 0.07919106632471085, | |
| "mean_token_accuracy": 0.9962852001190186, | |
| "num_tokens": 44967068.0, | |
| "step": 280 | |
| }, | |
| { | |
| "aux_loss": 8.036411762237549, | |
| "entropy": 0.03132207505404949, | |
| "epoch": 6.698795180722891, | |
| "grad_norm": 0.3478906750679016, | |
| "learning_rate": 1.4205528508029496e-06, | |
| "loss": 0.07999314367771149, | |
| "mean_token_accuracy": 0.9962101578712463, | |
| "num_tokens": 45141741.0, | |
| "step": 281 | |
| }, | |
| { | |
| "aux_loss": 8.03869342803955, | |
| "entropy": 0.03163009416311979, | |
| "epoch": 6.72289156626506, | |
| "grad_norm": 0.3555811941623688, | |
| "learning_rate": 1.4203373499197057e-06, | |
| "loss": 0.08022312819957733, | |
| "mean_token_accuracy": 0.9961192905902863, | |
| "num_tokens": 45317687.0, | |
| "step": 282 | |
| }, | |
| { | |
| "aux_loss": 8.036246299743652, | |
| "entropy": 0.029239365831017494, | |
| "epoch": 6.746987951807229, | |
| "grad_norm": 0.34071168303489685, | |
| "learning_rate": 1.4201210969995682e-06, | |
| "loss": 0.0793105736374855, | |
| "mean_token_accuracy": 0.9963167905807495, | |
| "num_tokens": 45504365.0, | |
| "step": 283 | |
| }, | |
| { | |
| "aux_loss": 8.03716516494751, | |
| "entropy": 0.03523336164653301, | |
| "epoch": 6.771084337349397, | |
| "grad_norm": 0.3549567461013794, | |
| "learning_rate": 1.4199040925311544e-06, | |
| "loss": 0.08193039894104004, | |
| "mean_token_accuracy": 0.9957601726055145, | |
| "num_tokens": 45690787.0, | |
| "step": 284 | |
| }, | |
| { | |
| "aux_loss": 8.036113262176514, | |
| "entropy": 0.03256150148808956, | |
| "epoch": 6.795180722891566, | |
| "grad_norm": 0.36457401514053345, | |
| "learning_rate": 1.4196863370047803e-06, | |
| "loss": 0.08117170631885529, | |
| "mean_token_accuracy": 0.9957631528377533, | |
| "num_tokens": 45850417.0, | |
| "step": 285 | |
| }, | |
| { | |
| "aux_loss": 8.035535335540771, | |
| "entropy": 0.03171788528561592, | |
| "epoch": 6.8192771084337345, | |
| "grad_norm": 0.351662278175354, | |
| "learning_rate": 1.4194678309124583e-06, | |
| "loss": 0.0804198831319809, | |
| "mean_token_accuracy": 0.9961467385292053, | |
| "num_tokens": 46013319.0, | |
| "step": 286 | |
| }, | |
| { | |
| "aux_loss": 8.033803462982178, | |
| "entropy": 0.035000565461814404, | |
| "epoch": 6.843373493975903, | |
| "grad_norm": 0.3920998275279999, | |
| "learning_rate": 1.4192485747478974e-06, | |
| "loss": 0.08269241452217102, | |
| "mean_token_accuracy": 0.9949135482311249, | |
| "num_tokens": 46188144.0, | |
| "step": 287 | |
| }, | |
| { | |
| "aux_loss": 8.03599739074707, | |
| "entropy": 0.03238750249147415, | |
| "epoch": 6.867469879518072, | |
| "grad_norm": 0.35797789692878723, | |
| "learning_rate": 1.4190285690065004e-06, | |
| "loss": 0.08076779544353485, | |
| "mean_token_accuracy": 0.9960897862911224, | |
| "num_tokens": 46341440.0, | |
| "step": 288 | |
| }, | |
| { | |
| "aux_loss": 8.035959243774414, | |
| "entropy": 0.03638170100748539, | |
| "epoch": 6.891566265060241, | |
| "grad_norm": 0.3702660799026489, | |
| "learning_rate": 1.4188078141853645e-06, | |
| "loss": 0.08285987377166748, | |
| "mean_token_accuracy": 0.9956148564815521, | |
| "num_tokens": 46502026.0, | |
| "step": 289 | |
| }, | |
| { | |
| "aux_loss": 8.034866333007812, | |
| "entropy": 0.034105464816093445, | |
| "epoch": 6.9156626506024095, | |
| "grad_norm": 0.3803676962852478, | |
| "learning_rate": 1.418586310783279e-06, | |
| "loss": 0.08216661214828491, | |
| "mean_token_accuracy": 0.9953741133213043, | |
| "num_tokens": 46670197.0, | |
| "step": 290 | |
| }, | |
| { | |
| "aux_loss": 8.038596153259277, | |
| "entropy": 0.03966710343956947, | |
| "epoch": 6.9397590361445785, | |
| "grad_norm": 0.3919319808483124, | |
| "learning_rate": 1.4183640593007253e-06, | |
| "loss": 0.08459129929542542, | |
| "mean_token_accuracy": 0.9947242140769958, | |
| "num_tokens": 46827184.0, | |
| "step": 291 | |
| }, | |
| { | |
| "aux_loss": 8.035058975219727, | |
| "entropy": 0.0370329562574625, | |
| "epoch": 6.9638554216867465, | |
| "grad_norm": 0.3695419132709503, | |
| "learning_rate": 1.418141060239874e-06, | |
| "loss": 0.08234144747257233, | |
| "mean_token_accuracy": 0.9958735704421997, | |
| "num_tokens": 46975123.0, | |
| "step": 292 | |
| }, | |
| { | |
| "aux_loss": 8.034956932067871, | |
| "entropy": 0.03599015064537525, | |
| "epoch": 6.9879518072289155, | |
| "grad_norm": 0.372112512588501, | |
| "learning_rate": 1.4179173141045854e-06, | |
| "loss": 0.08284641802310944, | |
| "mean_token_accuracy": 0.9954551458358765, | |
| "num_tokens": 47143463.0, | |
| "step": 293 | |
| }, | |
| { | |
| "aux_loss": 8.03744888305664, | |
| "entropy": 0.030542269349098206, | |
| "epoch": 7.0, | |
| "grad_norm": 0.47627538442611694, | |
| "learning_rate": 1.417692821400408e-06, | |
| "loss": 0.04683445766568184, | |
| "mean_token_accuracy": 0.995657205581665, | |
| "num_tokens": 47190241.0, | |
| "step": 294 | |
| }, | |
| { | |
| "aux_loss": 8.033048629760742, | |
| "entropy": 0.035450490191578865, | |
| "epoch": 7.024096385542169, | |
| "grad_norm": 0.34915679693222046, | |
| "learning_rate": 1.417467582634577e-06, | |
| "loss": 0.08114811033010483, | |
| "mean_token_accuracy": 0.9963439106941223, | |
| "num_tokens": 47348345.0, | |
| "step": 295 | |
| }, | |
| { | |
| "aux_loss": 8.034916877746582, | |
| "entropy": 0.03222184535115957, | |
| "epoch": 7.048192771084337, | |
| "grad_norm": 0.32226625084877014, | |
| "learning_rate": 1.417241598316013e-06, | |
| "loss": 0.07955966889858246, | |
| "mean_token_accuracy": 0.9968876838684082, | |
| "num_tokens": 47515241.0, | |
| "step": 296 | |
| }, | |
| { | |
| "aux_loss": 8.035215377807617, | |
| "entropy": 0.03598351962864399, | |
| "epoch": 7.072289156626506, | |
| "grad_norm": 0.34765782952308655, | |
| "learning_rate": 1.4170148689553215e-06, | |
| "loss": 0.08156674355268478, | |
| "mean_token_accuracy": 0.9967100620269775, | |
| "num_tokens": 47663653.0, | |
| "step": 297 | |
| }, | |
| { | |
| "aux_loss": 8.035448551177979, | |
| "entropy": 0.032758140936493874, | |
| "epoch": 7.096385542168675, | |
| "grad_norm": 0.338187038898468, | |
| "learning_rate": 1.4167873950647913e-06, | |
| "loss": 0.07984046638011932, | |
| "mean_token_accuracy": 0.9966485798358917, | |
| "num_tokens": 47828224.0, | |
| "step": 298 | |
| }, | |
| { | |
| "aux_loss": 8.03564167022705, | |
| "entropy": 0.0363839715719223, | |
| "epoch": 7.120481927710843, | |
| "grad_norm": 0.3636642396450043, | |
| "learning_rate": 1.4165591771583934e-06, | |
| "loss": 0.0818038135766983, | |
| "mean_token_accuracy": 0.9960289299488068, | |
| "num_tokens": 47965572.0, | |
| "step": 299 | |
| }, | |
| { | |
| "aux_loss": 8.037732124328613, | |
| "entropy": 0.03432103618979454, | |
| "epoch": 7.144578313253012, | |
| "grad_norm": 0.36236822605133057, | |
| "learning_rate": 1.41633021575178e-06, | |
| "loss": 0.08107459545135498, | |
| "mean_token_accuracy": 0.996305376291275, | |
| "num_tokens": 48137642.0, | |
| "step": 300 | |
| }, | |
| { | |
| "aux_loss": 8.036556720733643, | |
| "entropy": 0.03693149797618389, | |
| "epoch": 7.168674698795181, | |
| "grad_norm": 0.34610867500305176, | |
| "learning_rate": 1.416100511362283e-06, | |
| "loss": 0.0821981430053711, | |
| "mean_token_accuracy": 0.99636110663414, | |
| "num_tokens": 48324625.0, | |
| "step": 301 | |
| }, | |
| { | |
| "aux_loss": 8.034196376800537, | |
| "entropy": 0.029057555831968784, | |
| "epoch": 7.192771084337349, | |
| "grad_norm": 0.32378068566322327, | |
| "learning_rate": 1.4158700645089132e-06, | |
| "loss": 0.07781493663787842, | |
| "mean_token_accuracy": 0.9974943101406097, | |
| "num_tokens": 48469198.0, | |
| "step": 302 | |
| }, | |
| { | |
| "aux_loss": 8.036748886108398, | |
| "entropy": 0.03262832574546337, | |
| "epoch": 7.216867469879518, | |
| "grad_norm": 0.3372521996498108, | |
| "learning_rate": 1.415638875712359e-06, | |
| "loss": 0.08014824986457825, | |
| "mean_token_accuracy": 0.9964551031589508, | |
| "num_tokens": 48634260.0, | |
| "step": 303 | |
| }, | |
| { | |
| "aux_loss": 8.037166595458984, | |
| "entropy": 0.032166702672839165, | |
| "epoch": 7.240963855421687, | |
| "grad_norm": 0.34929683804512024, | |
| "learning_rate": 1.4154069454949852e-06, | |
| "loss": 0.08027002215385437, | |
| "mean_token_accuracy": 0.996328204870224, | |
| "num_tokens": 48804133.0, | |
| "step": 304 | |
| }, | |
| { | |
| "aux_loss": 8.03482961654663, | |
| "entropy": 0.03405679203569889, | |
| "epoch": 7.265060240963855, | |
| "grad_norm": 0.34674111008644104, | |
| "learning_rate": 1.415174274380832e-06, | |
| "loss": 0.08115323632955551, | |
| "mean_token_accuracy": 0.9964562058448792, | |
| "num_tokens": 48964195.0, | |
| "step": 305 | |
| }, | |
| { | |
| "aux_loss": 8.032870292663574, | |
| "entropy": 0.030429409816861153, | |
| "epoch": 7.289156626506024, | |
| "grad_norm": 0.3174818158149719, | |
| "learning_rate": 1.4149408628956132e-06, | |
| "loss": 0.07890744507312775, | |
| "mean_token_accuracy": 0.9967007339000702, | |
| "num_tokens": 49129035.0, | |
| "step": 306 | |
| }, | |
| { | |
| "aux_loss": 8.035819053649902, | |
| "entropy": 0.028406686149537563, | |
| "epoch": 7.313253012048193, | |
| "grad_norm": 0.3168235123157501, | |
| "learning_rate": 1.4147067115667155e-06, | |
| "loss": 0.07822935283184052, | |
| "mean_token_accuracy": 0.996906578540802, | |
| "num_tokens": 49300740.0, | |
| "step": 307 | |
| }, | |
| { | |
| "aux_loss": 8.03471565246582, | |
| "entropy": 0.03468763642013073, | |
| "epoch": 7.337349397590361, | |
| "grad_norm": 0.3807547092437744, | |
| "learning_rate": 1.4144718209231978e-06, | |
| "loss": 0.08181793242692947, | |
| "mean_token_accuracy": 0.9959447979927063, | |
| "num_tokens": 49446228.0, | |
| "step": 308 | |
| }, | |
| { | |
| "aux_loss": 8.035276889801025, | |
| "entropy": 0.03498452343046665, | |
| "epoch": 7.36144578313253, | |
| "grad_norm": 0.37493276596069336, | |
| "learning_rate": 1.4142361914957885e-06, | |
| "loss": 0.0809975117444992, | |
| "mean_token_accuracy": 0.9967085421085358, | |
| "num_tokens": 49620124.0, | |
| "step": 309 | |
| }, | |
| { | |
| "aux_loss": 8.03686237335205, | |
| "entropy": 0.03699825517833233, | |
| "epoch": 7.385542168674699, | |
| "grad_norm": 0.380402147769928, | |
| "learning_rate": 1.4139998238168866e-06, | |
| "loss": 0.08249437808990479, | |
| "mean_token_accuracy": 0.9959370195865631, | |
| "num_tokens": 49785119.0, | |
| "step": 310 | |
| }, | |
| { | |
| "aux_loss": 8.03669023513794, | |
| "entropy": 0.03257426247000694, | |
| "epoch": 7.409638554216867, | |
| "grad_norm": 0.3667578101158142, | |
| "learning_rate": 1.413762718420558e-06, | |
| "loss": 0.08071167767047882, | |
| "mean_token_accuracy": 0.9963789582252502, | |
| "num_tokens": 49952981.0, | |
| "step": 311 | |
| }, | |
| { | |
| "aux_loss": 8.034005641937256, | |
| "entropy": 0.02788942214101553, | |
| "epoch": 7.433734939759036, | |
| "grad_norm": 0.2974223494529724, | |
| "learning_rate": 1.4135248758425359e-06, | |
| "loss": 0.07806290686130524, | |
| "mean_token_accuracy": 0.99703049659729, | |
| "num_tokens": 50143595.0, | |
| "step": 312 | |
| }, | |
| { | |
| "aux_loss": 8.033695697784424, | |
| "entropy": 0.03359641693532467, | |
| "epoch": 7.457831325301205, | |
| "grad_norm": 0.3415364623069763, | |
| "learning_rate": 1.413286296620219e-06, | |
| "loss": 0.0807826817035675, | |
| "mean_token_accuracy": 0.9961223006248474, | |
| "num_tokens": 50297111.0, | |
| "step": 313 | |
| }, | |
| { | |
| "aux_loss": 8.034516334533691, | |
| "entropy": 0.03204282093793154, | |
| "epoch": 7.481927710843373, | |
| "grad_norm": 0.37344956398010254, | |
| "learning_rate": 1.4130469812926708e-06, | |
| "loss": 0.08044802397489548, | |
| "mean_token_accuracy": 0.9963233172893524, | |
| "num_tokens": 50448811.0, | |
| "step": 314 | |
| }, | |
| { | |
| "aux_loss": 8.033761978149414, | |
| "entropy": 0.031184443272650242, | |
| "epoch": 7.506024096385542, | |
| "grad_norm": 0.34687599539756775, | |
| "learning_rate": 1.4128069304006176e-06, | |
| "loss": 0.07920951396226883, | |
| "mean_token_accuracy": 0.9964482486248016, | |
| "num_tokens": 50609715.0, | |
| "step": 315 | |
| }, | |
| { | |
| "aux_loss": 8.034749031066895, | |
| "entropy": 0.029387577436864376, | |
| "epoch": 7.530120481927711, | |
| "grad_norm": 0.31832030415534973, | |
| "learning_rate": 1.4125661444864477e-06, | |
| "loss": 0.07884480059146881, | |
| "mean_token_accuracy": 0.9967005848884583, | |
| "num_tokens": 50772691.0, | |
| "step": 316 | |
| }, | |
| { | |
| "aux_loss": 8.03644847869873, | |
| "entropy": 0.03081085067242384, | |
| "epoch": 7.554216867469879, | |
| "grad_norm": 0.3318593204021454, | |
| "learning_rate": 1.4123246240942104e-06, | |
| "loss": 0.07955613732337952, | |
| "mean_token_accuracy": 0.996260017156601, | |
| "num_tokens": 50946461.0, | |
| "step": 317 | |
| }, | |
| { | |
| "aux_loss": 8.03480863571167, | |
| "entropy": 0.029540213756263256, | |
| "epoch": 7.578313253012048, | |
| "grad_norm": 0.3266274631023407, | |
| "learning_rate": 1.4120823697696144e-06, | |
| "loss": 0.07922594994306564, | |
| "mean_token_accuracy": 0.9967344701290131, | |
| "num_tokens": 51132312.0, | |
| "step": 318 | |
| }, | |
| { | |
| "aux_loss": 8.034060955047607, | |
| "entropy": 0.032534703612327576, | |
| "epoch": 7.602409638554217, | |
| "grad_norm": 0.35959550738334656, | |
| "learning_rate": 1.4118393820600268e-06, | |
| "loss": 0.08021605014801025, | |
| "mean_token_accuracy": 0.9963286817073822, | |
| "num_tokens": 51292228.0, | |
| "step": 319 | |
| }, | |
| { | |
| "aux_loss": 8.034628868103027, | |
| "entropy": 0.03200039733201265, | |
| "epoch": 7.626506024096385, | |
| "grad_norm": 0.3670026957988739, | |
| "learning_rate": 1.4115956615144717e-06, | |
| "loss": 0.0801118016242981, | |
| "mean_token_accuracy": 0.9965364933013916, | |
| "num_tokens": 51460338.0, | |
| "step": 320 | |
| }, | |
| { | |
| "aux_loss": 8.0361909866333, | |
| "entropy": 0.029335936531424522, | |
| "epoch": 7.650602409638554, | |
| "grad_norm": 0.35437721014022827, | |
| "learning_rate": 1.4113512086836288e-06, | |
| "loss": 0.07883332669734955, | |
| "mean_token_accuracy": 0.9966942071914673, | |
| "num_tokens": 51619895.0, | |
| "step": 321 | |
| }, | |
| { | |
| "aux_loss": 8.035427570343018, | |
| "entropy": 0.032436246052384377, | |
| "epoch": 7.674698795180722, | |
| "grad_norm": 0.34983742237091064, | |
| "learning_rate": 1.4111060241198329e-06, | |
| "loss": 0.08025002479553223, | |
| "mean_token_accuracy": 0.9963445365428925, | |
| "num_tokens": 51785833.0, | |
| "step": 322 | |
| }, | |
| { | |
| "aux_loss": 8.033997058868408, | |
| "entropy": 0.03502529673278332, | |
| "epoch": 7.698795180722891, | |
| "grad_norm": 0.39680731296539307, | |
| "learning_rate": 1.4108601083770718e-06, | |
| "loss": 0.08174897730350494, | |
| "mean_token_accuracy": 0.9958369731903076, | |
| "num_tokens": 51950251.0, | |
| "step": 323 | |
| }, | |
| { | |
| "aux_loss": 8.03468132019043, | |
| "entropy": 0.039487240836024284, | |
| "epoch": 7.72289156626506, | |
| "grad_norm": 0.3813090920448303, | |
| "learning_rate": 1.4106134620109848e-06, | |
| "loss": 0.08411987125873566, | |
| "mean_token_accuracy": 0.9956846833229065, | |
| "num_tokens": 52104274.0, | |
| "step": 324 | |
| }, | |
| { | |
| "aux_loss": 8.034347534179688, | |
| "entropy": 0.0300306910648942, | |
| "epoch": 7.746987951807229, | |
| "grad_norm": 0.3322348892688751, | |
| "learning_rate": 1.4103660855788636e-06, | |
| "loss": 0.07942084223031998, | |
| "mean_token_accuracy": 0.9967765212059021, | |
| "num_tokens": 52266704.0, | |
| "step": 325 | |
| }, | |
| { | |
| "aux_loss": 8.032934665679932, | |
| "entropy": 0.030973643995821476, | |
| "epoch": 7.771084337349397, | |
| "grad_norm": 0.3334362208843231, | |
| "learning_rate": 1.4101179796396477e-06, | |
| "loss": 0.07914458960294724, | |
| "mean_token_accuracy": 0.9966495633125305, | |
| "num_tokens": 52446376.0, | |
| "step": 326 | |
| }, | |
| { | |
| "aux_loss": 8.032021522521973, | |
| "entropy": 0.030552386306226254, | |
| "epoch": 7.795180722891566, | |
| "grad_norm": 0.37135079503059387, | |
| "learning_rate": 1.409869144753926e-06, | |
| "loss": 0.07951807975769043, | |
| "mean_token_accuracy": 0.9962173700332642, | |
| "num_tokens": 52600001.0, | |
| "step": 327 | |
| }, | |
| { | |
| "aux_loss": 8.035574913024902, | |
| "entropy": 0.03106264304369688, | |
| "epoch": 7.8192771084337345, | |
| "grad_norm": 0.3528701663017273, | |
| "learning_rate": 1.4096195814839339e-06, | |
| "loss": 0.0800810307264328, | |
| "mean_token_accuracy": 0.996282309293747, | |
| "num_tokens": 52768318.0, | |
| "step": 328 | |
| }, | |
| { | |
| "aux_loss": 8.035249710083008, | |
| "entropy": 0.03810280002653599, | |
| "epoch": 7.843373493975903, | |
| "grad_norm": 0.38768336176872253, | |
| "learning_rate": 1.4093692903935533e-06, | |
| "loss": 0.08325342833995819, | |
| "mean_token_accuracy": 0.9957176744937897, | |
| "num_tokens": 52937588.0, | |
| "step": 329 | |
| }, | |
| { | |
| "aux_loss": 8.033713340759277, | |
| "entropy": 0.034183334559202194, | |
| "epoch": 7.867469879518072, | |
| "grad_norm": 0.35069799423217773, | |
| "learning_rate": 1.4091182720483095e-06, | |
| "loss": 0.08079741895198822, | |
| "mean_token_accuracy": 0.9960699379444122, | |
| "num_tokens": 53089655.0, | |
| "step": 330 | |
| }, | |
| { | |
| "aux_loss": 8.032924175262451, | |
| "entropy": 0.03523244708776474, | |
| "epoch": 7.891566265060241, | |
| "grad_norm": 0.39111587405204773, | |
| "learning_rate": 1.4088665270153717e-06, | |
| "loss": 0.08104196190834045, | |
| "mean_token_accuracy": 0.9962975680828094, | |
| "num_tokens": 53248483.0, | |
| "step": 331 | |
| }, | |
| { | |
| "aux_loss": 8.033989906311035, | |
| "entropy": 0.03644202649593353, | |
| "epoch": 7.9156626506024095, | |
| "grad_norm": 0.3810213506221771, | |
| "learning_rate": 1.4086140558635514e-06, | |
| "loss": 0.08186738193035126, | |
| "mean_token_accuracy": 0.9956882297992706, | |
| "num_tokens": 53411522.0, | |
| "step": 332 | |
| }, | |
| { | |
| "aux_loss": 8.034379005432129, | |
| "entropy": 0.03020784631371498, | |
| "epoch": 7.9397590361445785, | |
| "grad_norm": 0.3371445834636688, | |
| "learning_rate": 1.4083608591632996e-06, | |
| "loss": 0.07884131371974945, | |
| "mean_token_accuracy": 0.9969273209571838, | |
| "num_tokens": 53574408.0, | |
| "step": 333 | |
| }, | |
| { | |
| "aux_loss": 8.03269910812378, | |
| "entropy": 0.031987156718969345, | |
| "epoch": 7.9638554216867465, | |
| "grad_norm": 0.368277370929718, | |
| "learning_rate": 1.4081069374867079e-06, | |
| "loss": 0.07966729998588562, | |
| "mean_token_accuracy": 0.9962456524372101, | |
| "num_tokens": 53736277.0, | |
| "step": 334 | |
| }, | |
| { | |
| "aux_loss": 8.032955646514893, | |
| "entropy": 0.034337449818849564, | |
| "epoch": 7.9879518072289155, | |
| "grad_norm": 0.34589219093322754, | |
| "learning_rate": 1.407852291407505e-06, | |
| "loss": 0.08137495815753937, | |
| "mean_token_accuracy": 0.9959911406040192, | |
| "num_tokens": 53893541.0, | |
| "step": 335 | |
| }, | |
| { | |
| "aux_loss": 8.037422180175781, | |
| "entropy": 0.03607993572950363, | |
| "epoch": 8.0, | |
| "grad_norm": 0.48692095279693604, | |
| "learning_rate": 1.4075969215010567e-06, | |
| "loss": 0.04885231703519821, | |
| "mean_token_accuracy": 0.9962315559387207, | |
| "num_tokens": 53931704.0, | |
| "step": 336 | |
| }, | |
| { | |
| "aux_loss": 8.03453254699707, | |
| "entropy": 0.03251357935369015, | |
| "epoch": 8.024096385542169, | |
| "grad_norm": 0.31673136353492737, | |
| "learning_rate": 1.4073408283443648e-06, | |
| "loss": 0.07995766401290894, | |
| "mean_token_accuracy": 0.9967318177223206, | |
| "num_tokens": 54091047.0, | |
| "step": 337 | |
| }, | |
| { | |
| "aux_loss": 8.032040119171143, | |
| "entropy": 0.03007432259619236, | |
| "epoch": 8.048192771084338, | |
| "grad_norm": 0.30801841616630554, | |
| "learning_rate": 1.4070840125160644e-06, | |
| "loss": 0.07856522500514984, | |
| "mean_token_accuracy": 0.997085839509964, | |
| "num_tokens": 54251503.0, | |
| "step": 338 | |
| }, | |
| { | |
| "aux_loss": 8.033209323883057, | |
| "entropy": 0.0301275672391057, | |
| "epoch": 8.072289156626505, | |
| "grad_norm": 0.32101917266845703, | |
| "learning_rate": 1.4068264745964238e-06, | |
| "loss": 0.07812288403511047, | |
| "mean_token_accuracy": 0.9971620738506317, | |
| "num_tokens": 54431460.0, | |
| "step": 339 | |
| }, | |
| { | |
| "aux_loss": 8.03450059890747, | |
| "entropy": 0.037498150020837784, | |
| "epoch": 8.096385542168674, | |
| "grad_norm": 0.3406485617160797, | |
| "learning_rate": 1.4065682151673432e-06, | |
| "loss": 0.08174111694097519, | |
| "mean_token_accuracy": 0.9965010583400726, | |
| "num_tokens": 54590360.0, | |
| "step": 340 | |
| }, | |
| { | |
| "aux_loss": 8.035029888153076, | |
| "entropy": 0.031323011964559555, | |
| "epoch": 8.120481927710843, | |
| "grad_norm": 0.48250916600227356, | |
| "learning_rate": 1.4063092348123523e-06, | |
| "loss": 0.07874792069196701, | |
| "mean_token_accuracy": 0.9969989359378815, | |
| "num_tokens": 54752146.0, | |
| "step": 341 | |
| }, | |
| { | |
| "aux_loss": 8.034884929656982, | |
| "entropy": 0.030849049799144268, | |
| "epoch": 8.144578313253012, | |
| "grad_norm": 0.3505721688270569, | |
| "learning_rate": 1.4060495341166107e-06, | |
| "loss": 0.07901881635189056, | |
| "mean_token_accuracy": 0.9968648850917816, | |
| "num_tokens": 54910384.0, | |
| "step": 342 | |
| }, | |
| { | |
| "aux_loss": 8.031527996063232, | |
| "entropy": 0.03027996141463518, | |
| "epoch": 8.168674698795181, | |
| "grad_norm": 0.3279053568840027, | |
| "learning_rate": 1.4057891136669046e-06, | |
| "loss": 0.0783233493566513, | |
| "mean_token_accuracy": 0.9972791373729706, | |
| "num_tokens": 55074547.0, | |
| "step": 343 | |
| }, | |
| { | |
| "aux_loss": 8.032787322998047, | |
| "entropy": 0.03463793359696865, | |
| "epoch": 8.19277108433735, | |
| "grad_norm": 0.37317872047424316, | |
| "learning_rate": 1.4055279740516467e-06, | |
| "loss": 0.08077745139598846, | |
| "mean_token_accuracy": 0.9964223802089691, | |
| "num_tokens": 55223107.0, | |
| "step": 344 | |
| }, | |
| { | |
| "aux_loss": 8.032590866088867, | |
| "entropy": 0.03586240112781525, | |
| "epoch": 8.216867469879517, | |
| "grad_norm": 0.3791426420211792, | |
| "learning_rate": 1.4052661158608755e-06, | |
| "loss": 0.08125555515289307, | |
| "mean_token_accuracy": 0.9962078630924225, | |
| "num_tokens": 55367867.0, | |
| "step": 345 | |
| }, | |
| { | |
| "aux_loss": 8.033146858215332, | |
| "entropy": 0.03275267221033573, | |
| "epoch": 8.240963855421686, | |
| "grad_norm": 0.3555714786052704, | |
| "learning_rate": 1.4050035396862518e-06, | |
| "loss": 0.0799730122089386, | |
| "mean_token_accuracy": 0.9965274631977081, | |
| "num_tokens": 55531222.0, | |
| "step": 346 | |
| }, | |
| { | |
| "aux_loss": 8.033248901367188, | |
| "entropy": 0.029476456344127655, | |
| "epoch": 8.265060240963855, | |
| "grad_norm": 0.323041707277298, | |
| "learning_rate": 1.4047402461210596e-06, | |
| "loss": 0.07879751920700073, | |
| "mean_token_accuracy": 0.9967617392539978, | |
| "num_tokens": 55707018.0, | |
| "step": 347 | |
| }, | |
| { | |
| "aux_loss": 8.034295558929443, | |
| "entropy": 0.034110626205801964, | |
| "epoch": 8.289156626506024, | |
| "grad_norm": 0.3517826199531555, | |
| "learning_rate": 1.4044762357602033e-06, | |
| "loss": 0.08017922937870026, | |
| "mean_token_accuracy": 0.9966349303722382, | |
| "num_tokens": 55859239.0, | |
| "step": 348 | |
| }, | |
| { | |
| "aux_loss": 8.031924724578857, | |
| "entropy": 0.02905238326638937, | |
| "epoch": 8.313253012048193, | |
| "grad_norm": 0.3139900863170624, | |
| "learning_rate": 1.4042115092002074e-06, | |
| "loss": 0.07803536206483841, | |
| "mean_token_accuracy": 0.9969979524612427, | |
| "num_tokens": 56002942.0, | |
| "step": 349 | |
| }, | |
| { | |
| "aux_loss": 8.03225040435791, | |
| "entropy": 0.030559261329472065, | |
| "epoch": 8.337349397590362, | |
| "grad_norm": 0.34452271461486816, | |
| "learning_rate": 1.403946067039214e-06, | |
| "loss": 0.07925976067781448, | |
| "mean_token_accuracy": 0.9967726767063141, | |
| "num_tokens": 56159221.0, | |
| "step": 350 | |
| }, | |
| { | |
| "aux_loss": 8.033653736114502, | |
| "entropy": 0.036190446466207504, | |
| "epoch": 8.36144578313253, | |
| "grad_norm": 0.3688271939754486, | |
| "learning_rate": 1.4036799098769828e-06, | |
| "loss": 0.08133170008659363, | |
| "mean_token_accuracy": 0.9966385960578918, | |
| "num_tokens": 56326889.0, | |
| "step": 351 | |
| }, | |
| { | |
| "aux_loss": 8.032990455627441, | |
| "entropy": 0.03038295917212963, | |
| "epoch": 8.385542168674698, | |
| "grad_norm": 0.3074115812778473, | |
| "learning_rate": 1.4034130383148882e-06, | |
| "loss": 0.0787685215473175, | |
| "mean_token_accuracy": 0.9970142543315887, | |
| "num_tokens": 56498544.0, | |
| "step": 352 | |
| }, | |
| { | |
| "aux_loss": 8.03279447555542, | |
| "entropy": 0.03136066906154156, | |
| "epoch": 8.409638554216867, | |
| "grad_norm": 0.3597790002822876, | |
| "learning_rate": 1.4031454529559193e-06, | |
| "loss": 0.07899552583694458, | |
| "mean_token_accuracy": 0.9971287846565247, | |
| "num_tokens": 56661229.0, | |
| "step": 353 | |
| }, | |
| { | |
| "aux_loss": 8.03244400024414, | |
| "entropy": 0.03564039617776871, | |
| "epoch": 8.433734939759036, | |
| "grad_norm": 0.36866894364356995, | |
| "learning_rate": 1.4028771544046781e-06, | |
| "loss": 0.08136041462421417, | |
| "mean_token_accuracy": 0.9964535534381866, | |
| "num_tokens": 56809009.0, | |
| "step": 354 | |
| }, | |
| { | |
| "aux_loss": 8.033175945281982, | |
| "entropy": 0.03262287098914385, | |
| "epoch": 8.457831325301205, | |
| "grad_norm": 0.3500673770904541, | |
| "learning_rate": 1.4026081432673777e-06, | |
| "loss": 0.08022792637348175, | |
| "mean_token_accuracy": 0.9964220225811005, | |
| "num_tokens": 56974040.0, | |
| "step": 355 | |
| }, | |
| { | |
| "aux_loss": 8.034413814544678, | |
| "entropy": 0.03208298236131668, | |
| "epoch": 8.481927710843374, | |
| "grad_norm": 0.3360278308391571, | |
| "learning_rate": 1.4023384201518416e-06, | |
| "loss": 0.07970739901065826, | |
| "mean_token_accuracy": 0.9968045651912689, | |
| "num_tokens": 57140951.0, | |
| "step": 356 | |
| }, | |
| { | |
| "aux_loss": 8.033014297485352, | |
| "entropy": 0.030674396082758904, | |
| "epoch": 8.506024096385541, | |
| "grad_norm": 0.3344880938529968, | |
| "learning_rate": 1.4020679856675015e-06, | |
| "loss": 0.07849317789077759, | |
| "mean_token_accuracy": 0.9969932436943054, | |
| "num_tokens": 57282214.0, | |
| "step": 357 | |
| }, | |
| { | |
| "aux_loss": 8.031963348388672, | |
| "entropy": 0.03275129199028015, | |
| "epoch": 8.53012048192771, | |
| "grad_norm": 0.3430642783641815, | |
| "learning_rate": 1.401796840425397e-06, | |
| "loss": 0.07970772683620453, | |
| "mean_token_accuracy": 0.9970153570175171, | |
| "num_tokens": 57430073.0, | |
| "step": 358 | |
| }, | |
| { | |
| "aux_loss": 8.032482147216797, | |
| "entropy": 0.02784721739590168, | |
| "epoch": 8.55421686746988, | |
| "grad_norm": 0.33207616209983826, | |
| "learning_rate": 1.401524985038173e-06, | |
| "loss": 0.0774514451622963, | |
| "mean_token_accuracy": 0.9972799718379974, | |
| "num_tokens": 57611033.0, | |
| "step": 359 | |
| }, | |
| { | |
| "aux_loss": 8.032303810119629, | |
| "entropy": 0.02809650544077158, | |
| "epoch": 8.578313253012048, | |
| "grad_norm": 0.36203494668006897, | |
| "learning_rate": 1.4012524201200799e-06, | |
| "loss": 0.07764801383018494, | |
| "mean_token_accuracy": 0.9973397850990295, | |
| "num_tokens": 57775590.0, | |
| "step": 360 | |
| }, | |
| { | |
| "aux_loss": 8.03242826461792, | |
| "entropy": 0.03094232641160488, | |
| "epoch": 8.602409638554217, | |
| "grad_norm": 0.3259294033050537, | |
| "learning_rate": 1.40097914628697e-06, | |
| "loss": 0.07914900034666061, | |
| "mean_token_accuracy": 0.9970998764038086, | |
| "num_tokens": 57943047.0, | |
| "step": 361 | |
| }, | |
| { | |
| "aux_loss": 8.03185749053955, | |
| "entropy": 0.027600662782788277, | |
| "epoch": 8.626506024096386, | |
| "grad_norm": 0.30300894379615784, | |
| "learning_rate": 1.4007051641562986e-06, | |
| "loss": 0.07772274315357208, | |
| "mean_token_accuracy": 0.9973132312297821, | |
| "num_tokens": 58120845.0, | |
| "step": 362 | |
| }, | |
| { | |
| "aux_loss": 8.033005237579346, | |
| "entropy": 0.030716686509549618, | |
| "epoch": 8.650602409638553, | |
| "grad_norm": 0.41477662324905396, | |
| "learning_rate": 1.4004304743471206e-06, | |
| "loss": 0.07921659201383591, | |
| "mean_token_accuracy": 0.9964025318622589, | |
| "num_tokens": 58290435.0, | |
| "step": 363 | |
| }, | |
| { | |
| "aux_loss": 8.031022548675537, | |
| "entropy": 0.032445063814520836, | |
| "epoch": 8.674698795180722, | |
| "grad_norm": 0.36098530888557434, | |
| "learning_rate": 1.4001550774800902e-06, | |
| "loss": 0.07978940010070801, | |
| "mean_token_accuracy": 0.9963515102863312, | |
| "num_tokens": 58446144.0, | |
| "step": 364 | |
| }, | |
| { | |
| "aux_loss": 8.03183650970459, | |
| "entropy": 0.028307861648499966, | |
| "epoch": 8.698795180722891, | |
| "grad_norm": 0.37047818303108215, | |
| "learning_rate": 1.399878974177459e-06, | |
| "loss": 0.07777097821235657, | |
| "mean_token_accuracy": 0.997242659330368, | |
| "num_tokens": 58623005.0, | |
| "step": 365 | |
| }, | |
| { | |
| "aux_loss": 8.032839298248291, | |
| "entropy": 0.03144409507513046, | |
| "epoch": 8.72289156626506, | |
| "grad_norm": 0.33840411901474, | |
| "learning_rate": 1.3996021650630748e-06, | |
| "loss": 0.07940583676099777, | |
| "mean_token_accuracy": 0.9966592788696289, | |
| "num_tokens": 58781686.0, | |
| "step": 366 | |
| }, | |
| { | |
| "aux_loss": 8.030786514282227, | |
| "entropy": 0.027757197618484497, | |
| "epoch": 8.74698795180723, | |
| "grad_norm": 0.3691762387752533, | |
| "learning_rate": 1.3993246507623804e-06, | |
| "loss": 0.07730717957019806, | |
| "mean_token_accuracy": 0.9969027042388916, | |
| "num_tokens": 58924651.0, | |
| "step": 367 | |
| }, | |
| { | |
| "aux_loss": 8.032029628753662, | |
| "entropy": 0.02889639139175415, | |
| "epoch": 8.771084337349398, | |
| "grad_norm": 0.3496450185775757, | |
| "learning_rate": 1.3990464319024116e-06, | |
| "loss": 0.07893317937850952, | |
| "mean_token_accuracy": 0.9967939853668213, | |
| "num_tokens": 59083066.0, | |
| "step": 368 | |
| }, | |
| { | |
| "aux_loss": 8.031221866607666, | |
| "entropy": 0.030891859903931618, | |
| "epoch": 8.795180722891565, | |
| "grad_norm": 0.3323741555213928, | |
| "learning_rate": 1.3987675091117965e-06, | |
| "loss": 0.07858480513095856, | |
| "mean_token_accuracy": 0.9969135522842407, | |
| "num_tokens": 59256385.0, | |
| "step": 369 | |
| }, | |
| { | |
| "aux_loss": 8.032551288604736, | |
| "entropy": 0.03319684974849224, | |
| "epoch": 8.819277108433734, | |
| "grad_norm": 0.34501487016677856, | |
| "learning_rate": 1.3984878830207534e-06, | |
| "loss": 0.08011599630117416, | |
| "mean_token_accuracy": 0.996588408946991, | |
| "num_tokens": 59427852.0, | |
| "step": 370 | |
| }, | |
| { | |
| "aux_loss": 8.032721519470215, | |
| "entropy": 0.03409439139068127, | |
| "epoch": 8.843373493975903, | |
| "grad_norm": 0.3768217861652374, | |
| "learning_rate": 1.39820755426109e-06, | |
| "loss": 0.08085048198699951, | |
| "mean_token_accuracy": 0.9963680505752563, | |
| "num_tokens": 59595387.0, | |
| "step": 371 | |
| }, | |
| { | |
| "aux_loss": 8.032885551452637, | |
| "entropy": 0.03258616290986538, | |
| "epoch": 8.867469879518072, | |
| "grad_norm": 0.3588944375514984, | |
| "learning_rate": 1.3979265234662012e-06, | |
| "loss": 0.0799306333065033, | |
| "mean_token_accuracy": 0.9965479075908661, | |
| "num_tokens": 59779351.0, | |
| "step": 372 | |
| }, | |
| { | |
| "aux_loss": 8.030370235443115, | |
| "entropy": 0.029054300859570503, | |
| "epoch": 8.891566265060241, | |
| "grad_norm": 0.33350667357444763, | |
| "learning_rate": 1.3976447912710685e-06, | |
| "loss": 0.07802186906337738, | |
| "mean_token_accuracy": 0.9969941079616547, | |
| "num_tokens": 59949200.0, | |
| "step": 373 | |
| }, | |
| { | |
| "aux_loss": 8.02937126159668, | |
| "entropy": 0.028985220938920975, | |
| "epoch": 8.91566265060241, | |
| "grad_norm": 0.3544178605079651, | |
| "learning_rate": 1.3973623583122578e-06, | |
| "loss": 0.07832932472229004, | |
| "mean_token_accuracy": 0.9969984292984009, | |
| "num_tokens": 60109064.0, | |
| "step": 374 | |
| }, | |
| { | |
| "aux_loss": 8.03177261352539, | |
| "entropy": 0.029587114229798317, | |
| "epoch": 8.939759036144578, | |
| "grad_norm": 0.3520343005657196, | |
| "learning_rate": 1.3970792252279195e-06, | |
| "loss": 0.07858137786388397, | |
| "mean_token_accuracy": 0.996891975402832, | |
| "num_tokens": 60274692.0, | |
| "step": 375 | |
| }, | |
| { | |
| "aux_loss": 8.035192966461182, | |
| "entropy": 0.03562385682016611, | |
| "epoch": 8.963855421686747, | |
| "grad_norm": 0.35002952814102173, | |
| "learning_rate": 1.3967953926577841e-06, | |
| "loss": 0.08112400025129318, | |
| "mean_token_accuracy": 0.996430367231369, | |
| "num_tokens": 60441996.0, | |
| "step": 376 | |
| }, | |
| { | |
| "aux_loss": 8.033750534057617, | |
| "entropy": 0.029073555022478104, | |
| "epoch": 8.987951807228916, | |
| "grad_norm": 0.346101850271225, | |
| "learning_rate": 1.3965108612431643e-06, | |
| "loss": 0.07820385694503784, | |
| "mean_token_accuracy": 0.9969233572483063, | |
| "num_tokens": 60627910.0, | |
| "step": 377 | |
| }, | |
| { | |
| "aux_loss": 8.03187370300293, | |
| "entropy": 0.02936927229166031, | |
| "epoch": 9.0, | |
| "grad_norm": 0.46344229578971863, | |
| "learning_rate": 1.3962256316269505e-06, | |
| "loss": 0.04597163945436478, | |
| "mean_token_accuracy": 0.9973151087760925, | |
| "num_tokens": 60673167.0, | |
| "step": 378 | |
| }, | |
| { | |
| "aux_loss": 8.03305721282959, | |
| "entropy": 0.028284212574362755, | |
| "epoch": 9.024096385542169, | |
| "grad_norm": 0.31423506140708923, | |
| "learning_rate": 1.3959397044536114e-06, | |
| "loss": 0.07713969051837921, | |
| "mean_token_accuracy": 0.9977681040763855, | |
| "num_tokens": 60836716.0, | |
| "step": 379 | |
| }, | |
| { | |
| "aux_loss": 8.032850742340088, | |
| "entropy": 0.026606920175254345, | |
| "epoch": 9.048192771084338, | |
| "grad_norm": 0.2880466878414154, | |
| "learning_rate": 1.3956530803691917e-06, | |
| "loss": 0.0765802338719368, | |
| "mean_token_accuracy": 0.9976675510406494, | |
| "num_tokens": 61000573.0, | |
| "step": 380 | |
| }, | |
| { | |
| "aux_loss": 8.031289100646973, | |
| "entropy": 0.030671123415231705, | |
| "epoch": 9.072289156626505, | |
| "grad_norm": 0.30061787366867065, | |
| "learning_rate": 1.3953657600213106e-06, | |
| "loss": 0.07775267213582993, | |
| "mean_token_accuracy": 0.9975506663322449, | |
| "num_tokens": 61154706.0, | |
| "step": 381 | |
| }, | |
| { | |
| "aux_loss": 8.032238960266113, | |
| "entropy": 0.027959519997239113, | |
| "epoch": 9.096385542168674, | |
| "grad_norm": 0.28902363777160645, | |
| "learning_rate": 1.3950777440591605e-06, | |
| "loss": 0.07733355462551117, | |
| "mean_token_accuracy": 0.9973697662353516, | |
| "num_tokens": 61333594.0, | |
| "step": 382 | |
| }, | |
| { | |
| "aux_loss": 8.030166625976562, | |
| "entropy": 0.032277317717671394, | |
| "epoch": 9.120481927710843, | |
| "grad_norm": 0.34240710735321045, | |
| "learning_rate": 1.394789033133506e-06, | |
| "loss": 0.07901263236999512, | |
| "mean_token_accuracy": 0.9973782598972321, | |
| "num_tokens": 61490776.0, | |
| "step": 383 | |
| }, | |
| { | |
| "aux_loss": 8.032149314880371, | |
| "entropy": 0.02693926077336073, | |
| "epoch": 9.144578313253012, | |
| "grad_norm": 0.29341667890548706, | |
| "learning_rate": 1.3944996278966811e-06, | |
| "loss": 0.076640784740448, | |
| "mean_token_accuracy": 0.9978146553039551, | |
| "num_tokens": 61669552.0, | |
| "step": 384 | |
| }, | |
| { | |
| "aux_loss": 8.031457901000977, | |
| "entropy": 0.03191028628498316, | |
| "epoch": 9.168674698795181, | |
| "grad_norm": 0.3397424519062042, | |
| "learning_rate": 1.394209529002589e-06, | |
| "loss": 0.07893210649490356, | |
| "mean_token_accuracy": 0.9971943795681, | |
| "num_tokens": 61843274.0, | |
| "step": 385 | |
| }, | |
| { | |
| "aux_loss": 8.03022575378418, | |
| "entropy": 0.028519313782453537, | |
| "epoch": 9.19277108433735, | |
| "grad_norm": 0.30692535638809204, | |
| "learning_rate": 1.3939187371067007e-06, | |
| "loss": 0.07746940851211548, | |
| "mean_token_accuracy": 0.9976769387722015, | |
| "num_tokens": 61998707.0, | |
| "step": 386 | |
| }, | |
| { | |
| "aux_loss": 8.031204223632812, | |
| "entropy": 0.03095682244747877, | |
| "epoch": 9.216867469879517, | |
| "grad_norm": 0.3476795554161072, | |
| "learning_rate": 1.393627252866052e-06, | |
| "loss": 0.07881052792072296, | |
| "mean_token_accuracy": 0.9969981908798218, | |
| "num_tokens": 62173983.0, | |
| "step": 387 | |
| }, | |
| { | |
| "aux_loss": 8.027823448181152, | |
| "entropy": 0.02978881075978279, | |
| "epoch": 9.240963855421686, | |
| "grad_norm": 0.3190312683582306, | |
| "learning_rate": 1.3933350769392442e-06, | |
| "loss": 0.07773149758577347, | |
| "mean_token_accuracy": 0.9973650872707367, | |
| "num_tokens": 62324901.0, | |
| "step": 388 | |
| }, | |
| { | |
| "aux_loss": 8.031431674957275, | |
| "entropy": 0.027737611904740334, | |
| "epoch": 9.265060240963855, | |
| "grad_norm": 0.38071316480636597, | |
| "learning_rate": 1.39304220998644e-06, | |
| "loss": 0.07697569578886032, | |
| "mean_token_accuracy": 0.9974884390830994, | |
| "num_tokens": 62485228.0, | |
| "step": 389 | |
| }, | |
| { | |
| "aux_loss": 8.030527114868164, | |
| "entropy": 0.02737813163548708, | |
| "epoch": 9.289156626506024, | |
| "grad_norm": 0.2937212586402893, | |
| "learning_rate": 1.3927486526693647e-06, | |
| "loss": 0.0766058936715126, | |
| "mean_token_accuracy": 0.9978461861610413, | |
| "num_tokens": 62647707.0, | |
| "step": 390 | |
| }, | |
| { | |
| "aux_loss": 8.030436038970947, | |
| "entropy": 0.030430599115788937, | |
| "epoch": 9.313253012048193, | |
| "grad_norm": 0.30997201800346375, | |
| "learning_rate": 1.3924544056513032e-06, | |
| "loss": 0.0783412903547287, | |
| "mean_token_accuracy": 0.9975597560405731, | |
| "num_tokens": 62816112.0, | |
| "step": 391 | |
| }, | |
| { | |
| "aux_loss": 8.03123950958252, | |
| "entropy": 0.026135905645787716, | |
| "epoch": 9.337349397590362, | |
| "grad_norm": 0.3543896973133087, | |
| "learning_rate": 1.3921594695970985e-06, | |
| "loss": 0.07653771340847015, | |
| "mean_token_accuracy": 0.997521847486496, | |
| "num_tokens": 62950912.0, | |
| "step": 392 | |
| }, | |
| { | |
| "aux_loss": 8.02945613861084, | |
| "entropy": 0.03068769257515669, | |
| "epoch": 9.36144578313253, | |
| "grad_norm": 0.3361717462539673, | |
| "learning_rate": 1.3918638451731505e-06, | |
| "loss": 0.07847397774457932, | |
| "mean_token_accuracy": 0.9971339702606201, | |
| "num_tokens": 63106341.0, | |
| "step": 393 | |
| }, | |
| { | |
| "aux_loss": 8.031757354736328, | |
| "entropy": 0.03277725353837013, | |
| "epoch": 9.385542168674698, | |
| "grad_norm": 0.3406221866607666, | |
| "learning_rate": 1.3915675330474142e-06, | |
| "loss": 0.0791986957192421, | |
| "mean_token_accuracy": 0.9971778690814972, | |
| "num_tokens": 63284372.0, | |
| "step": 394 | |
| }, | |
| { | |
| "aux_loss": 8.030030727386475, | |
| "entropy": 0.026919249445199966, | |
| "epoch": 9.409638554216867, | |
| "grad_norm": 0.31440675258636475, | |
| "learning_rate": 1.3912705338893993e-06, | |
| "loss": 0.07689384371042252, | |
| "mean_token_accuracy": 0.9976073503494263, | |
| "num_tokens": 63455837.0, | |
| "step": 395 | |
| }, | |
| { | |
| "aux_loss": 8.031475067138672, | |
| "entropy": 0.033060451969504356, | |
| "epoch": 9.433734939759036, | |
| "grad_norm": 0.3352949023246765, | |
| "learning_rate": 1.3909728483701666e-06, | |
| "loss": 0.07927119731903076, | |
| "mean_token_accuracy": 0.9972446262836456, | |
| "num_tokens": 63618970.0, | |
| "step": 396 | |
| }, | |
| { | |
| "aux_loss": 8.029807567596436, | |
| "entropy": 0.03108399175107479, | |
| "epoch": 9.457831325301205, | |
| "grad_norm": 0.32964977622032166, | |
| "learning_rate": 1.3906744771623291e-06, | |
| "loss": 0.07835537195205688, | |
| "mean_token_accuracy": 0.9973717033863068, | |
| "num_tokens": 63781997.0, | |
| "step": 397 | |
| }, | |
| { | |
| "aux_loss": 8.031740665435791, | |
| "entropy": 0.03269661497324705, | |
| "epoch": 9.481927710843374, | |
| "grad_norm": 0.3676154911518097, | |
| "learning_rate": 1.3903754209400482e-06, | |
| "loss": 0.07965146005153656, | |
| "mean_token_accuracy": 0.9964734315872192, | |
| "num_tokens": 63932105.0, | |
| "step": 398 | |
| }, | |
| { | |
| "aux_loss": 8.033281803131104, | |
| "entropy": 0.03186710365116596, | |
| "epoch": 9.506024096385541, | |
| "grad_norm": 0.35776206851005554, | |
| "learning_rate": 1.390075680379033e-06, | |
| "loss": 0.07902336865663528, | |
| "mean_token_accuracy": 0.9969694018363953, | |
| "num_tokens": 64093887.0, | |
| "step": 399 | |
| }, | |
| { | |
| "aux_loss": 8.032399654388428, | |
| "entropy": 0.024799546226859093, | |
| "epoch": 9.53012048192771, | |
| "grad_norm": 0.3226422369480133, | |
| "learning_rate": 1.3897752561565394e-06, | |
| "loss": 0.07591937482357025, | |
| "mean_token_accuracy": 0.9975130259990692, | |
| "num_tokens": 64273357.0, | |
| "step": 400 | |
| }, | |
| { | |
| "aux_loss": 8.033264636993408, | |
| "entropy": 0.0295121967792511, | |
| "epoch": 9.55421686746988, | |
| "grad_norm": 0.3351059854030609, | |
| "learning_rate": 1.3894741489513673e-06, | |
| "loss": 0.07776688039302826, | |
| "mean_token_accuracy": 0.997167706489563, | |
| "num_tokens": 64448304.0, | |
| "step": 401 | |
| }, | |
| { | |
| "aux_loss": 8.029650211334229, | |
| "entropy": 0.02971556317061186, | |
| "epoch": 9.578313253012048, | |
| "grad_norm": 0.32523661851882935, | |
| "learning_rate": 1.3891723594438605e-06, | |
| "loss": 0.07813172787427902, | |
| "mean_token_accuracy": 0.9973180294036865, | |
| "num_tokens": 64596938.0, | |
| "step": 402 | |
| }, | |
| { | |
| "aux_loss": 8.031736373901367, | |
| "entropy": 0.02978976722806692, | |
| "epoch": 9.602409638554217, | |
| "grad_norm": 0.3332604169845581, | |
| "learning_rate": 1.3888698883159043e-06, | |
| "loss": 0.07776395231485367, | |
| "mean_token_accuracy": 0.9974326193332672, | |
| "num_tokens": 64769145.0, | |
| "step": 403 | |
| }, | |
| { | |
| "aux_loss": 8.033589839935303, | |
| "entropy": 0.032476719468832016, | |
| "epoch": 9.626506024096386, | |
| "grad_norm": 0.3411960005760193, | |
| "learning_rate": 1.3885667362509237e-06, | |
| "loss": 0.07948120683431625, | |
| "mean_token_accuracy": 0.9970299303531647, | |
| "num_tokens": 64932386.0, | |
| "step": 404 | |
| }, | |
| { | |
| "aux_loss": 8.030903816223145, | |
| "entropy": 0.03362698294222355, | |
| "epoch": 9.650602409638553, | |
| "grad_norm": 0.3845645487308502, | |
| "learning_rate": 1.3882629039338825e-06, | |
| "loss": 0.08039066195487976, | |
| "mean_token_accuracy": 0.9965060353279114, | |
| "num_tokens": 65085807.0, | |
| "step": 405 | |
| }, | |
| { | |
| "aux_loss": 8.029520034790039, | |
| "entropy": 0.0270113842561841, | |
| "epoch": 9.674698795180722, | |
| "grad_norm": 0.34778332710266113, | |
| "learning_rate": 1.3879583920512816e-06, | |
| "loss": 0.077044278383255, | |
| "mean_token_accuracy": 0.9973159432411194, | |
| "num_tokens": 65246006.0, | |
| "step": 406 | |
| }, | |
| { | |
| "aux_loss": 8.030782699584961, | |
| "entropy": 0.03195221349596977, | |
| "epoch": 9.698795180722891, | |
| "grad_norm": 0.35124245285987854, | |
| "learning_rate": 1.3876532012911574e-06, | |
| "loss": 0.07930511981248856, | |
| "mean_token_accuracy": 0.9969338178634644, | |
| "num_tokens": 65411013.0, | |
| "step": 407 | |
| }, | |
| { | |
| "aux_loss": 8.029433727264404, | |
| "entropy": 0.03094009030610323, | |
| "epoch": 9.72289156626506, | |
| "grad_norm": 0.4142710268497467, | |
| "learning_rate": 1.3873473323430797e-06, | |
| "loss": 0.07911791652441025, | |
| "mean_token_accuracy": 0.9967486560344696, | |
| "num_tokens": 65571476.0, | |
| "step": 408 | |
| }, | |
| { | |
| "aux_loss": 8.030499935150146, | |
| "entropy": 0.027457045391201973, | |
| "epoch": 9.74698795180723, | |
| "grad_norm": 0.3272239863872528, | |
| "learning_rate": 1.3870407858981514e-06, | |
| "loss": 0.07713578641414642, | |
| "mean_token_accuracy": 0.9972514510154724, | |
| "num_tokens": 65742609.0, | |
| "step": 409 | |
| }, | |
| { | |
| "aux_loss": 8.029773712158203, | |
| "entropy": 0.030966890044510365, | |
| "epoch": 9.771084337349398, | |
| "grad_norm": 0.42443791031837463, | |
| "learning_rate": 1.3867335626490055e-06, | |
| "loss": 0.07875967025756836, | |
| "mean_token_accuracy": 0.9968508183956146, | |
| "num_tokens": 65891366.0, | |
| "step": 410 | |
| }, | |
| { | |
| "aux_loss": 8.029150009155273, | |
| "entropy": 0.03328642249107361, | |
| "epoch": 9.795180722891565, | |
| "grad_norm": 0.3802852928638458, | |
| "learning_rate": 1.3864256632898051e-06, | |
| "loss": 0.07969282567501068, | |
| "mean_token_accuracy": 0.9970137476921082, | |
| "num_tokens": 66041964.0, | |
| "step": 411 | |
| }, | |
| { | |
| "aux_loss": 8.030668258666992, | |
| "entropy": 0.02882132213562727, | |
| "epoch": 9.819277108433734, | |
| "grad_norm": 0.3516421616077423, | |
| "learning_rate": 1.3861170885162396e-06, | |
| "loss": 0.07771005481481552, | |
| "mean_token_accuracy": 0.9975076615810394, | |
| "num_tokens": 66231004.0, | |
| "step": 412 | |
| }, | |
| { | |
| "aux_loss": 8.029856204986572, | |
| "entropy": 0.028738058172166348, | |
| "epoch": 9.843373493975903, | |
| "grad_norm": 0.34768593311309814, | |
| "learning_rate": 1.3858078390255256e-06, | |
| "loss": 0.07793055474758148, | |
| "mean_token_accuracy": 0.9971697330474854, | |
| "num_tokens": 66399510.0, | |
| "step": 413 | |
| }, | |
| { | |
| "aux_loss": 8.030166625976562, | |
| "entropy": 0.03400828316807747, | |
| "epoch": 9.867469879518072, | |
| "grad_norm": 0.37204456329345703, | |
| "learning_rate": 1.3854979155164043e-06, | |
| "loss": 0.08015817403793335, | |
| "mean_token_accuracy": 0.9967809617519379, | |
| "num_tokens": 66547156.0, | |
| "step": 414 | |
| }, | |
| { | |
| "aux_loss": 8.032981872558594, | |
| "entropy": 0.03100480604916811, | |
| "epoch": 9.891566265060241, | |
| "grad_norm": 0.3481873869895935, | |
| "learning_rate": 1.3851873186891386e-06, | |
| "loss": 0.07907165586948395, | |
| "mean_token_accuracy": 0.9964969456195831, | |
| "num_tokens": 66718160.0, | |
| "step": 415 | |
| }, | |
| { | |
| "aux_loss": 8.028274536132812, | |
| "entropy": 0.030552691780030727, | |
| "epoch": 9.91566265060241, | |
| "grad_norm": 0.33890053629875183, | |
| "learning_rate": 1.3848760492455145e-06, | |
| "loss": 0.07868947088718414, | |
| "mean_token_accuracy": 0.9966758191585541, | |
| "num_tokens": 66873016.0, | |
| "step": 416 | |
| }, | |
| { | |
| "aux_loss": 8.02976369857788, | |
| "entropy": 0.03107893466949463, | |
| "epoch": 9.939759036144578, | |
| "grad_norm": 0.3599156141281128, | |
| "learning_rate": 1.384564107888836e-06, | |
| "loss": 0.078771211206913, | |
| "mean_token_accuracy": 0.9969359636306763, | |
| "num_tokens": 67038673.0, | |
| "step": 417 | |
| }, | |
| { | |
| "aux_loss": 8.02978229522705, | |
| "entropy": 0.028388715349137783, | |
| "epoch": 9.963855421686747, | |
| "grad_norm": 0.35516616702079773, | |
| "learning_rate": 1.384251495323926e-06, | |
| "loss": 0.0778445154428482, | |
| "mean_token_accuracy": 0.9971783459186554, | |
| "num_tokens": 67218897.0, | |
| "step": 418 | |
| }, | |
| { | |
| "aux_loss": 8.031276226043701, | |
| "entropy": 0.03284810110926628, | |
| "epoch": 9.987951807228916, | |
| "grad_norm": 0.3593505024909973, | |
| "learning_rate": 1.3839382122571248e-06, | |
| "loss": 0.0795031189918518, | |
| "mean_token_accuracy": 0.9974339604377747, | |
| "num_tokens": 67376548.0, | |
| "step": 419 | |
| }, | |
| { | |
| "aux_loss": 8.033153533935547, | |
| "entropy": 0.029837898910045624, | |
| "epoch": 10.0, | |
| "grad_norm": 0.4149579107761383, | |
| "learning_rate": 1.3836242593962863e-06, | |
| "loss": 0.04504719376564026, | |
| "mean_token_accuracy": 0.997219443321228, | |
| "num_tokens": 67414630.0, | |
| "step": 420 | |
| }, | |
| { | |
| "aux_loss": 8.03052043914795, | |
| "entropy": 0.026807748712599277, | |
| "epoch": 10.024096385542169, | |
| "grad_norm": 0.3050729036331177, | |
| "learning_rate": 1.3833096374507787e-06, | |
| "loss": 0.07622632384300232, | |
| "mean_token_accuracy": 0.9978890419006348, | |
| "num_tokens": 67588234.0, | |
| "step": 421 | |
| }, | |
| { | |
| "aux_loss": 8.031226634979248, | |
| "entropy": 0.033840239979326725, | |
| "epoch": 10.048192771084338, | |
| "grad_norm": 0.3194749653339386, | |
| "learning_rate": 1.3829943471314814e-06, | |
| "loss": 0.07884673774242401, | |
| "mean_token_accuracy": 0.9978678822517395, | |
| "num_tokens": 67757352.0, | |
| "step": 422 | |
| }, | |
| { | |
| "aux_loss": 8.029906272888184, | |
| "entropy": 0.027255422435700893, | |
| "epoch": 10.072289156626505, | |
| "grad_norm": 0.30284735560417175, | |
| "learning_rate": 1.3826783891507848e-06, | |
| "loss": 0.07626917958259583, | |
| "mean_token_accuracy": 0.9980226457118988, | |
| "num_tokens": 67920553.0, | |
| "step": 423 | |
| }, | |
| { | |
| "aux_loss": 8.02976942062378, | |
| "entropy": 0.027208078652620316, | |
| "epoch": 10.096385542168674, | |
| "grad_norm": 0.29062679409980774, | |
| "learning_rate": 1.3823617642225866e-06, | |
| "loss": 0.07693935185670853, | |
| "mean_token_accuracy": 0.9976333379745483, | |
| "num_tokens": 68081290.0, | |
| "step": 424 | |
| }, | |
| { | |
| "aux_loss": 8.029796123504639, | |
| "entropy": 0.0285436250269413, | |
| "epoch": 10.120481927710843, | |
| "grad_norm": 0.2950977683067322, | |
| "learning_rate": 1.3820444730622926e-06, | |
| "loss": 0.07694471627473831, | |
| "mean_token_accuracy": 0.9980784356594086, | |
| "num_tokens": 68271566.0, | |
| "step": 425 | |
| }, | |
| { | |
| "aux_loss": 8.031370639801025, | |
| "entropy": 0.03286069352179766, | |
| "epoch": 10.144578313253012, | |
| "grad_norm": 0.3592938780784607, | |
| "learning_rate": 1.3817265163868138e-06, | |
| "loss": 0.07915187627077103, | |
| "mean_token_accuracy": 0.9973708391189575, | |
| "num_tokens": 68410627.0, | |
| "step": 426 | |
| }, | |
| { | |
| "aux_loss": 8.02876901626587, | |
| "entropy": 0.033930208534002304, | |
| "epoch": 10.168674698795181, | |
| "grad_norm": 0.3631734549999237, | |
| "learning_rate": 1.381407894914564e-06, | |
| "loss": 0.07949021458625793, | |
| "mean_token_accuracy": 0.9971204400062561, | |
| "num_tokens": 68547059.0, | |
| "step": 427 | |
| }, | |
| { | |
| "aux_loss": 8.028857231140137, | |
| "entropy": 0.03004965092986822, | |
| "epoch": 10.19277108433735, | |
| "grad_norm": 0.32348141074180603, | |
| "learning_rate": 1.3810886093654599e-06, | |
| "loss": 0.07751224935054779, | |
| "mean_token_accuracy": 0.997689813375473, | |
| "num_tokens": 68719122.0, | |
| "step": 428 | |
| }, | |
| { | |
| "aux_loss": 8.0299711227417, | |
| "entropy": 0.025603781454265118, | |
| "epoch": 10.216867469879517, | |
| "grad_norm": 0.2847801148891449, | |
| "learning_rate": 1.3807686604609185e-06, | |
| "loss": 0.07599260658025742, | |
| "mean_token_accuracy": 0.9978285729885101, | |
| "num_tokens": 68903105.0, | |
| "step": 429 | |
| }, | |
| { | |
| "aux_loss": 8.02917766571045, | |
| "entropy": 0.02435719594359398, | |
| "epoch": 10.240963855421686, | |
| "grad_norm": 0.31084614992141724, | |
| "learning_rate": 1.3804480489238556e-06, | |
| "loss": 0.07491791248321533, | |
| "mean_token_accuracy": 0.9980163872241974, | |
| "num_tokens": 69086727.0, | |
| "step": 430 | |
| }, | |
| { | |
| "aux_loss": 8.029499530792236, | |
| "entropy": 0.02250757720321417, | |
| "epoch": 10.265060240963855, | |
| "grad_norm": 0.2934803366661072, | |
| "learning_rate": 1.3801267754786845e-06, | |
| "loss": 0.07460962235927582, | |
| "mean_token_accuracy": 0.9981854856014252, | |
| "num_tokens": 69255826.0, | |
| "step": 431 | |
| }, | |
| { | |
| "aux_loss": 8.028985023498535, | |
| "entropy": 0.026835591532289982, | |
| "epoch": 10.289156626506024, | |
| "grad_norm": 0.31175994873046875, | |
| "learning_rate": 1.3798048408513135e-06, | |
| "loss": 0.0759553462266922, | |
| "mean_token_accuracy": 0.9978678524494171, | |
| "num_tokens": 69429204.0, | |
| "step": 432 | |
| }, | |
| { | |
| "aux_loss": 8.029627323150635, | |
| "entropy": 0.02608797326683998, | |
| "epoch": 10.313253012048193, | |
| "grad_norm": 0.28849494457244873, | |
| "learning_rate": 1.3794822457691448e-06, | |
| "loss": 0.07554003596305847, | |
| "mean_token_accuracy": 0.9981241524219513, | |
| "num_tokens": 69615147.0, | |
| "step": 433 | |
| }, | |
| { | |
| "aux_loss": 8.027892589569092, | |
| "entropy": 0.029431588016450405, | |
| "epoch": 10.337349397590362, | |
| "grad_norm": 0.3519872725009918, | |
| "learning_rate": 1.3791589909610738e-06, | |
| "loss": 0.07704924046993256, | |
| "mean_token_accuracy": 0.9977331459522247, | |
| "num_tokens": 69763662.0, | |
| "step": 434 | |
| }, | |
| { | |
| "aux_loss": 8.028160095214844, | |
| "entropy": 0.030695267021656036, | |
| "epoch": 10.36144578313253, | |
| "grad_norm": 0.35359182953834534, | |
| "learning_rate": 1.3788350771574854e-06, | |
| "loss": 0.0779634341597557, | |
| "mean_token_accuracy": 0.9976026713848114, | |
| "num_tokens": 69923670.0, | |
| "step": 435 | |
| }, | |
| { | |
| "aux_loss": 8.028687000274658, | |
| "entropy": 0.030781088396906853, | |
| "epoch": 10.385542168674698, | |
| "grad_norm": 0.3456423878669739, | |
| "learning_rate": 1.3785105050902542e-06, | |
| "loss": 0.07804363965988159, | |
| "mean_token_accuracy": 0.9974770545959473, | |
| "num_tokens": 70070248.0, | |
| "step": 436 | |
| }, | |
| { | |
| "aux_loss": 8.03036642074585, | |
| "entropy": 0.025892925448715687, | |
| "epoch": 10.409638554216867, | |
| "grad_norm": 0.42847299575805664, | |
| "learning_rate": 1.3781852754927418e-06, | |
| "loss": 0.07700430601835251, | |
| "mean_token_accuracy": 0.9975075125694275, | |
| "num_tokens": 70249380.0, | |
| "step": 437 | |
| }, | |
| { | |
| "aux_loss": 8.031606197357178, | |
| "entropy": 0.0267898328602314, | |
| "epoch": 10.433734939759036, | |
| "grad_norm": 0.29486900568008423, | |
| "learning_rate": 1.3778593890997959e-06, | |
| "loss": 0.07694413512945175, | |
| "mean_token_accuracy": 0.9977473318576813, | |
| "num_tokens": 70413199.0, | |
| "step": 438 | |
| }, | |
| { | |
| "aux_loss": 8.029096126556396, | |
| "entropy": 0.027300704270601273, | |
| "epoch": 10.457831325301205, | |
| "grad_norm": 0.3215588331222534, | |
| "learning_rate": 1.3775328466477474e-06, | |
| "loss": 0.07631190121173859, | |
| "mean_token_accuracy": 0.997810572385788, | |
| "num_tokens": 70586808.0, | |
| "step": 439 | |
| }, | |
| { | |
| "aux_loss": 8.030426025390625, | |
| "entropy": 0.02695034071803093, | |
| "epoch": 10.481927710843374, | |
| "grad_norm": 0.309374064207077, | |
| "learning_rate": 1.3772056488744102e-06, | |
| "loss": 0.07675328850746155, | |
| "mean_token_accuracy": 0.9976034462451935, | |
| "num_tokens": 70763440.0, | |
| "step": 440 | |
| }, | |
| { | |
| "aux_loss": 8.028189659118652, | |
| "entropy": 0.028853912837803364, | |
| "epoch": 10.506024096385541, | |
| "grad_norm": 0.335868239402771, | |
| "learning_rate": 1.3768777965190792e-06, | |
| "loss": 0.07752006500959396, | |
| "mean_token_accuracy": 0.9972420930862427, | |
| "num_tokens": 70910457.0, | |
| "step": 441 | |
| }, | |
| { | |
| "aux_loss": 8.029743194580078, | |
| "entropy": 0.025770947337150574, | |
| "epoch": 10.53012048192771, | |
| "grad_norm": 0.3330857455730438, | |
| "learning_rate": 1.3765492903225272e-06, | |
| "loss": 0.07615037262439728, | |
| "mean_token_accuracy": 0.9975591003894806, | |
| "num_tokens": 71067271.0, | |
| "step": 442 | |
| }, | |
| { | |
| "aux_loss": 8.027770519256592, | |
| "entropy": 0.02995127160102129, | |
| "epoch": 10.55421686746988, | |
| "grad_norm": 0.3459339737892151, | |
| "learning_rate": 1.3762201310270052e-06, | |
| "loss": 0.0779542475938797, | |
| "mean_token_accuracy": 0.9972722232341766, | |
| "num_tokens": 71225176.0, | |
| "step": 443 | |
| }, | |
| { | |
| "aux_loss": 8.02858829498291, | |
| "entropy": 0.024707495234906673, | |
| "epoch": 10.578313253012048, | |
| "grad_norm": 0.32370665669441223, | |
| "learning_rate": 1.3758903193762397e-06, | |
| "loss": 0.0753905326128006, | |
| "mean_token_accuracy": 0.9975995123386383, | |
| "num_tokens": 71391719.0, | |
| "step": 444 | |
| }, | |
| { | |
| "aux_loss": 8.029046535491943, | |
| "entropy": 0.02720453217625618, | |
| "epoch": 10.602409638554217, | |
| "grad_norm": 0.31780052185058594, | |
| "learning_rate": 1.3755598561154312e-06, | |
| "loss": 0.077033132314682, | |
| "mean_token_accuracy": 0.9974277913570404, | |
| "num_tokens": 71561690.0, | |
| "step": 445 | |
| }, | |
| { | |
| "aux_loss": 8.030248165130615, | |
| "entropy": 0.029147695749998093, | |
| "epoch": 10.626506024096386, | |
| "grad_norm": 0.3248000741004944, | |
| "learning_rate": 1.3752287419912521e-06, | |
| "loss": 0.07753097265958786, | |
| "mean_token_accuracy": 0.9971960484981537, | |
| "num_tokens": 71710468.0, | |
| "step": 446 | |
| }, | |
| { | |
| "aux_loss": 8.028928279876709, | |
| "entropy": 0.029994006268680096, | |
| "epoch": 10.650602409638553, | |
| "grad_norm": 0.33071792125701904, | |
| "learning_rate": 1.3748969777518458e-06, | |
| "loss": 0.07808565348386765, | |
| "mean_token_accuracy": 0.9973722398281097, | |
| "num_tokens": 71875559.0, | |
| "step": 447 | |
| }, | |
| { | |
| "aux_loss": 8.030104637145996, | |
| "entropy": 0.025511790066957474, | |
| "epoch": 10.674698795180722, | |
| "grad_norm": 0.32101917266845703, | |
| "learning_rate": 1.3745645641468248e-06, | |
| "loss": 0.07576514780521393, | |
| "mean_token_accuracy": 0.9978866875171661, | |
| "num_tokens": 72045798.0, | |
| "step": 448 | |
| }, | |
| { | |
| "aux_loss": 8.028583526611328, | |
| "entropy": 0.028393504209816456, | |
| "epoch": 10.698795180722891, | |
| "grad_norm": 0.31367799639701843, | |
| "learning_rate": 1.3742315019272683e-06, | |
| "loss": 0.07735928893089294, | |
| "mean_token_accuracy": 0.9973789155483246, | |
| "num_tokens": 72218153.0, | |
| "step": 449 | |
| }, | |
| { | |
| "aux_loss": 8.02676010131836, | |
| "entropy": 0.03315955400466919, | |
| "epoch": 10.72289156626506, | |
| "grad_norm": 0.33943045139312744, | |
| "learning_rate": 1.3738977918457213e-06, | |
| "loss": 0.07943802326917648, | |
| "mean_token_accuracy": 0.9972104430198669, | |
| "num_tokens": 72360308.0, | |
| "step": 450 | |
| }, | |
| { | |
| "aux_loss": 8.028342247009277, | |
| "entropy": 0.037015119567513466, | |
| "epoch": 10.74698795180723, | |
| "grad_norm": 0.35264134407043457, | |
| "learning_rate": 1.3735634346561928e-06, | |
| "loss": 0.08016332238912582, | |
| "mean_token_accuracy": 0.9973889291286469, | |
| "num_tokens": 72523679.0, | |
| "step": 451 | |
| }, | |
| { | |
| "aux_loss": 8.028265953063965, | |
| "entropy": 0.030274370685219765, | |
| "epoch": 10.771084337349398, | |
| "grad_norm": 0.31121376156806946, | |
| "learning_rate": 1.3732284311141535e-06, | |
| "loss": 0.0778329148888588, | |
| "mean_token_accuracy": 0.997382640838623, | |
| "num_tokens": 72676307.0, | |
| "step": 452 | |
| }, | |
| { | |
| "aux_loss": 8.028914451599121, | |
| "entropy": 0.02892636600881815, | |
| "epoch": 10.795180722891565, | |
| "grad_norm": 0.32904553413391113, | |
| "learning_rate": 1.3728927819765347e-06, | |
| "loss": 0.07730700075626373, | |
| "mean_token_accuracy": 0.9975307881832123, | |
| "num_tokens": 72827705.0, | |
| "step": 453 | |
| }, | |
| { | |
| "aux_loss": 8.028653144836426, | |
| "entropy": 0.026827383786439896, | |
| "epoch": 10.819277108433734, | |
| "grad_norm": 0.3565026521682739, | |
| "learning_rate": 1.3725564880017268e-06, | |
| "loss": 0.07710254937410355, | |
| "mean_token_accuracy": 0.9978848695755005, | |
| "num_tokens": 72984162.0, | |
| "step": 454 | |
| }, | |
| { | |
| "aux_loss": 8.027618408203125, | |
| "entropy": 0.03206733614206314, | |
| "epoch": 10.843373493975903, | |
| "grad_norm": 0.33514919877052307, | |
| "learning_rate": 1.3722195499495765e-06, | |
| "loss": 0.0789363905787468, | |
| "mean_token_accuracy": 0.9969374537467957, | |
| "num_tokens": 73141852.0, | |
| "step": 455 | |
| }, | |
| { | |
| "aux_loss": 8.030162811279297, | |
| "entropy": 0.027127815410494804, | |
| "epoch": 10.867469879518072, | |
| "grad_norm": 0.32852309942245483, | |
| "learning_rate": 1.3718819685813862e-06, | |
| "loss": 0.07681447267532349, | |
| "mean_token_accuracy": 0.9976330995559692, | |
| "num_tokens": 73318634.0, | |
| "step": 456 | |
| }, | |
| { | |
| "aux_loss": 8.028889179229736, | |
| "entropy": 0.02808957453817129, | |
| "epoch": 10.891566265060241, | |
| "grad_norm": 0.428763747215271, | |
| "learning_rate": 1.371543744659912e-06, | |
| "loss": 0.07722076028585434, | |
| "mean_token_accuracy": 0.9971847534179688, | |
| "num_tokens": 73467288.0, | |
| "step": 457 | |
| }, | |
| { | |
| "aux_loss": 8.028523445129395, | |
| "entropy": 0.033010026440024376, | |
| "epoch": 10.91566265060241, | |
| "grad_norm": 0.332423597574234, | |
| "learning_rate": 1.371204878949361e-06, | |
| "loss": 0.07916770875453949, | |
| "mean_token_accuracy": 0.9972398281097412, | |
| "num_tokens": 73624957.0, | |
| "step": 458 | |
| }, | |
| { | |
| "aux_loss": 8.027756214141846, | |
| "entropy": 0.03013605810701847, | |
| "epoch": 10.939759036144578, | |
| "grad_norm": 0.4300965666770935, | |
| "learning_rate": 1.3708653722153918e-06, | |
| "loss": 0.07825049012899399, | |
| "mean_token_accuracy": 0.9971310496330261, | |
| "num_tokens": 73772800.0, | |
| "step": 459 | |
| }, | |
| { | |
| "aux_loss": 8.030034065246582, | |
| "entropy": 0.027245910838246346, | |
| "epoch": 10.963855421686747, | |
| "grad_norm": 0.32759150862693787, | |
| "learning_rate": 1.3705252252251102e-06, | |
| "loss": 0.076337531208992, | |
| "mean_token_accuracy": 0.997997373342514, | |
| "num_tokens": 73971847.0, | |
| "step": 460 | |
| }, | |
| { | |
| "aux_loss": 8.029091358184814, | |
| "entropy": 0.03214616421610117, | |
| "epoch": 10.987951807228916, | |
| "grad_norm": 0.36098340153694153, | |
| "learning_rate": 1.370184438747069e-06, | |
| "loss": 0.07857733964920044, | |
| "mean_token_accuracy": 0.9973133206367493, | |
| "num_tokens": 74122193.0, | |
| "step": 461 | |
| }, | |
| { | |
| "aux_loss": 8.02614974975586, | |
| "entropy": 0.035153578966856, | |
| "epoch": 11.0, | |
| "grad_norm": 0.46866685152053833, | |
| "learning_rate": 1.3698430135512658e-06, | |
| "loss": 0.04593968391418457, | |
| "mean_token_accuracy": 0.9968705773353577, | |
| "num_tokens": 74156093.0, | |
| "step": 462 | |
| }, | |
| { | |
| "aux_loss": 8.027415752410889, | |
| "entropy": 0.028158558532595634, | |
| "epoch": 11.024096385542169, | |
| "grad_norm": 0.30607613921165466, | |
| "learning_rate": 1.369500950409142e-06, | |
| "loss": 0.07637624442577362, | |
| "mean_token_accuracy": 0.9978108406066895, | |
| "num_tokens": 74313575.0, | |
| "step": 463 | |
| }, | |
| { | |
| "aux_loss": 8.027459621429443, | |
| "entropy": 0.029599015600979328, | |
| "epoch": 11.048192771084338, | |
| "grad_norm": 0.357259064912796, | |
| "learning_rate": 1.3691582500935793e-06, | |
| "loss": 0.07699000835418701, | |
| "mean_token_accuracy": 0.9981439709663391, | |
| "num_tokens": 74470458.0, | |
| "step": 464 | |
| }, | |
| { | |
| "aux_loss": 8.026456356048584, | |
| "entropy": 0.028655465692281723, | |
| "epoch": 11.072289156626505, | |
| "grad_norm": 0.29174235463142395, | |
| "learning_rate": 1.3688149133789e-06, | |
| "loss": 0.07684057950973511, | |
| "mean_token_accuracy": 0.9977833330631256, | |
| "num_tokens": 74620787.0, | |
| "step": 465 | |
| }, | |
| { | |
| "aux_loss": 8.029138088226318, | |
| "entropy": 0.022806944325566292, | |
| "epoch": 11.096385542168674, | |
| "grad_norm": 0.2944920063018799, | |
| "learning_rate": 1.368470941040864e-06, | |
| "loss": 0.07433664798736572, | |
| "mean_token_accuracy": 0.9983370304107666, | |
| "num_tokens": 74777566.0, | |
| "step": 466 | |
| }, | |
| { | |
| "aux_loss": 8.026599407196045, | |
| "entropy": 0.025663558393716812, | |
| "epoch": 11.120481927710843, | |
| "grad_norm": 0.2916056513786316, | |
| "learning_rate": 1.3681263338566675e-06, | |
| "loss": 0.07559385895729065, | |
| "mean_token_accuracy": 0.9982210993766785, | |
| "num_tokens": 74948804.0, | |
| "step": 467 | |
| }, | |
| { | |
| "aux_loss": 8.026897430419922, | |
| "entropy": 0.03057689778506756, | |
| "epoch": 11.144578313253012, | |
| "grad_norm": 0.31129932403564453, | |
| "learning_rate": 1.3677810926049408e-06, | |
| "loss": 0.0773526206612587, | |
| "mean_token_accuracy": 0.99770787358284, | |
| "num_tokens": 75097224.0, | |
| "step": 468 | |
| }, | |
| { | |
| "aux_loss": 8.024751663208008, | |
| "entropy": 0.028811393305659294, | |
| "epoch": 11.168674698795181, | |
| "grad_norm": 0.3139060437679291, | |
| "learning_rate": 1.3674352180657472e-06, | |
| "loss": 0.07690249383449554, | |
| "mean_token_accuracy": 0.997710257768631, | |
| "num_tokens": 75237910.0, | |
| "step": 469 | |
| }, | |
| { | |
| "aux_loss": 8.026570796966553, | |
| "entropy": 0.027774027548730373, | |
| "epoch": 11.19277108433735, | |
| "grad_norm": 0.30671951174736023, | |
| "learning_rate": 1.367088711020581e-06, | |
| "loss": 0.07627267390489578, | |
| "mean_token_accuracy": 0.9979667663574219, | |
| "num_tokens": 75384961.0, | |
| "step": 470 | |
| }, | |
| { | |
| "aux_loss": 8.029362201690674, | |
| "entropy": 0.028830256313085556, | |
| "epoch": 11.216867469879517, | |
| "grad_norm": 0.3399089574813843, | |
| "learning_rate": 1.3667415722523648e-06, | |
| "loss": 0.07696400582790375, | |
| "mean_token_accuracy": 0.9977167546749115, | |
| "num_tokens": 75547412.0, | |
| "step": 471 | |
| }, | |
| { | |
| "aux_loss": 8.029022693634033, | |
| "entropy": 0.026009133085608482, | |
| "epoch": 11.240963855421686, | |
| "grad_norm": 0.2968512177467346, | |
| "learning_rate": 1.3663938025454495e-06, | |
| "loss": 0.07592800259590149, | |
| "mean_token_accuracy": 0.997904509305954, | |
| "num_tokens": 75721807.0, | |
| "step": 472 | |
| }, | |
| { | |
| "aux_loss": 8.027937889099121, | |
| "entropy": 0.03286511264741421, | |
| "epoch": 11.265060240963855, | |
| "grad_norm": 0.3452129662036896, | |
| "learning_rate": 1.3660454026856114e-06, | |
| "loss": 0.0784171000123024, | |
| "mean_token_accuracy": 0.9975327253341675, | |
| "num_tokens": 75877734.0, | |
| "step": 473 | |
| }, | |
| { | |
| "aux_loss": 8.028258323669434, | |
| "entropy": 0.025823739357292652, | |
| "epoch": 11.289156626506024, | |
| "grad_norm": 0.3015165328979492, | |
| "learning_rate": 1.3656963734600503e-06, | |
| "loss": 0.07567039132118225, | |
| "mean_token_accuracy": 0.9982956647872925, | |
| "num_tokens": 76034122.0, | |
| "step": 474 | |
| }, | |
| { | |
| "aux_loss": 8.026177406311035, | |
| "entropy": 0.03207191079854965, | |
| "epoch": 11.313253012048193, | |
| "grad_norm": 0.3374171853065491, | |
| "learning_rate": 1.3653467156573882e-06, | |
| "loss": 0.07849003374576569, | |
| "mean_token_accuracy": 0.9976714849472046, | |
| "num_tokens": 76192441.0, | |
| "step": 475 | |
| }, | |
| { | |
| "aux_loss": 8.027956008911133, | |
| "entropy": 0.026211952790617943, | |
| "epoch": 11.337349397590362, | |
| "grad_norm": 0.35711753368377686, | |
| "learning_rate": 1.3649964300676674e-06, | |
| "loss": 0.07585370540618896, | |
| "mean_token_accuracy": 0.9977020621299744, | |
| "num_tokens": 76356381.0, | |
| "step": 476 | |
| }, | |
| { | |
| "aux_loss": 8.02691650390625, | |
| "entropy": 0.03026073705404997, | |
| "epoch": 11.36144578313253, | |
| "grad_norm": 0.3285326361656189, | |
| "learning_rate": 1.3646455174823483e-06, | |
| "loss": 0.07800611853599548, | |
| "mean_token_accuracy": 0.9974254965782166, | |
| "num_tokens": 76515766.0, | |
| "step": 477 | |
| }, | |
| { | |
| "aux_loss": 8.028995513916016, | |
| "entropy": 0.02668727468699217, | |
| "epoch": 11.385542168674698, | |
| "grad_norm": 0.3030661642551422, | |
| "learning_rate": 1.3642939786943089e-06, | |
| "loss": 0.07588149607181549, | |
| "mean_token_accuracy": 0.9981980621814728, | |
| "num_tokens": 76672811.0, | |
| "step": 478 | |
| }, | |
| { | |
| "aux_loss": 8.028472423553467, | |
| "entropy": 0.02798299677670002, | |
| "epoch": 11.409638554216867, | |
| "grad_norm": 0.30959540605545044, | |
| "learning_rate": 1.363941814497841e-06, | |
| "loss": 0.07691517472267151, | |
| "mean_token_accuracy": 0.9976131021976471, | |
| "num_tokens": 76846962.0, | |
| "step": 479 | |
| }, | |
| { | |
| "aux_loss": 8.027761459350586, | |
| "entropy": 0.023294473066926003, | |
| "epoch": 11.433734939759036, | |
| "grad_norm": 0.2890002429485321, | |
| "learning_rate": 1.3635890256886501e-06, | |
| "loss": 0.07428885996341705, | |
| "mean_token_accuracy": 0.9982883036136627, | |
| "num_tokens": 77020669.0, | |
| "step": 480 | |
| }, | |
| { | |
| "aux_loss": 8.027469635009766, | |
| "entropy": 0.028372498229146004, | |
| "epoch": 11.457831325301205, | |
| "grad_norm": 0.3321754038333893, | |
| "learning_rate": 1.3632356130638528e-06, | |
| "loss": 0.07671969383955002, | |
| "mean_token_accuracy": 0.9977000951766968, | |
| "num_tokens": 77181204.0, | |
| "step": 481 | |
| }, | |
| { | |
| "aux_loss": 8.027999877929688, | |
| "entropy": 0.024836488999426365, | |
| "epoch": 11.481927710843374, | |
| "grad_norm": 0.2997661232948303, | |
| "learning_rate": 1.3628815774219754e-06, | |
| "loss": 0.07534407079219818, | |
| "mean_token_accuracy": 0.9979956150054932, | |
| "num_tokens": 77365065.0, | |
| "step": 482 | |
| }, | |
| { | |
| "aux_loss": 8.027578830718994, | |
| "entropy": 0.025402785278856754, | |
| "epoch": 11.506024096385541, | |
| "grad_norm": 0.3166537880897522, | |
| "learning_rate": 1.3625269195629517e-06, | |
| "loss": 0.07534520328044891, | |
| "mean_token_accuracy": 0.9980738162994385, | |
| "num_tokens": 77534153.0, | |
| "step": 483 | |
| }, | |
| { | |
| "aux_loss": 8.028955936431885, | |
| "entropy": 0.027941882610321045, | |
| "epoch": 11.53012048192771, | |
| "grad_norm": 0.3131483495235443, | |
| "learning_rate": 1.3621716402881215e-06, | |
| "loss": 0.0763813927769661, | |
| "mean_token_accuracy": 0.9981589615345001, | |
| "num_tokens": 77697477.0, | |
| "step": 484 | |
| }, | |
| { | |
| "aux_loss": 8.028358459472656, | |
| "entropy": 0.023258808068931103, | |
| "epoch": 11.55421686746988, | |
| "grad_norm": 0.28977909684181213, | |
| "learning_rate": 1.3618157404002283e-06, | |
| "loss": 0.07519376277923584, | |
| "mean_token_accuracy": 0.9978441596031189, | |
| "num_tokens": 77884159.0, | |
| "step": 485 | |
| }, | |
| { | |
| "aux_loss": 8.027586460113525, | |
| "entropy": 0.028671267442405224, | |
| "epoch": 11.578313253012048, | |
| "grad_norm": 0.3253847658634186, | |
| "learning_rate": 1.3614592207034186e-06, | |
| "loss": 0.07729551196098328, | |
| "mean_token_accuracy": 0.9978532791137695, | |
| "num_tokens": 78051531.0, | |
| "step": 486 | |
| }, | |
| { | |
| "aux_loss": 8.025540828704834, | |
| "entropy": 0.02651071920990944, | |
| "epoch": 11.602409638554217, | |
| "grad_norm": 0.31019577383995056, | |
| "learning_rate": 1.3611020820032388e-06, | |
| "loss": 0.07641060650348663, | |
| "mean_token_accuracy": 0.9979585409164429, | |
| "num_tokens": 78225093.0, | |
| "step": 487 | |
| }, | |
| { | |
| "aux_loss": 8.02729320526123, | |
| "entropy": 0.029389088042080402, | |
| "epoch": 11.626506024096386, | |
| "grad_norm": 0.3609655499458313, | |
| "learning_rate": 1.360744325106634e-06, | |
| "loss": 0.07722356915473938, | |
| "mean_token_accuracy": 0.9975888133049011, | |
| "num_tokens": 78382804.0, | |
| "step": 488 | |
| }, | |
| { | |
| "aux_loss": 8.027955532073975, | |
| "entropy": 0.029173430055379868, | |
| "epoch": 11.650602409638553, | |
| "grad_norm": 0.34442952275276184, | |
| "learning_rate": 1.360385950821946e-06, | |
| "loss": 0.07752852886915207, | |
| "mean_token_accuracy": 0.9973673522472382, | |
| "num_tokens": 78541939.0, | |
| "step": 489 | |
| }, | |
| { | |
| "aux_loss": 8.026641368865967, | |
| "entropy": 0.02798728458583355, | |
| "epoch": 11.674698795180722, | |
| "grad_norm": 0.34241095185279846, | |
| "learning_rate": 1.3600269599589116e-06, | |
| "loss": 0.07710593938827515, | |
| "mean_token_accuracy": 0.997597724199295, | |
| "num_tokens": 78699528.0, | |
| "step": 490 | |
| }, | |
| { | |
| "aux_loss": 8.02653169631958, | |
| "entropy": 0.022601360455155373, | |
| "epoch": 11.698795180722891, | |
| "grad_norm": 0.35648760199546814, | |
| "learning_rate": 1.3596673533286612e-06, | |
| "loss": 0.07467810064554214, | |
| "mean_token_accuracy": 0.9981017708778381, | |
| "num_tokens": 78883699.0, | |
| "step": 491 | |
| }, | |
| { | |
| "aux_loss": 8.02663803100586, | |
| "entropy": 0.024978790432214737, | |
| "epoch": 11.72289156626506, | |
| "grad_norm": 0.3188750445842743, | |
| "learning_rate": 1.3593071317437159e-06, | |
| "loss": 0.07513359189033508, | |
| "mean_token_accuracy": 0.9980481863021851, | |
| "num_tokens": 79053318.0, | |
| "step": 492 | |
| }, | |
| { | |
| "aux_loss": 8.027148246765137, | |
| "entropy": 0.025895356200635433, | |
| "epoch": 11.74698795180723, | |
| "grad_norm": 0.3157801628112793, | |
| "learning_rate": 1.3589462960179868e-06, | |
| "loss": 0.0758017897605896, | |
| "mean_token_accuracy": 0.9976556599140167, | |
| "num_tokens": 79210267.0, | |
| "step": 493 | |
| }, | |
| { | |
| "aux_loss": 8.026412010192871, | |
| "entropy": 0.026703675277531147, | |
| "epoch": 11.771084337349398, | |
| "grad_norm": 0.29264572262763977, | |
| "learning_rate": 1.358584846966772e-06, | |
| "loss": 0.07661619037389755, | |
| "mean_token_accuracy": 0.9978971779346466, | |
| "num_tokens": 79382574.0, | |
| "step": 494 | |
| }, | |
| { | |
| "aux_loss": 8.02318811416626, | |
| "entropy": 0.029082953929901123, | |
| "epoch": 11.795180722891565, | |
| "grad_norm": 0.3202921748161316, | |
| "learning_rate": 1.358222785406756e-06, | |
| "loss": 0.07708336412906647, | |
| "mean_token_accuracy": 0.9975403249263763, | |
| "num_tokens": 79539742.0, | |
| "step": 495 | |
| }, | |
| { | |
| "aux_loss": 8.028156757354736, | |
| "entropy": 0.03219949174672365, | |
| "epoch": 11.819277108433734, | |
| "grad_norm": 0.347214013338089, | |
| "learning_rate": 1.3578601121560066e-06, | |
| "loss": 0.07849562168121338, | |
| "mean_token_accuracy": 0.9975992739200592, | |
| "num_tokens": 79715225.0, | |
| "step": 496 | |
| }, | |
| { | |
| "aux_loss": 8.02785062789917, | |
| "entropy": 0.03248244524002075, | |
| "epoch": 11.843373493975903, | |
| "grad_norm": 0.36930665373802185, | |
| "learning_rate": 1.3574968280339748e-06, | |
| "loss": 0.07867126166820526, | |
| "mean_token_accuracy": 0.9975761771202087, | |
| "num_tokens": 79863950.0, | |
| "step": 497 | |
| }, | |
| { | |
| "aux_loss": 8.026073455810547, | |
| "entropy": 0.02557132299989462, | |
| "epoch": 11.867469879518072, | |
| "grad_norm": 0.3051406145095825, | |
| "learning_rate": 1.3571329338614906e-06, | |
| "loss": 0.07562849670648575, | |
| "mean_token_accuracy": 0.9980701208114624, | |
| "num_tokens": 80030537.0, | |
| "step": 498 | |
| }, | |
| { | |
| "aux_loss": 8.02685546875, | |
| "entropy": 0.02724768966436386, | |
| "epoch": 11.891566265060241, | |
| "grad_norm": 0.32025477290153503, | |
| "learning_rate": 1.356768430460763e-06, | |
| "loss": 0.07616618275642395, | |
| "mean_token_accuracy": 0.9980640113353729, | |
| "num_tokens": 80201317.0, | |
| "step": 499 | |
| }, | |
| { | |
| "aux_loss": 8.026135921478271, | |
| "entropy": 0.03000323288142681, | |
| "epoch": 11.91566265060241, | |
| "grad_norm": 0.3271973133087158, | |
| "learning_rate": 1.3564033186553776e-06, | |
| "loss": 0.07745539397001266, | |
| "mean_token_accuracy": 0.9974850416183472, | |
| "num_tokens": 80348643.0, | |
| "step": 500 | |
| }, | |
| { | |
| "aux_loss": 8.02552318572998, | |
| "entropy": 0.027183019556105137, | |
| "epoch": 11.939759036144578, | |
| "grad_norm": 0.33340510725975037, | |
| "learning_rate": 1.3560375992702945e-06, | |
| "loss": 0.07644230127334595, | |
| "mean_token_accuracy": 0.9975429177284241, | |
| "num_tokens": 80511188.0, | |
| "step": 501 | |
| }, | |
| { | |
| "aux_loss": 8.02660322189331, | |
| "entropy": 0.025949115864932537, | |
| "epoch": 11.963855421686747, | |
| "grad_norm": 0.30572640895843506, | |
| "learning_rate": 1.3556712731318467e-06, | |
| "loss": 0.0758323073387146, | |
| "mean_token_accuracy": 0.9978821277618408, | |
| "num_tokens": 80685850.0, | |
| "step": 502 | |
| }, | |
| { | |
| "aux_loss": 8.02736520767212, | |
| "entropy": 0.026593544520437717, | |
| "epoch": 11.987951807228916, | |
| "grad_norm": 0.3319381773471832, | |
| "learning_rate": 1.3553043410677378e-06, | |
| "loss": 0.07625584304332733, | |
| "mean_token_accuracy": 0.9979047179222107, | |
| "num_tokens": 80858074.0, | |
| "step": 503 | |
| }, | |
| { | |
| "aux_loss": 8.02574348449707, | |
| "entropy": 0.026809921488165855, | |
| "epoch": 12.0, | |
| "grad_norm": 0.43141719698905945, | |
| "learning_rate": 1.3549368039070411e-06, | |
| "loss": 0.04325544089078903, | |
| "mean_token_accuracy": 0.9976990818977356, | |
| "num_tokens": 80897556.0, | |
| "step": 504 | |
| }, | |
| { | |
| "aux_loss": 8.027431011199951, | |
| "entropy": 0.028303110972046852, | |
| "epoch": 12.024096385542169, | |
| "grad_norm": 0.29158341884613037, | |
| "learning_rate": 1.354568662480197e-06, | |
| "loss": 0.07610264420509338, | |
| "mean_token_accuracy": 0.9983315169811249, | |
| "num_tokens": 81058588.0, | |
| "step": 505 | |
| }, | |
| { | |
| "aux_loss": 8.027827262878418, | |
| "entropy": 0.029750879853963852, | |
| "epoch": 12.048192771084338, | |
| "grad_norm": 0.34390127658843994, | |
| "learning_rate": 1.3541999176190103e-06, | |
| "loss": 0.07679297775030136, | |
| "mean_token_accuracy": 0.9981173276901245, | |
| "num_tokens": 81218943.0, | |
| "step": 506 | |
| }, | |
| { | |
| "aux_loss": 8.025716781616211, | |
| "entropy": 0.028487034142017365, | |
| "epoch": 12.072289156626505, | |
| "grad_norm": 0.32288870215415955, | |
| "learning_rate": 1.3538305701566505e-06, | |
| "loss": 0.07639636099338531, | |
| "mean_token_accuracy": 0.9979084432125092, | |
| "num_tokens": 81391960.0, | |
| "step": 507 | |
| }, | |
| { | |
| "aux_loss": 8.025598049163818, | |
| "entropy": 0.02569352090358734, | |
| "epoch": 12.096385542168674, | |
| "grad_norm": 0.3089020252227783, | |
| "learning_rate": 1.3534606209276477e-06, | |
| "loss": 0.07509694248437881, | |
| "mean_token_accuracy": 0.9983225762844086, | |
| "num_tokens": 81548788.0, | |
| "step": 508 | |
| }, | |
| { | |
| "aux_loss": 8.026646137237549, | |
| "entropy": 0.023537397384643555, | |
| "epoch": 12.120481927710843, | |
| "grad_norm": 0.296945720911026, | |
| "learning_rate": 1.3530900707678925e-06, | |
| "loss": 0.07455359399318695, | |
| "mean_token_accuracy": 0.9982962906360626, | |
| "num_tokens": 81708198.0, | |
| "step": 509 | |
| }, | |
| { | |
| "aux_loss": 8.022956848144531, | |
| "entropy": 0.028022294864058495, | |
| "epoch": 12.144578313253012, | |
| "grad_norm": 0.32837480306625366, | |
| "learning_rate": 1.3527189205146324e-06, | |
| "loss": 0.07651332765817642, | |
| "mean_token_accuracy": 0.997875303030014, | |
| "num_tokens": 81848561.0, | |
| "step": 510 | |
| }, | |
| { | |
| "aux_loss": 8.025831699371338, | |
| "entropy": 0.026299542747437954, | |
| "epoch": 12.168674698795181, | |
| "grad_norm": 0.30512234568595886, | |
| "learning_rate": 1.3523471710064716e-06, | |
| "loss": 0.07586384564638138, | |
| "mean_token_accuracy": 0.9978923797607422, | |
| "num_tokens": 81994863.0, | |
| "step": 511 | |
| }, | |
| { | |
| "aux_loss": 8.024884223937988, | |
| "entropy": 0.02601549867540598, | |
| "epoch": 12.19277108433735, | |
| "grad_norm": 0.3252599537372589, | |
| "learning_rate": 1.351974823083368e-06, | |
| "loss": 0.07537113130092621, | |
| "mean_token_accuracy": 0.998057097196579, | |
| "num_tokens": 82147211.0, | |
| "step": 512 | |
| }, | |
| { | |
| "aux_loss": 8.027286052703857, | |
| "entropy": 0.02541358768939972, | |
| "epoch": 12.216867469879517, | |
| "grad_norm": 0.28130462765693665, | |
| "learning_rate": 1.3516018775866311e-06, | |
| "loss": 0.07533696293830872, | |
| "mean_token_accuracy": 0.9985062777996063, | |
| "num_tokens": 82296539.0, | |
| "step": 513 | |
| }, | |
| { | |
| "aux_loss": 8.023170471191406, | |
| "entropy": 0.025747119449079037, | |
| "epoch": 12.240963855421686, | |
| "grad_norm": 0.3796326518058777, | |
| "learning_rate": 1.3512283353589214e-06, | |
| "loss": 0.07526561617851257, | |
| "mean_token_accuracy": 0.9982715845108032, | |
| "num_tokens": 82454079.0, | |
| "step": 514 | |
| }, | |
| { | |
| "aux_loss": 8.026607990264893, | |
| "entropy": 0.025363615714013577, | |
| "epoch": 12.265060240963855, | |
| "grad_norm": 0.30517780780792236, | |
| "learning_rate": 1.3508541972442473e-06, | |
| "loss": 0.07509754598140717, | |
| "mean_token_accuracy": 0.9983097016811371, | |
| "num_tokens": 82630292.0, | |
| "step": 515 | |
| }, | |
| { | |
| "aux_loss": 8.02615737915039, | |
| "entropy": 0.02330672275274992, | |
| "epoch": 12.289156626506024, | |
| "grad_norm": 0.27616629004478455, | |
| "learning_rate": 1.3504794640879638e-06, | |
| "loss": 0.07439641654491425, | |
| "mean_token_accuracy": 0.9981828331947327, | |
| "num_tokens": 82818619.0, | |
| "step": 516 | |
| }, | |
| { | |
| "aux_loss": 8.027260303497314, | |
| "entropy": 0.03045511431992054, | |
| "epoch": 12.313253012048193, | |
| "grad_norm": 0.36653822660446167, | |
| "learning_rate": 1.35010413673677e-06, | |
| "loss": 0.07767168432474136, | |
| "mean_token_accuracy": 0.9976451992988586, | |
| "num_tokens": 82986008.0, | |
| "step": 517 | |
| }, | |
| { | |
| "aux_loss": 8.025866031646729, | |
| "entropy": 0.027308608405292034, | |
| "epoch": 12.337349397590362, | |
| "grad_norm": 0.47573405504226685, | |
| "learning_rate": 1.3497282160387075e-06, | |
| "loss": 0.07590079307556152, | |
| "mean_token_accuracy": 0.9980502426624298, | |
| "num_tokens": 83161459.0, | |
| "step": 518 | |
| }, | |
| { | |
| "aux_loss": 8.027106285095215, | |
| "entropy": 0.02594301663339138, | |
| "epoch": 12.36144578313253, | |
| "grad_norm": 0.31834688782691956, | |
| "learning_rate": 1.3493517028431595e-06, | |
| "loss": 0.07548630237579346, | |
| "mean_token_accuracy": 0.9980054497718811, | |
| "num_tokens": 83320022.0, | |
| "step": 519 | |
| }, | |
| { | |
| "aux_loss": 8.026435375213623, | |
| "entropy": 0.023103803396224976, | |
| "epoch": 12.385542168674698, | |
| "grad_norm": 0.2995982766151428, | |
| "learning_rate": 1.348974598000847e-06, | |
| "loss": 0.07430864870548248, | |
| "mean_token_accuracy": 0.998340368270874, | |
| "num_tokens": 83504630.0, | |
| "step": 520 | |
| }, | |
| { | |
| "aux_loss": 8.025731563568115, | |
| "entropy": 0.02603835891932249, | |
| "epoch": 12.409638554216867, | |
| "grad_norm": 0.2815133333206177, | |
| "learning_rate": 1.3485969023638278e-06, | |
| "loss": 0.07602337002754211, | |
| "mean_token_accuracy": 0.9980197846889496, | |
| "num_tokens": 83682302.0, | |
| "step": 521 | |
| }, | |
| { | |
| "aux_loss": 8.02298355102539, | |
| "entropy": 0.026776984333992004, | |
| "epoch": 12.433734939759036, | |
| "grad_norm": 0.3041905164718628, | |
| "learning_rate": 1.3482186167854954e-06, | |
| "loss": 0.07534859329462051, | |
| "mean_token_accuracy": 0.9982883036136627, | |
| "num_tokens": 83829851.0, | |
| "step": 522 | |
| }, | |
| { | |
| "aux_loss": 8.025999069213867, | |
| "entropy": 0.02272285521030426, | |
| "epoch": 12.457831325301205, | |
| "grad_norm": 0.39276036620140076, | |
| "learning_rate": 1.3478397421205751e-06, | |
| "loss": 0.07404108345508575, | |
| "mean_token_accuracy": 0.9983120262622833, | |
| "num_tokens": 84004635.0, | |
| "step": 523 | |
| }, | |
| { | |
| "aux_loss": 8.026875972747803, | |
| "entropy": 0.02525839675217867, | |
| "epoch": 12.481927710843374, | |
| "grad_norm": 0.286891907453537, | |
| "learning_rate": 1.3474602792251244e-06, | |
| "loss": 0.07579140365123749, | |
| "mean_token_accuracy": 0.9980730414390564, | |
| "num_tokens": 84191495.0, | |
| "step": 524 | |
| }, | |
| { | |
| "aux_loss": 8.025129318237305, | |
| "entropy": 0.022243279963731766, | |
| "epoch": 12.506024096385541, | |
| "grad_norm": 0.30389881134033203, | |
| "learning_rate": 1.347080228956529e-06, | |
| "loss": 0.07404506206512451, | |
| "mean_token_accuracy": 0.9983067512512207, | |
| "num_tokens": 84371571.0, | |
| "step": 525 | |
| }, | |
| { | |
| "aux_loss": 8.025508403778076, | |
| "entropy": 0.028252240270376205, | |
| "epoch": 12.53012048192771, | |
| "grad_norm": 0.369401216506958, | |
| "learning_rate": 1.3466995921735024e-06, | |
| "loss": 0.07609507441520691, | |
| "mean_token_accuracy": 0.9978316426277161, | |
| "num_tokens": 84540392.0, | |
| "step": 526 | |
| }, | |
| { | |
| "aux_loss": 8.02607536315918, | |
| "entropy": 0.023751961067318916, | |
| "epoch": 12.55421686746988, | |
| "grad_norm": 0.2676929235458374, | |
| "learning_rate": 1.3463183697360826e-06, | |
| "loss": 0.07453473657369614, | |
| "mean_token_accuracy": 0.9983112514019012, | |
| "num_tokens": 84722188.0, | |
| "step": 527 | |
| }, | |
| { | |
| "aux_loss": 8.024996757507324, | |
| "entropy": 0.024897695519030094, | |
| "epoch": 12.578313253012048, | |
| "grad_norm": 0.32287949323654175, | |
| "learning_rate": 1.3459365625056316e-06, | |
| "loss": 0.07488568872213364, | |
| "mean_token_accuracy": 0.9982265532016754, | |
| "num_tokens": 84885749.0, | |
| "step": 528 | |
| }, | |
| { | |
| "aux_loss": 8.024873733520508, | |
| "entropy": 0.03361297491937876, | |
| "epoch": 12.602409638554217, | |
| "grad_norm": 0.3236023187637329, | |
| "learning_rate": 1.3455541713448322e-06, | |
| "loss": 0.07850486040115356, | |
| "mean_token_accuracy": 0.9977066218852997, | |
| "num_tokens": 85038968.0, | |
| "step": 529 | |
| }, | |
| { | |
| "aux_loss": 8.025553226470947, | |
| "entropy": 0.028920285403728485, | |
| "epoch": 12.626506024096386, | |
| "grad_norm": 0.3417403995990753, | |
| "learning_rate": 1.3451711971176868e-06, | |
| "loss": 0.07649402320384979, | |
| "mean_token_accuracy": 0.9976703524589539, | |
| "num_tokens": 85187038.0, | |
| "step": 530 | |
| }, | |
| { | |
| "aux_loss": 8.025936126708984, | |
| "entropy": 0.023510326631367207, | |
| "epoch": 12.650602409638553, | |
| "grad_norm": 0.29556459188461304, | |
| "learning_rate": 1.3447876406895154e-06, | |
| "loss": 0.0748981386423111, | |
| "mean_token_accuracy": 0.9980536699295044, | |
| "num_tokens": 85367566.0, | |
| "step": 531 | |
| }, | |
| { | |
| "aux_loss": 8.023914813995361, | |
| "entropy": 0.0269571915268898, | |
| "epoch": 12.674698795180722, | |
| "grad_norm": 0.32661116123199463, | |
| "learning_rate": 1.3444035029269533e-06, | |
| "loss": 0.07619081437587738, | |
| "mean_token_accuracy": 0.9981045424938202, | |
| "num_tokens": 85530522.0, | |
| "step": 532 | |
| }, | |
| { | |
| "aux_loss": 8.025804996490479, | |
| "entropy": 0.02588724624365568, | |
| "epoch": 12.698795180722891, | |
| "grad_norm": 0.3140789270401001, | |
| "learning_rate": 1.344018784697949e-06, | |
| "loss": 0.0757066011428833, | |
| "mean_token_accuracy": 0.9979479014873505, | |
| "num_tokens": 85691123.0, | |
| "step": 533 | |
| }, | |
| { | |
| "aux_loss": 8.027095317840576, | |
| "entropy": 0.028189819306135178, | |
| "epoch": 12.72289156626506, | |
| "grad_norm": 0.34211185574531555, | |
| "learning_rate": 1.3436334868717626e-06, | |
| "loss": 0.07652498781681061, | |
| "mean_token_accuracy": 0.9978649020195007, | |
| "num_tokens": 85847441.0, | |
| "step": 534 | |
| }, | |
| { | |
| "aux_loss": 8.02366828918457, | |
| "entropy": 0.030385578982532024, | |
| "epoch": 12.74698795180723, | |
| "grad_norm": 0.3527638912200928, | |
| "learning_rate": 1.3432476103189647e-06, | |
| "loss": 0.0774821788072586, | |
| "mean_token_accuracy": 0.9980002343654633, | |
| "num_tokens": 85989139.0, | |
| "step": 535 | |
| }, | |
| { | |
| "aux_loss": 8.026358604431152, | |
| "entropy": 0.024296218529343605, | |
| "epoch": 12.771084337349398, | |
| "grad_norm": 0.3142213225364685, | |
| "learning_rate": 1.3428611559114323e-06, | |
| "loss": 0.07496938109397888, | |
| "mean_token_accuracy": 0.9980889558792114, | |
| "num_tokens": 86151372.0, | |
| "step": 536 | |
| }, | |
| { | |
| "aux_loss": 8.025363445281982, | |
| "entropy": 0.027813317254185677, | |
| "epoch": 12.795180722891565, | |
| "grad_norm": 0.32382503151893616, | |
| "learning_rate": 1.3424741245223487e-06, | |
| "loss": 0.0763462707400322, | |
| "mean_token_accuracy": 0.9977690279483795, | |
| "num_tokens": 86301367.0, | |
| "step": 537 | |
| }, | |
| { | |
| "aux_loss": 8.024674415588379, | |
| "entropy": 0.026332633569836617, | |
| "epoch": 12.819277108433734, | |
| "grad_norm": 0.3284594416618347, | |
| "learning_rate": 1.3420865170262008e-06, | |
| "loss": 0.07633200287818909, | |
| "mean_token_accuracy": 0.9977154731750488, | |
| "num_tokens": 86450704.0, | |
| "step": 538 | |
| }, | |
| { | |
| "aux_loss": 8.024837493896484, | |
| "entropy": 0.026419474743306637, | |
| "epoch": 12.843373493975903, | |
| "grad_norm": 0.3180190920829773, | |
| "learning_rate": 1.3416983342987772e-06, | |
| "loss": 0.07557108998298645, | |
| "mean_token_accuracy": 0.9981383979320526, | |
| "num_tokens": 86603235.0, | |
| "step": 539 | |
| }, | |
| { | |
| "aux_loss": 8.024927616119385, | |
| "entropy": 0.02800104208290577, | |
| "epoch": 12.867469879518072, | |
| "grad_norm": 0.32239335775375366, | |
| "learning_rate": 1.341309577217166e-06, | |
| "loss": 0.07647630572319031, | |
| "mean_token_accuracy": 0.997693806886673, | |
| "num_tokens": 86768482.0, | |
| "step": 540 | |
| }, | |
| { | |
| "aux_loss": 8.024649143218994, | |
| "entropy": 0.02718318998813629, | |
| "epoch": 12.891566265060241, | |
| "grad_norm": 0.3123128116130829, | |
| "learning_rate": 1.3409202466597532e-06, | |
| "loss": 0.07626186311244965, | |
| "mean_token_accuracy": 0.9976713359355927, | |
| "num_tokens": 86941996.0, | |
| "step": 541 | |
| }, | |
| { | |
| "aux_loss": 8.025608539581299, | |
| "entropy": 0.023810462094843388, | |
| "epoch": 12.91566265060241, | |
| "grad_norm": 0.3008756637573242, | |
| "learning_rate": 1.3405303435062207e-06, | |
| "loss": 0.07481741905212402, | |
| "mean_token_accuracy": 0.9984180331230164, | |
| "num_tokens": 87125542.0, | |
| "step": 542 | |
| }, | |
| { | |
| "aux_loss": 8.024901390075684, | |
| "entropy": 0.02601471357047558, | |
| "epoch": 12.939759036144578, | |
| "grad_norm": 0.3155852258205414, | |
| "learning_rate": 1.340139868637544e-06, | |
| "loss": 0.07538659870624542, | |
| "mean_token_accuracy": 0.9985229671001434, | |
| "num_tokens": 87288460.0, | |
| "step": 543 | |
| }, | |
| { | |
| "aux_loss": 8.024972438812256, | |
| "entropy": 0.022537375800311565, | |
| "epoch": 12.963855421686747, | |
| "grad_norm": 0.3109420835971832, | |
| "learning_rate": 1.3397488229359902e-06, | |
| "loss": 0.07500609755516052, | |
| "mean_token_accuracy": 0.9979784190654755, | |
| "num_tokens": 87451648.0, | |
| "step": 544 | |
| }, | |
| { | |
| "aux_loss": 8.025615692138672, | |
| "entropy": 0.025141560472548008, | |
| "epoch": 12.987951807228916, | |
| "grad_norm": 0.3224468529224396, | |
| "learning_rate": 1.3393572072851165e-06, | |
| "loss": 0.0755264014005661, | |
| "mean_token_accuracy": 0.9979694187641144, | |
| "num_tokens": 87594464.0, | |
| "step": 545 | |
| }, | |
| { | |
| "aux_loss": 8.027117729187012, | |
| "entropy": 0.03544420748949051, | |
| "epoch": 13.0, | |
| "grad_norm": 0.41236618161201477, | |
| "learning_rate": 1.338965022569768e-06, | |
| "loss": 0.04544805735349655, | |
| "mean_token_accuracy": 0.9975458383560181, | |
| "num_tokens": 87639019.0, | |
| "step": 546 | |
| }, | |
| { | |
| "aux_loss": 8.024989128112793, | |
| "entropy": 0.026830715127289295, | |
| "epoch": 13.024096385542169, | |
| "grad_norm": 0.2847767472267151, | |
| "learning_rate": 1.3385722696760749e-06, | |
| "loss": 0.0754060372710228, | |
| "mean_token_accuracy": 0.9983295202255249, | |
| "num_tokens": 87805075.0, | |
| "step": 547 | |
| }, | |
| { | |
| "aux_loss": 8.024466037750244, | |
| "entropy": 0.02858618274331093, | |
| "epoch": 13.048192771084338, | |
| "grad_norm": 0.3334623873233795, | |
| "learning_rate": 1.3381789494914518e-06, | |
| "loss": 0.07619360089302063, | |
| "mean_token_accuracy": 0.9982382655143738, | |
| "num_tokens": 87972930.0, | |
| "step": 548 | |
| }, | |
| { | |
| "aux_loss": 8.022853374481201, | |
| "entropy": 0.024458790197968483, | |
| "epoch": 13.072289156626505, | |
| "grad_norm": 0.2856697142124176, | |
| "learning_rate": 1.337785062904595e-06, | |
| "loss": 0.07412649691104889, | |
| "mean_token_accuracy": 0.9987647533416748, | |
| "num_tokens": 88110730.0, | |
| "step": 549 | |
| }, | |
| { | |
| "aux_loss": 8.022730827331543, | |
| "entropy": 0.02606914658099413, | |
| "epoch": 13.096385542168674, | |
| "grad_norm": 0.3089272975921631, | |
| "learning_rate": 1.3373906108054802e-06, | |
| "loss": 0.07486039400100708, | |
| "mean_token_accuracy": 0.9983535408973694, | |
| "num_tokens": 88252615.0, | |
| "step": 550 | |
| }, | |
| { | |
| "aux_loss": 8.026148796081543, | |
| "entropy": 0.02447528950870037, | |
| "epoch": 13.120481927710843, | |
| "grad_norm": 0.2822977900505066, | |
| "learning_rate": 1.3369955940853614e-06, | |
| "loss": 0.07445919513702393, | |
| "mean_token_accuracy": 0.9984354674816132, | |
| "num_tokens": 88410844.0, | |
| "step": 551 | |
| }, | |
| { | |
| "aux_loss": 8.02492618560791, | |
| "entropy": 0.0269709974527359, | |
| "epoch": 13.144578313253012, | |
| "grad_norm": 0.2854020595550537, | |
| "learning_rate": 1.3366000136367682e-06, | |
| "loss": 0.0757034569978714, | |
| "mean_token_accuracy": 0.998249739408493, | |
| "num_tokens": 88564248.0, | |
| "step": 552 | |
| }, | |
| { | |
| "aux_loss": 8.024571895599365, | |
| "entropy": 0.02222419437021017, | |
| "epoch": 13.168674698795181, | |
| "grad_norm": 0.25642162561416626, | |
| "learning_rate": 1.3362038703535036e-06, | |
| "loss": 0.07327268272638321, | |
| "mean_token_accuracy": 0.9988367855548859, | |
| "num_tokens": 88750778.0, | |
| "step": 553 | |
| }, | |
| { | |
| "aux_loss": 8.024845600128174, | |
| "entropy": 0.02474350295960903, | |
| "epoch": 13.19277108433735, | |
| "grad_norm": 0.2963204085826874, | |
| "learning_rate": 1.3358071651306426e-06, | |
| "loss": 0.0745597630739212, | |
| "mean_token_accuracy": 0.9984132945537567, | |
| "num_tokens": 88919735.0, | |
| "step": 554 | |
| }, | |
| { | |
| "aux_loss": 8.02199935913086, | |
| "entropy": 0.02377183921635151, | |
| "epoch": 13.216867469879517, | |
| "grad_norm": 0.2865126132965088, | |
| "learning_rate": 1.3354098988645298e-06, | |
| "loss": 0.07410858571529388, | |
| "mean_token_accuracy": 0.9985485970973969, | |
| "num_tokens": 89098830.0, | |
| "step": 555 | |
| }, | |
| { | |
| "aux_loss": 8.024818897247314, | |
| "entropy": 0.024852984584867954, | |
| "epoch": 13.240963855421686, | |
| "grad_norm": 0.2904917895793915, | |
| "learning_rate": 1.3350120724527771e-06, | |
| "loss": 0.07489709556102753, | |
| "mean_token_accuracy": 0.9982765316963196, | |
| "num_tokens": 89267886.0, | |
| "step": 556 | |
| }, | |
| { | |
| "aux_loss": 8.022951126098633, | |
| "entropy": 0.02369327563792467, | |
| "epoch": 13.265060240963855, | |
| "grad_norm": 0.28303927183151245, | |
| "learning_rate": 1.334613686794263e-06, | |
| "loss": 0.07419449090957642, | |
| "mean_token_accuracy": 0.9987742304801941, | |
| "num_tokens": 89426149.0, | |
| "step": 557 | |
| }, | |
| { | |
| "aux_loss": 8.023364067077637, | |
| "entropy": 0.029238391667604446, | |
| "epoch": 13.289156626506024, | |
| "grad_norm": 0.3138507008552551, | |
| "learning_rate": 1.3342147427891287e-06, | |
| "loss": 0.07640309631824493, | |
| "mean_token_accuracy": 0.9982937872409821, | |
| "num_tokens": 89568963.0, | |
| "step": 558 | |
| }, | |
| { | |
| "aux_loss": 8.02321720123291, | |
| "entropy": 0.022036599926650524, | |
| "epoch": 13.313253012048193, | |
| "grad_norm": 0.30322566628456116, | |
| "learning_rate": 1.3338152413387773e-06, | |
| "loss": 0.0736384466290474, | |
| "mean_token_accuracy": 0.9985252618789673, | |
| "num_tokens": 89717439.0, | |
| "step": 559 | |
| }, | |
| { | |
| "aux_loss": 8.024878978729248, | |
| "entropy": 0.02454978320747614, | |
| "epoch": 13.337349397590362, | |
| "grad_norm": 0.31352540850639343, | |
| "learning_rate": 1.3334151833458714e-06, | |
| "loss": 0.07487867027521133, | |
| "mean_token_accuracy": 0.9984146058559418, | |
| "num_tokens": 89872747.0, | |
| "step": 560 | |
| }, | |
| { | |
| "aux_loss": 8.022562980651855, | |
| "entropy": 0.02784901112318039, | |
| "epoch": 13.36144578313253, | |
| "grad_norm": 0.31067028641700745, | |
| "learning_rate": 1.3330145697143313e-06, | |
| "loss": 0.0768236368894577, | |
| "mean_token_accuracy": 0.9979459643363953, | |
| "num_tokens": 90034928.0, | |
| "step": 561 | |
| }, | |
| { | |
| "aux_loss": 8.023937225341797, | |
| "entropy": 0.027477607131004333, | |
| "epoch": 13.385542168674698, | |
| "grad_norm": 0.30565252900123596, | |
| "learning_rate": 1.332613401349332e-06, | |
| "loss": 0.07601162046194077, | |
| "mean_token_accuracy": 0.9979828000068665, | |
| "num_tokens": 90191929.0, | |
| "step": 562 | |
| }, | |
| { | |
| "aux_loss": 8.022271633148193, | |
| "entropy": 0.026144892908632755, | |
| "epoch": 13.409638554216867, | |
| "grad_norm": 0.35552600026130676, | |
| "learning_rate": 1.3322116791573032e-06, | |
| "loss": 0.07517768442630768, | |
| "mean_token_accuracy": 0.9982477128505707, | |
| "num_tokens": 90351024.0, | |
| "step": 563 | |
| }, | |
| { | |
| "aux_loss": 8.02480411529541, | |
| "entropy": 0.022527651861310005, | |
| "epoch": 13.433734939759036, | |
| "grad_norm": 0.2768544852733612, | |
| "learning_rate": 1.3318094040459246e-06, | |
| "loss": 0.07377660274505615, | |
| "mean_token_accuracy": 0.9984523952007294, | |
| "num_tokens": 90542541.0, | |
| "step": 564 | |
| }, | |
| { | |
| "aux_loss": 8.024526596069336, | |
| "entropy": 0.022174563258886337, | |
| "epoch": 13.457831325301205, | |
| "grad_norm": 0.31696975231170654, | |
| "learning_rate": 1.331406576924126e-06, | |
| "loss": 0.07396799325942993, | |
| "mean_token_accuracy": 0.9982556402683258, | |
| "num_tokens": 90715821.0, | |
| "step": 565 | |
| }, | |
| { | |
| "aux_loss": 8.024879932403564, | |
| "entropy": 0.025845030322670937, | |
| "epoch": 13.481927710843374, | |
| "grad_norm": 0.322178453207016, | |
| "learning_rate": 1.3310031987020846e-06, | |
| "loss": 0.0750863328576088, | |
| "mean_token_accuracy": 0.9982399642467499, | |
| "num_tokens": 90858351.0, | |
| "step": 566 | |
| }, | |
| { | |
| "aux_loss": 8.024662017822266, | |
| "entropy": 0.025781244970858097, | |
| "epoch": 13.506024096385541, | |
| "grad_norm": 0.3323957622051239, | |
| "learning_rate": 1.3305992702912221e-06, | |
| "loss": 0.07543926686048508, | |
| "mean_token_accuracy": 0.9979799687862396, | |
| "num_tokens": 91020129.0, | |
| "step": 567 | |
| }, | |
| { | |
| "aux_loss": 8.024908542633057, | |
| "entropy": 0.028576262295246124, | |
| "epoch": 13.53012048192771, | |
| "grad_norm": 0.3114175498485565, | |
| "learning_rate": 1.3301947926042036e-06, | |
| "loss": 0.07623940706253052, | |
| "mean_token_accuracy": 0.9981194138526917, | |
| "num_tokens": 91178730.0, | |
| "step": 568 | |
| }, | |
| { | |
| "aux_loss": 8.024174690246582, | |
| "entropy": 0.027286341413855553, | |
| "epoch": 13.55421686746988, | |
| "grad_norm": 0.2996421456336975, | |
| "learning_rate": 1.3297897665549356e-06, | |
| "loss": 0.0759400948882103, | |
| "mean_token_accuracy": 0.9981012940406799, | |
| "num_tokens": 91338932.0, | |
| "step": 569 | |
| }, | |
| { | |
| "aux_loss": 8.024128913879395, | |
| "entropy": 0.027576555497944355, | |
| "epoch": 13.578313253012048, | |
| "grad_norm": 0.3370552659034729, | |
| "learning_rate": 1.3293841930585635e-06, | |
| "loss": 0.07610613107681274, | |
| "mean_token_accuracy": 0.9980021715164185, | |
| "num_tokens": 91475686.0, | |
| "step": 570 | |
| }, | |
| { | |
| "aux_loss": 8.023448944091797, | |
| "entropy": 0.02724074013531208, | |
| "epoch": 13.602409638554217, | |
| "grad_norm": 0.2822796702384949, | |
| "learning_rate": 1.3289780730314693e-06, | |
| "loss": 0.07561826705932617, | |
| "mean_token_accuracy": 0.9980600476264954, | |
| "num_tokens": 91659137.0, | |
| "step": 571 | |
| }, | |
| { | |
| "aux_loss": 8.024022102355957, | |
| "entropy": 0.02411498688161373, | |
| "epoch": 13.626506024096386, | |
| "grad_norm": 0.32041260600090027, | |
| "learning_rate": 1.32857140739127e-06, | |
| "loss": 0.0743638202548027, | |
| "mean_token_accuracy": 0.9982563257217407, | |
| "num_tokens": 91827455.0, | |
| "step": 572 | |
| }, | |
| { | |
| "aux_loss": 8.022703170776367, | |
| "entropy": 0.025913319550454617, | |
| "epoch": 13.650602409638553, | |
| "grad_norm": 0.31268373131752014, | |
| "learning_rate": 1.328164197056816e-06, | |
| "loss": 0.0751735046505928, | |
| "mean_token_accuracy": 0.9982975423336029, | |
| "num_tokens": 92003658.0, | |
| "step": 573 | |
| }, | |
| { | |
| "aux_loss": 8.02454948425293, | |
| "entropy": 0.02658990491181612, | |
| "epoch": 13.674698795180722, | |
| "grad_norm": 0.31806057691574097, | |
| "learning_rate": 1.3277564429481873e-06, | |
| "loss": 0.07578857988119125, | |
| "mean_token_accuracy": 0.9981650710105896, | |
| "num_tokens": 92157556.0, | |
| "step": 574 | |
| }, | |
| { | |
| "aux_loss": 8.02476167678833, | |
| "entropy": 0.023106982000172138, | |
| "epoch": 13.698795180722891, | |
| "grad_norm": 0.30248817801475525, | |
| "learning_rate": 1.3273481459866937e-06, | |
| "loss": 0.07406168431043625, | |
| "mean_token_accuracy": 0.9986033737659454, | |
| "num_tokens": 92330208.0, | |
| "step": 575 | |
| }, | |
| { | |
| "aux_loss": 8.025537967681885, | |
| "entropy": 0.025431593880057335, | |
| "epoch": 13.72289156626506, | |
| "grad_norm": 0.29318559169769287, | |
| "learning_rate": 1.3269393070948708e-06, | |
| "loss": 0.07514628767967224, | |
| "mean_token_accuracy": 0.9983897507190704, | |
| "num_tokens": 92504619.0, | |
| "step": 576 | |
| }, | |
| { | |
| "aux_loss": 8.02451229095459, | |
| "entropy": 0.024779404513537884, | |
| "epoch": 13.74698795180723, | |
| "grad_norm": 0.30274254083633423, | |
| "learning_rate": 1.3265299271964786e-06, | |
| "loss": 0.0745309591293335, | |
| "mean_token_accuracy": 0.9984515011310577, | |
| "num_tokens": 92658774.0, | |
| "step": 577 | |
| }, | |
| { | |
| "aux_loss": 8.025212287902832, | |
| "entropy": 0.02221023663878441, | |
| "epoch": 13.771084337349398, | |
| "grad_norm": 0.2912888824939728, | |
| "learning_rate": 1.3261200072165e-06, | |
| "loss": 0.0740441381931305, | |
| "mean_token_accuracy": 0.9983481764793396, | |
| "num_tokens": 92848734.0, | |
| "step": 578 | |
| }, | |
| { | |
| "aux_loss": 8.02445650100708, | |
| "entropy": 0.023341810330748558, | |
| "epoch": 13.795180722891565, | |
| "grad_norm": 0.31299862265586853, | |
| "learning_rate": 1.3257095480811385e-06, | |
| "loss": 0.07490390539169312, | |
| "mean_token_accuracy": 0.9981822967529297, | |
| "num_tokens": 93035663.0, | |
| "step": 579 | |
| }, | |
| { | |
| "aux_loss": 8.0231294631958, | |
| "entropy": 0.02731005661189556, | |
| "epoch": 13.819277108433734, | |
| "grad_norm": 0.31801944971084595, | |
| "learning_rate": 1.3252985507178148e-06, | |
| "loss": 0.07540342211723328, | |
| "mean_token_accuracy": 0.9984270334243774, | |
| "num_tokens": 93190212.0, | |
| "step": 580 | |
| }, | |
| { | |
| "aux_loss": 8.022398948669434, | |
| "entropy": 0.026008632965385914, | |
| "epoch": 13.843373493975903, | |
| "grad_norm": 0.33179038763046265, | |
| "learning_rate": 1.324887016055166e-06, | |
| "loss": 0.07522394508123398, | |
| "mean_token_accuracy": 0.9983549416065216, | |
| "num_tokens": 93341246.0, | |
| "step": 581 | |
| }, | |
| { | |
| "aux_loss": 8.023831844329834, | |
| "entropy": 0.029645448550581932, | |
| "epoch": 13.867469879518072, | |
| "grad_norm": 0.3618362247943878, | |
| "learning_rate": 1.3244749450230438e-06, | |
| "loss": 0.0771031528711319, | |
| "mean_token_accuracy": 0.9976988434791565, | |
| "num_tokens": 93485629.0, | |
| "step": 582 | |
| }, | |
| { | |
| "aux_loss": 8.022218704223633, | |
| "entropy": 0.02165289968252182, | |
| "epoch": 13.891566265060241, | |
| "grad_norm": 0.27375370264053345, | |
| "learning_rate": 1.324062338552511e-06, | |
| "loss": 0.07368101179599762, | |
| "mean_token_accuracy": 0.9984147846698761, | |
| "num_tokens": 93662529.0, | |
| "step": 583 | |
| }, | |
| { | |
| "aux_loss": 8.024479866027832, | |
| "entropy": 0.02351562399417162, | |
| "epoch": 13.91566265060241, | |
| "grad_norm": 0.30303192138671875, | |
| "learning_rate": 1.3236491975758413e-06, | |
| "loss": 0.07437251508235931, | |
| "mean_token_accuracy": 0.9984338581562042, | |
| "num_tokens": 93848011.0, | |
| "step": 584 | |
| }, | |
| { | |
| "aux_loss": 8.022239208221436, | |
| "entropy": 0.02414259221404791, | |
| "epoch": 13.939759036144578, | |
| "grad_norm": 0.2712882161140442, | |
| "learning_rate": 1.3232355230265152e-06, | |
| "loss": 0.07462576031684875, | |
| "mean_token_accuracy": 0.9984138906002045, | |
| "num_tokens": 94023181.0, | |
| "step": 585 | |
| }, | |
| { | |
| "aux_loss": 8.02386999130249, | |
| "entropy": 0.023252902552485466, | |
| "epoch": 13.963855421686747, | |
| "grad_norm": 0.32376915216445923, | |
| "learning_rate": 1.3228213158392188e-06, | |
| "loss": 0.07477660477161407, | |
| "mean_token_accuracy": 0.9978744983673096, | |
| "num_tokens": 94188080.0, | |
| "step": 586 | |
| }, | |
| { | |
| "aux_loss": 8.021694660186768, | |
| "entropy": 0.028471998870372772, | |
| "epoch": 13.987951807228916, | |
| "grad_norm": 0.3617095947265625, | |
| "learning_rate": 1.322406576949842e-06, | |
| "loss": 0.07622809708118439, | |
| "mean_token_accuracy": 0.9979861080646515, | |
| "num_tokens": 94332756.0, | |
| "step": 587 | |
| }, | |
| { | |
| "aux_loss": 8.022180557250977, | |
| "entropy": 0.023031173273921013, | |
| "epoch": 14.0, | |
| "grad_norm": 0.39885711669921875, | |
| "learning_rate": 1.3219913072954761e-06, | |
| "loss": 0.04186277836561203, | |
| "mean_token_accuracy": 0.9979294538497925, | |
| "num_tokens": 94380482.0, | |
| "step": 588 | |
| }, | |
| { | |
| "aux_loss": 8.024760246276855, | |
| "entropy": 0.02022178377956152, | |
| "epoch": 14.024096385542169, | |
| "grad_norm": 0.2387811690568924, | |
| "learning_rate": 1.3215755078144116e-06, | |
| "loss": 0.07233056426048279, | |
| "mean_token_accuracy": 0.9986909627914429, | |
| "num_tokens": 94562098.0, | |
| "step": 589 | |
| }, | |
| { | |
| "aux_loss": 8.022474765777588, | |
| "entropy": 0.023938612081110477, | |
| "epoch": 14.048192771084338, | |
| "grad_norm": 0.27819156646728516, | |
| "learning_rate": 1.3211591794461356e-06, | |
| "loss": 0.07419903576374054, | |
| "mean_token_accuracy": 0.9986561834812164, | |
| "num_tokens": 94718632.0, | |
| "step": 590 | |
| }, | |
| { | |
| "aux_loss": 8.024396419525146, | |
| "entropy": 0.023845979012548923, | |
| "epoch": 14.072289156626505, | |
| "grad_norm": 0.2741614282131195, | |
| "learning_rate": 1.3207423231313312e-06, | |
| "loss": 0.07409413903951645, | |
| "mean_token_accuracy": 0.9986681938171387, | |
| "num_tokens": 94891903.0, | |
| "step": 591 | |
| }, | |
| { | |
| "aux_loss": 8.024489402770996, | |
| "entropy": 0.02289368212223053, | |
| "epoch": 14.096385542168674, | |
| "grad_norm": 0.2634838819503784, | |
| "learning_rate": 1.3203249398118737e-06, | |
| "loss": 0.07382728904485703, | |
| "mean_token_accuracy": 0.9985337257385254, | |
| "num_tokens": 95061769.0, | |
| "step": 592 | |
| }, | |
| { | |
| "aux_loss": 8.023909568786621, | |
| "entropy": 0.023399224504828453, | |
| "epoch": 14.120481927710843, | |
| "grad_norm": 0.25872477889060974, | |
| "learning_rate": 1.319907030430829e-06, | |
| "loss": 0.07436823844909668, | |
| "mean_token_accuracy": 0.9986319541931152, | |
| "num_tokens": 95226736.0, | |
| "step": 593 | |
| }, | |
| { | |
| "aux_loss": 8.021496295928955, | |
| "entropy": 0.023850570432841778, | |
| "epoch": 14.144578313253012, | |
| "grad_norm": 0.3044877350330353, | |
| "learning_rate": 1.3194885959324523e-06, | |
| "loss": 0.07421186566352844, | |
| "mean_token_accuracy": 0.998362272977829, | |
| "num_tokens": 95377366.0, | |
| "step": 594 | |
| }, | |
| { | |
| "aux_loss": 8.021922588348389, | |
| "entropy": 0.024413741193711758, | |
| "epoch": 14.168674698795181, | |
| "grad_norm": 0.28136560320854187, | |
| "learning_rate": 1.3190696372621847e-06, | |
| "loss": 0.07438543438911438, | |
| "mean_token_accuracy": 0.9987072944641113, | |
| "num_tokens": 95534946.0, | |
| "step": 595 | |
| }, | |
| { | |
| "aux_loss": 8.022111892700195, | |
| "entropy": 0.024447415955364704, | |
| "epoch": 14.19277108433735, | |
| "grad_norm": 0.2626717984676361, | |
| "learning_rate": 1.318650155366652e-06, | |
| "loss": 0.07457850873470306, | |
| "mean_token_accuracy": 0.9984690248966217, | |
| "num_tokens": 95697094.0, | |
| "step": 596 | |
| }, | |
| { | |
| "aux_loss": 8.023127555847168, | |
| "entropy": 0.024961436167359352, | |
| "epoch": 14.216867469879517, | |
| "grad_norm": 0.27824899554252625, | |
| "learning_rate": 1.3182301511936622e-06, | |
| "loss": 0.07419399917125702, | |
| "mean_token_accuracy": 0.9986103475093842, | |
| "num_tokens": 95853061.0, | |
| "step": 597 | |
| }, | |
| { | |
| "aux_loss": 8.024140357971191, | |
| "entropy": 0.026958868838846684, | |
| "epoch": 14.240963855421686, | |
| "grad_norm": 0.3049028217792511, | |
| "learning_rate": 1.317809625692203e-06, | |
| "loss": 0.07510385662317276, | |
| "mean_token_accuracy": 0.9983646869659424, | |
| "num_tokens": 96017500.0, | |
| "step": 598 | |
| }, | |
| { | |
| "aux_loss": 8.02279281616211, | |
| "entropy": 0.024663295596837997, | |
| "epoch": 14.265060240963855, | |
| "grad_norm": 0.30349597334861755, | |
| "learning_rate": 1.3173885798124402e-06, | |
| "loss": 0.07457980513572693, | |
| "mean_token_accuracy": 0.9985092580318451, | |
| "num_tokens": 96175235.0, | |
| "step": 599 | |
| }, | |
| { | |
| "aux_loss": 8.022304058074951, | |
| "entropy": 0.02379010058939457, | |
| "epoch": 14.289156626506024, | |
| "grad_norm": 0.26444587111473083, | |
| "learning_rate": 1.3169670145057156e-06, | |
| "loss": 0.07390819489955902, | |
| "mean_token_accuracy": 0.9986671507358551, | |
| "num_tokens": 96344090.0, | |
| "step": 600 | |
| }, | |
| { | |
| "aux_loss": 8.022550582885742, | |
| "entropy": 0.02393107209354639, | |
| "epoch": 14.313253012048193, | |
| "grad_norm": 0.28396496176719666, | |
| "learning_rate": 1.3165449307245445e-06, | |
| "loss": 0.07395670562982559, | |
| "mean_token_accuracy": 0.9986652135848999, | |
| "num_tokens": 96525865.0, | |
| "step": 601 | |
| }, | |
| { | |
| "aux_loss": 8.023728370666504, | |
| "entropy": 0.028622742742300034, | |
| "epoch": 14.337349397590362, | |
| "grad_norm": 0.3755778670310974, | |
| "learning_rate": 1.3161223294226135e-06, | |
| "loss": 0.07638661563396454, | |
| "mean_token_accuracy": 0.9980232417583466, | |
| "num_tokens": 96662516.0, | |
| "step": 602 | |
| }, | |
| { | |
| "aux_loss": 8.023515701293945, | |
| "entropy": 0.02594769559800625, | |
| "epoch": 14.36144578313253, | |
| "grad_norm": 0.30059191584587097, | |
| "learning_rate": 1.3156992115547792e-06, | |
| "loss": 0.07463668286800385, | |
| "mean_token_accuracy": 0.9986335933208466, | |
| "num_tokens": 96828809.0, | |
| "step": 603 | |
| }, | |
| { | |
| "aux_loss": 8.022513389587402, | |
| "entropy": 0.028040869161486626, | |
| "epoch": 14.385542168674698, | |
| "grad_norm": 0.3215217590332031, | |
| "learning_rate": 1.3152755780770644e-06, | |
| "loss": 0.07540538161993027, | |
| "mean_token_accuracy": 0.9985578954219818, | |
| "num_tokens": 96970896.0, | |
| "step": 604 | |
| }, | |
| { | |
| "aux_loss": 8.02444839477539, | |
| "entropy": 0.026185978204011917, | |
| "epoch": 14.409638554216867, | |
| "grad_norm": 0.32708242535591125, | |
| "learning_rate": 1.3148514299466574e-06, | |
| "loss": 0.07525956630706787, | |
| "mean_token_accuracy": 0.9983802437782288, | |
| "num_tokens": 97128433.0, | |
| "step": 605 | |
| }, | |
| { | |
| "aux_loss": 8.022536277770996, | |
| "entropy": 0.023743015713989735, | |
| "epoch": 14.433734939759036, | |
| "grad_norm": 0.2937101125717163, | |
| "learning_rate": 1.3144267681219092e-06, | |
| "loss": 0.07399174571037292, | |
| "mean_token_accuracy": 0.9986098110675812, | |
| "num_tokens": 97279348.0, | |
| "step": 606 | |
| }, | |
| { | |
| "aux_loss": 8.022383689880371, | |
| "entropy": 0.026632227934896946, | |
| "epoch": 14.457831325301205, | |
| "grad_norm": 0.30835458636283875, | |
| "learning_rate": 1.3140015935623318e-06, | |
| "loss": 0.07527077198028564, | |
| "mean_token_accuracy": 0.9982325434684753, | |
| "num_tokens": 97444407.0, | |
| "step": 607 | |
| }, | |
| { | |
| "aux_loss": 8.02312183380127, | |
| "entropy": 0.024252044036984444, | |
| "epoch": 14.481927710843374, | |
| "grad_norm": 0.29159989953041077, | |
| "learning_rate": 1.3135759072285955e-06, | |
| "loss": 0.07456320524215698, | |
| "mean_token_accuracy": 0.9984078705310822, | |
| "num_tokens": 97624818.0, | |
| "step": 608 | |
| }, | |
| { | |
| "aux_loss": 8.022176265716553, | |
| "entropy": 0.025633632205426693, | |
| "epoch": 14.506024096385541, | |
| "grad_norm": 0.2863618731498718, | |
| "learning_rate": 1.313149710082527e-06, | |
| "loss": 0.07489114999771118, | |
| "mean_token_accuracy": 0.9985541701316833, | |
| "num_tokens": 97788363.0, | |
| "step": 609 | |
| }, | |
| { | |
| "aux_loss": 8.022820949554443, | |
| "entropy": 0.021122743375599384, | |
| "epoch": 14.53012048192771, | |
| "grad_norm": 0.26490604877471924, | |
| "learning_rate": 1.3127230030871068e-06, | |
| "loss": 0.07331493496894836, | |
| "mean_token_accuracy": 0.9985091984272003, | |
| "num_tokens": 97974372.0, | |
| "step": 610 | |
| }, | |
| { | |
| "aux_loss": 8.022090911865234, | |
| "entropy": 0.025382555089890957, | |
| "epoch": 14.55421686746988, | |
| "grad_norm": 0.2946323752403259, | |
| "learning_rate": 1.3122957872064679e-06, | |
| "loss": 0.07488776743412018, | |
| "mean_token_accuracy": 0.9984503984451294, | |
| "num_tokens": 98146312.0, | |
| "step": 611 | |
| }, | |
| { | |
| "aux_loss": 8.0248384475708, | |
| "entropy": 0.023470413871109486, | |
| "epoch": 14.578313253012048, | |
| "grad_norm": 0.28668469190597534, | |
| "learning_rate": 1.3118680634058929e-06, | |
| "loss": 0.0739784687757492, | |
| "mean_token_accuracy": 0.9984510242938995, | |
| "num_tokens": 98322279.0, | |
| "step": 612 | |
| }, | |
| { | |
| "aux_loss": 8.021702289581299, | |
| "entropy": 0.021302196197211742, | |
| "epoch": 14.602409638554217, | |
| "grad_norm": 0.27184075117111206, | |
| "learning_rate": 1.3114398326518119e-06, | |
| "loss": 0.07294765114784241, | |
| "mean_token_accuracy": 0.9986790120601654, | |
| "num_tokens": 98495941.0, | |
| "step": 613 | |
| }, | |
| { | |
| "aux_loss": 8.021376609802246, | |
| "entropy": 0.02515318524092436, | |
| "epoch": 14.626506024096386, | |
| "grad_norm": 0.36623698472976685, | |
| "learning_rate": 1.3110110959118008e-06, | |
| "loss": 0.07469873130321503, | |
| "mean_token_accuracy": 0.9984108209609985, | |
| "num_tokens": 98649028.0, | |
| "step": 614 | |
| }, | |
| { | |
| "aux_loss": 8.022244453430176, | |
| "entropy": 0.022386303171515465, | |
| "epoch": 14.650602409638553, | |
| "grad_norm": 0.30380144715309143, | |
| "learning_rate": 1.3105818541545785e-06, | |
| "loss": 0.07382786273956299, | |
| "mean_token_accuracy": 0.9984555244445801, | |
| "num_tokens": 98820655.0, | |
| "step": 615 | |
| }, | |
| { | |
| "aux_loss": 8.022692680358887, | |
| "entropy": 0.024392325431108475, | |
| "epoch": 14.674698795180722, | |
| "grad_norm": 0.32163384556770325, | |
| "learning_rate": 1.3101521083500047e-06, | |
| "loss": 0.07459438592195511, | |
| "mean_token_accuracy": 0.9981200695037842, | |
| "num_tokens": 98985094.0, | |
| "step": 616 | |
| }, | |
| { | |
| "aux_loss": 8.022065162658691, | |
| "entropy": 0.026209702715277672, | |
| "epoch": 14.698795180722891, | |
| "grad_norm": 0.3077583611011505, | |
| "learning_rate": 1.3097218594690787e-06, | |
| "loss": 0.07581385970115662, | |
| "mean_token_accuracy": 0.9981196522712708, | |
| "num_tokens": 99142817.0, | |
| "step": 617 | |
| }, | |
| { | |
| "aux_loss": 8.02006721496582, | |
| "entropy": 0.023902803659439087, | |
| "epoch": 14.72289156626506, | |
| "grad_norm": 0.28286728262901306, | |
| "learning_rate": 1.309291108483936e-06, | |
| "loss": 0.07453930377960205, | |
| "mean_token_accuracy": 0.9983839690685272, | |
| "num_tokens": 99283960.0, | |
| "step": 618 | |
| }, | |
| { | |
| "aux_loss": 8.02124834060669, | |
| "entropy": 0.024052273482084274, | |
| "epoch": 14.74698795180723, | |
| "grad_norm": 0.2964589595794678, | |
| "learning_rate": 1.3088598563678464e-06, | |
| "loss": 0.07424813508987427, | |
| "mean_token_accuracy": 0.9983850717544556, | |
| "num_tokens": 99428973.0, | |
| "step": 619 | |
| }, | |
| { | |
| "aux_loss": 8.022575378417969, | |
| "entropy": 0.021747206337749958, | |
| "epoch": 14.771084337349398, | |
| "grad_norm": 0.3091699779033661, | |
| "learning_rate": 1.3084281040952126e-06, | |
| "loss": 0.07359092682600021, | |
| "mean_token_accuracy": 0.9985521137714386, | |
| "num_tokens": 99599548.0, | |
| "step": 620 | |
| }, | |
| { | |
| "aux_loss": 8.022809505462646, | |
| "entropy": 0.021415174938738346, | |
| "epoch": 14.795180722891565, | |
| "grad_norm": 0.2741931974887848, | |
| "learning_rate": 1.307995852641567e-06, | |
| "loss": 0.07326743006706238, | |
| "mean_token_accuracy": 0.9985740482807159, | |
| "num_tokens": 99761944.0, | |
| "step": 621 | |
| }, | |
| { | |
| "aux_loss": 8.021624088287354, | |
| "entropy": 0.02542014978826046, | |
| "epoch": 14.819277108433734, | |
| "grad_norm": 0.3038715124130249, | |
| "learning_rate": 1.3075631029835698e-06, | |
| "loss": 0.07464160025119781, | |
| "mean_token_accuracy": 0.9984971880912781, | |
| "num_tokens": 99920090.0, | |
| "step": 622 | |
| }, | |
| { | |
| "aux_loss": 8.021050453186035, | |
| "entropy": 0.02499569673091173, | |
| "epoch": 14.843373493975903, | |
| "grad_norm": 0.2812490463256836, | |
| "learning_rate": 1.307129856099007e-06, | |
| "loss": 0.07466801255941391, | |
| "mean_token_accuracy": 0.9985790550708771, | |
| "num_tokens": 100086789.0, | |
| "step": 623 | |
| }, | |
| { | |
| "aux_loss": 8.021025657653809, | |
| "entropy": 0.026820295490324497, | |
| "epoch": 14.867469879518072, | |
| "grad_norm": 0.3224012851715088, | |
| "learning_rate": 1.3066961129667884e-06, | |
| "loss": 0.07568350434303284, | |
| "mean_token_accuracy": 0.9980534017086029, | |
| "num_tokens": 100240901.0, | |
| "step": 624 | |
| }, | |
| { | |
| "aux_loss": 8.021604537963867, | |
| "entropy": 0.02594233863055706, | |
| "epoch": 14.891566265060241, | |
| "grad_norm": 0.3286438286304474, | |
| "learning_rate": 1.3062618745669444e-06, | |
| "loss": 0.07503099739551544, | |
| "mean_token_accuracy": 0.9982061386108398, | |
| "num_tokens": 100397675.0, | |
| "step": 625 | |
| }, | |
| { | |
| "aux_loss": 8.021660804748535, | |
| "entropy": 0.02323277574032545, | |
| "epoch": 14.91566265060241, | |
| "grad_norm": 0.2902336120605469, | |
| "learning_rate": 1.305827141880625e-06, | |
| "loss": 0.07387363910675049, | |
| "mean_token_accuracy": 0.998563826084137, | |
| "num_tokens": 100571805.0, | |
| "step": 626 | |
| }, | |
| { | |
| "aux_loss": 8.023479461669922, | |
| "entropy": 0.02272103913128376, | |
| "epoch": 14.939759036144578, | |
| "grad_norm": 0.2875194847583771, | |
| "learning_rate": 1.3053919158900968e-06, | |
| "loss": 0.07392413914203644, | |
| "mean_token_accuracy": 0.9985417127609253, | |
| "num_tokens": 100749220.0, | |
| "step": 627 | |
| }, | |
| { | |
| "aux_loss": 8.021773338317871, | |
| "entropy": 0.024398663081228733, | |
| "epoch": 14.963855421686747, | |
| "grad_norm": 0.3021429777145386, | |
| "learning_rate": 1.3049561975787408e-06, | |
| "loss": 0.07461895793676376, | |
| "mean_token_accuracy": 0.998176246881485, | |
| "num_tokens": 100909579.0, | |
| "step": 628 | |
| }, | |
| { | |
| "aux_loss": 8.021002292633057, | |
| "entropy": 0.023792341351509094, | |
| "epoch": 14.987951807228916, | |
| "grad_norm": 0.3388311266899109, | |
| "learning_rate": 1.304519987931051e-06, | |
| "loss": 0.07436676323413849, | |
| "mean_token_accuracy": 0.9982630014419556, | |
| "num_tokens": 101073627.0, | |
| "step": 629 | |
| }, | |
| { | |
| "aux_loss": 8.0238037109375, | |
| "entropy": 0.01941307634115219, | |
| "epoch": 15.0, | |
| "grad_norm": 0.39163467288017273, | |
| "learning_rate": 1.3040832879326307e-06, | |
| "loss": 0.04034464806318283, | |
| "mean_token_accuracy": 0.9982436895370483, | |
| "num_tokens": 101121945.0, | |
| "step": 630 | |
| }, | |
| { | |
| "aux_loss": 8.020874977111816, | |
| "entropy": 0.030838350765407085, | |
| "epoch": 15.024096385542169, | |
| "grad_norm": 0.31362706422805786, | |
| "learning_rate": 1.3036460985701921e-06, | |
| "loss": 0.07680098712444305, | |
| "mean_token_accuracy": 0.9982480704784393, | |
| "num_tokens": 101249459.0, | |
| "step": 631 | |
| }, | |
| { | |
| "aux_loss": 8.02276611328125, | |
| "entropy": 0.02502510603517294, | |
| "epoch": 15.048192771084338, | |
| "grad_norm": 0.27360862493515015, | |
| "learning_rate": 1.3032084208315525e-06, | |
| "loss": 0.07409708201885223, | |
| "mean_token_accuracy": 0.9989785850048065, | |
| "num_tokens": 101401821.0, | |
| "step": 632 | |
| }, | |
| { | |
| "aux_loss": 8.021870136260986, | |
| "entropy": 0.021272542886435986, | |
| "epoch": 15.072289156626505, | |
| "grad_norm": 0.25828370451927185, | |
| "learning_rate": 1.3027702557056325e-06, | |
| "loss": 0.07290402054786682, | |
| "mean_token_accuracy": 0.9988965690135956, | |
| "num_tokens": 101579104.0, | |
| "step": 633 | |
| }, | |
| { | |
| "aux_loss": 8.020940780639648, | |
| "entropy": 0.020017596893012524, | |
| "epoch": 15.096385542168674, | |
| "grad_norm": 0.2512258291244507, | |
| "learning_rate": 1.3023316041824544e-06, | |
| "loss": 0.07227890193462372, | |
| "mean_token_accuracy": 0.999037891626358, | |
| "num_tokens": 101745475.0, | |
| "step": 634 | |
| }, | |
| { | |
| "aux_loss": 8.021780967712402, | |
| "entropy": 0.02389626670628786, | |
| "epoch": 15.120481927710843, | |
| "grad_norm": 0.27933046221733093, | |
| "learning_rate": 1.3018924672531393e-06, | |
| "loss": 0.07385027408599854, | |
| "mean_token_accuracy": 0.9987798929214478, | |
| "num_tokens": 101904997.0, | |
| "step": 635 | |
| }, | |
| { | |
| "aux_loss": 8.022858142852783, | |
| "entropy": 0.022255877032876015, | |
| "epoch": 15.144578313253012, | |
| "grad_norm": 0.2804347276687622, | |
| "learning_rate": 1.3014528459099053e-06, | |
| "loss": 0.07336017489433289, | |
| "mean_token_accuracy": 0.998691588640213, | |
| "num_tokens": 102072594.0, | |
| "step": 636 | |
| }, | |
| { | |
| "aux_loss": 8.019988059997559, | |
| "entropy": 0.02136957924813032, | |
| "epoch": 15.168674698795181, | |
| "grad_norm": 0.2652220129966736, | |
| "learning_rate": 1.3010127411460643e-06, | |
| "loss": 0.07301878929138184, | |
| "mean_token_accuracy": 0.9986830353736877, | |
| "num_tokens": 102237845.0, | |
| "step": 637 | |
| }, | |
| { | |
| "aux_loss": 8.020222663879395, | |
| "entropy": 0.023709292523562908, | |
| "epoch": 15.19277108433735, | |
| "grad_norm": 0.37665247917175293, | |
| "learning_rate": 1.3005721539560217e-06, | |
| "loss": 0.07381770014762878, | |
| "mean_token_accuracy": 0.9986214935779572, | |
| "num_tokens": 102402057.0, | |
| "step": 638 | |
| }, | |
| { | |
| "aux_loss": 8.022130966186523, | |
| "entropy": 0.02243464346975088, | |
| "epoch": 15.216867469879517, | |
| "grad_norm": 0.2828420102596283, | |
| "learning_rate": 1.3001310853352716e-06, | |
| "loss": 0.0734640508890152, | |
| "mean_token_accuracy": 0.9986587762832642, | |
| "num_tokens": 102569638.0, | |
| "step": 639 | |
| }, | |
| { | |
| "aux_loss": 8.023382663726807, | |
| "entropy": 0.023820437490940094, | |
| "epoch": 15.240963855421686, | |
| "grad_norm": 0.27643638849258423, | |
| "learning_rate": 1.2996895362803967e-06, | |
| "loss": 0.07373812049627304, | |
| "mean_token_accuracy": 0.9989169836044312, | |
| "num_tokens": 102738864.0, | |
| "step": 640 | |
| }, | |
| { | |
| "aux_loss": 8.021101951599121, | |
| "entropy": 0.02268280368298292, | |
| "epoch": 15.265060240963855, | |
| "grad_norm": 0.27888503670692444, | |
| "learning_rate": 1.299247507789065e-06, | |
| "loss": 0.07356101274490356, | |
| "mean_token_accuracy": 0.9985786378383636, | |
| "num_tokens": 102903859.0, | |
| "step": 641 | |
| }, | |
| { | |
| "aux_loss": 8.02034854888916, | |
| "entropy": 0.023311128839850426, | |
| "epoch": 15.289156626506024, | |
| "grad_norm": 0.30982568860054016, | |
| "learning_rate": 1.2988050008600278e-06, | |
| "loss": 0.0734785720705986, | |
| "mean_token_accuracy": 0.9988106191158295, | |
| "num_tokens": 103069388.0, | |
| "step": 642 | |
| }, | |
| { | |
| "aux_loss": 8.020792484283447, | |
| "entropy": 0.025052642449736595, | |
| "epoch": 15.313253012048193, | |
| "grad_norm": 0.3088907301425934, | |
| "learning_rate": 1.2983620164931176e-06, | |
| "loss": 0.07444137334823608, | |
| "mean_token_accuracy": 0.9985477030277252, | |
| "num_tokens": 103226610.0, | |
| "step": 643 | |
| }, | |
| { | |
| "aux_loss": 8.022226810455322, | |
| "entropy": 0.02244643308222294, | |
| "epoch": 15.337349397590362, | |
| "grad_norm": 0.31514278054237366, | |
| "learning_rate": 1.2979185556892453e-06, | |
| "loss": 0.07336429506540298, | |
| "mean_token_accuracy": 0.9984653294086456, | |
| "num_tokens": 103408648.0, | |
| "step": 644 | |
| }, | |
| { | |
| "aux_loss": 8.022058486938477, | |
| "entropy": 0.022669089026749134, | |
| "epoch": 15.36144578313253, | |
| "grad_norm": 0.27879098057746887, | |
| "learning_rate": 1.2974746194503983e-06, | |
| "loss": 0.07349519431591034, | |
| "mean_token_accuracy": 0.9986022412776947, | |
| "num_tokens": 103566045.0, | |
| "step": 645 | |
| }, | |
| { | |
| "aux_loss": 8.021483898162842, | |
| "entropy": 0.021356522105634212, | |
| "epoch": 15.385542168674698, | |
| "grad_norm": 0.2727099061012268, | |
| "learning_rate": 1.2970302087796387e-06, | |
| "loss": 0.07301362603902817, | |
| "mean_token_accuracy": 0.998765617609024, | |
| "num_tokens": 103724872.0, | |
| "step": 646 | |
| }, | |
| { | |
| "aux_loss": 8.021254539489746, | |
| "entropy": 0.020334189757704735, | |
| "epoch": 15.409638554216867, | |
| "grad_norm": 0.26047971844673157, | |
| "learning_rate": 1.2965853246811002e-06, | |
| "loss": 0.07252707332372665, | |
| "mean_token_accuracy": 0.9989950954914093, | |
| "num_tokens": 103892586.0, | |
| "step": 647 | |
| }, | |
| { | |
| "aux_loss": 8.022690773010254, | |
| "entropy": 0.023002373054623604, | |
| "epoch": 15.433734939759036, | |
| "grad_norm": 0.27840209007263184, | |
| "learning_rate": 1.296139968159986e-06, | |
| "loss": 0.07410129904747009, | |
| "mean_token_accuracy": 0.9984548091888428, | |
| "num_tokens": 104089061.0, | |
| "step": 648 | |
| }, | |
| { | |
| "aux_loss": 8.021388053894043, | |
| "entropy": 0.0260968254879117, | |
| "epoch": 15.457831325301205, | |
| "grad_norm": 0.32532691955566406, | |
| "learning_rate": 1.295694140222567e-06, | |
| "loss": 0.07457713037729263, | |
| "mean_token_accuracy": 0.9986681640148163, | |
| "num_tokens": 104244702.0, | |
| "step": 649 | |
| }, | |
| { | |
| "aux_loss": 8.02051067352295, | |
| "entropy": 0.02532896865159273, | |
| "epoch": 15.481927710843374, | |
| "grad_norm": 0.2929506301879883, | |
| "learning_rate": 1.2952478418761797e-06, | |
| "loss": 0.0746280699968338, | |
| "mean_token_accuracy": 0.9985699653625488, | |
| "num_tokens": 104394461.0, | |
| "step": 650 | |
| }, | |
| { | |
| "aux_loss": 8.020220279693604, | |
| "entropy": 0.02090471889823675, | |
| "epoch": 15.506024096385541, | |
| "grad_norm": 0.2575758993625641, | |
| "learning_rate": 1.2948010741292229e-06, | |
| "loss": 0.07256072759628296, | |
| "mean_token_accuracy": 0.9989967942237854, | |
| "num_tokens": 104549331.0, | |
| "step": 651 | |
| }, | |
| { | |
| "aux_loss": 8.020815372467041, | |
| "entropy": 0.02374210860580206, | |
| "epoch": 15.53012048192771, | |
| "grad_norm": 0.27740997076034546, | |
| "learning_rate": 1.2943538379911556e-06, | |
| "loss": 0.07387857139110565, | |
| "mean_token_accuracy": 0.9988603293895721, | |
| "num_tokens": 104705482.0, | |
| "step": 652 | |
| }, | |
| { | |
| "aux_loss": 8.01929759979248, | |
| "entropy": 0.022214006632566452, | |
| "epoch": 15.55421686746988, | |
| "grad_norm": 0.26949021220207214, | |
| "learning_rate": 1.293906134472496e-06, | |
| "loss": 0.07310213893651962, | |
| "mean_token_accuracy": 0.9987643361091614, | |
| "num_tokens": 104869500.0, | |
| "step": 653 | |
| }, | |
| { | |
| "aux_loss": 8.020097255706787, | |
| "entropy": 0.02291025221347809, | |
| "epoch": 15.578313253012048, | |
| "grad_norm": 0.2881735563278198, | |
| "learning_rate": 1.293457964584818e-06, | |
| "loss": 0.07341130077838898, | |
| "mean_token_accuracy": 0.9985943734645844, | |
| "num_tokens": 105031708.0, | |
| "step": 654 | |
| }, | |
| { | |
| "aux_loss": 8.022075653076172, | |
| "entropy": 0.026461578905582428, | |
| "epoch": 15.602409638554217, | |
| "grad_norm": 0.34265780448913574, | |
| "learning_rate": 1.2930093293407489e-06, | |
| "loss": 0.07502055913209915, | |
| "mean_token_accuracy": 0.9984954297542572, | |
| "num_tokens": 105186130.0, | |
| "step": 655 | |
| }, | |
| { | |
| "aux_loss": 8.02108097076416, | |
| "entropy": 0.02646957617253065, | |
| "epoch": 15.626506024096386, | |
| "grad_norm": 0.30914735794067383, | |
| "learning_rate": 1.2925602297539683e-06, | |
| "loss": 0.07509751617908478, | |
| "mean_token_accuracy": 0.9983176290988922, | |
| "num_tokens": 105352036.0, | |
| "step": 656 | |
| }, | |
| { | |
| "aux_loss": 8.020662784576416, | |
| "entropy": 0.021242394112050533, | |
| "epoch": 15.650602409638553, | |
| "grad_norm": 0.3023134171962738, | |
| "learning_rate": 1.292110666839204e-06, | |
| "loss": 0.07290812581777573, | |
| "mean_token_accuracy": 0.9986430406570435, | |
| "num_tokens": 105524545.0, | |
| "step": 657 | |
| }, | |
| { | |
| "aux_loss": 8.01900053024292, | |
| "entropy": 0.02397344261407852, | |
| "epoch": 15.674698795180722, | |
| "grad_norm": 0.3177374601364136, | |
| "learning_rate": 1.291660641612231e-06, | |
| "loss": 0.07397983223199844, | |
| "mean_token_accuracy": 0.998524397611618, | |
| "num_tokens": 105672387.0, | |
| "step": 658 | |
| }, | |
| { | |
| "aux_loss": 8.020395278930664, | |
| "entropy": 0.025442958809435368, | |
| "epoch": 15.698795180722891, | |
| "grad_norm": 0.3742443919181824, | |
| "learning_rate": 1.2912101550898697e-06, | |
| "loss": 0.0751451700925827, | |
| "mean_token_accuracy": 0.9982341527938843, | |
| "num_tokens": 105833891.0, | |
| "step": 659 | |
| }, | |
| { | |
| "aux_loss": 8.02198600769043, | |
| "entropy": 0.022907257080078125, | |
| "epoch": 15.72289156626506, | |
| "grad_norm": 0.29169169068336487, | |
| "learning_rate": 1.2907592082899816e-06, | |
| "loss": 0.0738602802157402, | |
| "mean_token_accuracy": 0.998700886964798, | |
| "num_tokens": 106020005.0, | |
| "step": 660 | |
| }, | |
| { | |
| "aux_loss": 8.02039098739624, | |
| "entropy": 0.026243245229125023, | |
| "epoch": 15.74698795180723, | |
| "grad_norm": 0.33287695050239563, | |
| "learning_rate": 1.2903078022314686e-06, | |
| "loss": 0.07507944852113724, | |
| "mean_token_accuracy": 0.9982471168041229, | |
| "num_tokens": 106145420.0, | |
| "step": 661 | |
| }, | |
| { | |
| "aux_loss": 8.01774787902832, | |
| "entropy": 0.02395310066640377, | |
| "epoch": 15.771084337349398, | |
| "grad_norm": 0.29184141755104065, | |
| "learning_rate": 1.2898559379342702e-06, | |
| "loss": 0.07375696301460266, | |
| "mean_token_accuracy": 0.9986594617366791, | |
| "num_tokens": 106294891.0, | |
| "step": 662 | |
| }, | |
| { | |
| "aux_loss": 8.022370338439941, | |
| "entropy": 0.021435990929603577, | |
| "epoch": 15.795180722891565, | |
| "grad_norm": 0.26756441593170166, | |
| "learning_rate": 1.2894036164193619e-06, | |
| "loss": 0.07307396084070206, | |
| "mean_token_accuracy": 0.9987272918224335, | |
| "num_tokens": 106481286.0, | |
| "step": 663 | |
| }, | |
| { | |
| "aux_loss": 8.020098686218262, | |
| "entropy": 0.023615891113877296, | |
| "epoch": 15.819277108433734, | |
| "grad_norm": 0.2693254351615906, | |
| "learning_rate": 1.2889508387087517e-06, | |
| "loss": 0.07437321543693542, | |
| "mean_token_accuracy": 0.9984356164932251, | |
| "num_tokens": 106662412.0, | |
| "step": 664 | |
| }, | |
| { | |
| "aux_loss": 8.019869804382324, | |
| "entropy": 0.02427336946129799, | |
| "epoch": 15.843373493975903, | |
| "grad_norm": 0.31732895970344543, | |
| "learning_rate": 1.288497605825478e-06, | |
| "loss": 0.07438519597053528, | |
| "mean_token_accuracy": 0.9983821511268616, | |
| "num_tokens": 106811595.0, | |
| "step": 665 | |
| }, | |
| { | |
| "aux_loss": 8.019139289855957, | |
| "entropy": 0.024068274535238743, | |
| "epoch": 15.867469879518072, | |
| "grad_norm": 0.3149513900279999, | |
| "learning_rate": 1.2880439187936087e-06, | |
| "loss": 0.0742831826210022, | |
| "mean_token_accuracy": 0.9983760118484497, | |
| "num_tokens": 106979051.0, | |
| "step": 666 | |
| }, | |
| { | |
| "aux_loss": 8.02074146270752, | |
| "entropy": 0.021527115255594254, | |
| "epoch": 15.891566265060241, | |
| "grad_norm": 0.3242640495300293, | |
| "learning_rate": 1.287589778638237e-06, | |
| "loss": 0.07310071587562561, | |
| "mean_token_accuracy": 0.998621016740799, | |
| "num_tokens": 107134402.0, | |
| "step": 667 | |
| }, | |
| { | |
| "aux_loss": 8.019129753112793, | |
| "entropy": 0.022771391086280346, | |
| "epoch": 15.91566265060241, | |
| "grad_norm": 0.2968021333217621, | |
| "learning_rate": 1.2871351863854801e-06, | |
| "loss": 0.07361795008182526, | |
| "mean_token_accuracy": 0.9986350834369659, | |
| "num_tokens": 107297595.0, | |
| "step": 668 | |
| }, | |
| { | |
| "aux_loss": 8.020462036132812, | |
| "entropy": 0.02477428875863552, | |
| "epoch": 15.939759036144578, | |
| "grad_norm": 0.2882487177848816, | |
| "learning_rate": 1.286680143062477e-06, | |
| "loss": 0.07493428885936737, | |
| "mean_token_accuracy": 0.9982820153236389, | |
| "num_tokens": 107464336.0, | |
| "step": 669 | |
| }, | |
| { | |
| "aux_loss": 8.02011489868164, | |
| "entropy": 0.020565422251820564, | |
| "epoch": 15.963855421686747, | |
| "grad_norm": 0.28168952465057373, | |
| "learning_rate": 1.2862246496973851e-06, | |
| "loss": 0.07310523092746735, | |
| "mean_token_accuracy": 0.9986270666122437, | |
| "num_tokens": 107638336.0, | |
| "step": 670 | |
| }, | |
| { | |
| "aux_loss": 8.020737648010254, | |
| "entropy": 0.021479875780642033, | |
| "epoch": 15.987951807228916, | |
| "grad_norm": 0.29684916138648987, | |
| "learning_rate": 1.2857687073193798e-06, | |
| "loss": 0.07347613573074341, | |
| "mean_token_accuracy": 0.9984760880470276, | |
| "num_tokens": 107826080.0, | |
| "step": 671 | |
| }, | |
| { | |
| "aux_loss": 8.01843547821045, | |
| "entropy": 0.02332298830151558, | |
| "epoch": 16.0, | |
| "grad_norm": 0.43242138624191284, | |
| "learning_rate": 1.2853123169586503e-06, | |
| "loss": 0.043614618480205536, | |
| "mean_token_accuracy": 0.9981607794761658, | |
| "num_tokens": 107863408.0, | |
| "step": 672 | |
| }, | |
| { | |
| "aux_loss": 8.020530700683594, | |
| "entropy": 0.022393235005438328, | |
| "epoch": 16.02409638554217, | |
| "grad_norm": 0.2633357346057892, | |
| "learning_rate": 1.2848554796463979e-06, | |
| "loss": 0.0727771669626236, | |
| "mean_token_accuracy": 0.999247670173645, | |
| "num_tokens": 108050327.0, | |
| "step": 673 | |
| }, | |
| { | |
| "aux_loss": 8.02012825012207, | |
| "entropy": 0.022030208259820938, | |
| "epoch": 16.048192771084338, | |
| "grad_norm": 0.2506941258907318, | |
| "learning_rate": 1.2843981964148343e-06, | |
| "loss": 0.0728757455945015, | |
| "mean_token_accuracy": 0.9989919066429138, | |
| "num_tokens": 108217426.0, | |
| "step": 674 | |
| }, | |
| { | |
| "aux_loss": 8.021928787231445, | |
| "entropy": 0.023885431699454784, | |
| "epoch": 16.072289156626507, | |
| "grad_norm": 0.26206958293914795, | |
| "learning_rate": 1.2839404682971785e-06, | |
| "loss": 0.07347150146961212, | |
| "mean_token_accuracy": 0.9989467859268188, | |
| "num_tokens": 108392675.0, | |
| "step": 675 | |
| }, | |
| { | |
| "aux_loss": 8.020271301269531, | |
| "entropy": 0.022960077971220016, | |
| "epoch": 16.096385542168676, | |
| "grad_norm": 0.2646230161190033, | |
| "learning_rate": 1.2834822963276542e-06, | |
| "loss": 0.07312756776809692, | |
| "mean_token_accuracy": 0.9989570677280426, | |
| "num_tokens": 108553072.0, | |
| "step": 676 | |
| }, | |
| { | |
| "aux_loss": 8.019484043121338, | |
| "entropy": 0.020488368347287178, | |
| "epoch": 16.120481927710845, | |
| "grad_norm": 0.24604511260986328, | |
| "learning_rate": 1.283023681541489e-06, | |
| "loss": 0.0727168396115303, | |
| "mean_token_accuracy": 0.9987335801124573, | |
| "num_tokens": 108719154.0, | |
| "step": 677 | |
| }, | |
| { | |
| "aux_loss": 8.020560264587402, | |
| "entropy": 0.019702761434018612, | |
| "epoch": 16.14457831325301, | |
| "grad_norm": 0.2394089698791504, | |
| "learning_rate": 1.28256462497491e-06, | |
| "loss": 0.07267318665981293, | |
| "mean_token_accuracy": 0.9985304176807404, | |
| "num_tokens": 108904674.0, | |
| "step": 678 | |
| }, | |
| { | |
| "aux_loss": 8.020466327667236, | |
| "entropy": 0.020342765375971794, | |
| "epoch": 16.16867469879518, | |
| "grad_norm": 0.2705174684524536, | |
| "learning_rate": 1.2821051276651435e-06, | |
| "loss": 0.0721237063407898, | |
| "mean_token_accuracy": 0.998966246843338, | |
| "num_tokens": 109070935.0, | |
| "step": 679 | |
| }, | |
| { | |
| "aux_loss": 8.018497467041016, | |
| "entropy": 0.020449550822377205, | |
| "epoch": 16.19277108433735, | |
| "grad_norm": 0.2680540084838867, | |
| "learning_rate": 1.2816451906504105e-06, | |
| "loss": 0.07245158404111862, | |
| "mean_token_accuracy": 0.9988517463207245, | |
| "num_tokens": 109234529.0, | |
| "step": 680 | |
| }, | |
| { | |
| "aux_loss": 8.021220207214355, | |
| "entropy": 0.020716692321002483, | |
| "epoch": 16.216867469879517, | |
| "grad_norm": 0.28465089201927185, | |
| "learning_rate": 1.2811848149699267e-06, | |
| "loss": 0.07244610786437988, | |
| "mean_token_accuracy": 0.9989461600780487, | |
| "num_tokens": 109392460.0, | |
| "step": 681 | |
| }, | |
| { | |
| "aux_loss": 8.018983840942383, | |
| "entropy": 0.021451476030051708, | |
| "epoch": 16.240963855421686, | |
| "grad_norm": 0.2451764941215515, | |
| "learning_rate": 1.2807240016638979e-06, | |
| "loss": 0.0723300501704216, | |
| "mean_token_accuracy": 0.999213457107544, | |
| "num_tokens": 109554796.0, | |
| "step": 682 | |
| }, | |
| { | |
| "aux_loss": 8.019144535064697, | |
| "entropy": 0.02154405042529106, | |
| "epoch": 16.265060240963855, | |
| "grad_norm": 0.25080832839012146, | |
| "learning_rate": 1.2802627517735193e-06, | |
| "loss": 0.07240288704633713, | |
| "mean_token_accuracy": 0.9991842806339264, | |
| "num_tokens": 109713297.0, | |
| "step": 683 | |
| }, | |
| { | |
| "aux_loss": 8.019875526428223, | |
| "entropy": 0.022928071208298206, | |
| "epoch": 16.289156626506024, | |
| "grad_norm": 0.3149115741252899, | |
| "learning_rate": 1.2798010663409725e-06, | |
| "loss": 0.07373928278684616, | |
| "mean_token_accuracy": 0.9986364245414734, | |
| "num_tokens": 109873842.0, | |
| "step": 684 | |
| }, | |
| { | |
| "aux_loss": 8.020755290985107, | |
| "entropy": 0.019248541444540024, | |
| "epoch": 16.313253012048193, | |
| "grad_norm": 0.272822767496109, | |
| "learning_rate": 1.2793389464094231e-06, | |
| "loss": 0.07230706512928009, | |
| "mean_token_accuracy": 0.9988452792167664, | |
| "num_tokens": 110038995.0, | |
| "step": 685 | |
| }, | |
| { | |
| "aux_loss": 8.02060079574585, | |
| "entropy": 0.02429412119090557, | |
| "epoch": 16.337349397590362, | |
| "grad_norm": 0.2750745415687561, | |
| "learning_rate": 1.2788763930230185e-06, | |
| "loss": 0.07414013147354126, | |
| "mean_token_accuracy": 0.9989420175552368, | |
| "num_tokens": 110200379.0, | |
| "step": 686 | |
| }, | |
| { | |
| "aux_loss": 8.019941329956055, | |
| "entropy": 0.023073025979101658, | |
| "epoch": 16.36144578313253, | |
| "grad_norm": 0.28986501693725586, | |
| "learning_rate": 1.2784134072268853e-06, | |
| "loss": 0.07339712977409363, | |
| "mean_token_accuracy": 0.9983747899532318, | |
| "num_tokens": 110363989.0, | |
| "step": 687 | |
| }, | |
| { | |
| "aux_loss": 8.0198073387146, | |
| "entropy": 0.02075932454317808, | |
| "epoch": 16.3855421686747, | |
| "grad_norm": 0.26142221689224243, | |
| "learning_rate": 1.2779499900671275e-06, | |
| "loss": 0.07247196137905121, | |
| "mean_token_accuracy": 0.9989039599895477, | |
| "num_tokens": 110546477.0, | |
| "step": 688 | |
| }, | |
| { | |
| "aux_loss": 8.017828941345215, | |
| "entropy": 0.023983335122466087, | |
| "epoch": 16.40963855421687, | |
| "grad_norm": 0.26134753227233887, | |
| "learning_rate": 1.2774861425908232e-06, | |
| "loss": 0.07388327270746231, | |
| "mean_token_accuracy": 0.9985763430595398, | |
| "num_tokens": 110705279.0, | |
| "step": 689 | |
| }, | |
| { | |
| "aux_loss": 8.01949691772461, | |
| "entropy": 0.021404901519417763, | |
| "epoch": 16.433734939759034, | |
| "grad_norm": 0.29304608702659607, | |
| "learning_rate": 1.277021865846023e-06, | |
| "loss": 0.07277315855026245, | |
| "mean_token_accuracy": 0.9989573061466217, | |
| "num_tokens": 110872733.0, | |
| "step": 690 | |
| }, | |
| { | |
| "aux_loss": 8.019288539886475, | |
| "entropy": 0.02335297502577305, | |
| "epoch": 16.457831325301203, | |
| "grad_norm": 0.2603730857372284, | |
| "learning_rate": 1.2765571608817482e-06, | |
| "loss": 0.0734720528125763, | |
| "mean_token_accuracy": 0.9986677169799805, | |
| "num_tokens": 111048756.0, | |
| "step": 691 | |
| }, | |
| { | |
| "aux_loss": 8.017802238464355, | |
| "entropy": 0.024003656581044197, | |
| "epoch": 16.481927710843372, | |
| "grad_norm": 0.30309340357780457, | |
| "learning_rate": 1.2760920287479862e-06, | |
| "loss": 0.07363101094961166, | |
| "mean_token_accuracy": 0.9985250532627106, | |
| "num_tokens": 111204600.0, | |
| "step": 692 | |
| }, | |
| { | |
| "aux_loss": 8.02037239074707, | |
| "entropy": 0.019865051843225956, | |
| "epoch": 16.50602409638554, | |
| "grad_norm": 0.3331621289253235, | |
| "learning_rate": 1.2756264704956907e-06, | |
| "loss": 0.0723302960395813, | |
| "mean_token_accuracy": 0.9988258481025696, | |
| "num_tokens": 111383445.0, | |
| "step": 693 | |
| }, | |
| { | |
| "aux_loss": 8.020899295806885, | |
| "entropy": 0.02355680614709854, | |
| "epoch": 16.53012048192771, | |
| "grad_norm": 0.30058375000953674, | |
| "learning_rate": 1.2751604871767777e-06, | |
| "loss": 0.07387770712375641, | |
| "mean_token_accuracy": 0.9987203776836395, | |
| "num_tokens": 111526844.0, | |
| "step": 694 | |
| }, | |
| { | |
| "aux_loss": 8.019113063812256, | |
| "entropy": 0.02117983717471361, | |
| "epoch": 16.55421686746988, | |
| "grad_norm": 0.2666833996772766, | |
| "learning_rate": 1.2746940798441239e-06, | |
| "loss": 0.07312053442001343, | |
| "mean_token_accuracy": 0.9987923204898834, | |
| "num_tokens": 111698598.0, | |
| "step": 695 | |
| }, | |
| { | |
| "aux_loss": 8.019593715667725, | |
| "entropy": 0.023584443144500256, | |
| "epoch": 16.57831325301205, | |
| "grad_norm": 0.2818170189857483, | |
| "learning_rate": 1.2742272495515638e-06, | |
| "loss": 0.0736173540353775, | |
| "mean_token_accuracy": 0.9989428520202637, | |
| "num_tokens": 111854262.0, | |
| "step": 696 | |
| }, | |
| { | |
| "aux_loss": 8.018776893615723, | |
| "entropy": 0.02602121327072382, | |
| "epoch": 16.602409638554217, | |
| "grad_norm": 0.2953900396823883, | |
| "learning_rate": 1.2737599973538879e-06, | |
| "loss": 0.0743790864944458, | |
| "mean_token_accuracy": 0.9987208843231201, | |
| "num_tokens": 112000995.0, | |
| "step": 697 | |
| }, | |
| { | |
| "aux_loss": 8.020740032196045, | |
| "entropy": 0.019654186442494392, | |
| "epoch": 16.626506024096386, | |
| "grad_norm": 0.2816968262195587, | |
| "learning_rate": 1.2732923243068392e-06, | |
| "loss": 0.07228513062000275, | |
| "mean_token_accuracy": 0.9988078773021698, | |
| "num_tokens": 112156280.0, | |
| "step": 698 | |
| }, | |
| { | |
| "aux_loss": 8.019818305969238, | |
| "entropy": 0.02012883499264717, | |
| "epoch": 16.650602409638555, | |
| "grad_norm": 0.2908588647842407, | |
| "learning_rate": 1.272824231467113e-06, | |
| "loss": 0.07279551029205322, | |
| "mean_token_accuracy": 0.998571515083313, | |
| "num_tokens": 112317480.0, | |
| "step": 699 | |
| }, | |
| { | |
| "aux_loss": 8.017993450164795, | |
| "entropy": 0.022014505229890347, | |
| "epoch": 16.674698795180724, | |
| "grad_norm": 0.2733386754989624, | |
| "learning_rate": 1.2723557198923518e-06, | |
| "loss": 0.07319703698158264, | |
| "mean_token_accuracy": 0.998718798160553, | |
| "num_tokens": 112488475.0, | |
| "step": 700 | |
| }, | |
| { | |
| "aux_loss": 8.02134895324707, | |
| "entropy": 0.02212555892765522, | |
| "epoch": 16.698795180722893, | |
| "grad_norm": 0.27544257044792175, | |
| "learning_rate": 1.2718867906411449e-06, | |
| "loss": 0.0728733241558075, | |
| "mean_token_accuracy": 0.9989720582962036, | |
| "num_tokens": 112656711.0, | |
| "step": 701 | |
| }, | |
| { | |
| "aux_loss": 8.021170616149902, | |
| "entropy": 0.02474300842732191, | |
| "epoch": 16.72289156626506, | |
| "grad_norm": 0.2849322557449341, | |
| "learning_rate": 1.2714174447730245e-06, | |
| "loss": 0.0741940513253212, | |
| "mean_token_accuracy": 0.9986203908920288, | |
| "num_tokens": 112833393.0, | |
| "step": 702 | |
| }, | |
| { | |
| "aux_loss": 8.018834590911865, | |
| "entropy": 0.022908312268555164, | |
| "epoch": 16.746987951807228, | |
| "grad_norm": 0.28826624155044556, | |
| "learning_rate": 1.2709476833484658e-06, | |
| "loss": 0.0734931081533432, | |
| "mean_token_accuracy": 0.9986154139041901, | |
| "num_tokens": 112989879.0, | |
| "step": 703 | |
| }, | |
| { | |
| "aux_loss": 8.019938468933105, | |
| "entropy": 0.02371642179787159, | |
| "epoch": 16.771084337349397, | |
| "grad_norm": 0.28521883487701416, | |
| "learning_rate": 1.2704775074288811e-06, | |
| "loss": 0.07402516901493073, | |
| "mean_token_accuracy": 0.9986785352230072, | |
| "num_tokens": 113141308.0, | |
| "step": 704 | |
| }, | |
| { | |
| "aux_loss": 8.020092010498047, | |
| "entropy": 0.024456963874399662, | |
| "epoch": 16.795180722891565, | |
| "grad_norm": 0.2931254506111145, | |
| "learning_rate": 1.27000691807662e-06, | |
| "loss": 0.0738486722111702, | |
| "mean_token_accuracy": 0.9987576603889465, | |
| "num_tokens": 113301783.0, | |
| "step": 705 | |
| }, | |
| { | |
| "aux_loss": 8.018565654754639, | |
| "entropy": 0.0241565415635705, | |
| "epoch": 16.819277108433734, | |
| "grad_norm": 0.3001376986503601, | |
| "learning_rate": 1.2695359163549669e-06, | |
| "loss": 0.0737600326538086, | |
| "mean_token_accuracy": 0.9986201226711273, | |
| "num_tokens": 113477950.0, | |
| "step": 706 | |
| }, | |
| { | |
| "aux_loss": 8.01756477355957, | |
| "entropy": 0.025217771530151367, | |
| "epoch": 16.843373493975903, | |
| "grad_norm": 0.3046022355556488, | |
| "learning_rate": 1.2690645033281367e-06, | |
| "loss": 0.07499519735574722, | |
| "mean_token_accuracy": 0.9982928335666656, | |
| "num_tokens": 113621328.0, | |
| "step": 707 | |
| }, | |
| { | |
| "aux_loss": 8.018495559692383, | |
| "entropy": 0.026443729177117348, | |
| "epoch": 16.867469879518072, | |
| "grad_norm": 0.3249662220478058, | |
| "learning_rate": 1.268592680061275e-06, | |
| "loss": 0.07490746676921844, | |
| "mean_token_accuracy": 0.998531699180603, | |
| "num_tokens": 113768784.0, | |
| "step": 708 | |
| }, | |
| { | |
| "aux_loss": 8.018553256988525, | |
| "entropy": 0.02360593993216753, | |
| "epoch": 16.89156626506024, | |
| "grad_norm": 0.29597988724708557, | |
| "learning_rate": 1.2681204476204526e-06, | |
| "loss": 0.07375691831111908, | |
| "mean_token_accuracy": 0.9984996318817139, | |
| "num_tokens": 113913639.0, | |
| "step": 709 | |
| }, | |
| { | |
| "aux_loss": 8.018509864807129, | |
| "entropy": 0.022534790448844433, | |
| "epoch": 16.91566265060241, | |
| "grad_norm": 0.27990180253982544, | |
| "learning_rate": 1.2676478070726664e-06, | |
| "loss": 0.0731102004647255, | |
| "mean_token_accuracy": 0.9988978803157806, | |
| "num_tokens": 114063897.0, | |
| "step": 710 | |
| }, | |
| { | |
| "aux_loss": 8.018209457397461, | |
| "entropy": 0.02309778332710266, | |
| "epoch": 16.93975903614458, | |
| "grad_norm": 0.3171619176864624, | |
| "learning_rate": 1.2671747594858347e-06, | |
| "loss": 0.0735432580113411, | |
| "mean_token_accuracy": 0.9983865022659302, | |
| "num_tokens": 114211028.0, | |
| "step": 711 | |
| }, | |
| { | |
| "aux_loss": 8.020139694213867, | |
| "entropy": 0.020823744125664234, | |
| "epoch": 16.96385542168675, | |
| "grad_norm": 0.27658897638320923, | |
| "learning_rate": 1.2667013059287958e-06, | |
| "loss": 0.07257592678070068, | |
| "mean_token_accuracy": 0.9990012347698212, | |
| "num_tokens": 114382660.0, | |
| "step": 712 | |
| }, | |
| { | |
| "aux_loss": 8.01858901977539, | |
| "entropy": 0.022462548688054085, | |
| "epoch": 16.987951807228917, | |
| "grad_norm": 0.2987523078918457, | |
| "learning_rate": 1.2662274474713044e-06, | |
| "loss": 0.07326245307922363, | |
| "mean_token_accuracy": 0.9986851513385773, | |
| "num_tokens": 114563054.0, | |
| "step": 713 | |
| }, | |
| { | |
| "aux_loss": 8.018234252929688, | |
| "entropy": 0.022904684767127037, | |
| "epoch": 17.0, | |
| "grad_norm": 0.35216137766838074, | |
| "learning_rate": 1.2657531851840316e-06, | |
| "loss": 0.04157853499054909, | |
| "mean_token_accuracy": 0.9983097910881042, | |
| "num_tokens": 114604871.0, | |
| "step": 714 | |
| }, | |
| { | |
| "aux_loss": 8.020260334014893, | |
| "entropy": 0.01973626110702753, | |
| "epoch": 17.02409638554217, | |
| "grad_norm": 0.24988825619220734, | |
| "learning_rate": 1.2652785201385593e-06, | |
| "loss": 0.07225106656551361, | |
| "mean_token_accuracy": 0.9988470375537872, | |
| "num_tokens": 114781200.0, | |
| "step": 715 | |
| }, | |
| { | |
| "aux_loss": 8.018704891204834, | |
| "entropy": 0.021086208522319794, | |
| "epoch": 17.048192771084338, | |
| "grad_norm": 0.2632339298725128, | |
| "learning_rate": 1.2648034534073808e-06, | |
| "loss": 0.07266698777675629, | |
| "mean_token_accuracy": 0.9989010393619537, | |
| "num_tokens": 114951789.0, | |
| "step": 716 | |
| }, | |
| { | |
| "aux_loss": 8.01948356628418, | |
| "entropy": 0.020533667877316475, | |
| "epoch": 17.072289156626507, | |
| "grad_norm": 0.26556897163391113, | |
| "learning_rate": 1.264327986063896e-06, | |
| "loss": 0.07211188971996307, | |
| "mean_token_accuracy": 0.9989912211894989, | |
| "num_tokens": 115127254.0, | |
| "step": 717 | |
| }, | |
| { | |
| "aux_loss": 8.018863677978516, | |
| "entropy": 0.018902011215686798, | |
| "epoch": 17.096385542168676, | |
| "grad_norm": 0.24564693868160248, | |
| "learning_rate": 1.2638521191824104e-06, | |
| "loss": 0.07158875465393066, | |
| "mean_token_accuracy": 0.9990418553352356, | |
| "num_tokens": 115292268.0, | |
| "step": 718 | |
| }, | |
| { | |
| "aux_loss": 8.018441200256348, | |
| "entropy": 0.023904663510620594, | |
| "epoch": 17.120481927710845, | |
| "grad_norm": 0.29119113087654114, | |
| "learning_rate": 1.2633758538381323e-06, | |
| "loss": 0.07388065755367279, | |
| "mean_token_accuracy": 0.9987189471721649, | |
| "num_tokens": 115441718.0, | |
| "step": 719 | |
| }, | |
| { | |
| "aux_loss": 8.018760681152344, | |
| "entropy": 0.022885017096996307, | |
| "epoch": 17.14457831325301, | |
| "grad_norm": 0.2819487750530243, | |
| "learning_rate": 1.2628991911071704e-06, | |
| "loss": 0.07310710102319717, | |
| "mean_token_accuracy": 0.9988558888435364, | |
| "num_tokens": 115586091.0, | |
| "step": 720 | |
| }, | |
| { | |
| "aux_loss": 8.022488594055176, | |
| "entropy": 0.020207397639751434, | |
| "epoch": 17.16867469879518, | |
| "grad_norm": 0.27069467306137085, | |
| "learning_rate": 1.2624221320665308e-06, | |
| "loss": 0.0723872259259224, | |
| "mean_token_accuracy": 0.9989005327224731, | |
| "num_tokens": 115775635.0, | |
| "step": 721 | |
| }, | |
| { | |
| "aux_loss": 8.018838882446289, | |
| "entropy": 0.020961137488484383, | |
| "epoch": 17.19277108433735, | |
| "grad_norm": 0.24343232810497284, | |
| "learning_rate": 1.2619446777941157e-06, | |
| "loss": 0.07253874838352203, | |
| "mean_token_accuracy": 0.9989787936210632, | |
| "num_tokens": 115934942.0, | |
| "step": 722 | |
| }, | |
| { | |
| "aux_loss": 8.01854419708252, | |
| "entropy": 0.024558238685131073, | |
| "epoch": 17.216867469879517, | |
| "grad_norm": 0.2664203941822052, | |
| "learning_rate": 1.2614668293687195e-06, | |
| "loss": 0.07387381047010422, | |
| "mean_token_accuracy": 0.9987564980983734, | |
| "num_tokens": 116082257.0, | |
| "step": 723 | |
| }, | |
| { | |
| "aux_loss": 8.017542839050293, | |
| "entropy": 0.021965456195175648, | |
| "epoch": 17.240963855421686, | |
| "grad_norm": 0.2544980049133301, | |
| "learning_rate": 1.260988587870028e-06, | |
| "loss": 0.07254408299922943, | |
| "mean_token_accuracy": 0.9989876449108124, | |
| "num_tokens": 116241709.0, | |
| "step": 724 | |
| }, | |
| { | |
| "aux_loss": 8.017529964447021, | |
| "entropy": 0.02150173019617796, | |
| "epoch": 17.265060240963855, | |
| "grad_norm": 0.273670494556427, | |
| "learning_rate": 1.2605099543786148e-06, | |
| "loss": 0.07259450107812881, | |
| "mean_token_accuracy": 0.9989366829395294, | |
| "num_tokens": 116395455.0, | |
| "step": 725 | |
| }, | |
| { | |
| "aux_loss": 8.018130779266357, | |
| "entropy": 0.020396078005433083, | |
| "epoch": 17.289156626506024, | |
| "grad_norm": 0.25444889068603516, | |
| "learning_rate": 1.2600309299759394e-06, | |
| "loss": 0.07241903990507126, | |
| "mean_token_accuracy": 0.9989669620990753, | |
| "num_tokens": 116554317.0, | |
| "step": 726 | |
| }, | |
| { | |
| "aux_loss": 8.019949436187744, | |
| "entropy": 0.025264563970267773, | |
| "epoch": 17.313253012048193, | |
| "grad_norm": 0.2933806777000427, | |
| "learning_rate": 1.2595515157443437e-06, | |
| "loss": 0.07410993427038193, | |
| "mean_token_accuracy": 0.9988081157207489, | |
| "num_tokens": 116718223.0, | |
| "step": 727 | |
| }, | |
| { | |
| "aux_loss": 8.01746654510498, | |
| "entropy": 0.02322079986333847, | |
| "epoch": 17.337349397590362, | |
| "grad_norm": 0.28038111329078674, | |
| "learning_rate": 1.2590717127670515e-06, | |
| "loss": 0.07366527616977692, | |
| "mean_token_accuracy": 0.9986792206764221, | |
| "num_tokens": 116878403.0, | |
| "step": 728 | |
| }, | |
| { | |
| "aux_loss": 8.018659591674805, | |
| "entropy": 0.02247860375791788, | |
| "epoch": 17.36144578313253, | |
| "grad_norm": 0.30654484033584595, | |
| "learning_rate": 1.2585915221281644e-06, | |
| "loss": 0.0729723572731018, | |
| "mean_token_accuracy": 0.9987496137619019, | |
| "num_tokens": 117024804.0, | |
| "step": 729 | |
| }, | |
| { | |
| "aux_loss": 8.016965389251709, | |
| "entropy": 0.021469758823513985, | |
| "epoch": 17.3855421686747, | |
| "grad_norm": 0.2939203977584839, | |
| "learning_rate": 1.25811094491266e-06, | |
| "loss": 0.07287987321615219, | |
| "mean_token_accuracy": 0.9987414479255676, | |
| "num_tokens": 117176747.0, | |
| "step": 730 | |
| }, | |
| { | |
| "aux_loss": 8.018593311309814, | |
| "entropy": 0.018805145286023617, | |
| "epoch": 17.40963855421687, | |
| "grad_norm": 0.268107533454895, | |
| "learning_rate": 1.2576299822063895e-06, | |
| "loss": 0.07208384573459625, | |
| "mean_token_accuracy": 0.9986215829849243, | |
| "num_tokens": 117343678.0, | |
| "step": 731 | |
| }, | |
| { | |
| "aux_loss": 8.018801212310791, | |
| "entropy": 0.024666352197527885, | |
| "epoch": 17.433734939759034, | |
| "grad_norm": 0.31131765246391296, | |
| "learning_rate": 1.2571486350960748e-06, | |
| "loss": 0.07412542402744293, | |
| "mean_token_accuracy": 0.9986770153045654, | |
| "num_tokens": 117509421.0, | |
| "step": 732 | |
| }, | |
| { | |
| "aux_loss": 8.018770694732666, | |
| "entropy": 0.02042167354375124, | |
| "epoch": 17.457831325301203, | |
| "grad_norm": 0.2588518559932709, | |
| "learning_rate": 1.2566669046693068e-06, | |
| "loss": 0.07215803861618042, | |
| "mean_token_accuracy": 0.9989665746688843, | |
| "num_tokens": 117696015.0, | |
| "step": 733 | |
| }, | |
| { | |
| "aux_loss": 8.01615571975708, | |
| "entropy": 0.022597020491957664, | |
| "epoch": 17.481927710843372, | |
| "grad_norm": 0.30011555552482605, | |
| "learning_rate": 1.256184792014542e-06, | |
| "loss": 0.07340023666620255, | |
| "mean_token_accuracy": 0.9987127184867859, | |
| "num_tokens": 117841809.0, | |
| "step": 734 | |
| }, | |
| { | |
| "aux_loss": 8.019785404205322, | |
| "entropy": 0.02277126256376505, | |
| "epoch": 17.50602409638554, | |
| "grad_norm": 0.2965037226676941, | |
| "learning_rate": 1.255702298221101e-06, | |
| "loss": 0.0731470137834549, | |
| "mean_token_accuracy": 0.9989103674888611, | |
| "num_tokens": 118012997.0, | |
| "step": 735 | |
| }, | |
| { | |
| "aux_loss": 8.017552852630615, | |
| "entropy": 0.021831008605659008, | |
| "epoch": 17.53012048192771, | |
| "grad_norm": 0.308307945728302, | |
| "learning_rate": 1.255219424379165e-06, | |
| "loss": 0.07292138785123825, | |
| "mean_token_accuracy": 0.9988667964935303, | |
| "num_tokens": 118171296.0, | |
| "step": 736 | |
| }, | |
| { | |
| "aux_loss": 8.018458366394043, | |
| "entropy": 0.021706807427108288, | |
| "epoch": 17.55421686746988, | |
| "grad_norm": 0.26562947034835815, | |
| "learning_rate": 1.2547361715797744e-06, | |
| "loss": 0.07324767857789993, | |
| "mean_token_accuracy": 0.9985917508602142, | |
| "num_tokens": 118343766.0, | |
| "step": 737 | |
| }, | |
| { | |
| "aux_loss": 8.017994403839111, | |
| "entropy": 0.02541373111307621, | |
| "epoch": 17.57831325301205, | |
| "grad_norm": 0.4492263197898865, | |
| "learning_rate": 1.2542525409148257e-06, | |
| "loss": 0.07444741576910019, | |
| "mean_token_accuracy": 0.9987869262695312, | |
| "num_tokens": 118507347.0, | |
| "step": 738 | |
| }, | |
| { | |
| "aux_loss": 8.019275188446045, | |
| "entropy": 0.022211837582290173, | |
| "epoch": 17.602409638554217, | |
| "grad_norm": 0.2794819176197052, | |
| "learning_rate": 1.2537685334770693e-06, | |
| "loss": 0.07303763926029205, | |
| "mean_token_accuracy": 0.9987471699714661, | |
| "num_tokens": 118682794.0, | |
| "step": 739 | |
| }, | |
| { | |
| "aux_loss": 8.019274711608887, | |
| "entropy": 0.01959415804594755, | |
| "epoch": 17.626506024096386, | |
| "grad_norm": 0.2540050446987152, | |
| "learning_rate": 1.2532841503601068e-06, | |
| "loss": 0.07219386100769043, | |
| "mean_token_accuracy": 0.9988141357898712, | |
| "num_tokens": 118859309.0, | |
| "step": 740 | |
| }, | |
| { | |
| "aux_loss": 8.019009590148926, | |
| "entropy": 0.01926138438284397, | |
| "epoch": 17.650602409638555, | |
| "grad_norm": 0.28901535272598267, | |
| "learning_rate": 1.2527993926583883e-06, | |
| "loss": 0.07196243852376938, | |
| "mean_token_accuracy": 0.9989327490329742, | |
| "num_tokens": 119035893.0, | |
| "step": 741 | |
| }, | |
| { | |
| "aux_loss": 8.017775058746338, | |
| "entropy": 0.022144275717437267, | |
| "epoch": 17.674698795180724, | |
| "grad_norm": 0.2637416124343872, | |
| "learning_rate": 1.2523142614672107e-06, | |
| "loss": 0.07286165654659271, | |
| "mean_token_accuracy": 0.9988670945167542, | |
| "num_tokens": 119180158.0, | |
| "step": 742 | |
| }, | |
| { | |
| "aux_loss": 8.017905712127686, | |
| "entropy": 0.020680655725300312, | |
| "epoch": 17.698795180722893, | |
| "grad_norm": 0.27268412709236145, | |
| "learning_rate": 1.251828757882715e-06, | |
| "loss": 0.07280862331390381, | |
| "mean_token_accuracy": 0.9987437427043915, | |
| "num_tokens": 119321045.0, | |
| "step": 743 | |
| }, | |
| { | |
| "aux_loss": 8.019142150878906, | |
| "entropy": 0.022346139885485172, | |
| "epoch": 17.72289156626506, | |
| "grad_norm": 0.2602423131465912, | |
| "learning_rate": 1.2513428830018823e-06, | |
| "loss": 0.07306060194969177, | |
| "mean_token_accuracy": 0.9989902079105377, | |
| "num_tokens": 119496030.0, | |
| "step": 744 | |
| }, | |
| { | |
| "aux_loss": 8.018294334411621, | |
| "entropy": 0.01832838449627161, | |
| "epoch": 17.746987951807228, | |
| "grad_norm": 0.2646837532520294, | |
| "learning_rate": 1.2508566379225348e-06, | |
| "loss": 0.07142096012830734, | |
| "mean_token_accuracy": 0.9991815686225891, | |
| "num_tokens": 119678297.0, | |
| "step": 745 | |
| }, | |
| { | |
| "aux_loss": 8.018517971038818, | |
| "entropy": 0.021844751201570034, | |
| "epoch": 17.771084337349397, | |
| "grad_norm": 0.291924387216568, | |
| "learning_rate": 1.2503700237433296e-06, | |
| "loss": 0.0728534385561943, | |
| "mean_token_accuracy": 0.9987517893314362, | |
| "num_tokens": 119840233.0, | |
| "step": 746 | |
| }, | |
| { | |
| "aux_loss": 8.018216133117676, | |
| "entropy": 0.020785548724234104, | |
| "epoch": 17.795180722891565, | |
| "grad_norm": 0.28122949600219727, | |
| "learning_rate": 1.2498830415637577e-06, | |
| "loss": 0.07247965782880783, | |
| "mean_token_accuracy": 0.9988265633583069, | |
| "num_tokens": 120003358.0, | |
| "step": 747 | |
| }, | |
| { | |
| "aux_loss": 8.018074035644531, | |
| "entropy": 0.021714145317673683, | |
| "epoch": 17.819277108433734, | |
| "grad_norm": 0.2694195508956909, | |
| "learning_rate": 1.2493956924841425e-06, | |
| "loss": 0.07262789458036423, | |
| "mean_token_accuracy": 0.9990041851997375, | |
| "num_tokens": 120160933.0, | |
| "step": 748 | |
| }, | |
| { | |
| "aux_loss": 8.019499778747559, | |
| "entropy": 0.02373611554503441, | |
| "epoch": 17.843373493975903, | |
| "grad_norm": 0.2960670292377472, | |
| "learning_rate": 1.2489079776056356e-06, | |
| "loss": 0.07344628870487213, | |
| "mean_token_accuracy": 0.9987205564975739, | |
| "num_tokens": 120325227.0, | |
| "step": 749 | |
| }, | |
| { | |
| "aux_loss": 8.018202304840088, | |
| "entropy": 0.021645985543727875, | |
| "epoch": 17.867469879518072, | |
| "grad_norm": 0.28741884231567383, | |
| "learning_rate": 1.2484198980302157e-06, | |
| "loss": 0.07262778282165527, | |
| "mean_token_accuracy": 0.9989192187786102, | |
| "num_tokens": 120495791.0, | |
| "step": 750 | |
| }, | |
| { | |
| "aux_loss": 8.018044471740723, | |
| "entropy": 0.023350493051111698, | |
| "epoch": 17.89156626506024, | |
| "grad_norm": 0.28955328464508057, | |
| "learning_rate": 1.2479314548606851e-06, | |
| "loss": 0.0735691487789154, | |
| "mean_token_accuracy": 0.9987229704856873, | |
| "num_tokens": 120660773.0, | |
| "step": 751 | |
| }, | |
| { | |
| "aux_loss": 8.018717765808105, | |
| "entropy": 0.02127855271100998, | |
| "epoch": 17.91566265060241, | |
| "grad_norm": 0.2683342695236206, | |
| "learning_rate": 1.2474426492006677e-06, | |
| "loss": 0.07282005995512009, | |
| "mean_token_accuracy": 0.9986674189567566, | |
| "num_tokens": 120826550.0, | |
| "step": 752 | |
| }, | |
| { | |
| "aux_loss": 8.017789840698242, | |
| "entropy": 0.022071994841098785, | |
| "epoch": 17.93975903614458, | |
| "grad_norm": 0.29112520813941956, | |
| "learning_rate": 1.246953482154607e-06, | |
| "loss": 0.07279111444950104, | |
| "mean_token_accuracy": 0.9989712834358215, | |
| "num_tokens": 120979013.0, | |
| "step": 753 | |
| }, | |
| { | |
| "aux_loss": 8.016852855682373, | |
| "entropy": 0.019618223421275616, | |
| "epoch": 17.96385542168675, | |
| "grad_norm": 0.2747417986392975, | |
| "learning_rate": 1.2464639548277618e-06, | |
| "loss": 0.07161170989274979, | |
| "mean_token_accuracy": 0.9992184042930603, | |
| "num_tokens": 121130966.0, | |
| "step": 754 | |
| }, | |
| { | |
| "aux_loss": 8.018714904785156, | |
| "entropy": 0.01958319917321205, | |
| "epoch": 17.987951807228917, | |
| "grad_norm": 0.26990944147109985, | |
| "learning_rate": 1.2459740683262065e-06, | |
| "loss": 0.07182662934064865, | |
| "mean_token_accuracy": 0.9990403354167938, | |
| "num_tokens": 121306353.0, | |
| "step": 755 | |
| }, | |
| { | |
| "aux_loss": 8.018830299377441, | |
| "entropy": 0.01911022700369358, | |
| "epoch": 18.0, | |
| "grad_norm": 0.3378460705280304, | |
| "learning_rate": 1.2454838237568257e-06, | |
| "loss": 0.03958260267972946, | |
| "mean_token_accuracy": 0.9991428852081299, | |
| "num_tokens": 121346334.0, | |
| "step": 756 | |
| }, | |
| { | |
| "aux_loss": 8.018142223358154, | |
| "entropy": 0.01967654377222061, | |
| "epoch": 18.02409638554217, | |
| "grad_norm": 0.22108010947704315, | |
| "learning_rate": 1.2449932222273137e-06, | |
| "loss": 0.07172244787216187, | |
| "mean_token_accuracy": 0.9990315437316895, | |
| "num_tokens": 121523418.0, | |
| "step": 757 | |
| }, | |
| { | |
| "aux_loss": 8.017167091369629, | |
| "entropy": 0.021951429545879364, | |
| "epoch": 18.048192771084338, | |
| "grad_norm": 0.27572283148765564, | |
| "learning_rate": 1.2445022648461716e-06, | |
| "loss": 0.07266423106193542, | |
| "mean_token_accuracy": 0.9990328252315521, | |
| "num_tokens": 121678552.0, | |
| "step": 758 | |
| }, | |
| { | |
| "aux_loss": 8.016557693481445, | |
| "entropy": 0.0203837463632226, | |
| "epoch": 18.072289156626507, | |
| "grad_norm": 0.2632099688053131, | |
| "learning_rate": 1.2440109527227037e-06, | |
| "loss": 0.07195623219013214, | |
| "mean_token_accuracy": 0.9990858137607574, | |
| "num_tokens": 121825520.0, | |
| "step": 759 | |
| }, | |
| { | |
| "aux_loss": 8.018312931060791, | |
| "entropy": 0.020994133315980434, | |
| "epoch": 18.096385542168676, | |
| "grad_norm": 0.27051058411598206, | |
| "learning_rate": 1.2435192869670168e-06, | |
| "loss": 0.0721668004989624, | |
| "mean_token_accuracy": 0.9990926384925842, | |
| "num_tokens": 121986116.0, | |
| "step": 760 | |
| }, | |
| { | |
| "aux_loss": 8.017702102661133, | |
| "entropy": 0.01970060635358095, | |
| "epoch": 18.120481927710845, | |
| "grad_norm": 0.23090173304080963, | |
| "learning_rate": 1.243027268690016e-06, | |
| "loss": 0.07158677279949188, | |
| "mean_token_accuracy": 0.9991891384124756, | |
| "num_tokens": 122156242.0, | |
| "step": 761 | |
| }, | |
| { | |
| "aux_loss": 8.019289016723633, | |
| "entropy": 0.021130764856934547, | |
| "epoch": 18.14457831325301, | |
| "grad_norm": 0.2537887692451477, | |
| "learning_rate": 1.2425348990034026e-06, | |
| "loss": 0.07236440479755402, | |
| "mean_token_accuracy": 0.999125063419342, | |
| "num_tokens": 122340036.0, | |
| "step": 762 | |
| }, | |
| { | |
| "aux_loss": 8.018044471740723, | |
| "entropy": 0.01954676304012537, | |
| "epoch": 18.16867469879518, | |
| "grad_norm": 0.2520613372325897, | |
| "learning_rate": 1.2420421790196733e-06, | |
| "loss": 0.07214604318141937, | |
| "mean_token_accuracy": 0.9987333118915558, | |
| "num_tokens": 122521317.0, | |
| "step": 763 | |
| }, | |
| { | |
| "aux_loss": 8.01823902130127, | |
| "entropy": 0.01993868313729763, | |
| "epoch": 18.19277108433735, | |
| "grad_norm": 0.24693681299686432, | |
| "learning_rate": 1.2415491098521152e-06, | |
| "loss": 0.07197412103414536, | |
| "mean_token_accuracy": 0.9989577829837799, | |
| "num_tokens": 122689596.0, | |
| "step": 764 | |
| }, | |
| { | |
| "aux_loss": 8.017821788787842, | |
| "entropy": 0.019117838703095913, | |
| "epoch": 18.216867469879517, | |
| "grad_norm": 0.25819259881973267, | |
| "learning_rate": 1.2410556926148043e-06, | |
| "loss": 0.07151195406913757, | |
| "mean_token_accuracy": 0.9991266429424286, | |
| "num_tokens": 122848887.0, | |
| "step": 765 | |
| }, | |
| { | |
| "aux_loss": 8.017277240753174, | |
| "entropy": 0.02282050345093012, | |
| "epoch": 18.240963855421686, | |
| "grad_norm": 0.3336971700191498, | |
| "learning_rate": 1.2405619284226036e-06, | |
| "loss": 0.07297661900520325, | |
| "mean_token_accuracy": 0.9989360868930817, | |
| "num_tokens": 123007977.0, | |
| "step": 766 | |
| }, | |
| { | |
| "aux_loss": 8.020303726196289, | |
| "entropy": 0.018516553565859795, | |
| "epoch": 18.265060240963855, | |
| "grad_norm": 0.2913930416107178, | |
| "learning_rate": 1.24006781839116e-06, | |
| "loss": 0.07139115035533905, | |
| "mean_token_accuracy": 0.9990445077419281, | |
| "num_tokens": 123183325.0, | |
| "step": 767 | |
| }, | |
| { | |
| "aux_loss": 8.017969131469727, | |
| "entropy": 0.020907875150442123, | |
| "epoch": 18.289156626506024, | |
| "grad_norm": 0.26279398798942566, | |
| "learning_rate": 1.2395733636369012e-06, | |
| "loss": 0.0723220556974411, | |
| "mean_token_accuracy": 0.9988578855991364, | |
| "num_tokens": 123354501.0, | |
| "step": 768 | |
| }, | |
| { | |
| "aux_loss": 8.01951789855957, | |
| "entropy": 0.019883046858012676, | |
| "epoch": 18.313253012048193, | |
| "grad_norm": 0.2431030571460724, | |
| "learning_rate": 1.2390785652770344e-06, | |
| "loss": 0.07210540771484375, | |
| "mean_token_accuracy": 0.9989734888076782, | |
| "num_tokens": 123522136.0, | |
| "step": 769 | |
| }, | |
| { | |
| "aux_loss": 8.018885612487793, | |
| "entropy": 0.018920441158115864, | |
| "epoch": 18.337349397590362, | |
| "grad_norm": 0.25550684332847595, | |
| "learning_rate": 1.2385834244295428e-06, | |
| "loss": 0.0715964287519455, | |
| "mean_token_accuracy": 0.9991505444049835, | |
| "num_tokens": 123662037.0, | |
| "step": 770 | |
| }, | |
| { | |
| "aux_loss": 8.017975330352783, | |
| "entropy": 0.021694052033126354, | |
| "epoch": 18.36144578313253, | |
| "grad_norm": 0.30290576815605164, | |
| "learning_rate": 1.238087942213184e-06, | |
| "loss": 0.07307359576225281, | |
| "mean_token_accuracy": 0.9989704787731171, | |
| "num_tokens": 123814012.0, | |
| "step": 771 | |
| }, | |
| { | |
| "aux_loss": 8.017130851745605, | |
| "entropy": 0.02111757453531027, | |
| "epoch": 18.3855421686747, | |
| "grad_norm": 0.3017498552799225, | |
| "learning_rate": 1.2375921197474862e-06, | |
| "loss": 0.07237553596496582, | |
| "mean_token_accuracy": 0.9989622533321381, | |
| "num_tokens": 123984333.0, | |
| "step": 772 | |
| }, | |
| { | |
| "aux_loss": 8.015630722045898, | |
| "entropy": 0.02062998153269291, | |
| "epoch": 18.40963855421687, | |
| "grad_norm": 0.2949274778366089, | |
| "learning_rate": 1.2370959581527464e-06, | |
| "loss": 0.07229379564523697, | |
| "mean_token_accuracy": 0.9989545941352844, | |
| "num_tokens": 124155932.0, | |
| "step": 773 | |
| }, | |
| { | |
| "aux_loss": 8.016655921936035, | |
| "entropy": 0.01841769553720951, | |
| "epoch": 18.433734939759034, | |
| "grad_norm": 0.25348353385925293, | |
| "learning_rate": 1.236599458550029e-06, | |
| "loss": 0.0715688019990921, | |
| "mean_token_accuracy": 0.9989084601402283, | |
| "num_tokens": 124320385.0, | |
| "step": 774 | |
| }, | |
| { | |
| "aux_loss": 8.01733684539795, | |
| "entropy": 0.021025179885327816, | |
| "epoch": 18.457831325301203, | |
| "grad_norm": 0.27677661180496216, | |
| "learning_rate": 1.2361026220611607e-06, | |
| "loss": 0.07285228371620178, | |
| "mean_token_accuracy": 0.9987456500530243, | |
| "num_tokens": 124486615.0, | |
| "step": 775 | |
| }, | |
| { | |
| "aux_loss": 8.017730236053467, | |
| "entropy": 0.022088666446506977, | |
| "epoch": 18.481927710843372, | |
| "grad_norm": 0.2776980400085449, | |
| "learning_rate": 1.2356054498087302e-06, | |
| "loss": 0.07264924049377441, | |
| "mean_token_accuracy": 0.99912890791893, | |
| "num_tokens": 124645740.0, | |
| "step": 776 | |
| }, | |
| { | |
| "aux_loss": 8.0174560546875, | |
| "entropy": 0.020048685371875763, | |
| "epoch": 18.50602409638554, | |
| "grad_norm": 0.4569571912288666, | |
| "learning_rate": 1.2351079429160842e-06, | |
| "loss": 0.07212985306978226, | |
| "mean_token_accuracy": 0.9989519417285919, | |
| "num_tokens": 124805207.0, | |
| "step": 777 | |
| }, | |
| { | |
| "aux_loss": 8.015850067138672, | |
| "entropy": 0.022110003978013992, | |
| "epoch": 18.53012048192771, | |
| "grad_norm": 0.2736422121524811, | |
| "learning_rate": 1.2346101025073264e-06, | |
| "loss": 0.07289471477270126, | |
| "mean_token_accuracy": 0.9988590180873871, | |
| "num_tokens": 124971034.0, | |
| "step": 778 | |
| }, | |
| { | |
| "aux_loss": 8.016895294189453, | |
| "entropy": 0.02094773482531309, | |
| "epoch": 18.55421686746988, | |
| "grad_norm": 0.27527254819869995, | |
| "learning_rate": 1.2341119297073133e-06, | |
| "loss": 0.07241301238536835, | |
| "mean_token_accuracy": 0.9987749755382538, | |
| "num_tokens": 125134164.0, | |
| "step": 779 | |
| }, | |
| { | |
| "aux_loss": 8.018424987792969, | |
| "entropy": 0.019557715393602848, | |
| "epoch": 18.57831325301205, | |
| "grad_norm": 0.2686154246330261, | |
| "learning_rate": 1.233613425641653e-06, | |
| "loss": 0.07223023474216461, | |
| "mean_token_accuracy": 0.9988672733306885, | |
| "num_tokens": 125303080.0, | |
| "step": 780 | |
| }, | |
| { | |
| "aux_loss": 8.016579627990723, | |
| "entropy": 0.02069095242768526, | |
| "epoch": 18.602409638554217, | |
| "grad_norm": 0.2709297835826874, | |
| "learning_rate": 1.2331145914367016e-06, | |
| "loss": 0.07235056161880493, | |
| "mean_token_accuracy": 0.9991201758384705, | |
| "num_tokens": 125457326.0, | |
| "step": 781 | |
| }, | |
| { | |
| "aux_loss": 8.017444133758545, | |
| "entropy": 0.019050849601626396, | |
| "epoch": 18.626506024096386, | |
| "grad_norm": 0.2603260278701782, | |
| "learning_rate": 1.2326154282195612e-06, | |
| "loss": 0.07184787094593048, | |
| "mean_token_accuracy": 0.9990633726119995, | |
| "num_tokens": 125623507.0, | |
| "step": 782 | |
| }, | |
| { | |
| "aux_loss": 8.016646385192871, | |
| "entropy": 0.020856465213000774, | |
| "epoch": 18.650602409638555, | |
| "grad_norm": 0.26723363995552063, | |
| "learning_rate": 1.232115937118078e-06, | |
| "loss": 0.0722731500864029, | |
| "mean_token_accuracy": 0.9991081357002258, | |
| "num_tokens": 125794453.0, | |
| "step": 783 | |
| }, | |
| { | |
| "aux_loss": 8.016578197479248, | |
| "entropy": 0.020370217971503735, | |
| "epoch": 18.674698795180724, | |
| "grad_norm": 0.24809421598911285, | |
| "learning_rate": 1.2316161192608378e-06, | |
| "loss": 0.07225576043128967, | |
| "mean_token_accuracy": 0.9988513886928558, | |
| "num_tokens": 125968466.0, | |
| "step": 784 | |
| }, | |
| { | |
| "aux_loss": 8.017183780670166, | |
| "entropy": 0.019782189279794693, | |
| "epoch": 18.698795180722893, | |
| "grad_norm": 0.27581024169921875, | |
| "learning_rate": 1.231115975777166e-06, | |
| "loss": 0.0719655454158783, | |
| "mean_token_accuracy": 0.9990843832492828, | |
| "num_tokens": 126129579.0, | |
| "step": 785 | |
| }, | |
| { | |
| "aux_loss": 8.016780853271484, | |
| "entropy": 0.02061288245022297, | |
| "epoch": 18.72289156626506, | |
| "grad_norm": 0.2525731325149536, | |
| "learning_rate": 1.2306155077971227e-06, | |
| "loss": 0.07215370237827301, | |
| "mean_token_accuracy": 0.9992306530475616, | |
| "num_tokens": 126292719.0, | |
| "step": 786 | |
| }, | |
| { | |
| "aux_loss": 8.016438007354736, | |
| "entropy": 0.021378587931394577, | |
| "epoch": 18.746987951807228, | |
| "grad_norm": 0.3300939202308655, | |
| "learning_rate": 1.2301147164515017e-06, | |
| "loss": 0.07247316092252731, | |
| "mean_token_accuracy": 0.9989226460456848, | |
| "num_tokens": 126458152.0, | |
| "step": 787 | |
| }, | |
| { | |
| "aux_loss": 8.017562866210938, | |
| "entropy": 0.023026008158922195, | |
| "epoch": 18.771084337349397, | |
| "grad_norm": 0.29177817702293396, | |
| "learning_rate": 1.2296136028718276e-06, | |
| "loss": 0.07325838506221771, | |
| "mean_token_accuracy": 0.9986927509307861, | |
| "num_tokens": 126608387.0, | |
| "step": 788 | |
| }, | |
| { | |
| "aux_loss": 8.01653003692627, | |
| "entropy": 0.02121768146753311, | |
| "epoch": 18.795180722891565, | |
| "grad_norm": 0.24625295400619507, | |
| "learning_rate": 1.2291121681903523e-06, | |
| "loss": 0.07226230949163437, | |
| "mean_token_accuracy": 0.998975396156311, | |
| "num_tokens": 126774101.0, | |
| "step": 789 | |
| }, | |
| { | |
| "aux_loss": 8.017135620117188, | |
| "entropy": 0.02047717571258545, | |
| "epoch": 18.819277108433734, | |
| "grad_norm": 0.28403371572494507, | |
| "learning_rate": 1.2286104135400546e-06, | |
| "loss": 0.07196817547082901, | |
| "mean_token_accuracy": 0.99922975897789, | |
| "num_tokens": 126948810.0, | |
| "step": 790 | |
| }, | |
| { | |
| "aux_loss": 8.017651081085205, | |
| "entropy": 0.02271729800850153, | |
| "epoch": 18.843373493975903, | |
| "grad_norm": 0.2664547264575958, | |
| "learning_rate": 1.2281083400546346e-06, | |
| "loss": 0.07297229021787643, | |
| "mean_token_accuracy": 0.9989756643772125, | |
| "num_tokens": 127123705.0, | |
| "step": 791 | |
| }, | |
| { | |
| "aux_loss": 8.016648292541504, | |
| "entropy": 0.022724810987710953, | |
| "epoch": 18.867469879518072, | |
| "grad_norm": 0.27334722876548767, | |
| "learning_rate": 1.227605948868514e-06, | |
| "loss": 0.07290689647197723, | |
| "mean_token_accuracy": 0.9990213513374329, | |
| "num_tokens": 127286211.0, | |
| "step": 792 | |
| }, | |
| { | |
| "aux_loss": 8.018507480621338, | |
| "entropy": 0.02393777295947075, | |
| "epoch": 18.89156626506024, | |
| "grad_norm": 0.2772607207298279, | |
| "learning_rate": 1.227103241116832e-06, | |
| "loss": 0.07380357384681702, | |
| "mean_token_accuracy": 0.9988025724887848, | |
| "num_tokens": 127454841.0, | |
| "step": 793 | |
| }, | |
| { | |
| "aux_loss": 8.014709949493408, | |
| "entropy": 0.022906312718987465, | |
| "epoch": 18.91566265060241, | |
| "grad_norm": 0.2939465641975403, | |
| "learning_rate": 1.2266002179354427e-06, | |
| "loss": 0.07364203035831451, | |
| "mean_token_accuracy": 0.9987647533416748, | |
| "num_tokens": 127601787.0, | |
| "step": 794 | |
| }, | |
| { | |
| "aux_loss": 8.014947414398193, | |
| "entropy": 0.02199286874383688, | |
| "epoch": 18.93975903614458, | |
| "grad_norm": 0.3006232976913452, | |
| "learning_rate": 1.2260968804609137e-06, | |
| "loss": 0.07279400527477264, | |
| "mean_token_accuracy": 0.9985716938972473, | |
| "num_tokens": 127743717.0, | |
| "step": 795 | |
| }, | |
| { | |
| "aux_loss": 8.016969680786133, | |
| "entropy": 0.02244889084249735, | |
| "epoch": 18.96385542168675, | |
| "grad_norm": 0.3185865879058838, | |
| "learning_rate": 1.225593229830522e-06, | |
| "loss": 0.07299022376537323, | |
| "mean_token_accuracy": 0.9987007081508636, | |
| "num_tokens": 127897148.0, | |
| "step": 796 | |
| }, | |
| { | |
| "aux_loss": 8.016538143157959, | |
| "entropy": 0.018228761851787567, | |
| "epoch": 18.987951807228917, | |
| "grad_norm": 0.24646823108196259, | |
| "learning_rate": 1.2250892671822523e-06, | |
| "loss": 0.07121360301971436, | |
| "mean_token_accuracy": 0.9989063739776611, | |
| "num_tokens": 128063518.0, | |
| "step": 797 | |
| }, | |
| { | |
| "aux_loss": 8.016475677490234, | |
| "entropy": 0.029299454763531685, | |
| "epoch": 19.0, | |
| "grad_norm": 0.4041454792022705, | |
| "learning_rate": 1.2245849936547948e-06, | |
| "loss": 0.040493883192539215, | |
| "mean_token_accuracy": 0.9988755583763123, | |
| "num_tokens": 128087797.0, | |
| "step": 798 | |
| }, | |
| { | |
| "aux_loss": 8.016082286834717, | |
| "entropy": 0.01707358844578266, | |
| "epoch": 19.02409638554217, | |
| "grad_norm": 0.2209968864917755, | |
| "learning_rate": 1.224080410387541e-06, | |
| "loss": 0.07054603844881058, | |
| "mean_token_accuracy": 0.9994014203548431, | |
| "num_tokens": 128257323.0, | |
| "step": 799 | |
| }, | |
| { | |
| "aux_loss": 8.016879081726074, | |
| "entropy": 0.020540348254144192, | |
| "epoch": 19.048192771084338, | |
| "grad_norm": 0.28073349595069885, | |
| "learning_rate": 1.223575518520584e-06, | |
| "loss": 0.07254428416490555, | |
| "mean_token_accuracy": 0.9990403950214386, | |
| "num_tokens": 128408675.0, | |
| "step": 800 | |
| }, | |
| { | |
| "aux_loss": 8.016739845275879, | |
| "entropy": 0.0186675563454628, | |
| "epoch": 19.072289156626507, | |
| "grad_norm": 0.22932597994804382, | |
| "learning_rate": 1.2230703191947125e-06, | |
| "loss": 0.07110397517681122, | |
| "mean_token_accuracy": 0.9992808401584625, | |
| "num_tokens": 128576966.0, | |
| "step": 801 | |
| }, | |
| { | |
| "aux_loss": 8.014533519744873, | |
| "entropy": 0.0216646958142519, | |
| "epoch": 19.096385542168676, | |
| "grad_norm": 0.24630875885486603, | |
| "learning_rate": 1.2225648135514107e-06, | |
| "loss": 0.0723528265953064, | |
| "mean_token_accuracy": 0.9988449215888977, | |
| "num_tokens": 128722275.0, | |
| "step": 802 | |
| }, | |
| { | |
| "aux_loss": 8.016851902008057, | |
| "entropy": 0.01763029955327511, | |
| "epoch": 19.120481927710845, | |
| "grad_norm": 0.23657096922397614, | |
| "learning_rate": 1.222059002732855e-06, | |
| "loss": 0.07095248252153397, | |
| "mean_token_accuracy": 0.9990513622760773, | |
| "num_tokens": 128893797.0, | |
| "step": 803 | |
| }, | |
| { | |
| "aux_loss": 8.017178535461426, | |
| "entropy": 0.020476515404880047, | |
| "epoch": 19.14457831325301, | |
| "grad_norm": 0.2538764476776123, | |
| "learning_rate": 1.221552887881911e-06, | |
| "loss": 0.07223986089229584, | |
| "mean_token_accuracy": 0.9988578855991364, | |
| "num_tokens": 129068433.0, | |
| "step": 804 | |
| }, | |
| { | |
| "aux_loss": 8.016830921173096, | |
| "entropy": 0.018701947294175625, | |
| "epoch": 19.16867469879518, | |
| "grad_norm": 0.24616143107414246, | |
| "learning_rate": 1.2210464701421311e-06, | |
| "loss": 0.0714377760887146, | |
| "mean_token_accuracy": 0.9991999268531799, | |
| "num_tokens": 129255686.0, | |
| "step": 805 | |
| }, | |
| { | |
| "aux_loss": 8.01766586303711, | |
| "entropy": 0.02190525457262993, | |
| "epoch": 19.19277108433735, | |
| "grad_norm": 0.257795125246048, | |
| "learning_rate": 1.2205397506577528e-06, | |
| "loss": 0.07279151678085327, | |
| "mean_token_accuracy": 0.9989840984344482, | |
| "num_tokens": 129426600.0, | |
| "step": 806 | |
| }, | |
| { | |
| "aux_loss": 8.01670217514038, | |
| "entropy": 0.022698327898979187, | |
| "epoch": 19.216867469879517, | |
| "grad_norm": 0.27151861786842346, | |
| "learning_rate": 1.2200327305736947e-06, | |
| "loss": 0.072884202003479, | |
| "mean_token_accuracy": 0.9989652335643768, | |
| "num_tokens": 129602609.0, | |
| "step": 807 | |
| }, | |
| { | |
| "aux_loss": 8.016786098480225, | |
| "entropy": 0.020293287932872772, | |
| "epoch": 19.240963855421686, | |
| "grad_norm": 0.260490357875824, | |
| "learning_rate": 1.2195254110355547e-06, | |
| "loss": 0.07177005708217621, | |
| "mean_token_accuracy": 0.9990547299385071, | |
| "num_tokens": 129764750.0, | |
| "step": 808 | |
| }, | |
| { | |
| "aux_loss": 8.01784610748291, | |
| "entropy": 0.02007181290537119, | |
| "epoch": 19.265060240963855, | |
| "grad_norm": 0.24022895097732544, | |
| "learning_rate": 1.2190177931896074e-06, | |
| "loss": 0.07160848379135132, | |
| "mean_token_accuracy": 0.9992149472236633, | |
| "num_tokens": 129933157.0, | |
| "step": 809 | |
| }, | |
| { | |
| "aux_loss": 8.018133163452148, | |
| "entropy": 0.02162711601704359, | |
| "epoch": 19.289156626506024, | |
| "grad_norm": 0.30957019329071045, | |
| "learning_rate": 1.2185098781828017e-06, | |
| "loss": 0.07218888401985168, | |
| "mean_token_accuracy": 0.998899906873703, | |
| "num_tokens": 130082077.0, | |
| "step": 810 | |
| }, | |
| { | |
| "aux_loss": 8.016764640808105, | |
| "entropy": 0.017992699518799782, | |
| "epoch": 19.313253012048193, | |
| "grad_norm": 0.23729471862316132, | |
| "learning_rate": 1.2180016671627576e-06, | |
| "loss": 0.0710437223315239, | |
| "mean_token_accuracy": 0.9992759525775909, | |
| "num_tokens": 130256356.0, | |
| "step": 811 | |
| }, | |
| { | |
| "aux_loss": 8.018122673034668, | |
| "entropy": 0.02003295347094536, | |
| "epoch": 19.337349397590362, | |
| "grad_norm": 0.2603780925273895, | |
| "learning_rate": 1.217493161277764e-06, | |
| "loss": 0.07190095633268356, | |
| "mean_token_accuracy": 0.9992459416389465, | |
| "num_tokens": 130428786.0, | |
| "step": 812 | |
| }, | |
| { | |
| "aux_loss": 8.015380382537842, | |
| "entropy": 0.02138371951878071, | |
| "epoch": 19.36144578313253, | |
| "grad_norm": 0.23855821788311005, | |
| "learning_rate": 1.216984361676776e-06, | |
| "loss": 0.07250922918319702, | |
| "mean_token_accuracy": 0.9992147982120514, | |
| "num_tokens": 130569702.0, | |
| "step": 813 | |
| }, | |
| { | |
| "aux_loss": 8.014621257781982, | |
| "entropy": 0.024525553919374943, | |
| "epoch": 19.3855421686747, | |
| "grad_norm": 0.2766070067882538, | |
| "learning_rate": 1.2164752695094123e-06, | |
| "loss": 0.0731203556060791, | |
| "mean_token_accuracy": 0.9991021752357483, | |
| "num_tokens": 130728155.0, | |
| "step": 814 | |
| }, | |
| { | |
| "aux_loss": 8.017411231994629, | |
| "entropy": 0.01734110154211521, | |
| "epoch": 19.40963855421687, | |
| "grad_norm": 0.30324476957321167, | |
| "learning_rate": 1.215965885925953e-06, | |
| "loss": 0.07086675614118576, | |
| "mean_token_accuracy": 0.9991721510887146, | |
| "num_tokens": 130906575.0, | |
| "step": 815 | |
| }, | |
| { | |
| "aux_loss": 8.016311168670654, | |
| "entropy": 0.020214502699673176, | |
| "epoch": 19.433734939759034, | |
| "grad_norm": 0.37634822726249695, | |
| "learning_rate": 1.2154562120773358e-06, | |
| "loss": 0.07189343869686127, | |
| "mean_token_accuracy": 0.9990342259407043, | |
| "num_tokens": 131067413.0, | |
| "step": 816 | |
| }, | |
| { | |
| "aux_loss": 8.015110492706299, | |
| "entropy": 0.023175804875791073, | |
| "epoch": 19.457831325301203, | |
| "grad_norm": 0.3171541690826416, | |
| "learning_rate": 1.2149462491151556e-06, | |
| "loss": 0.07334239780902863, | |
| "mean_token_accuracy": 0.9987165927886963, | |
| "num_tokens": 131214226.0, | |
| "step": 817 | |
| }, | |
| { | |
| "aux_loss": 8.015056610107422, | |
| "entropy": 0.019055875949561596, | |
| "epoch": 19.481927710843372, | |
| "grad_norm": 0.33125078678131104, | |
| "learning_rate": 1.2144359981916595e-06, | |
| "loss": 0.07168950885534286, | |
| "mean_token_accuracy": 0.9990333318710327, | |
| "num_tokens": 131359757.0, | |
| "step": 818 | |
| }, | |
| { | |
| "aux_loss": 8.013885974884033, | |
| "entropy": 0.02209868934005499, | |
| "epoch": 19.50602409638554, | |
| "grad_norm": 0.2984984219074249, | |
| "learning_rate": 1.2139254604597453e-06, | |
| "loss": 0.07285237312316895, | |
| "mean_token_accuracy": 0.9989113807678223, | |
| "num_tokens": 131496939.0, | |
| "step": 819 | |
| }, | |
| { | |
| "aux_loss": 8.015743255615234, | |
| "entropy": 0.020269363187253475, | |
| "epoch": 19.53012048192771, | |
| "grad_norm": 0.24305978417396545, | |
| "learning_rate": 1.2134146370729593e-06, | |
| "loss": 0.07186189293861389, | |
| "mean_token_accuracy": 0.9991940855979919, | |
| "num_tokens": 131648339.0, | |
| "step": 820 | |
| }, | |
| { | |
| "aux_loss": 8.016966819763184, | |
| "entropy": 0.018671550787985325, | |
| "epoch": 19.55421686746988, | |
| "grad_norm": 0.25464141368865967, | |
| "learning_rate": 1.2129035291854927e-06, | |
| "loss": 0.07103103399276733, | |
| "mean_token_accuracy": 0.9992456138134003, | |
| "num_tokens": 131819044.0, | |
| "step": 821 | |
| }, | |
| { | |
| "aux_loss": 8.016483783721924, | |
| "entropy": 0.0185864744707942, | |
| "epoch": 19.57831325301205, | |
| "grad_norm": 0.24460941553115845, | |
| "learning_rate": 1.2123921379521802e-06, | |
| "loss": 0.0713551789522171, | |
| "mean_token_accuracy": 0.9990330636501312, | |
| "num_tokens": 131988935.0, | |
| "step": 822 | |
| }, | |
| { | |
| "aux_loss": 8.014330863952637, | |
| "entropy": 0.019629787653684616, | |
| "epoch": 19.602409638554217, | |
| "grad_norm": 0.27499374747276306, | |
| "learning_rate": 1.2118804645284957e-06, | |
| "loss": 0.07154914736747742, | |
| "mean_token_accuracy": 0.9992263913154602, | |
| "num_tokens": 132157225.0, | |
| "step": 823 | |
| }, | |
| { | |
| "aux_loss": 8.016732692718506, | |
| "entropy": 0.019671409390866756, | |
| "epoch": 19.626506024096386, | |
| "grad_norm": 0.2679067850112915, | |
| "learning_rate": 1.211368510070552e-06, | |
| "loss": 0.07195160537958145, | |
| "mean_token_accuracy": 0.9990942776203156, | |
| "num_tokens": 132319583.0, | |
| "step": 824 | |
| }, | |
| { | |
| "aux_loss": 8.016017436981201, | |
| "entropy": 0.01897235121577978, | |
| "epoch": 19.650602409638555, | |
| "grad_norm": 0.31477922201156616, | |
| "learning_rate": 1.2108562757350959e-06, | |
| "loss": 0.07175606489181519, | |
| "mean_token_accuracy": 0.998927503824234, | |
| "num_tokens": 132461657.0, | |
| "step": 825 | |
| }, | |
| { | |
| "aux_loss": 8.017291069030762, | |
| "entropy": 0.017452422529459, | |
| "epoch": 19.674698795180724, | |
| "grad_norm": 0.23533299565315247, | |
| "learning_rate": 1.2103437626795066e-06, | |
| "loss": 0.07113629579544067, | |
| "mean_token_accuracy": 0.9991660118103027, | |
| "num_tokens": 132654439.0, | |
| "step": 826 | |
| }, | |
| { | |
| "aux_loss": 8.014272689819336, | |
| "entropy": 0.022786526009440422, | |
| "epoch": 19.698795180722893, | |
| "grad_norm": 0.2727932333946228, | |
| "learning_rate": 1.2098309720617938e-06, | |
| "loss": 0.07298114150762558, | |
| "mean_token_accuracy": 0.9988896250724792, | |
| "num_tokens": 132807186.0, | |
| "step": 827 | |
| }, | |
| { | |
| "aux_loss": 8.015275001525879, | |
| "entropy": 0.02233956567943096, | |
| "epoch": 19.72289156626506, | |
| "grad_norm": 0.2817685008049011, | |
| "learning_rate": 1.2093179050405935e-06, | |
| "loss": 0.07318785786628723, | |
| "mean_token_accuracy": 0.998853325843811, | |
| "num_tokens": 132947861.0, | |
| "step": 828 | |
| }, | |
| { | |
| "aux_loss": 8.016317367553711, | |
| "entropy": 0.01885117031633854, | |
| "epoch": 19.746987951807228, | |
| "grad_norm": 0.2575323283672333, | |
| "learning_rate": 1.208804562775167e-06, | |
| "loss": 0.07110799103975296, | |
| "mean_token_accuracy": 0.9993088245391846, | |
| "num_tokens": 133118610.0, | |
| "step": 829 | |
| }, | |
| { | |
| "aux_loss": 8.013425827026367, | |
| "entropy": 0.020050152204930782, | |
| "epoch": 19.771084337349397, | |
| "grad_norm": 0.25590944290161133, | |
| "learning_rate": 1.2082909464253968e-06, | |
| "loss": 0.07188734412193298, | |
| "mean_token_accuracy": 0.9991053342819214, | |
| "num_tokens": 133265190.0, | |
| "step": 830 | |
| }, | |
| { | |
| "aux_loss": 8.018101692199707, | |
| "entropy": 0.020321492105722427, | |
| "epoch": 19.795180722891565, | |
| "grad_norm": 0.2820008397102356, | |
| "learning_rate": 1.2077770571517851e-06, | |
| "loss": 0.07242708653211594, | |
| "mean_token_accuracy": 0.9988300800323486, | |
| "num_tokens": 133443361.0, | |
| "step": 831 | |
| }, | |
| { | |
| "aux_loss": 8.016617774963379, | |
| "entropy": 0.021538270637392998, | |
| "epoch": 19.819277108433734, | |
| "grad_norm": 0.29813796281814575, | |
| "learning_rate": 1.207262896115451e-06, | |
| "loss": 0.07250789552927017, | |
| "mean_token_accuracy": 0.9990063607692719, | |
| "num_tokens": 133619744.0, | |
| "step": 832 | |
| }, | |
| { | |
| "aux_loss": 8.016489028930664, | |
| "entropy": 0.017469782382249832, | |
| "epoch": 19.843373493975903, | |
| "grad_norm": 0.2585788071155548, | |
| "learning_rate": 1.2067484644781265e-06, | |
| "loss": 0.0711778849363327, | |
| "mean_token_accuracy": 0.9991479218006134, | |
| "num_tokens": 133798588.0, | |
| "step": 833 | |
| }, | |
| { | |
| "aux_loss": 8.01574182510376, | |
| "entropy": 0.020052564330399036, | |
| "epoch": 19.867469879518072, | |
| "grad_norm": 0.2874489724636078, | |
| "learning_rate": 1.2062337634021566e-06, | |
| "loss": 0.0720338225364685, | |
| "mean_token_accuracy": 0.99901282787323, | |
| "num_tokens": 133949653.0, | |
| "step": 834 | |
| }, | |
| { | |
| "aux_loss": 8.014959812164307, | |
| "entropy": 0.020040088333189487, | |
| "epoch": 19.89156626506024, | |
| "grad_norm": 0.26376113295555115, | |
| "learning_rate": 1.2057187940504941e-06, | |
| "loss": 0.07194425165653229, | |
| "mean_token_accuracy": 0.9990537166595459, | |
| "num_tokens": 134113370.0, | |
| "step": 835 | |
| }, | |
| { | |
| "aux_loss": 8.015164375305176, | |
| "entropy": 0.023158026859164238, | |
| "epoch": 19.91566265060241, | |
| "grad_norm": 0.2815038859844208, | |
| "learning_rate": 1.205203557586698e-06, | |
| "loss": 0.07307106256484985, | |
| "mean_token_accuracy": 0.9989737272262573, | |
| "num_tokens": 134286525.0, | |
| "step": 836 | |
| }, | |
| { | |
| "aux_loss": 8.017555236816406, | |
| "entropy": 0.017343491315841675, | |
| "epoch": 19.93975903614458, | |
| "grad_norm": 0.2515917420387268, | |
| "learning_rate": 1.204688055174931e-06, | |
| "loss": 0.07106645405292511, | |
| "mean_token_accuracy": 0.9990668594837189, | |
| "num_tokens": 134455231.0, | |
| "step": 837 | |
| }, | |
| { | |
| "aux_loss": 8.015775203704834, | |
| "entropy": 0.023353048600256443, | |
| "epoch": 19.96385542168675, | |
| "grad_norm": 0.29685935378074646, | |
| "learning_rate": 1.2041722879799568e-06, | |
| "loss": 0.07338288426399231, | |
| "mean_token_accuracy": 0.9986701309680939, | |
| "num_tokens": 134603410.0, | |
| "step": 838 | |
| }, | |
| { | |
| "aux_loss": 8.01530408859253, | |
| "entropy": 0.018707728944718838, | |
| "epoch": 19.987951807228917, | |
| "grad_norm": 0.26528769731521606, | |
| "learning_rate": 1.2036562571671374e-06, | |
| "loss": 0.0717005729675293, | |
| "mean_token_accuracy": 0.9990585446357727, | |
| "num_tokens": 134779729.0, | |
| "step": 839 | |
| }, | |
| { | |
| "aux_loss": 8.01617431640625, | |
| "entropy": 0.0191100612282753, | |
| "epoch": 20.0, | |
| "grad_norm": 0.32825803756713867, | |
| "learning_rate": 1.20313996390243e-06, | |
| "loss": 0.03942277655005455, | |
| "mean_token_accuracy": 0.9991744160652161, | |
| "num_tokens": 134829260.0, | |
| "step": 840 | |
| }, | |
| { | |
| "aux_loss": 8.013209819793701, | |
| "entropy": 0.02059428207576275, | |
| "epoch": 20.02409638554217, | |
| "grad_norm": 0.24572697281837463, | |
| "learning_rate": 1.2026234093523856e-06, | |
| "loss": 0.07189934700727463, | |
| "mean_token_accuracy": 0.9991085827350616, | |
| "num_tokens": 134992831.0, | |
| "step": 841 | |
| }, | |
| { | |
| "aux_loss": 8.012920379638672, | |
| "entropy": 0.021370324306190014, | |
| "epoch": 20.048192771084338, | |
| "grad_norm": 0.42761075496673584, | |
| "learning_rate": 1.2021065946841448e-06, | |
| "loss": 0.07216686010360718, | |
| "mean_token_accuracy": 0.998961329460144, | |
| "num_tokens": 135132806.0, | |
| "step": 842 | |
| }, | |
| { | |
| "aux_loss": 8.015305042266846, | |
| "entropy": 0.018415560014545918, | |
| "epoch": 20.072289156626507, | |
| "grad_norm": 0.23072311282157898, | |
| "learning_rate": 1.2015895210654361e-06, | |
| "loss": 0.07108470797538757, | |
| "mean_token_accuracy": 0.9991589784622192, | |
| "num_tokens": 135310245.0, | |
| "step": 843 | |
| }, | |
| { | |
| "aux_loss": 8.016035079956055, | |
| "entropy": 0.018389324657619, | |
| "epoch": 20.096385542168676, | |
| "grad_norm": 0.24892204999923706, | |
| "learning_rate": 1.2010721896645732e-06, | |
| "loss": 0.0708564817905426, | |
| "mean_token_accuracy": 0.9994164109230042, | |
| "num_tokens": 135478692.0, | |
| "step": 844 | |
| }, | |
| { | |
| "aux_loss": 8.015366554260254, | |
| "entropy": 0.020714948885142803, | |
| "epoch": 20.120481927710845, | |
| "grad_norm": 0.24307778477668762, | |
| "learning_rate": 1.2005546016504526e-06, | |
| "loss": 0.07157693803310394, | |
| "mean_token_accuracy": 0.9993534982204437, | |
| "num_tokens": 135628890.0, | |
| "step": 845 | |
| }, | |
| { | |
| "aux_loss": 8.01463508605957, | |
| "entropy": 0.0212752353399992, | |
| "epoch": 20.14457831325301, | |
| "grad_norm": 0.24047866463661194, | |
| "learning_rate": 1.20003675819255e-06, | |
| "loss": 0.0722416490316391, | |
| "mean_token_accuracy": 0.999059796333313, | |
| "num_tokens": 135782823.0, | |
| "step": 846 | |
| }, | |
| { | |
| "aux_loss": 8.01609992980957, | |
| "entropy": 0.019625852815806866, | |
| "epoch": 20.16867469879518, | |
| "grad_norm": 0.24964730441570282, | |
| "learning_rate": 1.1995186604609185e-06, | |
| "loss": 0.07153446972370148, | |
| "mean_token_accuracy": 0.9991658329963684, | |
| "num_tokens": 135958992.0, | |
| "step": 847 | |
| }, | |
| { | |
| "aux_loss": 8.015625, | |
| "entropy": 0.02252290118485689, | |
| "epoch": 20.19277108433735, | |
| "grad_norm": 0.2563897669315338, | |
| "learning_rate": 1.199000309626186e-06, | |
| "loss": 0.07267315685749054, | |
| "mean_token_accuracy": 0.9989122748374939, | |
| "num_tokens": 136126642.0, | |
| "step": 848 | |
| }, | |
| { | |
| "aux_loss": 8.016855239868164, | |
| "entropy": 0.01888811308890581, | |
| "epoch": 20.216867469879517, | |
| "grad_norm": 0.23033533990383148, | |
| "learning_rate": 1.1984817068595518e-06, | |
| "loss": 0.07117213308811188, | |
| "mean_token_accuracy": 0.9991577565670013, | |
| "num_tokens": 136297196.0, | |
| "step": 849 | |
| }, | |
| { | |
| "aux_loss": 8.01485824584961, | |
| "entropy": 0.018825308419764042, | |
| "epoch": 20.240963855421686, | |
| "grad_norm": 0.2620784342288971, | |
| "learning_rate": 1.1979628533327847e-06, | |
| "loss": 0.07108195126056671, | |
| "mean_token_accuracy": 0.9991429448127747, | |
| "num_tokens": 136451872.0, | |
| "step": 850 | |
| }, | |
| { | |
| "aux_loss": 8.015204906463623, | |
| "entropy": 0.01622555498033762, | |
| "epoch": 20.265060240963855, | |
| "grad_norm": 0.22484785318374634, | |
| "learning_rate": 1.1974437502182203e-06, | |
| "loss": 0.07052718847990036, | |
| "mean_token_accuracy": 0.9991798996925354, | |
| "num_tokens": 136619483.0, | |
| "step": 851 | |
| }, | |
| { | |
| "aux_loss": 8.017267227172852, | |
| "entropy": 0.016841549426317215, | |
| "epoch": 20.289156626506024, | |
| "grad_norm": 0.21868085861206055, | |
| "learning_rate": 1.1969243986887578e-06, | |
| "loss": 0.07062295079231262, | |
| "mean_token_accuracy": 0.9991513788700104, | |
| "num_tokens": 136807598.0, | |
| "step": 852 | |
| }, | |
| { | |
| "aux_loss": 8.014912605285645, | |
| "entropy": 0.019336337223649025, | |
| "epoch": 20.313253012048193, | |
| "grad_norm": 0.23610550165176392, | |
| "learning_rate": 1.1964047999178572e-06, | |
| "loss": 0.07179201394319534, | |
| "mean_token_accuracy": 0.9992705881595612, | |
| "num_tokens": 136972464.0, | |
| "step": 853 | |
| }, | |
| { | |
| "aux_loss": 8.013875007629395, | |
| "entropy": 0.02350557316094637, | |
| "epoch": 20.337349397590362, | |
| "grad_norm": 0.2529645264148712, | |
| "learning_rate": 1.1958849550795387e-06, | |
| "loss": 0.07279883325099945, | |
| "mean_token_accuracy": 0.9991186857223511, | |
| "num_tokens": 137127060.0, | |
| "step": 854 | |
| }, | |
| { | |
| "aux_loss": 8.015921115875244, | |
| "entropy": 0.020983693189918995, | |
| "epoch": 20.36144578313253, | |
| "grad_norm": 0.23120775818824768, | |
| "learning_rate": 1.195364865348377e-06, | |
| "loss": 0.0721922218799591, | |
| "mean_token_accuracy": 0.999091386795044, | |
| "num_tokens": 137282054.0, | |
| "step": 855 | |
| }, | |
| { | |
| "aux_loss": 8.017494201660156, | |
| "entropy": 0.018297821283340454, | |
| "epoch": 20.3855421686747, | |
| "grad_norm": 0.2224910408258438, | |
| "learning_rate": 1.1948445318995005e-06, | |
| "loss": 0.07094530761241913, | |
| "mean_token_accuracy": 0.9991941154003143, | |
| "num_tokens": 137461718.0, | |
| "step": 856 | |
| }, | |
| { | |
| "aux_loss": 8.01477336883545, | |
| "entropy": 0.015757147688418627, | |
| "epoch": 20.40963855421687, | |
| "grad_norm": 0.2883114218711853, | |
| "learning_rate": 1.1943239559085886e-06, | |
| "loss": 0.07010868191719055, | |
| "mean_token_accuracy": 0.9994107782840729, | |
| "num_tokens": 137630346.0, | |
| "step": 857 | |
| }, | |
| { | |
| "aux_loss": 8.013188362121582, | |
| "entropy": 0.021769145503640175, | |
| "epoch": 20.433734939759034, | |
| "grad_norm": 0.2615295350551605, | |
| "learning_rate": 1.1938031385518685e-06, | |
| "loss": 0.07243753969669342, | |
| "mean_token_accuracy": 0.9989071488380432, | |
| "num_tokens": 137765802.0, | |
| "step": 858 | |
| }, | |
| { | |
| "aux_loss": 8.015521049499512, | |
| "entropy": 0.01864070724695921, | |
| "epoch": 20.457831325301203, | |
| "grad_norm": 0.231665700674057, | |
| "learning_rate": 1.1932820810061128e-06, | |
| "loss": 0.07132695615291595, | |
| "mean_token_accuracy": 0.9991524517536163, | |
| "num_tokens": 137931822.0, | |
| "step": 859 | |
| }, | |
| { | |
| "aux_loss": 8.014593601226807, | |
| "entropy": 0.01945006474852562, | |
| "epoch": 20.481927710843372, | |
| "grad_norm": 0.2958713173866272, | |
| "learning_rate": 1.1927607844486368e-06, | |
| "loss": 0.07161392271518707, | |
| "mean_token_accuracy": 0.9991827607154846, | |
| "num_tokens": 138095894.0, | |
| "step": 860 | |
| }, | |
| { | |
| "aux_loss": 8.01363468170166, | |
| "entropy": 0.019185454584658146, | |
| "epoch": 20.50602409638554, | |
| "grad_norm": 0.262090802192688, | |
| "learning_rate": 1.1922392500572957e-06, | |
| "loss": 0.07143920660018921, | |
| "mean_token_accuracy": 0.9991458058357239, | |
| "num_tokens": 138263788.0, | |
| "step": 861 | |
| }, | |
| { | |
| "aux_loss": 8.015174388885498, | |
| "entropy": 0.017392096109688282, | |
| "epoch": 20.53012048192771, | |
| "grad_norm": 0.250765323638916, | |
| "learning_rate": 1.1917174790104822e-06, | |
| "loss": 0.07097406685352325, | |
| "mean_token_accuracy": 0.9991758763790131, | |
| "num_tokens": 138433292.0, | |
| "step": 862 | |
| }, | |
| { | |
| "aux_loss": 8.016233921051025, | |
| "entropy": 0.02018314227461815, | |
| "epoch": 20.55421686746988, | |
| "grad_norm": 0.24786005914211273, | |
| "learning_rate": 1.1911954724871238e-06, | |
| "loss": 0.07198825478553772, | |
| "mean_token_accuracy": 0.9992509484291077, | |
| "num_tokens": 138594833.0, | |
| "step": 863 | |
| }, | |
| { | |
| "aux_loss": 8.014333724975586, | |
| "entropy": 0.01877683959901333, | |
| "epoch": 20.57831325301205, | |
| "grad_norm": 0.24034591019153595, | |
| "learning_rate": 1.1906732316666802e-06, | |
| "loss": 0.07137183845043182, | |
| "mean_token_accuracy": 0.9990993142127991, | |
| "num_tokens": 138750172.0, | |
| "step": 864 | |
| }, | |
| { | |
| "aux_loss": 8.015239238739014, | |
| "entropy": 0.019693774171173573, | |
| "epoch": 20.602409638554217, | |
| "grad_norm": 0.28064224123954773, | |
| "learning_rate": 1.1901507577291398e-06, | |
| "loss": 0.07180516421794891, | |
| "mean_token_accuracy": 0.998885989189148, | |
| "num_tokens": 138917870.0, | |
| "step": 865 | |
| }, | |
| { | |
| "aux_loss": 8.016077041625977, | |
| "entropy": 0.021774998866021633, | |
| "epoch": 20.626506024096386, | |
| "grad_norm": 0.25658896565437317, | |
| "learning_rate": 1.1896280518550184e-06, | |
| "loss": 0.07241100072860718, | |
| "mean_token_accuracy": 0.9991808533668518, | |
| "num_tokens": 139091508.0, | |
| "step": 866 | |
| }, | |
| { | |
| "aux_loss": 8.01535940170288, | |
| "entropy": 0.01949040312319994, | |
| "epoch": 20.650602409638555, | |
| "grad_norm": 0.2877894639968872, | |
| "learning_rate": 1.1891051152253557e-06, | |
| "loss": 0.07161968946456909, | |
| "mean_token_accuracy": 0.9990425705909729, | |
| "num_tokens": 139264973.0, | |
| "step": 867 | |
| }, | |
| { | |
| "aux_loss": 8.014946937561035, | |
| "entropy": 0.021726500242948532, | |
| "epoch": 20.674698795180724, | |
| "grad_norm": 0.28723615407943726, | |
| "learning_rate": 1.1885819490217124e-06, | |
| "loss": 0.07256714999675751, | |
| "mean_token_accuracy": 0.9991051852703094, | |
| "num_tokens": 139440246.0, | |
| "step": 868 | |
| }, | |
| { | |
| "aux_loss": 8.015090942382812, | |
| "entropy": 0.017755858600139618, | |
| "epoch": 20.698795180722893, | |
| "grad_norm": 0.2656784951686859, | |
| "learning_rate": 1.1880585544261689e-06, | |
| "loss": 0.07081268727779388, | |
| "mean_token_accuracy": 0.9991943538188934, | |
| "num_tokens": 139611484.0, | |
| "step": 869 | |
| }, | |
| { | |
| "aux_loss": 8.017644882202148, | |
| "entropy": 0.017926585860550404, | |
| "epoch": 20.72289156626506, | |
| "grad_norm": 0.25008681416511536, | |
| "learning_rate": 1.1875349326213202e-06, | |
| "loss": 0.07092377543449402, | |
| "mean_token_accuracy": 0.9991013407707214, | |
| "num_tokens": 139786451.0, | |
| "step": 870 | |
| }, | |
| { | |
| "aux_loss": 8.014115333557129, | |
| "entropy": 0.019910937640815973, | |
| "epoch": 20.746987951807228, | |
| "grad_norm": 0.2600031793117523, | |
| "learning_rate": 1.187011084790276e-06, | |
| "loss": 0.07185967266559601, | |
| "mean_token_accuracy": 0.9992063343524933, | |
| "num_tokens": 139940870.0, | |
| "step": 871 | |
| }, | |
| { | |
| "aux_loss": 8.014479637145996, | |
| "entropy": 0.01817234791815281, | |
| "epoch": 20.771084337349397, | |
| "grad_norm": 0.24683645367622375, | |
| "learning_rate": 1.1864870121166558e-06, | |
| "loss": 0.07097449898719788, | |
| "mean_token_accuracy": 0.9990246891975403, | |
| "num_tokens": 140110786.0, | |
| "step": 872 | |
| }, | |
| { | |
| "aux_loss": 8.0132417678833, | |
| "entropy": 0.01734836306422949, | |
| "epoch": 20.795180722891565, | |
| "grad_norm": 0.25990185141563416, | |
| "learning_rate": 1.1859627157845877e-06, | |
| "loss": 0.07099585235118866, | |
| "mean_token_accuracy": 0.9992154836654663, | |
| "num_tokens": 140281015.0, | |
| "step": 873 | |
| }, | |
| { | |
| "aux_loss": 8.015357971191406, | |
| "entropy": 0.018785839900374413, | |
| "epoch": 20.819277108433734, | |
| "grad_norm": 0.28464582562446594, | |
| "learning_rate": 1.185438196978705e-06, | |
| "loss": 0.07173855602741241, | |
| "mean_token_accuracy": 0.9988526701927185, | |
| "num_tokens": 140431751.0, | |
| "step": 874 | |
| }, | |
| { | |
| "aux_loss": 8.016085624694824, | |
| "entropy": 0.02032049559056759, | |
| "epoch": 20.843373493975903, | |
| "grad_norm": 0.29489409923553467, | |
| "learning_rate": 1.1849134568841436e-06, | |
| "loss": 0.07205380499362946, | |
| "mean_token_accuracy": 0.9989710748195648, | |
| "num_tokens": 140604033.0, | |
| "step": 875 | |
| }, | |
| { | |
| "aux_loss": 8.01557207107544, | |
| "entropy": 0.020371905528008938, | |
| "epoch": 20.867469879518072, | |
| "grad_norm": 0.26816612482070923, | |
| "learning_rate": 1.184388496686539e-06, | |
| "loss": 0.07203839719295502, | |
| "mean_token_accuracy": 0.9989346861839294, | |
| "num_tokens": 140762882.0, | |
| "step": 876 | |
| }, | |
| { | |
| "aux_loss": 8.011805057525635, | |
| "entropy": 0.01969855558127165, | |
| "epoch": 20.89156626506024, | |
| "grad_norm": 0.2511252164840698, | |
| "learning_rate": 1.1838633175720249e-06, | |
| "loss": 0.07142087072134018, | |
| "mean_token_accuracy": 0.9991007447242737, | |
| "num_tokens": 140913810.0, | |
| "step": 877 | |
| }, | |
| { | |
| "aux_loss": 8.015848636627197, | |
| "entropy": 0.018998843617737293, | |
| "epoch": 20.91566265060241, | |
| "grad_norm": 0.2623438835144043, | |
| "learning_rate": 1.183337920727229e-06, | |
| "loss": 0.07181046903133392, | |
| "mean_token_accuracy": 0.9990564286708832, | |
| "num_tokens": 141068865.0, | |
| "step": 878 | |
| }, | |
| { | |
| "aux_loss": 8.013355731964111, | |
| "entropy": 0.019784594886004925, | |
| "epoch": 20.93975903614458, | |
| "grad_norm": 0.28874844312667847, | |
| "learning_rate": 1.1828123073392708e-06, | |
| "loss": 0.0717635452747345, | |
| "mean_token_accuracy": 0.9990528523921967, | |
| "num_tokens": 141222703.0, | |
| "step": 879 | |
| }, | |
| { | |
| "aux_loss": 8.01409912109375, | |
| "entropy": 0.021358169615268707, | |
| "epoch": 20.96385542168675, | |
| "grad_norm": 0.2645207941532135, | |
| "learning_rate": 1.1822864785957597e-06, | |
| "loss": 0.07192955911159515, | |
| "mean_token_accuracy": 0.9991900324821472, | |
| "num_tokens": 141379277.0, | |
| "step": 880 | |
| }, | |
| { | |
| "aux_loss": 8.015501976013184, | |
| "entropy": 0.018178369849920273, | |
| "epoch": 20.987951807228917, | |
| "grad_norm": 0.2733187973499298, | |
| "learning_rate": 1.1817604356847914e-06, | |
| "loss": 0.07119777798652649, | |
| "mean_token_accuracy": 0.9990058541297913, | |
| "num_tokens": 141529476.0, | |
| "step": 881 | |
| }, | |
| { | |
| "aux_loss": 8.014284133911133, | |
| "entropy": 0.015183513052761555, | |
| "epoch": 21.0, | |
| "grad_norm": 0.34507277607917786, | |
| "learning_rate": 1.1812341797949455e-06, | |
| "loss": 0.03846766799688339, | |
| "mean_token_accuracy": 0.9994618892669678, | |
| "num_tokens": 141570723.0, | |
| "step": 882 | |
| }, | |
| { | |
| "aux_loss": 8.01323127746582, | |
| "entropy": 0.018154023215174675, | |
| "epoch": 21.02409638554217, | |
| "grad_norm": 0.24614425003528595, | |
| "learning_rate": 1.1807077121152827e-06, | |
| "loss": 0.07076417654752731, | |
| "mean_token_accuracy": 0.9993391036987305, | |
| "num_tokens": 141757507.0, | |
| "step": 883 | |
| }, | |
| { | |
| "aux_loss": 8.013922691345215, | |
| "entropy": 0.01983295939862728, | |
| "epoch": 21.048192771084338, | |
| "grad_norm": 0.24692152440547943, | |
| "learning_rate": 1.180181033835342e-06, | |
| "loss": 0.07120583951473236, | |
| "mean_token_accuracy": 0.9993802905082703, | |
| "num_tokens": 141894930.0, | |
| "step": 884 | |
| }, | |
| { | |
| "aux_loss": 8.014530181884766, | |
| "entropy": 0.019670534878969193, | |
| "epoch": 21.072289156626507, | |
| "grad_norm": 0.24641910195350647, | |
| "learning_rate": 1.179654146145139e-06, | |
| "loss": 0.0713525116443634, | |
| "mean_token_accuracy": 0.9992433786392212, | |
| "num_tokens": 142063547.0, | |
| "step": 885 | |
| }, | |
| { | |
| "aux_loss": 8.015149116516113, | |
| "entropy": 0.019047324545681477, | |
| "epoch": 21.096385542168676, | |
| "grad_norm": 0.24476729333400726, | |
| "learning_rate": 1.1791270502351621e-06, | |
| "loss": 0.07117617130279541, | |
| "mean_token_accuracy": 0.9990925788879395, | |
| "num_tokens": 142237959.0, | |
| "step": 886 | |
| }, | |
| { | |
| "aux_loss": 8.013380527496338, | |
| "entropy": 0.02015339396893978, | |
| "epoch": 21.120481927710845, | |
| "grad_norm": 0.23826949298381805, | |
| "learning_rate": 1.1785997472963697e-06, | |
| "loss": 0.07169397175312042, | |
| "mean_token_accuracy": 0.9991181790828705, | |
| "num_tokens": 142391101.0, | |
| "step": 887 | |
| }, | |
| { | |
| "aux_loss": 8.015638828277588, | |
| "entropy": 0.024460233747959137, | |
| "epoch": 21.14457831325301, | |
| "grad_norm": 0.27939584851264954, | |
| "learning_rate": 1.1780722385201889e-06, | |
| "loss": 0.07349646836519241, | |
| "mean_token_accuracy": 0.9990708231925964, | |
| "num_tokens": 142512794.0, | |
| "step": 888 | |
| }, | |
| { | |
| "aux_loss": 8.012683868408203, | |
| "entropy": 0.02155546471476555, | |
| "epoch": 21.16867469879518, | |
| "grad_norm": 0.24982911348342896, | |
| "learning_rate": 1.177544525098511e-06, | |
| "loss": 0.07213179767131805, | |
| "mean_token_accuracy": 0.9991197288036346, | |
| "num_tokens": 142670945.0, | |
| "step": 889 | |
| }, | |
| { | |
| "aux_loss": 8.01441478729248, | |
| "entropy": 0.02026781253516674, | |
| "epoch": 21.19277108433735, | |
| "grad_norm": 0.2505277097225189, | |
| "learning_rate": 1.17701660822369e-06, | |
| "loss": 0.07161730527877808, | |
| "mean_token_accuracy": 0.999284565448761, | |
| "num_tokens": 142817197.0, | |
| "step": 890 | |
| }, | |
| { | |
| "aux_loss": 8.015609741210938, | |
| "entropy": 0.01686427928507328, | |
| "epoch": 21.216867469879517, | |
| "grad_norm": 0.25400081276893616, | |
| "learning_rate": 1.1764884890885399e-06, | |
| "loss": 0.07048171758651733, | |
| "mean_token_accuracy": 0.9993577897548676, | |
| "num_tokens": 142979993.0, | |
| "step": 891 | |
| }, | |
| { | |
| "aux_loss": 8.015190601348877, | |
| "entropy": 0.016790298745036125, | |
| "epoch": 21.240963855421686, | |
| "grad_norm": 0.21269014477729797, | |
| "learning_rate": 1.175960168886331e-06, | |
| "loss": 0.07070891559123993, | |
| "mean_token_accuracy": 0.9992137253284454, | |
| "num_tokens": 143171670.0, | |
| "step": 892 | |
| }, | |
| { | |
| "aux_loss": 8.013529777526855, | |
| "entropy": 0.016728555783629417, | |
| "epoch": 21.265060240963855, | |
| "grad_norm": 0.2346455454826355, | |
| "learning_rate": 1.175431648810789e-06, | |
| "loss": 0.07016371190547943, | |
| "mean_token_accuracy": 0.9994739890098572, | |
| "num_tokens": 143335367.0, | |
| "step": 893 | |
| }, | |
| { | |
| "aux_loss": 8.01320505142212, | |
| "entropy": 0.017979947850108147, | |
| "epoch": 21.289156626506024, | |
| "grad_norm": 0.24540981650352478, | |
| "learning_rate": 1.1749029300560899e-06, | |
| "loss": 0.07062411308288574, | |
| "mean_token_accuracy": 0.9991055130958557, | |
| "num_tokens": 143494903.0, | |
| "step": 894 | |
| }, | |
| { | |
| "aux_loss": 8.013950824737549, | |
| "entropy": 0.020114672370254993, | |
| "epoch": 21.313253012048193, | |
| "grad_norm": 0.2551021873950958, | |
| "learning_rate": 1.17437401381686e-06, | |
| "loss": 0.0715552270412445, | |
| "mean_token_accuracy": 0.9991988241672516, | |
| "num_tokens": 143652508.0, | |
| "step": 895 | |
| }, | |
| { | |
| "aux_loss": 8.014235496520996, | |
| "entropy": 0.01615771744400263, | |
| "epoch": 21.337349397590362, | |
| "grad_norm": 0.24847005307674408, | |
| "learning_rate": 1.1738449012881706e-06, | |
| "loss": 0.07049012184143066, | |
| "mean_token_accuracy": 0.999138742685318, | |
| "num_tokens": 143815733.0, | |
| "step": 896 | |
| }, | |
| { | |
| "aux_loss": 8.014393329620361, | |
| "entropy": 0.022052861750125885, | |
| "epoch": 21.36144578313253, | |
| "grad_norm": 0.2577436864376068, | |
| "learning_rate": 1.1733155936655368e-06, | |
| "loss": 0.07279989123344421, | |
| "mean_token_accuracy": 0.9989136755466461, | |
| "num_tokens": 143986677.0, | |
| "step": 897 | |
| }, | |
| { | |
| "aux_loss": 8.01253890991211, | |
| "entropy": 0.018677118234336376, | |
| "epoch": 21.3855421686747, | |
| "grad_norm": 0.22350162267684937, | |
| "learning_rate": 1.1727860921449152e-06, | |
| "loss": 0.07126197218894958, | |
| "mean_token_accuracy": 0.9991850852966309, | |
| "num_tokens": 144150595.0, | |
| "step": 898 | |
| }, | |
| { | |
| "aux_loss": 8.015076160430908, | |
| "entropy": 0.017602560110390186, | |
| "epoch": 21.40963855421687, | |
| "grad_norm": 0.22461570799350739, | |
| "learning_rate": 1.1722563979226998e-06, | |
| "loss": 0.07061722129583359, | |
| "mean_token_accuracy": 0.9992894530296326, | |
| "num_tokens": 144321176.0, | |
| "step": 899 | |
| }, | |
| { | |
| "aux_loss": 8.014989852905273, | |
| "entropy": 0.01876959018409252, | |
| "epoch": 21.433734939759034, | |
| "grad_norm": 0.2587912082672119, | |
| "learning_rate": 1.17172651219572e-06, | |
| "loss": 0.07115986943244934, | |
| "mean_token_accuracy": 0.9990778565406799, | |
| "num_tokens": 144491907.0, | |
| "step": 900 | |
| }, | |
| { | |
| "aux_loss": 8.015000820159912, | |
| "entropy": 0.018395491875708103, | |
| "epoch": 21.457831325301203, | |
| "grad_norm": 0.23809660971164703, | |
| "learning_rate": 1.1711964361612385e-06, | |
| "loss": 0.07099337875843048, | |
| "mean_token_accuracy": 0.9992078840732574, | |
| "num_tokens": 144649417.0, | |
| "step": 901 | |
| }, | |
| { | |
| "aux_loss": 8.014244556427002, | |
| "entropy": 0.017675181850790977, | |
| "epoch": 21.481927710843372, | |
| "grad_norm": 0.24655362963676453, | |
| "learning_rate": 1.1706661710169475e-06, | |
| "loss": 0.0707675963640213, | |
| "mean_token_accuracy": 0.9993148446083069, | |
| "num_tokens": 144811954.0, | |
| "step": 902 | |
| }, | |
| { | |
| "aux_loss": 8.014013290405273, | |
| "entropy": 0.019099495373666286, | |
| "epoch": 21.50602409638554, | |
| "grad_norm": 0.24485772848129272, | |
| "learning_rate": 1.1701357179609666e-06, | |
| "loss": 0.07114608585834503, | |
| "mean_token_accuracy": 0.9993022382259369, | |
| "num_tokens": 144970306.0, | |
| "step": 903 | |
| }, | |
| { | |
| "aux_loss": 8.012389659881592, | |
| "entropy": 0.020937589928507805, | |
| "epoch": 21.53012048192771, | |
| "grad_norm": 0.2481389045715332, | |
| "learning_rate": 1.1696050781918398e-06, | |
| "loss": 0.07180596143007278, | |
| "mean_token_accuracy": 0.999099999666214, | |
| "num_tokens": 145115040.0, | |
| "step": 904 | |
| }, | |
| { | |
| "aux_loss": 8.014892578125, | |
| "entropy": 0.018934819847345352, | |
| "epoch": 21.55421686746988, | |
| "grad_norm": 0.2642694115638733, | |
| "learning_rate": 1.169074252908533e-06, | |
| "loss": 0.07122250646352768, | |
| "mean_token_accuracy": 0.9992123246192932, | |
| "num_tokens": 145279167.0, | |
| "step": 905 | |
| }, | |
| { | |
| "aux_loss": 8.014004707336426, | |
| "entropy": 0.021409288980066776, | |
| "epoch": 21.57831325301205, | |
| "grad_norm": 0.2766292989253998, | |
| "learning_rate": 1.168543243310432e-06, | |
| "loss": 0.07221560180187225, | |
| "mean_token_accuracy": 0.9993177652359009, | |
| "num_tokens": 145447208.0, | |
| "step": 906 | |
| }, | |
| { | |
| "aux_loss": 8.014603614807129, | |
| "entropy": 0.01751386933028698, | |
| "epoch": 21.602409638554217, | |
| "grad_norm": 0.25062957406044006, | |
| "learning_rate": 1.1680120505973382e-06, | |
| "loss": 0.0708167627453804, | |
| "mean_token_accuracy": 0.9991951882839203, | |
| "num_tokens": 145606489.0, | |
| "step": 907 | |
| }, | |
| { | |
| "aux_loss": 8.018440246582031, | |
| "entropy": 0.015230256132781506, | |
| "epoch": 21.626506024096386, | |
| "grad_norm": 0.25712889432907104, | |
| "learning_rate": 1.1674806759694668e-06, | |
| "loss": 0.07026419043540955, | |
| "mean_token_accuracy": 0.9993832409381866, | |
| "num_tokens": 145772295.0, | |
| "step": 908 | |
| }, | |
| { | |
| "aux_loss": 8.013906478881836, | |
| "entropy": 0.017842063680291176, | |
| "epoch": 21.650602409638555, | |
| "grad_norm": 0.2853424847126007, | |
| "learning_rate": 1.1669491206274444e-06, | |
| "loss": 0.0708966851234436, | |
| "mean_token_accuracy": 0.9990724325180054, | |
| "num_tokens": 145909545.0, | |
| "step": 909 | |
| }, | |
| { | |
| "aux_loss": 8.012400150299072, | |
| "entropy": 0.019418477080762386, | |
| "epoch": 21.674698795180724, | |
| "grad_norm": 0.2649625241756439, | |
| "learning_rate": 1.1664173857723058e-06, | |
| "loss": 0.0713847279548645, | |
| "mean_token_accuracy": 0.9992568492889404, | |
| "num_tokens": 146067220.0, | |
| "step": 910 | |
| }, | |
| { | |
| "aux_loss": 8.015399932861328, | |
| "entropy": 0.017952339723706245, | |
| "epoch": 21.698795180722893, | |
| "grad_norm": 0.2824140191078186, | |
| "learning_rate": 1.1658854726054913e-06, | |
| "loss": 0.07136330008506775, | |
| "mean_token_accuracy": 0.9991283416748047, | |
| "num_tokens": 146241091.0, | |
| "step": 911 | |
| }, | |
| { | |
| "aux_loss": 8.014923095703125, | |
| "entropy": 0.020302233286201954, | |
| "epoch": 21.72289156626506, | |
| "grad_norm": 0.27626627683639526, | |
| "learning_rate": 1.1653533823288444e-06, | |
| "loss": 0.07169334590435028, | |
| "mean_token_accuracy": 0.9992359578609467, | |
| "num_tokens": 146407090.0, | |
| "step": 912 | |
| }, | |
| { | |
| "aux_loss": 8.01394510269165, | |
| "entropy": 0.018771435134112835, | |
| "epoch": 21.746987951807228, | |
| "grad_norm": 0.2780453562736511, | |
| "learning_rate": 1.1648211161446084e-06, | |
| "loss": 0.07132960855960846, | |
| "mean_token_accuracy": 0.9989534914493561, | |
| "num_tokens": 146572741.0, | |
| "step": 913 | |
| }, | |
| { | |
| "aux_loss": 8.014733791351318, | |
| "entropy": 0.017568754963576794, | |
| "epoch": 21.771084337349397, | |
| "grad_norm": 0.24800656735897064, | |
| "learning_rate": 1.164288675255424e-06, | |
| "loss": 0.07059050351381302, | |
| "mean_token_accuracy": 0.9992434084415436, | |
| "num_tokens": 146771249.0, | |
| "step": 914 | |
| }, | |
| { | |
| "aux_loss": 8.013745307922363, | |
| "entropy": 0.018569269217550755, | |
| "epoch": 21.795180722891565, | |
| "grad_norm": 0.2566494047641754, | |
| "learning_rate": 1.1637560608643269e-06, | |
| "loss": 0.07117751240730286, | |
| "mean_token_accuracy": 0.9991358816623688, | |
| "num_tokens": 146927606.0, | |
| "step": 915 | |
| }, | |
| { | |
| "aux_loss": 8.014211654663086, | |
| "entropy": 0.019441496580839157, | |
| "epoch": 21.819277108433734, | |
| "grad_norm": 0.27913621068000793, | |
| "learning_rate": 1.1632232741747449e-06, | |
| "loss": 0.07145224511623383, | |
| "mean_token_accuracy": 0.9990966022014618, | |
| "num_tokens": 147078302.0, | |
| "step": 916 | |
| }, | |
| { | |
| "aux_loss": 8.012444496154785, | |
| "entropy": 0.019019109196960926, | |
| "epoch": 21.843373493975903, | |
| "grad_norm": 0.28188833594322205, | |
| "learning_rate": 1.1626903163904948e-06, | |
| "loss": 0.07167785614728928, | |
| "mean_token_accuracy": 0.9990155696868896, | |
| "num_tokens": 147233952.0, | |
| "step": 917 | |
| }, | |
| { | |
| "aux_loss": 8.01331901550293, | |
| "entropy": 0.01779519859701395, | |
| "epoch": 21.867469879518072, | |
| "grad_norm": 0.27154967188835144, | |
| "learning_rate": 1.1621571887157803e-06, | |
| "loss": 0.07083356380462646, | |
| "mean_token_accuracy": 0.9991532564163208, | |
| "num_tokens": 147400698.0, | |
| "step": 918 | |
| }, | |
| { | |
| "aux_loss": 8.013606548309326, | |
| "entropy": 0.017602672800421715, | |
| "epoch": 21.89156626506024, | |
| "grad_norm": 0.2656519114971161, | |
| "learning_rate": 1.1616238923551887e-06, | |
| "loss": 0.07089027762413025, | |
| "mean_token_accuracy": 0.9992519021034241, | |
| "num_tokens": 147582738.0, | |
| "step": 919 | |
| }, | |
| { | |
| "aux_loss": 8.015371799468994, | |
| "entropy": 0.018127653747797012, | |
| "epoch": 21.91566265060241, | |
| "grad_norm": 0.2636999189853668, | |
| "learning_rate": 1.1610904285136886e-06, | |
| "loss": 0.07094477117061615, | |
| "mean_token_accuracy": 0.9991376996040344, | |
| "num_tokens": 147775785.0, | |
| "step": 920 | |
| }, | |
| { | |
| "aux_loss": 8.013552188873291, | |
| "entropy": 0.01729942485690117, | |
| "epoch": 21.93975903614458, | |
| "grad_norm": 0.26023203134536743, | |
| "learning_rate": 1.1605567983966271e-06, | |
| "loss": 0.07063956558704376, | |
| "mean_token_accuracy": 0.9993418455123901, | |
| "num_tokens": 147936430.0, | |
| "step": 921 | |
| }, | |
| { | |
| "aux_loss": 8.014430522918701, | |
| "entropy": 0.015739817172288895, | |
| "epoch": 21.96385542168675, | |
| "grad_norm": 0.2076667696237564, | |
| "learning_rate": 1.1600230032097266e-06, | |
| "loss": 0.07040604948997498, | |
| "mean_token_accuracy": 0.999272495508194, | |
| "num_tokens": 148137575.0, | |
| "step": 922 | |
| }, | |
| { | |
| "aux_loss": 8.011709213256836, | |
| "entropy": 0.019408750347793102, | |
| "epoch": 21.987951807228917, | |
| "grad_norm": 0.2545049786567688, | |
| "learning_rate": 1.1594890441590829e-06, | |
| "loss": 0.07166232168674469, | |
| "mean_token_accuracy": 0.9990161955356598, | |
| "num_tokens": 148288575.0, | |
| "step": 923 | |
| }, | |
| { | |
| "aux_loss": 8.014568328857422, | |
| "entropy": 0.019053278490900993, | |
| "epoch": 22.0, | |
| "grad_norm": 0.4009021818637848, | |
| "learning_rate": 1.1589549224511617e-06, | |
| "loss": 0.03886584937572479, | |
| "mean_token_accuracy": 0.9992607831954956, | |
| "num_tokens": 148312186.0, | |
| "step": 924 | |
| }, | |
| { | |
| "aux_loss": 8.012784957885742, | |
| "entropy": 0.02153092809021473, | |
| "epoch": 22.02409638554217, | |
| "grad_norm": 0.28903302550315857, | |
| "learning_rate": 1.1584206392927964e-06, | |
| "loss": 0.07154347747564316, | |
| "mean_token_accuracy": 0.9992208480834961, | |
| "num_tokens": 148470444.0, | |
| "step": 925 | |
| }, | |
| { | |
| "aux_loss": 8.011584758758545, | |
| "entropy": 0.019011841155588627, | |
| "epoch": 22.048192771084338, | |
| "grad_norm": 0.24408678710460663, | |
| "learning_rate": 1.1578861958911858e-06, | |
| "loss": 0.07099132239818573, | |
| "mean_token_accuracy": 0.9993138909339905, | |
| "num_tokens": 148613601.0, | |
| "step": 926 | |
| }, | |
| { | |
| "aux_loss": 8.014337539672852, | |
| "entropy": 0.015908177476376295, | |
| "epoch": 22.072289156626507, | |
| "grad_norm": 0.19189028441905975, | |
| "learning_rate": 1.1573515934538894e-06, | |
| "loss": 0.07044023275375366, | |
| "mean_token_accuracy": 0.9995050430297852, | |
| "num_tokens": 148808547.0, | |
| "step": 927 | |
| }, | |
| { | |
| "aux_loss": 8.014455795288086, | |
| "entropy": 0.021229710429906845, | |
| "epoch": 22.096385542168676, | |
| "grad_norm": 0.23952123522758484, | |
| "learning_rate": 1.156816833188827e-06, | |
| "loss": 0.07193786650896072, | |
| "mean_token_accuracy": 0.999223917722702, | |
| "num_tokens": 148956844.0, | |
| "step": 928 | |
| }, | |
| { | |
| "aux_loss": 8.014805316925049, | |
| "entropy": 0.01621132530272007, | |
| "epoch": 22.120481927710845, | |
| "grad_norm": 0.20052631199359894, | |
| "learning_rate": 1.156281916304275e-06, | |
| "loss": 0.07020527124404907, | |
| "mean_token_accuracy": 0.9993305206298828, | |
| "num_tokens": 149138544.0, | |
| "step": 929 | |
| }, | |
| { | |
| "aux_loss": 8.015092849731445, | |
| "entropy": 0.015159159898757935, | |
| "epoch": 22.14457831325301, | |
| "grad_norm": 0.27986496686935425, | |
| "learning_rate": 1.1557468440088635e-06, | |
| "loss": 0.06961491703987122, | |
| "mean_token_accuracy": 0.9994818866252899, | |
| "num_tokens": 149315148.0, | |
| "step": 930 | |
| }, | |
| { | |
| "aux_loss": 8.012570858001709, | |
| "entropy": 0.0210476228967309, | |
| "epoch": 22.16867469879518, | |
| "grad_norm": 0.25468602776527405, | |
| "learning_rate": 1.155211617511573e-06, | |
| "loss": 0.07175370305776596, | |
| "mean_token_accuracy": 0.9991936087608337, | |
| "num_tokens": 149448140.0, | |
| "step": 931 | |
| }, | |
| { | |
| "aux_loss": 8.014810562133789, | |
| "entropy": 0.01643281104043126, | |
| "epoch": 22.19277108433735, | |
| "grad_norm": 0.23826348781585693, | |
| "learning_rate": 1.1546762380217341e-06, | |
| "loss": 0.07052358984947205, | |
| "mean_token_accuracy": 0.9991428852081299, | |
| "num_tokens": 149619716.0, | |
| "step": 932 | |
| }, | |
| { | |
| "aux_loss": 8.01404619216919, | |
| "entropy": 0.016487995628267527, | |
| "epoch": 22.216867469879517, | |
| "grad_norm": 0.20834019780158997, | |
| "learning_rate": 1.1541407067490219e-06, | |
| "loss": 0.06992585211992264, | |
| "mean_token_accuracy": 0.9993537664413452, | |
| "num_tokens": 149793148.0, | |
| "step": 933 | |
| }, | |
| { | |
| "aux_loss": 8.014398574829102, | |
| "entropy": 0.016304658725857735, | |
| "epoch": 22.240963855421686, | |
| "grad_norm": 0.2243112474679947, | |
| "learning_rate": 1.1536050249034543e-06, | |
| "loss": 0.07004868239164352, | |
| "mean_token_accuracy": 0.9993802905082703, | |
| "num_tokens": 149951761.0, | |
| "step": 934 | |
| }, | |
| { | |
| "aux_loss": 8.013888359069824, | |
| "entropy": 0.01798428315669298, | |
| "epoch": 22.265060240963855, | |
| "grad_norm": 0.2289910614490509, | |
| "learning_rate": 1.15306919369539e-06, | |
| "loss": 0.0706726610660553, | |
| "mean_token_accuracy": 0.9993649125099182, | |
| "num_tokens": 150121451.0, | |
| "step": 935 | |
| }, | |
| { | |
| "aux_loss": 8.013855457305908, | |
| "entropy": 0.02033137623220682, | |
| "epoch": 22.289156626506024, | |
| "grad_norm": 0.26931989192962646, | |
| "learning_rate": 1.152533214335525e-06, | |
| "loss": 0.07192891091108322, | |
| "mean_token_accuracy": 0.9989032745361328, | |
| "num_tokens": 150293770.0, | |
| "step": 936 | |
| }, | |
| { | |
| "aux_loss": 8.013188362121582, | |
| "entropy": 0.018230491317808628, | |
| "epoch": 22.313253012048193, | |
| "grad_norm": 0.2354254126548767, | |
| "learning_rate": 1.1519970880348897e-06, | |
| "loss": 0.0709499642252922, | |
| "mean_token_accuracy": 0.9992497563362122, | |
| "num_tokens": 150461016.0, | |
| "step": 937 | |
| }, | |
| { | |
| "aux_loss": 8.01400089263916, | |
| "entropy": 0.017842641100287437, | |
| "epoch": 22.337349397590362, | |
| "grad_norm": 0.23199482262134552, | |
| "learning_rate": 1.1514608160048474e-06, | |
| "loss": 0.07077157497406006, | |
| "mean_token_accuracy": 0.9993587136268616, | |
| "num_tokens": 150634921.0, | |
| "step": 938 | |
| }, | |
| { | |
| "aux_loss": 8.015130043029785, | |
| "entropy": 0.016422214452177286, | |
| "epoch": 22.36144578313253, | |
| "grad_norm": 0.22542262077331543, | |
| "learning_rate": 1.1509243994570896e-06, | |
| "loss": 0.07013031840324402, | |
| "mean_token_accuracy": 0.9994313418865204, | |
| "num_tokens": 150790405.0, | |
| "step": 939 | |
| }, | |
| { | |
| "aux_loss": 8.014851093292236, | |
| "entropy": 0.017874456010758877, | |
| "epoch": 22.3855421686747, | |
| "grad_norm": 0.23647861182689667, | |
| "learning_rate": 1.1503878396036351e-06, | |
| "loss": 0.07073527574539185, | |
| "mean_token_accuracy": 0.9994246959686279, | |
| "num_tokens": 150962793.0, | |
| "step": 940 | |
| }, | |
| { | |
| "aux_loss": 8.014474391937256, | |
| "entropy": 0.016588577069342136, | |
| "epoch": 22.40963855421687, | |
| "grad_norm": 0.24759569764137268, | |
| "learning_rate": 1.1498511376568263e-06, | |
| "loss": 0.07012608647346497, | |
| "mean_token_accuracy": 0.9993808269500732, | |
| "num_tokens": 151114021.0, | |
| "step": 941 | |
| }, | |
| { | |
| "aux_loss": 8.011907577514648, | |
| "entropy": 0.017437142319977283, | |
| "epoch": 22.433734939759034, | |
| "grad_norm": 0.24111858010292053, | |
| "learning_rate": 1.149314294829326e-06, | |
| "loss": 0.07041236758232117, | |
| "mean_token_accuracy": 0.9992009699344635, | |
| "num_tokens": 151284169.0, | |
| "step": 942 | |
| }, | |
| { | |
| "aux_loss": 8.01377248764038, | |
| "entropy": 0.01878757541999221, | |
| "epoch": 22.457831325301203, | |
| "grad_norm": 0.2375716269016266, | |
| "learning_rate": 1.1487773123341168e-06, | |
| "loss": 0.07128296792507172, | |
| "mean_token_accuracy": 0.9991564154624939, | |
| "num_tokens": 151446283.0, | |
| "step": 943 | |
| }, | |
| { | |
| "aux_loss": 8.013377666473389, | |
| "entropy": 0.01606868812814355, | |
| "epoch": 22.481927710843372, | |
| "grad_norm": 0.24183540046215057, | |
| "learning_rate": 1.1482401913844952e-06, | |
| "loss": 0.0703459233045578, | |
| "mean_token_accuracy": 0.9992804527282715, | |
| "num_tokens": 151616540.0, | |
| "step": 944 | |
| }, | |
| { | |
| "aux_loss": 8.014086723327637, | |
| "entropy": 0.016903758980333805, | |
| "epoch": 22.50602409638554, | |
| "grad_norm": 0.23826339840888977, | |
| "learning_rate": 1.1477029331940715e-06, | |
| "loss": 0.07059438526630402, | |
| "mean_token_accuracy": 0.9992112219333649, | |
| "num_tokens": 151787787.0, | |
| "step": 945 | |
| }, | |
| { | |
| "aux_loss": 8.012079238891602, | |
| "entropy": 0.018823054619133472, | |
| "epoch": 22.53012048192771, | |
| "grad_norm": 0.2557152807712555, | |
| "learning_rate": 1.1471655389767661e-06, | |
| "loss": 0.07144980132579803, | |
| "mean_token_accuracy": 0.9991010427474976, | |
| "num_tokens": 151943958.0, | |
| "step": 946 | |
| }, | |
| { | |
| "aux_loss": 8.013519763946533, | |
| "entropy": 0.01882808655500412, | |
| "epoch": 22.55421686746988, | |
| "grad_norm": 0.2529004216194153, | |
| "learning_rate": 1.1466280099468065e-06, | |
| "loss": 0.07127431035041809, | |
| "mean_token_accuracy": 0.9991658926010132, | |
| "num_tokens": 152109362.0, | |
| "step": 947 | |
| }, | |
| { | |
| "aux_loss": 8.011232376098633, | |
| "entropy": 0.01898039411753416, | |
| "epoch": 22.57831325301205, | |
| "grad_norm": 0.254921555519104, | |
| "learning_rate": 1.1460903473187245e-06, | |
| "loss": 0.07110169529914856, | |
| "mean_token_accuracy": 0.9991906583309174, | |
| "num_tokens": 152260576.0, | |
| "step": 948 | |
| }, | |
| { | |
| "aux_loss": 8.011157035827637, | |
| "entropy": 0.019723043777048588, | |
| "epoch": 22.602409638554217, | |
| "grad_norm": 0.25754013657569885, | |
| "learning_rate": 1.1455525523073545e-06, | |
| "loss": 0.07162071764469147, | |
| "mean_token_accuracy": 0.9990551769733429, | |
| "num_tokens": 152399337.0, | |
| "step": 949 | |
| }, | |
| { | |
| "aux_loss": 8.013039112091064, | |
| "entropy": 0.01904588472098112, | |
| "epoch": 22.626506024096386, | |
| "grad_norm": 0.26531389355659485, | |
| "learning_rate": 1.1450146261278295e-06, | |
| "loss": 0.07106468081474304, | |
| "mean_token_accuracy": 0.9992550611495972, | |
| "num_tokens": 152561815.0, | |
| "step": 950 | |
| }, | |
| { | |
| "aux_loss": 8.013493061065674, | |
| "entropy": 0.01632722606882453, | |
| "epoch": 22.650602409638555, | |
| "grad_norm": 0.24526332318782806, | |
| "learning_rate": 1.144476569995579e-06, | |
| "loss": 0.07015934586524963, | |
| "mean_token_accuracy": 0.9993216693401337, | |
| "num_tokens": 152732201.0, | |
| "step": 951 | |
| }, | |
| { | |
| "aux_loss": 8.014325141906738, | |
| "entropy": 0.018475313670933247, | |
| "epoch": 22.674698795180724, | |
| "grad_norm": 0.24589988589286804, | |
| "learning_rate": 1.143938385126326e-06, | |
| "loss": 0.07068803906440735, | |
| "mean_token_accuracy": 0.9994083344936371, | |
| "num_tokens": 152901782.0, | |
| "step": 952 | |
| }, | |
| { | |
| "aux_loss": 8.014365673065186, | |
| "entropy": 0.019621457904577255, | |
| "epoch": 22.698795180722893, | |
| "grad_norm": 0.5130637288093567, | |
| "learning_rate": 1.143400072736085e-06, | |
| "loss": 0.07160702347755432, | |
| "mean_token_accuracy": 0.9991608262062073, | |
| "num_tokens": 153067819.0, | |
| "step": 953 | |
| }, | |
| { | |
| "aux_loss": 8.01173210144043, | |
| "entropy": 0.02212008461356163, | |
| "epoch": 22.72289156626506, | |
| "grad_norm": 0.28811657428741455, | |
| "learning_rate": 1.1428616340411574e-06, | |
| "loss": 0.07209309190511703, | |
| "mean_token_accuracy": 0.9992563426494598, | |
| "num_tokens": 153215820.0, | |
| "step": 954 | |
| }, | |
| { | |
| "aux_loss": 8.012729167938232, | |
| "entropy": 0.019486146979033947, | |
| "epoch": 22.746987951807228, | |
| "grad_norm": 0.2485649138689041, | |
| "learning_rate": 1.1423230702581313e-06, | |
| "loss": 0.07139360904693604, | |
| "mean_token_accuracy": 0.9991364181041718, | |
| "num_tokens": 153379581.0, | |
| "step": 955 | |
| }, | |
| { | |
| "aux_loss": 8.01283073425293, | |
| "entropy": 0.018342016264796257, | |
| "epoch": 22.771084337349397, | |
| "grad_norm": 0.24916580319404602, | |
| "learning_rate": 1.1417843826038762e-06, | |
| "loss": 0.07104545831680298, | |
| "mean_token_accuracy": 0.9992525577545166, | |
| "num_tokens": 153548225.0, | |
| "step": 956 | |
| }, | |
| { | |
| "aux_loss": 8.012862205505371, | |
| "entropy": 0.01778554916381836, | |
| "epoch": 22.795180722891565, | |
| "grad_norm": 0.23696421086788177, | |
| "learning_rate": 1.1412455722955428e-06, | |
| "loss": 0.07087703049182892, | |
| "mean_token_accuracy": 0.9993714392185211, | |
| "num_tokens": 153708967.0, | |
| "step": 957 | |
| }, | |
| { | |
| "aux_loss": 8.01194429397583, | |
| "entropy": 0.01852086652070284, | |
| "epoch": 22.819277108433734, | |
| "grad_norm": 0.23247742652893066, | |
| "learning_rate": 1.140706640550558e-06, | |
| "loss": 0.07102647423744202, | |
| "mean_token_accuracy": 0.999399334192276, | |
| "num_tokens": 153864772.0, | |
| "step": 958 | |
| }, | |
| { | |
| "aux_loss": 8.0131254196167, | |
| "entropy": 0.019301623106002808, | |
| "epoch": 22.843373493975903, | |
| "grad_norm": 0.2517237365245819, | |
| "learning_rate": 1.1401675885866233e-06, | |
| "loss": 0.07131901383399963, | |
| "mean_token_accuracy": 0.9991787075996399, | |
| "num_tokens": 154044797.0, | |
| "step": 959 | |
| }, | |
| { | |
| "aux_loss": 8.01394510269165, | |
| "entropy": 0.01689683459699154, | |
| "epoch": 22.867469879518072, | |
| "grad_norm": 0.24177652597427368, | |
| "learning_rate": 1.139628417621712e-06, | |
| "loss": 0.07088659703731537, | |
| "mean_token_accuracy": 0.9991794228553772, | |
| "num_tokens": 154213117.0, | |
| "step": 960 | |
| }, | |
| { | |
| "aux_loss": 8.014339923858643, | |
| "entropy": 0.014581645373255014, | |
| "epoch": 22.89156626506024, | |
| "grad_norm": 0.2341250479221344, | |
| "learning_rate": 1.139089128874066e-06, | |
| "loss": 0.06967546045780182, | |
| "mean_token_accuracy": 0.9994029998779297, | |
| "num_tokens": 154390961.0, | |
| "step": 961 | |
| }, | |
| { | |
| "aux_loss": 8.013369083404541, | |
| "entropy": 0.018853779416531324, | |
| "epoch": 22.91566265060241, | |
| "grad_norm": 0.252960205078125, | |
| "learning_rate": 1.1385497235621936e-06, | |
| "loss": 0.07136285305023193, | |
| "mean_token_accuracy": 0.9990043938159943, | |
| "num_tokens": 154536253.0, | |
| "step": 962 | |
| }, | |
| { | |
| "aux_loss": 8.01185655593872, | |
| "entropy": 0.017755253240466118, | |
| "epoch": 22.93975903614458, | |
| "grad_norm": 0.24129363894462585, | |
| "learning_rate": 1.1380102029048663e-06, | |
| "loss": 0.07058435678482056, | |
| "mean_token_accuracy": 0.9995276033878326, | |
| "num_tokens": 154698949.0, | |
| "step": 963 | |
| }, | |
| { | |
| "aux_loss": 8.011659145355225, | |
| "entropy": 0.017914061434566975, | |
| "epoch": 22.96385542168675, | |
| "grad_norm": 0.28093233704566956, | |
| "learning_rate": 1.1374705681211163e-06, | |
| "loss": 0.07093275338411331, | |
| "mean_token_accuracy": 0.9991449415683746, | |
| "num_tokens": 154845775.0, | |
| "step": 964 | |
| }, | |
| { | |
| "aux_loss": 8.012037754058838, | |
| "entropy": 0.0187357971444726, | |
| "epoch": 22.987951807228917, | |
| "grad_norm": 0.24145640432834625, | |
| "learning_rate": 1.1369308204302335e-06, | |
| "loss": 0.0712050125002861, | |
| "mean_token_accuracy": 0.9991163313388824, | |
| "num_tokens": 155015616.0, | |
| "step": 965 | |
| }, | |
| { | |
| "aux_loss": 8.011124610900879, | |
| "entropy": 0.01684977114200592, | |
| "epoch": 23.0, | |
| "grad_norm": 0.3900095820426941, | |
| "learning_rate": 1.1363909610517634e-06, | |
| "loss": 0.03998487815260887, | |
| "mean_token_accuracy": 0.9991750121116638, | |
| "num_tokens": 155053649.0, | |
| "step": 966 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 2100, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 50, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 3.2147329412004577e+19, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |