Instructions to use greyAll/test-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use greyAll/test-lora with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("greyAll/test-lora", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 210, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "aux_loss": 8.045117378234863, | |
| "entropy": 0.05226727016270161, | |
| "epoch": 0.024096385542168676, | |
| "grad_norm": 0.5021907687187195, | |
| "learning_rate": 0.0, | |
| "loss": 0.09741637855768204, | |
| "mean_token_accuracy": 0.9888820052146912, | |
| "num_tokens": 154362.0, | |
| "step": 1 | |
| }, | |
| { | |
| "aux_loss": 8.047614574432373, | |
| "entropy": 0.05835266411304474, | |
| "epoch": 0.04819277108433735, | |
| "grad_norm": 0.551396369934082, | |
| "learning_rate": 1.4500000000000001e-07, | |
| "loss": 0.09991507232189178, | |
| "mean_token_accuracy": 0.9883801937103271, | |
| "num_tokens": 310702.0, | |
| "step": 2 | |
| }, | |
| { | |
| "aux_loss": 8.049727439880371, | |
| "entropy": 0.052583809942007065, | |
| "epoch": 0.07228915662650602, | |
| "grad_norm": 0.4750031530857086, | |
| "learning_rate": 2.9000000000000003e-07, | |
| "loss": 0.09806497395038605, | |
| "mean_token_accuracy": 0.9886206984519958, | |
| "num_tokens": 493904.0, | |
| "step": 3 | |
| }, | |
| { | |
| "aux_loss": 8.047826766967773, | |
| "entropy": 0.05231792479753494, | |
| "epoch": 0.0963855421686747, | |
| "grad_norm": 0.4863564074039459, | |
| "learning_rate": 4.35e-07, | |
| "loss": 0.09776315838098526, | |
| "mean_token_accuracy": 0.9888334274291992, | |
| "num_tokens": 663136.0, | |
| "step": 4 | |
| }, | |
| { | |
| "aux_loss": 8.047198295593262, | |
| "entropy": 0.04943128302693367, | |
| "epoch": 0.12048192771084337, | |
| "grad_norm": 0.5010114908218384, | |
| "learning_rate": 5.800000000000001e-07, | |
| "loss": 0.09543517231941223, | |
| "mean_token_accuracy": 0.9894405901432037, | |
| "num_tokens": 812532.0, | |
| "step": 5 | |
| }, | |
| { | |
| "aux_loss": 8.049106121063232, | |
| "entropy": 0.063042301684618, | |
| "epoch": 0.14457831325301204, | |
| "grad_norm": 0.5165722966194153, | |
| "learning_rate": 7.25e-07, | |
| "loss": 0.10346449911594391, | |
| "mean_token_accuracy": 0.987544983625412, | |
| "num_tokens": 973071.0, | |
| "step": 6 | |
| }, | |
| { | |
| "aux_loss": 8.047893047332764, | |
| "entropy": 0.0672433041036129, | |
| "epoch": 0.1686746987951807, | |
| "grad_norm": 0.5849524736404419, | |
| "learning_rate": 8.7e-07, | |
| "loss": 0.10626787692308426, | |
| "mean_token_accuracy": 0.9862557649612427, | |
| "num_tokens": 1110326.0, | |
| "step": 7 | |
| }, | |
| { | |
| "aux_loss": 8.04862642288208, | |
| "entropy": 0.06088166497647762, | |
| "epoch": 0.1927710843373494, | |
| "grad_norm": 0.48005586862564087, | |
| "learning_rate": 1.015e-06, | |
| "loss": 0.1021210104227066, | |
| "mean_token_accuracy": 0.9877255260944366, | |
| "num_tokens": 1259440.0, | |
| "step": 8 | |
| }, | |
| { | |
| "aux_loss": 8.047185897827148, | |
| "entropy": 0.049826065078377724, | |
| "epoch": 0.21686746987951808, | |
| "grad_norm": 0.43366947770118713, | |
| "learning_rate": 1.1600000000000001e-06, | |
| "loss": 0.09475715458393097, | |
| "mean_token_accuracy": 0.9898165464401245, | |
| "num_tokens": 1417756.0, | |
| "step": 9 | |
| }, | |
| { | |
| "aux_loss": 8.04772663116455, | |
| "entropy": 0.054957231506705284, | |
| "epoch": 0.24096385542168675, | |
| "grad_norm": 0.4529463052749634, | |
| "learning_rate": 1.3050000000000002e-06, | |
| "loss": 0.09896557033061981, | |
| "mean_token_accuracy": 0.9889253675937653, | |
| "num_tokens": 1579862.0, | |
| "step": 10 | |
| }, | |
| { | |
| "aux_loss": 8.047585487365723, | |
| "entropy": 0.05796742998063564, | |
| "epoch": 0.26506024096385544, | |
| "grad_norm": 0.45284125208854675, | |
| "learning_rate": 1.45e-06, | |
| "loss": 0.10001235455274582, | |
| "mean_token_accuracy": 0.9876790642738342, | |
| "num_tokens": 1731184.0, | |
| "step": 11 | |
| }, | |
| { | |
| "aux_loss": 8.04898738861084, | |
| "entropy": 0.05215233750641346, | |
| "epoch": 0.2891566265060241, | |
| "grad_norm": 0.4420299828052521, | |
| "learning_rate": 1.4499995904705798e-06, | |
| "loss": 0.09724222123622894, | |
| "mean_token_accuracy": 0.9884337782859802, | |
| "num_tokens": 1893932.0, | |
| "step": 12 | |
| }, | |
| { | |
| "aux_loss": 8.04798412322998, | |
| "entropy": 0.05265074409544468, | |
| "epoch": 0.3132530120481928, | |
| "grad_norm": 0.40204742550849915, | |
| "learning_rate": 1.4499983618832442e-06, | |
| "loss": 0.0970243290066719, | |
| "mean_token_accuracy": 0.989496260881424, | |
| "num_tokens": 2053005.0, | |
| "step": 13 | |
| }, | |
| { | |
| "aux_loss": 8.05030107498169, | |
| "entropy": 0.049178898334503174, | |
| "epoch": 0.3373493975903614, | |
| "grad_norm": 0.4108814597129822, | |
| "learning_rate": 1.4499963142407692e-06, | |
| "loss": 0.09499870240688324, | |
| "mean_token_accuracy": 0.9897345900535583, | |
| "num_tokens": 2217039.0, | |
| "step": 14 | |
| }, | |
| { | |
| "aux_loss": 8.046091079711914, | |
| "entropy": 0.0504351407289505, | |
| "epoch": 0.3614457831325301, | |
| "grad_norm": 0.4030505418777466, | |
| "learning_rate": 1.4499934475477814e-06, | |
| "loss": 0.09597203135490417, | |
| "mean_token_accuracy": 0.9898054599761963, | |
| "num_tokens": 2386769.0, | |
| "step": 15 | |
| }, | |
| { | |
| "aux_loss": 8.047934532165527, | |
| "entropy": 0.04648676887154579, | |
| "epoch": 0.3855421686746988, | |
| "grad_norm": 0.4123123586177826, | |
| "learning_rate": 1.4499897618107582e-06, | |
| "loss": 0.09345895051956177, | |
| "mean_token_accuracy": 0.989924967288971, | |
| "num_tokens": 2551093.0, | |
| "step": 16 | |
| }, | |
| { | |
| "aux_loss": 8.04793405532837, | |
| "entropy": 0.04946734011173248, | |
| "epoch": 0.40963855421686746, | |
| "grad_norm": 0.42739129066467285, | |
| "learning_rate": 1.4499852570380272e-06, | |
| "loss": 0.09633760154247284, | |
| "mean_token_accuracy": 0.9889810979366302, | |
| "num_tokens": 2704860.0, | |
| "step": 17 | |
| }, | |
| { | |
| "aux_loss": 8.048253536224365, | |
| "entropy": 0.0546275470405817, | |
| "epoch": 0.43373493975903615, | |
| "grad_norm": 0.44881728291511536, | |
| "learning_rate": 1.449979933239767e-06, | |
| "loss": 0.09820500761270523, | |
| "mean_token_accuracy": 0.9885384142398834, | |
| "num_tokens": 2850860.0, | |
| "step": 18 | |
| }, | |
| { | |
| "aux_loss": 8.050773620605469, | |
| "entropy": 0.05041976273059845, | |
| "epoch": 0.4578313253012048, | |
| "grad_norm": 0.46621593832969666, | |
| "learning_rate": 1.4499737904280063e-06, | |
| "loss": 0.09671641141176224, | |
| "mean_token_accuracy": 0.9887768924236298, | |
| "num_tokens": 3039323.0, | |
| "step": 19 | |
| }, | |
| { | |
| "aux_loss": 8.050614356994629, | |
| "entropy": 0.050554944202303886, | |
| "epoch": 0.4819277108433735, | |
| "grad_norm": 0.47147253155708313, | |
| "learning_rate": 1.449966828616625e-06, | |
| "loss": 0.09628961980342865, | |
| "mean_token_accuracy": 0.9888468682765961, | |
| "num_tokens": 3195488.0, | |
| "step": 20 | |
| }, | |
| { | |
| "aux_loss": 8.050609111785889, | |
| "entropy": 0.04489951767027378, | |
| "epoch": 0.5060240963855421, | |
| "grad_norm": 0.4890425503253937, | |
| "learning_rate": 1.4499590478213525e-06, | |
| "loss": 0.09394823014736176, | |
| "mean_token_accuracy": 0.9896246194839478, | |
| "num_tokens": 3369627.0, | |
| "step": 21 | |
| }, | |
| { | |
| "aux_loss": 8.047994613647461, | |
| "entropy": 0.0530005544424057, | |
| "epoch": 0.5301204819277109, | |
| "grad_norm": 0.5181686878204346, | |
| "learning_rate": 1.4499504480597702e-06, | |
| "loss": 0.09846185147762299, | |
| "mean_token_accuracy": 0.9879846572875977, | |
| "num_tokens": 3520643.0, | |
| "step": 22 | |
| }, | |
| { | |
| "aux_loss": 8.049047946929932, | |
| "entropy": 0.039870962500572205, | |
| "epoch": 0.5542168674698795, | |
| "grad_norm": 0.41603270173072815, | |
| "learning_rate": 1.4499410293513081e-06, | |
| "loss": 0.09075028449296951, | |
| "mean_token_accuracy": 0.9908623099327087, | |
| "num_tokens": 3702510.0, | |
| "step": 23 | |
| }, | |
| { | |
| "aux_loss": 8.050177097320557, | |
| "entropy": 0.05053388141095638, | |
| "epoch": 0.5783132530120482, | |
| "grad_norm": 0.4234795570373535, | |
| "learning_rate": 1.449930791717248e-06, | |
| "loss": 0.09689382463693619, | |
| "mean_token_accuracy": 0.9886369109153748, | |
| "num_tokens": 3867610.0, | |
| "step": 24 | |
| }, | |
| { | |
| "aux_loss": 8.048462867736816, | |
| "entropy": 0.049235520884394646, | |
| "epoch": 0.6024096385542169, | |
| "grad_norm": 0.4375890791416168, | |
| "learning_rate": 1.4499197351807219e-06, | |
| "loss": 0.09504671394824982, | |
| "mean_token_accuracy": 0.9891063868999481, | |
| "num_tokens": 4021186.0, | |
| "step": 25 | |
| }, | |
| { | |
| "aux_loss": 8.050186157226562, | |
| "entropy": 0.048021236434578896, | |
| "epoch": 0.6265060240963856, | |
| "grad_norm": 0.42389488220214844, | |
| "learning_rate": 1.449907859766711e-06, | |
| "loss": 0.09462042152881622, | |
| "mean_token_accuracy": 0.9893973469734192, | |
| "num_tokens": 4183102.0, | |
| "step": 26 | |
| }, | |
| { | |
| "aux_loss": 8.04945182800293, | |
| "entropy": 0.042689668014645576, | |
| "epoch": 0.6506024096385542, | |
| "grad_norm": 0.40038207173347473, | |
| "learning_rate": 1.4498951655020479e-06, | |
| "loss": 0.09214234352111816, | |
| "mean_token_accuracy": 0.9904394745826721, | |
| "num_tokens": 4348628.0, | |
| "step": 27 | |
| }, | |
| { | |
| "aux_loss": 8.050597667694092, | |
| "entropy": 0.05143065005540848, | |
| "epoch": 0.6746987951807228, | |
| "grad_norm": 0.4422961473464966, | |
| "learning_rate": 1.4498816524154148e-06, | |
| "loss": 0.09722501039505005, | |
| "mean_token_accuracy": 0.9888282418251038, | |
| "num_tokens": 4511217.0, | |
| "step": 28 | |
| }, | |
| { | |
| "aux_loss": 8.048704147338867, | |
| "entropy": 0.044764744117856026, | |
| "epoch": 0.6987951807228916, | |
| "grad_norm": 0.4279940128326416, | |
| "learning_rate": 1.4498673205373443e-06, | |
| "loss": 0.09300120174884796, | |
| "mean_token_accuracy": 0.9899511337280273, | |
| "num_tokens": 4684266.0, | |
| "step": 29 | |
| }, | |
| { | |
| "aux_loss": 8.047113418579102, | |
| "entropy": 0.04995520040392876, | |
| "epoch": 0.7228915662650602, | |
| "grad_norm": 0.45497408509254456, | |
| "learning_rate": 1.4498521699002187e-06, | |
| "loss": 0.0966445729136467, | |
| "mean_token_accuracy": 0.9883378744125366, | |
| "num_tokens": 4858009.0, | |
| "step": 30 | |
| }, | |
| { | |
| "aux_loss": 8.050236701965332, | |
| "entropy": 0.04773502238094807, | |
| "epoch": 0.7469879518072289, | |
| "grad_norm": 0.40059739351272583, | |
| "learning_rate": 1.4498362005382707e-06, | |
| "loss": 0.09425598382949829, | |
| "mean_token_accuracy": 0.9895853698253632, | |
| "num_tokens": 5041560.0, | |
| "step": 31 | |
| }, | |
| { | |
| "aux_loss": 8.0483078956604, | |
| "entropy": 0.04463958367705345, | |
| "epoch": 0.7710843373493976, | |
| "grad_norm": 0.421403706073761, | |
| "learning_rate": 1.4498194124875822e-06, | |
| "loss": 0.0921817421913147, | |
| "mean_token_accuracy": 0.9903146624565125, | |
| "num_tokens": 5207925.0, | |
| "step": 32 | |
| }, | |
| { | |
| "aux_loss": 8.051517486572266, | |
| "entropy": 0.0455746091902256, | |
| "epoch": 0.7951807228915663, | |
| "grad_norm": 0.39467114210128784, | |
| "learning_rate": 1.449801805786086e-06, | |
| "loss": 0.09311801195144653, | |
| "mean_token_accuracy": 0.9897293448448181, | |
| "num_tokens": 5410900.0, | |
| "step": 33 | |
| }, | |
| { | |
| "aux_loss": 8.047285079956055, | |
| "entropy": 0.04475598596036434, | |
| "epoch": 0.8192771084337349, | |
| "grad_norm": 0.3885505795478821, | |
| "learning_rate": 1.4497833804735631e-06, | |
| "loss": 0.09283807128667831, | |
| "mean_token_accuracy": 0.9904457926750183, | |
| "num_tokens": 5579379.0, | |
| "step": 34 | |
| }, | |
| { | |
| "aux_loss": 8.049206733703613, | |
| "entropy": 0.045768845826387405, | |
| "epoch": 0.8433734939759037, | |
| "grad_norm": 0.38822969794273376, | |
| "learning_rate": 1.4497641365916457e-06, | |
| "loss": 0.0930660218000412, | |
| "mean_token_accuracy": 0.9898505806922913, | |
| "num_tokens": 5756181.0, | |
| "step": 35 | |
| }, | |
| { | |
| "aux_loss": 8.049548149108887, | |
| "entropy": 0.0442772526293993, | |
| "epoch": 0.8674698795180723, | |
| "grad_norm": 0.42765918374061584, | |
| "learning_rate": 1.4497440741838147e-06, | |
| "loss": 0.09213966131210327, | |
| "mean_token_accuracy": 0.9906859695911407, | |
| "num_tokens": 5913888.0, | |
| "step": 36 | |
| }, | |
| { | |
| "aux_loss": 8.047310829162598, | |
| "entropy": 0.05137152969837189, | |
| "epoch": 0.891566265060241, | |
| "grad_norm": 0.46749433875083923, | |
| "learning_rate": 1.4497231932954002e-06, | |
| "loss": 0.09635019302368164, | |
| "mean_token_accuracy": 0.9894134104251862, | |
| "num_tokens": 6073822.0, | |
| "step": 37 | |
| }, | |
| { | |
| "aux_loss": 8.04575777053833, | |
| "entropy": 0.04952680319547653, | |
| "epoch": 0.9156626506024096, | |
| "grad_norm": 0.40102288126945496, | |
| "learning_rate": 1.4497014939735825e-06, | |
| "loss": 0.09520888328552246, | |
| "mean_token_accuracy": 0.9900149703025818, | |
| "num_tokens": 6228998.0, | |
| "step": 38 | |
| }, | |
| { | |
| "aux_loss": 8.05048656463623, | |
| "entropy": 0.05141362361609936, | |
| "epoch": 0.9397590361445783, | |
| "grad_norm": 0.45891159772872925, | |
| "learning_rate": 1.4496789762673903e-06, | |
| "loss": 0.09608915448188782, | |
| "mean_token_accuracy": 0.9895050525665283, | |
| "num_tokens": 6380479.0, | |
| "step": 39 | |
| }, | |
| { | |
| "aux_loss": 8.049390316009521, | |
| "entropy": 0.0542642492800951, | |
| "epoch": 0.963855421686747, | |
| "grad_norm": 0.4678654968738556, | |
| "learning_rate": 1.4496556402277018e-06, | |
| "loss": 0.0986521765589714, | |
| "mean_token_accuracy": 0.9882148206233978, | |
| "num_tokens": 6514347.0, | |
| "step": 40 | |
| }, | |
| { | |
| "aux_loss": 8.047286033630371, | |
| "entropy": 0.04129311256110668, | |
| "epoch": 0.9879518072289156, | |
| "grad_norm": 0.42529988288879395, | |
| "learning_rate": 1.4496314859072443e-06, | |
| "loss": 0.09138549864292145, | |
| "mean_token_accuracy": 0.9908298254013062, | |
| "num_tokens": 6684739.0, | |
| "step": 41 | |
| }, | |
| { | |
| "aux_loss": 8.050637245178223, | |
| "entropy": 0.04988313093781471, | |
| "epoch": 1.0, | |
| "grad_norm": 0.5628013610839844, | |
| "learning_rate": 1.4496065133605937e-06, | |
| "loss": 0.06163128837943077, | |
| "mean_token_accuracy": 0.9887231588363647, | |
| "num_tokens": 6741463.0, | |
| "step": 42 | |
| }, | |
| { | |
| "aux_loss": 8.047677040100098, | |
| "entropy": 0.04833286814391613, | |
| "epoch": 1.0240963855421688, | |
| "grad_norm": 0.43433839082717896, | |
| "learning_rate": 1.4495807226441745e-06, | |
| "loss": 0.09322302043437958, | |
| "mean_token_accuracy": 0.9907335042953491, | |
| "num_tokens": 6872162.0, | |
| "step": 43 | |
| }, | |
| { | |
| "aux_loss": 8.049845218658447, | |
| "entropy": 0.04814961925148964, | |
| "epoch": 1.0481927710843373, | |
| "grad_norm": 0.38683706521987915, | |
| "learning_rate": 1.4495541138162606e-06, | |
| "loss": 0.09274052828550339, | |
| "mean_token_accuracy": 0.9911822378635406, | |
| "num_tokens": 7044917.0, | |
| "step": 44 | |
| }, | |
| { | |
| "aux_loss": 8.045840740203857, | |
| "entropy": 0.04862277954816818, | |
| "epoch": 1.072289156626506, | |
| "grad_norm": 0.43781232833862305, | |
| "learning_rate": 1.4495266869369737e-06, | |
| "loss": 0.09285125136375427, | |
| "mean_token_accuracy": 0.991097629070282, | |
| "num_tokens": 7207551.0, | |
| "step": 45 | |
| }, | |
| { | |
| "aux_loss": 8.047110080718994, | |
| "entropy": 0.04816548526287079, | |
| "epoch": 1.0963855421686748, | |
| "grad_norm": 0.4117249846458435, | |
| "learning_rate": 1.4494984420682841e-06, | |
| "loss": 0.09330926835536957, | |
| "mean_token_accuracy": 0.990231990814209, | |
| "num_tokens": 7376391.0, | |
| "step": 46 | |
| }, | |
| { | |
| "aux_loss": 8.046239852905273, | |
| "entropy": 0.04640440456569195, | |
| "epoch": 1.1204819277108433, | |
| "grad_norm": 0.3918110728263855, | |
| "learning_rate": 1.4494693792740101e-06, | |
| "loss": 0.09266579151153564, | |
| "mean_token_accuracy": 0.9905861914157867, | |
| "num_tokens": 7544885.0, | |
| "step": 47 | |
| }, | |
| { | |
| "aux_loss": 8.045721054077148, | |
| "entropy": 0.04254587180912495, | |
| "epoch": 1.144578313253012, | |
| "grad_norm": 0.3635147213935852, | |
| "learning_rate": 1.4494394986198189e-06, | |
| "loss": 0.08964599668979645, | |
| "mean_token_accuracy": 0.9919890761375427, | |
| "num_tokens": 7718825.0, | |
| "step": 48 | |
| }, | |
| { | |
| "aux_loss": 8.04783582687378, | |
| "entropy": 0.0457068495452404, | |
| "epoch": 1.1686746987951806, | |
| "grad_norm": 0.37491077184677124, | |
| "learning_rate": 1.4494088001732242e-06, | |
| "loss": 0.0912659764289856, | |
| "mean_token_accuracy": 0.9914940893650055, | |
| "num_tokens": 7884797.0, | |
| "step": 49 | |
| }, | |
| { | |
| "aux_loss": 8.048118591308594, | |
| "entropy": 0.05809796415269375, | |
| "epoch": 1.1927710843373494, | |
| "grad_norm": 0.442947119474411, | |
| "learning_rate": 1.449377284003589e-06, | |
| "loss": 0.09830181300640106, | |
| "mean_token_accuracy": 0.9896205961704254, | |
| "num_tokens": 8037756.0, | |
| "step": 50 | |
| }, | |
| { | |
| "aux_loss": 8.045411109924316, | |
| "entropy": 0.04734855704009533, | |
| "epoch": 1.216867469879518, | |
| "grad_norm": 0.3778594732284546, | |
| "learning_rate": 1.449344950182123e-06, | |
| "loss": 0.09220214188098907, | |
| "mean_token_accuracy": 0.9912082552909851, | |
| "num_tokens": 8201900.0, | |
| "step": 51 | |
| }, | |
| { | |
| "aux_loss": 8.051240921020508, | |
| "entropy": 0.04616173356771469, | |
| "epoch": 1.2409638554216866, | |
| "grad_norm": 0.39906826615333557, | |
| "learning_rate": 1.4493117987818833e-06, | |
| "loss": 0.09254124015569687, | |
| "mean_token_accuracy": 0.9910232424736023, | |
| "num_tokens": 8368482.0, | |
| "step": 52 | |
| }, | |
| { | |
| "aux_loss": 8.048255443572998, | |
| "entropy": 0.04362104274332523, | |
| "epoch": 1.2650602409638554, | |
| "grad_norm": 0.4132522642612457, | |
| "learning_rate": 1.449277829877775e-06, | |
| "loss": 0.08969354629516602, | |
| "mean_token_accuracy": 0.9923582375049591, | |
| "num_tokens": 8532083.0, | |
| "step": 53 | |
| }, | |
| { | |
| "aux_loss": 8.049753189086914, | |
| "entropy": 0.05157726630568504, | |
| "epoch": 1.2891566265060241, | |
| "grad_norm": 0.42263299226760864, | |
| "learning_rate": 1.4492430435465495e-06, | |
| "loss": 0.09429101645946503, | |
| "mean_token_accuracy": 0.9907614588737488, | |
| "num_tokens": 8707916.0, | |
| "step": 54 | |
| }, | |
| { | |
| "aux_loss": 8.04571533203125, | |
| "entropy": 0.04540949687361717, | |
| "epoch": 1.3132530120481927, | |
| "grad_norm": 0.415887713432312, | |
| "learning_rate": 1.4492074398668059e-06, | |
| "loss": 0.09169892221689224, | |
| "mean_token_accuracy": 0.9909594357013702, | |
| "num_tokens": 8868293.0, | |
| "step": 55 | |
| }, | |
| { | |
| "aux_loss": 8.047487258911133, | |
| "entropy": 0.042821500450372696, | |
| "epoch": 1.3373493975903614, | |
| "grad_norm": 0.3941069543361664, | |
| "learning_rate": 1.4491710189189896e-06, | |
| "loss": 0.08963996917009354, | |
| "mean_token_accuracy": 0.9915030598640442, | |
| "num_tokens": 9040400.0, | |
| "step": 56 | |
| }, | |
| { | |
| "aux_loss": 8.046500205993652, | |
| "entropy": 0.04034057445824146, | |
| "epoch": 1.3614457831325302, | |
| "grad_norm": 0.3714058995246887, | |
| "learning_rate": 1.4491337807853928e-06, | |
| "loss": 0.08831468969583511, | |
| "mean_token_accuracy": 0.9924418330192566, | |
| "num_tokens": 9210005.0, | |
| "step": 57 | |
| }, | |
| { | |
| "aux_loss": 8.04520559310913, | |
| "entropy": 0.04288036748766899, | |
| "epoch": 1.3855421686746987, | |
| "grad_norm": 0.4117484986782074, | |
| "learning_rate": 1.4490957255501541e-06, | |
| "loss": 0.09062028676271439, | |
| "mean_token_accuracy": 0.9908726513385773, | |
| "num_tokens": 9354587.0, | |
| "step": 58 | |
| }, | |
| { | |
| "aux_loss": 8.048189163208008, | |
| "entropy": 0.04117992892861366, | |
| "epoch": 1.4096385542168675, | |
| "grad_norm": 0.3880350589752197, | |
| "learning_rate": 1.449056853299258e-06, | |
| "loss": 0.08878283947706223, | |
| "mean_token_accuracy": 0.9918811917304993, | |
| "num_tokens": 9530098.0, | |
| "step": 59 | |
| }, | |
| { | |
| "aux_loss": 8.046634674072266, | |
| "entropy": 0.046307843178510666, | |
| "epoch": 1.4337349397590362, | |
| "grad_norm": 0.41205379366874695, | |
| "learning_rate": 1.4490171641205356e-06, | |
| "loss": 0.0928514301776886, | |
| "mean_token_accuracy": 0.99020916223526, | |
| "num_tokens": 9696846.0, | |
| "step": 60 | |
| }, | |
| { | |
| "aux_loss": 8.04638147354126, | |
| "entropy": 0.03861385025084019, | |
| "epoch": 1.4578313253012047, | |
| "grad_norm": 0.3674647808074951, | |
| "learning_rate": 1.4489766581036633e-06, | |
| "loss": 0.08779378235340118, | |
| "mean_token_accuracy": 0.9924313127994537, | |
| "num_tokens": 9868180.0, | |
| "step": 61 | |
| }, | |
| { | |
| "aux_loss": 8.048831462860107, | |
| "entropy": 0.04485859349370003, | |
| "epoch": 1.4819277108433735, | |
| "grad_norm": 0.4122410714626312, | |
| "learning_rate": 1.4489353353401633e-06, | |
| "loss": 0.09213700890541077, | |
| "mean_token_accuracy": 0.9905197322368622, | |
| "num_tokens": 10041207.0, | |
| "step": 62 | |
| }, | |
| { | |
| "aux_loss": 8.045693397521973, | |
| "entropy": 0.04181382618844509, | |
| "epoch": 1.5060240963855422, | |
| "grad_norm": 0.41252797842025757, | |
| "learning_rate": 1.4488931959234036e-06, | |
| "loss": 0.08966240286827087, | |
| "mean_token_accuracy": 0.9918944835662842, | |
| "num_tokens": 10216601.0, | |
| "step": 63 | |
| }, | |
| { | |
| "aux_loss": 8.045026779174805, | |
| "entropy": 0.04367237165570259, | |
| "epoch": 1.5301204819277108, | |
| "grad_norm": 0.7194992899894714, | |
| "learning_rate": 1.4488502399485967e-06, | |
| "loss": 0.09064353257417679, | |
| "mean_token_accuracy": 0.9913205206394196, | |
| "num_tokens": 10373157.0, | |
| "step": 64 | |
| }, | |
| { | |
| "aux_loss": 8.046749591827393, | |
| "entropy": 0.049618642777204514, | |
| "epoch": 1.5542168674698795, | |
| "grad_norm": 0.4409625828266144, | |
| "learning_rate": 1.4488064675128008e-06, | |
| "loss": 0.09418876469135284, | |
| "mean_token_accuracy": 0.98995640873909, | |
| "num_tokens": 10513760.0, | |
| "step": 65 | |
| }, | |
| { | |
| "aux_loss": 8.04750108718872, | |
| "entropy": 0.045051392167806625, | |
| "epoch": 1.5783132530120483, | |
| "grad_norm": 0.4379954934120178, | |
| "learning_rate": 1.4487618787149178e-06, | |
| "loss": 0.09229664504528046, | |
| "mean_token_accuracy": 0.990358978509903, | |
| "num_tokens": 10667072.0, | |
| "step": 66 | |
| }, | |
| { | |
| "aux_loss": 8.0473952293396, | |
| "entropy": 0.03963223472237587, | |
| "epoch": 1.6024096385542168, | |
| "grad_norm": 0.3720748722553253, | |
| "learning_rate": 1.4487164736556958e-06, | |
| "loss": 0.08866938948631287, | |
| "mean_token_accuracy": 0.9920879304409027, | |
| "num_tokens": 10839108.0, | |
| "step": 67 | |
| }, | |
| { | |
| "aux_loss": 8.047708511352539, | |
| "entropy": 0.04451095871627331, | |
| "epoch": 1.6265060240963856, | |
| "grad_norm": 0.4250375032424927, | |
| "learning_rate": 1.4486702524377257e-06, | |
| "loss": 0.09129409492015839, | |
| "mean_token_accuracy": 0.9904707074165344, | |
| "num_tokens": 11001747.0, | |
| "step": 68 | |
| }, | |
| { | |
| "aux_loss": 8.045770645141602, | |
| "entropy": 0.041699016466736794, | |
| "epoch": 1.6506024096385543, | |
| "grad_norm": 0.5749812722206116, | |
| "learning_rate": 1.4486232151654433e-06, | |
| "loss": 0.08955338597297668, | |
| "mean_token_accuracy": 0.9914253950119019, | |
| "num_tokens": 11163010.0, | |
| "step": 69 | |
| }, | |
| { | |
| "aux_loss": 8.048367977142334, | |
| "entropy": 0.0460666548460722, | |
| "epoch": 1.6746987951807228, | |
| "grad_norm": 0.412992388010025, | |
| "learning_rate": 1.448575361945128e-06, | |
| "loss": 0.09151523560285568, | |
| "mean_token_accuracy": 0.9911079108715057, | |
| "num_tokens": 11326488.0, | |
| "step": 70 | |
| }, | |
| { | |
| "aux_loss": 8.047677040100098, | |
| "entropy": 0.039530523121356964, | |
| "epoch": 1.6987951807228916, | |
| "grad_norm": 0.3757312297821045, | |
| "learning_rate": 1.4485266928849028e-06, | |
| "loss": 0.08811481297016144, | |
| "mean_token_accuracy": 0.9917347729206085, | |
| "num_tokens": 11501286.0, | |
| "step": 71 | |
| }, | |
| { | |
| "aux_loss": 8.046856880187988, | |
| "entropy": 0.041672926396131516, | |
| "epoch": 1.7228915662650603, | |
| "grad_norm": 0.38275983929634094, | |
| "learning_rate": 1.448477208094734e-06, | |
| "loss": 0.08906584978103638, | |
| "mean_token_accuracy": 0.9918383359909058, | |
| "num_tokens": 11668188.0, | |
| "step": 72 | |
| }, | |
| { | |
| "aux_loss": 8.04528522491455, | |
| "entropy": 0.047908855602145195, | |
| "epoch": 1.7469879518072289, | |
| "grad_norm": 0.4008839726448059, | |
| "learning_rate": 1.4484269076864313e-06, | |
| "loss": 0.09260185062885284, | |
| "mean_token_accuracy": 0.9907302260398865, | |
| "num_tokens": 11834809.0, | |
| "step": 73 | |
| }, | |
| { | |
| "aux_loss": 8.047989845275879, | |
| "entropy": 0.049024928361177444, | |
| "epoch": 1.7710843373493976, | |
| "grad_norm": 0.43533122539520264, | |
| "learning_rate": 1.448375791773647e-06, | |
| "loss": 0.09409160912036896, | |
| "mean_token_accuracy": 0.9904188215732574, | |
| "num_tokens": 12004510.0, | |
| "step": 74 | |
| }, | |
| { | |
| "aux_loss": 8.045915126800537, | |
| "entropy": 0.05250510759651661, | |
| "epoch": 1.7951807228915664, | |
| "grad_norm": 0.4690086841583252, | |
| "learning_rate": 1.4483238604718765e-06, | |
| "loss": 0.0955488458275795, | |
| "mean_token_accuracy": 0.9906903803348541, | |
| "num_tokens": 12137534.0, | |
| "step": 75 | |
| }, | |
| { | |
| "aux_loss": 8.044984817504883, | |
| "entropy": 0.0376634681597352, | |
| "epoch": 1.819277108433735, | |
| "grad_norm": 0.35793742537498474, | |
| "learning_rate": 1.4482711138984564e-06, | |
| "loss": 0.08688877522945404, | |
| "mean_token_accuracy": 0.9927193224430084, | |
| "num_tokens": 12325369.0, | |
| "step": 76 | |
| }, | |
| { | |
| "aux_loss": 8.04779052734375, | |
| "entropy": 0.04571797512471676, | |
| "epoch": 1.8433734939759037, | |
| "grad_norm": 0.4300045371055603, | |
| "learning_rate": 1.4482175521725665e-06, | |
| "loss": 0.09217096120119095, | |
| "mean_token_accuracy": 0.9905279278755188, | |
| "num_tokens": 12488806.0, | |
| "step": 77 | |
| }, | |
| { | |
| "aux_loss": 8.044951915740967, | |
| "entropy": 0.05060774274170399, | |
| "epoch": 1.8674698795180724, | |
| "grad_norm": 0.423297643661499, | |
| "learning_rate": 1.4481631754152286e-06, | |
| "loss": 0.0944666936993599, | |
| "mean_token_accuracy": 0.990161120891571, | |
| "num_tokens": 12640695.0, | |
| "step": 78 | |
| }, | |
| { | |
| "aux_loss": 8.047436714172363, | |
| "entropy": 0.04260541498661041, | |
| "epoch": 1.891566265060241, | |
| "grad_norm": 0.39964279532432556, | |
| "learning_rate": 1.4481079837493048e-06, | |
| "loss": 0.08988695591688156, | |
| "mean_token_accuracy": 0.9916346371173859, | |
| "num_tokens": 12823930.0, | |
| "step": 79 | |
| }, | |
| { | |
| "aux_loss": 8.047076225280762, | |
| "entropy": 0.04447777755558491, | |
| "epoch": 1.9156626506024095, | |
| "grad_norm": 0.3796585202217102, | |
| "learning_rate": 1.4480519772994993e-06, | |
| "loss": 0.09115425497293472, | |
| "mean_token_accuracy": 0.9917284250259399, | |
| "num_tokens": 12998419.0, | |
| "step": 80 | |
| }, | |
| { | |
| "aux_loss": 8.04789924621582, | |
| "entropy": 0.04236619919538498, | |
| "epoch": 1.9397590361445785, | |
| "grad_norm": 0.418720543384552, | |
| "learning_rate": 1.4479951561923573e-06, | |
| "loss": 0.0903579443693161, | |
| "mean_token_accuracy": 0.9915480315685272, | |
| "num_tokens": 13148913.0, | |
| "step": 81 | |
| }, | |
| { | |
| "aux_loss": 8.045738697052002, | |
| "entropy": 0.04441889189183712, | |
| "epoch": 1.963855421686747, | |
| "grad_norm": 0.3862975835800171, | |
| "learning_rate": 1.4479375205562642e-06, | |
| "loss": 0.09073998779058456, | |
| "mean_token_accuracy": 0.9912832081317902, | |
| "num_tokens": 13304132.0, | |
| "step": 82 | |
| }, | |
| { | |
| "aux_loss": 8.046059608459473, | |
| "entropy": 0.05218968167901039, | |
| "epoch": 1.9879518072289155, | |
| "grad_norm": 0.4317293167114258, | |
| "learning_rate": 1.4478790705214464e-06, | |
| "loss": 0.09526760876178741, | |
| "mean_token_accuracy": 0.9900495111942291, | |
| "num_tokens": 13453623.0, | |
| "step": 83 | |
| }, | |
| { | |
| "aux_loss": 8.05069351196289, | |
| "entropy": 0.039391469210386276, | |
| "epoch": 2.0, | |
| "grad_norm": 0.6828374266624451, | |
| "learning_rate": 1.4478198062199706e-06, | |
| "loss": 0.05737518146634102, | |
| "mean_token_accuracy": 0.9917781352996826, | |
| "num_tokens": 13482926.0, | |
| "step": 84 | |
| }, | |
| { | |
| "aux_loss": 8.045267105102539, | |
| "entropy": 0.053030213341116905, | |
| "epoch": 2.0240963855421685, | |
| "grad_norm": 0.40254807472229004, | |
| "learning_rate": 1.4477597277857421e-06, | |
| "loss": 0.09399621188640594, | |
| "mean_token_accuracy": 0.9910189509391785, | |
| "num_tokens": 13616336.0, | |
| "step": 85 | |
| }, | |
| { | |
| "aux_loss": 8.04813003540039, | |
| "entropy": 0.04406110197305679, | |
| "epoch": 2.0481927710843375, | |
| "grad_norm": 0.36270391941070557, | |
| "learning_rate": 1.4476988353545068e-06, | |
| "loss": 0.08861124515533447, | |
| "mean_token_accuracy": 0.9931189119815826, | |
| "num_tokens": 13775230.0, | |
| "step": 86 | |
| }, | |
| { | |
| "aux_loss": 8.044662952423096, | |
| "entropy": 0.03888658061623573, | |
| "epoch": 2.072289156626506, | |
| "grad_norm": 0.3652919828891754, | |
| "learning_rate": 1.4476371290638496e-06, | |
| "loss": 0.08651480078697205, | |
| "mean_token_accuracy": 0.9931168258190155, | |
| "num_tokens": 13935092.0, | |
| "step": 87 | |
| }, | |
| { | |
| "aux_loss": 8.048104763031006, | |
| "entropy": 0.047589803114533424, | |
| "epoch": 2.0963855421686746, | |
| "grad_norm": 0.4187248647212982, | |
| "learning_rate": 1.447574609053194e-06, | |
| "loss": 0.09169710427522659, | |
| "mean_token_accuracy": 0.9922028183937073, | |
| "num_tokens": 14097222.0, | |
| "step": 88 | |
| }, | |
| { | |
| "aux_loss": 8.044262409210205, | |
| "entropy": 0.04133613780140877, | |
| "epoch": 2.1204819277108435, | |
| "grad_norm": 0.3797593414783478, | |
| "learning_rate": 1.4475112754638022e-06, | |
| "loss": 0.08802482485771179, | |
| "mean_token_accuracy": 0.9926626980304718, | |
| "num_tokens": 14255553.0, | |
| "step": 89 | |
| }, | |
| { | |
| "aux_loss": 8.046658515930176, | |
| "entropy": 0.04000333696603775, | |
| "epoch": 2.144578313253012, | |
| "grad_norm": 0.4277676045894623, | |
| "learning_rate": 1.447447128438775e-06, | |
| "loss": 0.08734406530857086, | |
| "mean_token_accuracy": 0.993060439825058, | |
| "num_tokens": 14431608.0, | |
| "step": 90 | |
| }, | |
| { | |
| "aux_loss": 8.045912265777588, | |
| "entropy": 0.041802020743489265, | |
| "epoch": 2.1686746987951806, | |
| "grad_norm": 0.37397268414497375, | |
| "learning_rate": 1.4473821681230506e-06, | |
| "loss": 0.08865631371736526, | |
| "mean_token_accuracy": 0.9919825196266174, | |
| "num_tokens": 14615993.0, | |
| "step": 91 | |
| }, | |
| { | |
| "aux_loss": 8.044597625732422, | |
| "entropy": 0.04039378650486469, | |
| "epoch": 2.1927710843373496, | |
| "grad_norm": 0.423145592212677, | |
| "learning_rate": 1.4473163946634052e-06, | |
| "loss": 0.0880887508392334, | |
| "mean_token_accuracy": 0.9921639561653137, | |
| "num_tokens": 14766575.0, | |
| "step": 92 | |
| }, | |
| { | |
| "aux_loss": 8.04832410812378, | |
| "entropy": 0.04441938176751137, | |
| "epoch": 2.216867469879518, | |
| "grad_norm": 0.3814225196838379, | |
| "learning_rate": 1.4472498082084518e-06, | |
| "loss": 0.08906400948762894, | |
| "mean_token_accuracy": 0.9928748905658722, | |
| "num_tokens": 14931445.0, | |
| "step": 93 | |
| }, | |
| { | |
| "aux_loss": 8.042942523956299, | |
| "entropy": 0.046976158395409584, | |
| "epoch": 2.2409638554216866, | |
| "grad_norm": 0.3922480344772339, | |
| "learning_rate": 1.4471824089086415e-06, | |
| "loss": 0.09150424599647522, | |
| "mean_token_accuracy": 0.9916513860225677, | |
| "num_tokens": 15091210.0, | |
| "step": 94 | |
| }, | |
| { | |
| "aux_loss": 8.045757293701172, | |
| "entropy": 0.035969141870737076, | |
| "epoch": 2.2650602409638556, | |
| "grad_norm": 0.3510456681251526, | |
| "learning_rate": 1.44711419691626e-06, | |
| "loss": 0.0854613184928894, | |
| "mean_token_accuracy": 0.9934249818325043, | |
| "num_tokens": 15260222.0, | |
| "step": 95 | |
| }, | |
| { | |
| "aux_loss": 8.044999122619629, | |
| "entropy": 0.03909716196358204, | |
| "epoch": 2.289156626506024, | |
| "grad_norm": 0.3629781901836395, | |
| "learning_rate": 1.4470451723854314e-06, | |
| "loss": 0.08637961745262146, | |
| "mean_token_accuracy": 0.9935233891010284, | |
| "num_tokens": 15455860.0, | |
| "step": 96 | |
| }, | |
| { | |
| "aux_loss": 8.04701280593872, | |
| "entropy": 0.04057766683399677, | |
| "epoch": 2.3132530120481927, | |
| "grad_norm": 0.36879613995552063, | |
| "learning_rate": 1.4469753354721144e-06, | |
| "loss": 0.087168388068676, | |
| "mean_token_accuracy": 0.9932206869125366, | |
| "num_tokens": 15631021.0, | |
| "step": 97 | |
| }, | |
| { | |
| "aux_loss": 8.047924518585205, | |
| "entropy": 0.04564652778208256, | |
| "epoch": 2.337349397590361, | |
| "grad_norm": 0.41153064370155334, | |
| "learning_rate": 1.4469046863341036e-06, | |
| "loss": 0.08925162255764008, | |
| "mean_token_accuracy": 0.9921718537807465, | |
| "num_tokens": 15789136.0, | |
| "step": 98 | |
| }, | |
| { | |
| "aux_loss": 8.0452880859375, | |
| "entropy": 0.04301636107265949, | |
| "epoch": 2.36144578313253, | |
| "grad_norm": 0.376197874546051, | |
| "learning_rate": 1.4468332251310286e-06, | |
| "loss": 0.08848991990089417, | |
| "mean_token_accuracy": 0.9930213391780853, | |
| "num_tokens": 15938397.0, | |
| "step": 99 | |
| }, | |
| { | |
| "aux_loss": 8.043729782104492, | |
| "entropy": 0.04113657400012016, | |
| "epoch": 2.3855421686746987, | |
| "grad_norm": 0.3817802667617798, | |
| "learning_rate": 1.4467609520243544e-06, | |
| "loss": 0.08791770040988922, | |
| "mean_token_accuracy": 0.9926939308643341, | |
| "num_tokens": 16114803.0, | |
| "step": 100 | |
| }, | |
| { | |
| "aux_loss": 8.044564247131348, | |
| "entropy": 0.04448202811181545, | |
| "epoch": 2.4096385542168672, | |
| "grad_norm": 0.41418957710266113, | |
| "learning_rate": 1.44668786717738e-06, | |
| "loss": 0.08933436870574951, | |
| "mean_token_accuracy": 0.9923655092716217, | |
| "num_tokens": 16267681.0, | |
| "step": 101 | |
| }, | |
| { | |
| "aux_loss": 8.045689105987549, | |
| "entropy": 0.043511977419257164, | |
| "epoch": 2.433734939759036, | |
| "grad_norm": 0.3912562429904938, | |
| "learning_rate": 1.4466139707552382e-06, | |
| "loss": 0.08852104097604752, | |
| "mean_token_accuracy": 0.9933134019374847, | |
| "num_tokens": 16435524.0, | |
| "step": 102 | |
| }, | |
| { | |
| "aux_loss": 8.04603910446167, | |
| "entropy": 0.03945927880704403, | |
| "epoch": 2.4578313253012047, | |
| "grad_norm": 0.37696266174316406, | |
| "learning_rate": 1.4465392629248964e-06, | |
| "loss": 0.08802925050258636, | |
| "mean_token_accuracy": 0.9925020635128021, | |
| "num_tokens": 16601843.0, | |
| "step": 103 | |
| }, | |
| { | |
| "aux_loss": 8.041633129119873, | |
| "entropy": 0.042852023616433144, | |
| "epoch": 2.4819277108433733, | |
| "grad_norm": 0.42523500323295593, | |
| "learning_rate": 1.446463743855155e-06, | |
| "loss": 0.08881749212741852, | |
| "mean_token_accuracy": 0.9926598370075226, | |
| "num_tokens": 16749225.0, | |
| "step": 104 | |
| }, | |
| { | |
| "aux_loss": 8.044000625610352, | |
| "entropy": 0.04509095661342144, | |
| "epoch": 2.5060240963855422, | |
| "grad_norm": 0.43666303157806396, | |
| "learning_rate": 1.4463874137166468e-06, | |
| "loss": 0.09076739847660065, | |
| "mean_token_accuracy": 0.9915396869182587, | |
| "num_tokens": 16897018.0, | |
| "step": 105 | |
| }, | |
| { | |
| "aux_loss": 8.044254302978516, | |
| "entropy": 0.04391391761600971, | |
| "epoch": 2.5301204819277108, | |
| "grad_norm": 0.4111824333667755, | |
| "learning_rate": 1.4463102726818382e-06, | |
| "loss": 0.08995572477579117, | |
| "mean_token_accuracy": 0.9917828142642975, | |
| "num_tokens": 17065753.0, | |
| "step": 106 | |
| }, | |
| { | |
| "aux_loss": 8.045661926269531, | |
| "entropy": 0.04082946851849556, | |
| "epoch": 2.5542168674698793, | |
| "grad_norm": 0.3910435438156128, | |
| "learning_rate": 1.4462323209250268e-06, | |
| "loss": 0.08806779235601425, | |
| "mean_token_accuracy": 0.9928287863731384, | |
| "num_tokens": 17235799.0, | |
| "step": 107 | |
| }, | |
| { | |
| "aux_loss": 8.043983459472656, | |
| "entropy": 0.045222554355859756, | |
| "epoch": 2.5783132530120483, | |
| "grad_norm": 0.4386132061481476, | |
| "learning_rate": 1.4461535586223427e-06, | |
| "loss": 0.090940460562706, | |
| "mean_token_accuracy": 0.9915510416030884, | |
| "num_tokens": 17376992.0, | |
| "step": 108 | |
| }, | |
| { | |
| "aux_loss": 8.0429105758667, | |
| "entropy": 0.04239073768258095, | |
| "epoch": 2.602409638554217, | |
| "grad_norm": 0.39754438400268555, | |
| "learning_rate": 1.4460739859517472e-06, | |
| "loss": 0.08899098634719849, | |
| "mean_token_accuracy": 0.9922184944152832, | |
| "num_tokens": 17537095.0, | |
| "step": 109 | |
| }, | |
| { | |
| "aux_loss": 8.046865940093994, | |
| "entropy": 0.04032203182578087, | |
| "epoch": 2.6265060240963853, | |
| "grad_norm": 0.4198264181613922, | |
| "learning_rate": 1.4459936030930326e-06, | |
| "loss": 0.08784371614456177, | |
| "mean_token_accuracy": 0.9927988350391388, | |
| "num_tokens": 17697756.0, | |
| "step": 110 | |
| }, | |
| { | |
| "aux_loss": 8.045022964477539, | |
| "entropy": 0.04641672037541866, | |
| "epoch": 2.6506024096385543, | |
| "grad_norm": 0.41483283042907715, | |
| "learning_rate": 1.4459124102278213e-06, | |
| "loss": 0.0906679630279541, | |
| "mean_token_accuracy": 0.9918768405914307, | |
| "num_tokens": 17862032.0, | |
| "step": 111 | |
| }, | |
| { | |
| "aux_loss": 8.046215057373047, | |
| "entropy": 0.038604725152254105, | |
| "epoch": 2.674698795180723, | |
| "grad_norm": 0.38772159814834595, | |
| "learning_rate": 1.4458304075395668e-06, | |
| "loss": 0.08620807528495789, | |
| "mean_token_accuracy": 0.9930865466594696, | |
| "num_tokens": 18014648.0, | |
| "step": 112 | |
| }, | |
| { | |
| "aux_loss": 8.04534912109375, | |
| "entropy": 0.047094520181417465, | |
| "epoch": 2.6987951807228914, | |
| "grad_norm": 0.4265570342540741, | |
| "learning_rate": 1.445747595213552e-06, | |
| "loss": 0.09142982959747314, | |
| "mean_token_accuracy": 0.9916557669639587, | |
| "num_tokens": 18170137.0, | |
| "step": 113 | |
| }, | |
| { | |
| "aux_loss": 8.045645713806152, | |
| "entropy": 0.037863900884985924, | |
| "epoch": 2.7228915662650603, | |
| "grad_norm": 0.3691053092479706, | |
| "learning_rate": 1.4456639734368888e-06, | |
| "loss": 0.08656749129295349, | |
| "mean_token_accuracy": 0.9931949079036713, | |
| "num_tokens": 18341196.0, | |
| "step": 114 | |
| }, | |
| { | |
| "aux_loss": 8.04396677017212, | |
| "entropy": 0.04190782643854618, | |
| "epoch": 2.746987951807229, | |
| "grad_norm": 0.38775166869163513, | |
| "learning_rate": 1.4455795423985187e-06, | |
| "loss": 0.08832530677318573, | |
| "mean_token_accuracy": 0.9925132691860199, | |
| "num_tokens": 18499534.0, | |
| "step": 115 | |
| }, | |
| { | |
| "aux_loss": 8.046361446380615, | |
| "entropy": 0.044008735567331314, | |
| "epoch": 2.7710843373493974, | |
| "grad_norm": 0.3934473395347595, | |
| "learning_rate": 1.445494302289211e-06, | |
| "loss": 0.08926442265510559, | |
| "mean_token_accuracy": 0.9925075769424438, | |
| "num_tokens": 18659760.0, | |
| "step": 116 | |
| }, | |
| { | |
| "aux_loss": 8.044501304626465, | |
| "entropy": 0.04429285787045956, | |
| "epoch": 2.7951807228915664, | |
| "grad_norm": 0.4424228072166443, | |
| "learning_rate": 1.4454082533015636e-06, | |
| "loss": 0.08979617059230804, | |
| "mean_token_accuracy": 0.9921565651893616, | |
| "num_tokens": 18831165.0, | |
| "step": 117 | |
| }, | |
| { | |
| "aux_loss": 8.042979717254639, | |
| "entropy": 0.040504178032279015, | |
| "epoch": 2.819277108433735, | |
| "grad_norm": 0.4018898904323578, | |
| "learning_rate": 1.4453213956300015e-06, | |
| "loss": 0.08786608278751373, | |
| "mean_token_accuracy": 0.992399662733078, | |
| "num_tokens": 18984127.0, | |
| "step": 118 | |
| }, | |
| { | |
| "aux_loss": 8.045685768127441, | |
| "entropy": 0.041042402386665344, | |
| "epoch": 2.8433734939759034, | |
| "grad_norm": 0.5288944840431213, | |
| "learning_rate": 1.4452337294707773e-06, | |
| "loss": 0.08859241008758545, | |
| "mean_token_accuracy": 0.9921814501285553, | |
| "num_tokens": 19160419.0, | |
| "step": 119 | |
| }, | |
| { | |
| "aux_loss": 8.046215057373047, | |
| "entropy": 0.04414335638284683, | |
| "epoch": 2.8674698795180724, | |
| "grad_norm": 0.4066352844238281, | |
| "learning_rate": 1.4451452550219706e-06, | |
| "loss": 0.08978652209043503, | |
| "mean_token_accuracy": 0.9923945069313049, | |
| "num_tokens": 19335546.0, | |
| "step": 120 | |
| }, | |
| { | |
| "aux_loss": 8.044774055480957, | |
| "entropy": 0.03940526768565178, | |
| "epoch": 2.891566265060241, | |
| "grad_norm": 0.4042900800704956, | |
| "learning_rate": 1.445055972483487e-06, | |
| "loss": 0.08746181428432465, | |
| "mean_token_accuracy": 0.9926989078521729, | |
| "num_tokens": 19496314.0, | |
| "step": 121 | |
| }, | |
| { | |
| "aux_loss": 8.043519020080566, | |
| "entropy": 0.03671685978770256, | |
| "epoch": 2.9156626506024095, | |
| "grad_norm": 0.3954128921031952, | |
| "learning_rate": 1.4449658820570577e-06, | |
| "loss": 0.08653290569782257, | |
| "mean_token_accuracy": 0.9926026463508606, | |
| "num_tokens": 19661718.0, | |
| "step": 122 | |
| }, | |
| { | |
| "aux_loss": 8.045527458190918, | |
| "entropy": 0.04113632068037987, | |
| "epoch": 2.9397590361445785, | |
| "grad_norm": 0.39803871512413025, | |
| "learning_rate": 1.4448749839462395e-06, | |
| "loss": 0.08833590149879456, | |
| "mean_token_accuracy": 0.9923411309719086, | |
| "num_tokens": 19847373.0, | |
| "step": 123 | |
| }, | |
| { | |
| "aux_loss": 8.044186115264893, | |
| "entropy": 0.03642796538770199, | |
| "epoch": 2.963855421686747, | |
| "grad_norm": 0.3793511390686035, | |
| "learning_rate": 1.4447832783564146e-06, | |
| "loss": 0.086070716381073, | |
| "mean_token_accuracy": 0.9930998384952545, | |
| "num_tokens": 20025875.0, | |
| "step": 124 | |
| }, | |
| { | |
| "aux_loss": 8.046002388000488, | |
| "entropy": 0.047230470925569534, | |
| "epoch": 2.9879518072289155, | |
| "grad_norm": 0.4477235972881317, | |
| "learning_rate": 1.444690765494789e-06, | |
| "loss": 0.09117428958415985, | |
| "mean_token_accuracy": 0.9920151233673096, | |
| "num_tokens": 20182590.0, | |
| "step": 125 | |
| }, | |
| { | |
| "aux_loss": 8.042522430419922, | |
| "entropy": 0.040220800787210464, | |
| "epoch": 3.0, | |
| "grad_norm": 0.5846906900405884, | |
| "learning_rate": 1.4445974455703927e-06, | |
| "loss": 0.0573921799659729, | |
| "mean_token_accuracy": 0.9929695129394531, | |
| "num_tokens": 20224389.0, | |
| "step": 126 | |
| }, | |
| { | |
| "aux_loss": 8.044944763183594, | |
| "entropy": 0.039370276033878326, | |
| "epoch": 3.0240963855421685, | |
| "grad_norm": 0.3742491900920868, | |
| "learning_rate": 1.44450331879408e-06, | |
| "loss": 0.08556805551052094, | |
| "mean_token_accuracy": 0.9942886531352997, | |
| "num_tokens": 20380640.0, | |
| "step": 127 | |
| }, | |
| { | |
| "aux_loss": 8.043789863586426, | |
| "entropy": 0.045225948095321655, | |
| "epoch": 3.0481927710843375, | |
| "grad_norm": 0.38408586382865906, | |
| "learning_rate": 1.4444083853785277e-06, | |
| "loss": 0.08862867951393127, | |
| "mean_token_accuracy": 0.9931619465351105, | |
| "num_tokens": 20532981.0, | |
| "step": 128 | |
| }, | |
| { | |
| "aux_loss": 8.042508125305176, | |
| "entropy": 0.0450060423463583, | |
| "epoch": 3.072289156626506, | |
| "grad_norm": 0.37083542346954346, | |
| "learning_rate": 1.444312645538235e-06, | |
| "loss": 0.08864334225654602, | |
| "mean_token_accuracy": 0.9928875267505646, | |
| "num_tokens": 20683874.0, | |
| "step": 129 | |
| }, | |
| { | |
| "aux_loss": 8.041747093200684, | |
| "entropy": 0.04171221703290939, | |
| "epoch": 3.0963855421686746, | |
| "grad_norm": 0.36446937918663025, | |
| "learning_rate": 1.4442160994895236e-06, | |
| "loss": 0.08605008572340012, | |
| "mean_token_accuracy": 0.9937500953674316, | |
| "num_tokens": 20836727.0, | |
| "step": 130 | |
| }, | |
| { | |
| "aux_loss": 8.042478561401367, | |
| "entropy": 0.04033582843840122, | |
| "epoch": 3.1204819277108435, | |
| "grad_norm": 0.37039053440093994, | |
| "learning_rate": 1.4441187474505368e-06, | |
| "loss": 0.08619973808526993, | |
| "mean_token_accuracy": 0.9936582446098328, | |
| "num_tokens": 20989173.0, | |
| "step": 131 | |
| }, | |
| { | |
| "aux_loss": 8.04190444946289, | |
| "entropy": 0.04400304704904556, | |
| "epoch": 3.144578313253012, | |
| "grad_norm": 0.39441367983818054, | |
| "learning_rate": 1.4440205896412386e-06, | |
| "loss": 0.08861161768436432, | |
| "mean_token_accuracy": 0.993509829044342, | |
| "num_tokens": 21137746.0, | |
| "step": 132 | |
| }, | |
| { | |
| "aux_loss": 8.042577743530273, | |
| "entropy": 0.0362233929336071, | |
| "epoch": 3.1686746987951806, | |
| "grad_norm": 0.3513298034667969, | |
| "learning_rate": 1.4439216262834142e-06, | |
| "loss": 0.08395665884017944, | |
| "mean_token_accuracy": 0.9942896068096161, | |
| "num_tokens": 21303083.0, | |
| "step": 133 | |
| }, | |
| { | |
| "aux_loss": 8.045822143554688, | |
| "entropy": 0.044513555243611336, | |
| "epoch": 3.1927710843373496, | |
| "grad_norm": 0.4062028229236603, | |
| "learning_rate": 1.4438218576006684e-06, | |
| "loss": 0.08783506602048874, | |
| "mean_token_accuracy": 0.9932784140110016, | |
| "num_tokens": 21465720.0, | |
| "step": 134 | |
| }, | |
| { | |
| "aux_loss": 8.042749881744385, | |
| "entropy": 0.03609209880232811, | |
| "epoch": 3.216867469879518, | |
| "grad_norm": 0.36185288429260254, | |
| "learning_rate": 1.4437212838184255e-06, | |
| "loss": 0.08398795872926712, | |
| "mean_token_accuracy": 0.9942994117736816, | |
| "num_tokens": 21634832.0, | |
| "step": 135 | |
| }, | |
| { | |
| "aux_loss": 8.046396255493164, | |
| "entropy": 0.039127200841903687, | |
| "epoch": 3.2409638554216866, | |
| "grad_norm": 0.3764151334762573, | |
| "learning_rate": 1.44361990516393e-06, | |
| "loss": 0.08616587519645691, | |
| "mean_token_accuracy": 0.993415892124176, | |
| "num_tokens": 21801355.0, | |
| "step": 136 | |
| }, | |
| { | |
| "aux_loss": 8.043558597564697, | |
| "entropy": 0.03838344104588032, | |
| "epoch": 3.2650602409638556, | |
| "grad_norm": 0.3657795786857605, | |
| "learning_rate": 1.4435177218662435e-06, | |
| "loss": 0.08551836758852005, | |
| "mean_token_accuracy": 0.9938235878944397, | |
| "num_tokens": 21973015.0, | |
| "step": 137 | |
| }, | |
| { | |
| "aux_loss": 8.043213367462158, | |
| "entropy": 0.04633874632418156, | |
| "epoch": 3.289156626506024, | |
| "grad_norm": 0.38201189041137695, | |
| "learning_rate": 1.4434147341562468e-06, | |
| "loss": 0.08937641978263855, | |
| "mean_token_accuracy": 0.9929512739181519, | |
| "num_tokens": 22134914.0, | |
| "step": 138 | |
| }, | |
| { | |
| "aux_loss": 8.04480266571045, | |
| "entropy": 0.03689238056540489, | |
| "epoch": 3.3132530120481927, | |
| "grad_norm": 0.35625335574150085, | |
| "learning_rate": 1.4433109422666374e-06, | |
| "loss": 0.08385109901428223, | |
| "mean_token_accuracy": 0.9944583773612976, | |
| "num_tokens": 22302240.0, | |
| "step": 139 | |
| }, | |
| { | |
| "aux_loss": 8.042608261108398, | |
| "entropy": 0.04020004719495773, | |
| "epoch": 3.337349397590361, | |
| "grad_norm": 0.3919045925140381, | |
| "learning_rate": 1.4432063464319306e-06, | |
| "loss": 0.0874231606721878, | |
| "mean_token_accuracy": 0.9931889474391937, | |
| "num_tokens": 22471698.0, | |
| "step": 140 | |
| }, | |
| { | |
| "aux_loss": 8.042847156524658, | |
| "entropy": 0.03685566782951355, | |
| "epoch": 3.36144578313253, | |
| "grad_norm": 0.3515630066394806, | |
| "learning_rate": 1.4431009468884578e-06, | |
| "loss": 0.0849953442811966, | |
| "mean_token_accuracy": 0.9941838085651398, | |
| "num_tokens": 22653073.0, | |
| "step": 141 | |
| }, | |
| { | |
| "aux_loss": 8.043398380279541, | |
| "entropy": 0.0423385389149189, | |
| "epoch": 3.3855421686746987, | |
| "grad_norm": 0.41736137866973877, | |
| "learning_rate": 1.442994743874366e-06, | |
| "loss": 0.08791652321815491, | |
| "mean_token_accuracy": 0.9927142858505249, | |
| "num_tokens": 22810578.0, | |
| "step": 142 | |
| }, | |
| { | |
| "aux_loss": 8.04459524154663, | |
| "entropy": 0.04449957422912121, | |
| "epoch": 3.4096385542168672, | |
| "grad_norm": 0.4232349693775177, | |
| "learning_rate": 1.4428877376296185e-06, | |
| "loss": 0.08924206346273422, | |
| "mean_token_accuracy": 0.9924839735031128, | |
| "num_tokens": 22953794.0, | |
| "step": 143 | |
| }, | |
| { | |
| "aux_loss": 8.041166305541992, | |
| "entropy": 0.04270816035568714, | |
| "epoch": 3.433734939759036, | |
| "grad_norm": 0.3914850354194641, | |
| "learning_rate": 1.4427799283959926e-06, | |
| "loss": 0.08785770833492279, | |
| "mean_token_accuracy": 0.9931382238864899, | |
| "num_tokens": 23120357.0, | |
| "step": 144 | |
| }, | |
| { | |
| "aux_loss": 8.04544448852539, | |
| "entropy": 0.03356307931244373, | |
| "epoch": 3.4578313253012047, | |
| "grad_norm": 0.3500516712665558, | |
| "learning_rate": 1.4426713164170808e-06, | |
| "loss": 0.08334299921989441, | |
| "mean_token_accuracy": 0.9946193993091583, | |
| "num_tokens": 23300231.0, | |
| "step": 145 | |
| }, | |
| { | |
| "aux_loss": 8.04530382156372, | |
| "entropy": 0.044576091691851616, | |
| "epoch": 3.4819277108433733, | |
| "grad_norm": 0.41992995142936707, | |
| "learning_rate": 1.4425619019382884e-06, | |
| "loss": 0.08873672783374786, | |
| "mean_token_accuracy": 0.9929416477680206, | |
| "num_tokens": 23453268.0, | |
| "step": 146 | |
| }, | |
| { | |
| "aux_loss": 8.044836044311523, | |
| "entropy": 0.03937925212085247, | |
| "epoch": 3.5060240963855422, | |
| "grad_norm": 0.37806037068367004, | |
| "learning_rate": 1.4424516852068346e-06, | |
| "loss": 0.08648265898227692, | |
| "mean_token_accuracy": 0.9935058355331421, | |
| "num_tokens": 23625257.0, | |
| "step": 147 | |
| }, | |
| { | |
| "aux_loss": 8.04463529586792, | |
| "entropy": 0.0399188157171011, | |
| "epoch": 3.5301204819277108, | |
| "grad_norm": 0.37204214930534363, | |
| "learning_rate": 1.442340666471751e-06, | |
| "loss": 0.08639834821224213, | |
| "mean_token_accuracy": 0.9933888912200928, | |
| "num_tokens": 23820327.0, | |
| "step": 148 | |
| }, | |
| { | |
| "aux_loss": 8.044984340667725, | |
| "entropy": 0.036087172105908394, | |
| "epoch": 3.5542168674698793, | |
| "grad_norm": 0.36808425188064575, | |
| "learning_rate": 1.4422288459838816e-06, | |
| "loss": 0.08478154242038727, | |
| "mean_token_accuracy": 0.9945113360881805, | |
| "num_tokens": 23979995.0, | |
| "step": 149 | |
| }, | |
| { | |
| "aux_loss": 8.043323993682861, | |
| "entropy": 0.04419667460024357, | |
| "epoch": 3.5783132530120483, | |
| "grad_norm": 0.41120970249176025, | |
| "learning_rate": 1.4421162239958818e-06, | |
| "loss": 0.0894618034362793, | |
| "mean_token_accuracy": 0.9925802052021027, | |
| "num_tokens": 24125572.0, | |
| "step": 150 | |
| }, | |
| { | |
| "aux_loss": 8.042481422424316, | |
| "entropy": 0.03813181072473526, | |
| "epoch": 3.602409638554217, | |
| "grad_norm": 0.3920314610004425, | |
| "learning_rate": 1.4420028007622175e-06, | |
| "loss": 0.08617769181728363, | |
| "mean_token_accuracy": 0.9939529597759247, | |
| "num_tokens": 24283705.0, | |
| "step": 151 | |
| }, | |
| { | |
| "aux_loss": 8.043877601623535, | |
| "entropy": 0.03504548221826553, | |
| "epoch": 3.6265060240963853, | |
| "grad_norm": 0.38018906116485596, | |
| "learning_rate": 1.4418885765391659e-06, | |
| "loss": 0.08467784523963928, | |
| "mean_token_accuracy": 0.993707150220871, | |
| "num_tokens": 24472505.0, | |
| "step": 152 | |
| }, | |
| { | |
| "aux_loss": 8.042401313781738, | |
| "entropy": 0.04122787527740002, | |
| "epoch": 3.6506024096385543, | |
| "grad_norm": 0.39765456318855286, | |
| "learning_rate": 1.4417735515848131e-06, | |
| "loss": 0.08704474568367004, | |
| "mean_token_accuracy": 0.9933643937110901, | |
| "num_tokens": 24643360.0, | |
| "step": 153 | |
| }, | |
| { | |
| "aux_loss": 8.043309688568115, | |
| "entropy": 0.04166724532842636, | |
| "epoch": 3.674698795180723, | |
| "grad_norm": 0.3905385136604309, | |
| "learning_rate": 1.4416577261590549e-06, | |
| "loss": 0.08706511557102203, | |
| "mean_token_accuracy": 0.9933055341243744, | |
| "num_tokens": 24802344.0, | |
| "step": 154 | |
| }, | |
| { | |
| "aux_loss": 8.040821552276611, | |
| "entropy": 0.03833147883415222, | |
| "epoch": 3.6987951807228914, | |
| "grad_norm": 0.4488506615161896, | |
| "learning_rate": 1.4415411005235958e-06, | |
| "loss": 0.08571713417768478, | |
| "mean_token_accuracy": 0.9934513568878174, | |
| "num_tokens": 24956387.0, | |
| "step": 155 | |
| }, | |
| { | |
| "aux_loss": 8.043232440948486, | |
| "entropy": 0.03610091283917427, | |
| "epoch": 3.7228915662650603, | |
| "grad_norm": 0.3729538023471832, | |
| "learning_rate": 1.4414236749419483e-06, | |
| "loss": 0.08453528583049774, | |
| "mean_token_accuracy": 0.9941688776016235, | |
| "num_tokens": 25118460.0, | |
| "step": 156 | |
| }, | |
| { | |
| "aux_loss": 8.042871475219727, | |
| "entropy": 0.04386945813894272, | |
| "epoch": 3.746987951807229, | |
| "grad_norm": 0.4113171100616455, | |
| "learning_rate": 1.441305449679432e-06, | |
| "loss": 0.08860649913549423, | |
| "mean_token_accuracy": 0.9927978813648224, | |
| "num_tokens": 25276453.0, | |
| "step": 157 | |
| }, | |
| { | |
| "aux_loss": 8.04326343536377, | |
| "entropy": 0.03775089047849178, | |
| "epoch": 3.7710843373493974, | |
| "grad_norm": 0.3969726860523224, | |
| "learning_rate": 1.441186425003174e-06, | |
| "loss": 0.08585880696773529, | |
| "mean_token_accuracy": 0.9934997260570526, | |
| "num_tokens": 25465189.0, | |
| "step": 158 | |
| }, | |
| { | |
| "aux_loss": 8.041276931762695, | |
| "entropy": 0.03554354049265385, | |
| "epoch": 3.7951807228915664, | |
| "grad_norm": 0.37212640047073364, | |
| "learning_rate": 1.4410666011821071e-06, | |
| "loss": 0.08398972451686859, | |
| "mean_token_accuracy": 0.9942491948604584, | |
| "num_tokens": 25647091.0, | |
| "step": 159 | |
| }, | |
| { | |
| "aux_loss": 8.04280948638916, | |
| "entropy": 0.03362584114074707, | |
| "epoch": 3.819277108433735, | |
| "grad_norm": 0.37804487347602844, | |
| "learning_rate": 1.44094597848697e-06, | |
| "loss": 0.08355149626731873, | |
| "mean_token_accuracy": 0.9944404661655426, | |
| "num_tokens": 25812959.0, | |
| "step": 160 | |
| }, | |
| { | |
| "aux_loss": 8.041194915771484, | |
| "entropy": 0.04549684002995491, | |
| "epoch": 3.8433734939759034, | |
| "grad_norm": 0.4044184982776642, | |
| "learning_rate": 1.4408245571903066e-06, | |
| "loss": 0.08932945877313614, | |
| "mean_token_accuracy": 0.9926709532737732, | |
| "num_tokens": 25975077.0, | |
| "step": 161 | |
| }, | |
| { | |
| "aux_loss": 8.040953636169434, | |
| "entropy": 0.04158872179687023, | |
| "epoch": 3.8674698795180724, | |
| "grad_norm": 0.4143630564212799, | |
| "learning_rate": 1.4407023375664644e-06, | |
| "loss": 0.08703690767288208, | |
| "mean_token_accuracy": 0.993314117193222, | |
| "num_tokens": 26133481.0, | |
| "step": 162 | |
| }, | |
| { | |
| "aux_loss": 8.042658805847168, | |
| "entropy": 0.04513395018875599, | |
| "epoch": 3.891566265060241, | |
| "grad_norm": 0.4163261651992798, | |
| "learning_rate": 1.440579319891596e-06, | |
| "loss": 0.08887109160423279, | |
| "mean_token_accuracy": 0.9932331144809723, | |
| "num_tokens": 26285677.0, | |
| "step": 163 | |
| }, | |
| { | |
| "aux_loss": 8.044297218322754, | |
| "entropy": 0.03768927603960037, | |
| "epoch": 3.9156626506024095, | |
| "grad_norm": 0.3762443959712982, | |
| "learning_rate": 1.440455504443656e-06, | |
| "loss": 0.08547879010438919, | |
| "mean_token_accuracy": 0.9941076934337616, | |
| "num_tokens": 26456101.0, | |
| "step": 164 | |
| }, | |
| { | |
| "aux_loss": 8.040573596954346, | |
| "entropy": 0.040223028510808945, | |
| "epoch": 3.9397590361445785, | |
| "grad_norm": 0.44806984066963196, | |
| "learning_rate": 1.4403308915024023e-06, | |
| "loss": 0.08660810440778732, | |
| "mean_token_accuracy": 0.9934520721435547, | |
| "num_tokens": 26599076.0, | |
| "step": 165 | |
| }, | |
| { | |
| "aux_loss": 8.042471408843994, | |
| "entropy": 0.038684969767928123, | |
| "epoch": 3.963855421686747, | |
| "grad_norm": 0.40352219343185425, | |
| "learning_rate": 1.4402054813493942e-06, | |
| "loss": 0.08614273369312286, | |
| "mean_token_accuracy": 0.9937964081764221, | |
| "num_tokens": 26769500.0, | |
| "step": 166 | |
| }, | |
| { | |
| "aux_loss": 8.041973114013672, | |
| "entropy": 0.037965722382068634, | |
| "epoch": 3.9879518072289155, | |
| "grad_norm": 0.38133445382118225, | |
| "learning_rate": 1.4400792742679925e-06, | |
| "loss": 0.08504779636859894, | |
| "mean_token_accuracy": 0.9941068291664124, | |
| "num_tokens": 26942979.0, | |
| "step": 167 | |
| }, | |
| { | |
| "aux_loss": 8.039653778076172, | |
| "entropy": 0.046194545924663544, | |
| "epoch": 4.0, | |
| "grad_norm": 0.5609819889068604, | |
| "learning_rate": 1.439952270543359e-06, | |
| "loss": 0.053759872913360596, | |
| "mean_token_accuracy": 0.9936670064926147, | |
| "num_tokens": 26965852.0, | |
| "step": 168 | |
| }, | |
| { | |
| "aux_loss": 8.043168544769287, | |
| "entropy": 0.03969798795878887, | |
| "epoch": 4.024096385542169, | |
| "grad_norm": 0.5476467609405518, | |
| "learning_rate": 1.4398244704624548e-06, | |
| "loss": 0.08540086448192596, | |
| "mean_token_accuracy": 0.9945910573005676, | |
| "num_tokens": 27138361.0, | |
| "step": 169 | |
| }, | |
| { | |
| "aux_loss": 8.041584968566895, | |
| "entropy": 0.037986068055033684, | |
| "epoch": 4.048192771084337, | |
| "grad_norm": 0.3398607075214386, | |
| "learning_rate": 1.4396958743140407e-06, | |
| "loss": 0.08402132987976074, | |
| "mean_token_accuracy": 0.9951412975788116, | |
| "num_tokens": 27298070.0, | |
| "step": 170 | |
| }, | |
| { | |
| "aux_loss": 8.041838645935059, | |
| "entropy": 0.03689403831958771, | |
| "epoch": 4.072289156626506, | |
| "grad_norm": 0.3282793462276459, | |
| "learning_rate": 1.4395664823886764e-06, | |
| "loss": 0.08331362903118134, | |
| "mean_token_accuracy": 0.9951364398002625, | |
| "num_tokens": 27477493.0, | |
| "step": 171 | |
| }, | |
| { | |
| "aux_loss": 8.042462825775146, | |
| "entropy": 0.04227207601070404, | |
| "epoch": 4.096385542168675, | |
| "grad_norm": 0.3614228367805481, | |
| "learning_rate": 1.4394362949787193e-06, | |
| "loss": 0.08635450899600983, | |
| "mean_token_accuracy": 0.9946377873420715, | |
| "num_tokens": 27650870.0, | |
| "step": 172 | |
| }, | |
| { | |
| "aux_loss": 8.040101051330566, | |
| "entropy": 0.039225177839398384, | |
| "epoch": 4.120481927710843, | |
| "grad_norm": 0.3621145486831665, | |
| "learning_rate": 1.4393053123783242e-06, | |
| "loss": 0.08554555475711823, | |
| "mean_token_accuracy": 0.9942145347595215, | |
| "num_tokens": 27809889.0, | |
| "step": 173 | |
| }, | |
| { | |
| "aux_loss": 8.042874336242676, | |
| "entropy": 0.04224075563251972, | |
| "epoch": 4.144578313253012, | |
| "grad_norm": 0.3778877854347229, | |
| "learning_rate": 1.439173534883443e-06, | |
| "loss": 0.08607605844736099, | |
| "mean_token_accuracy": 0.9945782423019409, | |
| "num_tokens": 27957420.0, | |
| "step": 174 | |
| }, | |
| { | |
| "aux_loss": 8.040241718292236, | |
| "entropy": 0.03377825953066349, | |
| "epoch": 4.168674698795181, | |
| "grad_norm": 0.34376251697540283, | |
| "learning_rate": 1.439040962791823e-06, | |
| "loss": 0.08279868215322495, | |
| "mean_token_accuracy": 0.9951018989086151, | |
| "num_tokens": 28127629.0, | |
| "step": 175 | |
| }, | |
| { | |
| "aux_loss": 8.042171955108643, | |
| "entropy": 0.03661440312862396, | |
| "epoch": 4.192771084337349, | |
| "grad_norm": 0.3872918486595154, | |
| "learning_rate": 1.4389075964030074e-06, | |
| "loss": 0.08358034491539001, | |
| "mean_token_accuracy": 0.9953621327877045, | |
| "num_tokens": 28293076.0, | |
| "step": 176 | |
| }, | |
| { | |
| "aux_loss": 8.040359020233154, | |
| "entropy": 0.035597002133727074, | |
| "epoch": 4.216867469879518, | |
| "grad_norm": 0.357154905796051, | |
| "learning_rate": 1.438773436018334e-06, | |
| "loss": 0.0828801617026329, | |
| "mean_token_accuracy": 0.9952186346054077, | |
| "num_tokens": 28453952.0, | |
| "step": 177 | |
| }, | |
| { | |
| "aux_loss": 8.042491912841797, | |
| "entropy": 0.04073164612054825, | |
| "epoch": 4.240963855421687, | |
| "grad_norm": 0.3982166349887848, | |
| "learning_rate": 1.438638481940934e-06, | |
| "loss": 0.08584737777709961, | |
| "mean_token_accuracy": 0.9942737519741058, | |
| "num_tokens": 28604320.0, | |
| "step": 178 | |
| }, | |
| { | |
| "aux_loss": 8.040094375610352, | |
| "entropy": 0.03856072202324867, | |
| "epoch": 4.265060240963855, | |
| "grad_norm": 0.3902375102043152, | |
| "learning_rate": 1.4385027344757331e-06, | |
| "loss": 0.08460918813943863, | |
| "mean_token_accuracy": 0.994719922542572, | |
| "num_tokens": 28756892.0, | |
| "step": 179 | |
| }, | |
| { | |
| "aux_loss": 8.040781497955322, | |
| "entropy": 0.035547565668821335, | |
| "epoch": 4.289156626506024, | |
| "grad_norm": 0.3302716016769409, | |
| "learning_rate": 1.438366193929449e-06, | |
| "loss": 0.0830703154206276, | |
| "mean_token_accuracy": 0.995084673166275, | |
| "num_tokens": 28930439.0, | |
| "step": 180 | |
| }, | |
| { | |
| "aux_loss": 8.039629459381104, | |
| "entropy": 0.04048551991581917, | |
| "epoch": 4.313253012048193, | |
| "grad_norm": 0.4318244457244873, | |
| "learning_rate": 1.4382288606105908e-06, | |
| "loss": 0.08579900115728378, | |
| "mean_token_accuracy": 0.9941352307796478, | |
| "num_tokens": 29092853.0, | |
| "step": 181 | |
| }, | |
| { | |
| "aux_loss": 8.040911674499512, | |
| "entropy": 0.03764263913035393, | |
| "epoch": 4.337349397590361, | |
| "grad_norm": 0.42847853899002075, | |
| "learning_rate": 1.4380907348294597e-06, | |
| "loss": 0.0839407742023468, | |
| "mean_token_accuracy": 0.9944304823875427, | |
| "num_tokens": 29226583.0, | |
| "step": 182 | |
| }, | |
| { | |
| "aux_loss": 8.039612770080566, | |
| "entropy": 0.03596244379878044, | |
| "epoch": 4.36144578313253, | |
| "grad_norm": 0.36768803000450134, | |
| "learning_rate": 1.4379518168981469e-06, | |
| "loss": 0.08371734619140625, | |
| "mean_token_accuracy": 0.9946404695510864, | |
| "num_tokens": 29381987.0, | |
| "step": 183 | |
| }, | |
| { | |
| "aux_loss": 8.040324211120605, | |
| "entropy": 0.038307564333081245, | |
| "epoch": 4.385542168674699, | |
| "grad_norm": 0.38769692182540894, | |
| "learning_rate": 1.437812107130534e-06, | |
| "loss": 0.08458788692951202, | |
| "mean_token_accuracy": 0.9944848418235779, | |
| "num_tokens": 29540073.0, | |
| "step": 184 | |
| }, | |
| { | |
| "aux_loss": 8.040425777435303, | |
| "entropy": 0.03475116938352585, | |
| "epoch": 4.409638554216867, | |
| "grad_norm": 0.3598844110965729, | |
| "learning_rate": 1.437671605842291e-06, | |
| "loss": 0.083564393222332, | |
| "mean_token_accuracy": 0.9947148263454437, | |
| "num_tokens": 29701935.0, | |
| "step": 185 | |
| }, | |
| { | |
| "aux_loss": 8.041619300842285, | |
| "entropy": 0.037232447415590286, | |
| "epoch": 4.433734939759036, | |
| "grad_norm": 0.4138000011444092, | |
| "learning_rate": 1.4375303133508774e-06, | |
| "loss": 0.08460228890180588, | |
| "mean_token_accuracy": 0.9941424429416656, | |
| "num_tokens": 29843884.0, | |
| "step": 186 | |
| }, | |
| { | |
| "aux_loss": 8.04134750366211, | |
| "entropy": 0.036806127056479454, | |
| "epoch": 4.457831325301205, | |
| "grad_norm": 0.4106656610965729, | |
| "learning_rate": 1.437388229975539e-06, | |
| "loss": 0.08441147208213806, | |
| "mean_token_accuracy": 0.9946633577346802, | |
| "num_tokens": 29987812.0, | |
| "step": 187 | |
| }, | |
| { | |
| "aux_loss": 8.039554119110107, | |
| "entropy": 0.03547658585011959, | |
| "epoch": 4.481927710843373, | |
| "grad_norm": 0.3592974841594696, | |
| "learning_rate": 1.4372453560373097e-06, | |
| "loss": 0.0837140679359436, | |
| "mean_token_accuracy": 0.9946017563343048, | |
| "num_tokens": 30149270.0, | |
| "step": 188 | |
| }, | |
| { | |
| "aux_loss": 8.041821479797363, | |
| "entropy": 0.035800814628601074, | |
| "epoch": 4.506024096385542, | |
| "grad_norm": 0.36003249883651733, | |
| "learning_rate": 1.437101691859009e-06, | |
| "loss": 0.08376017212867737, | |
| "mean_token_accuracy": 0.9945588111877441, | |
| "num_tokens": 30307956.0, | |
| "step": 189 | |
| }, | |
| { | |
| "aux_loss": 8.042970180511475, | |
| "entropy": 0.040934668853878975, | |
| "epoch": 4.530120481927711, | |
| "grad_norm": 0.42162829637527466, | |
| "learning_rate": 1.4369572377652423e-06, | |
| "loss": 0.08601701259613037, | |
| "mean_token_accuracy": 0.9943284690380096, | |
| "num_tokens": 30494893.0, | |
| "step": 190 | |
| }, | |
| { | |
| "aux_loss": 8.041118144989014, | |
| "entropy": 0.03687039390206337, | |
| "epoch": 4.554216867469879, | |
| "grad_norm": 0.370378315448761, | |
| "learning_rate": 1.4368119940823998e-06, | |
| "loss": 0.08406563103199005, | |
| "mean_token_accuracy": 0.9943959414958954, | |
| "num_tokens": 30672420.0, | |
| "step": 191 | |
| }, | |
| { | |
| "aux_loss": 8.040582656860352, | |
| "entropy": 0.03540595434606075, | |
| "epoch": 4.578313253012048, | |
| "grad_norm": 0.38017594814300537, | |
| "learning_rate": 1.4366659611386557e-06, | |
| "loss": 0.08305495977401733, | |
| "mean_token_accuracy": 0.9947693049907684, | |
| "num_tokens": 30847054.0, | |
| "step": 192 | |
| }, | |
| { | |
| "aux_loss": 8.042843341827393, | |
| "entropy": 0.04187178239226341, | |
| "epoch": 4.602409638554217, | |
| "grad_norm": 0.3843596577644348, | |
| "learning_rate": 1.436519139263967e-06, | |
| "loss": 0.08659607917070389, | |
| "mean_token_accuracy": 0.9939823746681213, | |
| "num_tokens": 31000786.0, | |
| "step": 193 | |
| }, | |
| { | |
| "aux_loss": 8.041165351867676, | |
| "entropy": 0.034371569752693176, | |
| "epoch": 4.626506024096385, | |
| "grad_norm": 0.37609967589378357, | |
| "learning_rate": 1.4363715287900742e-06, | |
| "loss": 0.08291493356227875, | |
| "mean_token_accuracy": 0.9949217736721039, | |
| "num_tokens": 31180147.0, | |
| "step": 194 | |
| }, | |
| { | |
| "aux_loss": 8.040238380432129, | |
| "entropy": 0.03516504354774952, | |
| "epoch": 4.650602409638554, | |
| "grad_norm": 0.3637091815471649, | |
| "learning_rate": 1.4362231300504988e-06, | |
| "loss": 0.08338074386119843, | |
| "mean_token_accuracy": 0.9948630630970001, | |
| "num_tokens": 31343986.0, | |
| "step": 195 | |
| }, | |
| { | |
| "aux_loss": 8.041361808776855, | |
| "entropy": 0.04160070978105068, | |
| "epoch": 4.674698795180722, | |
| "grad_norm": 0.4149928390979767, | |
| "learning_rate": 1.4360739433805439e-06, | |
| "loss": 0.08658482134342194, | |
| "mean_token_accuracy": 0.9941949248313904, | |
| "num_tokens": 31512880.0, | |
| "step": 196 | |
| }, | |
| { | |
| "aux_loss": 8.040586948394775, | |
| "entropy": 0.04432631470263004, | |
| "epoch": 4.698795180722891, | |
| "grad_norm": 0.40140870213508606, | |
| "learning_rate": 1.4359239691172926e-06, | |
| "loss": 0.08757840096950531, | |
| "mean_token_accuracy": 0.9936575889587402, | |
| "num_tokens": 31661985.0, | |
| "step": 197 | |
| }, | |
| { | |
| "aux_loss": 8.040112018585205, | |
| "entropy": 0.037308650091290474, | |
| "epoch": 4.72289156626506, | |
| "grad_norm": 0.39514875411987305, | |
| "learning_rate": 1.4357732075996076e-06, | |
| "loss": 0.08466262370347977, | |
| "mean_token_accuracy": 0.9945145845413208, | |
| "num_tokens": 31842845.0, | |
| "step": 198 | |
| }, | |
| { | |
| "aux_loss": 8.041626930236816, | |
| "entropy": 0.04097534902393818, | |
| "epoch": 4.746987951807229, | |
| "grad_norm": 0.405231237411499, | |
| "learning_rate": 1.4356216591681305e-06, | |
| "loss": 0.08651918172836304, | |
| "mean_token_accuracy": 0.9938961267471313, | |
| "num_tokens": 31994483.0, | |
| "step": 199 | |
| }, | |
| { | |
| "aux_loss": 8.038835525512695, | |
| "entropy": 0.03753245994448662, | |
| "epoch": 4.771084337349397, | |
| "grad_norm": 0.3914196789264679, | |
| "learning_rate": 1.4354693241652809e-06, | |
| "loss": 0.08507226407527924, | |
| "mean_token_accuracy": 0.9937683045864105, | |
| "num_tokens": 32153186.0, | |
| "step": 200 | |
| }, | |
| { | |
| "aux_loss": 8.039247989654541, | |
| "entropy": 0.037701187655329704, | |
| "epoch": 4.795180722891566, | |
| "grad_norm": 0.3929915130138397, | |
| "learning_rate": 1.4353162029352554e-06, | |
| "loss": 0.0845346599817276, | |
| "mean_token_accuracy": 0.9943271279335022, | |
| "num_tokens": 32309805.0, | |
| "step": 201 | |
| }, | |
| { | |
| "aux_loss": 8.04191780090332, | |
| "entropy": 0.04091975465416908, | |
| "epoch": 4.8192771084337345, | |
| "grad_norm": 0.4561111032962799, | |
| "learning_rate": 1.4351622958240273e-06, | |
| "loss": 0.08624639362096786, | |
| "mean_token_accuracy": 0.9937124252319336, | |
| "num_tokens": 32483341.0, | |
| "step": 202 | |
| }, | |
| { | |
| "aux_loss": 8.04048204421997, | |
| "entropy": 0.034330458380281925, | |
| "epoch": 4.843373493975903, | |
| "grad_norm": 0.367446631193161, | |
| "learning_rate": 1.4350076031793456e-06, | |
| "loss": 0.08318167924880981, | |
| "mean_token_accuracy": 0.9946629703044891, | |
| "num_tokens": 32647509.0, | |
| "step": 203 | |
| }, | |
| { | |
| "aux_loss": 8.04125452041626, | |
| "entropy": 0.03692132607102394, | |
| "epoch": 4.867469879518072, | |
| "grad_norm": 0.403191477060318, | |
| "learning_rate": 1.4348521253507344e-06, | |
| "loss": 0.08472205698490143, | |
| "mean_token_accuracy": 0.9941362142562866, | |
| "num_tokens": 32839256.0, | |
| "step": 204 | |
| }, | |
| { | |
| "aux_loss": 8.039531230926514, | |
| "entropy": 0.038704318925738335, | |
| "epoch": 4.891566265060241, | |
| "grad_norm": 0.39772483706474304, | |
| "learning_rate": 1.434695862689491e-06, | |
| "loss": 0.08526815474033356, | |
| "mean_token_accuracy": 0.9942019283771515, | |
| "num_tokens": 33003150.0, | |
| "step": 205 | |
| }, | |
| { | |
| "aux_loss": 8.040374755859375, | |
| "entropy": 0.03595581278204918, | |
| "epoch": 4.9156626506024095, | |
| "grad_norm": 0.4022948741912842, | |
| "learning_rate": 1.4345388155486866e-06, | |
| "loss": 0.08391736447811127, | |
| "mean_token_accuracy": 0.9942536056041718, | |
| "num_tokens": 33179546.0, | |
| "step": 206 | |
| }, | |
| { | |
| "aux_loss": 8.039075374603271, | |
| "entropy": 0.03800219111144543, | |
| "epoch": 4.9397590361445785, | |
| "grad_norm": 0.380649209022522, | |
| "learning_rate": 1.4343809842831657e-06, | |
| "loss": 0.08527541905641556, | |
| "mean_token_accuracy": 0.9943437278270721, | |
| "num_tokens": 33351836.0, | |
| "step": 207 | |
| }, | |
| { | |
| "aux_loss": 8.043510913848877, | |
| "entropy": 0.04215468093752861, | |
| "epoch": 4.9638554216867465, | |
| "grad_norm": 0.41969671845436096, | |
| "learning_rate": 1.4342223692495428e-06, | |
| "loss": 0.08674986660480499, | |
| "mean_token_accuracy": 0.9934200346469879, | |
| "num_tokens": 33505025.0, | |
| "step": 208 | |
| }, | |
| { | |
| "aux_loss": 8.039401054382324, | |
| "entropy": 0.03880974091589451, | |
| "epoch": 4.9879518072289155, | |
| "grad_norm": 0.37678730487823486, | |
| "learning_rate": 1.4340629708062048e-06, | |
| "loss": 0.08524405211210251, | |
| "mean_token_accuracy": 0.9945527911186218, | |
| "num_tokens": 33660485.0, | |
| "step": 209 | |
| }, | |
| { | |
| "aux_loss": 8.04077434539795, | |
| "entropy": 0.03518826887011528, | |
| "epoch": 5.0, | |
| "grad_norm": 0.48134711384773254, | |
| "learning_rate": 1.433902789313308e-06, | |
| "loss": 0.050809722393751144, | |
| "mean_token_accuracy": 0.9939299821853638, | |
| "num_tokens": 33707315.0, | |
| "step": 210 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 2100, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 50, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 6.986904899933962e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |