{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 4508, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.4996726989746094, "epoch": 0.0022186477342060014, "grad_norm": 0.640625, "learning_rate": 4.990017746228927e-05, "loss": 1.1004, "mean_token_accuracy": 0.7237629115581512, "num_tokens": 909841.0, "step": 10 }, { "entropy": 1.4749152779579162, "epoch": 0.004437295468412003, "grad_norm": 0.609375, "learning_rate": 4.978926353149956e-05, "loss": 1.101, "mean_token_accuracy": 0.7234805017709732, "num_tokens": 1834174.0, "step": 20 }, { "entropy": 1.4161717116832733, "epoch": 0.006655943202618004, "grad_norm": 0.58203125, "learning_rate": 4.967834960070985e-05, "loss": 1.0533, "mean_token_accuracy": 0.7340411610901356, "num_tokens": 2779537.0, "step": 30 }, { "entropy": 1.4273382410407067, "epoch": 0.008874590936824005, "grad_norm": 0.5625, "learning_rate": 4.9567435669920145e-05, "loss": 1.0489, "mean_token_accuracy": 0.7345465816557407, "num_tokens": 3733014.0, "step": 40 }, { "entropy": 1.414509892463684, "epoch": 0.011093238671030008, "grad_norm": 0.5703125, "learning_rate": 4.945652173913044e-05, "loss": 1.0496, "mean_token_accuracy": 0.7320007584989071, "num_tokens": 4694268.0, "step": 50 }, { "entropy": 1.397396445274353, "epoch": 0.013311886405236008, "grad_norm": 0.53125, "learning_rate": 4.934560780834073e-05, "loss": 1.0067, "mean_token_accuracy": 0.7418178603053093, "num_tokens": 5617442.0, "step": 60 }, { "entropy": 1.4162584945559502, "epoch": 0.01553053413944201, "grad_norm": 0.59765625, "learning_rate": 4.923469387755102e-05, "loss": 1.0315, "mean_token_accuracy": 0.7393374048173428, "num_tokens": 6545669.0, "step": 70 }, { "entropy": 1.3941649526357651, "epoch": 0.01774918187364801, "grad_norm": 0.67578125, "learning_rate": 4.9123779946761314e-05, "loss": 1.0467, "mean_token_accuracy": 0.7343609191477298, "num_tokens": 7508566.0, "step": 80 }, { "entropy": 1.4546006247401237, "epoch": 0.019967829607854013, "grad_norm": 0.58203125, "learning_rate": 4.9012866015971606e-05, "loss": 1.0777, "mean_token_accuracy": 0.7278525292873382, "num_tokens": 8457985.0, "step": 90 }, { "entropy": 1.4280843511223793, "epoch": 0.022186477342060015, "grad_norm": 0.6328125, "learning_rate": 4.8901952085181905e-05, "loss": 1.0605, "mean_token_accuracy": 0.7319539472460747, "num_tokens": 9401548.0, "step": 100 }, { "entropy": 1.4251440301537515, "epoch": 0.024405125076266018, "grad_norm": 0.55859375, "learning_rate": 4.87910381543922e-05, "loss": 1.0505, "mean_token_accuracy": 0.7344287090003491, "num_tokens": 10343177.0, "step": 110 }, { "entropy": 1.3903976306319237, "epoch": 0.026623772810472016, "grad_norm": 0.5703125, "learning_rate": 4.868012422360249e-05, "loss": 1.012, "mean_token_accuracy": 0.7406081691384315, "num_tokens": 11262171.0, "step": 120 }, { "entropy": 1.4572355687618255, "epoch": 0.02884242054467802, "grad_norm": 0.6171875, "learning_rate": 4.856921029281278e-05, "loss": 1.0934, "mean_token_accuracy": 0.7263241574168205, "num_tokens": 12207213.0, "step": 130 }, { "entropy": 1.3774912744760512, "epoch": 0.03106106827888402, "grad_norm": 0.5703125, "learning_rate": 4.845829636202307e-05, "loss": 0.9988, "mean_token_accuracy": 0.7457391232252121, "num_tokens": 13169677.0, "step": 140 }, { "entropy": 1.3801545724272728, "epoch": 0.03327971601309002, "grad_norm": 0.578125, "learning_rate": 4.8347382431233365e-05, "loss": 1.0128, "mean_token_accuracy": 0.7391506642103195, "num_tokens": 14101879.0, "step": 150 }, { "entropy": 1.383959451317787, "epoch": 0.03549836374729602, "grad_norm": 0.5703125, "learning_rate": 4.823646850044366e-05, "loss": 1.0289, "mean_token_accuracy": 0.7387954272329808, "num_tokens": 15070630.0, "step": 160 }, { "entropy": 1.3918858915567398, "epoch": 0.03771701148150203, "grad_norm": 0.578125, "learning_rate": 4.812555456965395e-05, "loss": 1.0241, "mean_token_accuracy": 0.7366124205291271, "num_tokens": 16027843.0, "step": 170 }, { "entropy": 1.428921215236187, "epoch": 0.039935659215708026, "grad_norm": 0.56640625, "learning_rate": 4.801464063886424e-05, "loss": 1.036, "mean_token_accuracy": 0.7360907278954982, "num_tokens": 16947937.0, "step": 180 }, { "entropy": 1.4443669021129608, "epoch": 0.042154306949914025, "grad_norm": 0.60546875, "learning_rate": 4.7903726708074534e-05, "loss": 1.0389, "mean_token_accuracy": 0.7340119168162346, "num_tokens": 17851722.0, "step": 190 }, { "entropy": 1.4278473794460296, "epoch": 0.04437295468412003, "grad_norm": 0.5546875, "learning_rate": 4.7792812777284826e-05, "loss": 1.048, "mean_token_accuracy": 0.7365864336490631, "num_tokens": 18798538.0, "step": 200 }, { "entropy": 1.4079762324690819, "epoch": 0.04659160241832603, "grad_norm": 0.58203125, "learning_rate": 4.768189884649512e-05, "loss": 1.0217, "mean_token_accuracy": 0.7381824173033238, "num_tokens": 19746990.0, "step": 210 }, { "entropy": 1.4014856681227683, "epoch": 0.048810250152532035, "grad_norm": 0.5625, "learning_rate": 4.757098491570541e-05, "loss": 1.0218, "mean_token_accuracy": 0.7401599958539009, "num_tokens": 20669202.0, "step": 220 }, { "entropy": 1.3362741515040397, "epoch": 0.051028897886738034, "grad_norm": 0.54296875, "learning_rate": 4.74600709849157e-05, "loss": 0.9708, "mean_token_accuracy": 0.7500613324344159, "num_tokens": 21636384.0, "step": 230 }, { "entropy": 1.4148907586932182, "epoch": 0.05324754562094403, "grad_norm": 0.5703125, "learning_rate": 4.7349157054126e-05, "loss": 1.0376, "mean_token_accuracy": 0.7359736375510693, "num_tokens": 22574934.0, "step": 240 }, { "entropy": 1.4070934116840363, "epoch": 0.05546619335515004, "grad_norm": 0.62890625, "learning_rate": 4.7238243123336293e-05, "loss": 1.019, "mean_token_accuracy": 0.7393471024930477, "num_tokens": 23510479.0, "step": 250 }, { "entropy": 1.4115072026848794, "epoch": 0.05768484108935604, "grad_norm": 0.61328125, "learning_rate": 4.7127329192546586e-05, "loss": 1.0324, "mean_token_accuracy": 0.7382585242390632, "num_tokens": 24464735.0, "step": 260 }, { "entropy": 1.3863993905484677, "epoch": 0.059903488823562036, "grad_norm": 0.578125, "learning_rate": 4.701641526175688e-05, "loss": 0.9979, "mean_token_accuracy": 0.7422027714550495, "num_tokens": 25396556.0, "step": 270 }, { "entropy": 1.3688023373484612, "epoch": 0.06212213655776804, "grad_norm": 0.5859375, "learning_rate": 4.690550133096717e-05, "loss": 0.9956, "mean_token_accuracy": 0.7453529857099056, "num_tokens": 26353783.0, "step": 280 }, { "entropy": 1.3656944148242474, "epoch": 0.06434078429197404, "grad_norm": 0.5625, "learning_rate": 4.679458740017746e-05, "loss": 0.9969, "mean_token_accuracy": 0.7447779856622219, "num_tokens": 27304682.0, "step": 290 }, { "entropy": 1.3630746126174926, "epoch": 0.06655943202618005, "grad_norm": 0.5234375, "learning_rate": 4.6683673469387754e-05, "loss": 1.0053, "mean_token_accuracy": 0.7430833972990513, "num_tokens": 28275130.0, "step": 300 }, { "entropy": 1.405807738006115, "epoch": 0.06877807976038605, "grad_norm": 0.54296875, "learning_rate": 4.6572759538598046e-05, "loss": 1.0312, "mean_token_accuracy": 0.736625573784113, "num_tokens": 29208090.0, "step": 310 }, { "entropy": 1.4168103411793709, "epoch": 0.07099672749459204, "grad_norm": 0.5859375, "learning_rate": 4.646184560780834e-05, "loss": 1.0463, "mean_token_accuracy": 0.7340070068836212, "num_tokens": 30132884.0, "step": 320 }, { "entropy": 1.328667588531971, "epoch": 0.07321537522879805, "grad_norm": 0.578125, "learning_rate": 4.635093167701863e-05, "loss": 0.9905, "mean_token_accuracy": 0.7449391677975654, "num_tokens": 31096131.0, "step": 330 }, { "entropy": 1.3874380961060524, "epoch": 0.07543402296300405, "grad_norm": 0.55078125, "learning_rate": 4.624001774622893e-05, "loss": 0.9946, "mean_token_accuracy": 0.7445168398320675, "num_tokens": 32025666.0, "step": 340 }, { "entropy": 1.3859788089990617, "epoch": 0.07765267069721005, "grad_norm": 0.52734375, "learning_rate": 4.612910381543922e-05, "loss": 0.9871, "mean_token_accuracy": 0.7463914036750794, "num_tokens": 32965922.0, "step": 350 }, { "entropy": 1.4040928453207016, "epoch": 0.07987131843141605, "grad_norm": 0.58203125, "learning_rate": 4.6018189884649514e-05, "loss": 0.9979, "mean_token_accuracy": 0.7431536763906479, "num_tokens": 33896621.0, "step": 360 }, { "entropy": 1.4107008963823318, "epoch": 0.08208996616562206, "grad_norm": 0.6015625, "learning_rate": 4.5907275953859806e-05, "loss": 1.0311, "mean_token_accuracy": 0.7370501346886158, "num_tokens": 34842327.0, "step": 370 }, { "entropy": 1.3692341327667237, "epoch": 0.08430861389982805, "grad_norm": 0.546875, "learning_rate": 4.57963620230701e-05, "loss": 0.9932, "mean_token_accuracy": 0.7449106052517891, "num_tokens": 35785569.0, "step": 380 }, { "entropy": 1.3753847882151604, "epoch": 0.08652726163403406, "grad_norm": 0.55859375, "learning_rate": 4.568544809228039e-05, "loss": 1.0154, "mean_token_accuracy": 0.7405989103019237, "num_tokens": 36720371.0, "step": 390 }, { "entropy": 1.3850012436509131, "epoch": 0.08874590936824006, "grad_norm": 0.5546875, "learning_rate": 4.557453416149068e-05, "loss": 0.9946, "mean_token_accuracy": 0.743626830726862, "num_tokens": 37663502.0, "step": 400 }, { "entropy": 1.4084563165903092, "epoch": 0.09096455710244605, "grad_norm": 0.56640625, "learning_rate": 4.5463620230700974e-05, "loss": 1.0224, "mean_token_accuracy": 0.7386880144476891, "num_tokens": 38595385.0, "step": 410 }, { "entropy": 1.4221973702311517, "epoch": 0.09318320483665206, "grad_norm": 0.5625, "learning_rate": 4.5352706299911266e-05, "loss": 1.0401, "mean_token_accuracy": 0.7350750401616096, "num_tokens": 39560136.0, "step": 420 }, { "entropy": 1.3766985535621643, "epoch": 0.09540185257085806, "grad_norm": 0.57421875, "learning_rate": 4.5241792369121565e-05, "loss": 0.9819, "mean_token_accuracy": 0.7460968688130378, "num_tokens": 40504329.0, "step": 430 }, { "entropy": 1.3452365651726723, "epoch": 0.09762050030506407, "grad_norm": 0.5703125, "learning_rate": 4.513087843833186e-05, "loss": 0.9656, "mean_token_accuracy": 0.7495473526418209, "num_tokens": 41447374.0, "step": 440 }, { "entropy": 1.4052437961101532, "epoch": 0.09983914803927006, "grad_norm": 0.57421875, "learning_rate": 4.501996450754215e-05, "loss": 1.029, "mean_token_accuracy": 0.7380021281540394, "num_tokens": 42352403.0, "step": 450 }, { "entropy": 1.3656214989721775, "epoch": 0.10205779577347607, "grad_norm": 0.60546875, "learning_rate": 4.490905057675244e-05, "loss": 0.9861, "mean_token_accuracy": 0.7466712445020676, "num_tokens": 43285467.0, "step": 460 }, { "entropy": 1.359076064825058, "epoch": 0.10427644350768207, "grad_norm": 0.5078125, "learning_rate": 4.4798136645962734e-05, "loss": 0.9999, "mean_token_accuracy": 0.743770582973957, "num_tokens": 44255931.0, "step": 470 }, { "entropy": 1.3802897572517394, "epoch": 0.10649509124188807, "grad_norm": 0.57421875, "learning_rate": 4.4687222715173026e-05, "loss": 1.0001, "mean_token_accuracy": 0.7432407602667809, "num_tokens": 45184260.0, "step": 480 }, { "entropy": 1.3991574339568615, "epoch": 0.10871373897609407, "grad_norm": 0.578125, "learning_rate": 4.457630878438332e-05, "loss": 1.0154, "mean_token_accuracy": 0.7401745900511741, "num_tokens": 46148392.0, "step": 490 }, { "entropy": 1.3566242396831512, "epoch": 0.11093238671030008, "grad_norm": 0.61328125, "learning_rate": 4.446539485359361e-05, "loss": 0.9846, "mean_token_accuracy": 0.7464064188301563, "num_tokens": 47078335.0, "step": 500 }, { "entropy": 1.3858811572194099, "epoch": 0.11315103444450607, "grad_norm": 0.51171875, "learning_rate": 4.43544809228039e-05, "loss": 0.9912, "mean_token_accuracy": 0.7457821436226368, "num_tokens": 48018551.0, "step": 510 }, { "entropy": 1.3758568353950977, "epoch": 0.11536968217871207, "grad_norm": 0.51171875, "learning_rate": 4.42435669920142e-05, "loss": 0.9886, "mean_token_accuracy": 0.7470844730734825, "num_tokens": 48974568.0, "step": 520 }, { "entropy": 1.3550358980894088, "epoch": 0.11758832991291808, "grad_norm": 0.5390625, "learning_rate": 4.4132653061224493e-05, "loss": 0.9694, "mean_token_accuracy": 0.7498566247522831, "num_tokens": 49932695.0, "step": 530 }, { "entropy": 1.3841885790228843, "epoch": 0.11980697764712407, "grad_norm": 0.51953125, "learning_rate": 4.4021739130434786e-05, "loss": 1.0022, "mean_token_accuracy": 0.7409815572202205, "num_tokens": 50866996.0, "step": 540 }, { "entropy": 1.3405610300600528, "epoch": 0.12202562538133008, "grad_norm": 0.5625, "learning_rate": 4.391082519964508e-05, "loss": 0.9921, "mean_token_accuracy": 0.746824074536562, "num_tokens": 51808608.0, "step": 550 }, { "entropy": 1.3757329672574996, "epoch": 0.12424427311553608, "grad_norm": 0.5390625, "learning_rate": 4.379991126885537e-05, "loss": 0.9985, "mean_token_accuracy": 0.7443767100572586, "num_tokens": 52747915.0, "step": 560 }, { "entropy": 1.3554963186383246, "epoch": 0.1264629208497421, "grad_norm": 0.5625, "learning_rate": 4.368899733806566e-05, "loss": 0.9713, "mean_token_accuracy": 0.7524632543325425, "num_tokens": 53688292.0, "step": 570 }, { "entropy": 1.398676659166813, "epoch": 0.12868156858394808, "grad_norm": 0.56640625, "learning_rate": 4.3578083407275954e-05, "loss": 1.0127, "mean_token_accuracy": 0.7388371795415878, "num_tokens": 54653551.0, "step": 580 }, { "entropy": 1.3686447888612747, "epoch": 0.13090021631815407, "grad_norm": 0.57421875, "learning_rate": 4.3467169476486246e-05, "loss": 0.9858, "mean_token_accuracy": 0.7466567374765873, "num_tokens": 55613826.0, "step": 590 }, { "entropy": 1.3752284094691276, "epoch": 0.1331188640523601, "grad_norm": 0.578125, "learning_rate": 4.335625554569654e-05, "loss": 1.0096, "mean_token_accuracy": 0.7415601670742035, "num_tokens": 56548552.0, "step": 600 }, { "entropy": 1.3863979026675224, "epoch": 0.13533751178656608, "grad_norm": 0.57421875, "learning_rate": 4.324534161490684e-05, "loss": 1.0217, "mean_token_accuracy": 0.7401334017515182, "num_tokens": 57528307.0, "step": 610 }, { "entropy": 1.3773459926247598, "epoch": 0.1375561595207721, "grad_norm": 0.56640625, "learning_rate": 4.313442768411713e-05, "loss": 1.0188, "mean_token_accuracy": 0.740601348131895, "num_tokens": 58432573.0, "step": 620 }, { "entropy": 1.3685629293322563, "epoch": 0.1397748072549781, "grad_norm": 0.5703125, "learning_rate": 4.302351375332742e-05, "loss": 0.9738, "mean_token_accuracy": 0.748286597430706, "num_tokens": 59388628.0, "step": 630 }, { "entropy": 1.3901671305298806, "epoch": 0.1419934549891841, "grad_norm": 0.53125, "learning_rate": 4.2912599822537714e-05, "loss": 0.998, "mean_token_accuracy": 0.7412993647158146, "num_tokens": 60325800.0, "step": 640 }, { "entropy": 1.34510198533535, "epoch": 0.1442121027233901, "grad_norm": 0.54296875, "learning_rate": 4.2801685891748006e-05, "loss": 0.9638, "mean_token_accuracy": 0.7532913006842137, "num_tokens": 61300321.0, "step": 650 }, { "entropy": 1.3802052095532418, "epoch": 0.1464307504575961, "grad_norm": 0.578125, "learning_rate": 4.26907719609583e-05, "loss": 1.0103, "mean_token_accuracy": 0.7420814141631127, "num_tokens": 62232968.0, "step": 660 }, { "entropy": 1.346378207206726, "epoch": 0.1486493981918021, "grad_norm": 0.57421875, "learning_rate": 4.257985803016859e-05, "loss": 0.9557, "mean_token_accuracy": 0.7515577465295792, "num_tokens": 63184820.0, "step": 670 }, { "entropy": 1.3793225064873695, "epoch": 0.1508680459260081, "grad_norm": 0.53515625, "learning_rate": 4.246894409937888e-05, "loss": 1.0116, "mean_token_accuracy": 0.7416508607566357, "num_tokens": 64146856.0, "step": 680 }, { "entropy": 1.370984847843647, "epoch": 0.1530866936602141, "grad_norm": 0.53125, "learning_rate": 4.2358030168589174e-05, "loss": 0.9871, "mean_token_accuracy": 0.7441729478538036, "num_tokens": 65076302.0, "step": 690 }, { "entropy": 1.4060401052236557, "epoch": 0.1553053413944201, "grad_norm": 0.6171875, "learning_rate": 4.224711623779947e-05, "loss": 1.0304, "mean_token_accuracy": 0.7379218600690365, "num_tokens": 65997560.0, "step": 700 }, { "entropy": 1.3768175289034843, "epoch": 0.1575239891286261, "grad_norm": 0.56640625, "learning_rate": 4.2136202307009765e-05, "loss": 1.0149, "mean_token_accuracy": 0.7417769655585289, "num_tokens": 66965724.0, "step": 710 }, { "entropy": 1.340875183045864, "epoch": 0.1597426368628321, "grad_norm": 0.52734375, "learning_rate": 4.202528837622006e-05, "loss": 0.9412, "mean_token_accuracy": 0.7555658839643001, "num_tokens": 67898095.0, "step": 720 }, { "entropy": 1.391999800503254, "epoch": 0.1619612845970381, "grad_norm": 0.609375, "learning_rate": 4.191437444543035e-05, "loss": 0.9839, "mean_token_accuracy": 0.7462506376206874, "num_tokens": 68844871.0, "step": 730 }, { "entropy": 1.38314318805933, "epoch": 0.16417993233124412, "grad_norm": 0.51953125, "learning_rate": 4.180346051464064e-05, "loss": 1.0097, "mean_token_accuracy": 0.7410484097898007, "num_tokens": 69767489.0, "step": 740 }, { "entropy": 1.3815456658601761, "epoch": 0.1663985800654501, "grad_norm": 0.56640625, "learning_rate": 4.1692546583850934e-05, "loss": 0.9754, "mean_token_accuracy": 0.7478328756988049, "num_tokens": 70707718.0, "step": 750 }, { "entropy": 1.3746361419558526, "epoch": 0.1686172277996561, "grad_norm": 0.5859375, "learning_rate": 4.1581632653061226e-05, "loss": 0.987, "mean_token_accuracy": 0.747043264657259, "num_tokens": 71653766.0, "step": 760 }, { "entropy": 1.3854685127735138, "epoch": 0.17083587553386212, "grad_norm": 0.5625, "learning_rate": 4.147071872227152e-05, "loss": 1.0288, "mean_token_accuracy": 0.7364709347486496, "num_tokens": 72601815.0, "step": 770 }, { "entropy": 1.3882519789040089, "epoch": 0.1730545232680681, "grad_norm": 0.546875, "learning_rate": 4.135980479148181e-05, "loss": 1.0141, "mean_token_accuracy": 0.7391402766108512, "num_tokens": 73560646.0, "step": 780 }, { "entropy": 1.3660476624965667, "epoch": 0.1752731710022741, "grad_norm": 0.5703125, "learning_rate": 4.124889086069211e-05, "loss": 0.9924, "mean_token_accuracy": 0.7450746014714241, "num_tokens": 74500221.0, "step": 790 }, { "entropy": 1.3751828119158744, "epoch": 0.17749181873648012, "grad_norm": 0.5390625, "learning_rate": 4.11379769299024e-05, "loss": 1.0004, "mean_token_accuracy": 0.7434543266892433, "num_tokens": 75399976.0, "step": 800 }, { "entropy": 1.354314035922289, "epoch": 0.17971046647068611, "grad_norm": 0.51953125, "learning_rate": 4.1027062999112693e-05, "loss": 0.9623, "mean_token_accuracy": 0.7510982856154442, "num_tokens": 76358729.0, "step": 810 }, { "entropy": 1.3439435064792633, "epoch": 0.1819291142048921, "grad_norm": 0.56640625, "learning_rate": 4.0916149068322986e-05, "loss": 0.9607, "mean_token_accuracy": 0.7531138896942139, "num_tokens": 77311440.0, "step": 820 }, { "entropy": 1.3753922283649445, "epoch": 0.18414776193909813, "grad_norm": 0.546875, "learning_rate": 4.080523513753328e-05, "loss": 0.9839, "mean_token_accuracy": 0.7464477054774761, "num_tokens": 78248418.0, "step": 830 }, { "entropy": 1.3592103332281114, "epoch": 0.18636640967330412, "grad_norm": 0.52734375, "learning_rate": 4.069432120674357e-05, "loss": 0.9724, "mean_token_accuracy": 0.7482516840100288, "num_tokens": 79193662.0, "step": 840 }, { "entropy": 1.3815738067030907, "epoch": 0.1885850574075101, "grad_norm": 0.5859375, "learning_rate": 4.058340727595386e-05, "loss": 0.9826, "mean_token_accuracy": 0.7456090994179249, "num_tokens": 80111085.0, "step": 850 }, { "entropy": 1.3659467726945878, "epoch": 0.19080370514171613, "grad_norm": 0.52734375, "learning_rate": 4.0472493345164154e-05, "loss": 0.9858, "mean_token_accuracy": 0.7455601133406162, "num_tokens": 81041558.0, "step": 860 }, { "entropy": 1.39312274903059, "epoch": 0.19302235287592212, "grad_norm": 0.5546875, "learning_rate": 4.0361579414374446e-05, "loss": 1.0138, "mean_token_accuracy": 0.7410866186022759, "num_tokens": 81959502.0, "step": 870 }, { "entropy": 1.394485105574131, "epoch": 0.19524100061012814, "grad_norm": 0.60546875, "learning_rate": 4.025066548358474e-05, "loss": 1.0044, "mean_token_accuracy": 0.7429567784070968, "num_tokens": 82914796.0, "step": 880 }, { "entropy": 1.3824292540550231, "epoch": 0.19745964834433413, "grad_norm": 0.52734375, "learning_rate": 4.013975155279504e-05, "loss": 0.9947, "mean_token_accuracy": 0.7459897518157959, "num_tokens": 83875692.0, "step": 890 }, { "entropy": 1.327862946689129, "epoch": 0.19967829607854012, "grad_norm": 0.5546875, "learning_rate": 4.002883762200533e-05, "loss": 0.923, "mean_token_accuracy": 0.7600434601306916, "num_tokens": 84802764.0, "step": 900 }, { "entropy": 1.3845474988222122, "epoch": 0.20189694381274614, "grad_norm": 0.5703125, "learning_rate": 3.991792369121562e-05, "loss": 0.9861, "mean_token_accuracy": 0.7468884617090226, "num_tokens": 85748938.0, "step": 910 }, { "entropy": 1.3717331126332284, "epoch": 0.20411559154695214, "grad_norm": 0.54296875, "learning_rate": 3.9807009760425914e-05, "loss": 0.9829, "mean_token_accuracy": 0.7473111696541309, "num_tokens": 86700841.0, "step": 920 }, { "entropy": 1.3603821635246276, "epoch": 0.20633423928115813, "grad_norm": 0.515625, "learning_rate": 3.9696095829636206e-05, "loss": 0.9704, "mean_token_accuracy": 0.7494109883904457, "num_tokens": 87650079.0, "step": 930 }, { "entropy": 1.364639788120985, "epoch": 0.20855288701536415, "grad_norm": 0.5390625, "learning_rate": 3.95851818988465e-05, "loss": 0.9812, "mean_token_accuracy": 0.7471095651388169, "num_tokens": 88603707.0, "step": 940 }, { "entropy": 1.3764722615480423, "epoch": 0.21077153474957014, "grad_norm": 0.56640625, "learning_rate": 3.947426796805679e-05, "loss": 0.9736, "mean_token_accuracy": 0.7484091036021709, "num_tokens": 89540513.0, "step": 950 }, { "entropy": 1.3506674736738205, "epoch": 0.21299018248377613, "grad_norm": 0.578125, "learning_rate": 3.936335403726708e-05, "loss": 0.9689, "mean_token_accuracy": 0.7476179704070092, "num_tokens": 90483742.0, "step": 960 }, { "entropy": 1.3450557515025139, "epoch": 0.21520883021798215, "grad_norm": 0.578125, "learning_rate": 3.9252440106477374e-05, "loss": 0.968, "mean_token_accuracy": 0.7493214279413223, "num_tokens": 91434192.0, "step": 970 }, { "entropy": 1.329263025522232, "epoch": 0.21742747795218814, "grad_norm": 0.57421875, "learning_rate": 3.914152617568767e-05, "loss": 0.9536, "mean_token_accuracy": 0.7544709414243698, "num_tokens": 92377773.0, "step": 980 }, { "entropy": 1.352605053782463, "epoch": 0.21964612568639413, "grad_norm": 0.52734375, "learning_rate": 3.9030612244897965e-05, "loss": 0.9466, "mean_token_accuracy": 0.7529656864702702, "num_tokens": 93333525.0, "step": 990 }, { "entropy": 1.361532361805439, "epoch": 0.22186477342060015, "grad_norm": 0.54296875, "learning_rate": 3.891969831410826e-05, "loss": 0.9713, "mean_token_accuracy": 0.7466711558401584, "num_tokens": 94288415.0, "step": 1000 }, { "entropy": 1.400508201122284, "epoch": 0.22408342115480614, "grad_norm": 0.5703125, "learning_rate": 3.880878438331855e-05, "loss": 0.9905, "mean_token_accuracy": 0.7447403699159623, "num_tokens": 95210180.0, "step": 1010 }, { "entropy": 1.333881674706936, "epoch": 0.22630206888901214, "grad_norm": 0.55859375, "learning_rate": 3.869787045252884e-05, "loss": 0.9516, "mean_token_accuracy": 0.7562138311564922, "num_tokens": 96165001.0, "step": 1020 }, { "entropy": 1.3659777596592904, "epoch": 0.22852071662321816, "grad_norm": 0.5390625, "learning_rate": 3.8586956521739134e-05, "loss": 0.9796, "mean_token_accuracy": 0.7488616541028023, "num_tokens": 97118737.0, "step": 1030 }, { "entropy": 1.3581289164721966, "epoch": 0.23073936435742415, "grad_norm": 0.5078125, "learning_rate": 3.8476042590949426e-05, "loss": 0.9905, "mean_token_accuracy": 0.7445513367652893, "num_tokens": 98084593.0, "step": 1040 }, { "entropy": 1.3156771540641785, "epoch": 0.23295801209163014, "grad_norm": 0.50390625, "learning_rate": 3.836512866015972e-05, "loss": 0.9249, "mean_token_accuracy": 0.758704387396574, "num_tokens": 99029928.0, "step": 1050 }, { "entropy": 1.3755515664815903, "epoch": 0.23517665982583616, "grad_norm": 0.5390625, "learning_rate": 3.825421472937001e-05, "loss": 0.9974, "mean_token_accuracy": 0.746151739358902, "num_tokens": 100006819.0, "step": 1060 }, { "entropy": 1.3569506011903285, "epoch": 0.23739530756004215, "grad_norm": 0.5546875, "learning_rate": 3.814330079858031e-05, "loss": 0.9626, "mean_token_accuracy": 0.7495047964155674, "num_tokens": 100925967.0, "step": 1070 }, { "entropy": 1.3472113192081452, "epoch": 0.23961395529424814, "grad_norm": 0.54296875, "learning_rate": 3.80323868677906e-05, "loss": 0.9572, "mean_token_accuracy": 0.7518169023096561, "num_tokens": 101902867.0, "step": 1080 }, { "entropy": 1.3691953018307685, "epoch": 0.24183260302845416, "grad_norm": 0.5546875, "learning_rate": 3.7921472937000893e-05, "loss": 0.9385, "mean_token_accuracy": 0.7557882443070412, "num_tokens": 102819883.0, "step": 1090 }, { "entropy": 1.3221500940620898, "epoch": 0.24405125076266015, "grad_norm": 0.546875, "learning_rate": 3.7810559006211186e-05, "loss": 0.9363, "mean_token_accuracy": 0.7567619226872921, "num_tokens": 103770099.0, "step": 1100 }, { "entropy": 1.3552875474095345, "epoch": 0.24626989849686615, "grad_norm": 0.56640625, "learning_rate": 3.769964507542148e-05, "loss": 0.96, "mean_token_accuracy": 0.7519307337701321, "num_tokens": 104703977.0, "step": 1110 }, { "entropy": 1.3745846793055534, "epoch": 0.24848854623107217, "grad_norm": 0.57421875, "learning_rate": 3.758873114463177e-05, "loss": 0.9775, "mean_token_accuracy": 0.746993649750948, "num_tokens": 105614489.0, "step": 1120 }, { "entropy": 1.379011509567499, "epoch": 0.2507071939652782, "grad_norm": 0.494140625, "learning_rate": 3.747781721384206e-05, "loss": 0.9913, "mean_token_accuracy": 0.7447584941983223, "num_tokens": 106570238.0, "step": 1130 }, { "entropy": 1.3902081191539764, "epoch": 0.2529258416994842, "grad_norm": 0.58203125, "learning_rate": 3.7366903283052354e-05, "loss": 0.9864, "mean_token_accuracy": 0.746292807906866, "num_tokens": 107501226.0, "step": 1140 }, { "entropy": 1.3556282117962837, "epoch": 0.25514448943369017, "grad_norm": 0.55078125, "learning_rate": 3.7255989352262646e-05, "loss": 0.9811, "mean_token_accuracy": 0.7470501571893692, "num_tokens": 108445475.0, "step": 1150 }, { "entropy": 1.3668062418699265, "epoch": 0.25736313716789616, "grad_norm": 0.53515625, "learning_rate": 3.714507542147294e-05, "loss": 0.9785, "mean_token_accuracy": 0.7489332385361195, "num_tokens": 109362028.0, "step": 1160 }, { "entropy": 1.3806826993823051, "epoch": 0.25958178490210215, "grad_norm": 0.5078125, "learning_rate": 3.703416149068323e-05, "loss": 0.9682, "mean_token_accuracy": 0.7490875221788883, "num_tokens": 110308226.0, "step": 1170 }, { "entropy": 1.3806460306048394, "epoch": 0.26180043263630814, "grad_norm": 0.55859375, "learning_rate": 3.692324755989352e-05, "loss": 0.9937, "mean_token_accuracy": 0.7435216665267944, "num_tokens": 111243611.0, "step": 1180 }, { "entropy": 1.3768418952822685, "epoch": 0.2640190803705142, "grad_norm": 0.5546875, "learning_rate": 3.6812333629103815e-05, "loss": 1.0088, "mean_token_accuracy": 0.741937792301178, "num_tokens": 112158924.0, "step": 1190 }, { "entropy": 1.3587884977459908, "epoch": 0.2662377281047202, "grad_norm": 0.56640625, "learning_rate": 3.670141969831411e-05, "loss": 0.9634, "mean_token_accuracy": 0.7523072622716427, "num_tokens": 113114964.0, "step": 1200 }, { "entropy": 1.3679104253649712, "epoch": 0.2684563758389262, "grad_norm": 0.58984375, "learning_rate": 3.65905057675244e-05, "loss": 0.979, "mean_token_accuracy": 0.7477054476737977, "num_tokens": 114050174.0, "step": 1210 }, { "entropy": 1.355040068924427, "epoch": 0.27067502357313217, "grad_norm": 0.57421875, "learning_rate": 3.64795918367347e-05, "loss": 0.9668, "mean_token_accuracy": 0.75032162591815, "num_tokens": 114988970.0, "step": 1220 }, { "entropy": 1.3842439249157905, "epoch": 0.27289367130733816, "grad_norm": 0.546875, "learning_rate": 3.636867790594499e-05, "loss": 0.9967, "mean_token_accuracy": 0.7448992133140564, "num_tokens": 115921292.0, "step": 1230 }, { "entropy": 1.386633063107729, "epoch": 0.2751123190415442, "grad_norm": 0.59765625, "learning_rate": 3.625776397515528e-05, "loss": 0.9982, "mean_token_accuracy": 0.7450036846101284, "num_tokens": 116870507.0, "step": 1240 }, { "entropy": 1.3373503908514977, "epoch": 0.2773309667757502, "grad_norm": 0.546875, "learning_rate": 3.6146850044365574e-05, "loss": 0.9631, "mean_token_accuracy": 0.7503526777029037, "num_tokens": 117814194.0, "step": 1250 }, { "entropy": 1.3738537311553956, "epoch": 0.2795496145099562, "grad_norm": 0.53515625, "learning_rate": 3.6035936113575866e-05, "loss": 0.9636, "mean_token_accuracy": 0.7519263453781605, "num_tokens": 118745944.0, "step": 1260 }, { "entropy": 1.373944465816021, "epoch": 0.2817682622441622, "grad_norm": 0.55078125, "learning_rate": 3.592502218278616e-05, "loss": 0.9946, "mean_token_accuracy": 0.7430286034941673, "num_tokens": 119703256.0, "step": 1270 }, { "entropy": 1.3817725293338299, "epoch": 0.2839869099783682, "grad_norm": 0.5546875, "learning_rate": 3.581410825199645e-05, "loss": 1.0038, "mean_token_accuracy": 0.7412588849663735, "num_tokens": 120632316.0, "step": 1280 }, { "entropy": 1.383293604105711, "epoch": 0.28620555771257417, "grad_norm": 0.546875, "learning_rate": 3.570319432120674e-05, "loss": 1.0004, "mean_token_accuracy": 0.7431584998965264, "num_tokens": 121557708.0, "step": 1290 }, { "entropy": 1.3742095410823822, "epoch": 0.2884242054467802, "grad_norm": 0.56640625, "learning_rate": 3.5592280390417035e-05, "loss": 0.9699, "mean_token_accuracy": 0.7505590744316578, "num_tokens": 122515689.0, "step": 1300 }, { "entropy": 1.3871235311031342, "epoch": 0.2906428531809862, "grad_norm": 0.5703125, "learning_rate": 3.548136645962733e-05, "loss": 0.9824, "mean_token_accuracy": 0.7457533970475196, "num_tokens": 123456033.0, "step": 1310 }, { "entropy": 1.3561372354626655, "epoch": 0.2928615009151922, "grad_norm": 0.5625, "learning_rate": 3.537045252883762e-05, "loss": 0.9547, "mean_token_accuracy": 0.7511110901832581, "num_tokens": 124410678.0, "step": 1320 }, { "entropy": 1.3228459164500237, "epoch": 0.2950801486493982, "grad_norm": 0.55078125, "learning_rate": 3.525953859804791e-05, "loss": 0.9167, "mean_token_accuracy": 0.7597990974783897, "num_tokens": 125353637.0, "step": 1330 }, { "entropy": 1.3309078864753245, "epoch": 0.2972987963836042, "grad_norm": 0.70703125, "learning_rate": 3.514862466725821e-05, "loss": 0.9623, "mean_token_accuracy": 0.7502509340643883, "num_tokens": 126291010.0, "step": 1340 }, { "entropy": 1.375917912274599, "epoch": 0.29951744411781017, "grad_norm": 2.46875, "learning_rate": 3.50377107364685e-05, "loss": 0.9729, "mean_token_accuracy": 0.7492444895207881, "num_tokens": 127237461.0, "step": 1350 }, { "entropy": 1.3652615778148174, "epoch": 0.3017360918520162, "grad_norm": 0.578125, "learning_rate": 3.4926796805678794e-05, "loss": 0.9673, "mean_token_accuracy": 0.7486005112528801, "num_tokens": 128184481.0, "step": 1360 }, { "entropy": 1.361464273929596, "epoch": 0.3039547395862222, "grad_norm": 0.55078125, "learning_rate": 3.481588287488909e-05, "loss": 0.9848, "mean_token_accuracy": 0.7459657743573189, "num_tokens": 129136106.0, "step": 1370 }, { "entropy": 1.3367391996085645, "epoch": 0.3061733873204282, "grad_norm": 0.53125, "learning_rate": 3.470496894409938e-05, "loss": 0.9721, "mean_token_accuracy": 0.7480074115097523, "num_tokens": 130083779.0, "step": 1380 }, { "entropy": 1.345343752205372, "epoch": 0.3083920350546342, "grad_norm": 0.57421875, "learning_rate": 3.459405501330967e-05, "loss": 0.9301, "mean_token_accuracy": 0.7568992510437965, "num_tokens": 131031114.0, "step": 1390 }, { "entropy": 1.37344888150692, "epoch": 0.3106106827888402, "grad_norm": 0.55859375, "learning_rate": 3.448314108251996e-05, "loss": 0.9955, "mean_token_accuracy": 0.745458111166954, "num_tokens": 131970717.0, "step": 1400 }, { "entropy": 1.3943381957709788, "epoch": 0.3128293305230462, "grad_norm": 0.5546875, "learning_rate": 3.4372227151730255e-05, "loss": 0.9955, "mean_token_accuracy": 0.743470398336649, "num_tokens": 132916501.0, "step": 1410 }, { "entropy": 1.3412963405251503, "epoch": 0.3150479782572522, "grad_norm": 0.54296875, "learning_rate": 3.426131322094055e-05, "loss": 0.9656, "mean_token_accuracy": 0.751042614877224, "num_tokens": 133855964.0, "step": 1420 }, { "entropy": 1.3560855656862258, "epoch": 0.3172666259914582, "grad_norm": 0.5625, "learning_rate": 3.415039929015084e-05, "loss": 0.9734, "mean_token_accuracy": 0.7487790770828724, "num_tokens": 134794608.0, "step": 1430 }, { "entropy": 1.3474852062761784, "epoch": 0.3194852737256642, "grad_norm": 0.546875, "learning_rate": 3.403948535936114e-05, "loss": 0.9772, "mean_token_accuracy": 0.7492424316704274, "num_tokens": 135743072.0, "step": 1440 }, { "entropy": 1.3934367418289184, "epoch": 0.3217039214598702, "grad_norm": 0.55078125, "learning_rate": 3.392857142857143e-05, "loss": 1.0063, "mean_token_accuracy": 0.7409680478274823, "num_tokens": 136659708.0, "step": 1450 }, { "entropy": 1.3512530893087387, "epoch": 0.3239225691940762, "grad_norm": 0.55859375, "learning_rate": 3.381765749778172e-05, "loss": 0.9717, "mean_token_accuracy": 0.7517142631113529, "num_tokens": 137609079.0, "step": 1460 }, { "entropy": 1.3412357300519944, "epoch": 0.3261412169282822, "grad_norm": 0.546875, "learning_rate": 3.3706743566992015e-05, "loss": 0.9477, "mean_token_accuracy": 0.7528042688965797, "num_tokens": 138553919.0, "step": 1470 }, { "entropy": 1.3442728258669376, "epoch": 0.32835986466248823, "grad_norm": 0.54296875, "learning_rate": 3.359582963620231e-05, "loss": 0.9464, "mean_token_accuracy": 0.7520667724311352, "num_tokens": 139484549.0, "step": 1480 }, { "entropy": 1.3433556392788888, "epoch": 0.3305785123966942, "grad_norm": 0.546875, "learning_rate": 3.34849157054126e-05, "loss": 0.9377, "mean_token_accuracy": 0.7539769187569618, "num_tokens": 140426792.0, "step": 1490 }, { "entropy": 1.325501861423254, "epoch": 0.3327971601309002, "grad_norm": 0.5, "learning_rate": 3.337400177462289e-05, "loss": 0.9226, "mean_token_accuracy": 0.7607504710555076, "num_tokens": 141371155.0, "step": 1500 }, { "entropy": 1.3407476291060447, "epoch": 0.3350158078651062, "grad_norm": 0.55078125, "learning_rate": 3.326308784383318e-05, "loss": 0.9537, "mean_token_accuracy": 0.7520662292838096, "num_tokens": 142331590.0, "step": 1510 }, { "entropy": 1.329257782548666, "epoch": 0.3372344555993122, "grad_norm": 0.5390625, "learning_rate": 3.3152173913043475e-05, "loss": 0.9312, "mean_token_accuracy": 0.7564695417881012, "num_tokens": 143254361.0, "step": 1520 }, { "entropy": 1.388334572315216, "epoch": 0.33945310333351825, "grad_norm": 0.58203125, "learning_rate": 3.3041259982253774e-05, "loss": 0.9958, "mean_token_accuracy": 0.7436298795044423, "num_tokens": 144217386.0, "step": 1530 }, { "entropy": 1.3446097187697887, "epoch": 0.34167175106772424, "grad_norm": 0.5625, "learning_rate": 3.2930346051464066e-05, "loss": 0.9654, "mean_token_accuracy": 0.7493618465960026, "num_tokens": 145142821.0, "step": 1540 }, { "entropy": 1.371129809319973, "epoch": 0.34389039880193023, "grad_norm": 0.6015625, "learning_rate": 3.281943212067436e-05, "loss": 0.9937, "mean_token_accuracy": 0.7430687204003334, "num_tokens": 146063376.0, "step": 1550 }, { "entropy": 1.3537682175636292, "epoch": 0.3461090465361362, "grad_norm": 0.58203125, "learning_rate": 3.270851818988465e-05, "loss": 0.99, "mean_token_accuracy": 0.7446731366217136, "num_tokens": 146991473.0, "step": 1560 }, { "entropy": 1.3684612050652505, "epoch": 0.3483276942703422, "grad_norm": 0.578125, "learning_rate": 3.259760425909494e-05, "loss": 0.9916, "mean_token_accuracy": 0.7439785785973072, "num_tokens": 147938218.0, "step": 1570 }, { "entropy": 1.3405075147747993, "epoch": 0.3505463420045482, "grad_norm": 0.53125, "learning_rate": 3.2486690328305235e-05, "loss": 0.9367, "mean_token_accuracy": 0.7569099083542824, "num_tokens": 148892689.0, "step": 1580 }, { "entropy": 1.3668345354497433, "epoch": 0.35276498973875425, "grad_norm": 0.5234375, "learning_rate": 3.237577639751553e-05, "loss": 1.0039, "mean_token_accuracy": 0.7430003948509694, "num_tokens": 149855777.0, "step": 1590 }, { "entropy": 1.3536728963255882, "epoch": 0.35498363747296025, "grad_norm": 0.5390625, "learning_rate": 3.226486246672582e-05, "loss": 0.941, "mean_token_accuracy": 0.7554409049451352, "num_tokens": 150788457.0, "step": 1600 }, { "entropy": 1.3560076355934143, "epoch": 0.35720228520716624, "grad_norm": 0.5234375, "learning_rate": 3.215394853593611e-05, "loss": 0.9564, "mean_token_accuracy": 0.7533373937010766, "num_tokens": 151725184.0, "step": 1610 }, { "entropy": 1.3634236186742783, "epoch": 0.35942093294137223, "grad_norm": 0.54296875, "learning_rate": 3.204303460514641e-05, "loss": 0.9729, "mean_token_accuracy": 0.7496181048452855, "num_tokens": 152659898.0, "step": 1620 }, { "entropy": 1.3436542712152004, "epoch": 0.3616395806755782, "grad_norm": 0.54296875, "learning_rate": 3.19321206743567e-05, "loss": 0.942, "mean_token_accuracy": 0.7547677598893643, "num_tokens": 153575877.0, "step": 1630 }, { "entropy": 1.3383269011974335, "epoch": 0.3638582284097842, "grad_norm": 0.54296875, "learning_rate": 3.1821206743566994e-05, "loss": 0.9586, "mean_token_accuracy": 0.752650099247694, "num_tokens": 154524747.0, "step": 1640 }, { "entropy": 1.3560621812939644, "epoch": 0.36607687614399026, "grad_norm": 0.5703125, "learning_rate": 3.171029281277729e-05, "loss": 0.9661, "mean_token_accuracy": 0.7512250438332557, "num_tokens": 155446708.0, "step": 1650 }, { "entropy": 1.33823501765728, "epoch": 0.36829552387819625, "grad_norm": 0.54296875, "learning_rate": 3.159937888198758e-05, "loss": 0.9506, "mean_token_accuracy": 0.7525983549654484, "num_tokens": 156421334.0, "step": 1660 }, { "entropy": 1.3900124236941338, "epoch": 0.37051417161240224, "grad_norm": 0.55859375, "learning_rate": 3.148846495119787e-05, "loss": 1.0267, "mean_token_accuracy": 0.7392269425094128, "num_tokens": 157348131.0, "step": 1670 }, { "entropy": 1.382587905973196, "epoch": 0.37273281934660824, "grad_norm": 0.5390625, "learning_rate": 3.137755102040816e-05, "loss": 1.0009, "mean_token_accuracy": 0.7422369658946991, "num_tokens": 158290254.0, "step": 1680 }, { "entropy": 1.3116468265652657, "epoch": 0.3749514670808142, "grad_norm": 0.50390625, "learning_rate": 3.1266637089618455e-05, "loss": 0.9484, "mean_token_accuracy": 0.7536117002367974, "num_tokens": 159223319.0, "step": 1690 }, { "entropy": 1.369352640211582, "epoch": 0.3771701148150202, "grad_norm": 0.58203125, "learning_rate": 3.115572315882875e-05, "loss": 0.9948, "mean_token_accuracy": 0.7430945433676243, "num_tokens": 160153728.0, "step": 1700 }, { "entropy": 1.3820845365524292, "epoch": 0.37938876254922627, "grad_norm": 0.53515625, "learning_rate": 3.1044809228039046e-05, "loss": 0.9902, "mean_token_accuracy": 0.7446745671331882, "num_tokens": 161082297.0, "step": 1710 }, { "entropy": 1.3555257454514504, "epoch": 0.38160741028343226, "grad_norm": 0.52734375, "learning_rate": 3.093389529724934e-05, "loss": 0.9932, "mean_token_accuracy": 0.7462766982614994, "num_tokens": 162025680.0, "step": 1720 }, { "entropy": 1.3567566007375718, "epoch": 0.38382605801763825, "grad_norm": 0.54296875, "learning_rate": 3.082298136645963e-05, "loss": 0.9669, "mean_token_accuracy": 0.7502202562987804, "num_tokens": 162959342.0, "step": 1730 }, { "entropy": 1.3683917000889778, "epoch": 0.38604470575184424, "grad_norm": 0.58203125, "learning_rate": 3.071206743566992e-05, "loss": 0.9881, "mean_token_accuracy": 0.7448588319122791, "num_tokens": 163880040.0, "step": 1740 }, { "entropy": 1.3426910683512687, "epoch": 0.38826335348605023, "grad_norm": 0.546875, "learning_rate": 3.0601153504880215e-05, "loss": 0.9519, "mean_token_accuracy": 0.7537251867353916, "num_tokens": 164818895.0, "step": 1750 }, { "entropy": 1.3621003210544587, "epoch": 0.3904820012202563, "grad_norm": 0.53515625, "learning_rate": 3.0490239574090507e-05, "loss": 0.9675, "mean_token_accuracy": 0.7497253358364105, "num_tokens": 165782211.0, "step": 1760 }, { "entropy": 1.3328422799706459, "epoch": 0.3927006489544623, "grad_norm": 0.53515625, "learning_rate": 3.03793256433008e-05, "loss": 0.9581, "mean_token_accuracy": 0.7515999570488929, "num_tokens": 166723681.0, "step": 1770 }, { "entropy": 1.310817752033472, "epoch": 0.39491929668866826, "grad_norm": 0.53125, "learning_rate": 3.026841171251109e-05, "loss": 0.9207, "mean_token_accuracy": 0.7629957444965839, "num_tokens": 167681826.0, "step": 1780 }, { "entropy": 1.3678661212325096, "epoch": 0.39713794442287426, "grad_norm": 0.5859375, "learning_rate": 3.0157497781721383e-05, "loss": 0.9722, "mean_token_accuracy": 0.7485598646104336, "num_tokens": 168615498.0, "step": 1790 }, { "entropy": 1.3442377656698228, "epoch": 0.39935659215708025, "grad_norm": 0.59765625, "learning_rate": 3.0046583850931682e-05, "loss": 0.9293, "mean_token_accuracy": 0.7590565107762813, "num_tokens": 169554298.0, "step": 1800 }, { "entropy": 1.368715339899063, "epoch": 0.40157523989128624, "grad_norm": 0.578125, "learning_rate": 2.9935669920141974e-05, "loss": 0.9773, "mean_token_accuracy": 0.7482131317257881, "num_tokens": 170486143.0, "step": 1810 }, { "entropy": 1.3645600192248821, "epoch": 0.4037938876254923, "grad_norm": 0.51171875, "learning_rate": 2.9824755989352266e-05, "loss": 0.9689, "mean_token_accuracy": 0.7496557794511318, "num_tokens": 171436267.0, "step": 1820 }, { "entropy": 1.360542993992567, "epoch": 0.4060125353596983, "grad_norm": 0.5390625, "learning_rate": 2.971384205856256e-05, "loss": 0.9738, "mean_token_accuracy": 0.7470414891839028, "num_tokens": 172361708.0, "step": 1830 }, { "entropy": 1.3571796461939811, "epoch": 0.40823118309390427, "grad_norm": 0.55078125, "learning_rate": 2.960292812777285e-05, "loss": 0.977, "mean_token_accuracy": 0.7466642953455448, "num_tokens": 173304422.0, "step": 1840 }, { "entropy": 1.3569322228431702, "epoch": 0.41044983082811026, "grad_norm": 0.53515625, "learning_rate": 2.9492014196983143e-05, "loss": 0.9536, "mean_token_accuracy": 0.7540878303349018, "num_tokens": 174236098.0, "step": 1850 }, { "entropy": 1.3723473891615867, "epoch": 0.41266847856231625, "grad_norm": 0.52734375, "learning_rate": 2.9381100266193435e-05, "loss": 0.9987, "mean_token_accuracy": 0.7455512471497059, "num_tokens": 175171519.0, "step": 1860 }, { "entropy": 1.3791632324457168, "epoch": 0.41488712629652225, "grad_norm": 0.55078125, "learning_rate": 2.9270186335403727e-05, "loss": 0.9508, "mean_token_accuracy": 0.7529595606029034, "num_tokens": 176092982.0, "step": 1870 }, { "entropy": 1.3743179097771645, "epoch": 0.4171057740307283, "grad_norm": 0.52734375, "learning_rate": 2.915927240461402e-05, "loss": 0.9734, "mean_token_accuracy": 0.7494499087333679, "num_tokens": 177060429.0, "step": 1880 }, { "entropy": 1.3471356205642224, "epoch": 0.4193244217649343, "grad_norm": 0.58203125, "learning_rate": 2.9048358473824318e-05, "loss": 0.9605, "mean_token_accuracy": 0.7509974204003811, "num_tokens": 178025303.0, "step": 1890 }, { "entropy": 1.3652866527438163, "epoch": 0.4215430694991403, "grad_norm": 0.55859375, "learning_rate": 2.893744454303461e-05, "loss": 0.9779, "mean_token_accuracy": 0.7496740512549878, "num_tokens": 178956578.0, "step": 1900 }, { "entropy": 1.355041117966175, "epoch": 0.42376171723334627, "grad_norm": 0.515625, "learning_rate": 2.8826530612244902e-05, "loss": 0.959, "mean_token_accuracy": 0.7527659654617309, "num_tokens": 179899402.0, "step": 1910 }, { "entropy": 1.3641887351870536, "epoch": 0.42598036496755226, "grad_norm": 0.5703125, "learning_rate": 2.8715616681455194e-05, "loss": 0.9457, "mean_token_accuracy": 0.7552632115781307, "num_tokens": 180827499.0, "step": 1920 }, { "entropy": 1.3468473985791207, "epoch": 0.42819901270175825, "grad_norm": 0.55859375, "learning_rate": 2.8604702750665487e-05, "loss": 0.9572, "mean_token_accuracy": 0.7524127073585987, "num_tokens": 181771979.0, "step": 1930 }, { "entropy": 1.3425350815057755, "epoch": 0.4304176604359643, "grad_norm": 0.50390625, "learning_rate": 2.849378881987578e-05, "loss": 0.9408, "mean_token_accuracy": 0.7537083625793457, "num_tokens": 182712453.0, "step": 1940 }, { "entropy": 1.3628494575619698, "epoch": 0.4326363081701703, "grad_norm": 0.5546875, "learning_rate": 2.838287488908607e-05, "loss": 0.9566, "mean_token_accuracy": 0.7520852789282799, "num_tokens": 183659069.0, "step": 1950 }, { "entropy": 1.3504344090819358, "epoch": 0.4348549559043763, "grad_norm": 0.58984375, "learning_rate": 2.8271960958296363e-05, "loss": 0.9631, "mean_token_accuracy": 0.7504830814898014, "num_tokens": 184596569.0, "step": 1960 }, { "entropy": 1.364800187200308, "epoch": 0.4370736036385823, "grad_norm": 0.55859375, "learning_rate": 2.8161047027506655e-05, "loss": 0.9659, "mean_token_accuracy": 0.75085094794631, "num_tokens": 185522825.0, "step": 1970 }, { "entropy": 1.3836459085345267, "epoch": 0.43929225137278827, "grad_norm": 0.5625, "learning_rate": 2.8050133096716947e-05, "loss": 0.9855, "mean_token_accuracy": 0.7443784818053245, "num_tokens": 186445738.0, "step": 1980 }, { "entropy": 1.3496420353651046, "epoch": 0.4415108991069943, "grad_norm": 0.5546875, "learning_rate": 2.7939219165927243e-05, "loss": 0.9816, "mean_token_accuracy": 0.7476452320814133, "num_tokens": 187399391.0, "step": 1990 }, { "entropy": 1.3308730378746987, "epoch": 0.4437295468412003, "grad_norm": 0.5078125, "learning_rate": 2.7828305235137535e-05, "loss": 0.9431, "mean_token_accuracy": 0.7563184469938278, "num_tokens": 188372699.0, "step": 2000 }, { "entropy": 1.3839409291744231, "epoch": 0.4459481945754063, "grad_norm": 0.578125, "learning_rate": 2.7717391304347827e-05, "loss": 0.9981, "mean_token_accuracy": 0.7429635897278786, "num_tokens": 189301311.0, "step": 2010 }, { "entropy": 1.3560212314128877, "epoch": 0.4481668423096123, "grad_norm": 0.5546875, "learning_rate": 2.760647737355812e-05, "loss": 0.9725, "mean_token_accuracy": 0.7480806417763233, "num_tokens": 190232558.0, "step": 2020 }, { "entropy": 1.3780321873724461, "epoch": 0.4503854900438183, "grad_norm": 1.1875, "learning_rate": 2.749556344276841e-05, "loss": 0.997, "mean_token_accuracy": 0.7428381346166134, "num_tokens": 191181745.0, "step": 2030 }, { "entropy": 1.345700977742672, "epoch": 0.4526041377780243, "grad_norm": 0.5390625, "learning_rate": 2.7384649511978703e-05, "loss": 0.938, "mean_token_accuracy": 0.7569623030722141, "num_tokens": 192157581.0, "step": 2040 }, { "entropy": 1.3496388509869575, "epoch": 0.4548227855122303, "grad_norm": 0.5390625, "learning_rate": 2.7273735581188996e-05, "loss": 0.9513, "mean_token_accuracy": 0.7525494247674942, "num_tokens": 193095233.0, "step": 2050 }, { "entropy": 1.350592066347599, "epoch": 0.4570414332464363, "grad_norm": 0.59375, "learning_rate": 2.7162821650399288e-05, "loss": 0.9517, "mean_token_accuracy": 0.7537726648151875, "num_tokens": 194025263.0, "step": 2060 }, { "entropy": 1.3845593720674514, "epoch": 0.4592600809806423, "grad_norm": 0.57421875, "learning_rate": 2.7051907719609583e-05, "loss": 0.9504, "mean_token_accuracy": 0.7514217287302017, "num_tokens": 194926897.0, "step": 2070 }, { "entropy": 1.3488378807902337, "epoch": 0.4614787287148483, "grad_norm": 0.5390625, "learning_rate": 2.694099378881988e-05, "loss": 0.961, "mean_token_accuracy": 0.7501702718436718, "num_tokens": 195849599.0, "step": 2080 }, { "entropy": 1.349847511947155, "epoch": 0.4636973764490543, "grad_norm": 0.55859375, "learning_rate": 2.683007985803017e-05, "loss": 0.9442, "mean_token_accuracy": 0.7564226061105728, "num_tokens": 196794354.0, "step": 2090 }, { "entropy": 1.3340238958597184, "epoch": 0.4659160241832603, "grad_norm": 0.55859375, "learning_rate": 2.6719165927240463e-05, "loss": 0.941, "mean_token_accuracy": 0.7531145378947258, "num_tokens": 197720928.0, "step": 2100 }, { "entropy": 1.346337614953518, "epoch": 0.4681346719174663, "grad_norm": 0.5546875, "learning_rate": 2.6608251996450755e-05, "loss": 0.9573, "mean_token_accuracy": 0.7538634926080704, "num_tokens": 198643271.0, "step": 2110 }, { "entropy": 1.3088567845523358, "epoch": 0.4703533196516723, "grad_norm": 0.56640625, "learning_rate": 2.6497338065661047e-05, "loss": 0.8915, "mean_token_accuracy": 0.7640130512416363, "num_tokens": 199578606.0, "step": 2120 }, { "entropy": 1.3767965711653232, "epoch": 0.4725719673858783, "grad_norm": 0.609375, "learning_rate": 2.638642413487134e-05, "loss": 0.9838, "mean_token_accuracy": 0.7447601705789566, "num_tokens": 200543514.0, "step": 2130 }, { "entropy": 1.3281448036432266, "epoch": 0.4747906151200843, "grad_norm": 0.55078125, "learning_rate": 2.627551020408163e-05, "loss": 0.9187, "mean_token_accuracy": 0.7601314648985863, "num_tokens": 201496122.0, "step": 2140 }, { "entropy": 1.3478802539408208, "epoch": 0.4770092628542903, "grad_norm": 0.54296875, "learning_rate": 2.6164596273291924e-05, "loss": 0.9621, "mean_token_accuracy": 0.749699717015028, "num_tokens": 202430446.0, "step": 2150 }, { "entropy": 1.388000564277172, "epoch": 0.4792279105884963, "grad_norm": 0.55078125, "learning_rate": 2.6053682342502216e-05, "loss": 1.01, "mean_token_accuracy": 0.7405543349683285, "num_tokens": 203346018.0, "step": 2160 }, { "entropy": 1.3482555583119393, "epoch": 0.48144655832270233, "grad_norm": 0.546875, "learning_rate": 2.5942768411712515e-05, "loss": 0.9864, "mean_token_accuracy": 0.7477688670158387, "num_tokens": 204279144.0, "step": 2170 }, { "entropy": 1.3538051225244998, "epoch": 0.4836652060569083, "grad_norm": 0.5625, "learning_rate": 2.5831854480922807e-05, "loss": 0.9934, "mean_token_accuracy": 0.743538661301136, "num_tokens": 205214999.0, "step": 2180 }, { "entropy": 1.3154275290668012, "epoch": 0.4858838537911143, "grad_norm": 0.52734375, "learning_rate": 2.57209405501331e-05, "loss": 0.9213, "mean_token_accuracy": 0.7582350388169289, "num_tokens": 206144520.0, "step": 2190 }, { "entropy": 1.3671178199350833, "epoch": 0.4881025015253203, "grad_norm": 0.5625, "learning_rate": 2.561002661934339e-05, "loss": 0.9544, "mean_token_accuracy": 0.7533901192247867, "num_tokens": 207080904.0, "step": 2200 }, { "entropy": 1.3218648932874202, "epoch": 0.4903211492595263, "grad_norm": 0.5625, "learning_rate": 2.5499112688553683e-05, "loss": 0.9238, "mean_token_accuracy": 0.760743847489357, "num_tokens": 208047310.0, "step": 2210 }, { "entropy": 1.3616492010653019, "epoch": 0.4925397969937323, "grad_norm": 0.53515625, "learning_rate": 2.5388198757763975e-05, "loss": 0.982, "mean_token_accuracy": 0.7471165806055069, "num_tokens": 209015470.0, "step": 2220 }, { "entropy": 1.3293255344033241, "epoch": 0.49475844472793834, "grad_norm": 0.546875, "learning_rate": 2.5277284826974267e-05, "loss": 0.967, "mean_token_accuracy": 0.7527132786810398, "num_tokens": 209969523.0, "step": 2230 }, { "entropy": 1.3665335968136787, "epoch": 0.49697709246214433, "grad_norm": 0.54296875, "learning_rate": 2.516637089618456e-05, "loss": 0.9793, "mean_token_accuracy": 0.7467245981097221, "num_tokens": 210894802.0, "step": 2240 }, { "entropy": 1.3085681259632111, "epoch": 0.4991957401963503, "grad_norm": 0.546875, "learning_rate": 2.5055456965394852e-05, "loss": 0.9423, "mean_token_accuracy": 0.7545640543103218, "num_tokens": 211846270.0, "step": 2250 }, { "entropy": 1.3383339211344718, "epoch": 0.5014143879305564, "grad_norm": 0.494140625, "learning_rate": 2.4944543034605147e-05, "loss": 0.9454, "mean_token_accuracy": 0.753314109146595, "num_tokens": 212817521.0, "step": 2260 }, { "entropy": 1.329726865887642, "epoch": 0.5036330356647624, "grad_norm": 0.51171875, "learning_rate": 2.483362910381544e-05, "loss": 0.9517, "mean_token_accuracy": 0.7521423630416393, "num_tokens": 213779244.0, "step": 2270 }, { "entropy": 1.3511702984571456, "epoch": 0.5058516833989684, "grad_norm": 0.5546875, "learning_rate": 2.4722715173025735e-05, "loss": 0.9431, "mean_token_accuracy": 0.7529738865792751, "num_tokens": 214731996.0, "step": 2280 }, { "entropy": 1.366059672832489, "epoch": 0.5080703311331743, "grad_norm": 0.55859375, "learning_rate": 2.4611801242236027e-05, "loss": 0.9965, "mean_token_accuracy": 0.7439504019916058, "num_tokens": 215694840.0, "step": 2290 }, { "entropy": 1.3440134845674039, "epoch": 0.5102889788673803, "grad_norm": 0.5390625, "learning_rate": 2.450088731144632e-05, "loss": 0.9691, "mean_token_accuracy": 0.7480943873524666, "num_tokens": 216639877.0, "step": 2300 }, { "entropy": 1.3710797160863877, "epoch": 0.5125076266015863, "grad_norm": 0.54296875, "learning_rate": 2.438997338065661e-05, "loss": 0.9453, "mean_token_accuracy": 0.7527918457984925, "num_tokens": 217569723.0, "step": 2310 }, { "entropy": 1.3561846666038035, "epoch": 0.5147262743357923, "grad_norm": 0.54296875, "learning_rate": 2.4279059449866903e-05, "loss": 0.9768, "mean_token_accuracy": 0.7460780493915081, "num_tokens": 218524752.0, "step": 2320 }, { "entropy": 1.354518896341324, "epoch": 0.5169449220699983, "grad_norm": 0.52734375, "learning_rate": 2.41681455190772e-05, "loss": 0.9424, "mean_token_accuracy": 0.7531989276409149, "num_tokens": 219445599.0, "step": 2330 }, { "entropy": 1.3691720873117448, "epoch": 0.5191635698042043, "grad_norm": 0.62890625, "learning_rate": 2.405723158828749e-05, "loss": 0.9875, "mean_token_accuracy": 0.745745038241148, "num_tokens": 220388844.0, "step": 2340 }, { "entropy": 1.3644569292664528, "epoch": 0.5213822175384103, "grad_norm": 0.54296875, "learning_rate": 2.3946317657497783e-05, "loss": 0.9665, "mean_token_accuracy": 0.7500609241425991, "num_tokens": 221325639.0, "step": 2350 }, { "entropy": 1.3851750075817109, "epoch": 0.5236008652726163, "grad_norm": 0.5625, "learning_rate": 2.3835403726708075e-05, "loss": 0.9989, "mean_token_accuracy": 0.7438922718167305, "num_tokens": 222256317.0, "step": 2360 }, { "entropy": 1.347152130305767, "epoch": 0.5258195130068224, "grad_norm": 0.57421875, "learning_rate": 2.372448979591837e-05, "loss": 0.9613, "mean_token_accuracy": 0.7514459244906903, "num_tokens": 223173083.0, "step": 2370 }, { "entropy": 1.3526596918702125, "epoch": 0.5280381607410284, "grad_norm": 0.5390625, "learning_rate": 2.3613575865128663e-05, "loss": 0.9948, "mean_token_accuracy": 0.7444270350039005, "num_tokens": 224114753.0, "step": 2380 }, { "entropy": 1.3236285299062729, "epoch": 0.5302568084752344, "grad_norm": 0.5546875, "learning_rate": 2.3502661934338955e-05, "loss": 0.9508, "mean_token_accuracy": 0.7532543577253819, "num_tokens": 225081036.0, "step": 2390 }, { "entropy": 1.3525523334741592, "epoch": 0.5324754562094404, "grad_norm": 0.5234375, "learning_rate": 2.3391748003549247e-05, "loss": 0.9595, "mean_token_accuracy": 0.7512728653848171, "num_tokens": 226017057.0, "step": 2400 }, { "entropy": 1.350379504263401, "epoch": 0.5346941039436464, "grad_norm": 0.54296875, "learning_rate": 2.328083407275954e-05, "loss": 0.962, "mean_token_accuracy": 0.7505261316895485, "num_tokens": 226946188.0, "step": 2410 }, { "entropy": 1.3398205131292342, "epoch": 0.5369127516778524, "grad_norm": 0.5546875, "learning_rate": 2.3169920141969835e-05, "loss": 0.9597, "mean_token_accuracy": 0.7539136126637459, "num_tokens": 227910063.0, "step": 2420 }, { "entropy": 1.331970850378275, "epoch": 0.5391313994120583, "grad_norm": 0.54296875, "learning_rate": 2.3059006211180127e-05, "loss": 0.937, "mean_token_accuracy": 0.7590182758867741, "num_tokens": 228863577.0, "step": 2430 }, { "entropy": 1.346589733660221, "epoch": 0.5413500471462643, "grad_norm": 0.59765625, "learning_rate": 2.294809228039042e-05, "loss": 0.9517, "mean_token_accuracy": 0.7540139898657798, "num_tokens": 229797253.0, "step": 2440 }, { "entropy": 1.3450704276561738, "epoch": 0.5435686948804703, "grad_norm": 0.5546875, "learning_rate": 2.283717834960071e-05, "loss": 0.9261, "mean_token_accuracy": 0.7560984350740909, "num_tokens": 230738751.0, "step": 2450 }, { "entropy": 1.3362338081002236, "epoch": 0.5457873426146763, "grad_norm": 0.53515625, "learning_rate": 2.2726264418811003e-05, "loss": 0.9396, "mean_token_accuracy": 0.755575978755951, "num_tokens": 231668805.0, "step": 2460 }, { "entropy": 1.339858317375183, "epoch": 0.5480059903488823, "grad_norm": 0.5625, "learning_rate": 2.26153504880213e-05, "loss": 0.942, "mean_token_accuracy": 0.7545136004686356, "num_tokens": 232602810.0, "step": 2470 }, { "entropy": 1.349748957157135, "epoch": 0.5502246380830884, "grad_norm": 0.52734375, "learning_rate": 2.250443655723159e-05, "loss": 0.9763, "mean_token_accuracy": 0.7481756076216698, "num_tokens": 233553318.0, "step": 2480 }, { "entropy": 1.3118550218641758, "epoch": 0.5524432858172944, "grad_norm": 0.51953125, "learning_rate": 2.2393522626441883e-05, "loss": 0.9201, "mean_token_accuracy": 0.7602349728345871, "num_tokens": 234503089.0, "step": 2490 }, { "entropy": 1.388796190917492, "epoch": 0.5546619335515004, "grad_norm": 0.55078125, "learning_rate": 2.2282608695652175e-05, "loss": 0.9855, "mean_token_accuracy": 0.7455244645476341, "num_tokens": 235447418.0, "step": 2500 }, { "entropy": 1.3685590282082558, "epoch": 0.5568805812857064, "grad_norm": 0.5390625, "learning_rate": 2.2171694764862467e-05, "loss": 0.9774, "mean_token_accuracy": 0.7483286060392856, "num_tokens": 236399184.0, "step": 2510 }, { "entropy": 1.3622719518840314, "epoch": 0.5590992290199124, "grad_norm": 0.5546875, "learning_rate": 2.206078083407276e-05, "loss": 0.9722, "mean_token_accuracy": 0.7481064416468144, "num_tokens": 237325726.0, "step": 2520 }, { "entropy": 1.3797079771757126, "epoch": 0.5613178767541184, "grad_norm": 0.57421875, "learning_rate": 2.1949866903283052e-05, "loss": 0.9826, "mean_token_accuracy": 0.7481960266828537, "num_tokens": 238283753.0, "step": 2530 }, { "entropy": 1.3590396404266358, "epoch": 0.5635365244883244, "grad_norm": 0.53515625, "learning_rate": 2.1838952972493347e-05, "loss": 0.9631, "mean_token_accuracy": 0.749776404350996, "num_tokens": 239205878.0, "step": 2540 }, { "entropy": 1.3788958624005319, "epoch": 0.5657551722225304, "grad_norm": 0.56640625, "learning_rate": 2.172803904170364e-05, "loss": 0.9639, "mean_token_accuracy": 0.7497024066746235, "num_tokens": 240097144.0, "step": 2550 }, { "entropy": 1.3258331522345543, "epoch": 0.5679738199567363, "grad_norm": 0.55078125, "learning_rate": 2.161712511091393e-05, "loss": 0.9469, "mean_token_accuracy": 0.7540858566761017, "num_tokens": 241055028.0, "step": 2560 }, { "entropy": 1.3632364630699159, "epoch": 0.5701924676909423, "grad_norm": 0.5234375, "learning_rate": 2.1506211180124224e-05, "loss": 0.9669, "mean_token_accuracy": 0.7478960521519185, "num_tokens": 241982324.0, "step": 2570 }, { "entropy": 1.382692551612854, "epoch": 0.5724111154251483, "grad_norm": 0.546875, "learning_rate": 2.1395297249334516e-05, "loss": 0.982, "mean_token_accuracy": 0.747248487174511, "num_tokens": 242906902.0, "step": 2580 }, { "entropy": 1.3415826320648194, "epoch": 0.5746297631593543, "grad_norm": 0.58984375, "learning_rate": 2.1284383318544808e-05, "loss": 0.9541, "mean_token_accuracy": 0.7534500122070312, "num_tokens": 243863487.0, "step": 2590 }, { "entropy": 1.361097539961338, "epoch": 0.5768484108935604, "grad_norm": 0.5234375, "learning_rate": 2.1173469387755103e-05, "loss": 0.9617, "mean_token_accuracy": 0.7487135134637356, "num_tokens": 244790336.0, "step": 2600 }, { "entropy": 1.337267841398716, "epoch": 0.5790670586277664, "grad_norm": 0.56640625, "learning_rate": 2.1062555456965396e-05, "loss": 0.933, "mean_token_accuracy": 0.7563786394894123, "num_tokens": 245733272.0, "step": 2610 }, { "entropy": 1.3518446780741216, "epoch": 0.5812857063619724, "grad_norm": 0.51171875, "learning_rate": 2.0951641526175688e-05, "loss": 0.9707, "mean_token_accuracy": 0.7486745782196522, "num_tokens": 246664891.0, "step": 2620 }, { "entropy": 1.3540575861930848, "epoch": 0.5835043540961784, "grad_norm": 0.53125, "learning_rate": 2.084072759538598e-05, "loss": 0.9571, "mean_token_accuracy": 0.7517107434570789, "num_tokens": 247612921.0, "step": 2630 }, { "entropy": 1.3499131940305233, "epoch": 0.5857230018303844, "grad_norm": 0.5703125, "learning_rate": 2.0729813664596272e-05, "loss": 0.9726, "mean_token_accuracy": 0.7497683681547642, "num_tokens": 248563712.0, "step": 2640 }, { "entropy": 1.3714247092604637, "epoch": 0.5879416495645904, "grad_norm": 0.51953125, "learning_rate": 2.0618899733806567e-05, "loss": 0.9711, "mean_token_accuracy": 0.7488393485546112, "num_tokens": 249490907.0, "step": 2650 }, { "entropy": 1.3412188753485679, "epoch": 0.5901602972987964, "grad_norm": 0.5703125, "learning_rate": 2.050798580301686e-05, "loss": 0.9491, "mean_token_accuracy": 0.7532148152589798, "num_tokens": 250423263.0, "step": 2660 }, { "entropy": 1.3625102311372757, "epoch": 0.5923789450330024, "grad_norm": 0.55078125, "learning_rate": 2.0397071872227152e-05, "loss": 0.9543, "mean_token_accuracy": 0.7492990329861641, "num_tokens": 251346039.0, "step": 2670 }, { "entropy": 1.3572603225708009, "epoch": 0.5945975927672084, "grad_norm": 0.54296875, "learning_rate": 2.0286157941437444e-05, "loss": 1.0038, "mean_token_accuracy": 0.74280019775033, "num_tokens": 252294379.0, "step": 2680 }, { "entropy": 1.3205513313412667, "epoch": 0.5968162405014144, "grad_norm": 0.5859375, "learning_rate": 2.0175244010647736e-05, "loss": 0.9271, "mean_token_accuracy": 0.760619267821312, "num_tokens": 253223241.0, "step": 2690 }, { "entropy": 1.3887271240353585, "epoch": 0.5990348882356203, "grad_norm": 0.56640625, "learning_rate": 2.006433007985803e-05, "loss": 0.967, "mean_token_accuracy": 0.7496553495526314, "num_tokens": 254149442.0, "step": 2700 }, { "entropy": 1.3467085279524327, "epoch": 0.6012535359698263, "grad_norm": 0.54296875, "learning_rate": 1.9953416149068324e-05, "loss": 0.9544, "mean_token_accuracy": 0.751462958753109, "num_tokens": 255110533.0, "step": 2710 }, { "entropy": 1.355501127243042, "epoch": 0.6034721837040324, "grad_norm": 0.55078125, "learning_rate": 1.9842502218278616e-05, "loss": 0.9601, "mean_token_accuracy": 0.7510710142552852, "num_tokens": 256043709.0, "step": 2720 }, { "entropy": 1.3472363010048867, "epoch": 0.6056908314382384, "grad_norm": 0.55078125, "learning_rate": 1.9731588287488908e-05, "loss": 0.9427, "mean_token_accuracy": 0.75606449842453, "num_tokens": 257002884.0, "step": 2730 }, { "entropy": 1.3073521062731743, "epoch": 0.6079094791724444, "grad_norm": 0.546875, "learning_rate": 1.9620674356699203e-05, "loss": 0.9342, "mean_token_accuracy": 0.7574294097721577, "num_tokens": 257959846.0, "step": 2740 }, { "entropy": 1.3511497721076011, "epoch": 0.6101281269066504, "grad_norm": 0.53125, "learning_rate": 1.9509760425909496e-05, "loss": 0.9546, "mean_token_accuracy": 0.7517549440264701, "num_tokens": 258923804.0, "step": 2750 }, { "entropy": 1.3576786249876023, "epoch": 0.6123467746408564, "grad_norm": 0.5390625, "learning_rate": 1.9398846495119788e-05, "loss": 0.9499, "mean_token_accuracy": 0.7557240962982178, "num_tokens": 259860952.0, "step": 2760 }, { "entropy": 1.3472177743911744, "epoch": 0.6145654223750624, "grad_norm": 0.59375, "learning_rate": 1.928793256433008e-05, "loss": 0.9466, "mean_token_accuracy": 0.753157027810812, "num_tokens": 260785025.0, "step": 2770 }, { "entropy": 1.380058291554451, "epoch": 0.6167840701092684, "grad_norm": 0.57421875, "learning_rate": 1.9177018633540372e-05, "loss": 0.983, "mean_token_accuracy": 0.7439537294209003, "num_tokens": 261707332.0, "step": 2780 }, { "entropy": 1.3696980610489846, "epoch": 0.6190027178434744, "grad_norm": 0.51953125, "learning_rate": 1.9066104702750667e-05, "loss": 0.973, "mean_token_accuracy": 0.7488272294402123, "num_tokens": 262628859.0, "step": 2790 }, { "entropy": 1.3467194586992264, "epoch": 0.6212213655776804, "grad_norm": 0.5546875, "learning_rate": 1.895519077196096e-05, "loss": 0.9385, "mean_token_accuracy": 0.7560124054551125, "num_tokens": 263568807.0, "step": 2800 }, { "entropy": 1.3259218126535415, "epoch": 0.6234400133118864, "grad_norm": 0.5390625, "learning_rate": 1.8844276841171252e-05, "loss": 0.9512, "mean_token_accuracy": 0.7530164457857609, "num_tokens": 264503207.0, "step": 2810 }, { "entropy": 1.349274192750454, "epoch": 0.6256586610460924, "grad_norm": 0.5, "learning_rate": 1.8733362910381544e-05, "loss": 0.96, "mean_token_accuracy": 0.7500286810100079, "num_tokens": 265443978.0, "step": 2820 }, { "entropy": 1.3598796546459198, "epoch": 0.6278773087802985, "grad_norm": 0.55078125, "learning_rate": 1.862244897959184e-05, "loss": 0.9772, "mean_token_accuracy": 0.7478482507169246, "num_tokens": 266389592.0, "step": 2830 }, { "entropy": 1.3375118046998977, "epoch": 0.6300959565145045, "grad_norm": 0.51953125, "learning_rate": 1.851153504880213e-05, "loss": 0.9396, "mean_token_accuracy": 0.7552093096077442, "num_tokens": 267324146.0, "step": 2840 }, { "entropy": 1.3398489728569984, "epoch": 0.6323146042487104, "grad_norm": 0.5234375, "learning_rate": 1.8400621118012424e-05, "loss": 0.9375, "mean_token_accuracy": 0.7564864322543144, "num_tokens": 268270041.0, "step": 2850 }, { "entropy": 1.3224478855729103, "epoch": 0.6345332519829164, "grad_norm": 0.55859375, "learning_rate": 1.8289707187222716e-05, "loss": 0.9462, "mean_token_accuracy": 0.7549590796232224, "num_tokens": 269231597.0, "step": 2860 }, { "entropy": 1.3553704172372818, "epoch": 0.6367518997171224, "grad_norm": 0.53515625, "learning_rate": 1.8178793256433008e-05, "loss": 0.9589, "mean_token_accuracy": 0.751991906017065, "num_tokens": 270152001.0, "step": 2870 }, { "entropy": 1.3432944223284722, "epoch": 0.6389705474513284, "grad_norm": 0.5546875, "learning_rate": 1.8067879325643303e-05, "loss": 0.9621, "mean_token_accuracy": 0.7513845339417458, "num_tokens": 271087976.0, "step": 2880 }, { "entropy": 1.3790721513330937, "epoch": 0.6411891951855344, "grad_norm": 0.55078125, "learning_rate": 1.7956965394853596e-05, "loss": 0.9863, "mean_token_accuracy": 0.74508848041296, "num_tokens": 272035081.0, "step": 2890 }, { "entropy": 1.3692745730280875, "epoch": 0.6434078429197404, "grad_norm": 0.52734375, "learning_rate": 1.7846051464063888e-05, "loss": 0.9804, "mean_token_accuracy": 0.7487337306141854, "num_tokens": 272973482.0, "step": 2900 }, { "entropy": 1.3950363367795944, "epoch": 0.6456264906539464, "grad_norm": 0.55859375, "learning_rate": 1.773513753327418e-05, "loss": 0.9917, "mean_token_accuracy": 0.7448577910661698, "num_tokens": 273904331.0, "step": 2910 }, { "entropy": 1.3784946396946907, "epoch": 0.6478451383881524, "grad_norm": 0.55078125, "learning_rate": 1.7624223602484475e-05, "loss": 1.0087, "mean_token_accuracy": 0.741528432816267, "num_tokens": 274848669.0, "step": 2920 }, { "entropy": 1.3325315289199353, "epoch": 0.6500637861223584, "grad_norm": 0.53125, "learning_rate": 1.7513309671694767e-05, "loss": 0.9466, "mean_token_accuracy": 0.7518486715853214, "num_tokens": 275803568.0, "step": 2930 }, { "entropy": 1.3600165903568269, "epoch": 0.6522824338565644, "grad_norm": 0.5625, "learning_rate": 1.740239574090506e-05, "loss": 0.9382, "mean_token_accuracy": 0.7539416745305061, "num_tokens": 276747925.0, "step": 2940 }, { "entropy": 1.3534336686134338, "epoch": 0.6545010815907705, "grad_norm": 0.53515625, "learning_rate": 1.7291481810115352e-05, "loss": 0.9704, "mean_token_accuracy": 0.7500346690416336, "num_tokens": 277658894.0, "step": 2950 }, { "entropy": 1.3526192732155322, "epoch": 0.6567197293249765, "grad_norm": 0.53125, "learning_rate": 1.7180567879325644e-05, "loss": 0.9615, "mean_token_accuracy": 0.7505016751587391, "num_tokens": 278614364.0, "step": 2960 }, { "entropy": 1.3536822080612183, "epoch": 0.6589383770591825, "grad_norm": 0.5859375, "learning_rate": 1.706965394853594e-05, "loss": 0.9584, "mean_token_accuracy": 0.7506825909018516, "num_tokens": 279546133.0, "step": 2970 }, { "entropy": 1.3441800415515899, "epoch": 0.6611570247933884, "grad_norm": 0.51171875, "learning_rate": 1.695874001774623e-05, "loss": 0.9322, "mean_token_accuracy": 0.7591280125081539, "num_tokens": 280483436.0, "step": 2980 }, { "entropy": 1.3216261357069015, "epoch": 0.6633756725275944, "grad_norm": 0.53515625, "learning_rate": 1.6847826086956524e-05, "loss": 0.9491, "mean_token_accuracy": 0.7539561577141285, "num_tokens": 281450626.0, "step": 2990 }, { "entropy": 1.3525083124637605, "epoch": 0.6655943202618004, "grad_norm": 0.5546875, "learning_rate": 1.6736912156166816e-05, "loss": 0.9179, "mean_token_accuracy": 0.7602526120841503, "num_tokens": 282378418.0, "step": 3000 }, { "entropy": 1.350367258489132, "epoch": 0.6678129679960064, "grad_norm": 0.51171875, "learning_rate": 1.6625998225377108e-05, "loss": 0.9397, "mean_token_accuracy": 0.7571302607655526, "num_tokens": 283298771.0, "step": 3010 }, { "entropy": 1.3382517769932747, "epoch": 0.6700316157302124, "grad_norm": 0.546875, "learning_rate": 1.6515084294587403e-05, "loss": 0.9536, "mean_token_accuracy": 0.7520625948905945, "num_tokens": 284243577.0, "step": 3020 }, { "entropy": 1.336366317421198, "epoch": 0.6722502634644184, "grad_norm": 0.5078125, "learning_rate": 1.6404170363797696e-05, "loss": 0.9375, "mean_token_accuracy": 0.7568468548357487, "num_tokens": 285185257.0, "step": 3030 }, { "entropy": 1.3323681712150575, "epoch": 0.6744689111986244, "grad_norm": 0.54296875, "learning_rate": 1.6293256433007988e-05, "loss": 0.932, "mean_token_accuracy": 0.7574945628643036, "num_tokens": 286121874.0, "step": 3040 }, { "entropy": 1.344571302831173, "epoch": 0.6766875589328304, "grad_norm": 0.54296875, "learning_rate": 1.618234250221828e-05, "loss": 0.9454, "mean_token_accuracy": 0.7531527921557426, "num_tokens": 287042084.0, "step": 3050 }, { "entropy": 1.3513332322239875, "epoch": 0.6789062066670365, "grad_norm": 0.53125, "learning_rate": 1.6071428571428572e-05, "loss": 0.9615, "mean_token_accuracy": 0.7513311177492141, "num_tokens": 287961333.0, "step": 3060 }, { "entropy": 1.3252726949751377, "epoch": 0.6811248544012425, "grad_norm": 0.490234375, "learning_rate": 1.5960514640638864e-05, "loss": 0.9341, "mean_token_accuracy": 0.7552036680281162, "num_tokens": 288894800.0, "step": 3070 }, { "entropy": 1.3621705561876296, "epoch": 0.6833435021354485, "grad_norm": 0.51953125, "learning_rate": 1.5849600709849156e-05, "loss": 0.9659, "mean_token_accuracy": 0.7510468997061253, "num_tokens": 289837877.0, "step": 3080 }, { "entropy": 1.372152604162693, "epoch": 0.6855621498696545, "grad_norm": 0.515625, "learning_rate": 1.573868677905945e-05, "loss": 0.9908, "mean_token_accuracy": 0.7456212192773819, "num_tokens": 290768330.0, "step": 3090 }, { "entropy": 1.3613446295261382, "epoch": 0.6877807976038605, "grad_norm": 0.546875, "learning_rate": 1.5627772848269744e-05, "loss": 0.9498, "mean_token_accuracy": 0.7532825492322445, "num_tokens": 291697499.0, "step": 3100 }, { "entropy": 1.3725149601697921, "epoch": 0.6899994453380665, "grad_norm": 0.52734375, "learning_rate": 1.5516858917480036e-05, "loss": 0.9747, "mean_token_accuracy": 0.7483395658433437, "num_tokens": 292632277.0, "step": 3110 }, { "entropy": 1.3413543090224267, "epoch": 0.6922180930722724, "grad_norm": 0.546875, "learning_rate": 1.5405944986690328e-05, "loss": 0.9563, "mean_token_accuracy": 0.7508202590048313, "num_tokens": 293584069.0, "step": 3120 }, { "entropy": 1.352384202182293, "epoch": 0.6944367408064784, "grad_norm": 0.57421875, "learning_rate": 1.529503105590062e-05, "loss": 0.9654, "mean_token_accuracy": 0.7493121877312661, "num_tokens": 294513585.0, "step": 3130 }, { "entropy": 1.356651772558689, "epoch": 0.6966553885406844, "grad_norm": 0.578125, "learning_rate": 1.5184117125110914e-05, "loss": 0.9495, "mean_token_accuracy": 0.7534554153680801, "num_tokens": 295440578.0, "step": 3140 }, { "entropy": 1.335485778748989, "epoch": 0.6988740362748904, "grad_norm": 0.54296875, "learning_rate": 1.5073203194321208e-05, "loss": 0.9726, "mean_token_accuracy": 0.7495904855430127, "num_tokens": 296372981.0, "step": 3150 }, { "entropy": 1.343485713750124, "epoch": 0.7010926840090964, "grad_norm": 0.57421875, "learning_rate": 1.4962289263531502e-05, "loss": 0.9646, "mean_token_accuracy": 0.7513713717460633, "num_tokens": 297325689.0, "step": 3160 }, { "entropy": 1.363182956725359, "epoch": 0.7033113317433024, "grad_norm": 0.53515625, "learning_rate": 1.4851375332741794e-05, "loss": 0.9518, "mean_token_accuracy": 0.7518307134509087, "num_tokens": 298270698.0, "step": 3170 }, { "entropy": 1.3420901797711848, "epoch": 0.7055299794775085, "grad_norm": 0.55859375, "learning_rate": 1.4740461401952086e-05, "loss": 0.9716, "mean_token_accuracy": 0.7465130612254143, "num_tokens": 299197164.0, "step": 3180 }, { "entropy": 1.3738549813628196, "epoch": 0.7077486272117145, "grad_norm": 0.515625, "learning_rate": 1.4629547471162378e-05, "loss": 0.9738, "mean_token_accuracy": 0.7482325688004494, "num_tokens": 300152852.0, "step": 3190 }, { "entropy": 1.3018300041556359, "epoch": 0.7099672749459205, "grad_norm": 0.53515625, "learning_rate": 1.4518633540372672e-05, "loss": 0.907, "mean_token_accuracy": 0.764003473520279, "num_tokens": 301127407.0, "step": 3200 }, { "entropy": 1.342644067108631, "epoch": 0.7121859226801265, "grad_norm": 0.52734375, "learning_rate": 1.4407719609582964e-05, "loss": 0.9644, "mean_token_accuracy": 0.7527099289000034, "num_tokens": 302059360.0, "step": 3210 }, { "entropy": 1.3652416355907917, "epoch": 0.7144045704143325, "grad_norm": 0.546875, "learning_rate": 1.4296805678793256e-05, "loss": 0.9425, "mean_token_accuracy": 0.7537096805870533, "num_tokens": 302987839.0, "step": 3220 }, { "entropy": 1.3176094248890877, "epoch": 0.7166232181485385, "grad_norm": 0.53125, "learning_rate": 1.4185891748003548e-05, "loss": 0.9469, "mean_token_accuracy": 0.7529924146831035, "num_tokens": 303927433.0, "step": 3230 }, { "entropy": 1.3563083581626416, "epoch": 0.7188418658827445, "grad_norm": 0.50390625, "learning_rate": 1.4074977817213844e-05, "loss": 0.9656, "mean_token_accuracy": 0.7512292198836803, "num_tokens": 304897121.0, "step": 3240 }, { "entropy": 1.3360683649778367, "epoch": 0.7210605136169504, "grad_norm": 0.60546875, "learning_rate": 1.3964063886424136e-05, "loss": 0.9356, "mean_token_accuracy": 0.7564455397427082, "num_tokens": 305845949.0, "step": 3250 }, { "entropy": 1.3641312032938004, "epoch": 0.7232791613511564, "grad_norm": 0.578125, "learning_rate": 1.3853149955634428e-05, "loss": 1.0009, "mean_token_accuracy": 0.7445311717689037, "num_tokens": 306770481.0, "step": 3260 }, { "entropy": 1.3404412433505057, "epoch": 0.7254978090853624, "grad_norm": 0.56640625, "learning_rate": 1.374223602484472e-05, "loss": 0.948, "mean_token_accuracy": 0.7560093238949775, "num_tokens": 307705021.0, "step": 3270 }, { "entropy": 1.343174346536398, "epoch": 0.7277164568195684, "grad_norm": 0.51953125, "learning_rate": 1.3631322094055012e-05, "loss": 0.9282, "mean_token_accuracy": 0.7588741101324559, "num_tokens": 308647182.0, "step": 3280 }, { "entropy": 1.3446429327130318, "epoch": 0.7299351045537745, "grad_norm": 0.490234375, "learning_rate": 1.3520408163265308e-05, "loss": 0.9535, "mean_token_accuracy": 0.7525325618684292, "num_tokens": 309593575.0, "step": 3290 }, { "entropy": 1.3387797683477403, "epoch": 0.7321537522879805, "grad_norm": 0.546875, "learning_rate": 1.34094942324756e-05, "loss": 0.9583, "mean_token_accuracy": 0.7520524263381958, "num_tokens": 310549256.0, "step": 3300 }, { "entropy": 1.371607707440853, "epoch": 0.7343724000221865, "grad_norm": 0.546875, "learning_rate": 1.3298580301685892e-05, "loss": 0.9565, "mean_token_accuracy": 0.7507821291685104, "num_tokens": 311487519.0, "step": 3310 }, { "entropy": 1.3396147727966308, "epoch": 0.7365910477563925, "grad_norm": 0.60546875, "learning_rate": 1.3187666370896184e-05, "loss": 0.9704, "mean_token_accuracy": 0.7495545491576194, "num_tokens": 312433352.0, "step": 3320 }, { "entropy": 1.3545660354197024, "epoch": 0.7388096954905985, "grad_norm": 0.546875, "learning_rate": 1.3076752440106476e-05, "loss": 0.9416, "mean_token_accuracy": 0.7558687753975392, "num_tokens": 313376390.0, "step": 3330 }, { "entropy": 1.3706799075007439, "epoch": 0.7410283432248045, "grad_norm": 0.55078125, "learning_rate": 1.2965838509316772e-05, "loss": 0.9826, "mean_token_accuracy": 0.7450837090611457, "num_tokens": 314320815.0, "step": 3340 }, { "entropy": 1.3725864320993424, "epoch": 0.7432469909590105, "grad_norm": 0.51171875, "learning_rate": 1.2854924578527064e-05, "loss": 0.9775, "mean_token_accuracy": 0.7485952161252498, "num_tokens": 315291123.0, "step": 3350 }, { "entropy": 1.3556952878832818, "epoch": 0.7454656386932165, "grad_norm": 0.51953125, "learning_rate": 1.2744010647737356e-05, "loss": 0.9683, "mean_token_accuracy": 0.7492410965263844, "num_tokens": 316236020.0, "step": 3360 }, { "entropy": 1.349064838141203, "epoch": 0.7476842864274225, "grad_norm": 0.53515625, "learning_rate": 1.2633096716947648e-05, "loss": 0.9704, "mean_token_accuracy": 0.7494482189416886, "num_tokens": 317154910.0, "step": 3370 }, { "entropy": 1.359015841037035, "epoch": 0.7499029341616285, "grad_norm": 0.546875, "learning_rate": 1.2522182786157944e-05, "loss": 0.9641, "mean_token_accuracy": 0.749902281910181, "num_tokens": 318080921.0, "step": 3380 }, { "entropy": 1.3636605456471442, "epoch": 0.7521215818958344, "grad_norm": 0.5390625, "learning_rate": 1.2411268855368236e-05, "loss": 0.9644, "mean_token_accuracy": 0.7513450764119625, "num_tokens": 319014412.0, "step": 3390 }, { "entropy": 1.3377082630991937, "epoch": 0.7543402296300404, "grad_norm": 0.515625, "learning_rate": 1.2300354924578528e-05, "loss": 0.946, "mean_token_accuracy": 0.7537905521690845, "num_tokens": 319955427.0, "step": 3400 }, { "entropy": 1.3234972402453422, "epoch": 0.7565588773642465, "grad_norm": 0.546875, "learning_rate": 1.218944099378882e-05, "loss": 0.9414, "mean_token_accuracy": 0.7541356466710567, "num_tokens": 320934497.0, "step": 3410 }, { "entropy": 1.3440752558410167, "epoch": 0.7587775250984525, "grad_norm": 0.5546875, "learning_rate": 1.2078527062999114e-05, "loss": 0.9503, "mean_token_accuracy": 0.7518649064004421, "num_tokens": 321880491.0, "step": 3420 }, { "entropy": 1.3397350490093232, "epoch": 0.7609961728326585, "grad_norm": 0.51953125, "learning_rate": 1.1967613132209406e-05, "loss": 0.9324, "mean_token_accuracy": 0.7557294942438603, "num_tokens": 322803732.0, "step": 3430 }, { "entropy": 1.3109237834811212, "epoch": 0.7632148205668645, "grad_norm": 0.5234375, "learning_rate": 1.18566992014197e-05, "loss": 0.9228, "mean_token_accuracy": 0.7610769435763359, "num_tokens": 323769648.0, "step": 3440 }, { "entropy": 1.3633039817214012, "epoch": 0.7654334683010705, "grad_norm": 0.52734375, "learning_rate": 1.1745785270629992e-05, "loss": 0.9921, "mean_token_accuracy": 0.7444672405719757, "num_tokens": 324712776.0, "step": 3450 }, { "entropy": 1.3648219130933286, "epoch": 0.7676521160352765, "grad_norm": 0.55078125, "learning_rate": 1.1634871339840284e-05, "loss": 0.9942, "mean_token_accuracy": 0.744285186380148, "num_tokens": 325639116.0, "step": 3460 }, { "entropy": 1.3753913044929504, "epoch": 0.7698707637694825, "grad_norm": 0.56640625, "learning_rate": 1.1523957409050576e-05, "loss": 0.9669, "mean_token_accuracy": 0.7503029778599739, "num_tokens": 326579098.0, "step": 3470 }, { "entropy": 1.3312873490154744, "epoch": 0.7720894115036885, "grad_norm": 0.51171875, "learning_rate": 1.141304347826087e-05, "loss": 0.9488, "mean_token_accuracy": 0.7541476741433144, "num_tokens": 327516490.0, "step": 3480 }, { "entropy": 1.3498370356857776, "epoch": 0.7743080592378945, "grad_norm": 0.57421875, "learning_rate": 1.1302129547471162e-05, "loss": 0.9738, "mean_token_accuracy": 0.7493281632661819, "num_tokens": 328443057.0, "step": 3490 }, { "entropy": 1.3415059983730315, "epoch": 0.7765267069721005, "grad_norm": 0.5234375, "learning_rate": 1.1191215616681455e-05, "loss": 0.9392, "mean_token_accuracy": 0.7565719000995159, "num_tokens": 329389868.0, "step": 3500 }, { "entropy": 1.3868108600378037, "epoch": 0.7787453547063065, "grad_norm": 0.52734375, "learning_rate": 1.1080301685891748e-05, "loss": 1.0112, "mean_token_accuracy": 0.7436525091528893, "num_tokens": 330333754.0, "step": 3510 }, { "entropy": 1.353071667253971, "epoch": 0.7809640024405126, "grad_norm": 0.57421875, "learning_rate": 1.096938775510204e-05, "loss": 0.9435, "mean_token_accuracy": 0.7540925681591034, "num_tokens": 331254469.0, "step": 3520 }, { "entropy": 1.3132469408214091, "epoch": 0.7831826501747186, "grad_norm": 0.54296875, "learning_rate": 1.0858473824312334e-05, "loss": 0.9211, "mean_token_accuracy": 0.7597164355218411, "num_tokens": 332195343.0, "step": 3530 }, { "entropy": 1.322484378516674, "epoch": 0.7854012979089245, "grad_norm": 0.53125, "learning_rate": 1.0747559893522626e-05, "loss": 0.9358, "mean_token_accuracy": 0.7559656046330929, "num_tokens": 333130438.0, "step": 3540 }, { "entropy": 1.3583971813321114, "epoch": 0.7876199456431305, "grad_norm": 0.53515625, "learning_rate": 1.063664596273292e-05, "loss": 0.944, "mean_token_accuracy": 0.7558795347809791, "num_tokens": 334072646.0, "step": 3550 }, { "entropy": 1.3520539619028569, "epoch": 0.7898385933773365, "grad_norm": 0.53515625, "learning_rate": 1.0525732031943212e-05, "loss": 0.9802, "mean_token_accuracy": 0.7473956875503063, "num_tokens": 335011200.0, "step": 3560 }, { "entropy": 1.3791773080825807, "epoch": 0.7920572411115425, "grad_norm": 0.5234375, "learning_rate": 1.0414818101153505e-05, "loss": 0.9912, "mean_token_accuracy": 0.7445360422134399, "num_tokens": 335949808.0, "step": 3570 }, { "entropy": 1.30967488437891, "epoch": 0.7942758888457485, "grad_norm": 0.5234375, "learning_rate": 1.0303904170363798e-05, "loss": 0.9029, "mean_token_accuracy": 0.761937515437603, "num_tokens": 336904248.0, "step": 3580 }, { "entropy": 1.3683781877160073, "epoch": 0.7964945365799545, "grad_norm": 0.5390625, "learning_rate": 1.019299023957409e-05, "loss": 0.9608, "mean_token_accuracy": 0.7519945807754993, "num_tokens": 337849157.0, "step": 3590 }, { "entropy": 1.3160683244466782, "epoch": 0.7987131843141605, "grad_norm": 0.5078125, "learning_rate": 1.0082076308784384e-05, "loss": 0.928, "mean_token_accuracy": 0.7593866750597954, "num_tokens": 338799972.0, "step": 3600 }, { "entropy": 1.3837224870920182, "epoch": 0.8009318320483665, "grad_norm": 0.5703125, "learning_rate": 9.971162377994676e-06, "loss": 0.9794, "mean_token_accuracy": 0.7475892208516598, "num_tokens": 339729332.0, "step": 3610 }, { "entropy": 1.3449356317520142, "epoch": 0.8031504797825725, "grad_norm": 0.51953125, "learning_rate": 9.86024844720497e-06, "loss": 0.9435, "mean_token_accuracy": 0.7529967434704303, "num_tokens": 340656347.0, "step": 3620 }, { "entropy": 1.3135579869151115, "epoch": 0.8053691275167785, "grad_norm": 0.52734375, "learning_rate": 9.749334516415262e-06, "loss": 0.905, "mean_token_accuracy": 0.7636351682245731, "num_tokens": 341603645.0, "step": 3630 }, { "entropy": 1.3562857955694199, "epoch": 0.8075877752509846, "grad_norm": 0.53515625, "learning_rate": 9.638420585625555e-06, "loss": 0.9654, "mean_token_accuracy": 0.7500083535909653, "num_tokens": 342551945.0, "step": 3640 }, { "entropy": 1.355036635696888, "epoch": 0.8098064229851906, "grad_norm": 0.55859375, "learning_rate": 9.527506654835848e-06, "loss": 0.9783, "mean_token_accuracy": 0.747504611313343, "num_tokens": 343501214.0, "step": 3650 }, { "entropy": 1.3850376293063165, "epoch": 0.8120250707193966, "grad_norm": 0.53515625, "learning_rate": 9.41659272404614e-06, "loss": 0.9813, "mean_token_accuracy": 0.7430158272385597, "num_tokens": 344479426.0, "step": 3660 }, { "entropy": 1.35298143774271, "epoch": 0.8142437184536025, "grad_norm": 0.54296875, "learning_rate": 9.305678793256434e-06, "loss": 0.9528, "mean_token_accuracy": 0.75439862459898, "num_tokens": 345406732.0, "step": 3670 }, { "entropy": 1.3408295065164566, "epoch": 0.8164623661878085, "grad_norm": 0.52734375, "learning_rate": 9.194764862466726e-06, "loss": 0.9464, "mean_token_accuracy": 0.7534433856606484, "num_tokens": 346375091.0, "step": 3680 }, { "entropy": 1.3690178409218787, "epoch": 0.8186810139220145, "grad_norm": 0.54296875, "learning_rate": 9.08385093167702e-06, "loss": 0.9794, "mean_token_accuracy": 0.7499176189303398, "num_tokens": 347327768.0, "step": 3690 }, { "entropy": 1.3406174167990685, "epoch": 0.8208996616562205, "grad_norm": 0.546875, "learning_rate": 8.972937000887312e-06, "loss": 0.9237, "mean_token_accuracy": 0.7583520159125328, "num_tokens": 348246799.0, "step": 3700 }, { "entropy": 1.3822472810745239, "epoch": 0.8231183093904265, "grad_norm": 0.57421875, "learning_rate": 8.862023070097605e-06, "loss": 0.9984, "mean_token_accuracy": 0.7432019256055356, "num_tokens": 349172608.0, "step": 3710 }, { "entropy": 1.3216811880469321, "epoch": 0.8253369571246325, "grad_norm": 0.53515625, "learning_rate": 8.751109139307898e-06, "loss": 0.9271, "mean_token_accuracy": 0.758989142626524, "num_tokens": 350123406.0, "step": 3720 }, { "entropy": 1.2982059597969056, "epoch": 0.8275556048588385, "grad_norm": 0.53125, "learning_rate": 8.64019520851819e-06, "loss": 0.8997, "mean_token_accuracy": 0.7647782519459725, "num_tokens": 351066848.0, "step": 3730 }, { "entropy": 1.3314955472946166, "epoch": 0.8297742525930445, "grad_norm": 0.54296875, "learning_rate": 8.529281277728483e-06, "loss": 0.9526, "mean_token_accuracy": 0.7523629620671273, "num_tokens": 351999813.0, "step": 3740 }, { "entropy": 1.35967206209898, "epoch": 0.8319929003272506, "grad_norm": 0.56640625, "learning_rate": 8.418367346938775e-06, "loss": 0.9813, "mean_token_accuracy": 0.7480250895023346, "num_tokens": 352930626.0, "step": 3750 }, { "entropy": 1.3411589175462724, "epoch": 0.8342115480614566, "grad_norm": 0.55859375, "learning_rate": 8.307453416149069e-06, "loss": 0.9699, "mean_token_accuracy": 0.748241176456213, "num_tokens": 353873348.0, "step": 3760 }, { "entropy": 1.3526584044098855, "epoch": 0.8364301957956626, "grad_norm": 0.53515625, "learning_rate": 8.19653948535936e-06, "loss": 0.9759, "mean_token_accuracy": 0.7478196188807488, "num_tokens": 354803544.0, "step": 3770 }, { "entropy": 1.3394062861800193, "epoch": 0.8386488435298686, "grad_norm": 0.5625, "learning_rate": 8.085625554569655e-06, "loss": 0.9535, "mean_token_accuracy": 0.7555646121501922, "num_tokens": 355731286.0, "step": 3780 }, { "entropy": 1.3712951876223087, "epoch": 0.8408674912640746, "grad_norm": 0.53125, "learning_rate": 7.974711623779947e-06, "loss": 0.9772, "mean_token_accuracy": 0.7479187317192555, "num_tokens": 356667594.0, "step": 3790 }, { "entropy": 1.3195544198155402, "epoch": 0.8430861389982806, "grad_norm": 0.51171875, "learning_rate": 7.863797692990239e-06, "loss": 0.9468, "mean_token_accuracy": 0.7531268313527107, "num_tokens": 357589764.0, "step": 3800 }, { "entropy": 1.3623077616095542, "epoch": 0.8453047867324865, "grad_norm": 0.5703125, "learning_rate": 7.752883762200533e-06, "loss": 0.9927, "mean_token_accuracy": 0.7447442330420018, "num_tokens": 358546216.0, "step": 3810 }, { "entropy": 1.3607013449072838, "epoch": 0.8475234344666925, "grad_norm": 0.5625, "learning_rate": 7.641969831410825e-06, "loss": 0.9416, "mean_token_accuracy": 0.7566105239093304, "num_tokens": 359495367.0, "step": 3820 }, { "entropy": 1.348987601697445, "epoch": 0.8497420822008985, "grad_norm": 0.484375, "learning_rate": 7.5310559006211186e-06, "loss": 0.9343, "mean_token_accuracy": 0.7575232580304145, "num_tokens": 360442276.0, "step": 3830 }, { "entropy": 1.3610796511173249, "epoch": 0.8519607299351045, "grad_norm": 0.51953125, "learning_rate": 7.420141969831411e-06, "loss": 0.9372, "mean_token_accuracy": 0.756447360664606, "num_tokens": 361377342.0, "step": 3840 }, { "entropy": 1.3527425512671472, "epoch": 0.8541793776693105, "grad_norm": 0.53515625, "learning_rate": 7.3092280390417045e-06, "loss": 0.9495, "mean_token_accuracy": 0.7547285988926887, "num_tokens": 362298440.0, "step": 3850 }, { "entropy": 1.330655214190483, "epoch": 0.8563980254035165, "grad_norm": 0.51171875, "learning_rate": 7.198314108251997e-06, "loss": 0.9475, "mean_token_accuracy": 0.751707597821951, "num_tokens": 363228367.0, "step": 3860 }, { "entropy": 1.3436040908098221, "epoch": 0.8586166731377226, "grad_norm": 0.48828125, "learning_rate": 7.0874001774622905e-06, "loss": 0.9536, "mean_token_accuracy": 0.7511266514658927, "num_tokens": 364167204.0, "step": 3870 }, { "entropy": 1.3443495616316796, "epoch": 0.8608353208719286, "grad_norm": 0.54296875, "learning_rate": 6.976486246672583e-06, "loss": 0.9512, "mean_token_accuracy": 0.7544127158820629, "num_tokens": 365144075.0, "step": 3880 }, { "entropy": 1.3494714990258216, "epoch": 0.8630539686061346, "grad_norm": 0.5390625, "learning_rate": 6.865572315882875e-06, "loss": 0.951, "mean_token_accuracy": 0.752277635782957, "num_tokens": 366069039.0, "step": 3890 }, { "entropy": 1.3707938618957995, "epoch": 0.8652726163403406, "grad_norm": 0.5859375, "learning_rate": 6.7546583850931686e-06, "loss": 0.9935, "mean_token_accuracy": 0.7460488043725491, "num_tokens": 366994185.0, "step": 3900 }, { "entropy": 1.3302705749869346, "epoch": 0.8674912640745466, "grad_norm": 0.5078125, "learning_rate": 6.643744454303461e-06, "loss": 0.9403, "mean_token_accuracy": 0.7569159217178821, "num_tokens": 367932317.0, "step": 3910 }, { "entropy": 1.3517090238630771, "epoch": 0.8697099118087526, "grad_norm": 0.54296875, "learning_rate": 6.532830523513754e-06, "loss": 0.9539, "mean_token_accuracy": 0.7541409082710743, "num_tokens": 368888419.0, "step": 3920 }, { "entropy": 1.365368028730154, "epoch": 0.8719285595429586, "grad_norm": 0.55859375, "learning_rate": 6.421916592724047e-06, "loss": 0.975, "mean_token_accuracy": 0.7489493399858475, "num_tokens": 369809659.0, "step": 3930 }, { "entropy": 1.363468910753727, "epoch": 0.8741472072771646, "grad_norm": 0.578125, "learning_rate": 6.31100266193434e-06, "loss": 0.9687, "mean_token_accuracy": 0.7492878220975399, "num_tokens": 370758628.0, "step": 3940 }, { "entropy": 1.3409071058034896, "epoch": 0.8763658550113705, "grad_norm": 0.56640625, "learning_rate": 6.200088731144632e-06, "loss": 0.9425, "mean_token_accuracy": 0.7558536991477013, "num_tokens": 371684631.0, "step": 3950 }, { "entropy": 1.3250400580465793, "epoch": 0.8785845027455765, "grad_norm": 0.53515625, "learning_rate": 6.089174800354925e-06, "loss": 0.9554, "mean_token_accuracy": 0.7519582070410251, "num_tokens": 372645749.0, "step": 3960 }, { "entropy": 1.3622069828212262, "epoch": 0.8808031504797825, "grad_norm": 0.55859375, "learning_rate": 5.978260869565218e-06, "loss": 0.974, "mean_token_accuracy": 0.7483527101576328, "num_tokens": 373579688.0, "step": 3970 }, { "entropy": 1.3249136090278626, "epoch": 0.8830217982139886, "grad_norm": 0.52734375, "learning_rate": 5.867346938775511e-06, "loss": 0.9481, "mean_token_accuracy": 0.7574851214885712, "num_tokens": 374523490.0, "step": 3980 }, { "entropy": 1.3423442378640176, "epoch": 0.8852404459481946, "grad_norm": 0.515625, "learning_rate": 5.756433007985803e-06, "loss": 0.9604, "mean_token_accuracy": 0.7507563464343547, "num_tokens": 375480069.0, "step": 3990 }, { "entropy": 1.3690859913825988, "epoch": 0.8874590936824006, "grad_norm": 0.53515625, "learning_rate": 5.645519077196096e-06, "loss": 0.9424, "mean_token_accuracy": 0.7560895748436451, "num_tokens": 376414915.0, "step": 4000 }, { "entropy": 1.377838420122862, "epoch": 0.8896777414166066, "grad_norm": 0.54296875, "learning_rate": 5.534605146406389e-06, "loss": 0.9678, "mean_token_accuracy": 0.7493596062064171, "num_tokens": 377345183.0, "step": 4010 }, { "entropy": 1.3701353058218957, "epoch": 0.8918963891508126, "grad_norm": 0.55078125, "learning_rate": 5.423691215616682e-06, "loss": 0.9638, "mean_token_accuracy": 0.7514446713030338, "num_tokens": 378293994.0, "step": 4020 }, { "entropy": 1.3063566341996193, "epoch": 0.8941150368850186, "grad_norm": 0.5546875, "learning_rate": 5.312777284826975e-06, "loss": 0.9353, "mean_token_accuracy": 0.7562219582498073, "num_tokens": 379256824.0, "step": 4030 }, { "entropy": 1.3382435604929923, "epoch": 0.8963336846192246, "grad_norm": 0.55859375, "learning_rate": 5.201863354037268e-06, "loss": 0.9604, "mean_token_accuracy": 0.751346006244421, "num_tokens": 380227652.0, "step": 4040 }, { "entropy": 1.331801988184452, "epoch": 0.8985523323534306, "grad_norm": 0.515625, "learning_rate": 5.090949423247561e-06, "loss": 0.94, "mean_token_accuracy": 0.7547981061041356, "num_tokens": 381192630.0, "step": 4050 }, { "entropy": 1.3264615371823312, "epoch": 0.9007709800876366, "grad_norm": 0.51953125, "learning_rate": 4.980035492457853e-06, "loss": 0.9421, "mean_token_accuracy": 0.7552372604608536, "num_tokens": 382131792.0, "step": 4060 }, { "entropy": 1.3523736476898194, "epoch": 0.9029896278218426, "grad_norm": 0.5625, "learning_rate": 4.869121561668146e-06, "loss": 0.9506, "mean_token_accuracy": 0.7518483199179172, "num_tokens": 383067523.0, "step": 4070 }, { "entropy": 1.3546856120228767, "epoch": 0.9052082755560485, "grad_norm": 0.515625, "learning_rate": 4.758207630878438e-06, "loss": 0.9454, "mean_token_accuracy": 0.7534751631319523, "num_tokens": 384006299.0, "step": 4080 }, { "entropy": 1.3601078018546104, "epoch": 0.9074269232902545, "grad_norm": 0.5859375, "learning_rate": 4.647293700088731e-06, "loss": 0.9405, "mean_token_accuracy": 0.754411680996418, "num_tokens": 384947487.0, "step": 4090 }, { "entropy": 1.339237504452467, "epoch": 0.9096455710244606, "grad_norm": 0.515625, "learning_rate": 4.536379769299024e-06, "loss": 0.9384, "mean_token_accuracy": 0.7560152366757393, "num_tokens": 385874176.0, "step": 4100 }, { "entropy": 1.3611842297017573, "epoch": 0.9118642187586666, "grad_norm": 0.55859375, "learning_rate": 4.425465838509317e-06, "loss": 0.9453, "mean_token_accuracy": 0.7545816585421562, "num_tokens": 386816538.0, "step": 4110 }, { "entropy": 1.3051216751337051, "epoch": 0.9140828664928726, "grad_norm": 0.51171875, "learning_rate": 4.31455190771961e-06, "loss": 0.8994, "mean_token_accuracy": 0.7656806372106075, "num_tokens": 387775511.0, "step": 4120 }, { "entropy": 1.3420870661735536, "epoch": 0.9163015142270786, "grad_norm": 0.5390625, "learning_rate": 4.203637976929903e-06, "loss": 0.9343, "mean_token_accuracy": 0.7567372977733612, "num_tokens": 388685069.0, "step": 4130 }, { "entropy": 1.3393280230462552, "epoch": 0.9185201619612846, "grad_norm": 0.51171875, "learning_rate": 4.092724046140196e-06, "loss": 0.9264, "mean_token_accuracy": 0.7575048118829727, "num_tokens": 389642225.0, "step": 4140 }, { "entropy": 1.312432309985161, "epoch": 0.9207388096954906, "grad_norm": 0.5234375, "learning_rate": 3.981810115350488e-06, "loss": 0.9282, "mean_token_accuracy": 0.7600929595530033, "num_tokens": 390590909.0, "step": 4150 }, { "entropy": 1.3392370440065862, "epoch": 0.9229574574296966, "grad_norm": 0.5625, "learning_rate": 3.870896184560781e-06, "loss": 0.9476, "mean_token_accuracy": 0.7553087763488293, "num_tokens": 391532202.0, "step": 4160 }, { "entropy": 1.3347293518483638, "epoch": 0.9251761051639026, "grad_norm": 0.53125, "learning_rate": 3.759982253771074e-06, "loss": 0.959, "mean_token_accuracy": 0.7549694336950779, "num_tokens": 392487451.0, "step": 4170 }, { "entropy": 1.3385291382670403, "epoch": 0.9273947528981086, "grad_norm": 3.21875, "learning_rate": 3.6490683229813664e-06, "loss": 0.9723, "mean_token_accuracy": 0.7489883296191693, "num_tokens": 393424376.0, "step": 4180 }, { "entropy": 1.3224166721105575, "epoch": 0.9296134006323146, "grad_norm": 0.52734375, "learning_rate": 3.5381543921916594e-06, "loss": 0.9096, "mean_token_accuracy": 0.7614037752151489, "num_tokens": 394361746.0, "step": 4190 }, { "entropy": 1.3364241227507592, "epoch": 0.9318320483665206, "grad_norm": 0.53125, "learning_rate": 3.4272404614019524e-06, "loss": 0.9491, "mean_token_accuracy": 0.7532857812941074, "num_tokens": 395307042.0, "step": 4200 }, { "entropy": 1.3627421900629997, "epoch": 0.9340506961007266, "grad_norm": 0.5234375, "learning_rate": 3.3163265306122454e-06, "loss": 0.9864, "mean_token_accuracy": 0.7476166844367981, "num_tokens": 396250195.0, "step": 4210 }, { "entropy": 1.3614855892956257, "epoch": 0.9362693438349327, "grad_norm": 0.53515625, "learning_rate": 3.2054125998225384e-06, "loss": 0.9671, "mean_token_accuracy": 0.7500945217907429, "num_tokens": 397188536.0, "step": 4220 }, { "entropy": 1.2906481601297854, "epoch": 0.9384879915691386, "grad_norm": 0.486328125, "learning_rate": 3.094498669032831e-06, "loss": 0.9289, "mean_token_accuracy": 0.7579261489212513, "num_tokens": 398160424.0, "step": 4230 }, { "entropy": 1.3569138646125793, "epoch": 0.9407066393033446, "grad_norm": 0.546875, "learning_rate": 2.9835847382431235e-06, "loss": 0.9937, "mean_token_accuracy": 0.7468014664947986, "num_tokens": 399138573.0, "step": 4240 }, { "entropy": 1.3754788801074027, "epoch": 0.9429252870375506, "grad_norm": 1.96875, "learning_rate": 2.872670807453416e-06, "loss": 0.9847, "mean_token_accuracy": 0.7449347853660584, "num_tokens": 400072373.0, "step": 4250 }, { "entropy": 1.3287566512823106, "epoch": 0.9451439347717566, "grad_norm": 0.5390625, "learning_rate": 2.761756876663709e-06, "loss": 0.9585, "mean_token_accuracy": 0.7522503368556499, "num_tokens": 401010419.0, "step": 4260 }, { "entropy": 1.359559991955757, "epoch": 0.9473625825059626, "grad_norm": 0.546875, "learning_rate": 2.650842945874002e-06, "loss": 0.9659, "mean_token_accuracy": 0.7480006530880928, "num_tokens": 401980514.0, "step": 4270 }, { "entropy": 1.3255119130015374, "epoch": 0.9495812302401686, "grad_norm": 0.52734375, "learning_rate": 2.539929015084295e-06, "loss": 0.9165, "mean_token_accuracy": 0.7598443776369095, "num_tokens": 402934393.0, "step": 4280 }, { "entropy": 1.314503613859415, "epoch": 0.9517998779743746, "grad_norm": 0.546875, "learning_rate": 2.4290150842945875e-06, "loss": 0.9198, "mean_token_accuracy": 0.7572920247912407, "num_tokens": 403881438.0, "step": 4290 }, { "entropy": 1.34530808031559, "epoch": 0.9540185257085806, "grad_norm": 0.55078125, "learning_rate": 2.3181011535048805e-06, "loss": 0.9502, "mean_token_accuracy": 0.7529184207320213, "num_tokens": 404832889.0, "step": 4300 }, { "entropy": 1.3469831585884093, "epoch": 0.9562371734427866, "grad_norm": 0.5390625, "learning_rate": 2.207187222715173e-06, "loss": 0.9485, "mean_token_accuracy": 0.7524568639695645, "num_tokens": 405773210.0, "step": 4310 }, { "entropy": 1.3356608122587204, "epoch": 0.9584558211769926, "grad_norm": 0.52734375, "learning_rate": 2.096273291925466e-06, "loss": 0.943, "mean_token_accuracy": 0.7541289560496807, "num_tokens": 406697781.0, "step": 4320 }, { "entropy": 1.3480161339044572, "epoch": 0.9606744689111987, "grad_norm": 0.51171875, "learning_rate": 1.9853593611357586e-06, "loss": 0.9618, "mean_token_accuracy": 0.7477487847208977, "num_tokens": 407635544.0, "step": 4330 }, { "entropy": 1.3414922960102558, "epoch": 0.9628931166454047, "grad_norm": 0.53125, "learning_rate": 1.8744454303460516e-06, "loss": 0.9485, "mean_token_accuracy": 0.7516260854899883, "num_tokens": 408594342.0, "step": 4340 }, { "entropy": 1.33254055082798, "epoch": 0.9651117643796107, "grad_norm": 0.5390625, "learning_rate": 1.7635314995563443e-06, "loss": 0.9164, "mean_token_accuracy": 0.7584716722369194, "num_tokens": 409518793.0, "step": 4350 }, { "entropy": 1.362374597787857, "epoch": 0.9673304121138167, "grad_norm": 0.5078125, "learning_rate": 1.6526175687666373e-06, "loss": 0.9664, "mean_token_accuracy": 0.7495695851743222, "num_tokens": 410465748.0, "step": 4360 }, { "entropy": 1.355623196810484, "epoch": 0.9695490598480226, "grad_norm": 0.5390625, "learning_rate": 1.54170363797693e-06, "loss": 0.9614, "mean_token_accuracy": 0.7504058249294758, "num_tokens": 411413316.0, "step": 4370 }, { "entropy": 1.3444112464785576, "epoch": 0.9717677075822286, "grad_norm": 0.53515625, "learning_rate": 1.4307897071872228e-06, "loss": 0.9682, "mean_token_accuracy": 0.7514989458024501, "num_tokens": 412367491.0, "step": 4380 }, { "entropy": 1.3571382217109202, "epoch": 0.9739863553164346, "grad_norm": 0.546875, "learning_rate": 1.3198757763975156e-06, "loss": 0.9415, "mean_token_accuracy": 0.75667395144701, "num_tokens": 413306525.0, "step": 4390 }, { "entropy": 1.3180716767907144, "epoch": 0.9762050030506406, "grad_norm": 0.55859375, "learning_rate": 1.2089618456078084e-06, "loss": 0.9439, "mean_token_accuracy": 0.7561846785247326, "num_tokens": 414250494.0, "step": 4400 }, { "entropy": 1.3656005658209325, "epoch": 0.9784236507848466, "grad_norm": 0.53125, "learning_rate": 1.0980479148181013e-06, "loss": 0.9833, "mean_token_accuracy": 0.7456090614199639, "num_tokens": 415199963.0, "step": 4410 }, { "entropy": 1.3268229991197587, "epoch": 0.9806422985190526, "grad_norm": 0.484375, "learning_rate": 9.871339840283939e-07, "loss": 0.9375, "mean_token_accuracy": 0.7558161698281765, "num_tokens": 416170950.0, "step": 4420 }, { "entropy": 1.3259350806474686, "epoch": 0.9828609462532586, "grad_norm": 0.55078125, "learning_rate": 8.762200532386869e-07, "loss": 0.9365, "mean_token_accuracy": 0.7544685363769531, "num_tokens": 417129972.0, "step": 4430 }, { "entropy": 1.3594698533415794, "epoch": 0.9850795939874646, "grad_norm": 0.57421875, "learning_rate": 7.653061224489796e-07, "loss": 0.9744, "mean_token_accuracy": 0.7484218552708626, "num_tokens": 418083653.0, "step": 4440 }, { "entropy": 1.3757464356720448, "epoch": 0.9872982417216707, "grad_norm": 0.58203125, "learning_rate": 6.543921916592724e-07, "loss": 0.9598, "mean_token_accuracy": 0.7515306659042835, "num_tokens": 419023538.0, "step": 4450 }, { "entropy": 1.3545207664370538, "epoch": 0.9895168894558767, "grad_norm": 0.5078125, "learning_rate": 5.434782608695653e-07, "loss": 0.9539, "mean_token_accuracy": 0.753493282943964, "num_tokens": 419968988.0, "step": 4460 }, { "entropy": 1.3401925891637803, "epoch": 0.9917355371900827, "grad_norm": 0.55859375, "learning_rate": 4.3256433007985804e-07, "loss": 0.937, "mean_token_accuracy": 0.753621107339859, "num_tokens": 420897811.0, "step": 4470 }, { "entropy": 1.36095949113369, "epoch": 0.9939541849242887, "grad_norm": 0.52734375, "learning_rate": 3.2165039929015086e-07, "loss": 0.9757, "mean_token_accuracy": 0.749586571007967, "num_tokens": 421848611.0, "step": 4480 }, { "entropy": 1.374735850095749, "epoch": 0.9961728326584947, "grad_norm": 0.53515625, "learning_rate": 2.1073646850044365e-07, "loss": 0.9893, "mean_token_accuracy": 0.7467234946787358, "num_tokens": 422804916.0, "step": 4490 }, { "entropy": 1.4061301365494727, "epoch": 0.9983914803927006, "grad_norm": 0.546875, "learning_rate": 9.982253771073646e-08, "loss": 1.0009, "mean_token_accuracy": 0.7450855560600758, "num_tokens": 423729440.0, "step": 4500 } ], "logging_steps": 10, "max_steps": 4508, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.662706335855149e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }