{ "best_global_step": 5270, "best_metric": 0.29535341262817383, "best_model_checkpoint": "/home/longtail/data/outputs/exaone_7b_lora_rtlcoder_ratio1.0/checkpoint-5270", "epoch": 3.9715470133785566, "eval_steps": 170, "global_step": 5270, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.500390625, "epoch": 0.007537214999057848, "grad_norm": 3.2508912086486816, "learning_rate": 9.000000000000001e-07, "loss": 1.4970951080322266, "mean_token_accuracy": 0.7383653238415718, "num_tokens": 124053.0, "step": 10 }, { "entropy": 0.480322265625, "epoch": 0.015074429998115696, "grad_norm": 2.5751638412475586, "learning_rate": 1.9000000000000002e-06, "loss": 1.4152856826782227, "mean_token_accuracy": 0.7493167400360108, "num_tokens": 260327.0, "step": 20 }, { "entropy": 0.513330078125, "epoch": 0.022611644997173545, "grad_norm": 2.6885225772857666, "learning_rate": 2.9e-06, "loss": 1.3749178886413573, "mean_token_accuracy": 0.7562702834606171, "num_tokens": 382406.0, "step": 30 }, { "entropy": 0.55849609375, "epoch": 0.030148859996231393, "grad_norm": 2.3008334636688232, "learning_rate": 3.900000000000001e-06, "loss": 1.2062281608581542, "mean_token_accuracy": 0.763033090531826, "num_tokens": 505114.0, "step": 40 }, { "entropy": 0.566552734375, "epoch": 0.03768607499528924, "grad_norm": 1.038688063621521, "learning_rate": 4.9000000000000005e-06, "loss": 0.8852876663208008, "mean_token_accuracy": 0.8057842180132866, "num_tokens": 640766.0, "step": 50 }, { "entropy": 0.64345703125, "epoch": 0.04522328999434709, "grad_norm": 0.8166051506996155, "learning_rate": 5.9e-06, "loss": 0.6880127429962158, "mean_token_accuracy": 0.8336978167295456, "num_tokens": 759118.0, "step": 60 }, { "entropy": 0.58603515625, "epoch": 0.052760504993404934, "grad_norm": 0.7374411225318909, "learning_rate": 6.9e-06, "loss": 0.5521659851074219, "mean_token_accuracy": 0.8549367278814316, "num_tokens": 885806.0, "step": 70 }, { "entropy": 0.5080078125, "epoch": 0.060297719992462785, "grad_norm": 0.39635205268859863, "learning_rate": 7.9e-06, "loss": 0.49886331558227537, "mean_token_accuracy": 0.8612601146101951, "num_tokens": 1013663.0, "step": 80 }, { "entropy": 0.452587890625, "epoch": 0.06783493499152063, "grad_norm": 0.40894708037376404, "learning_rate": 8.900000000000001e-06, "loss": 0.4750356197357178, "mean_token_accuracy": 0.8679621189832687, "num_tokens": 1140381.0, "step": 90 }, { "entropy": 0.434814453125, "epoch": 0.07537214999057848, "grad_norm": 0.3433704376220703, "learning_rate": 9.9e-06, "loss": 0.4414645195007324, "mean_token_accuracy": 0.8758952230215072, "num_tokens": 1269277.0, "step": 100 }, { "entropy": 0.425927734375, "epoch": 0.08290936498963633, "grad_norm": 0.3355954587459564, "learning_rate": 1.0900000000000002e-05, "loss": 0.4468825817108154, "mean_token_accuracy": 0.8759026020765305, "num_tokens": 1393833.0, "step": 110 }, { "entropy": 0.4673828125, "epoch": 0.09044657998869418, "grad_norm": 0.3367510437965393, "learning_rate": 1.1900000000000001e-05, "loss": 0.47623600959777834, "mean_token_accuracy": 0.8684576749801636, "num_tokens": 1525283.0, "step": 120 }, { "entropy": 0.43203125, "epoch": 0.09798379498775203, "grad_norm": 0.38895294070243835, "learning_rate": 1.2900000000000002e-05, "loss": 0.4312158107757568, "mean_token_accuracy": 0.8784290611743927, "num_tokens": 1652856.0, "step": 130 }, { "entropy": 0.4258056640625, "epoch": 0.10552100998680987, "grad_norm": 0.3369289040565491, "learning_rate": 1.39e-05, "loss": 0.4163616180419922, "mean_token_accuracy": 0.88214410841465, "num_tokens": 1787576.0, "step": 140 }, { "entropy": 0.419775390625, "epoch": 0.11305822498586772, "grad_norm": 0.34929800033569336, "learning_rate": 1.4900000000000001e-05, "loss": 0.42300877571105955, "mean_token_accuracy": 0.8821998775005341, "num_tokens": 1910866.0, "step": 150 }, { "entropy": 0.422314453125, "epoch": 0.12059543998492557, "grad_norm": 0.34880968928337097, "learning_rate": 1.5900000000000004e-05, "loss": 0.4256776809692383, "mean_token_accuracy": 0.8781016901135444, "num_tokens": 2033937.0, "step": 160 }, { "entropy": 0.390673828125, "epoch": 0.1281326549839834, "grad_norm": 0.30792421102523804, "learning_rate": 1.69e-05, "loss": 0.392413592338562, "mean_token_accuracy": 0.8856923297047615, "num_tokens": 2161669.0, "step": 170 }, { "epoch": 0.1281326549839834, "eval_entropy": 0.40038180064006024, "eval_loss": 0.408536434173584, "eval_mean_token_accuracy": 0.8834756215114191, "eval_num_tokens": 2161669.0, "eval_runtime": 444.9651, "eval_samples_per_second": 5.962, "eval_steps_per_second": 1.492, "step": 170 }, { "entropy": 0.3729248046875, "epoch": 0.13566986998304126, "grad_norm": 0.36590659618377686, "learning_rate": 1.79e-05, "loss": 0.3798275709152222, "mean_token_accuracy": 0.8910293310880661, "num_tokens": 2298812.0, "step": 180 }, { "entropy": 0.398779296875, "epoch": 0.1432070849820991, "grad_norm": 0.37025851011276245, "learning_rate": 1.8900000000000002e-05, "loss": 0.4105966567993164, "mean_token_accuracy": 0.8843188390135766, "num_tokens": 2421990.0, "step": 190 }, { "entropy": 0.3990234375, "epoch": 0.15074429998115696, "grad_norm": 0.38612475991249084, "learning_rate": 1.9900000000000003e-05, "loss": 0.40378603935241697, "mean_token_accuracy": 0.881200622022152, "num_tokens": 2546022.0, "step": 200 }, { "entropy": 0.4103515625, "epoch": 0.1582815149802148, "grad_norm": 0.4074586033821106, "learning_rate": 1.9999903471186634e-05, "loss": 0.42444210052490233, "mean_token_accuracy": 0.8808081805706024, "num_tokens": 2673345.0, "step": 210 }, { "entropy": 0.374658203125, "epoch": 0.16581872997927266, "grad_norm": 0.34897786378860474, "learning_rate": 1.999956979373049e-05, "loss": 0.3861543655395508, "mean_token_accuracy": 0.887491112947464, "num_tokens": 2799859.0, "step": 220 }, { "entropy": 0.391455078125, "epoch": 0.1733559449783305, "grad_norm": 0.38405418395996094, "learning_rate": 1.9998997783868885e-05, "loss": 0.3967418193817139, "mean_token_accuracy": 0.8830995351076126, "num_tokens": 2929096.0, "step": 230 }, { "entropy": 0.392724609375, "epoch": 0.18089315997738836, "grad_norm": 0.4110228717327118, "learning_rate": 1.999818745523526e-05, "loss": 0.39841184616088865, "mean_token_accuracy": 0.8842095598578453, "num_tokens": 3048433.0, "step": 240 }, { "entropy": 0.3698974609375, "epoch": 0.1884303749764462, "grad_norm": 0.4672147035598755, "learning_rate": 1.9997138827143197e-05, "loss": 0.38254082202911377, "mean_token_accuracy": 0.8880651697516442, "num_tokens": 3159277.0, "step": 250 }, { "entropy": 0.390576171875, "epoch": 0.19596758997550406, "grad_norm": 0.4443078339099884, "learning_rate": 1.9995851924585978e-05, "loss": 0.3986587762832642, "mean_token_accuracy": 0.8839748218655586, "num_tokens": 3291698.0, "step": 260 }, { "entropy": 0.360400390625, "epoch": 0.2035048049745619, "grad_norm": 0.46329835057258606, "learning_rate": 1.9994326778235983e-05, "loss": 0.37484548091888426, "mean_token_accuracy": 0.8916234523057938, "num_tokens": 3415688.0, "step": 270 }, { "entropy": 0.3857666015625, "epoch": 0.21104201997361974, "grad_norm": 0.41270825266838074, "learning_rate": 1.9992563424443955e-05, "loss": 0.4022381782531738, "mean_token_accuracy": 0.8860612288117409, "num_tokens": 3541844.0, "step": 280 }, { "entropy": 0.3788330078125, "epoch": 0.2185792349726776, "grad_norm": 0.4354550540447235, "learning_rate": 1.9990561905238136e-05, "loss": 0.39404640197753904, "mean_token_accuracy": 0.8860739976167679, "num_tokens": 3668238.0, "step": 290 }, { "entropy": 0.355810546875, "epoch": 0.22611644997173544, "grad_norm": 0.4367234706878662, "learning_rate": 1.998832226832327e-05, "loss": 0.35446126461029054, "mean_token_accuracy": 0.8932908058166504, "num_tokens": 3791388.0, "step": 300 }, { "entropy": 0.3698974609375, "epoch": 0.2336536649707933, "grad_norm": 0.33177778124809265, "learning_rate": 1.9985844567079452e-05, "loss": 0.3798938512802124, "mean_token_accuracy": 0.890485617518425, "num_tokens": 3918847.0, "step": 310 }, { "entropy": 0.343310546875, "epoch": 0.24119087996985114, "grad_norm": 0.4057367146015167, "learning_rate": 1.998312886056088e-05, "loss": 0.3518209934234619, "mean_token_accuracy": 0.8955762058496475, "num_tokens": 4046508.0, "step": 320 }, { "entropy": 0.3807373046875, "epoch": 0.248728094968909, "grad_norm": 0.42162206768989563, "learning_rate": 1.9980175213494418e-05, "loss": 0.39223556518554686, "mean_token_accuracy": 0.8870018571615219, "num_tokens": 4169257.0, "step": 330 }, { "entropy": 0.374658203125, "epoch": 0.2562653099679668, "grad_norm": 0.4284176826477051, "learning_rate": 1.9976983696278083e-05, "loss": 0.3777692556381226, "mean_token_accuracy": 0.8895119220018387, "num_tokens": 4299468.0, "step": 340 }, { "epoch": 0.2562653099679668, "eval_entropy": 0.35730862904743976, "eval_loss": 0.3676407039165497, "eval_mean_token_accuracy": 0.8923638243093548, "eval_num_tokens": 4299468.0, "eval_runtime": 445.3697, "eval_samples_per_second": 5.957, "eval_steps_per_second": 1.491, "step": 340 }, { "entropy": 0.3595703125, "epoch": 0.26380252496702467, "grad_norm": 0.4121377468109131, "learning_rate": 1.9973554384979343e-05, "loss": 0.373604416847229, "mean_token_accuracy": 0.892127700150013, "num_tokens": 4430546.0, "step": 350 }, { "entropy": 0.3835205078125, "epoch": 0.2713397399660825, "grad_norm": 0.4015622138977051, "learning_rate": 1.9969887361333313e-05, "loss": 0.3918182373046875, "mean_token_accuracy": 0.8868573501706123, "num_tokens": 4554384.0, "step": 360 }, { "entropy": 0.3498046875, "epoch": 0.27887695496514037, "grad_norm": 0.43255379796028137, "learning_rate": 1.996598271274081e-05, "loss": 0.35996294021606445, "mean_token_accuracy": 0.8938629716634751, "num_tokens": 4690486.0, "step": 370 }, { "entropy": 0.3456298828125, "epoch": 0.2864141699641982, "grad_norm": 0.3963714838027954, "learning_rate": 1.9961840532266263e-05, "loss": 0.35376391410827634, "mean_token_accuracy": 0.8946138739585876, "num_tokens": 4814483.0, "step": 380 }, { "entropy": 0.332177734375, "epoch": 0.29395138496325607, "grad_norm": 0.3841065764427185, "learning_rate": 1.9957460918635513e-05, "loss": 0.34462361335754393, "mean_token_accuracy": 0.897958156466484, "num_tokens": 4940434.0, "step": 390 }, { "entropy": 0.361767578125, "epoch": 0.3014885999623139, "grad_norm": 0.4300925135612488, "learning_rate": 1.9952843976233428e-05, "loss": 0.36802771091461184, "mean_token_accuracy": 0.8923172727227211, "num_tokens": 5068544.0, "step": 400 }, { "entropy": 0.3556640625, "epoch": 0.30902581496137177, "grad_norm": 0.42255330085754395, "learning_rate": 1.9947989815101444e-05, "loss": 0.36620967388153075, "mean_token_accuracy": 0.8925080612301827, "num_tokens": 5181729.0, "step": 410 }, { "entropy": 0.3381591796875, "epoch": 0.3165630299604296, "grad_norm": 0.3419656753540039, "learning_rate": 1.9942898550934928e-05, "loss": 0.3503819465637207, "mean_token_accuracy": 0.8954922616481781, "num_tokens": 5306748.0, "step": 420 }, { "entropy": 0.3394287109375, "epoch": 0.32410024495948747, "grad_norm": 0.3902963101863861, "learning_rate": 1.9937570305080422e-05, "loss": 0.3475761651992798, "mean_token_accuracy": 0.8975138142704964, "num_tokens": 5438366.0, "step": 430 }, { "entropy": 0.3736083984375, "epoch": 0.3316374599585453, "grad_norm": 0.38104942440986633, "learning_rate": 1.9932005204532756e-05, "loss": 0.38853695392608645, "mean_token_accuracy": 0.889219282567501, "num_tokens": 5576392.0, "step": 440 }, { "entropy": 0.3273193359375, "epoch": 0.3391746749576032, "grad_norm": 0.35075074434280396, "learning_rate": 1.9926203381932015e-05, "loss": 0.33571979999542234, "mean_token_accuracy": 0.8994953021407127, "num_tokens": 5701170.0, "step": 450 }, { "entropy": 0.3619873046875, "epoch": 0.346711889956661, "grad_norm": 0.34510132670402527, "learning_rate": 1.9920164975560386e-05, "loss": 0.37769622802734376, "mean_token_accuracy": 0.8914814174175263, "num_tokens": 5834397.0, "step": 460 }, { "entropy": 0.37041015625, "epoch": 0.3542491049557189, "grad_norm": 0.3143845796585083, "learning_rate": 1.9913890129338846e-05, "loss": 0.3819720268249512, "mean_token_accuracy": 0.891846376657486, "num_tokens": 5969370.0, "step": 470 }, { "entropy": 0.348388671875, "epoch": 0.3617863199547767, "grad_norm": 0.4210856556892395, "learning_rate": 1.9907378992823755e-05, "loss": 0.36168179512023924, "mean_token_accuracy": 0.8931615963578224, "num_tokens": 6086183.0, "step": 480 }, { "entropy": 0.33388671875, "epoch": 0.3693235349538346, "grad_norm": 0.3834077715873718, "learning_rate": 1.9900631721203264e-05, "loss": 0.3554360866546631, "mean_token_accuracy": 0.8969168856739997, "num_tokens": 6209383.0, "step": 490 }, { "entropy": 0.3376953125, "epoch": 0.3768607499528924, "grad_norm": 0.3776184320449829, "learning_rate": 1.9893648475293646e-05, "loss": 0.35178580284118655, "mean_token_accuracy": 0.8986482962965965, "num_tokens": 6339234.0, "step": 500 }, { "entropy": 0.359765625, "epoch": 0.3843979649519503, "grad_norm": 0.3891402781009674, "learning_rate": 1.988642942153544e-05, "loss": 0.3677093982696533, "mean_token_accuracy": 0.895267216861248, "num_tokens": 6467113.0, "step": 510 }, { "epoch": 0.3843979649519503, "eval_entropy": 0.3330872317394578, "eval_loss": 0.3505273461341858, "eval_mean_token_accuracy": 0.8962113052067986, "eval_num_tokens": 6467113.0, "eval_runtime": 444.8495, "eval_samples_per_second": 5.964, "eval_steps_per_second": 1.493, "step": 510 }, { "entropy": 0.3333984375, "epoch": 0.39193517995100813, "grad_norm": 0.43438854813575745, "learning_rate": 1.9878974731989487e-05, "loss": 0.3478308439254761, "mean_token_accuracy": 0.8962388306856155, "num_tokens": 6583985.0, "step": 520 }, { "entropy": 0.35859375, "epoch": 0.3994723949500659, "grad_norm": 0.4000532031059265, "learning_rate": 1.9871284584332845e-05, "loss": 0.3833730697631836, "mean_token_accuracy": 0.8913498848676682, "num_tokens": 6708069.0, "step": 530 }, { "entropy": 0.33818359375, "epoch": 0.4070096099491238, "grad_norm": 0.45075827836990356, "learning_rate": 1.986335916185454e-05, "loss": 0.3408809661865234, "mean_token_accuracy": 0.8979726910591126, "num_tokens": 6834235.0, "step": 540 }, { "entropy": 0.356494140625, "epoch": 0.4145468249481816, "grad_norm": 0.3909159004688263, "learning_rate": 1.9855198653451194e-05, "loss": 0.36372694969177244, "mean_token_accuracy": 0.8921904131770134, "num_tokens": 6972729.0, "step": 550 }, { "entropy": 0.340576171875, "epoch": 0.4220840399472395, "grad_norm": 0.34595179557800293, "learning_rate": 1.9846803253622535e-05, "loss": 0.35205156803131105, "mean_token_accuracy": 0.8962323024868966, "num_tokens": 7105522.0, "step": 560 }, { "entropy": 0.3424072265625, "epoch": 0.4296212549462973, "grad_norm": 0.48934608697891235, "learning_rate": 1.983817316246676e-05, "loss": 0.35395040512084963, "mean_token_accuracy": 0.8971632197499275, "num_tokens": 7226248.0, "step": 570 }, { "entropy": 0.31986083984375, "epoch": 0.4371584699453552, "grad_norm": 0.4124310612678528, "learning_rate": 1.9829308585675746e-05, "loss": 0.33618412017822263, "mean_token_accuracy": 0.8994600489735604, "num_tokens": 7348054.0, "step": 580 }, { "entropy": 0.3430908203125, "epoch": 0.444695684944413, "grad_norm": 0.3382546901702881, "learning_rate": 1.9820209734530185e-05, "loss": 0.35527355670928956, "mean_token_accuracy": 0.8949465349316597, "num_tokens": 7467342.0, "step": 590 }, { "entropy": 0.3464599609375, "epoch": 0.4522328999434709, "grad_norm": 0.4934978783130646, "learning_rate": 1.981087682589451e-05, "loss": 0.3549240827560425, "mean_token_accuracy": 0.8943406358361244, "num_tokens": 7592366.0, "step": 600 }, { "entropy": 0.33681640625, "epoch": 0.45977011494252873, "grad_norm": 0.4190860986709595, "learning_rate": 1.9801310082211748e-05, "loss": 0.3477961540222168, "mean_token_accuracy": 0.8963608622550965, "num_tokens": 7718744.0, "step": 610 }, { "entropy": 0.32294921875, "epoch": 0.4673073299415866, "grad_norm": 0.4096807539463043, "learning_rate": 1.9791509731498205e-05, "loss": 0.33289148807525637, "mean_token_accuracy": 0.8992252185940742, "num_tokens": 7835764.0, "step": 620 }, { "entropy": 0.3320068359375, "epoch": 0.47484454494064443, "grad_norm": 0.45555874705314636, "learning_rate": 1.9781476007338058e-05, "loss": 0.34081387519836426, "mean_token_accuracy": 0.8964440226554871, "num_tokens": 7965749.0, "step": 630 }, { "entropy": 0.3408935546875, "epoch": 0.4823817599397023, "grad_norm": 0.3963310718536377, "learning_rate": 1.977120914887775e-05, "loss": 0.3597146272659302, "mean_token_accuracy": 0.8958937346935272, "num_tokens": 8088365.0, "step": 640 }, { "entropy": 0.37021484375, "epoch": 0.48991897493876013, "grad_norm": 0.365715891122818, "learning_rate": 1.9760709400820314e-05, "loss": 0.3843697547912598, "mean_token_accuracy": 0.8901895850896835, "num_tokens": 8229867.0, "step": 650 }, { "entropy": 0.3655029296875, "epoch": 0.497456189937818, "grad_norm": 0.4006253778934479, "learning_rate": 1.9749977013419536e-05, "loss": 0.37570044994354246, "mean_token_accuracy": 0.8904815658926963, "num_tokens": 8357858.0, "step": 660 }, { "entropy": 0.3462890625, "epoch": 0.5049934049368758, "grad_norm": 0.3711676299571991, "learning_rate": 1.9739012242474e-05, "loss": 0.3505732297897339, "mean_token_accuracy": 0.8968447670340538, "num_tokens": 8491784.0, "step": 670 }, { "entropy": 0.3403564453125, "epoch": 0.5125306199359336, "grad_norm": 0.432271808385849, "learning_rate": 1.9727815349320964e-05, "loss": 0.35620846748352053, "mean_token_accuracy": 0.8953040033578873, "num_tokens": 8613675.0, "step": 680 }, { "epoch": 0.5125306199359336, "eval_entropy": 0.3416262707078313, "eval_loss": 0.3412366807460785, "eval_mean_token_accuracy": 0.8980938759912928, "eval_num_tokens": 8613675.0, "eval_runtime": 445.2361, "eval_samples_per_second": 5.959, "eval_steps_per_second": 1.491, "step": 680 }, { "entropy": 0.3375244140625, "epoch": 0.5200678349349915, "grad_norm": 0.39377152919769287, "learning_rate": 1.971638660083016e-05, "loss": 0.3446618318557739, "mean_token_accuracy": 0.8973624289035798, "num_tokens": 8734967.0, "step": 690 }, { "entropy": 0.380859375, "epoch": 0.5276050499340493, "grad_norm": 0.3425155282020569, "learning_rate": 1.970472626939742e-05, "loss": 0.3928657293319702, "mean_token_accuracy": 0.8857068896293641, "num_tokens": 8866789.0, "step": 700 }, { "entropy": 0.3181884765625, "epoch": 0.5351422649331072, "grad_norm": 0.39210009574890137, "learning_rate": 1.969283463293818e-05, "loss": 0.3279300928115845, "mean_token_accuracy": 0.901725186407566, "num_tokens": 8989637.0, "step": 710 }, { "entropy": 0.3260986328125, "epoch": 0.542679479932165, "grad_norm": 0.36499711871147156, "learning_rate": 1.9680711974880868e-05, "loss": 0.3395835399627686, "mean_token_accuracy": 0.8985119208693504, "num_tokens": 9107079.0, "step": 720 }, { "entropy": 0.3133056640625, "epoch": 0.5502166949312229, "grad_norm": 0.3930191099643707, "learning_rate": 1.9668358584160136e-05, "loss": 0.3265484094619751, "mean_token_accuracy": 0.9016185060143471, "num_tokens": 9227783.0, "step": 730 }, { "entropy": 0.340673828125, "epoch": 0.5577539099302807, "grad_norm": 0.3877074122428894, "learning_rate": 1.965577475520999e-05, "loss": 0.34572837352752683, "mean_token_accuracy": 0.8980929121375084, "num_tokens": 9352288.0, "step": 740 }, { "entropy": 0.3293212890625, "epoch": 0.5652911249293386, "grad_norm": 0.3847011625766754, "learning_rate": 1.964296078795675e-05, "loss": 0.33631391525268556, "mean_token_accuracy": 0.8981146275997162, "num_tokens": 9475875.0, "step": 750 }, { "entropy": 0.3515380859375, "epoch": 0.5728283399283964, "grad_norm": 0.3962864577770233, "learning_rate": 1.9629916987811924e-05, "loss": 0.3633269309997559, "mean_token_accuracy": 0.8934466958045959, "num_tokens": 9601762.0, "step": 760 }, { "entropy": 0.31484375, "epoch": 0.5803655549274543, "grad_norm": 0.3556186556816101, "learning_rate": 1.961664366566491e-05, "loss": 0.3226339101791382, "mean_token_accuracy": 0.9032136023044586, "num_tokens": 9729416.0, "step": 770 }, { "entropy": 0.34990234375, "epoch": 0.5879027699265121, "grad_norm": 0.3913438618183136, "learning_rate": 1.9603141137875596e-05, "loss": 0.358534836769104, "mean_token_accuracy": 0.8945465311408043, "num_tokens": 9862899.0, "step": 780 }, { "entropy": 0.343603515625, "epoch": 0.59543998492557, "grad_norm": 0.39869415760040283, "learning_rate": 1.9589409726266822e-05, "loss": 0.3582808494567871, "mean_token_accuracy": 0.8956417754292488, "num_tokens": 9990936.0, "step": 790 }, { "entropy": 0.3222900390625, "epoch": 0.6029771999246278, "grad_norm": 0.46191906929016113, "learning_rate": 1.9575449758116703e-05, "loss": 0.32662172317504884, "mean_token_accuracy": 0.9030146107077599, "num_tokens": 10124909.0, "step": 800 }, { "entropy": 0.3161376953125, "epoch": 0.6105144149236857, "grad_norm": 0.35114115476608276, "learning_rate": 1.956126156615083e-05, "loss": 0.3295163631439209, "mean_token_accuracy": 0.8997720777988434, "num_tokens": 10252655.0, "step": 810 }, { "entropy": 0.335595703125, "epoch": 0.6180516299227435, "grad_norm": 0.435343861579895, "learning_rate": 1.9546845488534347e-05, "loss": 0.34328203201293944, "mean_token_accuracy": 0.8988629937171936, "num_tokens": 10378988.0, "step": 820 }, { "entropy": 0.329248046875, "epoch": 0.6255888449218014, "grad_norm": 0.3690928518772125, "learning_rate": 1.953220186886388e-05, "loss": 0.3510568380355835, "mean_token_accuracy": 0.897222849726677, "num_tokens": 10503801.0, "step": 830 }, { "entropy": 0.325, "epoch": 0.6331260599208592, "grad_norm": 0.33731427788734436, "learning_rate": 1.9517331056159353e-05, "loss": 0.3301519870758057, "mean_token_accuracy": 0.9016004085540772, "num_tokens": 10632605.0, "step": 840 }, { "entropy": 0.3230224609375, "epoch": 0.640663274919917, "grad_norm": 0.3374157249927521, "learning_rate": 1.9502233404855672e-05, "loss": 0.335455584526062, "mean_token_accuracy": 0.8995656460523606, "num_tokens": 10758290.0, "step": 850 }, { "epoch": 0.640663274919917, "eval_entropy": 0.32338926016566266, "eval_loss": 0.33324772119522095, "eval_mean_token_accuracy": 0.8999460333262581, "eval_num_tokens": 10758290.0, "eval_runtime": 445.1709, "eval_samples_per_second": 5.96, "eval_steps_per_second": 1.492, "step": 850 }, { "entropy": 0.3327880859375, "epoch": 0.6482004899189749, "grad_norm": 0.3995136320590973, "learning_rate": 1.948690927479427e-05, "loss": 0.34148826599121096, "mean_token_accuracy": 0.898120503127575, "num_tokens": 10884739.0, "step": 860 }, { "entropy": 0.3158203125, "epoch": 0.6557377049180327, "grad_norm": 0.49846041202545166, "learning_rate": 1.9471359031214535e-05, "loss": 0.3240156412124634, "mean_token_accuracy": 0.9004231512546539, "num_tokens": 11008100.0, "step": 870 }, { "entropy": 0.312646484375, "epoch": 0.6632749199170906, "grad_norm": 0.42257261276245117, "learning_rate": 1.945558304474512e-05, "loss": 0.3160678863525391, "mean_token_accuracy": 0.9045681983232499, "num_tokens": 11129110.0, "step": 880 }, { "entropy": 0.319189453125, "epoch": 0.6708121349161484, "grad_norm": 0.36973708868026733, "learning_rate": 1.943958169139507e-05, "loss": 0.3275951623916626, "mean_token_accuracy": 0.9003831461071968, "num_tokens": 11258786.0, "step": 890 }, { "entropy": 0.311572265625, "epoch": 0.6783493499152063, "grad_norm": 0.3653687834739685, "learning_rate": 1.9423355352544896e-05, "loss": 0.31893162727355956, "mean_token_accuracy": 0.9011349901556969, "num_tokens": 11370930.0, "step": 900 }, { "entropy": 0.3440673828125, "epoch": 0.6858865649142641, "grad_norm": 0.39143797755241394, "learning_rate": 1.940690441493748e-05, "loss": 0.3578460693359375, "mean_token_accuracy": 0.8946596220135689, "num_tokens": 11504972.0, "step": 910 }, { "entropy": 0.3222412109375, "epoch": 0.693423779913322, "grad_norm": 0.33701032400131226, "learning_rate": 1.939022927066884e-05, "loss": 0.3248148441314697, "mean_token_accuracy": 0.9022357478737831, "num_tokens": 11646947.0, "step": 920 }, { "entropy": 0.345849609375, "epoch": 0.7009609949123798, "grad_norm": 0.43142688274383545, "learning_rate": 1.9373330317178797e-05, "loss": 0.3588585615158081, "mean_token_accuracy": 0.8931220710277558, "num_tokens": 11768199.0, "step": 930 }, { "entropy": 0.34091796875, "epoch": 0.7084982099114377, "grad_norm": 0.36513519287109375, "learning_rate": 1.93562079572415e-05, "loss": 0.34344265460968015, "mean_token_accuracy": 0.8979562237858772, "num_tokens": 11890508.0, "step": 940 }, { "entropy": 0.3333984375, "epoch": 0.7160354249104955, "grad_norm": 0.41007548570632935, "learning_rate": 1.9338862598955833e-05, "loss": 0.34928805828094484, "mean_token_accuracy": 0.8953282848000527, "num_tokens": 12021587.0, "step": 950 }, { "entropy": 0.3439208984375, "epoch": 0.7235726399095535, "grad_norm": 0.44236838817596436, "learning_rate": 1.932129465573568e-05, "loss": 0.34870595932006837, "mean_token_accuracy": 0.8960365921258926, "num_tokens": 12143730.0, "step": 960 }, { "entropy": 0.3028564453125, "epoch": 0.7311098549086112, "grad_norm": 0.4242440164089203, "learning_rate": 1.9303504546300066e-05, "loss": 0.31922686100006104, "mean_token_accuracy": 0.9043222770094872, "num_tokens": 12271951.0, "step": 970 }, { "entropy": 0.31630859375, "epoch": 0.7386470699076692, "grad_norm": 0.4041174352169037, "learning_rate": 1.928549269466319e-05, "loss": 0.31934442520141604, "mean_token_accuracy": 0.9024053528904915, "num_tokens": 12391649.0, "step": 980 }, { "entropy": 0.300537109375, "epoch": 0.746184284906727, "grad_norm": 0.36280640959739685, "learning_rate": 1.9267259530124317e-05, "loss": 0.30955698490142824, "mean_token_accuracy": 0.9053523823618889, "num_tokens": 12515972.0, "step": 990 }, { "entropy": 0.3237060546875, "epoch": 0.7537214999057849, "grad_norm": 0.35504451394081116, "learning_rate": 1.9248805487257537e-05, "loss": 0.3321828842163086, "mean_token_accuracy": 0.8994348689913749, "num_tokens": 12638350.0, "step": 1000 }, { "entropy": 0.3082275390625, "epoch": 0.7612587149048426, "grad_norm": 0.3824400305747986, "learning_rate": 1.9230131005901413e-05, "loss": 0.3234311580657959, "mean_token_accuracy": 0.9044092565774917, "num_tokens": 12772460.0, "step": 1010 }, { "entropy": 0.3014404296875, "epoch": 0.7687959299039006, "grad_norm": 0.32694560289382935, "learning_rate": 1.92112365311485e-05, "loss": 0.3027196884155273, "mean_token_accuracy": 0.9065699726343155, "num_tokens": 12915477.0, "step": 1020 }, { "epoch": 0.7687959299039006, "eval_entropy": 0.3172269154743976, "eval_loss": 0.32759496569633484, "eval_mean_token_accuracy": 0.900975513978895, "eval_num_tokens": 12915477.0, "eval_runtime": 445.4607, "eval_samples_per_second": 5.956, "eval_steps_per_second": 1.491, "step": 1020 }, { "entropy": 0.3295166015625, "epoch": 0.7763331449029583, "grad_norm": 0.39178362488746643, "learning_rate": 1.9192122513334742e-05, "loss": 0.338738226890564, "mean_token_accuracy": 0.8980937018990517, "num_tokens": 13044310.0, "step": 1030 }, { "entropy": 0.3359375, "epoch": 0.7838703599020163, "grad_norm": 0.45059332251548767, "learning_rate": 1.917278940802871e-05, "loss": 0.3519278049468994, "mean_token_accuracy": 0.8944015249609947, "num_tokens": 13167032.0, "step": 1040 }, { "entropy": 0.3169189453125, "epoch": 0.791407574901074, "grad_norm": 0.43569517135620117, "learning_rate": 1.9153237676020783e-05, "loss": 0.32522382736206057, "mean_token_accuracy": 0.9009502604603767, "num_tokens": 13289712.0, "step": 1050 }, { "entropy": 0.308447265625, "epoch": 0.7989447899001318, "grad_norm": 0.3533364236354828, "learning_rate": 1.9133467783312135e-05, "loss": 0.31727802753448486, "mean_token_accuracy": 0.9029386058449745, "num_tokens": 13408540.0, "step": 1060 }, { "entropy": 0.284033203125, "epoch": 0.8064820048991898, "grad_norm": 0.3339077830314636, "learning_rate": 1.9113480201103658e-05, "loss": 0.28868808746337893, "mean_token_accuracy": 0.9101893961429596, "num_tokens": 13531603.0, "step": 1070 }, { "entropy": 0.3197265625, "epoch": 0.8140192198982475, "grad_norm": 0.49363258481025696, "learning_rate": 1.9093275405784686e-05, "loss": 0.32742924690246583, "mean_token_accuracy": 0.9000251770019532, "num_tokens": 13644481.0, "step": 1080 }, { "entropy": 0.3171630859375, "epoch": 0.8215564348973055, "grad_norm": 0.34514543414115906, "learning_rate": 1.9072853878921698e-05, "loss": 0.3292176008224487, "mean_token_accuracy": 0.9016644075512886, "num_tokens": 13779842.0, "step": 1090 }, { "entropy": 0.3384521484375, "epoch": 0.8290936498963632, "grad_norm": 0.3689023554325104, "learning_rate": 1.9052216107246786e-05, "loss": 0.35496888160705564, "mean_token_accuracy": 0.896573556959629, "num_tokens": 13915594.0, "step": 1100 }, { "entropy": 0.31826171875, "epoch": 0.8366308648954212, "grad_norm": 0.429788738489151, "learning_rate": 1.903136258264609e-05, "loss": 0.3248345375061035, "mean_token_accuracy": 0.9002579048275947, "num_tokens": 14042862.0, "step": 1110 }, { "entropy": 0.32587890625, "epoch": 0.844168079894479, "grad_norm": 0.3493012487888336, "learning_rate": 1.901029380214806e-05, "loss": 0.33571810722351075, "mean_token_accuracy": 0.8995957180857659, "num_tokens": 14171903.0, "step": 1120 }, { "entropy": 0.3212890625, "epoch": 0.8517052948935369, "grad_norm": 0.3966390788555145, "learning_rate": 1.8989010267911613e-05, "loss": 0.32640881538391114, "mean_token_accuracy": 0.9010836943984032, "num_tokens": 14307045.0, "step": 1130 }, { "entropy": 0.3130126953125, "epoch": 0.8592425098925947, "grad_norm": 0.38989686965942383, "learning_rate": 1.8967512487214165e-05, "loss": 0.3198718070983887, "mean_token_accuracy": 0.9039800494909287, "num_tokens": 14446367.0, "step": 1140 }, { "entropy": 0.3095703125, "epoch": 0.8667797248916526, "grad_norm": 0.42321473360061646, "learning_rate": 1.894580097243954e-05, "loss": 0.30954005718231203, "mean_token_accuracy": 0.9031733021140098, "num_tokens": 14570222.0, "step": 1150 }, { "entropy": 0.309814453125, "epoch": 0.8743169398907104, "grad_norm": 0.3035660684108734, "learning_rate": 1.8923876241065747e-05, "loss": 0.3227293252944946, "mean_token_accuracy": 0.9051610559225083, "num_tokens": 14710023.0, "step": 1160 }, { "entropy": 0.297412109375, "epoch": 0.8818541548897683, "grad_norm": 0.3944414258003235, "learning_rate": 1.890173881565267e-05, "loss": 0.31080548763275145, "mean_token_accuracy": 0.9057466745376587, "num_tokens": 14840957.0, "step": 1170 }, { "entropy": 0.300244140625, "epoch": 0.889391369888826, "grad_norm": 0.42378875613212585, "learning_rate": 1.8879389223829592e-05, "loss": 0.30106220245361326, "mean_token_accuracy": 0.904910996556282, "num_tokens": 14960231.0, "step": 1180 }, { "entropy": 0.3187255859375, "epoch": 0.896928584887884, "grad_norm": 0.4092881381511688, "learning_rate": 1.8856827998282622e-05, "loss": 0.33903799057006834, "mean_token_accuracy": 0.9004707217216492, "num_tokens": 15082392.0, "step": 1190 }, { "epoch": 0.896928584887884, "eval_entropy": 0.3203551510730422, "eval_loss": 0.3233819901943207, "eval_mean_token_accuracy": 0.9019732332552772, "eval_num_tokens": 15082392.0, "eval_runtime": 445.1, "eval_samples_per_second": 5.96, "eval_steps_per_second": 1.492, "step": 1190 }, { "entropy": 0.292822265625, "epoch": 0.9044657998869418, "grad_norm": 0.36644798517227173, "learning_rate": 1.8834055676742018e-05, "loss": 0.29460992813110354, "mean_token_accuracy": 0.9084796339273453, "num_tokens": 15212983.0, "step": 1200 }, { "entropy": 0.3179931640625, "epoch": 0.9120030148859997, "grad_norm": 0.3994215130805969, "learning_rate": 1.8811072801969338e-05, "loss": 0.33203489780426027, "mean_token_accuracy": 0.8998118698596954, "num_tokens": 15348661.0, "step": 1210 }, { "entropy": 0.3119140625, "epoch": 0.9195402298850575, "grad_norm": 0.4053172469139099, "learning_rate": 1.878787992174454e-05, "loss": 0.32895455360412595, "mean_token_accuracy": 0.9015865311026573, "num_tokens": 15471160.0, "step": 1220 }, { "entropy": 0.3383544921875, "epoch": 0.9270774448841154, "grad_norm": 0.44813165068626404, "learning_rate": 1.876447758885289e-05, "loss": 0.33706986904144287, "mean_token_accuracy": 0.89834313839674, "num_tokens": 15603058.0, "step": 1230 }, { "entropy": 0.307568359375, "epoch": 0.9346146598831732, "grad_norm": 0.3789234757423401, "learning_rate": 1.8740866361071818e-05, "loss": 0.3279023408889771, "mean_token_accuracy": 0.9016483277082443, "num_tokens": 15734640.0, "step": 1240 }, { "entropy": 0.333056640625, "epoch": 0.9421518748822311, "grad_norm": 0.38480523228645325, "learning_rate": 1.8717046801157602e-05, "loss": 0.3306466817855835, "mean_token_accuracy": 0.8975656688213348, "num_tokens": 15853167.0, "step": 1250 }, { "entropy": 0.315673828125, "epoch": 0.9496890898812889, "grad_norm": 0.3715457618236542, "learning_rate": 1.869301947683197e-05, "loss": 0.3402095317840576, "mean_token_accuracy": 0.8996288001537323, "num_tokens": 15983692.0, "step": 1260 }, { "entropy": 0.3170654296875, "epoch": 0.9572263048803467, "grad_norm": 0.40626004338264465, "learning_rate": 1.866878496076856e-05, "loss": 0.32470359802246096, "mean_token_accuracy": 0.9029552206397057, "num_tokens": 16100297.0, "step": 1270 }, { "entropy": 0.301513671875, "epoch": 0.9647635198794046, "grad_norm": 0.40940678119659424, "learning_rate": 1.864434383057927e-05, "loss": 0.31711864471435547, "mean_token_accuracy": 0.9059911221265793, "num_tokens": 16228135.0, "step": 1280 }, { "entropy": 0.331494140625, "epoch": 0.9723007348784624, "grad_norm": 0.3918750286102295, "learning_rate": 1.8619696668800494e-05, "loss": 0.3397138833999634, "mean_token_accuracy": 0.8966664358973503, "num_tokens": 16358644.0, "step": 1290 }, { "entropy": 0.30888671875, "epoch": 0.9798379498775203, "grad_norm": 0.35955581068992615, "learning_rate": 1.8594844062879244e-05, "loss": 0.3226014614105225, "mean_token_accuracy": 0.9042733535170555, "num_tokens": 16485152.0, "step": 1300 }, { "entropy": 0.3216064453125, "epoch": 0.9873751648765781, "grad_norm": 0.3783910572528839, "learning_rate": 1.8569786605159133e-05, "loss": 0.3362764358520508, "mean_token_accuracy": 0.8991301536560059, "num_tokens": 16604827.0, "step": 1310 }, { "entropy": 0.317529296875, "epoch": 0.994912379875636, "grad_norm": 0.32068535685539246, "learning_rate": 1.8544524892866277e-05, "loss": 0.32965884208679197, "mean_token_accuracy": 0.9012513026595116, "num_tokens": 16740803.0, "step": 1320 }, { "entropy": 0.3245442708333333, "epoch": 1.0022611644997172, "grad_norm": 0.3632865250110626, "learning_rate": 1.8519059528095042e-05, "loss": 0.33621630668640134, "mean_token_accuracy": 0.9006370382431226, "num_tokens": 16856855.0, "step": 1330 }, { "entropy": 0.283056640625, "epoch": 1.0097983794987753, "grad_norm": 0.46613505482673645, "learning_rate": 1.84933911177937e-05, "loss": 0.28250281810760497, "mean_token_accuracy": 0.9116494670510292, "num_tokens": 16975649.0, "step": 1340 }, { "entropy": 0.278125, "epoch": 1.017335594497833, "grad_norm": 0.36128926277160645, "learning_rate": 1.8467520273749976e-05, "loss": 0.29456756114959715, "mean_token_accuracy": 0.9097805410623551, "num_tokens": 17101024.0, "step": 1350 }, { "entropy": 0.3016357421875, "epoch": 1.0248728094968909, "grad_norm": 0.4207335412502289, "learning_rate": 1.8441447612576438e-05, "loss": 0.3014190673828125, "mean_token_accuracy": 0.9071466863155365, "num_tokens": 17230628.0, "step": 1360 }, { "epoch": 1.0248728094968909, "eval_entropy": 0.2955366387424699, "eval_loss": 0.32009029388427734, "eval_mean_token_accuracy": 0.9035842050629926, "eval_num_tokens": 17230628.0, "eval_runtime": 444.9145, "eval_samples_per_second": 5.963, "eval_steps_per_second": 1.492, "step": 1360 }, { "entropy": 0.30123291015625, "epoch": 1.0324100244959487, "grad_norm": 0.40995725989341736, "learning_rate": 1.841517375569583e-05, "loss": 0.30909392833709715, "mean_token_accuracy": 0.9055786192417145, "num_tokens": 17352049.0, "step": 1370 }, { "entropy": 0.3074951171875, "epoch": 1.0399472394950067, "grad_norm": 0.36840590834617615, "learning_rate": 1.8388699329326237e-05, "loss": 0.31580018997192383, "mean_token_accuracy": 0.9033578932285309, "num_tokens": 17479720.0, "step": 1380 }, { "entropy": 0.2889404296875, "epoch": 1.0474844544940645, "grad_norm": 0.39798107743263245, "learning_rate": 1.8362024964466185e-05, "loss": 0.30143420696258544, "mean_token_accuracy": 0.9072484865784645, "num_tokens": 17602320.0, "step": 1390 }, { "entropy": 0.2903564453125, "epoch": 1.0550216694931223, "grad_norm": 0.36563146114349365, "learning_rate": 1.8335151296879576e-05, "loss": 0.2945702075958252, "mean_token_accuracy": 0.9097679927945137, "num_tokens": 17732035.0, "step": 1400 }, { "entropy": 0.2938720703125, "epoch": 1.06255888449218, "grad_norm": 0.3827485740184784, "learning_rate": 1.8308078967080547e-05, "loss": 0.3062156915664673, "mean_token_accuracy": 0.9074965313076973, "num_tokens": 17858692.0, "step": 1410 }, { "entropy": 0.293212890625, "epoch": 1.070096099491238, "grad_norm": 0.3732523024082184, "learning_rate": 1.8280808620318207e-05, "loss": 0.29337191581726074, "mean_token_accuracy": 0.908596222102642, "num_tokens": 17980887.0, "step": 1420 }, { "entropy": 0.3029052734375, "epoch": 1.0776333144902959, "grad_norm": 0.34282541275024414, "learning_rate": 1.8253340906561257e-05, "loss": 0.31957981586456297, "mean_token_accuracy": 0.9054985359311104, "num_tokens": 18118746.0, "step": 1430 }, { "entropy": 0.306103515625, "epoch": 1.0851705294893537, "grad_norm": 0.4450572729110718, "learning_rate": 1.8225676480482484e-05, "loss": 0.3173269033432007, "mean_token_accuracy": 0.905036324262619, "num_tokens": 18242535.0, "step": 1440 }, { "entropy": 0.3273193359375, "epoch": 1.0927077444884115, "grad_norm": 0.37454572319984436, "learning_rate": 1.819781600144318e-05, "loss": 0.339494514465332, "mean_token_accuracy": 0.8988345369696618, "num_tokens": 18369940.0, "step": 1450 }, { "entropy": 0.2994873046875, "epoch": 1.1002449594874695, "grad_norm": 0.39925429224967957, "learning_rate": 1.8169760133477404e-05, "loss": 0.3085808277130127, "mean_token_accuracy": 0.9062377795577049, "num_tokens": 18510860.0, "step": 1460 }, { "entropy": 0.3177734375, "epoch": 1.1077821744865273, "grad_norm": 0.3473636209964752, "learning_rate": 1.814150954527618e-05, "loss": 0.33002748489379885, "mean_token_accuracy": 0.9014916539192199, "num_tokens": 18637891.0, "step": 1470 }, { "entropy": 0.2923583984375, "epoch": 1.115319389485585, "grad_norm": 0.41963300108909607, "learning_rate": 1.8113064910171538e-05, "loss": 0.30164639949798583, "mean_token_accuracy": 0.9075041651725769, "num_tokens": 18762929.0, "step": 1480 }, { "entropy": 0.304736328125, "epoch": 1.1228566044846429, "grad_norm": 0.4134460985660553, "learning_rate": 1.8084426906120472e-05, "loss": 0.312406063079834, "mean_token_accuracy": 0.9049404874444008, "num_tokens": 18885165.0, "step": 1490 }, { "entropy": 0.2976318359375, "epoch": 1.1303938194837007, "grad_norm": 0.44191214442253113, "learning_rate": 1.8055596215688788e-05, "loss": 0.3146297693252563, "mean_token_accuracy": 0.9052109360694885, "num_tokens": 19003706.0, "step": 1500 }, { "entropy": 0.27841796875, "epoch": 1.1379310344827587, "grad_norm": 0.43751654028892517, "learning_rate": 1.802657352603483e-05, "loss": 0.28258237838745115, "mean_token_accuracy": 0.9103972479701042, "num_tokens": 19129867.0, "step": 1510 }, { "entropy": 0.3037841796875, "epoch": 1.1454682494818165, "grad_norm": 0.4770371913909912, "learning_rate": 1.7997359528893098e-05, "loss": 0.31419939994812013, "mean_token_accuracy": 0.9043475434184074, "num_tokens": 19245782.0, "step": 1520 }, { "entropy": 0.3114501953125, "epoch": 1.1530054644808743, "grad_norm": 0.40218523144721985, "learning_rate": 1.7967954920557768e-05, "loss": 0.3275810956954956, "mean_token_accuracy": 0.9032333821058274, "num_tokens": 19375196.0, "step": 1530 }, { "epoch": 1.1530054644808743, "eval_entropy": 0.30540668533509036, "eval_loss": 0.31701526045799255, "eval_mean_token_accuracy": 0.9038175200841513, "eval_num_tokens": 19375196.0, "eval_runtime": 444.8306, "eval_samples_per_second": 5.964, "eval_steps_per_second": 1.493, "step": 1530 }, { "entropy": 0.300830078125, "epoch": 1.1605426794799323, "grad_norm": 0.3524416983127594, "learning_rate": 1.7938360401866096e-05, "loss": 0.30742716789245605, "mean_token_accuracy": 0.9047734826803208, "num_tokens": 19500857.0, "step": 1540 }, { "entropy": 0.316162109375, "epoch": 1.16807989447899, "grad_norm": 0.3703024983406067, "learning_rate": 1.7908576678181707e-05, "loss": 0.33172438144683836, "mean_token_accuracy": 0.9015444025397301, "num_tokens": 19626493.0, "step": 1550 }, { "entropy": 0.2737548828125, "epoch": 1.1756171094780479, "grad_norm": 0.3456210494041443, "learning_rate": 1.7878604459377795e-05, "loss": 0.2756441593170166, "mean_token_accuracy": 0.9136368721723557, "num_tokens": 19743689.0, "step": 1560 }, { "entropy": 0.302880859375, "epoch": 1.1831543244771057, "grad_norm": 0.4714341461658478, "learning_rate": 1.7848444459820188e-05, "loss": 0.3121260404586792, "mean_token_accuracy": 0.9028191328048706, "num_tokens": 19863458.0, "step": 1570 }, { "entropy": 0.28583984375, "epoch": 1.1906915394761635, "grad_norm": 0.4156145453453064, "learning_rate": 1.7818097398350342e-05, "loss": 0.2904102325439453, "mean_token_accuracy": 0.9098244786262513, "num_tokens": 19994262.0, "step": 1580 }, { "entropy": 0.29375, "epoch": 1.1982287544752215, "grad_norm": 0.3377763330936432, "learning_rate": 1.7787563998268184e-05, "loss": 0.30670197010040284, "mean_token_accuracy": 0.906707638502121, "num_tokens": 20124999.0, "step": 1590 }, { "entropy": 0.302392578125, "epoch": 1.2057659694742793, "grad_norm": 0.49329009652137756, "learning_rate": 1.775684498731489e-05, "loss": 0.3087696313858032, "mean_token_accuracy": 0.9053114622831344, "num_tokens": 20249258.0, "step": 1600 }, { "entropy": 0.297705078125, "epoch": 1.213303184473337, "grad_norm": 0.4330660402774811, "learning_rate": 1.7725941097655545e-05, "loss": 0.3062288761138916, "mean_token_accuracy": 0.9051512002944946, "num_tokens": 20364874.0, "step": 1610 }, { "entropy": 0.2842529296875, "epoch": 1.2208403994723949, "grad_norm": 0.4065454602241516, "learning_rate": 1.769485306586166e-05, "loss": 0.2898876428604126, "mean_token_accuracy": 0.9075682818889618, "num_tokens": 20480419.0, "step": 1620 }, { "entropy": 0.2935791015625, "epoch": 1.2283776144714529, "grad_norm": 0.35416698455810547, "learning_rate": 1.766358163289366e-05, "loss": 0.30039851665496825, "mean_token_accuracy": 0.9085959702730179, "num_tokens": 20614729.0, "step": 1630 }, { "entropy": 0.2864990234375, "epoch": 1.2359148294705107, "grad_norm": 0.3471983075141907, "learning_rate": 1.763212754408319e-05, "loss": 0.29657065868377686, "mean_token_accuracy": 0.9082139819860459, "num_tokens": 20738759.0, "step": 1640 }, { "entropy": 0.3024169921875, "epoch": 1.2434520444695685, "grad_norm": 0.3187088370323181, "learning_rate": 1.760049154911537e-05, "loss": 0.31194396018981935, "mean_token_accuracy": 0.9060672715306282, "num_tokens": 20867449.0, "step": 1650 }, { "entropy": 0.2745849609375, "epoch": 1.2509892594686263, "grad_norm": 0.3486154079437256, "learning_rate": 1.7568674402010916e-05, "loss": 0.2793387174606323, "mean_token_accuracy": 0.9114227816462517, "num_tokens": 20995147.0, "step": 1660 }, { "entropy": 0.2999755859375, "epoch": 1.258526474467684, "grad_norm": 0.42927002906799316, "learning_rate": 1.7536676861108167e-05, "loss": 0.3100817441940308, "mean_token_accuracy": 0.9050891101360321, "num_tokens": 21115888.0, "step": 1670 }, { "entropy": 0.2914794921875, "epoch": 1.266063689466742, "grad_norm": 0.389069527387619, "learning_rate": 1.7504499689045025e-05, "loss": 0.2946730852127075, "mean_token_accuracy": 0.9088802948594094, "num_tokens": 21248739.0, "step": 1680 }, { "entropy": 0.2900390625, "epoch": 1.2736009044657999, "grad_norm": 0.4550289809703827, "learning_rate": 1.7472143652740766e-05, "loss": 0.2940664768218994, "mean_token_accuracy": 0.9070353329181671, "num_tokens": 21372952.0, "step": 1690 }, { "entropy": 0.3079345703125, "epoch": 1.2811381194648577, "grad_norm": 0.3766443133354187, "learning_rate": 1.7439609523377765e-05, "loss": 0.31435160636901854, "mean_token_accuracy": 0.9039904981851578, "num_tokens": 21482465.0, "step": 1700 }, { "epoch": 1.2811381194648577, "eval_entropy": 0.2963881894766566, "eval_loss": 0.3144903779029846, "eval_mean_token_accuracy": 0.9044847843876804, "eval_num_tokens": 21482465.0, "eval_runtime": 444.3229, "eval_samples_per_second": 5.971, "eval_steps_per_second": 1.494, "step": 1700 }, { "entropy": 0.2976318359375, "epoch": 1.2886753344639157, "grad_norm": 0.3675684630870819, "learning_rate": 1.740689807638311e-05, "loss": 0.3084413051605225, "mean_token_accuracy": 0.9068222478032112, "num_tokens": 21606886.0, "step": 1710 }, { "entropy": 0.26845703125, "epoch": 1.2962125494629735, "grad_norm": 0.48080354928970337, "learning_rate": 1.7374010091410126e-05, "loss": 0.27617788314819336, "mean_token_accuracy": 0.9144353941082954, "num_tokens": 21728204.0, "step": 1720 }, { "entropy": 0.3060546875, "epoch": 1.3037497644620313, "grad_norm": 0.4360472559928894, "learning_rate": 1.7340946352319795e-05, "loss": 0.3208837270736694, "mean_token_accuracy": 0.9051508828997612, "num_tokens": 21847166.0, "step": 1730 }, { "entropy": 0.275732421875, "epoch": 1.311286979461089, "grad_norm": 0.42607492208480835, "learning_rate": 1.730770764716206e-05, "loss": 0.2842782735824585, "mean_token_accuracy": 0.912279462814331, "num_tokens": 21972827.0, "step": 1740 }, { "entropy": 0.298291015625, "epoch": 1.3188241944601469, "grad_norm": 0.3897174298763275, "learning_rate": 1.7274294768157065e-05, "loss": 0.30409531593322753, "mean_token_accuracy": 0.907126384973526, "num_tokens": 22098702.0, "step": 1750 }, { "entropy": 0.301708984375, "epoch": 1.3263614094592049, "grad_norm": 0.3547886312007904, "learning_rate": 1.7240708511676253e-05, "loss": 0.30962510108947755, "mean_token_accuracy": 0.9043201595544815, "num_tokens": 22224280.0, "step": 1760 }, { "entropy": 0.2868896484375, "epoch": 1.3338986244582627, "grad_norm": 0.41709667444229126, "learning_rate": 1.7206949678223388e-05, "loss": 0.29194619655609133, "mean_token_accuracy": 0.9089675724506379, "num_tokens": 22350124.0, "step": 1770 }, { "entropy": 0.31044921875, "epoch": 1.3414358394573205, "grad_norm": 0.41593441367149353, "learning_rate": 1.7173019072415488e-05, "loss": 0.3232313871383667, "mean_token_accuracy": 0.9014707505702972, "num_tokens": 22466149.0, "step": 1780 }, { "entropy": 0.302587890625, "epoch": 1.3489730544563785, "grad_norm": 0.3737364113330841, "learning_rate": 1.7138917502963627e-05, "loss": 0.3045801639556885, "mean_token_accuracy": 0.9061708480119706, "num_tokens": 22589692.0, "step": 1790 }, { "entropy": 0.288525390625, "epoch": 1.3565102694554363, "grad_norm": 0.36714568734169006, "learning_rate": 1.710464578265369e-05, "loss": 0.2963777780532837, "mean_token_accuracy": 0.9083131685853004, "num_tokens": 22722538.0, "step": 1800 }, { "entropy": 0.273828125, "epoch": 1.364047484454494, "grad_norm": 0.35630372166633606, "learning_rate": 1.7070204728326964e-05, "loss": 0.27682127952575686, "mean_token_accuracy": 0.9124655604362488, "num_tokens": 22857508.0, "step": 1810 }, { "entropy": 0.2949951171875, "epoch": 1.3715846994535519, "grad_norm": 0.353568434715271, "learning_rate": 1.7035595160860694e-05, "loss": 0.3098414897918701, "mean_token_accuracy": 0.9068989664316177, "num_tokens": 22982244.0, "step": 1820 }, { "entropy": 0.30048828125, "epoch": 1.3791219144526097, "grad_norm": 0.33436575531959534, "learning_rate": 1.7000817905148523e-05, "loss": 0.3092353820800781, "mean_token_accuracy": 0.9077757328748703, "num_tokens": 23115582.0, "step": 1830 }, { "entropy": 0.293017578125, "epoch": 1.3866591294516675, "grad_norm": 0.3831446170806885, "learning_rate": 1.6965873790080806e-05, "loss": 0.2991267442703247, "mean_token_accuracy": 0.9091545164585113, "num_tokens": 23244458.0, "step": 1840 }, { "entropy": 0.2932373046875, "epoch": 1.3941963444507255, "grad_norm": 0.4001041352748871, "learning_rate": 1.693076364852487e-05, "loss": 0.3073925018310547, "mean_token_accuracy": 0.9061064407229423, "num_tokens": 23370896.0, "step": 1850 }, { "entropy": 0.2966796875, "epoch": 1.4017335594497833, "grad_norm": 0.36026492714881897, "learning_rate": 1.6895488317305174e-05, "loss": 0.3013612747192383, "mean_token_accuracy": 0.9059083923697472, "num_tokens": 23490463.0, "step": 1860 }, { "entropy": 0.28447265625, "epoch": 1.409270774448841, "grad_norm": 0.4457832872867584, "learning_rate": 1.6860048637183336e-05, "loss": 0.2879622936248779, "mean_token_accuracy": 0.910649086534977, "num_tokens": 23619624.0, "step": 1870 }, { "epoch": 1.409270774448841, "eval_entropy": 0.2866534497364458, "eval_loss": 0.31162187457084656, "eval_mean_token_accuracy": 0.9055151030959854, "eval_num_tokens": 23619624.0, "eval_runtime": 444.4582, "eval_samples_per_second": 5.969, "eval_steps_per_second": 1.494, "step": 1870 }, { "entropy": 0.2755126953125, "epoch": 1.416807989447899, "grad_norm": 0.34847527742385864, "learning_rate": 1.6824445452838112e-05, "loss": 0.2797748327255249, "mean_token_accuracy": 0.9122792810201645, "num_tokens": 23751843.0, "step": 1880 }, { "entropy": 0.3048583984375, "epoch": 1.424345204446957, "grad_norm": 0.34166133403778076, "learning_rate": 1.6788679612845275e-05, "loss": 0.3143250226974487, "mean_token_accuracy": 0.9053974837064743, "num_tokens": 23890129.0, "step": 1890 }, { "entropy": 0.2959228515625, "epoch": 1.4318824194460147, "grad_norm": 0.4138602316379547, "learning_rate": 1.6752751969657364e-05, "loss": 0.3098402738571167, "mean_token_accuracy": 0.9060688123106957, "num_tokens": 24025639.0, "step": 1900 }, { "entropy": 0.2892822265625, "epoch": 1.4394196344450725, "grad_norm": 0.35475072264671326, "learning_rate": 1.6716663379583373e-05, "loss": 0.30137479305267334, "mean_token_accuracy": 0.9065017476677895, "num_tokens": 24142755.0, "step": 1910 }, { "entropy": 0.2736083984375, "epoch": 1.4469568494441303, "grad_norm": 0.38053274154663086, "learning_rate": 1.6680414702768358e-05, "loss": 0.2755943775177002, "mean_token_accuracy": 0.9128162145614624, "num_tokens": 24271034.0, "step": 1920 }, { "entropy": 0.2882568359375, "epoch": 1.4544940644431883, "grad_norm": 0.3685821294784546, "learning_rate": 1.6644006803172926e-05, "loss": 0.29870429039001467, "mean_token_accuracy": 0.9083519443869591, "num_tokens": 24401299.0, "step": 1930 }, { "entropy": 0.2899169921875, "epoch": 1.462031279442246, "grad_norm": 0.38053128123283386, "learning_rate": 1.660744054855263e-05, "loss": 0.2999034643173218, "mean_token_accuracy": 0.9092144444584846, "num_tokens": 24525590.0, "step": 1940 }, { "entropy": 0.3008544921875, "epoch": 1.4695684944413039, "grad_norm": 0.3747199773788452, "learning_rate": 1.657071681043731e-05, "loss": 0.3081289052963257, "mean_token_accuracy": 0.9040897369384766, "num_tokens": 24652105.0, "step": 1950 }, { "entropy": 0.28818359375, "epoch": 1.477105709440362, "grad_norm": 0.4361964762210846, "learning_rate": 1.6533836464110303e-05, "loss": 0.2913468599319458, "mean_token_accuracy": 0.9085044726729393, "num_tokens": 24781538.0, "step": 1960 }, { "entropy": 0.2942626953125, "epoch": 1.4846429244394197, "grad_norm": 0.4351835548877716, "learning_rate": 1.649680038858759e-05, "loss": 0.30144288539886477, "mean_token_accuracy": 0.9078996136784554, "num_tokens": 24900040.0, "step": 1970 }, { "entropy": 0.309912109375, "epoch": 1.4921801394384775, "grad_norm": 0.3614610433578491, "learning_rate": 1.645960946659685e-05, "loss": 0.32563717365264894, "mean_token_accuracy": 0.9042312502861023, "num_tokens": 25029356.0, "step": 1980 }, { "entropy": 0.288232421875, "epoch": 1.4997173544375353, "grad_norm": 0.46183428168296814, "learning_rate": 1.64222645845564e-05, "loss": 0.2938676118850708, "mean_token_accuracy": 0.9088562294840813, "num_tokens": 25150702.0, "step": 1990 }, { "entropy": 0.287841796875, "epoch": 1.507254569436593, "grad_norm": 0.35748639702796936, "learning_rate": 1.638476663255409e-05, "loss": 0.3016012907028198, "mean_token_accuracy": 0.90945535749197, "num_tokens": 25289821.0, "step": 2000 }, { "entropy": 0.29658203125, "epoch": 1.5147917844356509, "grad_norm": 0.392511785030365, "learning_rate": 1.6347116504326082e-05, "loss": 0.30182077884674074, "mean_token_accuracy": 0.9069562748074531, "num_tokens": 25427874.0, "step": 2010 }, { "entropy": 0.2969482421875, "epoch": 1.522328999434709, "grad_norm": 0.4357432425022125, "learning_rate": 1.630931509723554e-05, "loss": 0.30153517723083495, "mean_token_accuracy": 0.9072390154004097, "num_tokens": 25554351.0, "step": 2020 }, { "entropy": 0.2900390625, "epoch": 1.5298662144337667, "grad_norm": 0.36660265922546387, "learning_rate": 1.6271363312251253e-05, "loss": 0.30401484966278075, "mean_token_accuracy": 0.909621711075306, "num_tokens": 25687339.0, "step": 2030 }, { "entropy": 0.291259765625, "epoch": 1.5374034294328247, "grad_norm": 0.3444574177265167, "learning_rate": 1.6233262053926165e-05, "loss": 0.29833531379699707, "mean_token_accuracy": 0.9089738965034485, "num_tokens": 25819705.0, "step": 2040 }, { "epoch": 1.5374034294328247, "eval_entropy": 0.29168186417545183, "eval_loss": 0.3090449571609497, "eval_mean_token_accuracy": 0.9057694819856839, "eval_num_tokens": 25819705.0, "eval_runtime": 444.9473, "eval_samples_per_second": 5.963, "eval_steps_per_second": 1.492, "step": 2040 }, { "entropy": 0.286083984375, "epoch": 1.5449406444318825, "grad_norm": 0.3866405487060547, "learning_rate": 1.6195012230375783e-05, "loss": 0.29763362407684324, "mean_token_accuracy": 0.9090174749493599, "num_tokens": 25950997.0, "step": 2050 }, { "entropy": 0.279345703125, "epoch": 1.5524778594309403, "grad_norm": 0.39879608154296875, "learning_rate": 1.6156614753256583e-05, "loss": 0.2852219343185425, "mean_token_accuracy": 0.9102980241179466, "num_tokens": 26065033.0, "step": 2060 }, { "entropy": 0.2977294921875, "epoch": 1.560015074429998, "grad_norm": 0.4519115686416626, "learning_rate": 1.6118070537744242e-05, "loss": 0.3063497066497803, "mean_token_accuracy": 0.9054354265332222, "num_tokens": 26188501.0, "step": 2070 }, { "entropy": 0.305029296875, "epoch": 1.567552289429056, "grad_norm": 0.3860149383544922, "learning_rate": 1.6079380502511846e-05, "loss": 0.3170385122299194, "mean_token_accuracy": 0.906504712998867, "num_tokens": 26320550.0, "step": 2080 }, { "entropy": 0.2880859375, "epoch": 1.5750895044281137, "grad_norm": 0.4003013074398041, "learning_rate": 1.6040545569707977e-05, "loss": 0.29796886444091797, "mean_token_accuracy": 0.907678847014904, "num_tokens": 26439410.0, "step": 2090 }, { "entropy": 0.293212890625, "epoch": 1.5826267194271717, "grad_norm": 0.39812982082366943, "learning_rate": 1.600156666493475e-05, "loss": 0.3037936449050903, "mean_token_accuracy": 0.9078080400824546, "num_tokens": 26558486.0, "step": 2100 }, { "entropy": 0.2809814453125, "epoch": 1.5901639344262295, "grad_norm": 0.3826020658016205, "learning_rate": 1.5962444717225753e-05, "loss": 0.29529705047607424, "mean_token_accuracy": 0.9107925236225128, "num_tokens": 26690449.0, "step": 2110 }, { "entropy": 0.2869140625, "epoch": 1.5977011494252875, "grad_norm": 0.3772203326225281, "learning_rate": 1.5923180659023883e-05, "loss": 0.29066874980926516, "mean_token_accuracy": 0.9094026356935501, "num_tokens": 26824245.0, "step": 2120 }, { "entropy": 0.28427734375, "epoch": 1.6052383644243453, "grad_norm": 0.3734860122203827, "learning_rate": 1.588377542615915e-05, "loss": 0.2948519945144653, "mean_token_accuracy": 0.908295425772667, "num_tokens": 26951710.0, "step": 2130 }, { "entropy": 0.2827392578125, "epoch": 1.612775579423403, "grad_norm": 0.4289539158344269, "learning_rate": 1.5844229957826347e-05, "loss": 0.28623509407043457, "mean_token_accuracy": 0.9114281222224235, "num_tokens": 27081467.0, "step": 2140 }, { "entropy": 0.3018798828125, "epoch": 1.620312794422461, "grad_norm": 0.4174732565879822, "learning_rate": 1.5804545196562683e-05, "loss": 0.31496200561523435, "mean_token_accuracy": 0.9058399319648742, "num_tokens": 27213220.0, "step": 2150 }, { "entropy": 0.2672119140625, "epoch": 1.6278500094215187, "grad_norm": 0.3824097514152527, "learning_rate": 1.5764722088225317e-05, "loss": 0.2726640224456787, "mean_token_accuracy": 0.9144431263208389, "num_tokens": 27326671.0, "step": 2160 }, { "entropy": 0.3100341796875, "epoch": 1.6353872244205765, "grad_norm": 0.45335128903388977, "learning_rate": 1.572476158196879e-05, "loss": 0.3252666234970093, "mean_token_accuracy": 0.9008206337690353, "num_tokens": 27440284.0, "step": 2170 }, { "entropy": 0.28056640625, "epoch": 1.6429244394196343, "grad_norm": 0.3022969663143158, "learning_rate": 1.568466463022245e-05, "loss": 0.2954371452331543, "mean_token_accuracy": 0.9110561206936836, "num_tokens": 27559379.0, "step": 2180 }, { "entropy": 0.2784423828125, "epoch": 1.6504616544186923, "grad_norm": 0.3907804489135742, "learning_rate": 1.5644432188667695e-05, "loss": 0.2918686389923096, "mean_token_accuracy": 0.9108302012085915, "num_tokens": 27686989.0, "step": 2190 }, { "entropy": 0.2941162109375, "epoch": 1.65799886941775, "grad_norm": 0.35084792971611023, "learning_rate": 1.560406521621524e-05, "loss": 0.29794740676879883, "mean_token_accuracy": 0.9107154473662377, "num_tokens": 27820500.0, "step": 2200 }, { "entropy": 0.26474609375, "epoch": 1.6655360844168081, "grad_norm": 0.3820977807044983, "learning_rate": 1.5563564674982235e-05, "loss": 0.27836596965789795, "mean_token_accuracy": 0.9123305752873421, "num_tokens": 27932725.0, "step": 2210 }, { "epoch": 1.6655360844168081, "eval_entropy": 0.28888454207454817, "eval_loss": 0.30725526809692383, "eval_mean_token_accuracy": 0.9062411828213427, "eval_num_tokens": 27932725.0, "eval_runtime": 444.1042, "eval_samples_per_second": 5.974, "eval_steps_per_second": 1.495, "step": 2210 }, { "entropy": 0.301220703125, "epoch": 1.673073299415866, "grad_norm": 0.41093695163726807, "learning_rate": 1.5522931530269356e-05, "loss": 0.3100571155548096, "mean_token_accuracy": 0.9063948586583137, "num_tokens": 28068236.0, "step": 2220 }, { "entropy": 0.2692626953125, "epoch": 1.6806105144149237, "grad_norm": 0.33717814087867737, "learning_rate": 1.5482166750537777e-05, "loss": 0.2845989942550659, "mean_token_accuracy": 0.913370530307293, "num_tokens": 28194718.0, "step": 2230 }, { "entropy": 0.310009765625, "epoch": 1.6881477294139815, "grad_norm": 0.43015503883361816, "learning_rate": 1.54412713073861e-05, "loss": 0.31532199382781984, "mean_token_accuracy": 0.903562581539154, "num_tokens": 28317717.0, "step": 2240 }, { "entropy": 0.2740234375, "epoch": 1.6956849444130393, "grad_norm": 0.3851742148399353, "learning_rate": 1.5400246175527186e-05, "loss": 0.2825237035751343, "mean_token_accuracy": 0.9131973013281822, "num_tokens": 28450059.0, "step": 2250 }, { "entropy": 0.270556640625, "epoch": 1.703222159412097, "grad_norm": 0.3782564401626587, "learning_rate": 1.5359092332764938e-05, "loss": 0.28100948333740233, "mean_token_accuracy": 0.9127213463187218, "num_tokens": 28577388.0, "step": 2260 }, { "entropy": 0.2857666015625, "epoch": 1.710759374411155, "grad_norm": 0.41269612312316895, "learning_rate": 1.5317810759970996e-05, "loss": 0.29292376041412355, "mean_token_accuracy": 0.9088818147778511, "num_tokens": 28708268.0, "step": 2270 }, { "entropy": 0.2853271484375, "epoch": 1.718296589410213, "grad_norm": 0.3992975354194641, "learning_rate": 1.527640244106133e-05, "loss": 0.29620723724365233, "mean_token_accuracy": 0.9107150569558143, "num_tokens": 28844273.0, "step": 2280 }, { "entropy": 0.282958984375, "epoch": 1.725833804409271, "grad_norm": 0.4681526720523834, "learning_rate": 1.5234868362972832e-05, "loss": 0.292909574508667, "mean_token_accuracy": 0.9111030578613282, "num_tokens": 28968218.0, "step": 2290 }, { "entropy": 0.263427734375, "epoch": 1.7333710194083287, "grad_norm": 0.38428157567977905, "learning_rate": 1.5193209515639762e-05, "loss": 0.2674442768096924, "mean_token_accuracy": 0.914100530743599, "num_tokens": 29089112.0, "step": 2300 }, { "entropy": 0.2892822265625, "epoch": 1.7409082344073865, "grad_norm": 0.40929433703422546, "learning_rate": 1.5151426891970168e-05, "loss": 0.29194159507751466, "mean_token_accuracy": 0.9096132263541221, "num_tokens": 29218950.0, "step": 2310 }, { "entropy": 0.2778564453125, "epoch": 1.7484454494064443, "grad_norm": 0.3487510681152344, "learning_rate": 1.5109521487822208e-05, "loss": 0.294701361656189, "mean_token_accuracy": 0.9104762703180314, "num_tokens": 29354082.0, "step": 2320 }, { "entropy": 0.2981201171875, "epoch": 1.755982664405502, "grad_norm": 0.4178600311279297, "learning_rate": 1.5067494301980427e-05, "loss": 0.3012765169143677, "mean_token_accuracy": 0.9065235763788223, "num_tokens": 29488709.0, "step": 2330 }, { "entropy": 0.2984375, "epoch": 1.76351987940456, "grad_norm": 0.39268913865089417, "learning_rate": 1.5025346336131955e-05, "loss": 0.314531946182251, "mean_token_accuracy": 0.9063766539096832, "num_tokens": 29618043.0, "step": 2340 }, { "entropy": 0.2891845703125, "epoch": 1.771057094403618, "grad_norm": 0.5101540088653564, "learning_rate": 1.4983078594842608e-05, "loss": 0.29479122161865234, "mean_token_accuracy": 0.9087283477187157, "num_tokens": 29742122.0, "step": 2350 }, { "entropy": 0.2698974609375, "epoch": 1.7785943094026757, "grad_norm": 0.40157949924468994, "learning_rate": 1.494069208553298e-05, "loss": 0.277575945854187, "mean_token_accuracy": 0.9128099977970123, "num_tokens": 29872789.0, "step": 2360 }, { "entropy": 0.2943603515625, "epoch": 1.7861315244017335, "grad_norm": 0.35253477096557617, "learning_rate": 1.4898187818454401e-05, "loss": 0.2952854633331299, "mean_token_accuracy": 0.9069695189595223, "num_tokens": 29996632.0, "step": 2370 }, { "entropy": 0.283447265625, "epoch": 1.7936687394007915, "grad_norm": 0.394357830286026, "learning_rate": 1.4855566806664874e-05, "loss": 0.29858076572418213, "mean_token_accuracy": 0.9087747976183891, "num_tokens": 30115734.0, "step": 2380 }, { "epoch": 1.7936687394007915, "eval_entropy": 0.2916524496423193, "eval_loss": 0.30516064167022705, "eval_mean_token_accuracy": 0.9064356250217162, "eval_num_tokens": 30115734.0, "eval_runtime": 444.5117, "eval_samples_per_second": 5.968, "eval_steps_per_second": 1.494, "step": 2380 }, { "entropy": 0.28697509765625, "epoch": 1.8012059543998493, "grad_norm": 0.33769169449806213, "learning_rate": 1.481283006600493e-05, "loss": 0.29146175384521483, "mean_token_accuracy": 0.9108529061079025, "num_tokens": 30251060.0, "step": 2390 }, { "entropy": 0.2843994140625, "epoch": 1.8087431693989071, "grad_norm": 0.3985027074813843, "learning_rate": 1.4769978615073406e-05, "loss": 0.2936448574066162, "mean_token_accuracy": 0.9098766788840293, "num_tokens": 30373308.0, "step": 2400 }, { "entropy": 0.27158203125, "epoch": 1.816280384397965, "grad_norm": 0.4366515278816223, "learning_rate": 1.4727013475203182e-05, "loss": 0.27635395526885986, "mean_token_accuracy": 0.9137975901365281, "num_tokens": 30504411.0, "step": 2410 }, { "entropy": 0.26373291015625, "epoch": 1.8238175993970227, "grad_norm": 0.35052821040153503, "learning_rate": 1.4683935670436824e-05, "loss": 0.2652280330657959, "mean_token_accuracy": 0.9151029929518699, "num_tokens": 30630360.0, "step": 2420 }, { "entropy": 0.29560546875, "epoch": 1.8313548143960805, "grad_norm": 0.33174508810043335, "learning_rate": 1.464074622750219e-05, "loss": 0.3035954713821411, "mean_token_accuracy": 0.9070772379636765, "num_tokens": 30764034.0, "step": 2430 }, { "entropy": 0.2862060546875, "epoch": 1.8388920293951385, "grad_norm": 0.418497771024704, "learning_rate": 1.4597446175787944e-05, "loss": 0.29122745990753174, "mean_token_accuracy": 0.9084449097514152, "num_tokens": 30889656.0, "step": 2440 }, { "entropy": 0.27470703125, "epoch": 1.8464292443941963, "grad_norm": 0.30565425753593445, "learning_rate": 1.4554036547319033e-05, "loss": 0.277424955368042, "mean_token_accuracy": 0.9113439500331879, "num_tokens": 31019827.0, "step": 2450 }, { "entropy": 0.27275390625, "epoch": 1.8539664593932543, "grad_norm": 0.43941381573677063, "learning_rate": 1.4510518376732081e-05, "loss": 0.2832863092422485, "mean_token_accuracy": 0.9118362620472908, "num_tokens": 31154827.0, "step": 2460 }, { "entropy": 0.2802734375, "epoch": 1.8615036743923121, "grad_norm": 0.41547101736068726, "learning_rate": 1.4466892701250745e-05, "loss": 0.286260986328125, "mean_token_accuracy": 0.911260911822319, "num_tokens": 31287561.0, "step": 2470 }, { "entropy": 0.28837890625, "epoch": 1.86904088939137, "grad_norm": 0.34127259254455566, "learning_rate": 1.4423160560660972e-05, "loss": 0.30336732864379884, "mean_token_accuracy": 0.9074774295091629, "num_tokens": 31420717.0, "step": 2480 }, { "entropy": 0.2842529296875, "epoch": 1.8765781043904277, "grad_norm": 0.4352460503578186, "learning_rate": 1.4379322997286228e-05, "loss": 0.29042506217956543, "mean_token_accuracy": 0.9101185172796249, "num_tokens": 31543657.0, "step": 2490 }, { "entropy": 0.308984375, "epoch": 1.8841153193894855, "grad_norm": 0.37729454040527344, "learning_rate": 1.4335381055962657e-05, "loss": 0.32251315116882323, "mean_token_accuracy": 0.9027933478355408, "num_tokens": 31672685.0, "step": 2500 }, { "entropy": 0.2936279296875, "epoch": 1.8916525343885433, "grad_norm": 0.38765987753868103, "learning_rate": 1.4291335784014173e-05, "loss": 0.2984729766845703, "mean_token_accuracy": 0.9071457028388977, "num_tokens": 31794684.0, "step": 2510 }, { "entropy": 0.2948486328125, "epoch": 1.8991897493876013, "grad_norm": 0.39258772134780884, "learning_rate": 1.42471882312275e-05, "loss": 0.30484049320220946, "mean_token_accuracy": 0.9063387095928193, "num_tokens": 31915478.0, "step": 2520 }, { "entropy": 0.2870849609375, "epoch": 1.9067269643866591, "grad_norm": 0.3371396064758301, "learning_rate": 1.4202939449827149e-05, "loss": 0.30141425132751465, "mean_token_accuracy": 0.9095958784222603, "num_tokens": 32040746.0, "step": 2530 }, { "entropy": 0.2741943359375, "epoch": 1.9142641793857171, "grad_norm": 0.4031423032283783, "learning_rate": 1.4158590494450344e-05, "loss": 0.2807930946350098, "mean_token_accuracy": 0.9128145009279252, "num_tokens": 32169569.0, "step": 2540 }, { "entropy": 0.2891357421875, "epoch": 1.921801394384775, "grad_norm": 0.37120503187179565, "learning_rate": 1.4114142422121879e-05, "loss": 0.2933060646057129, "mean_token_accuracy": 0.908392770588398, "num_tokens": 32296584.0, "step": 2550 }, { "epoch": 1.921801394384775, "eval_entropy": 0.2865328501506024, "eval_loss": 0.3034323453903198, "eval_mean_token_accuracy": 0.9070448785661215, "eval_num_tokens": 32296584.0, "eval_runtime": 444.775, "eval_samples_per_second": 5.965, "eval_steps_per_second": 1.493, "step": 2550 }, { "entropy": 0.2989990234375, "epoch": 1.9293386093838327, "grad_norm": 0.40673521161079407, "learning_rate": 1.406959629222893e-05, "loss": 0.3103364944458008, "mean_token_accuracy": 0.9063321113586426, "num_tokens": 32428504.0, "step": 2560 }, { "entropy": 0.2962646484375, "epoch": 1.9368758243828905, "grad_norm": 0.3941977322101593, "learning_rate": 1.40249531664958e-05, "loss": 0.30964858531951905, "mean_token_accuracy": 0.9068703219294548, "num_tokens": 32556407.0, "step": 2570 }, { "entropy": 0.2732666015625, "epoch": 1.9444130393819483, "grad_norm": 0.4122161567211151, "learning_rate": 1.3980214108958626e-05, "loss": 0.27610068321228026, "mean_token_accuracy": 0.9125834852457047, "num_tokens": 32679188.0, "step": 2580 }, { "entropy": 0.252587890625, "epoch": 1.9519502543810061, "grad_norm": 0.31762272119522095, "learning_rate": 1.3935380185939992e-05, "loss": 0.26145143508911134, "mean_token_accuracy": 0.9161947175860405, "num_tokens": 32806126.0, "step": 2590 }, { "entropy": 0.28642578125, "epoch": 1.959487469380064, "grad_norm": 0.37945154309272766, "learning_rate": 1.3890452466023545e-05, "loss": 0.29998881816864015, "mean_token_accuracy": 0.908545869588852, "num_tokens": 32928860.0, "step": 2600 }, { "entropy": 0.2949462890625, "epoch": 1.967024684379122, "grad_norm": 0.39361295104026794, "learning_rate": 1.3845432020028511e-05, "loss": 0.30800106525421145, "mean_token_accuracy": 0.9073520034551621, "num_tokens": 33065049.0, "step": 2610 }, { "entropy": 0.3162109375, "epoch": 1.9745618993781797, "grad_norm": 0.411302387714386, "learning_rate": 1.380031992098417e-05, "loss": 0.33235788345336914, "mean_token_accuracy": 0.9015798211097718, "num_tokens": 33199078.0, "step": 2620 }, { "entropy": 0.2697021484375, "epoch": 1.9820991143772377, "grad_norm": 0.42348551750183105, "learning_rate": 1.3755117244104282e-05, "loss": 0.27779905796051024, "mean_token_accuracy": 0.9132746890187263, "num_tokens": 33326852.0, "step": 2630 }, { "entropy": 0.2989501953125, "epoch": 1.9896363293762955, "grad_norm": 0.3523179888725281, "learning_rate": 1.370982506676147e-05, "loss": 0.3090573787689209, "mean_token_accuracy": 0.907941748201847, "num_tokens": 33465412.0, "step": 2640 }, { "entropy": 0.289208984375, "epoch": 1.9971735443753533, "grad_norm": 0.3901941180229187, "learning_rate": 1.3664444468461537e-05, "loss": 0.30592546463012693, "mean_token_accuracy": 0.9097454324364662, "num_tokens": 33594937.0, "step": 2650 }, { "entropy": 0.2732121394230769, "epoch": 2.0045223289994345, "grad_norm": 0.42783066630363464, "learning_rate": 1.3618976530817727e-05, "loss": 0.27013728618621824, "mean_token_accuracy": 0.915503862576607, "num_tokens": 33713476.0, "step": 2660 }, { "entropy": 0.265283203125, "epoch": 2.0120595439984927, "grad_norm": 0.3797246217727661, "learning_rate": 1.3573422337524953e-05, "loss": 0.27342140674591064, "mean_token_accuracy": 0.9139280915260315, "num_tokens": 33841244.0, "step": 2670 }, { "entropy": 0.2574951171875, "epoch": 2.0195967589975505, "grad_norm": 0.4094177484512329, "learning_rate": 1.3527782974333978e-05, "loss": 0.26642181873321535, "mean_token_accuracy": 0.917819993197918, "num_tokens": 33965783.0, "step": 2680 }, { "entropy": 0.2673828125, "epoch": 2.0271339739966083, "grad_norm": 0.49123308062553406, "learning_rate": 1.3482059529025517e-05, "loss": 0.272041392326355, "mean_token_accuracy": 0.9136370241641998, "num_tokens": 34084425.0, "step": 2690 }, { "entropy": 0.2714599609375, "epoch": 2.034671188995666, "grad_norm": 0.38243553042411804, "learning_rate": 1.3436253091384321e-05, "loss": 0.28252534866333007, "mean_token_accuracy": 0.9118999525904655, "num_tokens": 34206356.0, "step": 2700 }, { "entropy": 0.2743896484375, "epoch": 2.042208403994724, "grad_norm": 0.4383077919483185, "learning_rate": 1.3390364753173206e-05, "loss": 0.2724027633666992, "mean_token_accuracy": 0.9126274734735489, "num_tokens": 34326720.0, "step": 2710 }, { "entropy": 0.264013671875, "epoch": 2.0497456189937817, "grad_norm": 0.42032304406166077, "learning_rate": 1.3344395608107032e-05, "loss": 0.27180933952331543, "mean_token_accuracy": 0.9154068097472191, "num_tokens": 34449082.0, "step": 2720 }, { "epoch": 2.0497456189937817, "eval_entropy": 0.2703239716679217, "eval_loss": 0.30382418632507324, "eval_mean_token_accuracy": 0.9076029673577791, "eval_num_tokens": 34449082.0, "eval_runtime": 444.9112, "eval_samples_per_second": 5.963, "eval_steps_per_second": 1.492, "step": 2720 }, { "entropy": 0.25732421875, "epoch": 2.0572828339928395, "grad_norm": 0.4523007571697235, "learning_rate": 1.3298346751826624e-05, "loss": 0.2659280300140381, "mean_token_accuracy": 0.9151400104165077, "num_tokens": 34574314.0, "step": 2730 }, { "entropy": 0.2736328125, "epoch": 2.0648200489918973, "grad_norm": 0.43264201283454895, "learning_rate": 1.3252219281872663e-05, "loss": 0.27533228397369386, "mean_token_accuracy": 0.9147139310836792, "num_tokens": 34694661.0, "step": 2740 }, { "entropy": 0.25009765625, "epoch": 2.0723572639909555, "grad_norm": 0.38429099321365356, "learning_rate": 1.3206014297659538e-05, "loss": 0.25780477523803713, "mean_token_accuracy": 0.9180345565080643, "num_tokens": 34821985.0, "step": 2750 }, { "entropy": 0.2557861328125, "epoch": 2.0798944789900133, "grad_norm": 0.40265947580337524, "learning_rate": 1.315973290044913e-05, "loss": 0.26505556106567385, "mean_token_accuracy": 0.9161929801106453, "num_tokens": 34946746.0, "step": 2760 }, { "entropy": 0.274853515625, "epoch": 2.087431693989071, "grad_norm": 0.3728543519973755, "learning_rate": 1.3113376193324564e-05, "loss": 0.2775618314743042, "mean_token_accuracy": 0.9146954879164696, "num_tokens": 35084683.0, "step": 2770 }, { "entropy": 0.26063232421875, "epoch": 2.094968908988129, "grad_norm": 0.4594137668609619, "learning_rate": 1.3066945281163923e-05, "loss": 0.2669402837753296, "mean_token_accuracy": 0.9168649092316628, "num_tokens": 35207447.0, "step": 2780 }, { "entropy": 0.267236328125, "epoch": 2.1025061239871867, "grad_norm": 0.4985879063606262, "learning_rate": 1.302044127061392e-05, "loss": 0.2751408815383911, "mean_token_accuracy": 0.912787701189518, "num_tokens": 35325558.0, "step": 2790 }, { "entropy": 0.26943359375, "epoch": 2.1100433389862445, "grad_norm": 0.45133885741233826, "learning_rate": 1.2973865270063501e-05, "loss": 0.27563629150390623, "mean_token_accuracy": 0.9126975074410438, "num_tokens": 35451140.0, "step": 2800 }, { "entropy": 0.2789306640625, "epoch": 2.1175805539853023, "grad_norm": 0.42350032925605774, "learning_rate": 1.2927218389617452e-05, "loss": 0.28734893798828126, "mean_token_accuracy": 0.911960031092167, "num_tokens": 35567497.0, "step": 2810 }, { "entropy": 0.255517578125, "epoch": 2.12511776898436, "grad_norm": 0.4202309548854828, "learning_rate": 1.2880501741069931e-05, "loss": 0.2654577255249023, "mean_token_accuracy": 0.9167904317378998, "num_tokens": 35695050.0, "step": 2820 }, { "entropy": 0.23223876953125, "epoch": 2.132654983983418, "grad_norm": 0.44368067383766174, "learning_rate": 1.2833716437877952e-05, "loss": 0.23806145191192626, "mean_token_accuracy": 0.9233140185475349, "num_tokens": 35822236.0, "step": 2830 }, { "entropy": 0.2786865234375, "epoch": 2.140192198982476, "grad_norm": 0.40076377987861633, "learning_rate": 1.278686359513488e-05, "loss": 0.2845803737640381, "mean_token_accuracy": 0.9122401431202889, "num_tokens": 35958799.0, "step": 2840 }, { "entropy": 0.2666748046875, "epoch": 2.147729413981534, "grad_norm": 0.4162449538707733, "learning_rate": 1.2739944329543818e-05, "loss": 0.274515962600708, "mean_token_accuracy": 0.9145516887307167, "num_tokens": 36083078.0, "step": 2850 }, { "entropy": 0.252099609375, "epoch": 2.1552666289805917, "grad_norm": 0.41252174973487854, "learning_rate": 1.2692959759391027e-05, "loss": 0.2631190299987793, "mean_token_accuracy": 0.9182503208518028, "num_tokens": 36203301.0, "step": 2860 }, { "entropy": 0.2442626953125, "epoch": 2.1628038439796495, "grad_norm": 0.47404617071151733, "learning_rate": 1.2645911004519246e-05, "loss": 0.250153923034668, "mean_token_accuracy": 0.9218041867017746, "num_tokens": 36337562.0, "step": 2870 }, { "entropy": 0.2638671875, "epoch": 2.1703410589787073, "grad_norm": 0.44618526101112366, "learning_rate": 1.2598799186301003e-05, "loss": 0.26806776523590087, "mean_token_accuracy": 0.9138118460774421, "num_tokens": 36451609.0, "step": 2880 }, { "entropy": 0.2649169921875, "epoch": 2.177878273977765, "grad_norm": 0.4570532441139221, "learning_rate": 1.2551625427611907e-05, "loss": 0.27152099609375, "mean_token_accuracy": 0.9154557690024376, "num_tokens": 36578083.0, "step": 2890 }, { "epoch": 2.177878273977765, "eval_entropy": 0.2681899472891566, "eval_loss": 0.3028174340724945, "eval_mean_token_accuracy": 0.9079541289303676, "eval_num_tokens": 36578083.0, "eval_runtime": 445.3242, "eval_samples_per_second": 5.957, "eval_steps_per_second": 1.491, "step": 2890 }, { "entropy": 0.2643310546875, "epoch": 2.185415488976823, "grad_norm": 0.4730449318885803, "learning_rate": 1.2504390852803863e-05, "loss": 0.2764227867126465, "mean_token_accuracy": 0.9145638346672058, "num_tokens": 36710742.0, "step": 2900 }, { "entropy": 0.2716796875, "epoch": 2.1929527039758807, "grad_norm": 0.4901706576347351, "learning_rate": 1.245709658767829e-05, "loss": 0.2783637523651123, "mean_token_accuracy": 0.913567054271698, "num_tokens": 36829782.0, "step": 2910 }, { "entropy": 0.273779296875, "epoch": 2.200489918974939, "grad_norm": 0.47092169523239136, "learning_rate": 1.2409743759459275e-05, "loss": 0.28058323860168455, "mean_token_accuracy": 0.9126289084553718, "num_tokens": 36957582.0, "step": 2920 }, { "entropy": 0.24866943359375, "epoch": 2.2080271339739967, "grad_norm": 0.43678930401802063, "learning_rate": 1.2362333496766718e-05, "loss": 0.249833345413208, "mean_token_accuracy": 0.9209662929177285, "num_tokens": 37090946.0, "step": 2930 }, { "entropy": 0.2679443359375, "epoch": 2.2155643489730545, "grad_norm": 0.44983765482902527, "learning_rate": 1.2314866929589434e-05, "loss": 0.281503963470459, "mean_token_accuracy": 0.9136047154664994, "num_tokens": 37226066.0, "step": 2940 }, { "entropy": 0.2578369140625, "epoch": 2.2231015639721123, "grad_norm": 0.4278606176376343, "learning_rate": 1.2267345189258197e-05, "loss": 0.26151697635650634, "mean_token_accuracy": 0.917884474992752, "num_tokens": 37348841.0, "step": 2950 }, { "entropy": 0.255615234375, "epoch": 2.23063877897117, "grad_norm": 0.38196465373039246, "learning_rate": 1.2219769408418809e-05, "loss": 0.26131410598754884, "mean_token_accuracy": 0.9185866966843605, "num_tokens": 37485128.0, "step": 2960 }, { "entropy": 0.282373046875, "epoch": 2.238175993970228, "grad_norm": 0.4476567208766937, "learning_rate": 1.217214072100508e-05, "loss": 0.2837507963180542, "mean_token_accuracy": 0.9103922292590141, "num_tokens": 37614342.0, "step": 2970 }, { "entropy": 0.279638671875, "epoch": 2.2457132089692857, "grad_norm": 0.45457765460014343, "learning_rate": 1.2124460262211808e-05, "loss": 0.29149446487426756, "mean_token_accuracy": 0.9109927758574485, "num_tokens": 37745788.0, "step": 2980 }, { "entropy": 0.27572021484375, "epoch": 2.2532504239683435, "grad_norm": 0.46303901076316833, "learning_rate": 1.2076729168467733e-05, "loss": 0.28504157066345215, "mean_token_accuracy": 0.9117044806480408, "num_tokens": 37874375.0, "step": 2990 }, { "entropy": 0.2697509765625, "epoch": 2.2607876389674013, "grad_norm": 0.5162591934204102, "learning_rate": 1.202894857740843e-05, "loss": 0.27514770030975344, "mean_token_accuracy": 0.9141019478440284, "num_tokens": 38003944.0, "step": 3000 }, { "entropy": 0.27939453125, "epoch": 2.2683248539664596, "grad_norm": 0.3618636727333069, "learning_rate": 1.1981119627849213e-05, "loss": 0.28610208034515383, "mean_token_accuracy": 0.9116652965545654, "num_tokens": 38140440.0, "step": 3010 }, { "entropy": 0.25126953125, "epoch": 2.2758620689655173, "grad_norm": 0.45818719267845154, "learning_rate": 1.1933243459757987e-05, "loss": 0.25659780502319335, "mean_token_accuracy": 0.9194882601499558, "num_tokens": 38266675.0, "step": 3020 }, { "entropy": 0.277490234375, "epoch": 2.283399283964575, "grad_norm": 0.4702519476413727, "learning_rate": 1.1885321214228065e-05, "loss": 0.285460376739502, "mean_token_accuracy": 0.91060761064291, "num_tokens": 38373564.0, "step": 3030 }, { "entropy": 0.2642333984375, "epoch": 2.290936498963633, "grad_norm": 0.415840744972229, "learning_rate": 1.1837354033451e-05, "loss": 0.26558847427368165, "mean_token_accuracy": 0.9156399607658386, "num_tokens": 38498699.0, "step": 3040 }, { "entropy": 0.27161865234375, "epoch": 2.2984737139626907, "grad_norm": 0.42131829261779785, "learning_rate": 1.178934306068933e-05, "loss": 0.27293484210968016, "mean_token_accuracy": 0.9125606477260589, "num_tokens": 38628016.0, "step": 3050 }, { "entropy": 0.2598876953125, "epoch": 2.3060109289617485, "grad_norm": 0.4538854658603668, "learning_rate": 1.1741289440249342e-05, "loss": 0.26241345405578614, "mean_token_accuracy": 0.9170191511511803, "num_tokens": 38754104.0, "step": 3060 }, { "epoch": 2.3060109289617485, "eval_entropy": 0.26989010730421686, "eval_loss": 0.3018670380115509, "eval_mean_token_accuracy": 0.9079400467046772, "eval_num_tokens": 38754104.0, "eval_runtime": 445.3089, "eval_samples_per_second": 5.958, "eval_steps_per_second": 1.491, "step": 3060 }, { "entropy": 0.2600341796875, "epoch": 2.3135481439608063, "grad_norm": 0.42576491832733154, "learning_rate": 1.1693194317453809e-05, "loss": 0.2762170314788818, "mean_token_accuracy": 0.9149327039718628, "num_tokens": 38887576.0, "step": 3070 }, { "entropy": 0.2461669921875, "epoch": 2.3210853589598646, "grad_norm": 0.36997467279434204, "learning_rate": 1.1645058838614676e-05, "loss": 0.2484156608581543, "mean_token_accuracy": 0.9216334640979766, "num_tokens": 39020182.0, "step": 3080 }, { "entropy": 0.26444091796875, "epoch": 2.3286225739589224, "grad_norm": 0.4386986792087555, "learning_rate": 1.1596884151005743e-05, "loss": 0.2760676383972168, "mean_token_accuracy": 0.9157780781388283, "num_tokens": 39141193.0, "step": 3090 }, { "entropy": 0.2866455078125, "epoch": 2.33615978895798, "grad_norm": 0.42354196310043335, "learning_rate": 1.1548671402835325e-05, "loss": 0.29737937450408936, "mean_token_accuracy": 0.9101170405745507, "num_tokens": 39269837.0, "step": 3100 }, { "entropy": 0.2653564453125, "epoch": 2.343697003957038, "grad_norm": 0.4202589690685272, "learning_rate": 1.1500421743218885e-05, "loss": 0.27224156856536863, "mean_token_accuracy": 0.9151485860347748, "num_tokens": 39397814.0, "step": 3110 }, { "entropy": 0.2645751953125, "epoch": 2.3512342189560957, "grad_norm": 0.4046901762485504, "learning_rate": 1.145213632215164e-05, "loss": 0.2657832384109497, "mean_token_accuracy": 0.9154883936047554, "num_tokens": 39524638.0, "step": 3120 }, { "entropy": 0.2693115234375, "epoch": 2.3587714339551535, "grad_norm": 0.44271120429039, "learning_rate": 1.1403816290481148e-05, "loss": 0.2753964185714722, "mean_token_accuracy": 0.9133884340524674, "num_tokens": 39661551.0, "step": 3130 }, { "entropy": 0.2556884765625, "epoch": 2.3663086489542113, "grad_norm": 0.4109664261341095, "learning_rate": 1.1355462799879903e-05, "loss": 0.25953586101531984, "mean_token_accuracy": 0.9173814952373505, "num_tokens": 39776450.0, "step": 3140 }, { "entropy": 0.2528076171875, "epoch": 2.373845863953269, "grad_norm": 0.4666280150413513, "learning_rate": 1.1307077002817853e-05, "loss": 0.26098630428314207, "mean_token_accuracy": 0.9175211057066918, "num_tokens": 39903858.0, "step": 3150 }, { "entropy": 0.2533935546875, "epoch": 2.381383078952327, "grad_norm": 0.43249785900115967, "learning_rate": 1.125866005253495e-05, "loss": 0.2545808792114258, "mean_token_accuracy": 0.9177893921732903, "num_tokens": 40039159.0, "step": 3160 }, { "entropy": 0.273388671875, "epoch": 2.3889202939513847, "grad_norm": 0.4109291136264801, "learning_rate": 1.1210213103013666e-05, "loss": 0.2860630750656128, "mean_token_accuracy": 0.9107137665152549, "num_tokens": 40163427.0, "step": 3170 }, { "entropy": 0.2639892578125, "epoch": 2.396457508950443, "grad_norm": 0.498600572347641, "learning_rate": 1.1161737308951473e-05, "loss": 0.27160656452178955, "mean_token_accuracy": 0.9145796820521355, "num_tokens": 40290261.0, "step": 3180 }, { "entropy": 0.27569580078125, "epoch": 2.4039947239495008, "grad_norm": 0.459117591381073, "learning_rate": 1.1113233825733342e-05, "loss": 0.27838788032531736, "mean_token_accuracy": 0.9126795575022697, "num_tokens": 40419601.0, "step": 3190 }, { "entropy": 0.2720947265625, "epoch": 2.4115319389485586, "grad_norm": 0.4818122982978821, "learning_rate": 1.1064703809404185e-05, "loss": 0.28298871517181395, "mean_token_accuracy": 0.9107334464788437, "num_tokens": 40534638.0, "step": 3200 }, { "entropy": 0.293701171875, "epoch": 2.4190691539476163, "grad_norm": 0.40891212224960327, "learning_rate": 1.1016148416641321e-05, "loss": 0.3044193983078003, "mean_token_accuracy": 0.9071599930524826, "num_tokens": 40663606.0, "step": 3210 }, { "entropy": 0.2436767578125, "epoch": 2.426606368946674, "grad_norm": 0.4774790406227112, "learning_rate": 1.096756880472689e-05, "loss": 0.24657707214355468, "mean_token_accuracy": 0.9199987560510635, "num_tokens": 40781780.0, "step": 3220 }, { "entropy": 0.27978515625, "epoch": 2.434143583945732, "grad_norm": 0.4053128957748413, "learning_rate": 1.0918966131520276e-05, "loss": 0.2862666606903076, "mean_token_accuracy": 0.9118180349469185, "num_tokens": 40916833.0, "step": 3230 }, { "epoch": 2.434143583945732, "eval_entropy": 0.2733654343938253, "eval_loss": 0.30075809359550476, "eval_mean_token_accuracy": 0.9080868976482426, "eval_num_tokens": 40916833.0, "eval_runtime": 445.2814, "eval_samples_per_second": 5.958, "eval_steps_per_second": 1.491, "step": 3230 }, { "entropy": 0.268994140625, "epoch": 2.4416807989447897, "grad_norm": 0.4496704936027527, "learning_rate": 1.0870341555430524e-05, "loss": 0.27509455680847167, "mean_token_accuracy": 0.9132101371884346, "num_tokens": 41037216.0, "step": 3240 }, { "entropy": 0.265087890625, "epoch": 2.449218013943848, "grad_norm": 0.45039892196655273, "learning_rate": 1.0821696235388704e-05, "loss": 0.2819454908370972, "mean_token_accuracy": 0.9132270663976669, "num_tokens": 41158606.0, "step": 3250 }, { "entropy": 0.2676513671875, "epoch": 2.4567552289429058, "grad_norm": 0.4146597385406494, "learning_rate": 1.0773031330820313e-05, "loss": 0.26915433406829836, "mean_token_accuracy": 0.915351215004921, "num_tokens": 41279915.0, "step": 3260 }, { "entropy": 0.282275390625, "epoch": 2.4642924439419636, "grad_norm": 0.3807780146598816, "learning_rate": 1.0724348001617626e-05, "loss": 0.29516355991363524, "mean_token_accuracy": 0.910530948638916, "num_tokens": 41417857.0, "step": 3270 }, { "entropy": 0.270166015625, "epoch": 2.4718296589410214, "grad_norm": 0.4073243737220764, "learning_rate": 1.0675647408112055e-05, "loss": 0.27692787647247313, "mean_token_accuracy": 0.9140403926372528, "num_tokens": 41543296.0, "step": 3280 }, { "entropy": 0.2533935546875, "epoch": 2.479366873940079, "grad_norm": 0.4855513572692871, "learning_rate": 1.0626930711046499e-05, "loss": 0.26345822811126707, "mean_token_accuracy": 0.9178490027785301, "num_tokens": 41665526.0, "step": 3290 }, { "entropy": 0.2848876953125, "epoch": 2.486904088939137, "grad_norm": 0.40497887134552, "learning_rate": 1.0578199071547666e-05, "loss": 0.2959612846374512, "mean_token_accuracy": 0.9122223347425461, "num_tokens": 41798895.0, "step": 3300 }, { "entropy": 0.2606201171875, "epoch": 2.4944413039381947, "grad_norm": 0.4320884644985199, "learning_rate": 1.0529453651098414e-05, "loss": 0.2592708826065063, "mean_token_accuracy": 0.9175490200519562, "num_tokens": 41924273.0, "step": 3310 }, { "entropy": 0.25693359375, "epoch": 2.5019785189372525, "grad_norm": 0.4300364851951599, "learning_rate": 1.0480695611510052e-05, "loss": 0.2722728967666626, "mean_token_accuracy": 0.9149225175380706, "num_tokens": 42050422.0, "step": 3320 }, { "entropy": 0.2692626953125, "epoch": 2.5095157339363103, "grad_norm": 0.381966233253479, "learning_rate": 1.0431926114894666e-05, "loss": 0.2769562482833862, "mean_token_accuracy": 0.9167289510369301, "num_tokens": 42182717.0, "step": 3330 }, { "entropy": 0.2641357421875, "epoch": 2.517052948935368, "grad_norm": 0.4619712233543396, "learning_rate": 1.0383146323637403e-05, "loss": 0.2671494007110596, "mean_token_accuracy": 0.9168986156582832, "num_tokens": 42309826.0, "step": 3340 }, { "entropy": 0.2777099609375, "epoch": 2.5245901639344264, "grad_norm": 0.45539072155952454, "learning_rate": 1.0334357400368777e-05, "loss": 0.2854647159576416, "mean_token_accuracy": 0.9126088574528695, "num_tokens": 42433368.0, "step": 3350 }, { "entropy": 0.26806640625, "epoch": 2.532127378933484, "grad_norm": 0.4394124448299408, "learning_rate": 1.0285560507936962e-05, "loss": 0.2735744953155518, "mean_token_accuracy": 0.9150983482599259, "num_tokens": 42554101.0, "step": 3360 }, { "entropy": 0.2348876953125, "epoch": 2.539664593932542, "grad_norm": 0.47088930010795593, "learning_rate": 1.023675680938007e-05, "loss": 0.24447669982910156, "mean_token_accuracy": 0.9219925120472908, "num_tokens": 42677888.0, "step": 3370 }, { "entropy": 0.2652587890625, "epoch": 2.5472018089315998, "grad_norm": 0.4078092873096466, "learning_rate": 1.0187947467898425e-05, "loss": 0.2711235284805298, "mean_token_accuracy": 0.916148230433464, "num_tokens": 42810838.0, "step": 3380 }, { "entropy": 0.27083740234375, "epoch": 2.5547390239306575, "grad_norm": 0.3476676344871521, "learning_rate": 1.0139133646826854e-05, "loss": 0.27367372512817384, "mean_token_accuracy": 0.914184220135212, "num_tokens": 42940004.0, "step": 3390 }, { "entropy": 0.2453125, "epoch": 2.5622762389297153, "grad_norm": 0.42558515071868896, "learning_rate": 1.0090316509606945e-05, "loss": 0.254138708114624, "mean_token_accuracy": 0.9195643991231919, "num_tokens": 43069099.0, "step": 3400 }, { "epoch": 2.5622762389297153, "eval_entropy": 0.2698195124246988, "eval_loss": 0.2993011474609375, "eval_mean_token_accuracy": 0.9087990870676845, "eval_num_tokens": 43069099.0, "eval_runtime": 443.9843, "eval_samples_per_second": 5.975, "eval_steps_per_second": 1.496, "step": 3400 }, { "entropy": 0.2767333984375, "epoch": 2.5698134539287736, "grad_norm": 0.45832180976867676, "learning_rate": 1.0041497219759333e-05, "loss": 0.29227685928344727, "mean_token_accuracy": 0.9110212385654449, "num_tokens": 43193208.0, "step": 3410 }, { "entropy": 0.2489013671875, "epoch": 2.5773506689278314, "grad_norm": 0.4983760416507721, "learning_rate": 9.99267694085595e-06, "loss": 0.2483989715576172, "mean_token_accuracy": 0.9187382385134697, "num_tokens": 43317014.0, "step": 3420 }, { "entropy": 0.26158447265625, "epoch": 2.584887883926889, "grad_norm": 0.45462238788604736, "learning_rate": 9.943856836492301e-06, "loss": 0.2670482397079468, "mean_token_accuracy": 0.9153082132339477, "num_tokens": 43449515.0, "step": 3430 }, { "entropy": 0.2579345703125, "epoch": 2.592425098925947, "grad_norm": 0.46467944979667664, "learning_rate": 9.895038070259746e-06, "loss": 0.2636100769042969, "mean_token_accuracy": 0.9178228959441185, "num_tokens": 43567089.0, "step": 3440 }, { "entropy": 0.27763671875, "epoch": 2.5999623139250048, "grad_norm": 0.41027960181236267, "learning_rate": 9.846221805717734e-06, "loss": 0.2852740526199341, "mean_token_accuracy": 0.9120066031813622, "num_tokens": 43703492.0, "step": 3450 }, { "entropy": 0.253173828125, "epoch": 2.6074995289240626, "grad_norm": 0.4736091196537018, "learning_rate": 9.797409206366095e-06, "loss": 0.26119682788848875, "mean_token_accuracy": 0.9169812351465225, "num_tokens": 43820194.0, "step": 3460 }, { "entropy": 0.275732421875, "epoch": 2.6150367439231204, "grad_norm": 0.40017107129096985, "learning_rate": 9.748601435617303e-06, "loss": 0.27841379642486574, "mean_token_accuracy": 0.9130286037921905, "num_tokens": 43947103.0, "step": 3470 }, { "entropy": 0.2679931640625, "epoch": 2.622573958922178, "grad_norm": 0.4032149910926819, "learning_rate": 9.699799656768745e-06, "loss": 0.28026058673858645, "mean_token_accuracy": 0.9144454896450043, "num_tokens": 44075924.0, "step": 3480 }, { "entropy": 0.2673828125, "epoch": 2.630111173921236, "grad_norm": 0.46909603476524353, "learning_rate": 9.651005032974994e-06, "loss": 0.28631269931793213, "mean_token_accuracy": 0.9125849813222885, "num_tokens": 44203855.0, "step": 3490 }, { "entropy": 0.2550537109375, "epoch": 2.6376483889202937, "grad_norm": 0.4014464020729065, "learning_rate": 9.602218727220088e-06, "loss": 0.2603114128112793, "mean_token_accuracy": 0.9170651033520698, "num_tokens": 44329352.0, "step": 3500 }, { "entropy": 0.2544677734375, "epoch": 2.6451856039193515, "grad_norm": 0.4324460029602051, "learning_rate": 9.553441902289807e-06, "loss": 0.25681219100952146, "mean_token_accuracy": 0.9173885345458984, "num_tokens": 44459299.0, "step": 3510 }, { "entropy": 0.2712646484375, "epoch": 2.6527228189184098, "grad_norm": 0.429166316986084, "learning_rate": 9.504675720743976e-06, "loss": 0.2794325590133667, "mean_token_accuracy": 0.9118164703249931, "num_tokens": 44589157.0, "step": 3520 }, { "entropy": 0.2759033203125, "epoch": 2.6602600339174676, "grad_norm": 0.4505804777145386, "learning_rate": 9.45592134488873e-06, "loss": 0.2813832759857178, "mean_token_accuracy": 0.9124478429555893, "num_tokens": 44720112.0, "step": 3530 }, { "entropy": 0.271630859375, "epoch": 2.6677972489165254, "grad_norm": 0.4533892571926117, "learning_rate": 9.407179936748827e-06, "loss": 0.28013317584991454, "mean_token_accuracy": 0.9141771763563156, "num_tokens": 44849682.0, "step": 3540 }, { "entropy": 0.2718505859375, "epoch": 2.675334463915583, "grad_norm": 0.4437422752380371, "learning_rate": 9.358452658039946e-06, "loss": 0.28716139793395995, "mean_token_accuracy": 0.9127397000789642, "num_tokens": 44977692.0, "step": 3550 }, { "entropy": 0.2603515625, "epoch": 2.682871678914641, "grad_norm": 0.41409823298454285, "learning_rate": 9.30974067014101e-06, "loss": 0.2669771432876587, "mean_token_accuracy": 0.9178864300251007, "num_tokens": 45110149.0, "step": 3560 }, { "entropy": 0.2744873046875, "epoch": 2.6904088939136988, "grad_norm": 0.4747328460216522, "learning_rate": 9.261045134066487e-06, "loss": 0.28503587245941164, "mean_token_accuracy": 0.9122420877218247, "num_tokens": 45241772.0, "step": 3570 }, { "epoch": 2.6904088939136988, "eval_entropy": 0.2725241787462349, "eval_loss": 0.29796838760375977, "eval_mean_token_accuracy": 0.9088380316115288, "eval_num_tokens": 45241772.0, "eval_runtime": 443.9422, "eval_samples_per_second": 5.976, "eval_steps_per_second": 1.496, "step": 3570 }, { "entropy": 0.268896484375, "epoch": 2.697946108912757, "grad_norm": 0.42475807666778564, "learning_rate": 9.212367210438735e-06, "loss": 0.2734686374664307, "mean_token_accuracy": 0.9146973386406898, "num_tokens": 45373873.0, "step": 3580 }, { "entropy": 0.24866943359375, "epoch": 2.705483323911815, "grad_norm": 0.4935104250907898, "learning_rate": 9.16370805946033e-06, "loss": 0.2566777944564819, "mean_token_accuracy": 0.918173971772194, "num_tokens": 45503108.0, "step": 3590 }, { "entropy": 0.26513671875, "epoch": 2.7130205389108726, "grad_norm": 0.32801884412765503, "learning_rate": 9.115068840886418e-06, "loss": 0.2722788333892822, "mean_token_accuracy": 0.9168035730719566, "num_tokens": 45640842.0, "step": 3600 }, { "entropy": 0.264794921875, "epoch": 2.7205577539099304, "grad_norm": 0.4599117636680603, "learning_rate": 9.066450713997062e-06, "loss": 0.276505184173584, "mean_token_accuracy": 0.9149751618504525, "num_tokens": 45769433.0, "step": 3610 }, { "entropy": 0.2660400390625, "epoch": 2.728094968908988, "grad_norm": 0.46812763810157776, "learning_rate": 9.017854837569629e-06, "loss": 0.27300546169281004, "mean_token_accuracy": 0.9130877435207367, "num_tokens": 45880560.0, "step": 3620 }, { "entropy": 0.2379638671875, "epoch": 2.735632183908046, "grad_norm": 0.5042068958282471, "learning_rate": 8.969282369851163e-06, "loss": 0.24074835777282716, "mean_token_accuracy": 0.921598632633686, "num_tokens": 45993797.0, "step": 3630 }, { "entropy": 0.2520263671875, "epoch": 2.7431693989071038, "grad_norm": 0.48145022988319397, "learning_rate": 8.920734468530773e-06, "loss": 0.2605001211166382, "mean_token_accuracy": 0.918573509156704, "num_tokens": 46112002.0, "step": 3640 }, { "entropy": 0.25791015625, "epoch": 2.7507066139061616, "grad_norm": 0.3994383215904236, "learning_rate": 8.872212290712047e-06, "loss": 0.2658211708068848, "mean_token_accuracy": 0.9159253165125847, "num_tokens": 46240729.0, "step": 3650 }, { "entropy": 0.271435546875, "epoch": 2.7582438289052194, "grad_norm": 0.39268237352371216, "learning_rate": 8.823716992885475e-06, "loss": 0.2839186191558838, "mean_token_accuracy": 0.9141981810331344, "num_tokens": 46368015.0, "step": 3660 }, { "entropy": 0.2667236328125, "epoch": 2.765781043904277, "grad_norm": 0.39958369731903076, "learning_rate": 8.77524973090088e-06, "loss": 0.27642645835876467, "mean_token_accuracy": 0.9151778295636177, "num_tokens": 46515273.0, "step": 3670 }, { "entropy": 0.29097900390625, "epoch": 2.773318258903335, "grad_norm": 0.42510679364204407, "learning_rate": 8.726811659939877e-06, "loss": 0.29592735767364503, "mean_token_accuracy": 0.9093442618846893, "num_tokens": 46639287.0, "step": 3680 }, { "entropy": 0.271142578125, "epoch": 2.780855473902393, "grad_norm": 0.41649726033210754, "learning_rate": 8.678403934488325e-06, "loss": 0.27806544303894043, "mean_token_accuracy": 0.914185406267643, "num_tokens": 46755940.0, "step": 3690 }, { "entropy": 0.2638916015625, "epoch": 2.788392688901451, "grad_norm": 0.42742252349853516, "learning_rate": 8.630027708308826e-06, "loss": 0.2767770290374756, "mean_token_accuracy": 0.9134870544075966, "num_tokens": 46889885.0, "step": 3700 }, { "entropy": 0.2822509765625, "epoch": 2.7959299039005088, "grad_norm": 0.3878902792930603, "learning_rate": 8.581684134413216e-06, "loss": 0.27821874618530273, "mean_token_accuracy": 0.9127815574407577, "num_tokens": 47019960.0, "step": 3710 }, { "entropy": 0.272314453125, "epoch": 2.8034671188995666, "grad_norm": 0.373980849981308, "learning_rate": 8.533374365035089e-06, "loss": 0.28022453784942625, "mean_token_accuracy": 0.9120476201176644, "num_tokens": 47153538.0, "step": 3720 }, { "entropy": 0.2423095703125, "epoch": 2.8110043338986244, "grad_norm": 0.3966856300830841, "learning_rate": 8.485099551602341e-06, "loss": 0.24279303550720216, "mean_token_accuracy": 0.9210615813732147, "num_tokens": 47278367.0, "step": 3730 }, { "entropy": 0.253173828125, "epoch": 2.818541548897682, "grad_norm": 0.424553781747818, "learning_rate": 8.436860844709708e-06, "loss": 0.2533012866973877, "mean_token_accuracy": 0.9188416093587876, "num_tokens": 47401970.0, "step": 3740 }, { "epoch": 2.818541548897682, "eval_entropy": 0.2633541980421687, "eval_loss": 0.2967968285083771, "eval_mean_token_accuracy": 0.9093607121023787, "eval_num_tokens": 47401970.0, "eval_runtime": 444.0882, "eval_samples_per_second": 5.974, "eval_steps_per_second": 1.495, "step": 3740 }, { "entropy": 0.2485107421875, "epoch": 2.8260787638967404, "grad_norm": 0.4144607186317444, "learning_rate": 8.388659394091362e-06, "loss": 0.256608772277832, "mean_token_accuracy": 0.9184371501207351, "num_tokens": 47536067.0, "step": 3750 }, { "entropy": 0.2462890625, "epoch": 2.833615978895798, "grad_norm": 0.4533601701259613, "learning_rate": 8.340496348593485e-06, "loss": 0.25168781280517577, "mean_token_accuracy": 0.919621941447258, "num_tokens": 47659072.0, "step": 3760 }, { "entropy": 0.242138671875, "epoch": 2.841153193894856, "grad_norm": 0.4203242063522339, "learning_rate": 8.292372856146919e-06, "loss": 0.2485339403152466, "mean_token_accuracy": 0.9196742460131645, "num_tokens": 47785829.0, "step": 3770 }, { "entropy": 0.2552490234375, "epoch": 2.848690408893914, "grad_norm": 0.3394729793071747, "learning_rate": 8.244290063739776e-06, "loss": 0.25977215766906736, "mean_token_accuracy": 0.9153026059269905, "num_tokens": 47913628.0, "step": 3780 }, { "entropy": 0.27724609375, "epoch": 2.8562276238929716, "grad_norm": 0.4583624303340912, "learning_rate": 8.196249117390112e-06, "loss": 0.2713502883911133, "mean_token_accuracy": 0.913399763405323, "num_tokens": 48040647.0, "step": 3790 }, { "entropy": 0.25810546875, "epoch": 2.8637648388920294, "grad_norm": 0.40007394552230835, "learning_rate": 8.148251162118625e-06, "loss": 0.26303553581237793, "mean_token_accuracy": 0.9153849989175796, "num_tokens": 48170847.0, "step": 3800 }, { "entropy": 0.2434814453125, "epoch": 2.871302053891087, "grad_norm": 0.3815859258174896, "learning_rate": 8.100297341921342e-06, "loss": 0.2506600856781006, "mean_token_accuracy": 0.9199610412120819, "num_tokens": 48290214.0, "step": 3810 }, { "entropy": 0.2513671875, "epoch": 2.878839268890145, "grad_norm": 0.38468119502067566, "learning_rate": 8.05238879974236e-06, "loss": 0.2547659635543823, "mean_token_accuracy": 0.9180278465151787, "num_tokens": 48414986.0, "step": 3820 }, { "entropy": 0.2574951171875, "epoch": 2.8863764838892028, "grad_norm": 0.48956918716430664, "learning_rate": 8.00452667744662e-06, "loss": 0.2638235092163086, "mean_token_accuracy": 0.9166240409016609, "num_tokens": 48531392.0, "step": 3830 }, { "entropy": 0.267822265625, "epoch": 2.8939136988882606, "grad_norm": 0.5001468658447266, "learning_rate": 7.956712115792666e-06, "loss": 0.2735679388046265, "mean_token_accuracy": 0.9156135901808738, "num_tokens": 48664784.0, "step": 3840 }, { "entropy": 0.2489990234375, "epoch": 2.901450913887319, "grad_norm": 0.46188080310821533, "learning_rate": 7.908946254405477e-06, "loss": 0.2521179676055908, "mean_token_accuracy": 0.9186730876564979, "num_tokens": 48786675.0, "step": 3850 }, { "entropy": 0.2811767578125, "epoch": 2.9089881288863766, "grad_norm": 0.3843408226966858, "learning_rate": 7.86123023174929e-06, "loss": 0.28948609828948973, "mean_token_accuracy": 0.911932322382927, "num_tokens": 48926071.0, "step": 3860 }, { "entropy": 0.270263671875, "epoch": 2.9165253438854344, "grad_norm": 0.3932430148124695, "learning_rate": 7.813565185100487e-06, "loss": 0.2777218818664551, "mean_token_accuracy": 0.9139480367302895, "num_tokens": 49059803.0, "step": 3870 }, { "entropy": 0.243212890625, "epoch": 2.924062558884492, "grad_norm": 0.48365503549575806, "learning_rate": 7.765952250520459e-06, "loss": 0.24481496810913086, "mean_token_accuracy": 0.9214571461081504, "num_tokens": 49188445.0, "step": 3880 }, { "entropy": 0.239501953125, "epoch": 2.93159977388355, "grad_norm": 0.37279045581817627, "learning_rate": 7.71839256282855e-06, "loss": 0.24772932529449462, "mean_token_accuracy": 0.9205403715372086, "num_tokens": 49317486.0, "step": 3890 }, { "entropy": 0.2743408203125, "epoch": 2.9391369888826078, "grad_norm": 0.4030146598815918, "learning_rate": 7.670887255575003e-06, "loss": 0.2839582204818726, "mean_token_accuracy": 0.9123036295175553, "num_tokens": 49455758.0, "step": 3900 }, { "entropy": 0.243994140625, "epoch": 2.9466742038816656, "grad_norm": 0.37864017486572266, "learning_rate": 7.623437461013941e-06, "loss": 0.24827678203582765, "mean_token_accuracy": 0.9205136641860008, "num_tokens": 49582414.0, "step": 3910 }, { "epoch": 2.9466742038816656, "eval_entropy": 0.26600003529743976, "eval_loss": 0.29588836431503296, "eval_mean_token_accuracy": 0.909692998032972, "eval_num_tokens": 49582414.0, "eval_runtime": 444.4984, "eval_samples_per_second": 5.969, "eval_steps_per_second": 1.494, "step": 3910 }, { "entropy": 0.23487548828125, "epoch": 2.954211418880724, "grad_norm": 0.4359188675880432, "learning_rate": 7.576044310076388e-06, "loss": 0.23804020881652832, "mean_token_accuracy": 0.9226861000061035, "num_tokens": 49706454.0, "step": 3920 }, { "entropy": 0.2821044921875, "epoch": 2.9617486338797816, "grad_norm": 0.4656037390232086, "learning_rate": 7.5287089323433035e-06, "loss": 0.2857757806777954, "mean_token_accuracy": 0.9117534056305885, "num_tokens": 49840228.0, "step": 3930 }, { "entropy": 0.27659912109375, "epoch": 2.9692858488788394, "grad_norm": 0.35202714800834656, "learning_rate": 7.481432456018671e-06, "loss": 0.2831352949142456, "mean_token_accuracy": 0.9127496406435966, "num_tokens": 49973240.0, "step": 3940 }, { "entropy": 0.2625244140625, "epoch": 2.976823063877897, "grad_norm": 0.4686535596847534, "learning_rate": 7.434216007902598e-06, "loss": 0.2630059242248535, "mean_token_accuracy": 0.9144649460911751, "num_tokens": 50094039.0, "step": 3950 }, { "entropy": 0.255615234375, "epoch": 2.984360278876955, "grad_norm": 0.4569144546985626, "learning_rate": 7.387060713364462e-06, "loss": 0.26566917896270753, "mean_token_accuracy": 0.9165397122502327, "num_tokens": 50208282.0, "step": 3960 }, { "entropy": 0.2490234375, "epoch": 2.991897493876013, "grad_norm": 0.4426827132701874, "learning_rate": 7.33996769631609e-06, "loss": 0.25277419090270997, "mean_token_accuracy": 0.9186919391155243, "num_tokens": 50328886.0, "step": 3970 }, { "entropy": 0.2667724609375, "epoch": 2.9994347088750706, "grad_norm": 0.48642250895500183, "learning_rate": 7.292938079184979e-06, "loss": 0.2723618745803833, "mean_token_accuracy": 0.9138344705104828, "num_tokens": 50454506.0, "step": 3980 }, { "entropy": 0.2523036858974359, "epoch": 3.006783493499152, "grad_norm": 0.48612406849861145, "learning_rate": 7.2459729828875256e-06, "loss": 0.25093731880187986, "mean_token_accuracy": 0.9203954384877131, "num_tokens": 50563331.0, "step": 3990 }, { "entropy": 0.2311279296875, "epoch": 3.01432070849821, "grad_norm": 0.3902427554130554, "learning_rate": 7.199073526802322e-06, "loss": 0.23201241493225097, "mean_token_accuracy": 0.9242525264620781, "num_tokens": 50688841.0, "step": 4000 }, { "entropy": 0.24853515625, "epoch": 3.021857923497268, "grad_norm": 0.3865509331226349, "learning_rate": 7.1522408287434774e-06, "loss": 0.2584357738494873, "mean_token_accuracy": 0.9196509182453155, "num_tokens": 50823608.0, "step": 4010 }, { "entropy": 0.23577880859375, "epoch": 3.0293951384963256, "grad_norm": 0.47226399183273315, "learning_rate": 7.105476004933973e-06, "loss": 0.23722119331359864, "mean_token_accuracy": 0.9245356351137162, "num_tokens": 50952093.0, "step": 4020 }, { "entropy": 0.24713134765625, "epoch": 3.0369323534953834, "grad_norm": 0.5489491820335388, "learning_rate": 7.058780169979051e-06, "loss": 0.25731186866760253, "mean_token_accuracy": 0.9205514118075371, "num_tokens": 51078395.0, "step": 4030 }, { "entropy": 0.2447509765625, "epoch": 3.044469568494441, "grad_norm": 0.442008912563324, "learning_rate": 7.012154436839664e-06, "loss": 0.250858998298645, "mean_token_accuracy": 0.9203956529498101, "num_tokens": 51206927.0, "step": 4040 }, { "entropy": 0.2478759765625, "epoch": 3.052006783493499, "grad_norm": 0.5229147672653198, "learning_rate": 6.965599916805927e-06, "loss": 0.2520869731903076, "mean_token_accuracy": 0.9199037939310074, "num_tokens": 51323632.0, "step": 4050 }, { "entropy": 0.2457275390625, "epoch": 3.059543998492557, "grad_norm": 0.4642680287361145, "learning_rate": 6.919117719470655e-06, "loss": 0.25035810470581055, "mean_token_accuracy": 0.9208179607987403, "num_tokens": 51450728.0, "step": 4060 }, { "entropy": 0.23104248046875, "epoch": 3.067081213491615, "grad_norm": 0.46121546626091003, "learning_rate": 6.872708952702893e-06, "loss": 0.2347405433654785, "mean_token_accuracy": 0.9219806760549545, "num_tokens": 51568454.0, "step": 4070 }, { "entropy": 0.2685791015625, "epoch": 3.074618428490673, "grad_norm": 0.5084824562072754, "learning_rate": 6.826374722621536e-06, "loss": 0.27871730327606203, "mean_token_accuracy": 0.914721603691578, "num_tokens": 51692485.0, "step": 4080 }, { "epoch": 3.074618428490673, "eval_entropy": 0.25480192253388556, "eval_loss": 0.29853206872940063, "eval_mean_token_accuracy": 0.9095420700957976, "eval_num_tokens": 51692485.0, "eval_runtime": 444.6635, "eval_samples_per_second": 5.966, "eval_steps_per_second": 1.493, "step": 4080 }, { "entropy": 0.257958984375, "epoch": 3.0821556434897306, "grad_norm": 0.4730566143989563, "learning_rate": 6.780116133568943e-06, "loss": 0.26084840297698975, "mean_token_accuracy": 0.9181940242648124, "num_tokens": 51819563.0, "step": 4090 }, { "entropy": 0.2264892578125, "epoch": 3.0896928584887884, "grad_norm": 0.4408583343029022, "learning_rate": 6.733934288084624e-06, "loss": 0.22071993350982666, "mean_token_accuracy": 0.928843292593956, "num_tokens": 51957836.0, "step": 4100 }, { "entropy": 0.240869140625, "epoch": 3.097230073487846, "grad_norm": 0.41696277260780334, "learning_rate": 6.687830286878968e-06, "loss": 0.24481325149536132, "mean_token_accuracy": 0.9215219706296921, "num_tokens": 52085471.0, "step": 4110 }, { "entropy": 0.249609375, "epoch": 3.104767288486904, "grad_norm": 0.45289766788482666, "learning_rate": 6.641805228806994e-06, "loss": 0.2558360815048218, "mean_token_accuracy": 0.9204878672957421, "num_tokens": 52210380.0, "step": 4120 }, { "entropy": 0.25283203125, "epoch": 3.1123045034859618, "grad_norm": 0.48902979493141174, "learning_rate": 6.5958602108421796e-06, "loss": 0.26007556915283203, "mean_token_accuracy": 0.9192629650235176, "num_tokens": 52344583.0, "step": 4130 }, { "entropy": 0.2415771484375, "epoch": 3.11984171848502, "grad_norm": 0.4995759129524231, "learning_rate": 6.549996328050296e-06, "loss": 0.24606029987335204, "mean_token_accuracy": 0.9220411941409111, "num_tokens": 52481392.0, "step": 4140 }, { "entropy": 0.2508056640625, "epoch": 3.127378933484078, "grad_norm": 0.5180537104606628, "learning_rate": 6.504214673563321e-06, "loss": 0.25423905849456785, "mean_token_accuracy": 0.9189393475651741, "num_tokens": 52598987.0, "step": 4150 }, { "entropy": 0.2357666015625, "epoch": 3.1349161484831356, "grad_norm": 0.505828320980072, "learning_rate": 6.458516338553387e-06, "loss": 0.24432835578918458, "mean_token_accuracy": 0.9223694607615471, "num_tokens": 52725067.0, "step": 4160 }, { "entropy": 0.246435546875, "epoch": 3.1424533634821934, "grad_norm": 0.565288245677948, "learning_rate": 6.41290241220676e-06, "loss": 0.2593379020690918, "mean_token_accuracy": 0.918650609254837, "num_tokens": 52845379.0, "step": 4170 }, { "entropy": 0.2607177734375, "epoch": 3.149990578481251, "grad_norm": 0.45378032326698303, "learning_rate": 6.367373981697889e-06, "loss": 0.26407182216644287, "mean_token_accuracy": 0.9182954132556915, "num_tokens": 52977261.0, "step": 4180 }, { "entropy": 0.2532958984375, "epoch": 3.157527793480309, "grad_norm": 0.42719534039497375, "learning_rate": 6.321932132163493e-06, "loss": 0.26045353412628175, "mean_token_accuracy": 0.9192585989832878, "num_tokens": 53110441.0, "step": 4190 }, { "entropy": 0.2584716796875, "epoch": 3.165065008479367, "grad_norm": 0.48866167664527893, "learning_rate": 6.276577946676696e-06, "loss": 0.27137844562530516, "mean_token_accuracy": 0.9169502511620522, "num_tokens": 53239158.0, "step": 4200 }, { "entropy": 0.23046875, "epoch": 3.1726022234784246, "grad_norm": 0.4197594225406647, "learning_rate": 6.231312506221219e-06, "loss": 0.23780272006988526, "mean_token_accuracy": 0.9241486981511116, "num_tokens": 53368874.0, "step": 4210 }, { "entropy": 0.2381103515625, "epoch": 3.1801394384774824, "grad_norm": 0.5063280463218689, "learning_rate": 6.1861368896656e-06, "loss": 0.23919708728790284, "mean_token_accuracy": 0.9226507186889649, "num_tokens": 53496718.0, "step": 4220 }, { "entropy": 0.251904296875, "epoch": 3.1876766534765406, "grad_norm": 0.5316512584686279, "learning_rate": 6.141052173737503e-06, "loss": 0.2563410758972168, "mean_token_accuracy": 0.9189333856105805, "num_tokens": 53623940.0, "step": 4230 }, { "entropy": 0.24686279296875, "epoch": 3.1952138684755984, "grad_norm": 0.4826897382736206, "learning_rate": 6.096059432998034e-06, "loss": 0.24861443042755127, "mean_token_accuracy": 0.9219458773732185, "num_tokens": 53764009.0, "step": 4240 }, { "entropy": 0.2468017578125, "epoch": 3.202751083474656, "grad_norm": 0.46765172481536865, "learning_rate": 6.0511597398161395e-06, "loss": 0.250647234916687, "mean_token_accuracy": 0.9204504400491714, "num_tokens": 53892566.0, "step": 4250 }, { "epoch": 3.202751083474656, "eval_entropy": 0.2578801534262048, "eval_loss": 0.2983558773994446, "eval_mean_token_accuracy": 0.9092684685286269, "eval_num_tokens": 53892566.0, "eval_runtime": 443.9354, "eval_samples_per_second": 5.976, "eval_steps_per_second": 1.496, "step": 4250 }, { "entropy": 0.2371826171875, "epoch": 3.210288298473714, "grad_norm": 0.5083767771720886, "learning_rate": 6.006354164343047e-06, "loss": 0.2339548110961914, "mean_token_accuracy": 0.9240068301558495, "num_tokens": 54017602.0, "step": 4260 }, { "entropy": 0.229931640625, "epoch": 3.217825513472772, "grad_norm": 0.5524066686630249, "learning_rate": 5.961643774486754e-06, "loss": 0.24028148651123046, "mean_token_accuracy": 0.9243996739387512, "num_tokens": 54151854.0, "step": 4270 }, { "entropy": 0.2494140625, "epoch": 3.2253627284718296, "grad_norm": 0.5873595476150513, "learning_rate": 5.917029635886585e-06, "loss": 0.2616408824920654, "mean_token_accuracy": 0.919035418331623, "num_tokens": 54262389.0, "step": 4280 }, { "entropy": 0.23074951171875, "epoch": 3.2328999434708874, "grad_norm": 0.46301954984664917, "learning_rate": 5.872512811887777e-06, "loss": 0.2374636173248291, "mean_token_accuracy": 0.9259173914790153, "num_tokens": 54394237.0, "step": 4290 }, { "entropy": 0.2382568359375, "epoch": 3.240437158469945, "grad_norm": 0.41154083609580994, "learning_rate": 5.828094363516158e-06, "loss": 0.24436559677124023, "mean_token_accuracy": 0.9219806671142579, "num_tokens": 54531773.0, "step": 4300 }, { "entropy": 0.245263671875, "epoch": 3.2479743734690034, "grad_norm": 0.4517538845539093, "learning_rate": 5.783775349452831e-06, "loss": 0.25096561908721926, "mean_token_accuracy": 0.9219090670347214, "num_tokens": 54661135.0, "step": 4310 }, { "entropy": 0.2532470703125, "epoch": 3.255511588468061, "grad_norm": 0.4663011133670807, "learning_rate": 5.739556826008972e-06, "loss": 0.2571004629135132, "mean_token_accuracy": 0.918338057398796, "num_tokens": 54781768.0, "step": 4320 }, { "entropy": 0.2399658203125, "epoch": 3.263048803467119, "grad_norm": 0.4521697163581848, "learning_rate": 5.695439847100615e-06, "loss": 0.24652526378631592, "mean_token_accuracy": 0.9215589553117752, "num_tokens": 54916397.0, "step": 4330 }, { "entropy": 0.2451416015625, "epoch": 3.270586018466177, "grad_norm": 0.4162958562374115, "learning_rate": 5.651425464223577e-06, "loss": 0.24436590671539307, "mean_token_accuracy": 0.920574314892292, "num_tokens": 55040997.0, "step": 4340 }, { "entropy": 0.2452392578125, "epoch": 3.2781232334652346, "grad_norm": 0.46381431818008423, "learning_rate": 5.6075147264283526e-06, "loss": 0.2571404457092285, "mean_token_accuracy": 0.9213781818747521, "num_tokens": 55175738.0, "step": 4350 }, { "entropy": 0.24869384765625, "epoch": 3.2856604484642924, "grad_norm": 0.36787933111190796, "learning_rate": 5.56370868029515e-06, "loss": 0.253587532043457, "mean_token_accuracy": 0.9196270078420639, "num_tokens": 55312758.0, "step": 4360 }, { "entropy": 0.22239990234375, "epoch": 3.29319766346335, "grad_norm": 0.43934619426727295, "learning_rate": 5.520008369908918e-06, "loss": 0.2182994842529297, "mean_token_accuracy": 0.9281560033559799, "num_tokens": 55444635.0, "step": 4370 }, { "entropy": 0.2463134765625, "epoch": 3.300734878462408, "grad_norm": 0.5719824433326721, "learning_rate": 5.476414836834481e-06, "loss": 0.25219566822052003, "mean_token_accuracy": 0.9201019376516342, "num_tokens": 55569153.0, "step": 4380 }, { "entropy": 0.2388427734375, "epoch": 3.308272093461466, "grad_norm": 0.6103549599647522, "learning_rate": 5.432929120091691e-06, "loss": 0.24608726501464845, "mean_token_accuracy": 0.9217844411730767, "num_tokens": 55689383.0, "step": 4390 }, { "entropy": 0.2604736328125, "epoch": 3.315809308460524, "grad_norm": 0.48919445276260376, "learning_rate": 5.38955225613069e-06, "loss": 0.2672025203704834, "mean_token_accuracy": 0.9159393101930619, "num_tokens": 55818032.0, "step": 4400 }, { "entropy": 0.24017333984375, "epoch": 3.323346523459582, "grad_norm": 0.6008545756340027, "learning_rate": 5.346285278807182e-06, "loss": 0.24650108814239502, "mean_token_accuracy": 0.9232565045356751, "num_tokens": 55951704.0, "step": 4410 }, { "entropy": 0.24951171875, "epoch": 3.3308837384586396, "grad_norm": 0.5296514630317688, "learning_rate": 5.303129219357811e-06, "loss": 0.25560004711151124, "mean_token_accuracy": 0.9190060347318649, "num_tokens": 56087124.0, "step": 4420 }, { "epoch": 3.3308837384586396, "eval_entropy": 0.25144572430346385, "eval_loss": 0.29815539717674255, "eval_mean_token_accuracy": 0.9097737183412874, "eval_num_tokens": 56087124.0, "eval_runtime": 444.342, "eval_samples_per_second": 5.971, "eval_steps_per_second": 1.494, "step": 4420 }, { "entropy": 0.24404296875, "epoch": 3.3384209534576974, "grad_norm": 0.5156750082969666, "learning_rate": 5.260085106375577e-06, "loss": 0.24577805995941163, "mean_token_accuracy": 0.9231465876102447, "num_tokens": 56216768.0, "step": 4430 }, { "entropy": 0.23583984375, "epoch": 3.345958168456755, "grad_norm": 0.48873215913772583, "learning_rate": 5.217153965785315e-06, "loss": 0.24040358066558837, "mean_token_accuracy": 0.9222135201096535, "num_tokens": 56331628.0, "step": 4440 }, { "entropy": 0.236279296875, "epoch": 3.353495383455813, "grad_norm": 0.6165609955787659, "learning_rate": 5.174336820819241e-06, "loss": 0.24129061698913573, "mean_token_accuracy": 0.922450278699398, "num_tokens": 56466449.0, "step": 4450 }, { "entropy": 0.25859375, "epoch": 3.361032598454871, "grad_norm": 0.42945030331611633, "learning_rate": 5.131634691992576e-06, "loss": 0.2604536771774292, "mean_token_accuracy": 0.9179983928799629, "num_tokens": 56590258.0, "step": 4460 }, { "entropy": 0.2478515625, "epoch": 3.3685698134539286, "grad_norm": 0.3764921724796295, "learning_rate": 5.089048597079218e-06, "loss": 0.25089526176452637, "mean_token_accuracy": 0.918754868209362, "num_tokens": 56712466.0, "step": 4470 }, { "entropy": 0.251513671875, "epoch": 3.376107028452987, "grad_norm": 0.5503227710723877, "learning_rate": 5.046579551087469e-06, "loss": 0.25963895320892333, "mean_token_accuracy": 0.9187079787254333, "num_tokens": 56838324.0, "step": 4480 }, { "entropy": 0.24443359375, "epoch": 3.3836442434520446, "grad_norm": 0.4642918109893799, "learning_rate": 5.0042285662358715e-06, "loss": 0.25160040855407717, "mean_token_accuracy": 0.9221544966101647, "num_tokens": 56971672.0, "step": 4490 }, { "entropy": 0.22529296875, "epoch": 3.3911814584511024, "grad_norm": 0.47102871537208557, "learning_rate": 4.961996651929053e-06, "loss": 0.23354432582855225, "mean_token_accuracy": 0.9269132241606712, "num_tokens": 57101256.0, "step": 4500 }, { "entropy": 0.2195068359375, "epoch": 3.39871867345016, "grad_norm": 0.4792303144931793, "learning_rate": 4.9198848147336935e-06, "loss": 0.22426846027374267, "mean_token_accuracy": 0.9267282068729401, "num_tokens": 57220336.0, "step": 4510 }, { "entropy": 0.23193359375, "epoch": 3.406255888449218, "grad_norm": 0.46890905499458313, "learning_rate": 4.877894058354518e-06, "loss": 0.23823246955871583, "mean_token_accuracy": 0.9238113984465599, "num_tokens": 57351375.0, "step": 4520 }, { "entropy": 0.259375, "epoch": 3.413793103448276, "grad_norm": 0.4295634925365448, "learning_rate": 4.836025383610382e-06, "loss": 0.26934764385223386, "mean_token_accuracy": 0.9180942147970199, "num_tokens": 57492948.0, "step": 4530 }, { "entropy": 0.23662109375, "epoch": 3.4213303184473336, "grad_norm": 0.4977467656135559, "learning_rate": 4.794279788410408e-06, "loss": 0.23803329467773438, "mean_token_accuracy": 0.9239297583699226, "num_tokens": 57617213.0, "step": 4540 }, { "entropy": 0.2344482421875, "epoch": 3.4288675334463914, "grad_norm": 0.5020400881767273, "learning_rate": 4.752658267730218e-06, "loss": 0.24145655632019042, "mean_token_accuracy": 0.9231008142232895, "num_tokens": 57755087.0, "step": 4550 }, { "entropy": 0.23726806640625, "epoch": 3.436404748445449, "grad_norm": 0.5047474503517151, "learning_rate": 4.711161813588198e-06, "loss": 0.24432265758514404, "mean_token_accuracy": 0.921500913798809, "num_tokens": 57881092.0, "step": 4560 }, { "entropy": 0.2539306640625, "epoch": 3.4439419634445074, "grad_norm": 0.5615915060043335, "learning_rate": 4.6697914150218726e-06, "loss": 0.26180734634399416, "mean_token_accuracy": 0.9188700020313263, "num_tokens": 58019422.0, "step": 4570 }, { "entropy": 0.2443115234375, "epoch": 3.451479178443565, "grad_norm": 0.41278159618377686, "learning_rate": 4.6285480580643214e-06, "loss": 0.24113664627075196, "mean_token_accuracy": 0.92239079028368, "num_tokens": 58144501.0, "step": 4580 }, { "entropy": 0.249853515625, "epoch": 3.459016393442623, "grad_norm": 0.48389744758605957, "learning_rate": 4.587432725720687e-06, "loss": 0.2561469554901123, "mean_token_accuracy": 0.9191392526030541, "num_tokens": 58274208.0, "step": 4590 }, { "epoch": 3.459016393442623, "eval_entropy": 0.2534054675734187, "eval_loss": 0.2973636984825134, "eval_mean_token_accuracy": 0.9099213545580944, "eval_num_tokens": 58274208.0, "eval_runtime": 444.1047, "eval_samples_per_second": 5.974, "eval_steps_per_second": 1.495, "step": 4590 }, { "entropy": 0.25052490234375, "epoch": 3.466553608441681, "grad_norm": 0.48276710510253906, "learning_rate": 4.5464463979447245e-06, "loss": 0.2551881313323975, "mean_token_accuracy": 0.9179890528321266, "num_tokens": 58399143.0, "step": 4600 }, { "entropy": 0.23720703125, "epoch": 3.4740908234407386, "grad_norm": 0.49638012051582336, "learning_rate": 4.505590051615478e-06, "loss": 0.24317293167114257, "mean_token_accuracy": 0.9220433473587036, "num_tokens": 58518939.0, "step": 4610 }, { "entropy": 0.23392333984375, "epoch": 3.4816280384397964, "grad_norm": 0.512684166431427, "learning_rate": 4.4648646605139605e-06, "loss": 0.23999152183532715, "mean_token_accuracy": 0.9236366301774979, "num_tokens": 58645386.0, "step": 4620 }, { "entropy": 0.2496337890625, "epoch": 3.489165253438854, "grad_norm": 0.476936399936676, "learning_rate": 4.424271195299981e-06, "loss": 0.25567328929901123, "mean_token_accuracy": 0.9208142340183259, "num_tokens": 58774633.0, "step": 4630 }, { "entropy": 0.2439453125, "epoch": 3.4967024684379124, "grad_norm": 0.4863242208957672, "learning_rate": 4.383810623488973e-06, "loss": 0.2511773109436035, "mean_token_accuracy": 0.9208297878503799, "num_tokens": 58890700.0, "step": 4640 }, { "entropy": 0.2301513671875, "epoch": 3.5042396834369702, "grad_norm": 0.4208335280418396, "learning_rate": 4.343483909428978e-06, "loss": 0.23434915542602539, "mean_token_accuracy": 0.926320880651474, "num_tokens": 59023930.0, "step": 4650 }, { "entropy": 0.2602294921875, "epoch": 3.511776898436028, "grad_norm": 0.5129518508911133, "learning_rate": 4.3032920142776125e-06, "loss": 0.2699117660522461, "mean_token_accuracy": 0.9175953105092048, "num_tokens": 59148853.0, "step": 4660 }, { "entropy": 0.232763671875, "epoch": 3.519314113435086, "grad_norm": 0.48988714814186096, "learning_rate": 4.2632358959791984e-06, "loss": 0.24585673809051514, "mean_token_accuracy": 0.9236719325184822, "num_tokens": 59270325.0, "step": 4670 }, { "entropy": 0.2343994140625, "epoch": 3.5268513284341436, "grad_norm": 0.5187233686447144, "learning_rate": 4.2233165092419045e-06, "loss": 0.23766450881958007, "mean_token_accuracy": 0.9215475022792816, "num_tokens": 59390235.0, "step": 4680 }, { "entropy": 0.2481201171875, "epoch": 3.5343885434332014, "grad_norm": 0.5581011772155762, "learning_rate": 4.183534805515017e-06, "loss": 0.2518896579742432, "mean_token_accuracy": 0.9208254173398018, "num_tokens": 59523333.0, "step": 4690 }, { "entropy": 0.2261474609375, "epoch": 3.541925758432259, "grad_norm": 0.4673849046230316, "learning_rate": 4.143891732966233e-06, "loss": 0.222815203666687, "mean_token_accuracy": 0.9255363285541535, "num_tokens": 59644999.0, "step": 4700 }, { "entropy": 0.238232421875, "epoch": 3.549462973431317, "grad_norm": 0.4689350724220276, "learning_rate": 4.1043882364590895e-06, "loss": 0.24630405902862548, "mean_token_accuracy": 0.9213015034794807, "num_tokens": 59768160.0, "step": 4710 }, { "entropy": 0.246630859375, "epoch": 3.557000188430375, "grad_norm": 0.5590668320655823, "learning_rate": 4.065025257530425e-06, "loss": 0.2526021718978882, "mean_token_accuracy": 0.9192856788635254, "num_tokens": 59893438.0, "step": 4720 }, { "entropy": 0.2509765625, "epoch": 3.5645374034294326, "grad_norm": 0.5854102373123169, "learning_rate": 4.025803734367951e-06, "loss": 0.2594055414199829, "mean_token_accuracy": 0.9179863676428794, "num_tokens": 60011320.0, "step": 4730 }, { "entropy": 0.2639892578125, "epoch": 3.572074618428491, "grad_norm": 0.4343920648097992, "learning_rate": 3.986724601787874e-06, "loss": 0.27078163623809814, "mean_token_accuracy": 0.9166007101535797, "num_tokens": 60132251.0, "step": 4740 }, { "entropy": 0.2543212890625, "epoch": 3.5796118334275486, "grad_norm": 0.5742672681808472, "learning_rate": 3.947788791212636e-06, "loss": 0.2545814037322998, "mean_token_accuracy": 0.9177268758416176, "num_tokens": 60250677.0, "step": 4750 }, { "entropy": 0.2412841796875, "epoch": 3.5871490484266064, "grad_norm": 0.47204774618148804, "learning_rate": 3.908997230648693e-06, "loss": 0.2479944944381714, "mean_token_accuracy": 0.9224215567111969, "num_tokens": 60384182.0, "step": 4760 }, { "epoch": 3.5871490484266064, "eval_entropy": 0.2532833972609187, "eval_loss": 0.2967984080314636, "eval_mean_token_accuracy": 0.9098558257143181, "eval_num_tokens": 60384182.0, "eval_runtime": 444.2337, "eval_samples_per_second": 5.972, "eval_steps_per_second": 1.495, "step": 4760 }, { "entropy": 0.2306640625, "epoch": 3.594686263425664, "grad_norm": 0.44733676314353943, "learning_rate": 3.870350844664421e-06, "loss": 0.23280799388885498, "mean_token_accuracy": 0.9231883391737938, "num_tokens": 60512836.0, "step": 4770 }, { "entropy": 0.22529296875, "epoch": 3.602223478424722, "grad_norm": 0.4727942645549774, "learning_rate": 3.831850554368062e-06, "loss": 0.2281050443649292, "mean_token_accuracy": 0.9263469472527504, "num_tokens": 60644876.0, "step": 4780 }, { "entropy": 0.2620361328125, "epoch": 3.60976069342378, "grad_norm": 0.5005683302879333, "learning_rate": 3.7934972773857637e-06, "loss": 0.2716717481613159, "mean_token_accuracy": 0.9157996863126755, "num_tokens": 60767111.0, "step": 4790 }, { "entropy": 0.239306640625, "epoch": 3.6172979084228376, "grad_norm": 0.5814849734306335, "learning_rate": 3.7552919278397335e-06, "loss": 0.24393236637115479, "mean_token_accuracy": 0.9211369171738625, "num_tokens": 60888646.0, "step": 4800 }, { "entropy": 0.23623046875, "epoch": 3.624835123421896, "grad_norm": 0.5132681727409363, "learning_rate": 3.7172354163264324e-06, "loss": 0.23972315788269044, "mean_token_accuracy": 0.9234942555427551, "num_tokens": 61006787.0, "step": 4810 }, { "entropy": 0.239892578125, "epoch": 3.6323723384209536, "grad_norm": 0.449523001909256, "learning_rate": 3.6793286498948777e-06, "loss": 0.250550365447998, "mean_token_accuracy": 0.9213675454258918, "num_tokens": 61136494.0, "step": 4820 }, { "entropy": 0.23447265625, "epoch": 3.6399095534200114, "grad_norm": 0.4843718707561493, "learning_rate": 3.641572532025014e-06, "loss": 0.2334545373916626, "mean_token_accuracy": 0.9240896537899971, "num_tokens": 61255513.0, "step": 4830 }, { "entropy": 0.2620361328125, "epoch": 3.6474467684190692, "grad_norm": 0.48772865533828735, "learning_rate": 3.603967962606201e-06, "loss": 0.26780409812927247, "mean_token_accuracy": 0.9164189457893371, "num_tokens": 61377835.0, "step": 4840 }, { "entropy": 0.232861328125, "epoch": 3.654983983418127, "grad_norm": 0.488202303647995, "learning_rate": 3.566515837915738e-06, "loss": 0.2365469217300415, "mean_token_accuracy": 0.9234168440103531, "num_tokens": 61510553.0, "step": 4850 }, { "entropy": 0.2384765625, "epoch": 3.662521198417185, "grad_norm": 0.48342105746269226, "learning_rate": 3.5292170505975286e-06, "loss": 0.24164836406707763, "mean_token_accuracy": 0.9242537707090378, "num_tokens": 61641190.0, "step": 4860 }, { "entropy": 0.245166015625, "epoch": 3.6700584134162426, "grad_norm": 0.4898669421672821, "learning_rate": 3.4920724896407877e-06, "loss": 0.2510417699813843, "mean_token_accuracy": 0.9203757330775261, "num_tokens": 61772842.0, "step": 4870 }, { "entropy": 0.23450927734375, "epoch": 3.6775956284153004, "grad_norm": 0.5533488988876343, "learning_rate": 3.455083040358861e-06, "loss": 0.23881711959838867, "mean_token_accuracy": 0.9239112094044686, "num_tokens": 61901653.0, "step": 4880 }, { "entropy": 0.2240234375, "epoch": 3.685132843414358, "grad_norm": 0.3996533155441284, "learning_rate": 3.4182495843681117e-06, "loss": 0.22698888778686524, "mean_token_accuracy": 0.927504974603653, "num_tokens": 62041188.0, "step": 4890 }, { "entropy": 0.24088134765625, "epoch": 3.692670058413416, "grad_norm": 0.49964672327041626, "learning_rate": 3.3815729995669322e-06, "loss": 0.24840447902679444, "mean_token_accuracy": 0.9213329881429673, "num_tokens": 62173168.0, "step": 4900 }, { "entropy": 0.22628173828125, "epoch": 3.7002072734124742, "grad_norm": 0.4857988953590393, "learning_rate": 3.345054160114789e-06, "loss": 0.22398624420166016, "mean_token_accuracy": 0.9263280004262924, "num_tokens": 62297740.0, "step": 4910 }, { "entropy": 0.246728515625, "epoch": 3.707744488411532, "grad_norm": 0.4899304509162903, "learning_rate": 3.308693936411421e-06, "loss": 0.25445635318756105, "mean_token_accuracy": 0.920192101597786, "num_tokens": 62418710.0, "step": 4920 }, { "entropy": 0.24462890625, "epoch": 3.71528170341059, "grad_norm": 0.4868662655353546, "learning_rate": 3.2724931950760576e-06, "loss": 0.24715008735656738, "mean_token_accuracy": 0.9194081127643585, "num_tokens": 62538535.0, "step": 4930 }, { "epoch": 3.71528170341059, "eval_entropy": 0.25196268472326805, "eval_loss": 0.2968800365924835, "eval_mean_token_accuracy": 0.9099598022469555, "eval_num_tokens": 62538535.0, "eval_runtime": 444.76, "eval_samples_per_second": 5.965, "eval_steps_per_second": 1.493, "step": 4930 }, { "entropy": 0.2277587890625, "epoch": 3.7228189184096476, "grad_norm": 0.5071448683738708, "learning_rate": 3.236452798926807e-06, "loss": 0.2292656660079956, "mean_token_accuracy": 0.9266470044851303, "num_tokens": 62663129.0, "step": 4940 }, { "entropy": 0.249853515625, "epoch": 3.7303561334087054, "grad_norm": 0.46776777505874634, "learning_rate": 3.2005736069600446e-06, "loss": 0.25865788459777833, "mean_token_accuracy": 0.9170892059803009, "num_tokens": 62779198.0, "step": 4950 }, { "entropy": 0.253662109375, "epoch": 3.737893348407763, "grad_norm": 0.5072009563446045, "learning_rate": 3.1648564743299793e-06, "loss": 0.2605839729309082, "mean_token_accuracy": 0.9192040726542473, "num_tokens": 62906493.0, "step": 4960 }, { "entropy": 0.249267578125, "epoch": 3.7454305634068215, "grad_norm": 0.5265138149261475, "learning_rate": 3.12930225232824e-06, "loss": 0.2564325571060181, "mean_token_accuracy": 0.9199110895395279, "num_tokens": 63034082.0, "step": 4970 }, { "entropy": 0.238427734375, "epoch": 3.7529677784058793, "grad_norm": 0.4928956627845764, "learning_rate": 3.093911788363617e-06, "loss": 0.2413705825805664, "mean_token_accuracy": 0.9228529289364815, "num_tokens": 63157973.0, "step": 4980 }, { "entropy": 0.2524169921875, "epoch": 3.760504993404937, "grad_norm": 0.5981191992759705, "learning_rate": 3.058685925941832e-06, "loss": 0.2596710443496704, "mean_token_accuracy": 0.9180012375116349, "num_tokens": 63280137.0, "step": 4990 }, { "entropy": 0.23251953125, "epoch": 3.768042208403995, "grad_norm": 0.482380211353302, "learning_rate": 3.023625504645459e-06, "loss": 0.24188435077667236, "mean_token_accuracy": 0.9233495354652405, "num_tokens": 63406930.0, "step": 5000 }, { "entropy": 0.23822021484375, "epoch": 3.7755794234030526, "grad_norm": 0.5340070128440857, "learning_rate": 2.9887313601139023e-06, "loss": 0.24011678695678712, "mean_token_accuracy": 0.9242303058505058, "num_tokens": 63533137.0, "step": 5010 }, { "entropy": 0.24560546875, "epoch": 3.7831166384021104, "grad_norm": 0.4129692316055298, "learning_rate": 2.954004324023485e-06, "loss": 0.25254933834075927, "mean_token_accuracy": 0.9207971751689911, "num_tokens": 63665433.0, "step": 5020 }, { "entropy": 0.2470947265625, "epoch": 3.7906538534011682, "grad_norm": 0.4447065591812134, "learning_rate": 2.919445224067614e-06, "loss": 0.2541998624801636, "mean_token_accuracy": 0.9211808830499649, "num_tokens": 63793265.0, "step": 5030 }, { "entropy": 0.242724609375, "epoch": 3.798191068400226, "grad_norm": 0.4375300109386444, "learning_rate": 2.885054883937073e-06, "loss": 0.24628190994262694, "mean_token_accuracy": 0.9202960833907128, "num_tokens": 63913932.0, "step": 5040 }, { "entropy": 0.2439208984375, "epoch": 3.805728283399284, "grad_norm": 0.5313498973846436, "learning_rate": 2.8508341233003656e-06, "loss": 0.2506706237792969, "mean_token_accuracy": 0.9210630789399147, "num_tokens": 64035256.0, "step": 5050 }, { "entropy": 0.2599853515625, "epoch": 3.8132654983983416, "grad_norm": 0.5273305773735046, "learning_rate": 2.816783757784206e-06, "loss": 0.2702688217163086, "mean_token_accuracy": 0.9156295627355575, "num_tokens": 64156686.0, "step": 5060 }, { "entropy": 0.25810546875, "epoch": 3.8208027133973994, "grad_norm": 0.5010347962379456, "learning_rate": 2.7829045989540594e-06, "loss": 0.2638701915740967, "mean_token_accuracy": 0.9181295543909073, "num_tokens": 64286554.0, "step": 5070 }, { "entropy": 0.2409423828125, "epoch": 3.8283399283964576, "grad_norm": 0.6270024180412292, "learning_rate": 2.7491974542948087e-06, "loss": 0.24303548336029052, "mean_token_accuracy": 0.9216175884008407, "num_tokens": 64406250.0, "step": 5080 }, { "entropy": 0.2555908203125, "epoch": 3.8358771433955154, "grad_norm": 0.50421142578125, "learning_rate": 2.715663127191498e-06, "loss": 0.2657378435134888, "mean_token_accuracy": 0.918186990916729, "num_tokens": 64546008.0, "step": 5090 }, { "entropy": 0.23912353515625, "epoch": 3.8434143583945732, "grad_norm": 0.5221638083457947, "learning_rate": 2.682302416910201e-06, "loss": 0.24288854598999024, "mean_token_accuracy": 0.9223589122295379, "num_tokens": 64673887.0, "step": 5100 }, { "epoch": 3.8434143583945732, "eval_entropy": 0.25410847491528615, "eval_loss": 0.29583480954170227, "eval_mean_token_accuracy": 0.9102463329053787, "eval_num_tokens": 64673887.0, "eval_runtime": 444.3668, "eval_samples_per_second": 5.97, "eval_steps_per_second": 1.494, "step": 5100 }, { "entropy": 0.2464111328125, "epoch": 3.850951573393631, "grad_norm": 0.4669792354106903, "learning_rate": 2.6491161185789525e-06, "loss": 0.251127290725708, "mean_token_accuracy": 0.9189326271414757, "num_tokens": 64792525.0, "step": 5110 }, { "entropy": 0.23583984375, "epoch": 3.858488788392689, "grad_norm": 0.5284295678138733, "learning_rate": 2.6161050231688145e-06, "loss": 0.23496873378753663, "mean_token_accuracy": 0.9242655590176583, "num_tokens": 64927953.0, "step": 5120 }, { "entropy": 0.2385986328125, "epoch": 3.8660260033917466, "grad_norm": 0.4746510982513428, "learning_rate": 2.583269917475015e-06, "loss": 0.24602668285369872, "mean_token_accuracy": 0.9217883810400963, "num_tokens": 65060416.0, "step": 5130 }, { "entropy": 0.2327392578125, "epoch": 3.873563218390805, "grad_norm": 0.5625964999198914, "learning_rate": 2.5506115840981905e-06, "loss": 0.23991544246673585, "mean_token_accuracy": 0.9225243136286736, "num_tokens": 65180637.0, "step": 5140 }, { "entropy": 0.25853271484375, "epoch": 3.8811004333898627, "grad_norm": 0.49249470233917236, "learning_rate": 2.5181308014257445e-06, "loss": 0.2658606290817261, "mean_token_accuracy": 0.9198394268751144, "num_tokens": 65306476.0, "step": 5150 }, { "entropy": 0.2334228515625, "epoch": 3.8886376483889205, "grad_norm": 0.5490977168083191, "learning_rate": 2.485828343613288e-06, "loss": 0.23961324691772462, "mean_token_accuracy": 0.9249249547719955, "num_tokens": 65429741.0, "step": 5160 }, { "entropy": 0.22962646484375, "epoch": 3.8961748633879782, "grad_norm": 0.4870103597640991, "learning_rate": 2.453704980566194e-06, "loss": 0.2331066608428955, "mean_token_accuracy": 0.9261724725365639, "num_tokens": 65557932.0, "step": 5170 }, { "entropy": 0.2351806640625, "epoch": 3.903712078387036, "grad_norm": 0.5044042468070984, "learning_rate": 2.421761477921232e-06, "loss": 0.24697554111480713, "mean_token_accuracy": 0.9232055351138115, "num_tokens": 65685595.0, "step": 5180 }, { "entropy": 0.2565673828125, "epoch": 3.911249293386094, "grad_norm": 0.5367307662963867, "learning_rate": 2.3899985970283446e-06, "loss": 0.262367844581604, "mean_token_accuracy": 0.916471290588379, "num_tokens": 65794307.0, "step": 5190 }, { "entropy": 0.24423828125, "epoch": 3.9187865083851516, "grad_norm": 0.4560658633708954, "learning_rate": 2.358417094932477e-06, "loss": 0.255014443397522, "mean_token_accuracy": 0.9187598779797554, "num_tokens": 65921865.0, "step": 5200 }, { "entropy": 0.24368896484375, "epoch": 3.9263237233842094, "grad_norm": 0.517406165599823, "learning_rate": 2.3270177243555483e-06, "loss": 0.25057861804962156, "mean_token_accuracy": 0.9210366785526276, "num_tokens": 66042392.0, "step": 5210 }, { "entropy": 0.259814453125, "epoch": 3.9338609383832672, "grad_norm": 0.4247106909751892, "learning_rate": 2.2958012336785075e-06, "loss": 0.2645686626434326, "mean_token_accuracy": 0.9183212980628014, "num_tokens": 66174262.0, "step": 5220 }, { "entropy": 0.24361572265625, "epoch": 3.941398153382325, "grad_norm": 0.4038093388080597, "learning_rate": 2.2647683669234964e-06, "loss": 0.24378161430358886, "mean_token_accuracy": 0.9212676301598549, "num_tokens": 66308633.0, "step": 5230 }, { "entropy": 0.239697265625, "epoch": 3.948935368381383, "grad_norm": 0.5646233558654785, "learning_rate": 2.2339198637361094e-06, "loss": 0.24792141914367677, "mean_token_accuracy": 0.9222084075212479, "num_tokens": 66434122.0, "step": 5240 }, { "entropy": 0.25, "epoch": 3.956472583380441, "grad_norm": 0.5821533203125, "learning_rate": 2.2032564593677773e-06, "loss": 0.26183009147644043, "mean_token_accuracy": 0.9185786202549935, "num_tokens": 66557954.0, "step": 5250 }, { "entropy": 0.2566162109375, "epoch": 3.964009798379499, "grad_norm": 0.5635284781455994, "learning_rate": 2.172778884658231e-06, "loss": 0.2627396821975708, "mean_token_accuracy": 0.9167688429355622, "num_tokens": 66677221.0, "step": 5260 }, { "entropy": 0.2368408203125, "epoch": 3.9715470133785566, "grad_norm": 0.41133439540863037, "learning_rate": 2.1424878660180935e-06, "loss": 0.23894243240356444, "mean_token_accuracy": 0.9241284295916558, "num_tokens": 66810692.0, "step": 5270 }, { "epoch": 3.9715470133785566, "eval_entropy": 0.25422613304781627, "eval_loss": 0.29535341262817383, "eval_mean_token_accuracy": 0.9102872919784971, "eval_num_tokens": 66810692.0, "eval_runtime": 444.4912, "eval_samples_per_second": 5.969, "eval_steps_per_second": 1.494, "step": 5270 } ], "logging_steps": 10, "max_steps": 6635, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 170, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.062071673121931e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }