{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.4670588763641263, "eval_steps": 1000, "global_step": 26000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.2285142108798027, "epoch": 0.0001796380293708178, "grad_norm": 338.0, "learning_rate": 4.5e-07, "loss": 4.8883522033691404, "mean_token_accuracy": 0.614159119874239, "num_tokens": 19881.0, "step": 10 }, { "entropy": 0.2592433709651232, "epoch": 0.0003592760587416356, "grad_norm": 225.0, "learning_rate": 9.5e-07, "loss": 4.066074371337891, "mean_token_accuracy": 0.615167886018753, "num_tokens": 40073.0, "step": 20 }, { "entropy": 0.5413158625364304, "epoch": 0.0005389140881124534, "grad_norm": 78.0, "learning_rate": 1.45e-06, "loss": 2.8527931213378905, "mean_token_accuracy": 0.6295808032155037, "num_tokens": 59507.0, "step": 30 }, { "entropy": 0.8526842221617699, "epoch": 0.0007185521174832712, "grad_norm": 40.0, "learning_rate": 1.95e-06, "loss": 1.788459014892578, "mean_token_accuracy": 0.6713394083082675, "num_tokens": 78952.0, "step": 40 }, { "entropy": 1.3804137662053109, "epoch": 0.000898190146854089, "grad_norm": 34.25, "learning_rate": 2.4500000000000003e-06, "loss": 1.77496395111084, "mean_token_accuracy": 0.6312253788113594, "num_tokens": 99568.0, "step": 50 }, { "entropy": 1.1601247757673263, "epoch": 0.0010778281762249067, "grad_norm": 21.625, "learning_rate": 2.95e-06, "loss": 1.3090765953063965, "mean_token_accuracy": 0.7052405722439289, "num_tokens": 120527.0, "step": 60 }, { "entropy": 1.253069232404232, "epoch": 0.0012574662055957245, "grad_norm": 27.5, "learning_rate": 3.4500000000000004e-06, "loss": 1.3177606582641601, "mean_token_accuracy": 0.7069540455937385, "num_tokens": 140444.0, "step": 70 }, { "entropy": 1.3081351161003112, "epoch": 0.0014371042349665423, "grad_norm": 33.75, "learning_rate": 3.95e-06, "loss": 1.38143949508667, "mean_token_accuracy": 0.6947338208556175, "num_tokens": 160447.0, "step": 80 }, { "entropy": 1.2931678161025046, "epoch": 0.0016167422643373602, "grad_norm": 28.625, "learning_rate": 4.45e-06, "loss": 1.321197509765625, "mean_token_accuracy": 0.696695514768362, "num_tokens": 179917.0, "step": 90 }, { "entropy": 1.3114918872714043, "epoch": 0.001796380293708178, "grad_norm": 26.25, "learning_rate": 4.950000000000001e-06, "loss": 1.4064659118652343, "mean_token_accuracy": 0.6969998598098754, "num_tokens": 198929.0, "step": 100 }, { "entropy": 1.2356058835983277, "epoch": 0.001976018323078996, "grad_norm": 23.125, "learning_rate": 5.45e-06, "loss": 1.3247491836547851, "mean_token_accuracy": 0.6962062671780587, "num_tokens": 220465.0, "step": 110 }, { "entropy": 1.1230886340141297, "epoch": 0.0021556563524498134, "grad_norm": 23.5, "learning_rate": 5.95e-06, "loss": 1.176513957977295, "mean_token_accuracy": 0.7297163873910903, "num_tokens": 239249.0, "step": 120 }, { "entropy": 1.313824026286602, "epoch": 0.0023352943818206314, "grad_norm": 33.5, "learning_rate": 6.45e-06, "loss": 1.3627755165100097, "mean_token_accuracy": 0.7020026236772537, "num_tokens": 258824.0, "step": 130 }, { "entropy": 1.3096917569637299, "epoch": 0.002514932411191449, "grad_norm": 37.0, "learning_rate": 6.950000000000001e-06, "loss": 1.4027366638183594, "mean_token_accuracy": 0.689975680410862, "num_tokens": 278392.0, "step": 140 }, { "entropy": 1.229283632338047, "epoch": 0.002694570440562267, "grad_norm": 27.875, "learning_rate": 7.45e-06, "loss": 1.193472194671631, "mean_token_accuracy": 0.7135655298829079, "num_tokens": 298114.0, "step": 150 }, { "entropy": 1.129289910197258, "epoch": 0.0028742084699330847, "grad_norm": 28.25, "learning_rate": 7.95e-06, "loss": 1.2268380165100097, "mean_token_accuracy": 0.7122256726026535, "num_tokens": 317682.0, "step": 160 }, { "entropy": 1.3514228284358978, "epoch": 0.0030538464993039027, "grad_norm": 25.75, "learning_rate": 8.45e-06, "loss": 1.3145798683166503, "mean_token_accuracy": 0.6925913117825985, "num_tokens": 337243.0, "step": 170 }, { "entropy": 1.1698046237230302, "epoch": 0.0032334845286747203, "grad_norm": 23.0, "learning_rate": 8.95e-06, "loss": 1.202991771697998, "mean_token_accuracy": 0.7119750328361988, "num_tokens": 357044.0, "step": 180 }, { "entropy": 1.1908135280013084, "epoch": 0.0034131225580455384, "grad_norm": 30.0, "learning_rate": 9.450000000000001e-06, "loss": 1.2616134643554688, "mean_token_accuracy": 0.7143504373729229, "num_tokens": 376996.0, "step": 190 }, { "entropy": 1.1140592023730278, "epoch": 0.003592760587416356, "grad_norm": 20.625, "learning_rate": 9.950000000000001e-06, "loss": 1.1481157302856446, "mean_token_accuracy": 0.7259704366326332, "num_tokens": 395940.0, "step": 200 }, { "entropy": 1.185268647968769, "epoch": 0.003772398616787174, "grad_norm": 22.0, "learning_rate": 1.045e-05, "loss": 1.1380942344665528, "mean_token_accuracy": 0.7433141075074673, "num_tokens": 414953.0, "step": 210 }, { "entropy": 1.1160883173346519, "epoch": 0.003952036646157992, "grad_norm": 20.125, "learning_rate": 1.095e-05, "loss": 1.234296703338623, "mean_token_accuracy": 0.7160610310733319, "num_tokens": 435066.0, "step": 220 }, { "entropy": 1.3014020532369615, "epoch": 0.004131674675528809, "grad_norm": 17.75, "learning_rate": 1.145e-05, "loss": 1.2594083786010741, "mean_token_accuracy": 0.7140978299081325, "num_tokens": 455791.0, "step": 230 }, { "entropy": 1.186601100116968, "epoch": 0.004311312704899627, "grad_norm": 35.0, "learning_rate": 1.195e-05, "loss": 1.2977076530456544, "mean_token_accuracy": 0.7061133705079555, "num_tokens": 474818.0, "step": 240 }, { "entropy": 1.2088973760604858, "epoch": 0.004490950734270445, "grad_norm": 22.125, "learning_rate": 1.2450000000000001e-05, "loss": 1.1662664413452148, "mean_token_accuracy": 0.7203448742628098, "num_tokens": 496453.0, "step": 250 }, { "entropy": 1.2616489186882973, "epoch": 0.004670588763641263, "grad_norm": 28.0, "learning_rate": 1.2950000000000001e-05, "loss": 1.298599624633789, "mean_token_accuracy": 0.7160171762108802, "num_tokens": 516400.0, "step": 260 }, { "entropy": 1.126600243151188, "epoch": 0.0048502267930120805, "grad_norm": 19.75, "learning_rate": 1.3450000000000002e-05, "loss": 1.1665369987487793, "mean_token_accuracy": 0.7411642163991928, "num_tokens": 535475.0, "step": 270 }, { "entropy": 1.1618767216801644, "epoch": 0.005029864822382898, "grad_norm": 27.875, "learning_rate": 1.3950000000000002e-05, "loss": 1.2132204055786133, "mean_token_accuracy": 0.7233127027750015, "num_tokens": 554868.0, "step": 280 }, { "entropy": 1.3146504908800125, "epoch": 0.005209502851753717, "grad_norm": 22.0, "learning_rate": 1.4449999999999999e-05, "loss": 1.3070467948913573, "mean_token_accuracy": 0.7006118722259999, "num_tokens": 574711.0, "step": 290 }, { "entropy": 1.1791881158947946, "epoch": 0.005389140881124534, "grad_norm": 22.5, "learning_rate": 1.4950000000000001e-05, "loss": 1.2319019317626954, "mean_token_accuracy": 0.7152372360229492, "num_tokens": 595068.0, "step": 300 }, { "entropy": 1.1496956929564477, "epoch": 0.005568778910495352, "grad_norm": 23.25, "learning_rate": 1.545e-05, "loss": 1.2204404830932618, "mean_token_accuracy": 0.720104095339775, "num_tokens": 615186.0, "step": 310 }, { "entropy": 1.1919636234641076, "epoch": 0.005748416939866169, "grad_norm": 22.25, "learning_rate": 1.595e-05, "loss": 1.2102306365966797, "mean_token_accuracy": 0.7176152899861336, "num_tokens": 636045.0, "step": 320 }, { "entropy": 1.2924261584877967, "epoch": 0.005928054969236988, "grad_norm": 24.0, "learning_rate": 1.645e-05, "loss": 1.256188201904297, "mean_token_accuracy": 0.698620592802763, "num_tokens": 656037.0, "step": 330 }, { "entropy": 1.2066523447632789, "epoch": 0.0061076929986078055, "grad_norm": 23.875, "learning_rate": 1.6950000000000002e-05, "loss": 1.300409984588623, "mean_token_accuracy": 0.6900593861937523, "num_tokens": 674706.0, "step": 340 }, { "entropy": 1.1717823699116707, "epoch": 0.006287331027978623, "grad_norm": 21.75, "learning_rate": 1.745e-05, "loss": 1.1818981170654297, "mean_token_accuracy": 0.7271141156554222, "num_tokens": 697034.0, "step": 350 }, { "entropy": 1.347169689834118, "epoch": 0.006466969057349441, "grad_norm": 20.5, "learning_rate": 1.795e-05, "loss": 1.386529541015625, "mean_token_accuracy": 0.6903549000620842, "num_tokens": 716356.0, "step": 360 }, { "entropy": 1.1157519415020942, "epoch": 0.006646607086720258, "grad_norm": 19.875, "learning_rate": 1.845e-05, "loss": 1.1746755599975587, "mean_token_accuracy": 0.7316143766045571, "num_tokens": 736010.0, "step": 370 }, { "entropy": 1.2086873427033424, "epoch": 0.006826245116091077, "grad_norm": 21.0, "learning_rate": 1.895e-05, "loss": 1.1709842681884766, "mean_token_accuracy": 0.721261890232563, "num_tokens": 755905.0, "step": 380 }, { "entropy": 1.0470090851187706, "epoch": 0.007005883145461894, "grad_norm": 15.875, "learning_rate": 1.9450000000000002e-05, "loss": 1.1902419090270997, "mean_token_accuracy": 0.730524119734764, "num_tokens": 776342.0, "step": 390 }, { "entropy": 1.3544242575764656, "epoch": 0.007185521174832712, "grad_norm": 16.5, "learning_rate": 1.995e-05, "loss": 1.3294052124023437, "mean_token_accuracy": 0.6911105871200561, "num_tokens": 796912.0, "step": 400 }, { "entropy": 1.294105887413025, "epoch": 0.0073651592042035295, "grad_norm": 26.0, "learning_rate": 2.045e-05, "loss": 1.3535008430480957, "mean_token_accuracy": 0.6951926596462726, "num_tokens": 816253.0, "step": 410 }, { "entropy": 1.3261266335844994, "epoch": 0.007544797233574348, "grad_norm": 20.125, "learning_rate": 2.095e-05, "loss": 1.3798662185668946, "mean_token_accuracy": 0.6866254404187202, "num_tokens": 835424.0, "step": 420 }, { "entropy": 1.3382393702864648, "epoch": 0.007724435262945166, "grad_norm": 22.125, "learning_rate": 2.145e-05, "loss": 1.3444744110107423, "mean_token_accuracy": 0.6885690718889237, "num_tokens": 853906.0, "step": 430 }, { "entropy": 1.190830898284912, "epoch": 0.007904073292315983, "grad_norm": 27.0, "learning_rate": 2.195e-05, "loss": 1.2053414344787599, "mean_token_accuracy": 0.7217165172100067, "num_tokens": 873159.0, "step": 440 }, { "entropy": 1.1526850268244744, "epoch": 0.0080837113216868, "grad_norm": 20.125, "learning_rate": 2.245e-05, "loss": 1.3208661079406738, "mean_token_accuracy": 0.6984982281923294, "num_tokens": 893835.0, "step": 450 }, { "entropy": 1.3733031839132308, "epoch": 0.008263349351057618, "grad_norm": 19.875, "learning_rate": 2.2950000000000002e-05, "loss": 1.2875539779663085, "mean_token_accuracy": 0.70067323371768, "num_tokens": 914236.0, "step": 460 }, { "entropy": 1.1398809850215912, "epoch": 0.008442987380428436, "grad_norm": 17.5, "learning_rate": 2.345e-05, "loss": 1.2422693252563477, "mean_token_accuracy": 0.7127251163125038, "num_tokens": 933711.0, "step": 470 }, { "entropy": 1.3505023419857025, "epoch": 0.008622625409799254, "grad_norm": 19.25, "learning_rate": 2.395e-05, "loss": 1.3500717163085938, "mean_token_accuracy": 0.7032387189567089, "num_tokens": 952965.0, "step": 480 }, { "entropy": 1.2616789430379867, "epoch": 0.008802263439170073, "grad_norm": 23.75, "learning_rate": 2.445e-05, "loss": 1.3580240249633788, "mean_token_accuracy": 0.6813065484166145, "num_tokens": 973043.0, "step": 490 }, { "entropy": 1.1928757190704347, "epoch": 0.00898190146854089, "grad_norm": 18.75, "learning_rate": 2.495e-05, "loss": 1.2279540061950684, "mean_token_accuracy": 0.7097863912582397, "num_tokens": 992534.0, "step": 500 }, { "entropy": 1.3313418433070183, "epoch": 0.009161539497911708, "grad_norm": 25.625, "learning_rate": 2.5450000000000002e-05, "loss": 1.392829418182373, "mean_token_accuracy": 0.687772911787033, "num_tokens": 1011503.0, "step": 510 }, { "entropy": 1.2510645657777786, "epoch": 0.009341177527282526, "grad_norm": 17.375, "learning_rate": 2.595e-05, "loss": 1.2840056419372559, "mean_token_accuracy": 0.7028377979993821, "num_tokens": 1031078.0, "step": 520 }, { "entropy": 1.3048915401101113, "epoch": 0.009520815556653343, "grad_norm": 16.75, "learning_rate": 2.6450000000000003e-05, "loss": 1.3614519119262696, "mean_token_accuracy": 0.6907784312963485, "num_tokens": 1051001.0, "step": 530 }, { "entropy": 1.2187796041369439, "epoch": 0.009700453586024161, "grad_norm": 20.875, "learning_rate": 2.6950000000000005e-05, "loss": 1.2859848976135253, "mean_token_accuracy": 0.7090503506362438, "num_tokens": 1070569.0, "step": 540 }, { "entropy": 1.3603180184960366, "epoch": 0.009880091615394979, "grad_norm": 18.25, "learning_rate": 2.7450000000000003e-05, "loss": 1.3390862464904785, "mean_token_accuracy": 0.6932703338563442, "num_tokens": 1089715.0, "step": 550 }, { "entropy": 1.229197269678116, "epoch": 0.010059729644765796, "grad_norm": 18.375, "learning_rate": 2.7950000000000005e-05, "loss": 1.3082941055297852, "mean_token_accuracy": 0.7056461185216903, "num_tokens": 1110066.0, "step": 560 }, { "entropy": 1.3566848933696747, "epoch": 0.010239367674136616, "grad_norm": 15.375, "learning_rate": 2.845e-05, "loss": 1.3479373931884766, "mean_token_accuracy": 0.6874948844313622, "num_tokens": 1129467.0, "step": 570 }, { "entropy": 1.165881448984146, "epoch": 0.010419005703507433, "grad_norm": 15.25, "learning_rate": 2.895e-05, "loss": 1.2552820205688477, "mean_token_accuracy": 0.7130140498280525, "num_tokens": 1150425.0, "step": 580 }, { "entropy": 1.2559717029333115, "epoch": 0.01059864373287825, "grad_norm": 14.875, "learning_rate": 2.945e-05, "loss": 1.3594337463378907, "mean_token_accuracy": 0.6969697877764702, "num_tokens": 1169390.0, "step": 590 }, { "entropy": 1.527521088719368, "epoch": 0.010778281762249068, "grad_norm": 18.125, "learning_rate": 2.995e-05, "loss": 1.5145947456359863, "mean_token_accuracy": 0.6706581458449363, "num_tokens": 1188454.0, "step": 600 }, { "entropy": 1.3165057599544525, "epoch": 0.010957919791619886, "grad_norm": 22.75, "learning_rate": 3.045e-05, "loss": 1.3955662727355957, "mean_token_accuracy": 0.6902709446847439, "num_tokens": 1208049.0, "step": 610 }, { "entropy": 1.2833266004920005, "epoch": 0.011137557820990704, "grad_norm": 30.125, "learning_rate": 3.095e-05, "loss": 1.3738471031188966, "mean_token_accuracy": 0.695693901181221, "num_tokens": 1227680.0, "step": 620 }, { "entropy": 1.3729368403553963, "epoch": 0.011317195850361521, "grad_norm": 27.75, "learning_rate": 3.145e-05, "loss": 1.3908536911010743, "mean_token_accuracy": 0.6883269481360912, "num_tokens": 1248247.0, "step": 630 }, { "entropy": 1.321514193713665, "epoch": 0.011496833879732339, "grad_norm": 15.75, "learning_rate": 3.1950000000000004e-05, "loss": 1.4234540939331055, "mean_token_accuracy": 0.6745201140642166, "num_tokens": 1268043.0, "step": 640 }, { "entropy": 1.4137424260377884, "epoch": 0.011676471909103156, "grad_norm": 16.375, "learning_rate": 3.245e-05, "loss": 1.465153121948242, "mean_token_accuracy": 0.6703482449054718, "num_tokens": 1287035.0, "step": 650 }, { "entropy": 1.4118265092372895, "epoch": 0.011856109938473976, "grad_norm": 16.625, "learning_rate": 3.295e-05, "loss": 1.4218225479125977, "mean_token_accuracy": 0.6761282578110694, "num_tokens": 1307713.0, "step": 660 }, { "entropy": 1.3070572301745416, "epoch": 0.012035747967844793, "grad_norm": 12.4375, "learning_rate": 3.345000000000001e-05, "loss": 1.4144351005554199, "mean_token_accuracy": 0.6854814760386944, "num_tokens": 1328401.0, "step": 670 }, { "entropy": 1.4844876140356065, "epoch": 0.012215385997215611, "grad_norm": 14.0, "learning_rate": 3.3950000000000005e-05, "loss": 1.5067203521728516, "mean_token_accuracy": 0.6696059130132198, "num_tokens": 1348081.0, "step": 680 }, { "entropy": 1.5267313480377198, "epoch": 0.012395024026586429, "grad_norm": 22.125, "learning_rate": 3.445e-05, "loss": 1.547717571258545, "mean_token_accuracy": 0.6525343872606755, "num_tokens": 1366620.0, "step": 690 }, { "entropy": 1.409482868015766, "epoch": 0.012574662055957246, "grad_norm": 15.25, "learning_rate": 3.495e-05, "loss": 1.5240630149841308, "mean_token_accuracy": 0.6619769029319287, "num_tokens": 1387634.0, "step": 700 }, { "entropy": 1.385390780866146, "epoch": 0.012754300085328064, "grad_norm": 17.875, "learning_rate": 3.545e-05, "loss": 1.4197970390319825, "mean_token_accuracy": 0.6821596398949623, "num_tokens": 1407691.0, "step": 710 }, { "entropy": 1.4515428811311721, "epoch": 0.012933938114698881, "grad_norm": 13.3125, "learning_rate": 3.595e-05, "loss": 1.5343506813049317, "mean_token_accuracy": 0.6703817009925842, "num_tokens": 1428549.0, "step": 720 }, { "entropy": 1.422910524904728, "epoch": 0.013113576144069699, "grad_norm": 16.25, "learning_rate": 3.645e-05, "loss": 1.4436484336853028, "mean_token_accuracy": 0.679908835887909, "num_tokens": 1448696.0, "step": 730 }, { "entropy": 1.3541560366749763, "epoch": 0.013293214173440517, "grad_norm": 13.5625, "learning_rate": 3.6950000000000004e-05, "loss": 1.4838427543640136, "mean_token_accuracy": 0.6745669797062874, "num_tokens": 1467982.0, "step": 740 }, { "entropy": 1.4543387055397035, "epoch": 0.013472852202811336, "grad_norm": 24.375, "learning_rate": 3.745e-05, "loss": 1.5257116317749024, "mean_token_accuracy": 0.6583885066211224, "num_tokens": 1486504.0, "step": 750 }, { "entropy": 1.4233024775981904, "epoch": 0.013652490232182153, "grad_norm": 14.3125, "learning_rate": 3.795e-05, "loss": 1.5261417388916017, "mean_token_accuracy": 0.6611535474658012, "num_tokens": 1507944.0, "step": 760 }, { "entropy": 1.5868904277682305, "epoch": 0.013832128261552971, "grad_norm": 15.4375, "learning_rate": 3.845e-05, "loss": 1.589180088043213, "mean_token_accuracy": 0.652680542320013, "num_tokens": 1527573.0, "step": 770 }, { "entropy": 1.4296333938837051, "epoch": 0.014011766290923789, "grad_norm": 15.875, "learning_rate": 3.8950000000000005e-05, "loss": 1.4833106994628906, "mean_token_accuracy": 0.664696491509676, "num_tokens": 1547688.0, "step": 780 }, { "entropy": 1.4370834082365036, "epoch": 0.014191404320294606, "grad_norm": 19.0, "learning_rate": 3.9450000000000003e-05, "loss": 1.5261101722717285, "mean_token_accuracy": 0.6580417729914189, "num_tokens": 1567143.0, "step": 790 }, { "entropy": 1.5416127756237983, "epoch": 0.014371042349665424, "grad_norm": 11.3125, "learning_rate": 3.995e-05, "loss": 1.5723227500915526, "mean_token_accuracy": 0.6579069018363952, "num_tokens": 1587504.0, "step": 800 }, { "entropy": 1.4236389979720117, "epoch": 0.014550680379036241, "grad_norm": 15.5625, "learning_rate": 4.045000000000001e-05, "loss": 1.5273307800292968, "mean_token_accuracy": 0.6582598991692066, "num_tokens": 1606283.0, "step": 810 }, { "entropy": 1.478298343718052, "epoch": 0.014730318408407059, "grad_norm": 20.5, "learning_rate": 4.095e-05, "loss": 1.5232603073120117, "mean_token_accuracy": 0.6629001379013062, "num_tokens": 1625648.0, "step": 820 }, { "entropy": 1.5232951745390892, "epoch": 0.014909956437777878, "grad_norm": 14.5, "learning_rate": 4.145e-05, "loss": 1.5676536560058594, "mean_token_accuracy": 0.6548260487616062, "num_tokens": 1645079.0, "step": 830 }, { "entropy": 1.3451756298542024, "epoch": 0.015089594467148696, "grad_norm": 17.25, "learning_rate": 4.195e-05, "loss": 1.4040653228759765, "mean_token_accuracy": 0.6850749261677265, "num_tokens": 1665644.0, "step": 840 }, { "entropy": 1.553303211927414, "epoch": 0.015269232496519514, "grad_norm": 15.5625, "learning_rate": 4.245e-05, "loss": 1.6475976943969726, "mean_token_accuracy": 0.6442298710346221, "num_tokens": 1684318.0, "step": 850 }, { "entropy": 1.4236965268850326, "epoch": 0.015448870525890331, "grad_norm": 14.1875, "learning_rate": 4.295e-05, "loss": 1.513192844390869, "mean_token_accuracy": 0.6647441633045673, "num_tokens": 1705464.0, "step": 860 }, { "entropy": 1.6874301448464393, "epoch": 0.01562850855526115, "grad_norm": 14.1875, "learning_rate": 4.345e-05, "loss": 1.6767539978027344, "mean_token_accuracy": 0.6399445720016956, "num_tokens": 1724729.0, "step": 870 }, { "entropy": 1.455209381878376, "epoch": 0.015808146584631966, "grad_norm": 15.8125, "learning_rate": 4.3950000000000004e-05, "loss": 1.6115209579467773, "mean_token_accuracy": 0.6471515670418739, "num_tokens": 1744724.0, "step": 880 }, { "entropy": 1.4922844484448432, "epoch": 0.015987784614002784, "grad_norm": 14.6875, "learning_rate": 4.445e-05, "loss": 1.572502613067627, "mean_token_accuracy": 0.6561724334955216, "num_tokens": 1764414.0, "step": 890 }, { "entropy": 1.7285323530435561, "epoch": 0.0161674226433736, "grad_norm": 16.0, "learning_rate": 4.495e-05, "loss": 1.8349027633666992, "mean_token_accuracy": 0.6137065529823303, "num_tokens": 1783351.0, "step": 900 }, { "entropy": 1.510180902481079, "epoch": 0.01634706067274442, "grad_norm": 20.375, "learning_rate": 4.545000000000001e-05, "loss": 1.5554212570190429, "mean_token_accuracy": 0.6492202296853066, "num_tokens": 1802521.0, "step": 910 }, { "entropy": 1.6031754165887833, "epoch": 0.016526698702115237, "grad_norm": 13.375, "learning_rate": 4.5950000000000006e-05, "loss": 1.7184165954589843, "mean_token_accuracy": 0.6307573899626732, "num_tokens": 1821027.0, "step": 920 }, { "entropy": 1.5202497854828834, "epoch": 0.016706336731486054, "grad_norm": 13.0625, "learning_rate": 4.6450000000000004e-05, "loss": 1.674123191833496, "mean_token_accuracy": 0.6374556072056293, "num_tokens": 1840799.0, "step": 930 }, { "entropy": 1.577104239165783, "epoch": 0.016885974760856872, "grad_norm": 17.125, "learning_rate": 4.695e-05, "loss": 1.6293512344360352, "mean_token_accuracy": 0.662019107490778, "num_tokens": 1860158.0, "step": 940 }, { "entropy": 1.474810865521431, "epoch": 0.01706561279022769, "grad_norm": 13.25, "learning_rate": 4.745e-05, "loss": 1.5657214164733886, "mean_token_accuracy": 0.6575634054839611, "num_tokens": 1879251.0, "step": 950 }, { "entropy": 1.376376987993717, "epoch": 0.017245250819598507, "grad_norm": 22.25, "learning_rate": 4.795e-05, "loss": 1.505562686920166, "mean_token_accuracy": 0.6564014129340648, "num_tokens": 1898911.0, "step": 960 }, { "entropy": 1.5325671911239624, "epoch": 0.01742488884896933, "grad_norm": 14.875, "learning_rate": 4.845e-05, "loss": 1.6113946914672852, "mean_token_accuracy": 0.6567016690969467, "num_tokens": 1918843.0, "step": 970 }, { "entropy": 1.6021498128771783, "epoch": 0.017604526878340146, "grad_norm": 18.625, "learning_rate": 4.8950000000000004e-05, "loss": 1.7239124298095703, "mean_token_accuracy": 0.6299502395093441, "num_tokens": 1939280.0, "step": 980 }, { "entropy": 1.5801695257425308, "epoch": 0.017784164907710964, "grad_norm": 12.5, "learning_rate": 4.945e-05, "loss": 1.6025472640991212, "mean_token_accuracy": 0.6534447938203811, "num_tokens": 1959517.0, "step": 990 }, { "epoch": 0.01796380293708178, "eval_entropy": 1.6879122581481933, "eval_loss": 1.6562248468399048, "eval_mean_token_accuracy": 0.6401306872367859, "eval_num_tokens": 1977717.0, "eval_runtime": 40.5307, "eval_samples_per_second": 49.345, "eval_steps_per_second": 6.168, "step": 1000 }, { "entropy": 1.5339436739683152, "epoch": 0.0181434409664526, "grad_norm": 12.875, "learning_rate": 4.99999966562916e-05, "loss": 1.6479965209960938, "mean_token_accuracy": 0.6450760822743178, "num_tokens": 1997777.0, "step": 1010 }, { "entropy": 1.481242610514164, "epoch": 0.018323078995823416, "grad_norm": 11.9375, "learning_rate": 4.999998509779458e-05, "loss": 1.5723793983459473, "mean_token_accuracy": 0.6561716787517071, "num_tokens": 2017891.0, "step": 1020 }, { "entropy": 1.3482632651925086, "epoch": 0.018502717025194234, "grad_norm": 14.375, "learning_rate": 4.99999652832324e-05, "loss": 1.5132084846496583, "mean_token_accuracy": 0.6613622292876243, "num_tokens": 2037900.0, "step": 1030 }, { "entropy": 1.7140410661697387, "epoch": 0.01868235505456505, "grad_norm": 13.6875, "learning_rate": 4.9999937212611616e-05, "loss": 1.825594711303711, "mean_token_accuracy": 0.6063587903976441, "num_tokens": 2058263.0, "step": 1040 }, { "entropy": 1.69788548797369, "epoch": 0.01886199308393587, "grad_norm": 14.4375, "learning_rate": 4.9999900885941476e-05, "loss": 1.7420467376708983, "mean_token_accuracy": 0.6239760592579842, "num_tokens": 2078942.0, "step": 1050 }, { "entropy": 1.521554161608219, "epoch": 0.019041631113306687, "grad_norm": 18.0, "learning_rate": 4.9999856303234e-05, "loss": 1.7311466217041016, "mean_token_accuracy": 0.6197005368769168, "num_tokens": 2097309.0, "step": 1060 }, { "entropy": 1.5711013540625571, "epoch": 0.019221269142677504, "grad_norm": 16.375, "learning_rate": 4.99998034645039e-05, "loss": 1.6851322174072265, "mean_token_accuracy": 0.6406420513987541, "num_tokens": 2116331.0, "step": 1070 }, { "entropy": 1.517425474524498, "epoch": 0.019400907172048322, "grad_norm": 14.6875, "learning_rate": 4.999974236976862e-05, "loss": 1.5062079429626465, "mean_token_accuracy": 0.6739716276526451, "num_tokens": 2135284.0, "step": 1080 }, { "entropy": 1.402970278263092, "epoch": 0.01958054520141914, "grad_norm": 22.625, "learning_rate": 4.999967301904834e-05, "loss": 1.614433479309082, "mean_token_accuracy": 0.6460897564888001, "num_tokens": 2154764.0, "step": 1090 }, { "entropy": 1.4869570776820182, "epoch": 0.019760183230789957, "grad_norm": 15.3125, "learning_rate": 4.999959541236597e-05, "loss": 1.5126214981079102, "mean_token_accuracy": 0.6601682506501675, "num_tokens": 2175073.0, "step": 1100 }, { "entropy": 1.4203249007463454, "epoch": 0.019939821260160775, "grad_norm": 13.125, "learning_rate": 4.9999509549747143e-05, "loss": 1.6122428894042968, "mean_token_accuracy": 0.6398775935173034, "num_tokens": 2195533.0, "step": 1110 }, { "entropy": 1.7457217395305633, "epoch": 0.020119459289531592, "grad_norm": 14.25, "learning_rate": 4.99994154312202e-05, "loss": 1.7978387832641602, "mean_token_accuracy": 0.6236461505293847, "num_tokens": 2215392.0, "step": 1120 }, { "entropy": 1.4203085482120514, "epoch": 0.02029909731890241, "grad_norm": 13.3125, "learning_rate": 4.999931305681622e-05, "loss": 1.535835361480713, "mean_token_accuracy": 0.66737802028656, "num_tokens": 2234775.0, "step": 1130 }, { "entropy": 1.6592785954475402, "epoch": 0.02047873534827323, "grad_norm": 13.6875, "learning_rate": 4.9999202426569024e-05, "loss": 1.717864418029785, "mean_token_accuracy": 0.6368574008345604, "num_tokens": 2253731.0, "step": 1140 }, { "entropy": 1.5235640779137611, "epoch": 0.02065837337764405, "grad_norm": 11.3125, "learning_rate": 4.999908354051515e-05, "loss": 1.6711483001708984, "mean_token_accuracy": 0.6409434221684933, "num_tokens": 2273704.0, "step": 1150 }, { "entropy": 1.5913785725831986, "epoch": 0.020838011407014866, "grad_norm": 10.75, "learning_rate": 4.999895639869385e-05, "loss": 1.6213735580444335, "mean_token_accuracy": 0.6473274938762188, "num_tokens": 2294883.0, "step": 1160 }, { "entropy": 1.4578886479139328, "epoch": 0.021017649436385684, "grad_norm": 17.375, "learning_rate": 4.999882100114711e-05, "loss": 1.5965503692626952, "mean_token_accuracy": 0.6535281084477902, "num_tokens": 2315060.0, "step": 1170 }, { "entropy": 1.703429938852787, "epoch": 0.0211972874657565, "grad_norm": 11.5, "learning_rate": 4.999867734791965e-05, "loss": 1.7444644927978517, "mean_token_accuracy": 0.6244046315550804, "num_tokens": 2335097.0, "step": 1180 }, { "entropy": 1.4013918712735176, "epoch": 0.02137692549512732, "grad_norm": 10.375, "learning_rate": 4.9998525439058906e-05, "loss": 1.4863811492919923, "mean_token_accuracy": 0.6667556263506412, "num_tokens": 2355374.0, "step": 1190 }, { "entropy": 1.5714426934719086, "epoch": 0.021556563524498137, "grad_norm": 10.875, "learning_rate": 4.999836527461505e-05, "loss": 1.6421844482421875, "mean_token_accuracy": 0.6483815163373947, "num_tokens": 2375236.0, "step": 1200 }, { "entropy": 1.48934256285429, "epoch": 0.021736201553868954, "grad_norm": 12.6875, "learning_rate": 4.999819685464097e-05, "loss": 1.635277557373047, "mean_token_accuracy": 0.6506827063858509, "num_tokens": 2395068.0, "step": 1210 }, { "entropy": 1.6177606523036956, "epoch": 0.021915839583239772, "grad_norm": 13.75, "learning_rate": 4.999802017919229e-05, "loss": 1.7069984436035157, "mean_token_accuracy": 0.6416367538273334, "num_tokens": 2414218.0, "step": 1220 }, { "entropy": 1.6434327408671379, "epoch": 0.02209547761261059, "grad_norm": 12.6875, "learning_rate": 4.999783524832735e-05, "loss": 1.7221960067749023, "mean_token_accuracy": 0.6327094666659832, "num_tokens": 2433952.0, "step": 1230 }, { "entropy": 1.5641241088509559, "epoch": 0.022275115641981407, "grad_norm": 13.5, "learning_rate": 4.999764206210723e-05, "loss": 1.5754161834716798, "mean_token_accuracy": 0.65119748711586, "num_tokens": 2453433.0, "step": 1240 }, { "entropy": 1.5548364117741584, "epoch": 0.022454753671352225, "grad_norm": 10.4375, "learning_rate": 4.9997440620595724e-05, "loss": 1.745047378540039, "mean_token_accuracy": 0.6357388451695443, "num_tokens": 2473929.0, "step": 1250 }, { "entropy": 1.5932861298322678, "epoch": 0.022634391700723042, "grad_norm": 10.75, "learning_rate": 4.999723092385935e-05, "loss": 1.6144153594970703, "mean_token_accuracy": 0.6489748314023018, "num_tokens": 2493661.0, "step": 1260 }, { "entropy": 1.5058840662240982, "epoch": 0.02281402973009386, "grad_norm": 13.5625, "learning_rate": 4.9997012971967375e-05, "loss": 1.6505386352539062, "mean_token_accuracy": 0.6422648474574089, "num_tokens": 2513309.0, "step": 1270 }, { "entropy": 1.517166194319725, "epoch": 0.022993667759464678, "grad_norm": 11.5, "learning_rate": 4.9996786764991766e-05, "loss": 1.576535701751709, "mean_token_accuracy": 0.6516160413622856, "num_tokens": 2533388.0, "step": 1280 }, { "entropy": 1.4109832972288132, "epoch": 0.023173305788835495, "grad_norm": 17.625, "learning_rate": 4.9996552303007216e-05, "loss": 1.5971531867980957, "mean_token_accuracy": 0.6632041566073894, "num_tokens": 2552530.0, "step": 1290 }, { "entropy": 1.5902836352586747, "epoch": 0.023352943818206313, "grad_norm": 11.5, "learning_rate": 4.999630958609117e-05, "loss": 1.5698233604431153, "mean_token_accuracy": 0.6543730370700359, "num_tokens": 2572748.0, "step": 1300 }, { "entropy": 1.4055397614836693, "epoch": 0.023532581847577134, "grad_norm": 13.0, "learning_rate": 4.999605861432378e-05, "loss": 1.6371458053588868, "mean_token_accuracy": 0.6445710822939873, "num_tokens": 2592065.0, "step": 1310 }, { "entropy": 1.6797343373298645, "epoch": 0.02371221987694795, "grad_norm": 12.3125, "learning_rate": 4.999579938778794e-05, "loss": 1.6646812438964844, "mean_token_accuracy": 0.6332690112292767, "num_tokens": 2611257.0, "step": 1320 }, { "entropy": 1.4525077223777771, "epoch": 0.02389185790631877, "grad_norm": 13.25, "learning_rate": 4.9995531906569224e-05, "loss": 1.5657713890075684, "mean_token_accuracy": 0.6668823085725307, "num_tokens": 2630888.0, "step": 1330 }, { "entropy": 1.4237727612257003, "epoch": 0.024071495935689587, "grad_norm": 11.75, "learning_rate": 4.9995256170755986e-05, "loss": 1.5716552734375, "mean_token_accuracy": 0.6479331746697425, "num_tokens": 2651428.0, "step": 1340 }, { "entropy": 1.4339660495519637, "epoch": 0.024251133965060404, "grad_norm": 9.375, "learning_rate": 4.99949721804393e-05, "loss": 1.4079453468322753, "mean_token_accuracy": 0.6819032713770866, "num_tokens": 2671526.0, "step": 1350 }, { "entropy": 1.6262118130922318, "epoch": 0.024430771994431222, "grad_norm": 14.1875, "learning_rate": 4.9994679935712926e-05, "loss": 1.8461585998535157, "mean_token_accuracy": 0.6129544958472252, "num_tokens": 2691008.0, "step": 1360 }, { "entropy": 1.732082599401474, "epoch": 0.02461041002380204, "grad_norm": 12.625, "learning_rate": 4.999437943667339e-05, "loss": 1.7744600296020507, "mean_token_accuracy": 0.6243151530623436, "num_tokens": 2710558.0, "step": 1370 }, { "entropy": 1.5513766437768937, "epoch": 0.024790048053172857, "grad_norm": 10.3125, "learning_rate": 4.999407068341992e-05, "loss": 1.7053058624267579, "mean_token_accuracy": 0.6329125322401523, "num_tokens": 2731179.0, "step": 1380 }, { "entropy": 1.5373933896422387, "epoch": 0.024969686082543675, "grad_norm": 13.9375, "learning_rate": 4.99937536760545e-05, "loss": 1.616126823425293, "mean_token_accuracy": 0.6419561401009559, "num_tokens": 2750381.0, "step": 1390 }, { "entropy": 1.4567629858851432, "epoch": 0.025149324111914492, "grad_norm": 8.75, "learning_rate": 4.9993428414681796e-05, "loss": 1.5642082214355468, "mean_token_accuracy": 0.6601189814507962, "num_tokens": 2769782.0, "step": 1400 }, { "entropy": 1.507647468149662, "epoch": 0.02532896214128531, "grad_norm": 16.375, "learning_rate": 4.999309489940924e-05, "loss": 1.5823881149291992, "mean_token_accuracy": 0.650723684579134, "num_tokens": 2789949.0, "step": 1410 }, { "entropy": 1.468251334130764, "epoch": 0.025508600170656127, "grad_norm": 10.4375, "learning_rate": 4.999275313034696e-05, "loss": 1.5939903259277344, "mean_token_accuracy": 0.6539834812283516, "num_tokens": 2810085.0, "step": 1420 }, { "entropy": 1.573106411099434, "epoch": 0.025688238200026945, "grad_norm": 11.0625, "learning_rate": 4.999240310760783e-05, "loss": 1.6474645614624024, "mean_token_accuracy": 0.6424420893192291, "num_tokens": 2828371.0, "step": 1430 }, { "entropy": 1.5729375794529914, "epoch": 0.025867876229397763, "grad_norm": 10.5, "learning_rate": 4.999204483130744e-05, "loss": 1.6772174835205078, "mean_token_accuracy": 0.6429912939667701, "num_tokens": 2848250.0, "step": 1440 }, { "entropy": 1.592067340016365, "epoch": 0.02604751425876858, "grad_norm": 12.0, "learning_rate": 4.999167830156411e-05, "loss": 1.6595354080200195, "mean_token_accuracy": 0.6351709939539433, "num_tokens": 2867489.0, "step": 1450 }, { "entropy": 1.377654667198658, "epoch": 0.026227152288139398, "grad_norm": 10.625, "learning_rate": 4.9991303518498884e-05, "loss": 1.5140768051147462, "mean_token_accuracy": 0.6695582553744316, "num_tokens": 2887394.0, "step": 1460 }, { "entropy": 1.5429529666900634, "epoch": 0.026406790317510215, "grad_norm": 11.0, "learning_rate": 4.9990920482235526e-05, "loss": 1.669426155090332, "mean_token_accuracy": 0.6400448359549046, "num_tokens": 2906814.0, "step": 1470 }, { "entropy": 1.5632092237472535, "epoch": 0.026586428346881033, "grad_norm": 10.0, "learning_rate": 4.999052919290054e-05, "loss": 1.6766624450683594, "mean_token_accuracy": 0.6423386096954345, "num_tokens": 2927477.0, "step": 1480 }, { "entropy": 1.4513872116804123, "epoch": 0.026766066376251854, "grad_norm": 9.9375, "learning_rate": 4.9990129650623144e-05, "loss": 1.5277776718139648, "mean_token_accuracy": 0.6600641779601574, "num_tokens": 2946858.0, "step": 1490 }, { "entropy": 1.4783962324261666, "epoch": 0.026945704405622672, "grad_norm": 12.25, "learning_rate": 4.998972185553528e-05, "loss": 1.5461612701416017, "mean_token_accuracy": 0.6608979612588882, "num_tokens": 2966658.0, "step": 1500 }, { "entropy": 1.4329083040356636, "epoch": 0.02712534243499349, "grad_norm": 9.125, "learning_rate": 4.998930580777162e-05, "loss": 1.5002537727355958, "mean_token_accuracy": 0.6745608203113079, "num_tokens": 2985784.0, "step": 1510 }, { "entropy": 1.5033440753817557, "epoch": 0.027304980464364307, "grad_norm": 14.5, "learning_rate": 4.998888150746957e-05, "loss": 1.591783046722412, "mean_token_accuracy": 0.6536013603210449, "num_tokens": 3005268.0, "step": 1520 }, { "entropy": 1.5715586751699449, "epoch": 0.027484618493735125, "grad_norm": 11.125, "learning_rate": 4.998844895476923e-05, "loss": 1.5852946281433105, "mean_token_accuracy": 0.6514325991272927, "num_tokens": 3024640.0, "step": 1530 }, { "entropy": 1.4802327036857605, "epoch": 0.027664256523105942, "grad_norm": 10.0, "learning_rate": 4.998800814981346e-05, "loss": 1.568634605407715, "mean_token_accuracy": 0.6610087245702744, "num_tokens": 3044144.0, "step": 1540 }, { "entropy": 1.552686908841133, "epoch": 0.02784389455247676, "grad_norm": 9.5, "learning_rate": 4.998755909274785e-05, "loss": 1.6198490142822266, "mean_token_accuracy": 0.6509311467409133, "num_tokens": 3064442.0, "step": 1550 }, { "entropy": 1.4523080557584762, "epoch": 0.028023532581847577, "grad_norm": 15.75, "learning_rate": 4.998710178372067e-05, "loss": 1.621797752380371, "mean_token_accuracy": 0.6542368687689304, "num_tokens": 3083210.0, "step": 1560 }, { "entropy": 1.6241023704409598, "epoch": 0.028203170611218395, "grad_norm": 8.9375, "learning_rate": 4.998663622288296e-05, "loss": 1.707360076904297, "mean_token_accuracy": 0.6304206505417824, "num_tokens": 3103130.0, "step": 1570 }, { "entropy": 1.459706774353981, "epoch": 0.028382808640589213, "grad_norm": 9.375, "learning_rate": 4.998616241038846e-05, "loss": 1.4722458839416503, "mean_token_accuracy": 0.6724917612969875, "num_tokens": 3122604.0, "step": 1580 }, { "entropy": 1.3426085755228996, "epoch": 0.02856244666996003, "grad_norm": 37.25, "learning_rate": 4.9985680346393646e-05, "loss": 1.6074480056762694, "mean_token_accuracy": 0.6560868576169014, "num_tokens": 3142076.0, "step": 1590 }, { "entropy": 1.366212722659111, "epoch": 0.028742084699330848, "grad_norm": 9.4375, "learning_rate": 4.9985190031057727e-05, "loss": 1.3982316970825195, "mean_token_accuracy": 0.6974723257124424, "num_tokens": 3162989.0, "step": 1600 }, { "entropy": 1.321020522713661, "epoch": 0.028921722728701665, "grad_norm": 12.1875, "learning_rate": 4.998469146454261e-05, "loss": 1.444266414642334, "mean_token_accuracy": 0.6938928335905075, "num_tokens": 3181845.0, "step": 1610 }, { "entropy": 1.4611617252230644, "epoch": 0.029101360758072483, "grad_norm": 11.375, "learning_rate": 4.9984184647012945e-05, "loss": 1.5311830520629883, "mean_token_accuracy": 0.6752639405429364, "num_tokens": 3201278.0, "step": 1620 }, { "entropy": 1.4955737888813019, "epoch": 0.0292809987874433, "grad_norm": 9.5625, "learning_rate": 4.998366957863611e-05, "loss": 1.493691349029541, "mean_token_accuracy": 0.6672499142587185, "num_tokens": 3221704.0, "step": 1630 }, { "entropy": 1.3047339126467705, "epoch": 0.029460636816814118, "grad_norm": 11.375, "learning_rate": 4.99831462595822e-05, "loss": 1.4614850997924804, "mean_token_accuracy": 0.6840211108326912, "num_tokens": 3242445.0, "step": 1640 }, { "entropy": 1.3840580880641937, "epoch": 0.029640274846184936, "grad_norm": 14.875, "learning_rate": 4.9982614690024043e-05, "loss": 1.4759600639343262, "mean_token_accuracy": 0.6760420441627503, "num_tokens": 3262220.0, "step": 1650 }, { "entropy": 1.5510875165462494, "epoch": 0.029819912875555757, "grad_norm": 12.0, "learning_rate": 4.998207487013717e-05, "loss": 1.5977466583251954, "mean_token_accuracy": 0.6495107904076576, "num_tokens": 3281865.0, "step": 1660 }, { "entropy": 1.4049832925200463, "epoch": 0.029999550904926574, "grad_norm": 8.5, "learning_rate": 4.9981526800099875e-05, "loss": 1.4581579208374023, "mean_token_accuracy": 0.6835083514451981, "num_tokens": 3301008.0, "step": 1670 }, { "entropy": 1.5528059363365174, "epoch": 0.030179188934297392, "grad_norm": 11.5, "learning_rate": 4.998097048009315e-05, "loss": 1.6444576263427735, "mean_token_accuracy": 0.6547182284295558, "num_tokens": 3319908.0, "step": 1680 }, { "entropy": 1.2988245815038681, "epoch": 0.03035882696366821, "grad_norm": 10.5625, "learning_rate": 4.99804059103007e-05, "loss": 1.3999847412109374, "mean_token_accuracy": 0.6804589122533798, "num_tokens": 3340185.0, "step": 1690 }, { "entropy": 1.4380019143223763, "epoch": 0.030538464993039027, "grad_norm": 11.25, "learning_rate": 4.997983309090898e-05, "loss": 1.4962980270385742, "mean_token_accuracy": 0.6764723815023899, "num_tokens": 3359706.0, "step": 1700 }, { "entropy": 1.4233854606747627, "epoch": 0.030718103022409845, "grad_norm": 9.9375, "learning_rate": 4.997925202210715e-05, "loss": 1.539259910583496, "mean_token_accuracy": 0.6645733818411828, "num_tokens": 3379611.0, "step": 1710 }, { "entropy": 1.4388819113373756, "epoch": 0.030897741051780662, "grad_norm": 10.5625, "learning_rate": 4.997866270408712e-05, "loss": 1.5832198143005372, "mean_token_accuracy": 0.6639614477753639, "num_tokens": 3400687.0, "step": 1720 }, { "entropy": 1.5089255303144455, "epoch": 0.03107737908115148, "grad_norm": 12.9375, "learning_rate": 4.9978065137043506e-05, "loss": 1.5903237342834473, "mean_token_accuracy": 0.6547822445631027, "num_tokens": 3419916.0, "step": 1730 }, { "entropy": 1.4004312366247178, "epoch": 0.0312570171105223, "grad_norm": 10.5, "learning_rate": 4.997745932117364e-05, "loss": 1.4962909698486329, "mean_token_accuracy": 0.6745987348258495, "num_tokens": 3438709.0, "step": 1740 }, { "entropy": 1.4637741982936858, "epoch": 0.03143665513989312, "grad_norm": 9.9375, "learning_rate": 4.997684525667759e-05, "loss": 1.5000354766845703, "mean_token_accuracy": 0.6743131808936595, "num_tokens": 3458225.0, "step": 1750 }, { "entropy": 1.3026440516114235, "epoch": 0.03161629316926393, "grad_norm": 11.875, "learning_rate": 4.997622294375816e-05, "loss": 1.4002955436706543, "mean_token_accuracy": 0.692991704493761, "num_tokens": 3477608.0, "step": 1760 }, { "entropy": 1.443167109787464, "epoch": 0.031795931198634754, "grad_norm": 12.375, "learning_rate": 4.9975592382620836e-05, "loss": 1.4983144760131837, "mean_token_accuracy": 0.6700777739286423, "num_tokens": 3496123.0, "step": 1770 }, { "entropy": 1.459372314810753, "epoch": 0.03197556922800557, "grad_norm": 10.25, "learning_rate": 4.997495357347388e-05, "loss": 1.489708137512207, "mean_token_accuracy": 0.6677679911255836, "num_tokens": 3516787.0, "step": 1780 }, { "entropy": 1.333537481725216, "epoch": 0.03215520725737639, "grad_norm": 8.625, "learning_rate": 4.997430651652826e-05, "loss": 1.4847636222839355, "mean_token_accuracy": 0.6733242832124233, "num_tokens": 3536899.0, "step": 1790 }, { "entropy": 1.4999468088150025, "epoch": 0.0323348452867472, "grad_norm": 11.625, "learning_rate": 4.997365121199764e-05, "loss": 1.5769845008850099, "mean_token_accuracy": 0.6588590689003467, "num_tokens": 3557046.0, "step": 1800 }, { "entropy": 1.452918392419815, "epoch": 0.032514483316118024, "grad_norm": 10.0625, "learning_rate": 4.997298766009844e-05, "loss": 1.5399716377258301, "mean_token_accuracy": 0.6588214591145516, "num_tokens": 3577721.0, "step": 1810 }, { "entropy": 1.4200744450092315, "epoch": 0.03269412134548884, "grad_norm": 9.9375, "learning_rate": 4.9972315861049794e-05, "loss": 1.4729167938232421, "mean_token_accuracy": 0.6796995468437672, "num_tokens": 3597102.0, "step": 1820 }, { "entropy": 1.2982208222150802, "epoch": 0.03287375937485966, "grad_norm": 9.4375, "learning_rate": 4.997163581507356e-05, "loss": 1.3422197341918944, "mean_token_accuracy": 0.6908485218882561, "num_tokens": 3617565.0, "step": 1830 }, { "entropy": 1.3019727289676666, "epoch": 0.033053397404230474, "grad_norm": 11.5625, "learning_rate": 4.997094752239431e-05, "loss": 1.4144463539123535, "mean_token_accuracy": 0.6866289287805557, "num_tokens": 3638110.0, "step": 1840 }, { "entropy": 1.5307150796055793, "epoch": 0.033233035433601295, "grad_norm": 10.1875, "learning_rate": 4.997025098323936e-05, "loss": 1.5762164115905761, "mean_token_accuracy": 0.6582541570067406, "num_tokens": 3657763.0, "step": 1850 }, { "entropy": 1.3525944530963898, "epoch": 0.03341267346297211, "grad_norm": 9.4375, "learning_rate": 4.996954619783873e-05, "loss": 1.4310758590698243, "mean_token_accuracy": 0.6845531776547432, "num_tokens": 3676808.0, "step": 1860 }, { "entropy": 1.4061302855610847, "epoch": 0.03359231149234293, "grad_norm": 11.0625, "learning_rate": 4.996883316642517e-05, "loss": 1.454031753540039, "mean_token_accuracy": 0.6834939956665039, "num_tokens": 3696335.0, "step": 1870 }, { "entropy": 1.476578514277935, "epoch": 0.033771949521713744, "grad_norm": 10.8125, "learning_rate": 4.9968111889234145e-05, "loss": 1.58303804397583, "mean_token_accuracy": 0.6579067260026932, "num_tokens": 3716773.0, "step": 1880 }, { "entropy": 1.5915799140930176, "epoch": 0.033951587551084565, "grad_norm": 11.625, "learning_rate": 4.996738236650388e-05, "loss": 1.6760948181152344, "mean_token_accuracy": 0.6308161959052085, "num_tokens": 3736866.0, "step": 1890 }, { "entropy": 1.4185971394181252, "epoch": 0.03413122558045538, "grad_norm": 8.75, "learning_rate": 4.9966644598475266e-05, "loss": 1.4916116714477539, "mean_token_accuracy": 0.6840248756110668, "num_tokens": 3757687.0, "step": 1900 }, { "entropy": 1.4899285048246385, "epoch": 0.0343108636098262, "grad_norm": 10.875, "learning_rate": 4.9965898585391954e-05, "loss": 1.5667666435241698, "mean_token_accuracy": 0.6564998932182788, "num_tokens": 3777462.0, "step": 1910 }, { "entropy": 1.4775958225131034, "epoch": 0.034490501639197015, "grad_norm": 8.125, "learning_rate": 4.996514432750031e-05, "loss": 1.6225557327270508, "mean_token_accuracy": 0.6544752031564712, "num_tokens": 3796725.0, "step": 1920 }, { "entropy": 1.3850451871752738, "epoch": 0.034670139668567836, "grad_norm": 11.5625, "learning_rate": 4.996438182504942e-05, "loss": 1.4020709991455078, "mean_token_accuracy": 0.6894868232309819, "num_tokens": 3816310.0, "step": 1930 }, { "entropy": 1.4130028799176215, "epoch": 0.03484977769793866, "grad_norm": 9.4375, "learning_rate": 4.996361107829111e-05, "loss": 1.5707258224487304, "mean_token_accuracy": 0.6510094694793225, "num_tokens": 3835270.0, "step": 1940 }, { "entropy": 1.4181913778185844, "epoch": 0.03502941572730947, "grad_norm": 6.6875, "learning_rate": 4.996283208747989e-05, "loss": 1.4030420303344726, "mean_token_accuracy": 0.687630844861269, "num_tokens": 3855525.0, "step": 1950 }, { "entropy": 1.387476322054863, "epoch": 0.03520905375668029, "grad_norm": 9.5625, "learning_rate": 4.996204485287304e-05, "loss": 1.5385560989379883, "mean_token_accuracy": 0.6627428747713566, "num_tokens": 3876068.0, "step": 1960 }, { "entropy": 1.5595558032393455, "epoch": 0.035388691786051106, "grad_norm": 9.1875, "learning_rate": 4.996124937473051e-05, "loss": 1.5708704948425294, "mean_token_accuracy": 0.659713289141655, "num_tokens": 3896088.0, "step": 1970 }, { "entropy": 1.3917503014206887, "epoch": 0.03556832981542193, "grad_norm": 9.5, "learning_rate": 4.996044565331502e-05, "loss": 1.4669230461120606, "mean_token_accuracy": 0.672278282046318, "num_tokens": 3914554.0, "step": 1980 }, { "entropy": 1.5031164228916167, "epoch": 0.03574796784479274, "grad_norm": 9.625, "learning_rate": 4.9959633688892e-05, "loss": 1.6079071044921875, "mean_token_accuracy": 0.6591591216623783, "num_tokens": 3934276.0, "step": 1990 }, { "epoch": 0.03592760587416356, "eval_entropy": 1.386294443845749, "eval_loss": 1.4577912092208862, "eval_mean_token_accuracy": 0.6798514029979705, "eval_num_tokens": 3953916.0, "eval_runtime": 40.4522, "eval_samples_per_second": 49.441, "eval_steps_per_second": 6.18, "step": 2000 }, { "entropy": 1.3852115996181964, "epoch": 0.036107243903534376, "grad_norm": 8.5, "learning_rate": 4.9957985032098636e-05, "loss": 1.4510122299194337, "mean_token_accuracy": 0.6766671903431416, "num_tokens": 3976478.0, "step": 2010 }, { "entropy": 1.3892260804772376, "epoch": 0.0362868819329052, "grad_norm": 14.4375, "learning_rate": 4.995714834027275e-05, "loss": 1.4879559516906737, "mean_token_accuracy": 0.6728622771799564, "num_tokens": 3996357.0, "step": 2020 }, { "entropy": 1.2689381957054138, "epoch": 0.03646651996227601, "grad_norm": 11.375, "learning_rate": 4.995630340652825e-05, "loss": 1.3114850044250488, "mean_token_accuracy": 0.7042328543961048, "num_tokens": 4015938.0, "step": 2030 }, { "entropy": 1.346160574257374, "epoch": 0.03664615799164683, "grad_norm": 8.8125, "learning_rate": 4.995545023114414e-05, "loss": 1.4239927291870118, "mean_token_accuracy": 0.6828582987189293, "num_tokens": 4035180.0, "step": 2040 }, { "entropy": 1.3286015927791595, "epoch": 0.03682579602101765, "grad_norm": 8.5, "learning_rate": 4.99545888144022e-05, "loss": 1.3946846961975097, "mean_token_accuracy": 0.6950214438140392, "num_tokens": 4054300.0, "step": 2050 }, { "entropy": 1.4283461213111877, "epoch": 0.03700543405038847, "grad_norm": 11.25, "learning_rate": 4.995371915658691e-05, "loss": 1.5292243957519531, "mean_token_accuracy": 0.6782881774008274, "num_tokens": 4073937.0, "step": 2060 }, { "entropy": 1.5037285730242729, "epoch": 0.03718507207975928, "grad_norm": 10.6875, "learning_rate": 4.995284125798545e-05, "loss": 1.622320556640625, "mean_token_accuracy": 0.6501829117536545, "num_tokens": 4094074.0, "step": 2070 }, { "entropy": 1.4100628808140754, "epoch": 0.0373647101091301, "grad_norm": 10.4375, "learning_rate": 4.995195511888774e-05, "loss": 1.441728401184082, "mean_token_accuracy": 0.6748277321457863, "num_tokens": 4113754.0, "step": 2080 }, { "entropy": 1.2534951508045196, "epoch": 0.03754434813850092, "grad_norm": 8.875, "learning_rate": 4.995106073958644e-05, "loss": 1.3250720977783204, "mean_token_accuracy": 0.7045919358730316, "num_tokens": 4132875.0, "step": 2090 }, { "entropy": 1.3869805589318276, "epoch": 0.03772398616787174, "grad_norm": 9.5, "learning_rate": 4.995015812037689e-05, "loss": 1.500474452972412, "mean_token_accuracy": 0.6728356026113034, "num_tokens": 4152888.0, "step": 2100 }, { "entropy": 1.407675413787365, "epoch": 0.03790362419724256, "grad_norm": 12.5625, "learning_rate": 4.994924726155719e-05, "loss": 1.471339511871338, "mean_token_accuracy": 0.6686058312654495, "num_tokens": 4172954.0, "step": 2110 }, { "entropy": 1.3001487225294113, "epoch": 0.038083262226613374, "grad_norm": 7.65625, "learning_rate": 4.994832816342814e-05, "loss": 1.355784797668457, "mean_token_accuracy": 0.701902487128973, "num_tokens": 4192622.0, "step": 2120 }, { "entropy": 1.322553563117981, "epoch": 0.038262900255984195, "grad_norm": 9.125, "learning_rate": 4.994740082629325e-05, "loss": 1.3366957664489747, "mean_token_accuracy": 0.698298542201519, "num_tokens": 4212532.0, "step": 2130 }, { "entropy": 1.2555802136659622, "epoch": 0.03844253828535501, "grad_norm": 11.6875, "learning_rate": 4.99464652504588e-05, "loss": 1.3966214179992675, "mean_token_accuracy": 0.6893934711813927, "num_tokens": 4232317.0, "step": 2140 }, { "entropy": 1.3680005744099617, "epoch": 0.03862217631472583, "grad_norm": 9.375, "learning_rate": 4.9945521436233734e-05, "loss": 1.4108839988708497, "mean_token_accuracy": 0.676778818666935, "num_tokens": 4251961.0, "step": 2150 }, { "entropy": 1.3847421169281007, "epoch": 0.038801814344096644, "grad_norm": 8.5, "learning_rate": 4.9944569383929736e-05, "loss": 1.4746883392333985, "mean_token_accuracy": 0.6758048750460148, "num_tokens": 4271400.0, "step": 2160 }, { "entropy": 1.4548217207193375, "epoch": 0.038981452373467465, "grad_norm": 7.125, "learning_rate": 4.9943609093861224e-05, "loss": 1.5626228332519532, "mean_token_accuracy": 0.6512648619711399, "num_tokens": 4292287.0, "step": 2170 }, { "entropy": 1.4191979765892029, "epoch": 0.03916109040283828, "grad_norm": 9.25, "learning_rate": 4.9942640566345325e-05, "loss": 1.4875967025756835, "mean_token_accuracy": 0.6716679044067859, "num_tokens": 4311407.0, "step": 2180 }, { "entropy": 1.2986303925514222, "epoch": 0.0393407284322091, "grad_norm": 14.5625, "learning_rate": 4.994166380170189e-05, "loss": 1.344566249847412, "mean_token_accuracy": 0.7027465403079987, "num_tokens": 4331325.0, "step": 2190 }, { "entropy": 1.3378031596541404, "epoch": 0.039520366461579914, "grad_norm": 7.9375, "learning_rate": 4.994067880025349e-05, "loss": 1.4125244140625, "mean_token_accuracy": 0.6898518830537796, "num_tokens": 4351787.0, "step": 2200 }, { "entropy": 1.3462848573923112, "epoch": 0.039700004490950735, "grad_norm": 8.8125, "learning_rate": 4.9939685562325405e-05, "loss": 1.444535255432129, "mean_token_accuracy": 0.6816151268780232, "num_tokens": 4372412.0, "step": 2210 }, { "entropy": 1.4076301500201225, "epoch": 0.03987964252032155, "grad_norm": 8.625, "learning_rate": 4.993868408824566e-05, "loss": 1.440959644317627, "mean_token_accuracy": 0.6924315065145492, "num_tokens": 4392563.0, "step": 2220 }, { "entropy": 1.4046123221516609, "epoch": 0.04005928054969237, "grad_norm": 10.0, "learning_rate": 4.993767437834496e-05, "loss": 1.553008460998535, "mean_token_accuracy": 0.6718848347663879, "num_tokens": 4411924.0, "step": 2230 }, { "entropy": 1.2542652651667594, "epoch": 0.040238918579063185, "grad_norm": 7.4375, "learning_rate": 4.993665643295678e-05, "loss": 1.3188764572143554, "mean_token_accuracy": 0.6935629293322563, "num_tokens": 4431340.0, "step": 2240 }, { "entropy": 1.3614250645041466, "epoch": 0.040418556608434006, "grad_norm": 8.875, "learning_rate": 4.993563025241728e-05, "loss": 1.4111050605773925, "mean_token_accuracy": 0.689359862357378, "num_tokens": 4450515.0, "step": 2250 }, { "entropy": 1.310494926571846, "epoch": 0.04059819463780482, "grad_norm": 6.8125, "learning_rate": 4.993459583706534e-05, "loss": 1.3224611282348633, "mean_token_accuracy": 0.7060503855347633, "num_tokens": 4470031.0, "step": 2260 }, { "entropy": 1.3604912854731084, "epoch": 0.04077783266717564, "grad_norm": 9.5, "learning_rate": 4.9933553187242586e-05, "loss": 1.5020469665527343, "mean_token_accuracy": 0.6709420837461948, "num_tokens": 4490672.0, "step": 2270 }, { "entropy": 1.3310826301574707, "epoch": 0.04095747069654646, "grad_norm": 9.4375, "learning_rate": 4.9932502303293336e-05, "loss": 1.3717524528503418, "mean_token_accuracy": 0.6959741517901421, "num_tokens": 4509494.0, "step": 2280 }, { "entropy": 1.3372018203139304, "epoch": 0.041137108725917276, "grad_norm": 10.125, "learning_rate": 4.993144318556463e-05, "loss": 1.4499279975891113, "mean_token_accuracy": 0.678582813590765, "num_tokens": 4528424.0, "step": 2290 }, { "entropy": 1.4755570113658905, "epoch": 0.0413167467552881, "grad_norm": 8.1875, "learning_rate": 4.9930375834406245e-05, "loss": 1.5132333755493164, "mean_token_accuracy": 0.6683591969311238, "num_tokens": 4548511.0, "step": 2300 }, { "entropy": 1.2982542484998703, "epoch": 0.04149638478465891, "grad_norm": 7.03125, "learning_rate": 4.992930025017066e-05, "loss": 1.3485528945922851, "mean_token_accuracy": 0.6985410317778588, "num_tokens": 4568884.0, "step": 2310 }, { "entropy": 1.2956511452794075, "epoch": 0.04167602281402973, "grad_norm": 7.125, "learning_rate": 4.992821643321308e-05, "loss": 1.3949552536010743, "mean_token_accuracy": 0.6817234754562378, "num_tokens": 4589343.0, "step": 2320 }, { "entropy": 1.3517157122492791, "epoch": 0.04185566084340055, "grad_norm": 10.5625, "learning_rate": 4.992712438389143e-05, "loss": 1.423372459411621, "mean_token_accuracy": 0.6937249153852463, "num_tokens": 4608678.0, "step": 2330 }, { "entropy": 1.3493634089827538, "epoch": 0.04203529887277137, "grad_norm": 10.0625, "learning_rate": 4.992602410256635e-05, "loss": 1.3928610801696777, "mean_token_accuracy": 0.6890722371637821, "num_tokens": 4629429.0, "step": 2340 }, { "entropy": 1.2909897580742835, "epoch": 0.04221493690214218, "grad_norm": 9.25, "learning_rate": 4.99249155896012e-05, "loss": 1.306317138671875, "mean_token_accuracy": 0.7104037247598172, "num_tokens": 4649013.0, "step": 2350 }, { "entropy": 1.3496612012386322, "epoch": 0.042394574931513, "grad_norm": 7.875, "learning_rate": 4.9923798845362055e-05, "loss": 1.4225537300109863, "mean_token_accuracy": 0.6847415447235108, "num_tokens": 4667684.0, "step": 2360 }, { "entropy": 1.3888683900237084, "epoch": 0.04257421296088382, "grad_norm": 8.75, "learning_rate": 4.992267387021772e-05, "loss": 1.4505311965942382, "mean_token_accuracy": 0.6889954619109631, "num_tokens": 4688012.0, "step": 2370 }, { "entropy": 1.2660149484872818, "epoch": 0.04275385099025464, "grad_norm": 11.4375, "learning_rate": 4.9921540664539694e-05, "loss": 1.412290668487549, "mean_token_accuracy": 0.685637129098177, "num_tokens": 4706808.0, "step": 2380 }, { "entropy": 1.2213765501976013, "epoch": 0.04293348901962545, "grad_norm": 8.9375, "learning_rate": 4.992039922870223e-05, "loss": 1.3109620094299317, "mean_token_accuracy": 0.7055920973420143, "num_tokens": 4726385.0, "step": 2390 }, { "entropy": 1.4299337461590766, "epoch": 0.04311312704899627, "grad_norm": 9.0625, "learning_rate": 4.991924956308227e-05, "loss": 1.5099981307983399, "mean_token_accuracy": 0.6700854904949665, "num_tokens": 4745568.0, "step": 2400 }, { "entropy": 1.3655345007777213, "epoch": 0.04329276507836709, "grad_norm": 9.25, "learning_rate": 4.991809166805948e-05, "loss": 1.400827693939209, "mean_token_accuracy": 0.6930969566106796, "num_tokens": 4765320.0, "step": 2410 }, { "entropy": 1.3112824589014054, "epoch": 0.04347240310773791, "grad_norm": 9.0625, "learning_rate": 4.9916925544016246e-05, "loss": 1.3679177284240722, "mean_token_accuracy": 0.6980331242084503, "num_tokens": 4786248.0, "step": 2420 }, { "entropy": 1.2900094658136367, "epoch": 0.04365204113710872, "grad_norm": 7.0, "learning_rate": 4.991575119133768e-05, "loss": 1.3773300170898437, "mean_token_accuracy": 0.6965838596224785, "num_tokens": 4806161.0, "step": 2430 }, { "entropy": 1.3515348821878432, "epoch": 0.043831679166479544, "grad_norm": 8.375, "learning_rate": 4.991456861041161e-05, "loss": 1.4092613220214845, "mean_token_accuracy": 0.6918789118528366, "num_tokens": 4826047.0, "step": 2440 }, { "entropy": 1.4256507366895677, "epoch": 0.044011317195850365, "grad_norm": 14.875, "learning_rate": 4.991337780162854e-05, "loss": 1.3939717292785645, "mean_token_accuracy": 0.6889933459460735, "num_tokens": 4845778.0, "step": 2450 }, { "entropy": 1.3277788490056992, "epoch": 0.04419095522522118, "grad_norm": 9.25, "learning_rate": 4.991217876538177e-05, "loss": 1.388737964630127, "mean_token_accuracy": 0.6865644760429859, "num_tokens": 4865383.0, "step": 2460 }, { "entropy": 1.3833733096718788, "epoch": 0.044370593254592, "grad_norm": 9.0, "learning_rate": 4.991097150206724e-05, "loss": 1.4994051933288575, "mean_token_accuracy": 0.6717169411480427, "num_tokens": 4885618.0, "step": 2470 }, { "entropy": 1.2716542035341263, "epoch": 0.044550231283962814, "grad_norm": 8.4375, "learning_rate": 4.990975601208365e-05, "loss": 1.2832053184509278, "mean_token_accuracy": 0.7136360689997673, "num_tokens": 4906218.0, "step": 2480 }, { "entropy": 1.34033023416996, "epoch": 0.044729869313333635, "grad_norm": 9.375, "learning_rate": 4.990853229583242e-05, "loss": 1.436203956604004, "mean_token_accuracy": 0.6842044688761234, "num_tokens": 4927510.0, "step": 2490 }, { "entropy": 1.4591680765151978, "epoch": 0.04490950734270445, "grad_norm": 7.40625, "learning_rate": 4.9907300353717654e-05, "loss": 1.4958786964416504, "mean_token_accuracy": 0.6768533974885941, "num_tokens": 4947233.0, "step": 2500 }, { "entropy": 1.223151443898678, "epoch": 0.04508914537207527, "grad_norm": 16.75, "learning_rate": 4.990606018614621e-05, "loss": 1.2687625885009766, "mean_token_accuracy": 0.7144640415906907, "num_tokens": 4966394.0, "step": 2510 }, { "entropy": 1.321670588850975, "epoch": 0.045268783401446085, "grad_norm": 12.5, "learning_rate": 4.990481179352763e-05, "loss": 1.4832565307617187, "mean_token_accuracy": 0.6693767845630646, "num_tokens": 4985129.0, "step": 2520 }, { "entropy": 1.243193519115448, "epoch": 0.045448421430816906, "grad_norm": 8.6875, "learning_rate": 4.9903555176274195e-05, "loss": 1.259221649169922, "mean_token_accuracy": 0.7097675010561943, "num_tokens": 5005158.0, "step": 2530 }, { "entropy": 1.3275543317198752, "epoch": 0.04562805946018772, "grad_norm": 9.9375, "learning_rate": 4.9902290334800897e-05, "loss": 1.4005366325378419, "mean_token_accuracy": 0.6900383830070496, "num_tokens": 5025099.0, "step": 2540 }, { "entropy": 1.35167026668787, "epoch": 0.04580769748955854, "grad_norm": 9.4375, "learning_rate": 4.9901017269525425e-05, "loss": 1.3493748664855958, "mean_token_accuracy": 0.7060595467686653, "num_tokens": 5044943.0, "step": 2550 }, { "entropy": 1.1953320011496544, "epoch": 0.045987335518929355, "grad_norm": 9.1875, "learning_rate": 4.9899735980868214e-05, "loss": 1.279421615600586, "mean_token_accuracy": 0.7239278607070446, "num_tokens": 5064780.0, "step": 2560 }, { "entropy": 1.2834494024515153, "epoch": 0.046166973548300176, "grad_norm": 10.5, "learning_rate": 4.989844646925239e-05, "loss": 1.3923212051391602, "mean_token_accuracy": 0.6952004477381706, "num_tokens": 5084058.0, "step": 2570 }, { "entropy": 1.1845080688595773, "epoch": 0.04634661157767099, "grad_norm": 9.4375, "learning_rate": 4.9897148735103816e-05, "loss": 1.220262336730957, "mean_token_accuracy": 0.7271849617362023, "num_tokens": 5103486.0, "step": 2580 }, { "entropy": 1.4354370057582855, "epoch": 0.04652624960704181, "grad_norm": 9.5625, "learning_rate": 4.9895842778851056e-05, "loss": 1.5020055770874023, "mean_token_accuracy": 0.6726393468677998, "num_tokens": 5123695.0, "step": 2590 }, { "entropy": 1.3275725990533829, "epoch": 0.046705887636412625, "grad_norm": 7.65625, "learning_rate": 4.989452860092538e-05, "loss": 1.3116796493530274, "mean_token_accuracy": 0.7051602303981781, "num_tokens": 5142404.0, "step": 2600 }, { "entropy": 1.192495933175087, "epoch": 0.04688552566578345, "grad_norm": 10.0625, "learning_rate": 4.989320620176081e-05, "loss": 1.4025640487670898, "mean_token_accuracy": 0.688460073620081, "num_tokens": 5161318.0, "step": 2610 }, { "entropy": 1.2570716872811318, "epoch": 0.04706516369515427, "grad_norm": 7.0625, "learning_rate": 4.9891875581794033e-05, "loss": 1.3261414527893067, "mean_token_accuracy": 0.7105177581310272, "num_tokens": 5180927.0, "step": 2620 }, { "entropy": 1.337856189906597, "epoch": 0.04724480172452508, "grad_norm": 9.1875, "learning_rate": 4.98905367414645e-05, "loss": 1.3589582443237305, "mean_token_accuracy": 0.6933407261967659, "num_tokens": 5201323.0, "step": 2630 }, { "entropy": 1.3069262325763702, "epoch": 0.0474244397538959, "grad_norm": 9.5, "learning_rate": 4.9889189681214335e-05, "loss": 1.416452407836914, "mean_token_accuracy": 0.6833235710859299, "num_tokens": 5220469.0, "step": 2640 }, { "entropy": 1.422820433974266, "epoch": 0.04760407778326672, "grad_norm": 8.0625, "learning_rate": 4.9887834401488406e-05, "loss": 1.4213821411132812, "mean_token_accuracy": 0.683092050999403, "num_tokens": 5241302.0, "step": 2650 }, { "entropy": 1.2506478175520896, "epoch": 0.04778371581263754, "grad_norm": 10.125, "learning_rate": 4.988647090273428e-05, "loss": 1.396510696411133, "mean_token_accuracy": 0.6983902335166932, "num_tokens": 5261404.0, "step": 2660 }, { "entropy": 1.3648975372314454, "epoch": 0.04796335384200835, "grad_norm": 8.125, "learning_rate": 4.988509918540224e-05, "loss": 1.3885870933532716, "mean_token_accuracy": 0.6930775731801987, "num_tokens": 5281482.0, "step": 2670 }, { "entropy": 1.3311908036470412, "epoch": 0.04814299187137917, "grad_norm": 8.4375, "learning_rate": 4.988371924994529e-05, "loss": 1.3789891242980956, "mean_token_accuracy": 0.6992242433130741, "num_tokens": 5301408.0, "step": 2680 }, { "entropy": 1.3038343518972397, "epoch": 0.04832262990074999, "grad_norm": 7.6875, "learning_rate": 4.9882331096819145e-05, "loss": 1.3972562789916991, "mean_token_accuracy": 0.6883526988327503, "num_tokens": 5320443.0, "step": 2690 }, { "entropy": 1.311833919584751, "epoch": 0.04850226793012081, "grad_norm": 8.0625, "learning_rate": 4.9880934726482234e-05, "loss": 1.3173972129821778, "mean_token_accuracy": 0.7006198644638062, "num_tokens": 5340777.0, "step": 2700 }, { "entropy": 1.3987028837203979, "epoch": 0.04868190595949162, "grad_norm": 7.125, "learning_rate": 4.9879530139395695e-05, "loss": 1.5190353393554688, "mean_token_accuracy": 0.6705217584967613, "num_tokens": 5361079.0, "step": 2710 }, { "entropy": 1.300481103360653, "epoch": 0.048861543988862444, "grad_norm": 8.5, "learning_rate": 4.987811733602338e-05, "loss": 1.29676513671875, "mean_token_accuracy": 0.7194139674305916, "num_tokens": 5380992.0, "step": 2720 }, { "entropy": 1.294689479470253, "epoch": 0.04904118201823326, "grad_norm": 8.1875, "learning_rate": 4.987669631683185e-05, "loss": 1.4212841033935546, "mean_token_accuracy": 0.6948933452367783, "num_tokens": 5401446.0, "step": 2730 }, { "entropy": 1.26357045173645, "epoch": 0.04922082004760408, "grad_norm": 8.5625, "learning_rate": 4.987526708229041e-05, "loss": 1.331010627746582, "mean_token_accuracy": 0.6966155946254731, "num_tokens": 5420973.0, "step": 2740 }, { "entropy": 1.3671389058232308, "epoch": 0.04940045807697489, "grad_norm": 12.75, "learning_rate": 4.987382963287103e-05, "loss": 1.3746275901794434, "mean_token_accuracy": 0.6926651231944561, "num_tokens": 5441255.0, "step": 2750 }, { "entropy": 1.2061855614185333, "epoch": 0.049580096106345714, "grad_norm": 10.5, "learning_rate": 4.987238396904843e-05, "loss": 1.3396441459655761, "mean_token_accuracy": 0.7067731723189354, "num_tokens": 5461883.0, "step": 2760 }, { "entropy": 1.3966844588518144, "epoch": 0.04975973413571653, "grad_norm": 8.125, "learning_rate": 4.9870930091300034e-05, "loss": 1.4205124855041504, "mean_token_accuracy": 0.688123058527708, "num_tokens": 5481480.0, "step": 2770 }, { "entropy": 1.1706627994775771, "epoch": 0.04993937216508735, "grad_norm": 8.0625, "learning_rate": 4.986946800010597e-05, "loss": 1.2511099815368651, "mean_token_accuracy": 0.7223161771893502, "num_tokens": 5502785.0, "step": 2780 }, { "entropy": 1.281210759282112, "epoch": 0.05011901019445816, "grad_norm": 8.9375, "learning_rate": 4.986799769594907e-05, "loss": 1.387538242340088, "mean_token_accuracy": 0.6984438315033913, "num_tokens": 5524148.0, "step": 2790 }, { "entropy": 1.3482430651783943, "epoch": 0.050298648223828984, "grad_norm": 6.5, "learning_rate": 4.986651917931491e-05, "loss": 1.3431249618530274, "mean_token_accuracy": 0.704458849877119, "num_tokens": 5543845.0, "step": 2800 }, { "entropy": 1.2614577263593674, "epoch": 0.050478286253199806, "grad_norm": 6.46875, "learning_rate": 4.986503245069175e-05, "loss": 1.3213672637939453, "mean_token_accuracy": 0.7075468108057976, "num_tokens": 5564439.0, "step": 2810 }, { "entropy": 1.266054430603981, "epoch": 0.05065792428257062, "grad_norm": 9.4375, "learning_rate": 4.986353751057058e-05, "loss": 1.3275205612182617, "mean_token_accuracy": 0.7045779831707477, "num_tokens": 5583368.0, "step": 2820 }, { "entropy": 1.2890402510762216, "epoch": 0.05083756231194144, "grad_norm": 6.375, "learning_rate": 4.9862034359445076e-05, "loss": 1.3899471282958984, "mean_token_accuracy": 0.6825043484568596, "num_tokens": 5604202.0, "step": 2830 }, { "entropy": 1.3366580858826638, "epoch": 0.051017200341312255, "grad_norm": 8.1875, "learning_rate": 4.9860522997811664e-05, "loss": 1.3271031379699707, "mean_token_accuracy": 0.7065982103347779, "num_tokens": 5623725.0, "step": 2840 }, { "entropy": 1.2373004704713821, "epoch": 0.051196838370683076, "grad_norm": 8.75, "learning_rate": 4.985900342616945e-05, "loss": 1.3450727462768555, "mean_token_accuracy": 0.6976740017533303, "num_tokens": 5644627.0, "step": 2850 }, { "entropy": 1.369050419330597, "epoch": 0.05137647640005389, "grad_norm": 8.4375, "learning_rate": 4.985747564502026e-05, "loss": 1.4189981460571288, "mean_token_accuracy": 0.6970780231058598, "num_tokens": 5665570.0, "step": 2860 }, { "entropy": 1.1946534171700478, "epoch": 0.05155611442942471, "grad_norm": 8.0625, "learning_rate": 4.985593965486863e-05, "loss": 1.2828879356384277, "mean_token_accuracy": 0.7100204780697823, "num_tokens": 5685833.0, "step": 2870 }, { "entropy": 1.2458000168204308, "epoch": 0.051735752458795525, "grad_norm": 7.5, "learning_rate": 4.985439545622181e-05, "loss": 1.2325324058532714, "mean_token_accuracy": 0.7182733811438083, "num_tokens": 5706468.0, "step": 2880 }, { "entropy": 1.1770873591303825, "epoch": 0.051915390488166346, "grad_norm": 9.9375, "learning_rate": 4.985284304958978e-05, "loss": 1.2611387252807618, "mean_token_accuracy": 0.7225394740700721, "num_tokens": 5726485.0, "step": 2890 }, { "entropy": 1.279192292690277, "epoch": 0.05209502851753716, "grad_norm": 10.375, "learning_rate": 4.9851282435485184e-05, "loss": 1.3833558082580566, "mean_token_accuracy": 0.6912841096520423, "num_tokens": 5745620.0, "step": 2900 }, { "entropy": 1.2917813286185265, "epoch": 0.05227466654690798, "grad_norm": 7.78125, "learning_rate": 4.984971361442342e-05, "loss": 1.28564453125, "mean_token_accuracy": 0.7049105674028396, "num_tokens": 5764605.0, "step": 2910 }, { "entropy": 1.2992657899856568, "epoch": 0.052454304576278796, "grad_norm": 10.125, "learning_rate": 4.984813658692257e-05, "loss": 1.321458911895752, "mean_token_accuracy": 0.707523126900196, "num_tokens": 5784159.0, "step": 2920 }, { "entropy": 1.13544053286314, "epoch": 0.05263394260564962, "grad_norm": 5.84375, "learning_rate": 4.9846551353503445e-05, "loss": 1.2309046745300294, "mean_token_accuracy": 0.7213367313146591, "num_tokens": 5803812.0, "step": 2930 }, { "entropy": 1.3005485817790032, "epoch": 0.05281358063502043, "grad_norm": 10.25, "learning_rate": 4.984495791468956e-05, "loss": 1.4027809143066405, "mean_token_accuracy": 0.6931733332574368, "num_tokens": 5823166.0, "step": 2940 }, { "entropy": 1.254653562605381, "epoch": 0.05299321866439125, "grad_norm": 8.625, "learning_rate": 4.9843356271007125e-05, "loss": 1.300437068939209, "mean_token_accuracy": 0.705638687312603, "num_tokens": 5843386.0, "step": 2950 }, { "entropy": 1.3216019973158837, "epoch": 0.053172856693762066, "grad_norm": 7.25, "learning_rate": 4.984174642298507e-05, "loss": 1.359949493408203, "mean_token_accuracy": 0.7100481852889061, "num_tokens": 5862634.0, "step": 2960 }, { "entropy": 1.3008277341723442, "epoch": 0.05335249472313289, "grad_norm": 15.375, "learning_rate": 4.9840128371155046e-05, "loss": 1.368751621246338, "mean_token_accuracy": 0.6962978295981884, "num_tokens": 5881644.0, "step": 2970 }, { "entropy": 1.240821860730648, "epoch": 0.05353213275250371, "grad_norm": 8.5625, "learning_rate": 4.98385021160514e-05, "loss": 1.268119716644287, "mean_token_accuracy": 0.7124153539538384, "num_tokens": 5901449.0, "step": 2980 }, { "entropy": 1.2630082756280898, "epoch": 0.05371177078187452, "grad_norm": 7.3125, "learning_rate": 4.983686765821119e-05, "loss": 1.3535577774047851, "mean_token_accuracy": 0.7052506610751152, "num_tokens": 5920882.0, "step": 2990 }, { "epoch": 0.053891408811245343, "eval_entropy": 1.2305607693195344, "eval_loss": 1.2938153743743896, "eval_mean_token_accuracy": 0.7112859692573548, "eval_num_tokens": 5940705.0, "eval_runtime": 40.4865, "eval_samples_per_second": 49.399, "eval_steps_per_second": 6.175, "step": 3000 }, { "entropy": 1.212465363740921, "epoch": 0.05407104684061616, "grad_norm": 7.25, "learning_rate": 4.983357413648286e-05, "loss": 1.2685124397277832, "mean_token_accuracy": 0.7060285702347755, "num_tokens": 5959971.0, "step": 3010 }, { "entropy": 1.2705860674381255, "epoch": 0.05425068486998698, "grad_norm": 9.375, "learning_rate": 4.98319150736824e-05, "loss": 1.31303129196167, "mean_token_accuracy": 0.7058427125215531, "num_tokens": 5981168.0, "step": 3020 }, { "entropy": 1.2937784075737, "epoch": 0.05443032289935779, "grad_norm": 11.0625, "learning_rate": 4.9830247810320694e-05, "loss": 1.3791098594665527, "mean_token_accuracy": 0.6943519517779351, "num_tokens": 6001372.0, "step": 3030 }, { "entropy": 1.3318655461072921, "epoch": 0.054609960928728614, "grad_norm": 7.28125, "learning_rate": 4.982857234694836e-05, "loss": 1.3658021926879882, "mean_token_accuracy": 0.6942898020148277, "num_tokens": 6021178.0, "step": 3040 }, { "entropy": 1.3197183042764664, "epoch": 0.05478959895809943, "grad_norm": 9.125, "learning_rate": 4.982688868411869e-05, "loss": 1.404970359802246, "mean_token_accuracy": 0.7003599464893341, "num_tokens": 6041764.0, "step": 3050 }, { "entropy": 1.2844930931925773, "epoch": 0.05496923698747025, "grad_norm": 7.40625, "learning_rate": 4.9825196822387705e-05, "loss": 1.2841452598571776, "mean_token_accuracy": 0.7065952852368355, "num_tokens": 6062755.0, "step": 3060 }, { "entropy": 1.2265906885266304, "epoch": 0.05514887501684106, "grad_norm": 8.75, "learning_rate": 4.982349676231414e-05, "loss": 1.2465375900268554, "mean_token_accuracy": 0.7151035532355309, "num_tokens": 6082483.0, "step": 3070 }, { "entropy": 1.1339795097708703, "epoch": 0.055328513046211884, "grad_norm": 6.3125, "learning_rate": 4.982178850445941e-05, "loss": 1.2763813972473144, "mean_token_accuracy": 0.7256345644593238, "num_tokens": 6102407.0, "step": 3080 }, { "entropy": 1.270952996611595, "epoch": 0.0555081510755827, "grad_norm": 10.0625, "learning_rate": 4.982007204938768e-05, "loss": 1.3460318565368652, "mean_token_accuracy": 0.7137261286377907, "num_tokens": 6121728.0, "step": 3090 }, { "entropy": 1.2569975599646568, "epoch": 0.05568778910495352, "grad_norm": 7.09375, "learning_rate": 4.981834739766578e-05, "loss": 1.2724987030029298, "mean_token_accuracy": 0.7073746204376221, "num_tokens": 6143110.0, "step": 3100 }, { "entropy": 1.2817855432629586, "epoch": 0.055867427134324334, "grad_norm": 10.5625, "learning_rate": 4.981661454986326e-05, "loss": 1.3831307411193847, "mean_token_accuracy": 0.6954029813408852, "num_tokens": 6162077.0, "step": 3110 }, { "entropy": 1.2735674560070038, "epoch": 0.056047065163695155, "grad_norm": 8.75, "learning_rate": 4.981487350655239e-05, "loss": 1.2766504287719727, "mean_token_accuracy": 0.7066126257181168, "num_tokens": 6181108.0, "step": 3120 }, { "entropy": 1.1311923533678054, "epoch": 0.05622670319306597, "grad_norm": 7.28125, "learning_rate": 4.981312426830813e-05, "loss": 1.2055017471313476, "mean_token_accuracy": 0.7288956001400948, "num_tokens": 6200424.0, "step": 3130 }, { "entropy": 1.3666249245405198, "epoch": 0.05640634122243679, "grad_norm": 9.1875, "learning_rate": 4.981136683570816e-05, "loss": 1.4029760360717773, "mean_token_accuracy": 0.686952055990696, "num_tokens": 6220501.0, "step": 3140 }, { "entropy": 1.2993694990873337, "epoch": 0.05658597925180761, "grad_norm": 10.75, "learning_rate": 4.980960120933287e-05, "loss": 1.2893091201782227, "mean_token_accuracy": 0.7055289223790169, "num_tokens": 6240048.0, "step": 3150 }, { "entropy": 1.1119103491306306, "epoch": 0.056765617281178425, "grad_norm": 7.4375, "learning_rate": 4.9807827389765316e-05, "loss": 1.2223850250244142, "mean_token_accuracy": 0.7190957799553871, "num_tokens": 6260108.0, "step": 3160 }, { "entropy": 1.195087979733944, "epoch": 0.056945255310549246, "grad_norm": 8.375, "learning_rate": 4.9806045377591317e-05, "loss": 1.268524742126465, "mean_token_accuracy": 0.7110963732004165, "num_tokens": 6280073.0, "step": 3170 }, { "entropy": 1.2271991118788719, "epoch": 0.05712489333992006, "grad_norm": 7.3125, "learning_rate": 4.980425517339935e-05, "loss": 1.3134913444519043, "mean_token_accuracy": 0.7043784148991108, "num_tokens": 6299909.0, "step": 3180 }, { "entropy": 1.2218820795416832, "epoch": 0.05730453136929088, "grad_norm": 8.125, "learning_rate": 4.980245677778063e-05, "loss": 1.2430070877075194, "mean_token_accuracy": 0.7221039563417435, "num_tokens": 6319408.0, "step": 3190 }, { "entropy": 1.188573731482029, "epoch": 0.057484169398661696, "grad_norm": 9.1875, "learning_rate": 4.980065019132905e-05, "loss": 1.2444118499755858, "mean_token_accuracy": 0.7217368751764297, "num_tokens": 6339634.0, "step": 3200 }, { "entropy": 1.3362519547343255, "epoch": 0.05766380742803252, "grad_norm": 13.5625, "learning_rate": 4.979883541464124e-05, "loss": 1.3920759201049804, "mean_token_accuracy": 0.6976002052426338, "num_tokens": 6359387.0, "step": 3210 }, { "entropy": 1.1500658124685288, "epoch": 0.05784344545740333, "grad_norm": 6.6875, "learning_rate": 4.9797012448316505e-05, "loss": 1.1104830741882323, "mean_token_accuracy": 0.7497173845767975, "num_tokens": 6378775.0, "step": 3220 }, { "entropy": 1.206740863621235, "epoch": 0.05802308348677415, "grad_norm": 8.375, "learning_rate": 4.979518129295687e-05, "loss": 1.3307913780212401, "mean_token_accuracy": 0.7072183325886726, "num_tokens": 6399148.0, "step": 3230 }, { "entropy": 1.2591784119606018, "epoch": 0.058202721516144966, "grad_norm": 6.78125, "learning_rate": 4.9793341949167064e-05, "loss": 1.2734559059143067, "mean_token_accuracy": 0.7065724715590477, "num_tokens": 6419577.0, "step": 3240 }, { "entropy": 1.226381041109562, "epoch": 0.05838235954551579, "grad_norm": 7.21875, "learning_rate": 4.9791494417554517e-05, "loss": 1.2940117835998535, "mean_token_accuracy": 0.7089318469166755, "num_tokens": 6439454.0, "step": 3250 }, { "entropy": 1.2393014162778855, "epoch": 0.0585619975748866, "grad_norm": 8.0625, "learning_rate": 4.9789638698729356e-05, "loss": 1.29135160446167, "mean_token_accuracy": 0.7178616285324096, "num_tokens": 6458745.0, "step": 3260 }, { "entropy": 1.2197474554181098, "epoch": 0.05874163560425742, "grad_norm": 8.4375, "learning_rate": 4.978777479330442e-05, "loss": 1.2943720817565918, "mean_token_accuracy": 0.7084274925291538, "num_tokens": 6478206.0, "step": 3270 }, { "entropy": 1.2297852396965028, "epoch": 0.058921273633628236, "grad_norm": 7.65625, "learning_rate": 4.978590270189526e-05, "loss": 1.2721128463745117, "mean_token_accuracy": 0.7122110277414322, "num_tokens": 6498369.0, "step": 3280 }, { "entropy": 1.2309267163276671, "epoch": 0.05910091166299906, "grad_norm": 8.0625, "learning_rate": 4.978402242512011e-05, "loss": 1.3250860214233398, "mean_token_accuracy": 0.7046559602022171, "num_tokens": 6518459.0, "step": 3290 }, { "entropy": 1.268016543984413, "epoch": 0.05928054969236987, "grad_norm": 9.375, "learning_rate": 4.9782133963599916e-05, "loss": 1.3107852935791016, "mean_token_accuracy": 0.7096571244299412, "num_tokens": 6538537.0, "step": 3300 }, { "entropy": 1.2028040543198586, "epoch": 0.05946018772174069, "grad_norm": 8.375, "learning_rate": 4.978023731795834e-05, "loss": 1.2983840942382812, "mean_token_accuracy": 0.7168523222208023, "num_tokens": 6557820.0, "step": 3310 }, { "entropy": 1.3016474202275277, "epoch": 0.059639825751111514, "grad_norm": 9.125, "learning_rate": 4.977833248882173e-05, "loss": 1.307421875, "mean_token_accuracy": 0.7036651030182839, "num_tokens": 6578908.0, "step": 3320 }, { "entropy": 1.3456607446074487, "epoch": 0.05981946378048233, "grad_norm": 7.8125, "learning_rate": 4.9776419476819144e-05, "loss": 1.3548008918762207, "mean_token_accuracy": 0.7018690846860409, "num_tokens": 6597802.0, "step": 3330 }, { "entropy": 1.1719222888350487, "epoch": 0.05999910180985315, "grad_norm": 11.6875, "learning_rate": 4.9774498282582345e-05, "loss": 1.276802921295166, "mean_token_accuracy": 0.7090975195169449, "num_tokens": 6617697.0, "step": 3340 }, { "entropy": 1.2620284423232078, "epoch": 0.06017873983922396, "grad_norm": 5.71875, "learning_rate": 4.977256890674577e-05, "loss": 1.3803043365478516, "mean_token_accuracy": 0.7027500331401825, "num_tokens": 6636930.0, "step": 3350 }, { "entropy": 1.2817351326346398, "epoch": 0.060358377868594784, "grad_norm": 7.625, "learning_rate": 4.977063134994662e-05, "loss": 1.279933261871338, "mean_token_accuracy": 0.7034377135336399, "num_tokens": 6656377.0, "step": 3360 }, { "entropy": 1.167387916147709, "epoch": 0.0605380158979656, "grad_norm": 5.625, "learning_rate": 4.976868561282472e-05, "loss": 1.1824708938598634, "mean_token_accuracy": 0.7330655008554459, "num_tokens": 6677205.0, "step": 3370 }, { "entropy": 1.1286020129919052, "epoch": 0.06071765392733642, "grad_norm": 9.0, "learning_rate": 4.9766731696022664e-05, "loss": 1.232715129852295, "mean_token_accuracy": 0.7248808458447457, "num_tokens": 6698105.0, "step": 3380 }, { "entropy": 1.321954208612442, "epoch": 0.060897291956707233, "grad_norm": 8.5625, "learning_rate": 4.97647696001857e-05, "loss": 1.4307735443115235, "mean_token_accuracy": 0.69056516289711, "num_tokens": 6717826.0, "step": 3390 }, { "entropy": 1.2396196484565736, "epoch": 0.061076929986078055, "grad_norm": 8.25, "learning_rate": 4.976279932596182e-05, "loss": 1.1927993774414063, "mean_token_accuracy": 0.7270082898437977, "num_tokens": 6737263.0, "step": 3400 }, { "entropy": 1.1182163417339326, "epoch": 0.06125656801544887, "grad_norm": 6.34375, "learning_rate": 4.9760820874001664e-05, "loss": 1.1719481468200683, "mean_token_accuracy": 0.7272097051143647, "num_tokens": 6757784.0, "step": 3410 }, { "entropy": 1.2036172717809677, "epoch": 0.06143620604481969, "grad_norm": 6.34375, "learning_rate": 4.9758834244958616e-05, "loss": 1.2382091522216796, "mean_token_accuracy": 0.7252969890832901, "num_tokens": 6776728.0, "step": 3420 }, { "entropy": 1.2807849138975143, "epoch": 0.061615844074190504, "grad_norm": 5.25, "learning_rate": 4.975683943948875e-05, "loss": 1.352182388305664, "mean_token_accuracy": 0.7102423667907715, "num_tokens": 6796588.0, "step": 3430 }, { "entropy": 1.2119808204472065, "epoch": 0.061795482103561325, "grad_norm": 9.5625, "learning_rate": 4.975483645825083e-05, "loss": 1.2675718307495116, "mean_token_accuracy": 0.7183391459286212, "num_tokens": 6815557.0, "step": 3440 }, { "entropy": 1.2187032014131547, "epoch": 0.06197512013293214, "grad_norm": 12.0625, "learning_rate": 4.975282530190632e-05, "loss": 1.309666347503662, "mean_token_accuracy": 0.7133752577006817, "num_tokens": 6836335.0, "step": 3450 }, { "entropy": 1.2438659489154815, "epoch": 0.06215475816230296, "grad_norm": 7.9375, "learning_rate": 4.975080597111941e-05, "loss": 1.2932543754577637, "mean_token_accuracy": 0.7090259060263634, "num_tokens": 6856973.0, "step": 3460 }, { "entropy": 1.2497733801603317, "epoch": 0.062334396191673774, "grad_norm": 9.25, "learning_rate": 4.974877846655694e-05, "loss": 1.2450849533081054, "mean_token_accuracy": 0.7180824309587479, "num_tokens": 6876477.0, "step": 3470 }, { "entropy": 1.1382774874567985, "epoch": 0.0625140342210446, "grad_norm": 11.9375, "learning_rate": 4.974674278888851e-05, "loss": 1.2133026123046875, "mean_token_accuracy": 0.7236194267868996, "num_tokens": 6896275.0, "step": 3480 }, { "entropy": 1.235068529844284, "epoch": 0.06269367225041542, "grad_norm": 7.46875, "learning_rate": 4.974469893878637e-05, "loss": 1.3045209884643554, "mean_token_accuracy": 0.7078215204179287, "num_tokens": 6915823.0, "step": 3490 }, { "entropy": 1.2026451602578163, "epoch": 0.06287331027978624, "grad_norm": 8.5, "learning_rate": 4.9742646916925484e-05, "loss": 1.2315085411071778, "mean_token_accuracy": 0.7220328912138939, "num_tokens": 6934986.0, "step": 3500 }, { "entropy": 1.2231766253709793, "epoch": 0.06305294830915704, "grad_norm": 9.125, "learning_rate": 4.974058672398353e-05, "loss": 1.2991942405700683, "mean_token_accuracy": 0.7067679658532142, "num_tokens": 6954226.0, "step": 3510 }, { "entropy": 1.2861617535352707, "epoch": 0.06323258633852787, "grad_norm": 9.3125, "learning_rate": 4.973851836064086e-05, "loss": 1.332446002960205, "mean_token_accuracy": 0.6976198434829712, "num_tokens": 6972985.0, "step": 3520 }, { "entropy": 1.234875889122486, "epoch": 0.06341222436789869, "grad_norm": 6.1875, "learning_rate": 4.973644182758055e-05, "loss": 1.226964282989502, "mean_token_accuracy": 0.7273961171507836, "num_tokens": 6991688.0, "step": 3530 }, { "entropy": 1.223322905600071, "epoch": 0.06359186239726951, "grad_norm": 4.625, "learning_rate": 4.973435712548834e-05, "loss": 1.2936535835266114, "mean_token_accuracy": 0.7073257721960544, "num_tokens": 7012670.0, "step": 3540 }, { "entropy": 1.2125786438584327, "epoch": 0.06377150042664032, "grad_norm": 8.4375, "learning_rate": 4.9732264255052706e-05, "loss": 1.3368864059448242, "mean_token_accuracy": 0.7069816030561924, "num_tokens": 7031831.0, "step": 3550 }, { "entropy": 1.2602311804890634, "epoch": 0.06395113845601114, "grad_norm": 7.40625, "learning_rate": 4.97301632169648e-05, "loss": 1.3025297164916991, "mean_token_accuracy": 0.7098409436643124, "num_tokens": 7052248.0, "step": 3560 }, { "entropy": 1.364729504287243, "epoch": 0.06413077648538196, "grad_norm": 9.5, "learning_rate": 4.972805401191847e-05, "loss": 1.4347960472106933, "mean_token_accuracy": 0.688126140832901, "num_tokens": 7071284.0, "step": 3570 }, { "entropy": 1.1663824573159218, "epoch": 0.06431041451475278, "grad_norm": 7.3125, "learning_rate": 4.972593664061027e-05, "loss": 1.2339487075805664, "mean_token_accuracy": 0.7286138713359833, "num_tokens": 7090273.0, "step": 3580 }, { "entropy": 1.2514225229620934, "epoch": 0.06449005254412359, "grad_norm": 8.1875, "learning_rate": 4.9723811103739435e-05, "loss": 1.3342815399169923, "mean_token_accuracy": 0.7041991069912911, "num_tokens": 7110543.0, "step": 3590 }, { "entropy": 1.1802908971905708, "epoch": 0.0646696905734944, "grad_norm": 8.0, "learning_rate": 4.972167740200793e-05, "loss": 1.1685798645019532, "mean_token_accuracy": 0.7224047504365444, "num_tokens": 7131347.0, "step": 3600 }, { "entropy": 1.2886706575751306, "epoch": 0.06484932860286523, "grad_norm": 8.0625, "learning_rate": 4.971953553612036e-05, "loss": 1.4090861320495605, "mean_token_accuracy": 0.7011920288205147, "num_tokens": 7151376.0, "step": 3610 }, { "entropy": 1.347020211815834, "epoch": 0.06502896663223605, "grad_norm": 11.5625, "learning_rate": 4.971738550678411e-05, "loss": 1.3731415748596192, "mean_token_accuracy": 0.6966219522058964, "num_tokens": 7171119.0, "step": 3620 }, { "entropy": 1.2852986738085748, "epoch": 0.06520860466160686, "grad_norm": 9.1875, "learning_rate": 4.9715227314709164e-05, "loss": 1.2775721549987793, "mean_token_accuracy": 0.7031201519072056, "num_tokens": 7190493.0, "step": 3630 }, { "entropy": 1.2208514109253883, "epoch": 0.06538824269097768, "grad_norm": 8.5625, "learning_rate": 4.971306096060828e-05, "loss": 1.302250576019287, "mean_token_accuracy": 0.7101312294602394, "num_tokens": 7209508.0, "step": 3640 }, { "entropy": 1.245539802312851, "epoch": 0.0655678807203485, "grad_norm": 7.875, "learning_rate": 4.971088644519687e-05, "loss": 1.3021961212158204, "mean_token_accuracy": 0.7031107805669308, "num_tokens": 7229810.0, "step": 3650 }, { "entropy": 1.1274859696626662, "epoch": 0.06574751874971932, "grad_norm": 6.28125, "learning_rate": 4.970870376919305e-05, "loss": 1.1816731452941895, "mean_token_accuracy": 0.7423084408044816, "num_tokens": 7250518.0, "step": 3660 }, { "entropy": 1.0779212534427642, "epoch": 0.06592715677909014, "grad_norm": 6.125, "learning_rate": 4.970651293331764e-05, "loss": 1.1065179824829101, "mean_token_accuracy": 0.7425893932580948, "num_tokens": 7270177.0, "step": 3670 }, { "entropy": 1.1414249613881111, "epoch": 0.06610679480846095, "grad_norm": 5.96875, "learning_rate": 4.9704313938294134e-05, "loss": 1.2218378067016602, "mean_token_accuracy": 0.731036901473999, "num_tokens": 7289893.0, "step": 3680 }, { "entropy": 1.1677282959222794, "epoch": 0.06628643283783177, "grad_norm": 6.53125, "learning_rate": 4.970210678484876e-05, "loss": 1.1923569679260253, "mean_token_accuracy": 0.7306131199002266, "num_tokens": 7310224.0, "step": 3690 }, { "entropy": 1.1779899552464486, "epoch": 0.06646607086720259, "grad_norm": 7.1875, "learning_rate": 4.969989147371038e-05, "loss": 1.2312817573547363, "mean_token_accuracy": 0.7168428733944893, "num_tokens": 7330845.0, "step": 3700 }, { "entropy": 1.1872374355792998, "epoch": 0.06664570889657341, "grad_norm": 6.25, "learning_rate": 4.9697668005610613e-05, "loss": 1.2032230377197266, "mean_token_accuracy": 0.7239424347877502, "num_tokens": 7350255.0, "step": 3710 }, { "entropy": 1.2174224704504013, "epoch": 0.06682534692594422, "grad_norm": 6.25, "learning_rate": 4.969543638128373e-05, "loss": 1.3171369552612304, "mean_token_accuracy": 0.7075670704245567, "num_tokens": 7369666.0, "step": 3720 }, { "entropy": 1.2062487781047821, "epoch": 0.06700498495531504, "grad_norm": 8.0625, "learning_rate": 4.969319660146672e-05, "loss": 1.2684994697570802, "mean_token_accuracy": 0.7242234297096729, "num_tokens": 7389836.0, "step": 3730 }, { "entropy": 1.3156227365136146, "epoch": 0.06718462298468586, "grad_norm": 8.125, "learning_rate": 4.969094866689924e-05, "loss": 1.3338292121887207, "mean_token_accuracy": 0.7075921133160591, "num_tokens": 7409549.0, "step": 3740 }, { "entropy": 1.2621764317154884, "epoch": 0.06736426101405668, "grad_norm": 7.15625, "learning_rate": 4.968869257832366e-05, "loss": 1.3384495735168458, "mean_token_accuracy": 0.6944715850055218, "num_tokens": 7429142.0, "step": 3750 }, { "entropy": 1.2328008137643338, "epoch": 0.06754389904342749, "grad_norm": 9.4375, "learning_rate": 4.9686428336485033e-05, "loss": 1.3114291191101075, "mean_token_accuracy": 0.7137681439518928, "num_tokens": 7447923.0, "step": 3760 }, { "entropy": 1.221186363697052, "epoch": 0.06772353707279831, "grad_norm": 5.96875, "learning_rate": 4.968415594213113e-05, "loss": 1.2468070983886719, "mean_token_accuracy": 0.7111487925052643, "num_tokens": 7466912.0, "step": 3770 }, { "entropy": 1.2326500102877618, "epoch": 0.06790317510216913, "grad_norm": 7.09375, "learning_rate": 4.968187539601236e-05, "loss": 1.2358693122863769, "mean_token_accuracy": 0.7201651819050312, "num_tokens": 7486861.0, "step": 3780 }, { "entropy": 1.1974031433463097, "epoch": 0.06808281313153995, "grad_norm": 9.9375, "learning_rate": 4.967958669888188e-05, "loss": 1.281076431274414, "mean_token_accuracy": 0.7184802263975143, "num_tokens": 7506247.0, "step": 3790 }, { "entropy": 1.2204970180988313, "epoch": 0.06826245116091076, "grad_norm": 6.90625, "learning_rate": 4.96772898514955e-05, "loss": 1.285616970062256, "mean_token_accuracy": 0.7070894479751587, "num_tokens": 7527277.0, "step": 3800 }, { "entropy": 1.2314346462488175, "epoch": 0.06844208919028158, "grad_norm": 8.5625, "learning_rate": 4.967498485461176e-05, "loss": 1.2882765769958495, "mean_token_accuracy": 0.7152645960450172, "num_tokens": 7547363.0, "step": 3810 }, { "entropy": 1.2864285662770272, "epoch": 0.0686217272196524, "grad_norm": 5.53125, "learning_rate": 4.967267170899185e-05, "loss": 1.3151036262512208, "mean_token_accuracy": 0.6949542030692101, "num_tokens": 7568055.0, "step": 3820 }, { "entropy": 1.2726764366030694, "epoch": 0.06880136524902322, "grad_norm": 7.53125, "learning_rate": 4.967035041539967e-05, "loss": 1.303805446624756, "mean_token_accuracy": 0.7162467837333679, "num_tokens": 7589470.0, "step": 3830 }, { "entropy": 1.2356864973902701, "epoch": 0.06898100327839403, "grad_norm": 6.9375, "learning_rate": 4.9668020974601816e-05, "loss": 1.3131505966186523, "mean_token_accuracy": 0.7027673237025738, "num_tokens": 7608654.0, "step": 3840 }, { "entropy": 1.159817098081112, "epoch": 0.06916064130776485, "grad_norm": 6.25, "learning_rate": 4.966568338736757e-05, "loss": 1.1256381034851075, "mean_token_accuracy": 0.7296169057488442, "num_tokens": 7628615.0, "step": 3850 }, { "entropy": 1.3059486582875253, "epoch": 0.06934027933713567, "grad_norm": 7.1875, "learning_rate": 4.96633376544689e-05, "loss": 1.4329897880554199, "mean_token_accuracy": 0.6818833567202092, "num_tokens": 7648594.0, "step": 3860 }, { "entropy": 1.1422328650951385, "epoch": 0.06951991736650649, "grad_norm": 7.59375, "learning_rate": 4.966098377668047e-05, "loss": 1.181243896484375, "mean_token_accuracy": 0.7235778883099556, "num_tokens": 7668915.0, "step": 3870 }, { "entropy": 1.1333101496100426, "epoch": 0.06969955539587731, "grad_norm": 6.09375, "learning_rate": 4.9658621754779624e-05, "loss": 1.2051117897033692, "mean_token_accuracy": 0.7212189637124539, "num_tokens": 7688621.0, "step": 3880 }, { "entropy": 1.1232207968831063, "epoch": 0.06987919342524812, "grad_norm": 9.1875, "learning_rate": 4.965625158954642e-05, "loss": 1.1678098678588866, "mean_token_accuracy": 0.7345072537660599, "num_tokens": 7708625.0, "step": 3890 }, { "entropy": 1.1640655010938645, "epoch": 0.07005883145461894, "grad_norm": 7.78125, "learning_rate": 4.965387328176356e-05, "loss": 1.2449628829956054, "mean_token_accuracy": 0.725748098641634, "num_tokens": 7728005.0, "step": 3900 }, { "entropy": 1.3203783065080643, "epoch": 0.07023846948398976, "grad_norm": 6.75, "learning_rate": 4.96514868322165e-05, "loss": 1.3069683074951173, "mean_token_accuracy": 0.699828465282917, "num_tokens": 7748372.0, "step": 3910 }, { "entropy": 1.167919297516346, "epoch": 0.07041810751336058, "grad_norm": 5.84375, "learning_rate": 4.964909224169331e-05, "loss": 1.24308443069458, "mean_token_accuracy": 0.7124692603945733, "num_tokens": 7769053.0, "step": 3920 }, { "entropy": 1.2315762400627137, "epoch": 0.07059774554273139, "grad_norm": 8.3125, "learning_rate": 4.964668951098481e-05, "loss": 1.307978343963623, "mean_token_accuracy": 0.7066112831234932, "num_tokens": 7788054.0, "step": 3930 }, { "entropy": 1.1790028259158134, "epoch": 0.07077738357210221, "grad_norm": 7.09375, "learning_rate": 4.9644278640884476e-05, "loss": 1.1816357612609862, "mean_token_accuracy": 0.7243860140442848, "num_tokens": 7808464.0, "step": 3940 }, { "entropy": 1.1662120059132577, "epoch": 0.07095702160147303, "grad_norm": 6.46875, "learning_rate": 4.964185963218849e-05, "loss": 1.2439204216003419, "mean_token_accuracy": 0.7191622465848923, "num_tokens": 7827407.0, "step": 3950 }, { "entropy": 1.1534938678145408, "epoch": 0.07113665963084385, "grad_norm": 6.65625, "learning_rate": 4.9639432485695704e-05, "loss": 1.1548154830932618, "mean_token_accuracy": 0.7311466187238693, "num_tokens": 7846810.0, "step": 3960 }, { "entropy": 1.1068582475185393, "epoch": 0.07131629766021466, "grad_norm": 6.34375, "learning_rate": 4.963699720220766e-05, "loss": 1.1102201461791992, "mean_token_accuracy": 0.742414303123951, "num_tokens": 7866375.0, "step": 3970 }, { "entropy": 1.0965869441628455, "epoch": 0.07149593568958548, "grad_norm": 9.625, "learning_rate": 4.96345537825286e-05, "loss": 1.2301941871643067, "mean_token_accuracy": 0.724865297973156, "num_tokens": 7885541.0, "step": 3980 }, { "entropy": 1.1597801387310027, "epoch": 0.0716755737189563, "grad_norm": 8.3125, "learning_rate": 4.9632102227465454e-05, "loss": 1.2550856590270996, "mean_token_accuracy": 0.7191265910863877, "num_tokens": 7905579.0, "step": 3990 }, { "epoch": 0.07185521174832712, "eval_entropy": 1.1816870107650757, "eval_loss": 1.1931698322296143, "eval_mean_token_accuracy": 0.7292079088687897, "eval_num_tokens": 7926226.0, "eval_runtime": 40.4952, "eval_samples_per_second": 49.389, "eval_steps_per_second": 6.174, "step": 4000 }, { "entropy": 1.1713870141655207, "epoch": 0.07203484977769793, "grad_norm": 7.40625, "learning_rate": 4.962717471442799e-05, "loss": 1.1969499588012695, "mean_token_accuracy": 0.7299913689494133, "num_tokens": 7946346.0, "step": 4010 }, { "entropy": 1.1797849789261818, "epoch": 0.07221448780706875, "grad_norm": 7.1875, "learning_rate": 4.962469875808094e-05, "loss": 1.25166015625, "mean_token_accuracy": 0.7197384297847748, "num_tokens": 7966372.0, "step": 4020 }, { "entropy": 1.242465315759182, "epoch": 0.07239412583643957, "grad_norm": 7.5625, "learning_rate": 4.962221466960436e-05, "loss": 1.2804611206054688, "mean_token_accuracy": 0.7203630454838276, "num_tokens": 7985084.0, "step": 4030 }, { "entropy": 1.208653238415718, "epoch": 0.0725737638658104, "grad_norm": 9.6875, "learning_rate": 4.961972244981859e-05, "loss": 1.2687210083007812, "mean_token_accuracy": 0.7167617976665497, "num_tokens": 8004777.0, "step": 4040 }, { "entropy": 1.2139231905341148, "epoch": 0.07275340189518122, "grad_norm": 6.9375, "learning_rate": 4.9617222099546656e-05, "loss": 1.257332992553711, "mean_token_accuracy": 0.7208951704204083, "num_tokens": 8024146.0, "step": 4050 }, { "entropy": 1.152854146808386, "epoch": 0.07293303992455202, "grad_norm": 6.6875, "learning_rate": 4.96147136196143e-05, "loss": 1.215870475769043, "mean_token_accuracy": 0.717916489392519, "num_tokens": 8044151.0, "step": 4060 }, { "entropy": 1.074496054649353, "epoch": 0.07311267795392284, "grad_norm": 7.34375, "learning_rate": 4.9612197010849914e-05, "loss": 1.1245906829833985, "mean_token_accuracy": 0.7415511220693588, "num_tokens": 8063914.0, "step": 4070 }, { "entropy": 1.1561739817261696, "epoch": 0.07329231598329367, "grad_norm": 7.8125, "learning_rate": 4.96096722740846e-05, "loss": 1.2119399070739747, "mean_token_accuracy": 0.7264811292290687, "num_tokens": 8083712.0, "step": 4080 }, { "entropy": 1.1322413355112075, "epoch": 0.07347195401266449, "grad_norm": 7.1875, "learning_rate": 4.9607139410152125e-05, "loss": 1.1491485595703126, "mean_token_accuracy": 0.7246209889650345, "num_tokens": 8104099.0, "step": 4090 }, { "entropy": 1.1210455924272538, "epoch": 0.0736515920420353, "grad_norm": 8.8125, "learning_rate": 4.960459841988896e-05, "loss": 1.1640192985534668, "mean_token_accuracy": 0.7334762841463089, "num_tokens": 8124414.0, "step": 4100 }, { "entropy": 1.142209130525589, "epoch": 0.07383123007140611, "grad_norm": 9.375, "learning_rate": 4.9602049304134245e-05, "loss": 1.2349956512451172, "mean_token_accuracy": 0.7196511864662171, "num_tokens": 8144399.0, "step": 4110 }, { "entropy": 1.2242891952395438, "epoch": 0.07401086810077694, "grad_norm": 8.6875, "learning_rate": 4.95994920637298e-05, "loss": 1.2499198913574219, "mean_token_accuracy": 0.7192654147744179, "num_tokens": 8164376.0, "step": 4120 }, { "entropy": 1.218564397096634, "epoch": 0.07419050613014776, "grad_norm": 6.1875, "learning_rate": 4.9596926699520144e-05, "loss": 1.2232787132263183, "mean_token_accuracy": 0.7258368238806725, "num_tokens": 8184048.0, "step": 4130 }, { "entropy": 1.1712930262088777, "epoch": 0.07437014415951856, "grad_norm": 7.4375, "learning_rate": 4.959435321235246e-05, "loss": 1.2336976051330566, "mean_token_accuracy": 0.7239293172955513, "num_tokens": 8204084.0, "step": 4140 }, { "entropy": 1.2275750920176507, "epoch": 0.07454978218888939, "grad_norm": 8.6875, "learning_rate": 4.959177160307664e-05, "loss": 1.2959970474243163, "mean_token_accuracy": 0.7193170458078384, "num_tokens": 8223830.0, "step": 4150 }, { "entropy": 1.185786284506321, "epoch": 0.0747294202182602, "grad_norm": 8.375, "learning_rate": 4.9589181872545225e-05, "loss": 1.1565098762512207, "mean_token_accuracy": 0.7324448108673096, "num_tokens": 8243935.0, "step": 4160 }, { "entropy": 1.1236275151371955, "epoch": 0.07490905824763103, "grad_norm": 8.5, "learning_rate": 4.958658402161347e-05, "loss": 1.1814092636108398, "mean_token_accuracy": 0.7348843105137348, "num_tokens": 8263559.0, "step": 4170 }, { "entropy": 1.0817065611481667, "epoch": 0.07508869627700183, "grad_norm": 8.25, "learning_rate": 4.958397805113928e-05, "loss": 1.1719980239868164, "mean_token_accuracy": 0.737169261276722, "num_tokens": 8282921.0, "step": 4180 }, { "entropy": 1.2425470396876335, "epoch": 0.07526833430637266, "grad_norm": 6.28125, "learning_rate": 4.9581363961983265e-05, "loss": 1.3042529106140137, "mean_token_accuracy": 0.7026644073426723, "num_tokens": 8303879.0, "step": 4190 }, { "entropy": 1.2776909247040749, "epoch": 0.07544797233574348, "grad_norm": 7.1875, "learning_rate": 4.957874175500872e-05, "loss": 1.2881336212158203, "mean_token_accuracy": 0.716185811161995, "num_tokens": 8324551.0, "step": 4200 }, { "entropy": 1.1333178557455539, "epoch": 0.0756276103651143, "grad_norm": 7.875, "learning_rate": 4.9576111431081594e-05, "loss": 1.1647315979003907, "mean_token_accuracy": 0.7394245445728302, "num_tokens": 8343072.0, "step": 4210 }, { "entropy": 0.9866166695952415, "epoch": 0.07580724839448512, "grad_norm": 6.375, "learning_rate": 4.957347299107054e-05, "loss": 1.0758567810058595, "mean_token_accuracy": 0.7557776510715485, "num_tokens": 8362647.0, "step": 4220 }, { "entropy": 1.082628497481346, "epoch": 0.07598688642385593, "grad_norm": 7.03125, "learning_rate": 4.957082643584688e-05, "loss": 1.1338550567626953, "mean_token_accuracy": 0.7338819041848182, "num_tokens": 8382086.0, "step": 4230 }, { "entropy": 1.0527696318924427, "epoch": 0.07616652445322675, "grad_norm": 7.90625, "learning_rate": 4.956817176628463e-05, "loss": 1.0984151840209961, "mean_token_accuracy": 0.7494589716196061, "num_tokens": 8402690.0, "step": 4240 }, { "entropy": 1.185495026409626, "epoch": 0.07634616248259757, "grad_norm": 6.8125, "learning_rate": 4.9565508983260464e-05, "loss": 1.2181382179260254, "mean_token_accuracy": 0.7362824261188508, "num_tokens": 8423353.0, "step": 4250 }, { "entropy": 1.2501841343939304, "epoch": 0.07652580051196839, "grad_norm": 8.125, "learning_rate": 4.956283808765376e-05, "loss": 1.2641603469848632, "mean_token_accuracy": 0.7112665444612503, "num_tokens": 8443211.0, "step": 4260 }, { "entropy": 1.161339780688286, "epoch": 0.0767054385413392, "grad_norm": 10.4375, "learning_rate": 4.9560159080346545e-05, "loss": 1.232271385192871, "mean_token_accuracy": 0.7298238225281238, "num_tokens": 8462398.0, "step": 4270 }, { "entropy": 0.9935755603015423, "epoch": 0.07688507657071002, "grad_norm": 7.625, "learning_rate": 4.955747196222355e-05, "loss": 1.028653335571289, "mean_token_accuracy": 0.7640767946839333, "num_tokens": 8482730.0, "step": 4280 }, { "entropy": 1.0362499043345452, "epoch": 0.07706471460008084, "grad_norm": 7.375, "learning_rate": 4.955477673417218e-05, "loss": 1.1323720932006835, "mean_token_accuracy": 0.7439577117562294, "num_tokens": 8503077.0, "step": 4290 }, { "entropy": 1.1890631526708604, "epoch": 0.07724435262945166, "grad_norm": 6.15625, "learning_rate": 4.955207339708251e-05, "loss": 1.182280921936035, "mean_token_accuracy": 0.7326760351657867, "num_tokens": 8522290.0, "step": 4300 }, { "entropy": 1.1386354684829711, "epoch": 0.07742399065882247, "grad_norm": 6.375, "learning_rate": 4.9549361951847295e-05, "loss": 1.1753834724426269, "mean_token_accuracy": 0.7320934399962425, "num_tokens": 8542708.0, "step": 4310 }, { "entropy": 1.1046071857213975, "epoch": 0.07760362868819329, "grad_norm": 8.5, "learning_rate": 4.954664239936197e-05, "loss": 1.224449920654297, "mean_token_accuracy": 0.7294555336236954, "num_tokens": 8561394.0, "step": 4320 }, { "entropy": 1.1356689035892487, "epoch": 0.07778326671756411, "grad_norm": 7.59375, "learning_rate": 4.954391474052466e-05, "loss": 1.154538059234619, "mean_token_accuracy": 0.735795333981514, "num_tokens": 8581730.0, "step": 4330 }, { "entropy": 1.082607415318489, "epoch": 0.07796290474693493, "grad_norm": 6.875, "learning_rate": 4.954117897623616e-05, "loss": 1.0830055236816407, "mean_token_accuracy": 0.7537325888872146, "num_tokens": 8601341.0, "step": 4340 }, { "entropy": 1.1453176468610764, "epoch": 0.07814254277630574, "grad_norm": 6.71875, "learning_rate": 4.9538435107399904e-05, "loss": 1.2479177474975587, "mean_token_accuracy": 0.7211047016084194, "num_tokens": 8622368.0, "step": 4350 }, { "entropy": 1.1174189552664757, "epoch": 0.07832218080567656, "grad_norm": 7.9375, "learning_rate": 4.953568313492206e-05, "loss": 1.2095426559448241, "mean_token_accuracy": 0.7209716007113457, "num_tokens": 8641573.0, "step": 4360 }, { "entropy": 1.219351901113987, "epoch": 0.07850181883504738, "grad_norm": 7.5, "learning_rate": 4.9532923059711436e-05, "loss": 1.2631852149963378, "mean_token_accuracy": 0.7296150237321853, "num_tokens": 8663117.0, "step": 4370 }, { "entropy": 1.2396316826343536, "epoch": 0.0786814568644182, "grad_norm": 7.9375, "learning_rate": 4.953015488267954e-05, "loss": 1.2260595321655274, "mean_token_accuracy": 0.7207832835614681, "num_tokens": 8681971.0, "step": 4380 }, { "entropy": 1.1308637797832488, "epoch": 0.07886109489378902, "grad_norm": 7.125, "learning_rate": 4.9527378604740524e-05, "loss": 1.1758810043334962, "mean_token_accuracy": 0.7243160039186478, "num_tokens": 8701270.0, "step": 4390 }, { "entropy": 1.117917563021183, "epoch": 0.07904073292315983, "grad_norm": 8.375, "learning_rate": 4.952459422681126e-05, "loss": 1.1736659049987792, "mean_token_accuracy": 0.7362862914800644, "num_tokens": 8720977.0, "step": 4400 }, { "entropy": 1.1850198328495025, "epoch": 0.07922037095253065, "grad_norm": 8.0625, "learning_rate": 4.9521801749811244e-05, "loss": 1.229194736480713, "mean_token_accuracy": 0.7197527036070823, "num_tokens": 8741493.0, "step": 4410 }, { "entropy": 1.100655935704708, "epoch": 0.07940000898190147, "grad_norm": 8.3125, "learning_rate": 4.951900117466268e-05, "loss": 1.0920257568359375, "mean_token_accuracy": 0.7484180495142937, "num_tokens": 8761894.0, "step": 4420 }, { "entropy": 1.1196262806653976, "epoch": 0.07957964701127229, "grad_norm": 10.6875, "learning_rate": 4.951619250229044e-05, "loss": 1.2225539207458496, "mean_token_accuracy": 0.728130965679884, "num_tokens": 8782035.0, "step": 4430 }, { "entropy": 1.1870262697339058, "epoch": 0.0797592850406431, "grad_norm": 6.625, "learning_rate": 4.9513375733622064e-05, "loss": 1.2134931564331055, "mean_token_accuracy": 0.7289870753884315, "num_tokens": 8803256.0, "step": 4440 }, { "entropy": 1.1689264476299286, "epoch": 0.07993892307001392, "grad_norm": 9.6875, "learning_rate": 4.951055086958777e-05, "loss": 1.2450201988220215, "mean_token_accuracy": 0.7246900506317615, "num_tokens": 8822743.0, "step": 4450 }, { "entropy": 1.1491047069430351, "epoch": 0.08011856109938474, "grad_norm": 5.75, "learning_rate": 4.9507717911120456e-05, "loss": 1.2423948287963866, "mean_token_accuracy": 0.7236890837550163, "num_tokens": 8842515.0, "step": 4460 }, { "entropy": 1.1791701532900334, "epoch": 0.08029819912875556, "grad_norm": 9.75, "learning_rate": 4.950487685915568e-05, "loss": 1.2120024681091308, "mean_token_accuracy": 0.7256231009960175, "num_tokens": 8863647.0, "step": 4470 }, { "entropy": 1.1515010014176368, "epoch": 0.08047783715812637, "grad_norm": 7.1875, "learning_rate": 4.9502027714631684e-05, "loss": 1.207651138305664, "mean_token_accuracy": 0.7286435097455979, "num_tokens": 8884436.0, "step": 4480 }, { "entropy": 1.1190988317131996, "epoch": 0.08065747518749719, "grad_norm": 8.3125, "learning_rate": 4.9499170478489366e-05, "loss": 1.1839657783508302, "mean_token_accuracy": 0.734744630753994, "num_tokens": 8904065.0, "step": 4490 }, { "entropy": 1.1805353432893753, "epoch": 0.08083711321686801, "grad_norm": 11.75, "learning_rate": 4.949630515167232e-05, "loss": 1.2314042091369628, "mean_token_accuracy": 0.7194116234779357, "num_tokens": 8923449.0, "step": 4500 }, { "entropy": 1.2770184025168418, "epoch": 0.08101675124623883, "grad_norm": 7.75, "learning_rate": 4.949343173512679e-05, "loss": 1.259283447265625, "mean_token_accuracy": 0.7055680677294731, "num_tokens": 8941762.0, "step": 4510 }, { "entropy": 1.1458518490195275, "epoch": 0.08119638927560964, "grad_norm": 7.78125, "learning_rate": 4.9490550229801706e-05, "loss": 1.2183851242065429, "mean_token_accuracy": 0.7194598913192749, "num_tokens": 8962146.0, "step": 4520 }, { "entropy": 1.113838893175125, "epoch": 0.08137602730498046, "grad_norm": 10.0, "learning_rate": 4.948766063664867e-05, "loss": 1.1766281127929688, "mean_token_accuracy": 0.7418471738696099, "num_tokens": 8981459.0, "step": 4530 }, { "entropy": 1.0895928040146827, "epoch": 0.08155566533435128, "grad_norm": 5.8125, "learning_rate": 4.948476295662194e-05, "loss": 1.0964507102966308, "mean_token_accuracy": 0.7489591509103775, "num_tokens": 9000662.0, "step": 4540 }, { "entropy": 1.0721483424305915, "epoch": 0.0817353033637221, "grad_norm": 6.46875, "learning_rate": 4.948185719067846e-05, "loss": 1.0654159545898438, "mean_token_accuracy": 0.7556398212909698, "num_tokens": 9020337.0, "step": 4550 }, { "entropy": 1.1024317428469659, "epoch": 0.08191494139309292, "grad_norm": 6.25, "learning_rate": 4.947894333977783e-05, "loss": 1.1473363876342773, "mean_token_accuracy": 0.7449666991829872, "num_tokens": 9041389.0, "step": 4560 }, { "entropy": 1.0792812690138818, "epoch": 0.08209457942246373, "grad_norm": 6.59375, "learning_rate": 4.9476021404882334e-05, "loss": 1.1406134605407714, "mean_token_accuracy": 0.7428496971726417, "num_tokens": 9060752.0, "step": 4570 }, { "entropy": 1.1383121401071548, "epoch": 0.08227421745183455, "grad_norm": 7.34375, "learning_rate": 4.947309138695693e-05, "loss": 1.1429553985595704, "mean_token_accuracy": 0.7356810122728348, "num_tokens": 9081057.0, "step": 4580 }, { "entropy": 1.0782451003789901, "epoch": 0.08245385548120537, "grad_norm": 6.40625, "learning_rate": 4.947015328696921e-05, "loss": 1.0886828422546386, "mean_token_accuracy": 0.7469633638858795, "num_tokens": 9100489.0, "step": 4590 }, { "entropy": 1.095804797858, "epoch": 0.0826334935105762, "grad_norm": 6.03125, "learning_rate": 4.946720710588949e-05, "loss": 1.1337652206420898, "mean_token_accuracy": 0.735855221748352, "num_tokens": 9121072.0, "step": 4600 }, { "entropy": 1.0897636383771896, "epoch": 0.082813131539947, "grad_norm": 5.6875, "learning_rate": 4.946425284469071e-05, "loss": 1.1113767623901367, "mean_token_accuracy": 0.7458392336964608, "num_tokens": 9141351.0, "step": 4610 }, { "entropy": 1.1274853184819222, "epoch": 0.08299276956931782, "grad_norm": 8.625, "learning_rate": 4.946129050434848e-05, "loss": 1.239295482635498, "mean_token_accuracy": 0.7173780806362628, "num_tokens": 9160784.0, "step": 4620 }, { "entropy": 1.009946422278881, "epoch": 0.08317240759868864, "grad_norm": 6.9375, "learning_rate": 4.945832008584112e-05, "loss": 1.0282076835632323, "mean_token_accuracy": 0.759869922697544, "num_tokens": 9179862.0, "step": 4630 }, { "entropy": 1.1466631941497325, "epoch": 0.08335204562805947, "grad_norm": 8.1875, "learning_rate": 4.945534159014957e-05, "loss": 1.2382200241088868, "mean_token_accuracy": 0.7125390745699406, "num_tokens": 9199210.0, "step": 4640 }, { "entropy": 1.0501185223460197, "epoch": 0.08353168365743027, "grad_norm": 6.9375, "learning_rate": 4.945235501825747e-05, "loss": 1.0690990447998048, "mean_token_accuracy": 0.7579691767692566, "num_tokens": 9218872.0, "step": 4650 }, { "entropy": 1.1878760367631913, "epoch": 0.0837113216868011, "grad_norm": 9.25, "learning_rate": 4.944936037115109e-05, "loss": 1.2630474090576171, "mean_token_accuracy": 0.7189512997865677, "num_tokens": 9238842.0, "step": 4660 }, { "entropy": 1.2201133072376251, "epoch": 0.08389095971617191, "grad_norm": 7.09375, "learning_rate": 4.944635764981942e-05, "loss": 1.2702902793884276, "mean_token_accuracy": 0.7169070929288864, "num_tokens": 9257476.0, "step": 4670 }, { "entropy": 1.0432930171489716, "epoch": 0.08407059774554274, "grad_norm": 7.84375, "learning_rate": 4.944334685525407e-05, "loss": 1.0921135902404786, "mean_token_accuracy": 0.7399536401033402, "num_tokens": 9277743.0, "step": 4680 }, { "entropy": 1.078136332333088, "epoch": 0.08425023577491354, "grad_norm": 5.75, "learning_rate": 4.944032798844933e-05, "loss": 1.0558756828308105, "mean_token_accuracy": 0.7448537409305572, "num_tokens": 9297397.0, "step": 4690 }, { "entropy": 1.0190674111247062, "epoch": 0.08442987380428436, "grad_norm": 7.78125, "learning_rate": 4.943730105040217e-05, "loss": 1.1207489013671874, "mean_token_accuracy": 0.735479012131691, "num_tokens": 9317151.0, "step": 4700 }, { "entropy": 1.1430235594511031, "epoch": 0.08460951183365518, "grad_norm": 6.71875, "learning_rate": 4.943426604211222e-05, "loss": 1.1972759246826172, "mean_token_accuracy": 0.7309389486908913, "num_tokens": 9336304.0, "step": 4710 }, { "entropy": 1.2262649565935135, "epoch": 0.084789149863026, "grad_norm": 8.0, "learning_rate": 4.9431222964581756e-05, "loss": 1.2485018730163575, "mean_token_accuracy": 0.7141258925199508, "num_tokens": 9357327.0, "step": 4720 }, { "entropy": 1.1704344421625137, "epoch": 0.08496878789239683, "grad_norm": 8.3125, "learning_rate": 4.942817181881573e-05, "loss": 1.2148893356323243, "mean_token_accuracy": 0.725588996708393, "num_tokens": 9377018.0, "step": 4730 }, { "entropy": 1.0907916009426117, "epoch": 0.08514842592176763, "grad_norm": 7.09375, "learning_rate": 4.9425112605821764e-05, "loss": 1.0532269477844238, "mean_token_accuracy": 0.7582018673419952, "num_tokens": 9396611.0, "step": 4740 }, { "entropy": 1.085527414828539, "epoch": 0.08532806395113846, "grad_norm": 6.28125, "learning_rate": 4.942204532661016e-05, "loss": 1.1715558052062989, "mean_token_accuracy": 0.7360363766551018, "num_tokens": 9416791.0, "step": 4750 }, { "entropy": 1.0757691830396652, "epoch": 0.08550770198050928, "grad_norm": 5.71875, "learning_rate": 4.941896998219384e-05, "loss": 1.093851089477539, "mean_token_accuracy": 0.7434619531035424, "num_tokens": 9437765.0, "step": 4760 }, { "entropy": 1.170188531279564, "epoch": 0.0856873400098801, "grad_norm": 7.25, "learning_rate": 4.941588657358842e-05, "loss": 1.199110221862793, "mean_token_accuracy": 0.7326875366270542, "num_tokens": 9457939.0, "step": 4770 }, { "entropy": 1.1072071999311448, "epoch": 0.0858669780392509, "grad_norm": 6.65625, "learning_rate": 4.941279510181218e-05, "loss": 1.197795295715332, "mean_token_accuracy": 0.7166375622153283, "num_tokens": 9478026.0, "step": 4780 }, { "entropy": 1.1615648224949837, "epoch": 0.08604661606862173, "grad_norm": 5.375, "learning_rate": 4.940969556788606e-05, "loss": 1.1371450424194336, "mean_token_accuracy": 0.7349997401237488, "num_tokens": 9497918.0, "step": 4790 }, { "entropy": 1.1660807460546494, "epoch": 0.08622625409799255, "grad_norm": 9.0, "learning_rate": 4.940658797283365e-05, "loss": 1.2441143989562988, "mean_token_accuracy": 0.7208584748208523, "num_tokens": 9517487.0, "step": 4800 }, { "entropy": 1.0893693819642067, "epoch": 0.08640589212736337, "grad_norm": 6.125, "learning_rate": 4.940347231768121e-05, "loss": 1.127051830291748, "mean_token_accuracy": 0.7391569375991821, "num_tokens": 9536686.0, "step": 4810 }, { "entropy": 1.196195873618126, "epoch": 0.08658553015673418, "grad_norm": 7.4375, "learning_rate": 4.9400348603457666e-05, "loss": 1.2687178611755372, "mean_token_accuracy": 0.7227301627397538, "num_tokens": 9556431.0, "step": 4820 }, { "entropy": 1.0226236060261726, "epoch": 0.086765168186105, "grad_norm": 5.53125, "learning_rate": 4.93972168311946e-05, "loss": 1.0510937690734863, "mean_token_accuracy": 0.7562260389328003, "num_tokens": 9575900.0, "step": 4830 }, { "entropy": 1.249869167804718, "epoch": 0.08694480621547582, "grad_norm": 7.4375, "learning_rate": 4.939407700192627e-05, "loss": 1.254288101196289, "mean_token_accuracy": 0.714546873420477, "num_tokens": 9596978.0, "step": 4840 }, { "entropy": 1.0518839672207831, "epoch": 0.08712444424484664, "grad_norm": 9.1875, "learning_rate": 4.9390929116689564e-05, "loss": 1.0785776138305665, "mean_token_accuracy": 0.752020961791277, "num_tokens": 9616364.0, "step": 4850 }, { "entropy": 0.979648444801569, "epoch": 0.08730408227421745, "grad_norm": 7.6875, "learning_rate": 4.938777317652405e-05, "loss": 1.0633100509643554, "mean_token_accuracy": 0.7483566731214524, "num_tokens": 9637270.0, "step": 4860 }, { "entropy": 1.0675409823656081, "epoch": 0.08748372030358827, "grad_norm": 9.25, "learning_rate": 4.9384609182471964e-05, "loss": 1.1480443954467774, "mean_token_accuracy": 0.7428780734539032, "num_tokens": 9658063.0, "step": 4870 }, { "entropy": 1.1188408970832824, "epoch": 0.08766335833295909, "grad_norm": 6.71875, "learning_rate": 4.938143713557819e-05, "loss": 1.2195775985717774, "mean_token_accuracy": 0.721643791347742, "num_tokens": 9677401.0, "step": 4880 }, { "entropy": 1.0885242834687232, "epoch": 0.08784299636232991, "grad_norm": 8.125, "learning_rate": 4.9378257036890274e-05, "loss": 1.0725805282592773, "mean_token_accuracy": 0.7543836668133735, "num_tokens": 9696171.0, "step": 4890 }, { "entropy": 1.1103441014885902, "epoch": 0.08802263439170073, "grad_norm": 11.1875, "learning_rate": 4.937506888745842e-05, "loss": 1.1757125854492188, "mean_token_accuracy": 0.73391894698143, "num_tokens": 9715382.0, "step": 4900 }, { "entropy": 1.1567430004477501, "epoch": 0.08820227242107154, "grad_norm": 8.6875, "learning_rate": 4.937187268833549e-05, "loss": 1.1572379112243651, "mean_token_accuracy": 0.7308511160314083, "num_tokens": 9735614.0, "step": 4910 }, { "entropy": 1.0268317446112634, "epoch": 0.08838191045044236, "grad_norm": 8.1875, "learning_rate": 4.9368668440577004e-05, "loss": 1.1054457664489745, "mean_token_accuracy": 0.7446669086813926, "num_tokens": 9755779.0, "step": 4920 }, { "entropy": 1.0308701664209365, "epoch": 0.08856154847981318, "grad_norm": 6.84375, "learning_rate": 4.936545614524114e-05, "loss": 1.089671802520752, "mean_token_accuracy": 0.7485545501112938, "num_tokens": 9775888.0, "step": 4930 }, { "entropy": 1.1735311090946197, "epoch": 0.088741186509184, "grad_norm": 7.625, "learning_rate": 4.9362235803388743e-05, "loss": 1.204796028137207, "mean_token_accuracy": 0.7297091811895371, "num_tokens": 9795296.0, "step": 4940 }, { "entropy": 1.1966588482260705, "epoch": 0.08892082453855481, "grad_norm": 7.15625, "learning_rate": 4.935900741608331e-05, "loss": 1.1896883964538574, "mean_token_accuracy": 0.7273554235696793, "num_tokens": 9815947.0, "step": 4950 }, { "entropy": 1.1858868986368178, "epoch": 0.08910046256792563, "grad_norm": 7.09375, "learning_rate": 4.935577098439098e-05, "loss": 1.1679813385009765, "mean_token_accuracy": 0.7352235659956932, "num_tokens": 9834549.0, "step": 4960 }, { "entropy": 1.1753675110638142, "epoch": 0.08928010059729645, "grad_norm": 7.15625, "learning_rate": 4.935252650938057e-05, "loss": 1.2885382652282715, "mean_token_accuracy": 0.7026080086827278, "num_tokens": 9854159.0, "step": 4970 }, { "entropy": 1.0198906108736991, "epoch": 0.08945973862666727, "grad_norm": 4.75, "learning_rate": 4.934927399212354e-05, "loss": 1.0887751579284668, "mean_token_accuracy": 0.7540128245949745, "num_tokens": 9874278.0, "step": 4980 }, { "entropy": 1.2017800465226174, "epoch": 0.08963937665603808, "grad_norm": 7.53125, "learning_rate": 4.9346013433694015e-05, "loss": 1.2068198204040528, "mean_token_accuracy": 0.7233853235840797, "num_tokens": 9893070.0, "step": 4990 }, { "epoch": 0.0898190146854089, "eval_entropy": 1.0882056572437286, "eval_loss": 1.1298004388809204, "eval_mean_token_accuracy": 0.7420213644504547, "eval_num_tokens": 9912598.0, "eval_runtime": 40.4432, "eval_samples_per_second": 49.452, "eval_steps_per_second": 6.182, "step": 5000 }, { "entropy": 1.0914090752601624, "epoch": 0.08999865271477972, "grad_norm": 8.75, "learning_rate": 4.933946819762724e-05, "loss": 1.1383769035339355, "mean_token_accuracy": 0.7404438890516758, "num_tokens": 9932169.0, "step": 5010 }, { "entropy": 1.1380635425448418, "epoch": 0.09017829074415054, "grad_norm": 9.125, "learning_rate": 4.933618352215149e-05, "loss": 1.152083396911621, "mean_token_accuracy": 0.7271808430552482, "num_tokens": 9952227.0, "step": 5020 }, { "entropy": 1.0220148339867592, "epoch": 0.09035792877352135, "grad_norm": 7.125, "learning_rate": 4.9332890809826296e-05, "loss": 1.0692299842834472, "mean_token_accuracy": 0.7524761587381363, "num_tokens": 9971835.0, "step": 5030 }, { "entropy": 1.0026740372180938, "epoch": 0.09053756680289217, "grad_norm": 6.0, "learning_rate": 4.9329590061739014e-05, "loss": 1.0836249351501466, "mean_token_accuracy": 0.7460832521319389, "num_tokens": 9992157.0, "step": 5040 }, { "entropy": 1.178272594511509, "epoch": 0.09071720483226299, "grad_norm": 7.125, "learning_rate": 4.9326281278979724e-05, "loss": 1.2511772155761718, "mean_token_accuracy": 0.7174595117568969, "num_tokens": 10013018.0, "step": 5050 }, { "entropy": 1.2776155576109887, "epoch": 0.09089684286163381, "grad_norm": 6.8125, "learning_rate": 4.932296446264111e-05, "loss": 1.2887293815612793, "mean_token_accuracy": 0.7096857517957688, "num_tokens": 10033857.0, "step": 5060 }, { "entropy": 0.9546220138669014, "epoch": 0.09107648089100463, "grad_norm": 6.90625, "learning_rate": 4.9319639613818534e-05, "loss": 1.0112491607666017, "mean_token_accuracy": 0.7743618234992027, "num_tokens": 10053604.0, "step": 5070 }, { "entropy": 0.9962936744093895, "epoch": 0.09125611892037544, "grad_norm": 5.75, "learning_rate": 4.931630673361e-05, "loss": 1.0010974884033204, "mean_token_accuracy": 0.7660636007785797, "num_tokens": 10073538.0, "step": 5080 }, { "entropy": 1.0547944888472558, "epoch": 0.09143575694974626, "grad_norm": 6.4375, "learning_rate": 4.931296582311618e-05, "loss": 1.1485336303710938, "mean_token_accuracy": 0.7320487529039383, "num_tokens": 10093105.0, "step": 5090 }, { "entropy": 1.142357422411442, "epoch": 0.09161539497911708, "grad_norm": 8.25, "learning_rate": 4.930961688344036e-05, "loss": 1.2027498245239259, "mean_token_accuracy": 0.7288209445774555, "num_tokens": 10114480.0, "step": 5100 }, { "entropy": 1.0491223186254501, "epoch": 0.0917950330084879, "grad_norm": 7.03125, "learning_rate": 4.930625991568851e-05, "loss": 1.0472751617431642, "mean_token_accuracy": 0.7557002186775208, "num_tokens": 10134713.0, "step": 5110 }, { "entropy": 1.0559690818190575, "epoch": 0.09197467103785871, "grad_norm": 8.375, "learning_rate": 4.930289492096927e-05, "loss": 1.0869626998901367, "mean_token_accuracy": 0.7524943515658379, "num_tokens": 10154936.0, "step": 5120 }, { "entropy": 0.9721009105443954, "epoch": 0.09215430906722953, "grad_norm": 6.53125, "learning_rate": 4.929952190039388e-05, "loss": 1.018129253387451, "mean_token_accuracy": 0.7587607815861702, "num_tokens": 10174250.0, "step": 5130 }, { "entropy": 1.042512382566929, "epoch": 0.09233394709660035, "grad_norm": 5.71875, "learning_rate": 4.929614085507627e-05, "loss": 1.0626505851745605, "mean_token_accuracy": 0.7524214640259743, "num_tokens": 10193908.0, "step": 5140 }, { "entropy": 1.0346194952726364, "epoch": 0.09251358512597117, "grad_norm": 7.625, "learning_rate": 4.929275178613298e-05, "loss": 1.1145664215087892, "mean_token_accuracy": 0.7511129155755043, "num_tokens": 10214554.0, "step": 5150 }, { "entropy": 1.1123483985662461, "epoch": 0.09269322315534198, "grad_norm": 6.59375, "learning_rate": 4.928935469468327e-05, "loss": 1.1143043518066407, "mean_token_accuracy": 0.744641299545765, "num_tokens": 10236233.0, "step": 5160 }, { "entropy": 1.0230978533625603, "epoch": 0.0928728611847128, "grad_norm": 6.90625, "learning_rate": 4.9285949581848964e-05, "loss": 1.0614803314208985, "mean_token_accuracy": 0.7528670564293861, "num_tokens": 10256452.0, "step": 5170 }, { "entropy": 1.0922610640525818, "epoch": 0.09305249921408362, "grad_norm": 5.1875, "learning_rate": 4.928253644875459e-05, "loss": 1.1323586463928224, "mean_token_accuracy": 0.7398323759436607, "num_tokens": 10276611.0, "step": 5180 }, { "entropy": 1.1038916900753974, "epoch": 0.09323213724345444, "grad_norm": 7.09375, "learning_rate": 4.9279115296527324e-05, "loss": 1.1701594352722169, "mean_token_accuracy": 0.7353798605501651, "num_tokens": 10296993.0, "step": 5190 }, { "entropy": 1.1484145201742648, "epoch": 0.09341177527282525, "grad_norm": 6.375, "learning_rate": 4.927568612629696e-05, "loss": 1.1665028572082519, "mean_token_accuracy": 0.7322954878211021, "num_tokens": 10316448.0, "step": 5200 }, { "entropy": 1.012902107089758, "epoch": 0.09359141330219607, "grad_norm": 5.5, "learning_rate": 4.927224893919595e-05, "loss": 1.0114215850830077, "mean_token_accuracy": 0.765603469312191, "num_tokens": 10337065.0, "step": 5210 }, { "entropy": 1.0247754469513892, "epoch": 0.0937710513315669, "grad_norm": 5.0625, "learning_rate": 4.9268803736359426e-05, "loss": 1.1000990867614746, "mean_token_accuracy": 0.7513218760490418, "num_tokens": 10356953.0, "step": 5220 }, { "entropy": 1.1060189202427864, "epoch": 0.09395068936093771, "grad_norm": 6.59375, "learning_rate": 4.926535051892513e-05, "loss": 1.0986078262329102, "mean_token_accuracy": 0.7419395886361599, "num_tokens": 10376309.0, "step": 5230 }, { "entropy": 1.0925479769706725, "epoch": 0.09413032739030854, "grad_norm": 8.375, "learning_rate": 4.9261889288033445e-05, "loss": 1.1497454643249512, "mean_token_accuracy": 0.7397084981203079, "num_tokens": 10397081.0, "step": 5240 }, { "entropy": 1.1301081612706185, "epoch": 0.09430996541967934, "grad_norm": 10.0625, "learning_rate": 4.925842004482745e-05, "loss": 1.2125494956970215, "mean_token_accuracy": 0.7250224642455578, "num_tokens": 10416823.0, "step": 5250 }, { "entropy": 1.1606574088335038, "epoch": 0.09448960344905016, "grad_norm": 6.84375, "learning_rate": 4.925494279045281e-05, "loss": 1.2046463012695312, "mean_token_accuracy": 0.7321810111403465, "num_tokens": 10436705.0, "step": 5260 }, { "entropy": 1.162073915451765, "epoch": 0.09466924147842098, "grad_norm": 7.40625, "learning_rate": 4.925145752605788e-05, "loss": 1.1661548614501953, "mean_token_accuracy": 0.7304585590958595, "num_tokens": 10456339.0, "step": 5270 }, { "entropy": 1.136557611823082, "epoch": 0.0948488795077918, "grad_norm": 7.15625, "learning_rate": 4.9247964252793624e-05, "loss": 1.2424405097961426, "mean_token_accuracy": 0.7333075851202011, "num_tokens": 10477205.0, "step": 5280 }, { "entropy": 1.0063030883669852, "epoch": 0.09502851753716261, "grad_norm": 4.71875, "learning_rate": 4.9244462971813696e-05, "loss": 0.9620872497558594, "mean_token_accuracy": 0.7753238156437874, "num_tokens": 10497810.0, "step": 5290 }, { "entropy": 0.9935022726655006, "epoch": 0.09520815556653343, "grad_norm": 7.15625, "learning_rate": 4.924095368427435e-05, "loss": 1.0597262382507324, "mean_token_accuracy": 0.7567232459783554, "num_tokens": 10518412.0, "step": 5300 }, { "entropy": 1.1183653250336647, "epoch": 0.09538779359590425, "grad_norm": 7.03125, "learning_rate": 4.923743639133451e-05, "loss": 1.1989439010620118, "mean_token_accuracy": 0.7255274146795273, "num_tokens": 10538274.0, "step": 5310 }, { "entropy": 1.0052246682345867, "epoch": 0.09556743162527508, "grad_norm": 8.5625, "learning_rate": 4.9233911094155735e-05, "loss": 1.05171537399292, "mean_token_accuracy": 0.7563199654221535, "num_tokens": 10559604.0, "step": 5320 }, { "entropy": 1.1118532486259938, "epoch": 0.09574706965464588, "grad_norm": 7.09375, "learning_rate": 4.9230377793902236e-05, "loss": 1.1537075996398927, "mean_token_accuracy": 0.743959829211235, "num_tokens": 10579387.0, "step": 5330 }, { "entropy": 1.1166372366249562, "epoch": 0.0959267076840167, "grad_norm": 5.9375, "learning_rate": 4.9226836491740844e-05, "loss": 1.1717398643493653, "mean_token_accuracy": 0.733088281005621, "num_tokens": 10598453.0, "step": 5340 }, { "entropy": 1.1397918701171874, "epoch": 0.09610634571338753, "grad_norm": 5.4375, "learning_rate": 4.922328718884107e-05, "loss": 1.141579532623291, "mean_token_accuracy": 0.7417924642562866, "num_tokens": 10617952.0, "step": 5350 }, { "entropy": 1.047075329720974, "epoch": 0.09628598374275835, "grad_norm": 7.0625, "learning_rate": 4.9219729886375024e-05, "loss": 1.0157114028930665, "mean_token_accuracy": 0.765577121078968, "num_tokens": 10637374.0, "step": 5360 }, { "entropy": 1.020466460287571, "epoch": 0.09646562177212915, "grad_norm": 6.03125, "learning_rate": 4.9216164585517494e-05, "loss": 1.0876362800598145, "mean_token_accuracy": 0.7573550254106521, "num_tokens": 10657173.0, "step": 5370 }, { "entropy": 1.008359081298113, "epoch": 0.09664525980149997, "grad_norm": 6.9375, "learning_rate": 4.921259128744589e-05, "loss": 1.0307931900024414, "mean_token_accuracy": 0.7562927782535553, "num_tokens": 10677472.0, "step": 5380 }, { "entropy": 1.0701922655105591, "epoch": 0.0968248978308708, "grad_norm": 6.625, "learning_rate": 4.9209009993340264e-05, "loss": 1.1034717559814453, "mean_token_accuracy": 0.7494121044874191, "num_tokens": 10698124.0, "step": 5390 }, { "entropy": 1.1503942504525184, "epoch": 0.09700453586024162, "grad_norm": 7.5, "learning_rate": 4.920542070438332e-05, "loss": 1.2291152000427246, "mean_token_accuracy": 0.7066176936030388, "num_tokens": 10717994.0, "step": 5400 }, { "entropy": 1.035945226252079, "epoch": 0.09718417388961242, "grad_norm": 5.59375, "learning_rate": 4.9201823421760395e-05, "loss": 1.093758487701416, "mean_token_accuracy": 0.7496545135974884, "num_tokens": 10739824.0, "step": 5410 }, { "entropy": 1.155145500600338, "epoch": 0.09736381191898325, "grad_norm": 10.125, "learning_rate": 4.919821814665946e-05, "loss": 1.1667027473449707, "mean_token_accuracy": 0.732168273627758, "num_tokens": 10758786.0, "step": 5420 }, { "entropy": 1.170270571857691, "epoch": 0.09754344994835407, "grad_norm": 8.125, "learning_rate": 4.919460488027113e-05, "loss": 1.2354021072387695, "mean_token_accuracy": 0.7238908313214779, "num_tokens": 10780006.0, "step": 5430 }, { "entropy": 1.1628091730177403, "epoch": 0.09772308797772489, "grad_norm": 8.125, "learning_rate": 4.919098362378868e-05, "loss": 1.205706787109375, "mean_token_accuracy": 0.7184412762522697, "num_tokens": 10800674.0, "step": 5440 }, { "entropy": 1.185660894215107, "epoch": 0.09790272600709571, "grad_norm": 8.3125, "learning_rate": 4.918735437840797e-05, "loss": 1.1491731643676757, "mean_token_accuracy": 0.7371725812554359, "num_tokens": 10821089.0, "step": 5450 }, { "entropy": 1.1204293459653853, "epoch": 0.09808236403646652, "grad_norm": 5.8125, "learning_rate": 4.918371714532756e-05, "loss": 1.2428881645202636, "mean_token_accuracy": 0.7213858619332314, "num_tokens": 10842765.0, "step": 5460 }, { "entropy": 1.097996361553669, "epoch": 0.09826200206583734, "grad_norm": 6.28125, "learning_rate": 4.918007192574861e-05, "loss": 1.085082721710205, "mean_token_accuracy": 0.7507482290267944, "num_tokens": 10862834.0, "step": 5470 }, { "entropy": 1.0705626383423805, "epoch": 0.09844164009520816, "grad_norm": 6.53125, "learning_rate": 4.917641872087492e-05, "loss": 1.1050758361816406, "mean_token_accuracy": 0.745497590303421, "num_tokens": 10882137.0, "step": 5480 }, { "entropy": 1.1645829781889916, "epoch": 0.09862127812457898, "grad_norm": 6.59375, "learning_rate": 4.917275753191294e-05, "loss": 1.203923511505127, "mean_token_accuracy": 0.7298523351550102, "num_tokens": 10901620.0, "step": 5490 }, { "entropy": 1.1557079285383225, "epoch": 0.09880091615394979, "grad_norm": 6.0625, "learning_rate": 4.916908836007176e-05, "loss": 1.1813009262084961, "mean_token_accuracy": 0.7358975663781167, "num_tokens": 10921106.0, "step": 5500 }, { "entropy": 0.9995366096496582, "epoch": 0.09898055418332061, "grad_norm": 8.9375, "learning_rate": 4.91654112065631e-05, "loss": 1.0133164405822754, "mean_token_accuracy": 0.7629754096269608, "num_tokens": 10940701.0, "step": 5510 }, { "entropy": 1.0657085008919238, "epoch": 0.09916019221269143, "grad_norm": 6.9375, "learning_rate": 4.9161726072601286e-05, "loss": 1.174940299987793, "mean_token_accuracy": 0.7383551955223083, "num_tokens": 10961195.0, "step": 5520 }, { "entropy": 1.023510032892227, "epoch": 0.09933983024206225, "grad_norm": 6.1875, "learning_rate": 4.915803295940333e-05, "loss": 1.0425142288208007, "mean_token_accuracy": 0.7584219187498092, "num_tokens": 10979831.0, "step": 5530 }, { "entropy": 1.1189694494009017, "epoch": 0.09951946827143306, "grad_norm": 7.21875, "learning_rate": 4.9154331868188865e-05, "loss": 1.1405045509338378, "mean_token_accuracy": 0.7520097717642784, "num_tokens": 10998828.0, "step": 5540 }, { "entropy": 1.0844595924019813, "epoch": 0.09969910630080388, "grad_norm": 4.65625, "learning_rate": 4.915062280018012e-05, "loss": 1.0839847564697265, "mean_token_accuracy": 0.7443592548370361, "num_tokens": 11018857.0, "step": 5550 }, { "entropy": 1.1899598315358162, "epoch": 0.0998787443301747, "grad_norm": 5.5, "learning_rate": 4.914690575660202e-05, "loss": 1.165814208984375, "mean_token_accuracy": 0.7357245326042176, "num_tokens": 11037838.0, "step": 5560 }, { "entropy": 1.0412156522274016, "epoch": 0.10005838235954552, "grad_norm": 6.3125, "learning_rate": 4.914318073868207e-05, "loss": 1.1189002990722656, "mean_token_accuracy": 0.7408639818429947, "num_tokens": 11057599.0, "step": 5570 }, { "entropy": 1.0312755942344665, "epoch": 0.10023802038891633, "grad_norm": 9.125, "learning_rate": 4.913944774765044e-05, "loss": 1.061415672302246, "mean_token_accuracy": 0.7434593051671982, "num_tokens": 11077692.0, "step": 5580 }, { "entropy": 1.0085327550768852, "epoch": 0.10041765841828715, "grad_norm": 4.84375, "learning_rate": 4.913570678473991e-05, "loss": 1.036046314239502, "mean_token_accuracy": 0.7555720120668411, "num_tokens": 11098514.0, "step": 5590 }, { "entropy": 1.0291207820177077, "epoch": 0.10059729644765797, "grad_norm": 6.5, "learning_rate": 4.9131957851185915e-05, "loss": 1.128465175628662, "mean_token_accuracy": 0.7424156993627549, "num_tokens": 11118565.0, "step": 5600 }, { "entropy": 1.15163347274065, "epoch": 0.10077693447702879, "grad_norm": 7.4375, "learning_rate": 4.912820094822652e-05, "loss": 1.1871371269226074, "mean_token_accuracy": 0.7359251111745835, "num_tokens": 11138316.0, "step": 5610 }, { "entropy": 1.1466680020093918, "epoch": 0.10095657250639961, "grad_norm": 5.3125, "learning_rate": 4.912443607710241e-05, "loss": 1.148698616027832, "mean_token_accuracy": 0.7421729430556298, "num_tokens": 11158751.0, "step": 5620 }, { "entropy": 0.9591960638761521, "epoch": 0.10113621053577042, "grad_norm": 7.03125, "learning_rate": 4.9120663239056914e-05, "loss": 0.9600547790527344, "mean_token_accuracy": 0.7702839434146881, "num_tokens": 11178084.0, "step": 5630 }, { "entropy": 0.9736021757125854, "epoch": 0.10131584856514124, "grad_norm": 8.5625, "learning_rate": 4.9116882435335966e-05, "loss": 1.0426530838012695, "mean_token_accuracy": 0.7497874781489372, "num_tokens": 11198042.0, "step": 5640 }, { "entropy": 1.1649086952209473, "epoch": 0.10149548659451206, "grad_norm": 7.25, "learning_rate": 4.911309366718817e-05, "loss": 1.2064261436462402, "mean_token_accuracy": 0.7338306829333305, "num_tokens": 11217349.0, "step": 5650 }, { "entropy": 1.0595213398337364, "epoch": 0.10167512462388288, "grad_norm": 7.1875, "learning_rate": 4.910929693586472e-05, "loss": 1.0868009567260741, "mean_token_accuracy": 0.7516065120697022, "num_tokens": 11237284.0, "step": 5660 }, { "entropy": 1.1015644878149033, "epoch": 0.10185476265325369, "grad_norm": 7.75, "learning_rate": 4.910549224261947e-05, "loss": 1.1364654541015624, "mean_token_accuracy": 0.7441115751862526, "num_tokens": 11256958.0, "step": 5670 }, { "entropy": 1.0432453140616418, "epoch": 0.10203440068262451, "grad_norm": 6.5625, "learning_rate": 4.910167958870889e-05, "loss": 1.1159459114074708, "mean_token_accuracy": 0.7430467203259468, "num_tokens": 11276778.0, "step": 5680 }, { "entropy": 1.076836434006691, "epoch": 0.10221403871199533, "grad_norm": 6.5625, "learning_rate": 4.909785897539209e-05, "loss": 1.1307708740234375, "mean_token_accuracy": 0.7387826569378376, "num_tokens": 11297715.0, "step": 5690 }, { "entropy": 1.1495344325900079, "epoch": 0.10239367674136615, "grad_norm": 6.59375, "learning_rate": 4.909403040393079e-05, "loss": 1.192055606842041, "mean_token_accuracy": 0.72905587926507, "num_tokens": 11317785.0, "step": 5700 }, { "entropy": 1.0696873247623444, "epoch": 0.10257331477073696, "grad_norm": 7.8125, "learning_rate": 4.909019387558935e-05, "loss": 1.1156390190124512, "mean_token_accuracy": 0.7452369824051857, "num_tokens": 11338476.0, "step": 5710 }, { "entropy": 1.1068349450826644, "epoch": 0.10275295280010778, "grad_norm": 5.0625, "learning_rate": 4.9086349391634755e-05, "loss": 1.116074562072754, "mean_token_accuracy": 0.7409947916865349, "num_tokens": 11358803.0, "step": 5720 }, { "entropy": 1.0765526920557023, "epoch": 0.1029325908294786, "grad_norm": 6.15625, "learning_rate": 4.908249695333662e-05, "loss": 1.1018148422241212, "mean_token_accuracy": 0.7474873699247837, "num_tokens": 11379952.0, "step": 5730 }, { "entropy": 1.0575618125498294, "epoch": 0.10311222885884942, "grad_norm": 6.5, "learning_rate": 4.907863656196719e-05, "loss": 1.1194604873657226, "mean_token_accuracy": 0.7468373820185661, "num_tokens": 11399683.0, "step": 5740 }, { "entropy": 1.0685867860913276, "epoch": 0.10329186688822023, "grad_norm": 7.75, "learning_rate": 4.907476821880132e-05, "loss": 1.0872982025146485, "mean_token_accuracy": 0.748898808658123, "num_tokens": 11419410.0, "step": 5750 }, { "entropy": 1.0381993144750594, "epoch": 0.10347150491759105, "grad_norm": 7.1875, "learning_rate": 4.907089192511651e-05, "loss": 1.0862348556518555, "mean_token_accuracy": 0.746786642074585, "num_tokens": 11438772.0, "step": 5760 }, { "entropy": 1.0364542946219444, "epoch": 0.10365114294696187, "grad_norm": 4.9375, "learning_rate": 4.906700768219288e-05, "loss": 1.0907612800598145, "mean_token_accuracy": 0.7433740258216858, "num_tokens": 11459210.0, "step": 5770 }, { "entropy": 1.0087475448846817, "epoch": 0.10383078097633269, "grad_norm": 6.875, "learning_rate": 4.906311549131317e-05, "loss": 1.0176715850830078, "mean_token_accuracy": 0.7580270543694496, "num_tokens": 11478691.0, "step": 5780 }, { "entropy": 0.9338625639677047, "epoch": 0.10401041900570351, "grad_norm": 5.71875, "learning_rate": 4.905921535376275e-05, "loss": 0.9635801315307617, "mean_token_accuracy": 0.767186838388443, "num_tokens": 11498293.0, "step": 5790 }, { "entropy": 1.1373558983206749, "epoch": 0.10419005703507432, "grad_norm": 6.5625, "learning_rate": 4.905530727082961e-05, "loss": 1.1965977668762207, "mean_token_accuracy": 0.7290416166186333, "num_tokens": 11518715.0, "step": 5800 }, { "entropy": 1.1861480817198753, "epoch": 0.10436969506444514, "grad_norm": 6.5625, "learning_rate": 4.9051391243804364e-05, "loss": 1.1814220428466797, "mean_token_accuracy": 0.7295829258859158, "num_tokens": 11538859.0, "step": 5810 }, { "entropy": 1.0245934382081032, "epoch": 0.10454933309381596, "grad_norm": 5.6875, "learning_rate": 4.904746727398025e-05, "loss": 1.0298347473144531, "mean_token_accuracy": 0.7525382161140441, "num_tokens": 11557500.0, "step": 5820 }, { "entropy": 1.01600990742445, "epoch": 0.10472897112318678, "grad_norm": 7.6875, "learning_rate": 4.9043535362653146e-05, "loss": 1.0304162979125977, "mean_token_accuracy": 0.7633151859045029, "num_tokens": 11577984.0, "step": 5830 }, { "entropy": 1.0156742125749587, "epoch": 0.10490860915255759, "grad_norm": 7.34375, "learning_rate": 4.903959551112153e-05, "loss": 1.1048483848571777, "mean_token_accuracy": 0.7479206956923008, "num_tokens": 11598405.0, "step": 5840 }, { "entropy": 1.0360478840768337, "epoch": 0.10508824718192841, "grad_norm": 6.15625, "learning_rate": 4.9035647720686495e-05, "loss": 1.0700927734375, "mean_token_accuracy": 0.7488227054476738, "num_tokens": 11617654.0, "step": 5850 }, { "entropy": 1.009080171585083, "epoch": 0.10526788521129923, "grad_norm": 5.28125, "learning_rate": 4.9031691992651784e-05, "loss": 1.0658652305603027, "mean_token_accuracy": 0.7580617651343345, "num_tokens": 11637527.0, "step": 5860 }, { "entropy": 1.0495788708329201, "epoch": 0.10544752324067005, "grad_norm": 6.78125, "learning_rate": 4.9027728328323755e-05, "loss": 1.0697233200073242, "mean_token_accuracy": 0.7545733407139779, "num_tokens": 11657057.0, "step": 5870 }, { "entropy": 1.0322448551654815, "epoch": 0.10562716127004086, "grad_norm": 6.9375, "learning_rate": 4.9023756729011364e-05, "loss": 1.063349437713623, "mean_token_accuracy": 0.7505650848150254, "num_tokens": 11677237.0, "step": 5880 }, { "entropy": 1.0717719510197639, "epoch": 0.10580679929941168, "grad_norm": 6.34375, "learning_rate": 4.9019777196026204e-05, "loss": 1.0954110145568847, "mean_token_accuracy": 0.7442150920629501, "num_tokens": 11696801.0, "step": 5890 }, { "entropy": 1.0516410022974014, "epoch": 0.1059864373287825, "grad_norm": 8.25, "learning_rate": 4.901578973068249e-05, "loss": 1.123201847076416, "mean_token_accuracy": 0.7358275979757309, "num_tokens": 11716517.0, "step": 5900 }, { "entropy": 1.1413511157035827, "epoch": 0.10616607535815333, "grad_norm": 7.03125, "learning_rate": 4.9011794334297064e-05, "loss": 1.1876730918884277, "mean_token_accuracy": 0.7294520512223244, "num_tokens": 11735790.0, "step": 5910 }, { "entropy": 1.1290773004293442, "epoch": 0.10634571338752413, "grad_norm": 7.40625, "learning_rate": 4.9007791008189376e-05, "loss": 1.1772315979003907, "mean_token_accuracy": 0.7263943634927272, "num_tokens": 11755070.0, "step": 5920 }, { "entropy": 1.0778159394860267, "epoch": 0.10652535141689495, "grad_norm": 7.8125, "learning_rate": 4.9003779753681476e-05, "loss": 1.0553714752197265, "mean_token_accuracy": 0.7557582795619965, "num_tokens": 11775017.0, "step": 5930 }, { "entropy": 1.045047302544117, "epoch": 0.10670498944626577, "grad_norm": 8.0625, "learning_rate": 4.8999760572098076e-05, "loss": 1.1167244911193848, "mean_token_accuracy": 0.7462304264307023, "num_tokens": 11794892.0, "step": 5940 }, { "entropy": 1.0112846434116363, "epoch": 0.1068846274756366, "grad_norm": 6.6875, "learning_rate": 4.8995733464766456e-05, "loss": 0.9950170516967773, "mean_token_accuracy": 0.7710164472460747, "num_tokens": 11813821.0, "step": 5950 }, { "entropy": 0.9848114423453808, "epoch": 0.10706426550500742, "grad_norm": 5.5, "learning_rate": 4.8991698433016567e-05, "loss": 1.0798036575317382, "mean_token_accuracy": 0.7548213630914689, "num_tokens": 11834346.0, "step": 5960 }, { "entropy": 1.0721779204905033, "epoch": 0.10724390353437822, "grad_norm": 7.71875, "learning_rate": 4.8987655478180926e-05, "loss": 1.124882698059082, "mean_token_accuracy": 0.7332268178462982, "num_tokens": 11853516.0, "step": 5970 }, { "entropy": 1.143219293653965, "epoch": 0.10742354156374904, "grad_norm": 6.125, "learning_rate": 4.898360460159471e-05, "loss": 1.1659598350524902, "mean_token_accuracy": 0.7341182455420494, "num_tokens": 11873707.0, "step": 5980 }, { "entropy": 1.1560181632637978, "epoch": 0.10760317959311987, "grad_norm": 5.59375, "learning_rate": 4.897954580459567e-05, "loss": 1.1859731674194336, "mean_token_accuracy": 0.7260950461030007, "num_tokens": 11893813.0, "step": 5990 }, { "epoch": 0.10778281762249069, "eval_entropy": 1.0263335263729096, "eval_loss": 1.0623183250427246, "eval_mean_token_accuracy": 0.7533111233711243, "eval_num_tokens": 11913033.0, "eval_runtime": 40.5662, "eval_samples_per_second": 49.302, "eval_steps_per_second": 6.163, "step": 6000 }, { "entropy": 0.9956502024084329, "epoch": 0.1079624556518615, "grad_norm": 6.6875, "learning_rate": 4.897140445472334e-05, "loss": 1.023189640045166, "mean_token_accuracy": 0.7594320617616177, "num_tokens": 11933234.0, "step": 6010 }, { "entropy": 1.0894772738218308, "epoch": 0.10814209368123232, "grad_norm": 5.96875, "learning_rate": 4.896732190453866e-05, "loss": 1.1016148567199706, "mean_token_accuracy": 0.74625184237957, "num_tokens": 11954910.0, "step": 6020 }, { "entropy": 1.0253516979515553, "epoch": 0.10832173171060314, "grad_norm": 6.4375, "learning_rate": 4.896323143931841e-05, "loss": 1.107302761077881, "mean_token_accuracy": 0.7491895817220211, "num_tokens": 11975608.0, "step": 6030 }, { "entropy": 1.0746199190616608, "epoch": 0.10850136973997396, "grad_norm": 7.375, "learning_rate": 4.895913306041344e-05, "loss": 1.0935521125793457, "mean_token_accuracy": 0.7454762056469917, "num_tokens": 11995026.0, "step": 6040 }, { "entropy": 1.01798400208354, "epoch": 0.10868100776934476, "grad_norm": 7.90625, "learning_rate": 4.89550267691772e-05, "loss": 1.0459890365600586, "mean_token_accuracy": 0.7536133244633675, "num_tokens": 12015546.0, "step": 6050 }, { "entropy": 1.0714834108948708, "epoch": 0.10886064579871559, "grad_norm": 6.0625, "learning_rate": 4.895091256696578e-05, "loss": 1.118292999267578, "mean_token_accuracy": 0.7389300256967545, "num_tokens": 12035659.0, "step": 6060 }, { "entropy": 1.0880193039774895, "epoch": 0.1090402838280864, "grad_norm": 9.125, "learning_rate": 4.8946790455137856e-05, "loss": 1.0567352294921875, "mean_token_accuracy": 0.7475480064749718, "num_tokens": 12056542.0, "step": 6070 }, { "entropy": 1.0426205813884735, "epoch": 0.10921992185745723, "grad_norm": 6.5625, "learning_rate": 4.894266043505472e-05, "loss": 1.0677014350891114, "mean_token_accuracy": 0.7626322612166405, "num_tokens": 12077166.0, "step": 6080 }, { "entropy": 1.0352643243968487, "epoch": 0.10939955988682804, "grad_norm": 6.09375, "learning_rate": 4.89385225080803e-05, "loss": 1.0735333442687989, "mean_token_accuracy": 0.7500649943947792, "num_tokens": 12097940.0, "step": 6090 }, { "entropy": 1.0700816869735719, "epoch": 0.10957919791619886, "grad_norm": 8.5, "learning_rate": 4.8934376675581096e-05, "loss": 1.1178907394409179, "mean_token_accuracy": 0.743023757636547, "num_tokens": 12117716.0, "step": 6100 }, { "entropy": 0.9464042142033577, "epoch": 0.10975883594556968, "grad_norm": 6.53125, "learning_rate": 4.8930222938926245e-05, "loss": 0.9468300819396973, "mean_token_accuracy": 0.7686618760228157, "num_tokens": 12137933.0, "step": 6110 }, { "entropy": 1.091781882941723, "epoch": 0.1099384739749405, "grad_norm": 8.625, "learning_rate": 4.892606129948749e-05, "loss": 1.0873963356018066, "mean_token_accuracy": 0.7495502181351185, "num_tokens": 12158901.0, "step": 6120 }, { "entropy": 0.9942154839634896, "epoch": 0.11011811200431132, "grad_norm": 9.0, "learning_rate": 4.8921891758639196e-05, "loss": 1.0592898368835448, "mean_token_accuracy": 0.7540314614772796, "num_tokens": 12178934.0, "step": 6130 }, { "entropy": 0.9941693246364594, "epoch": 0.11029775003368213, "grad_norm": 6.90625, "learning_rate": 4.8917714317758304e-05, "loss": 1.0154906272888184, "mean_token_accuracy": 0.7608428508043289, "num_tokens": 12199661.0, "step": 6140 }, { "entropy": 1.033303937315941, "epoch": 0.11047738806305295, "grad_norm": 7.5625, "learning_rate": 4.891352897822439e-05, "loss": 1.0534424781799316, "mean_token_accuracy": 0.7513334073126317, "num_tokens": 12219554.0, "step": 6150 }, { "entropy": 1.0806662991642952, "epoch": 0.11065702609242377, "grad_norm": 6.90625, "learning_rate": 4.890933574141964e-05, "loss": 1.1575303077697754, "mean_token_accuracy": 0.7324025899171829, "num_tokens": 12240903.0, "step": 6160 }, { "entropy": 1.066120059788227, "epoch": 0.11083666412179459, "grad_norm": 6.96875, "learning_rate": 4.890513460872883e-05, "loss": 1.0571278572082519, "mean_token_accuracy": 0.7533085778355598, "num_tokens": 12260451.0, "step": 6170 }, { "entropy": 1.0459950476884843, "epoch": 0.1110163021511654, "grad_norm": 6.28125, "learning_rate": 4.890092558153935e-05, "loss": 1.1307196617126465, "mean_token_accuracy": 0.7439378961920738, "num_tokens": 12281836.0, "step": 6180 }, { "entropy": 0.9970750510692596, "epoch": 0.11119594018053622, "grad_norm": 11.375, "learning_rate": 4.889670866124122e-05, "loss": 1.059687614440918, "mean_token_accuracy": 0.74624994546175, "num_tokens": 12301409.0, "step": 6190 }, { "entropy": 1.0292142443358898, "epoch": 0.11137557820990704, "grad_norm": 7.15625, "learning_rate": 4.8892483849227034e-05, "loss": 1.0145362854003905, "mean_token_accuracy": 0.7649327725172043, "num_tokens": 12321304.0, "step": 6200 }, { "entropy": 1.0469703406095505, "epoch": 0.11155521623927786, "grad_norm": 7.78125, "learning_rate": 4.8888251146892e-05, "loss": 1.01773042678833, "mean_token_accuracy": 0.7551460549235344, "num_tokens": 12339859.0, "step": 6210 }, { "entropy": 0.9684609696269035, "epoch": 0.11173485426864867, "grad_norm": 5.65625, "learning_rate": 4.888401055563396e-05, "loss": 1.0565549850463867, "mean_token_accuracy": 0.7555677369236946, "num_tokens": 12359048.0, "step": 6220 }, { "entropy": 1.124122017621994, "epoch": 0.11191449229801949, "grad_norm": 6.375, "learning_rate": 4.8879762076853314e-05, "loss": 1.1532334327697753, "mean_token_accuracy": 0.740015585720539, "num_tokens": 12378388.0, "step": 6230 }, { "entropy": 1.0747182056307794, "epoch": 0.11209413032739031, "grad_norm": 7.4375, "learning_rate": 4.8875505711953103e-05, "loss": 1.108290958404541, "mean_token_accuracy": 0.7411955341696739, "num_tokens": 12397541.0, "step": 6240 }, { "entropy": 0.938264898955822, "epoch": 0.11227376835676113, "grad_norm": 5.28125, "learning_rate": 4.887124146233896e-05, "loss": 0.9431843757629395, "mean_token_accuracy": 0.7783607006072998, "num_tokens": 12417377.0, "step": 6250 }, { "entropy": 1.001605676114559, "epoch": 0.11245340638613194, "grad_norm": 6.40625, "learning_rate": 4.886696932941913e-05, "loss": 1.0423752784729003, "mean_token_accuracy": 0.7528838887810707, "num_tokens": 12437693.0, "step": 6260 }, { "entropy": 0.9650053367018699, "epoch": 0.11263304441550276, "grad_norm": 5.84375, "learning_rate": 4.8862689314604434e-05, "loss": 0.965366268157959, "mean_token_accuracy": 0.7738505646586418, "num_tokens": 12458209.0, "step": 6270 }, { "entropy": 0.9712089881300926, "epoch": 0.11281268244487358, "grad_norm": 7.96875, "learning_rate": 4.885840141930834e-05, "loss": 1.0391764640808105, "mean_token_accuracy": 0.7517055526375771, "num_tokens": 12478289.0, "step": 6280 }, { "entropy": 1.081689990311861, "epoch": 0.1129923204742444, "grad_norm": 7.84375, "learning_rate": 4.885410564494688e-05, "loss": 1.1368453979492188, "mean_token_accuracy": 0.7460439398884773, "num_tokens": 12498084.0, "step": 6290 }, { "entropy": 1.1053149342536925, "epoch": 0.11317195850361522, "grad_norm": 7.71875, "learning_rate": 4.8849801992938706e-05, "loss": 1.134336280822754, "mean_token_accuracy": 0.7440494827926158, "num_tokens": 12518286.0, "step": 6300 }, { "entropy": 1.0616450533270836, "epoch": 0.11335159653298603, "grad_norm": 6.59375, "learning_rate": 4.884549046470507e-05, "loss": 1.0437630653381347, "mean_token_accuracy": 0.752113826572895, "num_tokens": 12539095.0, "step": 6310 }, { "entropy": 1.03160240650177, "epoch": 0.11353123456235685, "grad_norm": 8.0625, "learning_rate": 4.884117106166981e-05, "loss": 1.0980774879455566, "mean_token_accuracy": 0.7493119806051254, "num_tokens": 12558359.0, "step": 6320 }, { "entropy": 1.05936993137002, "epoch": 0.11371087259172767, "grad_norm": 6.34375, "learning_rate": 4.88368437852594e-05, "loss": 1.0880445480346679, "mean_token_accuracy": 0.7531413897871971, "num_tokens": 12578082.0, "step": 6330 }, { "entropy": 0.9684530325233937, "epoch": 0.11389051062109849, "grad_norm": 6.9375, "learning_rate": 4.8832508636902876e-05, "loss": 0.9865660667419434, "mean_token_accuracy": 0.7738498479127884, "num_tokens": 12598376.0, "step": 6340 }, { "entropy": 1.0118293084204197, "epoch": 0.1140701486504693, "grad_norm": 7.6875, "learning_rate": 4.88281656180319e-05, "loss": 1.0487909317016602, "mean_token_accuracy": 0.7557375371456146, "num_tokens": 12617492.0, "step": 6350 }, { "entropy": 0.9186167255043983, "epoch": 0.11424978667984012, "grad_norm": 6.625, "learning_rate": 4.882381473008071e-05, "loss": 0.9821917533874511, "mean_token_accuracy": 0.7730137690901756, "num_tokens": 12636274.0, "step": 6360 }, { "entropy": 1.042784681916237, "epoch": 0.11442942470921094, "grad_norm": 7.46875, "learning_rate": 4.881945597448617e-05, "loss": 1.0676585197448731, "mean_token_accuracy": 0.7516802608966827, "num_tokens": 12655437.0, "step": 6370 }, { "entropy": 1.065847682952881, "epoch": 0.11460906273858176, "grad_norm": 6.625, "learning_rate": 4.881508935268772e-05, "loss": 1.055802822113037, "mean_token_accuracy": 0.7571970328688622, "num_tokens": 12675843.0, "step": 6380 }, { "entropy": 1.0163489624857902, "epoch": 0.11478870076795257, "grad_norm": 6.90625, "learning_rate": 4.8810714866127396e-05, "loss": 1.0799942016601562, "mean_token_accuracy": 0.7535074308514595, "num_tokens": 12696092.0, "step": 6390 }, { "entropy": 1.010008205473423, "epoch": 0.11496833879732339, "grad_norm": 5.5, "learning_rate": 4.880633251624986e-05, "loss": 1.0491214752197267, "mean_token_accuracy": 0.7569492131471633, "num_tokens": 12715034.0, "step": 6400 }, { "entropy": 1.0110047802329063, "epoch": 0.11514797682669421, "grad_norm": 6.8125, "learning_rate": 4.880194230450233e-05, "loss": 1.0598729133605957, "mean_token_accuracy": 0.7513307005167007, "num_tokens": 12735784.0, "step": 6410 }, { "entropy": 1.0210563033819198, "epoch": 0.11532761485606503, "grad_norm": 7.375, "learning_rate": 4.879754423233467e-05, "loss": 1.0464460372924804, "mean_token_accuracy": 0.7693593099713325, "num_tokens": 12754660.0, "step": 6420 }, { "entropy": 1.105432777106762, "epoch": 0.11550725288543584, "grad_norm": 8.8125, "learning_rate": 4.879313830119928e-05, "loss": 1.0998011589050294, "mean_token_accuracy": 0.746526052057743, "num_tokens": 12774946.0, "step": 6430 }, { "entropy": 0.9488676428794861, "epoch": 0.11568689091480666, "grad_norm": 6.8125, "learning_rate": 4.878872451255121e-05, "loss": 0.9547931671142578, "mean_token_accuracy": 0.7704014152288436, "num_tokens": 12794403.0, "step": 6440 }, { "entropy": 0.9039615742862225, "epoch": 0.11586652894417748, "grad_norm": 7.78125, "learning_rate": 4.8784302867848076e-05, "loss": 0.9366701126098633, "mean_token_accuracy": 0.7851650446653367, "num_tokens": 12815134.0, "step": 6450 }, { "entropy": 0.9854362159967422, "epoch": 0.1160461669735483, "grad_norm": 6.875, "learning_rate": 4.877987336855009e-05, "loss": 1.0387304306030274, "mean_token_accuracy": 0.7558018639683723, "num_tokens": 12835190.0, "step": 6460 }, { "entropy": 1.1121864467859268, "epoch": 0.11622580500291912, "grad_norm": 6.0625, "learning_rate": 4.8775436016120066e-05, "loss": 1.2135540008544923, "mean_token_accuracy": 0.7309125058352948, "num_tokens": 12854620.0, "step": 6470 }, { "entropy": 1.0853245466947556, "epoch": 0.11640544303228993, "grad_norm": 8.5625, "learning_rate": 4.877099081202341e-05, "loss": 1.0786243438720704, "mean_token_accuracy": 0.7556031823158265, "num_tokens": 12874317.0, "step": 6480 }, { "entropy": 0.9458428382873535, "epoch": 0.11658508106166075, "grad_norm": 5.21875, "learning_rate": 4.876653775772811e-05, "loss": 1.0157344818115235, "mean_token_accuracy": 0.7615962594747543, "num_tokens": 12894607.0, "step": 6490 }, { "entropy": 1.124277839064598, "epoch": 0.11676471909103157, "grad_norm": 6.4375, "learning_rate": 4.876207685470476e-05, "loss": 1.1769062995910644, "mean_token_accuracy": 0.7311655737459659, "num_tokens": 12915612.0, "step": 6500 }, { "entropy": 1.039088200777769, "epoch": 0.1169443571204024, "grad_norm": 7.53125, "learning_rate": 4.875760810442654e-05, "loss": 1.036177635192871, "mean_token_accuracy": 0.7529889523983002, "num_tokens": 12934003.0, "step": 6510 }, { "entropy": 0.9423630580306053, "epoch": 0.1171239951497732, "grad_norm": 7.78125, "learning_rate": 4.875313150836923e-05, "loss": 0.9441682815551757, "mean_token_accuracy": 0.7680635437369346, "num_tokens": 12953275.0, "step": 6520 }, { "entropy": 1.1086465388536453, "epoch": 0.11730363317914402, "grad_norm": 7.15625, "learning_rate": 4.874864706801119e-05, "loss": 1.1593046188354492, "mean_token_accuracy": 0.7296991139650345, "num_tokens": 12971672.0, "step": 6530 }, { "entropy": 1.0537022650241852, "epoch": 0.11748327120851484, "grad_norm": 7.5625, "learning_rate": 4.874415478483336e-05, "loss": 1.1074079513549804, "mean_token_accuracy": 0.7402363657951355, "num_tokens": 12992709.0, "step": 6540 }, { "entropy": 0.9904323205351829, "epoch": 0.11766290923788567, "grad_norm": 9.0625, "learning_rate": 4.873965466031931e-05, "loss": 1.0011497497558595, "mean_token_accuracy": 0.7709414944052696, "num_tokens": 13012268.0, "step": 6550 }, { "entropy": 1.0350611910223961, "epoch": 0.11784254726725647, "grad_norm": 8.25, "learning_rate": 4.8735146695955154e-05, "loss": 1.0971911430358887, "mean_token_accuracy": 0.7489110670983792, "num_tokens": 13032124.0, "step": 6560 }, { "entropy": 0.9896834671497345, "epoch": 0.1180221852966273, "grad_norm": 6.53125, "learning_rate": 4.873063089322962e-05, "loss": 0.9778719902038574, "mean_token_accuracy": 0.7633831724524498, "num_tokens": 13051789.0, "step": 6570 }, { "entropy": 1.069327637553215, "epoch": 0.11820182332599811, "grad_norm": 6.28125, "learning_rate": 4.872610725363402e-05, "loss": 1.0697262763977051, "mean_token_accuracy": 0.7499631449580193, "num_tokens": 13071140.0, "step": 6580 }, { "entropy": 0.9656549043953419, "epoch": 0.11838146135536894, "grad_norm": 6.84375, "learning_rate": 4.872157577866225e-05, "loss": 1.0009926795959472, "mean_token_accuracy": 0.7680483996868134, "num_tokens": 13091309.0, "step": 6590 }, { "entropy": 0.9845070227980613, "epoch": 0.11856109938473974, "grad_norm": 7.28125, "learning_rate": 4.871703646981081e-05, "loss": 1.0317476272583008, "mean_token_accuracy": 0.7533792406320572, "num_tokens": 13111371.0, "step": 6600 }, { "entropy": 1.0421454735100268, "epoch": 0.11874073741411056, "grad_norm": 6.3125, "learning_rate": 4.871248932857876e-05, "loss": 1.0890267372131348, "mean_token_accuracy": 0.7409923642873764, "num_tokens": 13130657.0, "step": 6610 }, { "entropy": 0.9024669304490089, "epoch": 0.11892037544348139, "grad_norm": 7.09375, "learning_rate": 4.870793435646776e-05, "loss": 0.9276371955871582, "mean_token_accuracy": 0.7823088929057121, "num_tokens": 13149764.0, "step": 6620 }, { "entropy": 0.9360634863376618, "epoch": 0.1191000134728522, "grad_norm": 5.8125, "learning_rate": 4.870337155498207e-05, "loss": 0.9467898368835449, "mean_token_accuracy": 0.7801152005791664, "num_tokens": 13169107.0, "step": 6630 }, { "entropy": 1.02987220287323, "epoch": 0.11927965150222303, "grad_norm": 6.375, "learning_rate": 4.8698800925628506e-05, "loss": 1.084320068359375, "mean_token_accuracy": 0.7482532218098641, "num_tokens": 13188581.0, "step": 6640 }, { "entropy": 1.029680258780718, "epoch": 0.11945928953159383, "grad_norm": 6.0, "learning_rate": 4.8694222469916504e-05, "loss": 1.0989627838134766, "mean_token_accuracy": 0.7460219338536263, "num_tokens": 13208346.0, "step": 6650 }, { "entropy": 1.0734458602964878, "epoch": 0.11963892756096466, "grad_norm": 8.1875, "learning_rate": 4.8689636189358045e-05, "loss": 1.0589815139770509, "mean_token_accuracy": 0.7575636148452759, "num_tokens": 13227406.0, "step": 6660 }, { "entropy": 0.9638423591852188, "epoch": 0.11981856559033548, "grad_norm": 5.6875, "learning_rate": 4.868504208546774e-05, "loss": 0.9934786796569824, "mean_token_accuracy": 0.7669479727745057, "num_tokens": 13247967.0, "step": 6670 }, { "entropy": 1.0991191014647483, "epoch": 0.1199982036197063, "grad_norm": 6.34375, "learning_rate": 4.868044015976273e-05, "loss": 1.1577638626098632, "mean_token_accuracy": 0.7318303808569908, "num_tokens": 13268459.0, "step": 6680 }, { "entropy": 0.9101608723402024, "epoch": 0.1201778416490771, "grad_norm": 7.40625, "learning_rate": 4.867583041376278e-05, "loss": 0.9195585250854492, "mean_token_accuracy": 0.7837798535823822, "num_tokens": 13288414.0, "step": 6690 }, { "entropy": 1.065487912297249, "epoch": 0.12035747967844793, "grad_norm": 6.1875, "learning_rate": 4.8671212848990246e-05, "loss": 1.1378360748291017, "mean_token_accuracy": 0.7402533307671547, "num_tokens": 13309189.0, "step": 6700 }, { "entropy": 1.0643005684018134, "epoch": 0.12053711770781875, "grad_norm": 7.96875, "learning_rate": 4.866658746697001e-05, "loss": 1.097043800354004, "mean_token_accuracy": 0.7491765782237053, "num_tokens": 13329882.0, "step": 6710 }, { "entropy": 0.9805642001330852, "epoch": 0.12071675573718957, "grad_norm": 7.34375, "learning_rate": 4.8661954269229595e-05, "loss": 0.9970211029052735, "mean_token_accuracy": 0.7660590589046479, "num_tokens": 13349183.0, "step": 6720 }, { "entropy": 0.9814873158931732, "epoch": 0.12089639376656038, "grad_norm": 6.78125, "learning_rate": 4.865731325729908e-05, "loss": 1.0121488571166992, "mean_token_accuracy": 0.7641021609306335, "num_tokens": 13368802.0, "step": 6730 }, { "entropy": 0.9894362859427929, "epoch": 0.1210760317959312, "grad_norm": 6.5625, "learning_rate": 4.8652664432711115e-05, "loss": 1.009317684173584, "mean_token_accuracy": 0.7588550344109535, "num_tokens": 13387113.0, "step": 6740 }, { "entropy": 1.0440159760415555, "epoch": 0.12125566982530202, "grad_norm": 6.09375, "learning_rate": 4.864800779700095e-05, "loss": 1.0911325454711913, "mean_token_accuracy": 0.7527034327387809, "num_tokens": 13406835.0, "step": 6750 }, { "entropy": 1.0030406430363654, "epoch": 0.12143530785467284, "grad_norm": 8.3125, "learning_rate": 4.86433433517064e-05, "loss": 0.9971686363220215, "mean_token_accuracy": 0.7668825313448906, "num_tokens": 13426869.0, "step": 6760 }, { "entropy": 0.9166123487055302, "epoch": 0.12161494588404365, "grad_norm": 7.03125, "learning_rate": 4.863867109836787e-05, "loss": 0.9854426383972168, "mean_token_accuracy": 0.7727517142891884, "num_tokens": 13446503.0, "step": 6770 }, { "entropy": 0.9390500813722611, "epoch": 0.12179458391341447, "grad_norm": 6.25, "learning_rate": 4.863399103852833e-05, "loss": 0.9305182456970215, "mean_token_accuracy": 0.7743746340274811, "num_tokens": 13465433.0, "step": 6780 }, { "entropy": 1.1078578799962997, "epoch": 0.12197422194278529, "grad_norm": 7.4375, "learning_rate": 4.862930317373334e-05, "loss": 1.1838531494140625, "mean_token_accuracy": 0.7291121244430542, "num_tokens": 13484665.0, "step": 6790 }, { "entropy": 0.9251707255840301, "epoch": 0.12215385997215611, "grad_norm": 6.4375, "learning_rate": 4.8624607505531036e-05, "loss": 0.9616168975830078, "mean_token_accuracy": 0.7723833799362183, "num_tokens": 13504329.0, "step": 6800 }, { "entropy": 0.9434578157961369, "epoch": 0.12233349800152692, "grad_norm": 5.9375, "learning_rate": 4.861990403547213e-05, "loss": 0.9922041893005371, "mean_token_accuracy": 0.7682307422161102, "num_tokens": 13525149.0, "step": 6810 }, { "entropy": 1.00031920671463, "epoch": 0.12251313603089774, "grad_norm": 7.1875, "learning_rate": 4.86151927651099e-05, "loss": 1.013861083984375, "mean_token_accuracy": 0.758407998085022, "num_tokens": 13544451.0, "step": 6820 }, { "entropy": 1.1202403873205184, "epoch": 0.12269277406026856, "grad_norm": 4.8125, "learning_rate": 4.8610473696000214e-05, "loss": 1.1820843696594239, "mean_token_accuracy": 0.7329499587416649, "num_tokens": 13564143.0, "step": 6830 }, { "entropy": 1.0417736902832986, "epoch": 0.12287241208963938, "grad_norm": 5.71875, "learning_rate": 4.8605746829701515e-05, "loss": 0.9679837226867676, "mean_token_accuracy": 0.7726904019713402, "num_tokens": 13584819.0, "step": 6840 }, { "entropy": 1.0067878305912017, "epoch": 0.1230520501190102, "grad_norm": 6.40625, "learning_rate": 4.8601012167774815e-05, "loss": 1.0070413589477538, "mean_token_accuracy": 0.7584892511367798, "num_tokens": 13603773.0, "step": 6850 }, { "entropy": 0.9952953092753887, "epoch": 0.12323168814838101, "grad_norm": 6.25, "learning_rate": 4.8596269711783696e-05, "loss": 1.1002662658691407, "mean_token_accuracy": 0.7561241887509823, "num_tokens": 13623456.0, "step": 6860 }, { "entropy": 1.003292979300022, "epoch": 0.12341132617775183, "grad_norm": 7.1875, "learning_rate": 4.8591519463294336e-05, "loss": 0.9929161071777344, "mean_token_accuracy": 0.7706490695476532, "num_tokens": 13643957.0, "step": 6870 }, { "entropy": 1.0403919465839864, "epoch": 0.12359096420712265, "grad_norm": 10.0, "learning_rate": 4.8586761423875447e-05, "loss": 1.1246644020080567, "mean_token_accuracy": 0.742063120007515, "num_tokens": 13663613.0, "step": 6880 }, { "entropy": 0.9565848641097545, "epoch": 0.12377060223649347, "grad_norm": 5.78125, "learning_rate": 4.858199559509835e-05, "loss": 0.9863670349121094, "mean_token_accuracy": 0.7635638147592545, "num_tokens": 13682920.0, "step": 6890 }, { "entropy": 0.9593957096338273, "epoch": 0.12395024026586428, "grad_norm": 7.25, "learning_rate": 4.8577221978536924e-05, "loss": 0.9902218818664551, "mean_token_accuracy": 0.7598926559090614, "num_tokens": 13701810.0, "step": 6900 }, { "entropy": 0.9058008939027786, "epoch": 0.1241298782952351, "grad_norm": 6.125, "learning_rate": 4.857244057576762e-05, "loss": 0.924420166015625, "mean_token_accuracy": 0.7777085155248642, "num_tokens": 13720738.0, "step": 6910 }, { "entropy": 0.9216203063726425, "epoch": 0.12430951632460592, "grad_norm": 6.5, "learning_rate": 4.856765138836947e-05, "loss": 0.9765249252319336, "mean_token_accuracy": 0.7725277796387673, "num_tokens": 13741224.0, "step": 6920 }, { "entropy": 0.9464600130915641, "epoch": 0.12448915435397674, "grad_norm": 5.4375, "learning_rate": 4.856285441792407e-05, "loss": 0.9995107650756836, "mean_token_accuracy": 0.7607283592224121, "num_tokens": 13760311.0, "step": 6930 }, { "entropy": 1.020284004509449, "epoch": 0.12466879238334755, "grad_norm": 4.40625, "learning_rate": 4.855804966601556e-05, "loss": 1.0106845855712892, "mean_token_accuracy": 0.7653924763202667, "num_tokens": 13780215.0, "step": 6940 }, { "entropy": 1.0780873231589794, "epoch": 0.12484843041271837, "grad_norm": 6.125, "learning_rate": 4.85532371342307e-05, "loss": 1.1189627647399902, "mean_token_accuracy": 0.7504855573177338, "num_tokens": 13800135.0, "step": 6950 }, { "entropy": 0.9893208250403405, "epoch": 0.1250280684420892, "grad_norm": 5.75, "learning_rate": 4.854841682415879e-05, "loss": 0.9784346580505371, "mean_token_accuracy": 0.7669732868671417, "num_tokens": 13820300.0, "step": 6960 }, { "entropy": 0.9498419493436814, "epoch": 0.12520770647146, "grad_norm": 5.8125, "learning_rate": 4.8543588737391696e-05, "loss": 0.9837165832519531, "mean_token_accuracy": 0.7657981343567372, "num_tokens": 13839598.0, "step": 6970 }, { "entropy": 0.8783250324428081, "epoch": 0.12538734450083083, "grad_norm": 5.65625, "learning_rate": 4.853875287552386e-05, "loss": 0.9952584266662597, "mean_token_accuracy": 0.774166339635849, "num_tokens": 13859574.0, "step": 6980 }, { "entropy": 1.0732742726802826, "epoch": 0.12556698253020165, "grad_norm": 8.5625, "learning_rate": 4.85339092401523e-05, "loss": 1.19972505569458, "mean_token_accuracy": 0.7316268265247345, "num_tokens": 13879974.0, "step": 6990 }, { "epoch": 0.12574662055957248, "eval_entropy": 1.0539333384037017, "eval_loss": 1.0188111066818237, "eval_mean_token_accuracy": 0.7641782150268555, "eval_num_tokens": 13900457.0, "eval_runtime": 40.4836, "eval_samples_per_second": 49.403, "eval_steps_per_second": 6.175, "step": 7000 }, { "entropy": 1.0704687289893626, "epoch": 0.12592625858894327, "grad_norm": 7.84375, "learning_rate": 4.8524198655298833e-05, "loss": 1.0548014640808105, "mean_token_accuracy": 0.7501308396458626, "num_tokens": 13919660.0, "step": 7010 }, { "entropy": 1.0547692447900772, "epoch": 0.1261058966183141, "grad_norm": 8.3125, "learning_rate": 4.8519331709023795e-05, "loss": 1.081246280670166, "mean_token_accuracy": 0.7473935708403587, "num_tokens": 13937628.0, "step": 7020 }, { "entropy": 0.9390965379774571, "epoch": 0.1262855346476849, "grad_norm": 8.4375, "learning_rate": 4.8514456995658726e-05, "loss": 0.9572797775268554, "mean_token_accuracy": 0.7749572098255157, "num_tokens": 13956825.0, "step": 7030 }, { "entropy": 0.9652213841676712, "epoch": 0.12646517267705573, "grad_norm": 7.28125, "learning_rate": 4.850957451681346e-05, "loss": 0.9720582962036133, "mean_token_accuracy": 0.7662696912884712, "num_tokens": 13976916.0, "step": 7040 }, { "entropy": 0.8637428626418113, "epoch": 0.12664481070642655, "grad_norm": 6.03125, "learning_rate": 4.850468427410041e-05, "loss": 0.9257391929626465, "mean_token_accuracy": 0.7808357328176498, "num_tokens": 13995934.0, "step": 7050 }, { "entropy": 0.9526255652308464, "epoch": 0.12682444873579737, "grad_norm": 7.40625, "learning_rate": 4.849978626913454e-05, "loss": 0.9906145095825195, "mean_token_accuracy": 0.7689179390668869, "num_tokens": 14015304.0, "step": 7060 }, { "entropy": 0.9305871874094009, "epoch": 0.1270040867651682, "grad_norm": 6.71875, "learning_rate": 4.849488050353337e-05, "loss": 0.9351966857910157, "mean_token_accuracy": 0.7824089989066124, "num_tokens": 14034097.0, "step": 7070 }, { "entropy": 0.9513274013996125, "epoch": 0.12718372479453902, "grad_norm": 4.65625, "learning_rate": 4.848996697891701e-05, "loss": 1.0010278701782227, "mean_token_accuracy": 0.7751732021570206, "num_tokens": 14054396.0, "step": 7080 }, { "entropy": 1.0039676330983638, "epoch": 0.1273633628239098, "grad_norm": 6.40625, "learning_rate": 4.848504569690812e-05, "loss": 1.0376245498657226, "mean_token_accuracy": 0.7558190628886223, "num_tokens": 14073554.0, "step": 7090 }, { "entropy": 1.0095471292734146, "epoch": 0.12754300085328063, "grad_norm": 7.5, "learning_rate": 4.848011665913189e-05, "loss": 1.0702735900878906, "mean_token_accuracy": 0.7530047968029976, "num_tokens": 14093419.0, "step": 7100 }, { "entropy": 0.9995038047432899, "epoch": 0.12772263888265145, "grad_norm": 6.0, "learning_rate": 4.8475179867216125e-05, "loss": 1.063162136077881, "mean_token_accuracy": 0.7515974521636963, "num_tokens": 14113055.0, "step": 7110 }, { "entropy": 1.0539027094841003, "epoch": 0.12790227691202227, "grad_norm": 6.0, "learning_rate": 4.8470235322791156e-05, "loss": 1.0371717453002929, "mean_token_accuracy": 0.7615969255566597, "num_tokens": 14132836.0, "step": 7120 }, { "entropy": 0.9602646186947823, "epoch": 0.1280819149413931, "grad_norm": 6.03125, "learning_rate": 4.8465283027489884e-05, "loss": 0.9974834442138671, "mean_token_accuracy": 0.7661203786730766, "num_tokens": 14152136.0, "step": 7130 }, { "entropy": 1.047901628166437, "epoch": 0.12826155297076391, "grad_norm": 7.6875, "learning_rate": 4.846032298294777e-05, "loss": 1.0882431030273438, "mean_token_accuracy": 0.7494831725955009, "num_tokens": 14171540.0, "step": 7140 }, { "entropy": 1.0146586880087853, "epoch": 0.12844119100013474, "grad_norm": 6.25, "learning_rate": 4.845535519080283e-05, "loss": 1.0395357131958007, "mean_token_accuracy": 0.753221869468689, "num_tokens": 14190585.0, "step": 7150 }, { "entropy": 0.9759780965745449, "epoch": 0.12862082902950556, "grad_norm": 6.375, "learning_rate": 4.8450379652695646e-05, "loss": 0.9921046257019043, "mean_token_accuracy": 0.7688451960682869, "num_tokens": 14209903.0, "step": 7160 }, { "entropy": 0.9458831459283829, "epoch": 0.12880046705887638, "grad_norm": 8.0625, "learning_rate": 4.844539637026935e-05, "loss": 1.0311005592346192, "mean_token_accuracy": 0.768575819581747, "num_tokens": 14229490.0, "step": 7170 }, { "entropy": 1.0068778857588767, "epoch": 0.12898010508824717, "grad_norm": 7.84375, "learning_rate": 4.844040534516964e-05, "loss": 1.0468737602233886, "mean_token_accuracy": 0.7575206249952317, "num_tokens": 14248452.0, "step": 7180 }, { "entropy": 1.0791752129793166, "epoch": 0.129159743117618, "grad_norm": 7.125, "learning_rate": 4.8435406579044764e-05, "loss": 1.075886344909668, "mean_token_accuracy": 0.7474431961774826, "num_tokens": 14268358.0, "step": 7190 }, { "entropy": 1.0529504910111427, "epoch": 0.1293393811469888, "grad_norm": 5.625, "learning_rate": 4.8430400073545516e-05, "loss": 1.0952861785888672, "mean_token_accuracy": 0.7439638927578927, "num_tokens": 14288465.0, "step": 7200 }, { "entropy": 1.0603987380862236, "epoch": 0.12951901917635963, "grad_norm": 5.40625, "learning_rate": 4.8425385830325274e-05, "loss": 1.056072998046875, "mean_token_accuracy": 0.7510070040822029, "num_tokens": 14308829.0, "step": 7210 }, { "entropy": 1.0066994294524192, "epoch": 0.12969865720573046, "grad_norm": 5.0, "learning_rate": 4.8420363851039955e-05, "loss": 1.0044511795043944, "mean_token_accuracy": 0.7635873422026634, "num_tokens": 14329682.0, "step": 7220 }, { "entropy": 1.0032708846032619, "epoch": 0.12987829523510128, "grad_norm": 7.15625, "learning_rate": 4.841533413734803e-05, "loss": 1.0734521865844726, "mean_token_accuracy": 0.7625238470733166, "num_tokens": 14348288.0, "step": 7230 }, { "entropy": 1.038369619846344, "epoch": 0.1300579332644721, "grad_norm": 5.9375, "learning_rate": 4.841029669091052e-05, "loss": 1.0857677459716797, "mean_token_accuracy": 0.7477707870304584, "num_tokens": 14368279.0, "step": 7240 }, { "entropy": 1.0475360125303268, "epoch": 0.13023757129384292, "grad_norm": 6.3125, "learning_rate": 4.8405251513391e-05, "loss": 1.1035821914672852, "mean_token_accuracy": 0.7405801579356194, "num_tokens": 14387685.0, "step": 7250 }, { "entropy": 1.0898923024535179, "epoch": 0.1304172093232137, "grad_norm": 5.0625, "learning_rate": 4.8400198606455626e-05, "loss": 1.085732364654541, "mean_token_accuracy": 0.7459083139896393, "num_tokens": 14407946.0, "step": 7260 }, { "entropy": 1.038026401400566, "epoch": 0.13059684735258453, "grad_norm": 4.75, "learning_rate": 4.839513797177307e-05, "loss": 1.048984909057617, "mean_token_accuracy": 0.7518763616681099, "num_tokens": 14427812.0, "step": 7270 }, { "entropy": 1.0761775322258473, "epoch": 0.13077648538195535, "grad_norm": 5.90625, "learning_rate": 4.839006961101457e-05, "loss": 1.0780851364135742, "mean_token_accuracy": 0.7360206946730614, "num_tokens": 14446940.0, "step": 7280 }, { "entropy": 0.9662975825369358, "epoch": 0.13095612341132618, "grad_norm": 8.3125, "learning_rate": 4.83849935258539e-05, "loss": 1.0302798271179199, "mean_token_accuracy": 0.764030534029007, "num_tokens": 14466639.0, "step": 7290 }, { "entropy": 1.0169863127171994, "epoch": 0.131135761440697, "grad_norm": 6.09375, "learning_rate": 4.837990971796744e-05, "loss": 1.031626319885254, "mean_token_accuracy": 0.7589772090315818, "num_tokens": 14486243.0, "step": 7300 }, { "entropy": 0.9524190604686738, "epoch": 0.13131539947006782, "grad_norm": 7.21875, "learning_rate": 4.837481818903404e-05, "loss": 1.017763328552246, "mean_token_accuracy": 0.7593987986445427, "num_tokens": 14506532.0, "step": 7310 }, { "entropy": 1.0019267067313193, "epoch": 0.13149503749943864, "grad_norm": 6.46875, "learning_rate": 4.8369718940735176e-05, "loss": 1.0181355476379395, "mean_token_accuracy": 0.7598321154713631, "num_tokens": 14527100.0, "step": 7320 }, { "entropy": 0.9895594835281372, "epoch": 0.13167467552880946, "grad_norm": 7.125, "learning_rate": 4.836461197475481e-05, "loss": 0.9963333129882812, "mean_token_accuracy": 0.7660549744963646, "num_tokens": 14546685.0, "step": 7330 }, { "entropy": 0.876677007228136, "epoch": 0.13185431355818028, "grad_norm": 5.875, "learning_rate": 4.8359497292779495e-05, "loss": 0.9290422439575196, "mean_token_accuracy": 0.7822725132107735, "num_tokens": 14566923.0, "step": 7340 }, { "entropy": 0.8709055915474891, "epoch": 0.13203395158755107, "grad_norm": 6.5, "learning_rate": 4.835437489649831e-05, "loss": 0.8853213310241699, "mean_token_accuracy": 0.7778545469045639, "num_tokens": 14586269.0, "step": 7350 }, { "entropy": 0.922557246685028, "epoch": 0.1322135896169219, "grad_norm": 7.03125, "learning_rate": 4.83492447876029e-05, "loss": 1.0160842895507813, "mean_token_accuracy": 0.769161856174469, "num_tokens": 14606334.0, "step": 7360 }, { "entropy": 1.0463509738445282, "epoch": 0.13239322764629272, "grad_norm": 4.8125, "learning_rate": 4.834410696778744e-05, "loss": 1.0613508224487305, "mean_token_accuracy": 0.7502421051263809, "num_tokens": 14626897.0, "step": 7370 }, { "entropy": 0.9834346681833267, "epoch": 0.13257286567566354, "grad_norm": 7.15625, "learning_rate": 4.833896143874865e-05, "loss": 0.9475133895874024, "mean_token_accuracy": 0.7763537585735321, "num_tokens": 14647276.0, "step": 7380 }, { "entropy": 0.956779134273529, "epoch": 0.13275250370503436, "grad_norm": 7.3125, "learning_rate": 4.8333808202185826e-05, "loss": 1.0467992782592774, "mean_token_accuracy": 0.7568529158830642, "num_tokens": 14666665.0, "step": 7390 }, { "entropy": 0.9405389867722989, "epoch": 0.13293214173440518, "grad_norm": 6.59375, "learning_rate": 4.8328647259800765e-05, "loss": 0.9760592460632325, "mean_token_accuracy": 0.7664414137601853, "num_tokens": 14686963.0, "step": 7400 }, { "entropy": 0.9767249166965485, "epoch": 0.133111779763776, "grad_norm": 6.21875, "learning_rate": 4.832347861329784e-05, "loss": 0.9937135696411132, "mean_token_accuracy": 0.7680794999003411, "num_tokens": 14705647.0, "step": 7410 }, { "entropy": 0.8972371503710747, "epoch": 0.13329141779314682, "grad_norm": 5.8125, "learning_rate": 4.831830226438396e-05, "loss": 0.9153555870056153, "mean_token_accuracy": 0.7840756922960281, "num_tokens": 14725781.0, "step": 7420 }, { "entropy": 1.0124459140002728, "epoch": 0.13347105582251761, "grad_norm": 5.65625, "learning_rate": 4.8313118214768584e-05, "loss": 1.027753734588623, "mean_token_accuracy": 0.7593206621706485, "num_tokens": 14745758.0, "step": 7430 }, { "entropy": 1.0883337348699569, "epoch": 0.13365069385188844, "grad_norm": 7.09375, "learning_rate": 4.830792646616369e-05, "loss": 1.1550491333007813, "mean_token_accuracy": 0.7440998949110508, "num_tokens": 14766717.0, "step": 7440 }, { "entropy": 0.9820266768336297, "epoch": 0.13383033188125926, "grad_norm": 10.5625, "learning_rate": 4.8302727020283825e-05, "loss": 1.018569564819336, "mean_token_accuracy": 0.7588348686695099, "num_tokens": 14786376.0, "step": 7450 }, { "entropy": 0.9752943694591523, "epoch": 0.13400996991063008, "grad_norm": 8.4375, "learning_rate": 4.8297519878846077e-05, "loss": 1.057596206665039, "mean_token_accuracy": 0.7617123052477837, "num_tokens": 14806150.0, "step": 7460 }, { "entropy": 0.9267949141561985, "epoch": 0.1341896079400009, "grad_norm": 6.53125, "learning_rate": 4.829230504357005e-05, "loss": 0.93712158203125, "mean_token_accuracy": 0.7776257634162903, "num_tokens": 14825824.0, "step": 7470 }, { "entropy": 1.0339096680283546, "epoch": 0.13436924596937172, "grad_norm": 5.96875, "learning_rate": 4.828708251617792e-05, "loss": 1.0638809204101562, "mean_token_accuracy": 0.7497575655579567, "num_tokens": 14846877.0, "step": 7480 }, { "entropy": 0.9317882686853409, "epoch": 0.13454888399874254, "grad_norm": 5.5625, "learning_rate": 4.8281852298394384e-05, "loss": 0.9406015396118164, "mean_token_accuracy": 0.7742516383528709, "num_tokens": 14866642.0, "step": 7490 }, { "entropy": 0.9686097353696823, "epoch": 0.13472852202811336, "grad_norm": 5.125, "learning_rate": 4.827661439194667e-05, "loss": 0.9904957771301269, "mean_token_accuracy": 0.7631622701883316, "num_tokens": 14886886.0, "step": 7500 }, { "entropy": 0.9410270944237709, "epoch": 0.13490816005748418, "grad_norm": 5.96875, "learning_rate": 4.827136879856459e-05, "loss": 0.9413405418395996, "mean_token_accuracy": 0.776588824391365, "num_tokens": 14905655.0, "step": 7510 }, { "entropy": 0.9666697688400745, "epoch": 0.13508779808685498, "grad_norm": 5.46875, "learning_rate": 4.826611551998044e-05, "loss": 1.0359756469726562, "mean_token_accuracy": 0.757803750783205, "num_tokens": 14926295.0, "step": 7520 }, { "entropy": 1.0256551466882229, "epoch": 0.1352674361162258, "grad_norm": 6.6875, "learning_rate": 4.8260854557929074e-05, "loss": 1.045433807373047, "mean_token_accuracy": 0.7525411635637284, "num_tokens": 14948090.0, "step": 7530 }, { "entropy": 0.9966421768069267, "epoch": 0.13544707414559662, "grad_norm": 5.75, "learning_rate": 4.8255585914147906e-05, "loss": 1.0045899391174316, "mean_token_accuracy": 0.7595632210373878, "num_tokens": 14968267.0, "step": 7540 }, { "entropy": 0.947544538974762, "epoch": 0.13562671217496744, "grad_norm": 6.21875, "learning_rate": 4.8250309590376854e-05, "loss": 0.9799577713012695, "mean_token_accuracy": 0.7670654103159904, "num_tokens": 14987214.0, "step": 7550 }, { "entropy": 1.0466882660984993, "epoch": 0.13580635020433826, "grad_norm": 6.03125, "learning_rate": 4.824502558835838e-05, "loss": 1.0922574996948242, "mean_token_accuracy": 0.7481233045458794, "num_tokens": 15006329.0, "step": 7560 }, { "entropy": 1.0878894224762916, "epoch": 0.13598598823370908, "grad_norm": 7.71875, "learning_rate": 4.8239733909837515e-05, "loss": 1.1031211853027343, "mean_token_accuracy": 0.7472087875008583, "num_tokens": 15027147.0, "step": 7570 }, { "entropy": 0.9644355952739716, "epoch": 0.1361656262630799, "grad_norm": 7.40625, "learning_rate": 4.823443455656177e-05, "loss": 1.001220989227295, "mean_token_accuracy": 0.7750869542360306, "num_tokens": 15047355.0, "step": 7580 }, { "entropy": 0.9090218998491764, "epoch": 0.13634526429245072, "grad_norm": 6.0625, "learning_rate": 4.8229127530281225e-05, "loss": 0.9393827438354492, "mean_token_accuracy": 0.7823689952492714, "num_tokens": 15066942.0, "step": 7590 }, { "entropy": 0.9752462819218636, "epoch": 0.13652490232182152, "grad_norm": 7.21875, "learning_rate": 4.822381283274849e-05, "loss": 1.00120849609375, "mean_token_accuracy": 0.7599927857518196, "num_tokens": 15086528.0, "step": 7600 }, { "entropy": 0.9841432318091392, "epoch": 0.13670454035119234, "grad_norm": 7.21875, "learning_rate": 4.8218490465718716e-05, "loss": 1.0175788879394532, "mean_token_accuracy": 0.7616926595568657, "num_tokens": 15106086.0, "step": 7610 }, { "entropy": 0.9625697776675224, "epoch": 0.13688417838056316, "grad_norm": 5.65625, "learning_rate": 4.8213160430949566e-05, "loss": 1.055706787109375, "mean_token_accuracy": 0.7496672600507737, "num_tokens": 15124972.0, "step": 7620 }, { "entropy": 1.0013868123292924, "epoch": 0.13706381640993398, "grad_norm": 6.5, "learning_rate": 4.8207822730201235e-05, "loss": 1.022496223449707, "mean_token_accuracy": 0.7650181606411934, "num_tokens": 15143851.0, "step": 7630 }, { "entropy": 1.1403584860265255, "epoch": 0.1372434544393048, "grad_norm": 7.25, "learning_rate": 4.820247736523648e-05, "loss": 1.117336368560791, "mean_token_accuracy": 0.7482697673141956, "num_tokens": 15164906.0, "step": 7640 }, { "entropy": 1.0574091345071792, "epoch": 0.13742309246867562, "grad_norm": 6.34375, "learning_rate": 4.819712433782056e-05, "loss": 1.0826851844787597, "mean_token_accuracy": 0.7504638671875, "num_tokens": 15184700.0, "step": 7650 }, { "entropy": 0.9792430564761162, "epoch": 0.13760273049804644, "grad_norm": 5.5625, "learning_rate": 4.819176364972127e-05, "loss": 0.9904280662536621, "mean_token_accuracy": 0.7649105042219162, "num_tokens": 15203812.0, "step": 7660 }, { "entropy": 0.9239024288952351, "epoch": 0.13778236852741726, "grad_norm": 5.65625, "learning_rate": 4.8186395302708945e-05, "loss": 0.9592381477355957, "mean_token_accuracy": 0.7689514562487603, "num_tokens": 15223923.0, "step": 7670 }, { "entropy": 0.9036650270223617, "epoch": 0.13796200655678806, "grad_norm": 5.90625, "learning_rate": 4.8181019298556444e-05, "loss": 0.9777517318725586, "mean_token_accuracy": 0.7790706425905227, "num_tokens": 15243500.0, "step": 7680 }, { "entropy": 1.0522332705557347, "epoch": 0.13814164458615888, "grad_norm": 7.28125, "learning_rate": 4.817563563903915e-05, "loss": 1.0460851669311524, "mean_token_accuracy": 0.7607108160853386, "num_tokens": 15262344.0, "step": 7690 }, { "entropy": 1.015552794188261, "epoch": 0.1383212826155297, "grad_norm": 6.03125, "learning_rate": 4.817024432593497e-05, "loss": 1.0146279335021973, "mean_token_accuracy": 0.7699651852250099, "num_tokens": 15281626.0, "step": 7700 }, { "entropy": 1.0855581656098365, "epoch": 0.13850092064490052, "grad_norm": 8.8125, "learning_rate": 4.816484536102437e-05, "loss": 1.1384079933166504, "mean_token_accuracy": 0.7484158635139465, "num_tokens": 15301492.0, "step": 7710 }, { "entropy": 0.9143221013247966, "epoch": 0.13868055867427134, "grad_norm": 6.5, "learning_rate": 4.815943874609029e-05, "loss": 0.9617671012878418, "mean_token_accuracy": 0.7745268329977989, "num_tokens": 15321187.0, "step": 7720 }, { "entropy": 0.9544545084238052, "epoch": 0.13886019670364216, "grad_norm": 7.125, "learning_rate": 4.815402448291825e-05, "loss": 0.97393798828125, "mean_token_accuracy": 0.7658943727612495, "num_tokens": 15339714.0, "step": 7730 }, { "entropy": 1.0051582425832748, "epoch": 0.13903983473301298, "grad_norm": 7.5625, "learning_rate": 4.814860257329625e-05, "loss": 1.000349998474121, "mean_token_accuracy": 0.7609384104609489, "num_tokens": 15358571.0, "step": 7740 }, { "entropy": 0.9305440656840801, "epoch": 0.1392194727623838, "grad_norm": 7.65625, "learning_rate": 4.814317301901486e-05, "loss": 0.958104133605957, "mean_token_accuracy": 0.770952707529068, "num_tokens": 15378411.0, "step": 7750 }, { "entropy": 0.9795505315065384, "epoch": 0.13939911079175463, "grad_norm": 6.21875, "learning_rate": 4.813773582186714e-05, "loss": 1.0074503898620606, "mean_token_accuracy": 0.7626443967223168, "num_tokens": 15401580.0, "step": 7760 }, { "entropy": 0.9503938175737858, "epoch": 0.13957874882112542, "grad_norm": 6.375, "learning_rate": 4.8132290983648675e-05, "loss": 1.0205866813659668, "mean_token_accuracy": 0.7669512376189231, "num_tokens": 15421437.0, "step": 7770 }, { "entropy": 1.0204586371779443, "epoch": 0.13975838685049624, "grad_norm": 8.3125, "learning_rate": 4.8126838506157594e-05, "loss": 1.0673606872558594, "mean_token_accuracy": 0.7425005987286568, "num_tokens": 15442504.0, "step": 7780 }, { "entropy": 0.9531779669225215, "epoch": 0.13993802487986706, "grad_norm": 7.90625, "learning_rate": 4.812137839119454e-05, "loss": 0.99929780960083, "mean_token_accuracy": 0.7683652810752392, "num_tokens": 15462444.0, "step": 7790 }, { "entropy": 0.989243657886982, "epoch": 0.14011766290923788, "grad_norm": 5.84375, "learning_rate": 4.8115910640562675e-05, "loss": 0.9879693984985352, "mean_token_accuracy": 0.7624568179249763, "num_tokens": 15481541.0, "step": 7800 }, { "entropy": 0.9361924007534981, "epoch": 0.1402973009386087, "grad_norm": 5.28125, "learning_rate": 4.8110435256067684e-05, "loss": 0.9400579452514648, "mean_token_accuracy": 0.7703248217701912, "num_tokens": 15501299.0, "step": 7810 }, { "entropy": 0.9134767703711987, "epoch": 0.14047693896797953, "grad_norm": 5.84375, "learning_rate": 4.810495223951777e-05, "loss": 0.9158266067504883, "mean_token_accuracy": 0.7841978080570697, "num_tokens": 15521099.0, "step": 7820 }, { "entropy": 1.0086168855428697, "epoch": 0.14065657699735035, "grad_norm": 6.125, "learning_rate": 4.809946159272366e-05, "loss": 1.1049494743347168, "mean_token_accuracy": 0.7437369585037231, "num_tokens": 15542244.0, "step": 7830 }, { "entropy": 0.9758957415819168, "epoch": 0.14083621502672117, "grad_norm": 6.40625, "learning_rate": 4.8093963317498614e-05, "loss": 0.9844758033752441, "mean_token_accuracy": 0.7701422110199928, "num_tokens": 15562892.0, "step": 7840 }, { "entropy": 0.975720651447773, "epoch": 0.14101585305609196, "grad_norm": 5.40625, "learning_rate": 4.8088457415658374e-05, "loss": 1.0480069160461425, "mean_token_accuracy": 0.7628588542342186, "num_tokens": 15582709.0, "step": 7850 }, { "entropy": 0.9315341129899025, "epoch": 0.14119549108546278, "grad_norm": 6.71875, "learning_rate": 4.808294388902125e-05, "loss": 0.9373558044433594, "mean_token_accuracy": 0.7789211988449096, "num_tokens": 15603694.0, "step": 7860 }, { "entropy": 0.9304000794887543, "epoch": 0.1413751291148336, "grad_norm": 7.53125, "learning_rate": 4.807742273940802e-05, "loss": 0.9249242782592774, "mean_token_accuracy": 0.7742099076509475, "num_tokens": 15624991.0, "step": 7870 }, { "entropy": 1.1340977996587753, "epoch": 0.14155476714420442, "grad_norm": 6.3125, "learning_rate": 4.807189396864202e-05, "loss": 1.1512449264526368, "mean_token_accuracy": 0.740560895204544, "num_tokens": 15645160.0, "step": 7880 }, { "entropy": 0.934343284368515, "epoch": 0.14173440517357525, "grad_norm": 6.96875, "learning_rate": 4.8066357578549084e-05, "loss": 0.9627437591552734, "mean_token_accuracy": 0.7725389644503593, "num_tokens": 15664325.0, "step": 7890 }, { "entropy": 0.9234327264130116, "epoch": 0.14191404320294607, "grad_norm": 6.6875, "learning_rate": 4.806081357095756e-05, "loss": 0.9461308479309082, "mean_token_accuracy": 0.7729640871286392, "num_tokens": 15683844.0, "step": 7900 }, { "entropy": 0.982674865424633, "epoch": 0.1420936812323169, "grad_norm": 5.21875, "learning_rate": 4.805526194769833e-05, "loss": 1.0271575927734375, "mean_token_accuracy": 0.7620200425386429, "num_tokens": 15703099.0, "step": 7910 }, { "entropy": 1.099584560841322, "epoch": 0.1422733192616877, "grad_norm": 5.96875, "learning_rate": 4.804970271060475e-05, "loss": 1.1175827980041504, "mean_token_accuracy": 0.7436011791229248, "num_tokens": 15722672.0, "step": 7920 }, { "entropy": 0.9634081177413464, "epoch": 0.14245295729105853, "grad_norm": 4.59375, "learning_rate": 4.804413586151275e-05, "loss": 0.9453004837036133, "mean_token_accuracy": 0.7736996680498123, "num_tokens": 15742433.0, "step": 7930 }, { "entropy": 0.9332099676132202, "epoch": 0.14263259532042932, "grad_norm": 5.71875, "learning_rate": 4.803856140226072e-05, "loss": 0.9822916984558105, "mean_token_accuracy": 0.7649647414684295, "num_tokens": 15761186.0, "step": 7940 }, { "entropy": 0.8899253077805043, "epoch": 0.14281223334980014, "grad_norm": 6.34375, "learning_rate": 4.80329793346896e-05, "loss": 0.9294010162353515, "mean_token_accuracy": 0.7811193868517876, "num_tokens": 15781247.0, "step": 7950 }, { "entropy": 0.9057660847902298, "epoch": 0.14299187137917097, "grad_norm": 6.9375, "learning_rate": 4.8027389660642815e-05, "loss": 0.8979418754577637, "mean_token_accuracy": 0.7901165187358856, "num_tokens": 15800944.0, "step": 7960 }, { "entropy": 0.8994721084833145, "epoch": 0.14317150940854179, "grad_norm": 6.15625, "learning_rate": 4.802179238196632e-05, "loss": 0.9426714897155761, "mean_token_accuracy": 0.7724975645542145, "num_tokens": 15821123.0, "step": 7970 }, { "entropy": 0.8700844459235668, "epoch": 0.1433511474379126, "grad_norm": 5.53125, "learning_rate": 4.801618750050858e-05, "loss": 0.9043972015380859, "mean_token_accuracy": 0.7886849567294121, "num_tokens": 15840633.0, "step": 7980 }, { "entropy": 0.9122070282697677, "epoch": 0.14353078546728343, "grad_norm": 5.46875, "learning_rate": 4.8010575018120565e-05, "loss": 0.940817928314209, "mean_token_accuracy": 0.783033049851656, "num_tokens": 15860763.0, "step": 7990 }, { "epoch": 0.14371042349665425, "eval_entropy": 0.9253975068330764, "eval_loss": 0.9760612845420837, "eval_mean_token_accuracy": 0.771456812620163, "eval_num_tokens": 15879974.0, "eval_runtime": 40.527, "eval_samples_per_second": 49.35, "eval_steps_per_second": 6.169, "step": 8000 }, { "entropy": 0.9213393233716488, "epoch": 0.14389006152602507, "grad_norm": 7.9375, "learning_rate": 4.7999327257970125e-05, "loss": 0.9661079406738281, "mean_token_accuracy": 0.7736393481492996, "num_tokens": 15899160.0, "step": 8010 }, { "entropy": 0.9077555313706398, "epoch": 0.14406969955539586, "grad_norm": 7.34375, "learning_rate": 4.799369198392221e-05, "loss": 0.8781991004943848, "mean_token_accuracy": 0.7922703772783279, "num_tokens": 15920544.0, "step": 8020 }, { "entropy": 0.8791537016630173, "epoch": 0.14424933758476668, "grad_norm": 5.84375, "learning_rate": 4.798804911637299e-05, "loss": 0.8872124671936035, "mean_token_accuracy": 0.7892002657055854, "num_tokens": 15939116.0, "step": 8030 }, { "entropy": 1.007106528431177, "epoch": 0.1444289756141375, "grad_norm": 6.34375, "learning_rate": 4.7982398657185994e-05, "loss": 1.0695843696594238, "mean_token_accuracy": 0.7552625820040703, "num_tokens": 15959916.0, "step": 8040 }, { "entropy": 0.9214366927742959, "epoch": 0.14460861364350833, "grad_norm": 6.34375, "learning_rate": 4.797674060822724e-05, "loss": 1.0163339614868163, "mean_token_accuracy": 0.766477893292904, "num_tokens": 15979421.0, "step": 8050 }, { "entropy": 1.0950290344655513, "epoch": 0.14478825167287915, "grad_norm": 6.28125, "learning_rate": 4.797107497136527e-05, "loss": 1.1203022956848145, "mean_token_accuracy": 0.7474785096943378, "num_tokens": 15999946.0, "step": 8060 }, { "entropy": 1.0755657061934472, "epoch": 0.14496788970224997, "grad_norm": 7.5625, "learning_rate": 4.7965401748471105e-05, "loss": 1.004679012298584, "mean_token_accuracy": 0.761923325061798, "num_tokens": 16020057.0, "step": 8070 }, { "entropy": 0.9756059482693672, "epoch": 0.1451475277316208, "grad_norm": 7.0, "learning_rate": 4.79597209414183e-05, "loss": 0.988649559020996, "mean_token_accuracy": 0.7638410523533821, "num_tokens": 16040036.0, "step": 8080 }, { "entropy": 1.0792164623737335, "epoch": 0.1453271657609916, "grad_norm": 6.28125, "learning_rate": 4.795403255208287e-05, "loss": 1.0785239219665528, "mean_token_accuracy": 0.7480552606284618, "num_tokens": 16060882.0, "step": 8090 }, { "entropy": 0.9377812132239342, "epoch": 0.14550680379036243, "grad_norm": 5.5, "learning_rate": 4.794833658234341e-05, "loss": 0.9462774276733399, "mean_token_accuracy": 0.7788886345922947, "num_tokens": 16079988.0, "step": 8100 }, { "entropy": 0.9954687006771564, "epoch": 0.14568644181973323, "grad_norm": 9.25, "learning_rate": 4.794263303408094e-05, "loss": 1.0717336654663085, "mean_token_accuracy": 0.7422982066869735, "num_tokens": 16099491.0, "step": 8110 }, { "entropy": 0.9266466960310936, "epoch": 0.14586607984910405, "grad_norm": 5.3125, "learning_rate": 4.7936921909179025e-05, "loss": 1.007299041748047, "mean_token_accuracy": 0.7658177345991135, "num_tokens": 16120315.0, "step": 8120 }, { "entropy": 0.918332064896822, "epoch": 0.14604571787847487, "grad_norm": 5.4375, "learning_rate": 4.793120320952373e-05, "loss": 0.9172868728637695, "mean_token_accuracy": 0.7765826389193535, "num_tokens": 16140305.0, "step": 8130 }, { "entropy": 0.9838981352746486, "epoch": 0.1462253559078457, "grad_norm": 6.25, "learning_rate": 4.79254769370036e-05, "loss": 1.0050840377807617, "mean_token_accuracy": 0.7727771311998367, "num_tokens": 16159957.0, "step": 8140 }, { "entropy": 0.9598341636359692, "epoch": 0.1464049939372165, "grad_norm": 7.53125, "learning_rate": 4.791974309350971e-05, "loss": 0.9321498870849609, "mean_token_accuracy": 0.775365024805069, "num_tokens": 16179409.0, "step": 8150 }, { "entropy": 0.8736059963703156, "epoch": 0.14658463196658733, "grad_norm": 5.8125, "learning_rate": 4.791400168093562e-05, "loss": 0.9543352127075195, "mean_token_accuracy": 0.7838498800992966, "num_tokens": 16198836.0, "step": 8160 }, { "entropy": 0.9364406079053879, "epoch": 0.14676426999595815, "grad_norm": 5.09375, "learning_rate": 4.790825270117737e-05, "loss": 0.9711810111999511, "mean_token_accuracy": 0.7722716882824898, "num_tokens": 16217946.0, "step": 8170 }, { "entropy": 1.050256796181202, "epoch": 0.14694390802532897, "grad_norm": 5.75, "learning_rate": 4.790249615613354e-05, "loss": 1.1144298553466796, "mean_token_accuracy": 0.7403399452567101, "num_tokens": 16239033.0, "step": 8180 }, { "entropy": 0.9918863236904144, "epoch": 0.14712354605469977, "grad_norm": 8.1875, "learning_rate": 4.7896732047705186e-05, "loss": 0.9685324668884278, "mean_token_accuracy": 0.7705891713500023, "num_tokens": 16257754.0, "step": 8190 }, { "entropy": 0.9363312378525734, "epoch": 0.1473031840840706, "grad_norm": 6.375, "learning_rate": 4.7890960377795854e-05, "loss": 0.9067818641662597, "mean_token_accuracy": 0.7761141359806061, "num_tokens": 16277770.0, "step": 8200 }, { "entropy": 1.0740804091095923, "epoch": 0.1474828221134414, "grad_norm": 7.28125, "learning_rate": 4.7885181148311595e-05, "loss": 1.175827407836914, "mean_token_accuracy": 0.7309317663311958, "num_tokens": 16297940.0, "step": 8210 }, { "entropy": 0.9732234723865986, "epoch": 0.14766246014281223, "grad_norm": 6.84375, "learning_rate": 4.787939436116097e-05, "loss": 1.0304366111755372, "mean_token_accuracy": 0.7548943281173706, "num_tokens": 16318456.0, "step": 8220 }, { "entropy": 1.0493127137422562, "epoch": 0.14784209817218305, "grad_norm": 6.46875, "learning_rate": 4.787360001825502e-05, "loss": 1.0820201873779296, "mean_token_accuracy": 0.7460463121533394, "num_tokens": 16338285.0, "step": 8230 }, { "entropy": 0.9108531437814236, "epoch": 0.14802173620155387, "grad_norm": 5.96875, "learning_rate": 4.786779812150727e-05, "loss": 0.8831881523132324, "mean_token_accuracy": 0.7933973103761673, "num_tokens": 16358087.0, "step": 8240 }, { "entropy": 0.9601771712303162, "epoch": 0.1482013742309247, "grad_norm": 6.15625, "learning_rate": 4.786198867283378e-05, "loss": 0.9855291366577148, "mean_token_accuracy": 0.7606870174407959, "num_tokens": 16378497.0, "step": 8250 }, { "entropy": 1.04051413834095, "epoch": 0.14838101226029551, "grad_norm": 7.0, "learning_rate": 4.785617167415306e-05, "loss": 1.095736312866211, "mean_token_accuracy": 0.7461801916360855, "num_tokens": 16398707.0, "step": 8260 }, { "entropy": 0.9777207329869271, "epoch": 0.14856065028966634, "grad_norm": 7.8125, "learning_rate": 4.785034712738614e-05, "loss": 0.9825257301330567, "mean_token_accuracy": 0.7654220774769783, "num_tokens": 16418593.0, "step": 8270 }, { "entropy": 0.9808871738612652, "epoch": 0.14874028831903713, "grad_norm": 7.6875, "learning_rate": 4.7844515034456535e-05, "loss": 1.0270327568054198, "mean_token_accuracy": 0.7590462177991867, "num_tokens": 16438576.0, "step": 8280 }, { "entropy": 1.08336161673069, "epoch": 0.14891992634840795, "grad_norm": 4.9375, "learning_rate": 4.7838675397290245e-05, "loss": 1.0961649894714356, "mean_token_accuracy": 0.7482455588877202, "num_tokens": 16459251.0, "step": 8290 }, { "entropy": 0.9407742746174336, "epoch": 0.14909956437777877, "grad_norm": 4.65625, "learning_rate": 4.783282821781577e-05, "loss": 0.9486184120178223, "mean_token_accuracy": 0.7776899576187134, "num_tokens": 16478530.0, "step": 8300 }, { "entropy": 0.9380235381424427, "epoch": 0.1492792024071496, "grad_norm": 6.09375, "learning_rate": 4.7826973497964104e-05, "loss": 0.9914567947387696, "mean_token_accuracy": 0.7693686172366142, "num_tokens": 16498815.0, "step": 8310 }, { "entropy": 0.9677539363503456, "epoch": 0.1494588404365204, "grad_norm": 6.3125, "learning_rate": 4.782111123966872e-05, "loss": 1.005695915222168, "mean_token_accuracy": 0.7632286712527275, "num_tokens": 16518149.0, "step": 8320 }, { "entropy": 0.9675017647445202, "epoch": 0.14963847846589123, "grad_norm": 6.34375, "learning_rate": 4.78152414448656e-05, "loss": 1.006098461151123, "mean_token_accuracy": 0.7647502481937408, "num_tokens": 16537357.0, "step": 8330 }, { "entropy": 0.9819768950343132, "epoch": 0.14981811649526205, "grad_norm": 6.0625, "learning_rate": 4.780936411549319e-05, "loss": 1.0014469146728515, "mean_token_accuracy": 0.7614009439945221, "num_tokens": 16557200.0, "step": 8340 }, { "entropy": 0.9535814724862576, "epoch": 0.14999775452463288, "grad_norm": 5.625, "learning_rate": 4.780347925349243e-05, "loss": 0.9643281936645508, "mean_token_accuracy": 0.7714976266026496, "num_tokens": 16576637.0, "step": 8350 }, { "entropy": 0.9912674829363823, "epoch": 0.15017739255400367, "grad_norm": 5.4375, "learning_rate": 4.7797586860806766e-05, "loss": 1.039186954498291, "mean_token_accuracy": 0.7689199656248092, "num_tokens": 16597417.0, "step": 8360 }, { "entropy": 1.0057676807045937, "epoch": 0.1503570305833745, "grad_norm": 7.59375, "learning_rate": 4.779168693938211e-05, "loss": 1.0194299697875977, "mean_token_accuracy": 0.763163010776043, "num_tokens": 16616941.0, "step": 8370 }, { "entropy": 0.9133186720311641, "epoch": 0.1505366686127453, "grad_norm": 6.90625, "learning_rate": 4.778577949116686e-05, "loss": 0.9048111915588379, "mean_token_accuracy": 0.7816048264503479, "num_tokens": 16636930.0, "step": 8380 }, { "entropy": 1.0196019619703294, "epoch": 0.15071630664211613, "grad_norm": 7.65625, "learning_rate": 4.7779864518111935e-05, "loss": 1.0508824348449708, "mean_token_accuracy": 0.7527576312422752, "num_tokens": 16656472.0, "step": 8390 }, { "entropy": 0.9308358244597912, "epoch": 0.15089594467148695, "grad_norm": 5.9375, "learning_rate": 4.777394202217069e-05, "loss": 0.9421045303344726, "mean_token_accuracy": 0.7774453893303871, "num_tokens": 16675576.0, "step": 8400 }, { "entropy": 1.064289902150631, "epoch": 0.15107558270085777, "grad_norm": 7.59375, "learning_rate": 4.7768012005299e-05, "loss": 1.1038736343383788, "mean_token_accuracy": 0.749541050195694, "num_tokens": 16694850.0, "step": 8410 }, { "entropy": 0.9885524310171604, "epoch": 0.1512552207302286, "grad_norm": 8.625, "learning_rate": 4.77620744694552e-05, "loss": 1.0435017585754394, "mean_token_accuracy": 0.7530829295516014, "num_tokens": 16714257.0, "step": 8420 }, { "entropy": 0.976657697558403, "epoch": 0.15143485875959942, "grad_norm": 5.59375, "learning_rate": 4.7756129416600125e-05, "loss": 0.9995203018188477, "mean_token_accuracy": 0.7667400926351547, "num_tokens": 16733991.0, "step": 8430 }, { "entropy": 0.9459144331514835, "epoch": 0.15161449678897024, "grad_norm": 7.3125, "learning_rate": 4.775017684869708e-05, "loss": 0.9626112937927246, "mean_token_accuracy": 0.7768433019518852, "num_tokens": 16753119.0, "step": 8440 }, { "entropy": 0.9674123585224151, "epoch": 0.15179413481834103, "grad_norm": 6.25, "learning_rate": 4.7744216767711856e-05, "loss": 0.9742136001586914, "mean_token_accuracy": 0.7641598656773567, "num_tokens": 16773481.0, "step": 8450 }, { "entropy": 0.947027649730444, "epoch": 0.15197377284771185, "grad_norm": 6.0, "learning_rate": 4.7738249175612736e-05, "loss": 1.0270215034484864, "mean_token_accuracy": 0.7674704849720001, "num_tokens": 16793170.0, "step": 8460 }, { "entropy": 0.899222207814455, "epoch": 0.15215341087708267, "grad_norm": 7.25, "learning_rate": 4.7732274074370475e-05, "loss": 0.9216394424438477, "mean_token_accuracy": 0.7811160445213318, "num_tokens": 16812152.0, "step": 8470 }, { "entropy": 0.9994746647775173, "epoch": 0.1523330489064535, "grad_norm": 6.125, "learning_rate": 4.77262914659583e-05, "loss": 1.0397178649902343, "mean_token_accuracy": 0.760996862500906, "num_tokens": 16832704.0, "step": 8480 }, { "entropy": 0.9703105866909028, "epoch": 0.15251268693582432, "grad_norm": 6.4375, "learning_rate": 4.7720301352351924e-05, "loss": 0.9766875267028808, "mean_token_accuracy": 0.7668307051062584, "num_tokens": 16853565.0, "step": 8490 }, { "entropy": 1.0501516416668892, "epoch": 0.15269232496519514, "grad_norm": 6.625, "learning_rate": 4.771430373552955e-05, "loss": 1.101221752166748, "mean_token_accuracy": 0.7473446115851402, "num_tokens": 16873410.0, "step": 8500 }, { "entropy": 1.0002856373786926, "epoch": 0.15287196299456596, "grad_norm": 6.625, "learning_rate": 4.7708298617471826e-05, "loss": 1.0198898315429688, "mean_token_accuracy": 0.7665119498968125, "num_tokens": 16892331.0, "step": 8510 }, { "entropy": 0.9968453854322433, "epoch": 0.15305160102393678, "grad_norm": 6.78125, "learning_rate": 4.770228600016192e-05, "loss": 0.9913382530212402, "mean_token_accuracy": 0.7704442054033279, "num_tokens": 16911188.0, "step": 8520 }, { "entropy": 0.9885257661342621, "epoch": 0.15323123905330757, "grad_norm": 6.125, "learning_rate": 4.769626588558545e-05, "loss": 0.9797019958496094, "mean_token_accuracy": 0.7724747464060784, "num_tokens": 16931509.0, "step": 8530 }, { "entropy": 0.9782149374485016, "epoch": 0.1534108770826784, "grad_norm": 8.125, "learning_rate": 4.769023827573051e-05, "loss": 1.0146746635437012, "mean_token_accuracy": 0.7616164013743401, "num_tokens": 16950743.0, "step": 8540 }, { "entropy": 0.8727515764534474, "epoch": 0.15359051511204921, "grad_norm": 6.0625, "learning_rate": 4.768420317258768e-05, "loss": 0.8935771942138672, "mean_token_accuracy": 0.7834074899554253, "num_tokens": 16970015.0, "step": 8550 }, { "entropy": 0.9122753046452999, "epoch": 0.15377015314142004, "grad_norm": 5.90625, "learning_rate": 4.767816057815001e-05, "loss": 0.9500601768493653, "mean_token_accuracy": 0.7772382199764252, "num_tokens": 16990014.0, "step": 8560 }, { "entropy": 0.9873059459030629, "epoch": 0.15394979117079086, "grad_norm": 6.78125, "learning_rate": 4.767211049441301e-05, "loss": 1.0860373497009277, "mean_token_accuracy": 0.7473328277468682, "num_tokens": 17009763.0, "step": 8570 }, { "entropy": 0.9409085288643837, "epoch": 0.15412942920016168, "grad_norm": 5.46875, "learning_rate": 4.76660529233747e-05, "loss": 1.0001693725585938, "mean_token_accuracy": 0.7653929725289345, "num_tokens": 17029272.0, "step": 8580 }, { "entropy": 0.9125297427177429, "epoch": 0.1543090672295325, "grad_norm": 4.84375, "learning_rate": 4.765998786703554e-05, "loss": 0.9233849525451661, "mean_token_accuracy": 0.7878601789474488, "num_tokens": 17049691.0, "step": 8590 }, { "entropy": 0.8805228359997272, "epoch": 0.15448870525890332, "grad_norm": 6.71875, "learning_rate": 4.765391532739846e-05, "loss": 0.8344390869140625, "mean_token_accuracy": 0.7932497188448906, "num_tokens": 17069604.0, "step": 8600 }, { "entropy": 0.9685429468750953, "epoch": 0.15466834328827414, "grad_norm": 6.09375, "learning_rate": 4.764783530646888e-05, "loss": 0.988888168334961, "mean_token_accuracy": 0.7677136167883873, "num_tokens": 17090470.0, "step": 8610 }, { "entropy": 0.8634371489286423, "epoch": 0.15484798131764493, "grad_norm": 4.90625, "learning_rate": 4.764174780625469e-05, "loss": 0.9613308906555176, "mean_token_accuracy": 0.7739670544862747, "num_tokens": 17110593.0, "step": 8620 }, { "entropy": 0.9327140390872956, "epoch": 0.15502761934701575, "grad_norm": 7.125, "learning_rate": 4.763565282876623e-05, "loss": 0.9377048492431641, "mean_token_accuracy": 0.7768642783164978, "num_tokens": 17128944.0, "step": 8630 }, { "entropy": 0.9358147360384464, "epoch": 0.15520725737638658, "grad_norm": 4.59375, "learning_rate": 4.762955037601633e-05, "loss": 0.8977405548095703, "mean_token_accuracy": 0.7839958354830742, "num_tokens": 17149082.0, "step": 8640 }, { "entropy": 0.9750100076198578, "epoch": 0.1553868954057574, "grad_norm": 6.84375, "learning_rate": 4.762344045002028e-05, "loss": 1.030782413482666, "mean_token_accuracy": 0.7678866490721703, "num_tokens": 17169281.0, "step": 8650 }, { "entropy": 0.8895739287137985, "epoch": 0.15556653343512822, "grad_norm": 8.1875, "learning_rate": 4.761732305279585e-05, "loss": 0.9771529197692871, "mean_token_accuracy": 0.7717635035514832, "num_tokens": 17189593.0, "step": 8660 }, { "entropy": 0.9889240600168705, "epoch": 0.15574617146449904, "grad_norm": 5.84375, "learning_rate": 4.7611198186363244e-05, "loss": 1.029722309112549, "mean_token_accuracy": 0.7595301106572151, "num_tokens": 17210641.0, "step": 8670 }, { "entropy": 0.9961977578699589, "epoch": 0.15592580949386986, "grad_norm": 6.375, "learning_rate": 4.760506585274517e-05, "loss": 1.0377142906188965, "mean_token_accuracy": 0.7633031956851483, "num_tokens": 17230687.0, "step": 8680 }, { "entropy": 1.0272681072354317, "epoch": 0.15610544752324068, "grad_norm": 7.65625, "learning_rate": 4.759892605396679e-05, "loss": 1.0011177062988281, "mean_token_accuracy": 0.7630869328975678, "num_tokens": 17249267.0, "step": 8690 }, { "entropy": 0.9655700929462909, "epoch": 0.15628508555261147, "grad_norm": 4.84375, "learning_rate": 4.7592778792055714e-05, "loss": 0.9809362411499023, "mean_token_accuracy": 0.7759057402610778, "num_tokens": 17269204.0, "step": 8700 }, { "entropy": 0.9096764788031578, "epoch": 0.1564647235819823, "grad_norm": 6.1875, "learning_rate": 4.7586624069042044e-05, "loss": 0.9462522506713867, "mean_token_accuracy": 0.7753981962800026, "num_tokens": 17288534.0, "step": 8710 }, { "entropy": 0.9044617041945457, "epoch": 0.15664436161135312, "grad_norm": 6.90625, "learning_rate": 4.758046188695833e-05, "loss": 0.9258021354675293, "mean_token_accuracy": 0.7789418533444404, "num_tokens": 17308185.0, "step": 8720 }, { "entropy": 0.9491473779082298, "epoch": 0.15682399964072394, "grad_norm": 5.71875, "learning_rate": 4.757429224783958e-05, "loss": 0.9592753410339355, "mean_token_accuracy": 0.7788291737437248, "num_tokens": 17328573.0, "step": 8730 }, { "entropy": 0.9719256080687046, "epoch": 0.15700363767009476, "grad_norm": 6.09375, "learning_rate": 4.7568115153723284e-05, "loss": 1.0173357009887696, "mean_token_accuracy": 0.7668135076761246, "num_tokens": 17348027.0, "step": 8740 }, { "entropy": 0.9268810249865055, "epoch": 0.15718327569946558, "grad_norm": 4.90625, "learning_rate": 4.756193060664938e-05, "loss": 0.9744657516479492, "mean_token_accuracy": 0.7741603493690491, "num_tokens": 17367334.0, "step": 8750 }, { "entropy": 0.971621935069561, "epoch": 0.1573629137288364, "grad_norm": 7.0625, "learning_rate": 4.7555738608660264e-05, "loss": 0.9625894546508789, "mean_token_accuracy": 0.7770540103316307, "num_tokens": 17387198.0, "step": 8760 }, { "entropy": 1.0689078114926815, "epoch": 0.15754255175820722, "grad_norm": 8.125, "learning_rate": 4.754953916180081e-05, "loss": 1.066531276702881, "mean_token_accuracy": 0.7581532210111618, "num_tokens": 17408593.0, "step": 8770 }, { "entropy": 0.8720496878027916, "epoch": 0.15772218978757804, "grad_norm": 7.15625, "learning_rate": 4.7543332268118335e-05, "loss": 0.8786140441894531, "mean_token_accuracy": 0.7867275476455688, "num_tokens": 17428171.0, "step": 8780 }, { "entropy": 0.9861971028149128, "epoch": 0.15790182781694884, "grad_norm": 6.125, "learning_rate": 4.753711792966261e-05, "loss": 1.0357498168945312, "mean_token_accuracy": 0.7570379182696343, "num_tokens": 17447144.0, "step": 8790 }, { "entropy": 1.045317170023918, "epoch": 0.15808146584631966, "grad_norm": 6.75, "learning_rate": 4.753089614848589e-05, "loss": 1.0704665184020996, "mean_token_accuracy": 0.7500792741775513, "num_tokens": 17466393.0, "step": 8800 }, { "entropy": 0.8440519250929356, "epoch": 0.15826110387569048, "grad_norm": 9.4375, "learning_rate": 4.752466692664287e-05, "loss": 0.8856520652770996, "mean_token_accuracy": 0.7968454629182815, "num_tokens": 17486247.0, "step": 8810 }, { "entropy": 1.0042638331651688, "epoch": 0.1584407419050613, "grad_norm": 7.75, "learning_rate": 4.751843026619071e-05, "loss": 0.9723373413085937, "mean_token_accuracy": 0.7791522830724716, "num_tokens": 17504949.0, "step": 8820 }, { "entropy": 0.8787732116878033, "epoch": 0.15862037993443212, "grad_norm": 7.1875, "learning_rate": 4.751218616918901e-05, "loss": 0.9162117004394531, "mean_token_accuracy": 0.7846383064985275, "num_tokens": 17524718.0, "step": 8830 }, { "entropy": 1.0122891396284104, "epoch": 0.15880001796380294, "grad_norm": 6.9375, "learning_rate": 4.7505934637699856e-05, "loss": 1.0410573959350586, "mean_token_accuracy": 0.764104038476944, "num_tokens": 17546036.0, "step": 8840 }, { "entropy": 1.0013054005801678, "epoch": 0.15897965599317376, "grad_norm": 6.875, "learning_rate": 4.749967567378775e-05, "loss": 1.064315128326416, "mean_token_accuracy": 0.7516775041818619, "num_tokens": 17565785.0, "step": 8850 }, { "entropy": 0.96607446372509, "epoch": 0.15915929402254458, "grad_norm": 6.6875, "learning_rate": 4.7493409279519686e-05, "loss": 0.9831289291381836, "mean_token_accuracy": 0.7710923448204994, "num_tokens": 17587505.0, "step": 8860 }, { "entropy": 0.9975804023444652, "epoch": 0.15933893205191538, "grad_norm": 4.625, "learning_rate": 4.7487135456965084e-05, "loss": 1.0060144424438477, "mean_token_accuracy": 0.7647943995893002, "num_tokens": 17607190.0, "step": 8870 }, { "entropy": 0.9912250831723213, "epoch": 0.1595185700812862, "grad_norm": 4.4375, "learning_rate": 4.7480854208195835e-05, "loss": 1.0001302719116212, "mean_token_accuracy": 0.7621441900730133, "num_tokens": 17626816.0, "step": 8880 }, { "entropy": 0.8946340456604958, "epoch": 0.15969820811065702, "grad_norm": 5.09375, "learning_rate": 4.747456553528628e-05, "loss": 0.9108309745788574, "mean_token_accuracy": 0.7817248150706291, "num_tokens": 17647779.0, "step": 8890 }, { "entropy": 0.9393540628254413, "epoch": 0.15987784614002784, "grad_norm": 6.0, "learning_rate": 4.7468269440313194e-05, "loss": 0.974214744567871, "mean_token_accuracy": 0.7725089535117149, "num_tokens": 17667830.0, "step": 8900 }, { "entropy": 1.0443107917904855, "epoch": 0.16005748416939866, "grad_norm": 6.09375, "learning_rate": 4.746196592535584e-05, "loss": 1.0719220161437988, "mean_token_accuracy": 0.7534979403018951, "num_tokens": 17688361.0, "step": 8910 }, { "entropy": 1.042989766597748, "epoch": 0.16023712219876948, "grad_norm": 5.65625, "learning_rate": 4.745565499249589e-05, "loss": 1.0510982513427733, "mean_token_accuracy": 0.7477129012346267, "num_tokens": 17707540.0, "step": 8920 }, { "entropy": 1.0210182338953018, "epoch": 0.1604167602281403, "grad_norm": 7.21875, "learning_rate": 4.744933664381749e-05, "loss": 1.1169282913208007, "mean_token_accuracy": 0.7457792028784752, "num_tokens": 17726894.0, "step": 8930 }, { "entropy": 1.0933182634413243, "epoch": 0.16059639825751112, "grad_norm": 4.5625, "learning_rate": 4.7443010881407225e-05, "loss": 1.1368219375610351, "mean_token_accuracy": 0.7440774589776993, "num_tokens": 17749237.0, "step": 8940 }, { "entropy": 1.0087726727128028, "epoch": 0.16077603628688195, "grad_norm": 5.375, "learning_rate": 4.743667770735414e-05, "loss": 1.0164118766784669, "mean_token_accuracy": 0.760972361266613, "num_tokens": 17769183.0, "step": 8950 }, { "entropy": 0.9550929941236973, "epoch": 0.16095567431625274, "grad_norm": 5.9375, "learning_rate": 4.743033712374971e-05, "loss": 0.9461418151855469, "mean_token_accuracy": 0.7787161409854889, "num_tokens": 17789489.0, "step": 8960 }, { "entropy": 0.9016365617513656, "epoch": 0.16113531234562356, "grad_norm": 5.21875, "learning_rate": 4.742398913268788e-05, "loss": 0.8944819450378418, "mean_token_accuracy": 0.784300409257412, "num_tokens": 17808932.0, "step": 8970 }, { "entropy": 0.9215508490800858, "epoch": 0.16131495037499438, "grad_norm": 4.78125, "learning_rate": 4.741763373626502e-05, "loss": 0.9370976448059082, "mean_token_accuracy": 0.7738397717475891, "num_tokens": 17829564.0, "step": 8980 }, { "entropy": 0.8448221601545811, "epoch": 0.1614945884043652, "grad_norm": 7.78125, "learning_rate": 4.741127093657995e-05, "loss": 0.8962443351745606, "mean_token_accuracy": 0.7898091658949852, "num_tokens": 17849384.0, "step": 8990 }, { "epoch": 0.16167422643373602, "eval_entropy": 0.9303436948060989, "eval_loss": 0.9488416314125061, "eval_mean_token_accuracy": 0.7757836725711823, "eval_num_tokens": 17870229.0, "eval_runtime": 40.5228, "eval_samples_per_second": 49.355, "eval_steps_per_second": 6.169, "step": 9000 }, { "entropy": 0.9638120740652084, "epoch": 0.16185386446310684, "grad_norm": 5.3125, "learning_rate": 4.739852313583074e-05, "loss": 1.018975067138672, "mean_token_accuracy": 0.7673677865415811, "num_tokens": 17890018.0, "step": 9010 }, { "entropy": 0.9681854233145714, "epoch": 0.16203350249247767, "grad_norm": 6.0, "learning_rate": 4.739213813897645e-05, "loss": 0.9576973915100098, "mean_token_accuracy": 0.7843311294913292, "num_tokens": 17909464.0, "step": 9020 }, { "entropy": 0.9766761496663093, "epoch": 0.1622131405218485, "grad_norm": 7.8125, "learning_rate": 4.738574574727969e-05, "loss": 0.9760836601257324, "mean_token_accuracy": 0.7754037395119667, "num_tokens": 17929076.0, "step": 9030 }, { "entropy": 0.8228480659425259, "epoch": 0.16239277855121928, "grad_norm": 6.90625, "learning_rate": 4.7379345962851515e-05, "loss": 0.8559449195861817, "mean_token_accuracy": 0.8000741928815842, "num_tokens": 17948295.0, "step": 9040 }, { "entropy": 0.9463241461664438, "epoch": 0.1625724165805901, "grad_norm": 6.53125, "learning_rate": 4.737293878780539e-05, "loss": 1.0076125144958497, "mean_token_accuracy": 0.7696226395666599, "num_tokens": 17968971.0, "step": 9050 }, { "entropy": 0.8300053380429745, "epoch": 0.16275205460996092, "grad_norm": 6.71875, "learning_rate": 4.7366524224257245e-05, "loss": 0.8233118057250977, "mean_token_accuracy": 0.7992605149745942, "num_tokens": 17988264.0, "step": 9060 }, { "entropy": 0.9255936995148659, "epoch": 0.16293169263933174, "grad_norm": 6.65625, "learning_rate": 4.736010227432544e-05, "loss": 0.9705953598022461, "mean_token_accuracy": 0.7700245976448059, "num_tokens": 18007269.0, "step": 9070 }, { "entropy": 0.9908387616276741, "epoch": 0.16311133066870256, "grad_norm": 11.1875, "learning_rate": 4.7353672940130796e-05, "loss": 1.0327488899230957, "mean_token_accuracy": 0.7612299218773841, "num_tokens": 18026595.0, "step": 9080 }, { "entropy": 0.9577730923891068, "epoch": 0.16329096869807339, "grad_norm": 5.4375, "learning_rate": 4.734723622379653e-05, "loss": 0.9640662193298339, "mean_token_accuracy": 0.7827681139111519, "num_tokens": 18045736.0, "step": 9090 }, { "entropy": 0.9837521903216839, "epoch": 0.1634706067274442, "grad_norm": 8.6875, "learning_rate": 4.734079212744833e-05, "loss": 1.0170021057128906, "mean_token_accuracy": 0.7706265673041344, "num_tokens": 18067611.0, "step": 9100 }, { "entropy": 0.8206705145537854, "epoch": 0.16365024475681503, "grad_norm": 6.71875, "learning_rate": 4.733434065321432e-05, "loss": 0.8678516387939453, "mean_token_accuracy": 0.7948760494589806, "num_tokens": 18086958.0, "step": 9110 }, { "entropy": 0.9261166758835315, "epoch": 0.16382988278618585, "grad_norm": 6.40625, "learning_rate": 4.7327881803225046e-05, "loss": 0.9737388610839843, "mean_token_accuracy": 0.7739491254091263, "num_tokens": 18106731.0, "step": 9120 }, { "entropy": 0.8987494334578514, "epoch": 0.16400952081555664, "grad_norm": 9.25, "learning_rate": 4.732141557961349e-05, "loss": 0.9284511566162109, "mean_token_accuracy": 0.7756375715136528, "num_tokens": 18126809.0, "step": 9130 }, { "entropy": 1.0321485213935375, "epoch": 0.16418915884492746, "grad_norm": 6.40625, "learning_rate": 4.731494198451509e-05, "loss": 1.0619437217712402, "mean_token_accuracy": 0.7506299927830696, "num_tokens": 18147498.0, "step": 9140 }, { "entropy": 0.8776893839240074, "epoch": 0.16436879687429828, "grad_norm": 7.03125, "learning_rate": 4.7308461020067704e-05, "loss": 0.8966526985168457, "mean_token_accuracy": 0.7856161281466484, "num_tokens": 18166452.0, "step": 9150 }, { "entropy": 0.9587407387793064, "epoch": 0.1645484349036691, "grad_norm": 8.9375, "learning_rate": 4.7301972688411614e-05, "loss": 0.939057445526123, "mean_token_accuracy": 0.7788362771272659, "num_tokens": 18184290.0, "step": 9160 }, { "entropy": 0.8897178299725056, "epoch": 0.16472807293303993, "grad_norm": 7.6875, "learning_rate": 4.729547699168954e-05, "loss": 0.9725374221801758, "mean_token_accuracy": 0.7768823891878128, "num_tokens": 18204300.0, "step": 9170 }, { "entropy": 0.8844131723046302, "epoch": 0.16490771096241075, "grad_norm": 7.25, "learning_rate": 4.7288973932046656e-05, "loss": 0.9096429824829102, "mean_token_accuracy": 0.7802961796522141, "num_tokens": 18223806.0, "step": 9180 }, { "entropy": 1.0714459702372552, "epoch": 0.16508734899178157, "grad_norm": 6.375, "learning_rate": 4.728246351163054e-05, "loss": 1.106997299194336, "mean_token_accuracy": 0.7480820059776306, "num_tokens": 18243708.0, "step": 9190 }, { "entropy": 0.8125671908259392, "epoch": 0.1652669870211524, "grad_norm": 6.34375, "learning_rate": 4.727594573259121e-05, "loss": 0.7652768611907959, "mean_token_accuracy": 0.8130101934075356, "num_tokens": 18263476.0, "step": 9200 }, { "entropy": 0.8467555202543735, "epoch": 0.16544662505052318, "grad_norm": 7.3125, "learning_rate": 4.7269420597081114e-05, "loss": 0.920893669128418, "mean_token_accuracy": 0.7788765475153923, "num_tokens": 18284127.0, "step": 9210 }, { "entropy": 0.9326670832931996, "epoch": 0.165626263079894, "grad_norm": 6.59375, "learning_rate": 4.726288810725515e-05, "loss": 0.9445914268493653, "mean_token_accuracy": 0.7757194757461547, "num_tokens": 18303875.0, "step": 9220 }, { "entropy": 0.8629965014755726, "epoch": 0.16580590110926482, "grad_norm": 6.65625, "learning_rate": 4.72563482652706e-05, "loss": 0.9051396369934082, "mean_token_accuracy": 0.7843986138701439, "num_tokens": 18323468.0, "step": 9230 }, { "entropy": 0.8389853581786155, "epoch": 0.16598553913863565, "grad_norm": 6.34375, "learning_rate": 4.724980107328722e-05, "loss": 0.8194594383239746, "mean_token_accuracy": 0.798887787759304, "num_tokens": 18343394.0, "step": 9240 }, { "entropy": 1.0091021195054055, "epoch": 0.16616517716800647, "grad_norm": 6.5, "learning_rate": 4.724324653346716e-05, "loss": 1.043700885772705, "mean_token_accuracy": 0.7542940318584442, "num_tokens": 18363903.0, "step": 9250 }, { "entropy": 0.9561960935592652, "epoch": 0.1663448151973773, "grad_norm": 6.0, "learning_rate": 4.723668464797502e-05, "loss": 1.0119144439697265, "mean_token_accuracy": 0.7664878085255623, "num_tokens": 18382940.0, "step": 9260 }, { "entropy": 0.8921266764402389, "epoch": 0.1665244532267481, "grad_norm": 5.59375, "learning_rate": 4.723011541897781e-05, "loss": 0.8833674430847168, "mean_token_accuracy": 0.7899740055203438, "num_tokens": 18403071.0, "step": 9270 }, { "entropy": 0.8875182561576367, "epoch": 0.16670409125611893, "grad_norm": 5.6875, "learning_rate": 4.722353884864496e-05, "loss": 0.9245976448059082, "mean_token_accuracy": 0.7728003561496735, "num_tokens": 18423145.0, "step": 9280 }, { "entropy": 0.942279863357544, "epoch": 0.16688372928548975, "grad_norm": 6.0, "learning_rate": 4.721695493914835e-05, "loss": 1.0021965980529786, "mean_token_accuracy": 0.7701666370034218, "num_tokens": 18442701.0, "step": 9290 }, { "entropy": 1.0353110067546367, "epoch": 0.16706336731486054, "grad_norm": 11.0, "learning_rate": 4.7210363692662267e-05, "loss": 1.0737655639648438, "mean_token_accuracy": 0.7501712031662464, "num_tokens": 18463468.0, "step": 9300 }, { "entropy": 0.9296294204890728, "epoch": 0.16724300534423137, "grad_norm": 5.5625, "learning_rate": 4.720376511136342e-05, "loss": 0.8965011596679687, "mean_token_accuracy": 0.7824577704071999, "num_tokens": 18484080.0, "step": 9310 }, { "entropy": 0.8524242773652076, "epoch": 0.1674226433736022, "grad_norm": 4.84375, "learning_rate": 4.719715919743094e-05, "loss": 0.9343573570251464, "mean_token_accuracy": 0.793031319975853, "num_tokens": 18505286.0, "step": 9320 }, { "entropy": 0.911799605935812, "epoch": 0.167602281402973, "grad_norm": 6.03125, "learning_rate": 4.719054595304638e-05, "loss": 0.9171762466430664, "mean_token_accuracy": 0.7827555373311043, "num_tokens": 18525912.0, "step": 9330 }, { "entropy": 0.8643674038350582, "epoch": 0.16778191943234383, "grad_norm": 5.40625, "learning_rate": 4.718392538039374e-05, "loss": 0.8773012161254883, "mean_token_accuracy": 0.795585049688816, "num_tokens": 18545706.0, "step": 9340 }, { "entropy": 1.027641935646534, "epoch": 0.16796155746171465, "grad_norm": 6.59375, "learning_rate": 4.717729748165938e-05, "loss": 1.0094654083251953, "mean_token_accuracy": 0.7578551426529885, "num_tokens": 18565375.0, "step": 9350 }, { "entropy": 0.9796357691287995, "epoch": 0.16814119549108547, "grad_norm": 4.1875, "learning_rate": 4.717066225903214e-05, "loss": 0.9889277458190918, "mean_token_accuracy": 0.7676798954606057, "num_tokens": 18586569.0, "step": 9360 }, { "entropy": 0.8381679400801658, "epoch": 0.1683208335204563, "grad_norm": 6.75, "learning_rate": 4.7164019714703256e-05, "loss": 0.862794303894043, "mean_token_accuracy": 0.8010192960500717, "num_tokens": 18605744.0, "step": 9370 }, { "entropy": 0.903783343732357, "epoch": 0.16850047154982709, "grad_norm": 7.6875, "learning_rate": 4.715736985086636e-05, "loss": 0.9910968780517578, "mean_token_accuracy": 0.7659548781812191, "num_tokens": 18625789.0, "step": 9380 }, { "entropy": 0.8808243818581104, "epoch": 0.1686801095791979, "grad_norm": 6.4375, "learning_rate": 4.7150712669717545e-05, "loss": 0.8979572296142578, "mean_token_accuracy": 0.787866523861885, "num_tokens": 18645912.0, "step": 9390 }, { "entropy": 0.8958413884043693, "epoch": 0.16885974760856873, "grad_norm": 7.5625, "learning_rate": 4.714404817345528e-05, "loss": 0.9158196449279785, "mean_token_accuracy": 0.7902197211980819, "num_tokens": 18665868.0, "step": 9400 }, { "entropy": 0.862149441242218, "epoch": 0.16903938563793955, "grad_norm": 5.75, "learning_rate": 4.713737636428048e-05, "loss": 0.8268040657043457, "mean_token_accuracy": 0.7911340206861496, "num_tokens": 18686617.0, "step": 9410 }, { "entropy": 0.907992385327816, "epoch": 0.16921902366731037, "grad_norm": 4.90625, "learning_rate": 4.713069724439645e-05, "loss": 0.949774169921875, "mean_token_accuracy": 0.7834359690546989, "num_tokens": 18706887.0, "step": 9420 }, { "entropy": 0.9191290006041527, "epoch": 0.1693986616966812, "grad_norm": 7.40625, "learning_rate": 4.712401081600893e-05, "loss": 0.9316378593444824, "mean_token_accuracy": 0.7811064325273037, "num_tokens": 18727175.0, "step": 9430 }, { "entropy": 0.8583660207688808, "epoch": 0.169578299726052, "grad_norm": 5.875, "learning_rate": 4.711731708132606e-05, "loss": 0.8893906593322753, "mean_token_accuracy": 0.7887267261743546, "num_tokens": 18746133.0, "step": 9440 }, { "entropy": 0.9689084470272065, "epoch": 0.16975793775542283, "grad_norm": 8.25, "learning_rate": 4.7110616042558404e-05, "loss": 1.0509136199951172, "mean_token_accuracy": 0.7614096269011498, "num_tokens": 18765494.0, "step": 9450 }, { "entropy": 0.8895253948867321, "epoch": 0.16993757578479365, "grad_norm": 6.53125, "learning_rate": 4.7103907701918924e-05, "loss": 0.9014310836791992, "mean_token_accuracy": 0.7900927186012268, "num_tokens": 18785273.0, "step": 9460 }, { "entropy": 0.916766132414341, "epoch": 0.17011721381416445, "grad_norm": 4.96875, "learning_rate": 4.7097192061623e-05, "loss": 0.9033540725708008, "mean_token_accuracy": 0.7863207668066025, "num_tokens": 18804621.0, "step": 9470 }, { "entropy": 0.8936407186090947, "epoch": 0.17029685184353527, "grad_norm": 7.34375, "learning_rate": 4.7090469123888436e-05, "loss": 0.9383153915405273, "mean_token_accuracy": 0.7787775993347168, "num_tokens": 18823792.0, "step": 9480 }, { "entropy": 0.9060123920440674, "epoch": 0.1704764898729061, "grad_norm": 6.0, "learning_rate": 4.7083738890935426e-05, "loss": 0.8974112510681153, "mean_token_accuracy": 0.7896077901124954, "num_tokens": 18844352.0, "step": 9490 }, { "entropy": 0.9063649274408817, "epoch": 0.1706561279022769, "grad_norm": 7.0625, "learning_rate": 4.707700136498658e-05, "loss": 0.9537568092346191, "mean_token_accuracy": 0.7833113089203835, "num_tokens": 18864462.0, "step": 9500 }, { "entropy": 0.9782896302640438, "epoch": 0.17083576593164773, "grad_norm": 4.875, "learning_rate": 4.707025654826692e-05, "loss": 1.0257890701293946, "mean_token_accuracy": 0.7674552157521248, "num_tokens": 18885483.0, "step": 9510 }, { "entropy": 0.8746934436261654, "epoch": 0.17101540396101855, "grad_norm": 6.84375, "learning_rate": 4.706350444300387e-05, "loss": 0.9134779930114746, "mean_token_accuracy": 0.7908712387084961, "num_tokens": 18905364.0, "step": 9520 }, { "entropy": 0.8717833809554577, "epoch": 0.17119504199038937, "grad_norm": 4.5, "learning_rate": 4.705674505142726e-05, "loss": 0.8525161743164062, "mean_token_accuracy": 0.7905518040060997, "num_tokens": 18924291.0, "step": 9530 }, { "entropy": 1.027393075078726, "epoch": 0.1713746800197602, "grad_norm": 7.375, "learning_rate": 4.704997837576935e-05, "loss": 1.0328557968139649, "mean_token_accuracy": 0.7582243226468564, "num_tokens": 18944899.0, "step": 9540 }, { "entropy": 0.8280367687344551, "epoch": 0.171554318049131, "grad_norm": 8.5625, "learning_rate": 4.7043204418264756e-05, "loss": 0.888212013244629, "mean_token_accuracy": 0.7915822759270668, "num_tokens": 18965407.0, "step": 9550 }, { "entropy": 0.8664294868707657, "epoch": 0.1717339560785018, "grad_norm": 6.0625, "learning_rate": 4.703642318115056e-05, "loss": 0.8780263900756836, "mean_token_accuracy": 0.7851709812879563, "num_tokens": 18985761.0, "step": 9560 }, { "entropy": 0.8437274187803269, "epoch": 0.17191359410787263, "grad_norm": 10.0, "learning_rate": 4.702963466666619e-05, "loss": 0.8491219520568848, "mean_token_accuracy": 0.7917777583003044, "num_tokens": 19005278.0, "step": 9570 }, { "entropy": 0.7588127285242081, "epoch": 0.17209323213724345, "grad_norm": 6.4375, "learning_rate": 4.702283887705352e-05, "loss": 0.7774446964263916, "mean_token_accuracy": 0.8105572029948235, "num_tokens": 19025594.0, "step": 9580 }, { "entropy": 0.9226869255304336, "epoch": 0.17227287016661427, "grad_norm": 6.375, "learning_rate": 4.701603581455681e-05, "loss": 0.9948654174804688, "mean_token_accuracy": 0.7676158845424652, "num_tokens": 19045507.0, "step": 9590 }, { "entropy": 0.9335997827351094, "epoch": 0.1724525081959851, "grad_norm": 6.75, "learning_rate": 4.700922548142273e-05, "loss": 0.9896574020385742, "mean_token_accuracy": 0.7613599583506584, "num_tokens": 19065763.0, "step": 9600 }, { "entropy": 0.970546105504036, "epoch": 0.17263214622535591, "grad_norm": 5.1875, "learning_rate": 4.7002407879900314e-05, "loss": 0.9497195243835449, "mean_token_accuracy": 0.77253128439188, "num_tokens": 19086119.0, "step": 9610 }, { "entropy": 0.9360686421394349, "epoch": 0.17281178425472674, "grad_norm": 5.5, "learning_rate": 4.699558301224105e-05, "loss": 0.9997067451477051, "mean_token_accuracy": 0.7645293459296226, "num_tokens": 19105940.0, "step": 9620 }, { "entropy": 0.9390234097838401, "epoch": 0.17299142228409756, "grad_norm": 5.1875, "learning_rate": 4.6988750880698797e-05, "loss": 0.96348876953125, "mean_token_accuracy": 0.7760978445410729, "num_tokens": 19125875.0, "step": 9630 }, { "entropy": 1.0701192140579223, "epoch": 0.17317106031346835, "grad_norm": 5.8125, "learning_rate": 4.698191148752982e-05, "loss": 1.0500544548034667, "mean_token_accuracy": 0.754813103377819, "num_tokens": 19145327.0, "step": 9640 }, { "entropy": 0.9879483342170715, "epoch": 0.17335069834283917, "grad_norm": 6.0625, "learning_rate": 4.6975064834992765e-05, "loss": 0.9527148246765137, "mean_token_accuracy": 0.7701940312981606, "num_tokens": 19165501.0, "step": 9650 }, { "entropy": 0.79984863512218, "epoch": 0.17353033637221, "grad_norm": 7.1875, "learning_rate": 4.69682109253487e-05, "loss": 0.9002044677734375, "mean_token_accuracy": 0.7872171685099602, "num_tokens": 19184148.0, "step": 9660 }, { "entropy": 0.9505138382315635, "epoch": 0.1737099744015808, "grad_norm": 5.75, "learning_rate": 4.6961349760861095e-05, "loss": 0.9538670539855957, "mean_token_accuracy": 0.7678418636322022, "num_tokens": 19204565.0, "step": 9670 }, { "entropy": 0.9760745167732239, "epoch": 0.17388961243095163, "grad_norm": 6.03125, "learning_rate": 4.695448134379577e-05, "loss": 0.9559142112731933, "mean_token_accuracy": 0.7691164925694466, "num_tokens": 19225042.0, "step": 9680 }, { "entropy": 0.8791351959109306, "epoch": 0.17406925046032246, "grad_norm": 9.9375, "learning_rate": 4.6947605676420994e-05, "loss": 0.9054128646850585, "mean_token_accuracy": 0.786659762263298, "num_tokens": 19245213.0, "step": 9690 }, { "entropy": 0.9709884136915207, "epoch": 0.17424888848969328, "grad_norm": 4.03125, "learning_rate": 4.6940722761007396e-05, "loss": 0.9749642372131347, "mean_token_accuracy": 0.7780238419771195, "num_tokens": 19265047.0, "step": 9700 }, { "entropy": 0.9294934887439013, "epoch": 0.1744285265190641, "grad_norm": 6.28125, "learning_rate": 4.6933832599828e-05, "loss": 0.9403132438659668, "mean_token_accuracy": 0.789320471137762, "num_tokens": 19284890.0, "step": 9710 }, { "entropy": 0.8958697043359279, "epoch": 0.1746081645484349, "grad_norm": 9.1875, "learning_rate": 4.6926935195158257e-05, "loss": 0.9269455909729004, "mean_token_accuracy": 0.7735864460468292, "num_tokens": 19304494.0, "step": 9720 }, { "entropy": 0.9792730428278447, "epoch": 0.1747878025778057, "grad_norm": 7.59375, "learning_rate": 4.692003054927597e-05, "loss": 1.0214195251464844, "mean_token_accuracy": 0.7646785318851471, "num_tokens": 19324438.0, "step": 9730 }, { "entropy": 1.0013775184750557, "epoch": 0.17496744060717653, "grad_norm": 6.5625, "learning_rate": 4.6913118664461344e-05, "loss": 1.0185001373291016, "mean_token_accuracy": 0.7612957775592804, "num_tokens": 19344417.0, "step": 9740 }, { "entropy": 0.8812263227999211, "epoch": 0.17514707863654735, "grad_norm": 6.21875, "learning_rate": 4.690619954299699e-05, "loss": 0.8862649917602539, "mean_token_accuracy": 0.7906287685036659, "num_tokens": 19365669.0, "step": 9750 }, { "entropy": 0.9786417976021766, "epoch": 0.17532671666591818, "grad_norm": 5.25, "learning_rate": 4.6899273187167894e-05, "loss": 0.9972304344177246, "mean_token_accuracy": 0.7638727478682995, "num_tokens": 19386111.0, "step": 9760 }, { "entropy": 0.843319721519947, "epoch": 0.175506354695289, "grad_norm": 7.15625, "learning_rate": 4.689233959926142e-05, "loss": 0.8748242378234863, "mean_token_accuracy": 0.7886282086372376, "num_tokens": 19406243.0, "step": 9770 }, { "entropy": 0.8470712170004845, "epoch": 0.17568599272465982, "grad_norm": 5.40625, "learning_rate": 4.688539878156737e-05, "loss": 0.8864126205444336, "mean_token_accuracy": 0.7888110801577568, "num_tokens": 19426876.0, "step": 9780 }, { "entropy": 0.880895970761776, "epoch": 0.17586563075403064, "grad_norm": 5.09375, "learning_rate": 4.687845073637786e-05, "loss": 0.9161407470703125, "mean_token_accuracy": 0.7760112106800079, "num_tokens": 19448188.0, "step": 9790 }, { "entropy": 0.8215919353067875, "epoch": 0.17604526878340146, "grad_norm": 5.5625, "learning_rate": 4.687149546598747e-05, "loss": 0.8065370559692383, "mean_token_accuracy": 0.8095763623714447, "num_tokens": 19469161.0, "step": 9800 }, { "entropy": 0.940293101966381, "epoch": 0.17622490681277225, "grad_norm": 5.71875, "learning_rate": 4.6864532972693096e-05, "loss": 0.9980769157409668, "mean_token_accuracy": 0.7708943307399749, "num_tokens": 19490164.0, "step": 9810 }, { "entropy": 0.9293912209570407, "epoch": 0.17640454484214307, "grad_norm": 8.0625, "learning_rate": 4.685756325879407e-05, "loss": 0.9511631965637207, "mean_token_accuracy": 0.7740518391132355, "num_tokens": 19510823.0, "step": 9820 }, { "entropy": 0.819664042443037, "epoch": 0.1765841828715139, "grad_norm": 6.71875, "learning_rate": 4.685058632659208e-05, "loss": 0.8230952262878418, "mean_token_accuracy": 0.808774447441101, "num_tokens": 19531766.0, "step": 9830 }, { "entropy": 0.8843199007213116, "epoch": 0.17676382090088472, "grad_norm": 5.375, "learning_rate": 4.6843602178391216e-05, "loss": 0.9109560966491699, "mean_token_accuracy": 0.7788462847471237, "num_tokens": 19552359.0, "step": 9840 }, { "entropy": 0.7806415006518364, "epoch": 0.17694345893025554, "grad_norm": 5.28125, "learning_rate": 4.683661081649794e-05, "loss": 0.8133620262145996, "mean_token_accuracy": 0.8053049743175507, "num_tokens": 19572777.0, "step": 9850 }, { "entropy": 0.9454508267343045, "epoch": 0.17712309695962636, "grad_norm": 8.125, "learning_rate": 4.682961224322109e-05, "loss": 1.0305035591125489, "mean_token_accuracy": 0.7619006484746933, "num_tokens": 19591845.0, "step": 9860 }, { "entropy": 0.8355608589947223, "epoch": 0.17730273498899718, "grad_norm": 4.84375, "learning_rate": 4.6822606460871905e-05, "loss": 0.8281384468078613, "mean_token_accuracy": 0.7892985329031944, "num_tokens": 19612190.0, "step": 9870 }, { "entropy": 0.9059530779719353, "epoch": 0.177482373018368, "grad_norm": 7.5625, "learning_rate": 4.681559347176399e-05, "loss": 0.9679039001464844, "mean_token_accuracy": 0.7695346951484681, "num_tokens": 19631449.0, "step": 9880 }, { "entropy": 0.8924325972795486, "epoch": 0.1776620110477388, "grad_norm": 6.9375, "learning_rate": 4.6808573278213335e-05, "loss": 0.8547731399536133, "mean_token_accuracy": 0.7943399846553802, "num_tokens": 19651738.0, "step": 9890 }, { "entropy": 0.8809739574790001, "epoch": 0.17784164907710961, "grad_norm": 7.8125, "learning_rate": 4.680154588253831e-05, "loss": 0.8992229461669922, "mean_token_accuracy": 0.7830890074372292, "num_tokens": 19671214.0, "step": 9900 }, { "entropy": 0.9373166345059871, "epoch": 0.17802128710648044, "grad_norm": 5.8125, "learning_rate": 4.679451128705966e-05, "loss": 1.0422589302062988, "mean_token_accuracy": 0.7628077566623688, "num_tokens": 19690764.0, "step": 9910 }, { "entropy": 0.884357450157404, "epoch": 0.17820092513585126, "grad_norm": 6.8125, "learning_rate": 4.678746949410051e-05, "loss": 0.875083065032959, "mean_token_accuracy": 0.793388170003891, "num_tokens": 19710421.0, "step": 9920 }, { "entropy": 1.003797211498022, "epoch": 0.17838056316522208, "grad_norm": 6.40625, "learning_rate": 4.6780420505986364e-05, "loss": 1.0005805015563964, "mean_token_accuracy": 0.7616712465882302, "num_tokens": 19729586.0, "step": 9930 }, { "entropy": 0.9402335725724698, "epoch": 0.1785602011945929, "grad_norm": 5.375, "learning_rate": 4.67733643250451e-05, "loss": 1.0139225959777831, "mean_token_accuracy": 0.763370369374752, "num_tokens": 19750089.0, "step": 9940 }, { "entropy": 0.9041382670402527, "epoch": 0.17873983922396372, "grad_norm": 7.4375, "learning_rate": 4.6766300953606965e-05, "loss": 0.9334269523620605, "mean_token_accuracy": 0.7833434388041496, "num_tokens": 19769988.0, "step": 9950 }, { "entropy": 0.9178200788795948, "epoch": 0.17891947725333454, "grad_norm": 5.0625, "learning_rate": 4.6759230394004585e-05, "loss": 0.8636631011962891, "mean_token_accuracy": 0.7860185578465462, "num_tokens": 19789913.0, "step": 9960 }, { "entropy": 0.885036726295948, "epoch": 0.17909911528270536, "grad_norm": 6.96875, "learning_rate": 4.675215264857297e-05, "loss": 0.9375524520874023, "mean_token_accuracy": 0.7828322112560272, "num_tokens": 19809575.0, "step": 9970 }, { "entropy": 0.9421730369329453, "epoch": 0.17927875331207616, "grad_norm": 5.28125, "learning_rate": 4.674506771964948e-05, "loss": 0.963228988647461, "mean_token_accuracy": 0.7686885207891464, "num_tokens": 19829459.0, "step": 9980 }, { "entropy": 0.9244213327765465, "epoch": 0.17945839134144698, "grad_norm": 4.3125, "learning_rate": 4.6737975609573885e-05, "loss": 0.963899803161621, "mean_token_accuracy": 0.7784286767244339, "num_tokens": 19848553.0, "step": 9990 }, { "epoch": 0.1796380293708178, "eval_entropy": 0.8654658439159393, "eval_loss": 0.9178380370140076, "eval_mean_token_accuracy": 0.7827489011287689, "eval_num_tokens": 19868813.0, "eval_runtime": 40.5594, "eval_samples_per_second": 49.31, "eval_steps_per_second": 6.164, "step": 10000 }, { "entropy": 0.8970327652990818, "epoch": 0.17981766740018862, "grad_norm": 6.4375, "learning_rate": 4.672376985533718e-05, "loss": 0.9154790878295899, "mean_token_accuracy": 0.7790773957967758, "num_tokens": 19889070.0, "step": 10010 }, { "entropy": 0.8860844872891903, "epoch": 0.17999730542955944, "grad_norm": 5.5, "learning_rate": 4.6716656215867416e-05, "loss": 0.9297883033752441, "mean_token_accuracy": 0.7806318372488021, "num_tokens": 19909669.0, "step": 10020 }, { "entropy": 0.8904704309999942, "epoch": 0.18017694345893026, "grad_norm": 5.0625, "learning_rate": 4.6709535404628235e-05, "loss": 0.8861412048339844, "mean_token_accuracy": 0.7842861548066139, "num_tokens": 19929310.0, "step": 10030 }, { "entropy": 0.9421122550964356, "epoch": 0.18035658148830108, "grad_norm": 5.875, "learning_rate": 4.670240742397123e-05, "loss": 0.9656044006347656, "mean_token_accuracy": 0.7745575472712517, "num_tokens": 19949316.0, "step": 10040 }, { "entropy": 0.9575737029314041, "epoch": 0.1805362195176719, "grad_norm": 12.6875, "learning_rate": 4.669527227625036e-05, "loss": 0.9661746978759765, "mean_token_accuracy": 0.7781783565878868, "num_tokens": 19968635.0, "step": 10050 }, { "entropy": 0.8467212662100791, "epoch": 0.1807158575470427, "grad_norm": 6.75, "learning_rate": 4.6688129963821955e-05, "loss": 0.8847176551818847, "mean_token_accuracy": 0.7942148804664612, "num_tokens": 19987448.0, "step": 10060 }, { "entropy": 0.8960808664560318, "epoch": 0.18089549557641352, "grad_norm": 5.78125, "learning_rate": 4.668098048904472e-05, "loss": 0.9462654113769531, "mean_token_accuracy": 0.776871158182621, "num_tokens": 20007490.0, "step": 10070 }, { "entropy": 0.8117484986782074, "epoch": 0.18107513360578434, "grad_norm": 4.78125, "learning_rate": 4.667382385427971e-05, "loss": 0.810932731628418, "mean_token_accuracy": 0.8044671684503555, "num_tokens": 20027156.0, "step": 10080 }, { "entropy": 0.9018398560583591, "epoch": 0.18125477163515516, "grad_norm": 9.25, "learning_rate": 4.6666660061890355e-05, "loss": 0.9327230453491211, "mean_token_accuracy": 0.7876079708337784, "num_tokens": 20046362.0, "step": 10090 }, { "entropy": 0.869919040799141, "epoch": 0.18143440966452598, "grad_norm": 7.25, "learning_rate": 4.665948911424246e-05, "loss": 0.8856520652770996, "mean_token_accuracy": 0.7849762588739395, "num_tokens": 20066034.0, "step": 10100 }, { "entropy": 0.8612315021455288, "epoch": 0.1816140476938968, "grad_norm": 4.875, "learning_rate": 4.665231101370415e-05, "loss": 0.8797199249267578, "mean_token_accuracy": 0.7865251332521439, "num_tokens": 20086132.0, "step": 10110 }, { "entropy": 0.8215412184596061, "epoch": 0.18179368572326762, "grad_norm": 7.4375, "learning_rate": 4.664512576264596e-05, "loss": 0.8817085266113281, "mean_token_accuracy": 0.7978115871548652, "num_tokens": 20105458.0, "step": 10120 }, { "entropy": 0.8708537980914116, "epoch": 0.18197332375263844, "grad_norm": 5.1875, "learning_rate": 4.663793336344077e-05, "loss": 0.8897501945495605, "mean_token_accuracy": 0.7868052572011948, "num_tokens": 20124421.0, "step": 10130 }, { "entropy": 0.8606214374303818, "epoch": 0.18215296178200927, "grad_norm": 6.53125, "learning_rate": 4.663073381846381e-05, "loss": 0.8434826850891113, "mean_token_accuracy": 0.7889123961329461, "num_tokens": 20143074.0, "step": 10140 }, { "entropy": 0.8437647886574269, "epoch": 0.18233259981138006, "grad_norm": 5.9375, "learning_rate": 4.662352713009268e-05, "loss": 0.8886876106262207, "mean_token_accuracy": 0.7893482580780983, "num_tokens": 20162432.0, "step": 10150 }, { "entropy": 0.959248498827219, "epoch": 0.18251223784075088, "grad_norm": 7.96875, "learning_rate": 4.661631330070734e-05, "loss": 0.9278444290161133, "mean_token_accuracy": 0.782409805059433, "num_tokens": 20182124.0, "step": 10160 }, { "entropy": 0.8961891002953053, "epoch": 0.1826918758701217, "grad_norm": 6.15625, "learning_rate": 4.66090923326901e-05, "loss": 0.9482830047607422, "mean_token_accuracy": 0.7701358571648598, "num_tokens": 20201455.0, "step": 10170 }, { "entropy": 0.8502549394965172, "epoch": 0.18287151389949252, "grad_norm": 4.5, "learning_rate": 4.6601864228425636e-05, "loss": 0.9447774887084961, "mean_token_accuracy": 0.7777151077985763, "num_tokens": 20221383.0, "step": 10180 }, { "entropy": 0.9295808129012585, "epoch": 0.18305115192886334, "grad_norm": 6.15625, "learning_rate": 4.6594628990300973e-05, "loss": 0.9805933952331543, "mean_token_accuracy": 0.7741496138274669, "num_tokens": 20241710.0, "step": 10190 }, { "entropy": 0.9320115998387337, "epoch": 0.18323078995823416, "grad_norm": 6.125, "learning_rate": 4.65873866207055e-05, "loss": 0.9468727111816406, "mean_token_accuracy": 0.7794321238994598, "num_tokens": 20261922.0, "step": 10200 }, { "entropy": 0.9146525450050831, "epoch": 0.18341042798760498, "grad_norm": 4.96875, "learning_rate": 4.6580137122030965e-05, "loss": 0.9139816284179687, "mean_token_accuracy": 0.7824425846338272, "num_tokens": 20281555.0, "step": 10210 }, { "entropy": 0.9685615167021752, "epoch": 0.1835900660169758, "grad_norm": 8.5625, "learning_rate": 4.6572880496671444e-05, "loss": 1.0247797966003418, "mean_token_accuracy": 0.7732262901961804, "num_tokens": 20302381.0, "step": 10220 }, { "entropy": 0.9388386622071266, "epoch": 0.1837697040463466, "grad_norm": 5.1875, "learning_rate": 4.656561674702341e-05, "loss": 0.9076201438903808, "mean_token_accuracy": 0.7856024459004403, "num_tokens": 20322244.0, "step": 10230 }, { "entropy": 0.8644967660307884, "epoch": 0.18394934207571742, "grad_norm": 5.65625, "learning_rate": 4.6558345875485645e-05, "loss": 0.8878963470458985, "mean_token_accuracy": 0.7892375700175762, "num_tokens": 20341154.0, "step": 10240 }, { "entropy": 1.055906529724598, "epoch": 0.18412898010508824, "grad_norm": 7.375, "learning_rate": 4.65510678844593e-05, "loss": 1.0465203285217286, "mean_token_accuracy": 0.7560982845723629, "num_tokens": 20361875.0, "step": 10250 }, { "entropy": 0.8690978042781353, "epoch": 0.18430861813445906, "grad_norm": 6.625, "learning_rate": 4.6543782776347896e-05, "loss": 0.8669333457946777, "mean_token_accuracy": 0.805006018280983, "num_tokens": 20382291.0, "step": 10260 }, { "entropy": 0.846253851801157, "epoch": 0.18448825616382988, "grad_norm": 6.75, "learning_rate": 4.653649055355727e-05, "loss": 0.899083423614502, "mean_token_accuracy": 0.7814048767089844, "num_tokens": 20401817.0, "step": 10270 }, { "entropy": 0.8792815178632736, "epoch": 0.1846678941932007, "grad_norm": 5.46875, "learning_rate": 4.6529191218495636e-05, "loss": 0.9170869827270508, "mean_token_accuracy": 0.7820360198616981, "num_tokens": 20422421.0, "step": 10280 }, { "entropy": 0.8867128424346447, "epoch": 0.18484753222257153, "grad_norm": 4.90625, "learning_rate": 4.6521884773573556e-05, "loss": 0.9152216911315918, "mean_token_accuracy": 0.7900599136948585, "num_tokens": 20442493.0, "step": 10290 }, { "entropy": 0.9218067035079003, "epoch": 0.18502717025194235, "grad_norm": 6.28125, "learning_rate": 4.6514571221203905e-05, "loss": 0.8914688110351563, "mean_token_accuracy": 0.7879645988345146, "num_tokens": 20461711.0, "step": 10300 }, { "entropy": 0.8364969179034233, "epoch": 0.18520680828131317, "grad_norm": 6.375, "learning_rate": 4.650725056380195e-05, "loss": 0.8176088333129883, "mean_token_accuracy": 0.8037059500813484, "num_tokens": 20480729.0, "step": 10310 }, { "entropy": 0.8749627761542798, "epoch": 0.18538644631068396, "grad_norm": 6.84375, "learning_rate": 4.649992280378529e-05, "loss": 0.9180304527282714, "mean_token_accuracy": 0.7805110365152359, "num_tokens": 20500229.0, "step": 10320 }, { "entropy": 0.8077126622200013, "epoch": 0.18556608434005478, "grad_norm": 6.0625, "learning_rate": 4.649258794357385e-05, "loss": 0.854182243347168, "mean_token_accuracy": 0.7967185273766517, "num_tokens": 20520376.0, "step": 10330 }, { "entropy": 0.8610661804676056, "epoch": 0.1857457223694256, "grad_norm": 5.4375, "learning_rate": 4.648524598558992e-05, "loss": 0.8956315994262696, "mean_token_accuracy": 0.7910210475325584, "num_tokens": 20540065.0, "step": 10340 }, { "entropy": 0.9021451853215694, "epoch": 0.18592536039879642, "grad_norm": 7.78125, "learning_rate": 4.6477896932258136e-05, "loss": 0.9509499549865723, "mean_token_accuracy": 0.7669754132628441, "num_tokens": 20559944.0, "step": 10350 }, { "entropy": 0.9365390732884407, "epoch": 0.18610499842816725, "grad_norm": 4.9375, "learning_rate": 4.6470540786005454e-05, "loss": 0.9479766845703125, "mean_token_accuracy": 0.7729396760463715, "num_tokens": 20579411.0, "step": 10360 }, { "entropy": 0.9452847026288509, "epoch": 0.18628463645753807, "grad_norm": 4.5625, "learning_rate": 4.646317754926121e-05, "loss": 0.9594344139099121, "mean_token_accuracy": 0.7686725646257401, "num_tokens": 20598534.0, "step": 10370 }, { "entropy": 0.8386963322758675, "epoch": 0.1864642744869089, "grad_norm": 5.25, "learning_rate": 4.645580722445704e-05, "loss": 0.8169011116027832, "mean_token_accuracy": 0.8096451237797737, "num_tokens": 20619214.0, "step": 10380 }, { "entropy": 0.8733599707484245, "epoch": 0.1866439125162797, "grad_norm": 8.0625, "learning_rate": 4.644842981402695e-05, "loss": 0.8992310523986816, "mean_token_accuracy": 0.781498996913433, "num_tokens": 20638825.0, "step": 10390 }, { "entropy": 0.9407279476523399, "epoch": 0.1868235505456505, "grad_norm": 5.84375, "learning_rate": 4.6441045320407276e-05, "loss": 0.9471444129943848, "mean_token_accuracy": 0.7787516072392464, "num_tokens": 20657920.0, "step": 10400 }, { "entropy": 0.9154140867292881, "epoch": 0.18700318857502132, "grad_norm": 7.65625, "learning_rate": 4.6433653746036696e-05, "loss": 0.9598176956176758, "mean_token_accuracy": 0.7760003358125687, "num_tokens": 20677170.0, "step": 10410 }, { "entropy": 0.9073328129947186, "epoch": 0.18718282660439214, "grad_norm": 7.40625, "learning_rate": 4.642625509335622e-05, "loss": 0.9268363952636719, "mean_token_accuracy": 0.7803513795137406, "num_tokens": 20696038.0, "step": 10420 }, { "entropy": 0.8684262469410896, "epoch": 0.18736246463376297, "grad_norm": 5.46875, "learning_rate": 4.64188493648092e-05, "loss": 0.8868843078613281, "mean_token_accuracy": 0.7954951122403144, "num_tokens": 20716309.0, "step": 10430 }, { "entropy": 0.918014845252037, "epoch": 0.1875421026631338, "grad_norm": 6.34375, "learning_rate": 4.641143656284133e-05, "loss": 0.9020030975341797, "mean_token_accuracy": 0.7870040729641914, "num_tokens": 20735924.0, "step": 10440 }, { "entropy": 0.9092310547828675, "epoch": 0.1877217406925046, "grad_norm": 9.1875, "learning_rate": 4.640401668990063e-05, "loss": 0.9500041961669922, "mean_token_accuracy": 0.7762953087687492, "num_tokens": 20754844.0, "step": 10450 }, { "entropy": 0.9070415891706943, "epoch": 0.18790137872187543, "grad_norm": 5.4375, "learning_rate": 4.639658974843746e-05, "loss": 0.9467242240905762, "mean_token_accuracy": 0.7788534298539161, "num_tokens": 20773990.0, "step": 10460 }, { "entropy": 0.8963094502687454, "epoch": 0.18808101675124625, "grad_norm": 9.4375, "learning_rate": 4.638915574090451e-05, "loss": 0.9309506416320801, "mean_token_accuracy": 0.7770019412040711, "num_tokens": 20793639.0, "step": 10470 }, { "entropy": 1.0263412542641164, "epoch": 0.18826065478061707, "grad_norm": 6.96875, "learning_rate": 4.638171466975682e-05, "loss": 1.053122615814209, "mean_token_accuracy": 0.7624891124665737, "num_tokens": 20813716.0, "step": 10480 }, { "entropy": 0.9137916810810566, "epoch": 0.18844029280998786, "grad_norm": 7.09375, "learning_rate": 4.637426653745174e-05, "loss": 0.9340500831604004, "mean_token_accuracy": 0.7687035456299782, "num_tokens": 20834462.0, "step": 10490 }, { "entropy": 0.8767765007913113, "epoch": 0.18861993083935868, "grad_norm": 6.75, "learning_rate": 4.636681134644896e-05, "loss": 0.897179126739502, "mean_token_accuracy": 0.783487931638956, "num_tokens": 20854620.0, "step": 10500 }, { "entropy": 0.8499530285596848, "epoch": 0.1887995688687295, "grad_norm": 5.90625, "learning_rate": 4.6359349099210505e-05, "loss": 0.8415807723999024, "mean_token_accuracy": 0.7923376768827438, "num_tokens": 20874108.0, "step": 10510 }, { "entropy": 0.8776728577911854, "epoch": 0.18897920689810033, "grad_norm": 6.1875, "learning_rate": 4.6351879798200734e-05, "loss": 0.902304744720459, "mean_token_accuracy": 0.7939081758260726, "num_tokens": 20894464.0, "step": 10520 }, { "entropy": 0.8587953537702561, "epoch": 0.18915884492747115, "grad_norm": 5.71875, "learning_rate": 4.6344403445886334e-05, "loss": 0.9612351417541504, "mean_token_accuracy": 0.7729480594396592, "num_tokens": 20913768.0, "step": 10530 }, { "entropy": 0.9976669743657112, "epoch": 0.18933848295684197, "grad_norm": 6.5, "learning_rate": 4.63369200447363e-05, "loss": 1.0563933372497558, "mean_token_accuracy": 0.7569487959146499, "num_tokens": 20933343.0, "step": 10540 }, { "entropy": 0.923011091351509, "epoch": 0.1895181209862128, "grad_norm": 5.3125, "learning_rate": 4.632942959722198e-05, "loss": 0.9680864334106445, "mean_token_accuracy": 0.7764596194028854, "num_tokens": 20951847.0, "step": 10550 }, { "entropy": 0.9453989893198014, "epoch": 0.1896977590155836, "grad_norm": 7.15625, "learning_rate": 4.632193210581704e-05, "loss": 0.9448729515075683, "mean_token_accuracy": 0.7815139219164848, "num_tokens": 20971638.0, "step": 10560 }, { "entropy": 1.0035074219107627, "epoch": 0.1898773970449544, "grad_norm": 7.3125, "learning_rate": 4.631442757299748e-05, "loss": 1.0361597061157226, "mean_token_accuracy": 0.7540891155600548, "num_tokens": 20990794.0, "step": 10570 }, { "entropy": 0.9517493501305581, "epoch": 0.19005703507432523, "grad_norm": 8.0625, "learning_rate": 4.630691600124161e-05, "loss": 0.9442025184631347, "mean_token_accuracy": 0.7785703375935554, "num_tokens": 21011265.0, "step": 10580 }, { "entropy": 0.8879652462899685, "epoch": 0.19023667310369605, "grad_norm": 7.96875, "learning_rate": 4.6299397393030075e-05, "loss": 0.9373575210571289, "mean_token_accuracy": 0.7772521086037159, "num_tokens": 21031432.0, "step": 10590 }, { "entropy": 0.9365950301289558, "epoch": 0.19041631113306687, "grad_norm": 8.5625, "learning_rate": 4.629187175084584e-05, "loss": 0.9817299842834473, "mean_token_accuracy": 0.7737820461392403, "num_tokens": 21050058.0, "step": 10600 }, { "entropy": 0.9550454951822758, "epoch": 0.1905959491624377, "grad_norm": 5.21875, "learning_rate": 4.628433907717419e-05, "loss": 0.9584936141967774, "mean_token_accuracy": 0.7790491640567779, "num_tokens": 21070387.0, "step": 10610 }, { "entropy": 0.8827878668904304, "epoch": 0.1907755871918085, "grad_norm": 6.28125, "learning_rate": 4.6276799374502744e-05, "loss": 0.8645289421081543, "mean_token_accuracy": 0.7939226984977722, "num_tokens": 21090799.0, "step": 10620 }, { "entropy": 0.9570800736546516, "epoch": 0.19095522522117933, "grad_norm": 7.8125, "learning_rate": 4.6269252645321425e-05, "loss": 0.9892303466796875, "mean_token_accuracy": 0.7694451868534088, "num_tokens": 21111151.0, "step": 10630 }, { "entropy": 0.8552551865577698, "epoch": 0.19113486325055015, "grad_norm": 6.6875, "learning_rate": 4.6261698892122496e-05, "loss": 0.8567474365234375, "mean_token_accuracy": 0.79371307939291, "num_tokens": 21131310.0, "step": 10640 }, { "entropy": 0.8782812021672726, "epoch": 0.19131450127992095, "grad_norm": 5.3125, "learning_rate": 4.625413811740053e-05, "loss": 0.9345088005065918, "mean_token_accuracy": 0.7743212327361106, "num_tokens": 21152138.0, "step": 10650 }, { "entropy": 0.9206596046686173, "epoch": 0.19149413930929177, "grad_norm": 5.25, "learning_rate": 4.6246570323652404e-05, "loss": 0.958531379699707, "mean_token_accuracy": 0.7713661819696427, "num_tokens": 21171264.0, "step": 10660 }, { "entropy": 0.9246576435863971, "epoch": 0.1916737773386626, "grad_norm": 4.625, "learning_rate": 4.623899551337735e-05, "loss": 0.921489143371582, "mean_token_accuracy": 0.7835305579006672, "num_tokens": 21192167.0, "step": 10670 }, { "entropy": 0.959288053959608, "epoch": 0.1918534153680334, "grad_norm": 6.1875, "learning_rate": 4.6231413689076876e-05, "loss": 0.9701106071472168, "mean_token_accuracy": 0.770016510039568, "num_tokens": 21211220.0, "step": 10680 }, { "entropy": 0.8775778666138649, "epoch": 0.19203305339740423, "grad_norm": 9.6875, "learning_rate": 4.622382485325483e-05, "loss": 0.958392333984375, "mean_token_accuracy": 0.7752549842000007, "num_tokens": 21230874.0, "step": 10690 }, { "entropy": 0.9155103363096714, "epoch": 0.19221269142677505, "grad_norm": 5.375, "learning_rate": 4.621622900841738e-05, "loss": 0.9071863174438477, "mean_token_accuracy": 0.7879876345396042, "num_tokens": 21250996.0, "step": 10700 }, { "entropy": 0.9597749948501587, "epoch": 0.19239232945614587, "grad_norm": 7.9375, "learning_rate": 4.620862615707298e-05, "loss": 0.9698691368103027, "mean_token_accuracy": 0.7723872274160385, "num_tokens": 21270578.0, "step": 10710 }, { "entropy": 0.8198323681950569, "epoch": 0.1925719674855167, "grad_norm": 4.96875, "learning_rate": 4.620101630173243e-05, "loss": 0.7743246555328369, "mean_token_accuracy": 0.8123441755771637, "num_tokens": 21291284.0, "step": 10720 }, { "entropy": 0.8347475752234459, "epoch": 0.19275160551488751, "grad_norm": 4.78125, "learning_rate": 4.619339944490883e-05, "loss": 0.8893527984619141, "mean_token_accuracy": 0.7908472135663033, "num_tokens": 21310945.0, "step": 10730 }, { "entropy": 0.8385367393493652, "epoch": 0.1929312435442583, "grad_norm": 6.46875, "learning_rate": 4.6185775589117594e-05, "loss": 0.8540879249572754, "mean_token_accuracy": 0.7914605081081391, "num_tokens": 21331112.0, "step": 10740 }, { "entropy": 0.9175145834684372, "epoch": 0.19311088157362913, "grad_norm": 6.0, "learning_rate": 4.617814473687643e-05, "loss": 0.9755760192871094, "mean_token_accuracy": 0.7762549720704556, "num_tokens": 21351718.0, "step": 10750 }, { "entropy": 0.9445755057036876, "epoch": 0.19329051960299995, "grad_norm": 5.75, "learning_rate": 4.617050689070539e-05, "loss": 0.9090581893920898, "mean_token_accuracy": 0.7907473109662533, "num_tokens": 21370590.0, "step": 10760 }, { "entropy": 0.8613024458289147, "epoch": 0.19347015763237077, "grad_norm": 4.90625, "learning_rate": 4.616286205312681e-05, "loss": 0.854987621307373, "mean_token_accuracy": 0.791745288670063, "num_tokens": 21390147.0, "step": 10770 }, { "entropy": 0.7588732674717903, "epoch": 0.1936497956617416, "grad_norm": 7.125, "learning_rate": 4.615521022666535e-05, "loss": 0.8054081916809082, "mean_token_accuracy": 0.8077579349279403, "num_tokens": 21410136.0, "step": 10780 }, { "entropy": 0.9653812102973461, "epoch": 0.1938294336911124, "grad_norm": 7.375, "learning_rate": 4.6147551413847956e-05, "loss": 1.036971378326416, "mean_token_accuracy": 0.7621015064418316, "num_tokens": 21431212.0, "step": 10790 }, { "entropy": 0.98788276091218, "epoch": 0.19400907172048323, "grad_norm": 10.8125, "learning_rate": 4.613988561720391e-05, "loss": 0.9979410171508789, "mean_token_accuracy": 0.7652235180139542, "num_tokens": 21450484.0, "step": 10800 }, { "entropy": 0.8375085666775703, "epoch": 0.19418870974985405, "grad_norm": 6.125, "learning_rate": 4.6132212839264765e-05, "loss": 0.8567901611328125, "mean_token_accuracy": 0.7948850840330124, "num_tokens": 21471132.0, "step": 10810 }, { "entropy": 0.8053878769278526, "epoch": 0.19436834777922485, "grad_norm": 4.0, "learning_rate": 4.6124533082564434e-05, "loss": 0.8006709098815918, "mean_token_accuracy": 0.8106097310781479, "num_tokens": 21491697.0, "step": 10820 }, { "entropy": 1.0332276977598667, "epoch": 0.19454798580859567, "grad_norm": 7.53125, "learning_rate": 4.611684634963908e-05, "loss": 1.1347893714904784, "mean_token_accuracy": 0.7474535003304481, "num_tokens": 21512177.0, "step": 10830 }, { "entropy": 0.8964815348386764, "epoch": 0.1947276238379665, "grad_norm": 6.6875, "learning_rate": 4.610915264302719e-05, "loss": 0.8832280158996582, "mean_token_accuracy": 0.7851007223129273, "num_tokens": 21532670.0, "step": 10840 }, { "entropy": 1.0005129784345628, "epoch": 0.1949072618673373, "grad_norm": 8.125, "learning_rate": 4.610145196526956e-05, "loss": 1.020705795288086, "mean_token_accuracy": 0.7706126257777214, "num_tokens": 21552174.0, "step": 10850 }, { "entropy": 0.820348034799099, "epoch": 0.19508689989670813, "grad_norm": 6.96875, "learning_rate": 4.609374431890928e-05, "loss": 0.8059733390808106, "mean_token_accuracy": 0.803258153796196, "num_tokens": 21571350.0, "step": 10860 }, { "entropy": 0.8472366109490395, "epoch": 0.19526653792607895, "grad_norm": 5.40625, "learning_rate": 4.608602970649175e-05, "loss": 0.8730942726135253, "mean_token_accuracy": 0.7821216896176338, "num_tokens": 21590937.0, "step": 10870 }, { "entropy": 0.826553588360548, "epoch": 0.19544617595544977, "grad_norm": 8.75, "learning_rate": 4.6078308130564665e-05, "loss": 0.8561902046203613, "mean_token_accuracy": 0.7990699172019958, "num_tokens": 21612347.0, "step": 10880 }, { "entropy": 0.8690866716206074, "epoch": 0.1956258139848206, "grad_norm": 5.25, "learning_rate": 4.607057959367802e-05, "loss": 0.8949705123901367, "mean_token_accuracy": 0.7854206740856171, "num_tokens": 21631843.0, "step": 10890 }, { "entropy": 0.9460312694311142, "epoch": 0.19580545201419142, "grad_norm": 6.03125, "learning_rate": 4.60628440983841e-05, "loss": 1.0245882987976074, "mean_token_accuracy": 0.7560961097478867, "num_tokens": 21650983.0, "step": 10900 }, { "entropy": 0.9562560014426709, "epoch": 0.1959850900435622, "grad_norm": 4.34375, "learning_rate": 4.605510164723751e-05, "loss": 0.9722962379455566, "mean_token_accuracy": 0.7684106647968292, "num_tokens": 21670621.0, "step": 10910 }, { "entropy": 0.9785911172628403, "epoch": 0.19616472807293303, "grad_norm": 7.34375, "learning_rate": 4.604735224279513e-05, "loss": 0.9742871284484863, "mean_token_accuracy": 0.7737636178731918, "num_tokens": 21690360.0, "step": 10920 }, { "entropy": 0.8847896374762059, "epoch": 0.19634436610230385, "grad_norm": 6.9375, "learning_rate": 4.603959588761615e-05, "loss": 0.8559576988220214, "mean_token_accuracy": 0.7961952418088913, "num_tokens": 21709743.0, "step": 10930 }, { "entropy": 0.8677625961601734, "epoch": 0.19652400413167467, "grad_norm": 7.21875, "learning_rate": 4.603183258426204e-05, "loss": 0.9095634460449219, "mean_token_accuracy": 0.78458052277565, "num_tokens": 21730160.0, "step": 10940 }, { "entropy": 0.901097447425127, "epoch": 0.1967036421610455, "grad_norm": 6.9375, "learning_rate": 4.602406233529659e-05, "loss": 0.9543604850769043, "mean_token_accuracy": 0.776050640642643, "num_tokens": 21749938.0, "step": 10950 }, { "entropy": 0.9408169202506542, "epoch": 0.19688328019041632, "grad_norm": 7.0625, "learning_rate": 4.6016285143285856e-05, "loss": 0.9706070899963379, "mean_token_accuracy": 0.7788687959313393, "num_tokens": 21770002.0, "step": 10960 }, { "entropy": 0.8664716377854347, "epoch": 0.19706291821978714, "grad_norm": 10.0625, "learning_rate": 4.600850101079821e-05, "loss": 0.8894480705261231, "mean_token_accuracy": 0.7916534319519997, "num_tokens": 21789813.0, "step": 10970 }, { "entropy": 0.8398127883672715, "epoch": 0.19724255624915796, "grad_norm": 6.21875, "learning_rate": 4.6000709940404296e-05, "loss": 0.8119674682617187, "mean_token_accuracy": 0.801940806210041, "num_tokens": 21808766.0, "step": 10980 }, { "entropy": 0.8680760376155376, "epoch": 0.19742219427852875, "grad_norm": 6.625, "learning_rate": 4.599291193467706e-05, "loss": 0.9252339363098144, "mean_token_accuracy": 0.776945061981678, "num_tokens": 21829032.0, "step": 10990 }, { "epoch": 0.19760183230789957, "eval_entropy": 0.8788281654119492, "eval_loss": 0.8879156708717346, "eval_mean_token_accuracy": 0.7868806464672089, "eval_num_tokens": 21848854.0, "eval_runtime": 40.5208, "eval_samples_per_second": 49.357, "eval_steps_per_second": 6.17, "step": 11000 }, { "entropy": 0.9209602098912001, "epoch": 0.1977814703372704, "grad_norm": 5.59375, "learning_rate": 4.5977295127525876e-05, "loss": 0.9637662887573242, "mean_token_accuracy": 0.7798609986901284, "num_tokens": 21867872.0, "step": 11010 }, { "entropy": 0.9289896786212921, "epoch": 0.19796110836664121, "grad_norm": 5.75, "learning_rate": 4.5969476331259266e-05, "loss": 0.8969556808471679, "mean_token_accuracy": 0.7833624616265297, "num_tokens": 21887621.0, "step": 11020 }, { "entropy": 0.9317864462733269, "epoch": 0.19814074639601204, "grad_norm": 5.875, "learning_rate": 4.5961650609974006e-05, "loss": 0.9004011154174805, "mean_token_accuracy": 0.7834533080458641, "num_tokens": 21907573.0, "step": 11030 }, { "entropy": 0.9031454622745514, "epoch": 0.19832038442538286, "grad_norm": 5.40625, "learning_rate": 4.595381796625449e-05, "loss": 0.9555165290832519, "mean_token_accuracy": 0.7760496199131012, "num_tokens": 21926828.0, "step": 11040 }, { "entropy": 0.9250333406031132, "epoch": 0.19850002245475368, "grad_norm": 9.75, "learning_rate": 4.5945978402687395e-05, "loss": 0.9731258392333985, "mean_token_accuracy": 0.7761249348521233, "num_tokens": 21945502.0, "step": 11050 }, { "entropy": 0.8963647350668907, "epoch": 0.1986796604841245, "grad_norm": 11.125, "learning_rate": 4.593813192186168e-05, "loss": 0.9551509857177735, "mean_token_accuracy": 0.7708211421966553, "num_tokens": 21964156.0, "step": 11060 }, { "entropy": 0.8488388136029243, "epoch": 0.19885929851349532, "grad_norm": 6.4375, "learning_rate": 4.5930278526368584e-05, "loss": 0.8046700477600097, "mean_token_accuracy": 0.8030500337481499, "num_tokens": 21983577.0, "step": 11070 }, { "entropy": 0.9691312938928605, "epoch": 0.1990389365428661, "grad_norm": 6.71875, "learning_rate": 4.592241821880163e-05, "loss": 0.9761872291564941, "mean_token_accuracy": 0.7622840806841851, "num_tokens": 22004651.0, "step": 11080 }, { "entropy": 0.8757909446954727, "epoch": 0.19921857457223693, "grad_norm": 7.21875, "learning_rate": 4.5914551001756646e-05, "loss": 0.9096345901489258, "mean_token_accuracy": 0.7778163269162178, "num_tokens": 22024582.0, "step": 11090 }, { "entropy": 0.9655227281153203, "epoch": 0.19939821260160775, "grad_norm": 4.625, "learning_rate": 4.590667687783171e-05, "loss": 0.9641009330749511, "mean_token_accuracy": 0.7781957976520062, "num_tokens": 22044410.0, "step": 11100 }, { "entropy": 0.8858931280672551, "epoch": 0.19957785063097858, "grad_norm": 6.84375, "learning_rate": 4.5898795849627194e-05, "loss": 0.8693421363830567, "mean_token_accuracy": 0.7945321410894394, "num_tokens": 22064626.0, "step": 11110 }, { "entropy": 0.7739857137203217, "epoch": 0.1997574886603494, "grad_norm": 8.6875, "learning_rate": 4.589090791974576e-05, "loss": 0.7859329223632813, "mean_token_accuracy": 0.8048031345009804, "num_tokens": 22084977.0, "step": 11120 }, { "entropy": 0.825855728238821, "epoch": 0.19993712668972022, "grad_norm": 7.1875, "learning_rate": 4.588301309079234e-05, "loss": 0.9059236526489258, "mean_token_accuracy": 0.7829899162054061, "num_tokens": 22105204.0, "step": 11130 }, { "entropy": 0.7788939066231251, "epoch": 0.20011676471909104, "grad_norm": 5.8125, "learning_rate": 4.5875111365374134e-05, "loss": 0.7993866920471191, "mean_token_accuracy": 0.7998276114463806, "num_tokens": 22125193.0, "step": 11140 }, { "entropy": 0.8257860995829105, "epoch": 0.20029640274846186, "grad_norm": 4.78125, "learning_rate": 4.5867202746100636e-05, "loss": 0.8266702651977539, "mean_token_accuracy": 0.797323040664196, "num_tokens": 22144556.0, "step": 11150 }, { "entropy": 0.9007250122725964, "epoch": 0.20047604077783265, "grad_norm": 7.40625, "learning_rate": 4.58592872355836e-05, "loss": 0.9284053802490234, "mean_token_accuracy": 0.7715675190091134, "num_tokens": 22164655.0, "step": 11160 }, { "entropy": 0.8784724034368991, "epoch": 0.20065567880720347, "grad_norm": 5.34375, "learning_rate": 4.585136483643709e-05, "loss": 0.882784366607666, "mean_token_accuracy": 0.7878041610121727, "num_tokens": 22183691.0, "step": 11170 }, { "entropy": 0.8141251787543297, "epoch": 0.2008353168365743, "grad_norm": 6.6875, "learning_rate": 4.5843435551277405e-05, "loss": 0.8255696296691895, "mean_token_accuracy": 0.8025176003575325, "num_tokens": 22203634.0, "step": 11180 }, { "entropy": 0.8806927412748337, "epoch": 0.20101495486594512, "grad_norm": 4.875, "learning_rate": 4.583549938272313e-05, "loss": 0.8752194404602051, "mean_token_accuracy": 0.7877620980143547, "num_tokens": 22222963.0, "step": 11190 }, { "entropy": 0.8817830346524715, "epoch": 0.20119459289531594, "grad_norm": 5.5625, "learning_rate": 4.582755633339514e-05, "loss": 0.9269624710083008, "mean_token_accuracy": 0.7841905288398265, "num_tokens": 22243710.0, "step": 11200 }, { "entropy": 0.9529386624693871, "epoch": 0.20137423092468676, "grad_norm": 8.25, "learning_rate": 4.581960640591656e-05, "loss": 0.9944866180419922, "mean_token_accuracy": 0.7648677222430706, "num_tokens": 22263922.0, "step": 11210 }, { "entropy": 0.9114404521882534, "epoch": 0.20155386895405758, "grad_norm": 5.46875, "learning_rate": 4.58116496029128e-05, "loss": 0.9124053955078125, "mean_token_accuracy": 0.7908343091607094, "num_tokens": 22284002.0, "step": 11220 }, { "entropy": 0.8170178420841694, "epoch": 0.2017335069834284, "grad_norm": 5.53125, "learning_rate": 4.580368592701155e-05, "loss": 0.8187215805053711, "mean_token_accuracy": 0.8034049019217491, "num_tokens": 22304298.0, "step": 11230 }, { "entropy": 0.7807209081947803, "epoch": 0.20191314501279922, "grad_norm": 4.9375, "learning_rate": 4.579571538084273e-05, "loss": 0.7871910095214844, "mean_token_accuracy": 0.8143251970410347, "num_tokens": 22323858.0, "step": 11240 }, { "entropy": 0.8423394210636616, "epoch": 0.20209278304217002, "grad_norm": 5.5625, "learning_rate": 4.578773796703858e-05, "loss": 0.8645644187927246, "mean_token_accuracy": 0.7933366313576699, "num_tokens": 22344688.0, "step": 11250 }, { "entropy": 0.9253683909773827, "epoch": 0.20227242107154084, "grad_norm": 9.3125, "learning_rate": 4.5779753688233565e-05, "loss": 1.0047744750976562, "mean_token_accuracy": 0.7710051968693733, "num_tokens": 22366475.0, "step": 11260 }, { "entropy": 0.9232454262673855, "epoch": 0.20245205910091166, "grad_norm": 5.375, "learning_rate": 4.577176254706445e-05, "loss": 0.9102578163146973, "mean_token_accuracy": 0.7746404260396957, "num_tokens": 22387377.0, "step": 11270 }, { "entropy": 0.842565505951643, "epoch": 0.20263169713028248, "grad_norm": 6.03125, "learning_rate": 4.576376454617024e-05, "loss": 0.8164196014404297, "mean_token_accuracy": 0.8009149223566056, "num_tokens": 22406862.0, "step": 11280 }, { "entropy": 0.9664469242095948, "epoch": 0.2028113351596533, "grad_norm": 6.03125, "learning_rate": 4.575575968819223e-05, "loss": 1.031270694732666, "mean_token_accuracy": 0.7514821663498878, "num_tokens": 22427367.0, "step": 11290 }, { "entropy": 0.9795466922223568, "epoch": 0.20299097318902412, "grad_norm": 8.4375, "learning_rate": 4.574774797577395e-05, "loss": 1.0498817443847657, "mean_token_accuracy": 0.7623425647616386, "num_tokens": 22446980.0, "step": 11300 }, { "entropy": 0.8971272014081478, "epoch": 0.20317061121839494, "grad_norm": 7.03125, "learning_rate": 4.5739729411561225e-05, "loss": 0.859313678741455, "mean_token_accuracy": 0.7944761261343956, "num_tokens": 22466988.0, "step": 11310 }, { "entropy": 0.9614310465753079, "epoch": 0.20335024924776576, "grad_norm": 5.25, "learning_rate": 4.573170399820213e-05, "loss": 0.9974462509155273, "mean_token_accuracy": 0.7657989799976349, "num_tokens": 22487321.0, "step": 11320 }, { "entropy": 0.8890015535056591, "epoch": 0.20352988727713656, "grad_norm": 6.09375, "learning_rate": 4.572367173834698e-05, "loss": 0.8796669960021972, "mean_token_accuracy": 0.7878701902925969, "num_tokens": 22506986.0, "step": 11330 }, { "entropy": 0.8429915435612202, "epoch": 0.20370952530650738, "grad_norm": 5.1875, "learning_rate": 4.5715632634648395e-05, "loss": 0.8574431419372559, "mean_token_accuracy": 0.7864844635128975, "num_tokens": 22526077.0, "step": 11340 }, { "entropy": 0.8833885349333286, "epoch": 0.2038891633358782, "grad_norm": 5.8125, "learning_rate": 4.5707586689761214e-05, "loss": 0.9213557243347168, "mean_token_accuracy": 0.7824743866920472, "num_tokens": 22545477.0, "step": 11350 }, { "entropy": 0.8574072010815144, "epoch": 0.20406880136524902, "grad_norm": 5.34375, "learning_rate": 4.569953390634257e-05, "loss": 0.8702330589294434, "mean_token_accuracy": 0.7950220510363579, "num_tokens": 22565993.0, "step": 11360 }, { "entropy": 0.883940476924181, "epoch": 0.20424843939461984, "grad_norm": 4.59375, "learning_rate": 4.569147428705182e-05, "loss": 0.9097959518432617, "mean_token_accuracy": 0.7870344892144203, "num_tokens": 22586012.0, "step": 11370 }, { "entropy": 0.966283518821001, "epoch": 0.20442807742399066, "grad_norm": 8.0, "learning_rate": 4.568340783455059e-05, "loss": 1.0267705917358398, "mean_token_accuracy": 0.7695122942328453, "num_tokens": 22607119.0, "step": 11380 }, { "entropy": 0.9584083452820777, "epoch": 0.20460771545336148, "grad_norm": 6.5, "learning_rate": 4.567533455150279e-05, "loss": 0.9550557136535645, "mean_token_accuracy": 0.771448640525341, "num_tokens": 22626702.0, "step": 11390 }, { "entropy": 0.9120221249759197, "epoch": 0.2047873534827323, "grad_norm": 6.75, "learning_rate": 4.566725444057455e-05, "loss": 0.9075155258178711, "mean_token_accuracy": 0.7838271245360374, "num_tokens": 22646645.0, "step": 11400 }, { "entropy": 0.8010118879377842, "epoch": 0.20496699151210312, "grad_norm": 6.0625, "learning_rate": 4.5659167504434264e-05, "loss": 0.8274785995483398, "mean_token_accuracy": 0.7890014976263047, "num_tokens": 22666564.0, "step": 11410 }, { "entropy": 0.8687062926590443, "epoch": 0.20514662954147392, "grad_norm": 7.09375, "learning_rate": 4.56510737457526e-05, "loss": 0.9017355918884278, "mean_token_accuracy": 0.7844808578491211, "num_tokens": 22687941.0, "step": 11420 }, { "entropy": 0.885517680644989, "epoch": 0.20532626757084474, "grad_norm": 7.0625, "learning_rate": 4.564297316720245e-05, "loss": 0.9004813194274902, "mean_token_accuracy": 0.7821603134274483, "num_tokens": 22707713.0, "step": 11430 }, { "entropy": 0.8573585227131844, "epoch": 0.20550590560021556, "grad_norm": 5.8125, "learning_rate": 4.563486577145898e-05, "loss": 0.9219475746154785, "mean_token_accuracy": 0.7881103307008743, "num_tokens": 22728096.0, "step": 11440 }, { "entropy": 0.9365617819130421, "epoch": 0.20568554362958638, "grad_norm": 6.9375, "learning_rate": 4.562675156119959e-05, "loss": 0.9951620101928711, "mean_token_accuracy": 0.7604023084044457, "num_tokens": 22746751.0, "step": 11450 }, { "entropy": 0.8300738863646984, "epoch": 0.2058651816589572, "grad_norm": 6.0, "learning_rate": 4.561863053910395e-05, "loss": 0.8131514549255371, "mean_token_accuracy": 0.8002211332321167, "num_tokens": 22766279.0, "step": 11460 }, { "entropy": 0.9336564019322395, "epoch": 0.20604481968832802, "grad_norm": 5.9375, "learning_rate": 4.561050270785396e-05, "loss": 0.9160529136657715, "mean_token_accuracy": 0.7857787400484085, "num_tokens": 22785884.0, "step": 11470 }, { "entropy": 0.8281168967485428, "epoch": 0.20622445771769884, "grad_norm": 7.5625, "learning_rate": 4.5602368070133794e-05, "loss": 0.7916419982910157, "mean_token_accuracy": 0.8017245307564735, "num_tokens": 22806077.0, "step": 11480 }, { "entropy": 0.9007447838783265, "epoch": 0.20640409574706967, "grad_norm": 7.84375, "learning_rate": 4.5594226628629834e-05, "loss": 0.8879066467285156, "mean_token_accuracy": 0.786144457757473, "num_tokens": 22825538.0, "step": 11490 }, { "entropy": 0.7842489652335644, "epoch": 0.20658373377644046, "grad_norm": 5.59375, "learning_rate": 4.558607838603075e-05, "loss": 0.8031447410583497, "mean_token_accuracy": 0.8001901626586914, "num_tokens": 22846178.0, "step": 11500 }, { "entropy": 0.8617790050804615, "epoch": 0.20676337180581128, "grad_norm": 6.9375, "learning_rate": 4.557792334502743e-05, "loss": 0.9158389091491699, "mean_token_accuracy": 0.7877695441246033, "num_tokens": 22865653.0, "step": 11510 }, { "entropy": 0.8902119196951389, "epoch": 0.2069430098351821, "grad_norm": 7.5, "learning_rate": 4.556976150831302e-05, "loss": 0.9528593063354492, "mean_token_accuracy": 0.7729435041546822, "num_tokens": 22884719.0, "step": 11520 }, { "entropy": 0.8985680162906646, "epoch": 0.20712264786455292, "grad_norm": 6.0, "learning_rate": 4.556159287858292e-05, "loss": 0.9034319877624511, "mean_token_accuracy": 0.7807430028915405, "num_tokens": 22905792.0, "step": 11530 }, { "entropy": 0.859601828455925, "epoch": 0.20730228589392374, "grad_norm": 5.53125, "learning_rate": 4.555341745853474e-05, "loss": 0.8416665077209473, "mean_token_accuracy": 0.7908956751227378, "num_tokens": 22926267.0, "step": 11540 }, { "entropy": 0.9283218637108803, "epoch": 0.20748192392329456, "grad_norm": 6.21875, "learning_rate": 4.5545235250868365e-05, "loss": 0.9314607620239258, "mean_token_accuracy": 0.7908827289938927, "num_tokens": 22947863.0, "step": 11550 }, { "entropy": 0.8506497517228127, "epoch": 0.20766156195266539, "grad_norm": 7.3125, "learning_rate": 4.553704625828592e-05, "loss": 0.8783835411071778, "mean_token_accuracy": 0.7937017478048801, "num_tokens": 22969396.0, "step": 11560 }, { "entropy": 0.8327492535114288, "epoch": 0.2078411999820362, "grad_norm": 6.15625, "learning_rate": 4.5528850483491746e-05, "loss": 0.8268207550048828, "mean_token_accuracy": 0.7945083320140839, "num_tokens": 22988583.0, "step": 11570 }, { "entropy": 0.9341848261654377, "epoch": 0.20802083801140703, "grad_norm": 5.6875, "learning_rate": 4.552064792919245e-05, "loss": 0.9600367546081543, "mean_token_accuracy": 0.7718945637345314, "num_tokens": 23009288.0, "step": 11580 }, { "entropy": 0.7509714752435684, "epoch": 0.20820047604077782, "grad_norm": 7.1875, "learning_rate": 4.5512438598096854e-05, "loss": 0.7658008098602295, "mean_token_accuracy": 0.8125150874257088, "num_tokens": 23030198.0, "step": 11590 }, { "entropy": 0.8244590133428573, "epoch": 0.20838011407014864, "grad_norm": 5.65625, "learning_rate": 4.550422249291603e-05, "loss": 0.8507304191589355, "mean_token_accuracy": 0.7967900648713112, "num_tokens": 23049564.0, "step": 11600 }, { "entropy": 0.8053080555051565, "epoch": 0.20855975209951946, "grad_norm": 5.78125, "learning_rate": 4.54959996163633e-05, "loss": 0.8656981468200684, "mean_token_accuracy": 0.787071841955185, "num_tokens": 23069041.0, "step": 11610 }, { "entropy": 0.803099624067545, "epoch": 0.20873939012889028, "grad_norm": 6.46875, "learning_rate": 4.5487769971154205e-05, "loss": 0.7804460048675537, "mean_token_accuracy": 0.8118880361318588, "num_tokens": 23089370.0, "step": 11620 }, { "entropy": 0.9415870226919651, "epoch": 0.2089190281582611, "grad_norm": 7.53125, "learning_rate": 4.547953356000652e-05, "loss": 0.9741015434265137, "mean_token_accuracy": 0.7798790514469147, "num_tokens": 23109675.0, "step": 11630 }, { "entropy": 0.8991717837750912, "epoch": 0.20909866618763193, "grad_norm": 6.84375, "learning_rate": 4.5471290385640276e-05, "loss": 0.93502197265625, "mean_token_accuracy": 0.782210287451744, "num_tokens": 23130478.0, "step": 11640 }, { "entropy": 0.798111055791378, "epoch": 0.20927830421700275, "grad_norm": 5.8125, "learning_rate": 4.54630404507777e-05, "loss": 0.8036151885986328, "mean_token_accuracy": 0.7982562229037284, "num_tokens": 23151515.0, "step": 11650 }, { "entropy": 0.9028390303254128, "epoch": 0.20945794224637357, "grad_norm": 5.375, "learning_rate": 4.5454783758143295e-05, "loss": 0.9040911674499512, "mean_token_accuracy": 0.7812075838446617, "num_tokens": 23172837.0, "step": 11660 }, { "entropy": 0.8002609081566334, "epoch": 0.20963758027574436, "grad_norm": 5.40625, "learning_rate": 4.544652031046376e-05, "loss": 0.7831881523132325, "mean_token_accuracy": 0.8047621518373489, "num_tokens": 23193080.0, "step": 11670 }, { "entropy": 0.9469489753246307, "epoch": 0.20981721830511518, "grad_norm": 6.125, "learning_rate": 4.5438250110468036e-05, "loss": 0.9466521263122558, "mean_token_accuracy": 0.7654821455478669, "num_tokens": 23213176.0, "step": 11680 }, { "entropy": 0.796565118432045, "epoch": 0.209996856334486, "grad_norm": 5.46875, "learning_rate": 4.542997316088732e-05, "loss": 0.8797205924987793, "mean_token_accuracy": 0.7918878197669983, "num_tokens": 23233369.0, "step": 11690 }, { "entropy": 0.9146947503089905, "epoch": 0.21017649436385683, "grad_norm": 7.71875, "learning_rate": 4.542168946445499e-05, "loss": 0.9108059883117676, "mean_token_accuracy": 0.7837534680962562, "num_tokens": 23252571.0, "step": 11700 }, { "entropy": 0.8756265386939048, "epoch": 0.21035613239322765, "grad_norm": 4.65625, "learning_rate": 4.541339902390669e-05, "loss": 0.8936793327331543, "mean_token_accuracy": 0.7886108085513115, "num_tokens": 23272706.0, "step": 11710 }, { "entropy": 0.8471706986427308, "epoch": 0.21053577042259847, "grad_norm": 5.1875, "learning_rate": 4.5405101841980266e-05, "loss": 0.8751951217651367, "mean_token_accuracy": 0.7870098739862442, "num_tokens": 23293553.0, "step": 11720 }, { "entropy": 0.8902305915951729, "epoch": 0.2107154084519693, "grad_norm": 4.46875, "learning_rate": 4.539679792141582e-05, "loss": 0.869639778137207, "mean_token_accuracy": 0.7864952832460403, "num_tokens": 23312878.0, "step": 11730 }, { "entropy": 0.8602326273918152, "epoch": 0.2108950464813401, "grad_norm": 6.78125, "learning_rate": 4.538848726495566e-05, "loss": 0.888673210144043, "mean_token_accuracy": 0.782754035294056, "num_tokens": 23333078.0, "step": 11740 }, { "entropy": 0.8880679443478584, "epoch": 0.21107468451071093, "grad_norm": 6.875, "learning_rate": 4.53801698753443e-05, "loss": 0.8646439552307129, "mean_token_accuracy": 0.790368628501892, "num_tokens": 23353434.0, "step": 11750 }, { "entropy": 0.7796212345361709, "epoch": 0.21125432254008172, "grad_norm": 5.375, "learning_rate": 4.537184575532853e-05, "loss": 0.7964162826538086, "mean_token_accuracy": 0.8108895421028137, "num_tokens": 23374564.0, "step": 11760 }, { "entropy": 0.9269380301237107, "epoch": 0.21143396056945254, "grad_norm": 8.5625, "learning_rate": 4.53635149076573e-05, "loss": 0.9741859436035156, "mean_token_accuracy": 0.7672837674617767, "num_tokens": 23395041.0, "step": 11770 }, { "entropy": 0.8324027925729751, "epoch": 0.21161359859882337, "grad_norm": 4.9375, "learning_rate": 4.535517733508183e-05, "loss": 0.8666191101074219, "mean_token_accuracy": 0.7994116529822349, "num_tokens": 23414320.0, "step": 11780 }, { "entropy": 0.7509162478148937, "epoch": 0.2117932366281942, "grad_norm": 5.84375, "learning_rate": 4.534683304035554e-05, "loss": 0.8079517364501954, "mean_token_accuracy": 0.8080166667699814, "num_tokens": 23433143.0, "step": 11790 }, { "entropy": 0.9041401676833629, "epoch": 0.211972874657565, "grad_norm": 6.25, "learning_rate": 4.5338482026234064e-05, "loss": 0.9419396400451661, "mean_token_accuracy": 0.7839539527893067, "num_tokens": 23454367.0, "step": 11800 }, { "entropy": 0.8956077970564366, "epoch": 0.21215251268693583, "grad_norm": 6.28125, "learning_rate": 4.533012429547528e-05, "loss": 0.9027382850646972, "mean_token_accuracy": 0.7832041651010513, "num_tokens": 23473264.0, "step": 11810 }, { "entropy": 0.9157611280679703, "epoch": 0.21233215071630665, "grad_norm": 5.0625, "learning_rate": 4.532175985083926e-05, "loss": 0.8620236396789551, "mean_token_accuracy": 0.7872451275587082, "num_tokens": 23493342.0, "step": 11820 }, { "entropy": 0.8748748458921909, "epoch": 0.21251178874567747, "grad_norm": 5.375, "learning_rate": 4.53133886950883e-05, "loss": 0.9250937461853027, "mean_token_accuracy": 0.7745199605822564, "num_tokens": 23512932.0, "step": 11830 }, { "entropy": 0.8910929664969445, "epoch": 0.21269142677504826, "grad_norm": 8.1875, "learning_rate": 4.530501083098692e-05, "loss": 0.9051648139953613, "mean_token_accuracy": 0.7787199780344963, "num_tokens": 23531845.0, "step": 11840 }, { "entropy": 0.8718089506030082, "epoch": 0.21287106480441909, "grad_norm": 5.0625, "learning_rate": 4.5296626261301845e-05, "loss": 0.8654747009277344, "mean_token_accuracy": 0.7920468553900719, "num_tokens": 23551421.0, "step": 11850 }, { "entropy": 0.8071680948138237, "epoch": 0.2130507028337899, "grad_norm": 5.65625, "learning_rate": 4.5288234988802015e-05, "loss": 0.8205275535583496, "mean_token_accuracy": 0.7986840844154358, "num_tokens": 23570403.0, "step": 11860 }, { "entropy": 0.8409905366599559, "epoch": 0.21323034086316073, "grad_norm": 5.625, "learning_rate": 4.5279837016258595e-05, "loss": 0.8703806877136231, "mean_token_accuracy": 0.7924432069063186, "num_tokens": 23589410.0, "step": 11870 }, { "entropy": 0.8105420738458633, "epoch": 0.21340997889253155, "grad_norm": 7.21875, "learning_rate": 4.5271432346444955e-05, "loss": 0.8503334999084473, "mean_token_accuracy": 0.7964959919452668, "num_tokens": 23610230.0, "step": 11880 }, { "entropy": 0.8245964542031288, "epoch": 0.21358961692190237, "grad_norm": 5.5, "learning_rate": 4.526302098213667e-05, "loss": 0.8177347183227539, "mean_token_accuracy": 0.7970363959670067, "num_tokens": 23630470.0, "step": 11890 }, { "entropy": 0.7978442572057247, "epoch": 0.2137692549512732, "grad_norm": 5.125, "learning_rate": 4.525460292611154e-05, "loss": 0.853847885131836, "mean_token_accuracy": 0.7944505468010903, "num_tokens": 23650379.0, "step": 11900 }, { "entropy": 0.9227809779345989, "epoch": 0.213948892980644, "grad_norm": 6.0, "learning_rate": 4.5246178181149556e-05, "loss": 0.9348913192749023, "mean_token_accuracy": 0.7690330147743225, "num_tokens": 23671313.0, "step": 11910 }, { "entropy": 0.885598923265934, "epoch": 0.21412853101001483, "grad_norm": 5.5, "learning_rate": 4.5237746750032945e-05, "loss": 0.8872857093811035, "mean_token_accuracy": 0.7929845601320267, "num_tokens": 23690640.0, "step": 11920 }, { "entropy": 0.8461043626070023, "epoch": 0.21430816903938563, "grad_norm": 6.0625, "learning_rate": 4.522930863554612e-05, "loss": 0.84425048828125, "mean_token_accuracy": 0.7933999031782151, "num_tokens": 23710825.0, "step": 11930 }, { "entropy": 0.8892766140401364, "epoch": 0.21448780706875645, "grad_norm": 5.3125, "learning_rate": 4.52208638404757e-05, "loss": 0.9082716941833496, "mean_token_accuracy": 0.7829471364617347, "num_tokens": 23730619.0, "step": 11940 }, { "entropy": 0.8075975857675075, "epoch": 0.21466744509812727, "grad_norm": 5.3125, "learning_rate": 4.5212412367610524e-05, "loss": 0.8088004112243652, "mean_token_accuracy": 0.8022006094455719, "num_tokens": 23750363.0, "step": 11950 }, { "entropy": 0.7650886200368404, "epoch": 0.2148470831274981, "grad_norm": 6.75, "learning_rate": 4.520395421974163e-05, "loss": 0.7765495777130127, "mean_token_accuracy": 0.8091513708233833, "num_tokens": 23769728.0, "step": 11960 }, { "entropy": 0.7986391887068749, "epoch": 0.2150267211568689, "grad_norm": 4.8125, "learning_rate": 4.519548939966226e-05, "loss": 0.8482050895690918, "mean_token_accuracy": 0.7979520753026008, "num_tokens": 23788994.0, "step": 11970 }, { "entropy": 0.8329289734363556, "epoch": 0.21520635918623973, "grad_norm": 6.90625, "learning_rate": 4.518701791016786e-05, "loss": 0.8150861740112305, "mean_token_accuracy": 0.8043266505002975, "num_tokens": 23807849.0, "step": 11980 }, { "entropy": 0.7797232665121555, "epoch": 0.21538599721561055, "grad_norm": 5.0625, "learning_rate": 4.517853975405608e-05, "loss": 0.8143875122070312, "mean_token_accuracy": 0.8019890189170837, "num_tokens": 23828150.0, "step": 11990 }, { "epoch": 0.21556563524498137, "eval_entropy": 0.8464146839380264, "eval_loss": 0.8452970385551453, "eval_mean_token_accuracy": 0.7959438359737396, "eval_num_tokens": 23848467.0, "eval_runtime": 40.578, "eval_samples_per_second": 49.288, "eval_steps_per_second": 6.161, "step": 12000 }, { "entropy": 0.8479792516678571, "epoch": 0.21574527327435217, "grad_norm": 9.125, "learning_rate": 4.516156345318198e-05, "loss": 0.875247573852539, "mean_token_accuracy": 0.7886293981224298, "num_tokens": 23866943.0, "step": 12010 }, { "entropy": 0.8574517481029034, "epoch": 0.215924911303723, "grad_norm": 5.4375, "learning_rate": 4.515306531402596e-05, "loss": 0.844296932220459, "mean_token_accuracy": 0.7944005832076073, "num_tokens": 23888828.0, "step": 12020 }, { "entropy": 0.8414042226970195, "epoch": 0.2161045493330938, "grad_norm": 5.625, "learning_rate": 4.514456051946516e-05, "loss": 0.8315954208374023, "mean_token_accuracy": 0.8022475019097328, "num_tokens": 23908019.0, "step": 12030 }, { "entropy": 0.8386501006782054, "epoch": 0.21628418736246463, "grad_norm": 5.71875, "learning_rate": 4.513604907230823e-05, "loss": 0.8816123008728027, "mean_token_accuracy": 0.7946676641702652, "num_tokens": 23927515.0, "step": 12040 }, { "entropy": 0.8604972586035728, "epoch": 0.21646382539183545, "grad_norm": 4.15625, "learning_rate": 4.5127530975366e-05, "loss": 0.866706657409668, "mean_token_accuracy": 0.7919363409280777, "num_tokens": 23949695.0, "step": 12050 }, { "entropy": 0.8096953980624676, "epoch": 0.21664346342120627, "grad_norm": 5.03125, "learning_rate": 4.511900623145152e-05, "loss": 0.7925299644470215, "mean_token_accuracy": 0.8021791979670525, "num_tokens": 23969585.0, "step": 12060 }, { "entropy": 0.8854925207793712, "epoch": 0.2168231014505771, "grad_norm": 7.09375, "learning_rate": 4.5110474843380036e-05, "loss": 0.9172743797302246, "mean_token_accuracy": 0.7840204879641532, "num_tokens": 23989799.0, "step": 12070 }, { "entropy": 0.796972592920065, "epoch": 0.21700273947994791, "grad_norm": 7.09375, "learning_rate": 4.510193681396896e-05, "loss": 0.8046932220458984, "mean_token_accuracy": 0.8079536944627762, "num_tokens": 24009301.0, "step": 12080 }, { "entropy": 0.8570881865918636, "epoch": 0.21718237750931874, "grad_norm": 5.59375, "learning_rate": 4.5093392146037935e-05, "loss": 0.8699812889099121, "mean_token_accuracy": 0.7916162610054016, "num_tokens": 24029046.0, "step": 12090 }, { "entropy": 0.8185301721096039, "epoch": 0.21736201553868953, "grad_norm": 6.96875, "learning_rate": 4.5084840842408746e-05, "loss": 0.7953297615051269, "mean_token_accuracy": 0.8010001286864281, "num_tokens": 24048559.0, "step": 12100 }, { "entropy": 0.7530040487647056, "epoch": 0.21754165356806035, "grad_norm": 6.25, "learning_rate": 4.507628290590543e-05, "loss": 0.7911427974700928, "mean_token_accuracy": 0.8138585031032562, "num_tokens": 24068416.0, "step": 12110 }, { "entropy": 0.8224557250738144, "epoch": 0.21772129159743117, "grad_norm": 4.3125, "learning_rate": 4.5067718339354173e-05, "loss": 0.8501961708068848, "mean_token_accuracy": 0.8008611887693405, "num_tokens": 24088278.0, "step": 12120 }, { "entropy": 0.7375212855637073, "epoch": 0.217900929626802, "grad_norm": 5.1875, "learning_rate": 4.5059147145583346e-05, "loss": 0.743773078918457, "mean_token_accuracy": 0.8217915192246437, "num_tokens": 24108905.0, "step": 12130 }, { "entropy": 0.8700596071779728, "epoch": 0.2180805676561728, "grad_norm": 4.90625, "learning_rate": 4.5050569327423554e-05, "loss": 0.8951065063476562, "mean_token_accuracy": 0.7870243668556214, "num_tokens": 24128774.0, "step": 12140 }, { "entropy": 0.8434512503445148, "epoch": 0.21826020568554363, "grad_norm": 6.03125, "learning_rate": 4.5041984887707527e-05, "loss": 0.8785881042480469, "mean_token_accuracy": 0.7928961955010891, "num_tokens": 24149531.0, "step": 12150 }, { "entropy": 0.8176505111157895, "epoch": 0.21843984371491446, "grad_norm": 5.625, "learning_rate": 4.5033393829270235e-05, "loss": 0.8494326591491699, "mean_token_accuracy": 0.7927245572209358, "num_tokens": 24171301.0, "step": 12160 }, { "entropy": 0.8252288304269314, "epoch": 0.21861948174428528, "grad_norm": 6.53125, "learning_rate": 4.502479615494881e-05, "loss": 0.8436321258544922, "mean_token_accuracy": 0.7965697005391121, "num_tokens": 24190613.0, "step": 12170 }, { "entropy": 0.8238121353089809, "epoch": 0.21879911977365607, "grad_norm": 6.09375, "learning_rate": 4.501619186758258e-05, "loss": 0.8353986740112305, "mean_token_accuracy": 0.80070820748806, "num_tokens": 24211586.0, "step": 12180 }, { "entropy": 0.8209795475006103, "epoch": 0.2189787578030269, "grad_norm": 5.375, "learning_rate": 4.500758097001303e-05, "loss": 0.804349422454834, "mean_token_accuracy": 0.8051554724574089, "num_tokens": 24230729.0, "step": 12190 }, { "entropy": 0.7983332190662622, "epoch": 0.2191583958323977, "grad_norm": 6.28125, "learning_rate": 4.4998963465083856e-05, "loss": 0.7756563186645508, "mean_token_accuracy": 0.8130069330334664, "num_tokens": 24250505.0, "step": 12200 }, { "entropy": 0.8395957559347152, "epoch": 0.21933803386176853, "grad_norm": 6.9375, "learning_rate": 4.4990339355640934e-05, "loss": 0.8581814765930176, "mean_token_accuracy": 0.7993357323110104, "num_tokens": 24269312.0, "step": 12210 }, { "entropy": 0.8188572727143765, "epoch": 0.21951767189113935, "grad_norm": 6.0, "learning_rate": 4.4981708644532305e-05, "loss": 0.8869921684265136, "mean_token_accuracy": 0.791328576952219, "num_tokens": 24289015.0, "step": 12220 }, { "entropy": 0.8390635289251804, "epoch": 0.21969730992051018, "grad_norm": 6.375, "learning_rate": 4.49730713346082e-05, "loss": 0.8982131958007813, "mean_token_accuracy": 0.7822622925043106, "num_tokens": 24309304.0, "step": 12230 }, { "entropy": 0.8575118318200111, "epoch": 0.219876947949881, "grad_norm": 5.96875, "learning_rate": 4.496442742872104e-05, "loss": 0.8457438468933105, "mean_token_accuracy": 0.7942942529916763, "num_tokens": 24328393.0, "step": 12240 }, { "entropy": 0.7731442593038083, "epoch": 0.22005658597925182, "grad_norm": 4.0, "learning_rate": 4.495577692972539e-05, "loss": 0.7842674732208252, "mean_token_accuracy": 0.8094912648200989, "num_tokens": 24348741.0, "step": 12250 }, { "entropy": 0.7967588119208813, "epoch": 0.22023622400862264, "grad_norm": 4.625, "learning_rate": 4.494711984047804e-05, "loss": 0.8280070304870606, "mean_token_accuracy": 0.8015093073248863, "num_tokens": 24367604.0, "step": 12260 }, { "entropy": 0.8123065695166588, "epoch": 0.22041586203799343, "grad_norm": 7.0625, "learning_rate": 4.493845616383791e-05, "loss": 0.8543951988220215, "mean_token_accuracy": 0.7966227486729622, "num_tokens": 24387296.0, "step": 12270 }, { "entropy": 0.8806727811694145, "epoch": 0.22059550006736425, "grad_norm": 5.96875, "learning_rate": 4.492978590266613e-05, "loss": 0.8688224792480469, "mean_token_accuracy": 0.7905280292034149, "num_tokens": 24407301.0, "step": 12280 }, { "entropy": 0.8444134458899498, "epoch": 0.22077513809673507, "grad_norm": 6.25, "learning_rate": 4.492110905982598e-05, "loss": 0.8337883949279785, "mean_token_accuracy": 0.8072254166007042, "num_tokens": 24426197.0, "step": 12290 }, { "entropy": 0.8585028409957886, "epoch": 0.2209547761261059, "grad_norm": 8.25, "learning_rate": 4.491242563818294e-05, "loss": 0.9325284957885742, "mean_token_accuracy": 0.7722136795520782, "num_tokens": 24444720.0, "step": 12300 }, { "entropy": 0.9239864327013493, "epoch": 0.22113441415547672, "grad_norm": 6.375, "learning_rate": 4.490373564060465e-05, "loss": 0.9178210258483886, "mean_token_accuracy": 0.7798847004771232, "num_tokens": 24465029.0, "step": 12310 }, { "entropy": 0.8193739831447602, "epoch": 0.22131405218484754, "grad_norm": 5.84375, "learning_rate": 4.48950390699609e-05, "loss": 0.8450372695922852, "mean_token_accuracy": 0.7999195009469986, "num_tokens": 24484109.0, "step": 12320 }, { "entropy": 0.8811383880674839, "epoch": 0.22149369021421836, "grad_norm": 8.125, "learning_rate": 4.488633592912368e-05, "loss": 0.8541461944580078, "mean_token_accuracy": 0.7896482035517692, "num_tokens": 24504292.0, "step": 12330 }, { "entropy": 0.9137931719422341, "epoch": 0.22167332824358918, "grad_norm": 7.25, "learning_rate": 4.487762622096714e-05, "loss": 0.9298038482666016, "mean_token_accuracy": 0.7718917161226273, "num_tokens": 24524072.0, "step": 12340 }, { "entropy": 0.8275380201637745, "epoch": 0.22185296627295997, "grad_norm": 5.34375, "learning_rate": 4.4868909948367596e-05, "loss": 0.8407528877258301, "mean_token_accuracy": 0.8019433960318565, "num_tokens": 24544271.0, "step": 12350 }, { "entropy": 0.7840126506984234, "epoch": 0.2220326043023308, "grad_norm": 4.28125, "learning_rate": 4.4860187114203534e-05, "loss": 0.8254824638366699, "mean_token_accuracy": 0.8082240000367165, "num_tokens": 24564515.0, "step": 12360 }, { "entropy": 0.8121642455458641, "epoch": 0.22221224233170161, "grad_norm": 5.0625, "learning_rate": 4.485145772135561e-05, "loss": 0.7950341701507568, "mean_token_accuracy": 0.805321016907692, "num_tokens": 24585731.0, "step": 12370 }, { "entropy": 0.8478195108473301, "epoch": 0.22239188036107244, "grad_norm": 7.75, "learning_rate": 4.484272177270664e-05, "loss": 0.8351319313049317, "mean_token_accuracy": 0.7944676846265792, "num_tokens": 24605350.0, "step": 12380 }, { "entropy": 0.8992158904671669, "epoch": 0.22257151839044326, "grad_norm": 5.15625, "learning_rate": 4.483397927114162e-05, "loss": 0.8890450477600098, "mean_token_accuracy": 0.7909966140985489, "num_tokens": 24624754.0, "step": 12390 }, { "entropy": 0.8411101944744587, "epoch": 0.22275115641981408, "grad_norm": 4.78125, "learning_rate": 4.482523021954768e-05, "loss": 0.9016767501831054, "mean_token_accuracy": 0.7933079645037651, "num_tokens": 24644294.0, "step": 12400 }, { "entropy": 0.8896338380873203, "epoch": 0.2229307944491849, "grad_norm": 7.46875, "learning_rate": 4.481647462081414e-05, "loss": 0.8993163108825684, "mean_token_accuracy": 0.789176182448864, "num_tokens": 24663927.0, "step": 12410 }, { "entropy": 0.7691617041826249, "epoch": 0.22311043247855572, "grad_norm": 7.34375, "learning_rate": 4.4807712477832476e-05, "loss": 0.7881993293762207, "mean_token_accuracy": 0.8030701950192451, "num_tokens": 24683665.0, "step": 12420 }, { "entropy": 0.7974100209772587, "epoch": 0.22329007050792654, "grad_norm": 5.40625, "learning_rate": 4.4798943793496325e-05, "loss": 0.8093111038208007, "mean_token_accuracy": 0.8029956519603729, "num_tokens": 24704145.0, "step": 12430 }, { "entropy": 0.9408095441758633, "epoch": 0.22346970853729733, "grad_norm": 9.0, "learning_rate": 4.479016857070147e-05, "loss": 0.9576236724853515, "mean_token_accuracy": 0.7741116255521774, "num_tokens": 24723945.0, "step": 12440 }, { "entropy": 0.8627887338399887, "epoch": 0.22364934656666816, "grad_norm": 8.8125, "learning_rate": 4.478138681234587e-05, "loss": 0.9228914260864258, "mean_token_accuracy": 0.7747398644685746, "num_tokens": 24742979.0, "step": 12450 }, { "entropy": 0.9155248194932938, "epoch": 0.22382898459603898, "grad_norm": 6.25, "learning_rate": 4.477259852132964e-05, "loss": 0.8994830131530762, "mean_token_accuracy": 0.7837437972426414, "num_tokens": 24763656.0, "step": 12460 }, { "entropy": 0.8223226211965085, "epoch": 0.2240086226254098, "grad_norm": 8.25, "learning_rate": 4.476380370055506e-05, "loss": 0.851894760131836, "mean_token_accuracy": 0.7952192440629006, "num_tokens": 24783643.0, "step": 12470 }, { "entropy": 0.7979088582098484, "epoch": 0.22418826065478062, "grad_norm": 5.1875, "learning_rate": 4.4755002352926536e-05, "loss": 0.8254804611206055, "mean_token_accuracy": 0.7957828283309937, "num_tokens": 24803589.0, "step": 12480 }, { "entropy": 0.8761582091450691, "epoch": 0.22436789868415144, "grad_norm": 4.96875, "learning_rate": 4.4746194481350656e-05, "loss": 0.8574308395385742, "mean_token_accuracy": 0.7925078794360161, "num_tokens": 24824087.0, "step": 12490 }, { "entropy": 0.8385453555732966, "epoch": 0.22454753671352226, "grad_norm": 6.5625, "learning_rate": 4.473738008873617e-05, "loss": 0.8114017486572266, "mean_token_accuracy": 0.8024143561720848, "num_tokens": 24844133.0, "step": 12500 }, { "entropy": 0.8314867570996285, "epoch": 0.22472717474289308, "grad_norm": 5.90625, "learning_rate": 4.472855917799395e-05, "loss": 0.843207836151123, "mean_token_accuracy": 0.7980601876974106, "num_tokens": 24865332.0, "step": 12510 }, { "entropy": 0.7927067019045353, "epoch": 0.22490681277226388, "grad_norm": 5.40625, "learning_rate": 4.4719731752037046e-05, "loss": 0.8535285949707031, "mean_token_accuracy": 0.7969173178076744, "num_tokens": 24885192.0, "step": 12520 }, { "entropy": 0.8247241027653217, "epoch": 0.2250864508016347, "grad_norm": 4.3125, "learning_rate": 4.4710897813780654e-05, "loss": 0.857239055633545, "mean_token_accuracy": 0.7954294830560684, "num_tokens": 24904529.0, "step": 12530 }, { "entropy": 0.782114976644516, "epoch": 0.22526608883100552, "grad_norm": 6.59375, "learning_rate": 4.470205736614212e-05, "loss": 0.7867801666259766, "mean_token_accuracy": 0.8075640633702278, "num_tokens": 24923966.0, "step": 12540 }, { "entropy": 0.8624099388718605, "epoch": 0.22544572686037634, "grad_norm": 6.03125, "learning_rate": 4.469321041204093e-05, "loss": 0.8868124961853028, "mean_token_accuracy": 0.7884203091263771, "num_tokens": 24943864.0, "step": 12550 }, { "entropy": 0.7803060226142406, "epoch": 0.22562536488974716, "grad_norm": 6.03125, "learning_rate": 4.4684356954398725e-05, "loss": 0.8262887001037598, "mean_token_accuracy": 0.8020025327801704, "num_tokens": 24963770.0, "step": 12560 }, { "entropy": 0.8649819917976856, "epoch": 0.22580500291911798, "grad_norm": 6.5625, "learning_rate": 4.467549699613931e-05, "loss": 0.9401711463928223, "mean_token_accuracy": 0.7824192769825459, "num_tokens": 24983392.0, "step": 12570 }, { "entropy": 0.9410753034055233, "epoch": 0.2259846409484888, "grad_norm": 5.9375, "learning_rate": 4.466663054018861e-05, "loss": 1.0132086753845215, "mean_token_accuracy": 0.7755438074469566, "num_tokens": 25003105.0, "step": 12580 }, { "entropy": 0.877509132027626, "epoch": 0.22616427897785962, "grad_norm": 7.125, "learning_rate": 4.465775758947471e-05, "loss": 0.8720463752746582, "mean_token_accuracy": 0.7866893485188484, "num_tokens": 25021863.0, "step": 12590 }, { "entropy": 0.9339281156659126, "epoch": 0.22634391700723044, "grad_norm": 6.40625, "learning_rate": 4.4648878146927845e-05, "loss": 0.921604061126709, "mean_token_accuracy": 0.7866102978587151, "num_tokens": 25041952.0, "step": 12600 }, { "entropy": 0.904553259909153, "epoch": 0.22652355503660124, "grad_norm": 5.5625, "learning_rate": 4.463999221548039e-05, "loss": 0.8969251632690429, "mean_token_accuracy": 0.7922039024531842, "num_tokens": 25062308.0, "step": 12610 }, { "entropy": 0.7811459705233574, "epoch": 0.22670319306597206, "grad_norm": 5.28125, "learning_rate": 4.463109979806684e-05, "loss": 0.8446714401245117, "mean_token_accuracy": 0.8029682204127312, "num_tokens": 25080841.0, "step": 12620 }, { "entropy": 0.9139662891626358, "epoch": 0.22688283109534288, "grad_norm": 5.90625, "learning_rate": 4.462220089762387e-05, "loss": 0.9217382431030273, "mean_token_accuracy": 0.7815721467137337, "num_tokens": 25100418.0, "step": 12630 }, { "entropy": 0.8794430300593377, "epoch": 0.2270624691247137, "grad_norm": 6.53125, "learning_rate": 4.461329551709027e-05, "loss": 0.8852977752685547, "mean_token_accuracy": 0.7826037406921387, "num_tokens": 25120256.0, "step": 12640 }, { "entropy": 0.877899319678545, "epoch": 0.22724210715408452, "grad_norm": 7.4375, "learning_rate": 4.460438365940698e-05, "loss": 0.8553321838378907, "mean_token_accuracy": 0.7954798057675362, "num_tokens": 25139531.0, "step": 12650 }, { "entropy": 0.7066783405840397, "epoch": 0.22742174518345534, "grad_norm": 6.46875, "learning_rate": 4.459546532751708e-05, "loss": 0.7618896961212158, "mean_token_accuracy": 0.8173317685723305, "num_tokens": 25158992.0, "step": 12660 }, { "entropy": 0.7926855161786079, "epoch": 0.22760138321282616, "grad_norm": 7.875, "learning_rate": 4.4586540524365775e-05, "loss": 0.8324318885803222, "mean_token_accuracy": 0.8025322109460831, "num_tokens": 25178117.0, "step": 12670 }, { "entropy": 0.8477311000227928, "epoch": 0.22778102124219698, "grad_norm": 5.90625, "learning_rate": 4.457760925290043e-05, "loss": 0.8981081962585449, "mean_token_accuracy": 0.7870203867554665, "num_tokens": 25199253.0, "step": 12680 }, { "entropy": 0.79274223446846, "epoch": 0.22796065927156778, "grad_norm": 4.0, "learning_rate": 4.4568671516070523e-05, "loss": 0.8021099090576171, "mean_token_accuracy": 0.8121156215667724, "num_tokens": 25219354.0, "step": 12690 }, { "entropy": 0.9788394019007682, "epoch": 0.2281402973009386, "grad_norm": 5.375, "learning_rate": 4.455972731682769e-05, "loss": 0.9878940582275391, "mean_token_accuracy": 0.7678033530712127, "num_tokens": 25240953.0, "step": 12700 }, { "entropy": 0.9230789631605149, "epoch": 0.22831993533030942, "grad_norm": 6.125, "learning_rate": 4.455077665812567e-05, "loss": 0.9540598869323731, "mean_token_accuracy": 0.7733573749661445, "num_tokens": 25260118.0, "step": 12710 }, { "entropy": 0.8246907591819763, "epoch": 0.22849957335968024, "grad_norm": 5.6875, "learning_rate": 4.454181954292036e-05, "loss": 0.8094210624694824, "mean_token_accuracy": 0.8006536200642586, "num_tokens": 25279782.0, "step": 12720 }, { "entropy": 0.8479666955769062, "epoch": 0.22867921138905106, "grad_norm": 5.5, "learning_rate": 4.45328559741698e-05, "loss": 0.8293931961059571, "mean_token_accuracy": 0.7997950077056885, "num_tokens": 25299892.0, "step": 12730 }, { "entropy": 0.8010788090527058, "epoch": 0.22885884941842188, "grad_norm": 6.1875, "learning_rate": 4.452388595483412e-05, "loss": 0.7823635578155518, "mean_token_accuracy": 0.8061694011092186, "num_tokens": 25318977.0, "step": 12740 }, { "entropy": 0.8933595702052116, "epoch": 0.2290384874477927, "grad_norm": 5.0625, "learning_rate": 4.4514909487875624e-05, "loss": 0.9494735717773437, "mean_token_accuracy": 0.7759922675788402, "num_tokens": 25338326.0, "step": 12750 }, { "entropy": 0.8753757774829865, "epoch": 0.22921812547716353, "grad_norm": 10.75, "learning_rate": 4.450592657625871e-05, "loss": 0.9691245079040527, "mean_token_accuracy": 0.7673906400799752, "num_tokens": 25357082.0, "step": 12760 }, { "entropy": 0.8472864843904973, "epoch": 0.22939776350653435, "grad_norm": 6.0, "learning_rate": 4.449693722294992e-05, "loss": 0.8274935722351074, "mean_token_accuracy": 0.794508482515812, "num_tokens": 25376120.0, "step": 12770 }, { "entropy": 0.8558566257357597, "epoch": 0.22957740153590514, "grad_norm": 6.6875, "learning_rate": 4.448794143091793e-05, "loss": 0.8903715133666992, "mean_token_accuracy": 0.7848844036459923, "num_tokens": 25396376.0, "step": 12780 }, { "entropy": 0.8676431268453598, "epoch": 0.22975703956527596, "grad_norm": 5.34375, "learning_rate": 4.447893920313355e-05, "loss": 0.8301250457763671, "mean_token_accuracy": 0.8004786998033524, "num_tokens": 25416156.0, "step": 12790 }, { "entropy": 0.8249128334224224, "epoch": 0.22993667759464678, "grad_norm": 4.375, "learning_rate": 4.446993054256967e-05, "loss": 0.8252821922302246, "mean_token_accuracy": 0.8049804523587227, "num_tokens": 25436968.0, "step": 12800 }, { "entropy": 0.8511012464761734, "epoch": 0.2301163156240176, "grad_norm": 6.75, "learning_rate": 4.446091545220136e-05, "loss": 0.873869514465332, "mean_token_accuracy": 0.7804472506046295, "num_tokens": 25457658.0, "step": 12810 }, { "entropy": 0.8360457956790924, "epoch": 0.23029595365338842, "grad_norm": 6.25, "learning_rate": 4.445189393500577e-05, "loss": 0.8606691360473633, "mean_token_accuracy": 0.7959957838058471, "num_tokens": 25476351.0, "step": 12820 }, { "entropy": 0.831702147424221, "epoch": 0.23047559168275925, "grad_norm": 5.125, "learning_rate": 4.4442865993962215e-05, "loss": 0.8223786354064941, "mean_token_accuracy": 0.8010449886322022, "num_tokens": 25495937.0, "step": 12830 }, { "entropy": 0.8353251658380032, "epoch": 0.23065522971213007, "grad_norm": 9.75, "learning_rate": 4.443383163205208e-05, "loss": 0.8224445343017578, "mean_token_accuracy": 0.7952178120613098, "num_tokens": 25515360.0, "step": 12840 }, { "entropy": 0.7540961034595967, "epoch": 0.2308348677415009, "grad_norm": 4.71875, "learning_rate": 4.4424790852258925e-05, "loss": 0.7488266944885253, "mean_token_accuracy": 0.8184132441878319, "num_tokens": 25535112.0, "step": 12850 }, { "entropy": 0.854656008630991, "epoch": 0.23101450577087168, "grad_norm": 4.9375, "learning_rate": 4.4415743657568374e-05, "loss": 0.9016470909118652, "mean_token_accuracy": 0.7882017225027085, "num_tokens": 25553352.0, "step": 12860 }, { "entropy": 0.8081205911934376, "epoch": 0.2311941438002425, "grad_norm": 6.03125, "learning_rate": 4.4406690050968224e-05, "loss": 0.8460009574890137, "mean_token_accuracy": 0.7893910720944405, "num_tokens": 25573937.0, "step": 12870 }, { "entropy": 0.8350037544965744, "epoch": 0.23137378182961332, "grad_norm": 7.5625, "learning_rate": 4.439763003544835e-05, "loss": 0.8450263023376465, "mean_token_accuracy": 0.8000707551836967, "num_tokens": 25593783.0, "step": 12880 }, { "entropy": 0.8313210375607014, "epoch": 0.23155341985898414, "grad_norm": 6.9375, "learning_rate": 4.4388563614000756e-05, "loss": 0.830899715423584, "mean_token_accuracy": 0.8053499922156334, "num_tokens": 25612475.0, "step": 12890 }, { "entropy": 0.8646220825612545, "epoch": 0.23173305788835497, "grad_norm": 6.125, "learning_rate": 4.4379490789619574e-05, "loss": 0.8717094421386719, "mean_token_accuracy": 0.7907189726829529, "num_tokens": 25631839.0, "step": 12900 }, { "entropy": 0.8579128488898278, "epoch": 0.2319126959177258, "grad_norm": 5.84375, "learning_rate": 4.4370411565301015e-05, "loss": 0.8247678756713868, "mean_token_accuracy": 0.8076560109853744, "num_tokens": 25651009.0, "step": 12910 }, { "entropy": 0.8028069369494915, "epoch": 0.2320923339470966, "grad_norm": 5.84375, "learning_rate": 4.4361325944043455e-05, "loss": 0.8240917205810547, "mean_token_accuracy": 0.7966988205909729, "num_tokens": 25669922.0, "step": 12920 }, { "entropy": 0.7637861631810665, "epoch": 0.23227197197646743, "grad_norm": 5.25, "learning_rate": 4.435223392884734e-05, "loss": 0.8295699119567871, "mean_token_accuracy": 0.8057667642831803, "num_tokens": 25690500.0, "step": 12930 }, { "entropy": 0.802569330483675, "epoch": 0.23245161000583825, "grad_norm": 4.59375, "learning_rate": 4.434313552271525e-05, "loss": 0.8176230430603028, "mean_token_accuracy": 0.8051825419068337, "num_tokens": 25711981.0, "step": 12940 }, { "entropy": 0.8870356164872646, "epoch": 0.23263124803520904, "grad_norm": 5.0625, "learning_rate": 4.4334030728651854e-05, "loss": 0.8993595123291016, "mean_token_accuracy": 0.787372249364853, "num_tokens": 25731738.0, "step": 12950 }, { "entropy": 0.8762515470385551, "epoch": 0.23281088606457986, "grad_norm": 6.46875, "learning_rate": 4.4324919549663964e-05, "loss": 0.8683287620544433, "mean_token_accuracy": 0.7880354702472687, "num_tokens": 25751894.0, "step": 12960 }, { "entropy": 0.8842963829636574, "epoch": 0.23299052409395068, "grad_norm": 6.96875, "learning_rate": 4.431580198876046e-05, "loss": 0.9580388069152832, "mean_token_accuracy": 0.7765140473842621, "num_tokens": 25772582.0, "step": 12970 }, { "entropy": 0.7793270118534565, "epoch": 0.2331701621233215, "grad_norm": 5.28125, "learning_rate": 4.430667804895238e-05, "loss": 0.7752094268798828, "mean_token_accuracy": 0.8184760630130767, "num_tokens": 25791605.0, "step": 12980 }, { "entropy": 0.8661415778100491, "epoch": 0.23334980015269233, "grad_norm": 4.90625, "learning_rate": 4.429754773325281e-05, "loss": 0.8656119346618653, "mean_token_accuracy": 0.8004096314311028, "num_tokens": 25812293.0, "step": 12990 }, { "epoch": 0.23352943818206315, "eval_entropy": 0.8022053318023682, "eval_loss": 0.8216367959976196, "eval_mean_token_accuracy": 0.8034624741077423, "eval_num_tokens": 25831861.0, "eval_runtime": 40.5239, "eval_samples_per_second": 49.354, "eval_steps_per_second": 6.169, "step": 13000 }, { "entropy": 0.8294111751019955, "epoch": 0.23370907621143397, "grad_norm": 6.9375, "learning_rate": 4.4279267986242234e-05, "loss": 0.8443568229675293, "mean_token_accuracy": 0.7993490062654018, "num_tokens": 25850942.0, "step": 13010 }, { "entropy": 0.7961078353226185, "epoch": 0.2338887142408048, "grad_norm": 5.59375, "learning_rate": 4.427011856096798e-05, "loss": 0.839866828918457, "mean_token_accuracy": 0.808353939652443, "num_tokens": 25871033.0, "step": 13020 }, { "entropy": 0.8532736130058766, "epoch": 0.23406835227017558, "grad_norm": 5.65625, "learning_rate": 4.4260962771875746e-05, "loss": 0.8963590621948242, "mean_token_accuracy": 0.7935997501015664, "num_tokens": 25891614.0, "step": 13030 }, { "entropy": 0.778396725654602, "epoch": 0.2342479902995464, "grad_norm": 7.0, "learning_rate": 4.4251800621989184e-05, "loss": 0.7322530269622802, "mean_token_accuracy": 0.8226825997233391, "num_tokens": 25911040.0, "step": 13040 }, { "entropy": 0.826403621584177, "epoch": 0.23442762832891723, "grad_norm": 7.96875, "learning_rate": 4.424263211433402e-05, "loss": 0.8655001640319824, "mean_token_accuracy": 0.7976618558168411, "num_tokens": 25930698.0, "step": 13050 }, { "entropy": 0.8097852259874344, "epoch": 0.23460726635828805, "grad_norm": 6.03125, "learning_rate": 4.423345725193808e-05, "loss": 0.8429778099060059, "mean_token_accuracy": 0.7988743856549263, "num_tokens": 25951499.0, "step": 13060 }, { "entropy": 0.8602092564105988, "epoch": 0.23478690438765887, "grad_norm": 6.34375, "learning_rate": 4.4224276037831314e-05, "loss": 0.8577801704406738, "mean_token_accuracy": 0.7953047916293144, "num_tokens": 25971205.0, "step": 13070 }, { "entropy": 0.8327577278017998, "epoch": 0.2349665424170297, "grad_norm": 5.6875, "learning_rate": 4.421508847504574e-05, "loss": 0.8539166450500488, "mean_token_accuracy": 0.7880702629685402, "num_tokens": 25991494.0, "step": 13080 }, { "entropy": 0.8312172628939152, "epoch": 0.2351461804464005, "grad_norm": 7.5625, "learning_rate": 4.420589456661548e-05, "loss": 0.8287091255187988, "mean_token_accuracy": 0.8004522904753685, "num_tokens": 26010275.0, "step": 13090 }, { "entropy": 0.7685111060738563, "epoch": 0.23532581847577133, "grad_norm": 7.40625, "learning_rate": 4.419669431557676e-05, "loss": 0.7482511520385742, "mean_token_accuracy": 0.8192949175834656, "num_tokens": 26030801.0, "step": 13100 }, { "entropy": 0.8228398337960243, "epoch": 0.23550545650514215, "grad_norm": 7.09375, "learning_rate": 4.4187487724967905e-05, "loss": 0.9251422882080078, "mean_token_accuracy": 0.7824779823422432, "num_tokens": 26051236.0, "step": 13110 }, { "entropy": 0.7810831367969513, "epoch": 0.23568509453451295, "grad_norm": 6.15625, "learning_rate": 4.4178274797829324e-05, "loss": 0.8000071525573731, "mean_token_accuracy": 0.800956991314888, "num_tokens": 26070429.0, "step": 13120 }, { "entropy": 0.8344467595219612, "epoch": 0.23586473256388377, "grad_norm": 5.0, "learning_rate": 4.41690555372035e-05, "loss": 0.8428084373474121, "mean_token_accuracy": 0.8010011479258538, "num_tokens": 26090936.0, "step": 13130 }, { "entropy": 0.8300610117614269, "epoch": 0.2360443705932546, "grad_norm": 5.5, "learning_rate": 4.415982994613505e-05, "loss": 0.8459264755249023, "mean_token_accuracy": 0.7962104439735412, "num_tokens": 26110516.0, "step": 13140 }, { "entropy": 0.8765744000673295, "epoch": 0.2362240086226254, "grad_norm": 5.6875, "learning_rate": 4.4150598027670654e-05, "loss": 0.8630064964294434, "mean_token_accuracy": 0.7884830616414547, "num_tokens": 26132150.0, "step": 13150 }, { "entropy": 0.9264851808547974, "epoch": 0.23640364665199623, "grad_norm": 6.625, "learning_rate": 4.414135978485908e-05, "loss": 0.9343637466430664, "mean_token_accuracy": 0.776537823677063, "num_tokens": 26152423.0, "step": 13160 }, { "entropy": 0.8725615873932838, "epoch": 0.23658328468136705, "grad_norm": 6.46875, "learning_rate": 4.41321152207512e-05, "loss": 0.9374333381652832, "mean_token_accuracy": 0.7747077733278275, "num_tokens": 26171500.0, "step": 13170 }, { "entropy": 0.837825221568346, "epoch": 0.23676292271073787, "grad_norm": 4.9375, "learning_rate": 4.412286433839995e-05, "loss": 0.8546714782714844, "mean_token_accuracy": 0.795743516087532, "num_tokens": 26190506.0, "step": 13180 }, { "entropy": 0.8153563156723976, "epoch": 0.2369425607401087, "grad_norm": 6.03125, "learning_rate": 4.411360714086038e-05, "loss": 0.8052280426025391, "mean_token_accuracy": 0.801672175526619, "num_tokens": 26210199.0, "step": 13190 }, { "entropy": 0.7945010028779507, "epoch": 0.2371221987694795, "grad_norm": 4.3125, "learning_rate": 4.4104343631189614e-05, "loss": 0.8012173652648926, "mean_token_accuracy": 0.8045805335044861, "num_tokens": 26230514.0, "step": 13200 }, { "entropy": 0.8502820879220963, "epoch": 0.2373018367988503, "grad_norm": 5.625, "learning_rate": 4.409507381244686e-05, "loss": 0.8486570358276367, "mean_token_accuracy": 0.8026246711611748, "num_tokens": 26251549.0, "step": 13210 }, { "entropy": 0.8523926630616188, "epoch": 0.23748147482822113, "grad_norm": 6.4375, "learning_rate": 4.4085797687693394e-05, "loss": 0.9124655723571777, "mean_token_accuracy": 0.7897864326834678, "num_tokens": 26271989.0, "step": 13220 }, { "entropy": 0.8423567868769168, "epoch": 0.23766111285759195, "grad_norm": 5.09375, "learning_rate": 4.4076515259992614e-05, "loss": 0.8454095840454101, "mean_token_accuracy": 0.8019152909517289, "num_tokens": 26291672.0, "step": 13230 }, { "entropy": 0.8563370063900948, "epoch": 0.23784075088696277, "grad_norm": 5.84375, "learning_rate": 4.406722653240995e-05, "loss": 0.8178421974182128, "mean_token_accuracy": 0.804261839389801, "num_tokens": 26311822.0, "step": 13240 }, { "entropy": 0.8608871519565582, "epoch": 0.2380203889163336, "grad_norm": 6.90625, "learning_rate": 4.405793150801295e-05, "loss": 0.9165966033935546, "mean_token_accuracy": 0.7838574834167957, "num_tokens": 26331384.0, "step": 13250 }, { "entropy": 0.8039006620645524, "epoch": 0.2382000269457044, "grad_norm": 4.8125, "learning_rate": 4.404863018987122e-05, "loss": 0.8268921852111817, "mean_token_accuracy": 0.7975385501980782, "num_tokens": 26350874.0, "step": 13260 }, { "entropy": 0.751151566952467, "epoch": 0.23837966497507523, "grad_norm": 7.25, "learning_rate": 4.4039322581056474e-05, "loss": 0.7578027725219727, "mean_token_accuracy": 0.8109473019838334, "num_tokens": 26370804.0, "step": 13270 }, { "entropy": 0.8888045981526375, "epoch": 0.23855930300444605, "grad_norm": 7.25, "learning_rate": 4.4030008684642466e-05, "loss": 0.859557056427002, "mean_token_accuracy": 0.793322491645813, "num_tokens": 26389833.0, "step": 13280 }, { "entropy": 0.8526957459747792, "epoch": 0.23873894103381685, "grad_norm": 5.6875, "learning_rate": 4.4020688503705046e-05, "loss": 0.8818240165710449, "mean_token_accuracy": 0.790793451666832, "num_tokens": 26409188.0, "step": 13290 }, { "entropy": 0.904371589422226, "epoch": 0.23891857906318767, "grad_norm": 5.9375, "learning_rate": 4.401136204132213e-05, "loss": 0.9643376350402832, "mean_token_accuracy": 0.7745593547821045, "num_tokens": 26429527.0, "step": 13300 }, { "entropy": 0.7771104529500008, "epoch": 0.2390982170925585, "grad_norm": 5.3125, "learning_rate": 4.400202930057373e-05, "loss": 0.7797120094299317, "mean_token_accuracy": 0.8115101099014282, "num_tokens": 26449676.0, "step": 13310 }, { "entropy": 0.8480752810835839, "epoch": 0.2392778551219293, "grad_norm": 6.34375, "learning_rate": 4.3992690284541903e-05, "loss": 0.8843204498291015, "mean_token_accuracy": 0.790017269551754, "num_tokens": 26469282.0, "step": 13320 }, { "entropy": 0.8000416107475757, "epoch": 0.23945749315130013, "grad_norm": 6.03125, "learning_rate": 4.3983344996310805e-05, "loss": 0.8028103828430175, "mean_token_accuracy": 0.7986316993832588, "num_tokens": 26490018.0, "step": 13330 }, { "entropy": 0.9123258791863919, "epoch": 0.23963713118067095, "grad_norm": 5.65625, "learning_rate": 4.397399343896663e-05, "loss": 0.9376555442810058, "mean_token_accuracy": 0.7819564029574394, "num_tokens": 26510800.0, "step": 13340 }, { "entropy": 0.8541868910193443, "epoch": 0.23981676921004177, "grad_norm": 6.8125, "learning_rate": 4.3964635615597686e-05, "loss": 0.8546566963195801, "mean_token_accuracy": 0.7991875395178795, "num_tokens": 26531089.0, "step": 13350 }, { "entropy": 0.8048194207251071, "epoch": 0.2399964072394126, "grad_norm": 7.34375, "learning_rate": 4.395527152929432e-05, "loss": 0.8428640365600586, "mean_token_accuracy": 0.7993195682764054, "num_tokens": 26549926.0, "step": 13360 }, { "entropy": 0.7812407940626145, "epoch": 0.2401760452687834, "grad_norm": 5.0, "learning_rate": 4.394590118314894e-05, "loss": 0.7664508819580078, "mean_token_accuracy": 0.8158423021435738, "num_tokens": 26569704.0, "step": 13370 }, { "entropy": 0.8481205046176911, "epoch": 0.2403556832981542, "grad_norm": 5.90625, "learning_rate": 4.393652458025605e-05, "loss": 0.8584465026855469, "mean_token_accuracy": 0.7954918637871742, "num_tokens": 26589701.0, "step": 13380 }, { "entropy": 0.8093801572918892, "epoch": 0.24053532132752503, "grad_norm": 6.0625, "learning_rate": 4.392714172371221e-05, "loss": 0.8151741981506347, "mean_token_accuracy": 0.8042861700057984, "num_tokens": 26609809.0, "step": 13390 }, { "entropy": 0.8859588146209717, "epoch": 0.24071495935689585, "grad_norm": 6.96875, "learning_rate": 4.3917752616616015e-05, "loss": 0.9433646202087402, "mean_token_accuracy": 0.7855261400341987, "num_tokens": 26631465.0, "step": 13400 }, { "entropy": 0.7782510004937648, "epoch": 0.24089459738626667, "grad_norm": 6.6875, "learning_rate": 4.3908357262068176e-05, "loss": 0.7895389080047608, "mean_token_accuracy": 0.8005859911441803, "num_tokens": 26651394.0, "step": 13410 }, { "entropy": 0.8104953475296497, "epoch": 0.2410742354156375, "grad_norm": 4.9375, "learning_rate": 4.389895566317144e-05, "loss": 0.8134613990783691, "mean_token_accuracy": 0.8051000170409679, "num_tokens": 26671934.0, "step": 13420 }, { "entropy": 0.7244637757539749, "epoch": 0.24125387344500832, "grad_norm": 4.875, "learning_rate": 4.38895478230306e-05, "loss": 0.7035492897033692, "mean_token_accuracy": 0.8240381866693497, "num_tokens": 26691979.0, "step": 13430 }, { "entropy": 0.7952271088957786, "epoch": 0.24143351147437914, "grad_norm": 8.4375, "learning_rate": 4.388013374475254e-05, "loss": 0.793808126449585, "mean_token_accuracy": 0.8059951648116112, "num_tokens": 26712283.0, "step": 13440 }, { "entropy": 0.838923753798008, "epoch": 0.24161314950374996, "grad_norm": 6.625, "learning_rate": 4.387071343144619e-05, "loss": 0.87814302444458, "mean_token_accuracy": 0.7969618663191795, "num_tokens": 26732103.0, "step": 13450 }, { "entropy": 0.7875683717429638, "epoch": 0.24179278753312075, "grad_norm": 5.65625, "learning_rate": 4.386128688622253e-05, "loss": 0.8302737236022949, "mean_token_accuracy": 0.8018063828349113, "num_tokens": 26752388.0, "step": 13460 }, { "entropy": 0.8359189722687006, "epoch": 0.24197242556249157, "grad_norm": 6.28125, "learning_rate": 4.3851854112194623e-05, "loss": 0.8467391967773438, "mean_token_accuracy": 0.7976729929447174, "num_tokens": 26773124.0, "step": 13470 }, { "entropy": 0.8606241069734096, "epoch": 0.2421520635918624, "grad_norm": 5.65625, "learning_rate": 4.384241511247757e-05, "loss": 0.8593057632446289, "mean_token_accuracy": 0.797717472910881, "num_tokens": 26792855.0, "step": 13480 }, { "entropy": 0.8028083570301533, "epoch": 0.24233170162123321, "grad_norm": 3.40625, "learning_rate": 4.383296989018854e-05, "loss": 0.7776421546936035, "mean_token_accuracy": 0.8102691829204559, "num_tokens": 26812403.0, "step": 13490 }, { "entropy": 0.8435114089399576, "epoch": 0.24251133965060404, "grad_norm": 7.3125, "learning_rate": 4.382351844844674e-05, "loss": 0.9107912063598633, "mean_token_accuracy": 0.7920294776558876, "num_tokens": 26833051.0, "step": 13500 }, { "entropy": 0.8145574770867825, "epoch": 0.24269097767997486, "grad_norm": 9.25, "learning_rate": 4.381406079037344e-05, "loss": 0.8400983810424805, "mean_token_accuracy": 0.7998263776302338, "num_tokens": 26852623.0, "step": 13510 }, { "entropy": 0.7644591614603996, "epoch": 0.24287061570934568, "grad_norm": 6.09375, "learning_rate": 4.3804596919091964e-05, "loss": 0.7844414234161377, "mean_token_accuracy": 0.8130142956972122, "num_tokens": 26871633.0, "step": 13520 }, { "entropy": 0.8215132541954517, "epoch": 0.2430502537387165, "grad_norm": 5.78125, "learning_rate": 4.3795126837727695e-05, "loss": 0.8524012565612793, "mean_token_accuracy": 0.7911192134022713, "num_tokens": 26889910.0, "step": 13530 }, { "entropy": 0.8603561118245124, "epoch": 0.2432298917680873, "grad_norm": 6.65625, "learning_rate": 4.378565054940805e-05, "loss": 0.879394817352295, "mean_token_accuracy": 0.7950222387909889, "num_tokens": 26910226.0, "step": 13540 }, { "entropy": 0.8143448971211911, "epoch": 0.2434095297974581, "grad_norm": 7.40625, "learning_rate": 4.377616805726252e-05, "loss": 0.8625999450683594, "mean_token_accuracy": 0.7928274750709534, "num_tokens": 26930520.0, "step": 13550 }, { "entropy": 0.7778517529368401, "epoch": 0.24358916782682893, "grad_norm": 6.875, "learning_rate": 4.376667936442261e-05, "loss": 0.7624529361724853, "mean_token_accuracy": 0.8165528297424316, "num_tokens": 26949394.0, "step": 13560 }, { "entropy": 0.8629262465983629, "epoch": 0.24376880585619976, "grad_norm": 6.46875, "learning_rate": 4.37571844740219e-05, "loss": 0.8273058891296386, "mean_token_accuracy": 0.8002196326851845, "num_tokens": 26970106.0, "step": 13570 }, { "entropy": 0.8166915208101273, "epoch": 0.24394844388557058, "grad_norm": 6.75, "learning_rate": 4.3747683389196015e-05, "loss": 0.8216407775878907, "mean_token_accuracy": 0.8027824029326439, "num_tokens": 26990358.0, "step": 13580 }, { "entropy": 0.8272555425763131, "epoch": 0.2441280819149414, "grad_norm": 5.875, "learning_rate": 4.3738176113082614e-05, "loss": 0.8302549362182617, "mean_token_accuracy": 0.8105716541409492, "num_tokens": 27010640.0, "step": 13590 }, { "entropy": 0.8589202456176281, "epoch": 0.24430771994431222, "grad_norm": 6.46875, "learning_rate": 4.3728662648821406e-05, "loss": 0.8641993522644043, "mean_token_accuracy": 0.7981086507439613, "num_tokens": 27030213.0, "step": 13600 }, { "entropy": 0.7838783346116542, "epoch": 0.24448735797368304, "grad_norm": 6.71875, "learning_rate": 4.3719142999554146e-05, "loss": 0.8545126914978027, "mean_token_accuracy": 0.7930277362465858, "num_tokens": 27049607.0, "step": 13610 }, { "entropy": 0.751653042435646, "epoch": 0.24466699600305383, "grad_norm": 5.0, "learning_rate": 4.370961716842463e-05, "loss": 0.7441647052764893, "mean_token_accuracy": 0.8134953200817108, "num_tokens": 27069676.0, "step": 13620 }, { "entropy": 0.7849678728729487, "epoch": 0.24484663403242465, "grad_norm": 6.375, "learning_rate": 4.3700085158578694e-05, "loss": 0.7777293205261231, "mean_token_accuracy": 0.8170342177152634, "num_tokens": 27088185.0, "step": 13630 }, { "entropy": 0.7968810461461544, "epoch": 0.24502627206179547, "grad_norm": 6.96875, "learning_rate": 4.369054697316423e-05, "loss": 0.8433983802795411, "mean_token_accuracy": 0.7983433678746223, "num_tokens": 27108207.0, "step": 13640 }, { "entropy": 0.8658739365637302, "epoch": 0.2452059100911663, "grad_norm": 4.78125, "learning_rate": 4.3681002615331126e-05, "loss": 0.8854556083679199, "mean_token_accuracy": 0.7839902430772782, "num_tokens": 27129344.0, "step": 13650 }, { "entropy": 0.8249386437237263, "epoch": 0.24538554812053712, "grad_norm": 6.21875, "learning_rate": 4.3671452088231355e-05, "loss": 0.8174446105957032, "mean_token_accuracy": 0.8045562699437141, "num_tokens": 27149165.0, "step": 13660 }, { "entropy": 0.7624789878726006, "epoch": 0.24556518614990794, "grad_norm": 4.5625, "learning_rate": 4.366189539501891e-05, "loss": 0.7846019268035889, "mean_token_accuracy": 0.8127708435058594, "num_tokens": 27168936.0, "step": 13670 }, { "entropy": 0.7870650894939899, "epoch": 0.24574482417927876, "grad_norm": 6.46875, "learning_rate": 4.3652332538849824e-05, "loss": 0.8217618942260743, "mean_token_accuracy": 0.7953908115625381, "num_tokens": 27188793.0, "step": 13680 }, { "entropy": 0.763074304908514, "epoch": 0.24592446220864958, "grad_norm": 7.0, "learning_rate": 4.364276352288215e-05, "loss": 0.7522635459899902, "mean_token_accuracy": 0.8163917616009713, "num_tokens": 27208804.0, "step": 13690 }, { "entropy": 0.7606382876634598, "epoch": 0.2461041002380204, "grad_norm": 6.59375, "learning_rate": 4.3633188350275996e-05, "loss": 0.8136446952819825, "mean_token_accuracy": 0.8047461166977883, "num_tokens": 27228913.0, "step": 13700 }, { "entropy": 0.8110116370022297, "epoch": 0.2462837382673912, "grad_norm": 6.15625, "learning_rate": 4.362360702419348e-05, "loss": 0.800137996673584, "mean_token_accuracy": 0.8082036674022675, "num_tokens": 27248103.0, "step": 13710 }, { "entropy": 0.7978027477860451, "epoch": 0.24646337629676202, "grad_norm": 5.96875, "learning_rate": 4.361401954779879e-05, "loss": 0.8092119216918945, "mean_token_accuracy": 0.8066146284341812, "num_tokens": 27267757.0, "step": 13720 }, { "entropy": 0.7688148498535157, "epoch": 0.24664301432613284, "grad_norm": 6.28125, "learning_rate": 4.36044259242581e-05, "loss": 0.8275465965270996, "mean_token_accuracy": 0.8025032967329025, "num_tokens": 27287344.0, "step": 13730 }, { "entropy": 0.7337068825960159, "epoch": 0.24682265235550366, "grad_norm": 5.53125, "learning_rate": 4.359482615673964e-05, "loss": 0.7259703636169433, "mean_token_accuracy": 0.8188115805387497, "num_tokens": 27306101.0, "step": 13740 }, { "entropy": 0.7875922851264476, "epoch": 0.24700229038487448, "grad_norm": 5.6875, "learning_rate": 4.3585220248413674e-05, "loss": 0.7924707412719727, "mean_token_accuracy": 0.8108751147985458, "num_tokens": 27325117.0, "step": 13750 }, { "entropy": 0.7412275068461895, "epoch": 0.2471819284142453, "grad_norm": 4.84375, "learning_rate": 4.3575608202452474e-05, "loss": 0.7450665473937989, "mean_token_accuracy": 0.8127679198980331, "num_tokens": 27345952.0, "step": 13760 }, { "entropy": 0.8160237550735474, "epoch": 0.24736156644361612, "grad_norm": 5.5625, "learning_rate": 4.3565990022030346e-05, "loss": 0.8164488792419433, "mean_token_accuracy": 0.7953980743885041, "num_tokens": 27365071.0, "step": 13770 }, { "entropy": 0.8261899374425411, "epoch": 0.24754120447298694, "grad_norm": 4.375, "learning_rate": 4.355636571032364e-05, "loss": 0.8589550971984863, "mean_token_accuracy": 0.7909029290080071, "num_tokens": 27384532.0, "step": 13780 }, { "entropy": 0.7894202262163162, "epoch": 0.24772084250235774, "grad_norm": 4.9375, "learning_rate": 4.3546735270510695e-05, "loss": 0.8152304649353027, "mean_token_accuracy": 0.7971238806843758, "num_tokens": 27404764.0, "step": 13790 }, { "entropy": 0.8257817037403583, "epoch": 0.24790048053172856, "grad_norm": 7.375, "learning_rate": 4.3537098705771916e-05, "loss": 0.812558937072754, "mean_token_accuracy": 0.7981402933597564, "num_tokens": 27424630.0, "step": 13800 }, { "entropy": 0.7889108881354332, "epoch": 0.24808011856109938, "grad_norm": 8.25, "learning_rate": 4.352745601928969e-05, "loss": 0.8120283126831055, "mean_token_accuracy": 0.8006609439849853, "num_tokens": 27443682.0, "step": 13810 }, { "entropy": 0.8692940428853035, "epoch": 0.2482597565904702, "grad_norm": 6.0625, "learning_rate": 4.3517807214248464e-05, "loss": 0.862795639038086, "mean_token_accuracy": 0.7934139177203179, "num_tokens": 27463291.0, "step": 13820 }, { "entropy": 0.8374870076775551, "epoch": 0.24843939461984102, "grad_norm": 6.40625, "learning_rate": 4.3508152293834665e-05, "loss": 0.8341181755065918, "mean_token_accuracy": 0.7993769809603691, "num_tokens": 27483281.0, "step": 13830 }, { "entropy": 0.9041734732687473, "epoch": 0.24861903264921184, "grad_norm": 6.15625, "learning_rate": 4.349849126123678e-05, "loss": 0.9557903289794922, "mean_token_accuracy": 0.7831974193453789, "num_tokens": 27503024.0, "step": 13840 }, { "entropy": 0.819349580258131, "epoch": 0.24879867067858266, "grad_norm": 7.84375, "learning_rate": 4.3488824119645276e-05, "loss": 0.7811998844146728, "mean_token_accuracy": 0.8059081554412841, "num_tokens": 27523383.0, "step": 13850 }, { "entropy": 0.7715065360069275, "epoch": 0.24897830870795348, "grad_norm": 7.5625, "learning_rate": 4.347915087225268e-05, "loss": 0.7440221309661865, "mean_token_accuracy": 0.8082112684845925, "num_tokens": 27542745.0, "step": 13860 }, { "entropy": 0.7329110682010651, "epoch": 0.2491579467373243, "grad_norm": 5.59375, "learning_rate": 4.34694715222535e-05, "loss": 0.7399541854858398, "mean_token_accuracy": 0.8082781165838242, "num_tokens": 27562094.0, "step": 13870 }, { "entropy": 0.7984652914106846, "epoch": 0.2493375847666951, "grad_norm": 5.0, "learning_rate": 4.3459786072844266e-05, "loss": 0.8460657119750976, "mean_token_accuracy": 0.7990671768784523, "num_tokens": 27582008.0, "step": 13880 }, { "entropy": 0.746969722956419, "epoch": 0.24951722279606592, "grad_norm": 5.625, "learning_rate": 4.345009452722354e-05, "loss": 0.7735437870025634, "mean_token_accuracy": 0.818760558962822, "num_tokens": 27601466.0, "step": 13890 }, { "entropy": 0.7327978014945984, "epoch": 0.24969686082543674, "grad_norm": 6.3125, "learning_rate": 4.3440396888591874e-05, "loss": 0.7709096908569336, "mean_token_accuracy": 0.8040370464324951, "num_tokens": 27620665.0, "step": 13900 }, { "entropy": 0.8508526973426342, "epoch": 0.24987649885480756, "grad_norm": 4.8125, "learning_rate": 4.343069316015185e-05, "loss": 0.8447537422180176, "mean_token_accuracy": 0.7939540073275566, "num_tokens": 27640545.0, "step": 13910 }, { "entropy": 0.848307815939188, "epoch": 0.2500561368841784, "grad_norm": 5.96875, "learning_rate": 4.342098334510806e-05, "loss": 0.8779210090637207, "mean_token_accuracy": 0.7960585847496986, "num_tokens": 27660498.0, "step": 13920 }, { "entropy": 0.8527353264391422, "epoch": 0.2502357749135492, "grad_norm": 8.0625, "learning_rate": 4.341126744666709e-05, "loss": 0.9123054504394531, "mean_token_accuracy": 0.7886921599507332, "num_tokens": 27680538.0, "step": 13930 }, { "entropy": 0.839226158708334, "epoch": 0.25041541294292, "grad_norm": 7.75, "learning_rate": 4.3401545468037546e-05, "loss": 0.8788884162902832, "mean_token_accuracy": 0.7935563623905182, "num_tokens": 27700263.0, "step": 13940 }, { "entropy": 0.7657243803143501, "epoch": 0.25059505097229084, "grad_norm": 5.84375, "learning_rate": 4.3391817412430046e-05, "loss": 0.7886397838592529, "mean_token_accuracy": 0.8056871309876442, "num_tokens": 27719390.0, "step": 13950 }, { "entropy": 0.8648333057761193, "epoch": 0.25077468900166167, "grad_norm": 5.8125, "learning_rate": 4.338208328305722e-05, "loss": 0.8675991058349609, "mean_token_accuracy": 0.7935129538178444, "num_tokens": 27738841.0, "step": 13960 }, { "entropy": 0.7995679803192616, "epoch": 0.2509543270310325, "grad_norm": 7.28125, "learning_rate": 4.337234308313367e-05, "loss": 0.8029519081115722, "mean_token_accuracy": 0.8084412455558777, "num_tokens": 27757994.0, "step": 13970 }, { "entropy": 0.8524405397474766, "epoch": 0.2511339650604033, "grad_norm": 4.53125, "learning_rate": 4.3362596815876046e-05, "loss": 0.899988842010498, "mean_token_accuracy": 0.7921252772212029, "num_tokens": 27777845.0, "step": 13980 }, { "entropy": 0.845899411290884, "epoch": 0.25131360308977413, "grad_norm": 6.5625, "learning_rate": 4.335284448450298e-05, "loss": 0.8093595504760742, "mean_token_accuracy": 0.8086071893572807, "num_tokens": 27797731.0, "step": 13990 }, { "epoch": 0.25149324111914495, "eval_entropy": 0.7823118499517441, "eval_loss": 0.7997555136680603, "eval_mean_token_accuracy": 0.8076520009040833, "eval_num_tokens": 27817716.0, "eval_runtime": 40.5724, "eval_samples_per_second": 49.295, "eval_steps_per_second": 6.162, "step": 14000 }, { "entropy": 0.8305971156805754, "epoch": 0.2516728791485157, "grad_norm": 6.28125, "learning_rate": 4.3333321642295046e-05, "loss": 0.8534729957580567, "mean_token_accuracy": 0.7936193771660328, "num_tokens": 27837607.0, "step": 14010 }, { "entropy": 0.8847357168793678, "epoch": 0.25185251717788654, "grad_norm": 6.1875, "learning_rate": 4.332355113790747e-05, "loss": 0.9044944763183593, "mean_token_accuracy": 0.7891054704785347, "num_tokens": 27857516.0, "step": 14020 }, { "entropy": 0.7862937532365322, "epoch": 0.25203215520725736, "grad_norm": 6.0625, "learning_rate": 4.331377458229901e-05, "loss": 0.7968478202819824, "mean_token_accuracy": 0.8118302032351494, "num_tokens": 27877637.0, "step": 14030 }, { "entropy": 0.8244802989065647, "epoch": 0.2522117932366282, "grad_norm": 4.5625, "learning_rate": 4.3303991978698276e-05, "loss": 0.8252405166625977, "mean_token_accuracy": 0.8023489505052567, "num_tokens": 27898377.0, "step": 14040 }, { "entropy": 0.7420347094535827, "epoch": 0.252391431265999, "grad_norm": 5.03125, "learning_rate": 4.3294203330335935e-05, "loss": 0.7452284336090088, "mean_token_accuracy": 0.815617349743843, "num_tokens": 27917734.0, "step": 14050 }, { "entropy": 0.760425566136837, "epoch": 0.2525710692953698, "grad_norm": 8.125, "learning_rate": 4.328440864044461e-05, "loss": 0.7840786457061768, "mean_token_accuracy": 0.8156183704733848, "num_tokens": 27937442.0, "step": 14060 }, { "entropy": 0.7686777248978615, "epoch": 0.25275070732474064, "grad_norm": 7.3125, "learning_rate": 4.3274607912258916e-05, "loss": 0.7291486263275146, "mean_token_accuracy": 0.8176906436681748, "num_tokens": 27955575.0, "step": 14070 }, { "entropy": 0.8890803173184395, "epoch": 0.25293034535411146, "grad_norm": 7.4375, "learning_rate": 4.326480114901548e-05, "loss": 0.9546053886413575, "mean_token_accuracy": 0.7770086444914341, "num_tokens": 27976284.0, "step": 14080 }, { "entropy": 0.8317489318549633, "epoch": 0.2531099833834823, "grad_norm": 6.71875, "learning_rate": 4.3254988353952916e-05, "loss": 0.854953384399414, "mean_token_accuracy": 0.7921025469899178, "num_tokens": 27996070.0, "step": 14090 }, { "entropy": 0.833439689874649, "epoch": 0.2532896214128531, "grad_norm": 7.5625, "learning_rate": 4.324516953031182e-05, "loss": 0.8885133743286133, "mean_token_accuracy": 0.7922736361622811, "num_tokens": 28015615.0, "step": 14100 }, { "entropy": 0.8334063023328782, "epoch": 0.2534692594422239, "grad_norm": 5.8125, "learning_rate": 4.323534468133481e-05, "loss": 0.8776500701904297, "mean_token_accuracy": 0.7903510466217994, "num_tokens": 28034876.0, "step": 14110 }, { "entropy": 0.8881644174456597, "epoch": 0.25364889747159475, "grad_norm": 6.5, "learning_rate": 4.322551381026645e-05, "loss": 0.9214949607849121, "mean_token_accuracy": 0.7832420527935028, "num_tokens": 28053874.0, "step": 14120 }, { "entropy": 0.8123660005629063, "epoch": 0.25382853550096557, "grad_norm": 4.1875, "learning_rate": 4.321567692035331e-05, "loss": 0.7783702850341797, "mean_token_accuracy": 0.8071834981441498, "num_tokens": 28074653.0, "step": 14130 }, { "entropy": 0.8241522639989853, "epoch": 0.2540081735303364, "grad_norm": 6.0625, "learning_rate": 4.320583401484398e-05, "loss": 0.8078440666198731, "mean_token_accuracy": 0.8116596773266792, "num_tokens": 28094287.0, "step": 14140 }, { "entropy": 0.8052144214510918, "epoch": 0.2541878115597072, "grad_norm": 6.46875, "learning_rate": 4.3195985096988976e-05, "loss": 0.8097591400146484, "mean_token_accuracy": 0.7987451165914535, "num_tokens": 28114100.0, "step": 14150 }, { "entropy": 0.793202667683363, "epoch": 0.25436744958907803, "grad_norm": 7.0, "learning_rate": 4.318613017004086e-05, "loss": 0.8525226593017579, "mean_token_accuracy": 0.7962001897394657, "num_tokens": 28134178.0, "step": 14160 }, { "entropy": 0.8541349522769451, "epoch": 0.25454708761844885, "grad_norm": 6.46875, "learning_rate": 4.317626923725414e-05, "loss": 0.8765149116516113, "mean_token_accuracy": 0.7851223066449166, "num_tokens": 28154273.0, "step": 14170 }, { "entropy": 0.8576840594410896, "epoch": 0.2547267256478196, "grad_norm": 5.65625, "learning_rate": 4.316640230188531e-05, "loss": 0.8743958473205566, "mean_token_accuracy": 0.7917151406407357, "num_tokens": 28173566.0, "step": 14180 }, { "entropy": 0.8606802739202977, "epoch": 0.25490636367719044, "grad_norm": 6.65625, "learning_rate": 4.315652936719286e-05, "loss": 0.8259428024291993, "mean_token_accuracy": 0.7993944764137269, "num_tokens": 28193412.0, "step": 14190 }, { "entropy": 0.8613556973636151, "epoch": 0.25508600170656126, "grad_norm": 6.21875, "learning_rate": 4.3146650436437265e-05, "loss": 0.8245043754577637, "mean_token_accuracy": 0.7978127881884575, "num_tokens": 28213004.0, "step": 14200 }, { "entropy": 0.8105805769562722, "epoch": 0.2552656397359321, "grad_norm": 6.3125, "learning_rate": 4.313676551288095e-05, "loss": 0.8677256584167481, "mean_token_accuracy": 0.7978790134191514, "num_tokens": 28232502.0, "step": 14210 }, { "entropy": 0.7708905167877674, "epoch": 0.2554452777653029, "grad_norm": 6.21875, "learning_rate": 4.312687459978836e-05, "loss": 0.7871992111206054, "mean_token_accuracy": 0.8169694811105728, "num_tokens": 28252834.0, "step": 14220 }, { "entropy": 0.7973978713154792, "epoch": 0.2556249157946737, "grad_norm": 5.625, "learning_rate": 4.3116977700425894e-05, "loss": 0.766731071472168, "mean_token_accuracy": 0.8153269544243813, "num_tokens": 28272589.0, "step": 14230 }, { "entropy": 0.7794838853180408, "epoch": 0.25580455382404454, "grad_norm": 4.03125, "learning_rate": 4.310707481806192e-05, "loss": 0.7510892868041992, "mean_token_accuracy": 0.8205872982740402, "num_tokens": 28292506.0, "step": 14240 }, { "entropy": 0.7519724570214749, "epoch": 0.25598419185341537, "grad_norm": 5.15625, "learning_rate": 4.3097165955966814e-05, "loss": 0.7734851360321044, "mean_token_accuracy": 0.8113970935344696, "num_tokens": 28312154.0, "step": 14250 }, { "entropy": 0.7895194351673126, "epoch": 0.2561638298827862, "grad_norm": 6.625, "learning_rate": 4.308725111741288e-05, "loss": 0.805809497833252, "mean_token_accuracy": 0.8009387388825416, "num_tokens": 28331430.0, "step": 14260 }, { "entropy": 0.7499701671302319, "epoch": 0.256343467912157, "grad_norm": 6.84375, "learning_rate": 4.307733030567445e-05, "loss": 0.7558623313903808, "mean_token_accuracy": 0.8095523729920387, "num_tokens": 28350833.0, "step": 14270 }, { "entropy": 0.7204631559550763, "epoch": 0.25652310594152783, "grad_norm": 5.75, "learning_rate": 4.306740352402777e-05, "loss": 0.7321593761444092, "mean_token_accuracy": 0.8199307128787041, "num_tokens": 28371791.0, "step": 14280 }, { "entropy": 0.8380329694598914, "epoch": 0.25670274397089865, "grad_norm": 4.84375, "learning_rate": 4.305747077575112e-05, "loss": 0.9004829406738282, "mean_token_accuracy": 0.7955252528190613, "num_tokens": 28392587.0, "step": 14290 }, { "entropy": 0.7112549595534802, "epoch": 0.25688238200026947, "grad_norm": 7.0, "learning_rate": 4.3047532064124695e-05, "loss": 0.7641959667205811, "mean_token_accuracy": 0.8152240738272667, "num_tokens": 28414527.0, "step": 14300 }, { "entropy": 0.825827780365944, "epoch": 0.2570620200296403, "grad_norm": 6.03125, "learning_rate": 4.30375873924307e-05, "loss": 0.845159912109375, "mean_token_accuracy": 0.7914518535137176, "num_tokens": 28434858.0, "step": 14310 }, { "entropy": 0.8412707515060902, "epoch": 0.2572416580590111, "grad_norm": 6.34375, "learning_rate": 4.302763676395327e-05, "loss": 0.86558837890625, "mean_token_accuracy": 0.7979420840740203, "num_tokens": 28456334.0, "step": 14320 }, { "entropy": 0.7655456654727459, "epoch": 0.25742129608838193, "grad_norm": 4.65625, "learning_rate": 4.3017680181978556e-05, "loss": 0.7576260566711426, "mean_token_accuracy": 0.8161571398377419, "num_tokens": 28475542.0, "step": 14330 }, { "entropy": 0.8217014811933041, "epoch": 0.25760093411775276, "grad_norm": 5.84375, "learning_rate": 4.300771764979462e-05, "loss": 0.8637436866760254, "mean_token_accuracy": 0.7939350441098213, "num_tokens": 28495075.0, "step": 14340 }, { "entropy": 0.8074494399130344, "epoch": 0.2577805721471235, "grad_norm": 5.75, "learning_rate": 4.2997749170691536e-05, "loss": 0.8022321701049805, "mean_token_accuracy": 0.8168031826615334, "num_tokens": 28515172.0, "step": 14350 }, { "entropy": 0.7716741152107716, "epoch": 0.25796021017649434, "grad_norm": 5.5625, "learning_rate": 4.2987774747961315e-05, "loss": 0.7860188007354736, "mean_token_accuracy": 0.8156327664852142, "num_tokens": 28535338.0, "step": 14360 }, { "entropy": 0.783092538267374, "epoch": 0.25813984820586516, "grad_norm": 7.125, "learning_rate": 4.297779438489795e-05, "loss": 0.7879272937774658, "mean_token_accuracy": 0.8077037408947945, "num_tokens": 28553639.0, "step": 14370 }, { "entropy": 0.6922728888690471, "epoch": 0.258319486235236, "grad_norm": 6.15625, "learning_rate": 4.296780808479736e-05, "loss": 0.697773551940918, "mean_token_accuracy": 0.8285977512598037, "num_tokens": 28573390.0, "step": 14380 }, { "entropy": 0.7938649445772171, "epoch": 0.2584991242646068, "grad_norm": 4.84375, "learning_rate": 4.2957815850957466e-05, "loss": 0.8564668655395508, "mean_token_accuracy": 0.7936929121613503, "num_tokens": 28592908.0, "step": 14390 }, { "entropy": 0.822998633235693, "epoch": 0.2586787622939776, "grad_norm": 5.65625, "learning_rate": 4.294781768667813e-05, "loss": 0.8278387069702149, "mean_token_accuracy": 0.7978073790669441, "num_tokens": 28613648.0, "step": 14400 }, { "entropy": 0.7473748818039894, "epoch": 0.25885840032334845, "grad_norm": 6.6875, "learning_rate": 4.293781359526117e-05, "loss": 0.7390222549438477, "mean_token_accuracy": 0.8186459958553314, "num_tokens": 28633074.0, "step": 14410 }, { "entropy": 0.8443714216351509, "epoch": 0.25903803835271927, "grad_norm": 8.0, "learning_rate": 4.2927803580010365e-05, "loss": 0.849765396118164, "mean_token_accuracy": 0.7938869014382363, "num_tokens": 28651429.0, "step": 14420 }, { "entropy": 0.845733255892992, "epoch": 0.2592176763820901, "grad_norm": 5.53125, "learning_rate": 4.291778764423145e-05, "loss": 0.8720784187316895, "mean_token_accuracy": 0.7989844918251038, "num_tokens": 28670611.0, "step": 14430 }, { "entropy": 0.818676570057869, "epoch": 0.2593973144114609, "grad_norm": 5.78125, "learning_rate": 4.290776579123212e-05, "loss": 0.8249676704406739, "mean_token_accuracy": 0.8039656817913056, "num_tokens": 28691481.0, "step": 14440 }, { "entropy": 0.8130947772413493, "epoch": 0.25957695244083173, "grad_norm": 4.6875, "learning_rate": 4.2897738024322014e-05, "loss": 0.798153018951416, "mean_token_accuracy": 0.8037065446376801, "num_tokens": 28713083.0, "step": 14450 }, { "entropy": 0.7692267332226038, "epoch": 0.25975659047020255, "grad_norm": 5.8125, "learning_rate": 4.288770434681274e-05, "loss": 0.7926108837127686, "mean_token_accuracy": 0.8088784359395504, "num_tokens": 28734145.0, "step": 14460 }, { "entropy": 0.8078782632946968, "epoch": 0.2599362284995734, "grad_norm": 9.875, "learning_rate": 4.2877664762017835e-05, "loss": 0.7899657726287842, "mean_token_accuracy": 0.8087860003113747, "num_tokens": 28753182.0, "step": 14470 }, { "entropy": 0.7435506097972393, "epoch": 0.2601158665289442, "grad_norm": 6.09375, "learning_rate": 4.286761927325281e-05, "loss": 0.7472553253173828, "mean_token_accuracy": 0.8158667489886284, "num_tokens": 28772417.0, "step": 14480 }, { "entropy": 0.7945246532559395, "epoch": 0.260295504558315, "grad_norm": 6.25, "learning_rate": 4.285756788383512e-05, "loss": 0.867308521270752, "mean_token_accuracy": 0.7831429615616798, "num_tokens": 28792444.0, "step": 14490 }, { "entropy": 0.8455458812415599, "epoch": 0.26047514258768584, "grad_norm": 6.25, "learning_rate": 4.2847510597084136e-05, "loss": 0.8616435050964355, "mean_token_accuracy": 0.7934768483042717, "num_tokens": 28813559.0, "step": 14500 }, { "entropy": 0.8628276482224464, "epoch": 0.26065478061705666, "grad_norm": 6.09375, "learning_rate": 4.283744741632123e-05, "loss": 0.862397289276123, "mean_token_accuracy": 0.7975175499916076, "num_tokens": 28832767.0, "step": 14510 }, { "entropy": 0.8063305981457234, "epoch": 0.2608344186464274, "grad_norm": 8.0, "learning_rate": 4.28273783448697e-05, "loss": 0.8468155860900879, "mean_token_accuracy": 0.7887645468115807, "num_tokens": 28853012.0, "step": 14520 }, { "entropy": 0.7459668152034282, "epoch": 0.26101405667579824, "grad_norm": 5.5625, "learning_rate": 4.2817303386054763e-05, "loss": 0.7352814197540283, "mean_token_accuracy": 0.8190690964460373, "num_tokens": 28871306.0, "step": 14530 }, { "entropy": 0.7463353462517262, "epoch": 0.26119369470516907, "grad_norm": 6.65625, "learning_rate": 4.2807222543203604e-05, "loss": 0.7881595134735108, "mean_token_accuracy": 0.8142834976315498, "num_tokens": 28891443.0, "step": 14540 }, { "entropy": 0.8250531561672687, "epoch": 0.2613733327345399, "grad_norm": 8.3125, "learning_rate": 4.279713581964537e-05, "loss": 0.8437843322753906, "mean_token_accuracy": 0.7979848653078079, "num_tokens": 28911515.0, "step": 14550 }, { "entropy": 0.7826508209109306, "epoch": 0.2615529707639107, "grad_norm": 6.625, "learning_rate": 4.278704321871112e-05, "loss": 0.8044563293457031, "mean_token_accuracy": 0.8065446883440017, "num_tokens": 28930633.0, "step": 14560 }, { "entropy": 0.7261652827262879, "epoch": 0.26173260879328153, "grad_norm": 3.5625, "learning_rate": 4.277694474373385e-05, "loss": 0.7151919841766358, "mean_token_accuracy": 0.814508906006813, "num_tokens": 28952538.0, "step": 14570 }, { "entropy": 0.7804071493446827, "epoch": 0.26191224682265235, "grad_norm": 5.09375, "learning_rate": 4.276684039804851e-05, "loss": 0.8198032379150391, "mean_token_accuracy": 0.8068506315350532, "num_tokens": 28973957.0, "step": 14580 }, { "entropy": 0.8185569062829018, "epoch": 0.26209188485202317, "grad_norm": 4.0, "learning_rate": 4.2756730184992e-05, "loss": 0.8221435546875, "mean_token_accuracy": 0.800892961025238, "num_tokens": 28994054.0, "step": 14590 }, { "entropy": 0.826179300993681, "epoch": 0.262271522881394, "grad_norm": 5.65625, "learning_rate": 4.274661410790314e-05, "loss": 0.8319836616516113, "mean_token_accuracy": 0.8005240052938462, "num_tokens": 29014652.0, "step": 14600 }, { "entropy": 0.781681714951992, "epoch": 0.2624511609107648, "grad_norm": 4.75, "learning_rate": 4.2736492170122696e-05, "loss": 0.7349733829498291, "mean_token_accuracy": 0.8168729975819587, "num_tokens": 29033426.0, "step": 14610 }, { "entropy": 0.8356439761817456, "epoch": 0.26263079894013563, "grad_norm": 7.25, "learning_rate": 4.272636437499336e-05, "loss": 0.8564369201660156, "mean_token_accuracy": 0.800352169573307, "num_tokens": 29052896.0, "step": 14620 }, { "entropy": 0.8980650261044503, "epoch": 0.26281043696950646, "grad_norm": 8.8125, "learning_rate": 4.271623072585975e-05, "loss": 0.9067797660827637, "mean_token_accuracy": 0.789995738863945, "num_tokens": 29072045.0, "step": 14630 }, { "entropy": 0.7769496843218804, "epoch": 0.2629900749988773, "grad_norm": 6.90625, "learning_rate": 4.2706091226068455e-05, "loss": 0.7838994026184082, "mean_token_accuracy": 0.8106893107295037, "num_tokens": 29092078.0, "step": 14640 }, { "entropy": 0.7628645084798336, "epoch": 0.2631697130282481, "grad_norm": 7.0, "learning_rate": 4.269594587896796e-05, "loss": 0.8081195831298829, "mean_token_accuracy": 0.8002945467829704, "num_tokens": 29112156.0, "step": 14650 }, { "entropy": 0.8126539684832096, "epoch": 0.2633493510576189, "grad_norm": 8.9375, "learning_rate": 4.2685794687908695e-05, "loss": 0.8209115028381347, "mean_token_accuracy": 0.8036455735564232, "num_tokens": 29131066.0, "step": 14660 }, { "entropy": 0.7613566733896733, "epoch": 0.26352898908698974, "grad_norm": 6.65625, "learning_rate": 4.2675637656243014e-05, "loss": 0.7804110527038575, "mean_token_accuracy": 0.8108525827527047, "num_tokens": 29150631.0, "step": 14670 }, { "entropy": 0.7164460457861423, "epoch": 0.26370862711636056, "grad_norm": 5.90625, "learning_rate": 4.266547478732521e-05, "loss": 0.6783817291259766, "mean_token_accuracy": 0.8299393966794014, "num_tokens": 29169795.0, "step": 14680 }, { "entropy": 0.7525430284440517, "epoch": 0.2638882651457313, "grad_norm": 5.875, "learning_rate": 4.2655306084511494e-05, "loss": 0.7945614814758301, "mean_token_accuracy": 0.8117571890354156, "num_tokens": 29189503.0, "step": 14690 }, { "entropy": 0.7658544696867466, "epoch": 0.26406790317510215, "grad_norm": 5.84375, "learning_rate": 4.264513155116001e-05, "loss": 0.7698403835296631, "mean_token_accuracy": 0.8125215902924537, "num_tokens": 29209627.0, "step": 14700 }, { "entropy": 0.7455651178956032, "epoch": 0.26424754120447297, "grad_norm": 9.875, "learning_rate": 4.263495119063081e-05, "loss": 0.7787853717803955, "mean_token_accuracy": 0.8147596046328545, "num_tokens": 29228437.0, "step": 14710 }, { "entropy": 0.7897412188351154, "epoch": 0.2644271792338438, "grad_norm": 7.9375, "learning_rate": 4.26247650062859e-05, "loss": 0.8080427169799804, "mean_token_accuracy": 0.807109959423542, "num_tokens": 29247411.0, "step": 14720 }, { "entropy": 0.7684538669884204, "epoch": 0.2646068172632146, "grad_norm": 8.625, "learning_rate": 4.26145730014892e-05, "loss": 0.789597463607788, "mean_token_accuracy": 0.8073916092514992, "num_tokens": 29267354.0, "step": 14730 }, { "entropy": 0.8205644749104977, "epoch": 0.26478645529258543, "grad_norm": 7.59375, "learning_rate": 4.2604375179606526e-05, "loss": 0.8572630882263184, "mean_token_accuracy": 0.7883263632655144, "num_tokens": 29287836.0, "step": 14740 }, { "entropy": 0.8595778204500675, "epoch": 0.26496609332195625, "grad_norm": 5.28125, "learning_rate": 4.259417154400565e-05, "loss": 0.8462514877319336, "mean_token_accuracy": 0.7908521980047226, "num_tokens": 29308045.0, "step": 14750 }, { "entropy": 0.8849016591906548, "epoch": 0.2651457313513271, "grad_norm": 4.875, "learning_rate": 4.258396209805624e-05, "loss": 0.8981064796447754, "mean_token_accuracy": 0.7855641141533851, "num_tokens": 29328955.0, "step": 14760 }, { "entropy": 0.8084438286721707, "epoch": 0.2653253693806979, "grad_norm": 4.5625, "learning_rate": 4.25737468451299e-05, "loss": 0.8432988166809082, "mean_token_accuracy": 0.7984826803207398, "num_tokens": 29349679.0, "step": 14770 }, { "entropy": 0.7323750138282776, "epoch": 0.2655050074100687, "grad_norm": 6.03125, "learning_rate": 4.2563525788600144e-05, "loss": 0.724146842956543, "mean_token_accuracy": 0.8244312986731529, "num_tokens": 29369380.0, "step": 14780 }, { "entropy": 0.8129285268485547, "epoch": 0.26568464543943954, "grad_norm": 4.96875, "learning_rate": 4.255329893184239e-05, "loss": 0.8562200546264649, "mean_token_accuracy": 0.7958911299705506, "num_tokens": 29388300.0, "step": 14790 }, { "entropy": 0.8517115540802479, "epoch": 0.26586428346881036, "grad_norm": 8.375, "learning_rate": 4.2543066278234e-05, "loss": 0.9158024787902832, "mean_token_accuracy": 0.7789546191692353, "num_tokens": 29408773.0, "step": 14800 }, { "entropy": 0.8241821102797985, "epoch": 0.2660439214981812, "grad_norm": 6.8125, "learning_rate": 4.2532827831154225e-05, "loss": 0.8350062370300293, "mean_token_accuracy": 0.7896240040659904, "num_tokens": 29428186.0, "step": 14810 }, { "entropy": 0.8539618864655495, "epoch": 0.266223559527552, "grad_norm": 5.25, "learning_rate": 4.2522583593984245e-05, "loss": 0.8458507537841797, "mean_token_accuracy": 0.7927403837442398, "num_tokens": 29447999.0, "step": 14820 }, { "entropy": 0.886480239033699, "epoch": 0.2664031975569228, "grad_norm": 7.15625, "learning_rate": 4.251233357010713e-05, "loss": 0.9013381958007812, "mean_token_accuracy": 0.7853526636958122, "num_tokens": 29468914.0, "step": 14830 }, { "entropy": 0.8678180009126664, "epoch": 0.26658283558629364, "grad_norm": 5.09375, "learning_rate": 4.2502077762907896e-05, "loss": 0.8747787475585938, "mean_token_accuracy": 0.7956721991300583, "num_tokens": 29489661.0, "step": 14840 }, { "entropy": 0.8419894684106112, "epoch": 0.26676247361566446, "grad_norm": 7.5625, "learning_rate": 4.249181617577344e-05, "loss": 0.8622321128845215, "mean_token_accuracy": 0.7896248832345009, "num_tokens": 29509997.0, "step": 14850 }, { "entropy": 0.8152633763849735, "epoch": 0.26694211164503523, "grad_norm": 4.0, "learning_rate": 4.2481548812092575e-05, "loss": 0.8355317115783691, "mean_token_accuracy": 0.8034189760684967, "num_tokens": 29529308.0, "step": 14860 }, { "entropy": 0.8315967574715615, "epoch": 0.26712174967440605, "grad_norm": 4.96875, "learning_rate": 4.2471275675256034e-05, "loss": 0.8158427238464355, "mean_token_accuracy": 0.8048417374491692, "num_tokens": 29549575.0, "step": 14870 }, { "entropy": 0.7599101223051548, "epoch": 0.26730138770377687, "grad_norm": 4.96875, "learning_rate": 4.2460996768656434e-05, "loss": 0.7426119327545166, "mean_token_accuracy": 0.817649282515049, "num_tokens": 29570081.0, "step": 14880 }, { "entropy": 0.7584678359329701, "epoch": 0.2674810257331477, "grad_norm": 7.1875, "learning_rate": 4.245071209568832e-05, "loss": 0.8116582870483399, "mean_token_accuracy": 0.8024958059191704, "num_tokens": 29590816.0, "step": 14890 }, { "entropy": 0.7050860553979874, "epoch": 0.2676606637625185, "grad_norm": 5.625, "learning_rate": 4.244042165974813e-05, "loss": 0.724920129776001, "mean_token_accuracy": 0.8218887910246849, "num_tokens": 29610304.0, "step": 14900 }, { "entropy": 0.7423150785267353, "epoch": 0.26784030179188933, "grad_norm": 5.59375, "learning_rate": 4.2430125464234195e-05, "loss": 0.7800523281097412, "mean_token_accuracy": 0.815909343957901, "num_tokens": 29631452.0, "step": 14910 }, { "entropy": 0.8177873887121677, "epoch": 0.26801993982126016, "grad_norm": 6.3125, "learning_rate": 4.241982351254677e-05, "loss": 0.8582361221313477, "mean_token_accuracy": 0.79053515791893, "num_tokens": 29651311.0, "step": 14920 }, { "entropy": 0.8094145499169827, "epoch": 0.268199577850631, "grad_norm": 6.71875, "learning_rate": 4.2409515808088e-05, "loss": 0.8056672096252442, "mean_token_accuracy": 0.7977997109293937, "num_tokens": 29670275.0, "step": 14930 }, { "entropy": 0.7838593252003193, "epoch": 0.2683792158800018, "grad_norm": 6.5625, "learning_rate": 4.239920235426193e-05, "loss": 0.7865023612976074, "mean_token_accuracy": 0.8021491393446922, "num_tokens": 29690177.0, "step": 14940 }, { "entropy": 0.7969058059155941, "epoch": 0.2685588539093726, "grad_norm": 5.75, "learning_rate": 4.23888831544745e-05, "loss": 0.8203608512878418, "mean_token_accuracy": 0.8052724778652192, "num_tokens": 29709957.0, "step": 14950 }, { "entropy": 0.8394558370113373, "epoch": 0.26873849193874344, "grad_norm": 5.1875, "learning_rate": 4.237855821213356e-05, "loss": 0.8768033027648926, "mean_token_accuracy": 0.7964011982083321, "num_tokens": 29730036.0, "step": 14960 }, { "entropy": 0.7590589866042137, "epoch": 0.26891812996811426, "grad_norm": 5.8125, "learning_rate": 4.236822753064883e-05, "loss": 0.7614968776702881, "mean_token_accuracy": 0.8096046566963195, "num_tokens": 29748930.0, "step": 14970 }, { "entropy": 0.8132305979728699, "epoch": 0.2690977679974851, "grad_norm": 4.28125, "learning_rate": 4.235789111343196e-05, "loss": 0.819987678527832, "mean_token_accuracy": 0.7965493872761726, "num_tokens": 29768401.0, "step": 14980 }, { "entropy": 0.7061920069158077, "epoch": 0.2692774060268559, "grad_norm": 5.25, "learning_rate": 4.2347548963896476e-05, "loss": 0.7335346698760986, "mean_token_accuracy": 0.8200434759259224, "num_tokens": 29788539.0, "step": 14990 }, { "epoch": 0.2694570440562267, "eval_entropy": 0.782933717250824, "eval_loss": 0.7773110866546631, "eval_mean_token_accuracy": 0.8121837055683137, "eval_num_tokens": 29807778.0, "eval_runtime": 40.5759, "eval_samples_per_second": 49.29, "eval_steps_per_second": 6.161, "step": 15000 }, { "entropy": 0.858425565250218, "epoch": 0.26963668208559755, "grad_norm": 6.4375, "learning_rate": 4.232684748153323e-05, "loss": 0.8543200492858887, "mean_token_accuracy": 0.7928964242339134, "num_tokens": 29827572.0, "step": 15010 }, { "entropy": 0.8562903605401516, "epoch": 0.26981632011496837, "grad_norm": 6.1875, "learning_rate": 4.2316488155541976e-05, "loss": 0.8729925155639648, "mean_token_accuracy": 0.7820759490132332, "num_tokens": 29846918.0, "step": 15020 }, { "entropy": 0.6811912328004837, "epoch": 0.26999595814433913, "grad_norm": 4.84375, "learning_rate": 4.2306123110905135e-05, "loss": 0.723421049118042, "mean_token_accuracy": 0.821088133752346, "num_tokens": 29867640.0, "step": 15030 }, { "entropy": 0.8043637439608574, "epoch": 0.27017559617370995, "grad_norm": 7.78125, "learning_rate": 4.2295752351045695e-05, "loss": 0.8367928504943848, "mean_token_accuracy": 0.8034457430243492, "num_tokens": 29887707.0, "step": 15040 }, { "entropy": 0.7981558598577976, "epoch": 0.2703552342030808, "grad_norm": 7.03125, "learning_rate": 4.228537587938851e-05, "loss": 0.8467235565185547, "mean_token_accuracy": 0.7965778172016144, "num_tokens": 29906956.0, "step": 15050 }, { "entropy": 0.8807403571903706, "epoch": 0.2705348722324516, "grad_norm": 5.9375, "learning_rate": 4.227499369936034e-05, "loss": 0.8878775596618652, "mean_token_accuracy": 0.7872479170560837, "num_tokens": 29928219.0, "step": 15060 }, { "entropy": 0.7907146669924259, "epoch": 0.2707145102618224, "grad_norm": 6.125, "learning_rate": 4.226460581438984e-05, "loss": 0.7813410758972168, "mean_token_accuracy": 0.8135585740208626, "num_tokens": 29947772.0, "step": 15070 }, { "entropy": 0.8488945506513119, "epoch": 0.27089414829119324, "grad_norm": 5.375, "learning_rate": 4.225421222790751e-05, "loss": 0.844735050201416, "mean_token_accuracy": 0.7945253551006317, "num_tokens": 29968239.0, "step": 15080 }, { "entropy": 0.764475117623806, "epoch": 0.27107378632056406, "grad_norm": 5.125, "learning_rate": 4.224381294334576e-05, "loss": 0.7774603366851807, "mean_token_accuracy": 0.8092085734009743, "num_tokens": 29987550.0, "step": 15090 }, { "entropy": 0.7700480103492737, "epoch": 0.2712534243499349, "grad_norm": 6.25, "learning_rate": 4.2233407964138905e-05, "loss": 0.7915660381317139, "mean_token_accuracy": 0.8012581571936608, "num_tokens": 30007130.0, "step": 15100 }, { "entropy": 0.7512736760079861, "epoch": 0.2714330623793057, "grad_norm": 5.9375, "learning_rate": 4.2222997293723085e-05, "loss": 0.7560422897338868, "mean_token_accuracy": 0.812439477443695, "num_tokens": 30025409.0, "step": 15110 }, { "entropy": 0.76257349178195, "epoch": 0.2716127004086765, "grad_norm": 5.46875, "learning_rate": 4.2212580935536365e-05, "loss": 0.8023286819458008, "mean_token_accuracy": 0.8082122102379798, "num_tokens": 30044429.0, "step": 15120 }, { "entropy": 0.7564937815070152, "epoch": 0.27179233843804734, "grad_norm": 5.53125, "learning_rate": 4.220215889301867e-05, "loss": 0.8027561187744141, "mean_token_accuracy": 0.8062302619218826, "num_tokens": 30063577.0, "step": 15130 }, { "entropy": 0.8030178837478161, "epoch": 0.27197197646741816, "grad_norm": 5.0625, "learning_rate": 4.219173116961179e-05, "loss": 0.7878527641296387, "mean_token_accuracy": 0.8132232993841171, "num_tokens": 30082990.0, "step": 15140 }, { "entropy": 0.8668191500008107, "epoch": 0.272151614496789, "grad_norm": 7.59375, "learning_rate": 4.218129776875944e-05, "loss": 0.8677660942077636, "mean_token_accuracy": 0.7946762427687645, "num_tokens": 30102881.0, "step": 15150 }, { "entropy": 0.8510095737874508, "epoch": 0.2723312525261598, "grad_norm": 5.78125, "learning_rate": 4.2170858693907136e-05, "loss": 0.873196792602539, "mean_token_accuracy": 0.80057852268219, "num_tokens": 30123853.0, "step": 15160 }, { "entropy": 0.823201435059309, "epoch": 0.2725108905555306, "grad_norm": 5.5625, "learning_rate": 4.216041394850233e-05, "loss": 0.8839154243469238, "mean_token_accuracy": 0.7994728803634643, "num_tokens": 30144619.0, "step": 15170 }, { "entropy": 0.8226317308843136, "epoch": 0.27269052858490145, "grad_norm": 5.3125, "learning_rate": 4.214996353599432e-05, "loss": 0.8312336921691894, "mean_token_accuracy": 0.8007644861936569, "num_tokens": 30163965.0, "step": 15180 }, { "entropy": 0.7755617506802082, "epoch": 0.2728701666142722, "grad_norm": 4.5625, "learning_rate": 4.2139507459834276e-05, "loss": 0.7457169532775879, "mean_token_accuracy": 0.8187390372157097, "num_tokens": 30184265.0, "step": 15190 }, { "entropy": 0.7315781570971012, "epoch": 0.27304980464364303, "grad_norm": 5.65625, "learning_rate": 4.212904572347525e-05, "loss": 0.698231840133667, "mean_token_accuracy": 0.8214591443538666, "num_tokens": 30203910.0, "step": 15200 }, { "entropy": 0.8158537074923515, "epoch": 0.27322944267301386, "grad_norm": 4.90625, "learning_rate": 4.2118578330372136e-05, "loss": 0.7763810157775879, "mean_token_accuracy": 0.8141224846243859, "num_tokens": 30222866.0, "step": 15210 }, { "entropy": 0.705679365247488, "epoch": 0.2734090807023847, "grad_norm": 5.28125, "learning_rate": 4.210810528398174e-05, "loss": 0.7324028968811035, "mean_token_accuracy": 0.8257035061717033, "num_tokens": 30242837.0, "step": 15220 }, { "entropy": 0.7460914671421051, "epoch": 0.2735887187317555, "grad_norm": 6.625, "learning_rate": 4.2097626587762694e-05, "loss": 0.792588472366333, "mean_token_accuracy": 0.8025313034653664, "num_tokens": 30261863.0, "step": 15230 }, { "entropy": 0.8398551344871521, "epoch": 0.2737683567611263, "grad_norm": 7.6875, "learning_rate": 4.2087142245175523e-05, "loss": 0.8939518928527832, "mean_token_accuracy": 0.7907396376132965, "num_tokens": 30281434.0, "step": 15240 }, { "entropy": 0.819460928440094, "epoch": 0.27394799479049714, "grad_norm": 6.3125, "learning_rate": 4.20766522596826e-05, "loss": 0.8539933204650879, "mean_token_accuracy": 0.7936834156513214, "num_tokens": 30300472.0, "step": 15250 }, { "entropy": 0.7469527527689934, "epoch": 0.27412763281986796, "grad_norm": 5.125, "learning_rate": 4.206615663474817e-05, "loss": 0.8117154121398926, "mean_token_accuracy": 0.810653404891491, "num_tokens": 30320941.0, "step": 15260 }, { "entropy": 0.7652257144451141, "epoch": 0.2743072708492388, "grad_norm": 7.5, "learning_rate": 4.205565537383832e-05, "loss": 0.7320143222808838, "mean_token_accuracy": 0.8190082177519799, "num_tokens": 30340624.0, "step": 15270 }, { "entropy": 0.7558058016002178, "epoch": 0.2744869088786096, "grad_norm": 5.8125, "learning_rate": 4.2045148480421034e-05, "loss": 0.7971116542816162, "mean_token_accuracy": 0.8121700271964073, "num_tokens": 30360364.0, "step": 15280 }, { "entropy": 0.8277565866708756, "epoch": 0.2746665469079804, "grad_norm": 7.9375, "learning_rate": 4.203463595796614e-05, "loss": 0.8302898406982422, "mean_token_accuracy": 0.799428278207779, "num_tokens": 30379580.0, "step": 15290 }, { "entropy": 0.7397950187325477, "epoch": 0.27484618493735125, "grad_norm": 5.0, "learning_rate": 4.202411780994532e-05, "loss": 0.752332353591919, "mean_token_accuracy": 0.8206473425030708, "num_tokens": 30399545.0, "step": 15300 }, { "entropy": 0.7773168049752712, "epoch": 0.27502582296672207, "grad_norm": 7.4375, "learning_rate": 4.201359403983211e-05, "loss": 0.7869867801666259, "mean_token_accuracy": 0.8087172418832779, "num_tokens": 30418498.0, "step": 15310 }, { "entropy": 0.8848711736500263, "epoch": 0.2752054609960929, "grad_norm": 5.6875, "learning_rate": 4.2003064651101907e-05, "loss": 0.8747241020202636, "mean_token_accuracy": 0.7983499258756638, "num_tokens": 30437891.0, "step": 15320 }, { "entropy": 0.844631502777338, "epoch": 0.2753850990254637, "grad_norm": 6.125, "learning_rate": 4.1992529647231984e-05, "loss": 0.8646357536315918, "mean_token_accuracy": 0.7951238691806793, "num_tokens": 30458142.0, "step": 15330 }, { "entropy": 0.8027203001081944, "epoch": 0.27556473705483453, "grad_norm": 8.875, "learning_rate": 4.198198903170143e-05, "loss": 0.8388633728027344, "mean_token_accuracy": 0.794037452340126, "num_tokens": 30477217.0, "step": 15340 }, { "entropy": 0.7782227091491223, "epoch": 0.27574437508420535, "grad_norm": 7.96875, "learning_rate": 4.197144280799122e-05, "loss": 0.7912730693817138, "mean_token_accuracy": 0.8029851600527763, "num_tokens": 30497337.0, "step": 15350 }, { "entropy": 0.7280202258378268, "epoch": 0.2759240131135761, "grad_norm": 4.96875, "learning_rate": 4.1960890979584163e-05, "loss": 0.7232720851898193, "mean_token_accuracy": 0.8153430238366127, "num_tokens": 30516157.0, "step": 15360 }, { "entropy": 0.7394778750836849, "epoch": 0.27610365114294694, "grad_norm": 7.03125, "learning_rate": 4.195033354996492e-05, "loss": 0.7084841251373291, "mean_token_accuracy": 0.825533977150917, "num_tokens": 30536781.0, "step": 15370 }, { "entropy": 0.851001937687397, "epoch": 0.27628328917231776, "grad_norm": 8.375, "learning_rate": 4.193977052262001e-05, "loss": 0.9042911529541016, "mean_token_accuracy": 0.7801014602184295, "num_tokens": 30556029.0, "step": 15380 }, { "entropy": 0.7767828799784183, "epoch": 0.2764629272016886, "grad_norm": 6.84375, "learning_rate": 4.192920190103781e-05, "loss": 0.802911376953125, "mean_token_accuracy": 0.8073208600282669, "num_tokens": 30576326.0, "step": 15390 }, { "entropy": 0.7369447678327561, "epoch": 0.2766425652310594, "grad_norm": 5.4375, "learning_rate": 4.191862768870851e-05, "loss": 0.7825936794281005, "mean_token_accuracy": 0.8234935507178307, "num_tokens": 30596282.0, "step": 15400 }, { "entropy": 0.7223578862845897, "epoch": 0.2768222032604302, "grad_norm": 7.0, "learning_rate": 4.1908047889124184e-05, "loss": 0.7637592315673828, "mean_token_accuracy": 0.8166277825832366, "num_tokens": 30615588.0, "step": 15410 }, { "entropy": 0.8957057736814023, "epoch": 0.27700184128980104, "grad_norm": 4.84375, "learning_rate": 4.189746250577873e-05, "loss": 0.8960773468017578, "mean_token_accuracy": 0.7940184935927391, "num_tokens": 30635162.0, "step": 15420 }, { "entropy": 0.7907737970352173, "epoch": 0.27718147931917186, "grad_norm": 5.90625, "learning_rate": 4.188687154216788e-05, "loss": 0.7601071834564209, "mean_token_accuracy": 0.8129597023129463, "num_tokens": 30655417.0, "step": 15430 }, { "entropy": 0.8412348203361034, "epoch": 0.2773611173485427, "grad_norm": 5.5625, "learning_rate": 4.187627500178925e-05, "loss": 0.8645668983459472, "mean_token_accuracy": 0.7875519007444381, "num_tokens": 30674930.0, "step": 15440 }, { "entropy": 0.7478829987347126, "epoch": 0.2775407553779135, "grad_norm": 5.5, "learning_rate": 4.1865672888142246e-05, "loss": 0.7541036605834961, "mean_token_accuracy": 0.815546253323555, "num_tokens": 30694021.0, "step": 15450 }, { "entropy": 0.7349458284676075, "epoch": 0.2777203934072843, "grad_norm": 5.78125, "learning_rate": 4.1855065204728164e-05, "loss": 0.7484430313110352, "mean_token_accuracy": 0.8199443146586418, "num_tokens": 30713047.0, "step": 15460 }, { "entropy": 0.7155452094972133, "epoch": 0.27790003143665515, "grad_norm": 4.875, "learning_rate": 4.184445195505009e-05, "loss": 0.7334370136260986, "mean_token_accuracy": 0.8189377710223198, "num_tokens": 30733300.0, "step": 15470 }, { "entropy": 0.7888330042362213, "epoch": 0.27807966946602597, "grad_norm": 6.34375, "learning_rate": 4.183383314261299e-05, "loss": 0.8616847038269043, "mean_token_accuracy": 0.801086388528347, "num_tokens": 30753889.0, "step": 15480 }, { "entropy": 0.8318060167133808, "epoch": 0.2782593074953968, "grad_norm": 5.625, "learning_rate": 4.182320877092364e-05, "loss": 0.8092374801635742, "mean_token_accuracy": 0.8028967261314393, "num_tokens": 30774808.0, "step": 15490 }, { "entropy": 0.8503727957606315, "epoch": 0.2784389455247676, "grad_norm": 7.8125, "learning_rate": 4.1812578843490676e-05, "loss": 0.9135036468505859, "mean_token_accuracy": 0.7880162164568901, "num_tokens": 30795797.0, "step": 15500 }, { "entropy": 0.8089977629482746, "epoch": 0.27861858355413843, "grad_norm": 6.5, "learning_rate": 4.1801943363824545e-05, "loss": 0.8380992889404297, "mean_token_accuracy": 0.7971097275614738, "num_tokens": 30816803.0, "step": 15510 }, { "entropy": 0.7498241052031517, "epoch": 0.27879822158350925, "grad_norm": 6.90625, "learning_rate": 4.1791302335437535e-05, "loss": 0.767780876159668, "mean_token_accuracy": 0.8159568309783936, "num_tokens": 30836134.0, "step": 15520 }, { "entropy": 0.7281147390604019, "epoch": 0.27897785961288, "grad_norm": 5.34375, "learning_rate": 4.1780655761843776e-05, "loss": 0.7200061798095703, "mean_token_accuracy": 0.8257206797599792, "num_tokens": 30856097.0, "step": 15530 }, { "entropy": 0.8131218485534191, "epoch": 0.27915749764225084, "grad_norm": 5.625, "learning_rate": 4.177000364655922e-05, "loss": 0.8036087989807129, "mean_token_accuracy": 0.7982544377446175, "num_tokens": 30875604.0, "step": 15540 }, { "entropy": 0.7974972054362297, "epoch": 0.27933713567162166, "grad_norm": 4.75, "learning_rate": 4.175934599310165e-05, "loss": 0.7071460723876953, "mean_token_accuracy": 0.8259832620620727, "num_tokens": 30895446.0, "step": 15550 }, { "entropy": 0.6969527877867222, "epoch": 0.2795167737009925, "grad_norm": 4.21875, "learning_rate": 4.174868280499069e-05, "loss": 0.6668246746063232, "mean_token_accuracy": 0.8357454121112824, "num_tokens": 30915951.0, "step": 15560 }, { "entropy": 0.7876476876437664, "epoch": 0.2796964117303633, "grad_norm": 5.84375, "learning_rate": 4.1738014085747765e-05, "loss": 0.8730512619018554, "mean_token_accuracy": 0.7937133431434631, "num_tokens": 30935765.0, "step": 15570 }, { "entropy": 0.7450729414820672, "epoch": 0.2798760497597341, "grad_norm": 5.5, "learning_rate": 4.172733983889615e-05, "loss": 0.7500867366790771, "mean_token_accuracy": 0.8151269376277923, "num_tokens": 30955605.0, "step": 15580 }, { "entropy": 0.8328361734747887, "epoch": 0.28005568778910495, "grad_norm": 6.3125, "learning_rate": 4.171666006796094e-05, "loss": 0.88980712890625, "mean_token_accuracy": 0.8004471838474274, "num_tokens": 30973597.0, "step": 15590 }, { "entropy": 0.7893170610070228, "epoch": 0.28023532581847577, "grad_norm": 5.0, "learning_rate": 4.170597477646905e-05, "loss": 0.7996819019317627, "mean_token_accuracy": 0.8028216451406479, "num_tokens": 30993835.0, "step": 15600 }, { "entropy": 0.7736422643065453, "epoch": 0.2804149638478466, "grad_norm": 4.71875, "learning_rate": 4.169528396794922e-05, "loss": 0.7739620685577393, "mean_token_accuracy": 0.808749896287918, "num_tokens": 31013286.0, "step": 15610 }, { "entropy": 0.83072724416852, "epoch": 0.2805946018772174, "grad_norm": 5.5, "learning_rate": 4.1684587645932006e-05, "loss": 0.8459759712219238, "mean_token_accuracy": 0.7988006912171841, "num_tokens": 31034633.0, "step": 15620 }, { "entropy": 0.7503642030060291, "epoch": 0.28077423990658823, "grad_norm": 6.3125, "learning_rate": 4.167388581394981e-05, "loss": 0.7674846649169922, "mean_token_accuracy": 0.815148974955082, "num_tokens": 31055391.0, "step": 15630 }, { "entropy": 0.8070327155292034, "epoch": 0.28095387793595905, "grad_norm": 5.40625, "learning_rate": 4.166317847553681e-05, "loss": 0.8116891860961915, "mean_token_accuracy": 0.801799064874649, "num_tokens": 31074940.0, "step": 15640 }, { "entropy": 0.8238192707300186, "epoch": 0.28113351596532987, "grad_norm": 5.34375, "learning_rate": 4.165246563422906e-05, "loss": 0.8363788604736329, "mean_token_accuracy": 0.8007370710372925, "num_tokens": 31095470.0, "step": 15650 }, { "entropy": 0.7823977239429951, "epoch": 0.2813131539947007, "grad_norm": 5.96875, "learning_rate": 4.164174729356437e-05, "loss": 0.7903109073638916, "mean_token_accuracy": 0.810466168820858, "num_tokens": 31115044.0, "step": 15660 }, { "entropy": 0.7794207729399204, "epoch": 0.2814927920240715, "grad_norm": 6.25, "learning_rate": 4.163102345708241e-05, "loss": 0.7499467372894287, "mean_token_accuracy": 0.8065095126628876, "num_tokens": 31134441.0, "step": 15670 }, { "entropy": 0.7686565883457661, "epoch": 0.28167243005344234, "grad_norm": 5.5, "learning_rate": 4.162029412832464e-05, "loss": 0.7682111740112305, "mean_token_accuracy": 0.8164161577820778, "num_tokens": 31154435.0, "step": 15680 }, { "entropy": 0.7627410054206848, "epoch": 0.28185206808281316, "grad_norm": 5.375, "learning_rate": 4.160955931083434e-05, "loss": 0.8017070770263672, "mean_token_accuracy": 0.8144962951540947, "num_tokens": 31175256.0, "step": 15690 }, { "entropy": 0.724706993997097, "epoch": 0.2820317061121839, "grad_norm": 4.8125, "learning_rate": 4.1598819008156633e-05, "loss": 0.7209950923919678, "mean_token_accuracy": 0.8210929945111275, "num_tokens": 31194174.0, "step": 15700 }, { "entropy": 0.7097630426287651, "epoch": 0.28221134414155474, "grad_norm": 4.0625, "learning_rate": 4.15880732238384e-05, "loss": 0.7172952175140381, "mean_token_accuracy": 0.8239585056900978, "num_tokens": 31213803.0, "step": 15710 }, { "entropy": 0.7432207785546779, "epoch": 0.28239098217092556, "grad_norm": 6.59375, "learning_rate": 4.157732196142836e-05, "loss": 0.7617032527923584, "mean_token_accuracy": 0.8206196159124375, "num_tokens": 31233701.0, "step": 15720 }, { "entropy": 0.7092471659183502, "epoch": 0.2825706202002964, "grad_norm": 5.65625, "learning_rate": 4.156656522447706e-05, "loss": 0.7115270614624023, "mean_token_accuracy": 0.8199438467621804, "num_tokens": 31253320.0, "step": 15730 }, { "entropy": 0.7400734752416611, "epoch": 0.2827502582296672, "grad_norm": 5.65625, "learning_rate": 4.1555803016536815e-05, "loss": 0.7746194362640381, "mean_token_accuracy": 0.8121130377054214, "num_tokens": 31274566.0, "step": 15740 }, { "entropy": 0.7510441161692143, "epoch": 0.282929896259038, "grad_norm": 6.25, "learning_rate": 4.1545035341161776e-05, "loss": 0.8051490783691406, "mean_token_accuracy": 0.8095645785331727, "num_tokens": 31294004.0, "step": 15750 }, { "entropy": 0.8055024221539497, "epoch": 0.28310953428840885, "grad_norm": 5.5625, "learning_rate": 4.153426220190788e-05, "loss": 0.8285681724548339, "mean_token_accuracy": 0.8129273235797883, "num_tokens": 31313690.0, "step": 15760 }, { "entropy": 0.7768132604658604, "epoch": 0.28328917231777967, "grad_norm": 7.4375, "learning_rate": 4.15234836023329e-05, "loss": 0.7528494834899903, "mean_token_accuracy": 0.8132277220487595, "num_tokens": 31334113.0, "step": 15770 }, { "entropy": 0.8804208666086197, "epoch": 0.2834688103471505, "grad_norm": 5.5, "learning_rate": 4.151269954599637e-05, "loss": 0.9061985015869141, "mean_token_accuracy": 0.7852698013186454, "num_tokens": 31354142.0, "step": 15780 }, { "entropy": 0.7419680453836918, "epoch": 0.2836484483765213, "grad_norm": 9.1875, "learning_rate": 4.1501910036459656e-05, "loss": 0.7257208347320556, "mean_token_accuracy": 0.8212027832865715, "num_tokens": 31373620.0, "step": 15790 }, { "entropy": 0.6994263164699077, "epoch": 0.28382808640589213, "grad_norm": 5.75, "learning_rate": 4.1491115077285916e-05, "loss": 0.7097643852233887, "mean_token_accuracy": 0.8258636325597764, "num_tokens": 31393428.0, "step": 15800 }, { "entropy": 0.7774539552628994, "epoch": 0.28400772443526295, "grad_norm": 5.8125, "learning_rate": 4.148031467204011e-05, "loss": 0.7774507522583007, "mean_token_accuracy": 0.8088270738720894, "num_tokens": 31413716.0, "step": 15810 }, { "entropy": 0.8529713410884142, "epoch": 0.2841873624646338, "grad_norm": 6.5, "learning_rate": 4.146950882428898e-05, "loss": 0.8658102035522461, "mean_token_accuracy": 0.7921802893280983, "num_tokens": 31433879.0, "step": 15820 }, { "entropy": 0.7473576918244362, "epoch": 0.2843670004940046, "grad_norm": 6.15625, "learning_rate": 4.14586975376011e-05, "loss": 0.736475133895874, "mean_token_accuracy": 0.8213563725352288, "num_tokens": 31453155.0, "step": 15830 }, { "entropy": 0.7054384544491767, "epoch": 0.2845466385233754, "grad_norm": 5.1875, "learning_rate": 4.14478808155468e-05, "loss": 0.7497594356536865, "mean_token_accuracy": 0.8174060076475144, "num_tokens": 31472618.0, "step": 15840 }, { "entropy": 0.9327756479382515, "epoch": 0.28472627655274624, "grad_norm": 6.0625, "learning_rate": 4.1437058661698244e-05, "loss": 0.9854413986206054, "mean_token_accuracy": 0.7784182697534561, "num_tokens": 31492201.0, "step": 15850 }, { "entropy": 0.8623161919414997, "epoch": 0.28490591458211706, "grad_norm": 6.28125, "learning_rate": 4.1426231079629355e-05, "loss": 0.8703429222106933, "mean_token_accuracy": 0.7865716114640235, "num_tokens": 31513233.0, "step": 15860 }, { "entropy": 0.7912965916097164, "epoch": 0.2850855526114878, "grad_norm": 6.65625, "learning_rate": 4.141539807291587e-05, "loss": 0.78533935546875, "mean_token_accuracy": 0.8112850442528725, "num_tokens": 31533118.0, "step": 15870 }, { "entropy": 0.7576616831123829, "epoch": 0.28526519064085865, "grad_norm": 6.53125, "learning_rate": 4.1404559645135314e-05, "loss": 0.7483622550964355, "mean_token_accuracy": 0.815638393163681, "num_tokens": 31552064.0, "step": 15880 }, { "entropy": 0.7274096436798573, "epoch": 0.28544482867022947, "grad_norm": 5.78125, "learning_rate": 4.139371579986699e-05, "loss": 0.7241614818572998, "mean_token_accuracy": 0.8139476224780082, "num_tokens": 31571986.0, "step": 15890 }, { "entropy": 0.8361580953001976, "epoch": 0.2856244666996003, "grad_norm": 6.0625, "learning_rate": 4.1382866540692017e-05, "loss": 0.8124227523803711, "mean_token_accuracy": 0.8022423937916756, "num_tokens": 31591019.0, "step": 15900 }, { "entropy": 0.7711074855178595, "epoch": 0.2858041047289711, "grad_norm": 5.4375, "learning_rate": 4.1372011871193274e-05, "loss": 0.7568377017974853, "mean_token_accuracy": 0.819816367328167, "num_tokens": 31610266.0, "step": 15910 }, { "entropy": 0.8036399684846401, "epoch": 0.28598374275834193, "grad_norm": 6.3125, "learning_rate": 4.1361151794955436e-05, "loss": 0.8389735221862793, "mean_token_accuracy": 0.7925105318427086, "num_tokens": 31631074.0, "step": 15920 }, { "entropy": 0.7928057365119457, "epoch": 0.28616338078771275, "grad_norm": 6.0, "learning_rate": 4.1350286315564955e-05, "loss": 0.8213986396789551, "mean_token_accuracy": 0.7985964506864548, "num_tokens": 31651200.0, "step": 15930 }, { "entropy": 0.7588919274508953, "epoch": 0.28634301881708357, "grad_norm": 5.34375, "learning_rate": 4.13394154366101e-05, "loss": 0.7963966846466064, "mean_token_accuracy": 0.8093880817294121, "num_tokens": 31670520.0, "step": 15940 }, { "entropy": 0.7961931593716145, "epoch": 0.2865226568464544, "grad_norm": 6.84375, "learning_rate": 4.132853916168089e-05, "loss": 0.8064395904541015, "mean_token_accuracy": 0.8072598338127136, "num_tokens": 31690983.0, "step": 15950 }, { "entropy": 0.7187569998204708, "epoch": 0.2867022948758252, "grad_norm": 4.96875, "learning_rate": 4.1317657494369135e-05, "loss": 0.7582693099975586, "mean_token_accuracy": 0.8090129747986794, "num_tokens": 31711180.0, "step": 15960 }, { "entropy": 0.8032232850790024, "epoch": 0.28688193290519604, "grad_norm": 7.6875, "learning_rate": 4.130677043826843e-05, "loss": 0.8159518241882324, "mean_token_accuracy": 0.8023663058876991, "num_tokens": 31730481.0, "step": 15970 }, { "entropy": 0.7934968687593937, "epoch": 0.28706157093456686, "grad_norm": 6.71875, "learning_rate": 4.129587799697414e-05, "loss": 0.7949066638946534, "mean_token_accuracy": 0.8001003921031952, "num_tokens": 31750886.0, "step": 15980 }, { "entropy": 0.8237157940864563, "epoch": 0.2872412089639377, "grad_norm": 6.46875, "learning_rate": 4.1284980174083425e-05, "loss": 0.8106029510498047, "mean_token_accuracy": 0.8044885590672493, "num_tokens": 31771212.0, "step": 15990 }, { "epoch": 0.2874208469933085, "eval_entropy": 0.769939710021019, "eval_loss": 0.7637472748756409, "eval_mean_token_accuracy": 0.8148191969394684, "eval_num_tokens": 31791201.0, "eval_runtime": 40.556, "eval_samples_per_second": 49.315, "eval_steps_per_second": 6.164, "step": 16000 }, { "entropy": 0.8075591046363115, "epoch": 0.2876004850226793, "grad_norm": 6.0625, "learning_rate": 4.12631683979102e-05, "loss": 0.8072579383850098, "mean_token_accuracy": 0.8063986800611019, "num_tokens": 31811837.0, "step": 16010 }, { "entropy": 0.7812395192682743, "epoch": 0.28778012305205014, "grad_norm": 4.4375, "learning_rate": 4.1252254451830866e-05, "loss": 0.7616629600524902, "mean_token_accuracy": 0.8214369758963584, "num_tokens": 31830167.0, "step": 16020 }, { "entropy": 0.734915504604578, "epoch": 0.28795976108142096, "grad_norm": 7.3125, "learning_rate": 4.124133513856147e-05, "loss": 0.7374481201171875, "mean_token_accuracy": 0.8198157727718354, "num_tokens": 31849761.0, "step": 16030 }, { "entropy": 0.7607235573232174, "epoch": 0.2881393991107917, "grad_norm": 6.1875, "learning_rate": 4.123041046170802e-05, "loss": 0.7706562042236328, "mean_token_accuracy": 0.8223676219582557, "num_tokens": 31869937.0, "step": 16040 }, { "entropy": 0.7586753569543362, "epoch": 0.28831903714016255, "grad_norm": 6.1875, "learning_rate": 4.1219480424878326e-05, "loss": 0.7715690612792969, "mean_token_accuracy": 0.8111238434910775, "num_tokens": 31889669.0, "step": 16050 }, { "entropy": 0.6968930706381797, "epoch": 0.28849867516953337, "grad_norm": 6.125, "learning_rate": 4.120854503168195e-05, "loss": 0.756509256362915, "mean_token_accuracy": 0.8189873367547988, "num_tokens": 31909265.0, "step": 16060 }, { "entropy": 0.7779805593192577, "epoch": 0.2886783131989042, "grad_norm": 9.25, "learning_rate": 4.119760428573024e-05, "loss": 0.7882138252258301, "mean_token_accuracy": 0.8103580631315708, "num_tokens": 31929716.0, "step": 16070 }, { "entropy": 0.8281352058053016, "epoch": 0.288857951228275, "grad_norm": 6.25, "learning_rate": 4.1186658190636286e-05, "loss": 0.8437937736511231, "mean_token_accuracy": 0.797195915877819, "num_tokens": 31948424.0, "step": 16080 }, { "entropy": 0.6807680770754814, "epoch": 0.28903758925764583, "grad_norm": 6.53125, "learning_rate": 4.117570675001495e-05, "loss": 0.6521598339080811, "mean_token_accuracy": 0.8366071119904518, "num_tokens": 31968102.0, "step": 16090 }, { "entropy": 0.741829277575016, "epoch": 0.28921722728701665, "grad_norm": 7.0625, "learning_rate": 4.116474996748287e-05, "loss": 0.7737984657287598, "mean_token_accuracy": 0.8136377841234207, "num_tokens": 31988242.0, "step": 16100 }, { "entropy": 0.6802665669471025, "epoch": 0.2893968653163875, "grad_norm": 5.15625, "learning_rate": 4.115378784665847e-05, "loss": 0.6773580551147461, "mean_token_accuracy": 0.8326177462935448, "num_tokens": 32007244.0, "step": 16110 }, { "entropy": 0.7470757000148296, "epoch": 0.2895765033457583, "grad_norm": 5.9375, "learning_rate": 4.114282039116187e-05, "loss": 0.8040597915649415, "mean_token_accuracy": 0.7988247752189637, "num_tokens": 32026112.0, "step": 16120 }, { "entropy": 0.734778118878603, "epoch": 0.2897561413751291, "grad_norm": 7.34375, "learning_rate": 4.113184760461502e-05, "loss": 0.7510690689086914, "mean_token_accuracy": 0.8199361532926559, "num_tokens": 32046018.0, "step": 16130 }, { "entropy": 0.8198709115386009, "epoch": 0.28993577940449994, "grad_norm": 5.25, "learning_rate": 4.1120869490641595e-05, "loss": 0.8106560707092285, "mean_token_accuracy": 0.7973447903990746, "num_tokens": 32065297.0, "step": 16140 }, { "entropy": 0.7495136730372906, "epoch": 0.29011541743387076, "grad_norm": 7.0625, "learning_rate": 4.110988605286704e-05, "loss": 0.7754366397857666, "mean_token_accuracy": 0.8070261612534523, "num_tokens": 32085864.0, "step": 16150 }, { "entropy": 0.7799046531319618, "epoch": 0.2902950554632416, "grad_norm": 6.34375, "learning_rate": 4.109889729491856e-05, "loss": 0.7895327091217041, "mean_token_accuracy": 0.8026217311620713, "num_tokens": 32104997.0, "step": 16160 }, { "entropy": 0.703456562757492, "epoch": 0.2904746934926124, "grad_norm": 5.5, "learning_rate": 4.108790322042512e-05, "loss": 0.700212049484253, "mean_token_accuracy": 0.8223715513944626, "num_tokens": 32124715.0, "step": 16170 }, { "entropy": 0.790971789509058, "epoch": 0.2906543315219832, "grad_norm": 11.8125, "learning_rate": 4.107690383301741e-05, "loss": 0.8490647315979004, "mean_token_accuracy": 0.7925594851374627, "num_tokens": 32144759.0, "step": 16180 }, { "entropy": 0.774212346971035, "epoch": 0.29083396955135404, "grad_norm": 5.625, "learning_rate": 4.106589913632791e-05, "loss": 0.7576523303985596, "mean_token_accuracy": 0.8170502424240113, "num_tokens": 32165617.0, "step": 16190 }, { "entropy": 0.7632520660758019, "epoch": 0.29101360758072486, "grad_norm": 6.78125, "learning_rate": 4.105488913399086e-05, "loss": 0.7882227897644043, "mean_token_accuracy": 0.8019206464290619, "num_tokens": 32184924.0, "step": 16200 }, { "entropy": 0.7957564160227776, "epoch": 0.29119324561009563, "grad_norm": 6.625, "learning_rate": 4.104387382964221e-05, "loss": 0.8309175491333007, "mean_token_accuracy": 0.8002100974321366, "num_tokens": 32204341.0, "step": 16210 }, { "entropy": 0.815641226619482, "epoch": 0.29137288363946645, "grad_norm": 5.4375, "learning_rate": 4.1032853226919696e-05, "loss": 0.8366466522216797, "mean_token_accuracy": 0.8038297548890114, "num_tokens": 32224698.0, "step": 16220 }, { "entropy": 0.7388044387102127, "epoch": 0.2915525216688373, "grad_norm": 4.6875, "learning_rate": 4.102182732946279e-05, "loss": 0.7544495582580566, "mean_token_accuracy": 0.8144376754760743, "num_tokens": 32245140.0, "step": 16230 }, { "entropy": 0.7551039382815361, "epoch": 0.2917321596982081, "grad_norm": 6.5625, "learning_rate": 4.101079614091271e-05, "loss": 0.7650655746459961, "mean_token_accuracy": 0.8112197160720825, "num_tokens": 32264956.0, "step": 16240 }, { "entropy": 0.7910215213894844, "epoch": 0.2919117977275789, "grad_norm": 5.25, "learning_rate": 4.099975966491244e-05, "loss": 0.8058812141418457, "mean_token_accuracy": 0.8040731906890869, "num_tokens": 32284451.0, "step": 16250 }, { "entropy": 0.8513581395149231, "epoch": 0.29209143575694974, "grad_norm": 6.46875, "learning_rate": 4.098871790510669e-05, "loss": 0.8738054275512696, "mean_token_accuracy": 0.7896746918559074, "num_tokens": 32303906.0, "step": 16260 }, { "entropy": 0.7252016447484493, "epoch": 0.29227107378632056, "grad_norm": 6.1875, "learning_rate": 4.097767086514191e-05, "loss": 0.7252104759216309, "mean_token_accuracy": 0.8254316568374633, "num_tokens": 32323234.0, "step": 16270 }, { "entropy": 0.6794798195362091, "epoch": 0.2924507118156914, "grad_norm": 4.71875, "learning_rate": 4.096661854866633e-05, "loss": 0.6654901027679443, "mean_token_accuracy": 0.8359261587262153, "num_tokens": 32344109.0, "step": 16280 }, { "entropy": 0.7859842635691165, "epoch": 0.2926303498450622, "grad_norm": 4.9375, "learning_rate": 4.0955560959329874e-05, "loss": 0.7949409484863281, "mean_token_accuracy": 0.8133767902851105, "num_tokens": 32363043.0, "step": 16290 }, { "entropy": 0.756204704195261, "epoch": 0.292809987874433, "grad_norm": 5.0, "learning_rate": 4.0944498100784244e-05, "loss": 0.7917475223541259, "mean_token_accuracy": 0.8035780057311058, "num_tokens": 32382831.0, "step": 16300 }, { "entropy": 0.6658496014773846, "epoch": 0.29298962590380384, "grad_norm": 5.65625, "learning_rate": 4.093342997668287e-05, "loss": 0.7091598510742188, "mean_token_accuracy": 0.8197940289974213, "num_tokens": 32403481.0, "step": 16310 }, { "entropy": 0.7673735603690147, "epoch": 0.29316926393317466, "grad_norm": 5.03125, "learning_rate": 4.092235659068091e-05, "loss": 0.7712867259979248, "mean_token_accuracy": 0.8052166000008583, "num_tokens": 32423608.0, "step": 16320 }, { "entropy": 0.7582424409687519, "epoch": 0.2933489019625455, "grad_norm": 4.75, "learning_rate": 4.0911277946435285e-05, "loss": 0.759792709350586, "mean_token_accuracy": 0.8127274006605149, "num_tokens": 32443711.0, "step": 16330 }, { "entropy": 0.7317033216357232, "epoch": 0.2935285399919163, "grad_norm": 4.6875, "learning_rate": 4.090019404760462e-05, "loss": 0.6944607257843017, "mean_token_accuracy": 0.8303657665848732, "num_tokens": 32463328.0, "step": 16340 }, { "entropy": 0.7394083186984062, "epoch": 0.2937081780212871, "grad_norm": 5.96875, "learning_rate": 4.088910489784931e-05, "loss": 0.7875749588012695, "mean_token_accuracy": 0.8133788600564003, "num_tokens": 32484034.0, "step": 16350 }, { "entropy": 0.7232165172696113, "epoch": 0.29388781605065795, "grad_norm": 4.5625, "learning_rate": 4.087801050083146e-05, "loss": 0.7252594470977783, "mean_token_accuracy": 0.8206925451755523, "num_tokens": 32502926.0, "step": 16360 }, { "entropy": 0.7964564621448517, "epoch": 0.29406745408002877, "grad_norm": 6.46875, "learning_rate": 4.0866910860214915e-05, "loss": 0.8127152442932128, "mean_token_accuracy": 0.8036402523517608, "num_tokens": 32522225.0, "step": 16370 }, { "entropy": 0.7179344594478607, "epoch": 0.29424709210939953, "grad_norm": 7.34375, "learning_rate": 4.0855805979665245e-05, "loss": 0.7233580112457275, "mean_token_accuracy": 0.8175023674964905, "num_tokens": 32541469.0, "step": 16380 }, { "entropy": 0.7371633421629668, "epoch": 0.29442673013877035, "grad_norm": 5.59375, "learning_rate": 4.084469586284977e-05, "loss": 0.7301100730895996, "mean_token_accuracy": 0.8220718190073967, "num_tokens": 32561720.0, "step": 16390 }, { "entropy": 0.8346506595611572, "epoch": 0.2946063681681412, "grad_norm": 8.125, "learning_rate": 4.0833580513437505e-05, "loss": 0.8832295417785645, "mean_token_accuracy": 0.7864325046539307, "num_tokens": 32581819.0, "step": 16400 }, { "entropy": 0.7887408591806888, "epoch": 0.294786006197512, "grad_norm": 4.71875, "learning_rate": 4.0822459935099246e-05, "loss": 0.7814285278320312, "mean_token_accuracy": 0.8054888308048248, "num_tokens": 32602657.0, "step": 16410 }, { "entropy": 0.8148703306913376, "epoch": 0.2949656442268828, "grad_norm": 5.21875, "learning_rate": 4.081133413150746e-05, "loss": 0.8244067192077636, "mean_token_accuracy": 0.8036095216870308, "num_tokens": 32620929.0, "step": 16420 }, { "entropy": 0.6441010862588883, "epoch": 0.29514528225625364, "grad_norm": 4.59375, "learning_rate": 4.0800203106336365e-05, "loss": 0.6752524375915527, "mean_token_accuracy": 0.8291705891489982, "num_tokens": 32641281.0, "step": 16430 }, { "entropy": 0.7516821302473545, "epoch": 0.29532492028562446, "grad_norm": 8.125, "learning_rate": 4.07890668632619e-05, "loss": 0.7595185279846192, "mean_token_accuracy": 0.8179703846573829, "num_tokens": 32660949.0, "step": 16440 }, { "entropy": 0.6725540444254875, "epoch": 0.2955045583149953, "grad_norm": 11.9375, "learning_rate": 4.0777925405961746e-05, "loss": 0.6743653297424317, "mean_token_accuracy": 0.8307419419288635, "num_tokens": 32681234.0, "step": 16450 }, { "entropy": 0.759384922683239, "epoch": 0.2956841963443661, "grad_norm": 4.53125, "learning_rate": 4.0766778738115275e-05, "loss": 0.7526276111602783, "mean_token_accuracy": 0.8164209336042404, "num_tokens": 32702043.0, "step": 16460 }, { "entropy": 0.7467499770224094, "epoch": 0.2958638343737369, "grad_norm": 4.9375, "learning_rate": 4.0755626863403605e-05, "loss": 0.7757118701934814, "mean_token_accuracy": 0.8179592102766037, "num_tokens": 32722579.0, "step": 16470 }, { "entropy": 0.79761051684618, "epoch": 0.29604347240310774, "grad_norm": 5.46875, "learning_rate": 4.074446978550954e-05, "loss": 0.8320376396179199, "mean_token_accuracy": 0.8091583713889122, "num_tokens": 32742948.0, "step": 16480 }, { "entropy": 0.7638556130230427, "epoch": 0.29622311043247856, "grad_norm": 5.03125, "learning_rate": 4.0733307508117654e-05, "loss": 0.706824779510498, "mean_token_accuracy": 0.8254311710596085, "num_tokens": 32762214.0, "step": 16490 }, { "entropy": 0.7699882030487061, "epoch": 0.2964027484618494, "grad_norm": 9.0, "learning_rate": 4.072214003491418e-05, "loss": 0.790395975112915, "mean_token_accuracy": 0.8132738694548607, "num_tokens": 32781151.0, "step": 16500 }, { "entropy": 0.7158139243721962, "epoch": 0.2965823864912202, "grad_norm": 6.0625, "learning_rate": 4.0710967369587126e-05, "loss": 0.7447795391082763, "mean_token_accuracy": 0.8179330617189408, "num_tokens": 32801289.0, "step": 16510 }, { "entropy": 0.7331295058131218, "epoch": 0.29676202452059103, "grad_norm": 7.40625, "learning_rate": 4.069978951582616e-05, "loss": 0.7282636642456055, "mean_token_accuracy": 0.8215281695127488, "num_tokens": 32821438.0, "step": 16520 }, { "entropy": 0.6937525883316994, "epoch": 0.29694166254996185, "grad_norm": 4.78125, "learning_rate": 4.0688606477322695e-05, "loss": 0.6796750545501709, "mean_token_accuracy": 0.8300207406282425, "num_tokens": 32840712.0, "step": 16530 }, { "entropy": 0.7728459522128105, "epoch": 0.29712130057933267, "grad_norm": 8.6875, "learning_rate": 4.067741825776985e-05, "loss": 0.8052539825439453, "mean_token_accuracy": 0.8005506187677384, "num_tokens": 32861526.0, "step": 16540 }, { "entropy": 0.6426697306334972, "epoch": 0.29730093860870344, "grad_norm": 5.03125, "learning_rate": 4.0666224860862454e-05, "loss": 0.6739311695098877, "mean_token_accuracy": 0.8328271776437759, "num_tokens": 32882231.0, "step": 16550 }, { "entropy": 0.791443296521902, "epoch": 0.29748057663807426, "grad_norm": 5.40625, "learning_rate": 4.065502629029704e-05, "loss": 0.7856956481933594, "mean_token_accuracy": 0.8074075743556023, "num_tokens": 32901687.0, "step": 16560 }, { "entropy": 0.7727358289062977, "epoch": 0.2976602146674451, "grad_norm": 4.5625, "learning_rate": 4.064382254977187e-05, "loss": 0.7975558280944824, "mean_token_accuracy": 0.8042471423745156, "num_tokens": 32922222.0, "step": 16570 }, { "entropy": 0.7073809765279293, "epoch": 0.2978398526968159, "grad_norm": 6.5, "learning_rate": 4.063261364298688e-05, "loss": 0.714824914932251, "mean_token_accuracy": 0.8312507584691048, "num_tokens": 32941124.0, "step": 16580 }, { "entropy": 0.8149250656366348, "epoch": 0.2980194907261867, "grad_norm": 5.90625, "learning_rate": 4.0621399573643754e-05, "loss": 0.8715660095214843, "mean_token_accuracy": 0.8037385821342469, "num_tokens": 32961277.0, "step": 16590 }, { "entropy": 0.8408456407487392, "epoch": 0.29819912875555754, "grad_norm": 6.5, "learning_rate": 4.061018034544584e-05, "loss": 0.8403009414672852, "mean_token_accuracy": 0.7976683929562569, "num_tokens": 32980032.0, "step": 16600 }, { "entropy": 0.731586092710495, "epoch": 0.29837876678492836, "grad_norm": 5.28125, "learning_rate": 4.0598955962098205e-05, "loss": 0.7359925270080566, "mean_token_accuracy": 0.823723541200161, "num_tokens": 32999408.0, "step": 16610 }, { "entropy": 0.6712837897241115, "epoch": 0.2985584048142992, "grad_norm": 5.71875, "learning_rate": 4.058772642730764e-05, "loss": 0.6713774681091309, "mean_token_accuracy": 0.8351075023412704, "num_tokens": 33019089.0, "step": 16620 }, { "entropy": 0.8408644244074821, "epoch": 0.29873804284367, "grad_norm": 5.0, "learning_rate": 4.057649174478259e-05, "loss": 0.8882511138916016, "mean_token_accuracy": 0.79170081615448, "num_tokens": 33039611.0, "step": 16630 }, { "entropy": 0.7752871446311473, "epoch": 0.2989176808730408, "grad_norm": 5.53125, "learning_rate": 4.056525191823325e-05, "loss": 0.8054216384887696, "mean_token_accuracy": 0.8082266628742218, "num_tokens": 33058969.0, "step": 16640 }, { "entropy": 0.7794643566012383, "epoch": 0.29909731890241165, "grad_norm": 5.4375, "learning_rate": 4.055400695137149e-05, "loss": 0.7833192348480225, "mean_token_accuracy": 0.8092082172632218, "num_tokens": 33078854.0, "step": 16650 }, { "entropy": 0.8296513441950083, "epoch": 0.29927695693178247, "grad_norm": 5.53125, "learning_rate": 4.054275684791087e-05, "loss": 0.8304566383361817, "mean_token_accuracy": 0.8034424290060997, "num_tokens": 33099081.0, "step": 16660 }, { "entropy": 0.8378834009170533, "epoch": 0.2994565949611533, "grad_norm": 6.96875, "learning_rate": 4.053150161156666e-05, "loss": 0.832552719116211, "mean_token_accuracy": 0.8049099296331406, "num_tokens": 33119046.0, "step": 16670 }, { "entropy": 0.7404852122068405, "epoch": 0.2996362329905241, "grad_norm": 5.375, "learning_rate": 4.052024124605582e-05, "loss": 0.7401700973510742, "mean_token_accuracy": 0.8271591573953628, "num_tokens": 33137117.0, "step": 16680 }, { "entropy": 0.7142466381192207, "epoch": 0.29981587101989493, "grad_norm": 5.28125, "learning_rate": 4.0508975755097e-05, "loss": 0.715613317489624, "mean_token_accuracy": 0.8214541643857955, "num_tokens": 33157837.0, "step": 16690 }, { "entropy": 0.6744240231812, "epoch": 0.29999550904926575, "grad_norm": 5.5, "learning_rate": 4.049770514241057e-05, "loss": 0.6703217029571533, "mean_token_accuracy": 0.8276666879653931, "num_tokens": 33176952.0, "step": 16700 }, { "entropy": 0.7664406470954418, "epoch": 0.3001751470786366, "grad_norm": 7.15625, "learning_rate": 4.048642941171854e-05, "loss": 0.7839531898498535, "mean_token_accuracy": 0.8130544558167457, "num_tokens": 33196826.0, "step": 16710 }, { "entropy": 0.8311275757849217, "epoch": 0.30035478510800734, "grad_norm": 8.25, "learning_rate": 4.047514856674465e-05, "loss": 0.9031271934509277, "mean_token_accuracy": 0.7948875650763512, "num_tokens": 33217126.0, "step": 16720 }, { "entropy": 0.7347884178161621, "epoch": 0.30053442313737816, "grad_norm": 8.0625, "learning_rate": 4.046386261121432e-05, "loss": 0.7311437606811524, "mean_token_accuracy": 0.816559998691082, "num_tokens": 33236767.0, "step": 16730 }, { "entropy": 0.7218950673937797, "epoch": 0.300714061166749, "grad_norm": 5.375, "learning_rate": 4.0452571548854656e-05, "loss": 0.7324501037597656, "mean_token_accuracy": 0.8159527018666267, "num_tokens": 33255966.0, "step": 16740 }, { "entropy": 0.890400905907154, "epoch": 0.3008936991961198, "grad_norm": 7.59375, "learning_rate": 4.044127538339445e-05, "loss": 0.8462236404418946, "mean_token_accuracy": 0.785409215092659, "num_tokens": 33275751.0, "step": 16750 }, { "entropy": 0.7645746022462845, "epoch": 0.3010733372254906, "grad_norm": 5.15625, "learning_rate": 4.0429974118564175e-05, "loss": 0.7906983375549317, "mean_token_accuracy": 0.8026041612029076, "num_tokens": 33295250.0, "step": 16760 }, { "entropy": 0.7720949843525886, "epoch": 0.30125297525486144, "grad_norm": 6.0625, "learning_rate": 4.0418667758095995e-05, "loss": 0.7648301601409913, "mean_token_accuracy": 0.8153431460261344, "num_tokens": 33316131.0, "step": 16770 }, { "entropy": 0.6727171760052443, "epoch": 0.30143261328423226, "grad_norm": 4.71875, "learning_rate": 4.040735630572375e-05, "loss": 0.6772083282470703, "mean_token_accuracy": 0.8367044433951378, "num_tokens": 33335935.0, "step": 16780 }, { "entropy": 0.8031598135828972, "epoch": 0.3016122513136031, "grad_norm": 5.78125, "learning_rate": 4.039603976518298e-05, "loss": 0.8405230522155762, "mean_token_accuracy": 0.8036567464470863, "num_tokens": 33355415.0, "step": 16790 }, { "entropy": 0.8119475387036801, "epoch": 0.3017918893429739, "grad_norm": 5.40625, "learning_rate": 4.038471814021088e-05, "loss": 0.8467553138732911, "mean_token_accuracy": 0.8047595426440239, "num_tokens": 33375713.0, "step": 16800 }, { "entropy": 0.8614579483866691, "epoch": 0.30197152737234473, "grad_norm": 6.34375, "learning_rate": 4.0373391434546324e-05, "loss": 0.8881271362304688, "mean_token_accuracy": 0.7956246256828308, "num_tokens": 33397461.0, "step": 16810 }, { "entropy": 0.8732067100703717, "epoch": 0.30215116540171555, "grad_norm": 6.34375, "learning_rate": 4.03620596519299e-05, "loss": 0.8863471984863281, "mean_token_accuracy": 0.7939257130026818, "num_tokens": 33417282.0, "step": 16820 }, { "entropy": 0.7578549019992351, "epoch": 0.30233080343108637, "grad_norm": 7.21875, "learning_rate": 4.035072279610384e-05, "loss": 0.7369836330413818, "mean_token_accuracy": 0.8270233556628227, "num_tokens": 33437036.0, "step": 16830 }, { "entropy": 0.8801611095666886, "epoch": 0.3025104414604572, "grad_norm": 6.3125, "learning_rate": 4.0339380870812036e-05, "loss": 0.913973331451416, "mean_token_accuracy": 0.7854417368769646, "num_tokens": 33458374.0, "step": 16840 }, { "entropy": 0.6873669430613518, "epoch": 0.302690079489828, "grad_norm": 8.25, "learning_rate": 4.0328033879800106e-05, "loss": 0.6995107650756835, "mean_token_accuracy": 0.8247468620538712, "num_tokens": 33478410.0, "step": 16850 }, { "entropy": 0.7423675902187824, "epoch": 0.30286971751919883, "grad_norm": 5.09375, "learning_rate": 4.0316681826815295e-05, "loss": 0.7063494682312011, "mean_token_accuracy": 0.8239742875099182, "num_tokens": 33499461.0, "step": 16860 }, { "entropy": 0.7965792261064053, "epoch": 0.30304935554856965, "grad_norm": 6.5, "learning_rate": 4.0305324715606543e-05, "loss": 0.8206728935241699, "mean_token_accuracy": 0.8042060241103173, "num_tokens": 33518451.0, "step": 16870 }, { "entropy": 0.7631928488612175, "epoch": 0.3032289935779405, "grad_norm": 6.96875, "learning_rate": 4.0293962549924466e-05, "loss": 0.7700592517852783, "mean_token_accuracy": 0.8086611896753311, "num_tokens": 33538199.0, "step": 16880 }, { "entropy": 0.7288111381232738, "epoch": 0.30340863160731124, "grad_norm": 4.90625, "learning_rate": 4.028259533352131e-05, "loss": 0.7613233089447021, "mean_token_accuracy": 0.8105173423886299, "num_tokens": 33557175.0, "step": 16890 }, { "entropy": 0.678798970580101, "epoch": 0.30358826963668206, "grad_norm": 6.15625, "learning_rate": 4.027122307015104e-05, "loss": 0.7268945693969726, "mean_token_accuracy": 0.8203946098685264, "num_tokens": 33576453.0, "step": 16900 }, { "entropy": 0.7926782719790936, "epoch": 0.3037679076660529, "grad_norm": 6.03125, "learning_rate": 4.025984576356926e-05, "loss": 0.8218985557556152, "mean_token_accuracy": 0.8051017701625824, "num_tokens": 33595742.0, "step": 16910 }, { "entropy": 0.8191024236381054, "epoch": 0.3039475456954237, "grad_norm": 7.1875, "learning_rate": 4.0248463417533234e-05, "loss": 0.8528058052062988, "mean_token_accuracy": 0.7965284943580627, "num_tokens": 33614596.0, "step": 16920 }, { "entropy": 0.7082028731703758, "epoch": 0.3041271837247945, "grad_norm": 3.859375, "learning_rate": 4.023707603580191e-05, "loss": 0.7071847915649414, "mean_token_accuracy": 0.8188983902335167, "num_tokens": 33636056.0, "step": 16930 }, { "entropy": 0.7995364531874657, "epoch": 0.30430682175416535, "grad_norm": 4.53125, "learning_rate": 4.022568362213588e-05, "loss": 0.811736011505127, "mean_token_accuracy": 0.8118455722928047, "num_tokens": 33655485.0, "step": 16940 }, { "entropy": 0.7739044696092605, "epoch": 0.30448645978353617, "grad_norm": 6.65625, "learning_rate": 4.0214286180297414e-05, "loss": 0.7538593292236329, "mean_token_accuracy": 0.8164787590503693, "num_tokens": 33674896.0, "step": 16950 }, { "entropy": 0.8529946267604828, "epoch": 0.304666097812907, "grad_norm": 5.53125, "learning_rate": 4.020288371405043e-05, "loss": 0.8298836708068847, "mean_token_accuracy": 0.7960230588912964, "num_tokens": 33694522.0, "step": 16960 }, { "entropy": 0.7227740488946438, "epoch": 0.3048457358422778, "grad_norm": 4.71875, "learning_rate": 4.019147622716052e-05, "loss": 0.7262112140655518, "mean_token_accuracy": 0.8117696195840836, "num_tokens": 33713848.0, "step": 16970 }, { "entropy": 0.8260045371949672, "epoch": 0.30502537387164863, "grad_norm": 7.9375, "learning_rate": 4.018006372339491e-05, "loss": 0.821468448638916, "mean_token_accuracy": 0.7979263037443161, "num_tokens": 33734382.0, "step": 16980 }, { "entropy": 0.7398630760610103, "epoch": 0.30520501190101945, "grad_norm": 6.78125, "learning_rate": 4.01686462065225e-05, "loss": 0.7616140365600585, "mean_token_accuracy": 0.810047110915184, "num_tokens": 33754326.0, "step": 16990 }, { "epoch": 0.3053846499303903, "eval_entropy": 0.746131109714508, "eval_loss": 0.7473167777061462, "eval_mean_token_accuracy": 0.8186712293624878, "eval_num_tokens": 33773663.0, "eval_runtime": 40.5441, "eval_samples_per_second": 49.329, "eval_steps_per_second": 6.166, "step": 17000 }, { "entropy": 0.752722242474556, "epoch": 0.3055642879597611, "grad_norm": 6.3125, "learning_rate": 4.014579614854117e-05, "loss": 0.7757734298706055, "mean_token_accuracy": 0.8113306805491447, "num_tokens": 33793483.0, "step": 17010 }, { "entropy": 0.7913009047508239, "epoch": 0.3057439259891319, "grad_norm": 5.875, "learning_rate": 4.013436361497832e-05, "loss": 0.7943925857543945, "mean_token_accuracy": 0.8029153510928154, "num_tokens": 33812581.0, "step": 17020 }, { "entropy": 0.7796534996479749, "epoch": 0.30592356401850274, "grad_norm": 5.0, "learning_rate": 4.0122926083400795e-05, "loss": 0.7848310947418213, "mean_token_accuracy": 0.8077147454023361, "num_tokens": 33833401.0, "step": 17030 }, { "entropy": 0.7849590167403221, "epoch": 0.30610320204787356, "grad_norm": 7.5625, "learning_rate": 4.0111483557585774e-05, "loss": 0.7763415336608886, "mean_token_accuracy": 0.8105032786726951, "num_tokens": 33853978.0, "step": 17040 }, { "entropy": 0.7379834957420826, "epoch": 0.3062828400772444, "grad_norm": 6.65625, "learning_rate": 4.0100036041312064e-05, "loss": 0.7281891345977783, "mean_token_accuracy": 0.8167565539479256, "num_tokens": 33875489.0, "step": 17050 }, { "entropy": 0.7870235066860914, "epoch": 0.30646247810661514, "grad_norm": 7.28125, "learning_rate": 4.008858353836012e-05, "loss": 0.8118382453918457, "mean_token_accuracy": 0.8102093383669853, "num_tokens": 33895021.0, "step": 17060 }, { "entropy": 0.7490365158766508, "epoch": 0.30664211613598596, "grad_norm": 5.96875, "learning_rate": 4.007712605251206e-05, "loss": 0.7716125011444092, "mean_token_accuracy": 0.8152915611863136, "num_tokens": 33914380.0, "step": 17070 }, { "entropy": 0.7463030867278576, "epoch": 0.3068217541653568, "grad_norm": 4.5625, "learning_rate": 4.0065663587551624e-05, "loss": 0.7154333591461182, "mean_token_accuracy": 0.8198764607310295, "num_tokens": 33933039.0, "step": 17080 }, { "entropy": 0.862423637509346, "epoch": 0.3070013921947276, "grad_norm": 4.78125, "learning_rate": 4.005419614726421e-05, "loss": 0.8879791259765625, "mean_token_accuracy": 0.7910993218421936, "num_tokens": 33954758.0, "step": 17090 }, { "entropy": 0.7775037899613381, "epoch": 0.30718103022409843, "grad_norm": 6.4375, "learning_rate": 4.004272373543687e-05, "loss": 0.7843568801879883, "mean_token_accuracy": 0.8033167466521263, "num_tokens": 33974274.0, "step": 17100 }, { "entropy": 0.7304410509765148, "epoch": 0.30736066825346925, "grad_norm": 6.71875, "learning_rate": 4.003124635585828e-05, "loss": 0.7187887668609619, "mean_token_accuracy": 0.8203001841902733, "num_tokens": 33994673.0, "step": 17110 }, { "entropy": 0.7252669785171747, "epoch": 0.30754030628284007, "grad_norm": 4.9375, "learning_rate": 4.001976401231875e-05, "loss": 0.7237717151641846, "mean_token_accuracy": 0.822287268191576, "num_tokens": 34014016.0, "step": 17120 }, { "entropy": 0.6598985336720944, "epoch": 0.3077199443122109, "grad_norm": 3.9375, "learning_rate": 4.000827670861025e-05, "loss": 0.6747980117797852, "mean_token_accuracy": 0.8322231858968735, "num_tokens": 34033941.0, "step": 17130 }, { "entropy": 0.6381131887435914, "epoch": 0.3078995823415817, "grad_norm": 5.15625, "learning_rate": 3.999678444852638e-05, "loss": 0.6548916339874268, "mean_token_accuracy": 0.8374187156558037, "num_tokens": 34054314.0, "step": 17140 }, { "entropy": 0.7456407353281975, "epoch": 0.30807922037095253, "grad_norm": 7.84375, "learning_rate": 3.9985287235862385e-05, "loss": 0.7782154083251953, "mean_token_accuracy": 0.8080860584974289, "num_tokens": 34073926.0, "step": 17150 }, { "entropy": 0.7674588494002819, "epoch": 0.30825885840032335, "grad_norm": 7.8125, "learning_rate": 3.997378507441512e-05, "loss": 0.806364917755127, "mean_token_accuracy": 0.7930010914802551, "num_tokens": 34094428.0, "step": 17160 }, { "entropy": 0.7215720698237419, "epoch": 0.3084384964296942, "grad_norm": 5.25, "learning_rate": 3.99622779679831e-05, "loss": 0.7024405002593994, "mean_token_accuracy": 0.818800701200962, "num_tokens": 34114270.0, "step": 17170 }, { "entropy": 0.7715274028480053, "epoch": 0.308618134459065, "grad_norm": 6.875, "learning_rate": 3.995076592036646e-05, "loss": 0.8163088798522949, "mean_token_accuracy": 0.8038177058100701, "num_tokens": 34133286.0, "step": 17180 }, { "entropy": 0.8199379093945026, "epoch": 0.3087977724884358, "grad_norm": 6.4375, "learning_rate": 3.993924893536698e-05, "loss": 0.8404458045959473, "mean_token_accuracy": 0.8024330317974091, "num_tokens": 34152962.0, "step": 17190 }, { "entropy": 0.8414850845932961, "epoch": 0.30897741051780664, "grad_norm": 5.625, "learning_rate": 3.992772701678805e-05, "loss": 0.8890132904052734, "mean_token_accuracy": 0.7895616620779038, "num_tokens": 34174493.0, "step": 17200 }, { "entropy": 0.7950747579336166, "epoch": 0.30915704854717746, "grad_norm": 9.125, "learning_rate": 3.991620016843471e-05, "loss": 0.7995020866394043, "mean_token_accuracy": 0.8052304580807685, "num_tokens": 34195334.0, "step": 17210 }, { "entropy": 0.7398949205875397, "epoch": 0.3093366865765483, "grad_norm": 9.125, "learning_rate": 3.990466839411361e-05, "loss": 0.7757128238677978, "mean_token_accuracy": 0.8195069462060929, "num_tokens": 34214521.0, "step": 17220 }, { "entropy": 0.7580545455217361, "epoch": 0.30951632460591905, "grad_norm": 5.75, "learning_rate": 3.989313169763304e-05, "loss": 0.7773032665252686, "mean_token_accuracy": 0.8153793126344681, "num_tokens": 34235900.0, "step": 17230 }, { "entropy": 0.7163580529391765, "epoch": 0.30969596263528987, "grad_norm": 5.125, "learning_rate": 3.988159008280292e-05, "loss": 0.7127536296844482, "mean_token_accuracy": 0.8304613947868347, "num_tokens": 34254993.0, "step": 17240 }, { "entropy": 0.7382263816893101, "epoch": 0.3098756006646607, "grad_norm": 5.21875, "learning_rate": 3.987004355343477e-05, "loss": 0.7537627696990967, "mean_token_accuracy": 0.8176436588168144, "num_tokens": 34275022.0, "step": 17250 }, { "entropy": 0.7582098595798016, "epoch": 0.3100552386940315, "grad_norm": 6.90625, "learning_rate": 3.985849211334175e-05, "loss": 0.7572234630584717, "mean_token_accuracy": 0.8098289221525192, "num_tokens": 34295122.0, "step": 17260 }, { "entropy": 0.8045599684119225, "epoch": 0.31023487672340233, "grad_norm": 9.0, "learning_rate": 3.984693576633865e-05, "loss": 0.8160170555114746, "mean_token_accuracy": 0.7962881594896316, "num_tokens": 34314026.0, "step": 17270 }, { "entropy": 0.8006197161972523, "epoch": 0.31041451475277315, "grad_norm": 6.15625, "learning_rate": 3.9835374516241865e-05, "loss": 0.7819230079650878, "mean_token_accuracy": 0.8114110291004181, "num_tokens": 34333511.0, "step": 17280 }, { "entropy": 0.7648152396082878, "epoch": 0.310594152782144, "grad_norm": 5.0625, "learning_rate": 3.982380836686941e-05, "loss": 0.7909525871276856, "mean_token_accuracy": 0.8103834196925164, "num_tokens": 34353447.0, "step": 17290 }, { "entropy": 0.7797297820448875, "epoch": 0.3107737908115148, "grad_norm": 5.5625, "learning_rate": 3.9812237322040937e-05, "loss": 0.7945465564727783, "mean_token_accuracy": 0.8063509717583657, "num_tokens": 34373616.0, "step": 17300 }, { "entropy": 0.7823939166963101, "epoch": 0.3109534288408856, "grad_norm": 7.9375, "learning_rate": 3.980066138557768e-05, "loss": 0.7792452812194824, "mean_token_accuracy": 0.8049327626824379, "num_tokens": 34393492.0, "step": 17310 }, { "entropy": 0.7256773076951504, "epoch": 0.31113306687025644, "grad_norm": 4.21875, "learning_rate": 3.978908056130252e-05, "loss": 0.7022278785705567, "mean_token_accuracy": 0.8217857733368874, "num_tokens": 34413337.0, "step": 17320 }, { "entropy": 0.7851140700280667, "epoch": 0.31131270489962726, "grad_norm": 3.90625, "learning_rate": 3.977749485303994e-05, "loss": 0.7973503112792969, "mean_token_accuracy": 0.8053277119994163, "num_tokens": 34434119.0, "step": 17330 }, { "entropy": 0.6800014093518257, "epoch": 0.3114923429289981, "grad_norm": 5.53125, "learning_rate": 3.9765904264616036e-05, "loss": 0.7107971668243408, "mean_token_accuracy": 0.8358748331665993, "num_tokens": 34454343.0, "step": 17340 }, { "entropy": 0.7413935773074627, "epoch": 0.3116719809583689, "grad_norm": 6.0625, "learning_rate": 3.975430879985852e-05, "loss": 0.7587538719177246, "mean_token_accuracy": 0.8167598187923432, "num_tokens": 34475470.0, "step": 17350 }, { "entropy": 0.8088782027363777, "epoch": 0.3118516189877397, "grad_norm": 8.5, "learning_rate": 3.9742708462596714e-05, "loss": 0.8073749542236328, "mean_token_accuracy": 0.802432382106781, "num_tokens": 34495786.0, "step": 17360 }, { "entropy": 0.7750293768942356, "epoch": 0.31203125701711054, "grad_norm": 5.84375, "learning_rate": 3.9731103256661525e-05, "loss": 0.8018113136291504, "mean_token_accuracy": 0.8028248488903046, "num_tokens": 34515441.0, "step": 17370 }, { "entropy": 0.7360148802399635, "epoch": 0.31221089504648136, "grad_norm": 4.9375, "learning_rate": 3.971949318588551e-05, "loss": 0.7195657253265381, "mean_token_accuracy": 0.8264596506953239, "num_tokens": 34535470.0, "step": 17380 }, { "entropy": 0.7150483272969723, "epoch": 0.3123905330758522, "grad_norm": 6.71875, "learning_rate": 3.9707878254102816e-05, "loss": 0.6925189018249511, "mean_token_accuracy": 0.8243127301335335, "num_tokens": 34555607.0, "step": 17390 }, { "entropy": 0.7102046512067318, "epoch": 0.31257017110522295, "grad_norm": 5.90625, "learning_rate": 3.969625846514916e-05, "loss": 0.7089354038238526, "mean_token_accuracy": 0.8217187836766243, "num_tokens": 34575189.0, "step": 17400 }, { "entropy": 0.7956078216433525, "epoch": 0.31274980913459377, "grad_norm": 8.0, "learning_rate": 3.968463382286193e-05, "loss": 0.79115309715271, "mean_token_accuracy": 0.8102262482047081, "num_tokens": 34594153.0, "step": 17410 }, { "entropy": 0.7971115879714489, "epoch": 0.3129294471639646, "grad_norm": 6.25, "learning_rate": 3.9673004331080055e-05, "loss": 0.8102178573608398, "mean_token_accuracy": 0.8009338974952698, "num_tokens": 34613927.0, "step": 17420 }, { "entropy": 0.7245143163949251, "epoch": 0.3131090851933354, "grad_norm": 6.09375, "learning_rate": 3.9661369993644106e-05, "loss": 0.7183018684387207, "mean_token_accuracy": 0.8191718652844429, "num_tokens": 34634157.0, "step": 17430 }, { "entropy": 0.7351012133061886, "epoch": 0.31328872322270623, "grad_norm": 7.625, "learning_rate": 3.964973081439622e-05, "loss": 0.7541585922241211, "mean_token_accuracy": 0.8216377049684525, "num_tokens": 34653281.0, "step": 17440 }, { "entropy": 0.6604509472846984, "epoch": 0.31346836125207705, "grad_norm": 6.1875, "learning_rate": 3.963808679718018e-05, "loss": 0.6379446506500244, "mean_token_accuracy": 0.840779747068882, "num_tokens": 34673070.0, "step": 17450 }, { "entropy": 0.7899170063436032, "epoch": 0.3136479992814479, "grad_norm": 5.0625, "learning_rate": 3.962643794584131e-05, "loss": 0.783599853515625, "mean_token_accuracy": 0.8054482564330101, "num_tokens": 34693375.0, "step": 17460 }, { "entropy": 0.6961737267673016, "epoch": 0.3138276373108187, "grad_norm": 6.3125, "learning_rate": 3.9614784264226576e-05, "loss": 0.7157501220703125, "mean_token_accuracy": 0.8270401880145073, "num_tokens": 34712734.0, "step": 17470 }, { "entropy": 0.6720437578856945, "epoch": 0.3140072753401895, "grad_norm": 7.4375, "learning_rate": 3.9603125756184525e-05, "loss": 0.7000727176666259, "mean_token_accuracy": 0.8251109153032303, "num_tokens": 34732350.0, "step": 17480 }, { "entropy": 0.6779511567205191, "epoch": 0.31418691336956034, "grad_norm": 4.78125, "learning_rate": 3.959146242556529e-05, "loss": 0.6967905521392822, "mean_token_accuracy": 0.8350613325834274, "num_tokens": 34752358.0, "step": 17490 }, { "entropy": 0.7495093815028667, "epoch": 0.31436655139893116, "grad_norm": 5.53125, "learning_rate": 3.95797942762206e-05, "loss": 0.8074655532836914, "mean_token_accuracy": 0.8126159369945526, "num_tokens": 34772085.0, "step": 17500 }, { "entropy": 0.7551707163453102, "epoch": 0.314546189428302, "grad_norm": 5.875, "learning_rate": 3.956812131200378e-05, "loss": 0.7482800960540772, "mean_token_accuracy": 0.8156968057155609, "num_tokens": 34791957.0, "step": 17510 }, { "entropy": 0.7427793987095356, "epoch": 0.3147258274576728, "grad_norm": 7.28125, "learning_rate": 3.955644353676974e-05, "loss": 0.7400613307952881, "mean_token_accuracy": 0.8234319016337395, "num_tokens": 34810755.0, "step": 17520 }, { "entropy": 0.7959214210510254, "epoch": 0.3149054654870436, "grad_norm": 4.96875, "learning_rate": 3.9544760954374985e-05, "loss": 0.791872215270996, "mean_token_accuracy": 0.8023567460477352, "num_tokens": 34829525.0, "step": 17530 }, { "entropy": 0.7121578104794025, "epoch": 0.31508510351641444, "grad_norm": 5.9375, "learning_rate": 3.95330735686776e-05, "loss": 0.6979360103607177, "mean_token_accuracy": 0.8324784830212593, "num_tokens": 34848684.0, "step": 17540 }, { "entropy": 0.7069754101336002, "epoch": 0.31526474154578527, "grad_norm": 6.40625, "learning_rate": 3.952138138353726e-05, "loss": 0.7719102382659913, "mean_token_accuracy": 0.8122841611504554, "num_tokens": 34867438.0, "step": 17550 }, { "entropy": 0.7023864611983299, "epoch": 0.3154443795751561, "grad_norm": 8.3125, "learning_rate": 3.950968440281524e-05, "loss": 0.6983365058898926, "mean_token_accuracy": 0.8294951304793358, "num_tokens": 34886713.0, "step": 17560 }, { "entropy": 0.7242735005915165, "epoch": 0.31562401760452685, "grad_norm": 4.875, "learning_rate": 3.949798263037435e-05, "loss": 0.7602056503295899, "mean_token_accuracy": 0.8163086891174316, "num_tokens": 34907512.0, "step": 17570 }, { "entropy": 0.8385130237787962, "epoch": 0.3158036556338977, "grad_norm": 6.0625, "learning_rate": 3.948627607007906e-05, "loss": 0.9197768211364746, "mean_token_accuracy": 0.7968756482005119, "num_tokens": 34927968.0, "step": 17580 }, { "entropy": 0.761645146459341, "epoch": 0.3159832936632685, "grad_norm": 5.125, "learning_rate": 3.9474564725795324e-05, "loss": 0.7537056922912597, "mean_token_accuracy": 0.8109301716089249, "num_tokens": 34948685.0, "step": 17590 }, { "entropy": 0.7647321999073029, "epoch": 0.3161629316926393, "grad_norm": 6.71875, "learning_rate": 3.946284860139078e-05, "loss": 0.7590048789978028, "mean_token_accuracy": 0.8145085543394088, "num_tokens": 34969244.0, "step": 17600 }, { "entropy": 0.7169677264988422, "epoch": 0.31634256972201014, "grad_norm": 5.59375, "learning_rate": 3.945112770073457e-05, "loss": 0.7077847480773926, "mean_token_accuracy": 0.825789125263691, "num_tokens": 34988936.0, "step": 17610 }, { "entropy": 0.7381929822266102, "epoch": 0.31652220775138096, "grad_norm": 7.5625, "learning_rate": 3.9439402027697435e-05, "loss": 0.7341346263885498, "mean_token_accuracy": 0.8267239779233932, "num_tokens": 35008085.0, "step": 17620 }, { "entropy": 0.7316080778837204, "epoch": 0.3167018457807518, "grad_norm": 5.59375, "learning_rate": 3.94276715861517e-05, "loss": 0.7617347717285157, "mean_token_accuracy": 0.8139830753207207, "num_tokens": 35028054.0, "step": 17630 }, { "entropy": 0.7260509677231312, "epoch": 0.3168814838101226, "grad_norm": 8.6875, "learning_rate": 3.9415936379971264e-05, "loss": 0.7644793033599854, "mean_token_accuracy": 0.8167120516300201, "num_tokens": 35046774.0, "step": 17640 }, { "entropy": 0.790661808475852, "epoch": 0.3170611218394934, "grad_norm": 6.15625, "learning_rate": 3.940419641303159e-05, "loss": 0.8470956802368164, "mean_token_accuracy": 0.804165604710579, "num_tokens": 35067003.0, "step": 17650 }, { "entropy": 0.7736934401094914, "epoch": 0.31724075986886424, "grad_norm": 5.8125, "learning_rate": 3.939245168920971e-05, "loss": 0.8395459175109863, "mean_token_accuracy": 0.8051696851849556, "num_tokens": 35087491.0, "step": 17660 }, { "entropy": 0.7307654902338981, "epoch": 0.31742039789823506, "grad_norm": 5.0625, "learning_rate": 3.9380702212384234e-05, "loss": 0.7179835319519043, "mean_token_accuracy": 0.8296659529209137, "num_tokens": 35108480.0, "step": 17670 }, { "entropy": 0.7836914859712124, "epoch": 0.3176000359276059, "grad_norm": 6.09375, "learning_rate": 3.936894798643536e-05, "loss": 0.7921192646026611, "mean_token_accuracy": 0.8002183720469475, "num_tokens": 35129802.0, "step": 17680 }, { "entropy": 0.821904543042183, "epoch": 0.3177796739569767, "grad_norm": 6.3125, "learning_rate": 3.935718901524481e-05, "loss": 0.8243512153625489, "mean_token_accuracy": 0.8043264150619507, "num_tokens": 35149769.0, "step": 17690 }, { "entropy": 0.6292390547692776, "epoch": 0.3179593119863475, "grad_norm": 6.75, "learning_rate": 3.934542530269593e-05, "loss": 0.6188334941864013, "mean_token_accuracy": 0.8497886136174202, "num_tokens": 35168529.0, "step": 17700 }, { "entropy": 0.7929140143096447, "epoch": 0.31813895001571835, "grad_norm": 7.0625, "learning_rate": 3.933365685267358e-05, "loss": 0.7906225681304931, "mean_token_accuracy": 0.8013290375471115, "num_tokens": 35187658.0, "step": 17710 }, { "entropy": 0.8120412543416023, "epoch": 0.31831858804508917, "grad_norm": 6.53125, "learning_rate": 3.932188366906422e-05, "loss": 0.7878899574279785, "mean_token_accuracy": 0.8007497161626815, "num_tokens": 35206249.0, "step": 17720 }, { "entropy": 0.690728259831667, "epoch": 0.31849822607446, "grad_norm": 8.25, "learning_rate": 3.931010575575584e-05, "loss": 0.7184494495391845, "mean_token_accuracy": 0.8269483983516693, "num_tokens": 35224970.0, "step": 17730 }, { "entropy": 0.740854436904192, "epoch": 0.31867786410383075, "grad_norm": 6.625, "learning_rate": 3.929832311663803e-05, "loss": 0.7246941089630127, "mean_token_accuracy": 0.8198397517204284, "num_tokens": 35243346.0, "step": 17740 }, { "entropy": 0.6676546044647693, "epoch": 0.3188575021332016, "grad_norm": 5.84375, "learning_rate": 3.928653575560191e-05, "loss": 0.7035351276397706, "mean_token_accuracy": 0.8237126424908638, "num_tokens": 35263450.0, "step": 17750 }, { "entropy": 0.7323327511548996, "epoch": 0.3190371401625724, "grad_norm": 5.15625, "learning_rate": 3.927474367654017e-05, "loss": 0.7486181735992432, "mean_token_accuracy": 0.8162674978375435, "num_tokens": 35283680.0, "step": 17760 }, { "entropy": 0.7591222655028105, "epoch": 0.3192167781919432, "grad_norm": 7.1875, "learning_rate": 3.926294688334707e-05, "loss": 0.7804352283477783, "mean_token_accuracy": 0.8173931494355202, "num_tokens": 35303303.0, "step": 17770 }, { "entropy": 0.8280812725424767, "epoch": 0.31939641622131404, "grad_norm": 6.03125, "learning_rate": 3.925114537991841e-05, "loss": 0.8541572570800782, "mean_token_accuracy": 0.8000821828842163, "num_tokens": 35324250.0, "step": 17780 }, { "entropy": 0.716727501899004, "epoch": 0.31957605425068486, "grad_norm": 7.8125, "learning_rate": 3.9239339170151554e-05, "loss": 0.6860591411590576, "mean_token_accuracy": 0.8338948950171471, "num_tokens": 35344382.0, "step": 17790 }, { "entropy": 0.7611725151538848, "epoch": 0.3197556922800557, "grad_norm": 7.125, "learning_rate": 3.922752825794542e-05, "loss": 0.8029959678649903, "mean_token_accuracy": 0.8064067751169205, "num_tokens": 35362893.0, "step": 17800 }, { "entropy": 0.6786594569683075, "epoch": 0.3199353303094265, "grad_norm": 6.875, "learning_rate": 3.9215712647200464e-05, "loss": 0.6978197574615479, "mean_token_accuracy": 0.8251541584730149, "num_tokens": 35382799.0, "step": 17810 }, { "entropy": 0.6543627932667733, "epoch": 0.3201149683387973, "grad_norm": 5.46875, "learning_rate": 3.920389234181871e-05, "loss": 0.6348058700561523, "mean_token_accuracy": 0.8412888690829277, "num_tokens": 35402553.0, "step": 17820 }, { "entropy": 0.6935957431793213, "epoch": 0.32029460636816814, "grad_norm": 5.125, "learning_rate": 3.9192067345703755e-05, "loss": 0.6866061210632324, "mean_token_accuracy": 0.829162959754467, "num_tokens": 35422225.0, "step": 17830 }, { "entropy": 0.693574846163392, "epoch": 0.32047424439753897, "grad_norm": 6.5625, "learning_rate": 3.918023766276068e-05, "loss": 0.7246339797973633, "mean_token_accuracy": 0.8193977564573288, "num_tokens": 35441901.0, "step": 17840 }, { "entropy": 0.820479690283537, "epoch": 0.3206538824269098, "grad_norm": 6.09375, "learning_rate": 3.916840329689618e-05, "loss": 0.8252622604370117, "mean_token_accuracy": 0.7990131780505181, "num_tokens": 35461154.0, "step": 17850 }, { "entropy": 0.6803769111633301, "epoch": 0.3208335204562806, "grad_norm": 5.53125, "learning_rate": 3.915656425201845e-05, "loss": 0.7319106101989746, "mean_token_accuracy": 0.8188167631626129, "num_tokens": 35481281.0, "step": 17860 }, { "entropy": 0.8349010899662972, "epoch": 0.32101315848565143, "grad_norm": 5.71875, "learning_rate": 3.914472053203726e-05, "loss": 0.9022153854370117, "mean_token_accuracy": 0.789471959322691, "num_tokens": 35501401.0, "step": 17870 }, { "entropy": 0.7311196655035019, "epoch": 0.32119279651502225, "grad_norm": 5.75, "learning_rate": 3.913287214086392e-05, "loss": 0.7151325225830079, "mean_token_accuracy": 0.8244502767920494, "num_tokens": 35522449.0, "step": 17880 }, { "entropy": 0.87136470079422, "epoch": 0.32137243454439307, "grad_norm": 5.9375, "learning_rate": 3.912101908241126e-05, "loss": 0.867275333404541, "mean_token_accuracy": 0.7914594322443008, "num_tokens": 35542643.0, "step": 17890 }, { "entropy": 0.730673173815012, "epoch": 0.3215520725737639, "grad_norm": 4.71875, "learning_rate": 3.9109161360593684e-05, "loss": 0.7197350025177002, "mean_token_accuracy": 0.8230228215456009, "num_tokens": 35562064.0, "step": 17900 }, { "entropy": 0.7367616221308708, "epoch": 0.32173171060313466, "grad_norm": 6.59375, "learning_rate": 3.9097298979327104e-05, "loss": 0.765618896484375, "mean_token_accuracy": 0.8102297723293305, "num_tokens": 35581401.0, "step": 17910 }, { "entropy": 0.7334169682115317, "epoch": 0.3219113486325055, "grad_norm": 5.0, "learning_rate": 3.9085431942528995e-05, "loss": 0.6692475795745849, "mean_token_accuracy": 0.8380904793739319, "num_tokens": 35601578.0, "step": 17920 }, { "entropy": 0.711165975034237, "epoch": 0.3220909866618763, "grad_norm": 5.03125, "learning_rate": 3.9073560254118357e-05, "loss": 0.7349391460418702, "mean_token_accuracy": 0.8185041308403015, "num_tokens": 35621624.0, "step": 17930 }, { "entropy": 0.6822538442909718, "epoch": 0.3222706246912471, "grad_norm": 6.125, "learning_rate": 3.906168391801574e-05, "loss": 0.7448233604431153, "mean_token_accuracy": 0.8198145613074302, "num_tokens": 35640193.0, "step": 17940 }, { "entropy": 0.7884551115334034, "epoch": 0.32245026272061794, "grad_norm": 5.71875, "learning_rate": 3.904980293814319e-05, "loss": 0.8254501342773437, "mean_token_accuracy": 0.8034142166376114, "num_tokens": 35659808.0, "step": 17950 }, { "entropy": 0.8055154643952847, "epoch": 0.32262990074998876, "grad_norm": 4.71875, "learning_rate": 3.9037917318424345e-05, "loss": 0.8211849212646485, "mean_token_accuracy": 0.8013218566775322, "num_tokens": 35680537.0, "step": 17960 }, { "entropy": 0.769489198178053, "epoch": 0.3228095387793596, "grad_norm": 6.15625, "learning_rate": 3.902602706278434e-05, "loss": 0.737896203994751, "mean_token_accuracy": 0.8228942841291428, "num_tokens": 35700398.0, "step": 17970 }, { "entropy": 0.6962581276893616, "epoch": 0.3229891768087304, "grad_norm": 5.25, "learning_rate": 3.901413217514983e-05, "loss": 0.6619221687316894, "mean_token_accuracy": 0.8340642988681793, "num_tokens": 35720628.0, "step": 17980 }, { "entropy": 0.6967524424195289, "epoch": 0.3231688148381012, "grad_norm": 6.65625, "learning_rate": 3.9002232659449036e-05, "loss": 0.6605311393737793, "mean_token_accuracy": 0.8388112917542457, "num_tokens": 35740644.0, "step": 17990 }, { "epoch": 0.32334845286747205, "eval_entropy": 0.6859483782052994, "eval_loss": 0.7286707758903503, "eval_mean_token_accuracy": 0.8220490045547485, "eval_num_tokens": 35760000.0, "eval_runtime": 40.5099, "eval_samples_per_second": 49.371, "eval_steps_per_second": 6.171, "step": 18000 }, { "entropy": 0.7104107137769461, "epoch": 0.32352809089684287, "grad_norm": 7.21875, "learning_rate": 3.897841975956901e-05, "loss": 0.7437191963195801, "mean_token_accuracy": 0.8219703547656536, "num_tokens": 35779311.0, "step": 18010 }, { "entropy": 0.6965253315865993, "epoch": 0.3237077289262137, "grad_norm": 5.15625, "learning_rate": 3.896650638325382e-05, "loss": 0.738174295425415, "mean_token_accuracy": 0.8219190165400505, "num_tokens": 35798459.0, "step": 18020 }, { "entropy": 0.7180504962801934, "epoch": 0.3238873669555845, "grad_norm": 8.1875, "learning_rate": 3.895458839460041e-05, "loss": 0.7187300682067871, "mean_token_accuracy": 0.823338258266449, "num_tokens": 35818198.0, "step": 18030 }, { "entropy": 0.7858592428267002, "epoch": 0.32406700498495533, "grad_norm": 6.0625, "learning_rate": 3.8942665797544614e-05, "loss": 0.7939746379852295, "mean_token_accuracy": 0.8107775658369064, "num_tokens": 35838842.0, "step": 18040 }, { "entropy": 0.7111394345760346, "epoch": 0.32424664301432615, "grad_norm": 7.125, "learning_rate": 3.893073859602378e-05, "loss": 0.7317216873168946, "mean_token_accuracy": 0.8147927239537239, "num_tokens": 35859226.0, "step": 18050 }, { "entropy": 0.7522515088319779, "epoch": 0.324426281043697, "grad_norm": 5.375, "learning_rate": 3.891880679397679e-05, "loss": 0.7336560249328613, "mean_token_accuracy": 0.815828162431717, "num_tokens": 35878908.0, "step": 18060 }, { "entropy": 0.6881562776863575, "epoch": 0.3246059190730678, "grad_norm": 5.375, "learning_rate": 3.890687039534402e-05, "loss": 0.7237205505371094, "mean_token_accuracy": 0.8199845224618911, "num_tokens": 35898344.0, "step": 18070 }, { "entropy": 0.7639813840389251, "epoch": 0.32478555710243856, "grad_norm": 4.71875, "learning_rate": 3.889492940406739e-05, "loss": 0.7334863185882569, "mean_token_accuracy": 0.8067487761378288, "num_tokens": 35917475.0, "step": 18080 }, { "entropy": 0.7383829429745674, "epoch": 0.3249651951318094, "grad_norm": 6.8125, "learning_rate": 3.888298382409032e-05, "loss": 0.7514029026031495, "mean_token_accuracy": 0.8088784500956535, "num_tokens": 35937271.0, "step": 18090 }, { "entropy": 0.6948116440325975, "epoch": 0.3251448331611802, "grad_norm": 6.53125, "learning_rate": 3.887103365935776e-05, "loss": 0.7240853786468506, "mean_token_accuracy": 0.8247540324926377, "num_tokens": 35956289.0, "step": 18100 }, { "entropy": 0.7187845341861248, "epoch": 0.325324471190551, "grad_norm": 9.125, "learning_rate": 3.8859078913816164e-05, "loss": 0.7233653545379639, "mean_token_accuracy": 0.8141455739736557, "num_tokens": 35975111.0, "step": 18110 }, { "entropy": 0.7458083823323249, "epoch": 0.32550410921992184, "grad_norm": 7.8125, "learning_rate": 3.8847119591413496e-05, "loss": 0.7706594467163086, "mean_token_accuracy": 0.8207385942339898, "num_tokens": 35994414.0, "step": 18120 }, { "entropy": 0.8206540107727051, "epoch": 0.32568374724929267, "grad_norm": 8.1875, "learning_rate": 3.8835155696099246e-05, "loss": 0.8289780616760254, "mean_token_accuracy": 0.798843277990818, "num_tokens": 36015479.0, "step": 18130 }, { "entropy": 0.7936149846762419, "epoch": 0.3258633852786635, "grad_norm": 6.34375, "learning_rate": 3.882318723182439e-05, "loss": 0.7851647853851318, "mean_token_accuracy": 0.8097789123654365, "num_tokens": 36035585.0, "step": 18140 }, { "entropy": 0.7167164027690888, "epoch": 0.3260430233080343, "grad_norm": 6.53125, "learning_rate": 3.881121420254144e-05, "loss": 0.7050783634185791, "mean_token_accuracy": 0.8215075165033341, "num_tokens": 36055767.0, "step": 18150 }, { "entropy": 0.6607315503060818, "epoch": 0.32622266133740513, "grad_norm": 4.625, "learning_rate": 3.879923661220439e-05, "loss": 0.6287544250488282, "mean_token_accuracy": 0.8367185801267624, "num_tokens": 36074978.0, "step": 18160 }, { "entropy": 0.6782990470528603, "epoch": 0.32640229936677595, "grad_norm": 5.8125, "learning_rate": 3.878725446476876e-05, "loss": 0.6678516864776611, "mean_token_accuracy": 0.8337928794324398, "num_tokens": 36094330.0, "step": 18170 }, { "entropy": 0.6288402430713177, "epoch": 0.32658193739614677, "grad_norm": 5.0, "learning_rate": 3.877526776419158e-05, "loss": 0.6523642539978027, "mean_token_accuracy": 0.8342447802424431, "num_tokens": 36113661.0, "step": 18180 }, { "entropy": 0.7460531532764435, "epoch": 0.3267615754255176, "grad_norm": 7.21875, "learning_rate": 3.876327651443135e-05, "loss": 0.7760750770568847, "mean_token_accuracy": 0.8118333652615547, "num_tokens": 36133901.0, "step": 18190 }, { "entropy": 0.7059107288718224, "epoch": 0.3269412134548884, "grad_norm": 8.1875, "learning_rate": 3.87512807194481e-05, "loss": 0.7308043003082275, "mean_token_accuracy": 0.8239887073636055, "num_tokens": 36154322.0, "step": 18200 }, { "entropy": 0.6194564238190651, "epoch": 0.32712085148425923, "grad_norm": 5.75, "learning_rate": 3.8739280383203366e-05, "loss": 0.7034087657928467, "mean_token_accuracy": 0.8321375474333763, "num_tokens": 36174064.0, "step": 18210 }, { "entropy": 0.7423336267471313, "epoch": 0.32730048951363006, "grad_norm": 7.0625, "learning_rate": 3.872727550966017e-05, "loss": 0.7456801891326904, "mean_token_accuracy": 0.8181778118014336, "num_tokens": 36193095.0, "step": 18220 }, { "entropy": 0.7759594857692719, "epoch": 0.3274801275430009, "grad_norm": 7.125, "learning_rate": 3.871526610278302e-05, "loss": 0.774388599395752, "mean_token_accuracy": 0.8100086480379105, "num_tokens": 36213463.0, "step": 18230 }, { "entropy": 0.7618721894919872, "epoch": 0.3276597655723717, "grad_norm": 7.3125, "learning_rate": 3.8703252166537954e-05, "loss": 0.7587786197662354, "mean_token_accuracy": 0.8235827222466469, "num_tokens": 36233781.0, "step": 18240 }, { "entropy": 0.7541228655725718, "epoch": 0.32783940360174246, "grad_norm": 5.96875, "learning_rate": 3.869123370489248e-05, "loss": 0.8078394889831543, "mean_token_accuracy": 0.8117158576846123, "num_tokens": 36254098.0, "step": 18250 }, { "entropy": 0.7939810432493687, "epoch": 0.3280190416311133, "grad_norm": 6.03125, "learning_rate": 3.867921072181561e-05, "loss": 0.7747293949127197, "mean_token_accuracy": 0.8127890095114708, "num_tokens": 36273992.0, "step": 18260 }, { "entropy": 0.7231539063155651, "epoch": 0.3281986796604841, "grad_norm": 5.625, "learning_rate": 3.866718322127784e-05, "loss": 0.7358824729919433, "mean_token_accuracy": 0.8163224875926971, "num_tokens": 36293821.0, "step": 18270 }, { "entropy": 0.6936972655355931, "epoch": 0.3283783176898549, "grad_norm": 5.46875, "learning_rate": 3.865515120725117e-05, "loss": 0.6835323810577393, "mean_token_accuracy": 0.833130057156086, "num_tokens": 36313991.0, "step": 18280 }, { "entropy": 0.7611787430942059, "epoch": 0.32855795571922575, "grad_norm": 6.09375, "learning_rate": 3.8643114683709106e-05, "loss": 0.781134557723999, "mean_token_accuracy": 0.8132867559790611, "num_tokens": 36333701.0, "step": 18290 }, { "entropy": 0.7220565572381019, "epoch": 0.32873759374859657, "grad_norm": 4.96875, "learning_rate": 3.863107365462659e-05, "loss": 0.7168581008911132, "mean_token_accuracy": 0.8252742826938629, "num_tokens": 36353354.0, "step": 18300 }, { "entropy": 0.7133948326110839, "epoch": 0.3289172317779674, "grad_norm": 6.4375, "learning_rate": 3.86190281239801e-05, "loss": 0.7207342147827148, "mean_token_accuracy": 0.8175678163766861, "num_tokens": 36373590.0, "step": 18310 }, { "entropy": 0.7170808725059032, "epoch": 0.3290968698073382, "grad_norm": 7.125, "learning_rate": 3.860697809574759e-05, "loss": 0.7516814231872558, "mean_token_accuracy": 0.8184340953826904, "num_tokens": 36392673.0, "step": 18320 }, { "entropy": 0.6643745338544249, "epoch": 0.32927650783670903, "grad_norm": 5.96875, "learning_rate": 3.8594923573908496e-05, "loss": 0.6682701110839844, "mean_token_accuracy": 0.8350428402423858, "num_tokens": 36411923.0, "step": 18330 }, { "entropy": 0.7081220515072346, "epoch": 0.32945614586607985, "grad_norm": 4.21875, "learning_rate": 3.8582864562443735e-05, "loss": 0.726106071472168, "mean_token_accuracy": 0.8204600110650062, "num_tokens": 36432530.0, "step": 18340 }, { "entropy": 0.7445301353931427, "epoch": 0.3296357838954507, "grad_norm": 9.625, "learning_rate": 3.857080106533569e-05, "loss": 0.823037052154541, "mean_token_accuracy": 0.8115371927618981, "num_tokens": 36452150.0, "step": 18350 }, { "entropy": 0.8014833815395832, "epoch": 0.3298154219248215, "grad_norm": 7.1875, "learning_rate": 3.8558733086568276e-05, "loss": 0.8193591117858887, "mean_token_accuracy": 0.8090257301926613, "num_tokens": 36471767.0, "step": 18360 }, { "entropy": 0.8053083054721355, "epoch": 0.3299950599541923, "grad_norm": 6.46875, "learning_rate": 3.854666063012684e-05, "loss": 0.8458587646484375, "mean_token_accuracy": 0.8012135088443756, "num_tokens": 36492233.0, "step": 18370 }, { "entropy": 0.824552272260189, "epoch": 0.33017469798356314, "grad_norm": 7.03125, "learning_rate": 3.853458369999822e-05, "loss": 0.7995263576507569, "mean_token_accuracy": 0.8024511843919754, "num_tokens": 36511468.0, "step": 18380 }, { "entropy": 0.7469260133802891, "epoch": 0.33035433601293396, "grad_norm": 5.90625, "learning_rate": 3.8522502300170744e-05, "loss": 0.722861909866333, "mean_token_accuracy": 0.8246075689792634, "num_tokens": 36530853.0, "step": 18390 }, { "entropy": 0.7714269630610943, "epoch": 0.3305339740423048, "grad_norm": 5.15625, "learning_rate": 3.85104164346342e-05, "loss": 0.7363530158996582, "mean_token_accuracy": 0.8184788078069687, "num_tokens": 36551393.0, "step": 18400 }, { "entropy": 0.7279658913612366, "epoch": 0.3307136120716756, "grad_norm": 8.0625, "learning_rate": 3.849832610737986e-05, "loss": 0.7606022357940674, "mean_token_accuracy": 0.8112672522664071, "num_tokens": 36570769.0, "step": 18410 }, { "entropy": 0.7019796539098024, "epoch": 0.33089325010104637, "grad_norm": 7.34375, "learning_rate": 3.848623132240047e-05, "loss": 0.7645049571990967, "mean_token_accuracy": 0.8167028889060021, "num_tokens": 36590872.0, "step": 18420 }, { "entropy": 0.7192273221909999, "epoch": 0.3310728881304172, "grad_norm": 4.625, "learning_rate": 3.847413208369025e-05, "loss": 0.7425713539123535, "mean_token_accuracy": 0.8125694468617439, "num_tokens": 36610178.0, "step": 18430 }, { "entropy": 0.7617163226008415, "epoch": 0.331252526159788, "grad_norm": 7.40625, "learning_rate": 3.8462028395244874e-05, "loss": 0.7606909275054932, "mean_token_accuracy": 0.8147780910134316, "num_tokens": 36630216.0, "step": 18440 }, { "entropy": 0.7540189482271671, "epoch": 0.33143216418915883, "grad_norm": 4.4375, "learning_rate": 3.844992026106151e-05, "loss": 0.7246033191680908, "mean_token_accuracy": 0.828866283595562, "num_tokens": 36650214.0, "step": 18450 }, { "entropy": 0.7657978005707264, "epoch": 0.33161180221852965, "grad_norm": 7.84375, "learning_rate": 3.843780768513877e-05, "loss": 0.7647784233093262, "mean_token_accuracy": 0.817056518048048, "num_tokens": 36670995.0, "step": 18460 }, { "entropy": 0.726831492781639, "epoch": 0.33179144024790047, "grad_norm": 5.34375, "learning_rate": 3.8425690671476756e-05, "loss": 0.7299631595611572, "mean_token_accuracy": 0.8184500336647034, "num_tokens": 36690742.0, "step": 18470 }, { "entropy": 0.7030957140028476, "epoch": 0.3319710782772713, "grad_norm": 7.0, "learning_rate": 3.8413569224077026e-05, "loss": 0.7092371940612793, "mean_token_accuracy": 0.8225024163722991, "num_tokens": 36709945.0, "step": 18480 }, { "entropy": 0.698981449007988, "epoch": 0.3321507163066421, "grad_norm": 6.1875, "learning_rate": 3.840144334694259e-05, "loss": 0.7193443775177002, "mean_token_accuracy": 0.8260339245200157, "num_tokens": 36730552.0, "step": 18490 }, { "entropy": 0.7802863925695419, "epoch": 0.33233035433601293, "grad_norm": 7.125, "learning_rate": 3.838931304407793e-05, "loss": 0.7969265937805176, "mean_token_accuracy": 0.8059286683797836, "num_tokens": 36751378.0, "step": 18500 }, { "entropy": 0.681403387337923, "epoch": 0.33250999236538376, "grad_norm": 5.90625, "learning_rate": 3.837717831948901e-05, "loss": 0.6884686470031738, "mean_token_accuracy": 0.8318066015839577, "num_tokens": 36770624.0, "step": 18510 }, { "entropy": 0.6782195389270782, "epoch": 0.3326896303947546, "grad_norm": 7.46875, "learning_rate": 3.836503917718323e-05, "loss": 0.7010732650756836, "mean_token_accuracy": 0.8273067072033882, "num_tokens": 36790879.0, "step": 18520 }, { "entropy": 0.7966554440557957, "epoch": 0.3328692684241254, "grad_norm": 5.9375, "learning_rate": 3.835289562116944e-05, "loss": 0.7911303997039795, "mean_token_accuracy": 0.8021986454725265, "num_tokens": 36811172.0, "step": 18530 }, { "entropy": 0.7638285987079143, "epoch": 0.3330489064534962, "grad_norm": 4.9375, "learning_rate": 3.8340747655457966e-05, "loss": 0.7817434310913086, "mean_token_accuracy": 0.8101646333932877, "num_tokens": 36831743.0, "step": 18540 }, { "entropy": 0.7218019172549248, "epoch": 0.33322854448286704, "grad_norm": 5.03125, "learning_rate": 3.8328595284060594e-05, "loss": 0.7030789852142334, "mean_token_accuracy": 0.8340276136994362, "num_tokens": 36850942.0, "step": 18550 }, { "entropy": 0.8480454966425895, "epoch": 0.33340818251223786, "grad_norm": 6.53125, "learning_rate": 3.831643851099056e-05, "loss": 0.9133129119873047, "mean_token_accuracy": 0.7898767620325089, "num_tokens": 36871385.0, "step": 18560 }, { "entropy": 0.7373027011752129, "epoch": 0.3335878205416087, "grad_norm": 6.90625, "learning_rate": 3.8304277340262536e-05, "loss": 0.7270811080932618, "mean_token_accuracy": 0.8201663658022881, "num_tokens": 36891429.0, "step": 18570 }, { "entropy": 0.6780092939734459, "epoch": 0.3337674585709795, "grad_norm": 5.03125, "learning_rate": 3.829211177589267e-05, "loss": 0.6929347515106201, "mean_token_accuracy": 0.8263748154044152, "num_tokens": 36911038.0, "step": 18580 }, { "entropy": 0.7557262569665909, "epoch": 0.33394709660035027, "grad_norm": 5.875, "learning_rate": 3.827994182189855e-05, "loss": 0.772157859802246, "mean_token_accuracy": 0.8099320515990257, "num_tokens": 36930958.0, "step": 18590 }, { "entropy": 0.6927871316671371, "epoch": 0.3341267346297211, "grad_norm": 5.5, "learning_rate": 3.826776748229922e-05, "loss": 0.6662344455718994, "mean_token_accuracy": 0.835584020614624, "num_tokens": 36951474.0, "step": 18600 }, { "entropy": 0.6624749101698398, "epoch": 0.3343063726590919, "grad_norm": 8.1875, "learning_rate": 3.825558876111518e-05, "loss": 0.6888839721679687, "mean_token_accuracy": 0.8293868422508239, "num_tokens": 36972228.0, "step": 18610 }, { "entropy": 0.7181465312838554, "epoch": 0.33448601068846273, "grad_norm": 4.9375, "learning_rate": 3.824340566236833e-05, "loss": 0.7347521305084228, "mean_token_accuracy": 0.8214095681905746, "num_tokens": 36992018.0, "step": 18620 }, { "entropy": 0.7762895479798317, "epoch": 0.33466564871783355, "grad_norm": 7.09375, "learning_rate": 3.823121819008208e-05, "loss": 0.7590028285980225, "mean_token_accuracy": 0.8116882398724556, "num_tokens": 37012143.0, "step": 18630 }, { "entropy": 0.7358211122453213, "epoch": 0.3348452867472044, "grad_norm": 6.5, "learning_rate": 3.821902634828124e-05, "loss": 0.7745433330535889, "mean_token_accuracy": 0.8135696589946747, "num_tokens": 37031625.0, "step": 18640 }, { "entropy": 0.7558896265923977, "epoch": 0.3350249247765752, "grad_norm": 5.03125, "learning_rate": 3.8206830140992094e-05, "loss": 0.7886178016662597, "mean_token_accuracy": 0.810863482952118, "num_tokens": 37054140.0, "step": 18650 }, { "entropy": 0.6869462393224239, "epoch": 0.335204562805946, "grad_norm": 5.375, "learning_rate": 3.8194629572242335e-05, "loss": 0.7197296142578125, "mean_token_accuracy": 0.829002232849598, "num_tokens": 37073511.0, "step": 18660 }, { "entropy": 0.7334383629262448, "epoch": 0.33538420083531684, "grad_norm": 6.59375, "learning_rate": 3.818242464606112e-05, "loss": 0.759697437286377, "mean_token_accuracy": 0.8188296809792519, "num_tokens": 37093285.0, "step": 18670 }, { "entropy": 0.7271647840738297, "epoch": 0.33556383886468766, "grad_norm": 5.9375, "learning_rate": 3.817021536647905e-05, "loss": 0.7197713375091552, "mean_token_accuracy": 0.8217777356505394, "num_tokens": 37112477.0, "step": 18680 }, { "entropy": 0.7619598247110844, "epoch": 0.3357434768940585, "grad_norm": 6.4375, "learning_rate": 3.815800173752813e-05, "loss": 0.7630502700805664, "mean_token_accuracy": 0.8127833500504493, "num_tokens": 37132284.0, "step": 18690 }, { "entropy": 0.7578432653099298, "epoch": 0.3359231149234293, "grad_norm": 7.34375, "learning_rate": 3.814578376324183e-05, "loss": 0.731998872756958, "mean_token_accuracy": 0.8185982555150986, "num_tokens": 37152362.0, "step": 18700 }, { "entropy": 0.6884110160171986, "epoch": 0.3361027529528001, "grad_norm": 6.90625, "learning_rate": 3.8133561447655046e-05, "loss": 0.6964850425720215, "mean_token_accuracy": 0.8265047192573547, "num_tokens": 37172611.0, "step": 18710 }, { "entropy": 0.8253501400351524, "epoch": 0.33628239098217094, "grad_norm": 8.125, "learning_rate": 3.812133479480413e-05, "loss": 0.8615789413452148, "mean_token_accuracy": 0.7984562411904335, "num_tokens": 37193416.0, "step": 18720 }, { "entropy": 0.7341925159096718, "epoch": 0.33646202901154176, "grad_norm": 6.25, "learning_rate": 3.8109103808726816e-05, "loss": 0.7278830051422119, "mean_token_accuracy": 0.8197360396385193, "num_tokens": 37213556.0, "step": 18730 }, { "entropy": 0.7634441427886486, "epoch": 0.3366416670409126, "grad_norm": 6.90625, "learning_rate": 3.8096868493462324e-05, "loss": 0.7745267391204834, "mean_token_accuracy": 0.8052794098854065, "num_tokens": 37233035.0, "step": 18740 }, { "entropy": 0.7776296749711037, "epoch": 0.3368213050702834, "grad_norm": 4.28125, "learning_rate": 3.808462885305126e-05, "loss": 0.7788728713989258, "mean_token_accuracy": 0.8059475466609001, "num_tokens": 37252712.0, "step": 18750 }, { "entropy": 0.7568254709243775, "epoch": 0.33700094309965417, "grad_norm": 6.0, "learning_rate": 3.8072384891535694e-05, "loss": 0.7935106754302979, "mean_token_accuracy": 0.8023427307605744, "num_tokens": 37272399.0, "step": 18760 }, { "entropy": 0.6368025138974189, "epoch": 0.337180581129025, "grad_norm": 5.03125, "learning_rate": 3.8060136612959096e-05, "loss": 0.6402888298034668, "mean_token_accuracy": 0.8436927735805512, "num_tokens": 37292500.0, "step": 18770 }, { "entropy": 0.7777565490454436, "epoch": 0.3373602191583958, "grad_norm": 3.875, "learning_rate": 3.8047884021366374e-05, "loss": 0.7925205230712891, "mean_token_accuracy": 0.808977472782135, "num_tokens": 37312100.0, "step": 18780 }, { "entropy": 0.7706734105944634, "epoch": 0.33753985718776663, "grad_norm": 6.875, "learning_rate": 3.803562712080386e-05, "loss": 0.8321983337402343, "mean_token_accuracy": 0.8087673798203469, "num_tokens": 37331489.0, "step": 18790 }, { "entropy": 0.7277456097304821, "epoch": 0.33771949521713746, "grad_norm": 4.9375, "learning_rate": 3.80233659153193e-05, "loss": 0.7134997367858886, "mean_token_accuracy": 0.8213506639003754, "num_tokens": 37350969.0, "step": 18800 }, { "entropy": 0.6118907302618026, "epoch": 0.3378991332465083, "grad_norm": 5.15625, "learning_rate": 3.801110040896187e-05, "loss": 0.6330528736114502, "mean_token_accuracy": 0.8412870526313782, "num_tokens": 37371179.0, "step": 18810 }, { "entropy": 0.7131917484104633, "epoch": 0.3380787712758791, "grad_norm": 4.0625, "learning_rate": 3.799883060578218e-05, "loss": 0.6921073436737061, "mean_token_accuracy": 0.8304278865456581, "num_tokens": 37390184.0, "step": 18820 }, { "entropy": 0.7184038236737251, "epoch": 0.3382584093052499, "grad_norm": 5.40625, "learning_rate": 3.798655650983223e-05, "loss": 0.6857271194458008, "mean_token_accuracy": 0.8249371990561485, "num_tokens": 37409401.0, "step": 18830 }, { "entropy": 0.7210898119956255, "epoch": 0.33843804733462074, "grad_norm": 8.9375, "learning_rate": 3.7974278125165455e-05, "loss": 0.7216170787811279, "mean_token_accuracy": 0.8264225035905838, "num_tokens": 37428922.0, "step": 18840 }, { "entropy": 0.7202691189944744, "epoch": 0.33861768536399156, "grad_norm": 5.90625, "learning_rate": 3.79619954558367e-05, "loss": 0.7232740879058838, "mean_token_accuracy": 0.8209880575537681, "num_tokens": 37448123.0, "step": 18850 }, { "entropy": 0.7499488189816474, "epoch": 0.3387973233933624, "grad_norm": 4.25, "learning_rate": 3.7949708505902234e-05, "loss": 0.7715535163879395, "mean_token_accuracy": 0.8093914017081261, "num_tokens": 37468812.0, "step": 18860 }, { "entropy": 0.6953777208924293, "epoch": 0.3389769614227332, "grad_norm": 6.03125, "learning_rate": 3.793741727941973e-05, "loss": 0.7301736354827881, "mean_token_accuracy": 0.8261926978826523, "num_tokens": 37487471.0, "step": 18870 }, { "entropy": 0.7437459662556648, "epoch": 0.339156599452104, "grad_norm": 5.71875, "learning_rate": 3.792512178044828e-05, "loss": 0.7270897388458252, "mean_token_accuracy": 0.8254898443818093, "num_tokens": 37507350.0, "step": 18880 }, { "entropy": 0.7612410224974155, "epoch": 0.33933623748147485, "grad_norm": 7.65625, "learning_rate": 3.791282201304838e-05, "loss": 0.7653296947479248, "mean_token_accuracy": 0.8047315880656243, "num_tokens": 37528072.0, "step": 18890 }, { "entropy": 0.6096017561852932, "epoch": 0.33951587551084567, "grad_norm": 5.75, "learning_rate": 3.7900517981281944e-05, "loss": 0.6406901359558106, "mean_token_accuracy": 0.8357881680130959, "num_tokens": 37547134.0, "step": 18900 }, { "entropy": 0.7701665848493576, "epoch": 0.3396955135402165, "grad_norm": 9.3125, "learning_rate": 3.78882096892123e-05, "loss": 0.8009776115417481, "mean_token_accuracy": 0.8100209400057793, "num_tokens": 37567547.0, "step": 18910 }, { "entropy": 0.7547654867172241, "epoch": 0.3398751515695873, "grad_norm": 7.875, "learning_rate": 3.787589714090414e-05, "loss": 0.7779419898986817, "mean_token_accuracy": 0.8086513087153435, "num_tokens": 37588144.0, "step": 18920 }, { "entropy": 0.7244872614741326, "epoch": 0.3400547895989581, "grad_norm": 5.46875, "learning_rate": 3.786358034042363e-05, "loss": 0.698306655883789, "mean_token_accuracy": 0.8251514658331871, "num_tokens": 37609079.0, "step": 18930 }, { "entropy": 0.761848258972168, "epoch": 0.3402344276283289, "grad_norm": 5.75, "learning_rate": 3.785125929183829e-05, "loss": 0.750943946838379, "mean_token_accuracy": 0.8199173092842102, "num_tokens": 37629767.0, "step": 18940 }, { "entropy": 0.6687883049249649, "epoch": 0.3404140656576997, "grad_norm": 7.96875, "learning_rate": 3.783893399921705e-05, "loss": 0.6762603759765625, "mean_token_accuracy": 0.8328309640288353, "num_tokens": 37649492.0, "step": 18950 }, { "entropy": 0.7742831759154797, "epoch": 0.34059370368707054, "grad_norm": 4.53125, "learning_rate": 3.782660446663026e-05, "loss": 0.8442475318908691, "mean_token_accuracy": 0.7992448180913925, "num_tokens": 37669884.0, "step": 18960 }, { "entropy": 0.6961066674441099, "epoch": 0.34077334171644136, "grad_norm": 6.375, "learning_rate": 3.781427069814966e-05, "loss": 0.7144382953643799, "mean_token_accuracy": 0.8219897776842118, "num_tokens": 37689319.0, "step": 18970 }, { "entropy": 0.7304068498313427, "epoch": 0.3409529797458122, "grad_norm": 6.15625, "learning_rate": 3.7801932697848384e-05, "loss": 0.7871774673461914, "mean_token_accuracy": 0.8083600834012031, "num_tokens": 37708412.0, "step": 18980 }, { "entropy": 0.6915356785058975, "epoch": 0.341132617775183, "grad_norm": 8.0, "learning_rate": 3.7789590469800964e-05, "loss": 0.6875615596771241, "mean_token_accuracy": 0.8225994825363159, "num_tokens": 37727832.0, "step": 18990 }, { "epoch": 0.3413122558045538, "eval_entropy": 0.7105240641832352, "eval_loss": 0.7102656364440918, "eval_mean_token_accuracy": 0.8266999173164368, "eval_num_tokens": 37748444.0, "eval_runtime": 40.5106, "eval_samples_per_second": 49.37, "eval_steps_per_second": 6.171, "step": 19000 }, { "entropy": 0.7470948297530413, "epoch": 0.34149189383392464, "grad_norm": 5.375, "learning_rate": 3.776489334677283e-05, "loss": 0.7552666187286377, "mean_token_accuracy": 0.8163947820663452, "num_tokens": 37767868.0, "step": 19010 }, { "entropy": 0.658749309182167, "epoch": 0.34167153186329546, "grad_norm": 4.28125, "learning_rate": 3.7752538459948166e-05, "loss": 0.6398323059082032, "mean_token_accuracy": 0.8333108991384506, "num_tokens": 37788923.0, "step": 19020 }, { "entropy": 0.7044443979859352, "epoch": 0.3418511698926663, "grad_norm": 5.96875, "learning_rate": 3.7740179361689456e-05, "loss": 0.6969527721405029, "mean_token_accuracy": 0.8253401532769203, "num_tokens": 37808391.0, "step": 19030 }, { "entropy": 0.7176072269678115, "epoch": 0.3420308079220371, "grad_norm": 9.1875, "learning_rate": 3.7727816056078194e-05, "loss": 0.738358449935913, "mean_token_accuracy": 0.8177365466952324, "num_tokens": 37828939.0, "step": 19040 }, { "entropy": 0.7564432226121426, "epoch": 0.3422104459514079, "grad_norm": 7.15625, "learning_rate": 3.771544854719728e-05, "loss": 0.7708708763122558, "mean_token_accuracy": 0.8114937514066696, "num_tokens": 37849027.0, "step": 19050 }, { "entropy": 0.7048233859241009, "epoch": 0.34239008398077875, "grad_norm": 5.625, "learning_rate": 3.7703076839131e-05, "loss": 0.7374229431152344, "mean_token_accuracy": 0.8205429792404175, "num_tokens": 37869459.0, "step": 19060 }, { "entropy": 0.7019929453730583, "epoch": 0.34256972201014957, "grad_norm": 4.3125, "learning_rate": 3.769070093596502e-05, "loss": 0.7498816013336181, "mean_token_accuracy": 0.8127054795622826, "num_tokens": 37889501.0, "step": 19070 }, { "entropy": 0.7260166116058826, "epoch": 0.3427493600395204, "grad_norm": 4.59375, "learning_rate": 3.767832084178639e-05, "loss": 0.7173238277435303, "mean_token_accuracy": 0.8211311534047127, "num_tokens": 37909116.0, "step": 19080 }, { "entropy": 0.7571039728820324, "epoch": 0.3429289980688912, "grad_norm": 5.1875, "learning_rate": 3.766593656068353e-05, "loss": 0.7422631740570068, "mean_token_accuracy": 0.820719176530838, "num_tokens": 37930223.0, "step": 19090 }, { "entropy": 0.6945526666939259, "epoch": 0.343108636098262, "grad_norm": 6.0625, "learning_rate": 3.7653548096746286e-05, "loss": 0.6704851150512695, "mean_token_accuracy": 0.8353661194443702, "num_tokens": 37949311.0, "step": 19100 }, { "entropy": 0.6877373330295086, "epoch": 0.3432882741276328, "grad_norm": 6.125, "learning_rate": 3.764115545406586e-05, "loss": 0.6937294006347656, "mean_token_accuracy": 0.8236712366342545, "num_tokens": 37969216.0, "step": 19110 }, { "entropy": 0.7838771343231201, "epoch": 0.3434679121570036, "grad_norm": 6.8125, "learning_rate": 3.7628758636734805e-05, "loss": 0.8437059402465821, "mean_token_accuracy": 0.8050981879234314, "num_tokens": 37988391.0, "step": 19120 }, { "entropy": 0.7158090360462666, "epoch": 0.34364755018637444, "grad_norm": 5.28125, "learning_rate": 3.76163576488471e-05, "loss": 0.7070069789886475, "mean_token_accuracy": 0.8265893533825874, "num_tokens": 38007629.0, "step": 19130 }, { "entropy": 0.7143278494477272, "epoch": 0.34382718821574526, "grad_norm": 6.0, "learning_rate": 3.760395249449809e-05, "loss": 0.7046169757843017, "mean_token_accuracy": 0.8205106377601623, "num_tokens": 38027354.0, "step": 19140 }, { "entropy": 0.7360103152692318, "epoch": 0.3440068262451161, "grad_norm": 7.3125, "learning_rate": 3.759154317778447e-05, "loss": 0.7412358283996582, "mean_token_accuracy": 0.821279838681221, "num_tokens": 38047049.0, "step": 19150 }, { "entropy": 0.6841146789491177, "epoch": 0.3441864642744869, "grad_norm": 6.0, "learning_rate": 3.7579129702804344e-05, "loss": 0.7308036327362061, "mean_token_accuracy": 0.8284485906362533, "num_tokens": 38066016.0, "step": 19160 }, { "entropy": 0.7355218008160591, "epoch": 0.3443661023038577, "grad_norm": 8.625, "learning_rate": 3.756671207365716e-05, "loss": 0.7159568309783936, "mean_token_accuracy": 0.824302400648594, "num_tokens": 38085862.0, "step": 19170 }, { "entropy": 0.6563275642693043, "epoch": 0.34454574033322855, "grad_norm": 6.96875, "learning_rate": 3.755429029444375e-05, "loss": 0.6665488243103027, "mean_token_accuracy": 0.829937107861042, "num_tokens": 38105712.0, "step": 19180 }, { "entropy": 0.7235178224742412, "epoch": 0.34472537836259937, "grad_norm": 6.28125, "learning_rate": 3.754186436926632e-05, "loss": 0.7619231224060059, "mean_token_accuracy": 0.816053093969822, "num_tokens": 38125983.0, "step": 19190 }, { "entropy": 0.7046797551214695, "epoch": 0.3449050163919702, "grad_norm": 7.875, "learning_rate": 3.7529434302228464e-05, "loss": 0.7277954578399658, "mean_token_accuracy": 0.8219369724392891, "num_tokens": 38146031.0, "step": 19200 }, { "entropy": 0.7113085374236107, "epoch": 0.345084654421341, "grad_norm": 4.8125, "learning_rate": 3.751700009743508e-05, "loss": 0.7442852973937988, "mean_token_accuracy": 0.817693717777729, "num_tokens": 38165427.0, "step": 19210 }, { "entropy": 0.7748551547527314, "epoch": 0.34526429245071183, "grad_norm": 5.59375, "learning_rate": 3.7504561758992505e-05, "loss": 0.7610948085784912, "mean_token_accuracy": 0.829310166835785, "num_tokens": 38184749.0, "step": 19220 }, { "entropy": 0.7265764161944389, "epoch": 0.34544393048008265, "grad_norm": 7.71875, "learning_rate": 3.74921192910084e-05, "loss": 0.7449968338012696, "mean_token_accuracy": 0.8206524759531021, "num_tokens": 38204974.0, "step": 19230 }, { "entropy": 0.7975287966430187, "epoch": 0.34562356850945347, "grad_norm": 8.25, "learning_rate": 3.747967269759181e-05, "loss": 0.7726430892944336, "mean_token_accuracy": 0.8185803309082985, "num_tokens": 38225103.0, "step": 19240 }, { "entropy": 0.5731569331139326, "epoch": 0.3458032065388243, "grad_norm": 4.84375, "learning_rate": 3.7467221982853125e-05, "loss": 0.5851688385009766, "mean_token_accuracy": 0.8555969774723053, "num_tokens": 38244715.0, "step": 19250 }, { "entropy": 0.7497602261602878, "epoch": 0.3459828445681951, "grad_norm": 5.0625, "learning_rate": 3.74547671509041e-05, "loss": 0.7365609169006347, "mean_token_accuracy": 0.8170225068926811, "num_tokens": 38265205.0, "step": 19260 }, { "entropy": 0.7458068639039993, "epoch": 0.3461624825975659, "grad_norm": 5.5, "learning_rate": 3.744230820585786e-05, "loss": 0.7546461582183838, "mean_token_accuracy": 0.8166630506515503, "num_tokens": 38285777.0, "step": 19270 }, { "entropy": 0.7627834901213646, "epoch": 0.3463421206269367, "grad_norm": 4.9375, "learning_rate": 3.742984515182888e-05, "loss": 0.7814962863922119, "mean_token_accuracy": 0.8142510116100311, "num_tokens": 38305896.0, "step": 19280 }, { "entropy": 0.7436657659709454, "epoch": 0.3465217586563075, "grad_norm": 6.0625, "learning_rate": 3.7417377992933006e-05, "loss": 0.7709619045257569, "mean_token_accuracy": 0.8094367116689682, "num_tokens": 38325186.0, "step": 19290 }, { "entropy": 0.6691153690218925, "epoch": 0.34670139668567834, "grad_norm": 6.28125, "learning_rate": 3.74049067332874e-05, "loss": 0.6791462898254395, "mean_token_accuracy": 0.8314015701413154, "num_tokens": 38345465.0, "step": 19300 }, { "entropy": 0.7306291438639164, "epoch": 0.34688103471504916, "grad_norm": 9.0625, "learning_rate": 3.7392431377010634e-05, "loss": 0.714200210571289, "mean_token_accuracy": 0.8198609828948975, "num_tokens": 38366031.0, "step": 19310 }, { "entropy": 0.6979415692389012, "epoch": 0.34706067274442, "grad_norm": 5.84375, "learning_rate": 3.7379951928222584e-05, "loss": 0.7082321643829346, "mean_token_accuracy": 0.8262175038456917, "num_tokens": 38386115.0, "step": 19320 }, { "entropy": 0.7768630117177964, "epoch": 0.3472403107737908, "grad_norm": 6.15625, "learning_rate": 3.7367468391044514e-05, "loss": 0.7835107326507569, "mean_token_accuracy": 0.8064766526222229, "num_tokens": 38404826.0, "step": 19330 }, { "entropy": 0.6705552920699119, "epoch": 0.3474199488031616, "grad_norm": 4.4375, "learning_rate": 3.7354980769599014e-05, "loss": 0.6855151176452636, "mean_token_accuracy": 0.8339838474988938, "num_tokens": 38424704.0, "step": 19340 }, { "entropy": 0.6821355912834406, "epoch": 0.34759958683253245, "grad_norm": 5.59375, "learning_rate": 3.734248906801003e-05, "loss": 0.6492209434509277, "mean_token_accuracy": 0.8339143961668014, "num_tokens": 38444330.0, "step": 19350 }, { "entropy": 0.7818419747054577, "epoch": 0.34777922486190327, "grad_norm": 4.65625, "learning_rate": 3.732999329040286e-05, "loss": 0.8500520706176757, "mean_token_accuracy": 0.7986829802393913, "num_tokens": 38463562.0, "step": 19360 }, { "entropy": 0.8236159533262253, "epoch": 0.3479588628912741, "grad_norm": 6.59375, "learning_rate": 3.731749344090414e-05, "loss": 0.8518532752990723, "mean_token_accuracy": 0.7995924435555934, "num_tokens": 38483998.0, "step": 19370 }, { "entropy": 0.7961986035108566, "epoch": 0.3481385009206449, "grad_norm": 6.625, "learning_rate": 3.7304989523641866e-05, "loss": 0.7961482524871826, "mean_token_accuracy": 0.8040114253759384, "num_tokens": 38503596.0, "step": 19380 }, { "entropy": 0.7170285671949387, "epoch": 0.34831813895001573, "grad_norm": 5.9375, "learning_rate": 3.729248154274535e-05, "loss": 0.6814708709716797, "mean_token_accuracy": 0.8306064814329147, "num_tokens": 38523550.0, "step": 19390 }, { "entropy": 0.6218185223639011, "epoch": 0.34849777697938655, "grad_norm": 6.4375, "learning_rate": 3.727996950234528e-05, "loss": 0.5942700862884521, "mean_token_accuracy": 0.8479880779981613, "num_tokens": 38543445.0, "step": 19400 }, { "entropy": 0.6584331452846527, "epoch": 0.3486774150087574, "grad_norm": 6.6875, "learning_rate": 3.7267453406573646e-05, "loss": 0.7164645671844483, "mean_token_accuracy": 0.828114801645279, "num_tokens": 38563211.0, "step": 19410 }, { "entropy": 0.7123130120337009, "epoch": 0.3488570530381282, "grad_norm": 6.25, "learning_rate": 3.7254933259563826e-05, "loss": 0.7497681140899658, "mean_token_accuracy": 0.8183339387178421, "num_tokens": 38582003.0, "step": 19420 }, { "entropy": 0.7531318098306656, "epoch": 0.349036691067499, "grad_norm": 8.5, "learning_rate": 3.724240906545049e-05, "loss": 0.745562219619751, "mean_token_accuracy": 0.8220388367772102, "num_tokens": 38601447.0, "step": 19430 }, { "entropy": 0.7783000510185957, "epoch": 0.3492163290968698, "grad_norm": 5.75, "learning_rate": 3.722988082836967e-05, "loss": 0.7921068668365479, "mean_token_accuracy": 0.8143302634358406, "num_tokens": 38622222.0, "step": 19440 }, { "entropy": 0.7307706788182259, "epoch": 0.3493959671262406, "grad_norm": 6.21875, "learning_rate": 3.721734855245872e-05, "loss": 0.7375482082366943, "mean_token_accuracy": 0.823814032971859, "num_tokens": 38643011.0, "step": 19450 }, { "entropy": 0.7250261522829533, "epoch": 0.3495756051556114, "grad_norm": 6.0625, "learning_rate": 3.720481224185633e-05, "loss": 0.7338265419006348, "mean_token_accuracy": 0.8206143364310264, "num_tokens": 38663207.0, "step": 19460 }, { "entropy": 0.6972012229263782, "epoch": 0.34975524318498225, "grad_norm": 6.90625, "learning_rate": 3.7192271900702554e-05, "loss": 0.7050270080566406, "mean_token_accuracy": 0.8321330428123475, "num_tokens": 38682920.0, "step": 19470 }, { "entropy": 0.6967833112925291, "epoch": 0.34993488121435307, "grad_norm": 4.5, "learning_rate": 3.717972753313871e-05, "loss": 0.6925751209259033, "mean_token_accuracy": 0.8247395232319832, "num_tokens": 38702535.0, "step": 19480 }, { "entropy": 0.7052656009793281, "epoch": 0.3501145192437239, "grad_norm": 5.75, "learning_rate": 3.7167179143307514e-05, "loss": 0.6996980667114258, "mean_token_accuracy": 0.8199231758713722, "num_tokens": 38721777.0, "step": 19490 }, { "entropy": 0.7232063189148903, "epoch": 0.3502941572730947, "grad_norm": 6.40625, "learning_rate": 3.7154626735352964e-05, "loss": 0.7731166839599609, "mean_token_accuracy": 0.8144383385777474, "num_tokens": 38740962.0, "step": 19500 }, { "entropy": 0.6854423105716705, "epoch": 0.35047379530246553, "grad_norm": 5.84375, "learning_rate": 3.714207031342042e-05, "loss": 0.709846019744873, "mean_token_accuracy": 0.8282036945223809, "num_tokens": 38762405.0, "step": 19510 }, { "entropy": 0.677189652621746, "epoch": 0.35065343333183635, "grad_norm": 4.46875, "learning_rate": 3.712950988165653e-05, "loss": 0.6914024829864502, "mean_token_accuracy": 0.8244973734021187, "num_tokens": 38782050.0, "step": 19520 }, { "entropy": 0.7527848079800605, "epoch": 0.35083307136120717, "grad_norm": 6.46875, "learning_rate": 3.7116945444209306e-05, "loss": 0.7600464344024658, "mean_token_accuracy": 0.8162539556622506, "num_tokens": 38801977.0, "step": 19530 }, { "entropy": 0.7454664569348097, "epoch": 0.351012709390578, "grad_norm": 6.40625, "learning_rate": 3.710437700522805e-05, "loss": 0.7491289138793945, "mean_token_accuracy": 0.8286859825253486, "num_tokens": 38820532.0, "step": 19540 }, { "entropy": 0.7071416556835175, "epoch": 0.3511923474199488, "grad_norm": 6.125, "learning_rate": 3.70918045688634e-05, "loss": 0.6822431087493896, "mean_token_accuracy": 0.8370253548026085, "num_tokens": 38842067.0, "step": 19550 }, { "entropy": 0.7024726055562496, "epoch": 0.35137198544931963, "grad_norm": 5.25, "learning_rate": 3.707922813926731e-05, "loss": 0.7256744384765625, "mean_token_accuracy": 0.8155663028359413, "num_tokens": 38862431.0, "step": 19560 }, { "entropy": 0.7440385214984417, "epoch": 0.35155162347869046, "grad_norm": 5.0, "learning_rate": 3.706664772059306e-05, "loss": 0.7175159454345703, "mean_token_accuracy": 0.8276472702622414, "num_tokens": 38883744.0, "step": 19570 }, { "entropy": 0.7138817705214023, "epoch": 0.3517312615080613, "grad_norm": 6.0, "learning_rate": 3.705406331699525e-05, "loss": 0.7633171081542969, "mean_token_accuracy": 0.8222905993461609, "num_tokens": 38904011.0, "step": 19580 }, { "entropy": 0.7213800169527531, "epoch": 0.3519108995374321, "grad_norm": 5.0625, "learning_rate": 3.704147493262978e-05, "loss": 0.7514737606048584, "mean_token_accuracy": 0.8108336687088012, "num_tokens": 38923084.0, "step": 19590 }, { "entropy": 0.7661073513329029, "epoch": 0.3520905375668029, "grad_norm": 6.5625, "learning_rate": 3.7028882571653874e-05, "loss": 0.7500514030456543, "mean_token_accuracy": 0.8162610396742821, "num_tokens": 38942573.0, "step": 19600 }, { "entropy": 0.7282956473529338, "epoch": 0.3522701755961737, "grad_norm": 6.25, "learning_rate": 3.7016286238226067e-05, "loss": 0.7041528701782227, "mean_token_accuracy": 0.8238245025277138, "num_tokens": 38961629.0, "step": 19610 }, { "entropy": 0.7249262992292642, "epoch": 0.3524498136255445, "grad_norm": 5.4375, "learning_rate": 3.7003685936506215e-05, "loss": 0.7533349990844727, "mean_token_accuracy": 0.8187106624245644, "num_tokens": 38981060.0, "step": 19620 }, { "entropy": 0.7481336526572704, "epoch": 0.3526294516549153, "grad_norm": 5.28125, "learning_rate": 3.699108167065546e-05, "loss": 0.7613324642181396, "mean_token_accuracy": 0.813330452144146, "num_tokens": 39001040.0, "step": 19630 }, { "entropy": 0.7565899334847928, "epoch": 0.35280908968428615, "grad_norm": 6.09375, "learning_rate": 3.697847344483629e-05, "loss": 0.7764715671539306, "mean_token_accuracy": 0.8162884220480919, "num_tokens": 39021544.0, "step": 19640 }, { "entropy": 0.7485118616372347, "epoch": 0.35298872771365697, "grad_norm": 5.125, "learning_rate": 3.696586126321248e-05, "loss": 0.6814226150512696, "mean_token_accuracy": 0.8276503384113312, "num_tokens": 39041079.0, "step": 19650 }, { "entropy": 0.7217489499598742, "epoch": 0.3531683657430278, "grad_norm": 5.6875, "learning_rate": 3.6953245129949085e-05, "loss": 0.749444580078125, "mean_token_accuracy": 0.8240980982780457, "num_tokens": 39060446.0, "step": 19660 }, { "entropy": 0.6897683598101139, "epoch": 0.3533480037723986, "grad_norm": 4.625, "learning_rate": 3.694062504921253e-05, "loss": 0.6841042518615723, "mean_token_accuracy": 0.8274684309959411, "num_tokens": 39081505.0, "step": 19670 }, { "entropy": 0.6393590599298478, "epoch": 0.35352764180176943, "grad_norm": 6.09375, "learning_rate": 3.692800102517047e-05, "loss": 0.6473001003265381, "mean_token_accuracy": 0.8371409267187119, "num_tokens": 39100466.0, "step": 19680 }, { "entropy": 0.7079867459833622, "epoch": 0.35370727983114025, "grad_norm": 6.53125, "learning_rate": 3.691537306199193e-05, "loss": 0.7407841682434082, "mean_token_accuracy": 0.8245193272829056, "num_tokens": 39122009.0, "step": 19690 }, { "entropy": 0.6577744990587234, "epoch": 0.3538869178605111, "grad_norm": 5.8125, "learning_rate": 3.690274116384719e-05, "loss": 0.649692153930664, "mean_token_accuracy": 0.8371589824557304, "num_tokens": 39141733.0, "step": 19700 }, { "entropy": 0.7200697928667068, "epoch": 0.3540665558898819, "grad_norm": 7.40625, "learning_rate": 3.6890105334907843e-05, "loss": 0.7775652885437012, "mean_token_accuracy": 0.8101379722356796, "num_tokens": 39161180.0, "step": 19710 }, { "entropy": 0.6804958343505859, "epoch": 0.3542461939192527, "grad_norm": 5.0, "learning_rate": 3.687746557934677e-05, "loss": 0.6561213970184326, "mean_token_accuracy": 0.8360828205943107, "num_tokens": 39181958.0, "step": 19720 }, { "entropy": 0.7525444965809583, "epoch": 0.35442583194862354, "grad_norm": 6.59375, "learning_rate": 3.686482190133818e-05, "loss": 0.7912158489227294, "mean_token_accuracy": 0.8218772232532501, "num_tokens": 39202302.0, "step": 19730 }, { "entropy": 0.6691570825874805, "epoch": 0.35460546997799436, "grad_norm": 5.875, "learning_rate": 3.685217430505755e-05, "loss": 0.6586970329284668, "mean_token_accuracy": 0.832605043053627, "num_tokens": 39221488.0, "step": 19740 }, { "entropy": 0.7555838368833065, "epoch": 0.3547851080073652, "grad_norm": 5.59375, "learning_rate": 3.683952279468164e-05, "loss": 0.7917445182800293, "mean_token_accuracy": 0.81813974827528, "num_tokens": 39241628.0, "step": 19750 }, { "entropy": 0.6395846024155617, "epoch": 0.354964746036736, "grad_norm": 6.4375, "learning_rate": 3.6826867374388543e-05, "loss": 0.6577080249786377, "mean_token_accuracy": 0.8358124822378159, "num_tokens": 39260693.0, "step": 19760 }, { "entropy": 0.6996312208473683, "epoch": 0.3551443840661068, "grad_norm": 6.03125, "learning_rate": 3.681420804835761e-05, "loss": 0.6488876819610596, "mean_token_accuracy": 0.8398793131113053, "num_tokens": 39281467.0, "step": 19770 }, { "entropy": 0.6990426421165467, "epoch": 0.3553240220954776, "grad_norm": 5.71875, "learning_rate": 3.68015448207695e-05, "loss": 0.7335831642150878, "mean_token_accuracy": 0.821978397667408, "num_tokens": 39301169.0, "step": 19780 }, { "entropy": 0.7376824270933866, "epoch": 0.3555036601248484, "grad_norm": 5.65625, "learning_rate": 3.6788877695806144e-05, "loss": 0.7520842552185059, "mean_token_accuracy": 0.8214549958705902, "num_tokens": 39321292.0, "step": 19790 }, { "entropy": 0.6470536831766367, "epoch": 0.35568329815421923, "grad_norm": 5.3125, "learning_rate": 3.677620667765078e-05, "loss": 0.6641606330871582, "mean_token_accuracy": 0.8322773054242134, "num_tokens": 39341290.0, "step": 19800 }, { "entropy": 0.7078388050198555, "epoch": 0.35586293618359005, "grad_norm": 7.09375, "learning_rate": 3.6763531770487894e-05, "loss": 0.72921781539917, "mean_token_accuracy": 0.8244057804346084, "num_tokens": 39361365.0, "step": 19810 }, { "entropy": 0.8154718972742557, "epoch": 0.35604257421296087, "grad_norm": 6.46875, "learning_rate": 3.675085297850332e-05, "loss": 0.8529019355773926, "mean_token_accuracy": 0.8069949239492417, "num_tokens": 39381863.0, "step": 19820 }, { "entropy": 0.68941012583673, "epoch": 0.3562222122423317, "grad_norm": 5.46875, "learning_rate": 3.673817030588411e-05, "loss": 0.6655060768127441, "mean_token_accuracy": 0.8340241625905037, "num_tokens": 39402349.0, "step": 19830 }, { "entropy": 0.7359036855399609, "epoch": 0.3564018502717025, "grad_norm": 7.0, "learning_rate": 3.672548375681864e-05, "loss": 0.6846307754516602, "mean_token_accuracy": 0.8293835997581482, "num_tokens": 39422871.0, "step": 19840 }, { "entropy": 0.7430458717048168, "epoch": 0.35658148830107333, "grad_norm": 8.75, "learning_rate": 3.6712793335496536e-05, "loss": 0.8190174102783203, "mean_token_accuracy": 0.8075822867453099, "num_tokens": 39442900.0, "step": 19850 }, { "entropy": 0.6816018588840962, "epoch": 0.35676112633044416, "grad_norm": 3.875, "learning_rate": 3.6700099046108735e-05, "loss": 0.6835995197296143, "mean_token_accuracy": 0.8273237034678459, "num_tokens": 39462698.0, "step": 19860 }, { "entropy": 0.7785143665969372, "epoch": 0.356940764359815, "grad_norm": 5.84375, "learning_rate": 3.668740089284743e-05, "loss": 0.791728162765503, "mean_token_accuracy": 0.8137085393071175, "num_tokens": 39482219.0, "step": 19870 }, { "entropy": 0.6846207953989506, "epoch": 0.3571204023891858, "grad_norm": 4.71875, "learning_rate": 3.66746988799061e-05, "loss": 0.6944001197814942, "mean_token_accuracy": 0.8188466727733612, "num_tokens": 39502012.0, "step": 19880 }, { "entropy": 0.8880552910268307, "epoch": 0.3573000404185566, "grad_norm": 6.71875, "learning_rate": 3.6661993011479475e-05, "loss": 0.9361356735229492, "mean_token_accuracy": 0.791209614276886, "num_tokens": 39521430.0, "step": 19890 }, { "entropy": 0.7826593890786171, "epoch": 0.35747967844792744, "grad_norm": 4.9375, "learning_rate": 3.6649283291763584e-05, "loss": 0.7490047931671142, "mean_token_accuracy": 0.8159813627600669, "num_tokens": 39542135.0, "step": 19900 }, { "entropy": 0.7004616983234883, "epoch": 0.35765931647729826, "grad_norm": 6.84375, "learning_rate": 3.6636569724955736e-05, "loss": 0.7144822597503662, "mean_token_accuracy": 0.8229681357741356, "num_tokens": 39561941.0, "step": 19910 }, { "entropy": 0.7251121565699578, "epoch": 0.3578389545066691, "grad_norm": 5.90625, "learning_rate": 3.662385231525447e-05, "loss": 0.7363756179809571, "mean_token_accuracy": 0.8226905658841133, "num_tokens": 39581015.0, "step": 19920 }, { "entropy": 0.6704909421503544, "epoch": 0.3580185925360399, "grad_norm": 4.96875, "learning_rate": 3.661113106685965e-05, "loss": 0.6460696220397949, "mean_token_accuracy": 0.8354404449462891, "num_tokens": 39600564.0, "step": 19930 }, { "entropy": 0.660530687123537, "epoch": 0.3581982305654107, "grad_norm": 5.5625, "learning_rate": 3.659840598397234e-05, "loss": 0.6877734184265136, "mean_token_accuracy": 0.8326182022690773, "num_tokens": 39620032.0, "step": 19940 }, { "entropy": 0.7667974092066288, "epoch": 0.3583778685947815, "grad_norm": 6.15625, "learning_rate": 3.658567707079494e-05, "loss": 0.7793787956237793, "mean_token_accuracy": 0.804989618062973, "num_tokens": 39640175.0, "step": 19950 }, { "entropy": 0.7590945478528738, "epoch": 0.3585575066241523, "grad_norm": 5.5625, "learning_rate": 3.6572944331531064e-05, "loss": 0.7614902973175048, "mean_token_accuracy": 0.8122261539101601, "num_tokens": 39660011.0, "step": 19960 }, { "entropy": 0.7114308450371027, "epoch": 0.35873714465352313, "grad_norm": 5.8125, "learning_rate": 3.6560207770385615e-05, "loss": 0.7441701889038086, "mean_token_accuracy": 0.8226582407951355, "num_tokens": 39679296.0, "step": 19970 }, { "entropy": 0.6666687287390232, "epoch": 0.35891678268289395, "grad_norm": 6.46875, "learning_rate": 3.654746739156474e-05, "loss": 0.681654977798462, "mean_token_accuracy": 0.8284374788403511, "num_tokens": 39699090.0, "step": 19980 }, { "entropy": 0.7235564418137074, "epoch": 0.3590964207122648, "grad_norm": 7.09375, "learning_rate": 3.6534723199275875e-05, "loss": 0.7334863662719726, "mean_token_accuracy": 0.8140013873577118, "num_tokens": 39719927.0, "step": 19990 }, { "epoch": 0.3592760587416356, "eval_entropy": 0.6944533010721207, "eval_loss": 0.6942692995071411, "eval_mean_token_accuracy": 0.8306707270145416, "eval_num_tokens": 39740177.0, "eval_runtime": 40.5397, "eval_samples_per_second": 49.334, "eval_steps_per_second": 6.167, "step": 20000 }, { "entropy": 0.7013344779610634, "epoch": 0.3594556967710064, "grad_norm": 5.71875, "learning_rate": 3.650922339113009e-05, "loss": 0.6944020748138428, "mean_token_accuracy": 0.8249864757061005, "num_tokens": 39760159.0, "step": 20010 }, { "entropy": 0.6237478792667389, "epoch": 0.35963533480037724, "grad_norm": 6.53125, "learning_rate": 3.6496467783694326e-05, "loss": 0.5890854358673095, "mean_token_accuracy": 0.8490129664540291, "num_tokens": 39779550.0, "step": 20020 }, { "entropy": 0.6795018419623375, "epoch": 0.35981497282974806, "grad_norm": 5.15625, "learning_rate": 3.64837083796328e-05, "loss": 0.6895266056060791, "mean_token_accuracy": 0.821311953663826, "num_tokens": 39800849.0, "step": 20030 }, { "entropy": 0.6331407427787781, "epoch": 0.3599946108591189, "grad_norm": 6.8125, "learning_rate": 3.647094518315923e-05, "loss": 0.640320873260498, "mean_token_accuracy": 0.8492522686719894, "num_tokens": 39821414.0, "step": 20040 }, { "entropy": 0.684369832277298, "epoch": 0.3601742488884897, "grad_norm": 4.59375, "learning_rate": 3.6458178198488574e-05, "loss": 0.7153933048248291, "mean_token_accuracy": 0.8293255597352982, "num_tokens": 39842582.0, "step": 20050 }, { "entropy": 0.8237659387290478, "epoch": 0.3603538869178605, "grad_norm": 5.6875, "learning_rate": 3.644540742983703e-05, "loss": 0.861668872833252, "mean_token_accuracy": 0.8008444100618363, "num_tokens": 39861715.0, "step": 20060 }, { "entropy": 0.7737053610384464, "epoch": 0.36053352494723134, "grad_norm": 10.125, "learning_rate": 3.643263288142205e-05, "loss": 0.7810943126678467, "mean_token_accuracy": 0.8098478958010673, "num_tokens": 39881751.0, "step": 20070 }, { "entropy": 0.7501410365104675, "epoch": 0.36071316297660216, "grad_norm": 6.09375, "learning_rate": 3.641985455746235e-05, "loss": 0.7198531150817871, "mean_token_accuracy": 0.8267974510788918, "num_tokens": 39902124.0, "step": 20080 }, { "entropy": 0.7151833653450013, "epoch": 0.360892801005973, "grad_norm": 5.78125, "learning_rate": 3.640707246217785e-05, "loss": 0.712099552154541, "mean_token_accuracy": 0.8209892630577087, "num_tokens": 39921721.0, "step": 20090 }, { "entropy": 0.6613160043954849, "epoch": 0.3610724390353438, "grad_norm": 5.9375, "learning_rate": 3.639428659978978e-05, "loss": 0.6676843643188477, "mean_token_accuracy": 0.8368137508630753, "num_tokens": 39941695.0, "step": 20100 }, { "entropy": 0.6396045289933682, "epoch": 0.3612520770647146, "grad_norm": 4.3125, "learning_rate": 3.638149697452056e-05, "loss": 0.7175408363342285, "mean_token_accuracy": 0.8297272369265556, "num_tokens": 39960680.0, "step": 20110 }, { "entropy": 0.7199223957955837, "epoch": 0.3614317150940854, "grad_norm": 5.90625, "learning_rate": 3.6368703590593876e-05, "loss": 0.7145095825195312, "mean_token_accuracy": 0.8290554374456406, "num_tokens": 39981024.0, "step": 20120 }, { "entropy": 0.765744150429964, "epoch": 0.3616113531234562, "grad_norm": 8.1875, "learning_rate": 3.635590645223465e-05, "loss": 0.7662083625793457, "mean_token_accuracy": 0.8059632152318954, "num_tokens": 40000335.0, "step": 20130 }, { "entropy": 0.6582271385937929, "epoch": 0.36179099115282704, "grad_norm": 5.75, "learning_rate": 3.634310556366905e-05, "loss": 0.6708737373352051, "mean_token_accuracy": 0.8384749323129654, "num_tokens": 40020498.0, "step": 20140 }, { "entropy": 0.7423563003540039, "epoch": 0.36197062918219786, "grad_norm": 5.0625, "learning_rate": 3.633030092912447e-05, "loss": 0.7253873825073243, "mean_token_accuracy": 0.8240020588040352, "num_tokens": 40040171.0, "step": 20150 }, { "entropy": 0.625378180295229, "epoch": 0.3621502672115687, "grad_norm": 4.90625, "learning_rate": 3.631749255282954e-05, "loss": 0.6063027858734131, "mean_token_accuracy": 0.8435919210314751, "num_tokens": 40059885.0, "step": 20160 }, { "entropy": 0.6876794174313545, "epoch": 0.3623299052409395, "grad_norm": 5.40625, "learning_rate": 3.630468043901416e-05, "loss": 0.7047016620635986, "mean_token_accuracy": 0.8221633091568947, "num_tokens": 40080094.0, "step": 20170 }, { "entropy": 0.6922564268112182, "epoch": 0.3625095432703103, "grad_norm": 5.59375, "learning_rate": 3.6291864591909414e-05, "loss": 0.6729543685913086, "mean_token_accuracy": 0.8316970765590668, "num_tokens": 40099321.0, "step": 20180 }, { "entropy": 0.7137661136686801, "epoch": 0.36268918129968114, "grad_norm": 5.625, "learning_rate": 3.6279045015747656e-05, "loss": 0.7086482048034668, "mean_token_accuracy": 0.8198181629180908, "num_tokens": 40118280.0, "step": 20190 }, { "entropy": 0.7512328773736954, "epoch": 0.36286881932905196, "grad_norm": 5.46875, "learning_rate": 3.626622171476246e-05, "loss": 0.7443258762359619, "mean_token_accuracy": 0.818686555325985, "num_tokens": 40137749.0, "step": 20200 }, { "entropy": 0.7105993315577507, "epoch": 0.3630484573584228, "grad_norm": 5.71875, "learning_rate": 3.6253394693188614e-05, "loss": 0.746551513671875, "mean_token_accuracy": 0.8173611864447594, "num_tokens": 40158263.0, "step": 20210 }, { "entropy": 0.7092254210263491, "epoch": 0.3632280953877936, "grad_norm": 9.1875, "learning_rate": 3.624056395526216e-05, "loss": 0.7148334980010986, "mean_token_accuracy": 0.8275555238127709, "num_tokens": 40177840.0, "step": 20220 }, { "entropy": 0.7027041845023632, "epoch": 0.3634077334171644, "grad_norm": 4.34375, "learning_rate": 3.622772950522036e-05, "loss": 0.7142897129058838, "mean_token_accuracy": 0.8278562650084496, "num_tokens": 40198084.0, "step": 20230 }, { "entropy": 0.705822728574276, "epoch": 0.36358737144653525, "grad_norm": 5.15625, "learning_rate": 3.621489134730171e-05, "loss": 0.7521200180053711, "mean_token_accuracy": 0.8146567225456238, "num_tokens": 40217199.0, "step": 20240 }, { "entropy": 0.7429266415536404, "epoch": 0.36376700947590607, "grad_norm": 5.46875, "learning_rate": 3.6202049485745894e-05, "loss": 0.7194550037384033, "mean_token_accuracy": 0.8256473749876022, "num_tokens": 40237375.0, "step": 20250 }, { "entropy": 0.7113359659910202, "epoch": 0.3639466475052769, "grad_norm": 5.40625, "learning_rate": 3.618920392479385e-05, "loss": 0.722438907623291, "mean_token_accuracy": 0.8275696858763695, "num_tokens": 40257209.0, "step": 20260 }, { "entropy": 0.6595685303211212, "epoch": 0.3641262855346477, "grad_norm": 5.625, "learning_rate": 3.617635466868774e-05, "loss": 0.6976892948150635, "mean_token_accuracy": 0.8322662249207496, "num_tokens": 40276219.0, "step": 20270 }, { "entropy": 0.669034144282341, "epoch": 0.36430592356401853, "grad_norm": 5.875, "learning_rate": 3.616350172167094e-05, "loss": 0.6463847160339355, "mean_token_accuracy": 0.8287868216633797, "num_tokens": 40296230.0, "step": 20280 }, { "entropy": 0.7146677948534489, "epoch": 0.3644855615933893, "grad_norm": 4.03125, "learning_rate": 3.6150645087988037e-05, "loss": 0.68258056640625, "mean_token_accuracy": 0.8271263122558594, "num_tokens": 40315585.0, "step": 20290 }, { "entropy": 0.6644920468330383, "epoch": 0.3646651996227601, "grad_norm": 3.953125, "learning_rate": 3.6137784771884836e-05, "loss": 0.6472136974334717, "mean_token_accuracy": 0.8422638654708863, "num_tokens": 40335838.0, "step": 20300 }, { "entropy": 0.6753864359110594, "epoch": 0.36484483765213094, "grad_norm": 5.34375, "learning_rate": 3.612492077760838e-05, "loss": 0.6792931079864502, "mean_token_accuracy": 0.8317681014537811, "num_tokens": 40356436.0, "step": 20310 }, { "entropy": 0.6847208485007286, "epoch": 0.36502447568150176, "grad_norm": 6.0625, "learning_rate": 3.6112053109406896e-05, "loss": 0.7046985626220703, "mean_token_accuracy": 0.8303431078791619, "num_tokens": 40375830.0, "step": 20320 }, { "entropy": 0.6820194914937019, "epoch": 0.3652041137108726, "grad_norm": 7.0625, "learning_rate": 3.609918177152985e-05, "loss": 0.6546438694000244, "mean_token_accuracy": 0.8450311154127121, "num_tokens": 40395857.0, "step": 20330 }, { "entropy": 0.6877770833671093, "epoch": 0.3653837517402434, "grad_norm": 7.09375, "learning_rate": 3.6086306768227906e-05, "loss": 0.6881216049194336, "mean_token_accuracy": 0.8294637113809585, "num_tokens": 40415066.0, "step": 20340 }, { "entropy": 0.7158541504293681, "epoch": 0.3655633897696142, "grad_norm": 7.59375, "learning_rate": 3.607342810375293e-05, "loss": 0.7619421005249023, "mean_token_accuracy": 0.8182507574558258, "num_tokens": 40435507.0, "step": 20350 }, { "entropy": 0.6468711584806442, "epoch": 0.36574302779898504, "grad_norm": 8.1875, "learning_rate": 3.6060545782358026e-05, "loss": 0.682933235168457, "mean_token_accuracy": 0.8350359842181205, "num_tokens": 40455309.0, "step": 20360 }, { "entropy": 0.6519595451653004, "epoch": 0.36592266582835586, "grad_norm": 6.0625, "learning_rate": 3.604765980829747e-05, "loss": 0.6527403831481934, "mean_token_accuracy": 0.8345248341560364, "num_tokens": 40475262.0, "step": 20370 }, { "entropy": 0.7483419723808765, "epoch": 0.3661023038577267, "grad_norm": 5.6875, "learning_rate": 3.603477018582678e-05, "loss": 0.7906387329101563, "mean_token_accuracy": 0.8112152606248856, "num_tokens": 40496653.0, "step": 20380 }, { "entropy": 0.7134924802929163, "epoch": 0.3662819418870975, "grad_norm": 7.09375, "learning_rate": 3.6021876919202644e-05, "loss": 0.6915002822875976, "mean_token_accuracy": 0.8235787972807884, "num_tokens": 40517642.0, "step": 20390 }, { "entropy": 0.6885743692517281, "epoch": 0.3664615799164683, "grad_norm": 5.96875, "learning_rate": 3.600898001268298e-05, "loss": 0.7159062385559082, "mean_token_accuracy": 0.8227503642439842, "num_tokens": 40536493.0, "step": 20400 }, { "entropy": 0.7345754653215408, "epoch": 0.36664121794583915, "grad_norm": 7.03125, "learning_rate": 3.59960794705269e-05, "loss": 0.7159864425659179, "mean_token_accuracy": 0.8271230682730675, "num_tokens": 40557248.0, "step": 20410 }, { "entropy": 0.6364628583192825, "epoch": 0.36682085597520997, "grad_norm": 3.953125, "learning_rate": 3.598317529699471e-05, "loss": 0.6005306720733643, "mean_token_accuracy": 0.8479072451591492, "num_tokens": 40577382.0, "step": 20420 }, { "entropy": 0.7025217309594154, "epoch": 0.3670004940045808, "grad_norm": 4.96875, "learning_rate": 3.597026749634792e-05, "loss": 0.7096610069274902, "mean_token_accuracy": 0.8188622146844864, "num_tokens": 40597578.0, "step": 20430 }, { "entropy": 0.6743962246924639, "epoch": 0.3671801320339516, "grad_norm": 6.4375, "learning_rate": 3.5957356072849254e-05, "loss": 0.7003351211547851, "mean_token_accuracy": 0.8283336594700813, "num_tokens": 40616509.0, "step": 20440 }, { "entropy": 0.7375138387084007, "epoch": 0.36735977006332243, "grad_norm": 5.84375, "learning_rate": 3.594444103076259e-05, "loss": 0.7750445365905761, "mean_token_accuracy": 0.8222465500235557, "num_tokens": 40635970.0, "step": 20450 }, { "entropy": 0.7050664879381656, "epoch": 0.3675394080926932, "grad_norm": 7.90625, "learning_rate": 3.593152237435304e-05, "loss": 0.7686359882354736, "mean_token_accuracy": 0.8198610424995423, "num_tokens": 40654679.0, "step": 20460 }, { "entropy": 0.792995760589838, "epoch": 0.367719046122064, "grad_norm": 6.59375, "learning_rate": 3.591860010788691e-05, "loss": 0.8202888488769531, "mean_token_accuracy": 0.8088745936751366, "num_tokens": 40674425.0, "step": 20470 }, { "entropy": 0.7411613710224628, "epoch": 0.36789868415143484, "grad_norm": 6.40625, "learning_rate": 3.590567423563167e-05, "loss": 0.7281792640686036, "mean_token_accuracy": 0.8291094839572907, "num_tokens": 40693753.0, "step": 20480 }, { "entropy": 0.6900273330509663, "epoch": 0.36807832218080566, "grad_norm": 6.03125, "learning_rate": 3.5892744761856e-05, "loss": 0.6661017894744873, "mean_token_accuracy": 0.8430843695998191, "num_tokens": 40713165.0, "step": 20490 }, { "entropy": 0.8103882588446141, "epoch": 0.3682579602101765, "grad_norm": 7.6875, "learning_rate": 3.587981169082977e-05, "loss": 0.8332761764526367, "mean_token_accuracy": 0.8005744189023971, "num_tokens": 40732306.0, "step": 20500 }, { "entropy": 0.7376714583486319, "epoch": 0.3684375982395473, "grad_norm": 9.5, "learning_rate": 3.586687502682402e-05, "loss": 0.7614424705505372, "mean_token_accuracy": 0.8152658015489578, "num_tokens": 40752499.0, "step": 20510 }, { "entropy": 0.661192062497139, "epoch": 0.3686172362689181, "grad_norm": 5.71875, "learning_rate": 3.5853934774111005e-05, "loss": 0.6855201244354248, "mean_token_accuracy": 0.8343196496367454, "num_tokens": 40772307.0, "step": 20520 }, { "entropy": 0.7207657627761364, "epoch": 0.36879687429828895, "grad_norm": 6.6875, "learning_rate": 3.584099093696415e-05, "loss": 0.7796384811401367, "mean_token_accuracy": 0.813531118631363, "num_tokens": 40792695.0, "step": 20530 }, { "entropy": 0.698410940170288, "epoch": 0.36897651232765977, "grad_norm": 3.84375, "learning_rate": 3.582804351965805e-05, "loss": 0.6850183010101318, "mean_token_accuracy": 0.832542960345745, "num_tokens": 40811777.0, "step": 20540 }, { "entropy": 0.7131990224123002, "epoch": 0.3691561503570306, "grad_norm": 5.0, "learning_rate": 3.581509252646851e-05, "loss": 0.6880014419555665, "mean_token_accuracy": 0.8246005326509476, "num_tokens": 40832110.0, "step": 20550 }, { "entropy": 0.6933339335024357, "epoch": 0.3693357883864014, "grad_norm": 6.6875, "learning_rate": 3.58021379616725e-05, "loss": 0.7115252017974854, "mean_token_accuracy": 0.8217625468969345, "num_tokens": 40853350.0, "step": 20560 }, { "entropy": 0.7036506719887257, "epoch": 0.36951542641577223, "grad_norm": 5.6875, "learning_rate": 3.578917982954818e-05, "loss": 0.7371609687805176, "mean_token_accuracy": 0.8202033147215844, "num_tokens": 40872550.0, "step": 20570 }, { "entropy": 0.6599099144339562, "epoch": 0.36969506444514305, "grad_norm": 7.40625, "learning_rate": 3.577621813437485e-05, "loss": 0.6824038982391357, "mean_token_accuracy": 0.8300283327698708, "num_tokens": 40891089.0, "step": 20580 }, { "entropy": 0.6858442336320877, "epoch": 0.3698747024745139, "grad_norm": 5.78125, "learning_rate": 3.576325288043305e-05, "loss": 0.7259114742279053, "mean_token_accuracy": 0.8260356232523918, "num_tokens": 40910666.0, "step": 20590 }, { "entropy": 0.7528995238244534, "epoch": 0.3700543405038847, "grad_norm": 6.59375, "learning_rate": 3.575028407200443e-05, "loss": 0.736287784576416, "mean_token_accuracy": 0.820683453977108, "num_tokens": 40930315.0, "step": 20600 }, { "entropy": 0.7175080262124538, "epoch": 0.3702339785332555, "grad_norm": 7.90625, "learning_rate": 3.5737311713371884e-05, "loss": 0.7299849033355713, "mean_token_accuracy": 0.8204699426889419, "num_tokens": 40949011.0, "step": 20610 }, { "entropy": 0.7660007044672966, "epoch": 0.37041361656262634, "grad_norm": 5.09375, "learning_rate": 3.572433580881942e-05, "loss": 0.7598221778869629, "mean_token_accuracy": 0.8238486498594284, "num_tokens": 40969887.0, "step": 20620 }, { "entropy": 0.7726422816514968, "epoch": 0.3705932545919971, "grad_norm": 5.65625, "learning_rate": 3.571135636263222e-05, "loss": 0.7469907283782959, "mean_token_accuracy": 0.8175657704472542, "num_tokens": 40989996.0, "step": 20630 }, { "entropy": 0.7317269049584866, "epoch": 0.3707728926213679, "grad_norm": 5.5, "learning_rate": 3.569837337909669e-05, "loss": 0.6978418827056885, "mean_token_accuracy": 0.8275679588317871, "num_tokens": 41010153.0, "step": 20640 }, { "entropy": 0.7007546126842499, "epoch": 0.37095253065073874, "grad_norm": 6.65625, "learning_rate": 3.568538686250033e-05, "loss": 0.6966262817382812, "mean_token_accuracy": 0.8213423326611519, "num_tokens": 41029092.0, "step": 20650 }, { "entropy": 0.6580459583550692, "epoch": 0.37113216868010956, "grad_norm": 7.46875, "learning_rate": 3.567239681713187e-05, "loss": 0.6834336280822754, "mean_token_accuracy": 0.8368600651621818, "num_tokens": 41048745.0, "step": 20660 }, { "entropy": 0.6332890424877405, "epoch": 0.3713118067094804, "grad_norm": 8.125, "learning_rate": 3.565940324728116e-05, "loss": 0.7018272876739502, "mean_token_accuracy": 0.8295303642749786, "num_tokens": 41067650.0, "step": 20670 }, { "entropy": 0.6855477657169103, "epoch": 0.3714914447388512, "grad_norm": 8.3125, "learning_rate": 3.564640615723924e-05, "loss": 0.666628360748291, "mean_token_accuracy": 0.8349691465497017, "num_tokens": 41088330.0, "step": 20680 }, { "entropy": 0.7081369586288929, "epoch": 0.371671082768222, "grad_norm": 6.0625, "learning_rate": 3.5633405551298316e-05, "loss": 0.7413527488708496, "mean_token_accuracy": 0.820302052795887, "num_tokens": 41109029.0, "step": 20690 }, { "entropy": 0.6725036777555943, "epoch": 0.37185072079759285, "grad_norm": 4.71875, "learning_rate": 3.562040143375174e-05, "loss": 0.672006893157959, "mean_token_accuracy": 0.8392054289579391, "num_tokens": 41128571.0, "step": 20700 }, { "entropy": 0.7486584067344666, "epoch": 0.37203035882696367, "grad_norm": 7.40625, "learning_rate": 3.5607393808894016e-05, "loss": 0.7569601535797119, "mean_token_accuracy": 0.8119803681969643, "num_tokens": 41148207.0, "step": 20710 }, { "entropy": 0.7085374869406224, "epoch": 0.3722099968563345, "grad_norm": 6.84375, "learning_rate": 3.5594382681020836e-05, "loss": 0.7080005168914795, "mean_token_accuracy": 0.8279252201318741, "num_tokens": 41168933.0, "step": 20720 }, { "entropy": 0.7667396642267704, "epoch": 0.3723896348857053, "grad_norm": 6.8125, "learning_rate": 3.558136805442901e-05, "loss": 0.7845785617828369, "mean_token_accuracy": 0.806319385766983, "num_tokens": 41188641.0, "step": 20730 }, { "entropy": 0.6925453685224057, "epoch": 0.37256927291507613, "grad_norm": 4.375, "learning_rate": 3.556834993341654e-05, "loss": 0.6717335700988769, "mean_token_accuracy": 0.8295074760913849, "num_tokens": 41207707.0, "step": 20740 }, { "entropy": 0.6259505048394203, "epoch": 0.37274891094444695, "grad_norm": 4.34375, "learning_rate": 3.555532832228257e-05, "loss": 0.6191555023193359, "mean_token_accuracy": 0.8462332755327224, "num_tokens": 41227780.0, "step": 20750 }, { "entropy": 0.775537907332182, "epoch": 0.3729285489738178, "grad_norm": 6.34375, "learning_rate": 3.554230322532738e-05, "loss": 0.7648780822753907, "mean_token_accuracy": 0.817702554166317, "num_tokens": 41247434.0, "step": 20760 }, { "entropy": 0.6931198447942734, "epoch": 0.3731081870031886, "grad_norm": 5.03125, "learning_rate": 3.5529274646852425e-05, "loss": 0.6568755626678466, "mean_token_accuracy": 0.8285251230001449, "num_tokens": 41267381.0, "step": 20770 }, { "entropy": 0.5807228919118643, "epoch": 0.3732878250325594, "grad_norm": 6.96875, "learning_rate": 3.551624259116029e-05, "loss": 0.6186048984527588, "mean_token_accuracy": 0.8535513564944267, "num_tokens": 41289015.0, "step": 20780 }, { "entropy": 0.6589427012950182, "epoch": 0.37346746306193024, "grad_norm": 6.78125, "learning_rate": 3.550320706255474e-05, "loss": 0.7088614463806152, "mean_token_accuracy": 0.828295425325632, "num_tokens": 41307776.0, "step": 20790 }, { "entropy": 0.7005051389336586, "epoch": 0.373647101091301, "grad_norm": 5.53125, "learning_rate": 3.549016806534064e-05, "loss": 0.7337851524353027, "mean_token_accuracy": 0.8246641531586647, "num_tokens": 41327389.0, "step": 20800 }, { "entropy": 0.6386764496564865, "epoch": 0.3738267391206718, "grad_norm": 4.5, "learning_rate": 3.5477125603824026e-05, "loss": 0.6172388553619385, "mean_token_accuracy": 0.848934157192707, "num_tokens": 41347016.0, "step": 20810 }, { "entropy": 0.6635836806148291, "epoch": 0.37400637715004265, "grad_norm": 4.8125, "learning_rate": 3.546407968231208e-05, "loss": 0.6792052268981934, "mean_token_accuracy": 0.8319901213049888, "num_tokens": 41366991.0, "step": 20820 }, { "entropy": 0.7323547806590796, "epoch": 0.37418601517941347, "grad_norm": 5.78125, "learning_rate": 3.545103030511314e-05, "loss": 0.6899195671081543, "mean_token_accuracy": 0.8316585719585419, "num_tokens": 41388285.0, "step": 20830 }, { "entropy": 0.6686758436262608, "epoch": 0.3743656532087843, "grad_norm": 6.59375, "learning_rate": 3.5437977476536656e-05, "loss": 0.6565890789031983, "mean_token_accuracy": 0.8307007864117623, "num_tokens": 41408508.0, "step": 20840 }, { "entropy": 0.7113072119653225, "epoch": 0.3745452912381551, "grad_norm": 9.375, "learning_rate": 3.542492120089322e-05, "loss": 0.7894554138183594, "mean_token_accuracy": 0.8116436541080475, "num_tokens": 41428503.0, "step": 20850 }, { "entropy": 0.6463107161223889, "epoch": 0.37472492926752593, "grad_norm": 4.6875, "learning_rate": 3.541186148249459e-05, "loss": 0.6480932235717773, "mean_token_accuracy": 0.8367932558059692, "num_tokens": 41449152.0, "step": 20860 }, { "entropy": 0.6425647713243962, "epoch": 0.37490456729689675, "grad_norm": 7.21875, "learning_rate": 3.539879832565364e-05, "loss": 0.6824722766876221, "mean_token_accuracy": 0.8280842825770378, "num_tokens": 41468498.0, "step": 20870 }, { "entropy": 0.6355410009622574, "epoch": 0.3750842053262676, "grad_norm": 5.5, "learning_rate": 3.538573173468439e-05, "loss": 0.636577558517456, "mean_token_accuracy": 0.8400583997368812, "num_tokens": 41488070.0, "step": 20880 }, { "entropy": 0.7394064828753472, "epoch": 0.3752638433556384, "grad_norm": 7.0625, "learning_rate": 3.537266171390197e-05, "loss": 0.7315902709960938, "mean_token_accuracy": 0.8213183268904686, "num_tokens": 41507345.0, "step": 20890 }, { "entropy": 0.6322452001273632, "epoch": 0.3754434813850092, "grad_norm": 9.4375, "learning_rate": 3.535958826762267e-05, "loss": 0.657258939743042, "mean_token_accuracy": 0.8430497974157334, "num_tokens": 41527834.0, "step": 20900 }, { "entropy": 0.8347547523677349, "epoch": 0.37562311941438004, "grad_norm": 8.25, "learning_rate": 3.53465114001639e-05, "loss": 0.8560379981994629, "mean_token_accuracy": 0.7973290704190731, "num_tokens": 41548289.0, "step": 20910 }, { "entropy": 0.6853037364780903, "epoch": 0.37580275744375086, "grad_norm": 6.21875, "learning_rate": 3.5333431115844205e-05, "loss": 0.6840935707092285, "mean_token_accuracy": 0.8291462883353233, "num_tokens": 41568451.0, "step": 20920 }, { "entropy": 0.7625200234353542, "epoch": 0.3759823954731217, "grad_norm": 6.65625, "learning_rate": 3.532034741898325e-05, "loss": 0.7132830142974853, "mean_token_accuracy": 0.8310846492648125, "num_tokens": 41588340.0, "step": 20930 }, { "entropy": 0.7042336642742157, "epoch": 0.3761620335024925, "grad_norm": 6.46875, "learning_rate": 3.530726031390184e-05, "loss": 0.7298715591430665, "mean_token_accuracy": 0.8205323219299316, "num_tokens": 41609047.0, "step": 20940 }, { "entropy": 0.7789061367511749, "epoch": 0.3763416715318633, "grad_norm": 5.34375, "learning_rate": 3.5294169804921885e-05, "loss": 0.8108373641967773, "mean_token_accuracy": 0.8094974607229233, "num_tokens": 41628103.0, "step": 20950 }, { "entropy": 0.6398904502391816, "epoch": 0.37652130956123414, "grad_norm": 4.84375, "learning_rate": 3.5281075896366445e-05, "loss": 0.63114013671875, "mean_token_accuracy": 0.8428157761693, "num_tokens": 41648200.0, "step": 20960 }, { "entropy": 0.703277637436986, "epoch": 0.3767009475906049, "grad_norm": 6.59375, "learning_rate": 3.526797859255968e-05, "loss": 0.7367339611053467, "mean_token_accuracy": 0.8178547725081444, "num_tokens": 41668428.0, "step": 20970 }, { "entropy": 0.7693057917058468, "epoch": 0.3768805856199757, "grad_norm": 4.90625, "learning_rate": 3.5254877897826874e-05, "loss": 0.7364476203918457, "mean_token_accuracy": 0.8227125436067582, "num_tokens": 41688528.0, "step": 20980 }, { "entropy": 0.7052096277475357, "epoch": 0.37706022364934655, "grad_norm": 5.4375, "learning_rate": 3.524177381649445e-05, "loss": 0.668573522567749, "mean_token_accuracy": 0.8438011229038238, "num_tokens": 41708018.0, "step": 20990 }, { "epoch": 0.37723986167871737, "eval_entropy": 0.6488430182933808, "eval_loss": 0.6855563521385193, "eval_mean_token_accuracy": 0.8325611810684204, "eval_num_tokens": 41728160.0, "eval_runtime": 40.6107, "eval_samples_per_second": 49.248, "eval_steps_per_second": 6.156, "step": 21000 }, { "entropy": 0.685401535127312, "epoch": 0.3774194997080882, "grad_norm": 7.125, "learning_rate": 3.521555551134197e-05, "loss": 0.6980848789215088, "mean_token_accuracy": 0.8320543691515923, "num_tokens": 41747646.0, "step": 21010 }, { "entropy": 0.6122336108237505, "epoch": 0.377599137737459, "grad_norm": 6.875, "learning_rate": 3.520244129618032e-05, "loss": 0.6310426235198975, "mean_token_accuracy": 0.8563805148005486, "num_tokens": 41766901.0, "step": 21020 }, { "entropy": 0.7632059790194035, "epoch": 0.37777877576682983, "grad_norm": 8.5, "learning_rate": 3.5189323711735854e-05, "loss": 0.8137436866760254, "mean_token_accuracy": 0.8099944233894348, "num_tokens": 41786149.0, "step": 21030 }, { "entropy": 0.7002090759575367, "epoch": 0.37795841379620065, "grad_norm": 4.90625, "learning_rate": 3.517620276234056e-05, "loss": 0.6996436595916748, "mean_token_accuracy": 0.8254104003310203, "num_tokens": 41807072.0, "step": 21040 }, { "entropy": 0.6723452359437943, "epoch": 0.3781380518255715, "grad_norm": 5.1875, "learning_rate": 3.516307845232755e-05, "loss": 0.6553958892822266, "mean_token_accuracy": 0.8418293669819832, "num_tokens": 41827055.0, "step": 21050 }, { "entropy": 0.7408423908054829, "epoch": 0.3783176898549423, "grad_norm": 5.1875, "learning_rate": 3.514995078603102e-05, "loss": 0.7837141036987305, "mean_token_accuracy": 0.7975616917014122, "num_tokens": 41847147.0, "step": 21060 }, { "entropy": 0.7634066000580788, "epoch": 0.3784973278843131, "grad_norm": 6.84375, "learning_rate": 3.513681976778629e-05, "loss": 0.768970251083374, "mean_token_accuracy": 0.8190920308232308, "num_tokens": 41866899.0, "step": 21070 }, { "entropy": 0.645480614900589, "epoch": 0.37867696591368394, "grad_norm": 5.5, "learning_rate": 3.512368540192979e-05, "loss": 0.6082379341125488, "mean_token_accuracy": 0.8418129622936249, "num_tokens": 41886739.0, "step": 21080 }, { "entropy": 0.6537938177585602, "epoch": 0.37885660394305476, "grad_norm": 8.25, "learning_rate": 3.5110547692799026e-05, "loss": 0.6309549808502197, "mean_token_accuracy": 0.8478370845317841, "num_tokens": 41907319.0, "step": 21090 }, { "entropy": 0.6578036092221737, "epoch": 0.3790362419724256, "grad_norm": 6.1875, "learning_rate": 3.5097406644732664e-05, "loss": 0.6945337772369384, "mean_token_accuracy": 0.8212285339832306, "num_tokens": 41926696.0, "step": 21100 }, { "entropy": 0.7340669080615043, "epoch": 0.3792158800017964, "grad_norm": 4.9375, "learning_rate": 3.508426226207043e-05, "loss": 0.7506400585174561, "mean_token_accuracy": 0.817342446744442, "num_tokens": 41945922.0, "step": 21110 }, { "entropy": 0.6796356346458197, "epoch": 0.3793955180311672, "grad_norm": 6.53125, "learning_rate": 3.5071114549153166e-05, "loss": 0.699470043182373, "mean_token_accuracy": 0.8282402493059635, "num_tokens": 41965065.0, "step": 21120 }, { "entropy": 0.7802211627364158, "epoch": 0.379575156060538, "grad_norm": 9.0, "learning_rate": 3.505796351032279e-05, "loss": 0.8359064102172852, "mean_token_accuracy": 0.8052878767251969, "num_tokens": 41984673.0, "step": 21130 }, { "entropy": 0.6757221980020404, "epoch": 0.3797547940899088, "grad_norm": 3.25, "learning_rate": 3.504480914992235e-05, "loss": 0.6891399383544922, "mean_token_accuracy": 0.8288613453507423, "num_tokens": 42005196.0, "step": 21140 }, { "entropy": 0.6448501594364643, "epoch": 0.37993443211927963, "grad_norm": 6.5625, "learning_rate": 3.503165147229599e-05, "loss": 0.6328178882598877, "mean_token_accuracy": 0.838468787074089, "num_tokens": 42025158.0, "step": 21150 }, { "entropy": 0.6921123370528222, "epoch": 0.38011407014865045, "grad_norm": 4.1875, "learning_rate": 3.501849048178892e-05, "loss": 0.6879634380340576, "mean_token_accuracy": 0.8307283446192741, "num_tokens": 42044844.0, "step": 21160 }, { "entropy": 0.7336290996521712, "epoch": 0.3802937081780213, "grad_norm": 5.34375, "learning_rate": 3.500532618274748e-05, "loss": 0.7146403312683105, "mean_token_accuracy": 0.8240015953779221, "num_tokens": 42064728.0, "step": 21170 }, { "entropy": 0.6398572064936161, "epoch": 0.3804733462073921, "grad_norm": 7.625, "learning_rate": 3.499215857951906e-05, "loss": 0.6443054676055908, "mean_token_accuracy": 0.8377064347267151, "num_tokens": 42083813.0, "step": 21180 }, { "entropy": 0.6949018970131874, "epoch": 0.3806529842367629, "grad_norm": 8.3125, "learning_rate": 3.497898767645219e-05, "loss": 0.7198577404022217, "mean_token_accuracy": 0.815118819475174, "num_tokens": 42103212.0, "step": 21190 }, { "entropy": 0.7099394038319587, "epoch": 0.38083262226613374, "grad_norm": 3.421875, "learning_rate": 3.496581347789646e-05, "loss": 0.711375617980957, "mean_token_accuracy": 0.8298701912164688, "num_tokens": 42123187.0, "step": 21200 }, { "entropy": 0.6876069072633981, "epoch": 0.38101226029550456, "grad_norm": 7.59375, "learning_rate": 3.4952635988202545e-05, "loss": 0.7006659030914306, "mean_token_accuracy": 0.8265680730342865, "num_tokens": 42142599.0, "step": 21210 }, { "entropy": 0.6791185714304447, "epoch": 0.3811918983248754, "grad_norm": 4.875, "learning_rate": 3.4939455211722224e-05, "loss": 0.7223628520965576, "mean_token_accuracy": 0.8260677263140679, "num_tokens": 42161820.0, "step": 21220 }, { "entropy": 0.6870696507394314, "epoch": 0.3813715363542462, "grad_norm": 4.8125, "learning_rate": 3.492627115280836e-05, "loss": 0.734947919845581, "mean_token_accuracy": 0.8313745379447937, "num_tokens": 42181353.0, "step": 21230 }, { "entropy": 0.7005032584071159, "epoch": 0.381551174383617, "grad_norm": 7.59375, "learning_rate": 3.491308381581489e-05, "loss": 0.7267261505126953, "mean_token_accuracy": 0.8278243407607079, "num_tokens": 42201403.0, "step": 21240 }, { "entropy": 0.7523579679429531, "epoch": 0.38173081241298784, "grad_norm": 5.90625, "learning_rate": 3.489989320509682e-05, "loss": 0.7507474422454834, "mean_token_accuracy": 0.8187444761395455, "num_tokens": 42220674.0, "step": 21250 }, { "entropy": 0.7516706213355064, "epoch": 0.38191045044235866, "grad_norm": 7.34375, "learning_rate": 3.4886699325010265e-05, "loss": 0.768617820739746, "mean_token_accuracy": 0.817050164937973, "num_tokens": 42240755.0, "step": 21260 }, { "entropy": 0.7213110692799092, "epoch": 0.3820900884717295, "grad_norm": 7.78125, "learning_rate": 3.487350217991242e-05, "loss": 0.7076373100280762, "mean_token_accuracy": 0.83057651668787, "num_tokens": 42260267.0, "step": 21270 }, { "entropy": 0.7579997472465039, "epoch": 0.3822697265011003, "grad_norm": 6.5625, "learning_rate": 3.486030177416153e-05, "loss": 0.7041111946105957, "mean_token_accuracy": 0.8322078928351402, "num_tokens": 42281265.0, "step": 21280 }, { "entropy": 0.7179070495069027, "epoch": 0.3824493645304711, "grad_norm": 5.15625, "learning_rate": 3.484709811211695e-05, "loss": 0.6804269313812256, "mean_token_accuracy": 0.8361951395869255, "num_tokens": 42300232.0, "step": 21290 }, { "entropy": 0.722075591981411, "epoch": 0.3826290025598419, "grad_norm": 6.09375, "learning_rate": 3.483389119813909e-05, "loss": 0.8238638877868653, "mean_token_accuracy": 0.808764573931694, "num_tokens": 42319913.0, "step": 21300 }, { "entropy": 0.6796317979693413, "epoch": 0.3828086405892127, "grad_norm": 4.53125, "learning_rate": 3.482068103658942e-05, "loss": 0.6493636131286621, "mean_token_accuracy": 0.8387590900063515, "num_tokens": 42339530.0, "step": 21310 }, { "entropy": 0.5769486486911773, "epoch": 0.38298827861858353, "grad_norm": 4.75, "learning_rate": 3.480746763183053e-05, "loss": 0.557643461227417, "mean_token_accuracy": 0.8530028179287911, "num_tokens": 42359621.0, "step": 21320 }, { "entropy": 0.7712953083217144, "epoch": 0.38316791664795435, "grad_norm": 6.84375, "learning_rate": 3.479425098822604e-05, "loss": 0.8029804229736328, "mean_token_accuracy": 0.8159344509243965, "num_tokens": 42379493.0, "step": 21330 }, { "entropy": 0.749280133843422, "epoch": 0.3833475546773252, "grad_norm": 5.5625, "learning_rate": 3.4781031110140646e-05, "loss": 0.7428476333618164, "mean_token_accuracy": 0.815738758444786, "num_tokens": 42400146.0, "step": 21340 }, { "entropy": 0.6972391869872808, "epoch": 0.383527192706696, "grad_norm": 3.9375, "learning_rate": 3.476780800194011e-05, "loss": 0.6858940124511719, "mean_token_accuracy": 0.8398605063557625, "num_tokens": 42421680.0, "step": 21350 }, { "entropy": 0.7181228488683701, "epoch": 0.3837068307360668, "grad_norm": 4.21875, "learning_rate": 3.475458166799129e-05, "loss": 0.7356170177459717, "mean_token_accuracy": 0.8195689767599106, "num_tokens": 42442691.0, "step": 21360 }, { "entropy": 0.7038106553256511, "epoch": 0.38388646876543764, "grad_norm": 6.53125, "learning_rate": 3.474135211266207e-05, "loss": 0.7087418079376221, "mean_token_accuracy": 0.8259187340736389, "num_tokens": 42462515.0, "step": 21370 }, { "entropy": 0.6616566590964794, "epoch": 0.38406610679480846, "grad_norm": 4.34375, "learning_rate": 3.472811934032143e-05, "loss": 0.6580923080444336, "mean_token_accuracy": 0.8408215939998627, "num_tokens": 42481697.0, "step": 21380 }, { "entropy": 0.6362639755010605, "epoch": 0.3842457448241793, "grad_norm": 6.0, "learning_rate": 3.471488335533939e-05, "loss": 0.663828182220459, "mean_token_accuracy": 0.834761281311512, "num_tokens": 42501885.0, "step": 21390 }, { "entropy": 0.6487002413719892, "epoch": 0.3844253828535501, "grad_norm": 4.53125, "learning_rate": 3.470164416208703e-05, "loss": 0.6778441905975342, "mean_token_accuracy": 0.83646130412817, "num_tokens": 42521868.0, "step": 21400 }, { "entropy": 0.7919644050300121, "epoch": 0.3846050208829209, "grad_norm": 6.875, "learning_rate": 3.468840176493651e-05, "loss": 0.8010330200195312, "mean_token_accuracy": 0.8065056562423706, "num_tokens": 42542181.0, "step": 21410 }, { "entropy": 0.7306326061487198, "epoch": 0.38478465891229174, "grad_norm": 7.0, "learning_rate": 3.467515616826104e-05, "loss": 0.7506579875946044, "mean_token_accuracy": 0.8228535532951355, "num_tokens": 42562267.0, "step": 21420 }, { "entropy": 0.7638312131166458, "epoch": 0.38496429694166256, "grad_norm": 7.28125, "learning_rate": 3.466190737643487e-05, "loss": 0.7362929344177246, "mean_token_accuracy": 0.8181168526411057, "num_tokens": 42582569.0, "step": 21430 }, { "entropy": 0.7458190105855464, "epoch": 0.3851439349710334, "grad_norm": 7.3125, "learning_rate": 3.464865539383333e-05, "loss": 0.8107745170593261, "mean_token_accuracy": 0.8001433417201043, "num_tokens": 42603822.0, "step": 21440 }, { "entropy": 0.740352027118206, "epoch": 0.3853235730004042, "grad_norm": 7.09375, "learning_rate": 3.4635400224832784e-05, "loss": 0.7381250381469726, "mean_token_accuracy": 0.8173072606325149, "num_tokens": 42623256.0, "step": 21450 }, { "entropy": 0.7283120695501566, "epoch": 0.38550321102977503, "grad_norm": 5.8125, "learning_rate": 3.462214187381065e-05, "loss": 0.7106196403503418, "mean_token_accuracy": 0.8298001632094383, "num_tokens": 42643838.0, "step": 21460 }, { "entropy": 0.6796266309916973, "epoch": 0.3856828490591458, "grad_norm": 5.9375, "learning_rate": 3.460888034514542e-05, "loss": 0.6561205387115479, "mean_token_accuracy": 0.8299140691757202, "num_tokens": 42663244.0, "step": 21470 }, { "entropy": 0.6110217899084092, "epoch": 0.3858624870885166, "grad_norm": 6.375, "learning_rate": 3.459561564321661e-05, "loss": 0.6209378242492676, "mean_token_accuracy": 0.8427578493952751, "num_tokens": 42682135.0, "step": 21480 }, { "entropy": 0.7800540171563626, "epoch": 0.38604212511788744, "grad_norm": 5.59375, "learning_rate": 3.458234777240479e-05, "loss": 0.8154523849487305, "mean_token_accuracy": 0.8081024348735809, "num_tokens": 42702257.0, "step": 21490 }, { "entropy": 0.6480796031653882, "epoch": 0.38622176314725826, "grad_norm": 6.78125, "learning_rate": 3.456907673709158e-05, "loss": 0.6605803012847901, "mean_token_accuracy": 0.8390386402606964, "num_tokens": 42723596.0, "step": 21500 }, { "entropy": 0.6994588017463684, "epoch": 0.3864014011766291, "grad_norm": 5.15625, "learning_rate": 3.4555802541659644e-05, "loss": 0.6819421291351319, "mean_token_accuracy": 0.8299408167600631, "num_tokens": 42743880.0, "step": 21510 }, { "entropy": 0.6927497975528241, "epoch": 0.3865810392059999, "grad_norm": 7.28125, "learning_rate": 3.45425251904927e-05, "loss": 0.6864865779876709, "mean_token_accuracy": 0.8331621691584588, "num_tokens": 42763940.0, "step": 21520 }, { "entropy": 0.6850131340324879, "epoch": 0.3867606772353707, "grad_norm": 7.375, "learning_rate": 3.452924468797548e-05, "loss": 0.6442245960235595, "mean_token_accuracy": 0.8404936403036117, "num_tokens": 42784356.0, "step": 21530 }, { "entropy": 0.7827148750424385, "epoch": 0.38694031526474154, "grad_norm": 8.1875, "learning_rate": 3.451596103849379e-05, "loss": 0.7670826435089111, "mean_token_accuracy": 0.8089598819613457, "num_tokens": 42804281.0, "step": 21540 }, { "entropy": 0.7187535740435124, "epoch": 0.38711995329411236, "grad_norm": 6.6875, "learning_rate": 3.4502674246434444e-05, "loss": 0.7305371761322021, "mean_token_accuracy": 0.8233100593090057, "num_tokens": 42824583.0, "step": 21550 }, { "entropy": 0.718814817070961, "epoch": 0.3872995913234832, "grad_norm": 6.5, "learning_rate": 3.448938431618532e-05, "loss": 0.771711778640747, "mean_token_accuracy": 0.8186303213238716, "num_tokens": 42844602.0, "step": 21560 }, { "entropy": 0.71777877882123, "epoch": 0.387479229352854, "grad_norm": 4.25, "learning_rate": 3.4476091252135324e-05, "loss": 0.7546377182006836, "mean_token_accuracy": 0.8187700524926186, "num_tokens": 42865399.0, "step": 21570 }, { "entropy": 0.756792512908578, "epoch": 0.3876588673822248, "grad_norm": 8.875, "learning_rate": 3.446279505867438e-05, "loss": 0.7395129203796387, "mean_token_accuracy": 0.8236748024821281, "num_tokens": 42885154.0, "step": 21580 }, { "entropy": 0.6950151212513447, "epoch": 0.38783850541159565, "grad_norm": 7.84375, "learning_rate": 3.4449495740193486e-05, "loss": 0.6975533962249756, "mean_token_accuracy": 0.8226354211568833, "num_tokens": 42904441.0, "step": 21590 }, { "entropy": 0.7311376191675663, "epoch": 0.38801814344096647, "grad_norm": 7.34375, "learning_rate": 3.443619330108462e-05, "loss": 0.7514359951019287, "mean_token_accuracy": 0.8153172314167023, "num_tokens": 42923706.0, "step": 21600 }, { "entropy": 0.6920048259198666, "epoch": 0.3881977814703373, "grad_norm": 5.40625, "learning_rate": 3.442288774574083e-05, "loss": 0.6697358131408692, "mean_token_accuracy": 0.8313635379076004, "num_tokens": 42943242.0, "step": 21610 }, { "entropy": 0.7440321501344442, "epoch": 0.3883774194997081, "grad_norm": 9.6875, "learning_rate": 3.440957907855617e-05, "loss": 0.7557305335998535, "mean_token_accuracy": 0.8166138425469398, "num_tokens": 42962456.0, "step": 21620 }, { "entropy": 0.6744061037898064, "epoch": 0.38855705752907893, "grad_norm": 9.5, "learning_rate": 3.439626730392575e-05, "loss": 0.6839993953704834, "mean_token_accuracy": 0.8325913473963737, "num_tokens": 42981771.0, "step": 21630 }, { "entropy": 0.6937509968876838, "epoch": 0.3887366955584497, "grad_norm": 5.125, "learning_rate": 3.438295242624567e-05, "loss": 0.6781824588775635, "mean_token_accuracy": 0.8350390091538429, "num_tokens": 43001487.0, "step": 21640 }, { "entropy": 0.7251948766410351, "epoch": 0.3889163335878205, "grad_norm": 4.46875, "learning_rate": 3.436963444991309e-05, "loss": 0.6926638603210449, "mean_token_accuracy": 0.8267672210931778, "num_tokens": 43022761.0, "step": 21650 }, { "entropy": 0.6618501082062721, "epoch": 0.38909597161719134, "grad_norm": 6.3125, "learning_rate": 3.435631337932615e-05, "loss": 0.6908493995666504, "mean_token_accuracy": 0.8245184361934662, "num_tokens": 43042096.0, "step": 21660 }, { "entropy": 0.6265833333134652, "epoch": 0.38927560964656216, "grad_norm": 5.125, "learning_rate": 3.434298921888406e-05, "loss": 0.662623929977417, "mean_token_accuracy": 0.8327146396040916, "num_tokens": 43061869.0, "step": 21670 }, { "entropy": 0.7083549693226814, "epoch": 0.389455247675933, "grad_norm": 5.65625, "learning_rate": 3.432966197298702e-05, "loss": 0.7210670471191406, "mean_token_accuracy": 0.8178113684058189, "num_tokens": 43081676.0, "step": 21680 }, { "entropy": 0.7019871361553669, "epoch": 0.3896348857053038, "grad_norm": 7.21875, "learning_rate": 3.431633164603626e-05, "loss": 0.6966697216033936, "mean_token_accuracy": 0.8228415340185166, "num_tokens": 43101399.0, "step": 21690 }, { "entropy": 0.6654799848794937, "epoch": 0.3898145237346746, "grad_norm": 6.8125, "learning_rate": 3.430299824243402e-05, "loss": 0.6256399154663086, "mean_token_accuracy": 0.8519033700227737, "num_tokens": 43121284.0, "step": 21700 }, { "entropy": 0.692875400185585, "epoch": 0.38999416176404544, "grad_norm": 6.0, "learning_rate": 3.428966176658356e-05, "loss": 0.7363029479980469, "mean_token_accuracy": 0.8216084897518158, "num_tokens": 43141299.0, "step": 21710 }, { "entropy": 0.6670462653040886, "epoch": 0.39017379979341626, "grad_norm": 8.6875, "learning_rate": 3.427632222288917e-05, "loss": 0.7002129554748535, "mean_token_accuracy": 0.8275974094867706, "num_tokens": 43162254.0, "step": 21720 }, { "entropy": 0.687794029712677, "epoch": 0.3903534378227871, "grad_norm": 5.28125, "learning_rate": 3.4262979615756106e-05, "loss": 0.743415117263794, "mean_token_accuracy": 0.8172914445400238, "num_tokens": 43183365.0, "step": 21730 }, { "entropy": 0.6906866550445556, "epoch": 0.3905330758521579, "grad_norm": 6.375, "learning_rate": 3.42496339495907e-05, "loss": 0.7134065628051758, "mean_token_accuracy": 0.8251887768507004, "num_tokens": 43202230.0, "step": 21740 }, { "entropy": 0.6972950875759125, "epoch": 0.39071271388152873, "grad_norm": 6.6875, "learning_rate": 3.423628522880026e-05, "loss": 0.673663854598999, "mean_token_accuracy": 0.8404061913490295, "num_tokens": 43221269.0, "step": 21750 }, { "entropy": 0.6280014872550964, "epoch": 0.39089235191089955, "grad_norm": 7.375, "learning_rate": 3.422293345779309e-05, "loss": 0.6238652229309082, "mean_token_accuracy": 0.851250422000885, "num_tokens": 43240875.0, "step": 21760 }, { "entropy": 0.6681252829730511, "epoch": 0.39107198994027037, "grad_norm": 5.53125, "learning_rate": 3.4209578640978513e-05, "loss": 0.6600646495819091, "mean_token_accuracy": 0.8339387580752373, "num_tokens": 43261344.0, "step": 21770 }, { "entropy": 0.7529622189700603, "epoch": 0.3912516279696412, "grad_norm": 4.5, "learning_rate": 3.4196220782766875e-05, "loss": 0.7635057449340821, "mean_token_accuracy": 0.820761026442051, "num_tokens": 43282661.0, "step": 21780 }, { "entropy": 0.6740679532289505, "epoch": 0.391431265999012, "grad_norm": 8.1875, "learning_rate": 3.4182859887569514e-05, "loss": 0.7343880653381347, "mean_token_accuracy": 0.8247687846422196, "num_tokens": 43301423.0, "step": 21790 }, { "entropy": 0.6474896594882011, "epoch": 0.39161090402838283, "grad_norm": 5.15625, "learning_rate": 3.416949595979876e-05, "loss": 0.6172186851501464, "mean_token_accuracy": 0.8379372462630272, "num_tokens": 43321050.0, "step": 21800 }, { "entropy": 0.7663525573909282, "epoch": 0.3917905420577536, "grad_norm": 5.125, "learning_rate": 3.415612900386795e-05, "loss": 0.7770637512207031, "mean_token_accuracy": 0.8147229582071305, "num_tokens": 43342756.0, "step": 21810 }, { "entropy": 0.6903288178145885, "epoch": 0.3919701800871244, "grad_norm": 5.8125, "learning_rate": 3.414275902419144e-05, "loss": 0.6720218658447266, "mean_token_accuracy": 0.8323619931936264, "num_tokens": 43362577.0, "step": 21820 }, { "entropy": 0.671393821388483, "epoch": 0.39214981811649524, "grad_norm": 5.03125, "learning_rate": 3.4129386025184553e-05, "loss": 0.6806766986846924, "mean_token_accuracy": 0.8317648664116859, "num_tokens": 43382636.0, "step": 21830 }, { "entropy": 0.6655507545918227, "epoch": 0.39232945614586606, "grad_norm": 4.21875, "learning_rate": 3.4116010011263645e-05, "loss": 0.6139698505401612, "mean_token_accuracy": 0.8451815262436867, "num_tokens": 43402011.0, "step": 21840 }, { "entropy": 0.6672481700778008, "epoch": 0.3925090941752369, "grad_norm": 4.53125, "learning_rate": 3.410263098684603e-05, "loss": 0.6430671691894532, "mean_token_accuracy": 0.8357481941580772, "num_tokens": 43421257.0, "step": 21850 }, { "entropy": 0.5748035836964845, "epoch": 0.3926887322046077, "grad_norm": 4.875, "learning_rate": 3.408924895635004e-05, "loss": 0.6040756225585937, "mean_token_accuracy": 0.8473412156105041, "num_tokens": 43441235.0, "step": 21860 }, { "entropy": 0.6708726942539215, "epoch": 0.3928683702339785, "grad_norm": 6.28125, "learning_rate": 3.407586392419501e-05, "loss": 0.6487235069274903, "mean_token_accuracy": 0.8345163777470589, "num_tokens": 43460822.0, "step": 21870 }, { "entropy": 0.6514489538967609, "epoch": 0.39304800826334935, "grad_norm": 5.1875, "learning_rate": 3.406247589480122e-05, "loss": 0.6552809238433838, "mean_token_accuracy": 0.8357023641467094, "num_tokens": 43479995.0, "step": 21880 }, { "entropy": 0.6578537121415138, "epoch": 0.39322764629272017, "grad_norm": 5.4375, "learning_rate": 3.404908487259e-05, "loss": 0.6744859695434571, "mean_token_accuracy": 0.8255391091108322, "num_tokens": 43500845.0, "step": 21890 }, { "entropy": 0.6408430073410273, "epoch": 0.393407284322091, "grad_norm": 7.125, "learning_rate": 3.403569086198362e-05, "loss": 0.6577876567840576, "mean_token_accuracy": 0.8369144916534423, "num_tokens": 43520227.0, "step": 21900 }, { "entropy": 0.6405914753675461, "epoch": 0.3935869223514618, "grad_norm": 4.46875, "learning_rate": 3.4022293867405366e-05, "loss": 0.6383644580841065, "mean_token_accuracy": 0.8361352548003197, "num_tokens": 43541165.0, "step": 21910 }, { "entropy": 0.7254486445337534, "epoch": 0.39376656038083263, "grad_norm": 6.53125, "learning_rate": 3.400889389327948e-05, "loss": 0.7279854774475097, "mean_token_accuracy": 0.828614880144596, "num_tokens": 43560236.0, "step": 21920 }, { "entropy": 0.6784035690128803, "epoch": 0.39394619841020345, "grad_norm": 6.875, "learning_rate": 3.399549094403124e-05, "loss": 0.7065106391906738, "mean_token_accuracy": 0.8331379547715188, "num_tokens": 43579568.0, "step": 21930 }, { "entropy": 0.6221677821129561, "epoch": 0.3941258364395743, "grad_norm": 6.90625, "learning_rate": 3.3982085024086846e-05, "loss": 0.6614912509918213, "mean_token_accuracy": 0.8389544501900673, "num_tokens": 43598805.0, "step": 21940 }, { "entropy": 0.7338356442749501, "epoch": 0.3943054744689451, "grad_norm": 6.65625, "learning_rate": 3.396867613787352e-05, "loss": 0.7375948429107666, "mean_token_accuracy": 0.8159846365451813, "num_tokens": 43619071.0, "step": 21950 }, { "entropy": 0.7576738998293877, "epoch": 0.3944851124983159, "grad_norm": 6.40625, "learning_rate": 3.395526428981944e-05, "loss": 0.7416477680206299, "mean_token_accuracy": 0.8244003638625145, "num_tokens": 43640629.0, "step": 21960 }, { "entropy": 0.6696250911802053, "epoch": 0.39466475052768674, "grad_norm": 5.96875, "learning_rate": 3.394184948435379e-05, "loss": 0.6080710411071777, "mean_token_accuracy": 0.8495638355612755, "num_tokens": 43659640.0, "step": 21970 }, { "entropy": 0.5898547060787678, "epoch": 0.3948443885570575, "grad_norm": 9.5, "learning_rate": 3.392843172590669e-05, "loss": 0.5898168563842774, "mean_token_accuracy": 0.8504234462976455, "num_tokens": 43679856.0, "step": 21980 }, { "entropy": 0.7593280732631683, "epoch": 0.3950240265864283, "grad_norm": 6.15625, "learning_rate": 3.391501101890927e-05, "loss": 0.8135687828063964, "mean_token_accuracy": 0.8096916928887368, "num_tokens": 43698471.0, "step": 21990 }, { "epoch": 0.39520366461579914, "eval_entropy": 0.6558015918135643, "eval_loss": 0.673142671585083, "eval_mean_token_accuracy": 0.8351366941928864, "eval_num_tokens": 43719262.0, "eval_runtime": 40.4837, "eval_samples_per_second": 49.403, "eval_steps_per_second": 6.175, "step": 22000 }, { "entropy": 0.7241968221962451, "epoch": 0.39538330264516997, "grad_norm": 5.84375, "learning_rate": 3.388816077699281e-05, "loss": 0.7623065948486328, "mean_token_accuracy": 0.819486765563488, "num_tokens": 43739976.0, "step": 22010 }, { "entropy": 0.6493478201329708, "epoch": 0.3955629406745408, "grad_norm": 5.46875, "learning_rate": 3.387473125094087e-05, "loss": 0.6746752738952637, "mean_token_accuracy": 0.8314756393432617, "num_tokens": 43760308.0, "step": 22020 }, { "entropy": 0.6624151483178139, "epoch": 0.3957425787039116, "grad_norm": 4.8125, "learning_rate": 3.386129879407281e-05, "loss": 0.671884822845459, "mean_token_accuracy": 0.8360084101557732, "num_tokens": 43779747.0, "step": 22030 }, { "entropy": 0.6607727073132992, "epoch": 0.39592221673328243, "grad_norm": 5.5, "learning_rate": 3.384786341082459e-05, "loss": 0.645862627029419, "mean_token_accuracy": 0.8417955219745636, "num_tokens": 43799610.0, "step": 22040 }, { "entropy": 0.7024108413606882, "epoch": 0.39610185476265325, "grad_norm": 5.28125, "learning_rate": 3.383442510563316e-05, "loss": 0.6677959442138672, "mean_token_accuracy": 0.8274481117725372, "num_tokens": 43820592.0, "step": 22050 }, { "entropy": 0.6819233074784279, "epoch": 0.39628149279202407, "grad_norm": 4.65625, "learning_rate": 3.382098388293642e-05, "loss": 0.7044548034667969, "mean_token_accuracy": 0.82572370916605, "num_tokens": 43840837.0, "step": 22060 }, { "entropy": 0.6408405773341656, "epoch": 0.3964611308213949, "grad_norm": 5.28125, "learning_rate": 3.3807539747173236e-05, "loss": 0.623042631149292, "mean_token_accuracy": 0.8414137437939644, "num_tokens": 43860241.0, "step": 22070 }, { "entropy": 0.6417080465704202, "epoch": 0.3966407688507657, "grad_norm": 5.625, "learning_rate": 3.3794092702783426e-05, "loss": 0.6433993339538574, "mean_token_accuracy": 0.8341434553265572, "num_tokens": 43879191.0, "step": 22080 }, { "entropy": 0.6420730002224445, "epoch": 0.39682040688013653, "grad_norm": 6.25, "learning_rate": 3.37806427542078e-05, "loss": 0.6256831645965576, "mean_token_accuracy": 0.8470543757081032, "num_tokens": 43898693.0, "step": 22090 }, { "entropy": 0.6462625682353973, "epoch": 0.39700004490950735, "grad_norm": 7.40625, "learning_rate": 3.37671899058881e-05, "loss": 0.6173986911773681, "mean_token_accuracy": 0.8404306560754776, "num_tokens": 43919459.0, "step": 22100 }, { "entropy": 0.7910645864903927, "epoch": 0.3971796829388782, "grad_norm": 8.375, "learning_rate": 3.3753734162267025e-05, "loss": 0.7814685821533203, "mean_token_accuracy": 0.8104552209377289, "num_tokens": 43938663.0, "step": 22110 }, { "entropy": 0.6860839754343033, "epoch": 0.397359320968249, "grad_norm": 7.125, "learning_rate": 3.3740275527788247e-05, "loss": 0.7195610523223877, "mean_token_accuracy": 0.8275859281420708, "num_tokens": 43958629.0, "step": 22120 }, { "entropy": 0.6875795148313045, "epoch": 0.3975389589976198, "grad_norm": 5.84375, "learning_rate": 3.3726814006896375e-05, "loss": 0.7132916450500488, "mean_token_accuracy": 0.8207760348916053, "num_tokens": 43978071.0, "step": 22130 }, { "entropy": 0.6830442637205124, "epoch": 0.39771859702699064, "grad_norm": 8.0, "learning_rate": 3.3713349604036984e-05, "loss": 0.7069227695465088, "mean_token_accuracy": 0.8318000227212906, "num_tokens": 43997192.0, "step": 22140 }, { "entropy": 0.6524615310132503, "epoch": 0.3978982350563614, "grad_norm": 6.25, "learning_rate": 3.36998823236566e-05, "loss": 0.6561416149139404, "mean_token_accuracy": 0.8385264322161674, "num_tokens": 44016078.0, "step": 22150 }, { "entropy": 0.612352479249239, "epoch": 0.3980778730857322, "grad_norm": 4.78125, "learning_rate": 3.368641217020268e-05, "loss": 0.6088404178619384, "mean_token_accuracy": 0.8454895094037056, "num_tokens": 44035660.0, "step": 22160 }, { "entropy": 0.6279764913022519, "epoch": 0.39825751111510305, "grad_norm": 5.75, "learning_rate": 3.3672939148123654e-05, "loss": 0.6485654354095459, "mean_token_accuracy": 0.8316551372408867, "num_tokens": 44056453.0, "step": 22170 }, { "entropy": 0.6700321987271309, "epoch": 0.39843714914447387, "grad_norm": 8.3125, "learning_rate": 3.3659463261868907e-05, "loss": 0.6924183368682861, "mean_token_accuracy": 0.823557086288929, "num_tokens": 44076029.0, "step": 22180 }, { "entropy": 0.6503889881074428, "epoch": 0.3986167871738447, "grad_norm": 6.90625, "learning_rate": 3.364598451588873e-05, "loss": 0.664320707321167, "mean_token_accuracy": 0.8362871915102005, "num_tokens": 44094977.0, "step": 22190 }, { "entropy": 0.6858331218361855, "epoch": 0.3987964252032155, "grad_norm": 6.03125, "learning_rate": 3.3632502914634395e-05, "loss": 0.683863353729248, "mean_token_accuracy": 0.8401730537414551, "num_tokens": 44115534.0, "step": 22200 }, { "entropy": 0.6879073277115821, "epoch": 0.39897606323258633, "grad_norm": 7.875, "learning_rate": 3.361901846255809e-05, "loss": 0.7091107845306397, "mean_token_accuracy": 0.8244135081768036, "num_tokens": 44135521.0, "step": 22210 }, { "entropy": 0.7438757218420505, "epoch": 0.39915570126195715, "grad_norm": 6.1875, "learning_rate": 3.360553116411298e-05, "loss": 0.7478530406951904, "mean_token_accuracy": 0.8174891158938408, "num_tokens": 44155326.0, "step": 22220 }, { "entropy": 0.7605732206255198, "epoch": 0.399335339291328, "grad_norm": 5.21875, "learning_rate": 3.3592041023753126e-05, "loss": 0.8048529624938965, "mean_token_accuracy": 0.8003992080688477, "num_tokens": 44174855.0, "step": 22230 }, { "entropy": 0.6924356527626514, "epoch": 0.3995149773206988, "grad_norm": 4.8125, "learning_rate": 3.3578548045933575e-05, "loss": 0.6906275749206543, "mean_token_accuracy": 0.8295157432556153, "num_tokens": 44195500.0, "step": 22240 }, { "entropy": 0.6545244716107845, "epoch": 0.3996946153500696, "grad_norm": 4.53125, "learning_rate": 3.3565052235110254e-05, "loss": 0.6450164318084717, "mean_token_accuracy": 0.8418580979108811, "num_tokens": 44216116.0, "step": 22250 }, { "entropy": 0.6838923864066601, "epoch": 0.39987425337944044, "grad_norm": 6.25, "learning_rate": 3.355155359574008e-05, "loss": 0.6862600803375244, "mean_token_accuracy": 0.8321245431900024, "num_tokens": 44235391.0, "step": 22260 }, { "entropy": 0.687882962077856, "epoch": 0.40005389140881126, "grad_norm": 5.59375, "learning_rate": 3.3538052132280877e-05, "loss": 0.6652538299560546, "mean_token_accuracy": 0.8352219730615615, "num_tokens": 44256196.0, "step": 22270 }, { "entropy": 0.6697224445641041, "epoch": 0.4002335294381821, "grad_norm": 6.15625, "learning_rate": 3.35245478491914e-05, "loss": 0.7327306270599365, "mean_token_accuracy": 0.8231875389814377, "num_tokens": 44275319.0, "step": 22280 }, { "entropy": 0.6583179734647274, "epoch": 0.4004131674675529, "grad_norm": 4.4375, "learning_rate": 3.3511040750931355e-05, "loss": 0.6128525733947754, "mean_token_accuracy": 0.8432210311293602, "num_tokens": 44295317.0, "step": 22290 }, { "entropy": 0.6696611866354942, "epoch": 0.4005928054969237, "grad_norm": 6.0, "learning_rate": 3.349753084196135e-05, "loss": 0.6502727508544922, "mean_token_accuracy": 0.8459016531705856, "num_tokens": 44315549.0, "step": 22300 }, { "entropy": 0.6934429407119751, "epoch": 0.40077244352629454, "grad_norm": 5.1875, "learning_rate": 3.348401812674294e-05, "loss": 0.6869980812072753, "mean_token_accuracy": 0.8297330781817436, "num_tokens": 44334589.0, "step": 22310 }, { "entropy": 0.5777344413101673, "epoch": 0.4009520815556653, "grad_norm": 5.0, "learning_rate": 3.3470502609738595e-05, "loss": 0.5970641613006592, "mean_token_accuracy": 0.8529870539903641, "num_tokens": 44355100.0, "step": 22320 }, { "entropy": 0.5983030380681157, "epoch": 0.40113171958503613, "grad_norm": 5.0, "learning_rate": 3.345698429541174e-05, "loss": 0.6491535186767579, "mean_token_accuracy": 0.8428195133805275, "num_tokens": 44376101.0, "step": 22330 }, { "entropy": 0.6968772262334824, "epoch": 0.40131135761440695, "grad_norm": 5.6875, "learning_rate": 3.344346318822668e-05, "loss": 0.7004656314849853, "mean_token_accuracy": 0.8284920811653137, "num_tokens": 44395549.0, "step": 22340 }, { "entropy": 0.7113131783902645, "epoch": 0.40149099564377777, "grad_norm": 5.5, "learning_rate": 3.342993929264866e-05, "loss": 0.7103156566619873, "mean_token_accuracy": 0.8222610637545585, "num_tokens": 44414808.0, "step": 22350 }, { "entropy": 0.6783322386443615, "epoch": 0.4016706336731486, "grad_norm": 6.5625, "learning_rate": 3.341641261314386e-05, "loss": 0.7103092193603515, "mean_token_accuracy": 0.8326554521918297, "num_tokens": 44433371.0, "step": 22360 }, { "entropy": 0.698417105525732, "epoch": 0.4018502717025194, "grad_norm": 6.875, "learning_rate": 3.340288315417937e-05, "loss": 0.6647182941436768, "mean_token_accuracy": 0.8376531884074211, "num_tokens": 44453164.0, "step": 22370 }, { "entropy": 0.6952787030488252, "epoch": 0.40202990973189023, "grad_norm": 4.71875, "learning_rate": 3.338935092022319e-05, "loss": 0.7135073661804199, "mean_token_accuracy": 0.8245546475052834, "num_tokens": 44474193.0, "step": 22380 }, { "entropy": 0.805926077067852, "epoch": 0.40220954776126105, "grad_norm": 5.53125, "learning_rate": 3.3375815915744254e-05, "loss": 0.8032584190368652, "mean_token_accuracy": 0.8070807561278344, "num_tokens": 44494379.0, "step": 22390 }, { "entropy": 0.6957412242889405, "epoch": 0.4023891857906319, "grad_norm": 5.84375, "learning_rate": 3.336227814521239e-05, "loss": 0.7394069194793701, "mean_token_accuracy": 0.816690368950367, "num_tokens": 44513991.0, "step": 22400 }, { "entropy": 0.7332220442593098, "epoch": 0.4025688238200027, "grad_norm": 7.1875, "learning_rate": 3.334873761309834e-05, "loss": 0.7164353370666504, "mean_token_accuracy": 0.8268209457397461, "num_tokens": 44534466.0, "step": 22410 }, { "entropy": 0.7292749412357807, "epoch": 0.4027484618493735, "grad_norm": 5.65625, "learning_rate": 3.3335194323873784e-05, "loss": 0.7544412612915039, "mean_token_accuracy": 0.8137175813317299, "num_tokens": 44554688.0, "step": 22420 }, { "entropy": 0.8354973644018173, "epoch": 0.40292809987874434, "grad_norm": 7.59375, "learning_rate": 3.332164828201129e-05, "loss": 0.8762054443359375, "mean_token_accuracy": 0.8022147446870804, "num_tokens": 44574184.0, "step": 22430 }, { "entropy": 0.7801049770787358, "epoch": 0.40310773790811516, "grad_norm": 5.5, "learning_rate": 3.330809949198435e-05, "loss": 0.7766165256500244, "mean_token_accuracy": 0.81794403642416, "num_tokens": 44593140.0, "step": 22440 }, { "entropy": 0.6667418234050274, "epoch": 0.403287375937486, "grad_norm": 4.03125, "learning_rate": 3.329454795826733e-05, "loss": 0.7061066627502441, "mean_token_accuracy": 0.8328410059213638, "num_tokens": 44612913.0, "step": 22450 }, { "entropy": 0.7023803547024727, "epoch": 0.4034670139668568, "grad_norm": 6.25, "learning_rate": 3.3280993685335546e-05, "loss": 0.6761770725250245, "mean_token_accuracy": 0.8256873741745949, "num_tokens": 44633349.0, "step": 22460 }, { "entropy": 0.6428582966327667, "epoch": 0.4036466519962276, "grad_norm": 5.59375, "learning_rate": 3.3267436677665204e-05, "loss": 0.6783720970153808, "mean_token_accuracy": 0.8358080565929413, "num_tokens": 44652771.0, "step": 22470 }, { "entropy": 0.6104120582342147, "epoch": 0.40382629002559844, "grad_norm": 6.90625, "learning_rate": 3.325387693973338e-05, "loss": 0.568636703491211, "mean_token_accuracy": 0.851903049647808, "num_tokens": 44670926.0, "step": 22480 }, { "entropy": 0.6643792770802974, "epoch": 0.4040059280549692, "grad_norm": 8.0625, "learning_rate": 3.324031447601812e-05, "loss": 0.6976274013519287, "mean_token_accuracy": 0.8361451581120491, "num_tokens": 44690911.0, "step": 22490 }, { "entropy": 0.6068355873227119, "epoch": 0.40418556608434003, "grad_norm": 5.5, "learning_rate": 3.32267492909983e-05, "loss": 0.6128767967224121, "mean_token_accuracy": 0.8496202155947685, "num_tokens": 44710635.0, "step": 22500 }, { "entropy": 0.7108094185590744, "epoch": 0.40436520411371085, "grad_norm": 6.375, "learning_rate": 3.321318138915373e-05, "loss": 0.7066905498504639, "mean_token_accuracy": 0.8265850663185119, "num_tokens": 44730342.0, "step": 22510 }, { "entropy": 0.6774210140109063, "epoch": 0.4045448421430817, "grad_norm": 4.8125, "learning_rate": 3.319961077496512e-05, "loss": 0.7050983428955078, "mean_token_accuracy": 0.8301229119300843, "num_tokens": 44750413.0, "step": 22520 }, { "entropy": 0.7404642555862665, "epoch": 0.4047244801724525, "grad_norm": 4.65625, "learning_rate": 3.3186037452914065e-05, "loss": 0.7653717517852783, "mean_token_accuracy": 0.8150559157133103, "num_tokens": 44769818.0, "step": 22530 }, { "entropy": 0.6418867006897926, "epoch": 0.4049041182018233, "grad_norm": 10.3125, "learning_rate": 3.317246142748305e-05, "loss": 0.6636004447937012, "mean_token_accuracy": 0.8357202738523484, "num_tokens": 44789614.0, "step": 22540 }, { "entropy": 0.6306140393018722, "epoch": 0.40508375623119414, "grad_norm": 5.125, "learning_rate": 3.315888270315547e-05, "loss": 0.6421436309814453, "mean_token_accuracy": 0.8493367597460747, "num_tokens": 44809124.0, "step": 22550 }, { "entropy": 0.6423268489539623, "epoch": 0.40526339426056496, "grad_norm": 4.9375, "learning_rate": 3.314530128441559e-05, "loss": 0.6546293735504151, "mean_token_accuracy": 0.8408963426947593, "num_tokens": 44828970.0, "step": 22560 }, { "entropy": 0.7043904002755881, "epoch": 0.4054430322899358, "grad_norm": 5.875, "learning_rate": 3.313171717574858e-05, "loss": 0.7079294681549072, "mean_token_accuracy": 0.832610534131527, "num_tokens": 44848759.0, "step": 22570 }, { "entropy": 0.7322651073336601, "epoch": 0.4056226703193066, "grad_norm": 5.46875, "learning_rate": 3.3118130381640506e-05, "loss": 0.7366083145141602, "mean_token_accuracy": 0.8156790941953659, "num_tokens": 44867911.0, "step": 22580 }, { "entropy": 0.6543777473270893, "epoch": 0.4058023083486774, "grad_norm": 7.15625, "learning_rate": 3.310454090657828e-05, "loss": 0.6609643459320068, "mean_token_accuracy": 0.8365061476826667, "num_tokens": 44888307.0, "step": 22590 }, { "entropy": 0.697276008501649, "epoch": 0.40598194637804824, "grad_norm": 6.5, "learning_rate": 3.3090948755049774e-05, "loss": 0.7440574645996094, "mean_token_accuracy": 0.8174171894788742, "num_tokens": 44908101.0, "step": 22600 }, { "entropy": 0.5557753995060921, "epoch": 0.40616158440741906, "grad_norm": 4.1875, "learning_rate": 3.3077353931543655e-05, "loss": 0.5601234436035156, "mean_token_accuracy": 0.8668026849627495, "num_tokens": 44928837.0, "step": 22610 }, { "entropy": 0.709277143701911, "epoch": 0.4063412224367899, "grad_norm": 7.1875, "learning_rate": 3.306375644054954e-05, "loss": 0.7436286926269531, "mean_token_accuracy": 0.8214550584554672, "num_tokens": 44948537.0, "step": 22620 }, { "entropy": 0.6570791564881802, "epoch": 0.4065208604661607, "grad_norm": 4.4375, "learning_rate": 3.3050156286557884e-05, "loss": 0.6490310668945313, "mean_token_accuracy": 0.8325426861643791, "num_tokens": 44968760.0, "step": 22630 }, { "entropy": 0.6308296252042055, "epoch": 0.4067004984955315, "grad_norm": 5.0625, "learning_rate": 3.303655347406005e-05, "loss": 0.6484262466430664, "mean_token_accuracy": 0.8365836650133133, "num_tokens": 44989323.0, "step": 22640 }, { "entropy": 0.6776929520070553, "epoch": 0.40688013652490235, "grad_norm": 6.0, "learning_rate": 3.302294800754828e-05, "loss": 0.677354383468628, "mean_token_accuracy": 0.8280426368117333, "num_tokens": 45009314.0, "step": 22650 }, { "entropy": 0.7251378327608109, "epoch": 0.4070597745542731, "grad_norm": 4.8125, "learning_rate": 3.300933989151566e-05, "loss": 0.72687668800354, "mean_token_accuracy": 0.8290361434221267, "num_tokens": 45029529.0, "step": 22660 }, { "entropy": 0.7583900839090347, "epoch": 0.40723941258364393, "grad_norm": 5.59375, "learning_rate": 3.2995729130456185e-05, "loss": 0.8117211341857911, "mean_token_accuracy": 0.808470395207405, "num_tokens": 45050530.0, "step": 22670 }, { "entropy": 0.7688450172543526, "epoch": 0.40741905061301475, "grad_norm": 7.40625, "learning_rate": 3.2982115728864714e-05, "loss": 0.7603821277618408, "mean_token_accuracy": 0.8212204411625862, "num_tokens": 45070168.0, "step": 22680 }, { "entropy": 0.7614038497209549, "epoch": 0.4075986886423856, "grad_norm": 8.3125, "learning_rate": 3.296849969123696e-05, "loss": 0.7804455280303955, "mean_token_accuracy": 0.8184756860136986, "num_tokens": 45089616.0, "step": 22690 }, { "entropy": 0.6373643200844527, "epoch": 0.4077783266717564, "grad_norm": 7.40625, "learning_rate": 3.295488102206955e-05, "loss": 0.6532629489898681, "mean_token_accuracy": 0.8422436520457268, "num_tokens": 45109399.0, "step": 22700 }, { "entropy": 0.6100007340312004, "epoch": 0.4079579647011272, "grad_norm": 6.0, "learning_rate": 3.294125972585992e-05, "loss": 0.5999004364013671, "mean_token_accuracy": 0.842499227821827, "num_tokens": 45128804.0, "step": 22710 }, { "entropy": 0.6053519256412982, "epoch": 0.40813760273049804, "grad_norm": 5.53125, "learning_rate": 3.292763580710642e-05, "loss": 0.6307381629943848, "mean_token_accuracy": 0.8362287029623985, "num_tokens": 45150081.0, "step": 22720 }, { "entropy": 0.6801414672285319, "epoch": 0.40831724075986886, "grad_norm": 6.09375, "learning_rate": 3.291400927030825e-05, "loss": 0.6554404735565186, "mean_token_accuracy": 0.832933883368969, "num_tokens": 45169850.0, "step": 22730 }, { "entropy": 0.7439732313156128, "epoch": 0.4084968787892397, "grad_norm": 6.53125, "learning_rate": 3.2900380119965466e-05, "loss": 0.8080075263977051, "mean_token_accuracy": 0.8092029258608818, "num_tokens": 45189503.0, "step": 22740 }, { "entropy": 0.6725748501718044, "epoch": 0.4086765168186105, "grad_norm": 5.59375, "learning_rate": 3.288674836057902e-05, "loss": 0.6501432418823242, "mean_token_accuracy": 0.8382540047168732, "num_tokens": 45209829.0, "step": 22750 }, { "entropy": 0.753080402687192, "epoch": 0.4088561548479813, "grad_norm": 7.3125, "learning_rate": 3.2873113996650676e-05, "loss": 0.7526428699493408, "mean_token_accuracy": 0.8169500544667244, "num_tokens": 45228555.0, "step": 22760 }, { "entropy": 0.711393267661333, "epoch": 0.40903579287735214, "grad_norm": 6.78125, "learning_rate": 3.285947703268311e-05, "loss": 0.6784804344177247, "mean_token_accuracy": 0.838080070912838, "num_tokens": 45247888.0, "step": 22770 }, { "entropy": 0.6723963245749474, "epoch": 0.40921543090672297, "grad_norm": 5.75, "learning_rate": 3.2845837473179795e-05, "loss": 0.7027187347412109, "mean_token_accuracy": 0.833698658645153, "num_tokens": 45268022.0, "step": 22780 }, { "entropy": 0.7531605176627636, "epoch": 0.4093950689360938, "grad_norm": 5.21875, "learning_rate": 3.283219532264514e-05, "loss": 0.7299594402313232, "mean_token_accuracy": 0.8188507795333863, "num_tokens": 45289034.0, "step": 22790 }, { "entropy": 0.6526213444769382, "epoch": 0.4095747069654646, "grad_norm": 5.53125, "learning_rate": 3.281855058558434e-05, "loss": 0.6303492069244385, "mean_token_accuracy": 0.843523895740509, "num_tokens": 45308137.0, "step": 22800 }, { "entropy": 0.6062753543257713, "epoch": 0.40975434499483543, "grad_norm": 5.90625, "learning_rate": 3.280490326650348e-05, "loss": 0.6138824462890625, "mean_token_accuracy": 0.8411237925291062, "num_tokens": 45328314.0, "step": 22810 }, { "entropy": 0.6476704373955726, "epoch": 0.40993398302420625, "grad_norm": 7.34375, "learning_rate": 3.279125336990948e-05, "loss": 0.6581060409545898, "mean_token_accuracy": 0.8376688912510872, "num_tokens": 45348715.0, "step": 22820 }, { "entropy": 0.6718829549849034, "epoch": 0.410113621053577, "grad_norm": 6.09375, "learning_rate": 3.2777600900310137e-05, "loss": 0.7055031299591065, "mean_token_accuracy": 0.833826319873333, "num_tokens": 45367995.0, "step": 22830 }, { "entropy": 0.629845866933465, "epoch": 0.41029325908294784, "grad_norm": 6.375, "learning_rate": 3.276394586221407e-05, "loss": 0.6474076747894287, "mean_token_accuracy": 0.8385332003235817, "num_tokens": 45388897.0, "step": 22840 }, { "entropy": 0.7140257030725479, "epoch": 0.41047289711231866, "grad_norm": 6.75, "learning_rate": 3.2750288260130755e-05, "loss": 0.7341724872589112, "mean_token_accuracy": 0.8218767404556274, "num_tokens": 45408007.0, "step": 22850 }, { "entropy": 0.716847138106823, "epoch": 0.4106525351416895, "grad_norm": 6.90625, "learning_rate": 3.273662809857053e-05, "loss": 0.7314211368560791, "mean_token_accuracy": 0.8170238375663758, "num_tokens": 45429022.0, "step": 22860 }, { "entropy": 0.7257310207933187, "epoch": 0.4108321731710603, "grad_norm": 6.53125, "learning_rate": 3.272296538204454e-05, "loss": 0.7288665771484375, "mean_token_accuracy": 0.8246805012226105, "num_tokens": 45449753.0, "step": 22870 }, { "entropy": 0.7496883995831013, "epoch": 0.4110118112004311, "grad_norm": 6.15625, "learning_rate": 3.270930011506482e-05, "loss": 0.7539916038513184, "mean_token_accuracy": 0.814261469244957, "num_tokens": 45470533.0, "step": 22880 }, { "entropy": 0.6454012591391802, "epoch": 0.41119144922980194, "grad_norm": 4.5625, "learning_rate": 3.269563230214422e-05, "loss": 0.6186908721923828, "mean_token_accuracy": 0.838475202023983, "num_tokens": 45490313.0, "step": 22890 }, { "entropy": 0.6866658806800843, "epoch": 0.41137108725917276, "grad_norm": 4.15625, "learning_rate": 3.268196194779644e-05, "loss": 0.6965051651000976, "mean_token_accuracy": 0.8315447926521301, "num_tokens": 45509896.0, "step": 22900 }, { "entropy": 0.6137972973287106, "epoch": 0.4115507252885436, "grad_norm": 5.46875, "learning_rate": 3.2668289056536004e-05, "loss": 0.6033967971801758, "mean_token_accuracy": 0.8553759783506394, "num_tokens": 45530136.0, "step": 22910 }, { "entropy": 0.650493610650301, "epoch": 0.4117303633179144, "grad_norm": 5.8125, "learning_rate": 3.26546136328783e-05, "loss": 0.666453742980957, "mean_token_accuracy": 0.836171281337738, "num_tokens": 45549535.0, "step": 22920 }, { "entropy": 0.733617166429758, "epoch": 0.4119100013472852, "grad_norm": 8.9375, "learning_rate": 3.264093568133954e-05, "loss": 0.7418248653411865, "mean_token_accuracy": 0.8189740777015686, "num_tokens": 45569261.0, "step": 22930 }, { "entropy": 0.6186542198061943, "epoch": 0.41208963937665605, "grad_norm": 7.46875, "learning_rate": 3.2627255206436744e-05, "loss": 0.6323249340057373, "mean_token_accuracy": 0.8455927580595016, "num_tokens": 45588745.0, "step": 22940 }, { "entropy": 0.6665212947875261, "epoch": 0.41226927740602687, "grad_norm": 6.09375, "learning_rate": 3.2613572212687824e-05, "loss": 0.6764096260070801, "mean_token_accuracy": 0.8316299125552178, "num_tokens": 45608895.0, "step": 22950 }, { "entropy": 0.6451776951551438, "epoch": 0.4124489154353977, "grad_norm": 4.21875, "learning_rate": 3.259988670461147e-05, "loss": 0.6428620338439941, "mean_token_accuracy": 0.8476417437195778, "num_tokens": 45628294.0, "step": 22960 }, { "entropy": 0.7484756927937269, "epoch": 0.4126285534647685, "grad_norm": 6.6875, "learning_rate": 3.2586198686727237e-05, "loss": 0.7448271751403809, "mean_token_accuracy": 0.8054756566882133, "num_tokens": 45647797.0, "step": 22970 }, { "entropy": 0.660018665716052, "epoch": 0.41280819149413933, "grad_norm": 6.0, "learning_rate": 3.257250816355547e-05, "loss": 0.7036425590515136, "mean_token_accuracy": 0.8346416994929313, "num_tokens": 45667586.0, "step": 22980 }, { "entropy": 0.6594592332839966, "epoch": 0.41298782952351015, "grad_norm": 6.25, "learning_rate": 3.255881513961739e-05, "loss": 0.6726462841033936, "mean_token_accuracy": 0.8292291700839997, "num_tokens": 45687366.0, "step": 22990 }, { "epoch": 0.4131674675528809, "eval_entropy": 0.6609513915777206, "eval_loss": 0.6571119427680969, "eval_mean_token_accuracy": 0.839023366689682, "eval_num_tokens": 45708492.0, "eval_runtime": 40.548, "eval_samples_per_second": 49.324, "eval_steps_per_second": 6.166, "step": 23000 }, { "entropy": 0.6640272188931704, "epoch": 0.41334710558225174, "grad_norm": 5.4375, "learning_rate": 3.2531421607531165e-05, "loss": 0.6746596336364746, "mean_token_accuracy": 0.8314566947519779, "num_tokens": 45728240.0, "step": 23010 }, { "entropy": 0.6499909503385425, "epoch": 0.41352674361162256, "grad_norm": 7.65625, "learning_rate": 3.251772110842955e-05, "loss": 0.6314692974090577, "mean_token_accuracy": 0.8525784566998482, "num_tokens": 45747909.0, "step": 23020 }, { "entropy": 0.7167673274874687, "epoch": 0.4137063816409934, "grad_norm": 6.9375, "learning_rate": 3.2504018126654636e-05, "loss": 0.7251205444335938, "mean_token_accuracy": 0.8285655096173287, "num_tokens": 45766710.0, "step": 23030 }, { "entropy": 0.6369082137942315, "epoch": 0.4138860196703642, "grad_norm": 5.5625, "learning_rate": 3.249031266673174e-05, "loss": 0.6498454093933106, "mean_token_accuracy": 0.8428271114826202, "num_tokens": 45785833.0, "step": 23040 }, { "entropy": 0.6905918989330531, "epoch": 0.414065657699735, "grad_norm": 5.96875, "learning_rate": 3.2476604733186994e-05, "loss": 0.7275197982788086, "mean_token_accuracy": 0.8224400177597999, "num_tokens": 45807177.0, "step": 23050 }, { "entropy": 0.7335435926914216, "epoch": 0.41424529572910584, "grad_norm": 5.5, "learning_rate": 3.246289433054736e-05, "loss": 0.7611394405364991, "mean_token_accuracy": 0.8114820539951324, "num_tokens": 45827820.0, "step": 23060 }, { "entropy": 0.6114605758339167, "epoch": 0.41442493375847667, "grad_norm": 5.84375, "learning_rate": 3.244918146334056e-05, "loss": 0.6043206214904785, "mean_token_accuracy": 0.848127818107605, "num_tokens": 45846895.0, "step": 23070 }, { "entropy": 0.7020625710487366, "epoch": 0.4146045717878475, "grad_norm": 6.5625, "learning_rate": 3.24354661360952e-05, "loss": 0.7163649082183838, "mean_token_accuracy": 0.8233471050858497, "num_tokens": 45866193.0, "step": 23080 }, { "entropy": 0.7127120420336723, "epoch": 0.4147842098172183, "grad_norm": 5.84375, "learning_rate": 3.242174835334066e-05, "loss": 0.7266265869140625, "mean_token_accuracy": 0.8179249033331871, "num_tokens": 45884912.0, "step": 23090 }, { "entropy": 0.7246527075767517, "epoch": 0.41496384784658913, "grad_norm": 7.90625, "learning_rate": 3.240802811960714e-05, "loss": 0.7663551330566406, "mean_token_accuracy": 0.8252000197768211, "num_tokens": 45904113.0, "step": 23100 }, { "entropy": 0.7118993975222111, "epoch": 0.41514348587595995, "grad_norm": 6.15625, "learning_rate": 3.239430543942565e-05, "loss": 0.7112181186676025, "mean_token_accuracy": 0.8305133000016213, "num_tokens": 45925037.0, "step": 23110 }, { "entropy": 0.6859762005507946, "epoch": 0.41532312390533077, "grad_norm": 4.53125, "learning_rate": 3.2380580317328003e-05, "loss": 0.6995909690856934, "mean_token_accuracy": 0.8377453327178955, "num_tokens": 45944901.0, "step": 23120 }, { "entropy": 0.702526556700468, "epoch": 0.4155027619347016, "grad_norm": 6.34375, "learning_rate": 3.236685275784682e-05, "loss": 0.6959921360015869, "mean_token_accuracy": 0.8270902886986733, "num_tokens": 45965654.0, "step": 23130 }, { "entropy": 0.6819639127701521, "epoch": 0.4156823999640724, "grad_norm": 4.96875, "learning_rate": 3.2353122765515534e-05, "loss": 0.6668210983276367, "mean_token_accuracy": 0.83558998554945, "num_tokens": 45985910.0, "step": 23140 }, { "entropy": 0.6115058541297913, "epoch": 0.41586203799344323, "grad_norm": 7.46875, "learning_rate": 3.2339390344868384e-05, "loss": 0.6231845855712891, "mean_token_accuracy": 0.8413219466805458, "num_tokens": 46005543.0, "step": 23150 }, { "entropy": 0.6468209695070982, "epoch": 0.41604167602281406, "grad_norm": 7.4375, "learning_rate": 3.2325655500440385e-05, "loss": 0.643020486831665, "mean_token_accuracy": 0.8409248143434525, "num_tokens": 46026257.0, "step": 23160 }, { "entropy": 0.5919083263725042, "epoch": 0.4162213140521848, "grad_norm": 4.875, "learning_rate": 3.231191823676738e-05, "loss": 0.541643762588501, "mean_token_accuracy": 0.8708536520600318, "num_tokens": 46047386.0, "step": 23170 }, { "entropy": 0.6307024881243706, "epoch": 0.41640095208155564, "grad_norm": 5.9375, "learning_rate": 3.2298178558386e-05, "loss": 0.6454501628875733, "mean_token_accuracy": 0.8373385310173035, "num_tokens": 46066855.0, "step": 23180 }, { "entropy": 0.6024470072239637, "epoch": 0.41658059011092646, "grad_norm": 6.78125, "learning_rate": 3.2284436469833676e-05, "loss": 0.612937068939209, "mean_token_accuracy": 0.8493049532175064, "num_tokens": 46086517.0, "step": 23190 }, { "entropy": 0.6759311430156231, "epoch": 0.4167602281402973, "grad_norm": 8.0, "learning_rate": 3.227069197564863e-05, "loss": 0.7639508247375488, "mean_token_accuracy": 0.8115621119737625, "num_tokens": 46106135.0, "step": 23200 }, { "entropy": 0.6196597956120968, "epoch": 0.4169398661696681, "grad_norm": 8.5, "learning_rate": 3.225694508036989e-05, "loss": 0.6441765308380127, "mean_token_accuracy": 0.8415669411420822, "num_tokens": 46125533.0, "step": 23210 }, { "entropy": 0.6639901414513588, "epoch": 0.4171195041990389, "grad_norm": 4.375, "learning_rate": 3.224319578853726e-05, "loss": 0.6453790187835693, "mean_token_accuracy": 0.8375705406069756, "num_tokens": 46146831.0, "step": 23220 }, { "entropy": 0.6392422068864108, "epoch": 0.41729914222840975, "grad_norm": 5.0625, "learning_rate": 3.222944410469135e-05, "loss": 0.6557307243347168, "mean_token_accuracy": 0.8410643219947815, "num_tokens": 46165976.0, "step": 23230 }, { "entropy": 0.7951401233673095, "epoch": 0.41747878025778057, "grad_norm": 6.65625, "learning_rate": 3.2215690033373555e-05, "loss": 0.8281031608581543, "mean_token_accuracy": 0.8034468427300453, "num_tokens": 46185598.0, "step": 23240 }, { "entropy": 0.6511195970699191, "epoch": 0.4176584182871514, "grad_norm": 5.78125, "learning_rate": 3.220193357912606e-05, "loss": 0.6580522537231446, "mean_token_accuracy": 0.8436175793409347, "num_tokens": 46206444.0, "step": 23250 }, { "entropy": 0.6845143094658852, "epoch": 0.4178380563165222, "grad_norm": 5.4375, "learning_rate": 3.218817474649183e-05, "loss": 0.6704878330230712, "mean_token_accuracy": 0.8357115671038627, "num_tokens": 46226102.0, "step": 23260 }, { "entropy": 0.7219809021800756, "epoch": 0.41801769434589303, "grad_norm": 6.375, "learning_rate": 3.217441354001462e-05, "loss": 0.7451582908630371, "mean_token_accuracy": 0.8247045442461968, "num_tokens": 46246800.0, "step": 23270 }, { "entropy": 0.6332199849188328, "epoch": 0.41819733237526385, "grad_norm": 5.03125, "learning_rate": 3.2160649964238976e-05, "loss": 0.6463354587554931, "mean_token_accuracy": 0.8427874118089675, "num_tokens": 46266296.0, "step": 23280 }, { "entropy": 0.6888075068593025, "epoch": 0.4183769704046347, "grad_norm": 7.21875, "learning_rate": 3.214688402371021e-05, "loss": 0.6718083381652832, "mean_token_accuracy": 0.8235295474529266, "num_tokens": 46285333.0, "step": 23290 }, { "entropy": 0.6196028664708138, "epoch": 0.4185566084340055, "grad_norm": 6.1875, "learning_rate": 3.2133115722974435e-05, "loss": 0.6293376445770263, "mean_token_accuracy": 0.8440947338938714, "num_tokens": 46305708.0, "step": 23300 }, { "entropy": 0.7481485478579998, "epoch": 0.4187362464633763, "grad_norm": 4.5625, "learning_rate": 3.2119345066578523e-05, "loss": 0.7710437774658203, "mean_token_accuracy": 0.8181166261434555, "num_tokens": 46326098.0, "step": 23310 }, { "entropy": 0.6420524008572102, "epoch": 0.41891588449274714, "grad_norm": 6.9375, "learning_rate": 3.210557205907015e-05, "loss": 0.6342854499816895, "mean_token_accuracy": 0.8384896740317345, "num_tokens": 46344915.0, "step": 23320 }, { "entropy": 0.7156854037195444, "epoch": 0.41909552252211796, "grad_norm": 5.375, "learning_rate": 3.209179670499773e-05, "loss": 0.6809807777404785, "mean_token_accuracy": 0.8372182667255401, "num_tokens": 46364522.0, "step": 23330 }, { "entropy": 0.7047219440340996, "epoch": 0.4192751605514887, "grad_norm": 7.40625, "learning_rate": 3.20780190089105e-05, "loss": 0.7081789970397949, "mean_token_accuracy": 0.8230768047273159, "num_tokens": 46385845.0, "step": 23340 }, { "entropy": 0.7965566612780094, "epoch": 0.41945479858085954, "grad_norm": 5.40625, "learning_rate": 3.2064238975358426e-05, "loss": 0.8140080451965332, "mean_token_accuracy": 0.8055187836289406, "num_tokens": 46406830.0, "step": 23350 }, { "entropy": 0.5983365148305893, "epoch": 0.41963443661023037, "grad_norm": 6.96875, "learning_rate": 3.2050456608892264e-05, "loss": 0.5742587089538574, "mean_token_accuracy": 0.8593401685357094, "num_tokens": 46426832.0, "step": 23360 }, { "entropy": 0.7125523172318935, "epoch": 0.4198140746396012, "grad_norm": 6.84375, "learning_rate": 3.203667191406356e-05, "loss": 0.7139479637145996, "mean_token_accuracy": 0.821300408244133, "num_tokens": 46446471.0, "step": 23370 }, { "entropy": 0.6192107323557139, "epoch": 0.419993712668972, "grad_norm": 6.625, "learning_rate": 3.2022884895424594e-05, "loss": 0.6201735019683838, "mean_token_accuracy": 0.8412507727742196, "num_tokens": 46465851.0, "step": 23380 }, { "entropy": 0.6526543114334344, "epoch": 0.42017335069834283, "grad_norm": 6.40625, "learning_rate": 3.2009095557528434e-05, "loss": 0.674851942062378, "mean_token_accuracy": 0.8391532301902771, "num_tokens": 46485708.0, "step": 23390 }, { "entropy": 0.6175659246742725, "epoch": 0.42035298872771365, "grad_norm": 4.875, "learning_rate": 3.1995303904928906e-05, "loss": 0.6282788276672363, "mean_token_accuracy": 0.8451520740985871, "num_tokens": 46505589.0, "step": 23400 }, { "entropy": 0.7528997153043747, "epoch": 0.42053262675708447, "grad_norm": 7.46875, "learning_rate": 3.1981509942180616e-05, "loss": 0.7615347385406495, "mean_token_accuracy": 0.8222849503159523, "num_tokens": 46525755.0, "step": 23410 }, { "entropy": 0.5969504952430725, "epoch": 0.4207122647864553, "grad_norm": 5.28125, "learning_rate": 3.19677136738389e-05, "loss": 0.5787000179290771, "mean_token_accuracy": 0.8569890528917312, "num_tokens": 46545136.0, "step": 23420 }, { "entropy": 0.5864482589066029, "epoch": 0.4208919028158261, "grad_norm": 6.3125, "learning_rate": 3.19539151044599e-05, "loss": 0.6217243671417236, "mean_token_accuracy": 0.842398451268673, "num_tokens": 46564088.0, "step": 23430 }, { "entropy": 0.6566278148442507, "epoch": 0.42107154084519693, "grad_norm": 7.0625, "learning_rate": 3.194011423860048e-05, "loss": 0.628873348236084, "mean_token_accuracy": 0.8416550204157829, "num_tokens": 46585061.0, "step": 23440 }, { "entropy": 0.7693922020494938, "epoch": 0.42125117887456776, "grad_norm": 5.21875, "learning_rate": 3.1926311080818276e-05, "loss": 0.7796463966369629, "mean_token_accuracy": 0.8079635210335254, "num_tokens": 46604801.0, "step": 23450 }, { "entropy": 0.6586019679903984, "epoch": 0.4214308169039386, "grad_norm": 6.6875, "learning_rate": 3.191250563567169e-05, "loss": 0.6638798713684082, "mean_token_accuracy": 0.8277608349919319, "num_tokens": 46624277.0, "step": 23460 }, { "entropy": 0.6861205764114857, "epoch": 0.4216104549333094, "grad_norm": 5.25, "learning_rate": 3.189869790771987e-05, "loss": 0.7087327003479004, "mean_token_accuracy": 0.8244765803217888, "num_tokens": 46643745.0, "step": 23470 }, { "entropy": 0.7769518010318279, "epoch": 0.4217900929626802, "grad_norm": 7.6875, "learning_rate": 3.188488790152271e-05, "loss": 0.7951416969299316, "mean_token_accuracy": 0.8073859304189682, "num_tokens": 46662940.0, "step": 23480 }, { "entropy": 0.5699319195002317, "epoch": 0.42196973099205104, "grad_norm": 7.3125, "learning_rate": 3.187107562164087e-05, "loss": 0.577358341217041, "mean_token_accuracy": 0.852861861884594, "num_tokens": 46683294.0, "step": 23490 }, { "entropy": 0.6043197866529226, "epoch": 0.42214936902142186, "grad_norm": 4.5, "learning_rate": 3.1857261072635756e-05, "loss": 0.6108151912689209, "mean_token_accuracy": 0.8447893992066383, "num_tokens": 46702759.0, "step": 23500 }, { "entropy": 0.7254449337720871, "epoch": 0.4223290070507926, "grad_norm": 5.875, "learning_rate": 3.184344425906952e-05, "loss": 0.7229170799255371, "mean_token_accuracy": 0.8244763568043709, "num_tokens": 46722507.0, "step": 23510 }, { "entropy": 0.6677377238869667, "epoch": 0.42250864508016345, "grad_norm": 5.875, "learning_rate": 3.182962518550507e-05, "loss": 0.6493424892425537, "mean_token_accuracy": 0.834862295538187, "num_tokens": 46742663.0, "step": 23520 }, { "entropy": 0.7454547628760337, "epoch": 0.42268828310953427, "grad_norm": 6.46875, "learning_rate": 3.1815803856506065e-05, "loss": 0.7162877082824707, "mean_token_accuracy": 0.8231628760695457, "num_tokens": 46763001.0, "step": 23530 }, { "entropy": 0.5990430530160665, "epoch": 0.4228679211389051, "grad_norm": 5.6875, "learning_rate": 3.180198027663688e-05, "loss": 0.6127132415771485, "mean_token_accuracy": 0.8470400109887123, "num_tokens": 46783269.0, "step": 23540 }, { "entropy": 0.6272448725998402, "epoch": 0.4230475591682759, "grad_norm": 5.0625, "learning_rate": 3.178815445046267e-05, "loss": 0.6132073402404785, "mean_token_accuracy": 0.8410403013229371, "num_tokens": 46803280.0, "step": 23550 }, { "entropy": 0.6414046663790941, "epoch": 0.42322719719764673, "grad_norm": 6.3125, "learning_rate": 3.1774326382549294e-05, "loss": 0.6087607383728028, "mean_token_accuracy": 0.838011734187603, "num_tokens": 46822857.0, "step": 23560 }, { "entropy": 0.660580787062645, "epoch": 0.42340683522701755, "grad_norm": 5.84375, "learning_rate": 3.17604960774634e-05, "loss": 0.678853702545166, "mean_token_accuracy": 0.8306648895144463, "num_tokens": 46842970.0, "step": 23570 }, { "entropy": 0.7083369355648756, "epoch": 0.4235864732563884, "grad_norm": 5.21875, "learning_rate": 3.174666353977231e-05, "loss": 0.7372464179992676, "mean_token_accuracy": 0.8184053733944893, "num_tokens": 46863624.0, "step": 23580 }, { "entropy": 0.7065844684839249, "epoch": 0.4237661112857592, "grad_norm": 7.875, "learning_rate": 3.173282877404416e-05, "loss": 0.7306058406829834, "mean_token_accuracy": 0.8294106855988502, "num_tokens": 46884669.0, "step": 23590 }, { "entropy": 0.6485109269618988, "epoch": 0.42394574931513, "grad_norm": 6.65625, "learning_rate": 3.171899178484775e-05, "loss": 0.6996689796447754, "mean_token_accuracy": 0.8309333324432373, "num_tokens": 46904201.0, "step": 23600 }, { "entropy": 0.586810477823019, "epoch": 0.42412538734450084, "grad_norm": 5.59375, "learning_rate": 3.170515257675267e-05, "loss": 0.6223575592041015, "mean_token_accuracy": 0.8495154276490211, "num_tokens": 46924700.0, "step": 23610 }, { "entropy": 0.67276396676898, "epoch": 0.42430502537387166, "grad_norm": 6.59375, "learning_rate": 3.1691311154329196e-05, "loss": 0.7173723220825196, "mean_token_accuracy": 0.8314430415630341, "num_tokens": 46944195.0, "step": 23620 }, { "entropy": 0.7477695576846599, "epoch": 0.4244846634032425, "grad_norm": 5.3125, "learning_rate": 3.167746752214838e-05, "loss": 0.7162967681884765, "mean_token_accuracy": 0.8267581835389137, "num_tokens": 46965342.0, "step": 23630 }, { "entropy": 0.7500372648239135, "epoch": 0.4246643014326133, "grad_norm": 7.03125, "learning_rate": 3.166362168478196e-05, "loss": 0.7602426052093506, "mean_token_accuracy": 0.8255150020122528, "num_tokens": 46984530.0, "step": 23640 }, { "entropy": 0.6396973673254251, "epoch": 0.4248439394619841, "grad_norm": 5.53125, "learning_rate": 3.1649773646802445e-05, "loss": 0.6249341011047364, "mean_token_accuracy": 0.8477486088871956, "num_tokens": 47004567.0, "step": 23650 }, { "entropy": 0.7148826811462641, "epoch": 0.42502357749135494, "grad_norm": 4.375, "learning_rate": 3.1635923412783044e-05, "loss": 0.7322266101837158, "mean_token_accuracy": 0.8240624606609345, "num_tokens": 47023577.0, "step": 23660 }, { "entropy": 0.7269294366240502, "epoch": 0.42520321552072576, "grad_norm": 5.59375, "learning_rate": 3.162207098729768e-05, "loss": 0.7517065525054931, "mean_token_accuracy": 0.8258009478449821, "num_tokens": 47043125.0, "step": 23670 }, { "entropy": 0.6598549596965313, "epoch": 0.42538285355009653, "grad_norm": 5.59375, "learning_rate": 3.160821637492104e-05, "loss": 0.6774972438812256, "mean_token_accuracy": 0.8381332844495774, "num_tokens": 47062853.0, "step": 23680 }, { "entropy": 0.7702537305653095, "epoch": 0.42556249157946735, "grad_norm": 5.75, "learning_rate": 3.15943595802285e-05, "loss": 0.755970048904419, "mean_token_accuracy": 0.8167732790112495, "num_tokens": 47083174.0, "step": 23690 }, { "entropy": 0.55663131326437, "epoch": 0.42574212960883817, "grad_norm": 4.75, "learning_rate": 3.158050060779617e-05, "loss": 0.5648555278778076, "mean_token_accuracy": 0.8610092669725418, "num_tokens": 47104474.0, "step": 23700 }, { "entropy": 0.6427796367555857, "epoch": 0.425921767638209, "grad_norm": 6.0625, "learning_rate": 3.1566639462200865e-05, "loss": 0.6340445518493653, "mean_token_accuracy": 0.8362182572484016, "num_tokens": 47123616.0, "step": 23710 }, { "entropy": 0.6005171479657292, "epoch": 0.4261014056675798, "grad_norm": 4.09375, "learning_rate": 3.155277614802015e-05, "loss": 0.6307083606719971, "mean_token_accuracy": 0.8414289563894272, "num_tokens": 47145000.0, "step": 23720 }, { "entropy": 0.6968921110033989, "epoch": 0.42628104369695063, "grad_norm": 5.03125, "learning_rate": 3.153891066983226e-05, "loss": 0.6963856220245361, "mean_token_accuracy": 0.8283406108617782, "num_tokens": 47163130.0, "step": 23730 }, { "entropy": 0.6803260661661625, "epoch": 0.42646068172632146, "grad_norm": 6.40625, "learning_rate": 3.1525043032216185e-05, "loss": 0.6678486824035644, "mean_token_accuracy": 0.8259052127599716, "num_tokens": 47183823.0, "step": 23740 }, { "entropy": 0.660888458788395, "epoch": 0.4266403197556923, "grad_norm": 6.0, "learning_rate": 3.1511173239751615e-05, "loss": 0.6798188209533691, "mean_token_accuracy": 0.8293200120329857, "num_tokens": 47203718.0, "step": 23750 }, { "entropy": 0.7096694614738226, "epoch": 0.4268199577850631, "grad_norm": 6.9375, "learning_rate": 3.149730129701893e-05, "loss": 0.6745379447937012, "mean_token_accuracy": 0.8326949834823608, "num_tokens": 47223142.0, "step": 23760 }, { "entropy": 0.7273824464529752, "epoch": 0.4269995958144339, "grad_norm": 6.65625, "learning_rate": 3.1483427208599256e-05, "loss": 0.7428422927856445, "mean_token_accuracy": 0.8209651917219162, "num_tokens": 47243548.0, "step": 23770 }, { "entropy": 0.6760349325835705, "epoch": 0.42717923384380474, "grad_norm": 6.1875, "learning_rate": 3.146955097907441e-05, "loss": 0.6873424530029297, "mean_token_accuracy": 0.8322339043021202, "num_tokens": 47262744.0, "step": 23780 }, { "entropy": 0.6197375915944576, "epoch": 0.42735887187317556, "grad_norm": 5.21875, "learning_rate": 3.145567261302692e-05, "loss": 0.6541970729827881, "mean_token_accuracy": 0.8423280358314514, "num_tokens": 47282814.0, "step": 23790 }, { "entropy": 0.6615794908255339, "epoch": 0.4275385099025464, "grad_norm": 6.125, "learning_rate": 3.1441792115039996e-05, "loss": 0.6347053050994873, "mean_token_accuracy": 0.8358678922057152, "num_tokens": 47302536.0, "step": 23800 }, { "entropy": 0.6702492091804743, "epoch": 0.4277181479319172, "grad_norm": 5.59375, "learning_rate": 3.142790948969759e-05, "loss": 0.6672655582427979, "mean_token_accuracy": 0.8402595117688179, "num_tokens": 47321623.0, "step": 23810 }, { "entropy": 0.6698753476142884, "epoch": 0.427897785961288, "grad_norm": 7.6875, "learning_rate": 3.141402474158434e-05, "loss": 0.6738217353820801, "mean_token_accuracy": 0.8343053162097931, "num_tokens": 47342292.0, "step": 23820 }, { "entropy": 0.6731942117214202, "epoch": 0.42807742399065885, "grad_norm": 6.125, "learning_rate": 3.140013787528559e-05, "loss": 0.6803479194641113, "mean_token_accuracy": 0.8351604998111725, "num_tokens": 47363443.0, "step": 23830 }, { "entropy": 0.6426824301481247, "epoch": 0.42825706202002967, "grad_norm": 6.5, "learning_rate": 3.1386248895387354e-05, "loss": 0.61573805809021, "mean_token_accuracy": 0.8445127591490745, "num_tokens": 47384622.0, "step": 23840 }, { "entropy": 0.6753062032163143, "epoch": 0.42843670004940043, "grad_norm": 5.84375, "learning_rate": 3.137235780647639e-05, "loss": 0.6749578952789307, "mean_token_accuracy": 0.8357361450791359, "num_tokens": 47403592.0, "step": 23850 }, { "entropy": 0.6939686320722103, "epoch": 0.42861633807877125, "grad_norm": 6.0625, "learning_rate": 3.135846461314011e-05, "loss": 0.7325024604797363, "mean_token_accuracy": 0.8239819511771203, "num_tokens": 47423913.0, "step": 23860 }, { "entropy": 0.696803268790245, "epoch": 0.4287959761081421, "grad_norm": 7.3125, "learning_rate": 3.134456931996666e-05, "loss": 0.7140926837921142, "mean_token_accuracy": 0.8170573860406876, "num_tokens": 47444523.0, "step": 23870 }, { "entropy": 0.6037124387919903, "epoch": 0.4289756141375129, "grad_norm": 9.0, "learning_rate": 3.1330671931544855e-05, "loss": 0.606038761138916, "mean_token_accuracy": 0.8527293592691422, "num_tokens": 47463990.0, "step": 23880 }, { "entropy": 0.6957373976707458, "epoch": 0.4291552521668837, "grad_norm": 6.4375, "learning_rate": 3.13167724524642e-05, "loss": 0.6865151882171631, "mean_token_accuracy": 0.82889783680439, "num_tokens": 47483852.0, "step": 23890 }, { "entropy": 0.6792431350797414, "epoch": 0.42933489019625454, "grad_norm": 6.53125, "learning_rate": 3.1302870887314906e-05, "loss": 0.7170518398284912, "mean_token_accuracy": 0.8275602132081985, "num_tokens": 47503603.0, "step": 23900 }, { "entropy": 0.6037205047905445, "epoch": 0.42951452822562536, "grad_norm": 7.75, "learning_rate": 3.128896724068786e-05, "loss": 0.6428238868713378, "mean_token_accuracy": 0.8414407536387444, "num_tokens": 47523826.0, "step": 23910 }, { "entropy": 0.6739425085484981, "epoch": 0.4296941662549962, "grad_norm": 5.5625, "learning_rate": 3.1275061517174656e-05, "loss": 0.6554346561431885, "mean_token_accuracy": 0.8329007640480995, "num_tokens": 47543826.0, "step": 23920 }, { "entropy": 0.6566864341497421, "epoch": 0.429873804284367, "grad_norm": 6.0625, "learning_rate": 3.1261153721367535e-05, "loss": 0.6901873588562012, "mean_token_accuracy": 0.8337967872619629, "num_tokens": 47562575.0, "step": 23930 }, { "entropy": 0.7516804128885269, "epoch": 0.4300534423137378, "grad_norm": 6.96875, "learning_rate": 3.1247243857859464e-05, "loss": 0.7447842597961426, "mean_token_accuracy": 0.8130014762282372, "num_tokens": 47581688.0, "step": 23940 }, { "entropy": 0.6308729652315378, "epoch": 0.43023308034310864, "grad_norm": 6.34375, "learning_rate": 3.123333193124406e-05, "loss": 0.6159263610839844, "mean_token_accuracy": 0.8465975895524025, "num_tokens": 47602053.0, "step": 23950 }, { "entropy": 0.6302910849452019, "epoch": 0.43041271837247946, "grad_norm": 7.1875, "learning_rate": 3.121941794611566e-05, "loss": 0.6234625339508056, "mean_token_accuracy": 0.8500958800315856, "num_tokens": 47622221.0, "step": 23960 }, { "entropy": 0.6727326799184083, "epoch": 0.4305923564018503, "grad_norm": 6.625, "learning_rate": 3.1205501907069234e-05, "loss": 0.6773569107055664, "mean_token_accuracy": 0.8358851373195648, "num_tokens": 47642303.0, "step": 23970 }, { "entropy": 0.5640832461416722, "epoch": 0.4307719944312211, "grad_norm": 5.25, "learning_rate": 3.119158381870046e-05, "loss": 0.5562549114227295, "mean_token_accuracy": 0.8653771936893463, "num_tokens": 47662365.0, "step": 23980 }, { "entropy": 0.646189521998167, "epoch": 0.4309516324605919, "grad_norm": 5.125, "learning_rate": 3.11776636856057e-05, "loss": 0.6979965209960938, "mean_token_accuracy": 0.8403136804699898, "num_tokens": 47681648.0, "step": 23990 }, { "epoch": 0.43113127048996275, "eval_entropy": 0.643974608361721, "eval_loss": 0.6478521823883057, "eval_mean_token_accuracy": 0.8415909221172333, "eval_num_tokens": 47700497.0, "eval_runtime": 40.5431, "eval_samples_per_second": 49.33, "eval_steps_per_second": 6.166, "step": 24000 }, { "entropy": 0.6116340771317482, "epoch": 0.43131090851933357, "grad_norm": 7.40625, "learning_rate": 3.114981730362695e-05, "loss": 0.6225731849670411, "mean_token_accuracy": 0.8486511081457138, "num_tokens": 47720176.0, "step": 24010 }, { "entropy": 0.6417730018496514, "epoch": 0.43149054654870433, "grad_norm": 8.1875, "learning_rate": 3.113589106393904e-05, "loss": 0.6425131797790528, "mean_token_accuracy": 0.8422294422984123, "num_tokens": 47740766.0, "step": 24020 }, { "entropy": 0.7078488174825907, "epoch": 0.43167018457807516, "grad_norm": 7.34375, "learning_rate": 3.112196279791726e-05, "loss": 0.7469717502593994, "mean_token_accuracy": 0.8250307664275169, "num_tokens": 47761590.0, "step": 24030 }, { "entropy": 0.6866001222282648, "epoch": 0.431849822607446, "grad_norm": 5.3125, "learning_rate": 3.1108032510161326e-05, "loss": 0.6446122169494629, "mean_token_accuracy": 0.833529357612133, "num_tokens": 47779748.0, "step": 24040 }, { "entropy": 0.6868690174072981, "epoch": 0.4320294606368168, "grad_norm": 7.3125, "learning_rate": 3.109410020527161e-05, "loss": 0.7091449737548828, "mean_token_accuracy": 0.8321635752916337, "num_tokens": 47798969.0, "step": 24050 }, { "entropy": 0.6160532560199499, "epoch": 0.4322090986661876, "grad_norm": 6.21875, "learning_rate": 3.108016588784916e-05, "loss": 0.6060786724090577, "mean_token_accuracy": 0.8443858772516251, "num_tokens": 47818210.0, "step": 24060 }, { "entropy": 0.6329162698239088, "epoch": 0.43238873669555844, "grad_norm": 7.125, "learning_rate": 3.1066229562495685e-05, "loss": 0.6312871932983398, "mean_token_accuracy": 0.8438546836376191, "num_tokens": 47838313.0, "step": 24070 }, { "entropy": 0.672634968161583, "epoch": 0.43256837472492926, "grad_norm": 6.40625, "learning_rate": 3.1052291233813555e-05, "loss": 0.6814215183258057, "mean_token_accuracy": 0.8314599946141243, "num_tokens": 47857746.0, "step": 24080 }, { "entropy": 0.7047202907502651, "epoch": 0.4327480127543001, "grad_norm": 8.625, "learning_rate": 3.1038350906405804e-05, "loss": 0.7244247913360595, "mean_token_accuracy": 0.8213862523436546, "num_tokens": 47878735.0, "step": 24090 }, { "entropy": 0.6799656547605991, "epoch": 0.4329276507836709, "grad_norm": 5.21875, "learning_rate": 3.1024408584876124e-05, "loss": 0.6469698905944824, "mean_token_accuracy": 0.836238905787468, "num_tokens": 47897996.0, "step": 24100 }, { "entropy": 0.7024842206388712, "epoch": 0.4331072888130417, "grad_norm": 7.6875, "learning_rate": 3.1010464273828864e-05, "loss": 0.7120854377746582, "mean_token_accuracy": 0.8228103414177894, "num_tokens": 47917720.0, "step": 24110 }, { "entropy": 0.6569418989121913, "epoch": 0.43328692684241255, "grad_norm": 8.5, "learning_rate": 3.0996517977869045e-05, "loss": 0.6930888652801513, "mean_token_accuracy": 0.8321496114134789, "num_tokens": 47937335.0, "step": 24120 }, { "entropy": 0.7343391198664904, "epoch": 0.43346656487178337, "grad_norm": 7.3125, "learning_rate": 3.09825697016023e-05, "loss": 0.7747005939483642, "mean_token_accuracy": 0.8177273198962212, "num_tokens": 47957523.0, "step": 24130 }, { "entropy": 0.6938234955072403, "epoch": 0.4336462029011542, "grad_norm": 6.03125, "learning_rate": 3.0968619449634984e-05, "loss": 0.7045555591583252, "mean_token_accuracy": 0.8318816423416138, "num_tokens": 47977998.0, "step": 24140 }, { "entropy": 0.6539994336664676, "epoch": 0.433825840930525, "grad_norm": 7.5, "learning_rate": 3.0954667226574036e-05, "loss": 0.6392402648925781, "mean_token_accuracy": 0.8388224467635155, "num_tokens": 47997819.0, "step": 24150 }, { "entropy": 0.6357131343334913, "epoch": 0.43400547895989583, "grad_norm": 4.8125, "learning_rate": 3.0940713037027106e-05, "loss": 0.6495887756347656, "mean_token_accuracy": 0.8364812210202217, "num_tokens": 48017141.0, "step": 24160 }, { "entropy": 0.5694891676306725, "epoch": 0.43418511698926665, "grad_norm": 6.375, "learning_rate": 3.092675688560244e-05, "loss": 0.5821140289306641, "mean_token_accuracy": 0.8563517794013024, "num_tokens": 48038509.0, "step": 24170 }, { "entropy": 0.6492311626672744, "epoch": 0.43436475501863747, "grad_norm": 7.0, "learning_rate": 3.0912798776908974e-05, "loss": 0.6166582584381104, "mean_token_accuracy": 0.8455361276865005, "num_tokens": 48059405.0, "step": 24180 }, { "entropy": 0.6579222697764635, "epoch": 0.43454439304800824, "grad_norm": 6.0, "learning_rate": 3.0898838715556256e-05, "loss": 0.6397764205932617, "mean_token_accuracy": 0.8406086131930351, "num_tokens": 48078804.0, "step": 24190 }, { "entropy": 0.6347151096910238, "epoch": 0.43472403107737906, "grad_norm": 5.0625, "learning_rate": 3.0884876706154516e-05, "loss": 0.6415602207183838, "mean_token_accuracy": 0.8425936251878738, "num_tokens": 48098535.0, "step": 24200 }, { "entropy": 0.6497670665383339, "epoch": 0.4349036691067499, "grad_norm": 5.875, "learning_rate": 3.087091275331459e-05, "loss": 0.6485769748687744, "mean_token_accuracy": 0.8367728665471077, "num_tokens": 48117842.0, "step": 24210 }, { "entropy": 0.6299391526728868, "epoch": 0.4350833071361207, "grad_norm": 4.59375, "learning_rate": 3.085694686164798e-05, "loss": 0.6326821327209473, "mean_token_accuracy": 0.8517057940363884, "num_tokens": 48138103.0, "step": 24220 }, { "entropy": 0.5950762785971164, "epoch": 0.4352629451654915, "grad_norm": 8.0625, "learning_rate": 3.0842979035766825e-05, "loss": 0.5773335933685303, "mean_token_accuracy": 0.859959015250206, "num_tokens": 48157555.0, "step": 24230 }, { "entropy": 0.6722312860190869, "epoch": 0.43544258319486234, "grad_norm": 5.875, "learning_rate": 3.0829009280283884e-05, "loss": 0.7104061603546142, "mean_token_accuracy": 0.8225480541586876, "num_tokens": 48176636.0, "step": 24240 }, { "entropy": 0.6431870773434639, "epoch": 0.43562222122423316, "grad_norm": 6.75, "learning_rate": 3.081503759981259e-05, "loss": 0.6344115734100342, "mean_token_accuracy": 0.839464607834816, "num_tokens": 48196475.0, "step": 24250 }, { "entropy": 0.6827650159597397, "epoch": 0.435801859253604, "grad_norm": 8.375, "learning_rate": 3.080106399896697e-05, "loss": 0.7154043197631836, "mean_token_accuracy": 0.8314108595252037, "num_tokens": 48215659.0, "step": 24260 }, { "entropy": 0.6553299807012081, "epoch": 0.4359814972829748, "grad_norm": 6.09375, "learning_rate": 3.0787088482361725e-05, "loss": 0.6391956329345703, "mean_token_accuracy": 0.8403597295284271, "num_tokens": 48234982.0, "step": 24270 }, { "entropy": 0.6779052548110485, "epoch": 0.4361611353123456, "grad_norm": 8.25, "learning_rate": 3.0773111054612146e-05, "loss": 0.6637829780578614, "mean_token_accuracy": 0.838368509709835, "num_tokens": 48254121.0, "step": 24280 }, { "entropy": 0.5827049601823091, "epoch": 0.43634077334171645, "grad_norm": 7.96875, "learning_rate": 3.07591317203342e-05, "loss": 0.5852439880371094, "mean_token_accuracy": 0.8524028226733208, "num_tokens": 48273354.0, "step": 24290 }, { "entropy": 0.616769940406084, "epoch": 0.43652041137108727, "grad_norm": 6.65625, "learning_rate": 3.0745150484144444e-05, "loss": 0.6197027683258056, "mean_token_accuracy": 0.8483280181884766, "num_tokens": 48291969.0, "step": 24300 }, { "entropy": 0.6108016103506089, "epoch": 0.4367000494004581, "grad_norm": 5.875, "learning_rate": 3.073116735066009e-05, "loss": 0.5824091911315918, "mean_token_accuracy": 0.8571629509329796, "num_tokens": 48311133.0, "step": 24310 }, { "entropy": 0.5841566108167171, "epoch": 0.4368796874298289, "grad_norm": 4.875, "learning_rate": 3.071718232449896e-05, "loss": 0.5923855304718018, "mean_token_accuracy": 0.8529880329966545, "num_tokens": 48331149.0, "step": 24320 }, { "entropy": 0.7286870822310447, "epoch": 0.43705932545919973, "grad_norm": 8.625, "learning_rate": 3.070319541027952e-05, "loss": 0.7580495834350586, "mean_token_accuracy": 0.8108010180294514, "num_tokens": 48351572.0, "step": 24330 }, { "entropy": 0.6825996853411198, "epoch": 0.43723896348857055, "grad_norm": 8.75, "learning_rate": 3.068920661262085e-05, "loss": 0.6995247840881348, "mean_token_accuracy": 0.8319066911935806, "num_tokens": 48370946.0, "step": 24340 }, { "entropy": 0.6596868000924587, "epoch": 0.4374186015179414, "grad_norm": 7.4375, "learning_rate": 3.067521593614262e-05, "loss": 0.6630935192108154, "mean_token_accuracy": 0.8351659640669823, "num_tokens": 48390397.0, "step": 24350 }, { "entropy": 0.6398804992437362, "epoch": 0.43759823954731214, "grad_norm": 6.28125, "learning_rate": 3.066122338546518e-05, "loss": 0.6383000373840332, "mean_token_accuracy": 0.8420041784644127, "num_tokens": 48409555.0, "step": 24360 }, { "entropy": 0.7143633153289557, "epoch": 0.43777787757668296, "grad_norm": 5.46875, "learning_rate": 3.064722896520946e-05, "loss": 0.723311471939087, "mean_token_accuracy": 0.8258228704333306, "num_tokens": 48429848.0, "step": 24370 }, { "entropy": 0.6875798180699348, "epoch": 0.4379575156060538, "grad_norm": 8.6875, "learning_rate": 3.063323267999702e-05, "loss": 0.7160614013671875, "mean_token_accuracy": 0.8254805788397789, "num_tokens": 48448674.0, "step": 24380 }, { "entropy": 0.651991369575262, "epoch": 0.4381371536354246, "grad_norm": 7.5, "learning_rate": 3.0619234534450034e-05, "loss": 0.6259730815887451, "mean_token_accuracy": 0.8404921442270279, "num_tokens": 48467701.0, "step": 24390 }, { "entropy": 0.6553060866892337, "epoch": 0.4383167916647954, "grad_norm": 5.5, "learning_rate": 3.060523453319127e-05, "loss": 0.6829468250274658, "mean_token_accuracy": 0.8249972000718117, "num_tokens": 48487228.0, "step": 24400 }, { "entropy": 0.6708332661539316, "epoch": 0.43849642969416625, "grad_norm": 6.03125, "learning_rate": 3.059123268084415e-05, "loss": 0.6162095069885254, "mean_token_accuracy": 0.8462602972984314, "num_tokens": 48507170.0, "step": 24410 }, { "entropy": 0.6859062768518924, "epoch": 0.43867606772353707, "grad_norm": 6.71875, "learning_rate": 3.057722898203267e-05, "loss": 0.7276244640350342, "mean_token_accuracy": 0.8227898523211479, "num_tokens": 48526543.0, "step": 24420 }, { "entropy": 0.6548083253204823, "epoch": 0.4388557057529079, "grad_norm": 5.65625, "learning_rate": 3.0563223441381464e-05, "loss": 0.6397836685180665, "mean_token_accuracy": 0.8447485193610191, "num_tokens": 48546188.0, "step": 24430 }, { "entropy": 0.6609334945678711, "epoch": 0.4390353437822787, "grad_norm": 5.65625, "learning_rate": 3.0549216063515754e-05, "loss": 0.6716468334197998, "mean_token_accuracy": 0.8284130379557609, "num_tokens": 48566666.0, "step": 24440 }, { "entropy": 0.6348645225167274, "epoch": 0.43921498181164953, "grad_norm": 5.84375, "learning_rate": 3.053520685306138e-05, "loss": 0.6639882564544678, "mean_token_accuracy": 0.8381089508533478, "num_tokens": 48586426.0, "step": 24450 }, { "entropy": 0.7350969210267067, "epoch": 0.43939461984102035, "grad_norm": 6.1875, "learning_rate": 3.052119581464477e-05, "loss": 0.7468497276306152, "mean_token_accuracy": 0.8118630766868591, "num_tokens": 48606440.0, "step": 24460 }, { "entropy": 0.6784627448767424, "epoch": 0.43957425787039117, "grad_norm": 6.4375, "learning_rate": 3.0507182952892983e-05, "loss": 0.6952576637268066, "mean_token_accuracy": 0.8315318375825882, "num_tokens": 48627786.0, "step": 24470 }, { "entropy": 0.5751110419631005, "epoch": 0.439753895899762, "grad_norm": 6.34375, "learning_rate": 3.049316827243366e-05, "loss": 0.575243616104126, "mean_token_accuracy": 0.8466513440012932, "num_tokens": 48647046.0, "step": 24480 }, { "entropy": 0.5471175953745842, "epoch": 0.4399335339291328, "grad_norm": 5.71875, "learning_rate": 3.0479151777895042e-05, "loss": 0.5089127063751221, "mean_token_accuracy": 0.8720040857791901, "num_tokens": 48666933.0, "step": 24490 }, { "entropy": 0.6096704304218292, "epoch": 0.44011317195850364, "grad_norm": 4.6875, "learning_rate": 3.0465133473905987e-05, "loss": 0.5958727359771728, "mean_token_accuracy": 0.8473158493638039, "num_tokens": 48687232.0, "step": 24500 }, { "entropy": 0.5894104741513729, "epoch": 0.44029280998787446, "grad_norm": 5.40625, "learning_rate": 3.0451113365095933e-05, "loss": 0.5703695297241211, "mean_token_accuracy": 0.8509207278490066, "num_tokens": 48706691.0, "step": 24510 }, { "entropy": 0.5600882176309824, "epoch": 0.4404724480172453, "grad_norm": 5.28125, "learning_rate": 3.043709145609493e-05, "loss": 0.5430359840393066, "mean_token_accuracy": 0.8666277050971984, "num_tokens": 48726035.0, "step": 24520 }, { "entropy": 0.6792589701712132, "epoch": 0.44065208604661604, "grad_norm": 6.21875, "learning_rate": 3.042306775153359e-05, "loss": 0.6821471214294433, "mean_token_accuracy": 0.8340050727128983, "num_tokens": 48746045.0, "step": 24530 }, { "entropy": 0.6152332082390786, "epoch": 0.44083172407598686, "grad_norm": 8.125, "learning_rate": 3.0409042256043164e-05, "loss": 0.6431283473968505, "mean_token_accuracy": 0.8401598826050758, "num_tokens": 48766269.0, "step": 24540 }, { "entropy": 0.7134300217032432, "epoch": 0.4410113621053577, "grad_norm": 6.6875, "learning_rate": 3.0395014974255454e-05, "loss": 0.7360266208648681, "mean_token_accuracy": 0.818088473379612, "num_tokens": 48785585.0, "step": 24550 }, { "entropy": 0.6341461170464754, "epoch": 0.4411910001347285, "grad_norm": 6.84375, "learning_rate": 3.0380985910802885e-05, "loss": 0.6664112091064454, "mean_token_accuracy": 0.8312144741415978, "num_tokens": 48806205.0, "step": 24560 }, { "entropy": 0.6343520622700453, "epoch": 0.4413706381640993, "grad_norm": 5.78125, "learning_rate": 3.036695507031844e-05, "loss": 0.6160861492156983, "mean_token_accuracy": 0.8393663197755814, "num_tokens": 48825212.0, "step": 24570 }, { "entropy": 0.6558980982750654, "epoch": 0.44155027619347015, "grad_norm": 8.0625, "learning_rate": 3.0352922457435707e-05, "loss": 0.6846744537353515, "mean_token_accuracy": 0.8371525272727013, "num_tokens": 48844033.0, "step": 24580 }, { "entropy": 0.7383323162794113, "epoch": 0.44172991422284097, "grad_norm": 9.0, "learning_rate": 3.033888807678886e-05, "loss": 0.7554762840270997, "mean_token_accuracy": 0.810349977016449, "num_tokens": 48863759.0, "step": 24590 }, { "entropy": 0.6707283407449722, "epoch": 0.4419095522522118, "grad_norm": 6.21875, "learning_rate": 3.0324851933012644e-05, "loss": 0.6680423736572265, "mean_token_accuracy": 0.8358715415000916, "num_tokens": 48882898.0, "step": 24600 }, { "entropy": 0.6419709332287311, "epoch": 0.4420891902815826, "grad_norm": 6.5625, "learning_rate": 3.0310814030742406e-05, "loss": 0.6242598056793213, "mean_token_accuracy": 0.8465228125452995, "num_tokens": 48903964.0, "step": 24610 }, { "entropy": 0.6546909786760807, "epoch": 0.44226882831095343, "grad_norm": 7.65625, "learning_rate": 3.0296774374614046e-05, "loss": 0.6794456005096435, "mean_token_accuracy": 0.8325377434492112, "num_tokens": 48924771.0, "step": 24620 }, { "entropy": 0.6202659197151661, "epoch": 0.44244846634032425, "grad_norm": 7.6875, "learning_rate": 3.0282732969264082e-05, "loss": 0.6098038196563721, "mean_token_accuracy": 0.8548227608203888, "num_tokens": 48945621.0, "step": 24630 }, { "entropy": 0.6240485176444054, "epoch": 0.4426281043696951, "grad_norm": 6.8125, "learning_rate": 3.026868981932956e-05, "loss": 0.6937830924987793, "mean_token_accuracy": 0.8319880947470665, "num_tokens": 48965034.0, "step": 24640 }, { "entropy": 0.7398942716419696, "epoch": 0.4428077423990659, "grad_norm": 7.125, "learning_rate": 3.0254644929448156e-05, "loss": 0.7947087287902832, "mean_token_accuracy": 0.8174772322177887, "num_tokens": 48986022.0, "step": 24650 }, { "entropy": 0.6909448966383934, "epoch": 0.4429873804284367, "grad_norm": 8.5, "learning_rate": 3.0240598304258078e-05, "loss": 0.6848007678985596, "mean_token_accuracy": 0.8385121032595635, "num_tokens": 49005820.0, "step": 24660 }, { "entropy": 0.6841110631823539, "epoch": 0.44316701845780754, "grad_norm": 6.09375, "learning_rate": 3.0226549948398126e-05, "loss": 0.6714051723480224, "mean_token_accuracy": 0.8297701433300972, "num_tokens": 49026623.0, "step": 24670 }, { "entropy": 0.6862603195011616, "epoch": 0.44334665648717836, "grad_norm": 4.96875, "learning_rate": 3.021249986650766e-05, "loss": 0.7057745456695557, "mean_token_accuracy": 0.8246428772807122, "num_tokens": 49046777.0, "step": 24680 }, { "entropy": 0.6537864200770855, "epoch": 0.4435262945165492, "grad_norm": 6.375, "learning_rate": 3.0198448063226635e-05, "loss": 0.6506913661956787, "mean_token_accuracy": 0.8443417236208915, "num_tokens": 49066261.0, "step": 24690 }, { "entropy": 0.7047199092805385, "epoch": 0.44370593254591995, "grad_norm": 6.8125, "learning_rate": 3.018439454319555e-05, "loss": 0.7087321281433105, "mean_token_accuracy": 0.8283670008182525, "num_tokens": 49086343.0, "step": 24700 }, { "entropy": 0.6323735993355513, "epoch": 0.44388557057529077, "grad_norm": 5.75, "learning_rate": 3.017033931105548e-05, "loss": 0.6258208274841308, "mean_token_accuracy": 0.8504282802343368, "num_tokens": 49105564.0, "step": 24710 }, { "entropy": 0.6451583333313465, "epoch": 0.4440652086046616, "grad_norm": 5.6875, "learning_rate": 3.0156282371448053e-05, "loss": 0.6097512722015381, "mean_token_accuracy": 0.8471232742071152, "num_tokens": 49124530.0, "step": 24720 }, { "entropy": 0.6597867157310248, "epoch": 0.4442448466340324, "grad_norm": 6.75, "learning_rate": 3.0142223729015488e-05, "loss": 0.6635383129119873, "mean_token_accuracy": 0.8407457947731019, "num_tokens": 49144100.0, "step": 24730 }, { "entropy": 0.6090733125805855, "epoch": 0.44442448466340323, "grad_norm": 8.25, "learning_rate": 3.0128163388400544e-05, "loss": 0.6453722953796387, "mean_token_accuracy": 0.834476524591446, "num_tokens": 49164086.0, "step": 24740 }, { "entropy": 0.7093131553381682, "epoch": 0.44460412269277405, "grad_norm": 5.9375, "learning_rate": 3.011410135424655e-05, "loss": 0.7638623714447021, "mean_token_accuracy": 0.8188984617590904, "num_tokens": 49184118.0, "step": 24750 }, { "entropy": 0.7432346932590008, "epoch": 0.44478376072214487, "grad_norm": 6.8125, "learning_rate": 3.0100037631197393e-05, "loss": 0.7585359573364258, "mean_token_accuracy": 0.8147079572081566, "num_tokens": 49204244.0, "step": 24760 }, { "entropy": 0.6366347067058087, "epoch": 0.4449633987515157, "grad_norm": 4.375, "learning_rate": 3.0085972223897503e-05, "loss": 0.6233406066894531, "mean_token_accuracy": 0.8406553149223328, "num_tokens": 49225128.0, "step": 24770 }, { "entropy": 0.7200527563691139, "epoch": 0.4451430367808865, "grad_norm": 6.125, "learning_rate": 3.0071905136991895e-05, "loss": 0.6957122802734375, "mean_token_accuracy": 0.8265476405620575, "num_tokens": 49245120.0, "step": 24780 }, { "entropy": 0.5662011288106441, "epoch": 0.44532267481025734, "grad_norm": 6.34375, "learning_rate": 3.0057836375126116e-05, "loss": 0.5451754093170166, "mean_token_accuracy": 0.860263068974018, "num_tokens": 49264458.0, "step": 24790 }, { "entropy": 0.7338626340031624, "epoch": 0.44550231283962816, "grad_norm": 5.71875, "learning_rate": 3.004376594294628e-05, "loss": 0.7422623634338379, "mean_token_accuracy": 0.8200034037232399, "num_tokens": 49283471.0, "step": 24800 }, { "entropy": 0.7104780457913875, "epoch": 0.445681950868999, "grad_norm": 6.0625, "learning_rate": 3.0029693845099028e-05, "loss": 0.7348772525787354, "mean_token_accuracy": 0.8238610781729221, "num_tokens": 49302765.0, "step": 24810 }, { "entropy": 0.6248294528573751, "epoch": 0.4458615888983698, "grad_norm": 7.84375, "learning_rate": 3.0015620086231595e-05, "loss": 0.5852408885955811, "mean_token_accuracy": 0.8594656825065613, "num_tokens": 49322787.0, "step": 24820 }, { "entropy": 0.5683596175163984, "epoch": 0.4460412269277406, "grad_norm": 5.5625, "learning_rate": 3.0001544670991716e-05, "loss": 0.5722835540771485, "mean_token_accuracy": 0.8501962542533874, "num_tokens": 49342315.0, "step": 24830 }, { "entropy": 0.6376261048018932, "epoch": 0.44622086495711144, "grad_norm": 5.84375, "learning_rate": 2.998746760402771e-05, "loss": 0.6271524429321289, "mean_token_accuracy": 0.8414926365017891, "num_tokens": 49361358.0, "step": 24840 }, { "entropy": 0.6727514907717704, "epoch": 0.44640050298648226, "grad_norm": 6.53125, "learning_rate": 2.9973388889988418e-05, "loss": 0.7007735729217529, "mean_token_accuracy": 0.8299114316701889, "num_tokens": 49380593.0, "step": 24850 }, { "entropy": 0.6736725352704525, "epoch": 0.4465801410158531, "grad_norm": 6.1875, "learning_rate": 2.995930853352324e-05, "loss": 0.7083977699279785, "mean_token_accuracy": 0.8343409970402718, "num_tokens": 49400816.0, "step": 24860 }, { "entropy": 0.6473349504172802, "epoch": 0.44675977904522385, "grad_norm": 6.90625, "learning_rate": 2.9945226539282113e-05, "loss": 0.6853185176849366, "mean_token_accuracy": 0.8376095771789551, "num_tokens": 49420615.0, "step": 24870 }, { "entropy": 0.600874425470829, "epoch": 0.44693941707459467, "grad_norm": 6.78125, "learning_rate": 2.9931142911915512e-05, "loss": 0.6223116874694824, "mean_token_accuracy": 0.8470140606164932, "num_tokens": 49439231.0, "step": 24880 }, { "entropy": 0.642533902078867, "epoch": 0.4471190551039655, "grad_norm": 5.65625, "learning_rate": 2.991705765607445e-05, "loss": 0.6592984676361084, "mean_token_accuracy": 0.8327147260308265, "num_tokens": 49458789.0, "step": 24890 }, { "entropy": 0.7062618792057037, "epoch": 0.4472986931333363, "grad_norm": 5.6875, "learning_rate": 2.9902970776410484e-05, "loss": 0.7163824081420899, "mean_token_accuracy": 0.832091948390007, "num_tokens": 49478639.0, "step": 24900 }, { "entropy": 0.6589072704315185, "epoch": 0.44747833116270713, "grad_norm": 6.375, "learning_rate": 2.9888882277575707e-05, "loss": 0.6528713703155518, "mean_token_accuracy": 0.8422851070761681, "num_tokens": 49498727.0, "step": 24910 }, { "entropy": 0.6145786799490451, "epoch": 0.44765796919207795, "grad_norm": 4.96875, "learning_rate": 2.9874792164222736e-05, "loss": 0.587584114074707, "mean_token_accuracy": 0.8557287961244583, "num_tokens": 49517793.0, "step": 24920 }, { "entropy": 0.636996253579855, "epoch": 0.4478376072214488, "grad_norm": 7.15625, "learning_rate": 2.9860700441004746e-05, "loss": 0.6754997253417969, "mean_token_accuracy": 0.8291559904813767, "num_tokens": 49537370.0, "step": 24930 }, { "entropy": 0.612726590782404, "epoch": 0.4480172452508196, "grad_norm": 4.15625, "learning_rate": 2.9846607112575414e-05, "loss": 0.6053715229034424, "mean_token_accuracy": 0.8496888294816017, "num_tokens": 49556941.0, "step": 24940 }, { "entropy": 0.6087141796946526, "epoch": 0.4481968832801904, "grad_norm": 6.46875, "learning_rate": 2.9832512183588962e-05, "loss": 0.6325457572937012, "mean_token_accuracy": 0.8408694788813591, "num_tokens": 49576599.0, "step": 24950 }, { "entropy": 0.64008983746171, "epoch": 0.44837652130956124, "grad_norm": 6.46875, "learning_rate": 2.9818415658700145e-05, "loss": 0.6202704906463623, "mean_token_accuracy": 0.8437325850129127, "num_tokens": 49596679.0, "step": 24960 }, { "entropy": 0.604790635406971, "epoch": 0.44855615933893206, "grad_norm": 9.625, "learning_rate": 2.9804317542564232e-05, "loss": 0.6460066795349121, "mean_token_accuracy": 0.843159033358097, "num_tokens": 49615915.0, "step": 24970 }, { "entropy": 0.5462105844169856, "epoch": 0.4487357973683029, "grad_norm": 6.09375, "learning_rate": 2.9790217839837024e-05, "loss": 0.583113431930542, "mean_token_accuracy": 0.8569620534777641, "num_tokens": 49635193.0, "step": 24980 }, { "entropy": 0.6619690850377082, "epoch": 0.4489154353976737, "grad_norm": 5.0625, "learning_rate": 2.9776116555174848e-05, "loss": 0.6237630367279052, "mean_token_accuracy": 0.8396276220679283, "num_tokens": 49655352.0, "step": 24990 }, { "epoch": 0.4490950734270445, "eval_entropy": 0.6292575550675392, "eval_loss": 0.6323664784431458, "eval_mean_token_accuracy": 0.8447910149097443, "eval_num_tokens": 49674772.0, "eval_runtime": 40.5094, "eval_samples_per_second": 49.371, "eval_steps_per_second": 6.171, "step": 25000 }, { "entropy": 0.638684949092567, "epoch": 0.44927471145641534, "grad_norm": 4.78125, "learning_rate": 2.9747909258673506e-05, "loss": 0.6595239639282227, "mean_token_accuracy": 0.836548687517643, "num_tokens": 49694382.0, "step": 25010 }, { "entropy": 0.7055387504398822, "epoch": 0.44945434948578616, "grad_norm": 5.78125, "learning_rate": 2.9733803256149612e-05, "loss": 0.7578374862670898, "mean_token_accuracy": 0.8209755778312683, "num_tokens": 49714637.0, "step": 25020 }, { "entropy": 0.6387829348444939, "epoch": 0.449633987515157, "grad_norm": 6.0, "learning_rate": 2.9719695690321243e-05, "loss": 0.6398033142089844, "mean_token_accuracy": 0.8389146134257317, "num_tokens": 49733850.0, "step": 25030 }, { "entropy": 0.643056233972311, "epoch": 0.44981362554452775, "grad_norm": 7.90625, "learning_rate": 2.9705586565847347e-05, "loss": 0.6638535499572754, "mean_token_accuracy": 0.8431431859731674, "num_tokens": 49753411.0, "step": 25040 }, { "entropy": 0.5584363348782062, "epoch": 0.44999326357389857, "grad_norm": 8.125, "learning_rate": 2.969147588738735e-05, "loss": 0.5573175430297852, "mean_token_accuracy": 0.8553016409277916, "num_tokens": 49772143.0, "step": 25050 }, { "entropy": 0.6667997360229492, "epoch": 0.4501729016032694, "grad_norm": 9.1875, "learning_rate": 2.967736365960121e-05, "loss": 0.6630809307098389, "mean_token_accuracy": 0.8395236819982529, "num_tokens": 49791977.0, "step": 25060 }, { "entropy": 0.674366020783782, "epoch": 0.4503525396326402, "grad_norm": 6.59375, "learning_rate": 2.966324988714938e-05, "loss": 0.6595981597900391, "mean_token_accuracy": 0.8447778016328812, "num_tokens": 49810932.0, "step": 25070 }, { "entropy": 0.6593878965824842, "epoch": 0.45053217766201104, "grad_norm": 6.53125, "learning_rate": 2.9649134574692834e-05, "loss": 0.6435557842254639, "mean_token_accuracy": 0.8381580978631973, "num_tokens": 49831365.0, "step": 25080 }, { "entropy": 0.6742773965001106, "epoch": 0.45071181569138186, "grad_norm": 5.59375, "learning_rate": 2.9635017726893057e-05, "loss": 0.6652705669403076, "mean_token_accuracy": 0.8452425882220268, "num_tokens": 49850210.0, "step": 25090 }, { "entropy": 0.6782958213239908, "epoch": 0.4508914537207527, "grad_norm": 7.125, "learning_rate": 2.9620899348412028e-05, "loss": 0.6942856311798096, "mean_token_accuracy": 0.8309721395373344, "num_tokens": 49870124.0, "step": 25100 }, { "entropy": 0.666462529078126, "epoch": 0.4510710917501235, "grad_norm": 6.4375, "learning_rate": 2.960677944391226e-05, "loss": 0.6675957679748535, "mean_token_accuracy": 0.8296088501811028, "num_tokens": 49890310.0, "step": 25110 }, { "entropy": 0.629999179393053, "epoch": 0.4512507297794943, "grad_norm": 5.15625, "learning_rate": 2.9592658018056717e-05, "loss": 0.6155696868896484, "mean_token_accuracy": 0.849763223528862, "num_tokens": 49910540.0, "step": 25120 }, { "entropy": 0.6640816450119018, "epoch": 0.45143036780886514, "grad_norm": 6.71875, "learning_rate": 2.957853507550893e-05, "loss": 0.6632445335388184, "mean_token_accuracy": 0.8374566316604615, "num_tokens": 49929541.0, "step": 25130 }, { "entropy": 0.6631264202296734, "epoch": 0.45161000583823596, "grad_norm": 5.34375, "learning_rate": 2.9564410620932876e-05, "loss": 0.6752084732055664, "mean_token_accuracy": 0.8368457749485969, "num_tokens": 49948952.0, "step": 25140 }, { "entropy": 0.656722454726696, "epoch": 0.4517896438676068, "grad_norm": 9.1875, "learning_rate": 2.9550284658993066e-05, "loss": 0.6669083595275879, "mean_token_accuracy": 0.834371255338192, "num_tokens": 49968963.0, "step": 25150 }, { "entropy": 0.631779707968235, "epoch": 0.4519692818969776, "grad_norm": 4.8125, "learning_rate": 2.95361571943545e-05, "loss": 0.6154253005981445, "mean_token_accuracy": 0.8475814059376716, "num_tokens": 49990747.0, "step": 25160 }, { "entropy": 0.7300349719822407, "epoch": 0.4521489199263484, "grad_norm": 7.78125, "learning_rate": 2.9522028231682664e-05, "loss": 0.727361011505127, "mean_token_accuracy": 0.8220221385359764, "num_tokens": 50010828.0, "step": 25170 }, { "entropy": 0.5861820664256812, "epoch": 0.45232855795571925, "grad_norm": 10.25, "learning_rate": 2.950789777564355e-05, "loss": 0.6004938125610352, "mean_token_accuracy": 0.8485207810997963, "num_tokens": 50031216.0, "step": 25180 }, { "entropy": 0.5503634229302407, "epoch": 0.45250819598509007, "grad_norm": 7.59375, "learning_rate": 2.949376583090363e-05, "loss": 0.526863956451416, "mean_token_accuracy": 0.8697680130600929, "num_tokens": 50051311.0, "step": 25190 }, { "entropy": 0.6283725298941135, "epoch": 0.4526878340144609, "grad_norm": 7.875, "learning_rate": 2.9479632402129904e-05, "loss": 0.63141770362854, "mean_token_accuracy": 0.8399059519171714, "num_tokens": 50071451.0, "step": 25200 }, { "entropy": 0.627512489259243, "epoch": 0.45286747204383165, "grad_norm": 6.53125, "learning_rate": 2.94654974939898e-05, "loss": 0.6458745956420898, "mean_token_accuracy": 0.8321477234363556, "num_tokens": 50091831.0, "step": 25210 }, { "entropy": 0.6924109339714051, "epoch": 0.4530471100732025, "grad_norm": 6.5, "learning_rate": 2.9451361111151293e-05, "loss": 0.6783711433410644, "mean_token_accuracy": 0.8283683940768242, "num_tokens": 50111958.0, "step": 25220 }, { "entropy": 0.6518695548176765, "epoch": 0.4532267481025733, "grad_norm": 6.53125, "learning_rate": 2.943722325828281e-05, "loss": 0.5924414157867431, "mean_token_accuracy": 0.8441137000918388, "num_tokens": 50132302.0, "step": 25230 }, { "entropy": 0.6240761388093233, "epoch": 0.4534063861319441, "grad_norm": 7.25, "learning_rate": 2.9423083940053285e-05, "loss": 0.6506386756896972, "mean_token_accuracy": 0.8441406473517418, "num_tokens": 50152830.0, "step": 25240 }, { "entropy": 0.6854124598205089, "epoch": 0.45358602416131494, "grad_norm": 10.6875, "learning_rate": 2.9408943161132124e-05, "loss": 0.7455312728881835, "mean_token_accuracy": 0.8255221836268902, "num_tokens": 50172015.0, "step": 25250 }, { "entropy": 0.5960974767804146, "epoch": 0.45376566219068576, "grad_norm": 6.25, "learning_rate": 2.9394800926189205e-05, "loss": 0.6277171611785889, "mean_token_accuracy": 0.8464951530098915, "num_tokens": 50191436.0, "step": 25260 }, { "entropy": 0.5768345851451159, "epoch": 0.4539453002200566, "grad_norm": 6.09375, "learning_rate": 2.9380657239894917e-05, "loss": 0.5919283390045166, "mean_token_accuracy": 0.8517137989401817, "num_tokens": 50211268.0, "step": 25270 }, { "entropy": 0.5933682758361101, "epoch": 0.4541249382494274, "grad_norm": 5.90625, "learning_rate": 2.9366512106920095e-05, "loss": 0.5840302467346191, "mean_token_accuracy": 0.8495647132396698, "num_tokens": 50231493.0, "step": 25280 }, { "entropy": 0.6076404370367527, "epoch": 0.4543045762787982, "grad_norm": 5.875, "learning_rate": 2.935236553193609e-05, "loss": 0.6132025241851806, "mean_token_accuracy": 0.8435410961508751, "num_tokens": 50251284.0, "step": 25290 }, { "entropy": 0.7315272923558951, "epoch": 0.45448421430816904, "grad_norm": 5.21875, "learning_rate": 2.9338217519614675e-05, "loss": 0.7790263175964356, "mean_token_accuracy": 0.820195198059082, "num_tokens": 50270751.0, "step": 25300 }, { "entropy": 0.6670715101063251, "epoch": 0.45466385233753986, "grad_norm": 6.1875, "learning_rate": 2.932406807462815e-05, "loss": 0.6770613193511963, "mean_token_accuracy": 0.8367348626255989, "num_tokens": 50291656.0, "step": 25310 }, { "entropy": 0.6457675602287054, "epoch": 0.4548434903669107, "grad_norm": 5.40625, "learning_rate": 2.9309917201649266e-05, "loss": 0.612489652633667, "mean_token_accuracy": 0.844483008980751, "num_tokens": 50310552.0, "step": 25320 }, { "entropy": 0.6395229611545801, "epoch": 0.4550231283962815, "grad_norm": 6.46875, "learning_rate": 2.9295764905351247e-05, "loss": 0.6768513202667237, "mean_token_accuracy": 0.848475331068039, "num_tokens": 50330173.0, "step": 25330 }, { "entropy": 0.5990995306521654, "epoch": 0.4552027664256523, "grad_norm": 9.3125, "learning_rate": 2.9281611190407783e-05, "loss": 0.601787805557251, "mean_token_accuracy": 0.8497443243861198, "num_tokens": 50349617.0, "step": 25340 }, { "entropy": 0.693512424826622, "epoch": 0.45538240445502315, "grad_norm": 5.84375, "learning_rate": 2.9267456061493037e-05, "loss": 0.7133592128753662, "mean_token_accuracy": 0.828156964480877, "num_tokens": 50370045.0, "step": 25350 }, { "entropy": 0.6325917668640614, "epoch": 0.45556204248439397, "grad_norm": 7.96875, "learning_rate": 2.925329952328163e-05, "loss": 0.6935085773468017, "mean_token_accuracy": 0.829437917470932, "num_tokens": 50390556.0, "step": 25360 }, { "entropy": 0.6913409329950809, "epoch": 0.4557416805137648, "grad_norm": 6.375, "learning_rate": 2.9239141580448675e-05, "loss": 0.7083559513092041, "mean_token_accuracy": 0.8345638900995255, "num_tokens": 50410548.0, "step": 25370 }, { "entropy": 0.637165478989482, "epoch": 0.45592131854313556, "grad_norm": 7.46875, "learning_rate": 2.9224982237669723e-05, "loss": 0.6610452651977539, "mean_token_accuracy": 0.8335252806544304, "num_tokens": 50429588.0, "step": 25380 }, { "entropy": 0.6131776116788388, "epoch": 0.4561009565725064, "grad_norm": 4.71875, "learning_rate": 2.9210821499620787e-05, "loss": 0.5746246337890625, "mean_token_accuracy": 0.8555165618658066, "num_tokens": 50449342.0, "step": 25390 }, { "entropy": 0.6258339460939168, "epoch": 0.4562805946018772, "grad_norm": 7.625, "learning_rate": 2.9196659370978363e-05, "loss": 0.6317354679107666, "mean_token_accuracy": 0.8398290351033211, "num_tokens": 50468952.0, "step": 25400 }, { "entropy": 0.5593230076134205, "epoch": 0.456460232631248, "grad_norm": 4.875, "learning_rate": 2.9182495856419377e-05, "loss": 0.5120494842529297, "mean_token_accuracy": 0.8629510864615441, "num_tokens": 50490052.0, "step": 25410 }, { "entropy": 0.6611490480601787, "epoch": 0.45663987066061884, "grad_norm": 5.625, "learning_rate": 2.9168330960621243e-05, "loss": 0.7093032836914063, "mean_token_accuracy": 0.8329256534576416, "num_tokens": 50510165.0, "step": 25420 }, { "entropy": 0.6370770268142223, "epoch": 0.45681950868998966, "grad_norm": 5.3125, "learning_rate": 2.9154164688261803e-05, "loss": 0.6011889934539795, "mean_token_accuracy": 0.8522447913885116, "num_tokens": 50529615.0, "step": 25430 }, { "entropy": 0.645000410079956, "epoch": 0.4569991467193605, "grad_norm": 6.125, "learning_rate": 2.9139997044019375e-05, "loss": 0.6536627769470215, "mean_token_accuracy": 0.8377035349607468, "num_tokens": 50550132.0, "step": 25440 }, { "entropy": 0.7422636657953262, "epoch": 0.4571787847487313, "grad_norm": 4.8125, "learning_rate": 2.9125828032572718e-05, "loss": 0.8207412719726562, "mean_token_accuracy": 0.8069488435983658, "num_tokens": 50571378.0, "step": 25450 }, { "entropy": 0.6084121130406857, "epoch": 0.4573584227781021, "grad_norm": 5.5625, "learning_rate": 2.9111657658601043e-05, "loss": 0.621738052368164, "mean_token_accuracy": 0.846948866546154, "num_tokens": 50591551.0, "step": 25460 }, { "entropy": 0.5886890947818756, "epoch": 0.45753806080747295, "grad_norm": 6.15625, "learning_rate": 2.909748592678402e-05, "loss": 0.5699174404144287, "mean_token_accuracy": 0.8514479652047158, "num_tokens": 50611327.0, "step": 25470 }, { "entropy": 0.6397239524871111, "epoch": 0.45771769883684377, "grad_norm": 3.78125, "learning_rate": 2.908331284180176e-05, "loss": 0.6495782852172851, "mean_token_accuracy": 0.8374035209417343, "num_tokens": 50631131.0, "step": 25480 }, { "entropy": 0.6873040594160557, "epoch": 0.4578973368662146, "grad_norm": 5.28125, "learning_rate": 2.9069138408334817e-05, "loss": 0.6738361358642578, "mean_token_accuracy": 0.8331977978348732, "num_tokens": 50651039.0, "step": 25490 }, { "entropy": 0.6267948567867279, "epoch": 0.4580769748955854, "grad_norm": 5.28125, "learning_rate": 2.9054962631064196e-05, "loss": 0.6212169170379639, "mean_token_accuracy": 0.840568694472313, "num_tokens": 50672373.0, "step": 25500 }, { "entropy": 0.6677661683410406, "epoch": 0.45825661292495623, "grad_norm": 5.78125, "learning_rate": 2.9040785514671358e-05, "loss": 0.7249666213989258, "mean_token_accuracy": 0.825019097328186, "num_tokens": 50693258.0, "step": 25510 }, { "entropy": 0.5941379114985466, "epoch": 0.45843625095432705, "grad_norm": 5.0625, "learning_rate": 2.9026607063838186e-05, "loss": 0.572938060760498, "mean_token_accuracy": 0.8503668770194054, "num_tokens": 50712640.0, "step": 25520 }, { "entropy": 0.6403566155582666, "epoch": 0.4586158889836979, "grad_norm": 6.5625, "learning_rate": 2.9012427283247005e-05, "loss": 0.632210636138916, "mean_token_accuracy": 0.8391883745789528, "num_tokens": 50731832.0, "step": 25530 }, { "entropy": 0.600138621032238, "epoch": 0.4587955270130687, "grad_norm": 7.0625, "learning_rate": 2.899824617758059e-05, "loss": 0.5980629444122314, "mean_token_accuracy": 0.8472205772995949, "num_tokens": 50752141.0, "step": 25540 }, { "entropy": 0.7062356412410736, "epoch": 0.45897516504243946, "grad_norm": 6.625, "learning_rate": 2.898406375152215e-05, "loss": 0.7078725814819335, "mean_token_accuracy": 0.8208790302276612, "num_tokens": 50771039.0, "step": 25550 }, { "entropy": 0.6620148822665215, "epoch": 0.4591548030718103, "grad_norm": 8.0, "learning_rate": 2.896988000975533e-05, "loss": 0.6740068435668946, "mean_token_accuracy": 0.8431305274367332, "num_tokens": 50790402.0, "step": 25560 }, { "entropy": 0.5858115360140801, "epoch": 0.4593344411011811, "grad_norm": 6.15625, "learning_rate": 2.8955694956964212e-05, "loss": 0.6215967178344727, "mean_token_accuracy": 0.8493713468313218, "num_tokens": 50808872.0, "step": 25570 }, { "entropy": 0.7574009954929352, "epoch": 0.4595140791305519, "grad_norm": 7.09375, "learning_rate": 2.8941508597833295e-05, "loss": 0.7576849460601807, "mean_token_accuracy": 0.8182817742228508, "num_tokens": 50828996.0, "step": 25580 }, { "entropy": 0.6275342617183923, "epoch": 0.45969371715992274, "grad_norm": 7.71875, "learning_rate": 2.8927320937047536e-05, "loss": 0.6255920886993408, "mean_token_accuracy": 0.8419717267155647, "num_tokens": 50848034.0, "step": 25590 }, { "entropy": 0.6065071992576122, "epoch": 0.45987335518929356, "grad_norm": 4.5, "learning_rate": 2.8913131979292298e-05, "loss": 0.5861433029174805, "mean_token_accuracy": 0.8565980672836304, "num_tokens": 50868084.0, "step": 25600 }, { "entropy": 0.6757667608559131, "epoch": 0.4600529932186644, "grad_norm": 7.21875, "learning_rate": 2.8898941729253386e-05, "loss": 0.6780172348022461, "mean_token_accuracy": 0.8281867980957032, "num_tokens": 50886944.0, "step": 25610 }, { "entropy": 0.6902949158102274, "epoch": 0.4602326312480352, "grad_norm": 7.28125, "learning_rate": 2.888475019161704e-05, "loss": 0.6881210803985596, "mean_token_accuracy": 0.8257127717137337, "num_tokens": 50906240.0, "step": 25620 }, { "entropy": 0.6011094443500042, "epoch": 0.460412269277406, "grad_norm": 7.875, "learning_rate": 2.8870557371069884e-05, "loss": 0.6133516788482666, "mean_token_accuracy": 0.8461831539869309, "num_tokens": 50926740.0, "step": 25630 }, { "entropy": 0.6040114372968673, "epoch": 0.46059190730677685, "grad_norm": 5.25, "learning_rate": 2.8856363272299018e-05, "loss": 0.5971450328826904, "mean_token_accuracy": 0.8495015546679496, "num_tokens": 50945992.0, "step": 25640 }, { "entropy": 0.6934925317764282, "epoch": 0.46077154533614767, "grad_norm": 8.0625, "learning_rate": 2.8842167899991933e-05, "loss": 0.7048426151275635, "mean_token_accuracy": 0.8351691097021103, "num_tokens": 50965222.0, "step": 25650 }, { "entropy": 0.6329482924193144, "epoch": 0.4609511833655185, "grad_norm": 4.6875, "learning_rate": 2.882797125883657e-05, "loss": 0.6606556892395019, "mean_token_accuracy": 0.8396263301372529, "num_tokens": 50986202.0, "step": 25660 }, { "entropy": 0.5530278362333775, "epoch": 0.4611308213948893, "grad_norm": 6.96875, "learning_rate": 2.8813773353521223e-05, "loss": 0.5789451599121094, "mean_token_accuracy": 0.8534066557884217, "num_tokens": 51005457.0, "step": 25670 }, { "entropy": 0.6640733372420072, "epoch": 0.46131045942426013, "grad_norm": 5.15625, "learning_rate": 2.8799574188734685e-05, "loss": 0.6331408023834229, "mean_token_accuracy": 0.8493509814143181, "num_tokens": 51024106.0, "step": 25680 }, { "entropy": 0.7068748187273741, "epoch": 0.46149009745363095, "grad_norm": 6.03125, "learning_rate": 2.8785373769166113e-05, "loss": 0.7153264999389648, "mean_token_accuracy": 0.8256227418780326, "num_tokens": 51045094.0, "step": 25690 }, { "entropy": 0.5893899440765381, "epoch": 0.4616697354830018, "grad_norm": 5.28125, "learning_rate": 2.87711720995051e-05, "loss": 0.5735009193420411, "mean_token_accuracy": 0.8588044553995132, "num_tokens": 51064576.0, "step": 25700 }, { "entropy": 0.6313374683260917, "epoch": 0.4618493735123726, "grad_norm": 6.71875, "learning_rate": 2.875696918444164e-05, "loss": 0.6082898139953613, "mean_token_accuracy": 0.846271063387394, "num_tokens": 51085428.0, "step": 25710 }, { "entropy": 0.5920072223991155, "epoch": 0.46202901154174336, "grad_norm": 6.5, "learning_rate": 2.8742765028666142e-05, "loss": 0.6229467868804932, "mean_token_accuracy": 0.8434670001268387, "num_tokens": 51104251.0, "step": 25720 }, { "entropy": 0.6229615122079849, "epoch": 0.4622086495711142, "grad_norm": 6.625, "learning_rate": 2.8728559636869435e-05, "loss": 0.6378118991851807, "mean_token_accuracy": 0.8415612027049064, "num_tokens": 51124070.0, "step": 25730 }, { "entropy": 0.6763359542936087, "epoch": 0.462388287600485, "grad_norm": 6.15625, "learning_rate": 2.8714353013742736e-05, "loss": 0.6679882526397705, "mean_token_accuracy": 0.8349309280514717, "num_tokens": 51143765.0, "step": 25740 }, { "entropy": 0.669699078425765, "epoch": 0.4625679256298558, "grad_norm": 6.21875, "learning_rate": 2.8700145163977697e-05, "loss": 0.6854621887207031, "mean_token_accuracy": 0.8312308505177498, "num_tokens": 51163628.0, "step": 25750 }, { "entropy": 0.6926385834813118, "epoch": 0.46274756365922665, "grad_norm": 6.125, "learning_rate": 2.8685936092266334e-05, "loss": 0.6914441585540771, "mean_token_accuracy": 0.8288914635777473, "num_tokens": 51183202.0, "step": 25760 }, { "entropy": 0.6186100497841835, "epoch": 0.46292720168859747, "grad_norm": 6.71875, "learning_rate": 2.8671725803301114e-05, "loss": 0.6753859043121337, "mean_token_accuracy": 0.8333504065871239, "num_tokens": 51202883.0, "step": 25770 }, { "entropy": 0.6608428992331028, "epoch": 0.4631068397179683, "grad_norm": 5.34375, "learning_rate": 2.8657514301774864e-05, "loss": 0.6533806800842286, "mean_token_accuracy": 0.8425754457712173, "num_tokens": 51223523.0, "step": 25780 }, { "entropy": 0.6102218974381686, "epoch": 0.4632864777473391, "grad_norm": 5.46875, "learning_rate": 2.8643301592380843e-05, "loss": 0.6256093978881836, "mean_token_accuracy": 0.8441969484090805, "num_tokens": 51243262.0, "step": 25790 }, { "entropy": 0.8202163949608803, "epoch": 0.46346611577670993, "grad_norm": 6.1875, "learning_rate": 2.8629087679812693e-05, "loss": 0.7995344638824463, "mean_token_accuracy": 0.811702573299408, "num_tokens": 51263221.0, "step": 25800 }, { "entropy": 0.64853769633919, "epoch": 0.46364575380608075, "grad_norm": 9.0, "learning_rate": 2.861487256876445e-05, "loss": 0.6470497608184814, "mean_token_accuracy": 0.8406313449144364, "num_tokens": 51282773.0, "step": 25810 }, { "entropy": 0.7274887137115001, "epoch": 0.4638253918354516, "grad_norm": 5.84375, "learning_rate": 2.860065626393056e-05, "loss": 0.766373586654663, "mean_token_accuracy": 0.8170804768800736, "num_tokens": 51301855.0, "step": 25820 }, { "entropy": 0.657333143800497, "epoch": 0.4640050298648224, "grad_norm": 7.6875, "learning_rate": 2.8586438770005846e-05, "loss": 0.6868473529815674, "mean_token_accuracy": 0.8316267430782318, "num_tokens": 51321462.0, "step": 25830 }, { "entropy": 0.6249050987884402, "epoch": 0.4641846678941932, "grad_norm": 5.09375, "learning_rate": 2.8572220091685552e-05, "loss": 0.6120130538940429, "mean_token_accuracy": 0.8491566121578217, "num_tokens": 51341980.0, "step": 25840 }, { "entropy": 0.6045302528887987, "epoch": 0.46436430592356404, "grad_norm": 5.28125, "learning_rate": 2.8558000233665274e-05, "loss": 0.5650796890258789, "mean_token_accuracy": 0.8537971988320351, "num_tokens": 51362139.0, "step": 25850 }, { "entropy": 0.6725374810397625, "epoch": 0.46454394395293486, "grad_norm": 7.125, "learning_rate": 2.854377920064103e-05, "loss": 0.6571398258209229, "mean_token_accuracy": 0.8342468813061714, "num_tokens": 51382179.0, "step": 25860 }, { "entropy": 0.5756803572177887, "epoch": 0.4647235819823057, "grad_norm": 5.09375, "learning_rate": 2.8529556997309198e-05, "loss": 0.5507289886474609, "mean_token_accuracy": 0.8598543912172317, "num_tokens": 51401893.0, "step": 25870 }, { "entropy": 0.6082211524248123, "epoch": 0.4649032200116765, "grad_norm": 8.9375, "learning_rate": 2.8515333628366586e-05, "loss": 0.6282366275787353, "mean_token_accuracy": 0.8454065442085266, "num_tokens": 51421743.0, "step": 25880 }, { "entropy": 0.6294764690101147, "epoch": 0.46508285804104726, "grad_norm": 4.4375, "learning_rate": 2.850110909851033e-05, "loss": 0.6501500606536865, "mean_token_accuracy": 0.835572762787342, "num_tokens": 51440908.0, "step": 25890 }, { "entropy": 0.6060632511973381, "epoch": 0.4652624960704181, "grad_norm": 7.875, "learning_rate": 2.8486883412437998e-05, "loss": 0.6195859909057617, "mean_token_accuracy": 0.8399563387036324, "num_tokens": 51460793.0, "step": 25900 }, { "entropy": 0.6406848393380642, "epoch": 0.4654421340997889, "grad_norm": 7.21875, "learning_rate": 2.8472656574847508e-05, "loss": 0.6472595691680908, "mean_token_accuracy": 0.8409404948353767, "num_tokens": 51480438.0, "step": 25910 }, { "entropy": 0.6251276426017285, "epoch": 0.46562177212915973, "grad_norm": 6.15625, "learning_rate": 2.845842859043718e-05, "loss": 0.6895182609558106, "mean_token_accuracy": 0.832318739593029, "num_tokens": 51502089.0, "step": 25920 }, { "entropy": 0.6077856305986643, "epoch": 0.46580141015853055, "grad_norm": 6.34375, "learning_rate": 2.8444199463905703e-05, "loss": 0.5685009002685547, "mean_token_accuracy": 0.854977959394455, "num_tokens": 51522751.0, "step": 25930 }, { "entropy": 0.5694128222763538, "epoch": 0.46598104818790137, "grad_norm": 4.84375, "learning_rate": 2.8429969199952128e-05, "loss": 0.5380094051361084, "mean_token_accuracy": 0.8683346420526504, "num_tokens": 51542375.0, "step": 25940 }, { "entropy": 0.6811686966568231, "epoch": 0.4661606862172722, "grad_norm": 5.9375, "learning_rate": 2.841573780327592e-05, "loss": 0.6538914680480957, "mean_token_accuracy": 0.8386504486203193, "num_tokens": 51562880.0, "step": 25950 }, { "entropy": 0.6149995278567075, "epoch": 0.466340324246643, "grad_norm": 5.6875, "learning_rate": 2.8401505278576877e-05, "loss": 0.5841248989105224, "mean_token_accuracy": 0.8548590317368507, "num_tokens": 51584160.0, "step": 25960 }, { "entropy": 0.6974666863679886, "epoch": 0.46651996227601383, "grad_norm": 7.0, "learning_rate": 2.838727163055521e-05, "loss": 0.7242869377136231, "mean_token_accuracy": 0.817896381765604, "num_tokens": 51604486.0, "step": 25970 }, { "entropy": 0.6544119141995907, "epoch": 0.46669960030538465, "grad_norm": 6.5625, "learning_rate": 2.8373036863911457e-05, "loss": 0.6475766658782959, "mean_token_accuracy": 0.8401797011494636, "num_tokens": 51623418.0, "step": 25980 }, { "entropy": 0.6466917738318443, "epoch": 0.4668792383347555, "grad_norm": 7.1875, "learning_rate": 2.8358800983346556e-05, "loss": 0.6784713745117188, "mean_token_accuracy": 0.8389300957322121, "num_tokens": 51643318.0, "step": 25990 }, { "epoch": 0.4670588763641263, "eval_entropy": 0.6190758219957352, "eval_loss": 0.624586284160614, "eval_mean_token_accuracy": 0.8457643120288849, "eval_num_tokens": 51662963.0, "eval_runtime": 40.5724, "eval_samples_per_second": 49.295, "eval_steps_per_second": 6.162, "step": 26000 } ], "logging_steps": 10, "max_steps": 55668, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 2000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.9179453258262e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }