{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.5204236006051435, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.4401287615299225, "epoch": 0.010085728693898134, "grad_norm": 2.4543752670288086, "learning_rate": 9.96975806451613e-05, "loss": 1.6213287353515624, "mean_token_accuracy": 0.7053921639919281, "num_tokens": 79097.0, "step": 10 }, { "entropy": 0.7891692698001862, "epoch": 0.020171457387796268, "grad_norm": 0.5390229821205139, "learning_rate": 9.936155913978495e-05, "loss": 0.7798945903778076, "mean_token_accuracy": 0.8249495834112167, "num_tokens": 158299.0, "step": 20 }, { "entropy": 0.724391582608223, "epoch": 0.030257186081694403, "grad_norm": 0.5045413374900818, "learning_rate": 9.90255376344086e-05, "loss": 0.7134008407592773, "mean_token_accuracy": 0.8398919939994812, "num_tokens": 238224.0, "step": 30 }, { "entropy": 0.7293597489595414, "epoch": 0.040342914775592535, "grad_norm": 0.46384477615356445, "learning_rate": 9.868951612903227e-05, "loss": 0.7243994235992431, "mean_token_accuracy": 0.8363275468349457, "num_tokens": 317353.0, "step": 40 }, { "entropy": 0.7545649409294128, "epoch": 0.05042864346949067, "grad_norm": 0.45745861530303955, "learning_rate": 9.835349462365592e-05, "loss": 0.7480543613433838, "mean_token_accuracy": 0.8288968414068222, "num_tokens": 397144.0, "step": 50 }, { "entropy": 0.7276962548494339, "epoch": 0.060514372163388806, "grad_norm": 0.4223039448261261, "learning_rate": 9.801747311827957e-05, "loss": 0.7222286701202393, "mean_token_accuracy": 0.8347062259912491, "num_tokens": 476208.0, "step": 60 }, { "entropy": 0.7208940893411636, "epoch": 0.07060010085728693, "grad_norm": 0.407697468996048, "learning_rate": 9.768145161290323e-05, "loss": 0.722746753692627, "mean_token_accuracy": 0.8354023069143295, "num_tokens": 554635.0, "step": 70 }, { "entropy": 0.6870111703872681, "epoch": 0.08068582955118507, "grad_norm": 0.4341161549091339, "learning_rate": 9.734543010752689e-05, "loss": 0.678754472732544, "mean_token_accuracy": 0.8434581071138382, "num_tokens": 634099.0, "step": 80 }, { "entropy": 0.712015038728714, "epoch": 0.0907715582450832, "grad_norm": 0.44776472449302673, "learning_rate": 9.700940860215055e-05, "loss": 0.7065191268920898, "mean_token_accuracy": 0.8397477447986603, "num_tokens": 714006.0, "step": 90 }, { "entropy": 0.7148925572633743, "epoch": 0.10085728693898134, "grad_norm": 0.5683232545852661, "learning_rate": 9.667338709677419e-05, "loss": 0.7013186454772949, "mean_token_accuracy": 0.8386768013238907, "num_tokens": 793605.0, "step": 100 }, { "entropy": 0.6803987801074982, "epoch": 0.11094301563287948, "grad_norm": 0.4578818678855896, "learning_rate": 9.633736559139785e-05, "loss": 0.6829161643981934, "mean_token_accuracy": 0.8444311052560807, "num_tokens": 873358.0, "step": 110 }, { "entropy": 0.7018243819475174, "epoch": 0.12102874432677761, "grad_norm": 0.5580450892448425, "learning_rate": 9.600134408602151e-05, "loss": 0.6889585018157959, "mean_token_accuracy": 0.837009659409523, "num_tokens": 951272.0, "step": 120 }, { "entropy": 0.6722540825605392, "epoch": 0.13111447302067575, "grad_norm": 0.4111092984676361, "learning_rate": 9.566532258064517e-05, "loss": 0.671303653717041, "mean_token_accuracy": 0.8431149035692215, "num_tokens": 1030605.0, "step": 130 }, { "entropy": 0.6760291874408721, "epoch": 0.14120020171457387, "grad_norm": 0.4307563900947571, "learning_rate": 9.532930107526882e-05, "loss": 0.6683278560638428, "mean_token_accuracy": 0.8399741470813751, "num_tokens": 1110880.0, "step": 140 }, { "entropy": 0.6972564935684205, "epoch": 0.15128593040847202, "grad_norm": 0.4529708921909332, "learning_rate": 9.499327956989248e-05, "loss": 0.6857415199279785, "mean_token_accuracy": 0.8408671110868454, "num_tokens": 1190751.0, "step": 150 }, { "entropy": 0.6963291883468627, "epoch": 0.16137165910237014, "grad_norm": 0.5361336469650269, "learning_rate": 9.465725806451613e-05, "loss": 0.6925512313842773, "mean_token_accuracy": 0.8375045716762543, "num_tokens": 1270609.0, "step": 160 }, { "entropy": 0.66875439286232, "epoch": 0.1714573877962683, "grad_norm": 0.46975305676460266, "learning_rate": 9.43212365591398e-05, "loss": 0.6634211063385009, "mean_token_accuracy": 0.8445858895778656, "num_tokens": 1349205.0, "step": 170 }, { "entropy": 0.655107605457306, "epoch": 0.1815431164901664, "grad_norm": 0.4822644293308258, "learning_rate": 9.398521505376344e-05, "loss": 0.6485553741455078, "mean_token_accuracy": 0.8466801524162293, "num_tokens": 1429188.0, "step": 180 }, { "entropy": 0.6764869809150695, "epoch": 0.19162884518406456, "grad_norm": 0.4278046488761902, "learning_rate": 9.36491935483871e-05, "loss": 0.6674195289611816, "mean_token_accuracy": 0.8449790179729462, "num_tokens": 1508657.0, "step": 190 }, { "entropy": 0.6527546226978302, "epoch": 0.20171457387796268, "grad_norm": 0.4304865598678589, "learning_rate": 9.331317204301076e-05, "loss": 0.6533342361450195, "mean_token_accuracy": 0.8459020614624023, "num_tokens": 1588683.0, "step": 200 }, { "entropy": 0.6602984070777893, "epoch": 0.2118003025718608, "grad_norm": 0.4939623177051544, "learning_rate": 9.297715053763442e-05, "loss": 0.648746109008789, "mean_token_accuracy": 0.8454504400491715, "num_tokens": 1668136.0, "step": 210 }, { "entropy": 0.6352969735860825, "epoch": 0.22188603126575895, "grad_norm": 0.509572446346283, "learning_rate": 9.264112903225807e-05, "loss": 0.6338551044464111, "mean_token_accuracy": 0.8501922994852066, "num_tokens": 1747761.0, "step": 220 }, { "entropy": 0.640106874704361, "epoch": 0.23197175995965708, "grad_norm": 0.4373609721660614, "learning_rate": 9.230510752688173e-05, "loss": 0.63339204788208, "mean_token_accuracy": 0.8499221503734589, "num_tokens": 1826998.0, "step": 230 }, { "entropy": 0.6553326368331909, "epoch": 0.24205748865355523, "grad_norm": 0.5667263269424438, "learning_rate": 9.196908602150538e-05, "loss": 0.6620019912719727, "mean_token_accuracy": 0.8443398654460907, "num_tokens": 1906898.0, "step": 240 }, { "entropy": 0.6542477309703827, "epoch": 0.2521432173474534, "grad_norm": 0.42866837978363037, "learning_rate": 9.163306451612905e-05, "loss": 0.6385551452636719, "mean_token_accuracy": 0.8501411974430084, "num_tokens": 1986598.0, "step": 250 }, { "entropy": 0.6644888401031495, "epoch": 0.2622289460413515, "grad_norm": 0.471479594707489, "learning_rate": 9.129704301075269e-05, "loss": 0.6652373790740966, "mean_token_accuracy": 0.8430449545383454, "num_tokens": 2065968.0, "step": 260 }, { "entropy": 0.6506140828132629, "epoch": 0.2723146747352496, "grad_norm": 0.5871238112449646, "learning_rate": 9.096102150537635e-05, "loss": 0.6394162654876709, "mean_token_accuracy": 0.8478008478879928, "num_tokens": 2144807.0, "step": 270 }, { "entropy": 0.6450737684965133, "epoch": 0.28240040342914774, "grad_norm": 0.4758750796318054, "learning_rate": 9.062500000000001e-05, "loss": 0.6317679405212402, "mean_token_accuracy": 0.8477421134710312, "num_tokens": 2224756.0, "step": 280 }, { "entropy": 0.6312454760074615, "epoch": 0.2924861321230459, "grad_norm": 0.40708398818969727, "learning_rate": 9.028897849462365e-05, "loss": 0.6294290065765381, "mean_token_accuracy": 0.8498372942209244, "num_tokens": 2303755.0, "step": 290 }, { "entropy": 0.6435921430587769, "epoch": 0.30257186081694404, "grad_norm": 0.4586315155029297, "learning_rate": 8.995295698924732e-05, "loss": 0.6426968574523926, "mean_token_accuracy": 0.851655799150467, "num_tokens": 2383438.0, "step": 300 }, { "entropy": 0.6444200366735459, "epoch": 0.31265758951084216, "grad_norm": 0.41651129722595215, "learning_rate": 8.961693548387097e-05, "loss": 0.6398116111755371, "mean_token_accuracy": 0.8491226196289062, "num_tokens": 2462092.0, "step": 310 }, { "entropy": 0.630822691321373, "epoch": 0.3227433182047403, "grad_norm": 0.3903122842311859, "learning_rate": 8.928091397849463e-05, "loss": 0.6180138111114502, "mean_token_accuracy": 0.8523771226406097, "num_tokens": 2540813.0, "step": 320 }, { "entropy": 0.6329970508813858, "epoch": 0.3328290468986384, "grad_norm": 0.487721711397171, "learning_rate": 8.894489247311828e-05, "loss": 0.6315666198730469, "mean_token_accuracy": 0.851043239235878, "num_tokens": 2619658.0, "step": 330 }, { "entropy": 0.6223464220762253, "epoch": 0.3429147755925366, "grad_norm": 0.44329893589019775, "learning_rate": 8.860887096774194e-05, "loss": 0.60896897315979, "mean_token_accuracy": 0.8548593938350677, "num_tokens": 2698558.0, "step": 340 }, { "entropy": 0.629158017039299, "epoch": 0.3530005042864347, "grad_norm": 0.4763728976249695, "learning_rate": 8.827284946236559e-05, "loss": 0.6243833541870117, "mean_token_accuracy": 0.8506437599658966, "num_tokens": 2777589.0, "step": 350 }, { "entropy": 0.6252221703529358, "epoch": 0.3630862329803328, "grad_norm": 0.573401153087616, "learning_rate": 8.793682795698926e-05, "loss": 0.6311960697174073, "mean_token_accuracy": 0.8492237269878388, "num_tokens": 2857260.0, "step": 360 }, { "entropy": 0.6388662099838257, "epoch": 0.37317196167423095, "grad_norm": 0.43780848383903503, "learning_rate": 8.76008064516129e-05, "loss": 0.6235979557037353, "mean_token_accuracy": 0.8501455813646317, "num_tokens": 2937031.0, "step": 370 }, { "entropy": 0.6401920437812805, "epoch": 0.3832576903681291, "grad_norm": 0.6186213493347168, "learning_rate": 8.726478494623656e-05, "loss": 0.6394696712493897, "mean_token_accuracy": 0.8473399400711059, "num_tokens": 3016793.0, "step": 380 }, { "entropy": 0.636756744980812, "epoch": 0.39334341906202724, "grad_norm": 0.4315045177936554, "learning_rate": 8.692876344086022e-05, "loss": 0.633165979385376, "mean_token_accuracy": 0.8462948054075241, "num_tokens": 3096882.0, "step": 390 }, { "entropy": 0.6365224033594131, "epoch": 0.40342914775592537, "grad_norm": 0.4226789176464081, "learning_rate": 8.659274193548388e-05, "loss": 0.6305986404418945, "mean_token_accuracy": 0.8494676142930985, "num_tokens": 3176078.0, "step": 400 }, { "entropy": 0.6208570182323456, "epoch": 0.4135148764498235, "grad_norm": 0.4235779643058777, "learning_rate": 8.625672043010753e-05, "loss": 0.6180022716522217, "mean_token_accuracy": 0.8546466052532196, "num_tokens": 3254722.0, "step": 410 }, { "entropy": 0.6532779157161712, "epoch": 0.4236006051437216, "grad_norm": 0.4319876730442047, "learning_rate": 8.592069892473119e-05, "loss": 0.6470151901245117, "mean_token_accuracy": 0.8489160239696503, "num_tokens": 3334393.0, "step": 420 }, { "entropy": 0.6273243516683579, "epoch": 0.4336863338376198, "grad_norm": 0.46169838309288025, "learning_rate": 8.558467741935484e-05, "loss": 0.6159895896911621, "mean_token_accuracy": 0.8507320910692215, "num_tokens": 3413175.0, "step": 430 }, { "entropy": 0.605324798822403, "epoch": 0.4437720625315179, "grad_norm": 0.4526413083076477, "learning_rate": 8.524865591397851e-05, "loss": 0.6038426876068115, "mean_token_accuracy": 0.8523322999477386, "num_tokens": 3492802.0, "step": 440 }, { "entropy": 0.6320730000734329, "epoch": 0.45385779122541603, "grad_norm": 0.44433295726776123, "learning_rate": 8.491263440860215e-05, "loss": 0.6316131114959717, "mean_token_accuracy": 0.8506852626800537, "num_tokens": 3572664.0, "step": 450 }, { "entropy": 0.6317211121320725, "epoch": 0.46394351991931415, "grad_norm": 0.4498536288738251, "learning_rate": 8.457661290322581e-05, "loss": 0.6204007148742676, "mean_token_accuracy": 0.853309515118599, "num_tokens": 3652196.0, "step": 460 }, { "entropy": 0.6048054486513138, "epoch": 0.47402924861321233, "grad_norm": 0.45512956380844116, "learning_rate": 8.424059139784947e-05, "loss": 0.5983153820037842, "mean_token_accuracy": 0.8557393223047256, "num_tokens": 3731796.0, "step": 470 }, { "entropy": 0.6131872147321701, "epoch": 0.48411497730711045, "grad_norm": 0.39910048246383667, "learning_rate": 8.390456989247311e-05, "loss": 0.6079683303833008, "mean_token_accuracy": 0.8534030020236969, "num_tokens": 3811294.0, "step": 480 }, { "entropy": 0.6184361279010773, "epoch": 0.49420070600100857, "grad_norm": 0.45986732840538025, "learning_rate": 8.356854838709678e-05, "loss": 0.6137691497802734, "mean_token_accuracy": 0.8516123294830322, "num_tokens": 3890846.0, "step": 490 }, { "entropy": 0.6471396833658218, "epoch": 0.5042864346949067, "grad_norm": 0.49332594871520996, "learning_rate": 8.323252688172043e-05, "loss": 0.6466721057891845, "mean_token_accuracy": 0.8456789135932923, "num_tokens": 3970491.0, "step": 500 }, { "entropy": 0.6282050013542175, "epoch": 0.5143721633888049, "grad_norm": 0.4807436168193817, "learning_rate": 8.289650537634409e-05, "loss": 0.6175512313842774, "mean_token_accuracy": 0.8522112727165222, "num_tokens": 4050021.0, "step": 510 }, { "entropy": 0.6226097255945205, "epoch": 0.524457892082703, "grad_norm": 0.40654024481773376, "learning_rate": 8.256048387096774e-05, "loss": 0.6200938701629639, "mean_token_accuracy": 0.8494216620922088, "num_tokens": 4129976.0, "step": 520 }, { "entropy": 0.6335893511772156, "epoch": 0.5345436207766011, "grad_norm": 0.4114026427268982, "learning_rate": 8.22244623655914e-05, "loss": 0.6252026081085205, "mean_token_accuracy": 0.8503925174474716, "num_tokens": 4210291.0, "step": 530 }, { "entropy": 0.6135816037654876, "epoch": 0.5446293494704992, "grad_norm": 0.41848844289779663, "learning_rate": 8.188844086021506e-05, "loss": 0.6145244121551514, "mean_token_accuracy": 0.8571697324514389, "num_tokens": 4290179.0, "step": 540 }, { "entropy": 0.6119378715753555, "epoch": 0.5547150781643974, "grad_norm": 0.48698148131370544, "learning_rate": 8.155241935483872e-05, "loss": 0.6051679134368897, "mean_token_accuracy": 0.853746697306633, "num_tokens": 4368707.0, "step": 550 }, { "entropy": 0.603636771440506, "epoch": 0.5648008068582955, "grad_norm": 0.4577937424182892, "learning_rate": 8.121639784946236e-05, "loss": 0.5904152870178223, "mean_token_accuracy": 0.854565218091011, "num_tokens": 4448005.0, "step": 560 }, { "entropy": 0.6001244992017746, "epoch": 0.5748865355521936, "grad_norm": 0.5210131406784058, "learning_rate": 8.088037634408603e-05, "loss": 0.6008370399475098, "mean_token_accuracy": 0.8562947660684586, "num_tokens": 4526862.0, "step": 570 }, { "entropy": 0.6188263714313507, "epoch": 0.5849722642460918, "grad_norm": 0.47299662232398987, "learning_rate": 8.054435483870968e-05, "loss": 0.6188117027282715, "mean_token_accuracy": 0.8530359834432601, "num_tokens": 4605637.0, "step": 580 }, { "entropy": 0.6129011958837509, "epoch": 0.59505799293999, "grad_norm": 0.465508371591568, "learning_rate": 8.020833333333334e-05, "loss": 0.6022593021392822, "mean_token_accuracy": 0.8554005295038223, "num_tokens": 4685017.0, "step": 590 }, { "entropy": 0.6162968903779984, "epoch": 0.6051437216338881, "grad_norm": 0.43233755230903625, "learning_rate": 7.9872311827957e-05, "loss": 0.6092077732086182, "mean_token_accuracy": 0.8540722340345382, "num_tokens": 4765201.0, "step": 600 }, { "entropy": 0.600800535082817, "epoch": 0.6152294503277862, "grad_norm": 0.38787180185317993, "learning_rate": 7.953629032258065e-05, "loss": 0.5950473785400391, "mean_token_accuracy": 0.8578711360692978, "num_tokens": 4844272.0, "step": 610 }, { "entropy": 0.6160470128059388, "epoch": 0.6253151790216843, "grad_norm": 0.5581951141357422, "learning_rate": 7.920026881720431e-05, "loss": 0.6130586624145508, "mean_token_accuracy": 0.8534553349018097, "num_tokens": 4923984.0, "step": 620 }, { "entropy": 0.6198133587837219, "epoch": 0.6354009077155824, "grad_norm": 0.4616735279560089, "learning_rate": 7.886424731182797e-05, "loss": 0.6103284358978271, "mean_token_accuracy": 0.8518910020589828, "num_tokens": 5003560.0, "step": 630 }, { "entropy": 0.6080410033464432, "epoch": 0.6454866364094806, "grad_norm": 0.42364850640296936, "learning_rate": 7.852822580645161e-05, "loss": 0.6008682250976562, "mean_token_accuracy": 0.8532625198364258, "num_tokens": 5083721.0, "step": 640 }, { "entropy": 0.6005331248044967, "epoch": 0.6555723651033787, "grad_norm": 0.4882436692714691, "learning_rate": 7.819220430107528e-05, "loss": 0.6017726421356201, "mean_token_accuracy": 0.8539737015962601, "num_tokens": 5162794.0, "step": 650 }, { "entropy": 0.6231147140264511, "epoch": 0.6656580937972768, "grad_norm": 0.43205761909484863, "learning_rate": 7.785618279569893e-05, "loss": 0.6104018688201904, "mean_token_accuracy": 0.8523163944482803, "num_tokens": 5242716.0, "step": 660 }, { "entropy": 0.5988608807325363, "epoch": 0.675743822491175, "grad_norm": 0.45438122749328613, "learning_rate": 7.752016129032259e-05, "loss": 0.6024129390716553, "mean_token_accuracy": 0.8553207635879516, "num_tokens": 5321928.0, "step": 670 }, { "entropy": 0.6223491996526718, "epoch": 0.6858295511850732, "grad_norm": 0.4512474834918976, "learning_rate": 7.718413978494624e-05, "loss": 0.6082096099853516, "mean_token_accuracy": 0.8545188844203949, "num_tokens": 5401348.0, "step": 680 }, { "entropy": 0.6194269865751266, "epoch": 0.6959152798789713, "grad_norm": 0.4599096179008484, "learning_rate": 7.684811827956989e-05, "loss": 0.6193777561187744, "mean_token_accuracy": 0.8514397442340851, "num_tokens": 5480681.0, "step": 690 }, { "entropy": 0.6062219262123107, "epoch": 0.7060010085728694, "grad_norm": 0.5039567947387695, "learning_rate": 7.651209677419356e-05, "loss": 0.5999524116516113, "mean_token_accuracy": 0.8567820072174073, "num_tokens": 5559946.0, "step": 700 }, { "entropy": 0.59709934592247, "epoch": 0.7160867372667675, "grad_norm": 0.3883519470691681, "learning_rate": 7.61760752688172e-05, "loss": 0.5958030700683594, "mean_token_accuracy": 0.8547020137310029, "num_tokens": 5638762.0, "step": 710 }, { "entropy": 0.6092049956321717, "epoch": 0.7261724659606656, "grad_norm": 0.4532882273197174, "learning_rate": 7.584005376344086e-05, "loss": 0.5958750724792481, "mean_token_accuracy": 0.8556324869394303, "num_tokens": 5718851.0, "step": 720 }, { "entropy": 0.6095692694187165, "epoch": 0.7362581946545638, "grad_norm": 0.4741406738758087, "learning_rate": 7.550403225806452e-05, "loss": 0.610473346710205, "mean_token_accuracy": 0.8528454750776291, "num_tokens": 5797970.0, "step": 730 }, { "entropy": 0.6113681852817535, "epoch": 0.7463439233484619, "grad_norm": 0.4759446382522583, "learning_rate": 7.516801075268818e-05, "loss": 0.6012178421020508, "mean_token_accuracy": 0.8544665992259979, "num_tokens": 5876757.0, "step": 740 }, { "entropy": 0.6085548311471939, "epoch": 0.75642965204236, "grad_norm": 0.41346922516822815, "learning_rate": 7.483198924731182e-05, "loss": 0.6044020652770996, "mean_token_accuracy": 0.8550712764263153, "num_tokens": 5955819.0, "step": 750 }, { "entropy": 0.6155774682760239, "epoch": 0.7665153807362582, "grad_norm": 0.4597516357898712, "learning_rate": 7.44959677419355e-05, "loss": 0.6060014247894288, "mean_token_accuracy": 0.8542042136192322, "num_tokens": 6035167.0, "step": 760 }, { "entropy": 0.6068645745515824, "epoch": 0.7766011094301564, "grad_norm": 0.4649045765399933, "learning_rate": 7.415994623655914e-05, "loss": 0.6007673740386963, "mean_token_accuracy": 0.8525227665901184, "num_tokens": 6113853.0, "step": 770 }, { "entropy": 0.6005396485328675, "epoch": 0.7866868381240545, "grad_norm": 0.48349109292030334, "learning_rate": 7.382392473118281e-05, "loss": 0.5998473167419434, "mean_token_accuracy": 0.8538594901561737, "num_tokens": 6193206.0, "step": 780 }, { "entropy": 0.6022996723651886, "epoch": 0.7967725668179526, "grad_norm": 0.49629247188568115, "learning_rate": 7.348790322580645e-05, "loss": 0.597620677947998, "mean_token_accuracy": 0.8530676156282425, "num_tokens": 6271687.0, "step": 790 }, { "entropy": 0.5972118631005288, "epoch": 0.8068582955118507, "grad_norm": 0.4917770028114319, "learning_rate": 7.315188172043011e-05, "loss": 0.5890127658843994, "mean_token_accuracy": 0.8561224609613418, "num_tokens": 6351649.0, "step": 800 }, { "entropy": 0.5830775499343872, "epoch": 0.8169440242057489, "grad_norm": 0.43750327825546265, "learning_rate": 7.281586021505377e-05, "loss": 0.5748737335205079, "mean_token_accuracy": 0.857504940032959, "num_tokens": 6431689.0, "step": 810 }, { "entropy": 0.5911667436361313, "epoch": 0.827029752899647, "grad_norm": 0.45151153206825256, "learning_rate": 7.247983870967743e-05, "loss": 0.5893730163574219, "mean_token_accuracy": 0.8561951071023941, "num_tokens": 6510170.0, "step": 820 }, { "entropy": 0.6108928948640824, "epoch": 0.8371154815935451, "grad_norm": 0.42554008960723877, "learning_rate": 7.214381720430107e-05, "loss": 0.6033421039581299, "mean_token_accuracy": 0.8555109530687333, "num_tokens": 6590115.0, "step": 830 }, { "entropy": 0.6150878429412842, "epoch": 0.8472012102874432, "grad_norm": 0.4883771538734436, "learning_rate": 7.180779569892473e-05, "loss": 0.6113218307495117, "mean_token_accuracy": 0.8518930107355118, "num_tokens": 6669457.0, "step": 840 }, { "entropy": 0.6158306688070297, "epoch": 0.8572869389813415, "grad_norm": 0.4417215883731842, "learning_rate": 7.147177419354839e-05, "loss": 0.6072550296783448, "mean_token_accuracy": 0.852121776342392, "num_tokens": 6748544.0, "step": 850 }, { "entropy": 0.6014792859554291, "epoch": 0.8673726676752396, "grad_norm": 0.47120651602745056, "learning_rate": 7.113575268817205e-05, "loss": 0.6035449504852295, "mean_token_accuracy": 0.855668443441391, "num_tokens": 6828527.0, "step": 860 }, { "entropy": 0.610417115688324, "epoch": 0.8774583963691377, "grad_norm": 0.4029320478439331, "learning_rate": 7.07997311827957e-05, "loss": 0.5991814613342286, "mean_token_accuracy": 0.8501907676458359, "num_tokens": 6907265.0, "step": 870 }, { "entropy": 0.5880232125520706, "epoch": 0.8875441250630358, "grad_norm": 0.44422170519828796, "learning_rate": 7.046370967741935e-05, "loss": 0.589336633682251, "mean_token_accuracy": 0.8592681288719177, "num_tokens": 6987355.0, "step": 880 }, { "entropy": 0.6167952179908752, "epoch": 0.8976298537569339, "grad_norm": 0.47287294268608093, "learning_rate": 7.012768817204302e-05, "loss": 0.6005054950714112, "mean_token_accuracy": 0.8538300514221191, "num_tokens": 7067079.0, "step": 890 }, { "entropy": 0.6062485039234161, "epoch": 0.9077155824508321, "grad_norm": 0.4330484867095947, "learning_rate": 6.979166666666666e-05, "loss": 0.6009212017059327, "mean_token_accuracy": 0.8540766119956971, "num_tokens": 7146070.0, "step": 900 }, { "entropy": 0.6166725903749466, "epoch": 0.9178013111447302, "grad_norm": 0.4636240303516388, "learning_rate": 6.945564516129032e-05, "loss": 0.6120401859283447, "mean_token_accuracy": 0.8512512564659118, "num_tokens": 7225040.0, "step": 910 }, { "entropy": 0.5857499420642853, "epoch": 0.9278870398386283, "grad_norm": 0.45182108879089355, "learning_rate": 6.911962365591398e-05, "loss": 0.5876169204711914, "mean_token_accuracy": 0.8554476648569107, "num_tokens": 7304455.0, "step": 920 }, { "entropy": 0.6012028098106384, "epoch": 0.9379727685325264, "grad_norm": 0.4051869213581085, "learning_rate": 6.878360215053764e-05, "loss": 0.5880671977996826, "mean_token_accuracy": 0.8549540996551513, "num_tokens": 7383515.0, "step": 930 }, { "entropy": 0.6061528742313385, "epoch": 0.9480584972264247, "grad_norm": 0.4764135479927063, "learning_rate": 6.84475806451613e-05, "loss": 0.5949277877807617, "mean_token_accuracy": 0.8549325942993165, "num_tokens": 7462560.0, "step": 940 }, { "entropy": 0.5890018880367279, "epoch": 0.9581442259203228, "grad_norm": 0.3977248966693878, "learning_rate": 6.811155913978495e-05, "loss": 0.5861643314361572, "mean_token_accuracy": 0.8562160313129425, "num_tokens": 7542318.0, "step": 950 }, { "entropy": 0.569082447886467, "epoch": 0.9682299546142209, "grad_norm": 0.45443686842918396, "learning_rate": 6.77755376344086e-05, "loss": 0.5597212314605713, "mean_token_accuracy": 0.8636837095022202, "num_tokens": 7619896.0, "step": 960 }, { "entropy": 0.6035693377256394, "epoch": 0.978315683308119, "grad_norm": 0.4136727452278137, "learning_rate": 6.743951612903227e-05, "loss": 0.5982972145080566, "mean_token_accuracy": 0.852931946516037, "num_tokens": 7699479.0, "step": 970 }, { "entropy": 0.6018765300512314, "epoch": 0.9884014120020171, "grad_norm": 0.4627329707145691, "learning_rate": 6.710349462365591e-05, "loss": 0.6014264106750489, "mean_token_accuracy": 0.8550704807043076, "num_tokens": 7777973.0, "step": 980 }, { "entropy": 0.6101315438747406, "epoch": 0.9984871406959153, "grad_norm": 0.43074938654899597, "learning_rate": 6.676747311827957e-05, "loss": 0.6003837585449219, "mean_token_accuracy": 0.8531194061040879, "num_tokens": 7857491.0, "step": 990 }, { "entropy": 0.5885249046902907, "epoch": 1.0080685829551186, "grad_norm": 0.43550798296928406, "learning_rate": 6.643145161290323e-05, "loss": 0.5827617645263672, "mean_token_accuracy": 0.8590492982613412, "num_tokens": 7931419.0, "step": 1000 }, { "entropy": 0.5786265924572944, "epoch": 1.0181543116490166, "grad_norm": 0.4006239175796509, "learning_rate": 6.609543010752689e-05, "loss": 0.5741347312927246, "mean_token_accuracy": 0.859987598657608, "num_tokens": 8010076.0, "step": 1010 }, { "entropy": 0.6029427081346512, "epoch": 1.0282400403429148, "grad_norm": 0.5301637649536133, "learning_rate": 6.575940860215055e-05, "loss": 0.5843387603759765, "mean_token_accuracy": 0.8552656710147858, "num_tokens": 8089226.0, "step": 1020 }, { "entropy": 0.5827758759260178, "epoch": 1.0383257690368128, "grad_norm": 0.46098172664642334, "learning_rate": 6.542338709677419e-05, "loss": 0.5769033432006836, "mean_token_accuracy": 0.8591033697128296, "num_tokens": 8168296.0, "step": 1030 }, { "entropy": 0.578029453754425, "epoch": 1.048411497730711, "grad_norm": 0.4419442117214203, "learning_rate": 6.508736559139785e-05, "loss": 0.5668691158294678, "mean_token_accuracy": 0.8618250399827957, "num_tokens": 8247389.0, "step": 1040 }, { "entropy": 0.57004164904356, "epoch": 1.058497226424609, "grad_norm": 0.42728376388549805, "learning_rate": 6.47513440860215e-05, "loss": 0.5635159492492676, "mean_token_accuracy": 0.8611066967248917, "num_tokens": 8327733.0, "step": 1050 }, { "entropy": 0.5766539484262466, "epoch": 1.0685829551185073, "grad_norm": 0.45730945467948914, "learning_rate": 6.441532258064516e-05, "loss": 0.5666641235351563, "mean_token_accuracy": 0.8593446314334869, "num_tokens": 8407817.0, "step": 1060 }, { "entropy": 0.5864439934492112, "epoch": 1.0786686838124055, "grad_norm": 0.4544226825237274, "learning_rate": 6.407930107526882e-05, "loss": 0.5757258415222168, "mean_token_accuracy": 0.8577850371599197, "num_tokens": 8487535.0, "step": 1070 }, { "entropy": 0.5884994626045227, "epoch": 1.0887544125063036, "grad_norm": 0.48623108863830566, "learning_rate": 6.374327956989248e-05, "loss": 0.5825486183166504, "mean_token_accuracy": 0.8567618876695633, "num_tokens": 8567287.0, "step": 1080 }, { "entropy": 0.5760734975337982, "epoch": 1.0988401412002018, "grad_norm": 0.4508640468120575, "learning_rate": 6.340725806451612e-05, "loss": 0.5734494209289551, "mean_token_accuracy": 0.858697172999382, "num_tokens": 8646370.0, "step": 1090 }, { "entropy": 0.590225487947464, "epoch": 1.1089258698940998, "grad_norm": 0.43003523349761963, "learning_rate": 6.30712365591398e-05, "loss": 0.5778960704803466, "mean_token_accuracy": 0.8560095846652984, "num_tokens": 8726482.0, "step": 1100 }, { "entropy": 0.5984179466962815, "epoch": 1.119011598587998, "grad_norm": 0.4635157883167267, "learning_rate": 6.273521505376344e-05, "loss": 0.5918797016143799, "mean_token_accuracy": 0.8553583979606628, "num_tokens": 8805451.0, "step": 1110 }, { "entropy": 0.5844434216618538, "epoch": 1.129097327281896, "grad_norm": 0.4477420151233673, "learning_rate": 6.23991935483871e-05, "loss": 0.57535400390625, "mean_token_accuracy": 0.8573390394449234, "num_tokens": 8884601.0, "step": 1120 }, { "entropy": 0.5594617292284966, "epoch": 1.1391830559757943, "grad_norm": 0.4664854407310486, "learning_rate": 6.206317204301076e-05, "loss": 0.5436801910400391, "mean_token_accuracy": 0.8645383834838867, "num_tokens": 8962133.0, "step": 1130 }, { "entropy": 0.5811979010701179, "epoch": 1.1492687846696923, "grad_norm": 0.44287121295928955, "learning_rate": 6.172715053763441e-05, "loss": 0.5768415451049804, "mean_token_accuracy": 0.8589100211858749, "num_tokens": 9041544.0, "step": 1140 }, { "entropy": 0.5857019424438477, "epoch": 1.1593545133635905, "grad_norm": 0.49549591541290283, "learning_rate": 6.139112903225806e-05, "loss": 0.583711576461792, "mean_token_accuracy": 0.8538704454898834, "num_tokens": 9120658.0, "step": 1150 }, { "entropy": 0.5798764854669571, "epoch": 1.1694402420574885, "grad_norm": 0.45661458373069763, "learning_rate": 6.105510752688173e-05, "loss": 0.5687499046325684, "mean_token_accuracy": 0.8593120962381363, "num_tokens": 9200441.0, "step": 1160 }, { "entropy": 0.5608216986060143, "epoch": 1.1795259707513868, "grad_norm": 0.4311324656009674, "learning_rate": 6.0719086021505375e-05, "loss": 0.5529376029968261, "mean_token_accuracy": 0.8649492233991622, "num_tokens": 9280337.0, "step": 1170 }, { "entropy": 0.5674901068210602, "epoch": 1.189611699445285, "grad_norm": 0.42369771003723145, "learning_rate": 6.038306451612904e-05, "loss": 0.5703757762908935, "mean_token_accuracy": 0.8604072660207749, "num_tokens": 9359718.0, "step": 1180 }, { "entropy": 0.5913670003414154, "epoch": 1.199697428139183, "grad_norm": 0.42738214135169983, "learning_rate": 6.004704301075269e-05, "loss": 0.5724913597106933, "mean_token_accuracy": 0.8573768496513366, "num_tokens": 9438541.0, "step": 1190 }, { "entropy": 0.5946374118328095, "epoch": 1.2097831568330812, "grad_norm": 0.4449988901615143, "learning_rate": 5.9711021505376355e-05, "loss": 0.587339973449707, "mean_token_accuracy": 0.8539384603500366, "num_tokens": 9518019.0, "step": 1200 }, { "entropy": 0.5591581493616105, "epoch": 1.2198688855269793, "grad_norm": 0.500762939453125, "learning_rate": 5.9375e-05, "loss": 0.5534748077392578, "mean_token_accuracy": 0.8654944837093353, "num_tokens": 9598123.0, "step": 1210 }, { "entropy": 0.5613914996385574, "epoch": 1.2299546142208775, "grad_norm": 0.49419164657592773, "learning_rate": 5.903897849462365e-05, "loss": 0.552029800415039, "mean_token_accuracy": 0.8651645094156265, "num_tokens": 9677061.0, "step": 1220 }, { "entropy": 0.5790321677923203, "epoch": 1.2400403429147757, "grad_norm": 0.45684942603111267, "learning_rate": 5.8702956989247316e-05, "loss": 0.5709888935089111, "mean_token_accuracy": 0.8570766538381577, "num_tokens": 9755822.0, "step": 1230 }, { "entropy": 0.5670598953962326, "epoch": 1.2501260716086737, "grad_norm": 0.4502805471420288, "learning_rate": 5.836693548387097e-05, "loss": 0.5562293052673339, "mean_token_accuracy": 0.8617229491472245, "num_tokens": 9833630.0, "step": 1240 }, { "entropy": 0.5812987759709358, "epoch": 1.2602118003025717, "grad_norm": 0.47911354899406433, "learning_rate": 5.8030913978494625e-05, "loss": 0.5785074710845948, "mean_token_accuracy": 0.8579352408647537, "num_tokens": 9913298.0, "step": 1250 }, { "entropy": 0.5942406296730042, "epoch": 1.27029752899647, "grad_norm": 0.5416054129600525, "learning_rate": 5.7694892473118276e-05, "loss": 0.5871072769165039, "mean_token_accuracy": 0.8525298267602921, "num_tokens": 9992390.0, "step": 1260 }, { "entropy": 0.5730470806360245, "epoch": 1.2803832576903682, "grad_norm": 0.42904311418533325, "learning_rate": 5.735887096774194e-05, "loss": 0.5617104530334472, "mean_token_accuracy": 0.8585203140974045, "num_tokens": 10072228.0, "step": 1270 }, { "entropy": 0.576186053454876, "epoch": 1.2904689863842662, "grad_norm": 0.48196178674697876, "learning_rate": 5.702284946236559e-05, "loss": 0.564885950088501, "mean_token_accuracy": 0.8605964362621308, "num_tokens": 10151335.0, "step": 1280 }, { "entropy": 0.6046586632728577, "epoch": 1.3005547150781644, "grad_norm": 0.5057108998298645, "learning_rate": 5.668682795698925e-05, "loss": 0.5939000129699707, "mean_token_accuracy": 0.8541617125272751, "num_tokens": 10231293.0, "step": 1290 }, { "entropy": 0.5814134299755096, "epoch": 1.3106404437720625, "grad_norm": 0.4809938669204712, "learning_rate": 5.63508064516129e-05, "loss": 0.5762624740600586, "mean_token_accuracy": 0.8582640796899795, "num_tokens": 10310793.0, "step": 1300 }, { "entropy": 0.5876763761043549, "epoch": 1.3207261724659607, "grad_norm": 0.4530595541000366, "learning_rate": 5.6014784946236566e-05, "loss": 0.5883693695068359, "mean_token_accuracy": 0.855881854891777, "num_tokens": 10390285.0, "step": 1310 }, { "entropy": 0.5655333667993545, "epoch": 1.330811901159859, "grad_norm": 0.4557790756225586, "learning_rate": 5.567876344086022e-05, "loss": 0.5549901962280274, "mean_token_accuracy": 0.8610905766487121, "num_tokens": 10470065.0, "step": 1320 }, { "entropy": 0.5945004314184189, "epoch": 1.340897629853757, "grad_norm": 0.436661958694458, "learning_rate": 5.5342741935483875e-05, "loss": 0.5859263896942138, "mean_token_accuracy": 0.8548474669456482, "num_tokens": 10549649.0, "step": 1330 }, { "entropy": 0.5685078948736191, "epoch": 1.350983358547655, "grad_norm": 0.4716840088367462, "learning_rate": 5.5006720430107526e-05, "loss": 0.5484930992126464, "mean_token_accuracy": 0.8640597611665726, "num_tokens": 10629189.0, "step": 1340 }, { "entropy": 0.5654298186302185, "epoch": 1.3610690872415532, "grad_norm": 0.42921242117881775, "learning_rate": 5.467069892473119e-05, "loss": 0.5640359401702881, "mean_token_accuracy": 0.860820859670639, "num_tokens": 10708703.0, "step": 1350 }, { "entropy": 0.5941716223955155, "epoch": 1.3711548159354514, "grad_norm": 0.46565788984298706, "learning_rate": 5.433467741935484e-05, "loss": 0.594744873046875, "mean_token_accuracy": 0.8517325460910797, "num_tokens": 10788480.0, "step": 1360 }, { "entropy": 0.5812072679400444, "epoch": 1.3812405446293494, "grad_norm": 0.4489298462867737, "learning_rate": 5.39986559139785e-05, "loss": 0.5654291152954102, "mean_token_accuracy": 0.8605479776859284, "num_tokens": 10868434.0, "step": 1370 }, { "entropy": 0.5879675418138504, "epoch": 1.3913262733232477, "grad_norm": 0.46651822328567505, "learning_rate": 5.366263440860215e-05, "loss": 0.5838429450988769, "mean_token_accuracy": 0.8583901137113571, "num_tokens": 10948050.0, "step": 1380 }, { "entropy": 0.5686550527811051, "epoch": 1.4014120020171457, "grad_norm": 0.43968766927719116, "learning_rate": 5.3326612903225816e-05, "loss": 0.558499813079834, "mean_token_accuracy": 0.8613751292228699, "num_tokens": 11028113.0, "step": 1390 }, { "entropy": 0.5755997136235237, "epoch": 1.411497730711044, "grad_norm": 0.4646352231502533, "learning_rate": 5.299059139784947e-05, "loss": 0.5624261856079101, "mean_token_accuracy": 0.8600882589817047, "num_tokens": 11107425.0, "step": 1400 }, { "entropy": 0.564902774989605, "epoch": 1.4215834594049421, "grad_norm": 0.49692341685295105, "learning_rate": 5.265456989247312e-05, "loss": 0.559935188293457, "mean_token_accuracy": 0.860372531414032, "num_tokens": 11186952.0, "step": 1410 }, { "entropy": 0.5890892148017883, "epoch": 1.4316691880988401, "grad_norm": 0.46546879410743713, "learning_rate": 5.2318548387096776e-05, "loss": 0.5763956546783447, "mean_token_accuracy": 0.8564515620470047, "num_tokens": 11266572.0, "step": 1420 }, { "entropy": 0.5781215921044349, "epoch": 1.4417549167927382, "grad_norm": 0.44149070978164673, "learning_rate": 5.198252688172043e-05, "loss": 0.572498369216919, "mean_token_accuracy": 0.8586721986532211, "num_tokens": 11346213.0, "step": 1430 }, { "entropy": 0.5667644247412682, "epoch": 1.4518406454866364, "grad_norm": 0.4551633894443512, "learning_rate": 5.164650537634409e-05, "loss": 0.562723970413208, "mean_token_accuracy": 0.8600044697523117, "num_tokens": 11425510.0, "step": 1440 }, { "entropy": 0.57702035009861, "epoch": 1.4619263741805346, "grad_norm": 0.45487403869628906, "learning_rate": 5.131048387096774e-05, "loss": 0.5618971824645996, "mean_token_accuracy": 0.8618997722864151, "num_tokens": 11503529.0, "step": 1450 }, { "entropy": 0.5790243059396744, "epoch": 1.4720121028744326, "grad_norm": 0.481052041053772, "learning_rate": 5.09744623655914e-05, "loss": 0.5712011814117431, "mean_token_accuracy": 0.8604255467653275, "num_tokens": 11581888.0, "step": 1460 }, { "entropy": 0.5728526920080185, "epoch": 1.4820978315683309, "grad_norm": 0.4831527769565582, "learning_rate": 5.063844086021505e-05, "loss": 0.5751055717468262, "mean_token_accuracy": 0.8597662955522537, "num_tokens": 11661311.0, "step": 1470 }, { "entropy": 0.5620998844504357, "epoch": 1.4921835602622289, "grad_norm": 0.462201327085495, "learning_rate": 5.030241935483872e-05, "loss": 0.5486450672149659, "mean_token_accuracy": 0.8637843191623688, "num_tokens": 11740118.0, "step": 1480 }, { "entropy": 0.5603026807308197, "epoch": 1.502269288956127, "grad_norm": 0.47398635745048523, "learning_rate": 4.996639784946237e-05, "loss": 0.545743751525879, "mean_token_accuracy": 0.8636046230793, "num_tokens": 11817914.0, "step": 1490 }, { "entropy": 0.5598662227392197, "epoch": 1.5123550176500253, "grad_norm": 0.4725417494773865, "learning_rate": 4.963037634408602e-05, "loss": 0.5522914409637452, "mean_token_accuracy": 0.8619683742523193, "num_tokens": 11896470.0, "step": 1500 }, { "entropy": 0.5722532019019126, "epoch": 1.5224407463439233, "grad_norm": 0.47333210706710815, "learning_rate": 4.929435483870968e-05, "loss": 0.5686895370483398, "mean_token_accuracy": 0.8594554871320724, "num_tokens": 11975221.0, "step": 1510 }, { "entropy": 0.5743500784039497, "epoch": 1.5325264750378214, "grad_norm": 0.498080313205719, "learning_rate": 4.8958333333333335e-05, "loss": 0.5648915290832519, "mean_token_accuracy": 0.858995920419693, "num_tokens": 12053927.0, "step": 1520 }, { "entropy": 0.5615316748619079, "epoch": 1.5426122037317196, "grad_norm": 0.4675048589706421, "learning_rate": 4.862231182795699e-05, "loss": 0.5583067893981933, "mean_token_accuracy": 0.862602812051773, "num_tokens": 12133779.0, "step": 1530 }, { "entropy": 0.5674820989370346, "epoch": 1.5526979324256178, "grad_norm": 0.479189932346344, "learning_rate": 4.8286290322580644e-05, "loss": 0.5581048965454102, "mean_token_accuracy": 0.859470346570015, "num_tokens": 12213321.0, "step": 1540 }, { "entropy": 0.5720546498894692, "epoch": 1.5627836611195158, "grad_norm": 0.4640292823314667, "learning_rate": 4.79502688172043e-05, "loss": 0.5651350498199463, "mean_token_accuracy": 0.8625688463449478, "num_tokens": 12293425.0, "step": 1550 }, { "entropy": 0.5659960642457008, "epoch": 1.572869389813414, "grad_norm": 0.4951878488063812, "learning_rate": 4.761424731182796e-05, "loss": 0.5468338966369629, "mean_token_accuracy": 0.8602778345346451, "num_tokens": 12371939.0, "step": 1560 }, { "entropy": 0.5816718444228173, "epoch": 1.582955118507312, "grad_norm": 0.4827718436717987, "learning_rate": 4.727822580645161e-05, "loss": 0.5749332427978515, "mean_token_accuracy": 0.8562595009803772, "num_tokens": 12451620.0, "step": 1570 }, { "entropy": 0.5692623853683472, "epoch": 1.5930408472012103, "grad_norm": 0.5074397921562195, "learning_rate": 4.694220430107527e-05, "loss": 0.5635262489318847, "mean_token_accuracy": 0.859693843126297, "num_tokens": 12531500.0, "step": 1580 }, { "entropy": 0.5688315823674202, "epoch": 1.6031265758951085, "grad_norm": 0.47028103470802307, "learning_rate": 4.660618279569893e-05, "loss": 0.5646557331085205, "mean_token_accuracy": 0.8609416097402572, "num_tokens": 12610056.0, "step": 1590 }, { "entropy": 0.578702774643898, "epoch": 1.6132123045890066, "grad_norm": 0.4792572259902954, "learning_rate": 4.6270161290322585e-05, "loss": 0.5608342170715332, "mean_token_accuracy": 0.8583951354026794, "num_tokens": 12689520.0, "step": 1600 }, { "entropy": 0.5461821883916855, "epoch": 1.6232980332829046, "grad_norm": 0.4682954251766205, "learning_rate": 4.5934139784946236e-05, "loss": 0.5470096588134765, "mean_token_accuracy": 0.8660473883152008, "num_tokens": 12769300.0, "step": 1610 }, { "entropy": 0.5409149259328843, "epoch": 1.6333837619768028, "grad_norm": 0.4313759207725525, "learning_rate": 4.5598118279569894e-05, "loss": 0.5290946960449219, "mean_token_accuracy": 0.8687306940555573, "num_tokens": 12848928.0, "step": 1620 }, { "entropy": 0.5602993786334991, "epoch": 1.643469490670701, "grad_norm": 0.43227389454841614, "learning_rate": 4.526209677419355e-05, "loss": 0.5636171340942383, "mean_token_accuracy": 0.8613378524780273, "num_tokens": 12928356.0, "step": 1630 }, { "entropy": 0.5802386716008187, "epoch": 1.653555219364599, "grad_norm": 0.47118210792541504, "learning_rate": 4.492607526881721e-05, "loss": 0.5586458683013916, "mean_token_accuracy": 0.8608706951141357, "num_tokens": 13008403.0, "step": 1640 }, { "entropy": 0.5646507054567337, "epoch": 1.6636409480584973, "grad_norm": 0.4425702393054962, "learning_rate": 4.459005376344086e-05, "loss": 0.5531969547271729, "mean_token_accuracy": 0.8616601437330246, "num_tokens": 13088085.0, "step": 1650 }, { "entropy": 0.554588295519352, "epoch": 1.6737266767523953, "grad_norm": 0.4520638883113861, "learning_rate": 4.425403225806452e-05, "loss": 0.557581090927124, "mean_token_accuracy": 0.8634083062410355, "num_tokens": 13166818.0, "step": 1660 }, { "entropy": 0.5726349860429764, "epoch": 1.6838124054462935, "grad_norm": 0.6098994612693787, "learning_rate": 4.391801075268818e-05, "loss": 0.5592772483825683, "mean_token_accuracy": 0.8583408266305923, "num_tokens": 13246430.0, "step": 1670 }, { "entropy": 0.5743449658155442, "epoch": 1.6938981341401917, "grad_norm": 0.5307788848876953, "learning_rate": 4.358198924731183e-05, "loss": 0.5716012954711914, "mean_token_accuracy": 0.858471828699112, "num_tokens": 13325991.0, "step": 1680 }, { "entropy": 0.5580974891781807, "epoch": 1.7039838628340898, "grad_norm": 0.4562699794769287, "learning_rate": 4.3245967741935486e-05, "loss": 0.5490761756896972, "mean_token_accuracy": 0.8642932444810867, "num_tokens": 13405218.0, "step": 1690 }, { "entropy": 0.5611451357603073, "epoch": 1.7140695915279878, "grad_norm": 0.4747970700263977, "learning_rate": 4.290994623655914e-05, "loss": 0.55002760887146, "mean_token_accuracy": 0.8629568427801132, "num_tokens": 13483327.0, "step": 1700 }, { "entropy": 0.5680546730756759, "epoch": 1.724155320221886, "grad_norm": 0.4508069157600403, "learning_rate": 4.2573924731182796e-05, "loss": 0.5625165939331055, "mean_token_accuracy": 0.8583694219589233, "num_tokens": 13562046.0, "step": 1710 }, { "entropy": 0.5620178505778313, "epoch": 1.7342410489157842, "grad_norm": 0.4658072888851166, "learning_rate": 4.2237903225806454e-05, "loss": 0.5550461769104004, "mean_token_accuracy": 0.8632882922887802, "num_tokens": 13641490.0, "step": 1720 }, { "entropy": 0.5530170306563378, "epoch": 1.7443267776096822, "grad_norm": 0.5042744278907776, "learning_rate": 4.190188172043011e-05, "loss": 0.5403203010559082, "mean_token_accuracy": 0.8652596682310104, "num_tokens": 13721635.0, "step": 1730 }, { "entropy": 0.5663056463003159, "epoch": 1.7544125063035805, "grad_norm": 0.48429322242736816, "learning_rate": 4.156586021505376e-05, "loss": 0.5637138366699219, "mean_token_accuracy": 0.86119324862957, "num_tokens": 13801115.0, "step": 1740 }, { "entropy": 0.5869442075490952, "epoch": 1.7644982349974785, "grad_norm": 0.47282740473747253, "learning_rate": 4.122983870967742e-05, "loss": 0.5740327358245849, "mean_token_accuracy": 0.8570831835269928, "num_tokens": 13880836.0, "step": 1750 }, { "entropy": 0.5692236006259919, "epoch": 1.7745839636913767, "grad_norm": 0.48522087931632996, "learning_rate": 4.089381720430108e-05, "loss": 0.5549083232879639, "mean_token_accuracy": 0.8620316475629807, "num_tokens": 13960547.0, "step": 1760 }, { "entropy": 0.5681909918785095, "epoch": 1.784669692385275, "grad_norm": 0.5211447477340698, "learning_rate": 4.0557795698924737e-05, "loss": 0.5676622867584229, "mean_token_accuracy": 0.8572598755359649, "num_tokens": 14039751.0, "step": 1770 }, { "entropy": 0.5653912618756294, "epoch": 1.794755421079173, "grad_norm": 0.48671814799308777, "learning_rate": 4.022177419354839e-05, "loss": 0.5509668827056885, "mean_token_accuracy": 0.8620099276304245, "num_tokens": 14119860.0, "step": 1780 }, { "entropy": 0.5805320516228676, "epoch": 1.804841149773071, "grad_norm": 0.46735525131225586, "learning_rate": 3.9885752688172046e-05, "loss": 0.5758527278900146, "mean_token_accuracy": 0.8575719922780991, "num_tokens": 14198802.0, "step": 1790 }, { "entropy": 0.5776771619915962, "epoch": 1.8149268784669692, "grad_norm": 0.46059489250183105, "learning_rate": 3.9549731182795704e-05, "loss": 0.5662201404571533, "mean_token_accuracy": 0.8602292090654373, "num_tokens": 14277819.0, "step": 1800 }, { "entropy": 0.5446759209036827, "epoch": 1.8250126071608674, "grad_norm": 0.4299936890602112, "learning_rate": 3.9213709677419355e-05, "loss": 0.5321237087249756, "mean_token_accuracy": 0.8672592252492904, "num_tokens": 14356885.0, "step": 1810 }, { "entropy": 0.5735299795866012, "epoch": 1.8350983358547657, "grad_norm": 0.4611278176307678, "learning_rate": 3.887768817204301e-05, "loss": 0.5636817932128906, "mean_token_accuracy": 0.8613359600305557, "num_tokens": 14436671.0, "step": 1820 }, { "entropy": 0.5580099940299987, "epoch": 1.8451840645486637, "grad_norm": 0.44665414094924927, "learning_rate": 3.854166666666667e-05, "loss": 0.5478529453277587, "mean_token_accuracy": 0.865882283449173, "num_tokens": 14516240.0, "step": 1830 }, { "entropy": 0.5468813553452492, "epoch": 1.8552697932425617, "grad_norm": 0.48118823766708374, "learning_rate": 3.820564516129033e-05, "loss": 0.5421140670776368, "mean_token_accuracy": 0.8648819357156754, "num_tokens": 14594410.0, "step": 1840 }, { "entropy": 0.5601179748773575, "epoch": 1.86535552193646, "grad_norm": 0.47143810987472534, "learning_rate": 3.786962365591398e-05, "loss": 0.5547156810760498, "mean_token_accuracy": 0.8629712164402008, "num_tokens": 14674458.0, "step": 1850 }, { "entropy": 0.5468712210655212, "epoch": 1.8754412506303582, "grad_norm": 0.4703015089035034, "learning_rate": 3.753360215053764e-05, "loss": 0.5343079566955566, "mean_token_accuracy": 0.8661370754241944, "num_tokens": 14753930.0, "step": 1860 }, { "entropy": 0.5559142023324967, "epoch": 1.8855269793242562, "grad_norm": 0.5115091800689697, "learning_rate": 3.719758064516129e-05, "loss": 0.5517262935638427, "mean_token_accuracy": 0.8617942541837692, "num_tokens": 14832932.0, "step": 1870 }, { "entropy": 0.5663068994879723, "epoch": 1.8956127080181542, "grad_norm": 0.5054985880851746, "learning_rate": 3.686155913978495e-05, "loss": 0.5602648735046387, "mean_token_accuracy": 0.8621524393558502, "num_tokens": 14912738.0, "step": 1880 }, { "entropy": 0.5654321074485779, "epoch": 1.9056984367120524, "grad_norm": 0.6112289428710938, "learning_rate": 3.6525537634408605e-05, "loss": 0.5629604816436767, "mean_token_accuracy": 0.8605375409126281, "num_tokens": 14991840.0, "step": 1890 }, { "entropy": 0.576673474907875, "epoch": 1.9157841654059506, "grad_norm": 0.4323459565639496, "learning_rate": 3.6189516129032256e-05, "loss": 0.5591244220733642, "mean_token_accuracy": 0.8580433249473571, "num_tokens": 15071706.0, "step": 1900 }, { "entropy": 0.5643190979957581, "epoch": 1.9258698940998489, "grad_norm": 0.4710509479045868, "learning_rate": 3.5853494623655914e-05, "loss": 0.5512382507324218, "mean_token_accuracy": 0.8628631055355072, "num_tokens": 15151394.0, "step": 1910 }, { "entropy": 0.5628313675522805, "epoch": 1.9359556227937469, "grad_norm": 0.49328237771987915, "learning_rate": 3.551747311827957e-05, "loss": 0.5587539672851562, "mean_token_accuracy": 0.860697939991951, "num_tokens": 15231319.0, "step": 1920 }, { "entropy": 0.5748488426208496, "epoch": 1.946041351487645, "grad_norm": 0.4674327075481415, "learning_rate": 3.518145161290323e-05, "loss": 0.5687310695648193, "mean_token_accuracy": 0.8577084749937057, "num_tokens": 15310775.0, "step": 1930 }, { "entropy": 0.5803794890642167, "epoch": 1.9561270801815431, "grad_norm": 0.5266663432121277, "learning_rate": 3.484543010752688e-05, "loss": 0.563091516494751, "mean_token_accuracy": 0.8584628343582154, "num_tokens": 15390587.0, "step": 1940 }, { "entropy": 0.5552488923072815, "epoch": 1.9662128088754414, "grad_norm": 0.4923759996891022, "learning_rate": 3.450940860215054e-05, "loss": 0.5511169910430909, "mean_token_accuracy": 0.8629322975873948, "num_tokens": 15469965.0, "step": 1950 }, { "entropy": 0.5615150198340416, "epoch": 1.9762985375693394, "grad_norm": 0.48817864060401917, "learning_rate": 3.41733870967742e-05, "loss": 0.5568130016326904, "mean_token_accuracy": 0.8619527310132981, "num_tokens": 15549750.0, "step": 1960 }, { "entropy": 0.5814961880445481, "epoch": 1.9863842662632374, "grad_norm": 0.5092481970787048, "learning_rate": 3.3837365591397855e-05, "loss": 0.5730830669403076, "mean_token_accuracy": 0.8569308757781983, "num_tokens": 15629403.0, "step": 1970 }, { "entropy": 0.5555408030748368, "epoch": 1.9964699949571356, "grad_norm": 0.47072556614875793, "learning_rate": 3.3501344086021506e-05, "loss": 0.5473050117492676, "mean_token_accuracy": 0.8649396389722824, "num_tokens": 15709076.0, "step": 1980 }, { "entropy": 0.569047212600708, "epoch": 2.006051437216339, "grad_norm": 0.4627280831336975, "learning_rate": 3.3165322580645164e-05, "loss": 0.5441355228424072, "mean_token_accuracy": 0.864699639772114, "num_tokens": 15782771.0, "step": 1990 }, { "entropy": 0.539261668920517, "epoch": 2.016137165910237, "grad_norm": 0.48832473158836365, "learning_rate": 3.282930107526882e-05, "loss": 0.5297918796539307, "mean_token_accuracy": 0.8658891975879669, "num_tokens": 15862421.0, "step": 2000 }, { "entropy": 0.5377178519964219, "epoch": 2.026222894604135, "grad_norm": 0.48553702235221863, "learning_rate": 3.249327956989247e-05, "loss": 0.5355194091796875, "mean_token_accuracy": 0.8657042533159256, "num_tokens": 15941198.0, "step": 2010 }, { "entropy": 0.5516590684652328, "epoch": 2.036308623298033, "grad_norm": 0.5379918217658997, "learning_rate": 3.215725806451613e-05, "loss": 0.5353228092193604, "mean_token_accuracy": 0.8652983129024505, "num_tokens": 16021211.0, "step": 2020 }, { "entropy": 0.5461470827460289, "epoch": 2.0463943519919314, "grad_norm": 0.4731438457965851, "learning_rate": 3.182123655913979e-05, "loss": 0.5283015727996826, "mean_token_accuracy": 0.8663630455732345, "num_tokens": 16100444.0, "step": 2030 }, { "entropy": 0.5638475820422173, "epoch": 2.0564800806858297, "grad_norm": 0.5005958676338196, "learning_rate": 3.148521505376345e-05, "loss": 0.5557540893554688, "mean_token_accuracy": 0.8587030708789826, "num_tokens": 16179057.0, "step": 2040 }, { "entropy": 0.5465094238519669, "epoch": 2.066565809379728, "grad_norm": 0.5402827262878418, "learning_rate": 3.11491935483871e-05, "loss": 0.5304507255554199, "mean_token_accuracy": 0.8647589266300202, "num_tokens": 16258484.0, "step": 2050 }, { "entropy": 0.5264578998088837, "epoch": 2.0766515380736257, "grad_norm": 0.4704038202762604, "learning_rate": 3.081317204301075e-05, "loss": 0.5128489971160889, "mean_token_accuracy": 0.8706033259630204, "num_tokens": 16338768.0, "step": 2060 }, { "entropy": 0.5451709255576134, "epoch": 2.086737266767524, "grad_norm": 0.4614444673061371, "learning_rate": 3.0477150537634407e-05, "loss": 0.5359940528869629, "mean_token_accuracy": 0.8661996811628342, "num_tokens": 16418643.0, "step": 2070 }, { "entropy": 0.5472053721547127, "epoch": 2.096822995461422, "grad_norm": 0.632550060749054, "learning_rate": 3.0141129032258065e-05, "loss": 0.5351024627685547, "mean_token_accuracy": 0.8644415885210037, "num_tokens": 16498263.0, "step": 2080 }, { "entropy": 0.548878462612629, "epoch": 2.1069087241553204, "grad_norm": 0.5025933980941772, "learning_rate": 2.980510752688172e-05, "loss": 0.5379784584045411, "mean_token_accuracy": 0.8660365819931031, "num_tokens": 16577565.0, "step": 2090 }, { "entropy": 0.5425203040242195, "epoch": 2.116994452849218, "grad_norm": 0.4774039685726166, "learning_rate": 2.9469086021505378e-05, "loss": 0.5364133358001709, "mean_token_accuracy": 0.8674946367740631, "num_tokens": 16656311.0, "step": 2100 }, { "entropy": 0.5235720470547676, "epoch": 2.1270801815431164, "grad_norm": 0.5193483829498291, "learning_rate": 2.9133064516129032e-05, "loss": 0.5130849838256836, "mean_token_accuracy": 0.8696544647216797, "num_tokens": 16733102.0, "step": 2110 }, { "entropy": 0.5605258494615555, "epoch": 2.1371659102370146, "grad_norm": 0.4725455939769745, "learning_rate": 2.879704301075269e-05, "loss": 0.540586280822754, "mean_token_accuracy": 0.8627595365047455, "num_tokens": 16812449.0, "step": 2120 }, { "entropy": 0.5359290465712547, "epoch": 2.147251638930913, "grad_norm": 0.5029664039611816, "learning_rate": 2.8461021505376345e-05, "loss": 0.5248902320861817, "mean_token_accuracy": 0.8702762573957443, "num_tokens": 16890210.0, "step": 2130 }, { "entropy": 0.5447442144155502, "epoch": 2.157337367624811, "grad_norm": 0.5254132747650146, "learning_rate": 2.8125000000000003e-05, "loss": 0.5334976196289063, "mean_token_accuracy": 0.8659275323152542, "num_tokens": 16969724.0, "step": 2140 }, { "entropy": 0.5429217413067817, "epoch": 2.167423096318709, "grad_norm": 0.5342961549758911, "learning_rate": 2.7788978494623657e-05, "loss": 0.5368762969970703, "mean_token_accuracy": 0.8634399026632309, "num_tokens": 17049580.0, "step": 2150 }, { "entropy": 0.5661292850971222, "epoch": 2.177508825012607, "grad_norm": 0.5178996324539185, "learning_rate": 2.7452956989247315e-05, "loss": 0.5408023357391357, "mean_token_accuracy": 0.8626035422086715, "num_tokens": 17129600.0, "step": 2160 }, { "entropy": 0.5486285850405693, "epoch": 2.1875945537065054, "grad_norm": 0.5601539015769958, "learning_rate": 2.711693548387097e-05, "loss": 0.5464762210845947, "mean_token_accuracy": 0.8629148125648498, "num_tokens": 17208660.0, "step": 2170 }, { "entropy": 0.539339479804039, "epoch": 2.1976802824004036, "grad_norm": 0.5032673478126526, "learning_rate": 2.6780913978494628e-05, "loss": 0.5286684036254883, "mean_token_accuracy": 0.86694795191288, "num_tokens": 17288203.0, "step": 2180 }, { "entropy": 0.5645471304655075, "epoch": 2.2077660110943014, "grad_norm": 0.5230391025543213, "learning_rate": 2.6444892473118282e-05, "loss": 0.5560014724731446, "mean_token_accuracy": 0.8597795188426971, "num_tokens": 17367801.0, "step": 2190 }, { "entropy": 0.5548521086573601, "epoch": 2.2178517397881996, "grad_norm": 0.49602022767066956, "learning_rate": 2.610887096774194e-05, "loss": 0.5350295066833496, "mean_token_accuracy": 0.8652581185102463, "num_tokens": 17446189.0, "step": 2200 }, { "entropy": 0.514088487625122, "epoch": 2.227937468482098, "grad_norm": 0.4804084002971649, "learning_rate": 2.5772849462365595e-05, "loss": 0.5078618049621582, "mean_token_accuracy": 0.87323999106884, "num_tokens": 17525566.0, "step": 2210 }, { "entropy": 0.5376028656959534, "epoch": 2.238023197175996, "grad_norm": 0.5058464407920837, "learning_rate": 2.543682795698925e-05, "loss": 0.5364038944244385, "mean_token_accuracy": 0.8645770877599717, "num_tokens": 17604827.0, "step": 2220 }, { "entropy": 0.5462548270821571, "epoch": 2.2481089258698943, "grad_norm": 0.490461140871048, "learning_rate": 2.5100806451612907e-05, "loss": 0.5294418811798096, "mean_token_accuracy": 0.8681913077831268, "num_tokens": 17683861.0, "step": 2230 }, { "entropy": 0.5528038665652275, "epoch": 2.258194654563792, "grad_norm": 0.4974213242530823, "learning_rate": 2.4764784946236562e-05, "loss": 0.5406534194946289, "mean_token_accuracy": 0.8653462111949921, "num_tokens": 17762980.0, "step": 2240 }, { "entropy": 0.5535038366913796, "epoch": 2.2682803832576903, "grad_norm": 0.5496407151222229, "learning_rate": 2.4428763440860216e-05, "loss": 0.537155294418335, "mean_token_accuracy": 0.8642148166894913, "num_tokens": 17842556.0, "step": 2250 }, { "entropy": 0.5539382755756378, "epoch": 2.2783661119515886, "grad_norm": 0.525561511516571, "learning_rate": 2.4092741935483874e-05, "loss": 0.5407976150512696, "mean_token_accuracy": 0.8630766361951828, "num_tokens": 17922301.0, "step": 2260 }, { "entropy": 0.5272150099277496, "epoch": 2.288451840645487, "grad_norm": 0.5721139907836914, "learning_rate": 2.375672043010753e-05, "loss": 0.5236873626708984, "mean_token_accuracy": 0.8669533491134643, "num_tokens": 18001885.0, "step": 2270 }, { "entropy": 0.5631722688674927, "epoch": 2.2985375693393846, "grad_norm": 0.5678048133850098, "learning_rate": 2.3420698924731183e-05, "loss": 0.5523369312286377, "mean_token_accuracy": 0.8623350352048874, "num_tokens": 18081479.0, "step": 2280 }, { "entropy": 0.5382361978292465, "epoch": 2.308623298033283, "grad_norm": 0.5157824754714966, "learning_rate": 2.3084677419354838e-05, "loss": 0.5226727485656738, "mean_token_accuracy": 0.8679136961698533, "num_tokens": 18161203.0, "step": 2290 }, { "entropy": 0.533910921216011, "epoch": 2.318709026727181, "grad_norm": 0.47971630096435547, "learning_rate": 2.2748655913978496e-05, "loss": 0.5226436614990234, "mean_token_accuracy": 0.8696143090724945, "num_tokens": 18241262.0, "step": 2300 }, { "entropy": 0.5458772480487823, "epoch": 2.3287947554210793, "grad_norm": 0.45692282915115356, "learning_rate": 2.241263440860215e-05, "loss": 0.5294504165649414, "mean_token_accuracy": 0.8642321765422821, "num_tokens": 18320784.0, "step": 2310 }, { "entropy": 0.5594018489122391, "epoch": 2.338880484114977, "grad_norm": 0.4903578758239746, "learning_rate": 2.207661290322581e-05, "loss": 0.5604379177093506, "mean_token_accuracy": 0.860828360915184, "num_tokens": 18400852.0, "step": 2320 }, { "entropy": 0.5689606159925461, "epoch": 2.3489662128088753, "grad_norm": 0.5537696480751038, "learning_rate": 2.1740591397849463e-05, "loss": 0.5594550609588623, "mean_token_accuracy": 0.8629016607999802, "num_tokens": 18479779.0, "step": 2330 }, { "entropy": 0.5599432498216629, "epoch": 2.3590519415027735, "grad_norm": 0.5466564297676086, "learning_rate": 2.140456989247312e-05, "loss": 0.5437151908874511, "mean_token_accuracy": 0.8626207202672959, "num_tokens": 18558073.0, "step": 2340 }, { "entropy": 0.5474510326981544, "epoch": 2.3691376701966718, "grad_norm": 0.4898226857185364, "learning_rate": 2.1068548387096775e-05, "loss": 0.5327883720397949, "mean_token_accuracy": 0.8675543367862701, "num_tokens": 18637992.0, "step": 2350 }, { "entropy": 0.5352361142635346, "epoch": 2.37922339889057, "grad_norm": 0.49341657757759094, "learning_rate": 2.0732526881720433e-05, "loss": 0.5276922225952149, "mean_token_accuracy": 0.8687323063611985, "num_tokens": 18717199.0, "step": 2360 }, { "entropy": 0.5448679953813553, "epoch": 2.389309127584468, "grad_norm": 0.5279788374900818, "learning_rate": 2.0396505376344088e-05, "loss": 0.5373146057128906, "mean_token_accuracy": 0.8635420203208923, "num_tokens": 18795882.0, "step": 2370 }, { "entropy": 0.5282470986247063, "epoch": 2.399394856278366, "grad_norm": 0.5115689039230347, "learning_rate": 2.0060483870967743e-05, "loss": 0.5187318325042725, "mean_token_accuracy": 0.8699030309915543, "num_tokens": 18875539.0, "step": 2380 }, { "entropy": 0.5575937613844871, "epoch": 2.4094805849722642, "grad_norm": 0.5467925071716309, "learning_rate": 1.9724462365591397e-05, "loss": 0.5434219837188721, "mean_token_accuracy": 0.8646806567907334, "num_tokens": 18953688.0, "step": 2390 }, { "entropy": 0.5321239963173866, "epoch": 2.4195663136661625, "grad_norm": 0.5000545978546143, "learning_rate": 1.9388440860215055e-05, "loss": 0.5234639644622803, "mean_token_accuracy": 0.8677684217691422, "num_tokens": 19032209.0, "step": 2400 }, { "entropy": 0.5813943535089493, "epoch": 2.4296520423600603, "grad_norm": 0.516925573348999, "learning_rate": 1.905241935483871e-05, "loss": 0.5684566497802734, "mean_token_accuracy": 0.8597011536359787, "num_tokens": 19111890.0, "step": 2410 }, { "entropy": 0.5533119216561317, "epoch": 2.4397377710539585, "grad_norm": 0.4740159511566162, "learning_rate": 1.8716397849462368e-05, "loss": 0.5415266513824463, "mean_token_accuracy": 0.8660802483558655, "num_tokens": 19191883.0, "step": 2420 }, { "entropy": 0.5496593981981277, "epoch": 2.4498234997478567, "grad_norm": 0.5012199878692627, "learning_rate": 1.8380376344086022e-05, "loss": 0.5444561004638672, "mean_token_accuracy": 0.8652342647314072, "num_tokens": 19271352.0, "step": 2430 }, { "entropy": 0.5558317363262176, "epoch": 2.459909228441755, "grad_norm": 0.5741304755210876, "learning_rate": 1.804435483870968e-05, "loss": 0.5420098781585694, "mean_token_accuracy": 0.864546662569046, "num_tokens": 19351160.0, "step": 2440 }, { "entropy": 0.5458673521876335, "epoch": 2.469994957135653, "grad_norm": 0.5522996783256531, "learning_rate": 1.7708333333333335e-05, "loss": 0.5378719329833984, "mean_token_accuracy": 0.8654713213443757, "num_tokens": 19430996.0, "step": 2450 }, { "entropy": 0.5559975445270539, "epoch": 2.4800806858295514, "grad_norm": 0.5336911678314209, "learning_rate": 1.7372311827956993e-05, "loss": 0.5409592151641845, "mean_token_accuracy": 0.8620710968971252, "num_tokens": 19510210.0, "step": 2460 }, { "entropy": 0.5456252574920655, "epoch": 2.4901664145234492, "grad_norm": 0.5605066418647766, "learning_rate": 1.7036290322580644e-05, "loss": 0.5332871913909912, "mean_token_accuracy": 0.8647909879684448, "num_tokens": 19589727.0, "step": 2470 }, { "entropy": 0.5535303637385368, "epoch": 2.5002521432173475, "grad_norm": 0.4991672933101654, "learning_rate": 1.67002688172043e-05, "loss": 0.5402321815490723, "mean_token_accuracy": 0.8653812408447266, "num_tokens": 19668443.0, "step": 2480 }, { "entropy": 0.5551770642399788, "epoch": 2.5103378719112457, "grad_norm": 0.5773875713348389, "learning_rate": 1.6364247311827956e-05, "loss": 0.5489557266235352, "mean_token_accuracy": 0.8608813732862473, "num_tokens": 19747352.0, "step": 2490 }, { "entropy": 0.5320880457758903, "epoch": 2.5204236006051435, "grad_norm": 0.5162405371665955, "learning_rate": 1.6028225806451614e-05, "loss": 0.5143797397613525, "mean_token_accuracy": 0.8693823754787445, "num_tokens": 19825761.0, "step": 2500 } ], "logging_steps": 10, "max_steps": 2976, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.362020159939712e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }