Qwen2.5-0.5B-SQL / checkpoint-2976 /trainer_state.json
azeemazam's picture
Initial upload of Qwen2.5-0.5B SQL LoRA adapter
ba97ccc verified
Raw
History Blame Contribute Delete
90.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 2976,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.4401287615299225,
"epoch": 0.010085728693898134,
"grad_norm": 2.4543752670288086,
"learning_rate": 9.96975806451613e-05,
"loss": 1.6213287353515624,
"mean_token_accuracy": 0.7053921639919281,
"num_tokens": 79097.0,
"step": 10
},
{
"entropy": 0.7891692698001862,
"epoch": 0.020171457387796268,
"grad_norm": 0.5390229821205139,
"learning_rate": 9.936155913978495e-05,
"loss": 0.7798945903778076,
"mean_token_accuracy": 0.8249495834112167,
"num_tokens": 158299.0,
"step": 20
},
{
"entropy": 0.724391582608223,
"epoch": 0.030257186081694403,
"grad_norm": 0.5045413374900818,
"learning_rate": 9.90255376344086e-05,
"loss": 0.7134008407592773,
"mean_token_accuracy": 0.8398919939994812,
"num_tokens": 238224.0,
"step": 30
},
{
"entropy": 0.7293597489595414,
"epoch": 0.040342914775592535,
"grad_norm": 0.46384477615356445,
"learning_rate": 9.868951612903227e-05,
"loss": 0.7243994235992431,
"mean_token_accuracy": 0.8363275468349457,
"num_tokens": 317353.0,
"step": 40
},
{
"entropy": 0.7545649409294128,
"epoch": 0.05042864346949067,
"grad_norm": 0.45745861530303955,
"learning_rate": 9.835349462365592e-05,
"loss": 0.7480543613433838,
"mean_token_accuracy": 0.8288968414068222,
"num_tokens": 397144.0,
"step": 50
},
{
"entropy": 0.7276962548494339,
"epoch": 0.060514372163388806,
"grad_norm": 0.4223039448261261,
"learning_rate": 9.801747311827957e-05,
"loss": 0.7222286701202393,
"mean_token_accuracy": 0.8347062259912491,
"num_tokens": 476208.0,
"step": 60
},
{
"entropy": 0.7208940893411636,
"epoch": 0.07060010085728693,
"grad_norm": 0.407697468996048,
"learning_rate": 9.768145161290323e-05,
"loss": 0.722746753692627,
"mean_token_accuracy": 0.8354023069143295,
"num_tokens": 554635.0,
"step": 70
},
{
"entropy": 0.6870111703872681,
"epoch": 0.08068582955118507,
"grad_norm": 0.4341161549091339,
"learning_rate": 9.734543010752689e-05,
"loss": 0.678754472732544,
"mean_token_accuracy": 0.8434581071138382,
"num_tokens": 634099.0,
"step": 80
},
{
"entropy": 0.712015038728714,
"epoch": 0.0907715582450832,
"grad_norm": 0.44776472449302673,
"learning_rate": 9.700940860215055e-05,
"loss": 0.7065191268920898,
"mean_token_accuracy": 0.8397477447986603,
"num_tokens": 714006.0,
"step": 90
},
{
"entropy": 0.7148925572633743,
"epoch": 0.10085728693898134,
"grad_norm": 0.5683232545852661,
"learning_rate": 9.667338709677419e-05,
"loss": 0.7013186454772949,
"mean_token_accuracy": 0.8386768013238907,
"num_tokens": 793605.0,
"step": 100
},
{
"entropy": 0.6803987801074982,
"epoch": 0.11094301563287948,
"grad_norm": 0.4578818678855896,
"learning_rate": 9.633736559139785e-05,
"loss": 0.6829161643981934,
"mean_token_accuracy": 0.8444311052560807,
"num_tokens": 873358.0,
"step": 110
},
{
"entropy": 0.7018243819475174,
"epoch": 0.12102874432677761,
"grad_norm": 0.5580450892448425,
"learning_rate": 9.600134408602151e-05,
"loss": 0.6889585018157959,
"mean_token_accuracy": 0.837009659409523,
"num_tokens": 951272.0,
"step": 120
},
{
"entropy": 0.6722540825605392,
"epoch": 0.13111447302067575,
"grad_norm": 0.4111092984676361,
"learning_rate": 9.566532258064517e-05,
"loss": 0.671303653717041,
"mean_token_accuracy": 0.8431149035692215,
"num_tokens": 1030605.0,
"step": 130
},
{
"entropy": 0.6760291874408721,
"epoch": 0.14120020171457387,
"grad_norm": 0.4307563900947571,
"learning_rate": 9.532930107526882e-05,
"loss": 0.6683278560638428,
"mean_token_accuracy": 0.8399741470813751,
"num_tokens": 1110880.0,
"step": 140
},
{
"entropy": 0.6972564935684205,
"epoch": 0.15128593040847202,
"grad_norm": 0.4529708921909332,
"learning_rate": 9.499327956989248e-05,
"loss": 0.6857415199279785,
"mean_token_accuracy": 0.8408671110868454,
"num_tokens": 1190751.0,
"step": 150
},
{
"entropy": 0.6963291883468627,
"epoch": 0.16137165910237014,
"grad_norm": 0.5361336469650269,
"learning_rate": 9.465725806451613e-05,
"loss": 0.6925512313842773,
"mean_token_accuracy": 0.8375045716762543,
"num_tokens": 1270609.0,
"step": 160
},
{
"entropy": 0.66875439286232,
"epoch": 0.1714573877962683,
"grad_norm": 0.46975305676460266,
"learning_rate": 9.43212365591398e-05,
"loss": 0.6634211063385009,
"mean_token_accuracy": 0.8445858895778656,
"num_tokens": 1349205.0,
"step": 170
},
{
"entropy": 0.655107605457306,
"epoch": 0.1815431164901664,
"grad_norm": 0.4822644293308258,
"learning_rate": 9.398521505376344e-05,
"loss": 0.6485553741455078,
"mean_token_accuracy": 0.8466801524162293,
"num_tokens": 1429188.0,
"step": 180
},
{
"entropy": 0.6764869809150695,
"epoch": 0.19162884518406456,
"grad_norm": 0.4278046488761902,
"learning_rate": 9.36491935483871e-05,
"loss": 0.6674195289611816,
"mean_token_accuracy": 0.8449790179729462,
"num_tokens": 1508657.0,
"step": 190
},
{
"entropy": 0.6527546226978302,
"epoch": 0.20171457387796268,
"grad_norm": 0.4304865598678589,
"learning_rate": 9.331317204301076e-05,
"loss": 0.6533342361450195,
"mean_token_accuracy": 0.8459020614624023,
"num_tokens": 1588683.0,
"step": 200
},
{
"entropy": 0.6602984070777893,
"epoch": 0.2118003025718608,
"grad_norm": 0.4939623177051544,
"learning_rate": 9.297715053763442e-05,
"loss": 0.648746109008789,
"mean_token_accuracy": 0.8454504400491715,
"num_tokens": 1668136.0,
"step": 210
},
{
"entropy": 0.6352969735860825,
"epoch": 0.22188603126575895,
"grad_norm": 0.509572446346283,
"learning_rate": 9.264112903225807e-05,
"loss": 0.6338551044464111,
"mean_token_accuracy": 0.8501922994852066,
"num_tokens": 1747761.0,
"step": 220
},
{
"entropy": 0.640106874704361,
"epoch": 0.23197175995965708,
"grad_norm": 0.4373609721660614,
"learning_rate": 9.230510752688173e-05,
"loss": 0.63339204788208,
"mean_token_accuracy": 0.8499221503734589,
"num_tokens": 1826998.0,
"step": 230
},
{
"entropy": 0.6553326368331909,
"epoch": 0.24205748865355523,
"grad_norm": 0.5667263269424438,
"learning_rate": 9.196908602150538e-05,
"loss": 0.6620019912719727,
"mean_token_accuracy": 0.8443398654460907,
"num_tokens": 1906898.0,
"step": 240
},
{
"entropy": 0.6542477309703827,
"epoch": 0.2521432173474534,
"grad_norm": 0.42866837978363037,
"learning_rate": 9.163306451612905e-05,
"loss": 0.6385551452636719,
"mean_token_accuracy": 0.8501411974430084,
"num_tokens": 1986598.0,
"step": 250
},
{
"entropy": 0.6644888401031495,
"epoch": 0.2622289460413515,
"grad_norm": 0.471479594707489,
"learning_rate": 9.129704301075269e-05,
"loss": 0.6652373790740966,
"mean_token_accuracy": 0.8430449545383454,
"num_tokens": 2065968.0,
"step": 260
},
{
"entropy": 0.6506140828132629,
"epoch": 0.2723146747352496,
"grad_norm": 0.5871238112449646,
"learning_rate": 9.096102150537635e-05,
"loss": 0.6394162654876709,
"mean_token_accuracy": 0.8478008478879928,
"num_tokens": 2144807.0,
"step": 270
},
{
"entropy": 0.6450737684965133,
"epoch": 0.28240040342914774,
"grad_norm": 0.4758750796318054,
"learning_rate": 9.062500000000001e-05,
"loss": 0.6317679405212402,
"mean_token_accuracy": 0.8477421134710312,
"num_tokens": 2224756.0,
"step": 280
},
{
"entropy": 0.6312454760074615,
"epoch": 0.2924861321230459,
"grad_norm": 0.40708398818969727,
"learning_rate": 9.028897849462365e-05,
"loss": 0.6294290065765381,
"mean_token_accuracy": 0.8498372942209244,
"num_tokens": 2303755.0,
"step": 290
},
{
"entropy": 0.6435921430587769,
"epoch": 0.30257186081694404,
"grad_norm": 0.4586315155029297,
"learning_rate": 8.995295698924732e-05,
"loss": 0.6426968574523926,
"mean_token_accuracy": 0.851655799150467,
"num_tokens": 2383438.0,
"step": 300
},
{
"entropy": 0.6444200366735459,
"epoch": 0.31265758951084216,
"grad_norm": 0.41651129722595215,
"learning_rate": 8.961693548387097e-05,
"loss": 0.6398116111755371,
"mean_token_accuracy": 0.8491226196289062,
"num_tokens": 2462092.0,
"step": 310
},
{
"entropy": 0.630822691321373,
"epoch": 0.3227433182047403,
"grad_norm": 0.3903122842311859,
"learning_rate": 8.928091397849463e-05,
"loss": 0.6180138111114502,
"mean_token_accuracy": 0.8523771226406097,
"num_tokens": 2540813.0,
"step": 320
},
{
"entropy": 0.6329970508813858,
"epoch": 0.3328290468986384,
"grad_norm": 0.487721711397171,
"learning_rate": 8.894489247311828e-05,
"loss": 0.6315666198730469,
"mean_token_accuracy": 0.851043239235878,
"num_tokens": 2619658.0,
"step": 330
},
{
"entropy": 0.6223464220762253,
"epoch": 0.3429147755925366,
"grad_norm": 0.44329893589019775,
"learning_rate": 8.860887096774194e-05,
"loss": 0.60896897315979,
"mean_token_accuracy": 0.8548593938350677,
"num_tokens": 2698558.0,
"step": 340
},
{
"entropy": 0.629158017039299,
"epoch": 0.3530005042864347,
"grad_norm": 0.4763728976249695,
"learning_rate": 8.827284946236559e-05,
"loss": 0.6243833541870117,
"mean_token_accuracy": 0.8506437599658966,
"num_tokens": 2777589.0,
"step": 350
},
{
"entropy": 0.6252221703529358,
"epoch": 0.3630862329803328,
"grad_norm": 0.573401153087616,
"learning_rate": 8.793682795698926e-05,
"loss": 0.6311960697174073,
"mean_token_accuracy": 0.8492237269878388,
"num_tokens": 2857260.0,
"step": 360
},
{
"entropy": 0.6388662099838257,
"epoch": 0.37317196167423095,
"grad_norm": 0.43780848383903503,
"learning_rate": 8.76008064516129e-05,
"loss": 0.6235979557037353,
"mean_token_accuracy": 0.8501455813646317,
"num_tokens": 2937031.0,
"step": 370
},
{
"entropy": 0.6401920437812805,
"epoch": 0.3832576903681291,
"grad_norm": 0.6186213493347168,
"learning_rate": 8.726478494623656e-05,
"loss": 0.6394696712493897,
"mean_token_accuracy": 0.8473399400711059,
"num_tokens": 3016793.0,
"step": 380
},
{
"entropy": 0.636756744980812,
"epoch": 0.39334341906202724,
"grad_norm": 0.4315045177936554,
"learning_rate": 8.692876344086022e-05,
"loss": 0.633165979385376,
"mean_token_accuracy": 0.8462948054075241,
"num_tokens": 3096882.0,
"step": 390
},
{
"entropy": 0.6365224033594131,
"epoch": 0.40342914775592537,
"grad_norm": 0.4226789176464081,
"learning_rate": 8.659274193548388e-05,
"loss": 0.6305986404418945,
"mean_token_accuracy": 0.8494676142930985,
"num_tokens": 3176078.0,
"step": 400
},
{
"entropy": 0.6208570182323456,
"epoch": 0.4135148764498235,
"grad_norm": 0.4235779643058777,
"learning_rate": 8.625672043010753e-05,
"loss": 0.6180022716522217,
"mean_token_accuracy": 0.8546466052532196,
"num_tokens": 3254722.0,
"step": 410
},
{
"entropy": 0.6532779157161712,
"epoch": 0.4236006051437216,
"grad_norm": 0.4319876730442047,
"learning_rate": 8.592069892473119e-05,
"loss": 0.6470151901245117,
"mean_token_accuracy": 0.8489160239696503,
"num_tokens": 3334393.0,
"step": 420
},
{
"entropy": 0.6273243516683579,
"epoch": 0.4336863338376198,
"grad_norm": 0.46169838309288025,
"learning_rate": 8.558467741935484e-05,
"loss": 0.6159895896911621,
"mean_token_accuracy": 0.8507320910692215,
"num_tokens": 3413175.0,
"step": 430
},
{
"entropy": 0.605324798822403,
"epoch": 0.4437720625315179,
"grad_norm": 0.4526413083076477,
"learning_rate": 8.524865591397851e-05,
"loss": 0.6038426876068115,
"mean_token_accuracy": 0.8523322999477386,
"num_tokens": 3492802.0,
"step": 440
},
{
"entropy": 0.6320730000734329,
"epoch": 0.45385779122541603,
"grad_norm": 0.44433295726776123,
"learning_rate": 8.491263440860215e-05,
"loss": 0.6316131114959717,
"mean_token_accuracy": 0.8506852626800537,
"num_tokens": 3572664.0,
"step": 450
},
{
"entropy": 0.6317211121320725,
"epoch": 0.46394351991931415,
"grad_norm": 0.4498536288738251,
"learning_rate": 8.457661290322581e-05,
"loss": 0.6204007148742676,
"mean_token_accuracy": 0.853309515118599,
"num_tokens": 3652196.0,
"step": 460
},
{
"entropy": 0.6048054486513138,
"epoch": 0.47402924861321233,
"grad_norm": 0.45512956380844116,
"learning_rate": 8.424059139784947e-05,
"loss": 0.5983153820037842,
"mean_token_accuracy": 0.8557393223047256,
"num_tokens": 3731796.0,
"step": 470
},
{
"entropy": 0.6131872147321701,
"epoch": 0.48411497730711045,
"grad_norm": 0.39910048246383667,
"learning_rate": 8.390456989247311e-05,
"loss": 0.6079683303833008,
"mean_token_accuracy": 0.8534030020236969,
"num_tokens": 3811294.0,
"step": 480
},
{
"entropy": 0.6184361279010773,
"epoch": 0.49420070600100857,
"grad_norm": 0.45986732840538025,
"learning_rate": 8.356854838709678e-05,
"loss": 0.6137691497802734,
"mean_token_accuracy": 0.8516123294830322,
"num_tokens": 3890846.0,
"step": 490
},
{
"entropy": 0.6471396833658218,
"epoch": 0.5042864346949067,
"grad_norm": 0.49332594871520996,
"learning_rate": 8.323252688172043e-05,
"loss": 0.6466721057891845,
"mean_token_accuracy": 0.8456789135932923,
"num_tokens": 3970491.0,
"step": 500
},
{
"entropy": 0.6282050013542175,
"epoch": 0.5143721633888049,
"grad_norm": 0.4807436168193817,
"learning_rate": 8.289650537634409e-05,
"loss": 0.6175512313842774,
"mean_token_accuracy": 0.8522112727165222,
"num_tokens": 4050021.0,
"step": 510
},
{
"entropy": 0.6226097255945205,
"epoch": 0.524457892082703,
"grad_norm": 0.40654024481773376,
"learning_rate": 8.256048387096774e-05,
"loss": 0.6200938701629639,
"mean_token_accuracy": 0.8494216620922088,
"num_tokens": 4129976.0,
"step": 520
},
{
"entropy": 0.6335893511772156,
"epoch": 0.5345436207766011,
"grad_norm": 0.4114026427268982,
"learning_rate": 8.22244623655914e-05,
"loss": 0.6252026081085205,
"mean_token_accuracy": 0.8503925174474716,
"num_tokens": 4210291.0,
"step": 530
},
{
"entropy": 0.6135816037654876,
"epoch": 0.5446293494704992,
"grad_norm": 0.41848844289779663,
"learning_rate": 8.188844086021506e-05,
"loss": 0.6145244121551514,
"mean_token_accuracy": 0.8571697324514389,
"num_tokens": 4290179.0,
"step": 540
},
{
"entropy": 0.6119378715753555,
"epoch": 0.5547150781643974,
"grad_norm": 0.48698148131370544,
"learning_rate": 8.155241935483872e-05,
"loss": 0.6051679134368897,
"mean_token_accuracy": 0.853746697306633,
"num_tokens": 4368707.0,
"step": 550
},
{
"entropy": 0.603636771440506,
"epoch": 0.5648008068582955,
"grad_norm": 0.4577937424182892,
"learning_rate": 8.121639784946236e-05,
"loss": 0.5904152870178223,
"mean_token_accuracy": 0.854565218091011,
"num_tokens": 4448005.0,
"step": 560
},
{
"entropy": 0.6001244992017746,
"epoch": 0.5748865355521936,
"grad_norm": 0.5210131406784058,
"learning_rate": 8.088037634408603e-05,
"loss": 0.6008370399475098,
"mean_token_accuracy": 0.8562947660684586,
"num_tokens": 4526862.0,
"step": 570
},
{
"entropy": 0.6188263714313507,
"epoch": 0.5849722642460918,
"grad_norm": 0.47299662232398987,
"learning_rate": 8.054435483870968e-05,
"loss": 0.6188117027282715,
"mean_token_accuracy": 0.8530359834432601,
"num_tokens": 4605637.0,
"step": 580
},
{
"entropy": 0.6129011958837509,
"epoch": 0.59505799293999,
"grad_norm": 0.465508371591568,
"learning_rate": 8.020833333333334e-05,
"loss": 0.6022593021392822,
"mean_token_accuracy": 0.8554005295038223,
"num_tokens": 4685017.0,
"step": 590
},
{
"entropy": 0.6162968903779984,
"epoch": 0.6051437216338881,
"grad_norm": 0.43233755230903625,
"learning_rate": 7.9872311827957e-05,
"loss": 0.6092077732086182,
"mean_token_accuracy": 0.8540722340345382,
"num_tokens": 4765201.0,
"step": 600
},
{
"entropy": 0.600800535082817,
"epoch": 0.6152294503277862,
"grad_norm": 0.38787180185317993,
"learning_rate": 7.953629032258065e-05,
"loss": 0.5950473785400391,
"mean_token_accuracy": 0.8578711360692978,
"num_tokens": 4844272.0,
"step": 610
},
{
"entropy": 0.6160470128059388,
"epoch": 0.6253151790216843,
"grad_norm": 0.5581951141357422,
"learning_rate": 7.920026881720431e-05,
"loss": 0.6130586624145508,
"mean_token_accuracy": 0.8534553349018097,
"num_tokens": 4923984.0,
"step": 620
},
{
"entropy": 0.6198133587837219,
"epoch": 0.6354009077155824,
"grad_norm": 0.4616735279560089,
"learning_rate": 7.886424731182797e-05,
"loss": 0.6103284358978271,
"mean_token_accuracy": 0.8518910020589828,
"num_tokens": 5003560.0,
"step": 630
},
{
"entropy": 0.6080410033464432,
"epoch": 0.6454866364094806,
"grad_norm": 0.42364850640296936,
"learning_rate": 7.852822580645161e-05,
"loss": 0.6008682250976562,
"mean_token_accuracy": 0.8532625198364258,
"num_tokens": 5083721.0,
"step": 640
},
{
"entropy": 0.6005331248044967,
"epoch": 0.6555723651033787,
"grad_norm": 0.4882436692714691,
"learning_rate": 7.819220430107528e-05,
"loss": 0.6017726421356201,
"mean_token_accuracy": 0.8539737015962601,
"num_tokens": 5162794.0,
"step": 650
},
{
"entropy": 0.6231147140264511,
"epoch": 0.6656580937972768,
"grad_norm": 0.43205761909484863,
"learning_rate": 7.785618279569893e-05,
"loss": 0.6104018688201904,
"mean_token_accuracy": 0.8523163944482803,
"num_tokens": 5242716.0,
"step": 660
},
{
"entropy": 0.5988608807325363,
"epoch": 0.675743822491175,
"grad_norm": 0.45438122749328613,
"learning_rate": 7.752016129032259e-05,
"loss": 0.6024129390716553,
"mean_token_accuracy": 0.8553207635879516,
"num_tokens": 5321928.0,
"step": 670
},
{
"entropy": 0.6223491996526718,
"epoch": 0.6858295511850732,
"grad_norm": 0.4512474834918976,
"learning_rate": 7.718413978494624e-05,
"loss": 0.6082096099853516,
"mean_token_accuracy": 0.8545188844203949,
"num_tokens": 5401348.0,
"step": 680
},
{
"entropy": 0.6194269865751266,
"epoch": 0.6959152798789713,
"grad_norm": 0.4599096179008484,
"learning_rate": 7.684811827956989e-05,
"loss": 0.6193777561187744,
"mean_token_accuracy": 0.8514397442340851,
"num_tokens": 5480681.0,
"step": 690
},
{
"entropy": 0.6062219262123107,
"epoch": 0.7060010085728694,
"grad_norm": 0.5039567947387695,
"learning_rate": 7.651209677419356e-05,
"loss": 0.5999524116516113,
"mean_token_accuracy": 0.8567820072174073,
"num_tokens": 5559946.0,
"step": 700
},
{
"entropy": 0.59709934592247,
"epoch": 0.7160867372667675,
"grad_norm": 0.3883519470691681,
"learning_rate": 7.61760752688172e-05,
"loss": 0.5958030700683594,
"mean_token_accuracy": 0.8547020137310029,
"num_tokens": 5638762.0,
"step": 710
},
{
"entropy": 0.6092049956321717,
"epoch": 0.7261724659606656,
"grad_norm": 0.4532882273197174,
"learning_rate": 7.584005376344086e-05,
"loss": 0.5958750724792481,
"mean_token_accuracy": 0.8556324869394303,
"num_tokens": 5718851.0,
"step": 720
},
{
"entropy": 0.6095692694187165,
"epoch": 0.7362581946545638,
"grad_norm": 0.4741406738758087,
"learning_rate": 7.550403225806452e-05,
"loss": 0.610473346710205,
"mean_token_accuracy": 0.8528454750776291,
"num_tokens": 5797970.0,
"step": 730
},
{
"entropy": 0.6113681852817535,
"epoch": 0.7463439233484619,
"grad_norm": 0.4759446382522583,
"learning_rate": 7.516801075268818e-05,
"loss": 0.6012178421020508,
"mean_token_accuracy": 0.8544665992259979,
"num_tokens": 5876757.0,
"step": 740
},
{
"entropy": 0.6085548311471939,
"epoch": 0.75642965204236,
"grad_norm": 0.41346922516822815,
"learning_rate": 7.483198924731182e-05,
"loss": 0.6044020652770996,
"mean_token_accuracy": 0.8550712764263153,
"num_tokens": 5955819.0,
"step": 750
},
{
"entropy": 0.6155774682760239,
"epoch": 0.7665153807362582,
"grad_norm": 0.4597516357898712,
"learning_rate": 7.44959677419355e-05,
"loss": 0.6060014247894288,
"mean_token_accuracy": 0.8542042136192322,
"num_tokens": 6035167.0,
"step": 760
},
{
"entropy": 0.6068645745515824,
"epoch": 0.7766011094301564,
"grad_norm": 0.4649045765399933,
"learning_rate": 7.415994623655914e-05,
"loss": 0.6007673740386963,
"mean_token_accuracy": 0.8525227665901184,
"num_tokens": 6113853.0,
"step": 770
},
{
"entropy": 0.6005396485328675,
"epoch": 0.7866868381240545,
"grad_norm": 0.48349109292030334,
"learning_rate": 7.382392473118281e-05,
"loss": 0.5998473167419434,
"mean_token_accuracy": 0.8538594901561737,
"num_tokens": 6193206.0,
"step": 780
},
{
"entropy": 0.6022996723651886,
"epoch": 0.7967725668179526,
"grad_norm": 0.49629247188568115,
"learning_rate": 7.348790322580645e-05,
"loss": 0.597620677947998,
"mean_token_accuracy": 0.8530676156282425,
"num_tokens": 6271687.0,
"step": 790
},
{
"entropy": 0.5972118631005288,
"epoch": 0.8068582955118507,
"grad_norm": 0.4917770028114319,
"learning_rate": 7.315188172043011e-05,
"loss": 0.5890127658843994,
"mean_token_accuracy": 0.8561224609613418,
"num_tokens": 6351649.0,
"step": 800
},
{
"entropy": 0.5830775499343872,
"epoch": 0.8169440242057489,
"grad_norm": 0.43750327825546265,
"learning_rate": 7.281586021505377e-05,
"loss": 0.5748737335205079,
"mean_token_accuracy": 0.857504940032959,
"num_tokens": 6431689.0,
"step": 810
},
{
"entropy": 0.5911667436361313,
"epoch": 0.827029752899647,
"grad_norm": 0.45151153206825256,
"learning_rate": 7.247983870967743e-05,
"loss": 0.5893730163574219,
"mean_token_accuracy": 0.8561951071023941,
"num_tokens": 6510170.0,
"step": 820
},
{
"entropy": 0.6108928948640824,
"epoch": 0.8371154815935451,
"grad_norm": 0.42554008960723877,
"learning_rate": 7.214381720430107e-05,
"loss": 0.6033421039581299,
"mean_token_accuracy": 0.8555109530687333,
"num_tokens": 6590115.0,
"step": 830
},
{
"entropy": 0.6150878429412842,
"epoch": 0.8472012102874432,
"grad_norm": 0.4883771538734436,
"learning_rate": 7.180779569892473e-05,
"loss": 0.6113218307495117,
"mean_token_accuracy": 0.8518930107355118,
"num_tokens": 6669457.0,
"step": 840
},
{
"entropy": 0.6158306688070297,
"epoch": 0.8572869389813415,
"grad_norm": 0.4417215883731842,
"learning_rate": 7.147177419354839e-05,
"loss": 0.6072550296783448,
"mean_token_accuracy": 0.852121776342392,
"num_tokens": 6748544.0,
"step": 850
},
{
"entropy": 0.6014792859554291,
"epoch": 0.8673726676752396,
"grad_norm": 0.47120651602745056,
"learning_rate": 7.113575268817205e-05,
"loss": 0.6035449504852295,
"mean_token_accuracy": 0.855668443441391,
"num_tokens": 6828527.0,
"step": 860
},
{
"entropy": 0.610417115688324,
"epoch": 0.8774583963691377,
"grad_norm": 0.4029320478439331,
"learning_rate": 7.07997311827957e-05,
"loss": 0.5991814613342286,
"mean_token_accuracy": 0.8501907676458359,
"num_tokens": 6907265.0,
"step": 870
},
{
"entropy": 0.5880232125520706,
"epoch": 0.8875441250630358,
"grad_norm": 0.44422170519828796,
"learning_rate": 7.046370967741935e-05,
"loss": 0.589336633682251,
"mean_token_accuracy": 0.8592681288719177,
"num_tokens": 6987355.0,
"step": 880
},
{
"entropy": 0.6167952179908752,
"epoch": 0.8976298537569339,
"grad_norm": 0.47287294268608093,
"learning_rate": 7.012768817204302e-05,
"loss": 0.6005054950714112,
"mean_token_accuracy": 0.8538300514221191,
"num_tokens": 7067079.0,
"step": 890
},
{
"entropy": 0.6062485039234161,
"epoch": 0.9077155824508321,
"grad_norm": 0.4330484867095947,
"learning_rate": 6.979166666666666e-05,
"loss": 0.6009212017059327,
"mean_token_accuracy": 0.8540766119956971,
"num_tokens": 7146070.0,
"step": 900
},
{
"entropy": 0.6166725903749466,
"epoch": 0.9178013111447302,
"grad_norm": 0.4636240303516388,
"learning_rate": 6.945564516129032e-05,
"loss": 0.6120401859283447,
"mean_token_accuracy": 0.8512512564659118,
"num_tokens": 7225040.0,
"step": 910
},
{
"entropy": 0.5857499420642853,
"epoch": 0.9278870398386283,
"grad_norm": 0.45182108879089355,
"learning_rate": 6.911962365591398e-05,
"loss": 0.5876169204711914,
"mean_token_accuracy": 0.8554476648569107,
"num_tokens": 7304455.0,
"step": 920
},
{
"entropy": 0.6012028098106384,
"epoch": 0.9379727685325264,
"grad_norm": 0.4051869213581085,
"learning_rate": 6.878360215053764e-05,
"loss": 0.5880671977996826,
"mean_token_accuracy": 0.8549540996551513,
"num_tokens": 7383515.0,
"step": 930
},
{
"entropy": 0.6061528742313385,
"epoch": 0.9480584972264247,
"grad_norm": 0.4764135479927063,
"learning_rate": 6.84475806451613e-05,
"loss": 0.5949277877807617,
"mean_token_accuracy": 0.8549325942993165,
"num_tokens": 7462560.0,
"step": 940
},
{
"entropy": 0.5890018880367279,
"epoch": 0.9581442259203228,
"grad_norm": 0.3977248966693878,
"learning_rate": 6.811155913978495e-05,
"loss": 0.5861643314361572,
"mean_token_accuracy": 0.8562160313129425,
"num_tokens": 7542318.0,
"step": 950
},
{
"entropy": 0.569082447886467,
"epoch": 0.9682299546142209,
"grad_norm": 0.45443686842918396,
"learning_rate": 6.77755376344086e-05,
"loss": 0.5597212314605713,
"mean_token_accuracy": 0.8636837095022202,
"num_tokens": 7619896.0,
"step": 960
},
{
"entropy": 0.6035693377256394,
"epoch": 0.978315683308119,
"grad_norm": 0.4136727452278137,
"learning_rate": 6.743951612903227e-05,
"loss": 0.5982972145080566,
"mean_token_accuracy": 0.852931946516037,
"num_tokens": 7699479.0,
"step": 970
},
{
"entropy": 0.6018765300512314,
"epoch": 0.9884014120020171,
"grad_norm": 0.4627329707145691,
"learning_rate": 6.710349462365591e-05,
"loss": 0.6014264106750489,
"mean_token_accuracy": 0.8550704807043076,
"num_tokens": 7777973.0,
"step": 980
},
{
"entropy": 0.6101315438747406,
"epoch": 0.9984871406959153,
"grad_norm": 0.43074938654899597,
"learning_rate": 6.676747311827957e-05,
"loss": 0.6003837585449219,
"mean_token_accuracy": 0.8531194061040879,
"num_tokens": 7857491.0,
"step": 990
},
{
"entropy": 0.5885249046902907,
"epoch": 1.0080685829551186,
"grad_norm": 0.43550798296928406,
"learning_rate": 6.643145161290323e-05,
"loss": 0.5827617645263672,
"mean_token_accuracy": 0.8590492982613412,
"num_tokens": 7931419.0,
"step": 1000
},
{
"entropy": 0.5786265924572944,
"epoch": 1.0181543116490166,
"grad_norm": 0.4006239175796509,
"learning_rate": 6.609543010752689e-05,
"loss": 0.5741347312927246,
"mean_token_accuracy": 0.859987598657608,
"num_tokens": 8010076.0,
"step": 1010
},
{
"entropy": 0.6029427081346512,
"epoch": 1.0282400403429148,
"grad_norm": 0.5301637649536133,
"learning_rate": 6.575940860215055e-05,
"loss": 0.5843387603759765,
"mean_token_accuracy": 0.8552656710147858,
"num_tokens": 8089226.0,
"step": 1020
},
{
"entropy": 0.5827758759260178,
"epoch": 1.0383257690368128,
"grad_norm": 0.46098172664642334,
"learning_rate": 6.542338709677419e-05,
"loss": 0.5769033432006836,
"mean_token_accuracy": 0.8591033697128296,
"num_tokens": 8168296.0,
"step": 1030
},
{
"entropy": 0.578029453754425,
"epoch": 1.048411497730711,
"grad_norm": 0.4419442117214203,
"learning_rate": 6.508736559139785e-05,
"loss": 0.5668691158294678,
"mean_token_accuracy": 0.8618250399827957,
"num_tokens": 8247389.0,
"step": 1040
},
{
"entropy": 0.57004164904356,
"epoch": 1.058497226424609,
"grad_norm": 0.42728376388549805,
"learning_rate": 6.47513440860215e-05,
"loss": 0.5635159492492676,
"mean_token_accuracy": 0.8611066967248917,
"num_tokens": 8327733.0,
"step": 1050
},
{
"entropy": 0.5766539484262466,
"epoch": 1.0685829551185073,
"grad_norm": 0.45730945467948914,
"learning_rate": 6.441532258064516e-05,
"loss": 0.5666641235351563,
"mean_token_accuracy": 0.8593446314334869,
"num_tokens": 8407817.0,
"step": 1060
},
{
"entropy": 0.5864439934492112,
"epoch": 1.0786686838124055,
"grad_norm": 0.4544226825237274,
"learning_rate": 6.407930107526882e-05,
"loss": 0.5757258415222168,
"mean_token_accuracy": 0.8577850371599197,
"num_tokens": 8487535.0,
"step": 1070
},
{
"entropy": 0.5884994626045227,
"epoch": 1.0887544125063036,
"grad_norm": 0.48623108863830566,
"learning_rate": 6.374327956989248e-05,
"loss": 0.5825486183166504,
"mean_token_accuracy": 0.8567618876695633,
"num_tokens": 8567287.0,
"step": 1080
},
{
"entropy": 0.5760734975337982,
"epoch": 1.0988401412002018,
"grad_norm": 0.4508640468120575,
"learning_rate": 6.340725806451612e-05,
"loss": 0.5734494209289551,
"mean_token_accuracy": 0.858697172999382,
"num_tokens": 8646370.0,
"step": 1090
},
{
"entropy": 0.590225487947464,
"epoch": 1.1089258698940998,
"grad_norm": 0.43003523349761963,
"learning_rate": 6.30712365591398e-05,
"loss": 0.5778960704803466,
"mean_token_accuracy": 0.8560095846652984,
"num_tokens": 8726482.0,
"step": 1100
},
{
"entropy": 0.5984179466962815,
"epoch": 1.119011598587998,
"grad_norm": 0.4635157883167267,
"learning_rate": 6.273521505376344e-05,
"loss": 0.5918797016143799,
"mean_token_accuracy": 0.8553583979606628,
"num_tokens": 8805451.0,
"step": 1110
},
{
"entropy": 0.5844434216618538,
"epoch": 1.129097327281896,
"grad_norm": 0.4477420151233673,
"learning_rate": 6.23991935483871e-05,
"loss": 0.57535400390625,
"mean_token_accuracy": 0.8573390394449234,
"num_tokens": 8884601.0,
"step": 1120
},
{
"entropy": 0.5594617292284966,
"epoch": 1.1391830559757943,
"grad_norm": 0.4664854407310486,
"learning_rate": 6.206317204301076e-05,
"loss": 0.5436801910400391,
"mean_token_accuracy": 0.8645383834838867,
"num_tokens": 8962133.0,
"step": 1130
},
{
"entropy": 0.5811979010701179,
"epoch": 1.1492687846696923,
"grad_norm": 0.44287121295928955,
"learning_rate": 6.172715053763441e-05,
"loss": 0.5768415451049804,
"mean_token_accuracy": 0.8589100211858749,
"num_tokens": 9041544.0,
"step": 1140
},
{
"entropy": 0.5857019424438477,
"epoch": 1.1593545133635905,
"grad_norm": 0.49549591541290283,
"learning_rate": 6.139112903225806e-05,
"loss": 0.583711576461792,
"mean_token_accuracy": 0.8538704454898834,
"num_tokens": 9120658.0,
"step": 1150
},
{
"entropy": 0.5798764854669571,
"epoch": 1.1694402420574885,
"grad_norm": 0.45661458373069763,
"learning_rate": 6.105510752688173e-05,
"loss": 0.5687499046325684,
"mean_token_accuracy": 0.8593120962381363,
"num_tokens": 9200441.0,
"step": 1160
},
{
"entropy": 0.5608216986060143,
"epoch": 1.1795259707513868,
"grad_norm": 0.4311324656009674,
"learning_rate": 6.0719086021505375e-05,
"loss": 0.5529376029968261,
"mean_token_accuracy": 0.8649492233991622,
"num_tokens": 9280337.0,
"step": 1170
},
{
"entropy": 0.5674901068210602,
"epoch": 1.189611699445285,
"grad_norm": 0.42369771003723145,
"learning_rate": 6.038306451612904e-05,
"loss": 0.5703757762908935,
"mean_token_accuracy": 0.8604072660207749,
"num_tokens": 9359718.0,
"step": 1180
},
{
"entropy": 0.5913670003414154,
"epoch": 1.199697428139183,
"grad_norm": 0.42738214135169983,
"learning_rate": 6.004704301075269e-05,
"loss": 0.5724913597106933,
"mean_token_accuracy": 0.8573768496513366,
"num_tokens": 9438541.0,
"step": 1190
},
{
"entropy": 0.5946374118328095,
"epoch": 1.2097831568330812,
"grad_norm": 0.4449988901615143,
"learning_rate": 5.9711021505376355e-05,
"loss": 0.587339973449707,
"mean_token_accuracy": 0.8539384603500366,
"num_tokens": 9518019.0,
"step": 1200
},
{
"entropy": 0.5591581493616105,
"epoch": 1.2198688855269793,
"grad_norm": 0.500762939453125,
"learning_rate": 5.9375e-05,
"loss": 0.5534748077392578,
"mean_token_accuracy": 0.8654944837093353,
"num_tokens": 9598123.0,
"step": 1210
},
{
"entropy": 0.5613914996385574,
"epoch": 1.2299546142208775,
"grad_norm": 0.49419164657592773,
"learning_rate": 5.903897849462365e-05,
"loss": 0.552029800415039,
"mean_token_accuracy": 0.8651645094156265,
"num_tokens": 9677061.0,
"step": 1220
},
{
"entropy": 0.5790321677923203,
"epoch": 1.2400403429147757,
"grad_norm": 0.45684942603111267,
"learning_rate": 5.8702956989247316e-05,
"loss": 0.5709888935089111,
"mean_token_accuracy": 0.8570766538381577,
"num_tokens": 9755822.0,
"step": 1230
},
{
"entropy": 0.5670598953962326,
"epoch": 1.2501260716086737,
"grad_norm": 0.4502805471420288,
"learning_rate": 5.836693548387097e-05,
"loss": 0.5562293052673339,
"mean_token_accuracy": 0.8617229491472245,
"num_tokens": 9833630.0,
"step": 1240
},
{
"entropy": 0.5812987759709358,
"epoch": 1.2602118003025717,
"grad_norm": 0.47911354899406433,
"learning_rate": 5.8030913978494625e-05,
"loss": 0.5785074710845948,
"mean_token_accuracy": 0.8579352408647537,
"num_tokens": 9913298.0,
"step": 1250
},
{
"entropy": 0.5942406296730042,
"epoch": 1.27029752899647,
"grad_norm": 0.5416054129600525,
"learning_rate": 5.7694892473118276e-05,
"loss": 0.5871072769165039,
"mean_token_accuracy": 0.8525298267602921,
"num_tokens": 9992390.0,
"step": 1260
},
{
"entropy": 0.5730470806360245,
"epoch": 1.2803832576903682,
"grad_norm": 0.42904311418533325,
"learning_rate": 5.735887096774194e-05,
"loss": 0.5617104530334472,
"mean_token_accuracy": 0.8585203140974045,
"num_tokens": 10072228.0,
"step": 1270
},
{
"entropy": 0.576186053454876,
"epoch": 1.2904689863842662,
"grad_norm": 0.48196178674697876,
"learning_rate": 5.702284946236559e-05,
"loss": 0.564885950088501,
"mean_token_accuracy": 0.8605964362621308,
"num_tokens": 10151335.0,
"step": 1280
},
{
"entropy": 0.6046586632728577,
"epoch": 1.3005547150781644,
"grad_norm": 0.5057108998298645,
"learning_rate": 5.668682795698925e-05,
"loss": 0.5939000129699707,
"mean_token_accuracy": 0.8541617125272751,
"num_tokens": 10231293.0,
"step": 1290
},
{
"entropy": 0.5814134299755096,
"epoch": 1.3106404437720625,
"grad_norm": 0.4809938669204712,
"learning_rate": 5.63508064516129e-05,
"loss": 0.5762624740600586,
"mean_token_accuracy": 0.8582640796899795,
"num_tokens": 10310793.0,
"step": 1300
},
{
"entropy": 0.5876763761043549,
"epoch": 1.3207261724659607,
"grad_norm": 0.4530595541000366,
"learning_rate": 5.6014784946236566e-05,
"loss": 0.5883693695068359,
"mean_token_accuracy": 0.855881854891777,
"num_tokens": 10390285.0,
"step": 1310
},
{
"entropy": 0.5655333667993545,
"epoch": 1.330811901159859,
"grad_norm": 0.4557790756225586,
"learning_rate": 5.567876344086022e-05,
"loss": 0.5549901962280274,
"mean_token_accuracy": 0.8610905766487121,
"num_tokens": 10470065.0,
"step": 1320
},
{
"entropy": 0.5945004314184189,
"epoch": 1.340897629853757,
"grad_norm": 0.436661958694458,
"learning_rate": 5.5342741935483875e-05,
"loss": 0.5859263896942138,
"mean_token_accuracy": 0.8548474669456482,
"num_tokens": 10549649.0,
"step": 1330
},
{
"entropy": 0.5685078948736191,
"epoch": 1.350983358547655,
"grad_norm": 0.4716840088367462,
"learning_rate": 5.5006720430107526e-05,
"loss": 0.5484930992126464,
"mean_token_accuracy": 0.8640597611665726,
"num_tokens": 10629189.0,
"step": 1340
},
{
"entropy": 0.5654298186302185,
"epoch": 1.3610690872415532,
"grad_norm": 0.42921242117881775,
"learning_rate": 5.467069892473119e-05,
"loss": 0.5640359401702881,
"mean_token_accuracy": 0.860820859670639,
"num_tokens": 10708703.0,
"step": 1350
},
{
"entropy": 0.5941716223955155,
"epoch": 1.3711548159354514,
"grad_norm": 0.46565788984298706,
"learning_rate": 5.433467741935484e-05,
"loss": 0.594744873046875,
"mean_token_accuracy": 0.8517325460910797,
"num_tokens": 10788480.0,
"step": 1360
},
{
"entropy": 0.5812072679400444,
"epoch": 1.3812405446293494,
"grad_norm": 0.4489298462867737,
"learning_rate": 5.39986559139785e-05,
"loss": 0.5654291152954102,
"mean_token_accuracy": 0.8605479776859284,
"num_tokens": 10868434.0,
"step": 1370
},
{
"entropy": 0.5879675418138504,
"epoch": 1.3913262733232477,
"grad_norm": 0.46651822328567505,
"learning_rate": 5.366263440860215e-05,
"loss": 0.5838429450988769,
"mean_token_accuracy": 0.8583901137113571,
"num_tokens": 10948050.0,
"step": 1380
},
{
"entropy": 0.5686550527811051,
"epoch": 1.4014120020171457,
"grad_norm": 0.43968766927719116,
"learning_rate": 5.3326612903225816e-05,
"loss": 0.558499813079834,
"mean_token_accuracy": 0.8613751292228699,
"num_tokens": 11028113.0,
"step": 1390
},
{
"entropy": 0.5755997136235237,
"epoch": 1.411497730711044,
"grad_norm": 0.4646352231502533,
"learning_rate": 5.299059139784947e-05,
"loss": 0.5624261856079101,
"mean_token_accuracy": 0.8600882589817047,
"num_tokens": 11107425.0,
"step": 1400
},
{
"entropy": 0.564902774989605,
"epoch": 1.4215834594049421,
"grad_norm": 0.49692341685295105,
"learning_rate": 5.265456989247312e-05,
"loss": 0.559935188293457,
"mean_token_accuracy": 0.860372531414032,
"num_tokens": 11186952.0,
"step": 1410
},
{
"entropy": 0.5890892148017883,
"epoch": 1.4316691880988401,
"grad_norm": 0.46546879410743713,
"learning_rate": 5.2318548387096776e-05,
"loss": 0.5763956546783447,
"mean_token_accuracy": 0.8564515620470047,
"num_tokens": 11266572.0,
"step": 1420
},
{
"entropy": 0.5781215921044349,
"epoch": 1.4417549167927382,
"grad_norm": 0.44149070978164673,
"learning_rate": 5.198252688172043e-05,
"loss": 0.572498369216919,
"mean_token_accuracy": 0.8586721986532211,
"num_tokens": 11346213.0,
"step": 1430
},
{
"entropy": 0.5667644247412682,
"epoch": 1.4518406454866364,
"grad_norm": 0.4551633894443512,
"learning_rate": 5.164650537634409e-05,
"loss": 0.562723970413208,
"mean_token_accuracy": 0.8600044697523117,
"num_tokens": 11425510.0,
"step": 1440
},
{
"entropy": 0.57702035009861,
"epoch": 1.4619263741805346,
"grad_norm": 0.45487403869628906,
"learning_rate": 5.131048387096774e-05,
"loss": 0.5618971824645996,
"mean_token_accuracy": 0.8618997722864151,
"num_tokens": 11503529.0,
"step": 1450
},
{
"entropy": 0.5790243059396744,
"epoch": 1.4720121028744326,
"grad_norm": 0.481052041053772,
"learning_rate": 5.09744623655914e-05,
"loss": 0.5712011814117431,
"mean_token_accuracy": 0.8604255467653275,
"num_tokens": 11581888.0,
"step": 1460
},
{
"entropy": 0.5728526920080185,
"epoch": 1.4820978315683309,
"grad_norm": 0.4831527769565582,
"learning_rate": 5.063844086021505e-05,
"loss": 0.5751055717468262,
"mean_token_accuracy": 0.8597662955522537,
"num_tokens": 11661311.0,
"step": 1470
},
{
"entropy": 0.5620998844504357,
"epoch": 1.4921835602622289,
"grad_norm": 0.462201327085495,
"learning_rate": 5.030241935483872e-05,
"loss": 0.5486450672149659,
"mean_token_accuracy": 0.8637843191623688,
"num_tokens": 11740118.0,
"step": 1480
},
{
"entropy": 0.5603026807308197,
"epoch": 1.502269288956127,
"grad_norm": 0.47398635745048523,
"learning_rate": 4.996639784946237e-05,
"loss": 0.545743751525879,
"mean_token_accuracy": 0.8636046230793,
"num_tokens": 11817914.0,
"step": 1490
},
{
"entropy": 0.5598662227392197,
"epoch": 1.5123550176500253,
"grad_norm": 0.4725417494773865,
"learning_rate": 4.963037634408602e-05,
"loss": 0.5522914409637452,
"mean_token_accuracy": 0.8619683742523193,
"num_tokens": 11896470.0,
"step": 1500
},
{
"entropy": 0.5722532019019126,
"epoch": 1.5224407463439233,
"grad_norm": 0.47333210706710815,
"learning_rate": 4.929435483870968e-05,
"loss": 0.5686895370483398,
"mean_token_accuracy": 0.8594554871320724,
"num_tokens": 11975221.0,
"step": 1510
},
{
"entropy": 0.5743500784039497,
"epoch": 1.5325264750378214,
"grad_norm": 0.498080313205719,
"learning_rate": 4.8958333333333335e-05,
"loss": 0.5648915290832519,
"mean_token_accuracy": 0.858995920419693,
"num_tokens": 12053927.0,
"step": 1520
},
{
"entropy": 0.5615316748619079,
"epoch": 1.5426122037317196,
"grad_norm": 0.4675048589706421,
"learning_rate": 4.862231182795699e-05,
"loss": 0.5583067893981933,
"mean_token_accuracy": 0.862602812051773,
"num_tokens": 12133779.0,
"step": 1530
},
{
"entropy": 0.5674820989370346,
"epoch": 1.5526979324256178,
"grad_norm": 0.479189932346344,
"learning_rate": 4.8286290322580644e-05,
"loss": 0.5581048965454102,
"mean_token_accuracy": 0.859470346570015,
"num_tokens": 12213321.0,
"step": 1540
},
{
"entropy": 0.5720546498894692,
"epoch": 1.5627836611195158,
"grad_norm": 0.4640292823314667,
"learning_rate": 4.79502688172043e-05,
"loss": 0.5651350498199463,
"mean_token_accuracy": 0.8625688463449478,
"num_tokens": 12293425.0,
"step": 1550
},
{
"entropy": 0.5659960642457008,
"epoch": 1.572869389813414,
"grad_norm": 0.4951878488063812,
"learning_rate": 4.761424731182796e-05,
"loss": 0.5468338966369629,
"mean_token_accuracy": 0.8602778345346451,
"num_tokens": 12371939.0,
"step": 1560
},
{
"entropy": 0.5816718444228173,
"epoch": 1.582955118507312,
"grad_norm": 0.4827718436717987,
"learning_rate": 4.727822580645161e-05,
"loss": 0.5749332427978515,
"mean_token_accuracy": 0.8562595009803772,
"num_tokens": 12451620.0,
"step": 1570
},
{
"entropy": 0.5692623853683472,
"epoch": 1.5930408472012103,
"grad_norm": 0.5074397921562195,
"learning_rate": 4.694220430107527e-05,
"loss": 0.5635262489318847,
"mean_token_accuracy": 0.859693843126297,
"num_tokens": 12531500.0,
"step": 1580
},
{
"entropy": 0.5688315823674202,
"epoch": 1.6031265758951085,
"grad_norm": 0.47028103470802307,
"learning_rate": 4.660618279569893e-05,
"loss": 0.5646557331085205,
"mean_token_accuracy": 0.8609416097402572,
"num_tokens": 12610056.0,
"step": 1590
},
{
"entropy": 0.578702774643898,
"epoch": 1.6132123045890066,
"grad_norm": 0.4792572259902954,
"learning_rate": 4.6270161290322585e-05,
"loss": 0.5608342170715332,
"mean_token_accuracy": 0.8583951354026794,
"num_tokens": 12689520.0,
"step": 1600
},
{
"entropy": 0.5461821883916855,
"epoch": 1.6232980332829046,
"grad_norm": 0.4682954251766205,
"learning_rate": 4.5934139784946236e-05,
"loss": 0.5470096588134765,
"mean_token_accuracy": 0.8660473883152008,
"num_tokens": 12769300.0,
"step": 1610
},
{
"entropy": 0.5409149259328843,
"epoch": 1.6333837619768028,
"grad_norm": 0.4313759207725525,
"learning_rate": 4.5598118279569894e-05,
"loss": 0.5290946960449219,
"mean_token_accuracy": 0.8687306940555573,
"num_tokens": 12848928.0,
"step": 1620
},
{
"entropy": 0.5602993786334991,
"epoch": 1.643469490670701,
"grad_norm": 0.43227389454841614,
"learning_rate": 4.526209677419355e-05,
"loss": 0.5636171340942383,
"mean_token_accuracy": 0.8613378524780273,
"num_tokens": 12928356.0,
"step": 1630
},
{
"entropy": 0.5802386716008187,
"epoch": 1.653555219364599,
"grad_norm": 0.47118210792541504,
"learning_rate": 4.492607526881721e-05,
"loss": 0.5586458683013916,
"mean_token_accuracy": 0.8608706951141357,
"num_tokens": 13008403.0,
"step": 1640
},
{
"entropy": 0.5646507054567337,
"epoch": 1.6636409480584973,
"grad_norm": 0.4425702393054962,
"learning_rate": 4.459005376344086e-05,
"loss": 0.5531969547271729,
"mean_token_accuracy": 0.8616601437330246,
"num_tokens": 13088085.0,
"step": 1650
},
{
"entropy": 0.554588295519352,
"epoch": 1.6737266767523953,
"grad_norm": 0.4520638883113861,
"learning_rate": 4.425403225806452e-05,
"loss": 0.557581090927124,
"mean_token_accuracy": 0.8634083062410355,
"num_tokens": 13166818.0,
"step": 1660
},
{
"entropy": 0.5726349860429764,
"epoch": 1.6838124054462935,
"grad_norm": 0.6098994612693787,
"learning_rate": 4.391801075268818e-05,
"loss": 0.5592772483825683,
"mean_token_accuracy": 0.8583408266305923,
"num_tokens": 13246430.0,
"step": 1670
},
{
"entropy": 0.5743449658155442,
"epoch": 1.6938981341401917,
"grad_norm": 0.5307788848876953,
"learning_rate": 4.358198924731183e-05,
"loss": 0.5716012954711914,
"mean_token_accuracy": 0.858471828699112,
"num_tokens": 13325991.0,
"step": 1680
},
{
"entropy": 0.5580974891781807,
"epoch": 1.7039838628340898,
"grad_norm": 0.4562699794769287,
"learning_rate": 4.3245967741935486e-05,
"loss": 0.5490761756896972,
"mean_token_accuracy": 0.8642932444810867,
"num_tokens": 13405218.0,
"step": 1690
},
{
"entropy": 0.5611451357603073,
"epoch": 1.7140695915279878,
"grad_norm": 0.4747970700263977,
"learning_rate": 4.290994623655914e-05,
"loss": 0.55002760887146,
"mean_token_accuracy": 0.8629568427801132,
"num_tokens": 13483327.0,
"step": 1700
},
{
"entropy": 0.5680546730756759,
"epoch": 1.724155320221886,
"grad_norm": 0.4508069157600403,
"learning_rate": 4.2573924731182796e-05,
"loss": 0.5625165939331055,
"mean_token_accuracy": 0.8583694219589233,
"num_tokens": 13562046.0,
"step": 1710
},
{
"entropy": 0.5620178505778313,
"epoch": 1.7342410489157842,
"grad_norm": 0.4658072888851166,
"learning_rate": 4.2237903225806454e-05,
"loss": 0.5550461769104004,
"mean_token_accuracy": 0.8632882922887802,
"num_tokens": 13641490.0,
"step": 1720
},
{
"entropy": 0.5530170306563378,
"epoch": 1.7443267776096822,
"grad_norm": 0.5042744278907776,
"learning_rate": 4.190188172043011e-05,
"loss": 0.5403203010559082,
"mean_token_accuracy": 0.8652596682310104,
"num_tokens": 13721635.0,
"step": 1730
},
{
"entropy": 0.5663056463003159,
"epoch": 1.7544125063035805,
"grad_norm": 0.48429322242736816,
"learning_rate": 4.156586021505376e-05,
"loss": 0.5637138366699219,
"mean_token_accuracy": 0.86119324862957,
"num_tokens": 13801115.0,
"step": 1740
},
{
"entropy": 0.5869442075490952,
"epoch": 1.7644982349974785,
"grad_norm": 0.47282740473747253,
"learning_rate": 4.122983870967742e-05,
"loss": 0.5740327358245849,
"mean_token_accuracy": 0.8570831835269928,
"num_tokens": 13880836.0,
"step": 1750
},
{
"entropy": 0.5692236006259919,
"epoch": 1.7745839636913767,
"grad_norm": 0.48522087931632996,
"learning_rate": 4.089381720430108e-05,
"loss": 0.5549083232879639,
"mean_token_accuracy": 0.8620316475629807,
"num_tokens": 13960547.0,
"step": 1760
},
{
"entropy": 0.5681909918785095,
"epoch": 1.784669692385275,
"grad_norm": 0.5211447477340698,
"learning_rate": 4.0557795698924737e-05,
"loss": 0.5676622867584229,
"mean_token_accuracy": 0.8572598755359649,
"num_tokens": 14039751.0,
"step": 1770
},
{
"entropy": 0.5653912618756294,
"epoch": 1.794755421079173,
"grad_norm": 0.48671814799308777,
"learning_rate": 4.022177419354839e-05,
"loss": 0.5509668827056885,
"mean_token_accuracy": 0.8620099276304245,
"num_tokens": 14119860.0,
"step": 1780
},
{
"entropy": 0.5805320516228676,
"epoch": 1.804841149773071,
"grad_norm": 0.46735525131225586,
"learning_rate": 3.9885752688172046e-05,
"loss": 0.5758527278900146,
"mean_token_accuracy": 0.8575719922780991,
"num_tokens": 14198802.0,
"step": 1790
},
{
"entropy": 0.5776771619915962,
"epoch": 1.8149268784669692,
"grad_norm": 0.46059489250183105,
"learning_rate": 3.9549731182795704e-05,
"loss": 0.5662201404571533,
"mean_token_accuracy": 0.8602292090654373,
"num_tokens": 14277819.0,
"step": 1800
},
{
"entropy": 0.5446759209036827,
"epoch": 1.8250126071608674,
"grad_norm": 0.4299936890602112,
"learning_rate": 3.9213709677419355e-05,
"loss": 0.5321237087249756,
"mean_token_accuracy": 0.8672592252492904,
"num_tokens": 14356885.0,
"step": 1810
},
{
"entropy": 0.5735299795866012,
"epoch": 1.8350983358547657,
"grad_norm": 0.4611278176307678,
"learning_rate": 3.887768817204301e-05,
"loss": 0.5636817932128906,
"mean_token_accuracy": 0.8613359600305557,
"num_tokens": 14436671.0,
"step": 1820
},
{
"entropy": 0.5580099940299987,
"epoch": 1.8451840645486637,
"grad_norm": 0.44665414094924927,
"learning_rate": 3.854166666666667e-05,
"loss": 0.5478529453277587,
"mean_token_accuracy": 0.865882283449173,
"num_tokens": 14516240.0,
"step": 1830
},
{
"entropy": 0.5468813553452492,
"epoch": 1.8552697932425617,
"grad_norm": 0.48118823766708374,
"learning_rate": 3.820564516129033e-05,
"loss": 0.5421140670776368,
"mean_token_accuracy": 0.8648819357156754,
"num_tokens": 14594410.0,
"step": 1840
},
{
"entropy": 0.5601179748773575,
"epoch": 1.86535552193646,
"grad_norm": 0.47143810987472534,
"learning_rate": 3.786962365591398e-05,
"loss": 0.5547156810760498,
"mean_token_accuracy": 0.8629712164402008,
"num_tokens": 14674458.0,
"step": 1850
},
{
"entropy": 0.5468712210655212,
"epoch": 1.8754412506303582,
"grad_norm": 0.4703015089035034,
"learning_rate": 3.753360215053764e-05,
"loss": 0.5343079566955566,
"mean_token_accuracy": 0.8661370754241944,
"num_tokens": 14753930.0,
"step": 1860
},
{
"entropy": 0.5559142023324967,
"epoch": 1.8855269793242562,
"grad_norm": 0.5115091800689697,
"learning_rate": 3.719758064516129e-05,
"loss": 0.5517262935638427,
"mean_token_accuracy": 0.8617942541837692,
"num_tokens": 14832932.0,
"step": 1870
},
{
"entropy": 0.5663068994879723,
"epoch": 1.8956127080181542,
"grad_norm": 0.5054985880851746,
"learning_rate": 3.686155913978495e-05,
"loss": 0.5602648735046387,
"mean_token_accuracy": 0.8621524393558502,
"num_tokens": 14912738.0,
"step": 1880
},
{
"entropy": 0.5654321074485779,
"epoch": 1.9056984367120524,
"grad_norm": 0.6112289428710938,
"learning_rate": 3.6525537634408605e-05,
"loss": 0.5629604816436767,
"mean_token_accuracy": 0.8605375409126281,
"num_tokens": 14991840.0,
"step": 1890
},
{
"entropy": 0.576673474907875,
"epoch": 1.9157841654059506,
"grad_norm": 0.4323459565639496,
"learning_rate": 3.6189516129032256e-05,
"loss": 0.5591244220733642,
"mean_token_accuracy": 0.8580433249473571,
"num_tokens": 15071706.0,
"step": 1900
},
{
"entropy": 0.5643190979957581,
"epoch": 1.9258698940998489,
"grad_norm": 0.4710509479045868,
"learning_rate": 3.5853494623655914e-05,
"loss": 0.5512382507324218,
"mean_token_accuracy": 0.8628631055355072,
"num_tokens": 15151394.0,
"step": 1910
},
{
"entropy": 0.5628313675522805,
"epoch": 1.9359556227937469,
"grad_norm": 0.49328237771987915,
"learning_rate": 3.551747311827957e-05,
"loss": 0.5587539672851562,
"mean_token_accuracy": 0.860697939991951,
"num_tokens": 15231319.0,
"step": 1920
},
{
"entropy": 0.5748488426208496,
"epoch": 1.946041351487645,
"grad_norm": 0.4674327075481415,
"learning_rate": 3.518145161290323e-05,
"loss": 0.5687310695648193,
"mean_token_accuracy": 0.8577084749937057,
"num_tokens": 15310775.0,
"step": 1930
},
{
"entropy": 0.5803794890642167,
"epoch": 1.9561270801815431,
"grad_norm": 0.5266663432121277,
"learning_rate": 3.484543010752688e-05,
"loss": 0.563091516494751,
"mean_token_accuracy": 0.8584628343582154,
"num_tokens": 15390587.0,
"step": 1940
},
{
"entropy": 0.5552488923072815,
"epoch": 1.9662128088754414,
"grad_norm": 0.4923759996891022,
"learning_rate": 3.450940860215054e-05,
"loss": 0.5511169910430909,
"mean_token_accuracy": 0.8629322975873948,
"num_tokens": 15469965.0,
"step": 1950
},
{
"entropy": 0.5615150198340416,
"epoch": 1.9762985375693394,
"grad_norm": 0.48817864060401917,
"learning_rate": 3.41733870967742e-05,
"loss": 0.5568130016326904,
"mean_token_accuracy": 0.8619527310132981,
"num_tokens": 15549750.0,
"step": 1960
},
{
"entropy": 0.5814961880445481,
"epoch": 1.9863842662632374,
"grad_norm": 0.5092481970787048,
"learning_rate": 3.3837365591397855e-05,
"loss": 0.5730830669403076,
"mean_token_accuracy": 0.8569308757781983,
"num_tokens": 15629403.0,
"step": 1970
},
{
"entropy": 0.5555408030748368,
"epoch": 1.9964699949571356,
"grad_norm": 0.47072556614875793,
"learning_rate": 3.3501344086021506e-05,
"loss": 0.5473050117492676,
"mean_token_accuracy": 0.8649396389722824,
"num_tokens": 15709076.0,
"step": 1980
},
{
"entropy": 0.569047212600708,
"epoch": 2.006051437216339,
"grad_norm": 0.4627280831336975,
"learning_rate": 3.3165322580645164e-05,
"loss": 0.5441355228424072,
"mean_token_accuracy": 0.864699639772114,
"num_tokens": 15782771.0,
"step": 1990
},
{
"entropy": 0.539261668920517,
"epoch": 2.016137165910237,
"grad_norm": 0.48832473158836365,
"learning_rate": 3.282930107526882e-05,
"loss": 0.5297918796539307,
"mean_token_accuracy": 0.8658891975879669,
"num_tokens": 15862421.0,
"step": 2000
},
{
"entropy": 0.5377178519964219,
"epoch": 2.026222894604135,
"grad_norm": 0.48553702235221863,
"learning_rate": 3.249327956989247e-05,
"loss": 0.5355194091796875,
"mean_token_accuracy": 0.8657042533159256,
"num_tokens": 15941198.0,
"step": 2010
},
{
"entropy": 0.5516590684652328,
"epoch": 2.036308623298033,
"grad_norm": 0.5379918217658997,
"learning_rate": 3.215725806451613e-05,
"loss": 0.5353228092193604,
"mean_token_accuracy": 0.8652983129024505,
"num_tokens": 16021211.0,
"step": 2020
},
{
"entropy": 0.5461470827460289,
"epoch": 2.0463943519919314,
"grad_norm": 0.4731438457965851,
"learning_rate": 3.182123655913979e-05,
"loss": 0.5283015727996826,
"mean_token_accuracy": 0.8663630455732345,
"num_tokens": 16100444.0,
"step": 2030
},
{
"entropy": 0.5638475820422173,
"epoch": 2.0564800806858297,
"grad_norm": 0.5005958676338196,
"learning_rate": 3.148521505376345e-05,
"loss": 0.5557540893554688,
"mean_token_accuracy": 0.8587030708789826,
"num_tokens": 16179057.0,
"step": 2040
},
{
"entropy": 0.5465094238519669,
"epoch": 2.066565809379728,
"grad_norm": 0.5402827262878418,
"learning_rate": 3.11491935483871e-05,
"loss": 0.5304507255554199,
"mean_token_accuracy": 0.8647589266300202,
"num_tokens": 16258484.0,
"step": 2050
},
{
"entropy": 0.5264578998088837,
"epoch": 2.0766515380736257,
"grad_norm": 0.4704038202762604,
"learning_rate": 3.081317204301075e-05,
"loss": 0.5128489971160889,
"mean_token_accuracy": 0.8706033259630204,
"num_tokens": 16338768.0,
"step": 2060
},
{
"entropy": 0.5451709255576134,
"epoch": 2.086737266767524,
"grad_norm": 0.4614444673061371,
"learning_rate": 3.0477150537634407e-05,
"loss": 0.5359940528869629,
"mean_token_accuracy": 0.8661996811628342,
"num_tokens": 16418643.0,
"step": 2070
},
{
"entropy": 0.5472053721547127,
"epoch": 2.096822995461422,
"grad_norm": 0.632550060749054,
"learning_rate": 3.0141129032258065e-05,
"loss": 0.5351024627685547,
"mean_token_accuracy": 0.8644415885210037,
"num_tokens": 16498263.0,
"step": 2080
},
{
"entropy": 0.548878462612629,
"epoch": 2.1069087241553204,
"grad_norm": 0.5025933980941772,
"learning_rate": 2.980510752688172e-05,
"loss": 0.5379784584045411,
"mean_token_accuracy": 0.8660365819931031,
"num_tokens": 16577565.0,
"step": 2090
},
{
"entropy": 0.5425203040242195,
"epoch": 2.116994452849218,
"grad_norm": 0.4774039685726166,
"learning_rate": 2.9469086021505378e-05,
"loss": 0.5364133358001709,
"mean_token_accuracy": 0.8674946367740631,
"num_tokens": 16656311.0,
"step": 2100
},
{
"entropy": 0.5235720470547676,
"epoch": 2.1270801815431164,
"grad_norm": 0.5193483829498291,
"learning_rate": 2.9133064516129032e-05,
"loss": 0.5130849838256836,
"mean_token_accuracy": 0.8696544647216797,
"num_tokens": 16733102.0,
"step": 2110
},
{
"entropy": 0.5605258494615555,
"epoch": 2.1371659102370146,
"grad_norm": 0.4725455939769745,
"learning_rate": 2.879704301075269e-05,
"loss": 0.540586280822754,
"mean_token_accuracy": 0.8627595365047455,
"num_tokens": 16812449.0,
"step": 2120
},
{
"entropy": 0.5359290465712547,
"epoch": 2.147251638930913,
"grad_norm": 0.5029664039611816,
"learning_rate": 2.8461021505376345e-05,
"loss": 0.5248902320861817,
"mean_token_accuracy": 0.8702762573957443,
"num_tokens": 16890210.0,
"step": 2130
},
{
"entropy": 0.5447442144155502,
"epoch": 2.157337367624811,
"grad_norm": 0.5254132747650146,
"learning_rate": 2.8125000000000003e-05,
"loss": 0.5334976196289063,
"mean_token_accuracy": 0.8659275323152542,
"num_tokens": 16969724.0,
"step": 2140
},
{
"entropy": 0.5429217413067817,
"epoch": 2.167423096318709,
"grad_norm": 0.5342961549758911,
"learning_rate": 2.7788978494623657e-05,
"loss": 0.5368762969970703,
"mean_token_accuracy": 0.8634399026632309,
"num_tokens": 17049580.0,
"step": 2150
},
{
"entropy": 0.5661292850971222,
"epoch": 2.177508825012607,
"grad_norm": 0.5178996324539185,
"learning_rate": 2.7452956989247315e-05,
"loss": 0.5408023357391357,
"mean_token_accuracy": 0.8626035422086715,
"num_tokens": 17129600.0,
"step": 2160
},
{
"entropy": 0.5486285850405693,
"epoch": 2.1875945537065054,
"grad_norm": 0.5601539015769958,
"learning_rate": 2.711693548387097e-05,
"loss": 0.5464762210845947,
"mean_token_accuracy": 0.8629148125648498,
"num_tokens": 17208660.0,
"step": 2170
},
{
"entropy": 0.539339479804039,
"epoch": 2.1976802824004036,
"grad_norm": 0.5032673478126526,
"learning_rate": 2.6780913978494628e-05,
"loss": 0.5286684036254883,
"mean_token_accuracy": 0.86694795191288,
"num_tokens": 17288203.0,
"step": 2180
},
{
"entropy": 0.5645471304655075,
"epoch": 2.2077660110943014,
"grad_norm": 0.5230391025543213,
"learning_rate": 2.6444892473118282e-05,
"loss": 0.5560014724731446,
"mean_token_accuracy": 0.8597795188426971,
"num_tokens": 17367801.0,
"step": 2190
},
{
"entropy": 0.5548521086573601,
"epoch": 2.2178517397881996,
"grad_norm": 0.49602022767066956,
"learning_rate": 2.610887096774194e-05,
"loss": 0.5350295066833496,
"mean_token_accuracy": 0.8652581185102463,
"num_tokens": 17446189.0,
"step": 2200
},
{
"entropy": 0.514088487625122,
"epoch": 2.227937468482098,
"grad_norm": 0.4804084002971649,
"learning_rate": 2.5772849462365595e-05,
"loss": 0.5078618049621582,
"mean_token_accuracy": 0.87323999106884,
"num_tokens": 17525566.0,
"step": 2210
},
{
"entropy": 0.5376028656959534,
"epoch": 2.238023197175996,
"grad_norm": 0.5058464407920837,
"learning_rate": 2.543682795698925e-05,
"loss": 0.5364038944244385,
"mean_token_accuracy": 0.8645770877599717,
"num_tokens": 17604827.0,
"step": 2220
},
{
"entropy": 0.5462548270821571,
"epoch": 2.2481089258698943,
"grad_norm": 0.490461140871048,
"learning_rate": 2.5100806451612907e-05,
"loss": 0.5294418811798096,
"mean_token_accuracy": 0.8681913077831268,
"num_tokens": 17683861.0,
"step": 2230
},
{
"entropy": 0.5528038665652275,
"epoch": 2.258194654563792,
"grad_norm": 0.4974213242530823,
"learning_rate": 2.4764784946236562e-05,
"loss": 0.5406534194946289,
"mean_token_accuracy": 0.8653462111949921,
"num_tokens": 17762980.0,
"step": 2240
},
{
"entropy": 0.5535038366913796,
"epoch": 2.2682803832576903,
"grad_norm": 0.5496407151222229,
"learning_rate": 2.4428763440860216e-05,
"loss": 0.537155294418335,
"mean_token_accuracy": 0.8642148166894913,
"num_tokens": 17842556.0,
"step": 2250
},
{
"entropy": 0.5539382755756378,
"epoch": 2.2783661119515886,
"grad_norm": 0.525561511516571,
"learning_rate": 2.4092741935483874e-05,
"loss": 0.5407976150512696,
"mean_token_accuracy": 0.8630766361951828,
"num_tokens": 17922301.0,
"step": 2260
},
{
"entropy": 0.5272150099277496,
"epoch": 2.288451840645487,
"grad_norm": 0.5721139907836914,
"learning_rate": 2.375672043010753e-05,
"loss": 0.5236873626708984,
"mean_token_accuracy": 0.8669533491134643,
"num_tokens": 18001885.0,
"step": 2270
},
{
"entropy": 0.5631722688674927,
"epoch": 2.2985375693393846,
"grad_norm": 0.5678048133850098,
"learning_rate": 2.3420698924731183e-05,
"loss": 0.5523369312286377,
"mean_token_accuracy": 0.8623350352048874,
"num_tokens": 18081479.0,
"step": 2280
},
{
"entropy": 0.5382361978292465,
"epoch": 2.308623298033283,
"grad_norm": 0.5157824754714966,
"learning_rate": 2.3084677419354838e-05,
"loss": 0.5226727485656738,
"mean_token_accuracy": 0.8679136961698533,
"num_tokens": 18161203.0,
"step": 2290
},
{
"entropy": 0.533910921216011,
"epoch": 2.318709026727181,
"grad_norm": 0.47971630096435547,
"learning_rate": 2.2748655913978496e-05,
"loss": 0.5226436614990234,
"mean_token_accuracy": 0.8696143090724945,
"num_tokens": 18241262.0,
"step": 2300
},
{
"entropy": 0.5458772480487823,
"epoch": 2.3287947554210793,
"grad_norm": 0.45692282915115356,
"learning_rate": 2.241263440860215e-05,
"loss": 0.5294504165649414,
"mean_token_accuracy": 0.8642321765422821,
"num_tokens": 18320784.0,
"step": 2310
},
{
"entropy": 0.5594018489122391,
"epoch": 2.338880484114977,
"grad_norm": 0.4903578758239746,
"learning_rate": 2.207661290322581e-05,
"loss": 0.5604379177093506,
"mean_token_accuracy": 0.860828360915184,
"num_tokens": 18400852.0,
"step": 2320
},
{
"entropy": 0.5689606159925461,
"epoch": 2.3489662128088753,
"grad_norm": 0.5537696480751038,
"learning_rate": 2.1740591397849463e-05,
"loss": 0.5594550609588623,
"mean_token_accuracy": 0.8629016607999802,
"num_tokens": 18479779.0,
"step": 2330
},
{
"entropy": 0.5599432498216629,
"epoch": 2.3590519415027735,
"grad_norm": 0.5466564297676086,
"learning_rate": 2.140456989247312e-05,
"loss": 0.5437151908874511,
"mean_token_accuracy": 0.8626207202672959,
"num_tokens": 18558073.0,
"step": 2340
},
{
"entropy": 0.5474510326981544,
"epoch": 2.3691376701966718,
"grad_norm": 0.4898226857185364,
"learning_rate": 2.1068548387096775e-05,
"loss": 0.5327883720397949,
"mean_token_accuracy": 0.8675543367862701,
"num_tokens": 18637992.0,
"step": 2350
},
{
"entropy": 0.5352361142635346,
"epoch": 2.37922339889057,
"grad_norm": 0.49341657757759094,
"learning_rate": 2.0732526881720433e-05,
"loss": 0.5276922225952149,
"mean_token_accuracy": 0.8687323063611985,
"num_tokens": 18717199.0,
"step": 2360
},
{
"entropy": 0.5448679953813553,
"epoch": 2.389309127584468,
"grad_norm": 0.5279788374900818,
"learning_rate": 2.0396505376344088e-05,
"loss": 0.5373146057128906,
"mean_token_accuracy": 0.8635420203208923,
"num_tokens": 18795882.0,
"step": 2370
},
{
"entropy": 0.5282470986247063,
"epoch": 2.399394856278366,
"grad_norm": 0.5115689039230347,
"learning_rate": 2.0060483870967743e-05,
"loss": 0.5187318325042725,
"mean_token_accuracy": 0.8699030309915543,
"num_tokens": 18875539.0,
"step": 2380
},
{
"entropy": 0.5575937613844871,
"epoch": 2.4094805849722642,
"grad_norm": 0.5467925071716309,
"learning_rate": 1.9724462365591397e-05,
"loss": 0.5434219837188721,
"mean_token_accuracy": 0.8646806567907334,
"num_tokens": 18953688.0,
"step": 2390
},
{
"entropy": 0.5321239963173866,
"epoch": 2.4195663136661625,
"grad_norm": 0.5000545978546143,
"learning_rate": 1.9388440860215055e-05,
"loss": 0.5234639644622803,
"mean_token_accuracy": 0.8677684217691422,
"num_tokens": 19032209.0,
"step": 2400
},
{
"entropy": 0.5813943535089493,
"epoch": 2.4296520423600603,
"grad_norm": 0.516925573348999,
"learning_rate": 1.905241935483871e-05,
"loss": 0.5684566497802734,
"mean_token_accuracy": 0.8597011536359787,
"num_tokens": 19111890.0,
"step": 2410
},
{
"entropy": 0.5533119216561317,
"epoch": 2.4397377710539585,
"grad_norm": 0.4740159511566162,
"learning_rate": 1.8716397849462368e-05,
"loss": 0.5415266513824463,
"mean_token_accuracy": 0.8660802483558655,
"num_tokens": 19191883.0,
"step": 2420
},
{
"entropy": 0.5496593981981277,
"epoch": 2.4498234997478567,
"grad_norm": 0.5012199878692627,
"learning_rate": 1.8380376344086022e-05,
"loss": 0.5444561004638672,
"mean_token_accuracy": 0.8652342647314072,
"num_tokens": 19271352.0,
"step": 2430
},
{
"entropy": 0.5558317363262176,
"epoch": 2.459909228441755,
"grad_norm": 0.5741304755210876,
"learning_rate": 1.804435483870968e-05,
"loss": 0.5420098781585694,
"mean_token_accuracy": 0.864546662569046,
"num_tokens": 19351160.0,
"step": 2440
},
{
"entropy": 0.5458673521876335,
"epoch": 2.469994957135653,
"grad_norm": 0.5522996783256531,
"learning_rate": 1.7708333333333335e-05,
"loss": 0.5378719329833984,
"mean_token_accuracy": 0.8654713213443757,
"num_tokens": 19430996.0,
"step": 2450
},
{
"entropy": 0.5559975445270539,
"epoch": 2.4800806858295514,
"grad_norm": 0.5336911678314209,
"learning_rate": 1.7372311827956993e-05,
"loss": 0.5409592151641845,
"mean_token_accuracy": 0.8620710968971252,
"num_tokens": 19510210.0,
"step": 2460
},
{
"entropy": 0.5456252574920655,
"epoch": 2.4901664145234492,
"grad_norm": 0.5605066418647766,
"learning_rate": 1.7036290322580644e-05,
"loss": 0.5332871913909912,
"mean_token_accuracy": 0.8647909879684448,
"num_tokens": 19589727.0,
"step": 2470
},
{
"entropy": 0.5535303637385368,
"epoch": 2.5002521432173475,
"grad_norm": 0.4991672933101654,
"learning_rate": 1.67002688172043e-05,
"loss": 0.5402321815490723,
"mean_token_accuracy": 0.8653812408447266,
"num_tokens": 19668443.0,
"step": 2480
},
{
"entropy": 0.5551770642399788,
"epoch": 2.5103378719112457,
"grad_norm": 0.5773875713348389,
"learning_rate": 1.6364247311827956e-05,
"loss": 0.5489557266235352,
"mean_token_accuracy": 0.8608813732862473,
"num_tokens": 19747352.0,
"step": 2490
},
{
"entropy": 0.5320880457758903,
"epoch": 2.5204236006051435,
"grad_norm": 0.5162405371665955,
"learning_rate": 1.6028225806451614e-05,
"loss": 0.5143797397613525,
"mean_token_accuracy": 0.8693823754787445,
"num_tokens": 19825761.0,
"step": 2500
},
{
"entropy": 0.5509802043437958,
"epoch": 2.5305093292990417,
"grad_norm": 0.49250203371047974,
"learning_rate": 1.569220430107527e-05,
"loss": 0.5484753608703613,
"mean_token_accuracy": 0.8615890771150589,
"num_tokens": 19905522.0,
"step": 2510
},
{
"entropy": 0.5509913951158524,
"epoch": 2.54059505799294,
"grad_norm": 0.4801005423069,
"learning_rate": 1.5356182795698927e-05,
"loss": 0.534857177734375,
"mean_token_accuracy": 0.8665878713130951,
"num_tokens": 19985423.0,
"step": 2520
},
{
"entropy": 0.5512269869446754,
"epoch": 2.550680786686838,
"grad_norm": 0.5222068428993225,
"learning_rate": 1.5020161290322581e-05,
"loss": 0.5318729400634765,
"mean_token_accuracy": 0.867360520362854,
"num_tokens": 20064943.0,
"step": 2530
},
{
"entropy": 0.5388212829828263,
"epoch": 2.5607665153807364,
"grad_norm": 0.5755501985549927,
"learning_rate": 1.4684139784946237e-05,
"loss": 0.5273076057434082,
"mean_token_accuracy": 0.8683293461799622,
"num_tokens": 20144394.0,
"step": 2540
},
{
"entropy": 0.5427288740873337,
"epoch": 2.5708522440746346,
"grad_norm": 0.5304813385009766,
"learning_rate": 1.4348118279569894e-05,
"loss": 0.5372978687286377,
"mean_token_accuracy": 0.8653906404972076,
"num_tokens": 20224155.0,
"step": 2550
},
{
"entropy": 0.537303113937378,
"epoch": 2.5809379727685324,
"grad_norm": 0.5612549781799316,
"learning_rate": 1.4012096774193548e-05,
"loss": 0.5201327323913574,
"mean_token_accuracy": 0.8662876456975936,
"num_tokens": 20303359.0,
"step": 2560
},
{
"entropy": 0.5369555190205574,
"epoch": 2.5910237014624307,
"grad_norm": 0.5071592330932617,
"learning_rate": 1.3676075268817205e-05,
"loss": 0.5304999828338623,
"mean_token_accuracy": 0.8670349299907685,
"num_tokens": 20382903.0,
"step": 2570
},
{
"entropy": 0.5491381287574768,
"epoch": 2.601109430156329,
"grad_norm": 0.5084213614463806,
"learning_rate": 1.334005376344086e-05,
"loss": 0.5327461242675782,
"mean_token_accuracy": 0.8662136912345886,
"num_tokens": 20462155.0,
"step": 2580
},
{
"entropy": 0.5416491359472275,
"epoch": 2.6111951588502267,
"grad_norm": 0.5257861614227295,
"learning_rate": 1.3004032258064517e-05,
"loss": 0.528349494934082,
"mean_token_accuracy": 0.8684215098619461,
"num_tokens": 20541984.0,
"step": 2590
},
{
"entropy": 0.566520756483078,
"epoch": 2.621280887544125,
"grad_norm": 0.5360490679740906,
"learning_rate": 1.2668010752688173e-05,
"loss": 0.5587567806243896,
"mean_token_accuracy": 0.8621705800294877,
"num_tokens": 20621627.0,
"step": 2600
},
{
"entropy": 0.5417982503771782,
"epoch": 2.631366616238023,
"grad_norm": 0.6282044649124146,
"learning_rate": 1.2331989247311828e-05,
"loss": 0.5330332756042481,
"mean_token_accuracy": 0.8673626929521561,
"num_tokens": 20700444.0,
"step": 2610
},
{
"entropy": 0.5525400832295417,
"epoch": 2.6414523449319214,
"grad_norm": 0.46920013427734375,
"learning_rate": 1.1995967741935484e-05,
"loss": 0.5474446773529053,
"mean_token_accuracy": 0.8630323052406311,
"num_tokens": 20779575.0,
"step": 2620
},
{
"entropy": 0.5558207243680954,
"epoch": 2.6515380736258196,
"grad_norm": 0.5772764086723328,
"learning_rate": 1.165994623655914e-05,
"loss": 0.5425600528717041,
"mean_token_accuracy": 0.8641434967517853,
"num_tokens": 20859435.0,
"step": 2630
},
{
"entropy": 0.5576843723654747,
"epoch": 2.661623802319718,
"grad_norm": 0.4919654428958893,
"learning_rate": 1.1323924731182797e-05,
"loss": 0.5311962127685547,
"mean_token_accuracy": 0.8672047317028045,
"num_tokens": 20938905.0,
"step": 2640
},
{
"entropy": 0.54314656406641,
"epoch": 2.6717095310136156,
"grad_norm": 0.5382912158966064,
"learning_rate": 1.0987903225806453e-05,
"loss": 0.5263168811798096,
"mean_token_accuracy": 0.8669156759977341,
"num_tokens": 21019238.0,
"step": 2650
},
{
"entropy": 0.5516531556844712,
"epoch": 2.681795259707514,
"grad_norm": 0.5050802826881409,
"learning_rate": 1.0651881720430107e-05,
"loss": 0.5398415565490723,
"mean_token_accuracy": 0.8650593370199203,
"num_tokens": 21098899.0,
"step": 2660
},
{
"entropy": 0.5546103894710541,
"epoch": 2.691880988401412,
"grad_norm": 0.5349447727203369,
"learning_rate": 1.0315860215053764e-05,
"loss": 0.5495382308959961,
"mean_token_accuracy": 0.8624561607837677,
"num_tokens": 21177880.0,
"step": 2670
},
{
"entropy": 0.5512343898415566,
"epoch": 2.70196671709531,
"grad_norm": 0.5208629965782166,
"learning_rate": 9.97983870967742e-06,
"loss": 0.5331855773925781,
"mean_token_accuracy": 0.8639995604753494,
"num_tokens": 21257999.0,
"step": 2680
},
{
"entropy": 0.5312772765755653,
"epoch": 2.712052445789208,
"grad_norm": 0.4953898787498474,
"learning_rate": 9.643817204301076e-06,
"loss": 0.5195374965667725,
"mean_token_accuracy": 0.869972151517868,
"num_tokens": 21337317.0,
"step": 2690
},
{
"entropy": 0.5500992730259895,
"epoch": 2.7221381744831064,
"grad_norm": 0.5650175213813782,
"learning_rate": 9.307795698924732e-06,
"loss": 0.5417905330657959,
"mean_token_accuracy": 0.8655608594417572,
"num_tokens": 21417337.0,
"step": 2700
},
{
"entropy": 0.5753470867872238,
"epoch": 2.7322239031770046,
"grad_norm": 0.5138351917266846,
"learning_rate": 8.971774193548389e-06,
"loss": 0.566002368927002,
"mean_token_accuracy": 0.8588992148637772,
"num_tokens": 21495441.0,
"step": 2710
},
{
"entropy": 0.5489386066794395,
"epoch": 2.742309631870903,
"grad_norm": 0.6205029487609863,
"learning_rate": 8.635752688172043e-06,
"loss": 0.5376901626586914,
"mean_token_accuracy": 0.8655065208673477,
"num_tokens": 21575122.0,
"step": 2720
},
{
"entropy": 0.5537219062447548,
"epoch": 2.752395360564801,
"grad_norm": 0.49632322788238525,
"learning_rate": 8.2997311827957e-06,
"loss": 0.5360848426818847,
"mean_token_accuracy": 0.8659580051898956,
"num_tokens": 21654430.0,
"step": 2730
},
{
"entropy": 0.5487209603190422,
"epoch": 2.762481089258699,
"grad_norm": 0.5572301745414734,
"learning_rate": 7.963709677419356e-06,
"loss": 0.5442662715911866,
"mean_token_accuracy": 0.8630106240510941,
"num_tokens": 21733148.0,
"step": 2740
},
{
"entropy": 0.5612985536456108,
"epoch": 2.772566817952597,
"grad_norm": 0.6422117352485657,
"learning_rate": 7.627688172043011e-06,
"loss": 0.5526007175445556,
"mean_token_accuracy": 0.860730430483818,
"num_tokens": 21812607.0,
"step": 2750
},
{
"entropy": 0.5400200679898262,
"epoch": 2.7826525466464953,
"grad_norm": 0.8637318015098572,
"learning_rate": 7.2916666666666674e-06,
"loss": 0.5166098594665527,
"mean_token_accuracy": 0.8686787247657776,
"num_tokens": 21892036.0,
"step": 2760
},
{
"entropy": 0.5612641841173172,
"epoch": 2.792738275340393,
"grad_norm": 0.48974496126174927,
"learning_rate": 6.955645161290322e-06,
"loss": 0.5449564933776856,
"mean_token_accuracy": 0.8627958416938781,
"num_tokens": 21972109.0,
"step": 2770
},
{
"entropy": 0.5385331958532333,
"epoch": 2.8028240040342913,
"grad_norm": 0.5558703541755676,
"learning_rate": 6.619623655913978e-06,
"loss": 0.5277342796325684,
"mean_token_accuracy": 0.868207824230194,
"num_tokens": 22051892.0,
"step": 2780
},
{
"entropy": 0.5366700455546379,
"epoch": 2.8129097327281896,
"grad_norm": 0.5184351205825806,
"learning_rate": 6.2836021505376345e-06,
"loss": 0.5244134426116943,
"mean_token_accuracy": 0.8669192433357239,
"num_tokens": 22131511.0,
"step": 2790
},
{
"entropy": 0.5393238887190819,
"epoch": 2.822995461422088,
"grad_norm": 0.5058059096336365,
"learning_rate": 5.947580645161291e-06,
"loss": 0.5251157760620118,
"mean_token_accuracy": 0.868171575665474,
"num_tokens": 22211311.0,
"step": 2800
},
{
"entropy": 0.5239570930600166,
"epoch": 2.833081190115986,
"grad_norm": 0.49244430661201477,
"learning_rate": 5.611559139784946e-06,
"loss": 0.5180220603942871,
"mean_token_accuracy": 0.8699818342924118,
"num_tokens": 22291200.0,
"step": 2810
},
{
"entropy": 0.5237270832061768,
"epoch": 2.8431669188098843,
"grad_norm": 0.5526524782180786,
"learning_rate": 5.275537634408602e-06,
"loss": 0.5160961627960206,
"mean_token_accuracy": 0.8717655450105667,
"num_tokens": 22371402.0,
"step": 2820
},
{
"entropy": 0.5550815775990486,
"epoch": 2.853252647503782,
"grad_norm": 0.5555030107498169,
"learning_rate": 4.939516129032258e-06,
"loss": 0.5493992328643799,
"mean_token_accuracy": 0.8630385160446167,
"num_tokens": 22450991.0,
"step": 2830
},
{
"entropy": 0.5413601607084274,
"epoch": 2.8633383761976803,
"grad_norm": 0.5296768546104431,
"learning_rate": 4.603494623655914e-06,
"loss": 0.529835557937622,
"mean_token_accuracy": 0.8655640929937363,
"num_tokens": 22529941.0,
"step": 2840
},
{
"entropy": 0.5400006249547005,
"epoch": 2.8734241048915785,
"grad_norm": 0.5396979451179504,
"learning_rate": 4.2674731182795695e-06,
"loss": 0.5320997714996338,
"mean_token_accuracy": 0.8670689195394516,
"num_tokens": 22610031.0,
"step": 2850
},
{
"entropy": 0.5488270223140717,
"epoch": 2.8835098335854763,
"grad_norm": 0.5153380632400513,
"learning_rate": 3.931451612903226e-06,
"loss": 0.5233009338378907,
"mean_token_accuracy": 0.8684332311153412,
"num_tokens": 22689444.0,
"step": 2860
},
{
"entropy": 0.5396442547440529,
"epoch": 2.8935955622793745,
"grad_norm": 0.5235704183578491,
"learning_rate": 3.595430107526882e-06,
"loss": 0.5307882308959961,
"mean_token_accuracy": 0.8669263809919358,
"num_tokens": 22767585.0,
"step": 2870
},
{
"entropy": 0.5299616396427155,
"epoch": 2.9036812909732728,
"grad_norm": 0.5741503238677979,
"learning_rate": 3.259408602150538e-06,
"loss": 0.5177013874053955,
"mean_token_accuracy": 0.8693442493677139,
"num_tokens": 22847128.0,
"step": 2880
},
{
"entropy": 0.5234180510044097,
"epoch": 2.913767019667171,
"grad_norm": 0.48757055401802063,
"learning_rate": 2.9233870967741936e-06,
"loss": 0.5175334930419921,
"mean_token_accuracy": 0.8709781676530838,
"num_tokens": 22926087.0,
"step": 2890
},
{
"entropy": 0.5525398343801499,
"epoch": 2.9238527483610692,
"grad_norm": 0.5371067523956299,
"learning_rate": 2.58736559139785e-06,
"loss": 0.5446056365966797,
"mean_token_accuracy": 0.8640182733535766,
"num_tokens": 23005902.0,
"step": 2900
},
{
"entropy": 0.5530654519796372,
"epoch": 2.9339384770549675,
"grad_norm": 0.5097183585166931,
"learning_rate": 2.2513440860215057e-06,
"loss": 0.539762306213379,
"mean_token_accuracy": 0.864575845003128,
"num_tokens": 23084236.0,
"step": 2910
},
{
"entropy": 0.5282490402460098,
"epoch": 2.9440242057488653,
"grad_norm": 0.5585159659385681,
"learning_rate": 1.9153225806451616e-06,
"loss": 0.5186759471893311,
"mean_token_accuracy": 0.8688343107700348,
"num_tokens": 23163376.0,
"step": 2920
},
{
"entropy": 0.5502773314714432,
"epoch": 2.9541099344427635,
"grad_norm": 0.5116755962371826,
"learning_rate": 1.5793010752688172e-06,
"loss": 0.5362959861755371,
"mean_token_accuracy": 0.8632151573896408,
"num_tokens": 23243461.0,
"step": 2930
},
{
"entropy": 0.5681858882308006,
"epoch": 2.9641956631366617,
"grad_norm": 0.5849228501319885,
"learning_rate": 1.2432795698924732e-06,
"loss": 0.546544361114502,
"mean_token_accuracy": 0.8613691359758378,
"num_tokens": 23322907.0,
"step": 2940
},
{
"entropy": 0.5488282263278961,
"epoch": 2.9742813918305595,
"grad_norm": 0.539885938167572,
"learning_rate": 9.072580645161292e-07,
"loss": 0.5370998859405518,
"mean_token_accuracy": 0.8640505552291871,
"num_tokens": 23402756.0,
"step": 2950
},
{
"entropy": 0.5358055055141449,
"epoch": 2.9843671205244577,
"grad_norm": 0.5179461240768433,
"learning_rate": 5.71236559139785e-07,
"loss": 0.5123616695404053,
"mean_token_accuracy": 0.8696857988834381,
"num_tokens": 23482539.0,
"step": 2960
},
{
"entropy": 0.5303657278418541,
"epoch": 2.994452849218356,
"grad_norm": 0.6051850318908691,
"learning_rate": 2.3521505376344087e-07,
"loss": 0.508097505569458,
"mean_token_accuracy": 0.8716978818178177,
"num_tokens": 23560646.0,
"step": 2970
}
],
"logging_steps": 10,
"max_steps": 2976,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.192985776961024e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}