exaone_7b_lora_rtlcoder_ratio1.0 / trainer_state.json
Jongbin-kr's picture
best-5270
a09a457 verified
Raw
History Blame Contribute Delete
170 kB
{
"best_global_step": 5270,
"best_metric": 0.29535341262817383,
"best_model_checkpoint": "/home/longtail/data/outputs/exaone_7b_lora_rtlcoder_ratio1.0/checkpoint-5270",
"epoch": 3.9715470133785566,
"eval_steps": 170,
"global_step": 5270,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.500390625,
"epoch": 0.007537214999057848,
"grad_norm": 3.2508912086486816,
"learning_rate": 9.000000000000001e-07,
"loss": 1.4970951080322266,
"mean_token_accuracy": 0.7383653238415718,
"num_tokens": 124053.0,
"step": 10
},
{
"entropy": 0.480322265625,
"epoch": 0.015074429998115696,
"grad_norm": 2.5751638412475586,
"learning_rate": 1.9000000000000002e-06,
"loss": 1.4152856826782227,
"mean_token_accuracy": 0.7493167400360108,
"num_tokens": 260327.0,
"step": 20
},
{
"entropy": 0.513330078125,
"epoch": 0.022611644997173545,
"grad_norm": 2.6885225772857666,
"learning_rate": 2.9e-06,
"loss": 1.3749178886413573,
"mean_token_accuracy": 0.7562702834606171,
"num_tokens": 382406.0,
"step": 30
},
{
"entropy": 0.55849609375,
"epoch": 0.030148859996231393,
"grad_norm": 2.3008334636688232,
"learning_rate": 3.900000000000001e-06,
"loss": 1.2062281608581542,
"mean_token_accuracy": 0.763033090531826,
"num_tokens": 505114.0,
"step": 40
},
{
"entropy": 0.566552734375,
"epoch": 0.03768607499528924,
"grad_norm": 1.038688063621521,
"learning_rate": 4.9000000000000005e-06,
"loss": 0.8852876663208008,
"mean_token_accuracy": 0.8057842180132866,
"num_tokens": 640766.0,
"step": 50
},
{
"entropy": 0.64345703125,
"epoch": 0.04522328999434709,
"grad_norm": 0.8166051506996155,
"learning_rate": 5.9e-06,
"loss": 0.6880127429962158,
"mean_token_accuracy": 0.8336978167295456,
"num_tokens": 759118.0,
"step": 60
},
{
"entropy": 0.58603515625,
"epoch": 0.052760504993404934,
"grad_norm": 0.7374411225318909,
"learning_rate": 6.9e-06,
"loss": 0.5521659851074219,
"mean_token_accuracy": 0.8549367278814316,
"num_tokens": 885806.0,
"step": 70
},
{
"entropy": 0.5080078125,
"epoch": 0.060297719992462785,
"grad_norm": 0.39635205268859863,
"learning_rate": 7.9e-06,
"loss": 0.49886331558227537,
"mean_token_accuracy": 0.8612601146101951,
"num_tokens": 1013663.0,
"step": 80
},
{
"entropy": 0.452587890625,
"epoch": 0.06783493499152063,
"grad_norm": 0.40894708037376404,
"learning_rate": 8.900000000000001e-06,
"loss": 0.4750356197357178,
"mean_token_accuracy": 0.8679621189832687,
"num_tokens": 1140381.0,
"step": 90
},
{
"entropy": 0.434814453125,
"epoch": 0.07537214999057848,
"grad_norm": 0.3433704376220703,
"learning_rate": 9.9e-06,
"loss": 0.4414645195007324,
"mean_token_accuracy": 0.8758952230215072,
"num_tokens": 1269277.0,
"step": 100
},
{
"entropy": 0.425927734375,
"epoch": 0.08290936498963633,
"grad_norm": 0.3355954587459564,
"learning_rate": 1.0900000000000002e-05,
"loss": 0.4468825817108154,
"mean_token_accuracy": 0.8759026020765305,
"num_tokens": 1393833.0,
"step": 110
},
{
"entropy": 0.4673828125,
"epoch": 0.09044657998869418,
"grad_norm": 0.3367510437965393,
"learning_rate": 1.1900000000000001e-05,
"loss": 0.47623600959777834,
"mean_token_accuracy": 0.8684576749801636,
"num_tokens": 1525283.0,
"step": 120
},
{
"entropy": 0.43203125,
"epoch": 0.09798379498775203,
"grad_norm": 0.38895294070243835,
"learning_rate": 1.2900000000000002e-05,
"loss": 0.4312158107757568,
"mean_token_accuracy": 0.8784290611743927,
"num_tokens": 1652856.0,
"step": 130
},
{
"entropy": 0.4258056640625,
"epoch": 0.10552100998680987,
"grad_norm": 0.3369289040565491,
"learning_rate": 1.39e-05,
"loss": 0.4163616180419922,
"mean_token_accuracy": 0.88214410841465,
"num_tokens": 1787576.0,
"step": 140
},
{
"entropy": 0.419775390625,
"epoch": 0.11305822498586772,
"grad_norm": 0.34929800033569336,
"learning_rate": 1.4900000000000001e-05,
"loss": 0.42300877571105955,
"mean_token_accuracy": 0.8821998775005341,
"num_tokens": 1910866.0,
"step": 150
},
{
"entropy": 0.422314453125,
"epoch": 0.12059543998492557,
"grad_norm": 0.34880968928337097,
"learning_rate": 1.5900000000000004e-05,
"loss": 0.4256776809692383,
"mean_token_accuracy": 0.8781016901135444,
"num_tokens": 2033937.0,
"step": 160
},
{
"entropy": 0.390673828125,
"epoch": 0.1281326549839834,
"grad_norm": 0.30792421102523804,
"learning_rate": 1.69e-05,
"loss": 0.392413592338562,
"mean_token_accuracy": 0.8856923297047615,
"num_tokens": 2161669.0,
"step": 170
},
{
"epoch": 0.1281326549839834,
"eval_entropy": 0.40038180064006024,
"eval_loss": 0.408536434173584,
"eval_mean_token_accuracy": 0.8834756215114191,
"eval_num_tokens": 2161669.0,
"eval_runtime": 444.9651,
"eval_samples_per_second": 5.962,
"eval_steps_per_second": 1.492,
"step": 170
},
{
"entropy": 0.3729248046875,
"epoch": 0.13566986998304126,
"grad_norm": 0.36590659618377686,
"learning_rate": 1.79e-05,
"loss": 0.3798275709152222,
"mean_token_accuracy": 0.8910293310880661,
"num_tokens": 2298812.0,
"step": 180
},
{
"entropy": 0.398779296875,
"epoch": 0.1432070849820991,
"grad_norm": 0.37025851011276245,
"learning_rate": 1.8900000000000002e-05,
"loss": 0.4105966567993164,
"mean_token_accuracy": 0.8843188390135766,
"num_tokens": 2421990.0,
"step": 190
},
{
"entropy": 0.3990234375,
"epoch": 0.15074429998115696,
"grad_norm": 0.38612475991249084,
"learning_rate": 1.9900000000000003e-05,
"loss": 0.40378603935241697,
"mean_token_accuracy": 0.881200622022152,
"num_tokens": 2546022.0,
"step": 200
},
{
"entropy": 0.4103515625,
"epoch": 0.1582815149802148,
"grad_norm": 0.4074586033821106,
"learning_rate": 1.9999903471186634e-05,
"loss": 0.42444210052490233,
"mean_token_accuracy": 0.8808081805706024,
"num_tokens": 2673345.0,
"step": 210
},
{
"entropy": 0.374658203125,
"epoch": 0.16581872997927266,
"grad_norm": 0.34897786378860474,
"learning_rate": 1.999956979373049e-05,
"loss": 0.3861543655395508,
"mean_token_accuracy": 0.887491112947464,
"num_tokens": 2799859.0,
"step": 220
},
{
"entropy": 0.391455078125,
"epoch": 0.1733559449783305,
"grad_norm": 0.38405418395996094,
"learning_rate": 1.9998997783868885e-05,
"loss": 0.3967418193817139,
"mean_token_accuracy": 0.8830995351076126,
"num_tokens": 2929096.0,
"step": 230
},
{
"entropy": 0.392724609375,
"epoch": 0.18089315997738836,
"grad_norm": 0.4110228717327118,
"learning_rate": 1.999818745523526e-05,
"loss": 0.39841184616088865,
"mean_token_accuracy": 0.8842095598578453,
"num_tokens": 3048433.0,
"step": 240
},
{
"entropy": 0.3698974609375,
"epoch": 0.1884303749764462,
"grad_norm": 0.4672147035598755,
"learning_rate": 1.9997138827143197e-05,
"loss": 0.38254082202911377,
"mean_token_accuracy": 0.8880651697516442,
"num_tokens": 3159277.0,
"step": 250
},
{
"entropy": 0.390576171875,
"epoch": 0.19596758997550406,
"grad_norm": 0.4443078339099884,
"learning_rate": 1.9995851924585978e-05,
"loss": 0.3986587762832642,
"mean_token_accuracy": 0.8839748218655586,
"num_tokens": 3291698.0,
"step": 260
},
{
"entropy": 0.360400390625,
"epoch": 0.2035048049745619,
"grad_norm": 0.46329835057258606,
"learning_rate": 1.9994326778235983e-05,
"loss": 0.37484548091888426,
"mean_token_accuracy": 0.8916234523057938,
"num_tokens": 3415688.0,
"step": 270
},
{
"entropy": 0.3857666015625,
"epoch": 0.21104201997361974,
"grad_norm": 0.41270825266838074,
"learning_rate": 1.9992563424443955e-05,
"loss": 0.4022381782531738,
"mean_token_accuracy": 0.8860612288117409,
"num_tokens": 3541844.0,
"step": 280
},
{
"entropy": 0.3788330078125,
"epoch": 0.2185792349726776,
"grad_norm": 0.4354550540447235,
"learning_rate": 1.9990561905238136e-05,
"loss": 0.39404640197753904,
"mean_token_accuracy": 0.8860739976167679,
"num_tokens": 3668238.0,
"step": 290
},
{
"entropy": 0.355810546875,
"epoch": 0.22611644997173544,
"grad_norm": 0.4367234706878662,
"learning_rate": 1.998832226832327e-05,
"loss": 0.35446126461029054,
"mean_token_accuracy": 0.8932908058166504,
"num_tokens": 3791388.0,
"step": 300
},
{
"entropy": 0.3698974609375,
"epoch": 0.2336536649707933,
"grad_norm": 0.33177778124809265,
"learning_rate": 1.9985844567079452e-05,
"loss": 0.3798938512802124,
"mean_token_accuracy": 0.890485617518425,
"num_tokens": 3918847.0,
"step": 310
},
{
"entropy": 0.343310546875,
"epoch": 0.24119087996985114,
"grad_norm": 0.4057367146015167,
"learning_rate": 1.998312886056088e-05,
"loss": 0.3518209934234619,
"mean_token_accuracy": 0.8955762058496475,
"num_tokens": 4046508.0,
"step": 320
},
{
"entropy": 0.3807373046875,
"epoch": 0.248728094968909,
"grad_norm": 0.42162206768989563,
"learning_rate": 1.9980175213494418e-05,
"loss": 0.39223556518554686,
"mean_token_accuracy": 0.8870018571615219,
"num_tokens": 4169257.0,
"step": 330
},
{
"entropy": 0.374658203125,
"epoch": 0.2562653099679668,
"grad_norm": 0.4284176826477051,
"learning_rate": 1.9976983696278083e-05,
"loss": 0.3777692556381226,
"mean_token_accuracy": 0.8895119220018387,
"num_tokens": 4299468.0,
"step": 340
},
{
"epoch": 0.2562653099679668,
"eval_entropy": 0.35730862904743976,
"eval_loss": 0.3676407039165497,
"eval_mean_token_accuracy": 0.8923638243093548,
"eval_num_tokens": 4299468.0,
"eval_runtime": 445.3697,
"eval_samples_per_second": 5.957,
"eval_steps_per_second": 1.491,
"step": 340
},
{
"entropy": 0.3595703125,
"epoch": 0.26380252496702467,
"grad_norm": 0.4121377468109131,
"learning_rate": 1.9973554384979343e-05,
"loss": 0.373604416847229,
"mean_token_accuracy": 0.892127700150013,
"num_tokens": 4430546.0,
"step": 350
},
{
"entropy": 0.3835205078125,
"epoch": 0.2713397399660825,
"grad_norm": 0.4015622138977051,
"learning_rate": 1.9969887361333313e-05,
"loss": 0.3918182373046875,
"mean_token_accuracy": 0.8868573501706123,
"num_tokens": 4554384.0,
"step": 360
},
{
"entropy": 0.3498046875,
"epoch": 0.27887695496514037,
"grad_norm": 0.43255379796028137,
"learning_rate": 1.996598271274081e-05,
"loss": 0.35996294021606445,
"mean_token_accuracy": 0.8938629716634751,
"num_tokens": 4690486.0,
"step": 370
},
{
"entropy": 0.3456298828125,
"epoch": 0.2864141699641982,
"grad_norm": 0.3963714838027954,
"learning_rate": 1.9961840532266263e-05,
"loss": 0.35376391410827634,
"mean_token_accuracy": 0.8946138739585876,
"num_tokens": 4814483.0,
"step": 380
},
{
"entropy": 0.332177734375,
"epoch": 0.29395138496325607,
"grad_norm": 0.3841065764427185,
"learning_rate": 1.9957460918635513e-05,
"loss": 0.34462361335754393,
"mean_token_accuracy": 0.897958156466484,
"num_tokens": 4940434.0,
"step": 390
},
{
"entropy": 0.361767578125,
"epoch": 0.3014885999623139,
"grad_norm": 0.4300925135612488,
"learning_rate": 1.9952843976233428e-05,
"loss": 0.36802771091461184,
"mean_token_accuracy": 0.8923172727227211,
"num_tokens": 5068544.0,
"step": 400
},
{
"entropy": 0.3556640625,
"epoch": 0.30902581496137177,
"grad_norm": 0.42255330085754395,
"learning_rate": 1.9947989815101444e-05,
"loss": 0.36620967388153075,
"mean_token_accuracy": 0.8925080612301827,
"num_tokens": 5181729.0,
"step": 410
},
{
"entropy": 0.3381591796875,
"epoch": 0.3165630299604296,
"grad_norm": 0.3419656753540039,
"learning_rate": 1.9942898550934928e-05,
"loss": 0.3503819465637207,
"mean_token_accuracy": 0.8954922616481781,
"num_tokens": 5306748.0,
"step": 420
},
{
"entropy": 0.3394287109375,
"epoch": 0.32410024495948747,
"grad_norm": 0.3902963101863861,
"learning_rate": 1.9937570305080422e-05,
"loss": 0.3475761651992798,
"mean_token_accuracy": 0.8975138142704964,
"num_tokens": 5438366.0,
"step": 430
},
{
"entropy": 0.3736083984375,
"epoch": 0.3316374599585453,
"grad_norm": 0.38104942440986633,
"learning_rate": 1.9932005204532756e-05,
"loss": 0.38853695392608645,
"mean_token_accuracy": 0.889219282567501,
"num_tokens": 5576392.0,
"step": 440
},
{
"entropy": 0.3273193359375,
"epoch": 0.3391746749576032,
"grad_norm": 0.35075074434280396,
"learning_rate": 1.9926203381932015e-05,
"loss": 0.33571979999542234,
"mean_token_accuracy": 0.8994953021407127,
"num_tokens": 5701170.0,
"step": 450
},
{
"entropy": 0.3619873046875,
"epoch": 0.346711889956661,
"grad_norm": 0.34510132670402527,
"learning_rate": 1.9920164975560386e-05,
"loss": 0.37769622802734376,
"mean_token_accuracy": 0.8914814174175263,
"num_tokens": 5834397.0,
"step": 460
},
{
"entropy": 0.37041015625,
"epoch": 0.3542491049557189,
"grad_norm": 0.3143845796585083,
"learning_rate": 1.9913890129338846e-05,
"loss": 0.3819720268249512,
"mean_token_accuracy": 0.891846376657486,
"num_tokens": 5969370.0,
"step": 470
},
{
"entropy": 0.348388671875,
"epoch": 0.3617863199547767,
"grad_norm": 0.4210856556892395,
"learning_rate": 1.9907378992823755e-05,
"loss": 0.36168179512023924,
"mean_token_accuracy": 0.8931615963578224,
"num_tokens": 6086183.0,
"step": 480
},
{
"entropy": 0.33388671875,
"epoch": 0.3693235349538346,
"grad_norm": 0.3834077715873718,
"learning_rate": 1.9900631721203264e-05,
"loss": 0.3554360866546631,
"mean_token_accuracy": 0.8969168856739997,
"num_tokens": 6209383.0,
"step": 490
},
{
"entropy": 0.3376953125,
"epoch": 0.3768607499528924,
"grad_norm": 0.3776184320449829,
"learning_rate": 1.9893648475293646e-05,
"loss": 0.35178580284118655,
"mean_token_accuracy": 0.8986482962965965,
"num_tokens": 6339234.0,
"step": 500
},
{
"entropy": 0.359765625,
"epoch": 0.3843979649519503,
"grad_norm": 0.3891402781009674,
"learning_rate": 1.988642942153544e-05,
"loss": 0.3677093982696533,
"mean_token_accuracy": 0.895267216861248,
"num_tokens": 6467113.0,
"step": 510
},
{
"epoch": 0.3843979649519503,
"eval_entropy": 0.3330872317394578,
"eval_loss": 0.3505273461341858,
"eval_mean_token_accuracy": 0.8962113052067986,
"eval_num_tokens": 6467113.0,
"eval_runtime": 444.8495,
"eval_samples_per_second": 5.964,
"eval_steps_per_second": 1.493,
"step": 510
},
{
"entropy": 0.3333984375,
"epoch": 0.39193517995100813,
"grad_norm": 0.43438854813575745,
"learning_rate": 1.9878974731989487e-05,
"loss": 0.3478308439254761,
"mean_token_accuracy": 0.8962388306856155,
"num_tokens": 6583985.0,
"step": 520
},
{
"entropy": 0.35859375,
"epoch": 0.3994723949500659,
"grad_norm": 0.4000532031059265,
"learning_rate": 1.9871284584332845e-05,
"loss": 0.3833730697631836,
"mean_token_accuracy": 0.8913498848676682,
"num_tokens": 6708069.0,
"step": 530
},
{
"entropy": 0.33818359375,
"epoch": 0.4070096099491238,
"grad_norm": 0.45075827836990356,
"learning_rate": 1.986335916185454e-05,
"loss": 0.3408809661865234,
"mean_token_accuracy": 0.8979726910591126,
"num_tokens": 6834235.0,
"step": 540
},
{
"entropy": 0.356494140625,
"epoch": 0.4145468249481816,
"grad_norm": 0.3909159004688263,
"learning_rate": 1.9855198653451194e-05,
"loss": 0.36372694969177244,
"mean_token_accuracy": 0.8921904131770134,
"num_tokens": 6972729.0,
"step": 550
},
{
"entropy": 0.340576171875,
"epoch": 0.4220840399472395,
"grad_norm": 0.34595179557800293,
"learning_rate": 1.9846803253622535e-05,
"loss": 0.35205156803131105,
"mean_token_accuracy": 0.8962323024868966,
"num_tokens": 7105522.0,
"step": 560
},
{
"entropy": 0.3424072265625,
"epoch": 0.4296212549462973,
"grad_norm": 0.48934608697891235,
"learning_rate": 1.983817316246676e-05,
"loss": 0.35395040512084963,
"mean_token_accuracy": 0.8971632197499275,
"num_tokens": 7226248.0,
"step": 570
},
{
"entropy": 0.31986083984375,
"epoch": 0.4371584699453552,
"grad_norm": 0.4124310612678528,
"learning_rate": 1.9829308585675746e-05,
"loss": 0.33618412017822263,
"mean_token_accuracy": 0.8994600489735604,
"num_tokens": 7348054.0,
"step": 580
},
{
"entropy": 0.3430908203125,
"epoch": 0.444695684944413,
"grad_norm": 0.3382546901702881,
"learning_rate": 1.9820209734530185e-05,
"loss": 0.35527355670928956,
"mean_token_accuracy": 0.8949465349316597,
"num_tokens": 7467342.0,
"step": 590
},
{
"entropy": 0.3464599609375,
"epoch": 0.4522328999434709,
"grad_norm": 0.4934978783130646,
"learning_rate": 1.981087682589451e-05,
"loss": 0.3549240827560425,
"mean_token_accuracy": 0.8943406358361244,
"num_tokens": 7592366.0,
"step": 600
},
{
"entropy": 0.33681640625,
"epoch": 0.45977011494252873,
"grad_norm": 0.4190860986709595,
"learning_rate": 1.9801310082211748e-05,
"loss": 0.3477961540222168,
"mean_token_accuracy": 0.8963608622550965,
"num_tokens": 7718744.0,
"step": 610
},
{
"entropy": 0.32294921875,
"epoch": 0.4673073299415866,
"grad_norm": 0.4096807539463043,
"learning_rate": 1.9791509731498205e-05,
"loss": 0.33289148807525637,
"mean_token_accuracy": 0.8992252185940742,
"num_tokens": 7835764.0,
"step": 620
},
{
"entropy": 0.3320068359375,
"epoch": 0.47484454494064443,
"grad_norm": 0.45555874705314636,
"learning_rate": 1.9781476007338058e-05,
"loss": 0.34081387519836426,
"mean_token_accuracy": 0.8964440226554871,
"num_tokens": 7965749.0,
"step": 630
},
{
"entropy": 0.3408935546875,
"epoch": 0.4823817599397023,
"grad_norm": 0.3963310718536377,
"learning_rate": 1.977120914887775e-05,
"loss": 0.3597146272659302,
"mean_token_accuracy": 0.8958937346935272,
"num_tokens": 8088365.0,
"step": 640
},
{
"entropy": 0.37021484375,
"epoch": 0.48991897493876013,
"grad_norm": 0.365715891122818,
"learning_rate": 1.9760709400820314e-05,
"loss": 0.3843697547912598,
"mean_token_accuracy": 0.8901895850896835,
"num_tokens": 8229867.0,
"step": 650
},
{
"entropy": 0.3655029296875,
"epoch": 0.497456189937818,
"grad_norm": 0.4006253778934479,
"learning_rate": 1.9749977013419536e-05,
"loss": 0.37570044994354246,
"mean_token_accuracy": 0.8904815658926963,
"num_tokens": 8357858.0,
"step": 660
},
{
"entropy": 0.3462890625,
"epoch": 0.5049934049368758,
"grad_norm": 0.3711676299571991,
"learning_rate": 1.9739012242474e-05,
"loss": 0.3505732297897339,
"mean_token_accuracy": 0.8968447670340538,
"num_tokens": 8491784.0,
"step": 670
},
{
"entropy": 0.3403564453125,
"epoch": 0.5125306199359336,
"grad_norm": 0.432271808385849,
"learning_rate": 1.9727815349320964e-05,
"loss": 0.35620846748352053,
"mean_token_accuracy": 0.8953040033578873,
"num_tokens": 8613675.0,
"step": 680
},
{
"epoch": 0.5125306199359336,
"eval_entropy": 0.3416262707078313,
"eval_loss": 0.3412366807460785,
"eval_mean_token_accuracy": 0.8980938759912928,
"eval_num_tokens": 8613675.0,
"eval_runtime": 445.2361,
"eval_samples_per_second": 5.959,
"eval_steps_per_second": 1.491,
"step": 680
},
{
"entropy": 0.3375244140625,
"epoch": 0.5200678349349915,
"grad_norm": 0.39377152919769287,
"learning_rate": 1.971638660083016e-05,
"loss": 0.3446618318557739,
"mean_token_accuracy": 0.8973624289035798,
"num_tokens": 8734967.0,
"step": 690
},
{
"entropy": 0.380859375,
"epoch": 0.5276050499340493,
"grad_norm": 0.3425155282020569,
"learning_rate": 1.970472626939742e-05,
"loss": 0.3928657293319702,
"mean_token_accuracy": 0.8857068896293641,
"num_tokens": 8866789.0,
"step": 700
},
{
"entropy": 0.3181884765625,
"epoch": 0.5351422649331072,
"grad_norm": 0.39210009574890137,
"learning_rate": 1.969283463293818e-05,
"loss": 0.3279300928115845,
"mean_token_accuracy": 0.901725186407566,
"num_tokens": 8989637.0,
"step": 710
},
{
"entropy": 0.3260986328125,
"epoch": 0.542679479932165,
"grad_norm": 0.36499711871147156,
"learning_rate": 1.9680711974880868e-05,
"loss": 0.3395835399627686,
"mean_token_accuracy": 0.8985119208693504,
"num_tokens": 9107079.0,
"step": 720
},
{
"entropy": 0.3133056640625,
"epoch": 0.5502166949312229,
"grad_norm": 0.3930191099643707,
"learning_rate": 1.9668358584160136e-05,
"loss": 0.3265484094619751,
"mean_token_accuracy": 0.9016185060143471,
"num_tokens": 9227783.0,
"step": 730
},
{
"entropy": 0.340673828125,
"epoch": 0.5577539099302807,
"grad_norm": 0.3877074122428894,
"learning_rate": 1.965577475520999e-05,
"loss": 0.34572837352752683,
"mean_token_accuracy": 0.8980929121375084,
"num_tokens": 9352288.0,
"step": 740
},
{
"entropy": 0.3293212890625,
"epoch": 0.5652911249293386,
"grad_norm": 0.3847011625766754,
"learning_rate": 1.964296078795675e-05,
"loss": 0.33631391525268556,
"mean_token_accuracy": 0.8981146275997162,
"num_tokens": 9475875.0,
"step": 750
},
{
"entropy": 0.3515380859375,
"epoch": 0.5728283399283964,
"grad_norm": 0.3962864577770233,
"learning_rate": 1.9629916987811924e-05,
"loss": 0.3633269309997559,
"mean_token_accuracy": 0.8934466958045959,
"num_tokens": 9601762.0,
"step": 760
},
{
"entropy": 0.31484375,
"epoch": 0.5803655549274543,
"grad_norm": 0.3556186556816101,
"learning_rate": 1.961664366566491e-05,
"loss": 0.3226339101791382,
"mean_token_accuracy": 0.9032136023044586,
"num_tokens": 9729416.0,
"step": 770
},
{
"entropy": 0.34990234375,
"epoch": 0.5879027699265121,
"grad_norm": 0.3913438618183136,
"learning_rate": 1.9603141137875596e-05,
"loss": 0.358534836769104,
"mean_token_accuracy": 0.8945465311408043,
"num_tokens": 9862899.0,
"step": 780
},
{
"entropy": 0.343603515625,
"epoch": 0.59543998492557,
"grad_norm": 0.39869415760040283,
"learning_rate": 1.9589409726266822e-05,
"loss": 0.3582808494567871,
"mean_token_accuracy": 0.8956417754292488,
"num_tokens": 9990936.0,
"step": 790
},
{
"entropy": 0.3222900390625,
"epoch": 0.6029771999246278,
"grad_norm": 0.46191906929016113,
"learning_rate": 1.9575449758116703e-05,
"loss": 0.32662172317504884,
"mean_token_accuracy": 0.9030146107077599,
"num_tokens": 10124909.0,
"step": 800
},
{
"entropy": 0.3161376953125,
"epoch": 0.6105144149236857,
"grad_norm": 0.35114115476608276,
"learning_rate": 1.956126156615083e-05,
"loss": 0.3295163631439209,
"mean_token_accuracy": 0.8997720777988434,
"num_tokens": 10252655.0,
"step": 810
},
{
"entropy": 0.335595703125,
"epoch": 0.6180516299227435,
"grad_norm": 0.435343861579895,
"learning_rate": 1.9546845488534347e-05,
"loss": 0.34328203201293944,
"mean_token_accuracy": 0.8988629937171936,
"num_tokens": 10378988.0,
"step": 820
},
{
"entropy": 0.329248046875,
"epoch": 0.6255888449218014,
"grad_norm": 0.3690928518772125,
"learning_rate": 1.953220186886388e-05,
"loss": 0.3510568380355835,
"mean_token_accuracy": 0.897222849726677,
"num_tokens": 10503801.0,
"step": 830
},
{
"entropy": 0.325,
"epoch": 0.6331260599208592,
"grad_norm": 0.33731427788734436,
"learning_rate": 1.9517331056159353e-05,
"loss": 0.3301519870758057,
"mean_token_accuracy": 0.9016004085540772,
"num_tokens": 10632605.0,
"step": 840
},
{
"entropy": 0.3230224609375,
"epoch": 0.640663274919917,
"grad_norm": 0.3374157249927521,
"learning_rate": 1.9502233404855672e-05,
"loss": 0.335455584526062,
"mean_token_accuracy": 0.8995656460523606,
"num_tokens": 10758290.0,
"step": 850
},
{
"epoch": 0.640663274919917,
"eval_entropy": 0.32338926016566266,
"eval_loss": 0.33324772119522095,
"eval_mean_token_accuracy": 0.8999460333262581,
"eval_num_tokens": 10758290.0,
"eval_runtime": 445.1709,
"eval_samples_per_second": 5.96,
"eval_steps_per_second": 1.492,
"step": 850
},
{
"entropy": 0.3327880859375,
"epoch": 0.6482004899189749,
"grad_norm": 0.3995136320590973,
"learning_rate": 1.948690927479427e-05,
"loss": 0.34148826599121096,
"mean_token_accuracy": 0.898120503127575,
"num_tokens": 10884739.0,
"step": 860
},
{
"entropy": 0.3158203125,
"epoch": 0.6557377049180327,
"grad_norm": 0.49846041202545166,
"learning_rate": 1.9471359031214535e-05,
"loss": 0.3240156412124634,
"mean_token_accuracy": 0.9004231512546539,
"num_tokens": 11008100.0,
"step": 870
},
{
"entropy": 0.312646484375,
"epoch": 0.6632749199170906,
"grad_norm": 0.42257261276245117,
"learning_rate": 1.945558304474512e-05,
"loss": 0.3160678863525391,
"mean_token_accuracy": 0.9045681983232499,
"num_tokens": 11129110.0,
"step": 880
},
{
"entropy": 0.319189453125,
"epoch": 0.6708121349161484,
"grad_norm": 0.36973708868026733,
"learning_rate": 1.943958169139507e-05,
"loss": 0.3275951623916626,
"mean_token_accuracy": 0.9003831461071968,
"num_tokens": 11258786.0,
"step": 890
},
{
"entropy": 0.311572265625,
"epoch": 0.6783493499152063,
"grad_norm": 0.3653687834739685,
"learning_rate": 1.9423355352544896e-05,
"loss": 0.31893162727355956,
"mean_token_accuracy": 0.9011349901556969,
"num_tokens": 11370930.0,
"step": 900
},
{
"entropy": 0.3440673828125,
"epoch": 0.6858865649142641,
"grad_norm": 0.39143797755241394,
"learning_rate": 1.940690441493748e-05,
"loss": 0.3578460693359375,
"mean_token_accuracy": 0.8946596220135689,
"num_tokens": 11504972.0,
"step": 910
},
{
"entropy": 0.3222412109375,
"epoch": 0.693423779913322,
"grad_norm": 0.33701032400131226,
"learning_rate": 1.939022927066884e-05,
"loss": 0.3248148441314697,
"mean_token_accuracy": 0.9022357478737831,
"num_tokens": 11646947.0,
"step": 920
},
{
"entropy": 0.345849609375,
"epoch": 0.7009609949123798,
"grad_norm": 0.43142688274383545,
"learning_rate": 1.9373330317178797e-05,
"loss": 0.3588585615158081,
"mean_token_accuracy": 0.8931220710277558,
"num_tokens": 11768199.0,
"step": 930
},
{
"entropy": 0.34091796875,
"epoch": 0.7084982099114377,
"grad_norm": 0.36513519287109375,
"learning_rate": 1.93562079572415e-05,
"loss": 0.34344265460968015,
"mean_token_accuracy": 0.8979562237858772,
"num_tokens": 11890508.0,
"step": 940
},
{
"entropy": 0.3333984375,
"epoch": 0.7160354249104955,
"grad_norm": 0.41007548570632935,
"learning_rate": 1.9338862598955833e-05,
"loss": 0.34928805828094484,
"mean_token_accuracy": 0.8953282848000527,
"num_tokens": 12021587.0,
"step": 950
},
{
"entropy": 0.3439208984375,
"epoch": 0.7235726399095535,
"grad_norm": 0.44236838817596436,
"learning_rate": 1.932129465573568e-05,
"loss": 0.34870595932006837,
"mean_token_accuracy": 0.8960365921258926,
"num_tokens": 12143730.0,
"step": 960
},
{
"entropy": 0.3028564453125,
"epoch": 0.7311098549086112,
"grad_norm": 0.4242440164089203,
"learning_rate": 1.9303504546300066e-05,
"loss": 0.31922686100006104,
"mean_token_accuracy": 0.9043222770094872,
"num_tokens": 12271951.0,
"step": 970
},
{
"entropy": 0.31630859375,
"epoch": 0.7386470699076692,
"grad_norm": 0.4041174352169037,
"learning_rate": 1.928549269466319e-05,
"loss": 0.31934442520141604,
"mean_token_accuracy": 0.9024053528904915,
"num_tokens": 12391649.0,
"step": 980
},
{
"entropy": 0.300537109375,
"epoch": 0.746184284906727,
"grad_norm": 0.36280640959739685,
"learning_rate": 1.9267259530124317e-05,
"loss": 0.30955698490142824,
"mean_token_accuracy": 0.9053523823618889,
"num_tokens": 12515972.0,
"step": 990
},
{
"entropy": 0.3237060546875,
"epoch": 0.7537214999057849,
"grad_norm": 0.35504451394081116,
"learning_rate": 1.9248805487257537e-05,
"loss": 0.3321828842163086,
"mean_token_accuracy": 0.8994348689913749,
"num_tokens": 12638350.0,
"step": 1000
},
{
"entropy": 0.3082275390625,
"epoch": 0.7612587149048426,
"grad_norm": 0.3824400305747986,
"learning_rate": 1.9230131005901413e-05,
"loss": 0.3234311580657959,
"mean_token_accuracy": 0.9044092565774917,
"num_tokens": 12772460.0,
"step": 1010
},
{
"entropy": 0.3014404296875,
"epoch": 0.7687959299039006,
"grad_norm": 0.32694560289382935,
"learning_rate": 1.92112365311485e-05,
"loss": 0.3027196884155273,
"mean_token_accuracy": 0.9065699726343155,
"num_tokens": 12915477.0,
"step": 1020
},
{
"epoch": 0.7687959299039006,
"eval_entropy": 0.3172269154743976,
"eval_loss": 0.32759496569633484,
"eval_mean_token_accuracy": 0.900975513978895,
"eval_num_tokens": 12915477.0,
"eval_runtime": 445.4607,
"eval_samples_per_second": 5.956,
"eval_steps_per_second": 1.491,
"step": 1020
},
{
"entropy": 0.3295166015625,
"epoch": 0.7763331449029583,
"grad_norm": 0.39178362488746643,
"learning_rate": 1.9192122513334742e-05,
"loss": 0.338738226890564,
"mean_token_accuracy": 0.8980937018990517,
"num_tokens": 13044310.0,
"step": 1030
},
{
"entropy": 0.3359375,
"epoch": 0.7838703599020163,
"grad_norm": 0.45059332251548767,
"learning_rate": 1.917278940802871e-05,
"loss": 0.3519278049468994,
"mean_token_accuracy": 0.8944015249609947,
"num_tokens": 13167032.0,
"step": 1040
},
{
"entropy": 0.3169189453125,
"epoch": 0.791407574901074,
"grad_norm": 0.43569517135620117,
"learning_rate": 1.9153237676020783e-05,
"loss": 0.32522382736206057,
"mean_token_accuracy": 0.9009502604603767,
"num_tokens": 13289712.0,
"step": 1050
},
{
"entropy": 0.308447265625,
"epoch": 0.7989447899001318,
"grad_norm": 0.3533364236354828,
"learning_rate": 1.9133467783312135e-05,
"loss": 0.31727802753448486,
"mean_token_accuracy": 0.9029386058449745,
"num_tokens": 13408540.0,
"step": 1060
},
{
"entropy": 0.284033203125,
"epoch": 0.8064820048991898,
"grad_norm": 0.3339077830314636,
"learning_rate": 1.9113480201103658e-05,
"loss": 0.28868808746337893,
"mean_token_accuracy": 0.9101893961429596,
"num_tokens": 13531603.0,
"step": 1070
},
{
"entropy": 0.3197265625,
"epoch": 0.8140192198982475,
"grad_norm": 0.49363258481025696,
"learning_rate": 1.9093275405784686e-05,
"loss": 0.32742924690246583,
"mean_token_accuracy": 0.9000251770019532,
"num_tokens": 13644481.0,
"step": 1080
},
{
"entropy": 0.3171630859375,
"epoch": 0.8215564348973055,
"grad_norm": 0.34514543414115906,
"learning_rate": 1.9072853878921698e-05,
"loss": 0.3292176008224487,
"mean_token_accuracy": 0.9016644075512886,
"num_tokens": 13779842.0,
"step": 1090
},
{
"entropy": 0.3384521484375,
"epoch": 0.8290936498963632,
"grad_norm": 0.3689023554325104,
"learning_rate": 1.9052216107246786e-05,
"loss": 0.35496888160705564,
"mean_token_accuracy": 0.896573556959629,
"num_tokens": 13915594.0,
"step": 1100
},
{
"entropy": 0.31826171875,
"epoch": 0.8366308648954212,
"grad_norm": 0.429788738489151,
"learning_rate": 1.903136258264609e-05,
"loss": 0.3248345375061035,
"mean_token_accuracy": 0.9002579048275947,
"num_tokens": 14042862.0,
"step": 1110
},
{
"entropy": 0.32587890625,
"epoch": 0.844168079894479,
"grad_norm": 0.3493012487888336,
"learning_rate": 1.901029380214806e-05,
"loss": 0.33571810722351075,
"mean_token_accuracy": 0.8995957180857659,
"num_tokens": 14171903.0,
"step": 1120
},
{
"entropy": 0.3212890625,
"epoch": 0.8517052948935369,
"grad_norm": 0.3966390788555145,
"learning_rate": 1.8989010267911613e-05,
"loss": 0.32640881538391114,
"mean_token_accuracy": 0.9010836943984032,
"num_tokens": 14307045.0,
"step": 1130
},
{
"entropy": 0.3130126953125,
"epoch": 0.8592425098925947,
"grad_norm": 0.38989686965942383,
"learning_rate": 1.8967512487214165e-05,
"loss": 0.3198718070983887,
"mean_token_accuracy": 0.9039800494909287,
"num_tokens": 14446367.0,
"step": 1140
},
{
"entropy": 0.3095703125,
"epoch": 0.8667797248916526,
"grad_norm": 0.42321473360061646,
"learning_rate": 1.894580097243954e-05,
"loss": 0.30954005718231203,
"mean_token_accuracy": 0.9031733021140098,
"num_tokens": 14570222.0,
"step": 1150
},
{
"entropy": 0.309814453125,
"epoch": 0.8743169398907104,
"grad_norm": 0.3035660684108734,
"learning_rate": 1.8923876241065747e-05,
"loss": 0.3227293252944946,
"mean_token_accuracy": 0.9051610559225083,
"num_tokens": 14710023.0,
"step": 1160
},
{
"entropy": 0.297412109375,
"epoch": 0.8818541548897683,
"grad_norm": 0.3944414258003235,
"learning_rate": 1.890173881565267e-05,
"loss": 0.31080548763275145,
"mean_token_accuracy": 0.9057466745376587,
"num_tokens": 14840957.0,
"step": 1170
},
{
"entropy": 0.300244140625,
"epoch": 0.889391369888826,
"grad_norm": 0.42378875613212585,
"learning_rate": 1.8879389223829592e-05,
"loss": 0.30106220245361326,
"mean_token_accuracy": 0.904910996556282,
"num_tokens": 14960231.0,
"step": 1180
},
{
"entropy": 0.3187255859375,
"epoch": 0.896928584887884,
"grad_norm": 0.4092881381511688,
"learning_rate": 1.8856827998282622e-05,
"loss": 0.33903799057006834,
"mean_token_accuracy": 0.9004707217216492,
"num_tokens": 15082392.0,
"step": 1190
},
{
"epoch": 0.896928584887884,
"eval_entropy": 0.3203551510730422,
"eval_loss": 0.3233819901943207,
"eval_mean_token_accuracy": 0.9019732332552772,
"eval_num_tokens": 15082392.0,
"eval_runtime": 445.1,
"eval_samples_per_second": 5.96,
"eval_steps_per_second": 1.492,
"step": 1190
},
{
"entropy": 0.292822265625,
"epoch": 0.9044657998869418,
"grad_norm": 0.36644798517227173,
"learning_rate": 1.8834055676742018e-05,
"loss": 0.29460992813110354,
"mean_token_accuracy": 0.9084796339273453,
"num_tokens": 15212983.0,
"step": 1200
},
{
"entropy": 0.3179931640625,
"epoch": 0.9120030148859997,
"grad_norm": 0.3994215130805969,
"learning_rate": 1.8811072801969338e-05,
"loss": 0.33203489780426027,
"mean_token_accuracy": 0.8998118698596954,
"num_tokens": 15348661.0,
"step": 1210
},
{
"entropy": 0.3119140625,
"epoch": 0.9195402298850575,
"grad_norm": 0.4053172469139099,
"learning_rate": 1.878787992174454e-05,
"loss": 0.32895455360412595,
"mean_token_accuracy": 0.9015865311026573,
"num_tokens": 15471160.0,
"step": 1220
},
{
"entropy": 0.3383544921875,
"epoch": 0.9270774448841154,
"grad_norm": 0.44813165068626404,
"learning_rate": 1.876447758885289e-05,
"loss": 0.33706986904144287,
"mean_token_accuracy": 0.89834313839674,
"num_tokens": 15603058.0,
"step": 1230
},
{
"entropy": 0.307568359375,
"epoch": 0.9346146598831732,
"grad_norm": 0.3789234757423401,
"learning_rate": 1.8740866361071818e-05,
"loss": 0.3279023408889771,
"mean_token_accuracy": 0.9016483277082443,
"num_tokens": 15734640.0,
"step": 1240
},
{
"entropy": 0.333056640625,
"epoch": 0.9421518748822311,
"grad_norm": 0.38480523228645325,
"learning_rate": 1.8717046801157602e-05,
"loss": 0.3306466817855835,
"mean_token_accuracy": 0.8975656688213348,
"num_tokens": 15853167.0,
"step": 1250
},
{
"entropy": 0.315673828125,
"epoch": 0.9496890898812889,
"grad_norm": 0.3715457618236542,
"learning_rate": 1.869301947683197e-05,
"loss": 0.3402095317840576,
"mean_token_accuracy": 0.8996288001537323,
"num_tokens": 15983692.0,
"step": 1260
},
{
"entropy": 0.3170654296875,
"epoch": 0.9572263048803467,
"grad_norm": 0.40626004338264465,
"learning_rate": 1.866878496076856e-05,
"loss": 0.32470359802246096,
"mean_token_accuracy": 0.9029552206397057,
"num_tokens": 16100297.0,
"step": 1270
},
{
"entropy": 0.301513671875,
"epoch": 0.9647635198794046,
"grad_norm": 0.40940678119659424,
"learning_rate": 1.864434383057927e-05,
"loss": 0.31711864471435547,
"mean_token_accuracy": 0.9059911221265793,
"num_tokens": 16228135.0,
"step": 1280
},
{
"entropy": 0.331494140625,
"epoch": 0.9723007348784624,
"grad_norm": 0.3918750286102295,
"learning_rate": 1.8619696668800494e-05,
"loss": 0.3397138833999634,
"mean_token_accuracy": 0.8966664358973503,
"num_tokens": 16358644.0,
"step": 1290
},
{
"entropy": 0.30888671875,
"epoch": 0.9798379498775203,
"grad_norm": 0.35955581068992615,
"learning_rate": 1.8594844062879244e-05,
"loss": 0.3226014614105225,
"mean_token_accuracy": 0.9042733535170555,
"num_tokens": 16485152.0,
"step": 1300
},
{
"entropy": 0.3216064453125,
"epoch": 0.9873751648765781,
"grad_norm": 0.3783910572528839,
"learning_rate": 1.8569786605159133e-05,
"loss": 0.3362764358520508,
"mean_token_accuracy": 0.8991301536560059,
"num_tokens": 16604827.0,
"step": 1310
},
{
"entropy": 0.317529296875,
"epoch": 0.994912379875636,
"grad_norm": 0.32068535685539246,
"learning_rate": 1.8544524892866277e-05,
"loss": 0.32965884208679197,
"mean_token_accuracy": 0.9012513026595116,
"num_tokens": 16740803.0,
"step": 1320
},
{
"entropy": 0.3245442708333333,
"epoch": 1.0022611644997172,
"grad_norm": 0.3632865250110626,
"learning_rate": 1.8519059528095042e-05,
"loss": 0.33621630668640134,
"mean_token_accuracy": 0.9006370382431226,
"num_tokens": 16856855.0,
"step": 1330
},
{
"entropy": 0.283056640625,
"epoch": 1.0097983794987753,
"grad_norm": 0.46613505482673645,
"learning_rate": 1.84933911177937e-05,
"loss": 0.28250281810760497,
"mean_token_accuracy": 0.9116494670510292,
"num_tokens": 16975649.0,
"step": 1340
},
{
"entropy": 0.278125,
"epoch": 1.017335594497833,
"grad_norm": 0.36128926277160645,
"learning_rate": 1.8467520273749976e-05,
"loss": 0.29456756114959715,
"mean_token_accuracy": 0.9097805410623551,
"num_tokens": 17101024.0,
"step": 1350
},
{
"entropy": 0.3016357421875,
"epoch": 1.0248728094968909,
"grad_norm": 0.4207335412502289,
"learning_rate": 1.8441447612576438e-05,
"loss": 0.3014190673828125,
"mean_token_accuracy": 0.9071466863155365,
"num_tokens": 17230628.0,
"step": 1360
},
{
"epoch": 1.0248728094968909,
"eval_entropy": 0.2955366387424699,
"eval_loss": 0.32009029388427734,
"eval_mean_token_accuracy": 0.9035842050629926,
"eval_num_tokens": 17230628.0,
"eval_runtime": 444.9145,
"eval_samples_per_second": 5.963,
"eval_steps_per_second": 1.492,
"step": 1360
},
{
"entropy": 0.30123291015625,
"epoch": 1.0324100244959487,
"grad_norm": 0.40995725989341736,
"learning_rate": 1.841517375569583e-05,
"loss": 0.30909392833709715,
"mean_token_accuracy": 0.9055786192417145,
"num_tokens": 17352049.0,
"step": 1370
},
{
"entropy": 0.3074951171875,
"epoch": 1.0399472394950067,
"grad_norm": 0.36840590834617615,
"learning_rate": 1.8388699329326237e-05,
"loss": 0.31580018997192383,
"mean_token_accuracy": 0.9033578932285309,
"num_tokens": 17479720.0,
"step": 1380
},
{
"entropy": 0.2889404296875,
"epoch": 1.0474844544940645,
"grad_norm": 0.39798107743263245,
"learning_rate": 1.8362024964466185e-05,
"loss": 0.30143420696258544,
"mean_token_accuracy": 0.9072484865784645,
"num_tokens": 17602320.0,
"step": 1390
},
{
"entropy": 0.2903564453125,
"epoch": 1.0550216694931223,
"grad_norm": 0.36563146114349365,
"learning_rate": 1.8335151296879576e-05,
"loss": 0.2945702075958252,
"mean_token_accuracy": 0.9097679927945137,
"num_tokens": 17732035.0,
"step": 1400
},
{
"entropy": 0.2938720703125,
"epoch": 1.06255888449218,
"grad_norm": 0.3827485740184784,
"learning_rate": 1.8308078967080547e-05,
"loss": 0.3062156915664673,
"mean_token_accuracy": 0.9074965313076973,
"num_tokens": 17858692.0,
"step": 1410
},
{
"entropy": 0.293212890625,
"epoch": 1.070096099491238,
"grad_norm": 0.3732523024082184,
"learning_rate": 1.8280808620318207e-05,
"loss": 0.29337191581726074,
"mean_token_accuracy": 0.908596222102642,
"num_tokens": 17980887.0,
"step": 1420
},
{
"entropy": 0.3029052734375,
"epoch": 1.0776333144902959,
"grad_norm": 0.34282541275024414,
"learning_rate": 1.8253340906561257e-05,
"loss": 0.31957981586456297,
"mean_token_accuracy": 0.9054985359311104,
"num_tokens": 18118746.0,
"step": 1430
},
{
"entropy": 0.306103515625,
"epoch": 1.0851705294893537,
"grad_norm": 0.4450572729110718,
"learning_rate": 1.8225676480482484e-05,
"loss": 0.3173269033432007,
"mean_token_accuracy": 0.905036324262619,
"num_tokens": 18242535.0,
"step": 1440
},
{
"entropy": 0.3273193359375,
"epoch": 1.0927077444884115,
"grad_norm": 0.37454572319984436,
"learning_rate": 1.819781600144318e-05,
"loss": 0.339494514465332,
"mean_token_accuracy": 0.8988345369696618,
"num_tokens": 18369940.0,
"step": 1450
},
{
"entropy": 0.2994873046875,
"epoch": 1.1002449594874695,
"grad_norm": 0.39925429224967957,
"learning_rate": 1.8169760133477404e-05,
"loss": 0.3085808277130127,
"mean_token_accuracy": 0.9062377795577049,
"num_tokens": 18510860.0,
"step": 1460
},
{
"entropy": 0.3177734375,
"epoch": 1.1077821744865273,
"grad_norm": 0.3473636209964752,
"learning_rate": 1.814150954527618e-05,
"loss": 0.33002748489379885,
"mean_token_accuracy": 0.9014916539192199,
"num_tokens": 18637891.0,
"step": 1470
},
{
"entropy": 0.2923583984375,
"epoch": 1.115319389485585,
"grad_norm": 0.41963300108909607,
"learning_rate": 1.8113064910171538e-05,
"loss": 0.30164639949798583,
"mean_token_accuracy": 0.9075041651725769,
"num_tokens": 18762929.0,
"step": 1480
},
{
"entropy": 0.304736328125,
"epoch": 1.1228566044846429,
"grad_norm": 0.4134460985660553,
"learning_rate": 1.8084426906120472e-05,
"loss": 0.312406063079834,
"mean_token_accuracy": 0.9049404874444008,
"num_tokens": 18885165.0,
"step": 1490
},
{
"entropy": 0.2976318359375,
"epoch": 1.1303938194837007,
"grad_norm": 0.44191214442253113,
"learning_rate": 1.8055596215688788e-05,
"loss": 0.3146297693252563,
"mean_token_accuracy": 0.9052109360694885,
"num_tokens": 19003706.0,
"step": 1500
},
{
"entropy": 0.27841796875,
"epoch": 1.1379310344827587,
"grad_norm": 0.43751654028892517,
"learning_rate": 1.802657352603483e-05,
"loss": 0.28258237838745115,
"mean_token_accuracy": 0.9103972479701042,
"num_tokens": 19129867.0,
"step": 1510
},
{
"entropy": 0.3037841796875,
"epoch": 1.1454682494818165,
"grad_norm": 0.4770371913909912,
"learning_rate": 1.7997359528893098e-05,
"loss": 0.31419939994812013,
"mean_token_accuracy": 0.9043475434184074,
"num_tokens": 19245782.0,
"step": 1520
},
{
"entropy": 0.3114501953125,
"epoch": 1.1530054644808743,
"grad_norm": 0.40218523144721985,
"learning_rate": 1.7967954920557768e-05,
"loss": 0.3275810956954956,
"mean_token_accuracy": 0.9032333821058274,
"num_tokens": 19375196.0,
"step": 1530
},
{
"epoch": 1.1530054644808743,
"eval_entropy": 0.30540668533509036,
"eval_loss": 0.31701526045799255,
"eval_mean_token_accuracy": 0.9038175200841513,
"eval_num_tokens": 19375196.0,
"eval_runtime": 444.8306,
"eval_samples_per_second": 5.964,
"eval_steps_per_second": 1.493,
"step": 1530
},
{
"entropy": 0.300830078125,
"epoch": 1.1605426794799323,
"grad_norm": 0.3524416983127594,
"learning_rate": 1.7938360401866096e-05,
"loss": 0.30742716789245605,
"mean_token_accuracy": 0.9047734826803208,
"num_tokens": 19500857.0,
"step": 1540
},
{
"entropy": 0.316162109375,
"epoch": 1.16807989447899,
"grad_norm": 0.3703024983406067,
"learning_rate": 1.7908576678181707e-05,
"loss": 0.33172438144683836,
"mean_token_accuracy": 0.9015444025397301,
"num_tokens": 19626493.0,
"step": 1550
},
{
"entropy": 0.2737548828125,
"epoch": 1.1756171094780479,
"grad_norm": 0.3456210494041443,
"learning_rate": 1.7878604459377795e-05,
"loss": 0.2756441593170166,
"mean_token_accuracy": 0.9136368721723557,
"num_tokens": 19743689.0,
"step": 1560
},
{
"entropy": 0.302880859375,
"epoch": 1.1831543244771057,
"grad_norm": 0.4714341461658478,
"learning_rate": 1.7848444459820188e-05,
"loss": 0.3121260404586792,
"mean_token_accuracy": 0.9028191328048706,
"num_tokens": 19863458.0,
"step": 1570
},
{
"entropy": 0.28583984375,
"epoch": 1.1906915394761635,
"grad_norm": 0.4156145453453064,
"learning_rate": 1.7818097398350342e-05,
"loss": 0.2904102325439453,
"mean_token_accuracy": 0.9098244786262513,
"num_tokens": 19994262.0,
"step": 1580
},
{
"entropy": 0.29375,
"epoch": 1.1982287544752215,
"grad_norm": 0.3377763330936432,
"learning_rate": 1.7787563998268184e-05,
"loss": 0.30670197010040284,
"mean_token_accuracy": 0.906707638502121,
"num_tokens": 20124999.0,
"step": 1590
},
{
"entropy": 0.302392578125,
"epoch": 1.2057659694742793,
"grad_norm": 0.49329009652137756,
"learning_rate": 1.775684498731489e-05,
"loss": 0.3087696313858032,
"mean_token_accuracy": 0.9053114622831344,
"num_tokens": 20249258.0,
"step": 1600
},
{
"entropy": 0.297705078125,
"epoch": 1.213303184473337,
"grad_norm": 0.4330660402774811,
"learning_rate": 1.7725941097655545e-05,
"loss": 0.3062288761138916,
"mean_token_accuracy": 0.9051512002944946,
"num_tokens": 20364874.0,
"step": 1610
},
{
"entropy": 0.2842529296875,
"epoch": 1.2208403994723949,
"grad_norm": 0.4065454602241516,
"learning_rate": 1.769485306586166e-05,
"loss": 0.2898876428604126,
"mean_token_accuracy": 0.9075682818889618,
"num_tokens": 20480419.0,
"step": 1620
},
{
"entropy": 0.2935791015625,
"epoch": 1.2283776144714529,
"grad_norm": 0.35416698455810547,
"learning_rate": 1.766358163289366e-05,
"loss": 0.30039851665496825,
"mean_token_accuracy": 0.9085959702730179,
"num_tokens": 20614729.0,
"step": 1630
},
{
"entropy": 0.2864990234375,
"epoch": 1.2359148294705107,
"grad_norm": 0.3471983075141907,
"learning_rate": 1.763212754408319e-05,
"loss": 0.29657065868377686,
"mean_token_accuracy": 0.9082139819860459,
"num_tokens": 20738759.0,
"step": 1640
},
{
"entropy": 0.3024169921875,
"epoch": 1.2434520444695685,
"grad_norm": 0.3187088370323181,
"learning_rate": 1.760049154911537e-05,
"loss": 0.31194396018981935,
"mean_token_accuracy": 0.9060672715306282,
"num_tokens": 20867449.0,
"step": 1650
},
{
"entropy": 0.2745849609375,
"epoch": 1.2509892594686263,
"grad_norm": 0.3486154079437256,
"learning_rate": 1.7568674402010916e-05,
"loss": 0.2793387174606323,
"mean_token_accuracy": 0.9114227816462517,
"num_tokens": 20995147.0,
"step": 1660
},
{
"entropy": 0.2999755859375,
"epoch": 1.258526474467684,
"grad_norm": 0.42927002906799316,
"learning_rate": 1.7536676861108167e-05,
"loss": 0.3100817441940308,
"mean_token_accuracy": 0.9050891101360321,
"num_tokens": 21115888.0,
"step": 1670
},
{
"entropy": 0.2914794921875,
"epoch": 1.266063689466742,
"grad_norm": 0.389069527387619,
"learning_rate": 1.7504499689045025e-05,
"loss": 0.2946730852127075,
"mean_token_accuracy": 0.9088802948594094,
"num_tokens": 21248739.0,
"step": 1680
},
{
"entropy": 0.2900390625,
"epoch": 1.2736009044657999,
"grad_norm": 0.4550289809703827,
"learning_rate": 1.7472143652740766e-05,
"loss": 0.2940664768218994,
"mean_token_accuracy": 0.9070353329181671,
"num_tokens": 21372952.0,
"step": 1690
},
{
"entropy": 0.3079345703125,
"epoch": 1.2811381194648577,
"grad_norm": 0.3766443133354187,
"learning_rate": 1.7439609523377765e-05,
"loss": 0.31435160636901854,
"mean_token_accuracy": 0.9039904981851578,
"num_tokens": 21482465.0,
"step": 1700
},
{
"epoch": 1.2811381194648577,
"eval_entropy": 0.2963881894766566,
"eval_loss": 0.3144903779029846,
"eval_mean_token_accuracy": 0.9044847843876804,
"eval_num_tokens": 21482465.0,
"eval_runtime": 444.3229,
"eval_samples_per_second": 5.971,
"eval_steps_per_second": 1.494,
"step": 1700
},
{
"entropy": 0.2976318359375,
"epoch": 1.2886753344639157,
"grad_norm": 0.3675684630870819,
"learning_rate": 1.740689807638311e-05,
"loss": 0.3084413051605225,
"mean_token_accuracy": 0.9068222478032112,
"num_tokens": 21606886.0,
"step": 1710
},
{
"entropy": 0.26845703125,
"epoch": 1.2962125494629735,
"grad_norm": 0.48080354928970337,
"learning_rate": 1.7374010091410126e-05,
"loss": 0.27617788314819336,
"mean_token_accuracy": 0.9144353941082954,
"num_tokens": 21728204.0,
"step": 1720
},
{
"entropy": 0.3060546875,
"epoch": 1.3037497644620313,
"grad_norm": 0.4360472559928894,
"learning_rate": 1.7340946352319795e-05,
"loss": 0.3208837270736694,
"mean_token_accuracy": 0.9051508828997612,
"num_tokens": 21847166.0,
"step": 1730
},
{
"entropy": 0.275732421875,
"epoch": 1.311286979461089,
"grad_norm": 0.42607492208480835,
"learning_rate": 1.730770764716206e-05,
"loss": 0.2842782735824585,
"mean_token_accuracy": 0.912279462814331,
"num_tokens": 21972827.0,
"step": 1740
},
{
"entropy": 0.298291015625,
"epoch": 1.3188241944601469,
"grad_norm": 0.3897174298763275,
"learning_rate": 1.7274294768157065e-05,
"loss": 0.30409531593322753,
"mean_token_accuracy": 0.907126384973526,
"num_tokens": 22098702.0,
"step": 1750
},
{
"entropy": 0.301708984375,
"epoch": 1.3263614094592049,
"grad_norm": 0.3547886312007904,
"learning_rate": 1.7240708511676253e-05,
"loss": 0.30962510108947755,
"mean_token_accuracy": 0.9043201595544815,
"num_tokens": 22224280.0,
"step": 1760
},
{
"entropy": 0.2868896484375,
"epoch": 1.3338986244582627,
"grad_norm": 0.41709667444229126,
"learning_rate": 1.7206949678223388e-05,
"loss": 0.29194619655609133,
"mean_token_accuracy": 0.9089675724506379,
"num_tokens": 22350124.0,
"step": 1770
},
{
"entropy": 0.31044921875,
"epoch": 1.3414358394573205,
"grad_norm": 0.41593441367149353,
"learning_rate": 1.7173019072415488e-05,
"loss": 0.3232313871383667,
"mean_token_accuracy": 0.9014707505702972,
"num_tokens": 22466149.0,
"step": 1780
},
{
"entropy": 0.302587890625,
"epoch": 1.3489730544563785,
"grad_norm": 0.3737364113330841,
"learning_rate": 1.7138917502963627e-05,
"loss": 0.3045801639556885,
"mean_token_accuracy": 0.9061708480119706,
"num_tokens": 22589692.0,
"step": 1790
},
{
"entropy": 0.288525390625,
"epoch": 1.3565102694554363,
"grad_norm": 0.36714568734169006,
"learning_rate": 1.710464578265369e-05,
"loss": 0.2963777780532837,
"mean_token_accuracy": 0.9083131685853004,
"num_tokens": 22722538.0,
"step": 1800
},
{
"entropy": 0.273828125,
"epoch": 1.364047484454494,
"grad_norm": 0.35630372166633606,
"learning_rate": 1.7070204728326964e-05,
"loss": 0.27682127952575686,
"mean_token_accuracy": 0.9124655604362488,
"num_tokens": 22857508.0,
"step": 1810
},
{
"entropy": 0.2949951171875,
"epoch": 1.3715846994535519,
"grad_norm": 0.353568434715271,
"learning_rate": 1.7035595160860694e-05,
"loss": 0.3098414897918701,
"mean_token_accuracy": 0.9068989664316177,
"num_tokens": 22982244.0,
"step": 1820
},
{
"entropy": 0.30048828125,
"epoch": 1.3791219144526097,
"grad_norm": 0.33436575531959534,
"learning_rate": 1.7000817905148523e-05,
"loss": 0.3092353820800781,
"mean_token_accuracy": 0.9077757328748703,
"num_tokens": 23115582.0,
"step": 1830
},
{
"entropy": 0.293017578125,
"epoch": 1.3866591294516675,
"grad_norm": 0.3831446170806885,
"learning_rate": 1.6965873790080806e-05,
"loss": 0.2991267442703247,
"mean_token_accuracy": 0.9091545164585113,
"num_tokens": 23244458.0,
"step": 1840
},
{
"entropy": 0.2932373046875,
"epoch": 1.3941963444507255,
"grad_norm": 0.4001041352748871,
"learning_rate": 1.693076364852487e-05,
"loss": 0.3073925018310547,
"mean_token_accuracy": 0.9061064407229423,
"num_tokens": 23370896.0,
"step": 1850
},
{
"entropy": 0.2966796875,
"epoch": 1.4017335594497833,
"grad_norm": 0.36026492714881897,
"learning_rate": 1.6895488317305174e-05,
"loss": 0.3013612747192383,
"mean_token_accuracy": 0.9059083923697472,
"num_tokens": 23490463.0,
"step": 1860
},
{
"entropy": 0.28447265625,
"epoch": 1.409270774448841,
"grad_norm": 0.4457832872867584,
"learning_rate": 1.6860048637183336e-05,
"loss": 0.2879622936248779,
"mean_token_accuracy": 0.910649086534977,
"num_tokens": 23619624.0,
"step": 1870
},
{
"epoch": 1.409270774448841,
"eval_entropy": 0.2866534497364458,
"eval_loss": 0.31162187457084656,
"eval_mean_token_accuracy": 0.9055151030959854,
"eval_num_tokens": 23619624.0,
"eval_runtime": 444.4582,
"eval_samples_per_second": 5.969,
"eval_steps_per_second": 1.494,
"step": 1870
},
{
"entropy": 0.2755126953125,
"epoch": 1.416807989447899,
"grad_norm": 0.34847527742385864,
"learning_rate": 1.6824445452838112e-05,
"loss": 0.2797748327255249,
"mean_token_accuracy": 0.9122792810201645,
"num_tokens": 23751843.0,
"step": 1880
},
{
"entropy": 0.3048583984375,
"epoch": 1.424345204446957,
"grad_norm": 0.34166133403778076,
"learning_rate": 1.6788679612845275e-05,
"loss": 0.3143250226974487,
"mean_token_accuracy": 0.9053974837064743,
"num_tokens": 23890129.0,
"step": 1890
},
{
"entropy": 0.2959228515625,
"epoch": 1.4318824194460147,
"grad_norm": 0.4138602316379547,
"learning_rate": 1.6752751969657364e-05,
"loss": 0.3098402738571167,
"mean_token_accuracy": 0.9060688123106957,
"num_tokens": 24025639.0,
"step": 1900
},
{
"entropy": 0.2892822265625,
"epoch": 1.4394196344450725,
"grad_norm": 0.35475072264671326,
"learning_rate": 1.6716663379583373e-05,
"loss": 0.30137479305267334,
"mean_token_accuracy": 0.9065017476677895,
"num_tokens": 24142755.0,
"step": 1910
},
{
"entropy": 0.2736083984375,
"epoch": 1.4469568494441303,
"grad_norm": 0.38053274154663086,
"learning_rate": 1.6680414702768358e-05,
"loss": 0.2755943775177002,
"mean_token_accuracy": 0.9128162145614624,
"num_tokens": 24271034.0,
"step": 1920
},
{
"entropy": 0.2882568359375,
"epoch": 1.4544940644431883,
"grad_norm": 0.3685821294784546,
"learning_rate": 1.6644006803172926e-05,
"loss": 0.29870429039001467,
"mean_token_accuracy": 0.9083519443869591,
"num_tokens": 24401299.0,
"step": 1930
},
{
"entropy": 0.2899169921875,
"epoch": 1.462031279442246,
"grad_norm": 0.38053128123283386,
"learning_rate": 1.660744054855263e-05,
"loss": 0.2999034643173218,
"mean_token_accuracy": 0.9092144444584846,
"num_tokens": 24525590.0,
"step": 1940
},
{
"entropy": 0.3008544921875,
"epoch": 1.4695684944413039,
"grad_norm": 0.3747199773788452,
"learning_rate": 1.657071681043731e-05,
"loss": 0.3081289052963257,
"mean_token_accuracy": 0.9040897369384766,
"num_tokens": 24652105.0,
"step": 1950
},
{
"entropy": 0.28818359375,
"epoch": 1.477105709440362,
"grad_norm": 0.4361964762210846,
"learning_rate": 1.6533836464110303e-05,
"loss": 0.2913468599319458,
"mean_token_accuracy": 0.9085044726729393,
"num_tokens": 24781538.0,
"step": 1960
},
{
"entropy": 0.2942626953125,
"epoch": 1.4846429244394197,
"grad_norm": 0.4351835548877716,
"learning_rate": 1.649680038858759e-05,
"loss": 0.30144288539886477,
"mean_token_accuracy": 0.9078996136784554,
"num_tokens": 24900040.0,
"step": 1970
},
{
"entropy": 0.309912109375,
"epoch": 1.4921801394384775,
"grad_norm": 0.3614610433578491,
"learning_rate": 1.645960946659685e-05,
"loss": 0.32563717365264894,
"mean_token_accuracy": 0.9042312502861023,
"num_tokens": 25029356.0,
"step": 1980
},
{
"entropy": 0.288232421875,
"epoch": 1.4997173544375353,
"grad_norm": 0.46183428168296814,
"learning_rate": 1.64222645845564e-05,
"loss": 0.2938676118850708,
"mean_token_accuracy": 0.9088562294840813,
"num_tokens": 25150702.0,
"step": 1990
},
{
"entropy": 0.287841796875,
"epoch": 1.507254569436593,
"grad_norm": 0.35748639702796936,
"learning_rate": 1.638476663255409e-05,
"loss": 0.3016012907028198,
"mean_token_accuracy": 0.90945535749197,
"num_tokens": 25289821.0,
"step": 2000
},
{
"entropy": 0.29658203125,
"epoch": 1.5147917844356509,
"grad_norm": 0.392511785030365,
"learning_rate": 1.6347116504326082e-05,
"loss": 0.30182077884674074,
"mean_token_accuracy": 0.9069562748074531,
"num_tokens": 25427874.0,
"step": 2010
},
{
"entropy": 0.2969482421875,
"epoch": 1.522328999434709,
"grad_norm": 0.4357432425022125,
"learning_rate": 1.630931509723554e-05,
"loss": 0.30153517723083495,
"mean_token_accuracy": 0.9072390154004097,
"num_tokens": 25554351.0,
"step": 2020
},
{
"entropy": 0.2900390625,
"epoch": 1.5298662144337667,
"grad_norm": 0.36660265922546387,
"learning_rate": 1.6271363312251253e-05,
"loss": 0.30401484966278075,
"mean_token_accuracy": 0.909621711075306,
"num_tokens": 25687339.0,
"step": 2030
},
{
"entropy": 0.291259765625,
"epoch": 1.5374034294328247,
"grad_norm": 0.3444574177265167,
"learning_rate": 1.6233262053926165e-05,
"loss": 0.29833531379699707,
"mean_token_accuracy": 0.9089738965034485,
"num_tokens": 25819705.0,
"step": 2040
},
{
"epoch": 1.5374034294328247,
"eval_entropy": 0.29168186417545183,
"eval_loss": 0.3090449571609497,
"eval_mean_token_accuracy": 0.9057694819856839,
"eval_num_tokens": 25819705.0,
"eval_runtime": 444.9473,
"eval_samples_per_second": 5.963,
"eval_steps_per_second": 1.492,
"step": 2040
},
{
"entropy": 0.286083984375,
"epoch": 1.5449406444318825,
"grad_norm": 0.3866405487060547,
"learning_rate": 1.6195012230375783e-05,
"loss": 0.29763362407684324,
"mean_token_accuracy": 0.9090174749493599,
"num_tokens": 25950997.0,
"step": 2050
},
{
"entropy": 0.279345703125,
"epoch": 1.5524778594309403,
"grad_norm": 0.39879608154296875,
"learning_rate": 1.6156614753256583e-05,
"loss": 0.2852219343185425,
"mean_token_accuracy": 0.9102980241179466,
"num_tokens": 26065033.0,
"step": 2060
},
{
"entropy": 0.2977294921875,
"epoch": 1.560015074429998,
"grad_norm": 0.4519115686416626,
"learning_rate": 1.6118070537744242e-05,
"loss": 0.3063497066497803,
"mean_token_accuracy": 0.9054354265332222,
"num_tokens": 26188501.0,
"step": 2070
},
{
"entropy": 0.305029296875,
"epoch": 1.567552289429056,
"grad_norm": 0.3860149383544922,
"learning_rate": 1.6079380502511846e-05,
"loss": 0.3170385122299194,
"mean_token_accuracy": 0.906504712998867,
"num_tokens": 26320550.0,
"step": 2080
},
{
"entropy": 0.2880859375,
"epoch": 1.5750895044281137,
"grad_norm": 0.4003013074398041,
"learning_rate": 1.6040545569707977e-05,
"loss": 0.29796886444091797,
"mean_token_accuracy": 0.907678847014904,
"num_tokens": 26439410.0,
"step": 2090
},
{
"entropy": 0.293212890625,
"epoch": 1.5826267194271717,
"grad_norm": 0.39812982082366943,
"learning_rate": 1.600156666493475e-05,
"loss": 0.3037936449050903,
"mean_token_accuracy": 0.9078080400824546,
"num_tokens": 26558486.0,
"step": 2100
},
{
"entropy": 0.2809814453125,
"epoch": 1.5901639344262295,
"grad_norm": 0.3826020658016205,
"learning_rate": 1.5962444717225753e-05,
"loss": 0.29529705047607424,
"mean_token_accuracy": 0.9107925236225128,
"num_tokens": 26690449.0,
"step": 2110
},
{
"entropy": 0.2869140625,
"epoch": 1.5977011494252875,
"grad_norm": 0.3772203326225281,
"learning_rate": 1.5923180659023883e-05,
"loss": 0.29066874980926516,
"mean_token_accuracy": 0.9094026356935501,
"num_tokens": 26824245.0,
"step": 2120
},
{
"entropy": 0.28427734375,
"epoch": 1.6052383644243453,
"grad_norm": 0.3734860122203827,
"learning_rate": 1.588377542615915e-05,
"loss": 0.2948519945144653,
"mean_token_accuracy": 0.908295425772667,
"num_tokens": 26951710.0,
"step": 2130
},
{
"entropy": 0.2827392578125,
"epoch": 1.612775579423403,
"grad_norm": 0.4289539158344269,
"learning_rate": 1.5844229957826347e-05,
"loss": 0.28623509407043457,
"mean_token_accuracy": 0.9114281222224235,
"num_tokens": 27081467.0,
"step": 2140
},
{
"entropy": 0.3018798828125,
"epoch": 1.620312794422461,
"grad_norm": 0.4174732565879822,
"learning_rate": 1.5804545196562683e-05,
"loss": 0.31496200561523435,
"mean_token_accuracy": 0.9058399319648742,
"num_tokens": 27213220.0,
"step": 2150
},
{
"entropy": 0.2672119140625,
"epoch": 1.6278500094215187,
"grad_norm": 0.3824097514152527,
"learning_rate": 1.5764722088225317e-05,
"loss": 0.2726640224456787,
"mean_token_accuracy": 0.9144431263208389,
"num_tokens": 27326671.0,
"step": 2160
},
{
"entropy": 0.3100341796875,
"epoch": 1.6353872244205765,
"grad_norm": 0.45335128903388977,
"learning_rate": 1.572476158196879e-05,
"loss": 0.3252666234970093,
"mean_token_accuracy": 0.9008206337690353,
"num_tokens": 27440284.0,
"step": 2170
},
{
"entropy": 0.28056640625,
"epoch": 1.6429244394196343,
"grad_norm": 0.3022969663143158,
"learning_rate": 1.568466463022245e-05,
"loss": 0.2954371452331543,
"mean_token_accuracy": 0.9110561206936836,
"num_tokens": 27559379.0,
"step": 2180
},
{
"entropy": 0.2784423828125,
"epoch": 1.6504616544186923,
"grad_norm": 0.3907804489135742,
"learning_rate": 1.5644432188667695e-05,
"loss": 0.2918686389923096,
"mean_token_accuracy": 0.9108302012085915,
"num_tokens": 27686989.0,
"step": 2190
},
{
"entropy": 0.2941162109375,
"epoch": 1.65799886941775,
"grad_norm": 0.35084792971611023,
"learning_rate": 1.560406521621524e-05,
"loss": 0.29794740676879883,
"mean_token_accuracy": 0.9107154473662377,
"num_tokens": 27820500.0,
"step": 2200
},
{
"entropy": 0.26474609375,
"epoch": 1.6655360844168081,
"grad_norm": 0.3820977807044983,
"learning_rate": 1.5563564674982235e-05,
"loss": 0.27836596965789795,
"mean_token_accuracy": 0.9123305752873421,
"num_tokens": 27932725.0,
"step": 2210
},
{
"epoch": 1.6655360844168081,
"eval_entropy": 0.28888454207454817,
"eval_loss": 0.30725526809692383,
"eval_mean_token_accuracy": 0.9062411828213427,
"eval_num_tokens": 27932725.0,
"eval_runtime": 444.1042,
"eval_samples_per_second": 5.974,
"eval_steps_per_second": 1.495,
"step": 2210
},
{
"entropy": 0.301220703125,
"epoch": 1.673073299415866,
"grad_norm": 0.41093695163726807,
"learning_rate": 1.5522931530269356e-05,
"loss": 0.3100571155548096,
"mean_token_accuracy": 0.9063948586583137,
"num_tokens": 28068236.0,
"step": 2220
},
{
"entropy": 0.2692626953125,
"epoch": 1.6806105144149237,
"grad_norm": 0.33717814087867737,
"learning_rate": 1.5482166750537777e-05,
"loss": 0.2845989942550659,
"mean_token_accuracy": 0.913370530307293,
"num_tokens": 28194718.0,
"step": 2230
},
{
"entropy": 0.310009765625,
"epoch": 1.6881477294139815,
"grad_norm": 0.43015503883361816,
"learning_rate": 1.54412713073861e-05,
"loss": 0.31532199382781984,
"mean_token_accuracy": 0.903562581539154,
"num_tokens": 28317717.0,
"step": 2240
},
{
"entropy": 0.2740234375,
"epoch": 1.6956849444130393,
"grad_norm": 0.3851742148399353,
"learning_rate": 1.5400246175527186e-05,
"loss": 0.2825237035751343,
"mean_token_accuracy": 0.9131973013281822,
"num_tokens": 28450059.0,
"step": 2250
},
{
"entropy": 0.270556640625,
"epoch": 1.703222159412097,
"grad_norm": 0.3782564401626587,
"learning_rate": 1.5359092332764938e-05,
"loss": 0.28100948333740233,
"mean_token_accuracy": 0.9127213463187218,
"num_tokens": 28577388.0,
"step": 2260
},
{
"entropy": 0.2857666015625,
"epoch": 1.710759374411155,
"grad_norm": 0.41269612312316895,
"learning_rate": 1.5317810759970996e-05,
"loss": 0.29292376041412355,
"mean_token_accuracy": 0.9088818147778511,
"num_tokens": 28708268.0,
"step": 2270
},
{
"entropy": 0.2853271484375,
"epoch": 1.718296589410213,
"grad_norm": 0.3992975354194641,
"learning_rate": 1.527640244106133e-05,
"loss": 0.29620723724365233,
"mean_token_accuracy": 0.9107150569558143,
"num_tokens": 28844273.0,
"step": 2280
},
{
"entropy": 0.282958984375,
"epoch": 1.725833804409271,
"grad_norm": 0.4681526720523834,
"learning_rate": 1.5234868362972832e-05,
"loss": 0.292909574508667,
"mean_token_accuracy": 0.9111030578613282,
"num_tokens": 28968218.0,
"step": 2290
},
{
"entropy": 0.263427734375,
"epoch": 1.7333710194083287,
"grad_norm": 0.38428157567977905,
"learning_rate": 1.5193209515639762e-05,
"loss": 0.2674442768096924,
"mean_token_accuracy": 0.914100530743599,
"num_tokens": 29089112.0,
"step": 2300
},
{
"entropy": 0.2892822265625,
"epoch": 1.7409082344073865,
"grad_norm": 0.40929433703422546,
"learning_rate": 1.5151426891970168e-05,
"loss": 0.29194159507751466,
"mean_token_accuracy": 0.9096132263541221,
"num_tokens": 29218950.0,
"step": 2310
},
{
"entropy": 0.2778564453125,
"epoch": 1.7484454494064443,
"grad_norm": 0.3487510681152344,
"learning_rate": 1.5109521487822208e-05,
"loss": 0.294701361656189,
"mean_token_accuracy": 0.9104762703180314,
"num_tokens": 29354082.0,
"step": 2320
},
{
"entropy": 0.2981201171875,
"epoch": 1.755982664405502,
"grad_norm": 0.4178600311279297,
"learning_rate": 1.5067494301980427e-05,
"loss": 0.3012765169143677,
"mean_token_accuracy": 0.9065235763788223,
"num_tokens": 29488709.0,
"step": 2330
},
{
"entropy": 0.2984375,
"epoch": 1.76351987940456,
"grad_norm": 0.39268913865089417,
"learning_rate": 1.5025346336131955e-05,
"loss": 0.314531946182251,
"mean_token_accuracy": 0.9063766539096832,
"num_tokens": 29618043.0,
"step": 2340
},
{
"entropy": 0.2891845703125,
"epoch": 1.771057094403618,
"grad_norm": 0.5101540088653564,
"learning_rate": 1.4983078594842608e-05,
"loss": 0.29479122161865234,
"mean_token_accuracy": 0.9087283477187157,
"num_tokens": 29742122.0,
"step": 2350
},
{
"entropy": 0.2698974609375,
"epoch": 1.7785943094026757,
"grad_norm": 0.40157949924468994,
"learning_rate": 1.494069208553298e-05,
"loss": 0.277575945854187,
"mean_token_accuracy": 0.9128099977970123,
"num_tokens": 29872789.0,
"step": 2360
},
{
"entropy": 0.2943603515625,
"epoch": 1.7861315244017335,
"grad_norm": 0.35253477096557617,
"learning_rate": 1.4898187818454401e-05,
"loss": 0.2952854633331299,
"mean_token_accuracy": 0.9069695189595223,
"num_tokens": 29996632.0,
"step": 2370
},
{
"entropy": 0.283447265625,
"epoch": 1.7936687394007915,
"grad_norm": 0.394357830286026,
"learning_rate": 1.4855566806664874e-05,
"loss": 0.29858076572418213,
"mean_token_accuracy": 0.9087747976183891,
"num_tokens": 30115734.0,
"step": 2380
},
{
"epoch": 1.7936687394007915,
"eval_entropy": 0.2916524496423193,
"eval_loss": 0.30516064167022705,
"eval_mean_token_accuracy": 0.9064356250217162,
"eval_num_tokens": 30115734.0,
"eval_runtime": 444.5117,
"eval_samples_per_second": 5.968,
"eval_steps_per_second": 1.494,
"step": 2380
},
{
"entropy": 0.28697509765625,
"epoch": 1.8012059543998493,
"grad_norm": 0.33769169449806213,
"learning_rate": 1.481283006600493e-05,
"loss": 0.29146175384521483,
"mean_token_accuracy": 0.9108529061079025,
"num_tokens": 30251060.0,
"step": 2390
},
{
"entropy": 0.2843994140625,
"epoch": 1.8087431693989071,
"grad_norm": 0.3985027074813843,
"learning_rate": 1.4769978615073406e-05,
"loss": 0.2936448574066162,
"mean_token_accuracy": 0.9098766788840293,
"num_tokens": 30373308.0,
"step": 2400
},
{
"entropy": 0.27158203125,
"epoch": 1.816280384397965,
"grad_norm": 0.4366515278816223,
"learning_rate": 1.4727013475203182e-05,
"loss": 0.27635395526885986,
"mean_token_accuracy": 0.9137975901365281,
"num_tokens": 30504411.0,
"step": 2410
},
{
"entropy": 0.26373291015625,
"epoch": 1.8238175993970227,
"grad_norm": 0.35052821040153503,
"learning_rate": 1.4683935670436824e-05,
"loss": 0.2652280330657959,
"mean_token_accuracy": 0.9151029929518699,
"num_tokens": 30630360.0,
"step": 2420
},
{
"entropy": 0.29560546875,
"epoch": 1.8313548143960805,
"grad_norm": 0.33174508810043335,
"learning_rate": 1.464074622750219e-05,
"loss": 0.3035954713821411,
"mean_token_accuracy": 0.9070772379636765,
"num_tokens": 30764034.0,
"step": 2430
},
{
"entropy": 0.2862060546875,
"epoch": 1.8388920293951385,
"grad_norm": 0.418497771024704,
"learning_rate": 1.4597446175787944e-05,
"loss": 0.29122745990753174,
"mean_token_accuracy": 0.9084449097514152,
"num_tokens": 30889656.0,
"step": 2440
},
{
"entropy": 0.27470703125,
"epoch": 1.8464292443941963,
"grad_norm": 0.30565425753593445,
"learning_rate": 1.4554036547319033e-05,
"loss": 0.277424955368042,
"mean_token_accuracy": 0.9113439500331879,
"num_tokens": 31019827.0,
"step": 2450
},
{
"entropy": 0.27275390625,
"epoch": 1.8539664593932543,
"grad_norm": 0.43941381573677063,
"learning_rate": 1.4510518376732081e-05,
"loss": 0.2832863092422485,
"mean_token_accuracy": 0.9118362620472908,
"num_tokens": 31154827.0,
"step": 2460
},
{
"entropy": 0.2802734375,
"epoch": 1.8615036743923121,
"grad_norm": 0.41547101736068726,
"learning_rate": 1.4466892701250745e-05,
"loss": 0.286260986328125,
"mean_token_accuracy": 0.911260911822319,
"num_tokens": 31287561.0,
"step": 2470
},
{
"entropy": 0.28837890625,
"epoch": 1.86904088939137,
"grad_norm": 0.34127259254455566,
"learning_rate": 1.4423160560660972e-05,
"loss": 0.30336732864379884,
"mean_token_accuracy": 0.9074774295091629,
"num_tokens": 31420717.0,
"step": 2480
},
{
"entropy": 0.2842529296875,
"epoch": 1.8765781043904277,
"grad_norm": 0.4352460503578186,
"learning_rate": 1.4379322997286228e-05,
"loss": 0.29042506217956543,
"mean_token_accuracy": 0.9101185172796249,
"num_tokens": 31543657.0,
"step": 2490
},
{
"entropy": 0.308984375,
"epoch": 1.8841153193894855,
"grad_norm": 0.37729454040527344,
"learning_rate": 1.4335381055962657e-05,
"loss": 0.32251315116882323,
"mean_token_accuracy": 0.9027933478355408,
"num_tokens": 31672685.0,
"step": 2500
},
{
"entropy": 0.2936279296875,
"epoch": 1.8916525343885433,
"grad_norm": 0.38765987753868103,
"learning_rate": 1.4291335784014173e-05,
"loss": 0.2984729766845703,
"mean_token_accuracy": 0.9071457028388977,
"num_tokens": 31794684.0,
"step": 2510
},
{
"entropy": 0.2948486328125,
"epoch": 1.8991897493876013,
"grad_norm": 0.39258772134780884,
"learning_rate": 1.42471882312275e-05,
"loss": 0.30484049320220946,
"mean_token_accuracy": 0.9063387095928193,
"num_tokens": 31915478.0,
"step": 2520
},
{
"entropy": 0.2870849609375,
"epoch": 1.9067269643866591,
"grad_norm": 0.3371396064758301,
"learning_rate": 1.4202939449827149e-05,
"loss": 0.30141425132751465,
"mean_token_accuracy": 0.9095958784222603,
"num_tokens": 32040746.0,
"step": 2530
},
{
"entropy": 0.2741943359375,
"epoch": 1.9142641793857171,
"grad_norm": 0.4031423032283783,
"learning_rate": 1.4158590494450344e-05,
"loss": 0.2807930946350098,
"mean_token_accuracy": 0.9128145009279252,
"num_tokens": 32169569.0,
"step": 2540
},
{
"entropy": 0.2891357421875,
"epoch": 1.921801394384775,
"grad_norm": 0.37120503187179565,
"learning_rate": 1.4114142422121879e-05,
"loss": 0.2933060646057129,
"mean_token_accuracy": 0.908392770588398,
"num_tokens": 32296584.0,
"step": 2550
},
{
"epoch": 1.921801394384775,
"eval_entropy": 0.2865328501506024,
"eval_loss": 0.3034323453903198,
"eval_mean_token_accuracy": 0.9070448785661215,
"eval_num_tokens": 32296584.0,
"eval_runtime": 444.775,
"eval_samples_per_second": 5.965,
"eval_steps_per_second": 1.493,
"step": 2550
},
{
"entropy": 0.2989990234375,
"epoch": 1.9293386093838327,
"grad_norm": 0.40673521161079407,
"learning_rate": 1.406959629222893e-05,
"loss": 0.3103364944458008,
"mean_token_accuracy": 0.9063321113586426,
"num_tokens": 32428504.0,
"step": 2560
},
{
"entropy": 0.2962646484375,
"epoch": 1.9368758243828905,
"grad_norm": 0.3941977322101593,
"learning_rate": 1.40249531664958e-05,
"loss": 0.30964858531951905,
"mean_token_accuracy": 0.9068703219294548,
"num_tokens": 32556407.0,
"step": 2570
},
{
"entropy": 0.2732666015625,
"epoch": 1.9444130393819483,
"grad_norm": 0.4122161567211151,
"learning_rate": 1.3980214108958626e-05,
"loss": 0.27610068321228026,
"mean_token_accuracy": 0.9125834852457047,
"num_tokens": 32679188.0,
"step": 2580
},
{
"entropy": 0.252587890625,
"epoch": 1.9519502543810061,
"grad_norm": 0.31762272119522095,
"learning_rate": 1.3935380185939992e-05,
"loss": 0.26145143508911134,
"mean_token_accuracy": 0.9161947175860405,
"num_tokens": 32806126.0,
"step": 2590
},
{
"entropy": 0.28642578125,
"epoch": 1.959487469380064,
"grad_norm": 0.37945154309272766,
"learning_rate": 1.3890452466023545e-05,
"loss": 0.29998881816864015,
"mean_token_accuracy": 0.908545869588852,
"num_tokens": 32928860.0,
"step": 2600
},
{
"entropy": 0.2949462890625,
"epoch": 1.967024684379122,
"grad_norm": 0.39361295104026794,
"learning_rate": 1.3845432020028511e-05,
"loss": 0.30800106525421145,
"mean_token_accuracy": 0.9073520034551621,
"num_tokens": 33065049.0,
"step": 2610
},
{
"entropy": 0.3162109375,
"epoch": 1.9745618993781797,
"grad_norm": 0.411302387714386,
"learning_rate": 1.380031992098417e-05,
"loss": 0.33235788345336914,
"mean_token_accuracy": 0.9015798211097718,
"num_tokens": 33199078.0,
"step": 2620
},
{
"entropy": 0.2697021484375,
"epoch": 1.9820991143772377,
"grad_norm": 0.42348551750183105,
"learning_rate": 1.3755117244104282e-05,
"loss": 0.27779905796051024,
"mean_token_accuracy": 0.9132746890187263,
"num_tokens": 33326852.0,
"step": 2630
},
{
"entropy": 0.2989501953125,
"epoch": 1.9896363293762955,
"grad_norm": 0.3523179888725281,
"learning_rate": 1.370982506676147e-05,
"loss": 0.3090573787689209,
"mean_token_accuracy": 0.907941748201847,
"num_tokens": 33465412.0,
"step": 2640
},
{
"entropy": 0.289208984375,
"epoch": 1.9971735443753533,
"grad_norm": 0.3901941180229187,
"learning_rate": 1.3664444468461537e-05,
"loss": 0.30592546463012693,
"mean_token_accuracy": 0.9097454324364662,
"num_tokens": 33594937.0,
"step": 2650
},
{
"entropy": 0.2732121394230769,
"epoch": 2.0045223289994345,
"grad_norm": 0.42783066630363464,
"learning_rate": 1.3618976530817727e-05,
"loss": 0.27013728618621824,
"mean_token_accuracy": 0.915503862576607,
"num_tokens": 33713476.0,
"step": 2660
},
{
"entropy": 0.265283203125,
"epoch": 2.0120595439984927,
"grad_norm": 0.3797246217727661,
"learning_rate": 1.3573422337524953e-05,
"loss": 0.27342140674591064,
"mean_token_accuracy": 0.9139280915260315,
"num_tokens": 33841244.0,
"step": 2670
},
{
"entropy": 0.2574951171875,
"epoch": 2.0195967589975505,
"grad_norm": 0.4094177484512329,
"learning_rate": 1.3527782974333978e-05,
"loss": 0.26642181873321535,
"mean_token_accuracy": 0.917819993197918,
"num_tokens": 33965783.0,
"step": 2680
},
{
"entropy": 0.2673828125,
"epoch": 2.0271339739966083,
"grad_norm": 0.49123308062553406,
"learning_rate": 1.3482059529025517e-05,
"loss": 0.272041392326355,
"mean_token_accuracy": 0.9136370241641998,
"num_tokens": 34084425.0,
"step": 2690
},
{
"entropy": 0.2714599609375,
"epoch": 2.034671188995666,
"grad_norm": 0.38243553042411804,
"learning_rate": 1.3436253091384321e-05,
"loss": 0.28252534866333007,
"mean_token_accuracy": 0.9118999525904655,
"num_tokens": 34206356.0,
"step": 2700
},
{
"entropy": 0.2743896484375,
"epoch": 2.042208403994724,
"grad_norm": 0.4383077919483185,
"learning_rate": 1.3390364753173206e-05,
"loss": 0.2724027633666992,
"mean_token_accuracy": 0.9126274734735489,
"num_tokens": 34326720.0,
"step": 2710
},
{
"entropy": 0.264013671875,
"epoch": 2.0497456189937817,
"grad_norm": 0.42032304406166077,
"learning_rate": 1.3344395608107032e-05,
"loss": 0.27180933952331543,
"mean_token_accuracy": 0.9154068097472191,
"num_tokens": 34449082.0,
"step": 2720
},
{
"epoch": 2.0497456189937817,
"eval_entropy": 0.2703239716679217,
"eval_loss": 0.30382418632507324,
"eval_mean_token_accuracy": 0.9076029673577791,
"eval_num_tokens": 34449082.0,
"eval_runtime": 444.9112,
"eval_samples_per_second": 5.963,
"eval_steps_per_second": 1.492,
"step": 2720
},
{
"entropy": 0.25732421875,
"epoch": 2.0572828339928395,
"grad_norm": 0.4523007571697235,
"learning_rate": 1.3298346751826624e-05,
"loss": 0.2659280300140381,
"mean_token_accuracy": 0.9151400104165077,
"num_tokens": 34574314.0,
"step": 2730
},
{
"entropy": 0.2736328125,
"epoch": 2.0648200489918973,
"grad_norm": 0.43264201283454895,
"learning_rate": 1.3252219281872663e-05,
"loss": 0.27533228397369386,
"mean_token_accuracy": 0.9147139310836792,
"num_tokens": 34694661.0,
"step": 2740
},
{
"entropy": 0.25009765625,
"epoch": 2.0723572639909555,
"grad_norm": 0.38429099321365356,
"learning_rate": 1.3206014297659538e-05,
"loss": 0.25780477523803713,
"mean_token_accuracy": 0.9180345565080643,
"num_tokens": 34821985.0,
"step": 2750
},
{
"entropy": 0.2557861328125,
"epoch": 2.0798944789900133,
"grad_norm": 0.40265947580337524,
"learning_rate": 1.315973290044913e-05,
"loss": 0.26505556106567385,
"mean_token_accuracy": 0.9161929801106453,
"num_tokens": 34946746.0,
"step": 2760
},
{
"entropy": 0.274853515625,
"epoch": 2.087431693989071,
"grad_norm": 0.3728543519973755,
"learning_rate": 1.3113376193324564e-05,
"loss": 0.2775618314743042,
"mean_token_accuracy": 0.9146954879164696,
"num_tokens": 35084683.0,
"step": 2770
},
{
"entropy": 0.26063232421875,
"epoch": 2.094968908988129,
"grad_norm": 0.4594137668609619,
"learning_rate": 1.3066945281163923e-05,
"loss": 0.2669402837753296,
"mean_token_accuracy": 0.9168649092316628,
"num_tokens": 35207447.0,
"step": 2780
},
{
"entropy": 0.267236328125,
"epoch": 2.1025061239871867,
"grad_norm": 0.4985879063606262,
"learning_rate": 1.302044127061392e-05,
"loss": 0.2751408815383911,
"mean_token_accuracy": 0.912787701189518,
"num_tokens": 35325558.0,
"step": 2790
},
{
"entropy": 0.26943359375,
"epoch": 2.1100433389862445,
"grad_norm": 0.45133885741233826,
"learning_rate": 1.2973865270063501e-05,
"loss": 0.27563629150390623,
"mean_token_accuracy": 0.9126975074410438,
"num_tokens": 35451140.0,
"step": 2800
},
{
"entropy": 0.2789306640625,
"epoch": 2.1175805539853023,
"grad_norm": 0.42350032925605774,
"learning_rate": 1.2927218389617452e-05,
"loss": 0.28734893798828126,
"mean_token_accuracy": 0.911960031092167,
"num_tokens": 35567497.0,
"step": 2810
},
{
"entropy": 0.255517578125,
"epoch": 2.12511776898436,
"grad_norm": 0.4202309548854828,
"learning_rate": 1.2880501741069931e-05,
"loss": 0.2654577255249023,
"mean_token_accuracy": 0.9167904317378998,
"num_tokens": 35695050.0,
"step": 2820
},
{
"entropy": 0.23223876953125,
"epoch": 2.132654983983418,
"grad_norm": 0.44368067383766174,
"learning_rate": 1.2833716437877952e-05,
"loss": 0.23806145191192626,
"mean_token_accuracy": 0.9233140185475349,
"num_tokens": 35822236.0,
"step": 2830
},
{
"entropy": 0.2786865234375,
"epoch": 2.140192198982476,
"grad_norm": 0.40076377987861633,
"learning_rate": 1.278686359513488e-05,
"loss": 0.2845803737640381,
"mean_token_accuracy": 0.9122401431202889,
"num_tokens": 35958799.0,
"step": 2840
},
{
"entropy": 0.2666748046875,
"epoch": 2.147729413981534,
"grad_norm": 0.4162449538707733,
"learning_rate": 1.2739944329543818e-05,
"loss": 0.274515962600708,
"mean_token_accuracy": 0.9145516887307167,
"num_tokens": 36083078.0,
"step": 2850
},
{
"entropy": 0.252099609375,
"epoch": 2.1552666289805917,
"grad_norm": 0.41252174973487854,
"learning_rate": 1.2692959759391027e-05,
"loss": 0.2631190299987793,
"mean_token_accuracy": 0.9182503208518028,
"num_tokens": 36203301.0,
"step": 2860
},
{
"entropy": 0.2442626953125,
"epoch": 2.1628038439796495,
"grad_norm": 0.47404617071151733,
"learning_rate": 1.2645911004519246e-05,
"loss": 0.250153923034668,
"mean_token_accuracy": 0.9218041867017746,
"num_tokens": 36337562.0,
"step": 2870
},
{
"entropy": 0.2638671875,
"epoch": 2.1703410589787073,
"grad_norm": 0.44618526101112366,
"learning_rate": 1.2598799186301003e-05,
"loss": 0.26806776523590087,
"mean_token_accuracy": 0.9138118460774421,
"num_tokens": 36451609.0,
"step": 2880
},
{
"entropy": 0.2649169921875,
"epoch": 2.177878273977765,
"grad_norm": 0.4570532441139221,
"learning_rate": 1.2551625427611907e-05,
"loss": 0.27152099609375,
"mean_token_accuracy": 0.9154557690024376,
"num_tokens": 36578083.0,
"step": 2890
},
{
"epoch": 2.177878273977765,
"eval_entropy": 0.2681899472891566,
"eval_loss": 0.3028174340724945,
"eval_mean_token_accuracy": 0.9079541289303676,
"eval_num_tokens": 36578083.0,
"eval_runtime": 445.3242,
"eval_samples_per_second": 5.957,
"eval_steps_per_second": 1.491,
"step": 2890
},
{
"entropy": 0.2643310546875,
"epoch": 2.185415488976823,
"grad_norm": 0.4730449318885803,
"learning_rate": 1.2504390852803863e-05,
"loss": 0.2764227867126465,
"mean_token_accuracy": 0.9145638346672058,
"num_tokens": 36710742.0,
"step": 2900
},
{
"entropy": 0.2716796875,
"epoch": 2.1929527039758807,
"grad_norm": 0.4901706576347351,
"learning_rate": 1.245709658767829e-05,
"loss": 0.2783637523651123,
"mean_token_accuracy": 0.913567054271698,
"num_tokens": 36829782.0,
"step": 2910
},
{
"entropy": 0.273779296875,
"epoch": 2.200489918974939,
"grad_norm": 0.47092169523239136,
"learning_rate": 1.2409743759459275e-05,
"loss": 0.28058323860168455,
"mean_token_accuracy": 0.9126289084553718,
"num_tokens": 36957582.0,
"step": 2920
},
{
"entropy": 0.24866943359375,
"epoch": 2.2080271339739967,
"grad_norm": 0.43678930401802063,
"learning_rate": 1.2362333496766718e-05,
"loss": 0.249833345413208,
"mean_token_accuracy": 0.9209662929177285,
"num_tokens": 37090946.0,
"step": 2930
},
{
"entropy": 0.2679443359375,
"epoch": 2.2155643489730545,
"grad_norm": 0.44983765482902527,
"learning_rate": 1.2314866929589434e-05,
"loss": 0.281503963470459,
"mean_token_accuracy": 0.9136047154664994,
"num_tokens": 37226066.0,
"step": 2940
},
{
"entropy": 0.2578369140625,
"epoch": 2.2231015639721123,
"grad_norm": 0.4278606176376343,
"learning_rate": 1.2267345189258197e-05,
"loss": 0.26151697635650634,
"mean_token_accuracy": 0.917884474992752,
"num_tokens": 37348841.0,
"step": 2950
},
{
"entropy": 0.255615234375,
"epoch": 2.23063877897117,
"grad_norm": 0.38196465373039246,
"learning_rate": 1.2219769408418809e-05,
"loss": 0.26131410598754884,
"mean_token_accuracy": 0.9185866966843605,
"num_tokens": 37485128.0,
"step": 2960
},
{
"entropy": 0.282373046875,
"epoch": 2.238175993970228,
"grad_norm": 0.4476567208766937,
"learning_rate": 1.217214072100508e-05,
"loss": 0.2837507963180542,
"mean_token_accuracy": 0.9103922292590141,
"num_tokens": 37614342.0,
"step": 2970
},
{
"entropy": 0.279638671875,
"epoch": 2.2457132089692857,
"grad_norm": 0.45457765460014343,
"learning_rate": 1.2124460262211808e-05,
"loss": 0.29149446487426756,
"mean_token_accuracy": 0.9109927758574485,
"num_tokens": 37745788.0,
"step": 2980
},
{
"entropy": 0.27572021484375,
"epoch": 2.2532504239683435,
"grad_norm": 0.46303901076316833,
"learning_rate": 1.2076729168467733e-05,
"loss": 0.28504157066345215,
"mean_token_accuracy": 0.9117044806480408,
"num_tokens": 37874375.0,
"step": 2990
},
{
"entropy": 0.2697509765625,
"epoch": 2.2607876389674013,
"grad_norm": 0.5162591934204102,
"learning_rate": 1.202894857740843e-05,
"loss": 0.27514770030975344,
"mean_token_accuracy": 0.9141019478440284,
"num_tokens": 38003944.0,
"step": 3000
},
{
"entropy": 0.27939453125,
"epoch": 2.2683248539664596,
"grad_norm": 0.3618636727333069,
"learning_rate": 1.1981119627849213e-05,
"loss": 0.28610208034515383,
"mean_token_accuracy": 0.9116652965545654,
"num_tokens": 38140440.0,
"step": 3010
},
{
"entropy": 0.25126953125,
"epoch": 2.2758620689655173,
"grad_norm": 0.45818719267845154,
"learning_rate": 1.1933243459757987e-05,
"loss": 0.25659780502319335,
"mean_token_accuracy": 0.9194882601499558,
"num_tokens": 38266675.0,
"step": 3020
},
{
"entropy": 0.277490234375,
"epoch": 2.283399283964575,
"grad_norm": 0.4702519476413727,
"learning_rate": 1.1885321214228065e-05,
"loss": 0.285460376739502,
"mean_token_accuracy": 0.91060761064291,
"num_tokens": 38373564.0,
"step": 3030
},
{
"entropy": 0.2642333984375,
"epoch": 2.290936498963633,
"grad_norm": 0.415840744972229,
"learning_rate": 1.1837354033451e-05,
"loss": 0.26558847427368165,
"mean_token_accuracy": 0.9156399607658386,
"num_tokens": 38498699.0,
"step": 3040
},
{
"entropy": 0.27161865234375,
"epoch": 2.2984737139626907,
"grad_norm": 0.42131829261779785,
"learning_rate": 1.178934306068933e-05,
"loss": 0.27293484210968016,
"mean_token_accuracy": 0.9125606477260589,
"num_tokens": 38628016.0,
"step": 3050
},
{
"entropy": 0.2598876953125,
"epoch": 2.3060109289617485,
"grad_norm": 0.4538854658603668,
"learning_rate": 1.1741289440249342e-05,
"loss": 0.26241345405578614,
"mean_token_accuracy": 0.9170191511511803,
"num_tokens": 38754104.0,
"step": 3060
},
{
"epoch": 2.3060109289617485,
"eval_entropy": 0.26989010730421686,
"eval_loss": 0.3018670380115509,
"eval_mean_token_accuracy": 0.9079400467046772,
"eval_num_tokens": 38754104.0,
"eval_runtime": 445.3089,
"eval_samples_per_second": 5.958,
"eval_steps_per_second": 1.491,
"step": 3060
},
{
"entropy": 0.2600341796875,
"epoch": 2.3135481439608063,
"grad_norm": 0.42576491832733154,
"learning_rate": 1.1693194317453809e-05,
"loss": 0.2762170314788818,
"mean_token_accuracy": 0.9149327039718628,
"num_tokens": 38887576.0,
"step": 3070
},
{
"entropy": 0.2461669921875,
"epoch": 2.3210853589598646,
"grad_norm": 0.36997467279434204,
"learning_rate": 1.1645058838614676e-05,
"loss": 0.2484156608581543,
"mean_token_accuracy": 0.9216334640979766,
"num_tokens": 39020182.0,
"step": 3080
},
{
"entropy": 0.26444091796875,
"epoch": 2.3286225739589224,
"grad_norm": 0.4386986792087555,
"learning_rate": 1.1596884151005743e-05,
"loss": 0.2760676383972168,
"mean_token_accuracy": 0.9157780781388283,
"num_tokens": 39141193.0,
"step": 3090
},
{
"entropy": 0.2866455078125,
"epoch": 2.33615978895798,
"grad_norm": 0.42354196310043335,
"learning_rate": 1.1548671402835325e-05,
"loss": 0.29737937450408936,
"mean_token_accuracy": 0.9101170405745507,
"num_tokens": 39269837.0,
"step": 3100
},
{
"entropy": 0.2653564453125,
"epoch": 2.343697003957038,
"grad_norm": 0.4202589690685272,
"learning_rate": 1.1500421743218885e-05,
"loss": 0.27224156856536863,
"mean_token_accuracy": 0.9151485860347748,
"num_tokens": 39397814.0,
"step": 3110
},
{
"entropy": 0.2645751953125,
"epoch": 2.3512342189560957,
"grad_norm": 0.4046901762485504,
"learning_rate": 1.145213632215164e-05,
"loss": 0.2657832384109497,
"mean_token_accuracy": 0.9154883936047554,
"num_tokens": 39524638.0,
"step": 3120
},
{
"entropy": 0.2693115234375,
"epoch": 2.3587714339551535,
"grad_norm": 0.44271120429039,
"learning_rate": 1.1403816290481148e-05,
"loss": 0.2753964185714722,
"mean_token_accuracy": 0.9133884340524674,
"num_tokens": 39661551.0,
"step": 3130
},
{
"entropy": 0.2556884765625,
"epoch": 2.3663086489542113,
"grad_norm": 0.4109664261341095,
"learning_rate": 1.1355462799879903e-05,
"loss": 0.25953586101531984,
"mean_token_accuracy": 0.9173814952373505,
"num_tokens": 39776450.0,
"step": 3140
},
{
"entropy": 0.2528076171875,
"epoch": 2.373845863953269,
"grad_norm": 0.4666280150413513,
"learning_rate": 1.1307077002817853e-05,
"loss": 0.26098630428314207,
"mean_token_accuracy": 0.9175211057066918,
"num_tokens": 39903858.0,
"step": 3150
},
{
"entropy": 0.2533935546875,
"epoch": 2.381383078952327,
"grad_norm": 0.43249785900115967,
"learning_rate": 1.125866005253495e-05,
"loss": 0.2545808792114258,
"mean_token_accuracy": 0.9177893921732903,
"num_tokens": 40039159.0,
"step": 3160
},
{
"entropy": 0.273388671875,
"epoch": 2.3889202939513847,
"grad_norm": 0.4109291136264801,
"learning_rate": 1.1210213103013666e-05,
"loss": 0.2860630750656128,
"mean_token_accuracy": 0.9107137665152549,
"num_tokens": 40163427.0,
"step": 3170
},
{
"entropy": 0.2639892578125,
"epoch": 2.396457508950443,
"grad_norm": 0.498600572347641,
"learning_rate": 1.1161737308951473e-05,
"loss": 0.27160656452178955,
"mean_token_accuracy": 0.9145796820521355,
"num_tokens": 40290261.0,
"step": 3180
},
{
"entropy": 0.27569580078125,
"epoch": 2.4039947239495008,
"grad_norm": 0.459117591381073,
"learning_rate": 1.1113233825733342e-05,
"loss": 0.27838788032531736,
"mean_token_accuracy": 0.9126795575022697,
"num_tokens": 40419601.0,
"step": 3190
},
{
"entropy": 0.2720947265625,
"epoch": 2.4115319389485586,
"grad_norm": 0.4818122982978821,
"learning_rate": 1.1064703809404185e-05,
"loss": 0.28298871517181395,
"mean_token_accuracy": 0.9107334464788437,
"num_tokens": 40534638.0,
"step": 3200
},
{
"entropy": 0.293701171875,
"epoch": 2.4190691539476163,
"grad_norm": 0.40891212224960327,
"learning_rate": 1.1016148416641321e-05,
"loss": 0.3044193983078003,
"mean_token_accuracy": 0.9071599930524826,
"num_tokens": 40663606.0,
"step": 3210
},
{
"entropy": 0.2436767578125,
"epoch": 2.426606368946674,
"grad_norm": 0.4774790406227112,
"learning_rate": 1.096756880472689e-05,
"loss": 0.24657707214355468,
"mean_token_accuracy": 0.9199987560510635,
"num_tokens": 40781780.0,
"step": 3220
},
{
"entropy": 0.27978515625,
"epoch": 2.434143583945732,
"grad_norm": 0.4053128957748413,
"learning_rate": 1.0918966131520276e-05,
"loss": 0.2862666606903076,
"mean_token_accuracy": 0.9118180349469185,
"num_tokens": 40916833.0,
"step": 3230
},
{
"epoch": 2.434143583945732,
"eval_entropy": 0.2733654343938253,
"eval_loss": 0.30075809359550476,
"eval_mean_token_accuracy": 0.9080868976482426,
"eval_num_tokens": 40916833.0,
"eval_runtime": 445.2814,
"eval_samples_per_second": 5.958,
"eval_steps_per_second": 1.491,
"step": 3230
},
{
"entropy": 0.268994140625,
"epoch": 2.4416807989447897,
"grad_norm": 0.4496704936027527,
"learning_rate": 1.0870341555430524e-05,
"loss": 0.27509455680847167,
"mean_token_accuracy": 0.9132101371884346,
"num_tokens": 41037216.0,
"step": 3240
},
{
"entropy": 0.265087890625,
"epoch": 2.449218013943848,
"grad_norm": 0.45039892196655273,
"learning_rate": 1.0821696235388704e-05,
"loss": 0.2819454908370972,
"mean_token_accuracy": 0.9132270663976669,
"num_tokens": 41158606.0,
"step": 3250
},
{
"entropy": 0.2676513671875,
"epoch": 2.4567552289429058,
"grad_norm": 0.4146597385406494,
"learning_rate": 1.0773031330820313e-05,
"loss": 0.26915433406829836,
"mean_token_accuracy": 0.915351215004921,
"num_tokens": 41279915.0,
"step": 3260
},
{
"entropy": 0.282275390625,
"epoch": 2.4642924439419636,
"grad_norm": 0.3807780146598816,
"learning_rate": 1.0724348001617626e-05,
"loss": 0.29516355991363524,
"mean_token_accuracy": 0.910530948638916,
"num_tokens": 41417857.0,
"step": 3270
},
{
"entropy": 0.270166015625,
"epoch": 2.4718296589410214,
"grad_norm": 0.4073243737220764,
"learning_rate": 1.0675647408112055e-05,
"loss": 0.27692787647247313,
"mean_token_accuracy": 0.9140403926372528,
"num_tokens": 41543296.0,
"step": 3280
},
{
"entropy": 0.2533935546875,
"epoch": 2.479366873940079,
"grad_norm": 0.4855513572692871,
"learning_rate": 1.0626930711046499e-05,
"loss": 0.26345822811126707,
"mean_token_accuracy": 0.9178490027785301,
"num_tokens": 41665526.0,
"step": 3290
},
{
"entropy": 0.2848876953125,
"epoch": 2.486904088939137,
"grad_norm": 0.40497887134552,
"learning_rate": 1.0578199071547666e-05,
"loss": 0.2959612846374512,
"mean_token_accuracy": 0.9122223347425461,
"num_tokens": 41798895.0,
"step": 3300
},
{
"entropy": 0.2606201171875,
"epoch": 2.4944413039381947,
"grad_norm": 0.4320884644985199,
"learning_rate": 1.0529453651098414e-05,
"loss": 0.2592708826065063,
"mean_token_accuracy": 0.9175490200519562,
"num_tokens": 41924273.0,
"step": 3310
},
{
"entropy": 0.25693359375,
"epoch": 2.5019785189372525,
"grad_norm": 0.4300364851951599,
"learning_rate": 1.0480695611510052e-05,
"loss": 0.2722728967666626,
"mean_token_accuracy": 0.9149225175380706,
"num_tokens": 42050422.0,
"step": 3320
},
{
"entropy": 0.2692626953125,
"epoch": 2.5095157339363103,
"grad_norm": 0.381966233253479,
"learning_rate": 1.0431926114894666e-05,
"loss": 0.2769562482833862,
"mean_token_accuracy": 0.9167289510369301,
"num_tokens": 42182717.0,
"step": 3330
},
{
"entropy": 0.2641357421875,
"epoch": 2.517052948935368,
"grad_norm": 0.4619712233543396,
"learning_rate": 1.0383146323637403e-05,
"loss": 0.2671494007110596,
"mean_token_accuracy": 0.9168986156582832,
"num_tokens": 42309826.0,
"step": 3340
},
{
"entropy": 0.2777099609375,
"epoch": 2.5245901639344264,
"grad_norm": 0.45539072155952454,
"learning_rate": 1.0334357400368777e-05,
"loss": 0.2854647159576416,
"mean_token_accuracy": 0.9126088574528695,
"num_tokens": 42433368.0,
"step": 3350
},
{
"entropy": 0.26806640625,
"epoch": 2.532127378933484,
"grad_norm": 0.4394124448299408,
"learning_rate": 1.0285560507936962e-05,
"loss": 0.2735744953155518,
"mean_token_accuracy": 0.9150983482599259,
"num_tokens": 42554101.0,
"step": 3360
},
{
"entropy": 0.2348876953125,
"epoch": 2.539664593932542,
"grad_norm": 0.47088930010795593,
"learning_rate": 1.023675680938007e-05,
"loss": 0.24447669982910156,
"mean_token_accuracy": 0.9219925120472908,
"num_tokens": 42677888.0,
"step": 3370
},
{
"entropy": 0.2652587890625,
"epoch": 2.5472018089315998,
"grad_norm": 0.4078092873096466,
"learning_rate": 1.0187947467898425e-05,
"loss": 0.2711235284805298,
"mean_token_accuracy": 0.916148230433464,
"num_tokens": 42810838.0,
"step": 3380
},
{
"entropy": 0.27083740234375,
"epoch": 2.5547390239306575,
"grad_norm": 0.3476676344871521,
"learning_rate": 1.0139133646826854e-05,
"loss": 0.27367372512817384,
"mean_token_accuracy": 0.914184220135212,
"num_tokens": 42940004.0,
"step": 3390
},
{
"entropy": 0.2453125,
"epoch": 2.5622762389297153,
"grad_norm": 0.42558515071868896,
"learning_rate": 1.0090316509606945e-05,
"loss": 0.254138708114624,
"mean_token_accuracy": 0.9195643991231919,
"num_tokens": 43069099.0,
"step": 3400
},
{
"epoch": 2.5622762389297153,
"eval_entropy": 0.2698195124246988,
"eval_loss": 0.2993011474609375,
"eval_mean_token_accuracy": 0.9087990870676845,
"eval_num_tokens": 43069099.0,
"eval_runtime": 443.9843,
"eval_samples_per_second": 5.975,
"eval_steps_per_second": 1.496,
"step": 3400
},
{
"entropy": 0.2767333984375,
"epoch": 2.5698134539287736,
"grad_norm": 0.45832180976867676,
"learning_rate": 1.0041497219759333e-05,
"loss": 0.29227685928344727,
"mean_token_accuracy": 0.9110212385654449,
"num_tokens": 43193208.0,
"step": 3410
},
{
"entropy": 0.2489013671875,
"epoch": 2.5773506689278314,
"grad_norm": 0.4983760416507721,
"learning_rate": 9.99267694085595e-06,
"loss": 0.2483989715576172,
"mean_token_accuracy": 0.9187382385134697,
"num_tokens": 43317014.0,
"step": 3420
},
{
"entropy": 0.26158447265625,
"epoch": 2.584887883926889,
"grad_norm": 0.45462238788604736,
"learning_rate": 9.943856836492301e-06,
"loss": 0.2670482397079468,
"mean_token_accuracy": 0.9153082132339477,
"num_tokens": 43449515.0,
"step": 3430
},
{
"entropy": 0.2579345703125,
"epoch": 2.592425098925947,
"grad_norm": 0.46467944979667664,
"learning_rate": 9.895038070259746e-06,
"loss": 0.2636100769042969,
"mean_token_accuracy": 0.9178228959441185,
"num_tokens": 43567089.0,
"step": 3440
},
{
"entropy": 0.27763671875,
"epoch": 2.5999623139250048,
"grad_norm": 0.41027960181236267,
"learning_rate": 9.846221805717734e-06,
"loss": 0.2852740526199341,
"mean_token_accuracy": 0.9120066031813622,
"num_tokens": 43703492.0,
"step": 3450
},
{
"entropy": 0.253173828125,
"epoch": 2.6074995289240626,
"grad_norm": 0.4736091196537018,
"learning_rate": 9.797409206366095e-06,
"loss": 0.26119682788848875,
"mean_token_accuracy": 0.9169812351465225,
"num_tokens": 43820194.0,
"step": 3460
},
{
"entropy": 0.275732421875,
"epoch": 2.6150367439231204,
"grad_norm": 0.40017107129096985,
"learning_rate": 9.748601435617303e-06,
"loss": 0.27841379642486574,
"mean_token_accuracy": 0.9130286037921905,
"num_tokens": 43947103.0,
"step": 3470
},
{
"entropy": 0.2679931640625,
"epoch": 2.622573958922178,
"grad_norm": 0.4032149910926819,
"learning_rate": 9.699799656768745e-06,
"loss": 0.28026058673858645,
"mean_token_accuracy": 0.9144454896450043,
"num_tokens": 44075924.0,
"step": 3480
},
{
"entropy": 0.2673828125,
"epoch": 2.630111173921236,
"grad_norm": 0.46909603476524353,
"learning_rate": 9.651005032974994e-06,
"loss": 0.28631269931793213,
"mean_token_accuracy": 0.9125849813222885,
"num_tokens": 44203855.0,
"step": 3490
},
{
"entropy": 0.2550537109375,
"epoch": 2.6376483889202937,
"grad_norm": 0.4014464020729065,
"learning_rate": 9.602218727220088e-06,
"loss": 0.2603114128112793,
"mean_token_accuracy": 0.9170651033520698,
"num_tokens": 44329352.0,
"step": 3500
},
{
"entropy": 0.2544677734375,
"epoch": 2.6451856039193515,
"grad_norm": 0.4324460029602051,
"learning_rate": 9.553441902289807e-06,
"loss": 0.25681219100952146,
"mean_token_accuracy": 0.9173885345458984,
"num_tokens": 44459299.0,
"step": 3510
},
{
"entropy": 0.2712646484375,
"epoch": 2.6527228189184098,
"grad_norm": 0.429166316986084,
"learning_rate": 9.504675720743976e-06,
"loss": 0.2794325590133667,
"mean_token_accuracy": 0.9118164703249931,
"num_tokens": 44589157.0,
"step": 3520
},
{
"entropy": 0.2759033203125,
"epoch": 2.6602600339174676,
"grad_norm": 0.4505804777145386,
"learning_rate": 9.45592134488873e-06,
"loss": 0.2813832759857178,
"mean_token_accuracy": 0.9124478429555893,
"num_tokens": 44720112.0,
"step": 3530
},
{
"entropy": 0.271630859375,
"epoch": 2.6677972489165254,
"grad_norm": 0.4533892571926117,
"learning_rate": 9.407179936748827e-06,
"loss": 0.28013317584991454,
"mean_token_accuracy": 0.9141771763563156,
"num_tokens": 44849682.0,
"step": 3540
},
{
"entropy": 0.2718505859375,
"epoch": 2.675334463915583,
"grad_norm": 0.4437422752380371,
"learning_rate": 9.358452658039946e-06,
"loss": 0.28716139793395995,
"mean_token_accuracy": 0.9127397000789642,
"num_tokens": 44977692.0,
"step": 3550
},
{
"entropy": 0.2603515625,
"epoch": 2.682871678914641,
"grad_norm": 0.41409823298454285,
"learning_rate": 9.30974067014101e-06,
"loss": 0.2669771432876587,
"mean_token_accuracy": 0.9178864300251007,
"num_tokens": 45110149.0,
"step": 3560
},
{
"entropy": 0.2744873046875,
"epoch": 2.6904088939136988,
"grad_norm": 0.4747328460216522,
"learning_rate": 9.261045134066487e-06,
"loss": 0.28503587245941164,
"mean_token_accuracy": 0.9122420877218247,
"num_tokens": 45241772.0,
"step": 3570
},
{
"epoch": 2.6904088939136988,
"eval_entropy": 0.2725241787462349,
"eval_loss": 0.29796838760375977,
"eval_mean_token_accuracy": 0.9088380316115288,
"eval_num_tokens": 45241772.0,
"eval_runtime": 443.9422,
"eval_samples_per_second": 5.976,
"eval_steps_per_second": 1.496,
"step": 3570
},
{
"entropy": 0.268896484375,
"epoch": 2.697946108912757,
"grad_norm": 0.42475807666778564,
"learning_rate": 9.212367210438735e-06,
"loss": 0.2734686374664307,
"mean_token_accuracy": 0.9146973386406898,
"num_tokens": 45373873.0,
"step": 3580
},
{
"entropy": 0.24866943359375,
"epoch": 2.705483323911815,
"grad_norm": 0.4935104250907898,
"learning_rate": 9.16370805946033e-06,
"loss": 0.2566777944564819,
"mean_token_accuracy": 0.918173971772194,
"num_tokens": 45503108.0,
"step": 3590
},
{
"entropy": 0.26513671875,
"epoch": 2.7130205389108726,
"grad_norm": 0.32801884412765503,
"learning_rate": 9.115068840886418e-06,
"loss": 0.2722788333892822,
"mean_token_accuracy": 0.9168035730719566,
"num_tokens": 45640842.0,
"step": 3600
},
{
"entropy": 0.264794921875,
"epoch": 2.7205577539099304,
"grad_norm": 0.4599117636680603,
"learning_rate": 9.066450713997062e-06,
"loss": 0.276505184173584,
"mean_token_accuracy": 0.9149751618504525,
"num_tokens": 45769433.0,
"step": 3610
},
{
"entropy": 0.2660400390625,
"epoch": 2.728094968908988,
"grad_norm": 0.46812763810157776,
"learning_rate": 9.017854837569629e-06,
"loss": 0.27300546169281004,
"mean_token_accuracy": 0.9130877435207367,
"num_tokens": 45880560.0,
"step": 3620
},
{
"entropy": 0.2379638671875,
"epoch": 2.735632183908046,
"grad_norm": 0.5042068958282471,
"learning_rate": 8.969282369851163e-06,
"loss": 0.24074835777282716,
"mean_token_accuracy": 0.921598632633686,
"num_tokens": 45993797.0,
"step": 3630
},
{
"entropy": 0.2520263671875,
"epoch": 2.7431693989071038,
"grad_norm": 0.48145022988319397,
"learning_rate": 8.920734468530773e-06,
"loss": 0.2605001211166382,
"mean_token_accuracy": 0.918573509156704,
"num_tokens": 46112002.0,
"step": 3640
},
{
"entropy": 0.25791015625,
"epoch": 2.7507066139061616,
"grad_norm": 0.3994383215904236,
"learning_rate": 8.872212290712047e-06,
"loss": 0.2658211708068848,
"mean_token_accuracy": 0.9159253165125847,
"num_tokens": 46240729.0,
"step": 3650
},
{
"entropy": 0.271435546875,
"epoch": 2.7582438289052194,
"grad_norm": 0.39268237352371216,
"learning_rate": 8.823716992885475e-06,
"loss": 0.2839186191558838,
"mean_token_accuracy": 0.9141981810331344,
"num_tokens": 46368015.0,
"step": 3660
},
{
"entropy": 0.2667236328125,
"epoch": 2.765781043904277,
"grad_norm": 0.39958369731903076,
"learning_rate": 8.77524973090088e-06,
"loss": 0.27642645835876467,
"mean_token_accuracy": 0.9151778295636177,
"num_tokens": 46515273.0,
"step": 3670
},
{
"entropy": 0.29097900390625,
"epoch": 2.773318258903335,
"grad_norm": 0.42510679364204407,
"learning_rate": 8.726811659939877e-06,
"loss": 0.29592735767364503,
"mean_token_accuracy": 0.9093442618846893,
"num_tokens": 46639287.0,
"step": 3680
},
{
"entropy": 0.271142578125,
"epoch": 2.780855473902393,
"grad_norm": 0.41649726033210754,
"learning_rate": 8.678403934488325e-06,
"loss": 0.27806544303894043,
"mean_token_accuracy": 0.914185406267643,
"num_tokens": 46755940.0,
"step": 3690
},
{
"entropy": 0.2638916015625,
"epoch": 2.788392688901451,
"grad_norm": 0.42742252349853516,
"learning_rate": 8.630027708308826e-06,
"loss": 0.2767770290374756,
"mean_token_accuracy": 0.9134870544075966,
"num_tokens": 46889885.0,
"step": 3700
},
{
"entropy": 0.2822509765625,
"epoch": 2.7959299039005088,
"grad_norm": 0.3878902792930603,
"learning_rate": 8.581684134413216e-06,
"loss": 0.27821874618530273,
"mean_token_accuracy": 0.9127815574407577,
"num_tokens": 47019960.0,
"step": 3710
},
{
"entropy": 0.272314453125,
"epoch": 2.8034671188995666,
"grad_norm": 0.373980849981308,
"learning_rate": 8.533374365035089e-06,
"loss": 0.28022453784942625,
"mean_token_accuracy": 0.9120476201176644,
"num_tokens": 47153538.0,
"step": 3720
},
{
"entropy": 0.2423095703125,
"epoch": 2.8110043338986244,
"grad_norm": 0.3966856300830841,
"learning_rate": 8.485099551602341e-06,
"loss": 0.24279303550720216,
"mean_token_accuracy": 0.9210615813732147,
"num_tokens": 47278367.0,
"step": 3730
},
{
"entropy": 0.253173828125,
"epoch": 2.818541548897682,
"grad_norm": 0.424553781747818,
"learning_rate": 8.436860844709708e-06,
"loss": 0.2533012866973877,
"mean_token_accuracy": 0.9188416093587876,
"num_tokens": 47401970.0,
"step": 3740
},
{
"epoch": 2.818541548897682,
"eval_entropy": 0.2633541980421687,
"eval_loss": 0.2967968285083771,
"eval_mean_token_accuracy": 0.9093607121023787,
"eval_num_tokens": 47401970.0,
"eval_runtime": 444.0882,
"eval_samples_per_second": 5.974,
"eval_steps_per_second": 1.495,
"step": 3740
},
{
"entropy": 0.2485107421875,
"epoch": 2.8260787638967404,
"grad_norm": 0.4144607186317444,
"learning_rate": 8.388659394091362e-06,
"loss": 0.256608772277832,
"mean_token_accuracy": 0.9184371501207351,
"num_tokens": 47536067.0,
"step": 3750
},
{
"entropy": 0.2462890625,
"epoch": 2.833615978895798,
"grad_norm": 0.4533601701259613,
"learning_rate": 8.340496348593485e-06,
"loss": 0.25168781280517577,
"mean_token_accuracy": 0.919621941447258,
"num_tokens": 47659072.0,
"step": 3760
},
{
"entropy": 0.242138671875,
"epoch": 2.841153193894856,
"grad_norm": 0.4203242063522339,
"learning_rate": 8.292372856146919e-06,
"loss": 0.2485339403152466,
"mean_token_accuracy": 0.9196742460131645,
"num_tokens": 47785829.0,
"step": 3770
},
{
"entropy": 0.2552490234375,
"epoch": 2.848690408893914,
"grad_norm": 0.3394729793071747,
"learning_rate": 8.244290063739776e-06,
"loss": 0.25977215766906736,
"mean_token_accuracy": 0.9153026059269905,
"num_tokens": 47913628.0,
"step": 3780
},
{
"entropy": 0.27724609375,
"epoch": 2.8562276238929716,
"grad_norm": 0.4583624303340912,
"learning_rate": 8.196249117390112e-06,
"loss": 0.2713502883911133,
"mean_token_accuracy": 0.913399763405323,
"num_tokens": 48040647.0,
"step": 3790
},
{
"entropy": 0.25810546875,
"epoch": 2.8637648388920294,
"grad_norm": 0.40007394552230835,
"learning_rate": 8.148251162118625e-06,
"loss": 0.26303553581237793,
"mean_token_accuracy": 0.9153849989175796,
"num_tokens": 48170847.0,
"step": 3800
},
{
"entropy": 0.2434814453125,
"epoch": 2.871302053891087,
"grad_norm": 0.3815859258174896,
"learning_rate": 8.100297341921342e-06,
"loss": 0.2506600856781006,
"mean_token_accuracy": 0.9199610412120819,
"num_tokens": 48290214.0,
"step": 3810
},
{
"entropy": 0.2513671875,
"epoch": 2.878839268890145,
"grad_norm": 0.38468119502067566,
"learning_rate": 8.05238879974236e-06,
"loss": 0.2547659635543823,
"mean_token_accuracy": 0.9180278465151787,
"num_tokens": 48414986.0,
"step": 3820
},
{
"entropy": 0.2574951171875,
"epoch": 2.8863764838892028,
"grad_norm": 0.48956918716430664,
"learning_rate": 8.00452667744662e-06,
"loss": 0.2638235092163086,
"mean_token_accuracy": 0.9166240409016609,
"num_tokens": 48531392.0,
"step": 3830
},
{
"entropy": 0.267822265625,
"epoch": 2.8939136988882606,
"grad_norm": 0.5001468658447266,
"learning_rate": 7.956712115792666e-06,
"loss": 0.2735679388046265,
"mean_token_accuracy": 0.9156135901808738,
"num_tokens": 48664784.0,
"step": 3840
},
{
"entropy": 0.2489990234375,
"epoch": 2.901450913887319,
"grad_norm": 0.46188080310821533,
"learning_rate": 7.908946254405477e-06,
"loss": 0.2521179676055908,
"mean_token_accuracy": 0.9186730876564979,
"num_tokens": 48786675.0,
"step": 3850
},
{
"entropy": 0.2811767578125,
"epoch": 2.9089881288863766,
"grad_norm": 0.3843408226966858,
"learning_rate": 7.86123023174929e-06,
"loss": 0.28948609828948973,
"mean_token_accuracy": 0.911932322382927,
"num_tokens": 48926071.0,
"step": 3860
},
{
"entropy": 0.270263671875,
"epoch": 2.9165253438854344,
"grad_norm": 0.3932430148124695,
"learning_rate": 7.813565185100487e-06,
"loss": 0.2777218818664551,
"mean_token_accuracy": 0.9139480367302895,
"num_tokens": 49059803.0,
"step": 3870
},
{
"entropy": 0.243212890625,
"epoch": 2.924062558884492,
"grad_norm": 0.48365503549575806,
"learning_rate": 7.765952250520459e-06,
"loss": 0.24481496810913086,
"mean_token_accuracy": 0.9214571461081504,
"num_tokens": 49188445.0,
"step": 3880
},
{
"entropy": 0.239501953125,
"epoch": 2.93159977388355,
"grad_norm": 0.37279045581817627,
"learning_rate": 7.71839256282855e-06,
"loss": 0.24772932529449462,
"mean_token_accuracy": 0.9205403715372086,
"num_tokens": 49317486.0,
"step": 3890
},
{
"entropy": 0.2743408203125,
"epoch": 2.9391369888826078,
"grad_norm": 0.4030146598815918,
"learning_rate": 7.670887255575003e-06,
"loss": 0.2839582204818726,
"mean_token_accuracy": 0.9123036295175553,
"num_tokens": 49455758.0,
"step": 3900
},
{
"entropy": 0.243994140625,
"epoch": 2.9466742038816656,
"grad_norm": 0.37864017486572266,
"learning_rate": 7.623437461013941e-06,
"loss": 0.24827678203582765,
"mean_token_accuracy": 0.9205136641860008,
"num_tokens": 49582414.0,
"step": 3910
},
{
"epoch": 2.9466742038816656,
"eval_entropy": 0.26600003529743976,
"eval_loss": 0.29588836431503296,
"eval_mean_token_accuracy": 0.909692998032972,
"eval_num_tokens": 49582414.0,
"eval_runtime": 444.4984,
"eval_samples_per_second": 5.969,
"eval_steps_per_second": 1.494,
"step": 3910
},
{
"entropy": 0.23487548828125,
"epoch": 2.954211418880724,
"grad_norm": 0.4359188675880432,
"learning_rate": 7.576044310076388e-06,
"loss": 0.23804020881652832,
"mean_token_accuracy": 0.9226861000061035,
"num_tokens": 49706454.0,
"step": 3920
},
{
"entropy": 0.2821044921875,
"epoch": 2.9617486338797816,
"grad_norm": 0.4656037390232086,
"learning_rate": 7.5287089323433035e-06,
"loss": 0.2857757806777954,
"mean_token_accuracy": 0.9117534056305885,
"num_tokens": 49840228.0,
"step": 3930
},
{
"entropy": 0.27659912109375,
"epoch": 2.9692858488788394,
"grad_norm": 0.35202714800834656,
"learning_rate": 7.481432456018671e-06,
"loss": 0.2831352949142456,
"mean_token_accuracy": 0.9127496406435966,
"num_tokens": 49973240.0,
"step": 3940
},
{
"entropy": 0.2625244140625,
"epoch": 2.976823063877897,
"grad_norm": 0.4686535596847534,
"learning_rate": 7.434216007902598e-06,
"loss": 0.2630059242248535,
"mean_token_accuracy": 0.9144649460911751,
"num_tokens": 50094039.0,
"step": 3950
},
{
"entropy": 0.255615234375,
"epoch": 2.984360278876955,
"grad_norm": 0.4569144546985626,
"learning_rate": 7.387060713364462e-06,
"loss": 0.26566917896270753,
"mean_token_accuracy": 0.9165397122502327,
"num_tokens": 50208282.0,
"step": 3960
},
{
"entropy": 0.2490234375,
"epoch": 2.991897493876013,
"grad_norm": 0.4426827132701874,
"learning_rate": 7.33996769631609e-06,
"loss": 0.25277419090270997,
"mean_token_accuracy": 0.9186919391155243,
"num_tokens": 50328886.0,
"step": 3970
},
{
"entropy": 0.2667724609375,
"epoch": 2.9994347088750706,
"grad_norm": 0.48642250895500183,
"learning_rate": 7.292938079184979e-06,
"loss": 0.2723618745803833,
"mean_token_accuracy": 0.9138344705104828,
"num_tokens": 50454506.0,
"step": 3980
},
{
"entropy": 0.2523036858974359,
"epoch": 3.006783493499152,
"grad_norm": 0.48612406849861145,
"learning_rate": 7.2459729828875256e-06,
"loss": 0.25093731880187986,
"mean_token_accuracy": 0.9203954384877131,
"num_tokens": 50563331.0,
"step": 3990
},
{
"entropy": 0.2311279296875,
"epoch": 3.01432070849821,
"grad_norm": 0.3902427554130554,
"learning_rate": 7.199073526802322e-06,
"loss": 0.23201241493225097,
"mean_token_accuracy": 0.9242525264620781,
"num_tokens": 50688841.0,
"step": 4000
},
{
"entropy": 0.24853515625,
"epoch": 3.021857923497268,
"grad_norm": 0.3865509331226349,
"learning_rate": 7.1522408287434774e-06,
"loss": 0.2584357738494873,
"mean_token_accuracy": 0.9196509182453155,
"num_tokens": 50823608.0,
"step": 4010
},
{
"entropy": 0.23577880859375,
"epoch": 3.0293951384963256,
"grad_norm": 0.47226399183273315,
"learning_rate": 7.105476004933973e-06,
"loss": 0.23722119331359864,
"mean_token_accuracy": 0.9245356351137162,
"num_tokens": 50952093.0,
"step": 4020
},
{
"entropy": 0.24713134765625,
"epoch": 3.0369323534953834,
"grad_norm": 0.5489491820335388,
"learning_rate": 7.058780169979051e-06,
"loss": 0.25731186866760253,
"mean_token_accuracy": 0.9205514118075371,
"num_tokens": 51078395.0,
"step": 4030
},
{
"entropy": 0.2447509765625,
"epoch": 3.044469568494441,
"grad_norm": 0.442008912563324,
"learning_rate": 7.012154436839664e-06,
"loss": 0.250858998298645,
"mean_token_accuracy": 0.9203956529498101,
"num_tokens": 51206927.0,
"step": 4040
},
{
"entropy": 0.2478759765625,
"epoch": 3.052006783493499,
"grad_norm": 0.5229147672653198,
"learning_rate": 6.965599916805927e-06,
"loss": 0.2520869731903076,
"mean_token_accuracy": 0.9199037939310074,
"num_tokens": 51323632.0,
"step": 4050
},
{
"entropy": 0.2457275390625,
"epoch": 3.059543998492557,
"grad_norm": 0.4642680287361145,
"learning_rate": 6.919117719470655e-06,
"loss": 0.25035810470581055,
"mean_token_accuracy": 0.9208179607987403,
"num_tokens": 51450728.0,
"step": 4060
},
{
"entropy": 0.23104248046875,
"epoch": 3.067081213491615,
"grad_norm": 0.46121546626091003,
"learning_rate": 6.872708952702893e-06,
"loss": 0.2347405433654785,
"mean_token_accuracy": 0.9219806760549545,
"num_tokens": 51568454.0,
"step": 4070
},
{
"entropy": 0.2685791015625,
"epoch": 3.074618428490673,
"grad_norm": 0.5084824562072754,
"learning_rate": 6.826374722621536e-06,
"loss": 0.27871730327606203,
"mean_token_accuracy": 0.914721603691578,
"num_tokens": 51692485.0,
"step": 4080
},
{
"epoch": 3.074618428490673,
"eval_entropy": 0.25480192253388556,
"eval_loss": 0.29853206872940063,
"eval_mean_token_accuracy": 0.9095420700957976,
"eval_num_tokens": 51692485.0,
"eval_runtime": 444.6635,
"eval_samples_per_second": 5.966,
"eval_steps_per_second": 1.493,
"step": 4080
},
{
"entropy": 0.257958984375,
"epoch": 3.0821556434897306,
"grad_norm": 0.4730566143989563,
"learning_rate": 6.780116133568943e-06,
"loss": 0.26084840297698975,
"mean_token_accuracy": 0.9181940242648124,
"num_tokens": 51819563.0,
"step": 4090
},
{
"entropy": 0.2264892578125,
"epoch": 3.0896928584887884,
"grad_norm": 0.4408583343029022,
"learning_rate": 6.733934288084624e-06,
"loss": 0.22071993350982666,
"mean_token_accuracy": 0.928843292593956,
"num_tokens": 51957836.0,
"step": 4100
},
{
"entropy": 0.240869140625,
"epoch": 3.097230073487846,
"grad_norm": 0.41696277260780334,
"learning_rate": 6.687830286878968e-06,
"loss": 0.24481325149536132,
"mean_token_accuracy": 0.9215219706296921,
"num_tokens": 52085471.0,
"step": 4110
},
{
"entropy": 0.249609375,
"epoch": 3.104767288486904,
"grad_norm": 0.45289766788482666,
"learning_rate": 6.641805228806994e-06,
"loss": 0.2558360815048218,
"mean_token_accuracy": 0.9204878672957421,
"num_tokens": 52210380.0,
"step": 4120
},
{
"entropy": 0.25283203125,
"epoch": 3.1123045034859618,
"grad_norm": 0.48902979493141174,
"learning_rate": 6.5958602108421796e-06,
"loss": 0.26007556915283203,
"mean_token_accuracy": 0.9192629650235176,
"num_tokens": 52344583.0,
"step": 4130
},
{
"entropy": 0.2415771484375,
"epoch": 3.11984171848502,
"grad_norm": 0.4995759129524231,
"learning_rate": 6.549996328050296e-06,
"loss": 0.24606029987335204,
"mean_token_accuracy": 0.9220411941409111,
"num_tokens": 52481392.0,
"step": 4140
},
{
"entropy": 0.2508056640625,
"epoch": 3.127378933484078,
"grad_norm": 0.5180537104606628,
"learning_rate": 6.504214673563321e-06,
"loss": 0.25423905849456785,
"mean_token_accuracy": 0.9189393475651741,
"num_tokens": 52598987.0,
"step": 4150
},
{
"entropy": 0.2357666015625,
"epoch": 3.1349161484831356,
"grad_norm": 0.505828320980072,
"learning_rate": 6.458516338553387e-06,
"loss": 0.24432835578918458,
"mean_token_accuracy": 0.9223694607615471,
"num_tokens": 52725067.0,
"step": 4160
},
{
"entropy": 0.246435546875,
"epoch": 3.1424533634821934,
"grad_norm": 0.565288245677948,
"learning_rate": 6.41290241220676e-06,
"loss": 0.2593379020690918,
"mean_token_accuracy": 0.918650609254837,
"num_tokens": 52845379.0,
"step": 4170
},
{
"entropy": 0.2607177734375,
"epoch": 3.149990578481251,
"grad_norm": 0.45378032326698303,
"learning_rate": 6.367373981697889e-06,
"loss": 0.26407182216644287,
"mean_token_accuracy": 0.9182954132556915,
"num_tokens": 52977261.0,
"step": 4180
},
{
"entropy": 0.2532958984375,
"epoch": 3.157527793480309,
"grad_norm": 0.42719534039497375,
"learning_rate": 6.321932132163493e-06,
"loss": 0.26045353412628175,
"mean_token_accuracy": 0.9192585989832878,
"num_tokens": 53110441.0,
"step": 4190
},
{
"entropy": 0.2584716796875,
"epoch": 3.165065008479367,
"grad_norm": 0.48866167664527893,
"learning_rate": 6.276577946676696e-06,
"loss": 0.27137844562530516,
"mean_token_accuracy": 0.9169502511620522,
"num_tokens": 53239158.0,
"step": 4200
},
{
"entropy": 0.23046875,
"epoch": 3.1726022234784246,
"grad_norm": 0.4197594225406647,
"learning_rate": 6.231312506221219e-06,
"loss": 0.23780272006988526,
"mean_token_accuracy": 0.9241486981511116,
"num_tokens": 53368874.0,
"step": 4210
},
{
"entropy": 0.2381103515625,
"epoch": 3.1801394384774824,
"grad_norm": 0.5063280463218689,
"learning_rate": 6.1861368896656e-06,
"loss": 0.23919708728790284,
"mean_token_accuracy": 0.9226507186889649,
"num_tokens": 53496718.0,
"step": 4220
},
{
"entropy": 0.251904296875,
"epoch": 3.1876766534765406,
"grad_norm": 0.5316512584686279,
"learning_rate": 6.141052173737503e-06,
"loss": 0.2563410758972168,
"mean_token_accuracy": 0.9189333856105805,
"num_tokens": 53623940.0,
"step": 4230
},
{
"entropy": 0.24686279296875,
"epoch": 3.1952138684755984,
"grad_norm": 0.4826897382736206,
"learning_rate": 6.096059432998034e-06,
"loss": 0.24861443042755127,
"mean_token_accuracy": 0.9219458773732185,
"num_tokens": 53764009.0,
"step": 4240
},
{
"entropy": 0.2468017578125,
"epoch": 3.202751083474656,
"grad_norm": 0.46765172481536865,
"learning_rate": 6.0511597398161395e-06,
"loss": 0.250647234916687,
"mean_token_accuracy": 0.9204504400491714,
"num_tokens": 53892566.0,
"step": 4250
},
{
"epoch": 3.202751083474656,
"eval_entropy": 0.2578801534262048,
"eval_loss": 0.2983558773994446,
"eval_mean_token_accuracy": 0.9092684685286269,
"eval_num_tokens": 53892566.0,
"eval_runtime": 443.9354,
"eval_samples_per_second": 5.976,
"eval_steps_per_second": 1.496,
"step": 4250
},
{
"entropy": 0.2371826171875,
"epoch": 3.210288298473714,
"grad_norm": 0.5083767771720886,
"learning_rate": 6.006354164343047e-06,
"loss": 0.2339548110961914,
"mean_token_accuracy": 0.9240068301558495,
"num_tokens": 54017602.0,
"step": 4260
},
{
"entropy": 0.229931640625,
"epoch": 3.217825513472772,
"grad_norm": 0.5524066686630249,
"learning_rate": 5.961643774486754e-06,
"loss": 0.24028148651123046,
"mean_token_accuracy": 0.9243996739387512,
"num_tokens": 54151854.0,
"step": 4270
},
{
"entropy": 0.2494140625,
"epoch": 3.2253627284718296,
"grad_norm": 0.5873595476150513,
"learning_rate": 5.917029635886585e-06,
"loss": 0.2616408824920654,
"mean_token_accuracy": 0.919035418331623,
"num_tokens": 54262389.0,
"step": 4280
},
{
"entropy": 0.23074951171875,
"epoch": 3.2328999434708874,
"grad_norm": 0.46301954984664917,
"learning_rate": 5.872512811887777e-06,
"loss": 0.2374636173248291,
"mean_token_accuracy": 0.9259173914790153,
"num_tokens": 54394237.0,
"step": 4290
},
{
"entropy": 0.2382568359375,
"epoch": 3.240437158469945,
"grad_norm": 0.41154083609580994,
"learning_rate": 5.828094363516158e-06,
"loss": 0.24436559677124023,
"mean_token_accuracy": 0.9219806671142579,
"num_tokens": 54531773.0,
"step": 4300
},
{
"entropy": 0.245263671875,
"epoch": 3.2479743734690034,
"grad_norm": 0.4517538845539093,
"learning_rate": 5.783775349452831e-06,
"loss": 0.25096561908721926,
"mean_token_accuracy": 0.9219090670347214,
"num_tokens": 54661135.0,
"step": 4310
},
{
"entropy": 0.2532470703125,
"epoch": 3.255511588468061,
"grad_norm": 0.4663011133670807,
"learning_rate": 5.739556826008972e-06,
"loss": 0.2571004629135132,
"mean_token_accuracy": 0.918338057398796,
"num_tokens": 54781768.0,
"step": 4320
},
{
"entropy": 0.2399658203125,
"epoch": 3.263048803467119,
"grad_norm": 0.4521697163581848,
"learning_rate": 5.695439847100615e-06,
"loss": 0.24652526378631592,
"mean_token_accuracy": 0.9215589553117752,
"num_tokens": 54916397.0,
"step": 4330
},
{
"entropy": 0.2451416015625,
"epoch": 3.270586018466177,
"grad_norm": 0.4162958562374115,
"learning_rate": 5.651425464223577e-06,
"loss": 0.24436590671539307,
"mean_token_accuracy": 0.920574314892292,
"num_tokens": 55040997.0,
"step": 4340
},
{
"entropy": 0.2452392578125,
"epoch": 3.2781232334652346,
"grad_norm": 0.46381431818008423,
"learning_rate": 5.6075147264283526e-06,
"loss": 0.2571404457092285,
"mean_token_accuracy": 0.9213781818747521,
"num_tokens": 55175738.0,
"step": 4350
},
{
"entropy": 0.24869384765625,
"epoch": 3.2856604484642924,
"grad_norm": 0.36787933111190796,
"learning_rate": 5.56370868029515e-06,
"loss": 0.253587532043457,
"mean_token_accuracy": 0.9196270078420639,
"num_tokens": 55312758.0,
"step": 4360
},
{
"entropy": 0.22239990234375,
"epoch": 3.29319766346335,
"grad_norm": 0.43934619426727295,
"learning_rate": 5.520008369908918e-06,
"loss": 0.2182994842529297,
"mean_token_accuracy": 0.9281560033559799,
"num_tokens": 55444635.0,
"step": 4370
},
{
"entropy": 0.2463134765625,
"epoch": 3.300734878462408,
"grad_norm": 0.5719824433326721,
"learning_rate": 5.476414836834481e-06,
"loss": 0.25219566822052003,
"mean_token_accuracy": 0.9201019376516342,
"num_tokens": 55569153.0,
"step": 4380
},
{
"entropy": 0.2388427734375,
"epoch": 3.308272093461466,
"grad_norm": 0.6103549599647522,
"learning_rate": 5.432929120091691e-06,
"loss": 0.24608726501464845,
"mean_token_accuracy": 0.9217844411730767,
"num_tokens": 55689383.0,
"step": 4390
},
{
"entropy": 0.2604736328125,
"epoch": 3.315809308460524,
"grad_norm": 0.48919445276260376,
"learning_rate": 5.38955225613069e-06,
"loss": 0.2672025203704834,
"mean_token_accuracy": 0.9159393101930619,
"num_tokens": 55818032.0,
"step": 4400
},
{
"entropy": 0.24017333984375,
"epoch": 3.323346523459582,
"grad_norm": 0.6008545756340027,
"learning_rate": 5.346285278807182e-06,
"loss": 0.24650108814239502,
"mean_token_accuracy": 0.9232565045356751,
"num_tokens": 55951704.0,
"step": 4410
},
{
"entropy": 0.24951171875,
"epoch": 3.3308837384586396,
"grad_norm": 0.5296514630317688,
"learning_rate": 5.303129219357811e-06,
"loss": 0.25560004711151124,
"mean_token_accuracy": 0.9190060347318649,
"num_tokens": 56087124.0,
"step": 4420
},
{
"epoch": 3.3308837384586396,
"eval_entropy": 0.25144572430346385,
"eval_loss": 0.29815539717674255,
"eval_mean_token_accuracy": 0.9097737183412874,
"eval_num_tokens": 56087124.0,
"eval_runtime": 444.342,
"eval_samples_per_second": 5.971,
"eval_steps_per_second": 1.494,
"step": 4420
},
{
"entropy": 0.24404296875,
"epoch": 3.3384209534576974,
"grad_norm": 0.5156750082969666,
"learning_rate": 5.260085106375577e-06,
"loss": 0.24577805995941163,
"mean_token_accuracy": 0.9231465876102447,
"num_tokens": 56216768.0,
"step": 4430
},
{
"entropy": 0.23583984375,
"epoch": 3.345958168456755,
"grad_norm": 0.48873215913772583,
"learning_rate": 5.217153965785315e-06,
"loss": 0.24040358066558837,
"mean_token_accuracy": 0.9222135201096535,
"num_tokens": 56331628.0,
"step": 4440
},
{
"entropy": 0.236279296875,
"epoch": 3.353495383455813,
"grad_norm": 0.6165609955787659,
"learning_rate": 5.174336820819241e-06,
"loss": 0.24129061698913573,
"mean_token_accuracy": 0.922450278699398,
"num_tokens": 56466449.0,
"step": 4450
},
{
"entropy": 0.25859375,
"epoch": 3.361032598454871,
"grad_norm": 0.42945030331611633,
"learning_rate": 5.131634691992576e-06,
"loss": 0.2604536771774292,
"mean_token_accuracy": 0.9179983928799629,
"num_tokens": 56590258.0,
"step": 4460
},
{
"entropy": 0.2478515625,
"epoch": 3.3685698134539286,
"grad_norm": 0.3764921724796295,
"learning_rate": 5.089048597079218e-06,
"loss": 0.25089526176452637,
"mean_token_accuracy": 0.918754868209362,
"num_tokens": 56712466.0,
"step": 4470
},
{
"entropy": 0.251513671875,
"epoch": 3.376107028452987,
"grad_norm": 0.5503227710723877,
"learning_rate": 5.046579551087469e-06,
"loss": 0.25963895320892333,
"mean_token_accuracy": 0.9187079787254333,
"num_tokens": 56838324.0,
"step": 4480
},
{
"entropy": 0.24443359375,
"epoch": 3.3836442434520446,
"grad_norm": 0.4642918109893799,
"learning_rate": 5.0042285662358715e-06,
"loss": 0.25160040855407717,
"mean_token_accuracy": 0.9221544966101647,
"num_tokens": 56971672.0,
"step": 4490
},
{
"entropy": 0.22529296875,
"epoch": 3.3911814584511024,
"grad_norm": 0.47102871537208557,
"learning_rate": 4.961996651929053e-06,
"loss": 0.23354432582855225,
"mean_token_accuracy": 0.9269132241606712,
"num_tokens": 57101256.0,
"step": 4500
},
{
"entropy": 0.2195068359375,
"epoch": 3.39871867345016,
"grad_norm": 0.4792303144931793,
"learning_rate": 4.9198848147336935e-06,
"loss": 0.22426846027374267,
"mean_token_accuracy": 0.9267282068729401,
"num_tokens": 57220336.0,
"step": 4510
},
{
"entropy": 0.23193359375,
"epoch": 3.406255888449218,
"grad_norm": 0.46890905499458313,
"learning_rate": 4.877894058354518e-06,
"loss": 0.23823246955871583,
"mean_token_accuracy": 0.9238113984465599,
"num_tokens": 57351375.0,
"step": 4520
},
{
"entropy": 0.259375,
"epoch": 3.413793103448276,
"grad_norm": 0.4295634925365448,
"learning_rate": 4.836025383610382e-06,
"loss": 0.26934764385223386,
"mean_token_accuracy": 0.9180942147970199,
"num_tokens": 57492948.0,
"step": 4530
},
{
"entropy": 0.23662109375,
"epoch": 3.4213303184473336,
"grad_norm": 0.4977467656135559,
"learning_rate": 4.794279788410408e-06,
"loss": 0.23803329467773438,
"mean_token_accuracy": 0.9239297583699226,
"num_tokens": 57617213.0,
"step": 4540
},
{
"entropy": 0.2344482421875,
"epoch": 3.4288675334463914,
"grad_norm": 0.5020400881767273,
"learning_rate": 4.752658267730218e-06,
"loss": 0.24145655632019042,
"mean_token_accuracy": 0.9231008142232895,
"num_tokens": 57755087.0,
"step": 4550
},
{
"entropy": 0.23726806640625,
"epoch": 3.436404748445449,
"grad_norm": 0.5047474503517151,
"learning_rate": 4.711161813588198e-06,
"loss": 0.24432265758514404,
"mean_token_accuracy": 0.921500913798809,
"num_tokens": 57881092.0,
"step": 4560
},
{
"entropy": 0.2539306640625,
"epoch": 3.4439419634445074,
"grad_norm": 0.5615915060043335,
"learning_rate": 4.6697914150218726e-06,
"loss": 0.26180734634399416,
"mean_token_accuracy": 0.9188700020313263,
"num_tokens": 58019422.0,
"step": 4570
},
{
"entropy": 0.2443115234375,
"epoch": 3.451479178443565,
"grad_norm": 0.41278159618377686,
"learning_rate": 4.6285480580643214e-06,
"loss": 0.24113664627075196,
"mean_token_accuracy": 0.92239079028368,
"num_tokens": 58144501.0,
"step": 4580
},
{
"entropy": 0.249853515625,
"epoch": 3.459016393442623,
"grad_norm": 0.48389744758605957,
"learning_rate": 4.587432725720687e-06,
"loss": 0.2561469554901123,
"mean_token_accuracy": 0.9191392526030541,
"num_tokens": 58274208.0,
"step": 4590
},
{
"epoch": 3.459016393442623,
"eval_entropy": 0.2534054675734187,
"eval_loss": 0.2973636984825134,
"eval_mean_token_accuracy": 0.9099213545580944,
"eval_num_tokens": 58274208.0,
"eval_runtime": 444.1047,
"eval_samples_per_second": 5.974,
"eval_steps_per_second": 1.495,
"step": 4590
},
{
"entropy": 0.25052490234375,
"epoch": 3.466553608441681,
"grad_norm": 0.48276710510253906,
"learning_rate": 4.5464463979447245e-06,
"loss": 0.2551881313323975,
"mean_token_accuracy": 0.9179890528321266,
"num_tokens": 58399143.0,
"step": 4600
},
{
"entropy": 0.23720703125,
"epoch": 3.4740908234407386,
"grad_norm": 0.49638012051582336,
"learning_rate": 4.505590051615478e-06,
"loss": 0.24317293167114257,
"mean_token_accuracy": 0.9220433473587036,
"num_tokens": 58518939.0,
"step": 4610
},
{
"entropy": 0.23392333984375,
"epoch": 3.4816280384397964,
"grad_norm": 0.512684166431427,
"learning_rate": 4.4648646605139605e-06,
"loss": 0.23999152183532715,
"mean_token_accuracy": 0.9236366301774979,
"num_tokens": 58645386.0,
"step": 4620
},
{
"entropy": 0.2496337890625,
"epoch": 3.489165253438854,
"grad_norm": 0.476936399936676,
"learning_rate": 4.424271195299981e-06,
"loss": 0.25567328929901123,
"mean_token_accuracy": 0.9208142340183259,
"num_tokens": 58774633.0,
"step": 4630
},
{
"entropy": 0.2439453125,
"epoch": 3.4967024684379124,
"grad_norm": 0.4863242208957672,
"learning_rate": 4.383810623488973e-06,
"loss": 0.2511773109436035,
"mean_token_accuracy": 0.9208297878503799,
"num_tokens": 58890700.0,
"step": 4640
},
{
"entropy": 0.2301513671875,
"epoch": 3.5042396834369702,
"grad_norm": 0.4208335280418396,
"learning_rate": 4.343483909428978e-06,
"loss": 0.23434915542602539,
"mean_token_accuracy": 0.926320880651474,
"num_tokens": 59023930.0,
"step": 4650
},
{
"entropy": 0.2602294921875,
"epoch": 3.511776898436028,
"grad_norm": 0.5129518508911133,
"learning_rate": 4.3032920142776125e-06,
"loss": 0.2699117660522461,
"mean_token_accuracy": 0.9175953105092048,
"num_tokens": 59148853.0,
"step": 4660
},
{
"entropy": 0.232763671875,
"epoch": 3.519314113435086,
"grad_norm": 0.48988714814186096,
"learning_rate": 4.2632358959791984e-06,
"loss": 0.24585673809051514,
"mean_token_accuracy": 0.9236719325184822,
"num_tokens": 59270325.0,
"step": 4670
},
{
"entropy": 0.2343994140625,
"epoch": 3.5268513284341436,
"grad_norm": 0.5187233686447144,
"learning_rate": 4.2233165092419045e-06,
"loss": 0.23766450881958007,
"mean_token_accuracy": 0.9215475022792816,
"num_tokens": 59390235.0,
"step": 4680
},
{
"entropy": 0.2481201171875,
"epoch": 3.5343885434332014,
"grad_norm": 0.5581011772155762,
"learning_rate": 4.183534805515017e-06,
"loss": 0.2518896579742432,
"mean_token_accuracy": 0.9208254173398018,
"num_tokens": 59523333.0,
"step": 4690
},
{
"entropy": 0.2261474609375,
"epoch": 3.541925758432259,
"grad_norm": 0.4673849046230316,
"learning_rate": 4.143891732966233e-06,
"loss": 0.222815203666687,
"mean_token_accuracy": 0.9255363285541535,
"num_tokens": 59644999.0,
"step": 4700
},
{
"entropy": 0.238232421875,
"epoch": 3.549462973431317,
"grad_norm": 0.4689350724220276,
"learning_rate": 4.1043882364590895e-06,
"loss": 0.24630405902862548,
"mean_token_accuracy": 0.9213015034794807,
"num_tokens": 59768160.0,
"step": 4710
},
{
"entropy": 0.246630859375,
"epoch": 3.557000188430375,
"grad_norm": 0.5590668320655823,
"learning_rate": 4.065025257530425e-06,
"loss": 0.2526021718978882,
"mean_token_accuracy": 0.9192856788635254,
"num_tokens": 59893438.0,
"step": 4720
},
{
"entropy": 0.2509765625,
"epoch": 3.5645374034294326,
"grad_norm": 0.5854102373123169,
"learning_rate": 4.025803734367951e-06,
"loss": 0.2594055414199829,
"mean_token_accuracy": 0.9179863676428794,
"num_tokens": 60011320.0,
"step": 4730
},
{
"entropy": 0.2639892578125,
"epoch": 3.572074618428491,
"grad_norm": 0.4343920648097992,
"learning_rate": 3.986724601787874e-06,
"loss": 0.27078163623809814,
"mean_token_accuracy": 0.9166007101535797,
"num_tokens": 60132251.0,
"step": 4740
},
{
"entropy": 0.2543212890625,
"epoch": 3.5796118334275486,
"grad_norm": 0.5742672681808472,
"learning_rate": 3.947788791212636e-06,
"loss": 0.2545814037322998,
"mean_token_accuracy": 0.9177268758416176,
"num_tokens": 60250677.0,
"step": 4750
},
{
"entropy": 0.2412841796875,
"epoch": 3.5871490484266064,
"grad_norm": 0.47204774618148804,
"learning_rate": 3.908997230648693e-06,
"loss": 0.2479944944381714,
"mean_token_accuracy": 0.9224215567111969,
"num_tokens": 60384182.0,
"step": 4760
},
{
"epoch": 3.5871490484266064,
"eval_entropy": 0.2532833972609187,
"eval_loss": 0.2967984080314636,
"eval_mean_token_accuracy": 0.9098558257143181,
"eval_num_tokens": 60384182.0,
"eval_runtime": 444.2337,
"eval_samples_per_second": 5.972,
"eval_steps_per_second": 1.495,
"step": 4760
},
{
"entropy": 0.2306640625,
"epoch": 3.594686263425664,
"grad_norm": 0.44733676314353943,
"learning_rate": 3.870350844664421e-06,
"loss": 0.23280799388885498,
"mean_token_accuracy": 0.9231883391737938,
"num_tokens": 60512836.0,
"step": 4770
},
{
"entropy": 0.22529296875,
"epoch": 3.602223478424722,
"grad_norm": 0.4727942645549774,
"learning_rate": 3.831850554368062e-06,
"loss": 0.2281050443649292,
"mean_token_accuracy": 0.9263469472527504,
"num_tokens": 60644876.0,
"step": 4780
},
{
"entropy": 0.2620361328125,
"epoch": 3.60976069342378,
"grad_norm": 0.5005683302879333,
"learning_rate": 3.7934972773857637e-06,
"loss": 0.2716717481613159,
"mean_token_accuracy": 0.9157996863126755,
"num_tokens": 60767111.0,
"step": 4790
},
{
"entropy": 0.239306640625,
"epoch": 3.6172979084228376,
"grad_norm": 0.5814849734306335,
"learning_rate": 3.7552919278397335e-06,
"loss": 0.24393236637115479,
"mean_token_accuracy": 0.9211369171738625,
"num_tokens": 60888646.0,
"step": 4800
},
{
"entropy": 0.23623046875,
"epoch": 3.624835123421896,
"grad_norm": 0.5132681727409363,
"learning_rate": 3.7172354163264324e-06,
"loss": 0.23972315788269044,
"mean_token_accuracy": 0.9234942555427551,
"num_tokens": 61006787.0,
"step": 4810
},
{
"entropy": 0.239892578125,
"epoch": 3.6323723384209536,
"grad_norm": 0.449523001909256,
"learning_rate": 3.6793286498948777e-06,
"loss": 0.250550365447998,
"mean_token_accuracy": 0.9213675454258918,
"num_tokens": 61136494.0,
"step": 4820
},
{
"entropy": 0.23447265625,
"epoch": 3.6399095534200114,
"grad_norm": 0.4843718707561493,
"learning_rate": 3.641572532025014e-06,
"loss": 0.2334545373916626,
"mean_token_accuracy": 0.9240896537899971,
"num_tokens": 61255513.0,
"step": 4830
},
{
"entropy": 0.2620361328125,
"epoch": 3.6474467684190692,
"grad_norm": 0.48772865533828735,
"learning_rate": 3.603967962606201e-06,
"loss": 0.26780409812927247,
"mean_token_accuracy": 0.9164189457893371,
"num_tokens": 61377835.0,
"step": 4840
},
{
"entropy": 0.232861328125,
"epoch": 3.654983983418127,
"grad_norm": 0.488202303647995,
"learning_rate": 3.566515837915738e-06,
"loss": 0.2365469217300415,
"mean_token_accuracy": 0.9234168440103531,
"num_tokens": 61510553.0,
"step": 4850
},
{
"entropy": 0.2384765625,
"epoch": 3.662521198417185,
"grad_norm": 0.48342105746269226,
"learning_rate": 3.5292170505975286e-06,
"loss": 0.24164836406707763,
"mean_token_accuracy": 0.9242537707090378,
"num_tokens": 61641190.0,
"step": 4860
},
{
"entropy": 0.245166015625,
"epoch": 3.6700584134162426,
"grad_norm": 0.4898669421672821,
"learning_rate": 3.4920724896407877e-06,
"loss": 0.2510417699813843,
"mean_token_accuracy": 0.9203757330775261,
"num_tokens": 61772842.0,
"step": 4870
},
{
"entropy": 0.23450927734375,
"epoch": 3.6775956284153004,
"grad_norm": 0.5533488988876343,
"learning_rate": 3.455083040358861e-06,
"loss": 0.23881711959838867,
"mean_token_accuracy": 0.9239112094044686,
"num_tokens": 61901653.0,
"step": 4880
},
{
"entropy": 0.2240234375,
"epoch": 3.685132843414358,
"grad_norm": 0.3996533155441284,
"learning_rate": 3.4182495843681117e-06,
"loss": 0.22698888778686524,
"mean_token_accuracy": 0.927504974603653,
"num_tokens": 62041188.0,
"step": 4890
},
{
"entropy": 0.24088134765625,
"epoch": 3.692670058413416,
"grad_norm": 0.49964672327041626,
"learning_rate": 3.3815729995669322e-06,
"loss": 0.24840447902679444,
"mean_token_accuracy": 0.9213329881429673,
"num_tokens": 62173168.0,
"step": 4900
},
{
"entropy": 0.22628173828125,
"epoch": 3.7002072734124742,
"grad_norm": 0.4857988953590393,
"learning_rate": 3.345054160114789e-06,
"loss": 0.22398624420166016,
"mean_token_accuracy": 0.9263280004262924,
"num_tokens": 62297740.0,
"step": 4910
},
{
"entropy": 0.246728515625,
"epoch": 3.707744488411532,
"grad_norm": 0.4899304509162903,
"learning_rate": 3.308693936411421e-06,
"loss": 0.25445635318756105,
"mean_token_accuracy": 0.920192101597786,
"num_tokens": 62418710.0,
"step": 4920
},
{
"entropy": 0.24462890625,
"epoch": 3.71528170341059,
"grad_norm": 0.4868662655353546,
"learning_rate": 3.2724931950760576e-06,
"loss": 0.24715008735656738,
"mean_token_accuracy": 0.9194081127643585,
"num_tokens": 62538535.0,
"step": 4930
},
{
"epoch": 3.71528170341059,
"eval_entropy": 0.25196268472326805,
"eval_loss": 0.2968800365924835,
"eval_mean_token_accuracy": 0.9099598022469555,
"eval_num_tokens": 62538535.0,
"eval_runtime": 444.76,
"eval_samples_per_second": 5.965,
"eval_steps_per_second": 1.493,
"step": 4930
},
{
"entropy": 0.2277587890625,
"epoch": 3.7228189184096476,
"grad_norm": 0.5071448683738708,
"learning_rate": 3.236452798926807e-06,
"loss": 0.2292656660079956,
"mean_token_accuracy": 0.9266470044851303,
"num_tokens": 62663129.0,
"step": 4940
},
{
"entropy": 0.249853515625,
"epoch": 3.7303561334087054,
"grad_norm": 0.46776777505874634,
"learning_rate": 3.2005736069600446e-06,
"loss": 0.25865788459777833,
"mean_token_accuracy": 0.9170892059803009,
"num_tokens": 62779198.0,
"step": 4950
},
{
"entropy": 0.253662109375,
"epoch": 3.737893348407763,
"grad_norm": 0.5072009563446045,
"learning_rate": 3.1648564743299793e-06,
"loss": 0.2605839729309082,
"mean_token_accuracy": 0.9192040726542473,
"num_tokens": 62906493.0,
"step": 4960
},
{
"entropy": 0.249267578125,
"epoch": 3.7454305634068215,
"grad_norm": 0.5265138149261475,
"learning_rate": 3.12930225232824e-06,
"loss": 0.2564325571060181,
"mean_token_accuracy": 0.9199110895395279,
"num_tokens": 63034082.0,
"step": 4970
},
{
"entropy": 0.238427734375,
"epoch": 3.7529677784058793,
"grad_norm": 0.4928956627845764,
"learning_rate": 3.093911788363617e-06,
"loss": 0.2413705825805664,
"mean_token_accuracy": 0.9228529289364815,
"num_tokens": 63157973.0,
"step": 4980
},
{
"entropy": 0.2524169921875,
"epoch": 3.760504993404937,
"grad_norm": 0.5981191992759705,
"learning_rate": 3.058685925941832e-06,
"loss": 0.2596710443496704,
"mean_token_accuracy": 0.9180012375116349,
"num_tokens": 63280137.0,
"step": 4990
},
{
"entropy": 0.23251953125,
"epoch": 3.768042208403995,
"grad_norm": 0.482380211353302,
"learning_rate": 3.023625504645459e-06,
"loss": 0.24188435077667236,
"mean_token_accuracy": 0.9233495354652405,
"num_tokens": 63406930.0,
"step": 5000
},
{
"entropy": 0.23822021484375,
"epoch": 3.7755794234030526,
"grad_norm": 0.5340070128440857,
"learning_rate": 2.9887313601139023e-06,
"loss": 0.24011678695678712,
"mean_token_accuracy": 0.9242303058505058,
"num_tokens": 63533137.0,
"step": 5010
},
{
"entropy": 0.24560546875,
"epoch": 3.7831166384021104,
"grad_norm": 0.4129692316055298,
"learning_rate": 2.954004324023485e-06,
"loss": 0.25254933834075927,
"mean_token_accuracy": 0.9207971751689911,
"num_tokens": 63665433.0,
"step": 5020
},
{
"entropy": 0.2470947265625,
"epoch": 3.7906538534011682,
"grad_norm": 0.4447065591812134,
"learning_rate": 2.919445224067614e-06,
"loss": 0.2541998624801636,
"mean_token_accuracy": 0.9211808830499649,
"num_tokens": 63793265.0,
"step": 5030
},
{
"entropy": 0.242724609375,
"epoch": 3.798191068400226,
"grad_norm": 0.4375300109386444,
"learning_rate": 2.885054883937073e-06,
"loss": 0.24628190994262694,
"mean_token_accuracy": 0.9202960833907128,
"num_tokens": 63913932.0,
"step": 5040
},
{
"entropy": 0.2439208984375,
"epoch": 3.805728283399284,
"grad_norm": 0.5313498973846436,
"learning_rate": 2.8508341233003656e-06,
"loss": 0.2506706237792969,
"mean_token_accuracy": 0.9210630789399147,
"num_tokens": 64035256.0,
"step": 5050
},
{
"entropy": 0.2599853515625,
"epoch": 3.8132654983983416,
"grad_norm": 0.5273305773735046,
"learning_rate": 2.816783757784206e-06,
"loss": 0.2702688217163086,
"mean_token_accuracy": 0.9156295627355575,
"num_tokens": 64156686.0,
"step": 5060
},
{
"entropy": 0.25810546875,
"epoch": 3.8208027133973994,
"grad_norm": 0.5010347962379456,
"learning_rate": 2.7829045989540594e-06,
"loss": 0.2638701915740967,
"mean_token_accuracy": 0.9181295543909073,
"num_tokens": 64286554.0,
"step": 5070
},
{
"entropy": 0.2409423828125,
"epoch": 3.8283399283964576,
"grad_norm": 0.6270024180412292,
"learning_rate": 2.7491974542948087e-06,
"loss": 0.24303548336029052,
"mean_token_accuracy": 0.9216175884008407,
"num_tokens": 64406250.0,
"step": 5080
},
{
"entropy": 0.2555908203125,
"epoch": 3.8358771433955154,
"grad_norm": 0.50421142578125,
"learning_rate": 2.715663127191498e-06,
"loss": 0.2657378435134888,
"mean_token_accuracy": 0.918186990916729,
"num_tokens": 64546008.0,
"step": 5090
},
{
"entropy": 0.23912353515625,
"epoch": 3.8434143583945732,
"grad_norm": 0.5221638083457947,
"learning_rate": 2.682302416910201e-06,
"loss": 0.24288854598999024,
"mean_token_accuracy": 0.9223589122295379,
"num_tokens": 64673887.0,
"step": 5100
},
{
"epoch": 3.8434143583945732,
"eval_entropy": 0.25410847491528615,
"eval_loss": 0.29583480954170227,
"eval_mean_token_accuracy": 0.9102463329053787,
"eval_num_tokens": 64673887.0,
"eval_runtime": 444.3668,
"eval_samples_per_second": 5.97,
"eval_steps_per_second": 1.494,
"step": 5100
},
{
"entropy": 0.2464111328125,
"epoch": 3.850951573393631,
"grad_norm": 0.4669792354106903,
"learning_rate": 2.6491161185789525e-06,
"loss": 0.251127290725708,
"mean_token_accuracy": 0.9189326271414757,
"num_tokens": 64792525.0,
"step": 5110
},
{
"entropy": 0.23583984375,
"epoch": 3.858488788392689,
"grad_norm": 0.5284295678138733,
"learning_rate": 2.6161050231688145e-06,
"loss": 0.23496873378753663,
"mean_token_accuracy": 0.9242655590176583,
"num_tokens": 64927953.0,
"step": 5120
},
{
"entropy": 0.2385986328125,
"epoch": 3.8660260033917466,
"grad_norm": 0.4746510982513428,
"learning_rate": 2.583269917475015e-06,
"loss": 0.24602668285369872,
"mean_token_accuracy": 0.9217883810400963,
"num_tokens": 65060416.0,
"step": 5130
},
{
"entropy": 0.2327392578125,
"epoch": 3.873563218390805,
"grad_norm": 0.5625964999198914,
"learning_rate": 2.5506115840981905e-06,
"loss": 0.23991544246673585,
"mean_token_accuracy": 0.9225243136286736,
"num_tokens": 65180637.0,
"step": 5140
},
{
"entropy": 0.25853271484375,
"epoch": 3.8811004333898627,
"grad_norm": 0.49249470233917236,
"learning_rate": 2.5181308014257445e-06,
"loss": 0.2658606290817261,
"mean_token_accuracy": 0.9198394268751144,
"num_tokens": 65306476.0,
"step": 5150
},
{
"entropy": 0.2334228515625,
"epoch": 3.8886376483889205,
"grad_norm": 0.5490977168083191,
"learning_rate": 2.485828343613288e-06,
"loss": 0.23961324691772462,
"mean_token_accuracy": 0.9249249547719955,
"num_tokens": 65429741.0,
"step": 5160
},
{
"entropy": 0.22962646484375,
"epoch": 3.8961748633879782,
"grad_norm": 0.4870103597640991,
"learning_rate": 2.453704980566194e-06,
"loss": 0.2331066608428955,
"mean_token_accuracy": 0.9261724725365639,
"num_tokens": 65557932.0,
"step": 5170
},
{
"entropy": 0.2351806640625,
"epoch": 3.903712078387036,
"grad_norm": 0.5044042468070984,
"learning_rate": 2.421761477921232e-06,
"loss": 0.24697554111480713,
"mean_token_accuracy": 0.9232055351138115,
"num_tokens": 65685595.0,
"step": 5180
},
{
"entropy": 0.2565673828125,
"epoch": 3.911249293386094,
"grad_norm": 0.5367307662963867,
"learning_rate": 2.3899985970283446e-06,
"loss": 0.262367844581604,
"mean_token_accuracy": 0.916471290588379,
"num_tokens": 65794307.0,
"step": 5190
},
{
"entropy": 0.24423828125,
"epoch": 3.9187865083851516,
"grad_norm": 0.4560658633708954,
"learning_rate": 2.358417094932477e-06,
"loss": 0.255014443397522,
"mean_token_accuracy": 0.9187598779797554,
"num_tokens": 65921865.0,
"step": 5200
},
{
"entropy": 0.24368896484375,
"epoch": 3.9263237233842094,
"grad_norm": 0.517406165599823,
"learning_rate": 2.3270177243555483e-06,
"loss": 0.25057861804962156,
"mean_token_accuracy": 0.9210366785526276,
"num_tokens": 66042392.0,
"step": 5210
},
{
"entropy": 0.259814453125,
"epoch": 3.9338609383832672,
"grad_norm": 0.4247106909751892,
"learning_rate": 2.2958012336785075e-06,
"loss": 0.2645686626434326,
"mean_token_accuracy": 0.9183212980628014,
"num_tokens": 66174262.0,
"step": 5220
},
{
"entropy": 0.24361572265625,
"epoch": 3.941398153382325,
"grad_norm": 0.4038093388080597,
"learning_rate": 2.2647683669234964e-06,
"loss": 0.24378161430358886,
"mean_token_accuracy": 0.9212676301598549,
"num_tokens": 66308633.0,
"step": 5230
},
{
"entropy": 0.239697265625,
"epoch": 3.948935368381383,
"grad_norm": 0.5646233558654785,
"learning_rate": 2.2339198637361094e-06,
"loss": 0.24792141914367677,
"mean_token_accuracy": 0.9222084075212479,
"num_tokens": 66434122.0,
"step": 5240
},
{
"entropy": 0.25,
"epoch": 3.956472583380441,
"grad_norm": 0.5821533203125,
"learning_rate": 2.2032564593677773e-06,
"loss": 0.26183009147644043,
"mean_token_accuracy": 0.9185786202549935,
"num_tokens": 66557954.0,
"step": 5250
},
{
"entropy": 0.2566162109375,
"epoch": 3.964009798379499,
"grad_norm": 0.5635284781455994,
"learning_rate": 2.172778884658231e-06,
"loss": 0.2627396821975708,
"mean_token_accuracy": 0.9167688429355622,
"num_tokens": 66677221.0,
"step": 5260
},
{
"entropy": 0.2368408203125,
"epoch": 3.9715470133785566,
"grad_norm": 0.41133439540863037,
"learning_rate": 2.1424878660180935e-06,
"loss": 0.23894243240356444,
"mean_token_accuracy": 0.9241284295916558,
"num_tokens": 66810692.0,
"step": 5270
},
{
"epoch": 3.9715470133785566,
"eval_entropy": 0.25422613304781627,
"eval_loss": 0.29535341262817383,
"eval_mean_token_accuracy": 0.9102872919784971,
"eval_num_tokens": 66810692.0,
"eval_runtime": 444.4912,
"eval_samples_per_second": 5.969,
"eval_steps_per_second": 1.494,
"step": 5270
}
],
"logging_steps": 10,
"max_steps": 6635,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 170,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.062071673121931e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}