olmo2_1b_sft_plus_6 / trainer_state.json
suzeva's picture
Upload folder using huggingface_hub
4f1b784 verified
Raw
History Blame Contribute Delete
129 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 4508,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.4996726989746094,
"epoch": 0.0022186477342060014,
"grad_norm": 0.640625,
"learning_rate": 4.990017746228927e-05,
"loss": 1.1004,
"mean_token_accuracy": 0.7237629115581512,
"num_tokens": 909841.0,
"step": 10
},
{
"entropy": 1.4749152779579162,
"epoch": 0.004437295468412003,
"grad_norm": 0.609375,
"learning_rate": 4.978926353149956e-05,
"loss": 1.101,
"mean_token_accuracy": 0.7234805017709732,
"num_tokens": 1834174.0,
"step": 20
},
{
"entropy": 1.4161717116832733,
"epoch": 0.006655943202618004,
"grad_norm": 0.58203125,
"learning_rate": 4.967834960070985e-05,
"loss": 1.0533,
"mean_token_accuracy": 0.7340411610901356,
"num_tokens": 2779537.0,
"step": 30
},
{
"entropy": 1.4273382410407067,
"epoch": 0.008874590936824005,
"grad_norm": 0.5625,
"learning_rate": 4.9567435669920145e-05,
"loss": 1.0489,
"mean_token_accuracy": 0.7345465816557407,
"num_tokens": 3733014.0,
"step": 40
},
{
"entropy": 1.414509892463684,
"epoch": 0.011093238671030008,
"grad_norm": 0.5703125,
"learning_rate": 4.945652173913044e-05,
"loss": 1.0496,
"mean_token_accuracy": 0.7320007584989071,
"num_tokens": 4694268.0,
"step": 50
},
{
"entropy": 1.397396445274353,
"epoch": 0.013311886405236008,
"grad_norm": 0.53125,
"learning_rate": 4.934560780834073e-05,
"loss": 1.0067,
"mean_token_accuracy": 0.7418178603053093,
"num_tokens": 5617442.0,
"step": 60
},
{
"entropy": 1.4162584945559502,
"epoch": 0.01553053413944201,
"grad_norm": 0.59765625,
"learning_rate": 4.923469387755102e-05,
"loss": 1.0315,
"mean_token_accuracy": 0.7393374048173428,
"num_tokens": 6545669.0,
"step": 70
},
{
"entropy": 1.3941649526357651,
"epoch": 0.01774918187364801,
"grad_norm": 0.67578125,
"learning_rate": 4.9123779946761314e-05,
"loss": 1.0467,
"mean_token_accuracy": 0.7343609191477298,
"num_tokens": 7508566.0,
"step": 80
},
{
"entropy": 1.4546006247401237,
"epoch": 0.019967829607854013,
"grad_norm": 0.58203125,
"learning_rate": 4.9012866015971606e-05,
"loss": 1.0777,
"mean_token_accuracy": 0.7278525292873382,
"num_tokens": 8457985.0,
"step": 90
},
{
"entropy": 1.4280843511223793,
"epoch": 0.022186477342060015,
"grad_norm": 0.6328125,
"learning_rate": 4.8901952085181905e-05,
"loss": 1.0605,
"mean_token_accuracy": 0.7319539472460747,
"num_tokens": 9401548.0,
"step": 100
},
{
"entropy": 1.4251440301537515,
"epoch": 0.024405125076266018,
"grad_norm": 0.55859375,
"learning_rate": 4.87910381543922e-05,
"loss": 1.0505,
"mean_token_accuracy": 0.7344287090003491,
"num_tokens": 10343177.0,
"step": 110
},
{
"entropy": 1.3903976306319237,
"epoch": 0.026623772810472016,
"grad_norm": 0.5703125,
"learning_rate": 4.868012422360249e-05,
"loss": 1.012,
"mean_token_accuracy": 0.7406081691384315,
"num_tokens": 11262171.0,
"step": 120
},
{
"entropy": 1.4572355687618255,
"epoch": 0.02884242054467802,
"grad_norm": 0.6171875,
"learning_rate": 4.856921029281278e-05,
"loss": 1.0934,
"mean_token_accuracy": 0.7263241574168205,
"num_tokens": 12207213.0,
"step": 130
},
{
"entropy": 1.3774912744760512,
"epoch": 0.03106106827888402,
"grad_norm": 0.5703125,
"learning_rate": 4.845829636202307e-05,
"loss": 0.9988,
"mean_token_accuracy": 0.7457391232252121,
"num_tokens": 13169677.0,
"step": 140
},
{
"entropy": 1.3801545724272728,
"epoch": 0.03327971601309002,
"grad_norm": 0.578125,
"learning_rate": 4.8347382431233365e-05,
"loss": 1.0128,
"mean_token_accuracy": 0.7391506642103195,
"num_tokens": 14101879.0,
"step": 150
},
{
"entropy": 1.383959451317787,
"epoch": 0.03549836374729602,
"grad_norm": 0.5703125,
"learning_rate": 4.823646850044366e-05,
"loss": 1.0289,
"mean_token_accuracy": 0.7387954272329808,
"num_tokens": 15070630.0,
"step": 160
},
{
"entropy": 1.3918858915567398,
"epoch": 0.03771701148150203,
"grad_norm": 0.578125,
"learning_rate": 4.812555456965395e-05,
"loss": 1.0241,
"mean_token_accuracy": 0.7366124205291271,
"num_tokens": 16027843.0,
"step": 170
},
{
"entropy": 1.428921215236187,
"epoch": 0.039935659215708026,
"grad_norm": 0.56640625,
"learning_rate": 4.801464063886424e-05,
"loss": 1.036,
"mean_token_accuracy": 0.7360907278954982,
"num_tokens": 16947937.0,
"step": 180
},
{
"entropy": 1.4443669021129608,
"epoch": 0.042154306949914025,
"grad_norm": 0.60546875,
"learning_rate": 4.7903726708074534e-05,
"loss": 1.0389,
"mean_token_accuracy": 0.7340119168162346,
"num_tokens": 17851722.0,
"step": 190
},
{
"entropy": 1.4278473794460296,
"epoch": 0.04437295468412003,
"grad_norm": 0.5546875,
"learning_rate": 4.7792812777284826e-05,
"loss": 1.048,
"mean_token_accuracy": 0.7365864336490631,
"num_tokens": 18798538.0,
"step": 200
},
{
"entropy": 1.4079762324690819,
"epoch": 0.04659160241832603,
"grad_norm": 0.58203125,
"learning_rate": 4.768189884649512e-05,
"loss": 1.0217,
"mean_token_accuracy": 0.7381824173033238,
"num_tokens": 19746990.0,
"step": 210
},
{
"entropy": 1.4014856681227683,
"epoch": 0.048810250152532035,
"grad_norm": 0.5625,
"learning_rate": 4.757098491570541e-05,
"loss": 1.0218,
"mean_token_accuracy": 0.7401599958539009,
"num_tokens": 20669202.0,
"step": 220
},
{
"entropy": 1.3362741515040397,
"epoch": 0.051028897886738034,
"grad_norm": 0.54296875,
"learning_rate": 4.74600709849157e-05,
"loss": 0.9708,
"mean_token_accuracy": 0.7500613324344159,
"num_tokens": 21636384.0,
"step": 230
},
{
"entropy": 1.4148907586932182,
"epoch": 0.05324754562094403,
"grad_norm": 0.5703125,
"learning_rate": 4.7349157054126e-05,
"loss": 1.0376,
"mean_token_accuracy": 0.7359736375510693,
"num_tokens": 22574934.0,
"step": 240
},
{
"entropy": 1.4070934116840363,
"epoch": 0.05546619335515004,
"grad_norm": 0.62890625,
"learning_rate": 4.7238243123336293e-05,
"loss": 1.019,
"mean_token_accuracy": 0.7393471024930477,
"num_tokens": 23510479.0,
"step": 250
},
{
"entropy": 1.4115072026848794,
"epoch": 0.05768484108935604,
"grad_norm": 0.61328125,
"learning_rate": 4.7127329192546586e-05,
"loss": 1.0324,
"mean_token_accuracy": 0.7382585242390632,
"num_tokens": 24464735.0,
"step": 260
},
{
"entropy": 1.3863993905484677,
"epoch": 0.059903488823562036,
"grad_norm": 0.578125,
"learning_rate": 4.701641526175688e-05,
"loss": 0.9979,
"mean_token_accuracy": 0.7422027714550495,
"num_tokens": 25396556.0,
"step": 270
},
{
"entropy": 1.3688023373484612,
"epoch": 0.06212213655776804,
"grad_norm": 0.5859375,
"learning_rate": 4.690550133096717e-05,
"loss": 0.9956,
"mean_token_accuracy": 0.7453529857099056,
"num_tokens": 26353783.0,
"step": 280
},
{
"entropy": 1.3656944148242474,
"epoch": 0.06434078429197404,
"grad_norm": 0.5625,
"learning_rate": 4.679458740017746e-05,
"loss": 0.9969,
"mean_token_accuracy": 0.7447779856622219,
"num_tokens": 27304682.0,
"step": 290
},
{
"entropy": 1.3630746126174926,
"epoch": 0.06655943202618005,
"grad_norm": 0.5234375,
"learning_rate": 4.6683673469387754e-05,
"loss": 1.0053,
"mean_token_accuracy": 0.7430833972990513,
"num_tokens": 28275130.0,
"step": 300
},
{
"entropy": 1.405807738006115,
"epoch": 0.06877807976038605,
"grad_norm": 0.54296875,
"learning_rate": 4.6572759538598046e-05,
"loss": 1.0312,
"mean_token_accuracy": 0.736625573784113,
"num_tokens": 29208090.0,
"step": 310
},
{
"entropy": 1.4168103411793709,
"epoch": 0.07099672749459204,
"grad_norm": 0.5859375,
"learning_rate": 4.646184560780834e-05,
"loss": 1.0463,
"mean_token_accuracy": 0.7340070068836212,
"num_tokens": 30132884.0,
"step": 320
},
{
"entropy": 1.328667588531971,
"epoch": 0.07321537522879805,
"grad_norm": 0.578125,
"learning_rate": 4.635093167701863e-05,
"loss": 0.9905,
"mean_token_accuracy": 0.7449391677975654,
"num_tokens": 31096131.0,
"step": 330
},
{
"entropy": 1.3874380961060524,
"epoch": 0.07543402296300405,
"grad_norm": 0.55078125,
"learning_rate": 4.624001774622893e-05,
"loss": 0.9946,
"mean_token_accuracy": 0.7445168398320675,
"num_tokens": 32025666.0,
"step": 340
},
{
"entropy": 1.3859788089990617,
"epoch": 0.07765267069721005,
"grad_norm": 0.52734375,
"learning_rate": 4.612910381543922e-05,
"loss": 0.9871,
"mean_token_accuracy": 0.7463914036750794,
"num_tokens": 32965922.0,
"step": 350
},
{
"entropy": 1.4040928453207016,
"epoch": 0.07987131843141605,
"grad_norm": 0.58203125,
"learning_rate": 4.6018189884649514e-05,
"loss": 0.9979,
"mean_token_accuracy": 0.7431536763906479,
"num_tokens": 33896621.0,
"step": 360
},
{
"entropy": 1.4107008963823318,
"epoch": 0.08208996616562206,
"grad_norm": 0.6015625,
"learning_rate": 4.5907275953859806e-05,
"loss": 1.0311,
"mean_token_accuracy": 0.7370501346886158,
"num_tokens": 34842327.0,
"step": 370
},
{
"entropy": 1.3692341327667237,
"epoch": 0.08430861389982805,
"grad_norm": 0.546875,
"learning_rate": 4.57963620230701e-05,
"loss": 0.9932,
"mean_token_accuracy": 0.7449106052517891,
"num_tokens": 35785569.0,
"step": 380
},
{
"entropy": 1.3753847882151604,
"epoch": 0.08652726163403406,
"grad_norm": 0.55859375,
"learning_rate": 4.568544809228039e-05,
"loss": 1.0154,
"mean_token_accuracy": 0.7405989103019237,
"num_tokens": 36720371.0,
"step": 390
},
{
"entropy": 1.3850012436509131,
"epoch": 0.08874590936824006,
"grad_norm": 0.5546875,
"learning_rate": 4.557453416149068e-05,
"loss": 0.9946,
"mean_token_accuracy": 0.743626830726862,
"num_tokens": 37663502.0,
"step": 400
},
{
"entropy": 1.4084563165903092,
"epoch": 0.09096455710244605,
"grad_norm": 0.56640625,
"learning_rate": 4.5463620230700974e-05,
"loss": 1.0224,
"mean_token_accuracy": 0.7386880144476891,
"num_tokens": 38595385.0,
"step": 410
},
{
"entropy": 1.4221973702311517,
"epoch": 0.09318320483665206,
"grad_norm": 0.5625,
"learning_rate": 4.5352706299911266e-05,
"loss": 1.0401,
"mean_token_accuracy": 0.7350750401616096,
"num_tokens": 39560136.0,
"step": 420
},
{
"entropy": 1.3766985535621643,
"epoch": 0.09540185257085806,
"grad_norm": 0.57421875,
"learning_rate": 4.5241792369121565e-05,
"loss": 0.9819,
"mean_token_accuracy": 0.7460968688130378,
"num_tokens": 40504329.0,
"step": 430
},
{
"entropy": 1.3452365651726723,
"epoch": 0.09762050030506407,
"grad_norm": 0.5703125,
"learning_rate": 4.513087843833186e-05,
"loss": 0.9656,
"mean_token_accuracy": 0.7495473526418209,
"num_tokens": 41447374.0,
"step": 440
},
{
"entropy": 1.4052437961101532,
"epoch": 0.09983914803927006,
"grad_norm": 0.57421875,
"learning_rate": 4.501996450754215e-05,
"loss": 1.029,
"mean_token_accuracy": 0.7380021281540394,
"num_tokens": 42352403.0,
"step": 450
},
{
"entropy": 1.3656214989721775,
"epoch": 0.10205779577347607,
"grad_norm": 0.60546875,
"learning_rate": 4.490905057675244e-05,
"loss": 0.9861,
"mean_token_accuracy": 0.7466712445020676,
"num_tokens": 43285467.0,
"step": 460
},
{
"entropy": 1.359076064825058,
"epoch": 0.10427644350768207,
"grad_norm": 0.5078125,
"learning_rate": 4.4798136645962734e-05,
"loss": 0.9999,
"mean_token_accuracy": 0.743770582973957,
"num_tokens": 44255931.0,
"step": 470
},
{
"entropy": 1.3802897572517394,
"epoch": 0.10649509124188807,
"grad_norm": 0.57421875,
"learning_rate": 4.4687222715173026e-05,
"loss": 1.0001,
"mean_token_accuracy": 0.7432407602667809,
"num_tokens": 45184260.0,
"step": 480
},
{
"entropy": 1.3991574339568615,
"epoch": 0.10871373897609407,
"grad_norm": 0.578125,
"learning_rate": 4.457630878438332e-05,
"loss": 1.0154,
"mean_token_accuracy": 0.7401745900511741,
"num_tokens": 46148392.0,
"step": 490
},
{
"entropy": 1.3566242396831512,
"epoch": 0.11093238671030008,
"grad_norm": 0.61328125,
"learning_rate": 4.446539485359361e-05,
"loss": 0.9846,
"mean_token_accuracy": 0.7464064188301563,
"num_tokens": 47078335.0,
"step": 500
},
{
"entropy": 1.3858811572194099,
"epoch": 0.11315103444450607,
"grad_norm": 0.51171875,
"learning_rate": 4.43544809228039e-05,
"loss": 0.9912,
"mean_token_accuracy": 0.7457821436226368,
"num_tokens": 48018551.0,
"step": 510
},
{
"entropy": 1.3758568353950977,
"epoch": 0.11536968217871207,
"grad_norm": 0.51171875,
"learning_rate": 4.42435669920142e-05,
"loss": 0.9886,
"mean_token_accuracy": 0.7470844730734825,
"num_tokens": 48974568.0,
"step": 520
},
{
"entropy": 1.3550358980894088,
"epoch": 0.11758832991291808,
"grad_norm": 0.5390625,
"learning_rate": 4.4132653061224493e-05,
"loss": 0.9694,
"mean_token_accuracy": 0.7498566247522831,
"num_tokens": 49932695.0,
"step": 530
},
{
"entropy": 1.3841885790228843,
"epoch": 0.11980697764712407,
"grad_norm": 0.51953125,
"learning_rate": 4.4021739130434786e-05,
"loss": 1.0022,
"mean_token_accuracy": 0.7409815572202205,
"num_tokens": 50866996.0,
"step": 540
},
{
"entropy": 1.3405610300600528,
"epoch": 0.12202562538133008,
"grad_norm": 0.5625,
"learning_rate": 4.391082519964508e-05,
"loss": 0.9921,
"mean_token_accuracy": 0.746824074536562,
"num_tokens": 51808608.0,
"step": 550
},
{
"entropy": 1.3757329672574996,
"epoch": 0.12424427311553608,
"grad_norm": 0.5390625,
"learning_rate": 4.379991126885537e-05,
"loss": 0.9985,
"mean_token_accuracy": 0.7443767100572586,
"num_tokens": 52747915.0,
"step": 560
},
{
"entropy": 1.3554963186383246,
"epoch": 0.1264629208497421,
"grad_norm": 0.5625,
"learning_rate": 4.368899733806566e-05,
"loss": 0.9713,
"mean_token_accuracy": 0.7524632543325425,
"num_tokens": 53688292.0,
"step": 570
},
{
"entropy": 1.398676659166813,
"epoch": 0.12868156858394808,
"grad_norm": 0.56640625,
"learning_rate": 4.3578083407275954e-05,
"loss": 1.0127,
"mean_token_accuracy": 0.7388371795415878,
"num_tokens": 54653551.0,
"step": 580
},
{
"entropy": 1.3686447888612747,
"epoch": 0.13090021631815407,
"grad_norm": 0.57421875,
"learning_rate": 4.3467169476486246e-05,
"loss": 0.9858,
"mean_token_accuracy": 0.7466567374765873,
"num_tokens": 55613826.0,
"step": 590
},
{
"entropy": 1.3752284094691276,
"epoch": 0.1331188640523601,
"grad_norm": 0.578125,
"learning_rate": 4.335625554569654e-05,
"loss": 1.0096,
"mean_token_accuracy": 0.7415601670742035,
"num_tokens": 56548552.0,
"step": 600
},
{
"entropy": 1.3863979026675224,
"epoch": 0.13533751178656608,
"grad_norm": 0.57421875,
"learning_rate": 4.324534161490684e-05,
"loss": 1.0217,
"mean_token_accuracy": 0.7401334017515182,
"num_tokens": 57528307.0,
"step": 610
},
{
"entropy": 1.3773459926247598,
"epoch": 0.1375561595207721,
"grad_norm": 0.56640625,
"learning_rate": 4.313442768411713e-05,
"loss": 1.0188,
"mean_token_accuracy": 0.740601348131895,
"num_tokens": 58432573.0,
"step": 620
},
{
"entropy": 1.3685629293322563,
"epoch": 0.1397748072549781,
"grad_norm": 0.5703125,
"learning_rate": 4.302351375332742e-05,
"loss": 0.9738,
"mean_token_accuracy": 0.748286597430706,
"num_tokens": 59388628.0,
"step": 630
},
{
"entropy": 1.3901671305298806,
"epoch": 0.1419934549891841,
"grad_norm": 0.53125,
"learning_rate": 4.2912599822537714e-05,
"loss": 0.998,
"mean_token_accuracy": 0.7412993647158146,
"num_tokens": 60325800.0,
"step": 640
},
{
"entropy": 1.34510198533535,
"epoch": 0.1442121027233901,
"grad_norm": 0.54296875,
"learning_rate": 4.2801685891748006e-05,
"loss": 0.9638,
"mean_token_accuracy": 0.7532913006842137,
"num_tokens": 61300321.0,
"step": 650
},
{
"entropy": 1.3802052095532418,
"epoch": 0.1464307504575961,
"grad_norm": 0.578125,
"learning_rate": 4.26907719609583e-05,
"loss": 1.0103,
"mean_token_accuracy": 0.7420814141631127,
"num_tokens": 62232968.0,
"step": 660
},
{
"entropy": 1.346378207206726,
"epoch": 0.1486493981918021,
"grad_norm": 0.57421875,
"learning_rate": 4.257985803016859e-05,
"loss": 0.9557,
"mean_token_accuracy": 0.7515577465295792,
"num_tokens": 63184820.0,
"step": 670
},
{
"entropy": 1.3793225064873695,
"epoch": 0.1508680459260081,
"grad_norm": 0.53515625,
"learning_rate": 4.246894409937888e-05,
"loss": 1.0116,
"mean_token_accuracy": 0.7416508607566357,
"num_tokens": 64146856.0,
"step": 680
},
{
"entropy": 1.370984847843647,
"epoch": 0.1530866936602141,
"grad_norm": 0.53125,
"learning_rate": 4.2358030168589174e-05,
"loss": 0.9871,
"mean_token_accuracy": 0.7441729478538036,
"num_tokens": 65076302.0,
"step": 690
},
{
"entropy": 1.4060401052236557,
"epoch": 0.1553053413944201,
"grad_norm": 0.6171875,
"learning_rate": 4.224711623779947e-05,
"loss": 1.0304,
"mean_token_accuracy": 0.7379218600690365,
"num_tokens": 65997560.0,
"step": 700
},
{
"entropy": 1.3768175289034843,
"epoch": 0.1575239891286261,
"grad_norm": 0.56640625,
"learning_rate": 4.2136202307009765e-05,
"loss": 1.0149,
"mean_token_accuracy": 0.7417769655585289,
"num_tokens": 66965724.0,
"step": 710
},
{
"entropy": 1.340875183045864,
"epoch": 0.1597426368628321,
"grad_norm": 0.52734375,
"learning_rate": 4.202528837622006e-05,
"loss": 0.9412,
"mean_token_accuracy": 0.7555658839643001,
"num_tokens": 67898095.0,
"step": 720
},
{
"entropy": 1.391999800503254,
"epoch": 0.1619612845970381,
"grad_norm": 0.609375,
"learning_rate": 4.191437444543035e-05,
"loss": 0.9839,
"mean_token_accuracy": 0.7462506376206874,
"num_tokens": 68844871.0,
"step": 730
},
{
"entropy": 1.38314318805933,
"epoch": 0.16417993233124412,
"grad_norm": 0.51953125,
"learning_rate": 4.180346051464064e-05,
"loss": 1.0097,
"mean_token_accuracy": 0.7410484097898007,
"num_tokens": 69767489.0,
"step": 740
},
{
"entropy": 1.3815456658601761,
"epoch": 0.1663985800654501,
"grad_norm": 0.56640625,
"learning_rate": 4.1692546583850934e-05,
"loss": 0.9754,
"mean_token_accuracy": 0.7478328756988049,
"num_tokens": 70707718.0,
"step": 750
},
{
"entropy": 1.3746361419558526,
"epoch": 0.1686172277996561,
"grad_norm": 0.5859375,
"learning_rate": 4.1581632653061226e-05,
"loss": 0.987,
"mean_token_accuracy": 0.747043264657259,
"num_tokens": 71653766.0,
"step": 760
},
{
"entropy": 1.3854685127735138,
"epoch": 0.17083587553386212,
"grad_norm": 0.5625,
"learning_rate": 4.147071872227152e-05,
"loss": 1.0288,
"mean_token_accuracy": 0.7364709347486496,
"num_tokens": 72601815.0,
"step": 770
},
{
"entropy": 1.3882519789040089,
"epoch": 0.1730545232680681,
"grad_norm": 0.546875,
"learning_rate": 4.135980479148181e-05,
"loss": 1.0141,
"mean_token_accuracy": 0.7391402766108512,
"num_tokens": 73560646.0,
"step": 780
},
{
"entropy": 1.3660476624965667,
"epoch": 0.1752731710022741,
"grad_norm": 0.5703125,
"learning_rate": 4.124889086069211e-05,
"loss": 0.9924,
"mean_token_accuracy": 0.7450746014714241,
"num_tokens": 74500221.0,
"step": 790
},
{
"entropy": 1.3751828119158744,
"epoch": 0.17749181873648012,
"grad_norm": 0.5390625,
"learning_rate": 4.11379769299024e-05,
"loss": 1.0004,
"mean_token_accuracy": 0.7434543266892433,
"num_tokens": 75399976.0,
"step": 800
},
{
"entropy": 1.354314035922289,
"epoch": 0.17971046647068611,
"grad_norm": 0.51953125,
"learning_rate": 4.1027062999112693e-05,
"loss": 0.9623,
"mean_token_accuracy": 0.7510982856154442,
"num_tokens": 76358729.0,
"step": 810
},
{
"entropy": 1.3439435064792633,
"epoch": 0.1819291142048921,
"grad_norm": 0.56640625,
"learning_rate": 4.0916149068322986e-05,
"loss": 0.9607,
"mean_token_accuracy": 0.7531138896942139,
"num_tokens": 77311440.0,
"step": 820
},
{
"entropy": 1.3753922283649445,
"epoch": 0.18414776193909813,
"grad_norm": 0.546875,
"learning_rate": 4.080523513753328e-05,
"loss": 0.9839,
"mean_token_accuracy": 0.7464477054774761,
"num_tokens": 78248418.0,
"step": 830
},
{
"entropy": 1.3592103332281114,
"epoch": 0.18636640967330412,
"grad_norm": 0.52734375,
"learning_rate": 4.069432120674357e-05,
"loss": 0.9724,
"mean_token_accuracy": 0.7482516840100288,
"num_tokens": 79193662.0,
"step": 840
},
{
"entropy": 1.3815738067030907,
"epoch": 0.1885850574075101,
"grad_norm": 0.5859375,
"learning_rate": 4.058340727595386e-05,
"loss": 0.9826,
"mean_token_accuracy": 0.7456090994179249,
"num_tokens": 80111085.0,
"step": 850
},
{
"entropy": 1.3659467726945878,
"epoch": 0.19080370514171613,
"grad_norm": 0.52734375,
"learning_rate": 4.0472493345164154e-05,
"loss": 0.9858,
"mean_token_accuracy": 0.7455601133406162,
"num_tokens": 81041558.0,
"step": 860
},
{
"entropy": 1.39312274903059,
"epoch": 0.19302235287592212,
"grad_norm": 0.5546875,
"learning_rate": 4.0361579414374446e-05,
"loss": 1.0138,
"mean_token_accuracy": 0.7410866186022759,
"num_tokens": 81959502.0,
"step": 870
},
{
"entropy": 1.394485105574131,
"epoch": 0.19524100061012814,
"grad_norm": 0.60546875,
"learning_rate": 4.025066548358474e-05,
"loss": 1.0044,
"mean_token_accuracy": 0.7429567784070968,
"num_tokens": 82914796.0,
"step": 880
},
{
"entropy": 1.3824292540550231,
"epoch": 0.19745964834433413,
"grad_norm": 0.52734375,
"learning_rate": 4.013975155279504e-05,
"loss": 0.9947,
"mean_token_accuracy": 0.7459897518157959,
"num_tokens": 83875692.0,
"step": 890
},
{
"entropy": 1.327862946689129,
"epoch": 0.19967829607854012,
"grad_norm": 0.5546875,
"learning_rate": 4.002883762200533e-05,
"loss": 0.923,
"mean_token_accuracy": 0.7600434601306916,
"num_tokens": 84802764.0,
"step": 900
},
{
"entropy": 1.3845474988222122,
"epoch": 0.20189694381274614,
"grad_norm": 0.5703125,
"learning_rate": 3.991792369121562e-05,
"loss": 0.9861,
"mean_token_accuracy": 0.7468884617090226,
"num_tokens": 85748938.0,
"step": 910
},
{
"entropy": 1.3717331126332284,
"epoch": 0.20411559154695214,
"grad_norm": 0.54296875,
"learning_rate": 3.9807009760425914e-05,
"loss": 0.9829,
"mean_token_accuracy": 0.7473111696541309,
"num_tokens": 86700841.0,
"step": 920
},
{
"entropy": 1.3603821635246276,
"epoch": 0.20633423928115813,
"grad_norm": 0.515625,
"learning_rate": 3.9696095829636206e-05,
"loss": 0.9704,
"mean_token_accuracy": 0.7494109883904457,
"num_tokens": 87650079.0,
"step": 930
},
{
"entropy": 1.364639788120985,
"epoch": 0.20855288701536415,
"grad_norm": 0.5390625,
"learning_rate": 3.95851818988465e-05,
"loss": 0.9812,
"mean_token_accuracy": 0.7471095651388169,
"num_tokens": 88603707.0,
"step": 940
},
{
"entropy": 1.3764722615480423,
"epoch": 0.21077153474957014,
"grad_norm": 0.56640625,
"learning_rate": 3.947426796805679e-05,
"loss": 0.9736,
"mean_token_accuracy": 0.7484091036021709,
"num_tokens": 89540513.0,
"step": 950
},
{
"entropy": 1.3506674736738205,
"epoch": 0.21299018248377613,
"grad_norm": 0.578125,
"learning_rate": 3.936335403726708e-05,
"loss": 0.9689,
"mean_token_accuracy": 0.7476179704070092,
"num_tokens": 90483742.0,
"step": 960
},
{
"entropy": 1.3450557515025139,
"epoch": 0.21520883021798215,
"grad_norm": 0.578125,
"learning_rate": 3.9252440106477374e-05,
"loss": 0.968,
"mean_token_accuracy": 0.7493214279413223,
"num_tokens": 91434192.0,
"step": 970
},
{
"entropy": 1.329263025522232,
"epoch": 0.21742747795218814,
"grad_norm": 0.57421875,
"learning_rate": 3.914152617568767e-05,
"loss": 0.9536,
"mean_token_accuracy": 0.7544709414243698,
"num_tokens": 92377773.0,
"step": 980
},
{
"entropy": 1.352605053782463,
"epoch": 0.21964612568639413,
"grad_norm": 0.52734375,
"learning_rate": 3.9030612244897965e-05,
"loss": 0.9466,
"mean_token_accuracy": 0.7529656864702702,
"num_tokens": 93333525.0,
"step": 990
},
{
"entropy": 1.361532361805439,
"epoch": 0.22186477342060015,
"grad_norm": 0.54296875,
"learning_rate": 3.891969831410826e-05,
"loss": 0.9713,
"mean_token_accuracy": 0.7466711558401584,
"num_tokens": 94288415.0,
"step": 1000
},
{
"entropy": 1.400508201122284,
"epoch": 0.22408342115480614,
"grad_norm": 0.5703125,
"learning_rate": 3.880878438331855e-05,
"loss": 0.9905,
"mean_token_accuracy": 0.7447403699159623,
"num_tokens": 95210180.0,
"step": 1010
},
{
"entropy": 1.333881674706936,
"epoch": 0.22630206888901214,
"grad_norm": 0.55859375,
"learning_rate": 3.869787045252884e-05,
"loss": 0.9516,
"mean_token_accuracy": 0.7562138311564922,
"num_tokens": 96165001.0,
"step": 1020
},
{
"entropy": 1.3659777596592904,
"epoch": 0.22852071662321816,
"grad_norm": 0.5390625,
"learning_rate": 3.8586956521739134e-05,
"loss": 0.9796,
"mean_token_accuracy": 0.7488616541028023,
"num_tokens": 97118737.0,
"step": 1030
},
{
"entropy": 1.3581289164721966,
"epoch": 0.23073936435742415,
"grad_norm": 0.5078125,
"learning_rate": 3.8476042590949426e-05,
"loss": 0.9905,
"mean_token_accuracy": 0.7445513367652893,
"num_tokens": 98084593.0,
"step": 1040
},
{
"entropy": 1.3156771540641785,
"epoch": 0.23295801209163014,
"grad_norm": 0.50390625,
"learning_rate": 3.836512866015972e-05,
"loss": 0.9249,
"mean_token_accuracy": 0.758704387396574,
"num_tokens": 99029928.0,
"step": 1050
},
{
"entropy": 1.3755515664815903,
"epoch": 0.23517665982583616,
"grad_norm": 0.5390625,
"learning_rate": 3.825421472937001e-05,
"loss": 0.9974,
"mean_token_accuracy": 0.746151739358902,
"num_tokens": 100006819.0,
"step": 1060
},
{
"entropy": 1.3569506011903285,
"epoch": 0.23739530756004215,
"grad_norm": 0.5546875,
"learning_rate": 3.814330079858031e-05,
"loss": 0.9626,
"mean_token_accuracy": 0.7495047964155674,
"num_tokens": 100925967.0,
"step": 1070
},
{
"entropy": 1.3472113192081452,
"epoch": 0.23961395529424814,
"grad_norm": 0.54296875,
"learning_rate": 3.80323868677906e-05,
"loss": 0.9572,
"mean_token_accuracy": 0.7518169023096561,
"num_tokens": 101902867.0,
"step": 1080
},
{
"entropy": 1.3691953018307685,
"epoch": 0.24183260302845416,
"grad_norm": 0.5546875,
"learning_rate": 3.7921472937000893e-05,
"loss": 0.9385,
"mean_token_accuracy": 0.7557882443070412,
"num_tokens": 102819883.0,
"step": 1090
},
{
"entropy": 1.3221500940620898,
"epoch": 0.24405125076266015,
"grad_norm": 0.546875,
"learning_rate": 3.7810559006211186e-05,
"loss": 0.9363,
"mean_token_accuracy": 0.7567619226872921,
"num_tokens": 103770099.0,
"step": 1100
},
{
"entropy": 1.3552875474095345,
"epoch": 0.24626989849686615,
"grad_norm": 0.56640625,
"learning_rate": 3.769964507542148e-05,
"loss": 0.96,
"mean_token_accuracy": 0.7519307337701321,
"num_tokens": 104703977.0,
"step": 1110
},
{
"entropy": 1.3745846793055534,
"epoch": 0.24848854623107217,
"grad_norm": 0.57421875,
"learning_rate": 3.758873114463177e-05,
"loss": 0.9775,
"mean_token_accuracy": 0.746993649750948,
"num_tokens": 105614489.0,
"step": 1120
},
{
"entropy": 1.379011509567499,
"epoch": 0.2507071939652782,
"grad_norm": 0.494140625,
"learning_rate": 3.747781721384206e-05,
"loss": 0.9913,
"mean_token_accuracy": 0.7447584941983223,
"num_tokens": 106570238.0,
"step": 1130
},
{
"entropy": 1.3902081191539764,
"epoch": 0.2529258416994842,
"grad_norm": 0.58203125,
"learning_rate": 3.7366903283052354e-05,
"loss": 0.9864,
"mean_token_accuracy": 0.746292807906866,
"num_tokens": 107501226.0,
"step": 1140
},
{
"entropy": 1.3556282117962837,
"epoch": 0.25514448943369017,
"grad_norm": 0.55078125,
"learning_rate": 3.7255989352262646e-05,
"loss": 0.9811,
"mean_token_accuracy": 0.7470501571893692,
"num_tokens": 108445475.0,
"step": 1150
},
{
"entropy": 1.3668062418699265,
"epoch": 0.25736313716789616,
"grad_norm": 0.53515625,
"learning_rate": 3.714507542147294e-05,
"loss": 0.9785,
"mean_token_accuracy": 0.7489332385361195,
"num_tokens": 109362028.0,
"step": 1160
},
{
"entropy": 1.3806826993823051,
"epoch": 0.25958178490210215,
"grad_norm": 0.5078125,
"learning_rate": 3.703416149068323e-05,
"loss": 0.9682,
"mean_token_accuracy": 0.7490875221788883,
"num_tokens": 110308226.0,
"step": 1170
},
{
"entropy": 1.3806460306048394,
"epoch": 0.26180043263630814,
"grad_norm": 0.55859375,
"learning_rate": 3.692324755989352e-05,
"loss": 0.9937,
"mean_token_accuracy": 0.7435216665267944,
"num_tokens": 111243611.0,
"step": 1180
},
{
"entropy": 1.3768418952822685,
"epoch": 0.2640190803705142,
"grad_norm": 0.5546875,
"learning_rate": 3.6812333629103815e-05,
"loss": 1.0088,
"mean_token_accuracy": 0.741937792301178,
"num_tokens": 112158924.0,
"step": 1190
},
{
"entropy": 1.3587884977459908,
"epoch": 0.2662377281047202,
"grad_norm": 0.56640625,
"learning_rate": 3.670141969831411e-05,
"loss": 0.9634,
"mean_token_accuracy": 0.7523072622716427,
"num_tokens": 113114964.0,
"step": 1200
},
{
"entropy": 1.3679104253649712,
"epoch": 0.2684563758389262,
"grad_norm": 0.58984375,
"learning_rate": 3.65905057675244e-05,
"loss": 0.979,
"mean_token_accuracy": 0.7477054476737977,
"num_tokens": 114050174.0,
"step": 1210
},
{
"entropy": 1.355040068924427,
"epoch": 0.27067502357313217,
"grad_norm": 0.57421875,
"learning_rate": 3.64795918367347e-05,
"loss": 0.9668,
"mean_token_accuracy": 0.75032162591815,
"num_tokens": 114988970.0,
"step": 1220
},
{
"entropy": 1.3842439249157905,
"epoch": 0.27289367130733816,
"grad_norm": 0.546875,
"learning_rate": 3.636867790594499e-05,
"loss": 0.9967,
"mean_token_accuracy": 0.7448992133140564,
"num_tokens": 115921292.0,
"step": 1230
},
{
"entropy": 1.386633063107729,
"epoch": 0.2751123190415442,
"grad_norm": 0.59765625,
"learning_rate": 3.625776397515528e-05,
"loss": 0.9982,
"mean_token_accuracy": 0.7450036846101284,
"num_tokens": 116870507.0,
"step": 1240
},
{
"entropy": 1.3373503908514977,
"epoch": 0.2773309667757502,
"grad_norm": 0.546875,
"learning_rate": 3.6146850044365574e-05,
"loss": 0.9631,
"mean_token_accuracy": 0.7503526777029037,
"num_tokens": 117814194.0,
"step": 1250
},
{
"entropy": 1.3738537311553956,
"epoch": 0.2795496145099562,
"grad_norm": 0.53515625,
"learning_rate": 3.6035936113575866e-05,
"loss": 0.9636,
"mean_token_accuracy": 0.7519263453781605,
"num_tokens": 118745944.0,
"step": 1260
},
{
"entropy": 1.373944465816021,
"epoch": 0.2817682622441622,
"grad_norm": 0.55078125,
"learning_rate": 3.592502218278616e-05,
"loss": 0.9946,
"mean_token_accuracy": 0.7430286034941673,
"num_tokens": 119703256.0,
"step": 1270
},
{
"entropy": 1.3817725293338299,
"epoch": 0.2839869099783682,
"grad_norm": 0.5546875,
"learning_rate": 3.581410825199645e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.7412588849663735,
"num_tokens": 120632316.0,
"step": 1280
},
{
"entropy": 1.383293604105711,
"epoch": 0.28620555771257417,
"grad_norm": 0.546875,
"learning_rate": 3.570319432120674e-05,
"loss": 1.0004,
"mean_token_accuracy": 0.7431584998965264,
"num_tokens": 121557708.0,
"step": 1290
},
{
"entropy": 1.3742095410823822,
"epoch": 0.2884242054467802,
"grad_norm": 0.56640625,
"learning_rate": 3.5592280390417035e-05,
"loss": 0.9699,
"mean_token_accuracy": 0.7505590744316578,
"num_tokens": 122515689.0,
"step": 1300
},
{
"entropy": 1.3871235311031342,
"epoch": 0.2906428531809862,
"grad_norm": 0.5703125,
"learning_rate": 3.548136645962733e-05,
"loss": 0.9824,
"mean_token_accuracy": 0.7457533970475196,
"num_tokens": 123456033.0,
"step": 1310
},
{
"entropy": 1.3561372354626655,
"epoch": 0.2928615009151922,
"grad_norm": 0.5625,
"learning_rate": 3.537045252883762e-05,
"loss": 0.9547,
"mean_token_accuracy": 0.7511110901832581,
"num_tokens": 124410678.0,
"step": 1320
},
{
"entropy": 1.3228459164500237,
"epoch": 0.2950801486493982,
"grad_norm": 0.55078125,
"learning_rate": 3.525953859804791e-05,
"loss": 0.9167,
"mean_token_accuracy": 0.7597990974783897,
"num_tokens": 125353637.0,
"step": 1330
},
{
"entropy": 1.3309078864753245,
"epoch": 0.2972987963836042,
"grad_norm": 0.70703125,
"learning_rate": 3.514862466725821e-05,
"loss": 0.9623,
"mean_token_accuracy": 0.7502509340643883,
"num_tokens": 126291010.0,
"step": 1340
},
{
"entropy": 1.375917912274599,
"epoch": 0.29951744411781017,
"grad_norm": 2.46875,
"learning_rate": 3.50377107364685e-05,
"loss": 0.9729,
"mean_token_accuracy": 0.7492444895207881,
"num_tokens": 127237461.0,
"step": 1350
},
{
"entropy": 1.3652615778148174,
"epoch": 0.3017360918520162,
"grad_norm": 0.578125,
"learning_rate": 3.4926796805678794e-05,
"loss": 0.9673,
"mean_token_accuracy": 0.7486005112528801,
"num_tokens": 128184481.0,
"step": 1360
},
{
"entropy": 1.361464273929596,
"epoch": 0.3039547395862222,
"grad_norm": 0.55078125,
"learning_rate": 3.481588287488909e-05,
"loss": 0.9848,
"mean_token_accuracy": 0.7459657743573189,
"num_tokens": 129136106.0,
"step": 1370
},
{
"entropy": 1.3367391996085645,
"epoch": 0.3061733873204282,
"grad_norm": 0.53125,
"learning_rate": 3.470496894409938e-05,
"loss": 0.9721,
"mean_token_accuracy": 0.7480074115097523,
"num_tokens": 130083779.0,
"step": 1380
},
{
"entropy": 1.345343752205372,
"epoch": 0.3083920350546342,
"grad_norm": 0.57421875,
"learning_rate": 3.459405501330967e-05,
"loss": 0.9301,
"mean_token_accuracy": 0.7568992510437965,
"num_tokens": 131031114.0,
"step": 1390
},
{
"entropy": 1.37344888150692,
"epoch": 0.3106106827888402,
"grad_norm": 0.55859375,
"learning_rate": 3.448314108251996e-05,
"loss": 0.9955,
"mean_token_accuracy": 0.745458111166954,
"num_tokens": 131970717.0,
"step": 1400
},
{
"entropy": 1.3943381957709788,
"epoch": 0.3128293305230462,
"grad_norm": 0.5546875,
"learning_rate": 3.4372227151730255e-05,
"loss": 0.9955,
"mean_token_accuracy": 0.743470398336649,
"num_tokens": 132916501.0,
"step": 1410
},
{
"entropy": 1.3412963405251503,
"epoch": 0.3150479782572522,
"grad_norm": 0.54296875,
"learning_rate": 3.426131322094055e-05,
"loss": 0.9656,
"mean_token_accuracy": 0.751042614877224,
"num_tokens": 133855964.0,
"step": 1420
},
{
"entropy": 1.3560855656862258,
"epoch": 0.3172666259914582,
"grad_norm": 0.5625,
"learning_rate": 3.415039929015084e-05,
"loss": 0.9734,
"mean_token_accuracy": 0.7487790770828724,
"num_tokens": 134794608.0,
"step": 1430
},
{
"entropy": 1.3474852062761784,
"epoch": 0.3194852737256642,
"grad_norm": 0.546875,
"learning_rate": 3.403948535936114e-05,
"loss": 0.9772,
"mean_token_accuracy": 0.7492424316704274,
"num_tokens": 135743072.0,
"step": 1440
},
{
"entropy": 1.3934367418289184,
"epoch": 0.3217039214598702,
"grad_norm": 0.55078125,
"learning_rate": 3.392857142857143e-05,
"loss": 1.0063,
"mean_token_accuracy": 0.7409680478274823,
"num_tokens": 136659708.0,
"step": 1450
},
{
"entropy": 1.3512530893087387,
"epoch": 0.3239225691940762,
"grad_norm": 0.55859375,
"learning_rate": 3.381765749778172e-05,
"loss": 0.9717,
"mean_token_accuracy": 0.7517142631113529,
"num_tokens": 137609079.0,
"step": 1460
},
{
"entropy": 1.3412357300519944,
"epoch": 0.3261412169282822,
"grad_norm": 0.546875,
"learning_rate": 3.3706743566992015e-05,
"loss": 0.9477,
"mean_token_accuracy": 0.7528042688965797,
"num_tokens": 138553919.0,
"step": 1470
},
{
"entropy": 1.3442728258669376,
"epoch": 0.32835986466248823,
"grad_norm": 0.54296875,
"learning_rate": 3.359582963620231e-05,
"loss": 0.9464,
"mean_token_accuracy": 0.7520667724311352,
"num_tokens": 139484549.0,
"step": 1480
},
{
"entropy": 1.3433556392788888,
"epoch": 0.3305785123966942,
"grad_norm": 0.546875,
"learning_rate": 3.34849157054126e-05,
"loss": 0.9377,
"mean_token_accuracy": 0.7539769187569618,
"num_tokens": 140426792.0,
"step": 1490
},
{
"entropy": 1.325501861423254,
"epoch": 0.3327971601309002,
"grad_norm": 0.5,
"learning_rate": 3.337400177462289e-05,
"loss": 0.9226,
"mean_token_accuracy": 0.7607504710555076,
"num_tokens": 141371155.0,
"step": 1500
},
{
"entropy": 1.3407476291060447,
"epoch": 0.3350158078651062,
"grad_norm": 0.55078125,
"learning_rate": 3.326308784383318e-05,
"loss": 0.9537,
"mean_token_accuracy": 0.7520662292838096,
"num_tokens": 142331590.0,
"step": 1510
},
{
"entropy": 1.329257782548666,
"epoch": 0.3372344555993122,
"grad_norm": 0.5390625,
"learning_rate": 3.3152173913043475e-05,
"loss": 0.9312,
"mean_token_accuracy": 0.7564695417881012,
"num_tokens": 143254361.0,
"step": 1520
},
{
"entropy": 1.388334572315216,
"epoch": 0.33945310333351825,
"grad_norm": 0.58203125,
"learning_rate": 3.3041259982253774e-05,
"loss": 0.9958,
"mean_token_accuracy": 0.7436298795044423,
"num_tokens": 144217386.0,
"step": 1530
},
{
"entropy": 1.3446097187697887,
"epoch": 0.34167175106772424,
"grad_norm": 0.5625,
"learning_rate": 3.2930346051464066e-05,
"loss": 0.9654,
"mean_token_accuracy": 0.7493618465960026,
"num_tokens": 145142821.0,
"step": 1540
},
{
"entropy": 1.371129809319973,
"epoch": 0.34389039880193023,
"grad_norm": 0.6015625,
"learning_rate": 3.281943212067436e-05,
"loss": 0.9937,
"mean_token_accuracy": 0.7430687204003334,
"num_tokens": 146063376.0,
"step": 1550
},
{
"entropy": 1.3537682175636292,
"epoch": 0.3461090465361362,
"grad_norm": 0.58203125,
"learning_rate": 3.270851818988465e-05,
"loss": 0.99,
"mean_token_accuracy": 0.7446731366217136,
"num_tokens": 146991473.0,
"step": 1560
},
{
"entropy": 1.3684612050652505,
"epoch": 0.3483276942703422,
"grad_norm": 0.578125,
"learning_rate": 3.259760425909494e-05,
"loss": 0.9916,
"mean_token_accuracy": 0.7439785785973072,
"num_tokens": 147938218.0,
"step": 1570
},
{
"entropy": 1.3405075147747993,
"epoch": 0.3505463420045482,
"grad_norm": 0.53125,
"learning_rate": 3.2486690328305235e-05,
"loss": 0.9367,
"mean_token_accuracy": 0.7569099083542824,
"num_tokens": 148892689.0,
"step": 1580
},
{
"entropy": 1.3668345354497433,
"epoch": 0.35276498973875425,
"grad_norm": 0.5234375,
"learning_rate": 3.237577639751553e-05,
"loss": 1.0039,
"mean_token_accuracy": 0.7430003948509694,
"num_tokens": 149855777.0,
"step": 1590
},
{
"entropy": 1.3536728963255882,
"epoch": 0.35498363747296025,
"grad_norm": 0.5390625,
"learning_rate": 3.226486246672582e-05,
"loss": 0.941,
"mean_token_accuracy": 0.7554409049451352,
"num_tokens": 150788457.0,
"step": 1600
},
{
"entropy": 1.3560076355934143,
"epoch": 0.35720228520716624,
"grad_norm": 0.5234375,
"learning_rate": 3.215394853593611e-05,
"loss": 0.9564,
"mean_token_accuracy": 0.7533373937010766,
"num_tokens": 151725184.0,
"step": 1610
},
{
"entropy": 1.3634236186742783,
"epoch": 0.35942093294137223,
"grad_norm": 0.54296875,
"learning_rate": 3.204303460514641e-05,
"loss": 0.9729,
"mean_token_accuracy": 0.7496181048452855,
"num_tokens": 152659898.0,
"step": 1620
},
{
"entropy": 1.3436542712152004,
"epoch": 0.3616395806755782,
"grad_norm": 0.54296875,
"learning_rate": 3.19321206743567e-05,
"loss": 0.942,
"mean_token_accuracy": 0.7547677598893643,
"num_tokens": 153575877.0,
"step": 1630
},
{
"entropy": 1.3383269011974335,
"epoch": 0.3638582284097842,
"grad_norm": 0.54296875,
"learning_rate": 3.1821206743566994e-05,
"loss": 0.9586,
"mean_token_accuracy": 0.752650099247694,
"num_tokens": 154524747.0,
"step": 1640
},
{
"entropy": 1.3560621812939644,
"epoch": 0.36607687614399026,
"grad_norm": 0.5703125,
"learning_rate": 3.171029281277729e-05,
"loss": 0.9661,
"mean_token_accuracy": 0.7512250438332557,
"num_tokens": 155446708.0,
"step": 1650
},
{
"entropy": 1.33823501765728,
"epoch": 0.36829552387819625,
"grad_norm": 0.54296875,
"learning_rate": 3.159937888198758e-05,
"loss": 0.9506,
"mean_token_accuracy": 0.7525983549654484,
"num_tokens": 156421334.0,
"step": 1660
},
{
"entropy": 1.3900124236941338,
"epoch": 0.37051417161240224,
"grad_norm": 0.55859375,
"learning_rate": 3.148846495119787e-05,
"loss": 1.0267,
"mean_token_accuracy": 0.7392269425094128,
"num_tokens": 157348131.0,
"step": 1670
},
{
"entropy": 1.382587905973196,
"epoch": 0.37273281934660824,
"grad_norm": 0.5390625,
"learning_rate": 3.137755102040816e-05,
"loss": 1.0009,
"mean_token_accuracy": 0.7422369658946991,
"num_tokens": 158290254.0,
"step": 1680
},
{
"entropy": 1.3116468265652657,
"epoch": 0.3749514670808142,
"grad_norm": 0.50390625,
"learning_rate": 3.1266637089618455e-05,
"loss": 0.9484,
"mean_token_accuracy": 0.7536117002367974,
"num_tokens": 159223319.0,
"step": 1690
},
{
"entropy": 1.369352640211582,
"epoch": 0.3771701148150202,
"grad_norm": 0.58203125,
"learning_rate": 3.115572315882875e-05,
"loss": 0.9948,
"mean_token_accuracy": 0.7430945433676243,
"num_tokens": 160153728.0,
"step": 1700
},
{
"entropy": 1.3820845365524292,
"epoch": 0.37938876254922627,
"grad_norm": 0.53515625,
"learning_rate": 3.1044809228039046e-05,
"loss": 0.9902,
"mean_token_accuracy": 0.7446745671331882,
"num_tokens": 161082297.0,
"step": 1710
},
{
"entropy": 1.3555257454514504,
"epoch": 0.38160741028343226,
"grad_norm": 0.52734375,
"learning_rate": 3.093389529724934e-05,
"loss": 0.9932,
"mean_token_accuracy": 0.7462766982614994,
"num_tokens": 162025680.0,
"step": 1720
},
{
"entropy": 1.3567566007375718,
"epoch": 0.38382605801763825,
"grad_norm": 0.54296875,
"learning_rate": 3.082298136645963e-05,
"loss": 0.9669,
"mean_token_accuracy": 0.7502202562987804,
"num_tokens": 162959342.0,
"step": 1730
},
{
"entropy": 1.3683917000889778,
"epoch": 0.38604470575184424,
"grad_norm": 0.58203125,
"learning_rate": 3.071206743566992e-05,
"loss": 0.9881,
"mean_token_accuracy": 0.7448588319122791,
"num_tokens": 163880040.0,
"step": 1740
},
{
"entropy": 1.3426910683512687,
"epoch": 0.38826335348605023,
"grad_norm": 0.546875,
"learning_rate": 3.0601153504880215e-05,
"loss": 0.9519,
"mean_token_accuracy": 0.7537251867353916,
"num_tokens": 164818895.0,
"step": 1750
},
{
"entropy": 1.3621003210544587,
"epoch": 0.3904820012202563,
"grad_norm": 0.53515625,
"learning_rate": 3.0490239574090507e-05,
"loss": 0.9675,
"mean_token_accuracy": 0.7497253358364105,
"num_tokens": 165782211.0,
"step": 1760
},
{
"entropy": 1.3328422799706459,
"epoch": 0.3927006489544623,
"grad_norm": 0.53515625,
"learning_rate": 3.03793256433008e-05,
"loss": 0.9581,
"mean_token_accuracy": 0.7515999570488929,
"num_tokens": 166723681.0,
"step": 1770
},
{
"entropy": 1.310817752033472,
"epoch": 0.39491929668866826,
"grad_norm": 0.53125,
"learning_rate": 3.026841171251109e-05,
"loss": 0.9207,
"mean_token_accuracy": 0.7629957444965839,
"num_tokens": 167681826.0,
"step": 1780
},
{
"entropy": 1.3678661212325096,
"epoch": 0.39713794442287426,
"grad_norm": 0.5859375,
"learning_rate": 3.0157497781721383e-05,
"loss": 0.9722,
"mean_token_accuracy": 0.7485598646104336,
"num_tokens": 168615498.0,
"step": 1790
},
{
"entropy": 1.3442377656698228,
"epoch": 0.39935659215708025,
"grad_norm": 0.59765625,
"learning_rate": 3.0046583850931682e-05,
"loss": 0.9293,
"mean_token_accuracy": 0.7590565107762813,
"num_tokens": 169554298.0,
"step": 1800
},
{
"entropy": 1.368715339899063,
"epoch": 0.40157523989128624,
"grad_norm": 0.578125,
"learning_rate": 2.9935669920141974e-05,
"loss": 0.9773,
"mean_token_accuracy": 0.7482131317257881,
"num_tokens": 170486143.0,
"step": 1810
},
{
"entropy": 1.3645600192248821,
"epoch": 0.4037938876254923,
"grad_norm": 0.51171875,
"learning_rate": 2.9824755989352266e-05,
"loss": 0.9689,
"mean_token_accuracy": 0.7496557794511318,
"num_tokens": 171436267.0,
"step": 1820
},
{
"entropy": 1.360542993992567,
"epoch": 0.4060125353596983,
"grad_norm": 0.5390625,
"learning_rate": 2.971384205856256e-05,
"loss": 0.9738,
"mean_token_accuracy": 0.7470414891839028,
"num_tokens": 172361708.0,
"step": 1830
},
{
"entropy": 1.3571796461939811,
"epoch": 0.40823118309390427,
"grad_norm": 0.55078125,
"learning_rate": 2.960292812777285e-05,
"loss": 0.977,
"mean_token_accuracy": 0.7466642953455448,
"num_tokens": 173304422.0,
"step": 1840
},
{
"entropy": 1.3569322228431702,
"epoch": 0.41044983082811026,
"grad_norm": 0.53515625,
"learning_rate": 2.9492014196983143e-05,
"loss": 0.9536,
"mean_token_accuracy": 0.7540878303349018,
"num_tokens": 174236098.0,
"step": 1850
},
{
"entropy": 1.3723473891615867,
"epoch": 0.41266847856231625,
"grad_norm": 0.52734375,
"learning_rate": 2.9381100266193435e-05,
"loss": 0.9987,
"mean_token_accuracy": 0.7455512471497059,
"num_tokens": 175171519.0,
"step": 1860
},
{
"entropy": 1.3791632324457168,
"epoch": 0.41488712629652225,
"grad_norm": 0.55078125,
"learning_rate": 2.9270186335403727e-05,
"loss": 0.9508,
"mean_token_accuracy": 0.7529595606029034,
"num_tokens": 176092982.0,
"step": 1870
},
{
"entropy": 1.3743179097771645,
"epoch": 0.4171057740307283,
"grad_norm": 0.52734375,
"learning_rate": 2.915927240461402e-05,
"loss": 0.9734,
"mean_token_accuracy": 0.7494499087333679,
"num_tokens": 177060429.0,
"step": 1880
},
{
"entropy": 1.3471356205642224,
"epoch": 0.4193244217649343,
"grad_norm": 0.58203125,
"learning_rate": 2.9048358473824318e-05,
"loss": 0.9605,
"mean_token_accuracy": 0.7509974204003811,
"num_tokens": 178025303.0,
"step": 1890
},
{
"entropy": 1.3652866527438163,
"epoch": 0.4215430694991403,
"grad_norm": 0.55859375,
"learning_rate": 2.893744454303461e-05,
"loss": 0.9779,
"mean_token_accuracy": 0.7496740512549878,
"num_tokens": 178956578.0,
"step": 1900
},
{
"entropy": 1.355041117966175,
"epoch": 0.42376171723334627,
"grad_norm": 0.515625,
"learning_rate": 2.8826530612244902e-05,
"loss": 0.959,
"mean_token_accuracy": 0.7527659654617309,
"num_tokens": 179899402.0,
"step": 1910
},
{
"entropy": 1.3641887351870536,
"epoch": 0.42598036496755226,
"grad_norm": 0.5703125,
"learning_rate": 2.8715616681455194e-05,
"loss": 0.9457,
"mean_token_accuracy": 0.7552632115781307,
"num_tokens": 180827499.0,
"step": 1920
},
{
"entropy": 1.3468473985791207,
"epoch": 0.42819901270175825,
"grad_norm": 0.55859375,
"learning_rate": 2.8604702750665487e-05,
"loss": 0.9572,
"mean_token_accuracy": 0.7524127073585987,
"num_tokens": 181771979.0,
"step": 1930
},
{
"entropy": 1.3425350815057755,
"epoch": 0.4304176604359643,
"grad_norm": 0.50390625,
"learning_rate": 2.849378881987578e-05,
"loss": 0.9408,
"mean_token_accuracy": 0.7537083625793457,
"num_tokens": 182712453.0,
"step": 1940
},
{
"entropy": 1.3628494575619698,
"epoch": 0.4326363081701703,
"grad_norm": 0.5546875,
"learning_rate": 2.838287488908607e-05,
"loss": 0.9566,
"mean_token_accuracy": 0.7520852789282799,
"num_tokens": 183659069.0,
"step": 1950
},
{
"entropy": 1.3504344090819358,
"epoch": 0.4348549559043763,
"grad_norm": 0.58984375,
"learning_rate": 2.8271960958296363e-05,
"loss": 0.9631,
"mean_token_accuracy": 0.7504830814898014,
"num_tokens": 184596569.0,
"step": 1960
},
{
"entropy": 1.364800187200308,
"epoch": 0.4370736036385823,
"grad_norm": 0.55859375,
"learning_rate": 2.8161047027506655e-05,
"loss": 0.9659,
"mean_token_accuracy": 0.75085094794631,
"num_tokens": 185522825.0,
"step": 1970
},
{
"entropy": 1.3836459085345267,
"epoch": 0.43929225137278827,
"grad_norm": 0.5625,
"learning_rate": 2.8050133096716947e-05,
"loss": 0.9855,
"mean_token_accuracy": 0.7443784818053245,
"num_tokens": 186445738.0,
"step": 1980
},
{
"entropy": 1.3496420353651046,
"epoch": 0.4415108991069943,
"grad_norm": 0.5546875,
"learning_rate": 2.7939219165927243e-05,
"loss": 0.9816,
"mean_token_accuracy": 0.7476452320814133,
"num_tokens": 187399391.0,
"step": 1990
},
{
"entropy": 1.3308730378746987,
"epoch": 0.4437295468412003,
"grad_norm": 0.5078125,
"learning_rate": 2.7828305235137535e-05,
"loss": 0.9431,
"mean_token_accuracy": 0.7563184469938278,
"num_tokens": 188372699.0,
"step": 2000
},
{
"entropy": 1.3839409291744231,
"epoch": 0.4459481945754063,
"grad_norm": 0.578125,
"learning_rate": 2.7717391304347827e-05,
"loss": 0.9981,
"mean_token_accuracy": 0.7429635897278786,
"num_tokens": 189301311.0,
"step": 2010
},
{
"entropy": 1.3560212314128877,
"epoch": 0.4481668423096123,
"grad_norm": 0.5546875,
"learning_rate": 2.760647737355812e-05,
"loss": 0.9725,
"mean_token_accuracy": 0.7480806417763233,
"num_tokens": 190232558.0,
"step": 2020
},
{
"entropy": 1.3780321873724461,
"epoch": 0.4503854900438183,
"grad_norm": 1.1875,
"learning_rate": 2.749556344276841e-05,
"loss": 0.997,
"mean_token_accuracy": 0.7428381346166134,
"num_tokens": 191181745.0,
"step": 2030
},
{
"entropy": 1.345700977742672,
"epoch": 0.4526041377780243,
"grad_norm": 0.5390625,
"learning_rate": 2.7384649511978703e-05,
"loss": 0.938,
"mean_token_accuracy": 0.7569623030722141,
"num_tokens": 192157581.0,
"step": 2040
},
{
"entropy": 1.3496388509869575,
"epoch": 0.4548227855122303,
"grad_norm": 0.5390625,
"learning_rate": 2.7273735581188996e-05,
"loss": 0.9513,
"mean_token_accuracy": 0.7525494247674942,
"num_tokens": 193095233.0,
"step": 2050
},
{
"entropy": 1.350592066347599,
"epoch": 0.4570414332464363,
"grad_norm": 0.59375,
"learning_rate": 2.7162821650399288e-05,
"loss": 0.9517,
"mean_token_accuracy": 0.7537726648151875,
"num_tokens": 194025263.0,
"step": 2060
},
{
"entropy": 1.3845593720674514,
"epoch": 0.4592600809806423,
"grad_norm": 0.57421875,
"learning_rate": 2.7051907719609583e-05,
"loss": 0.9504,
"mean_token_accuracy": 0.7514217287302017,
"num_tokens": 194926897.0,
"step": 2070
},
{
"entropy": 1.3488378807902337,
"epoch": 0.4614787287148483,
"grad_norm": 0.5390625,
"learning_rate": 2.694099378881988e-05,
"loss": 0.961,
"mean_token_accuracy": 0.7501702718436718,
"num_tokens": 195849599.0,
"step": 2080
},
{
"entropy": 1.349847511947155,
"epoch": 0.4636973764490543,
"grad_norm": 0.55859375,
"learning_rate": 2.683007985803017e-05,
"loss": 0.9442,
"mean_token_accuracy": 0.7564226061105728,
"num_tokens": 196794354.0,
"step": 2090
},
{
"entropy": 1.3340238958597184,
"epoch": 0.4659160241832603,
"grad_norm": 0.55859375,
"learning_rate": 2.6719165927240463e-05,
"loss": 0.941,
"mean_token_accuracy": 0.7531145378947258,
"num_tokens": 197720928.0,
"step": 2100
},
{
"entropy": 1.346337614953518,
"epoch": 0.4681346719174663,
"grad_norm": 0.5546875,
"learning_rate": 2.6608251996450755e-05,
"loss": 0.9573,
"mean_token_accuracy": 0.7538634926080704,
"num_tokens": 198643271.0,
"step": 2110
},
{
"entropy": 1.3088567845523358,
"epoch": 0.4703533196516723,
"grad_norm": 0.56640625,
"learning_rate": 2.6497338065661047e-05,
"loss": 0.8915,
"mean_token_accuracy": 0.7640130512416363,
"num_tokens": 199578606.0,
"step": 2120
},
{
"entropy": 1.3767965711653232,
"epoch": 0.4725719673858783,
"grad_norm": 0.609375,
"learning_rate": 2.638642413487134e-05,
"loss": 0.9838,
"mean_token_accuracy": 0.7447601705789566,
"num_tokens": 200543514.0,
"step": 2130
},
{
"entropy": 1.3281448036432266,
"epoch": 0.4747906151200843,
"grad_norm": 0.55078125,
"learning_rate": 2.627551020408163e-05,
"loss": 0.9187,
"mean_token_accuracy": 0.7601314648985863,
"num_tokens": 201496122.0,
"step": 2140
},
{
"entropy": 1.3478802539408208,
"epoch": 0.4770092628542903,
"grad_norm": 0.54296875,
"learning_rate": 2.6164596273291924e-05,
"loss": 0.9621,
"mean_token_accuracy": 0.749699717015028,
"num_tokens": 202430446.0,
"step": 2150
},
{
"entropy": 1.388000564277172,
"epoch": 0.4792279105884963,
"grad_norm": 0.55078125,
"learning_rate": 2.6053682342502216e-05,
"loss": 1.01,
"mean_token_accuracy": 0.7405543349683285,
"num_tokens": 203346018.0,
"step": 2160
},
{
"entropy": 1.3482555583119393,
"epoch": 0.48144655832270233,
"grad_norm": 0.546875,
"learning_rate": 2.5942768411712515e-05,
"loss": 0.9864,
"mean_token_accuracy": 0.7477688670158387,
"num_tokens": 204279144.0,
"step": 2170
},
{
"entropy": 1.3538051225244998,
"epoch": 0.4836652060569083,
"grad_norm": 0.5625,
"learning_rate": 2.5831854480922807e-05,
"loss": 0.9934,
"mean_token_accuracy": 0.743538661301136,
"num_tokens": 205214999.0,
"step": 2180
},
{
"entropy": 1.3154275290668012,
"epoch": 0.4858838537911143,
"grad_norm": 0.52734375,
"learning_rate": 2.57209405501331e-05,
"loss": 0.9213,
"mean_token_accuracy": 0.7582350388169289,
"num_tokens": 206144520.0,
"step": 2190
},
{
"entropy": 1.3671178199350833,
"epoch": 0.4881025015253203,
"grad_norm": 0.5625,
"learning_rate": 2.561002661934339e-05,
"loss": 0.9544,
"mean_token_accuracy": 0.7533901192247867,
"num_tokens": 207080904.0,
"step": 2200
},
{
"entropy": 1.3218648932874202,
"epoch": 0.4903211492595263,
"grad_norm": 0.5625,
"learning_rate": 2.5499112688553683e-05,
"loss": 0.9238,
"mean_token_accuracy": 0.760743847489357,
"num_tokens": 208047310.0,
"step": 2210
},
{
"entropy": 1.3616492010653019,
"epoch": 0.4925397969937323,
"grad_norm": 0.53515625,
"learning_rate": 2.5388198757763975e-05,
"loss": 0.982,
"mean_token_accuracy": 0.7471165806055069,
"num_tokens": 209015470.0,
"step": 2220
},
{
"entropy": 1.3293255344033241,
"epoch": 0.49475844472793834,
"grad_norm": 0.546875,
"learning_rate": 2.5277284826974267e-05,
"loss": 0.967,
"mean_token_accuracy": 0.7527132786810398,
"num_tokens": 209969523.0,
"step": 2230
},
{
"entropy": 1.3665335968136787,
"epoch": 0.49697709246214433,
"grad_norm": 0.54296875,
"learning_rate": 2.516637089618456e-05,
"loss": 0.9793,
"mean_token_accuracy": 0.7467245981097221,
"num_tokens": 210894802.0,
"step": 2240
},
{
"entropy": 1.3085681259632111,
"epoch": 0.4991957401963503,
"grad_norm": 0.546875,
"learning_rate": 2.5055456965394852e-05,
"loss": 0.9423,
"mean_token_accuracy": 0.7545640543103218,
"num_tokens": 211846270.0,
"step": 2250
},
{
"entropy": 1.3383339211344718,
"epoch": 0.5014143879305564,
"grad_norm": 0.494140625,
"learning_rate": 2.4944543034605147e-05,
"loss": 0.9454,
"mean_token_accuracy": 0.753314109146595,
"num_tokens": 212817521.0,
"step": 2260
},
{
"entropy": 1.329726865887642,
"epoch": 0.5036330356647624,
"grad_norm": 0.51171875,
"learning_rate": 2.483362910381544e-05,
"loss": 0.9517,
"mean_token_accuracy": 0.7521423630416393,
"num_tokens": 213779244.0,
"step": 2270
},
{
"entropy": 1.3511702984571456,
"epoch": 0.5058516833989684,
"grad_norm": 0.5546875,
"learning_rate": 2.4722715173025735e-05,
"loss": 0.9431,
"mean_token_accuracy": 0.7529738865792751,
"num_tokens": 214731996.0,
"step": 2280
},
{
"entropy": 1.366059672832489,
"epoch": 0.5080703311331743,
"grad_norm": 0.55859375,
"learning_rate": 2.4611801242236027e-05,
"loss": 0.9965,
"mean_token_accuracy": 0.7439504019916058,
"num_tokens": 215694840.0,
"step": 2290
},
{
"entropy": 1.3440134845674039,
"epoch": 0.5102889788673803,
"grad_norm": 0.5390625,
"learning_rate": 2.450088731144632e-05,
"loss": 0.9691,
"mean_token_accuracy": 0.7480943873524666,
"num_tokens": 216639877.0,
"step": 2300
},
{
"entropy": 1.3710797160863877,
"epoch": 0.5125076266015863,
"grad_norm": 0.54296875,
"learning_rate": 2.438997338065661e-05,
"loss": 0.9453,
"mean_token_accuracy": 0.7527918457984925,
"num_tokens": 217569723.0,
"step": 2310
},
{
"entropy": 1.3561846666038035,
"epoch": 0.5147262743357923,
"grad_norm": 0.54296875,
"learning_rate": 2.4279059449866903e-05,
"loss": 0.9768,
"mean_token_accuracy": 0.7460780493915081,
"num_tokens": 218524752.0,
"step": 2320
},
{
"entropy": 1.354518896341324,
"epoch": 0.5169449220699983,
"grad_norm": 0.52734375,
"learning_rate": 2.41681455190772e-05,
"loss": 0.9424,
"mean_token_accuracy": 0.7531989276409149,
"num_tokens": 219445599.0,
"step": 2330
},
{
"entropy": 1.3691720873117448,
"epoch": 0.5191635698042043,
"grad_norm": 0.62890625,
"learning_rate": 2.405723158828749e-05,
"loss": 0.9875,
"mean_token_accuracy": 0.745745038241148,
"num_tokens": 220388844.0,
"step": 2340
},
{
"entropy": 1.3644569292664528,
"epoch": 0.5213822175384103,
"grad_norm": 0.54296875,
"learning_rate": 2.3946317657497783e-05,
"loss": 0.9665,
"mean_token_accuracy": 0.7500609241425991,
"num_tokens": 221325639.0,
"step": 2350
},
{
"entropy": 1.3851750075817109,
"epoch": 0.5236008652726163,
"grad_norm": 0.5625,
"learning_rate": 2.3835403726708075e-05,
"loss": 0.9989,
"mean_token_accuracy": 0.7438922718167305,
"num_tokens": 222256317.0,
"step": 2360
},
{
"entropy": 1.347152130305767,
"epoch": 0.5258195130068224,
"grad_norm": 0.57421875,
"learning_rate": 2.372448979591837e-05,
"loss": 0.9613,
"mean_token_accuracy": 0.7514459244906903,
"num_tokens": 223173083.0,
"step": 2370
},
{
"entropy": 1.3526596918702125,
"epoch": 0.5280381607410284,
"grad_norm": 0.5390625,
"learning_rate": 2.3613575865128663e-05,
"loss": 0.9948,
"mean_token_accuracy": 0.7444270350039005,
"num_tokens": 224114753.0,
"step": 2380
},
{
"entropy": 1.3236285299062729,
"epoch": 0.5302568084752344,
"grad_norm": 0.5546875,
"learning_rate": 2.3502661934338955e-05,
"loss": 0.9508,
"mean_token_accuracy": 0.7532543577253819,
"num_tokens": 225081036.0,
"step": 2390
},
{
"entropy": 1.3525523334741592,
"epoch": 0.5324754562094404,
"grad_norm": 0.5234375,
"learning_rate": 2.3391748003549247e-05,
"loss": 0.9595,
"mean_token_accuracy": 0.7512728653848171,
"num_tokens": 226017057.0,
"step": 2400
},
{
"entropy": 1.350379504263401,
"epoch": 0.5346941039436464,
"grad_norm": 0.54296875,
"learning_rate": 2.328083407275954e-05,
"loss": 0.962,
"mean_token_accuracy": 0.7505261316895485,
"num_tokens": 226946188.0,
"step": 2410
},
{
"entropy": 1.3398205131292342,
"epoch": 0.5369127516778524,
"grad_norm": 0.5546875,
"learning_rate": 2.3169920141969835e-05,
"loss": 0.9597,
"mean_token_accuracy": 0.7539136126637459,
"num_tokens": 227910063.0,
"step": 2420
},
{
"entropy": 1.331970850378275,
"epoch": 0.5391313994120583,
"grad_norm": 0.54296875,
"learning_rate": 2.3059006211180127e-05,
"loss": 0.937,
"mean_token_accuracy": 0.7590182758867741,
"num_tokens": 228863577.0,
"step": 2430
},
{
"entropy": 1.346589733660221,
"epoch": 0.5413500471462643,
"grad_norm": 0.59765625,
"learning_rate": 2.294809228039042e-05,
"loss": 0.9517,
"mean_token_accuracy": 0.7540139898657798,
"num_tokens": 229797253.0,
"step": 2440
},
{
"entropy": 1.3450704276561738,
"epoch": 0.5435686948804703,
"grad_norm": 0.5546875,
"learning_rate": 2.283717834960071e-05,
"loss": 0.9261,
"mean_token_accuracy": 0.7560984350740909,
"num_tokens": 230738751.0,
"step": 2450
},
{
"entropy": 1.3362338081002236,
"epoch": 0.5457873426146763,
"grad_norm": 0.53515625,
"learning_rate": 2.2726264418811003e-05,
"loss": 0.9396,
"mean_token_accuracy": 0.755575978755951,
"num_tokens": 231668805.0,
"step": 2460
},
{
"entropy": 1.339858317375183,
"epoch": 0.5480059903488823,
"grad_norm": 0.5625,
"learning_rate": 2.26153504880213e-05,
"loss": 0.942,
"mean_token_accuracy": 0.7545136004686356,
"num_tokens": 232602810.0,
"step": 2470
},
{
"entropy": 1.349748957157135,
"epoch": 0.5502246380830884,
"grad_norm": 0.52734375,
"learning_rate": 2.250443655723159e-05,
"loss": 0.9763,
"mean_token_accuracy": 0.7481756076216698,
"num_tokens": 233553318.0,
"step": 2480
},
{
"entropy": 1.3118550218641758,
"epoch": 0.5524432858172944,
"grad_norm": 0.51953125,
"learning_rate": 2.2393522626441883e-05,
"loss": 0.9201,
"mean_token_accuracy": 0.7602349728345871,
"num_tokens": 234503089.0,
"step": 2490
},
{
"entropy": 1.388796190917492,
"epoch": 0.5546619335515004,
"grad_norm": 0.55078125,
"learning_rate": 2.2282608695652175e-05,
"loss": 0.9855,
"mean_token_accuracy": 0.7455244645476341,
"num_tokens": 235447418.0,
"step": 2500
},
{
"entropy": 1.3685590282082558,
"epoch": 0.5568805812857064,
"grad_norm": 0.5390625,
"learning_rate": 2.2171694764862467e-05,
"loss": 0.9774,
"mean_token_accuracy": 0.7483286060392856,
"num_tokens": 236399184.0,
"step": 2510
},
{
"entropy": 1.3622719518840314,
"epoch": 0.5590992290199124,
"grad_norm": 0.5546875,
"learning_rate": 2.206078083407276e-05,
"loss": 0.9722,
"mean_token_accuracy": 0.7481064416468144,
"num_tokens": 237325726.0,
"step": 2520
},
{
"entropy": 1.3797079771757126,
"epoch": 0.5613178767541184,
"grad_norm": 0.57421875,
"learning_rate": 2.1949866903283052e-05,
"loss": 0.9826,
"mean_token_accuracy": 0.7481960266828537,
"num_tokens": 238283753.0,
"step": 2530
},
{
"entropy": 1.3590396404266358,
"epoch": 0.5635365244883244,
"grad_norm": 0.53515625,
"learning_rate": 2.1838952972493347e-05,
"loss": 0.9631,
"mean_token_accuracy": 0.749776404350996,
"num_tokens": 239205878.0,
"step": 2540
},
{
"entropy": 1.3788958624005319,
"epoch": 0.5657551722225304,
"grad_norm": 0.56640625,
"learning_rate": 2.172803904170364e-05,
"loss": 0.9639,
"mean_token_accuracy": 0.7497024066746235,
"num_tokens": 240097144.0,
"step": 2550
},
{
"entropy": 1.3258331522345543,
"epoch": 0.5679738199567363,
"grad_norm": 0.55078125,
"learning_rate": 2.161712511091393e-05,
"loss": 0.9469,
"mean_token_accuracy": 0.7540858566761017,
"num_tokens": 241055028.0,
"step": 2560
},
{
"entropy": 1.3632364630699159,
"epoch": 0.5701924676909423,
"grad_norm": 0.5234375,
"learning_rate": 2.1506211180124224e-05,
"loss": 0.9669,
"mean_token_accuracy": 0.7478960521519185,
"num_tokens": 241982324.0,
"step": 2570
},
{
"entropy": 1.382692551612854,
"epoch": 0.5724111154251483,
"grad_norm": 0.546875,
"learning_rate": 2.1395297249334516e-05,
"loss": 0.982,
"mean_token_accuracy": 0.747248487174511,
"num_tokens": 242906902.0,
"step": 2580
},
{
"entropy": 1.3415826320648194,
"epoch": 0.5746297631593543,
"grad_norm": 0.58984375,
"learning_rate": 2.1284383318544808e-05,
"loss": 0.9541,
"mean_token_accuracy": 0.7534500122070312,
"num_tokens": 243863487.0,
"step": 2590
},
{
"entropy": 1.361097539961338,
"epoch": 0.5768484108935604,
"grad_norm": 0.5234375,
"learning_rate": 2.1173469387755103e-05,
"loss": 0.9617,
"mean_token_accuracy": 0.7487135134637356,
"num_tokens": 244790336.0,
"step": 2600
},
{
"entropy": 1.337267841398716,
"epoch": 0.5790670586277664,
"grad_norm": 0.56640625,
"learning_rate": 2.1062555456965396e-05,
"loss": 0.933,
"mean_token_accuracy": 0.7563786394894123,
"num_tokens": 245733272.0,
"step": 2610
},
{
"entropy": 1.3518446780741216,
"epoch": 0.5812857063619724,
"grad_norm": 0.51171875,
"learning_rate": 2.0951641526175688e-05,
"loss": 0.9707,
"mean_token_accuracy": 0.7486745782196522,
"num_tokens": 246664891.0,
"step": 2620
},
{
"entropy": 1.3540575861930848,
"epoch": 0.5835043540961784,
"grad_norm": 0.53125,
"learning_rate": 2.084072759538598e-05,
"loss": 0.9571,
"mean_token_accuracy": 0.7517107434570789,
"num_tokens": 247612921.0,
"step": 2630
},
{
"entropy": 1.3499131940305233,
"epoch": 0.5857230018303844,
"grad_norm": 0.5703125,
"learning_rate": 2.0729813664596272e-05,
"loss": 0.9726,
"mean_token_accuracy": 0.7497683681547642,
"num_tokens": 248563712.0,
"step": 2640
},
{
"entropy": 1.3714247092604637,
"epoch": 0.5879416495645904,
"grad_norm": 0.51953125,
"learning_rate": 2.0618899733806567e-05,
"loss": 0.9711,
"mean_token_accuracy": 0.7488393485546112,
"num_tokens": 249490907.0,
"step": 2650
},
{
"entropy": 1.3412188753485679,
"epoch": 0.5901602972987964,
"grad_norm": 0.5703125,
"learning_rate": 2.050798580301686e-05,
"loss": 0.9491,
"mean_token_accuracy": 0.7532148152589798,
"num_tokens": 250423263.0,
"step": 2660
},
{
"entropy": 1.3625102311372757,
"epoch": 0.5923789450330024,
"grad_norm": 0.55078125,
"learning_rate": 2.0397071872227152e-05,
"loss": 0.9543,
"mean_token_accuracy": 0.7492990329861641,
"num_tokens": 251346039.0,
"step": 2670
},
{
"entropy": 1.3572603225708009,
"epoch": 0.5945975927672084,
"grad_norm": 0.54296875,
"learning_rate": 2.0286157941437444e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.74280019775033,
"num_tokens": 252294379.0,
"step": 2680
},
{
"entropy": 1.3205513313412667,
"epoch": 0.5968162405014144,
"grad_norm": 0.5859375,
"learning_rate": 2.0175244010647736e-05,
"loss": 0.9271,
"mean_token_accuracy": 0.760619267821312,
"num_tokens": 253223241.0,
"step": 2690
},
{
"entropy": 1.3887271240353585,
"epoch": 0.5990348882356203,
"grad_norm": 0.56640625,
"learning_rate": 2.006433007985803e-05,
"loss": 0.967,
"mean_token_accuracy": 0.7496553495526314,
"num_tokens": 254149442.0,
"step": 2700
},
{
"entropy": 1.3467085279524327,
"epoch": 0.6012535359698263,
"grad_norm": 0.54296875,
"learning_rate": 1.9953416149068324e-05,
"loss": 0.9544,
"mean_token_accuracy": 0.751462958753109,
"num_tokens": 255110533.0,
"step": 2710
},
{
"entropy": 1.355501127243042,
"epoch": 0.6034721837040324,
"grad_norm": 0.55078125,
"learning_rate": 1.9842502218278616e-05,
"loss": 0.9601,
"mean_token_accuracy": 0.7510710142552852,
"num_tokens": 256043709.0,
"step": 2720
},
{
"entropy": 1.3472363010048867,
"epoch": 0.6056908314382384,
"grad_norm": 0.55078125,
"learning_rate": 1.9731588287488908e-05,
"loss": 0.9427,
"mean_token_accuracy": 0.75606449842453,
"num_tokens": 257002884.0,
"step": 2730
},
{
"entropy": 1.3073521062731743,
"epoch": 0.6079094791724444,
"grad_norm": 0.546875,
"learning_rate": 1.9620674356699203e-05,
"loss": 0.9342,
"mean_token_accuracy": 0.7574294097721577,
"num_tokens": 257959846.0,
"step": 2740
},
{
"entropy": 1.3511497721076011,
"epoch": 0.6101281269066504,
"grad_norm": 0.53125,
"learning_rate": 1.9509760425909496e-05,
"loss": 0.9546,
"mean_token_accuracy": 0.7517549440264701,
"num_tokens": 258923804.0,
"step": 2750
},
{
"entropy": 1.3576786249876023,
"epoch": 0.6123467746408564,
"grad_norm": 0.5390625,
"learning_rate": 1.9398846495119788e-05,
"loss": 0.9499,
"mean_token_accuracy": 0.7557240962982178,
"num_tokens": 259860952.0,
"step": 2760
},
{
"entropy": 1.3472177743911744,
"epoch": 0.6145654223750624,
"grad_norm": 0.59375,
"learning_rate": 1.928793256433008e-05,
"loss": 0.9466,
"mean_token_accuracy": 0.753157027810812,
"num_tokens": 260785025.0,
"step": 2770
},
{
"entropy": 1.380058291554451,
"epoch": 0.6167840701092684,
"grad_norm": 0.57421875,
"learning_rate": 1.9177018633540372e-05,
"loss": 0.983,
"mean_token_accuracy": 0.7439537294209003,
"num_tokens": 261707332.0,
"step": 2780
},
{
"entropy": 1.3696980610489846,
"epoch": 0.6190027178434744,
"grad_norm": 0.51953125,
"learning_rate": 1.9066104702750667e-05,
"loss": 0.973,
"mean_token_accuracy": 0.7488272294402123,
"num_tokens": 262628859.0,
"step": 2790
},
{
"entropy": 1.3467194586992264,
"epoch": 0.6212213655776804,
"grad_norm": 0.5546875,
"learning_rate": 1.895519077196096e-05,
"loss": 0.9385,
"mean_token_accuracy": 0.7560124054551125,
"num_tokens": 263568807.0,
"step": 2800
},
{
"entropy": 1.3259218126535415,
"epoch": 0.6234400133118864,
"grad_norm": 0.5390625,
"learning_rate": 1.8844276841171252e-05,
"loss": 0.9512,
"mean_token_accuracy": 0.7530164457857609,
"num_tokens": 264503207.0,
"step": 2810
},
{
"entropy": 1.349274192750454,
"epoch": 0.6256586610460924,
"grad_norm": 0.5,
"learning_rate": 1.8733362910381544e-05,
"loss": 0.96,
"mean_token_accuracy": 0.7500286810100079,
"num_tokens": 265443978.0,
"step": 2820
},
{
"entropy": 1.3598796546459198,
"epoch": 0.6278773087802985,
"grad_norm": 0.55078125,
"learning_rate": 1.862244897959184e-05,
"loss": 0.9772,
"mean_token_accuracy": 0.7478482507169246,
"num_tokens": 266389592.0,
"step": 2830
},
{
"entropy": 1.3375118046998977,
"epoch": 0.6300959565145045,
"grad_norm": 0.51953125,
"learning_rate": 1.851153504880213e-05,
"loss": 0.9396,
"mean_token_accuracy": 0.7552093096077442,
"num_tokens": 267324146.0,
"step": 2840
},
{
"entropy": 1.3398489728569984,
"epoch": 0.6323146042487104,
"grad_norm": 0.5234375,
"learning_rate": 1.8400621118012424e-05,
"loss": 0.9375,
"mean_token_accuracy": 0.7564864322543144,
"num_tokens": 268270041.0,
"step": 2850
},
{
"entropy": 1.3224478855729103,
"epoch": 0.6345332519829164,
"grad_norm": 0.55859375,
"learning_rate": 1.8289707187222716e-05,
"loss": 0.9462,
"mean_token_accuracy": 0.7549590796232224,
"num_tokens": 269231597.0,
"step": 2860
},
{
"entropy": 1.3553704172372818,
"epoch": 0.6367518997171224,
"grad_norm": 0.53515625,
"learning_rate": 1.8178793256433008e-05,
"loss": 0.9589,
"mean_token_accuracy": 0.751991906017065,
"num_tokens": 270152001.0,
"step": 2870
},
{
"entropy": 1.3432944223284722,
"epoch": 0.6389705474513284,
"grad_norm": 0.5546875,
"learning_rate": 1.8067879325643303e-05,
"loss": 0.9621,
"mean_token_accuracy": 0.7513845339417458,
"num_tokens": 271087976.0,
"step": 2880
},
{
"entropy": 1.3790721513330937,
"epoch": 0.6411891951855344,
"grad_norm": 0.55078125,
"learning_rate": 1.7956965394853596e-05,
"loss": 0.9863,
"mean_token_accuracy": 0.74508848041296,
"num_tokens": 272035081.0,
"step": 2890
},
{
"entropy": 1.3692745730280875,
"epoch": 0.6434078429197404,
"grad_norm": 0.52734375,
"learning_rate": 1.7846051464063888e-05,
"loss": 0.9804,
"mean_token_accuracy": 0.7487337306141854,
"num_tokens": 272973482.0,
"step": 2900
},
{
"entropy": 1.3950363367795944,
"epoch": 0.6456264906539464,
"grad_norm": 0.55859375,
"learning_rate": 1.773513753327418e-05,
"loss": 0.9917,
"mean_token_accuracy": 0.7448577910661698,
"num_tokens": 273904331.0,
"step": 2910
},
{
"entropy": 1.3784946396946907,
"epoch": 0.6478451383881524,
"grad_norm": 0.55078125,
"learning_rate": 1.7624223602484475e-05,
"loss": 1.0087,
"mean_token_accuracy": 0.741528432816267,
"num_tokens": 274848669.0,
"step": 2920
},
{
"entropy": 1.3325315289199353,
"epoch": 0.6500637861223584,
"grad_norm": 0.53125,
"learning_rate": 1.7513309671694767e-05,
"loss": 0.9466,
"mean_token_accuracy": 0.7518486715853214,
"num_tokens": 275803568.0,
"step": 2930
},
{
"entropy": 1.3600165903568269,
"epoch": 0.6522824338565644,
"grad_norm": 0.5625,
"learning_rate": 1.740239574090506e-05,
"loss": 0.9382,
"mean_token_accuracy": 0.7539416745305061,
"num_tokens": 276747925.0,
"step": 2940
},
{
"entropy": 1.3534336686134338,
"epoch": 0.6545010815907705,
"grad_norm": 0.53515625,
"learning_rate": 1.7291481810115352e-05,
"loss": 0.9704,
"mean_token_accuracy": 0.7500346690416336,
"num_tokens": 277658894.0,
"step": 2950
},
{
"entropy": 1.3526192732155322,
"epoch": 0.6567197293249765,
"grad_norm": 0.53125,
"learning_rate": 1.7180567879325644e-05,
"loss": 0.9615,
"mean_token_accuracy": 0.7505016751587391,
"num_tokens": 278614364.0,
"step": 2960
},
{
"entropy": 1.3536822080612183,
"epoch": 0.6589383770591825,
"grad_norm": 0.5859375,
"learning_rate": 1.706965394853594e-05,
"loss": 0.9584,
"mean_token_accuracy": 0.7506825909018516,
"num_tokens": 279546133.0,
"step": 2970
},
{
"entropy": 1.3441800415515899,
"epoch": 0.6611570247933884,
"grad_norm": 0.51171875,
"learning_rate": 1.695874001774623e-05,
"loss": 0.9322,
"mean_token_accuracy": 0.7591280125081539,
"num_tokens": 280483436.0,
"step": 2980
},
{
"entropy": 1.3216261357069015,
"epoch": 0.6633756725275944,
"grad_norm": 0.53515625,
"learning_rate": 1.6847826086956524e-05,
"loss": 0.9491,
"mean_token_accuracy": 0.7539561577141285,
"num_tokens": 281450626.0,
"step": 2990
},
{
"entropy": 1.3525083124637605,
"epoch": 0.6655943202618004,
"grad_norm": 0.5546875,
"learning_rate": 1.6736912156166816e-05,
"loss": 0.9179,
"mean_token_accuracy": 0.7602526120841503,
"num_tokens": 282378418.0,
"step": 3000
},
{
"entropy": 1.350367258489132,
"epoch": 0.6678129679960064,
"grad_norm": 0.51171875,
"learning_rate": 1.6625998225377108e-05,
"loss": 0.9397,
"mean_token_accuracy": 0.7571302607655526,
"num_tokens": 283298771.0,
"step": 3010
},
{
"entropy": 1.3382517769932747,
"epoch": 0.6700316157302124,
"grad_norm": 0.546875,
"learning_rate": 1.6515084294587403e-05,
"loss": 0.9536,
"mean_token_accuracy": 0.7520625948905945,
"num_tokens": 284243577.0,
"step": 3020
},
{
"entropy": 1.336366317421198,
"epoch": 0.6722502634644184,
"grad_norm": 0.5078125,
"learning_rate": 1.6404170363797696e-05,
"loss": 0.9375,
"mean_token_accuracy": 0.7568468548357487,
"num_tokens": 285185257.0,
"step": 3030
},
{
"entropy": 1.3323681712150575,
"epoch": 0.6744689111986244,
"grad_norm": 0.54296875,
"learning_rate": 1.6293256433007988e-05,
"loss": 0.932,
"mean_token_accuracy": 0.7574945628643036,
"num_tokens": 286121874.0,
"step": 3040
},
{
"entropy": 1.344571302831173,
"epoch": 0.6766875589328304,
"grad_norm": 0.54296875,
"learning_rate": 1.618234250221828e-05,
"loss": 0.9454,
"mean_token_accuracy": 0.7531527921557426,
"num_tokens": 287042084.0,
"step": 3050
},
{
"entropy": 1.3513332322239875,
"epoch": 0.6789062066670365,
"grad_norm": 0.53125,
"learning_rate": 1.6071428571428572e-05,
"loss": 0.9615,
"mean_token_accuracy": 0.7513311177492141,
"num_tokens": 287961333.0,
"step": 3060
},
{
"entropy": 1.3252726949751377,
"epoch": 0.6811248544012425,
"grad_norm": 0.490234375,
"learning_rate": 1.5960514640638864e-05,
"loss": 0.9341,
"mean_token_accuracy": 0.7552036680281162,
"num_tokens": 288894800.0,
"step": 3070
},
{
"entropy": 1.3621705561876296,
"epoch": 0.6833435021354485,
"grad_norm": 0.51953125,
"learning_rate": 1.5849600709849156e-05,
"loss": 0.9659,
"mean_token_accuracy": 0.7510468997061253,
"num_tokens": 289837877.0,
"step": 3080
},
{
"entropy": 1.372152604162693,
"epoch": 0.6855621498696545,
"grad_norm": 0.515625,
"learning_rate": 1.573868677905945e-05,
"loss": 0.9908,
"mean_token_accuracy": 0.7456212192773819,
"num_tokens": 290768330.0,
"step": 3090
},
{
"entropy": 1.3613446295261382,
"epoch": 0.6877807976038605,
"grad_norm": 0.546875,
"learning_rate": 1.5627772848269744e-05,
"loss": 0.9498,
"mean_token_accuracy": 0.7532825492322445,
"num_tokens": 291697499.0,
"step": 3100
},
{
"entropy": 1.3725149601697921,
"epoch": 0.6899994453380665,
"grad_norm": 0.52734375,
"learning_rate": 1.5516858917480036e-05,
"loss": 0.9747,
"mean_token_accuracy": 0.7483395658433437,
"num_tokens": 292632277.0,
"step": 3110
},
{
"entropy": 1.3413543090224267,
"epoch": 0.6922180930722724,
"grad_norm": 0.546875,
"learning_rate": 1.5405944986690328e-05,
"loss": 0.9563,
"mean_token_accuracy": 0.7508202590048313,
"num_tokens": 293584069.0,
"step": 3120
},
{
"entropy": 1.352384202182293,
"epoch": 0.6944367408064784,
"grad_norm": 0.57421875,
"learning_rate": 1.529503105590062e-05,
"loss": 0.9654,
"mean_token_accuracy": 0.7493121877312661,
"num_tokens": 294513585.0,
"step": 3130
},
{
"entropy": 1.356651772558689,
"epoch": 0.6966553885406844,
"grad_norm": 0.578125,
"learning_rate": 1.5184117125110914e-05,
"loss": 0.9495,
"mean_token_accuracy": 0.7534554153680801,
"num_tokens": 295440578.0,
"step": 3140
},
{
"entropy": 1.335485778748989,
"epoch": 0.6988740362748904,
"grad_norm": 0.54296875,
"learning_rate": 1.5073203194321208e-05,
"loss": 0.9726,
"mean_token_accuracy": 0.7495904855430127,
"num_tokens": 296372981.0,
"step": 3150
},
{
"entropy": 1.343485713750124,
"epoch": 0.7010926840090964,
"grad_norm": 0.57421875,
"learning_rate": 1.4962289263531502e-05,
"loss": 0.9646,
"mean_token_accuracy": 0.7513713717460633,
"num_tokens": 297325689.0,
"step": 3160
},
{
"entropy": 1.363182956725359,
"epoch": 0.7033113317433024,
"grad_norm": 0.53515625,
"learning_rate": 1.4851375332741794e-05,
"loss": 0.9518,
"mean_token_accuracy": 0.7518307134509087,
"num_tokens": 298270698.0,
"step": 3170
},
{
"entropy": 1.3420901797711848,
"epoch": 0.7055299794775085,
"grad_norm": 0.55859375,
"learning_rate": 1.4740461401952086e-05,
"loss": 0.9716,
"mean_token_accuracy": 0.7465130612254143,
"num_tokens": 299197164.0,
"step": 3180
},
{
"entropy": 1.3738549813628196,
"epoch": 0.7077486272117145,
"grad_norm": 0.515625,
"learning_rate": 1.4629547471162378e-05,
"loss": 0.9738,
"mean_token_accuracy": 0.7482325688004494,
"num_tokens": 300152852.0,
"step": 3190
},
{
"entropy": 1.3018300041556359,
"epoch": 0.7099672749459205,
"grad_norm": 0.53515625,
"learning_rate": 1.4518633540372672e-05,
"loss": 0.907,
"mean_token_accuracy": 0.764003473520279,
"num_tokens": 301127407.0,
"step": 3200
},
{
"entropy": 1.342644067108631,
"epoch": 0.7121859226801265,
"grad_norm": 0.52734375,
"learning_rate": 1.4407719609582964e-05,
"loss": 0.9644,
"mean_token_accuracy": 0.7527099289000034,
"num_tokens": 302059360.0,
"step": 3210
},
{
"entropy": 1.3652416355907917,
"epoch": 0.7144045704143325,
"grad_norm": 0.546875,
"learning_rate": 1.4296805678793256e-05,
"loss": 0.9425,
"mean_token_accuracy": 0.7537096805870533,
"num_tokens": 302987839.0,
"step": 3220
},
{
"entropy": 1.3176094248890877,
"epoch": 0.7166232181485385,
"grad_norm": 0.53125,
"learning_rate": 1.4185891748003548e-05,
"loss": 0.9469,
"mean_token_accuracy": 0.7529924146831035,
"num_tokens": 303927433.0,
"step": 3230
},
{
"entropy": 1.3563083581626416,
"epoch": 0.7188418658827445,
"grad_norm": 0.50390625,
"learning_rate": 1.4074977817213844e-05,
"loss": 0.9656,
"mean_token_accuracy": 0.7512292198836803,
"num_tokens": 304897121.0,
"step": 3240
},
{
"entropy": 1.3360683649778367,
"epoch": 0.7210605136169504,
"grad_norm": 0.60546875,
"learning_rate": 1.3964063886424136e-05,
"loss": 0.9356,
"mean_token_accuracy": 0.7564455397427082,
"num_tokens": 305845949.0,
"step": 3250
},
{
"entropy": 1.3641312032938004,
"epoch": 0.7232791613511564,
"grad_norm": 0.578125,
"learning_rate": 1.3853149955634428e-05,
"loss": 1.0009,
"mean_token_accuracy": 0.7445311717689037,
"num_tokens": 306770481.0,
"step": 3260
},
{
"entropy": 1.3404412433505057,
"epoch": 0.7254978090853624,
"grad_norm": 0.56640625,
"learning_rate": 1.374223602484472e-05,
"loss": 0.948,
"mean_token_accuracy": 0.7560093238949775,
"num_tokens": 307705021.0,
"step": 3270
},
{
"entropy": 1.343174346536398,
"epoch": 0.7277164568195684,
"grad_norm": 0.51953125,
"learning_rate": 1.3631322094055012e-05,
"loss": 0.9282,
"mean_token_accuracy": 0.7588741101324559,
"num_tokens": 308647182.0,
"step": 3280
},
{
"entropy": 1.3446429327130318,
"epoch": 0.7299351045537745,
"grad_norm": 0.490234375,
"learning_rate": 1.3520408163265308e-05,
"loss": 0.9535,
"mean_token_accuracy": 0.7525325618684292,
"num_tokens": 309593575.0,
"step": 3290
},
{
"entropy": 1.3387797683477403,
"epoch": 0.7321537522879805,
"grad_norm": 0.546875,
"learning_rate": 1.34094942324756e-05,
"loss": 0.9583,
"mean_token_accuracy": 0.7520524263381958,
"num_tokens": 310549256.0,
"step": 3300
},
{
"entropy": 1.371607707440853,
"epoch": 0.7343724000221865,
"grad_norm": 0.546875,
"learning_rate": 1.3298580301685892e-05,
"loss": 0.9565,
"mean_token_accuracy": 0.7507821291685104,
"num_tokens": 311487519.0,
"step": 3310
},
{
"entropy": 1.3396147727966308,
"epoch": 0.7365910477563925,
"grad_norm": 0.60546875,
"learning_rate": 1.3187666370896184e-05,
"loss": 0.9704,
"mean_token_accuracy": 0.7495545491576194,
"num_tokens": 312433352.0,
"step": 3320
},
{
"entropy": 1.3545660354197024,
"epoch": 0.7388096954905985,
"grad_norm": 0.546875,
"learning_rate": 1.3076752440106476e-05,
"loss": 0.9416,
"mean_token_accuracy": 0.7558687753975392,
"num_tokens": 313376390.0,
"step": 3330
},
{
"entropy": 1.3706799075007439,
"epoch": 0.7410283432248045,
"grad_norm": 0.55078125,
"learning_rate": 1.2965838509316772e-05,
"loss": 0.9826,
"mean_token_accuracy": 0.7450837090611457,
"num_tokens": 314320815.0,
"step": 3340
},
{
"entropy": 1.3725864320993424,
"epoch": 0.7432469909590105,
"grad_norm": 0.51171875,
"learning_rate": 1.2854924578527064e-05,
"loss": 0.9775,
"mean_token_accuracy": 0.7485952161252498,
"num_tokens": 315291123.0,
"step": 3350
},
{
"entropy": 1.3556952878832818,
"epoch": 0.7454656386932165,
"grad_norm": 0.51953125,
"learning_rate": 1.2744010647737356e-05,
"loss": 0.9683,
"mean_token_accuracy": 0.7492410965263844,
"num_tokens": 316236020.0,
"step": 3360
},
{
"entropy": 1.349064838141203,
"epoch": 0.7476842864274225,
"grad_norm": 0.53515625,
"learning_rate": 1.2633096716947648e-05,
"loss": 0.9704,
"mean_token_accuracy": 0.7494482189416886,
"num_tokens": 317154910.0,
"step": 3370
},
{
"entropy": 1.359015841037035,
"epoch": 0.7499029341616285,
"grad_norm": 0.546875,
"learning_rate": 1.2522182786157944e-05,
"loss": 0.9641,
"mean_token_accuracy": 0.749902281910181,
"num_tokens": 318080921.0,
"step": 3380
},
{
"entropy": 1.3636605456471442,
"epoch": 0.7521215818958344,
"grad_norm": 0.5390625,
"learning_rate": 1.2411268855368236e-05,
"loss": 0.9644,
"mean_token_accuracy": 0.7513450764119625,
"num_tokens": 319014412.0,
"step": 3390
},
{
"entropy": 1.3377082630991937,
"epoch": 0.7543402296300404,
"grad_norm": 0.515625,
"learning_rate": 1.2300354924578528e-05,
"loss": 0.946,
"mean_token_accuracy": 0.7537905521690845,
"num_tokens": 319955427.0,
"step": 3400
},
{
"entropy": 1.3234972402453422,
"epoch": 0.7565588773642465,
"grad_norm": 0.546875,
"learning_rate": 1.218944099378882e-05,
"loss": 0.9414,
"mean_token_accuracy": 0.7541356466710567,
"num_tokens": 320934497.0,
"step": 3410
},
{
"entropy": 1.3440752558410167,
"epoch": 0.7587775250984525,
"grad_norm": 0.5546875,
"learning_rate": 1.2078527062999114e-05,
"loss": 0.9503,
"mean_token_accuracy": 0.7518649064004421,
"num_tokens": 321880491.0,
"step": 3420
},
{
"entropy": 1.3397350490093232,
"epoch": 0.7609961728326585,
"grad_norm": 0.51953125,
"learning_rate": 1.1967613132209406e-05,
"loss": 0.9324,
"mean_token_accuracy": 0.7557294942438603,
"num_tokens": 322803732.0,
"step": 3430
},
{
"entropy": 1.3109237834811212,
"epoch": 0.7632148205668645,
"grad_norm": 0.5234375,
"learning_rate": 1.18566992014197e-05,
"loss": 0.9228,
"mean_token_accuracy": 0.7610769435763359,
"num_tokens": 323769648.0,
"step": 3440
},
{
"entropy": 1.3633039817214012,
"epoch": 0.7654334683010705,
"grad_norm": 0.52734375,
"learning_rate": 1.1745785270629992e-05,
"loss": 0.9921,
"mean_token_accuracy": 0.7444672405719757,
"num_tokens": 324712776.0,
"step": 3450
},
{
"entropy": 1.3648219130933286,
"epoch": 0.7676521160352765,
"grad_norm": 0.55078125,
"learning_rate": 1.1634871339840284e-05,
"loss": 0.9942,
"mean_token_accuracy": 0.744285186380148,
"num_tokens": 325639116.0,
"step": 3460
},
{
"entropy": 1.3753913044929504,
"epoch": 0.7698707637694825,
"grad_norm": 0.56640625,
"learning_rate": 1.1523957409050576e-05,
"loss": 0.9669,
"mean_token_accuracy": 0.7503029778599739,
"num_tokens": 326579098.0,
"step": 3470
},
{
"entropy": 1.3312873490154744,
"epoch": 0.7720894115036885,
"grad_norm": 0.51171875,
"learning_rate": 1.141304347826087e-05,
"loss": 0.9488,
"mean_token_accuracy": 0.7541476741433144,
"num_tokens": 327516490.0,
"step": 3480
},
{
"entropy": 1.3498370356857776,
"epoch": 0.7743080592378945,
"grad_norm": 0.57421875,
"learning_rate": 1.1302129547471162e-05,
"loss": 0.9738,
"mean_token_accuracy": 0.7493281632661819,
"num_tokens": 328443057.0,
"step": 3490
},
{
"entropy": 1.3415059983730315,
"epoch": 0.7765267069721005,
"grad_norm": 0.5234375,
"learning_rate": 1.1191215616681455e-05,
"loss": 0.9392,
"mean_token_accuracy": 0.7565719000995159,
"num_tokens": 329389868.0,
"step": 3500
},
{
"entropy": 1.3868108600378037,
"epoch": 0.7787453547063065,
"grad_norm": 0.52734375,
"learning_rate": 1.1080301685891748e-05,
"loss": 1.0112,
"mean_token_accuracy": 0.7436525091528893,
"num_tokens": 330333754.0,
"step": 3510
},
{
"entropy": 1.353071667253971,
"epoch": 0.7809640024405126,
"grad_norm": 0.57421875,
"learning_rate": 1.096938775510204e-05,
"loss": 0.9435,
"mean_token_accuracy": 0.7540925681591034,
"num_tokens": 331254469.0,
"step": 3520
},
{
"entropy": 1.3132469408214091,
"epoch": 0.7831826501747186,
"grad_norm": 0.54296875,
"learning_rate": 1.0858473824312334e-05,
"loss": 0.9211,
"mean_token_accuracy": 0.7597164355218411,
"num_tokens": 332195343.0,
"step": 3530
},
{
"entropy": 1.322484378516674,
"epoch": 0.7854012979089245,
"grad_norm": 0.53125,
"learning_rate": 1.0747559893522626e-05,
"loss": 0.9358,
"mean_token_accuracy": 0.7559656046330929,
"num_tokens": 333130438.0,
"step": 3540
},
{
"entropy": 1.3583971813321114,
"epoch": 0.7876199456431305,
"grad_norm": 0.53515625,
"learning_rate": 1.063664596273292e-05,
"loss": 0.944,
"mean_token_accuracy": 0.7558795347809791,
"num_tokens": 334072646.0,
"step": 3550
},
{
"entropy": 1.3520539619028569,
"epoch": 0.7898385933773365,
"grad_norm": 0.53515625,
"learning_rate": 1.0525732031943212e-05,
"loss": 0.9802,
"mean_token_accuracy": 0.7473956875503063,
"num_tokens": 335011200.0,
"step": 3560
},
{
"entropy": 1.3791773080825807,
"epoch": 0.7920572411115425,
"grad_norm": 0.5234375,
"learning_rate": 1.0414818101153505e-05,
"loss": 0.9912,
"mean_token_accuracy": 0.7445360422134399,
"num_tokens": 335949808.0,
"step": 3570
},
{
"entropy": 1.30967488437891,
"epoch": 0.7942758888457485,
"grad_norm": 0.5234375,
"learning_rate": 1.0303904170363798e-05,
"loss": 0.9029,
"mean_token_accuracy": 0.761937515437603,
"num_tokens": 336904248.0,
"step": 3580
},
{
"entropy": 1.3683781877160073,
"epoch": 0.7964945365799545,
"grad_norm": 0.5390625,
"learning_rate": 1.019299023957409e-05,
"loss": 0.9608,
"mean_token_accuracy": 0.7519945807754993,
"num_tokens": 337849157.0,
"step": 3590
},
{
"entropy": 1.3160683244466782,
"epoch": 0.7987131843141605,
"grad_norm": 0.5078125,
"learning_rate": 1.0082076308784384e-05,
"loss": 0.928,
"mean_token_accuracy": 0.7593866750597954,
"num_tokens": 338799972.0,
"step": 3600
},
{
"entropy": 1.3837224870920182,
"epoch": 0.8009318320483665,
"grad_norm": 0.5703125,
"learning_rate": 9.971162377994676e-06,
"loss": 0.9794,
"mean_token_accuracy": 0.7475892208516598,
"num_tokens": 339729332.0,
"step": 3610
},
{
"entropy": 1.3449356317520142,
"epoch": 0.8031504797825725,
"grad_norm": 0.51953125,
"learning_rate": 9.86024844720497e-06,
"loss": 0.9435,
"mean_token_accuracy": 0.7529967434704303,
"num_tokens": 340656347.0,
"step": 3620
},
{
"entropy": 1.3135579869151115,
"epoch": 0.8053691275167785,
"grad_norm": 0.52734375,
"learning_rate": 9.749334516415262e-06,
"loss": 0.905,
"mean_token_accuracy": 0.7636351682245731,
"num_tokens": 341603645.0,
"step": 3630
},
{
"entropy": 1.3562857955694199,
"epoch": 0.8075877752509846,
"grad_norm": 0.53515625,
"learning_rate": 9.638420585625555e-06,
"loss": 0.9654,
"mean_token_accuracy": 0.7500083535909653,
"num_tokens": 342551945.0,
"step": 3640
},
{
"entropy": 1.355036635696888,
"epoch": 0.8098064229851906,
"grad_norm": 0.55859375,
"learning_rate": 9.527506654835848e-06,
"loss": 0.9783,
"mean_token_accuracy": 0.747504611313343,
"num_tokens": 343501214.0,
"step": 3650
},
{
"entropy": 1.3850376293063165,
"epoch": 0.8120250707193966,
"grad_norm": 0.53515625,
"learning_rate": 9.41659272404614e-06,
"loss": 0.9813,
"mean_token_accuracy": 0.7430158272385597,
"num_tokens": 344479426.0,
"step": 3660
},
{
"entropy": 1.35298143774271,
"epoch": 0.8142437184536025,
"grad_norm": 0.54296875,
"learning_rate": 9.305678793256434e-06,
"loss": 0.9528,
"mean_token_accuracy": 0.75439862459898,
"num_tokens": 345406732.0,
"step": 3670
},
{
"entropy": 1.3408295065164566,
"epoch": 0.8164623661878085,
"grad_norm": 0.52734375,
"learning_rate": 9.194764862466726e-06,
"loss": 0.9464,
"mean_token_accuracy": 0.7534433856606484,
"num_tokens": 346375091.0,
"step": 3680
},
{
"entropy": 1.3690178409218787,
"epoch": 0.8186810139220145,
"grad_norm": 0.54296875,
"learning_rate": 9.08385093167702e-06,
"loss": 0.9794,
"mean_token_accuracy": 0.7499176189303398,
"num_tokens": 347327768.0,
"step": 3690
},
{
"entropy": 1.3406174167990685,
"epoch": 0.8208996616562205,
"grad_norm": 0.546875,
"learning_rate": 8.972937000887312e-06,
"loss": 0.9237,
"mean_token_accuracy": 0.7583520159125328,
"num_tokens": 348246799.0,
"step": 3700
},
{
"entropy": 1.3822472810745239,
"epoch": 0.8231183093904265,
"grad_norm": 0.57421875,
"learning_rate": 8.862023070097605e-06,
"loss": 0.9984,
"mean_token_accuracy": 0.7432019256055356,
"num_tokens": 349172608.0,
"step": 3710
},
{
"entropy": 1.3216811880469321,
"epoch": 0.8253369571246325,
"grad_norm": 0.53515625,
"learning_rate": 8.751109139307898e-06,
"loss": 0.9271,
"mean_token_accuracy": 0.758989142626524,
"num_tokens": 350123406.0,
"step": 3720
},
{
"entropy": 1.2982059597969056,
"epoch": 0.8275556048588385,
"grad_norm": 0.53125,
"learning_rate": 8.64019520851819e-06,
"loss": 0.8997,
"mean_token_accuracy": 0.7647782519459725,
"num_tokens": 351066848.0,
"step": 3730
},
{
"entropy": 1.3314955472946166,
"epoch": 0.8297742525930445,
"grad_norm": 0.54296875,
"learning_rate": 8.529281277728483e-06,
"loss": 0.9526,
"mean_token_accuracy": 0.7523629620671273,
"num_tokens": 351999813.0,
"step": 3740
},
{
"entropy": 1.35967206209898,
"epoch": 0.8319929003272506,
"grad_norm": 0.56640625,
"learning_rate": 8.418367346938775e-06,
"loss": 0.9813,
"mean_token_accuracy": 0.7480250895023346,
"num_tokens": 352930626.0,
"step": 3750
},
{
"entropy": 1.3411589175462724,
"epoch": 0.8342115480614566,
"grad_norm": 0.55859375,
"learning_rate": 8.307453416149069e-06,
"loss": 0.9699,
"mean_token_accuracy": 0.748241176456213,
"num_tokens": 353873348.0,
"step": 3760
},
{
"entropy": 1.3526584044098855,
"epoch": 0.8364301957956626,
"grad_norm": 0.53515625,
"learning_rate": 8.19653948535936e-06,
"loss": 0.9759,
"mean_token_accuracy": 0.7478196188807488,
"num_tokens": 354803544.0,
"step": 3770
},
{
"entropy": 1.3394062861800193,
"epoch": 0.8386488435298686,
"grad_norm": 0.5625,
"learning_rate": 8.085625554569655e-06,
"loss": 0.9535,
"mean_token_accuracy": 0.7555646121501922,
"num_tokens": 355731286.0,
"step": 3780
},
{
"entropy": 1.3712951876223087,
"epoch": 0.8408674912640746,
"grad_norm": 0.53125,
"learning_rate": 7.974711623779947e-06,
"loss": 0.9772,
"mean_token_accuracy": 0.7479187317192555,
"num_tokens": 356667594.0,
"step": 3790
},
{
"entropy": 1.3195544198155402,
"epoch": 0.8430861389982806,
"grad_norm": 0.51171875,
"learning_rate": 7.863797692990239e-06,
"loss": 0.9468,
"mean_token_accuracy": 0.7531268313527107,
"num_tokens": 357589764.0,
"step": 3800
},
{
"entropy": 1.3623077616095542,
"epoch": 0.8453047867324865,
"grad_norm": 0.5703125,
"learning_rate": 7.752883762200533e-06,
"loss": 0.9927,
"mean_token_accuracy": 0.7447442330420018,
"num_tokens": 358546216.0,
"step": 3810
},
{
"entropy": 1.3607013449072838,
"epoch": 0.8475234344666925,
"grad_norm": 0.5625,
"learning_rate": 7.641969831410825e-06,
"loss": 0.9416,
"mean_token_accuracy": 0.7566105239093304,
"num_tokens": 359495367.0,
"step": 3820
},
{
"entropy": 1.348987601697445,
"epoch": 0.8497420822008985,
"grad_norm": 0.484375,
"learning_rate": 7.5310559006211186e-06,
"loss": 0.9343,
"mean_token_accuracy": 0.7575232580304145,
"num_tokens": 360442276.0,
"step": 3830
},
{
"entropy": 1.3610796511173249,
"epoch": 0.8519607299351045,
"grad_norm": 0.51953125,
"learning_rate": 7.420141969831411e-06,
"loss": 0.9372,
"mean_token_accuracy": 0.756447360664606,
"num_tokens": 361377342.0,
"step": 3840
},
{
"entropy": 1.3527425512671472,
"epoch": 0.8541793776693105,
"grad_norm": 0.53515625,
"learning_rate": 7.3092280390417045e-06,
"loss": 0.9495,
"mean_token_accuracy": 0.7547285988926887,
"num_tokens": 362298440.0,
"step": 3850
},
{
"entropy": 1.330655214190483,
"epoch": 0.8563980254035165,
"grad_norm": 0.51171875,
"learning_rate": 7.198314108251997e-06,
"loss": 0.9475,
"mean_token_accuracy": 0.751707597821951,
"num_tokens": 363228367.0,
"step": 3860
},
{
"entropy": 1.3436040908098221,
"epoch": 0.8586166731377226,
"grad_norm": 0.48828125,
"learning_rate": 7.0874001774622905e-06,
"loss": 0.9536,
"mean_token_accuracy": 0.7511266514658927,
"num_tokens": 364167204.0,
"step": 3870
},
{
"entropy": 1.3443495616316796,
"epoch": 0.8608353208719286,
"grad_norm": 0.54296875,
"learning_rate": 6.976486246672583e-06,
"loss": 0.9512,
"mean_token_accuracy": 0.7544127158820629,
"num_tokens": 365144075.0,
"step": 3880
},
{
"entropy": 1.3494714990258216,
"epoch": 0.8630539686061346,
"grad_norm": 0.5390625,
"learning_rate": 6.865572315882875e-06,
"loss": 0.951,
"mean_token_accuracy": 0.752277635782957,
"num_tokens": 366069039.0,
"step": 3890
},
{
"entropy": 1.3707938618957995,
"epoch": 0.8652726163403406,
"grad_norm": 0.5859375,
"learning_rate": 6.7546583850931686e-06,
"loss": 0.9935,
"mean_token_accuracy": 0.7460488043725491,
"num_tokens": 366994185.0,
"step": 3900
},
{
"entropy": 1.3302705749869346,
"epoch": 0.8674912640745466,
"grad_norm": 0.5078125,
"learning_rate": 6.643744454303461e-06,
"loss": 0.9403,
"mean_token_accuracy": 0.7569159217178821,
"num_tokens": 367932317.0,
"step": 3910
},
{
"entropy": 1.3517090238630771,
"epoch": 0.8697099118087526,
"grad_norm": 0.54296875,
"learning_rate": 6.532830523513754e-06,
"loss": 0.9539,
"mean_token_accuracy": 0.7541409082710743,
"num_tokens": 368888419.0,
"step": 3920
},
{
"entropy": 1.365368028730154,
"epoch": 0.8719285595429586,
"grad_norm": 0.55859375,
"learning_rate": 6.421916592724047e-06,
"loss": 0.975,
"mean_token_accuracy": 0.7489493399858475,
"num_tokens": 369809659.0,
"step": 3930
},
{
"entropy": 1.363468910753727,
"epoch": 0.8741472072771646,
"grad_norm": 0.578125,
"learning_rate": 6.31100266193434e-06,
"loss": 0.9687,
"mean_token_accuracy": 0.7492878220975399,
"num_tokens": 370758628.0,
"step": 3940
},
{
"entropy": 1.3409071058034896,
"epoch": 0.8763658550113705,
"grad_norm": 0.56640625,
"learning_rate": 6.200088731144632e-06,
"loss": 0.9425,
"mean_token_accuracy": 0.7558536991477013,
"num_tokens": 371684631.0,
"step": 3950
},
{
"entropy": 1.3250400580465793,
"epoch": 0.8785845027455765,
"grad_norm": 0.53515625,
"learning_rate": 6.089174800354925e-06,
"loss": 0.9554,
"mean_token_accuracy": 0.7519582070410251,
"num_tokens": 372645749.0,
"step": 3960
},
{
"entropy": 1.3622069828212262,
"epoch": 0.8808031504797825,
"grad_norm": 0.55859375,
"learning_rate": 5.978260869565218e-06,
"loss": 0.974,
"mean_token_accuracy": 0.7483527101576328,
"num_tokens": 373579688.0,
"step": 3970
},
{
"entropy": 1.3249136090278626,
"epoch": 0.8830217982139886,
"grad_norm": 0.52734375,
"learning_rate": 5.867346938775511e-06,
"loss": 0.9481,
"mean_token_accuracy": 0.7574851214885712,
"num_tokens": 374523490.0,
"step": 3980
},
{
"entropy": 1.3423442378640176,
"epoch": 0.8852404459481946,
"grad_norm": 0.515625,
"learning_rate": 5.756433007985803e-06,
"loss": 0.9604,
"mean_token_accuracy": 0.7507563464343547,
"num_tokens": 375480069.0,
"step": 3990
},
{
"entropy": 1.3690859913825988,
"epoch": 0.8874590936824006,
"grad_norm": 0.53515625,
"learning_rate": 5.645519077196096e-06,
"loss": 0.9424,
"mean_token_accuracy": 0.7560895748436451,
"num_tokens": 376414915.0,
"step": 4000
},
{
"entropy": 1.377838420122862,
"epoch": 0.8896777414166066,
"grad_norm": 0.54296875,
"learning_rate": 5.534605146406389e-06,
"loss": 0.9678,
"mean_token_accuracy": 0.7493596062064171,
"num_tokens": 377345183.0,
"step": 4010
},
{
"entropy": 1.3701353058218957,
"epoch": 0.8918963891508126,
"grad_norm": 0.55078125,
"learning_rate": 5.423691215616682e-06,
"loss": 0.9638,
"mean_token_accuracy": 0.7514446713030338,
"num_tokens": 378293994.0,
"step": 4020
},
{
"entropy": 1.3063566341996193,
"epoch": 0.8941150368850186,
"grad_norm": 0.5546875,
"learning_rate": 5.312777284826975e-06,
"loss": 0.9353,
"mean_token_accuracy": 0.7562219582498073,
"num_tokens": 379256824.0,
"step": 4030
},
{
"entropy": 1.3382435604929923,
"epoch": 0.8963336846192246,
"grad_norm": 0.55859375,
"learning_rate": 5.201863354037268e-06,
"loss": 0.9604,
"mean_token_accuracy": 0.751346006244421,
"num_tokens": 380227652.0,
"step": 4040
},
{
"entropy": 1.331801988184452,
"epoch": 0.8985523323534306,
"grad_norm": 0.515625,
"learning_rate": 5.090949423247561e-06,
"loss": 0.94,
"mean_token_accuracy": 0.7547981061041356,
"num_tokens": 381192630.0,
"step": 4050
},
{
"entropy": 1.3264615371823312,
"epoch": 0.9007709800876366,
"grad_norm": 0.51953125,
"learning_rate": 4.980035492457853e-06,
"loss": 0.9421,
"mean_token_accuracy": 0.7552372604608536,
"num_tokens": 382131792.0,
"step": 4060
},
{
"entropy": 1.3523736476898194,
"epoch": 0.9029896278218426,
"grad_norm": 0.5625,
"learning_rate": 4.869121561668146e-06,
"loss": 0.9506,
"mean_token_accuracy": 0.7518483199179172,
"num_tokens": 383067523.0,
"step": 4070
},
{
"entropy": 1.3546856120228767,
"epoch": 0.9052082755560485,
"grad_norm": 0.515625,
"learning_rate": 4.758207630878438e-06,
"loss": 0.9454,
"mean_token_accuracy": 0.7534751631319523,
"num_tokens": 384006299.0,
"step": 4080
},
{
"entropy": 1.3601078018546104,
"epoch": 0.9074269232902545,
"grad_norm": 0.5859375,
"learning_rate": 4.647293700088731e-06,
"loss": 0.9405,
"mean_token_accuracy": 0.754411680996418,
"num_tokens": 384947487.0,
"step": 4090
},
{
"entropy": 1.339237504452467,
"epoch": 0.9096455710244606,
"grad_norm": 0.515625,
"learning_rate": 4.536379769299024e-06,
"loss": 0.9384,
"mean_token_accuracy": 0.7560152366757393,
"num_tokens": 385874176.0,
"step": 4100
},
{
"entropy": 1.3611842297017573,
"epoch": 0.9118642187586666,
"grad_norm": 0.55859375,
"learning_rate": 4.425465838509317e-06,
"loss": 0.9453,
"mean_token_accuracy": 0.7545816585421562,
"num_tokens": 386816538.0,
"step": 4110
},
{
"entropy": 1.3051216751337051,
"epoch": 0.9140828664928726,
"grad_norm": 0.51171875,
"learning_rate": 4.31455190771961e-06,
"loss": 0.8994,
"mean_token_accuracy": 0.7656806372106075,
"num_tokens": 387775511.0,
"step": 4120
},
{
"entropy": 1.3420870661735536,
"epoch": 0.9163015142270786,
"grad_norm": 0.5390625,
"learning_rate": 4.203637976929903e-06,
"loss": 0.9343,
"mean_token_accuracy": 0.7567372977733612,
"num_tokens": 388685069.0,
"step": 4130
},
{
"entropy": 1.3393280230462552,
"epoch": 0.9185201619612846,
"grad_norm": 0.51171875,
"learning_rate": 4.092724046140196e-06,
"loss": 0.9264,
"mean_token_accuracy": 0.7575048118829727,
"num_tokens": 389642225.0,
"step": 4140
},
{
"entropy": 1.312432309985161,
"epoch": 0.9207388096954906,
"grad_norm": 0.5234375,
"learning_rate": 3.981810115350488e-06,
"loss": 0.9282,
"mean_token_accuracy": 0.7600929595530033,
"num_tokens": 390590909.0,
"step": 4150
},
{
"entropy": 1.3392370440065862,
"epoch": 0.9229574574296966,
"grad_norm": 0.5625,
"learning_rate": 3.870896184560781e-06,
"loss": 0.9476,
"mean_token_accuracy": 0.7553087763488293,
"num_tokens": 391532202.0,
"step": 4160
},
{
"entropy": 1.3347293518483638,
"epoch": 0.9251761051639026,
"grad_norm": 0.53125,
"learning_rate": 3.759982253771074e-06,
"loss": 0.959,
"mean_token_accuracy": 0.7549694336950779,
"num_tokens": 392487451.0,
"step": 4170
},
{
"entropy": 1.3385291382670403,
"epoch": 0.9273947528981086,
"grad_norm": 3.21875,
"learning_rate": 3.6490683229813664e-06,
"loss": 0.9723,
"mean_token_accuracy": 0.7489883296191693,
"num_tokens": 393424376.0,
"step": 4180
},
{
"entropy": 1.3224166721105575,
"epoch": 0.9296134006323146,
"grad_norm": 0.52734375,
"learning_rate": 3.5381543921916594e-06,
"loss": 0.9096,
"mean_token_accuracy": 0.7614037752151489,
"num_tokens": 394361746.0,
"step": 4190
},
{
"entropy": 1.3364241227507592,
"epoch": 0.9318320483665206,
"grad_norm": 0.53125,
"learning_rate": 3.4272404614019524e-06,
"loss": 0.9491,
"mean_token_accuracy": 0.7532857812941074,
"num_tokens": 395307042.0,
"step": 4200
},
{
"entropy": 1.3627421900629997,
"epoch": 0.9340506961007266,
"grad_norm": 0.5234375,
"learning_rate": 3.3163265306122454e-06,
"loss": 0.9864,
"mean_token_accuracy": 0.7476166844367981,
"num_tokens": 396250195.0,
"step": 4210
},
{
"entropy": 1.3614855892956257,
"epoch": 0.9362693438349327,
"grad_norm": 0.53515625,
"learning_rate": 3.2054125998225384e-06,
"loss": 0.9671,
"mean_token_accuracy": 0.7500945217907429,
"num_tokens": 397188536.0,
"step": 4220
},
{
"entropy": 1.2906481601297854,
"epoch": 0.9384879915691386,
"grad_norm": 0.486328125,
"learning_rate": 3.094498669032831e-06,
"loss": 0.9289,
"mean_token_accuracy": 0.7579261489212513,
"num_tokens": 398160424.0,
"step": 4230
},
{
"entropy": 1.3569138646125793,
"epoch": 0.9407066393033446,
"grad_norm": 0.546875,
"learning_rate": 2.9835847382431235e-06,
"loss": 0.9937,
"mean_token_accuracy": 0.7468014664947986,
"num_tokens": 399138573.0,
"step": 4240
},
{
"entropy": 1.3754788801074027,
"epoch": 0.9429252870375506,
"grad_norm": 1.96875,
"learning_rate": 2.872670807453416e-06,
"loss": 0.9847,
"mean_token_accuracy": 0.7449347853660584,
"num_tokens": 400072373.0,
"step": 4250
},
{
"entropy": 1.3287566512823106,
"epoch": 0.9451439347717566,
"grad_norm": 0.5390625,
"learning_rate": 2.761756876663709e-06,
"loss": 0.9585,
"mean_token_accuracy": 0.7522503368556499,
"num_tokens": 401010419.0,
"step": 4260
},
{
"entropy": 1.359559991955757,
"epoch": 0.9473625825059626,
"grad_norm": 0.546875,
"learning_rate": 2.650842945874002e-06,
"loss": 0.9659,
"mean_token_accuracy": 0.7480006530880928,
"num_tokens": 401980514.0,
"step": 4270
},
{
"entropy": 1.3255119130015374,
"epoch": 0.9495812302401686,
"grad_norm": 0.52734375,
"learning_rate": 2.539929015084295e-06,
"loss": 0.9165,
"mean_token_accuracy": 0.7598443776369095,
"num_tokens": 402934393.0,
"step": 4280
},
{
"entropy": 1.314503613859415,
"epoch": 0.9517998779743746,
"grad_norm": 0.546875,
"learning_rate": 2.4290150842945875e-06,
"loss": 0.9198,
"mean_token_accuracy": 0.7572920247912407,
"num_tokens": 403881438.0,
"step": 4290
},
{
"entropy": 1.34530808031559,
"epoch": 0.9540185257085806,
"grad_norm": 0.55078125,
"learning_rate": 2.3181011535048805e-06,
"loss": 0.9502,
"mean_token_accuracy": 0.7529184207320213,
"num_tokens": 404832889.0,
"step": 4300
},
{
"entropy": 1.3469831585884093,
"epoch": 0.9562371734427866,
"grad_norm": 0.5390625,
"learning_rate": 2.207187222715173e-06,
"loss": 0.9485,
"mean_token_accuracy": 0.7524568639695645,
"num_tokens": 405773210.0,
"step": 4310
},
{
"entropy": 1.3356608122587204,
"epoch": 0.9584558211769926,
"grad_norm": 0.52734375,
"learning_rate": 2.096273291925466e-06,
"loss": 0.943,
"mean_token_accuracy": 0.7541289560496807,
"num_tokens": 406697781.0,
"step": 4320
},
{
"entropy": 1.3480161339044572,
"epoch": 0.9606744689111987,
"grad_norm": 0.51171875,
"learning_rate": 1.9853593611357586e-06,
"loss": 0.9618,
"mean_token_accuracy": 0.7477487847208977,
"num_tokens": 407635544.0,
"step": 4330
},
{
"entropy": 1.3414922960102558,
"epoch": 0.9628931166454047,
"grad_norm": 0.53125,
"learning_rate": 1.8744454303460516e-06,
"loss": 0.9485,
"mean_token_accuracy": 0.7516260854899883,
"num_tokens": 408594342.0,
"step": 4340
},
{
"entropy": 1.33254055082798,
"epoch": 0.9651117643796107,
"grad_norm": 0.5390625,
"learning_rate": 1.7635314995563443e-06,
"loss": 0.9164,
"mean_token_accuracy": 0.7584716722369194,
"num_tokens": 409518793.0,
"step": 4350
},
{
"entropy": 1.362374597787857,
"epoch": 0.9673304121138167,
"grad_norm": 0.5078125,
"learning_rate": 1.6526175687666373e-06,
"loss": 0.9664,
"mean_token_accuracy": 0.7495695851743222,
"num_tokens": 410465748.0,
"step": 4360
},
{
"entropy": 1.355623196810484,
"epoch": 0.9695490598480226,
"grad_norm": 0.5390625,
"learning_rate": 1.54170363797693e-06,
"loss": 0.9614,
"mean_token_accuracy": 0.7504058249294758,
"num_tokens": 411413316.0,
"step": 4370
},
{
"entropy": 1.3444112464785576,
"epoch": 0.9717677075822286,
"grad_norm": 0.53515625,
"learning_rate": 1.4307897071872228e-06,
"loss": 0.9682,
"mean_token_accuracy": 0.7514989458024501,
"num_tokens": 412367491.0,
"step": 4380
},
{
"entropy": 1.3571382217109202,
"epoch": 0.9739863553164346,
"grad_norm": 0.546875,
"learning_rate": 1.3198757763975156e-06,
"loss": 0.9415,
"mean_token_accuracy": 0.75667395144701,
"num_tokens": 413306525.0,
"step": 4390
},
{
"entropy": 1.3180716767907144,
"epoch": 0.9762050030506406,
"grad_norm": 0.55859375,
"learning_rate": 1.2089618456078084e-06,
"loss": 0.9439,
"mean_token_accuracy": 0.7561846785247326,
"num_tokens": 414250494.0,
"step": 4400
},
{
"entropy": 1.3656005658209325,
"epoch": 0.9784236507848466,
"grad_norm": 0.53125,
"learning_rate": 1.0980479148181013e-06,
"loss": 0.9833,
"mean_token_accuracy": 0.7456090614199639,
"num_tokens": 415199963.0,
"step": 4410
},
{
"entropy": 1.3268229991197587,
"epoch": 0.9806422985190526,
"grad_norm": 0.484375,
"learning_rate": 9.871339840283939e-07,
"loss": 0.9375,
"mean_token_accuracy": 0.7558161698281765,
"num_tokens": 416170950.0,
"step": 4420
},
{
"entropy": 1.3259350806474686,
"epoch": 0.9828609462532586,
"grad_norm": 0.55078125,
"learning_rate": 8.762200532386869e-07,
"loss": 0.9365,
"mean_token_accuracy": 0.7544685363769531,
"num_tokens": 417129972.0,
"step": 4430
},
{
"entropy": 1.3594698533415794,
"epoch": 0.9850795939874646,
"grad_norm": 0.57421875,
"learning_rate": 7.653061224489796e-07,
"loss": 0.9744,
"mean_token_accuracy": 0.7484218552708626,
"num_tokens": 418083653.0,
"step": 4440
},
{
"entropy": 1.3757464356720448,
"epoch": 0.9872982417216707,
"grad_norm": 0.58203125,
"learning_rate": 6.543921916592724e-07,
"loss": 0.9598,
"mean_token_accuracy": 0.7515306659042835,
"num_tokens": 419023538.0,
"step": 4450
},
{
"entropy": 1.3545207664370538,
"epoch": 0.9895168894558767,
"grad_norm": 0.5078125,
"learning_rate": 5.434782608695653e-07,
"loss": 0.9539,
"mean_token_accuracy": 0.753493282943964,
"num_tokens": 419968988.0,
"step": 4460
},
{
"entropy": 1.3401925891637803,
"epoch": 0.9917355371900827,
"grad_norm": 0.55859375,
"learning_rate": 4.3256433007985804e-07,
"loss": 0.937,
"mean_token_accuracy": 0.753621107339859,
"num_tokens": 420897811.0,
"step": 4470
},
{
"entropy": 1.36095949113369,
"epoch": 0.9939541849242887,
"grad_norm": 0.52734375,
"learning_rate": 3.2165039929015086e-07,
"loss": 0.9757,
"mean_token_accuracy": 0.749586571007967,
"num_tokens": 421848611.0,
"step": 4480
},
{
"entropy": 1.374735850095749,
"epoch": 0.9961728326584947,
"grad_norm": 0.53515625,
"learning_rate": 2.1073646850044365e-07,
"loss": 0.9893,
"mean_token_accuracy": 0.7467234946787358,
"num_tokens": 422804916.0,
"step": 4490
},
{
"entropy": 1.4061301365494727,
"epoch": 0.9983914803927006,
"grad_norm": 0.546875,
"learning_rate": 9.982253771073646e-08,
"loss": 1.0009,
"mean_token_accuracy": 0.7450855560600758,
"num_tokens": 423729440.0,
"step": 4500
}
],
"logging_steps": 10,
"max_steps": 4508,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.662706335855149e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}