olmo2_1b_sft_plus_18 / trainer_state.json
suzeva's picture
Upload folder using huggingface_hub
e671908 verified
Raw
History Blame Contribute Delete
129 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 4508,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.4729585528373719,
"epoch": 0.0022186477342060014,
"grad_norm": 0.66796875,
"learning_rate": 4.990017746228927e-05,
"loss": 1.1026,
"mean_token_accuracy": 0.723765990883112,
"num_tokens": 918149.0,
"step": 10
},
{
"entropy": 1.4707149267196655,
"epoch": 0.004437295468412003,
"grad_norm": 0.7890625,
"learning_rate": 4.978926353149956e-05,
"loss": 1.1101,
"mean_token_accuracy": 0.7222173184156417,
"num_tokens": 1851932.0,
"step": 20
},
{
"entropy": 1.4091981947422028,
"epoch": 0.006655943202618004,
"grad_norm": 0.58984375,
"learning_rate": 4.967834960070985e-05,
"loss": 1.0628,
"mean_token_accuracy": 0.7333360627293587,
"num_tokens": 2794352.0,
"step": 30
},
{
"entropy": 1.3992425069212913,
"epoch": 0.008874590936824005,
"grad_norm": 0.57421875,
"learning_rate": 4.9567435669920145e-05,
"loss": 1.077,
"mean_token_accuracy": 0.7292535044252872,
"num_tokens": 3757078.0,
"step": 40
},
{
"entropy": 1.4060697376728057,
"epoch": 0.011093238671030008,
"grad_norm": 0.5390625,
"learning_rate": 4.945652173913044e-05,
"loss": 1.06,
"mean_token_accuracy": 0.7313959106802941,
"num_tokens": 4731047.0,
"step": 50
},
{
"entropy": 1.385067519545555,
"epoch": 0.013311886405236008,
"grad_norm": 0.53125,
"learning_rate": 4.934560780834073e-05,
"loss": 1.0177,
"mean_token_accuracy": 0.7411344431340694,
"num_tokens": 5679856.0,
"step": 60
},
{
"entropy": 1.4070588394999504,
"epoch": 0.01553053413944201,
"grad_norm": 0.56640625,
"learning_rate": 4.923469387755102e-05,
"loss": 1.0279,
"mean_token_accuracy": 0.7387959420681,
"num_tokens": 6628887.0,
"step": 70
},
{
"entropy": 1.3842194020748138,
"epoch": 0.01774918187364801,
"grad_norm": 0.5625,
"learning_rate": 4.9123779946761314e-05,
"loss": 1.0559,
"mean_token_accuracy": 0.7331727184355259,
"num_tokens": 7596388.0,
"step": 80
},
{
"entropy": 1.466818632185459,
"epoch": 0.019967829607854013,
"grad_norm": 0.625,
"learning_rate": 4.9012866015971606e-05,
"loss": 1.11,
"mean_token_accuracy": 0.7209376402199268,
"num_tokens": 8538237.0,
"step": 90
},
{
"entropy": 1.433634176105261,
"epoch": 0.022186477342060015,
"grad_norm": 0.62890625,
"learning_rate": 4.8901952085181905e-05,
"loss": 1.077,
"mean_token_accuracy": 0.7292104378342629,
"num_tokens": 9485166.0,
"step": 100
},
{
"entropy": 1.4099419370293618,
"epoch": 0.024405125076266018,
"grad_norm": 0.5546875,
"learning_rate": 4.87910381543922e-05,
"loss": 1.0308,
"mean_token_accuracy": 0.7382783465087414,
"num_tokens": 10417165.0,
"step": 110
},
{
"entropy": 1.405370193719864,
"epoch": 0.026623772810472016,
"grad_norm": 0.5703125,
"learning_rate": 4.868012422360249e-05,
"loss": 1.0073,
"mean_token_accuracy": 0.7402876511216163,
"num_tokens": 11335861.0,
"step": 120
},
{
"entropy": 1.4469662189483643,
"epoch": 0.02884242054467802,
"grad_norm": 0.6328125,
"learning_rate": 4.856921029281278e-05,
"loss": 1.0661,
"mean_token_accuracy": 0.7298030622303486,
"num_tokens": 12263889.0,
"step": 130
},
{
"entropy": 1.3592407315969468,
"epoch": 0.03106106827888402,
"grad_norm": 0.609375,
"learning_rate": 4.845829636202307e-05,
"loss": 0.9871,
"mean_token_accuracy": 0.7455302596092224,
"num_tokens": 13210311.0,
"step": 140
},
{
"entropy": 1.3838115274906158,
"epoch": 0.03327971601309002,
"grad_norm": 0.57421875,
"learning_rate": 4.8347382431233365e-05,
"loss": 1.0185,
"mean_token_accuracy": 0.7393872648477554,
"num_tokens": 14157072.0,
"step": 150
},
{
"entropy": 1.3638476587831974,
"epoch": 0.03549836374729602,
"grad_norm": 0.55859375,
"learning_rate": 4.823646850044366e-05,
"loss": 1.0026,
"mean_token_accuracy": 0.7428654655814171,
"num_tokens": 15103967.0,
"step": 160
},
{
"entropy": 1.385922372341156,
"epoch": 0.03771701148150203,
"grad_norm": 0.55078125,
"learning_rate": 4.812555456965395e-05,
"loss": 1.0082,
"mean_token_accuracy": 0.7438161842525005,
"num_tokens": 16057562.0,
"step": 170
},
{
"entropy": 1.4505465492606162,
"epoch": 0.039935659215708026,
"grad_norm": 0.55859375,
"learning_rate": 4.801464063886424e-05,
"loss": 1.0561,
"mean_token_accuracy": 0.7318664930760861,
"num_tokens": 16978828.0,
"step": 180
},
{
"entropy": 1.4350886657834052,
"epoch": 0.042154306949914025,
"grad_norm": 0.56640625,
"learning_rate": 4.7903726708074534e-05,
"loss": 1.0676,
"mean_token_accuracy": 0.7291314266622066,
"num_tokens": 17901464.0,
"step": 190
},
{
"entropy": 1.4210979074239731,
"epoch": 0.04437295468412003,
"grad_norm": 0.54296875,
"learning_rate": 4.7792812777284826e-05,
"loss": 1.0306,
"mean_token_accuracy": 0.7380646444857121,
"num_tokens": 18864277.0,
"step": 200
},
{
"entropy": 1.4056882798671722,
"epoch": 0.04659160241832603,
"grad_norm": 0.55859375,
"learning_rate": 4.768189884649512e-05,
"loss": 1.0177,
"mean_token_accuracy": 0.740249615162611,
"num_tokens": 19808213.0,
"step": 210
},
{
"entropy": 1.3831629231572151,
"epoch": 0.048810250152532035,
"grad_norm": 0.546875,
"learning_rate": 4.757098491570541e-05,
"loss": 1.0107,
"mean_token_accuracy": 0.7425381779670716,
"num_tokens": 20748143.0,
"step": 220
},
{
"entropy": 1.3360425300896168,
"epoch": 0.051028897886738034,
"grad_norm": 0.546875,
"learning_rate": 4.74600709849157e-05,
"loss": 0.9563,
"mean_token_accuracy": 0.7526988208293914,
"num_tokens": 21698186.0,
"step": 230
},
{
"entropy": 1.4442797765135764,
"epoch": 0.05324754562094403,
"grad_norm": 0.60546875,
"learning_rate": 4.7349157054126e-05,
"loss": 1.0408,
"mean_token_accuracy": 0.7342406339943409,
"num_tokens": 22653187.0,
"step": 240
},
{
"entropy": 1.4190511792898177,
"epoch": 0.05546619335515004,
"grad_norm": 0.6015625,
"learning_rate": 4.7238243123336293e-05,
"loss": 1.0243,
"mean_token_accuracy": 0.7393615126609803,
"num_tokens": 23601229.0,
"step": 250
},
{
"entropy": 1.4013425052165984,
"epoch": 0.05768484108935604,
"grad_norm": 0.578125,
"learning_rate": 4.7127329192546586e-05,
"loss": 1.0445,
"mean_token_accuracy": 0.737453556060791,
"num_tokens": 24545674.0,
"step": 260
},
{
"entropy": 1.3956441208720207,
"epoch": 0.059903488823562036,
"grad_norm": 0.5625,
"learning_rate": 4.701641526175688e-05,
"loss": 1.0355,
"mean_token_accuracy": 0.7368819013237953,
"num_tokens": 25480593.0,
"step": 270
},
{
"entropy": 1.3561255246400834,
"epoch": 0.06212213655776804,
"grad_norm": 0.5625,
"learning_rate": 4.690550133096717e-05,
"loss": 1.0008,
"mean_token_accuracy": 0.7417342521250248,
"num_tokens": 26437892.0,
"step": 280
},
{
"entropy": 1.3865095235407352,
"epoch": 0.06434078429197404,
"grad_norm": 0.5390625,
"learning_rate": 4.679458740017746e-05,
"loss": 1.0156,
"mean_token_accuracy": 0.7418425239622592,
"num_tokens": 27388999.0,
"step": 290
},
{
"entropy": 1.404170949012041,
"epoch": 0.06655943202618005,
"grad_norm": 0.53515625,
"learning_rate": 4.6683673469387754e-05,
"loss": 1.0029,
"mean_token_accuracy": 0.7463115990161896,
"num_tokens": 28344677.0,
"step": 300
},
{
"entropy": 1.3910762615501882,
"epoch": 0.06877807976038605,
"grad_norm": 0.55078125,
"learning_rate": 4.6572759538598046e-05,
"loss": 1.0098,
"mean_token_accuracy": 0.7405552670359612,
"num_tokens": 29289045.0,
"step": 310
},
{
"entropy": 1.441838303208351,
"epoch": 0.07099672749459204,
"grad_norm": 0.57421875,
"learning_rate": 4.646184560780834e-05,
"loss": 1.0902,
"mean_token_accuracy": 0.7256961852312088,
"num_tokens": 30215206.0,
"step": 320
},
{
"entropy": 1.3631876975297927,
"epoch": 0.07321537522879805,
"grad_norm": 0.57421875,
"learning_rate": 4.635093167701863e-05,
"loss": 1.0127,
"mean_token_accuracy": 0.7429364562034607,
"num_tokens": 31165550.0,
"step": 330
},
{
"entropy": 1.4029483541846275,
"epoch": 0.07543402296300405,
"grad_norm": 0.55859375,
"learning_rate": 4.624001774622893e-05,
"loss": 1.0015,
"mean_token_accuracy": 0.7426272496581078,
"num_tokens": 32097154.0,
"step": 340
},
{
"entropy": 1.3886511482298374,
"epoch": 0.07765267069721005,
"grad_norm": 0.5078125,
"learning_rate": 4.612910381543922e-05,
"loss": 1.0187,
"mean_token_accuracy": 0.7411878131330013,
"num_tokens": 33034411.0,
"step": 350
},
{
"entropy": 1.3666007652878762,
"epoch": 0.07987131843141605,
"grad_norm": 0.5625,
"learning_rate": 4.6018189884649514e-05,
"loss": 0.9746,
"mean_token_accuracy": 0.7496642753481865,
"num_tokens": 33974618.0,
"step": 360
},
{
"entropy": 1.3778321206569673,
"epoch": 0.08208996616562206,
"grad_norm": 0.5625,
"learning_rate": 4.5907275953859806e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7477375149726868,
"num_tokens": 34914062.0,
"step": 370
},
{
"entropy": 1.3750384822487831,
"epoch": 0.08430861389982805,
"grad_norm": 0.53125,
"learning_rate": 4.57963620230701e-05,
"loss": 0.9757,
"mean_token_accuracy": 0.7492865726351738,
"num_tokens": 35845845.0,
"step": 380
},
{
"entropy": 1.40703696757555,
"epoch": 0.08652726163403406,
"grad_norm": 0.546875,
"learning_rate": 4.568544809228039e-05,
"loss": 1.0141,
"mean_token_accuracy": 0.7390294030308724,
"num_tokens": 36767543.0,
"step": 390
},
{
"entropy": 1.3947004944086074,
"epoch": 0.08874590936824006,
"grad_norm": 0.53125,
"learning_rate": 4.557453416149068e-05,
"loss": 0.9984,
"mean_token_accuracy": 0.7446502350270748,
"num_tokens": 37713319.0,
"step": 400
},
{
"entropy": 1.4182243198156357,
"epoch": 0.09096455710244605,
"grad_norm": 0.5390625,
"learning_rate": 4.5463620230700974e-05,
"loss": 1.0251,
"mean_token_accuracy": 0.7391804203391075,
"num_tokens": 38672746.0,
"step": 410
},
{
"entropy": 1.408482176810503,
"epoch": 0.09318320483665206,
"grad_norm": 0.55859375,
"learning_rate": 4.5352706299911266e-05,
"loss": 1.0114,
"mean_token_accuracy": 0.7393792733550072,
"num_tokens": 39634632.0,
"step": 420
},
{
"entropy": 1.4136851638555528,
"epoch": 0.09540185257085806,
"grad_norm": 0.55859375,
"learning_rate": 4.5241792369121565e-05,
"loss": 0.9879,
"mean_token_accuracy": 0.7459694370627403,
"num_tokens": 40576342.0,
"step": 430
},
{
"entropy": 1.383458285033703,
"epoch": 0.09762050030506407,
"grad_norm": 0.515625,
"learning_rate": 4.513087843833186e-05,
"loss": 0.979,
"mean_token_accuracy": 0.7476258493959904,
"num_tokens": 41505927.0,
"step": 440
},
{
"entropy": 1.4427544571459294,
"epoch": 0.09983914803927006,
"grad_norm": 0.546875,
"learning_rate": 4.501996450754215e-05,
"loss": 1.0537,
"mean_token_accuracy": 0.7316265814006329,
"num_tokens": 42455803.0,
"step": 450
},
{
"entropy": 1.3921602264046669,
"epoch": 0.10205779577347607,
"grad_norm": 0.58984375,
"learning_rate": 4.490905057675244e-05,
"loss": 1.0066,
"mean_token_accuracy": 0.7426870331168175,
"num_tokens": 43404878.0,
"step": 460
},
{
"entropy": 1.3988172575831412,
"epoch": 0.10427644350768207,
"grad_norm": 0.5078125,
"learning_rate": 4.4798136645962734e-05,
"loss": 1.0108,
"mean_token_accuracy": 0.742293368279934,
"num_tokens": 44391917.0,
"step": 470
},
{
"entropy": 1.4275135532021523,
"epoch": 0.10649509124188807,
"grad_norm": 0.5625,
"learning_rate": 4.4687222715173026e-05,
"loss": 1.0262,
"mean_token_accuracy": 0.7378039725124836,
"num_tokens": 45329206.0,
"step": 480
},
{
"entropy": 1.3842679247260095,
"epoch": 0.10871373897609407,
"grad_norm": 0.5625,
"learning_rate": 4.457630878438332e-05,
"loss": 1.0035,
"mean_token_accuracy": 0.7409528233110905,
"num_tokens": 46299789.0,
"step": 490
},
{
"entropy": 1.390407882630825,
"epoch": 0.11093238671030008,
"grad_norm": 0.5625,
"learning_rate": 4.446539485359361e-05,
"loss": 0.9843,
"mean_token_accuracy": 0.746420969069004,
"num_tokens": 47246331.0,
"step": 500
},
{
"entropy": 1.3856108456850051,
"epoch": 0.11315103444450607,
"grad_norm": 0.5546875,
"learning_rate": 4.43544809228039e-05,
"loss": 0.978,
"mean_token_accuracy": 0.7486258946359158,
"num_tokens": 48200167.0,
"step": 510
},
{
"entropy": 1.3945159137248992,
"epoch": 0.11536968217871207,
"grad_norm": 0.5234375,
"learning_rate": 4.42435669920142e-05,
"loss": 1.0085,
"mean_token_accuracy": 0.7415202759206295,
"num_tokens": 49150454.0,
"step": 520
},
{
"entropy": 1.3512628681957721,
"epoch": 0.11758832991291808,
"grad_norm": 0.54296875,
"learning_rate": 4.4132653061224493e-05,
"loss": 0.9385,
"mean_token_accuracy": 0.7570643424987793,
"num_tokens": 50085034.0,
"step": 530
},
{
"entropy": 1.378444318473339,
"epoch": 0.11980697764712407,
"grad_norm": 0.53125,
"learning_rate": 4.4021739130434786e-05,
"loss": 0.9825,
"mean_token_accuracy": 0.7446637496352195,
"num_tokens": 51014521.0,
"step": 540
},
{
"entropy": 1.3720286831259727,
"epoch": 0.12202562538133008,
"grad_norm": 0.57421875,
"learning_rate": 4.391082519964508e-05,
"loss": 0.9718,
"mean_token_accuracy": 0.7489398539066314,
"num_tokens": 51929505.0,
"step": 550
},
{
"entropy": 1.3862373858690262,
"epoch": 0.12424427311553608,
"grad_norm": 0.53125,
"learning_rate": 4.379991126885537e-05,
"loss": 0.9629,
"mean_token_accuracy": 0.7500099420547486,
"num_tokens": 52878638.0,
"step": 560
},
{
"entropy": 1.3761510282754899,
"epoch": 0.1264629208497421,
"grad_norm": 0.57421875,
"learning_rate": 4.368899733806566e-05,
"loss": 0.9695,
"mean_token_accuracy": 0.7509791783988475,
"num_tokens": 53815492.0,
"step": 570
},
{
"entropy": 1.388393123447895,
"epoch": 0.12868156858394808,
"grad_norm": 0.546875,
"learning_rate": 4.3578083407275954e-05,
"loss": 0.9979,
"mean_token_accuracy": 0.7407989487051964,
"num_tokens": 54745153.0,
"step": 580
},
{
"entropy": 1.3540472716093064,
"epoch": 0.13090021631815407,
"grad_norm": 0.55078125,
"learning_rate": 4.3467169476486246e-05,
"loss": 0.9778,
"mean_token_accuracy": 0.7482736088335514,
"num_tokens": 55704045.0,
"step": 590
},
{
"entropy": 1.3751274153590203,
"epoch": 0.1331188640523601,
"grad_norm": 0.56640625,
"learning_rate": 4.335625554569654e-05,
"loss": 0.9656,
"mean_token_accuracy": 0.7485008135437965,
"num_tokens": 56631888.0,
"step": 600
},
{
"entropy": 1.424610199034214,
"epoch": 0.13533751178656608,
"grad_norm": 0.5234375,
"learning_rate": 4.324534161490684e-05,
"loss": 1.0094,
"mean_token_accuracy": 0.7427875995635986,
"num_tokens": 57580851.0,
"step": 610
},
{
"entropy": 1.3987043127417564,
"epoch": 0.1375561595207721,
"grad_norm": 0.578125,
"learning_rate": 4.313442768411713e-05,
"loss": 1.0099,
"mean_token_accuracy": 0.7419761680066586,
"num_tokens": 58492885.0,
"step": 620
},
{
"entropy": 1.3795367434620858,
"epoch": 0.1397748072549781,
"grad_norm": 0.5625,
"learning_rate": 4.302351375332742e-05,
"loss": 0.9619,
"mean_token_accuracy": 0.7496286295354366,
"num_tokens": 59446819.0,
"step": 630
},
{
"entropy": 1.4246120005846024,
"epoch": 0.1419934549891841,
"grad_norm": 0.55859375,
"learning_rate": 4.2912599822537714e-05,
"loss": 1.0243,
"mean_token_accuracy": 0.7391403771936893,
"num_tokens": 60379693.0,
"step": 640
},
{
"entropy": 1.3605768918991088,
"epoch": 0.1442121027233901,
"grad_norm": 0.546875,
"learning_rate": 4.2801685891748006e-05,
"loss": 0.9522,
"mean_token_accuracy": 0.7532150462269783,
"num_tokens": 61333413.0,
"step": 650
},
{
"entropy": 1.4056472092866898,
"epoch": 0.1464307504575961,
"grad_norm": 0.5703125,
"learning_rate": 4.26907719609583e-05,
"loss": 1.0085,
"mean_token_accuracy": 0.7418359808623791,
"num_tokens": 62265474.0,
"step": 660
},
{
"entropy": 1.3709092542529107,
"epoch": 0.1486493981918021,
"grad_norm": 0.5234375,
"learning_rate": 4.257985803016859e-05,
"loss": 0.9743,
"mean_token_accuracy": 0.7496256902813911,
"num_tokens": 63207696.0,
"step": 670
},
{
"entropy": 1.4048712268471717,
"epoch": 0.1508680459260081,
"grad_norm": 0.54296875,
"learning_rate": 4.246894409937888e-05,
"loss": 0.9926,
"mean_token_accuracy": 0.7464736774563789,
"num_tokens": 64150100.0,
"step": 680
},
{
"entropy": 1.4152741387486458,
"epoch": 0.1530866936602141,
"grad_norm": 0.54296875,
"learning_rate": 4.2358030168589174e-05,
"loss": 0.9764,
"mean_token_accuracy": 0.7450054451823235,
"num_tokens": 65065205.0,
"step": 690
},
{
"entropy": 1.4143257439136505,
"epoch": 0.1553053413944201,
"grad_norm": 0.57421875,
"learning_rate": 4.224711623779947e-05,
"loss": 1.0204,
"mean_token_accuracy": 0.7379486717283725,
"num_tokens": 65984220.0,
"step": 700
},
{
"entropy": 1.383517174422741,
"epoch": 0.1575239891286261,
"grad_norm": 0.54296875,
"learning_rate": 4.2136202307009765e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.7429847024381161,
"num_tokens": 66963944.0,
"step": 710
},
{
"entropy": 1.364837247878313,
"epoch": 0.1597426368628321,
"grad_norm": 0.546875,
"learning_rate": 4.202528837622006e-05,
"loss": 0.9569,
"mean_token_accuracy": 0.7517856456339359,
"num_tokens": 67927027.0,
"step": 720
},
{
"entropy": 1.388382686674595,
"epoch": 0.1619612845970381,
"grad_norm": 0.55859375,
"learning_rate": 4.191437444543035e-05,
"loss": 0.9754,
"mean_token_accuracy": 0.7475278504192829,
"num_tokens": 68858413.0,
"step": 730
},
{
"entropy": 1.3992270916700362,
"epoch": 0.16417993233124412,
"grad_norm": 0.49609375,
"learning_rate": 4.180346051464064e-05,
"loss": 0.9843,
"mean_token_accuracy": 0.7459095239639282,
"num_tokens": 69776534.0,
"step": 740
},
{
"entropy": 1.3922007218003274,
"epoch": 0.1663985800654501,
"grad_norm": 0.54296875,
"learning_rate": 4.1692546583850934e-05,
"loss": 0.9939,
"mean_token_accuracy": 0.7453566305339336,
"num_tokens": 70723313.0,
"step": 750
},
{
"entropy": 1.3805669724941254,
"epoch": 0.1686172277996561,
"grad_norm": 0.58203125,
"learning_rate": 4.1581632653061226e-05,
"loss": 0.9913,
"mean_token_accuracy": 0.7465671949088574,
"num_tokens": 71704943.0,
"step": 760
},
{
"entropy": 1.3953271463513375,
"epoch": 0.17083587553386212,
"grad_norm": 0.6640625,
"learning_rate": 4.147071872227152e-05,
"loss": 1.0389,
"mean_token_accuracy": 0.7354367606341838,
"num_tokens": 72654290.0,
"step": 770
},
{
"entropy": 1.3998527079820633,
"epoch": 0.1730545232680681,
"grad_norm": 0.54296875,
"learning_rate": 4.135980479148181e-05,
"loss": 0.9947,
"mean_token_accuracy": 0.7447001703083516,
"num_tokens": 73591959.0,
"step": 780
},
{
"entropy": 1.3867414839565755,
"epoch": 0.1752731710022741,
"grad_norm": 0.5390625,
"learning_rate": 4.124889086069211e-05,
"loss": 1.0031,
"mean_token_accuracy": 0.7421109825372696,
"num_tokens": 74553895.0,
"step": 790
},
{
"entropy": 1.3889594689011573,
"epoch": 0.17749181873648012,
"grad_norm": 0.5234375,
"learning_rate": 4.11379769299024e-05,
"loss": 0.9798,
"mean_token_accuracy": 0.7458746030926704,
"num_tokens": 75473199.0,
"step": 800
},
{
"entropy": 1.3977437242865562,
"epoch": 0.17971046647068611,
"grad_norm": 0.51953125,
"learning_rate": 4.1027062999112693e-05,
"loss": 0.9733,
"mean_token_accuracy": 0.747966817766428,
"num_tokens": 76414141.0,
"step": 810
},
{
"entropy": 1.367151539027691,
"epoch": 0.1819291142048921,
"grad_norm": 0.5703125,
"learning_rate": 4.0916149068322986e-05,
"loss": 0.9841,
"mean_token_accuracy": 0.7465965315699578,
"num_tokens": 77366592.0,
"step": 820
},
{
"entropy": 1.3750471204519272,
"epoch": 0.18414776193909813,
"grad_norm": 0.5703125,
"learning_rate": 4.080523513753328e-05,
"loss": 0.9989,
"mean_token_accuracy": 0.741999814659357,
"num_tokens": 78302248.0,
"step": 830
},
{
"entropy": 1.3610561907291412,
"epoch": 0.18636640967330412,
"grad_norm": 0.5234375,
"learning_rate": 4.069432120674357e-05,
"loss": 0.9803,
"mean_token_accuracy": 0.7461248070001603,
"num_tokens": 79268687.0,
"step": 840
},
{
"entropy": 1.3994140163064004,
"epoch": 0.1885850574075101,
"grad_norm": 0.5390625,
"learning_rate": 4.058340727595386e-05,
"loss": 1.0047,
"mean_token_accuracy": 0.7401757217943669,
"num_tokens": 80216167.0,
"step": 850
},
{
"entropy": 1.39816662222147,
"epoch": 0.19080370514171613,
"grad_norm": 0.57421875,
"learning_rate": 4.0472493345164154e-05,
"loss": 1.0098,
"mean_token_accuracy": 0.7411137498915196,
"num_tokens": 81146855.0,
"step": 860
},
{
"entropy": 1.4110144585371018,
"epoch": 0.19302235287592212,
"grad_norm": 0.578125,
"learning_rate": 4.0361579414374446e-05,
"loss": 0.9975,
"mean_token_accuracy": 0.7468475431203843,
"num_tokens": 82065352.0,
"step": 870
},
{
"entropy": 1.4093362182378768,
"epoch": 0.19524100061012814,
"grad_norm": 0.5625,
"learning_rate": 4.025066548358474e-05,
"loss": 0.9961,
"mean_token_accuracy": 0.7452754236757755,
"num_tokens": 83009393.0,
"step": 880
},
{
"entropy": 1.3738794058561326,
"epoch": 0.19745964834433413,
"grad_norm": 0.51953125,
"learning_rate": 4.013975155279504e-05,
"loss": 0.9595,
"mean_token_accuracy": 0.7526905313134193,
"num_tokens": 83982619.0,
"step": 890
},
{
"entropy": 1.3857081905007362,
"epoch": 0.19967829607854012,
"grad_norm": 0.5625,
"learning_rate": 4.002883762200533e-05,
"loss": 0.9776,
"mean_token_accuracy": 0.748926243185997,
"num_tokens": 84939163.0,
"step": 900
},
{
"entropy": 1.398831880092621,
"epoch": 0.20189694381274614,
"grad_norm": 0.54296875,
"learning_rate": 3.991792369121562e-05,
"loss": 0.9865,
"mean_token_accuracy": 0.7459573321044445,
"num_tokens": 85887826.0,
"step": 910
},
{
"entropy": 1.3910220503807067,
"epoch": 0.20411559154695214,
"grad_norm": 0.5546875,
"learning_rate": 3.9807009760425914e-05,
"loss": 0.9849,
"mean_token_accuracy": 0.745719988644123,
"num_tokens": 86808570.0,
"step": 920
},
{
"entropy": 1.3656192794442177,
"epoch": 0.20633423928115813,
"grad_norm": 0.51171875,
"learning_rate": 3.9696095829636206e-05,
"loss": 0.9658,
"mean_token_accuracy": 0.7481127180159092,
"num_tokens": 87748687.0,
"step": 930
},
{
"entropy": 1.3675310105085372,
"epoch": 0.20855288701536415,
"grad_norm": 0.50390625,
"learning_rate": 3.95851818988465e-05,
"loss": 0.9634,
"mean_token_accuracy": 0.7505045898258687,
"num_tokens": 88718503.0,
"step": 940
},
{
"entropy": 1.365248803794384,
"epoch": 0.21077153474957014,
"grad_norm": 0.515625,
"learning_rate": 3.947426796805679e-05,
"loss": 0.9377,
"mean_token_accuracy": 0.756609782576561,
"num_tokens": 89646214.0,
"step": 950
},
{
"entropy": 1.3557728335261345,
"epoch": 0.21299018248377613,
"grad_norm": 0.5546875,
"learning_rate": 3.936335403726708e-05,
"loss": 0.9495,
"mean_token_accuracy": 0.7515292674303055,
"num_tokens": 90584539.0,
"step": 960
},
{
"entropy": 1.3375528261065484,
"epoch": 0.21520883021798215,
"grad_norm": 0.58203125,
"learning_rate": 3.9252440106477374e-05,
"loss": 0.9359,
"mean_token_accuracy": 0.7541147537529469,
"num_tokens": 91524927.0,
"step": 970
},
{
"entropy": 1.3766776040196418,
"epoch": 0.21742747795218814,
"grad_norm": 0.54296875,
"learning_rate": 3.914152617568767e-05,
"loss": 0.9758,
"mean_token_accuracy": 0.7470216073095799,
"num_tokens": 92472966.0,
"step": 980
},
{
"entropy": 1.3779357895255089,
"epoch": 0.21964612568639413,
"grad_norm": 0.52734375,
"learning_rate": 3.9030612244897965e-05,
"loss": 0.9641,
"mean_token_accuracy": 0.7518527932465077,
"num_tokens": 93410659.0,
"step": 990
},
{
"entropy": 1.3866903841495515,
"epoch": 0.22186477342060015,
"grad_norm": 0.5390625,
"learning_rate": 3.891969831410826e-05,
"loss": 0.9693,
"mean_token_accuracy": 0.7480762518942357,
"num_tokens": 94376705.0,
"step": 1000
},
{
"entropy": 1.4138796277344228,
"epoch": 0.22408342115480614,
"grad_norm": 0.53125,
"learning_rate": 3.880878438331855e-05,
"loss": 0.9885,
"mean_token_accuracy": 0.746094710379839,
"num_tokens": 95306609.0,
"step": 1010
},
{
"entropy": 1.3473317727446557,
"epoch": 0.22630206888901214,
"grad_norm": 0.54296875,
"learning_rate": 3.869787045252884e-05,
"loss": 0.9388,
"mean_token_accuracy": 0.7558636233210564,
"num_tokens": 96277898.0,
"step": 1020
},
{
"entropy": 1.3636071279644966,
"epoch": 0.22852071662321816,
"grad_norm": 0.6015625,
"learning_rate": 3.8586956521739134e-05,
"loss": 0.9735,
"mean_token_accuracy": 0.745589692890644,
"num_tokens": 97233753.0,
"step": 1030
},
{
"entropy": 1.372378407418728,
"epoch": 0.23073936435742415,
"grad_norm": 0.5390625,
"learning_rate": 3.8476042590949426e-05,
"loss": 0.9672,
"mean_token_accuracy": 0.7510603852570057,
"num_tokens": 98177601.0,
"step": 1040
},
{
"entropy": 1.367596785724163,
"epoch": 0.23295801209163014,
"grad_norm": 0.5078125,
"learning_rate": 3.836512866015972e-05,
"loss": 0.9535,
"mean_token_accuracy": 0.7517831392586232,
"num_tokens": 99133455.0,
"step": 1050
},
{
"entropy": 1.3717108502984048,
"epoch": 0.23517665982583616,
"grad_norm": 0.55859375,
"learning_rate": 3.825421472937001e-05,
"loss": 0.9751,
"mean_token_accuracy": 0.7493723064661026,
"num_tokens": 100077287.0,
"step": 1060
},
{
"entropy": 1.378007946908474,
"epoch": 0.23739530756004215,
"grad_norm": 0.53515625,
"learning_rate": 3.814330079858031e-05,
"loss": 0.9352,
"mean_token_accuracy": 0.7550456888973713,
"num_tokens": 101011915.0,
"step": 1070
},
{
"entropy": 1.3725242644548417,
"epoch": 0.23961395529424814,
"grad_norm": 0.5234375,
"learning_rate": 3.80323868677906e-05,
"loss": 0.9535,
"mean_token_accuracy": 0.7519958928227425,
"num_tokens": 101961304.0,
"step": 1080
},
{
"entropy": 1.415687733888626,
"epoch": 0.24183260302845416,
"grad_norm": 0.546875,
"learning_rate": 3.7921472937000893e-05,
"loss": 0.9963,
"mean_token_accuracy": 0.7424227021634578,
"num_tokens": 102891482.0,
"step": 1090
},
{
"entropy": 1.356763481348753,
"epoch": 0.24405125076266015,
"grad_norm": 0.54296875,
"learning_rate": 3.7810559006211186e-05,
"loss": 0.9353,
"mean_token_accuracy": 0.7564209721982479,
"num_tokens": 103831567.0,
"step": 1100
},
{
"entropy": 1.3712417140603066,
"epoch": 0.24626989849686615,
"grad_norm": 0.55078125,
"learning_rate": 3.769964507542148e-05,
"loss": 0.9628,
"mean_token_accuracy": 0.7527426145970821,
"num_tokens": 104771073.0,
"step": 1110
},
{
"entropy": 1.3849323302507401,
"epoch": 0.24848854623107217,
"grad_norm": 0.59375,
"learning_rate": 3.758873114463177e-05,
"loss": 1.0069,
"mean_token_accuracy": 0.7417409770190716,
"num_tokens": 105699528.0,
"step": 1120
},
{
"entropy": 1.4036426708102225,
"epoch": 0.2507071939652782,
"grad_norm": 0.50390625,
"learning_rate": 3.747781721384206e-05,
"loss": 0.9894,
"mean_token_accuracy": 0.7465023934841156,
"num_tokens": 106650613.0,
"step": 1130
},
{
"entropy": 1.3854996912181377,
"epoch": 0.2529258416994842,
"grad_norm": 0.54296875,
"learning_rate": 3.7366903283052354e-05,
"loss": 0.9722,
"mean_token_accuracy": 0.7488848619163037,
"num_tokens": 107576916.0,
"step": 1140
},
{
"entropy": 1.3835882171988487,
"epoch": 0.25514448943369017,
"grad_norm": 0.5234375,
"learning_rate": 3.7255989352262646e-05,
"loss": 0.9998,
"mean_token_accuracy": 0.7414388991892338,
"num_tokens": 108541529.0,
"step": 1150
},
{
"entropy": 1.3686518892645836,
"epoch": 0.25736313716789616,
"grad_norm": 0.51953125,
"learning_rate": 3.714507542147294e-05,
"loss": 0.9453,
"mean_token_accuracy": 0.7537351176142693,
"num_tokens": 109478622.0,
"step": 1160
},
{
"entropy": 1.406387110054493,
"epoch": 0.25958178490210215,
"grad_norm": 0.51171875,
"learning_rate": 3.703416149068323e-05,
"loss": 0.9794,
"mean_token_accuracy": 0.7466554552316665,
"num_tokens": 110405684.0,
"step": 1170
},
{
"entropy": 1.3809578880667686,
"epoch": 0.26180043263630814,
"grad_norm": 0.5625,
"learning_rate": 3.692324755989352e-05,
"loss": 0.9719,
"mean_token_accuracy": 0.749175675958395,
"num_tokens": 111345202.0,
"step": 1180
},
{
"entropy": 1.3847816362977028,
"epoch": 0.2640190803705142,
"grad_norm": 0.5859375,
"learning_rate": 3.6812333629103815e-05,
"loss": 1.0003,
"mean_token_accuracy": 0.7436210744082927,
"num_tokens": 112274997.0,
"step": 1190
},
{
"entropy": 1.3820923566818237,
"epoch": 0.2662377281047202,
"grad_norm": 0.55859375,
"learning_rate": 3.670141969831411e-05,
"loss": 0.9592,
"mean_token_accuracy": 0.7504418276250362,
"num_tokens": 113206700.0,
"step": 1200
},
{
"entropy": 1.3826360628008842,
"epoch": 0.2684563758389262,
"grad_norm": 0.5859375,
"learning_rate": 3.65905057675244e-05,
"loss": 0.9873,
"mean_token_accuracy": 0.7447850324213505,
"num_tokens": 114136136.0,
"step": 1210
},
{
"entropy": 1.3701522216200828,
"epoch": 0.27067502357313217,
"grad_norm": 0.55078125,
"learning_rate": 3.64795918367347e-05,
"loss": 0.9779,
"mean_token_accuracy": 0.7473484382033349,
"num_tokens": 115065377.0,
"step": 1220
},
{
"entropy": 1.3910960853099823,
"epoch": 0.27289367130733816,
"grad_norm": 0.5234375,
"learning_rate": 3.636867790594499e-05,
"loss": 0.989,
"mean_token_accuracy": 0.7464887276291847,
"num_tokens": 116011291.0,
"step": 1230
},
{
"entropy": 1.370178584754467,
"epoch": 0.2751123190415442,
"grad_norm": 0.546875,
"learning_rate": 3.625776397515528e-05,
"loss": 0.9897,
"mean_token_accuracy": 0.7448255158960819,
"num_tokens": 116970495.0,
"step": 1240
},
{
"entropy": 1.3493198916316032,
"epoch": 0.2773309667757502,
"grad_norm": 0.52734375,
"learning_rate": 3.6146850044365574e-05,
"loss": 0.949,
"mean_token_accuracy": 0.7529671564698219,
"num_tokens": 117911337.0,
"step": 1250
},
{
"entropy": 1.371771328896284,
"epoch": 0.2795496145099562,
"grad_norm": 0.515625,
"learning_rate": 3.6035936113575866e-05,
"loss": 0.9472,
"mean_token_accuracy": 0.753813973069191,
"num_tokens": 118848493.0,
"step": 1260
},
{
"entropy": 1.4208975359797478,
"epoch": 0.2817682622441622,
"grad_norm": 0.53125,
"learning_rate": 3.592502218278616e-05,
"loss": 1.0034,
"mean_token_accuracy": 0.7418984033167362,
"num_tokens": 119781601.0,
"step": 1270
},
{
"entropy": 1.395139442384243,
"epoch": 0.2839869099783682,
"grad_norm": 0.53515625,
"learning_rate": 3.581410825199645e-05,
"loss": 1.0071,
"mean_token_accuracy": 0.7408353559672832,
"num_tokens": 120722213.0,
"step": 1280
},
{
"entropy": 1.3831138402223586,
"epoch": 0.28620555771257417,
"grad_norm": 0.52734375,
"learning_rate": 3.570319432120674e-05,
"loss": 0.9883,
"mean_token_accuracy": 0.7461639747023583,
"num_tokens": 121649961.0,
"step": 1290
},
{
"entropy": 1.3695012629032135,
"epoch": 0.2884242054467802,
"grad_norm": 0.53515625,
"learning_rate": 3.5592280390417035e-05,
"loss": 0.9526,
"mean_token_accuracy": 0.7522782661020756,
"num_tokens": 122622563.0,
"step": 1300
},
{
"entropy": 1.4116339407861234,
"epoch": 0.2906428531809862,
"grad_norm": 0.55859375,
"learning_rate": 3.548136645962733e-05,
"loss": 1.0048,
"mean_token_accuracy": 0.74220717176795,
"num_tokens": 123550041.0,
"step": 1310
},
{
"entropy": 1.3907336607575416,
"epoch": 0.2928615009151922,
"grad_norm": 0.5703125,
"learning_rate": 3.537045252883762e-05,
"loss": 0.9845,
"mean_token_accuracy": 0.7461209401488305,
"num_tokens": 124502233.0,
"step": 1320
},
{
"entropy": 1.3597315862774848,
"epoch": 0.2950801486493982,
"grad_norm": 0.57421875,
"learning_rate": 3.525953859804791e-05,
"loss": 0.9646,
"mean_token_accuracy": 0.7516384877264499,
"num_tokens": 125434381.0,
"step": 1330
},
{
"entropy": 1.3610756233334542,
"epoch": 0.2972987963836042,
"grad_norm": 0.546875,
"learning_rate": 3.514862466725821e-05,
"loss": 0.9613,
"mean_token_accuracy": 0.7506407134234905,
"num_tokens": 126374268.0,
"step": 1340
},
{
"entropy": 1.363479419052601,
"epoch": 0.29951744411781017,
"grad_norm": 0.55859375,
"learning_rate": 3.50377107364685e-05,
"loss": 0.9567,
"mean_token_accuracy": 0.7539497919380664,
"num_tokens": 127319726.0,
"step": 1350
},
{
"entropy": 1.4010797172784806,
"epoch": 0.3017360918520162,
"grad_norm": 0.57421875,
"learning_rate": 3.4926796805678794e-05,
"loss": 0.9972,
"mean_token_accuracy": 0.7439250282943248,
"num_tokens": 128269917.0,
"step": 1360
},
{
"entropy": 1.400447415560484,
"epoch": 0.3039547395862222,
"grad_norm": 0.55078125,
"learning_rate": 3.481588287488909e-05,
"loss": 1.0006,
"mean_token_accuracy": 0.7441901095211506,
"num_tokens": 129215524.0,
"step": 1370
},
{
"entropy": 1.3762236058712005,
"epoch": 0.3061733873204282,
"grad_norm": 0.5390625,
"learning_rate": 3.470496894409938e-05,
"loss": 0.9751,
"mean_token_accuracy": 0.7485686533153058,
"num_tokens": 130133218.0,
"step": 1380
},
{
"entropy": 1.3712550908327104,
"epoch": 0.3083920350546342,
"grad_norm": 0.5703125,
"learning_rate": 3.459405501330967e-05,
"loss": 0.967,
"mean_token_accuracy": 0.7488023094832897,
"num_tokens": 131090702.0,
"step": 1390
},
{
"entropy": 1.3727133765816688,
"epoch": 0.3106106827888402,
"grad_norm": 0.5859375,
"learning_rate": 3.448314108251996e-05,
"loss": 0.9617,
"mean_token_accuracy": 0.7511452712118626,
"num_tokens": 132015232.0,
"step": 1400
},
{
"entropy": 1.3846083499491215,
"epoch": 0.3128293305230462,
"grad_norm": 0.57421875,
"learning_rate": 3.4372227151730255e-05,
"loss": 0.9487,
"mean_token_accuracy": 0.752527979016304,
"num_tokens": 132965680.0,
"step": 1410
},
{
"entropy": 1.3626705884933472,
"epoch": 0.3150479782572522,
"grad_norm": 0.56640625,
"learning_rate": 3.426131322094055e-05,
"loss": 0.9392,
"mean_token_accuracy": 0.7541214250028133,
"num_tokens": 133895331.0,
"step": 1420
},
{
"entropy": 1.3925424292683601,
"epoch": 0.3172666259914582,
"grad_norm": 0.5546875,
"learning_rate": 3.415039929015084e-05,
"loss": 1.0072,
"mean_token_accuracy": 0.7419983983039856,
"num_tokens": 134848732.0,
"step": 1430
},
{
"entropy": 1.383028756082058,
"epoch": 0.3194852737256642,
"grad_norm": 0.55078125,
"learning_rate": 3.403948535936114e-05,
"loss": 0.9968,
"mean_token_accuracy": 0.7439531564712525,
"num_tokens": 135805571.0,
"step": 1440
},
{
"entropy": 1.411787600815296,
"epoch": 0.3217039214598702,
"grad_norm": 0.51953125,
"learning_rate": 3.392857142857143e-05,
"loss": 1.0173,
"mean_token_accuracy": 0.7382614344358445,
"num_tokens": 136755869.0,
"step": 1450
},
{
"entropy": 1.374262510240078,
"epoch": 0.3239225691940762,
"grad_norm": 0.5546875,
"learning_rate": 3.381765749778172e-05,
"loss": 0.9612,
"mean_token_accuracy": 0.7520359136164189,
"num_tokens": 137707923.0,
"step": 1460
},
{
"entropy": 1.345720000565052,
"epoch": 0.3261412169282822,
"grad_norm": 0.5078125,
"learning_rate": 3.3706743566992015e-05,
"loss": 0.9512,
"mean_token_accuracy": 0.7521267220377922,
"num_tokens": 138674173.0,
"step": 1470
},
{
"entropy": 1.3797206476330757,
"epoch": 0.32835986466248823,
"grad_norm": 0.5546875,
"learning_rate": 3.359582963620231e-05,
"loss": 0.9503,
"mean_token_accuracy": 0.7529976561665535,
"num_tokens": 139628775.0,
"step": 1480
},
{
"entropy": 1.3691905356943608,
"epoch": 0.3305785123966942,
"grad_norm": 0.546875,
"learning_rate": 3.34849157054126e-05,
"loss": 0.9742,
"mean_token_accuracy": 0.7474093928933143,
"num_tokens": 140568320.0,
"step": 1490
},
{
"entropy": 1.3553572654724122,
"epoch": 0.3327971601309002,
"grad_norm": 0.5078125,
"learning_rate": 3.337400177462289e-05,
"loss": 0.9474,
"mean_token_accuracy": 0.7541252739727498,
"num_tokens": 141508452.0,
"step": 1500
},
{
"entropy": 1.3576419681310654,
"epoch": 0.3350158078651062,
"grad_norm": 0.5546875,
"learning_rate": 3.326308784383318e-05,
"loss": 0.9445,
"mean_token_accuracy": 0.7541140832006932,
"num_tokens": 142443005.0,
"step": 1510
},
{
"entropy": 1.3632627040147782,
"epoch": 0.3372344555993122,
"grad_norm": 0.55859375,
"learning_rate": 3.3152173913043475e-05,
"loss": 0.9633,
"mean_token_accuracy": 0.751540695130825,
"num_tokens": 143364590.0,
"step": 1520
},
{
"entropy": 1.3698595464229584,
"epoch": 0.33945310333351825,
"grad_norm": 0.58984375,
"learning_rate": 3.3041259982253774e-05,
"loss": 0.9567,
"mean_token_accuracy": 0.7508327946066856,
"num_tokens": 144330283.0,
"step": 1530
},
{
"entropy": 1.3838164374232291,
"epoch": 0.34167175106772424,
"grad_norm": 0.54296875,
"learning_rate": 3.2930346051464066e-05,
"loss": 0.9412,
"mean_token_accuracy": 0.7536897391080857,
"num_tokens": 145271945.0,
"step": 1540
},
{
"entropy": 1.3916514277458192,
"epoch": 0.34389039880193023,
"grad_norm": 0.60546875,
"learning_rate": 3.281943212067436e-05,
"loss": 0.9674,
"mean_token_accuracy": 0.7496246941387653,
"num_tokens": 146208637.0,
"step": 1550
},
{
"entropy": 1.3817257568240167,
"epoch": 0.3461090465361362,
"grad_norm": 0.5390625,
"learning_rate": 3.270851818988465e-05,
"loss": 0.998,
"mean_token_accuracy": 0.745353914052248,
"num_tokens": 147132578.0,
"step": 1560
},
{
"entropy": 1.379334208369255,
"epoch": 0.3483276942703422,
"grad_norm": 0.59765625,
"learning_rate": 3.259760425909494e-05,
"loss": 0.9806,
"mean_token_accuracy": 0.7451153837144375,
"num_tokens": 148047084.0,
"step": 1570
},
{
"entropy": 1.3558235377073289,
"epoch": 0.3505463420045482,
"grad_norm": 0.55859375,
"learning_rate": 3.2486690328305235e-05,
"loss": 0.9319,
"mean_token_accuracy": 0.7564816296100616,
"num_tokens": 148984698.0,
"step": 1580
},
{
"entropy": 1.3621691033244132,
"epoch": 0.35276498973875425,
"grad_norm": 0.5,
"learning_rate": 3.237577639751553e-05,
"loss": 0.9663,
"mean_token_accuracy": 0.7516494557261467,
"num_tokens": 149927544.0,
"step": 1590
},
{
"entropy": 1.3577947162091732,
"epoch": 0.35498363747296025,
"grad_norm": 0.54296875,
"learning_rate": 3.226486246672582e-05,
"loss": 0.9732,
"mean_token_accuracy": 0.7493470698595047,
"num_tokens": 150876867.0,
"step": 1600
},
{
"entropy": 1.35196972489357,
"epoch": 0.35720228520716624,
"grad_norm": 0.54296875,
"learning_rate": 3.215394853593611e-05,
"loss": 0.9483,
"mean_token_accuracy": 0.7527376770973205,
"num_tokens": 151813474.0,
"step": 1610
},
{
"entropy": 1.3889328390359879,
"epoch": 0.35942093294137223,
"grad_norm": 0.55859375,
"learning_rate": 3.204303460514641e-05,
"loss": 0.9902,
"mean_token_accuracy": 0.7460403524339199,
"num_tokens": 152748724.0,
"step": 1620
},
{
"entropy": 1.3454296171665192,
"epoch": 0.3616395806755782,
"grad_norm": 0.5234375,
"learning_rate": 3.19321206743567e-05,
"loss": 0.9281,
"mean_token_accuracy": 0.755976890027523,
"num_tokens": 153669850.0,
"step": 1630
},
{
"entropy": 1.3814805909991263,
"epoch": 0.3638582284097842,
"grad_norm": 0.54296875,
"learning_rate": 3.1821206743566994e-05,
"loss": 0.9504,
"mean_token_accuracy": 0.7522977091372013,
"num_tokens": 154602553.0,
"step": 1640
},
{
"entropy": 1.3916409358382225,
"epoch": 0.36607687614399026,
"grad_norm": 0.54296875,
"learning_rate": 3.171029281277729e-05,
"loss": 0.9778,
"mean_token_accuracy": 0.7461537972092629,
"num_tokens": 155541120.0,
"step": 1650
},
{
"entropy": 1.3471432410180568,
"epoch": 0.36829552387819625,
"grad_norm": 0.52734375,
"learning_rate": 3.159937888198758e-05,
"loss": 0.9273,
"mean_token_accuracy": 0.7581139869987965,
"num_tokens": 156520158.0,
"step": 1660
},
{
"entropy": 1.404821753501892,
"epoch": 0.37051417161240224,
"grad_norm": 0.5625,
"learning_rate": 3.148846495119787e-05,
"loss": 1.0,
"mean_token_accuracy": 0.7436496950685978,
"num_tokens": 157463456.0,
"step": 1670
},
{
"entropy": 1.3906827136874198,
"epoch": 0.37273281934660824,
"grad_norm": 0.5390625,
"learning_rate": 3.137755102040816e-05,
"loss": 0.9907,
"mean_token_accuracy": 0.7457496263086796,
"num_tokens": 158405908.0,
"step": 1680
},
{
"entropy": 1.3714244484901428,
"epoch": 0.3749514670808142,
"grad_norm": 0.5234375,
"learning_rate": 3.1266637089618455e-05,
"loss": 0.9505,
"mean_token_accuracy": 0.7535674646496773,
"num_tokens": 159335729.0,
"step": 1690
},
{
"entropy": 1.390585573017597,
"epoch": 0.3771701148150202,
"grad_norm": 0.56640625,
"learning_rate": 3.115572315882875e-05,
"loss": 0.9966,
"mean_token_accuracy": 0.7446259804069996,
"num_tokens": 160296263.0,
"step": 1700
},
{
"entropy": 1.4077832899987697,
"epoch": 0.37938876254922627,
"grad_norm": 0.55859375,
"learning_rate": 3.1044809228039046e-05,
"loss": 0.9894,
"mean_token_accuracy": 0.7444383382797242,
"num_tokens": 161219852.0,
"step": 1710
},
{
"entropy": 1.395198680460453,
"epoch": 0.38160741028343226,
"grad_norm": 0.546875,
"learning_rate": 3.093389529724934e-05,
"loss": 1.0024,
"mean_token_accuracy": 0.74552848264575,
"num_tokens": 162158334.0,
"step": 1720
},
{
"entropy": 1.3805132403969764,
"epoch": 0.38382605801763825,
"grad_norm": 0.546875,
"learning_rate": 3.082298136645963e-05,
"loss": 0.9752,
"mean_token_accuracy": 0.7499201230704784,
"num_tokens": 163093367.0,
"step": 1730
},
{
"entropy": 1.398225909471512,
"epoch": 0.38604470575184424,
"grad_norm": 0.57421875,
"learning_rate": 3.071206743566992e-05,
"loss": 0.9824,
"mean_token_accuracy": 0.7451727867126465,
"num_tokens": 164014979.0,
"step": 1740
},
{
"entropy": 1.3813935965299606,
"epoch": 0.38826335348605023,
"grad_norm": 0.5390625,
"learning_rate": 3.0601153504880215e-05,
"loss": 0.9843,
"mean_token_accuracy": 0.7469385854899884,
"num_tokens": 164974085.0,
"step": 1750
},
{
"entropy": 1.368855346739292,
"epoch": 0.3904820012202563,
"grad_norm": 0.53515625,
"learning_rate": 3.0490239574090507e-05,
"loss": 0.9472,
"mean_token_accuracy": 0.75348781645298,
"num_tokens": 165918118.0,
"step": 1760
},
{
"entropy": 1.3673339888453484,
"epoch": 0.3927006489544623,
"grad_norm": 0.53515625,
"learning_rate": 3.03793256433008e-05,
"loss": 0.9387,
"mean_token_accuracy": 0.755811995267868,
"num_tokens": 166852949.0,
"step": 1770
},
{
"entropy": 1.3427365884184836,
"epoch": 0.39491929668866826,
"grad_norm": 0.50390625,
"learning_rate": 3.026841171251109e-05,
"loss": 0.9297,
"mean_token_accuracy": 0.7581560261547565,
"num_tokens": 167809459.0,
"step": 1780
},
{
"entropy": 1.3762704834342003,
"epoch": 0.39713794442287426,
"grad_norm": 0.55859375,
"learning_rate": 3.0157497781721383e-05,
"loss": 1.0051,
"mean_token_accuracy": 0.7433216728270053,
"num_tokens": 168752185.0,
"step": 1790
},
{
"entropy": 1.3575905784964561,
"epoch": 0.39935659215708025,
"grad_norm": 0.55078125,
"learning_rate": 3.0046583850931682e-05,
"loss": 0.9374,
"mean_token_accuracy": 0.7572205021977425,
"num_tokens": 169690119.0,
"step": 1800
},
{
"entropy": 1.3576733842492104,
"epoch": 0.40157523989128624,
"grad_norm": 0.55078125,
"learning_rate": 2.9935669920141974e-05,
"loss": 0.9523,
"mean_token_accuracy": 0.7515712559223175,
"num_tokens": 170619298.0,
"step": 1810
},
{
"entropy": 1.3723658367991447,
"epoch": 0.4037938876254923,
"grad_norm": 0.53515625,
"learning_rate": 2.9824755989352266e-05,
"loss": 0.9548,
"mean_token_accuracy": 0.7528701044619084,
"num_tokens": 171570309.0,
"step": 1820
},
{
"entropy": 1.4009515389800071,
"epoch": 0.4060125353596983,
"grad_norm": 0.515625,
"learning_rate": 2.971384205856256e-05,
"loss": 0.9975,
"mean_token_accuracy": 0.7424866132438183,
"num_tokens": 172494818.0,
"step": 1830
},
{
"entropy": 1.3911827325820922,
"epoch": 0.40823118309390427,
"grad_norm": 0.546875,
"learning_rate": 2.960292812777285e-05,
"loss": 0.9626,
"mean_token_accuracy": 0.7502177953720093,
"num_tokens": 173423865.0,
"step": 1840
},
{
"entropy": 1.3462319664657116,
"epoch": 0.41044983082811026,
"grad_norm": 0.5546875,
"learning_rate": 2.9492014196983143e-05,
"loss": 0.9437,
"mean_token_accuracy": 0.7530038900673389,
"num_tokens": 174366928.0,
"step": 1850
},
{
"entropy": 1.3755939684808254,
"epoch": 0.41266847856231625,
"grad_norm": 0.55078125,
"learning_rate": 2.9381100266193435e-05,
"loss": 0.9979,
"mean_token_accuracy": 0.7425804652273655,
"num_tokens": 175300342.0,
"step": 1860
},
{
"entropy": 1.3714133627712726,
"epoch": 0.41488712629652225,
"grad_norm": 0.59765625,
"learning_rate": 2.9270186335403727e-05,
"loss": 0.9564,
"mean_token_accuracy": 0.7504196316003799,
"num_tokens": 176242068.0,
"step": 1870
},
{
"entropy": 1.3977258250117301,
"epoch": 0.4171057740307283,
"grad_norm": 0.546875,
"learning_rate": 2.915927240461402e-05,
"loss": 0.9769,
"mean_token_accuracy": 0.7471397712826728,
"num_tokens": 177196173.0,
"step": 1880
},
{
"entropy": 1.3658091217279433,
"epoch": 0.4193244217649343,
"grad_norm": 0.6171875,
"learning_rate": 2.9048358473824318e-05,
"loss": 0.9419,
"mean_token_accuracy": 0.753964976221323,
"num_tokens": 178133746.0,
"step": 1890
},
{
"entropy": 1.3236115381121636,
"epoch": 0.4215430694991403,
"grad_norm": 0.53125,
"learning_rate": 2.893744454303461e-05,
"loss": 0.9437,
"mean_token_accuracy": 0.7538949429988862,
"num_tokens": 179096225.0,
"step": 1900
},
{
"entropy": 1.3948393434286117,
"epoch": 0.42376171723334627,
"grad_norm": 0.53515625,
"learning_rate": 2.8826530612244902e-05,
"loss": 1.002,
"mean_token_accuracy": 0.7435316666960716,
"num_tokens": 180036853.0,
"step": 1910
},
{
"entropy": 1.3544544890522956,
"epoch": 0.42598036496755226,
"grad_norm": 0.58984375,
"learning_rate": 2.8715616681455194e-05,
"loss": 0.9424,
"mean_token_accuracy": 0.7551728583872318,
"num_tokens": 180966842.0,
"step": 1920
},
{
"entropy": 1.3815669476985932,
"epoch": 0.42819901270175825,
"grad_norm": 0.53515625,
"learning_rate": 2.8604702750665487e-05,
"loss": 0.9622,
"mean_token_accuracy": 0.7512604773044587,
"num_tokens": 181900033.0,
"step": 1930
},
{
"entropy": 1.3831812545657158,
"epoch": 0.4304176604359643,
"grad_norm": 0.48046875,
"learning_rate": 2.849378881987578e-05,
"loss": 0.9525,
"mean_token_accuracy": 0.7529491983354092,
"num_tokens": 182851572.0,
"step": 1940
},
{
"entropy": 1.3749890983104707,
"epoch": 0.4326363081701703,
"grad_norm": 0.5390625,
"learning_rate": 2.838287488908607e-05,
"loss": 0.9776,
"mean_token_accuracy": 0.7499315291643143,
"num_tokens": 183771878.0,
"step": 1950
},
{
"entropy": 1.3801977284252644,
"epoch": 0.4348549559043763,
"grad_norm": 0.58203125,
"learning_rate": 2.8271960958296363e-05,
"loss": 0.9627,
"mean_token_accuracy": 0.7519955664873124,
"num_tokens": 184715766.0,
"step": 1960
},
{
"entropy": 1.3351484373211862,
"epoch": 0.4370736036385823,
"grad_norm": 0.55859375,
"learning_rate": 2.8161047027506655e-05,
"loss": 0.9321,
"mean_token_accuracy": 0.7555009052157402,
"num_tokens": 185661433.0,
"step": 1970
},
{
"entropy": 1.396961908042431,
"epoch": 0.43929225137278827,
"grad_norm": 0.5546875,
"learning_rate": 2.8050133096716947e-05,
"loss": 1.0058,
"mean_token_accuracy": 0.7446497425436973,
"num_tokens": 186585197.0,
"step": 1980
},
{
"entropy": 1.352859264612198,
"epoch": 0.4415108991069943,
"grad_norm": 0.52734375,
"learning_rate": 2.7939219165927243e-05,
"loss": 0.966,
"mean_token_accuracy": 0.7493795678019524,
"num_tokens": 187503900.0,
"step": 1990
},
{
"entropy": 1.333592215180397,
"epoch": 0.4437295468412003,
"grad_norm": 0.5,
"learning_rate": 2.7828305235137535e-05,
"loss": 0.9315,
"mean_token_accuracy": 0.7587283760309219,
"num_tokens": 188474289.0,
"step": 2000
},
{
"entropy": 1.3918707191944122,
"epoch": 0.4459481945754063,
"grad_norm": 0.57421875,
"learning_rate": 2.7717391304347827e-05,
"loss": 0.9874,
"mean_token_accuracy": 0.746398999541998,
"num_tokens": 189433780.0,
"step": 2010
},
{
"entropy": 1.368664526939392,
"epoch": 0.4481668423096123,
"grad_norm": 0.52734375,
"learning_rate": 2.760647737355812e-05,
"loss": 0.9454,
"mean_token_accuracy": 0.755309022217989,
"num_tokens": 190356653.0,
"step": 2020
},
{
"entropy": 1.4010012477636338,
"epoch": 0.4503854900438183,
"grad_norm": 0.55078125,
"learning_rate": 2.749556344276841e-05,
"loss": 1.0024,
"mean_token_accuracy": 0.7404071927070618,
"num_tokens": 191318931.0,
"step": 2030
},
{
"entropy": 1.3866683512926101,
"epoch": 0.4526041377780243,
"grad_norm": 0.6796875,
"learning_rate": 2.7384649511978703e-05,
"loss": 0.9751,
"mean_token_accuracy": 0.7486230276525021,
"num_tokens": 192303217.0,
"step": 2040
},
{
"entropy": 1.3726959481835366,
"epoch": 0.4548227855122303,
"grad_norm": 0.54296875,
"learning_rate": 2.7273735581188996e-05,
"loss": 0.9482,
"mean_token_accuracy": 0.7530568726360798,
"num_tokens": 193222632.0,
"step": 2050
},
{
"entropy": 1.3679525300860405,
"epoch": 0.4570414332464363,
"grad_norm": 0.5859375,
"learning_rate": 2.7162821650399288e-05,
"loss": 0.9506,
"mean_token_accuracy": 0.7516115583479405,
"num_tokens": 194151401.0,
"step": 2060
},
{
"entropy": 1.4062684878706933,
"epoch": 0.4592600809806423,
"grad_norm": 0.58984375,
"learning_rate": 2.7051907719609583e-05,
"loss": 0.9855,
"mean_token_accuracy": 0.7442703887820243,
"num_tokens": 195080292.0,
"step": 2070
},
{
"entropy": 1.3738665029406547,
"epoch": 0.4614787287148483,
"grad_norm": 0.56640625,
"learning_rate": 2.694099378881988e-05,
"loss": 0.9761,
"mean_token_accuracy": 0.7479680195450783,
"num_tokens": 196000406.0,
"step": 2080
},
{
"entropy": 1.3434479467570781,
"epoch": 0.4636973764490543,
"grad_norm": 0.5625,
"learning_rate": 2.683007985803017e-05,
"loss": 0.919,
"mean_token_accuracy": 0.760900753736496,
"num_tokens": 196914007.0,
"step": 2090
},
{
"entropy": 1.3689823046326637,
"epoch": 0.4659160241832603,
"grad_norm": 0.58203125,
"learning_rate": 2.6719165927240463e-05,
"loss": 0.9669,
"mean_token_accuracy": 0.7499063372611999,
"num_tokens": 197828045.0,
"step": 2100
},
{
"entropy": 1.3804068550467492,
"epoch": 0.4681346719174663,
"grad_norm": 0.55859375,
"learning_rate": 2.6608251996450755e-05,
"loss": 0.9433,
"mean_token_accuracy": 0.7544724628329277,
"num_tokens": 198765460.0,
"step": 2110
},
{
"entropy": 1.3435491159558297,
"epoch": 0.4703533196516723,
"grad_norm": 0.56640625,
"learning_rate": 2.6497338065661047e-05,
"loss": 0.9218,
"mean_token_accuracy": 0.7582143515348434,
"num_tokens": 199694033.0,
"step": 2120
},
{
"entropy": 1.394715888798237,
"epoch": 0.4725719673858783,
"grad_norm": 0.59765625,
"learning_rate": 2.638642413487134e-05,
"loss": 0.9791,
"mean_token_accuracy": 0.746685141324997,
"num_tokens": 200655207.0,
"step": 2130
},
{
"entropy": 1.3192944645881652,
"epoch": 0.4747906151200843,
"grad_norm": 0.54296875,
"learning_rate": 2.627551020408163e-05,
"loss": 0.9313,
"mean_token_accuracy": 0.7588945962488651,
"num_tokens": 201614974.0,
"step": 2140
},
{
"entropy": 1.3649922542273998,
"epoch": 0.4770092628542903,
"grad_norm": 0.5546875,
"learning_rate": 2.6164596273291924e-05,
"loss": 0.9602,
"mean_token_accuracy": 0.7506442323327065,
"num_tokens": 202551250.0,
"step": 2150
},
{
"entropy": 1.3999163076281547,
"epoch": 0.4792279105884963,
"grad_norm": 0.546875,
"learning_rate": 2.6053682342502216e-05,
"loss": 0.9891,
"mean_token_accuracy": 0.744847048074007,
"num_tokens": 203467276.0,
"step": 2160
},
{
"entropy": 1.3639633044600488,
"epoch": 0.48144655832270233,
"grad_norm": 0.55859375,
"learning_rate": 2.5942768411712515e-05,
"loss": 0.9824,
"mean_token_accuracy": 0.7470031566917896,
"num_tokens": 204368765.0,
"step": 2170
},
{
"entropy": 1.4031486429274083,
"epoch": 0.4836652060569083,
"grad_norm": 0.578125,
"learning_rate": 2.5831854480922807e-05,
"loss": 0.9948,
"mean_token_accuracy": 0.7446600675582886,
"num_tokens": 205276177.0,
"step": 2180
},
{
"entropy": 1.347407591342926,
"epoch": 0.4858838537911143,
"grad_norm": 0.53125,
"learning_rate": 2.57209405501331e-05,
"loss": 0.9339,
"mean_token_accuracy": 0.7554423555731773,
"num_tokens": 206213045.0,
"step": 2190
},
{
"entropy": 1.3782639726996422,
"epoch": 0.4881025015253203,
"grad_norm": 0.57421875,
"learning_rate": 2.561002661934339e-05,
"loss": 0.9529,
"mean_token_accuracy": 0.7520141348242759,
"num_tokens": 207163454.0,
"step": 2200
},
{
"entropy": 1.3646283119916915,
"epoch": 0.4903211492595263,
"grad_norm": 0.53515625,
"learning_rate": 2.5499112688553683e-05,
"loss": 0.944,
"mean_token_accuracy": 0.7564348295331002,
"num_tokens": 208151153.0,
"step": 2210
},
{
"entropy": 1.3543564982712268,
"epoch": 0.4925397969937323,
"grad_norm": 0.578125,
"learning_rate": 2.5388198757763975e-05,
"loss": 0.9695,
"mean_token_accuracy": 0.7477301351726056,
"num_tokens": 209092142.0,
"step": 2220
},
{
"entropy": 1.3566198840737342,
"epoch": 0.49475844472793834,
"grad_norm": 0.5390625,
"learning_rate": 2.5277284826974267e-05,
"loss": 0.9536,
"mean_token_accuracy": 0.7519425883889198,
"num_tokens": 210026782.0,
"step": 2230
},
{
"entropy": 1.3839320428669453,
"epoch": 0.49697709246214433,
"grad_norm": 0.5625,
"learning_rate": 2.516637089618456e-05,
"loss": 0.982,
"mean_token_accuracy": 0.7456572473049163,
"num_tokens": 210961869.0,
"step": 2240
},
{
"entropy": 1.3263145498931408,
"epoch": 0.4991957401963503,
"grad_norm": 0.53125,
"learning_rate": 2.5055456965394852e-05,
"loss": 0.9501,
"mean_token_accuracy": 0.7539430402219296,
"num_tokens": 211923968.0,
"step": 2250
},
{
"entropy": 1.3298779338598252,
"epoch": 0.5014143879305564,
"grad_norm": 0.515625,
"learning_rate": 2.4944543034605147e-05,
"loss": 0.9548,
"mean_token_accuracy": 0.7525861606001853,
"num_tokens": 212869103.0,
"step": 2260
},
{
"entropy": 1.3527758911252021,
"epoch": 0.5036330356647624,
"grad_norm": 0.494140625,
"learning_rate": 2.483362910381544e-05,
"loss": 0.9569,
"mean_token_accuracy": 0.7526809461414814,
"num_tokens": 213818858.0,
"step": 2270
},
{
"entropy": 1.3720970265567303,
"epoch": 0.5058516833989684,
"grad_norm": 0.51953125,
"learning_rate": 2.4722715173025735e-05,
"loss": 0.9519,
"mean_token_accuracy": 0.7515731148421765,
"num_tokens": 214779694.0,
"step": 2280
},
{
"entropy": 1.4162064865231514,
"epoch": 0.5080703311331743,
"grad_norm": 0.5625,
"learning_rate": 2.4611801242236027e-05,
"loss": 0.9876,
"mean_token_accuracy": 0.7463356249034405,
"num_tokens": 215737714.0,
"step": 2290
},
{
"entropy": 1.4002547860145569,
"epoch": 0.5102889788673803,
"grad_norm": 0.61328125,
"learning_rate": 2.450088731144632e-05,
"loss": 0.9809,
"mean_token_accuracy": 0.7466327108442783,
"num_tokens": 216677039.0,
"step": 2300
},
{
"entropy": 1.3871633470058442,
"epoch": 0.5125076266015863,
"grad_norm": 0.55859375,
"learning_rate": 2.438997338065661e-05,
"loss": 0.9862,
"mean_token_accuracy": 0.7464494623243809,
"num_tokens": 217592435.0,
"step": 2310
},
{
"entropy": 1.3928598061203956,
"epoch": 0.5147262743357923,
"grad_norm": 0.57421875,
"learning_rate": 2.4279059449866903e-05,
"loss": 0.9854,
"mean_token_accuracy": 0.7452214293181896,
"num_tokens": 218535578.0,
"step": 2320
},
{
"entropy": 1.3906780779361725,
"epoch": 0.5169449220699983,
"grad_norm": 0.52734375,
"learning_rate": 2.41681455190772e-05,
"loss": 0.9613,
"mean_token_accuracy": 0.7505389004945755,
"num_tokens": 219486330.0,
"step": 2330
},
{
"entropy": 1.378984921425581,
"epoch": 0.5191635698042043,
"grad_norm": 0.546875,
"learning_rate": 2.405723158828749e-05,
"loss": 0.9808,
"mean_token_accuracy": 0.7484551966190338,
"num_tokens": 220422599.0,
"step": 2340
},
{
"entropy": 1.3721670493483544,
"epoch": 0.5213822175384103,
"grad_norm": 0.5390625,
"learning_rate": 2.3946317657497783e-05,
"loss": 0.9709,
"mean_token_accuracy": 0.7495145805180072,
"num_tokens": 221377332.0,
"step": 2350
},
{
"entropy": 1.402656690776348,
"epoch": 0.5236008652726163,
"grad_norm": 0.5703125,
"learning_rate": 2.3835403726708075e-05,
"loss": 0.9879,
"mean_token_accuracy": 0.7473884426057339,
"num_tokens": 222314994.0,
"step": 2360
},
{
"entropy": 1.3594323709607123,
"epoch": 0.5258195130068224,
"grad_norm": 0.5859375,
"learning_rate": 2.372448979591837e-05,
"loss": 0.9538,
"mean_token_accuracy": 0.7511370845139027,
"num_tokens": 223224438.0,
"step": 2370
},
{
"entropy": 1.3805907770991326,
"epoch": 0.5280381607410284,
"grad_norm": 0.56640625,
"learning_rate": 2.3613575865128663e-05,
"loss": 0.9735,
"mean_token_accuracy": 0.7476461634039879,
"num_tokens": 224162752.0,
"step": 2380
},
{
"entropy": 1.370700439810753,
"epoch": 0.5302568084752344,
"grad_norm": 0.55859375,
"learning_rate": 2.3502661934338955e-05,
"loss": 0.9706,
"mean_token_accuracy": 0.7497715629637242,
"num_tokens": 225115083.0,
"step": 2390
},
{
"entropy": 1.3743368998169898,
"epoch": 0.5324754562094404,
"grad_norm": 0.53125,
"learning_rate": 2.3391748003549247e-05,
"loss": 0.9413,
"mean_token_accuracy": 0.7557661548256874,
"num_tokens": 226058977.0,
"step": 2400
},
{
"entropy": 1.3839602798223496,
"epoch": 0.5346941039436464,
"grad_norm": 0.54296875,
"learning_rate": 2.328083407275954e-05,
"loss": 0.9615,
"mean_token_accuracy": 0.7533138573169709,
"num_tokens": 227010773.0,
"step": 2410
},
{
"entropy": 1.3525896489620208,
"epoch": 0.5369127516778524,
"grad_norm": 0.54296875,
"learning_rate": 2.3169920141969835e-05,
"loss": 0.9493,
"mean_token_accuracy": 0.7553107261657714,
"num_tokens": 227955312.0,
"step": 2420
},
{
"entropy": 1.3674135118722917,
"epoch": 0.5391313994120583,
"grad_norm": 0.55078125,
"learning_rate": 2.3059006211180127e-05,
"loss": 0.9549,
"mean_token_accuracy": 0.752379784733057,
"num_tokens": 228898935.0,
"step": 2430
},
{
"entropy": 1.3545546859502793,
"epoch": 0.5413500471462643,
"grad_norm": 0.56640625,
"learning_rate": 2.294809228039042e-05,
"loss": 0.924,
"mean_token_accuracy": 0.7607569552958011,
"num_tokens": 229849618.0,
"step": 2440
},
{
"entropy": 1.3558753475546836,
"epoch": 0.5435686948804703,
"grad_norm": 0.55859375,
"learning_rate": 2.283717834960071e-05,
"loss": 0.9193,
"mean_token_accuracy": 0.7595973119139672,
"num_tokens": 230791414.0,
"step": 2450
},
{
"entropy": 1.3477294951677323,
"epoch": 0.5457873426146763,
"grad_norm": 0.52734375,
"learning_rate": 2.2726264418811003e-05,
"loss": 0.9388,
"mean_token_accuracy": 0.7565565295517445,
"num_tokens": 231726099.0,
"step": 2460
},
{
"entropy": 1.3844288192689418,
"epoch": 0.5480059903488823,
"grad_norm": 0.58984375,
"learning_rate": 2.26153504880213e-05,
"loss": 0.9495,
"mean_token_accuracy": 0.7530641496181488,
"num_tokens": 232656045.0,
"step": 2470
},
{
"entropy": 1.3597193375229835,
"epoch": 0.5502246380830884,
"grad_norm": 0.515625,
"learning_rate": 2.250443655723159e-05,
"loss": 0.966,
"mean_token_accuracy": 0.7509191624820233,
"num_tokens": 233602005.0,
"step": 2480
},
{
"entropy": 1.3691200099885463,
"epoch": 0.5524432858172944,
"grad_norm": 0.5546875,
"learning_rate": 2.2393522626441883e-05,
"loss": 0.9542,
"mean_token_accuracy": 0.7519414819777012,
"num_tokens": 234562308.0,
"step": 2490
},
{
"entropy": 1.3906163677573204,
"epoch": 0.5546619335515004,
"grad_norm": 0.55859375,
"learning_rate": 2.2282608695652175e-05,
"loss": 1.0039,
"mean_token_accuracy": 0.7424245841801167,
"num_tokens": 235506260.0,
"step": 2500
},
{
"entropy": 1.3696281641721726,
"epoch": 0.5568805812857064,
"grad_norm": 0.5390625,
"learning_rate": 2.2171694764862467e-05,
"loss": 0.9453,
"mean_token_accuracy": 0.7540791384875775,
"num_tokens": 236457040.0,
"step": 2510
},
{
"entropy": 1.3700327768921852,
"epoch": 0.5590992290199124,
"grad_norm": 0.5859375,
"learning_rate": 2.206078083407276e-05,
"loss": 0.9793,
"mean_token_accuracy": 0.7462692283093929,
"num_tokens": 237378902.0,
"step": 2520
},
{
"entropy": 1.398044180870056,
"epoch": 0.5613178767541184,
"grad_norm": 0.59765625,
"learning_rate": 2.1949866903283052e-05,
"loss": 0.9967,
"mean_token_accuracy": 0.7434925585985184,
"num_tokens": 238311961.0,
"step": 2530
},
{
"entropy": 1.3696945488452912,
"epoch": 0.5635365244883244,
"grad_norm": 0.5546875,
"learning_rate": 2.1838952972493347e-05,
"loss": 0.944,
"mean_token_accuracy": 0.7557799100875855,
"num_tokens": 239234133.0,
"step": 2540
},
{
"entropy": 1.3959093943238259,
"epoch": 0.5657551722225304,
"grad_norm": 0.546875,
"learning_rate": 2.172803904170364e-05,
"loss": 0.9815,
"mean_token_accuracy": 0.7467247255146503,
"num_tokens": 240146423.0,
"step": 2550
},
{
"entropy": 1.3369751781225205,
"epoch": 0.5679738199567363,
"grad_norm": 0.546875,
"learning_rate": 2.161712511091393e-05,
"loss": 0.9468,
"mean_token_accuracy": 0.7567501932382583,
"num_tokens": 241119847.0,
"step": 2560
},
{
"entropy": 1.390147428959608,
"epoch": 0.5701924676909423,
"grad_norm": 0.53515625,
"learning_rate": 2.1506211180124224e-05,
"loss": 0.9676,
"mean_token_accuracy": 0.7480736941099166,
"num_tokens": 242052102.0,
"step": 2570
},
{
"entropy": 1.3671862602233886,
"epoch": 0.5724111154251483,
"grad_norm": 0.5234375,
"learning_rate": 2.1395297249334516e-05,
"loss": 0.9731,
"mean_token_accuracy": 0.7491575211286545,
"num_tokens": 242987170.0,
"step": 2580
},
{
"entropy": 1.3787225410342216,
"epoch": 0.5746297631593543,
"grad_norm": 0.56640625,
"learning_rate": 2.1284383318544808e-05,
"loss": 0.9672,
"mean_token_accuracy": 0.7511276498436927,
"num_tokens": 243963315.0,
"step": 2590
},
{
"entropy": 1.3578606337308883,
"epoch": 0.5768484108935604,
"grad_norm": 0.515625,
"learning_rate": 2.1173469387755103e-05,
"loss": 0.9603,
"mean_token_accuracy": 0.7515728779137134,
"num_tokens": 244904401.0,
"step": 2600
},
{
"entropy": 1.3674334943294526,
"epoch": 0.5790670586277664,
"grad_norm": 0.55078125,
"learning_rate": 2.1062555456965396e-05,
"loss": 0.9511,
"mean_token_accuracy": 0.7508557684719562,
"num_tokens": 245843429.0,
"step": 2610
},
{
"entropy": 1.3535479776561261,
"epoch": 0.5812857063619724,
"grad_norm": 0.51953125,
"learning_rate": 2.0951641526175688e-05,
"loss": 0.9605,
"mean_token_accuracy": 0.7512571468949318,
"num_tokens": 246778122.0,
"step": 2620
},
{
"entropy": 1.3785287618637085,
"epoch": 0.5835043540961784,
"grad_norm": 0.5390625,
"learning_rate": 2.084072759538598e-05,
"loss": 0.9729,
"mean_token_accuracy": 0.7481971070170402,
"num_tokens": 247718243.0,
"step": 2630
},
{
"entropy": 1.371111909300089,
"epoch": 0.5857230018303844,
"grad_norm": 0.55078125,
"learning_rate": 2.0729813664596272e-05,
"loss": 0.9659,
"mean_token_accuracy": 0.7520016901195049,
"num_tokens": 248674188.0,
"step": 2640
},
{
"entropy": 1.3743113353848457,
"epoch": 0.5879416495645904,
"grad_norm": 0.5234375,
"learning_rate": 2.0618899733806567e-05,
"loss": 0.9857,
"mean_token_accuracy": 0.7460017666220665,
"num_tokens": 249630785.0,
"step": 2650
},
{
"entropy": 1.3525418415665627,
"epoch": 0.5901602972987964,
"grad_norm": 0.51171875,
"learning_rate": 2.050798580301686e-05,
"loss": 0.951,
"mean_token_accuracy": 0.7526404090225697,
"num_tokens": 250583741.0,
"step": 2660
},
{
"entropy": 1.404486595094204,
"epoch": 0.5923789450330024,
"grad_norm": 0.5546875,
"learning_rate": 2.0397071872227152e-05,
"loss": 0.9612,
"mean_token_accuracy": 0.7494330175220967,
"num_tokens": 251500094.0,
"step": 2670
},
{
"entropy": 1.387998953461647,
"epoch": 0.5945975927672084,
"grad_norm": 0.54296875,
"learning_rate": 2.0286157941437444e-05,
"loss": 0.9929,
"mean_token_accuracy": 0.7457513011991977,
"num_tokens": 252449803.0,
"step": 2680
},
{
"entropy": 1.3362199790775775,
"epoch": 0.5968162405014144,
"grad_norm": 0.5625,
"learning_rate": 2.0175244010647736e-05,
"loss": 0.9124,
"mean_token_accuracy": 0.7635637722909451,
"num_tokens": 253395680.0,
"step": 2690
},
{
"entropy": 1.4146859273314476,
"epoch": 0.5990348882356203,
"grad_norm": 0.5625,
"learning_rate": 2.006433007985803e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7484463512897491,
"num_tokens": 254339264.0,
"step": 2700
},
{
"entropy": 1.3608046501874924,
"epoch": 0.6012535359698263,
"grad_norm": 0.51953125,
"learning_rate": 1.9953416149068324e-05,
"loss": 0.9673,
"mean_token_accuracy": 0.7515561901032924,
"num_tokens": 255290026.0,
"step": 2710
},
{
"entropy": 1.3799020916223526,
"epoch": 0.6034721837040324,
"grad_norm": 0.5859375,
"learning_rate": 1.9842502218278616e-05,
"loss": 0.9756,
"mean_token_accuracy": 0.7478848710656166,
"num_tokens": 256215452.0,
"step": 2720
},
{
"entropy": 1.3492946550250053,
"epoch": 0.6056908314382384,
"grad_norm": 0.54296875,
"learning_rate": 1.9731588287488908e-05,
"loss": 0.9311,
"mean_token_accuracy": 0.7583515666425228,
"num_tokens": 257169093.0,
"step": 2730
},
{
"entropy": 1.3475312367081642,
"epoch": 0.6079094791724444,
"grad_norm": 0.5390625,
"learning_rate": 1.9620674356699203e-05,
"loss": 0.9507,
"mean_token_accuracy": 0.7529344208538532,
"num_tokens": 258138135.0,
"step": 2740
},
{
"entropy": 1.3525680214166642,
"epoch": 0.6101281269066504,
"grad_norm": 0.53515625,
"learning_rate": 1.9509760425909496e-05,
"loss": 0.9509,
"mean_token_accuracy": 0.7542378917336464,
"num_tokens": 259109912.0,
"step": 2750
},
{
"entropy": 1.386097263544798,
"epoch": 0.6123467746408564,
"grad_norm": 0.50390625,
"learning_rate": 1.9398846495119788e-05,
"loss": 0.9542,
"mean_token_accuracy": 0.754255336523056,
"num_tokens": 260053220.0,
"step": 2760
},
{
"entropy": 1.3739720061421394,
"epoch": 0.6145654223750624,
"grad_norm": 0.55078125,
"learning_rate": 1.928793256433008e-05,
"loss": 0.9611,
"mean_token_accuracy": 0.7508481532335282,
"num_tokens": 260961630.0,
"step": 2770
},
{
"entropy": 1.3830955043435096,
"epoch": 0.6167840701092684,
"grad_norm": 0.57421875,
"learning_rate": 1.9177018633540372e-05,
"loss": 0.9857,
"mean_token_accuracy": 0.7444805398583412,
"num_tokens": 261881656.0,
"step": 2780
},
{
"entropy": 1.362017647176981,
"epoch": 0.6190027178434744,
"grad_norm": 0.5390625,
"learning_rate": 1.9066104702750667e-05,
"loss": 0.9689,
"mean_token_accuracy": 0.749096342921257,
"num_tokens": 262826457.0,
"step": 2790
},
{
"entropy": 1.3458002880215645,
"epoch": 0.6212213655776804,
"grad_norm": 0.51953125,
"learning_rate": 1.895519077196096e-05,
"loss": 0.9281,
"mean_token_accuracy": 0.7574586406350136,
"num_tokens": 263773429.0,
"step": 2800
},
{
"entropy": 1.3549387857317925,
"epoch": 0.6234400133118864,
"grad_norm": 0.5625,
"learning_rate": 1.8844276841171252e-05,
"loss": 0.9219,
"mean_token_accuracy": 0.7583517156541347,
"num_tokens": 264707730.0,
"step": 2810
},
{
"entropy": 1.3565895311534404,
"epoch": 0.6256586610460924,
"grad_norm": 0.53515625,
"learning_rate": 1.8733362910381544e-05,
"loss": 0.9368,
"mean_token_accuracy": 0.753548564761877,
"num_tokens": 265654078.0,
"step": 2820
},
{
"entropy": 1.3848047599196434,
"epoch": 0.6278773087802985,
"grad_norm": 0.55078125,
"learning_rate": 1.862244897959184e-05,
"loss": 0.975,
"mean_token_accuracy": 0.748593944311142,
"num_tokens": 266590424.0,
"step": 2830
},
{
"entropy": 1.3483957096934318,
"epoch": 0.6300959565145045,
"grad_norm": 0.5078125,
"learning_rate": 1.851153504880213e-05,
"loss": 0.9282,
"mean_token_accuracy": 0.7571537889540195,
"num_tokens": 267518833.0,
"step": 2840
},
{
"entropy": 1.3641344249248504,
"epoch": 0.6323146042487104,
"grad_norm": 0.51953125,
"learning_rate": 1.8400621118012424e-05,
"loss": 0.9605,
"mean_token_accuracy": 0.7526396319270134,
"num_tokens": 268449765.0,
"step": 2850
},
{
"entropy": 1.32438455671072,
"epoch": 0.6345332519829164,
"grad_norm": 0.57421875,
"learning_rate": 1.8289707187222716e-05,
"loss": 0.9202,
"mean_token_accuracy": 0.7574717938899994,
"num_tokens": 269378040.0,
"step": 2860
},
{
"entropy": 1.365363524854183,
"epoch": 0.6367518997171224,
"grad_norm": 0.5078125,
"learning_rate": 1.8178793256433008e-05,
"loss": 0.9444,
"mean_token_accuracy": 0.7561964854598046,
"num_tokens": 270314784.0,
"step": 2870
},
{
"entropy": 1.3871594324707985,
"epoch": 0.6389705474513284,
"grad_norm": 0.60546875,
"learning_rate": 1.8067879325643303e-05,
"loss": 0.9619,
"mean_token_accuracy": 0.7529800362884999,
"num_tokens": 271247351.0,
"step": 2880
},
{
"entropy": 1.403894129395485,
"epoch": 0.6411891951855344,
"grad_norm": 0.54296875,
"learning_rate": 1.7956965394853596e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7474908255040645,
"num_tokens": 272187504.0,
"step": 2890
},
{
"entropy": 1.373784029483795,
"epoch": 0.6434078429197404,
"grad_norm": 0.52734375,
"learning_rate": 1.7846051464063888e-05,
"loss": 0.9801,
"mean_token_accuracy": 0.7456812761723995,
"num_tokens": 273121065.0,
"step": 2900
},
{
"entropy": 1.4182383090257644,
"epoch": 0.6456264906539464,
"grad_norm": 0.57421875,
"learning_rate": 1.773513753327418e-05,
"loss": 1.0075,
"mean_token_accuracy": 0.7424289509654045,
"num_tokens": 274058083.0,
"step": 2910
},
{
"entropy": 1.3978426158428192,
"epoch": 0.6478451383881524,
"grad_norm": 0.5625,
"learning_rate": 1.7624223602484475e-05,
"loss": 0.9752,
"mean_token_accuracy": 0.7466619923710823,
"num_tokens": 274983318.0,
"step": 2920
},
{
"entropy": 1.3537883020937442,
"epoch": 0.6500637861223584,
"grad_norm": 0.54296875,
"learning_rate": 1.7513309671694767e-05,
"loss": 0.9218,
"mean_token_accuracy": 0.7595953151583672,
"num_tokens": 275920398.0,
"step": 2930
},
{
"entropy": 1.3750786110758781,
"epoch": 0.6522824338565644,
"grad_norm": 0.578125,
"learning_rate": 1.740239574090506e-05,
"loss": 0.9448,
"mean_token_accuracy": 0.7525995224714279,
"num_tokens": 276854958.0,
"step": 2940
},
{
"entropy": 1.3850456327199936,
"epoch": 0.6545010815907705,
"grad_norm": 0.5234375,
"learning_rate": 1.7291481810115352e-05,
"loss": 0.9803,
"mean_token_accuracy": 0.745450871437788,
"num_tokens": 277786978.0,
"step": 2950
},
{
"entropy": 1.3714064493775369,
"epoch": 0.6567197293249765,
"grad_norm": 0.55859375,
"learning_rate": 1.7180567879325644e-05,
"loss": 0.9651,
"mean_token_accuracy": 0.7489276170730591,
"num_tokens": 278730912.0,
"step": 2960
},
{
"entropy": 1.3698252201080323,
"epoch": 0.6589383770591825,
"grad_norm": 0.59765625,
"learning_rate": 1.706965394853594e-05,
"loss": 0.9651,
"mean_token_accuracy": 0.7497381448745728,
"num_tokens": 279665300.0,
"step": 2970
},
{
"entropy": 1.3747903369367123,
"epoch": 0.6611570247933884,
"grad_norm": 0.51171875,
"learning_rate": 1.695874001774623e-05,
"loss": 0.9628,
"mean_token_accuracy": 0.7499303415417671,
"num_tokens": 280618272.0,
"step": 2980
},
{
"entropy": 1.3819094851613045,
"epoch": 0.6633756725275944,
"grad_norm": 0.54296875,
"learning_rate": 1.6847826086956524e-05,
"loss": 0.9551,
"mean_token_accuracy": 0.7553550757467746,
"num_tokens": 281554536.0,
"step": 2990
},
{
"entropy": 1.3707010336220264,
"epoch": 0.6655943202618004,
"grad_norm": 0.51171875,
"learning_rate": 1.6736912156166816e-05,
"loss": 0.9655,
"mean_token_accuracy": 0.7515952527523041,
"num_tokens": 282504485.0,
"step": 3000
},
{
"entropy": 1.3754500553011895,
"epoch": 0.6678129679960064,
"grad_norm": 0.53515625,
"learning_rate": 1.6625998225377108e-05,
"loss": 0.9502,
"mean_token_accuracy": 0.7545687988400459,
"num_tokens": 283421042.0,
"step": 3010
},
{
"entropy": 1.392235305160284,
"epoch": 0.6700316157302124,
"grad_norm": 0.578125,
"learning_rate": 1.6515084294587403e-05,
"loss": 0.9632,
"mean_token_accuracy": 0.7509094551205635,
"num_tokens": 284360423.0,
"step": 3020
},
{
"entropy": 1.3561602622270583,
"epoch": 0.6722502634644184,
"grad_norm": 0.51953125,
"learning_rate": 1.6404170363797696e-05,
"loss": 0.9744,
"mean_token_accuracy": 0.7496522702276707,
"num_tokens": 285303033.0,
"step": 3030
},
{
"entropy": 1.362218789756298,
"epoch": 0.6744689111986244,
"grad_norm": 0.54296875,
"learning_rate": 1.6293256433007988e-05,
"loss": 0.9366,
"mean_token_accuracy": 0.7554511360824108,
"num_tokens": 286237138.0,
"step": 3040
},
{
"entropy": 1.366736714541912,
"epoch": 0.6766875589328304,
"grad_norm": 0.5546875,
"learning_rate": 1.618234250221828e-05,
"loss": 0.9805,
"mean_token_accuracy": 0.7496004432439805,
"num_tokens": 287158543.0,
"step": 3050
},
{
"entropy": 1.3793413534760475,
"epoch": 0.6789062066670365,
"grad_norm": 0.53125,
"learning_rate": 1.6071428571428572e-05,
"loss": 0.9734,
"mean_token_accuracy": 0.7480289973318577,
"num_tokens": 288077419.0,
"step": 3060
},
{
"entropy": 1.3908205471932888,
"epoch": 0.6811248544012425,
"grad_norm": 0.50390625,
"learning_rate": 1.5960514640638864e-05,
"loss": 0.9812,
"mean_token_accuracy": 0.7471683271229267,
"num_tokens": 289027657.0,
"step": 3070
},
{
"entropy": 1.3779977604746818,
"epoch": 0.6833435021354485,
"grad_norm": 0.49609375,
"learning_rate": 1.5849600709849156e-05,
"loss": 0.9721,
"mean_token_accuracy": 0.7498278774321079,
"num_tokens": 289969226.0,
"step": 3080
},
{
"entropy": 1.3782277286052704,
"epoch": 0.6855621498696545,
"grad_norm": 0.51171875,
"learning_rate": 1.573868677905945e-05,
"loss": 0.9814,
"mean_token_accuracy": 0.7463328778743744,
"num_tokens": 290886120.0,
"step": 3090
},
{
"entropy": 1.366072203218937,
"epoch": 0.6877807976038605,
"grad_norm": 0.54296875,
"learning_rate": 1.5627772848269744e-05,
"loss": 0.9361,
"mean_token_accuracy": 0.7534136839210988,
"num_tokens": 291823611.0,
"step": 3100
},
{
"entropy": 1.393534542620182,
"epoch": 0.6899994453380665,
"grad_norm": 0.5234375,
"learning_rate": 1.5516858917480036e-05,
"loss": 0.9701,
"mean_token_accuracy": 0.7499865688383579,
"num_tokens": 292771710.0,
"step": 3110
},
{
"entropy": 1.3469060599803924,
"epoch": 0.6922180930722724,
"grad_norm": 0.55859375,
"learning_rate": 1.5405944986690328e-05,
"loss": 0.9529,
"mean_token_accuracy": 0.7520712472498416,
"num_tokens": 293710284.0,
"step": 3120
},
{
"entropy": 1.387193675339222,
"epoch": 0.6944367408064784,
"grad_norm": 0.54296875,
"learning_rate": 1.529503105590062e-05,
"loss": 0.9551,
"mean_token_accuracy": 0.7517340816557407,
"num_tokens": 294637424.0,
"step": 3130
},
{
"entropy": 1.3879702135920524,
"epoch": 0.6966553885406844,
"grad_norm": 0.5546875,
"learning_rate": 1.5184117125110914e-05,
"loss": 0.9713,
"mean_token_accuracy": 0.7498943455517292,
"num_tokens": 295552946.0,
"step": 3140
},
{
"entropy": 1.3521149441599847,
"epoch": 0.6988740362748904,
"grad_norm": 0.5390625,
"learning_rate": 1.5073203194321208e-05,
"loss": 0.9561,
"mean_token_accuracy": 0.7530835166573524,
"num_tokens": 296482856.0,
"step": 3150
},
{
"entropy": 1.3523337855935096,
"epoch": 0.7010926840090964,
"grad_norm": 0.5859375,
"learning_rate": 1.4962289263531502e-05,
"loss": 0.9482,
"mean_token_accuracy": 0.7535679526627064,
"num_tokens": 297414186.0,
"step": 3160
},
{
"entropy": 1.371672622859478,
"epoch": 0.7033113317433024,
"grad_norm": 0.546875,
"learning_rate": 1.4851375332741794e-05,
"loss": 0.9547,
"mean_token_accuracy": 0.7499964490532876,
"num_tokens": 298378469.0,
"step": 3170
},
{
"entropy": 1.3734628334641457,
"epoch": 0.7055299794775085,
"grad_norm": 0.5390625,
"learning_rate": 1.4740461401952086e-05,
"loss": 0.9766,
"mean_token_accuracy": 0.7470006972551346,
"num_tokens": 299298648.0,
"step": 3180
},
{
"entropy": 1.3621489077806472,
"epoch": 0.7077486272117145,
"grad_norm": 0.51953125,
"learning_rate": 1.4629547471162378e-05,
"loss": 0.976,
"mean_token_accuracy": 0.7489259757101536,
"num_tokens": 300256274.0,
"step": 3190
},
{
"entropy": 1.3307632811367511,
"epoch": 0.7099672749459205,
"grad_norm": 0.51953125,
"learning_rate": 1.4518633540372672e-05,
"loss": 0.9264,
"mean_token_accuracy": 0.7602166160941124,
"num_tokens": 301216228.0,
"step": 3200
},
{
"entropy": 1.378267367184162,
"epoch": 0.7121859226801265,
"grad_norm": 0.5703125,
"learning_rate": 1.4407719609582964e-05,
"loss": 0.9933,
"mean_token_accuracy": 0.7443177163600921,
"num_tokens": 302148133.0,
"step": 3210
},
{
"entropy": 1.3858237951993941,
"epoch": 0.7144045704143325,
"grad_norm": 0.51953125,
"learning_rate": 1.4296805678793256e-05,
"loss": 0.9591,
"mean_token_accuracy": 0.75175336971879,
"num_tokens": 303092579.0,
"step": 3220
},
{
"entropy": 1.349436528980732,
"epoch": 0.7166232181485385,
"grad_norm": 0.5390625,
"learning_rate": 1.4185891748003548e-05,
"loss": 0.9678,
"mean_token_accuracy": 0.7483910910785199,
"num_tokens": 304045131.0,
"step": 3230
},
{
"entropy": 1.3605081930756568,
"epoch": 0.7188418658827445,
"grad_norm": 0.5078125,
"learning_rate": 1.4074977817213844e-05,
"loss": 0.9462,
"mean_token_accuracy": 0.7560873411595821,
"num_tokens": 305017251.0,
"step": 3240
},
{
"entropy": 1.3534643828868866,
"epoch": 0.7210605136169504,
"grad_norm": 0.5625,
"learning_rate": 1.3964063886424136e-05,
"loss": 0.926,
"mean_token_accuracy": 0.7599373154342175,
"num_tokens": 305959111.0,
"step": 3250
},
{
"entropy": 1.3700198411941529,
"epoch": 0.7232791613511564,
"grad_norm": 0.57421875,
"learning_rate": 1.3853149955634428e-05,
"loss": 0.9498,
"mean_token_accuracy": 0.7523197077214718,
"num_tokens": 306895226.0,
"step": 3260
},
{
"entropy": 1.36115460395813,
"epoch": 0.7254978090853624,
"grad_norm": 0.578125,
"learning_rate": 1.374223602484472e-05,
"loss": 0.9696,
"mean_token_accuracy": 0.7488263450562954,
"num_tokens": 307845938.0,
"step": 3270
},
{
"entropy": 1.3370314098894596,
"epoch": 0.7277164568195684,
"grad_norm": 0.53125,
"learning_rate": 1.3631322094055012e-05,
"loss": 0.9092,
"mean_token_accuracy": 0.7618122868239879,
"num_tokens": 308778745.0,
"step": 3280
},
{
"entropy": 1.3687497057020663,
"epoch": 0.7299351045537745,
"grad_norm": 0.50390625,
"learning_rate": 1.3520408163265308e-05,
"loss": 0.9623,
"mean_token_accuracy": 0.75139045342803,
"num_tokens": 309737239.0,
"step": 3290
},
{
"entropy": 1.352933470904827,
"epoch": 0.7321537522879805,
"grad_norm": 0.56640625,
"learning_rate": 1.34094942324756e-05,
"loss": 0.9724,
"mean_token_accuracy": 0.7514422044157982,
"num_tokens": 310687853.0,
"step": 3300
},
{
"entropy": 1.400717096030712,
"epoch": 0.7343724000221865,
"grad_norm": 0.55078125,
"learning_rate": 1.3298580301685892e-05,
"loss": 1.0037,
"mean_token_accuracy": 0.7421482533216477,
"num_tokens": 311619002.0,
"step": 3310
},
{
"entropy": 1.3361869268119335,
"epoch": 0.7365910477563925,
"grad_norm": 0.578125,
"learning_rate": 1.3187666370896184e-05,
"loss": 0.9664,
"mean_token_accuracy": 0.7487700201570988,
"num_tokens": 312570005.0,
"step": 3320
},
{
"entropy": 1.3680378429591655,
"epoch": 0.7388096954905985,
"grad_norm": 0.5625,
"learning_rate": 1.3076752440106476e-05,
"loss": 0.9453,
"mean_token_accuracy": 0.753575050085783,
"num_tokens": 313510156.0,
"step": 3330
},
{
"entropy": 1.405937422066927,
"epoch": 0.7410283432248045,
"grad_norm": 0.5546875,
"learning_rate": 1.2965838509316772e-05,
"loss": 0.9661,
"mean_token_accuracy": 0.7477953679859638,
"num_tokens": 314441510.0,
"step": 3340
},
{
"entropy": 1.37651297301054,
"epoch": 0.7432469909590105,
"grad_norm": 0.53125,
"learning_rate": 1.2854924578527064e-05,
"loss": 0.9893,
"mean_token_accuracy": 0.7443842552602291,
"num_tokens": 315396770.0,
"step": 3350
},
{
"entropy": 1.3754449300467968,
"epoch": 0.7454656386932165,
"grad_norm": 0.50390625,
"learning_rate": 1.2744010647737356e-05,
"loss": 0.9761,
"mean_token_accuracy": 0.746372677385807,
"num_tokens": 316364686.0,
"step": 3360
},
{
"entropy": 1.3677063122391702,
"epoch": 0.7476842864274225,
"grad_norm": 0.53125,
"learning_rate": 1.2633096716947648e-05,
"loss": 0.9791,
"mean_token_accuracy": 0.747562813013792,
"num_tokens": 317297712.0,
"step": 3370
},
{
"entropy": 1.3510807111859322,
"epoch": 0.7499029341616285,
"grad_norm": 0.53515625,
"learning_rate": 1.2522182786157944e-05,
"loss": 0.9572,
"mean_token_accuracy": 0.7519927278161049,
"num_tokens": 318239974.0,
"step": 3380
},
{
"entropy": 1.3774001389741897,
"epoch": 0.7521215818958344,
"grad_norm": 0.546875,
"learning_rate": 1.2411268855368236e-05,
"loss": 0.9716,
"mean_token_accuracy": 0.7503920882940293,
"num_tokens": 319176815.0,
"step": 3390
},
{
"entropy": 1.355586975067854,
"epoch": 0.7543402296300404,
"grad_norm": 0.5390625,
"learning_rate": 1.2300354924578528e-05,
"loss": 0.9653,
"mean_token_accuracy": 0.7494859971106053,
"num_tokens": 320142075.0,
"step": 3400
},
{
"entropy": 1.3683804802596569,
"epoch": 0.7565588773642465,
"grad_norm": 0.53125,
"learning_rate": 1.218944099378882e-05,
"loss": 0.9564,
"mean_token_accuracy": 0.752348380535841,
"num_tokens": 321078125.0,
"step": 3410
},
{
"entropy": 1.3689906552433968,
"epoch": 0.7587775250984525,
"grad_norm": 0.56640625,
"learning_rate": 1.2078527062999114e-05,
"loss": 0.955,
"mean_token_accuracy": 0.7519045077264309,
"num_tokens": 321996511.0,
"step": 3420
},
{
"entropy": 1.3541745007038117,
"epoch": 0.7609961728326585,
"grad_norm": 0.5234375,
"learning_rate": 1.1967613132209406e-05,
"loss": 0.941,
"mean_token_accuracy": 0.7579099789261818,
"num_tokens": 322948179.0,
"step": 3430
},
{
"entropy": 1.3591908812522888,
"epoch": 0.7632148205668645,
"grad_norm": 0.53125,
"learning_rate": 1.18566992014197e-05,
"loss": 0.964,
"mean_token_accuracy": 0.7525539971888066,
"num_tokens": 323912573.0,
"step": 3440
},
{
"entropy": 1.36717321947217,
"epoch": 0.7654334683010705,
"grad_norm": 0.5546875,
"learning_rate": 1.1745785270629992e-05,
"loss": 0.9484,
"mean_token_accuracy": 0.7522753067314625,
"num_tokens": 324848669.0,
"step": 3450
},
{
"entropy": 1.3821905687451363,
"epoch": 0.7676521160352765,
"grad_norm": 0.546875,
"learning_rate": 1.1634871339840284e-05,
"loss": 0.9789,
"mean_token_accuracy": 0.7475393317639828,
"num_tokens": 325764593.0,
"step": 3460
},
{
"entropy": 1.3809657365083694,
"epoch": 0.7698707637694825,
"grad_norm": 0.55078125,
"learning_rate": 1.1523957409050576e-05,
"loss": 0.9433,
"mean_token_accuracy": 0.7541690699756145,
"num_tokens": 326728229.0,
"step": 3470
},
{
"entropy": 1.3609302565455437,
"epoch": 0.7720894115036885,
"grad_norm": 0.5078125,
"learning_rate": 1.141304347826087e-05,
"loss": 0.9323,
"mean_token_accuracy": 0.7568138137459754,
"num_tokens": 327666372.0,
"step": 3480
},
{
"entropy": 1.35459363758564,
"epoch": 0.7743080592378945,
"grad_norm": 0.55078125,
"learning_rate": 1.1302129547471162e-05,
"loss": 0.9626,
"mean_token_accuracy": 0.7514002807438374,
"num_tokens": 328589542.0,
"step": 3490
},
{
"entropy": 1.335961400717497,
"epoch": 0.7765267069721005,
"grad_norm": 0.51171875,
"learning_rate": 1.1191215616681455e-05,
"loss": 0.9327,
"mean_token_accuracy": 0.7580720439553261,
"num_tokens": 329542171.0,
"step": 3500
},
{
"entropy": 1.4132342591881752,
"epoch": 0.7787453547063065,
"grad_norm": 0.5625,
"learning_rate": 1.1080301685891748e-05,
"loss": 1.0189,
"mean_token_accuracy": 0.7392169758677483,
"num_tokens": 330481198.0,
"step": 3510
},
{
"entropy": 1.4080789655447006,
"epoch": 0.7809640024405126,
"grad_norm": 0.55078125,
"learning_rate": 1.096938775510204e-05,
"loss": 0.9954,
"mean_token_accuracy": 0.7450571835041047,
"num_tokens": 331406839.0,
"step": 3520
},
{
"entropy": 1.3507774248719215,
"epoch": 0.7831826501747186,
"grad_norm": 0.56640625,
"learning_rate": 1.0858473824312334e-05,
"loss": 0.939,
"mean_token_accuracy": 0.757654282450676,
"num_tokens": 332356653.0,
"step": 3530
},
{
"entropy": 1.3371329329907895,
"epoch": 0.7854012979089245,
"grad_norm": 0.58203125,
"learning_rate": 1.0747559893522626e-05,
"loss": 0.944,
"mean_token_accuracy": 0.7541753455996514,
"num_tokens": 333306767.0,
"step": 3540
},
{
"entropy": 1.3796106189489366,
"epoch": 0.7876199456431305,
"grad_norm": 0.5546875,
"learning_rate": 1.063664596273292e-05,
"loss": 0.976,
"mean_token_accuracy": 0.7494149960577488,
"num_tokens": 334267595.0,
"step": 3550
},
{
"entropy": 1.3886483326554298,
"epoch": 0.7898385933773365,
"grad_norm": 0.5703125,
"learning_rate": 1.0525732031943212e-05,
"loss": 0.9955,
"mean_token_accuracy": 0.745264695584774,
"num_tokens": 335211023.0,
"step": 3560
},
{
"entropy": 1.3904688894748687,
"epoch": 0.7920572411115425,
"grad_norm": 0.51171875,
"learning_rate": 1.0414818101153505e-05,
"loss": 0.9971,
"mean_token_accuracy": 0.7431247621774674,
"num_tokens": 336161592.0,
"step": 3570
},
{
"entropy": 1.3282628059387207,
"epoch": 0.7942758888457485,
"grad_norm": 0.54296875,
"learning_rate": 1.0303904170363798e-05,
"loss": 0.9194,
"mean_token_accuracy": 0.759865264594555,
"num_tokens": 337108472.0,
"step": 3580
},
{
"entropy": 1.3883577764034272,
"epoch": 0.7964945365799545,
"grad_norm": 0.5390625,
"learning_rate": 1.019299023957409e-05,
"loss": 0.9574,
"mean_token_accuracy": 0.7508158691227436,
"num_tokens": 338046556.0,
"step": 3590
},
{
"entropy": 1.354970221221447,
"epoch": 0.7987131843141605,
"grad_norm": 0.515625,
"learning_rate": 1.0082076308784384e-05,
"loss": 0.9428,
"mean_token_accuracy": 0.7563470520079136,
"num_tokens": 338995598.0,
"step": 3600
},
{
"entropy": 1.3790066853165626,
"epoch": 0.8009318320483665,
"grad_norm": 0.5390625,
"learning_rate": 9.971162377994676e-06,
"loss": 1.0013,
"mean_token_accuracy": 0.7433059230446816,
"num_tokens": 339946604.0,
"step": 3610
},
{
"entropy": 1.3680865824222566,
"epoch": 0.8031504797825725,
"grad_norm": 0.52734375,
"learning_rate": 9.86024844720497e-06,
"loss": 0.9482,
"mean_token_accuracy": 0.7530041396617889,
"num_tokens": 340865269.0,
"step": 3620
},
{
"entropy": 1.3551585905253887,
"epoch": 0.8053691275167785,
"grad_norm": 0.515625,
"learning_rate": 9.749334516415262e-06,
"loss": 0.9756,
"mean_token_accuracy": 0.749114916473627,
"num_tokens": 341821654.0,
"step": 3630
},
{
"entropy": 1.356984592974186,
"epoch": 0.8075877752509846,
"grad_norm": 0.515625,
"learning_rate": 9.638420585625555e-06,
"loss": 0.9269,
"mean_token_accuracy": 0.756236170232296,
"num_tokens": 342764886.0,
"step": 3640
},
{
"entropy": 1.4058508843183517,
"epoch": 0.8098064229851906,
"grad_norm": 0.5703125,
"learning_rate": 9.527506654835848e-06,
"loss": 0.9776,
"mean_token_accuracy": 0.7486060597002506,
"num_tokens": 343699361.0,
"step": 3650
},
{
"entropy": 1.4065939649939536,
"epoch": 0.8120250707193966,
"grad_norm": 0.5625,
"learning_rate": 9.41659272404614e-06,
"loss": 1.0093,
"mean_token_accuracy": 0.7410213641822339,
"num_tokens": 344637604.0,
"step": 3660
},
{
"entropy": 1.3512266606092453,
"epoch": 0.8142437184536025,
"grad_norm": 0.56640625,
"learning_rate": 9.305678793256434e-06,
"loss": 0.9506,
"mean_token_accuracy": 0.7549665696918965,
"num_tokens": 345590677.0,
"step": 3670
},
{
"entropy": 1.3379161387681962,
"epoch": 0.8164623661878085,
"grad_norm": 0.5234375,
"learning_rate": 9.194764862466726e-06,
"loss": 0.9331,
"mean_token_accuracy": 0.7561460591852665,
"num_tokens": 346534759.0,
"step": 3680
},
{
"entropy": 1.3927339702844619,
"epoch": 0.8186810139220145,
"grad_norm": 0.51171875,
"learning_rate": 9.08385093167702e-06,
"loss": 0.9591,
"mean_token_accuracy": 0.7537301577627659,
"num_tokens": 347455286.0,
"step": 3690
},
{
"entropy": 1.361009131371975,
"epoch": 0.8208996616562205,
"grad_norm": 0.546875,
"learning_rate": 8.972937000887312e-06,
"loss": 0.9464,
"mean_token_accuracy": 0.7557949997484684,
"num_tokens": 348401567.0,
"step": 3700
},
{
"entropy": 1.384497131407261,
"epoch": 0.8231183093904265,
"grad_norm": 0.578125,
"learning_rate": 8.862023070097605e-06,
"loss": 0.9803,
"mean_token_accuracy": 0.7466384552419185,
"num_tokens": 349334391.0,
"step": 3710
},
{
"entropy": 1.3447816006839275,
"epoch": 0.8253369571246325,
"grad_norm": 0.515625,
"learning_rate": 8.751109139307898e-06,
"loss": 0.9436,
"mean_token_accuracy": 0.7561516091227531,
"num_tokens": 350312604.0,
"step": 3720
},
{
"entropy": 1.3593414321541786,
"epoch": 0.8275556048588385,
"grad_norm": 0.5234375,
"learning_rate": 8.64019520851819e-06,
"loss": 0.9526,
"mean_token_accuracy": 0.7559100404381752,
"num_tokens": 351273912.0,
"step": 3730
},
{
"entropy": 1.3611069664359092,
"epoch": 0.8297742525930445,
"grad_norm": 0.55078125,
"learning_rate": 8.529281277728483e-06,
"loss": 0.9619,
"mean_token_accuracy": 0.7522155269980431,
"num_tokens": 352217449.0,
"step": 3740
},
{
"entropy": 1.3875371009111404,
"epoch": 0.8319929003272506,
"grad_norm": 0.5703125,
"learning_rate": 8.418367346938775e-06,
"loss": 0.9683,
"mean_token_accuracy": 0.7485638290643692,
"num_tokens": 353168090.0,
"step": 3750
},
{
"entropy": 1.3669875219464303,
"epoch": 0.8342115480614566,
"grad_norm": 0.55078125,
"learning_rate": 8.307453416149069e-06,
"loss": 0.9634,
"mean_token_accuracy": 0.7502586752176285,
"num_tokens": 354122430.0,
"step": 3760
},
{
"entropy": 1.3453943833708764,
"epoch": 0.8364301957956626,
"grad_norm": 0.55859375,
"learning_rate": 8.19653948535936e-06,
"loss": 0.9529,
"mean_token_accuracy": 0.7517515823245049,
"num_tokens": 355065338.0,
"step": 3770
},
{
"entropy": 1.3437988623976707,
"epoch": 0.8386488435298686,
"grad_norm": 0.5703125,
"learning_rate": 8.085625554569655e-06,
"loss": 0.9273,
"mean_token_accuracy": 0.7580426350235939,
"num_tokens": 355995716.0,
"step": 3780
},
{
"entropy": 1.3949485182762147,
"epoch": 0.8408674912640746,
"grad_norm": 0.51171875,
"learning_rate": 7.974711623779947e-06,
"loss": 0.9666,
"mean_token_accuracy": 0.7470616512000561,
"num_tokens": 356919067.0,
"step": 3790
},
{
"entropy": 1.3033222988247872,
"epoch": 0.8430861389982806,
"grad_norm": 0.48828125,
"learning_rate": 7.863797692990239e-06,
"loss": 0.9066,
"mean_token_accuracy": 0.7628800176084042,
"num_tokens": 357848380.0,
"step": 3800
},
{
"entropy": 1.389954724907875,
"epoch": 0.8453047867324865,
"grad_norm": 0.5546875,
"learning_rate": 7.752883762200533e-06,
"loss": 0.9835,
"mean_token_accuracy": 0.7488750971853733,
"num_tokens": 358798462.0,
"step": 3810
},
{
"entropy": 1.3484379634261132,
"epoch": 0.8475234344666925,
"grad_norm": 0.6015625,
"learning_rate": 7.641969831410825e-06,
"loss": 0.9511,
"mean_token_accuracy": 0.7518211953341961,
"num_tokens": 359760891.0,
"step": 3820
},
{
"entropy": 1.3600559674203396,
"epoch": 0.8497420822008985,
"grad_norm": 0.5,
"learning_rate": 7.5310559006211186e-06,
"loss": 0.945,
"mean_token_accuracy": 0.7558806143701077,
"num_tokens": 360727038.0,
"step": 3830
},
{
"entropy": 1.374285238981247,
"epoch": 0.8519607299351045,
"grad_norm": 0.55078125,
"learning_rate": 7.420141969831411e-06,
"loss": 0.9654,
"mean_token_accuracy": 0.7507951468229294,
"num_tokens": 361664062.0,
"step": 3840
},
{
"entropy": 1.3751945488154889,
"epoch": 0.8541793776693105,
"grad_norm": 0.51171875,
"learning_rate": 7.3092280390417045e-06,
"loss": 0.9759,
"mean_token_accuracy": 0.7493015758693218,
"num_tokens": 362581685.0,
"step": 3850
},
{
"entropy": 1.342698210477829,
"epoch": 0.8563980254035165,
"grad_norm": 0.5390625,
"learning_rate": 7.198314108251997e-06,
"loss": 0.9397,
"mean_token_accuracy": 0.7556280843913555,
"num_tokens": 363493172.0,
"step": 3860
},
{
"entropy": 1.3486001171171664,
"epoch": 0.8586166731377226,
"grad_norm": 0.5078125,
"learning_rate": 7.0874001774622905e-06,
"loss": 0.9397,
"mean_token_accuracy": 0.7553956717252731,
"num_tokens": 364446944.0,
"step": 3870
},
{
"entropy": 1.3552488908171654,
"epoch": 0.8608353208719286,
"grad_norm": 0.5234375,
"learning_rate": 6.976486246672583e-06,
"loss": 0.9279,
"mean_token_accuracy": 0.7601940959692002,
"num_tokens": 365374033.0,
"step": 3880
},
{
"entropy": 1.3852377466857433,
"epoch": 0.8630539686061346,
"grad_norm": 0.53515625,
"learning_rate": 6.865572315882875e-06,
"loss": 0.9508,
"mean_token_accuracy": 0.7540732339024544,
"num_tokens": 366289679.0,
"step": 3890
},
{
"entropy": 1.407871701568365,
"epoch": 0.8652726163403406,
"grad_norm": 0.5703125,
"learning_rate": 6.7546583850931686e-06,
"loss": 0.988,
"mean_token_accuracy": 0.7453559413552284,
"num_tokens": 367201731.0,
"step": 3900
},
{
"entropy": 1.3759823389351369,
"epoch": 0.8674912640745466,
"grad_norm": 0.54296875,
"learning_rate": 6.643744454303461e-06,
"loss": 0.9877,
"mean_token_accuracy": 0.7446005560457707,
"num_tokens": 368157287.0,
"step": 3910
},
{
"entropy": 1.3594166025519372,
"epoch": 0.8697099118087526,
"grad_norm": 0.54296875,
"learning_rate": 6.532830523513754e-06,
"loss": 0.9371,
"mean_token_accuracy": 0.7575969822704792,
"num_tokens": 369106919.0,
"step": 3920
},
{
"entropy": 1.393234833329916,
"epoch": 0.8719285595429586,
"grad_norm": 0.546875,
"learning_rate": 6.421916592724047e-06,
"loss": 0.9807,
"mean_token_accuracy": 0.7484029091894626,
"num_tokens": 370021686.0,
"step": 3930
},
{
"entropy": 1.3949926882982253,
"epoch": 0.8741472072771646,
"grad_norm": 0.625,
"learning_rate": 6.31100266193434e-06,
"loss": 0.9844,
"mean_token_accuracy": 0.7442330025136471,
"num_tokens": 370953193.0,
"step": 3940
},
{
"entropy": 1.3483674347400665,
"epoch": 0.8763658550113705,
"grad_norm": 0.53515625,
"learning_rate": 6.200088731144632e-06,
"loss": 0.9234,
"mean_token_accuracy": 0.7595080114901066,
"num_tokens": 371877002.0,
"step": 3950
},
{
"entropy": 1.3709127485752106,
"epoch": 0.8785845027455765,
"grad_norm": 0.51953125,
"learning_rate": 6.089174800354925e-06,
"loss": 0.9568,
"mean_token_accuracy": 0.7525337472558021,
"num_tokens": 372834751.0,
"step": 3960
},
{
"entropy": 1.3546331241726874,
"epoch": 0.8808031504797825,
"grad_norm": 0.5390625,
"learning_rate": 5.978260869565218e-06,
"loss": 0.9494,
"mean_token_accuracy": 0.7507483690977097,
"num_tokens": 373775771.0,
"step": 3970
},
{
"entropy": 1.332931426167488,
"epoch": 0.8830217982139886,
"grad_norm": 0.5078125,
"learning_rate": 5.867346938775511e-06,
"loss": 0.9509,
"mean_token_accuracy": 0.7548811562359333,
"num_tokens": 374731469.0,
"step": 3980
},
{
"entropy": 1.3545904070138932,
"epoch": 0.8852404459481946,
"grad_norm": 0.53515625,
"learning_rate": 5.756433007985803e-06,
"loss": 0.9417,
"mean_token_accuracy": 0.7551537476480007,
"num_tokens": 375675543.0,
"step": 3990
},
{
"entropy": 1.4011170595884324,
"epoch": 0.8874590936824006,
"grad_norm": 0.53125,
"learning_rate": 5.645519077196096e-06,
"loss": 0.9928,
"mean_token_accuracy": 0.7440803252160549,
"num_tokens": 376595094.0,
"step": 4000
},
{
"entropy": 1.3567784875631332,
"epoch": 0.8896777414166066,
"grad_norm": 0.53515625,
"learning_rate": 5.534605146406389e-06,
"loss": 0.9633,
"mean_token_accuracy": 0.7499005250632763,
"num_tokens": 377563516.0,
"step": 4010
},
{
"entropy": 1.3843678832054138,
"epoch": 0.8918963891508126,
"grad_norm": 0.56640625,
"learning_rate": 5.423691215616682e-06,
"loss": 0.9594,
"mean_token_accuracy": 0.7517636835575103,
"num_tokens": 378480786.0,
"step": 4020
},
{
"entropy": 1.3298022344708442,
"epoch": 0.8941150368850186,
"grad_norm": 0.5234375,
"learning_rate": 5.312777284826975e-06,
"loss": 0.9377,
"mean_token_accuracy": 0.7552124336361885,
"num_tokens": 379442068.0,
"step": 4030
},
{
"entropy": 1.3667471811175347,
"epoch": 0.8963336846192246,
"grad_norm": 0.55859375,
"learning_rate": 5.201863354037268e-06,
"loss": 0.9467,
"mean_token_accuracy": 0.7546268843114377,
"num_tokens": 380376120.0,
"step": 4040
},
{
"entropy": 1.382226860523224,
"epoch": 0.8985523323534306,
"grad_norm": 0.53125,
"learning_rate": 5.090949423247561e-06,
"loss": 0.9702,
"mean_token_accuracy": 0.7500215657055378,
"num_tokens": 381345861.0,
"step": 4050
},
{
"entropy": 1.3708786077797412,
"epoch": 0.9007709800876366,
"grad_norm": 0.52734375,
"learning_rate": 4.980035492457853e-06,
"loss": 0.9718,
"mean_token_accuracy": 0.7496377937495708,
"num_tokens": 382291775.0,
"step": 4060
},
{
"entropy": 1.3532396875321866,
"epoch": 0.9029896278218426,
"grad_norm": 0.54296875,
"learning_rate": 4.869121561668146e-06,
"loss": 0.9282,
"mean_token_accuracy": 0.7588274158537388,
"num_tokens": 383216309.0,
"step": 4070
},
{
"entropy": 1.3610619880259036,
"epoch": 0.9052082755560485,
"grad_norm": 0.51953125,
"learning_rate": 4.758207630878438e-06,
"loss": 0.948,
"mean_token_accuracy": 0.751985190808773,
"num_tokens": 384155565.0,
"step": 4080
},
{
"entropy": 1.371240922808647,
"epoch": 0.9074269232902545,
"grad_norm": 0.6015625,
"learning_rate": 4.647293700088731e-06,
"loss": 0.9647,
"mean_token_accuracy": 0.7506447650492192,
"num_tokens": 385092338.0,
"step": 4090
},
{
"entropy": 1.3659679263830184,
"epoch": 0.9096455710244606,
"grad_norm": 0.51953125,
"learning_rate": 4.536379769299024e-06,
"loss": 0.9308,
"mean_token_accuracy": 0.7565632097423076,
"num_tokens": 386018707.0,
"step": 4100
},
{
"entropy": 1.3694222941994667,
"epoch": 0.9118642187586666,
"grad_norm": 0.54296875,
"learning_rate": 4.425465838509317e-06,
"loss": 0.9536,
"mean_token_accuracy": 0.7497854404151439,
"num_tokens": 386966791.0,
"step": 4110
},
{
"entropy": 1.3574039578437804,
"epoch": 0.9140828664928726,
"grad_norm": 0.546875,
"learning_rate": 4.31455190771961e-06,
"loss": 0.9307,
"mean_token_accuracy": 0.7579091049730777,
"num_tokens": 387920492.0,
"step": 4120
},
{
"entropy": 1.3476274512708186,
"epoch": 0.9163015142270786,
"grad_norm": 0.51953125,
"learning_rate": 4.203637976929903e-06,
"loss": 0.9241,
"mean_token_accuracy": 0.7589688062667846,
"num_tokens": 388854075.0,
"step": 4130
},
{
"entropy": 1.3659275747835635,
"epoch": 0.9185201619612846,
"grad_norm": 0.55859375,
"learning_rate": 4.092724046140196e-06,
"loss": 0.9399,
"mean_token_accuracy": 0.7546637378633022,
"num_tokens": 389816530.0,
"step": 4140
},
{
"entropy": 1.3457153633236885,
"epoch": 0.9207388096954906,
"grad_norm": 0.53515625,
"learning_rate": 3.981810115350488e-06,
"loss": 0.9522,
"mean_token_accuracy": 0.7542778737843037,
"num_tokens": 390762015.0,
"step": 4150
},
{
"entropy": 1.3396061316132546,
"epoch": 0.9229574574296966,
"grad_norm": 0.51953125,
"learning_rate": 3.870896184560781e-06,
"loss": 0.918,
"mean_token_accuracy": 0.7604689553380013,
"num_tokens": 391706436.0,
"step": 4160
},
{
"entropy": 1.3485943019390105,
"epoch": 0.9251761051639026,
"grad_norm": 0.55078125,
"learning_rate": 3.759982253771074e-06,
"loss": 0.9313,
"mean_token_accuracy": 0.7574250407516956,
"num_tokens": 392643198.0,
"step": 4170
},
{
"entropy": 1.3615098975598812,
"epoch": 0.9273947528981086,
"grad_norm": 0.5390625,
"learning_rate": 3.6490683229813664e-06,
"loss": 0.9508,
"mean_token_accuracy": 0.7551313415169716,
"num_tokens": 393583331.0,
"step": 4180
},
{
"entropy": 1.3367910474538802,
"epoch": 0.9296134006323146,
"grad_norm": 0.52734375,
"learning_rate": 3.5381543921916594e-06,
"loss": 0.9386,
"mean_token_accuracy": 0.7580363132059574,
"num_tokens": 394527996.0,
"step": 4190
},
{
"entropy": 1.3829244390130042,
"epoch": 0.9318320483665206,
"grad_norm": 0.5546875,
"learning_rate": 3.4272404614019524e-06,
"loss": 0.9577,
"mean_token_accuracy": 0.7513498887419701,
"num_tokens": 395466130.0,
"step": 4200
},
{
"entropy": 1.3731888599693776,
"epoch": 0.9340506961007266,
"grad_norm": 0.51953125,
"learning_rate": 3.3163265306122454e-06,
"loss": 0.9611,
"mean_token_accuracy": 0.7499692045152188,
"num_tokens": 396395021.0,
"step": 4210
},
{
"entropy": 1.362666630744934,
"epoch": 0.9362693438349327,
"grad_norm": 0.5,
"learning_rate": 3.2054125998225384e-06,
"loss": 0.9688,
"mean_token_accuracy": 0.7498237736523151,
"num_tokens": 397343890.0,
"step": 4220
},
{
"entropy": 1.3288205087184906,
"epoch": 0.9384879915691386,
"grad_norm": 0.5078125,
"learning_rate": 3.094498669032831e-06,
"loss": 0.952,
"mean_token_accuracy": 0.7533118993043899,
"num_tokens": 398301341.0,
"step": 4230
},
{
"entropy": 1.3533720336854458,
"epoch": 0.9407066393033446,
"grad_norm": 0.53125,
"learning_rate": 2.9835847382431235e-06,
"loss": 0.9607,
"mean_token_accuracy": 0.7517400912940502,
"num_tokens": 399254773.0,
"step": 4240
},
{
"entropy": 1.3874829396605493,
"epoch": 0.9429252870375506,
"grad_norm": 0.6171875,
"learning_rate": 2.872670807453416e-06,
"loss": 0.9556,
"mean_token_accuracy": 0.7532159611582756,
"num_tokens": 400185915.0,
"step": 4250
},
{
"entropy": 1.3642595566809177,
"epoch": 0.9451439347717566,
"grad_norm": 0.52734375,
"learning_rate": 2.761756876663709e-06,
"loss": 0.9599,
"mean_token_accuracy": 0.7520182691514492,
"num_tokens": 401121244.0,
"step": 4260
},
{
"entropy": 1.3642713360488414,
"epoch": 0.9473625825059626,
"grad_norm": 0.5703125,
"learning_rate": 2.650842945874002e-06,
"loss": 0.9425,
"mean_token_accuracy": 0.7533236473798752,
"num_tokens": 402076727.0,
"step": 4270
},
{
"entropy": 1.3315014272928238,
"epoch": 0.9495812302401686,
"grad_norm": 0.53515625,
"learning_rate": 2.539929015084295e-06,
"loss": 0.9102,
"mean_token_accuracy": 0.7610321864485741,
"num_tokens": 403021321.0,
"step": 4280
},
{
"entropy": 1.3721179209649563,
"epoch": 0.9517998779743746,
"grad_norm": 0.5625,
"learning_rate": 2.4290150842945875e-06,
"loss": 0.9614,
"mean_token_accuracy": 0.7502239882946015,
"num_tokens": 403977566.0,
"step": 4290
},
{
"entropy": 1.3569226145744324,
"epoch": 0.9540185257085806,
"grad_norm": 0.55859375,
"learning_rate": 2.3181011535048805e-06,
"loss": 0.9332,
"mean_token_accuracy": 0.7586277812719345,
"num_tokens": 404906178.0,
"step": 4300
},
{
"entropy": 1.3908393040299416,
"epoch": 0.9562371734427866,
"grad_norm": 0.51953125,
"learning_rate": 2.207187222715173e-06,
"loss": 0.9475,
"mean_token_accuracy": 0.7541873648762702,
"num_tokens": 405837119.0,
"step": 4310
},
{
"entropy": 1.3411194518208505,
"epoch": 0.9584558211769926,
"grad_norm": 0.50390625,
"learning_rate": 2.096273291925466e-06,
"loss": 0.9392,
"mean_token_accuracy": 0.753732743114233,
"num_tokens": 406764129.0,
"step": 4320
},
{
"entropy": 1.3665377825498581,
"epoch": 0.9606744689111987,
"grad_norm": 0.51171875,
"learning_rate": 1.9853593611357586e-06,
"loss": 0.9762,
"mean_token_accuracy": 0.7461372949182987,
"num_tokens": 407691279.0,
"step": 4330
},
{
"entropy": 1.3637786209583282,
"epoch": 0.9628931166454047,
"grad_norm": 0.53515625,
"learning_rate": 1.8744454303460516e-06,
"loss": 0.9611,
"mean_token_accuracy": 0.7504919424653054,
"num_tokens": 408649779.0,
"step": 4340
},
{
"entropy": 1.344110856950283,
"epoch": 0.9651117643796107,
"grad_norm": 0.5390625,
"learning_rate": 1.7635314995563443e-06,
"loss": 0.9197,
"mean_token_accuracy": 0.7596047796308995,
"num_tokens": 409584005.0,
"step": 4350
},
{
"entropy": 1.4125637419521808,
"epoch": 0.9673304121138167,
"grad_norm": 0.52734375,
"learning_rate": 1.6526175687666373e-06,
"loss": 1.0056,
"mean_token_accuracy": 0.742132543027401,
"num_tokens": 410519889.0,
"step": 4360
},
{
"entropy": 1.3275214530527593,
"epoch": 0.9695490598480226,
"grad_norm": 0.55078125,
"learning_rate": 1.54170363797693e-06,
"loss": 0.9404,
"mean_token_accuracy": 0.7535249203443527,
"num_tokens": 411477556.0,
"step": 4370
},
{
"entropy": 1.3909116253256797,
"epoch": 0.9717677075822286,
"grad_norm": 0.54296875,
"learning_rate": 1.4307897071872228e-06,
"loss": 0.9646,
"mean_token_accuracy": 0.7525069527328014,
"num_tokens": 412423884.0,
"step": 4380
},
{
"entropy": 1.3520725175738335,
"epoch": 0.9739863553164346,
"grad_norm": 0.53515625,
"learning_rate": 1.3198757763975156e-06,
"loss": 0.9441,
"mean_token_accuracy": 0.7545062087476253,
"num_tokens": 413354815.0,
"step": 4390
},
{
"entropy": 1.3621721930801869,
"epoch": 0.9762050030506406,
"grad_norm": 0.54296875,
"learning_rate": 1.2089618456078084e-06,
"loss": 0.9569,
"mean_token_accuracy": 0.753555228561163,
"num_tokens": 414289518.0,
"step": 4400
},
{
"entropy": 1.3933924958109856,
"epoch": 0.9784236507848466,
"grad_norm": 0.5078125,
"learning_rate": 1.0980479148181013e-06,
"loss": 0.9916,
"mean_token_accuracy": 0.744612629711628,
"num_tokens": 415241454.0,
"step": 4410
},
{
"entropy": 1.3613307520747184,
"epoch": 0.9806422985190526,
"grad_norm": 0.486328125,
"learning_rate": 9.871339840283939e-07,
"loss": 0.9521,
"mean_token_accuracy": 0.7509805023670196,
"num_tokens": 416207581.0,
"step": 4420
},
{
"entropy": 1.3690778270363808,
"epoch": 0.9828609462532586,
"grad_norm": 0.5703125,
"learning_rate": 8.762200532386869e-07,
"loss": 0.9696,
"mean_token_accuracy": 0.7491403892636299,
"num_tokens": 417155162.0,
"step": 4430
},
{
"entropy": 1.350597658008337,
"epoch": 0.9850795939874646,
"grad_norm": 0.5390625,
"learning_rate": 7.653061224489796e-07,
"loss": 0.9432,
"mean_token_accuracy": 0.7551806442439556,
"num_tokens": 418126381.0,
"step": 4440
},
{
"entropy": 1.3831326559185981,
"epoch": 0.9872982417216707,
"grad_norm": 0.57421875,
"learning_rate": 6.543921916592724e-07,
"loss": 0.9717,
"mean_token_accuracy": 0.7482082195580005,
"num_tokens": 419064900.0,
"step": 4450
},
{
"entropy": 1.3672489911317824,
"epoch": 0.9895168894558767,
"grad_norm": 0.53125,
"learning_rate": 5.434782608695653e-07,
"loss": 0.9243,
"mean_token_accuracy": 0.7583662681281567,
"num_tokens": 420001310.0,
"step": 4460
},
{
"entropy": 1.3730630218982696,
"epoch": 0.9917355371900827,
"grad_norm": 0.54296875,
"learning_rate": 4.3256433007985804e-07,
"loss": 0.9561,
"mean_token_accuracy": 0.7527363084256649,
"num_tokens": 420932440.0,
"step": 4470
},
{
"entropy": 1.4036599799990654,
"epoch": 0.9939541849242887,
"grad_norm": 0.5390625,
"learning_rate": 3.2165039929015086e-07,
"loss": 0.9956,
"mean_token_accuracy": 0.7449633993208409,
"num_tokens": 421870068.0,
"step": 4480
},
{
"entropy": 1.3779713824391364,
"epoch": 0.9961728326584947,
"grad_norm": 0.5,
"learning_rate": 2.1073646850044365e-07,
"loss": 0.9726,
"mean_token_accuracy": 0.7501424111425876,
"num_tokens": 422814597.0,
"step": 4490
},
{
"entropy": 1.4002000510692596,
"epoch": 0.9983914803927006,
"grad_norm": 0.5546875,
"learning_rate": 9.982253771073646e-08,
"loss": 0.9774,
"mean_token_accuracy": 0.7493771456182003,
"num_tokens": 423759552.0,
"step": 4500
}
],
"logging_steps": 10,
"max_steps": 4508,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.664801045092499e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}