olmo2_1b_sft_plus_35 / trainer_state.json
suzeva's picture
Upload folder using huggingface_hub
a2fa542 verified
Raw
History Blame Contribute Delete
129 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 4508,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.465661996603012,
"epoch": 0.0022186477342060014,
"grad_norm": 0.62109375,
"learning_rate": 4.990017746228927e-05,
"loss": 1.1086,
"mean_token_accuracy": 0.7226187117397785,
"num_tokens": 920745.0,
"step": 10
},
{
"entropy": 1.488898192346096,
"epoch": 0.004437295468412003,
"grad_norm": 0.72265625,
"learning_rate": 4.978926353149956e-05,
"loss": 1.1144,
"mean_token_accuracy": 0.72113838493824,
"num_tokens": 1856069.0,
"step": 20
},
{
"entropy": 1.4106852501630782,
"epoch": 0.006655943202618004,
"grad_norm": 0.59765625,
"learning_rate": 4.967834960070985e-05,
"loss": 1.0531,
"mean_token_accuracy": 0.734193117916584,
"num_tokens": 2799754.0,
"step": 30
},
{
"entropy": 1.4108840212225915,
"epoch": 0.008874590936824005,
"grad_norm": 0.5859375,
"learning_rate": 4.9567435669920145e-05,
"loss": 1.0694,
"mean_token_accuracy": 0.7304773353040218,
"num_tokens": 3749567.0,
"step": 40
},
{
"entropy": 1.4120406746864318,
"epoch": 0.011093238671030008,
"grad_norm": 0.546875,
"learning_rate": 4.945652173913044e-05,
"loss": 1.0653,
"mean_token_accuracy": 0.7311853349208832,
"num_tokens": 4712044.0,
"step": 50
},
{
"entropy": 1.3809884995222093,
"epoch": 0.013311886405236008,
"grad_norm": 0.5390625,
"learning_rate": 4.934560780834073e-05,
"loss": 1.0003,
"mean_token_accuracy": 0.7430438749492169,
"num_tokens": 5652709.0,
"step": 60
},
{
"entropy": 1.4100728079676628,
"epoch": 0.01553053413944201,
"grad_norm": 0.5703125,
"learning_rate": 4.923469387755102e-05,
"loss": 1.0167,
"mean_token_accuracy": 0.7407922275364399,
"num_tokens": 6610134.0,
"step": 70
},
{
"entropy": 1.403176763653755,
"epoch": 0.01774918187364801,
"grad_norm": 0.64453125,
"learning_rate": 4.9123779946761314e-05,
"loss": 1.044,
"mean_token_accuracy": 0.7348449125885963,
"num_tokens": 7568291.0,
"step": 80
},
{
"entropy": 1.4683261014521123,
"epoch": 0.019967829607854013,
"grad_norm": 0.6328125,
"learning_rate": 4.9012866015971606e-05,
"loss": 1.0934,
"mean_token_accuracy": 0.724130530655384,
"num_tokens": 8504994.0,
"step": 90
},
{
"entropy": 1.4386583149433136,
"epoch": 0.022186477342060015,
"grad_norm": 0.61328125,
"learning_rate": 4.8901952085181905e-05,
"loss": 1.0837,
"mean_token_accuracy": 0.728272894024849,
"num_tokens": 9448639.0,
"step": 100
},
{
"entropy": 1.420653748512268,
"epoch": 0.024405125076266018,
"grad_norm": 0.55859375,
"learning_rate": 4.87910381543922e-05,
"loss": 1.0387,
"mean_token_accuracy": 0.7369039125740529,
"num_tokens": 10379425.0,
"step": 110
},
{
"entropy": 1.404262875020504,
"epoch": 0.026623772810472016,
"grad_norm": 0.56640625,
"learning_rate": 4.868012422360249e-05,
"loss": 1.0209,
"mean_token_accuracy": 0.7374828591942787,
"num_tokens": 11309822.0,
"step": 120
},
{
"entropy": 1.453029316663742,
"epoch": 0.02884242054467802,
"grad_norm": 0.625,
"learning_rate": 4.856921029281278e-05,
"loss": 1.0605,
"mean_token_accuracy": 0.7299027130007744,
"num_tokens": 12238455.0,
"step": 130
},
{
"entropy": 1.3651263251900674,
"epoch": 0.03106106827888402,
"grad_norm": 0.59375,
"learning_rate": 4.845829636202307e-05,
"loss": 0.9947,
"mean_token_accuracy": 0.7443266965448856,
"num_tokens": 13182071.0,
"step": 140
},
{
"entropy": 1.385608184337616,
"epoch": 0.03327971601309002,
"grad_norm": 0.58203125,
"learning_rate": 4.8347382431233365e-05,
"loss": 1.0164,
"mean_token_accuracy": 0.7404524885118008,
"num_tokens": 14133077.0,
"step": 150
},
{
"entropy": 1.3790138736367226,
"epoch": 0.03549836374729602,
"grad_norm": 0.55859375,
"learning_rate": 4.823646850044366e-05,
"loss": 1.0056,
"mean_token_accuracy": 0.7429419830441475,
"num_tokens": 15097146.0,
"step": 160
},
{
"entropy": 1.3843353003263474,
"epoch": 0.03771701148150203,
"grad_norm": 0.5625,
"learning_rate": 4.812555456965395e-05,
"loss": 1.0225,
"mean_token_accuracy": 0.7410897597670555,
"num_tokens": 16041115.0,
"step": 170
},
{
"entropy": 1.4388863369822502,
"epoch": 0.039935659215708026,
"grad_norm": 0.55859375,
"learning_rate": 4.801464063886424e-05,
"loss": 1.0651,
"mean_token_accuracy": 0.7301742501556874,
"num_tokens": 16967907.0,
"step": 180
},
{
"entropy": 1.4269818142056465,
"epoch": 0.042154306949914025,
"grad_norm": 0.58984375,
"learning_rate": 4.7903726708074534e-05,
"loss": 1.0516,
"mean_token_accuracy": 0.7301830016076565,
"num_tokens": 17886856.0,
"step": 190
},
{
"entropy": 1.4162877902388573,
"epoch": 0.04437295468412003,
"grad_norm": 0.55859375,
"learning_rate": 4.7792812777284826e-05,
"loss": 1.03,
"mean_token_accuracy": 0.7377504236996174,
"num_tokens": 18840197.0,
"step": 200
},
{
"entropy": 1.4102661520242692,
"epoch": 0.04659160241832603,
"grad_norm": 0.55859375,
"learning_rate": 4.768189884649512e-05,
"loss": 1.0236,
"mean_token_accuracy": 0.7400240004062653,
"num_tokens": 19781494.0,
"step": 210
},
{
"entropy": 1.3768211975693703,
"epoch": 0.048810250152532035,
"grad_norm": 0.546875,
"learning_rate": 4.757098491570541e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.7427880488336086,
"num_tokens": 20723374.0,
"step": 220
},
{
"entropy": 1.3382669970393182,
"epoch": 0.051028897886738034,
"grad_norm": 0.52734375,
"learning_rate": 4.74600709849157e-05,
"loss": 0.9594,
"mean_token_accuracy": 0.7518122509121895,
"num_tokens": 21678173.0,
"step": 230
},
{
"entropy": 1.4415529936552047,
"epoch": 0.05324754562094403,
"grad_norm": 0.59765625,
"learning_rate": 4.7349157054126e-05,
"loss": 1.0553,
"mean_token_accuracy": 0.7320528604090214,
"num_tokens": 22636644.0,
"step": 240
},
{
"entropy": 1.4109850257635117,
"epoch": 0.05546619335515004,
"grad_norm": 0.62890625,
"learning_rate": 4.7238243123336293e-05,
"loss": 1.0229,
"mean_token_accuracy": 0.7401082016527653,
"num_tokens": 23591235.0,
"step": 250
},
{
"entropy": 1.4080532848834992,
"epoch": 0.05768484108935604,
"grad_norm": 0.5859375,
"learning_rate": 4.7127329192546586e-05,
"loss": 1.0517,
"mean_token_accuracy": 0.7366889797151088,
"num_tokens": 24542394.0,
"step": 260
},
{
"entropy": 1.389213815331459,
"epoch": 0.059903488823562036,
"grad_norm": 0.578125,
"learning_rate": 4.701641526175688e-05,
"loss": 1.0251,
"mean_token_accuracy": 0.7381838664412499,
"num_tokens": 25470496.0,
"step": 270
},
{
"entropy": 1.3643932774662972,
"epoch": 0.06212213655776804,
"grad_norm": 0.5703125,
"learning_rate": 4.690550133096717e-05,
"loss": 1.0054,
"mean_token_accuracy": 0.7416425958275795,
"num_tokens": 26442302.0,
"step": 280
},
{
"entropy": 1.3870579779148102,
"epoch": 0.06434078429197404,
"grad_norm": 0.5546875,
"learning_rate": 4.679458740017746e-05,
"loss": 1.0343,
"mean_token_accuracy": 0.737949987500906,
"num_tokens": 27393661.0,
"step": 290
},
{
"entropy": 1.396770441532135,
"epoch": 0.06655943202618005,
"grad_norm": 0.546875,
"learning_rate": 4.6683673469387754e-05,
"loss": 1.0141,
"mean_token_accuracy": 0.7434757709503174,
"num_tokens": 28341659.0,
"step": 300
},
{
"entropy": 1.3748480409383774,
"epoch": 0.06877807976038605,
"grad_norm": 0.55859375,
"learning_rate": 4.6572759538598046e-05,
"loss": 1.0087,
"mean_token_accuracy": 0.7405130356550217,
"num_tokens": 29277411.0,
"step": 310
},
{
"entropy": 1.4325285077095031,
"epoch": 0.07099672749459204,
"grad_norm": 0.57421875,
"learning_rate": 4.646184560780834e-05,
"loss": 1.0756,
"mean_token_accuracy": 0.7282709129154682,
"num_tokens": 30202359.0,
"step": 320
},
{
"entropy": 1.3642885342240334,
"epoch": 0.07321537522879805,
"grad_norm": 0.57421875,
"learning_rate": 4.635093167701863e-05,
"loss": 1.0025,
"mean_token_accuracy": 0.7448312789201736,
"num_tokens": 31145832.0,
"step": 330
},
{
"entropy": 1.4077475845813752,
"epoch": 0.07543402296300405,
"grad_norm": 0.5625,
"learning_rate": 4.624001774622893e-05,
"loss": 1.0089,
"mean_token_accuracy": 0.7406972415745259,
"num_tokens": 32074320.0,
"step": 340
},
{
"entropy": 1.3939625218510627,
"epoch": 0.07765267069721005,
"grad_norm": 0.51953125,
"learning_rate": 4.612910381543922e-05,
"loss": 0.9987,
"mean_token_accuracy": 0.7439860895276069,
"num_tokens": 33020609.0,
"step": 350
},
{
"entropy": 1.3682234331965446,
"epoch": 0.07987131843141605,
"grad_norm": 0.5625,
"learning_rate": 4.6018189884649514e-05,
"loss": 0.9728,
"mean_token_accuracy": 0.7498374275863171,
"num_tokens": 33954434.0,
"step": 360
},
{
"entropy": 1.3806424900889396,
"epoch": 0.08208996616562206,
"grad_norm": 0.57421875,
"learning_rate": 4.5907275953859806e-05,
"loss": 0.9897,
"mean_token_accuracy": 0.7453982323408127,
"num_tokens": 34897665.0,
"step": 370
},
{
"entropy": 1.3811901077628135,
"epoch": 0.08430861389982805,
"grad_norm": 0.52734375,
"learning_rate": 4.57963620230701e-05,
"loss": 0.9774,
"mean_token_accuracy": 0.750572357326746,
"num_tokens": 35851910.0,
"step": 380
},
{
"entropy": 1.3813920207321644,
"epoch": 0.08652726163403406,
"grad_norm": 0.55859375,
"learning_rate": 4.568544809228039e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7430255509912967,
"num_tokens": 36774893.0,
"step": 390
},
{
"entropy": 1.4034755870699882,
"epoch": 0.08874590936824006,
"grad_norm": 0.53125,
"learning_rate": 4.557453416149068e-05,
"loss": 1.0016,
"mean_token_accuracy": 0.7436409674584865,
"num_tokens": 37732150.0,
"step": 400
},
{
"entropy": 1.416483211517334,
"epoch": 0.09096455710244605,
"grad_norm": 0.5234375,
"learning_rate": 4.5463620230700974e-05,
"loss": 1.0171,
"mean_token_accuracy": 0.7410402894020081,
"num_tokens": 38689323.0,
"step": 410
},
{
"entropy": 1.4142859980463982,
"epoch": 0.09318320483665206,
"grad_norm": 0.56640625,
"learning_rate": 4.5352706299911266e-05,
"loss": 1.0005,
"mean_token_accuracy": 0.740844739228487,
"num_tokens": 39646707.0,
"step": 420
},
{
"entropy": 1.408056764304638,
"epoch": 0.09540185257085806,
"grad_norm": 0.546875,
"learning_rate": 4.5241792369121565e-05,
"loss": 0.9846,
"mean_token_accuracy": 0.7466986313462257,
"num_tokens": 40593712.0,
"step": 430
},
{
"entropy": 1.38804781883955,
"epoch": 0.09762050030506407,
"grad_norm": 0.515625,
"learning_rate": 4.513087843833186e-05,
"loss": 0.9794,
"mean_token_accuracy": 0.7476758994162083,
"num_tokens": 41520297.0,
"step": 440
},
{
"entropy": 1.4305102132260799,
"epoch": 0.09983914803927006,
"grad_norm": 0.55859375,
"learning_rate": 4.501996450754215e-05,
"loss": 1.0383,
"mean_token_accuracy": 0.7344398230314255,
"num_tokens": 42459207.0,
"step": 450
},
{
"entropy": 1.388769841194153,
"epoch": 0.10205779577347607,
"grad_norm": 0.59375,
"learning_rate": 4.490905057675244e-05,
"loss": 1.0054,
"mean_token_accuracy": 0.7438753083348274,
"num_tokens": 43397171.0,
"step": 460
},
{
"entropy": 1.3882140532135963,
"epoch": 0.10427644350768207,
"grad_norm": 0.515625,
"learning_rate": 4.4798136645962734e-05,
"loss": 1.0118,
"mean_token_accuracy": 0.7423836156725884,
"num_tokens": 44389613.0,
"step": 470
},
{
"entropy": 1.422153604775667,
"epoch": 0.10649509124188807,
"grad_norm": 0.55078125,
"learning_rate": 4.4687222715173026e-05,
"loss": 1.0353,
"mean_token_accuracy": 0.7357220977544785,
"num_tokens": 45328113.0,
"step": 480
},
{
"entropy": 1.3926182009279728,
"epoch": 0.10871373897609407,
"grad_norm": 0.57421875,
"learning_rate": 4.457630878438332e-05,
"loss": 1.0027,
"mean_token_accuracy": 0.7421124801039696,
"num_tokens": 46299624.0,
"step": 490
},
{
"entropy": 1.4123871177434921,
"epoch": 0.11093238671030008,
"grad_norm": 0.55859375,
"learning_rate": 4.446539485359361e-05,
"loss": 0.9935,
"mean_token_accuracy": 0.745088592916727,
"num_tokens": 47252835.0,
"step": 500
},
{
"entropy": 1.3767844289541245,
"epoch": 0.11315103444450607,
"grad_norm": 0.55078125,
"learning_rate": 4.43544809228039e-05,
"loss": 0.9747,
"mean_token_accuracy": 0.7475401207804679,
"num_tokens": 48205264.0,
"step": 510
},
{
"entropy": 1.396455319225788,
"epoch": 0.11536968217871207,
"grad_norm": 0.5234375,
"learning_rate": 4.42435669920142e-05,
"loss": 1.0098,
"mean_token_accuracy": 0.7415580742061139,
"num_tokens": 49160839.0,
"step": 520
},
{
"entropy": 1.347930134832859,
"epoch": 0.11758832991291808,
"grad_norm": 0.54296875,
"learning_rate": 4.4132653061224493e-05,
"loss": 0.935,
"mean_token_accuracy": 0.7578449346125126,
"num_tokens": 50102578.0,
"step": 530
},
{
"entropy": 1.3879924044013023,
"epoch": 0.11980697764712407,
"grad_norm": 0.52734375,
"learning_rate": 4.4021739130434786e-05,
"loss": 0.9867,
"mean_token_accuracy": 0.7446529671549798,
"num_tokens": 51034066.0,
"step": 540
},
{
"entropy": 1.3780046537518502,
"epoch": 0.12202562538133008,
"grad_norm": 0.57421875,
"learning_rate": 4.391082519964508e-05,
"loss": 1.0,
"mean_token_accuracy": 0.7435966461896897,
"num_tokens": 51964014.0,
"step": 550
},
{
"entropy": 1.3777382314205169,
"epoch": 0.12424427311553608,
"grad_norm": 0.53125,
"learning_rate": 4.379991126885537e-05,
"loss": 0.9734,
"mean_token_accuracy": 0.7478257723152637,
"num_tokens": 52910576.0,
"step": 560
},
{
"entropy": 1.3899442911148072,
"epoch": 0.1264629208497421,
"grad_norm": 0.57421875,
"learning_rate": 4.368899733806566e-05,
"loss": 0.9825,
"mean_token_accuracy": 0.7491655819118023,
"num_tokens": 53856897.0,
"step": 570
},
{
"entropy": 1.3858520530164242,
"epoch": 0.12868156858394808,
"grad_norm": 0.5390625,
"learning_rate": 4.3578083407275954e-05,
"loss": 1.0048,
"mean_token_accuracy": 0.7406159020960331,
"num_tokens": 54781199.0,
"step": 580
},
{
"entropy": 1.35281662940979,
"epoch": 0.13090021631815407,
"grad_norm": 0.55078125,
"learning_rate": 4.3467169476486246e-05,
"loss": 0.9788,
"mean_token_accuracy": 0.7481894366443157,
"num_tokens": 55737247.0,
"step": 590
},
{
"entropy": 1.3705300688743591,
"epoch": 0.1331188640523601,
"grad_norm": 0.57421875,
"learning_rate": 4.335625554569654e-05,
"loss": 0.9694,
"mean_token_accuracy": 0.7483362957835198,
"num_tokens": 56651909.0,
"step": 600
},
{
"entropy": 1.4127747476100923,
"epoch": 0.13533751178656608,
"grad_norm": 0.54296875,
"learning_rate": 4.324534161490684e-05,
"loss": 1.0249,
"mean_token_accuracy": 0.7398222059011459,
"num_tokens": 57590489.0,
"step": 610
},
{
"entropy": 1.3992966830730438,
"epoch": 0.1375561595207721,
"grad_norm": 0.59765625,
"learning_rate": 4.313442768411713e-05,
"loss": 1.0117,
"mean_token_accuracy": 0.7400935985147953,
"num_tokens": 58499984.0,
"step": 620
},
{
"entropy": 1.387077435851097,
"epoch": 0.1397748072549781,
"grad_norm": 0.5703125,
"learning_rate": 4.302351375332742e-05,
"loss": 0.959,
"mean_token_accuracy": 0.7503612264990807,
"num_tokens": 59442258.0,
"step": 630
},
{
"entropy": 1.4211810544133185,
"epoch": 0.1419934549891841,
"grad_norm": 0.55078125,
"learning_rate": 4.2912599822537714e-05,
"loss": 1.0157,
"mean_token_accuracy": 0.7405542671680451,
"num_tokens": 60360327.0,
"step": 640
},
{
"entropy": 1.3745015911757945,
"epoch": 0.1442121027233901,
"grad_norm": 0.54296875,
"learning_rate": 4.2801685891748006e-05,
"loss": 0.9522,
"mean_token_accuracy": 0.7537800639867782,
"num_tokens": 61327349.0,
"step": 650
},
{
"entropy": 1.4054788954555988,
"epoch": 0.1464307504575961,
"grad_norm": 0.5546875,
"learning_rate": 4.26907719609583e-05,
"loss": 0.9941,
"mean_token_accuracy": 0.7440318554639817,
"num_tokens": 62264837.0,
"step": 660
},
{
"entropy": 1.3812890231609345,
"epoch": 0.1486493981918021,
"grad_norm": 0.53515625,
"learning_rate": 4.257985803016859e-05,
"loss": 0.9678,
"mean_token_accuracy": 0.7510386519134045,
"num_tokens": 63211247.0,
"step": 670
},
{
"entropy": 1.409769555926323,
"epoch": 0.1508680459260081,
"grad_norm": 0.546875,
"learning_rate": 4.246894409937888e-05,
"loss": 0.9996,
"mean_token_accuracy": 0.7456191934645175,
"num_tokens": 64155975.0,
"step": 680
},
{
"entropy": 1.3923737697303296,
"epoch": 0.1530866936602141,
"grad_norm": 0.53515625,
"learning_rate": 4.2358030168589174e-05,
"loss": 0.9722,
"mean_token_accuracy": 0.7461612269282341,
"num_tokens": 65072271.0,
"step": 690
},
{
"entropy": 1.40745849609375,
"epoch": 0.1553053413944201,
"grad_norm": 0.57421875,
"learning_rate": 4.224711623779947e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.7412535354495049,
"num_tokens": 65998478.0,
"step": 700
},
{
"entropy": 1.3825418494641781,
"epoch": 0.1575239891286261,
"grad_norm": 0.55859375,
"learning_rate": 4.2136202307009765e-05,
"loss": 1.02,
"mean_token_accuracy": 0.7408786401152611,
"num_tokens": 66964955.0,
"step": 710
},
{
"entropy": 1.36370387673378,
"epoch": 0.1597426368628321,
"grad_norm": 0.70703125,
"learning_rate": 4.202528837622006e-05,
"loss": 0.9479,
"mean_token_accuracy": 0.7531493015587329,
"num_tokens": 67924768.0,
"step": 720
},
{
"entropy": 1.3911995731294156,
"epoch": 0.1619612845970381,
"grad_norm": 0.5703125,
"learning_rate": 4.191437444543035e-05,
"loss": 0.9809,
"mean_token_accuracy": 0.7469467587769032,
"num_tokens": 68848454.0,
"step": 730
},
{
"entropy": 1.3749838933348655,
"epoch": 0.16417993233124412,
"grad_norm": 0.5078125,
"learning_rate": 4.180346051464064e-05,
"loss": 0.987,
"mean_token_accuracy": 0.7450465574860573,
"num_tokens": 69762759.0,
"step": 740
},
{
"entropy": 1.3985765784978867,
"epoch": 0.1663985800654501,
"grad_norm": 0.55078125,
"learning_rate": 4.1692546583850934e-05,
"loss": 1.0079,
"mean_token_accuracy": 0.7432275369763375,
"num_tokens": 70703955.0,
"step": 750
},
{
"entropy": 1.3777714148163795,
"epoch": 0.1686172277996561,
"grad_norm": 0.5859375,
"learning_rate": 4.1581632653061226e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7448336496949196,
"num_tokens": 71679834.0,
"step": 760
},
{
"entropy": 1.396980494260788,
"epoch": 0.17083587553386212,
"grad_norm": 0.5625,
"learning_rate": 4.147071872227152e-05,
"loss": 1.0315,
"mean_token_accuracy": 0.735766839236021,
"num_tokens": 72627848.0,
"step": 770
},
{
"entropy": 1.4055049568414688,
"epoch": 0.1730545232680681,
"grad_norm": 0.5546875,
"learning_rate": 4.135980479148181e-05,
"loss": 1.0316,
"mean_token_accuracy": 0.7373110122978688,
"num_tokens": 73581207.0,
"step": 780
},
{
"entropy": 1.3683342918753625,
"epoch": 0.1752731710022741,
"grad_norm": 0.53125,
"learning_rate": 4.124889086069211e-05,
"loss": 0.9791,
"mean_token_accuracy": 0.747586116939783,
"num_tokens": 74529475.0,
"step": 790
},
{
"entropy": 1.3873766288161278,
"epoch": 0.17749181873648012,
"grad_norm": 0.546875,
"learning_rate": 4.11379769299024e-05,
"loss": 0.9754,
"mean_token_accuracy": 0.7475376576185226,
"num_tokens": 75440781.0,
"step": 800
},
{
"entropy": 1.3871978685259818,
"epoch": 0.17971046647068611,
"grad_norm": 0.51953125,
"learning_rate": 4.1027062999112693e-05,
"loss": 0.9639,
"mean_token_accuracy": 0.7503504127264022,
"num_tokens": 76380254.0,
"step": 810
},
{
"entropy": 1.3826657935976983,
"epoch": 0.1819291142048921,
"grad_norm": 0.5703125,
"learning_rate": 4.0916149068322986e-05,
"loss": 0.9853,
"mean_token_accuracy": 0.7480736874043942,
"num_tokens": 77331959.0,
"step": 820
},
{
"entropy": 1.3709987953305245,
"epoch": 0.18414776193909813,
"grad_norm": 0.5859375,
"learning_rate": 4.080523513753328e-05,
"loss": 0.9922,
"mean_token_accuracy": 0.7420654028654099,
"num_tokens": 78260787.0,
"step": 830
},
{
"entropy": 1.3630467101931572,
"epoch": 0.18636640967330412,
"grad_norm": 0.53515625,
"learning_rate": 4.069432120674357e-05,
"loss": 0.9769,
"mean_token_accuracy": 0.7467788316309452,
"num_tokens": 79222828.0,
"step": 840
},
{
"entropy": 1.392745055258274,
"epoch": 0.1885850574075101,
"grad_norm": 0.55078125,
"learning_rate": 4.058340727595386e-05,
"loss": 0.9989,
"mean_token_accuracy": 0.7418600834906102,
"num_tokens": 80173060.0,
"step": 850
},
{
"entropy": 1.4078860878944397,
"epoch": 0.19080370514171613,
"grad_norm": 0.578125,
"learning_rate": 4.0472493345164154e-05,
"loss": 1.0245,
"mean_token_accuracy": 0.7383234694600105,
"num_tokens": 81102014.0,
"step": 860
},
{
"entropy": 1.417808648943901,
"epoch": 0.19302235287592212,
"grad_norm": 0.56640625,
"learning_rate": 4.0361579414374446e-05,
"loss": 0.9965,
"mean_token_accuracy": 0.7464033514261246,
"num_tokens": 82020785.0,
"step": 870
},
{
"entropy": 1.3907752215862275,
"epoch": 0.19524100061012814,
"grad_norm": 0.578125,
"learning_rate": 4.025066548358474e-05,
"loss": 0.9928,
"mean_token_accuracy": 0.7445502743124962,
"num_tokens": 82957496.0,
"step": 880
},
{
"entropy": 1.3803277552127837,
"epoch": 0.19745964834433413,
"grad_norm": 0.53125,
"learning_rate": 4.013975155279504e-05,
"loss": 0.9616,
"mean_token_accuracy": 0.7518575496971607,
"num_tokens": 83928608.0,
"step": 890
},
{
"entropy": 1.365333902835846,
"epoch": 0.19967829607854012,
"grad_norm": 0.55078125,
"learning_rate": 4.002883762200533e-05,
"loss": 0.9758,
"mean_token_accuracy": 0.7502094514667987,
"num_tokens": 84877530.0,
"step": 900
},
{
"entropy": 1.3868597373366356,
"epoch": 0.20189694381274614,
"grad_norm": 0.5390625,
"learning_rate": 3.991792369121562e-05,
"loss": 0.9728,
"mean_token_accuracy": 0.7488475523889064,
"num_tokens": 85818477.0,
"step": 910
},
{
"entropy": 1.3934067755937576,
"epoch": 0.20411559154695214,
"grad_norm": 0.55078125,
"learning_rate": 3.9807009760425914e-05,
"loss": 0.9875,
"mean_token_accuracy": 0.745812700688839,
"num_tokens": 86742251.0,
"step": 920
},
{
"entropy": 1.355683723092079,
"epoch": 0.20633423928115813,
"grad_norm": 0.5234375,
"learning_rate": 3.9696095829636206e-05,
"loss": 0.9674,
"mean_token_accuracy": 0.7483757615089417,
"num_tokens": 87672989.0,
"step": 930
},
{
"entropy": 1.3708684414625167,
"epoch": 0.20855288701536415,
"grad_norm": 0.4921875,
"learning_rate": 3.95851818988465e-05,
"loss": 0.976,
"mean_token_accuracy": 0.7468036495149135,
"num_tokens": 88639065.0,
"step": 940
},
{
"entropy": 1.3593387573957443,
"epoch": 0.21077153474957014,
"grad_norm": 0.51953125,
"learning_rate": 3.947426796805679e-05,
"loss": 0.9378,
"mean_token_accuracy": 0.7551731921732425,
"num_tokens": 89578484.0,
"step": 950
},
{
"entropy": 1.3732744343578815,
"epoch": 0.21299018248377613,
"grad_norm": 0.546875,
"learning_rate": 3.936335403726708e-05,
"loss": 0.9818,
"mean_token_accuracy": 0.7454430587589741,
"num_tokens": 90523121.0,
"step": 960
},
{
"entropy": 1.3468638718128205,
"epoch": 0.21520883021798215,
"grad_norm": 0.5859375,
"learning_rate": 3.9252440106477374e-05,
"loss": 0.9422,
"mean_token_accuracy": 0.7539307042956352,
"num_tokens": 91464767.0,
"step": 970
},
{
"entropy": 1.3708197608590127,
"epoch": 0.21742747795218814,
"grad_norm": 0.54296875,
"learning_rate": 3.914152617568767e-05,
"loss": 0.9705,
"mean_token_accuracy": 0.7490366064012051,
"num_tokens": 92409875.0,
"step": 980
},
{
"entropy": 1.3723851881921292,
"epoch": 0.21964612568639413,
"grad_norm": 0.51171875,
"learning_rate": 3.9030612244897965e-05,
"loss": 0.9613,
"mean_token_accuracy": 0.7512517027556896,
"num_tokens": 93347564.0,
"step": 990
},
{
"entropy": 1.3774209707975387,
"epoch": 0.22186477342060015,
"grad_norm": 0.53515625,
"learning_rate": 3.891969831410826e-05,
"loss": 0.9613,
"mean_token_accuracy": 0.7502817243337632,
"num_tokens": 94304767.0,
"step": 1000
},
{
"entropy": 1.4110181361436844,
"epoch": 0.22408342115480614,
"grad_norm": 0.6171875,
"learning_rate": 3.880878438331855e-05,
"loss": 0.9798,
"mean_token_accuracy": 0.74644386023283,
"num_tokens": 95239927.0,
"step": 1010
},
{
"entropy": 1.3407094910740853,
"epoch": 0.22630206888901214,
"grad_norm": 0.5390625,
"learning_rate": 3.869787045252884e-05,
"loss": 0.9345,
"mean_token_accuracy": 0.7551386684179306,
"num_tokens": 96197722.0,
"step": 1020
},
{
"entropy": 1.3748439356684685,
"epoch": 0.22852071662321816,
"grad_norm": 0.55078125,
"learning_rate": 3.8586956521739134e-05,
"loss": 0.9714,
"mean_token_accuracy": 0.7462637320160865,
"num_tokens": 97155014.0,
"step": 1030
},
{
"entropy": 1.40400949716568,
"epoch": 0.23073936435742415,
"grad_norm": 0.515625,
"learning_rate": 3.8476042590949426e-05,
"loss": 0.9907,
"mean_token_accuracy": 0.7466505110263825,
"num_tokens": 98110510.0,
"step": 1040
},
{
"entropy": 1.3614235058426858,
"epoch": 0.23295801209163014,
"grad_norm": 0.51171875,
"learning_rate": 3.836512866015972e-05,
"loss": 0.9528,
"mean_token_accuracy": 0.7518561266362667,
"num_tokens": 99062700.0,
"step": 1050
},
{
"entropy": 1.3811719179153443,
"epoch": 0.23517665982583616,
"grad_norm": 0.5859375,
"learning_rate": 3.825421472937001e-05,
"loss": 0.9715,
"mean_token_accuracy": 0.7507105618715286,
"num_tokens": 100002449.0,
"step": 1060
},
{
"entropy": 1.3694360241293908,
"epoch": 0.23739530756004215,
"grad_norm": 0.5390625,
"learning_rate": 3.814330079858031e-05,
"loss": 0.9393,
"mean_token_accuracy": 0.7542741730809212,
"num_tokens": 100944775.0,
"step": 1070
},
{
"entropy": 1.368511787056923,
"epoch": 0.23961395529424814,
"grad_norm": 0.52734375,
"learning_rate": 3.80323868677906e-05,
"loss": 0.9583,
"mean_token_accuracy": 0.7501736409962177,
"num_tokens": 101889263.0,
"step": 1080
},
{
"entropy": 1.410076305270195,
"epoch": 0.24183260302845416,
"grad_norm": 0.578125,
"learning_rate": 3.7921472937000893e-05,
"loss": 0.9805,
"mean_token_accuracy": 0.745997640490532,
"num_tokens": 102806738.0,
"step": 1090
},
{
"entropy": 1.3686684682965278,
"epoch": 0.24405125076266015,
"grad_norm": 0.5546875,
"learning_rate": 3.7810559006211186e-05,
"loss": 0.9533,
"mean_token_accuracy": 0.7539502412080765,
"num_tokens": 103757882.0,
"step": 1100
},
{
"entropy": 1.3773868307471275,
"epoch": 0.24626989849686615,
"grad_norm": 0.546875,
"learning_rate": 3.769964507542148e-05,
"loss": 0.9674,
"mean_token_accuracy": 0.7515710204839706,
"num_tokens": 104700330.0,
"step": 1110
},
{
"entropy": 1.3980351358652114,
"epoch": 0.24848854623107217,
"grad_norm": 0.578125,
"learning_rate": 3.758873114463177e-05,
"loss": 1.0042,
"mean_token_accuracy": 0.7424275025725364,
"num_tokens": 105631653.0,
"step": 1120
},
{
"entropy": 1.399548628926277,
"epoch": 0.2507071939652782,
"grad_norm": 0.5,
"learning_rate": 3.747781721384206e-05,
"loss": 0.9793,
"mean_token_accuracy": 0.7482922926545144,
"num_tokens": 106578177.0,
"step": 1130
},
{
"entropy": 1.3911961004137994,
"epoch": 0.2529258416994842,
"grad_norm": 0.5390625,
"learning_rate": 3.7366903283052354e-05,
"loss": 0.9861,
"mean_token_accuracy": 0.7463311538100242,
"num_tokens": 107501771.0,
"step": 1140
},
{
"entropy": 1.3983097136020661,
"epoch": 0.25514448943369017,
"grad_norm": 0.5390625,
"learning_rate": 3.7255989352262646e-05,
"loss": 1.0009,
"mean_token_accuracy": 0.739760322123766,
"num_tokens": 108461011.0,
"step": 1150
},
{
"entropy": 1.3597055405378342,
"epoch": 0.25736313716789616,
"grad_norm": 0.53125,
"learning_rate": 3.714507542147294e-05,
"loss": 0.9549,
"mean_token_accuracy": 0.7523537255823612,
"num_tokens": 109400402.0,
"step": 1160
},
{
"entropy": 1.388819195330143,
"epoch": 0.25958178490210215,
"grad_norm": 0.5078125,
"learning_rate": 3.703416149068323e-05,
"loss": 0.9474,
"mean_token_accuracy": 0.7524086780846119,
"num_tokens": 110311375.0,
"step": 1170
},
{
"entropy": 1.379358747601509,
"epoch": 0.26180043263630814,
"grad_norm": 0.58984375,
"learning_rate": 3.692324755989352e-05,
"loss": 0.9753,
"mean_token_accuracy": 0.7477897442877293,
"num_tokens": 111250331.0,
"step": 1180
},
{
"entropy": 1.3828957468271255,
"epoch": 0.2640190803705142,
"grad_norm": 0.58984375,
"learning_rate": 3.6812333629103815e-05,
"loss": 0.9848,
"mean_token_accuracy": 0.746380465477705,
"num_tokens": 112170443.0,
"step": 1190
},
{
"entropy": 1.3847462825477124,
"epoch": 0.2662377281047202,
"grad_norm": 0.578125,
"learning_rate": 3.670141969831411e-05,
"loss": 1.0014,
"mean_token_accuracy": 0.7441351152956486,
"num_tokens": 113114776.0,
"step": 1200
},
{
"entropy": 1.3747013211250305,
"epoch": 0.2684563758389262,
"grad_norm": 0.58984375,
"learning_rate": 3.65905057675244e-05,
"loss": 0.9892,
"mean_token_accuracy": 0.7449555344879627,
"num_tokens": 114040694.0,
"step": 1210
},
{
"entropy": 1.365119245648384,
"epoch": 0.27067502357313217,
"grad_norm": 0.546875,
"learning_rate": 3.64795918367347e-05,
"loss": 0.9687,
"mean_token_accuracy": 0.7497834034264088,
"num_tokens": 114961852.0,
"step": 1220
},
{
"entropy": 1.3869122669100762,
"epoch": 0.27289367130733816,
"grad_norm": 0.5234375,
"learning_rate": 3.636867790594499e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7449170716106892,
"num_tokens": 115901546.0,
"step": 1230
},
{
"entropy": 1.3620765566825868,
"epoch": 0.2751123190415442,
"grad_norm": 0.546875,
"learning_rate": 3.625776397515528e-05,
"loss": 0.9864,
"mean_token_accuracy": 0.7458140067756176,
"num_tokens": 116860680.0,
"step": 1240
},
{
"entropy": 1.3624719701707364,
"epoch": 0.2773309667757502,
"grad_norm": 0.5234375,
"learning_rate": 3.6146850044365574e-05,
"loss": 0.9459,
"mean_token_accuracy": 0.7540639825165272,
"num_tokens": 117800641.0,
"step": 1250
},
{
"entropy": 1.3767011970281602,
"epoch": 0.2795496145099562,
"grad_norm": 0.51171875,
"learning_rate": 3.6035936113575866e-05,
"loss": 0.9688,
"mean_token_accuracy": 0.7501399800181389,
"num_tokens": 118740256.0,
"step": 1260
},
{
"entropy": 1.4025324523448943,
"epoch": 0.2817682622441622,
"grad_norm": 0.53515625,
"learning_rate": 3.592502218278616e-05,
"loss": 0.9919,
"mean_token_accuracy": 0.7443845957517624,
"num_tokens": 119678821.0,
"step": 1270
},
{
"entropy": 1.3981096863746643,
"epoch": 0.2839869099783682,
"grad_norm": 0.53515625,
"learning_rate": 3.581410825199645e-05,
"loss": 1.0089,
"mean_token_accuracy": 0.7398683115839958,
"num_tokens": 120625856.0,
"step": 1280
},
{
"entropy": 1.3836973875761032,
"epoch": 0.28620555771257417,
"grad_norm": 0.53125,
"learning_rate": 3.570319432120674e-05,
"loss": 0.9833,
"mean_token_accuracy": 0.7469960272312164,
"num_tokens": 121548463.0,
"step": 1290
},
{
"entropy": 1.3693345814943314,
"epoch": 0.2884242054467802,
"grad_norm": 0.546875,
"learning_rate": 3.5592280390417035e-05,
"loss": 0.9547,
"mean_token_accuracy": 0.753000732511282,
"num_tokens": 122510112.0,
"step": 1300
},
{
"entropy": 1.4061051934957505,
"epoch": 0.2906428531809862,
"grad_norm": 0.5546875,
"learning_rate": 3.548136645962733e-05,
"loss": 1.0049,
"mean_token_accuracy": 0.7414190582931042,
"num_tokens": 123443396.0,
"step": 1310
},
{
"entropy": 1.3867851234972477,
"epoch": 0.2928615009151922,
"grad_norm": 0.56640625,
"learning_rate": 3.537045252883762e-05,
"loss": 0.979,
"mean_token_accuracy": 0.7475081883370877,
"num_tokens": 124388251.0,
"step": 1320
},
{
"entropy": 1.344521164894104,
"epoch": 0.2950801486493982,
"grad_norm": 0.56640625,
"learning_rate": 3.525953859804791e-05,
"loss": 0.9338,
"mean_token_accuracy": 0.7572960302233696,
"num_tokens": 125308765.0,
"step": 1330
},
{
"entropy": 1.3636821061372757,
"epoch": 0.2972987963836042,
"grad_norm": 0.53515625,
"learning_rate": 3.514862466725821e-05,
"loss": 0.962,
"mean_token_accuracy": 0.7506850846111774,
"num_tokens": 126245879.0,
"step": 1340
},
{
"entropy": 1.3687437891960144,
"epoch": 0.29951744411781017,
"grad_norm": 0.57421875,
"learning_rate": 3.50377107364685e-05,
"loss": 0.9639,
"mean_token_accuracy": 0.752644594758749,
"num_tokens": 127190476.0,
"step": 1350
},
{
"entropy": 1.3999216251075268,
"epoch": 0.3017360918520162,
"grad_norm": 0.6015625,
"learning_rate": 3.4926796805678794e-05,
"loss": 0.9869,
"mean_token_accuracy": 0.7462087258696556,
"num_tokens": 128115779.0,
"step": 1360
},
{
"entropy": 1.4003167398273946,
"epoch": 0.3039547395862222,
"grad_norm": 0.5546875,
"learning_rate": 3.481588287488909e-05,
"loss": 0.9984,
"mean_token_accuracy": 0.7460517160594463,
"num_tokens": 129062385.0,
"step": 1370
},
{
"entropy": 1.3807271018624305,
"epoch": 0.3061733873204282,
"grad_norm": 0.5390625,
"learning_rate": 3.470496894409938e-05,
"loss": 0.9805,
"mean_token_accuracy": 0.7482168138027191,
"num_tokens": 129990458.0,
"step": 1380
},
{
"entropy": 1.37543828189373,
"epoch": 0.3083920350546342,
"grad_norm": 0.5859375,
"learning_rate": 3.459405501330967e-05,
"loss": 0.9771,
"mean_token_accuracy": 0.7474354840815067,
"num_tokens": 130948775.0,
"step": 1390
},
{
"entropy": 1.3704403668642045,
"epoch": 0.3106106827888402,
"grad_norm": 0.58203125,
"learning_rate": 3.448314108251996e-05,
"loss": 0.9605,
"mean_token_accuracy": 0.7510613188147545,
"num_tokens": 131878796.0,
"step": 1400
},
{
"entropy": 1.3957126244902611,
"epoch": 0.3128293305230462,
"grad_norm": 0.609375,
"learning_rate": 3.4372227151730255e-05,
"loss": 0.9645,
"mean_token_accuracy": 0.7498879425227643,
"num_tokens": 132834250.0,
"step": 1410
},
{
"entropy": 1.3521507486701012,
"epoch": 0.3150479782572522,
"grad_norm": 0.57421875,
"learning_rate": 3.426131322094055e-05,
"loss": 0.9519,
"mean_token_accuracy": 0.7529676407575607,
"num_tokens": 133772698.0,
"step": 1420
},
{
"entropy": 1.3797581896185875,
"epoch": 0.3172666259914582,
"grad_norm": 0.55859375,
"learning_rate": 3.415039929015084e-05,
"loss": 1.0067,
"mean_token_accuracy": 0.7427522405982018,
"num_tokens": 134726995.0,
"step": 1430
},
{
"entropy": 1.3857417300343513,
"epoch": 0.3194852737256642,
"grad_norm": 0.546875,
"learning_rate": 3.403948535936114e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.7424978382885457,
"num_tokens": 135683552.0,
"step": 1440
},
{
"entropy": 1.4185665279626847,
"epoch": 0.3217039214598702,
"grad_norm": 0.52734375,
"learning_rate": 3.392857142857143e-05,
"loss": 1.0188,
"mean_token_accuracy": 0.7394578918814659,
"num_tokens": 136633106.0,
"step": 1450
},
{
"entropy": 1.3622751355171203,
"epoch": 0.3239225691940762,
"grad_norm": 0.59375,
"learning_rate": 3.381765749778172e-05,
"loss": 0.9698,
"mean_token_accuracy": 0.7495865255594254,
"num_tokens": 137586751.0,
"step": 1460
},
{
"entropy": 1.3379265323281289,
"epoch": 0.3261412169282822,
"grad_norm": 0.51171875,
"learning_rate": 3.3706743566992015e-05,
"loss": 0.9467,
"mean_token_accuracy": 0.7519558638334274,
"num_tokens": 138558225.0,
"step": 1470
},
{
"entropy": 1.3717472016811372,
"epoch": 0.32835986466248823,
"grad_norm": 0.546875,
"learning_rate": 3.359582963620231e-05,
"loss": 0.9353,
"mean_token_accuracy": 0.7551800265908242,
"num_tokens": 139493320.0,
"step": 1480
},
{
"entropy": 1.3652813754975797,
"epoch": 0.3305785123966942,
"grad_norm": 0.55078125,
"learning_rate": 3.34849157054126e-05,
"loss": 0.9574,
"mean_token_accuracy": 0.7501180328428745,
"num_tokens": 140431349.0,
"step": 1490
},
{
"entropy": 1.3436471790075302,
"epoch": 0.3327971601309002,
"grad_norm": 0.498046875,
"learning_rate": 3.337400177462289e-05,
"loss": 0.9565,
"mean_token_accuracy": 0.7528107918798923,
"num_tokens": 141372798.0,
"step": 1500
},
{
"entropy": 1.3558987267315388,
"epoch": 0.3350158078651062,
"grad_norm": 0.55859375,
"learning_rate": 3.326308784383318e-05,
"loss": 0.9391,
"mean_token_accuracy": 0.7559271931648255,
"num_tokens": 142315033.0,
"step": 1510
},
{
"entropy": 1.378397299349308,
"epoch": 0.3372344555993122,
"grad_norm": 0.5625,
"learning_rate": 3.3152173913043475e-05,
"loss": 0.9726,
"mean_token_accuracy": 0.7490174636244774,
"num_tokens": 143248295.0,
"step": 1520
},
{
"entropy": 1.377681267261505,
"epoch": 0.33945310333351825,
"grad_norm": 0.6015625,
"learning_rate": 3.3041259982253774e-05,
"loss": 0.9705,
"mean_token_accuracy": 0.7475920669734478,
"num_tokens": 144215440.0,
"step": 1530
},
{
"entropy": 1.3835771530866623,
"epoch": 0.34167175106772424,
"grad_norm": 0.56640625,
"learning_rate": 3.2930346051464066e-05,
"loss": 0.9578,
"mean_token_accuracy": 0.7509067423641682,
"num_tokens": 145154667.0,
"step": 1540
},
{
"entropy": 1.3816084749996662,
"epoch": 0.34389039880193023,
"grad_norm": 0.59765625,
"learning_rate": 3.281943212067436e-05,
"loss": 0.9694,
"mean_token_accuracy": 0.7493415616452694,
"num_tokens": 146091705.0,
"step": 1550
},
{
"entropy": 1.3724812373518944,
"epoch": 0.3461090465361362,
"grad_norm": 0.52734375,
"learning_rate": 3.270851818988465e-05,
"loss": 0.9904,
"mean_token_accuracy": 0.7453893661499024,
"num_tokens": 147020656.0,
"step": 1560
},
{
"entropy": 1.3804431870579719,
"epoch": 0.3483276942703422,
"grad_norm": 0.59375,
"learning_rate": 3.259760425909494e-05,
"loss": 0.9758,
"mean_token_accuracy": 0.7461709767580033,
"num_tokens": 147947728.0,
"step": 1570
},
{
"entropy": 1.344531001150608,
"epoch": 0.3505463420045482,
"grad_norm": 0.54296875,
"learning_rate": 3.2486690328305235e-05,
"loss": 0.9415,
"mean_token_accuracy": 0.7543717570602894,
"num_tokens": 148884865.0,
"step": 1580
},
{
"entropy": 1.3736070185899734,
"epoch": 0.35276498973875425,
"grad_norm": 0.50390625,
"learning_rate": 3.237577639751553e-05,
"loss": 0.9788,
"mean_token_accuracy": 0.7499733969569207,
"num_tokens": 149835556.0,
"step": 1590
},
{
"entropy": 1.3565202325582504,
"epoch": 0.35498363747296025,
"grad_norm": 0.53515625,
"learning_rate": 3.226486246672582e-05,
"loss": 0.968,
"mean_token_accuracy": 0.7509596891701221,
"num_tokens": 150782722.0,
"step": 1600
},
{
"entropy": 1.3689987510442734,
"epoch": 0.35720228520716624,
"grad_norm": 0.53515625,
"learning_rate": 3.215394853593611e-05,
"loss": 0.9624,
"mean_token_accuracy": 0.7504870064556599,
"num_tokens": 151727765.0,
"step": 1610
},
{
"entropy": 1.379437492787838,
"epoch": 0.35942093294137223,
"grad_norm": 0.56640625,
"learning_rate": 3.204303460514641e-05,
"loss": 0.9932,
"mean_token_accuracy": 0.7445692121982574,
"num_tokens": 152665685.0,
"step": 1620
},
{
"entropy": 1.3387732088565827,
"epoch": 0.3616395806755782,
"grad_norm": 0.5234375,
"learning_rate": 3.19321206743567e-05,
"loss": 0.9236,
"mean_token_accuracy": 0.7576431512832642,
"num_tokens": 153588690.0,
"step": 1630
},
{
"entropy": 1.3826099798083304,
"epoch": 0.3638582284097842,
"grad_norm": 0.54296875,
"learning_rate": 3.1821206743566994e-05,
"loss": 0.9605,
"mean_token_accuracy": 0.7498526185750961,
"num_tokens": 154534943.0,
"step": 1640
},
{
"entropy": 1.3945626512169838,
"epoch": 0.36607687614399026,
"grad_norm": 0.56640625,
"learning_rate": 3.171029281277729e-05,
"loss": 0.9766,
"mean_token_accuracy": 0.7471479557454586,
"num_tokens": 155476773.0,
"step": 1650
},
{
"entropy": 1.3412572763860227,
"epoch": 0.36829552387819625,
"grad_norm": 0.5390625,
"learning_rate": 3.159937888198758e-05,
"loss": 0.9292,
"mean_token_accuracy": 0.7570768728852272,
"num_tokens": 156445013.0,
"step": 1660
},
{
"entropy": 1.40811278373003,
"epoch": 0.37051417161240224,
"grad_norm": 0.56640625,
"learning_rate": 3.148846495119787e-05,
"loss": 1.0066,
"mean_token_accuracy": 0.7419991612434387,
"num_tokens": 157379214.0,
"step": 1670
},
{
"entropy": 1.3919242292642593,
"epoch": 0.37273281934660824,
"grad_norm": 0.5390625,
"learning_rate": 3.137755102040816e-05,
"loss": 0.9923,
"mean_token_accuracy": 0.7452871352434158,
"num_tokens": 158317725.0,
"step": 1680
},
{
"entropy": 1.3682388715445994,
"epoch": 0.3749514670808142,
"grad_norm": 0.5234375,
"learning_rate": 3.1266637089618455e-05,
"loss": 0.9562,
"mean_token_accuracy": 0.752392964810133,
"num_tokens": 159245900.0,
"step": 1690
},
{
"entropy": 1.3978073075413704,
"epoch": 0.3771701148150202,
"grad_norm": 0.59375,
"learning_rate": 3.115572315882875e-05,
"loss": 0.9959,
"mean_token_accuracy": 0.7438707917928695,
"num_tokens": 160206241.0,
"step": 1700
},
{
"entropy": 1.4060526877641677,
"epoch": 0.37938876254922627,
"grad_norm": 0.57421875,
"learning_rate": 3.1044809228039046e-05,
"loss": 0.9784,
"mean_token_accuracy": 0.7466170206665993,
"num_tokens": 161122737.0,
"step": 1710
},
{
"entropy": 1.4011815950274467,
"epoch": 0.38160741028343226,
"grad_norm": 0.54296875,
"learning_rate": 3.093389529724934e-05,
"loss": 1.0119,
"mean_token_accuracy": 0.7434992685914039,
"num_tokens": 162060602.0,
"step": 1720
},
{
"entropy": 1.3772536285221577,
"epoch": 0.38382605801763825,
"grad_norm": 0.55859375,
"learning_rate": 3.082298136645963e-05,
"loss": 0.9844,
"mean_token_accuracy": 0.7481080301105976,
"num_tokens": 162999081.0,
"step": 1730
},
{
"entropy": 1.3987220972776413,
"epoch": 0.38604470575184424,
"grad_norm": 0.5625,
"learning_rate": 3.071206743566992e-05,
"loss": 1.0022,
"mean_token_accuracy": 0.7418422900140286,
"num_tokens": 163922873.0,
"step": 1740
},
{
"entropy": 1.3580266810953616,
"epoch": 0.38826335348605023,
"grad_norm": 0.53515625,
"learning_rate": 3.0601153504880215e-05,
"loss": 0.9563,
"mean_token_accuracy": 0.752074807882309,
"num_tokens": 164870247.0,
"step": 1750
},
{
"entropy": 1.3677964322268963,
"epoch": 0.3904820012202563,
"grad_norm": 0.51953125,
"learning_rate": 3.0490239574090507e-05,
"loss": 0.9511,
"mean_token_accuracy": 0.7535176068544388,
"num_tokens": 165824528.0,
"step": 1760
},
{
"entropy": 1.3590489372611045,
"epoch": 0.3927006489544623,
"grad_norm": 0.54296875,
"learning_rate": 3.03793256433008e-05,
"loss": 0.9561,
"mean_token_accuracy": 0.7521475218236446,
"num_tokens": 166773198.0,
"step": 1770
},
{
"entropy": 1.339786247909069,
"epoch": 0.39491929668866826,
"grad_norm": 0.5078125,
"learning_rate": 3.026841171251109e-05,
"loss": 0.9227,
"mean_token_accuracy": 0.7592316955327988,
"num_tokens": 167718580.0,
"step": 1780
},
{
"entropy": 1.3726042732596397,
"epoch": 0.39713794442287426,
"grad_norm": 0.55859375,
"learning_rate": 3.0157497781721383e-05,
"loss": 0.99,
"mean_token_accuracy": 0.7463804952800274,
"num_tokens": 168655387.0,
"step": 1790
},
{
"entropy": 1.3457361325621604,
"epoch": 0.39935659215708025,
"grad_norm": 0.55078125,
"learning_rate": 3.0046583850931682e-05,
"loss": 0.9287,
"mean_token_accuracy": 0.7580367386341095,
"num_tokens": 169603547.0,
"step": 1800
},
{
"entropy": 1.3527330666780473,
"epoch": 0.40157523989128624,
"grad_norm": 0.55078125,
"learning_rate": 2.9935669920141974e-05,
"loss": 0.9564,
"mean_token_accuracy": 0.7514573320746422,
"num_tokens": 170533507.0,
"step": 1810
},
{
"entropy": 1.3654260367155076,
"epoch": 0.4037938876254923,
"grad_norm": 0.5546875,
"learning_rate": 2.9824755989352266e-05,
"loss": 0.9561,
"mean_token_accuracy": 0.7531027749180794,
"num_tokens": 171483258.0,
"step": 1820
},
{
"entropy": 1.4081357181072236,
"epoch": 0.4060125353596983,
"grad_norm": 0.51953125,
"learning_rate": 2.971384205856256e-05,
"loss": 0.9983,
"mean_token_accuracy": 0.7425357937812805,
"num_tokens": 172403233.0,
"step": 1830
},
{
"entropy": 1.389841765165329,
"epoch": 0.40823118309390427,
"grad_norm": 0.546875,
"learning_rate": 2.960292812777285e-05,
"loss": 0.968,
"mean_token_accuracy": 0.7487305231392384,
"num_tokens": 173339638.0,
"step": 1840
},
{
"entropy": 1.3511977650225162,
"epoch": 0.41044983082811026,
"grad_norm": 0.5625,
"learning_rate": 2.9492014196983143e-05,
"loss": 0.9522,
"mean_token_accuracy": 0.7524490259587765,
"num_tokens": 174277349.0,
"step": 1850
},
{
"entropy": 1.370618349313736,
"epoch": 0.41266847856231625,
"grad_norm": 0.5390625,
"learning_rate": 2.9381100266193435e-05,
"loss": 0.9907,
"mean_token_accuracy": 0.7455039098858833,
"num_tokens": 175210470.0,
"step": 1860
},
{
"entropy": 1.375410833209753,
"epoch": 0.41488712629652225,
"grad_norm": 0.59375,
"learning_rate": 2.9270186335403727e-05,
"loss": 0.9642,
"mean_token_accuracy": 0.7496527746319771,
"num_tokens": 176159361.0,
"step": 1870
},
{
"entropy": 1.4184004172682763,
"epoch": 0.4171057740307283,
"grad_norm": 0.55078125,
"learning_rate": 2.915927240461402e-05,
"loss": 0.9773,
"mean_token_accuracy": 0.7471778780221939,
"num_tokens": 177113588.0,
"step": 1880
},
{
"entropy": 1.371988333016634,
"epoch": 0.4193244217649343,
"grad_norm": 0.60546875,
"learning_rate": 2.9048358473824318e-05,
"loss": 0.9657,
"mean_token_accuracy": 0.7511657826602459,
"num_tokens": 178060888.0,
"step": 1890
},
{
"entropy": 1.3363316491246224,
"epoch": 0.4215430694991403,
"grad_norm": 0.52734375,
"learning_rate": 2.893744454303461e-05,
"loss": 0.9525,
"mean_token_accuracy": 0.7519229985773563,
"num_tokens": 179031885.0,
"step": 1900
},
{
"entropy": 1.3726731419563294,
"epoch": 0.42376171723334627,
"grad_norm": 0.51953125,
"learning_rate": 2.8826530612244902e-05,
"loss": 0.9915,
"mean_token_accuracy": 0.744737395644188,
"num_tokens": 179972132.0,
"step": 1910
},
{
"entropy": 1.3594248294830322,
"epoch": 0.42598036496755226,
"grad_norm": 0.609375,
"learning_rate": 2.8715616681455194e-05,
"loss": 0.9348,
"mean_token_accuracy": 0.7559118025004864,
"num_tokens": 180897094.0,
"step": 1920
},
{
"entropy": 1.362018422782421,
"epoch": 0.42819901270175825,
"grad_norm": 0.5390625,
"learning_rate": 2.8604702750665487e-05,
"loss": 0.9602,
"mean_token_accuracy": 0.752437824010849,
"num_tokens": 181838585.0,
"step": 1930
},
{
"entropy": 1.3808824971318245,
"epoch": 0.4304176604359643,
"grad_norm": 0.48828125,
"learning_rate": 2.849378881987578e-05,
"loss": 0.9584,
"mean_token_accuracy": 0.7506703034043312,
"num_tokens": 182803310.0,
"step": 1940
},
{
"entropy": 1.3881346195936204,
"epoch": 0.4326363081701703,
"grad_norm": 0.5234375,
"learning_rate": 2.838287488908607e-05,
"loss": 0.9875,
"mean_token_accuracy": 0.74772829413414,
"num_tokens": 183738214.0,
"step": 1950
},
{
"entropy": 1.3855524227023124,
"epoch": 0.4348549559043763,
"grad_norm": 0.58984375,
"learning_rate": 2.8271960958296363e-05,
"loss": 0.9521,
"mean_token_accuracy": 0.7537846647202968,
"num_tokens": 184688269.0,
"step": 1960
},
{
"entropy": 1.3399414360523223,
"epoch": 0.4370736036385823,
"grad_norm": 0.5546875,
"learning_rate": 2.8161047027506655e-05,
"loss": 0.9376,
"mean_token_accuracy": 0.7547785393893719,
"num_tokens": 185645274.0,
"step": 1970
},
{
"entropy": 1.3971083626151084,
"epoch": 0.43929225137278827,
"grad_norm": 0.56640625,
"learning_rate": 2.8050133096716947e-05,
"loss": 0.9953,
"mean_token_accuracy": 0.7458565980195999,
"num_tokens": 186569593.0,
"step": 1980
},
{
"entropy": 1.3322325393557548,
"epoch": 0.4415108991069943,
"grad_norm": 0.52734375,
"learning_rate": 2.7939219165927243e-05,
"loss": 0.9555,
"mean_token_accuracy": 0.7513496160507203,
"num_tokens": 187496284.0,
"step": 1990
},
{
"entropy": 1.3293438203632832,
"epoch": 0.4437295468412003,
"grad_norm": 0.50390625,
"learning_rate": 2.7828305235137535e-05,
"loss": 0.9171,
"mean_token_accuracy": 0.7596317879855633,
"num_tokens": 188468895.0,
"step": 2000
},
{
"entropy": 1.3781484201550485,
"epoch": 0.4459481945754063,
"grad_norm": 0.5703125,
"learning_rate": 2.7717391304347827e-05,
"loss": 0.973,
"mean_token_accuracy": 0.7494061894714832,
"num_tokens": 189421874.0,
"step": 2010
},
{
"entropy": 1.3695954069495202,
"epoch": 0.4481668423096123,
"grad_norm": 0.53125,
"learning_rate": 2.760647737355812e-05,
"loss": 0.9614,
"mean_token_accuracy": 0.7509508669376374,
"num_tokens": 190340227.0,
"step": 2020
},
{
"entropy": 1.3875800400972367,
"epoch": 0.4503854900438183,
"grad_norm": 0.546875,
"learning_rate": 2.749556344276841e-05,
"loss": 0.994,
"mean_token_accuracy": 0.7431605853140354,
"num_tokens": 191305091.0,
"step": 2030
},
{
"entropy": 1.3755045652389526,
"epoch": 0.4526041377780243,
"grad_norm": 0.52734375,
"learning_rate": 2.7384649511978703e-05,
"loss": 0.9649,
"mean_token_accuracy": 0.7511213339865208,
"num_tokens": 192292813.0,
"step": 2040
},
{
"entropy": 1.3822910636663437,
"epoch": 0.4548227855122303,
"grad_norm": 0.5546875,
"learning_rate": 2.7273735581188996e-05,
"loss": 0.9573,
"mean_token_accuracy": 0.7524046942591667,
"num_tokens": 193217411.0,
"step": 2050
},
{
"entropy": 1.3644483625888824,
"epoch": 0.4570414332464363,
"grad_norm": 0.5625,
"learning_rate": 2.7162821650399288e-05,
"loss": 0.9715,
"mean_token_accuracy": 0.7478004738688468,
"num_tokens": 194156737.0,
"step": 2060
},
{
"entropy": 1.3972303479909898,
"epoch": 0.4592600809806423,
"grad_norm": 0.6015625,
"learning_rate": 2.7051907719609583e-05,
"loss": 0.9795,
"mean_token_accuracy": 0.7456590063869953,
"num_tokens": 195099008.0,
"step": 2070
},
{
"entropy": 1.3703369855880738,
"epoch": 0.4614787287148483,
"grad_norm": 0.5546875,
"learning_rate": 2.694099378881988e-05,
"loss": 0.9714,
"mean_token_accuracy": 0.7501253761351109,
"num_tokens": 196007058.0,
"step": 2080
},
{
"entropy": 1.339685134589672,
"epoch": 0.4636973764490543,
"grad_norm": 0.56640625,
"learning_rate": 2.683007985803017e-05,
"loss": 0.9191,
"mean_token_accuracy": 0.7610551118850708,
"num_tokens": 196927119.0,
"step": 2090
},
{
"entropy": 1.3603023558855056,
"epoch": 0.4659160241832603,
"grad_norm": 1.1953125,
"learning_rate": 2.6719165927240463e-05,
"loss": 0.9522,
"mean_token_accuracy": 0.75257783010602,
"num_tokens": 197839234.0,
"step": 2100
},
{
"entropy": 1.3676279373466969,
"epoch": 0.4681346719174663,
"grad_norm": 0.578125,
"learning_rate": 2.6608251996450755e-05,
"loss": 0.9579,
"mean_token_accuracy": 0.7518479220569134,
"num_tokens": 198780897.0,
"step": 2110
},
{
"entropy": 1.3504170298576355,
"epoch": 0.4703533196516723,
"grad_norm": 0.578125,
"learning_rate": 2.6497338065661047e-05,
"loss": 0.92,
"mean_token_accuracy": 0.7589939460158348,
"num_tokens": 199720325.0,
"step": 2120
},
{
"entropy": 1.3881437584757805,
"epoch": 0.4725719673858783,
"grad_norm": 0.58203125,
"learning_rate": 2.638642413487134e-05,
"loss": 0.9739,
"mean_token_accuracy": 0.7481762118637562,
"num_tokens": 200688333.0,
"step": 2130
},
{
"entropy": 1.330506893992424,
"epoch": 0.4747906151200843,
"grad_norm": 0.546875,
"learning_rate": 2.627551020408163e-05,
"loss": 0.9364,
"mean_token_accuracy": 0.7579016864299775,
"num_tokens": 201637839.0,
"step": 2140
},
{
"entropy": 1.3658654704689979,
"epoch": 0.4770092628542903,
"grad_norm": 0.5546875,
"learning_rate": 2.6164596273291924e-05,
"loss": 0.9634,
"mean_token_accuracy": 0.7504187069833279,
"num_tokens": 202576401.0,
"step": 2150
},
{
"entropy": 1.3995375514030457,
"epoch": 0.4792279105884963,
"grad_norm": 0.55859375,
"learning_rate": 2.6053682342502216e-05,
"loss": 0.9965,
"mean_token_accuracy": 0.7445818439126015,
"num_tokens": 203487024.0,
"step": 2160
},
{
"entropy": 1.3725049093365669,
"epoch": 0.48144655832270233,
"grad_norm": 0.57421875,
"learning_rate": 2.5942768411712515e-05,
"loss": 0.9864,
"mean_token_accuracy": 0.7470806054770947,
"num_tokens": 204381436.0,
"step": 2170
},
{
"entropy": 1.394498337805271,
"epoch": 0.4836652060569083,
"grad_norm": 0.578125,
"learning_rate": 2.5831854480922807e-05,
"loss": 1.0076,
"mean_token_accuracy": 0.7424398958683014,
"num_tokens": 205293197.0,
"step": 2180
},
{
"entropy": 1.347807565331459,
"epoch": 0.4858838537911143,
"grad_norm": 0.5234375,
"learning_rate": 2.57209405501331e-05,
"loss": 0.9339,
"mean_token_accuracy": 0.755316337198019,
"num_tokens": 206231536.0,
"step": 2190
},
{
"entropy": 1.3778870403766632,
"epoch": 0.4881025015253203,
"grad_norm": 0.56640625,
"learning_rate": 2.561002661934339e-05,
"loss": 0.9378,
"mean_token_accuracy": 0.7550853170454502,
"num_tokens": 207184815.0,
"step": 2200
},
{
"entropy": 1.3568516939878463,
"epoch": 0.4903211492595263,
"grad_norm": 0.546875,
"learning_rate": 2.5499112688553683e-05,
"loss": 0.9557,
"mean_token_accuracy": 0.75401069521904,
"num_tokens": 208171394.0,
"step": 2210
},
{
"entropy": 1.366741893440485,
"epoch": 0.4925397969937323,
"grad_norm": 0.5546875,
"learning_rate": 2.5388198757763975e-05,
"loss": 0.9875,
"mean_token_accuracy": 0.7449213482439518,
"num_tokens": 209122216.0,
"step": 2220
},
{
"entropy": 1.3530812025070191,
"epoch": 0.49475844472793834,
"grad_norm": 0.54296875,
"learning_rate": 2.5277284826974267e-05,
"loss": 0.9549,
"mean_token_accuracy": 0.7526767641305924,
"num_tokens": 210056877.0,
"step": 2230
},
{
"entropy": 1.3858793810009957,
"epoch": 0.49697709246214433,
"grad_norm": 0.5625,
"learning_rate": 2.516637089618456e-05,
"loss": 0.9739,
"mean_token_accuracy": 0.7475887909531593,
"num_tokens": 210991604.0,
"step": 2240
},
{
"entropy": 1.3336512438952923,
"epoch": 0.4991957401963503,
"grad_norm": 0.53125,
"learning_rate": 2.5055456965394852e-05,
"loss": 0.9656,
"mean_token_accuracy": 0.7508934259414672,
"num_tokens": 211969946.0,
"step": 2250
},
{
"entropy": 1.3388653613626957,
"epoch": 0.5014143879305564,
"grad_norm": 0.50390625,
"learning_rate": 2.4944543034605147e-05,
"loss": 0.9543,
"mean_token_accuracy": 0.7524459935724735,
"num_tokens": 212910816.0,
"step": 2260
},
{
"entropy": 1.3453195527195931,
"epoch": 0.5036330356647624,
"grad_norm": 0.5,
"learning_rate": 2.483362910381544e-05,
"loss": 0.9375,
"mean_token_accuracy": 0.7574634417891503,
"num_tokens": 213850669.0,
"step": 2270
},
{
"entropy": 1.379884372651577,
"epoch": 0.5058516833989684,
"grad_norm": 0.53125,
"learning_rate": 2.4722715173025735e-05,
"loss": 0.9684,
"mean_token_accuracy": 0.7486192204058171,
"num_tokens": 214804067.0,
"step": 2280
},
{
"entropy": 1.3893992975354195,
"epoch": 0.5080703311331743,
"grad_norm": 0.5625,
"learning_rate": 2.4611801242236027e-05,
"loss": 0.9918,
"mean_token_accuracy": 0.7460889652371406,
"num_tokens": 215757019.0,
"step": 2290
},
{
"entropy": 1.3814901292324067,
"epoch": 0.5102889788673803,
"grad_norm": 0.5703125,
"learning_rate": 2.450088731144632e-05,
"loss": 0.9704,
"mean_token_accuracy": 0.7471752442419529,
"num_tokens": 216694493.0,
"step": 2300
},
{
"entropy": 1.3929108276963234,
"epoch": 0.5125076266015863,
"grad_norm": 0.86328125,
"learning_rate": 2.438997338065661e-05,
"loss": 0.9768,
"mean_token_accuracy": 0.7484888419508934,
"num_tokens": 217602175.0,
"step": 2310
},
{
"entropy": 1.397246466577053,
"epoch": 0.5147262743357923,
"grad_norm": 0.57421875,
"learning_rate": 2.4279059449866903e-05,
"loss": 0.9896,
"mean_token_accuracy": 0.7446176953613758,
"num_tokens": 218550783.0,
"step": 2320
},
{
"entropy": 1.3812805399298669,
"epoch": 0.5169449220699983,
"grad_norm": 0.5390625,
"learning_rate": 2.41681455190772e-05,
"loss": 0.9568,
"mean_token_accuracy": 0.7516316212713718,
"num_tokens": 219509393.0,
"step": 2330
},
{
"entropy": 1.3913217656314374,
"epoch": 0.5191635698042043,
"grad_norm": 0.55078125,
"learning_rate": 2.405723158828749e-05,
"loss": 0.994,
"mean_token_accuracy": 0.7467503845691681,
"num_tokens": 220442797.0,
"step": 2340
},
{
"entropy": 1.366735403239727,
"epoch": 0.5213822175384103,
"grad_norm": 0.54296875,
"learning_rate": 2.3946317657497783e-05,
"loss": 0.9649,
"mean_token_accuracy": 0.7511637844145298,
"num_tokens": 221403315.0,
"step": 2350
},
{
"entropy": 1.3902854323387146,
"epoch": 0.5236008652726163,
"grad_norm": 0.578125,
"learning_rate": 2.3835403726708075e-05,
"loss": 0.9796,
"mean_token_accuracy": 0.7477660529315472,
"num_tokens": 222332544.0,
"step": 2360
},
{
"entropy": 1.372003583610058,
"epoch": 0.5258195130068224,
"grad_norm": 0.58984375,
"learning_rate": 2.372448979591837e-05,
"loss": 0.9539,
"mean_token_accuracy": 0.7518885858356953,
"num_tokens": 223241356.0,
"step": 2370
},
{
"entropy": 1.3928717270493507,
"epoch": 0.5280381607410284,
"grad_norm": 0.5546875,
"learning_rate": 2.3613575865128663e-05,
"loss": 0.9886,
"mean_token_accuracy": 0.7441101655364036,
"num_tokens": 224188072.0,
"step": 2380
},
{
"entropy": 1.3675744011998177,
"epoch": 0.5302568084752344,
"grad_norm": 0.5859375,
"learning_rate": 2.3502661934338955e-05,
"loss": 0.9666,
"mean_token_accuracy": 0.7499430425465107,
"num_tokens": 225139376.0,
"step": 2390
},
{
"entropy": 1.366236688196659,
"epoch": 0.5324754562094404,
"grad_norm": 0.53125,
"learning_rate": 2.3391748003549247e-05,
"loss": 0.9545,
"mean_token_accuracy": 0.7533385291695595,
"num_tokens": 226081728.0,
"step": 2400
},
{
"entropy": 1.3825654938817025,
"epoch": 0.5346941039436464,
"grad_norm": 0.52734375,
"learning_rate": 2.328083407275954e-05,
"loss": 0.9758,
"mean_token_accuracy": 0.7503654226660729,
"num_tokens": 227039009.0,
"step": 2410
},
{
"entropy": 1.3630353569984437,
"epoch": 0.5369127516778524,
"grad_norm": 0.5390625,
"learning_rate": 2.3169920141969835e-05,
"loss": 0.9648,
"mean_token_accuracy": 0.7523718543350697,
"num_tokens": 227995365.0,
"step": 2420
},
{
"entropy": 1.3738336831331253,
"epoch": 0.5391313994120583,
"grad_norm": 0.5625,
"learning_rate": 2.3059006211180127e-05,
"loss": 0.9594,
"mean_token_accuracy": 0.7517461970448494,
"num_tokens": 228942729.0,
"step": 2430
},
{
"entropy": 1.3495117351412773,
"epoch": 0.5413500471462643,
"grad_norm": 0.56640625,
"learning_rate": 2.294809228039042e-05,
"loss": 0.9208,
"mean_token_accuracy": 0.7615052901208401,
"num_tokens": 229900137.0,
"step": 2440
},
{
"entropy": 1.3656693696975708,
"epoch": 0.5435686948804703,
"grad_norm": 0.56640625,
"learning_rate": 2.283717834960071e-05,
"loss": 0.9265,
"mean_token_accuracy": 0.7582555040717125,
"num_tokens": 230839638.0,
"step": 2450
},
{
"entropy": 1.359101416170597,
"epoch": 0.5457873426146763,
"grad_norm": 0.52734375,
"learning_rate": 2.2726264418811003e-05,
"loss": 0.946,
"mean_token_accuracy": 0.7545076720416546,
"num_tokens": 231784568.0,
"step": 2460
},
{
"entropy": 1.3754738956689834,
"epoch": 0.5480059903488823,
"grad_norm": 0.58203125,
"learning_rate": 2.26153504880213e-05,
"loss": 0.9498,
"mean_token_accuracy": 0.7523327447474003,
"num_tokens": 232706550.0,
"step": 2470
},
{
"entropy": 1.3724554181098938,
"epoch": 0.5502246380830884,
"grad_norm": 0.52734375,
"learning_rate": 2.250443655723159e-05,
"loss": 0.9766,
"mean_token_accuracy": 0.7489859662950039,
"num_tokens": 233663364.0,
"step": 2480
},
{
"entropy": 1.3810199111700059,
"epoch": 0.5524432858172944,
"grad_norm": 0.56640625,
"learning_rate": 2.2393522626441883e-05,
"loss": 0.9506,
"mean_token_accuracy": 0.7534161373972893,
"num_tokens": 234627455.0,
"step": 2490
},
{
"entropy": 1.4006718143820762,
"epoch": 0.5546619335515004,
"grad_norm": 0.56640625,
"learning_rate": 2.2282608695652175e-05,
"loss": 0.9935,
"mean_token_accuracy": 0.7439345620572567,
"num_tokens": 235567024.0,
"step": 2500
},
{
"entropy": 1.383282570540905,
"epoch": 0.5568805812857064,
"grad_norm": 0.5546875,
"learning_rate": 2.2171694764862467e-05,
"loss": 0.9472,
"mean_token_accuracy": 0.7532580479979515,
"num_tokens": 236531235.0,
"step": 2510
},
{
"entropy": 1.3930965930223465,
"epoch": 0.5590992290199124,
"grad_norm": 0.5703125,
"learning_rate": 2.206078083407276e-05,
"loss": 0.982,
"mean_token_accuracy": 0.7469352826476097,
"num_tokens": 237448605.0,
"step": 2520
},
{
"entropy": 1.3952334612607955,
"epoch": 0.5613178767541184,
"grad_norm": 0.58984375,
"learning_rate": 2.1949866903283052e-05,
"loss": 1.0024,
"mean_token_accuracy": 0.7422742739319801,
"num_tokens": 238389157.0,
"step": 2530
},
{
"entropy": 1.3666514441370965,
"epoch": 0.5635365244883244,
"grad_norm": 0.55859375,
"learning_rate": 2.1838952972493347e-05,
"loss": 0.9431,
"mean_token_accuracy": 0.7566322214901448,
"num_tokens": 239312016.0,
"step": 2540
},
{
"entropy": 1.40639336258173,
"epoch": 0.5657551722225304,
"grad_norm": 0.5390625,
"learning_rate": 2.172803904170364e-05,
"loss": 0.9865,
"mean_token_accuracy": 0.7460080161690712,
"num_tokens": 240216908.0,
"step": 2550
},
{
"entropy": 1.3294718250632287,
"epoch": 0.5679738199567363,
"grad_norm": 0.5546875,
"learning_rate": 2.161712511091393e-05,
"loss": 0.949,
"mean_token_accuracy": 0.7551594816148282,
"num_tokens": 241183984.0,
"step": 2560
},
{
"entropy": 1.380000075697899,
"epoch": 0.5701924676909423,
"grad_norm": 0.55078125,
"learning_rate": 2.1506211180124224e-05,
"loss": 0.9684,
"mean_token_accuracy": 0.7464251570403576,
"num_tokens": 242123855.0,
"step": 2570
},
{
"entropy": 1.3699100747704507,
"epoch": 0.5724111154251483,
"grad_norm": 0.53515625,
"learning_rate": 2.1395297249334516e-05,
"loss": 0.9714,
"mean_token_accuracy": 0.7494775131344795,
"num_tokens": 243057797.0,
"step": 2580
},
{
"entropy": 1.3705684199929238,
"epoch": 0.5746297631593543,
"grad_norm": 0.56640625,
"learning_rate": 2.1284383318544808e-05,
"loss": 0.9641,
"mean_token_accuracy": 0.7521654039621353,
"num_tokens": 244025358.0,
"step": 2590
},
{
"entropy": 1.361481635272503,
"epoch": 0.5768484108935604,
"grad_norm": 0.53515625,
"learning_rate": 2.1173469387755103e-05,
"loss": 0.9685,
"mean_token_accuracy": 0.7504465833306313,
"num_tokens": 244971950.0,
"step": 2600
},
{
"entropy": 1.3585113763809205,
"epoch": 0.5790670586277664,
"grad_norm": 0.55859375,
"learning_rate": 2.1062555456965396e-05,
"loss": 0.9401,
"mean_token_accuracy": 0.75314856544137,
"num_tokens": 245902595.0,
"step": 2610
},
{
"entropy": 1.3520452484488488,
"epoch": 0.5812857063619724,
"grad_norm": 0.5234375,
"learning_rate": 2.0951641526175688e-05,
"loss": 0.9586,
"mean_token_accuracy": 0.7528336457908154,
"num_tokens": 246843571.0,
"step": 2620
},
{
"entropy": 1.3962681278586389,
"epoch": 0.5835043540961784,
"grad_norm": 0.5390625,
"learning_rate": 2.084072759538598e-05,
"loss": 0.9619,
"mean_token_accuracy": 0.7511408895254135,
"num_tokens": 247787481.0,
"step": 2630
},
{
"entropy": 1.3641357719898224,
"epoch": 0.5857230018303844,
"grad_norm": 0.55078125,
"learning_rate": 2.0729813664596272e-05,
"loss": 0.9681,
"mean_token_accuracy": 0.7530590400099755,
"num_tokens": 248753372.0,
"step": 2640
},
{
"entropy": 1.3867824390530585,
"epoch": 0.5879416495645904,
"grad_norm": 0.5234375,
"learning_rate": 2.0618899733806567e-05,
"loss": 0.9718,
"mean_token_accuracy": 0.7493688210844993,
"num_tokens": 249707740.0,
"step": 2650
},
{
"entropy": 1.3566410467028618,
"epoch": 0.5901602972987964,
"grad_norm": 0.5234375,
"learning_rate": 2.050798580301686e-05,
"loss": 0.9481,
"mean_token_accuracy": 0.7530547261238099,
"num_tokens": 250668531.0,
"step": 2660
},
{
"entropy": 1.419162317365408,
"epoch": 0.5923789450330024,
"grad_norm": 0.54296875,
"learning_rate": 2.0397071872227152e-05,
"loss": 0.9736,
"mean_token_accuracy": 0.7478901363909245,
"num_tokens": 251574090.0,
"step": 2670
},
{
"entropy": 1.389479933679104,
"epoch": 0.5945975927672084,
"grad_norm": 0.5546875,
"learning_rate": 2.0286157941437444e-05,
"loss": 0.9992,
"mean_token_accuracy": 0.7439706973731518,
"num_tokens": 252535111.0,
"step": 2680
},
{
"entropy": 1.3280567415058613,
"epoch": 0.5968162405014144,
"grad_norm": 0.5703125,
"learning_rate": 2.0175244010647736e-05,
"loss": 0.905,
"mean_token_accuracy": 0.765102332830429,
"num_tokens": 253477803.0,
"step": 2690
},
{
"entropy": 1.4039628729224205,
"epoch": 0.5990348882356203,
"grad_norm": 0.57421875,
"learning_rate": 2.006433007985803e-05,
"loss": 0.9624,
"mean_token_accuracy": 0.7520765975117684,
"num_tokens": 254414330.0,
"step": 2700
},
{
"entropy": 1.3595366537570954,
"epoch": 0.6012535359698263,
"grad_norm": 0.515625,
"learning_rate": 1.9953416149068324e-05,
"loss": 0.9501,
"mean_token_accuracy": 0.7547135911881924,
"num_tokens": 255359441.0,
"step": 2710
},
{
"entropy": 1.3837119027972222,
"epoch": 0.6034721837040324,
"grad_norm": 0.58203125,
"learning_rate": 1.9842502218278616e-05,
"loss": 0.9679,
"mean_token_accuracy": 0.7504067279398441,
"num_tokens": 256293391.0,
"step": 2720
},
{
"entropy": 1.3583301618695258,
"epoch": 0.6056908314382384,
"grad_norm": 0.54296875,
"learning_rate": 1.9731588287488908e-05,
"loss": 0.9265,
"mean_token_accuracy": 0.7575979977846146,
"num_tokens": 257255291.0,
"step": 2730
},
{
"entropy": 1.3321390345692634,
"epoch": 0.6079094791724444,
"grad_norm": 0.53515625,
"learning_rate": 1.9620674356699203e-05,
"loss": 0.9417,
"mean_token_accuracy": 0.7558345906436443,
"num_tokens": 258216217.0,
"step": 2740
},
{
"entropy": 1.3556917786598206,
"epoch": 0.6101281269066504,
"grad_norm": 0.53515625,
"learning_rate": 1.9509760425909496e-05,
"loss": 0.9539,
"mean_token_accuracy": 0.7550654023885727,
"num_tokens": 259178609.0,
"step": 2750
},
{
"entropy": 1.3814320512115956,
"epoch": 0.6123467746408564,
"grad_norm": 0.515625,
"learning_rate": 1.9398846495119788e-05,
"loss": 0.9412,
"mean_token_accuracy": 0.757171281427145,
"num_tokens": 260110804.0,
"step": 2760
},
{
"entropy": 1.375185413658619,
"epoch": 0.6145654223750624,
"grad_norm": 0.66015625,
"learning_rate": 1.928793256433008e-05,
"loss": 0.9697,
"mean_token_accuracy": 0.7497281424701214,
"num_tokens": 261028443.0,
"step": 2770
},
{
"entropy": 1.37678205370903,
"epoch": 0.6167840701092684,
"grad_norm": 0.5703125,
"learning_rate": 1.9177018633540372e-05,
"loss": 0.9696,
"mean_token_accuracy": 0.7474402152001858,
"num_tokens": 261952317.0,
"step": 2780
},
{
"entropy": 1.3688176065683364,
"epoch": 0.6190027178434744,
"grad_norm": 0.5390625,
"learning_rate": 1.9066104702750667e-05,
"loss": 0.973,
"mean_token_accuracy": 0.7485333941876888,
"num_tokens": 262897797.0,
"step": 2790
},
{
"entropy": 1.3436351254582406,
"epoch": 0.6212213655776804,
"grad_norm": 0.52734375,
"learning_rate": 1.895519077196096e-05,
"loss": 0.939,
"mean_token_accuracy": 0.755128963291645,
"num_tokens": 263844200.0,
"step": 2800
},
{
"entropy": 1.3590498827397823,
"epoch": 0.6234400133118864,
"grad_norm": 0.57421875,
"learning_rate": 1.8844276841171252e-05,
"loss": 0.9068,
"mean_token_accuracy": 0.7598929911851883,
"num_tokens": 264775127.0,
"step": 2810
},
{
"entropy": 1.3578249305486678,
"epoch": 0.6256586610460924,
"grad_norm": 0.53515625,
"learning_rate": 1.8733362910381544e-05,
"loss": 0.9365,
"mean_token_accuracy": 0.7524393565952778,
"num_tokens": 265710700.0,
"step": 2820
},
{
"entropy": 1.3826695740222932,
"epoch": 0.6278773087802985,
"grad_norm": 0.546875,
"learning_rate": 1.862244897959184e-05,
"loss": 0.9781,
"mean_token_accuracy": 0.7476157076656819,
"num_tokens": 266636699.0,
"step": 2830
},
{
"entropy": 1.3442816585302353,
"epoch": 0.6300959565145045,
"grad_norm": 0.50390625,
"learning_rate": 1.851153504880213e-05,
"loss": 0.9354,
"mean_token_accuracy": 0.756941570341587,
"num_tokens": 267573793.0,
"step": 2840
},
{
"entropy": 1.3743248209357262,
"epoch": 0.6323146042487104,
"grad_norm": 0.515625,
"learning_rate": 1.8400621118012424e-05,
"loss": 0.9682,
"mean_token_accuracy": 0.7508407726883888,
"num_tokens": 268507577.0,
"step": 2850
},
{
"entropy": 1.3407793439924718,
"epoch": 0.6345332519829164,
"grad_norm": 0.5390625,
"learning_rate": 1.8289707187222716e-05,
"loss": 0.9353,
"mean_token_accuracy": 0.7562331147491932,
"num_tokens": 269452816.0,
"step": 2860
},
{
"entropy": 1.3617188811302186,
"epoch": 0.6367518997171224,
"grad_norm": 0.515625,
"learning_rate": 1.8178793256433008e-05,
"loss": 0.9456,
"mean_token_accuracy": 0.7551380828022957,
"num_tokens": 270388441.0,
"step": 2870
},
{
"entropy": 1.3776611492037774,
"epoch": 0.6389705474513284,
"grad_norm": 0.6171875,
"learning_rate": 1.8067879325643303e-05,
"loss": 0.9629,
"mean_token_accuracy": 0.7524656720459462,
"num_tokens": 271318970.0,
"step": 2880
},
{
"entropy": 1.4048678979277611,
"epoch": 0.6411891951855344,
"grad_norm": 0.53125,
"learning_rate": 1.7956965394853596e-05,
"loss": 0.9939,
"mean_token_accuracy": 0.7458176657557487,
"num_tokens": 272247913.0,
"step": 2890
},
{
"entropy": 1.3896298915147782,
"epoch": 0.6434078429197404,
"grad_norm": 0.51171875,
"learning_rate": 1.7846051464063888e-05,
"loss": 0.9721,
"mean_token_accuracy": 0.747653903067112,
"num_tokens": 273177796.0,
"step": 2900
},
{
"entropy": 1.415783490240574,
"epoch": 0.6456264906539464,
"grad_norm": 0.55078125,
"learning_rate": 1.773513753327418e-05,
"loss": 0.9831,
"mean_token_accuracy": 0.7461927577853202,
"num_tokens": 274110970.0,
"step": 2910
},
{
"entropy": 1.4129061743617057,
"epoch": 0.6478451383881524,
"grad_norm": 0.56640625,
"learning_rate": 1.7624223602484475e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7465896405279636,
"num_tokens": 275046221.0,
"step": 2920
},
{
"entropy": 1.3508685111999512,
"epoch": 0.6500637861223584,
"grad_norm": 0.546875,
"learning_rate": 1.7513309671694767e-05,
"loss": 0.9157,
"mean_token_accuracy": 0.7606397703289985,
"num_tokens": 275976030.0,
"step": 2930
},
{
"entropy": 1.3810200482606887,
"epoch": 0.6522824338565644,
"grad_norm": 0.5625,
"learning_rate": 1.740239574090506e-05,
"loss": 0.9495,
"mean_token_accuracy": 0.7528549820184708,
"num_tokens": 276911856.0,
"step": 2940
},
{
"entropy": 1.3692273482680322,
"epoch": 0.6545010815907705,
"grad_norm": 0.51953125,
"learning_rate": 1.7291481810115352e-05,
"loss": 0.9461,
"mean_token_accuracy": 0.75175801217556,
"num_tokens": 277835377.0,
"step": 2950
},
{
"entropy": 1.3666433647274971,
"epoch": 0.6567197293249765,
"grad_norm": 0.5625,
"learning_rate": 1.7180567879325644e-05,
"loss": 0.9708,
"mean_token_accuracy": 0.7483266830444336,
"num_tokens": 278781181.0,
"step": 2960
},
{
"entropy": 1.3559312582015992,
"epoch": 0.6589383770591825,
"grad_norm": 0.61328125,
"learning_rate": 1.706965394853594e-05,
"loss": 0.954,
"mean_token_accuracy": 0.7511206485331059,
"num_tokens": 279716531.0,
"step": 2970
},
{
"entropy": 1.368943963199854,
"epoch": 0.6611570247933884,
"grad_norm": 0.51953125,
"learning_rate": 1.695874001774623e-05,
"loss": 0.9498,
"mean_token_accuracy": 0.7534951239824295,
"num_tokens": 280676303.0,
"step": 2980
},
{
"entropy": 1.3631028145551682,
"epoch": 0.6633756725275944,
"grad_norm": 0.54296875,
"learning_rate": 1.6847826086956524e-05,
"loss": 0.954,
"mean_token_accuracy": 0.7553952462971211,
"num_tokens": 281607985.0,
"step": 2990
},
{
"entropy": 1.3665792286396026,
"epoch": 0.6655943202618004,
"grad_norm": 0.515625,
"learning_rate": 1.6736912156166816e-05,
"loss": 0.9486,
"mean_token_accuracy": 0.7549586035311222,
"num_tokens": 282546210.0,
"step": 3000
},
{
"entropy": 1.3732372209429742,
"epoch": 0.6678129679960064,
"grad_norm": 0.52734375,
"learning_rate": 1.6625998225377108e-05,
"loss": 0.9479,
"mean_token_accuracy": 0.7541014879941941,
"num_tokens": 283454678.0,
"step": 3010
},
{
"entropy": 1.3811131581664085,
"epoch": 0.6700316157302124,
"grad_norm": 0.5546875,
"learning_rate": 1.6515084294587403e-05,
"loss": 0.9651,
"mean_token_accuracy": 0.7497533209621906,
"num_tokens": 284398944.0,
"step": 3020
},
{
"entropy": 1.3607411414384842,
"epoch": 0.6722502634644184,
"grad_norm": 0.53515625,
"learning_rate": 1.6404170363797696e-05,
"loss": 0.9687,
"mean_token_accuracy": 0.7503784812986851,
"num_tokens": 285348795.0,
"step": 3030
},
{
"entropy": 1.3603453844785691,
"epoch": 0.6744689111986244,
"grad_norm": 0.5390625,
"learning_rate": 1.6293256433007988e-05,
"loss": 0.9375,
"mean_token_accuracy": 0.7553820662200451,
"num_tokens": 286282620.0,
"step": 3040
},
{
"entropy": 1.365732416510582,
"epoch": 0.6766875589328304,
"grad_norm": 0.55078125,
"learning_rate": 1.618234250221828e-05,
"loss": 0.9641,
"mean_token_accuracy": 0.7524892151355743,
"num_tokens": 287196362.0,
"step": 3050
},
{
"entropy": 1.388171437382698,
"epoch": 0.6789062066670365,
"grad_norm": 0.53515625,
"learning_rate": 1.6071428571428572e-05,
"loss": 0.9787,
"mean_token_accuracy": 0.7475274331867695,
"num_tokens": 288112223.0,
"step": 3060
},
{
"entropy": 1.3936428040266038,
"epoch": 0.6811248544012425,
"grad_norm": 0.490234375,
"learning_rate": 1.5960514640638864e-05,
"loss": 0.9798,
"mean_token_accuracy": 0.7470642291009426,
"num_tokens": 289068574.0,
"step": 3070
},
{
"entropy": 1.3852615475654602,
"epoch": 0.6833435021354485,
"grad_norm": 0.49609375,
"learning_rate": 1.5849600709849156e-05,
"loss": 0.9707,
"mean_token_accuracy": 0.7508011363446713,
"num_tokens": 289999042.0,
"step": 3080
},
{
"entropy": 1.3831126019358635,
"epoch": 0.6855621498696545,
"grad_norm": 0.51953125,
"learning_rate": 1.573868677905945e-05,
"loss": 0.9783,
"mean_token_accuracy": 0.7468917787075042,
"num_tokens": 290909919.0,
"step": 3090
},
{
"entropy": 1.3710383675992488,
"epoch": 0.6877807976038605,
"grad_norm": 0.52734375,
"learning_rate": 1.5627772848269744e-05,
"loss": 0.9353,
"mean_token_accuracy": 0.7548687607049942,
"num_tokens": 291840451.0,
"step": 3100
},
{
"entropy": 1.390061342716217,
"epoch": 0.6899994453380665,
"grad_norm": 0.5234375,
"learning_rate": 1.5516858917480036e-05,
"loss": 0.9665,
"mean_token_accuracy": 0.7505981981754303,
"num_tokens": 292779464.0,
"step": 3110
},
{
"entropy": 1.3343483962118625,
"epoch": 0.6922180930722724,
"grad_norm": 0.54296875,
"learning_rate": 1.5405944986690328e-05,
"loss": 0.95,
"mean_token_accuracy": 0.7518795721232892,
"num_tokens": 293715997.0,
"step": 3120
},
{
"entropy": 1.3757101863622665,
"epoch": 0.6944367408064784,
"grad_norm": 0.55078125,
"learning_rate": 1.529503105590062e-05,
"loss": 0.9644,
"mean_token_accuracy": 0.7492641024291515,
"num_tokens": 294640050.0,
"step": 3130
},
{
"entropy": 1.4059673711657523,
"epoch": 0.6966553885406844,
"grad_norm": 0.5546875,
"learning_rate": 1.5184117125110914e-05,
"loss": 0.9713,
"mean_token_accuracy": 0.75089840143919,
"num_tokens": 295559534.0,
"step": 3140
},
{
"entropy": 1.357503455877304,
"epoch": 0.6988740362748904,
"grad_norm": 0.546875,
"learning_rate": 1.5073203194321208e-05,
"loss": 0.9664,
"mean_token_accuracy": 0.7514619171619416,
"num_tokens": 296488124.0,
"step": 3150
},
{
"entropy": 1.3608231715857984,
"epoch": 0.7010926840090964,
"grad_norm": 0.58984375,
"learning_rate": 1.4962289263531502e-05,
"loss": 0.9671,
"mean_token_accuracy": 0.7501711532473564,
"num_tokens": 297430605.0,
"step": 3160
},
{
"entropy": 1.3769429683685304,
"epoch": 0.7033113317433024,
"grad_norm": 0.54296875,
"learning_rate": 1.4851375332741794e-05,
"loss": 0.9669,
"mean_token_accuracy": 0.7483825981616974,
"num_tokens": 298397840.0,
"step": 3170
},
{
"entropy": 1.360371782630682,
"epoch": 0.7055299794775085,
"grad_norm": 0.54296875,
"learning_rate": 1.4740461401952086e-05,
"loss": 0.957,
"mean_token_accuracy": 0.7509351380169391,
"num_tokens": 299305118.0,
"step": 3180
},
{
"entropy": 1.3703515753149986,
"epoch": 0.7077486272117145,
"grad_norm": 0.5234375,
"learning_rate": 1.4629547471162378e-05,
"loss": 0.9822,
"mean_token_accuracy": 0.7480870224535465,
"num_tokens": 300260539.0,
"step": 3190
},
{
"entropy": 1.332726612687111,
"epoch": 0.7099672749459205,
"grad_norm": 0.52734375,
"learning_rate": 1.4518633540372672e-05,
"loss": 0.933,
"mean_token_accuracy": 0.7587002798914909,
"num_tokens": 301217315.0,
"step": 3200
},
{
"entropy": 1.3821225792169571,
"epoch": 0.7121859226801265,
"grad_norm": 0.59765625,
"learning_rate": 1.4407719609582964e-05,
"loss": 0.9886,
"mean_token_accuracy": 0.7449311658740043,
"num_tokens": 302146575.0,
"step": 3210
},
{
"entropy": 1.3900915190577507,
"epoch": 0.7144045704143325,
"grad_norm": 0.53515625,
"learning_rate": 1.4296805678793256e-05,
"loss": 0.9682,
"mean_token_accuracy": 0.7492348991334439,
"num_tokens": 303094935.0,
"step": 3220
},
{
"entropy": 1.3515639439225198,
"epoch": 0.7166232181485385,
"grad_norm": 0.5234375,
"learning_rate": 1.4185891748003548e-05,
"loss": 0.9786,
"mean_token_accuracy": 0.7468583591282367,
"num_tokens": 304047392.0,
"step": 3230
},
{
"entropy": 1.367770765721798,
"epoch": 0.7188418658827445,
"grad_norm": 0.50390625,
"learning_rate": 1.4074977817213844e-05,
"loss": 0.9446,
"mean_token_accuracy": 0.756279019266367,
"num_tokens": 305032436.0,
"step": 3240
},
{
"entropy": 1.3513148739933967,
"epoch": 0.7210605136169504,
"grad_norm": 0.57421875,
"learning_rate": 1.3964063886424136e-05,
"loss": 0.9414,
"mean_token_accuracy": 0.7565284885466099,
"num_tokens": 305973152.0,
"step": 3250
},
{
"entropy": 1.3632114075124264,
"epoch": 0.7232791613511564,
"grad_norm": 0.5703125,
"learning_rate": 1.3853149955634428e-05,
"loss": 0.9472,
"mean_token_accuracy": 0.7536871291697025,
"num_tokens": 306907009.0,
"step": 3260
},
{
"entropy": 1.3524435505270958,
"epoch": 0.7254978090853624,
"grad_norm": 0.578125,
"learning_rate": 1.374223602484472e-05,
"loss": 0.9561,
"mean_token_accuracy": 0.7523258805274964,
"num_tokens": 307856537.0,
"step": 3270
},
{
"entropy": 1.3488811895251274,
"epoch": 0.7277164568195684,
"grad_norm": 0.53515625,
"learning_rate": 1.3631322094055012e-05,
"loss": 0.9133,
"mean_token_accuracy": 0.7616166241467,
"num_tokens": 308795993.0,
"step": 3280
},
{
"entropy": 1.3710470870137215,
"epoch": 0.7299351045537745,
"grad_norm": 0.5078125,
"learning_rate": 1.3520408163265308e-05,
"loss": 0.9616,
"mean_token_accuracy": 0.7521081164479255,
"num_tokens": 309747330.0,
"step": 3290
},
{
"entropy": 1.3429643303155898,
"epoch": 0.7321537522879805,
"grad_norm": 0.56640625,
"learning_rate": 1.34094942324756e-05,
"loss": 0.9548,
"mean_token_accuracy": 0.7535655975341797,
"num_tokens": 310694135.0,
"step": 3300
},
{
"entropy": 1.405469660460949,
"epoch": 0.7343724000221865,
"grad_norm": 0.5390625,
"learning_rate": 1.3298580301685892e-05,
"loss": 1.0062,
"mean_token_accuracy": 0.740718811005354,
"num_tokens": 311630235.0,
"step": 3310
},
{
"entropy": 1.3496448494493962,
"epoch": 0.7365910477563925,
"grad_norm": 0.6171875,
"learning_rate": 1.3187666370896184e-05,
"loss": 0.9664,
"mean_token_accuracy": 0.7488033905625343,
"num_tokens": 312584456.0,
"step": 3320
},
{
"entropy": 1.3738062731921672,
"epoch": 0.7388096954905985,
"grad_norm": 0.55859375,
"learning_rate": 1.3076752440106476e-05,
"loss": 0.9384,
"mean_token_accuracy": 0.7538033194839955,
"num_tokens": 313514606.0,
"step": 3330
},
{
"entropy": 1.413434487581253,
"epoch": 0.7410283432248045,
"grad_norm": 0.54296875,
"learning_rate": 1.2965838509316772e-05,
"loss": 0.9779,
"mean_token_accuracy": 0.7464080691337586,
"num_tokens": 314454935.0,
"step": 3340
},
{
"entropy": 1.3720596060156822,
"epoch": 0.7432469909590105,
"grad_norm": 0.52734375,
"learning_rate": 1.2854924578527064e-05,
"loss": 0.982,
"mean_token_accuracy": 0.7460523217916488,
"num_tokens": 315395689.0,
"step": 3350
},
{
"entropy": 1.373593833297491,
"epoch": 0.7454656386932165,
"grad_norm": 0.51171875,
"learning_rate": 1.2744010647737356e-05,
"loss": 0.9522,
"mean_token_accuracy": 0.7515580035746098,
"num_tokens": 316352803.0,
"step": 3360
},
{
"entropy": 1.3801784969866275,
"epoch": 0.7476842864274225,
"grad_norm": 0.52734375,
"learning_rate": 1.2633096716947648e-05,
"loss": 0.9855,
"mean_token_accuracy": 0.7485053785145283,
"num_tokens": 317274362.0,
"step": 3370
},
{
"entropy": 1.3563234113156795,
"epoch": 0.7499029341616285,
"grad_norm": 0.5390625,
"learning_rate": 1.2522182786157944e-05,
"loss": 0.9492,
"mean_token_accuracy": 0.7532071232795715,
"num_tokens": 318208426.0,
"step": 3380
},
{
"entropy": 1.3828615471720695,
"epoch": 0.7521215818958344,
"grad_norm": 0.54296875,
"learning_rate": 1.2411268855368236e-05,
"loss": 0.9703,
"mean_token_accuracy": 0.7500887289643288,
"num_tokens": 319135439.0,
"step": 3390
},
{
"entropy": 1.358182117342949,
"epoch": 0.7543402296300404,
"grad_norm": 0.546875,
"learning_rate": 1.2300354924578528e-05,
"loss": 0.9614,
"mean_token_accuracy": 0.7506945103406906,
"num_tokens": 320094550.0,
"step": 3400
},
{
"entropy": 1.3667812556028367,
"epoch": 0.7565588773642465,
"grad_norm": 0.54296875,
"learning_rate": 1.218944099378882e-05,
"loss": 0.9663,
"mean_token_accuracy": 0.7509840287268161,
"num_tokens": 321034769.0,
"step": 3410
},
{
"entropy": 1.366119608283043,
"epoch": 0.7587775250984525,
"grad_norm": 0.578125,
"learning_rate": 1.2078527062999114e-05,
"loss": 0.9641,
"mean_token_accuracy": 0.7504384361207486,
"num_tokens": 321956617.0,
"step": 3420
},
{
"entropy": 1.3458327114582063,
"epoch": 0.7609961728326585,
"grad_norm": 0.51953125,
"learning_rate": 1.1967613132209406e-05,
"loss": 0.9246,
"mean_token_accuracy": 0.7602002188563347,
"num_tokens": 322897156.0,
"step": 3430
},
{
"entropy": 1.3576911017298698,
"epoch": 0.7632148205668645,
"grad_norm": 0.53515625,
"learning_rate": 1.18566992014197e-05,
"loss": 0.965,
"mean_token_accuracy": 0.7521724298596382,
"num_tokens": 323862034.0,
"step": 3440
},
{
"entropy": 1.3676732160151004,
"epoch": 0.7654334683010705,
"grad_norm": 0.55859375,
"learning_rate": 1.1745785270629992e-05,
"loss": 0.9535,
"mean_token_accuracy": 0.7519848950207233,
"num_tokens": 324785828.0,
"step": 3450
},
{
"entropy": 1.3827008694410323,
"epoch": 0.7676521160352765,
"grad_norm": 0.546875,
"learning_rate": 1.1634871339840284e-05,
"loss": 0.9803,
"mean_token_accuracy": 0.7474793456494808,
"num_tokens": 325709539.0,
"step": 3460
},
{
"entropy": 1.3825151666998863,
"epoch": 0.7698707637694825,
"grad_norm": 0.546875,
"learning_rate": 1.1523957409050576e-05,
"loss": 0.9502,
"mean_token_accuracy": 0.7529159486293793,
"num_tokens": 326670959.0,
"step": 3470
},
{
"entropy": 1.3601200327277183,
"epoch": 0.7720894115036885,
"grad_norm": 0.50390625,
"learning_rate": 1.141304347826087e-05,
"loss": 0.9375,
"mean_token_accuracy": 0.7546686172485352,
"num_tokens": 327614086.0,
"step": 3480
},
{
"entropy": 1.362020593881607,
"epoch": 0.7743080592378945,
"grad_norm": 0.55859375,
"learning_rate": 1.1302129547471162e-05,
"loss": 0.9698,
"mean_token_accuracy": 0.7503468558192253,
"num_tokens": 328539952.0,
"step": 3490
},
{
"entropy": 1.3366340756416322,
"epoch": 0.7765267069721005,
"grad_norm": 0.5078125,
"learning_rate": 1.1191215616681455e-05,
"loss": 0.9268,
"mean_token_accuracy": 0.7585201792418956,
"num_tokens": 329486160.0,
"step": 3500
},
{
"entropy": 1.4073020935058593,
"epoch": 0.7787453547063065,
"grad_norm": 0.5390625,
"learning_rate": 1.1080301685891748e-05,
"loss": 1.0058,
"mean_token_accuracy": 0.7416151888668537,
"num_tokens": 330421872.0,
"step": 3510
},
{
"entropy": 1.4079115837812424,
"epoch": 0.7809640024405126,
"grad_norm": 0.5546875,
"learning_rate": 1.096938775510204e-05,
"loss": 0.9832,
"mean_token_accuracy": 0.7472482591867446,
"num_tokens": 331343559.0,
"step": 3520
},
{
"entropy": 1.3630366913974286,
"epoch": 0.7831826501747186,
"grad_norm": 0.57421875,
"learning_rate": 1.0858473824312334e-05,
"loss": 0.9403,
"mean_token_accuracy": 0.7571096703410148,
"num_tokens": 332300518.0,
"step": 3530
},
{
"entropy": 1.3317184090614318,
"epoch": 0.7854012979089245,
"grad_norm": 0.57421875,
"learning_rate": 1.0747559893522626e-05,
"loss": 0.9272,
"mean_token_accuracy": 0.7571123994886875,
"num_tokens": 333242960.0,
"step": 3540
},
{
"entropy": 1.3805472776293755,
"epoch": 0.7876199456431305,
"grad_norm": 0.55078125,
"learning_rate": 1.063664596273292e-05,
"loss": 1.0001,
"mean_token_accuracy": 0.7453782841563225,
"num_tokens": 334199687.0,
"step": 3550
},
{
"entropy": 1.3903330437839032,
"epoch": 0.7898385933773365,
"grad_norm": 0.5703125,
"learning_rate": 1.0525732031943212e-05,
"loss": 0.9892,
"mean_token_accuracy": 0.7476846061646938,
"num_tokens": 335136671.0,
"step": 3560
},
{
"entropy": 1.400630796700716,
"epoch": 0.7920572411115425,
"grad_norm": 0.51953125,
"learning_rate": 1.0414818101153505e-05,
"loss": 0.9818,
"mean_token_accuracy": 0.7456599548459053,
"num_tokens": 336082784.0,
"step": 3570
},
{
"entropy": 1.330247312784195,
"epoch": 0.7942758888457485,
"grad_norm": 0.5390625,
"learning_rate": 1.0303904170363798e-05,
"loss": 0.9171,
"mean_token_accuracy": 0.7594246298074723,
"num_tokens": 337030801.0,
"step": 3580
},
{
"entropy": 1.3843200758099556,
"epoch": 0.7964945365799545,
"grad_norm": 0.5546875,
"learning_rate": 1.019299023957409e-05,
"loss": 0.9532,
"mean_token_accuracy": 0.7528259746730328,
"num_tokens": 337968238.0,
"step": 3590
},
{
"entropy": 1.3642551466822623,
"epoch": 0.7987131843141605,
"grad_norm": 0.52734375,
"learning_rate": 1.0082076308784384e-05,
"loss": 0.9623,
"mean_token_accuracy": 0.7526472553610801,
"num_tokens": 338918630.0,
"step": 3600
},
{
"entropy": 1.3950382307171822,
"epoch": 0.8009318320483665,
"grad_norm": 0.54296875,
"learning_rate": 9.971162377994676e-06,
"loss": 0.9987,
"mean_token_accuracy": 0.7440306425094605,
"num_tokens": 339883232.0,
"step": 3610
},
{
"entropy": 1.3789781741797924,
"epoch": 0.8031504797825725,
"grad_norm": 0.5234375,
"learning_rate": 9.86024844720497e-06,
"loss": 0.9803,
"mean_token_accuracy": 0.7468686446547508,
"num_tokens": 340815896.0,
"step": 3620
},
{
"entropy": 1.347270517796278,
"epoch": 0.8053691275167785,
"grad_norm": 0.515625,
"learning_rate": 9.749334516415262e-06,
"loss": 0.9484,
"mean_token_accuracy": 0.7531238257884979,
"num_tokens": 341768148.0,
"step": 3630
},
{
"entropy": 1.3590503334999084,
"epoch": 0.8075877752509846,
"grad_norm": 0.5234375,
"learning_rate": 9.638420585625555e-06,
"loss": 0.9316,
"mean_token_accuracy": 0.7546578265726567,
"num_tokens": 342701793.0,
"step": 3640
},
{
"entropy": 1.396905992925167,
"epoch": 0.8098064229851906,
"grad_norm": 0.57421875,
"learning_rate": 9.527506654835848e-06,
"loss": 0.9789,
"mean_token_accuracy": 0.7470791518688202,
"num_tokens": 343640847.0,
"step": 3650
},
{
"entropy": 1.4036844223737717,
"epoch": 0.8120250707193966,
"grad_norm": 0.5703125,
"learning_rate": 9.41659272404614e-06,
"loss": 1.0054,
"mean_token_accuracy": 0.7421661540865898,
"num_tokens": 344575824.0,
"step": 3660
},
{
"entropy": 1.3429035820066928,
"epoch": 0.8142437184536025,
"grad_norm": 0.5625,
"learning_rate": 9.305678793256434e-06,
"loss": 0.9533,
"mean_token_accuracy": 0.7538112707436084,
"num_tokens": 345521736.0,
"step": 3670
},
{
"entropy": 1.339048933982849,
"epoch": 0.8164623661878085,
"grad_norm": 0.52734375,
"learning_rate": 9.194764862466726e-06,
"loss": 0.9285,
"mean_token_accuracy": 0.7566302098333836,
"num_tokens": 346467156.0,
"step": 3680
},
{
"entropy": 1.3884014829993248,
"epoch": 0.8186810139220145,
"grad_norm": 0.515625,
"learning_rate": 9.08385093167702e-06,
"loss": 0.9551,
"mean_token_accuracy": 0.7553901061415672,
"num_tokens": 347380187.0,
"step": 3690
},
{
"entropy": 1.3566100239753722,
"epoch": 0.8208996616562205,
"grad_norm": 0.55078125,
"learning_rate": 8.972937000887312e-06,
"loss": 0.9534,
"mean_token_accuracy": 0.7549425765872002,
"num_tokens": 348318416.0,
"step": 3700
},
{
"entropy": 1.4000753894448281,
"epoch": 0.8231183093904265,
"grad_norm": 0.578125,
"learning_rate": 8.862023070097605e-06,
"loss": 0.9621,
"mean_token_accuracy": 0.7486125141382217,
"num_tokens": 349238737.0,
"step": 3710
},
{
"entropy": 1.340146180987358,
"epoch": 0.8253369571246325,
"grad_norm": 0.5078125,
"learning_rate": 8.751109139307898e-06,
"loss": 0.9434,
"mean_token_accuracy": 0.7554696768522262,
"num_tokens": 350211450.0,
"step": 3720
},
{
"entropy": 1.3477161943912506,
"epoch": 0.8275556048588385,
"grad_norm": 0.5234375,
"learning_rate": 8.64019520851819e-06,
"loss": 0.9295,
"mean_token_accuracy": 0.7600415408611297,
"num_tokens": 351168010.0,
"step": 3730
},
{
"entropy": 1.3705016247928143,
"epoch": 0.8297742525930445,
"grad_norm": 0.5546875,
"learning_rate": 8.529281277728483e-06,
"loss": 0.9853,
"mean_token_accuracy": 0.7473350986838341,
"num_tokens": 352123671.0,
"step": 3740
},
{
"entropy": 1.381928026676178,
"epoch": 0.8319929003272506,
"grad_norm": 0.5859375,
"learning_rate": 8.418367346938775e-06,
"loss": 0.9616,
"mean_token_accuracy": 0.7508723892271518,
"num_tokens": 353053546.0,
"step": 3750
},
{
"entropy": 1.3625482141971588,
"epoch": 0.8342115480614566,
"grad_norm": 0.54296875,
"learning_rate": 8.307453416149069e-06,
"loss": 0.9663,
"mean_token_accuracy": 0.7500698082149029,
"num_tokens": 354009149.0,
"step": 3760
},
{
"entropy": 1.3776927255094051,
"epoch": 0.8364301957956626,
"grad_norm": 0.5390625,
"learning_rate": 8.19653948535936e-06,
"loss": 0.9723,
"mean_token_accuracy": 0.7484539121389389,
"num_tokens": 354960232.0,
"step": 3770
},
{
"entropy": 1.348229543864727,
"epoch": 0.8386488435298686,
"grad_norm": 0.5625,
"learning_rate": 8.085625554569655e-06,
"loss": 0.9244,
"mean_token_accuracy": 0.7584247119724751,
"num_tokens": 355881980.0,
"step": 3780
},
{
"entropy": 1.379010844230652,
"epoch": 0.8408674912640746,
"grad_norm": 0.515625,
"learning_rate": 7.974711623779947e-06,
"loss": 0.9759,
"mean_token_accuracy": 0.7453257746994495,
"num_tokens": 356796420.0,
"step": 3790
},
{
"entropy": 1.323212279379368,
"epoch": 0.8430861389982806,
"grad_norm": 0.498046875,
"learning_rate": 7.863797692990239e-06,
"loss": 0.9252,
"mean_token_accuracy": 0.7594764739274978,
"num_tokens": 357735562.0,
"step": 3800
},
{
"entropy": 1.3776595070958138,
"epoch": 0.8453047867324865,
"grad_norm": 0.5703125,
"learning_rate": 7.752883762200533e-06,
"loss": 0.9779,
"mean_token_accuracy": 0.7492772653698921,
"num_tokens": 358678512.0,
"step": 3810
},
{
"entropy": 1.3554644294083118,
"epoch": 0.8475234344666925,
"grad_norm": 0.6015625,
"learning_rate": 7.641969831410825e-06,
"loss": 0.9401,
"mean_token_accuracy": 0.7538537114858628,
"num_tokens": 359648927.0,
"step": 3820
},
{
"entropy": 1.374256819486618,
"epoch": 0.8497420822008985,
"grad_norm": 0.498046875,
"learning_rate": 7.5310559006211186e-06,
"loss": 0.9516,
"mean_token_accuracy": 0.7554675169289112,
"num_tokens": 360613821.0,
"step": 3830
},
{
"entropy": 1.3803797647356988,
"epoch": 0.8519607299351045,
"grad_norm": 0.56640625,
"learning_rate": 7.420141969831411e-06,
"loss": 0.9509,
"mean_token_accuracy": 0.7538297854363918,
"num_tokens": 361546512.0,
"step": 3840
},
{
"entropy": 1.3749396726489067,
"epoch": 0.8541793776693105,
"grad_norm": 0.53125,
"learning_rate": 7.3092280390417045e-06,
"loss": 0.9708,
"mean_token_accuracy": 0.7505305975675582,
"num_tokens": 362470545.0,
"step": 3850
},
{
"entropy": 1.3605864882469176,
"epoch": 0.8563980254035165,
"grad_norm": 0.53515625,
"learning_rate": 7.198314108251997e-06,
"loss": 0.9273,
"mean_token_accuracy": 0.7572342440485954,
"num_tokens": 363386208.0,
"step": 3860
},
{
"entropy": 1.351151192933321,
"epoch": 0.8586166731377226,
"grad_norm": 0.5078125,
"learning_rate": 7.0874001774622905e-06,
"loss": 0.9441,
"mean_token_accuracy": 0.7543889455497265,
"num_tokens": 364337117.0,
"step": 3870
},
{
"entropy": 1.366971617937088,
"epoch": 0.8608353208719286,
"grad_norm": 0.5390625,
"learning_rate": 6.976486246672583e-06,
"loss": 0.9329,
"mean_token_accuracy": 0.7580908246338367,
"num_tokens": 365268692.0,
"step": 3880
},
{
"entropy": 1.380783747881651,
"epoch": 0.8630539686061346,
"grad_norm": 0.546875,
"learning_rate": 6.865572315882875e-06,
"loss": 0.9474,
"mean_token_accuracy": 0.7536208674311637,
"num_tokens": 366189928.0,
"step": 3890
},
{
"entropy": 1.422633485496044,
"epoch": 0.8652726163403406,
"grad_norm": 0.56640625,
"learning_rate": 6.7546583850931686e-06,
"loss": 0.9858,
"mean_token_accuracy": 0.7456947565078735,
"num_tokens": 367107938.0,
"step": 3900
},
{
"entropy": 1.3686823442578315,
"epoch": 0.8674912640745466,
"grad_norm": 0.53515625,
"learning_rate": 6.643744454303461e-06,
"loss": 0.9747,
"mean_token_accuracy": 0.746913269907236,
"num_tokens": 368057735.0,
"step": 3910
},
{
"entropy": 1.365791380405426,
"epoch": 0.8697099118087526,
"grad_norm": 0.53515625,
"learning_rate": 6.532830523513754e-06,
"loss": 0.9314,
"mean_token_accuracy": 0.7586275286972523,
"num_tokens": 369015878.0,
"step": 3920
},
{
"entropy": 1.39709220379591,
"epoch": 0.8719285595429586,
"grad_norm": 0.5625,
"learning_rate": 6.421916592724047e-06,
"loss": 0.978,
"mean_token_accuracy": 0.7494583688676357,
"num_tokens": 369939440.0,
"step": 3930
},
{
"entropy": 1.4065926373004913,
"epoch": 0.8741472072771646,
"grad_norm": 0.75,
"learning_rate": 6.31100266193434e-06,
"loss": 0.9938,
"mean_token_accuracy": 0.7427597299218178,
"num_tokens": 370887601.0,
"step": 3940
},
{
"entropy": 1.357539613544941,
"epoch": 0.8763658550113705,
"grad_norm": 0.54296875,
"learning_rate": 6.200088731144632e-06,
"loss": 0.9208,
"mean_token_accuracy": 0.759847804158926,
"num_tokens": 371812502.0,
"step": 3950
},
{
"entropy": 1.367304864525795,
"epoch": 0.8785845027455765,
"grad_norm": 0.515625,
"learning_rate": 6.089174800354925e-06,
"loss": 0.955,
"mean_token_accuracy": 0.7528910353779793,
"num_tokens": 372785967.0,
"step": 3960
},
{
"entropy": 1.3642425253987311,
"epoch": 0.8808031504797825,
"grad_norm": 0.62890625,
"learning_rate": 5.978260869565218e-06,
"loss": 0.9491,
"mean_token_accuracy": 0.7509314216673374,
"num_tokens": 373736770.0,
"step": 3970
},
{
"entropy": 1.3422590374946595,
"epoch": 0.8830217982139886,
"grad_norm": 0.515625,
"learning_rate": 5.867346938775511e-06,
"loss": 0.9434,
"mean_token_accuracy": 0.7563717573881149,
"num_tokens": 374687743.0,
"step": 3980
},
{
"entropy": 1.3692431643605232,
"epoch": 0.8852404459481946,
"grad_norm": 0.546875,
"learning_rate": 5.756433007985803e-06,
"loss": 0.956,
"mean_token_accuracy": 0.7523974537849426,
"num_tokens": 375638585.0,
"step": 3990
},
{
"entropy": 1.4123634532094003,
"epoch": 0.8874590936824006,
"grad_norm": 0.546875,
"learning_rate": 5.645519077196096e-06,
"loss": 0.9755,
"mean_token_accuracy": 0.7474804915487766,
"num_tokens": 376564779.0,
"step": 4000
},
{
"entropy": 1.3707083746790887,
"epoch": 0.8896777414166066,
"grad_norm": 0.55078125,
"learning_rate": 5.534605146406389e-06,
"loss": 0.9594,
"mean_token_accuracy": 0.7516291610896587,
"num_tokens": 377535509.0,
"step": 4010
},
{
"entropy": 1.3990908935666084,
"epoch": 0.8918963891508126,
"grad_norm": 0.55859375,
"learning_rate": 5.423691215616682e-06,
"loss": 0.9707,
"mean_token_accuracy": 0.7489598006010055,
"num_tokens": 378452879.0,
"step": 4020
},
{
"entropy": 1.323516283929348,
"epoch": 0.8941150368850186,
"grad_norm": 0.515625,
"learning_rate": 5.312777284826975e-06,
"loss": 0.9208,
"mean_token_accuracy": 0.7579696662724018,
"num_tokens": 379389441.0,
"step": 4030
},
{
"entropy": 1.3694282189011573,
"epoch": 0.8963336846192246,
"grad_norm": 0.55859375,
"learning_rate": 5.201863354037268e-06,
"loss": 0.9566,
"mean_token_accuracy": 0.7532132729887963,
"num_tokens": 380328572.0,
"step": 4040
},
{
"entropy": 1.3825721323490143,
"epoch": 0.8985523323534306,
"grad_norm": 0.52734375,
"learning_rate": 5.090949423247561e-06,
"loss": 0.9646,
"mean_token_accuracy": 0.7510122939944267,
"num_tokens": 381298077.0,
"step": 4050
},
{
"entropy": 1.3718091905117036,
"epoch": 0.9007709800876366,
"grad_norm": 0.5234375,
"learning_rate": 4.980035492457853e-06,
"loss": 0.9691,
"mean_token_accuracy": 0.7500693678855896,
"num_tokens": 382253696.0,
"step": 4060
},
{
"entropy": 1.3613854326307773,
"epoch": 0.9029896278218426,
"grad_norm": 0.55078125,
"learning_rate": 4.869121561668146e-06,
"loss": 0.924,
"mean_token_accuracy": 0.7597228534519672,
"num_tokens": 383180557.0,
"step": 4070
},
{
"entropy": 1.356216273456812,
"epoch": 0.9052082755560485,
"grad_norm": 0.51953125,
"learning_rate": 4.758207630878438e-06,
"loss": 0.9507,
"mean_token_accuracy": 0.7508698903024197,
"num_tokens": 384121710.0,
"step": 4080
},
{
"entropy": 1.373689603805542,
"epoch": 0.9074269232902545,
"grad_norm": 0.62109375,
"learning_rate": 4.647293700088731e-06,
"loss": 0.9489,
"mean_token_accuracy": 0.7534318998456001,
"num_tokens": 385057665.0,
"step": 4090
},
{
"entropy": 1.3592337571084498,
"epoch": 0.9096455710244606,
"grad_norm": 0.5234375,
"learning_rate": 4.536379769299024e-06,
"loss": 0.9266,
"mean_token_accuracy": 0.7580548346042633,
"num_tokens": 385990068.0,
"step": 4100
},
{
"entropy": 1.3794769167900085,
"epoch": 0.9118642187586666,
"grad_norm": 0.54296875,
"learning_rate": 4.425465838509317e-06,
"loss": 0.961,
"mean_token_accuracy": 0.7483809188008308,
"num_tokens": 386942053.0,
"step": 4110
},
{
"entropy": 1.3542534172534944,
"epoch": 0.9140828664928726,
"grad_norm": 0.546875,
"learning_rate": 4.31455190771961e-06,
"loss": 0.9244,
"mean_token_accuracy": 0.7592903338372707,
"num_tokens": 387887015.0,
"step": 4120
},
{
"entropy": 1.3595674246549607,
"epoch": 0.9163015142270786,
"grad_norm": 0.52734375,
"learning_rate": 4.203637976929903e-06,
"loss": 0.9246,
"mean_token_accuracy": 0.7590445302426815,
"num_tokens": 388811553.0,
"step": 4130
},
{
"entropy": 1.3751677602529526,
"epoch": 0.9185201619612846,
"grad_norm": 0.54296875,
"learning_rate": 4.092724046140196e-06,
"loss": 0.9404,
"mean_token_accuracy": 0.7545685932040215,
"num_tokens": 389767963.0,
"step": 4140
},
{
"entropy": 1.3535856008529663,
"epoch": 0.9207388096954906,
"grad_norm": 8.1875,
"learning_rate": 3.981810115350488e-06,
"loss": 0.9423,
"mean_token_accuracy": 0.755934339761734,
"num_tokens": 390718147.0,
"step": 4150
},
{
"entropy": 1.3349559880793094,
"epoch": 0.9229574574296966,
"grad_norm": 0.52734375,
"learning_rate": 3.870896184560781e-06,
"loss": 0.9307,
"mean_token_accuracy": 0.7575117878615856,
"num_tokens": 391655572.0,
"step": 4160
},
{
"entropy": 1.3620432406663894,
"epoch": 0.9251761051639026,
"grad_norm": 0.53125,
"learning_rate": 3.759982253771074e-06,
"loss": 0.9489,
"mean_token_accuracy": 0.7553517244756222,
"num_tokens": 392605183.0,
"step": 4170
},
{
"entropy": 1.3631588451564312,
"epoch": 0.9273947528981086,
"grad_norm": 0.53515625,
"learning_rate": 3.6490683229813664e-06,
"loss": 0.9688,
"mean_token_accuracy": 0.7515050798654557,
"num_tokens": 393541641.0,
"step": 4180
},
{
"entropy": 1.3356323443353175,
"epoch": 0.9296134006323146,
"grad_norm": 0.52734375,
"learning_rate": 3.5381543921916594e-06,
"loss": 0.9403,
"mean_token_accuracy": 0.7564674764871597,
"num_tokens": 394494620.0,
"step": 4190
},
{
"entropy": 1.3773754671216012,
"epoch": 0.9318320483665206,
"grad_norm": 0.55859375,
"learning_rate": 3.4272404614019524e-06,
"loss": 0.9536,
"mean_token_accuracy": 0.7521816037595273,
"num_tokens": 395433318.0,
"step": 4200
},
{
"entropy": 1.3892026975750924,
"epoch": 0.9340506961007266,
"grad_norm": 0.5234375,
"learning_rate": 3.3163265306122454e-06,
"loss": 0.9748,
"mean_token_accuracy": 0.7485000409185887,
"num_tokens": 396362606.0,
"step": 4210
},
{
"entropy": 1.3755895391106605,
"epoch": 0.9362693438349327,
"grad_norm": 0.490234375,
"learning_rate": 3.2054125998225384e-06,
"loss": 0.9831,
"mean_token_accuracy": 0.7457576237618924,
"num_tokens": 397301443.0,
"step": 4220
},
{
"entropy": 1.344323543459177,
"epoch": 0.9384879915691386,
"grad_norm": 0.51953125,
"learning_rate": 3.094498669032831e-06,
"loss": 0.9579,
"mean_token_accuracy": 0.751289016008377,
"num_tokens": 398268492.0,
"step": 4230
},
{
"entropy": 1.37066999822855,
"epoch": 0.9407066393033446,
"grad_norm": 0.55078125,
"learning_rate": 2.9835847382431235e-06,
"loss": 0.9682,
"mean_token_accuracy": 0.7518731184303761,
"num_tokens": 399230191.0,
"step": 4240
},
{
"entropy": 1.3903049305081367,
"epoch": 0.9429252870375506,
"grad_norm": 0.5859375,
"learning_rate": 2.872670807453416e-06,
"loss": 0.968,
"mean_token_accuracy": 0.7508095845580101,
"num_tokens": 400161112.0,
"step": 4250
},
{
"entropy": 1.3681126192212105,
"epoch": 0.9451439347717566,
"grad_norm": 0.5234375,
"learning_rate": 2.761756876663709e-06,
"loss": 0.9533,
"mean_token_accuracy": 0.752733913064003,
"num_tokens": 401087454.0,
"step": 4260
},
{
"entropy": 1.3725266255438329,
"epoch": 0.9473625825059626,
"grad_norm": 0.546875,
"learning_rate": 2.650842945874002e-06,
"loss": 0.9593,
"mean_token_accuracy": 0.7504413217306137,
"num_tokens": 402039367.0,
"step": 4270
},
{
"entropy": 1.321278876066208,
"epoch": 0.9495812302401686,
"grad_norm": 0.53515625,
"learning_rate": 2.539929015084295e-06,
"loss": 0.8934,
"mean_token_accuracy": 0.7636477537453175,
"num_tokens": 402977685.0,
"step": 4280
},
{
"entropy": 1.3655060514807702,
"epoch": 0.9517998779743746,
"grad_norm": 0.59765625,
"learning_rate": 2.4290150842945875e-06,
"loss": 0.9563,
"mean_token_accuracy": 0.7512309543788434,
"num_tokens": 403917954.0,
"step": 4290
},
{
"entropy": 1.3604578115046024,
"epoch": 0.9540185257085806,
"grad_norm": 0.5546875,
"learning_rate": 2.3181011535048805e-06,
"loss": 0.9373,
"mean_token_accuracy": 0.7567278765141964,
"num_tokens": 404846467.0,
"step": 4300
},
{
"entropy": 1.3907675817608833,
"epoch": 0.9562371734427866,
"grad_norm": 0.53125,
"learning_rate": 2.207187222715173e-06,
"loss": 0.9519,
"mean_token_accuracy": 0.7529364757239818,
"num_tokens": 405777519.0,
"step": 4310
},
{
"entropy": 1.35387849137187,
"epoch": 0.9584558211769926,
"grad_norm": 0.515625,
"learning_rate": 2.096273291925466e-06,
"loss": 0.9467,
"mean_token_accuracy": 0.7520903997123242,
"num_tokens": 406709213.0,
"step": 4320
},
{
"entropy": 1.381056059896946,
"epoch": 0.9606744689111987,
"grad_norm": 0.515625,
"learning_rate": 1.9853593611357586e-06,
"loss": 0.9912,
"mean_token_accuracy": 0.7435290008783341,
"num_tokens": 407652379.0,
"step": 4330
},
{
"entropy": 1.3804906919598579,
"epoch": 0.9628931166454047,
"grad_norm": 0.53125,
"learning_rate": 1.8744454303460516e-06,
"loss": 0.963,
"mean_token_accuracy": 0.7496263563632966,
"num_tokens": 408609113.0,
"step": 4340
},
{
"entropy": 1.3666646957397461,
"epoch": 0.9651117643796107,
"grad_norm": 0.52734375,
"learning_rate": 1.7635314995563443e-06,
"loss": 0.9557,
"mean_token_accuracy": 0.7525534473359585,
"num_tokens": 409556084.0,
"step": 4350
},
{
"entropy": 1.4019876047968864,
"epoch": 0.9673304121138167,
"grad_norm": 0.5234375,
"learning_rate": 1.6526175687666373e-06,
"loss": 0.9896,
"mean_token_accuracy": 0.7458052903413772,
"num_tokens": 410505277.0,
"step": 4360
},
{
"entropy": 1.3351032480597496,
"epoch": 0.9695490598480226,
"grad_norm": 0.59765625,
"learning_rate": 1.54170363797693e-06,
"loss": 0.9507,
"mean_token_accuracy": 0.7514726743102074,
"num_tokens": 411461390.0,
"step": 4370
},
{
"entropy": 1.39310442507267,
"epoch": 0.9717677075822286,
"grad_norm": 0.54296875,
"learning_rate": 1.4307897071872228e-06,
"loss": 0.9698,
"mean_token_accuracy": 0.7523914836347103,
"num_tokens": 412416981.0,
"step": 4380
},
{
"entropy": 1.3549498602747918,
"epoch": 0.9739863553164346,
"grad_norm": 0.53515625,
"learning_rate": 1.3198757763975156e-06,
"loss": 0.9405,
"mean_token_accuracy": 0.7553456977009774,
"num_tokens": 413351642.0,
"step": 4390
},
{
"entropy": 1.3552466280758382,
"epoch": 0.9762050030506406,
"grad_norm": 0.53515625,
"learning_rate": 1.2089618456078084e-06,
"loss": 0.9431,
"mean_token_accuracy": 0.7560462899506092,
"num_tokens": 414294100.0,
"step": 4400
},
{
"entropy": 1.4019367545843124,
"epoch": 0.9784236507848466,
"grad_norm": 0.55078125,
"learning_rate": 1.0980479148181013e-06,
"loss": 0.9945,
"mean_token_accuracy": 0.7445798873901367,
"num_tokens": 415243404.0,
"step": 4410
},
{
"entropy": 1.354978322982788,
"epoch": 0.9806422985190526,
"grad_norm": 0.49609375,
"learning_rate": 9.871339840283939e-07,
"loss": 0.944,
"mean_token_accuracy": 0.751890330016613,
"num_tokens": 416201156.0,
"step": 4420
},
{
"entropy": 1.3830320432782173,
"epoch": 0.9828609462532586,
"grad_norm": 0.57421875,
"learning_rate": 8.762200532386869e-07,
"loss": 0.9883,
"mean_token_accuracy": 0.7455812312662602,
"num_tokens": 417144686.0,
"step": 4430
},
{
"entropy": 1.343818484246731,
"epoch": 0.9850795939874646,
"grad_norm": 0.5546875,
"learning_rate": 7.653061224489796e-07,
"loss": 0.9519,
"mean_token_accuracy": 0.7526337899267673,
"num_tokens": 418110287.0,
"step": 4440
},
{
"entropy": 1.3943986184895039,
"epoch": 0.9872982417216707,
"grad_norm": 0.5703125,
"learning_rate": 6.543921916592724e-07,
"loss": 0.9929,
"mean_token_accuracy": 0.745176513493061,
"num_tokens": 419055182.0,
"step": 4450
},
{
"entropy": 1.3566786855459214,
"epoch": 0.9895168894558767,
"grad_norm": 0.5234375,
"learning_rate": 5.434782608695653e-07,
"loss": 0.9174,
"mean_token_accuracy": 0.7596544347703457,
"num_tokens": 419984398.0,
"step": 4460
},
{
"entropy": 1.3785859584808349,
"epoch": 0.9917355371900827,
"grad_norm": 0.55859375,
"learning_rate": 4.3256433007985804e-07,
"loss": 0.9648,
"mean_token_accuracy": 0.750813028216362,
"num_tokens": 420924208.0,
"step": 4470
},
{
"entropy": 1.3863228864967823,
"epoch": 0.9939541849242887,
"grad_norm": 0.5390625,
"learning_rate": 3.2165039929015086e-07,
"loss": 0.9769,
"mean_token_accuracy": 0.7477744162082672,
"num_tokens": 421862664.0,
"step": 4480
},
{
"entropy": 1.3868858963251114,
"epoch": 0.9961728326584947,
"grad_norm": 0.5078125,
"learning_rate": 2.1073646850044365e-07,
"loss": 0.9711,
"mean_token_accuracy": 0.7494218237698078,
"num_tokens": 422811406.0,
"step": 4490
},
{
"entropy": 1.405050777643919,
"epoch": 0.9983914803927006,
"grad_norm": 0.5546875,
"learning_rate": 9.982253771073646e-08,
"loss": 0.9819,
"mean_token_accuracy": 0.7480638548731804,
"num_tokens": 423763513.0,
"step": 4500
}
],
"logging_steps": 10,
"max_steps": 4508,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.665805826921595e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}