{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 4508, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.465661996603012, "epoch": 0.0022186477342060014, "grad_norm": 0.62109375, "learning_rate": 4.990017746228927e-05, "loss": 1.1086, "mean_token_accuracy": 0.7226187117397785, "num_tokens": 920745.0, "step": 10 }, { "entropy": 1.488898192346096, "epoch": 0.004437295468412003, "grad_norm": 0.72265625, "learning_rate": 4.978926353149956e-05, "loss": 1.1144, "mean_token_accuracy": 0.72113838493824, "num_tokens": 1856069.0, "step": 20 }, { "entropy": 1.4106852501630782, "epoch": 0.006655943202618004, "grad_norm": 0.59765625, "learning_rate": 4.967834960070985e-05, "loss": 1.0531, "mean_token_accuracy": 0.734193117916584, "num_tokens": 2799754.0, "step": 30 }, { "entropy": 1.4108840212225915, "epoch": 0.008874590936824005, "grad_norm": 0.5859375, "learning_rate": 4.9567435669920145e-05, "loss": 1.0694, "mean_token_accuracy": 0.7304773353040218, "num_tokens": 3749567.0, "step": 40 }, { "entropy": 1.4120406746864318, "epoch": 0.011093238671030008, "grad_norm": 0.546875, "learning_rate": 4.945652173913044e-05, "loss": 1.0653, "mean_token_accuracy": 0.7311853349208832, "num_tokens": 4712044.0, "step": 50 }, { "entropy": 1.3809884995222093, "epoch": 0.013311886405236008, "grad_norm": 0.5390625, "learning_rate": 4.934560780834073e-05, "loss": 1.0003, "mean_token_accuracy": 0.7430438749492169, "num_tokens": 5652709.0, "step": 60 }, { "entropy": 1.4100728079676628, "epoch": 0.01553053413944201, "grad_norm": 0.5703125, "learning_rate": 4.923469387755102e-05, "loss": 1.0167, "mean_token_accuracy": 0.7407922275364399, "num_tokens": 6610134.0, "step": 70 }, { "entropy": 1.403176763653755, "epoch": 0.01774918187364801, "grad_norm": 0.64453125, "learning_rate": 4.9123779946761314e-05, "loss": 1.044, "mean_token_accuracy": 0.7348449125885963, "num_tokens": 7568291.0, "step": 80 }, { "entropy": 1.4683261014521123, "epoch": 0.019967829607854013, "grad_norm": 0.6328125, "learning_rate": 4.9012866015971606e-05, "loss": 1.0934, "mean_token_accuracy": 0.724130530655384, "num_tokens": 8504994.0, "step": 90 }, { "entropy": 1.4386583149433136, "epoch": 0.022186477342060015, "grad_norm": 0.61328125, "learning_rate": 4.8901952085181905e-05, "loss": 1.0837, "mean_token_accuracy": 0.728272894024849, "num_tokens": 9448639.0, "step": 100 }, { "entropy": 1.420653748512268, "epoch": 0.024405125076266018, "grad_norm": 0.55859375, "learning_rate": 4.87910381543922e-05, "loss": 1.0387, "mean_token_accuracy": 0.7369039125740529, "num_tokens": 10379425.0, "step": 110 }, { "entropy": 1.404262875020504, "epoch": 0.026623772810472016, "grad_norm": 0.56640625, "learning_rate": 4.868012422360249e-05, "loss": 1.0209, "mean_token_accuracy": 0.7374828591942787, "num_tokens": 11309822.0, "step": 120 }, { "entropy": 1.453029316663742, "epoch": 0.02884242054467802, "grad_norm": 0.625, "learning_rate": 4.856921029281278e-05, "loss": 1.0605, "mean_token_accuracy": 0.7299027130007744, "num_tokens": 12238455.0, "step": 130 }, { "entropy": 1.3651263251900674, "epoch": 0.03106106827888402, "grad_norm": 0.59375, "learning_rate": 4.845829636202307e-05, "loss": 0.9947, "mean_token_accuracy": 0.7443266965448856, "num_tokens": 13182071.0, "step": 140 }, { "entropy": 1.385608184337616, "epoch": 0.03327971601309002, "grad_norm": 0.58203125, "learning_rate": 4.8347382431233365e-05, "loss": 1.0164, "mean_token_accuracy": 0.7404524885118008, "num_tokens": 14133077.0, "step": 150 }, { "entropy": 1.3790138736367226, "epoch": 0.03549836374729602, "grad_norm": 0.55859375, "learning_rate": 4.823646850044366e-05, "loss": 1.0056, "mean_token_accuracy": 0.7429419830441475, "num_tokens": 15097146.0, "step": 160 }, { "entropy": 1.3843353003263474, "epoch": 0.03771701148150203, "grad_norm": 0.5625, "learning_rate": 4.812555456965395e-05, "loss": 1.0225, "mean_token_accuracy": 0.7410897597670555, "num_tokens": 16041115.0, "step": 170 }, { "entropy": 1.4388863369822502, "epoch": 0.039935659215708026, "grad_norm": 0.55859375, "learning_rate": 4.801464063886424e-05, "loss": 1.0651, "mean_token_accuracy": 0.7301742501556874, "num_tokens": 16967907.0, "step": 180 }, { "entropy": 1.4269818142056465, "epoch": 0.042154306949914025, "grad_norm": 0.58984375, "learning_rate": 4.7903726708074534e-05, "loss": 1.0516, "mean_token_accuracy": 0.7301830016076565, "num_tokens": 17886856.0, "step": 190 }, { "entropy": 1.4162877902388573, "epoch": 0.04437295468412003, "grad_norm": 0.55859375, "learning_rate": 4.7792812777284826e-05, "loss": 1.03, "mean_token_accuracy": 0.7377504236996174, "num_tokens": 18840197.0, "step": 200 }, { "entropy": 1.4102661520242692, "epoch": 0.04659160241832603, "grad_norm": 0.55859375, "learning_rate": 4.768189884649512e-05, "loss": 1.0236, "mean_token_accuracy": 0.7400240004062653, "num_tokens": 19781494.0, "step": 210 }, { "entropy": 1.3768211975693703, "epoch": 0.048810250152532035, "grad_norm": 0.546875, "learning_rate": 4.757098491570541e-05, "loss": 1.0038, "mean_token_accuracy": 0.7427880488336086, "num_tokens": 20723374.0, "step": 220 }, { "entropy": 1.3382669970393182, "epoch": 0.051028897886738034, "grad_norm": 0.52734375, "learning_rate": 4.74600709849157e-05, "loss": 0.9594, "mean_token_accuracy": 0.7518122509121895, "num_tokens": 21678173.0, "step": 230 }, { "entropy": 1.4415529936552047, "epoch": 0.05324754562094403, "grad_norm": 0.59765625, "learning_rate": 4.7349157054126e-05, "loss": 1.0553, "mean_token_accuracy": 0.7320528604090214, "num_tokens": 22636644.0, "step": 240 }, { "entropy": 1.4109850257635117, "epoch": 0.05546619335515004, "grad_norm": 0.62890625, "learning_rate": 4.7238243123336293e-05, "loss": 1.0229, "mean_token_accuracy": 0.7401082016527653, "num_tokens": 23591235.0, "step": 250 }, { "entropy": 1.4080532848834992, "epoch": 0.05768484108935604, "grad_norm": 0.5859375, "learning_rate": 4.7127329192546586e-05, "loss": 1.0517, "mean_token_accuracy": 0.7366889797151088, "num_tokens": 24542394.0, "step": 260 }, { "entropy": 1.389213815331459, "epoch": 0.059903488823562036, "grad_norm": 0.578125, "learning_rate": 4.701641526175688e-05, "loss": 1.0251, "mean_token_accuracy": 0.7381838664412499, "num_tokens": 25470496.0, "step": 270 }, { "entropy": 1.3643932774662972, "epoch": 0.06212213655776804, "grad_norm": 0.5703125, "learning_rate": 4.690550133096717e-05, "loss": 1.0054, "mean_token_accuracy": 0.7416425958275795, "num_tokens": 26442302.0, "step": 280 }, { "entropy": 1.3870579779148102, "epoch": 0.06434078429197404, "grad_norm": 0.5546875, "learning_rate": 4.679458740017746e-05, "loss": 1.0343, "mean_token_accuracy": 0.737949987500906, "num_tokens": 27393661.0, "step": 290 }, { "entropy": 1.396770441532135, "epoch": 0.06655943202618005, "grad_norm": 0.546875, "learning_rate": 4.6683673469387754e-05, "loss": 1.0141, "mean_token_accuracy": 0.7434757709503174, "num_tokens": 28341659.0, "step": 300 }, { "entropy": 1.3748480409383774, "epoch": 0.06877807976038605, "grad_norm": 0.55859375, "learning_rate": 4.6572759538598046e-05, "loss": 1.0087, "mean_token_accuracy": 0.7405130356550217, "num_tokens": 29277411.0, "step": 310 }, { "entropy": 1.4325285077095031, "epoch": 0.07099672749459204, "grad_norm": 0.57421875, "learning_rate": 4.646184560780834e-05, "loss": 1.0756, "mean_token_accuracy": 0.7282709129154682, "num_tokens": 30202359.0, "step": 320 }, { "entropy": 1.3642885342240334, "epoch": 0.07321537522879805, "grad_norm": 0.57421875, "learning_rate": 4.635093167701863e-05, "loss": 1.0025, "mean_token_accuracy": 0.7448312789201736, "num_tokens": 31145832.0, "step": 330 }, { "entropy": 1.4077475845813752, "epoch": 0.07543402296300405, "grad_norm": 0.5625, "learning_rate": 4.624001774622893e-05, "loss": 1.0089, "mean_token_accuracy": 0.7406972415745259, "num_tokens": 32074320.0, "step": 340 }, { "entropy": 1.3939625218510627, "epoch": 0.07765267069721005, "grad_norm": 0.51953125, "learning_rate": 4.612910381543922e-05, "loss": 0.9987, "mean_token_accuracy": 0.7439860895276069, "num_tokens": 33020609.0, "step": 350 }, { "entropy": 1.3682234331965446, "epoch": 0.07987131843141605, "grad_norm": 0.5625, "learning_rate": 4.6018189884649514e-05, "loss": 0.9728, "mean_token_accuracy": 0.7498374275863171, "num_tokens": 33954434.0, "step": 360 }, { "entropy": 1.3806424900889396, "epoch": 0.08208996616562206, "grad_norm": 0.57421875, "learning_rate": 4.5907275953859806e-05, "loss": 0.9897, "mean_token_accuracy": 0.7453982323408127, "num_tokens": 34897665.0, "step": 370 }, { "entropy": 1.3811901077628135, "epoch": 0.08430861389982805, "grad_norm": 0.52734375, "learning_rate": 4.57963620230701e-05, "loss": 0.9774, "mean_token_accuracy": 0.750572357326746, "num_tokens": 35851910.0, "step": 380 }, { "entropy": 1.3813920207321644, "epoch": 0.08652726163403406, "grad_norm": 0.55859375, "learning_rate": 4.568544809228039e-05, "loss": 0.9936, "mean_token_accuracy": 0.7430255509912967, "num_tokens": 36774893.0, "step": 390 }, { "entropy": 1.4034755870699882, "epoch": 0.08874590936824006, "grad_norm": 0.53125, "learning_rate": 4.557453416149068e-05, "loss": 1.0016, "mean_token_accuracy": 0.7436409674584865, "num_tokens": 37732150.0, "step": 400 }, { "entropy": 1.416483211517334, "epoch": 0.09096455710244605, "grad_norm": 0.5234375, "learning_rate": 4.5463620230700974e-05, "loss": 1.0171, "mean_token_accuracy": 0.7410402894020081, "num_tokens": 38689323.0, "step": 410 }, { "entropy": 1.4142859980463982, "epoch": 0.09318320483665206, "grad_norm": 0.56640625, "learning_rate": 4.5352706299911266e-05, "loss": 1.0005, "mean_token_accuracy": 0.740844739228487, "num_tokens": 39646707.0, "step": 420 }, { "entropy": 1.408056764304638, "epoch": 0.09540185257085806, "grad_norm": 0.546875, "learning_rate": 4.5241792369121565e-05, "loss": 0.9846, "mean_token_accuracy": 0.7466986313462257, "num_tokens": 40593712.0, "step": 430 }, { "entropy": 1.38804781883955, "epoch": 0.09762050030506407, "grad_norm": 0.515625, "learning_rate": 4.513087843833186e-05, "loss": 0.9794, "mean_token_accuracy": 0.7476758994162083, "num_tokens": 41520297.0, "step": 440 }, { "entropy": 1.4305102132260799, "epoch": 0.09983914803927006, "grad_norm": 0.55859375, "learning_rate": 4.501996450754215e-05, "loss": 1.0383, "mean_token_accuracy": 0.7344398230314255, "num_tokens": 42459207.0, "step": 450 }, { "entropy": 1.388769841194153, "epoch": 0.10205779577347607, "grad_norm": 0.59375, "learning_rate": 4.490905057675244e-05, "loss": 1.0054, "mean_token_accuracy": 0.7438753083348274, "num_tokens": 43397171.0, "step": 460 }, { "entropy": 1.3882140532135963, "epoch": 0.10427644350768207, "grad_norm": 0.515625, "learning_rate": 4.4798136645962734e-05, "loss": 1.0118, "mean_token_accuracy": 0.7423836156725884, "num_tokens": 44389613.0, "step": 470 }, { "entropy": 1.422153604775667, "epoch": 0.10649509124188807, "grad_norm": 0.55078125, "learning_rate": 4.4687222715173026e-05, "loss": 1.0353, "mean_token_accuracy": 0.7357220977544785, "num_tokens": 45328113.0, "step": 480 }, { "entropy": 1.3926182009279728, "epoch": 0.10871373897609407, "grad_norm": 0.57421875, "learning_rate": 4.457630878438332e-05, "loss": 1.0027, "mean_token_accuracy": 0.7421124801039696, "num_tokens": 46299624.0, "step": 490 }, { "entropy": 1.4123871177434921, "epoch": 0.11093238671030008, "grad_norm": 0.55859375, "learning_rate": 4.446539485359361e-05, "loss": 0.9935, "mean_token_accuracy": 0.745088592916727, "num_tokens": 47252835.0, "step": 500 }, { "entropy": 1.3767844289541245, "epoch": 0.11315103444450607, "grad_norm": 0.55078125, "learning_rate": 4.43544809228039e-05, "loss": 0.9747, "mean_token_accuracy": 0.7475401207804679, "num_tokens": 48205264.0, "step": 510 }, { "entropy": 1.396455319225788, "epoch": 0.11536968217871207, "grad_norm": 0.5234375, "learning_rate": 4.42435669920142e-05, "loss": 1.0098, "mean_token_accuracy": 0.7415580742061139, "num_tokens": 49160839.0, "step": 520 }, { "entropy": 1.347930134832859, "epoch": 0.11758832991291808, "grad_norm": 0.54296875, "learning_rate": 4.4132653061224493e-05, "loss": 0.935, "mean_token_accuracy": 0.7578449346125126, "num_tokens": 50102578.0, "step": 530 }, { "entropy": 1.3879924044013023, "epoch": 0.11980697764712407, "grad_norm": 0.52734375, "learning_rate": 4.4021739130434786e-05, "loss": 0.9867, "mean_token_accuracy": 0.7446529671549798, "num_tokens": 51034066.0, "step": 540 }, { "entropy": 1.3780046537518502, "epoch": 0.12202562538133008, "grad_norm": 0.57421875, "learning_rate": 4.391082519964508e-05, "loss": 1.0, "mean_token_accuracy": 0.7435966461896897, "num_tokens": 51964014.0, "step": 550 }, { "entropy": 1.3777382314205169, "epoch": 0.12424427311553608, "grad_norm": 0.53125, "learning_rate": 4.379991126885537e-05, "loss": 0.9734, "mean_token_accuracy": 0.7478257723152637, "num_tokens": 52910576.0, "step": 560 }, { "entropy": 1.3899442911148072, "epoch": 0.1264629208497421, "grad_norm": 0.57421875, "learning_rate": 4.368899733806566e-05, "loss": 0.9825, "mean_token_accuracy": 0.7491655819118023, "num_tokens": 53856897.0, "step": 570 }, { "entropy": 1.3858520530164242, "epoch": 0.12868156858394808, "grad_norm": 0.5390625, "learning_rate": 4.3578083407275954e-05, "loss": 1.0048, "mean_token_accuracy": 0.7406159020960331, "num_tokens": 54781199.0, "step": 580 }, { "entropy": 1.35281662940979, "epoch": 0.13090021631815407, "grad_norm": 0.55078125, "learning_rate": 4.3467169476486246e-05, "loss": 0.9788, "mean_token_accuracy": 0.7481894366443157, "num_tokens": 55737247.0, "step": 590 }, { "entropy": 1.3705300688743591, "epoch": 0.1331188640523601, "grad_norm": 0.57421875, "learning_rate": 4.335625554569654e-05, "loss": 0.9694, "mean_token_accuracy": 0.7483362957835198, "num_tokens": 56651909.0, "step": 600 }, { "entropy": 1.4127747476100923, "epoch": 0.13533751178656608, "grad_norm": 0.54296875, "learning_rate": 4.324534161490684e-05, "loss": 1.0249, "mean_token_accuracy": 0.7398222059011459, "num_tokens": 57590489.0, "step": 610 }, { "entropy": 1.3992966830730438, "epoch": 0.1375561595207721, "grad_norm": 0.59765625, "learning_rate": 4.313442768411713e-05, "loss": 1.0117, "mean_token_accuracy": 0.7400935985147953, "num_tokens": 58499984.0, "step": 620 }, { "entropy": 1.387077435851097, "epoch": 0.1397748072549781, "grad_norm": 0.5703125, "learning_rate": 4.302351375332742e-05, "loss": 0.959, "mean_token_accuracy": 0.7503612264990807, "num_tokens": 59442258.0, "step": 630 }, { "entropy": 1.4211810544133185, "epoch": 0.1419934549891841, "grad_norm": 0.55078125, "learning_rate": 4.2912599822537714e-05, "loss": 1.0157, "mean_token_accuracy": 0.7405542671680451, "num_tokens": 60360327.0, "step": 640 }, { "entropy": 1.3745015911757945, "epoch": 0.1442121027233901, "grad_norm": 0.54296875, "learning_rate": 4.2801685891748006e-05, "loss": 0.9522, "mean_token_accuracy": 0.7537800639867782, "num_tokens": 61327349.0, "step": 650 }, { "entropy": 1.4054788954555988, "epoch": 0.1464307504575961, "grad_norm": 0.5546875, "learning_rate": 4.26907719609583e-05, "loss": 0.9941, "mean_token_accuracy": 0.7440318554639817, "num_tokens": 62264837.0, "step": 660 }, { "entropy": 1.3812890231609345, "epoch": 0.1486493981918021, "grad_norm": 0.53515625, "learning_rate": 4.257985803016859e-05, "loss": 0.9678, "mean_token_accuracy": 0.7510386519134045, "num_tokens": 63211247.0, "step": 670 }, { "entropy": 1.409769555926323, "epoch": 0.1508680459260081, "grad_norm": 0.546875, "learning_rate": 4.246894409937888e-05, "loss": 0.9996, "mean_token_accuracy": 0.7456191934645175, "num_tokens": 64155975.0, "step": 680 }, { "entropy": 1.3923737697303296, "epoch": 0.1530866936602141, "grad_norm": 0.53515625, "learning_rate": 4.2358030168589174e-05, "loss": 0.9722, "mean_token_accuracy": 0.7461612269282341, "num_tokens": 65072271.0, "step": 690 }, { "entropy": 1.40745849609375, "epoch": 0.1553053413944201, "grad_norm": 0.57421875, "learning_rate": 4.224711623779947e-05, "loss": 1.0038, "mean_token_accuracy": 0.7412535354495049, "num_tokens": 65998478.0, "step": 700 }, { "entropy": 1.3825418494641781, "epoch": 0.1575239891286261, "grad_norm": 0.55859375, "learning_rate": 4.2136202307009765e-05, "loss": 1.02, "mean_token_accuracy": 0.7408786401152611, "num_tokens": 66964955.0, "step": 710 }, { "entropy": 1.36370387673378, "epoch": 0.1597426368628321, "grad_norm": 0.70703125, "learning_rate": 4.202528837622006e-05, "loss": 0.9479, "mean_token_accuracy": 0.7531493015587329, "num_tokens": 67924768.0, "step": 720 }, { "entropy": 1.3911995731294156, "epoch": 0.1619612845970381, "grad_norm": 0.5703125, "learning_rate": 4.191437444543035e-05, "loss": 0.9809, "mean_token_accuracy": 0.7469467587769032, "num_tokens": 68848454.0, "step": 730 }, { "entropy": 1.3749838933348655, "epoch": 0.16417993233124412, "grad_norm": 0.5078125, "learning_rate": 4.180346051464064e-05, "loss": 0.987, "mean_token_accuracy": 0.7450465574860573, "num_tokens": 69762759.0, "step": 740 }, { "entropy": 1.3985765784978867, "epoch": 0.1663985800654501, "grad_norm": 0.55078125, "learning_rate": 4.1692546583850934e-05, "loss": 1.0079, "mean_token_accuracy": 0.7432275369763375, "num_tokens": 70703955.0, "step": 750 }, { "entropy": 1.3777714148163795, "epoch": 0.1686172277996561, "grad_norm": 0.5859375, "learning_rate": 4.1581632653061226e-05, "loss": 0.9936, "mean_token_accuracy": 0.7448336496949196, "num_tokens": 71679834.0, "step": 760 }, { "entropy": 1.396980494260788, "epoch": 0.17083587553386212, "grad_norm": 0.5625, "learning_rate": 4.147071872227152e-05, "loss": 1.0315, "mean_token_accuracy": 0.735766839236021, "num_tokens": 72627848.0, "step": 770 }, { "entropy": 1.4055049568414688, "epoch": 0.1730545232680681, "grad_norm": 0.5546875, "learning_rate": 4.135980479148181e-05, "loss": 1.0316, "mean_token_accuracy": 0.7373110122978688, "num_tokens": 73581207.0, "step": 780 }, { "entropy": 1.3683342918753625, "epoch": 0.1752731710022741, "grad_norm": 0.53125, "learning_rate": 4.124889086069211e-05, "loss": 0.9791, "mean_token_accuracy": 0.747586116939783, "num_tokens": 74529475.0, "step": 790 }, { "entropy": 1.3873766288161278, "epoch": 0.17749181873648012, "grad_norm": 0.546875, "learning_rate": 4.11379769299024e-05, "loss": 0.9754, "mean_token_accuracy": 0.7475376576185226, "num_tokens": 75440781.0, "step": 800 }, { "entropy": 1.3871978685259818, "epoch": 0.17971046647068611, "grad_norm": 0.51953125, "learning_rate": 4.1027062999112693e-05, "loss": 0.9639, "mean_token_accuracy": 0.7503504127264022, "num_tokens": 76380254.0, "step": 810 }, { "entropy": 1.3826657935976983, "epoch": 0.1819291142048921, "grad_norm": 0.5703125, "learning_rate": 4.0916149068322986e-05, "loss": 0.9853, "mean_token_accuracy": 0.7480736874043942, "num_tokens": 77331959.0, "step": 820 }, { "entropy": 1.3709987953305245, "epoch": 0.18414776193909813, "grad_norm": 0.5859375, "learning_rate": 4.080523513753328e-05, "loss": 0.9922, "mean_token_accuracy": 0.7420654028654099, "num_tokens": 78260787.0, "step": 830 }, { "entropy": 1.3630467101931572, "epoch": 0.18636640967330412, "grad_norm": 0.53515625, "learning_rate": 4.069432120674357e-05, "loss": 0.9769, "mean_token_accuracy": 0.7467788316309452, "num_tokens": 79222828.0, "step": 840 }, { "entropy": 1.392745055258274, "epoch": 0.1885850574075101, "grad_norm": 0.55078125, "learning_rate": 4.058340727595386e-05, "loss": 0.9989, "mean_token_accuracy": 0.7418600834906102, "num_tokens": 80173060.0, "step": 850 }, { "entropy": 1.4078860878944397, "epoch": 0.19080370514171613, "grad_norm": 0.578125, "learning_rate": 4.0472493345164154e-05, "loss": 1.0245, "mean_token_accuracy": 0.7383234694600105, "num_tokens": 81102014.0, "step": 860 }, { "entropy": 1.417808648943901, "epoch": 0.19302235287592212, "grad_norm": 0.56640625, "learning_rate": 4.0361579414374446e-05, "loss": 0.9965, "mean_token_accuracy": 0.7464033514261246, "num_tokens": 82020785.0, "step": 870 }, { "entropy": 1.3907752215862275, "epoch": 0.19524100061012814, "grad_norm": 0.578125, "learning_rate": 4.025066548358474e-05, "loss": 0.9928, "mean_token_accuracy": 0.7445502743124962, "num_tokens": 82957496.0, "step": 880 }, { "entropy": 1.3803277552127837, "epoch": 0.19745964834433413, "grad_norm": 0.53125, "learning_rate": 4.013975155279504e-05, "loss": 0.9616, "mean_token_accuracy": 0.7518575496971607, "num_tokens": 83928608.0, "step": 890 }, { "entropy": 1.365333902835846, "epoch": 0.19967829607854012, "grad_norm": 0.55078125, "learning_rate": 4.002883762200533e-05, "loss": 0.9758, "mean_token_accuracy": 0.7502094514667987, "num_tokens": 84877530.0, "step": 900 }, { "entropy": 1.3868597373366356, "epoch": 0.20189694381274614, "grad_norm": 0.5390625, "learning_rate": 3.991792369121562e-05, "loss": 0.9728, "mean_token_accuracy": 0.7488475523889064, "num_tokens": 85818477.0, "step": 910 }, { "entropy": 1.3934067755937576, "epoch": 0.20411559154695214, "grad_norm": 0.55078125, "learning_rate": 3.9807009760425914e-05, "loss": 0.9875, "mean_token_accuracy": 0.745812700688839, "num_tokens": 86742251.0, "step": 920 }, { "entropy": 1.355683723092079, "epoch": 0.20633423928115813, "grad_norm": 0.5234375, "learning_rate": 3.9696095829636206e-05, "loss": 0.9674, "mean_token_accuracy": 0.7483757615089417, "num_tokens": 87672989.0, "step": 930 }, { "entropy": 1.3708684414625167, "epoch": 0.20855288701536415, "grad_norm": 0.4921875, "learning_rate": 3.95851818988465e-05, "loss": 0.976, "mean_token_accuracy": 0.7468036495149135, "num_tokens": 88639065.0, "step": 940 }, { "entropy": 1.3593387573957443, "epoch": 0.21077153474957014, "grad_norm": 0.51953125, "learning_rate": 3.947426796805679e-05, "loss": 0.9378, "mean_token_accuracy": 0.7551731921732425, "num_tokens": 89578484.0, "step": 950 }, { "entropy": 1.3732744343578815, "epoch": 0.21299018248377613, "grad_norm": 0.546875, "learning_rate": 3.936335403726708e-05, "loss": 0.9818, "mean_token_accuracy": 0.7454430587589741, "num_tokens": 90523121.0, "step": 960 }, { "entropy": 1.3468638718128205, "epoch": 0.21520883021798215, "grad_norm": 0.5859375, "learning_rate": 3.9252440106477374e-05, "loss": 0.9422, "mean_token_accuracy": 0.7539307042956352, "num_tokens": 91464767.0, "step": 970 }, { "entropy": 1.3708197608590127, "epoch": 0.21742747795218814, "grad_norm": 0.54296875, "learning_rate": 3.914152617568767e-05, "loss": 0.9705, "mean_token_accuracy": 0.7490366064012051, "num_tokens": 92409875.0, "step": 980 }, { "entropy": 1.3723851881921292, "epoch": 0.21964612568639413, "grad_norm": 0.51171875, "learning_rate": 3.9030612244897965e-05, "loss": 0.9613, "mean_token_accuracy": 0.7512517027556896, "num_tokens": 93347564.0, "step": 990 }, { "entropy": 1.3774209707975387, "epoch": 0.22186477342060015, "grad_norm": 0.53515625, "learning_rate": 3.891969831410826e-05, "loss": 0.9613, "mean_token_accuracy": 0.7502817243337632, "num_tokens": 94304767.0, "step": 1000 }, { "entropy": 1.4110181361436844, "epoch": 0.22408342115480614, "grad_norm": 0.6171875, "learning_rate": 3.880878438331855e-05, "loss": 0.9798, "mean_token_accuracy": 0.74644386023283, "num_tokens": 95239927.0, "step": 1010 }, { "entropy": 1.3407094910740853, "epoch": 0.22630206888901214, "grad_norm": 0.5390625, "learning_rate": 3.869787045252884e-05, "loss": 0.9345, "mean_token_accuracy": 0.7551386684179306, "num_tokens": 96197722.0, "step": 1020 }, { "entropy": 1.3748439356684685, "epoch": 0.22852071662321816, "grad_norm": 0.55078125, "learning_rate": 3.8586956521739134e-05, "loss": 0.9714, "mean_token_accuracy": 0.7462637320160865, "num_tokens": 97155014.0, "step": 1030 }, { "entropy": 1.40400949716568, "epoch": 0.23073936435742415, "grad_norm": 0.515625, "learning_rate": 3.8476042590949426e-05, "loss": 0.9907, "mean_token_accuracy": 0.7466505110263825, "num_tokens": 98110510.0, "step": 1040 }, { "entropy": 1.3614235058426858, "epoch": 0.23295801209163014, "grad_norm": 0.51171875, "learning_rate": 3.836512866015972e-05, "loss": 0.9528, "mean_token_accuracy": 0.7518561266362667, "num_tokens": 99062700.0, "step": 1050 }, { "entropy": 1.3811719179153443, "epoch": 0.23517665982583616, "grad_norm": 0.5859375, "learning_rate": 3.825421472937001e-05, "loss": 0.9715, "mean_token_accuracy": 0.7507105618715286, "num_tokens": 100002449.0, "step": 1060 }, { "entropy": 1.3694360241293908, "epoch": 0.23739530756004215, "grad_norm": 0.5390625, "learning_rate": 3.814330079858031e-05, "loss": 0.9393, "mean_token_accuracy": 0.7542741730809212, "num_tokens": 100944775.0, "step": 1070 }, { "entropy": 1.368511787056923, "epoch": 0.23961395529424814, "grad_norm": 0.52734375, "learning_rate": 3.80323868677906e-05, "loss": 0.9583, "mean_token_accuracy": 0.7501736409962177, "num_tokens": 101889263.0, "step": 1080 }, { "entropy": 1.410076305270195, "epoch": 0.24183260302845416, "grad_norm": 0.578125, "learning_rate": 3.7921472937000893e-05, "loss": 0.9805, "mean_token_accuracy": 0.745997640490532, "num_tokens": 102806738.0, "step": 1090 }, { "entropy": 1.3686684682965278, "epoch": 0.24405125076266015, "grad_norm": 0.5546875, "learning_rate": 3.7810559006211186e-05, "loss": 0.9533, "mean_token_accuracy": 0.7539502412080765, "num_tokens": 103757882.0, "step": 1100 }, { "entropy": 1.3773868307471275, "epoch": 0.24626989849686615, "grad_norm": 0.546875, "learning_rate": 3.769964507542148e-05, "loss": 0.9674, "mean_token_accuracy": 0.7515710204839706, "num_tokens": 104700330.0, "step": 1110 }, { "entropy": 1.3980351358652114, "epoch": 0.24848854623107217, "grad_norm": 0.578125, "learning_rate": 3.758873114463177e-05, "loss": 1.0042, "mean_token_accuracy": 0.7424275025725364, "num_tokens": 105631653.0, "step": 1120 }, { "entropy": 1.399548628926277, "epoch": 0.2507071939652782, "grad_norm": 0.5, "learning_rate": 3.747781721384206e-05, "loss": 0.9793, "mean_token_accuracy": 0.7482922926545144, "num_tokens": 106578177.0, "step": 1130 }, { "entropy": 1.3911961004137994, "epoch": 0.2529258416994842, "grad_norm": 0.5390625, "learning_rate": 3.7366903283052354e-05, "loss": 0.9861, "mean_token_accuracy": 0.7463311538100242, "num_tokens": 107501771.0, "step": 1140 }, { "entropy": 1.3983097136020661, "epoch": 0.25514448943369017, "grad_norm": 0.5390625, "learning_rate": 3.7255989352262646e-05, "loss": 1.0009, "mean_token_accuracy": 0.739760322123766, "num_tokens": 108461011.0, "step": 1150 }, { "entropy": 1.3597055405378342, "epoch": 0.25736313716789616, "grad_norm": 0.53125, "learning_rate": 3.714507542147294e-05, "loss": 0.9549, "mean_token_accuracy": 0.7523537255823612, "num_tokens": 109400402.0, "step": 1160 }, { "entropy": 1.388819195330143, "epoch": 0.25958178490210215, "grad_norm": 0.5078125, "learning_rate": 3.703416149068323e-05, "loss": 0.9474, "mean_token_accuracy": 0.7524086780846119, "num_tokens": 110311375.0, "step": 1170 }, { "entropy": 1.379358747601509, "epoch": 0.26180043263630814, "grad_norm": 0.58984375, "learning_rate": 3.692324755989352e-05, "loss": 0.9753, "mean_token_accuracy": 0.7477897442877293, "num_tokens": 111250331.0, "step": 1180 }, { "entropy": 1.3828957468271255, "epoch": 0.2640190803705142, "grad_norm": 0.58984375, "learning_rate": 3.6812333629103815e-05, "loss": 0.9848, "mean_token_accuracy": 0.746380465477705, "num_tokens": 112170443.0, "step": 1190 }, { "entropy": 1.3847462825477124, "epoch": 0.2662377281047202, "grad_norm": 0.578125, "learning_rate": 3.670141969831411e-05, "loss": 1.0014, "mean_token_accuracy": 0.7441351152956486, "num_tokens": 113114776.0, "step": 1200 }, { "entropy": 1.3747013211250305, "epoch": 0.2684563758389262, "grad_norm": 0.58984375, "learning_rate": 3.65905057675244e-05, "loss": 0.9892, "mean_token_accuracy": 0.7449555344879627, "num_tokens": 114040694.0, "step": 1210 }, { "entropy": 1.365119245648384, "epoch": 0.27067502357313217, "grad_norm": 0.546875, "learning_rate": 3.64795918367347e-05, "loss": 0.9687, "mean_token_accuracy": 0.7497834034264088, "num_tokens": 114961852.0, "step": 1220 }, { "entropy": 1.3869122669100762, "epoch": 0.27289367130733816, "grad_norm": 0.5234375, "learning_rate": 3.636867790594499e-05, "loss": 0.9936, "mean_token_accuracy": 0.7449170716106892, "num_tokens": 115901546.0, "step": 1230 }, { "entropy": 1.3620765566825868, "epoch": 0.2751123190415442, "grad_norm": 0.546875, "learning_rate": 3.625776397515528e-05, "loss": 0.9864, "mean_token_accuracy": 0.7458140067756176, "num_tokens": 116860680.0, "step": 1240 }, { "entropy": 1.3624719701707364, "epoch": 0.2773309667757502, "grad_norm": 0.5234375, "learning_rate": 3.6146850044365574e-05, "loss": 0.9459, "mean_token_accuracy": 0.7540639825165272, "num_tokens": 117800641.0, "step": 1250 }, { "entropy": 1.3767011970281602, "epoch": 0.2795496145099562, "grad_norm": 0.51171875, "learning_rate": 3.6035936113575866e-05, "loss": 0.9688, "mean_token_accuracy": 0.7501399800181389, "num_tokens": 118740256.0, "step": 1260 }, { "entropy": 1.4025324523448943, "epoch": 0.2817682622441622, "grad_norm": 0.53515625, "learning_rate": 3.592502218278616e-05, "loss": 0.9919, "mean_token_accuracy": 0.7443845957517624, "num_tokens": 119678821.0, "step": 1270 }, { "entropy": 1.3981096863746643, "epoch": 0.2839869099783682, "grad_norm": 0.53515625, "learning_rate": 3.581410825199645e-05, "loss": 1.0089, "mean_token_accuracy": 0.7398683115839958, "num_tokens": 120625856.0, "step": 1280 }, { "entropy": 1.3836973875761032, "epoch": 0.28620555771257417, "grad_norm": 0.53125, "learning_rate": 3.570319432120674e-05, "loss": 0.9833, "mean_token_accuracy": 0.7469960272312164, "num_tokens": 121548463.0, "step": 1290 }, { "entropy": 1.3693345814943314, "epoch": 0.2884242054467802, "grad_norm": 0.546875, "learning_rate": 3.5592280390417035e-05, "loss": 0.9547, "mean_token_accuracy": 0.753000732511282, "num_tokens": 122510112.0, "step": 1300 }, { "entropy": 1.4061051934957505, "epoch": 0.2906428531809862, "grad_norm": 0.5546875, "learning_rate": 3.548136645962733e-05, "loss": 1.0049, "mean_token_accuracy": 0.7414190582931042, "num_tokens": 123443396.0, "step": 1310 }, { "entropy": 1.3867851234972477, "epoch": 0.2928615009151922, "grad_norm": 0.56640625, "learning_rate": 3.537045252883762e-05, "loss": 0.979, "mean_token_accuracy": 0.7475081883370877, "num_tokens": 124388251.0, "step": 1320 }, { "entropy": 1.344521164894104, "epoch": 0.2950801486493982, "grad_norm": 0.56640625, "learning_rate": 3.525953859804791e-05, "loss": 0.9338, "mean_token_accuracy": 0.7572960302233696, "num_tokens": 125308765.0, "step": 1330 }, { "entropy": 1.3636821061372757, "epoch": 0.2972987963836042, "grad_norm": 0.53515625, "learning_rate": 3.514862466725821e-05, "loss": 0.962, "mean_token_accuracy": 0.7506850846111774, "num_tokens": 126245879.0, "step": 1340 }, { "entropy": 1.3687437891960144, "epoch": 0.29951744411781017, "grad_norm": 0.57421875, "learning_rate": 3.50377107364685e-05, "loss": 0.9639, "mean_token_accuracy": 0.752644594758749, "num_tokens": 127190476.0, "step": 1350 }, { "entropy": 1.3999216251075268, "epoch": 0.3017360918520162, "grad_norm": 0.6015625, "learning_rate": 3.4926796805678794e-05, "loss": 0.9869, "mean_token_accuracy": 0.7462087258696556, "num_tokens": 128115779.0, "step": 1360 }, { "entropy": 1.4003167398273946, "epoch": 0.3039547395862222, "grad_norm": 0.5546875, "learning_rate": 3.481588287488909e-05, "loss": 0.9984, "mean_token_accuracy": 0.7460517160594463, "num_tokens": 129062385.0, "step": 1370 }, { "entropy": 1.3807271018624305, "epoch": 0.3061733873204282, "grad_norm": 0.5390625, "learning_rate": 3.470496894409938e-05, "loss": 0.9805, "mean_token_accuracy": 0.7482168138027191, "num_tokens": 129990458.0, "step": 1380 }, { "entropy": 1.37543828189373, "epoch": 0.3083920350546342, "grad_norm": 0.5859375, "learning_rate": 3.459405501330967e-05, "loss": 0.9771, "mean_token_accuracy": 0.7474354840815067, "num_tokens": 130948775.0, "step": 1390 }, { "entropy": 1.3704403668642045, "epoch": 0.3106106827888402, "grad_norm": 0.58203125, "learning_rate": 3.448314108251996e-05, "loss": 0.9605, "mean_token_accuracy": 0.7510613188147545, "num_tokens": 131878796.0, "step": 1400 }, { "entropy": 1.3957126244902611, "epoch": 0.3128293305230462, "grad_norm": 0.609375, "learning_rate": 3.4372227151730255e-05, "loss": 0.9645, "mean_token_accuracy": 0.7498879425227643, "num_tokens": 132834250.0, "step": 1410 }, { "entropy": 1.3521507486701012, "epoch": 0.3150479782572522, "grad_norm": 0.57421875, "learning_rate": 3.426131322094055e-05, "loss": 0.9519, "mean_token_accuracy": 0.7529676407575607, "num_tokens": 133772698.0, "step": 1420 }, { "entropy": 1.3797581896185875, "epoch": 0.3172666259914582, "grad_norm": 0.55859375, "learning_rate": 3.415039929015084e-05, "loss": 1.0067, "mean_token_accuracy": 0.7427522405982018, "num_tokens": 134726995.0, "step": 1430 }, { "entropy": 1.3857417300343513, "epoch": 0.3194852737256642, "grad_norm": 0.546875, "learning_rate": 3.403948535936114e-05, "loss": 1.0038, "mean_token_accuracy": 0.7424978382885457, "num_tokens": 135683552.0, "step": 1440 }, { "entropy": 1.4185665279626847, "epoch": 0.3217039214598702, "grad_norm": 0.52734375, "learning_rate": 3.392857142857143e-05, "loss": 1.0188, "mean_token_accuracy": 0.7394578918814659, "num_tokens": 136633106.0, "step": 1450 }, { "entropy": 1.3622751355171203, "epoch": 0.3239225691940762, "grad_norm": 0.59375, "learning_rate": 3.381765749778172e-05, "loss": 0.9698, "mean_token_accuracy": 0.7495865255594254, "num_tokens": 137586751.0, "step": 1460 }, { "entropy": 1.3379265323281289, "epoch": 0.3261412169282822, "grad_norm": 0.51171875, "learning_rate": 3.3706743566992015e-05, "loss": 0.9467, "mean_token_accuracy": 0.7519558638334274, "num_tokens": 138558225.0, "step": 1470 }, { "entropy": 1.3717472016811372, "epoch": 0.32835986466248823, "grad_norm": 0.546875, "learning_rate": 3.359582963620231e-05, "loss": 0.9353, "mean_token_accuracy": 0.7551800265908242, "num_tokens": 139493320.0, "step": 1480 }, { "entropy": 1.3652813754975797, "epoch": 0.3305785123966942, "grad_norm": 0.55078125, "learning_rate": 3.34849157054126e-05, "loss": 0.9574, "mean_token_accuracy": 0.7501180328428745, "num_tokens": 140431349.0, "step": 1490 }, { "entropy": 1.3436471790075302, "epoch": 0.3327971601309002, "grad_norm": 0.498046875, "learning_rate": 3.337400177462289e-05, "loss": 0.9565, "mean_token_accuracy": 0.7528107918798923, "num_tokens": 141372798.0, "step": 1500 }, { "entropy": 1.3558987267315388, "epoch": 0.3350158078651062, "grad_norm": 0.55859375, "learning_rate": 3.326308784383318e-05, "loss": 0.9391, "mean_token_accuracy": 0.7559271931648255, "num_tokens": 142315033.0, "step": 1510 }, { "entropy": 1.378397299349308, "epoch": 0.3372344555993122, "grad_norm": 0.5625, "learning_rate": 3.3152173913043475e-05, "loss": 0.9726, "mean_token_accuracy": 0.7490174636244774, "num_tokens": 143248295.0, "step": 1520 }, { "entropy": 1.377681267261505, "epoch": 0.33945310333351825, "grad_norm": 0.6015625, "learning_rate": 3.3041259982253774e-05, "loss": 0.9705, "mean_token_accuracy": 0.7475920669734478, "num_tokens": 144215440.0, "step": 1530 }, { "entropy": 1.3835771530866623, "epoch": 0.34167175106772424, "grad_norm": 0.56640625, "learning_rate": 3.2930346051464066e-05, "loss": 0.9578, "mean_token_accuracy": 0.7509067423641682, "num_tokens": 145154667.0, "step": 1540 }, { "entropy": 1.3816084749996662, "epoch": 0.34389039880193023, "grad_norm": 0.59765625, "learning_rate": 3.281943212067436e-05, "loss": 0.9694, "mean_token_accuracy": 0.7493415616452694, "num_tokens": 146091705.0, "step": 1550 }, { "entropy": 1.3724812373518944, "epoch": 0.3461090465361362, "grad_norm": 0.52734375, "learning_rate": 3.270851818988465e-05, "loss": 0.9904, "mean_token_accuracy": 0.7453893661499024, "num_tokens": 147020656.0, "step": 1560 }, { "entropy": 1.3804431870579719, "epoch": 0.3483276942703422, "grad_norm": 0.59375, "learning_rate": 3.259760425909494e-05, "loss": 0.9758, "mean_token_accuracy": 0.7461709767580033, "num_tokens": 147947728.0, "step": 1570 }, { "entropy": 1.344531001150608, "epoch": 0.3505463420045482, "grad_norm": 0.54296875, "learning_rate": 3.2486690328305235e-05, "loss": 0.9415, "mean_token_accuracy": 0.7543717570602894, "num_tokens": 148884865.0, "step": 1580 }, { "entropy": 1.3736070185899734, "epoch": 0.35276498973875425, "grad_norm": 0.50390625, "learning_rate": 3.237577639751553e-05, "loss": 0.9788, "mean_token_accuracy": 0.7499733969569207, "num_tokens": 149835556.0, "step": 1590 }, { "entropy": 1.3565202325582504, "epoch": 0.35498363747296025, "grad_norm": 0.53515625, "learning_rate": 3.226486246672582e-05, "loss": 0.968, "mean_token_accuracy": 0.7509596891701221, "num_tokens": 150782722.0, "step": 1600 }, { "entropy": 1.3689987510442734, "epoch": 0.35720228520716624, "grad_norm": 0.53515625, "learning_rate": 3.215394853593611e-05, "loss": 0.9624, "mean_token_accuracy": 0.7504870064556599, "num_tokens": 151727765.0, "step": 1610 }, { "entropy": 1.379437492787838, "epoch": 0.35942093294137223, "grad_norm": 0.56640625, "learning_rate": 3.204303460514641e-05, "loss": 0.9932, "mean_token_accuracy": 0.7445692121982574, "num_tokens": 152665685.0, "step": 1620 }, { "entropy": 1.3387732088565827, "epoch": 0.3616395806755782, "grad_norm": 0.5234375, "learning_rate": 3.19321206743567e-05, "loss": 0.9236, "mean_token_accuracy": 0.7576431512832642, "num_tokens": 153588690.0, "step": 1630 }, { "entropy": 1.3826099798083304, "epoch": 0.3638582284097842, "grad_norm": 0.54296875, "learning_rate": 3.1821206743566994e-05, "loss": 0.9605, "mean_token_accuracy": 0.7498526185750961, "num_tokens": 154534943.0, "step": 1640 }, { "entropy": 1.3945626512169838, "epoch": 0.36607687614399026, "grad_norm": 0.56640625, "learning_rate": 3.171029281277729e-05, "loss": 0.9766, "mean_token_accuracy": 0.7471479557454586, "num_tokens": 155476773.0, "step": 1650 }, { "entropy": 1.3412572763860227, "epoch": 0.36829552387819625, "grad_norm": 0.5390625, "learning_rate": 3.159937888198758e-05, "loss": 0.9292, "mean_token_accuracy": 0.7570768728852272, "num_tokens": 156445013.0, "step": 1660 }, { "entropy": 1.40811278373003, "epoch": 0.37051417161240224, "grad_norm": 0.56640625, "learning_rate": 3.148846495119787e-05, "loss": 1.0066, "mean_token_accuracy": 0.7419991612434387, "num_tokens": 157379214.0, "step": 1670 }, { "entropy": 1.3919242292642593, "epoch": 0.37273281934660824, "grad_norm": 0.5390625, "learning_rate": 3.137755102040816e-05, "loss": 0.9923, "mean_token_accuracy": 0.7452871352434158, "num_tokens": 158317725.0, "step": 1680 }, { "entropy": 1.3682388715445994, "epoch": 0.3749514670808142, "grad_norm": 0.5234375, "learning_rate": 3.1266637089618455e-05, "loss": 0.9562, "mean_token_accuracy": 0.752392964810133, "num_tokens": 159245900.0, "step": 1690 }, { "entropy": 1.3978073075413704, "epoch": 0.3771701148150202, "grad_norm": 0.59375, "learning_rate": 3.115572315882875e-05, "loss": 0.9959, "mean_token_accuracy": 0.7438707917928695, "num_tokens": 160206241.0, "step": 1700 }, { "entropy": 1.4060526877641677, "epoch": 0.37938876254922627, "grad_norm": 0.57421875, "learning_rate": 3.1044809228039046e-05, "loss": 0.9784, "mean_token_accuracy": 0.7466170206665993, "num_tokens": 161122737.0, "step": 1710 }, { "entropy": 1.4011815950274467, "epoch": 0.38160741028343226, "grad_norm": 0.54296875, "learning_rate": 3.093389529724934e-05, "loss": 1.0119, "mean_token_accuracy": 0.7434992685914039, "num_tokens": 162060602.0, "step": 1720 }, { "entropy": 1.3772536285221577, "epoch": 0.38382605801763825, "grad_norm": 0.55859375, "learning_rate": 3.082298136645963e-05, "loss": 0.9844, "mean_token_accuracy": 0.7481080301105976, "num_tokens": 162999081.0, "step": 1730 }, { "entropy": 1.3987220972776413, "epoch": 0.38604470575184424, "grad_norm": 0.5625, "learning_rate": 3.071206743566992e-05, "loss": 1.0022, "mean_token_accuracy": 0.7418422900140286, "num_tokens": 163922873.0, "step": 1740 }, { "entropy": 1.3580266810953616, "epoch": 0.38826335348605023, "grad_norm": 0.53515625, "learning_rate": 3.0601153504880215e-05, "loss": 0.9563, "mean_token_accuracy": 0.752074807882309, "num_tokens": 164870247.0, "step": 1750 }, { "entropy": 1.3677964322268963, "epoch": 0.3904820012202563, "grad_norm": 0.51953125, "learning_rate": 3.0490239574090507e-05, "loss": 0.9511, "mean_token_accuracy": 0.7535176068544388, "num_tokens": 165824528.0, "step": 1760 }, { "entropy": 1.3590489372611045, "epoch": 0.3927006489544623, "grad_norm": 0.54296875, "learning_rate": 3.03793256433008e-05, "loss": 0.9561, "mean_token_accuracy": 0.7521475218236446, "num_tokens": 166773198.0, "step": 1770 }, { "entropy": 1.339786247909069, "epoch": 0.39491929668866826, "grad_norm": 0.5078125, "learning_rate": 3.026841171251109e-05, "loss": 0.9227, "mean_token_accuracy": 0.7592316955327988, "num_tokens": 167718580.0, "step": 1780 }, { "entropy": 1.3726042732596397, "epoch": 0.39713794442287426, "grad_norm": 0.55859375, "learning_rate": 3.0157497781721383e-05, "loss": 0.99, "mean_token_accuracy": 0.7463804952800274, "num_tokens": 168655387.0, "step": 1790 }, { "entropy": 1.3457361325621604, "epoch": 0.39935659215708025, "grad_norm": 0.55078125, "learning_rate": 3.0046583850931682e-05, "loss": 0.9287, "mean_token_accuracy": 0.7580367386341095, "num_tokens": 169603547.0, "step": 1800 }, { "entropy": 1.3527330666780473, "epoch": 0.40157523989128624, "grad_norm": 0.55078125, "learning_rate": 2.9935669920141974e-05, "loss": 0.9564, "mean_token_accuracy": 0.7514573320746422, "num_tokens": 170533507.0, "step": 1810 }, { "entropy": 1.3654260367155076, "epoch": 0.4037938876254923, "grad_norm": 0.5546875, "learning_rate": 2.9824755989352266e-05, "loss": 0.9561, "mean_token_accuracy": 0.7531027749180794, "num_tokens": 171483258.0, "step": 1820 }, { "entropy": 1.4081357181072236, "epoch": 0.4060125353596983, "grad_norm": 0.51953125, "learning_rate": 2.971384205856256e-05, "loss": 0.9983, "mean_token_accuracy": 0.7425357937812805, "num_tokens": 172403233.0, "step": 1830 }, { "entropy": 1.389841765165329, "epoch": 0.40823118309390427, "grad_norm": 0.546875, "learning_rate": 2.960292812777285e-05, "loss": 0.968, "mean_token_accuracy": 0.7487305231392384, "num_tokens": 173339638.0, "step": 1840 }, { "entropy": 1.3511977650225162, "epoch": 0.41044983082811026, "grad_norm": 0.5625, "learning_rate": 2.9492014196983143e-05, "loss": 0.9522, "mean_token_accuracy": 0.7524490259587765, "num_tokens": 174277349.0, "step": 1850 }, { "entropy": 1.370618349313736, "epoch": 0.41266847856231625, "grad_norm": 0.5390625, "learning_rate": 2.9381100266193435e-05, "loss": 0.9907, "mean_token_accuracy": 0.7455039098858833, "num_tokens": 175210470.0, "step": 1860 }, { "entropy": 1.375410833209753, "epoch": 0.41488712629652225, "grad_norm": 0.59375, "learning_rate": 2.9270186335403727e-05, "loss": 0.9642, "mean_token_accuracy": 0.7496527746319771, "num_tokens": 176159361.0, "step": 1870 }, { "entropy": 1.4184004172682763, "epoch": 0.4171057740307283, "grad_norm": 0.55078125, "learning_rate": 2.915927240461402e-05, "loss": 0.9773, "mean_token_accuracy": 0.7471778780221939, "num_tokens": 177113588.0, "step": 1880 }, { "entropy": 1.371988333016634, "epoch": 0.4193244217649343, "grad_norm": 0.60546875, "learning_rate": 2.9048358473824318e-05, "loss": 0.9657, "mean_token_accuracy": 0.7511657826602459, "num_tokens": 178060888.0, "step": 1890 }, { "entropy": 1.3363316491246224, "epoch": 0.4215430694991403, "grad_norm": 0.52734375, "learning_rate": 2.893744454303461e-05, "loss": 0.9525, "mean_token_accuracy": 0.7519229985773563, "num_tokens": 179031885.0, "step": 1900 }, { "entropy": 1.3726731419563294, "epoch": 0.42376171723334627, "grad_norm": 0.51953125, "learning_rate": 2.8826530612244902e-05, "loss": 0.9915, "mean_token_accuracy": 0.744737395644188, "num_tokens": 179972132.0, "step": 1910 }, { "entropy": 1.3594248294830322, "epoch": 0.42598036496755226, "grad_norm": 0.609375, "learning_rate": 2.8715616681455194e-05, "loss": 0.9348, "mean_token_accuracy": 0.7559118025004864, "num_tokens": 180897094.0, "step": 1920 }, { "entropy": 1.362018422782421, "epoch": 0.42819901270175825, "grad_norm": 0.5390625, "learning_rate": 2.8604702750665487e-05, "loss": 0.9602, "mean_token_accuracy": 0.752437824010849, "num_tokens": 181838585.0, "step": 1930 }, { "entropy": 1.3808824971318245, "epoch": 0.4304176604359643, "grad_norm": 0.48828125, "learning_rate": 2.849378881987578e-05, "loss": 0.9584, "mean_token_accuracy": 0.7506703034043312, "num_tokens": 182803310.0, "step": 1940 }, { "entropy": 1.3881346195936204, "epoch": 0.4326363081701703, "grad_norm": 0.5234375, "learning_rate": 2.838287488908607e-05, "loss": 0.9875, "mean_token_accuracy": 0.74772829413414, "num_tokens": 183738214.0, "step": 1950 }, { "entropy": 1.3855524227023124, "epoch": 0.4348549559043763, "grad_norm": 0.58984375, "learning_rate": 2.8271960958296363e-05, "loss": 0.9521, "mean_token_accuracy": 0.7537846647202968, "num_tokens": 184688269.0, "step": 1960 }, { "entropy": 1.3399414360523223, "epoch": 0.4370736036385823, "grad_norm": 0.5546875, "learning_rate": 2.8161047027506655e-05, "loss": 0.9376, "mean_token_accuracy": 0.7547785393893719, "num_tokens": 185645274.0, "step": 1970 }, { "entropy": 1.3971083626151084, "epoch": 0.43929225137278827, "grad_norm": 0.56640625, "learning_rate": 2.8050133096716947e-05, "loss": 0.9953, "mean_token_accuracy": 0.7458565980195999, "num_tokens": 186569593.0, "step": 1980 }, { "entropy": 1.3322325393557548, "epoch": 0.4415108991069943, "grad_norm": 0.52734375, "learning_rate": 2.7939219165927243e-05, "loss": 0.9555, "mean_token_accuracy": 0.7513496160507203, "num_tokens": 187496284.0, "step": 1990 }, { "entropy": 1.3293438203632832, "epoch": 0.4437295468412003, "grad_norm": 0.50390625, "learning_rate": 2.7828305235137535e-05, "loss": 0.9171, "mean_token_accuracy": 0.7596317879855633, "num_tokens": 188468895.0, "step": 2000 }, { "entropy": 1.3781484201550485, "epoch": 0.4459481945754063, "grad_norm": 0.5703125, "learning_rate": 2.7717391304347827e-05, "loss": 0.973, "mean_token_accuracy": 0.7494061894714832, "num_tokens": 189421874.0, "step": 2010 }, { "entropy": 1.3695954069495202, "epoch": 0.4481668423096123, "grad_norm": 0.53125, "learning_rate": 2.760647737355812e-05, "loss": 0.9614, "mean_token_accuracy": 0.7509508669376374, "num_tokens": 190340227.0, "step": 2020 }, { "entropy": 1.3875800400972367, "epoch": 0.4503854900438183, "grad_norm": 0.546875, "learning_rate": 2.749556344276841e-05, "loss": 0.994, "mean_token_accuracy": 0.7431605853140354, "num_tokens": 191305091.0, "step": 2030 }, { "entropy": 1.3755045652389526, "epoch": 0.4526041377780243, "grad_norm": 0.52734375, "learning_rate": 2.7384649511978703e-05, "loss": 0.9649, "mean_token_accuracy": 0.7511213339865208, "num_tokens": 192292813.0, "step": 2040 }, { "entropy": 1.3822910636663437, "epoch": 0.4548227855122303, "grad_norm": 0.5546875, "learning_rate": 2.7273735581188996e-05, "loss": 0.9573, "mean_token_accuracy": 0.7524046942591667, "num_tokens": 193217411.0, "step": 2050 }, { "entropy": 1.3644483625888824, "epoch": 0.4570414332464363, "grad_norm": 0.5625, "learning_rate": 2.7162821650399288e-05, "loss": 0.9715, "mean_token_accuracy": 0.7478004738688468, "num_tokens": 194156737.0, "step": 2060 }, { "entropy": 1.3972303479909898, "epoch": 0.4592600809806423, "grad_norm": 0.6015625, "learning_rate": 2.7051907719609583e-05, "loss": 0.9795, "mean_token_accuracy": 0.7456590063869953, "num_tokens": 195099008.0, "step": 2070 }, { "entropy": 1.3703369855880738, "epoch": 0.4614787287148483, "grad_norm": 0.5546875, "learning_rate": 2.694099378881988e-05, "loss": 0.9714, "mean_token_accuracy": 0.7501253761351109, "num_tokens": 196007058.0, "step": 2080 }, { "entropy": 1.339685134589672, "epoch": 0.4636973764490543, "grad_norm": 0.56640625, "learning_rate": 2.683007985803017e-05, "loss": 0.9191, "mean_token_accuracy": 0.7610551118850708, "num_tokens": 196927119.0, "step": 2090 }, { "entropy": 1.3603023558855056, "epoch": 0.4659160241832603, "grad_norm": 1.1953125, "learning_rate": 2.6719165927240463e-05, "loss": 0.9522, "mean_token_accuracy": 0.75257783010602, "num_tokens": 197839234.0, "step": 2100 }, { "entropy": 1.3676279373466969, "epoch": 0.4681346719174663, "grad_norm": 0.578125, "learning_rate": 2.6608251996450755e-05, "loss": 0.9579, "mean_token_accuracy": 0.7518479220569134, "num_tokens": 198780897.0, "step": 2110 }, { "entropy": 1.3504170298576355, "epoch": 0.4703533196516723, "grad_norm": 0.578125, "learning_rate": 2.6497338065661047e-05, "loss": 0.92, "mean_token_accuracy": 0.7589939460158348, "num_tokens": 199720325.0, "step": 2120 }, { "entropy": 1.3881437584757805, "epoch": 0.4725719673858783, "grad_norm": 0.58203125, "learning_rate": 2.638642413487134e-05, "loss": 0.9739, "mean_token_accuracy": 0.7481762118637562, "num_tokens": 200688333.0, "step": 2130 }, { "entropy": 1.330506893992424, "epoch": 0.4747906151200843, "grad_norm": 0.546875, "learning_rate": 2.627551020408163e-05, "loss": 0.9364, "mean_token_accuracy": 0.7579016864299775, "num_tokens": 201637839.0, "step": 2140 }, { "entropy": 1.3658654704689979, "epoch": 0.4770092628542903, "grad_norm": 0.5546875, "learning_rate": 2.6164596273291924e-05, "loss": 0.9634, "mean_token_accuracy": 0.7504187069833279, "num_tokens": 202576401.0, "step": 2150 }, { "entropy": 1.3995375514030457, "epoch": 0.4792279105884963, "grad_norm": 0.55859375, "learning_rate": 2.6053682342502216e-05, "loss": 0.9965, "mean_token_accuracy": 0.7445818439126015, "num_tokens": 203487024.0, "step": 2160 }, { "entropy": 1.3725049093365669, "epoch": 0.48144655832270233, "grad_norm": 0.57421875, "learning_rate": 2.5942768411712515e-05, "loss": 0.9864, "mean_token_accuracy": 0.7470806054770947, "num_tokens": 204381436.0, "step": 2170 }, { "entropy": 1.394498337805271, "epoch": 0.4836652060569083, "grad_norm": 0.578125, "learning_rate": 2.5831854480922807e-05, "loss": 1.0076, "mean_token_accuracy": 0.7424398958683014, "num_tokens": 205293197.0, "step": 2180 }, { "entropy": 1.347807565331459, "epoch": 0.4858838537911143, "grad_norm": 0.5234375, "learning_rate": 2.57209405501331e-05, "loss": 0.9339, "mean_token_accuracy": 0.755316337198019, "num_tokens": 206231536.0, "step": 2190 }, { "entropy": 1.3778870403766632, "epoch": 0.4881025015253203, "grad_norm": 0.56640625, "learning_rate": 2.561002661934339e-05, "loss": 0.9378, "mean_token_accuracy": 0.7550853170454502, "num_tokens": 207184815.0, "step": 2200 }, { "entropy": 1.3568516939878463, "epoch": 0.4903211492595263, "grad_norm": 0.546875, "learning_rate": 2.5499112688553683e-05, "loss": 0.9557, "mean_token_accuracy": 0.75401069521904, "num_tokens": 208171394.0, "step": 2210 }, { "entropy": 1.366741893440485, "epoch": 0.4925397969937323, "grad_norm": 0.5546875, "learning_rate": 2.5388198757763975e-05, "loss": 0.9875, "mean_token_accuracy": 0.7449213482439518, "num_tokens": 209122216.0, "step": 2220 }, { "entropy": 1.3530812025070191, "epoch": 0.49475844472793834, "grad_norm": 0.54296875, "learning_rate": 2.5277284826974267e-05, "loss": 0.9549, "mean_token_accuracy": 0.7526767641305924, "num_tokens": 210056877.0, "step": 2230 }, { "entropy": 1.3858793810009957, "epoch": 0.49697709246214433, "grad_norm": 0.5625, "learning_rate": 2.516637089618456e-05, "loss": 0.9739, "mean_token_accuracy": 0.7475887909531593, "num_tokens": 210991604.0, "step": 2240 }, { "entropy": 1.3336512438952923, "epoch": 0.4991957401963503, "grad_norm": 0.53125, "learning_rate": 2.5055456965394852e-05, "loss": 0.9656, "mean_token_accuracy": 0.7508934259414672, "num_tokens": 211969946.0, "step": 2250 }, { "entropy": 1.3388653613626957, "epoch": 0.5014143879305564, "grad_norm": 0.50390625, "learning_rate": 2.4944543034605147e-05, "loss": 0.9543, "mean_token_accuracy": 0.7524459935724735, "num_tokens": 212910816.0, "step": 2260 }, { "entropy": 1.3453195527195931, "epoch": 0.5036330356647624, "grad_norm": 0.5, "learning_rate": 2.483362910381544e-05, "loss": 0.9375, "mean_token_accuracy": 0.7574634417891503, "num_tokens": 213850669.0, "step": 2270 }, { "entropy": 1.379884372651577, "epoch": 0.5058516833989684, "grad_norm": 0.53125, "learning_rate": 2.4722715173025735e-05, "loss": 0.9684, "mean_token_accuracy": 0.7486192204058171, "num_tokens": 214804067.0, "step": 2280 }, { "entropy": 1.3893992975354195, "epoch": 0.5080703311331743, "grad_norm": 0.5625, "learning_rate": 2.4611801242236027e-05, "loss": 0.9918, "mean_token_accuracy": 0.7460889652371406, "num_tokens": 215757019.0, "step": 2290 }, { "entropy": 1.3814901292324067, "epoch": 0.5102889788673803, "grad_norm": 0.5703125, "learning_rate": 2.450088731144632e-05, "loss": 0.9704, "mean_token_accuracy": 0.7471752442419529, "num_tokens": 216694493.0, "step": 2300 }, { "entropy": 1.3929108276963234, "epoch": 0.5125076266015863, "grad_norm": 0.86328125, "learning_rate": 2.438997338065661e-05, "loss": 0.9768, "mean_token_accuracy": 0.7484888419508934, "num_tokens": 217602175.0, "step": 2310 }, { "entropy": 1.397246466577053, "epoch": 0.5147262743357923, "grad_norm": 0.57421875, "learning_rate": 2.4279059449866903e-05, "loss": 0.9896, "mean_token_accuracy": 0.7446176953613758, "num_tokens": 218550783.0, "step": 2320 }, { "entropy": 1.3812805399298669, "epoch": 0.5169449220699983, "grad_norm": 0.5390625, "learning_rate": 2.41681455190772e-05, "loss": 0.9568, "mean_token_accuracy": 0.7516316212713718, "num_tokens": 219509393.0, "step": 2330 }, { "entropy": 1.3913217656314374, "epoch": 0.5191635698042043, "grad_norm": 0.55078125, "learning_rate": 2.405723158828749e-05, "loss": 0.994, "mean_token_accuracy": 0.7467503845691681, "num_tokens": 220442797.0, "step": 2340 }, { "entropy": 1.366735403239727, "epoch": 0.5213822175384103, "grad_norm": 0.54296875, "learning_rate": 2.3946317657497783e-05, "loss": 0.9649, "mean_token_accuracy": 0.7511637844145298, "num_tokens": 221403315.0, "step": 2350 }, { "entropy": 1.3902854323387146, "epoch": 0.5236008652726163, "grad_norm": 0.578125, "learning_rate": 2.3835403726708075e-05, "loss": 0.9796, "mean_token_accuracy": 0.7477660529315472, "num_tokens": 222332544.0, "step": 2360 }, { "entropy": 1.372003583610058, "epoch": 0.5258195130068224, "grad_norm": 0.58984375, "learning_rate": 2.372448979591837e-05, "loss": 0.9539, "mean_token_accuracy": 0.7518885858356953, "num_tokens": 223241356.0, "step": 2370 }, { "entropy": 1.3928717270493507, "epoch": 0.5280381607410284, "grad_norm": 0.5546875, "learning_rate": 2.3613575865128663e-05, "loss": 0.9886, "mean_token_accuracy": 0.7441101655364036, "num_tokens": 224188072.0, "step": 2380 }, { "entropy": 1.3675744011998177, "epoch": 0.5302568084752344, "grad_norm": 0.5859375, "learning_rate": 2.3502661934338955e-05, "loss": 0.9666, "mean_token_accuracy": 0.7499430425465107, "num_tokens": 225139376.0, "step": 2390 }, { "entropy": 1.366236688196659, "epoch": 0.5324754562094404, "grad_norm": 0.53125, "learning_rate": 2.3391748003549247e-05, "loss": 0.9545, "mean_token_accuracy": 0.7533385291695595, "num_tokens": 226081728.0, "step": 2400 }, { "entropy": 1.3825654938817025, "epoch": 0.5346941039436464, "grad_norm": 0.52734375, "learning_rate": 2.328083407275954e-05, "loss": 0.9758, "mean_token_accuracy": 0.7503654226660729, "num_tokens": 227039009.0, "step": 2410 }, { "entropy": 1.3630353569984437, "epoch": 0.5369127516778524, "grad_norm": 0.5390625, "learning_rate": 2.3169920141969835e-05, "loss": 0.9648, "mean_token_accuracy": 0.7523718543350697, "num_tokens": 227995365.0, "step": 2420 }, { "entropy": 1.3738336831331253, "epoch": 0.5391313994120583, "grad_norm": 0.5625, "learning_rate": 2.3059006211180127e-05, "loss": 0.9594, "mean_token_accuracy": 0.7517461970448494, "num_tokens": 228942729.0, "step": 2430 }, { "entropy": 1.3495117351412773, "epoch": 0.5413500471462643, "grad_norm": 0.56640625, "learning_rate": 2.294809228039042e-05, "loss": 0.9208, "mean_token_accuracy": 0.7615052901208401, "num_tokens": 229900137.0, "step": 2440 }, { "entropy": 1.3656693696975708, "epoch": 0.5435686948804703, "grad_norm": 0.56640625, "learning_rate": 2.283717834960071e-05, "loss": 0.9265, "mean_token_accuracy": 0.7582555040717125, "num_tokens": 230839638.0, "step": 2450 }, { "entropy": 1.359101416170597, "epoch": 0.5457873426146763, "grad_norm": 0.52734375, "learning_rate": 2.2726264418811003e-05, "loss": 0.946, "mean_token_accuracy": 0.7545076720416546, "num_tokens": 231784568.0, "step": 2460 }, { "entropy": 1.3754738956689834, "epoch": 0.5480059903488823, "grad_norm": 0.58203125, "learning_rate": 2.26153504880213e-05, "loss": 0.9498, "mean_token_accuracy": 0.7523327447474003, "num_tokens": 232706550.0, "step": 2470 }, { "entropy": 1.3724554181098938, "epoch": 0.5502246380830884, "grad_norm": 0.52734375, "learning_rate": 2.250443655723159e-05, "loss": 0.9766, "mean_token_accuracy": 0.7489859662950039, "num_tokens": 233663364.0, "step": 2480 }, { "entropy": 1.3810199111700059, "epoch": 0.5524432858172944, "grad_norm": 0.56640625, "learning_rate": 2.2393522626441883e-05, "loss": 0.9506, "mean_token_accuracy": 0.7534161373972893, "num_tokens": 234627455.0, "step": 2490 }, { "entropy": 1.4006718143820762, "epoch": 0.5546619335515004, "grad_norm": 0.56640625, "learning_rate": 2.2282608695652175e-05, "loss": 0.9935, "mean_token_accuracy": 0.7439345620572567, "num_tokens": 235567024.0, "step": 2500 }, { "entropy": 1.383282570540905, "epoch": 0.5568805812857064, "grad_norm": 0.5546875, "learning_rate": 2.2171694764862467e-05, "loss": 0.9472, "mean_token_accuracy": 0.7532580479979515, "num_tokens": 236531235.0, "step": 2510 }, { "entropy": 1.3930965930223465, "epoch": 0.5590992290199124, "grad_norm": 0.5703125, "learning_rate": 2.206078083407276e-05, "loss": 0.982, "mean_token_accuracy": 0.7469352826476097, "num_tokens": 237448605.0, "step": 2520 }, { "entropy": 1.3952334612607955, "epoch": 0.5613178767541184, "grad_norm": 0.58984375, "learning_rate": 2.1949866903283052e-05, "loss": 1.0024, "mean_token_accuracy": 0.7422742739319801, "num_tokens": 238389157.0, "step": 2530 }, { "entropy": 1.3666514441370965, "epoch": 0.5635365244883244, "grad_norm": 0.55859375, "learning_rate": 2.1838952972493347e-05, "loss": 0.9431, "mean_token_accuracy": 0.7566322214901448, "num_tokens": 239312016.0, "step": 2540 }, { "entropy": 1.40639336258173, "epoch": 0.5657551722225304, "grad_norm": 0.5390625, "learning_rate": 2.172803904170364e-05, "loss": 0.9865, "mean_token_accuracy": 0.7460080161690712, "num_tokens": 240216908.0, "step": 2550 }, { "entropy": 1.3294718250632287, "epoch": 0.5679738199567363, "grad_norm": 0.5546875, "learning_rate": 2.161712511091393e-05, "loss": 0.949, "mean_token_accuracy": 0.7551594816148282, "num_tokens": 241183984.0, "step": 2560 }, { "entropy": 1.380000075697899, "epoch": 0.5701924676909423, "grad_norm": 0.55078125, "learning_rate": 2.1506211180124224e-05, "loss": 0.9684, "mean_token_accuracy": 0.7464251570403576, "num_tokens": 242123855.0, "step": 2570 }, { "entropy": 1.3699100747704507, "epoch": 0.5724111154251483, "grad_norm": 0.53515625, "learning_rate": 2.1395297249334516e-05, "loss": 0.9714, "mean_token_accuracy": 0.7494775131344795, "num_tokens": 243057797.0, "step": 2580 }, { "entropy": 1.3705684199929238, "epoch": 0.5746297631593543, "grad_norm": 0.56640625, "learning_rate": 2.1284383318544808e-05, "loss": 0.9641, "mean_token_accuracy": 0.7521654039621353, "num_tokens": 244025358.0, "step": 2590 }, { "entropy": 1.361481635272503, "epoch": 0.5768484108935604, "grad_norm": 0.53515625, "learning_rate": 2.1173469387755103e-05, "loss": 0.9685, "mean_token_accuracy": 0.7504465833306313, "num_tokens": 244971950.0, "step": 2600 }, { "entropy": 1.3585113763809205, "epoch": 0.5790670586277664, "grad_norm": 0.55859375, "learning_rate": 2.1062555456965396e-05, "loss": 0.9401, "mean_token_accuracy": 0.75314856544137, "num_tokens": 245902595.0, "step": 2610 }, { "entropy": 1.3520452484488488, "epoch": 0.5812857063619724, "grad_norm": 0.5234375, "learning_rate": 2.0951641526175688e-05, "loss": 0.9586, "mean_token_accuracy": 0.7528336457908154, "num_tokens": 246843571.0, "step": 2620 }, { "entropy": 1.3962681278586389, "epoch": 0.5835043540961784, "grad_norm": 0.5390625, "learning_rate": 2.084072759538598e-05, "loss": 0.9619, "mean_token_accuracy": 0.7511408895254135, "num_tokens": 247787481.0, "step": 2630 }, { "entropy": 1.3641357719898224, "epoch": 0.5857230018303844, "grad_norm": 0.55078125, "learning_rate": 2.0729813664596272e-05, "loss": 0.9681, "mean_token_accuracy": 0.7530590400099755, "num_tokens": 248753372.0, "step": 2640 }, { "entropy": 1.3867824390530585, "epoch": 0.5879416495645904, "grad_norm": 0.5234375, "learning_rate": 2.0618899733806567e-05, "loss": 0.9718, "mean_token_accuracy": 0.7493688210844993, "num_tokens": 249707740.0, "step": 2650 }, { "entropy": 1.3566410467028618, "epoch": 0.5901602972987964, "grad_norm": 0.5234375, "learning_rate": 2.050798580301686e-05, "loss": 0.9481, "mean_token_accuracy": 0.7530547261238099, "num_tokens": 250668531.0, "step": 2660 }, { "entropy": 1.419162317365408, "epoch": 0.5923789450330024, "grad_norm": 0.54296875, "learning_rate": 2.0397071872227152e-05, "loss": 0.9736, "mean_token_accuracy": 0.7478901363909245, "num_tokens": 251574090.0, "step": 2670 }, { "entropy": 1.389479933679104, "epoch": 0.5945975927672084, "grad_norm": 0.5546875, "learning_rate": 2.0286157941437444e-05, "loss": 0.9992, "mean_token_accuracy": 0.7439706973731518, "num_tokens": 252535111.0, "step": 2680 }, { "entropy": 1.3280567415058613, "epoch": 0.5968162405014144, "grad_norm": 0.5703125, "learning_rate": 2.0175244010647736e-05, "loss": 0.905, "mean_token_accuracy": 0.765102332830429, "num_tokens": 253477803.0, "step": 2690 }, { "entropy": 1.4039628729224205, "epoch": 0.5990348882356203, "grad_norm": 0.57421875, "learning_rate": 2.006433007985803e-05, "loss": 0.9624, "mean_token_accuracy": 0.7520765975117684, "num_tokens": 254414330.0, "step": 2700 }, { "entropy": 1.3595366537570954, "epoch": 0.6012535359698263, "grad_norm": 0.515625, "learning_rate": 1.9953416149068324e-05, "loss": 0.9501, "mean_token_accuracy": 0.7547135911881924, "num_tokens": 255359441.0, "step": 2710 }, { "entropy": 1.3837119027972222, "epoch": 0.6034721837040324, "grad_norm": 0.58203125, "learning_rate": 1.9842502218278616e-05, "loss": 0.9679, "mean_token_accuracy": 0.7504067279398441, "num_tokens": 256293391.0, "step": 2720 }, { "entropy": 1.3583301618695258, "epoch": 0.6056908314382384, "grad_norm": 0.54296875, "learning_rate": 1.9731588287488908e-05, "loss": 0.9265, "mean_token_accuracy": 0.7575979977846146, "num_tokens": 257255291.0, "step": 2730 }, { "entropy": 1.3321390345692634, "epoch": 0.6079094791724444, "grad_norm": 0.53515625, "learning_rate": 1.9620674356699203e-05, "loss": 0.9417, "mean_token_accuracy": 0.7558345906436443, "num_tokens": 258216217.0, "step": 2740 }, { "entropy": 1.3556917786598206, "epoch": 0.6101281269066504, "grad_norm": 0.53515625, "learning_rate": 1.9509760425909496e-05, "loss": 0.9539, "mean_token_accuracy": 0.7550654023885727, "num_tokens": 259178609.0, "step": 2750 }, { "entropy": 1.3814320512115956, "epoch": 0.6123467746408564, "grad_norm": 0.515625, "learning_rate": 1.9398846495119788e-05, "loss": 0.9412, "mean_token_accuracy": 0.757171281427145, "num_tokens": 260110804.0, "step": 2760 }, { "entropy": 1.375185413658619, "epoch": 0.6145654223750624, "grad_norm": 0.66015625, "learning_rate": 1.928793256433008e-05, "loss": 0.9697, "mean_token_accuracy": 0.7497281424701214, "num_tokens": 261028443.0, "step": 2770 }, { "entropy": 1.37678205370903, "epoch": 0.6167840701092684, "grad_norm": 0.5703125, "learning_rate": 1.9177018633540372e-05, "loss": 0.9696, "mean_token_accuracy": 0.7474402152001858, "num_tokens": 261952317.0, "step": 2780 }, { "entropy": 1.3688176065683364, "epoch": 0.6190027178434744, "grad_norm": 0.5390625, "learning_rate": 1.9066104702750667e-05, "loss": 0.973, "mean_token_accuracy": 0.7485333941876888, "num_tokens": 262897797.0, "step": 2790 }, { "entropy": 1.3436351254582406, "epoch": 0.6212213655776804, "grad_norm": 0.52734375, "learning_rate": 1.895519077196096e-05, "loss": 0.939, "mean_token_accuracy": 0.755128963291645, "num_tokens": 263844200.0, "step": 2800 }, { "entropy": 1.3590498827397823, "epoch": 0.6234400133118864, "grad_norm": 0.57421875, "learning_rate": 1.8844276841171252e-05, "loss": 0.9068, "mean_token_accuracy": 0.7598929911851883, "num_tokens": 264775127.0, "step": 2810 }, { "entropy": 1.3578249305486678, "epoch": 0.6256586610460924, "grad_norm": 0.53515625, "learning_rate": 1.8733362910381544e-05, "loss": 0.9365, "mean_token_accuracy": 0.7524393565952778, "num_tokens": 265710700.0, "step": 2820 }, { "entropy": 1.3826695740222932, "epoch": 0.6278773087802985, "grad_norm": 0.546875, "learning_rate": 1.862244897959184e-05, "loss": 0.9781, "mean_token_accuracy": 0.7476157076656819, "num_tokens": 266636699.0, "step": 2830 }, { "entropy": 1.3442816585302353, "epoch": 0.6300959565145045, "grad_norm": 0.50390625, "learning_rate": 1.851153504880213e-05, "loss": 0.9354, "mean_token_accuracy": 0.756941570341587, "num_tokens": 267573793.0, "step": 2840 }, { "entropy": 1.3743248209357262, "epoch": 0.6323146042487104, "grad_norm": 0.515625, "learning_rate": 1.8400621118012424e-05, "loss": 0.9682, "mean_token_accuracy": 0.7508407726883888, "num_tokens": 268507577.0, "step": 2850 }, { "entropy": 1.3407793439924718, "epoch": 0.6345332519829164, "grad_norm": 0.5390625, "learning_rate": 1.8289707187222716e-05, "loss": 0.9353, "mean_token_accuracy": 0.7562331147491932, "num_tokens": 269452816.0, "step": 2860 }, { "entropy": 1.3617188811302186, "epoch": 0.6367518997171224, "grad_norm": 0.515625, "learning_rate": 1.8178793256433008e-05, "loss": 0.9456, "mean_token_accuracy": 0.7551380828022957, "num_tokens": 270388441.0, "step": 2870 }, { "entropy": 1.3776611492037774, "epoch": 0.6389705474513284, "grad_norm": 0.6171875, "learning_rate": 1.8067879325643303e-05, "loss": 0.9629, "mean_token_accuracy": 0.7524656720459462, "num_tokens": 271318970.0, "step": 2880 }, { "entropy": 1.4048678979277611, "epoch": 0.6411891951855344, "grad_norm": 0.53125, "learning_rate": 1.7956965394853596e-05, "loss": 0.9939, "mean_token_accuracy": 0.7458176657557487, "num_tokens": 272247913.0, "step": 2890 }, { "entropy": 1.3896298915147782, "epoch": 0.6434078429197404, "grad_norm": 0.51171875, "learning_rate": 1.7846051464063888e-05, "loss": 0.9721, "mean_token_accuracy": 0.747653903067112, "num_tokens": 273177796.0, "step": 2900 }, { "entropy": 1.415783490240574, "epoch": 0.6456264906539464, "grad_norm": 0.55078125, "learning_rate": 1.773513753327418e-05, "loss": 0.9831, "mean_token_accuracy": 0.7461927577853202, "num_tokens": 274110970.0, "step": 2910 }, { "entropy": 1.4129061743617057, "epoch": 0.6478451383881524, "grad_norm": 0.56640625, "learning_rate": 1.7624223602484475e-05, "loss": 0.9799, "mean_token_accuracy": 0.7465896405279636, "num_tokens": 275046221.0, "step": 2920 }, { "entropy": 1.3508685111999512, "epoch": 0.6500637861223584, "grad_norm": 0.546875, "learning_rate": 1.7513309671694767e-05, "loss": 0.9157, "mean_token_accuracy": 0.7606397703289985, "num_tokens": 275976030.0, "step": 2930 }, { "entropy": 1.3810200482606887, "epoch": 0.6522824338565644, "grad_norm": 0.5625, "learning_rate": 1.740239574090506e-05, "loss": 0.9495, "mean_token_accuracy": 0.7528549820184708, "num_tokens": 276911856.0, "step": 2940 }, { "entropy": 1.3692273482680322, "epoch": 0.6545010815907705, "grad_norm": 0.51953125, "learning_rate": 1.7291481810115352e-05, "loss": 0.9461, "mean_token_accuracy": 0.75175801217556, "num_tokens": 277835377.0, "step": 2950 }, { "entropy": 1.3666433647274971, "epoch": 0.6567197293249765, "grad_norm": 0.5625, "learning_rate": 1.7180567879325644e-05, "loss": 0.9708, "mean_token_accuracy": 0.7483266830444336, "num_tokens": 278781181.0, "step": 2960 }, { "entropy": 1.3559312582015992, "epoch": 0.6589383770591825, "grad_norm": 0.61328125, "learning_rate": 1.706965394853594e-05, "loss": 0.954, "mean_token_accuracy": 0.7511206485331059, "num_tokens": 279716531.0, "step": 2970 }, { "entropy": 1.368943963199854, "epoch": 0.6611570247933884, "grad_norm": 0.51953125, "learning_rate": 1.695874001774623e-05, "loss": 0.9498, "mean_token_accuracy": 0.7534951239824295, "num_tokens": 280676303.0, "step": 2980 }, { "entropy": 1.3631028145551682, "epoch": 0.6633756725275944, "grad_norm": 0.54296875, "learning_rate": 1.6847826086956524e-05, "loss": 0.954, "mean_token_accuracy": 0.7553952462971211, "num_tokens": 281607985.0, "step": 2990 }, { "entropy": 1.3665792286396026, "epoch": 0.6655943202618004, "grad_norm": 0.515625, "learning_rate": 1.6736912156166816e-05, "loss": 0.9486, "mean_token_accuracy": 0.7549586035311222, "num_tokens": 282546210.0, "step": 3000 }, { "entropy": 1.3732372209429742, "epoch": 0.6678129679960064, "grad_norm": 0.52734375, "learning_rate": 1.6625998225377108e-05, "loss": 0.9479, "mean_token_accuracy": 0.7541014879941941, "num_tokens": 283454678.0, "step": 3010 }, { "entropy": 1.3811131581664085, "epoch": 0.6700316157302124, "grad_norm": 0.5546875, "learning_rate": 1.6515084294587403e-05, "loss": 0.9651, "mean_token_accuracy": 0.7497533209621906, "num_tokens": 284398944.0, "step": 3020 }, { "entropy": 1.3607411414384842, "epoch": 0.6722502634644184, "grad_norm": 0.53515625, "learning_rate": 1.6404170363797696e-05, "loss": 0.9687, "mean_token_accuracy": 0.7503784812986851, "num_tokens": 285348795.0, "step": 3030 }, { "entropy": 1.3603453844785691, "epoch": 0.6744689111986244, "grad_norm": 0.5390625, "learning_rate": 1.6293256433007988e-05, "loss": 0.9375, "mean_token_accuracy": 0.7553820662200451, "num_tokens": 286282620.0, "step": 3040 }, { "entropy": 1.365732416510582, "epoch": 0.6766875589328304, "grad_norm": 0.55078125, "learning_rate": 1.618234250221828e-05, "loss": 0.9641, "mean_token_accuracy": 0.7524892151355743, "num_tokens": 287196362.0, "step": 3050 }, { "entropy": 1.388171437382698, "epoch": 0.6789062066670365, "grad_norm": 0.53515625, "learning_rate": 1.6071428571428572e-05, "loss": 0.9787, "mean_token_accuracy": 0.7475274331867695, "num_tokens": 288112223.0, "step": 3060 }, { "entropy": 1.3936428040266038, "epoch": 0.6811248544012425, "grad_norm": 0.490234375, "learning_rate": 1.5960514640638864e-05, "loss": 0.9798, "mean_token_accuracy": 0.7470642291009426, "num_tokens": 289068574.0, "step": 3070 }, { "entropy": 1.3852615475654602, "epoch": 0.6833435021354485, "grad_norm": 0.49609375, "learning_rate": 1.5849600709849156e-05, "loss": 0.9707, "mean_token_accuracy": 0.7508011363446713, "num_tokens": 289999042.0, "step": 3080 }, { "entropy": 1.3831126019358635, "epoch": 0.6855621498696545, "grad_norm": 0.51953125, "learning_rate": 1.573868677905945e-05, "loss": 0.9783, "mean_token_accuracy": 0.7468917787075042, "num_tokens": 290909919.0, "step": 3090 }, { "entropy": 1.3710383675992488, "epoch": 0.6877807976038605, "grad_norm": 0.52734375, "learning_rate": 1.5627772848269744e-05, "loss": 0.9353, "mean_token_accuracy": 0.7548687607049942, "num_tokens": 291840451.0, "step": 3100 }, { "entropy": 1.390061342716217, "epoch": 0.6899994453380665, "grad_norm": 0.5234375, "learning_rate": 1.5516858917480036e-05, "loss": 0.9665, "mean_token_accuracy": 0.7505981981754303, "num_tokens": 292779464.0, "step": 3110 }, { "entropy": 1.3343483962118625, "epoch": 0.6922180930722724, "grad_norm": 0.54296875, "learning_rate": 1.5405944986690328e-05, "loss": 0.95, "mean_token_accuracy": 0.7518795721232892, "num_tokens": 293715997.0, "step": 3120 }, { "entropy": 1.3757101863622665, "epoch": 0.6944367408064784, "grad_norm": 0.55078125, "learning_rate": 1.529503105590062e-05, "loss": 0.9644, "mean_token_accuracy": 0.7492641024291515, "num_tokens": 294640050.0, "step": 3130 }, { "entropy": 1.4059673711657523, "epoch": 0.6966553885406844, "grad_norm": 0.5546875, "learning_rate": 1.5184117125110914e-05, "loss": 0.9713, "mean_token_accuracy": 0.75089840143919, "num_tokens": 295559534.0, "step": 3140 }, { "entropy": 1.357503455877304, "epoch": 0.6988740362748904, "grad_norm": 0.546875, "learning_rate": 1.5073203194321208e-05, "loss": 0.9664, "mean_token_accuracy": 0.7514619171619416, "num_tokens": 296488124.0, "step": 3150 }, { "entropy": 1.3608231715857984, "epoch": 0.7010926840090964, "grad_norm": 0.58984375, "learning_rate": 1.4962289263531502e-05, "loss": 0.9671, "mean_token_accuracy": 0.7501711532473564, "num_tokens": 297430605.0, "step": 3160 }, { "entropy": 1.3769429683685304, "epoch": 0.7033113317433024, "grad_norm": 0.54296875, "learning_rate": 1.4851375332741794e-05, "loss": 0.9669, "mean_token_accuracy": 0.7483825981616974, "num_tokens": 298397840.0, "step": 3170 }, { "entropy": 1.360371782630682, "epoch": 0.7055299794775085, "grad_norm": 0.54296875, "learning_rate": 1.4740461401952086e-05, "loss": 0.957, "mean_token_accuracy": 0.7509351380169391, "num_tokens": 299305118.0, "step": 3180 }, { "entropy": 1.3703515753149986, "epoch": 0.7077486272117145, "grad_norm": 0.5234375, "learning_rate": 1.4629547471162378e-05, "loss": 0.9822, "mean_token_accuracy": 0.7480870224535465, "num_tokens": 300260539.0, "step": 3190 }, { "entropy": 1.332726612687111, "epoch": 0.7099672749459205, "grad_norm": 0.52734375, "learning_rate": 1.4518633540372672e-05, "loss": 0.933, "mean_token_accuracy": 0.7587002798914909, "num_tokens": 301217315.0, "step": 3200 }, { "entropy": 1.3821225792169571, "epoch": 0.7121859226801265, "grad_norm": 0.59765625, "learning_rate": 1.4407719609582964e-05, "loss": 0.9886, "mean_token_accuracy": 0.7449311658740043, "num_tokens": 302146575.0, "step": 3210 }, { "entropy": 1.3900915190577507, "epoch": 0.7144045704143325, "grad_norm": 0.53515625, "learning_rate": 1.4296805678793256e-05, "loss": 0.9682, "mean_token_accuracy": 0.7492348991334439, "num_tokens": 303094935.0, "step": 3220 }, { "entropy": 1.3515639439225198, "epoch": 0.7166232181485385, "grad_norm": 0.5234375, "learning_rate": 1.4185891748003548e-05, "loss": 0.9786, "mean_token_accuracy": 0.7468583591282367, "num_tokens": 304047392.0, "step": 3230 }, { "entropy": 1.367770765721798, "epoch": 0.7188418658827445, "grad_norm": 0.50390625, "learning_rate": 1.4074977817213844e-05, "loss": 0.9446, "mean_token_accuracy": 0.756279019266367, "num_tokens": 305032436.0, "step": 3240 }, { "entropy": 1.3513148739933967, "epoch": 0.7210605136169504, "grad_norm": 0.57421875, "learning_rate": 1.3964063886424136e-05, "loss": 0.9414, "mean_token_accuracy": 0.7565284885466099, "num_tokens": 305973152.0, "step": 3250 }, { "entropy": 1.3632114075124264, "epoch": 0.7232791613511564, "grad_norm": 0.5703125, "learning_rate": 1.3853149955634428e-05, "loss": 0.9472, "mean_token_accuracy": 0.7536871291697025, "num_tokens": 306907009.0, "step": 3260 }, { "entropy": 1.3524435505270958, "epoch": 0.7254978090853624, "grad_norm": 0.578125, "learning_rate": 1.374223602484472e-05, "loss": 0.9561, "mean_token_accuracy": 0.7523258805274964, "num_tokens": 307856537.0, "step": 3270 }, { "entropy": 1.3488811895251274, "epoch": 0.7277164568195684, "grad_norm": 0.53515625, "learning_rate": 1.3631322094055012e-05, "loss": 0.9133, "mean_token_accuracy": 0.7616166241467, "num_tokens": 308795993.0, "step": 3280 }, { "entropy": 1.3710470870137215, "epoch": 0.7299351045537745, "grad_norm": 0.5078125, "learning_rate": 1.3520408163265308e-05, "loss": 0.9616, "mean_token_accuracy": 0.7521081164479255, "num_tokens": 309747330.0, "step": 3290 }, { "entropy": 1.3429643303155898, "epoch": 0.7321537522879805, "grad_norm": 0.56640625, "learning_rate": 1.34094942324756e-05, "loss": 0.9548, "mean_token_accuracy": 0.7535655975341797, "num_tokens": 310694135.0, "step": 3300 }, { "entropy": 1.405469660460949, "epoch": 0.7343724000221865, "grad_norm": 0.5390625, "learning_rate": 1.3298580301685892e-05, "loss": 1.0062, "mean_token_accuracy": 0.740718811005354, "num_tokens": 311630235.0, "step": 3310 }, { "entropy": 1.3496448494493962, "epoch": 0.7365910477563925, "grad_norm": 0.6171875, "learning_rate": 1.3187666370896184e-05, "loss": 0.9664, "mean_token_accuracy": 0.7488033905625343, "num_tokens": 312584456.0, "step": 3320 }, { "entropy": 1.3738062731921672, "epoch": 0.7388096954905985, "grad_norm": 0.55859375, "learning_rate": 1.3076752440106476e-05, "loss": 0.9384, "mean_token_accuracy": 0.7538033194839955, "num_tokens": 313514606.0, "step": 3330 }, { "entropy": 1.413434487581253, "epoch": 0.7410283432248045, "grad_norm": 0.54296875, "learning_rate": 1.2965838509316772e-05, "loss": 0.9779, "mean_token_accuracy": 0.7464080691337586, "num_tokens": 314454935.0, "step": 3340 }, { "entropy": 1.3720596060156822, "epoch": 0.7432469909590105, "grad_norm": 0.52734375, "learning_rate": 1.2854924578527064e-05, "loss": 0.982, "mean_token_accuracy": 0.7460523217916488, "num_tokens": 315395689.0, "step": 3350 }, { "entropy": 1.373593833297491, "epoch": 0.7454656386932165, "grad_norm": 0.51171875, "learning_rate": 1.2744010647737356e-05, "loss": 0.9522, "mean_token_accuracy": 0.7515580035746098, "num_tokens": 316352803.0, "step": 3360 }, { "entropy": 1.3801784969866275, "epoch": 0.7476842864274225, "grad_norm": 0.52734375, "learning_rate": 1.2633096716947648e-05, "loss": 0.9855, "mean_token_accuracy": 0.7485053785145283, "num_tokens": 317274362.0, "step": 3370 }, { "entropy": 1.3563234113156795, "epoch": 0.7499029341616285, "grad_norm": 0.5390625, "learning_rate": 1.2522182786157944e-05, "loss": 0.9492, "mean_token_accuracy": 0.7532071232795715, "num_tokens": 318208426.0, "step": 3380 }, { "entropy": 1.3828615471720695, "epoch": 0.7521215818958344, "grad_norm": 0.54296875, "learning_rate": 1.2411268855368236e-05, "loss": 0.9703, "mean_token_accuracy": 0.7500887289643288, "num_tokens": 319135439.0, "step": 3390 }, { "entropy": 1.358182117342949, "epoch": 0.7543402296300404, "grad_norm": 0.546875, "learning_rate": 1.2300354924578528e-05, "loss": 0.9614, "mean_token_accuracy": 0.7506945103406906, "num_tokens": 320094550.0, "step": 3400 }, { "entropy": 1.3667812556028367, "epoch": 0.7565588773642465, "grad_norm": 0.54296875, "learning_rate": 1.218944099378882e-05, "loss": 0.9663, "mean_token_accuracy": 0.7509840287268161, "num_tokens": 321034769.0, "step": 3410 }, { "entropy": 1.366119608283043, "epoch": 0.7587775250984525, "grad_norm": 0.578125, "learning_rate": 1.2078527062999114e-05, "loss": 0.9641, "mean_token_accuracy": 0.7504384361207486, "num_tokens": 321956617.0, "step": 3420 }, { "entropy": 1.3458327114582063, "epoch": 0.7609961728326585, "grad_norm": 0.51953125, "learning_rate": 1.1967613132209406e-05, "loss": 0.9246, "mean_token_accuracy": 0.7602002188563347, "num_tokens": 322897156.0, "step": 3430 }, { "entropy": 1.3576911017298698, "epoch": 0.7632148205668645, "grad_norm": 0.53515625, "learning_rate": 1.18566992014197e-05, "loss": 0.965, "mean_token_accuracy": 0.7521724298596382, "num_tokens": 323862034.0, "step": 3440 }, { "entropy": 1.3676732160151004, "epoch": 0.7654334683010705, "grad_norm": 0.55859375, "learning_rate": 1.1745785270629992e-05, "loss": 0.9535, "mean_token_accuracy": 0.7519848950207233, "num_tokens": 324785828.0, "step": 3450 }, { "entropy": 1.3827008694410323, "epoch": 0.7676521160352765, "grad_norm": 0.546875, "learning_rate": 1.1634871339840284e-05, "loss": 0.9803, "mean_token_accuracy": 0.7474793456494808, "num_tokens": 325709539.0, "step": 3460 }, { "entropy": 1.3825151666998863, "epoch": 0.7698707637694825, "grad_norm": 0.546875, "learning_rate": 1.1523957409050576e-05, "loss": 0.9502, "mean_token_accuracy": 0.7529159486293793, "num_tokens": 326670959.0, "step": 3470 }, { "entropy": 1.3601200327277183, "epoch": 0.7720894115036885, "grad_norm": 0.50390625, "learning_rate": 1.141304347826087e-05, "loss": 0.9375, "mean_token_accuracy": 0.7546686172485352, "num_tokens": 327614086.0, "step": 3480 }, { "entropy": 1.362020593881607, "epoch": 0.7743080592378945, "grad_norm": 0.55859375, "learning_rate": 1.1302129547471162e-05, "loss": 0.9698, "mean_token_accuracy": 0.7503468558192253, "num_tokens": 328539952.0, "step": 3490 }, { "entropy": 1.3366340756416322, "epoch": 0.7765267069721005, "grad_norm": 0.5078125, "learning_rate": 1.1191215616681455e-05, "loss": 0.9268, "mean_token_accuracy": 0.7585201792418956, "num_tokens": 329486160.0, "step": 3500 }, { "entropy": 1.4073020935058593, "epoch": 0.7787453547063065, "grad_norm": 0.5390625, "learning_rate": 1.1080301685891748e-05, "loss": 1.0058, "mean_token_accuracy": 0.7416151888668537, "num_tokens": 330421872.0, "step": 3510 }, { "entropy": 1.4079115837812424, "epoch": 0.7809640024405126, "grad_norm": 0.5546875, "learning_rate": 1.096938775510204e-05, "loss": 0.9832, "mean_token_accuracy": 0.7472482591867446, "num_tokens": 331343559.0, "step": 3520 }, { "entropy": 1.3630366913974286, "epoch": 0.7831826501747186, "grad_norm": 0.57421875, "learning_rate": 1.0858473824312334e-05, "loss": 0.9403, "mean_token_accuracy": 0.7571096703410148, "num_tokens": 332300518.0, "step": 3530 }, { "entropy": 1.3317184090614318, "epoch": 0.7854012979089245, "grad_norm": 0.57421875, "learning_rate": 1.0747559893522626e-05, "loss": 0.9272, "mean_token_accuracy": 0.7571123994886875, "num_tokens": 333242960.0, "step": 3540 }, { "entropy": 1.3805472776293755, "epoch": 0.7876199456431305, "grad_norm": 0.55078125, "learning_rate": 1.063664596273292e-05, "loss": 1.0001, "mean_token_accuracy": 0.7453782841563225, "num_tokens": 334199687.0, "step": 3550 }, { "entropy": 1.3903330437839032, "epoch": 0.7898385933773365, "grad_norm": 0.5703125, "learning_rate": 1.0525732031943212e-05, "loss": 0.9892, "mean_token_accuracy": 0.7476846061646938, "num_tokens": 335136671.0, "step": 3560 }, { "entropy": 1.400630796700716, "epoch": 0.7920572411115425, "grad_norm": 0.51953125, "learning_rate": 1.0414818101153505e-05, "loss": 0.9818, "mean_token_accuracy": 0.7456599548459053, "num_tokens": 336082784.0, "step": 3570 }, { "entropy": 1.330247312784195, "epoch": 0.7942758888457485, "grad_norm": 0.5390625, "learning_rate": 1.0303904170363798e-05, "loss": 0.9171, "mean_token_accuracy": 0.7594246298074723, "num_tokens": 337030801.0, "step": 3580 }, { "entropy": 1.3843200758099556, "epoch": 0.7964945365799545, "grad_norm": 0.5546875, "learning_rate": 1.019299023957409e-05, "loss": 0.9532, "mean_token_accuracy": 0.7528259746730328, "num_tokens": 337968238.0, "step": 3590 }, { "entropy": 1.3642551466822623, "epoch": 0.7987131843141605, "grad_norm": 0.52734375, "learning_rate": 1.0082076308784384e-05, "loss": 0.9623, "mean_token_accuracy": 0.7526472553610801, "num_tokens": 338918630.0, "step": 3600 }, { "entropy": 1.3950382307171822, "epoch": 0.8009318320483665, "grad_norm": 0.54296875, "learning_rate": 9.971162377994676e-06, "loss": 0.9987, "mean_token_accuracy": 0.7440306425094605, "num_tokens": 339883232.0, "step": 3610 }, { "entropy": 1.3789781741797924, "epoch": 0.8031504797825725, "grad_norm": 0.5234375, "learning_rate": 9.86024844720497e-06, "loss": 0.9803, "mean_token_accuracy": 0.7468686446547508, "num_tokens": 340815896.0, "step": 3620 }, { "entropy": 1.347270517796278, "epoch": 0.8053691275167785, "grad_norm": 0.515625, "learning_rate": 9.749334516415262e-06, "loss": 0.9484, "mean_token_accuracy": 0.7531238257884979, "num_tokens": 341768148.0, "step": 3630 }, { "entropy": 1.3590503334999084, "epoch": 0.8075877752509846, "grad_norm": 0.5234375, "learning_rate": 9.638420585625555e-06, "loss": 0.9316, "mean_token_accuracy": 0.7546578265726567, "num_tokens": 342701793.0, "step": 3640 }, { "entropy": 1.396905992925167, "epoch": 0.8098064229851906, "grad_norm": 0.57421875, "learning_rate": 9.527506654835848e-06, "loss": 0.9789, "mean_token_accuracy": 0.7470791518688202, "num_tokens": 343640847.0, "step": 3650 }, { "entropy": 1.4036844223737717, "epoch": 0.8120250707193966, "grad_norm": 0.5703125, "learning_rate": 9.41659272404614e-06, "loss": 1.0054, "mean_token_accuracy": 0.7421661540865898, "num_tokens": 344575824.0, "step": 3660 }, { "entropy": 1.3429035820066928, "epoch": 0.8142437184536025, "grad_norm": 0.5625, "learning_rate": 9.305678793256434e-06, "loss": 0.9533, "mean_token_accuracy": 0.7538112707436084, "num_tokens": 345521736.0, "step": 3670 }, { "entropy": 1.339048933982849, "epoch": 0.8164623661878085, "grad_norm": 0.52734375, "learning_rate": 9.194764862466726e-06, "loss": 0.9285, "mean_token_accuracy": 0.7566302098333836, "num_tokens": 346467156.0, "step": 3680 }, { "entropy": 1.3884014829993248, "epoch": 0.8186810139220145, "grad_norm": 0.515625, "learning_rate": 9.08385093167702e-06, "loss": 0.9551, "mean_token_accuracy": 0.7553901061415672, "num_tokens": 347380187.0, "step": 3690 }, { "entropy": 1.3566100239753722, "epoch": 0.8208996616562205, "grad_norm": 0.55078125, "learning_rate": 8.972937000887312e-06, "loss": 0.9534, "mean_token_accuracy": 0.7549425765872002, "num_tokens": 348318416.0, "step": 3700 }, { "entropy": 1.4000753894448281, "epoch": 0.8231183093904265, "grad_norm": 0.578125, "learning_rate": 8.862023070097605e-06, "loss": 0.9621, "mean_token_accuracy": 0.7486125141382217, "num_tokens": 349238737.0, "step": 3710 }, { "entropy": 1.340146180987358, "epoch": 0.8253369571246325, "grad_norm": 0.5078125, "learning_rate": 8.751109139307898e-06, "loss": 0.9434, "mean_token_accuracy": 0.7554696768522262, "num_tokens": 350211450.0, "step": 3720 }, { "entropy": 1.3477161943912506, "epoch": 0.8275556048588385, "grad_norm": 0.5234375, "learning_rate": 8.64019520851819e-06, "loss": 0.9295, "mean_token_accuracy": 0.7600415408611297, "num_tokens": 351168010.0, "step": 3730 }, { "entropy": 1.3705016247928143, "epoch": 0.8297742525930445, "grad_norm": 0.5546875, "learning_rate": 8.529281277728483e-06, "loss": 0.9853, "mean_token_accuracy": 0.7473350986838341, "num_tokens": 352123671.0, "step": 3740 }, { "entropy": 1.381928026676178, "epoch": 0.8319929003272506, "grad_norm": 0.5859375, "learning_rate": 8.418367346938775e-06, "loss": 0.9616, "mean_token_accuracy": 0.7508723892271518, "num_tokens": 353053546.0, "step": 3750 }, { "entropy": 1.3625482141971588, "epoch": 0.8342115480614566, "grad_norm": 0.54296875, "learning_rate": 8.307453416149069e-06, "loss": 0.9663, "mean_token_accuracy": 0.7500698082149029, "num_tokens": 354009149.0, "step": 3760 }, { "entropy": 1.3776927255094051, "epoch": 0.8364301957956626, "grad_norm": 0.5390625, "learning_rate": 8.19653948535936e-06, "loss": 0.9723, "mean_token_accuracy": 0.7484539121389389, "num_tokens": 354960232.0, "step": 3770 }, { "entropy": 1.348229543864727, "epoch": 0.8386488435298686, "grad_norm": 0.5625, "learning_rate": 8.085625554569655e-06, "loss": 0.9244, "mean_token_accuracy": 0.7584247119724751, "num_tokens": 355881980.0, "step": 3780 }, { "entropy": 1.379010844230652, "epoch": 0.8408674912640746, "grad_norm": 0.515625, "learning_rate": 7.974711623779947e-06, "loss": 0.9759, "mean_token_accuracy": 0.7453257746994495, "num_tokens": 356796420.0, "step": 3790 }, { "entropy": 1.323212279379368, "epoch": 0.8430861389982806, "grad_norm": 0.498046875, "learning_rate": 7.863797692990239e-06, "loss": 0.9252, "mean_token_accuracy": 0.7594764739274978, "num_tokens": 357735562.0, "step": 3800 }, { "entropy": 1.3776595070958138, "epoch": 0.8453047867324865, "grad_norm": 0.5703125, "learning_rate": 7.752883762200533e-06, "loss": 0.9779, "mean_token_accuracy": 0.7492772653698921, "num_tokens": 358678512.0, "step": 3810 }, { "entropy": 1.3554644294083118, "epoch": 0.8475234344666925, "grad_norm": 0.6015625, "learning_rate": 7.641969831410825e-06, "loss": 0.9401, "mean_token_accuracy": 0.7538537114858628, "num_tokens": 359648927.0, "step": 3820 }, { "entropy": 1.374256819486618, "epoch": 0.8497420822008985, "grad_norm": 0.498046875, "learning_rate": 7.5310559006211186e-06, "loss": 0.9516, "mean_token_accuracy": 0.7554675169289112, "num_tokens": 360613821.0, "step": 3830 }, { "entropy": 1.3803797647356988, "epoch": 0.8519607299351045, "grad_norm": 0.56640625, "learning_rate": 7.420141969831411e-06, "loss": 0.9509, "mean_token_accuracy": 0.7538297854363918, "num_tokens": 361546512.0, "step": 3840 }, { "entropy": 1.3749396726489067, "epoch": 0.8541793776693105, "grad_norm": 0.53125, "learning_rate": 7.3092280390417045e-06, "loss": 0.9708, "mean_token_accuracy": 0.7505305975675582, "num_tokens": 362470545.0, "step": 3850 }, { "entropy": 1.3605864882469176, "epoch": 0.8563980254035165, "grad_norm": 0.53515625, "learning_rate": 7.198314108251997e-06, "loss": 0.9273, "mean_token_accuracy": 0.7572342440485954, "num_tokens": 363386208.0, "step": 3860 }, { "entropy": 1.351151192933321, "epoch": 0.8586166731377226, "grad_norm": 0.5078125, "learning_rate": 7.0874001774622905e-06, "loss": 0.9441, "mean_token_accuracy": 0.7543889455497265, "num_tokens": 364337117.0, "step": 3870 }, { "entropy": 1.366971617937088, "epoch": 0.8608353208719286, "grad_norm": 0.5390625, "learning_rate": 6.976486246672583e-06, "loss": 0.9329, "mean_token_accuracy": 0.7580908246338367, "num_tokens": 365268692.0, "step": 3880 }, { "entropy": 1.380783747881651, "epoch": 0.8630539686061346, "grad_norm": 0.546875, "learning_rate": 6.865572315882875e-06, "loss": 0.9474, "mean_token_accuracy": 0.7536208674311637, "num_tokens": 366189928.0, "step": 3890 }, { "entropy": 1.422633485496044, "epoch": 0.8652726163403406, "grad_norm": 0.56640625, "learning_rate": 6.7546583850931686e-06, "loss": 0.9858, "mean_token_accuracy": 0.7456947565078735, "num_tokens": 367107938.0, "step": 3900 }, { "entropy": 1.3686823442578315, "epoch": 0.8674912640745466, "grad_norm": 0.53515625, "learning_rate": 6.643744454303461e-06, "loss": 0.9747, "mean_token_accuracy": 0.746913269907236, "num_tokens": 368057735.0, "step": 3910 }, { "entropy": 1.365791380405426, "epoch": 0.8697099118087526, "grad_norm": 0.53515625, "learning_rate": 6.532830523513754e-06, "loss": 0.9314, "mean_token_accuracy": 0.7586275286972523, "num_tokens": 369015878.0, "step": 3920 }, { "entropy": 1.39709220379591, "epoch": 0.8719285595429586, "grad_norm": 0.5625, "learning_rate": 6.421916592724047e-06, "loss": 0.978, "mean_token_accuracy": 0.7494583688676357, "num_tokens": 369939440.0, "step": 3930 }, { "entropy": 1.4065926373004913, "epoch": 0.8741472072771646, "grad_norm": 0.75, "learning_rate": 6.31100266193434e-06, "loss": 0.9938, "mean_token_accuracy": 0.7427597299218178, "num_tokens": 370887601.0, "step": 3940 }, { "entropy": 1.357539613544941, "epoch": 0.8763658550113705, "grad_norm": 0.54296875, "learning_rate": 6.200088731144632e-06, "loss": 0.9208, "mean_token_accuracy": 0.759847804158926, "num_tokens": 371812502.0, "step": 3950 }, { "entropy": 1.367304864525795, "epoch": 0.8785845027455765, "grad_norm": 0.515625, "learning_rate": 6.089174800354925e-06, "loss": 0.955, "mean_token_accuracy": 0.7528910353779793, "num_tokens": 372785967.0, "step": 3960 }, { "entropy": 1.3642425253987311, "epoch": 0.8808031504797825, "grad_norm": 0.62890625, "learning_rate": 5.978260869565218e-06, "loss": 0.9491, "mean_token_accuracy": 0.7509314216673374, "num_tokens": 373736770.0, "step": 3970 }, { "entropy": 1.3422590374946595, "epoch": 0.8830217982139886, "grad_norm": 0.515625, "learning_rate": 5.867346938775511e-06, "loss": 0.9434, "mean_token_accuracy": 0.7563717573881149, "num_tokens": 374687743.0, "step": 3980 }, { "entropy": 1.3692431643605232, "epoch": 0.8852404459481946, "grad_norm": 0.546875, "learning_rate": 5.756433007985803e-06, "loss": 0.956, "mean_token_accuracy": 0.7523974537849426, "num_tokens": 375638585.0, "step": 3990 }, { "entropy": 1.4123634532094003, "epoch": 0.8874590936824006, "grad_norm": 0.546875, "learning_rate": 5.645519077196096e-06, "loss": 0.9755, "mean_token_accuracy": 0.7474804915487766, "num_tokens": 376564779.0, "step": 4000 }, { "entropy": 1.3707083746790887, "epoch": 0.8896777414166066, "grad_norm": 0.55078125, "learning_rate": 5.534605146406389e-06, "loss": 0.9594, "mean_token_accuracy": 0.7516291610896587, "num_tokens": 377535509.0, "step": 4010 }, { "entropy": 1.3990908935666084, "epoch": 0.8918963891508126, "grad_norm": 0.55859375, "learning_rate": 5.423691215616682e-06, "loss": 0.9707, "mean_token_accuracy": 0.7489598006010055, "num_tokens": 378452879.0, "step": 4020 }, { "entropy": 1.323516283929348, "epoch": 0.8941150368850186, "grad_norm": 0.515625, "learning_rate": 5.312777284826975e-06, "loss": 0.9208, "mean_token_accuracy": 0.7579696662724018, "num_tokens": 379389441.0, "step": 4030 }, { "entropy": 1.3694282189011573, "epoch": 0.8963336846192246, "grad_norm": 0.55859375, "learning_rate": 5.201863354037268e-06, "loss": 0.9566, "mean_token_accuracy": 0.7532132729887963, "num_tokens": 380328572.0, "step": 4040 }, { "entropy": 1.3825721323490143, "epoch": 0.8985523323534306, "grad_norm": 0.52734375, "learning_rate": 5.090949423247561e-06, "loss": 0.9646, "mean_token_accuracy": 0.7510122939944267, "num_tokens": 381298077.0, "step": 4050 }, { "entropy": 1.3718091905117036, "epoch": 0.9007709800876366, "grad_norm": 0.5234375, "learning_rate": 4.980035492457853e-06, "loss": 0.9691, "mean_token_accuracy": 0.7500693678855896, "num_tokens": 382253696.0, "step": 4060 }, { "entropy": 1.3613854326307773, "epoch": 0.9029896278218426, "grad_norm": 0.55078125, "learning_rate": 4.869121561668146e-06, "loss": 0.924, "mean_token_accuracy": 0.7597228534519672, "num_tokens": 383180557.0, "step": 4070 }, { "entropy": 1.356216273456812, "epoch": 0.9052082755560485, "grad_norm": 0.51953125, "learning_rate": 4.758207630878438e-06, "loss": 0.9507, "mean_token_accuracy": 0.7508698903024197, "num_tokens": 384121710.0, "step": 4080 }, { "entropy": 1.373689603805542, "epoch": 0.9074269232902545, "grad_norm": 0.62109375, "learning_rate": 4.647293700088731e-06, "loss": 0.9489, "mean_token_accuracy": 0.7534318998456001, "num_tokens": 385057665.0, "step": 4090 }, { "entropy": 1.3592337571084498, "epoch": 0.9096455710244606, "grad_norm": 0.5234375, "learning_rate": 4.536379769299024e-06, "loss": 0.9266, "mean_token_accuracy": 0.7580548346042633, "num_tokens": 385990068.0, "step": 4100 }, { "entropy": 1.3794769167900085, "epoch": 0.9118642187586666, "grad_norm": 0.54296875, "learning_rate": 4.425465838509317e-06, "loss": 0.961, "mean_token_accuracy": 0.7483809188008308, "num_tokens": 386942053.0, "step": 4110 }, { "entropy": 1.3542534172534944, "epoch": 0.9140828664928726, "grad_norm": 0.546875, "learning_rate": 4.31455190771961e-06, "loss": 0.9244, "mean_token_accuracy": 0.7592903338372707, "num_tokens": 387887015.0, "step": 4120 }, { "entropy": 1.3595674246549607, "epoch": 0.9163015142270786, "grad_norm": 0.52734375, "learning_rate": 4.203637976929903e-06, "loss": 0.9246, "mean_token_accuracy": 0.7590445302426815, "num_tokens": 388811553.0, "step": 4130 }, { "entropy": 1.3751677602529526, "epoch": 0.9185201619612846, "grad_norm": 0.54296875, "learning_rate": 4.092724046140196e-06, "loss": 0.9404, "mean_token_accuracy": 0.7545685932040215, "num_tokens": 389767963.0, "step": 4140 }, { "entropy": 1.3535856008529663, "epoch": 0.9207388096954906, "grad_norm": 8.1875, "learning_rate": 3.981810115350488e-06, "loss": 0.9423, "mean_token_accuracy": 0.755934339761734, "num_tokens": 390718147.0, "step": 4150 }, { "entropy": 1.3349559880793094, "epoch": 0.9229574574296966, "grad_norm": 0.52734375, "learning_rate": 3.870896184560781e-06, "loss": 0.9307, "mean_token_accuracy": 0.7575117878615856, "num_tokens": 391655572.0, "step": 4160 }, { "entropy": 1.3620432406663894, "epoch": 0.9251761051639026, "grad_norm": 0.53125, "learning_rate": 3.759982253771074e-06, "loss": 0.9489, "mean_token_accuracy": 0.7553517244756222, "num_tokens": 392605183.0, "step": 4170 }, { "entropy": 1.3631588451564312, "epoch": 0.9273947528981086, "grad_norm": 0.53515625, "learning_rate": 3.6490683229813664e-06, "loss": 0.9688, "mean_token_accuracy": 0.7515050798654557, "num_tokens": 393541641.0, "step": 4180 }, { "entropy": 1.3356323443353175, "epoch": 0.9296134006323146, "grad_norm": 0.52734375, "learning_rate": 3.5381543921916594e-06, "loss": 0.9403, "mean_token_accuracy": 0.7564674764871597, "num_tokens": 394494620.0, "step": 4190 }, { "entropy": 1.3773754671216012, "epoch": 0.9318320483665206, "grad_norm": 0.55859375, "learning_rate": 3.4272404614019524e-06, "loss": 0.9536, "mean_token_accuracy": 0.7521816037595273, "num_tokens": 395433318.0, "step": 4200 }, { "entropy": 1.3892026975750924, "epoch": 0.9340506961007266, "grad_norm": 0.5234375, "learning_rate": 3.3163265306122454e-06, "loss": 0.9748, "mean_token_accuracy": 0.7485000409185887, "num_tokens": 396362606.0, "step": 4210 }, { "entropy": 1.3755895391106605, "epoch": 0.9362693438349327, "grad_norm": 0.490234375, "learning_rate": 3.2054125998225384e-06, "loss": 0.9831, "mean_token_accuracy": 0.7457576237618924, "num_tokens": 397301443.0, "step": 4220 }, { "entropy": 1.344323543459177, "epoch": 0.9384879915691386, "grad_norm": 0.51953125, "learning_rate": 3.094498669032831e-06, "loss": 0.9579, "mean_token_accuracy": 0.751289016008377, "num_tokens": 398268492.0, "step": 4230 }, { "entropy": 1.37066999822855, "epoch": 0.9407066393033446, "grad_norm": 0.55078125, "learning_rate": 2.9835847382431235e-06, "loss": 0.9682, "mean_token_accuracy": 0.7518731184303761, "num_tokens": 399230191.0, "step": 4240 }, { "entropy": 1.3903049305081367, "epoch": 0.9429252870375506, "grad_norm": 0.5859375, "learning_rate": 2.872670807453416e-06, "loss": 0.968, "mean_token_accuracy": 0.7508095845580101, "num_tokens": 400161112.0, "step": 4250 }, { "entropy": 1.3681126192212105, "epoch": 0.9451439347717566, "grad_norm": 0.5234375, "learning_rate": 2.761756876663709e-06, "loss": 0.9533, "mean_token_accuracy": 0.752733913064003, "num_tokens": 401087454.0, "step": 4260 }, { "entropy": 1.3725266255438329, "epoch": 0.9473625825059626, "grad_norm": 0.546875, "learning_rate": 2.650842945874002e-06, "loss": 0.9593, "mean_token_accuracy": 0.7504413217306137, "num_tokens": 402039367.0, "step": 4270 }, { "entropy": 1.321278876066208, "epoch": 0.9495812302401686, "grad_norm": 0.53515625, "learning_rate": 2.539929015084295e-06, "loss": 0.8934, "mean_token_accuracy": 0.7636477537453175, "num_tokens": 402977685.0, "step": 4280 }, { "entropy": 1.3655060514807702, "epoch": 0.9517998779743746, "grad_norm": 0.59765625, "learning_rate": 2.4290150842945875e-06, "loss": 0.9563, "mean_token_accuracy": 0.7512309543788434, "num_tokens": 403917954.0, "step": 4290 }, { "entropy": 1.3604578115046024, "epoch": 0.9540185257085806, "grad_norm": 0.5546875, "learning_rate": 2.3181011535048805e-06, "loss": 0.9373, "mean_token_accuracy": 0.7567278765141964, "num_tokens": 404846467.0, "step": 4300 }, { "entropy": 1.3907675817608833, "epoch": 0.9562371734427866, "grad_norm": 0.53125, "learning_rate": 2.207187222715173e-06, "loss": 0.9519, "mean_token_accuracy": 0.7529364757239818, "num_tokens": 405777519.0, "step": 4310 }, { "entropy": 1.35387849137187, "epoch": 0.9584558211769926, "grad_norm": 0.515625, "learning_rate": 2.096273291925466e-06, "loss": 0.9467, "mean_token_accuracy": 0.7520903997123242, "num_tokens": 406709213.0, "step": 4320 }, { "entropy": 1.381056059896946, "epoch": 0.9606744689111987, "grad_norm": 0.515625, "learning_rate": 1.9853593611357586e-06, "loss": 0.9912, "mean_token_accuracy": 0.7435290008783341, "num_tokens": 407652379.0, "step": 4330 }, { "entropy": 1.3804906919598579, "epoch": 0.9628931166454047, "grad_norm": 0.53125, "learning_rate": 1.8744454303460516e-06, "loss": 0.963, "mean_token_accuracy": 0.7496263563632966, "num_tokens": 408609113.0, "step": 4340 }, { "entropy": 1.3666646957397461, "epoch": 0.9651117643796107, "grad_norm": 0.52734375, "learning_rate": 1.7635314995563443e-06, "loss": 0.9557, "mean_token_accuracy": 0.7525534473359585, "num_tokens": 409556084.0, "step": 4350 }, { "entropy": 1.4019876047968864, "epoch": 0.9673304121138167, "grad_norm": 0.5234375, "learning_rate": 1.6526175687666373e-06, "loss": 0.9896, "mean_token_accuracy": 0.7458052903413772, "num_tokens": 410505277.0, "step": 4360 }, { "entropy": 1.3351032480597496, "epoch": 0.9695490598480226, "grad_norm": 0.59765625, "learning_rate": 1.54170363797693e-06, "loss": 0.9507, "mean_token_accuracy": 0.7514726743102074, "num_tokens": 411461390.0, "step": 4370 }, { "entropy": 1.39310442507267, "epoch": 0.9717677075822286, "grad_norm": 0.54296875, "learning_rate": 1.4307897071872228e-06, "loss": 0.9698, "mean_token_accuracy": 0.7523914836347103, "num_tokens": 412416981.0, "step": 4380 }, { "entropy": 1.3549498602747918, "epoch": 0.9739863553164346, "grad_norm": 0.53515625, "learning_rate": 1.3198757763975156e-06, "loss": 0.9405, "mean_token_accuracy": 0.7553456977009774, "num_tokens": 413351642.0, "step": 4390 }, { "entropy": 1.3552466280758382, "epoch": 0.9762050030506406, "grad_norm": 0.53515625, "learning_rate": 1.2089618456078084e-06, "loss": 0.9431, "mean_token_accuracy": 0.7560462899506092, "num_tokens": 414294100.0, "step": 4400 }, { "entropy": 1.4019367545843124, "epoch": 0.9784236507848466, "grad_norm": 0.55078125, "learning_rate": 1.0980479148181013e-06, "loss": 0.9945, "mean_token_accuracy": 0.7445798873901367, "num_tokens": 415243404.0, "step": 4410 }, { "entropy": 1.354978322982788, "epoch": 0.9806422985190526, "grad_norm": 0.49609375, "learning_rate": 9.871339840283939e-07, "loss": 0.944, "mean_token_accuracy": 0.751890330016613, "num_tokens": 416201156.0, "step": 4420 }, { "entropy": 1.3830320432782173, "epoch": 0.9828609462532586, "grad_norm": 0.57421875, "learning_rate": 8.762200532386869e-07, "loss": 0.9883, "mean_token_accuracy": 0.7455812312662602, "num_tokens": 417144686.0, "step": 4430 }, { "entropy": 1.343818484246731, "epoch": 0.9850795939874646, "grad_norm": 0.5546875, "learning_rate": 7.653061224489796e-07, "loss": 0.9519, "mean_token_accuracy": 0.7526337899267673, "num_tokens": 418110287.0, "step": 4440 }, { "entropy": 1.3943986184895039, "epoch": 0.9872982417216707, "grad_norm": 0.5703125, "learning_rate": 6.543921916592724e-07, "loss": 0.9929, "mean_token_accuracy": 0.745176513493061, "num_tokens": 419055182.0, "step": 4450 }, { "entropy": 1.3566786855459214, "epoch": 0.9895168894558767, "grad_norm": 0.5234375, "learning_rate": 5.434782608695653e-07, "loss": 0.9174, "mean_token_accuracy": 0.7596544347703457, "num_tokens": 419984398.0, "step": 4460 }, { "entropy": 1.3785859584808349, "epoch": 0.9917355371900827, "grad_norm": 0.55859375, "learning_rate": 4.3256433007985804e-07, "loss": 0.9648, "mean_token_accuracy": 0.750813028216362, "num_tokens": 420924208.0, "step": 4470 }, { "entropy": 1.3863228864967823, "epoch": 0.9939541849242887, "grad_norm": 0.5390625, "learning_rate": 3.2165039929015086e-07, "loss": 0.9769, "mean_token_accuracy": 0.7477744162082672, "num_tokens": 421862664.0, "step": 4480 }, { "entropy": 1.3868858963251114, "epoch": 0.9961728326584947, "grad_norm": 0.5078125, "learning_rate": 2.1073646850044365e-07, "loss": 0.9711, "mean_token_accuracy": 0.7494218237698078, "num_tokens": 422811406.0, "step": 4490 }, { "entropy": 1.405050777643919, "epoch": 0.9983914803927006, "grad_norm": 0.5546875, "learning_rate": 9.982253771073646e-08, "loss": 0.9819, "mean_token_accuracy": 0.7480638548731804, "num_tokens": 423763513.0, "step": 4500 } ], "logging_steps": 10, "max_steps": 4508, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.665805826921595e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }