{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 4508, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.4729585528373719, "epoch": 0.0022186477342060014, "grad_norm": 0.66796875, "learning_rate": 4.990017746228927e-05, "loss": 1.1026, "mean_token_accuracy": 0.723765990883112, "num_tokens": 918149.0, "step": 10 }, { "entropy": 1.4707149267196655, "epoch": 0.004437295468412003, "grad_norm": 0.7890625, "learning_rate": 4.978926353149956e-05, "loss": 1.1101, "mean_token_accuracy": 0.7222173184156417, "num_tokens": 1851932.0, "step": 20 }, { "entropy": 1.4091981947422028, "epoch": 0.006655943202618004, "grad_norm": 0.58984375, "learning_rate": 4.967834960070985e-05, "loss": 1.0628, "mean_token_accuracy": 0.7333360627293587, "num_tokens": 2794352.0, "step": 30 }, { "entropy": 1.3992425069212913, "epoch": 0.008874590936824005, "grad_norm": 0.57421875, "learning_rate": 4.9567435669920145e-05, "loss": 1.077, "mean_token_accuracy": 0.7292535044252872, "num_tokens": 3757078.0, "step": 40 }, { "entropy": 1.4060697376728057, "epoch": 0.011093238671030008, "grad_norm": 0.5390625, "learning_rate": 4.945652173913044e-05, "loss": 1.06, "mean_token_accuracy": 0.7313959106802941, "num_tokens": 4731047.0, "step": 50 }, { "entropy": 1.385067519545555, "epoch": 0.013311886405236008, "grad_norm": 0.53125, "learning_rate": 4.934560780834073e-05, "loss": 1.0177, "mean_token_accuracy": 0.7411344431340694, "num_tokens": 5679856.0, "step": 60 }, { "entropy": 1.4070588394999504, "epoch": 0.01553053413944201, "grad_norm": 0.56640625, "learning_rate": 4.923469387755102e-05, "loss": 1.0279, "mean_token_accuracy": 0.7387959420681, "num_tokens": 6628887.0, "step": 70 }, { "entropy": 1.3842194020748138, "epoch": 0.01774918187364801, "grad_norm": 0.5625, "learning_rate": 4.9123779946761314e-05, "loss": 1.0559, "mean_token_accuracy": 0.7331727184355259, "num_tokens": 7596388.0, "step": 80 }, { "entropy": 1.466818632185459, "epoch": 0.019967829607854013, "grad_norm": 0.625, "learning_rate": 4.9012866015971606e-05, "loss": 1.11, "mean_token_accuracy": 0.7209376402199268, "num_tokens": 8538237.0, "step": 90 }, { "entropy": 1.433634176105261, "epoch": 0.022186477342060015, "grad_norm": 0.62890625, "learning_rate": 4.8901952085181905e-05, "loss": 1.077, "mean_token_accuracy": 0.7292104378342629, "num_tokens": 9485166.0, "step": 100 }, { "entropy": 1.4099419370293618, "epoch": 0.024405125076266018, "grad_norm": 0.5546875, "learning_rate": 4.87910381543922e-05, "loss": 1.0308, "mean_token_accuracy": 0.7382783465087414, "num_tokens": 10417165.0, "step": 110 }, { "entropy": 1.405370193719864, "epoch": 0.026623772810472016, "grad_norm": 0.5703125, "learning_rate": 4.868012422360249e-05, "loss": 1.0073, "mean_token_accuracy": 0.7402876511216163, "num_tokens": 11335861.0, "step": 120 }, { "entropy": 1.4469662189483643, "epoch": 0.02884242054467802, "grad_norm": 0.6328125, "learning_rate": 4.856921029281278e-05, "loss": 1.0661, "mean_token_accuracy": 0.7298030622303486, "num_tokens": 12263889.0, "step": 130 }, { "entropy": 1.3592407315969468, "epoch": 0.03106106827888402, "grad_norm": 0.609375, "learning_rate": 4.845829636202307e-05, "loss": 0.9871, "mean_token_accuracy": 0.7455302596092224, "num_tokens": 13210311.0, "step": 140 }, { "entropy": 1.3838115274906158, "epoch": 0.03327971601309002, "grad_norm": 0.57421875, "learning_rate": 4.8347382431233365e-05, "loss": 1.0185, "mean_token_accuracy": 0.7393872648477554, "num_tokens": 14157072.0, "step": 150 }, { "entropy": 1.3638476587831974, "epoch": 0.03549836374729602, "grad_norm": 0.55859375, "learning_rate": 4.823646850044366e-05, "loss": 1.0026, "mean_token_accuracy": 0.7428654655814171, "num_tokens": 15103967.0, "step": 160 }, { "entropy": 1.385922372341156, "epoch": 0.03771701148150203, "grad_norm": 0.55078125, "learning_rate": 4.812555456965395e-05, "loss": 1.0082, "mean_token_accuracy": 0.7438161842525005, "num_tokens": 16057562.0, "step": 170 }, { "entropy": 1.4505465492606162, "epoch": 0.039935659215708026, "grad_norm": 0.55859375, "learning_rate": 4.801464063886424e-05, "loss": 1.0561, "mean_token_accuracy": 0.7318664930760861, "num_tokens": 16978828.0, "step": 180 }, { "entropy": 1.4350886657834052, "epoch": 0.042154306949914025, "grad_norm": 0.56640625, "learning_rate": 4.7903726708074534e-05, "loss": 1.0676, "mean_token_accuracy": 0.7291314266622066, "num_tokens": 17901464.0, "step": 190 }, { "entropy": 1.4210979074239731, "epoch": 0.04437295468412003, "grad_norm": 0.54296875, "learning_rate": 4.7792812777284826e-05, "loss": 1.0306, "mean_token_accuracy": 0.7380646444857121, "num_tokens": 18864277.0, "step": 200 }, { "entropy": 1.4056882798671722, "epoch": 0.04659160241832603, "grad_norm": 0.55859375, "learning_rate": 4.768189884649512e-05, "loss": 1.0177, "mean_token_accuracy": 0.740249615162611, "num_tokens": 19808213.0, "step": 210 }, { "entropy": 1.3831629231572151, "epoch": 0.048810250152532035, "grad_norm": 0.546875, "learning_rate": 4.757098491570541e-05, "loss": 1.0107, "mean_token_accuracy": 0.7425381779670716, "num_tokens": 20748143.0, "step": 220 }, { "entropy": 1.3360425300896168, "epoch": 0.051028897886738034, "grad_norm": 0.546875, "learning_rate": 4.74600709849157e-05, "loss": 0.9563, "mean_token_accuracy": 0.7526988208293914, "num_tokens": 21698186.0, "step": 230 }, { "entropy": 1.4442797765135764, "epoch": 0.05324754562094403, "grad_norm": 0.60546875, "learning_rate": 4.7349157054126e-05, "loss": 1.0408, "mean_token_accuracy": 0.7342406339943409, "num_tokens": 22653187.0, "step": 240 }, { "entropy": 1.4190511792898177, "epoch": 0.05546619335515004, "grad_norm": 0.6015625, "learning_rate": 4.7238243123336293e-05, "loss": 1.0243, "mean_token_accuracy": 0.7393615126609803, "num_tokens": 23601229.0, "step": 250 }, { "entropy": 1.4013425052165984, "epoch": 0.05768484108935604, "grad_norm": 0.578125, "learning_rate": 4.7127329192546586e-05, "loss": 1.0445, "mean_token_accuracy": 0.737453556060791, "num_tokens": 24545674.0, "step": 260 }, { "entropy": 1.3956441208720207, "epoch": 0.059903488823562036, "grad_norm": 0.5625, "learning_rate": 4.701641526175688e-05, "loss": 1.0355, "mean_token_accuracy": 0.7368819013237953, "num_tokens": 25480593.0, "step": 270 }, { "entropy": 1.3561255246400834, "epoch": 0.06212213655776804, "grad_norm": 0.5625, "learning_rate": 4.690550133096717e-05, "loss": 1.0008, "mean_token_accuracy": 0.7417342521250248, "num_tokens": 26437892.0, "step": 280 }, { "entropy": 1.3865095235407352, "epoch": 0.06434078429197404, "grad_norm": 0.5390625, "learning_rate": 4.679458740017746e-05, "loss": 1.0156, "mean_token_accuracy": 0.7418425239622592, "num_tokens": 27388999.0, "step": 290 }, { "entropy": 1.404170949012041, "epoch": 0.06655943202618005, "grad_norm": 0.53515625, "learning_rate": 4.6683673469387754e-05, "loss": 1.0029, "mean_token_accuracy": 0.7463115990161896, "num_tokens": 28344677.0, "step": 300 }, { "entropy": 1.3910762615501882, "epoch": 0.06877807976038605, "grad_norm": 0.55078125, "learning_rate": 4.6572759538598046e-05, "loss": 1.0098, "mean_token_accuracy": 0.7405552670359612, "num_tokens": 29289045.0, "step": 310 }, { "entropy": 1.441838303208351, "epoch": 0.07099672749459204, "grad_norm": 0.57421875, "learning_rate": 4.646184560780834e-05, "loss": 1.0902, "mean_token_accuracy": 0.7256961852312088, "num_tokens": 30215206.0, "step": 320 }, { "entropy": 1.3631876975297927, "epoch": 0.07321537522879805, "grad_norm": 0.57421875, "learning_rate": 4.635093167701863e-05, "loss": 1.0127, "mean_token_accuracy": 0.7429364562034607, "num_tokens": 31165550.0, "step": 330 }, { "entropy": 1.4029483541846275, "epoch": 0.07543402296300405, "grad_norm": 0.55859375, "learning_rate": 4.624001774622893e-05, "loss": 1.0015, "mean_token_accuracy": 0.7426272496581078, "num_tokens": 32097154.0, "step": 340 }, { "entropy": 1.3886511482298374, "epoch": 0.07765267069721005, "grad_norm": 0.5078125, "learning_rate": 4.612910381543922e-05, "loss": 1.0187, "mean_token_accuracy": 0.7411878131330013, "num_tokens": 33034411.0, "step": 350 }, { "entropy": 1.3666007652878762, "epoch": 0.07987131843141605, "grad_norm": 0.5625, "learning_rate": 4.6018189884649514e-05, "loss": 0.9746, "mean_token_accuracy": 0.7496642753481865, "num_tokens": 33974618.0, "step": 360 }, { "entropy": 1.3778321206569673, "epoch": 0.08208996616562206, "grad_norm": 0.5625, "learning_rate": 4.5907275953859806e-05, "loss": 0.9799, "mean_token_accuracy": 0.7477375149726868, "num_tokens": 34914062.0, "step": 370 }, { "entropy": 1.3750384822487831, "epoch": 0.08430861389982805, "grad_norm": 0.53125, "learning_rate": 4.57963620230701e-05, "loss": 0.9757, "mean_token_accuracy": 0.7492865726351738, "num_tokens": 35845845.0, "step": 380 }, { "entropy": 1.40703696757555, "epoch": 0.08652726163403406, "grad_norm": 0.546875, "learning_rate": 4.568544809228039e-05, "loss": 1.0141, "mean_token_accuracy": 0.7390294030308724, "num_tokens": 36767543.0, "step": 390 }, { "entropy": 1.3947004944086074, "epoch": 0.08874590936824006, "grad_norm": 0.53125, "learning_rate": 4.557453416149068e-05, "loss": 0.9984, "mean_token_accuracy": 0.7446502350270748, "num_tokens": 37713319.0, "step": 400 }, { "entropy": 1.4182243198156357, "epoch": 0.09096455710244605, "grad_norm": 0.5390625, "learning_rate": 4.5463620230700974e-05, "loss": 1.0251, "mean_token_accuracy": 0.7391804203391075, "num_tokens": 38672746.0, "step": 410 }, { "entropy": 1.408482176810503, "epoch": 0.09318320483665206, "grad_norm": 0.55859375, "learning_rate": 4.5352706299911266e-05, "loss": 1.0114, "mean_token_accuracy": 0.7393792733550072, "num_tokens": 39634632.0, "step": 420 }, { "entropy": 1.4136851638555528, "epoch": 0.09540185257085806, "grad_norm": 0.55859375, "learning_rate": 4.5241792369121565e-05, "loss": 0.9879, "mean_token_accuracy": 0.7459694370627403, "num_tokens": 40576342.0, "step": 430 }, { "entropy": 1.383458285033703, "epoch": 0.09762050030506407, "grad_norm": 0.515625, "learning_rate": 4.513087843833186e-05, "loss": 0.979, "mean_token_accuracy": 0.7476258493959904, "num_tokens": 41505927.0, "step": 440 }, { "entropy": 1.4427544571459294, "epoch": 0.09983914803927006, "grad_norm": 0.546875, "learning_rate": 4.501996450754215e-05, "loss": 1.0537, "mean_token_accuracy": 0.7316265814006329, "num_tokens": 42455803.0, "step": 450 }, { "entropy": 1.3921602264046669, "epoch": 0.10205779577347607, "grad_norm": 0.58984375, "learning_rate": 4.490905057675244e-05, "loss": 1.0066, "mean_token_accuracy": 0.7426870331168175, "num_tokens": 43404878.0, "step": 460 }, { "entropy": 1.3988172575831412, "epoch": 0.10427644350768207, "grad_norm": 0.5078125, "learning_rate": 4.4798136645962734e-05, "loss": 1.0108, "mean_token_accuracy": 0.742293368279934, "num_tokens": 44391917.0, "step": 470 }, { "entropy": 1.4275135532021523, "epoch": 0.10649509124188807, "grad_norm": 0.5625, "learning_rate": 4.4687222715173026e-05, "loss": 1.0262, "mean_token_accuracy": 0.7378039725124836, "num_tokens": 45329206.0, "step": 480 }, { "entropy": 1.3842679247260095, "epoch": 0.10871373897609407, "grad_norm": 0.5625, "learning_rate": 4.457630878438332e-05, "loss": 1.0035, "mean_token_accuracy": 0.7409528233110905, "num_tokens": 46299789.0, "step": 490 }, { "entropy": 1.390407882630825, "epoch": 0.11093238671030008, "grad_norm": 0.5625, "learning_rate": 4.446539485359361e-05, "loss": 0.9843, "mean_token_accuracy": 0.746420969069004, "num_tokens": 47246331.0, "step": 500 }, { "entropy": 1.3856108456850051, "epoch": 0.11315103444450607, "grad_norm": 0.5546875, "learning_rate": 4.43544809228039e-05, "loss": 0.978, "mean_token_accuracy": 0.7486258946359158, "num_tokens": 48200167.0, "step": 510 }, { "entropy": 1.3945159137248992, "epoch": 0.11536968217871207, "grad_norm": 0.5234375, "learning_rate": 4.42435669920142e-05, "loss": 1.0085, "mean_token_accuracy": 0.7415202759206295, "num_tokens": 49150454.0, "step": 520 }, { "entropy": 1.3512628681957721, "epoch": 0.11758832991291808, "grad_norm": 0.54296875, "learning_rate": 4.4132653061224493e-05, "loss": 0.9385, "mean_token_accuracy": 0.7570643424987793, "num_tokens": 50085034.0, "step": 530 }, { "entropy": 1.378444318473339, "epoch": 0.11980697764712407, "grad_norm": 0.53125, "learning_rate": 4.4021739130434786e-05, "loss": 0.9825, "mean_token_accuracy": 0.7446637496352195, "num_tokens": 51014521.0, "step": 540 }, { "entropy": 1.3720286831259727, "epoch": 0.12202562538133008, "grad_norm": 0.57421875, "learning_rate": 4.391082519964508e-05, "loss": 0.9718, "mean_token_accuracy": 0.7489398539066314, "num_tokens": 51929505.0, "step": 550 }, { "entropy": 1.3862373858690262, "epoch": 0.12424427311553608, "grad_norm": 0.53125, "learning_rate": 4.379991126885537e-05, "loss": 0.9629, "mean_token_accuracy": 0.7500099420547486, "num_tokens": 52878638.0, "step": 560 }, { "entropy": 1.3761510282754899, "epoch": 0.1264629208497421, "grad_norm": 0.57421875, "learning_rate": 4.368899733806566e-05, "loss": 0.9695, "mean_token_accuracy": 0.7509791783988475, "num_tokens": 53815492.0, "step": 570 }, { "entropy": 1.388393123447895, "epoch": 0.12868156858394808, "grad_norm": 0.546875, "learning_rate": 4.3578083407275954e-05, "loss": 0.9979, "mean_token_accuracy": 0.7407989487051964, "num_tokens": 54745153.0, "step": 580 }, { "entropy": 1.3540472716093064, "epoch": 0.13090021631815407, "grad_norm": 0.55078125, "learning_rate": 4.3467169476486246e-05, "loss": 0.9778, "mean_token_accuracy": 0.7482736088335514, "num_tokens": 55704045.0, "step": 590 }, { "entropy": 1.3751274153590203, "epoch": 0.1331188640523601, "grad_norm": 0.56640625, "learning_rate": 4.335625554569654e-05, "loss": 0.9656, "mean_token_accuracy": 0.7485008135437965, "num_tokens": 56631888.0, "step": 600 }, { "entropy": 1.424610199034214, "epoch": 0.13533751178656608, "grad_norm": 0.5234375, "learning_rate": 4.324534161490684e-05, "loss": 1.0094, "mean_token_accuracy": 0.7427875995635986, "num_tokens": 57580851.0, "step": 610 }, { "entropy": 1.3987043127417564, "epoch": 0.1375561595207721, "grad_norm": 0.578125, "learning_rate": 4.313442768411713e-05, "loss": 1.0099, "mean_token_accuracy": 0.7419761680066586, "num_tokens": 58492885.0, "step": 620 }, { "entropy": 1.3795367434620858, "epoch": 0.1397748072549781, "grad_norm": 0.5625, "learning_rate": 4.302351375332742e-05, "loss": 0.9619, "mean_token_accuracy": 0.7496286295354366, "num_tokens": 59446819.0, "step": 630 }, { "entropy": 1.4246120005846024, "epoch": 0.1419934549891841, "grad_norm": 0.55859375, "learning_rate": 4.2912599822537714e-05, "loss": 1.0243, "mean_token_accuracy": 0.7391403771936893, "num_tokens": 60379693.0, "step": 640 }, { "entropy": 1.3605768918991088, "epoch": 0.1442121027233901, "grad_norm": 0.546875, "learning_rate": 4.2801685891748006e-05, "loss": 0.9522, "mean_token_accuracy": 0.7532150462269783, "num_tokens": 61333413.0, "step": 650 }, { "entropy": 1.4056472092866898, "epoch": 0.1464307504575961, "grad_norm": 0.5703125, "learning_rate": 4.26907719609583e-05, "loss": 1.0085, "mean_token_accuracy": 0.7418359808623791, "num_tokens": 62265474.0, "step": 660 }, { "entropy": 1.3709092542529107, "epoch": 0.1486493981918021, "grad_norm": 0.5234375, "learning_rate": 4.257985803016859e-05, "loss": 0.9743, "mean_token_accuracy": 0.7496256902813911, "num_tokens": 63207696.0, "step": 670 }, { "entropy": 1.4048712268471717, "epoch": 0.1508680459260081, "grad_norm": 0.54296875, "learning_rate": 4.246894409937888e-05, "loss": 0.9926, "mean_token_accuracy": 0.7464736774563789, "num_tokens": 64150100.0, "step": 680 }, { "entropy": 1.4152741387486458, "epoch": 0.1530866936602141, "grad_norm": 0.54296875, "learning_rate": 4.2358030168589174e-05, "loss": 0.9764, "mean_token_accuracy": 0.7450054451823235, "num_tokens": 65065205.0, "step": 690 }, { "entropy": 1.4143257439136505, "epoch": 0.1553053413944201, "grad_norm": 0.57421875, "learning_rate": 4.224711623779947e-05, "loss": 1.0204, "mean_token_accuracy": 0.7379486717283725, "num_tokens": 65984220.0, "step": 700 }, { "entropy": 1.383517174422741, "epoch": 0.1575239891286261, "grad_norm": 0.54296875, "learning_rate": 4.2136202307009765e-05, "loss": 1.0038, "mean_token_accuracy": 0.7429847024381161, "num_tokens": 66963944.0, "step": 710 }, { "entropy": 1.364837247878313, "epoch": 0.1597426368628321, "grad_norm": 0.546875, "learning_rate": 4.202528837622006e-05, "loss": 0.9569, "mean_token_accuracy": 0.7517856456339359, "num_tokens": 67927027.0, "step": 720 }, { "entropy": 1.388382686674595, "epoch": 0.1619612845970381, "grad_norm": 0.55859375, "learning_rate": 4.191437444543035e-05, "loss": 0.9754, "mean_token_accuracy": 0.7475278504192829, "num_tokens": 68858413.0, "step": 730 }, { "entropy": 1.3992270916700362, "epoch": 0.16417993233124412, "grad_norm": 0.49609375, "learning_rate": 4.180346051464064e-05, "loss": 0.9843, "mean_token_accuracy": 0.7459095239639282, "num_tokens": 69776534.0, "step": 740 }, { "entropy": 1.3922007218003274, "epoch": 0.1663985800654501, "grad_norm": 0.54296875, "learning_rate": 4.1692546583850934e-05, "loss": 0.9939, "mean_token_accuracy": 0.7453566305339336, "num_tokens": 70723313.0, "step": 750 }, { "entropy": 1.3805669724941254, "epoch": 0.1686172277996561, "grad_norm": 0.58203125, "learning_rate": 4.1581632653061226e-05, "loss": 0.9913, "mean_token_accuracy": 0.7465671949088574, "num_tokens": 71704943.0, "step": 760 }, { "entropy": 1.3953271463513375, "epoch": 0.17083587553386212, "grad_norm": 0.6640625, "learning_rate": 4.147071872227152e-05, "loss": 1.0389, "mean_token_accuracy": 0.7354367606341838, "num_tokens": 72654290.0, "step": 770 }, { "entropy": 1.3998527079820633, "epoch": 0.1730545232680681, "grad_norm": 0.54296875, "learning_rate": 4.135980479148181e-05, "loss": 0.9947, "mean_token_accuracy": 0.7447001703083516, "num_tokens": 73591959.0, "step": 780 }, { "entropy": 1.3867414839565755, "epoch": 0.1752731710022741, "grad_norm": 0.5390625, "learning_rate": 4.124889086069211e-05, "loss": 1.0031, "mean_token_accuracy": 0.7421109825372696, "num_tokens": 74553895.0, "step": 790 }, { "entropy": 1.3889594689011573, "epoch": 0.17749181873648012, "grad_norm": 0.5234375, "learning_rate": 4.11379769299024e-05, "loss": 0.9798, "mean_token_accuracy": 0.7458746030926704, "num_tokens": 75473199.0, "step": 800 }, { "entropy": 1.3977437242865562, "epoch": 0.17971046647068611, "grad_norm": 0.51953125, "learning_rate": 4.1027062999112693e-05, "loss": 0.9733, "mean_token_accuracy": 0.747966817766428, "num_tokens": 76414141.0, "step": 810 }, { "entropy": 1.367151539027691, "epoch": 0.1819291142048921, "grad_norm": 0.5703125, "learning_rate": 4.0916149068322986e-05, "loss": 0.9841, "mean_token_accuracy": 0.7465965315699578, "num_tokens": 77366592.0, "step": 820 }, { "entropy": 1.3750471204519272, "epoch": 0.18414776193909813, "grad_norm": 0.5703125, "learning_rate": 4.080523513753328e-05, "loss": 0.9989, "mean_token_accuracy": 0.741999814659357, "num_tokens": 78302248.0, "step": 830 }, { "entropy": 1.3610561907291412, "epoch": 0.18636640967330412, "grad_norm": 0.5234375, "learning_rate": 4.069432120674357e-05, "loss": 0.9803, "mean_token_accuracy": 0.7461248070001603, "num_tokens": 79268687.0, "step": 840 }, { "entropy": 1.3994140163064004, "epoch": 0.1885850574075101, "grad_norm": 0.5390625, "learning_rate": 4.058340727595386e-05, "loss": 1.0047, "mean_token_accuracy": 0.7401757217943669, "num_tokens": 80216167.0, "step": 850 }, { "entropy": 1.39816662222147, "epoch": 0.19080370514171613, "grad_norm": 0.57421875, "learning_rate": 4.0472493345164154e-05, "loss": 1.0098, "mean_token_accuracy": 0.7411137498915196, "num_tokens": 81146855.0, "step": 860 }, { "entropy": 1.4110144585371018, "epoch": 0.19302235287592212, "grad_norm": 0.578125, "learning_rate": 4.0361579414374446e-05, "loss": 0.9975, "mean_token_accuracy": 0.7468475431203843, "num_tokens": 82065352.0, "step": 870 }, { "entropy": 1.4093362182378768, "epoch": 0.19524100061012814, "grad_norm": 0.5625, "learning_rate": 4.025066548358474e-05, "loss": 0.9961, "mean_token_accuracy": 0.7452754236757755, "num_tokens": 83009393.0, "step": 880 }, { "entropy": 1.3738794058561326, "epoch": 0.19745964834433413, "grad_norm": 0.51953125, "learning_rate": 4.013975155279504e-05, "loss": 0.9595, "mean_token_accuracy": 0.7526905313134193, "num_tokens": 83982619.0, "step": 890 }, { "entropy": 1.3857081905007362, "epoch": 0.19967829607854012, "grad_norm": 0.5625, "learning_rate": 4.002883762200533e-05, "loss": 0.9776, "mean_token_accuracy": 0.748926243185997, "num_tokens": 84939163.0, "step": 900 }, { "entropy": 1.398831880092621, "epoch": 0.20189694381274614, "grad_norm": 0.54296875, "learning_rate": 3.991792369121562e-05, "loss": 0.9865, "mean_token_accuracy": 0.7459573321044445, "num_tokens": 85887826.0, "step": 910 }, { "entropy": 1.3910220503807067, "epoch": 0.20411559154695214, "grad_norm": 0.5546875, "learning_rate": 3.9807009760425914e-05, "loss": 0.9849, "mean_token_accuracy": 0.745719988644123, "num_tokens": 86808570.0, "step": 920 }, { "entropy": 1.3656192794442177, "epoch": 0.20633423928115813, "grad_norm": 0.51171875, "learning_rate": 3.9696095829636206e-05, "loss": 0.9658, "mean_token_accuracy": 0.7481127180159092, "num_tokens": 87748687.0, "step": 930 }, { "entropy": 1.3675310105085372, "epoch": 0.20855288701536415, "grad_norm": 0.50390625, "learning_rate": 3.95851818988465e-05, "loss": 0.9634, "mean_token_accuracy": 0.7505045898258687, "num_tokens": 88718503.0, "step": 940 }, { "entropy": 1.365248803794384, "epoch": 0.21077153474957014, "grad_norm": 0.515625, "learning_rate": 3.947426796805679e-05, "loss": 0.9377, "mean_token_accuracy": 0.756609782576561, "num_tokens": 89646214.0, "step": 950 }, { "entropy": 1.3557728335261345, "epoch": 0.21299018248377613, "grad_norm": 0.5546875, "learning_rate": 3.936335403726708e-05, "loss": 0.9495, "mean_token_accuracy": 0.7515292674303055, "num_tokens": 90584539.0, "step": 960 }, { "entropy": 1.3375528261065484, "epoch": 0.21520883021798215, "grad_norm": 0.58203125, "learning_rate": 3.9252440106477374e-05, "loss": 0.9359, "mean_token_accuracy": 0.7541147537529469, "num_tokens": 91524927.0, "step": 970 }, { "entropy": 1.3766776040196418, "epoch": 0.21742747795218814, "grad_norm": 0.54296875, "learning_rate": 3.914152617568767e-05, "loss": 0.9758, "mean_token_accuracy": 0.7470216073095799, "num_tokens": 92472966.0, "step": 980 }, { "entropy": 1.3779357895255089, "epoch": 0.21964612568639413, "grad_norm": 0.52734375, "learning_rate": 3.9030612244897965e-05, "loss": 0.9641, "mean_token_accuracy": 0.7518527932465077, "num_tokens": 93410659.0, "step": 990 }, { "entropy": 1.3866903841495515, "epoch": 0.22186477342060015, "grad_norm": 0.5390625, "learning_rate": 3.891969831410826e-05, "loss": 0.9693, "mean_token_accuracy": 0.7480762518942357, "num_tokens": 94376705.0, "step": 1000 }, { "entropy": 1.4138796277344228, "epoch": 0.22408342115480614, "grad_norm": 0.53125, "learning_rate": 3.880878438331855e-05, "loss": 0.9885, "mean_token_accuracy": 0.746094710379839, "num_tokens": 95306609.0, "step": 1010 }, { "entropy": 1.3473317727446557, "epoch": 0.22630206888901214, "grad_norm": 0.54296875, "learning_rate": 3.869787045252884e-05, "loss": 0.9388, "mean_token_accuracy": 0.7558636233210564, "num_tokens": 96277898.0, "step": 1020 }, { "entropy": 1.3636071279644966, "epoch": 0.22852071662321816, "grad_norm": 0.6015625, "learning_rate": 3.8586956521739134e-05, "loss": 0.9735, "mean_token_accuracy": 0.745589692890644, "num_tokens": 97233753.0, "step": 1030 }, { "entropy": 1.372378407418728, "epoch": 0.23073936435742415, "grad_norm": 0.5390625, "learning_rate": 3.8476042590949426e-05, "loss": 0.9672, "mean_token_accuracy": 0.7510603852570057, "num_tokens": 98177601.0, "step": 1040 }, { "entropy": 1.367596785724163, "epoch": 0.23295801209163014, "grad_norm": 0.5078125, "learning_rate": 3.836512866015972e-05, "loss": 0.9535, "mean_token_accuracy": 0.7517831392586232, "num_tokens": 99133455.0, "step": 1050 }, { "entropy": 1.3717108502984048, "epoch": 0.23517665982583616, "grad_norm": 0.55859375, "learning_rate": 3.825421472937001e-05, "loss": 0.9751, "mean_token_accuracy": 0.7493723064661026, "num_tokens": 100077287.0, "step": 1060 }, { "entropy": 1.378007946908474, "epoch": 0.23739530756004215, "grad_norm": 0.53515625, "learning_rate": 3.814330079858031e-05, "loss": 0.9352, "mean_token_accuracy": 0.7550456888973713, "num_tokens": 101011915.0, "step": 1070 }, { "entropy": 1.3725242644548417, "epoch": 0.23961395529424814, "grad_norm": 0.5234375, "learning_rate": 3.80323868677906e-05, "loss": 0.9535, "mean_token_accuracy": 0.7519958928227425, "num_tokens": 101961304.0, "step": 1080 }, { "entropy": 1.415687733888626, "epoch": 0.24183260302845416, "grad_norm": 0.546875, "learning_rate": 3.7921472937000893e-05, "loss": 0.9963, "mean_token_accuracy": 0.7424227021634578, "num_tokens": 102891482.0, "step": 1090 }, { "entropy": 1.356763481348753, "epoch": 0.24405125076266015, "grad_norm": 0.54296875, "learning_rate": 3.7810559006211186e-05, "loss": 0.9353, "mean_token_accuracy": 0.7564209721982479, "num_tokens": 103831567.0, "step": 1100 }, { "entropy": 1.3712417140603066, "epoch": 0.24626989849686615, "grad_norm": 0.55078125, "learning_rate": 3.769964507542148e-05, "loss": 0.9628, "mean_token_accuracy": 0.7527426145970821, "num_tokens": 104771073.0, "step": 1110 }, { "entropy": 1.3849323302507401, "epoch": 0.24848854623107217, "grad_norm": 0.59375, "learning_rate": 3.758873114463177e-05, "loss": 1.0069, "mean_token_accuracy": 0.7417409770190716, "num_tokens": 105699528.0, "step": 1120 }, { "entropy": 1.4036426708102225, "epoch": 0.2507071939652782, "grad_norm": 0.50390625, "learning_rate": 3.747781721384206e-05, "loss": 0.9894, "mean_token_accuracy": 0.7465023934841156, "num_tokens": 106650613.0, "step": 1130 }, { "entropy": 1.3854996912181377, "epoch": 0.2529258416994842, "grad_norm": 0.54296875, "learning_rate": 3.7366903283052354e-05, "loss": 0.9722, "mean_token_accuracy": 0.7488848619163037, "num_tokens": 107576916.0, "step": 1140 }, { "entropy": 1.3835882171988487, "epoch": 0.25514448943369017, "grad_norm": 0.5234375, "learning_rate": 3.7255989352262646e-05, "loss": 0.9998, "mean_token_accuracy": 0.7414388991892338, "num_tokens": 108541529.0, "step": 1150 }, { "entropy": 1.3686518892645836, "epoch": 0.25736313716789616, "grad_norm": 0.51953125, "learning_rate": 3.714507542147294e-05, "loss": 0.9453, "mean_token_accuracy": 0.7537351176142693, "num_tokens": 109478622.0, "step": 1160 }, { "entropy": 1.406387110054493, "epoch": 0.25958178490210215, "grad_norm": 0.51171875, "learning_rate": 3.703416149068323e-05, "loss": 0.9794, "mean_token_accuracy": 0.7466554552316665, "num_tokens": 110405684.0, "step": 1170 }, { "entropy": 1.3809578880667686, "epoch": 0.26180043263630814, "grad_norm": 0.5625, "learning_rate": 3.692324755989352e-05, "loss": 0.9719, "mean_token_accuracy": 0.749175675958395, "num_tokens": 111345202.0, "step": 1180 }, { "entropy": 1.3847816362977028, "epoch": 0.2640190803705142, "grad_norm": 0.5859375, "learning_rate": 3.6812333629103815e-05, "loss": 1.0003, "mean_token_accuracy": 0.7436210744082927, "num_tokens": 112274997.0, "step": 1190 }, { "entropy": 1.3820923566818237, "epoch": 0.2662377281047202, "grad_norm": 0.55859375, "learning_rate": 3.670141969831411e-05, "loss": 0.9592, "mean_token_accuracy": 0.7504418276250362, "num_tokens": 113206700.0, "step": 1200 }, { "entropy": 1.3826360628008842, "epoch": 0.2684563758389262, "grad_norm": 0.5859375, "learning_rate": 3.65905057675244e-05, "loss": 0.9873, "mean_token_accuracy": 0.7447850324213505, "num_tokens": 114136136.0, "step": 1210 }, { "entropy": 1.3701522216200828, "epoch": 0.27067502357313217, "grad_norm": 0.55078125, "learning_rate": 3.64795918367347e-05, "loss": 0.9779, "mean_token_accuracy": 0.7473484382033349, "num_tokens": 115065377.0, "step": 1220 }, { "entropy": 1.3910960853099823, "epoch": 0.27289367130733816, "grad_norm": 0.5234375, "learning_rate": 3.636867790594499e-05, "loss": 0.989, "mean_token_accuracy": 0.7464887276291847, "num_tokens": 116011291.0, "step": 1230 }, { "entropy": 1.370178584754467, "epoch": 0.2751123190415442, "grad_norm": 0.546875, "learning_rate": 3.625776397515528e-05, "loss": 0.9897, "mean_token_accuracy": 0.7448255158960819, "num_tokens": 116970495.0, "step": 1240 }, { "entropy": 1.3493198916316032, "epoch": 0.2773309667757502, "grad_norm": 0.52734375, "learning_rate": 3.6146850044365574e-05, "loss": 0.949, "mean_token_accuracy": 0.7529671564698219, "num_tokens": 117911337.0, "step": 1250 }, { "entropy": 1.371771328896284, "epoch": 0.2795496145099562, "grad_norm": 0.515625, "learning_rate": 3.6035936113575866e-05, "loss": 0.9472, "mean_token_accuracy": 0.753813973069191, "num_tokens": 118848493.0, "step": 1260 }, { "entropy": 1.4208975359797478, "epoch": 0.2817682622441622, "grad_norm": 0.53125, "learning_rate": 3.592502218278616e-05, "loss": 1.0034, "mean_token_accuracy": 0.7418984033167362, "num_tokens": 119781601.0, "step": 1270 }, { "entropy": 1.395139442384243, "epoch": 0.2839869099783682, "grad_norm": 0.53515625, "learning_rate": 3.581410825199645e-05, "loss": 1.0071, "mean_token_accuracy": 0.7408353559672832, "num_tokens": 120722213.0, "step": 1280 }, { "entropy": 1.3831138402223586, "epoch": 0.28620555771257417, "grad_norm": 0.52734375, "learning_rate": 3.570319432120674e-05, "loss": 0.9883, "mean_token_accuracy": 0.7461639747023583, "num_tokens": 121649961.0, "step": 1290 }, { "entropy": 1.3695012629032135, "epoch": 0.2884242054467802, "grad_norm": 0.53515625, "learning_rate": 3.5592280390417035e-05, "loss": 0.9526, "mean_token_accuracy": 0.7522782661020756, "num_tokens": 122622563.0, "step": 1300 }, { "entropy": 1.4116339407861234, "epoch": 0.2906428531809862, "grad_norm": 0.55859375, "learning_rate": 3.548136645962733e-05, "loss": 1.0048, "mean_token_accuracy": 0.74220717176795, "num_tokens": 123550041.0, "step": 1310 }, { "entropy": 1.3907336607575416, "epoch": 0.2928615009151922, "grad_norm": 0.5703125, "learning_rate": 3.537045252883762e-05, "loss": 0.9845, "mean_token_accuracy": 0.7461209401488305, "num_tokens": 124502233.0, "step": 1320 }, { "entropy": 1.3597315862774848, "epoch": 0.2950801486493982, "grad_norm": 0.57421875, "learning_rate": 3.525953859804791e-05, "loss": 0.9646, "mean_token_accuracy": 0.7516384877264499, "num_tokens": 125434381.0, "step": 1330 }, { "entropy": 1.3610756233334542, "epoch": 0.2972987963836042, "grad_norm": 0.546875, "learning_rate": 3.514862466725821e-05, "loss": 0.9613, "mean_token_accuracy": 0.7506407134234905, "num_tokens": 126374268.0, "step": 1340 }, { "entropy": 1.363479419052601, "epoch": 0.29951744411781017, "grad_norm": 0.55859375, "learning_rate": 3.50377107364685e-05, "loss": 0.9567, "mean_token_accuracy": 0.7539497919380664, "num_tokens": 127319726.0, "step": 1350 }, { "entropy": 1.4010797172784806, "epoch": 0.3017360918520162, "grad_norm": 0.57421875, "learning_rate": 3.4926796805678794e-05, "loss": 0.9972, "mean_token_accuracy": 0.7439250282943248, "num_tokens": 128269917.0, "step": 1360 }, { "entropy": 1.400447415560484, "epoch": 0.3039547395862222, "grad_norm": 0.55078125, "learning_rate": 3.481588287488909e-05, "loss": 1.0006, "mean_token_accuracy": 0.7441901095211506, "num_tokens": 129215524.0, "step": 1370 }, { "entropy": 1.3762236058712005, "epoch": 0.3061733873204282, "grad_norm": 0.5390625, "learning_rate": 3.470496894409938e-05, "loss": 0.9751, "mean_token_accuracy": 0.7485686533153058, "num_tokens": 130133218.0, "step": 1380 }, { "entropy": 1.3712550908327104, "epoch": 0.3083920350546342, "grad_norm": 0.5703125, "learning_rate": 3.459405501330967e-05, "loss": 0.967, "mean_token_accuracy": 0.7488023094832897, "num_tokens": 131090702.0, "step": 1390 }, { "entropy": 1.3727133765816688, "epoch": 0.3106106827888402, "grad_norm": 0.5859375, "learning_rate": 3.448314108251996e-05, "loss": 0.9617, "mean_token_accuracy": 0.7511452712118626, "num_tokens": 132015232.0, "step": 1400 }, { "entropy": 1.3846083499491215, "epoch": 0.3128293305230462, "grad_norm": 0.57421875, "learning_rate": 3.4372227151730255e-05, "loss": 0.9487, "mean_token_accuracy": 0.752527979016304, "num_tokens": 132965680.0, "step": 1410 }, { "entropy": 1.3626705884933472, "epoch": 0.3150479782572522, "grad_norm": 0.56640625, "learning_rate": 3.426131322094055e-05, "loss": 0.9392, "mean_token_accuracy": 0.7541214250028133, "num_tokens": 133895331.0, "step": 1420 }, { "entropy": 1.3925424292683601, "epoch": 0.3172666259914582, "grad_norm": 0.5546875, "learning_rate": 3.415039929015084e-05, "loss": 1.0072, "mean_token_accuracy": 0.7419983983039856, "num_tokens": 134848732.0, "step": 1430 }, { "entropy": 1.383028756082058, "epoch": 0.3194852737256642, "grad_norm": 0.55078125, "learning_rate": 3.403948535936114e-05, "loss": 0.9968, "mean_token_accuracy": 0.7439531564712525, "num_tokens": 135805571.0, "step": 1440 }, { "entropy": 1.411787600815296, "epoch": 0.3217039214598702, "grad_norm": 0.51953125, "learning_rate": 3.392857142857143e-05, "loss": 1.0173, "mean_token_accuracy": 0.7382614344358445, "num_tokens": 136755869.0, "step": 1450 }, { "entropy": 1.374262510240078, "epoch": 0.3239225691940762, "grad_norm": 0.5546875, "learning_rate": 3.381765749778172e-05, "loss": 0.9612, "mean_token_accuracy": 0.7520359136164189, "num_tokens": 137707923.0, "step": 1460 }, { "entropy": 1.345720000565052, "epoch": 0.3261412169282822, "grad_norm": 0.5078125, "learning_rate": 3.3706743566992015e-05, "loss": 0.9512, "mean_token_accuracy": 0.7521267220377922, "num_tokens": 138674173.0, "step": 1470 }, { "entropy": 1.3797206476330757, "epoch": 0.32835986466248823, "grad_norm": 0.5546875, "learning_rate": 3.359582963620231e-05, "loss": 0.9503, "mean_token_accuracy": 0.7529976561665535, "num_tokens": 139628775.0, "step": 1480 }, { "entropy": 1.3691905356943608, "epoch": 0.3305785123966942, "grad_norm": 0.546875, "learning_rate": 3.34849157054126e-05, "loss": 0.9742, "mean_token_accuracy": 0.7474093928933143, "num_tokens": 140568320.0, "step": 1490 }, { "entropy": 1.3553572654724122, "epoch": 0.3327971601309002, "grad_norm": 0.5078125, "learning_rate": 3.337400177462289e-05, "loss": 0.9474, "mean_token_accuracy": 0.7541252739727498, "num_tokens": 141508452.0, "step": 1500 }, { "entropy": 1.3576419681310654, "epoch": 0.3350158078651062, "grad_norm": 0.5546875, "learning_rate": 3.326308784383318e-05, "loss": 0.9445, "mean_token_accuracy": 0.7541140832006932, "num_tokens": 142443005.0, "step": 1510 }, { "entropy": 1.3632627040147782, "epoch": 0.3372344555993122, "grad_norm": 0.55859375, "learning_rate": 3.3152173913043475e-05, "loss": 0.9633, "mean_token_accuracy": 0.751540695130825, "num_tokens": 143364590.0, "step": 1520 }, { "entropy": 1.3698595464229584, "epoch": 0.33945310333351825, "grad_norm": 0.58984375, "learning_rate": 3.3041259982253774e-05, "loss": 0.9567, "mean_token_accuracy": 0.7508327946066856, "num_tokens": 144330283.0, "step": 1530 }, { "entropy": 1.3838164374232291, "epoch": 0.34167175106772424, "grad_norm": 0.54296875, "learning_rate": 3.2930346051464066e-05, "loss": 0.9412, "mean_token_accuracy": 0.7536897391080857, "num_tokens": 145271945.0, "step": 1540 }, { "entropy": 1.3916514277458192, "epoch": 0.34389039880193023, "grad_norm": 0.60546875, "learning_rate": 3.281943212067436e-05, "loss": 0.9674, "mean_token_accuracy": 0.7496246941387653, "num_tokens": 146208637.0, "step": 1550 }, { "entropy": 1.3817257568240167, "epoch": 0.3461090465361362, "grad_norm": 0.5390625, "learning_rate": 3.270851818988465e-05, "loss": 0.998, "mean_token_accuracy": 0.745353914052248, "num_tokens": 147132578.0, "step": 1560 }, { "entropy": 1.379334208369255, "epoch": 0.3483276942703422, "grad_norm": 0.59765625, "learning_rate": 3.259760425909494e-05, "loss": 0.9806, "mean_token_accuracy": 0.7451153837144375, "num_tokens": 148047084.0, "step": 1570 }, { "entropy": 1.3558235377073289, "epoch": 0.3505463420045482, "grad_norm": 0.55859375, "learning_rate": 3.2486690328305235e-05, "loss": 0.9319, "mean_token_accuracy": 0.7564816296100616, "num_tokens": 148984698.0, "step": 1580 }, { "entropy": 1.3621691033244132, "epoch": 0.35276498973875425, "grad_norm": 0.5, "learning_rate": 3.237577639751553e-05, "loss": 0.9663, "mean_token_accuracy": 0.7516494557261467, "num_tokens": 149927544.0, "step": 1590 }, { "entropy": 1.3577947162091732, "epoch": 0.35498363747296025, "grad_norm": 0.54296875, "learning_rate": 3.226486246672582e-05, "loss": 0.9732, "mean_token_accuracy": 0.7493470698595047, "num_tokens": 150876867.0, "step": 1600 }, { "entropy": 1.35196972489357, "epoch": 0.35720228520716624, "grad_norm": 0.54296875, "learning_rate": 3.215394853593611e-05, "loss": 0.9483, "mean_token_accuracy": 0.7527376770973205, "num_tokens": 151813474.0, "step": 1610 }, { "entropy": 1.3889328390359879, "epoch": 0.35942093294137223, "grad_norm": 0.55859375, "learning_rate": 3.204303460514641e-05, "loss": 0.9902, "mean_token_accuracy": 0.7460403524339199, "num_tokens": 152748724.0, "step": 1620 }, { "entropy": 1.3454296171665192, "epoch": 0.3616395806755782, "grad_norm": 0.5234375, "learning_rate": 3.19321206743567e-05, "loss": 0.9281, "mean_token_accuracy": 0.755976890027523, "num_tokens": 153669850.0, "step": 1630 }, { "entropy": 1.3814805909991263, "epoch": 0.3638582284097842, "grad_norm": 0.54296875, "learning_rate": 3.1821206743566994e-05, "loss": 0.9504, "mean_token_accuracy": 0.7522977091372013, "num_tokens": 154602553.0, "step": 1640 }, { "entropy": 1.3916409358382225, "epoch": 0.36607687614399026, "grad_norm": 0.54296875, "learning_rate": 3.171029281277729e-05, "loss": 0.9778, "mean_token_accuracy": 0.7461537972092629, "num_tokens": 155541120.0, "step": 1650 }, { "entropy": 1.3471432410180568, "epoch": 0.36829552387819625, "grad_norm": 0.52734375, "learning_rate": 3.159937888198758e-05, "loss": 0.9273, "mean_token_accuracy": 0.7581139869987965, "num_tokens": 156520158.0, "step": 1660 }, { "entropy": 1.404821753501892, "epoch": 0.37051417161240224, "grad_norm": 0.5625, "learning_rate": 3.148846495119787e-05, "loss": 1.0, "mean_token_accuracy": 0.7436496950685978, "num_tokens": 157463456.0, "step": 1670 }, { "entropy": 1.3906827136874198, "epoch": 0.37273281934660824, "grad_norm": 0.5390625, "learning_rate": 3.137755102040816e-05, "loss": 0.9907, "mean_token_accuracy": 0.7457496263086796, "num_tokens": 158405908.0, "step": 1680 }, { "entropy": 1.3714244484901428, "epoch": 0.3749514670808142, "grad_norm": 0.5234375, "learning_rate": 3.1266637089618455e-05, "loss": 0.9505, "mean_token_accuracy": 0.7535674646496773, "num_tokens": 159335729.0, "step": 1690 }, { "entropy": 1.390585573017597, "epoch": 0.3771701148150202, "grad_norm": 0.56640625, "learning_rate": 3.115572315882875e-05, "loss": 0.9966, "mean_token_accuracy": 0.7446259804069996, "num_tokens": 160296263.0, "step": 1700 }, { "entropy": 1.4077832899987697, "epoch": 0.37938876254922627, "grad_norm": 0.55859375, "learning_rate": 3.1044809228039046e-05, "loss": 0.9894, "mean_token_accuracy": 0.7444383382797242, "num_tokens": 161219852.0, "step": 1710 }, { "entropy": 1.395198680460453, "epoch": 0.38160741028343226, "grad_norm": 0.546875, "learning_rate": 3.093389529724934e-05, "loss": 1.0024, "mean_token_accuracy": 0.74552848264575, "num_tokens": 162158334.0, "step": 1720 }, { "entropy": 1.3805132403969764, "epoch": 0.38382605801763825, "grad_norm": 0.546875, "learning_rate": 3.082298136645963e-05, "loss": 0.9752, "mean_token_accuracy": 0.7499201230704784, "num_tokens": 163093367.0, "step": 1730 }, { "entropy": 1.398225909471512, "epoch": 0.38604470575184424, "grad_norm": 0.57421875, "learning_rate": 3.071206743566992e-05, "loss": 0.9824, "mean_token_accuracy": 0.7451727867126465, "num_tokens": 164014979.0, "step": 1740 }, { "entropy": 1.3813935965299606, "epoch": 0.38826335348605023, "grad_norm": 0.5390625, "learning_rate": 3.0601153504880215e-05, "loss": 0.9843, "mean_token_accuracy": 0.7469385854899884, "num_tokens": 164974085.0, "step": 1750 }, { "entropy": 1.368855346739292, "epoch": 0.3904820012202563, "grad_norm": 0.53515625, "learning_rate": 3.0490239574090507e-05, "loss": 0.9472, "mean_token_accuracy": 0.75348781645298, "num_tokens": 165918118.0, "step": 1760 }, { "entropy": 1.3673339888453484, "epoch": 0.3927006489544623, "grad_norm": 0.53515625, "learning_rate": 3.03793256433008e-05, "loss": 0.9387, "mean_token_accuracy": 0.755811995267868, "num_tokens": 166852949.0, "step": 1770 }, { "entropy": 1.3427365884184836, "epoch": 0.39491929668866826, "grad_norm": 0.50390625, "learning_rate": 3.026841171251109e-05, "loss": 0.9297, "mean_token_accuracy": 0.7581560261547565, "num_tokens": 167809459.0, "step": 1780 }, { "entropy": 1.3762704834342003, "epoch": 0.39713794442287426, "grad_norm": 0.55859375, "learning_rate": 3.0157497781721383e-05, "loss": 1.0051, "mean_token_accuracy": 0.7433216728270053, "num_tokens": 168752185.0, "step": 1790 }, { "entropy": 1.3575905784964561, "epoch": 0.39935659215708025, "grad_norm": 0.55078125, "learning_rate": 3.0046583850931682e-05, "loss": 0.9374, "mean_token_accuracy": 0.7572205021977425, "num_tokens": 169690119.0, "step": 1800 }, { "entropy": 1.3576733842492104, "epoch": 0.40157523989128624, "grad_norm": 0.55078125, "learning_rate": 2.9935669920141974e-05, "loss": 0.9523, "mean_token_accuracy": 0.7515712559223175, "num_tokens": 170619298.0, "step": 1810 }, { "entropy": 1.3723658367991447, "epoch": 0.4037938876254923, "grad_norm": 0.53515625, "learning_rate": 2.9824755989352266e-05, "loss": 0.9548, "mean_token_accuracy": 0.7528701044619084, "num_tokens": 171570309.0, "step": 1820 }, { "entropy": 1.4009515389800071, "epoch": 0.4060125353596983, "grad_norm": 0.515625, "learning_rate": 2.971384205856256e-05, "loss": 0.9975, "mean_token_accuracy": 0.7424866132438183, "num_tokens": 172494818.0, "step": 1830 }, { "entropy": 1.3911827325820922, "epoch": 0.40823118309390427, "grad_norm": 0.546875, "learning_rate": 2.960292812777285e-05, "loss": 0.9626, "mean_token_accuracy": 0.7502177953720093, "num_tokens": 173423865.0, "step": 1840 }, { "entropy": 1.3462319664657116, "epoch": 0.41044983082811026, "grad_norm": 0.5546875, "learning_rate": 2.9492014196983143e-05, "loss": 0.9437, "mean_token_accuracy": 0.7530038900673389, "num_tokens": 174366928.0, "step": 1850 }, { "entropy": 1.3755939684808254, "epoch": 0.41266847856231625, "grad_norm": 0.55078125, "learning_rate": 2.9381100266193435e-05, "loss": 0.9979, "mean_token_accuracy": 0.7425804652273655, "num_tokens": 175300342.0, "step": 1860 }, { "entropy": 1.3714133627712726, "epoch": 0.41488712629652225, "grad_norm": 0.59765625, "learning_rate": 2.9270186335403727e-05, "loss": 0.9564, "mean_token_accuracy": 0.7504196316003799, "num_tokens": 176242068.0, "step": 1870 }, { "entropy": 1.3977258250117301, "epoch": 0.4171057740307283, "grad_norm": 0.546875, "learning_rate": 2.915927240461402e-05, "loss": 0.9769, "mean_token_accuracy": 0.7471397712826728, "num_tokens": 177196173.0, "step": 1880 }, { "entropy": 1.3658091217279433, "epoch": 0.4193244217649343, "grad_norm": 0.6171875, "learning_rate": 2.9048358473824318e-05, "loss": 0.9419, "mean_token_accuracy": 0.753964976221323, "num_tokens": 178133746.0, "step": 1890 }, { "entropy": 1.3236115381121636, "epoch": 0.4215430694991403, "grad_norm": 0.53125, "learning_rate": 2.893744454303461e-05, "loss": 0.9437, "mean_token_accuracy": 0.7538949429988862, "num_tokens": 179096225.0, "step": 1900 }, { "entropy": 1.3948393434286117, "epoch": 0.42376171723334627, "grad_norm": 0.53515625, "learning_rate": 2.8826530612244902e-05, "loss": 1.002, "mean_token_accuracy": 0.7435316666960716, "num_tokens": 180036853.0, "step": 1910 }, { "entropy": 1.3544544890522956, "epoch": 0.42598036496755226, "grad_norm": 0.58984375, "learning_rate": 2.8715616681455194e-05, "loss": 0.9424, "mean_token_accuracy": 0.7551728583872318, "num_tokens": 180966842.0, "step": 1920 }, { "entropy": 1.3815669476985932, "epoch": 0.42819901270175825, "grad_norm": 0.53515625, "learning_rate": 2.8604702750665487e-05, "loss": 0.9622, "mean_token_accuracy": 0.7512604773044587, "num_tokens": 181900033.0, "step": 1930 }, { "entropy": 1.3831812545657158, "epoch": 0.4304176604359643, "grad_norm": 0.48046875, "learning_rate": 2.849378881987578e-05, "loss": 0.9525, "mean_token_accuracy": 0.7529491983354092, "num_tokens": 182851572.0, "step": 1940 }, { "entropy": 1.3749890983104707, "epoch": 0.4326363081701703, "grad_norm": 0.5390625, "learning_rate": 2.838287488908607e-05, "loss": 0.9776, "mean_token_accuracy": 0.7499315291643143, "num_tokens": 183771878.0, "step": 1950 }, { "entropy": 1.3801977284252644, "epoch": 0.4348549559043763, "grad_norm": 0.58203125, "learning_rate": 2.8271960958296363e-05, "loss": 0.9627, "mean_token_accuracy": 0.7519955664873124, "num_tokens": 184715766.0, "step": 1960 }, { "entropy": 1.3351484373211862, "epoch": 0.4370736036385823, "grad_norm": 0.55859375, "learning_rate": 2.8161047027506655e-05, "loss": 0.9321, "mean_token_accuracy": 0.7555009052157402, "num_tokens": 185661433.0, "step": 1970 }, { "entropy": 1.396961908042431, "epoch": 0.43929225137278827, "grad_norm": 0.5546875, "learning_rate": 2.8050133096716947e-05, "loss": 1.0058, "mean_token_accuracy": 0.7446497425436973, "num_tokens": 186585197.0, "step": 1980 }, { "entropy": 1.352859264612198, "epoch": 0.4415108991069943, "grad_norm": 0.52734375, "learning_rate": 2.7939219165927243e-05, "loss": 0.966, "mean_token_accuracy": 0.7493795678019524, "num_tokens": 187503900.0, "step": 1990 }, { "entropy": 1.333592215180397, "epoch": 0.4437295468412003, "grad_norm": 0.5, "learning_rate": 2.7828305235137535e-05, "loss": 0.9315, "mean_token_accuracy": 0.7587283760309219, "num_tokens": 188474289.0, "step": 2000 }, { "entropy": 1.3918707191944122, "epoch": 0.4459481945754063, "grad_norm": 0.57421875, "learning_rate": 2.7717391304347827e-05, "loss": 0.9874, "mean_token_accuracy": 0.746398999541998, "num_tokens": 189433780.0, "step": 2010 }, { "entropy": 1.368664526939392, "epoch": 0.4481668423096123, "grad_norm": 0.52734375, "learning_rate": 2.760647737355812e-05, "loss": 0.9454, "mean_token_accuracy": 0.755309022217989, "num_tokens": 190356653.0, "step": 2020 }, { "entropy": 1.4010012477636338, "epoch": 0.4503854900438183, "grad_norm": 0.55078125, "learning_rate": 2.749556344276841e-05, "loss": 1.0024, "mean_token_accuracy": 0.7404071927070618, "num_tokens": 191318931.0, "step": 2030 }, { "entropy": 1.3866683512926101, "epoch": 0.4526041377780243, "grad_norm": 0.6796875, "learning_rate": 2.7384649511978703e-05, "loss": 0.9751, "mean_token_accuracy": 0.7486230276525021, "num_tokens": 192303217.0, "step": 2040 }, { "entropy": 1.3726959481835366, "epoch": 0.4548227855122303, "grad_norm": 0.54296875, "learning_rate": 2.7273735581188996e-05, "loss": 0.9482, "mean_token_accuracy": 0.7530568726360798, "num_tokens": 193222632.0, "step": 2050 }, { "entropy": 1.3679525300860405, "epoch": 0.4570414332464363, "grad_norm": 0.5859375, "learning_rate": 2.7162821650399288e-05, "loss": 0.9506, "mean_token_accuracy": 0.7516115583479405, "num_tokens": 194151401.0, "step": 2060 }, { "entropy": 1.4062684878706933, "epoch": 0.4592600809806423, "grad_norm": 0.58984375, "learning_rate": 2.7051907719609583e-05, "loss": 0.9855, "mean_token_accuracy": 0.7442703887820243, "num_tokens": 195080292.0, "step": 2070 }, { "entropy": 1.3738665029406547, "epoch": 0.4614787287148483, "grad_norm": 0.56640625, "learning_rate": 2.694099378881988e-05, "loss": 0.9761, "mean_token_accuracy": 0.7479680195450783, "num_tokens": 196000406.0, "step": 2080 }, { "entropy": 1.3434479467570781, "epoch": 0.4636973764490543, "grad_norm": 0.5625, "learning_rate": 2.683007985803017e-05, "loss": 0.919, "mean_token_accuracy": 0.760900753736496, "num_tokens": 196914007.0, "step": 2090 }, { "entropy": 1.3689823046326637, "epoch": 0.4659160241832603, "grad_norm": 0.58203125, "learning_rate": 2.6719165927240463e-05, "loss": 0.9669, "mean_token_accuracy": 0.7499063372611999, "num_tokens": 197828045.0, "step": 2100 }, { "entropy": 1.3804068550467492, "epoch": 0.4681346719174663, "grad_norm": 0.55859375, "learning_rate": 2.6608251996450755e-05, "loss": 0.9433, "mean_token_accuracy": 0.7544724628329277, "num_tokens": 198765460.0, "step": 2110 }, { "entropy": 1.3435491159558297, "epoch": 0.4703533196516723, "grad_norm": 0.56640625, "learning_rate": 2.6497338065661047e-05, "loss": 0.9218, "mean_token_accuracy": 0.7582143515348434, "num_tokens": 199694033.0, "step": 2120 }, { "entropy": 1.394715888798237, "epoch": 0.4725719673858783, "grad_norm": 0.59765625, "learning_rate": 2.638642413487134e-05, "loss": 0.9791, "mean_token_accuracy": 0.746685141324997, "num_tokens": 200655207.0, "step": 2130 }, { "entropy": 1.3192944645881652, "epoch": 0.4747906151200843, "grad_norm": 0.54296875, "learning_rate": 2.627551020408163e-05, "loss": 0.9313, "mean_token_accuracy": 0.7588945962488651, "num_tokens": 201614974.0, "step": 2140 }, { "entropy": 1.3649922542273998, "epoch": 0.4770092628542903, "grad_norm": 0.5546875, "learning_rate": 2.6164596273291924e-05, "loss": 0.9602, "mean_token_accuracy": 0.7506442323327065, "num_tokens": 202551250.0, "step": 2150 }, { "entropy": 1.3999163076281547, "epoch": 0.4792279105884963, "grad_norm": 0.546875, "learning_rate": 2.6053682342502216e-05, "loss": 0.9891, "mean_token_accuracy": 0.744847048074007, "num_tokens": 203467276.0, "step": 2160 }, { "entropy": 1.3639633044600488, "epoch": 0.48144655832270233, "grad_norm": 0.55859375, "learning_rate": 2.5942768411712515e-05, "loss": 0.9824, "mean_token_accuracy": 0.7470031566917896, "num_tokens": 204368765.0, "step": 2170 }, { "entropy": 1.4031486429274083, "epoch": 0.4836652060569083, "grad_norm": 0.578125, "learning_rate": 2.5831854480922807e-05, "loss": 0.9948, "mean_token_accuracy": 0.7446600675582886, "num_tokens": 205276177.0, "step": 2180 }, { "entropy": 1.347407591342926, "epoch": 0.4858838537911143, "grad_norm": 0.53125, "learning_rate": 2.57209405501331e-05, "loss": 0.9339, "mean_token_accuracy": 0.7554423555731773, "num_tokens": 206213045.0, "step": 2190 }, { "entropy": 1.3782639726996422, "epoch": 0.4881025015253203, "grad_norm": 0.57421875, "learning_rate": 2.561002661934339e-05, "loss": 0.9529, "mean_token_accuracy": 0.7520141348242759, "num_tokens": 207163454.0, "step": 2200 }, { "entropy": 1.3646283119916915, "epoch": 0.4903211492595263, "grad_norm": 0.53515625, "learning_rate": 2.5499112688553683e-05, "loss": 0.944, "mean_token_accuracy": 0.7564348295331002, "num_tokens": 208151153.0, "step": 2210 }, { "entropy": 1.3543564982712268, "epoch": 0.4925397969937323, "grad_norm": 0.578125, "learning_rate": 2.5388198757763975e-05, "loss": 0.9695, "mean_token_accuracy": 0.7477301351726056, "num_tokens": 209092142.0, "step": 2220 }, { "entropy": 1.3566198840737342, "epoch": 0.49475844472793834, "grad_norm": 0.5390625, "learning_rate": 2.5277284826974267e-05, "loss": 0.9536, "mean_token_accuracy": 0.7519425883889198, "num_tokens": 210026782.0, "step": 2230 }, { "entropy": 1.3839320428669453, "epoch": 0.49697709246214433, "grad_norm": 0.5625, "learning_rate": 2.516637089618456e-05, "loss": 0.982, "mean_token_accuracy": 0.7456572473049163, "num_tokens": 210961869.0, "step": 2240 }, { "entropy": 1.3263145498931408, "epoch": 0.4991957401963503, "grad_norm": 0.53125, "learning_rate": 2.5055456965394852e-05, "loss": 0.9501, "mean_token_accuracy": 0.7539430402219296, "num_tokens": 211923968.0, "step": 2250 }, { "entropy": 1.3298779338598252, "epoch": 0.5014143879305564, "grad_norm": 0.515625, "learning_rate": 2.4944543034605147e-05, "loss": 0.9548, "mean_token_accuracy": 0.7525861606001853, "num_tokens": 212869103.0, "step": 2260 }, { "entropy": 1.3527758911252021, "epoch": 0.5036330356647624, "grad_norm": 0.494140625, "learning_rate": 2.483362910381544e-05, "loss": 0.9569, "mean_token_accuracy": 0.7526809461414814, "num_tokens": 213818858.0, "step": 2270 }, { "entropy": 1.3720970265567303, "epoch": 0.5058516833989684, "grad_norm": 0.51953125, "learning_rate": 2.4722715173025735e-05, "loss": 0.9519, "mean_token_accuracy": 0.7515731148421765, "num_tokens": 214779694.0, "step": 2280 }, { "entropy": 1.4162064865231514, "epoch": 0.5080703311331743, "grad_norm": 0.5625, "learning_rate": 2.4611801242236027e-05, "loss": 0.9876, "mean_token_accuracy": 0.7463356249034405, "num_tokens": 215737714.0, "step": 2290 }, { "entropy": 1.4002547860145569, "epoch": 0.5102889788673803, "grad_norm": 0.61328125, "learning_rate": 2.450088731144632e-05, "loss": 0.9809, "mean_token_accuracy": 0.7466327108442783, "num_tokens": 216677039.0, "step": 2300 }, { "entropy": 1.3871633470058442, "epoch": 0.5125076266015863, "grad_norm": 0.55859375, "learning_rate": 2.438997338065661e-05, "loss": 0.9862, "mean_token_accuracy": 0.7464494623243809, "num_tokens": 217592435.0, "step": 2310 }, { "entropy": 1.3928598061203956, "epoch": 0.5147262743357923, "grad_norm": 0.57421875, "learning_rate": 2.4279059449866903e-05, "loss": 0.9854, "mean_token_accuracy": 0.7452214293181896, "num_tokens": 218535578.0, "step": 2320 }, { "entropy": 1.3906780779361725, "epoch": 0.5169449220699983, "grad_norm": 0.52734375, "learning_rate": 2.41681455190772e-05, "loss": 0.9613, "mean_token_accuracy": 0.7505389004945755, "num_tokens": 219486330.0, "step": 2330 }, { "entropy": 1.378984921425581, "epoch": 0.5191635698042043, "grad_norm": 0.546875, "learning_rate": 2.405723158828749e-05, "loss": 0.9808, "mean_token_accuracy": 0.7484551966190338, "num_tokens": 220422599.0, "step": 2340 }, { "entropy": 1.3721670493483544, "epoch": 0.5213822175384103, "grad_norm": 0.5390625, "learning_rate": 2.3946317657497783e-05, "loss": 0.9709, "mean_token_accuracy": 0.7495145805180072, "num_tokens": 221377332.0, "step": 2350 }, { "entropy": 1.402656690776348, "epoch": 0.5236008652726163, "grad_norm": 0.5703125, "learning_rate": 2.3835403726708075e-05, "loss": 0.9879, "mean_token_accuracy": 0.7473884426057339, "num_tokens": 222314994.0, "step": 2360 }, { "entropy": 1.3594323709607123, "epoch": 0.5258195130068224, "grad_norm": 0.5859375, "learning_rate": 2.372448979591837e-05, "loss": 0.9538, "mean_token_accuracy": 0.7511370845139027, "num_tokens": 223224438.0, "step": 2370 }, { "entropy": 1.3805907770991326, "epoch": 0.5280381607410284, "grad_norm": 0.56640625, "learning_rate": 2.3613575865128663e-05, "loss": 0.9735, "mean_token_accuracy": 0.7476461634039879, "num_tokens": 224162752.0, "step": 2380 }, { "entropy": 1.370700439810753, "epoch": 0.5302568084752344, "grad_norm": 0.55859375, "learning_rate": 2.3502661934338955e-05, "loss": 0.9706, "mean_token_accuracy": 0.7497715629637242, "num_tokens": 225115083.0, "step": 2390 }, { "entropy": 1.3743368998169898, "epoch": 0.5324754562094404, "grad_norm": 0.53125, "learning_rate": 2.3391748003549247e-05, "loss": 0.9413, "mean_token_accuracy": 0.7557661548256874, "num_tokens": 226058977.0, "step": 2400 }, { "entropy": 1.3839602798223496, "epoch": 0.5346941039436464, "grad_norm": 0.54296875, "learning_rate": 2.328083407275954e-05, "loss": 0.9615, "mean_token_accuracy": 0.7533138573169709, "num_tokens": 227010773.0, "step": 2410 }, { "entropy": 1.3525896489620208, "epoch": 0.5369127516778524, "grad_norm": 0.54296875, "learning_rate": 2.3169920141969835e-05, "loss": 0.9493, "mean_token_accuracy": 0.7553107261657714, "num_tokens": 227955312.0, "step": 2420 }, { "entropy": 1.3674135118722917, "epoch": 0.5391313994120583, "grad_norm": 0.55078125, "learning_rate": 2.3059006211180127e-05, "loss": 0.9549, "mean_token_accuracy": 0.752379784733057, "num_tokens": 228898935.0, "step": 2430 }, { "entropy": 1.3545546859502793, "epoch": 0.5413500471462643, "grad_norm": 0.56640625, "learning_rate": 2.294809228039042e-05, "loss": 0.924, "mean_token_accuracy": 0.7607569552958011, "num_tokens": 229849618.0, "step": 2440 }, { "entropy": 1.3558753475546836, "epoch": 0.5435686948804703, "grad_norm": 0.55859375, "learning_rate": 2.283717834960071e-05, "loss": 0.9193, "mean_token_accuracy": 0.7595973119139672, "num_tokens": 230791414.0, "step": 2450 }, { "entropy": 1.3477294951677323, "epoch": 0.5457873426146763, "grad_norm": 0.52734375, "learning_rate": 2.2726264418811003e-05, "loss": 0.9388, "mean_token_accuracy": 0.7565565295517445, "num_tokens": 231726099.0, "step": 2460 }, { "entropy": 1.3844288192689418, "epoch": 0.5480059903488823, "grad_norm": 0.58984375, "learning_rate": 2.26153504880213e-05, "loss": 0.9495, "mean_token_accuracy": 0.7530641496181488, "num_tokens": 232656045.0, "step": 2470 }, { "entropy": 1.3597193375229835, "epoch": 0.5502246380830884, "grad_norm": 0.515625, "learning_rate": 2.250443655723159e-05, "loss": 0.966, "mean_token_accuracy": 0.7509191624820233, "num_tokens": 233602005.0, "step": 2480 }, { "entropy": 1.3691200099885463, "epoch": 0.5524432858172944, "grad_norm": 0.5546875, "learning_rate": 2.2393522626441883e-05, "loss": 0.9542, "mean_token_accuracy": 0.7519414819777012, "num_tokens": 234562308.0, "step": 2490 }, { "entropy": 1.3906163677573204, "epoch": 0.5546619335515004, "grad_norm": 0.55859375, "learning_rate": 2.2282608695652175e-05, "loss": 1.0039, "mean_token_accuracy": 0.7424245841801167, "num_tokens": 235506260.0, "step": 2500 }, { "entropy": 1.3696281641721726, "epoch": 0.5568805812857064, "grad_norm": 0.5390625, "learning_rate": 2.2171694764862467e-05, "loss": 0.9453, "mean_token_accuracy": 0.7540791384875775, "num_tokens": 236457040.0, "step": 2510 }, { "entropy": 1.3700327768921852, "epoch": 0.5590992290199124, "grad_norm": 0.5859375, "learning_rate": 2.206078083407276e-05, "loss": 0.9793, "mean_token_accuracy": 0.7462692283093929, "num_tokens": 237378902.0, "step": 2520 }, { "entropy": 1.398044180870056, "epoch": 0.5613178767541184, "grad_norm": 0.59765625, "learning_rate": 2.1949866903283052e-05, "loss": 0.9967, "mean_token_accuracy": 0.7434925585985184, "num_tokens": 238311961.0, "step": 2530 }, { "entropy": 1.3696945488452912, "epoch": 0.5635365244883244, "grad_norm": 0.5546875, "learning_rate": 2.1838952972493347e-05, "loss": 0.944, "mean_token_accuracy": 0.7557799100875855, "num_tokens": 239234133.0, "step": 2540 }, { "entropy": 1.3959093943238259, "epoch": 0.5657551722225304, "grad_norm": 0.546875, "learning_rate": 2.172803904170364e-05, "loss": 0.9815, "mean_token_accuracy": 0.7467247255146503, "num_tokens": 240146423.0, "step": 2550 }, { "entropy": 1.3369751781225205, "epoch": 0.5679738199567363, "grad_norm": 0.546875, "learning_rate": 2.161712511091393e-05, "loss": 0.9468, "mean_token_accuracy": 0.7567501932382583, "num_tokens": 241119847.0, "step": 2560 }, { "entropy": 1.390147428959608, "epoch": 0.5701924676909423, "grad_norm": 0.53515625, "learning_rate": 2.1506211180124224e-05, "loss": 0.9676, "mean_token_accuracy": 0.7480736941099166, "num_tokens": 242052102.0, "step": 2570 }, { "entropy": 1.3671862602233886, "epoch": 0.5724111154251483, "grad_norm": 0.5234375, "learning_rate": 2.1395297249334516e-05, "loss": 0.9731, "mean_token_accuracy": 0.7491575211286545, "num_tokens": 242987170.0, "step": 2580 }, { "entropy": 1.3787225410342216, "epoch": 0.5746297631593543, "grad_norm": 0.56640625, "learning_rate": 2.1284383318544808e-05, "loss": 0.9672, "mean_token_accuracy": 0.7511276498436927, "num_tokens": 243963315.0, "step": 2590 }, { "entropy": 1.3578606337308883, "epoch": 0.5768484108935604, "grad_norm": 0.515625, "learning_rate": 2.1173469387755103e-05, "loss": 0.9603, "mean_token_accuracy": 0.7515728779137134, "num_tokens": 244904401.0, "step": 2600 }, { "entropy": 1.3674334943294526, "epoch": 0.5790670586277664, "grad_norm": 0.55078125, "learning_rate": 2.1062555456965396e-05, "loss": 0.9511, "mean_token_accuracy": 0.7508557684719562, "num_tokens": 245843429.0, "step": 2610 }, { "entropy": 1.3535479776561261, "epoch": 0.5812857063619724, "grad_norm": 0.51953125, "learning_rate": 2.0951641526175688e-05, "loss": 0.9605, "mean_token_accuracy": 0.7512571468949318, "num_tokens": 246778122.0, "step": 2620 }, { "entropy": 1.3785287618637085, "epoch": 0.5835043540961784, "grad_norm": 0.5390625, "learning_rate": 2.084072759538598e-05, "loss": 0.9729, "mean_token_accuracy": 0.7481971070170402, "num_tokens": 247718243.0, "step": 2630 }, { "entropy": 1.371111909300089, "epoch": 0.5857230018303844, "grad_norm": 0.55078125, "learning_rate": 2.0729813664596272e-05, "loss": 0.9659, "mean_token_accuracy": 0.7520016901195049, "num_tokens": 248674188.0, "step": 2640 }, { "entropy": 1.3743113353848457, "epoch": 0.5879416495645904, "grad_norm": 0.5234375, "learning_rate": 2.0618899733806567e-05, "loss": 0.9857, "mean_token_accuracy": 0.7460017666220665, "num_tokens": 249630785.0, "step": 2650 }, { "entropy": 1.3525418415665627, "epoch": 0.5901602972987964, "grad_norm": 0.51171875, "learning_rate": 2.050798580301686e-05, "loss": 0.951, "mean_token_accuracy": 0.7526404090225697, "num_tokens": 250583741.0, "step": 2660 }, { "entropy": 1.404486595094204, "epoch": 0.5923789450330024, "grad_norm": 0.5546875, "learning_rate": 2.0397071872227152e-05, "loss": 0.9612, "mean_token_accuracy": 0.7494330175220967, "num_tokens": 251500094.0, "step": 2670 }, { "entropy": 1.387998953461647, "epoch": 0.5945975927672084, "grad_norm": 0.54296875, "learning_rate": 2.0286157941437444e-05, "loss": 0.9929, "mean_token_accuracy": 0.7457513011991977, "num_tokens": 252449803.0, "step": 2680 }, { "entropy": 1.3362199790775775, "epoch": 0.5968162405014144, "grad_norm": 0.5625, "learning_rate": 2.0175244010647736e-05, "loss": 0.9124, "mean_token_accuracy": 0.7635637722909451, "num_tokens": 253395680.0, "step": 2690 }, { "entropy": 1.4146859273314476, "epoch": 0.5990348882356203, "grad_norm": 0.5625, "learning_rate": 2.006433007985803e-05, "loss": 0.9799, "mean_token_accuracy": 0.7484463512897491, "num_tokens": 254339264.0, "step": 2700 }, { "entropy": 1.3608046501874924, "epoch": 0.6012535359698263, "grad_norm": 0.51953125, "learning_rate": 1.9953416149068324e-05, "loss": 0.9673, "mean_token_accuracy": 0.7515561901032924, "num_tokens": 255290026.0, "step": 2710 }, { "entropy": 1.3799020916223526, "epoch": 0.6034721837040324, "grad_norm": 0.5859375, "learning_rate": 1.9842502218278616e-05, "loss": 0.9756, "mean_token_accuracy": 0.7478848710656166, "num_tokens": 256215452.0, "step": 2720 }, { "entropy": 1.3492946550250053, "epoch": 0.6056908314382384, "grad_norm": 0.54296875, "learning_rate": 1.9731588287488908e-05, "loss": 0.9311, "mean_token_accuracy": 0.7583515666425228, "num_tokens": 257169093.0, "step": 2730 }, { "entropy": 1.3475312367081642, "epoch": 0.6079094791724444, "grad_norm": 0.5390625, "learning_rate": 1.9620674356699203e-05, "loss": 0.9507, "mean_token_accuracy": 0.7529344208538532, "num_tokens": 258138135.0, "step": 2740 }, { "entropy": 1.3525680214166642, "epoch": 0.6101281269066504, "grad_norm": 0.53515625, "learning_rate": 1.9509760425909496e-05, "loss": 0.9509, "mean_token_accuracy": 0.7542378917336464, "num_tokens": 259109912.0, "step": 2750 }, { "entropy": 1.386097263544798, "epoch": 0.6123467746408564, "grad_norm": 0.50390625, "learning_rate": 1.9398846495119788e-05, "loss": 0.9542, "mean_token_accuracy": 0.754255336523056, "num_tokens": 260053220.0, "step": 2760 }, { "entropy": 1.3739720061421394, "epoch": 0.6145654223750624, "grad_norm": 0.55078125, "learning_rate": 1.928793256433008e-05, "loss": 0.9611, "mean_token_accuracy": 0.7508481532335282, "num_tokens": 260961630.0, "step": 2770 }, { "entropy": 1.3830955043435096, "epoch": 0.6167840701092684, "grad_norm": 0.57421875, "learning_rate": 1.9177018633540372e-05, "loss": 0.9857, "mean_token_accuracy": 0.7444805398583412, "num_tokens": 261881656.0, "step": 2780 }, { "entropy": 1.362017647176981, "epoch": 0.6190027178434744, "grad_norm": 0.5390625, "learning_rate": 1.9066104702750667e-05, "loss": 0.9689, "mean_token_accuracy": 0.749096342921257, "num_tokens": 262826457.0, "step": 2790 }, { "entropy": 1.3458002880215645, "epoch": 0.6212213655776804, "grad_norm": 0.51953125, "learning_rate": 1.895519077196096e-05, "loss": 0.9281, "mean_token_accuracy": 0.7574586406350136, "num_tokens": 263773429.0, "step": 2800 }, { "entropy": 1.3549387857317925, "epoch": 0.6234400133118864, "grad_norm": 0.5625, "learning_rate": 1.8844276841171252e-05, "loss": 0.9219, "mean_token_accuracy": 0.7583517156541347, "num_tokens": 264707730.0, "step": 2810 }, { "entropy": 1.3565895311534404, "epoch": 0.6256586610460924, "grad_norm": 0.53515625, "learning_rate": 1.8733362910381544e-05, "loss": 0.9368, "mean_token_accuracy": 0.753548564761877, "num_tokens": 265654078.0, "step": 2820 }, { "entropy": 1.3848047599196434, "epoch": 0.6278773087802985, "grad_norm": 0.55078125, "learning_rate": 1.862244897959184e-05, "loss": 0.975, "mean_token_accuracy": 0.748593944311142, "num_tokens": 266590424.0, "step": 2830 }, { "entropy": 1.3483957096934318, "epoch": 0.6300959565145045, "grad_norm": 0.5078125, "learning_rate": 1.851153504880213e-05, "loss": 0.9282, "mean_token_accuracy": 0.7571537889540195, "num_tokens": 267518833.0, "step": 2840 }, { "entropy": 1.3641344249248504, "epoch": 0.6323146042487104, "grad_norm": 0.51953125, "learning_rate": 1.8400621118012424e-05, "loss": 0.9605, "mean_token_accuracy": 0.7526396319270134, "num_tokens": 268449765.0, "step": 2850 }, { "entropy": 1.32438455671072, "epoch": 0.6345332519829164, "grad_norm": 0.57421875, "learning_rate": 1.8289707187222716e-05, "loss": 0.9202, "mean_token_accuracy": 0.7574717938899994, "num_tokens": 269378040.0, "step": 2860 }, { "entropy": 1.365363524854183, "epoch": 0.6367518997171224, "grad_norm": 0.5078125, "learning_rate": 1.8178793256433008e-05, "loss": 0.9444, "mean_token_accuracy": 0.7561964854598046, "num_tokens": 270314784.0, "step": 2870 }, { "entropy": 1.3871594324707985, "epoch": 0.6389705474513284, "grad_norm": 0.60546875, "learning_rate": 1.8067879325643303e-05, "loss": 0.9619, "mean_token_accuracy": 0.7529800362884999, "num_tokens": 271247351.0, "step": 2880 }, { "entropy": 1.403894129395485, "epoch": 0.6411891951855344, "grad_norm": 0.54296875, "learning_rate": 1.7956965394853596e-05, "loss": 0.9799, "mean_token_accuracy": 0.7474908255040645, "num_tokens": 272187504.0, "step": 2890 }, { "entropy": 1.373784029483795, "epoch": 0.6434078429197404, "grad_norm": 0.52734375, "learning_rate": 1.7846051464063888e-05, "loss": 0.9801, "mean_token_accuracy": 0.7456812761723995, "num_tokens": 273121065.0, "step": 2900 }, { "entropy": 1.4182383090257644, "epoch": 0.6456264906539464, "grad_norm": 0.57421875, "learning_rate": 1.773513753327418e-05, "loss": 1.0075, "mean_token_accuracy": 0.7424289509654045, "num_tokens": 274058083.0, "step": 2910 }, { "entropy": 1.3978426158428192, "epoch": 0.6478451383881524, "grad_norm": 0.5625, "learning_rate": 1.7624223602484475e-05, "loss": 0.9752, "mean_token_accuracy": 0.7466619923710823, "num_tokens": 274983318.0, "step": 2920 }, { "entropy": 1.3537883020937442, "epoch": 0.6500637861223584, "grad_norm": 0.54296875, "learning_rate": 1.7513309671694767e-05, "loss": 0.9218, "mean_token_accuracy": 0.7595953151583672, "num_tokens": 275920398.0, "step": 2930 }, { "entropy": 1.3750786110758781, "epoch": 0.6522824338565644, "grad_norm": 0.578125, "learning_rate": 1.740239574090506e-05, "loss": 0.9448, "mean_token_accuracy": 0.7525995224714279, "num_tokens": 276854958.0, "step": 2940 }, { "entropy": 1.3850456327199936, "epoch": 0.6545010815907705, "grad_norm": 0.5234375, "learning_rate": 1.7291481810115352e-05, "loss": 0.9803, "mean_token_accuracy": 0.745450871437788, "num_tokens": 277786978.0, "step": 2950 }, { "entropy": 1.3714064493775369, "epoch": 0.6567197293249765, "grad_norm": 0.55859375, "learning_rate": 1.7180567879325644e-05, "loss": 0.9651, "mean_token_accuracy": 0.7489276170730591, "num_tokens": 278730912.0, "step": 2960 }, { "entropy": 1.3698252201080323, "epoch": 0.6589383770591825, "grad_norm": 0.59765625, "learning_rate": 1.706965394853594e-05, "loss": 0.9651, "mean_token_accuracy": 0.7497381448745728, "num_tokens": 279665300.0, "step": 2970 }, { "entropy": 1.3747903369367123, "epoch": 0.6611570247933884, "grad_norm": 0.51171875, "learning_rate": 1.695874001774623e-05, "loss": 0.9628, "mean_token_accuracy": 0.7499303415417671, "num_tokens": 280618272.0, "step": 2980 }, { "entropy": 1.3819094851613045, "epoch": 0.6633756725275944, "grad_norm": 0.54296875, "learning_rate": 1.6847826086956524e-05, "loss": 0.9551, "mean_token_accuracy": 0.7553550757467746, "num_tokens": 281554536.0, "step": 2990 }, { "entropy": 1.3707010336220264, "epoch": 0.6655943202618004, "grad_norm": 0.51171875, "learning_rate": 1.6736912156166816e-05, "loss": 0.9655, "mean_token_accuracy": 0.7515952527523041, "num_tokens": 282504485.0, "step": 3000 }, { "entropy": 1.3754500553011895, "epoch": 0.6678129679960064, "grad_norm": 0.53515625, "learning_rate": 1.6625998225377108e-05, "loss": 0.9502, "mean_token_accuracy": 0.7545687988400459, "num_tokens": 283421042.0, "step": 3010 }, { "entropy": 1.392235305160284, "epoch": 0.6700316157302124, "grad_norm": 0.578125, "learning_rate": 1.6515084294587403e-05, "loss": 0.9632, "mean_token_accuracy": 0.7509094551205635, "num_tokens": 284360423.0, "step": 3020 }, { "entropy": 1.3561602622270583, "epoch": 0.6722502634644184, "grad_norm": 0.51953125, "learning_rate": 1.6404170363797696e-05, "loss": 0.9744, "mean_token_accuracy": 0.7496522702276707, "num_tokens": 285303033.0, "step": 3030 }, { "entropy": 1.362218789756298, "epoch": 0.6744689111986244, "grad_norm": 0.54296875, "learning_rate": 1.6293256433007988e-05, "loss": 0.9366, "mean_token_accuracy": 0.7554511360824108, "num_tokens": 286237138.0, "step": 3040 }, { "entropy": 1.366736714541912, "epoch": 0.6766875589328304, "grad_norm": 0.5546875, "learning_rate": 1.618234250221828e-05, "loss": 0.9805, "mean_token_accuracy": 0.7496004432439805, "num_tokens": 287158543.0, "step": 3050 }, { "entropy": 1.3793413534760475, "epoch": 0.6789062066670365, "grad_norm": 0.53125, "learning_rate": 1.6071428571428572e-05, "loss": 0.9734, "mean_token_accuracy": 0.7480289973318577, "num_tokens": 288077419.0, "step": 3060 }, { "entropy": 1.3908205471932888, "epoch": 0.6811248544012425, "grad_norm": 0.50390625, "learning_rate": 1.5960514640638864e-05, "loss": 0.9812, "mean_token_accuracy": 0.7471683271229267, "num_tokens": 289027657.0, "step": 3070 }, { "entropy": 1.3779977604746818, "epoch": 0.6833435021354485, "grad_norm": 0.49609375, "learning_rate": 1.5849600709849156e-05, "loss": 0.9721, "mean_token_accuracy": 0.7498278774321079, "num_tokens": 289969226.0, "step": 3080 }, { "entropy": 1.3782277286052704, "epoch": 0.6855621498696545, "grad_norm": 0.51171875, "learning_rate": 1.573868677905945e-05, "loss": 0.9814, "mean_token_accuracy": 0.7463328778743744, "num_tokens": 290886120.0, "step": 3090 }, { "entropy": 1.366072203218937, "epoch": 0.6877807976038605, "grad_norm": 0.54296875, "learning_rate": 1.5627772848269744e-05, "loss": 0.9361, "mean_token_accuracy": 0.7534136839210988, "num_tokens": 291823611.0, "step": 3100 }, { "entropy": 1.393534542620182, "epoch": 0.6899994453380665, "grad_norm": 0.5234375, "learning_rate": 1.5516858917480036e-05, "loss": 0.9701, "mean_token_accuracy": 0.7499865688383579, "num_tokens": 292771710.0, "step": 3110 }, { "entropy": 1.3469060599803924, "epoch": 0.6922180930722724, "grad_norm": 0.55859375, "learning_rate": 1.5405944986690328e-05, "loss": 0.9529, "mean_token_accuracy": 0.7520712472498416, "num_tokens": 293710284.0, "step": 3120 }, { "entropy": 1.387193675339222, "epoch": 0.6944367408064784, "grad_norm": 0.54296875, "learning_rate": 1.529503105590062e-05, "loss": 0.9551, "mean_token_accuracy": 0.7517340816557407, "num_tokens": 294637424.0, "step": 3130 }, { "entropy": 1.3879702135920524, "epoch": 0.6966553885406844, "grad_norm": 0.5546875, "learning_rate": 1.5184117125110914e-05, "loss": 0.9713, "mean_token_accuracy": 0.7498943455517292, "num_tokens": 295552946.0, "step": 3140 }, { "entropy": 1.3521149441599847, "epoch": 0.6988740362748904, "grad_norm": 0.5390625, "learning_rate": 1.5073203194321208e-05, "loss": 0.9561, "mean_token_accuracy": 0.7530835166573524, "num_tokens": 296482856.0, "step": 3150 }, { "entropy": 1.3523337855935096, "epoch": 0.7010926840090964, "grad_norm": 0.5859375, "learning_rate": 1.4962289263531502e-05, "loss": 0.9482, "mean_token_accuracy": 0.7535679526627064, "num_tokens": 297414186.0, "step": 3160 }, { "entropy": 1.371672622859478, "epoch": 0.7033113317433024, "grad_norm": 0.546875, "learning_rate": 1.4851375332741794e-05, "loss": 0.9547, "mean_token_accuracy": 0.7499964490532876, "num_tokens": 298378469.0, "step": 3170 }, { "entropy": 1.3734628334641457, "epoch": 0.7055299794775085, "grad_norm": 0.5390625, "learning_rate": 1.4740461401952086e-05, "loss": 0.9766, "mean_token_accuracy": 0.7470006972551346, "num_tokens": 299298648.0, "step": 3180 }, { "entropy": 1.3621489077806472, "epoch": 0.7077486272117145, "grad_norm": 0.51953125, "learning_rate": 1.4629547471162378e-05, "loss": 0.976, "mean_token_accuracy": 0.7489259757101536, "num_tokens": 300256274.0, "step": 3190 }, { "entropy": 1.3307632811367511, "epoch": 0.7099672749459205, "grad_norm": 0.51953125, "learning_rate": 1.4518633540372672e-05, "loss": 0.9264, "mean_token_accuracy": 0.7602166160941124, "num_tokens": 301216228.0, "step": 3200 }, { "entropy": 1.378267367184162, "epoch": 0.7121859226801265, "grad_norm": 0.5703125, "learning_rate": 1.4407719609582964e-05, "loss": 0.9933, "mean_token_accuracy": 0.7443177163600921, "num_tokens": 302148133.0, "step": 3210 }, { "entropy": 1.3858237951993941, "epoch": 0.7144045704143325, "grad_norm": 0.51953125, "learning_rate": 1.4296805678793256e-05, "loss": 0.9591, "mean_token_accuracy": 0.75175336971879, "num_tokens": 303092579.0, "step": 3220 }, { "entropy": 1.349436528980732, "epoch": 0.7166232181485385, "grad_norm": 0.5390625, "learning_rate": 1.4185891748003548e-05, "loss": 0.9678, "mean_token_accuracy": 0.7483910910785199, "num_tokens": 304045131.0, "step": 3230 }, { "entropy": 1.3605081930756568, "epoch": 0.7188418658827445, "grad_norm": 0.5078125, "learning_rate": 1.4074977817213844e-05, "loss": 0.9462, "mean_token_accuracy": 0.7560873411595821, "num_tokens": 305017251.0, "step": 3240 }, { "entropy": 1.3534643828868866, "epoch": 0.7210605136169504, "grad_norm": 0.5625, "learning_rate": 1.3964063886424136e-05, "loss": 0.926, "mean_token_accuracy": 0.7599373154342175, "num_tokens": 305959111.0, "step": 3250 }, { "entropy": 1.3700198411941529, "epoch": 0.7232791613511564, "grad_norm": 0.57421875, "learning_rate": 1.3853149955634428e-05, "loss": 0.9498, "mean_token_accuracy": 0.7523197077214718, "num_tokens": 306895226.0, "step": 3260 }, { "entropy": 1.36115460395813, "epoch": 0.7254978090853624, "grad_norm": 0.578125, "learning_rate": 1.374223602484472e-05, "loss": 0.9696, "mean_token_accuracy": 0.7488263450562954, "num_tokens": 307845938.0, "step": 3270 }, { "entropy": 1.3370314098894596, "epoch": 0.7277164568195684, "grad_norm": 0.53125, "learning_rate": 1.3631322094055012e-05, "loss": 0.9092, "mean_token_accuracy": 0.7618122868239879, "num_tokens": 308778745.0, "step": 3280 }, { "entropy": 1.3687497057020663, "epoch": 0.7299351045537745, "grad_norm": 0.50390625, "learning_rate": 1.3520408163265308e-05, "loss": 0.9623, "mean_token_accuracy": 0.75139045342803, "num_tokens": 309737239.0, "step": 3290 }, { "entropy": 1.352933470904827, "epoch": 0.7321537522879805, "grad_norm": 0.56640625, "learning_rate": 1.34094942324756e-05, "loss": 0.9724, "mean_token_accuracy": 0.7514422044157982, "num_tokens": 310687853.0, "step": 3300 }, { "entropy": 1.400717096030712, "epoch": 0.7343724000221865, "grad_norm": 0.55078125, "learning_rate": 1.3298580301685892e-05, "loss": 1.0037, "mean_token_accuracy": 0.7421482533216477, "num_tokens": 311619002.0, "step": 3310 }, { "entropy": 1.3361869268119335, "epoch": 0.7365910477563925, "grad_norm": 0.578125, "learning_rate": 1.3187666370896184e-05, "loss": 0.9664, "mean_token_accuracy": 0.7487700201570988, "num_tokens": 312570005.0, "step": 3320 }, { "entropy": 1.3680378429591655, "epoch": 0.7388096954905985, "grad_norm": 0.5625, "learning_rate": 1.3076752440106476e-05, "loss": 0.9453, "mean_token_accuracy": 0.753575050085783, "num_tokens": 313510156.0, "step": 3330 }, { "entropy": 1.405937422066927, "epoch": 0.7410283432248045, "grad_norm": 0.5546875, "learning_rate": 1.2965838509316772e-05, "loss": 0.9661, "mean_token_accuracy": 0.7477953679859638, "num_tokens": 314441510.0, "step": 3340 }, { "entropy": 1.37651297301054, "epoch": 0.7432469909590105, "grad_norm": 0.53125, "learning_rate": 1.2854924578527064e-05, "loss": 0.9893, "mean_token_accuracy": 0.7443842552602291, "num_tokens": 315396770.0, "step": 3350 }, { "entropy": 1.3754449300467968, "epoch": 0.7454656386932165, "grad_norm": 0.50390625, "learning_rate": 1.2744010647737356e-05, "loss": 0.9761, "mean_token_accuracy": 0.746372677385807, "num_tokens": 316364686.0, "step": 3360 }, { "entropy": 1.3677063122391702, "epoch": 0.7476842864274225, "grad_norm": 0.53125, "learning_rate": 1.2633096716947648e-05, "loss": 0.9791, "mean_token_accuracy": 0.747562813013792, "num_tokens": 317297712.0, "step": 3370 }, { "entropy": 1.3510807111859322, "epoch": 0.7499029341616285, "grad_norm": 0.53515625, "learning_rate": 1.2522182786157944e-05, "loss": 0.9572, "mean_token_accuracy": 0.7519927278161049, "num_tokens": 318239974.0, "step": 3380 }, { "entropy": 1.3774001389741897, "epoch": 0.7521215818958344, "grad_norm": 0.546875, "learning_rate": 1.2411268855368236e-05, "loss": 0.9716, "mean_token_accuracy": 0.7503920882940293, "num_tokens": 319176815.0, "step": 3390 }, { "entropy": 1.355586975067854, "epoch": 0.7543402296300404, "grad_norm": 0.5390625, "learning_rate": 1.2300354924578528e-05, "loss": 0.9653, "mean_token_accuracy": 0.7494859971106053, "num_tokens": 320142075.0, "step": 3400 }, { "entropy": 1.3683804802596569, "epoch": 0.7565588773642465, "grad_norm": 0.53125, "learning_rate": 1.218944099378882e-05, "loss": 0.9564, "mean_token_accuracy": 0.752348380535841, "num_tokens": 321078125.0, "step": 3410 }, { "entropy": 1.3689906552433968, "epoch": 0.7587775250984525, "grad_norm": 0.56640625, "learning_rate": 1.2078527062999114e-05, "loss": 0.955, "mean_token_accuracy": 0.7519045077264309, "num_tokens": 321996511.0, "step": 3420 }, { "entropy": 1.3541745007038117, "epoch": 0.7609961728326585, "grad_norm": 0.5234375, "learning_rate": 1.1967613132209406e-05, "loss": 0.941, "mean_token_accuracy": 0.7579099789261818, "num_tokens": 322948179.0, "step": 3430 }, { "entropy": 1.3591908812522888, "epoch": 0.7632148205668645, "grad_norm": 0.53125, "learning_rate": 1.18566992014197e-05, "loss": 0.964, "mean_token_accuracy": 0.7525539971888066, "num_tokens": 323912573.0, "step": 3440 }, { "entropy": 1.36717321947217, "epoch": 0.7654334683010705, "grad_norm": 0.5546875, "learning_rate": 1.1745785270629992e-05, "loss": 0.9484, "mean_token_accuracy": 0.7522753067314625, "num_tokens": 324848669.0, "step": 3450 }, { "entropy": 1.3821905687451363, "epoch": 0.7676521160352765, "grad_norm": 0.546875, "learning_rate": 1.1634871339840284e-05, "loss": 0.9789, "mean_token_accuracy": 0.7475393317639828, "num_tokens": 325764593.0, "step": 3460 }, { "entropy": 1.3809657365083694, "epoch": 0.7698707637694825, "grad_norm": 0.55078125, "learning_rate": 1.1523957409050576e-05, "loss": 0.9433, "mean_token_accuracy": 0.7541690699756145, "num_tokens": 326728229.0, "step": 3470 }, { "entropy": 1.3609302565455437, "epoch": 0.7720894115036885, "grad_norm": 0.5078125, "learning_rate": 1.141304347826087e-05, "loss": 0.9323, "mean_token_accuracy": 0.7568138137459754, "num_tokens": 327666372.0, "step": 3480 }, { "entropy": 1.35459363758564, "epoch": 0.7743080592378945, "grad_norm": 0.55078125, "learning_rate": 1.1302129547471162e-05, "loss": 0.9626, "mean_token_accuracy": 0.7514002807438374, "num_tokens": 328589542.0, "step": 3490 }, { "entropy": 1.335961400717497, "epoch": 0.7765267069721005, "grad_norm": 0.51171875, "learning_rate": 1.1191215616681455e-05, "loss": 0.9327, "mean_token_accuracy": 0.7580720439553261, "num_tokens": 329542171.0, "step": 3500 }, { "entropy": 1.4132342591881752, "epoch": 0.7787453547063065, "grad_norm": 0.5625, "learning_rate": 1.1080301685891748e-05, "loss": 1.0189, "mean_token_accuracy": 0.7392169758677483, "num_tokens": 330481198.0, "step": 3510 }, { "entropy": 1.4080789655447006, "epoch": 0.7809640024405126, "grad_norm": 0.55078125, "learning_rate": 1.096938775510204e-05, "loss": 0.9954, "mean_token_accuracy": 0.7450571835041047, "num_tokens": 331406839.0, "step": 3520 }, { "entropy": 1.3507774248719215, "epoch": 0.7831826501747186, "grad_norm": 0.56640625, "learning_rate": 1.0858473824312334e-05, "loss": 0.939, "mean_token_accuracy": 0.757654282450676, "num_tokens": 332356653.0, "step": 3530 }, { "entropy": 1.3371329329907895, "epoch": 0.7854012979089245, "grad_norm": 0.58203125, "learning_rate": 1.0747559893522626e-05, "loss": 0.944, "mean_token_accuracy": 0.7541753455996514, "num_tokens": 333306767.0, "step": 3540 }, { "entropy": 1.3796106189489366, "epoch": 0.7876199456431305, "grad_norm": 0.5546875, "learning_rate": 1.063664596273292e-05, "loss": 0.976, "mean_token_accuracy": 0.7494149960577488, "num_tokens": 334267595.0, "step": 3550 }, { "entropy": 1.3886483326554298, "epoch": 0.7898385933773365, "grad_norm": 0.5703125, "learning_rate": 1.0525732031943212e-05, "loss": 0.9955, "mean_token_accuracy": 0.745264695584774, "num_tokens": 335211023.0, "step": 3560 }, { "entropy": 1.3904688894748687, "epoch": 0.7920572411115425, "grad_norm": 0.51171875, "learning_rate": 1.0414818101153505e-05, "loss": 0.9971, "mean_token_accuracy": 0.7431247621774674, "num_tokens": 336161592.0, "step": 3570 }, { "entropy": 1.3282628059387207, "epoch": 0.7942758888457485, "grad_norm": 0.54296875, "learning_rate": 1.0303904170363798e-05, "loss": 0.9194, "mean_token_accuracy": 0.759865264594555, "num_tokens": 337108472.0, "step": 3580 }, { "entropy": 1.3883577764034272, "epoch": 0.7964945365799545, "grad_norm": 0.5390625, "learning_rate": 1.019299023957409e-05, "loss": 0.9574, "mean_token_accuracy": 0.7508158691227436, "num_tokens": 338046556.0, "step": 3590 }, { "entropy": 1.354970221221447, "epoch": 0.7987131843141605, "grad_norm": 0.515625, "learning_rate": 1.0082076308784384e-05, "loss": 0.9428, "mean_token_accuracy": 0.7563470520079136, "num_tokens": 338995598.0, "step": 3600 }, { "entropy": 1.3790066853165626, "epoch": 0.8009318320483665, "grad_norm": 0.5390625, "learning_rate": 9.971162377994676e-06, "loss": 1.0013, "mean_token_accuracy": 0.7433059230446816, "num_tokens": 339946604.0, "step": 3610 }, { "entropy": 1.3680865824222566, "epoch": 0.8031504797825725, "grad_norm": 0.52734375, "learning_rate": 9.86024844720497e-06, "loss": 0.9482, "mean_token_accuracy": 0.7530041396617889, "num_tokens": 340865269.0, "step": 3620 }, { "entropy": 1.3551585905253887, "epoch": 0.8053691275167785, "grad_norm": 0.515625, "learning_rate": 9.749334516415262e-06, "loss": 0.9756, "mean_token_accuracy": 0.749114916473627, "num_tokens": 341821654.0, "step": 3630 }, { "entropy": 1.356984592974186, "epoch": 0.8075877752509846, "grad_norm": 0.515625, "learning_rate": 9.638420585625555e-06, "loss": 0.9269, "mean_token_accuracy": 0.756236170232296, "num_tokens": 342764886.0, "step": 3640 }, { "entropy": 1.4058508843183517, "epoch": 0.8098064229851906, "grad_norm": 0.5703125, "learning_rate": 9.527506654835848e-06, "loss": 0.9776, "mean_token_accuracy": 0.7486060597002506, "num_tokens": 343699361.0, "step": 3650 }, { "entropy": 1.4065939649939536, "epoch": 0.8120250707193966, "grad_norm": 0.5625, "learning_rate": 9.41659272404614e-06, "loss": 1.0093, "mean_token_accuracy": 0.7410213641822339, "num_tokens": 344637604.0, "step": 3660 }, { "entropy": 1.3512266606092453, "epoch": 0.8142437184536025, "grad_norm": 0.56640625, "learning_rate": 9.305678793256434e-06, "loss": 0.9506, "mean_token_accuracy": 0.7549665696918965, "num_tokens": 345590677.0, "step": 3670 }, { "entropy": 1.3379161387681962, "epoch": 0.8164623661878085, "grad_norm": 0.5234375, "learning_rate": 9.194764862466726e-06, "loss": 0.9331, "mean_token_accuracy": 0.7561460591852665, "num_tokens": 346534759.0, "step": 3680 }, { "entropy": 1.3927339702844619, "epoch": 0.8186810139220145, "grad_norm": 0.51171875, "learning_rate": 9.08385093167702e-06, "loss": 0.9591, "mean_token_accuracy": 0.7537301577627659, "num_tokens": 347455286.0, "step": 3690 }, { "entropy": 1.361009131371975, "epoch": 0.8208996616562205, "grad_norm": 0.546875, "learning_rate": 8.972937000887312e-06, "loss": 0.9464, "mean_token_accuracy": 0.7557949997484684, "num_tokens": 348401567.0, "step": 3700 }, { "entropy": 1.384497131407261, "epoch": 0.8231183093904265, "grad_norm": 0.578125, "learning_rate": 8.862023070097605e-06, "loss": 0.9803, "mean_token_accuracy": 0.7466384552419185, "num_tokens": 349334391.0, "step": 3710 }, { "entropy": 1.3447816006839275, "epoch": 0.8253369571246325, "grad_norm": 0.515625, "learning_rate": 8.751109139307898e-06, "loss": 0.9436, "mean_token_accuracy": 0.7561516091227531, "num_tokens": 350312604.0, "step": 3720 }, { "entropy": 1.3593414321541786, "epoch": 0.8275556048588385, "grad_norm": 0.5234375, "learning_rate": 8.64019520851819e-06, "loss": 0.9526, "mean_token_accuracy": 0.7559100404381752, "num_tokens": 351273912.0, "step": 3730 }, { "entropy": 1.3611069664359092, "epoch": 0.8297742525930445, "grad_norm": 0.55078125, "learning_rate": 8.529281277728483e-06, "loss": 0.9619, "mean_token_accuracy": 0.7522155269980431, "num_tokens": 352217449.0, "step": 3740 }, { "entropy": 1.3875371009111404, "epoch": 0.8319929003272506, "grad_norm": 0.5703125, "learning_rate": 8.418367346938775e-06, "loss": 0.9683, "mean_token_accuracy": 0.7485638290643692, "num_tokens": 353168090.0, "step": 3750 }, { "entropy": 1.3669875219464303, "epoch": 0.8342115480614566, "grad_norm": 0.55078125, "learning_rate": 8.307453416149069e-06, "loss": 0.9634, "mean_token_accuracy": 0.7502586752176285, "num_tokens": 354122430.0, "step": 3760 }, { "entropy": 1.3453943833708764, "epoch": 0.8364301957956626, "grad_norm": 0.55859375, "learning_rate": 8.19653948535936e-06, "loss": 0.9529, "mean_token_accuracy": 0.7517515823245049, "num_tokens": 355065338.0, "step": 3770 }, { "entropy": 1.3437988623976707, "epoch": 0.8386488435298686, "grad_norm": 0.5703125, "learning_rate": 8.085625554569655e-06, "loss": 0.9273, "mean_token_accuracy": 0.7580426350235939, "num_tokens": 355995716.0, "step": 3780 }, { "entropy": 1.3949485182762147, "epoch": 0.8408674912640746, "grad_norm": 0.51171875, "learning_rate": 7.974711623779947e-06, "loss": 0.9666, "mean_token_accuracy": 0.7470616512000561, "num_tokens": 356919067.0, "step": 3790 }, { "entropy": 1.3033222988247872, "epoch": 0.8430861389982806, "grad_norm": 0.48828125, "learning_rate": 7.863797692990239e-06, "loss": 0.9066, "mean_token_accuracy": 0.7628800176084042, "num_tokens": 357848380.0, "step": 3800 }, { "entropy": 1.389954724907875, "epoch": 0.8453047867324865, "grad_norm": 0.5546875, "learning_rate": 7.752883762200533e-06, "loss": 0.9835, "mean_token_accuracy": 0.7488750971853733, "num_tokens": 358798462.0, "step": 3810 }, { "entropy": 1.3484379634261132, "epoch": 0.8475234344666925, "grad_norm": 0.6015625, "learning_rate": 7.641969831410825e-06, "loss": 0.9511, "mean_token_accuracy": 0.7518211953341961, "num_tokens": 359760891.0, "step": 3820 }, { "entropy": 1.3600559674203396, "epoch": 0.8497420822008985, "grad_norm": 0.5, "learning_rate": 7.5310559006211186e-06, "loss": 0.945, "mean_token_accuracy": 0.7558806143701077, "num_tokens": 360727038.0, "step": 3830 }, { "entropy": 1.374285238981247, "epoch": 0.8519607299351045, "grad_norm": 0.55078125, "learning_rate": 7.420141969831411e-06, "loss": 0.9654, "mean_token_accuracy": 0.7507951468229294, "num_tokens": 361664062.0, "step": 3840 }, { "entropy": 1.3751945488154889, "epoch": 0.8541793776693105, "grad_norm": 0.51171875, "learning_rate": 7.3092280390417045e-06, "loss": 0.9759, "mean_token_accuracy": 0.7493015758693218, "num_tokens": 362581685.0, "step": 3850 }, { "entropy": 1.342698210477829, "epoch": 0.8563980254035165, "grad_norm": 0.5390625, "learning_rate": 7.198314108251997e-06, "loss": 0.9397, "mean_token_accuracy": 0.7556280843913555, "num_tokens": 363493172.0, "step": 3860 }, { "entropy": 1.3486001171171664, "epoch": 0.8586166731377226, "grad_norm": 0.5078125, "learning_rate": 7.0874001774622905e-06, "loss": 0.9397, "mean_token_accuracy": 0.7553956717252731, "num_tokens": 364446944.0, "step": 3870 }, { "entropy": 1.3552488908171654, "epoch": 0.8608353208719286, "grad_norm": 0.5234375, "learning_rate": 6.976486246672583e-06, "loss": 0.9279, "mean_token_accuracy": 0.7601940959692002, "num_tokens": 365374033.0, "step": 3880 }, { "entropy": 1.3852377466857433, "epoch": 0.8630539686061346, "grad_norm": 0.53515625, "learning_rate": 6.865572315882875e-06, "loss": 0.9508, "mean_token_accuracy": 0.7540732339024544, "num_tokens": 366289679.0, "step": 3890 }, { "entropy": 1.407871701568365, "epoch": 0.8652726163403406, "grad_norm": 0.5703125, "learning_rate": 6.7546583850931686e-06, "loss": 0.988, "mean_token_accuracy": 0.7453559413552284, "num_tokens": 367201731.0, "step": 3900 }, { "entropy": 1.3759823389351369, "epoch": 0.8674912640745466, "grad_norm": 0.54296875, "learning_rate": 6.643744454303461e-06, "loss": 0.9877, "mean_token_accuracy": 0.7446005560457707, "num_tokens": 368157287.0, "step": 3910 }, { "entropy": 1.3594166025519372, "epoch": 0.8697099118087526, "grad_norm": 0.54296875, "learning_rate": 6.532830523513754e-06, "loss": 0.9371, "mean_token_accuracy": 0.7575969822704792, "num_tokens": 369106919.0, "step": 3920 }, { "entropy": 1.393234833329916, "epoch": 0.8719285595429586, "grad_norm": 0.546875, "learning_rate": 6.421916592724047e-06, "loss": 0.9807, "mean_token_accuracy": 0.7484029091894626, "num_tokens": 370021686.0, "step": 3930 }, { "entropy": 1.3949926882982253, "epoch": 0.8741472072771646, "grad_norm": 0.625, "learning_rate": 6.31100266193434e-06, "loss": 0.9844, "mean_token_accuracy": 0.7442330025136471, "num_tokens": 370953193.0, "step": 3940 }, { "entropy": 1.3483674347400665, "epoch": 0.8763658550113705, "grad_norm": 0.53515625, "learning_rate": 6.200088731144632e-06, "loss": 0.9234, "mean_token_accuracy": 0.7595080114901066, "num_tokens": 371877002.0, "step": 3950 }, { "entropy": 1.3709127485752106, "epoch": 0.8785845027455765, "grad_norm": 0.51953125, "learning_rate": 6.089174800354925e-06, "loss": 0.9568, "mean_token_accuracy": 0.7525337472558021, "num_tokens": 372834751.0, "step": 3960 }, { "entropy": 1.3546331241726874, "epoch": 0.8808031504797825, "grad_norm": 0.5390625, "learning_rate": 5.978260869565218e-06, "loss": 0.9494, "mean_token_accuracy": 0.7507483690977097, "num_tokens": 373775771.0, "step": 3970 }, { "entropy": 1.332931426167488, "epoch": 0.8830217982139886, "grad_norm": 0.5078125, "learning_rate": 5.867346938775511e-06, "loss": 0.9509, "mean_token_accuracy": 0.7548811562359333, "num_tokens": 374731469.0, "step": 3980 }, { "entropy": 1.3545904070138932, "epoch": 0.8852404459481946, "grad_norm": 0.53515625, "learning_rate": 5.756433007985803e-06, "loss": 0.9417, "mean_token_accuracy": 0.7551537476480007, "num_tokens": 375675543.0, "step": 3990 }, { "entropy": 1.4011170595884324, "epoch": 0.8874590936824006, "grad_norm": 0.53125, "learning_rate": 5.645519077196096e-06, "loss": 0.9928, "mean_token_accuracy": 0.7440803252160549, "num_tokens": 376595094.0, "step": 4000 }, { "entropy": 1.3567784875631332, "epoch": 0.8896777414166066, "grad_norm": 0.53515625, "learning_rate": 5.534605146406389e-06, "loss": 0.9633, "mean_token_accuracy": 0.7499005250632763, "num_tokens": 377563516.0, "step": 4010 }, { "entropy": 1.3843678832054138, "epoch": 0.8918963891508126, "grad_norm": 0.56640625, "learning_rate": 5.423691215616682e-06, "loss": 0.9594, "mean_token_accuracy": 0.7517636835575103, "num_tokens": 378480786.0, "step": 4020 }, { "entropy": 1.3298022344708442, "epoch": 0.8941150368850186, "grad_norm": 0.5234375, "learning_rate": 5.312777284826975e-06, "loss": 0.9377, "mean_token_accuracy": 0.7552124336361885, "num_tokens": 379442068.0, "step": 4030 }, { "entropy": 1.3667471811175347, "epoch": 0.8963336846192246, "grad_norm": 0.55859375, "learning_rate": 5.201863354037268e-06, "loss": 0.9467, "mean_token_accuracy": 0.7546268843114377, "num_tokens": 380376120.0, "step": 4040 }, { "entropy": 1.382226860523224, "epoch": 0.8985523323534306, "grad_norm": 0.53125, "learning_rate": 5.090949423247561e-06, "loss": 0.9702, "mean_token_accuracy": 0.7500215657055378, "num_tokens": 381345861.0, "step": 4050 }, { "entropy": 1.3708786077797412, "epoch": 0.9007709800876366, "grad_norm": 0.52734375, "learning_rate": 4.980035492457853e-06, "loss": 0.9718, "mean_token_accuracy": 0.7496377937495708, "num_tokens": 382291775.0, "step": 4060 }, { "entropy": 1.3532396875321866, "epoch": 0.9029896278218426, "grad_norm": 0.54296875, "learning_rate": 4.869121561668146e-06, "loss": 0.9282, "mean_token_accuracy": 0.7588274158537388, "num_tokens": 383216309.0, "step": 4070 }, { "entropy": 1.3610619880259036, "epoch": 0.9052082755560485, "grad_norm": 0.51953125, "learning_rate": 4.758207630878438e-06, "loss": 0.948, "mean_token_accuracy": 0.751985190808773, "num_tokens": 384155565.0, "step": 4080 }, { "entropy": 1.371240922808647, "epoch": 0.9074269232902545, "grad_norm": 0.6015625, "learning_rate": 4.647293700088731e-06, "loss": 0.9647, "mean_token_accuracy": 0.7506447650492192, "num_tokens": 385092338.0, "step": 4090 }, { "entropy": 1.3659679263830184, "epoch": 0.9096455710244606, "grad_norm": 0.51953125, "learning_rate": 4.536379769299024e-06, "loss": 0.9308, "mean_token_accuracy": 0.7565632097423076, "num_tokens": 386018707.0, "step": 4100 }, { "entropy": 1.3694222941994667, "epoch": 0.9118642187586666, "grad_norm": 0.54296875, "learning_rate": 4.425465838509317e-06, "loss": 0.9536, "mean_token_accuracy": 0.7497854404151439, "num_tokens": 386966791.0, "step": 4110 }, { "entropy": 1.3574039578437804, "epoch": 0.9140828664928726, "grad_norm": 0.546875, "learning_rate": 4.31455190771961e-06, "loss": 0.9307, "mean_token_accuracy": 0.7579091049730777, "num_tokens": 387920492.0, "step": 4120 }, { "entropy": 1.3476274512708186, "epoch": 0.9163015142270786, "grad_norm": 0.51953125, "learning_rate": 4.203637976929903e-06, "loss": 0.9241, "mean_token_accuracy": 0.7589688062667846, "num_tokens": 388854075.0, "step": 4130 }, { "entropy": 1.3659275747835635, "epoch": 0.9185201619612846, "grad_norm": 0.55859375, "learning_rate": 4.092724046140196e-06, "loss": 0.9399, "mean_token_accuracy": 0.7546637378633022, "num_tokens": 389816530.0, "step": 4140 }, { "entropy": 1.3457153633236885, "epoch": 0.9207388096954906, "grad_norm": 0.53515625, "learning_rate": 3.981810115350488e-06, "loss": 0.9522, "mean_token_accuracy": 0.7542778737843037, "num_tokens": 390762015.0, "step": 4150 }, { "entropy": 1.3396061316132546, "epoch": 0.9229574574296966, "grad_norm": 0.51953125, "learning_rate": 3.870896184560781e-06, "loss": 0.918, "mean_token_accuracy": 0.7604689553380013, "num_tokens": 391706436.0, "step": 4160 }, { "entropy": 1.3485943019390105, "epoch": 0.9251761051639026, "grad_norm": 0.55078125, "learning_rate": 3.759982253771074e-06, "loss": 0.9313, "mean_token_accuracy": 0.7574250407516956, "num_tokens": 392643198.0, "step": 4170 }, { "entropy": 1.3615098975598812, "epoch": 0.9273947528981086, "grad_norm": 0.5390625, "learning_rate": 3.6490683229813664e-06, "loss": 0.9508, "mean_token_accuracy": 0.7551313415169716, "num_tokens": 393583331.0, "step": 4180 }, { "entropy": 1.3367910474538802, "epoch": 0.9296134006323146, "grad_norm": 0.52734375, "learning_rate": 3.5381543921916594e-06, "loss": 0.9386, "mean_token_accuracy": 0.7580363132059574, "num_tokens": 394527996.0, "step": 4190 }, { "entropy": 1.3829244390130042, "epoch": 0.9318320483665206, "grad_norm": 0.5546875, "learning_rate": 3.4272404614019524e-06, "loss": 0.9577, "mean_token_accuracy": 0.7513498887419701, "num_tokens": 395466130.0, "step": 4200 }, { "entropy": 1.3731888599693776, "epoch": 0.9340506961007266, "grad_norm": 0.51953125, "learning_rate": 3.3163265306122454e-06, "loss": 0.9611, "mean_token_accuracy": 0.7499692045152188, "num_tokens": 396395021.0, "step": 4210 }, { "entropy": 1.362666630744934, "epoch": 0.9362693438349327, "grad_norm": 0.5, "learning_rate": 3.2054125998225384e-06, "loss": 0.9688, "mean_token_accuracy": 0.7498237736523151, "num_tokens": 397343890.0, "step": 4220 }, { "entropy": 1.3288205087184906, "epoch": 0.9384879915691386, "grad_norm": 0.5078125, "learning_rate": 3.094498669032831e-06, "loss": 0.952, "mean_token_accuracy": 0.7533118993043899, "num_tokens": 398301341.0, "step": 4230 }, { "entropy": 1.3533720336854458, "epoch": 0.9407066393033446, "grad_norm": 0.53125, "learning_rate": 2.9835847382431235e-06, "loss": 0.9607, "mean_token_accuracy": 0.7517400912940502, "num_tokens": 399254773.0, "step": 4240 }, { "entropy": 1.3874829396605493, "epoch": 0.9429252870375506, "grad_norm": 0.6171875, "learning_rate": 2.872670807453416e-06, "loss": 0.9556, "mean_token_accuracy": 0.7532159611582756, "num_tokens": 400185915.0, "step": 4250 }, { "entropy": 1.3642595566809177, "epoch": 0.9451439347717566, "grad_norm": 0.52734375, "learning_rate": 2.761756876663709e-06, "loss": 0.9599, "mean_token_accuracy": 0.7520182691514492, "num_tokens": 401121244.0, "step": 4260 }, { "entropy": 1.3642713360488414, "epoch": 0.9473625825059626, "grad_norm": 0.5703125, "learning_rate": 2.650842945874002e-06, "loss": 0.9425, "mean_token_accuracy": 0.7533236473798752, "num_tokens": 402076727.0, "step": 4270 }, { "entropy": 1.3315014272928238, "epoch": 0.9495812302401686, "grad_norm": 0.53515625, "learning_rate": 2.539929015084295e-06, "loss": 0.9102, "mean_token_accuracy": 0.7610321864485741, "num_tokens": 403021321.0, "step": 4280 }, { "entropy": 1.3721179209649563, "epoch": 0.9517998779743746, "grad_norm": 0.5625, "learning_rate": 2.4290150842945875e-06, "loss": 0.9614, "mean_token_accuracy": 0.7502239882946015, "num_tokens": 403977566.0, "step": 4290 }, { "entropy": 1.3569226145744324, "epoch": 0.9540185257085806, "grad_norm": 0.55859375, "learning_rate": 2.3181011535048805e-06, "loss": 0.9332, "mean_token_accuracy": 0.7586277812719345, "num_tokens": 404906178.0, "step": 4300 }, { "entropy": 1.3908393040299416, "epoch": 0.9562371734427866, "grad_norm": 0.51953125, "learning_rate": 2.207187222715173e-06, "loss": 0.9475, "mean_token_accuracy": 0.7541873648762702, "num_tokens": 405837119.0, "step": 4310 }, { "entropy": 1.3411194518208505, "epoch": 0.9584558211769926, "grad_norm": 0.50390625, "learning_rate": 2.096273291925466e-06, "loss": 0.9392, "mean_token_accuracy": 0.753732743114233, "num_tokens": 406764129.0, "step": 4320 }, { "entropy": 1.3665377825498581, "epoch": 0.9606744689111987, "grad_norm": 0.51171875, "learning_rate": 1.9853593611357586e-06, "loss": 0.9762, "mean_token_accuracy": 0.7461372949182987, "num_tokens": 407691279.0, "step": 4330 }, { "entropy": 1.3637786209583282, "epoch": 0.9628931166454047, "grad_norm": 0.53515625, "learning_rate": 1.8744454303460516e-06, "loss": 0.9611, "mean_token_accuracy": 0.7504919424653054, "num_tokens": 408649779.0, "step": 4340 }, { "entropy": 1.344110856950283, "epoch": 0.9651117643796107, "grad_norm": 0.5390625, "learning_rate": 1.7635314995563443e-06, "loss": 0.9197, "mean_token_accuracy": 0.7596047796308995, "num_tokens": 409584005.0, "step": 4350 }, { "entropy": 1.4125637419521808, "epoch": 0.9673304121138167, "grad_norm": 0.52734375, "learning_rate": 1.6526175687666373e-06, "loss": 1.0056, "mean_token_accuracy": 0.742132543027401, "num_tokens": 410519889.0, "step": 4360 }, { "entropy": 1.3275214530527593, "epoch": 0.9695490598480226, "grad_norm": 0.55078125, "learning_rate": 1.54170363797693e-06, "loss": 0.9404, "mean_token_accuracy": 0.7535249203443527, "num_tokens": 411477556.0, "step": 4370 }, { "entropy": 1.3909116253256797, "epoch": 0.9717677075822286, "grad_norm": 0.54296875, "learning_rate": 1.4307897071872228e-06, "loss": 0.9646, "mean_token_accuracy": 0.7525069527328014, "num_tokens": 412423884.0, "step": 4380 }, { "entropy": 1.3520725175738335, "epoch": 0.9739863553164346, "grad_norm": 0.53515625, "learning_rate": 1.3198757763975156e-06, "loss": 0.9441, "mean_token_accuracy": 0.7545062087476253, "num_tokens": 413354815.0, "step": 4390 }, { "entropy": 1.3621721930801869, "epoch": 0.9762050030506406, "grad_norm": 0.54296875, "learning_rate": 1.2089618456078084e-06, "loss": 0.9569, "mean_token_accuracy": 0.753555228561163, "num_tokens": 414289518.0, "step": 4400 }, { "entropy": 1.3933924958109856, "epoch": 0.9784236507848466, "grad_norm": 0.5078125, "learning_rate": 1.0980479148181013e-06, "loss": 0.9916, "mean_token_accuracy": 0.744612629711628, "num_tokens": 415241454.0, "step": 4410 }, { "entropy": 1.3613307520747184, "epoch": 0.9806422985190526, "grad_norm": 0.486328125, "learning_rate": 9.871339840283939e-07, "loss": 0.9521, "mean_token_accuracy": 0.7509805023670196, "num_tokens": 416207581.0, "step": 4420 }, { "entropy": 1.3690778270363808, "epoch": 0.9828609462532586, "grad_norm": 0.5703125, "learning_rate": 8.762200532386869e-07, "loss": 0.9696, "mean_token_accuracy": 0.7491403892636299, "num_tokens": 417155162.0, "step": 4430 }, { "entropy": 1.350597658008337, "epoch": 0.9850795939874646, "grad_norm": 0.5390625, "learning_rate": 7.653061224489796e-07, "loss": 0.9432, "mean_token_accuracy": 0.7551806442439556, "num_tokens": 418126381.0, "step": 4440 }, { "entropy": 1.3831326559185981, "epoch": 0.9872982417216707, "grad_norm": 0.57421875, "learning_rate": 6.543921916592724e-07, "loss": 0.9717, "mean_token_accuracy": 0.7482082195580005, "num_tokens": 419064900.0, "step": 4450 }, { "entropy": 1.3672489911317824, "epoch": 0.9895168894558767, "grad_norm": 0.53125, "learning_rate": 5.434782608695653e-07, "loss": 0.9243, "mean_token_accuracy": 0.7583662681281567, "num_tokens": 420001310.0, "step": 4460 }, { "entropy": 1.3730630218982696, "epoch": 0.9917355371900827, "grad_norm": 0.54296875, "learning_rate": 4.3256433007985804e-07, "loss": 0.9561, "mean_token_accuracy": 0.7527363084256649, "num_tokens": 420932440.0, "step": 4470 }, { "entropy": 1.4036599799990654, "epoch": 0.9939541849242887, "grad_norm": 0.5390625, "learning_rate": 3.2165039929015086e-07, "loss": 0.9956, "mean_token_accuracy": 0.7449633993208409, "num_tokens": 421870068.0, "step": 4480 }, { "entropy": 1.3779713824391364, "epoch": 0.9961728326584947, "grad_norm": 0.5, "learning_rate": 2.1073646850044365e-07, "loss": 0.9726, "mean_token_accuracy": 0.7501424111425876, "num_tokens": 422814597.0, "step": 4490 }, { "entropy": 1.4002000510692596, "epoch": 0.9983914803927006, "grad_norm": 0.5546875, "learning_rate": 9.982253771073646e-08, "loss": 0.9774, "mean_token_accuracy": 0.7493771456182003, "num_tokens": 423759552.0, "step": 4500 } ], "logging_steps": 10, "max_steps": 4508, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.664801045092499e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }