| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 500, |
| "global_step": 4508, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "entropy": 1.4729585528373719, |
| "epoch": 0.0022186477342060014, |
| "grad_norm": 0.66796875, |
| "learning_rate": 4.990017746228927e-05, |
| "loss": 1.1026, |
| "mean_token_accuracy": 0.723765990883112, |
| "num_tokens": 918149.0, |
| "step": 10 |
| }, |
| { |
| "entropy": 1.4707149267196655, |
| "epoch": 0.004437295468412003, |
| "grad_norm": 0.7890625, |
| "learning_rate": 4.978926353149956e-05, |
| "loss": 1.1101, |
| "mean_token_accuracy": 0.7222173184156417, |
| "num_tokens": 1851932.0, |
| "step": 20 |
| }, |
| { |
| "entropy": 1.4091981947422028, |
| "epoch": 0.006655943202618004, |
| "grad_norm": 0.58984375, |
| "learning_rate": 4.967834960070985e-05, |
| "loss": 1.0628, |
| "mean_token_accuracy": 0.7333360627293587, |
| "num_tokens": 2794352.0, |
| "step": 30 |
| }, |
| { |
| "entropy": 1.3992425069212913, |
| "epoch": 0.008874590936824005, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.9567435669920145e-05, |
| "loss": 1.077, |
| "mean_token_accuracy": 0.7292535044252872, |
| "num_tokens": 3757078.0, |
| "step": 40 |
| }, |
| { |
| "entropy": 1.4060697376728057, |
| "epoch": 0.011093238671030008, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.945652173913044e-05, |
| "loss": 1.06, |
| "mean_token_accuracy": 0.7313959106802941, |
| "num_tokens": 4731047.0, |
| "step": 50 |
| }, |
| { |
| "entropy": 1.385067519545555, |
| "epoch": 0.013311886405236008, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.934560780834073e-05, |
| "loss": 1.0177, |
| "mean_token_accuracy": 0.7411344431340694, |
| "num_tokens": 5679856.0, |
| "step": 60 |
| }, |
| { |
| "entropy": 1.4070588394999504, |
| "epoch": 0.01553053413944201, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.923469387755102e-05, |
| "loss": 1.0279, |
| "mean_token_accuracy": 0.7387959420681, |
| "num_tokens": 6628887.0, |
| "step": 70 |
| }, |
| { |
| "entropy": 1.3842194020748138, |
| "epoch": 0.01774918187364801, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.9123779946761314e-05, |
| "loss": 1.0559, |
| "mean_token_accuracy": 0.7331727184355259, |
| "num_tokens": 7596388.0, |
| "step": 80 |
| }, |
| { |
| "entropy": 1.466818632185459, |
| "epoch": 0.019967829607854013, |
| "grad_norm": 0.625, |
| "learning_rate": 4.9012866015971606e-05, |
| "loss": 1.11, |
| "mean_token_accuracy": 0.7209376402199268, |
| "num_tokens": 8538237.0, |
| "step": 90 |
| }, |
| { |
| "entropy": 1.433634176105261, |
| "epoch": 0.022186477342060015, |
| "grad_norm": 0.62890625, |
| "learning_rate": 4.8901952085181905e-05, |
| "loss": 1.077, |
| "mean_token_accuracy": 0.7292104378342629, |
| "num_tokens": 9485166.0, |
| "step": 100 |
| }, |
| { |
| "entropy": 1.4099419370293618, |
| "epoch": 0.024405125076266018, |
| "grad_norm": 0.5546875, |
| "learning_rate": 4.87910381543922e-05, |
| "loss": 1.0308, |
| "mean_token_accuracy": 0.7382783465087414, |
| "num_tokens": 10417165.0, |
| "step": 110 |
| }, |
| { |
| "entropy": 1.405370193719864, |
| "epoch": 0.026623772810472016, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.868012422360249e-05, |
| "loss": 1.0073, |
| "mean_token_accuracy": 0.7402876511216163, |
| "num_tokens": 11335861.0, |
| "step": 120 |
| }, |
| { |
| "entropy": 1.4469662189483643, |
| "epoch": 0.02884242054467802, |
| "grad_norm": 0.6328125, |
| "learning_rate": 4.856921029281278e-05, |
| "loss": 1.0661, |
| "mean_token_accuracy": 0.7298030622303486, |
| "num_tokens": 12263889.0, |
| "step": 130 |
| }, |
| { |
| "entropy": 1.3592407315969468, |
| "epoch": 0.03106106827888402, |
| "grad_norm": 0.609375, |
| "learning_rate": 4.845829636202307e-05, |
| "loss": 0.9871, |
| "mean_token_accuracy": 0.7455302596092224, |
| "num_tokens": 13210311.0, |
| "step": 140 |
| }, |
| { |
| "entropy": 1.3838115274906158, |
| "epoch": 0.03327971601309002, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.8347382431233365e-05, |
| "loss": 1.0185, |
| "mean_token_accuracy": 0.7393872648477554, |
| "num_tokens": 14157072.0, |
| "step": 150 |
| }, |
| { |
| "entropy": 1.3638476587831974, |
| "epoch": 0.03549836374729602, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.823646850044366e-05, |
| "loss": 1.0026, |
| "mean_token_accuracy": 0.7428654655814171, |
| "num_tokens": 15103967.0, |
| "step": 160 |
| }, |
| { |
| "entropy": 1.385922372341156, |
| "epoch": 0.03771701148150203, |
| "grad_norm": 0.55078125, |
| "learning_rate": 4.812555456965395e-05, |
| "loss": 1.0082, |
| "mean_token_accuracy": 0.7438161842525005, |
| "num_tokens": 16057562.0, |
| "step": 170 |
| }, |
| { |
| "entropy": 1.4505465492606162, |
| "epoch": 0.039935659215708026, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.801464063886424e-05, |
| "loss": 1.0561, |
| "mean_token_accuracy": 0.7318664930760861, |
| "num_tokens": 16978828.0, |
| "step": 180 |
| }, |
| { |
| "entropy": 1.4350886657834052, |
| "epoch": 0.042154306949914025, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.7903726708074534e-05, |
| "loss": 1.0676, |
| "mean_token_accuracy": 0.7291314266622066, |
| "num_tokens": 17901464.0, |
| "step": 190 |
| }, |
| { |
| "entropy": 1.4210979074239731, |
| "epoch": 0.04437295468412003, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.7792812777284826e-05, |
| "loss": 1.0306, |
| "mean_token_accuracy": 0.7380646444857121, |
| "num_tokens": 18864277.0, |
| "step": 200 |
| }, |
| { |
| "entropy": 1.4056882798671722, |
| "epoch": 0.04659160241832603, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.768189884649512e-05, |
| "loss": 1.0177, |
| "mean_token_accuracy": 0.740249615162611, |
| "num_tokens": 19808213.0, |
| "step": 210 |
| }, |
| { |
| "entropy": 1.3831629231572151, |
| "epoch": 0.048810250152532035, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.757098491570541e-05, |
| "loss": 1.0107, |
| "mean_token_accuracy": 0.7425381779670716, |
| "num_tokens": 20748143.0, |
| "step": 220 |
| }, |
| { |
| "entropy": 1.3360425300896168, |
| "epoch": 0.051028897886738034, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.74600709849157e-05, |
| "loss": 0.9563, |
| "mean_token_accuracy": 0.7526988208293914, |
| "num_tokens": 21698186.0, |
| "step": 230 |
| }, |
| { |
| "entropy": 1.4442797765135764, |
| "epoch": 0.05324754562094403, |
| "grad_norm": 0.60546875, |
| "learning_rate": 4.7349157054126e-05, |
| "loss": 1.0408, |
| "mean_token_accuracy": 0.7342406339943409, |
| "num_tokens": 22653187.0, |
| "step": 240 |
| }, |
| { |
| "entropy": 1.4190511792898177, |
| "epoch": 0.05546619335515004, |
| "grad_norm": 0.6015625, |
| "learning_rate": 4.7238243123336293e-05, |
| "loss": 1.0243, |
| "mean_token_accuracy": 0.7393615126609803, |
| "num_tokens": 23601229.0, |
| "step": 250 |
| }, |
| { |
| "entropy": 1.4013425052165984, |
| "epoch": 0.05768484108935604, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.7127329192546586e-05, |
| "loss": 1.0445, |
| "mean_token_accuracy": 0.737453556060791, |
| "num_tokens": 24545674.0, |
| "step": 260 |
| }, |
| { |
| "entropy": 1.3956441208720207, |
| "epoch": 0.059903488823562036, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.701641526175688e-05, |
| "loss": 1.0355, |
| "mean_token_accuracy": 0.7368819013237953, |
| "num_tokens": 25480593.0, |
| "step": 270 |
| }, |
| { |
| "entropy": 1.3561255246400834, |
| "epoch": 0.06212213655776804, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.690550133096717e-05, |
| "loss": 1.0008, |
| "mean_token_accuracy": 0.7417342521250248, |
| "num_tokens": 26437892.0, |
| "step": 280 |
| }, |
| { |
| "entropy": 1.3865095235407352, |
| "epoch": 0.06434078429197404, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.679458740017746e-05, |
| "loss": 1.0156, |
| "mean_token_accuracy": 0.7418425239622592, |
| "num_tokens": 27388999.0, |
| "step": 290 |
| }, |
| { |
| "entropy": 1.404170949012041, |
| "epoch": 0.06655943202618005, |
| "grad_norm": 0.53515625, |
| "learning_rate": 4.6683673469387754e-05, |
| "loss": 1.0029, |
| "mean_token_accuracy": 0.7463115990161896, |
| "num_tokens": 28344677.0, |
| "step": 300 |
| }, |
| { |
| "entropy": 1.3910762615501882, |
| "epoch": 0.06877807976038605, |
| "grad_norm": 0.55078125, |
| "learning_rate": 4.6572759538598046e-05, |
| "loss": 1.0098, |
| "mean_token_accuracy": 0.7405552670359612, |
| "num_tokens": 29289045.0, |
| "step": 310 |
| }, |
| { |
| "entropy": 1.441838303208351, |
| "epoch": 0.07099672749459204, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.646184560780834e-05, |
| "loss": 1.0902, |
| "mean_token_accuracy": 0.7256961852312088, |
| "num_tokens": 30215206.0, |
| "step": 320 |
| }, |
| { |
| "entropy": 1.3631876975297927, |
| "epoch": 0.07321537522879805, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.635093167701863e-05, |
| "loss": 1.0127, |
| "mean_token_accuracy": 0.7429364562034607, |
| "num_tokens": 31165550.0, |
| "step": 330 |
| }, |
| { |
| "entropy": 1.4029483541846275, |
| "epoch": 0.07543402296300405, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.624001774622893e-05, |
| "loss": 1.0015, |
| "mean_token_accuracy": 0.7426272496581078, |
| "num_tokens": 32097154.0, |
| "step": 340 |
| }, |
| { |
| "entropy": 1.3886511482298374, |
| "epoch": 0.07765267069721005, |
| "grad_norm": 0.5078125, |
| "learning_rate": 4.612910381543922e-05, |
| "loss": 1.0187, |
| "mean_token_accuracy": 0.7411878131330013, |
| "num_tokens": 33034411.0, |
| "step": 350 |
| }, |
| { |
| "entropy": 1.3666007652878762, |
| "epoch": 0.07987131843141605, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.6018189884649514e-05, |
| "loss": 0.9746, |
| "mean_token_accuracy": 0.7496642753481865, |
| "num_tokens": 33974618.0, |
| "step": 360 |
| }, |
| { |
| "entropy": 1.3778321206569673, |
| "epoch": 0.08208996616562206, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.5907275953859806e-05, |
| "loss": 0.9799, |
| "mean_token_accuracy": 0.7477375149726868, |
| "num_tokens": 34914062.0, |
| "step": 370 |
| }, |
| { |
| "entropy": 1.3750384822487831, |
| "epoch": 0.08430861389982805, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.57963620230701e-05, |
| "loss": 0.9757, |
| "mean_token_accuracy": 0.7492865726351738, |
| "num_tokens": 35845845.0, |
| "step": 380 |
| }, |
| { |
| "entropy": 1.40703696757555, |
| "epoch": 0.08652726163403406, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.568544809228039e-05, |
| "loss": 1.0141, |
| "mean_token_accuracy": 0.7390294030308724, |
| "num_tokens": 36767543.0, |
| "step": 390 |
| }, |
| { |
| "entropy": 1.3947004944086074, |
| "epoch": 0.08874590936824006, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.557453416149068e-05, |
| "loss": 0.9984, |
| "mean_token_accuracy": 0.7446502350270748, |
| "num_tokens": 37713319.0, |
| "step": 400 |
| }, |
| { |
| "entropy": 1.4182243198156357, |
| "epoch": 0.09096455710244605, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.5463620230700974e-05, |
| "loss": 1.0251, |
| "mean_token_accuracy": 0.7391804203391075, |
| "num_tokens": 38672746.0, |
| "step": 410 |
| }, |
| { |
| "entropy": 1.408482176810503, |
| "epoch": 0.09318320483665206, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.5352706299911266e-05, |
| "loss": 1.0114, |
| "mean_token_accuracy": 0.7393792733550072, |
| "num_tokens": 39634632.0, |
| "step": 420 |
| }, |
| { |
| "entropy": 1.4136851638555528, |
| "epoch": 0.09540185257085806, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.5241792369121565e-05, |
| "loss": 0.9879, |
| "mean_token_accuracy": 0.7459694370627403, |
| "num_tokens": 40576342.0, |
| "step": 430 |
| }, |
| { |
| "entropy": 1.383458285033703, |
| "epoch": 0.09762050030506407, |
| "grad_norm": 0.515625, |
| "learning_rate": 4.513087843833186e-05, |
| "loss": 0.979, |
| "mean_token_accuracy": 0.7476258493959904, |
| "num_tokens": 41505927.0, |
| "step": 440 |
| }, |
| { |
| "entropy": 1.4427544571459294, |
| "epoch": 0.09983914803927006, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.501996450754215e-05, |
| "loss": 1.0537, |
| "mean_token_accuracy": 0.7316265814006329, |
| "num_tokens": 42455803.0, |
| "step": 450 |
| }, |
| { |
| "entropy": 1.3921602264046669, |
| "epoch": 0.10205779577347607, |
| "grad_norm": 0.58984375, |
| "learning_rate": 4.490905057675244e-05, |
| "loss": 1.0066, |
| "mean_token_accuracy": 0.7426870331168175, |
| "num_tokens": 43404878.0, |
| "step": 460 |
| }, |
| { |
| "entropy": 1.3988172575831412, |
| "epoch": 0.10427644350768207, |
| "grad_norm": 0.5078125, |
| "learning_rate": 4.4798136645962734e-05, |
| "loss": 1.0108, |
| "mean_token_accuracy": 0.742293368279934, |
| "num_tokens": 44391917.0, |
| "step": 470 |
| }, |
| { |
| "entropy": 1.4275135532021523, |
| "epoch": 0.10649509124188807, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.4687222715173026e-05, |
| "loss": 1.0262, |
| "mean_token_accuracy": 0.7378039725124836, |
| "num_tokens": 45329206.0, |
| "step": 480 |
| }, |
| { |
| "entropy": 1.3842679247260095, |
| "epoch": 0.10871373897609407, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.457630878438332e-05, |
| "loss": 1.0035, |
| "mean_token_accuracy": 0.7409528233110905, |
| "num_tokens": 46299789.0, |
| "step": 490 |
| }, |
| { |
| "entropy": 1.390407882630825, |
| "epoch": 0.11093238671030008, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.446539485359361e-05, |
| "loss": 0.9843, |
| "mean_token_accuracy": 0.746420969069004, |
| "num_tokens": 47246331.0, |
| "step": 500 |
| }, |
| { |
| "entropy": 1.3856108456850051, |
| "epoch": 0.11315103444450607, |
| "grad_norm": 0.5546875, |
| "learning_rate": 4.43544809228039e-05, |
| "loss": 0.978, |
| "mean_token_accuracy": 0.7486258946359158, |
| "num_tokens": 48200167.0, |
| "step": 510 |
| }, |
| { |
| "entropy": 1.3945159137248992, |
| "epoch": 0.11536968217871207, |
| "grad_norm": 0.5234375, |
| "learning_rate": 4.42435669920142e-05, |
| "loss": 1.0085, |
| "mean_token_accuracy": 0.7415202759206295, |
| "num_tokens": 49150454.0, |
| "step": 520 |
| }, |
| { |
| "entropy": 1.3512628681957721, |
| "epoch": 0.11758832991291808, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.4132653061224493e-05, |
| "loss": 0.9385, |
| "mean_token_accuracy": 0.7570643424987793, |
| "num_tokens": 50085034.0, |
| "step": 530 |
| }, |
| { |
| "entropy": 1.378444318473339, |
| "epoch": 0.11980697764712407, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.4021739130434786e-05, |
| "loss": 0.9825, |
| "mean_token_accuracy": 0.7446637496352195, |
| "num_tokens": 51014521.0, |
| "step": 540 |
| }, |
| { |
| "entropy": 1.3720286831259727, |
| "epoch": 0.12202562538133008, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.391082519964508e-05, |
| "loss": 0.9718, |
| "mean_token_accuracy": 0.7489398539066314, |
| "num_tokens": 51929505.0, |
| "step": 550 |
| }, |
| { |
| "entropy": 1.3862373858690262, |
| "epoch": 0.12424427311553608, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.379991126885537e-05, |
| "loss": 0.9629, |
| "mean_token_accuracy": 0.7500099420547486, |
| "num_tokens": 52878638.0, |
| "step": 560 |
| }, |
| { |
| "entropy": 1.3761510282754899, |
| "epoch": 0.1264629208497421, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.368899733806566e-05, |
| "loss": 0.9695, |
| "mean_token_accuracy": 0.7509791783988475, |
| "num_tokens": 53815492.0, |
| "step": 570 |
| }, |
| { |
| "entropy": 1.388393123447895, |
| "epoch": 0.12868156858394808, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.3578083407275954e-05, |
| "loss": 0.9979, |
| "mean_token_accuracy": 0.7407989487051964, |
| "num_tokens": 54745153.0, |
| "step": 580 |
| }, |
| { |
| "entropy": 1.3540472716093064, |
| "epoch": 0.13090021631815407, |
| "grad_norm": 0.55078125, |
| "learning_rate": 4.3467169476486246e-05, |
| "loss": 0.9778, |
| "mean_token_accuracy": 0.7482736088335514, |
| "num_tokens": 55704045.0, |
| "step": 590 |
| }, |
| { |
| "entropy": 1.3751274153590203, |
| "epoch": 0.1331188640523601, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.335625554569654e-05, |
| "loss": 0.9656, |
| "mean_token_accuracy": 0.7485008135437965, |
| "num_tokens": 56631888.0, |
| "step": 600 |
| }, |
| { |
| "entropy": 1.424610199034214, |
| "epoch": 0.13533751178656608, |
| "grad_norm": 0.5234375, |
| "learning_rate": 4.324534161490684e-05, |
| "loss": 1.0094, |
| "mean_token_accuracy": 0.7427875995635986, |
| "num_tokens": 57580851.0, |
| "step": 610 |
| }, |
| { |
| "entropy": 1.3987043127417564, |
| "epoch": 0.1375561595207721, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.313442768411713e-05, |
| "loss": 1.0099, |
| "mean_token_accuracy": 0.7419761680066586, |
| "num_tokens": 58492885.0, |
| "step": 620 |
| }, |
| { |
| "entropy": 1.3795367434620858, |
| "epoch": 0.1397748072549781, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.302351375332742e-05, |
| "loss": 0.9619, |
| "mean_token_accuracy": 0.7496286295354366, |
| "num_tokens": 59446819.0, |
| "step": 630 |
| }, |
| { |
| "entropy": 1.4246120005846024, |
| "epoch": 0.1419934549891841, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.2912599822537714e-05, |
| "loss": 1.0243, |
| "mean_token_accuracy": 0.7391403771936893, |
| "num_tokens": 60379693.0, |
| "step": 640 |
| }, |
| { |
| "entropy": 1.3605768918991088, |
| "epoch": 0.1442121027233901, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.2801685891748006e-05, |
| "loss": 0.9522, |
| "mean_token_accuracy": 0.7532150462269783, |
| "num_tokens": 61333413.0, |
| "step": 650 |
| }, |
| { |
| "entropy": 1.4056472092866898, |
| "epoch": 0.1464307504575961, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.26907719609583e-05, |
| "loss": 1.0085, |
| "mean_token_accuracy": 0.7418359808623791, |
| "num_tokens": 62265474.0, |
| "step": 660 |
| }, |
| { |
| "entropy": 1.3709092542529107, |
| "epoch": 0.1486493981918021, |
| "grad_norm": 0.5234375, |
| "learning_rate": 4.257985803016859e-05, |
| "loss": 0.9743, |
| "mean_token_accuracy": 0.7496256902813911, |
| "num_tokens": 63207696.0, |
| "step": 670 |
| }, |
| { |
| "entropy": 1.4048712268471717, |
| "epoch": 0.1508680459260081, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.246894409937888e-05, |
| "loss": 0.9926, |
| "mean_token_accuracy": 0.7464736774563789, |
| "num_tokens": 64150100.0, |
| "step": 680 |
| }, |
| { |
| "entropy": 1.4152741387486458, |
| "epoch": 0.1530866936602141, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.2358030168589174e-05, |
| "loss": 0.9764, |
| "mean_token_accuracy": 0.7450054451823235, |
| "num_tokens": 65065205.0, |
| "step": 690 |
| }, |
| { |
| "entropy": 1.4143257439136505, |
| "epoch": 0.1553053413944201, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.224711623779947e-05, |
| "loss": 1.0204, |
| "mean_token_accuracy": 0.7379486717283725, |
| "num_tokens": 65984220.0, |
| "step": 700 |
| }, |
| { |
| "entropy": 1.383517174422741, |
| "epoch": 0.1575239891286261, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.2136202307009765e-05, |
| "loss": 1.0038, |
| "mean_token_accuracy": 0.7429847024381161, |
| "num_tokens": 66963944.0, |
| "step": 710 |
| }, |
| { |
| "entropy": 1.364837247878313, |
| "epoch": 0.1597426368628321, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.202528837622006e-05, |
| "loss": 0.9569, |
| "mean_token_accuracy": 0.7517856456339359, |
| "num_tokens": 67927027.0, |
| "step": 720 |
| }, |
| { |
| "entropy": 1.388382686674595, |
| "epoch": 0.1619612845970381, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.191437444543035e-05, |
| "loss": 0.9754, |
| "mean_token_accuracy": 0.7475278504192829, |
| "num_tokens": 68858413.0, |
| "step": 730 |
| }, |
| { |
| "entropy": 1.3992270916700362, |
| "epoch": 0.16417993233124412, |
| "grad_norm": 0.49609375, |
| "learning_rate": 4.180346051464064e-05, |
| "loss": 0.9843, |
| "mean_token_accuracy": 0.7459095239639282, |
| "num_tokens": 69776534.0, |
| "step": 740 |
| }, |
| { |
| "entropy": 1.3922007218003274, |
| "epoch": 0.1663985800654501, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.1692546583850934e-05, |
| "loss": 0.9939, |
| "mean_token_accuracy": 0.7453566305339336, |
| "num_tokens": 70723313.0, |
| "step": 750 |
| }, |
| { |
| "entropy": 1.3805669724941254, |
| "epoch": 0.1686172277996561, |
| "grad_norm": 0.58203125, |
| "learning_rate": 4.1581632653061226e-05, |
| "loss": 0.9913, |
| "mean_token_accuracy": 0.7465671949088574, |
| "num_tokens": 71704943.0, |
| "step": 760 |
| }, |
| { |
| "entropy": 1.3953271463513375, |
| "epoch": 0.17083587553386212, |
| "grad_norm": 0.6640625, |
| "learning_rate": 4.147071872227152e-05, |
| "loss": 1.0389, |
| "mean_token_accuracy": 0.7354367606341838, |
| "num_tokens": 72654290.0, |
| "step": 770 |
| }, |
| { |
| "entropy": 1.3998527079820633, |
| "epoch": 0.1730545232680681, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.135980479148181e-05, |
| "loss": 0.9947, |
| "mean_token_accuracy": 0.7447001703083516, |
| "num_tokens": 73591959.0, |
| "step": 780 |
| }, |
| { |
| "entropy": 1.3867414839565755, |
| "epoch": 0.1752731710022741, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.124889086069211e-05, |
| "loss": 1.0031, |
| "mean_token_accuracy": 0.7421109825372696, |
| "num_tokens": 74553895.0, |
| "step": 790 |
| }, |
| { |
| "entropy": 1.3889594689011573, |
| "epoch": 0.17749181873648012, |
| "grad_norm": 0.5234375, |
| "learning_rate": 4.11379769299024e-05, |
| "loss": 0.9798, |
| "mean_token_accuracy": 0.7458746030926704, |
| "num_tokens": 75473199.0, |
| "step": 800 |
| }, |
| { |
| "entropy": 1.3977437242865562, |
| "epoch": 0.17971046647068611, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.1027062999112693e-05, |
| "loss": 0.9733, |
| "mean_token_accuracy": 0.747966817766428, |
| "num_tokens": 76414141.0, |
| "step": 810 |
| }, |
| { |
| "entropy": 1.367151539027691, |
| "epoch": 0.1819291142048921, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.0916149068322986e-05, |
| "loss": 0.9841, |
| "mean_token_accuracy": 0.7465965315699578, |
| "num_tokens": 77366592.0, |
| "step": 820 |
| }, |
| { |
| "entropy": 1.3750471204519272, |
| "epoch": 0.18414776193909813, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.080523513753328e-05, |
| "loss": 0.9989, |
| "mean_token_accuracy": 0.741999814659357, |
| "num_tokens": 78302248.0, |
| "step": 830 |
| }, |
| { |
| "entropy": 1.3610561907291412, |
| "epoch": 0.18636640967330412, |
| "grad_norm": 0.5234375, |
| "learning_rate": 4.069432120674357e-05, |
| "loss": 0.9803, |
| "mean_token_accuracy": 0.7461248070001603, |
| "num_tokens": 79268687.0, |
| "step": 840 |
| }, |
| { |
| "entropy": 1.3994140163064004, |
| "epoch": 0.1885850574075101, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.058340727595386e-05, |
| "loss": 1.0047, |
| "mean_token_accuracy": 0.7401757217943669, |
| "num_tokens": 80216167.0, |
| "step": 850 |
| }, |
| { |
| "entropy": 1.39816662222147, |
| "epoch": 0.19080370514171613, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.0472493345164154e-05, |
| "loss": 1.0098, |
| "mean_token_accuracy": 0.7411137498915196, |
| "num_tokens": 81146855.0, |
| "step": 860 |
| }, |
| { |
| "entropy": 1.4110144585371018, |
| "epoch": 0.19302235287592212, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.0361579414374446e-05, |
| "loss": 0.9975, |
| "mean_token_accuracy": 0.7468475431203843, |
| "num_tokens": 82065352.0, |
| "step": 870 |
| }, |
| { |
| "entropy": 1.4093362182378768, |
| "epoch": 0.19524100061012814, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.025066548358474e-05, |
| "loss": 0.9961, |
| "mean_token_accuracy": 0.7452754236757755, |
| "num_tokens": 83009393.0, |
| "step": 880 |
| }, |
| { |
| "entropy": 1.3738794058561326, |
| "epoch": 0.19745964834433413, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.013975155279504e-05, |
| "loss": 0.9595, |
| "mean_token_accuracy": 0.7526905313134193, |
| "num_tokens": 83982619.0, |
| "step": 890 |
| }, |
| { |
| "entropy": 1.3857081905007362, |
| "epoch": 0.19967829607854012, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.002883762200533e-05, |
| "loss": 0.9776, |
| "mean_token_accuracy": 0.748926243185997, |
| "num_tokens": 84939163.0, |
| "step": 900 |
| }, |
| { |
| "entropy": 1.398831880092621, |
| "epoch": 0.20189694381274614, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.991792369121562e-05, |
| "loss": 0.9865, |
| "mean_token_accuracy": 0.7459573321044445, |
| "num_tokens": 85887826.0, |
| "step": 910 |
| }, |
| { |
| "entropy": 1.3910220503807067, |
| "epoch": 0.20411559154695214, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.9807009760425914e-05, |
| "loss": 0.9849, |
| "mean_token_accuracy": 0.745719988644123, |
| "num_tokens": 86808570.0, |
| "step": 920 |
| }, |
| { |
| "entropy": 1.3656192794442177, |
| "epoch": 0.20633423928115813, |
| "grad_norm": 0.51171875, |
| "learning_rate": 3.9696095829636206e-05, |
| "loss": 0.9658, |
| "mean_token_accuracy": 0.7481127180159092, |
| "num_tokens": 87748687.0, |
| "step": 930 |
| }, |
| { |
| "entropy": 1.3675310105085372, |
| "epoch": 0.20855288701536415, |
| "grad_norm": 0.50390625, |
| "learning_rate": 3.95851818988465e-05, |
| "loss": 0.9634, |
| "mean_token_accuracy": 0.7505045898258687, |
| "num_tokens": 88718503.0, |
| "step": 940 |
| }, |
| { |
| "entropy": 1.365248803794384, |
| "epoch": 0.21077153474957014, |
| "grad_norm": 0.515625, |
| "learning_rate": 3.947426796805679e-05, |
| "loss": 0.9377, |
| "mean_token_accuracy": 0.756609782576561, |
| "num_tokens": 89646214.0, |
| "step": 950 |
| }, |
| { |
| "entropy": 1.3557728335261345, |
| "epoch": 0.21299018248377613, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.936335403726708e-05, |
| "loss": 0.9495, |
| "mean_token_accuracy": 0.7515292674303055, |
| "num_tokens": 90584539.0, |
| "step": 960 |
| }, |
| { |
| "entropy": 1.3375528261065484, |
| "epoch": 0.21520883021798215, |
| "grad_norm": 0.58203125, |
| "learning_rate": 3.9252440106477374e-05, |
| "loss": 0.9359, |
| "mean_token_accuracy": 0.7541147537529469, |
| "num_tokens": 91524927.0, |
| "step": 970 |
| }, |
| { |
| "entropy": 1.3766776040196418, |
| "epoch": 0.21742747795218814, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.914152617568767e-05, |
| "loss": 0.9758, |
| "mean_token_accuracy": 0.7470216073095799, |
| "num_tokens": 92472966.0, |
| "step": 980 |
| }, |
| { |
| "entropy": 1.3779357895255089, |
| "epoch": 0.21964612568639413, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.9030612244897965e-05, |
| "loss": 0.9641, |
| "mean_token_accuracy": 0.7518527932465077, |
| "num_tokens": 93410659.0, |
| "step": 990 |
| }, |
| { |
| "entropy": 1.3866903841495515, |
| "epoch": 0.22186477342060015, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.891969831410826e-05, |
| "loss": 0.9693, |
| "mean_token_accuracy": 0.7480762518942357, |
| "num_tokens": 94376705.0, |
| "step": 1000 |
| }, |
| { |
| "entropy": 1.4138796277344228, |
| "epoch": 0.22408342115480614, |
| "grad_norm": 0.53125, |
| "learning_rate": 3.880878438331855e-05, |
| "loss": 0.9885, |
| "mean_token_accuracy": 0.746094710379839, |
| "num_tokens": 95306609.0, |
| "step": 1010 |
| }, |
| { |
| "entropy": 1.3473317727446557, |
| "epoch": 0.22630206888901214, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.869787045252884e-05, |
| "loss": 0.9388, |
| "mean_token_accuracy": 0.7558636233210564, |
| "num_tokens": 96277898.0, |
| "step": 1020 |
| }, |
| { |
| "entropy": 1.3636071279644966, |
| "epoch": 0.22852071662321816, |
| "grad_norm": 0.6015625, |
| "learning_rate": 3.8586956521739134e-05, |
| "loss": 0.9735, |
| "mean_token_accuracy": 0.745589692890644, |
| "num_tokens": 97233753.0, |
| "step": 1030 |
| }, |
| { |
| "entropy": 1.372378407418728, |
| "epoch": 0.23073936435742415, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.8476042590949426e-05, |
| "loss": 0.9672, |
| "mean_token_accuracy": 0.7510603852570057, |
| "num_tokens": 98177601.0, |
| "step": 1040 |
| }, |
| { |
| "entropy": 1.367596785724163, |
| "epoch": 0.23295801209163014, |
| "grad_norm": 0.5078125, |
| "learning_rate": 3.836512866015972e-05, |
| "loss": 0.9535, |
| "mean_token_accuracy": 0.7517831392586232, |
| "num_tokens": 99133455.0, |
| "step": 1050 |
| }, |
| { |
| "entropy": 1.3717108502984048, |
| "epoch": 0.23517665982583616, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.825421472937001e-05, |
| "loss": 0.9751, |
| "mean_token_accuracy": 0.7493723064661026, |
| "num_tokens": 100077287.0, |
| "step": 1060 |
| }, |
| { |
| "entropy": 1.378007946908474, |
| "epoch": 0.23739530756004215, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.814330079858031e-05, |
| "loss": 0.9352, |
| "mean_token_accuracy": 0.7550456888973713, |
| "num_tokens": 101011915.0, |
| "step": 1070 |
| }, |
| { |
| "entropy": 1.3725242644548417, |
| "epoch": 0.23961395529424814, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.80323868677906e-05, |
| "loss": 0.9535, |
| "mean_token_accuracy": 0.7519958928227425, |
| "num_tokens": 101961304.0, |
| "step": 1080 |
| }, |
| { |
| "entropy": 1.415687733888626, |
| "epoch": 0.24183260302845416, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.7921472937000893e-05, |
| "loss": 0.9963, |
| "mean_token_accuracy": 0.7424227021634578, |
| "num_tokens": 102891482.0, |
| "step": 1090 |
| }, |
| { |
| "entropy": 1.356763481348753, |
| "epoch": 0.24405125076266015, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.7810559006211186e-05, |
| "loss": 0.9353, |
| "mean_token_accuracy": 0.7564209721982479, |
| "num_tokens": 103831567.0, |
| "step": 1100 |
| }, |
| { |
| "entropy": 1.3712417140603066, |
| "epoch": 0.24626989849686615, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.769964507542148e-05, |
| "loss": 0.9628, |
| "mean_token_accuracy": 0.7527426145970821, |
| "num_tokens": 104771073.0, |
| "step": 1110 |
| }, |
| { |
| "entropy": 1.3849323302507401, |
| "epoch": 0.24848854623107217, |
| "grad_norm": 0.59375, |
| "learning_rate": 3.758873114463177e-05, |
| "loss": 1.0069, |
| "mean_token_accuracy": 0.7417409770190716, |
| "num_tokens": 105699528.0, |
| "step": 1120 |
| }, |
| { |
| "entropy": 1.4036426708102225, |
| "epoch": 0.2507071939652782, |
| "grad_norm": 0.50390625, |
| "learning_rate": 3.747781721384206e-05, |
| "loss": 0.9894, |
| "mean_token_accuracy": 0.7465023934841156, |
| "num_tokens": 106650613.0, |
| "step": 1130 |
| }, |
| { |
| "entropy": 1.3854996912181377, |
| "epoch": 0.2529258416994842, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.7366903283052354e-05, |
| "loss": 0.9722, |
| "mean_token_accuracy": 0.7488848619163037, |
| "num_tokens": 107576916.0, |
| "step": 1140 |
| }, |
| { |
| "entropy": 1.3835882171988487, |
| "epoch": 0.25514448943369017, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.7255989352262646e-05, |
| "loss": 0.9998, |
| "mean_token_accuracy": 0.7414388991892338, |
| "num_tokens": 108541529.0, |
| "step": 1150 |
| }, |
| { |
| "entropy": 1.3686518892645836, |
| "epoch": 0.25736313716789616, |
| "grad_norm": 0.51953125, |
| "learning_rate": 3.714507542147294e-05, |
| "loss": 0.9453, |
| "mean_token_accuracy": 0.7537351176142693, |
| "num_tokens": 109478622.0, |
| "step": 1160 |
| }, |
| { |
| "entropy": 1.406387110054493, |
| "epoch": 0.25958178490210215, |
| "grad_norm": 0.51171875, |
| "learning_rate": 3.703416149068323e-05, |
| "loss": 0.9794, |
| "mean_token_accuracy": 0.7466554552316665, |
| "num_tokens": 110405684.0, |
| "step": 1170 |
| }, |
| { |
| "entropy": 1.3809578880667686, |
| "epoch": 0.26180043263630814, |
| "grad_norm": 0.5625, |
| "learning_rate": 3.692324755989352e-05, |
| "loss": 0.9719, |
| "mean_token_accuracy": 0.749175675958395, |
| "num_tokens": 111345202.0, |
| "step": 1180 |
| }, |
| { |
| "entropy": 1.3847816362977028, |
| "epoch": 0.2640190803705142, |
| "grad_norm": 0.5859375, |
| "learning_rate": 3.6812333629103815e-05, |
| "loss": 1.0003, |
| "mean_token_accuracy": 0.7436210744082927, |
| "num_tokens": 112274997.0, |
| "step": 1190 |
| }, |
| { |
| "entropy": 1.3820923566818237, |
| "epoch": 0.2662377281047202, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.670141969831411e-05, |
| "loss": 0.9592, |
| "mean_token_accuracy": 0.7504418276250362, |
| "num_tokens": 113206700.0, |
| "step": 1200 |
| }, |
| { |
| "entropy": 1.3826360628008842, |
| "epoch": 0.2684563758389262, |
| "grad_norm": 0.5859375, |
| "learning_rate": 3.65905057675244e-05, |
| "loss": 0.9873, |
| "mean_token_accuracy": 0.7447850324213505, |
| "num_tokens": 114136136.0, |
| "step": 1210 |
| }, |
| { |
| "entropy": 1.3701522216200828, |
| "epoch": 0.27067502357313217, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.64795918367347e-05, |
| "loss": 0.9779, |
| "mean_token_accuracy": 0.7473484382033349, |
| "num_tokens": 115065377.0, |
| "step": 1220 |
| }, |
| { |
| "entropy": 1.3910960853099823, |
| "epoch": 0.27289367130733816, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.636867790594499e-05, |
| "loss": 0.989, |
| "mean_token_accuracy": 0.7464887276291847, |
| "num_tokens": 116011291.0, |
| "step": 1230 |
| }, |
| { |
| "entropy": 1.370178584754467, |
| "epoch": 0.2751123190415442, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.625776397515528e-05, |
| "loss": 0.9897, |
| "mean_token_accuracy": 0.7448255158960819, |
| "num_tokens": 116970495.0, |
| "step": 1240 |
| }, |
| { |
| "entropy": 1.3493198916316032, |
| "epoch": 0.2773309667757502, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.6146850044365574e-05, |
| "loss": 0.949, |
| "mean_token_accuracy": 0.7529671564698219, |
| "num_tokens": 117911337.0, |
| "step": 1250 |
| }, |
| { |
| "entropy": 1.371771328896284, |
| "epoch": 0.2795496145099562, |
| "grad_norm": 0.515625, |
| "learning_rate": 3.6035936113575866e-05, |
| "loss": 0.9472, |
| "mean_token_accuracy": 0.753813973069191, |
| "num_tokens": 118848493.0, |
| "step": 1260 |
| }, |
| { |
| "entropy": 1.4208975359797478, |
| "epoch": 0.2817682622441622, |
| "grad_norm": 0.53125, |
| "learning_rate": 3.592502218278616e-05, |
| "loss": 1.0034, |
| "mean_token_accuracy": 0.7418984033167362, |
| "num_tokens": 119781601.0, |
| "step": 1270 |
| }, |
| { |
| "entropy": 1.395139442384243, |
| "epoch": 0.2839869099783682, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.581410825199645e-05, |
| "loss": 1.0071, |
| "mean_token_accuracy": 0.7408353559672832, |
| "num_tokens": 120722213.0, |
| "step": 1280 |
| }, |
| { |
| "entropy": 1.3831138402223586, |
| "epoch": 0.28620555771257417, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.570319432120674e-05, |
| "loss": 0.9883, |
| "mean_token_accuracy": 0.7461639747023583, |
| "num_tokens": 121649961.0, |
| "step": 1290 |
| }, |
| { |
| "entropy": 1.3695012629032135, |
| "epoch": 0.2884242054467802, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.5592280390417035e-05, |
| "loss": 0.9526, |
| "mean_token_accuracy": 0.7522782661020756, |
| "num_tokens": 122622563.0, |
| "step": 1300 |
| }, |
| { |
| "entropy": 1.4116339407861234, |
| "epoch": 0.2906428531809862, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.548136645962733e-05, |
| "loss": 1.0048, |
| "mean_token_accuracy": 0.74220717176795, |
| "num_tokens": 123550041.0, |
| "step": 1310 |
| }, |
| { |
| "entropy": 1.3907336607575416, |
| "epoch": 0.2928615009151922, |
| "grad_norm": 0.5703125, |
| "learning_rate": 3.537045252883762e-05, |
| "loss": 0.9845, |
| "mean_token_accuracy": 0.7461209401488305, |
| "num_tokens": 124502233.0, |
| "step": 1320 |
| }, |
| { |
| "entropy": 1.3597315862774848, |
| "epoch": 0.2950801486493982, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.525953859804791e-05, |
| "loss": 0.9646, |
| "mean_token_accuracy": 0.7516384877264499, |
| "num_tokens": 125434381.0, |
| "step": 1330 |
| }, |
| { |
| "entropy": 1.3610756233334542, |
| "epoch": 0.2972987963836042, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.514862466725821e-05, |
| "loss": 0.9613, |
| "mean_token_accuracy": 0.7506407134234905, |
| "num_tokens": 126374268.0, |
| "step": 1340 |
| }, |
| { |
| "entropy": 1.363479419052601, |
| "epoch": 0.29951744411781017, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.50377107364685e-05, |
| "loss": 0.9567, |
| "mean_token_accuracy": 0.7539497919380664, |
| "num_tokens": 127319726.0, |
| "step": 1350 |
| }, |
| { |
| "entropy": 1.4010797172784806, |
| "epoch": 0.3017360918520162, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.4926796805678794e-05, |
| "loss": 0.9972, |
| "mean_token_accuracy": 0.7439250282943248, |
| "num_tokens": 128269917.0, |
| "step": 1360 |
| }, |
| { |
| "entropy": 1.400447415560484, |
| "epoch": 0.3039547395862222, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.481588287488909e-05, |
| "loss": 1.0006, |
| "mean_token_accuracy": 0.7441901095211506, |
| "num_tokens": 129215524.0, |
| "step": 1370 |
| }, |
| { |
| "entropy": 1.3762236058712005, |
| "epoch": 0.3061733873204282, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.470496894409938e-05, |
| "loss": 0.9751, |
| "mean_token_accuracy": 0.7485686533153058, |
| "num_tokens": 130133218.0, |
| "step": 1380 |
| }, |
| { |
| "entropy": 1.3712550908327104, |
| "epoch": 0.3083920350546342, |
| "grad_norm": 0.5703125, |
| "learning_rate": 3.459405501330967e-05, |
| "loss": 0.967, |
| "mean_token_accuracy": 0.7488023094832897, |
| "num_tokens": 131090702.0, |
| "step": 1390 |
| }, |
| { |
| "entropy": 1.3727133765816688, |
| "epoch": 0.3106106827888402, |
| "grad_norm": 0.5859375, |
| "learning_rate": 3.448314108251996e-05, |
| "loss": 0.9617, |
| "mean_token_accuracy": 0.7511452712118626, |
| "num_tokens": 132015232.0, |
| "step": 1400 |
| }, |
| { |
| "entropy": 1.3846083499491215, |
| "epoch": 0.3128293305230462, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.4372227151730255e-05, |
| "loss": 0.9487, |
| "mean_token_accuracy": 0.752527979016304, |
| "num_tokens": 132965680.0, |
| "step": 1410 |
| }, |
| { |
| "entropy": 1.3626705884933472, |
| "epoch": 0.3150479782572522, |
| "grad_norm": 0.56640625, |
| "learning_rate": 3.426131322094055e-05, |
| "loss": 0.9392, |
| "mean_token_accuracy": 0.7541214250028133, |
| "num_tokens": 133895331.0, |
| "step": 1420 |
| }, |
| { |
| "entropy": 1.3925424292683601, |
| "epoch": 0.3172666259914582, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.415039929015084e-05, |
| "loss": 1.0072, |
| "mean_token_accuracy": 0.7419983983039856, |
| "num_tokens": 134848732.0, |
| "step": 1430 |
| }, |
| { |
| "entropy": 1.383028756082058, |
| "epoch": 0.3194852737256642, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.403948535936114e-05, |
| "loss": 0.9968, |
| "mean_token_accuracy": 0.7439531564712525, |
| "num_tokens": 135805571.0, |
| "step": 1440 |
| }, |
| { |
| "entropy": 1.411787600815296, |
| "epoch": 0.3217039214598702, |
| "grad_norm": 0.51953125, |
| "learning_rate": 3.392857142857143e-05, |
| "loss": 1.0173, |
| "mean_token_accuracy": 0.7382614344358445, |
| "num_tokens": 136755869.0, |
| "step": 1450 |
| }, |
| { |
| "entropy": 1.374262510240078, |
| "epoch": 0.3239225691940762, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.381765749778172e-05, |
| "loss": 0.9612, |
| "mean_token_accuracy": 0.7520359136164189, |
| "num_tokens": 137707923.0, |
| "step": 1460 |
| }, |
| { |
| "entropy": 1.345720000565052, |
| "epoch": 0.3261412169282822, |
| "grad_norm": 0.5078125, |
| "learning_rate": 3.3706743566992015e-05, |
| "loss": 0.9512, |
| "mean_token_accuracy": 0.7521267220377922, |
| "num_tokens": 138674173.0, |
| "step": 1470 |
| }, |
| { |
| "entropy": 1.3797206476330757, |
| "epoch": 0.32835986466248823, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.359582963620231e-05, |
| "loss": 0.9503, |
| "mean_token_accuracy": 0.7529976561665535, |
| "num_tokens": 139628775.0, |
| "step": 1480 |
| }, |
| { |
| "entropy": 1.3691905356943608, |
| "epoch": 0.3305785123966942, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.34849157054126e-05, |
| "loss": 0.9742, |
| "mean_token_accuracy": 0.7474093928933143, |
| "num_tokens": 140568320.0, |
| "step": 1490 |
| }, |
| { |
| "entropy": 1.3553572654724122, |
| "epoch": 0.3327971601309002, |
| "grad_norm": 0.5078125, |
| "learning_rate": 3.337400177462289e-05, |
| "loss": 0.9474, |
| "mean_token_accuracy": 0.7541252739727498, |
| "num_tokens": 141508452.0, |
| "step": 1500 |
| }, |
| { |
| "entropy": 1.3576419681310654, |
| "epoch": 0.3350158078651062, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.326308784383318e-05, |
| "loss": 0.9445, |
| "mean_token_accuracy": 0.7541140832006932, |
| "num_tokens": 142443005.0, |
| "step": 1510 |
| }, |
| { |
| "entropy": 1.3632627040147782, |
| "epoch": 0.3372344555993122, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.3152173913043475e-05, |
| "loss": 0.9633, |
| "mean_token_accuracy": 0.751540695130825, |
| "num_tokens": 143364590.0, |
| "step": 1520 |
| }, |
| { |
| "entropy": 1.3698595464229584, |
| "epoch": 0.33945310333351825, |
| "grad_norm": 0.58984375, |
| "learning_rate": 3.3041259982253774e-05, |
| "loss": 0.9567, |
| "mean_token_accuracy": 0.7508327946066856, |
| "num_tokens": 144330283.0, |
| "step": 1530 |
| }, |
| { |
| "entropy": 1.3838164374232291, |
| "epoch": 0.34167175106772424, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.2930346051464066e-05, |
| "loss": 0.9412, |
| "mean_token_accuracy": 0.7536897391080857, |
| "num_tokens": 145271945.0, |
| "step": 1540 |
| }, |
| { |
| "entropy": 1.3916514277458192, |
| "epoch": 0.34389039880193023, |
| "grad_norm": 0.60546875, |
| "learning_rate": 3.281943212067436e-05, |
| "loss": 0.9674, |
| "mean_token_accuracy": 0.7496246941387653, |
| "num_tokens": 146208637.0, |
| "step": 1550 |
| }, |
| { |
| "entropy": 1.3817257568240167, |
| "epoch": 0.3461090465361362, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.270851818988465e-05, |
| "loss": 0.998, |
| "mean_token_accuracy": 0.745353914052248, |
| "num_tokens": 147132578.0, |
| "step": 1560 |
| }, |
| { |
| "entropy": 1.379334208369255, |
| "epoch": 0.3483276942703422, |
| "grad_norm": 0.59765625, |
| "learning_rate": 3.259760425909494e-05, |
| "loss": 0.9806, |
| "mean_token_accuracy": 0.7451153837144375, |
| "num_tokens": 148047084.0, |
| "step": 1570 |
| }, |
| { |
| "entropy": 1.3558235377073289, |
| "epoch": 0.3505463420045482, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.2486690328305235e-05, |
| "loss": 0.9319, |
| "mean_token_accuracy": 0.7564816296100616, |
| "num_tokens": 148984698.0, |
| "step": 1580 |
| }, |
| { |
| "entropy": 1.3621691033244132, |
| "epoch": 0.35276498973875425, |
| "grad_norm": 0.5, |
| "learning_rate": 3.237577639751553e-05, |
| "loss": 0.9663, |
| "mean_token_accuracy": 0.7516494557261467, |
| "num_tokens": 149927544.0, |
| "step": 1590 |
| }, |
| { |
| "entropy": 1.3577947162091732, |
| "epoch": 0.35498363747296025, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.226486246672582e-05, |
| "loss": 0.9732, |
| "mean_token_accuracy": 0.7493470698595047, |
| "num_tokens": 150876867.0, |
| "step": 1600 |
| }, |
| { |
| "entropy": 1.35196972489357, |
| "epoch": 0.35720228520716624, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.215394853593611e-05, |
| "loss": 0.9483, |
| "mean_token_accuracy": 0.7527376770973205, |
| "num_tokens": 151813474.0, |
| "step": 1610 |
| }, |
| { |
| "entropy": 1.3889328390359879, |
| "epoch": 0.35942093294137223, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.204303460514641e-05, |
| "loss": 0.9902, |
| "mean_token_accuracy": 0.7460403524339199, |
| "num_tokens": 152748724.0, |
| "step": 1620 |
| }, |
| { |
| "entropy": 1.3454296171665192, |
| "epoch": 0.3616395806755782, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.19321206743567e-05, |
| "loss": 0.9281, |
| "mean_token_accuracy": 0.755976890027523, |
| "num_tokens": 153669850.0, |
| "step": 1630 |
| }, |
| { |
| "entropy": 1.3814805909991263, |
| "epoch": 0.3638582284097842, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.1821206743566994e-05, |
| "loss": 0.9504, |
| "mean_token_accuracy": 0.7522977091372013, |
| "num_tokens": 154602553.0, |
| "step": 1640 |
| }, |
| { |
| "entropy": 1.3916409358382225, |
| "epoch": 0.36607687614399026, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.171029281277729e-05, |
| "loss": 0.9778, |
| "mean_token_accuracy": 0.7461537972092629, |
| "num_tokens": 155541120.0, |
| "step": 1650 |
| }, |
| { |
| "entropy": 1.3471432410180568, |
| "epoch": 0.36829552387819625, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.159937888198758e-05, |
| "loss": 0.9273, |
| "mean_token_accuracy": 0.7581139869987965, |
| "num_tokens": 156520158.0, |
| "step": 1660 |
| }, |
| { |
| "entropy": 1.404821753501892, |
| "epoch": 0.37051417161240224, |
| "grad_norm": 0.5625, |
| "learning_rate": 3.148846495119787e-05, |
| "loss": 1.0, |
| "mean_token_accuracy": 0.7436496950685978, |
| "num_tokens": 157463456.0, |
| "step": 1670 |
| }, |
| { |
| "entropy": 1.3906827136874198, |
| "epoch": 0.37273281934660824, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.137755102040816e-05, |
| "loss": 0.9907, |
| "mean_token_accuracy": 0.7457496263086796, |
| "num_tokens": 158405908.0, |
| "step": 1680 |
| }, |
| { |
| "entropy": 1.3714244484901428, |
| "epoch": 0.3749514670808142, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.1266637089618455e-05, |
| "loss": 0.9505, |
| "mean_token_accuracy": 0.7535674646496773, |
| "num_tokens": 159335729.0, |
| "step": 1690 |
| }, |
| { |
| "entropy": 1.390585573017597, |
| "epoch": 0.3771701148150202, |
| "grad_norm": 0.56640625, |
| "learning_rate": 3.115572315882875e-05, |
| "loss": 0.9966, |
| "mean_token_accuracy": 0.7446259804069996, |
| "num_tokens": 160296263.0, |
| "step": 1700 |
| }, |
| { |
| "entropy": 1.4077832899987697, |
| "epoch": 0.37938876254922627, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.1044809228039046e-05, |
| "loss": 0.9894, |
| "mean_token_accuracy": 0.7444383382797242, |
| "num_tokens": 161219852.0, |
| "step": 1710 |
| }, |
| { |
| "entropy": 1.395198680460453, |
| "epoch": 0.38160741028343226, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.093389529724934e-05, |
| "loss": 1.0024, |
| "mean_token_accuracy": 0.74552848264575, |
| "num_tokens": 162158334.0, |
| "step": 1720 |
| }, |
| { |
| "entropy": 1.3805132403969764, |
| "epoch": 0.38382605801763825, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.082298136645963e-05, |
| "loss": 0.9752, |
| "mean_token_accuracy": 0.7499201230704784, |
| "num_tokens": 163093367.0, |
| "step": 1730 |
| }, |
| { |
| "entropy": 1.398225909471512, |
| "epoch": 0.38604470575184424, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.071206743566992e-05, |
| "loss": 0.9824, |
| "mean_token_accuracy": 0.7451727867126465, |
| "num_tokens": 164014979.0, |
| "step": 1740 |
| }, |
| { |
| "entropy": 1.3813935965299606, |
| "epoch": 0.38826335348605023, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.0601153504880215e-05, |
| "loss": 0.9843, |
| "mean_token_accuracy": 0.7469385854899884, |
| "num_tokens": 164974085.0, |
| "step": 1750 |
| }, |
| { |
| "entropy": 1.368855346739292, |
| "epoch": 0.3904820012202563, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.0490239574090507e-05, |
| "loss": 0.9472, |
| "mean_token_accuracy": 0.75348781645298, |
| "num_tokens": 165918118.0, |
| "step": 1760 |
| }, |
| { |
| "entropy": 1.3673339888453484, |
| "epoch": 0.3927006489544623, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.03793256433008e-05, |
| "loss": 0.9387, |
| "mean_token_accuracy": 0.755811995267868, |
| "num_tokens": 166852949.0, |
| "step": 1770 |
| }, |
| { |
| "entropy": 1.3427365884184836, |
| "epoch": 0.39491929668866826, |
| "grad_norm": 0.50390625, |
| "learning_rate": 3.026841171251109e-05, |
| "loss": 0.9297, |
| "mean_token_accuracy": 0.7581560261547565, |
| "num_tokens": 167809459.0, |
| "step": 1780 |
| }, |
| { |
| "entropy": 1.3762704834342003, |
| "epoch": 0.39713794442287426, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.0157497781721383e-05, |
| "loss": 1.0051, |
| "mean_token_accuracy": 0.7433216728270053, |
| "num_tokens": 168752185.0, |
| "step": 1790 |
| }, |
| { |
| "entropy": 1.3575905784964561, |
| "epoch": 0.39935659215708025, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.0046583850931682e-05, |
| "loss": 0.9374, |
| "mean_token_accuracy": 0.7572205021977425, |
| "num_tokens": 169690119.0, |
| "step": 1800 |
| }, |
| { |
| "entropy": 1.3576733842492104, |
| "epoch": 0.40157523989128624, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.9935669920141974e-05, |
| "loss": 0.9523, |
| "mean_token_accuracy": 0.7515712559223175, |
| "num_tokens": 170619298.0, |
| "step": 1810 |
| }, |
| { |
| "entropy": 1.3723658367991447, |
| "epoch": 0.4037938876254923, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.9824755989352266e-05, |
| "loss": 0.9548, |
| "mean_token_accuracy": 0.7528701044619084, |
| "num_tokens": 171570309.0, |
| "step": 1820 |
| }, |
| { |
| "entropy": 1.4009515389800071, |
| "epoch": 0.4060125353596983, |
| "grad_norm": 0.515625, |
| "learning_rate": 2.971384205856256e-05, |
| "loss": 0.9975, |
| "mean_token_accuracy": 0.7424866132438183, |
| "num_tokens": 172494818.0, |
| "step": 1830 |
| }, |
| { |
| "entropy": 1.3911827325820922, |
| "epoch": 0.40823118309390427, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.960292812777285e-05, |
| "loss": 0.9626, |
| "mean_token_accuracy": 0.7502177953720093, |
| "num_tokens": 173423865.0, |
| "step": 1840 |
| }, |
| { |
| "entropy": 1.3462319664657116, |
| "epoch": 0.41044983082811026, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.9492014196983143e-05, |
| "loss": 0.9437, |
| "mean_token_accuracy": 0.7530038900673389, |
| "num_tokens": 174366928.0, |
| "step": 1850 |
| }, |
| { |
| "entropy": 1.3755939684808254, |
| "epoch": 0.41266847856231625, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.9381100266193435e-05, |
| "loss": 0.9979, |
| "mean_token_accuracy": 0.7425804652273655, |
| "num_tokens": 175300342.0, |
| "step": 1860 |
| }, |
| { |
| "entropy": 1.3714133627712726, |
| "epoch": 0.41488712629652225, |
| "grad_norm": 0.59765625, |
| "learning_rate": 2.9270186335403727e-05, |
| "loss": 0.9564, |
| "mean_token_accuracy": 0.7504196316003799, |
| "num_tokens": 176242068.0, |
| "step": 1870 |
| }, |
| { |
| "entropy": 1.3977258250117301, |
| "epoch": 0.4171057740307283, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.915927240461402e-05, |
| "loss": 0.9769, |
| "mean_token_accuracy": 0.7471397712826728, |
| "num_tokens": 177196173.0, |
| "step": 1880 |
| }, |
| { |
| "entropy": 1.3658091217279433, |
| "epoch": 0.4193244217649343, |
| "grad_norm": 0.6171875, |
| "learning_rate": 2.9048358473824318e-05, |
| "loss": 0.9419, |
| "mean_token_accuracy": 0.753964976221323, |
| "num_tokens": 178133746.0, |
| "step": 1890 |
| }, |
| { |
| "entropy": 1.3236115381121636, |
| "epoch": 0.4215430694991403, |
| "grad_norm": 0.53125, |
| "learning_rate": 2.893744454303461e-05, |
| "loss": 0.9437, |
| "mean_token_accuracy": 0.7538949429988862, |
| "num_tokens": 179096225.0, |
| "step": 1900 |
| }, |
| { |
| "entropy": 1.3948393434286117, |
| "epoch": 0.42376171723334627, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.8826530612244902e-05, |
| "loss": 1.002, |
| "mean_token_accuracy": 0.7435316666960716, |
| "num_tokens": 180036853.0, |
| "step": 1910 |
| }, |
| { |
| "entropy": 1.3544544890522956, |
| "epoch": 0.42598036496755226, |
| "grad_norm": 0.58984375, |
| "learning_rate": 2.8715616681455194e-05, |
| "loss": 0.9424, |
| "mean_token_accuracy": 0.7551728583872318, |
| "num_tokens": 180966842.0, |
| "step": 1920 |
| }, |
| { |
| "entropy": 1.3815669476985932, |
| "epoch": 0.42819901270175825, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.8604702750665487e-05, |
| "loss": 0.9622, |
| "mean_token_accuracy": 0.7512604773044587, |
| "num_tokens": 181900033.0, |
| "step": 1930 |
| }, |
| { |
| "entropy": 1.3831812545657158, |
| "epoch": 0.4304176604359643, |
| "grad_norm": 0.48046875, |
| "learning_rate": 2.849378881987578e-05, |
| "loss": 0.9525, |
| "mean_token_accuracy": 0.7529491983354092, |
| "num_tokens": 182851572.0, |
| "step": 1940 |
| }, |
| { |
| "entropy": 1.3749890983104707, |
| "epoch": 0.4326363081701703, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.838287488908607e-05, |
| "loss": 0.9776, |
| "mean_token_accuracy": 0.7499315291643143, |
| "num_tokens": 183771878.0, |
| "step": 1950 |
| }, |
| { |
| "entropy": 1.3801977284252644, |
| "epoch": 0.4348549559043763, |
| "grad_norm": 0.58203125, |
| "learning_rate": 2.8271960958296363e-05, |
| "loss": 0.9627, |
| "mean_token_accuracy": 0.7519955664873124, |
| "num_tokens": 184715766.0, |
| "step": 1960 |
| }, |
| { |
| "entropy": 1.3351484373211862, |
| "epoch": 0.4370736036385823, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.8161047027506655e-05, |
| "loss": 0.9321, |
| "mean_token_accuracy": 0.7555009052157402, |
| "num_tokens": 185661433.0, |
| "step": 1970 |
| }, |
| { |
| "entropy": 1.396961908042431, |
| "epoch": 0.43929225137278827, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.8050133096716947e-05, |
| "loss": 1.0058, |
| "mean_token_accuracy": 0.7446497425436973, |
| "num_tokens": 186585197.0, |
| "step": 1980 |
| }, |
| { |
| "entropy": 1.352859264612198, |
| "epoch": 0.4415108991069943, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.7939219165927243e-05, |
| "loss": 0.966, |
| "mean_token_accuracy": 0.7493795678019524, |
| "num_tokens": 187503900.0, |
| "step": 1990 |
| }, |
| { |
| "entropy": 1.333592215180397, |
| "epoch": 0.4437295468412003, |
| "grad_norm": 0.5, |
| "learning_rate": 2.7828305235137535e-05, |
| "loss": 0.9315, |
| "mean_token_accuracy": 0.7587283760309219, |
| "num_tokens": 188474289.0, |
| "step": 2000 |
| }, |
| { |
| "entropy": 1.3918707191944122, |
| "epoch": 0.4459481945754063, |
| "grad_norm": 0.57421875, |
| "learning_rate": 2.7717391304347827e-05, |
| "loss": 0.9874, |
| "mean_token_accuracy": 0.746398999541998, |
| "num_tokens": 189433780.0, |
| "step": 2010 |
| }, |
| { |
| "entropy": 1.368664526939392, |
| "epoch": 0.4481668423096123, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.760647737355812e-05, |
| "loss": 0.9454, |
| "mean_token_accuracy": 0.755309022217989, |
| "num_tokens": 190356653.0, |
| "step": 2020 |
| }, |
| { |
| "entropy": 1.4010012477636338, |
| "epoch": 0.4503854900438183, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.749556344276841e-05, |
| "loss": 1.0024, |
| "mean_token_accuracy": 0.7404071927070618, |
| "num_tokens": 191318931.0, |
| "step": 2030 |
| }, |
| { |
| "entropy": 1.3866683512926101, |
| "epoch": 0.4526041377780243, |
| "grad_norm": 0.6796875, |
| "learning_rate": 2.7384649511978703e-05, |
| "loss": 0.9751, |
| "mean_token_accuracy": 0.7486230276525021, |
| "num_tokens": 192303217.0, |
| "step": 2040 |
| }, |
| { |
| "entropy": 1.3726959481835366, |
| "epoch": 0.4548227855122303, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.7273735581188996e-05, |
| "loss": 0.9482, |
| "mean_token_accuracy": 0.7530568726360798, |
| "num_tokens": 193222632.0, |
| "step": 2050 |
| }, |
| { |
| "entropy": 1.3679525300860405, |
| "epoch": 0.4570414332464363, |
| "grad_norm": 0.5859375, |
| "learning_rate": 2.7162821650399288e-05, |
| "loss": 0.9506, |
| "mean_token_accuracy": 0.7516115583479405, |
| "num_tokens": 194151401.0, |
| "step": 2060 |
| }, |
| { |
| "entropy": 1.4062684878706933, |
| "epoch": 0.4592600809806423, |
| "grad_norm": 0.58984375, |
| "learning_rate": 2.7051907719609583e-05, |
| "loss": 0.9855, |
| "mean_token_accuracy": 0.7442703887820243, |
| "num_tokens": 195080292.0, |
| "step": 2070 |
| }, |
| { |
| "entropy": 1.3738665029406547, |
| "epoch": 0.4614787287148483, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.694099378881988e-05, |
| "loss": 0.9761, |
| "mean_token_accuracy": 0.7479680195450783, |
| "num_tokens": 196000406.0, |
| "step": 2080 |
| }, |
| { |
| "entropy": 1.3434479467570781, |
| "epoch": 0.4636973764490543, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.683007985803017e-05, |
| "loss": 0.919, |
| "mean_token_accuracy": 0.760900753736496, |
| "num_tokens": 196914007.0, |
| "step": 2090 |
| }, |
| { |
| "entropy": 1.3689823046326637, |
| "epoch": 0.4659160241832603, |
| "grad_norm": 0.58203125, |
| "learning_rate": 2.6719165927240463e-05, |
| "loss": 0.9669, |
| "mean_token_accuracy": 0.7499063372611999, |
| "num_tokens": 197828045.0, |
| "step": 2100 |
| }, |
| { |
| "entropy": 1.3804068550467492, |
| "epoch": 0.4681346719174663, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.6608251996450755e-05, |
| "loss": 0.9433, |
| "mean_token_accuracy": 0.7544724628329277, |
| "num_tokens": 198765460.0, |
| "step": 2110 |
| }, |
| { |
| "entropy": 1.3435491159558297, |
| "epoch": 0.4703533196516723, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.6497338065661047e-05, |
| "loss": 0.9218, |
| "mean_token_accuracy": 0.7582143515348434, |
| "num_tokens": 199694033.0, |
| "step": 2120 |
| }, |
| { |
| "entropy": 1.394715888798237, |
| "epoch": 0.4725719673858783, |
| "grad_norm": 0.59765625, |
| "learning_rate": 2.638642413487134e-05, |
| "loss": 0.9791, |
| "mean_token_accuracy": 0.746685141324997, |
| "num_tokens": 200655207.0, |
| "step": 2130 |
| }, |
| { |
| "entropy": 1.3192944645881652, |
| "epoch": 0.4747906151200843, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.627551020408163e-05, |
| "loss": 0.9313, |
| "mean_token_accuracy": 0.7588945962488651, |
| "num_tokens": 201614974.0, |
| "step": 2140 |
| }, |
| { |
| "entropy": 1.3649922542273998, |
| "epoch": 0.4770092628542903, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.6164596273291924e-05, |
| "loss": 0.9602, |
| "mean_token_accuracy": 0.7506442323327065, |
| "num_tokens": 202551250.0, |
| "step": 2150 |
| }, |
| { |
| "entropy": 1.3999163076281547, |
| "epoch": 0.4792279105884963, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.6053682342502216e-05, |
| "loss": 0.9891, |
| "mean_token_accuracy": 0.744847048074007, |
| "num_tokens": 203467276.0, |
| "step": 2160 |
| }, |
| { |
| "entropy": 1.3639633044600488, |
| "epoch": 0.48144655832270233, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.5942768411712515e-05, |
| "loss": 0.9824, |
| "mean_token_accuracy": 0.7470031566917896, |
| "num_tokens": 204368765.0, |
| "step": 2170 |
| }, |
| { |
| "entropy": 1.4031486429274083, |
| "epoch": 0.4836652060569083, |
| "grad_norm": 0.578125, |
| "learning_rate": 2.5831854480922807e-05, |
| "loss": 0.9948, |
| "mean_token_accuracy": 0.7446600675582886, |
| "num_tokens": 205276177.0, |
| "step": 2180 |
| }, |
| { |
| "entropy": 1.347407591342926, |
| "epoch": 0.4858838537911143, |
| "grad_norm": 0.53125, |
| "learning_rate": 2.57209405501331e-05, |
| "loss": 0.9339, |
| "mean_token_accuracy": 0.7554423555731773, |
| "num_tokens": 206213045.0, |
| "step": 2190 |
| }, |
| { |
| "entropy": 1.3782639726996422, |
| "epoch": 0.4881025015253203, |
| "grad_norm": 0.57421875, |
| "learning_rate": 2.561002661934339e-05, |
| "loss": 0.9529, |
| "mean_token_accuracy": 0.7520141348242759, |
| "num_tokens": 207163454.0, |
| "step": 2200 |
| }, |
| { |
| "entropy": 1.3646283119916915, |
| "epoch": 0.4903211492595263, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.5499112688553683e-05, |
| "loss": 0.944, |
| "mean_token_accuracy": 0.7564348295331002, |
| "num_tokens": 208151153.0, |
| "step": 2210 |
| }, |
| { |
| "entropy": 1.3543564982712268, |
| "epoch": 0.4925397969937323, |
| "grad_norm": 0.578125, |
| "learning_rate": 2.5388198757763975e-05, |
| "loss": 0.9695, |
| "mean_token_accuracy": 0.7477301351726056, |
| "num_tokens": 209092142.0, |
| "step": 2220 |
| }, |
| { |
| "entropy": 1.3566198840737342, |
| "epoch": 0.49475844472793834, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.5277284826974267e-05, |
| "loss": 0.9536, |
| "mean_token_accuracy": 0.7519425883889198, |
| "num_tokens": 210026782.0, |
| "step": 2230 |
| }, |
| { |
| "entropy": 1.3839320428669453, |
| "epoch": 0.49697709246214433, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.516637089618456e-05, |
| "loss": 0.982, |
| "mean_token_accuracy": 0.7456572473049163, |
| "num_tokens": 210961869.0, |
| "step": 2240 |
| }, |
| { |
| "entropy": 1.3263145498931408, |
| "epoch": 0.4991957401963503, |
| "grad_norm": 0.53125, |
| "learning_rate": 2.5055456965394852e-05, |
| "loss": 0.9501, |
| "mean_token_accuracy": 0.7539430402219296, |
| "num_tokens": 211923968.0, |
| "step": 2250 |
| }, |
| { |
| "entropy": 1.3298779338598252, |
| "epoch": 0.5014143879305564, |
| "grad_norm": 0.515625, |
| "learning_rate": 2.4944543034605147e-05, |
| "loss": 0.9548, |
| "mean_token_accuracy": 0.7525861606001853, |
| "num_tokens": 212869103.0, |
| "step": 2260 |
| }, |
| { |
| "entropy": 1.3527758911252021, |
| "epoch": 0.5036330356647624, |
| "grad_norm": 0.494140625, |
| "learning_rate": 2.483362910381544e-05, |
| "loss": 0.9569, |
| "mean_token_accuracy": 0.7526809461414814, |
| "num_tokens": 213818858.0, |
| "step": 2270 |
| }, |
| { |
| "entropy": 1.3720970265567303, |
| "epoch": 0.5058516833989684, |
| "grad_norm": 0.51953125, |
| "learning_rate": 2.4722715173025735e-05, |
| "loss": 0.9519, |
| "mean_token_accuracy": 0.7515731148421765, |
| "num_tokens": 214779694.0, |
| "step": 2280 |
| }, |
| { |
| "entropy": 1.4162064865231514, |
| "epoch": 0.5080703311331743, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.4611801242236027e-05, |
| "loss": 0.9876, |
| "mean_token_accuracy": 0.7463356249034405, |
| "num_tokens": 215737714.0, |
| "step": 2290 |
| }, |
| { |
| "entropy": 1.4002547860145569, |
| "epoch": 0.5102889788673803, |
| "grad_norm": 0.61328125, |
| "learning_rate": 2.450088731144632e-05, |
| "loss": 0.9809, |
| "mean_token_accuracy": 0.7466327108442783, |
| "num_tokens": 216677039.0, |
| "step": 2300 |
| }, |
| { |
| "entropy": 1.3871633470058442, |
| "epoch": 0.5125076266015863, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.438997338065661e-05, |
| "loss": 0.9862, |
| "mean_token_accuracy": 0.7464494623243809, |
| "num_tokens": 217592435.0, |
| "step": 2310 |
| }, |
| { |
| "entropy": 1.3928598061203956, |
| "epoch": 0.5147262743357923, |
| "grad_norm": 0.57421875, |
| "learning_rate": 2.4279059449866903e-05, |
| "loss": 0.9854, |
| "mean_token_accuracy": 0.7452214293181896, |
| "num_tokens": 218535578.0, |
| "step": 2320 |
| }, |
| { |
| "entropy": 1.3906780779361725, |
| "epoch": 0.5169449220699983, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.41681455190772e-05, |
| "loss": 0.9613, |
| "mean_token_accuracy": 0.7505389004945755, |
| "num_tokens": 219486330.0, |
| "step": 2330 |
| }, |
| { |
| "entropy": 1.378984921425581, |
| "epoch": 0.5191635698042043, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.405723158828749e-05, |
| "loss": 0.9808, |
| "mean_token_accuracy": 0.7484551966190338, |
| "num_tokens": 220422599.0, |
| "step": 2340 |
| }, |
| { |
| "entropy": 1.3721670493483544, |
| "epoch": 0.5213822175384103, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.3946317657497783e-05, |
| "loss": 0.9709, |
| "mean_token_accuracy": 0.7495145805180072, |
| "num_tokens": 221377332.0, |
| "step": 2350 |
| }, |
| { |
| "entropy": 1.402656690776348, |
| "epoch": 0.5236008652726163, |
| "grad_norm": 0.5703125, |
| "learning_rate": 2.3835403726708075e-05, |
| "loss": 0.9879, |
| "mean_token_accuracy": 0.7473884426057339, |
| "num_tokens": 222314994.0, |
| "step": 2360 |
| }, |
| { |
| "entropy": 1.3594323709607123, |
| "epoch": 0.5258195130068224, |
| "grad_norm": 0.5859375, |
| "learning_rate": 2.372448979591837e-05, |
| "loss": 0.9538, |
| "mean_token_accuracy": 0.7511370845139027, |
| "num_tokens": 223224438.0, |
| "step": 2370 |
| }, |
| { |
| "entropy": 1.3805907770991326, |
| "epoch": 0.5280381607410284, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.3613575865128663e-05, |
| "loss": 0.9735, |
| "mean_token_accuracy": 0.7476461634039879, |
| "num_tokens": 224162752.0, |
| "step": 2380 |
| }, |
| { |
| "entropy": 1.370700439810753, |
| "epoch": 0.5302568084752344, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.3502661934338955e-05, |
| "loss": 0.9706, |
| "mean_token_accuracy": 0.7497715629637242, |
| "num_tokens": 225115083.0, |
| "step": 2390 |
| }, |
| { |
| "entropy": 1.3743368998169898, |
| "epoch": 0.5324754562094404, |
| "grad_norm": 0.53125, |
| "learning_rate": 2.3391748003549247e-05, |
| "loss": 0.9413, |
| "mean_token_accuracy": 0.7557661548256874, |
| "num_tokens": 226058977.0, |
| "step": 2400 |
| }, |
| { |
| "entropy": 1.3839602798223496, |
| "epoch": 0.5346941039436464, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.328083407275954e-05, |
| "loss": 0.9615, |
| "mean_token_accuracy": 0.7533138573169709, |
| "num_tokens": 227010773.0, |
| "step": 2410 |
| }, |
| { |
| "entropy": 1.3525896489620208, |
| "epoch": 0.5369127516778524, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.3169920141969835e-05, |
| "loss": 0.9493, |
| "mean_token_accuracy": 0.7553107261657714, |
| "num_tokens": 227955312.0, |
| "step": 2420 |
| }, |
| { |
| "entropy": 1.3674135118722917, |
| "epoch": 0.5391313994120583, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.3059006211180127e-05, |
| "loss": 0.9549, |
| "mean_token_accuracy": 0.752379784733057, |
| "num_tokens": 228898935.0, |
| "step": 2430 |
| }, |
| { |
| "entropy": 1.3545546859502793, |
| "epoch": 0.5413500471462643, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.294809228039042e-05, |
| "loss": 0.924, |
| "mean_token_accuracy": 0.7607569552958011, |
| "num_tokens": 229849618.0, |
| "step": 2440 |
| }, |
| { |
| "entropy": 1.3558753475546836, |
| "epoch": 0.5435686948804703, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.283717834960071e-05, |
| "loss": 0.9193, |
| "mean_token_accuracy": 0.7595973119139672, |
| "num_tokens": 230791414.0, |
| "step": 2450 |
| }, |
| { |
| "entropy": 1.3477294951677323, |
| "epoch": 0.5457873426146763, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.2726264418811003e-05, |
| "loss": 0.9388, |
| "mean_token_accuracy": 0.7565565295517445, |
| "num_tokens": 231726099.0, |
| "step": 2460 |
| }, |
| { |
| "entropy": 1.3844288192689418, |
| "epoch": 0.5480059903488823, |
| "grad_norm": 0.58984375, |
| "learning_rate": 2.26153504880213e-05, |
| "loss": 0.9495, |
| "mean_token_accuracy": 0.7530641496181488, |
| "num_tokens": 232656045.0, |
| "step": 2470 |
| }, |
| { |
| "entropy": 1.3597193375229835, |
| "epoch": 0.5502246380830884, |
| "grad_norm": 0.515625, |
| "learning_rate": 2.250443655723159e-05, |
| "loss": 0.966, |
| "mean_token_accuracy": 0.7509191624820233, |
| "num_tokens": 233602005.0, |
| "step": 2480 |
| }, |
| { |
| "entropy": 1.3691200099885463, |
| "epoch": 0.5524432858172944, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.2393522626441883e-05, |
| "loss": 0.9542, |
| "mean_token_accuracy": 0.7519414819777012, |
| "num_tokens": 234562308.0, |
| "step": 2490 |
| }, |
| { |
| "entropy": 1.3906163677573204, |
| "epoch": 0.5546619335515004, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.2282608695652175e-05, |
| "loss": 1.0039, |
| "mean_token_accuracy": 0.7424245841801167, |
| "num_tokens": 235506260.0, |
| "step": 2500 |
| }, |
| { |
| "entropy": 1.3696281641721726, |
| "epoch": 0.5568805812857064, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.2171694764862467e-05, |
| "loss": 0.9453, |
| "mean_token_accuracy": 0.7540791384875775, |
| "num_tokens": 236457040.0, |
| "step": 2510 |
| }, |
| { |
| "entropy": 1.3700327768921852, |
| "epoch": 0.5590992290199124, |
| "grad_norm": 0.5859375, |
| "learning_rate": 2.206078083407276e-05, |
| "loss": 0.9793, |
| "mean_token_accuracy": 0.7462692283093929, |
| "num_tokens": 237378902.0, |
| "step": 2520 |
| }, |
| { |
| "entropy": 1.398044180870056, |
| "epoch": 0.5613178767541184, |
| "grad_norm": 0.59765625, |
| "learning_rate": 2.1949866903283052e-05, |
| "loss": 0.9967, |
| "mean_token_accuracy": 0.7434925585985184, |
| "num_tokens": 238311961.0, |
| "step": 2530 |
| }, |
| { |
| "entropy": 1.3696945488452912, |
| "epoch": 0.5635365244883244, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.1838952972493347e-05, |
| "loss": 0.944, |
| "mean_token_accuracy": 0.7557799100875855, |
| "num_tokens": 239234133.0, |
| "step": 2540 |
| }, |
| { |
| "entropy": 1.3959093943238259, |
| "epoch": 0.5657551722225304, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.172803904170364e-05, |
| "loss": 0.9815, |
| "mean_token_accuracy": 0.7467247255146503, |
| "num_tokens": 240146423.0, |
| "step": 2550 |
| }, |
| { |
| "entropy": 1.3369751781225205, |
| "epoch": 0.5679738199567363, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.161712511091393e-05, |
| "loss": 0.9468, |
| "mean_token_accuracy": 0.7567501932382583, |
| "num_tokens": 241119847.0, |
| "step": 2560 |
| }, |
| { |
| "entropy": 1.390147428959608, |
| "epoch": 0.5701924676909423, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.1506211180124224e-05, |
| "loss": 0.9676, |
| "mean_token_accuracy": 0.7480736941099166, |
| "num_tokens": 242052102.0, |
| "step": 2570 |
| }, |
| { |
| "entropy": 1.3671862602233886, |
| "epoch": 0.5724111154251483, |
| "grad_norm": 0.5234375, |
| "learning_rate": 2.1395297249334516e-05, |
| "loss": 0.9731, |
| "mean_token_accuracy": 0.7491575211286545, |
| "num_tokens": 242987170.0, |
| "step": 2580 |
| }, |
| { |
| "entropy": 1.3787225410342216, |
| "epoch": 0.5746297631593543, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.1284383318544808e-05, |
| "loss": 0.9672, |
| "mean_token_accuracy": 0.7511276498436927, |
| "num_tokens": 243963315.0, |
| "step": 2590 |
| }, |
| { |
| "entropy": 1.3578606337308883, |
| "epoch": 0.5768484108935604, |
| "grad_norm": 0.515625, |
| "learning_rate": 2.1173469387755103e-05, |
| "loss": 0.9603, |
| "mean_token_accuracy": 0.7515728779137134, |
| "num_tokens": 244904401.0, |
| "step": 2600 |
| }, |
| { |
| "entropy": 1.3674334943294526, |
| "epoch": 0.5790670586277664, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.1062555456965396e-05, |
| "loss": 0.9511, |
| "mean_token_accuracy": 0.7508557684719562, |
| "num_tokens": 245843429.0, |
| "step": 2610 |
| }, |
| { |
| "entropy": 1.3535479776561261, |
| "epoch": 0.5812857063619724, |
| "grad_norm": 0.51953125, |
| "learning_rate": 2.0951641526175688e-05, |
| "loss": 0.9605, |
| "mean_token_accuracy": 0.7512571468949318, |
| "num_tokens": 246778122.0, |
| "step": 2620 |
| }, |
| { |
| "entropy": 1.3785287618637085, |
| "epoch": 0.5835043540961784, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.084072759538598e-05, |
| "loss": 0.9729, |
| "mean_token_accuracy": 0.7481971070170402, |
| "num_tokens": 247718243.0, |
| "step": 2630 |
| }, |
| { |
| "entropy": 1.371111909300089, |
| "epoch": 0.5857230018303844, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.0729813664596272e-05, |
| "loss": 0.9659, |
| "mean_token_accuracy": 0.7520016901195049, |
| "num_tokens": 248674188.0, |
| "step": 2640 |
| }, |
| { |
| "entropy": 1.3743113353848457, |
| "epoch": 0.5879416495645904, |
| "grad_norm": 0.5234375, |
| "learning_rate": 2.0618899733806567e-05, |
| "loss": 0.9857, |
| "mean_token_accuracy": 0.7460017666220665, |
| "num_tokens": 249630785.0, |
| "step": 2650 |
| }, |
| { |
| "entropy": 1.3525418415665627, |
| "epoch": 0.5901602972987964, |
| "grad_norm": 0.51171875, |
| "learning_rate": 2.050798580301686e-05, |
| "loss": 0.951, |
| "mean_token_accuracy": 0.7526404090225697, |
| "num_tokens": 250583741.0, |
| "step": 2660 |
| }, |
| { |
| "entropy": 1.404486595094204, |
| "epoch": 0.5923789450330024, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.0397071872227152e-05, |
| "loss": 0.9612, |
| "mean_token_accuracy": 0.7494330175220967, |
| "num_tokens": 251500094.0, |
| "step": 2670 |
| }, |
| { |
| "entropy": 1.387998953461647, |
| "epoch": 0.5945975927672084, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.0286157941437444e-05, |
| "loss": 0.9929, |
| "mean_token_accuracy": 0.7457513011991977, |
| "num_tokens": 252449803.0, |
| "step": 2680 |
| }, |
| { |
| "entropy": 1.3362199790775775, |
| "epoch": 0.5968162405014144, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.0175244010647736e-05, |
| "loss": 0.9124, |
| "mean_token_accuracy": 0.7635637722909451, |
| "num_tokens": 253395680.0, |
| "step": 2690 |
| }, |
| { |
| "entropy": 1.4146859273314476, |
| "epoch": 0.5990348882356203, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.006433007985803e-05, |
| "loss": 0.9799, |
| "mean_token_accuracy": 0.7484463512897491, |
| "num_tokens": 254339264.0, |
| "step": 2700 |
| }, |
| { |
| "entropy": 1.3608046501874924, |
| "epoch": 0.6012535359698263, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.9953416149068324e-05, |
| "loss": 0.9673, |
| "mean_token_accuracy": 0.7515561901032924, |
| "num_tokens": 255290026.0, |
| "step": 2710 |
| }, |
| { |
| "entropy": 1.3799020916223526, |
| "epoch": 0.6034721837040324, |
| "grad_norm": 0.5859375, |
| "learning_rate": 1.9842502218278616e-05, |
| "loss": 0.9756, |
| "mean_token_accuracy": 0.7478848710656166, |
| "num_tokens": 256215452.0, |
| "step": 2720 |
| }, |
| { |
| "entropy": 1.3492946550250053, |
| "epoch": 0.6056908314382384, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.9731588287488908e-05, |
| "loss": 0.9311, |
| "mean_token_accuracy": 0.7583515666425228, |
| "num_tokens": 257169093.0, |
| "step": 2730 |
| }, |
| { |
| "entropy": 1.3475312367081642, |
| "epoch": 0.6079094791724444, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.9620674356699203e-05, |
| "loss": 0.9507, |
| "mean_token_accuracy": 0.7529344208538532, |
| "num_tokens": 258138135.0, |
| "step": 2740 |
| }, |
| { |
| "entropy": 1.3525680214166642, |
| "epoch": 0.6101281269066504, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.9509760425909496e-05, |
| "loss": 0.9509, |
| "mean_token_accuracy": 0.7542378917336464, |
| "num_tokens": 259109912.0, |
| "step": 2750 |
| }, |
| { |
| "entropy": 1.386097263544798, |
| "epoch": 0.6123467746408564, |
| "grad_norm": 0.50390625, |
| "learning_rate": 1.9398846495119788e-05, |
| "loss": 0.9542, |
| "mean_token_accuracy": 0.754255336523056, |
| "num_tokens": 260053220.0, |
| "step": 2760 |
| }, |
| { |
| "entropy": 1.3739720061421394, |
| "epoch": 0.6145654223750624, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.928793256433008e-05, |
| "loss": 0.9611, |
| "mean_token_accuracy": 0.7508481532335282, |
| "num_tokens": 260961630.0, |
| "step": 2770 |
| }, |
| { |
| "entropy": 1.3830955043435096, |
| "epoch": 0.6167840701092684, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.9177018633540372e-05, |
| "loss": 0.9857, |
| "mean_token_accuracy": 0.7444805398583412, |
| "num_tokens": 261881656.0, |
| "step": 2780 |
| }, |
| { |
| "entropy": 1.362017647176981, |
| "epoch": 0.6190027178434744, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.9066104702750667e-05, |
| "loss": 0.9689, |
| "mean_token_accuracy": 0.749096342921257, |
| "num_tokens": 262826457.0, |
| "step": 2790 |
| }, |
| { |
| "entropy": 1.3458002880215645, |
| "epoch": 0.6212213655776804, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.895519077196096e-05, |
| "loss": 0.9281, |
| "mean_token_accuracy": 0.7574586406350136, |
| "num_tokens": 263773429.0, |
| "step": 2800 |
| }, |
| { |
| "entropy": 1.3549387857317925, |
| "epoch": 0.6234400133118864, |
| "grad_norm": 0.5625, |
| "learning_rate": 1.8844276841171252e-05, |
| "loss": 0.9219, |
| "mean_token_accuracy": 0.7583517156541347, |
| "num_tokens": 264707730.0, |
| "step": 2810 |
| }, |
| { |
| "entropy": 1.3565895311534404, |
| "epoch": 0.6256586610460924, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.8733362910381544e-05, |
| "loss": 0.9368, |
| "mean_token_accuracy": 0.753548564761877, |
| "num_tokens": 265654078.0, |
| "step": 2820 |
| }, |
| { |
| "entropy": 1.3848047599196434, |
| "epoch": 0.6278773087802985, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.862244897959184e-05, |
| "loss": 0.975, |
| "mean_token_accuracy": 0.748593944311142, |
| "num_tokens": 266590424.0, |
| "step": 2830 |
| }, |
| { |
| "entropy": 1.3483957096934318, |
| "epoch": 0.6300959565145045, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.851153504880213e-05, |
| "loss": 0.9282, |
| "mean_token_accuracy": 0.7571537889540195, |
| "num_tokens": 267518833.0, |
| "step": 2840 |
| }, |
| { |
| "entropy": 1.3641344249248504, |
| "epoch": 0.6323146042487104, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.8400621118012424e-05, |
| "loss": 0.9605, |
| "mean_token_accuracy": 0.7526396319270134, |
| "num_tokens": 268449765.0, |
| "step": 2850 |
| }, |
| { |
| "entropy": 1.32438455671072, |
| "epoch": 0.6345332519829164, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.8289707187222716e-05, |
| "loss": 0.9202, |
| "mean_token_accuracy": 0.7574717938899994, |
| "num_tokens": 269378040.0, |
| "step": 2860 |
| }, |
| { |
| "entropy": 1.365363524854183, |
| "epoch": 0.6367518997171224, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.8178793256433008e-05, |
| "loss": 0.9444, |
| "mean_token_accuracy": 0.7561964854598046, |
| "num_tokens": 270314784.0, |
| "step": 2870 |
| }, |
| { |
| "entropy": 1.3871594324707985, |
| "epoch": 0.6389705474513284, |
| "grad_norm": 0.60546875, |
| "learning_rate": 1.8067879325643303e-05, |
| "loss": 0.9619, |
| "mean_token_accuracy": 0.7529800362884999, |
| "num_tokens": 271247351.0, |
| "step": 2880 |
| }, |
| { |
| "entropy": 1.403894129395485, |
| "epoch": 0.6411891951855344, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.7956965394853596e-05, |
| "loss": 0.9799, |
| "mean_token_accuracy": 0.7474908255040645, |
| "num_tokens": 272187504.0, |
| "step": 2890 |
| }, |
| { |
| "entropy": 1.373784029483795, |
| "epoch": 0.6434078429197404, |
| "grad_norm": 0.52734375, |
| "learning_rate": 1.7846051464063888e-05, |
| "loss": 0.9801, |
| "mean_token_accuracy": 0.7456812761723995, |
| "num_tokens": 273121065.0, |
| "step": 2900 |
| }, |
| { |
| "entropy": 1.4182383090257644, |
| "epoch": 0.6456264906539464, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.773513753327418e-05, |
| "loss": 1.0075, |
| "mean_token_accuracy": 0.7424289509654045, |
| "num_tokens": 274058083.0, |
| "step": 2910 |
| }, |
| { |
| "entropy": 1.3978426158428192, |
| "epoch": 0.6478451383881524, |
| "grad_norm": 0.5625, |
| "learning_rate": 1.7624223602484475e-05, |
| "loss": 0.9752, |
| "mean_token_accuracy": 0.7466619923710823, |
| "num_tokens": 274983318.0, |
| "step": 2920 |
| }, |
| { |
| "entropy": 1.3537883020937442, |
| "epoch": 0.6500637861223584, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.7513309671694767e-05, |
| "loss": 0.9218, |
| "mean_token_accuracy": 0.7595953151583672, |
| "num_tokens": 275920398.0, |
| "step": 2930 |
| }, |
| { |
| "entropy": 1.3750786110758781, |
| "epoch": 0.6522824338565644, |
| "grad_norm": 0.578125, |
| "learning_rate": 1.740239574090506e-05, |
| "loss": 0.9448, |
| "mean_token_accuracy": 0.7525995224714279, |
| "num_tokens": 276854958.0, |
| "step": 2940 |
| }, |
| { |
| "entropy": 1.3850456327199936, |
| "epoch": 0.6545010815907705, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.7291481810115352e-05, |
| "loss": 0.9803, |
| "mean_token_accuracy": 0.745450871437788, |
| "num_tokens": 277786978.0, |
| "step": 2950 |
| }, |
| { |
| "entropy": 1.3714064493775369, |
| "epoch": 0.6567197293249765, |
| "grad_norm": 0.55859375, |
| "learning_rate": 1.7180567879325644e-05, |
| "loss": 0.9651, |
| "mean_token_accuracy": 0.7489276170730591, |
| "num_tokens": 278730912.0, |
| "step": 2960 |
| }, |
| { |
| "entropy": 1.3698252201080323, |
| "epoch": 0.6589383770591825, |
| "grad_norm": 0.59765625, |
| "learning_rate": 1.706965394853594e-05, |
| "loss": 0.9651, |
| "mean_token_accuracy": 0.7497381448745728, |
| "num_tokens": 279665300.0, |
| "step": 2970 |
| }, |
| { |
| "entropy": 1.3747903369367123, |
| "epoch": 0.6611570247933884, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.695874001774623e-05, |
| "loss": 0.9628, |
| "mean_token_accuracy": 0.7499303415417671, |
| "num_tokens": 280618272.0, |
| "step": 2980 |
| }, |
| { |
| "entropy": 1.3819094851613045, |
| "epoch": 0.6633756725275944, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.6847826086956524e-05, |
| "loss": 0.9551, |
| "mean_token_accuracy": 0.7553550757467746, |
| "num_tokens": 281554536.0, |
| "step": 2990 |
| }, |
| { |
| "entropy": 1.3707010336220264, |
| "epoch": 0.6655943202618004, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.6736912156166816e-05, |
| "loss": 0.9655, |
| "mean_token_accuracy": 0.7515952527523041, |
| "num_tokens": 282504485.0, |
| "step": 3000 |
| }, |
| { |
| "entropy": 1.3754500553011895, |
| "epoch": 0.6678129679960064, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.6625998225377108e-05, |
| "loss": 0.9502, |
| "mean_token_accuracy": 0.7545687988400459, |
| "num_tokens": 283421042.0, |
| "step": 3010 |
| }, |
| { |
| "entropy": 1.392235305160284, |
| "epoch": 0.6700316157302124, |
| "grad_norm": 0.578125, |
| "learning_rate": 1.6515084294587403e-05, |
| "loss": 0.9632, |
| "mean_token_accuracy": 0.7509094551205635, |
| "num_tokens": 284360423.0, |
| "step": 3020 |
| }, |
| { |
| "entropy": 1.3561602622270583, |
| "epoch": 0.6722502634644184, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.6404170363797696e-05, |
| "loss": 0.9744, |
| "mean_token_accuracy": 0.7496522702276707, |
| "num_tokens": 285303033.0, |
| "step": 3030 |
| }, |
| { |
| "entropy": 1.362218789756298, |
| "epoch": 0.6744689111986244, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.6293256433007988e-05, |
| "loss": 0.9366, |
| "mean_token_accuracy": 0.7554511360824108, |
| "num_tokens": 286237138.0, |
| "step": 3040 |
| }, |
| { |
| "entropy": 1.366736714541912, |
| "epoch": 0.6766875589328304, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.618234250221828e-05, |
| "loss": 0.9805, |
| "mean_token_accuracy": 0.7496004432439805, |
| "num_tokens": 287158543.0, |
| "step": 3050 |
| }, |
| { |
| "entropy": 1.3793413534760475, |
| "epoch": 0.6789062066670365, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.6071428571428572e-05, |
| "loss": 0.9734, |
| "mean_token_accuracy": 0.7480289973318577, |
| "num_tokens": 288077419.0, |
| "step": 3060 |
| }, |
| { |
| "entropy": 1.3908205471932888, |
| "epoch": 0.6811248544012425, |
| "grad_norm": 0.50390625, |
| "learning_rate": 1.5960514640638864e-05, |
| "loss": 0.9812, |
| "mean_token_accuracy": 0.7471683271229267, |
| "num_tokens": 289027657.0, |
| "step": 3070 |
| }, |
| { |
| "entropy": 1.3779977604746818, |
| "epoch": 0.6833435021354485, |
| "grad_norm": 0.49609375, |
| "learning_rate": 1.5849600709849156e-05, |
| "loss": 0.9721, |
| "mean_token_accuracy": 0.7498278774321079, |
| "num_tokens": 289969226.0, |
| "step": 3080 |
| }, |
| { |
| "entropy": 1.3782277286052704, |
| "epoch": 0.6855621498696545, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.573868677905945e-05, |
| "loss": 0.9814, |
| "mean_token_accuracy": 0.7463328778743744, |
| "num_tokens": 290886120.0, |
| "step": 3090 |
| }, |
| { |
| "entropy": 1.366072203218937, |
| "epoch": 0.6877807976038605, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.5627772848269744e-05, |
| "loss": 0.9361, |
| "mean_token_accuracy": 0.7534136839210988, |
| "num_tokens": 291823611.0, |
| "step": 3100 |
| }, |
| { |
| "entropy": 1.393534542620182, |
| "epoch": 0.6899994453380665, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.5516858917480036e-05, |
| "loss": 0.9701, |
| "mean_token_accuracy": 0.7499865688383579, |
| "num_tokens": 292771710.0, |
| "step": 3110 |
| }, |
| { |
| "entropy": 1.3469060599803924, |
| "epoch": 0.6922180930722724, |
| "grad_norm": 0.55859375, |
| "learning_rate": 1.5405944986690328e-05, |
| "loss": 0.9529, |
| "mean_token_accuracy": 0.7520712472498416, |
| "num_tokens": 293710284.0, |
| "step": 3120 |
| }, |
| { |
| "entropy": 1.387193675339222, |
| "epoch": 0.6944367408064784, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.529503105590062e-05, |
| "loss": 0.9551, |
| "mean_token_accuracy": 0.7517340816557407, |
| "num_tokens": 294637424.0, |
| "step": 3130 |
| }, |
| { |
| "entropy": 1.3879702135920524, |
| "epoch": 0.6966553885406844, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.5184117125110914e-05, |
| "loss": 0.9713, |
| "mean_token_accuracy": 0.7498943455517292, |
| "num_tokens": 295552946.0, |
| "step": 3140 |
| }, |
| { |
| "entropy": 1.3521149441599847, |
| "epoch": 0.6988740362748904, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.5073203194321208e-05, |
| "loss": 0.9561, |
| "mean_token_accuracy": 0.7530835166573524, |
| "num_tokens": 296482856.0, |
| "step": 3150 |
| }, |
| { |
| "entropy": 1.3523337855935096, |
| "epoch": 0.7010926840090964, |
| "grad_norm": 0.5859375, |
| "learning_rate": 1.4962289263531502e-05, |
| "loss": 0.9482, |
| "mean_token_accuracy": 0.7535679526627064, |
| "num_tokens": 297414186.0, |
| "step": 3160 |
| }, |
| { |
| "entropy": 1.371672622859478, |
| "epoch": 0.7033113317433024, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.4851375332741794e-05, |
| "loss": 0.9547, |
| "mean_token_accuracy": 0.7499964490532876, |
| "num_tokens": 298378469.0, |
| "step": 3170 |
| }, |
| { |
| "entropy": 1.3734628334641457, |
| "epoch": 0.7055299794775085, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.4740461401952086e-05, |
| "loss": 0.9766, |
| "mean_token_accuracy": 0.7470006972551346, |
| "num_tokens": 299298648.0, |
| "step": 3180 |
| }, |
| { |
| "entropy": 1.3621489077806472, |
| "epoch": 0.7077486272117145, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.4629547471162378e-05, |
| "loss": 0.976, |
| "mean_token_accuracy": 0.7489259757101536, |
| "num_tokens": 300256274.0, |
| "step": 3190 |
| }, |
| { |
| "entropy": 1.3307632811367511, |
| "epoch": 0.7099672749459205, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.4518633540372672e-05, |
| "loss": 0.9264, |
| "mean_token_accuracy": 0.7602166160941124, |
| "num_tokens": 301216228.0, |
| "step": 3200 |
| }, |
| { |
| "entropy": 1.378267367184162, |
| "epoch": 0.7121859226801265, |
| "grad_norm": 0.5703125, |
| "learning_rate": 1.4407719609582964e-05, |
| "loss": 0.9933, |
| "mean_token_accuracy": 0.7443177163600921, |
| "num_tokens": 302148133.0, |
| "step": 3210 |
| }, |
| { |
| "entropy": 1.3858237951993941, |
| "epoch": 0.7144045704143325, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.4296805678793256e-05, |
| "loss": 0.9591, |
| "mean_token_accuracy": 0.75175336971879, |
| "num_tokens": 303092579.0, |
| "step": 3220 |
| }, |
| { |
| "entropy": 1.349436528980732, |
| "epoch": 0.7166232181485385, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.4185891748003548e-05, |
| "loss": 0.9678, |
| "mean_token_accuracy": 0.7483910910785199, |
| "num_tokens": 304045131.0, |
| "step": 3230 |
| }, |
| { |
| "entropy": 1.3605081930756568, |
| "epoch": 0.7188418658827445, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.4074977817213844e-05, |
| "loss": 0.9462, |
| "mean_token_accuracy": 0.7560873411595821, |
| "num_tokens": 305017251.0, |
| "step": 3240 |
| }, |
| { |
| "entropy": 1.3534643828868866, |
| "epoch": 0.7210605136169504, |
| "grad_norm": 0.5625, |
| "learning_rate": 1.3964063886424136e-05, |
| "loss": 0.926, |
| "mean_token_accuracy": 0.7599373154342175, |
| "num_tokens": 305959111.0, |
| "step": 3250 |
| }, |
| { |
| "entropy": 1.3700198411941529, |
| "epoch": 0.7232791613511564, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.3853149955634428e-05, |
| "loss": 0.9498, |
| "mean_token_accuracy": 0.7523197077214718, |
| "num_tokens": 306895226.0, |
| "step": 3260 |
| }, |
| { |
| "entropy": 1.36115460395813, |
| "epoch": 0.7254978090853624, |
| "grad_norm": 0.578125, |
| "learning_rate": 1.374223602484472e-05, |
| "loss": 0.9696, |
| "mean_token_accuracy": 0.7488263450562954, |
| "num_tokens": 307845938.0, |
| "step": 3270 |
| }, |
| { |
| "entropy": 1.3370314098894596, |
| "epoch": 0.7277164568195684, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.3631322094055012e-05, |
| "loss": 0.9092, |
| "mean_token_accuracy": 0.7618122868239879, |
| "num_tokens": 308778745.0, |
| "step": 3280 |
| }, |
| { |
| "entropy": 1.3687497057020663, |
| "epoch": 0.7299351045537745, |
| "grad_norm": 0.50390625, |
| "learning_rate": 1.3520408163265308e-05, |
| "loss": 0.9623, |
| "mean_token_accuracy": 0.75139045342803, |
| "num_tokens": 309737239.0, |
| "step": 3290 |
| }, |
| { |
| "entropy": 1.352933470904827, |
| "epoch": 0.7321537522879805, |
| "grad_norm": 0.56640625, |
| "learning_rate": 1.34094942324756e-05, |
| "loss": 0.9724, |
| "mean_token_accuracy": 0.7514422044157982, |
| "num_tokens": 310687853.0, |
| "step": 3300 |
| }, |
| { |
| "entropy": 1.400717096030712, |
| "epoch": 0.7343724000221865, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.3298580301685892e-05, |
| "loss": 1.0037, |
| "mean_token_accuracy": 0.7421482533216477, |
| "num_tokens": 311619002.0, |
| "step": 3310 |
| }, |
| { |
| "entropy": 1.3361869268119335, |
| "epoch": 0.7365910477563925, |
| "grad_norm": 0.578125, |
| "learning_rate": 1.3187666370896184e-05, |
| "loss": 0.9664, |
| "mean_token_accuracy": 0.7487700201570988, |
| "num_tokens": 312570005.0, |
| "step": 3320 |
| }, |
| { |
| "entropy": 1.3680378429591655, |
| "epoch": 0.7388096954905985, |
| "grad_norm": 0.5625, |
| "learning_rate": 1.3076752440106476e-05, |
| "loss": 0.9453, |
| "mean_token_accuracy": 0.753575050085783, |
| "num_tokens": 313510156.0, |
| "step": 3330 |
| }, |
| { |
| "entropy": 1.405937422066927, |
| "epoch": 0.7410283432248045, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.2965838509316772e-05, |
| "loss": 0.9661, |
| "mean_token_accuracy": 0.7477953679859638, |
| "num_tokens": 314441510.0, |
| "step": 3340 |
| }, |
| { |
| "entropy": 1.37651297301054, |
| "epoch": 0.7432469909590105, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.2854924578527064e-05, |
| "loss": 0.9893, |
| "mean_token_accuracy": 0.7443842552602291, |
| "num_tokens": 315396770.0, |
| "step": 3350 |
| }, |
| { |
| "entropy": 1.3754449300467968, |
| "epoch": 0.7454656386932165, |
| "grad_norm": 0.50390625, |
| "learning_rate": 1.2744010647737356e-05, |
| "loss": 0.9761, |
| "mean_token_accuracy": 0.746372677385807, |
| "num_tokens": 316364686.0, |
| "step": 3360 |
| }, |
| { |
| "entropy": 1.3677063122391702, |
| "epoch": 0.7476842864274225, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.2633096716947648e-05, |
| "loss": 0.9791, |
| "mean_token_accuracy": 0.747562813013792, |
| "num_tokens": 317297712.0, |
| "step": 3370 |
| }, |
| { |
| "entropy": 1.3510807111859322, |
| "epoch": 0.7499029341616285, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.2522182786157944e-05, |
| "loss": 0.9572, |
| "mean_token_accuracy": 0.7519927278161049, |
| "num_tokens": 318239974.0, |
| "step": 3380 |
| }, |
| { |
| "entropy": 1.3774001389741897, |
| "epoch": 0.7521215818958344, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.2411268855368236e-05, |
| "loss": 0.9716, |
| "mean_token_accuracy": 0.7503920882940293, |
| "num_tokens": 319176815.0, |
| "step": 3390 |
| }, |
| { |
| "entropy": 1.355586975067854, |
| "epoch": 0.7543402296300404, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.2300354924578528e-05, |
| "loss": 0.9653, |
| "mean_token_accuracy": 0.7494859971106053, |
| "num_tokens": 320142075.0, |
| "step": 3400 |
| }, |
| { |
| "entropy": 1.3683804802596569, |
| "epoch": 0.7565588773642465, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.218944099378882e-05, |
| "loss": 0.9564, |
| "mean_token_accuracy": 0.752348380535841, |
| "num_tokens": 321078125.0, |
| "step": 3410 |
| }, |
| { |
| "entropy": 1.3689906552433968, |
| "epoch": 0.7587775250984525, |
| "grad_norm": 0.56640625, |
| "learning_rate": 1.2078527062999114e-05, |
| "loss": 0.955, |
| "mean_token_accuracy": 0.7519045077264309, |
| "num_tokens": 321996511.0, |
| "step": 3420 |
| }, |
| { |
| "entropy": 1.3541745007038117, |
| "epoch": 0.7609961728326585, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.1967613132209406e-05, |
| "loss": 0.941, |
| "mean_token_accuracy": 0.7579099789261818, |
| "num_tokens": 322948179.0, |
| "step": 3430 |
| }, |
| { |
| "entropy": 1.3591908812522888, |
| "epoch": 0.7632148205668645, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.18566992014197e-05, |
| "loss": 0.964, |
| "mean_token_accuracy": 0.7525539971888066, |
| "num_tokens": 323912573.0, |
| "step": 3440 |
| }, |
| { |
| "entropy": 1.36717321947217, |
| "epoch": 0.7654334683010705, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.1745785270629992e-05, |
| "loss": 0.9484, |
| "mean_token_accuracy": 0.7522753067314625, |
| "num_tokens": 324848669.0, |
| "step": 3450 |
| }, |
| { |
| "entropy": 1.3821905687451363, |
| "epoch": 0.7676521160352765, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.1634871339840284e-05, |
| "loss": 0.9789, |
| "mean_token_accuracy": 0.7475393317639828, |
| "num_tokens": 325764593.0, |
| "step": 3460 |
| }, |
| { |
| "entropy": 1.3809657365083694, |
| "epoch": 0.7698707637694825, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.1523957409050576e-05, |
| "loss": 0.9433, |
| "mean_token_accuracy": 0.7541690699756145, |
| "num_tokens": 326728229.0, |
| "step": 3470 |
| }, |
| { |
| "entropy": 1.3609302565455437, |
| "epoch": 0.7720894115036885, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.141304347826087e-05, |
| "loss": 0.9323, |
| "mean_token_accuracy": 0.7568138137459754, |
| "num_tokens": 327666372.0, |
| "step": 3480 |
| }, |
| { |
| "entropy": 1.35459363758564, |
| "epoch": 0.7743080592378945, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.1302129547471162e-05, |
| "loss": 0.9626, |
| "mean_token_accuracy": 0.7514002807438374, |
| "num_tokens": 328589542.0, |
| "step": 3490 |
| }, |
| { |
| "entropy": 1.335961400717497, |
| "epoch": 0.7765267069721005, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.1191215616681455e-05, |
| "loss": 0.9327, |
| "mean_token_accuracy": 0.7580720439553261, |
| "num_tokens": 329542171.0, |
| "step": 3500 |
| }, |
| { |
| "entropy": 1.4132342591881752, |
| "epoch": 0.7787453547063065, |
| "grad_norm": 0.5625, |
| "learning_rate": 1.1080301685891748e-05, |
| "loss": 1.0189, |
| "mean_token_accuracy": 0.7392169758677483, |
| "num_tokens": 330481198.0, |
| "step": 3510 |
| }, |
| { |
| "entropy": 1.4080789655447006, |
| "epoch": 0.7809640024405126, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.096938775510204e-05, |
| "loss": 0.9954, |
| "mean_token_accuracy": 0.7450571835041047, |
| "num_tokens": 331406839.0, |
| "step": 3520 |
| }, |
| { |
| "entropy": 1.3507774248719215, |
| "epoch": 0.7831826501747186, |
| "grad_norm": 0.56640625, |
| "learning_rate": 1.0858473824312334e-05, |
| "loss": 0.939, |
| "mean_token_accuracy": 0.757654282450676, |
| "num_tokens": 332356653.0, |
| "step": 3530 |
| }, |
| { |
| "entropy": 1.3371329329907895, |
| "epoch": 0.7854012979089245, |
| "grad_norm": 0.58203125, |
| "learning_rate": 1.0747559893522626e-05, |
| "loss": 0.944, |
| "mean_token_accuracy": 0.7541753455996514, |
| "num_tokens": 333306767.0, |
| "step": 3540 |
| }, |
| { |
| "entropy": 1.3796106189489366, |
| "epoch": 0.7876199456431305, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.063664596273292e-05, |
| "loss": 0.976, |
| "mean_token_accuracy": 0.7494149960577488, |
| "num_tokens": 334267595.0, |
| "step": 3550 |
| }, |
| { |
| "entropy": 1.3886483326554298, |
| "epoch": 0.7898385933773365, |
| "grad_norm": 0.5703125, |
| "learning_rate": 1.0525732031943212e-05, |
| "loss": 0.9955, |
| "mean_token_accuracy": 0.745264695584774, |
| "num_tokens": 335211023.0, |
| "step": 3560 |
| }, |
| { |
| "entropy": 1.3904688894748687, |
| "epoch": 0.7920572411115425, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.0414818101153505e-05, |
| "loss": 0.9971, |
| "mean_token_accuracy": 0.7431247621774674, |
| "num_tokens": 336161592.0, |
| "step": 3570 |
| }, |
| { |
| "entropy": 1.3282628059387207, |
| "epoch": 0.7942758888457485, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.0303904170363798e-05, |
| "loss": 0.9194, |
| "mean_token_accuracy": 0.759865264594555, |
| "num_tokens": 337108472.0, |
| "step": 3580 |
| }, |
| { |
| "entropy": 1.3883577764034272, |
| "epoch": 0.7964945365799545, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.019299023957409e-05, |
| "loss": 0.9574, |
| "mean_token_accuracy": 0.7508158691227436, |
| "num_tokens": 338046556.0, |
| "step": 3590 |
| }, |
| { |
| "entropy": 1.354970221221447, |
| "epoch": 0.7987131843141605, |
| "grad_norm": 0.515625, |
| "learning_rate": 1.0082076308784384e-05, |
| "loss": 0.9428, |
| "mean_token_accuracy": 0.7563470520079136, |
| "num_tokens": 338995598.0, |
| "step": 3600 |
| }, |
| { |
| "entropy": 1.3790066853165626, |
| "epoch": 0.8009318320483665, |
| "grad_norm": 0.5390625, |
| "learning_rate": 9.971162377994676e-06, |
| "loss": 1.0013, |
| "mean_token_accuracy": 0.7433059230446816, |
| "num_tokens": 339946604.0, |
| "step": 3610 |
| }, |
| { |
| "entropy": 1.3680865824222566, |
| "epoch": 0.8031504797825725, |
| "grad_norm": 0.52734375, |
| "learning_rate": 9.86024844720497e-06, |
| "loss": 0.9482, |
| "mean_token_accuracy": 0.7530041396617889, |
| "num_tokens": 340865269.0, |
| "step": 3620 |
| }, |
| { |
| "entropy": 1.3551585905253887, |
| "epoch": 0.8053691275167785, |
| "grad_norm": 0.515625, |
| "learning_rate": 9.749334516415262e-06, |
| "loss": 0.9756, |
| "mean_token_accuracy": 0.749114916473627, |
| "num_tokens": 341821654.0, |
| "step": 3630 |
| }, |
| { |
| "entropy": 1.356984592974186, |
| "epoch": 0.8075877752509846, |
| "grad_norm": 0.515625, |
| "learning_rate": 9.638420585625555e-06, |
| "loss": 0.9269, |
| "mean_token_accuracy": 0.756236170232296, |
| "num_tokens": 342764886.0, |
| "step": 3640 |
| }, |
| { |
| "entropy": 1.4058508843183517, |
| "epoch": 0.8098064229851906, |
| "grad_norm": 0.5703125, |
| "learning_rate": 9.527506654835848e-06, |
| "loss": 0.9776, |
| "mean_token_accuracy": 0.7486060597002506, |
| "num_tokens": 343699361.0, |
| "step": 3650 |
| }, |
| { |
| "entropy": 1.4065939649939536, |
| "epoch": 0.8120250707193966, |
| "grad_norm": 0.5625, |
| "learning_rate": 9.41659272404614e-06, |
| "loss": 1.0093, |
| "mean_token_accuracy": 0.7410213641822339, |
| "num_tokens": 344637604.0, |
| "step": 3660 |
| }, |
| { |
| "entropy": 1.3512266606092453, |
| "epoch": 0.8142437184536025, |
| "grad_norm": 0.56640625, |
| "learning_rate": 9.305678793256434e-06, |
| "loss": 0.9506, |
| "mean_token_accuracy": 0.7549665696918965, |
| "num_tokens": 345590677.0, |
| "step": 3670 |
| }, |
| { |
| "entropy": 1.3379161387681962, |
| "epoch": 0.8164623661878085, |
| "grad_norm": 0.5234375, |
| "learning_rate": 9.194764862466726e-06, |
| "loss": 0.9331, |
| "mean_token_accuracy": 0.7561460591852665, |
| "num_tokens": 346534759.0, |
| "step": 3680 |
| }, |
| { |
| "entropy": 1.3927339702844619, |
| "epoch": 0.8186810139220145, |
| "grad_norm": 0.51171875, |
| "learning_rate": 9.08385093167702e-06, |
| "loss": 0.9591, |
| "mean_token_accuracy": 0.7537301577627659, |
| "num_tokens": 347455286.0, |
| "step": 3690 |
| }, |
| { |
| "entropy": 1.361009131371975, |
| "epoch": 0.8208996616562205, |
| "grad_norm": 0.546875, |
| "learning_rate": 8.972937000887312e-06, |
| "loss": 0.9464, |
| "mean_token_accuracy": 0.7557949997484684, |
| "num_tokens": 348401567.0, |
| "step": 3700 |
| }, |
| { |
| "entropy": 1.384497131407261, |
| "epoch": 0.8231183093904265, |
| "grad_norm": 0.578125, |
| "learning_rate": 8.862023070097605e-06, |
| "loss": 0.9803, |
| "mean_token_accuracy": 0.7466384552419185, |
| "num_tokens": 349334391.0, |
| "step": 3710 |
| }, |
| { |
| "entropy": 1.3447816006839275, |
| "epoch": 0.8253369571246325, |
| "grad_norm": 0.515625, |
| "learning_rate": 8.751109139307898e-06, |
| "loss": 0.9436, |
| "mean_token_accuracy": 0.7561516091227531, |
| "num_tokens": 350312604.0, |
| "step": 3720 |
| }, |
| { |
| "entropy": 1.3593414321541786, |
| "epoch": 0.8275556048588385, |
| "grad_norm": 0.5234375, |
| "learning_rate": 8.64019520851819e-06, |
| "loss": 0.9526, |
| "mean_token_accuracy": 0.7559100404381752, |
| "num_tokens": 351273912.0, |
| "step": 3730 |
| }, |
| { |
| "entropy": 1.3611069664359092, |
| "epoch": 0.8297742525930445, |
| "grad_norm": 0.55078125, |
| "learning_rate": 8.529281277728483e-06, |
| "loss": 0.9619, |
| "mean_token_accuracy": 0.7522155269980431, |
| "num_tokens": 352217449.0, |
| "step": 3740 |
| }, |
| { |
| "entropy": 1.3875371009111404, |
| "epoch": 0.8319929003272506, |
| "grad_norm": 0.5703125, |
| "learning_rate": 8.418367346938775e-06, |
| "loss": 0.9683, |
| "mean_token_accuracy": 0.7485638290643692, |
| "num_tokens": 353168090.0, |
| "step": 3750 |
| }, |
| { |
| "entropy": 1.3669875219464303, |
| "epoch": 0.8342115480614566, |
| "grad_norm": 0.55078125, |
| "learning_rate": 8.307453416149069e-06, |
| "loss": 0.9634, |
| "mean_token_accuracy": 0.7502586752176285, |
| "num_tokens": 354122430.0, |
| "step": 3760 |
| }, |
| { |
| "entropy": 1.3453943833708764, |
| "epoch": 0.8364301957956626, |
| "grad_norm": 0.55859375, |
| "learning_rate": 8.19653948535936e-06, |
| "loss": 0.9529, |
| "mean_token_accuracy": 0.7517515823245049, |
| "num_tokens": 355065338.0, |
| "step": 3770 |
| }, |
| { |
| "entropy": 1.3437988623976707, |
| "epoch": 0.8386488435298686, |
| "grad_norm": 0.5703125, |
| "learning_rate": 8.085625554569655e-06, |
| "loss": 0.9273, |
| "mean_token_accuracy": 0.7580426350235939, |
| "num_tokens": 355995716.0, |
| "step": 3780 |
| }, |
| { |
| "entropy": 1.3949485182762147, |
| "epoch": 0.8408674912640746, |
| "grad_norm": 0.51171875, |
| "learning_rate": 7.974711623779947e-06, |
| "loss": 0.9666, |
| "mean_token_accuracy": 0.7470616512000561, |
| "num_tokens": 356919067.0, |
| "step": 3790 |
| }, |
| { |
| "entropy": 1.3033222988247872, |
| "epoch": 0.8430861389982806, |
| "grad_norm": 0.48828125, |
| "learning_rate": 7.863797692990239e-06, |
| "loss": 0.9066, |
| "mean_token_accuracy": 0.7628800176084042, |
| "num_tokens": 357848380.0, |
| "step": 3800 |
| }, |
| { |
| "entropy": 1.389954724907875, |
| "epoch": 0.8453047867324865, |
| "grad_norm": 0.5546875, |
| "learning_rate": 7.752883762200533e-06, |
| "loss": 0.9835, |
| "mean_token_accuracy": 0.7488750971853733, |
| "num_tokens": 358798462.0, |
| "step": 3810 |
| }, |
| { |
| "entropy": 1.3484379634261132, |
| "epoch": 0.8475234344666925, |
| "grad_norm": 0.6015625, |
| "learning_rate": 7.641969831410825e-06, |
| "loss": 0.9511, |
| "mean_token_accuracy": 0.7518211953341961, |
| "num_tokens": 359760891.0, |
| "step": 3820 |
| }, |
| { |
| "entropy": 1.3600559674203396, |
| "epoch": 0.8497420822008985, |
| "grad_norm": 0.5, |
| "learning_rate": 7.5310559006211186e-06, |
| "loss": 0.945, |
| "mean_token_accuracy": 0.7558806143701077, |
| "num_tokens": 360727038.0, |
| "step": 3830 |
| }, |
| { |
| "entropy": 1.374285238981247, |
| "epoch": 0.8519607299351045, |
| "grad_norm": 0.55078125, |
| "learning_rate": 7.420141969831411e-06, |
| "loss": 0.9654, |
| "mean_token_accuracy": 0.7507951468229294, |
| "num_tokens": 361664062.0, |
| "step": 3840 |
| }, |
| { |
| "entropy": 1.3751945488154889, |
| "epoch": 0.8541793776693105, |
| "grad_norm": 0.51171875, |
| "learning_rate": 7.3092280390417045e-06, |
| "loss": 0.9759, |
| "mean_token_accuracy": 0.7493015758693218, |
| "num_tokens": 362581685.0, |
| "step": 3850 |
| }, |
| { |
| "entropy": 1.342698210477829, |
| "epoch": 0.8563980254035165, |
| "grad_norm": 0.5390625, |
| "learning_rate": 7.198314108251997e-06, |
| "loss": 0.9397, |
| "mean_token_accuracy": 0.7556280843913555, |
| "num_tokens": 363493172.0, |
| "step": 3860 |
| }, |
| { |
| "entropy": 1.3486001171171664, |
| "epoch": 0.8586166731377226, |
| "grad_norm": 0.5078125, |
| "learning_rate": 7.0874001774622905e-06, |
| "loss": 0.9397, |
| "mean_token_accuracy": 0.7553956717252731, |
| "num_tokens": 364446944.0, |
| "step": 3870 |
| }, |
| { |
| "entropy": 1.3552488908171654, |
| "epoch": 0.8608353208719286, |
| "grad_norm": 0.5234375, |
| "learning_rate": 6.976486246672583e-06, |
| "loss": 0.9279, |
| "mean_token_accuracy": 0.7601940959692002, |
| "num_tokens": 365374033.0, |
| "step": 3880 |
| }, |
| { |
| "entropy": 1.3852377466857433, |
| "epoch": 0.8630539686061346, |
| "grad_norm": 0.53515625, |
| "learning_rate": 6.865572315882875e-06, |
| "loss": 0.9508, |
| "mean_token_accuracy": 0.7540732339024544, |
| "num_tokens": 366289679.0, |
| "step": 3890 |
| }, |
| { |
| "entropy": 1.407871701568365, |
| "epoch": 0.8652726163403406, |
| "grad_norm": 0.5703125, |
| "learning_rate": 6.7546583850931686e-06, |
| "loss": 0.988, |
| "mean_token_accuracy": 0.7453559413552284, |
| "num_tokens": 367201731.0, |
| "step": 3900 |
| }, |
| { |
| "entropy": 1.3759823389351369, |
| "epoch": 0.8674912640745466, |
| "grad_norm": 0.54296875, |
| "learning_rate": 6.643744454303461e-06, |
| "loss": 0.9877, |
| "mean_token_accuracy": 0.7446005560457707, |
| "num_tokens": 368157287.0, |
| "step": 3910 |
| }, |
| { |
| "entropy": 1.3594166025519372, |
| "epoch": 0.8697099118087526, |
| "grad_norm": 0.54296875, |
| "learning_rate": 6.532830523513754e-06, |
| "loss": 0.9371, |
| "mean_token_accuracy": 0.7575969822704792, |
| "num_tokens": 369106919.0, |
| "step": 3920 |
| }, |
| { |
| "entropy": 1.393234833329916, |
| "epoch": 0.8719285595429586, |
| "grad_norm": 0.546875, |
| "learning_rate": 6.421916592724047e-06, |
| "loss": 0.9807, |
| "mean_token_accuracy": 0.7484029091894626, |
| "num_tokens": 370021686.0, |
| "step": 3930 |
| }, |
| { |
| "entropy": 1.3949926882982253, |
| "epoch": 0.8741472072771646, |
| "grad_norm": 0.625, |
| "learning_rate": 6.31100266193434e-06, |
| "loss": 0.9844, |
| "mean_token_accuracy": 0.7442330025136471, |
| "num_tokens": 370953193.0, |
| "step": 3940 |
| }, |
| { |
| "entropy": 1.3483674347400665, |
| "epoch": 0.8763658550113705, |
| "grad_norm": 0.53515625, |
| "learning_rate": 6.200088731144632e-06, |
| "loss": 0.9234, |
| "mean_token_accuracy": 0.7595080114901066, |
| "num_tokens": 371877002.0, |
| "step": 3950 |
| }, |
| { |
| "entropy": 1.3709127485752106, |
| "epoch": 0.8785845027455765, |
| "grad_norm": 0.51953125, |
| "learning_rate": 6.089174800354925e-06, |
| "loss": 0.9568, |
| "mean_token_accuracy": 0.7525337472558021, |
| "num_tokens": 372834751.0, |
| "step": 3960 |
| }, |
| { |
| "entropy": 1.3546331241726874, |
| "epoch": 0.8808031504797825, |
| "grad_norm": 0.5390625, |
| "learning_rate": 5.978260869565218e-06, |
| "loss": 0.9494, |
| "mean_token_accuracy": 0.7507483690977097, |
| "num_tokens": 373775771.0, |
| "step": 3970 |
| }, |
| { |
| "entropy": 1.332931426167488, |
| "epoch": 0.8830217982139886, |
| "grad_norm": 0.5078125, |
| "learning_rate": 5.867346938775511e-06, |
| "loss": 0.9509, |
| "mean_token_accuracy": 0.7548811562359333, |
| "num_tokens": 374731469.0, |
| "step": 3980 |
| }, |
| { |
| "entropy": 1.3545904070138932, |
| "epoch": 0.8852404459481946, |
| "grad_norm": 0.53515625, |
| "learning_rate": 5.756433007985803e-06, |
| "loss": 0.9417, |
| "mean_token_accuracy": 0.7551537476480007, |
| "num_tokens": 375675543.0, |
| "step": 3990 |
| }, |
| { |
| "entropy": 1.4011170595884324, |
| "epoch": 0.8874590936824006, |
| "grad_norm": 0.53125, |
| "learning_rate": 5.645519077196096e-06, |
| "loss": 0.9928, |
| "mean_token_accuracy": 0.7440803252160549, |
| "num_tokens": 376595094.0, |
| "step": 4000 |
| }, |
| { |
| "entropy": 1.3567784875631332, |
| "epoch": 0.8896777414166066, |
| "grad_norm": 0.53515625, |
| "learning_rate": 5.534605146406389e-06, |
| "loss": 0.9633, |
| "mean_token_accuracy": 0.7499005250632763, |
| "num_tokens": 377563516.0, |
| "step": 4010 |
| }, |
| { |
| "entropy": 1.3843678832054138, |
| "epoch": 0.8918963891508126, |
| "grad_norm": 0.56640625, |
| "learning_rate": 5.423691215616682e-06, |
| "loss": 0.9594, |
| "mean_token_accuracy": 0.7517636835575103, |
| "num_tokens": 378480786.0, |
| "step": 4020 |
| }, |
| { |
| "entropy": 1.3298022344708442, |
| "epoch": 0.8941150368850186, |
| "grad_norm": 0.5234375, |
| "learning_rate": 5.312777284826975e-06, |
| "loss": 0.9377, |
| "mean_token_accuracy": 0.7552124336361885, |
| "num_tokens": 379442068.0, |
| "step": 4030 |
| }, |
| { |
| "entropy": 1.3667471811175347, |
| "epoch": 0.8963336846192246, |
| "grad_norm": 0.55859375, |
| "learning_rate": 5.201863354037268e-06, |
| "loss": 0.9467, |
| "mean_token_accuracy": 0.7546268843114377, |
| "num_tokens": 380376120.0, |
| "step": 4040 |
| }, |
| { |
| "entropy": 1.382226860523224, |
| "epoch": 0.8985523323534306, |
| "grad_norm": 0.53125, |
| "learning_rate": 5.090949423247561e-06, |
| "loss": 0.9702, |
| "mean_token_accuracy": 0.7500215657055378, |
| "num_tokens": 381345861.0, |
| "step": 4050 |
| }, |
| { |
| "entropy": 1.3708786077797412, |
| "epoch": 0.9007709800876366, |
| "grad_norm": 0.52734375, |
| "learning_rate": 4.980035492457853e-06, |
| "loss": 0.9718, |
| "mean_token_accuracy": 0.7496377937495708, |
| "num_tokens": 382291775.0, |
| "step": 4060 |
| }, |
| { |
| "entropy": 1.3532396875321866, |
| "epoch": 0.9029896278218426, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.869121561668146e-06, |
| "loss": 0.9282, |
| "mean_token_accuracy": 0.7588274158537388, |
| "num_tokens": 383216309.0, |
| "step": 4070 |
| }, |
| { |
| "entropy": 1.3610619880259036, |
| "epoch": 0.9052082755560485, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.758207630878438e-06, |
| "loss": 0.948, |
| "mean_token_accuracy": 0.751985190808773, |
| "num_tokens": 384155565.0, |
| "step": 4080 |
| }, |
| { |
| "entropy": 1.371240922808647, |
| "epoch": 0.9074269232902545, |
| "grad_norm": 0.6015625, |
| "learning_rate": 4.647293700088731e-06, |
| "loss": 0.9647, |
| "mean_token_accuracy": 0.7506447650492192, |
| "num_tokens": 385092338.0, |
| "step": 4090 |
| }, |
| { |
| "entropy": 1.3659679263830184, |
| "epoch": 0.9096455710244606, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.536379769299024e-06, |
| "loss": 0.9308, |
| "mean_token_accuracy": 0.7565632097423076, |
| "num_tokens": 386018707.0, |
| "step": 4100 |
| }, |
| { |
| "entropy": 1.3694222941994667, |
| "epoch": 0.9118642187586666, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.425465838509317e-06, |
| "loss": 0.9536, |
| "mean_token_accuracy": 0.7497854404151439, |
| "num_tokens": 386966791.0, |
| "step": 4110 |
| }, |
| { |
| "entropy": 1.3574039578437804, |
| "epoch": 0.9140828664928726, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.31455190771961e-06, |
| "loss": 0.9307, |
| "mean_token_accuracy": 0.7579091049730777, |
| "num_tokens": 387920492.0, |
| "step": 4120 |
| }, |
| { |
| "entropy": 1.3476274512708186, |
| "epoch": 0.9163015142270786, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.203637976929903e-06, |
| "loss": 0.9241, |
| "mean_token_accuracy": 0.7589688062667846, |
| "num_tokens": 388854075.0, |
| "step": 4130 |
| }, |
| { |
| "entropy": 1.3659275747835635, |
| "epoch": 0.9185201619612846, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.092724046140196e-06, |
| "loss": 0.9399, |
| "mean_token_accuracy": 0.7546637378633022, |
| "num_tokens": 389816530.0, |
| "step": 4140 |
| }, |
| { |
| "entropy": 1.3457153633236885, |
| "epoch": 0.9207388096954906, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.981810115350488e-06, |
| "loss": 0.9522, |
| "mean_token_accuracy": 0.7542778737843037, |
| "num_tokens": 390762015.0, |
| "step": 4150 |
| }, |
| { |
| "entropy": 1.3396061316132546, |
| "epoch": 0.9229574574296966, |
| "grad_norm": 0.51953125, |
| "learning_rate": 3.870896184560781e-06, |
| "loss": 0.918, |
| "mean_token_accuracy": 0.7604689553380013, |
| "num_tokens": 391706436.0, |
| "step": 4160 |
| }, |
| { |
| "entropy": 1.3485943019390105, |
| "epoch": 0.9251761051639026, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.759982253771074e-06, |
| "loss": 0.9313, |
| "mean_token_accuracy": 0.7574250407516956, |
| "num_tokens": 392643198.0, |
| "step": 4170 |
| }, |
| { |
| "entropy": 1.3615098975598812, |
| "epoch": 0.9273947528981086, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.6490683229813664e-06, |
| "loss": 0.9508, |
| "mean_token_accuracy": 0.7551313415169716, |
| "num_tokens": 393583331.0, |
| "step": 4180 |
| }, |
| { |
| "entropy": 1.3367910474538802, |
| "epoch": 0.9296134006323146, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.5381543921916594e-06, |
| "loss": 0.9386, |
| "mean_token_accuracy": 0.7580363132059574, |
| "num_tokens": 394527996.0, |
| "step": 4190 |
| }, |
| { |
| "entropy": 1.3829244390130042, |
| "epoch": 0.9318320483665206, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.4272404614019524e-06, |
| "loss": 0.9577, |
| "mean_token_accuracy": 0.7513498887419701, |
| "num_tokens": 395466130.0, |
| "step": 4200 |
| }, |
| { |
| "entropy": 1.3731888599693776, |
| "epoch": 0.9340506961007266, |
| "grad_norm": 0.51953125, |
| "learning_rate": 3.3163265306122454e-06, |
| "loss": 0.9611, |
| "mean_token_accuracy": 0.7499692045152188, |
| "num_tokens": 396395021.0, |
| "step": 4210 |
| }, |
| { |
| "entropy": 1.362666630744934, |
| "epoch": 0.9362693438349327, |
| "grad_norm": 0.5, |
| "learning_rate": 3.2054125998225384e-06, |
| "loss": 0.9688, |
| "mean_token_accuracy": 0.7498237736523151, |
| "num_tokens": 397343890.0, |
| "step": 4220 |
| }, |
| { |
| "entropy": 1.3288205087184906, |
| "epoch": 0.9384879915691386, |
| "grad_norm": 0.5078125, |
| "learning_rate": 3.094498669032831e-06, |
| "loss": 0.952, |
| "mean_token_accuracy": 0.7533118993043899, |
| "num_tokens": 398301341.0, |
| "step": 4230 |
| }, |
| { |
| "entropy": 1.3533720336854458, |
| "epoch": 0.9407066393033446, |
| "grad_norm": 0.53125, |
| "learning_rate": 2.9835847382431235e-06, |
| "loss": 0.9607, |
| "mean_token_accuracy": 0.7517400912940502, |
| "num_tokens": 399254773.0, |
| "step": 4240 |
| }, |
| { |
| "entropy": 1.3874829396605493, |
| "epoch": 0.9429252870375506, |
| "grad_norm": 0.6171875, |
| "learning_rate": 2.872670807453416e-06, |
| "loss": 0.9556, |
| "mean_token_accuracy": 0.7532159611582756, |
| "num_tokens": 400185915.0, |
| "step": 4250 |
| }, |
| { |
| "entropy": 1.3642595566809177, |
| "epoch": 0.9451439347717566, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.761756876663709e-06, |
| "loss": 0.9599, |
| "mean_token_accuracy": 0.7520182691514492, |
| "num_tokens": 401121244.0, |
| "step": 4260 |
| }, |
| { |
| "entropy": 1.3642713360488414, |
| "epoch": 0.9473625825059626, |
| "grad_norm": 0.5703125, |
| "learning_rate": 2.650842945874002e-06, |
| "loss": 0.9425, |
| "mean_token_accuracy": 0.7533236473798752, |
| "num_tokens": 402076727.0, |
| "step": 4270 |
| }, |
| { |
| "entropy": 1.3315014272928238, |
| "epoch": 0.9495812302401686, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.539929015084295e-06, |
| "loss": 0.9102, |
| "mean_token_accuracy": 0.7610321864485741, |
| "num_tokens": 403021321.0, |
| "step": 4280 |
| }, |
| { |
| "entropy": 1.3721179209649563, |
| "epoch": 0.9517998779743746, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.4290150842945875e-06, |
| "loss": 0.9614, |
| "mean_token_accuracy": 0.7502239882946015, |
| "num_tokens": 403977566.0, |
| "step": 4290 |
| }, |
| { |
| "entropy": 1.3569226145744324, |
| "epoch": 0.9540185257085806, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.3181011535048805e-06, |
| "loss": 0.9332, |
| "mean_token_accuracy": 0.7586277812719345, |
| "num_tokens": 404906178.0, |
| "step": 4300 |
| }, |
| { |
| "entropy": 1.3908393040299416, |
| "epoch": 0.9562371734427866, |
| "grad_norm": 0.51953125, |
| "learning_rate": 2.207187222715173e-06, |
| "loss": 0.9475, |
| "mean_token_accuracy": 0.7541873648762702, |
| "num_tokens": 405837119.0, |
| "step": 4310 |
| }, |
| { |
| "entropy": 1.3411194518208505, |
| "epoch": 0.9584558211769926, |
| "grad_norm": 0.50390625, |
| "learning_rate": 2.096273291925466e-06, |
| "loss": 0.9392, |
| "mean_token_accuracy": 0.753732743114233, |
| "num_tokens": 406764129.0, |
| "step": 4320 |
| }, |
| { |
| "entropy": 1.3665377825498581, |
| "epoch": 0.9606744689111987, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.9853593611357586e-06, |
| "loss": 0.9762, |
| "mean_token_accuracy": 0.7461372949182987, |
| "num_tokens": 407691279.0, |
| "step": 4330 |
| }, |
| { |
| "entropy": 1.3637786209583282, |
| "epoch": 0.9628931166454047, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.8744454303460516e-06, |
| "loss": 0.9611, |
| "mean_token_accuracy": 0.7504919424653054, |
| "num_tokens": 408649779.0, |
| "step": 4340 |
| }, |
| { |
| "entropy": 1.344110856950283, |
| "epoch": 0.9651117643796107, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.7635314995563443e-06, |
| "loss": 0.9197, |
| "mean_token_accuracy": 0.7596047796308995, |
| "num_tokens": 409584005.0, |
| "step": 4350 |
| }, |
| { |
| "entropy": 1.4125637419521808, |
| "epoch": 0.9673304121138167, |
| "grad_norm": 0.52734375, |
| "learning_rate": 1.6526175687666373e-06, |
| "loss": 1.0056, |
| "mean_token_accuracy": 0.742132543027401, |
| "num_tokens": 410519889.0, |
| "step": 4360 |
| }, |
| { |
| "entropy": 1.3275214530527593, |
| "epoch": 0.9695490598480226, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.54170363797693e-06, |
| "loss": 0.9404, |
| "mean_token_accuracy": 0.7535249203443527, |
| "num_tokens": 411477556.0, |
| "step": 4370 |
| }, |
| { |
| "entropy": 1.3909116253256797, |
| "epoch": 0.9717677075822286, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.4307897071872228e-06, |
| "loss": 0.9646, |
| "mean_token_accuracy": 0.7525069527328014, |
| "num_tokens": 412423884.0, |
| "step": 4380 |
| }, |
| { |
| "entropy": 1.3520725175738335, |
| "epoch": 0.9739863553164346, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.3198757763975156e-06, |
| "loss": 0.9441, |
| "mean_token_accuracy": 0.7545062087476253, |
| "num_tokens": 413354815.0, |
| "step": 4390 |
| }, |
| { |
| "entropy": 1.3621721930801869, |
| "epoch": 0.9762050030506406, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.2089618456078084e-06, |
| "loss": 0.9569, |
| "mean_token_accuracy": 0.753555228561163, |
| "num_tokens": 414289518.0, |
| "step": 4400 |
| }, |
| { |
| "entropy": 1.3933924958109856, |
| "epoch": 0.9784236507848466, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.0980479148181013e-06, |
| "loss": 0.9916, |
| "mean_token_accuracy": 0.744612629711628, |
| "num_tokens": 415241454.0, |
| "step": 4410 |
| }, |
| { |
| "entropy": 1.3613307520747184, |
| "epoch": 0.9806422985190526, |
| "grad_norm": 0.486328125, |
| "learning_rate": 9.871339840283939e-07, |
| "loss": 0.9521, |
| "mean_token_accuracy": 0.7509805023670196, |
| "num_tokens": 416207581.0, |
| "step": 4420 |
| }, |
| { |
| "entropy": 1.3690778270363808, |
| "epoch": 0.9828609462532586, |
| "grad_norm": 0.5703125, |
| "learning_rate": 8.762200532386869e-07, |
| "loss": 0.9696, |
| "mean_token_accuracy": 0.7491403892636299, |
| "num_tokens": 417155162.0, |
| "step": 4430 |
| }, |
| { |
| "entropy": 1.350597658008337, |
| "epoch": 0.9850795939874646, |
| "grad_norm": 0.5390625, |
| "learning_rate": 7.653061224489796e-07, |
| "loss": 0.9432, |
| "mean_token_accuracy": 0.7551806442439556, |
| "num_tokens": 418126381.0, |
| "step": 4440 |
| }, |
| { |
| "entropy": 1.3831326559185981, |
| "epoch": 0.9872982417216707, |
| "grad_norm": 0.57421875, |
| "learning_rate": 6.543921916592724e-07, |
| "loss": 0.9717, |
| "mean_token_accuracy": 0.7482082195580005, |
| "num_tokens": 419064900.0, |
| "step": 4450 |
| }, |
| { |
| "entropy": 1.3672489911317824, |
| "epoch": 0.9895168894558767, |
| "grad_norm": 0.53125, |
| "learning_rate": 5.434782608695653e-07, |
| "loss": 0.9243, |
| "mean_token_accuracy": 0.7583662681281567, |
| "num_tokens": 420001310.0, |
| "step": 4460 |
| }, |
| { |
| "entropy": 1.3730630218982696, |
| "epoch": 0.9917355371900827, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.3256433007985804e-07, |
| "loss": 0.9561, |
| "mean_token_accuracy": 0.7527363084256649, |
| "num_tokens": 420932440.0, |
| "step": 4470 |
| }, |
| { |
| "entropy": 1.4036599799990654, |
| "epoch": 0.9939541849242887, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.2165039929015086e-07, |
| "loss": 0.9956, |
| "mean_token_accuracy": 0.7449633993208409, |
| "num_tokens": 421870068.0, |
| "step": 4480 |
| }, |
| { |
| "entropy": 1.3779713824391364, |
| "epoch": 0.9961728326584947, |
| "grad_norm": 0.5, |
| "learning_rate": 2.1073646850044365e-07, |
| "loss": 0.9726, |
| "mean_token_accuracy": 0.7501424111425876, |
| "num_tokens": 422814597.0, |
| "step": 4490 |
| }, |
| { |
| "entropy": 1.4002000510692596, |
| "epoch": 0.9983914803927006, |
| "grad_norm": 0.5546875, |
| "learning_rate": 9.982253771073646e-08, |
| "loss": 0.9774, |
| "mean_token_accuracy": 0.7493771456182003, |
| "num_tokens": 423759552.0, |
| "step": 4500 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 4508, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 5.664801045092499e+18, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|