| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 500, |
| "global_step": 4508, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "entropy": 1.4996726989746094, |
| "epoch": 0.0022186477342060014, |
| "grad_norm": 0.640625, |
| "learning_rate": 4.990017746228927e-05, |
| "loss": 1.1004, |
| "mean_token_accuracy": 0.7237629115581512, |
| "num_tokens": 909841.0, |
| "step": 10 |
| }, |
| { |
| "entropy": 1.4749152779579162, |
| "epoch": 0.004437295468412003, |
| "grad_norm": 0.609375, |
| "learning_rate": 4.978926353149956e-05, |
| "loss": 1.101, |
| "mean_token_accuracy": 0.7234805017709732, |
| "num_tokens": 1834174.0, |
| "step": 20 |
| }, |
| { |
| "entropy": 1.4161717116832733, |
| "epoch": 0.006655943202618004, |
| "grad_norm": 0.58203125, |
| "learning_rate": 4.967834960070985e-05, |
| "loss": 1.0533, |
| "mean_token_accuracy": 0.7340411610901356, |
| "num_tokens": 2779537.0, |
| "step": 30 |
| }, |
| { |
| "entropy": 1.4273382410407067, |
| "epoch": 0.008874590936824005, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.9567435669920145e-05, |
| "loss": 1.0489, |
| "mean_token_accuracy": 0.7345465816557407, |
| "num_tokens": 3733014.0, |
| "step": 40 |
| }, |
| { |
| "entropy": 1.414509892463684, |
| "epoch": 0.011093238671030008, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.945652173913044e-05, |
| "loss": 1.0496, |
| "mean_token_accuracy": 0.7320007584989071, |
| "num_tokens": 4694268.0, |
| "step": 50 |
| }, |
| { |
| "entropy": 1.397396445274353, |
| "epoch": 0.013311886405236008, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.934560780834073e-05, |
| "loss": 1.0067, |
| "mean_token_accuracy": 0.7418178603053093, |
| "num_tokens": 5617442.0, |
| "step": 60 |
| }, |
| { |
| "entropy": 1.4162584945559502, |
| "epoch": 0.01553053413944201, |
| "grad_norm": 0.59765625, |
| "learning_rate": 4.923469387755102e-05, |
| "loss": 1.0315, |
| "mean_token_accuracy": 0.7393374048173428, |
| "num_tokens": 6545669.0, |
| "step": 70 |
| }, |
| { |
| "entropy": 1.3941649526357651, |
| "epoch": 0.01774918187364801, |
| "grad_norm": 0.67578125, |
| "learning_rate": 4.9123779946761314e-05, |
| "loss": 1.0467, |
| "mean_token_accuracy": 0.7343609191477298, |
| "num_tokens": 7508566.0, |
| "step": 80 |
| }, |
| { |
| "entropy": 1.4546006247401237, |
| "epoch": 0.019967829607854013, |
| "grad_norm": 0.58203125, |
| "learning_rate": 4.9012866015971606e-05, |
| "loss": 1.0777, |
| "mean_token_accuracy": 0.7278525292873382, |
| "num_tokens": 8457985.0, |
| "step": 90 |
| }, |
| { |
| "entropy": 1.4280843511223793, |
| "epoch": 0.022186477342060015, |
| "grad_norm": 0.6328125, |
| "learning_rate": 4.8901952085181905e-05, |
| "loss": 1.0605, |
| "mean_token_accuracy": 0.7319539472460747, |
| "num_tokens": 9401548.0, |
| "step": 100 |
| }, |
| { |
| "entropy": 1.4251440301537515, |
| "epoch": 0.024405125076266018, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.87910381543922e-05, |
| "loss": 1.0505, |
| "mean_token_accuracy": 0.7344287090003491, |
| "num_tokens": 10343177.0, |
| "step": 110 |
| }, |
| { |
| "entropy": 1.3903976306319237, |
| "epoch": 0.026623772810472016, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.868012422360249e-05, |
| "loss": 1.012, |
| "mean_token_accuracy": 0.7406081691384315, |
| "num_tokens": 11262171.0, |
| "step": 120 |
| }, |
| { |
| "entropy": 1.4572355687618255, |
| "epoch": 0.02884242054467802, |
| "grad_norm": 0.6171875, |
| "learning_rate": 4.856921029281278e-05, |
| "loss": 1.0934, |
| "mean_token_accuracy": 0.7263241574168205, |
| "num_tokens": 12207213.0, |
| "step": 130 |
| }, |
| { |
| "entropy": 1.3774912744760512, |
| "epoch": 0.03106106827888402, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.845829636202307e-05, |
| "loss": 0.9988, |
| "mean_token_accuracy": 0.7457391232252121, |
| "num_tokens": 13169677.0, |
| "step": 140 |
| }, |
| { |
| "entropy": 1.3801545724272728, |
| "epoch": 0.03327971601309002, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.8347382431233365e-05, |
| "loss": 1.0128, |
| "mean_token_accuracy": 0.7391506642103195, |
| "num_tokens": 14101879.0, |
| "step": 150 |
| }, |
| { |
| "entropy": 1.383959451317787, |
| "epoch": 0.03549836374729602, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.823646850044366e-05, |
| "loss": 1.0289, |
| "mean_token_accuracy": 0.7387954272329808, |
| "num_tokens": 15070630.0, |
| "step": 160 |
| }, |
| { |
| "entropy": 1.3918858915567398, |
| "epoch": 0.03771701148150203, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.812555456965395e-05, |
| "loss": 1.0241, |
| "mean_token_accuracy": 0.7366124205291271, |
| "num_tokens": 16027843.0, |
| "step": 170 |
| }, |
| { |
| "entropy": 1.428921215236187, |
| "epoch": 0.039935659215708026, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.801464063886424e-05, |
| "loss": 1.036, |
| "mean_token_accuracy": 0.7360907278954982, |
| "num_tokens": 16947937.0, |
| "step": 180 |
| }, |
| { |
| "entropy": 1.4443669021129608, |
| "epoch": 0.042154306949914025, |
| "grad_norm": 0.60546875, |
| "learning_rate": 4.7903726708074534e-05, |
| "loss": 1.0389, |
| "mean_token_accuracy": 0.7340119168162346, |
| "num_tokens": 17851722.0, |
| "step": 190 |
| }, |
| { |
| "entropy": 1.4278473794460296, |
| "epoch": 0.04437295468412003, |
| "grad_norm": 0.5546875, |
| "learning_rate": 4.7792812777284826e-05, |
| "loss": 1.048, |
| "mean_token_accuracy": 0.7365864336490631, |
| "num_tokens": 18798538.0, |
| "step": 200 |
| }, |
| { |
| "entropy": 1.4079762324690819, |
| "epoch": 0.04659160241832603, |
| "grad_norm": 0.58203125, |
| "learning_rate": 4.768189884649512e-05, |
| "loss": 1.0217, |
| "mean_token_accuracy": 0.7381824173033238, |
| "num_tokens": 19746990.0, |
| "step": 210 |
| }, |
| { |
| "entropy": 1.4014856681227683, |
| "epoch": 0.048810250152532035, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.757098491570541e-05, |
| "loss": 1.0218, |
| "mean_token_accuracy": 0.7401599958539009, |
| "num_tokens": 20669202.0, |
| "step": 220 |
| }, |
| { |
| "entropy": 1.3362741515040397, |
| "epoch": 0.051028897886738034, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.74600709849157e-05, |
| "loss": 0.9708, |
| "mean_token_accuracy": 0.7500613324344159, |
| "num_tokens": 21636384.0, |
| "step": 230 |
| }, |
| { |
| "entropy": 1.4148907586932182, |
| "epoch": 0.05324754562094403, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.7349157054126e-05, |
| "loss": 1.0376, |
| "mean_token_accuracy": 0.7359736375510693, |
| "num_tokens": 22574934.0, |
| "step": 240 |
| }, |
| { |
| "entropy": 1.4070934116840363, |
| "epoch": 0.05546619335515004, |
| "grad_norm": 0.62890625, |
| "learning_rate": 4.7238243123336293e-05, |
| "loss": 1.019, |
| "mean_token_accuracy": 0.7393471024930477, |
| "num_tokens": 23510479.0, |
| "step": 250 |
| }, |
| { |
| "entropy": 1.4115072026848794, |
| "epoch": 0.05768484108935604, |
| "grad_norm": 0.61328125, |
| "learning_rate": 4.7127329192546586e-05, |
| "loss": 1.0324, |
| "mean_token_accuracy": 0.7382585242390632, |
| "num_tokens": 24464735.0, |
| "step": 260 |
| }, |
| { |
| "entropy": 1.3863993905484677, |
| "epoch": 0.059903488823562036, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.701641526175688e-05, |
| "loss": 0.9979, |
| "mean_token_accuracy": 0.7422027714550495, |
| "num_tokens": 25396556.0, |
| "step": 270 |
| }, |
| { |
| "entropy": 1.3688023373484612, |
| "epoch": 0.06212213655776804, |
| "grad_norm": 0.5859375, |
| "learning_rate": 4.690550133096717e-05, |
| "loss": 0.9956, |
| "mean_token_accuracy": 0.7453529857099056, |
| "num_tokens": 26353783.0, |
| "step": 280 |
| }, |
| { |
| "entropy": 1.3656944148242474, |
| "epoch": 0.06434078429197404, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.679458740017746e-05, |
| "loss": 0.9969, |
| "mean_token_accuracy": 0.7447779856622219, |
| "num_tokens": 27304682.0, |
| "step": 290 |
| }, |
| { |
| "entropy": 1.3630746126174926, |
| "epoch": 0.06655943202618005, |
| "grad_norm": 0.5234375, |
| "learning_rate": 4.6683673469387754e-05, |
| "loss": 1.0053, |
| "mean_token_accuracy": 0.7430833972990513, |
| "num_tokens": 28275130.0, |
| "step": 300 |
| }, |
| { |
| "entropy": 1.405807738006115, |
| "epoch": 0.06877807976038605, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.6572759538598046e-05, |
| "loss": 1.0312, |
| "mean_token_accuracy": 0.736625573784113, |
| "num_tokens": 29208090.0, |
| "step": 310 |
| }, |
| { |
| "entropy": 1.4168103411793709, |
| "epoch": 0.07099672749459204, |
| "grad_norm": 0.5859375, |
| "learning_rate": 4.646184560780834e-05, |
| "loss": 1.0463, |
| "mean_token_accuracy": 0.7340070068836212, |
| "num_tokens": 30132884.0, |
| "step": 320 |
| }, |
| { |
| "entropy": 1.328667588531971, |
| "epoch": 0.07321537522879805, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.635093167701863e-05, |
| "loss": 0.9905, |
| "mean_token_accuracy": 0.7449391677975654, |
| "num_tokens": 31096131.0, |
| "step": 330 |
| }, |
| { |
| "entropy": 1.3874380961060524, |
| "epoch": 0.07543402296300405, |
| "grad_norm": 0.55078125, |
| "learning_rate": 4.624001774622893e-05, |
| "loss": 0.9946, |
| "mean_token_accuracy": 0.7445168398320675, |
| "num_tokens": 32025666.0, |
| "step": 340 |
| }, |
| { |
| "entropy": 1.3859788089990617, |
| "epoch": 0.07765267069721005, |
| "grad_norm": 0.52734375, |
| "learning_rate": 4.612910381543922e-05, |
| "loss": 0.9871, |
| "mean_token_accuracy": 0.7463914036750794, |
| "num_tokens": 32965922.0, |
| "step": 350 |
| }, |
| { |
| "entropy": 1.4040928453207016, |
| "epoch": 0.07987131843141605, |
| "grad_norm": 0.58203125, |
| "learning_rate": 4.6018189884649514e-05, |
| "loss": 0.9979, |
| "mean_token_accuracy": 0.7431536763906479, |
| "num_tokens": 33896621.0, |
| "step": 360 |
| }, |
| { |
| "entropy": 1.4107008963823318, |
| "epoch": 0.08208996616562206, |
| "grad_norm": 0.6015625, |
| "learning_rate": 4.5907275953859806e-05, |
| "loss": 1.0311, |
| "mean_token_accuracy": 0.7370501346886158, |
| "num_tokens": 34842327.0, |
| "step": 370 |
| }, |
| { |
| "entropy": 1.3692341327667237, |
| "epoch": 0.08430861389982805, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.57963620230701e-05, |
| "loss": 0.9932, |
| "mean_token_accuracy": 0.7449106052517891, |
| "num_tokens": 35785569.0, |
| "step": 380 |
| }, |
| { |
| "entropy": 1.3753847882151604, |
| "epoch": 0.08652726163403406, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.568544809228039e-05, |
| "loss": 1.0154, |
| "mean_token_accuracy": 0.7405989103019237, |
| "num_tokens": 36720371.0, |
| "step": 390 |
| }, |
| { |
| "entropy": 1.3850012436509131, |
| "epoch": 0.08874590936824006, |
| "grad_norm": 0.5546875, |
| "learning_rate": 4.557453416149068e-05, |
| "loss": 0.9946, |
| "mean_token_accuracy": 0.743626830726862, |
| "num_tokens": 37663502.0, |
| "step": 400 |
| }, |
| { |
| "entropy": 1.4084563165903092, |
| "epoch": 0.09096455710244605, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.5463620230700974e-05, |
| "loss": 1.0224, |
| "mean_token_accuracy": 0.7386880144476891, |
| "num_tokens": 38595385.0, |
| "step": 410 |
| }, |
| { |
| "entropy": 1.4221973702311517, |
| "epoch": 0.09318320483665206, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.5352706299911266e-05, |
| "loss": 1.0401, |
| "mean_token_accuracy": 0.7350750401616096, |
| "num_tokens": 39560136.0, |
| "step": 420 |
| }, |
| { |
| "entropy": 1.3766985535621643, |
| "epoch": 0.09540185257085806, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.5241792369121565e-05, |
| "loss": 0.9819, |
| "mean_token_accuracy": 0.7460968688130378, |
| "num_tokens": 40504329.0, |
| "step": 430 |
| }, |
| { |
| "entropy": 1.3452365651726723, |
| "epoch": 0.09762050030506407, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.513087843833186e-05, |
| "loss": 0.9656, |
| "mean_token_accuracy": 0.7495473526418209, |
| "num_tokens": 41447374.0, |
| "step": 440 |
| }, |
| { |
| "entropy": 1.4052437961101532, |
| "epoch": 0.09983914803927006, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.501996450754215e-05, |
| "loss": 1.029, |
| "mean_token_accuracy": 0.7380021281540394, |
| "num_tokens": 42352403.0, |
| "step": 450 |
| }, |
| { |
| "entropy": 1.3656214989721775, |
| "epoch": 0.10205779577347607, |
| "grad_norm": 0.60546875, |
| "learning_rate": 4.490905057675244e-05, |
| "loss": 0.9861, |
| "mean_token_accuracy": 0.7466712445020676, |
| "num_tokens": 43285467.0, |
| "step": 460 |
| }, |
| { |
| "entropy": 1.359076064825058, |
| "epoch": 0.10427644350768207, |
| "grad_norm": 0.5078125, |
| "learning_rate": 4.4798136645962734e-05, |
| "loss": 0.9999, |
| "mean_token_accuracy": 0.743770582973957, |
| "num_tokens": 44255931.0, |
| "step": 470 |
| }, |
| { |
| "entropy": 1.3802897572517394, |
| "epoch": 0.10649509124188807, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.4687222715173026e-05, |
| "loss": 1.0001, |
| "mean_token_accuracy": 0.7432407602667809, |
| "num_tokens": 45184260.0, |
| "step": 480 |
| }, |
| { |
| "entropy": 1.3991574339568615, |
| "epoch": 0.10871373897609407, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.457630878438332e-05, |
| "loss": 1.0154, |
| "mean_token_accuracy": 0.7401745900511741, |
| "num_tokens": 46148392.0, |
| "step": 490 |
| }, |
| { |
| "entropy": 1.3566242396831512, |
| "epoch": 0.11093238671030008, |
| "grad_norm": 0.61328125, |
| "learning_rate": 4.446539485359361e-05, |
| "loss": 0.9846, |
| "mean_token_accuracy": 0.7464064188301563, |
| "num_tokens": 47078335.0, |
| "step": 500 |
| }, |
| { |
| "entropy": 1.3858811572194099, |
| "epoch": 0.11315103444450607, |
| "grad_norm": 0.51171875, |
| "learning_rate": 4.43544809228039e-05, |
| "loss": 0.9912, |
| "mean_token_accuracy": 0.7457821436226368, |
| "num_tokens": 48018551.0, |
| "step": 510 |
| }, |
| { |
| "entropy": 1.3758568353950977, |
| "epoch": 0.11536968217871207, |
| "grad_norm": 0.51171875, |
| "learning_rate": 4.42435669920142e-05, |
| "loss": 0.9886, |
| "mean_token_accuracy": 0.7470844730734825, |
| "num_tokens": 48974568.0, |
| "step": 520 |
| }, |
| { |
| "entropy": 1.3550358980894088, |
| "epoch": 0.11758832991291808, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.4132653061224493e-05, |
| "loss": 0.9694, |
| "mean_token_accuracy": 0.7498566247522831, |
| "num_tokens": 49932695.0, |
| "step": 530 |
| }, |
| { |
| "entropy": 1.3841885790228843, |
| "epoch": 0.11980697764712407, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.4021739130434786e-05, |
| "loss": 1.0022, |
| "mean_token_accuracy": 0.7409815572202205, |
| "num_tokens": 50866996.0, |
| "step": 540 |
| }, |
| { |
| "entropy": 1.3405610300600528, |
| "epoch": 0.12202562538133008, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.391082519964508e-05, |
| "loss": 0.9921, |
| "mean_token_accuracy": 0.746824074536562, |
| "num_tokens": 51808608.0, |
| "step": 550 |
| }, |
| { |
| "entropy": 1.3757329672574996, |
| "epoch": 0.12424427311553608, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.379991126885537e-05, |
| "loss": 0.9985, |
| "mean_token_accuracy": 0.7443767100572586, |
| "num_tokens": 52747915.0, |
| "step": 560 |
| }, |
| { |
| "entropy": 1.3554963186383246, |
| "epoch": 0.1264629208497421, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.368899733806566e-05, |
| "loss": 0.9713, |
| "mean_token_accuracy": 0.7524632543325425, |
| "num_tokens": 53688292.0, |
| "step": 570 |
| }, |
| { |
| "entropy": 1.398676659166813, |
| "epoch": 0.12868156858394808, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.3578083407275954e-05, |
| "loss": 1.0127, |
| "mean_token_accuracy": 0.7388371795415878, |
| "num_tokens": 54653551.0, |
| "step": 580 |
| }, |
| { |
| "entropy": 1.3686447888612747, |
| "epoch": 0.13090021631815407, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.3467169476486246e-05, |
| "loss": 0.9858, |
| "mean_token_accuracy": 0.7466567374765873, |
| "num_tokens": 55613826.0, |
| "step": 590 |
| }, |
| { |
| "entropy": 1.3752284094691276, |
| "epoch": 0.1331188640523601, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.335625554569654e-05, |
| "loss": 1.0096, |
| "mean_token_accuracy": 0.7415601670742035, |
| "num_tokens": 56548552.0, |
| "step": 600 |
| }, |
| { |
| "entropy": 1.3863979026675224, |
| "epoch": 0.13533751178656608, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.324534161490684e-05, |
| "loss": 1.0217, |
| "mean_token_accuracy": 0.7401334017515182, |
| "num_tokens": 57528307.0, |
| "step": 610 |
| }, |
| { |
| "entropy": 1.3773459926247598, |
| "epoch": 0.1375561595207721, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.313442768411713e-05, |
| "loss": 1.0188, |
| "mean_token_accuracy": 0.740601348131895, |
| "num_tokens": 58432573.0, |
| "step": 620 |
| }, |
| { |
| "entropy": 1.3685629293322563, |
| "epoch": 0.1397748072549781, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.302351375332742e-05, |
| "loss": 0.9738, |
| "mean_token_accuracy": 0.748286597430706, |
| "num_tokens": 59388628.0, |
| "step": 630 |
| }, |
| { |
| "entropy": 1.3901671305298806, |
| "epoch": 0.1419934549891841, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.2912599822537714e-05, |
| "loss": 0.998, |
| "mean_token_accuracy": 0.7412993647158146, |
| "num_tokens": 60325800.0, |
| "step": 640 |
| }, |
| { |
| "entropy": 1.34510198533535, |
| "epoch": 0.1442121027233901, |
| "grad_norm": 0.54296875, |
| "learning_rate": 4.2801685891748006e-05, |
| "loss": 0.9638, |
| "mean_token_accuracy": 0.7532913006842137, |
| "num_tokens": 61300321.0, |
| "step": 650 |
| }, |
| { |
| "entropy": 1.3802052095532418, |
| "epoch": 0.1464307504575961, |
| "grad_norm": 0.578125, |
| "learning_rate": 4.26907719609583e-05, |
| "loss": 1.0103, |
| "mean_token_accuracy": 0.7420814141631127, |
| "num_tokens": 62232968.0, |
| "step": 660 |
| }, |
| { |
| "entropy": 1.346378207206726, |
| "epoch": 0.1486493981918021, |
| "grad_norm": 0.57421875, |
| "learning_rate": 4.257985803016859e-05, |
| "loss": 0.9557, |
| "mean_token_accuracy": 0.7515577465295792, |
| "num_tokens": 63184820.0, |
| "step": 670 |
| }, |
| { |
| "entropy": 1.3793225064873695, |
| "epoch": 0.1508680459260081, |
| "grad_norm": 0.53515625, |
| "learning_rate": 4.246894409937888e-05, |
| "loss": 1.0116, |
| "mean_token_accuracy": 0.7416508607566357, |
| "num_tokens": 64146856.0, |
| "step": 680 |
| }, |
| { |
| "entropy": 1.370984847843647, |
| "epoch": 0.1530866936602141, |
| "grad_norm": 0.53125, |
| "learning_rate": 4.2358030168589174e-05, |
| "loss": 0.9871, |
| "mean_token_accuracy": 0.7441729478538036, |
| "num_tokens": 65076302.0, |
| "step": 690 |
| }, |
| { |
| "entropy": 1.4060401052236557, |
| "epoch": 0.1553053413944201, |
| "grad_norm": 0.6171875, |
| "learning_rate": 4.224711623779947e-05, |
| "loss": 1.0304, |
| "mean_token_accuracy": 0.7379218600690365, |
| "num_tokens": 65997560.0, |
| "step": 700 |
| }, |
| { |
| "entropy": 1.3768175289034843, |
| "epoch": 0.1575239891286261, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.2136202307009765e-05, |
| "loss": 1.0149, |
| "mean_token_accuracy": 0.7417769655585289, |
| "num_tokens": 66965724.0, |
| "step": 710 |
| }, |
| { |
| "entropy": 1.340875183045864, |
| "epoch": 0.1597426368628321, |
| "grad_norm": 0.52734375, |
| "learning_rate": 4.202528837622006e-05, |
| "loss": 0.9412, |
| "mean_token_accuracy": 0.7555658839643001, |
| "num_tokens": 67898095.0, |
| "step": 720 |
| }, |
| { |
| "entropy": 1.391999800503254, |
| "epoch": 0.1619612845970381, |
| "grad_norm": 0.609375, |
| "learning_rate": 4.191437444543035e-05, |
| "loss": 0.9839, |
| "mean_token_accuracy": 0.7462506376206874, |
| "num_tokens": 68844871.0, |
| "step": 730 |
| }, |
| { |
| "entropy": 1.38314318805933, |
| "epoch": 0.16417993233124412, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.180346051464064e-05, |
| "loss": 1.0097, |
| "mean_token_accuracy": 0.7410484097898007, |
| "num_tokens": 69767489.0, |
| "step": 740 |
| }, |
| { |
| "entropy": 1.3815456658601761, |
| "epoch": 0.1663985800654501, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.1692546583850934e-05, |
| "loss": 0.9754, |
| "mean_token_accuracy": 0.7478328756988049, |
| "num_tokens": 70707718.0, |
| "step": 750 |
| }, |
| { |
| "entropy": 1.3746361419558526, |
| "epoch": 0.1686172277996561, |
| "grad_norm": 0.5859375, |
| "learning_rate": 4.1581632653061226e-05, |
| "loss": 0.987, |
| "mean_token_accuracy": 0.747043264657259, |
| "num_tokens": 71653766.0, |
| "step": 760 |
| }, |
| { |
| "entropy": 1.3854685127735138, |
| "epoch": 0.17083587553386212, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.147071872227152e-05, |
| "loss": 1.0288, |
| "mean_token_accuracy": 0.7364709347486496, |
| "num_tokens": 72601815.0, |
| "step": 770 |
| }, |
| { |
| "entropy": 1.3882519789040089, |
| "epoch": 0.1730545232680681, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.135980479148181e-05, |
| "loss": 1.0141, |
| "mean_token_accuracy": 0.7391402766108512, |
| "num_tokens": 73560646.0, |
| "step": 780 |
| }, |
| { |
| "entropy": 1.3660476624965667, |
| "epoch": 0.1752731710022741, |
| "grad_norm": 0.5703125, |
| "learning_rate": 4.124889086069211e-05, |
| "loss": 0.9924, |
| "mean_token_accuracy": 0.7450746014714241, |
| "num_tokens": 74500221.0, |
| "step": 790 |
| }, |
| { |
| "entropy": 1.3751828119158744, |
| "epoch": 0.17749181873648012, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.11379769299024e-05, |
| "loss": 1.0004, |
| "mean_token_accuracy": 0.7434543266892433, |
| "num_tokens": 75399976.0, |
| "step": 800 |
| }, |
| { |
| "entropy": 1.354314035922289, |
| "epoch": 0.17971046647068611, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.1027062999112693e-05, |
| "loss": 0.9623, |
| "mean_token_accuracy": 0.7510982856154442, |
| "num_tokens": 76358729.0, |
| "step": 810 |
| }, |
| { |
| "entropy": 1.3439435064792633, |
| "epoch": 0.1819291142048921, |
| "grad_norm": 0.56640625, |
| "learning_rate": 4.0916149068322986e-05, |
| "loss": 0.9607, |
| "mean_token_accuracy": 0.7531138896942139, |
| "num_tokens": 77311440.0, |
| "step": 820 |
| }, |
| { |
| "entropy": 1.3753922283649445, |
| "epoch": 0.18414776193909813, |
| "grad_norm": 0.546875, |
| "learning_rate": 4.080523513753328e-05, |
| "loss": 0.9839, |
| "mean_token_accuracy": 0.7464477054774761, |
| "num_tokens": 78248418.0, |
| "step": 830 |
| }, |
| { |
| "entropy": 1.3592103332281114, |
| "epoch": 0.18636640967330412, |
| "grad_norm": 0.52734375, |
| "learning_rate": 4.069432120674357e-05, |
| "loss": 0.9724, |
| "mean_token_accuracy": 0.7482516840100288, |
| "num_tokens": 79193662.0, |
| "step": 840 |
| }, |
| { |
| "entropy": 1.3815738067030907, |
| "epoch": 0.1885850574075101, |
| "grad_norm": 0.5859375, |
| "learning_rate": 4.058340727595386e-05, |
| "loss": 0.9826, |
| "mean_token_accuracy": 0.7456090994179249, |
| "num_tokens": 80111085.0, |
| "step": 850 |
| }, |
| { |
| "entropy": 1.3659467726945878, |
| "epoch": 0.19080370514171613, |
| "grad_norm": 0.52734375, |
| "learning_rate": 4.0472493345164154e-05, |
| "loss": 0.9858, |
| "mean_token_accuracy": 0.7455601133406162, |
| "num_tokens": 81041558.0, |
| "step": 860 |
| }, |
| { |
| "entropy": 1.39312274903059, |
| "epoch": 0.19302235287592212, |
| "grad_norm": 0.5546875, |
| "learning_rate": 4.0361579414374446e-05, |
| "loss": 1.0138, |
| "mean_token_accuracy": 0.7410866186022759, |
| "num_tokens": 81959502.0, |
| "step": 870 |
| }, |
| { |
| "entropy": 1.394485105574131, |
| "epoch": 0.19524100061012814, |
| "grad_norm": 0.60546875, |
| "learning_rate": 4.025066548358474e-05, |
| "loss": 1.0044, |
| "mean_token_accuracy": 0.7429567784070968, |
| "num_tokens": 82914796.0, |
| "step": 880 |
| }, |
| { |
| "entropy": 1.3824292540550231, |
| "epoch": 0.19745964834433413, |
| "grad_norm": 0.52734375, |
| "learning_rate": 4.013975155279504e-05, |
| "loss": 0.9947, |
| "mean_token_accuracy": 0.7459897518157959, |
| "num_tokens": 83875692.0, |
| "step": 890 |
| }, |
| { |
| "entropy": 1.327862946689129, |
| "epoch": 0.19967829607854012, |
| "grad_norm": 0.5546875, |
| "learning_rate": 4.002883762200533e-05, |
| "loss": 0.923, |
| "mean_token_accuracy": 0.7600434601306916, |
| "num_tokens": 84802764.0, |
| "step": 900 |
| }, |
| { |
| "entropy": 1.3845474988222122, |
| "epoch": 0.20189694381274614, |
| "grad_norm": 0.5703125, |
| "learning_rate": 3.991792369121562e-05, |
| "loss": 0.9861, |
| "mean_token_accuracy": 0.7468884617090226, |
| "num_tokens": 85748938.0, |
| "step": 910 |
| }, |
| { |
| "entropy": 1.3717331126332284, |
| "epoch": 0.20411559154695214, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.9807009760425914e-05, |
| "loss": 0.9829, |
| "mean_token_accuracy": 0.7473111696541309, |
| "num_tokens": 86700841.0, |
| "step": 920 |
| }, |
| { |
| "entropy": 1.3603821635246276, |
| "epoch": 0.20633423928115813, |
| "grad_norm": 0.515625, |
| "learning_rate": 3.9696095829636206e-05, |
| "loss": 0.9704, |
| "mean_token_accuracy": 0.7494109883904457, |
| "num_tokens": 87650079.0, |
| "step": 930 |
| }, |
| { |
| "entropy": 1.364639788120985, |
| "epoch": 0.20855288701536415, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.95851818988465e-05, |
| "loss": 0.9812, |
| "mean_token_accuracy": 0.7471095651388169, |
| "num_tokens": 88603707.0, |
| "step": 940 |
| }, |
| { |
| "entropy": 1.3764722615480423, |
| "epoch": 0.21077153474957014, |
| "grad_norm": 0.56640625, |
| "learning_rate": 3.947426796805679e-05, |
| "loss": 0.9736, |
| "mean_token_accuracy": 0.7484091036021709, |
| "num_tokens": 89540513.0, |
| "step": 950 |
| }, |
| { |
| "entropy": 1.3506674736738205, |
| "epoch": 0.21299018248377613, |
| "grad_norm": 0.578125, |
| "learning_rate": 3.936335403726708e-05, |
| "loss": 0.9689, |
| "mean_token_accuracy": 0.7476179704070092, |
| "num_tokens": 90483742.0, |
| "step": 960 |
| }, |
| { |
| "entropy": 1.3450557515025139, |
| "epoch": 0.21520883021798215, |
| "grad_norm": 0.578125, |
| "learning_rate": 3.9252440106477374e-05, |
| "loss": 0.968, |
| "mean_token_accuracy": 0.7493214279413223, |
| "num_tokens": 91434192.0, |
| "step": 970 |
| }, |
| { |
| "entropy": 1.329263025522232, |
| "epoch": 0.21742747795218814, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.914152617568767e-05, |
| "loss": 0.9536, |
| "mean_token_accuracy": 0.7544709414243698, |
| "num_tokens": 92377773.0, |
| "step": 980 |
| }, |
| { |
| "entropy": 1.352605053782463, |
| "epoch": 0.21964612568639413, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.9030612244897965e-05, |
| "loss": 0.9466, |
| "mean_token_accuracy": 0.7529656864702702, |
| "num_tokens": 93333525.0, |
| "step": 990 |
| }, |
| { |
| "entropy": 1.361532361805439, |
| "epoch": 0.22186477342060015, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.891969831410826e-05, |
| "loss": 0.9713, |
| "mean_token_accuracy": 0.7466711558401584, |
| "num_tokens": 94288415.0, |
| "step": 1000 |
| }, |
| { |
| "entropy": 1.400508201122284, |
| "epoch": 0.22408342115480614, |
| "grad_norm": 0.5703125, |
| "learning_rate": 3.880878438331855e-05, |
| "loss": 0.9905, |
| "mean_token_accuracy": 0.7447403699159623, |
| "num_tokens": 95210180.0, |
| "step": 1010 |
| }, |
| { |
| "entropy": 1.333881674706936, |
| "epoch": 0.22630206888901214, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.869787045252884e-05, |
| "loss": 0.9516, |
| "mean_token_accuracy": 0.7562138311564922, |
| "num_tokens": 96165001.0, |
| "step": 1020 |
| }, |
| { |
| "entropy": 1.3659777596592904, |
| "epoch": 0.22852071662321816, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.8586956521739134e-05, |
| "loss": 0.9796, |
| "mean_token_accuracy": 0.7488616541028023, |
| "num_tokens": 97118737.0, |
| "step": 1030 |
| }, |
| { |
| "entropy": 1.3581289164721966, |
| "epoch": 0.23073936435742415, |
| "grad_norm": 0.5078125, |
| "learning_rate": 3.8476042590949426e-05, |
| "loss": 0.9905, |
| "mean_token_accuracy": 0.7445513367652893, |
| "num_tokens": 98084593.0, |
| "step": 1040 |
| }, |
| { |
| "entropy": 1.3156771540641785, |
| "epoch": 0.23295801209163014, |
| "grad_norm": 0.50390625, |
| "learning_rate": 3.836512866015972e-05, |
| "loss": 0.9249, |
| "mean_token_accuracy": 0.758704387396574, |
| "num_tokens": 99029928.0, |
| "step": 1050 |
| }, |
| { |
| "entropy": 1.3755515664815903, |
| "epoch": 0.23517665982583616, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.825421472937001e-05, |
| "loss": 0.9974, |
| "mean_token_accuracy": 0.746151739358902, |
| "num_tokens": 100006819.0, |
| "step": 1060 |
| }, |
| { |
| "entropy": 1.3569506011903285, |
| "epoch": 0.23739530756004215, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.814330079858031e-05, |
| "loss": 0.9626, |
| "mean_token_accuracy": 0.7495047964155674, |
| "num_tokens": 100925967.0, |
| "step": 1070 |
| }, |
| { |
| "entropy": 1.3472113192081452, |
| "epoch": 0.23961395529424814, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.80323868677906e-05, |
| "loss": 0.9572, |
| "mean_token_accuracy": 0.7518169023096561, |
| "num_tokens": 101902867.0, |
| "step": 1080 |
| }, |
| { |
| "entropy": 1.3691953018307685, |
| "epoch": 0.24183260302845416, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.7921472937000893e-05, |
| "loss": 0.9385, |
| "mean_token_accuracy": 0.7557882443070412, |
| "num_tokens": 102819883.0, |
| "step": 1090 |
| }, |
| { |
| "entropy": 1.3221500940620898, |
| "epoch": 0.24405125076266015, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.7810559006211186e-05, |
| "loss": 0.9363, |
| "mean_token_accuracy": 0.7567619226872921, |
| "num_tokens": 103770099.0, |
| "step": 1100 |
| }, |
| { |
| "entropy": 1.3552875474095345, |
| "epoch": 0.24626989849686615, |
| "grad_norm": 0.56640625, |
| "learning_rate": 3.769964507542148e-05, |
| "loss": 0.96, |
| "mean_token_accuracy": 0.7519307337701321, |
| "num_tokens": 104703977.0, |
| "step": 1110 |
| }, |
| { |
| "entropy": 1.3745846793055534, |
| "epoch": 0.24848854623107217, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.758873114463177e-05, |
| "loss": 0.9775, |
| "mean_token_accuracy": 0.746993649750948, |
| "num_tokens": 105614489.0, |
| "step": 1120 |
| }, |
| { |
| "entropy": 1.379011509567499, |
| "epoch": 0.2507071939652782, |
| "grad_norm": 0.494140625, |
| "learning_rate": 3.747781721384206e-05, |
| "loss": 0.9913, |
| "mean_token_accuracy": 0.7447584941983223, |
| "num_tokens": 106570238.0, |
| "step": 1130 |
| }, |
| { |
| "entropy": 1.3902081191539764, |
| "epoch": 0.2529258416994842, |
| "grad_norm": 0.58203125, |
| "learning_rate": 3.7366903283052354e-05, |
| "loss": 0.9864, |
| "mean_token_accuracy": 0.746292807906866, |
| "num_tokens": 107501226.0, |
| "step": 1140 |
| }, |
| { |
| "entropy": 1.3556282117962837, |
| "epoch": 0.25514448943369017, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.7255989352262646e-05, |
| "loss": 0.9811, |
| "mean_token_accuracy": 0.7470501571893692, |
| "num_tokens": 108445475.0, |
| "step": 1150 |
| }, |
| { |
| "entropy": 1.3668062418699265, |
| "epoch": 0.25736313716789616, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.714507542147294e-05, |
| "loss": 0.9785, |
| "mean_token_accuracy": 0.7489332385361195, |
| "num_tokens": 109362028.0, |
| "step": 1160 |
| }, |
| { |
| "entropy": 1.3806826993823051, |
| "epoch": 0.25958178490210215, |
| "grad_norm": 0.5078125, |
| "learning_rate": 3.703416149068323e-05, |
| "loss": 0.9682, |
| "mean_token_accuracy": 0.7490875221788883, |
| "num_tokens": 110308226.0, |
| "step": 1170 |
| }, |
| { |
| "entropy": 1.3806460306048394, |
| "epoch": 0.26180043263630814, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.692324755989352e-05, |
| "loss": 0.9937, |
| "mean_token_accuracy": 0.7435216665267944, |
| "num_tokens": 111243611.0, |
| "step": 1180 |
| }, |
| { |
| "entropy": 1.3768418952822685, |
| "epoch": 0.2640190803705142, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.6812333629103815e-05, |
| "loss": 1.0088, |
| "mean_token_accuracy": 0.741937792301178, |
| "num_tokens": 112158924.0, |
| "step": 1190 |
| }, |
| { |
| "entropy": 1.3587884977459908, |
| "epoch": 0.2662377281047202, |
| "grad_norm": 0.56640625, |
| "learning_rate": 3.670141969831411e-05, |
| "loss": 0.9634, |
| "mean_token_accuracy": 0.7523072622716427, |
| "num_tokens": 113114964.0, |
| "step": 1200 |
| }, |
| { |
| "entropy": 1.3679104253649712, |
| "epoch": 0.2684563758389262, |
| "grad_norm": 0.58984375, |
| "learning_rate": 3.65905057675244e-05, |
| "loss": 0.979, |
| "mean_token_accuracy": 0.7477054476737977, |
| "num_tokens": 114050174.0, |
| "step": 1210 |
| }, |
| { |
| "entropy": 1.355040068924427, |
| "epoch": 0.27067502357313217, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.64795918367347e-05, |
| "loss": 0.9668, |
| "mean_token_accuracy": 0.75032162591815, |
| "num_tokens": 114988970.0, |
| "step": 1220 |
| }, |
| { |
| "entropy": 1.3842439249157905, |
| "epoch": 0.27289367130733816, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.636867790594499e-05, |
| "loss": 0.9967, |
| "mean_token_accuracy": 0.7448992133140564, |
| "num_tokens": 115921292.0, |
| "step": 1230 |
| }, |
| { |
| "entropy": 1.386633063107729, |
| "epoch": 0.2751123190415442, |
| "grad_norm": 0.59765625, |
| "learning_rate": 3.625776397515528e-05, |
| "loss": 0.9982, |
| "mean_token_accuracy": 0.7450036846101284, |
| "num_tokens": 116870507.0, |
| "step": 1240 |
| }, |
| { |
| "entropy": 1.3373503908514977, |
| "epoch": 0.2773309667757502, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.6146850044365574e-05, |
| "loss": 0.9631, |
| "mean_token_accuracy": 0.7503526777029037, |
| "num_tokens": 117814194.0, |
| "step": 1250 |
| }, |
| { |
| "entropy": 1.3738537311553956, |
| "epoch": 0.2795496145099562, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.6035936113575866e-05, |
| "loss": 0.9636, |
| "mean_token_accuracy": 0.7519263453781605, |
| "num_tokens": 118745944.0, |
| "step": 1260 |
| }, |
| { |
| "entropy": 1.373944465816021, |
| "epoch": 0.2817682622441622, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.592502218278616e-05, |
| "loss": 0.9946, |
| "mean_token_accuracy": 0.7430286034941673, |
| "num_tokens": 119703256.0, |
| "step": 1270 |
| }, |
| { |
| "entropy": 1.3817725293338299, |
| "epoch": 0.2839869099783682, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.581410825199645e-05, |
| "loss": 1.0038, |
| "mean_token_accuracy": 0.7412588849663735, |
| "num_tokens": 120632316.0, |
| "step": 1280 |
| }, |
| { |
| "entropy": 1.383293604105711, |
| "epoch": 0.28620555771257417, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.570319432120674e-05, |
| "loss": 1.0004, |
| "mean_token_accuracy": 0.7431584998965264, |
| "num_tokens": 121557708.0, |
| "step": 1290 |
| }, |
| { |
| "entropy": 1.3742095410823822, |
| "epoch": 0.2884242054467802, |
| "grad_norm": 0.56640625, |
| "learning_rate": 3.5592280390417035e-05, |
| "loss": 0.9699, |
| "mean_token_accuracy": 0.7505590744316578, |
| "num_tokens": 122515689.0, |
| "step": 1300 |
| }, |
| { |
| "entropy": 1.3871235311031342, |
| "epoch": 0.2906428531809862, |
| "grad_norm": 0.5703125, |
| "learning_rate": 3.548136645962733e-05, |
| "loss": 0.9824, |
| "mean_token_accuracy": 0.7457533970475196, |
| "num_tokens": 123456033.0, |
| "step": 1310 |
| }, |
| { |
| "entropy": 1.3561372354626655, |
| "epoch": 0.2928615009151922, |
| "grad_norm": 0.5625, |
| "learning_rate": 3.537045252883762e-05, |
| "loss": 0.9547, |
| "mean_token_accuracy": 0.7511110901832581, |
| "num_tokens": 124410678.0, |
| "step": 1320 |
| }, |
| { |
| "entropy": 1.3228459164500237, |
| "epoch": 0.2950801486493982, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.525953859804791e-05, |
| "loss": 0.9167, |
| "mean_token_accuracy": 0.7597990974783897, |
| "num_tokens": 125353637.0, |
| "step": 1330 |
| }, |
| { |
| "entropy": 1.3309078864753245, |
| "epoch": 0.2972987963836042, |
| "grad_norm": 0.70703125, |
| "learning_rate": 3.514862466725821e-05, |
| "loss": 0.9623, |
| "mean_token_accuracy": 0.7502509340643883, |
| "num_tokens": 126291010.0, |
| "step": 1340 |
| }, |
| { |
| "entropy": 1.375917912274599, |
| "epoch": 0.29951744411781017, |
| "grad_norm": 2.46875, |
| "learning_rate": 3.50377107364685e-05, |
| "loss": 0.9729, |
| "mean_token_accuracy": 0.7492444895207881, |
| "num_tokens": 127237461.0, |
| "step": 1350 |
| }, |
| { |
| "entropy": 1.3652615778148174, |
| "epoch": 0.3017360918520162, |
| "grad_norm": 0.578125, |
| "learning_rate": 3.4926796805678794e-05, |
| "loss": 0.9673, |
| "mean_token_accuracy": 0.7486005112528801, |
| "num_tokens": 128184481.0, |
| "step": 1360 |
| }, |
| { |
| "entropy": 1.361464273929596, |
| "epoch": 0.3039547395862222, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.481588287488909e-05, |
| "loss": 0.9848, |
| "mean_token_accuracy": 0.7459657743573189, |
| "num_tokens": 129136106.0, |
| "step": 1370 |
| }, |
| { |
| "entropy": 1.3367391996085645, |
| "epoch": 0.3061733873204282, |
| "grad_norm": 0.53125, |
| "learning_rate": 3.470496894409938e-05, |
| "loss": 0.9721, |
| "mean_token_accuracy": 0.7480074115097523, |
| "num_tokens": 130083779.0, |
| "step": 1380 |
| }, |
| { |
| "entropy": 1.345343752205372, |
| "epoch": 0.3083920350546342, |
| "grad_norm": 0.57421875, |
| "learning_rate": 3.459405501330967e-05, |
| "loss": 0.9301, |
| "mean_token_accuracy": 0.7568992510437965, |
| "num_tokens": 131031114.0, |
| "step": 1390 |
| }, |
| { |
| "entropy": 1.37344888150692, |
| "epoch": 0.3106106827888402, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.448314108251996e-05, |
| "loss": 0.9955, |
| "mean_token_accuracy": 0.745458111166954, |
| "num_tokens": 131970717.0, |
| "step": 1400 |
| }, |
| { |
| "entropy": 1.3943381957709788, |
| "epoch": 0.3128293305230462, |
| "grad_norm": 0.5546875, |
| "learning_rate": 3.4372227151730255e-05, |
| "loss": 0.9955, |
| "mean_token_accuracy": 0.743470398336649, |
| "num_tokens": 132916501.0, |
| "step": 1410 |
| }, |
| { |
| "entropy": 1.3412963405251503, |
| "epoch": 0.3150479782572522, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.426131322094055e-05, |
| "loss": 0.9656, |
| "mean_token_accuracy": 0.751042614877224, |
| "num_tokens": 133855964.0, |
| "step": 1420 |
| }, |
| { |
| "entropy": 1.3560855656862258, |
| "epoch": 0.3172666259914582, |
| "grad_norm": 0.5625, |
| "learning_rate": 3.415039929015084e-05, |
| "loss": 0.9734, |
| "mean_token_accuracy": 0.7487790770828724, |
| "num_tokens": 134794608.0, |
| "step": 1430 |
| }, |
| { |
| "entropy": 1.3474852062761784, |
| "epoch": 0.3194852737256642, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.403948535936114e-05, |
| "loss": 0.9772, |
| "mean_token_accuracy": 0.7492424316704274, |
| "num_tokens": 135743072.0, |
| "step": 1440 |
| }, |
| { |
| "entropy": 1.3934367418289184, |
| "epoch": 0.3217039214598702, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.392857142857143e-05, |
| "loss": 1.0063, |
| "mean_token_accuracy": 0.7409680478274823, |
| "num_tokens": 136659708.0, |
| "step": 1450 |
| }, |
| { |
| "entropy": 1.3512530893087387, |
| "epoch": 0.3239225691940762, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.381765749778172e-05, |
| "loss": 0.9717, |
| "mean_token_accuracy": 0.7517142631113529, |
| "num_tokens": 137609079.0, |
| "step": 1460 |
| }, |
| { |
| "entropy": 1.3412357300519944, |
| "epoch": 0.3261412169282822, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.3706743566992015e-05, |
| "loss": 0.9477, |
| "mean_token_accuracy": 0.7528042688965797, |
| "num_tokens": 138553919.0, |
| "step": 1470 |
| }, |
| { |
| "entropy": 1.3442728258669376, |
| "epoch": 0.32835986466248823, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.359582963620231e-05, |
| "loss": 0.9464, |
| "mean_token_accuracy": 0.7520667724311352, |
| "num_tokens": 139484549.0, |
| "step": 1480 |
| }, |
| { |
| "entropy": 1.3433556392788888, |
| "epoch": 0.3305785123966942, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.34849157054126e-05, |
| "loss": 0.9377, |
| "mean_token_accuracy": 0.7539769187569618, |
| "num_tokens": 140426792.0, |
| "step": 1490 |
| }, |
| { |
| "entropy": 1.325501861423254, |
| "epoch": 0.3327971601309002, |
| "grad_norm": 0.5, |
| "learning_rate": 3.337400177462289e-05, |
| "loss": 0.9226, |
| "mean_token_accuracy": 0.7607504710555076, |
| "num_tokens": 141371155.0, |
| "step": 1500 |
| }, |
| { |
| "entropy": 1.3407476291060447, |
| "epoch": 0.3350158078651062, |
| "grad_norm": 0.55078125, |
| "learning_rate": 3.326308784383318e-05, |
| "loss": 0.9537, |
| "mean_token_accuracy": 0.7520662292838096, |
| "num_tokens": 142331590.0, |
| "step": 1510 |
| }, |
| { |
| "entropy": 1.329257782548666, |
| "epoch": 0.3372344555993122, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.3152173913043475e-05, |
| "loss": 0.9312, |
| "mean_token_accuracy": 0.7564695417881012, |
| "num_tokens": 143254361.0, |
| "step": 1520 |
| }, |
| { |
| "entropy": 1.388334572315216, |
| "epoch": 0.33945310333351825, |
| "grad_norm": 0.58203125, |
| "learning_rate": 3.3041259982253774e-05, |
| "loss": 0.9958, |
| "mean_token_accuracy": 0.7436298795044423, |
| "num_tokens": 144217386.0, |
| "step": 1530 |
| }, |
| { |
| "entropy": 1.3446097187697887, |
| "epoch": 0.34167175106772424, |
| "grad_norm": 0.5625, |
| "learning_rate": 3.2930346051464066e-05, |
| "loss": 0.9654, |
| "mean_token_accuracy": 0.7493618465960026, |
| "num_tokens": 145142821.0, |
| "step": 1540 |
| }, |
| { |
| "entropy": 1.371129809319973, |
| "epoch": 0.34389039880193023, |
| "grad_norm": 0.6015625, |
| "learning_rate": 3.281943212067436e-05, |
| "loss": 0.9937, |
| "mean_token_accuracy": 0.7430687204003334, |
| "num_tokens": 146063376.0, |
| "step": 1550 |
| }, |
| { |
| "entropy": 1.3537682175636292, |
| "epoch": 0.3461090465361362, |
| "grad_norm": 0.58203125, |
| "learning_rate": 3.270851818988465e-05, |
| "loss": 0.99, |
| "mean_token_accuracy": 0.7446731366217136, |
| "num_tokens": 146991473.0, |
| "step": 1560 |
| }, |
| { |
| "entropy": 1.3684612050652505, |
| "epoch": 0.3483276942703422, |
| "grad_norm": 0.578125, |
| "learning_rate": 3.259760425909494e-05, |
| "loss": 0.9916, |
| "mean_token_accuracy": 0.7439785785973072, |
| "num_tokens": 147938218.0, |
| "step": 1570 |
| }, |
| { |
| "entropy": 1.3405075147747993, |
| "epoch": 0.3505463420045482, |
| "grad_norm": 0.53125, |
| "learning_rate": 3.2486690328305235e-05, |
| "loss": 0.9367, |
| "mean_token_accuracy": 0.7569099083542824, |
| "num_tokens": 148892689.0, |
| "step": 1580 |
| }, |
| { |
| "entropy": 1.3668345354497433, |
| "epoch": 0.35276498973875425, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.237577639751553e-05, |
| "loss": 1.0039, |
| "mean_token_accuracy": 0.7430003948509694, |
| "num_tokens": 149855777.0, |
| "step": 1590 |
| }, |
| { |
| "entropy": 1.3536728963255882, |
| "epoch": 0.35498363747296025, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.226486246672582e-05, |
| "loss": 0.941, |
| "mean_token_accuracy": 0.7554409049451352, |
| "num_tokens": 150788457.0, |
| "step": 1600 |
| }, |
| { |
| "entropy": 1.3560076355934143, |
| "epoch": 0.35720228520716624, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.215394853593611e-05, |
| "loss": 0.9564, |
| "mean_token_accuracy": 0.7533373937010766, |
| "num_tokens": 151725184.0, |
| "step": 1610 |
| }, |
| { |
| "entropy": 1.3634236186742783, |
| "epoch": 0.35942093294137223, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.204303460514641e-05, |
| "loss": 0.9729, |
| "mean_token_accuracy": 0.7496181048452855, |
| "num_tokens": 152659898.0, |
| "step": 1620 |
| }, |
| { |
| "entropy": 1.3436542712152004, |
| "epoch": 0.3616395806755782, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.19321206743567e-05, |
| "loss": 0.942, |
| "mean_token_accuracy": 0.7547677598893643, |
| "num_tokens": 153575877.0, |
| "step": 1630 |
| }, |
| { |
| "entropy": 1.3383269011974335, |
| "epoch": 0.3638582284097842, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.1821206743566994e-05, |
| "loss": 0.9586, |
| "mean_token_accuracy": 0.752650099247694, |
| "num_tokens": 154524747.0, |
| "step": 1640 |
| }, |
| { |
| "entropy": 1.3560621812939644, |
| "epoch": 0.36607687614399026, |
| "grad_norm": 0.5703125, |
| "learning_rate": 3.171029281277729e-05, |
| "loss": 0.9661, |
| "mean_token_accuracy": 0.7512250438332557, |
| "num_tokens": 155446708.0, |
| "step": 1650 |
| }, |
| { |
| "entropy": 1.33823501765728, |
| "epoch": 0.36829552387819625, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.159937888198758e-05, |
| "loss": 0.9506, |
| "mean_token_accuracy": 0.7525983549654484, |
| "num_tokens": 156421334.0, |
| "step": 1660 |
| }, |
| { |
| "entropy": 1.3900124236941338, |
| "epoch": 0.37051417161240224, |
| "grad_norm": 0.55859375, |
| "learning_rate": 3.148846495119787e-05, |
| "loss": 1.0267, |
| "mean_token_accuracy": 0.7392269425094128, |
| "num_tokens": 157348131.0, |
| "step": 1670 |
| }, |
| { |
| "entropy": 1.382587905973196, |
| "epoch": 0.37273281934660824, |
| "grad_norm": 0.5390625, |
| "learning_rate": 3.137755102040816e-05, |
| "loss": 1.0009, |
| "mean_token_accuracy": 0.7422369658946991, |
| "num_tokens": 158290254.0, |
| "step": 1680 |
| }, |
| { |
| "entropy": 1.3116468265652657, |
| "epoch": 0.3749514670808142, |
| "grad_norm": 0.50390625, |
| "learning_rate": 3.1266637089618455e-05, |
| "loss": 0.9484, |
| "mean_token_accuracy": 0.7536117002367974, |
| "num_tokens": 159223319.0, |
| "step": 1690 |
| }, |
| { |
| "entropy": 1.369352640211582, |
| "epoch": 0.3771701148150202, |
| "grad_norm": 0.58203125, |
| "learning_rate": 3.115572315882875e-05, |
| "loss": 0.9948, |
| "mean_token_accuracy": 0.7430945433676243, |
| "num_tokens": 160153728.0, |
| "step": 1700 |
| }, |
| { |
| "entropy": 1.3820845365524292, |
| "epoch": 0.37938876254922627, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.1044809228039046e-05, |
| "loss": 0.9902, |
| "mean_token_accuracy": 0.7446745671331882, |
| "num_tokens": 161082297.0, |
| "step": 1710 |
| }, |
| { |
| "entropy": 1.3555257454514504, |
| "epoch": 0.38160741028343226, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.093389529724934e-05, |
| "loss": 0.9932, |
| "mean_token_accuracy": 0.7462766982614994, |
| "num_tokens": 162025680.0, |
| "step": 1720 |
| }, |
| { |
| "entropy": 1.3567566007375718, |
| "epoch": 0.38382605801763825, |
| "grad_norm": 0.54296875, |
| "learning_rate": 3.082298136645963e-05, |
| "loss": 0.9669, |
| "mean_token_accuracy": 0.7502202562987804, |
| "num_tokens": 162959342.0, |
| "step": 1730 |
| }, |
| { |
| "entropy": 1.3683917000889778, |
| "epoch": 0.38604470575184424, |
| "grad_norm": 0.58203125, |
| "learning_rate": 3.071206743566992e-05, |
| "loss": 0.9881, |
| "mean_token_accuracy": 0.7448588319122791, |
| "num_tokens": 163880040.0, |
| "step": 1740 |
| }, |
| { |
| "entropy": 1.3426910683512687, |
| "epoch": 0.38826335348605023, |
| "grad_norm": 0.546875, |
| "learning_rate": 3.0601153504880215e-05, |
| "loss": 0.9519, |
| "mean_token_accuracy": 0.7537251867353916, |
| "num_tokens": 164818895.0, |
| "step": 1750 |
| }, |
| { |
| "entropy": 1.3621003210544587, |
| "epoch": 0.3904820012202563, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.0490239574090507e-05, |
| "loss": 0.9675, |
| "mean_token_accuracy": 0.7497253358364105, |
| "num_tokens": 165782211.0, |
| "step": 1760 |
| }, |
| { |
| "entropy": 1.3328422799706459, |
| "epoch": 0.3927006489544623, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.03793256433008e-05, |
| "loss": 0.9581, |
| "mean_token_accuracy": 0.7515999570488929, |
| "num_tokens": 166723681.0, |
| "step": 1770 |
| }, |
| { |
| "entropy": 1.310817752033472, |
| "epoch": 0.39491929668866826, |
| "grad_norm": 0.53125, |
| "learning_rate": 3.026841171251109e-05, |
| "loss": 0.9207, |
| "mean_token_accuracy": 0.7629957444965839, |
| "num_tokens": 167681826.0, |
| "step": 1780 |
| }, |
| { |
| "entropy": 1.3678661212325096, |
| "epoch": 0.39713794442287426, |
| "grad_norm": 0.5859375, |
| "learning_rate": 3.0157497781721383e-05, |
| "loss": 0.9722, |
| "mean_token_accuracy": 0.7485598646104336, |
| "num_tokens": 168615498.0, |
| "step": 1790 |
| }, |
| { |
| "entropy": 1.3442377656698228, |
| "epoch": 0.39935659215708025, |
| "grad_norm": 0.59765625, |
| "learning_rate": 3.0046583850931682e-05, |
| "loss": 0.9293, |
| "mean_token_accuracy": 0.7590565107762813, |
| "num_tokens": 169554298.0, |
| "step": 1800 |
| }, |
| { |
| "entropy": 1.368715339899063, |
| "epoch": 0.40157523989128624, |
| "grad_norm": 0.578125, |
| "learning_rate": 2.9935669920141974e-05, |
| "loss": 0.9773, |
| "mean_token_accuracy": 0.7482131317257881, |
| "num_tokens": 170486143.0, |
| "step": 1810 |
| }, |
| { |
| "entropy": 1.3645600192248821, |
| "epoch": 0.4037938876254923, |
| "grad_norm": 0.51171875, |
| "learning_rate": 2.9824755989352266e-05, |
| "loss": 0.9689, |
| "mean_token_accuracy": 0.7496557794511318, |
| "num_tokens": 171436267.0, |
| "step": 1820 |
| }, |
| { |
| "entropy": 1.360542993992567, |
| "epoch": 0.4060125353596983, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.971384205856256e-05, |
| "loss": 0.9738, |
| "mean_token_accuracy": 0.7470414891839028, |
| "num_tokens": 172361708.0, |
| "step": 1830 |
| }, |
| { |
| "entropy": 1.3571796461939811, |
| "epoch": 0.40823118309390427, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.960292812777285e-05, |
| "loss": 0.977, |
| "mean_token_accuracy": 0.7466642953455448, |
| "num_tokens": 173304422.0, |
| "step": 1840 |
| }, |
| { |
| "entropy": 1.3569322228431702, |
| "epoch": 0.41044983082811026, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.9492014196983143e-05, |
| "loss": 0.9536, |
| "mean_token_accuracy": 0.7540878303349018, |
| "num_tokens": 174236098.0, |
| "step": 1850 |
| }, |
| { |
| "entropy": 1.3723473891615867, |
| "epoch": 0.41266847856231625, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.9381100266193435e-05, |
| "loss": 0.9987, |
| "mean_token_accuracy": 0.7455512471497059, |
| "num_tokens": 175171519.0, |
| "step": 1860 |
| }, |
| { |
| "entropy": 1.3791632324457168, |
| "epoch": 0.41488712629652225, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.9270186335403727e-05, |
| "loss": 0.9508, |
| "mean_token_accuracy": 0.7529595606029034, |
| "num_tokens": 176092982.0, |
| "step": 1870 |
| }, |
| { |
| "entropy": 1.3743179097771645, |
| "epoch": 0.4171057740307283, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.915927240461402e-05, |
| "loss": 0.9734, |
| "mean_token_accuracy": 0.7494499087333679, |
| "num_tokens": 177060429.0, |
| "step": 1880 |
| }, |
| { |
| "entropy": 1.3471356205642224, |
| "epoch": 0.4193244217649343, |
| "grad_norm": 0.58203125, |
| "learning_rate": 2.9048358473824318e-05, |
| "loss": 0.9605, |
| "mean_token_accuracy": 0.7509974204003811, |
| "num_tokens": 178025303.0, |
| "step": 1890 |
| }, |
| { |
| "entropy": 1.3652866527438163, |
| "epoch": 0.4215430694991403, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.893744454303461e-05, |
| "loss": 0.9779, |
| "mean_token_accuracy": 0.7496740512549878, |
| "num_tokens": 178956578.0, |
| "step": 1900 |
| }, |
| { |
| "entropy": 1.355041117966175, |
| "epoch": 0.42376171723334627, |
| "grad_norm": 0.515625, |
| "learning_rate": 2.8826530612244902e-05, |
| "loss": 0.959, |
| "mean_token_accuracy": 0.7527659654617309, |
| "num_tokens": 179899402.0, |
| "step": 1910 |
| }, |
| { |
| "entropy": 1.3641887351870536, |
| "epoch": 0.42598036496755226, |
| "grad_norm": 0.5703125, |
| "learning_rate": 2.8715616681455194e-05, |
| "loss": 0.9457, |
| "mean_token_accuracy": 0.7552632115781307, |
| "num_tokens": 180827499.0, |
| "step": 1920 |
| }, |
| { |
| "entropy": 1.3468473985791207, |
| "epoch": 0.42819901270175825, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.8604702750665487e-05, |
| "loss": 0.9572, |
| "mean_token_accuracy": 0.7524127073585987, |
| "num_tokens": 181771979.0, |
| "step": 1930 |
| }, |
| { |
| "entropy": 1.3425350815057755, |
| "epoch": 0.4304176604359643, |
| "grad_norm": 0.50390625, |
| "learning_rate": 2.849378881987578e-05, |
| "loss": 0.9408, |
| "mean_token_accuracy": 0.7537083625793457, |
| "num_tokens": 182712453.0, |
| "step": 1940 |
| }, |
| { |
| "entropy": 1.3628494575619698, |
| "epoch": 0.4326363081701703, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.838287488908607e-05, |
| "loss": 0.9566, |
| "mean_token_accuracy": 0.7520852789282799, |
| "num_tokens": 183659069.0, |
| "step": 1950 |
| }, |
| { |
| "entropy": 1.3504344090819358, |
| "epoch": 0.4348549559043763, |
| "grad_norm": 0.58984375, |
| "learning_rate": 2.8271960958296363e-05, |
| "loss": 0.9631, |
| "mean_token_accuracy": 0.7504830814898014, |
| "num_tokens": 184596569.0, |
| "step": 1960 |
| }, |
| { |
| "entropy": 1.364800187200308, |
| "epoch": 0.4370736036385823, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.8161047027506655e-05, |
| "loss": 0.9659, |
| "mean_token_accuracy": 0.75085094794631, |
| "num_tokens": 185522825.0, |
| "step": 1970 |
| }, |
| { |
| "entropy": 1.3836459085345267, |
| "epoch": 0.43929225137278827, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.8050133096716947e-05, |
| "loss": 0.9855, |
| "mean_token_accuracy": 0.7443784818053245, |
| "num_tokens": 186445738.0, |
| "step": 1980 |
| }, |
| { |
| "entropy": 1.3496420353651046, |
| "epoch": 0.4415108991069943, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.7939219165927243e-05, |
| "loss": 0.9816, |
| "mean_token_accuracy": 0.7476452320814133, |
| "num_tokens": 187399391.0, |
| "step": 1990 |
| }, |
| { |
| "entropy": 1.3308730378746987, |
| "epoch": 0.4437295468412003, |
| "grad_norm": 0.5078125, |
| "learning_rate": 2.7828305235137535e-05, |
| "loss": 0.9431, |
| "mean_token_accuracy": 0.7563184469938278, |
| "num_tokens": 188372699.0, |
| "step": 2000 |
| }, |
| { |
| "entropy": 1.3839409291744231, |
| "epoch": 0.4459481945754063, |
| "grad_norm": 0.578125, |
| "learning_rate": 2.7717391304347827e-05, |
| "loss": 0.9981, |
| "mean_token_accuracy": 0.7429635897278786, |
| "num_tokens": 189301311.0, |
| "step": 2010 |
| }, |
| { |
| "entropy": 1.3560212314128877, |
| "epoch": 0.4481668423096123, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.760647737355812e-05, |
| "loss": 0.9725, |
| "mean_token_accuracy": 0.7480806417763233, |
| "num_tokens": 190232558.0, |
| "step": 2020 |
| }, |
| { |
| "entropy": 1.3780321873724461, |
| "epoch": 0.4503854900438183, |
| "grad_norm": 1.1875, |
| "learning_rate": 2.749556344276841e-05, |
| "loss": 0.997, |
| "mean_token_accuracy": 0.7428381346166134, |
| "num_tokens": 191181745.0, |
| "step": 2030 |
| }, |
| { |
| "entropy": 1.345700977742672, |
| "epoch": 0.4526041377780243, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.7384649511978703e-05, |
| "loss": 0.938, |
| "mean_token_accuracy": 0.7569623030722141, |
| "num_tokens": 192157581.0, |
| "step": 2040 |
| }, |
| { |
| "entropy": 1.3496388509869575, |
| "epoch": 0.4548227855122303, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.7273735581188996e-05, |
| "loss": 0.9513, |
| "mean_token_accuracy": 0.7525494247674942, |
| "num_tokens": 193095233.0, |
| "step": 2050 |
| }, |
| { |
| "entropy": 1.350592066347599, |
| "epoch": 0.4570414332464363, |
| "grad_norm": 0.59375, |
| "learning_rate": 2.7162821650399288e-05, |
| "loss": 0.9517, |
| "mean_token_accuracy": 0.7537726648151875, |
| "num_tokens": 194025263.0, |
| "step": 2060 |
| }, |
| { |
| "entropy": 1.3845593720674514, |
| "epoch": 0.4592600809806423, |
| "grad_norm": 0.57421875, |
| "learning_rate": 2.7051907719609583e-05, |
| "loss": 0.9504, |
| "mean_token_accuracy": 0.7514217287302017, |
| "num_tokens": 194926897.0, |
| "step": 2070 |
| }, |
| { |
| "entropy": 1.3488378807902337, |
| "epoch": 0.4614787287148483, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.694099378881988e-05, |
| "loss": 0.961, |
| "mean_token_accuracy": 0.7501702718436718, |
| "num_tokens": 195849599.0, |
| "step": 2080 |
| }, |
| { |
| "entropy": 1.349847511947155, |
| "epoch": 0.4636973764490543, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.683007985803017e-05, |
| "loss": 0.9442, |
| "mean_token_accuracy": 0.7564226061105728, |
| "num_tokens": 196794354.0, |
| "step": 2090 |
| }, |
| { |
| "entropy": 1.3340238958597184, |
| "epoch": 0.4659160241832603, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.6719165927240463e-05, |
| "loss": 0.941, |
| "mean_token_accuracy": 0.7531145378947258, |
| "num_tokens": 197720928.0, |
| "step": 2100 |
| }, |
| { |
| "entropy": 1.346337614953518, |
| "epoch": 0.4681346719174663, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.6608251996450755e-05, |
| "loss": 0.9573, |
| "mean_token_accuracy": 0.7538634926080704, |
| "num_tokens": 198643271.0, |
| "step": 2110 |
| }, |
| { |
| "entropy": 1.3088567845523358, |
| "epoch": 0.4703533196516723, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.6497338065661047e-05, |
| "loss": 0.8915, |
| "mean_token_accuracy": 0.7640130512416363, |
| "num_tokens": 199578606.0, |
| "step": 2120 |
| }, |
| { |
| "entropy": 1.3767965711653232, |
| "epoch": 0.4725719673858783, |
| "grad_norm": 0.609375, |
| "learning_rate": 2.638642413487134e-05, |
| "loss": 0.9838, |
| "mean_token_accuracy": 0.7447601705789566, |
| "num_tokens": 200543514.0, |
| "step": 2130 |
| }, |
| { |
| "entropy": 1.3281448036432266, |
| "epoch": 0.4747906151200843, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.627551020408163e-05, |
| "loss": 0.9187, |
| "mean_token_accuracy": 0.7601314648985863, |
| "num_tokens": 201496122.0, |
| "step": 2140 |
| }, |
| { |
| "entropy": 1.3478802539408208, |
| "epoch": 0.4770092628542903, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.6164596273291924e-05, |
| "loss": 0.9621, |
| "mean_token_accuracy": 0.749699717015028, |
| "num_tokens": 202430446.0, |
| "step": 2150 |
| }, |
| { |
| "entropy": 1.388000564277172, |
| "epoch": 0.4792279105884963, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.6053682342502216e-05, |
| "loss": 1.01, |
| "mean_token_accuracy": 0.7405543349683285, |
| "num_tokens": 203346018.0, |
| "step": 2160 |
| }, |
| { |
| "entropy": 1.3482555583119393, |
| "epoch": 0.48144655832270233, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.5942768411712515e-05, |
| "loss": 0.9864, |
| "mean_token_accuracy": 0.7477688670158387, |
| "num_tokens": 204279144.0, |
| "step": 2170 |
| }, |
| { |
| "entropy": 1.3538051225244998, |
| "epoch": 0.4836652060569083, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.5831854480922807e-05, |
| "loss": 0.9934, |
| "mean_token_accuracy": 0.743538661301136, |
| "num_tokens": 205214999.0, |
| "step": 2180 |
| }, |
| { |
| "entropy": 1.3154275290668012, |
| "epoch": 0.4858838537911143, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.57209405501331e-05, |
| "loss": 0.9213, |
| "mean_token_accuracy": 0.7582350388169289, |
| "num_tokens": 206144520.0, |
| "step": 2190 |
| }, |
| { |
| "entropy": 1.3671178199350833, |
| "epoch": 0.4881025015253203, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.561002661934339e-05, |
| "loss": 0.9544, |
| "mean_token_accuracy": 0.7533901192247867, |
| "num_tokens": 207080904.0, |
| "step": 2200 |
| }, |
| { |
| "entropy": 1.3218648932874202, |
| "epoch": 0.4903211492595263, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.5499112688553683e-05, |
| "loss": 0.9238, |
| "mean_token_accuracy": 0.760743847489357, |
| "num_tokens": 208047310.0, |
| "step": 2210 |
| }, |
| { |
| "entropy": 1.3616492010653019, |
| "epoch": 0.4925397969937323, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.5388198757763975e-05, |
| "loss": 0.982, |
| "mean_token_accuracy": 0.7471165806055069, |
| "num_tokens": 209015470.0, |
| "step": 2220 |
| }, |
| { |
| "entropy": 1.3293255344033241, |
| "epoch": 0.49475844472793834, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.5277284826974267e-05, |
| "loss": 0.967, |
| "mean_token_accuracy": 0.7527132786810398, |
| "num_tokens": 209969523.0, |
| "step": 2230 |
| }, |
| { |
| "entropy": 1.3665335968136787, |
| "epoch": 0.49697709246214433, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.516637089618456e-05, |
| "loss": 0.9793, |
| "mean_token_accuracy": 0.7467245981097221, |
| "num_tokens": 210894802.0, |
| "step": 2240 |
| }, |
| { |
| "entropy": 1.3085681259632111, |
| "epoch": 0.4991957401963503, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.5055456965394852e-05, |
| "loss": 0.9423, |
| "mean_token_accuracy": 0.7545640543103218, |
| "num_tokens": 211846270.0, |
| "step": 2250 |
| }, |
| { |
| "entropy": 1.3383339211344718, |
| "epoch": 0.5014143879305564, |
| "grad_norm": 0.494140625, |
| "learning_rate": 2.4944543034605147e-05, |
| "loss": 0.9454, |
| "mean_token_accuracy": 0.753314109146595, |
| "num_tokens": 212817521.0, |
| "step": 2260 |
| }, |
| { |
| "entropy": 1.329726865887642, |
| "epoch": 0.5036330356647624, |
| "grad_norm": 0.51171875, |
| "learning_rate": 2.483362910381544e-05, |
| "loss": 0.9517, |
| "mean_token_accuracy": 0.7521423630416393, |
| "num_tokens": 213779244.0, |
| "step": 2270 |
| }, |
| { |
| "entropy": 1.3511702984571456, |
| "epoch": 0.5058516833989684, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.4722715173025735e-05, |
| "loss": 0.9431, |
| "mean_token_accuracy": 0.7529738865792751, |
| "num_tokens": 214731996.0, |
| "step": 2280 |
| }, |
| { |
| "entropy": 1.366059672832489, |
| "epoch": 0.5080703311331743, |
| "grad_norm": 0.55859375, |
| "learning_rate": 2.4611801242236027e-05, |
| "loss": 0.9965, |
| "mean_token_accuracy": 0.7439504019916058, |
| "num_tokens": 215694840.0, |
| "step": 2290 |
| }, |
| { |
| "entropy": 1.3440134845674039, |
| "epoch": 0.5102889788673803, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.450088731144632e-05, |
| "loss": 0.9691, |
| "mean_token_accuracy": 0.7480943873524666, |
| "num_tokens": 216639877.0, |
| "step": 2300 |
| }, |
| { |
| "entropy": 1.3710797160863877, |
| "epoch": 0.5125076266015863, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.438997338065661e-05, |
| "loss": 0.9453, |
| "mean_token_accuracy": 0.7527918457984925, |
| "num_tokens": 217569723.0, |
| "step": 2310 |
| }, |
| { |
| "entropy": 1.3561846666038035, |
| "epoch": 0.5147262743357923, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.4279059449866903e-05, |
| "loss": 0.9768, |
| "mean_token_accuracy": 0.7460780493915081, |
| "num_tokens": 218524752.0, |
| "step": 2320 |
| }, |
| { |
| "entropy": 1.354518896341324, |
| "epoch": 0.5169449220699983, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.41681455190772e-05, |
| "loss": 0.9424, |
| "mean_token_accuracy": 0.7531989276409149, |
| "num_tokens": 219445599.0, |
| "step": 2330 |
| }, |
| { |
| "entropy": 1.3691720873117448, |
| "epoch": 0.5191635698042043, |
| "grad_norm": 0.62890625, |
| "learning_rate": 2.405723158828749e-05, |
| "loss": 0.9875, |
| "mean_token_accuracy": 0.745745038241148, |
| "num_tokens": 220388844.0, |
| "step": 2340 |
| }, |
| { |
| "entropy": 1.3644569292664528, |
| "epoch": 0.5213822175384103, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.3946317657497783e-05, |
| "loss": 0.9665, |
| "mean_token_accuracy": 0.7500609241425991, |
| "num_tokens": 221325639.0, |
| "step": 2350 |
| }, |
| { |
| "entropy": 1.3851750075817109, |
| "epoch": 0.5236008652726163, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.3835403726708075e-05, |
| "loss": 0.9989, |
| "mean_token_accuracy": 0.7438922718167305, |
| "num_tokens": 222256317.0, |
| "step": 2360 |
| }, |
| { |
| "entropy": 1.347152130305767, |
| "epoch": 0.5258195130068224, |
| "grad_norm": 0.57421875, |
| "learning_rate": 2.372448979591837e-05, |
| "loss": 0.9613, |
| "mean_token_accuracy": 0.7514459244906903, |
| "num_tokens": 223173083.0, |
| "step": 2370 |
| }, |
| { |
| "entropy": 1.3526596918702125, |
| "epoch": 0.5280381607410284, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.3613575865128663e-05, |
| "loss": 0.9948, |
| "mean_token_accuracy": 0.7444270350039005, |
| "num_tokens": 224114753.0, |
| "step": 2380 |
| }, |
| { |
| "entropy": 1.3236285299062729, |
| "epoch": 0.5302568084752344, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.3502661934338955e-05, |
| "loss": 0.9508, |
| "mean_token_accuracy": 0.7532543577253819, |
| "num_tokens": 225081036.0, |
| "step": 2390 |
| }, |
| { |
| "entropy": 1.3525523334741592, |
| "epoch": 0.5324754562094404, |
| "grad_norm": 0.5234375, |
| "learning_rate": 2.3391748003549247e-05, |
| "loss": 0.9595, |
| "mean_token_accuracy": 0.7512728653848171, |
| "num_tokens": 226017057.0, |
| "step": 2400 |
| }, |
| { |
| "entropy": 1.350379504263401, |
| "epoch": 0.5346941039436464, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.328083407275954e-05, |
| "loss": 0.962, |
| "mean_token_accuracy": 0.7505261316895485, |
| "num_tokens": 226946188.0, |
| "step": 2410 |
| }, |
| { |
| "entropy": 1.3398205131292342, |
| "epoch": 0.5369127516778524, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.3169920141969835e-05, |
| "loss": 0.9597, |
| "mean_token_accuracy": 0.7539136126637459, |
| "num_tokens": 227910063.0, |
| "step": 2420 |
| }, |
| { |
| "entropy": 1.331970850378275, |
| "epoch": 0.5391313994120583, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.3059006211180127e-05, |
| "loss": 0.937, |
| "mean_token_accuracy": 0.7590182758867741, |
| "num_tokens": 228863577.0, |
| "step": 2430 |
| }, |
| { |
| "entropy": 1.346589733660221, |
| "epoch": 0.5413500471462643, |
| "grad_norm": 0.59765625, |
| "learning_rate": 2.294809228039042e-05, |
| "loss": 0.9517, |
| "mean_token_accuracy": 0.7540139898657798, |
| "num_tokens": 229797253.0, |
| "step": 2440 |
| }, |
| { |
| "entropy": 1.3450704276561738, |
| "epoch": 0.5435686948804703, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.283717834960071e-05, |
| "loss": 0.9261, |
| "mean_token_accuracy": 0.7560984350740909, |
| "num_tokens": 230738751.0, |
| "step": 2450 |
| }, |
| { |
| "entropy": 1.3362338081002236, |
| "epoch": 0.5457873426146763, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.2726264418811003e-05, |
| "loss": 0.9396, |
| "mean_token_accuracy": 0.755575978755951, |
| "num_tokens": 231668805.0, |
| "step": 2460 |
| }, |
| { |
| "entropy": 1.339858317375183, |
| "epoch": 0.5480059903488823, |
| "grad_norm": 0.5625, |
| "learning_rate": 2.26153504880213e-05, |
| "loss": 0.942, |
| "mean_token_accuracy": 0.7545136004686356, |
| "num_tokens": 232602810.0, |
| "step": 2470 |
| }, |
| { |
| "entropy": 1.349748957157135, |
| "epoch": 0.5502246380830884, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.250443655723159e-05, |
| "loss": 0.9763, |
| "mean_token_accuracy": 0.7481756076216698, |
| "num_tokens": 233553318.0, |
| "step": 2480 |
| }, |
| { |
| "entropy": 1.3118550218641758, |
| "epoch": 0.5524432858172944, |
| "grad_norm": 0.51953125, |
| "learning_rate": 2.2393522626441883e-05, |
| "loss": 0.9201, |
| "mean_token_accuracy": 0.7602349728345871, |
| "num_tokens": 234503089.0, |
| "step": 2490 |
| }, |
| { |
| "entropy": 1.388796190917492, |
| "epoch": 0.5546619335515004, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.2282608695652175e-05, |
| "loss": 0.9855, |
| "mean_token_accuracy": 0.7455244645476341, |
| "num_tokens": 235447418.0, |
| "step": 2500 |
| }, |
| { |
| "entropy": 1.3685590282082558, |
| "epoch": 0.5568805812857064, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.2171694764862467e-05, |
| "loss": 0.9774, |
| "mean_token_accuracy": 0.7483286060392856, |
| "num_tokens": 236399184.0, |
| "step": 2510 |
| }, |
| { |
| "entropy": 1.3622719518840314, |
| "epoch": 0.5590992290199124, |
| "grad_norm": 0.5546875, |
| "learning_rate": 2.206078083407276e-05, |
| "loss": 0.9722, |
| "mean_token_accuracy": 0.7481064416468144, |
| "num_tokens": 237325726.0, |
| "step": 2520 |
| }, |
| { |
| "entropy": 1.3797079771757126, |
| "epoch": 0.5613178767541184, |
| "grad_norm": 0.57421875, |
| "learning_rate": 2.1949866903283052e-05, |
| "loss": 0.9826, |
| "mean_token_accuracy": 0.7481960266828537, |
| "num_tokens": 238283753.0, |
| "step": 2530 |
| }, |
| { |
| "entropy": 1.3590396404266358, |
| "epoch": 0.5635365244883244, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.1838952972493347e-05, |
| "loss": 0.9631, |
| "mean_token_accuracy": 0.749776404350996, |
| "num_tokens": 239205878.0, |
| "step": 2540 |
| }, |
| { |
| "entropy": 1.3788958624005319, |
| "epoch": 0.5657551722225304, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.172803904170364e-05, |
| "loss": 0.9639, |
| "mean_token_accuracy": 0.7497024066746235, |
| "num_tokens": 240097144.0, |
| "step": 2550 |
| }, |
| { |
| "entropy": 1.3258331522345543, |
| "epoch": 0.5679738199567363, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.161712511091393e-05, |
| "loss": 0.9469, |
| "mean_token_accuracy": 0.7540858566761017, |
| "num_tokens": 241055028.0, |
| "step": 2560 |
| }, |
| { |
| "entropy": 1.3632364630699159, |
| "epoch": 0.5701924676909423, |
| "grad_norm": 0.5234375, |
| "learning_rate": 2.1506211180124224e-05, |
| "loss": 0.9669, |
| "mean_token_accuracy": 0.7478960521519185, |
| "num_tokens": 241982324.0, |
| "step": 2570 |
| }, |
| { |
| "entropy": 1.382692551612854, |
| "epoch": 0.5724111154251483, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.1395297249334516e-05, |
| "loss": 0.982, |
| "mean_token_accuracy": 0.747248487174511, |
| "num_tokens": 242906902.0, |
| "step": 2580 |
| }, |
| { |
| "entropy": 1.3415826320648194, |
| "epoch": 0.5746297631593543, |
| "grad_norm": 0.58984375, |
| "learning_rate": 2.1284383318544808e-05, |
| "loss": 0.9541, |
| "mean_token_accuracy": 0.7534500122070312, |
| "num_tokens": 243863487.0, |
| "step": 2590 |
| }, |
| { |
| "entropy": 1.361097539961338, |
| "epoch": 0.5768484108935604, |
| "grad_norm": 0.5234375, |
| "learning_rate": 2.1173469387755103e-05, |
| "loss": 0.9617, |
| "mean_token_accuracy": 0.7487135134637356, |
| "num_tokens": 244790336.0, |
| "step": 2600 |
| }, |
| { |
| "entropy": 1.337267841398716, |
| "epoch": 0.5790670586277664, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.1062555456965396e-05, |
| "loss": 0.933, |
| "mean_token_accuracy": 0.7563786394894123, |
| "num_tokens": 245733272.0, |
| "step": 2610 |
| }, |
| { |
| "entropy": 1.3518446780741216, |
| "epoch": 0.5812857063619724, |
| "grad_norm": 0.51171875, |
| "learning_rate": 2.0951641526175688e-05, |
| "loss": 0.9707, |
| "mean_token_accuracy": 0.7486745782196522, |
| "num_tokens": 246664891.0, |
| "step": 2620 |
| }, |
| { |
| "entropy": 1.3540575861930848, |
| "epoch": 0.5835043540961784, |
| "grad_norm": 0.53125, |
| "learning_rate": 2.084072759538598e-05, |
| "loss": 0.9571, |
| "mean_token_accuracy": 0.7517107434570789, |
| "num_tokens": 247612921.0, |
| "step": 2630 |
| }, |
| { |
| "entropy": 1.3499131940305233, |
| "epoch": 0.5857230018303844, |
| "grad_norm": 0.5703125, |
| "learning_rate": 2.0729813664596272e-05, |
| "loss": 0.9726, |
| "mean_token_accuracy": 0.7497683681547642, |
| "num_tokens": 248563712.0, |
| "step": 2640 |
| }, |
| { |
| "entropy": 1.3714247092604637, |
| "epoch": 0.5879416495645904, |
| "grad_norm": 0.51953125, |
| "learning_rate": 2.0618899733806567e-05, |
| "loss": 0.9711, |
| "mean_token_accuracy": 0.7488393485546112, |
| "num_tokens": 249490907.0, |
| "step": 2650 |
| }, |
| { |
| "entropy": 1.3412188753485679, |
| "epoch": 0.5901602972987964, |
| "grad_norm": 0.5703125, |
| "learning_rate": 2.050798580301686e-05, |
| "loss": 0.9491, |
| "mean_token_accuracy": 0.7532148152589798, |
| "num_tokens": 250423263.0, |
| "step": 2660 |
| }, |
| { |
| "entropy": 1.3625102311372757, |
| "epoch": 0.5923789450330024, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.0397071872227152e-05, |
| "loss": 0.9543, |
| "mean_token_accuracy": 0.7492990329861641, |
| "num_tokens": 251346039.0, |
| "step": 2670 |
| }, |
| { |
| "entropy": 1.3572603225708009, |
| "epoch": 0.5945975927672084, |
| "grad_norm": 0.54296875, |
| "learning_rate": 2.0286157941437444e-05, |
| "loss": 1.0038, |
| "mean_token_accuracy": 0.74280019775033, |
| "num_tokens": 252294379.0, |
| "step": 2680 |
| }, |
| { |
| "entropy": 1.3205513313412667, |
| "epoch": 0.5968162405014144, |
| "grad_norm": 0.5859375, |
| "learning_rate": 2.0175244010647736e-05, |
| "loss": 0.9271, |
| "mean_token_accuracy": 0.760619267821312, |
| "num_tokens": 253223241.0, |
| "step": 2690 |
| }, |
| { |
| "entropy": 1.3887271240353585, |
| "epoch": 0.5990348882356203, |
| "grad_norm": 0.56640625, |
| "learning_rate": 2.006433007985803e-05, |
| "loss": 0.967, |
| "mean_token_accuracy": 0.7496553495526314, |
| "num_tokens": 254149442.0, |
| "step": 2700 |
| }, |
| { |
| "entropy": 1.3467085279524327, |
| "epoch": 0.6012535359698263, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.9953416149068324e-05, |
| "loss": 0.9544, |
| "mean_token_accuracy": 0.751462958753109, |
| "num_tokens": 255110533.0, |
| "step": 2710 |
| }, |
| { |
| "entropy": 1.355501127243042, |
| "epoch": 0.6034721837040324, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.9842502218278616e-05, |
| "loss": 0.9601, |
| "mean_token_accuracy": 0.7510710142552852, |
| "num_tokens": 256043709.0, |
| "step": 2720 |
| }, |
| { |
| "entropy": 1.3472363010048867, |
| "epoch": 0.6056908314382384, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.9731588287488908e-05, |
| "loss": 0.9427, |
| "mean_token_accuracy": 0.75606449842453, |
| "num_tokens": 257002884.0, |
| "step": 2730 |
| }, |
| { |
| "entropy": 1.3073521062731743, |
| "epoch": 0.6079094791724444, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.9620674356699203e-05, |
| "loss": 0.9342, |
| "mean_token_accuracy": 0.7574294097721577, |
| "num_tokens": 257959846.0, |
| "step": 2740 |
| }, |
| { |
| "entropy": 1.3511497721076011, |
| "epoch": 0.6101281269066504, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.9509760425909496e-05, |
| "loss": 0.9546, |
| "mean_token_accuracy": 0.7517549440264701, |
| "num_tokens": 258923804.0, |
| "step": 2750 |
| }, |
| { |
| "entropy": 1.3576786249876023, |
| "epoch": 0.6123467746408564, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.9398846495119788e-05, |
| "loss": 0.9499, |
| "mean_token_accuracy": 0.7557240962982178, |
| "num_tokens": 259860952.0, |
| "step": 2760 |
| }, |
| { |
| "entropy": 1.3472177743911744, |
| "epoch": 0.6145654223750624, |
| "grad_norm": 0.59375, |
| "learning_rate": 1.928793256433008e-05, |
| "loss": 0.9466, |
| "mean_token_accuracy": 0.753157027810812, |
| "num_tokens": 260785025.0, |
| "step": 2770 |
| }, |
| { |
| "entropy": 1.380058291554451, |
| "epoch": 0.6167840701092684, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.9177018633540372e-05, |
| "loss": 0.983, |
| "mean_token_accuracy": 0.7439537294209003, |
| "num_tokens": 261707332.0, |
| "step": 2780 |
| }, |
| { |
| "entropy": 1.3696980610489846, |
| "epoch": 0.6190027178434744, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.9066104702750667e-05, |
| "loss": 0.973, |
| "mean_token_accuracy": 0.7488272294402123, |
| "num_tokens": 262628859.0, |
| "step": 2790 |
| }, |
| { |
| "entropy": 1.3467194586992264, |
| "epoch": 0.6212213655776804, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.895519077196096e-05, |
| "loss": 0.9385, |
| "mean_token_accuracy": 0.7560124054551125, |
| "num_tokens": 263568807.0, |
| "step": 2800 |
| }, |
| { |
| "entropy": 1.3259218126535415, |
| "epoch": 0.6234400133118864, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.8844276841171252e-05, |
| "loss": 0.9512, |
| "mean_token_accuracy": 0.7530164457857609, |
| "num_tokens": 264503207.0, |
| "step": 2810 |
| }, |
| { |
| "entropy": 1.349274192750454, |
| "epoch": 0.6256586610460924, |
| "grad_norm": 0.5, |
| "learning_rate": 1.8733362910381544e-05, |
| "loss": 0.96, |
| "mean_token_accuracy": 0.7500286810100079, |
| "num_tokens": 265443978.0, |
| "step": 2820 |
| }, |
| { |
| "entropy": 1.3598796546459198, |
| "epoch": 0.6278773087802985, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.862244897959184e-05, |
| "loss": 0.9772, |
| "mean_token_accuracy": 0.7478482507169246, |
| "num_tokens": 266389592.0, |
| "step": 2830 |
| }, |
| { |
| "entropy": 1.3375118046998977, |
| "epoch": 0.6300959565145045, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.851153504880213e-05, |
| "loss": 0.9396, |
| "mean_token_accuracy": 0.7552093096077442, |
| "num_tokens": 267324146.0, |
| "step": 2840 |
| }, |
| { |
| "entropy": 1.3398489728569984, |
| "epoch": 0.6323146042487104, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.8400621118012424e-05, |
| "loss": 0.9375, |
| "mean_token_accuracy": 0.7564864322543144, |
| "num_tokens": 268270041.0, |
| "step": 2850 |
| }, |
| { |
| "entropy": 1.3224478855729103, |
| "epoch": 0.6345332519829164, |
| "grad_norm": 0.55859375, |
| "learning_rate": 1.8289707187222716e-05, |
| "loss": 0.9462, |
| "mean_token_accuracy": 0.7549590796232224, |
| "num_tokens": 269231597.0, |
| "step": 2860 |
| }, |
| { |
| "entropy": 1.3553704172372818, |
| "epoch": 0.6367518997171224, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.8178793256433008e-05, |
| "loss": 0.9589, |
| "mean_token_accuracy": 0.751991906017065, |
| "num_tokens": 270152001.0, |
| "step": 2870 |
| }, |
| { |
| "entropy": 1.3432944223284722, |
| "epoch": 0.6389705474513284, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.8067879325643303e-05, |
| "loss": 0.9621, |
| "mean_token_accuracy": 0.7513845339417458, |
| "num_tokens": 271087976.0, |
| "step": 2880 |
| }, |
| { |
| "entropy": 1.3790721513330937, |
| "epoch": 0.6411891951855344, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.7956965394853596e-05, |
| "loss": 0.9863, |
| "mean_token_accuracy": 0.74508848041296, |
| "num_tokens": 272035081.0, |
| "step": 2890 |
| }, |
| { |
| "entropy": 1.3692745730280875, |
| "epoch": 0.6434078429197404, |
| "grad_norm": 0.52734375, |
| "learning_rate": 1.7846051464063888e-05, |
| "loss": 0.9804, |
| "mean_token_accuracy": 0.7487337306141854, |
| "num_tokens": 272973482.0, |
| "step": 2900 |
| }, |
| { |
| "entropy": 1.3950363367795944, |
| "epoch": 0.6456264906539464, |
| "grad_norm": 0.55859375, |
| "learning_rate": 1.773513753327418e-05, |
| "loss": 0.9917, |
| "mean_token_accuracy": 0.7448577910661698, |
| "num_tokens": 273904331.0, |
| "step": 2910 |
| }, |
| { |
| "entropy": 1.3784946396946907, |
| "epoch": 0.6478451383881524, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.7624223602484475e-05, |
| "loss": 1.0087, |
| "mean_token_accuracy": 0.741528432816267, |
| "num_tokens": 274848669.0, |
| "step": 2920 |
| }, |
| { |
| "entropy": 1.3325315289199353, |
| "epoch": 0.6500637861223584, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.7513309671694767e-05, |
| "loss": 0.9466, |
| "mean_token_accuracy": 0.7518486715853214, |
| "num_tokens": 275803568.0, |
| "step": 2930 |
| }, |
| { |
| "entropy": 1.3600165903568269, |
| "epoch": 0.6522824338565644, |
| "grad_norm": 0.5625, |
| "learning_rate": 1.740239574090506e-05, |
| "loss": 0.9382, |
| "mean_token_accuracy": 0.7539416745305061, |
| "num_tokens": 276747925.0, |
| "step": 2940 |
| }, |
| { |
| "entropy": 1.3534336686134338, |
| "epoch": 0.6545010815907705, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.7291481810115352e-05, |
| "loss": 0.9704, |
| "mean_token_accuracy": 0.7500346690416336, |
| "num_tokens": 277658894.0, |
| "step": 2950 |
| }, |
| { |
| "entropy": 1.3526192732155322, |
| "epoch": 0.6567197293249765, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.7180567879325644e-05, |
| "loss": 0.9615, |
| "mean_token_accuracy": 0.7505016751587391, |
| "num_tokens": 278614364.0, |
| "step": 2960 |
| }, |
| { |
| "entropy": 1.3536822080612183, |
| "epoch": 0.6589383770591825, |
| "grad_norm": 0.5859375, |
| "learning_rate": 1.706965394853594e-05, |
| "loss": 0.9584, |
| "mean_token_accuracy": 0.7506825909018516, |
| "num_tokens": 279546133.0, |
| "step": 2970 |
| }, |
| { |
| "entropy": 1.3441800415515899, |
| "epoch": 0.6611570247933884, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.695874001774623e-05, |
| "loss": 0.9322, |
| "mean_token_accuracy": 0.7591280125081539, |
| "num_tokens": 280483436.0, |
| "step": 2980 |
| }, |
| { |
| "entropy": 1.3216261357069015, |
| "epoch": 0.6633756725275944, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.6847826086956524e-05, |
| "loss": 0.9491, |
| "mean_token_accuracy": 0.7539561577141285, |
| "num_tokens": 281450626.0, |
| "step": 2990 |
| }, |
| { |
| "entropy": 1.3525083124637605, |
| "epoch": 0.6655943202618004, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.6736912156166816e-05, |
| "loss": 0.9179, |
| "mean_token_accuracy": 0.7602526120841503, |
| "num_tokens": 282378418.0, |
| "step": 3000 |
| }, |
| { |
| "entropy": 1.350367258489132, |
| "epoch": 0.6678129679960064, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.6625998225377108e-05, |
| "loss": 0.9397, |
| "mean_token_accuracy": 0.7571302607655526, |
| "num_tokens": 283298771.0, |
| "step": 3010 |
| }, |
| { |
| "entropy": 1.3382517769932747, |
| "epoch": 0.6700316157302124, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.6515084294587403e-05, |
| "loss": 0.9536, |
| "mean_token_accuracy": 0.7520625948905945, |
| "num_tokens": 284243577.0, |
| "step": 3020 |
| }, |
| { |
| "entropy": 1.336366317421198, |
| "epoch": 0.6722502634644184, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.6404170363797696e-05, |
| "loss": 0.9375, |
| "mean_token_accuracy": 0.7568468548357487, |
| "num_tokens": 285185257.0, |
| "step": 3030 |
| }, |
| { |
| "entropy": 1.3323681712150575, |
| "epoch": 0.6744689111986244, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.6293256433007988e-05, |
| "loss": 0.932, |
| "mean_token_accuracy": 0.7574945628643036, |
| "num_tokens": 286121874.0, |
| "step": 3040 |
| }, |
| { |
| "entropy": 1.344571302831173, |
| "epoch": 0.6766875589328304, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.618234250221828e-05, |
| "loss": 0.9454, |
| "mean_token_accuracy": 0.7531527921557426, |
| "num_tokens": 287042084.0, |
| "step": 3050 |
| }, |
| { |
| "entropy": 1.3513332322239875, |
| "epoch": 0.6789062066670365, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.6071428571428572e-05, |
| "loss": 0.9615, |
| "mean_token_accuracy": 0.7513311177492141, |
| "num_tokens": 287961333.0, |
| "step": 3060 |
| }, |
| { |
| "entropy": 1.3252726949751377, |
| "epoch": 0.6811248544012425, |
| "grad_norm": 0.490234375, |
| "learning_rate": 1.5960514640638864e-05, |
| "loss": 0.9341, |
| "mean_token_accuracy": 0.7552036680281162, |
| "num_tokens": 288894800.0, |
| "step": 3070 |
| }, |
| { |
| "entropy": 1.3621705561876296, |
| "epoch": 0.6833435021354485, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.5849600709849156e-05, |
| "loss": 0.9659, |
| "mean_token_accuracy": 0.7510468997061253, |
| "num_tokens": 289837877.0, |
| "step": 3080 |
| }, |
| { |
| "entropy": 1.372152604162693, |
| "epoch": 0.6855621498696545, |
| "grad_norm": 0.515625, |
| "learning_rate": 1.573868677905945e-05, |
| "loss": 0.9908, |
| "mean_token_accuracy": 0.7456212192773819, |
| "num_tokens": 290768330.0, |
| "step": 3090 |
| }, |
| { |
| "entropy": 1.3613446295261382, |
| "epoch": 0.6877807976038605, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.5627772848269744e-05, |
| "loss": 0.9498, |
| "mean_token_accuracy": 0.7532825492322445, |
| "num_tokens": 291697499.0, |
| "step": 3100 |
| }, |
| { |
| "entropy": 1.3725149601697921, |
| "epoch": 0.6899994453380665, |
| "grad_norm": 0.52734375, |
| "learning_rate": 1.5516858917480036e-05, |
| "loss": 0.9747, |
| "mean_token_accuracy": 0.7483395658433437, |
| "num_tokens": 292632277.0, |
| "step": 3110 |
| }, |
| { |
| "entropy": 1.3413543090224267, |
| "epoch": 0.6922180930722724, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.5405944986690328e-05, |
| "loss": 0.9563, |
| "mean_token_accuracy": 0.7508202590048313, |
| "num_tokens": 293584069.0, |
| "step": 3120 |
| }, |
| { |
| "entropy": 1.352384202182293, |
| "epoch": 0.6944367408064784, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.529503105590062e-05, |
| "loss": 0.9654, |
| "mean_token_accuracy": 0.7493121877312661, |
| "num_tokens": 294513585.0, |
| "step": 3130 |
| }, |
| { |
| "entropy": 1.356651772558689, |
| "epoch": 0.6966553885406844, |
| "grad_norm": 0.578125, |
| "learning_rate": 1.5184117125110914e-05, |
| "loss": 0.9495, |
| "mean_token_accuracy": 0.7534554153680801, |
| "num_tokens": 295440578.0, |
| "step": 3140 |
| }, |
| { |
| "entropy": 1.335485778748989, |
| "epoch": 0.6988740362748904, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.5073203194321208e-05, |
| "loss": 0.9726, |
| "mean_token_accuracy": 0.7495904855430127, |
| "num_tokens": 296372981.0, |
| "step": 3150 |
| }, |
| { |
| "entropy": 1.343485713750124, |
| "epoch": 0.7010926840090964, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.4962289263531502e-05, |
| "loss": 0.9646, |
| "mean_token_accuracy": 0.7513713717460633, |
| "num_tokens": 297325689.0, |
| "step": 3160 |
| }, |
| { |
| "entropy": 1.363182956725359, |
| "epoch": 0.7033113317433024, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.4851375332741794e-05, |
| "loss": 0.9518, |
| "mean_token_accuracy": 0.7518307134509087, |
| "num_tokens": 298270698.0, |
| "step": 3170 |
| }, |
| { |
| "entropy": 1.3420901797711848, |
| "epoch": 0.7055299794775085, |
| "grad_norm": 0.55859375, |
| "learning_rate": 1.4740461401952086e-05, |
| "loss": 0.9716, |
| "mean_token_accuracy": 0.7465130612254143, |
| "num_tokens": 299197164.0, |
| "step": 3180 |
| }, |
| { |
| "entropy": 1.3738549813628196, |
| "epoch": 0.7077486272117145, |
| "grad_norm": 0.515625, |
| "learning_rate": 1.4629547471162378e-05, |
| "loss": 0.9738, |
| "mean_token_accuracy": 0.7482325688004494, |
| "num_tokens": 300152852.0, |
| "step": 3190 |
| }, |
| { |
| "entropy": 1.3018300041556359, |
| "epoch": 0.7099672749459205, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.4518633540372672e-05, |
| "loss": 0.907, |
| "mean_token_accuracy": 0.764003473520279, |
| "num_tokens": 301127407.0, |
| "step": 3200 |
| }, |
| { |
| "entropy": 1.342644067108631, |
| "epoch": 0.7121859226801265, |
| "grad_norm": 0.52734375, |
| "learning_rate": 1.4407719609582964e-05, |
| "loss": 0.9644, |
| "mean_token_accuracy": 0.7527099289000034, |
| "num_tokens": 302059360.0, |
| "step": 3210 |
| }, |
| { |
| "entropy": 1.3652416355907917, |
| "epoch": 0.7144045704143325, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.4296805678793256e-05, |
| "loss": 0.9425, |
| "mean_token_accuracy": 0.7537096805870533, |
| "num_tokens": 302987839.0, |
| "step": 3220 |
| }, |
| { |
| "entropy": 1.3176094248890877, |
| "epoch": 0.7166232181485385, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.4185891748003548e-05, |
| "loss": 0.9469, |
| "mean_token_accuracy": 0.7529924146831035, |
| "num_tokens": 303927433.0, |
| "step": 3230 |
| }, |
| { |
| "entropy": 1.3563083581626416, |
| "epoch": 0.7188418658827445, |
| "grad_norm": 0.50390625, |
| "learning_rate": 1.4074977817213844e-05, |
| "loss": 0.9656, |
| "mean_token_accuracy": 0.7512292198836803, |
| "num_tokens": 304897121.0, |
| "step": 3240 |
| }, |
| { |
| "entropy": 1.3360683649778367, |
| "epoch": 0.7210605136169504, |
| "grad_norm": 0.60546875, |
| "learning_rate": 1.3964063886424136e-05, |
| "loss": 0.9356, |
| "mean_token_accuracy": 0.7564455397427082, |
| "num_tokens": 305845949.0, |
| "step": 3250 |
| }, |
| { |
| "entropy": 1.3641312032938004, |
| "epoch": 0.7232791613511564, |
| "grad_norm": 0.578125, |
| "learning_rate": 1.3853149955634428e-05, |
| "loss": 1.0009, |
| "mean_token_accuracy": 0.7445311717689037, |
| "num_tokens": 306770481.0, |
| "step": 3260 |
| }, |
| { |
| "entropy": 1.3404412433505057, |
| "epoch": 0.7254978090853624, |
| "grad_norm": 0.56640625, |
| "learning_rate": 1.374223602484472e-05, |
| "loss": 0.948, |
| "mean_token_accuracy": 0.7560093238949775, |
| "num_tokens": 307705021.0, |
| "step": 3270 |
| }, |
| { |
| "entropy": 1.343174346536398, |
| "epoch": 0.7277164568195684, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.3631322094055012e-05, |
| "loss": 0.9282, |
| "mean_token_accuracy": 0.7588741101324559, |
| "num_tokens": 308647182.0, |
| "step": 3280 |
| }, |
| { |
| "entropy": 1.3446429327130318, |
| "epoch": 0.7299351045537745, |
| "grad_norm": 0.490234375, |
| "learning_rate": 1.3520408163265308e-05, |
| "loss": 0.9535, |
| "mean_token_accuracy": 0.7525325618684292, |
| "num_tokens": 309593575.0, |
| "step": 3290 |
| }, |
| { |
| "entropy": 1.3387797683477403, |
| "epoch": 0.7321537522879805, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.34094942324756e-05, |
| "loss": 0.9583, |
| "mean_token_accuracy": 0.7520524263381958, |
| "num_tokens": 310549256.0, |
| "step": 3300 |
| }, |
| { |
| "entropy": 1.371607707440853, |
| "epoch": 0.7343724000221865, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.3298580301685892e-05, |
| "loss": 0.9565, |
| "mean_token_accuracy": 0.7507821291685104, |
| "num_tokens": 311487519.0, |
| "step": 3310 |
| }, |
| { |
| "entropy": 1.3396147727966308, |
| "epoch": 0.7365910477563925, |
| "grad_norm": 0.60546875, |
| "learning_rate": 1.3187666370896184e-05, |
| "loss": 0.9704, |
| "mean_token_accuracy": 0.7495545491576194, |
| "num_tokens": 312433352.0, |
| "step": 3320 |
| }, |
| { |
| "entropy": 1.3545660354197024, |
| "epoch": 0.7388096954905985, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.3076752440106476e-05, |
| "loss": 0.9416, |
| "mean_token_accuracy": 0.7558687753975392, |
| "num_tokens": 313376390.0, |
| "step": 3330 |
| }, |
| { |
| "entropy": 1.3706799075007439, |
| "epoch": 0.7410283432248045, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.2965838509316772e-05, |
| "loss": 0.9826, |
| "mean_token_accuracy": 0.7450837090611457, |
| "num_tokens": 314320815.0, |
| "step": 3340 |
| }, |
| { |
| "entropy": 1.3725864320993424, |
| "epoch": 0.7432469909590105, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.2854924578527064e-05, |
| "loss": 0.9775, |
| "mean_token_accuracy": 0.7485952161252498, |
| "num_tokens": 315291123.0, |
| "step": 3350 |
| }, |
| { |
| "entropy": 1.3556952878832818, |
| "epoch": 0.7454656386932165, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.2744010647737356e-05, |
| "loss": 0.9683, |
| "mean_token_accuracy": 0.7492410965263844, |
| "num_tokens": 316236020.0, |
| "step": 3360 |
| }, |
| { |
| "entropy": 1.349064838141203, |
| "epoch": 0.7476842864274225, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.2633096716947648e-05, |
| "loss": 0.9704, |
| "mean_token_accuracy": 0.7494482189416886, |
| "num_tokens": 317154910.0, |
| "step": 3370 |
| }, |
| { |
| "entropy": 1.359015841037035, |
| "epoch": 0.7499029341616285, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.2522182786157944e-05, |
| "loss": 0.9641, |
| "mean_token_accuracy": 0.749902281910181, |
| "num_tokens": 318080921.0, |
| "step": 3380 |
| }, |
| { |
| "entropy": 1.3636605456471442, |
| "epoch": 0.7521215818958344, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.2411268855368236e-05, |
| "loss": 0.9644, |
| "mean_token_accuracy": 0.7513450764119625, |
| "num_tokens": 319014412.0, |
| "step": 3390 |
| }, |
| { |
| "entropy": 1.3377082630991937, |
| "epoch": 0.7543402296300404, |
| "grad_norm": 0.515625, |
| "learning_rate": 1.2300354924578528e-05, |
| "loss": 0.946, |
| "mean_token_accuracy": 0.7537905521690845, |
| "num_tokens": 319955427.0, |
| "step": 3400 |
| }, |
| { |
| "entropy": 1.3234972402453422, |
| "epoch": 0.7565588773642465, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.218944099378882e-05, |
| "loss": 0.9414, |
| "mean_token_accuracy": 0.7541356466710567, |
| "num_tokens": 320934497.0, |
| "step": 3410 |
| }, |
| { |
| "entropy": 1.3440752558410167, |
| "epoch": 0.7587775250984525, |
| "grad_norm": 0.5546875, |
| "learning_rate": 1.2078527062999114e-05, |
| "loss": 0.9503, |
| "mean_token_accuracy": 0.7518649064004421, |
| "num_tokens": 321880491.0, |
| "step": 3420 |
| }, |
| { |
| "entropy": 1.3397350490093232, |
| "epoch": 0.7609961728326585, |
| "grad_norm": 0.51953125, |
| "learning_rate": 1.1967613132209406e-05, |
| "loss": 0.9324, |
| "mean_token_accuracy": 0.7557294942438603, |
| "num_tokens": 322803732.0, |
| "step": 3430 |
| }, |
| { |
| "entropy": 1.3109237834811212, |
| "epoch": 0.7632148205668645, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.18566992014197e-05, |
| "loss": 0.9228, |
| "mean_token_accuracy": 0.7610769435763359, |
| "num_tokens": 323769648.0, |
| "step": 3440 |
| }, |
| { |
| "entropy": 1.3633039817214012, |
| "epoch": 0.7654334683010705, |
| "grad_norm": 0.52734375, |
| "learning_rate": 1.1745785270629992e-05, |
| "loss": 0.9921, |
| "mean_token_accuracy": 0.7444672405719757, |
| "num_tokens": 324712776.0, |
| "step": 3450 |
| }, |
| { |
| "entropy": 1.3648219130933286, |
| "epoch": 0.7676521160352765, |
| "grad_norm": 0.55078125, |
| "learning_rate": 1.1634871339840284e-05, |
| "loss": 0.9942, |
| "mean_token_accuracy": 0.744285186380148, |
| "num_tokens": 325639116.0, |
| "step": 3460 |
| }, |
| { |
| "entropy": 1.3753913044929504, |
| "epoch": 0.7698707637694825, |
| "grad_norm": 0.56640625, |
| "learning_rate": 1.1523957409050576e-05, |
| "loss": 0.9669, |
| "mean_token_accuracy": 0.7503029778599739, |
| "num_tokens": 326579098.0, |
| "step": 3470 |
| }, |
| { |
| "entropy": 1.3312873490154744, |
| "epoch": 0.7720894115036885, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.141304347826087e-05, |
| "loss": 0.9488, |
| "mean_token_accuracy": 0.7541476741433144, |
| "num_tokens": 327516490.0, |
| "step": 3480 |
| }, |
| { |
| "entropy": 1.3498370356857776, |
| "epoch": 0.7743080592378945, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.1302129547471162e-05, |
| "loss": 0.9738, |
| "mean_token_accuracy": 0.7493281632661819, |
| "num_tokens": 328443057.0, |
| "step": 3490 |
| }, |
| { |
| "entropy": 1.3415059983730315, |
| "epoch": 0.7765267069721005, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.1191215616681455e-05, |
| "loss": 0.9392, |
| "mean_token_accuracy": 0.7565719000995159, |
| "num_tokens": 329389868.0, |
| "step": 3500 |
| }, |
| { |
| "entropy": 1.3868108600378037, |
| "epoch": 0.7787453547063065, |
| "grad_norm": 0.52734375, |
| "learning_rate": 1.1080301685891748e-05, |
| "loss": 1.0112, |
| "mean_token_accuracy": 0.7436525091528893, |
| "num_tokens": 330333754.0, |
| "step": 3510 |
| }, |
| { |
| "entropy": 1.353071667253971, |
| "epoch": 0.7809640024405126, |
| "grad_norm": 0.57421875, |
| "learning_rate": 1.096938775510204e-05, |
| "loss": 0.9435, |
| "mean_token_accuracy": 0.7540925681591034, |
| "num_tokens": 331254469.0, |
| "step": 3520 |
| }, |
| { |
| "entropy": 1.3132469408214091, |
| "epoch": 0.7831826501747186, |
| "grad_norm": 0.54296875, |
| "learning_rate": 1.0858473824312334e-05, |
| "loss": 0.9211, |
| "mean_token_accuracy": 0.7597164355218411, |
| "num_tokens": 332195343.0, |
| "step": 3530 |
| }, |
| { |
| "entropy": 1.322484378516674, |
| "epoch": 0.7854012979089245, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.0747559893522626e-05, |
| "loss": 0.9358, |
| "mean_token_accuracy": 0.7559656046330929, |
| "num_tokens": 333130438.0, |
| "step": 3540 |
| }, |
| { |
| "entropy": 1.3583971813321114, |
| "epoch": 0.7876199456431305, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.063664596273292e-05, |
| "loss": 0.944, |
| "mean_token_accuracy": 0.7558795347809791, |
| "num_tokens": 334072646.0, |
| "step": 3550 |
| }, |
| { |
| "entropy": 1.3520539619028569, |
| "epoch": 0.7898385933773365, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.0525732031943212e-05, |
| "loss": 0.9802, |
| "mean_token_accuracy": 0.7473956875503063, |
| "num_tokens": 335011200.0, |
| "step": 3560 |
| }, |
| { |
| "entropy": 1.3791773080825807, |
| "epoch": 0.7920572411115425, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.0414818101153505e-05, |
| "loss": 0.9912, |
| "mean_token_accuracy": 0.7445360422134399, |
| "num_tokens": 335949808.0, |
| "step": 3570 |
| }, |
| { |
| "entropy": 1.30967488437891, |
| "epoch": 0.7942758888457485, |
| "grad_norm": 0.5234375, |
| "learning_rate": 1.0303904170363798e-05, |
| "loss": 0.9029, |
| "mean_token_accuracy": 0.761937515437603, |
| "num_tokens": 336904248.0, |
| "step": 3580 |
| }, |
| { |
| "entropy": 1.3683781877160073, |
| "epoch": 0.7964945365799545, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.019299023957409e-05, |
| "loss": 0.9608, |
| "mean_token_accuracy": 0.7519945807754993, |
| "num_tokens": 337849157.0, |
| "step": 3590 |
| }, |
| { |
| "entropy": 1.3160683244466782, |
| "epoch": 0.7987131843141605, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.0082076308784384e-05, |
| "loss": 0.928, |
| "mean_token_accuracy": 0.7593866750597954, |
| "num_tokens": 338799972.0, |
| "step": 3600 |
| }, |
| { |
| "entropy": 1.3837224870920182, |
| "epoch": 0.8009318320483665, |
| "grad_norm": 0.5703125, |
| "learning_rate": 9.971162377994676e-06, |
| "loss": 0.9794, |
| "mean_token_accuracy": 0.7475892208516598, |
| "num_tokens": 339729332.0, |
| "step": 3610 |
| }, |
| { |
| "entropy": 1.3449356317520142, |
| "epoch": 0.8031504797825725, |
| "grad_norm": 0.51953125, |
| "learning_rate": 9.86024844720497e-06, |
| "loss": 0.9435, |
| "mean_token_accuracy": 0.7529967434704303, |
| "num_tokens": 340656347.0, |
| "step": 3620 |
| }, |
| { |
| "entropy": 1.3135579869151115, |
| "epoch": 0.8053691275167785, |
| "grad_norm": 0.52734375, |
| "learning_rate": 9.749334516415262e-06, |
| "loss": 0.905, |
| "mean_token_accuracy": 0.7636351682245731, |
| "num_tokens": 341603645.0, |
| "step": 3630 |
| }, |
| { |
| "entropy": 1.3562857955694199, |
| "epoch": 0.8075877752509846, |
| "grad_norm": 0.53515625, |
| "learning_rate": 9.638420585625555e-06, |
| "loss": 0.9654, |
| "mean_token_accuracy": 0.7500083535909653, |
| "num_tokens": 342551945.0, |
| "step": 3640 |
| }, |
| { |
| "entropy": 1.355036635696888, |
| "epoch": 0.8098064229851906, |
| "grad_norm": 0.55859375, |
| "learning_rate": 9.527506654835848e-06, |
| "loss": 0.9783, |
| "mean_token_accuracy": 0.747504611313343, |
| "num_tokens": 343501214.0, |
| "step": 3650 |
| }, |
| { |
| "entropy": 1.3850376293063165, |
| "epoch": 0.8120250707193966, |
| "grad_norm": 0.53515625, |
| "learning_rate": 9.41659272404614e-06, |
| "loss": 0.9813, |
| "mean_token_accuracy": 0.7430158272385597, |
| "num_tokens": 344479426.0, |
| "step": 3660 |
| }, |
| { |
| "entropy": 1.35298143774271, |
| "epoch": 0.8142437184536025, |
| "grad_norm": 0.54296875, |
| "learning_rate": 9.305678793256434e-06, |
| "loss": 0.9528, |
| "mean_token_accuracy": 0.75439862459898, |
| "num_tokens": 345406732.0, |
| "step": 3670 |
| }, |
| { |
| "entropy": 1.3408295065164566, |
| "epoch": 0.8164623661878085, |
| "grad_norm": 0.52734375, |
| "learning_rate": 9.194764862466726e-06, |
| "loss": 0.9464, |
| "mean_token_accuracy": 0.7534433856606484, |
| "num_tokens": 346375091.0, |
| "step": 3680 |
| }, |
| { |
| "entropy": 1.3690178409218787, |
| "epoch": 0.8186810139220145, |
| "grad_norm": 0.54296875, |
| "learning_rate": 9.08385093167702e-06, |
| "loss": 0.9794, |
| "mean_token_accuracy": 0.7499176189303398, |
| "num_tokens": 347327768.0, |
| "step": 3690 |
| }, |
| { |
| "entropy": 1.3406174167990685, |
| "epoch": 0.8208996616562205, |
| "grad_norm": 0.546875, |
| "learning_rate": 8.972937000887312e-06, |
| "loss": 0.9237, |
| "mean_token_accuracy": 0.7583520159125328, |
| "num_tokens": 348246799.0, |
| "step": 3700 |
| }, |
| { |
| "entropy": 1.3822472810745239, |
| "epoch": 0.8231183093904265, |
| "grad_norm": 0.57421875, |
| "learning_rate": 8.862023070097605e-06, |
| "loss": 0.9984, |
| "mean_token_accuracy": 0.7432019256055356, |
| "num_tokens": 349172608.0, |
| "step": 3710 |
| }, |
| { |
| "entropy": 1.3216811880469321, |
| "epoch": 0.8253369571246325, |
| "grad_norm": 0.53515625, |
| "learning_rate": 8.751109139307898e-06, |
| "loss": 0.9271, |
| "mean_token_accuracy": 0.758989142626524, |
| "num_tokens": 350123406.0, |
| "step": 3720 |
| }, |
| { |
| "entropy": 1.2982059597969056, |
| "epoch": 0.8275556048588385, |
| "grad_norm": 0.53125, |
| "learning_rate": 8.64019520851819e-06, |
| "loss": 0.8997, |
| "mean_token_accuracy": 0.7647782519459725, |
| "num_tokens": 351066848.0, |
| "step": 3730 |
| }, |
| { |
| "entropy": 1.3314955472946166, |
| "epoch": 0.8297742525930445, |
| "grad_norm": 0.54296875, |
| "learning_rate": 8.529281277728483e-06, |
| "loss": 0.9526, |
| "mean_token_accuracy": 0.7523629620671273, |
| "num_tokens": 351999813.0, |
| "step": 3740 |
| }, |
| { |
| "entropy": 1.35967206209898, |
| "epoch": 0.8319929003272506, |
| "grad_norm": 0.56640625, |
| "learning_rate": 8.418367346938775e-06, |
| "loss": 0.9813, |
| "mean_token_accuracy": 0.7480250895023346, |
| "num_tokens": 352930626.0, |
| "step": 3750 |
| }, |
| { |
| "entropy": 1.3411589175462724, |
| "epoch": 0.8342115480614566, |
| "grad_norm": 0.55859375, |
| "learning_rate": 8.307453416149069e-06, |
| "loss": 0.9699, |
| "mean_token_accuracy": 0.748241176456213, |
| "num_tokens": 353873348.0, |
| "step": 3760 |
| }, |
| { |
| "entropy": 1.3526584044098855, |
| "epoch": 0.8364301957956626, |
| "grad_norm": 0.53515625, |
| "learning_rate": 8.19653948535936e-06, |
| "loss": 0.9759, |
| "mean_token_accuracy": 0.7478196188807488, |
| "num_tokens": 354803544.0, |
| "step": 3770 |
| }, |
| { |
| "entropy": 1.3394062861800193, |
| "epoch": 0.8386488435298686, |
| "grad_norm": 0.5625, |
| "learning_rate": 8.085625554569655e-06, |
| "loss": 0.9535, |
| "mean_token_accuracy": 0.7555646121501922, |
| "num_tokens": 355731286.0, |
| "step": 3780 |
| }, |
| { |
| "entropy": 1.3712951876223087, |
| "epoch": 0.8408674912640746, |
| "grad_norm": 0.53125, |
| "learning_rate": 7.974711623779947e-06, |
| "loss": 0.9772, |
| "mean_token_accuracy": 0.7479187317192555, |
| "num_tokens": 356667594.0, |
| "step": 3790 |
| }, |
| { |
| "entropy": 1.3195544198155402, |
| "epoch": 0.8430861389982806, |
| "grad_norm": 0.51171875, |
| "learning_rate": 7.863797692990239e-06, |
| "loss": 0.9468, |
| "mean_token_accuracy": 0.7531268313527107, |
| "num_tokens": 357589764.0, |
| "step": 3800 |
| }, |
| { |
| "entropy": 1.3623077616095542, |
| "epoch": 0.8453047867324865, |
| "grad_norm": 0.5703125, |
| "learning_rate": 7.752883762200533e-06, |
| "loss": 0.9927, |
| "mean_token_accuracy": 0.7447442330420018, |
| "num_tokens": 358546216.0, |
| "step": 3810 |
| }, |
| { |
| "entropy": 1.3607013449072838, |
| "epoch": 0.8475234344666925, |
| "grad_norm": 0.5625, |
| "learning_rate": 7.641969831410825e-06, |
| "loss": 0.9416, |
| "mean_token_accuracy": 0.7566105239093304, |
| "num_tokens": 359495367.0, |
| "step": 3820 |
| }, |
| { |
| "entropy": 1.348987601697445, |
| "epoch": 0.8497420822008985, |
| "grad_norm": 0.484375, |
| "learning_rate": 7.5310559006211186e-06, |
| "loss": 0.9343, |
| "mean_token_accuracy": 0.7575232580304145, |
| "num_tokens": 360442276.0, |
| "step": 3830 |
| }, |
| { |
| "entropy": 1.3610796511173249, |
| "epoch": 0.8519607299351045, |
| "grad_norm": 0.51953125, |
| "learning_rate": 7.420141969831411e-06, |
| "loss": 0.9372, |
| "mean_token_accuracy": 0.756447360664606, |
| "num_tokens": 361377342.0, |
| "step": 3840 |
| }, |
| { |
| "entropy": 1.3527425512671472, |
| "epoch": 0.8541793776693105, |
| "grad_norm": 0.53515625, |
| "learning_rate": 7.3092280390417045e-06, |
| "loss": 0.9495, |
| "mean_token_accuracy": 0.7547285988926887, |
| "num_tokens": 362298440.0, |
| "step": 3850 |
| }, |
| { |
| "entropy": 1.330655214190483, |
| "epoch": 0.8563980254035165, |
| "grad_norm": 0.51171875, |
| "learning_rate": 7.198314108251997e-06, |
| "loss": 0.9475, |
| "mean_token_accuracy": 0.751707597821951, |
| "num_tokens": 363228367.0, |
| "step": 3860 |
| }, |
| { |
| "entropy": 1.3436040908098221, |
| "epoch": 0.8586166731377226, |
| "grad_norm": 0.48828125, |
| "learning_rate": 7.0874001774622905e-06, |
| "loss": 0.9536, |
| "mean_token_accuracy": 0.7511266514658927, |
| "num_tokens": 364167204.0, |
| "step": 3870 |
| }, |
| { |
| "entropy": 1.3443495616316796, |
| "epoch": 0.8608353208719286, |
| "grad_norm": 0.54296875, |
| "learning_rate": 6.976486246672583e-06, |
| "loss": 0.9512, |
| "mean_token_accuracy": 0.7544127158820629, |
| "num_tokens": 365144075.0, |
| "step": 3880 |
| }, |
| { |
| "entropy": 1.3494714990258216, |
| "epoch": 0.8630539686061346, |
| "grad_norm": 0.5390625, |
| "learning_rate": 6.865572315882875e-06, |
| "loss": 0.951, |
| "mean_token_accuracy": 0.752277635782957, |
| "num_tokens": 366069039.0, |
| "step": 3890 |
| }, |
| { |
| "entropy": 1.3707938618957995, |
| "epoch": 0.8652726163403406, |
| "grad_norm": 0.5859375, |
| "learning_rate": 6.7546583850931686e-06, |
| "loss": 0.9935, |
| "mean_token_accuracy": 0.7460488043725491, |
| "num_tokens": 366994185.0, |
| "step": 3900 |
| }, |
| { |
| "entropy": 1.3302705749869346, |
| "epoch": 0.8674912640745466, |
| "grad_norm": 0.5078125, |
| "learning_rate": 6.643744454303461e-06, |
| "loss": 0.9403, |
| "mean_token_accuracy": 0.7569159217178821, |
| "num_tokens": 367932317.0, |
| "step": 3910 |
| }, |
| { |
| "entropy": 1.3517090238630771, |
| "epoch": 0.8697099118087526, |
| "grad_norm": 0.54296875, |
| "learning_rate": 6.532830523513754e-06, |
| "loss": 0.9539, |
| "mean_token_accuracy": 0.7541409082710743, |
| "num_tokens": 368888419.0, |
| "step": 3920 |
| }, |
| { |
| "entropy": 1.365368028730154, |
| "epoch": 0.8719285595429586, |
| "grad_norm": 0.55859375, |
| "learning_rate": 6.421916592724047e-06, |
| "loss": 0.975, |
| "mean_token_accuracy": 0.7489493399858475, |
| "num_tokens": 369809659.0, |
| "step": 3930 |
| }, |
| { |
| "entropy": 1.363468910753727, |
| "epoch": 0.8741472072771646, |
| "grad_norm": 0.578125, |
| "learning_rate": 6.31100266193434e-06, |
| "loss": 0.9687, |
| "mean_token_accuracy": 0.7492878220975399, |
| "num_tokens": 370758628.0, |
| "step": 3940 |
| }, |
| { |
| "entropy": 1.3409071058034896, |
| "epoch": 0.8763658550113705, |
| "grad_norm": 0.56640625, |
| "learning_rate": 6.200088731144632e-06, |
| "loss": 0.9425, |
| "mean_token_accuracy": 0.7558536991477013, |
| "num_tokens": 371684631.0, |
| "step": 3950 |
| }, |
| { |
| "entropy": 1.3250400580465793, |
| "epoch": 0.8785845027455765, |
| "grad_norm": 0.53515625, |
| "learning_rate": 6.089174800354925e-06, |
| "loss": 0.9554, |
| "mean_token_accuracy": 0.7519582070410251, |
| "num_tokens": 372645749.0, |
| "step": 3960 |
| }, |
| { |
| "entropy": 1.3622069828212262, |
| "epoch": 0.8808031504797825, |
| "grad_norm": 0.55859375, |
| "learning_rate": 5.978260869565218e-06, |
| "loss": 0.974, |
| "mean_token_accuracy": 0.7483527101576328, |
| "num_tokens": 373579688.0, |
| "step": 3970 |
| }, |
| { |
| "entropy": 1.3249136090278626, |
| "epoch": 0.8830217982139886, |
| "grad_norm": 0.52734375, |
| "learning_rate": 5.867346938775511e-06, |
| "loss": 0.9481, |
| "mean_token_accuracy": 0.7574851214885712, |
| "num_tokens": 374523490.0, |
| "step": 3980 |
| }, |
| { |
| "entropy": 1.3423442378640176, |
| "epoch": 0.8852404459481946, |
| "grad_norm": 0.515625, |
| "learning_rate": 5.756433007985803e-06, |
| "loss": 0.9604, |
| "mean_token_accuracy": 0.7507563464343547, |
| "num_tokens": 375480069.0, |
| "step": 3990 |
| }, |
| { |
| "entropy": 1.3690859913825988, |
| "epoch": 0.8874590936824006, |
| "grad_norm": 0.53515625, |
| "learning_rate": 5.645519077196096e-06, |
| "loss": 0.9424, |
| "mean_token_accuracy": 0.7560895748436451, |
| "num_tokens": 376414915.0, |
| "step": 4000 |
| }, |
| { |
| "entropy": 1.377838420122862, |
| "epoch": 0.8896777414166066, |
| "grad_norm": 0.54296875, |
| "learning_rate": 5.534605146406389e-06, |
| "loss": 0.9678, |
| "mean_token_accuracy": 0.7493596062064171, |
| "num_tokens": 377345183.0, |
| "step": 4010 |
| }, |
| { |
| "entropy": 1.3701353058218957, |
| "epoch": 0.8918963891508126, |
| "grad_norm": 0.55078125, |
| "learning_rate": 5.423691215616682e-06, |
| "loss": 0.9638, |
| "mean_token_accuracy": 0.7514446713030338, |
| "num_tokens": 378293994.0, |
| "step": 4020 |
| }, |
| { |
| "entropy": 1.3063566341996193, |
| "epoch": 0.8941150368850186, |
| "grad_norm": 0.5546875, |
| "learning_rate": 5.312777284826975e-06, |
| "loss": 0.9353, |
| "mean_token_accuracy": 0.7562219582498073, |
| "num_tokens": 379256824.0, |
| "step": 4030 |
| }, |
| { |
| "entropy": 1.3382435604929923, |
| "epoch": 0.8963336846192246, |
| "grad_norm": 0.55859375, |
| "learning_rate": 5.201863354037268e-06, |
| "loss": 0.9604, |
| "mean_token_accuracy": 0.751346006244421, |
| "num_tokens": 380227652.0, |
| "step": 4040 |
| }, |
| { |
| "entropy": 1.331801988184452, |
| "epoch": 0.8985523323534306, |
| "grad_norm": 0.515625, |
| "learning_rate": 5.090949423247561e-06, |
| "loss": 0.94, |
| "mean_token_accuracy": 0.7547981061041356, |
| "num_tokens": 381192630.0, |
| "step": 4050 |
| }, |
| { |
| "entropy": 1.3264615371823312, |
| "epoch": 0.9007709800876366, |
| "grad_norm": 0.51953125, |
| "learning_rate": 4.980035492457853e-06, |
| "loss": 0.9421, |
| "mean_token_accuracy": 0.7552372604608536, |
| "num_tokens": 382131792.0, |
| "step": 4060 |
| }, |
| { |
| "entropy": 1.3523736476898194, |
| "epoch": 0.9029896278218426, |
| "grad_norm": 0.5625, |
| "learning_rate": 4.869121561668146e-06, |
| "loss": 0.9506, |
| "mean_token_accuracy": 0.7518483199179172, |
| "num_tokens": 383067523.0, |
| "step": 4070 |
| }, |
| { |
| "entropy": 1.3546856120228767, |
| "epoch": 0.9052082755560485, |
| "grad_norm": 0.515625, |
| "learning_rate": 4.758207630878438e-06, |
| "loss": 0.9454, |
| "mean_token_accuracy": 0.7534751631319523, |
| "num_tokens": 384006299.0, |
| "step": 4080 |
| }, |
| { |
| "entropy": 1.3601078018546104, |
| "epoch": 0.9074269232902545, |
| "grad_norm": 0.5859375, |
| "learning_rate": 4.647293700088731e-06, |
| "loss": 0.9405, |
| "mean_token_accuracy": 0.754411680996418, |
| "num_tokens": 384947487.0, |
| "step": 4090 |
| }, |
| { |
| "entropy": 1.339237504452467, |
| "epoch": 0.9096455710244606, |
| "grad_norm": 0.515625, |
| "learning_rate": 4.536379769299024e-06, |
| "loss": 0.9384, |
| "mean_token_accuracy": 0.7560152366757393, |
| "num_tokens": 385874176.0, |
| "step": 4100 |
| }, |
| { |
| "entropy": 1.3611842297017573, |
| "epoch": 0.9118642187586666, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.425465838509317e-06, |
| "loss": 0.9453, |
| "mean_token_accuracy": 0.7545816585421562, |
| "num_tokens": 386816538.0, |
| "step": 4110 |
| }, |
| { |
| "entropy": 1.3051216751337051, |
| "epoch": 0.9140828664928726, |
| "grad_norm": 0.51171875, |
| "learning_rate": 4.31455190771961e-06, |
| "loss": 0.8994, |
| "mean_token_accuracy": 0.7656806372106075, |
| "num_tokens": 387775511.0, |
| "step": 4120 |
| }, |
| { |
| "entropy": 1.3420870661735536, |
| "epoch": 0.9163015142270786, |
| "grad_norm": 0.5390625, |
| "learning_rate": 4.203637976929903e-06, |
| "loss": 0.9343, |
| "mean_token_accuracy": 0.7567372977733612, |
| "num_tokens": 388685069.0, |
| "step": 4130 |
| }, |
| { |
| "entropy": 1.3393280230462552, |
| "epoch": 0.9185201619612846, |
| "grad_norm": 0.51171875, |
| "learning_rate": 4.092724046140196e-06, |
| "loss": 0.9264, |
| "mean_token_accuracy": 0.7575048118829727, |
| "num_tokens": 389642225.0, |
| "step": 4140 |
| }, |
| { |
| "entropy": 1.312432309985161, |
| "epoch": 0.9207388096954906, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.981810115350488e-06, |
| "loss": 0.9282, |
| "mean_token_accuracy": 0.7600929595530033, |
| "num_tokens": 390590909.0, |
| "step": 4150 |
| }, |
| { |
| "entropy": 1.3392370440065862, |
| "epoch": 0.9229574574296966, |
| "grad_norm": 0.5625, |
| "learning_rate": 3.870896184560781e-06, |
| "loss": 0.9476, |
| "mean_token_accuracy": 0.7553087763488293, |
| "num_tokens": 391532202.0, |
| "step": 4160 |
| }, |
| { |
| "entropy": 1.3347293518483638, |
| "epoch": 0.9251761051639026, |
| "grad_norm": 0.53125, |
| "learning_rate": 3.759982253771074e-06, |
| "loss": 0.959, |
| "mean_token_accuracy": 0.7549694336950779, |
| "num_tokens": 392487451.0, |
| "step": 4170 |
| }, |
| { |
| "entropy": 1.3385291382670403, |
| "epoch": 0.9273947528981086, |
| "grad_norm": 3.21875, |
| "learning_rate": 3.6490683229813664e-06, |
| "loss": 0.9723, |
| "mean_token_accuracy": 0.7489883296191693, |
| "num_tokens": 393424376.0, |
| "step": 4180 |
| }, |
| { |
| "entropy": 1.3224166721105575, |
| "epoch": 0.9296134006323146, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.5381543921916594e-06, |
| "loss": 0.9096, |
| "mean_token_accuracy": 0.7614037752151489, |
| "num_tokens": 394361746.0, |
| "step": 4190 |
| }, |
| { |
| "entropy": 1.3364241227507592, |
| "epoch": 0.9318320483665206, |
| "grad_norm": 0.53125, |
| "learning_rate": 3.4272404614019524e-06, |
| "loss": 0.9491, |
| "mean_token_accuracy": 0.7532857812941074, |
| "num_tokens": 395307042.0, |
| "step": 4200 |
| }, |
| { |
| "entropy": 1.3627421900629997, |
| "epoch": 0.9340506961007266, |
| "grad_norm": 0.5234375, |
| "learning_rate": 3.3163265306122454e-06, |
| "loss": 0.9864, |
| "mean_token_accuracy": 0.7476166844367981, |
| "num_tokens": 396250195.0, |
| "step": 4210 |
| }, |
| { |
| "entropy": 1.3614855892956257, |
| "epoch": 0.9362693438349327, |
| "grad_norm": 0.53515625, |
| "learning_rate": 3.2054125998225384e-06, |
| "loss": 0.9671, |
| "mean_token_accuracy": 0.7500945217907429, |
| "num_tokens": 397188536.0, |
| "step": 4220 |
| }, |
| { |
| "entropy": 1.2906481601297854, |
| "epoch": 0.9384879915691386, |
| "grad_norm": 0.486328125, |
| "learning_rate": 3.094498669032831e-06, |
| "loss": 0.9289, |
| "mean_token_accuracy": 0.7579261489212513, |
| "num_tokens": 398160424.0, |
| "step": 4230 |
| }, |
| { |
| "entropy": 1.3569138646125793, |
| "epoch": 0.9407066393033446, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.9835847382431235e-06, |
| "loss": 0.9937, |
| "mean_token_accuracy": 0.7468014664947986, |
| "num_tokens": 399138573.0, |
| "step": 4240 |
| }, |
| { |
| "entropy": 1.3754788801074027, |
| "epoch": 0.9429252870375506, |
| "grad_norm": 1.96875, |
| "learning_rate": 2.872670807453416e-06, |
| "loss": 0.9847, |
| "mean_token_accuracy": 0.7449347853660584, |
| "num_tokens": 400072373.0, |
| "step": 4250 |
| }, |
| { |
| "entropy": 1.3287566512823106, |
| "epoch": 0.9451439347717566, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.761756876663709e-06, |
| "loss": 0.9585, |
| "mean_token_accuracy": 0.7522503368556499, |
| "num_tokens": 401010419.0, |
| "step": 4260 |
| }, |
| { |
| "entropy": 1.359559991955757, |
| "epoch": 0.9473625825059626, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.650842945874002e-06, |
| "loss": 0.9659, |
| "mean_token_accuracy": 0.7480006530880928, |
| "num_tokens": 401980514.0, |
| "step": 4270 |
| }, |
| { |
| "entropy": 1.3255119130015374, |
| "epoch": 0.9495812302401686, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.539929015084295e-06, |
| "loss": 0.9165, |
| "mean_token_accuracy": 0.7598443776369095, |
| "num_tokens": 402934393.0, |
| "step": 4280 |
| }, |
| { |
| "entropy": 1.314503613859415, |
| "epoch": 0.9517998779743746, |
| "grad_norm": 0.546875, |
| "learning_rate": 2.4290150842945875e-06, |
| "loss": 0.9198, |
| "mean_token_accuracy": 0.7572920247912407, |
| "num_tokens": 403881438.0, |
| "step": 4290 |
| }, |
| { |
| "entropy": 1.34530808031559, |
| "epoch": 0.9540185257085806, |
| "grad_norm": 0.55078125, |
| "learning_rate": 2.3181011535048805e-06, |
| "loss": 0.9502, |
| "mean_token_accuracy": 0.7529184207320213, |
| "num_tokens": 404832889.0, |
| "step": 4300 |
| }, |
| { |
| "entropy": 1.3469831585884093, |
| "epoch": 0.9562371734427866, |
| "grad_norm": 0.5390625, |
| "learning_rate": 2.207187222715173e-06, |
| "loss": 0.9485, |
| "mean_token_accuracy": 0.7524568639695645, |
| "num_tokens": 405773210.0, |
| "step": 4310 |
| }, |
| { |
| "entropy": 1.3356608122587204, |
| "epoch": 0.9584558211769926, |
| "grad_norm": 0.52734375, |
| "learning_rate": 2.096273291925466e-06, |
| "loss": 0.943, |
| "mean_token_accuracy": 0.7541289560496807, |
| "num_tokens": 406697781.0, |
| "step": 4320 |
| }, |
| { |
| "entropy": 1.3480161339044572, |
| "epoch": 0.9606744689111987, |
| "grad_norm": 0.51171875, |
| "learning_rate": 1.9853593611357586e-06, |
| "loss": 0.9618, |
| "mean_token_accuracy": 0.7477487847208977, |
| "num_tokens": 407635544.0, |
| "step": 4330 |
| }, |
| { |
| "entropy": 1.3414922960102558, |
| "epoch": 0.9628931166454047, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.8744454303460516e-06, |
| "loss": 0.9485, |
| "mean_token_accuracy": 0.7516260854899883, |
| "num_tokens": 408594342.0, |
| "step": 4340 |
| }, |
| { |
| "entropy": 1.33254055082798, |
| "epoch": 0.9651117643796107, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.7635314995563443e-06, |
| "loss": 0.9164, |
| "mean_token_accuracy": 0.7584716722369194, |
| "num_tokens": 409518793.0, |
| "step": 4350 |
| }, |
| { |
| "entropy": 1.362374597787857, |
| "epoch": 0.9673304121138167, |
| "grad_norm": 0.5078125, |
| "learning_rate": 1.6526175687666373e-06, |
| "loss": 0.9664, |
| "mean_token_accuracy": 0.7495695851743222, |
| "num_tokens": 410465748.0, |
| "step": 4360 |
| }, |
| { |
| "entropy": 1.355623196810484, |
| "epoch": 0.9695490598480226, |
| "grad_norm": 0.5390625, |
| "learning_rate": 1.54170363797693e-06, |
| "loss": 0.9614, |
| "mean_token_accuracy": 0.7504058249294758, |
| "num_tokens": 411413316.0, |
| "step": 4370 |
| }, |
| { |
| "entropy": 1.3444112464785576, |
| "epoch": 0.9717677075822286, |
| "grad_norm": 0.53515625, |
| "learning_rate": 1.4307897071872228e-06, |
| "loss": 0.9682, |
| "mean_token_accuracy": 0.7514989458024501, |
| "num_tokens": 412367491.0, |
| "step": 4380 |
| }, |
| { |
| "entropy": 1.3571382217109202, |
| "epoch": 0.9739863553164346, |
| "grad_norm": 0.546875, |
| "learning_rate": 1.3198757763975156e-06, |
| "loss": 0.9415, |
| "mean_token_accuracy": 0.75667395144701, |
| "num_tokens": 413306525.0, |
| "step": 4390 |
| }, |
| { |
| "entropy": 1.3180716767907144, |
| "epoch": 0.9762050030506406, |
| "grad_norm": 0.55859375, |
| "learning_rate": 1.2089618456078084e-06, |
| "loss": 0.9439, |
| "mean_token_accuracy": 0.7561846785247326, |
| "num_tokens": 414250494.0, |
| "step": 4400 |
| }, |
| { |
| "entropy": 1.3656005658209325, |
| "epoch": 0.9784236507848466, |
| "grad_norm": 0.53125, |
| "learning_rate": 1.0980479148181013e-06, |
| "loss": 0.9833, |
| "mean_token_accuracy": 0.7456090614199639, |
| "num_tokens": 415199963.0, |
| "step": 4410 |
| }, |
| { |
| "entropy": 1.3268229991197587, |
| "epoch": 0.9806422985190526, |
| "grad_norm": 0.484375, |
| "learning_rate": 9.871339840283939e-07, |
| "loss": 0.9375, |
| "mean_token_accuracy": 0.7558161698281765, |
| "num_tokens": 416170950.0, |
| "step": 4420 |
| }, |
| { |
| "entropy": 1.3259350806474686, |
| "epoch": 0.9828609462532586, |
| "grad_norm": 0.55078125, |
| "learning_rate": 8.762200532386869e-07, |
| "loss": 0.9365, |
| "mean_token_accuracy": 0.7544685363769531, |
| "num_tokens": 417129972.0, |
| "step": 4430 |
| }, |
| { |
| "entropy": 1.3594698533415794, |
| "epoch": 0.9850795939874646, |
| "grad_norm": 0.57421875, |
| "learning_rate": 7.653061224489796e-07, |
| "loss": 0.9744, |
| "mean_token_accuracy": 0.7484218552708626, |
| "num_tokens": 418083653.0, |
| "step": 4440 |
| }, |
| { |
| "entropy": 1.3757464356720448, |
| "epoch": 0.9872982417216707, |
| "grad_norm": 0.58203125, |
| "learning_rate": 6.543921916592724e-07, |
| "loss": 0.9598, |
| "mean_token_accuracy": 0.7515306659042835, |
| "num_tokens": 419023538.0, |
| "step": 4450 |
| }, |
| { |
| "entropy": 1.3545207664370538, |
| "epoch": 0.9895168894558767, |
| "grad_norm": 0.5078125, |
| "learning_rate": 5.434782608695653e-07, |
| "loss": 0.9539, |
| "mean_token_accuracy": 0.753493282943964, |
| "num_tokens": 419968988.0, |
| "step": 4460 |
| }, |
| { |
| "entropy": 1.3401925891637803, |
| "epoch": 0.9917355371900827, |
| "grad_norm": 0.55859375, |
| "learning_rate": 4.3256433007985804e-07, |
| "loss": 0.937, |
| "mean_token_accuracy": 0.753621107339859, |
| "num_tokens": 420897811.0, |
| "step": 4470 |
| }, |
| { |
| "entropy": 1.36095949113369, |
| "epoch": 0.9939541849242887, |
| "grad_norm": 0.52734375, |
| "learning_rate": 3.2165039929015086e-07, |
| "loss": 0.9757, |
| "mean_token_accuracy": 0.749586571007967, |
| "num_tokens": 421848611.0, |
| "step": 4480 |
| }, |
| { |
| "entropy": 1.374735850095749, |
| "epoch": 0.9961728326584947, |
| "grad_norm": 0.53515625, |
| "learning_rate": 2.1073646850044365e-07, |
| "loss": 0.9893, |
| "mean_token_accuracy": 0.7467234946787358, |
| "num_tokens": 422804916.0, |
| "step": 4490 |
| }, |
| { |
| "entropy": 1.4061301365494727, |
| "epoch": 0.9983914803927006, |
| "grad_norm": 0.546875, |
| "learning_rate": 9.982253771073646e-08, |
| "loss": 1.0009, |
| "mean_token_accuracy": 0.7450855560600758, |
| "num_tokens": 423729440.0, |
| "step": 4500 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 4508, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 5.662706335855149e+18, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|