{ "best_global_step": 300, "best_metric": 0.1870778650045395, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 50, "global_step": 338, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 4.701416462659836, "epoch": 0.002962962962962963, "grad_norm": 24.56123924255371, "learning_rate": 0.0, "loss": 2.4745616912841797, "mean_token_accuracy": 0.65498136729002, "num_tokens": 16384.0, "step": 1 }, { "entropy": 4.710217773914337, "epoch": 0.005925925925925926, "grad_norm": 22.917617797851562, "learning_rate": 2.0000000000000003e-06, "loss": 2.328688859939575, "mean_token_accuracy": 0.6696161925792694, "num_tokens": 32768.0, "step": 2 }, { "entropy": 5.008031904697418, "epoch": 0.008888888888888889, "grad_norm": 23.581327438354492, "learning_rate": 4.000000000000001e-06, "loss": 2.373687982559204, "mean_token_accuracy": 0.6377195976674557, "num_tokens": 49152.0, "step": 3 }, { "entropy": 4.461768329143524, "epoch": 0.011851851851851851, "grad_norm": 21.659339904785156, "learning_rate": 6e-06, "loss": 2.188899278640747, "mean_token_accuracy": 0.6830446049571037, "num_tokens": 65536.0, "step": 4 }, { "entropy": 3.990667074918747, "epoch": 0.014814814814814815, "grad_norm": 27.289581298828125, "learning_rate": 8.000000000000001e-06, "loss": 1.9017679691314697, "mean_token_accuracy": 0.6956704035401344, "num_tokens": 81920.0, "step": 5 }, { "entropy": 4.510465860366821, "epoch": 0.017777777777777778, "grad_norm": 19.150859832763672, "learning_rate": 1e-05, "loss": 2.1146278381347656, "mean_token_accuracy": 0.6657988280057907, "num_tokens": 98304.0, "step": 6 }, { "entropy": 5.020317792892456, "epoch": 0.02074074074074074, "grad_norm": 15.287837982177734, "learning_rate": 9.96996996996997e-06, "loss": 1.7613449096679688, "mean_token_accuracy": 0.6947520524263382, "num_tokens": 114688.0, "step": 7 }, { "entropy": 4.912468284368515, "epoch": 0.023703703703703703, "grad_norm": 9.686163902282715, "learning_rate": 9.93993993993994e-06, "loss": 1.345112681388855, "mean_token_accuracy": 0.7633048743009567, "num_tokens": 131072.0, "step": 8 }, { "entropy": 4.621884375810623, "epoch": 0.02666666666666667, "grad_norm": 8.546224594116211, "learning_rate": 9.90990990990991e-06, "loss": 1.1717731952667236, "mean_token_accuracy": 0.8044982850551605, "num_tokens": 147456.0, "step": 9 }, { "entropy": 5.038796991109848, "epoch": 0.02962962962962963, "grad_norm": 6.685237884521484, "learning_rate": 9.879879879879881e-06, "loss": 1.0621838569641113, "mean_token_accuracy": 0.7919343337416649, "num_tokens": 163840.0, "step": 10 }, { "entropy": 4.503615289926529, "epoch": 0.03259259259259259, "grad_norm": 4.604543685913086, "learning_rate": 9.849849849849851e-06, "loss": 0.6260772347450256, "mean_token_accuracy": 0.8595008999109268, "num_tokens": 180224.0, "step": 11 }, { "entropy": 4.9618454575538635, "epoch": 0.035555555555555556, "grad_norm": 4.359870433807373, "learning_rate": 9.81981981981982e-06, "loss": 0.9231398105621338, "mean_token_accuracy": 0.7866097167134285, "num_tokens": 196608.0, "step": 12 }, { "entropy": 5.029646277427673, "epoch": 0.03851851851851852, "grad_norm": 4.168108940124512, "learning_rate": 9.78978978978979e-06, "loss": 0.7823256850242615, "mean_token_accuracy": 0.8285031393170357, "num_tokens": 212992.0, "step": 13 }, { "entropy": 4.752634763717651, "epoch": 0.04148148148148148, "grad_norm": 4.052370548248291, "learning_rate": 9.75975975975976e-06, "loss": 0.8456622958183289, "mean_token_accuracy": 0.8258332759141922, "num_tokens": 229376.0, "step": 14 }, { "entropy": 4.367532521486282, "epoch": 0.044444444444444446, "grad_norm": 2.7583987712860107, "learning_rate": 9.729729729729732e-06, "loss": 0.38843369483947754, "mean_token_accuracy": 0.8896501585841179, "num_tokens": 245760.0, "step": 15 }, { "entropy": 4.656139403581619, "epoch": 0.047407407407407405, "grad_norm": 4.212277412414551, "learning_rate": 9.699699699699701e-06, "loss": 0.8094176650047302, "mean_token_accuracy": 0.8203602507710457, "num_tokens": 262144.0, "step": 16 }, { "entropy": 4.927716374397278, "epoch": 0.05037037037037037, "grad_norm": 3.1427767276763916, "learning_rate": 9.669669669669671e-06, "loss": 0.6425362825393677, "mean_token_accuracy": 0.8606718555092812, "num_tokens": 278528.0, "step": 17 }, { "entropy": 5.264335453510284, "epoch": 0.05333333333333334, "grad_norm": 2.9270451068878174, "learning_rate": 9.63963963963964e-06, "loss": 0.5596555471420288, "mean_token_accuracy": 0.8495745286345482, "num_tokens": 294912.0, "step": 18 }, { "entropy": 4.823247134685516, "epoch": 0.056296296296296296, "grad_norm": 3.0255370140075684, "learning_rate": 9.60960960960961e-06, "loss": 0.5243310332298279, "mean_token_accuracy": 0.8735020756721497, "num_tokens": 311296.0, "step": 19 }, { "entropy": 4.711223393678665, "epoch": 0.05925925925925926, "grad_norm": 2.342226505279541, "learning_rate": 9.57957957957958e-06, "loss": 0.4596331715583801, "mean_token_accuracy": 0.8677957728505135, "num_tokens": 327680.0, "step": 20 }, { "entropy": 4.827401220798492, "epoch": 0.06222222222222222, "grad_norm": 2.128645420074463, "learning_rate": 9.54954954954955e-06, "loss": 0.5169314742088318, "mean_token_accuracy": 0.8644424751400948, "num_tokens": 344064.0, "step": 21 }, { "entropy": 4.730625569820404, "epoch": 0.06518518518518518, "grad_norm": 2.072950839996338, "learning_rate": 9.51951951951952e-06, "loss": 0.45018476247787476, "mean_token_accuracy": 0.8857986330986023, "num_tokens": 360448.0, "step": 22 }, { "entropy": 4.8472941517829895, "epoch": 0.06814814814814815, "grad_norm": 2.0330708026885986, "learning_rate": 9.489489489489491e-06, "loss": 0.44504502415657043, "mean_token_accuracy": 0.8775075301527977, "num_tokens": 376832.0, "step": 23 }, { "entropy": 4.573881030082703, "epoch": 0.07111111111111111, "grad_norm": 2.3058454990386963, "learning_rate": 9.45945945945946e-06, "loss": 0.4268365204334259, "mean_token_accuracy": 0.9048123508691788, "num_tokens": 393216.0, "step": 24 }, { "entropy": 4.396156758069992, "epoch": 0.07407407407407407, "grad_norm": 1.6368998289108276, "learning_rate": 9.42942942942943e-06, "loss": 0.37373656034469604, "mean_token_accuracy": 0.9093844145536423, "num_tokens": 409600.0, "step": 25 }, { "entropy": 4.735283553600311, "epoch": 0.07703703703703704, "grad_norm": 1.736892580986023, "learning_rate": 9.3993993993994e-06, "loss": 0.3806194067001343, "mean_token_accuracy": 0.9068936184048653, "num_tokens": 425984.0, "step": 26 }, { "entropy": 4.740741103887558, "epoch": 0.08, "grad_norm": 1.8124656677246094, "learning_rate": 9.36936936936937e-06, "loss": 0.4839091897010803, "mean_token_accuracy": 0.8846660703420639, "num_tokens": 442368.0, "step": 27 }, { "entropy": 4.820813536643982, "epoch": 0.08296296296296296, "grad_norm": 1.6148549318313599, "learning_rate": 9.339339339339341e-06, "loss": 0.3115249276161194, "mean_token_accuracy": 0.9326120764017105, "num_tokens": 458752.0, "step": 28 }, { "entropy": 4.844596207141876, "epoch": 0.08592592592592592, "grad_norm": 1.944309115409851, "learning_rate": 9.30930930930931e-06, "loss": 0.4823766350746155, "mean_token_accuracy": 0.8930554986000061, "num_tokens": 475136.0, "step": 29 }, { "entropy": 4.210876405239105, "epoch": 0.08888888888888889, "grad_norm": 1.4049290418624878, "learning_rate": 9.27927927927928e-06, "loss": 0.2616775631904602, "mean_token_accuracy": 0.9358664155006409, "num_tokens": 491520.0, "step": 30 }, { "entropy": 4.226673096418381, "epoch": 0.09185185185185185, "grad_norm": 1.5136734247207642, "learning_rate": 9.24924924924925e-06, "loss": 0.3573359549045563, "mean_token_accuracy": 0.9113403558731079, "num_tokens": 507904.0, "step": 31 }, { "entropy": 4.580118954181671, "epoch": 0.09481481481481481, "grad_norm": 1.5213615894317627, "learning_rate": 9.21921921921922e-06, "loss": 0.2795485854148865, "mean_token_accuracy": 0.9298447221517563, "num_tokens": 524288.0, "step": 32 }, { "entropy": 4.726915955543518, "epoch": 0.09777777777777778, "grad_norm": 1.466759443283081, "learning_rate": 9.189189189189191e-06, "loss": 0.297269344329834, "mean_token_accuracy": 0.9181232526898384, "num_tokens": 540672.0, "step": 33 }, { "entropy": 4.508806675672531, "epoch": 0.10074074074074074, "grad_norm": 1.411300539970398, "learning_rate": 9.15915915915916e-06, "loss": 0.27328386902809143, "mean_token_accuracy": 0.9196836799383163, "num_tokens": 557056.0, "step": 34 }, { "entropy": 4.150590598583221, "epoch": 0.1037037037037037, "grad_norm": 1.0787698030471802, "learning_rate": 9.129129129129129e-06, "loss": 0.2225482016801834, "mean_token_accuracy": 0.9393472671508789, "num_tokens": 573440.0, "step": 35 }, { "entropy": 4.8258116543293, "epoch": 0.10666666666666667, "grad_norm": 1.5515680313110352, "learning_rate": 9.0990990990991e-06, "loss": 0.36224499344825745, "mean_token_accuracy": 0.9126538634300232, "num_tokens": 589824.0, "step": 36 }, { "entropy": 4.613873243331909, "epoch": 0.10962962962962963, "grad_norm": 1.1958707571029663, "learning_rate": 9.06906906906907e-06, "loss": 0.2626018226146698, "mean_token_accuracy": 0.9358126819133759, "num_tokens": 606208.0, "step": 37 }, { "entropy": 4.751417100429535, "epoch": 0.11259259259259259, "grad_norm": 1.7754180431365967, "learning_rate": 9.03903903903904e-06, "loss": 0.41290533542633057, "mean_token_accuracy": 0.8912962302565575, "num_tokens": 622592.0, "step": 38 }, { "entropy": 4.497866570949554, "epoch": 0.11555555555555555, "grad_norm": 1.3581385612487793, "learning_rate": 9.00900900900901e-06, "loss": 0.3074203133583069, "mean_token_accuracy": 0.9052062705159187, "num_tokens": 638976.0, "step": 39 }, { "entropy": 3.9070385098457336, "epoch": 0.11851851851851852, "grad_norm": 0.9901930689811707, "learning_rate": 8.97897897897898e-06, "loss": 0.18705977499485016, "mean_token_accuracy": 0.9510745629668236, "num_tokens": 655360.0, "step": 40 }, { "entropy": 4.494014769792557, "epoch": 0.12148148148148148, "grad_norm": 0.931329071521759, "learning_rate": 8.94894894894895e-06, "loss": 0.15729889273643494, "mean_token_accuracy": 0.9621974900364876, "num_tokens": 671744.0, "step": 41 }, { "entropy": 4.150999903678894, "epoch": 0.12444444444444444, "grad_norm": 1.0970348119735718, "learning_rate": 8.91891891891892e-06, "loss": 0.19550678133964539, "mean_token_accuracy": 0.9428130686283112, "num_tokens": 688128.0, "step": 42 }, { "entropy": 4.554481625556946, "epoch": 0.1274074074074074, "grad_norm": 1.4370427131652832, "learning_rate": 8.888888888888888e-06, "loss": 0.281034916639328, "mean_token_accuracy": 0.9330077469348907, "num_tokens": 704512.0, "step": 43 }, { "entropy": 4.474077612161636, "epoch": 0.13037037037037036, "grad_norm": 1.3707451820373535, "learning_rate": 8.85885885885886e-06, "loss": 0.2653379440307617, "mean_token_accuracy": 0.9189115986227989, "num_tokens": 720896.0, "step": 44 }, { "entropy": 4.545973598957062, "epoch": 0.13333333333333333, "grad_norm": 1.3633112907409668, "learning_rate": 8.82882882882883e-06, "loss": 0.361990362405777, "mean_token_accuracy": 0.914089597761631, "num_tokens": 737280.0, "step": 45 }, { "entropy": 5.099069595336914, "epoch": 0.1362962962962963, "grad_norm": 1.5805450677871704, "learning_rate": 8.798798798798799e-06, "loss": 0.3552599251270294, "mean_token_accuracy": 0.902031384408474, "num_tokens": 753664.0, "step": 46 }, { "entropy": 4.682322978973389, "epoch": 0.13925925925925925, "grad_norm": 1.5990415811538696, "learning_rate": 8.768768768768769e-06, "loss": 0.2980004847049713, "mean_token_accuracy": 0.9243276342749596, "num_tokens": 770048.0, "step": 47 }, { "entropy": 3.8644610345363617, "epoch": 0.14222222222222222, "grad_norm": 1.1499457359313965, "learning_rate": 8.738738738738739e-06, "loss": 0.17076195776462555, "mean_token_accuracy": 0.9673715531826019, "num_tokens": 786432.0, "step": 48 }, { "entropy": 3.549734801054001, "epoch": 0.1451851851851852, "grad_norm": 1.0603333711624146, "learning_rate": 8.70870870870871e-06, "loss": 0.1853162944316864, "mean_token_accuracy": 0.9549605473876, "num_tokens": 802816.0, "step": 49 }, { "entropy": 4.565040707588196, "epoch": 0.14814814814814814, "grad_norm": 1.3161346912384033, "learning_rate": 8.67867867867868e-06, "loss": 0.2428000271320343, "mean_token_accuracy": 0.941745437681675, "num_tokens": 819200.0, "step": 50 }, { "epoch": 0.14814814814814814, "eval_entropy": 4.431767495473226, "eval_loss": 0.26340892910957336, "eval_mean_token_accuracy": 0.9330609718958537, "eval_num_tokens": 819200.0, "eval_runtime": 41.8001, "eval_samples_per_second": 14.354, "eval_steps_per_second": 1.794, "step": 50 }, { "entropy": 4.543307781219482, "epoch": 0.1511111111111111, "grad_norm": 1.0699235200881958, "learning_rate": 8.64864864864865e-06, "loss": 0.21112632751464844, "mean_token_accuracy": 0.9408096745610237, "num_tokens": 835584.0, "step": 51 }, { "entropy": 4.287139475345612, "epoch": 0.15407407407407409, "grad_norm": 1.3812147378921509, "learning_rate": 8.618618618618619e-06, "loss": 0.33578288555145264, "mean_token_accuracy": 0.8980858325958252, "num_tokens": 851968.0, "step": 52 }, { "entropy": 4.334702581167221, "epoch": 0.15703703703703703, "grad_norm": 1.0601719617843628, "learning_rate": 8.588588588588589e-06, "loss": 0.20486582815647125, "mean_token_accuracy": 0.9470738098025322, "num_tokens": 868352.0, "step": 53 }, { "entropy": 4.366694152355194, "epoch": 0.16, "grad_norm": 1.1363606452941895, "learning_rate": 8.55855855855856e-06, "loss": 0.2239852249622345, "mean_token_accuracy": 0.9437156841158867, "num_tokens": 884736.0, "step": 54 }, { "entropy": 4.7676966190338135, "epoch": 0.16296296296296298, "grad_norm": 1.4757620096206665, "learning_rate": 8.52852852852853e-06, "loss": 0.2932360768318176, "mean_token_accuracy": 0.9156305864453316, "num_tokens": 901120.0, "step": 55 }, { "entropy": 3.975048542022705, "epoch": 0.16592592592592592, "grad_norm": 0.9454239010810852, "learning_rate": 8.4984984984985e-06, "loss": 0.1756972372531891, "mean_token_accuracy": 0.9529843851923943, "num_tokens": 917504.0, "step": 56 }, { "entropy": 4.308409333229065, "epoch": 0.1688888888888889, "grad_norm": 1.106583833694458, "learning_rate": 8.46846846846847e-06, "loss": 0.2179475724697113, "mean_token_accuracy": 0.9476942420005798, "num_tokens": 933888.0, "step": 57 }, { "entropy": 4.3459296226501465, "epoch": 0.17185185185185184, "grad_norm": 1.1199692487716675, "learning_rate": 8.438438438438439e-06, "loss": 0.19708535075187683, "mean_token_accuracy": 0.9468630477786064, "num_tokens": 950272.0, "step": 58 }, { "entropy": 4.2178795337677, "epoch": 0.1748148148148148, "grad_norm": 0.9635001420974731, "learning_rate": 8.408408408408409e-06, "loss": 0.22096095979213715, "mean_token_accuracy": 0.9436954632401466, "num_tokens": 966656.0, "step": 59 }, { "entropy": 4.530367374420166, "epoch": 0.17777777777777778, "grad_norm": 1.2648260593414307, "learning_rate": 8.378378378378378e-06, "loss": 0.2579096555709839, "mean_token_accuracy": 0.9305993020534515, "num_tokens": 983040.0, "step": 60 }, { "entropy": 4.394843816757202, "epoch": 0.18074074074074073, "grad_norm": 1.031794786453247, "learning_rate": 8.348348348348348e-06, "loss": 0.19525060057640076, "mean_token_accuracy": 0.9447937682271004, "num_tokens": 999424.0, "step": 61 }, { "entropy": 4.368332535028458, "epoch": 0.1837037037037037, "grad_norm": 1.1181342601776123, "learning_rate": 8.31831831831832e-06, "loss": 0.18430283665657043, "mean_token_accuracy": 0.9516401365399361, "num_tokens": 1015808.0, "step": 62 }, { "entropy": 4.473689407110214, "epoch": 0.18666666666666668, "grad_norm": 1.5281213521957397, "learning_rate": 8.288288288288289e-06, "loss": 0.2257380336523056, "mean_token_accuracy": 0.9356214329600334, "num_tokens": 1032192.0, "step": 63 }, { "entropy": 4.10108557343483, "epoch": 0.18962962962962962, "grad_norm": 0.8947974443435669, "learning_rate": 8.258258258258259e-06, "loss": 0.13964179158210754, "mean_token_accuracy": 0.9607399925589561, "num_tokens": 1048576.0, "step": 64 }, { "entropy": 4.5217985808849335, "epoch": 0.1925925925925926, "grad_norm": 1.2758291959762573, "learning_rate": 8.228228228228229e-06, "loss": 0.25637656450271606, "mean_token_accuracy": 0.9300419837236404, "num_tokens": 1064960.0, "step": 65 }, { "entropy": 4.629321813583374, "epoch": 0.19555555555555557, "grad_norm": 1.254235029220581, "learning_rate": 8.198198198198198e-06, "loss": 0.2535402774810791, "mean_token_accuracy": 0.9174696281552315, "num_tokens": 1081344.0, "step": 66 }, { "entropy": 3.9447177350521088, "epoch": 0.1985185185185185, "grad_norm": 0.9241489171981812, "learning_rate": 8.16816816816817e-06, "loss": 0.142357736825943, "mean_token_accuracy": 0.9547562450170517, "num_tokens": 1097728.0, "step": 67 }, { "entropy": 4.005536824464798, "epoch": 0.20148148148148148, "grad_norm": 0.9808012843132019, "learning_rate": 8.13813813813814e-06, "loss": 0.1787158101797104, "mean_token_accuracy": 0.9517183899879456, "num_tokens": 1114112.0, "step": 68 }, { "entropy": 4.408803582191467, "epoch": 0.20444444444444446, "grad_norm": 1.2708892822265625, "learning_rate": 8.108108108108109e-06, "loss": 0.2477702498435974, "mean_token_accuracy": 0.927848644554615, "num_tokens": 1130496.0, "step": 69 }, { "entropy": 4.427323371171951, "epoch": 0.2074074074074074, "grad_norm": 1.0906333923339844, "learning_rate": 8.078078078078079e-06, "loss": 0.18576793372631073, "mean_token_accuracy": 0.9514018073678017, "num_tokens": 1146880.0, "step": 70 }, { "entropy": 4.085136443376541, "epoch": 0.21037037037037037, "grad_norm": 0.9278141856193542, "learning_rate": 8.048048048048048e-06, "loss": 0.1597796231508255, "mean_token_accuracy": 0.950559951364994, "num_tokens": 1163264.0, "step": 71 }, { "entropy": 4.562773674726486, "epoch": 0.21333333333333335, "grad_norm": 1.222669005393982, "learning_rate": 8.018018018018018e-06, "loss": 0.23149636387825012, "mean_token_accuracy": 0.9292395636439323, "num_tokens": 1179648.0, "step": 72 }, { "entropy": 4.718744367361069, "epoch": 0.2162962962962963, "grad_norm": 1.4075634479522705, "learning_rate": 7.987987987987988e-06, "loss": 0.24038389325141907, "mean_token_accuracy": 0.9325431138277054, "num_tokens": 1196032.0, "step": 73 }, { "entropy": 5.075905919075012, "epoch": 0.21925925925925926, "grad_norm": 1.4967416524887085, "learning_rate": 7.95795795795796e-06, "loss": 0.3027274012565613, "mean_token_accuracy": 0.9107383862137794, "num_tokens": 1212416.0, "step": 74 }, { "entropy": 4.314110338687897, "epoch": 0.2222222222222222, "grad_norm": 0.9586232900619507, "learning_rate": 7.927927927927929e-06, "loss": 0.1696486622095108, "mean_token_accuracy": 0.9494581520557404, "num_tokens": 1228800.0, "step": 75 }, { "entropy": 4.872310161590576, "epoch": 0.22518518518518518, "grad_norm": 1.5255279541015625, "learning_rate": 7.897897897897899e-06, "loss": 0.3269280195236206, "mean_token_accuracy": 0.9095799848437309, "num_tokens": 1245184.0, "step": 76 }, { "entropy": 4.42020907998085, "epoch": 0.22814814814814816, "grad_norm": 1.4026970863342285, "learning_rate": 7.867867867867868e-06, "loss": 0.2915046215057373, "mean_token_accuracy": 0.9215874075889587, "num_tokens": 1261568.0, "step": 77 }, { "entropy": 4.672393083572388, "epoch": 0.2311111111111111, "grad_norm": 1.1211456060409546, "learning_rate": 7.837837837837838e-06, "loss": 0.17860044538974762, "mean_token_accuracy": 0.9532517418265343, "num_tokens": 1277952.0, "step": 78 }, { "entropy": 4.263626158237457, "epoch": 0.23407407407407407, "grad_norm": 1.2703758478164673, "learning_rate": 7.807807807807808e-06, "loss": 0.20677883923053741, "mean_token_accuracy": 0.9517276138067245, "num_tokens": 1294336.0, "step": 79 }, { "entropy": 4.612537890672684, "epoch": 0.23703703703703705, "grad_norm": 1.1560204029083252, "learning_rate": 7.77777777777778e-06, "loss": 0.20464098453521729, "mean_token_accuracy": 0.9621888473629951, "num_tokens": 1310720.0, "step": 80 }, { "entropy": 3.743598461151123, "epoch": 0.24, "grad_norm": 0.9571014046669006, "learning_rate": 7.747747747747749e-06, "loss": 0.16432294249534607, "mean_token_accuracy": 0.949650265276432, "num_tokens": 1327104.0, "step": 81 }, { "entropy": 4.481620937585831, "epoch": 0.24296296296296296, "grad_norm": 1.1675502061843872, "learning_rate": 7.717717717717719e-06, "loss": 0.21761369705200195, "mean_token_accuracy": 0.9432580098509789, "num_tokens": 1343488.0, "step": 82 }, { "entropy": 4.632976651191711, "epoch": 0.24592592592592594, "grad_norm": 1.4137561321258545, "learning_rate": 7.687687687687688e-06, "loss": 0.25227683782577515, "mean_token_accuracy": 0.9236670285463333, "num_tokens": 1359872.0, "step": 83 }, { "entropy": 4.919981598854065, "epoch": 0.24888888888888888, "grad_norm": 1.4102532863616943, "learning_rate": 7.657657657657658e-06, "loss": 0.28805384039878845, "mean_token_accuracy": 0.9161391258239746, "num_tokens": 1376256.0, "step": 84 }, { "entropy": 4.675688982009888, "epoch": 0.2518518518518518, "grad_norm": 1.0484553575515747, "learning_rate": 7.6276276276276285e-06, "loss": 0.17043615877628326, "mean_token_accuracy": 0.9514751136302948, "num_tokens": 1392640.0, "step": 85 }, { "entropy": 4.214458107948303, "epoch": 0.2548148148148148, "grad_norm": 0.9503604769706726, "learning_rate": 7.597597597597598e-06, "loss": 0.15311528742313385, "mean_token_accuracy": 0.9494195133447647, "num_tokens": 1409024.0, "step": 86 }, { "entropy": 4.548118233680725, "epoch": 0.2577777777777778, "grad_norm": 1.2899352312088013, "learning_rate": 7.567567567567569e-06, "loss": 0.2427193522453308, "mean_token_accuracy": 0.9302617087960243, "num_tokens": 1425408.0, "step": 87 }, { "entropy": 4.833130061626434, "epoch": 0.2607407407407407, "grad_norm": 1.1198095083236694, "learning_rate": 7.5375375375375385e-06, "loss": 0.2029549777507782, "mean_token_accuracy": 0.9402985349297523, "num_tokens": 1441792.0, "step": 88 }, { "entropy": 4.751594722270966, "epoch": 0.2637037037037037, "grad_norm": 1.1558674573898315, "learning_rate": 7.507507507507507e-06, "loss": 0.19649912416934967, "mean_token_accuracy": 0.9425910338759422, "num_tokens": 1458176.0, "step": 89 }, { "entropy": 4.8306790590286255, "epoch": 0.26666666666666666, "grad_norm": 1.3417739868164062, "learning_rate": 7.477477477477479e-06, "loss": 0.2961505055427551, "mean_token_accuracy": 0.9253265932202339, "num_tokens": 1474560.0, "step": 90 }, { "entropy": 4.5884115397930145, "epoch": 0.2696296296296296, "grad_norm": 1.0663913488388062, "learning_rate": 7.447447447447448e-06, "loss": 0.22267302870750427, "mean_token_accuracy": 0.9426953792572021, "num_tokens": 1490944.0, "step": 91 }, { "entropy": 4.409365922212601, "epoch": 0.2725925925925926, "grad_norm": 1.1096484661102295, "learning_rate": 7.417417417417418e-06, "loss": 0.26577574014663696, "mean_token_accuracy": 0.9276531934738159, "num_tokens": 1507328.0, "step": 92 }, { "entropy": 4.979451894760132, "epoch": 0.27555555555555555, "grad_norm": 1.0621061325073242, "learning_rate": 7.387387387387388e-06, "loss": 0.17089557647705078, "mean_token_accuracy": 0.9540339037775993, "num_tokens": 1523712.0, "step": 93 }, { "entropy": 4.742478549480438, "epoch": 0.2785185185185185, "grad_norm": 1.1826844215393066, "learning_rate": 7.3573573573573575e-06, "loss": 0.22930549085140228, "mean_token_accuracy": 0.9388362243771553, "num_tokens": 1540096.0, "step": 94 }, { "entropy": 4.794544339179993, "epoch": 0.2814814814814815, "grad_norm": 1.6299753189086914, "learning_rate": 7.327327327327328e-06, "loss": 0.28972867131233215, "mean_token_accuracy": 0.9282878786325455, "num_tokens": 1556480.0, "step": 95 }, { "entropy": 4.752287656068802, "epoch": 0.28444444444444444, "grad_norm": 1.3292368650436401, "learning_rate": 7.297297297297298e-06, "loss": 0.27213218808174133, "mean_token_accuracy": 0.9241840839385986, "num_tokens": 1572864.0, "step": 96 }, { "entropy": 4.4966756999492645, "epoch": 0.2874074074074074, "grad_norm": 1.0797817707061768, "learning_rate": 7.267267267267268e-06, "loss": 0.22773189842700958, "mean_token_accuracy": 0.9454372152686119, "num_tokens": 1589248.0, "step": 97 }, { "entropy": 4.7066821455955505, "epoch": 0.2903703703703704, "grad_norm": 1.4515063762664795, "learning_rate": 7.237237237237238e-06, "loss": 0.33411750197410583, "mean_token_accuracy": 0.9117428660392761, "num_tokens": 1605632.0, "step": 98 }, { "entropy": 4.119100630283356, "epoch": 0.29333333333333333, "grad_norm": 0.9465159773826599, "learning_rate": 7.207207207207208e-06, "loss": 0.14733517169952393, "mean_token_accuracy": 0.9545356035232544, "num_tokens": 1622016.0, "step": 99 }, { "entropy": 4.246767520904541, "epoch": 0.2962962962962963, "grad_norm": 1.176724910736084, "learning_rate": 7.177177177177178e-06, "loss": 0.30558162927627563, "mean_token_accuracy": 0.9205343350768089, "num_tokens": 1638400.0, "step": 100 }, { "epoch": 0.2962962962962963, "eval_entropy": 4.449052244822184, "eval_loss": 0.21724973618984222, "eval_mean_token_accuracy": 0.9431627003351847, "eval_num_tokens": 1638400.0, "eval_runtime": 41.8075, "eval_samples_per_second": 14.351, "eval_steps_per_second": 1.794, "step": 100 }, { "entropy": 4.789787411689758, "epoch": 0.2992592592592593, "grad_norm": 1.145389199256897, "learning_rate": 7.147147147147148e-06, "loss": 0.15895400941371918, "mean_token_accuracy": 0.9540646523237228, "num_tokens": 1654784.0, "step": 101 }, { "entropy": 4.701952874660492, "epoch": 0.3022222222222222, "grad_norm": 1.3662292957305908, "learning_rate": 7.117117117117117e-06, "loss": 0.2931893467903137, "mean_token_accuracy": 0.9204913973808289, "num_tokens": 1671168.0, "step": 102 }, { "entropy": 4.134100794792175, "epoch": 0.30518518518518517, "grad_norm": 0.8953816294670105, "learning_rate": 7.087087087087087e-06, "loss": 0.1295047253370285, "mean_token_accuracy": 0.9587932080030441, "num_tokens": 1687552.0, "step": 103 }, { "entropy": 4.094232052564621, "epoch": 0.30814814814814817, "grad_norm": 1.1214549541473389, "learning_rate": 7.057057057057057e-06, "loss": 0.2239776849746704, "mean_token_accuracy": 0.9460462778806686, "num_tokens": 1703936.0, "step": 104 }, { "entropy": 4.961356997489929, "epoch": 0.3111111111111111, "grad_norm": 1.514918565750122, "learning_rate": 7.027027027027028e-06, "loss": 0.3581639528274536, "mean_token_accuracy": 0.9032787084579468, "num_tokens": 1720320.0, "step": 105 }, { "entropy": 4.607772380113602, "epoch": 0.31407407407407406, "grad_norm": 1.0798094272613525, "learning_rate": 6.996996996996997e-06, "loss": 0.23729060590267181, "mean_token_accuracy": 0.9380658268928528, "num_tokens": 1736704.0, "step": 106 }, { "entropy": 3.8316372632980347, "epoch": 0.31703703703703706, "grad_norm": 0.8145128488540649, "learning_rate": 6.966966966966967e-06, "loss": 0.1603461354970932, "mean_token_accuracy": 0.9523681923747063, "num_tokens": 1753088.0, "step": 107 }, { "entropy": 4.021235078573227, "epoch": 0.32, "grad_norm": 1.1897822618484497, "learning_rate": 6.936936936936938e-06, "loss": 0.2039574235677719, "mean_token_accuracy": 0.9393771886825562, "num_tokens": 1769472.0, "step": 108 }, { "entropy": 4.5552674531936646, "epoch": 0.32296296296296295, "grad_norm": 1.3548667430877686, "learning_rate": 6.906906906906907e-06, "loss": 0.2532401978969574, "mean_token_accuracy": 0.9329179599881172, "num_tokens": 1785856.0, "step": 109 }, { "entropy": 4.35027739405632, "epoch": 0.32592592592592595, "grad_norm": 1.1885968446731567, "learning_rate": 6.876876876876878e-06, "loss": 0.16808564960956573, "mean_token_accuracy": 0.9461491629481316, "num_tokens": 1802240.0, "step": 110 }, { "entropy": 4.751055091619492, "epoch": 0.3288888888888889, "grad_norm": 1.1899914741516113, "learning_rate": 6.846846846846848e-06, "loss": 0.26376423239707947, "mean_token_accuracy": 0.9329497367143631, "num_tokens": 1818624.0, "step": 111 }, { "entropy": 4.269050449132919, "epoch": 0.33185185185185184, "grad_norm": 1.1826343536376953, "learning_rate": 6.816816816816817e-06, "loss": 0.1682528555393219, "mean_token_accuracy": 0.9482125043869019, "num_tokens": 1835008.0, "step": 112 }, { "entropy": 4.640616059303284, "epoch": 0.3348148148148148, "grad_norm": 1.166980504989624, "learning_rate": 6.786786786786788e-06, "loss": 0.238769069314003, "mean_token_accuracy": 0.9331283867359161, "num_tokens": 1851392.0, "step": 113 }, { "entropy": 4.051734387874603, "epoch": 0.3377777777777778, "grad_norm": 0.9284724593162537, "learning_rate": 6.7567567567567575e-06, "loss": 0.11436547338962555, "mean_token_accuracy": 0.9699687361717224, "num_tokens": 1867776.0, "step": 114 }, { "entropy": 4.884681403636932, "epoch": 0.34074074074074073, "grad_norm": 1.0763801336288452, "learning_rate": 6.726726726726728e-06, "loss": 0.1629171222448349, "mean_token_accuracy": 0.9543235972523689, "num_tokens": 1884160.0, "step": 115 }, { "entropy": 4.778160870075226, "epoch": 0.3437037037037037, "grad_norm": 0.8610367178916931, "learning_rate": 6.696696696696697e-06, "loss": 0.12890088558197021, "mean_token_accuracy": 0.9653410091996193, "num_tokens": 1900544.0, "step": 116 }, { "entropy": 4.650707423686981, "epoch": 0.3466666666666667, "grad_norm": 1.150089144706726, "learning_rate": 6.666666666666667e-06, "loss": 0.21885131299495697, "mean_token_accuracy": 0.9310262873768806, "num_tokens": 1916928.0, "step": 117 }, { "entropy": 4.634554773569107, "epoch": 0.3496296296296296, "grad_norm": 1.1062830686569214, "learning_rate": 6.636636636636637e-06, "loss": 0.2054327428340912, "mean_token_accuracy": 0.9322185516357422, "num_tokens": 1933312.0, "step": 118 }, { "entropy": 4.514108449220657, "epoch": 0.35259259259259257, "grad_norm": 1.1394360065460205, "learning_rate": 6.606606606606607e-06, "loss": 0.2247684895992279, "mean_token_accuracy": 0.9467405527830124, "num_tokens": 1949696.0, "step": 119 }, { "entropy": 4.34781551361084, "epoch": 0.35555555555555557, "grad_norm": 1.0121259689331055, "learning_rate": 6.5765765765765775e-06, "loss": 0.1715734302997589, "mean_token_accuracy": 0.9512444362044334, "num_tokens": 1966080.0, "step": 120 }, { "entropy": 4.744591236114502, "epoch": 0.3585185185185185, "grad_norm": 1.1714106798171997, "learning_rate": 6.546546546546547e-06, "loss": 0.23964054882526398, "mean_token_accuracy": 0.9383665025234222, "num_tokens": 1982464.0, "step": 121 }, { "entropy": 4.511653900146484, "epoch": 0.36148148148148146, "grad_norm": 1.2332781553268433, "learning_rate": 6.516516516516517e-06, "loss": 0.23672592639923096, "mean_token_accuracy": 0.9448187202215195, "num_tokens": 1998848.0, "step": 122 }, { "entropy": 4.528300076723099, "epoch": 0.36444444444444446, "grad_norm": 0.917389452457428, "learning_rate": 6.486486486486487e-06, "loss": 0.15570732951164246, "mean_token_accuracy": 0.9560035914182663, "num_tokens": 2015232.0, "step": 123 }, { "entropy": 4.652964890003204, "epoch": 0.3674074074074074, "grad_norm": 1.0291730165481567, "learning_rate": 6.456456456456457e-06, "loss": 0.19984155893325806, "mean_token_accuracy": 0.9478033557534218, "num_tokens": 2031616.0, "step": 124 }, { "entropy": 4.196425557136536, "epoch": 0.37037037037037035, "grad_norm": 0.9853512048721313, "learning_rate": 6.426426426426427e-06, "loss": 0.17781120538711548, "mean_token_accuracy": 0.9526060372591019, "num_tokens": 2048000.0, "step": 125 }, { "entropy": 4.501747310161591, "epoch": 0.37333333333333335, "grad_norm": 0.885403037071228, "learning_rate": 6.396396396396397e-06, "loss": 0.10924738645553589, "mean_token_accuracy": 0.9751126244664192, "num_tokens": 2064384.0, "step": 126 }, { "entropy": 4.62592014670372, "epoch": 0.3762962962962963, "grad_norm": 1.5773086547851562, "learning_rate": 6.366366366366366e-06, "loss": 0.3295811414718628, "mean_token_accuracy": 0.9110967963933945, "num_tokens": 2080768.0, "step": 127 }, { "entropy": 5.021280109882355, "epoch": 0.37925925925925924, "grad_norm": 1.380358338356018, "learning_rate": 6.336336336336338e-06, "loss": 0.20020775496959686, "mean_token_accuracy": 0.9450817406177521, "num_tokens": 2097152.0, "step": 128 }, { "entropy": 4.440324813127518, "epoch": 0.38222222222222224, "grad_norm": 1.1773418188095093, "learning_rate": 6.3063063063063065e-06, "loss": 0.22019381821155548, "mean_token_accuracy": 0.9418660625815392, "num_tokens": 2113536.0, "step": 129 }, { "entropy": 4.698460668325424, "epoch": 0.3851851851851852, "grad_norm": 1.1396949291229248, "learning_rate": 6.276276276276276e-06, "loss": 0.18115706741809845, "mean_token_accuracy": 0.94284238666296, "num_tokens": 2129920.0, "step": 130 }, { "entropy": 5.005904167890549, "epoch": 0.38814814814814813, "grad_norm": 1.1489640474319458, "learning_rate": 6.246246246246247e-06, "loss": 0.14725539088249207, "mean_token_accuracy": 0.9511874690651894, "num_tokens": 2146304.0, "step": 131 }, { "entropy": 5.031860530376434, "epoch": 0.39111111111111113, "grad_norm": 1.3990733623504639, "learning_rate": 6.2162162162162164e-06, "loss": 0.24054200947284698, "mean_token_accuracy": 0.9300425425171852, "num_tokens": 2162688.0, "step": 132 }, { "entropy": 4.654724597930908, "epoch": 0.3940740740740741, "grad_norm": 1.083472728729248, "learning_rate": 6.186186186186187e-06, "loss": 0.21355129778385162, "mean_token_accuracy": 0.9333104565739632, "num_tokens": 2179072.0, "step": 133 }, { "entropy": 4.3352950513362885, "epoch": 0.397037037037037, "grad_norm": 1.2197173833847046, "learning_rate": 6.156156156156157e-06, "loss": 0.27208036184310913, "mean_token_accuracy": 0.924175500869751, "num_tokens": 2195456.0, "step": 134 }, { "entropy": 4.924069583415985, "epoch": 0.4, "grad_norm": 1.3885170221328735, "learning_rate": 6.126126126126126e-06, "loss": 0.2448231726884842, "mean_token_accuracy": 0.93735421448946, "num_tokens": 2211840.0, "step": 135 }, { "entropy": 4.7157105803489685, "epoch": 0.40296296296296297, "grad_norm": 1.4344000816345215, "learning_rate": 6.096096096096097e-06, "loss": 0.2515410780906677, "mean_token_accuracy": 0.9249624758958817, "num_tokens": 2228224.0, "step": 136 }, { "entropy": 4.590086460113525, "epoch": 0.4059259259259259, "grad_norm": 1.2284572124481201, "learning_rate": 6.066066066066067e-06, "loss": 0.2063797265291214, "mean_token_accuracy": 0.9442784413695335, "num_tokens": 2244608.0, "step": 137 }, { "entropy": 4.807889759540558, "epoch": 0.4088888888888889, "grad_norm": 1.7174497842788696, "learning_rate": 6.036036036036037e-06, "loss": 0.3287466764450073, "mean_token_accuracy": 0.9112606719136238, "num_tokens": 2260992.0, "step": 138 }, { "entropy": 4.269232541322708, "epoch": 0.41185185185185186, "grad_norm": 0.8105608224868774, "learning_rate": 6.006006006006007e-06, "loss": 0.12416984885931015, "mean_token_accuracy": 0.9590313956141472, "num_tokens": 2277376.0, "step": 139 }, { "entropy": 4.601140409708023, "epoch": 0.4148148148148148, "grad_norm": 1.2158101797103882, "learning_rate": 5.975975975975976e-06, "loss": 0.19056841731071472, "mean_token_accuracy": 0.9466198459267616, "num_tokens": 2293760.0, "step": 140 }, { "entropy": 5.092256844043732, "epoch": 0.4177777777777778, "grad_norm": 1.4425084590911865, "learning_rate": 5.945945945945947e-06, "loss": 0.30024221539497375, "mean_token_accuracy": 0.9206296429038048, "num_tokens": 2310144.0, "step": 141 }, { "entropy": 5.037581652402878, "epoch": 0.42074074074074075, "grad_norm": 1.5531865358352661, "learning_rate": 5.915915915915916e-06, "loss": 0.3754885196685791, "mean_token_accuracy": 0.9084843918681145, "num_tokens": 2326528.0, "step": 142 }, { "entropy": 4.724683046340942, "epoch": 0.4237037037037037, "grad_norm": 1.1647831201553345, "learning_rate": 5.885885885885886e-06, "loss": 0.26595643162727356, "mean_token_accuracy": 0.9294901490211487, "num_tokens": 2342912.0, "step": 143 }, { "entropy": 4.66888752579689, "epoch": 0.4266666666666667, "grad_norm": 1.2422510385513306, "learning_rate": 5.855855855855856e-06, "loss": 0.201975479722023, "mean_token_accuracy": 0.937431775033474, "num_tokens": 2359296.0, "step": 144 }, { "entropy": 5.061137318611145, "epoch": 0.42962962962962964, "grad_norm": 1.1814007759094238, "learning_rate": 5.825825825825826e-06, "loss": 0.21096129715442657, "mean_token_accuracy": 0.944946400821209, "num_tokens": 2375680.0, "step": 145 }, { "entropy": 4.937180817127228, "epoch": 0.4325925925925926, "grad_norm": 1.3031474351882935, "learning_rate": 5.7957957957957965e-06, "loss": 0.24075299501419067, "mean_token_accuracy": 0.9233498498797417, "num_tokens": 2392064.0, "step": 146 }, { "entropy": 4.4801307916641235, "epoch": 0.43555555555555553, "grad_norm": 1.0523452758789062, "learning_rate": 5.765765765765766e-06, "loss": 0.20990847051143646, "mean_token_accuracy": 0.9455097988247871, "num_tokens": 2408448.0, "step": 147 }, { "entropy": 4.410671651363373, "epoch": 0.43851851851851853, "grad_norm": 1.1729801893234253, "learning_rate": 5.735735735735736e-06, "loss": 0.20666182041168213, "mean_token_accuracy": 0.9527652785181999, "num_tokens": 2424832.0, "step": 148 }, { "entropy": 4.266784578561783, "epoch": 0.4414814814814815, "grad_norm": 1.0994833707809448, "learning_rate": 5.7057057057057065e-06, "loss": 0.17016655206680298, "mean_token_accuracy": 0.9391877725720406, "num_tokens": 2441216.0, "step": 149 }, { "entropy": 4.919064462184906, "epoch": 0.4444444444444444, "grad_norm": 1.5136151313781738, "learning_rate": 5.675675675675676e-06, "loss": 0.33089369535446167, "mean_token_accuracy": 0.9111267700791359, "num_tokens": 2457600.0, "step": 150 }, { "epoch": 0.4444444444444444, "eval_entropy": 4.473293965657552, "eval_loss": 0.20222364366054535, "eval_mean_token_accuracy": 0.9461187330881754, "eval_num_tokens": 2457600.0, "eval_runtime": 41.8195, "eval_samples_per_second": 14.347, "eval_steps_per_second": 1.793, "step": 150 }, { "entropy": 4.558058649301529, "epoch": 0.4474074074074074, "grad_norm": 1.5376884937286377, "learning_rate": 5.645645645645647e-06, "loss": 0.3638846278190613, "mean_token_accuracy": 0.9130012094974518, "num_tokens": 2473984.0, "step": 151 }, { "entropy": 4.655219286680222, "epoch": 0.45037037037037037, "grad_norm": 1.4485206604003906, "learning_rate": 5.615615615615616e-06, "loss": 0.29070550203323364, "mean_token_accuracy": 0.9349231794476509, "num_tokens": 2490368.0, "step": 152 }, { "entropy": 4.120410114526749, "epoch": 0.4533333333333333, "grad_norm": 1.4900908470153809, "learning_rate": 5.585585585585585e-06, "loss": 0.2075977772474289, "mean_token_accuracy": 0.941280372440815, "num_tokens": 2506752.0, "step": 153 }, { "entropy": 4.852829605340958, "epoch": 0.4562962962962963, "grad_norm": 1.2578136920928955, "learning_rate": 5.555555555555557e-06, "loss": 0.2637161612510681, "mean_token_accuracy": 0.9209686145186424, "num_tokens": 2523136.0, "step": 154 }, { "entropy": 4.84997946023941, "epoch": 0.45925925925925926, "grad_norm": 1.26620352268219, "learning_rate": 5.5255255255255255e-06, "loss": 0.2449718415737152, "mean_token_accuracy": 0.9436092749238014, "num_tokens": 2539520.0, "step": 155 }, { "entropy": 4.473124235868454, "epoch": 0.4622222222222222, "grad_norm": 1.0916240215301514, "learning_rate": 5.495495495495496e-06, "loss": 0.19546659290790558, "mean_token_accuracy": 0.9399038553237915, "num_tokens": 2555904.0, "step": 156 }, { "entropy": 4.941104412078857, "epoch": 0.4651851851851852, "grad_norm": 1.2782196998596191, "learning_rate": 5.465465465465466e-06, "loss": 0.2740520238876343, "mean_token_accuracy": 0.929001159965992, "num_tokens": 2572288.0, "step": 157 }, { "entropy": 4.457964479923248, "epoch": 0.46814814814814815, "grad_norm": 0.8856244087219238, "learning_rate": 5.4354354354354355e-06, "loss": 0.1418902426958084, "mean_token_accuracy": 0.9622244611382484, "num_tokens": 2588672.0, "step": 158 }, { "entropy": 5.035272657871246, "epoch": 0.4711111111111111, "grad_norm": 1.441379427909851, "learning_rate": 5.405405405405406e-06, "loss": 0.27133798599243164, "mean_token_accuracy": 0.9293553680181503, "num_tokens": 2605056.0, "step": 159 }, { "entropy": 4.293529689311981, "epoch": 0.4740740740740741, "grad_norm": 0.9786353707313538, "learning_rate": 5.375375375375376e-06, "loss": 0.16610291600227356, "mean_token_accuracy": 0.9514764472842216, "num_tokens": 2621440.0, "step": 160 }, { "entropy": 4.59603413939476, "epoch": 0.47703703703703704, "grad_norm": 1.0930979251861572, "learning_rate": 5.345345345345346e-06, "loss": 0.18105587363243103, "mean_token_accuracy": 0.9463809877634048, "num_tokens": 2637824.0, "step": 161 }, { "entropy": 4.2250096797943115, "epoch": 0.48, "grad_norm": 1.1273365020751953, "learning_rate": 5.315315315315316e-06, "loss": 0.14089903235435486, "mean_token_accuracy": 0.9578321501612663, "num_tokens": 2654208.0, "step": 162 }, { "entropy": 4.682773381471634, "epoch": 0.482962962962963, "grad_norm": 1.227596402168274, "learning_rate": 5.285285285285286e-06, "loss": 0.19611728191375732, "mean_token_accuracy": 0.9440445899963379, "num_tokens": 2670592.0, "step": 163 }, { "entropy": 4.8632601499557495, "epoch": 0.48592592592592593, "grad_norm": 1.4043176174163818, "learning_rate": 5.255255255255256e-06, "loss": 0.3586108684539795, "mean_token_accuracy": 0.906936950981617, "num_tokens": 2686976.0, "step": 164 }, { "entropy": 4.995940268039703, "epoch": 0.4888888888888889, "grad_norm": 1.2404309511184692, "learning_rate": 5.225225225225226e-06, "loss": 0.24390891194343567, "mean_token_accuracy": 0.9296717569231987, "num_tokens": 2703360.0, "step": 165 }, { "entropy": 4.797116637229919, "epoch": 0.4918518518518519, "grad_norm": 1.1622867584228516, "learning_rate": 5.195195195195195e-06, "loss": 0.23147624731063843, "mean_token_accuracy": 0.9457610249519348, "num_tokens": 2719744.0, "step": 166 }, { "entropy": 4.39326399564743, "epoch": 0.4948148148148148, "grad_norm": 0.9756916761398315, "learning_rate": 5.165165165165165e-06, "loss": 0.17684155702590942, "mean_token_accuracy": 0.9526332467794418, "num_tokens": 2736128.0, "step": 167 }, { "entropy": 4.997508525848389, "epoch": 0.49777777777777776, "grad_norm": 1.3051714897155762, "learning_rate": 5.135135135135135e-06, "loss": 0.2765073776245117, "mean_token_accuracy": 0.9134911745786667, "num_tokens": 2752512.0, "step": 168 }, { "entropy": 4.755920052528381, "epoch": 0.5007407407407407, "grad_norm": 1.1401017904281616, "learning_rate": 5.105105105105106e-06, "loss": 0.161317840218544, "mean_token_accuracy": 0.956555500626564, "num_tokens": 2768896.0, "step": 169 }, { "entropy": 4.551803827285767, "epoch": 0.5037037037037037, "grad_norm": 1.263131022453308, "learning_rate": 5.075075075075075e-06, "loss": 0.21821963787078857, "mean_token_accuracy": 0.9273721501231194, "num_tokens": 2785280.0, "step": 170 }, { "entropy": 4.860443592071533, "epoch": 0.5066666666666667, "grad_norm": 1.6431126594543457, "learning_rate": 5.045045045045045e-06, "loss": 0.2978250980377197, "mean_token_accuracy": 0.93219093978405, "num_tokens": 2801664.0, "step": 171 }, { "entropy": 5.091837644577026, "epoch": 0.5096296296296297, "grad_norm": 1.2256911993026733, "learning_rate": 5.0150150150150156e-06, "loss": 0.22089162468910217, "mean_token_accuracy": 0.9408608600497246, "num_tokens": 2818048.0, "step": 172 }, { "entropy": 4.412120908498764, "epoch": 0.5125925925925926, "grad_norm": 0.961300253868103, "learning_rate": 4.984984984984985e-06, "loss": 0.1452527940273285, "mean_token_accuracy": 0.9523980766534805, "num_tokens": 2834432.0, "step": 173 }, { "entropy": 4.599301666021347, "epoch": 0.5155555555555555, "grad_norm": 1.2644505500793457, "learning_rate": 4.954954954954955e-06, "loss": 0.23289738595485687, "mean_token_accuracy": 0.9304530620574951, "num_tokens": 2850816.0, "step": 174 }, { "entropy": 4.892768442630768, "epoch": 0.5185185185185185, "grad_norm": 1.3745007514953613, "learning_rate": 4.9249249249249255e-06, "loss": 0.26232171058654785, "mean_token_accuracy": 0.9334614500403404, "num_tokens": 2867200.0, "step": 175 }, { "entropy": 4.197520017623901, "epoch": 0.5214814814814814, "grad_norm": 0.7528343796730042, "learning_rate": 4.894894894894895e-06, "loss": 0.08706651628017426, "mean_token_accuracy": 0.9749511107802391, "num_tokens": 2883584.0, "step": 176 }, { "entropy": 4.844129204750061, "epoch": 0.5244444444444445, "grad_norm": 0.9900454878807068, "learning_rate": 4.864864864864866e-06, "loss": 0.13525359332561493, "mean_token_accuracy": 0.9629090502858162, "num_tokens": 2899968.0, "step": 177 }, { "entropy": 4.392915487289429, "epoch": 0.5274074074074074, "grad_norm": 1.133989691734314, "learning_rate": 4.8348348348348355e-06, "loss": 0.21110782027244568, "mean_token_accuracy": 0.9441019669175148, "num_tokens": 2916352.0, "step": 178 }, { "entropy": 4.104142814874649, "epoch": 0.5303703703703704, "grad_norm": 0.850631833076477, "learning_rate": 4.804804804804805e-06, "loss": 0.10834487527608871, "mean_token_accuracy": 0.9692110046744347, "num_tokens": 2932736.0, "step": 179 }, { "entropy": 4.734551101922989, "epoch": 0.5333333333333333, "grad_norm": 1.3208616971969604, "learning_rate": 4.774774774774775e-06, "loss": 0.23270879685878754, "mean_token_accuracy": 0.9379692524671555, "num_tokens": 2949120.0, "step": 180 }, { "entropy": 4.912560999393463, "epoch": 0.5362962962962963, "grad_norm": 1.2346423864364624, "learning_rate": 4.7447447447447454e-06, "loss": 0.19857312738895416, "mean_token_accuracy": 0.9455485790967941, "num_tokens": 2965504.0, "step": 181 }, { "entropy": 4.509212881326675, "epoch": 0.5392592592592592, "grad_norm": 1.0463180541992188, "learning_rate": 4.714714714714715e-06, "loss": 0.16583660244941711, "mean_token_accuracy": 0.9510217607021332, "num_tokens": 2981888.0, "step": 182 }, { "entropy": 4.015108644962311, "epoch": 0.5422222222222223, "grad_norm": 1.0624524354934692, "learning_rate": 4.684684684684685e-06, "loss": 0.15331816673278809, "mean_token_accuracy": 0.9658570662140846, "num_tokens": 2998272.0, "step": 183 }, { "entropy": 4.083783894777298, "epoch": 0.5451851851851852, "grad_norm": 0.9544261693954468, "learning_rate": 4.654654654654655e-06, "loss": 0.14625918865203857, "mean_token_accuracy": 0.9399384111166, "num_tokens": 3014656.0, "step": 184 }, { "entropy": 4.890080273151398, "epoch": 0.5481481481481482, "grad_norm": 1.2931667566299438, "learning_rate": 4.624624624624625e-06, "loss": 0.24348178505897522, "mean_token_accuracy": 0.938007041811943, "num_tokens": 3031040.0, "step": 185 }, { "entropy": 4.95048725605011, "epoch": 0.5511111111111111, "grad_norm": 1.5240236520767212, "learning_rate": 4.594594594594596e-06, "loss": 0.343029260635376, "mean_token_accuracy": 0.9150973930954933, "num_tokens": 3047424.0, "step": 186 }, { "entropy": 4.586461454629898, "epoch": 0.554074074074074, "grad_norm": 1.1299018859863281, "learning_rate": 4.5645645645645645e-06, "loss": 0.15247294306755066, "mean_token_accuracy": 0.9517891779541969, "num_tokens": 3063808.0, "step": 187 }, { "entropy": 4.866858541965485, "epoch": 0.557037037037037, "grad_norm": 1.3016594648361206, "learning_rate": 4.534534534534535e-06, "loss": 0.21522042155265808, "mean_token_accuracy": 0.9356319904327393, "num_tokens": 3080192.0, "step": 188 }, { "entropy": 4.672504544258118, "epoch": 0.56, "grad_norm": 1.055087924003601, "learning_rate": 4.504504504504505e-06, "loss": 0.2004142701625824, "mean_token_accuracy": 0.9426759034395218, "num_tokens": 3096576.0, "step": 189 }, { "entropy": 4.583247601985931, "epoch": 0.562962962962963, "grad_norm": 1.2147111892700195, "learning_rate": 4.474474474474475e-06, "loss": 0.19617295265197754, "mean_token_accuracy": 0.9414351284503937, "num_tokens": 3112960.0, "step": 190 }, { "entropy": 4.45947140455246, "epoch": 0.5659259259259259, "grad_norm": 0.9906570911407471, "learning_rate": 4.444444444444444e-06, "loss": 0.1671217381954193, "mean_token_accuracy": 0.949979692697525, "num_tokens": 3129344.0, "step": 191 }, { "entropy": 4.343527674674988, "epoch": 0.5688888888888889, "grad_norm": 1.0607426166534424, "learning_rate": 4.414414414414415e-06, "loss": 0.1750665307044983, "mean_token_accuracy": 0.9508633464574814, "num_tokens": 3145728.0, "step": 192 }, { "entropy": 4.752969801425934, "epoch": 0.5718518518518518, "grad_norm": 1.6461411714553833, "learning_rate": 4.384384384384384e-06, "loss": 0.3614075481891632, "mean_token_accuracy": 0.9037638604640961, "num_tokens": 3162112.0, "step": 193 }, { "entropy": 4.508844017982483, "epoch": 0.5748148148148148, "grad_norm": 1.089011549949646, "learning_rate": 4.354354354354355e-06, "loss": 0.14948895573616028, "mean_token_accuracy": 0.9594759792089462, "num_tokens": 3178496.0, "step": 194 }, { "entropy": 5.090130269527435, "epoch": 0.5777777777777777, "grad_norm": 1.6512131690979004, "learning_rate": 4.324324324324325e-06, "loss": 0.2583276331424713, "mean_token_accuracy": 0.9319260492920876, "num_tokens": 3194880.0, "step": 195 }, { "entropy": 4.824137568473816, "epoch": 0.5807407407407408, "grad_norm": 1.3563088178634644, "learning_rate": 4.294294294294294e-06, "loss": 0.2706582546234131, "mean_token_accuracy": 0.9324178025126457, "num_tokens": 3211264.0, "step": 196 }, { "entropy": 4.71843621134758, "epoch": 0.5837037037037037, "grad_norm": 1.3810391426086426, "learning_rate": 4.264264264264265e-06, "loss": 0.24942129850387573, "mean_token_accuracy": 0.9400762096047401, "num_tokens": 3227648.0, "step": 197 }, { "entropy": 5.009927153587341, "epoch": 0.5866666666666667, "grad_norm": 1.4821265935897827, "learning_rate": 4.234234234234235e-06, "loss": 0.24027667939662933, "mean_token_accuracy": 0.9404318556189537, "num_tokens": 3244032.0, "step": 198 }, { "entropy": 4.441025912761688, "epoch": 0.5896296296296296, "grad_norm": 1.1178737878799438, "learning_rate": 4.204204204204204e-06, "loss": 0.16021518409252167, "mean_token_accuracy": 0.9493553563952446, "num_tokens": 3260416.0, "step": 199 }, { "entropy": 4.375000834465027, "epoch": 0.5925925925925926, "grad_norm": 0.8944060206413269, "learning_rate": 4.174174174174174e-06, "loss": 0.11856413632631302, "mean_token_accuracy": 0.9657595604658127, "num_tokens": 3276800.0, "step": 200 }, { "epoch": 0.5925925925925926, "eval_entropy": 4.434207131067912, "eval_loss": 0.19389286637306213, "eval_mean_token_accuracy": 0.9477152585983276, "eval_num_tokens": 3276800.0, "eval_runtime": 41.8193, "eval_samples_per_second": 14.347, "eval_steps_per_second": 1.793, "step": 200 }, { "entropy": 4.466799020767212, "epoch": 0.5955555555555555, "grad_norm": 1.115869402885437, "learning_rate": 4.1441441441441446e-06, "loss": 0.1898970603942871, "mean_token_accuracy": 0.9451106563210487, "num_tokens": 3293184.0, "step": 201 }, { "entropy": 4.269784092903137, "epoch": 0.5985185185185186, "grad_norm": 0.9474321603775024, "learning_rate": 4.114114114114114e-06, "loss": 0.13602310419082642, "mean_token_accuracy": 0.9589507281780243, "num_tokens": 3309568.0, "step": 202 }, { "entropy": 4.54515814781189, "epoch": 0.6014814814814815, "grad_norm": 1.2822232246398926, "learning_rate": 4.084084084084085e-06, "loss": 0.22034525871276855, "mean_token_accuracy": 0.9429414942860603, "num_tokens": 3325952.0, "step": 203 }, { "entropy": 4.767253935337067, "epoch": 0.6044444444444445, "grad_norm": 1.2094990015029907, "learning_rate": 4.0540540540540545e-06, "loss": 0.23143570125102997, "mean_token_accuracy": 0.9389630481600761, "num_tokens": 3342336.0, "step": 204 }, { "entropy": 4.702608406543732, "epoch": 0.6074074074074074, "grad_norm": 1.2544713020324707, "learning_rate": 4.024024024024024e-06, "loss": 0.28470316529273987, "mean_token_accuracy": 0.9257371500134468, "num_tokens": 3358720.0, "step": 205 }, { "entropy": 4.597526431083679, "epoch": 0.6103703703703703, "grad_norm": 1.1126115322113037, "learning_rate": 3.993993993993994e-06, "loss": 0.1989898383617401, "mean_token_accuracy": 0.9416873753070831, "num_tokens": 3375104.0, "step": 206 }, { "entropy": 4.506279408931732, "epoch": 0.6133333333333333, "grad_norm": 0.8431299328804016, "learning_rate": 3.9639639639639645e-06, "loss": 0.13484124839305878, "mean_token_accuracy": 0.95867919921875, "num_tokens": 3391488.0, "step": 207 }, { "entropy": 4.58755087852478, "epoch": 0.6162962962962963, "grad_norm": 1.352049708366394, "learning_rate": 3.933933933933934e-06, "loss": 0.22309252619743347, "mean_token_accuracy": 0.9428984001278877, "num_tokens": 3407872.0, "step": 208 }, { "entropy": 4.268629372119904, "epoch": 0.6192592592592593, "grad_norm": 1.1418225765228271, "learning_rate": 3.903903903903904e-06, "loss": 0.24874381721019745, "mean_token_accuracy": 0.9192089438438416, "num_tokens": 3424256.0, "step": 209 }, { "entropy": 4.83259379863739, "epoch": 0.6222222222222222, "grad_norm": 1.3404130935668945, "learning_rate": 3.8738738738738744e-06, "loss": 0.24457751214504242, "mean_token_accuracy": 0.937289871275425, "num_tokens": 3440640.0, "step": 210 }, { "entropy": 4.678910106420517, "epoch": 0.6251851851851852, "grad_norm": 1.2527177333831787, "learning_rate": 3.843843843843844e-06, "loss": 0.22603629529476166, "mean_token_accuracy": 0.9248089641332626, "num_tokens": 3457024.0, "step": 211 }, { "entropy": 4.5991188287734985, "epoch": 0.6281481481481481, "grad_norm": 0.9777531623840332, "learning_rate": 3.8138138138138143e-06, "loss": 0.14755500853061676, "mean_token_accuracy": 0.9557277113199234, "num_tokens": 3473408.0, "step": 212 }, { "entropy": 4.511403858661652, "epoch": 0.6311111111111111, "grad_norm": 1.2577223777770996, "learning_rate": 3.7837837837837844e-06, "loss": 0.26127955317497253, "mean_token_accuracy": 0.931500144302845, "num_tokens": 3489792.0, "step": 213 }, { "entropy": 4.782365560531616, "epoch": 0.6340740740740741, "grad_norm": 1.1569401025772095, "learning_rate": 3.7537537537537537e-06, "loss": 0.19748210906982422, "mean_token_accuracy": 0.9451235607266426, "num_tokens": 3506176.0, "step": 214 }, { "entropy": 4.5431535840034485, "epoch": 0.6370370370370371, "grad_norm": 1.0455090999603271, "learning_rate": 3.723723723723724e-06, "loss": 0.18465566635131836, "mean_token_accuracy": 0.947294220328331, "num_tokens": 3522560.0, "step": 215 }, { "entropy": 4.15060818195343, "epoch": 0.64, "grad_norm": 0.9153735041618347, "learning_rate": 3.693693693693694e-06, "loss": 0.12476930022239685, "mean_token_accuracy": 0.960964560508728, "num_tokens": 3538944.0, "step": 216 }, { "entropy": 4.939278542995453, "epoch": 0.642962962962963, "grad_norm": 1.75506591796875, "learning_rate": 3.663663663663664e-06, "loss": 0.33442193269729614, "mean_token_accuracy": 0.9232882410287857, "num_tokens": 3555328.0, "step": 217 }, { "entropy": 4.662109076976776, "epoch": 0.6459259259259259, "grad_norm": 1.198652744293213, "learning_rate": 3.633633633633634e-06, "loss": 0.1985606849193573, "mean_token_accuracy": 0.9437128081917763, "num_tokens": 3571712.0, "step": 218 }, { "entropy": 4.011054754257202, "epoch": 0.6488888888888888, "grad_norm": 0.7987180352210999, "learning_rate": 3.603603603603604e-06, "loss": 0.12160375714302063, "mean_token_accuracy": 0.9573516696691513, "num_tokens": 3588096.0, "step": 219 }, { "entropy": 4.471042722463608, "epoch": 0.6518518518518519, "grad_norm": 1.1055737733840942, "learning_rate": 3.573573573573574e-06, "loss": 0.1902877688407898, "mean_token_accuracy": 0.9458613023161888, "num_tokens": 3604480.0, "step": 220 }, { "entropy": 4.585752725601196, "epoch": 0.6548148148148148, "grad_norm": 1.390073299407959, "learning_rate": 3.5435435435435437e-06, "loss": 0.2900771200656891, "mean_token_accuracy": 0.9287381917238235, "num_tokens": 3620864.0, "step": 221 }, { "entropy": 4.868175387382507, "epoch": 0.6577777777777778, "grad_norm": 1.0750362873077393, "learning_rate": 3.513513513513514e-06, "loss": 0.14728227257728577, "mean_token_accuracy": 0.9561847373843193, "num_tokens": 3637248.0, "step": 222 }, { "entropy": 4.30068638920784, "epoch": 0.6607407407407407, "grad_norm": 0.9645360112190247, "learning_rate": 3.4834834834834835e-06, "loss": 0.1360422521829605, "mean_token_accuracy": 0.963471345603466, "num_tokens": 3653632.0, "step": 223 }, { "entropy": 3.964165151119232, "epoch": 0.6637037037037037, "grad_norm": 0.8071714043617249, "learning_rate": 3.4534534534534537e-06, "loss": 0.1220124140381813, "mean_token_accuracy": 0.9683285132050514, "num_tokens": 3670016.0, "step": 224 }, { "entropy": 4.224881365895271, "epoch": 0.6666666666666666, "grad_norm": 1.177420973777771, "learning_rate": 3.423423423423424e-06, "loss": 0.25342920422554016, "mean_token_accuracy": 0.9281225427985191, "num_tokens": 3686400.0, "step": 225 }, { "entropy": 4.558864623308182, "epoch": 0.6696296296296296, "grad_norm": 1.1701397895812988, "learning_rate": 3.393393393393394e-06, "loss": 0.17833128571510315, "mean_token_accuracy": 0.9490250796079636, "num_tokens": 3702784.0, "step": 226 }, { "entropy": 4.978881150484085, "epoch": 0.6725925925925926, "grad_norm": 1.158742070198059, "learning_rate": 3.363363363363364e-06, "loss": 0.20285750925540924, "mean_token_accuracy": 0.9312335178256035, "num_tokens": 3719168.0, "step": 227 }, { "entropy": 4.179438591003418, "epoch": 0.6755555555555556, "grad_norm": 1.008829116821289, "learning_rate": 3.3333333333333333e-06, "loss": 0.12895622849464417, "mean_token_accuracy": 0.959755003452301, "num_tokens": 3735552.0, "step": 228 }, { "entropy": 4.323319256305695, "epoch": 0.6785185185185185, "grad_norm": 0.979805588722229, "learning_rate": 3.3033033033033035e-06, "loss": 0.16936425864696503, "mean_token_accuracy": 0.9553892686963081, "num_tokens": 3751936.0, "step": 229 }, { "entropy": 4.394837021827698, "epoch": 0.6814814814814815, "grad_norm": 1.8132017850875854, "learning_rate": 3.2732732732732736e-06, "loss": 0.14924685657024384, "mean_token_accuracy": 0.9515182301402092, "num_tokens": 3768320.0, "step": 230 }, { "entropy": 4.344091087579727, "epoch": 0.6844444444444444, "grad_norm": 1.021894097328186, "learning_rate": 3.2432432432432437e-06, "loss": 0.1912682056427002, "mean_token_accuracy": 0.938031829893589, "num_tokens": 3784704.0, "step": 231 }, { "entropy": 4.561292320489883, "epoch": 0.6874074074074074, "grad_norm": 0.9297524094581604, "learning_rate": 3.2132132132132134e-06, "loss": 0.14056260883808136, "mean_token_accuracy": 0.9600224196910858, "num_tokens": 3801088.0, "step": 232 }, { "entropy": 4.751155436038971, "epoch": 0.6903703703703704, "grad_norm": 1.4993069171905518, "learning_rate": 3.183183183183183e-06, "loss": 0.3311198055744171, "mean_token_accuracy": 0.91727364808321, "num_tokens": 3817472.0, "step": 233 }, { "entropy": 3.6052426397800446, "epoch": 0.6933333333333334, "grad_norm": 0.792428195476532, "learning_rate": 3.1531531531531532e-06, "loss": 0.10642168670892715, "mean_token_accuracy": 0.9628430530428886, "num_tokens": 3833856.0, "step": 234 }, { "entropy": 4.941285133361816, "epoch": 0.6962962962962963, "grad_norm": 1.4012000560760498, "learning_rate": 3.1231231231231234e-06, "loss": 0.2629278600215912, "mean_token_accuracy": 0.9188983291387558, "num_tokens": 3850240.0, "step": 235 }, { "entropy": 4.552713304758072, "epoch": 0.6992592592592592, "grad_norm": 0.9069911241531372, "learning_rate": 3.0930930930930935e-06, "loss": 0.12337417900562286, "mean_token_accuracy": 0.9626295566558838, "num_tokens": 3866624.0, "step": 236 }, { "entropy": 4.564219534397125, "epoch": 0.7022222222222222, "grad_norm": 0.9812677502632141, "learning_rate": 3.063063063063063e-06, "loss": 0.1848071813583374, "mean_token_accuracy": 0.9507527649402618, "num_tokens": 3883008.0, "step": 237 }, { "entropy": 4.246627330780029, "epoch": 0.7051851851851851, "grad_norm": 0.947043776512146, "learning_rate": 3.0330330330330333e-06, "loss": 0.1329410970211029, "mean_token_accuracy": 0.9477042853832245, "num_tokens": 3899392.0, "step": 238 }, { "entropy": 4.977287948131561, "epoch": 0.7081481481481482, "grad_norm": 1.1813249588012695, "learning_rate": 3.0030030030030034e-06, "loss": 0.14123371243476868, "mean_token_accuracy": 0.9628991261124611, "num_tokens": 3915776.0, "step": 239 }, { "entropy": 5.06807667016983, "epoch": 0.7111111111111111, "grad_norm": 1.3652091026306152, "learning_rate": 2.9729729729729736e-06, "loss": 0.1918249875307083, "mean_token_accuracy": 0.9512263685464859, "num_tokens": 3932160.0, "step": 240 }, { "entropy": 4.769917339086533, "epoch": 0.7140740740740741, "grad_norm": 1.279091477394104, "learning_rate": 2.942942942942943e-06, "loss": 0.20959080755710602, "mean_token_accuracy": 0.9461727887392044, "num_tokens": 3948544.0, "step": 241 }, { "entropy": 4.704398810863495, "epoch": 0.717037037037037, "grad_norm": 1.2999058961868286, "learning_rate": 2.912912912912913e-06, "loss": 0.214752659201622, "mean_token_accuracy": 0.9327414259314537, "num_tokens": 3964928.0, "step": 242 }, { "entropy": 4.448032274842262, "epoch": 0.72, "grad_norm": 1.1233701705932617, "learning_rate": 2.882882882882883e-06, "loss": 0.2309226542711258, "mean_token_accuracy": 0.9327290877699852, "num_tokens": 3981312.0, "step": 243 }, { "entropy": 4.651471734046936, "epoch": 0.7229629629629629, "grad_norm": 1.2081260681152344, "learning_rate": 2.8528528528528532e-06, "loss": 0.20126961171627045, "mean_token_accuracy": 0.9540340229868889, "num_tokens": 3997696.0, "step": 244 }, { "entropy": 3.968225985765457, "epoch": 0.725925925925926, "grad_norm": 0.9694662690162659, "learning_rate": 2.8228228228228234e-06, "loss": 0.15460558235645294, "mean_token_accuracy": 0.9566036984324455, "num_tokens": 4014080.0, "step": 245 }, { "entropy": 4.390538901090622, "epoch": 0.7288888888888889, "grad_norm": 0.8548852205276489, "learning_rate": 2.7927927927927926e-06, "loss": 0.097850002348423, "mean_token_accuracy": 0.9653645381331444, "num_tokens": 4030464.0, "step": 246 }, { "entropy": 4.503017544746399, "epoch": 0.7318518518518519, "grad_norm": 1.3469693660736084, "learning_rate": 2.7627627627627628e-06, "loss": 0.24841120839118958, "mean_token_accuracy": 0.9232476502656937, "num_tokens": 4046848.0, "step": 247 }, { "entropy": 4.462825655937195, "epoch": 0.7348148148148148, "grad_norm": 1.4217870235443115, "learning_rate": 2.732732732732733e-06, "loss": 0.19937056303024292, "mean_token_accuracy": 0.935769684612751, "num_tokens": 4063232.0, "step": 248 }, { "entropy": 4.652177691459656, "epoch": 0.7377777777777778, "grad_norm": 0.8824627995491028, "learning_rate": 2.702702702702703e-06, "loss": 0.10789984464645386, "mean_token_accuracy": 0.960510291159153, "num_tokens": 4079616.0, "step": 249 }, { "entropy": 4.937440276145935, "epoch": 0.7407407407407407, "grad_norm": 1.3179996013641357, "learning_rate": 2.672672672672673e-06, "loss": 0.2225571870803833, "mean_token_accuracy": 0.9387790188193321, "num_tokens": 4096000.0, "step": 250 }, { "epoch": 0.7407407407407407, "eval_entropy": 4.431756820678711, "eval_loss": 0.18967284262180328, "eval_mean_token_accuracy": 0.9489845228195191, "eval_num_tokens": 4096000.0, "eval_runtime": 41.787, "eval_samples_per_second": 14.359, "eval_steps_per_second": 1.795, "step": 250 }, { "entropy": 4.682657957077026, "epoch": 0.7437037037037038, "grad_norm": 1.3843475580215454, "learning_rate": 2.642642642642643e-06, "loss": 0.289166659116745, "mean_token_accuracy": 0.9240095615386963, "num_tokens": 4112384.0, "step": 251 }, { "entropy": 4.640824466943741, "epoch": 0.7466666666666667, "grad_norm": 1.3217209577560425, "learning_rate": 2.612612612612613e-06, "loss": 0.1822134405374527, "mean_token_accuracy": 0.9433777928352356, "num_tokens": 4128768.0, "step": 252 }, { "entropy": 4.447018921375275, "epoch": 0.7496296296296296, "grad_norm": 1.1168774366378784, "learning_rate": 2.5825825825825827e-06, "loss": 0.17142070829868317, "mean_token_accuracy": 0.9459712356328964, "num_tokens": 4145152.0, "step": 253 }, { "entropy": 3.9602254927158356, "epoch": 0.7525925925925926, "grad_norm": 0.8399432897567749, "learning_rate": 2.552552552552553e-06, "loss": 0.12639330327510834, "mean_token_accuracy": 0.9613935053348541, "num_tokens": 4161536.0, "step": 254 }, { "entropy": 4.601360231637955, "epoch": 0.7555555555555555, "grad_norm": 1.5550976991653442, "learning_rate": 2.5225225225225225e-06, "loss": 0.3048744797706604, "mean_token_accuracy": 0.9272002652287483, "num_tokens": 4177920.0, "step": 255 }, { "entropy": 4.242599338293076, "epoch": 0.7585185185185185, "grad_norm": 0.7686388492584229, "learning_rate": 2.4924924924924926e-06, "loss": 0.10443609952926636, "mean_token_accuracy": 0.9714921414852142, "num_tokens": 4194304.0, "step": 256 }, { "entropy": 4.363556146621704, "epoch": 0.7614814814814815, "grad_norm": 1.1787077188491821, "learning_rate": 2.4624624624624628e-06, "loss": 0.204661563038826, "mean_token_accuracy": 0.9339022636413574, "num_tokens": 4210688.0, "step": 257 }, { "entropy": 4.804235219955444, "epoch": 0.7644444444444445, "grad_norm": 1.2627975940704346, "learning_rate": 2.432432432432433e-06, "loss": 0.2364749014377594, "mean_token_accuracy": 0.9268576577305794, "num_tokens": 4227072.0, "step": 258 }, { "entropy": 4.747017592191696, "epoch": 0.7674074074074074, "grad_norm": 1.2610846757888794, "learning_rate": 2.4024024024024026e-06, "loss": 0.22435243427753448, "mean_token_accuracy": 0.9417654201388359, "num_tokens": 4243456.0, "step": 259 }, { "entropy": 4.638267368078232, "epoch": 0.7703703703703704, "grad_norm": 0.9914318323135376, "learning_rate": 2.3723723723723727e-06, "loss": 0.13380999863147736, "mean_token_accuracy": 0.9633992239832878, "num_tokens": 4259840.0, "step": 260 }, { "entropy": 4.573302686214447, "epoch": 0.7733333333333333, "grad_norm": 1.0350133180618286, "learning_rate": 2.3423423423423424e-06, "loss": 0.12615230679512024, "mean_token_accuracy": 0.9685780853033066, "num_tokens": 4276224.0, "step": 261 }, { "entropy": 4.689242094755173, "epoch": 0.7762962962962963, "grad_norm": 1.2482013702392578, "learning_rate": 2.3123123123123125e-06, "loss": 0.23291385173797607, "mean_token_accuracy": 0.9366420358419418, "num_tokens": 4292608.0, "step": 262 }, { "entropy": 3.998199611902237, "epoch": 0.7792592592592592, "grad_norm": 1.0057257413864136, "learning_rate": 2.2822822822822822e-06, "loss": 0.17179888486862183, "mean_token_accuracy": 0.9553137645125389, "num_tokens": 4308992.0, "step": 263 }, { "entropy": 4.225500136613846, "epoch": 0.7822222222222223, "grad_norm": 1.0887339115142822, "learning_rate": 2.2522522522522524e-06, "loss": 0.19778764247894287, "mean_token_accuracy": 0.9462638273835182, "num_tokens": 4325376.0, "step": 264 }, { "entropy": 4.825541436672211, "epoch": 0.7851851851851852, "grad_norm": 1.3681272268295288, "learning_rate": 2.222222222222222e-06, "loss": 0.2275351583957672, "mean_token_accuracy": 0.9374270439147949, "num_tokens": 4341760.0, "step": 265 }, { "entropy": 4.241901844739914, "epoch": 0.7881481481481482, "grad_norm": 0.8523630499839783, "learning_rate": 2.192192192192192e-06, "loss": 0.12036363780498505, "mean_token_accuracy": 0.965179368853569, "num_tokens": 4358144.0, "step": 266 }, { "entropy": 4.517692267894745, "epoch": 0.7911111111111111, "grad_norm": 1.3278928995132446, "learning_rate": 2.1621621621621623e-06, "loss": 0.22415080666542053, "mean_token_accuracy": 0.9306197762489319, "num_tokens": 4374528.0, "step": 267 }, { "entropy": 4.571178376674652, "epoch": 0.794074074074074, "grad_norm": 1.1973634958267212, "learning_rate": 2.1321321321321325e-06, "loss": 0.20524609088897705, "mean_token_accuracy": 0.9440915882587433, "num_tokens": 4390912.0, "step": 268 }, { "entropy": 4.527001351118088, "epoch": 0.797037037037037, "grad_norm": 1.1548199653625488, "learning_rate": 2.102102102102102e-06, "loss": 0.17511600255966187, "mean_token_accuracy": 0.9538666158914566, "num_tokens": 4407296.0, "step": 269 }, { "entropy": 4.6544947028160095, "epoch": 0.8, "grad_norm": 1.2351737022399902, "learning_rate": 2.0720720720720723e-06, "loss": 0.19483497738838196, "mean_token_accuracy": 0.9452883303165436, "num_tokens": 4423680.0, "step": 270 }, { "entropy": 5.057309329509735, "epoch": 0.802962962962963, "grad_norm": 1.6245460510253906, "learning_rate": 2.0420420420420424e-06, "loss": 0.2552773952484131, "mean_token_accuracy": 0.9292241409420967, "num_tokens": 4440064.0, "step": 271 }, { "entropy": 4.319163411855698, "epoch": 0.8059259259259259, "grad_norm": 1.1663082838058472, "learning_rate": 2.012012012012012e-06, "loss": 0.20227555930614471, "mean_token_accuracy": 0.9424327984452248, "num_tokens": 4456448.0, "step": 272 }, { "entropy": 4.2681728303432465, "epoch": 0.8088888888888889, "grad_norm": 1.123548150062561, "learning_rate": 1.9819819819819822e-06, "loss": 0.14079917967319489, "mean_token_accuracy": 0.9620539620518684, "num_tokens": 4472832.0, "step": 273 }, { "entropy": 4.891470432281494, "epoch": 0.8118518518518518, "grad_norm": 1.4096643924713135, "learning_rate": 1.951951951951952e-06, "loss": 0.28214773535728455, "mean_token_accuracy": 0.9280454739928246, "num_tokens": 4489216.0, "step": 274 }, { "entropy": 4.890909731388092, "epoch": 0.8148148148148148, "grad_norm": 1.5594446659088135, "learning_rate": 1.921921921921922e-06, "loss": 0.27530887722969055, "mean_token_accuracy": 0.9204972609877586, "num_tokens": 4505600.0, "step": 275 }, { "entropy": 4.334610432386398, "epoch": 0.8177777777777778, "grad_norm": 0.8866946697235107, "learning_rate": 1.8918918918918922e-06, "loss": 0.10634834319353104, "mean_token_accuracy": 0.974961668252945, "num_tokens": 4521984.0, "step": 276 }, { "entropy": 4.795411825180054, "epoch": 0.8207407407407408, "grad_norm": 1.2682218551635742, "learning_rate": 1.861861861861862e-06, "loss": 0.23752596974372864, "mean_token_accuracy": 0.9372685104608536, "num_tokens": 4538368.0, "step": 277 }, { "entropy": 4.446784436702728, "epoch": 0.8237037037037037, "grad_norm": 1.0979875326156616, "learning_rate": 1.831831831831832e-06, "loss": 0.17328760027885437, "mean_token_accuracy": 0.9520234763622284, "num_tokens": 4554752.0, "step": 278 }, { "entropy": 5.077227234840393, "epoch": 0.8266666666666667, "grad_norm": 1.7083468437194824, "learning_rate": 1.801801801801802e-06, "loss": 0.3257288336753845, "mean_token_accuracy": 0.9132296666502953, "num_tokens": 4571136.0, "step": 279 }, { "entropy": 4.317785233259201, "epoch": 0.8296296296296296, "grad_norm": 0.9281159043312073, "learning_rate": 1.7717717717717719e-06, "loss": 0.1367281675338745, "mean_token_accuracy": 0.9651428610086441, "num_tokens": 4587520.0, "step": 280 }, { "entropy": 5.042377591133118, "epoch": 0.8325925925925926, "grad_norm": 1.3829681873321533, "learning_rate": 1.7417417417417418e-06, "loss": 0.24436160922050476, "mean_token_accuracy": 0.9278001636266708, "num_tokens": 4603904.0, "step": 281 }, { "entropy": 4.584516406059265, "epoch": 0.8355555555555556, "grad_norm": 1.1155527830123901, "learning_rate": 1.711711711711712e-06, "loss": 0.19232724606990814, "mean_token_accuracy": 0.9483994618058205, "num_tokens": 4620288.0, "step": 282 }, { "entropy": 4.5082491636276245, "epoch": 0.8385185185185186, "grad_norm": 0.938524603843689, "learning_rate": 1.681681681681682e-06, "loss": 0.14862608909606934, "mean_token_accuracy": 0.9592047855257988, "num_tokens": 4636672.0, "step": 283 }, { "entropy": 4.207568436861038, "epoch": 0.8414814814814815, "grad_norm": 0.7634081244468689, "learning_rate": 1.6516516516516517e-06, "loss": 0.10312718152999878, "mean_token_accuracy": 0.9655114337801933, "num_tokens": 4653056.0, "step": 284 }, { "entropy": 4.553406655788422, "epoch": 0.8444444444444444, "grad_norm": 1.1271867752075195, "learning_rate": 1.6216216216216219e-06, "loss": 0.1725669503211975, "mean_token_accuracy": 0.9447145611047745, "num_tokens": 4669440.0, "step": 285 }, { "entropy": 4.9145150780677795, "epoch": 0.8474074074074074, "grad_norm": 1.121119737625122, "learning_rate": 1.5915915915915916e-06, "loss": 0.1591874212026596, "mean_token_accuracy": 0.9459866732358932, "num_tokens": 4685824.0, "step": 286 }, { "entropy": 4.546119570732117, "epoch": 0.8503703703703703, "grad_norm": 1.0445350408554077, "learning_rate": 1.5615615615615617e-06, "loss": 0.18919306993484497, "mean_token_accuracy": 0.9420925006270409, "num_tokens": 4702208.0, "step": 287 }, { "entropy": 4.208664923906326, "epoch": 0.8533333333333334, "grad_norm": 1.017647624015808, "learning_rate": 1.5315315315315316e-06, "loss": 0.12748247385025024, "mean_token_accuracy": 0.9632326811552048, "num_tokens": 4718592.0, "step": 288 }, { "entropy": 4.534173429012299, "epoch": 0.8562962962962963, "grad_norm": 0.9885667562484741, "learning_rate": 1.5015015015015017e-06, "loss": 0.16047002375125885, "mean_token_accuracy": 0.9475576058030128, "num_tokens": 4734976.0, "step": 289 }, { "entropy": 4.53923037648201, "epoch": 0.8592592592592593, "grad_norm": 1.4043318033218384, "learning_rate": 1.4714714714714714e-06, "loss": 0.23335830867290497, "mean_token_accuracy": 0.9432575777173042, "num_tokens": 4751360.0, "step": 290 }, { "entropy": 4.453351438045502, "epoch": 0.8622222222222222, "grad_norm": 1.2922645807266235, "learning_rate": 1.4414414414414416e-06, "loss": 0.2262791097164154, "mean_token_accuracy": 0.9343696013092995, "num_tokens": 4767744.0, "step": 291 }, { "entropy": 4.307468056678772, "epoch": 0.8651851851851852, "grad_norm": 0.8348132967948914, "learning_rate": 1.4114114114114117e-06, "loss": 0.10120698064565659, "mean_token_accuracy": 0.9699218273162842, "num_tokens": 4784128.0, "step": 292 }, { "entropy": 4.376435071229935, "epoch": 0.8681481481481481, "grad_norm": 0.9932755827903748, "learning_rate": 1.3813813813813814e-06, "loss": 0.16437053680419922, "mean_token_accuracy": 0.9493629187345505, "num_tokens": 4800512.0, "step": 293 }, { "entropy": 4.17171511054039, "epoch": 0.8711111111111111, "grad_norm": 1.0171509981155396, "learning_rate": 1.3513513513513515e-06, "loss": 0.15266487002372742, "mean_token_accuracy": 0.9645697101950645, "num_tokens": 4816896.0, "step": 294 }, { "entropy": 4.363181322813034, "epoch": 0.8740740740740741, "grad_norm": 1.1125446557998657, "learning_rate": 1.3213213213213214e-06, "loss": 0.16176161170005798, "mean_token_accuracy": 0.954315535724163, "num_tokens": 4833280.0, "step": 295 }, { "entropy": 4.970975339412689, "epoch": 0.8770370370370371, "grad_norm": 1.289873480796814, "learning_rate": 1.2912912912912913e-06, "loss": 0.20878392457962036, "mean_token_accuracy": 0.9356447458267212, "num_tokens": 4849664.0, "step": 296 }, { "entropy": 4.833039224147797, "epoch": 0.88, "grad_norm": 1.0888588428497314, "learning_rate": 1.2612612612612613e-06, "loss": 0.15500885248184204, "mean_token_accuracy": 0.9589161276817322, "num_tokens": 4866048.0, "step": 297 }, { "entropy": 4.779081165790558, "epoch": 0.882962962962963, "grad_norm": 1.266128420829773, "learning_rate": 1.2312312312312314e-06, "loss": 0.21074306964874268, "mean_token_accuracy": 0.9407091289758682, "num_tokens": 4882432.0, "step": 298 }, { "entropy": 4.6357011795043945, "epoch": 0.8859259259259259, "grad_norm": 1.3224912881851196, "learning_rate": 1.2012012012012013e-06, "loss": 0.2368646115064621, "mean_token_accuracy": 0.9472242295742035, "num_tokens": 4898816.0, "step": 299 }, { "entropy": 4.068840324878693, "epoch": 0.8888888888888888, "grad_norm": 0.85923832654953, "learning_rate": 1.1711711711711712e-06, "loss": 0.11753897368907928, "mean_token_accuracy": 0.9662499204277992, "num_tokens": 4915200.0, "step": 300 }, { "epoch": 0.8888888888888888, "eval_entropy": 4.417586924235026, "eval_loss": 0.1870778650045395, "eval_mean_token_accuracy": 0.9491693472862244, "eval_num_tokens": 4915200.0, "eval_runtime": 41.7995, "eval_samples_per_second": 14.354, "eval_steps_per_second": 1.794, "step": 300 }, { "entropy": 5.071247100830078, "epoch": 0.8918518518518519, "grad_norm": 1.3558486700057983, "learning_rate": 1.1411411411411411e-06, "loss": 0.23602133989334106, "mean_token_accuracy": 0.9276960417628288, "num_tokens": 4931584.0, "step": 301 }, { "entropy": 4.117396056652069, "epoch": 0.8948148148148148, "grad_norm": 0.8388944268226624, "learning_rate": 1.111111111111111e-06, "loss": 0.11620326340198517, "mean_token_accuracy": 0.9635635763406754, "num_tokens": 4947968.0, "step": 302 }, { "entropy": 4.5542632937431335, "epoch": 0.8977777777777778, "grad_norm": 1.18254554271698, "learning_rate": 1.0810810810810812e-06, "loss": 0.1708286702632904, "mean_token_accuracy": 0.9597087278962135, "num_tokens": 4964352.0, "step": 303 }, { "entropy": 4.57982537150383, "epoch": 0.9007407407407407, "grad_norm": 1.3986045122146606, "learning_rate": 1.051051051051051e-06, "loss": 0.3021943271160126, "mean_token_accuracy": 0.919133186340332, "num_tokens": 4980736.0, "step": 304 }, { "entropy": 4.782330691814423, "epoch": 0.9037037037037037, "grad_norm": 1.1780952215194702, "learning_rate": 1.0210210210210212e-06, "loss": 0.21513484418392181, "mean_token_accuracy": 0.9414290711283684, "num_tokens": 4997120.0, "step": 305 }, { "entropy": 4.747852921485901, "epoch": 0.9066666666666666, "grad_norm": 1.4025940895080566, "learning_rate": 9.909909909909911e-07, "loss": 0.22148270905017853, "mean_token_accuracy": 0.9464741870760918, "num_tokens": 5013504.0, "step": 306 }, { "entropy": 4.174960762262344, "epoch": 0.9096296296296297, "grad_norm": 1.130652904510498, "learning_rate": 9.60960960960961e-07, "loss": 0.18711383640766144, "mean_token_accuracy": 0.9580972418189049, "num_tokens": 5029888.0, "step": 307 }, { "entropy": 4.478256374597549, "epoch": 0.9125925925925926, "grad_norm": 1.0640850067138672, "learning_rate": 9.30930930930931e-07, "loss": 0.1915970742702484, "mean_token_accuracy": 0.9348175227642059, "num_tokens": 5046272.0, "step": 308 }, { "entropy": 4.654453784227371, "epoch": 0.9155555555555556, "grad_norm": 1.0310114622116089, "learning_rate": 9.00900900900901e-07, "loss": 0.13161642849445343, "mean_token_accuracy": 0.9586769789457321, "num_tokens": 5062656.0, "step": 309 }, { "entropy": 4.399398684501648, "epoch": 0.9185185185185185, "grad_norm": 1.075095772743225, "learning_rate": 8.708708708708709e-07, "loss": 0.1970798522233963, "mean_token_accuracy": 0.9442151561379433, "num_tokens": 5079040.0, "step": 310 }, { "entropy": 4.483876526355743, "epoch": 0.9214814814814815, "grad_norm": 1.1613632440567017, "learning_rate": 8.40840840840841e-07, "loss": 0.21313047409057617, "mean_token_accuracy": 0.9410364031791687, "num_tokens": 5095424.0, "step": 311 }, { "entropy": 4.712851881980896, "epoch": 0.9244444444444444, "grad_norm": 1.041576623916626, "learning_rate": 8.108108108108109e-07, "loss": 0.14535699784755707, "mean_token_accuracy": 0.9653985276818275, "num_tokens": 5111808.0, "step": 312 }, { "entropy": 4.009306818246841, "epoch": 0.9274074074074075, "grad_norm": 0.8439784646034241, "learning_rate": 7.807807807807808e-07, "loss": 0.12768274545669556, "mean_token_accuracy": 0.9642351046204567, "num_tokens": 5128192.0, "step": 313 }, { "entropy": 3.9402647465467453, "epoch": 0.9303703703703704, "grad_norm": 0.6990681886672974, "learning_rate": 7.507507507507509e-07, "loss": 0.07188726961612701, "mean_token_accuracy": 0.9686107113957405, "num_tokens": 5144576.0, "step": 314 }, { "entropy": 4.321747362613678, "epoch": 0.9333333333333333, "grad_norm": 0.8538215756416321, "learning_rate": 7.207207207207208e-07, "loss": 0.12386510521173477, "mean_token_accuracy": 0.9637529402971268, "num_tokens": 5160960.0, "step": 315 }, { "entropy": 4.553303599357605, "epoch": 0.9362962962962963, "grad_norm": 1.160495638847351, "learning_rate": 6.906906906906907e-07, "loss": 0.19865782558918, "mean_token_accuracy": 0.9452551826834679, "num_tokens": 5177344.0, "step": 316 }, { "entropy": 4.6939592361450195, "epoch": 0.9392592592592592, "grad_norm": 1.1832135915756226, "learning_rate": 6.606606606606607e-07, "loss": 0.16584719717502594, "mean_token_accuracy": 0.9571598693728447, "num_tokens": 5193728.0, "step": 317 }, { "entropy": 4.5154470801353455, "epoch": 0.9422222222222222, "grad_norm": 1.1491987705230713, "learning_rate": 6.306306306306306e-07, "loss": 0.1722956746816635, "mean_token_accuracy": 0.9531917944550514, "num_tokens": 5210112.0, "step": 318 }, { "entropy": 4.328756272792816, "epoch": 0.9451851851851852, "grad_norm": 0.9116262793540955, "learning_rate": 6.006006006006006e-07, "loss": 0.11511941999197006, "mean_token_accuracy": 0.9662261977791786, "num_tokens": 5226496.0, "step": 319 }, { "entropy": 4.55816787481308, "epoch": 0.9481481481481482, "grad_norm": 1.2676368951797485, "learning_rate": 5.705705705705706e-07, "loss": 0.193391814827919, "mean_token_accuracy": 0.9519508555531502, "num_tokens": 5242880.0, "step": 320 }, { "entropy": 4.794662654399872, "epoch": 0.9511111111111111, "grad_norm": 1.181879997253418, "learning_rate": 5.405405405405406e-07, "loss": 0.19717438519001007, "mean_token_accuracy": 0.9396635890007019, "num_tokens": 5259264.0, "step": 321 }, { "entropy": 4.271101087331772, "epoch": 0.9540740740740741, "grad_norm": 1.1655861139297485, "learning_rate": 5.105105105105106e-07, "loss": 0.20040296018123627, "mean_token_accuracy": 0.9409918263554573, "num_tokens": 5275648.0, "step": 322 }, { "entropy": 4.867785483598709, "epoch": 0.957037037037037, "grad_norm": 1.4571250677108765, "learning_rate": 4.804804804804805e-07, "loss": 0.24724331498146057, "mean_token_accuracy": 0.9226743578910828, "num_tokens": 5292032.0, "step": 323 }, { "entropy": 5.1057488322258, "epoch": 0.96, "grad_norm": 1.5154188871383667, "learning_rate": 4.504504504504505e-07, "loss": 0.2607588469982147, "mean_token_accuracy": 0.92790437489748, "num_tokens": 5308416.0, "step": 324 }, { "entropy": 4.4008781015872955, "epoch": 0.9629629629629629, "grad_norm": 0.998136579990387, "learning_rate": 4.204204204204205e-07, "loss": 0.15995781123638153, "mean_token_accuracy": 0.9598969668149948, "num_tokens": 5324800.0, "step": 325 }, { "entropy": 3.9187879860401154, "epoch": 0.965925925925926, "grad_norm": 0.8381322026252747, "learning_rate": 3.903903903903904e-07, "loss": 0.126622274518013, "mean_token_accuracy": 0.9611322283744812, "num_tokens": 5341184.0, "step": 326 }, { "entropy": 4.744876116514206, "epoch": 0.9688888888888889, "grad_norm": 1.319761037826538, "learning_rate": 3.603603603603604e-07, "loss": 0.2034291923046112, "mean_token_accuracy": 0.9343697354197502, "num_tokens": 5357568.0, "step": 327 }, { "entropy": 4.7206811606884, "epoch": 0.9718518518518519, "grad_norm": 1.3094006776809692, "learning_rate": 3.3033033033033036e-07, "loss": 0.28418663144111633, "mean_token_accuracy": 0.9168223366141319, "num_tokens": 5373952.0, "step": 328 }, { "entropy": 4.250654578208923, "epoch": 0.9748148148148148, "grad_norm": 0.8762730956077576, "learning_rate": 3.003003003003003e-07, "loss": 0.14533185958862305, "mean_token_accuracy": 0.9615647569298744, "num_tokens": 5390336.0, "step": 329 }, { "entropy": 4.782383352518082, "epoch": 0.9777777777777777, "grad_norm": 1.4791736602783203, "learning_rate": 2.702702702702703e-07, "loss": 0.306484192609787, "mean_token_accuracy": 0.9203394278883934, "num_tokens": 5406720.0, "step": 330 }, { "entropy": 4.731139063835144, "epoch": 0.9807407407407407, "grad_norm": 1.1364384889602661, "learning_rate": 2.4024024024024026e-07, "loss": 0.187924325466156, "mean_token_accuracy": 0.940864272415638, "num_tokens": 5423104.0, "step": 331 }, { "entropy": 4.757296144962311, "epoch": 0.9837037037037037, "grad_norm": 1.2683117389678955, "learning_rate": 2.1021021021021025e-07, "loss": 0.2071211040019989, "mean_token_accuracy": 0.9373601898550987, "num_tokens": 5439488.0, "step": 332 }, { "entropy": 4.8207244873046875, "epoch": 0.9866666666666667, "grad_norm": 1.1348717212677002, "learning_rate": 1.801801801801802e-07, "loss": 0.16599202156066895, "mean_token_accuracy": 0.9438209906220436, "num_tokens": 5455872.0, "step": 333 }, { "entropy": 4.560002565383911, "epoch": 0.9896296296296296, "grad_norm": 1.0268224477767944, "learning_rate": 1.5015015015015016e-07, "loss": 0.18726664781570435, "mean_token_accuracy": 0.9389617219567299, "num_tokens": 5472256.0, "step": 334 }, { "entropy": 4.164048194885254, "epoch": 0.9925925925925926, "grad_norm": 0.8888510465621948, "learning_rate": 1.2012012012012013e-07, "loss": 0.08176050335168839, "mean_token_accuracy": 0.9774916544556618, "num_tokens": 5488640.0, "step": 335 }, { "entropy": 4.211227163672447, "epoch": 0.9955555555555555, "grad_norm": 1.0560649633407593, "learning_rate": 9.00900900900901e-08, "loss": 0.1871253103017807, "mean_token_accuracy": 0.9461539313197136, "num_tokens": 5505024.0, "step": 336 }, { "entropy": 4.4912309646606445, "epoch": 0.9985185185185185, "grad_norm": 1.1535362005233765, "learning_rate": 6.006006006006006e-08, "loss": 0.16527244448661804, "mean_token_accuracy": 0.949486643075943, "num_tokens": 5521408.0, "step": 337 }, { "entropy": 4.468047499656677, "epoch": 1.0, "grad_norm": 1.932939052581787, "learning_rate": 3.003003003003003e-08, "loss": 0.20345942676067352, "mean_token_accuracy": 0.9499414712190628, "num_tokens": 5529600.0, "step": 338 } ], "logging_steps": 1, "max_steps": 338, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9.53130594336768e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }