{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.968152866242038, "eval_steps": 500, "global_step": 234, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012738853503184714, "grad_norm": 4.032490253448486, "learning_rate": 0.0, "loss": 1.8275, "mean_token_accuracy": 0.6403467357158661, "num_tokens": 20782.0, "step": 1 }, { "epoch": 0.025477707006369428, "grad_norm": 4.02821683883667, "learning_rate": 2.5e-05, "loss": 1.8101, "mean_token_accuracy": 0.6456336379051208, "num_tokens": 41801.0, "step": 2 }, { "epoch": 0.03821656050955414, "grad_norm": 2.6589291095733643, "learning_rate": 5e-05, "loss": 1.666, "mean_token_accuracy": 0.6547168493270874, "num_tokens": 62978.0, "step": 3 }, { "epoch": 0.050955414012738856, "grad_norm": 2.0679564476013184, "learning_rate": 7.500000000000001e-05, "loss": 1.4185, "mean_token_accuracy": 0.6894981861114502, "num_tokens": 85034.0, "step": 4 }, { "epoch": 0.06369426751592357, "grad_norm": 1.1579885482788086, "learning_rate": 0.0001, "loss": 1.3053, "mean_token_accuracy": 0.6996746063232422, "num_tokens": 107185.0, "step": 5 }, { "epoch": 0.07643312101910828, "grad_norm": 0.8610864281654358, "learning_rate": 0.000125, "loss": 1.1499, "mean_token_accuracy": 0.720809280872345, "num_tokens": 127806.0, "step": 6 }, { "epoch": 0.08917197452229299, "grad_norm": 0.9501633644104004, "learning_rate": 0.00015000000000000001, "loss": 1.0344, "mean_token_accuracy": 0.7437184154987335, "num_tokens": 148231.0, "step": 7 }, { "epoch": 0.10191082802547771, "grad_norm": 1.209609031677246, "learning_rate": 0.000175, "loss": 0.9364, "mean_token_accuracy": 0.7647237181663513, "num_tokens": 169757.0, "step": 8 }, { "epoch": 0.11464968152866242, "grad_norm": 0.8404257297515869, "learning_rate": 0.0002, "loss": 0.8312, "mean_token_accuracy": 0.7892735302448273, "num_tokens": 190207.0, "step": 9 }, { "epoch": 0.12738853503184713, "grad_norm": 0.691281259059906, "learning_rate": 0.00019999033847063811, "loss": 0.6679, "mean_token_accuracy": 0.8296232521533966, "num_tokens": 209441.0, "step": 10 }, { "epoch": 0.14012738853503184, "grad_norm": 0.6289070844650269, "learning_rate": 0.00019996135574945544, "loss": 0.6195, "mean_token_accuracy": 0.8456655740737915, "num_tokens": 229789.0, "step": 11 }, { "epoch": 0.15286624203821655, "grad_norm": 0.5578577518463135, "learning_rate": 0.00019991305743680013, "loss": 0.5848, "mean_token_accuracy": 0.8547155559062958, "num_tokens": 250645.0, "step": 12 }, { "epoch": 0.16560509554140126, "grad_norm": 0.5704829692840576, "learning_rate": 0.0001998454528653836, "loss": 0.5061, "mean_token_accuracy": 0.8722218573093414, "num_tokens": 271375.0, "step": 13 }, { "epoch": 0.17834394904458598, "grad_norm": 0.5471704602241516, "learning_rate": 0.00019975855509847686, "loss": 0.4757, "mean_token_accuracy": 0.8858338296413422, "num_tokens": 292499.0, "step": 14 }, { "epoch": 0.1910828025477707, "grad_norm": 0.5097174048423767, "learning_rate": 0.00019965238092738643, "loss": 0.5191, "mean_token_accuracy": 0.8713619709014893, "num_tokens": 313755.0, "step": 15 }, { "epoch": 0.20382165605095542, "grad_norm": 0.43789729475975037, "learning_rate": 0.00019952695086820975, "loss": 0.381, "mean_token_accuracy": 0.9017090201377869, "num_tokens": 335462.0, "step": 16 }, { "epoch": 0.21656050955414013, "grad_norm": 0.45297467708587646, "learning_rate": 0.0001993822891578708, "loss": 0.4286, "mean_token_accuracy": 0.8946053981781006, "num_tokens": 355712.0, "step": 17 }, { "epoch": 0.22929936305732485, "grad_norm": 0.4537133276462555, "learning_rate": 0.0001992184237494368, "loss": 0.3651, "mean_token_accuracy": 0.912791520357132, "num_tokens": 376658.0, "step": 18 }, { "epoch": 0.24203821656050956, "grad_norm": 0.4055041968822479, "learning_rate": 0.0001990353863067169, "loss": 0.3392, "mean_token_accuracy": 0.915442943572998, "num_tokens": 396622.0, "step": 19 }, { "epoch": 0.25477707006369427, "grad_norm": 0.5385339856147766, "learning_rate": 0.0001988332121981436, "loss": 0.3193, "mean_token_accuracy": 0.9222363233566284, "num_tokens": 417604.0, "step": 20 }, { "epoch": 0.267515923566879, "grad_norm": 0.39093685150146484, "learning_rate": 0.00019861194048993863, "loss": 0.3171, "mean_token_accuracy": 0.9224121868610382, "num_tokens": 438312.0, "step": 21 }, { "epoch": 0.2802547770700637, "grad_norm": 0.30290552973747253, "learning_rate": 0.0001983716139385641, "loss": 0.2732, "mean_token_accuracy": 0.9361142218112946, "num_tokens": 460742.0, "step": 22 }, { "epoch": 0.2929936305732484, "grad_norm": 0.27954092621803284, "learning_rate": 0.0001981122789824607, "loss": 0.2555, "mean_token_accuracy": 0.9381744861602783, "num_tokens": 481292.0, "step": 23 }, { "epoch": 0.3057324840764331, "grad_norm": 0.33339905738830566, "learning_rate": 0.00019783398573307428, "loss": 0.2688, "mean_token_accuracy": 0.9344040155410767, "num_tokens": 502883.0, "step": 24 }, { "epoch": 0.3184713375796178, "grad_norm": 0.3911352753639221, "learning_rate": 0.00019753678796517282, "loss": 0.2329, "mean_token_accuracy": 0.9421150088310242, "num_tokens": 524527.0, "step": 25 }, { "epoch": 0.33121019108280253, "grad_norm": 0.3292308747768402, "learning_rate": 0.00019722074310645553, "loss": 0.2635, "mean_token_accuracy": 0.9353462159633636, "num_tokens": 543460.0, "step": 26 }, { "epoch": 0.34394904458598724, "grad_norm": 0.23688943684101105, "learning_rate": 0.00019688591222645607, "loss": 0.2046, "mean_token_accuracy": 0.9497671127319336, "num_tokens": 568256.0, "step": 27 }, { "epoch": 0.35668789808917195, "grad_norm": 0.3945387899875641, "learning_rate": 0.000196532360024742, "loss": 0.2345, "mean_token_accuracy": 0.9450124204158783, "num_tokens": 590291.0, "step": 28 }, { "epoch": 0.36942675159235666, "grad_norm": 0.28697916865348816, "learning_rate": 0.0001961601548184129, "loss": 0.2338, "mean_token_accuracy": 0.9414379298686981, "num_tokens": 613204.0, "step": 29 }, { "epoch": 0.3821656050955414, "grad_norm": 0.23970234394073486, "learning_rate": 0.00019576936852889936, "loss": 0.2229, "mean_token_accuracy": 0.9436235725879669, "num_tokens": 634063.0, "step": 30 }, { "epoch": 0.39490445859872614, "grad_norm": 0.2444416582584381, "learning_rate": 0.00019536007666806556, "loss": 0.239, "mean_token_accuracy": 0.9426109194755554, "num_tokens": 654939.0, "step": 31 }, { "epoch": 0.40764331210191085, "grad_norm": 0.2546619176864624, "learning_rate": 0.0001949323583236181, "loss": 0.2438, "mean_token_accuracy": 0.9379684627056122, "num_tokens": 676779.0, "step": 32 }, { "epoch": 0.42038216560509556, "grad_norm": 0.31282731890678406, "learning_rate": 0.0001944862961438239, "loss": 0.222, "mean_token_accuracy": 0.9442552626132965, "num_tokens": 698151.0, "step": 33 }, { "epoch": 0.43312101910828027, "grad_norm": 0.26302680373191833, "learning_rate": 0.00019402197632153992, "loss": 0.2109, "mean_token_accuracy": 0.9452959597110748, "num_tokens": 718994.0, "step": 34 }, { "epoch": 0.445859872611465, "grad_norm": 0.22304703295230865, "learning_rate": 0.00019353948857755803, "loss": 0.1937, "mean_token_accuracy": 0.9508229196071625, "num_tokens": 740812.0, "step": 35 }, { "epoch": 0.4585987261146497, "grad_norm": 0.22195610404014587, "learning_rate": 0.00019303892614326836, "loss": 0.2263, "mean_token_accuracy": 0.9433953166007996, "num_tokens": 761685.0, "step": 36 }, { "epoch": 0.4713375796178344, "grad_norm": 0.21497657895088196, "learning_rate": 0.00019252038574264405, "loss": 0.2319, "mean_token_accuracy": 0.941495269536972, "num_tokens": 783640.0, "step": 37 }, { "epoch": 0.4840764331210191, "grad_norm": 0.23853588104248047, "learning_rate": 0.00019198396757355118, "loss": 0.2468, "mean_token_accuracy": 0.9388796389102936, "num_tokens": 803923.0, "step": 38 }, { "epoch": 0.4968152866242038, "grad_norm": 0.20184901356697083, "learning_rate": 0.00019142977528838762, "loss": 0.1935, "mean_token_accuracy": 0.9509699940681458, "num_tokens": 824723.0, "step": 39 }, { "epoch": 0.5095541401273885, "grad_norm": 0.2413100302219391, "learning_rate": 0.00019085791597405404, "loss": 0.2581, "mean_token_accuracy": 0.9344974160194397, "num_tokens": 845317.0, "step": 40 }, { "epoch": 0.5222929936305732, "grad_norm": 0.20988352596759796, "learning_rate": 0.00019026850013126157, "loss": 0.1976, "mean_token_accuracy": 0.9503491222858429, "num_tokens": 867416.0, "step": 41 }, { "epoch": 0.535031847133758, "grad_norm": 0.22773092985153198, "learning_rate": 0.00018966164165317966, "loss": 0.2261, "mean_token_accuracy": 0.9430988430976868, "num_tokens": 886904.0, "step": 42 }, { "epoch": 0.5477707006369427, "grad_norm": 0.1990187019109726, "learning_rate": 0.00018903745780342839, "loss": 0.1993, "mean_token_accuracy": 0.9476139545440674, "num_tokens": 908886.0, "step": 43 }, { "epoch": 0.5605095541401274, "grad_norm": 0.22125588357448578, "learning_rate": 0.0001883960691934196, "loss": 0.2352, "mean_token_accuracy": 0.9444881975650787, "num_tokens": 929202.0, "step": 44 }, { "epoch": 0.5732484076433121, "grad_norm": 0.22190915048122406, "learning_rate": 0.00018773759975905098, "loss": 0.1924, "mean_token_accuracy": 0.952962726354599, "num_tokens": 949033.0, "step": 45 }, { "epoch": 0.5859872611464968, "grad_norm": 0.17759603261947632, "learning_rate": 0.00018706217673675811, "loss": 0.1921, "mean_token_accuracy": 0.9519978165626526, "num_tokens": 971365.0, "step": 46 }, { "epoch": 0.5987261146496815, "grad_norm": 0.19214215874671936, "learning_rate": 0.0001863699306389282, "loss": 0.2039, "mean_token_accuracy": 0.9491439461708069, "num_tokens": 990739.0, "step": 47 }, { "epoch": 0.6114649681528662, "grad_norm": 0.21507352590560913, "learning_rate": 0.00018566099522868119, "loss": 0.2436, "mean_token_accuracy": 0.9411478042602539, "num_tokens": 1011450.0, "step": 48 }, { "epoch": 0.6242038216560509, "grad_norm": 0.19679825007915497, "learning_rate": 0.00018493550749402278, "loss": 0.212, "mean_token_accuracy": 0.9487031996250153, "num_tokens": 1031182.0, "step": 49 }, { "epoch": 0.6369426751592356, "grad_norm": 0.19453713297843933, "learning_rate": 0.00018419360762137395, "loss": 0.1815, "mean_token_accuracy": 0.9539785385131836, "num_tokens": 1054994.0, "step": 50 }, { "epoch": 0.6496815286624203, "grad_norm": 0.17126353085041046, "learning_rate": 0.00018343543896848273, "loss": 0.1878, "mean_token_accuracy": 0.9533947706222534, "num_tokens": 1075696.0, "step": 51 }, { "epoch": 0.6624203821656051, "grad_norm": 0.23333708941936493, "learning_rate": 0.00018266114803672318, "loss": 0.2263, "mean_token_accuracy": 0.9433774650096893, "num_tokens": 1098543.0, "step": 52 }, { "epoch": 0.6751592356687898, "grad_norm": 0.20323054492473602, "learning_rate": 0.00018187088444278674, "loss": 0.1637, "mean_token_accuracy": 0.9572640359401703, "num_tokens": 1119652.0, "step": 53 }, { "epoch": 0.6878980891719745, "grad_norm": 0.2668849527835846, "learning_rate": 0.00018106480088977172, "loss": 0.2186, "mean_token_accuracy": 0.9467197954654694, "num_tokens": 1141306.0, "step": 54 }, { "epoch": 0.7006369426751592, "grad_norm": 0.19561052322387695, "learning_rate": 0.00018024305313767646, "loss": 0.1896, "mean_token_accuracy": 0.9518384337425232, "num_tokens": 1161171.0, "step": 55 }, { "epoch": 0.7133757961783439, "grad_norm": 0.1853981763124466, "learning_rate": 0.00017940579997330165, "loss": 0.1952, "mean_token_accuracy": 0.9492832124233246, "num_tokens": 1181534.0, "step": 56 }, { "epoch": 0.7261146496815286, "grad_norm": 0.16985760629177094, "learning_rate": 0.00017855320317956784, "loss": 0.1697, "mean_token_accuracy": 0.9568532705307007, "num_tokens": 1201659.0, "step": 57 }, { "epoch": 0.7388535031847133, "grad_norm": 0.17170517146587372, "learning_rate": 0.00017768542750425426, "loss": 0.2227, "mean_token_accuracy": 0.9445173442363739, "num_tokens": 1222313.0, "step": 58 }, { "epoch": 0.7515923566878981, "grad_norm": 0.19633768498897552, "learning_rate": 0.0001768026406281642, "loss": 0.1681, "mean_token_accuracy": 0.9575904607772827, "num_tokens": 1242286.0, "step": 59 }, { "epoch": 0.7643312101910829, "grad_norm": 0.17580056190490723, "learning_rate": 0.00017590501313272415, "loss": 0.1845, "mean_token_accuracy": 0.9523945152759552, "num_tokens": 1262874.0, "step": 60 }, { "epoch": 0.7770700636942676, "grad_norm": 0.18206478655338287, "learning_rate": 0.00017499271846702213, "loss": 0.1985, "mean_token_accuracy": 0.951472669839859, "num_tokens": 1282769.0, "step": 61 }, { "epoch": 0.7898089171974523, "grad_norm": 0.2344655692577362, "learning_rate": 0.00017406593291429217, "loss": 0.2122, "mean_token_accuracy": 0.9443674981594086, "num_tokens": 1304139.0, "step": 62 }, { "epoch": 0.802547770700637, "grad_norm": 0.19128663837909698, "learning_rate": 0.00017312483555785086, "loss": 0.2244, "mean_token_accuracy": 0.943341851234436, "num_tokens": 1324467.0, "step": 63 }, { "epoch": 0.8152866242038217, "grad_norm": 0.17244233191013336, "learning_rate": 0.00017216960824649303, "loss": 0.168, "mean_token_accuracy": 0.9575148522853851, "num_tokens": 1345262.0, "step": 64 }, { "epoch": 0.8280254777070064, "grad_norm": 0.17028464376926422, "learning_rate": 0.00017120043555935298, "loss": 0.1885, "mean_token_accuracy": 0.9521305859088898, "num_tokens": 1368700.0, "step": 65 }, { "epoch": 0.8407643312101911, "grad_norm": 0.20174594223499298, "learning_rate": 0.0001702175047702382, "loss": 0.185, "mean_token_accuracy": 0.9526795446872711, "num_tokens": 1388344.0, "step": 66 }, { "epoch": 0.8535031847133758, "grad_norm": 0.1811266541481018, "learning_rate": 0.00016922100581144228, "loss": 0.1754, "mean_token_accuracy": 0.9565881788730621, "num_tokens": 1407723.0, "step": 67 }, { "epoch": 0.8662420382165605, "grad_norm": 0.18422017991542816, "learning_rate": 0.00016821113123704424, "loss": 0.1749, "mean_token_accuracy": 0.9552392363548279, "num_tokens": 1427747.0, "step": 68 }, { "epoch": 0.8789808917197452, "grad_norm": 0.1854456216096878, "learning_rate": 0.00016718807618570106, "loss": 0.1452, "mean_token_accuracy": 0.9621990919113159, "num_tokens": 1446729.0, "step": 69 }, { "epoch": 0.89171974522293, "grad_norm": 0.20696918666362762, "learning_rate": 0.00016615203834294119, "loss": 0.185, "mean_token_accuracy": 0.9547071158885956, "num_tokens": 1466084.0, "step": 70 }, { "epoch": 0.9044585987261147, "grad_norm": 0.22027692198753357, "learning_rate": 0.00016510321790296525, "loss": 0.1912, "mean_token_accuracy": 0.9535127878189087, "num_tokens": 1485783.0, "step": 71 }, { "epoch": 0.9171974522292994, "grad_norm": 0.16686508059501648, "learning_rate": 0.00016404181752996289, "loss": 0.1622, "mean_token_accuracy": 0.959883451461792, "num_tokens": 1505907.0, "step": 72 }, { "epoch": 0.9299363057324841, "grad_norm": 0.17605887353420258, "learning_rate": 0.00016296804231895142, "loss": 0.165, "mean_token_accuracy": 0.9578165411949158, "num_tokens": 1527389.0, "step": 73 }, { "epoch": 0.9426751592356688, "grad_norm": 0.17619065940380096, "learning_rate": 0.00016188209975614542, "loss": 0.1561, "mean_token_accuracy": 0.9601358473300934, "num_tokens": 1547714.0, "step": 74 }, { "epoch": 0.9554140127388535, "grad_norm": 0.1950807124376297, "learning_rate": 0.00016078419967886402, "loss": 0.1984, "mean_token_accuracy": 0.9482778906822205, "num_tokens": 1567244.0, "step": 75 }, { "epoch": 0.9681528662420382, "grad_norm": 0.18063174188137054, "learning_rate": 0.00015967455423498387, "loss": 0.1802, "mean_token_accuracy": 0.9535951614379883, "num_tokens": 1586726.0, "step": 76 }, { "epoch": 0.9808917197452229, "grad_norm": 0.14509689807891846, "learning_rate": 0.00015855337784194577, "loss": 0.1411, "mean_token_accuracy": 0.9627689123153687, "num_tokens": 1608089.0, "step": 77 }, { "epoch": 0.9936305732484076, "grad_norm": 0.19907675683498383, "learning_rate": 0.00015742088714532247, "loss": 0.2119, "mean_token_accuracy": 0.9476487040519714, "num_tokens": 1629313.0, "step": 78 }, { "epoch": 1.0, "grad_norm": 0.19907675683498383, "learning_rate": 0.00015627730097695638, "loss": 0.1333, "mean_token_accuracy": 0.9651358127593994, "num_tokens": 1639470.0, "step": 79 }, { "epoch": 1.0127388535031847, "grad_norm": 0.23832248151302338, "learning_rate": 0.00015512284031267437, "loss": 0.1271, "mean_token_accuracy": 0.9659014642238617, "num_tokens": 1658148.0, "step": 80 }, { "epoch": 1.0254777070063694, "grad_norm": 0.14923803508281708, "learning_rate": 0.00015395772822958845, "loss": 0.1205, "mean_token_accuracy": 0.9664756953716278, "num_tokens": 1679412.0, "step": 81 }, { "epoch": 1.0382165605095541, "grad_norm": 0.14769527316093445, "learning_rate": 0.00015278218986299074, "loss": 0.1374, "mean_token_accuracy": 0.9626262485980988, "num_tokens": 1700169.0, "step": 82 }, { "epoch": 1.0509554140127388, "grad_norm": 0.17680829763412476, "learning_rate": 0.0001515964523628501, "loss": 0.125, "mean_token_accuracy": 0.9658435583114624, "num_tokens": 1721319.0, "step": 83 }, { "epoch": 1.0636942675159236, "grad_norm": 0.1534733772277832, "learning_rate": 0.00015040074484992, "loss": 0.1357, "mean_token_accuracy": 0.9641449451446533, "num_tokens": 1741752.0, "step": 84 }, { "epoch": 1.0764331210191083, "grad_norm": 0.1694839596748352, "learning_rate": 0.00014919529837146528, "loss": 0.1204, "mean_token_accuracy": 0.9689095318317413, "num_tokens": 1763187.0, "step": 85 }, { "epoch": 1.089171974522293, "grad_norm": 0.15279586613178253, "learning_rate": 0.00014798034585661695, "loss": 0.1337, "mean_token_accuracy": 0.9658444821834564, "num_tokens": 1783640.0, "step": 86 }, { "epoch": 1.1019108280254777, "grad_norm": 0.18650779128074646, "learning_rate": 0.0001467561220713628, "loss": 0.1261, "mean_token_accuracy": 0.9664537906646729, "num_tokens": 1803457.0, "step": 87 }, { "epoch": 1.1146496815286624, "grad_norm": 0.2114044576883316, "learning_rate": 0.0001455228635731839, "loss": 0.1337, "mean_token_accuracy": 0.9664061665534973, "num_tokens": 1824664.0, "step": 88 }, { "epoch": 1.127388535031847, "grad_norm": 0.20512934029102325, "learning_rate": 0.00014428080866534396, "loss": 0.1456, "mean_token_accuracy": 0.9614441394805908, "num_tokens": 1845586.0, "step": 89 }, { "epoch": 1.1401273885350318, "grad_norm": 0.17776310443878174, "learning_rate": 0.00014303019735084226, "loss": 0.1425, "mean_token_accuracy": 0.9611153304576874, "num_tokens": 1865504.0, "step": 90 }, { "epoch": 1.1528662420382165, "grad_norm": 0.15626613795757294, "learning_rate": 0.00014177127128603745, "loss": 0.1281, "mean_token_accuracy": 0.9677377045154572, "num_tokens": 1885083.0, "step": 91 }, { "epoch": 1.1656050955414012, "grad_norm": 0.1749550998210907, "learning_rate": 0.0001405042737339524, "loss": 0.1457, "mean_token_accuracy": 0.9627916514873505, "num_tokens": 1906200.0, "step": 92 }, { "epoch": 1.178343949044586, "grad_norm": 0.16051284968852997, "learning_rate": 0.0001392294495172681, "loss": 0.1138, "mean_token_accuracy": 0.9708078503608704, "num_tokens": 1929089.0, "step": 93 }, { "epoch": 1.1910828025477707, "grad_norm": 0.1582704484462738, "learning_rate": 0.00013794704497101655, "loss": 0.1393, "mean_token_accuracy": 0.9625002443790436, "num_tokens": 1950436.0, "step": 94 }, { "epoch": 1.2038216560509554, "grad_norm": 0.19418908655643463, "learning_rate": 0.0001366573078949813, "loss": 0.1484, "mean_token_accuracy": 0.9607403576374054, "num_tokens": 1970259.0, "step": 95 }, { "epoch": 1.21656050955414, "grad_norm": 0.1565779149532318, "learning_rate": 0.00013536048750581494, "loss": 0.1133, "mean_token_accuracy": 0.9693767130374908, "num_tokens": 1990966.0, "step": 96 }, { "epoch": 1.2292993630573248, "grad_norm": 0.1751173734664917, "learning_rate": 0.00013405683438888282, "loss": 0.1543, "mean_token_accuracy": 0.9605205059051514, "num_tokens": 2011687.0, "step": 97 }, { "epoch": 1.2420382165605095, "grad_norm": 0.1851140260696411, "learning_rate": 0.00013274660044984224, "loss": 0.1569, "mean_token_accuracy": 0.9579177796840668, "num_tokens": 2032850.0, "step": 98 }, { "epoch": 1.2547770700636942, "grad_norm": 0.17630673944950104, "learning_rate": 0.00013143003886596669, "loss": 0.1201, "mean_token_accuracy": 0.9683541655540466, "num_tokens": 2054502.0, "step": 99 }, { "epoch": 1.267515923566879, "grad_norm": 0.19014202058315277, "learning_rate": 0.0001301074040372242, "loss": 0.1292, "mean_token_accuracy": 0.9665453433990479, "num_tokens": 2075517.0, "step": 100 }, { "epoch": 1.2802547770700636, "grad_norm": 0.162857323884964, "learning_rate": 0.00012877895153711935, "loss": 0.1065, "mean_token_accuracy": 0.9714101850986481, "num_tokens": 2095734.0, "step": 101 }, { "epoch": 1.2929936305732483, "grad_norm": 0.16616225242614746, "learning_rate": 0.0001274449380633089, "loss": 0.116, "mean_token_accuracy": 0.9681942164897919, "num_tokens": 2117916.0, "step": 102 }, { "epoch": 1.305732484076433, "grad_norm": 0.1441652923822403, "learning_rate": 0.00012610562138799978, "loss": 0.1242, "mean_token_accuracy": 0.9661942422389984, "num_tokens": 2137533.0, "step": 103 }, { "epoch": 1.3184713375796178, "grad_norm": 0.15105916559696198, "learning_rate": 0.00012476126030813963, "loss": 0.1106, "mean_token_accuracy": 0.9702428579330444, "num_tokens": 2156908.0, "step": 104 }, { "epoch": 1.3312101910828025, "grad_norm": 0.16298384964466095, "learning_rate": 0.0001234121145954094, "loss": 0.1118, "mean_token_accuracy": 0.9696470499038696, "num_tokens": 2178701.0, "step": 105 }, { "epoch": 1.3439490445859872, "grad_norm": 0.17056092619895935, "learning_rate": 0.0001220584449460274, "loss": 0.1255, "mean_token_accuracy": 0.9645788669586182, "num_tokens": 2200357.0, "step": 106 }, { "epoch": 1.356687898089172, "grad_norm": 0.1652529537677765, "learning_rate": 0.00012070051293037492, "loss": 0.121, "mean_token_accuracy": 0.967876136302948, "num_tokens": 2222840.0, "step": 107 }, { "epoch": 1.3694267515923566, "grad_norm": 0.19024129211902618, "learning_rate": 0.00011933858094245281, "loss": 0.1181, "mean_token_accuracy": 0.9682499766349792, "num_tokens": 2245153.0, "step": 108 }, { "epoch": 1.3821656050955413, "grad_norm": 0.1724906712770462, "learning_rate": 0.00011797291214917881, "loss": 0.11, "mean_token_accuracy": 0.9716835618019104, "num_tokens": 2265787.0, "step": 109 }, { "epoch": 1.394904458598726, "grad_norm": 0.12500053644180298, "learning_rate": 0.00011660377043953588, "loss": 0.1227, "mean_token_accuracy": 0.9684112370014191, "num_tokens": 2288666.0, "step": 110 }, { "epoch": 1.4076433121019107, "grad_norm": 0.17808276414871216, "learning_rate": 0.0001152314203735805, "loss": 0.1201, "mean_token_accuracy": 0.9669378101825714, "num_tokens": 2309284.0, "step": 111 }, { "epoch": 1.4203821656050954, "grad_norm": 0.1402737945318222, "learning_rate": 0.0001138561271313219, "loss": 0.1111, "mean_token_accuracy": 0.9715414047241211, "num_tokens": 2331578.0, "step": 112 }, { "epoch": 1.4331210191082802, "grad_norm": 0.15381915867328644, "learning_rate": 0.00011247815646148087, "loss": 0.1217, "mean_token_accuracy": 0.9678640961647034, "num_tokens": 2350038.0, "step": 113 }, { "epoch": 1.4458598726114649, "grad_norm": 0.14706242084503174, "learning_rate": 0.00011109777463013915, "loss": 0.1061, "mean_token_accuracy": 0.9708584249019623, "num_tokens": 2368964.0, "step": 114 }, { "epoch": 1.4585987261146496, "grad_norm": 0.15973958373069763, "learning_rate": 0.0001097152483692886, "loss": 0.1197, "mean_token_accuracy": 0.9688680768013, "num_tokens": 2391178.0, "step": 115 }, { "epoch": 1.4713375796178343, "grad_norm": 0.1674444079399109, "learning_rate": 0.00010833084482529048, "loss": 0.1093, "mean_token_accuracy": 0.9704143404960632, "num_tokens": 2412996.0, "step": 116 }, { "epoch": 1.484076433121019, "grad_norm": 0.16148361563682556, "learning_rate": 0.00010694483150725458, "loss": 0.117, "mean_token_accuracy": 0.9665324985980988, "num_tokens": 2434259.0, "step": 117 }, { "epoch": 1.4968152866242037, "grad_norm": 0.16595368087291718, "learning_rate": 0.00010555747623534831, "loss": 0.1406, "mean_token_accuracy": 0.9625270962715149, "num_tokens": 2455587.0, "step": 118 }, { "epoch": 1.5095541401273884, "grad_norm": 0.16053670644760132, "learning_rate": 0.00010416904708904548, "loss": 0.1256, "mean_token_accuracy": 0.9664609730243683, "num_tokens": 2476283.0, "step": 119 }, { "epoch": 1.5222929936305731, "grad_norm": 0.20048527419567108, "learning_rate": 0.00010277981235532541, "loss": 0.1254, "mean_token_accuracy": 0.9659788012504578, "num_tokens": 2497546.0, "step": 120 }, { "epoch": 1.5350318471337578, "grad_norm": 0.16457313299179077, "learning_rate": 0.00010139004047683151, "loss": 0.1229, "mean_token_accuracy": 0.9671443700790405, "num_tokens": 2518296.0, "step": 121 }, { "epoch": 1.5477707006369426, "grad_norm": 0.15524955093860626, "learning_rate": 0.0001, "loss": 0.1033, "mean_token_accuracy": 0.9726420640945435, "num_tokens": 2540213.0, "step": 122 }, { "epoch": 1.5605095541401273, "grad_norm": 0.13140025734901428, "learning_rate": 9.860995952316851e-05, "loss": 0.1183, "mean_token_accuracy": 0.968624621629715, "num_tokens": 2559617.0, "step": 123 }, { "epoch": 1.573248407643312, "grad_norm": 0.14936192333698273, "learning_rate": 9.722018764467461e-05, "loss": 0.0999, "mean_token_accuracy": 0.9732542335987091, "num_tokens": 2582565.0, "step": 124 }, { "epoch": 1.5859872611464967, "grad_norm": 0.15049338340759277, "learning_rate": 9.583095291095453e-05, "loss": 0.1194, "mean_token_accuracy": 0.9678354859352112, "num_tokens": 2602091.0, "step": 125 }, { "epoch": 1.5987261146496814, "grad_norm": 0.16037316620349884, "learning_rate": 9.444252376465171e-05, "loss": 0.1218, "mean_token_accuracy": 0.9661269187927246, "num_tokens": 2621569.0, "step": 126 }, { "epoch": 1.611464968152866, "grad_norm": 0.14958986639976501, "learning_rate": 9.305516849274541e-05, "loss": 0.1186, "mean_token_accuracy": 0.9682396650314331, "num_tokens": 2642561.0, "step": 127 }, { "epoch": 1.6242038216560508, "grad_norm": 0.13898329436779022, "learning_rate": 9.166915517470953e-05, "loss": 0.0917, "mean_token_accuracy": 0.974632978439331, "num_tokens": 2664635.0, "step": 128 }, { "epoch": 1.6369426751592355, "grad_norm": 0.15911662578582764, "learning_rate": 9.028475163071141e-05, "loss": 0.1275, "mean_token_accuracy": 0.9655503630638123, "num_tokens": 2685293.0, "step": 129 }, { "epoch": 1.6496815286624202, "grad_norm": 0.1641586571931839, "learning_rate": 8.890222536986085e-05, "loss": 0.1326, "mean_token_accuracy": 0.9644103944301605, "num_tokens": 2706288.0, "step": 130 }, { "epoch": 1.662420382165605, "grad_norm": 0.17261752486228943, "learning_rate": 8.752184353851916e-05, "loss": 0.1263, "mean_token_accuracy": 0.9659662842750549, "num_tokens": 2729317.0, "step": 131 }, { "epoch": 1.6751592356687897, "grad_norm": 0.18082129955291748, "learning_rate": 8.614387286867814e-05, "loss": 0.1431, "mean_token_accuracy": 0.9621657431125641, "num_tokens": 2751538.0, "step": 132 }, { "epoch": 1.6878980891719744, "grad_norm": 0.16913549602031708, "learning_rate": 8.47685796264195e-05, "loss": 0.113, "mean_token_accuracy": 0.9688459932804108, "num_tokens": 2771471.0, "step": 133 }, { "epoch": 1.700636942675159, "grad_norm": 0.17692820727825165, "learning_rate": 8.339622956046417e-05, "loss": 0.1163, "mean_token_accuracy": 0.9676001965999603, "num_tokens": 2791343.0, "step": 134 }, { "epoch": 1.7133757961783438, "grad_norm": 0.14758412539958954, "learning_rate": 8.202708785082121e-05, "loss": 0.1528, "mean_token_accuracy": 0.9607497751712799, "num_tokens": 2810844.0, "step": 135 }, { "epoch": 1.7261146496815285, "grad_norm": 0.2107594609260559, "learning_rate": 8.066141905754723e-05, "loss": 0.1232, "mean_token_accuracy": 0.9672644436359406, "num_tokens": 2831746.0, "step": 136 }, { "epoch": 1.7388535031847132, "grad_norm": 0.14881309866905212, "learning_rate": 7.929948706962508e-05, "loss": 0.1045, "mean_token_accuracy": 0.971291571855545, "num_tokens": 2853450.0, "step": 137 }, { "epoch": 1.7515923566878981, "grad_norm": 0.17492781579494476, "learning_rate": 7.794155505397261e-05, "loss": 0.1216, "mean_token_accuracy": 0.9665966033935547, "num_tokens": 2873410.0, "step": 138 }, { "epoch": 1.7643312101910829, "grad_norm": 0.15295670926570892, "learning_rate": 7.658788540459062e-05, "loss": 0.0897, "mean_token_accuracy": 0.9743934571743011, "num_tokens": 2894318.0, "step": 139 }, { "epoch": 1.7770700636942676, "grad_norm": 0.12950226664543152, "learning_rate": 7.523873969186039e-05, "loss": 0.1119, "mean_token_accuracy": 0.9689730405807495, "num_tokens": 2912886.0, "step": 140 }, { "epoch": 1.7898089171974523, "grad_norm": 0.1793074905872345, "learning_rate": 7.389437861200024e-05, "loss": 0.1131, "mean_token_accuracy": 0.9701094329357147, "num_tokens": 2932155.0, "step": 141 }, { "epoch": 1.802547770700637, "grad_norm": 0.1540454626083374, "learning_rate": 7.25550619366911e-05, "loss": 0.1142, "mean_token_accuracy": 0.969739556312561, "num_tokens": 2954884.0, "step": 142 }, { "epoch": 1.8152866242038217, "grad_norm": 0.15937185287475586, "learning_rate": 7.122104846288064e-05, "loss": 0.128, "mean_token_accuracy": 0.9650757312774658, "num_tokens": 2976191.0, "step": 143 }, { "epoch": 1.8280254777070064, "grad_norm": 0.15609461069107056, "learning_rate": 6.989259596277582e-05, "loss": 0.0999, "mean_token_accuracy": 0.9722784161567688, "num_tokens": 2996633.0, "step": 144 }, { "epoch": 1.8407643312101911, "grad_norm": 0.1675417721271515, "learning_rate": 6.85699611340333e-05, "loss": 0.1058, "mean_token_accuracy": 0.9703787863254547, "num_tokens": 3017723.0, "step": 145 }, { "epoch": 1.8535031847133758, "grad_norm": 0.19539587199687958, "learning_rate": 6.725339955015777e-05, "loss": 0.1354, "mean_token_accuracy": 0.96318119764328, "num_tokens": 3037762.0, "step": 146 }, { "epoch": 1.8662420382165605, "grad_norm": 0.13168184459209442, "learning_rate": 6.594316561111724e-05, "loss": 0.1005, "mean_token_accuracy": 0.9725645482540131, "num_tokens": 3058329.0, "step": 147 }, { "epoch": 1.8789808917197452, "grad_norm": 0.1617504358291626, "learning_rate": 6.46395124941851e-05, "loss": 0.136, "mean_token_accuracy": 0.9640224277973175, "num_tokens": 3079340.0, "step": 148 }, { "epoch": 1.89171974522293, "grad_norm": 0.16531525552272797, "learning_rate": 6.334269210501875e-05, "loss": 0.1195, "mean_token_accuracy": 0.9680073857307434, "num_tokens": 3099670.0, "step": 149 }, { "epoch": 1.9044585987261147, "grad_norm": 0.22178637981414795, "learning_rate": 6.205295502898348e-05, "loss": 0.1281, "mean_token_accuracy": 0.9676016867160797, "num_tokens": 3119491.0, "step": 150 }, { "epoch": 1.9171974522292994, "grad_norm": 0.18001458048820496, "learning_rate": 6.0770550482731924e-05, "loss": 0.1079, "mean_token_accuracy": 0.9712074995040894, "num_tokens": 3139513.0, "step": 151 }, { "epoch": 1.929936305732484, "grad_norm": 0.1498527079820633, "learning_rate": 5.9495726266047605e-05, "loss": 0.1042, "mean_token_accuracy": 0.9726397097110748, "num_tokens": 3160672.0, "step": 152 }, { "epoch": 1.9426751592356688, "grad_norm": 0.1454562097787857, "learning_rate": 5.8228728713962543e-05, "loss": 0.1103, "mean_token_accuracy": 0.9712657034397125, "num_tokens": 3182484.0, "step": 153 }, { "epoch": 1.9554140127388535, "grad_norm": 0.19215665757656097, "learning_rate": 5.696980264915777e-05, "loss": 0.0922, "mean_token_accuracy": 0.9748160243034363, "num_tokens": 3203367.0, "step": 154 }, { "epoch": 1.9681528662420382, "grad_norm": 0.14836356043815613, "learning_rate": 5.571919133465605e-05, "loss": 0.1049, "mean_token_accuracy": 0.9711067080497742, "num_tokens": 3225455.0, "step": 155 }, { "epoch": 1.980891719745223, "grad_norm": 0.1734013706445694, "learning_rate": 5.447713642681612e-05, "loss": 0.1062, "mean_token_accuracy": 0.9732925593852997, "num_tokens": 3246222.0, "step": 156 }, { "epoch": 1.9936305732484076, "grad_norm": 0.13410215079784393, "learning_rate": 5.324387792863719e-05, "loss": 0.1118, "mean_token_accuracy": 0.9705207347869873, "num_tokens": 3268819.0, "step": 157 }, { "epoch": 2.0, "grad_norm": 0.19894972443580627, "learning_rate": 5.201965414338308e-05, "loss": 0.0804, "mean_token_accuracy": 0.9756550192832947, "num_tokens": 3278011.0, "step": 158 }, { "epoch": 2.0127388535031847, "grad_norm": 0.13745059072971344, "learning_rate": 5.080470162853472e-05, "loss": 0.0994, "mean_token_accuracy": 0.9729433953762054, "num_tokens": 3299349.0, "step": 159 }, { "epoch": 2.0254777070063694, "grad_norm": 0.1536296308040619, "learning_rate": 4.959925515008002e-05, "loss": 0.0976, "mean_token_accuracy": 0.973717212677002, "num_tokens": 3319814.0, "step": 160 }, { "epoch": 2.038216560509554, "grad_norm": 0.14658384025096893, "learning_rate": 4.840354763714991e-05, "loss": 0.0966, "mean_token_accuracy": 0.9740248918533325, "num_tokens": 3341791.0, "step": 161 }, { "epoch": 2.050955414012739, "grad_norm": 0.12013503909111023, "learning_rate": 4.7217810137009274e-05, "loss": 0.0783, "mean_token_accuracy": 0.9775272607803345, "num_tokens": 3362482.0, "step": 162 }, { "epoch": 2.0636942675159236, "grad_norm": 0.13740386068820953, "learning_rate": 4.604227177041156e-05, "loss": 0.0829, "mean_token_accuracy": 0.9774322211742401, "num_tokens": 3383265.0, "step": 163 }, { "epoch": 2.0764331210191083, "grad_norm": 0.1289196014404297, "learning_rate": 4.487715968732568e-05, "loss": 0.073, "mean_token_accuracy": 0.9784163534641266, "num_tokens": 3405772.0, "step": 164 }, { "epoch": 2.089171974522293, "grad_norm": 0.1675165295600891, "learning_rate": 4.372269902304363e-05, "loss": 0.0875, "mean_token_accuracy": 0.9745315313339233, "num_tokens": 3426008.0, "step": 165 }, { "epoch": 2.1019108280254777, "grad_norm": 0.16612502932548523, "learning_rate": 4.257911285467754e-05, "loss": 0.0861, "mean_token_accuracy": 0.9750963449478149, "num_tokens": 3445583.0, "step": 166 }, { "epoch": 2.1146496815286624, "grad_norm": 0.24531899392604828, "learning_rate": 4.144662215805426e-05, "loss": 0.0845, "mean_token_accuracy": 0.9756963849067688, "num_tokens": 3465685.0, "step": 167 }, { "epoch": 2.127388535031847, "grad_norm": 0.165582075715065, "learning_rate": 4.0325445765016145e-05, "loss": 0.0798, "mean_token_accuracy": 0.9772799611091614, "num_tokens": 3486747.0, "step": 168 }, { "epoch": 2.140127388535032, "grad_norm": 0.20452290773391724, "learning_rate": 3.921580032113602e-05, "loss": 0.1093, "mean_token_accuracy": 0.9696950614452362, "num_tokens": 3507170.0, "step": 169 }, { "epoch": 2.1528662420382165, "grad_norm": 0.22140122950077057, "learning_rate": 3.8117900243854595e-05, "loss": 0.0932, "mean_token_accuracy": 0.9731378257274628, "num_tokens": 3528688.0, "step": 170 }, { "epoch": 2.1656050955414012, "grad_norm": 0.14823046326637268, "learning_rate": 3.7031957681048604e-05, "loss": 0.0787, "mean_token_accuracy": 0.978544145822525, "num_tokens": 3551493.0, "step": 171 }, { "epoch": 2.178343949044586, "grad_norm": 0.18386752903461456, "learning_rate": 3.595818247003713e-05, "loss": 0.0911, "mean_token_accuracy": 0.9754537045955658, "num_tokens": 3573241.0, "step": 172 }, { "epoch": 2.1910828025477707, "grad_norm": 0.14411669969558716, "learning_rate": 3.489678209703475e-05, "loss": 0.0791, "mean_token_accuracy": 0.9779654443264008, "num_tokens": 3592020.0, "step": 173 }, { "epoch": 2.2038216560509554, "grad_norm": 0.1390937715768814, "learning_rate": 3.3847961657058845e-05, "loss": 0.0773, "mean_token_accuracy": 0.9773176610469818, "num_tokens": 3612923.0, "step": 174 }, { "epoch": 2.21656050955414, "grad_norm": 0.1446724385023117, "learning_rate": 3.281192381429894e-05, "loss": 0.0792, "mean_token_accuracy": 0.9771729111671448, "num_tokens": 3633033.0, "step": 175 }, { "epoch": 2.229299363057325, "grad_norm": 0.1646534949541092, "learning_rate": 3.178886876295578e-05, "loss": 0.0856, "mean_token_accuracy": 0.976368248462677, "num_tokens": 3653549.0, "step": 176 }, { "epoch": 2.2420382165605095, "grad_norm": 0.14741237461566925, "learning_rate": 3.077899418855772e-05, "loss": 0.0725, "mean_token_accuracy": 0.9795258343219757, "num_tokens": 3676404.0, "step": 177 }, { "epoch": 2.254777070063694, "grad_norm": 0.12899887561798096, "learning_rate": 2.9782495229761808e-05, "loss": 0.0695, "mean_token_accuracy": 0.9794414341449738, "num_tokens": 3696514.0, "step": 178 }, { "epoch": 2.267515923566879, "grad_norm": 0.1296052187681198, "learning_rate": 2.879956444064703e-05, "loss": 0.07, "mean_token_accuracy": 0.9783405065536499, "num_tokens": 3716614.0, "step": 179 }, { "epoch": 2.2802547770700636, "grad_norm": 0.17682477831840515, "learning_rate": 2.783039175350699e-05, "loss": 0.0899, "mean_token_accuracy": 0.9737552106380463, "num_tokens": 3734545.0, "step": 180 }, { "epoch": 2.2929936305732483, "grad_norm": 0.150472953915596, "learning_rate": 2.6875164442149147e-05, "loss": 0.0767, "mean_token_accuracy": 0.9762512743473053, "num_tokens": 3755770.0, "step": 181 }, { "epoch": 2.305732484076433, "grad_norm": 0.1425381898880005, "learning_rate": 2.5934067085707834e-05, "loss": 0.0741, "mean_token_accuracy": 0.9798364341259003, "num_tokens": 3778378.0, "step": 182 }, { "epoch": 2.3184713375796178, "grad_norm": 0.13129480183124542, "learning_rate": 2.500728153297788e-05, "loss": 0.0736, "mean_token_accuracy": 0.9784353077411652, "num_tokens": 3799187.0, "step": 183 }, { "epoch": 2.3312101910828025, "grad_norm": 0.1579660028219223, "learning_rate": 2.409498686727587e-05, "loss": 0.0839, "mean_token_accuracy": 0.9769056141376495, "num_tokens": 3821803.0, "step": 184 }, { "epoch": 2.343949044585987, "grad_norm": 0.13841375708580017, "learning_rate": 2.3197359371835802e-05, "loss": 0.0729, "mean_token_accuracy": 0.9776602387428284, "num_tokens": 3842009.0, "step": 185 }, { "epoch": 2.356687898089172, "grad_norm": 0.14079244434833527, "learning_rate": 2.2314572495745746e-05, "loss": 0.0745, "mean_token_accuracy": 0.978991687297821, "num_tokens": 3861386.0, "step": 186 }, { "epoch": 2.3694267515923566, "grad_norm": 0.1590651422739029, "learning_rate": 2.1446796820432167e-05, "loss": 0.0782, "mean_token_accuracy": 0.9771281480789185, "num_tokens": 3880797.0, "step": 187 }, { "epoch": 2.3821656050955413, "grad_norm": 0.143194317817688, "learning_rate": 2.0594200026698363e-05, "loss": 0.0818, "mean_token_accuracy": 0.9773141145706177, "num_tokens": 3903019.0, "step": 188 }, { "epoch": 2.394904458598726, "grad_norm": 0.13460594415664673, "learning_rate": 1.9756946862323535e-05, "loss": 0.0721, "mean_token_accuracy": 0.97975093126297, "num_tokens": 3924784.0, "step": 189 }, { "epoch": 2.4076433121019107, "grad_norm": 0.13424114882946014, "learning_rate": 1.8935199110228275e-05, "loss": 0.0734, "mean_token_accuracy": 0.9811668992042542, "num_tokens": 3948108.0, "step": 190 }, { "epoch": 2.4203821656050954, "grad_norm": 0.17168937623500824, "learning_rate": 1.8129115557213262e-05, "loss": 0.0785, "mean_token_accuracy": 0.9771130979061127, "num_tokens": 3969333.0, "step": 191 }, { "epoch": 2.43312101910828, "grad_norm": 0.13767112791538239, "learning_rate": 1.7338851963276825e-05, "loss": 0.0736, "mean_token_accuracy": 0.9778575003147125, "num_tokens": 3989403.0, "step": 192 }, { "epoch": 2.445859872611465, "grad_norm": 0.18789297342300415, "learning_rate": 1.656456103151728e-05, "loss": 0.0924, "mean_token_accuracy": 0.9723543524742126, "num_tokens": 4010821.0, "step": 193 }, { "epoch": 2.4585987261146496, "grad_norm": 0.1507100760936737, "learning_rate": 1.580639237862608e-05, "loss": 0.0764, "mean_token_accuracy": 0.97721067070961, "num_tokens": 4030537.0, "step": 194 }, { "epoch": 2.4713375796178343, "grad_norm": 0.18637511134147644, "learning_rate": 1.5064492505977234e-05, "loss": 0.0784, "mean_token_accuracy": 0.9756501317024231, "num_tokens": 4048731.0, "step": 195 }, { "epoch": 2.484076433121019, "grad_norm": 0.17008532583713531, "learning_rate": 1.433900477131882e-05, "loss": 0.0804, "mean_token_accuracy": 0.9770023822784424, "num_tokens": 4068414.0, "step": 196 }, { "epoch": 2.4968152866242037, "grad_norm": 0.14089594781398773, "learning_rate": 1.363006936107183e-05, "loss": 0.0666, "mean_token_accuracy": 0.9802176356315613, "num_tokens": 4089906.0, "step": 197 }, { "epoch": 2.5095541401273884, "grad_norm": 0.1633421629667282, "learning_rate": 1.29378232632419e-05, "loss": 0.078, "mean_token_accuracy": 0.9769896566867828, "num_tokens": 4110825.0, "step": 198 }, { "epoch": 2.522292993630573, "grad_norm": 0.148310124874115, "learning_rate": 1.2262400240949023e-05, "loss": 0.0866, "mean_token_accuracy": 0.9763473868370056, "num_tokens": 4130116.0, "step": 199 }, { "epoch": 2.535031847133758, "grad_norm": 0.14359574019908905, "learning_rate": 1.1603930806580444e-05, "loss": 0.0744, "mean_token_accuracy": 0.9773200452327728, "num_tokens": 4151296.0, "step": 200 }, { "epoch": 2.5477707006369426, "grad_norm": 0.15275435149669647, "learning_rate": 1.0962542196571634e-05, "loss": 0.0783, "mean_token_accuracy": 0.9785310328006744, "num_tokens": 4172098.0, "step": 201 }, { "epoch": 2.5605095541401273, "grad_norm": 0.16805951297283173, "learning_rate": 1.0338358346820353e-05, "loss": 0.0837, "mean_token_accuracy": 0.9770323634147644, "num_tokens": 4193109.0, "step": 202 }, { "epoch": 2.573248407643312, "grad_norm": 0.14101877808570862, "learning_rate": 9.731499868738447e-06, "loss": 0.0763, "mean_token_accuracy": 0.9785304367542267, "num_tokens": 4215347.0, "step": 203 }, { "epoch": 2.5859872611464967, "grad_norm": 0.15893617272377014, "learning_rate": 9.142084025945984e-06, "loss": 0.0772, "mean_token_accuracy": 0.978299617767334, "num_tokens": 4236346.0, "step": 204 }, { "epoch": 2.5987261146496814, "grad_norm": 0.14236551523208618, "learning_rate": 8.570224711612385e-06, "loss": 0.0715, "mean_token_accuracy": 0.9786622226238251, "num_tokens": 4258638.0, "step": 205 }, { "epoch": 2.611464968152866, "grad_norm": 0.17728912830352783, "learning_rate": 8.016032426448817e-06, "loss": 0.0855, "mean_token_accuracy": 0.9760014414787292, "num_tokens": 4279271.0, "step": 206 }, { "epoch": 2.624203821656051, "grad_norm": 0.19720520079135895, "learning_rate": 7.479614257355971e-06, "loss": 0.0833, "mean_token_accuracy": 0.9759804606437683, "num_tokens": 4299151.0, "step": 207 }, { "epoch": 2.6369426751592355, "grad_norm": 0.14556831121444702, "learning_rate": 6.961073856731648e-06, "loss": 0.0737, "mean_token_accuracy": 0.9779518842697144, "num_tokens": 4320704.0, "step": 208 }, { "epoch": 2.6496815286624202, "grad_norm": 0.16077663004398346, "learning_rate": 6.460511422441984e-06, "loss": 0.0794, "mean_token_accuracy": 0.9782223701477051, "num_tokens": 4339704.0, "step": 209 }, { "epoch": 2.662420382165605, "grad_norm": 0.15406979620456696, "learning_rate": 5.978023678460099e-06, "loss": 0.0776, "mean_token_accuracy": 0.977834552526474, "num_tokens": 4359021.0, "step": 210 }, { "epoch": 2.6751592356687897, "grad_norm": 0.16407983005046844, "learning_rate": 5.5137038561761115e-06, "loss": 0.0837, "mean_token_accuracy": 0.9751948714256287, "num_tokens": 4379725.0, "step": 211 }, { "epoch": 2.6878980891719744, "grad_norm": 0.13812731206417084, "learning_rate": 5.067641676381918e-06, "loss": 0.0718, "mean_token_accuracy": 0.977728933095932, "num_tokens": 4402644.0, "step": 212 }, { "epoch": 2.700636942675159, "grad_norm": 0.16759884357452393, "learning_rate": 4.639923331934471e-06, "loss": 0.077, "mean_token_accuracy": 0.9772835969924927, "num_tokens": 4423503.0, "step": 213 }, { "epoch": 2.713375796178344, "grad_norm": 0.1482495367527008, "learning_rate": 4.230631471100655e-06, "loss": 0.0783, "mean_token_accuracy": 0.9765441417694092, "num_tokens": 4445353.0, "step": 214 }, { "epoch": 2.7261146496815285, "grad_norm": 0.1537255495786667, "learning_rate": 3.839845181587098e-06, "loss": 0.0845, "mean_token_accuracy": 0.9765470325946808, "num_tokens": 4467140.0, "step": 215 }, { "epoch": 2.738853503184713, "grad_norm": 0.19450800120830536, "learning_rate": 3.467639975257997e-06, "loss": 0.0907, "mean_token_accuracy": 0.9742664694786072, "num_tokens": 4486775.0, "step": 216 }, { "epoch": 2.7515923566878984, "grad_norm": 0.16700267791748047, "learning_rate": 3.1140877735439387e-06, "loss": 0.0825, "mean_token_accuracy": 0.976231724023819, "num_tokens": 4507937.0, "step": 217 }, { "epoch": 2.7643312101910826, "grad_norm": 0.1603633612394333, "learning_rate": 2.7792568935444796e-06, "loss": 0.0823, "mean_token_accuracy": 0.976065456867218, "num_tokens": 4527826.0, "step": 218 }, { "epoch": 2.777070063694268, "grad_norm": 0.14653527736663818, "learning_rate": 2.4632120348272003e-06, "loss": 0.0775, "mean_token_accuracy": 0.9774307906627655, "num_tokens": 4550667.0, "step": 219 }, { "epoch": 2.789808917197452, "grad_norm": 0.15313751995563507, "learning_rate": 2.166014266925731e-06, "loss": 0.0819, "mean_token_accuracy": 0.9767453074455261, "num_tokens": 4570173.0, "step": 220 }, { "epoch": 2.802547770700637, "grad_norm": 0.13249285519123077, "learning_rate": 1.88772101753929e-06, "loss": 0.0741, "mean_token_accuracy": 0.9789757132530212, "num_tokens": 4590375.0, "step": 221 }, { "epoch": 2.8152866242038215, "grad_norm": 0.14562749862670898, "learning_rate": 1.6283860614358936e-06, "loss": 0.0825, "mean_token_accuracy": 0.9768469035625458, "num_tokens": 4611934.0, "step": 222 }, { "epoch": 2.8280254777070066, "grad_norm": 0.15164901316165924, "learning_rate": 1.3880595100613792e-06, "loss": 0.076, "mean_token_accuracy": 0.9793215095996857, "num_tokens": 4634831.0, "step": 223 }, { "epoch": 2.840764331210191, "grad_norm": 0.14515450596809387, "learning_rate": 1.1667878018564171e-06, "loss": 0.0759, "mean_token_accuracy": 0.9793158173561096, "num_tokens": 4654825.0, "step": 224 }, { "epoch": 2.853503184713376, "grad_norm": 0.15432044863700867, "learning_rate": 9.64613693283123e-07, "loss": 0.0779, "mean_token_accuracy": 0.9766505062580109, "num_tokens": 4676000.0, "step": 225 }, { "epoch": 2.8662420382165603, "grad_norm": 0.1555798053741455, "learning_rate": 7.815762505632096e-07, "loss": 0.0799, "mean_token_accuracy": 0.9778449833393097, "num_tokens": 4695897.0, "step": 226 }, { "epoch": 2.8789808917197455, "grad_norm": 0.16175790131092072, "learning_rate": 6.177108421292266e-07, "loss": 0.086, "mean_token_accuracy": 0.9760761559009552, "num_tokens": 4716551.0, "step": 227 }, { "epoch": 2.8917197452229297, "grad_norm": 0.13542035222053528, "learning_rate": 4.7304913179025965e-07, "loss": 0.0734, "mean_token_accuracy": 0.979287177324295, "num_tokens": 4739406.0, "step": 228 }, { "epoch": 2.904458598726115, "grad_norm": 0.1451287418603897, "learning_rate": 3.4761907261356976e-07, "loss": 0.0777, "mean_token_accuracy": 0.977697491645813, "num_tokens": 4760092.0, "step": 229 }, { "epoch": 2.917197452229299, "grad_norm": 0.1680404543876648, "learning_rate": 2.414449015231357e-07, "loss": 0.0934, "mean_token_accuracy": 0.973942905664444, "num_tokens": 4780982.0, "step": 230 }, { "epoch": 2.9299363057324843, "grad_norm": 0.19171962141990662, "learning_rate": 1.545471346164007e-07, "loss": 0.0939, "mean_token_accuracy": 0.9738248884677887, "num_tokens": 4801657.0, "step": 231 }, { "epoch": 2.9426751592356686, "grad_norm": 0.14699915051460266, "learning_rate": 8.694256319987659e-08, "loss": 0.0793, "mean_token_accuracy": 0.9780023992061615, "num_tokens": 4821928.0, "step": 232 }, { "epoch": 2.9554140127388537, "grad_norm": 0.15162605047225952, "learning_rate": 3.8644250544594975e-08, "loss": 0.0799, "mean_token_accuracy": 0.9769730567932129, "num_tokens": 4845265.0, "step": 233 }, { "epoch": 2.968152866242038, "grad_norm": 0.19175927340984344, "learning_rate": 9.661529361892907e-09, "loss": 0.086, "mean_token_accuracy": 0.9761645793914795, "num_tokens": 4864834.0, "step": 234 }, { "epoch": 2.968152866242038, "step": 234, "total_flos": 3.895828387117138e+17, "train_loss": 0.19240072863096866, "train_runtime": 1091.7173, "train_samples_per_second": 13.74, "train_steps_per_second": 0.214 } ], "logging_steps": 1.0, "max_steps": 234, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.895828387117138e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }