| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.968152866242038, |
| "eval_steps": 500, |
| "global_step": 234, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 4.032490253448486, |
| "learning_rate": 0.0, |
| "loss": 1.8275, |
| "mean_token_accuracy": 0.6403467357158661, |
| "num_tokens": 20782.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 4.02821683883667, |
| "learning_rate": 2.5e-05, |
| "loss": 1.8101, |
| "mean_token_accuracy": 0.6456336379051208, |
| "num_tokens": 41801.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 2.6589291095733643, |
| "learning_rate": 5e-05, |
| "loss": 1.666, |
| "mean_token_accuracy": 0.6547168493270874, |
| "num_tokens": 62978.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 2.0679564476013184, |
| "learning_rate": 7.500000000000001e-05, |
| "loss": 1.4185, |
| "mean_token_accuracy": 0.6894981861114502, |
| "num_tokens": 85034.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 1.1579885482788086, |
| "learning_rate": 0.0001, |
| "loss": 1.3053, |
| "mean_token_accuracy": 0.6996746063232422, |
| "num_tokens": 107185.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 0.8610864281654358, |
| "learning_rate": 0.000125, |
| "loss": 1.1499, |
| "mean_token_accuracy": 0.720809280872345, |
| "num_tokens": 127806.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 0.9501633644104004, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 1.0344, |
| "mean_token_accuracy": 0.7437184154987335, |
| "num_tokens": 148231.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 1.209609031677246, |
| "learning_rate": 0.000175, |
| "loss": 0.9364, |
| "mean_token_accuracy": 0.7647237181663513, |
| "num_tokens": 169757.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 0.8404257297515869, |
| "learning_rate": 0.0002, |
| "loss": 0.8312, |
| "mean_token_accuracy": 0.7892735302448273, |
| "num_tokens": 190207.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 0.691281259059906, |
| "learning_rate": 0.00019999033847063811, |
| "loss": 0.6679, |
| "mean_token_accuracy": 0.8296232521533966, |
| "num_tokens": 209441.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 0.6289070844650269, |
| "learning_rate": 0.00019996135574945544, |
| "loss": 0.6195, |
| "mean_token_accuracy": 0.8456655740737915, |
| "num_tokens": 229789.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 0.5578577518463135, |
| "learning_rate": 0.00019991305743680013, |
| "loss": 0.5848, |
| "mean_token_accuracy": 0.8547155559062958, |
| "num_tokens": 250645.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 0.5704829692840576, |
| "learning_rate": 0.0001998454528653836, |
| "loss": 0.5061, |
| "mean_token_accuracy": 0.8722218573093414, |
| "num_tokens": 271375.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 0.5471704602241516, |
| "learning_rate": 0.00019975855509847686, |
| "loss": 0.4757, |
| "mean_token_accuracy": 0.8858338296413422, |
| "num_tokens": 292499.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.5097174048423767, |
| "learning_rate": 0.00019965238092738643, |
| "loss": 0.5191, |
| "mean_token_accuracy": 0.8713619709014893, |
| "num_tokens": 313755.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.43789729475975037, |
| "learning_rate": 0.00019952695086820975, |
| "loss": 0.381, |
| "mean_token_accuracy": 0.9017090201377869, |
| "num_tokens": 335462.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 0.45297467708587646, |
| "learning_rate": 0.0001993822891578708, |
| "loss": 0.4286, |
| "mean_token_accuracy": 0.8946053981781006, |
| "num_tokens": 355712.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.4537133276462555, |
| "learning_rate": 0.0001992184237494368, |
| "loss": 0.3651, |
| "mean_token_accuracy": 0.912791520357132, |
| "num_tokens": 376658.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 0.4055041968822479, |
| "learning_rate": 0.0001990353863067169, |
| "loss": 0.3392, |
| "mean_token_accuracy": 0.915442943572998, |
| "num_tokens": 396622.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.5385339856147766, |
| "learning_rate": 0.0001988332121981436, |
| "loss": 0.3193, |
| "mean_token_accuracy": 0.9222363233566284, |
| "num_tokens": 417604.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.39093685150146484, |
| "learning_rate": 0.00019861194048993863, |
| "loss": 0.3171, |
| "mean_token_accuracy": 0.9224121868610382, |
| "num_tokens": 438312.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.30290552973747253, |
| "learning_rate": 0.0001983716139385641, |
| "loss": 0.2732, |
| "mean_token_accuracy": 0.9361142218112946, |
| "num_tokens": 460742.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.27954092621803284, |
| "learning_rate": 0.0001981122789824607, |
| "loss": 0.2555, |
| "mean_token_accuracy": 0.9381744861602783, |
| "num_tokens": 481292.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.33339905738830566, |
| "learning_rate": 0.00019783398573307428, |
| "loss": 0.2688, |
| "mean_token_accuracy": 0.9344040155410767, |
| "num_tokens": 502883.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.3911352753639221, |
| "learning_rate": 0.00019753678796517282, |
| "loss": 0.2329, |
| "mean_token_accuracy": 0.9421150088310242, |
| "num_tokens": 524527.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.3292308747768402, |
| "learning_rate": 0.00019722074310645553, |
| "loss": 0.2635, |
| "mean_token_accuracy": 0.9353462159633636, |
| "num_tokens": 543460.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.23688943684101105, |
| "learning_rate": 0.00019688591222645607, |
| "loss": 0.2046, |
| "mean_token_accuracy": 0.9497671127319336, |
| "num_tokens": 568256.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.3945387899875641, |
| "learning_rate": 0.000196532360024742, |
| "loss": 0.2345, |
| "mean_token_accuracy": 0.9450124204158783, |
| "num_tokens": 590291.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.28697916865348816, |
| "learning_rate": 0.0001961601548184129, |
| "loss": 0.2338, |
| "mean_token_accuracy": 0.9414379298686981, |
| "num_tokens": 613204.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.23970234394073486, |
| "learning_rate": 0.00019576936852889936, |
| "loss": 0.2229, |
| "mean_token_accuracy": 0.9436235725879669, |
| "num_tokens": 634063.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.2444416582584381, |
| "learning_rate": 0.00019536007666806556, |
| "loss": 0.239, |
| "mean_token_accuracy": 0.9426109194755554, |
| "num_tokens": 654939.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.2546619176864624, |
| "learning_rate": 0.0001949323583236181, |
| "loss": 0.2438, |
| "mean_token_accuracy": 0.9379684627056122, |
| "num_tokens": 676779.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.31282731890678406, |
| "learning_rate": 0.0001944862961438239, |
| "loss": 0.222, |
| "mean_token_accuracy": 0.9442552626132965, |
| "num_tokens": 698151.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.26302680373191833, |
| "learning_rate": 0.00019402197632153992, |
| "loss": 0.2109, |
| "mean_token_accuracy": 0.9452959597110748, |
| "num_tokens": 718994.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.22304703295230865, |
| "learning_rate": 0.00019353948857755803, |
| "loss": 0.1937, |
| "mean_token_accuracy": 0.9508229196071625, |
| "num_tokens": 740812.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.22195610404014587, |
| "learning_rate": 0.00019303892614326836, |
| "loss": 0.2263, |
| "mean_token_accuracy": 0.9433953166007996, |
| "num_tokens": 761685.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.21497657895088196, |
| "learning_rate": 0.00019252038574264405, |
| "loss": 0.2319, |
| "mean_token_accuracy": 0.941495269536972, |
| "num_tokens": 783640.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.23853588104248047, |
| "learning_rate": 0.00019198396757355118, |
| "loss": 0.2468, |
| "mean_token_accuracy": 0.9388796389102936, |
| "num_tokens": 803923.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.20184901356697083, |
| "learning_rate": 0.00019142977528838762, |
| "loss": 0.1935, |
| "mean_token_accuracy": 0.9509699940681458, |
| "num_tokens": 824723.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.2413100302219391, |
| "learning_rate": 0.00019085791597405404, |
| "loss": 0.2581, |
| "mean_token_accuracy": 0.9344974160194397, |
| "num_tokens": 845317.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.20988352596759796, |
| "learning_rate": 0.00019026850013126157, |
| "loss": 0.1976, |
| "mean_token_accuracy": 0.9503491222858429, |
| "num_tokens": 867416.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.22773092985153198, |
| "learning_rate": 0.00018966164165317966, |
| "loss": 0.2261, |
| "mean_token_accuracy": 0.9430988430976868, |
| "num_tokens": 886904.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.1990187019109726, |
| "learning_rate": 0.00018903745780342839, |
| "loss": 0.1993, |
| "mean_token_accuracy": 0.9476139545440674, |
| "num_tokens": 908886.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.22125588357448578, |
| "learning_rate": 0.0001883960691934196, |
| "loss": 0.2352, |
| "mean_token_accuracy": 0.9444881975650787, |
| "num_tokens": 929202.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.22190915048122406, |
| "learning_rate": 0.00018773759975905098, |
| "loss": 0.1924, |
| "mean_token_accuracy": 0.952962726354599, |
| "num_tokens": 949033.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.17759603261947632, |
| "learning_rate": 0.00018706217673675811, |
| "loss": 0.1921, |
| "mean_token_accuracy": 0.9519978165626526, |
| "num_tokens": 971365.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.19214215874671936, |
| "learning_rate": 0.0001863699306389282, |
| "loss": 0.2039, |
| "mean_token_accuracy": 0.9491439461708069, |
| "num_tokens": 990739.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.21507352590560913, |
| "learning_rate": 0.00018566099522868119, |
| "loss": 0.2436, |
| "mean_token_accuracy": 0.9411478042602539, |
| "num_tokens": 1011450.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.19679825007915497, |
| "learning_rate": 0.00018493550749402278, |
| "loss": 0.212, |
| "mean_token_accuracy": 0.9487031996250153, |
| "num_tokens": 1031182.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.19453713297843933, |
| "learning_rate": 0.00018419360762137395, |
| "loss": 0.1815, |
| "mean_token_accuracy": 0.9539785385131836, |
| "num_tokens": 1054994.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.17126353085041046, |
| "learning_rate": 0.00018343543896848273, |
| "loss": 0.1878, |
| "mean_token_accuracy": 0.9533947706222534, |
| "num_tokens": 1075696.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.23333708941936493, |
| "learning_rate": 0.00018266114803672318, |
| "loss": 0.2263, |
| "mean_token_accuracy": 0.9433774650096893, |
| "num_tokens": 1098543.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.20323054492473602, |
| "learning_rate": 0.00018187088444278674, |
| "loss": 0.1637, |
| "mean_token_accuracy": 0.9572640359401703, |
| "num_tokens": 1119652.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.2668849527835846, |
| "learning_rate": 0.00018106480088977172, |
| "loss": 0.2186, |
| "mean_token_accuracy": 0.9467197954654694, |
| "num_tokens": 1141306.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.19561052322387695, |
| "learning_rate": 0.00018024305313767646, |
| "loss": 0.1896, |
| "mean_token_accuracy": 0.9518384337425232, |
| "num_tokens": 1161171.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.1853981763124466, |
| "learning_rate": 0.00017940579997330165, |
| "loss": 0.1952, |
| "mean_token_accuracy": 0.9492832124233246, |
| "num_tokens": 1181534.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.16985760629177094, |
| "learning_rate": 0.00017855320317956784, |
| "loss": 0.1697, |
| "mean_token_accuracy": 0.9568532705307007, |
| "num_tokens": 1201659.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.17170517146587372, |
| "learning_rate": 0.00017768542750425426, |
| "loss": 0.2227, |
| "mean_token_accuracy": 0.9445173442363739, |
| "num_tokens": 1222313.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.19633768498897552, |
| "learning_rate": 0.0001768026406281642, |
| "loss": 0.1681, |
| "mean_token_accuracy": 0.9575904607772827, |
| "num_tokens": 1242286.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.17580056190490723, |
| "learning_rate": 0.00017590501313272415, |
| "loss": 0.1845, |
| "mean_token_accuracy": 0.9523945152759552, |
| "num_tokens": 1262874.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.18206478655338287, |
| "learning_rate": 0.00017499271846702213, |
| "loss": 0.1985, |
| "mean_token_accuracy": 0.951472669839859, |
| "num_tokens": 1282769.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.2344655692577362, |
| "learning_rate": 0.00017406593291429217, |
| "loss": 0.2122, |
| "mean_token_accuracy": 0.9443674981594086, |
| "num_tokens": 1304139.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.19128663837909698, |
| "learning_rate": 0.00017312483555785086, |
| "loss": 0.2244, |
| "mean_token_accuracy": 0.943341851234436, |
| "num_tokens": 1324467.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.17244233191013336, |
| "learning_rate": 0.00017216960824649303, |
| "loss": 0.168, |
| "mean_token_accuracy": 0.9575148522853851, |
| "num_tokens": 1345262.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.17028464376926422, |
| "learning_rate": 0.00017120043555935298, |
| "loss": 0.1885, |
| "mean_token_accuracy": 0.9521305859088898, |
| "num_tokens": 1368700.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.20174594223499298, |
| "learning_rate": 0.0001702175047702382, |
| "loss": 0.185, |
| "mean_token_accuracy": 0.9526795446872711, |
| "num_tokens": 1388344.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.1811266541481018, |
| "learning_rate": 0.00016922100581144228, |
| "loss": 0.1754, |
| "mean_token_accuracy": 0.9565881788730621, |
| "num_tokens": 1407723.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.18422017991542816, |
| "learning_rate": 0.00016821113123704424, |
| "loss": 0.1749, |
| "mean_token_accuracy": 0.9552392363548279, |
| "num_tokens": 1427747.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.1854456216096878, |
| "learning_rate": 0.00016718807618570106, |
| "loss": 0.1452, |
| "mean_token_accuracy": 0.9621990919113159, |
| "num_tokens": 1446729.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.20696918666362762, |
| "learning_rate": 0.00016615203834294119, |
| "loss": 0.185, |
| "mean_token_accuracy": 0.9547071158885956, |
| "num_tokens": 1466084.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.22027692198753357, |
| "learning_rate": 0.00016510321790296525, |
| "loss": 0.1912, |
| "mean_token_accuracy": 0.9535127878189087, |
| "num_tokens": 1485783.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.16686508059501648, |
| "learning_rate": 0.00016404181752996289, |
| "loss": 0.1622, |
| "mean_token_accuracy": 0.959883451461792, |
| "num_tokens": 1505907.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.17605887353420258, |
| "learning_rate": 0.00016296804231895142, |
| "loss": 0.165, |
| "mean_token_accuracy": 0.9578165411949158, |
| "num_tokens": 1527389.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.17619065940380096, |
| "learning_rate": 0.00016188209975614542, |
| "loss": 0.1561, |
| "mean_token_accuracy": 0.9601358473300934, |
| "num_tokens": 1547714.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.1950807124376297, |
| "learning_rate": 0.00016078419967886402, |
| "loss": 0.1984, |
| "mean_token_accuracy": 0.9482778906822205, |
| "num_tokens": 1567244.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.18063174188137054, |
| "learning_rate": 0.00015967455423498387, |
| "loss": 0.1802, |
| "mean_token_accuracy": 0.9535951614379883, |
| "num_tokens": 1586726.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.14509689807891846, |
| "learning_rate": 0.00015855337784194577, |
| "loss": 0.1411, |
| "mean_token_accuracy": 0.9627689123153687, |
| "num_tokens": 1608089.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.19907675683498383, |
| "learning_rate": 0.00015742088714532247, |
| "loss": 0.2119, |
| "mean_token_accuracy": 0.9476487040519714, |
| "num_tokens": 1629313.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.19907675683498383, |
| "learning_rate": 0.00015627730097695638, |
| "loss": 0.1333, |
| "mean_token_accuracy": 0.9651358127593994, |
| "num_tokens": 1639470.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.23832248151302338, |
| "learning_rate": 0.00015512284031267437, |
| "loss": 0.1271, |
| "mean_token_accuracy": 0.9659014642238617, |
| "num_tokens": 1658148.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.14923803508281708, |
| "learning_rate": 0.00015395772822958845, |
| "loss": 0.1205, |
| "mean_token_accuracy": 0.9664756953716278, |
| "num_tokens": 1679412.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.14769527316093445, |
| "learning_rate": 0.00015278218986299074, |
| "loss": 0.1374, |
| "mean_token_accuracy": 0.9626262485980988, |
| "num_tokens": 1700169.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.17680829763412476, |
| "learning_rate": 0.0001515964523628501, |
| "loss": 0.125, |
| "mean_token_accuracy": 0.9658435583114624, |
| "num_tokens": 1721319.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.1534733772277832, |
| "learning_rate": 0.00015040074484992, |
| "loss": 0.1357, |
| "mean_token_accuracy": 0.9641449451446533, |
| "num_tokens": 1741752.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.1694839596748352, |
| "learning_rate": 0.00014919529837146528, |
| "loss": 0.1204, |
| "mean_token_accuracy": 0.9689095318317413, |
| "num_tokens": 1763187.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.15279586613178253, |
| "learning_rate": 0.00014798034585661695, |
| "loss": 0.1337, |
| "mean_token_accuracy": 0.9658444821834564, |
| "num_tokens": 1783640.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.18650779128074646, |
| "learning_rate": 0.0001467561220713628, |
| "loss": 0.1261, |
| "mean_token_accuracy": 0.9664537906646729, |
| "num_tokens": 1803457.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.2114044576883316, |
| "learning_rate": 0.0001455228635731839, |
| "loss": 0.1337, |
| "mean_token_accuracy": 0.9664061665534973, |
| "num_tokens": 1824664.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.20512934029102325, |
| "learning_rate": 0.00014428080866534396, |
| "loss": 0.1456, |
| "mean_token_accuracy": 0.9614441394805908, |
| "num_tokens": 1845586.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.17776310443878174, |
| "learning_rate": 0.00014303019735084226, |
| "loss": 0.1425, |
| "mean_token_accuracy": 0.9611153304576874, |
| "num_tokens": 1865504.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.15626613795757294, |
| "learning_rate": 0.00014177127128603745, |
| "loss": 0.1281, |
| "mean_token_accuracy": 0.9677377045154572, |
| "num_tokens": 1885083.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.1749550998210907, |
| "learning_rate": 0.0001405042737339524, |
| "loss": 0.1457, |
| "mean_token_accuracy": 0.9627916514873505, |
| "num_tokens": 1906200.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.16051284968852997, |
| "learning_rate": 0.0001392294495172681, |
| "loss": 0.1138, |
| "mean_token_accuracy": 0.9708078503608704, |
| "num_tokens": 1929089.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.1582704484462738, |
| "learning_rate": 0.00013794704497101655, |
| "loss": 0.1393, |
| "mean_token_accuracy": 0.9625002443790436, |
| "num_tokens": 1950436.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.19418908655643463, |
| "learning_rate": 0.0001366573078949813, |
| "loss": 0.1484, |
| "mean_token_accuracy": 0.9607403576374054, |
| "num_tokens": 1970259.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.1565779149532318, |
| "learning_rate": 0.00013536048750581494, |
| "loss": 0.1133, |
| "mean_token_accuracy": 0.9693767130374908, |
| "num_tokens": 1990966.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.1751173734664917, |
| "learning_rate": 0.00013405683438888282, |
| "loss": 0.1543, |
| "mean_token_accuracy": 0.9605205059051514, |
| "num_tokens": 2011687.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.1851140260696411, |
| "learning_rate": 0.00013274660044984224, |
| "loss": 0.1569, |
| "mean_token_accuracy": 0.9579177796840668, |
| "num_tokens": 2032850.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.17630673944950104, |
| "learning_rate": 0.00013143003886596669, |
| "loss": 0.1201, |
| "mean_token_accuracy": 0.9683541655540466, |
| "num_tokens": 2054502.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.19014202058315277, |
| "learning_rate": 0.0001301074040372242, |
| "loss": 0.1292, |
| "mean_token_accuracy": 0.9665453433990479, |
| "num_tokens": 2075517.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.162857323884964, |
| "learning_rate": 0.00012877895153711935, |
| "loss": 0.1065, |
| "mean_token_accuracy": 0.9714101850986481, |
| "num_tokens": 2095734.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.16616225242614746, |
| "learning_rate": 0.0001274449380633089, |
| "loss": 0.116, |
| "mean_token_accuracy": 0.9681942164897919, |
| "num_tokens": 2117916.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.1441652923822403, |
| "learning_rate": 0.00012610562138799978, |
| "loss": 0.1242, |
| "mean_token_accuracy": 0.9661942422389984, |
| "num_tokens": 2137533.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.15105916559696198, |
| "learning_rate": 0.00012476126030813963, |
| "loss": 0.1106, |
| "mean_token_accuracy": 0.9702428579330444, |
| "num_tokens": 2156908.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.16298384964466095, |
| "learning_rate": 0.0001234121145954094, |
| "loss": 0.1118, |
| "mean_token_accuracy": 0.9696470499038696, |
| "num_tokens": 2178701.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.17056092619895935, |
| "learning_rate": 0.0001220584449460274, |
| "loss": 0.1255, |
| "mean_token_accuracy": 0.9645788669586182, |
| "num_tokens": 2200357.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.1652529537677765, |
| "learning_rate": 0.00012070051293037492, |
| "loss": 0.121, |
| "mean_token_accuracy": 0.967876136302948, |
| "num_tokens": 2222840.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.19024129211902618, |
| "learning_rate": 0.00011933858094245281, |
| "loss": 0.1181, |
| "mean_token_accuracy": 0.9682499766349792, |
| "num_tokens": 2245153.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.1724906712770462, |
| "learning_rate": 0.00011797291214917881, |
| "loss": 0.11, |
| "mean_token_accuracy": 0.9716835618019104, |
| "num_tokens": 2265787.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.12500053644180298, |
| "learning_rate": 0.00011660377043953588, |
| "loss": 0.1227, |
| "mean_token_accuracy": 0.9684112370014191, |
| "num_tokens": 2288666.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.17808276414871216, |
| "learning_rate": 0.0001152314203735805, |
| "loss": 0.1201, |
| "mean_token_accuracy": 0.9669378101825714, |
| "num_tokens": 2309284.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.1402737945318222, |
| "learning_rate": 0.0001138561271313219, |
| "loss": 0.1111, |
| "mean_token_accuracy": 0.9715414047241211, |
| "num_tokens": 2331578.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.15381915867328644, |
| "learning_rate": 0.00011247815646148087, |
| "loss": 0.1217, |
| "mean_token_accuracy": 0.9678640961647034, |
| "num_tokens": 2350038.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.14706242084503174, |
| "learning_rate": 0.00011109777463013915, |
| "loss": 0.1061, |
| "mean_token_accuracy": 0.9708584249019623, |
| "num_tokens": 2368964.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.15973958373069763, |
| "learning_rate": 0.0001097152483692886, |
| "loss": 0.1197, |
| "mean_token_accuracy": 0.9688680768013, |
| "num_tokens": 2391178.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.1674444079399109, |
| "learning_rate": 0.00010833084482529048, |
| "loss": 0.1093, |
| "mean_token_accuracy": 0.9704143404960632, |
| "num_tokens": 2412996.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.16148361563682556, |
| "learning_rate": 0.00010694483150725458, |
| "loss": 0.117, |
| "mean_token_accuracy": 0.9665324985980988, |
| "num_tokens": 2434259.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.16595368087291718, |
| "learning_rate": 0.00010555747623534831, |
| "loss": 0.1406, |
| "mean_token_accuracy": 0.9625270962715149, |
| "num_tokens": 2455587.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.16053670644760132, |
| "learning_rate": 0.00010416904708904548, |
| "loss": 0.1256, |
| "mean_token_accuracy": 0.9664609730243683, |
| "num_tokens": 2476283.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.20048527419567108, |
| "learning_rate": 0.00010277981235532541, |
| "loss": 0.1254, |
| "mean_token_accuracy": 0.9659788012504578, |
| "num_tokens": 2497546.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.16457313299179077, |
| "learning_rate": 0.00010139004047683151, |
| "loss": 0.1229, |
| "mean_token_accuracy": 0.9671443700790405, |
| "num_tokens": 2518296.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.15524955093860626, |
| "learning_rate": 0.0001, |
| "loss": 0.1033, |
| "mean_token_accuracy": 0.9726420640945435, |
| "num_tokens": 2540213.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.13140025734901428, |
| "learning_rate": 9.860995952316851e-05, |
| "loss": 0.1183, |
| "mean_token_accuracy": 0.968624621629715, |
| "num_tokens": 2559617.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.14936192333698273, |
| "learning_rate": 9.722018764467461e-05, |
| "loss": 0.0999, |
| "mean_token_accuracy": 0.9732542335987091, |
| "num_tokens": 2582565.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.15049338340759277, |
| "learning_rate": 9.583095291095453e-05, |
| "loss": 0.1194, |
| "mean_token_accuracy": 0.9678354859352112, |
| "num_tokens": 2602091.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.16037316620349884, |
| "learning_rate": 9.444252376465171e-05, |
| "loss": 0.1218, |
| "mean_token_accuracy": 0.9661269187927246, |
| "num_tokens": 2621569.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.14958986639976501, |
| "learning_rate": 9.305516849274541e-05, |
| "loss": 0.1186, |
| "mean_token_accuracy": 0.9682396650314331, |
| "num_tokens": 2642561.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.13898329436779022, |
| "learning_rate": 9.166915517470953e-05, |
| "loss": 0.0917, |
| "mean_token_accuracy": 0.974632978439331, |
| "num_tokens": 2664635.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.15911662578582764, |
| "learning_rate": 9.028475163071141e-05, |
| "loss": 0.1275, |
| "mean_token_accuracy": 0.9655503630638123, |
| "num_tokens": 2685293.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.1641586571931839, |
| "learning_rate": 8.890222536986085e-05, |
| "loss": 0.1326, |
| "mean_token_accuracy": 0.9644103944301605, |
| "num_tokens": 2706288.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.17261752486228943, |
| "learning_rate": 8.752184353851916e-05, |
| "loss": 0.1263, |
| "mean_token_accuracy": 0.9659662842750549, |
| "num_tokens": 2729317.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.18082129955291748, |
| "learning_rate": 8.614387286867814e-05, |
| "loss": 0.1431, |
| "mean_token_accuracy": 0.9621657431125641, |
| "num_tokens": 2751538.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.16913549602031708, |
| "learning_rate": 8.47685796264195e-05, |
| "loss": 0.113, |
| "mean_token_accuracy": 0.9688459932804108, |
| "num_tokens": 2771471.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.17692820727825165, |
| "learning_rate": 8.339622956046417e-05, |
| "loss": 0.1163, |
| "mean_token_accuracy": 0.9676001965999603, |
| "num_tokens": 2791343.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.14758412539958954, |
| "learning_rate": 8.202708785082121e-05, |
| "loss": 0.1528, |
| "mean_token_accuracy": 0.9607497751712799, |
| "num_tokens": 2810844.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.2107594609260559, |
| "learning_rate": 8.066141905754723e-05, |
| "loss": 0.1232, |
| "mean_token_accuracy": 0.9672644436359406, |
| "num_tokens": 2831746.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.14881309866905212, |
| "learning_rate": 7.929948706962508e-05, |
| "loss": 0.1045, |
| "mean_token_accuracy": 0.971291571855545, |
| "num_tokens": 2853450.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.17492781579494476, |
| "learning_rate": 7.794155505397261e-05, |
| "loss": 0.1216, |
| "mean_token_accuracy": 0.9665966033935547, |
| "num_tokens": 2873410.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.15295670926570892, |
| "learning_rate": 7.658788540459062e-05, |
| "loss": 0.0897, |
| "mean_token_accuracy": 0.9743934571743011, |
| "num_tokens": 2894318.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.12950226664543152, |
| "learning_rate": 7.523873969186039e-05, |
| "loss": 0.1119, |
| "mean_token_accuracy": 0.9689730405807495, |
| "num_tokens": 2912886.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.1793074905872345, |
| "learning_rate": 7.389437861200024e-05, |
| "loss": 0.1131, |
| "mean_token_accuracy": 0.9701094329357147, |
| "num_tokens": 2932155.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.1540454626083374, |
| "learning_rate": 7.25550619366911e-05, |
| "loss": 0.1142, |
| "mean_token_accuracy": 0.969739556312561, |
| "num_tokens": 2954884.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.15937185287475586, |
| "learning_rate": 7.122104846288064e-05, |
| "loss": 0.128, |
| "mean_token_accuracy": 0.9650757312774658, |
| "num_tokens": 2976191.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.15609461069107056, |
| "learning_rate": 6.989259596277582e-05, |
| "loss": 0.0999, |
| "mean_token_accuracy": 0.9722784161567688, |
| "num_tokens": 2996633.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.1675417721271515, |
| "learning_rate": 6.85699611340333e-05, |
| "loss": 0.1058, |
| "mean_token_accuracy": 0.9703787863254547, |
| "num_tokens": 3017723.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.19539587199687958, |
| "learning_rate": 6.725339955015777e-05, |
| "loss": 0.1354, |
| "mean_token_accuracy": 0.96318119764328, |
| "num_tokens": 3037762.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.13168184459209442, |
| "learning_rate": 6.594316561111724e-05, |
| "loss": 0.1005, |
| "mean_token_accuracy": 0.9725645482540131, |
| "num_tokens": 3058329.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.1617504358291626, |
| "learning_rate": 6.46395124941851e-05, |
| "loss": 0.136, |
| "mean_token_accuracy": 0.9640224277973175, |
| "num_tokens": 3079340.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.16531525552272797, |
| "learning_rate": 6.334269210501875e-05, |
| "loss": 0.1195, |
| "mean_token_accuracy": 0.9680073857307434, |
| "num_tokens": 3099670.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.22178637981414795, |
| "learning_rate": 6.205295502898348e-05, |
| "loss": 0.1281, |
| "mean_token_accuracy": 0.9676016867160797, |
| "num_tokens": 3119491.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.18001458048820496, |
| "learning_rate": 6.0770550482731924e-05, |
| "loss": 0.1079, |
| "mean_token_accuracy": 0.9712074995040894, |
| "num_tokens": 3139513.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.1498527079820633, |
| "learning_rate": 5.9495726266047605e-05, |
| "loss": 0.1042, |
| "mean_token_accuracy": 0.9726397097110748, |
| "num_tokens": 3160672.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.1454562097787857, |
| "learning_rate": 5.8228728713962543e-05, |
| "loss": 0.1103, |
| "mean_token_accuracy": 0.9712657034397125, |
| "num_tokens": 3182484.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.19215665757656097, |
| "learning_rate": 5.696980264915777e-05, |
| "loss": 0.0922, |
| "mean_token_accuracy": 0.9748160243034363, |
| "num_tokens": 3203367.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.14836356043815613, |
| "learning_rate": 5.571919133465605e-05, |
| "loss": 0.1049, |
| "mean_token_accuracy": 0.9711067080497742, |
| "num_tokens": 3225455.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.1734013706445694, |
| "learning_rate": 5.447713642681612e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.9732925593852997, |
| "num_tokens": 3246222.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.13410215079784393, |
| "learning_rate": 5.324387792863719e-05, |
| "loss": 0.1118, |
| "mean_token_accuracy": 0.9705207347869873, |
| "num_tokens": 3268819.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.19894972443580627, |
| "learning_rate": 5.201965414338308e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9756550192832947, |
| "num_tokens": 3278011.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.13745059072971344, |
| "learning_rate": 5.080470162853472e-05, |
| "loss": 0.0994, |
| "mean_token_accuracy": 0.9729433953762054, |
| "num_tokens": 3299349.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 0.1536296308040619, |
| "learning_rate": 4.959925515008002e-05, |
| "loss": 0.0976, |
| "mean_token_accuracy": 0.973717212677002, |
| "num_tokens": 3319814.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.14658384025096893, |
| "learning_rate": 4.840354763714991e-05, |
| "loss": 0.0966, |
| "mean_token_accuracy": 0.9740248918533325, |
| "num_tokens": 3341791.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.12013503909111023, |
| "learning_rate": 4.7217810137009274e-05, |
| "loss": 0.0783, |
| "mean_token_accuracy": 0.9775272607803345, |
| "num_tokens": 3362482.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.13740386068820953, |
| "learning_rate": 4.604227177041156e-05, |
| "loss": 0.0829, |
| "mean_token_accuracy": 0.9774322211742401, |
| "num_tokens": 3383265.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.1289196014404297, |
| "learning_rate": 4.487715968732568e-05, |
| "loss": 0.073, |
| "mean_token_accuracy": 0.9784163534641266, |
| "num_tokens": 3405772.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.1675165295600891, |
| "learning_rate": 4.372269902304363e-05, |
| "loss": 0.0875, |
| "mean_token_accuracy": 0.9745315313339233, |
| "num_tokens": 3426008.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.16612502932548523, |
| "learning_rate": 4.257911285467754e-05, |
| "loss": 0.0861, |
| "mean_token_accuracy": 0.9750963449478149, |
| "num_tokens": 3445583.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.24531899392604828, |
| "learning_rate": 4.144662215805426e-05, |
| "loss": 0.0845, |
| "mean_token_accuracy": 0.9756963849067688, |
| "num_tokens": 3465685.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.165582075715065, |
| "learning_rate": 4.0325445765016145e-05, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9772799611091614, |
| "num_tokens": 3486747.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.20452290773391724, |
| "learning_rate": 3.921580032113602e-05, |
| "loss": 0.1093, |
| "mean_token_accuracy": 0.9696950614452362, |
| "num_tokens": 3507170.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.22140122950077057, |
| "learning_rate": 3.8117900243854595e-05, |
| "loss": 0.0932, |
| "mean_token_accuracy": 0.9731378257274628, |
| "num_tokens": 3528688.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.14823046326637268, |
| "learning_rate": 3.7031957681048604e-05, |
| "loss": 0.0787, |
| "mean_token_accuracy": 0.978544145822525, |
| "num_tokens": 3551493.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.18386752903461456, |
| "learning_rate": 3.595818247003713e-05, |
| "loss": 0.0911, |
| "mean_token_accuracy": 0.9754537045955658, |
| "num_tokens": 3573241.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.14411669969558716, |
| "learning_rate": 3.489678209703475e-05, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9779654443264008, |
| "num_tokens": 3592020.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.1390937715768814, |
| "learning_rate": 3.3847961657058845e-05, |
| "loss": 0.0773, |
| "mean_token_accuracy": 0.9773176610469818, |
| "num_tokens": 3612923.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.1446724385023117, |
| "learning_rate": 3.281192381429894e-05, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9771729111671448, |
| "num_tokens": 3633033.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.1646534949541092, |
| "learning_rate": 3.178886876295578e-05, |
| "loss": 0.0856, |
| "mean_token_accuracy": 0.976368248462677, |
| "num_tokens": 3653549.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.14741237461566925, |
| "learning_rate": 3.077899418855772e-05, |
| "loss": 0.0725, |
| "mean_token_accuracy": 0.9795258343219757, |
| "num_tokens": 3676404.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.12899887561798096, |
| "learning_rate": 2.9782495229761808e-05, |
| "loss": 0.0695, |
| "mean_token_accuracy": 0.9794414341449738, |
| "num_tokens": 3696514.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.1296052187681198, |
| "learning_rate": 2.879956444064703e-05, |
| "loss": 0.07, |
| "mean_token_accuracy": 0.9783405065536499, |
| "num_tokens": 3716614.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.17682477831840515, |
| "learning_rate": 2.783039175350699e-05, |
| "loss": 0.0899, |
| "mean_token_accuracy": 0.9737552106380463, |
| "num_tokens": 3734545.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.150472953915596, |
| "learning_rate": 2.6875164442149147e-05, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9762512743473053, |
| "num_tokens": 3755770.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.1425381898880005, |
| "learning_rate": 2.5934067085707834e-05, |
| "loss": 0.0741, |
| "mean_token_accuracy": 0.9798364341259003, |
| "num_tokens": 3778378.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.13129480183124542, |
| "learning_rate": 2.500728153297788e-05, |
| "loss": 0.0736, |
| "mean_token_accuracy": 0.9784353077411652, |
| "num_tokens": 3799187.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.1579660028219223, |
| "learning_rate": 2.409498686727587e-05, |
| "loss": 0.0839, |
| "mean_token_accuracy": 0.9769056141376495, |
| "num_tokens": 3821803.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.13841375708580017, |
| "learning_rate": 2.3197359371835802e-05, |
| "loss": 0.0729, |
| "mean_token_accuracy": 0.9776602387428284, |
| "num_tokens": 3842009.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.14079244434833527, |
| "learning_rate": 2.2314572495745746e-05, |
| "loss": 0.0745, |
| "mean_token_accuracy": 0.978991687297821, |
| "num_tokens": 3861386.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.1590651422739029, |
| "learning_rate": 2.1446796820432167e-05, |
| "loss": 0.0782, |
| "mean_token_accuracy": 0.9771281480789185, |
| "num_tokens": 3880797.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.143194317817688, |
| "learning_rate": 2.0594200026698363e-05, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.9773141145706177, |
| "num_tokens": 3903019.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.13460594415664673, |
| "learning_rate": 1.9756946862323535e-05, |
| "loss": 0.0721, |
| "mean_token_accuracy": 0.97975093126297, |
| "num_tokens": 3924784.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.13424114882946014, |
| "learning_rate": 1.8935199110228275e-05, |
| "loss": 0.0734, |
| "mean_token_accuracy": 0.9811668992042542, |
| "num_tokens": 3948108.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.17168937623500824, |
| "learning_rate": 1.8129115557213262e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9771130979061127, |
| "num_tokens": 3969333.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.13767112791538239, |
| "learning_rate": 1.7338851963276825e-05, |
| "loss": 0.0736, |
| "mean_token_accuracy": 0.9778575003147125, |
| "num_tokens": 3989403.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.18789297342300415, |
| "learning_rate": 1.656456103151728e-05, |
| "loss": 0.0924, |
| "mean_token_accuracy": 0.9723543524742126, |
| "num_tokens": 4010821.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.1507100760936737, |
| "learning_rate": 1.580639237862608e-05, |
| "loss": 0.0764, |
| "mean_token_accuracy": 0.97721067070961, |
| "num_tokens": 4030537.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.18637511134147644, |
| "learning_rate": 1.5064492505977234e-05, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.9756501317024231, |
| "num_tokens": 4048731.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.17008532583713531, |
| "learning_rate": 1.433900477131882e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9770023822784424, |
| "num_tokens": 4068414.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.14089594781398773, |
| "learning_rate": 1.363006936107183e-05, |
| "loss": 0.0666, |
| "mean_token_accuracy": 0.9802176356315613, |
| "num_tokens": 4089906.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.1633421629667282, |
| "learning_rate": 1.29378232632419e-05, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9769896566867828, |
| "num_tokens": 4110825.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.148310124874115, |
| "learning_rate": 1.2262400240949023e-05, |
| "loss": 0.0866, |
| "mean_token_accuracy": 0.9763473868370056, |
| "num_tokens": 4130116.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.14359574019908905, |
| "learning_rate": 1.1603930806580444e-05, |
| "loss": 0.0744, |
| "mean_token_accuracy": 0.9773200452327728, |
| "num_tokens": 4151296.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.15275435149669647, |
| "learning_rate": 1.0962542196571634e-05, |
| "loss": 0.0783, |
| "mean_token_accuracy": 0.9785310328006744, |
| "num_tokens": 4172098.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.16805951297283173, |
| "learning_rate": 1.0338358346820353e-05, |
| "loss": 0.0837, |
| "mean_token_accuracy": 0.9770323634147644, |
| "num_tokens": 4193109.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.14101877808570862, |
| "learning_rate": 9.731499868738447e-06, |
| "loss": 0.0763, |
| "mean_token_accuracy": 0.9785304367542267, |
| "num_tokens": 4215347.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.15893617272377014, |
| "learning_rate": 9.142084025945984e-06, |
| "loss": 0.0772, |
| "mean_token_accuracy": 0.978299617767334, |
| "num_tokens": 4236346.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.14236551523208618, |
| "learning_rate": 8.570224711612385e-06, |
| "loss": 0.0715, |
| "mean_token_accuracy": 0.9786622226238251, |
| "num_tokens": 4258638.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.17728912830352783, |
| "learning_rate": 8.016032426448817e-06, |
| "loss": 0.0855, |
| "mean_token_accuracy": 0.9760014414787292, |
| "num_tokens": 4279271.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.19720520079135895, |
| "learning_rate": 7.479614257355971e-06, |
| "loss": 0.0833, |
| "mean_token_accuracy": 0.9759804606437683, |
| "num_tokens": 4299151.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.14556831121444702, |
| "learning_rate": 6.961073856731648e-06, |
| "loss": 0.0737, |
| "mean_token_accuracy": 0.9779518842697144, |
| "num_tokens": 4320704.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.16077663004398346, |
| "learning_rate": 6.460511422441984e-06, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9782223701477051, |
| "num_tokens": 4339704.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.15406979620456696, |
| "learning_rate": 5.978023678460099e-06, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.977834552526474, |
| "num_tokens": 4359021.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.16407983005046844, |
| "learning_rate": 5.5137038561761115e-06, |
| "loss": 0.0837, |
| "mean_token_accuracy": 0.9751948714256287, |
| "num_tokens": 4379725.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.13812731206417084, |
| "learning_rate": 5.067641676381918e-06, |
| "loss": 0.0718, |
| "mean_token_accuracy": 0.977728933095932, |
| "num_tokens": 4402644.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.16759884357452393, |
| "learning_rate": 4.639923331934471e-06, |
| "loss": 0.077, |
| "mean_token_accuracy": 0.9772835969924927, |
| "num_tokens": 4423503.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.1482495367527008, |
| "learning_rate": 4.230631471100655e-06, |
| "loss": 0.0783, |
| "mean_token_accuracy": 0.9765441417694092, |
| "num_tokens": 4445353.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.1537255495786667, |
| "learning_rate": 3.839845181587098e-06, |
| "loss": 0.0845, |
| "mean_token_accuracy": 0.9765470325946808, |
| "num_tokens": 4467140.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.19450800120830536, |
| "learning_rate": 3.467639975257997e-06, |
| "loss": 0.0907, |
| "mean_token_accuracy": 0.9742664694786072, |
| "num_tokens": 4486775.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.16700267791748047, |
| "learning_rate": 3.1140877735439387e-06, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.976231724023819, |
| "num_tokens": 4507937.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.1603633612394333, |
| "learning_rate": 2.7792568935444796e-06, |
| "loss": 0.0823, |
| "mean_token_accuracy": 0.976065456867218, |
| "num_tokens": 4527826.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.14653527736663818, |
| "learning_rate": 2.4632120348272003e-06, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9774307906627655, |
| "num_tokens": 4550667.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.15313751995563507, |
| "learning_rate": 2.166014266925731e-06, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9767453074455261, |
| "num_tokens": 4570173.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.13249285519123077, |
| "learning_rate": 1.88772101753929e-06, |
| "loss": 0.0741, |
| "mean_token_accuracy": 0.9789757132530212, |
| "num_tokens": 4590375.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.14562749862670898, |
| "learning_rate": 1.6283860614358936e-06, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.9768469035625458, |
| "num_tokens": 4611934.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.15164901316165924, |
| "learning_rate": 1.3880595100613792e-06, |
| "loss": 0.076, |
| "mean_token_accuracy": 0.9793215095996857, |
| "num_tokens": 4634831.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.14515450596809387, |
| "learning_rate": 1.1667878018564171e-06, |
| "loss": 0.0759, |
| "mean_token_accuracy": 0.9793158173561096, |
| "num_tokens": 4654825.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.15432044863700867, |
| "learning_rate": 9.64613693283123e-07, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9766505062580109, |
| "num_tokens": 4676000.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.1555798053741455, |
| "learning_rate": 7.815762505632096e-07, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.9778449833393097, |
| "num_tokens": 4695897.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.16175790131092072, |
| "learning_rate": 6.177108421292266e-07, |
| "loss": 0.086, |
| "mean_token_accuracy": 0.9760761559009552, |
| "num_tokens": 4716551.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.13542035222053528, |
| "learning_rate": 4.7304913179025965e-07, |
| "loss": 0.0734, |
| "mean_token_accuracy": 0.979287177324295, |
| "num_tokens": 4739406.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.1451287418603897, |
| "learning_rate": 3.4761907261356976e-07, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.977697491645813, |
| "num_tokens": 4760092.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.1680404543876648, |
| "learning_rate": 2.414449015231357e-07, |
| "loss": 0.0934, |
| "mean_token_accuracy": 0.973942905664444, |
| "num_tokens": 4780982.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.19171962141990662, |
| "learning_rate": 1.545471346164007e-07, |
| "loss": 0.0939, |
| "mean_token_accuracy": 0.9738248884677887, |
| "num_tokens": 4801657.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.14699915051460266, |
| "learning_rate": 8.694256319987659e-08, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9780023992061615, |
| "num_tokens": 4821928.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.15162605047225952, |
| "learning_rate": 3.8644250544594975e-08, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.9769730567932129, |
| "num_tokens": 4845265.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.19175927340984344, |
| "learning_rate": 9.661529361892907e-09, |
| "loss": 0.086, |
| "mean_token_accuracy": 0.9761645793914795, |
| "num_tokens": 4864834.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "step": 234, |
| "total_flos": 3.895828387117138e+17, |
| "train_loss": 0.19240072863096866, |
| "train_runtime": 1091.7173, |
| "train_samples_per_second": 13.74, |
| "train_steps_per_second": 0.214 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 234, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 3.895828387117138e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|