| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 4.942675159235669, |
| "eval_steps": 500, |
| "global_step": 390, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 3.7824301719665527, |
| "learning_rate": 0.0, |
| "loss": 1.2233, |
| "mean_token_accuracy": 0.8302195966243744, |
| "num_tokens": 5210.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 3.9117865562438965, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 1.2964, |
| "mean_token_accuracy": 0.818906307220459, |
| "num_tokens": 10552.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 3.2288713455200195, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 1.1763, |
| "mean_token_accuracy": 0.8304943442344666, |
| "num_tokens": 15783.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 2.576040029525757, |
| "learning_rate": 5e-05, |
| "loss": 0.9544, |
| "mean_token_accuracy": 0.8481430411338806, |
| "num_tokens": 21055.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 1.6133369207382202, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 0.7482, |
| "mean_token_accuracy": 0.8650574088096619, |
| "num_tokens": 26525.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 0.8690425753593445, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 0.5017, |
| "mean_token_accuracy": 0.8963637351989746, |
| "num_tokens": 31775.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 0.674253523349762, |
| "learning_rate": 0.0001, |
| "loss": 0.4655, |
| "mean_token_accuracy": 0.8968947529792786, |
| "num_tokens": 37075.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 0.5956063866615295, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 0.4192, |
| "mean_token_accuracy": 0.8946096897125244, |
| "num_tokens": 42353.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 0.5653583407402039, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 0.3808, |
| "mean_token_accuracy": 0.9010607898235321, |
| "num_tokens": 47529.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 0.531235933303833, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.3412, |
| "mean_token_accuracy": 0.9112062156200409, |
| "num_tokens": 52843.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 0.45494160056114197, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 0.2764, |
| "mean_token_accuracy": 0.9187242984771729, |
| "num_tokens": 57941.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 0.44628530740737915, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 0.2744, |
| "mean_token_accuracy": 0.9186911284923553, |
| "num_tokens": 63062.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 0.3284648656845093, |
| "learning_rate": 0.0002, |
| "loss": 0.2801, |
| "mean_token_accuracy": 0.9165399074554443, |
| "num_tokens": 68111.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 0.37082329392433167, |
| "learning_rate": 0.0001999965463076377, |
| "loss": 0.3087, |
| "mean_token_accuracy": 0.9133042097091675, |
| "num_tokens": 73237.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.3130003809928894, |
| "learning_rate": 0.00019998618546911056, |
| "loss": 0.2477, |
| "mean_token_accuracy": 0.9158357977867126, |
| "num_tokens": 78491.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.3563134968280792, |
| "learning_rate": 0.00019996891820008164, |
| "loss": 0.282, |
| "mean_token_accuracy": 0.912090390920639, |
| "num_tokens": 83703.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 0.29488661885261536, |
| "learning_rate": 0.00019994474569326757, |
| "loss": 0.2589, |
| "mean_token_accuracy": 0.9159494936466217, |
| "num_tokens": 88876.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.29270514845848083, |
| "learning_rate": 0.00019991366961835642, |
| "loss": 0.2396, |
| "mean_token_accuracy": 0.921425074338913, |
| "num_tokens": 93966.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 0.27681994438171387, |
| "learning_rate": 0.00019987569212189224, |
| "loss": 0.2243, |
| "mean_token_accuracy": 0.9262824356555939, |
| "num_tokens": 99078.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.29514309763908386, |
| "learning_rate": 0.00019983081582712685, |
| "loss": 0.2013, |
| "mean_token_accuracy": 0.9278378784656525, |
| "num_tokens": 104362.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.3255820870399475, |
| "learning_rate": 0.0001997790438338385, |
| "loss": 0.2071, |
| "mean_token_accuracy": 0.928867369890213, |
| "num_tokens": 109431.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.24862290918827057, |
| "learning_rate": 0.00019972037971811802, |
| "loss": 0.1889, |
| "mean_token_accuracy": 0.9348132014274597, |
| "num_tokens": 114757.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.33368730545043945, |
| "learning_rate": 0.00019965482753212156, |
| "loss": 0.2195, |
| "mean_token_accuracy": 0.927293449640274, |
| "num_tokens": 119944.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.27442213892936707, |
| "learning_rate": 0.0001995823918037908, |
| "loss": 0.2068, |
| "mean_token_accuracy": 0.9322147965431213, |
| "num_tokens": 125131.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.2690294682979584, |
| "learning_rate": 0.00019950307753654017, |
| "loss": 0.1975, |
| "mean_token_accuracy": 0.9335231781005859, |
| "num_tokens": 130305.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.23441526293754578, |
| "learning_rate": 0.0001994168902089112, |
| "loss": 0.176, |
| "mean_token_accuracy": 0.9373516738414764, |
| "num_tokens": 135592.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.257511168718338, |
| "learning_rate": 0.00019932383577419432, |
| "loss": 0.1991, |
| "mean_token_accuracy": 0.9299597442150116, |
| "num_tokens": 140754.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.23336845636367798, |
| "learning_rate": 0.00019922392066001722, |
| "loss": 0.1838, |
| "mean_token_accuracy": 0.9314956963062286, |
| "num_tokens": 145828.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.25471892952919006, |
| "learning_rate": 0.0001991171517679013, |
| "loss": 0.1911, |
| "mean_token_accuracy": 0.933700293302536, |
| "num_tokens": 151081.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.2571130394935608, |
| "learning_rate": 0.00019900353647278466, |
| "loss": 0.1908, |
| "mean_token_accuracy": 0.9333758354187012, |
| "num_tokens": 156157.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.28059864044189453, |
| "learning_rate": 0.00019888308262251285, |
| "loss": 0.1861, |
| "mean_token_accuracy": 0.9347586631774902, |
| "num_tokens": 161402.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.22686001658439636, |
| "learning_rate": 0.00019875579853729676, |
| "loss": 0.1769, |
| "mean_token_accuracy": 0.93821582198143, |
| "num_tokens": 166536.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.20812684297561646, |
| "learning_rate": 0.00019862169300913785, |
| "loss": 0.163, |
| "mean_token_accuracy": 0.9406305253505707, |
| "num_tokens": 171906.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.3466432988643646, |
| "learning_rate": 0.00019848077530122083, |
| "loss": 0.1831, |
| "mean_token_accuracy": 0.9393357038497925, |
| "num_tokens": 177080.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.21919341385364532, |
| "learning_rate": 0.00019833305514727395, |
| "loss": 0.1669, |
| "mean_token_accuracy": 0.9385254979133606, |
| "num_tokens": 182316.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.2825665771961212, |
| "learning_rate": 0.0001981785427508966, |
| "loss": 0.1708, |
| "mean_token_accuracy": 0.9377457201480865, |
| "num_tokens": 187617.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.23675024509429932, |
| "learning_rate": 0.00019801724878485438, |
| "loss": 0.1711, |
| "mean_token_accuracy": 0.9380519986152649, |
| "num_tokens": 192716.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.25276389718055725, |
| "learning_rate": 0.00019784918439034216, |
| "loss": 0.1611, |
| "mean_token_accuracy": 0.9403159916400909, |
| "num_tokens": 197979.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.23940987884998322, |
| "learning_rate": 0.00019767436117621413, |
| "loss": 0.1638, |
| "mean_token_accuracy": 0.936554491519928, |
| "num_tokens": 203088.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.20817831158638, |
| "learning_rate": 0.00019749279121818235, |
| "loss": 0.1539, |
| "mean_token_accuracy": 0.9392144680023193, |
| "num_tokens": 208270.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.21488814055919647, |
| "learning_rate": 0.00019730448705798239, |
| "loss": 0.1635, |
| "mean_token_accuracy": 0.940779834985733, |
| "num_tokens": 213525.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.23421017825603485, |
| "learning_rate": 0.000197109461702507, |
| "loss": 0.1496, |
| "mean_token_accuracy": 0.9416719675064087, |
| "num_tokens": 218891.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.258142352104187, |
| "learning_rate": 0.0001969077286229078, |
| "loss": 0.1691, |
| "mean_token_accuracy": 0.934789776802063, |
| "num_tokens": 224040.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.2293170988559723, |
| "learning_rate": 0.00019669930175366472, |
| "loss": 0.1577, |
| "mean_token_accuracy": 0.9377670586109161, |
| "num_tokens": 229247.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.24188922345638275, |
| "learning_rate": 0.00019648419549162348, |
| "loss": 0.1521, |
| "mean_token_accuracy": 0.9420928061008453, |
| "num_tokens": 234459.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.21200227737426758, |
| "learning_rate": 0.0001962624246950012, |
| "loss": 0.1527, |
| "mean_token_accuracy": 0.9398773610591888, |
| "num_tokens": 239713.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.19552259147167206, |
| "learning_rate": 0.00019603400468235998, |
| "loss": 0.1573, |
| "mean_token_accuracy": 0.9376706182956696, |
| "num_tokens": 244800.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.2834009826183319, |
| "learning_rate": 0.0001957989512315489, |
| "loss": 0.1577, |
| "mean_token_accuracy": 0.941499799489975, |
| "num_tokens": 250082.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.16560231149196625, |
| "learning_rate": 0.0001955572805786141, |
| "loss": 0.1465, |
| "mean_token_accuracy": 0.9433980286121368, |
| "num_tokens": 255252.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.21149985492229462, |
| "learning_rate": 0.0001953090094166773, |
| "loss": 0.1625, |
| "mean_token_accuracy": 0.9402491450309753, |
| "num_tokens": 260269.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.1948973536491394, |
| "learning_rate": 0.0001950541548947829, |
| "loss": 0.1493, |
| "mean_token_accuracy": 0.9446166753768921, |
| "num_tokens": 265479.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.19634638726711273, |
| "learning_rate": 0.0001947927346167132, |
| "loss": 0.151, |
| "mean_token_accuracy": 0.9424458146095276, |
| "num_tokens": 270804.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.1933320313692093, |
| "learning_rate": 0.00019452476663977248, |
| "loss": 0.1495, |
| "mean_token_accuracy": 0.9416649639606476, |
| "num_tokens": 276011.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.21446828544139862, |
| "learning_rate": 0.00019425026947353992, |
| "loss": 0.1466, |
| "mean_token_accuracy": 0.9454257786273956, |
| "num_tokens": 281225.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.19887098670005798, |
| "learning_rate": 0.00019396926207859084, |
| "loss": 0.157, |
| "mean_token_accuracy": 0.9424851536750793, |
| "num_tokens": 286422.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.1844012588262558, |
| "learning_rate": 0.0001936817638651871, |
| "loss": 0.144, |
| "mean_token_accuracy": 0.9469358026981354, |
| "num_tokens": 291678.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.18799826502799988, |
| "learning_rate": 0.00019338779469193639, |
| "loss": 0.1534, |
| "mean_token_accuracy": 0.9458630979061127, |
| "num_tokens": 296804.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.19042469561100006, |
| "learning_rate": 0.00019308737486442045, |
| "loss": 0.1545, |
| "mean_token_accuracy": 0.9410763680934906, |
| "num_tokens": 301857.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.158956378698349, |
| "learning_rate": 0.00019278052513379255, |
| "loss": 0.1379, |
| "mean_token_accuracy": 0.9460055828094482, |
| "num_tokens": 307051.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.1815986931324005, |
| "learning_rate": 0.00019246726669534415, |
| "loss": 0.1409, |
| "mean_token_accuracy": 0.9435812532901764, |
| "num_tokens": 312257.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.22261983156204224, |
| "learning_rate": 0.00019214762118704076, |
| "loss": 0.156, |
| "mean_token_accuracy": 0.9413077235221863, |
| "num_tokens": 317412.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.1710008829832077, |
| "learning_rate": 0.00019182161068802741, |
| "loss": 0.1378, |
| "mean_token_accuracy": 0.9503642618656158, |
| "num_tokens": 322734.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.3039683401584625, |
| "learning_rate": 0.00019148925771710347, |
| "loss": 0.1385, |
| "mean_token_accuracy": 0.9450577795505524, |
| "num_tokens": 328129.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.15925206243991852, |
| "learning_rate": 0.00019115058523116733, |
| "loss": 0.1311, |
| "mean_token_accuracy": 0.9462718069553375, |
| "num_tokens": 333272.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.1598874181509018, |
| "learning_rate": 0.0001908056166236305, |
| "loss": 0.1391, |
| "mean_token_accuracy": 0.946659117937088, |
| "num_tokens": 338420.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.18179531395435333, |
| "learning_rate": 0.00019045437572280194, |
| "loss": 0.1426, |
| "mean_token_accuracy": 0.945913702249527, |
| "num_tokens": 343626.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.17175814509391785, |
| "learning_rate": 0.0001900968867902419, |
| "loss": 0.132, |
| "mean_token_accuracy": 0.9485920369625092, |
| "num_tokens": 348845.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.1869221180677414, |
| "learning_rate": 0.00018973317451908642, |
| "loss": 0.1356, |
| "mean_token_accuracy": 0.9477656185626984, |
| "num_tokens": 354138.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.20954406261444092, |
| "learning_rate": 0.00018936326403234125, |
| "loss": 0.1454, |
| "mean_token_accuracy": 0.9445447623729706, |
| "num_tokens": 359314.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.1922268569469452, |
| "learning_rate": 0.0001889871808811469, |
| "loss": 0.1354, |
| "mean_token_accuracy": 0.9471762180328369, |
| "num_tokens": 364473.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.17652815580368042, |
| "learning_rate": 0.00018860495104301345, |
| "loss": 0.1376, |
| "mean_token_accuracy": 0.9477506279945374, |
| "num_tokens": 369703.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.23259028792381287, |
| "learning_rate": 0.00018821660092002641, |
| "loss": 0.1352, |
| "mean_token_accuracy": 0.9448699951171875, |
| "num_tokens": 374865.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.22274835407733917, |
| "learning_rate": 0.00018782215733702286, |
| "loss": 0.1466, |
| "mean_token_accuracy": 0.9414529800415039, |
| "num_tokens": 379986.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.2029760628938675, |
| "learning_rate": 0.00018742164753973855, |
| "loss": 0.1321, |
| "mean_token_accuracy": 0.9473606944084167, |
| "num_tokens": 385254.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.2057085484266281, |
| "learning_rate": 0.00018701509919292613, |
| "loss": 0.1368, |
| "mean_token_accuracy": 0.946168452501297, |
| "num_tokens": 390556.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.15876570343971252, |
| "learning_rate": 0.00018660254037844388, |
| "loss": 0.1295, |
| "mean_token_accuracy": 0.9503520429134369, |
| "num_tokens": 395877.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.17099611461162567, |
| "learning_rate": 0.0001861839995933164, |
| "loss": 0.1351, |
| "mean_token_accuracy": 0.9449459612369537, |
| "num_tokens": 400995.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.15932753682136536, |
| "learning_rate": 0.00018575950574776595, |
| "loss": 0.1295, |
| "mean_token_accuracy": 0.9448761940002441, |
| "num_tokens": 406243.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.15932753682136536, |
| "learning_rate": 0.00018532908816321558, |
| "loss": 0.1417, |
| "mean_token_accuracy": 0.9469307065010071, |
| "num_tokens": 408800.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.2659032642841339, |
| "learning_rate": 0.00018489277657026375, |
| "loss": 0.1304, |
| "mean_token_accuracy": 0.9467148184776306, |
| "num_tokens": 413872.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.14225730299949646, |
| "learning_rate": 0.0001844506011066308, |
| "loss": 0.1282, |
| "mean_token_accuracy": 0.9470857381820679, |
| "num_tokens": 419058.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.14326529204845428, |
| "learning_rate": 0.00018400259231507717, |
| "loss": 0.1257, |
| "mean_token_accuracy": 0.9480691254138947, |
| "num_tokens": 424398.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.18412485718727112, |
| "learning_rate": 0.00018354878114129367, |
| "loss": 0.1232, |
| "mean_token_accuracy": 0.9475138187408447, |
| "num_tokens": 429816.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.16766390204429626, |
| "learning_rate": 0.00018308919893176396, |
| "loss": 0.1234, |
| "mean_token_accuracy": 0.9507202506065369, |
| "num_tokens": 435036.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.14527039229869843, |
| "learning_rate": 0.0001826238774315995, |
| "loss": 0.1275, |
| "mean_token_accuracy": 0.9464537501335144, |
| "num_tokens": 440091.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.20255133509635925, |
| "learning_rate": 0.00018215284878234642, |
| "loss": 0.1424, |
| "mean_token_accuracy": 0.9444701671600342, |
| "num_tokens": 445081.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.1725914031267166, |
| "learning_rate": 0.00018167614551976567, |
| "loss": 0.1335, |
| "mean_token_accuracy": 0.9467510879039764, |
| "num_tokens": 450138.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.2247326523065567, |
| "learning_rate": 0.00018119380057158568, |
| "loss": 0.14, |
| "mean_token_accuracy": 0.9452223479747772, |
| "num_tokens": 455277.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.20980721712112427, |
| "learning_rate": 0.00018070584725522762, |
| "loss": 0.1289, |
| "mean_token_accuracy": 0.9489553868770599, |
| "num_tokens": 460438.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.14790885150432587, |
| "learning_rate": 0.0001802123192755044, |
| "loss": 0.1253, |
| "mean_token_accuracy": 0.9499755501747131, |
| "num_tokens": 465678.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.14694303274154663, |
| "learning_rate": 0.00017971325072229226, |
| "loss": 0.1205, |
| "mean_token_accuracy": 0.9478762447834015, |
| "num_tokens": 470920.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.1444869190454483, |
| "learning_rate": 0.00017920867606817625, |
| "loss": 0.1258, |
| "mean_token_accuracy": 0.9522562026977539, |
| "num_tokens": 476011.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.1662275493144989, |
| "learning_rate": 0.0001786986301660689, |
| "loss": 0.1282, |
| "mean_token_accuracy": 0.9508558809757233, |
| "num_tokens": 481122.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.12791097164154053, |
| "learning_rate": 0.000178183148246803, |
| "loss": 0.1323, |
| "mean_token_accuracy": 0.944861888885498, |
| "num_tokens": 486156.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.15323220193386078, |
| "learning_rate": 0.00017766226591669785, |
| "loss": 0.1293, |
| "mean_token_accuracy": 0.951024740934372, |
| "num_tokens": 491386.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.14362579584121704, |
| "learning_rate": 0.0001771360191551, |
| "loss": 0.1279, |
| "mean_token_accuracy": 0.9486364126205444, |
| "num_tokens": 496639.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.16863521933555603, |
| "learning_rate": 0.0001766044443118978, |
| "loss": 0.1304, |
| "mean_token_accuracy": 0.9472695589065552, |
| "num_tokens": 501899.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.14442408084869385, |
| "learning_rate": 0.00017606757810501088, |
| "loss": 0.1276, |
| "mean_token_accuracy": 0.9468772709369659, |
| "num_tokens": 506969.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.18459908664226532, |
| "learning_rate": 0.0001755254576178535, |
| "loss": 0.1288, |
| "mean_token_accuracy": 0.9511973857879639, |
| "num_tokens": 512177.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.15920302271842957, |
| "learning_rate": 0.00017497812029677344, |
| "loss": 0.125, |
| "mean_token_accuracy": 0.9510241746902466, |
| "num_tokens": 517503.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.14390042424201965, |
| "learning_rate": 0.00017442560394846516, |
| "loss": 0.1235, |
| "mean_token_accuracy": 0.9539001286029816, |
| "num_tokens": 522650.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.15696237981319427, |
| "learning_rate": 0.0001738679467373586, |
| "loss": 0.1294, |
| "mean_token_accuracy": 0.9488069415092468, |
| "num_tokens": 527850.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.14888447523117065, |
| "learning_rate": 0.00017330518718298264, |
| "loss": 0.1264, |
| "mean_token_accuracy": 0.9493102431297302, |
| "num_tokens": 533004.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.159367173910141, |
| "learning_rate": 0.00017273736415730488, |
| "loss": 0.1275, |
| "mean_token_accuracy": 0.947404533624649, |
| "num_tokens": 538199.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.12455767393112183, |
| "learning_rate": 0.0001721645168820462, |
| "loss": 0.1189, |
| "mean_token_accuracy": 0.9485114812850952, |
| "num_tokens": 543545.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.1362970769405365, |
| "learning_rate": 0.00017158668492597186, |
| "loss": 0.1239, |
| "mean_token_accuracy": 0.9471650719642639, |
| "num_tokens": 548699.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.10838621109724045, |
| "learning_rate": 0.00017100390820215804, |
| "loss": 0.1221, |
| "mean_token_accuracy": 0.9493043720722198, |
| "num_tokens": 553971.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.14165404438972473, |
| "learning_rate": 0.00017041622696523518, |
| "loss": 0.1219, |
| "mean_token_accuracy": 0.951966792345047, |
| "num_tokens": 559156.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.12003354728221893, |
| "learning_rate": 0.00016982368180860728, |
| "loss": 0.1188, |
| "mean_token_accuracy": 0.9512242674827576, |
| "num_tokens": 564284.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.11046839505434036, |
| "learning_rate": 0.00016922631366164797, |
| "loss": 0.1191, |
| "mean_token_accuracy": 0.9494934380054474, |
| "num_tokens": 569516.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.13339076936244965, |
| "learning_rate": 0.0001686241637868734, |
| "loss": 0.1186, |
| "mean_token_accuracy": 0.9493625164031982, |
| "num_tokens": 574816.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.15977565944194794, |
| "learning_rate": 0.00016801727377709194, |
| "loss": 0.1319, |
| "mean_token_accuracy": 0.9512809216976166, |
| "num_tokens": 580117.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.18785618245601654, |
| "learning_rate": 0.00016740568555253155, |
| "loss": 0.1203, |
| "mean_token_accuracy": 0.9501672685146332, |
| "num_tokens": 585339.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.13912543654441833, |
| "learning_rate": 0.00016678944135794374, |
| "loss": 0.1209, |
| "mean_token_accuracy": 0.9528982639312744, |
| "num_tokens": 590648.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.1673336625099182, |
| "learning_rate": 0.00016616858375968595, |
| "loss": 0.1278, |
| "mean_token_accuracy": 0.9478160440921783, |
| "num_tokens": 595944.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.13905712962150574, |
| "learning_rate": 0.000165543155642781, |
| "loss": 0.1235, |
| "mean_token_accuracy": 0.9476510584354401, |
| "num_tokens": 601036.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.2041148841381073, |
| "learning_rate": 0.0001649132002079552, |
| "loss": 0.1236, |
| "mean_token_accuracy": 0.9503988921642303, |
| "num_tokens": 606263.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.1707996129989624, |
| "learning_rate": 0.00016427876096865394, |
| "loss": 0.1245, |
| "mean_token_accuracy": 0.9471159875392914, |
| "num_tokens": 611452.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.15354764461517334, |
| "learning_rate": 0.00016363988174803638, |
| "loss": 0.1211, |
| "mean_token_accuracy": 0.9493577182292938, |
| "num_tokens": 616575.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.10961586982011795, |
| "learning_rate": 0.00016299660667594814, |
| "loss": 0.1189, |
| "mean_token_accuracy": 0.9515132904052734, |
| "num_tokens": 621819.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.165780708193779, |
| "learning_rate": 0.00016234898018587337, |
| "loss": 0.1228, |
| "mean_token_accuracy": 0.9477584362030029, |
| "num_tokens": 626913.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.1603623777627945, |
| "learning_rate": 0.00016169704701186527, |
| "loss": 0.1231, |
| "mean_token_accuracy": 0.9464293122291565, |
| "num_tokens": 632152.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.14159291982650757, |
| "learning_rate": 0.00016104085218545633, |
| "loss": 0.1258, |
| "mean_token_accuracy": 0.9506712853908539, |
| "num_tokens": 637425.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.11082585901021957, |
| "learning_rate": 0.00016038044103254775, |
| "loss": 0.1183, |
| "mean_token_accuracy": 0.9518589675426483, |
| "num_tokens": 642786.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.1823294758796692, |
| "learning_rate": 0.00015971585917027862, |
| "loss": 0.122, |
| "mean_token_accuracy": 0.9472161531448364, |
| "num_tokens": 647984.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.11483275145292282, |
| "learning_rate": 0.00015904715250387498, |
| "loss": 0.1262, |
| "mean_token_accuracy": 0.947608083486557, |
| "num_tokens": 653201.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.1607467085123062, |
| "learning_rate": 0.000158374367223479, |
| "loss": 0.1196, |
| "mean_token_accuracy": 0.954265683889389, |
| "num_tokens": 658517.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.10482734441757202, |
| "learning_rate": 0.0001576975498009583, |
| "loss": 0.1202, |
| "mean_token_accuracy": 0.9509238004684448, |
| "num_tokens": 663717.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.1322750598192215, |
| "learning_rate": 0.0001570167469866962, |
| "loss": 0.1185, |
| "mean_token_accuracy": 0.9499522149562836, |
| "num_tokens": 668899.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.10216841846704483, |
| "learning_rate": 0.0001563320058063622, |
| "loss": 0.117, |
| "mean_token_accuracy": 0.9509294629096985, |
| "num_tokens": 674100.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.1417446881532669, |
| "learning_rate": 0.00015564337355766412, |
| "loss": 0.1168, |
| "mean_token_accuracy": 0.9485281705856323, |
| "num_tokens": 679353.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.12658298015594482, |
| "learning_rate": 0.0001549508978070806, |
| "loss": 0.1146, |
| "mean_token_accuracy": 0.9511803686618805, |
| "num_tokens": 684663.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.11299584060907364, |
| "learning_rate": 0.00015425462638657595, |
| "loss": 0.1192, |
| "mean_token_accuracy": 0.9505378007888794, |
| "num_tokens": 689891.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.13253171741962433, |
| "learning_rate": 0.00015355460739029586, |
| "loss": 0.1205, |
| "mean_token_accuracy": 0.9539958238601685, |
| "num_tokens": 695197.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.14320266246795654, |
| "learning_rate": 0.00015285088917124556, |
| "loss": 0.123, |
| "mean_token_accuracy": 0.9514380991458893, |
| "num_tokens": 700335.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.1291801780462265, |
| "learning_rate": 0.0001521435203379498, |
| "loss": 0.1233, |
| "mean_token_accuracy": 0.9470665752887726, |
| "num_tokens": 705406.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.10977620631456375, |
| "learning_rate": 0.00015143254975109538, |
| "loss": 0.1198, |
| "mean_token_accuracy": 0.9482473433017731, |
| "num_tokens": 710535.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.1165376827120781, |
| "learning_rate": 0.0001507180265201559, |
| "loss": 0.1159, |
| "mean_token_accuracy": 0.9500870704650879, |
| "num_tokens": 715713.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.09521724283695221, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.1157, |
| "mean_token_accuracy": 0.9525724649429321, |
| "num_tokens": 720964.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.11171551793813705, |
| "learning_rate": 0.00014927851978748178, |
| "loss": 0.1164, |
| "mean_token_accuracy": 0.9490360617637634, |
| "num_tokens": 726071.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.09082835912704468, |
| "learning_rate": 0.00014855363571801523, |
| "loss": 0.1121, |
| "mean_token_accuracy": 0.9526254236698151, |
| "num_tokens": 731318.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.0980280190706253, |
| "learning_rate": 0.00014782539786213183, |
| "loss": 0.1141, |
| "mean_token_accuracy": 0.9535337686538696, |
| "num_tokens": 736504.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.09917044639587402, |
| "learning_rate": 0.00014709385652202203, |
| "loss": 0.1225, |
| "mean_token_accuracy": 0.94985231757164, |
| "num_tokens": 741575.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.10919863730669022, |
| "learning_rate": 0.00014635906222806058, |
| "loss": 0.1113, |
| "mean_token_accuracy": 0.9551882147789001, |
| "num_tokens": 746946.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.1464734524488449, |
| "learning_rate": 0.0001456210657353163, |
| "loss": 0.1174, |
| "mean_token_accuracy": 0.9487408995628357, |
| "num_tokens": 752294.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.130368173122406, |
| "learning_rate": 0.00014487991802004623, |
| "loss": 0.1211, |
| "mean_token_accuracy": 0.9474329650402069, |
| "num_tokens": 757381.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.11154960840940475, |
| "learning_rate": 0.0001441356702761744, |
| "loss": 0.1179, |
| "mean_token_accuracy": 0.9520448744297028, |
| "num_tokens": 762617.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.14685551822185516, |
| "learning_rate": 0.00014338837391175582, |
| "loss": 0.1206, |
| "mean_token_accuracy": 0.9540107548236847, |
| "num_tokens": 767864.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.12117283046245575, |
| "learning_rate": 0.0001426380805454254, |
| "loss": 0.1084, |
| "mean_token_accuracy": 0.9583871364593506, |
| "num_tokens": 773276.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.11210386455059052, |
| "learning_rate": 0.0001418848420028325, |
| "loss": 0.1151, |
| "mean_token_accuracy": 0.9484023153781891, |
| "num_tokens": 778515.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.11518337577581406, |
| "learning_rate": 0.00014112871031306119, |
| "loss": 0.1223, |
| "mean_token_accuracy": 0.9511970281600952, |
| "num_tokens": 783599.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.09871043264865875, |
| "learning_rate": 0.00014036973770503624, |
| "loss": 0.1177, |
| "mean_token_accuracy": 0.9499721825122833, |
| "num_tokens": 788755.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.10248729586601257, |
| "learning_rate": 0.0001396079766039157, |
| "loss": 0.1141, |
| "mean_token_accuracy": 0.9549025297164917, |
| "num_tokens": 794052.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.10185417532920837, |
| "learning_rate": 0.00013884347962746948, |
| "loss": 0.1154, |
| "mean_token_accuracy": 0.9485199749469757, |
| "num_tokens": 799324.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.10412627458572388, |
| "learning_rate": 0.00013807629958244498, |
| "loss": 0.1144, |
| "mean_token_accuracy": 0.9535442888736725, |
| "num_tokens": 804598.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.09640145301818848, |
| "learning_rate": 0.0001373064894609194, |
| "loss": 0.1144, |
| "mean_token_accuracy": 0.9523051679134369, |
| "num_tokens": 809991.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.12382632493972778, |
| "learning_rate": 0.00013653410243663952, |
| "loss": 0.118, |
| "mean_token_accuracy": 0.950864315032959, |
| "num_tokens": 815085.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.1575586348772049, |
| "learning_rate": 0.0001357591918613486, |
| "loss": 0.112, |
| "mean_token_accuracy": 0.9533618092536926, |
| "num_tokens": 817690.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.1542641818523407, |
| "learning_rate": 0.0001349818112611015, |
| "loss": 0.1125, |
| "mean_token_accuracy": 0.9523372650146484, |
| "num_tokens": 822995.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 0.10381153225898743, |
| "learning_rate": 0.00013420201433256689, |
| "loss": 0.11, |
| "mean_token_accuracy": 0.9508816599845886, |
| "num_tokens": 828255.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.0960901603102684, |
| "learning_rate": 0.00013341985493931877, |
| "loss": 0.1154, |
| "mean_token_accuracy": 0.9514484405517578, |
| "num_tokens": 833390.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.0993146151304245, |
| "learning_rate": 0.0001326353871081156, |
| "loss": 0.1138, |
| "mean_token_accuracy": 0.9487912058830261, |
| "num_tokens": 838553.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.10440049320459366, |
| "learning_rate": 0.00013184866502516845, |
| "loss": 0.1088, |
| "mean_token_accuracy": 0.9525078237056732, |
| "num_tokens": 843860.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.12403910607099533, |
| "learning_rate": 0.00013105974303239838, |
| "loss": 0.1127, |
| "mean_token_accuracy": 0.9510957598686218, |
| "num_tokens": 849076.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.11162856221199036, |
| "learning_rate": 0.0001302686756236826, |
| "loss": 0.1095, |
| "mean_token_accuracy": 0.957258552312851, |
| "num_tokens": 854384.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.09947948902845383, |
| "learning_rate": 0.00012947551744109043, |
| "loss": 0.1111, |
| "mean_token_accuracy": 0.9516081511974335, |
| "num_tokens": 859636.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.12568730115890503, |
| "learning_rate": 0.00012868032327110904, |
| "loss": 0.1128, |
| "mean_token_accuracy": 0.9562821388244629, |
| "num_tokens": 864827.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.15059728920459747, |
| "learning_rate": 0.00012788314804085903, |
| "loss": 0.1156, |
| "mean_token_accuracy": 0.9558725357055664, |
| "num_tokens": 870035.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.11143993586301804, |
| "learning_rate": 0.00012708404681430053, |
| "loss": 0.1135, |
| "mean_token_accuracy": 0.9555186331272125, |
| "num_tokens": 875272.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.14999280869960785, |
| "learning_rate": 0.00012628307478842953, |
| "loss": 0.1137, |
| "mean_token_accuracy": 0.9542877078056335, |
| "num_tokens": 880368.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.1020786389708519, |
| "learning_rate": 0.0001254802872894655, |
| "loss": 0.1132, |
| "mean_token_accuracy": 0.9493483901023865, |
| "num_tokens": 885550.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.13141581416130066, |
| "learning_rate": 0.00012467573976902935, |
| "loss": 0.1118, |
| "mean_token_accuracy": 0.9513366222381592, |
| "num_tokens": 890817.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.13585546612739563, |
| "learning_rate": 0.0001238694878003138, |
| "loss": 0.1118, |
| "mean_token_accuracy": 0.9503801763057709, |
| "num_tokens": 896078.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.15674127638339996, |
| "learning_rate": 0.00012306158707424403, |
| "loss": 0.1164, |
| "mean_token_accuracy": 0.9482068419456482, |
| "num_tokens": 901259.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.16721534729003906, |
| "learning_rate": 0.00012225209339563145, |
| "loss": 0.1152, |
| "mean_token_accuracy": 0.95207279920578, |
| "num_tokens": 906393.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.16014410555362701, |
| "learning_rate": 0.00012144106267931876, |
| "loss": 0.1113, |
| "mean_token_accuracy": 0.9518575370311737, |
| "num_tokens": 911516.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.10618874430656433, |
| "learning_rate": 0.00012062855094631778, |
| "loss": 0.1156, |
| "mean_token_accuracy": 0.9505187571048737, |
| "num_tokens": 916572.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.14721563458442688, |
| "learning_rate": 0.00011981461431993977, |
| "loss": 0.111, |
| "mean_token_accuracy": 0.9537347555160522, |
| "num_tokens": 921824.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.10303163528442383, |
| "learning_rate": 0.00011899930902191902, |
| "loss": 0.1124, |
| "mean_token_accuracy": 0.9502955079078674, |
| "num_tokens": 926978.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.1269257515668869, |
| "learning_rate": 0.00011818269136852909, |
| "loss": 0.1148, |
| "mean_token_accuracy": 0.9499041736125946, |
| "num_tokens": 932220.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.12417840957641602, |
| "learning_rate": 0.00011736481776669306, |
| "loss": 0.1157, |
| "mean_token_accuracy": 0.949295312166214, |
| "num_tokens": 937491.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.2725951075553894, |
| "learning_rate": 0.00011654574471008713, |
| "loss": 0.1097, |
| "mean_token_accuracy": 0.9541505873203278, |
| "num_tokens": 942876.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.14981700479984283, |
| "learning_rate": 0.00011572552877523854, |
| "loss": 0.1099, |
| "mean_token_accuracy": 0.9530862867832184, |
| "num_tokens": 948142.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.17998529970645905, |
| "learning_rate": 0.00011490422661761744, |
| "loss": 0.1111, |
| "mean_token_accuracy": 0.9553705453872681, |
| "num_tokens": 953361.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.18095913529396057, |
| "learning_rate": 0.00011408189496772368, |
| "loss": 0.1085, |
| "mean_token_accuracy": 0.9569565951824188, |
| "num_tokens": 958698.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.12876005470752716, |
| "learning_rate": 0.00011325859062716795, |
| "loss": 0.11, |
| "mean_token_accuracy": 0.9540988802909851, |
| "num_tokens": 963904.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.1892637312412262, |
| "learning_rate": 0.00011243437046474853, |
| "loss": 0.1124, |
| "mean_token_accuracy": 0.9509802162647247, |
| "num_tokens": 969068.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.10241339355707169, |
| "learning_rate": 0.00011160929141252303, |
| "loss": 0.1108, |
| "mean_token_accuracy": 0.9518979787826538, |
| "num_tokens": 974289.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.1427609920501709, |
| "learning_rate": 0.00011078341046187589, |
| "loss": 0.1094, |
| "mean_token_accuracy": 0.9557224214076996, |
| "num_tokens": 979548.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.12035023421049118, |
| "learning_rate": 0.00010995678465958168, |
| "loss": 0.1156, |
| "mean_token_accuracy": 0.9529212415218353, |
| "num_tokens": 984731.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.11421657353639603, |
| "learning_rate": 0.00010912947110386484, |
| "loss": 0.1158, |
| "mean_token_accuracy": 0.950139731168747, |
| "num_tokens": 989909.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.12608011066913605, |
| "learning_rate": 0.00010830152694045552, |
| "loss": 0.1118, |
| "mean_token_accuracy": 0.9534354209899902, |
| "num_tokens": 995130.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.176521435379982, |
| "learning_rate": 0.00010747300935864243, |
| "loss": 0.1184, |
| "mean_token_accuracy": 0.9504529535770416, |
| "num_tokens": 1000143.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 77.22000122070312, |
| "learning_rate": 0.00010664397558732244, |
| "loss": 0.1686, |
| "mean_token_accuracy": 0.9431236684322357, |
| "num_tokens": 1005201.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 3.9037532806396484, |
| "learning_rate": 0.00010581448289104758, |
| "loss": 0.1153, |
| "mean_token_accuracy": 0.9525106251239777, |
| "num_tokens": 1010256.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.08692986518144608, |
| "learning_rate": 0.00010498458856606972, |
| "loss": 0.1106, |
| "mean_token_accuracy": 0.9518369734287262, |
| "num_tokens": 1015347.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.1722182035446167, |
| "learning_rate": 0.00010415434993638269, |
| "loss": 0.1116, |
| "mean_token_accuracy": 0.9541844427585602, |
| "num_tokens": 1020700.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.07971198856830597, |
| "learning_rate": 0.00010332382434976266, |
| "loss": 0.1097, |
| "mean_token_accuracy": 0.9521732032299042, |
| "num_tokens": 1025991.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.3300648033618927, |
| "learning_rate": 0.0001024930691738073, |
| "loss": 0.1128, |
| "mean_token_accuracy": 0.9527797996997833, |
| "num_tokens": 1031201.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 2.3378825187683105, |
| "learning_rate": 0.00010166214179197264, |
| "loss": 0.1738, |
| "mean_token_accuracy": 0.9447502791881561, |
| "num_tokens": 1036370.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.1075408086180687, |
| "learning_rate": 0.00010083109959960973, |
| "loss": 0.1154, |
| "mean_token_accuracy": 0.951427161693573, |
| "num_tokens": 1041418.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.15424466133117676, |
| "learning_rate": 0.0001, |
| "loss": 0.1158, |
| "mean_token_accuracy": 0.9483841061592102, |
| "num_tokens": 1046481.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.131869375705719, |
| "learning_rate": 9.916890040039031e-05, |
| "loss": 0.1122, |
| "mean_token_accuracy": 0.9509872794151306, |
| "num_tokens": 1051665.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.13468806445598602, |
| "learning_rate": 9.833785820802739e-05, |
| "loss": 0.1116, |
| "mean_token_accuracy": 0.9532687067985535, |
| "num_tokens": 1057014.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.12996461987495422, |
| "learning_rate": 9.750693082619273e-05, |
| "loss": 0.107, |
| "mean_token_accuracy": 0.9560883641242981, |
| "num_tokens": 1062314.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.08511005342006683, |
| "learning_rate": 9.667617565023735e-05, |
| "loss": 0.1094, |
| "mean_token_accuracy": 0.953723281621933, |
| "num_tokens": 1067456.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.09277484565973282, |
| "learning_rate": 9.584565006361734e-05, |
| "loss": 0.1102, |
| "mean_token_accuracy": 0.9523052871227264, |
| "num_tokens": 1072700.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.10232524573802948, |
| "learning_rate": 9.501541143393028e-05, |
| "loss": 0.1068, |
| "mean_token_accuracy": 0.955791175365448, |
| "num_tokens": 1078034.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.10213851183652878, |
| "learning_rate": 9.418551710895243e-05, |
| "loss": 0.1169, |
| "mean_token_accuracy": 0.9503030478954315, |
| "num_tokens": 1083050.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.10190371423959732, |
| "learning_rate": 9.335602441267759e-05, |
| "loss": 0.1112, |
| "mean_token_accuracy": 0.953047126531601, |
| "num_tokens": 1088281.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.11229667067527771, |
| "learning_rate": 9.252699064135758e-05, |
| "loss": 0.1164, |
| "mean_token_accuracy": 0.9506237506866455, |
| "num_tokens": 1093435.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.08696591854095459, |
| "learning_rate": 9.169847305954447e-05, |
| "loss": 0.1107, |
| "mean_token_accuracy": 0.9544893801212311, |
| "num_tokens": 1098644.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.09480199962854385, |
| "learning_rate": 9.087052889613518e-05, |
| "loss": 0.1109, |
| "mean_token_accuracy": 0.9502566158771515, |
| "num_tokens": 1103775.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.09873849153518677, |
| "learning_rate": 9.004321534041835e-05, |
| "loss": 0.1094, |
| "mean_token_accuracy": 0.9538437724113464, |
| "num_tokens": 1109082.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.16237005591392517, |
| "learning_rate": 8.921658953812415e-05, |
| "loss": 0.1107, |
| "mean_token_accuracy": 0.9529086649417877, |
| "num_tokens": 1114250.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.08408457785844803, |
| "learning_rate": 8.839070858747697e-05, |
| "loss": 0.1134, |
| "mean_token_accuracy": 0.9480299949645996, |
| "num_tokens": 1119375.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.2315531224012375, |
| "learning_rate": 8.756562953525152e-05, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.95367431640625, |
| "num_tokens": 1124684.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.09821003675460815, |
| "learning_rate": 8.674140937283208e-05, |
| "loss": 0.1121, |
| "mean_token_accuracy": 0.9524604380130768, |
| "num_tokens": 1129903.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.08394256979227066, |
| "learning_rate": 8.591810503227635e-05, |
| "loss": 0.1058, |
| "mean_token_accuracy": 0.9550954103469849, |
| "num_tokens": 1135243.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.0909803956747055, |
| "learning_rate": 8.509577338238255e-05, |
| "loss": 0.1131, |
| "mean_token_accuracy": 0.9511939585208893, |
| "num_tokens": 1140430.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.0834677517414093, |
| "learning_rate": 8.427447122476148e-05, |
| "loss": 0.1138, |
| "mean_token_accuracy": 0.9512240588665009, |
| "num_tokens": 1145518.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.08603792637586594, |
| "learning_rate": 8.345425528991288e-05, |
| "loss": 0.1093, |
| "mean_token_accuracy": 0.9524519443511963, |
| "num_tokens": 1150818.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.12986299395561218, |
| "learning_rate": 8.263518223330697e-05, |
| "loss": 0.1083, |
| "mean_token_accuracy": 0.9532658159732819, |
| "num_tokens": 1156130.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.08395830541849136, |
| "learning_rate": 8.181730863147093e-05, |
| "loss": 0.1138, |
| "mean_token_accuracy": 0.9518845081329346, |
| "num_tokens": 1161182.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.1729099005460739, |
| "learning_rate": 8.100069097808103e-05, |
| "loss": 0.1156, |
| "mean_token_accuracy": 0.9514641165733337, |
| "num_tokens": 1166254.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.16455362737178802, |
| "learning_rate": 8.018538568006027e-05, |
| "loss": 0.1107, |
| "mean_token_accuracy": 0.9519481658935547, |
| "num_tokens": 1171502.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.07433055341243744, |
| "learning_rate": 7.937144905368226e-05, |
| "loss": 0.1069, |
| "mean_token_accuracy": 0.9540406763553619, |
| "num_tokens": 1176744.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.08446791768074036, |
| "learning_rate": 7.855893732068125e-05, |
| "loss": 0.1101, |
| "mean_token_accuracy": 0.9524591267108917, |
| "num_tokens": 1181989.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.0870402455329895, |
| "learning_rate": 7.774790660436858e-05, |
| "loss": 0.109, |
| "mean_token_accuracy": 0.9547540843486786, |
| "num_tokens": 1187312.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.08110392093658447, |
| "learning_rate": 7.693841292575598e-05, |
| "loss": 0.1134, |
| "mean_token_accuracy": 0.9487438499927521, |
| "num_tokens": 1192374.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.07331240177154541, |
| "learning_rate": 7.613051219968623e-05, |
| "loss": 0.1089, |
| "mean_token_accuracy": 0.9551816880702972, |
| "num_tokens": 1197504.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.06998025625944138, |
| "learning_rate": 7.532426023097063e-05, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9534473717212677, |
| "num_tokens": 1202857.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.07499606907367706, |
| "learning_rate": 7.451971271053455e-05, |
| "loss": 0.1101, |
| "mean_token_accuracy": 0.9513660669326782, |
| "num_tokens": 1208019.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.08685536682605743, |
| "learning_rate": 7.371692521157048e-05, |
| "loss": 0.1073, |
| "mean_token_accuracy": 0.9565198719501495, |
| "num_tokens": 1213375.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.980891719745223, |
| "grad_norm": 0.08383391052484512, |
| "learning_rate": 7.291595318569951e-05, |
| "loss": 0.1079, |
| "mean_token_accuracy": 0.9528385400772095, |
| "num_tokens": 1218678.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9936305732484074, |
| "grad_norm": 0.09736430644989014, |
| "learning_rate": 7.211685195914097e-05, |
| "loss": 0.1089, |
| "mean_token_accuracy": 0.951784610748291, |
| "num_tokens": 1223932.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.09736430644989014, |
| "learning_rate": 7.131967672889101e-05, |
| "loss": 0.1097, |
| "mean_token_accuracy": 0.9564379453659058, |
| "num_tokens": 1226558.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0127388535031847, |
| "grad_norm": 0.12066958844661713, |
| "learning_rate": 7.052448255890957e-05, |
| "loss": 0.11, |
| "mean_token_accuracy": 0.950747162103653, |
| "num_tokens": 1231687.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0254777070063694, |
| "grad_norm": 0.1692134290933609, |
| "learning_rate": 6.973132437631742e-05, |
| "loss": 0.1035, |
| "mean_token_accuracy": 0.9540812373161316, |
| "num_tokens": 1236936.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.038216560509554, |
| "grad_norm": 0.06671499460935593, |
| "learning_rate": 6.894025696760163e-05, |
| "loss": 0.1025, |
| "mean_token_accuracy": 0.9547434747219086, |
| "num_tokens": 1242302.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050955414012739, |
| "grad_norm": 0.0693930983543396, |
| "learning_rate": 6.815133497483157e-05, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.9553611278533936, |
| "num_tokens": 1247575.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0636942675159236, |
| "grad_norm": 0.07331426441669464, |
| "learning_rate": 6.736461289188445e-05, |
| "loss": 0.111, |
| "mean_token_accuracy": 0.9509542286396027, |
| "num_tokens": 1252615.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0764331210191083, |
| "grad_norm": 0.09026432782411575, |
| "learning_rate": 6.658014506068126e-05, |
| "loss": 0.1085, |
| "mean_token_accuracy": 0.9518916606903076, |
| "num_tokens": 1257709.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.089171974522293, |
| "grad_norm": 0.0691080093383789, |
| "learning_rate": 6.579798566743314e-05, |
| "loss": 0.1024, |
| "mean_token_accuracy": 0.9566259384155273, |
| "num_tokens": 1262980.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1019108280254777, |
| "grad_norm": 0.07958503067493439, |
| "learning_rate": 6.501818873889855e-05, |
| "loss": 0.1091, |
| "mean_token_accuracy": 0.9549121856689453, |
| "num_tokens": 1268116.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1146496815286624, |
| "grad_norm": 0.07630956918001175, |
| "learning_rate": 6.424080813865138e-05, |
| "loss": 0.106, |
| "mean_token_accuracy": 0.9562622308731079, |
| "num_tokens": 1273328.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.127388535031847, |
| "grad_norm": 0.07538638263940811, |
| "learning_rate": 6.34658975633605e-05, |
| "loss": 0.1058, |
| "mean_token_accuracy": 0.9536794424057007, |
| "num_tokens": 1278573.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.140127388535032, |
| "grad_norm": 0.07185419648885727, |
| "learning_rate": 6.269351053908061e-05, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.956435889005661, |
| "num_tokens": 1283847.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.1528662420382165, |
| "grad_norm": 0.08341516554355621, |
| "learning_rate": 6.192370041755505e-05, |
| "loss": 0.1073, |
| "mean_token_accuracy": 0.9528530836105347, |
| "num_tokens": 1288981.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1656050955414012, |
| "grad_norm": 0.07855644077062607, |
| "learning_rate": 6.115652037253053e-05, |
| "loss": 0.1055, |
| "mean_token_accuracy": 0.9546916782855988, |
| "num_tokens": 1294255.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.178343949044586, |
| "grad_norm": 0.08059215545654297, |
| "learning_rate": 6.039202339608432e-05, |
| "loss": 0.1054, |
| "mean_token_accuracy": 0.9560668766498566, |
| "num_tokens": 1299486.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.1910828025477707, |
| "grad_norm": 0.08181022852659225, |
| "learning_rate": 5.963026229496378e-05, |
| "loss": 0.1111, |
| "mean_token_accuracy": 0.9553267061710358, |
| "num_tokens": 1304437.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2038216560509554, |
| "grad_norm": 0.08100328594446182, |
| "learning_rate": 5.887128968693887e-05, |
| "loss": 0.109, |
| "mean_token_accuracy": 0.9509040117263794, |
| "num_tokens": 1309471.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.21656050955414, |
| "grad_norm": 0.08512415736913681, |
| "learning_rate": 5.8115157997167536e-05, |
| "loss": 0.1087, |
| "mean_token_accuracy": 0.9532097578048706, |
| "num_tokens": 1314603.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.229299363057325, |
| "grad_norm": 0.08154093474149704, |
| "learning_rate": 5.736191945457463e-05, |
| "loss": 0.1025, |
| "mean_token_accuracy": 0.9590216279029846, |
| "num_tokens": 1319916.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.2420382165605095, |
| "grad_norm": 0.08640050143003464, |
| "learning_rate": 5.6611626088244194e-05, |
| "loss": 0.1102, |
| "mean_token_accuracy": 0.9538323879241943, |
| "num_tokens": 1325115.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.254777070063694, |
| "grad_norm": 0.08790913224220276, |
| "learning_rate": 5.58643297238256e-05, |
| "loss": 0.1056, |
| "mean_token_accuracy": 0.9544298946857452, |
| "num_tokens": 1330383.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.267515923566879, |
| "grad_norm": 0.08440745621919632, |
| "learning_rate": 5.5120081979953785e-05, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.9548279345035553, |
| "num_tokens": 1335583.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.2802547770700636, |
| "grad_norm": 0.08989395946264267, |
| "learning_rate": 5.43789342646837e-05, |
| "loss": 0.1078, |
| "mean_token_accuracy": 0.9546796679496765, |
| "num_tokens": 1340769.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.2929936305732483, |
| "grad_norm": 0.0709109902381897, |
| "learning_rate": 5.3640937771939436e-05, |
| "loss": 0.1082, |
| "mean_token_accuracy": 0.9568992257118225, |
| "num_tokens": 1345904.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.305732484076433, |
| "grad_norm": 0.1291133016347885, |
| "learning_rate": 5.290614347797802e-05, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9526994228363037, |
| "num_tokens": 1351168.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3184713375796178, |
| "grad_norm": 0.07290786504745483, |
| "learning_rate": 5.217460213786821e-05, |
| "loss": 0.109, |
| "mean_token_accuracy": 0.9547650516033173, |
| "num_tokens": 1356428.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.3312101910828025, |
| "grad_norm": 0.08591271936893463, |
| "learning_rate": 5.1446364281984774e-05, |
| "loss": 0.1037, |
| "mean_token_accuracy": 0.9587284922599792, |
| "num_tokens": 1361775.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.343949044585987, |
| "grad_norm": 0.08994387835264206, |
| "learning_rate": 5.072148021251821e-05, |
| "loss": 0.1099, |
| "mean_token_accuracy": 0.9539965689182281, |
| "num_tokens": 1366926.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.356687898089172, |
| "grad_norm": 0.07574263960123062, |
| "learning_rate": 5.000000000000002e-05, |
| "loss": 0.1071, |
| "mean_token_accuracy": 0.9549139440059662, |
| "num_tokens": 1372136.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.3694267515923566, |
| "grad_norm": 0.07433713972568512, |
| "learning_rate": 4.92819734798441e-05, |
| "loss": 0.1086, |
| "mean_token_accuracy": 0.955206036567688, |
| "num_tokens": 1377357.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.3821656050955413, |
| "grad_norm": 0.07785839587450027, |
| "learning_rate": 4.856745024890466e-05, |
| "loss": 0.1035, |
| "mean_token_accuracy": 0.9549472033977509, |
| "num_tokens": 1382709.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.394904458598726, |
| "grad_norm": 0.08468873053789139, |
| "learning_rate": 4.78564796620502e-05, |
| "loss": 0.1105, |
| "mean_token_accuracy": 0.9527934193611145, |
| "num_tokens": 1387820.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4076433121019107, |
| "grad_norm": 0.07234114408493042, |
| "learning_rate": 4.7149110828754464e-05, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.9562168121337891, |
| "num_tokens": 1393297.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4203821656050954, |
| "grad_norm": 0.07486510276794434, |
| "learning_rate": 4.644539260970416e-05, |
| "loss": 0.1033, |
| "mean_token_accuracy": 0.9566996693611145, |
| "num_tokens": 1398625.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.43312101910828, |
| "grad_norm": 0.07534699141979218, |
| "learning_rate": 4.574537361342407e-05, |
| "loss": 0.1114, |
| "mean_token_accuracy": 0.9527919888496399, |
| "num_tokens": 1403629.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.445859872611465, |
| "grad_norm": 0.08369162678718567, |
| "learning_rate": 4.50491021929194e-05, |
| "loss": 0.1116, |
| "mean_token_accuracy": 0.9526659250259399, |
| "num_tokens": 1408724.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4585987261146496, |
| "grad_norm": 0.07841815799474716, |
| "learning_rate": 4.435662644233594e-05, |
| "loss": 0.1043, |
| "mean_token_accuracy": 0.9549655616283417, |
| "num_tokens": 1414006.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4713375796178343, |
| "grad_norm": 0.09484494477510452, |
| "learning_rate": 4.3667994193637796e-05, |
| "loss": 0.1054, |
| "mean_token_accuracy": 0.9525864720344543, |
| "num_tokens": 1419316.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.484076433121019, |
| "grad_norm": 0.07024021446704865, |
| "learning_rate": 4.298325301330383e-05, |
| "loss": 0.1054, |
| "mean_token_accuracy": 0.9536097049713135, |
| "num_tokens": 1424568.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4968152866242037, |
| "grad_norm": 0.06818420439958572, |
| "learning_rate": 4.23024501990417e-05, |
| "loss": 0.1102, |
| "mean_token_accuracy": 0.9506390392780304, |
| "num_tokens": 1429595.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5095541401273884, |
| "grad_norm": 0.07772965729236603, |
| "learning_rate": 4.1625632776521037e-05, |
| "loss": 0.1009, |
| "mean_token_accuracy": 0.9574998021125793, |
| "num_tokens": 1435023.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.522292993630573, |
| "grad_norm": 0.06488121300935745, |
| "learning_rate": 4.095284749612503e-05, |
| "loss": 0.106, |
| "mean_token_accuracy": 0.9521074295043945, |
| "num_tokens": 1440328.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.535031847133758, |
| "grad_norm": 0.07453517615795135, |
| "learning_rate": 4.028414082972141e-05, |
| "loss": 0.1054, |
| "mean_token_accuracy": 0.954413890838623, |
| "num_tokens": 1445571.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5477707006369426, |
| "grad_norm": 0.07654673606157303, |
| "learning_rate": 3.961955896745224e-05, |
| "loss": 0.106, |
| "mean_token_accuracy": 0.9553346335887909, |
| "num_tokens": 1450837.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5605095541401273, |
| "grad_norm": 0.06677993386983871, |
| "learning_rate": 3.89591478145437e-05, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.9563196003437042, |
| "num_tokens": 1456075.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.573248407643312, |
| "grad_norm": 0.07811679691076279, |
| "learning_rate": 3.8302952988134756e-05, |
| "loss": 0.1094, |
| "mean_token_accuracy": 0.9542314112186432, |
| "num_tokens": 1461230.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5859872611464967, |
| "grad_norm": 0.07797476649284363, |
| "learning_rate": 3.7651019814126654e-05, |
| "loss": 0.1066, |
| "mean_token_accuracy": 0.9561484158039093, |
| "num_tokens": 1466562.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5987261146496814, |
| "grad_norm": 0.068536177277565, |
| "learning_rate": 3.7003393324051874e-05, |
| "loss": 0.1085, |
| "mean_token_accuracy": 0.9561351835727692, |
| "num_tokens": 1471687.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.611464968152866, |
| "grad_norm": 0.08289831131696701, |
| "learning_rate": 3.6360118251963645e-05, |
| "loss": 0.1067, |
| "mean_token_accuracy": 0.9524477422237396, |
| "num_tokens": 1476904.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.624203821656051, |
| "grad_norm": 0.07308328151702881, |
| "learning_rate": 3.5721239031346066e-05, |
| "loss": 0.1063, |
| "mean_token_accuracy": 0.9520415663719177, |
| "num_tokens": 1482100.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.6369426751592355, |
| "grad_norm": 0.07325176149606705, |
| "learning_rate": 3.508679979204481e-05, |
| "loss": 0.1092, |
| "mean_token_accuracy": 0.9525676369667053, |
| "num_tokens": 1487266.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6496815286624202, |
| "grad_norm": 0.08290306478738785, |
| "learning_rate": 3.445684435721897e-05, |
| "loss": 0.1086, |
| "mean_token_accuracy": 0.9519762396812439, |
| "num_tokens": 1492492.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.662420382165605, |
| "grad_norm": 0.06719819456338882, |
| "learning_rate": 3.383141624031408e-05, |
| "loss": 0.1033, |
| "mean_token_accuracy": 0.954697459936142, |
| "num_tokens": 1497790.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.6751592356687897, |
| "grad_norm": 0.07050006091594696, |
| "learning_rate": 3.3210558642056275e-05, |
| "loss": 0.1064, |
| "mean_token_accuracy": 0.954306036233902, |
| "num_tokens": 1502956.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6878980891719744, |
| "grad_norm": 0.0685805082321167, |
| "learning_rate": 3.259431444746846e-05, |
| "loss": 0.103, |
| "mean_token_accuracy": 0.9540392458438873, |
| "num_tokens": 1508286.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.700636942675159, |
| "grad_norm": 0.06632719188928604, |
| "learning_rate": 3.198272622290804e-05, |
| "loss": 0.1058, |
| "mean_token_accuracy": 0.9538767337799072, |
| "num_tokens": 1513510.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.713375796178344, |
| "grad_norm": 0.0773625299334526, |
| "learning_rate": 3.137583621312665e-05, |
| "loss": 0.1075, |
| "mean_token_accuracy": 0.9506730139255524, |
| "num_tokens": 1518701.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.7261146496815285, |
| "grad_norm": 0.07610657811164856, |
| "learning_rate": 3.077368633835205e-05, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9538764953613281, |
| "num_tokens": 1523921.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.738853503184713, |
| "grad_norm": 0.0694374367594719, |
| "learning_rate": 3.0176318191392726e-05, |
| "loss": 0.1013, |
| "mean_token_accuracy": 0.9555954337120056, |
| "num_tokens": 1529415.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7515923566878984, |
| "grad_norm": 0.06636825203895569, |
| "learning_rate": 2.9583773034764826e-05, |
| "loss": 0.1077, |
| "mean_token_accuracy": 0.9531519114971161, |
| "num_tokens": 1534538.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.7643312101910826, |
| "grad_norm": 0.07177619636058807, |
| "learning_rate": 2.8996091797841973e-05, |
| "loss": 0.1089, |
| "mean_token_accuracy": 0.9525831937789917, |
| "num_tokens": 1539634.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.777070063694268, |
| "grad_norm": 0.0751037448644638, |
| "learning_rate": 2.8413315074028158e-05, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.9543749690055847, |
| "num_tokens": 1544802.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.789808917197452, |
| "grad_norm": 0.08280035108327866, |
| "learning_rate": 2.7835483117953788e-05, |
| "loss": 0.1074, |
| "mean_token_accuracy": 0.9507263600826263, |
| "num_tokens": 1549931.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.802547770700637, |
| "grad_norm": 0.07366805523633957, |
| "learning_rate": 2.7262635842695127e-05, |
| "loss": 0.1096, |
| "mean_token_accuracy": 0.952391117811203, |
| "num_tokens": 1555036.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.8152866242038215, |
| "grad_norm": 0.06576742231845856, |
| "learning_rate": 2.669481281701739e-05, |
| "loss": 0.1099, |
| "mean_token_accuracy": 0.9533363580703735, |
| "num_tokens": 1560093.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8280254777070066, |
| "grad_norm": 0.088027223944664, |
| "learning_rate": 2.6132053262641466e-05, |
| "loss": 0.1063, |
| "mean_token_accuracy": 0.9537536799907684, |
| "num_tokens": 1565240.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.840764331210191, |
| "grad_norm": 0.08146074414253235, |
| "learning_rate": 2.5574396051534832e-05, |
| "loss": 0.1092, |
| "mean_token_accuracy": 0.9527508616447449, |
| "num_tokens": 1570302.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.853503184713376, |
| "grad_norm": 0.06479709595441818, |
| "learning_rate": 2.502187970322657e-05, |
| "loss": 0.1094, |
| "mean_token_accuracy": 0.9502229988574982, |
| "num_tokens": 1575412.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8662420382165603, |
| "grad_norm": 0.0956709012389183, |
| "learning_rate": 2.4474542382146537e-05, |
| "loss": 0.1076, |
| "mean_token_accuracy": 0.9498851895332336, |
| "num_tokens": 1580547.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8789808917197455, |
| "grad_norm": 0.08334702998399734, |
| "learning_rate": 2.3932421894989167e-05, |
| "loss": 0.1092, |
| "mean_token_accuracy": 0.9494307339191437, |
| "num_tokens": 1585694.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8917197452229297, |
| "grad_norm": 0.08375080674886703, |
| "learning_rate": 2.339555568810221e-05, |
| "loss": 0.1017, |
| "mean_token_accuracy": 0.9544005393981934, |
| "num_tokens": 1591093.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.904458598726115, |
| "grad_norm": 0.0755012109875679, |
| "learning_rate": 2.2863980844900036e-05, |
| "loss": 0.1034, |
| "mean_token_accuracy": 0.9553941786289215, |
| "num_tokens": 1596426.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.917197452229299, |
| "grad_norm": 0.07963601499795914, |
| "learning_rate": 2.2337734083302164e-05, |
| "loss": 0.1055, |
| "mean_token_accuracy": 0.9529078900814056, |
| "num_tokens": 1601611.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9299363057324843, |
| "grad_norm": 0.09792937338352203, |
| "learning_rate": 2.181685175319702e-05, |
| "loss": 0.1055, |
| "mean_token_accuracy": 0.9546305239200592, |
| "num_tokens": 1606921.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9426751592356686, |
| "grad_norm": 0.0747600793838501, |
| "learning_rate": 2.1301369833931117e-05, |
| "loss": 0.1066, |
| "mean_token_accuracy": 0.9536134004592896, |
| "num_tokens": 1612115.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9554140127388537, |
| "grad_norm": 0.07063605636358261, |
| "learning_rate": 2.079132393182378e-05, |
| "loss": 0.1087, |
| "mean_token_accuracy": 0.9522020220756531, |
| "num_tokens": 1617203.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.968152866242038, |
| "grad_norm": 0.07867901027202606, |
| "learning_rate": 2.0286749277707782e-05, |
| "loss": 0.1059, |
| "mean_token_accuracy": 0.9549467265605927, |
| "num_tokens": 1622415.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.980891719745223, |
| "grad_norm": 0.07289194315671921, |
| "learning_rate": 1.9787680724495617e-05, |
| "loss": 0.1085, |
| "mean_token_accuracy": 0.9504382014274597, |
| "num_tokens": 1627563.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9936305732484074, |
| "grad_norm": 0.07952401041984558, |
| "learning_rate": 1.929415274477239e-05, |
| "loss": 0.1038, |
| "mean_token_accuracy": 0.9552877843379974, |
| "num_tokens": 1632867.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.11535109579563141, |
| "learning_rate": 1.880619942841435e-05, |
| "loss": 0.109, |
| "mean_token_accuracy": 0.9492900371551514, |
| "num_tokens": 1635364.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012738853503185, |
| "grad_norm": 0.06943787634372711, |
| "learning_rate": 1.832385448023435e-05, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9556294083595276, |
| "num_tokens": 1640683.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025477707006369, |
| "grad_norm": 0.06671405583620071, |
| "learning_rate": 1.7847151217653624e-05, |
| "loss": 0.1064, |
| "mean_token_accuracy": 0.9508287012577057, |
| "num_tokens": 1645733.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.038216560509555, |
| "grad_norm": 0.07054504007101059, |
| "learning_rate": 1.7376122568400532e-05, |
| "loss": 0.1035, |
| "mean_token_accuracy": 0.9549604058265686, |
| "num_tokens": 1650927.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050955414012739, |
| "grad_norm": 0.07232412695884705, |
| "learning_rate": 1.6910801068236016e-05, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.9545462131500244, |
| "num_tokens": 1656050.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063694267515924, |
| "grad_norm": 0.08388278633356094, |
| "learning_rate": 1.6451218858706374e-05, |
| "loss": 0.0994, |
| "mean_token_accuracy": 0.9571965932846069, |
| "num_tokens": 1661487.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.076433121019108, |
| "grad_norm": 0.06368128955364227, |
| "learning_rate": 1.5997407684922862e-05, |
| "loss": 0.1009, |
| "mean_token_accuracy": 0.9551970958709717, |
| "num_tokens": 1666819.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.089171974522293, |
| "grad_norm": 0.0757264643907547, |
| "learning_rate": 1.5549398893369216e-05, |
| "loss": 0.1042, |
| "mean_token_accuracy": 0.9547902643680573, |
| "num_tokens": 1671948.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.101910828025478, |
| "grad_norm": 0.0689975917339325, |
| "learning_rate": 1.5107223429736272e-05, |
| "loss": 0.1032, |
| "mean_token_accuracy": 0.953640878200531, |
| "num_tokens": 1677077.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.114649681528663, |
| "grad_norm": 0.07469335198402405, |
| "learning_rate": 1.467091183678444e-05, |
| "loss": 0.1028, |
| "mean_token_accuracy": 0.9557537734508514, |
| "num_tokens": 1682321.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.127388535031847, |
| "grad_norm": 0.08852046728134155, |
| "learning_rate": 1.4240494252234049e-05, |
| "loss": 0.103, |
| "mean_token_accuracy": 0.9547942876815796, |
| "num_tokens": 1687547.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.140127388535032, |
| "grad_norm": 0.07536771148443222, |
| "learning_rate": 1.3816000406683604e-05, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.9549121856689453, |
| "num_tokens": 1692801.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.1528662420382165, |
| "grad_norm": 0.07635539770126343, |
| "learning_rate": 1.339745962155613e-05, |
| "loss": 0.1064, |
| "mean_token_accuracy": 0.95393306016922, |
| "num_tokens": 1697836.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.165605095541402, |
| "grad_norm": 0.08687105029821396, |
| "learning_rate": 1.2984900807073919e-05, |
| "loss": 0.1078, |
| "mean_token_accuracy": 0.9537835717201233, |
| "num_tokens": 1702813.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.178343949044586, |
| "grad_norm": 0.06335142999887466, |
| "learning_rate": 1.2578352460261456e-05, |
| "loss": 0.0978, |
| "mean_token_accuracy": 0.9576011598110199, |
| "num_tokens": 1708220.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.191082802547771, |
| "grad_norm": 0.07969138771295547, |
| "learning_rate": 1.2177842662977135e-05, |
| "loss": 0.1066, |
| "mean_token_accuracy": 0.9537541568279266, |
| "num_tokens": 1713259.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.203821656050955, |
| "grad_norm": 0.06776980310678482, |
| "learning_rate": 1.1783399079973578e-05, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.9574141502380371, |
| "num_tokens": 1718488.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.2165605095541405, |
| "grad_norm": 0.07281561940908432, |
| "learning_rate": 1.1395048956986575e-05, |
| "loss": 0.1062, |
| "mean_token_accuracy": 0.954279750585556, |
| "num_tokens": 1723510.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.229299363057325, |
| "grad_norm": 0.07905755937099457, |
| "learning_rate": 1.1012819118853147e-05, |
| "loss": 0.1042, |
| "mean_token_accuracy": 0.9547126591205597, |
| "num_tokens": 1728674.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.24203821656051, |
| "grad_norm": 0.07528189569711685, |
| "learning_rate": 1.0636735967658784e-05, |
| "loss": 0.1004, |
| "mean_token_accuracy": 0.9574441611766815, |
| "num_tokens": 1734002.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.254777070063694, |
| "grad_norm": 0.07986707240343094, |
| "learning_rate": 1.0266825480913611e-05, |
| "loss": 0.1052, |
| "mean_token_accuracy": 0.9533541202545166, |
| "num_tokens": 1739079.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.267515923566879, |
| "grad_norm": 0.07390084117650986, |
| "learning_rate": 9.903113209758096e-06, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9537836015224457, |
| "num_tokens": 1744315.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.280254777070064, |
| "grad_norm": 0.06952923536300659, |
| "learning_rate": 9.545624277198084e-06, |
| "loss": 0.103, |
| "mean_token_accuracy": 0.9543668627738953, |
| "num_tokens": 1749512.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.292993630573249, |
| "grad_norm": 0.07176285237073898, |
| "learning_rate": 9.194383376369508e-06, |
| "loss": 0.1032, |
| "mean_token_accuracy": 0.9570850133895874, |
| "num_tokens": 1754610.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.305732484076433, |
| "grad_norm": 0.07516177743673325, |
| "learning_rate": 8.849414768832687e-06, |
| "loss": 0.1037, |
| "mean_token_accuracy": 0.9540053308010101, |
| "num_tokens": 1759789.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.318471337579618, |
| "grad_norm": 0.0716799721121788, |
| "learning_rate": 8.510742282896544e-06, |
| "loss": 0.0998, |
| "mean_token_accuracy": 0.9560298323631287, |
| "num_tokens": 1765129.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.3312101910828025, |
| "grad_norm": 0.0837906002998352, |
| "learning_rate": 8.178389311972612e-06, |
| "loss": 0.105, |
| "mean_token_accuracy": 0.9543243944644928, |
| "num_tokens": 1770338.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.343949044585988, |
| "grad_norm": 0.07087274640798569, |
| "learning_rate": 7.852378812959227e-06, |
| "loss": 0.102, |
| "mean_token_accuracy": 0.9561855792999268, |
| "num_tokens": 1775583.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.356687898089172, |
| "grad_norm": 0.08090753108263016, |
| "learning_rate": 7.532733304655848e-06, |
| "loss": 0.1039, |
| "mean_token_accuracy": 0.958774983882904, |
| "num_tokens": 1780820.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.369426751592357, |
| "grad_norm": 0.07000670582056046, |
| "learning_rate": 7.219474866207465e-06, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.9566550850868225, |
| "num_tokens": 1786008.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.382165605095541, |
| "grad_norm": 0.0725073516368866, |
| "learning_rate": 6.9126251355795864e-06, |
| "loss": 0.0995, |
| "mean_token_accuracy": 0.9561439454555511, |
| "num_tokens": 1791386.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3949044585987265, |
| "grad_norm": 0.06831885874271393, |
| "learning_rate": 6.612205308063646e-06, |
| "loss": 0.1005, |
| "mean_token_accuracy": 0.9557774066925049, |
| "num_tokens": 1796648.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.407643312101911, |
| "grad_norm": 0.07962380349636078, |
| "learning_rate": 6.318236134812916e-06, |
| "loss": 0.1006, |
| "mean_token_accuracy": 0.9558420777320862, |
| "num_tokens": 1802013.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.420382165605096, |
| "grad_norm": 0.07603943347930908, |
| "learning_rate": 6.030737921409169e-06, |
| "loss": 0.1026, |
| "mean_token_accuracy": 0.9523784816265106, |
| "num_tokens": 1807206.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.43312101910828, |
| "grad_norm": 0.07720854878425598, |
| "learning_rate": 5.749730526460073e-06, |
| "loss": 0.1057, |
| "mean_token_accuracy": 0.9522489905357361, |
| "num_tokens": 1812361.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.445859872611465, |
| "grad_norm": 0.07383149862289429, |
| "learning_rate": 5.475233360227516e-06, |
| "loss": 0.1029, |
| "mean_token_accuracy": 0.9540509581565857, |
| "num_tokens": 1817605.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.45859872611465, |
| "grad_norm": 0.07123313099145889, |
| "learning_rate": 5.20726538328683e-06, |
| "loss": 0.1035, |
| "mean_token_accuracy": 0.9533557295799255, |
| "num_tokens": 1822772.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.471337579617835, |
| "grad_norm": 0.08088903874158859, |
| "learning_rate": 4.945845105217117e-06, |
| "loss": 0.107, |
| "mean_token_accuracy": 0.9517634212970734, |
| "num_tokens": 1827936.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.484076433121019, |
| "grad_norm": 0.07305390387773514, |
| "learning_rate": 4.6909905833226966e-06, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.9566372334957123, |
| "num_tokens": 1833113.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.496815286624204, |
| "grad_norm": 0.07187072187662125, |
| "learning_rate": 4.442719421385922e-06, |
| "loss": 0.1022, |
| "mean_token_accuracy": 0.9553613364696503, |
| "num_tokens": 1838352.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.509554140127388, |
| "grad_norm": 0.08292709290981293, |
| "learning_rate": 4.20104876845111e-06, |
| "loss": 0.1016, |
| "mean_token_accuracy": 0.9544655084609985, |
| "num_tokens": 1843665.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.522292993630574, |
| "grad_norm": 0.07301212102174759, |
| "learning_rate": 3.965995317640025e-06, |
| "loss": 0.1039, |
| "mean_token_accuracy": 0.9533164799213409, |
| "num_tokens": 1848911.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.535031847133758, |
| "grad_norm": 0.08238684386014938, |
| "learning_rate": 3.7375753049987973e-06, |
| "loss": 0.1008, |
| "mean_token_accuracy": 0.9585762619972229, |
| "num_tokens": 1854213.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.547770700636943, |
| "grad_norm": 0.07075439393520355, |
| "learning_rate": 3.515804508376508e-06, |
| "loss": 0.1046, |
| "mean_token_accuracy": 0.9562832713127136, |
| "num_tokens": 1859356.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.560509554140127, |
| "grad_norm": 0.07496190071105957, |
| "learning_rate": 3.3006982463352766e-06, |
| "loss": 0.1026, |
| "mean_token_accuracy": 0.9552099406719208, |
| "num_tokens": 1864689.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.573248407643312, |
| "grad_norm": 0.07805922627449036, |
| "learning_rate": 3.092271377092215e-06, |
| "loss": 0.1046, |
| "mean_token_accuracy": 0.9539024233818054, |
| "num_tokens": 1869816.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.585987261146497, |
| "grad_norm": 0.06747109442949295, |
| "learning_rate": 2.8905382974930172e-06, |
| "loss": 0.0994, |
| "mean_token_accuracy": 0.9568324387073517, |
| "num_tokens": 1875191.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.598726114649682, |
| "grad_norm": 0.08741574734449387, |
| "learning_rate": 2.6955129420176196e-06, |
| "loss": 0.1051, |
| "mean_token_accuracy": 0.9548819065093994, |
| "num_tokens": 1880330.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.611464968152866, |
| "grad_norm": 0.07086427509784698, |
| "learning_rate": 2.5072087818176382e-06, |
| "loss": 0.1028, |
| "mean_token_accuracy": 0.9552706182003021, |
| "num_tokens": 1885618.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.624203821656051, |
| "grad_norm": 0.09037292748689651, |
| "learning_rate": 2.3256388237858807e-06, |
| "loss": 0.1058, |
| "mean_token_accuracy": 0.9500741064548492, |
| "num_tokens": 1890809.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.6369426751592355, |
| "grad_norm": 0.07957708090543747, |
| "learning_rate": 2.150815609657875e-06, |
| "loss": 0.1029, |
| "mean_token_accuracy": 0.9558984339237213, |
| "num_tokens": 1896020.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.649681528662421, |
| "grad_norm": 0.06979665160179138, |
| "learning_rate": 1.9827512151456173e-06, |
| "loss": 0.0993, |
| "mean_token_accuracy": 0.9556711912155151, |
| "num_tokens": 1901407.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.662420382165605, |
| "grad_norm": 0.066802479326725, |
| "learning_rate": 1.8214572491034198e-06, |
| "loss": 0.1016, |
| "mean_token_accuracy": 0.9537667632102966, |
| "num_tokens": 1906685.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.67515923566879, |
| "grad_norm": 0.07699089497327805, |
| "learning_rate": 1.66694485272606e-06, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9554409980773926, |
| "num_tokens": 1911956.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.687898089171974, |
| "grad_norm": 0.06872906535863876, |
| "learning_rate": 1.5192246987791981e-06, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.9550608098506927, |
| "num_tokens": 1917050.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.7006369426751595, |
| "grad_norm": 0.07824942469596863, |
| "learning_rate": 1.378306990862177e-06, |
| "loss": 0.1016, |
| "mean_token_accuracy": 0.9562693536281586, |
| "num_tokens": 1922307.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.713375796178344, |
| "grad_norm": 0.07499802857637405, |
| "learning_rate": 1.2442014627032316e-06, |
| "loss": 0.1069, |
| "mean_token_accuracy": 0.9526033401489258, |
| "num_tokens": 1927350.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.726114649681529, |
| "grad_norm": 0.0749669075012207, |
| "learning_rate": 1.1169173774871478e-06, |
| "loss": 0.1038, |
| "mean_token_accuracy": 0.9533734917640686, |
| "num_tokens": 1932562.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.738853503184713, |
| "grad_norm": 0.08355723321437836, |
| "learning_rate": 9.964635272153633e-07, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.9523906707763672, |
| "num_tokens": 1937735.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.751592356687898, |
| "grad_norm": 0.07518034428358078, |
| "learning_rate": 8.828482320987319e-07, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.9536759555339813, |
| "num_tokens": 1942841.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.764331210191083, |
| "grad_norm": 0.0784311518073082, |
| "learning_rate": 7.760793399827937e-07, |
| "loss": 0.1079, |
| "mean_token_accuracy": 0.9512859582901001, |
| "num_tokens": 1947957.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.777070063694268, |
| "grad_norm": 0.07679091393947601, |
| "learning_rate": 6.761642258056978e-07, |
| "loss": 0.1006, |
| "mean_token_accuracy": 0.9535685181617737, |
| "num_tokens": 1953276.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.789808917197452, |
| "grad_norm": 0.07247486710548401, |
| "learning_rate": 5.831097910887873e-07, |
| "loss": 0.1021, |
| "mean_token_accuracy": 0.9537284970283508, |
| "num_tokens": 1958636.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.802547770700637, |
| "grad_norm": 0.07884224504232407, |
| "learning_rate": 4.969224634598591e-07, |
| "loss": 0.1026, |
| "mean_token_accuracy": 0.9526365101337433, |
| "num_tokens": 1963897.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.8152866242038215, |
| "grad_norm": 0.08129719644784927, |
| "learning_rate": 4.176081962092182e-07, |
| "loss": 0.1027, |
| "mean_token_accuracy": 0.9571616053581238, |
| "num_tokens": 1969073.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.828025477707007, |
| "grad_norm": 0.07397085428237915, |
| "learning_rate": 3.451724678784518e-07, |
| "loss": 0.1032, |
| "mean_token_accuracy": 0.9548551142215729, |
| "num_tokens": 1974327.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.840764331210191, |
| "grad_norm": 0.08152173459529877, |
| "learning_rate": 2.7962028188198706e-07, |
| "loss": 0.1038, |
| "mean_token_accuracy": 0.9496630430221558, |
| "num_tokens": 1979511.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.853503184713376, |
| "grad_norm": 0.08115998655557632, |
| "learning_rate": 2.2095616616150115e-07, |
| "loss": 0.1026, |
| "mean_token_accuracy": 0.9531446695327759, |
| "num_tokens": 1984765.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.86624203821656, |
| "grad_norm": 0.0791371688246727, |
| "learning_rate": 1.6918417287318245e-07, |
| "loss": 0.1048, |
| "mean_token_accuracy": 0.9550330936908722, |
| "num_tokens": 1989926.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8789808917197455, |
| "grad_norm": 0.07414387911558151, |
| "learning_rate": 1.2430787810776555e-07, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.95284703373909, |
| "num_tokens": 1995060.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.89171974522293, |
| "grad_norm": 0.07836966216564178, |
| "learning_rate": 8.633038164358454e-08, |
| "loss": 0.1044, |
| "mean_token_accuracy": 0.9553065896034241, |
| "num_tokens": 2000215.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.904458598726115, |
| "grad_norm": 0.06861698627471924, |
| "learning_rate": 5.5254306732444025e-08, |
| "loss": 0.1024, |
| "mean_token_accuracy": 0.9546225965023041, |
| "num_tokens": 2005435.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.917197452229299, |
| "grad_norm": 0.075834721326828, |
| "learning_rate": 3.1081799918375454e-08, |
| "loss": 0.1014, |
| "mean_token_accuracy": 0.9536567032337189, |
| "num_tokens": 2010721.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.929936305732484, |
| "grad_norm": 0.07424164563417435, |
| "learning_rate": 1.3814530889433296e-08, |
| "loss": 0.1021, |
| "mean_token_accuracy": 0.9579430222511292, |
| "num_tokens": 2015921.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "grad_norm": 0.07672765851020813, |
| "learning_rate": 3.453692362309635e-09, |
| "loss": 0.1054, |
| "mean_token_accuracy": 0.9539982378482819, |
| "num_tokens": 2020985.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "step": 390, |
| "total_flos": 1.1265274541611418e+17, |
| "train_loss": 0.13867208319596755, |
| "train_runtime": 627.158, |
| "train_samples_per_second": 39.862, |
| "train_steps_per_second": 0.622 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 390, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.1265274541611418e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|