| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 7.0, |
| "eval_steps": 500, |
| "global_step": 553, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012658227848101266, |
| "grad_norm": 2.3777403831481934, |
| "learning_rate": 0.0, |
| "loss": 2.987, |
| "mean_token_accuracy": 0.43647515773773193, |
| "num_tokens": 49462.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.02531645569620253, |
| "grad_norm": 2.2921016216278076, |
| "learning_rate": 1.1764705882352942e-05, |
| "loss": 2.9692, |
| "mean_token_accuracy": 0.43469536304473877, |
| "num_tokens": 103343.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.0379746835443038, |
| "grad_norm": 2.1817562580108643, |
| "learning_rate": 2.3529411764705884e-05, |
| "loss": 2.9708, |
| "mean_token_accuracy": 0.4287627935409546, |
| "num_tokens": 159396.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.05063291139240506, |
| "grad_norm": 1.69505774974823, |
| "learning_rate": 3.529411764705883e-05, |
| "loss": 2.8333, |
| "mean_token_accuracy": 0.4467816650867462, |
| "num_tokens": 214939.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06329113924050633, |
| "grad_norm": 0.8903109431266785, |
| "learning_rate": 4.705882352941177e-05, |
| "loss": 2.7946, |
| "mean_token_accuracy": 0.4477955102920532, |
| "num_tokens": 269347.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.0759493670886076, |
| "grad_norm": 0.7307999730110168, |
| "learning_rate": 5.882352941176471e-05, |
| "loss": 2.7415, |
| "mean_token_accuracy": 0.4459383189678192, |
| "num_tokens": 322665.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08860759493670886, |
| "grad_norm": 1.0384595394134521, |
| "learning_rate": 7.058823529411765e-05, |
| "loss": 2.6873, |
| "mean_token_accuracy": 0.45682191848754883, |
| "num_tokens": 376321.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10126582278481013, |
| "grad_norm": 0.6653650999069214, |
| "learning_rate": 8.23529411764706e-05, |
| "loss": 2.6668, |
| "mean_token_accuracy": 0.4562457799911499, |
| "num_tokens": 432471.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11392405063291139, |
| "grad_norm": 0.5289244651794434, |
| "learning_rate": 9.411764705882353e-05, |
| "loss": 2.5618, |
| "mean_token_accuracy": 0.4725915491580963, |
| "num_tokens": 484508.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12658227848101267, |
| "grad_norm": 0.41668060421943665, |
| "learning_rate": 0.00010588235294117647, |
| "loss": 2.595, |
| "mean_token_accuracy": 0.459774911403656, |
| "num_tokens": 539575.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.13924050632911392, |
| "grad_norm": 0.4126631021499634, |
| "learning_rate": 0.00011764705882352942, |
| "loss": 2.5641, |
| "mean_token_accuracy": 0.46722716093063354, |
| "num_tokens": 595661.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.1518987341772152, |
| "grad_norm": 0.42117854952812195, |
| "learning_rate": 0.00012941176470588237, |
| "loss": 2.4867, |
| "mean_token_accuracy": 0.4772918224334717, |
| "num_tokens": 649252.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16455696202531644, |
| "grad_norm": 0.3347395360469818, |
| "learning_rate": 0.0001411764705882353, |
| "loss": 2.4066, |
| "mean_token_accuracy": 0.4961014986038208, |
| "num_tokens": 698181.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17721518987341772, |
| "grad_norm": 0.3450194001197815, |
| "learning_rate": 0.00015294117647058822, |
| "loss": 2.4575, |
| "mean_token_accuracy": 0.4829401671886444, |
| "num_tokens": 751997.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.189873417721519, |
| "grad_norm": 0.3743025064468384, |
| "learning_rate": 0.0001647058823529412, |
| "loss": 2.5271, |
| "mean_token_accuracy": 0.47433584928512573, |
| "num_tokens": 804157.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20253164556962025, |
| "grad_norm": 0.31017568707466125, |
| "learning_rate": 0.00017647058823529413, |
| "loss": 2.4469, |
| "mean_token_accuracy": 0.4821561872959137, |
| "num_tokens": 857853.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21518987341772153, |
| "grad_norm": 0.2644542455673218, |
| "learning_rate": 0.00018823529411764707, |
| "loss": 2.4757, |
| "mean_token_accuracy": 0.4836902916431427, |
| "num_tokens": 911658.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22784810126582278, |
| "grad_norm": 0.276317298412323, |
| "learning_rate": 0.0002, |
| "loss": 2.4031, |
| "mean_token_accuracy": 0.49243834614753723, |
| "num_tokens": 966472.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24050632911392406, |
| "grad_norm": 0.2615073621273041, |
| "learning_rate": 0.0001999982823331779, |
| "loss": 2.4172, |
| "mean_token_accuracy": 0.48848584294319153, |
| "num_tokens": 1021121.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25316455696202533, |
| "grad_norm": 0.29055628180503845, |
| "learning_rate": 0.00019999312939171914, |
| "loss": 2.4338, |
| "mean_token_accuracy": 0.48929548263549805, |
| "num_tokens": 1073873.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.26582278481012656, |
| "grad_norm": 0.27930697798728943, |
| "learning_rate": 0.00019998454135264444, |
| "loss": 2.4522, |
| "mean_token_accuracy": 0.48395559191703796, |
| "num_tokens": 1127694.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.27848101265822783, |
| "grad_norm": 0.26422643661499023, |
| "learning_rate": 0.0001999725185109816, |
| "loss": 2.3931, |
| "mean_token_accuracy": 0.49215826392173767, |
| "num_tokens": 1182019.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2911392405063291, |
| "grad_norm": 0.24653665721416473, |
| "learning_rate": 0.00019995706127975537, |
| "loss": 2.4242, |
| "mean_token_accuracy": 0.49197646975517273, |
| "num_tokens": 1236984.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3037974683544304, |
| "grad_norm": 0.23459693789482117, |
| "learning_rate": 0.00019993817018997323, |
| "loss": 2.3932, |
| "mean_token_accuracy": 0.49121400713920593, |
| "num_tokens": 1290713.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.31645569620253167, |
| "grad_norm": 0.2341814786195755, |
| "learning_rate": 0.0001999158458906071, |
| "loss": 2.3674, |
| "mean_token_accuracy": 0.4998742640018463, |
| "num_tokens": 1342478.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.3291139240506329, |
| "grad_norm": 0.23303280770778656, |
| "learning_rate": 0.00019989008914857116, |
| "loss": 2.371, |
| "mean_token_accuracy": 0.49253204464912415, |
| "num_tokens": 1399050.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34177215189873417, |
| "grad_norm": 0.23921893537044525, |
| "learning_rate": 0.00019986090084869545, |
| "loss": 2.3414, |
| "mean_token_accuracy": 0.504025936126709, |
| "num_tokens": 1450903.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35443037974683544, |
| "grad_norm": 0.23109662532806396, |
| "learning_rate": 0.00019982828199369541, |
| "loss": 2.383, |
| "mean_token_accuracy": 0.4947618544101715, |
| "num_tokens": 1502703.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.3670886075949367, |
| "grad_norm": 0.23166801035404205, |
| "learning_rate": 0.00019979223370413763, |
| "loss": 2.3427, |
| "mean_token_accuracy": 0.5024489760398865, |
| "num_tokens": 1554830.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.379746835443038, |
| "grad_norm": 0.23221726715564728, |
| "learning_rate": 0.00019975275721840103, |
| "loss": 2.316, |
| "mean_token_accuracy": 0.5067493915557861, |
| "num_tokens": 1608232.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.3924050632911392, |
| "grad_norm": 0.25872787833213806, |
| "learning_rate": 0.00019970985389263467, |
| "loss": 2.4018, |
| "mean_token_accuracy": 0.4859926998615265, |
| "num_tokens": 1664017.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.4050632911392405, |
| "grad_norm": 0.21597705781459808, |
| "learning_rate": 0.0001996635252007109, |
| "loss": 2.373, |
| "mean_token_accuracy": 0.4899657070636749, |
| "num_tokens": 1720089.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4177215189873418, |
| "grad_norm": 0.21651999652385712, |
| "learning_rate": 0.00019961377273417487, |
| "loss": 2.3406, |
| "mean_token_accuracy": 0.5002290606498718, |
| "num_tokens": 1774726.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43037974683544306, |
| "grad_norm": 0.27110129594802856, |
| "learning_rate": 0.00019956059820218982, |
| "loss": 2.2649, |
| "mean_token_accuracy": 0.5155223608016968, |
| "num_tokens": 1825040.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.4430379746835443, |
| "grad_norm": 0.2406129240989685, |
| "learning_rate": 0.00019950400343147833, |
| "loss": 2.2383, |
| "mean_token_accuracy": 0.5138267874717712, |
| "num_tokens": 1874103.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.45569620253164556, |
| "grad_norm": 0.23772259056568146, |
| "learning_rate": 0.0001994439903662596, |
| "loss": 2.308, |
| "mean_token_accuracy": 0.5060418248176575, |
| "num_tokens": 1927131.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.46835443037974683, |
| "grad_norm": 0.2241072952747345, |
| "learning_rate": 0.00019938056106818261, |
| "loss": 2.3184, |
| "mean_token_accuracy": 0.5003350377082825, |
| "num_tokens": 1980917.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4810126582278481, |
| "grad_norm": 0.21709077060222626, |
| "learning_rate": 0.00019931371771625544, |
| "loss": 2.297, |
| "mean_token_accuracy": 0.5099939703941345, |
| "num_tokens": 2038766.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4936708860759494, |
| "grad_norm": 0.23601983487606049, |
| "learning_rate": 0.0001992434626067702, |
| "loss": 2.2036, |
| "mean_token_accuracy": 0.5218307971954346, |
| "num_tokens": 2091004.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5063291139240507, |
| "grad_norm": 0.2275037169456482, |
| "learning_rate": 0.00019916979815322433, |
| "loss": 2.2341, |
| "mean_token_accuracy": 0.5191103219985962, |
| "num_tokens": 2140073.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5189873417721519, |
| "grad_norm": 0.2513538599014282, |
| "learning_rate": 0.00019909272688623756, |
| "loss": 2.253, |
| "mean_token_accuracy": 0.5178407430648804, |
| "num_tokens": 2188061.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.5316455696202531, |
| "grad_norm": 0.23898564279079437, |
| "learning_rate": 0.0001990122514534651, |
| "loss": 2.3332, |
| "mean_token_accuracy": 0.5028094053268433, |
| "num_tokens": 2238848.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5443037974683544, |
| "grad_norm": 0.23017625510692596, |
| "learning_rate": 0.00019892837461950652, |
| "loss": 2.281, |
| "mean_token_accuracy": 0.5065714120864868, |
| "num_tokens": 2290423.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5569620253164557, |
| "grad_norm": 0.22404694557189941, |
| "learning_rate": 0.00019884109926581096, |
| "loss": 2.3715, |
| "mean_token_accuracy": 0.4927098751068115, |
| "num_tokens": 2346796.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.569620253164557, |
| "grad_norm": 0.26679301261901855, |
| "learning_rate": 0.00019875042839057798, |
| "loss": 2.2823, |
| "mean_token_accuracy": 0.5043882131576538, |
| "num_tokens": 2398134.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5822784810126582, |
| "grad_norm": 0.35434162616729736, |
| "learning_rate": 0.00019865636510865467, |
| "loss": 2.2726, |
| "mean_token_accuracy": 0.5074643492698669, |
| "num_tokens": 2451183.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5949367088607594, |
| "grad_norm": 0.25821197032928467, |
| "learning_rate": 0.0001985589126514286, |
| "loss": 2.2611, |
| "mean_token_accuracy": 0.5144078135490417, |
| "num_tokens": 2504378.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6075949367088608, |
| "grad_norm": 0.24773675203323364, |
| "learning_rate": 0.0001984580743667168, |
| "loss": 2.2926, |
| "mean_token_accuracy": 0.5041046142578125, |
| "num_tokens": 2560111.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.620253164556962, |
| "grad_norm": 0.2054610252380371, |
| "learning_rate": 0.0001983538537186508, |
| "loss": 2.2683, |
| "mean_token_accuracy": 0.5050387978553772, |
| "num_tokens": 2615347.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6329113924050633, |
| "grad_norm": 0.2727196216583252, |
| "learning_rate": 0.0001982462542875576, |
| "loss": 2.2515, |
| "mean_token_accuracy": 0.5132653713226318, |
| "num_tokens": 2668557.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6455696202531646, |
| "grad_norm": 0.220747172832489, |
| "learning_rate": 0.0001981352797698367, |
| "loss": 2.2114, |
| "mean_token_accuracy": 0.5235074162483215, |
| "num_tokens": 2719222.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6582278481012658, |
| "grad_norm": 0.22235804796218872, |
| "learning_rate": 0.00019802093397783296, |
| "loss": 2.3158, |
| "mean_token_accuracy": 0.5008944869041443, |
| "num_tokens": 2774066.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6708860759493671, |
| "grad_norm": 0.21352076530456543, |
| "learning_rate": 0.0001979032208397059, |
| "loss": 2.2094, |
| "mean_token_accuracy": 0.5189113616943359, |
| "num_tokens": 2826453.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6835443037974683, |
| "grad_norm": 0.24351590871810913, |
| "learning_rate": 0.00019778214439929452, |
| "loss": 2.237, |
| "mean_token_accuracy": 0.5208898782730103, |
| "num_tokens": 2879916.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.6962025316455697, |
| "grad_norm": 0.22591541707515717, |
| "learning_rate": 0.00019765770881597855, |
| "loss": 2.2748, |
| "mean_token_accuracy": 0.5128757953643799, |
| "num_tokens": 2935627.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7088607594936709, |
| "grad_norm": 0.23585133254528046, |
| "learning_rate": 0.00019752991836453543, |
| "loss": 2.2592, |
| "mean_token_accuracy": 0.517071008682251, |
| "num_tokens": 2987299.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7215189873417721, |
| "grad_norm": 0.2299552857875824, |
| "learning_rate": 0.00019739877743499352, |
| "loss": 2.2103, |
| "mean_token_accuracy": 0.5231272578239441, |
| "num_tokens": 3039920.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7341772151898734, |
| "grad_norm": 0.22556596994400024, |
| "learning_rate": 0.0001972642905324813, |
| "loss": 2.1801, |
| "mean_token_accuracy": 0.5252166390419006, |
| "num_tokens": 3093758.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7468354430379747, |
| "grad_norm": 0.2583288252353668, |
| "learning_rate": 0.00019712646227707263, |
| "loss": 2.2206, |
| "mean_token_accuracy": 0.5194674134254456, |
| "num_tokens": 3146320.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.759493670886076, |
| "grad_norm": 0.23114819824695587, |
| "learning_rate": 0.00019698529740362785, |
| "loss": 2.1938, |
| "mean_token_accuracy": 0.5238490104675293, |
| "num_tokens": 3199447.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7721518987341772, |
| "grad_norm": 0.27613702416419983, |
| "learning_rate": 0.00019684080076163142, |
| "loss": 2.218, |
| "mean_token_accuracy": 0.5217007398605347, |
| "num_tokens": 3249325.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7848101265822784, |
| "grad_norm": 0.2257266640663147, |
| "learning_rate": 0.00019669297731502507, |
| "loss": 2.1838, |
| "mean_token_accuracy": 0.527215301990509, |
| "num_tokens": 3301933.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.7974683544303798, |
| "grad_norm": 0.2396840751171112, |
| "learning_rate": 0.0001965418321420374, |
| "loss": 2.287, |
| "mean_token_accuracy": 0.5053610801696777, |
| "num_tokens": 3359168.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.810126582278481, |
| "grad_norm": 0.2592514753341675, |
| "learning_rate": 0.0001963873704350094, |
| "loss": 2.2362, |
| "mean_token_accuracy": 0.5132758021354675, |
| "num_tokens": 3413805.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8227848101265823, |
| "grad_norm": 0.21635417640209198, |
| "learning_rate": 0.00019622959750021605, |
| "loss": 2.2325, |
| "mean_token_accuracy": 0.516057550907135, |
| "num_tokens": 3468018.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8354430379746836, |
| "grad_norm": 0.31652048230171204, |
| "learning_rate": 0.000196068518757684, |
| "loss": 2.1816, |
| "mean_token_accuracy": 0.5242221355438232, |
| "num_tokens": 3520245.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8481012658227848, |
| "grad_norm": 0.2590932548046112, |
| "learning_rate": 0.0001959041397410056, |
| "loss": 2.2603, |
| "mean_token_accuracy": 0.5067430734634399, |
| "num_tokens": 3575996.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8607594936708861, |
| "grad_norm": 0.2672514021396637, |
| "learning_rate": 0.0001957364660971485, |
| "loss": 2.1668, |
| "mean_token_accuracy": 0.5292069911956787, |
| "num_tokens": 3626048.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8734177215189873, |
| "grad_norm": 0.2696274518966675, |
| "learning_rate": 0.0001955655035862617, |
| "loss": 2.2775, |
| "mean_token_accuracy": 0.5012869834899902, |
| "num_tokens": 3680891.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.8860759493670886, |
| "grad_norm": 0.263043075799942, |
| "learning_rate": 0.0001953912580814779, |
| "loss": 2.1221, |
| "mean_token_accuracy": 0.5379413366317749, |
| "num_tokens": 3734485.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.8987341772151899, |
| "grad_norm": 0.2448316514492035, |
| "learning_rate": 0.0001952137355687116, |
| "loss": 2.2553, |
| "mean_token_accuracy": 0.5112840533256531, |
| "num_tokens": 3788386.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9113924050632911, |
| "grad_norm": 0.24373596906661987, |
| "learning_rate": 0.00019503294214645337, |
| "loss": 2.2736, |
| "mean_token_accuracy": 0.5043618679046631, |
| "num_tokens": 3844848.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9240506329113924, |
| "grad_norm": 0.24015116691589355, |
| "learning_rate": 0.00019484888402556045, |
| "loss": 2.1951, |
| "mean_token_accuracy": 0.5237194299697876, |
| "num_tokens": 3897780.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9367088607594937, |
| "grad_norm": 0.23572903871536255, |
| "learning_rate": 0.00019466156752904343, |
| "loss": 2.1952, |
| "mean_token_accuracy": 0.522976279258728, |
| "num_tokens": 3951508.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9493670886075949, |
| "grad_norm": 0.2306000143289566, |
| "learning_rate": 0.0001944709990918489, |
| "loss": 2.2095, |
| "mean_token_accuracy": 0.5186269879341125, |
| "num_tokens": 4005526.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9620253164556962, |
| "grad_norm": 0.24925322830677032, |
| "learning_rate": 0.00019427718526063856, |
| "loss": 2.2771, |
| "mean_token_accuracy": 0.5064836144447327, |
| "num_tokens": 4060883.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9746835443037974, |
| "grad_norm": 0.24365416169166565, |
| "learning_rate": 0.00019408013269356408, |
| "loss": 2.2302, |
| "mean_token_accuracy": 0.5153389573097229, |
| "num_tokens": 4116720.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9873417721518988, |
| "grad_norm": 0.2500327229499817, |
| "learning_rate": 0.00019387984816003867, |
| "loss": 2.2153, |
| "mean_token_accuracy": 0.5156280994415283, |
| "num_tokens": 4171909.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.2392851859331131, |
| "learning_rate": 0.00019367633854050422, |
| "loss": 2.2053, |
| "mean_token_accuracy": 0.5209515690803528, |
| "num_tokens": 4223258.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0126582278481013, |
| "grad_norm": 0.25848275423049927, |
| "learning_rate": 0.00019346961082619522, |
| "loss": 2.1435, |
| "mean_token_accuracy": 0.5287906527519226, |
| "num_tokens": 4276360.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0253164556962024, |
| "grad_norm": 0.2851516902446747, |
| "learning_rate": 0.00019325967211889834, |
| "loss": 2.0766, |
| "mean_token_accuracy": 0.5436299443244934, |
| "num_tokens": 4327593.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0379746835443038, |
| "grad_norm": 0.24724675714969635, |
| "learning_rate": 0.0001930465296307087, |
| "loss": 2.1137, |
| "mean_token_accuracy": 0.5325369834899902, |
| "num_tokens": 4381903.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0506329113924051, |
| "grad_norm": 0.2525455951690674, |
| "learning_rate": 0.00019283019068378182, |
| "loss": 2.1432, |
| "mean_token_accuracy": 0.5336418747901917, |
| "num_tokens": 4436200.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0632911392405062, |
| "grad_norm": 0.25476905703544617, |
| "learning_rate": 0.00019261066271008235, |
| "loss": 2.0469, |
| "mean_token_accuracy": 0.5430089831352234, |
| "num_tokens": 4488753.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0759493670886076, |
| "grad_norm": 0.2865007817745209, |
| "learning_rate": 0.0001923879532511287, |
| "loss": 2.0638, |
| "mean_token_accuracy": 0.5452839732170105, |
| "num_tokens": 4541054.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.0886075949367089, |
| "grad_norm": 0.3013957440853119, |
| "learning_rate": 0.00019216206995773373, |
| "loss": 2.0805, |
| "mean_token_accuracy": 0.5348638892173767, |
| "num_tokens": 4595128.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1012658227848102, |
| "grad_norm": 0.254112184047699, |
| "learning_rate": 0.00019193302058974232, |
| "loss": 2.0616, |
| "mean_token_accuracy": 0.537585973739624, |
| "num_tokens": 4646940.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1139240506329113, |
| "grad_norm": 0.2646372318267822, |
| "learning_rate": 0.00019170081301576444, |
| "loss": 2.0863, |
| "mean_token_accuracy": 0.5361210703849792, |
| "num_tokens": 4699591.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.1265822784810127, |
| "grad_norm": 0.2960815131664276, |
| "learning_rate": 0.00019146545521290495, |
| "loss": 2.0699, |
| "mean_token_accuracy": 0.5427575707435608, |
| "num_tokens": 4751599.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.139240506329114, |
| "grad_norm": 0.25750261545181274, |
| "learning_rate": 0.00019122695526648968, |
| "loss": 2.1036, |
| "mean_token_accuracy": 0.5315433144569397, |
| "num_tokens": 4809837.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1518987341772151, |
| "grad_norm": 0.4250410199165344, |
| "learning_rate": 0.00019098532136978754, |
| "loss": 2.0947, |
| "mean_token_accuracy": 0.5293768048286438, |
| "num_tokens": 4865472.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1645569620253164, |
| "grad_norm": 0.2557165324687958, |
| "learning_rate": 0.00019074056182372907, |
| "loss": 2.0543, |
| "mean_token_accuracy": 0.5417463183403015, |
| "num_tokens": 4917852.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.1772151898734178, |
| "grad_norm": 0.3148958384990692, |
| "learning_rate": 0.00019049268503662126, |
| "loss": 2.1255, |
| "mean_token_accuracy": 0.5321261286735535, |
| "num_tokens": 4972202.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.189873417721519, |
| "grad_norm": 0.22774221003055573, |
| "learning_rate": 0.00019024169952385885, |
| "loss": 2.0793, |
| "mean_token_accuracy": 0.5393686890602112, |
| "num_tokens": 5028656.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2025316455696202, |
| "grad_norm": 0.32660016417503357, |
| "learning_rate": 0.00018998761390763154, |
| "loss": 2.0631, |
| "mean_token_accuracy": 0.5409747958183289, |
| "num_tokens": 5080935.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.2151898734177216, |
| "grad_norm": 0.2552703619003296, |
| "learning_rate": 0.00018973043691662803, |
| "loss": 2.0697, |
| "mean_token_accuracy": 0.5411579012870789, |
| "num_tokens": 5131609.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2278481012658227, |
| "grad_norm": 0.3084775507450104, |
| "learning_rate": 0.000189470177385736, |
| "loss": 2.069, |
| "mean_token_accuracy": 0.5433229804039001, |
| "num_tokens": 5186563.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.240506329113924, |
| "grad_norm": 0.2627609074115753, |
| "learning_rate": 0.00018920684425573865, |
| "loss": 2.1484, |
| "mean_token_accuracy": 0.5229992270469666, |
| "num_tokens": 5240868.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2531645569620253, |
| "grad_norm": 0.3135717809200287, |
| "learning_rate": 0.00018894044657300765, |
| "loss": 2.0522, |
| "mean_token_accuracy": 0.5427237153053284, |
| "num_tokens": 5296826.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.2658227848101267, |
| "grad_norm": 0.23775604367256165, |
| "learning_rate": 0.00018867099348919217, |
| "loss": 2.1287, |
| "mean_token_accuracy": 0.5334255695343018, |
| "num_tokens": 5351818.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2784810126582278, |
| "grad_norm": 0.2612893581390381, |
| "learning_rate": 0.0001883984942609047, |
| "loss": 2.0926, |
| "mean_token_accuracy": 0.5350447297096252, |
| "num_tokens": 5405328.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2911392405063291, |
| "grad_norm": 0.29380878806114197, |
| "learning_rate": 0.00018812295824940285, |
| "loss": 2.03, |
| "mean_token_accuracy": 0.5474804043769836, |
| "num_tokens": 5456234.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.3037974683544304, |
| "grad_norm": 0.2552684545516968, |
| "learning_rate": 0.00018784439492026798, |
| "loss": 2.1386, |
| "mean_token_accuracy": 0.5273610353469849, |
| "num_tokens": 5510225.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3164556962025316, |
| "grad_norm": 0.2983575761318207, |
| "learning_rate": 0.00018756281384307982, |
| "loss": 2.1227, |
| "mean_token_accuracy": 0.529445230960846, |
| "num_tokens": 5564780.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3291139240506329, |
| "grad_norm": 0.26163336634635925, |
| "learning_rate": 0.0001872782246910879, |
| "loss": 2.045, |
| "mean_token_accuracy": 0.5461205840110779, |
| "num_tokens": 5615071.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3417721518987342, |
| "grad_norm": 0.3032778799533844, |
| "learning_rate": 0.00018699063724087904, |
| "loss": 2.1803, |
| "mean_token_accuracy": 0.5188722014427185, |
| "num_tokens": 5672415.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.3544303797468356, |
| "grad_norm": 0.2592957615852356, |
| "learning_rate": 0.0001867000613720417, |
| "loss": 2.0498, |
| "mean_token_accuracy": 0.5388314723968506, |
| "num_tokens": 5725503.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3670886075949367, |
| "grad_norm": 0.29061180353164673, |
| "learning_rate": 0.0001864065070668265, |
| "loss": 2.098, |
| "mean_token_accuracy": 0.5372474193572998, |
| "num_tokens": 5778470.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.379746835443038, |
| "grad_norm": 0.26013630628585815, |
| "learning_rate": 0.00018610998440980324, |
| "loss": 2.0141, |
| "mean_token_accuracy": 0.5491858124732971, |
| "num_tokens": 5832086.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.3924050632911391, |
| "grad_norm": 0.26930177211761475, |
| "learning_rate": 0.00018581050358751445, |
| "loss": 2.1008, |
| "mean_token_accuracy": 0.5337706804275513, |
| "num_tokens": 5884133.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4050632911392404, |
| "grad_norm": 0.2522057294845581, |
| "learning_rate": 0.00018550807488812562, |
| "loss": 2.0286, |
| "mean_token_accuracy": 0.547819197177887, |
| "num_tokens": 5936059.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4177215189873418, |
| "grad_norm": 0.30630195140838623, |
| "learning_rate": 0.00018520270870107166, |
| "loss": 2.0577, |
| "mean_token_accuracy": 0.5432639718055725, |
| "num_tokens": 5989782.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4303797468354431, |
| "grad_norm": 0.29105985164642334, |
| "learning_rate": 0.00018489441551669986, |
| "loss": 2.091, |
| "mean_token_accuracy": 0.5343809127807617, |
| "num_tokens": 6044702.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4430379746835442, |
| "grad_norm": 0.2534923255443573, |
| "learning_rate": 0.00018458320592590975, |
| "loss": 2.0732, |
| "mean_token_accuracy": 0.5419034361839294, |
| "num_tokens": 6097733.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4556962025316456, |
| "grad_norm": 0.3388892114162445, |
| "learning_rate": 0.00018426909061978908, |
| "loss": 2.0036, |
| "mean_token_accuracy": 0.5546702146530151, |
| "num_tokens": 6148501.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4683544303797469, |
| "grad_norm": 0.24488019943237305, |
| "learning_rate": 0.00018395208038924667, |
| "loss": 2.0736, |
| "mean_token_accuracy": 0.5427255034446716, |
| "num_tokens": 6204129.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.481012658227848, |
| "grad_norm": 0.30311962962150574, |
| "learning_rate": 0.00018363218612464158, |
| "loss": 2.0696, |
| "mean_token_accuracy": 0.5433797240257263, |
| "num_tokens": 6252960.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4936708860759493, |
| "grad_norm": 0.2518928050994873, |
| "learning_rate": 0.00018330941881540915, |
| "loss": 2.1633, |
| "mean_token_accuracy": 0.5237207412719727, |
| "num_tokens": 6309325.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5063291139240507, |
| "grad_norm": 0.27587708830833435, |
| "learning_rate": 0.00018298378954968337, |
| "loss": 2.0865, |
| "mean_token_accuracy": 0.5355247855186462, |
| "num_tokens": 6363661.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.518987341772152, |
| "grad_norm": 0.25085651874542236, |
| "learning_rate": 0.0001826553095139159, |
| "loss": 2.0476, |
| "mean_token_accuracy": 0.5387334227561951, |
| "num_tokens": 6418897.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5316455696202531, |
| "grad_norm": 0.27475208044052124, |
| "learning_rate": 0.00018232398999249192, |
| "loss": 2.0465, |
| "mean_token_accuracy": 0.5438748598098755, |
| "num_tokens": 6471964.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5443037974683544, |
| "grad_norm": 0.2808888554573059, |
| "learning_rate": 0.00018198984236734246, |
| "loss": 2.1187, |
| "mean_token_accuracy": 0.5324656367301941, |
| "num_tokens": 6526578.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5569620253164556, |
| "grad_norm": 0.25396695733070374, |
| "learning_rate": 0.0001816528781175533, |
| "loss": 2.1141, |
| "mean_token_accuracy": 0.5278106331825256, |
| "num_tokens": 6579913.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.5696202531645569, |
| "grad_norm": 0.26733213663101196, |
| "learning_rate": 0.0001813131088189707, |
| "loss": 1.9808, |
| "mean_token_accuracy": 0.5578979253768921, |
| "num_tokens": 6629737.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5822784810126582, |
| "grad_norm": 0.25329867005348206, |
| "learning_rate": 0.00018097054614380365, |
| "loss": 2.0034, |
| "mean_token_accuracy": 0.5492294430732727, |
| "num_tokens": 6682879.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5949367088607596, |
| "grad_norm": 0.2658468186855316, |
| "learning_rate": 0.000180625201860223, |
| "loss": 2.1381, |
| "mean_token_accuracy": 0.527422308921814, |
| "num_tokens": 6735929.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.6075949367088609, |
| "grad_norm": 0.23761491477489471, |
| "learning_rate": 0.0001802770878319571, |
| "loss": 2.1088, |
| "mean_token_accuracy": 0.5335116982460022, |
| "num_tokens": 6791675.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.620253164556962, |
| "grad_norm": 0.26158007979393005, |
| "learning_rate": 0.00017992621601788428, |
| "loss": 2.0366, |
| "mean_token_accuracy": 0.5437957048416138, |
| "num_tokens": 6845500.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6329113924050633, |
| "grad_norm": 0.2551691234111786, |
| "learning_rate": 0.00017957259847162205, |
| "loss": 2.0507, |
| "mean_token_accuracy": 0.5451430082321167, |
| "num_tokens": 6897510.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6455696202531644, |
| "grad_norm": 0.2645633816719055, |
| "learning_rate": 0.00017921624734111292, |
| "loss": 2.0529, |
| "mean_token_accuracy": 0.542524516582489, |
| "num_tokens": 6951343.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.6582278481012658, |
| "grad_norm": 0.25614386796951294, |
| "learning_rate": 0.00017885717486820722, |
| "loss": 2.1082, |
| "mean_token_accuracy": 0.5370593070983887, |
| "num_tokens": 7004619.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6708860759493671, |
| "grad_norm": 0.2779742181301117, |
| "learning_rate": 0.00017849539338824231, |
| "loss": 1.9767, |
| "mean_token_accuracy": 0.558155357837677, |
| "num_tokens": 7056140.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6835443037974684, |
| "grad_norm": 0.2670557498931885, |
| "learning_rate": 0.0001781309153296192, |
| "loss": 2.0374, |
| "mean_token_accuracy": 0.5427295565605164, |
| "num_tokens": 7108147.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.6962025316455698, |
| "grad_norm": 0.2564358711242676, |
| "learning_rate": 0.00017776375321337521, |
| "loss": 2.1222, |
| "mean_token_accuracy": 0.530992865562439, |
| "num_tokens": 7162046.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7088607594936709, |
| "grad_norm": 0.2533285617828369, |
| "learning_rate": 0.00017739391965275404, |
| "loss": 2.078, |
| "mean_token_accuracy": 0.5365890264511108, |
| "num_tokens": 7215432.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.721518987341772, |
| "grad_norm": 0.2570582926273346, |
| "learning_rate": 0.00017702142735277247, |
| "loss": 2.0243, |
| "mean_token_accuracy": 0.5478048324584961, |
| "num_tokens": 7269455.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7341772151898733, |
| "grad_norm": 0.27466800808906555, |
| "learning_rate": 0.00017664628910978375, |
| "loss": 2.0785, |
| "mean_token_accuracy": 0.5374588966369629, |
| "num_tokens": 7325754.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7468354430379747, |
| "grad_norm": 0.29858797788619995, |
| "learning_rate": 0.0001762685178110382, |
| "loss": 2.0338, |
| "mean_token_accuracy": 0.5446484684944153, |
| "num_tokens": 7380064.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.759493670886076, |
| "grad_norm": 0.26779335737228394, |
| "learning_rate": 0.00017588812643424032, |
| "loss": 2.0546, |
| "mean_token_accuracy": 0.5391934514045715, |
| "num_tokens": 7434359.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7721518987341773, |
| "grad_norm": 0.2574562430381775, |
| "learning_rate": 0.0001755051280471031, |
| "loss": 2.0319, |
| "mean_token_accuracy": 0.5409929156303406, |
| "num_tokens": 7483712.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7848101265822784, |
| "grad_norm": 0.31137484312057495, |
| "learning_rate": 0.00017511953580689888, |
| "loss": 2.0427, |
| "mean_token_accuracy": 0.5435848832130432, |
| "num_tokens": 7537602.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.7974683544303798, |
| "grad_norm": 0.31535619497299194, |
| "learning_rate": 0.00017473136296000772, |
| "loss": 1.9553, |
| "mean_token_accuracy": 0.5641329884529114, |
| "num_tokens": 7589870.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.810126582278481, |
| "grad_norm": 0.2668202519416809, |
| "learning_rate": 0.000174340622841462, |
| "loss": 2.0205, |
| "mean_token_accuracy": 0.5494571924209595, |
| "num_tokens": 7644284.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8227848101265822, |
| "grad_norm": 0.26058775186538696, |
| "learning_rate": 0.00017394732887448847, |
| "loss": 2.1271, |
| "mean_token_accuracy": 0.527405321598053, |
| "num_tokens": 7699465.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8354430379746836, |
| "grad_norm": 0.2781299948692322, |
| "learning_rate": 0.00017355149457004709, |
| "loss": 1.9947, |
| "mean_token_accuracy": 0.5520567297935486, |
| "num_tokens": 7751165.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8481012658227849, |
| "grad_norm": 0.26897257566452026, |
| "learning_rate": 0.0001731531335263669, |
| "loss": 2.0708, |
| "mean_token_accuracy": 0.5371328592300415, |
| "num_tokens": 7804955.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8607594936708862, |
| "grad_norm": 0.3198035955429077, |
| "learning_rate": 0.0001727522594284789, |
| "loss": 2.0811, |
| "mean_token_accuracy": 0.5379791259765625, |
| "num_tokens": 7860668.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8734177215189873, |
| "grad_norm": 0.2609718143939972, |
| "learning_rate": 0.00017234888604774574, |
| "loss": 2.0328, |
| "mean_token_accuracy": 0.542784571647644, |
| "num_tokens": 7915857.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.8860759493670884, |
| "grad_norm": 0.31711193919181824, |
| "learning_rate": 0.00017194302724138903, |
| "loss": 2.0753, |
| "mean_token_accuracy": 0.5399681925773621, |
| "num_tokens": 7969326.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.8987341772151898, |
| "grad_norm": 0.3608168959617615, |
| "learning_rate": 0.00017153469695201277, |
| "loss": 2.0528, |
| "mean_token_accuracy": 0.5399906039237976, |
| "num_tokens": 8022615.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9113924050632911, |
| "grad_norm": 0.2569022476673126, |
| "learning_rate": 0.0001711239092071248, |
| "loss": 2.0195, |
| "mean_token_accuracy": 0.5482782125473022, |
| "num_tokens": 8075995.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.9240506329113924, |
| "grad_norm": 0.3743065595626831, |
| "learning_rate": 0.00017071067811865476, |
| "loss": 2.0105, |
| "mean_token_accuracy": 0.5483627915382385, |
| "num_tokens": 8125167.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9367088607594938, |
| "grad_norm": 0.25395363569259644, |
| "learning_rate": 0.00017029501788246924, |
| "loss": 2.0084, |
| "mean_token_accuracy": 0.5484933257102966, |
| "num_tokens": 8179589.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9493670886075949, |
| "grad_norm": 0.3222920894622803, |
| "learning_rate": 0.00016987694277788417, |
| "loss": 1.9888, |
| "mean_token_accuracy": 0.5601121187210083, |
| "num_tokens": 8228886.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9620253164556962, |
| "grad_norm": 0.2416379451751709, |
| "learning_rate": 0.0001694564671671743, |
| "loss": 2.0704, |
| "mean_token_accuracy": 0.5397144556045532, |
| "num_tokens": 8284635.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.9746835443037973, |
| "grad_norm": 0.2981293797492981, |
| "learning_rate": 0.0001690336054950797, |
| "loss": 2.1268, |
| "mean_token_accuracy": 0.5291581153869629, |
| "num_tokens": 8340584.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9873417721518987, |
| "grad_norm": 0.263873815536499, |
| "learning_rate": 0.00016860837228830974, |
| "loss": 2.0321, |
| "mean_token_accuracy": 0.5468259453773499, |
| "num_tokens": 8394144.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.31899693608283997, |
| "learning_rate": 0.0001681807821550438, |
| "loss": 1.9678, |
| "mean_token_accuracy": 0.554486870765686, |
| "num_tokens": 8448377.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0126582278481013, |
| "grad_norm": 0.29040661454200745, |
| "learning_rate": 0.00016775084978442955, |
| "loss": 1.889, |
| "mean_token_accuracy": 0.5655468106269836, |
| "num_tokens": 8502288.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0253164556962027, |
| "grad_norm": 0.4248679578304291, |
| "learning_rate": 0.00016731858994607838, |
| "loss": 1.8803, |
| "mean_token_accuracy": 0.5686565637588501, |
| "num_tokens": 8554248.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.037974683544304, |
| "grad_norm": 0.37469160556793213, |
| "learning_rate": 0.00016688401748955802, |
| "loss": 1.853, |
| "mean_token_accuracy": 0.5755634307861328, |
| "num_tokens": 8607380.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050632911392405, |
| "grad_norm": 0.32907748222351074, |
| "learning_rate": 0.00016644714734388217, |
| "loss": 1.946, |
| "mean_token_accuracy": 0.5507125854492188, |
| "num_tokens": 8661612.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0632911392405062, |
| "grad_norm": 0.35196223855018616, |
| "learning_rate": 0.00016600799451699802, |
| "loss": 1.8451, |
| "mean_token_accuracy": 0.5690965056419373, |
| "num_tokens": 8713806.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0759493670886076, |
| "grad_norm": 0.29669368267059326, |
| "learning_rate": 0.0001655665740952703, |
| "loss": 1.8824, |
| "mean_token_accuracy": 0.5658582448959351, |
| "num_tokens": 8770112.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.088607594936709, |
| "grad_norm": 0.31338831782341003, |
| "learning_rate": 0.00016512290124296336, |
| "loss": 1.8446, |
| "mean_token_accuracy": 0.5760558247566223, |
| "num_tokens": 8825655.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1012658227848102, |
| "grad_norm": 0.3266657888889313, |
| "learning_rate": 0.00016467699120171987, |
| "loss": 1.8758, |
| "mean_token_accuracy": 0.5682055950164795, |
| "num_tokens": 8879263.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1139240506329116, |
| "grad_norm": 0.343274861574173, |
| "learning_rate": 0.00016422885929003758, |
| "loss": 1.7457, |
| "mean_token_accuracy": 0.5934667587280273, |
| "num_tokens": 8929195.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.1265822784810124, |
| "grad_norm": 0.3215281665325165, |
| "learning_rate": 0.00016377852090274276, |
| "loss": 1.821, |
| "mean_token_accuracy": 0.5799418687820435, |
| "num_tokens": 8980171.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.1392405063291138, |
| "grad_norm": 0.35965943336486816, |
| "learning_rate": 0.0001633259915104616, |
| "loss": 1.8355, |
| "mean_token_accuracy": 0.5785340070724487, |
| "num_tokens": 9034861.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.151898734177215, |
| "grad_norm": 0.39557531476020813, |
| "learning_rate": 0.0001628712866590885, |
| "loss": 1.799, |
| "mean_token_accuracy": 0.5816659331321716, |
| "num_tokens": 9090450.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1645569620253164, |
| "grad_norm": 0.30929461121559143, |
| "learning_rate": 0.00016241442196925223, |
| "loss": 1.8251, |
| "mean_token_accuracy": 0.5757784843444824, |
| "num_tokens": 9141254.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.1772151898734178, |
| "grad_norm": 0.3711070120334625, |
| "learning_rate": 0.00016195541313577923, |
| "loss": 1.8639, |
| "mean_token_accuracy": 0.5689946413040161, |
| "num_tokens": 9194554.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.189873417721519, |
| "grad_norm": 0.36852866411209106, |
| "learning_rate": 0.00016149427592715432, |
| "loss": 1.8202, |
| "mean_token_accuracy": 0.5803923010826111, |
| "num_tokens": 9248454.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2025316455696204, |
| "grad_norm": 0.30636078119277954, |
| "learning_rate": 0.00016103102618497922, |
| "loss": 1.9217, |
| "mean_token_accuracy": 0.5586243271827698, |
| "num_tokens": 9301960.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.2151898734177213, |
| "grad_norm": 0.365090936422348, |
| "learning_rate": 0.00016056567982342817, |
| "loss": 1.7946, |
| "mean_token_accuracy": 0.585414707660675, |
| "num_tokens": 9354954.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.2278481012658227, |
| "grad_norm": 0.3484059274196625, |
| "learning_rate": 0.00016009825282870126, |
| "loss": 1.7078, |
| "mean_token_accuracy": 0.6031553149223328, |
| "num_tokens": 9407754.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.240506329113924, |
| "grad_norm": 0.3187144100666046, |
| "learning_rate": 0.00015962876125847535, |
| "loss": 1.9279, |
| "mean_token_accuracy": 0.5545867681503296, |
| "num_tokens": 9461265.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.2531645569620253, |
| "grad_norm": 0.38731351494789124, |
| "learning_rate": 0.00015915722124135227, |
| "loss": 1.8782, |
| "mean_token_accuracy": 0.5675600171089172, |
| "num_tokens": 9515170.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.2658227848101267, |
| "grad_norm": 0.3368418514728546, |
| "learning_rate": 0.0001586836489763049, |
| "loss": 1.7767, |
| "mean_token_accuracy": 0.5821657180786133, |
| "num_tokens": 9570117.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.278481012658228, |
| "grad_norm": 0.33595919609069824, |
| "learning_rate": 0.00015820806073212055, |
| "loss": 1.8194, |
| "mean_token_accuracy": 0.5774704217910767, |
| "num_tokens": 9620355.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.291139240506329, |
| "grad_norm": 0.3396199941635132, |
| "learning_rate": 0.0001577304728468422, |
| "loss": 1.7706, |
| "mean_token_accuracy": 0.5850851535797119, |
| "num_tokens": 9670463.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.3037974683544302, |
| "grad_norm": 0.33389562368392944, |
| "learning_rate": 0.0001572509017272072, |
| "loss": 1.8639, |
| "mean_token_accuracy": 0.5703521966934204, |
| "num_tokens": 9723880.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3164556962025316, |
| "grad_norm": 0.3759293854236603, |
| "learning_rate": 0.00015676936384808354, |
| "loss": 1.9416, |
| "mean_token_accuracy": 0.5503548383712769, |
| "num_tokens": 9780026.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.329113924050633, |
| "grad_norm": 0.3279268145561218, |
| "learning_rate": 0.00015628587575190395, |
| "loss": 1.8682, |
| "mean_token_accuracy": 0.5664793252944946, |
| "num_tokens": 9834182.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.3417721518987342, |
| "grad_norm": 0.33523041009902954, |
| "learning_rate": 0.00015580045404809772, |
| "loss": 1.8708, |
| "mean_token_accuracy": 0.5720546245574951, |
| "num_tokens": 9889926.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.3544303797468356, |
| "grad_norm": 0.31567129492759705, |
| "learning_rate": 0.00015531311541251995, |
| "loss": 1.8889, |
| "mean_token_accuracy": 0.5600780248641968, |
| "num_tokens": 9945343.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.367088607594937, |
| "grad_norm": 0.32239577174186707, |
| "learning_rate": 0.00015482387658687875, |
| "loss": 1.84, |
| "mean_token_accuracy": 0.5734173655509949, |
| "num_tokens": 9997772.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.379746835443038, |
| "grad_norm": 0.34426018595695496, |
| "learning_rate": 0.00015433275437816004, |
| "loss": 1.8681, |
| "mean_token_accuracy": 0.5655243396759033, |
| "num_tokens": 10052083.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.392405063291139, |
| "grad_norm": 0.32579970359802246, |
| "learning_rate": 0.00015383976565805035, |
| "loss": 1.848, |
| "mean_token_accuracy": 0.5735384225845337, |
| "num_tokens": 10105908.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4050632911392404, |
| "grad_norm": 0.313778817653656, |
| "learning_rate": 0.00015334492736235705, |
| "loss": 1.9487, |
| "mean_token_accuracy": 0.55268394947052, |
| "num_tokens": 10161226.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4177215189873418, |
| "grad_norm": 0.3332686722278595, |
| "learning_rate": 0.00015284825649042655, |
| "loss": 1.7781, |
| "mean_token_accuracy": 0.592665433883667, |
| "num_tokens": 10214163.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.430379746835443, |
| "grad_norm": 0.31427377462387085, |
| "learning_rate": 0.00015234977010456047, |
| "loss": 1.7905, |
| "mean_token_accuracy": 0.5814598202705383, |
| "num_tokens": 10268714.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.4430379746835444, |
| "grad_norm": 0.3140884339809418, |
| "learning_rate": 0.00015184948532942928, |
| "loss": 1.8759, |
| "mean_token_accuracy": 0.5640963315963745, |
| "num_tokens": 10322260.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4556962025316453, |
| "grad_norm": 0.314708948135376, |
| "learning_rate": 0.0001513474193514842, |
| "loss": 1.8658, |
| "mean_token_accuracy": 0.5691792368888855, |
| "num_tokens": 10377579.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4683544303797467, |
| "grad_norm": 0.31301847100257874, |
| "learning_rate": 0.0001508435894183667, |
| "loss": 1.8546, |
| "mean_token_accuracy": 0.5749539732933044, |
| "num_tokens": 10432470.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.481012658227848, |
| "grad_norm": 0.31218788027763367, |
| "learning_rate": 0.00015033801283831596, |
| "loss": 1.9022, |
| "mean_token_accuracy": 0.5633723735809326, |
| "num_tokens": 10484189.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4936708860759493, |
| "grad_norm": 0.3280318081378937, |
| "learning_rate": 0.00014983070697957438, |
| "loss": 1.7818, |
| "mean_token_accuracy": 0.5819751620292664, |
| "num_tokens": 10536958.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5063291139240507, |
| "grad_norm": 0.3817770481109619, |
| "learning_rate": 0.00014932168926979074, |
| "loss": 1.841, |
| "mean_token_accuracy": 0.5792132616043091, |
| "num_tokens": 10591451.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.518987341772152, |
| "grad_norm": 0.35046157240867615, |
| "learning_rate": 0.00014881097719542173, |
| "loss": 1.8229, |
| "mean_token_accuracy": 0.5766626596450806, |
| "num_tokens": 10646157.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.5316455696202533, |
| "grad_norm": 0.3283882439136505, |
| "learning_rate": 0.000148298588301131, |
| "loss": 1.8715, |
| "mean_token_accuracy": 0.5702670216560364, |
| "num_tokens": 10700706.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5443037974683547, |
| "grad_norm": 0.3310740292072296, |
| "learning_rate": 0.0001477845401891867, |
| "loss": 1.9048, |
| "mean_token_accuracy": 0.5702333450317383, |
| "num_tokens": 10752882.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5569620253164556, |
| "grad_norm": 0.33611828088760376, |
| "learning_rate": 0.00014726885051885653, |
| "loss": 1.8881, |
| "mean_token_accuracy": 0.5651430487632751, |
| "num_tokens": 10807334.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.569620253164557, |
| "grad_norm": 0.32620447874069214, |
| "learning_rate": 0.00014675153700580124, |
| "loss": 1.8265, |
| "mean_token_accuracy": 0.5770817995071411, |
| "num_tokens": 10859985.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5822784810126582, |
| "grad_norm": 0.3716906011104584, |
| "learning_rate": 0.00014623261742146602, |
| "loss": 1.8504, |
| "mean_token_accuracy": 0.5766309499740601, |
| "num_tokens": 10912058.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5949367088607596, |
| "grad_norm": 0.43748190999031067, |
| "learning_rate": 0.00014571210959246988, |
| "loss": 1.9149, |
| "mean_token_accuracy": 0.5612872838973999, |
| "num_tokens": 10964792.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.607594936708861, |
| "grad_norm": 0.3213548958301544, |
| "learning_rate": 0.00014519003139999337, |
| "loss": 1.7896, |
| "mean_token_accuracy": 0.582744836807251, |
| "num_tokens": 11020364.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.620253164556962, |
| "grad_norm": 0.4236705005168915, |
| "learning_rate": 0.0001446664007791644, |
| "loss": 1.887, |
| "mean_token_accuracy": 0.5643614530563354, |
| "num_tokens": 11075593.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.632911392405063, |
| "grad_norm": 0.3708915114402771, |
| "learning_rate": 0.00014414123571844178, |
| "loss": 1.7496, |
| "mean_token_accuracy": 0.59052973985672, |
| "num_tokens": 11128137.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6455696202531644, |
| "grad_norm": 0.36450517177581787, |
| "learning_rate": 0.00014361455425899756, |
| "loss": 1.8051, |
| "mean_token_accuracy": 0.579054057598114, |
| "num_tokens": 11180975.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.6582278481012658, |
| "grad_norm": 0.34610500931739807, |
| "learning_rate": 0.00014308637449409706, |
| "loss": 1.8752, |
| "mean_token_accuracy": 0.566521406173706, |
| "num_tokens": 11235420.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.670886075949367, |
| "grad_norm": 0.32428479194641113, |
| "learning_rate": 0.00014255671456847748, |
| "loss": 1.846, |
| "mean_token_accuracy": 0.5711670517921448, |
| "num_tokens": 11290657.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6835443037974684, |
| "grad_norm": 0.3470180630683899, |
| "learning_rate": 0.00014202559267772444, |
| "loss": 1.9229, |
| "mean_token_accuracy": 0.5572388172149658, |
| "num_tokens": 11346697.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.6962025316455698, |
| "grad_norm": 0.3158308267593384, |
| "learning_rate": 0.00014149302706764697, |
| "loss": 1.8882, |
| "mean_token_accuracy": 0.5655895471572876, |
| "num_tokens": 11400268.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.708860759493671, |
| "grad_norm": 0.3739509880542755, |
| "learning_rate": 0.00014095903603365066, |
| "loss": 1.8327, |
| "mean_token_accuracy": 0.5739619731903076, |
| "num_tokens": 11457003.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.721518987341772, |
| "grad_norm": 0.3665842115879059, |
| "learning_rate": 0.0001404236379201091, |
| "loss": 1.855, |
| "mean_token_accuracy": 0.5749245285987854, |
| "num_tokens": 11507411.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.7341772151898733, |
| "grad_norm": 0.33928871154785156, |
| "learning_rate": 0.00013988685111973384, |
| "loss": 1.7869, |
| "mean_token_accuracy": 0.5864142179489136, |
| "num_tokens": 11559706.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7468354430379747, |
| "grad_norm": 0.376045823097229, |
| "learning_rate": 0.00013934869407294245, |
| "loss": 1.9374, |
| "mean_token_accuracy": 0.5520438551902771, |
| "num_tokens": 11617577.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.759493670886076, |
| "grad_norm": 0.31934303045272827, |
| "learning_rate": 0.00013880918526722497, |
| "loss": 1.8828, |
| "mean_token_accuracy": 0.5626968741416931, |
| "num_tokens": 11675100.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.7721518987341773, |
| "grad_norm": 0.3510988652706146, |
| "learning_rate": 0.000138268343236509, |
| "loss": 1.8147, |
| "mean_token_accuracy": 0.5796269178390503, |
| "num_tokens": 11727056.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.7848101265822782, |
| "grad_norm": 0.3386330306529999, |
| "learning_rate": 0.0001377261865605227, |
| "loss": 1.8044, |
| "mean_token_accuracy": 0.5796509385108948, |
| "num_tokens": 11775594.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.7974683544303796, |
| "grad_norm": 0.36835694313049316, |
| "learning_rate": 0.0001371827338641568, |
| "loss": 1.8303, |
| "mean_token_accuracy": 0.5750265717506409, |
| "num_tokens": 11827393.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.810126582278481, |
| "grad_norm": 0.3421669006347656, |
| "learning_rate": 0.00013663800381682464, |
| "loss": 1.8834, |
| "mean_token_accuracy": 0.5673810243606567, |
| "num_tokens": 11881070.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8227848101265822, |
| "grad_norm": 0.3295755684375763, |
| "learning_rate": 0.00013609201513182075, |
| "loss": 1.9107, |
| "mean_token_accuracy": 0.557906448841095, |
| "num_tokens": 11938701.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.8354430379746836, |
| "grad_norm": 0.34180569648742676, |
| "learning_rate": 0.00013554478656567818, |
| "loss": 1.8386, |
| "mean_token_accuracy": 0.577558696269989, |
| "num_tokens": 11991409.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.848101265822785, |
| "grad_norm": 0.3204934000968933, |
| "learning_rate": 0.0001349963369175239, |
| "loss": 1.9146, |
| "mean_token_accuracy": 0.5546259880065918, |
| "num_tokens": 12048012.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8607594936708862, |
| "grad_norm": 0.3490206003189087, |
| "learning_rate": 0.0001344466850284333, |
| "loss": 1.861, |
| "mean_token_accuracy": 0.573200523853302, |
| "num_tokens": 12098868.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8734177215189876, |
| "grad_norm": 0.32708510756492615, |
| "learning_rate": 0.00013389584978078258, |
| "loss": 1.8304, |
| "mean_token_accuracy": 0.5713738799095154, |
| "num_tokens": 12153777.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8860759493670884, |
| "grad_norm": 0.33750301599502563, |
| "learning_rate": 0.00013334385009760032, |
| "loss": 1.8488, |
| "mean_token_accuracy": 0.5716525912284851, |
| "num_tokens": 12204858.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.8987341772151898, |
| "grad_norm": 0.35124820470809937, |
| "learning_rate": 0.00013279070494191737, |
| "loss": 1.8847, |
| "mean_token_accuracy": 0.569037675857544, |
| "num_tokens": 12258219.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.911392405063291, |
| "grad_norm": 0.32959967851638794, |
| "learning_rate": 0.00013223643331611537, |
| "loss": 1.827, |
| "mean_token_accuracy": 0.578726589679718, |
| "num_tokens": 12308590.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9240506329113924, |
| "grad_norm": 0.35620811581611633, |
| "learning_rate": 0.000131681054261274, |
| "loss": 1.7977, |
| "mean_token_accuracy": 0.5861988663673401, |
| "num_tokens": 12360244.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9367088607594938, |
| "grad_norm": 0.32876428961753845, |
| "learning_rate": 0.00013112458685651668, |
| "loss": 1.7982, |
| "mean_token_accuracy": 0.5834053754806519, |
| "num_tokens": 12410047.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9493670886075947, |
| "grad_norm": 0.329098105430603, |
| "learning_rate": 0.00013056705021835546, |
| "loss": 1.8335, |
| "mean_token_accuracy": 0.5807684659957886, |
| "num_tokens": 12465052.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.962025316455696, |
| "grad_norm": 0.3197422921657562, |
| "learning_rate": 0.0001300084635000341, |
| "loss": 1.8429, |
| "mean_token_accuracy": 0.5740662217140198, |
| "num_tokens": 12517110.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.9746835443037973, |
| "grad_norm": 0.3175854980945587, |
| "learning_rate": 0.00012944884589086993, |
| "loss": 1.8138, |
| "mean_token_accuracy": 0.5791066884994507, |
| "num_tokens": 12570033.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9873417721518987, |
| "grad_norm": 0.32739362120628357, |
| "learning_rate": 0.00012888821661559508, |
| "loss": 1.8057, |
| "mean_token_accuracy": 0.5797368288040161, |
| "num_tokens": 12620563.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.3728819191455841, |
| "learning_rate": 0.00012832659493369557, |
| "loss": 1.6939, |
| "mean_token_accuracy": 0.5952839851379395, |
| "num_tokens": 12674613.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0126582278481013, |
| "grad_norm": 0.42436647415161133, |
| "learning_rate": 0.00012776400013875006, |
| "loss": 1.5034, |
| "mean_token_accuracy": 0.6346282958984375, |
| "num_tokens": 12725335.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0253164556962027, |
| "grad_norm": 0.4612860381603241, |
| "learning_rate": 0.0001272004515577668, |
| "loss": 1.5386, |
| "mean_token_accuracy": 0.6292459964752197, |
| "num_tokens": 12775888.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.037974683544304, |
| "grad_norm": 0.6946155428886414, |
| "learning_rate": 0.0001266359685505198, |
| "loss": 1.5901, |
| "mean_token_accuracy": 0.617897093296051, |
| "num_tokens": 12828765.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050632911392405, |
| "grad_norm": 0.4287043809890747, |
| "learning_rate": 0.0001260705705088837, |
| "loss": 1.5589, |
| "mean_token_accuracy": 0.6239352226257324, |
| "num_tokens": 12880836.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0632911392405062, |
| "grad_norm": 0.4556795060634613, |
| "learning_rate": 0.00012550427685616765, |
| "loss": 1.5111, |
| "mean_token_accuracy": 0.6317170262336731, |
| "num_tokens": 12932355.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0759493670886076, |
| "grad_norm": 0.4299950897693634, |
| "learning_rate": 0.00012493710704644805, |
| "loss": 1.5545, |
| "mean_token_accuracy": 0.6259156465530396, |
| "num_tokens": 12984295.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.088607594936709, |
| "grad_norm": 0.41609516739845276, |
| "learning_rate": 0.0001243690805639002, |
| "loss": 1.623, |
| "mean_token_accuracy": 0.6103270649909973, |
| "num_tokens": 13040406.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1012658227848102, |
| "grad_norm": 0.4679557681083679, |
| "learning_rate": 0.00012380021692212894, |
| "loss": 1.6624, |
| "mean_token_accuracy": 0.6014009714126587, |
| "num_tokens": 13097146.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1139240506329116, |
| "grad_norm": 0.5160155892372131, |
| "learning_rate": 0.00012323053566349834, |
| "loss": 1.608, |
| "mean_token_accuracy": 0.6115766167640686, |
| "num_tokens": 13153064.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.1265822784810124, |
| "grad_norm": 0.4674924314022064, |
| "learning_rate": 0.00012266005635846037, |
| "loss": 1.5492, |
| "mean_token_accuracy": 0.6278569102287292, |
| "num_tokens": 13207908.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.1392405063291138, |
| "grad_norm": 0.45278114080429077, |
| "learning_rate": 0.0001220887986048825, |
| "loss": 1.5134, |
| "mean_token_accuracy": 0.6304005980491638, |
| "num_tokens": 13256925.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.151898734177215, |
| "grad_norm": 0.4184185564517975, |
| "learning_rate": 0.00012151678202737456, |
| "loss": 1.6149, |
| "mean_token_accuracy": 0.6162724494934082, |
| "num_tokens": 13311314.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1645569620253164, |
| "grad_norm": 0.4231603443622589, |
| "learning_rate": 0.00012094402627661447, |
| "loss": 1.5758, |
| "mean_token_accuracy": 0.6183434128761292, |
| "num_tokens": 13366962.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.1772151898734178, |
| "grad_norm": 0.4317049980163574, |
| "learning_rate": 0.00012037055102867321, |
| "loss": 1.5862, |
| "mean_token_accuracy": 0.6172645092010498, |
| "num_tokens": 13419156.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.189873417721519, |
| "grad_norm": 0.43530407547950745, |
| "learning_rate": 0.00011979637598433899, |
| "loss": 1.6126, |
| "mean_token_accuracy": 0.6087615489959717, |
| "num_tokens": 13473982.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2025316455696204, |
| "grad_norm": 0.46672239899635315, |
| "learning_rate": 0.00011922152086844023, |
| "loss": 1.556, |
| "mean_token_accuracy": 0.6229726076126099, |
| "num_tokens": 13524480.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.2151898734177213, |
| "grad_norm": 0.455728143453598, |
| "learning_rate": 0.00011864600542916813, |
| "loss": 1.611, |
| "mean_token_accuracy": 0.6102961897850037, |
| "num_tokens": 13577923.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.2278481012658227, |
| "grad_norm": 0.4760991930961609, |
| "learning_rate": 0.00011806984943739821, |
| "loss": 1.562, |
| "mean_token_accuracy": 0.6255306005477905, |
| "num_tokens": 13629815.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.240506329113924, |
| "grad_norm": 0.4103173315525055, |
| "learning_rate": 0.00011749307268601111, |
| "loss": 1.6351, |
| "mean_token_accuracy": 0.602997899055481, |
| "num_tokens": 13687720.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.2531645569620253, |
| "grad_norm": 0.4410172998905182, |
| "learning_rate": 0.00011691569498921264, |
| "loss": 1.6159, |
| "mean_token_accuracy": 0.6079987287521362, |
| "num_tokens": 13743993.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.2658227848101267, |
| "grad_norm": 0.4677037000656128, |
| "learning_rate": 0.00011633773618185302, |
| "loss": 1.5324, |
| "mean_token_accuracy": 0.6266757845878601, |
| "num_tokens": 13795152.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.278481012658228, |
| "grad_norm": 0.4234687387943268, |
| "learning_rate": 0.00011575921611874565, |
| "loss": 1.5927, |
| "mean_token_accuracy": 0.6112661957740784, |
| "num_tokens": 13850390.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.291139240506329, |
| "grad_norm": 0.47788316011428833, |
| "learning_rate": 0.00011518015467398489, |
| "loss": 1.6094, |
| "mean_token_accuracy": 0.6132988929748535, |
| "num_tokens": 13905000.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.3037974683544302, |
| "grad_norm": 0.48243483901023865, |
| "learning_rate": 0.00011460057174026335, |
| "loss": 1.6604, |
| "mean_token_accuracy": 0.6029521822929382, |
| "num_tokens": 13958652.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3164556962025316, |
| "grad_norm": 0.43476489186286926, |
| "learning_rate": 0.0001140204872281886, |
| "loss": 1.6219, |
| "mean_token_accuracy": 0.61234050989151, |
| "num_tokens": 14012717.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.329113924050633, |
| "grad_norm": 0.43300172686576843, |
| "learning_rate": 0.00011343992106559898, |
| "loss": 1.5688, |
| "mean_token_accuracy": 0.6212312579154968, |
| "num_tokens": 14067408.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.3417721518987342, |
| "grad_norm": 0.43267443776130676, |
| "learning_rate": 0.00011285889319687923, |
| "loss": 1.5304, |
| "mean_token_accuracy": 0.6297682523727417, |
| "num_tokens": 14122235.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.3544303797468356, |
| "grad_norm": 0.44928601384162903, |
| "learning_rate": 0.00011227742358227522, |
| "loss": 1.5597, |
| "mean_token_accuracy": 0.6211428046226501, |
| "num_tokens": 14177164.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.367088607594937, |
| "grad_norm": 0.4439207911491394, |
| "learning_rate": 0.00011169553219720828, |
| "loss": 1.5676, |
| "mean_token_accuracy": 0.6210277676582336, |
| "num_tokens": 14230158.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.379746835443038, |
| "grad_norm": 0.48783257603645325, |
| "learning_rate": 0.00011111323903158885, |
| "loss": 1.614, |
| "mean_token_accuracy": 0.6099197268486023, |
| "num_tokens": 14283429.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.392405063291139, |
| "grad_norm": 0.49185577034950256, |
| "learning_rate": 0.00011053056408913001, |
| "loss": 1.5395, |
| "mean_token_accuracy": 0.6258946061134338, |
| "num_tokens": 14335612.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4050632911392404, |
| "grad_norm": 0.4414823651313782, |
| "learning_rate": 0.0001099475273866601, |
| "loss": 1.6256, |
| "mean_token_accuracy": 0.6063946485519409, |
| "num_tokens": 14389471.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4177215189873418, |
| "grad_norm": 0.4640585780143738, |
| "learning_rate": 0.0001093641489534351, |
| "loss": 1.6266, |
| "mean_token_accuracy": 0.6118572354316711, |
| "num_tokens": 14442549.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.430379746835443, |
| "grad_norm": 0.4561823904514313, |
| "learning_rate": 0.0001087804488304506, |
| "loss": 1.6005, |
| "mean_token_accuracy": 0.6093841791152954, |
| "num_tokens": 14496917.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.4430379746835444, |
| "grad_norm": 0.4885174036026001, |
| "learning_rate": 0.00010819644706975332, |
| "loss": 1.564, |
| "mean_token_accuracy": 0.6223441362380981, |
| "num_tokens": 14547294.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4556962025316453, |
| "grad_norm": 0.43165430426597595, |
| "learning_rate": 0.00010761216373375221, |
| "loss": 1.6193, |
| "mean_token_accuracy": 0.6121744513511658, |
| "num_tokens": 14600650.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4683544303797467, |
| "grad_norm": 0.46113377809524536, |
| "learning_rate": 0.0001070276188945293, |
| "loss": 1.5433, |
| "mean_token_accuracy": 0.624561071395874, |
| "num_tokens": 14653684.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.481012658227848, |
| "grad_norm": 0.4514339864253998, |
| "learning_rate": 0.00010644283263315014, |
| "loss": 1.6049, |
| "mean_token_accuracy": 0.6116100549697876, |
| "num_tokens": 14708528.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4936708860759493, |
| "grad_norm": 0.5267874002456665, |
| "learning_rate": 0.00010585782503897388, |
| "loss": 1.6155, |
| "mean_token_accuracy": 0.6114990711212158, |
| "num_tokens": 14760857.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5063291139240507, |
| "grad_norm": 0.4393192231655121, |
| "learning_rate": 0.00010527261620896323, |
| "loss": 1.5409, |
| "mean_token_accuracy": 0.6235739588737488, |
| "num_tokens": 14814302.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.518987341772152, |
| "grad_norm": 0.4979285001754761, |
| "learning_rate": 0.00010468722624699401, |
| "loss": 1.6588, |
| "mean_token_accuracy": 0.6001515984535217, |
| "num_tokens": 14869767.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.5316455696202533, |
| "grad_norm": 0.4557904005050659, |
| "learning_rate": 0.00010410167526316457, |
| "loss": 1.6458, |
| "mean_token_accuracy": 0.6057513952255249, |
| "num_tokens": 14924809.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5443037974683547, |
| "grad_norm": 0.47976383566856384, |
| "learning_rate": 0.00010351598337310482, |
| "loss": 1.5589, |
| "mean_token_accuracy": 0.6206314563751221, |
| "num_tokens": 14979954.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5569620253164556, |
| "grad_norm": 0.4409061372280121, |
| "learning_rate": 0.00010293017069728535, |
| "loss": 1.6327, |
| "mean_token_accuracy": 0.6080577373504639, |
| "num_tokens": 15031819.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.569620253164557, |
| "grad_norm": 0.47851356863975525, |
| "learning_rate": 0.00010234425736032607, |
| "loss": 1.5299, |
| "mean_token_accuracy": 0.6291932463645935, |
| "num_tokens": 15083484.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5822784810126582, |
| "grad_norm": 0.44256338477134705, |
| "learning_rate": 0.00010175826349030496, |
| "loss": 1.5426, |
| "mean_token_accuracy": 0.624239444732666, |
| "num_tokens": 15134003.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5949367088607596, |
| "grad_norm": 0.4588923454284668, |
| "learning_rate": 0.00010117220921806664, |
| "loss": 1.5259, |
| "mean_token_accuracy": 0.6249427199363708, |
| "num_tokens": 15186435.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.607594936708861, |
| "grad_norm": 0.4287813901901245, |
| "learning_rate": 0.00010058611467653066, |
| "loss": 1.5826, |
| "mean_token_accuracy": 0.6139138340950012, |
| "num_tokens": 15240316.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.620253164556962, |
| "grad_norm": 0.44988927245140076, |
| "learning_rate": 0.0001, |
| "loss": 1.5698, |
| "mean_token_accuracy": 0.6190887689590454, |
| "num_tokens": 15292484.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.632911392405063, |
| "grad_norm": 0.4369228780269623, |
| "learning_rate": 9.941388532346934e-05, |
| "loss": 1.6259, |
| "mean_token_accuracy": 0.6063051223754883, |
| "num_tokens": 15345711.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6455696202531644, |
| "grad_norm": 0.44405412673950195, |
| "learning_rate": 9.882779078193339e-05, |
| "loss": 1.5726, |
| "mean_token_accuracy": 0.6200418472290039, |
| "num_tokens": 15399323.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.6582278481012658, |
| "grad_norm": 0.4382248520851135, |
| "learning_rate": 9.824173650969507e-05, |
| "loss": 1.5953, |
| "mean_token_accuracy": 0.61171555519104, |
| "num_tokens": 15453247.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.670886075949367, |
| "grad_norm": 0.44934383034706116, |
| "learning_rate": 9.765574263967396e-05, |
| "loss": 1.5937, |
| "mean_token_accuracy": 0.621938943862915, |
| "num_tokens": 15504070.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6835443037974684, |
| "grad_norm": 0.44672778248786926, |
| "learning_rate": 9.706982930271465e-05, |
| "loss": 1.5322, |
| "mean_token_accuracy": 0.6252855658531189, |
| "num_tokens": 15557540.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.6962025316455698, |
| "grad_norm": 0.45192646980285645, |
| "learning_rate": 9.648401662689521e-05, |
| "loss": 1.5109, |
| "mean_token_accuracy": 0.6344218254089355, |
| "num_tokens": 15606480.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.708860759493671, |
| "grad_norm": 0.4427901804447174, |
| "learning_rate": 9.589832473683547e-05, |
| "loss": 1.613, |
| "mean_token_accuracy": 0.614681601524353, |
| "num_tokens": 15660271.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.721518987341772, |
| "grad_norm": 0.45339709520339966, |
| "learning_rate": 9.531277375300599e-05, |
| "loss": 1.6333, |
| "mean_token_accuracy": 0.6080583930015564, |
| "num_tokens": 15714986.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.7341772151898733, |
| "grad_norm": 0.44133368134498596, |
| "learning_rate": 9.472738379103682e-05, |
| "loss": 1.5492, |
| "mean_token_accuracy": 0.6258243918418884, |
| "num_tokens": 15765390.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7468354430379747, |
| "grad_norm": 0.4260408282279968, |
| "learning_rate": 9.414217496102614e-05, |
| "loss": 1.6041, |
| "mean_token_accuracy": 0.6146592497825623, |
| "num_tokens": 15820600.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.759493670886076, |
| "grad_norm": 0.44411468505859375, |
| "learning_rate": 9.355716736684988e-05, |
| "loss": 1.6526, |
| "mean_token_accuracy": 0.6064497232437134, |
| "num_tokens": 15875643.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.7721518987341773, |
| "grad_norm": 0.43013662099838257, |
| "learning_rate": 9.297238110547074e-05, |
| "loss": 1.6829, |
| "mean_token_accuracy": 0.5955364108085632, |
| "num_tokens": 15931178.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.7848101265822782, |
| "grad_norm": 0.4368194341659546, |
| "learning_rate": 9.238783626624781e-05, |
| "loss": 1.5791, |
| "mean_token_accuracy": 0.6144816875457764, |
| "num_tokens": 15985338.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.7974683544303796, |
| "grad_norm": 0.45760172605514526, |
| "learning_rate": 9.180355293024669e-05, |
| "loss": 1.5706, |
| "mean_token_accuracy": 0.6167289018630981, |
| "num_tokens": 16038448.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.810126582278481, |
| "grad_norm": 0.4340561032295227, |
| "learning_rate": 9.121955116954942e-05, |
| "loss": 1.5906, |
| "mean_token_accuracy": 0.6153745055198669, |
| "num_tokens": 16091704.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8227848101265822, |
| "grad_norm": 0.42591392993927, |
| "learning_rate": 9.063585104656493e-05, |
| "loss": 1.5561, |
| "mean_token_accuracy": 0.6215280890464783, |
| "num_tokens": 16145809.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.8354430379746836, |
| "grad_norm": 0.4405565857887268, |
| "learning_rate": 9.005247261333993e-05, |
| "loss": 1.4882, |
| "mean_token_accuracy": 0.6390531659126282, |
| "num_tokens": 16198299.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.848101265822785, |
| "grad_norm": 0.4609524607658386, |
| "learning_rate": 8.946943591087e-05, |
| "loss": 1.5796, |
| "mean_token_accuracy": 0.6171963810920715, |
| "num_tokens": 16251223.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8607594936708862, |
| "grad_norm": 0.4306551218032837, |
| "learning_rate": 8.88867609684112e-05, |
| "loss": 1.5733, |
| "mean_token_accuracy": 0.6200153231620789, |
| "num_tokens": 16306155.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8734177215189876, |
| "grad_norm": 0.47058236598968506, |
| "learning_rate": 8.830446780279176e-05, |
| "loss": 1.599, |
| "mean_token_accuracy": 0.6126205325126648, |
| "num_tokens": 16360987.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8860759493670884, |
| "grad_norm": 0.46783286333084106, |
| "learning_rate": 8.772257641772479e-05, |
| "loss": 1.5925, |
| "mean_token_accuracy": 0.6167819499969482, |
| "num_tokens": 16413238.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.8987341772151898, |
| "grad_norm": 0.46523240208625793, |
| "learning_rate": 8.71411068031208e-05, |
| "loss": 1.5129, |
| "mean_token_accuracy": 0.6336224675178528, |
| "num_tokens": 16467260.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.911392405063291, |
| "grad_norm": 0.46208396553993225, |
| "learning_rate": 8.656007893440106e-05, |
| "loss": 1.6122, |
| "mean_token_accuracy": 0.6104090809822083, |
| "num_tokens": 16520662.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9240506329113924, |
| "grad_norm": 0.5171907544136047, |
| "learning_rate": 8.597951277181142e-05, |
| "loss": 1.6877, |
| "mean_token_accuracy": 0.5934458374977112, |
| "num_tokens": 16577850.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9367088607594938, |
| "grad_norm": 0.4658549427986145, |
| "learning_rate": 8.539942825973666e-05, |
| "loss": 1.5145, |
| "mean_token_accuracy": 0.6306940317153931, |
| "num_tokens": 16630074.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9493670886075947, |
| "grad_norm": 0.5423455834388733, |
| "learning_rate": 8.481984532601515e-05, |
| "loss": 1.7042, |
| "mean_token_accuracy": 0.5973284244537354, |
| "num_tokens": 16684788.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.962025316455696, |
| "grad_norm": 0.4419417679309845, |
| "learning_rate": 8.424078388125436e-05, |
| "loss": 1.5366, |
| "mean_token_accuracy": 0.627940833568573, |
| "num_tokens": 16736325.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.9746835443037973, |
| "grad_norm": 0.5917538404464722, |
| "learning_rate": 8.366226381814697e-05, |
| "loss": 1.6817, |
| "mean_token_accuracy": 0.5960053205490112, |
| "num_tokens": 16792964.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9873417721518987, |
| "grad_norm": 0.43734970688819885, |
| "learning_rate": 8.308430501078739e-05, |
| "loss": 1.5546, |
| "mean_token_accuracy": 0.621354877948761, |
| "num_tokens": 16846936.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.5773450136184692, |
| "learning_rate": 8.25069273139889e-05, |
| "loss": 1.3048, |
| "mean_token_accuracy": 0.6735352277755737, |
| "num_tokens": 16898151.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012658227848101, |
| "grad_norm": 0.6190834641456604, |
| "learning_rate": 8.19301505626018e-05, |
| "loss": 1.3439, |
| "mean_token_accuracy": 0.6669641137123108, |
| "num_tokens": 16952008.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025316455696203, |
| "grad_norm": 0.5162801146507263, |
| "learning_rate": 8.13539945708319e-05, |
| "loss": 1.2842, |
| "mean_token_accuracy": 0.6779625415802002, |
| "num_tokens": 17009438.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.037974683544304, |
| "grad_norm": 0.8861052989959717, |
| "learning_rate": 8.07784791315598e-05, |
| "loss": 1.2423, |
| "mean_token_accuracy": 0.6833261847496033, |
| "num_tokens": 17063065.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050632911392405, |
| "grad_norm": 0.7958038449287415, |
| "learning_rate": 8.020362401566103e-05, |
| "loss": 1.3678, |
| "mean_token_accuracy": 0.6559507250785828, |
| "num_tokens": 17121080.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063291139240507, |
| "grad_norm": 0.5480073094367981, |
| "learning_rate": 7.962944897132678e-05, |
| "loss": 1.2981, |
| "mean_token_accuracy": 0.6758822798728943, |
| "num_tokens": 17174387.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.075949367088608, |
| "grad_norm": 0.5921289920806885, |
| "learning_rate": 7.905597372338558e-05, |
| "loss": 1.3479, |
| "mean_token_accuracy": 0.6665363311767578, |
| "num_tokens": 17228166.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.0886075949367084, |
| "grad_norm": 0.5580439567565918, |
| "learning_rate": 7.848321797262548e-05, |
| "loss": 1.3442, |
| "mean_token_accuracy": 0.6631233096122742, |
| "num_tokens": 17279970.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.10126582278481, |
| "grad_norm": 0.5380421280860901, |
| "learning_rate": 7.791120139511752e-05, |
| "loss": 1.2944, |
| "mean_token_accuracy": 0.6707260608673096, |
| "num_tokens": 17334147.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.113924050632911, |
| "grad_norm": 0.6376309394836426, |
| "learning_rate": 7.733994364153969e-05, |
| "loss": 1.2812, |
| "mean_token_accuracy": 0.6757416129112244, |
| "num_tokens": 17383798.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.1265822784810124, |
| "grad_norm": 0.6679216027259827, |
| "learning_rate": 7.67694643365017e-05, |
| "loss": 1.3301, |
| "mean_token_accuracy": 0.6633830666542053, |
| "num_tokens": 17440101.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.139240506329114, |
| "grad_norm": 0.6206209659576416, |
| "learning_rate": 7.619978307787108e-05, |
| "loss": 1.2626, |
| "mean_token_accuracy": 0.6785885095596313, |
| "num_tokens": 17492366.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.151898734177215, |
| "grad_norm": 0.5746794939041138, |
| "learning_rate": 7.563091943609984e-05, |
| "loss": 1.2677, |
| "mean_token_accuracy": 0.6740871071815491, |
| "num_tokens": 17550513.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.1645569620253164, |
| "grad_norm": 0.5489034652709961, |
| "learning_rate": 7.506289295355198e-05, |
| "loss": 1.3781, |
| "mean_token_accuracy": 0.65250164270401, |
| "num_tokens": 17609219.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.177215189873418, |
| "grad_norm": 0.5608614683151245, |
| "learning_rate": 7.449572314383237e-05, |
| "loss": 1.2503, |
| "mean_token_accuracy": 0.6817007064819336, |
| "num_tokens": 17661897.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.189873417721519, |
| "grad_norm": 0.5509681105613708, |
| "learning_rate": 7.392942949111633e-05, |
| "loss": 1.2831, |
| "mean_token_accuracy": 0.6758288741111755, |
| "num_tokens": 17716642.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.2025316455696204, |
| "grad_norm": 0.5699339509010315, |
| "learning_rate": 7.336403144948022e-05, |
| "loss": 1.1983, |
| "mean_token_accuracy": 0.6953414678573608, |
| "num_tokens": 17769319.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.215189873417722, |
| "grad_norm": 0.5870381593704224, |
| "learning_rate": 7.279954844223323e-05, |
| "loss": 1.1973, |
| "mean_token_accuracy": 0.6953087449073792, |
| "num_tokens": 17821544.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.227848101265823, |
| "grad_norm": 0.5986402034759521, |
| "learning_rate": 7.223599986124994e-05, |
| "loss": 1.2402, |
| "mean_token_accuracy": 0.6869230270385742, |
| "num_tokens": 17873822.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.2405063291139244, |
| "grad_norm": 0.5851041078567505, |
| "learning_rate": 7.167340506630445e-05, |
| "loss": 1.2882, |
| "mean_token_accuracy": 0.6755807399749756, |
| "num_tokens": 17929117.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.253164556962025, |
| "grad_norm": 0.5770756006240845, |
| "learning_rate": 7.111178338440496e-05, |
| "loss": 1.337, |
| "mean_token_accuracy": 0.6594337224960327, |
| "num_tokens": 17981027.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.265822784810126, |
| "grad_norm": 0.55469810962677, |
| "learning_rate": 7.055115410913009e-05, |
| "loss": 1.1853, |
| "mean_token_accuracy": 0.7015496492385864, |
| "num_tokens": 18034651.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.2784810126582276, |
| "grad_norm": 0.5626926422119141, |
| "learning_rate": 6.999153649996595e-05, |
| "loss": 1.3398, |
| "mean_token_accuracy": 0.6679387092590332, |
| "num_tokens": 18089744.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.291139240506329, |
| "grad_norm": 0.5761396288871765, |
| "learning_rate": 6.943294978164454e-05, |
| "loss": 1.2738, |
| "mean_token_accuracy": 0.6804162859916687, |
| "num_tokens": 18142270.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.30379746835443, |
| "grad_norm": 0.5691214799880981, |
| "learning_rate": 6.887541314348333e-05, |
| "loss": 1.3552, |
| "mean_token_accuracy": 0.6607176661491394, |
| "num_tokens": 18195620.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.3164556962025316, |
| "grad_norm": 0.5720015168190002, |
| "learning_rate": 6.831894573872601e-05, |
| "loss": 1.3218, |
| "mean_token_accuracy": 0.6686378121376038, |
| "num_tokens": 18251997.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.329113924050633, |
| "grad_norm": 0.6008363962173462, |
| "learning_rate": 6.776356668388464e-05, |
| "loss": 1.2333, |
| "mean_token_accuracy": 0.6878805756568909, |
| "num_tokens": 18302311.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.341772151898734, |
| "grad_norm": 0.6210716366767883, |
| "learning_rate": 6.720929505808265e-05, |
| "loss": 1.2887, |
| "mean_token_accuracy": 0.6707760691642761, |
| "num_tokens": 18352666.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.3544303797468356, |
| "grad_norm": 0.5934692025184631, |
| "learning_rate": 6.665614990239969e-05, |
| "loss": 1.2217, |
| "mean_token_accuracy": 0.6912603974342346, |
| "num_tokens": 18402309.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.367088607594937, |
| "grad_norm": 0.5864667296409607, |
| "learning_rate": 6.610415021921747e-05, |
| "loss": 1.2923, |
| "mean_token_accuracy": 0.6747585535049438, |
| "num_tokens": 18456419.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.379746835443038, |
| "grad_norm": 0.5857178568840027, |
| "learning_rate": 6.555331497156672e-05, |
| "loss": 1.3078, |
| "mean_token_accuracy": 0.6736264824867249, |
| "num_tokens": 18508975.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3924050632911396, |
| "grad_norm": 0.5825328826904297, |
| "learning_rate": 6.50036630824761e-05, |
| "loss": 1.273, |
| "mean_token_accuracy": 0.6832161545753479, |
| "num_tokens": 18561387.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.405063291139241, |
| "grad_norm": 0.5755932331085205, |
| "learning_rate": 6.445521343432188e-05, |
| "loss": 1.2756, |
| "mean_token_accuracy": 0.6811782717704773, |
| "num_tokens": 18612950.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.417721518987342, |
| "grad_norm": 0.5817604064941406, |
| "learning_rate": 6.390798486817929e-05, |
| "loss": 1.3343, |
| "mean_token_accuracy": 0.6663679480552673, |
| "num_tokens": 18664340.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.430379746835443, |
| "grad_norm": 0.5856095552444458, |
| "learning_rate": 6.336199618317537e-05, |
| "loss": 1.3448, |
| "mean_token_accuracy": 0.6607745289802551, |
| "num_tokens": 18719562.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.443037974683544, |
| "grad_norm": 0.5836370587348938, |
| "learning_rate": 6.281726613584321e-05, |
| "loss": 1.3236, |
| "mean_token_accuracy": 0.6663780212402344, |
| "num_tokens": 18772746.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.455696202531645, |
| "grad_norm": 0.5693697929382324, |
| "learning_rate": 6.227381343947733e-05, |
| "loss": 1.4024, |
| "mean_token_accuracy": 0.6489980220794678, |
| "num_tokens": 18829049.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.468354430379747, |
| "grad_norm": 0.5808230042457581, |
| "learning_rate": 6.173165676349103e-05, |
| "loss": 1.3548, |
| "mean_token_accuracy": 0.6583444476127625, |
| "num_tokens": 18884707.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.481012658227848, |
| "grad_norm": 0.5697141289710999, |
| "learning_rate": 6.119081473277501e-05, |
| "loss": 1.2806, |
| "mean_token_accuracy": 0.6785191297531128, |
| "num_tokens": 18938037.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.493670886075949, |
| "grad_norm": 0.5767077803611755, |
| "learning_rate": 6.065130592705759e-05, |
| "loss": 1.3013, |
| "mean_token_accuracy": 0.6735213398933411, |
| "num_tokens": 18990328.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.506329113924051, |
| "grad_norm": 0.5735676288604736, |
| "learning_rate": 6.01131488802662e-05, |
| "loss": 1.3132, |
| "mean_token_accuracy": 0.6706185936927795, |
| "num_tokens": 19046567.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.518987341772152, |
| "grad_norm": 0.5731688141822815, |
| "learning_rate": 5.9576362079890925e-05, |
| "loss": 1.2473, |
| "mean_token_accuracy": 0.682766318321228, |
| "num_tokens": 19096632.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.531645569620253, |
| "grad_norm": 0.5659275650978088, |
| "learning_rate": 5.904096396634935e-05, |
| "loss": 1.3143, |
| "mean_token_accuracy": 0.6679917573928833, |
| "num_tokens": 19151535.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.544303797468355, |
| "grad_norm": 0.6067102551460266, |
| "learning_rate": 5.8506972932353035e-05, |
| "loss": 1.2347, |
| "mean_token_accuracy": 0.6812778115272522, |
| "num_tokens": 19201059.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.556962025316456, |
| "grad_norm": 0.6011271476745605, |
| "learning_rate": 5.797440732227555e-05, |
| "loss": 1.2771, |
| "mean_token_accuracy": 0.6814538836479187, |
| "num_tokens": 19252902.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.569620253164557, |
| "grad_norm": 0.5889953374862671, |
| "learning_rate": 5.744328543152253e-05, |
| "loss": 1.3188, |
| "mean_token_accuracy": 0.6712836027145386, |
| "num_tokens": 19306465.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.582278481012658, |
| "grad_norm": 0.587265133857727, |
| "learning_rate": 5.691362550590297e-05, |
| "loss": 1.2569, |
| "mean_token_accuracy": 0.682069718837738, |
| "num_tokens": 19360739.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.594936708860759, |
| "grad_norm": 0.5950151085853577, |
| "learning_rate": 5.638544574100249e-05, |
| "loss": 1.2659, |
| "mean_token_accuracy": 0.6816703677177429, |
| "num_tokens": 19414612.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.6075949367088604, |
| "grad_norm": 0.6016396284103394, |
| "learning_rate": 5.585876428155824e-05, |
| "loss": 1.238, |
| "mean_token_accuracy": 0.6834296584129333, |
| "num_tokens": 19466914.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.620253164556962, |
| "grad_norm": 0.5939626693725586, |
| "learning_rate": 5.533359922083562e-05, |
| "loss": 1.3226, |
| "mean_token_accuracy": 0.6637207269668579, |
| "num_tokens": 19521516.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.632911392405063, |
| "grad_norm": 0.5587190389633179, |
| "learning_rate": 5.4809968600006635e-05, |
| "loss": 1.2707, |
| "mean_token_accuracy": 0.6756612658500671, |
| "num_tokens": 19577799.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.6455696202531644, |
| "grad_norm": 0.5682988166809082, |
| "learning_rate": 5.4287890407530175e-05, |
| "loss": 1.2354, |
| "mean_token_accuracy": 0.6873900890350342, |
| "num_tokens": 19630750.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.658227848101266, |
| "grad_norm": 0.5705362558364868, |
| "learning_rate": 5.3767382578534e-05, |
| "loss": 1.3058, |
| "mean_token_accuracy": 0.670261561870575, |
| "num_tokens": 19685521.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.670886075949367, |
| "grad_norm": 0.5939800143241882, |
| "learning_rate": 5.324846299419879e-05, |
| "loss": 1.2875, |
| "mean_token_accuracy": 0.6791155934333801, |
| "num_tokens": 19735924.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.6835443037974684, |
| "grad_norm": 0.5905841588973999, |
| "learning_rate": 5.273114948114346e-05, |
| "loss": 1.29, |
| "mean_token_accuracy": 0.6750991344451904, |
| "num_tokens": 19790223.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.69620253164557, |
| "grad_norm": 0.5728279948234558, |
| "learning_rate": 5.2215459810813306e-05, |
| "loss": 1.3004, |
| "mean_token_accuracy": 0.6714416742324829, |
| "num_tokens": 19843830.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.708860759493671, |
| "grad_norm": 0.5861008763313293, |
| "learning_rate": 5.170141169886904e-05, |
| "loss": 1.3081, |
| "mean_token_accuracy": 0.6724933385848999, |
| "num_tokens": 19895896.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.7215189873417724, |
| "grad_norm": 0.590370237827301, |
| "learning_rate": 5.118902280457829e-05, |
| "loss": 1.3177, |
| "mean_token_accuracy": 0.6696312427520752, |
| "num_tokens": 19951955.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.734177215189874, |
| "grad_norm": 0.5858080387115479, |
| "learning_rate": 5.0678310730209275e-05, |
| "loss": 1.2543, |
| "mean_token_accuracy": 0.6782749891281128, |
| "num_tokens": 20006233.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.746835443037975, |
| "grad_norm": 0.5834558606147766, |
| "learning_rate": 5.016929302042563e-05, |
| "loss": 1.2638, |
| "mean_token_accuracy": 0.6811890602111816, |
| "num_tokens": 20059548.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.759493670886076, |
| "grad_norm": 0.587447464466095, |
| "learning_rate": 4.9661987161684045e-05, |
| "loss": 1.2763, |
| "mean_token_accuracy": 0.6746391654014587, |
| "num_tokens": 20112126.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.772151898734177, |
| "grad_norm": 0.5700677037239075, |
| "learning_rate": 4.9156410581633317e-05, |
| "loss": 1.3477, |
| "mean_token_accuracy": 0.6617173552513123, |
| "num_tokens": 20167484.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.784810126582278, |
| "grad_norm": 0.5649070143699646, |
| "learning_rate": 4.865258064851579e-05, |
| "loss": 1.3037, |
| "mean_token_accuracy": 0.6660420894622803, |
| "num_tokens": 20221983.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.7974683544303796, |
| "grad_norm": 0.5917767882347107, |
| "learning_rate": 4.8150514670570754e-05, |
| "loss": 1.3665, |
| "mean_token_accuracy": 0.6614978909492493, |
| "num_tokens": 20273252.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.810126582278481, |
| "grad_norm": 0.6018021702766418, |
| "learning_rate": 4.765022989543958e-05, |
| "loss": 1.3038, |
| "mean_token_accuracy": 0.6711691617965698, |
| "num_tokens": 20325361.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.822784810126582, |
| "grad_norm": 0.5708827376365662, |
| "learning_rate": 4.7151743509573444e-05, |
| "loss": 1.3366, |
| "mean_token_accuracy": 0.6616772413253784, |
| "num_tokens": 20383615.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.8354430379746836, |
| "grad_norm": 0.586915135383606, |
| "learning_rate": 4.665507263764299e-05, |
| "loss": 1.324, |
| "mean_token_accuracy": 0.6650412082672119, |
| "num_tokens": 20439047.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.848101265822785, |
| "grad_norm": 0.5868443250656128, |
| "learning_rate": 4.6160234341949646e-05, |
| "loss": 1.2787, |
| "mean_token_accuracy": 0.6764598488807678, |
| "num_tokens": 20493809.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.860759493670886, |
| "grad_norm": 0.5989151000976562, |
| "learning_rate": 4.5667245621839974e-05, |
| "loss": 1.2877, |
| "mean_token_accuracy": 0.6735488176345825, |
| "num_tokens": 20544245.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8734177215189876, |
| "grad_norm": 0.5820327997207642, |
| "learning_rate": 4.5176123413121284e-05, |
| "loss": 1.3003, |
| "mean_token_accuracy": 0.6759911179542542, |
| "num_tokens": 20598289.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.886075949367089, |
| "grad_norm": 0.5799569487571716, |
| "learning_rate": 4.468688458748006e-05, |
| "loss": 1.2629, |
| "mean_token_accuracy": 0.6812482476234436, |
| "num_tokens": 20651708.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.89873417721519, |
| "grad_norm": 0.5748412609100342, |
| "learning_rate": 4.4199545951902286e-05, |
| "loss": 1.2656, |
| "mean_token_accuracy": 0.679618775844574, |
| "num_tokens": 20703501.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.911392405063291, |
| "grad_norm": 0.595779538154602, |
| "learning_rate": 4.3714124248096067e-05, |
| "loss": 1.2518, |
| "mean_token_accuracy": 0.683225691318512, |
| "num_tokens": 20755138.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.924050632911392, |
| "grad_norm": 0.5738579034805298, |
| "learning_rate": 4.3230636151916495e-05, |
| "loss": 1.2484, |
| "mean_token_accuracy": 0.6847042441368103, |
| "num_tokens": 20807223.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.936708860759493, |
| "grad_norm": 0.5756692290306091, |
| "learning_rate": 4.274909827279283e-05, |
| "loss": 1.3462, |
| "mean_token_accuracy": 0.6611171960830688, |
| "num_tokens": 20863749.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.949367088607595, |
| "grad_norm": 0.5885776281356812, |
| "learning_rate": 4.226952715315779e-05, |
| "loss": 1.2916, |
| "mean_token_accuracy": 0.6735062003135681, |
| "num_tokens": 20916497.0, |
| "step": 391 |
| }, |
| { |
| "epoch": 4.962025316455696, |
| "grad_norm": 0.6201795935630798, |
| "learning_rate": 4.17919392678795e-05, |
| "loss": 1.1691, |
| "mean_token_accuracy": 0.6980156302452087, |
| "num_tokens": 20964335.0, |
| "step": 392 |
| }, |
| { |
| "epoch": 4.974683544303797, |
| "grad_norm": 0.5966718196868896, |
| "learning_rate": 4.131635102369513e-05, |
| "loss": 1.3067, |
| "mean_token_accuracy": 0.6753334999084473, |
| "num_tokens": 21020321.0, |
| "step": 393 |
| }, |
| { |
| "epoch": 4.987341772151899, |
| "grad_norm": 0.5949414968490601, |
| "learning_rate": 4.084277875864776e-05, |
| "loss": 1.316, |
| "mean_token_accuracy": 0.6707158088684082, |
| "num_tokens": 21071013.0, |
| "step": 394 |
| }, |
| { |
| "epoch": 5.0, |
| "grad_norm": 0.6401087045669556, |
| "learning_rate": 4.037123874152472e-05, |
| "loss": 1.0996, |
| "mean_token_accuracy": 0.7210924029350281, |
| "num_tokens": 21124428.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 5.012658227848101, |
| "grad_norm": 0.7365010976791382, |
| "learning_rate": 3.9901747171298766e-05, |
| "loss": 1.0391, |
| "mean_token_accuracy": 0.7338370084762573, |
| "num_tokens": 21177437.0, |
| "step": 396 |
| }, |
| { |
| "epoch": 5.025316455696203, |
| "grad_norm": 0.6505429148674011, |
| "learning_rate": 3.943432017657186e-05, |
| "loss": 0.9978, |
| "mean_token_accuracy": 0.7425819635391235, |
| "num_tokens": 21233884.0, |
| "step": 397 |
| }, |
| { |
| "epoch": 5.037974683544304, |
| "grad_norm": 0.6625313758850098, |
| "learning_rate": 3.8968973815020806e-05, |
| "loss": 1.0228, |
| "mean_token_accuracy": 0.7341680526733398, |
| "num_tokens": 21289374.0, |
| "step": 398 |
| }, |
| { |
| "epoch": 5.050632911392405, |
| "grad_norm": 1.0251473188400269, |
| "learning_rate": 3.850572407284569e-05, |
| "loss": 0.9728, |
| "mean_token_accuracy": 0.7449803352355957, |
| "num_tokens": 21340089.0, |
| "step": 399 |
| }, |
| { |
| "epoch": 5.063291139240507, |
| "grad_norm": 1.1878520250320435, |
| "learning_rate": 3.80445868642208e-05, |
| "loss": 1.0699, |
| "mean_token_accuracy": 0.7249756455421448, |
| "num_tokens": 21388356.0, |
| "step": 400 |
| }, |
| { |
| "epoch": 5.075949367088608, |
| "grad_norm": 0.8483335971832275, |
| "learning_rate": 3.7585578030747744e-05, |
| "loss": 1.0448, |
| "mean_token_accuracy": 0.7355468273162842, |
| "num_tokens": 21439862.0, |
| "step": 401 |
| }, |
| { |
| "epoch": 5.0886075949367084, |
| "grad_norm": 0.6893622279167175, |
| "learning_rate": 3.7128713340911535e-05, |
| "loss": 0.961, |
| "mean_token_accuracy": 0.7475458979606628, |
| "num_tokens": 21493001.0, |
| "step": 402 |
| }, |
| { |
| "epoch": 5.10126582278481, |
| "grad_norm": 0.6758370399475098, |
| "learning_rate": 3.667400848953845e-05, |
| "loss": 1.008, |
| "mean_token_accuracy": 0.7371683716773987, |
| "num_tokens": 21548553.0, |
| "step": 403 |
| }, |
| { |
| "epoch": 5.113924050632911, |
| "grad_norm": 0.6713793277740479, |
| "learning_rate": 3.622147909725724e-05, |
| "loss": 1.001, |
| "mean_token_accuracy": 0.7425588369369507, |
| "num_tokens": 21602540.0, |
| "step": 404 |
| }, |
| { |
| "epoch": 5.1265822784810124, |
| "grad_norm": 0.6601512432098389, |
| "learning_rate": 3.577114070996247e-05, |
| "loss": 1.0354, |
| "mean_token_accuracy": 0.7336742281913757, |
| "num_tokens": 21654822.0, |
| "step": 405 |
| }, |
| { |
| "epoch": 5.139240506329114, |
| "grad_norm": 0.6632497906684875, |
| "learning_rate": 3.532300879828013e-05, |
| "loss": 1.0393, |
| "mean_token_accuracy": 0.7334464192390442, |
| "num_tokens": 21711490.0, |
| "step": 406 |
| }, |
| { |
| "epoch": 5.151898734177215, |
| "grad_norm": 0.7294788956642151, |
| "learning_rate": 3.4877098757036665e-05, |
| "loss": 1.0106, |
| "mean_token_accuracy": 0.7395373582839966, |
| "num_tokens": 21762521.0, |
| "step": 407 |
| }, |
| { |
| "epoch": 5.1645569620253164, |
| "grad_norm": 0.746837317943573, |
| "learning_rate": 3.44334259047297e-05, |
| "loss": 1.0651, |
| "mean_token_accuracy": 0.7258839011192322, |
| "num_tokens": 21815081.0, |
| "step": 408 |
| }, |
| { |
| "epoch": 5.177215189873418, |
| "grad_norm": 0.806247889995575, |
| "learning_rate": 3.3992005483002e-05, |
| "loss": 1.0844, |
| "mean_token_accuracy": 0.7215079069137573, |
| "num_tokens": 21871064.0, |
| "step": 409 |
| }, |
| { |
| "epoch": 5.189873417721519, |
| "grad_norm": 0.8033056855201721, |
| "learning_rate": 3.355285265611784e-05, |
| "loss": 1.0074, |
| "mean_token_accuracy": 0.7389492392539978, |
| "num_tokens": 21924405.0, |
| "step": 410 |
| }, |
| { |
| "epoch": 5.2025316455696204, |
| "grad_norm": 0.7441568970680237, |
| "learning_rate": 3.3115982510442014e-05, |
| "loss": 1.0617, |
| "mean_token_accuracy": 0.7245724201202393, |
| "num_tokens": 21981769.0, |
| "step": 411 |
| }, |
| { |
| "epoch": 5.215189873417722, |
| "grad_norm": 0.7295483350753784, |
| "learning_rate": 3.268141005392163e-05, |
| "loss": 1.062, |
| "mean_token_accuracy": 0.7272607684135437, |
| "num_tokens": 22034990.0, |
| "step": 412 |
| }, |
| { |
| "epoch": 5.227848101265823, |
| "grad_norm": 0.6898937821388245, |
| "learning_rate": 3.224915021557049e-05, |
| "loss": 0.9831, |
| "mean_token_accuracy": 0.7429006695747375, |
| "num_tokens": 22089566.0, |
| "step": 413 |
| }, |
| { |
| "epoch": 5.2405063291139244, |
| "grad_norm": 0.6886006593704224, |
| "learning_rate": 3.1819217844956214e-05, |
| "loss": 0.9795, |
| "mean_token_accuracy": 0.7483858466148376, |
| "num_tokens": 22141515.0, |
| "step": 414 |
| }, |
| { |
| "epoch": 5.253164556962025, |
| "grad_norm": 0.6947466135025024, |
| "learning_rate": 3.1391627711690296e-05, |
| "loss": 1.0315, |
| "mean_token_accuracy": 0.7290645241737366, |
| "num_tokens": 22195005.0, |
| "step": 415 |
| }, |
| { |
| "epoch": 5.265822784810126, |
| "grad_norm": 0.6854252815246582, |
| "learning_rate": 3.0966394504920317e-05, |
| "loss": 1.0079, |
| "mean_token_accuracy": 0.7384724617004395, |
| "num_tokens": 22250111.0, |
| "step": 416 |
| }, |
| { |
| "epoch": 5.2784810126582276, |
| "grad_norm": 0.6747215390205383, |
| "learning_rate": 3.0543532832825715e-05, |
| "loss": 1.0281, |
| "mean_token_accuracy": 0.7306157350540161, |
| "num_tokens": 22307554.0, |
| "step": 417 |
| }, |
| { |
| "epoch": 5.291139240506329, |
| "grad_norm": 0.7181615829467773, |
| "learning_rate": 3.0123057222115836e-05, |
| "loss": 1.0336, |
| "mean_token_accuracy": 0.7309041619300842, |
| "num_tokens": 22358637.0, |
| "step": 418 |
| }, |
| { |
| "epoch": 5.30379746835443, |
| "grad_norm": 0.7213126420974731, |
| "learning_rate": 2.9704982117530777e-05, |
| "loss": 1.0904, |
| "mean_token_accuracy": 0.7194147706031799, |
| "num_tokens": 22415297.0, |
| "step": 419 |
| }, |
| { |
| "epoch": 5.3164556962025316, |
| "grad_norm": 0.7304534316062927, |
| "learning_rate": 2.9289321881345254e-05, |
| "loss": 1.0136, |
| "mean_token_accuracy": 0.736984372138977, |
| "num_tokens": 22469008.0, |
| "step": 420 |
| }, |
| { |
| "epoch": 5.329113924050633, |
| "grad_norm": 0.7307331562042236, |
| "learning_rate": 2.887609079287521e-05, |
| "loss": 1.0368, |
| "mean_token_accuracy": 0.7307581305503845, |
| "num_tokens": 22524472.0, |
| "step": 421 |
| }, |
| { |
| "epoch": 5.341772151898734, |
| "grad_norm": 0.7253232002258301, |
| "learning_rate": 2.8465303047987267e-05, |
| "loss": 1.0469, |
| "mean_token_accuracy": 0.7322298884391785, |
| "num_tokens": 22578489.0, |
| "step": 422 |
| }, |
| { |
| "epoch": 5.3544303797468356, |
| "grad_norm": 0.7165502309799194, |
| "learning_rate": 2.805697275861101e-05, |
| "loss": 0.9725, |
| "mean_token_accuracy": 0.7465605139732361, |
| "num_tokens": 22629796.0, |
| "step": 423 |
| }, |
| { |
| "epoch": 5.367088607594937, |
| "grad_norm": 0.7150178551673889, |
| "learning_rate": 2.765111395225424e-05, |
| "loss": 1.0024, |
| "mean_token_accuracy": 0.7396253347396851, |
| "num_tokens": 22681693.0, |
| "step": 424 |
| }, |
| { |
| "epoch": 5.379746835443038, |
| "grad_norm": 0.6943763494491577, |
| "learning_rate": 2.7247740571521118e-05, |
| "loss": 1.0145, |
| "mean_token_accuracy": 0.7367216348648071, |
| "num_tokens": 22732008.0, |
| "step": 425 |
| }, |
| { |
| "epoch": 5.3924050632911396, |
| "grad_norm": 0.6839891672134399, |
| "learning_rate": 2.6846866473633125e-05, |
| "loss": 0.9447, |
| "mean_token_accuracy": 0.7547025084495544, |
| "num_tokens": 22784119.0, |
| "step": 426 |
| }, |
| { |
| "epoch": 5.405063291139241, |
| "grad_norm": 0.671549916267395, |
| "learning_rate": 2.6448505429952917e-05, |
| "loss": 1.0198, |
| "mean_token_accuracy": 0.733854353427887, |
| "num_tokens": 22840096.0, |
| "step": 427 |
| }, |
| { |
| "epoch": 5.417721518987342, |
| "grad_norm": 0.6969998478889465, |
| "learning_rate": 2.605267112551154e-05, |
| "loss": 1.057, |
| "mean_token_accuracy": 0.7291796803474426, |
| "num_tokens": 22894698.0, |
| "step": 428 |
| }, |
| { |
| "epoch": 5.430379746835443, |
| "grad_norm": 0.6982560753822327, |
| "learning_rate": 2.5659377158538012e-05, |
| "loss": 1.0138, |
| "mean_token_accuracy": 0.7372158765792847, |
| "num_tokens": 22947992.0, |
| "step": 429 |
| }, |
| { |
| "epoch": 5.443037974683544, |
| "grad_norm": 0.7151924967765808, |
| "learning_rate": 2.5268637039992293e-05, |
| "loss": 0.9917, |
| "mean_token_accuracy": 0.7383322715759277, |
| "num_tokens": 23000294.0, |
| "step": 430 |
| }, |
| { |
| "epoch": 5.455696202531645, |
| "grad_norm": 0.7005829215049744, |
| "learning_rate": 2.488046419310114e-05, |
| "loss": 1.0214, |
| "mean_token_accuracy": 0.734840989112854, |
| "num_tokens": 23055985.0, |
| "step": 431 |
| }, |
| { |
| "epoch": 5.468354430379747, |
| "grad_norm": 0.7062477469444275, |
| "learning_rate": 2.4494871952896947e-05, |
| "loss": 1.0029, |
| "mean_token_accuracy": 0.7360851764678955, |
| "num_tokens": 23110703.0, |
| "step": 432 |
| }, |
| { |
| "epoch": 5.481012658227848, |
| "grad_norm": 0.6942815184593201, |
| "learning_rate": 2.411187356575969e-05, |
| "loss": 1.0621, |
| "mean_token_accuracy": 0.7231142520904541, |
| "num_tokens": 23166447.0, |
| "step": 433 |
| }, |
| { |
| "epoch": 5.493670886075949, |
| "grad_norm": 0.742875337600708, |
| "learning_rate": 2.3731482188961818e-05, |
| "loss": 1.0389, |
| "mean_token_accuracy": 0.7320136427879333, |
| "num_tokens": 23218898.0, |
| "step": 434 |
| }, |
| { |
| "epoch": 5.506329113924051, |
| "grad_norm": 0.7092304229736328, |
| "learning_rate": 2.335371089021623e-05, |
| "loss": 1.0546, |
| "mean_token_accuracy": 0.7280179858207703, |
| "num_tokens": 23272392.0, |
| "step": 435 |
| }, |
| { |
| "epoch": 5.518987341772152, |
| "grad_norm": 0.7047234773635864, |
| "learning_rate": 2.297857264722756e-05, |
| "loss": 0.9799, |
| "mean_token_accuracy": 0.7427883744239807, |
| "num_tokens": 23326050.0, |
| "step": 436 |
| }, |
| { |
| "epoch": 5.531645569620253, |
| "grad_norm": 0.7014687061309814, |
| "learning_rate": 2.260608034724595e-05, |
| "loss": 1.0677, |
| "mean_token_accuracy": 0.724626898765564, |
| "num_tokens": 23381192.0, |
| "step": 437 |
| }, |
| { |
| "epoch": 5.544303797468355, |
| "grad_norm": 0.6740880012512207, |
| "learning_rate": 2.2236246786624792e-05, |
| "loss": 1.039, |
| "mean_token_accuracy": 0.737155556678772, |
| "num_tokens": 23438849.0, |
| "step": 438 |
| }, |
| { |
| "epoch": 5.556962025316456, |
| "grad_norm": 0.6918567419052124, |
| "learning_rate": 2.1869084670380835e-05, |
| "loss": 1.0365, |
| "mean_token_accuracy": 0.7317704558372498, |
| "num_tokens": 23492617.0, |
| "step": 439 |
| }, |
| { |
| "epoch": 5.569620253164557, |
| "grad_norm": 0.6956952214241028, |
| "learning_rate": 2.150460661175768e-05, |
| "loss": 1.0282, |
| "mean_token_accuracy": 0.7331886887550354, |
| "num_tokens": 23544759.0, |
| "step": 440 |
| }, |
| { |
| "epoch": 5.582278481012658, |
| "grad_norm": 0.6904217004776001, |
| "learning_rate": 2.114282513179281e-05, |
| "loss": 1.0341, |
| "mean_token_accuracy": 0.7316084504127502, |
| "num_tokens": 23596151.0, |
| "step": 441 |
| }, |
| { |
| "epoch": 5.594936708860759, |
| "grad_norm": 0.7040565609931946, |
| "learning_rate": 2.0783752658887066e-05, |
| "loss": 1.0227, |
| "mean_token_accuracy": 0.7370526790618896, |
| "num_tokens": 23650203.0, |
| "step": 442 |
| }, |
| { |
| "epoch": 5.6075949367088604, |
| "grad_norm": 0.7769550085067749, |
| "learning_rate": 2.0427401528377953e-05, |
| "loss": 1.0127, |
| "mean_token_accuracy": 0.7367920875549316, |
| "num_tokens": 23701808.0, |
| "step": 443 |
| }, |
| { |
| "epoch": 5.620253164556962, |
| "grad_norm": 0.7274349927902222, |
| "learning_rate": 2.0073783982115723e-05, |
| "loss": 1.0214, |
| "mean_token_accuracy": 0.7346363067626953, |
| "num_tokens": 23752218.0, |
| "step": 444 |
| }, |
| { |
| "epoch": 5.632911392405063, |
| "grad_norm": 0.7190005779266357, |
| "learning_rate": 1.9722912168042897e-05, |
| "loss": 0.9928, |
| "mean_token_accuracy": 0.745000958442688, |
| "num_tokens": 23803392.0, |
| "step": 445 |
| }, |
| { |
| "epoch": 5.6455696202531644, |
| "grad_norm": 0.7127588391304016, |
| "learning_rate": 1.937479813977703e-05, |
| "loss": 1.0507, |
| "mean_token_accuracy": 0.724457323551178, |
| "num_tokens": 23854958.0, |
| "step": 446 |
| }, |
| { |
| "epoch": 5.658227848101266, |
| "grad_norm": 0.7291621565818787, |
| "learning_rate": 1.9029453856196376e-05, |
| "loss": 1.019, |
| "mean_token_accuracy": 0.7388318181037903, |
| "num_tokens": 23904963.0, |
| "step": 447 |
| }, |
| { |
| "epoch": 5.670886075949367, |
| "grad_norm": 0.7113199830055237, |
| "learning_rate": 1.868689118102931e-05, |
| "loss": 1.0059, |
| "mean_token_accuracy": 0.7382575273513794, |
| "num_tokens": 23959466.0, |
| "step": 448 |
| }, |
| { |
| "epoch": 5.6835443037974684, |
| "grad_norm": 0.6915891170501709, |
| "learning_rate": 1.8347121882446717e-05, |
| "loss": 1.0548, |
| "mean_token_accuracy": 0.7301124930381775, |
| "num_tokens": 24015809.0, |
| "step": 449 |
| }, |
| { |
| "epoch": 5.69620253164557, |
| "grad_norm": 0.7390320301055908, |
| "learning_rate": 1.8010157632657543e-05, |
| "loss": 1.0465, |
| "mean_token_accuracy": 0.7288335561752319, |
| "num_tokens": 24066661.0, |
| "step": 450 |
| }, |
| { |
| "epoch": 5.708860759493671, |
| "grad_norm": 0.6886243224143982, |
| "learning_rate": 1.7676010007508092e-05, |
| "loss": 1.0437, |
| "mean_token_accuracy": 0.7315667271614075, |
| "num_tokens": 24120690.0, |
| "step": 451 |
| }, |
| { |
| "epoch": 5.7215189873417724, |
| "grad_norm": 0.6963152289390564, |
| "learning_rate": 1.7344690486084137e-05, |
| "loss": 1.0505, |
| "mean_token_accuracy": 0.7260193824768066, |
| "num_tokens": 24175444.0, |
| "step": 452 |
| }, |
| { |
| "epoch": 5.734177215189874, |
| "grad_norm": 0.6931020617485046, |
| "learning_rate": 1.701621045031666e-05, |
| "loss": 1.0465, |
| "mean_token_accuracy": 0.7293127775192261, |
| "num_tokens": 24229829.0, |
| "step": 453 |
| }, |
| { |
| "epoch": 5.746835443037975, |
| "grad_norm": 0.7032824754714966, |
| "learning_rate": 1.6690581184590858e-05, |
| "loss": 1.098, |
| "mean_token_accuracy": 0.7177731394767761, |
| "num_tokens": 24284374.0, |
| "step": 454 |
| }, |
| { |
| "epoch": 5.759493670886076, |
| "grad_norm": 0.6938078999519348, |
| "learning_rate": 1.636781387535843e-05, |
| "loss": 1.0065, |
| "mean_token_accuracy": 0.7374997735023499, |
| "num_tokens": 24335977.0, |
| "step": 455 |
| }, |
| { |
| "epoch": 5.772151898734177, |
| "grad_norm": 0.7007805705070496, |
| "learning_rate": 1.604791961075336e-05, |
| "loss": 1.0198, |
| "mean_token_accuracy": 0.734321653842926, |
| "num_tokens": 24389937.0, |
| "step": 456 |
| }, |
| { |
| "epoch": 5.784810126582278, |
| "grad_norm": 0.704025387763977, |
| "learning_rate": 1.5730909380210945e-05, |
| "loss": 1.0306, |
| "mean_token_accuracy": 0.7323794364929199, |
| "num_tokens": 24443674.0, |
| "step": 457 |
| }, |
| { |
| "epoch": 5.7974683544303796, |
| "grad_norm": 0.7411045432090759, |
| "learning_rate": 1.5416794074090258e-05, |
| "loss": 1.0176, |
| "mean_token_accuracy": 0.7357881665229797, |
| "num_tokens": 24492676.0, |
| "step": 458 |
| }, |
| { |
| "epoch": 5.810126582278481, |
| "grad_norm": 0.7155459523200989, |
| "learning_rate": 1.5105584483300162e-05, |
| "loss": 1.0839, |
| "mean_token_accuracy": 0.7148189544677734, |
| "num_tokens": 24544714.0, |
| "step": 459 |
| }, |
| { |
| "epoch": 5.822784810126582, |
| "grad_norm": 0.7093493342399597, |
| "learning_rate": 1.479729129892835e-05, |
| "loss": 1.0426, |
| "mean_token_accuracy": 0.7318651676177979, |
| "num_tokens": 24599314.0, |
| "step": 460 |
| }, |
| { |
| "epoch": 5.8354430379746836, |
| "grad_norm": 0.7229861617088318, |
| "learning_rate": 1.4491925111874383e-05, |
| "loss": 1.0331, |
| "mean_token_accuracy": 0.7305112481117249, |
| "num_tokens": 24653499.0, |
| "step": 461 |
| }, |
| { |
| "epoch": 5.848101265822785, |
| "grad_norm": 0.682659924030304, |
| "learning_rate": 1.4189496412485592e-05, |
| "loss": 1.0739, |
| "mean_token_accuracy": 0.7230107188224792, |
| "num_tokens": 24710493.0, |
| "step": 462 |
| }, |
| { |
| "epoch": 5.860759493670886, |
| "grad_norm": 0.6993433833122253, |
| "learning_rate": 1.3890015590196803e-05, |
| "loss": 1.0591, |
| "mean_token_accuracy": 0.7279648780822754, |
| "num_tokens": 24765719.0, |
| "step": 463 |
| }, |
| { |
| "epoch": 5.8734177215189876, |
| "grad_norm": 0.7131443023681641, |
| "learning_rate": 1.3593492933173512e-05, |
| "loss": 1.0473, |
| "mean_token_accuracy": 0.7293837666511536, |
| "num_tokens": 24819527.0, |
| "step": 464 |
| }, |
| { |
| "epoch": 5.886075949367089, |
| "grad_norm": 0.6991192698478699, |
| "learning_rate": 1.3299938627958297e-05, |
| "loss": 1.0703, |
| "mean_token_accuracy": 0.7221192121505737, |
| "num_tokens": 24874064.0, |
| "step": 465 |
| }, |
| { |
| "epoch": 5.89873417721519, |
| "grad_norm": 0.6935943961143494, |
| "learning_rate": 1.300936275912098e-05, |
| "loss": 0.9366, |
| "mean_token_accuracy": 0.7561765313148499, |
| "num_tokens": 24925694.0, |
| "step": 466 |
| }, |
| { |
| "epoch": 5.911392405063291, |
| "grad_norm": 0.7046949863433838, |
| "learning_rate": 1.2721775308912132e-05, |
| "loss": 1.0577, |
| "mean_token_accuracy": 0.7263013124465942, |
| "num_tokens": 24978915.0, |
| "step": 467 |
| }, |
| { |
| "epoch": 5.924050632911392, |
| "grad_norm": 0.6971089839935303, |
| "learning_rate": 1.2437186156920167e-05, |
| "loss": 1.0268, |
| "mean_token_accuracy": 0.7334689497947693, |
| "num_tokens": 25030110.0, |
| "step": 468 |
| }, |
| { |
| "epoch": 5.936708860759493, |
| "grad_norm": 0.7104247808456421, |
| "learning_rate": 1.2155605079732046e-05, |
| "loss": 1.062, |
| "mean_token_accuracy": 0.7263693809509277, |
| "num_tokens": 25083410.0, |
| "step": 469 |
| }, |
| { |
| "epoch": 5.949367088607595, |
| "grad_norm": 0.7165059447288513, |
| "learning_rate": 1.1877041750597173e-05, |
| "loss": 1.0257, |
| "mean_token_accuracy": 0.7345736622810364, |
| "num_tokens": 25135074.0, |
| "step": 470 |
| }, |
| { |
| "epoch": 5.962025316455696, |
| "grad_norm": 0.720089852809906, |
| "learning_rate": 1.160150573909532e-05, |
| "loss": 1.0055, |
| "mean_token_accuracy": 0.7425574064254761, |
| "num_tokens": 25185087.0, |
| "step": 471 |
| }, |
| { |
| "epoch": 5.974683544303797, |
| "grad_norm": 0.7024204730987549, |
| "learning_rate": 1.132900651080785e-05, |
| "loss": 1.0197, |
| "mean_token_accuracy": 0.7319695353507996, |
| "num_tokens": 25241514.0, |
| "step": 472 |
| }, |
| { |
| "epoch": 5.987341772151899, |
| "grad_norm": 0.6910815834999084, |
| "learning_rate": 1.1059553426992365e-05, |
| "loss": 1.0526, |
| "mean_token_accuracy": 0.7272513508796692, |
| "num_tokens": 25296867.0, |
| "step": 473 |
| }, |
| { |
| "epoch": 6.0, |
| "grad_norm": 0.6968879699707031, |
| "learning_rate": 1.0793155744261351e-05, |
| "loss": 0.8455, |
| "mean_token_accuracy": 0.7779576182365417, |
| "num_tokens": 25350056.0, |
| "step": 474 |
| }, |
| { |
| "epoch": 6.012658227848101, |
| "grad_norm": 0.7330729365348816, |
| "learning_rate": 1.0529822614264018e-05, |
| "loss": 0.8765, |
| "mean_token_accuracy": 0.7725006341934204, |
| "num_tokens": 25401263.0, |
| "step": 475 |
| }, |
| { |
| "epoch": 6.025316455696203, |
| "grad_norm": 0.7381304502487183, |
| "learning_rate": 1.026956308337199e-05, |
| "loss": 0.9087, |
| "mean_token_accuracy": 0.7671048045158386, |
| "num_tokens": 25454660.0, |
| "step": 476 |
| }, |
| { |
| "epoch": 6.037974683544304, |
| "grad_norm": 0.6964046359062195, |
| "learning_rate": 1.0012386092368475e-05, |
| "loss": 0.9349, |
| "mean_token_accuracy": 0.7573679685592651, |
| "num_tokens": 25508979.0, |
| "step": 477 |
| }, |
| { |
| "epoch": 6.050632911392405, |
| "grad_norm": 0.7061088681221008, |
| "learning_rate": 9.75830047614117e-06, |
| "loss": 0.8418, |
| "mean_token_accuracy": 0.7831987738609314, |
| "num_tokens": 25561801.0, |
| "step": 478 |
| }, |
| { |
| "epoch": 6.063291139240507, |
| "grad_norm": 0.7184389233589172, |
| "learning_rate": 9.507314963378745e-06, |
| "loss": 0.9069, |
| "mean_token_accuracy": 0.7647831439971924, |
| "num_tokens": 25615169.0, |
| "step": 479 |
| }, |
| { |
| "epoch": 6.075949367088608, |
| "grad_norm": 0.7675829529762268, |
| "learning_rate": 9.259438176270962e-06, |
| "loss": 0.8598, |
| "mean_token_accuracy": 0.7760006189346313, |
| "num_tokens": 25667126.0, |
| "step": 480 |
| }, |
| { |
| "epoch": 6.0886075949367084, |
| "grad_norm": 0.8120074272155762, |
| "learning_rate": 9.014678630212469e-06, |
| "loss": 0.846, |
| "mean_token_accuracy": 0.774548351764679, |
| "num_tokens": 25717560.0, |
| "step": 481 |
| }, |
| { |
| "epoch": 6.10126582278481, |
| "grad_norm": 0.8958349227905273, |
| "learning_rate": 8.773044733510338e-06, |
| "loss": 0.919, |
| "mean_token_accuracy": 0.7592644691467285, |
| "num_tokens": 25771189.0, |
| "step": 482 |
| }, |
| { |
| "epoch": 6.113924050632911, |
| "grad_norm": 0.8866109848022461, |
| "learning_rate": 8.534544787095078e-06, |
| "loss": 0.9448, |
| "mean_token_accuracy": 0.7527633309364319, |
| "num_tokens": 25826350.0, |
| "step": 483 |
| }, |
| { |
| "epoch": 6.1265822784810124, |
| "grad_norm": 0.8762211203575134, |
| "learning_rate": 8.299186984235585e-06, |
| "loss": 0.8883, |
| "mean_token_accuracy": 0.7666193842887878, |
| "num_tokens": 25879319.0, |
| "step": 484 |
| }, |
| { |
| "epoch": 6.139240506329114, |
| "grad_norm": 0.844354510307312, |
| "learning_rate": 8.06697941025768e-06, |
| "loss": 0.7943, |
| "mean_token_accuracy": 0.7924570441246033, |
| "num_tokens": 25928303.0, |
| "step": 485 |
| }, |
| { |
| "epoch": 6.151898734177215, |
| "grad_norm": 0.8180962800979614, |
| "learning_rate": 7.837930042266262e-06, |
| "loss": 0.896, |
| "mean_token_accuracy": 0.7649088501930237, |
| "num_tokens": 25983150.0, |
| "step": 486 |
| }, |
| { |
| "epoch": 6.1645569620253164, |
| "grad_norm": 0.7528831362724304, |
| "learning_rate": 7.612046748871327e-06, |
| "loss": 0.8709, |
| "mean_token_accuracy": 0.7727630734443665, |
| "num_tokens": 26035305.0, |
| "step": 487 |
| }, |
| { |
| "epoch": 6.177215189873418, |
| "grad_norm": 0.7552682161331177, |
| "learning_rate": 7.389337289917652e-06, |
| "loss": 0.7608, |
| "mean_token_accuracy": 0.8003422021865845, |
| "num_tokens": 26085630.0, |
| "step": 488 |
| }, |
| { |
| "epoch": 6.189873417721519, |
| "grad_norm": 0.7309929728507996, |
| "learning_rate": 7.1698093162182125e-06, |
| "loss": 0.9185, |
| "mean_token_accuracy": 0.7621966004371643, |
| "num_tokens": 26138393.0, |
| "step": 489 |
| }, |
| { |
| "epoch": 6.2025316455696204, |
| "grad_norm": 0.7125580906867981, |
| "learning_rate": 6.953470369291348e-06, |
| "loss": 0.8313, |
| "mean_token_accuracy": 0.7828810214996338, |
| "num_tokens": 26192105.0, |
| "step": 490 |
| }, |
| { |
| "epoch": 6.215189873417722, |
| "grad_norm": 0.7312189340591431, |
| "learning_rate": 6.74032788110166e-06, |
| "loss": 0.9374, |
| "mean_token_accuracy": 0.7564448118209839, |
| "num_tokens": 26244071.0, |
| "step": 491 |
| }, |
| { |
| "epoch": 6.227848101265823, |
| "grad_norm": 0.7063823342323303, |
| "learning_rate": 6.530389173804807e-06, |
| "loss": 0.8842, |
| "mean_token_accuracy": 0.7675926685333252, |
| "num_tokens": 26296259.0, |
| "step": 492 |
| }, |
| { |
| "epoch": 6.2405063291139244, |
| "grad_norm": 0.7618180513381958, |
| "learning_rate": 6.323661459495811e-06, |
| "loss": 0.8576, |
| "mean_token_accuracy": 0.7767826318740845, |
| "num_tokens": 26345226.0, |
| "step": 493 |
| }, |
| { |
| "epoch": 6.253164556962025, |
| "grad_norm": 0.7362849116325378, |
| "learning_rate": 6.1201518399613635e-06, |
| "loss": 0.8982, |
| "mean_token_accuracy": 0.7671923041343689, |
| "num_tokens": 26399893.0, |
| "step": 494 |
| }, |
| { |
| "epoch": 6.265822784810126, |
| "grad_norm": 0.7188842296600342, |
| "learning_rate": 5.919867306435934e-06, |
| "loss": 0.8716, |
| "mean_token_accuracy": 0.7712004780769348, |
| "num_tokens": 26454826.0, |
| "step": 495 |
| }, |
| { |
| "epoch": 6.2784810126582276, |
| "grad_norm": 0.7352620959281921, |
| "learning_rate": 5.722814739361459e-06, |
| "loss": 0.8841, |
| "mean_token_accuracy": 0.7689441442489624, |
| "num_tokens": 26506951.0, |
| "step": 496 |
| }, |
| { |
| "epoch": 6.291139240506329, |
| "grad_norm": 0.7250537872314453, |
| "learning_rate": 5.529000908151105e-06, |
| "loss": 0.9214, |
| "mean_token_accuracy": 0.7619938850402832, |
| "num_tokens": 26561501.0, |
| "step": 497 |
| }, |
| { |
| "epoch": 6.30379746835443, |
| "grad_norm": 0.741434633731842, |
| "learning_rate": 5.338432470956589e-06, |
| "loss": 0.8713, |
| "mean_token_accuracy": 0.7752888798713684, |
| "num_tokens": 26612279.0, |
| "step": 498 |
| }, |
| { |
| "epoch": 6.3164556962025316, |
| "grad_norm": 0.7042741775512695, |
| "learning_rate": 5.151115974439569e-06, |
| "loss": 0.918, |
| "mean_token_accuracy": 0.759595513343811, |
| "num_tokens": 26670391.0, |
| "step": 499 |
| }, |
| { |
| "epoch": 6.329113924050633, |
| "grad_norm": 0.7422060370445251, |
| "learning_rate": 4.967057853546653e-06, |
| "loss": 0.8468, |
| "mean_token_accuracy": 0.7787840366363525, |
| "num_tokens": 26724339.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 6.341772151898734, |
| "grad_norm": 0.7409331202507019, |
| "learning_rate": 4.786264431288423e-06, |
| "loss": 0.8453, |
| "mean_token_accuracy": 0.7787643074989319, |
| "num_tokens": 26778463.0, |
| "step": 501 |
| }, |
| { |
| "epoch": 6.3544303797468356, |
| "grad_norm": 0.7570395469665527, |
| "learning_rate": 4.608741918522097e-06, |
| "loss": 0.8242, |
| "mean_token_accuracy": 0.7847666144371033, |
| "num_tokens": 26829402.0, |
| "step": 502 |
| }, |
| { |
| "epoch": 6.367088607594937, |
| "grad_norm": 0.7759395837783813, |
| "learning_rate": 4.434496413738332e-06, |
| "loss": 0.9319, |
| "mean_token_accuracy": 0.7584540843963623, |
| "num_tokens": 26881630.0, |
| "step": 503 |
| }, |
| { |
| "epoch": 6.379746835443038, |
| "grad_norm": 0.7546198964118958, |
| "learning_rate": 4.263533902851535e-06, |
| "loss": 0.9328, |
| "mean_token_accuracy": 0.7532243132591248, |
| "num_tokens": 26936667.0, |
| "step": 504 |
| }, |
| { |
| "epoch": 6.3924050632911396, |
| "grad_norm": 0.787138819694519, |
| "learning_rate": 4.095860258994388e-06, |
| "loss": 0.8714, |
| "mean_token_accuracy": 0.7742336392402649, |
| "num_tokens": 26987394.0, |
| "step": 505 |
| }, |
| { |
| "epoch": 6.405063291139241, |
| "grad_norm": 0.7618371844291687, |
| "learning_rate": 3.931481242315993e-06, |
| "loss": 0.9072, |
| "mean_token_accuracy": 0.7687786221504211, |
| "num_tokens": 27042241.0, |
| "step": 506 |
| }, |
| { |
| "epoch": 6.417721518987342, |
| "grad_norm": 0.7442908883094788, |
| "learning_rate": 3.770402499783976e-06, |
| "loss": 0.9159, |
| "mean_token_accuracy": 0.7618834972381592, |
| "num_tokens": 27098286.0, |
| "step": 507 |
| }, |
| { |
| "epoch": 6.430379746835443, |
| "grad_norm": 0.7562023997306824, |
| "learning_rate": 3.6126295649906216e-06, |
| "loss": 0.8177, |
| "mean_token_accuracy": 0.7862200140953064, |
| "num_tokens": 27153009.0, |
| "step": 508 |
| }, |
| { |
| "epoch": 6.443037974683544, |
| "grad_norm": 0.7642728090286255, |
| "learning_rate": 3.458167857962613e-06, |
| "loss": 0.9324, |
| "mean_token_accuracy": 0.7579013109207153, |
| "num_tokens": 27209108.0, |
| "step": 509 |
| }, |
| { |
| "epoch": 6.455696202531645, |
| "grad_norm": 0.7718908786773682, |
| "learning_rate": 3.3070226849749366e-06, |
| "loss": 0.9163, |
| "mean_token_accuracy": 0.7598476409912109, |
| "num_tokens": 27260885.0, |
| "step": 510 |
| }, |
| { |
| "epoch": 6.468354430379747, |
| "grad_norm": 0.7596184611320496, |
| "learning_rate": 3.159199238368593e-06, |
| "loss": 0.9469, |
| "mean_token_accuracy": 0.7533886432647705, |
| "num_tokens": 27315764.0, |
| "step": 511 |
| }, |
| { |
| "epoch": 6.481012658227848, |
| "grad_norm": 0.7800886034965515, |
| "learning_rate": 3.0147025963721433e-06, |
| "loss": 0.8988, |
| "mean_token_accuracy": 0.7648918628692627, |
| "num_tokens": 27367702.0, |
| "step": 512 |
| }, |
| { |
| "epoch": 6.493670886075949, |
| "grad_norm": 0.7586997151374817, |
| "learning_rate": 2.8735377229273998e-06, |
| "loss": 0.8676, |
| "mean_token_accuracy": 0.7724491953849792, |
| "num_tokens": 27419583.0, |
| "step": 513 |
| }, |
| { |
| "epoch": 6.506329113924051, |
| "grad_norm": 0.7350573539733887, |
| "learning_rate": 2.735709467518699e-06, |
| "loss": 0.8614, |
| "mean_token_accuracy": 0.7761837244033813, |
| "num_tokens": 27476037.0, |
| "step": 514 |
| }, |
| { |
| "epoch": 6.518987341772152, |
| "grad_norm": 0.7755162119865417, |
| "learning_rate": 2.6012225650064893e-06, |
| "loss": 0.7956, |
| "mean_token_accuracy": 0.7926900386810303, |
| "num_tokens": 27523981.0, |
| "step": 515 |
| }, |
| { |
| "epoch": 6.531645569620253, |
| "grad_norm": 0.7676106095314026, |
| "learning_rate": 2.470081635464594e-06, |
| "loss": 0.858, |
| "mean_token_accuracy": 0.7748537063598633, |
| "num_tokens": 27574963.0, |
| "step": 516 |
| }, |
| { |
| "epoch": 6.544303797468355, |
| "grad_norm": 0.7565949559211731, |
| "learning_rate": 2.342291184021461e-06, |
| "loss": 0.9054, |
| "mean_token_accuracy": 0.7672910094261169, |
| "num_tokens": 27628682.0, |
| "step": 517 |
| }, |
| { |
| "epoch": 6.556962025316456, |
| "grad_norm": 0.7573908567428589, |
| "learning_rate": 2.2178556007054872e-06, |
| "loss": 0.8732, |
| "mean_token_accuracy": 0.772281289100647, |
| "num_tokens": 27682255.0, |
| "step": 518 |
| }, |
| { |
| "epoch": 6.569620253164557, |
| "grad_norm": 0.7215973734855652, |
| "learning_rate": 2.0967791602941154e-06, |
| "loss": 0.8207, |
| "mean_token_accuracy": 0.785857617855072, |
| "num_tokens": 27733654.0, |
| "step": 519 |
| }, |
| { |
| "epoch": 6.582278481012658, |
| "grad_norm": 0.743601381778717, |
| "learning_rate": 1.979066022167042e-06, |
| "loss": 0.886, |
| "mean_token_accuracy": 0.7737412452697754, |
| "num_tokens": 27786706.0, |
| "step": 520 |
| }, |
| { |
| "epoch": 6.594936708860759, |
| "grad_norm": 0.7350673079490662, |
| "learning_rate": 1.8647202301633194e-06, |
| "loss": 0.8471, |
| "mean_token_accuracy": 0.7783074378967285, |
| "num_tokens": 27839636.0, |
| "step": 521 |
| }, |
| { |
| "epoch": 6.6075949367088604, |
| "grad_norm": 0.7188898921012878, |
| "learning_rate": 1.7537457124423895e-06, |
| "loss": 0.9255, |
| "mean_token_accuracy": 0.75742107629776, |
| "num_tokens": 27897306.0, |
| "step": 522 |
| }, |
| { |
| "epoch": 6.620253164556962, |
| "grad_norm": 0.7354036569595337, |
| "learning_rate": 1.6461462813492034e-06, |
| "loss": 0.9245, |
| "mean_token_accuracy": 0.7580609917640686, |
| "num_tokens": 27952078.0, |
| "step": 523 |
| }, |
| { |
| "epoch": 6.632911392405063, |
| "grad_norm": 0.7150800824165344, |
| "learning_rate": 1.5419256332832255e-06, |
| "loss": 0.8486, |
| "mean_token_accuracy": 0.7778921723365784, |
| "num_tokens": 28008475.0, |
| "step": 524 |
| }, |
| { |
| "epoch": 6.6455696202531644, |
| "grad_norm": 0.7539225816726685, |
| "learning_rate": 1.4410873485714238e-06, |
| "loss": 0.9198, |
| "mean_token_accuracy": 0.7615216970443726, |
| "num_tokens": 28063110.0, |
| "step": 525 |
| }, |
| { |
| "epoch": 6.658227848101266, |
| "grad_norm": 0.7394741773605347, |
| "learning_rate": 1.3436348913453578e-06, |
| "loss": 0.9504, |
| "mean_token_accuracy": 0.7545590996742249, |
| "num_tokens": 28117900.0, |
| "step": 526 |
| }, |
| { |
| "epoch": 6.670886075949367, |
| "grad_norm": 0.7107752561569214, |
| "learning_rate": 1.249571609422029e-06, |
| "loss": 0.8333, |
| "mean_token_accuracy": 0.7816824316978455, |
| "num_tokens": 28171148.0, |
| "step": 527 |
| }, |
| { |
| "epoch": 6.6835443037974684, |
| "grad_norm": 0.7358193397521973, |
| "learning_rate": 1.158900734189039e-06, |
| "loss": 0.8975, |
| "mean_token_accuracy": 0.7663297653198242, |
| "num_tokens": 28225040.0, |
| "step": 528 |
| }, |
| { |
| "epoch": 6.69620253164557, |
| "grad_norm": 0.7299255132675171, |
| "learning_rate": 1.0716253804934795e-06, |
| "loss": 0.8914, |
| "mean_token_accuracy": 0.7701156139373779, |
| "num_tokens": 28278222.0, |
| "step": 529 |
| }, |
| { |
| "epoch": 6.708860759493671, |
| "grad_norm": 0.7237915396690369, |
| "learning_rate": 9.877485465349058e-07, |
| "loss": 0.8646, |
| "mean_token_accuracy": 0.7740433216094971, |
| "num_tokens": 28331544.0, |
| "step": 530 |
| }, |
| { |
| "epoch": 6.7215189873417724, |
| "grad_norm": 0.7234286665916443, |
| "learning_rate": 9.072731137624413e-07, |
| "loss": 0.8846, |
| "mean_token_accuracy": 0.7751022577285767, |
| "num_tokens": 28387340.0, |
| "step": 531 |
| }, |
| { |
| "epoch": 6.734177215189874, |
| "grad_norm": 0.7300404906272888, |
| "learning_rate": 8.3020184677568e-07, |
| "loss": 0.8896, |
| "mean_token_accuracy": 0.7671842575073242, |
| "num_tokens": 28440854.0, |
| "step": 532 |
| }, |
| { |
| "epoch": 6.746835443037975, |
| "grad_norm": 0.7527182102203369, |
| "learning_rate": 7.56537393229817e-07, |
| "loss": 0.8803, |
| "mean_token_accuracy": 0.7691497206687927, |
| "num_tokens": 28494052.0, |
| "step": 533 |
| }, |
| { |
| "epoch": 6.759493670886076, |
| "grad_norm": 0.7488577961921692, |
| "learning_rate": 6.862822837445881e-07, |
| "loss": 0.8548, |
| "mean_token_accuracy": 0.7733297944068909, |
| "num_tokens": 28546849.0, |
| "step": 534 |
| }, |
| { |
| "epoch": 6.772151898734177, |
| "grad_norm": 0.7488005757331848, |
| "learning_rate": 6.194389318173954e-07, |
| "loss": 0.888, |
| "mean_token_accuracy": 0.7672020792961121, |
| "num_tokens": 28601514.0, |
| "step": 535 |
| }, |
| { |
| "epoch": 6.784810126582278, |
| "grad_norm": 0.7336114645004272, |
| "learning_rate": 5.560096337404397e-07, |
| "loss": 0.8876, |
| "mean_token_accuracy": 0.7662824392318726, |
| "num_tokens": 28655716.0, |
| "step": 536 |
| }, |
| { |
| "epoch": 6.7974683544303796, |
| "grad_norm": 0.7397316694259644, |
| "learning_rate": 4.959965685216949e-07, |
| "loss": 0.8851, |
| "mean_token_accuracy": 0.7723047733306885, |
| "num_tokens": 28708605.0, |
| "step": 537 |
| }, |
| { |
| "epoch": 6.810126582278481, |
| "grad_norm": 0.7416898012161255, |
| "learning_rate": 4.3940179781019055e-07, |
| "loss": 0.8685, |
| "mean_token_accuracy": 0.7749481797218323, |
| "num_tokens": 28762190.0, |
| "step": 538 |
| }, |
| { |
| "epoch": 6.822784810126582, |
| "grad_norm": 0.7306899428367615, |
| "learning_rate": 3.8622726582514537e-07, |
| "loss": 0.9062, |
| "mean_token_accuracy": 0.7666445970535278, |
| "num_tokens": 28819630.0, |
| "step": 539 |
| }, |
| { |
| "epoch": 6.8354430379746836, |
| "grad_norm": 0.7442116141319275, |
| "learning_rate": 3.364747992891215e-07, |
| "loss": 0.8668, |
| "mean_token_accuracy": 0.770470917224884, |
| "num_tokens": 28871426.0, |
| "step": 540 |
| }, |
| { |
| "epoch": 6.848101265822785, |
| "grad_norm": 0.7165699005126953, |
| "learning_rate": 2.901461073653633e-07, |
| "loss": 0.8279, |
| "mean_token_accuracy": 0.78138667345047, |
| "num_tokens": 28926139.0, |
| "step": 541 |
| }, |
| { |
| "epoch": 6.860759493670886, |
| "grad_norm": 0.7217394113540649, |
| "learning_rate": 2.472427815989886e-07, |
| "loss": 0.8511, |
| "mean_token_accuracy": 0.778727114200592, |
| "num_tokens": 28982030.0, |
| "step": 542 |
| }, |
| { |
| "epoch": 6.8734177215189876, |
| "grad_norm": 0.7448404431343079, |
| "learning_rate": 2.0776629586239936e-07, |
| "loss": 0.8987, |
| "mean_token_accuracy": 0.7639403343200684, |
| "num_tokens": 29035572.0, |
| "step": 543 |
| }, |
| { |
| "epoch": 6.886075949367089, |
| "grad_norm": 0.7140018343925476, |
| "learning_rate": 1.7171800630458868e-07, |
| "loss": 0.8414, |
| "mean_token_accuracy": 0.7787364721298218, |
| "num_tokens": 29090688.0, |
| "step": 544 |
| }, |
| { |
| "epoch": 6.89873417721519, |
| "grad_norm": 0.7151165008544922, |
| "learning_rate": 1.3909915130457808e-07, |
| "loss": 0.8353, |
| "mean_token_accuracy": 0.7813047170639038, |
| "num_tokens": 29146167.0, |
| "step": 545 |
| }, |
| { |
| "epoch": 6.911392405063291, |
| "grad_norm": 0.7673919796943665, |
| "learning_rate": 1.0991085142886271e-07, |
| "loss": 0.8912, |
| "mean_token_accuracy": 0.7691309452056885, |
| "num_tokens": 29197862.0, |
| "step": 546 |
| }, |
| { |
| "epoch": 6.924050632911392, |
| "grad_norm": 0.7264222502708435, |
| "learning_rate": 8.41541093929199e-08, |
| "loss": 0.9261, |
| "mean_token_accuracy": 0.7595686912536621, |
| "num_tokens": 29252923.0, |
| "step": 547 |
| }, |
| { |
| "epoch": 6.936708860759493, |
| "grad_norm": 0.741691529750824, |
| "learning_rate": 6.182981002679223e-08, |
| "loss": 0.8706, |
| "mean_token_accuracy": 0.7722748517990112, |
| "num_tokens": 29307443.0, |
| "step": 548 |
| }, |
| { |
| "epoch": 6.949367088607595, |
| "grad_norm": 0.7263526320457458, |
| "learning_rate": 4.293872024463408e-08, |
| "loss": 0.9296, |
| "mean_token_accuracy": 0.7559453248977661, |
| "num_tokens": 29364064.0, |
| "step": 549 |
| }, |
| { |
| "epoch": 6.962025316455696, |
| "grad_norm": 0.7507171034812927, |
| "learning_rate": 2.7481489018410523e-08, |
| "loss": 0.8557, |
| "mean_token_accuracy": 0.7787690162658691, |
| "num_tokens": 29417484.0, |
| "step": 550 |
| }, |
| { |
| "epoch": 6.974683544303797, |
| "grad_norm": 0.7565820813179016, |
| "learning_rate": 1.545864735558178e-08, |
| "loss": 0.9, |
| "mean_token_accuracy": 0.764269232749939, |
| "num_tokens": 29470354.0, |
| "step": 551 |
| }, |
| { |
| "epoch": 6.987341772151899, |
| "grad_norm": 0.7323611378669739, |
| "learning_rate": 6.8706082808955855e-09, |
| "loss": 0.839, |
| "mean_token_accuracy": 0.776936411857605, |
| "num_tokens": 29521789.0, |
| "step": 552 |
| }, |
| { |
| "epoch": 7.0, |
| "grad_norm": 0.7202613353729248, |
| "learning_rate": 1.7176668221208225e-09, |
| "loss": 0.8342, |
| "mean_token_accuracy": 0.7798174023628235, |
| "num_tokens": 29574859.0, |
| "step": 553 |
| }, |
| { |
| "epoch": 7.0, |
| "step": 553, |
| "total_flos": 1.6684160180929167e+18, |
| "train_loss": 1.57913771772902, |
| "train_runtime": 3337.6138, |
| "train_samples_per_second": 10.487, |
| "train_steps_per_second": 0.166 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 553, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 7, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.6684160180929167e+18, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|