| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 7.0, |
| "eval_steps": 500, |
| "global_step": 553, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012658227848101266, |
| "grad_norm": 1.4297935962677002, |
| "learning_rate": 0.0, |
| "loss": 2.1269, |
| "mean_token_accuracy": 0.5883483290672302, |
| "num_tokens": 45860.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.02531645569620253, |
| "grad_norm": 1.434566855430603, |
| "learning_rate": 1.1764705882352942e-05, |
| "loss": 2.0758, |
| "mean_token_accuracy": 0.5955607295036316, |
| "num_tokens": 91607.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.0379746835443038, |
| "grad_norm": 1.34773850440979, |
| "learning_rate": 2.3529411764705884e-05, |
| "loss": 2.0995, |
| "mean_token_accuracy": 0.5925061702728271, |
| "num_tokens": 138803.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.05063291139240506, |
| "grad_norm": 1.2693862915039062, |
| "learning_rate": 3.529411764705883e-05, |
| "loss": 2.0646, |
| "mean_token_accuracy": 0.592647910118103, |
| "num_tokens": 185711.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06329113924050633, |
| "grad_norm": 1.0771547555923462, |
| "learning_rate": 4.705882352941177e-05, |
| "loss": 1.9528, |
| "mean_token_accuracy": 0.6024201512336731, |
| "num_tokens": 229326.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.0759493670886076, |
| "grad_norm": 0.8461045026779175, |
| "learning_rate": 5.882352941176471e-05, |
| "loss": 1.8946, |
| "mean_token_accuracy": 0.6050652861595154, |
| "num_tokens": 273139.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08860759493670886, |
| "grad_norm": 0.5019454956054688, |
| "learning_rate": 7.058823529411765e-05, |
| "loss": 1.833, |
| "mean_token_accuracy": 0.6073743104934692, |
| "num_tokens": 320421.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10126582278481013, |
| "grad_norm": 0.5096880197525024, |
| "learning_rate": 8.23529411764706e-05, |
| "loss": 1.8264, |
| "mean_token_accuracy": 0.604993462562561, |
| "num_tokens": 368788.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11392405063291139, |
| "grad_norm": 0.8427304029464722, |
| "learning_rate": 9.411764705882353e-05, |
| "loss": 1.8343, |
| "mean_token_accuracy": 0.6039018630981445, |
| "num_tokens": 415189.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12658227848101267, |
| "grad_norm": 0.8095427751541138, |
| "learning_rate": 0.00010588235294117647, |
| "loss": 1.7456, |
| "mean_token_accuracy": 0.6184370517730713, |
| "num_tokens": 458774.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.13924050632911392, |
| "grad_norm": 0.5690692067146301, |
| "learning_rate": 0.00011764705882352942, |
| "loss": 1.761, |
| "mean_token_accuracy": 0.6134573817253113, |
| "num_tokens": 504300.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.1518987341772152, |
| "grad_norm": 0.42741021513938904, |
| "learning_rate": 0.00012941176470588237, |
| "loss": 1.7408, |
| "mean_token_accuracy": 0.6172425150871277, |
| "num_tokens": 550239.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16455696202531644, |
| "grad_norm": 0.3621617257595062, |
| "learning_rate": 0.0001411764705882353, |
| "loss": 1.7292, |
| "mean_token_accuracy": 0.6186677813529968, |
| "num_tokens": 595311.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17721518987341772, |
| "grad_norm": 0.356418639421463, |
| "learning_rate": 0.00015294117647058822, |
| "loss": 1.7433, |
| "mean_token_accuracy": 0.618061900138855, |
| "num_tokens": 643731.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.189873417721519, |
| "grad_norm": 0.31577178835868835, |
| "learning_rate": 0.0001647058823529412, |
| "loss": 1.7376, |
| "mean_token_accuracy": 0.6176530718803406, |
| "num_tokens": 687946.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20253164556962025, |
| "grad_norm": 0.28681808710098267, |
| "learning_rate": 0.00017647058823529413, |
| "loss": 1.7212, |
| "mean_token_accuracy": 0.6185654997825623, |
| "num_tokens": 733740.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21518987341772153, |
| "grad_norm": 0.3112754821777344, |
| "learning_rate": 0.00018823529411764707, |
| "loss": 1.7352, |
| "mean_token_accuracy": 0.6181626319885254, |
| "num_tokens": 780185.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22784810126582278, |
| "grad_norm": 0.40416133403778076, |
| "learning_rate": 0.0002, |
| "loss": 1.7291, |
| "mean_token_accuracy": 0.618687093257904, |
| "num_tokens": 827533.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24050632911392406, |
| "grad_norm": 0.45459505915641785, |
| "learning_rate": 0.0001999982823331779, |
| "loss": 1.7223, |
| "mean_token_accuracy": 0.6227962970733643, |
| "num_tokens": 873543.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25316455696202533, |
| "grad_norm": 0.37240275740623474, |
| "learning_rate": 0.00019999312939171914, |
| "loss": 1.7479, |
| "mean_token_accuracy": 0.6146200895309448, |
| "num_tokens": 923210.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.26582278481012656, |
| "grad_norm": 0.5440695881843567, |
| "learning_rate": 0.00019998454135264444, |
| "loss": 1.6538, |
| "mean_token_accuracy": 0.6290217638015747, |
| "num_tokens": 969460.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.27848101265822783, |
| "grad_norm": 0.2815147638320923, |
| "learning_rate": 0.0001999725185109816, |
| "loss": 1.6833, |
| "mean_token_accuracy": 0.6285157799720764, |
| "num_tokens": 1014215.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2911392405063291, |
| "grad_norm": 0.27108052372932434, |
| "learning_rate": 0.00019995706127975537, |
| "loss": 1.6823, |
| "mean_token_accuracy": 0.6276950836181641, |
| "num_tokens": 1061587.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3037974683544304, |
| "grad_norm": 0.28978854417800903, |
| "learning_rate": 0.00019993817018997323, |
| "loss": 1.7345, |
| "mean_token_accuracy": 0.6147149205207825, |
| "num_tokens": 1108746.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.31645569620253167, |
| "grad_norm": 0.26003706455230713, |
| "learning_rate": 0.0001999158458906071, |
| "loss": 1.6382, |
| "mean_token_accuracy": 0.633102297782898, |
| "num_tokens": 1150650.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.3291139240506329, |
| "grad_norm": 0.2689721882343292, |
| "learning_rate": 0.00019989008914857116, |
| "loss": 1.7528, |
| "mean_token_accuracy": 0.6133280396461487, |
| "num_tokens": 1198478.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34177215189873417, |
| "grad_norm": 0.29233652353286743, |
| "learning_rate": 0.00019986090084869545, |
| "loss": 1.7128, |
| "mean_token_accuracy": 0.6206752061843872, |
| "num_tokens": 1248602.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35443037974683544, |
| "grad_norm": 0.3018750846385956, |
| "learning_rate": 0.00019982828199369541, |
| "loss": 1.7215, |
| "mean_token_accuracy": 0.6194838285446167, |
| "num_tokens": 1298225.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.3670886075949367, |
| "grad_norm": 0.3065217435359955, |
| "learning_rate": 0.00019979223370413763, |
| "loss": 1.642, |
| "mean_token_accuracy": 0.632573127746582, |
| "num_tokens": 1346783.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.379746835443038, |
| "grad_norm": 0.26041898131370544, |
| "learning_rate": 0.00019975275721840103, |
| "loss": 1.7038, |
| "mean_token_accuracy": 0.6213216781616211, |
| "num_tokens": 1394151.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.3924050632911392, |
| "grad_norm": 0.25361573696136475, |
| "learning_rate": 0.00019970985389263467, |
| "loss": 1.6846, |
| "mean_token_accuracy": 0.6269124150276184, |
| "num_tokens": 1440818.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.4050632911392405, |
| "grad_norm": 0.23808851838111877, |
| "learning_rate": 0.0001996635252007109, |
| "loss": 1.7003, |
| "mean_token_accuracy": 0.6228302121162415, |
| "num_tokens": 1486970.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4177215189873418, |
| "grad_norm": 0.2258971631526947, |
| "learning_rate": 0.00019961377273417487, |
| "loss": 1.6915, |
| "mean_token_accuracy": 0.6242671012878418, |
| "num_tokens": 1535132.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43037974683544306, |
| "grad_norm": 0.23645015060901642, |
| "learning_rate": 0.00019956059820218982, |
| "loss": 1.6701, |
| "mean_token_accuracy": 0.6313917636871338, |
| "num_tokens": 1581310.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.4430379746835443, |
| "grad_norm": 0.22955374419689178, |
| "learning_rate": 0.00019950400343147833, |
| "loss": 1.6651, |
| "mean_token_accuracy": 0.6299709677696228, |
| "num_tokens": 1626838.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.45569620253164556, |
| "grad_norm": 0.22750572860240936, |
| "learning_rate": 0.0001994439903662596, |
| "loss": 1.6982, |
| "mean_token_accuracy": 0.6246239542961121, |
| "num_tokens": 1674100.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.46835443037974683, |
| "grad_norm": 0.22190001606941223, |
| "learning_rate": 0.00019938056106818261, |
| "loss": 1.6975, |
| "mean_token_accuracy": 0.6197924017906189, |
| "num_tokens": 1722819.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4810126582278481, |
| "grad_norm": 0.24010570347309113, |
| "learning_rate": 0.00019931371771625544, |
| "loss": 1.6365, |
| "mean_token_accuracy": 0.6325092911720276, |
| "num_tokens": 1770008.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4936708860759494, |
| "grad_norm": 0.23719368875026703, |
| "learning_rate": 0.0001992434626067702, |
| "loss": 1.6906, |
| "mean_token_accuracy": 0.6234063506126404, |
| "num_tokens": 1815094.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5063291139240507, |
| "grad_norm": 0.22259032726287842, |
| "learning_rate": 0.00019916979815322433, |
| "loss": 1.6798, |
| "mean_token_accuracy": 0.6275040507316589, |
| "num_tokens": 1865027.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5189873417721519, |
| "grad_norm": 0.2300175577402115, |
| "learning_rate": 0.00019909272688623756, |
| "loss": 1.6783, |
| "mean_token_accuracy": 0.6286372542381287, |
| "num_tokens": 1911967.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.5316455696202531, |
| "grad_norm": 0.21260212361812592, |
| "learning_rate": 0.0001990122514534651, |
| "loss": 1.7155, |
| "mean_token_accuracy": 0.6216686964035034, |
| "num_tokens": 1963100.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5443037974683544, |
| "grad_norm": 0.2217252254486084, |
| "learning_rate": 0.00019892837461950652, |
| "loss": 1.6599, |
| "mean_token_accuracy": 0.6299470663070679, |
| "num_tokens": 2010768.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5569620253164557, |
| "grad_norm": 0.2244565337896347, |
| "learning_rate": 0.00019884109926581096, |
| "loss": 1.7049, |
| "mean_token_accuracy": 0.622722864151001, |
| "num_tokens": 2059303.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.569620253164557, |
| "grad_norm": 0.23472081124782562, |
| "learning_rate": 0.00019875042839057798, |
| "loss": 1.7017, |
| "mean_token_accuracy": 0.6219018697738647, |
| "num_tokens": 2103829.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5822784810126582, |
| "grad_norm": 0.22766339778900146, |
| "learning_rate": 0.00019865636510865467, |
| "loss": 1.7028, |
| "mean_token_accuracy": 0.6218793392181396, |
| "num_tokens": 2150558.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5949367088607594, |
| "grad_norm": 0.228139728307724, |
| "learning_rate": 0.0001985589126514286, |
| "loss": 1.7016, |
| "mean_token_accuracy": 0.6203511953353882, |
| "num_tokens": 2201253.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6075949367088608, |
| "grad_norm": 0.22668923437595367, |
| "learning_rate": 0.0001984580743667168, |
| "loss": 1.6959, |
| "mean_token_accuracy": 0.6244654059410095, |
| "num_tokens": 2247382.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.620253164556962, |
| "grad_norm": 0.2259022295475006, |
| "learning_rate": 0.0001983538537186508, |
| "loss": 1.6974, |
| "mean_token_accuracy": 0.6239613890647888, |
| "num_tokens": 2295707.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6329113924050633, |
| "grad_norm": 0.22462861239910126, |
| "learning_rate": 0.0001982462542875576, |
| "loss": 1.6612, |
| "mean_token_accuracy": 0.6296576857566833, |
| "num_tokens": 2340697.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6455696202531646, |
| "grad_norm": 0.24034149944782257, |
| "learning_rate": 0.0001981352797698367, |
| "loss": 1.6784, |
| "mean_token_accuracy": 0.6287301182746887, |
| "num_tokens": 2382717.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6582278481012658, |
| "grad_norm": 0.21968059241771698, |
| "learning_rate": 0.00019802093397783296, |
| "loss": 1.6612, |
| "mean_token_accuracy": 0.6290526390075684, |
| "num_tokens": 2430219.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6708860759493671, |
| "grad_norm": 0.23564419150352478, |
| "learning_rate": 0.0001979032208397059, |
| "loss": 1.6276, |
| "mean_token_accuracy": 0.6347538232803345, |
| "num_tokens": 2473766.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6835443037974683, |
| "grad_norm": 0.22665007412433624, |
| "learning_rate": 0.00019778214439929452, |
| "loss": 1.6862, |
| "mean_token_accuracy": 0.6270169615745544, |
| "num_tokens": 2521674.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.6962025316455697, |
| "grad_norm": 0.2169383466243744, |
| "learning_rate": 0.00019765770881597855, |
| "loss": 1.707, |
| "mean_token_accuracy": 0.624442458152771, |
| "num_tokens": 2570612.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7088607594936709, |
| "grad_norm": 0.22436678409576416, |
| "learning_rate": 0.00019752991836453543, |
| "loss": 1.6428, |
| "mean_token_accuracy": 0.6327121257781982, |
| "num_tokens": 2620095.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7215189873417721, |
| "grad_norm": 0.23180508613586426, |
| "learning_rate": 0.00019739877743499352, |
| "loss": 1.7243, |
| "mean_token_accuracy": 0.6180028915405273, |
| "num_tokens": 2665785.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7341772151898734, |
| "grad_norm": 0.2244236022233963, |
| "learning_rate": 0.0001972642905324813, |
| "loss": 1.6619, |
| "mean_token_accuracy": 0.6294060349464417, |
| "num_tokens": 2712064.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7468354430379747, |
| "grad_norm": 0.2267381250858307, |
| "learning_rate": 0.00019712646227707263, |
| "loss": 1.6287, |
| "mean_token_accuracy": 0.6353709697723389, |
| "num_tokens": 2760026.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.759493670886076, |
| "grad_norm": 0.23568469285964966, |
| "learning_rate": 0.00019698529740362785, |
| "loss": 1.7067, |
| "mean_token_accuracy": 0.6213864088058472, |
| "num_tokens": 2806166.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7721518987341772, |
| "grad_norm": 0.21780051290988922, |
| "learning_rate": 0.00019684080076163142, |
| "loss": 1.6478, |
| "mean_token_accuracy": 0.630071759223938, |
| "num_tokens": 2855572.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7848101265822784, |
| "grad_norm": 0.23158034682273865, |
| "learning_rate": 0.00019669297731502507, |
| "loss": 1.6464, |
| "mean_token_accuracy": 0.6330370903015137, |
| "num_tokens": 2900646.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.7974683544303798, |
| "grad_norm": 0.22072935104370117, |
| "learning_rate": 0.0001965418321420374, |
| "loss": 1.6329, |
| "mean_token_accuracy": 0.6327118277549744, |
| "num_tokens": 2948656.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.810126582278481, |
| "grad_norm": 0.23062308132648468, |
| "learning_rate": 0.0001963873704350094, |
| "loss": 1.6534, |
| "mean_token_accuracy": 0.6293391585350037, |
| "num_tokens": 2992709.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8227848101265823, |
| "grad_norm": 0.21779538691043854, |
| "learning_rate": 0.00019622959750021605, |
| "loss": 1.618, |
| "mean_token_accuracy": 0.6372920274734497, |
| "num_tokens": 3038992.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8354430379746836, |
| "grad_norm": 0.22693635523319244, |
| "learning_rate": 0.000196068518757684, |
| "loss": 1.7128, |
| "mean_token_accuracy": 0.6208335161209106, |
| "num_tokens": 3085558.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8481012658227848, |
| "grad_norm": 0.23582525551319122, |
| "learning_rate": 0.0001959041397410056, |
| "loss": 1.6625, |
| "mean_token_accuracy": 0.6306231617927551, |
| "num_tokens": 3130170.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8607594936708861, |
| "grad_norm": 0.2246374785900116, |
| "learning_rate": 0.0001957364660971485, |
| "loss": 1.6385, |
| "mean_token_accuracy": 0.6291642189025879, |
| "num_tokens": 3176311.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8734177215189873, |
| "grad_norm": 0.22443550825119019, |
| "learning_rate": 0.0001955655035862617, |
| "loss": 1.6751, |
| "mean_token_accuracy": 0.625806450843811, |
| "num_tokens": 3222875.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.8860759493670886, |
| "grad_norm": 0.22177176177501678, |
| "learning_rate": 0.0001953912580814779, |
| "loss": 1.6653, |
| "mean_token_accuracy": 0.6286900639533997, |
| "num_tokens": 3271109.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.8987341772151899, |
| "grad_norm": 0.2268744707107544, |
| "learning_rate": 0.0001952137355687116, |
| "loss": 1.6222, |
| "mean_token_accuracy": 0.6369240283966064, |
| "num_tokens": 3317571.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9113924050632911, |
| "grad_norm": 0.22358258068561554, |
| "learning_rate": 0.00019503294214645337, |
| "loss": 1.6428, |
| "mean_token_accuracy": 0.633510172367096, |
| "num_tokens": 3362493.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9240506329113924, |
| "grad_norm": 0.2274637073278427, |
| "learning_rate": 0.00019484888402556045, |
| "loss": 1.6303, |
| "mean_token_accuracy": 0.6295872926712036, |
| "num_tokens": 3412450.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9367088607594937, |
| "grad_norm": 0.2235092669725418, |
| "learning_rate": 0.00019466156752904343, |
| "loss": 1.6348, |
| "mean_token_accuracy": 0.6336225867271423, |
| "num_tokens": 3458150.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9493670886075949, |
| "grad_norm": 0.22723203897476196, |
| "learning_rate": 0.0001944709990918489, |
| "loss": 1.6353, |
| "mean_token_accuracy": 0.6303831934928894, |
| "num_tokens": 3503285.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9620253164556962, |
| "grad_norm": 0.23029087483882904, |
| "learning_rate": 0.00019427718526063856, |
| "loss": 1.6788, |
| "mean_token_accuracy": 0.6246349215507507, |
| "num_tokens": 3550258.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9746835443037974, |
| "grad_norm": 0.21722035109996796, |
| "learning_rate": 0.00019408013269356408, |
| "loss": 1.6423, |
| "mean_token_accuracy": 0.6343802809715271, |
| "num_tokens": 3600054.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9873417721518988, |
| "grad_norm": 0.22306939959526062, |
| "learning_rate": 0.00019387984816003867, |
| "loss": 1.6825, |
| "mean_token_accuracy": 0.6262245774269104, |
| "num_tokens": 3646563.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.24767781794071198, |
| "learning_rate": 0.00019367633854050422, |
| "loss": 1.6458, |
| "mean_token_accuracy": 0.6306663751602173, |
| "num_tokens": 3693284.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0126582278481013, |
| "grad_norm": 0.2704238295555115, |
| "learning_rate": 0.00019346961082619522, |
| "loss": 1.5187, |
| "mean_token_accuracy": 0.6579475402832031, |
| "num_tokens": 3738689.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0253164556962024, |
| "grad_norm": 0.22565050423145294, |
| "learning_rate": 0.00019325967211889834, |
| "loss": 1.5333, |
| "mean_token_accuracy": 0.6507334113121033, |
| "num_tokens": 3783544.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0379746835443038, |
| "grad_norm": 0.21894116699695587, |
| "learning_rate": 0.0001930465296307087, |
| "loss": 1.4748, |
| "mean_token_accuracy": 0.6617191433906555, |
| "num_tokens": 3830433.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0506329113924051, |
| "grad_norm": 0.2757681906223297, |
| "learning_rate": 0.00019283019068378182, |
| "loss": 1.5382, |
| "mean_token_accuracy": 0.6483068466186523, |
| "num_tokens": 3876830.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0632911392405062, |
| "grad_norm": 0.26444658637046814, |
| "learning_rate": 0.00019261066271008235, |
| "loss": 1.4792, |
| "mean_token_accuracy": 0.6634548902511597, |
| "num_tokens": 3921833.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0759493670886076, |
| "grad_norm": 0.23986731469631195, |
| "learning_rate": 0.0001923879532511287, |
| "loss": 1.5573, |
| "mean_token_accuracy": 0.6481124758720398, |
| "num_tokens": 3968122.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.0886075949367089, |
| "grad_norm": 0.23939338326454163, |
| "learning_rate": 0.00019216206995773373, |
| "loss": 1.5157, |
| "mean_token_accuracy": 0.6560894846916199, |
| "num_tokens": 4016466.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1012658227848102, |
| "grad_norm": 0.24986766278743744, |
| "learning_rate": 0.00019193302058974232, |
| "loss": 1.5496, |
| "mean_token_accuracy": 0.6462620496749878, |
| "num_tokens": 4066437.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1139240506329113, |
| "grad_norm": 0.23949536681175232, |
| "learning_rate": 0.00019170081301576444, |
| "loss": 1.5063, |
| "mean_token_accuracy": 0.6563820242881775, |
| "num_tokens": 4114793.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.1265822784810127, |
| "grad_norm": 0.23770886659622192, |
| "learning_rate": 0.00019146545521290495, |
| "loss": 1.4886, |
| "mean_token_accuracy": 0.6591377854347229, |
| "num_tokens": 4159441.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.139240506329114, |
| "grad_norm": 0.2399303913116455, |
| "learning_rate": 0.00019122695526648968, |
| "loss": 1.5237, |
| "mean_token_accuracy": 0.650536298751831, |
| "num_tokens": 4208729.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1518987341772151, |
| "grad_norm": 0.2637503147125244, |
| "learning_rate": 0.00019098532136978754, |
| "loss": 1.498, |
| "mean_token_accuracy": 0.6567501425743103, |
| "num_tokens": 4253466.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1645569620253164, |
| "grad_norm": 0.2615419924259186, |
| "learning_rate": 0.00019074056182372907, |
| "loss": 1.5141, |
| "mean_token_accuracy": 0.6535509824752808, |
| "num_tokens": 4302784.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.1772151898734178, |
| "grad_norm": 0.2541172504425049, |
| "learning_rate": 0.00019049268503662126, |
| "loss": 1.4986, |
| "mean_token_accuracy": 0.6578357815742493, |
| "num_tokens": 4347917.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.189873417721519, |
| "grad_norm": 0.24259509146213531, |
| "learning_rate": 0.00019024169952385885, |
| "loss": 1.4655, |
| "mean_token_accuracy": 0.6630852222442627, |
| "num_tokens": 4394610.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2025316455696202, |
| "grad_norm": 0.2532861530780792, |
| "learning_rate": 0.00018998761390763154, |
| "loss": 1.5144, |
| "mean_token_accuracy": 0.6535828709602356, |
| "num_tokens": 4443029.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.2151898734177216, |
| "grad_norm": 0.24317510426044464, |
| "learning_rate": 0.00018973043691662803, |
| "loss": 1.5196, |
| "mean_token_accuracy": 0.6520761847496033, |
| "num_tokens": 4490704.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2278481012658227, |
| "grad_norm": 0.2610395848751068, |
| "learning_rate": 0.000189470177385736, |
| "loss": 1.5044, |
| "mean_token_accuracy": 0.6601476669311523, |
| "num_tokens": 4534384.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.240506329113924, |
| "grad_norm": 0.2677130103111267, |
| "learning_rate": 0.00018920684425573865, |
| "loss": 1.4518, |
| "mean_token_accuracy": 0.6647972464561462, |
| "num_tokens": 4578669.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2531645569620253, |
| "grad_norm": 0.2610534429550171, |
| "learning_rate": 0.00018894044657300765, |
| "loss": 1.4535, |
| "mean_token_accuracy": 0.6645317077636719, |
| "num_tokens": 4624636.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.2658227848101267, |
| "grad_norm": 0.2596592903137207, |
| "learning_rate": 0.00018867099348919217, |
| "loss": 1.47, |
| "mean_token_accuracy": 0.6623217463493347, |
| "num_tokens": 4671958.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2784810126582278, |
| "grad_norm": 0.2679537236690521, |
| "learning_rate": 0.0001883984942609047, |
| "loss": 1.473, |
| "mean_token_accuracy": 0.6634280681610107, |
| "num_tokens": 4718853.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2911392405063291, |
| "grad_norm": 0.26461848616600037, |
| "learning_rate": 0.00018812295824940285, |
| "loss": 1.5248, |
| "mean_token_accuracy": 0.6544753909111023, |
| "num_tokens": 4767695.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.3037974683544304, |
| "grad_norm": 0.2688470482826233, |
| "learning_rate": 0.00018784439492026798, |
| "loss": 1.553, |
| "mean_token_accuracy": 0.6471455693244934, |
| "num_tokens": 4813880.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3164556962025316, |
| "grad_norm": 0.2555462419986725, |
| "learning_rate": 0.00018756281384307982, |
| "loss": 1.4992, |
| "mean_token_accuracy": 0.656396210193634, |
| "num_tokens": 4860323.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3291139240506329, |
| "grad_norm": 0.27267542481422424, |
| "learning_rate": 0.0001872782246910879, |
| "loss": 1.453, |
| "mean_token_accuracy": 0.6634340882301331, |
| "num_tokens": 4906274.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3417721518987342, |
| "grad_norm": 0.2674024999141693, |
| "learning_rate": 0.00018699063724087904, |
| "loss": 1.5336, |
| "mean_token_accuracy": 0.652473509311676, |
| "num_tokens": 4954225.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.3544303797468356, |
| "grad_norm": 0.2559143602848053, |
| "learning_rate": 0.0001867000613720417, |
| "loss": 1.4769, |
| "mean_token_accuracy": 0.6595107316970825, |
| "num_tokens": 5001336.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3670886075949367, |
| "grad_norm": 0.27574166655540466, |
| "learning_rate": 0.0001864065070668265, |
| "loss": 1.4803, |
| "mean_token_accuracy": 0.661461591720581, |
| "num_tokens": 5047445.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.379746835443038, |
| "grad_norm": 0.2721637189388275, |
| "learning_rate": 0.00018610998440980324, |
| "loss": 1.4955, |
| "mean_token_accuracy": 0.6583252549171448, |
| "num_tokens": 5092745.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.3924050632911391, |
| "grad_norm": 0.2680104076862335, |
| "learning_rate": 0.00018581050358751445, |
| "loss": 1.5764, |
| "mean_token_accuracy": 0.6440534591674805, |
| "num_tokens": 5140038.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4050632911392404, |
| "grad_norm": 0.2686646580696106, |
| "learning_rate": 0.00018550807488812562, |
| "loss": 1.4896, |
| "mean_token_accuracy": 0.6607694625854492, |
| "num_tokens": 5185717.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4177215189873418, |
| "grad_norm": 0.26218053698539734, |
| "learning_rate": 0.00018520270870107166, |
| "loss": 1.5112, |
| "mean_token_accuracy": 0.6550983786582947, |
| "num_tokens": 5230040.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4303797468354431, |
| "grad_norm": 0.2599179446697235, |
| "learning_rate": 0.00018489441551669986, |
| "loss": 1.4914, |
| "mean_token_accuracy": 0.6583897471427917, |
| "num_tokens": 5279599.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4430379746835442, |
| "grad_norm": 0.25936904549598694, |
| "learning_rate": 0.00018458320592590975, |
| "loss": 1.491, |
| "mean_token_accuracy": 0.6570174098014832, |
| "num_tokens": 5326817.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4556962025316456, |
| "grad_norm": 0.2672724425792694, |
| "learning_rate": 0.00018426909061978908, |
| "loss": 1.5042, |
| "mean_token_accuracy": 0.6552169322967529, |
| "num_tokens": 5374131.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4683544303797469, |
| "grad_norm": 0.26219993829727173, |
| "learning_rate": 0.00018395208038924667, |
| "loss": 1.457, |
| "mean_token_accuracy": 0.664246141910553, |
| "num_tokens": 5421155.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.481012658227848, |
| "grad_norm": 0.2645889222621918, |
| "learning_rate": 0.00018363218612464158, |
| "loss": 1.4865, |
| "mean_token_accuracy": 0.6586675643920898, |
| "num_tokens": 5468516.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4936708860759493, |
| "grad_norm": 0.27145904302597046, |
| "learning_rate": 0.00018330941881540915, |
| "loss": 1.5393, |
| "mean_token_accuracy": 0.6498931646347046, |
| "num_tokens": 5519116.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5063291139240507, |
| "grad_norm": 0.27031463384628296, |
| "learning_rate": 0.00018298378954968337, |
| "loss": 1.4729, |
| "mean_token_accuracy": 0.6622894406318665, |
| "num_tokens": 5566013.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.518987341772152, |
| "grad_norm": 0.2636566460132599, |
| "learning_rate": 0.0001826553095139159, |
| "loss": 1.4852, |
| "mean_token_accuracy": 0.6582340002059937, |
| "num_tokens": 5613393.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5316455696202531, |
| "grad_norm": 0.26901474595069885, |
| "learning_rate": 0.00018232398999249192, |
| "loss": 1.4343, |
| "mean_token_accuracy": 0.6671172976493835, |
| "num_tokens": 5658581.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5443037974683544, |
| "grad_norm": 0.260540634393692, |
| "learning_rate": 0.00018198984236734246, |
| "loss": 1.5081, |
| "mean_token_accuracy": 0.6527827978134155, |
| "num_tokens": 5708631.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5569620253164556, |
| "grad_norm": 0.267051100730896, |
| "learning_rate": 0.0001816528781175533, |
| "loss": 1.479, |
| "mean_token_accuracy": 0.6584655046463013, |
| "num_tokens": 5757428.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.5696202531645569, |
| "grad_norm": 0.2814350724220276, |
| "learning_rate": 0.0001813131088189707, |
| "loss": 1.4711, |
| "mean_token_accuracy": 0.6626920104026794, |
| "num_tokens": 5801689.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5822784810126582, |
| "grad_norm": 0.2702229619026184, |
| "learning_rate": 0.00018097054614380365, |
| "loss": 1.4945, |
| "mean_token_accuracy": 0.6577462553977966, |
| "num_tokens": 5847827.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5949367088607596, |
| "grad_norm": 0.2745739221572876, |
| "learning_rate": 0.000180625201860223, |
| "loss": 1.504, |
| "mean_token_accuracy": 0.6541758179664612, |
| "num_tokens": 5895606.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.6075949367088609, |
| "grad_norm": 0.2730543315410614, |
| "learning_rate": 0.0001802770878319571, |
| "loss": 1.4956, |
| "mean_token_accuracy": 0.6596698760986328, |
| "num_tokens": 5942501.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.620253164556962, |
| "grad_norm": 0.26320144534111023, |
| "learning_rate": 0.00017992621601788428, |
| "loss": 1.4677, |
| "mean_token_accuracy": 0.6615061163902283, |
| "num_tokens": 5988684.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6329113924050633, |
| "grad_norm": 0.27375948429107666, |
| "learning_rate": 0.00017957259847162205, |
| "loss": 1.4883, |
| "mean_token_accuracy": 0.6593698263168335, |
| "num_tokens": 6036577.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6455696202531644, |
| "grad_norm": 0.27551186084747314, |
| "learning_rate": 0.00017921624734111292, |
| "loss": 1.5127, |
| "mean_token_accuracy": 0.6532179713249207, |
| "num_tokens": 6082866.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.6582278481012658, |
| "grad_norm": 0.2854526937007904, |
| "learning_rate": 0.00017885717486820722, |
| "loss": 1.4834, |
| "mean_token_accuracy": 0.6589472889900208, |
| "num_tokens": 6128184.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6708860759493671, |
| "grad_norm": 0.2762332558631897, |
| "learning_rate": 0.00017849539338824231, |
| "loss": 1.4762, |
| "mean_token_accuracy": 0.6631950736045837, |
| "num_tokens": 6175777.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6835443037974684, |
| "grad_norm": 0.28698286414146423, |
| "learning_rate": 0.0001781309153296192, |
| "loss": 1.4743, |
| "mean_token_accuracy": 0.6608595252037048, |
| "num_tokens": 6221704.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.6962025316455698, |
| "grad_norm": 0.2894686758518219, |
| "learning_rate": 0.00017776375321337521, |
| "loss": 1.4985, |
| "mean_token_accuracy": 0.65559983253479, |
| "num_tokens": 6267430.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7088607594936709, |
| "grad_norm": 0.2916942834854126, |
| "learning_rate": 0.00017739391965275404, |
| "loss": 1.4675, |
| "mean_token_accuracy": 0.6640766859054565, |
| "num_tokens": 6309965.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.721518987341772, |
| "grad_norm": 0.27421343326568604, |
| "learning_rate": 0.00017702142735277247, |
| "loss": 1.497, |
| "mean_token_accuracy": 0.6565625071525574, |
| "num_tokens": 6358326.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7341772151898733, |
| "grad_norm": 0.2747173309326172, |
| "learning_rate": 0.00017664628910978375, |
| "loss": 1.4995, |
| "mean_token_accuracy": 0.655762255191803, |
| "num_tokens": 6405160.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7468354430379747, |
| "grad_norm": 0.27782154083251953, |
| "learning_rate": 0.0001762685178110382, |
| "loss": 1.4358, |
| "mean_token_accuracy": 0.667519211769104, |
| "num_tokens": 6449795.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.759493670886076, |
| "grad_norm": 0.2791241705417633, |
| "learning_rate": 0.00017588812643424032, |
| "loss": 1.5493, |
| "mean_token_accuracy": 0.6500073671340942, |
| "num_tokens": 6497300.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7721518987341773, |
| "grad_norm": 0.2714492380619049, |
| "learning_rate": 0.0001755051280471031, |
| "loss": 1.4895, |
| "mean_token_accuracy": 0.6580542922019958, |
| "num_tokens": 6546518.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7848101265822784, |
| "grad_norm": 0.27369654178619385, |
| "learning_rate": 0.00017511953580689888, |
| "loss": 1.5208, |
| "mean_token_accuracy": 0.6513364315032959, |
| "num_tokens": 6593048.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.7974683544303798, |
| "grad_norm": 0.2905201017856598, |
| "learning_rate": 0.00017473136296000772, |
| "loss": 1.5268, |
| "mean_token_accuracy": 0.6505144238471985, |
| "num_tokens": 6638988.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.810126582278481, |
| "grad_norm": 0.2680700719356537, |
| "learning_rate": 0.000174340622841462, |
| "loss": 1.4976, |
| "mean_token_accuracy": 0.6543448567390442, |
| "num_tokens": 6686177.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8227848101265822, |
| "grad_norm": 0.28409284353256226, |
| "learning_rate": 0.00017394732887448847, |
| "loss": 1.4865, |
| "mean_token_accuracy": 0.6597988605499268, |
| "num_tokens": 6731379.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8354430379746836, |
| "grad_norm": 0.2727820575237274, |
| "learning_rate": 0.00017355149457004709, |
| "loss": 1.4922, |
| "mean_token_accuracy": 0.6577648520469666, |
| "num_tokens": 6779860.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8481012658227849, |
| "grad_norm": 0.2895708382129669, |
| "learning_rate": 0.0001731531335263669, |
| "loss": 1.4861, |
| "mean_token_accuracy": 0.6559346318244934, |
| "num_tokens": 6822631.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8607594936708862, |
| "grad_norm": 0.2730681300163269, |
| "learning_rate": 0.0001727522594284789, |
| "loss": 1.5365, |
| "mean_token_accuracy": 0.6517869830131531, |
| "num_tokens": 6871240.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8734177215189873, |
| "grad_norm": 0.27399033308029175, |
| "learning_rate": 0.00017234888604774574, |
| "loss": 1.5494, |
| "mean_token_accuracy": 0.6449940800666809, |
| "num_tokens": 6920506.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.8860759493670884, |
| "grad_norm": 0.28052183985710144, |
| "learning_rate": 0.00017194302724138903, |
| "loss": 1.5205, |
| "mean_token_accuracy": 0.6526179313659668, |
| "num_tokens": 6968451.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.8987341772151898, |
| "grad_norm": 0.2830485999584198, |
| "learning_rate": 0.00017153469695201277, |
| "loss": 1.534, |
| "mean_token_accuracy": 0.6482208371162415, |
| "num_tokens": 7015391.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9113924050632911, |
| "grad_norm": 0.2714807689189911, |
| "learning_rate": 0.0001711239092071248, |
| "loss": 1.5007, |
| "mean_token_accuracy": 0.6547030210494995, |
| "num_tokens": 7061957.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.9240506329113924, |
| "grad_norm": 0.28191933035850525, |
| "learning_rate": 0.00017071067811865476, |
| "loss": 1.506, |
| "mean_token_accuracy": 0.6569375395774841, |
| "num_tokens": 7107246.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9367088607594938, |
| "grad_norm": 0.2704729437828064, |
| "learning_rate": 0.00017029501788246924, |
| "loss": 1.4832, |
| "mean_token_accuracy": 0.6607176065444946, |
| "num_tokens": 7155553.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9493670886075949, |
| "grad_norm": 0.27189669013023376, |
| "learning_rate": 0.00016987694277788417, |
| "loss": 1.4983, |
| "mean_token_accuracy": 0.6550452709197998, |
| "num_tokens": 7202255.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9620253164556962, |
| "grad_norm": 0.288601279258728, |
| "learning_rate": 0.0001694564671671743, |
| "loss": 1.5234, |
| "mean_token_accuracy": 0.651522159576416, |
| "num_tokens": 7250081.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.9746835443037973, |
| "grad_norm": 0.28722238540649414, |
| "learning_rate": 0.0001690336054950797, |
| "loss": 1.4838, |
| "mean_token_accuracy": 0.6596331596374512, |
| "num_tokens": 7295452.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9873417721518987, |
| "grad_norm": 0.28106075525283813, |
| "learning_rate": 0.00016860837228830974, |
| "loss": 1.4449, |
| "mean_token_accuracy": 0.6669970750808716, |
| "num_tokens": 7340912.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.29809167981147766, |
| "learning_rate": 0.0001681807821550438, |
| "loss": 1.3563, |
| "mean_token_accuracy": 0.6853920221328735, |
| "num_tokens": 7386725.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0126582278481013, |
| "grad_norm": 0.302463173866272, |
| "learning_rate": 0.00016775084978442955, |
| "loss": 1.2736, |
| "mean_token_accuracy": 0.7005270719528198, |
| "num_tokens": 7431374.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0253164556962027, |
| "grad_norm": 0.3087366819381714, |
| "learning_rate": 0.00016731858994607838, |
| "loss": 1.2788, |
| "mean_token_accuracy": 0.6979596018791199, |
| "num_tokens": 7477018.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.037974683544304, |
| "grad_norm": 0.31179991364479065, |
| "learning_rate": 0.00016688401748955802, |
| "loss": 1.3065, |
| "mean_token_accuracy": 0.6944866180419922, |
| "num_tokens": 7525800.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050632911392405, |
| "grad_norm": 0.3638923466205597, |
| "learning_rate": 0.00016644714734388217, |
| "loss": 1.2457, |
| "mean_token_accuracy": 0.7046037912368774, |
| "num_tokens": 7573759.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0632911392405062, |
| "grad_norm": 0.3726513385772705, |
| "learning_rate": 0.00016600799451699802, |
| "loss": 1.215, |
| "mean_token_accuracy": 0.7081204652786255, |
| "num_tokens": 7617478.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0759493670886076, |
| "grad_norm": 0.316274493932724, |
| "learning_rate": 0.0001655665740952703, |
| "loss": 1.2713, |
| "mean_token_accuracy": 0.6999913454055786, |
| "num_tokens": 7663624.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.088607594936709, |
| "grad_norm": 0.31808707118034363, |
| "learning_rate": 0.00016512290124296336, |
| "loss": 1.2328, |
| "mean_token_accuracy": 0.7067911028862, |
| "num_tokens": 7708158.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1012658227848102, |
| "grad_norm": 0.304767370223999, |
| "learning_rate": 0.00016467699120171987, |
| "loss": 1.2526, |
| "mean_token_accuracy": 0.7050590515136719, |
| "num_tokens": 7755306.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1139240506329116, |
| "grad_norm": 0.28329142928123474, |
| "learning_rate": 0.00016422885929003758, |
| "loss": 1.2241, |
| "mean_token_accuracy": 0.7089524269104004, |
| "num_tokens": 7803692.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.1265822784810124, |
| "grad_norm": 0.2999579906463623, |
| "learning_rate": 0.00016377852090274276, |
| "loss": 1.2834, |
| "mean_token_accuracy": 0.7007805109024048, |
| "num_tokens": 7851547.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.1392405063291138, |
| "grad_norm": 0.32791537046432495, |
| "learning_rate": 0.0001633259915104616, |
| "loss": 1.225, |
| "mean_token_accuracy": 0.7079063057899475, |
| "num_tokens": 7896107.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.151898734177215, |
| "grad_norm": 0.35149338841438293, |
| "learning_rate": 0.0001628712866590885, |
| "loss": 1.1993, |
| "mean_token_accuracy": 0.7159732580184937, |
| "num_tokens": 7938836.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1645569620253164, |
| "grad_norm": 0.3519878387451172, |
| "learning_rate": 0.00016241442196925223, |
| "loss": 1.267, |
| "mean_token_accuracy": 0.6996027827262878, |
| "num_tokens": 7985475.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.1772151898734178, |
| "grad_norm": 0.32906627655029297, |
| "learning_rate": 0.00016195541313577923, |
| "loss": 1.2498, |
| "mean_token_accuracy": 0.7009555697441101, |
| "num_tokens": 8034933.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.189873417721519, |
| "grad_norm": 0.322187215089798, |
| "learning_rate": 0.00016149427592715432, |
| "loss": 1.269, |
| "mean_token_accuracy": 0.6975268721580505, |
| "num_tokens": 8082912.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2025316455696204, |
| "grad_norm": 0.33761700987815857, |
| "learning_rate": 0.00016103102618497922, |
| "loss": 1.245, |
| "mean_token_accuracy": 0.7072176337242126, |
| "num_tokens": 8129099.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.2151898734177213, |
| "grad_norm": 0.31815439462661743, |
| "learning_rate": 0.00016056567982342817, |
| "loss": 1.2356, |
| "mean_token_accuracy": 0.7027240991592407, |
| "num_tokens": 8175931.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.2278481012658227, |
| "grad_norm": 0.3221277594566345, |
| "learning_rate": 0.00016009825282870126, |
| "loss": 1.2474, |
| "mean_token_accuracy": 0.7036200165748596, |
| "num_tokens": 8224227.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.240506329113924, |
| "grad_norm": 0.32305020093917847, |
| "learning_rate": 0.00015962876125847535, |
| "loss": 1.2577, |
| "mean_token_accuracy": 0.7010858654975891, |
| "num_tokens": 8273285.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.2531645569620253, |
| "grad_norm": 0.35282593965530396, |
| "learning_rate": 0.00015915722124135227, |
| "loss": 1.2303, |
| "mean_token_accuracy": 0.7082141041755676, |
| "num_tokens": 8316689.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.2658227848101267, |
| "grad_norm": 0.3499389886856079, |
| "learning_rate": 0.0001586836489763049, |
| "loss": 1.275, |
| "mean_token_accuracy": 0.6990365386009216, |
| "num_tokens": 8365327.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.278481012658228, |
| "grad_norm": 0.34207987785339355, |
| "learning_rate": 0.00015820806073212055, |
| "loss": 1.2536, |
| "mean_token_accuracy": 0.702049970626831, |
| "num_tokens": 8411392.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.291139240506329, |
| "grad_norm": 0.32787948846817017, |
| "learning_rate": 0.0001577304728468422, |
| "loss": 1.2539, |
| "mean_token_accuracy": 0.7007697820663452, |
| "num_tokens": 8460562.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.3037974683544302, |
| "grad_norm": 0.3327817916870117, |
| "learning_rate": 0.0001572509017272072, |
| "loss": 1.2562, |
| "mean_token_accuracy": 0.7036707401275635, |
| "num_tokens": 8506693.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3164556962025316, |
| "grad_norm": 0.3491711914539337, |
| "learning_rate": 0.00015676936384808354, |
| "loss": 1.2257, |
| "mean_token_accuracy": 0.7093122005462646, |
| "num_tokens": 8549239.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.329113924050633, |
| "grad_norm": 0.33453595638275146, |
| "learning_rate": 0.00015628587575190395, |
| "loss": 1.2653, |
| "mean_token_accuracy": 0.6975212693214417, |
| "num_tokens": 8594850.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.3417721518987342, |
| "grad_norm": 0.331360399723053, |
| "learning_rate": 0.00015580045404809772, |
| "loss": 1.283, |
| "mean_token_accuracy": 0.6986226439476013, |
| "num_tokens": 8642542.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.3544303797468356, |
| "grad_norm": 0.3299597501754761, |
| "learning_rate": 0.00015531311541251995, |
| "loss": 1.2375, |
| "mean_token_accuracy": 0.704332709312439, |
| "num_tokens": 8690890.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.367088607594937, |
| "grad_norm": 0.3463394343852997, |
| "learning_rate": 0.00015482387658687875, |
| "loss": 1.2434, |
| "mean_token_accuracy": 0.7066888809204102, |
| "num_tokens": 8737195.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.379746835443038, |
| "grad_norm": 0.3440077304840088, |
| "learning_rate": 0.00015433275437816004, |
| "loss": 1.2422, |
| "mean_token_accuracy": 0.7034814357757568, |
| "num_tokens": 8784251.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.392405063291139, |
| "grad_norm": 0.34045225381851196, |
| "learning_rate": 0.00015383976565805035, |
| "loss": 1.2669, |
| "mean_token_accuracy": 0.6978285312652588, |
| "num_tokens": 8831103.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4050632911392404, |
| "grad_norm": 0.34536802768707275, |
| "learning_rate": 0.00015334492736235705, |
| "loss": 1.2757, |
| "mean_token_accuracy": 0.699856698513031, |
| "num_tokens": 8878611.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4177215189873418, |
| "grad_norm": 0.3353114426136017, |
| "learning_rate": 0.00015284825649042655, |
| "loss": 1.2864, |
| "mean_token_accuracy": 0.6976174712181091, |
| "num_tokens": 8927279.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.430379746835443, |
| "grad_norm": 0.3356870710849762, |
| "learning_rate": 0.00015234977010456047, |
| "loss": 1.2366, |
| "mean_token_accuracy": 0.7043005228042603, |
| "num_tokens": 8974198.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.4430379746835444, |
| "grad_norm": 0.347060889005661, |
| "learning_rate": 0.00015184948532942928, |
| "loss": 1.2653, |
| "mean_token_accuracy": 0.7007454633712769, |
| "num_tokens": 9018395.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4556962025316453, |
| "grad_norm": 0.33887261152267456, |
| "learning_rate": 0.0001513474193514842, |
| "loss": 1.2701, |
| "mean_token_accuracy": 0.7008969187736511, |
| "num_tokens": 9069077.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4683544303797467, |
| "grad_norm": 0.348005473613739, |
| "learning_rate": 0.0001508435894183667, |
| "loss": 1.2134, |
| "mean_token_accuracy": 0.711205244064331, |
| "num_tokens": 9113754.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.481012658227848, |
| "grad_norm": 0.3352693021297455, |
| "learning_rate": 0.00015033801283831596, |
| "loss": 1.2823, |
| "mean_token_accuracy": 0.6957764029502869, |
| "num_tokens": 9164557.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4936708860759493, |
| "grad_norm": 0.33518290519714355, |
| "learning_rate": 0.00014983070697957438, |
| "loss": 1.2649, |
| "mean_token_accuracy": 0.69664067029953, |
| "num_tokens": 9211773.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5063291139240507, |
| "grad_norm": 0.33229929208755493, |
| "learning_rate": 0.00014932168926979074, |
| "loss": 1.2585, |
| "mean_token_accuracy": 0.7020613551139832, |
| "num_tokens": 9260300.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.518987341772152, |
| "grad_norm": 0.3351842164993286, |
| "learning_rate": 0.00014881097719542173, |
| "loss": 1.259, |
| "mean_token_accuracy": 0.7015478014945984, |
| "num_tokens": 9309789.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.5316455696202533, |
| "grad_norm": 0.34552860260009766, |
| "learning_rate": 0.000148298588301131, |
| "loss": 1.2738, |
| "mean_token_accuracy": 0.7004240155220032, |
| "num_tokens": 9357260.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5443037974683547, |
| "grad_norm": 0.3504265546798706, |
| "learning_rate": 0.0001477845401891867, |
| "loss": 1.2694, |
| "mean_token_accuracy": 0.6969807744026184, |
| "num_tokens": 9406608.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5569620253164556, |
| "grad_norm": 0.35586681962013245, |
| "learning_rate": 0.00014726885051885653, |
| "loss": 1.2553, |
| "mean_token_accuracy": 0.7009937167167664, |
| "num_tokens": 9451253.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.569620253164557, |
| "grad_norm": 0.34470343589782715, |
| "learning_rate": 0.00014675153700580124, |
| "loss": 1.2595, |
| "mean_token_accuracy": 0.7024118304252625, |
| "num_tokens": 9497216.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5822784810126582, |
| "grad_norm": 0.335822194814682, |
| "learning_rate": 0.00014623261742146602, |
| "loss": 1.2525, |
| "mean_token_accuracy": 0.7015378475189209, |
| "num_tokens": 9544033.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5949367088607596, |
| "grad_norm": 0.3584577441215515, |
| "learning_rate": 0.00014571210959246988, |
| "loss": 1.2333, |
| "mean_token_accuracy": 0.706198513507843, |
| "num_tokens": 9586333.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.607594936708861, |
| "grad_norm": 0.34092119336128235, |
| "learning_rate": 0.00014519003139999337, |
| "loss": 1.2542, |
| "mean_token_accuracy": 0.7034091353416443, |
| "num_tokens": 9634298.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.620253164556962, |
| "grad_norm": 0.35801050066947937, |
| "learning_rate": 0.0001446664007791644, |
| "loss": 1.2988, |
| "mean_token_accuracy": 0.6928357481956482, |
| "num_tokens": 9682141.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.632911392405063, |
| "grad_norm": 0.3394937515258789, |
| "learning_rate": 0.00014414123571844178, |
| "loss": 1.2624, |
| "mean_token_accuracy": 0.7046942710876465, |
| "num_tokens": 9731222.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6455696202531644, |
| "grad_norm": 0.35818547010421753, |
| "learning_rate": 0.00014361455425899756, |
| "loss": 1.2537, |
| "mean_token_accuracy": 0.7017344832420349, |
| "num_tokens": 9778851.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.6582278481012658, |
| "grad_norm": 0.369809627532959, |
| "learning_rate": 0.00014308637449409706, |
| "loss": 1.2001, |
| "mean_token_accuracy": 0.7117389440536499, |
| "num_tokens": 9822556.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.670886075949367, |
| "grad_norm": 0.3590123653411865, |
| "learning_rate": 0.00014255671456847748, |
| "loss": 1.2923, |
| "mean_token_accuracy": 0.6946203708648682, |
| "num_tokens": 9870151.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6835443037974684, |
| "grad_norm": 0.3501306176185608, |
| "learning_rate": 0.00014202559267772444, |
| "loss": 1.2468, |
| "mean_token_accuracy": 0.701853334903717, |
| "num_tokens": 9916833.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.6962025316455698, |
| "grad_norm": 0.3504582643508911, |
| "learning_rate": 0.00014149302706764697, |
| "loss": 1.279, |
| "mean_token_accuracy": 0.6964161396026611, |
| "num_tokens": 9965727.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.708860759493671, |
| "grad_norm": 0.3543940782546997, |
| "learning_rate": 0.00014095903603365066, |
| "loss": 1.2258, |
| "mean_token_accuracy": 0.704728364944458, |
| "num_tokens": 10009527.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.721518987341772, |
| "grad_norm": 0.3418155014514923, |
| "learning_rate": 0.0001404236379201091, |
| "loss": 1.2177, |
| "mean_token_accuracy": 0.7080258727073669, |
| "num_tokens": 10055667.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.7341772151898733, |
| "grad_norm": 0.34693628549575806, |
| "learning_rate": 0.00013988685111973384, |
| "loss": 1.254, |
| "mean_token_accuracy": 0.7021883726119995, |
| "num_tokens": 10104077.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7468354430379747, |
| "grad_norm": 0.3545077443122864, |
| "learning_rate": 0.00013934869407294245, |
| "loss": 1.3069, |
| "mean_token_accuracy": 0.6918914318084717, |
| "num_tokens": 10152374.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.759493670886076, |
| "grad_norm": 0.3604845702648163, |
| "learning_rate": 0.00013880918526722497, |
| "loss": 1.2708, |
| "mean_token_accuracy": 0.6986167430877686, |
| "num_tokens": 10198416.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.7721518987341773, |
| "grad_norm": 0.34998974204063416, |
| "learning_rate": 0.000138268343236509, |
| "loss": 1.2194, |
| "mean_token_accuracy": 0.7079833745956421, |
| "num_tokens": 10243724.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.7848101265822782, |
| "grad_norm": 0.3521496057510376, |
| "learning_rate": 0.0001377261865605227, |
| "loss": 1.2717, |
| "mean_token_accuracy": 0.6980299949645996, |
| "num_tokens": 10290286.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.7974683544303796, |
| "grad_norm": 0.3567959666252136, |
| "learning_rate": 0.0001371827338641568, |
| "loss": 1.2435, |
| "mean_token_accuracy": 0.7042776942253113, |
| "num_tokens": 10335000.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.810126582278481, |
| "grad_norm": 0.3671683371067047, |
| "learning_rate": 0.00013663800381682464, |
| "loss": 1.2715, |
| "mean_token_accuracy": 0.6983711123466492, |
| "num_tokens": 10381661.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8227848101265822, |
| "grad_norm": 0.3411732614040375, |
| "learning_rate": 0.00013609201513182075, |
| "loss": 1.2401, |
| "mean_token_accuracy": 0.7075390815734863, |
| "num_tokens": 10427314.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.8354430379746836, |
| "grad_norm": 0.3450396656990051, |
| "learning_rate": 0.00013554478656567818, |
| "loss": 1.2947, |
| "mean_token_accuracy": 0.6972159147262573, |
| "num_tokens": 10476119.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.848101265822785, |
| "grad_norm": 0.3609869182109833, |
| "learning_rate": 0.0001349963369175239, |
| "loss": 1.2503, |
| "mean_token_accuracy": 0.7017799615859985, |
| "num_tokens": 10521408.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8607594936708862, |
| "grad_norm": 0.3500053584575653, |
| "learning_rate": 0.0001344466850284333, |
| "loss": 1.2872, |
| "mean_token_accuracy": 0.6957990527153015, |
| "num_tokens": 10569128.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8734177215189876, |
| "grad_norm": 0.3592340052127838, |
| "learning_rate": 0.00013389584978078258, |
| "loss": 1.2613, |
| "mean_token_accuracy": 0.7002545595169067, |
| "num_tokens": 10615151.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8860759493670884, |
| "grad_norm": 0.35870033502578735, |
| "learning_rate": 0.00013334385009760032, |
| "loss": 1.2487, |
| "mean_token_accuracy": 0.7038562893867493, |
| "num_tokens": 10659636.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.8987341772151898, |
| "grad_norm": 0.3581511676311493, |
| "learning_rate": 0.00013279070494191737, |
| "loss": 1.2662, |
| "mean_token_accuracy": 0.7002348303794861, |
| "num_tokens": 10703988.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.911392405063291, |
| "grad_norm": 0.3540744185447693, |
| "learning_rate": 0.00013223643331611537, |
| "loss": 1.2613, |
| "mean_token_accuracy": 0.7001772522926331, |
| "num_tokens": 10750306.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9240506329113924, |
| "grad_norm": 0.37011268734931946, |
| "learning_rate": 0.000131681054261274, |
| "loss": 1.2902, |
| "mean_token_accuracy": 0.697233259677887, |
| "num_tokens": 10795550.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9367088607594938, |
| "grad_norm": 0.3456755578517914, |
| "learning_rate": 0.00013112458685651668, |
| "loss": 1.3182, |
| "mean_token_accuracy": 0.6913251876831055, |
| "num_tokens": 10845252.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9493670886075947, |
| "grad_norm": 0.34918084740638733, |
| "learning_rate": 0.00013056705021835546, |
| "loss": 1.2464, |
| "mean_token_accuracy": 0.7025464773178101, |
| "num_tokens": 10892204.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.962025316455696, |
| "grad_norm": 0.3588140606880188, |
| "learning_rate": 0.0001300084635000341, |
| "loss": 1.3022, |
| "mean_token_accuracy": 0.6909407377243042, |
| "num_tokens": 10938188.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.9746835443037973, |
| "grad_norm": 0.35461536049842834, |
| "learning_rate": 0.00012944884589086993, |
| "loss": 1.3174, |
| "mean_token_accuracy": 0.6889122128486633, |
| "num_tokens": 10986801.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9873417721518987, |
| "grad_norm": 0.3585621416568756, |
| "learning_rate": 0.00012888821661559508, |
| "loss": 1.2524, |
| "mean_token_accuracy": 0.7034770846366882, |
| "num_tokens": 11033772.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.3551687002182007, |
| "learning_rate": 0.00012832659493369557, |
| "loss": 1.0758, |
| "mean_token_accuracy": 0.739671528339386, |
| "num_tokens": 11079559.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0126582278481013, |
| "grad_norm": 0.4075370728969574, |
| "learning_rate": 0.00012776400013875006, |
| "loss": 1.032, |
| "mean_token_accuracy": 0.7526733875274658, |
| "num_tokens": 11127596.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0253164556962027, |
| "grad_norm": 0.3849814832210541, |
| "learning_rate": 0.0001272004515577668, |
| "loss": 1.004, |
| "mean_token_accuracy": 0.7555179595947266, |
| "num_tokens": 11172559.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.037974683544304, |
| "grad_norm": 0.4353029131889343, |
| "learning_rate": 0.0001266359685505198, |
| "loss": 0.99, |
| "mean_token_accuracy": 0.7563720345497131, |
| "num_tokens": 11218566.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050632911392405, |
| "grad_norm": 0.600694477558136, |
| "learning_rate": 0.0001260705705088837, |
| "loss": 0.9818, |
| "mean_token_accuracy": 0.7581696510314941, |
| "num_tokens": 11268632.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0632911392405062, |
| "grad_norm": 0.5432077050209045, |
| "learning_rate": 0.00012550427685616765, |
| "loss": 1.0269, |
| "mean_token_accuracy": 0.7526742219924927, |
| "num_tokens": 11315719.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0759493670886076, |
| "grad_norm": 0.4427173435688019, |
| "learning_rate": 0.00012493710704644805, |
| "loss": 0.9989, |
| "mean_token_accuracy": 0.75676429271698, |
| "num_tokens": 11362573.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.088607594936709, |
| "grad_norm": 0.3981163501739502, |
| "learning_rate": 0.0001243690805639002, |
| "loss": 0.9723, |
| "mean_token_accuracy": 0.7642591595649719, |
| "num_tokens": 11408853.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1012658227848102, |
| "grad_norm": 0.3880089223384857, |
| "learning_rate": 0.00012380021692212894, |
| "loss": 0.9801, |
| "mean_token_accuracy": 0.7625755667686462, |
| "num_tokens": 11455555.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1139240506329116, |
| "grad_norm": 0.38175487518310547, |
| "learning_rate": 0.00012323053566349834, |
| "loss": 0.9998, |
| "mean_token_accuracy": 0.7584809064865112, |
| "num_tokens": 11503963.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.1265822784810124, |
| "grad_norm": 0.39173728227615356, |
| "learning_rate": 0.00012266005635846037, |
| "loss": 0.9341, |
| "mean_token_accuracy": 0.7685783505439758, |
| "num_tokens": 11549537.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.1392405063291138, |
| "grad_norm": 0.435289591550827, |
| "learning_rate": 0.0001220887986048825, |
| "loss": 0.948, |
| "mean_token_accuracy": 0.7657555341720581, |
| "num_tokens": 11595442.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.151898734177215, |
| "grad_norm": 0.480478972196579, |
| "learning_rate": 0.00012151678202737456, |
| "loss": 0.9671, |
| "mean_token_accuracy": 0.7640275955200195, |
| "num_tokens": 11638867.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1645569620253164, |
| "grad_norm": 0.5007439851760864, |
| "learning_rate": 0.00012094402627661447, |
| "loss": 0.9631, |
| "mean_token_accuracy": 0.7621972560882568, |
| "num_tokens": 11684515.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.1772151898734178, |
| "grad_norm": 0.4938323497772217, |
| "learning_rate": 0.00012037055102867321, |
| "loss": 0.9863, |
| "mean_token_accuracy": 0.7565716505050659, |
| "num_tokens": 11731295.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.189873417721519, |
| "grad_norm": 0.46317818760871887, |
| "learning_rate": 0.00011979637598433899, |
| "loss": 0.9599, |
| "mean_token_accuracy": 0.7661996483802795, |
| "num_tokens": 11775897.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2025316455696204, |
| "grad_norm": 0.4412788152694702, |
| "learning_rate": 0.00011922152086844023, |
| "loss": 0.9711, |
| "mean_token_accuracy": 0.7613348364830017, |
| "num_tokens": 11821749.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.2151898734177213, |
| "grad_norm": 0.4221232235431671, |
| "learning_rate": 0.00011864600542916813, |
| "loss": 0.9382, |
| "mean_token_accuracy": 0.7676687240600586, |
| "num_tokens": 11868449.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.2278481012658227, |
| "grad_norm": 0.4161496162414551, |
| "learning_rate": 0.00011806984943739821, |
| "loss": 0.9391, |
| "mean_token_accuracy": 0.7664811015129089, |
| "num_tokens": 11915036.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.240506329113924, |
| "grad_norm": 0.40381163358688354, |
| "learning_rate": 0.00011749307268601111, |
| "loss": 1.0414, |
| "mean_token_accuracy": 0.7476540207862854, |
| "num_tokens": 11965079.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.2531645569620253, |
| "grad_norm": 0.41820257902145386, |
| "learning_rate": 0.00011691569498921264, |
| "loss": 0.9629, |
| "mean_token_accuracy": 0.7615616917610168, |
| "num_tokens": 12011784.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.2658227848101267, |
| "grad_norm": 0.44741806387901306, |
| "learning_rate": 0.00011633773618185302, |
| "loss": 0.977, |
| "mean_token_accuracy": 0.7589461207389832, |
| "num_tokens": 12058153.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.278481012658228, |
| "grad_norm": 0.4427592158317566, |
| "learning_rate": 0.00011575921611874565, |
| "loss": 0.9571, |
| "mean_token_accuracy": 0.7660679221153259, |
| "num_tokens": 12104427.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.291139240506329, |
| "grad_norm": 0.4691466987133026, |
| "learning_rate": 0.00011518015467398489, |
| "loss": 0.9336, |
| "mean_token_accuracy": 0.7664586901664734, |
| "num_tokens": 12149528.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.3037974683544302, |
| "grad_norm": 0.47362270951271057, |
| "learning_rate": 0.00011460057174026335, |
| "loss": 0.9858, |
| "mean_token_accuracy": 0.7595200538635254, |
| "num_tokens": 12196598.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3164556962025316, |
| "grad_norm": 0.46093323826789856, |
| "learning_rate": 0.0001140204872281886, |
| "loss": 0.9882, |
| "mean_token_accuracy": 0.7542067766189575, |
| "num_tokens": 12245036.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.329113924050633, |
| "grad_norm": 0.43514880537986755, |
| "learning_rate": 0.00011343992106559898, |
| "loss": 1.0037, |
| "mean_token_accuracy": 0.7565442323684692, |
| "num_tokens": 12294189.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.3417721518987342, |
| "grad_norm": 0.4213711619377136, |
| "learning_rate": 0.00011285889319687923, |
| "loss": 0.9712, |
| "mean_token_accuracy": 0.7629369497299194, |
| "num_tokens": 12343569.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.3544303797468356, |
| "grad_norm": 0.42522549629211426, |
| "learning_rate": 0.00011227742358227522, |
| "loss": 0.9892, |
| "mean_token_accuracy": 0.7599421143531799, |
| "num_tokens": 12392717.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.367088607594937, |
| "grad_norm": 0.43775442242622375, |
| "learning_rate": 0.00011169553219720828, |
| "loss": 0.9598, |
| "mean_token_accuracy": 0.7645099759101868, |
| "num_tokens": 12437216.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.379746835443038, |
| "grad_norm": 0.45032966136932373, |
| "learning_rate": 0.00011111323903158885, |
| "loss": 0.988, |
| "mean_token_accuracy": 0.7559954524040222, |
| "num_tokens": 12484566.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.392405063291139, |
| "grad_norm": 0.4129181206226349, |
| "learning_rate": 0.00011053056408913001, |
| "loss": 0.9857, |
| "mean_token_accuracy": 0.758560299873352, |
| "num_tokens": 12534891.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4050632911392404, |
| "grad_norm": 0.4736068546772003, |
| "learning_rate": 0.0001099475273866601, |
| "loss": 0.9717, |
| "mean_token_accuracy": 0.7591570615768433, |
| "num_tokens": 12579893.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4177215189873418, |
| "grad_norm": 0.4686090350151062, |
| "learning_rate": 0.0001093641489534351, |
| "loss": 0.9763, |
| "mean_token_accuracy": 0.7623862028121948, |
| "num_tokens": 12625552.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.430379746835443, |
| "grad_norm": 0.44861164689064026, |
| "learning_rate": 0.0001087804488304506, |
| "loss": 0.9643, |
| "mean_token_accuracy": 0.7631211876869202, |
| "num_tokens": 12671496.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.4430379746835444, |
| "grad_norm": 0.45744118094444275, |
| "learning_rate": 0.00010819644706975332, |
| "loss": 0.9521, |
| "mean_token_accuracy": 0.7642855644226074, |
| "num_tokens": 12716763.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4556962025316453, |
| "grad_norm": 0.48478421568870544, |
| "learning_rate": 0.00010761216373375221, |
| "loss": 0.9767, |
| "mean_token_accuracy": 0.7615178823471069, |
| "num_tokens": 12760151.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4683544303797467, |
| "grad_norm": 0.4677796959877014, |
| "learning_rate": 0.0001070276188945293, |
| "loss": 0.9978, |
| "mean_token_accuracy": 0.7565178871154785, |
| "num_tokens": 12805130.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.481012658227848, |
| "grad_norm": 0.4537658095359802, |
| "learning_rate": 0.00010644283263315014, |
| "loss": 0.9788, |
| "mean_token_accuracy": 0.7601967453956604, |
| "num_tokens": 12851949.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4936708860759493, |
| "grad_norm": 0.4506645202636719, |
| "learning_rate": 0.00010585782503897388, |
| "loss": 0.9727, |
| "mean_token_accuracy": 0.7614617347717285, |
| "num_tokens": 12898123.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5063291139240507, |
| "grad_norm": 0.42953184247016907, |
| "learning_rate": 0.00010527261620896323, |
| "loss": 0.9731, |
| "mean_token_accuracy": 0.7647458910942078, |
| "num_tokens": 12945268.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.518987341772152, |
| "grad_norm": 0.4598475396633148, |
| "learning_rate": 0.00010468722624699401, |
| "loss": 1.0024, |
| "mean_token_accuracy": 0.7568365931510925, |
| "num_tokens": 12991371.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.5316455696202533, |
| "grad_norm": 0.44531142711639404, |
| "learning_rate": 0.00010410167526316457, |
| "loss": 0.9627, |
| "mean_token_accuracy": 0.7636065483093262, |
| "num_tokens": 13039004.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5443037974683547, |
| "grad_norm": 0.4507937729358673, |
| "learning_rate": 0.00010351598337310482, |
| "loss": 0.9912, |
| "mean_token_accuracy": 0.7541834115982056, |
| "num_tokens": 13085920.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5569620253164556, |
| "grad_norm": 0.4690151512622833, |
| "learning_rate": 0.00010293017069728535, |
| "loss": 1.0278, |
| "mean_token_accuracy": 0.7486876845359802, |
| "num_tokens": 13133610.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.569620253164557, |
| "grad_norm": 0.4618782103061676, |
| "learning_rate": 0.00010234425736032607, |
| "loss": 0.9648, |
| "mean_token_accuracy": 0.7642068862915039, |
| "num_tokens": 13178353.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5822784810126582, |
| "grad_norm": 0.45085033774375916, |
| "learning_rate": 0.00010175826349030496, |
| "loss": 1.0038, |
| "mean_token_accuracy": 0.7567628026008606, |
| "num_tokens": 13227509.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5949367088607596, |
| "grad_norm": 0.44593507051467896, |
| "learning_rate": 0.00010117220921806664, |
| "loss": 0.9988, |
| "mean_token_accuracy": 0.752589225769043, |
| "num_tokens": 13276140.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.607594936708861, |
| "grad_norm": 0.448966383934021, |
| "learning_rate": 0.00010058611467653066, |
| "loss": 0.9782, |
| "mean_token_accuracy": 0.7603657841682434, |
| "num_tokens": 13322896.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.620253164556962, |
| "grad_norm": 0.43764910101890564, |
| "learning_rate": 0.0001, |
| "loss": 0.9499, |
| "mean_token_accuracy": 0.7665926218032837, |
| "num_tokens": 13369788.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.632911392405063, |
| "grad_norm": 0.46153128147125244, |
| "learning_rate": 9.941388532346934e-05, |
| "loss": 0.9586, |
| "mean_token_accuracy": 0.7638452053070068, |
| "num_tokens": 13414073.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6455696202531644, |
| "grad_norm": 0.44592994451522827, |
| "learning_rate": 9.882779078193339e-05, |
| "loss": 0.9965, |
| "mean_token_accuracy": 0.7588433027267456, |
| "num_tokens": 13462931.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.6582278481012658, |
| "grad_norm": 0.4681696593761444, |
| "learning_rate": 9.824173650969507e-05, |
| "loss": 0.9741, |
| "mean_token_accuracy": 0.7605555057525635, |
| "num_tokens": 13509369.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.670886075949367, |
| "grad_norm": 0.46631893515586853, |
| "learning_rate": 9.765574263967396e-05, |
| "loss": 0.9998, |
| "mean_token_accuracy": 0.7567450404167175, |
| "num_tokens": 13553206.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6835443037974684, |
| "grad_norm": 0.44251787662506104, |
| "learning_rate": 9.706982930271465e-05, |
| "loss": 0.9894, |
| "mean_token_accuracy": 0.7563201785087585, |
| "num_tokens": 13601370.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.6962025316455698, |
| "grad_norm": 0.4594095051288605, |
| "learning_rate": 9.648401662689521e-05, |
| "loss": 0.9922, |
| "mean_token_accuracy": 0.7575803995132446, |
| "num_tokens": 13647210.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.708860759493671, |
| "grad_norm": 0.4474162757396698, |
| "learning_rate": 9.589832473683547e-05, |
| "loss": 0.9915, |
| "mean_token_accuracy": 0.7562800049781799, |
| "num_tokens": 13694726.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.721518987341772, |
| "grad_norm": 0.4731695353984833, |
| "learning_rate": 9.531277375300599e-05, |
| "loss": 0.9804, |
| "mean_token_accuracy": 0.758215606212616, |
| "num_tokens": 13737605.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.7341772151898733, |
| "grad_norm": 0.4519980847835541, |
| "learning_rate": 9.472738379103682e-05, |
| "loss": 1.004, |
| "mean_token_accuracy": 0.7548936605453491, |
| "num_tokens": 13784873.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7468354430379747, |
| "grad_norm": 0.45873039960861206, |
| "learning_rate": 9.414217496102614e-05, |
| "loss": 0.9526, |
| "mean_token_accuracy": 0.7641096711158752, |
| "num_tokens": 13831802.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.759493670886076, |
| "grad_norm": 0.46528834104537964, |
| "learning_rate": 9.355716736684988e-05, |
| "loss": 0.9592, |
| "mean_token_accuracy": 0.7640624642372131, |
| "num_tokens": 13878035.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.7721518987341773, |
| "grad_norm": 0.45268163084983826, |
| "learning_rate": 9.297238110547074e-05, |
| "loss": 1.0181, |
| "mean_token_accuracy": 0.7509171366691589, |
| "num_tokens": 13927436.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.7848101265822782, |
| "grad_norm": 0.4594506323337555, |
| "learning_rate": 9.238783626624781e-05, |
| "loss": 0.9415, |
| "mean_token_accuracy": 0.7657912373542786, |
| "num_tokens": 13972430.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.7974683544303796, |
| "grad_norm": 0.46437937021255493, |
| "learning_rate": 9.180355293024669e-05, |
| "loss": 0.9485, |
| "mean_token_accuracy": 0.766374945640564, |
| "num_tokens": 14019227.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.810126582278481, |
| "grad_norm": 0.4636267125606537, |
| "learning_rate": 9.121955116954942e-05, |
| "loss": 0.9802, |
| "mean_token_accuracy": 0.7597395181655884, |
| "num_tokens": 14064750.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8227848101265822, |
| "grad_norm": 0.48009157180786133, |
| "learning_rate": 9.063585104656493e-05, |
| "loss": 0.9248, |
| "mean_token_accuracy": 0.7727100253105164, |
| "num_tokens": 14109629.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.8354430379746836, |
| "grad_norm": 0.46061643958091736, |
| "learning_rate": 9.005247261333993e-05, |
| "loss": 0.9856, |
| "mean_token_accuracy": 0.7584598660469055, |
| "num_tokens": 14157714.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.848101265822785, |
| "grad_norm": 0.46670177578926086, |
| "learning_rate": 8.946943591087e-05, |
| "loss": 1.0039, |
| "mean_token_accuracy": 0.7559428811073303, |
| "num_tokens": 14202874.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8607594936708862, |
| "grad_norm": 0.4689050018787384, |
| "learning_rate": 8.88867609684112e-05, |
| "loss": 0.9811, |
| "mean_token_accuracy": 0.7581244707107544, |
| "num_tokens": 14247064.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8734177215189876, |
| "grad_norm": 0.44281500577926636, |
| "learning_rate": 8.830446780279176e-05, |
| "loss": 0.9928, |
| "mean_token_accuracy": 0.7555981874465942, |
| "num_tokens": 14296653.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8860759493670884, |
| "grad_norm": 0.45278170704841614, |
| "learning_rate": 8.772257641772479e-05, |
| "loss": 0.9772, |
| "mean_token_accuracy": 0.7612497806549072, |
| "num_tokens": 14342518.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.8987341772151898, |
| "grad_norm": 0.4528560936450958, |
| "learning_rate": 8.71411068031208e-05, |
| "loss": 0.9495, |
| "mean_token_accuracy": 0.7653767466545105, |
| "num_tokens": 14389406.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.911392405063291, |
| "grad_norm": 0.4473622143268585, |
| "learning_rate": 8.656007893440106e-05, |
| "loss": 0.9523, |
| "mean_token_accuracy": 0.7669484615325928, |
| "num_tokens": 14437734.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9240506329113924, |
| "grad_norm": 0.4741891324520111, |
| "learning_rate": 8.597951277181142e-05, |
| "loss": 1.003, |
| "mean_token_accuracy": 0.7522197961807251, |
| "num_tokens": 14485437.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9367088607594938, |
| "grad_norm": 0.4523335099220276, |
| "learning_rate": 8.539942825973666e-05, |
| "loss": 0.9808, |
| "mean_token_accuracy": 0.7603780031204224, |
| "num_tokens": 14534282.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9493670886075947, |
| "grad_norm": 0.469784677028656, |
| "learning_rate": 8.481984532601515e-05, |
| "loss": 0.9904, |
| "mean_token_accuracy": 0.7573358416557312, |
| "num_tokens": 14580319.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.962025316455696, |
| "grad_norm": 0.47262197732925415, |
| "learning_rate": 8.424078388125436e-05, |
| "loss": 0.9906, |
| "mean_token_accuracy": 0.7568280696868896, |
| "num_tokens": 14628896.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.9746835443037973, |
| "grad_norm": 0.47215375304222107, |
| "learning_rate": 8.366226381814697e-05, |
| "loss": 1.0217, |
| "mean_token_accuracy": 0.7515872716903687, |
| "num_tokens": 14677943.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9873417721518987, |
| "grad_norm": 0.4638935625553131, |
| "learning_rate": 8.308430501078739e-05, |
| "loss": 1.0244, |
| "mean_token_accuracy": 0.7499192953109741, |
| "num_tokens": 14727559.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.43590956926345825, |
| "learning_rate": 8.25069273139889e-05, |
| "loss": 0.8203, |
| "mean_token_accuracy": 0.7978315949440002, |
| "num_tokens": 14774109.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012658227848101, |
| "grad_norm": 0.4966140389442444, |
| "learning_rate": 8.19301505626018e-05, |
| "loss": 0.7698, |
| "mean_token_accuracy": 0.8127477765083313, |
| "num_tokens": 14821852.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025316455696203, |
| "grad_norm": 0.48176905512809753, |
| "learning_rate": 8.13539945708319e-05, |
| "loss": 0.7578, |
| "mean_token_accuracy": 0.8137043118476868, |
| "num_tokens": 14867274.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.037974683544304, |
| "grad_norm": 0.49787062406539917, |
| "learning_rate": 8.07784791315598e-05, |
| "loss": 0.7138, |
| "mean_token_accuracy": 0.8246570229530334, |
| "num_tokens": 14913037.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050632911392405, |
| "grad_norm": 0.6012403964996338, |
| "learning_rate": 8.020362401566103e-05, |
| "loss": 0.7109, |
| "mean_token_accuracy": 0.8215330839157104, |
| "num_tokens": 14959569.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063291139240507, |
| "grad_norm": 0.7662049531936646, |
| "learning_rate": 7.962944897132678e-05, |
| "loss": 0.7184, |
| "mean_token_accuracy": 0.8202931880950928, |
| "num_tokens": 15006565.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.075949367088608, |
| "grad_norm": 0.707722008228302, |
| "learning_rate": 7.905597372338558e-05, |
| "loss": 0.7138, |
| "mean_token_accuracy": 0.8212239146232605, |
| "num_tokens": 15053218.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.0886075949367084, |
| "grad_norm": 0.5710378289222717, |
| "learning_rate": 7.848321797262548e-05, |
| "loss": 0.6948, |
| "mean_token_accuracy": 0.8260384202003479, |
| "num_tokens": 15101626.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.10126582278481, |
| "grad_norm": 0.536343514919281, |
| "learning_rate": 7.791120139511752e-05, |
| "loss": 0.7012, |
| "mean_token_accuracy": 0.8271479606628418, |
| "num_tokens": 15147012.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.113924050632911, |
| "grad_norm": 0.5122034549713135, |
| "learning_rate": 7.733994364153969e-05, |
| "loss": 0.7082, |
| "mean_token_accuracy": 0.8272866010665894, |
| "num_tokens": 15192996.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.1265822784810124, |
| "grad_norm": 0.49738800525665283, |
| "learning_rate": 7.67694643365017e-05, |
| "loss": 0.7172, |
| "mean_token_accuracy": 0.8232470750808716, |
| "num_tokens": 15238270.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.139240506329114, |
| "grad_norm": 0.5137494206428528, |
| "learning_rate": 7.619978307787108e-05, |
| "loss": 0.6974, |
| "mean_token_accuracy": 0.8292660713195801, |
| "num_tokens": 15281770.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.151898734177215, |
| "grad_norm": 0.5142786502838135, |
| "learning_rate": 7.563091943609984e-05, |
| "loss": 0.7247, |
| "mean_token_accuracy": 0.8209677934646606, |
| "num_tokens": 15328105.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.1645569620253164, |
| "grad_norm": 0.5584180951118469, |
| "learning_rate": 7.506289295355198e-05, |
| "loss": 0.709, |
| "mean_token_accuracy": 0.8250913619995117, |
| "num_tokens": 15374679.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.177215189873418, |
| "grad_norm": 0.5827005505561829, |
| "learning_rate": 7.449572314383237e-05, |
| "loss": 0.7321, |
| "mean_token_accuracy": 0.8182151317596436, |
| "num_tokens": 15421166.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.189873417721519, |
| "grad_norm": 0.6163628101348877, |
| "learning_rate": 7.392942949111633e-05, |
| "loss": 0.7458, |
| "mean_token_accuracy": 0.8168110847473145, |
| "num_tokens": 15469246.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.2025316455696204, |
| "grad_norm": 0.5932377576828003, |
| "learning_rate": 7.336403144948022e-05, |
| "loss": 0.7449, |
| "mean_token_accuracy": 0.8152413368225098, |
| "num_tokens": 15516117.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.215189873417722, |
| "grad_norm": 0.5681145787239075, |
| "learning_rate": 7.279954844223323e-05, |
| "loss": 0.7052, |
| "mean_token_accuracy": 0.8263698816299438, |
| "num_tokens": 15562590.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.227848101265823, |
| "grad_norm": 0.5275646448135376, |
| "learning_rate": 7.223599986124994e-05, |
| "loss": 0.7144, |
| "mean_token_accuracy": 0.8233181238174438, |
| "num_tokens": 15611380.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.2405063291139244, |
| "grad_norm": 0.549479067325592, |
| "learning_rate": 7.167340506630445e-05, |
| "loss": 0.6902, |
| "mean_token_accuracy": 0.8262238502502441, |
| "num_tokens": 15656853.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.253164556962025, |
| "grad_norm": 0.5401619672775269, |
| "learning_rate": 7.111178338440496e-05, |
| "loss": 0.6795, |
| "mean_token_accuracy": 0.8296888470649719, |
| "num_tokens": 15702968.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.265822784810126, |
| "grad_norm": 0.5113623738288879, |
| "learning_rate": 7.055115410913009e-05, |
| "loss": 0.6953, |
| "mean_token_accuracy": 0.8251818418502808, |
| "num_tokens": 15748811.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.2784810126582276, |
| "grad_norm": 0.5283024311065674, |
| "learning_rate": 6.999153649996595e-05, |
| "loss": 0.7128, |
| "mean_token_accuracy": 0.8234080672264099, |
| "num_tokens": 15796380.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.291139240506329, |
| "grad_norm": 0.5316226482391357, |
| "learning_rate": 6.943294978164454e-05, |
| "loss": 0.6752, |
| "mean_token_accuracy": 0.8321078419685364, |
| "num_tokens": 15842956.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.30379746835443, |
| "grad_norm": 0.5778771638870239, |
| "learning_rate": 6.887541314348333e-05, |
| "loss": 0.7031, |
| "mean_token_accuracy": 0.8234809637069702, |
| "num_tokens": 15889134.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.3164556962025316, |
| "grad_norm": 0.5819162130355835, |
| "learning_rate": 6.831894573872601e-05, |
| "loss": 0.7429, |
| "mean_token_accuracy": 0.8154833912849426, |
| "num_tokens": 15936229.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.329113924050633, |
| "grad_norm": 0.5713794827461243, |
| "learning_rate": 6.776356668388464e-05, |
| "loss": 0.7124, |
| "mean_token_accuracy": 0.8215630650520325, |
| "num_tokens": 15981973.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.341772151898734, |
| "grad_norm": 0.5627953410148621, |
| "learning_rate": 6.720929505808265e-05, |
| "loss": 0.7298, |
| "mean_token_accuracy": 0.8181149959564209, |
| "num_tokens": 16031035.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.3544303797468356, |
| "grad_norm": 0.5609976053237915, |
| "learning_rate": 6.665614990239969e-05, |
| "loss": 0.6939, |
| "mean_token_accuracy": 0.828144371509552, |
| "num_tokens": 16077929.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.367088607594937, |
| "grad_norm": 0.5497515797615051, |
| "learning_rate": 6.610415021921747e-05, |
| "loss": 0.7098, |
| "mean_token_accuracy": 0.8211853504180908, |
| "num_tokens": 16124544.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.379746835443038, |
| "grad_norm": 0.5421944260597229, |
| "learning_rate": 6.555331497156672e-05, |
| "loss": 0.6964, |
| "mean_token_accuracy": 0.8250083923339844, |
| "num_tokens": 16172376.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3924050632911396, |
| "grad_norm": 0.535250723361969, |
| "learning_rate": 6.50036630824761e-05, |
| "loss": 0.6991, |
| "mean_token_accuracy": 0.8260812163352966, |
| "num_tokens": 16217829.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.405063291139241, |
| "grad_norm": 0.5412235260009766, |
| "learning_rate": 6.445521343432188e-05, |
| "loss": 0.7066, |
| "mean_token_accuracy": 0.8224402666091919, |
| "num_tokens": 16263962.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.417721518987342, |
| "grad_norm": 0.5575072169303894, |
| "learning_rate": 6.390798486817929e-05, |
| "loss": 0.705, |
| "mean_token_accuracy": 0.8242610096931458, |
| "num_tokens": 16308410.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.430379746835443, |
| "grad_norm": 0.5557534098625183, |
| "learning_rate": 6.336199618317537e-05, |
| "loss": 0.7195, |
| "mean_token_accuracy": 0.8202704787254333, |
| "num_tokens": 16355133.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.443037974683544, |
| "grad_norm": 0.5342419743537903, |
| "learning_rate": 6.281726613584321e-05, |
| "loss": 0.6991, |
| "mean_token_accuracy": 0.8249329924583435, |
| "num_tokens": 16401842.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.455696202531645, |
| "grad_norm": 0.5405949950218201, |
| "learning_rate": 6.227381343947733e-05, |
| "loss": 0.6922, |
| "mean_token_accuracy": 0.8285226821899414, |
| "num_tokens": 16449370.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.468354430379747, |
| "grad_norm": 0.552777886390686, |
| "learning_rate": 6.173165676349103e-05, |
| "loss": 0.7142, |
| "mean_token_accuracy": 0.8212454915046692, |
| "num_tokens": 16497416.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.481012658227848, |
| "grad_norm": 0.5529714226722717, |
| "learning_rate": 6.119081473277501e-05, |
| "loss": 0.6991, |
| "mean_token_accuracy": 0.8240037560462952, |
| "num_tokens": 16544231.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.493670886075949, |
| "grad_norm": 0.5485042929649353, |
| "learning_rate": 6.065130592705759e-05, |
| "loss": 0.7307, |
| "mean_token_accuracy": 0.8205800652503967, |
| "num_tokens": 16592701.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.506329113924051, |
| "grad_norm": 0.5457609295845032, |
| "learning_rate": 6.01131488802662e-05, |
| "loss": 0.7112, |
| "mean_token_accuracy": 0.8206736445426941, |
| "num_tokens": 16639646.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.518987341772152, |
| "grad_norm": 0.5910729765892029, |
| "learning_rate": 5.9576362079890925e-05, |
| "loss": 0.7012, |
| "mean_token_accuracy": 0.8259279727935791, |
| "num_tokens": 16685375.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.531645569620253, |
| "grad_norm": 0.5504463911056519, |
| "learning_rate": 5.904096396634935e-05, |
| "loss": 0.7073, |
| "mean_token_accuracy": 0.8246215581893921, |
| "num_tokens": 16733267.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.544303797468355, |
| "grad_norm": 0.5555917024612427, |
| "learning_rate": 5.8506972932353035e-05, |
| "loss": 0.6635, |
| "mean_token_accuracy": 0.8324669599533081, |
| "num_tokens": 16777961.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.556962025316456, |
| "grad_norm": 0.5440343618392944, |
| "learning_rate": 5.797440732227555e-05, |
| "loss": 0.7234, |
| "mean_token_accuracy": 0.8209396004676819, |
| "num_tokens": 16827472.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.569620253164557, |
| "grad_norm": 0.5303831100463867, |
| "learning_rate": 5.744328543152253e-05, |
| "loss": 0.662, |
| "mean_token_accuracy": 0.8331236243247986, |
| "num_tokens": 16872839.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.582278481012658, |
| "grad_norm": 0.563178539276123, |
| "learning_rate": 5.691362550590297e-05, |
| "loss": 0.6625, |
| "mean_token_accuracy": 0.8346900343894958, |
| "num_tokens": 16915163.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.594936708860759, |
| "grad_norm": 0.5247779488563538, |
| "learning_rate": 5.638544574100249e-05, |
| "loss": 0.7099, |
| "mean_token_accuracy": 0.823519766330719, |
| "num_tokens": 16963986.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.6075949367088604, |
| "grad_norm": 0.5180805325508118, |
| "learning_rate": 5.585876428155824e-05, |
| "loss": 0.6988, |
| "mean_token_accuracy": 0.8249117732048035, |
| "num_tokens": 17012220.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.620253164556962, |
| "grad_norm": 0.5352941751480103, |
| "learning_rate": 5.533359922083562e-05, |
| "loss": 0.6849, |
| "mean_token_accuracy": 0.8279665112495422, |
| "num_tokens": 17058711.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.632911392405063, |
| "grad_norm": 0.5777114033699036, |
| "learning_rate": 5.4809968600006635e-05, |
| "loss": 0.678, |
| "mean_token_accuracy": 0.8303003907203674, |
| "num_tokens": 17102682.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.6455696202531644, |
| "grad_norm": 0.5614490509033203, |
| "learning_rate": 5.4287890407530175e-05, |
| "loss": 0.7108, |
| "mean_token_accuracy": 0.8221400380134583, |
| "num_tokens": 17149530.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.658227848101266, |
| "grad_norm": 0.5888735055923462, |
| "learning_rate": 5.3767382578534e-05, |
| "loss": 0.6856, |
| "mean_token_accuracy": 0.828814685344696, |
| "num_tokens": 17193634.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.670886075949367, |
| "grad_norm": 0.5642009377479553, |
| "learning_rate": 5.324846299419879e-05, |
| "loss": 0.7221, |
| "mean_token_accuracy": 0.8182055950164795, |
| "num_tokens": 17243375.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.6835443037974684, |
| "grad_norm": 0.5699864625930786, |
| "learning_rate": 5.273114948114346e-05, |
| "loss": 0.6912, |
| "mean_token_accuracy": 0.8257492780685425, |
| "num_tokens": 17288116.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.69620253164557, |
| "grad_norm": 0.5664955973625183, |
| "learning_rate": 5.2215459810813306e-05, |
| "loss": 0.7255, |
| "mean_token_accuracy": 0.8178353309631348, |
| "num_tokens": 17335928.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.708860759493671, |
| "grad_norm": 0.5631005167961121, |
| "learning_rate": 5.170141169886904e-05, |
| "loss": 0.6987, |
| "mean_token_accuracy": 0.8256130218505859, |
| "num_tokens": 17382320.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.7215189873417724, |
| "grad_norm": 0.5475056767463684, |
| "learning_rate": 5.118902280457829e-05, |
| "loss": 0.7383, |
| "mean_token_accuracy": 0.8166825771331787, |
| "num_tokens": 17432712.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.734177215189874, |
| "grad_norm": 0.5569179654121399, |
| "learning_rate": 5.0678310730209275e-05, |
| "loss": 0.7157, |
| "mean_token_accuracy": 0.8199924230575562, |
| "num_tokens": 17480174.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.746835443037975, |
| "grad_norm": 0.5541711449623108, |
| "learning_rate": 5.016929302042563e-05, |
| "loss": 0.6978, |
| "mean_token_accuracy": 0.826197624206543, |
| "num_tokens": 17528563.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.759493670886076, |
| "grad_norm": 0.5538228750228882, |
| "learning_rate": 4.9661987161684045e-05, |
| "loss": 0.693, |
| "mean_token_accuracy": 0.8276927471160889, |
| "num_tokens": 17573303.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.772151898734177, |
| "grad_norm": 0.5440813899040222, |
| "learning_rate": 4.9156410581633317e-05, |
| "loss": 0.699, |
| "mean_token_accuracy": 0.8246811628341675, |
| "num_tokens": 17620099.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.784810126582278, |
| "grad_norm": 0.5575851202011108, |
| "learning_rate": 4.865258064851579e-05, |
| "loss": 0.72, |
| "mean_token_accuracy": 0.8187082409858704, |
| "num_tokens": 17666100.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.7974683544303796, |
| "grad_norm": 0.5372059941291809, |
| "learning_rate": 4.8150514670570754e-05, |
| "loss": 0.7156, |
| "mean_token_accuracy": 0.8224175572395325, |
| "num_tokens": 17716107.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.810126582278481, |
| "grad_norm": 0.5502781271934509, |
| "learning_rate": 4.765022989543958e-05, |
| "loss": 0.6808, |
| "mean_token_accuracy": 0.8300414085388184, |
| "num_tokens": 17762547.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.822784810126582, |
| "grad_norm": 0.5721256732940674, |
| "learning_rate": 4.7151743509573444e-05, |
| "loss": 0.7167, |
| "mean_token_accuracy": 0.8231954574584961, |
| "num_tokens": 17808939.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.8354430379746836, |
| "grad_norm": 0.557105541229248, |
| "learning_rate": 4.665507263764299e-05, |
| "loss": 0.6788, |
| "mean_token_accuracy": 0.831015944480896, |
| "num_tokens": 17854457.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.848101265822785, |
| "grad_norm": 0.560921311378479, |
| "learning_rate": 4.6160234341949646e-05, |
| "loss": 0.7473, |
| "mean_token_accuracy": 0.8154394030570984, |
| "num_tokens": 17901958.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.860759493670886, |
| "grad_norm": 0.5427091717720032, |
| "learning_rate": 4.5667245621839974e-05, |
| "loss": 0.6843, |
| "mean_token_accuracy": 0.8294286727905273, |
| "num_tokens": 17949316.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8734177215189876, |
| "grad_norm": 0.54844731092453, |
| "learning_rate": 4.5176123413121284e-05, |
| "loss": 0.7267, |
| "mean_token_accuracy": 0.8211008310317993, |
| "num_tokens": 17998525.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.886075949367089, |
| "grad_norm": 0.5478676557540894, |
| "learning_rate": 4.468688458748006e-05, |
| "loss": 0.7032, |
| "mean_token_accuracy": 0.8235698342323303, |
| "num_tokens": 18045174.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.89873417721519, |
| "grad_norm": 0.5715044140815735, |
| "learning_rate": 4.4199545951902286e-05, |
| "loss": 0.7351, |
| "mean_token_accuracy": 0.8134607076644897, |
| "num_tokens": 18094745.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.911392405063291, |
| "grad_norm": 0.5567689538002014, |
| "learning_rate": 4.3714124248096067e-05, |
| "loss": 0.72, |
| "mean_token_accuracy": 0.8220183253288269, |
| "num_tokens": 18142769.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.924050632911392, |
| "grad_norm": 0.5515459179878235, |
| "learning_rate": 4.3230636151916495e-05, |
| "loss": 0.7314, |
| "mean_token_accuracy": 0.8181837201118469, |
| "num_tokens": 18190392.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.936708860759493, |
| "grad_norm": 0.5599684715270996, |
| "learning_rate": 4.274909827279283e-05, |
| "loss": 0.6852, |
| "mean_token_accuracy": 0.8275984525680542, |
| "num_tokens": 18238292.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.949367088607595, |
| "grad_norm": 0.581655740737915, |
| "learning_rate": 4.226952715315779e-05, |
| "loss": 0.6965, |
| "mean_token_accuracy": 0.8275977969169617, |
| "num_tokens": 18282932.0, |
| "step": 391 |
| }, |
| { |
| "epoch": 4.962025316455696, |
| "grad_norm": 0.5861680507659912, |
| "learning_rate": 4.17919392678795e-05, |
| "loss": 0.6881, |
| "mean_token_accuracy": 0.8262351155281067, |
| "num_tokens": 18325542.0, |
| "step": 392 |
| }, |
| { |
| "epoch": 4.974683544303797, |
| "grad_norm": 0.5522813200950623, |
| "learning_rate": 4.131635102369513e-05, |
| "loss": 0.7188, |
| "mean_token_accuracy": 0.8196642398834229, |
| "num_tokens": 18373317.0, |
| "step": 393 |
| }, |
| { |
| "epoch": 4.987341772151899, |
| "grad_norm": 0.5678694248199463, |
| "learning_rate": 4.084277875864776e-05, |
| "loss": 0.7326, |
| "mean_token_accuracy": 0.8180271983146667, |
| "num_tokens": 18422185.0, |
| "step": 394 |
| }, |
| { |
| "epoch": 5.0, |
| "grad_norm": 0.4936027526855469, |
| "learning_rate": 4.037123874152472e-05, |
| "loss": 0.5711, |
| "mean_token_accuracy": 0.8599328398704529, |
| "num_tokens": 18468998.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 5.012658227848101, |
| "grad_norm": 0.5264456272125244, |
| "learning_rate": 3.9901747171298766e-05, |
| "loss": 0.5328, |
| "mean_token_accuracy": 0.8718881011009216, |
| "num_tokens": 18514452.0, |
| "step": 396 |
| }, |
| { |
| "epoch": 5.025316455696203, |
| "grad_norm": 0.5222989320755005, |
| "learning_rate": 3.943432017657186e-05, |
| "loss": 0.5193, |
| "mean_token_accuracy": 0.8739416599273682, |
| "num_tokens": 18561288.0, |
| "step": 397 |
| }, |
| { |
| "epoch": 5.037974683544304, |
| "grad_norm": 0.5219823718070984, |
| "learning_rate": 3.8968973815020806e-05, |
| "loss": 0.4756, |
| "mean_token_accuracy": 0.884689211845398, |
| "num_tokens": 18607731.0, |
| "step": 398 |
| }, |
| { |
| "epoch": 5.050632911392405, |
| "grad_norm": 0.5559691786766052, |
| "learning_rate": 3.850572407284569e-05, |
| "loss": 0.4868, |
| "mean_token_accuracy": 0.8799352645874023, |
| "num_tokens": 18650422.0, |
| "step": 399 |
| }, |
| { |
| "epoch": 5.063291139240507, |
| "grad_norm": 0.6586586236953735, |
| "learning_rate": 3.80445868642208e-05, |
| "loss": 0.5133, |
| "mean_token_accuracy": 0.8707754015922546, |
| "num_tokens": 18694425.0, |
| "step": 400 |
| }, |
| { |
| "epoch": 5.075949367088608, |
| "grad_norm": 0.7043012976646423, |
| "learning_rate": 3.7585578030747744e-05, |
| "loss": 0.4937, |
| "mean_token_accuracy": 0.8765274882316589, |
| "num_tokens": 18743180.0, |
| "step": 401 |
| }, |
| { |
| "epoch": 5.0886075949367084, |
| "grad_norm": 0.7497896552085876, |
| "learning_rate": 3.7128713340911535e-05, |
| "loss": 0.4978, |
| "mean_token_accuracy": 0.8755159974098206, |
| "num_tokens": 18792905.0, |
| "step": 402 |
| }, |
| { |
| "epoch": 5.10126582278481, |
| "grad_norm": 0.7151162028312683, |
| "learning_rate": 3.667400848953845e-05, |
| "loss": 0.5065, |
| "mean_token_accuracy": 0.875111997127533, |
| "num_tokens": 18839835.0, |
| "step": 403 |
| }, |
| { |
| "epoch": 5.113924050632911, |
| "grad_norm": 0.6478233337402344, |
| "learning_rate": 3.622147909725724e-05, |
| "loss": 0.4802, |
| "mean_token_accuracy": 0.8800956010818481, |
| "num_tokens": 18888029.0, |
| "step": 404 |
| }, |
| { |
| "epoch": 5.1265822784810124, |
| "grad_norm": 0.6064746975898743, |
| "learning_rate": 3.577114070996247e-05, |
| "loss": 0.5117, |
| "mean_token_accuracy": 0.8728470802307129, |
| "num_tokens": 18933322.0, |
| "step": 405 |
| }, |
| { |
| "epoch": 5.139240506329114, |
| "grad_norm": 0.5626401305198669, |
| "learning_rate": 3.532300879828013e-05, |
| "loss": 0.4832, |
| "mean_token_accuracy": 0.8781822919845581, |
| "num_tokens": 18980522.0, |
| "step": 406 |
| }, |
| { |
| "epoch": 5.151898734177215, |
| "grad_norm": 0.546474039554596, |
| "learning_rate": 3.4877098757036665e-05, |
| "loss": 0.5058, |
| "mean_token_accuracy": 0.8778883218765259, |
| "num_tokens": 19028624.0, |
| "step": 407 |
| }, |
| { |
| "epoch": 5.1645569620253164, |
| "grad_norm": 0.5445472002029419, |
| "learning_rate": 3.44334259047297e-05, |
| "loss": 0.4888, |
| "mean_token_accuracy": 0.8800671696662903, |
| "num_tokens": 19074522.0, |
| "step": 408 |
| }, |
| { |
| "epoch": 5.177215189873418, |
| "grad_norm": 0.531647801399231, |
| "learning_rate": 3.3992005483002e-05, |
| "loss": 0.4776, |
| "mean_token_accuracy": 0.8834218978881836, |
| "num_tokens": 19122571.0, |
| "step": 409 |
| }, |
| { |
| "epoch": 5.189873417721519, |
| "grad_norm": 0.5426664352416992, |
| "learning_rate": 3.355285265611784e-05, |
| "loss": 0.5024, |
| "mean_token_accuracy": 0.8779997825622559, |
| "num_tokens": 19171389.0, |
| "step": 410 |
| }, |
| { |
| "epoch": 5.2025316455696204, |
| "grad_norm": 0.5555723905563354, |
| "learning_rate": 3.3115982510442014e-05, |
| "loss": 0.5103, |
| "mean_token_accuracy": 0.8771188855171204, |
| "num_tokens": 19219296.0, |
| "step": 411 |
| }, |
| { |
| "epoch": 5.215189873417722, |
| "grad_norm": 0.5892623066902161, |
| "learning_rate": 3.268141005392163e-05, |
| "loss": 0.4948, |
| "mean_token_accuracy": 0.8789801597595215, |
| "num_tokens": 19262386.0, |
| "step": 412 |
| }, |
| { |
| "epoch": 5.227848101265823, |
| "grad_norm": 0.5882421731948853, |
| "learning_rate": 3.224915021557049e-05, |
| "loss": 0.4821, |
| "mean_token_accuracy": 0.8825682401657104, |
| "num_tokens": 19307259.0, |
| "step": 413 |
| }, |
| { |
| "epoch": 5.2405063291139244, |
| "grad_norm": 0.6074917316436768, |
| "learning_rate": 3.1819217844956214e-05, |
| "loss": 0.4925, |
| "mean_token_accuracy": 0.8789646625518799, |
| "num_tokens": 19355152.0, |
| "step": 414 |
| }, |
| { |
| "epoch": 5.253164556962025, |
| "grad_norm": 0.6312512159347534, |
| "learning_rate": 3.1391627711690296e-05, |
| "loss": 0.4878, |
| "mean_token_accuracy": 0.8776240944862366, |
| "num_tokens": 19400470.0, |
| "step": 415 |
| }, |
| { |
| "epoch": 5.265822784810126, |
| "grad_norm": 0.6164311766624451, |
| "learning_rate": 3.0966394504920317e-05, |
| "loss": 0.4695, |
| "mean_token_accuracy": 0.8826056718826294, |
| "num_tokens": 19446848.0, |
| "step": 416 |
| }, |
| { |
| "epoch": 5.2784810126582276, |
| "grad_norm": 0.6131919026374817, |
| "learning_rate": 3.0543532832825715e-05, |
| "loss": 0.4808, |
| "mean_token_accuracy": 0.8802450299263, |
| "num_tokens": 19493432.0, |
| "step": 417 |
| }, |
| { |
| "epoch": 5.291139240506329, |
| "grad_norm": 0.6002056002616882, |
| "learning_rate": 3.0123057222115836e-05, |
| "loss": 0.4986, |
| "mean_token_accuracy": 0.8771020174026489, |
| "num_tokens": 19542496.0, |
| "step": 418 |
| }, |
| { |
| "epoch": 5.30379746835443, |
| "grad_norm": 0.6012871265411377, |
| "learning_rate": 2.9704982117530777e-05, |
| "loss": 0.5124, |
| "mean_token_accuracy": 0.8735976815223694, |
| "num_tokens": 19590605.0, |
| "step": 419 |
| }, |
| { |
| "epoch": 5.3164556962025316, |
| "grad_norm": 0.5826122164726257, |
| "learning_rate": 2.9289321881345254e-05, |
| "loss": 0.4848, |
| "mean_token_accuracy": 0.8811623454093933, |
| "num_tokens": 19636816.0, |
| "step": 420 |
| }, |
| { |
| "epoch": 5.329113924050633, |
| "grad_norm": 0.5988377332687378, |
| "learning_rate": 2.887609079287521e-05, |
| "loss": 0.4867, |
| "mean_token_accuracy": 0.8805438280105591, |
| "num_tokens": 19683441.0, |
| "step": 421 |
| }, |
| { |
| "epoch": 5.341772151898734, |
| "grad_norm": 0.5812557339668274, |
| "learning_rate": 2.8465303047987267e-05, |
| "loss": 0.4878, |
| "mean_token_accuracy": 0.8807899951934814, |
| "num_tokens": 19731605.0, |
| "step": 422 |
| }, |
| { |
| "epoch": 5.3544303797468356, |
| "grad_norm": 0.5604175329208374, |
| "learning_rate": 2.805697275861101e-05, |
| "loss": 0.4961, |
| "mean_token_accuracy": 0.8778889179229736, |
| "num_tokens": 19780346.0, |
| "step": 423 |
| }, |
| { |
| "epoch": 5.367088607594937, |
| "grad_norm": 0.5724864602088928, |
| "learning_rate": 2.765111395225424e-05, |
| "loss": 0.4884, |
| "mean_token_accuracy": 0.8789756894111633, |
| "num_tokens": 19828326.0, |
| "step": 424 |
| }, |
| { |
| "epoch": 5.379746835443038, |
| "grad_norm": 0.5703694224357605, |
| "learning_rate": 2.7247740571521118e-05, |
| "loss": 0.4896, |
| "mean_token_accuracy": 0.8801313042640686, |
| "num_tokens": 19875600.0, |
| "step": 425 |
| }, |
| { |
| "epoch": 5.3924050632911396, |
| "grad_norm": 0.5990126132965088, |
| "learning_rate": 2.6846866473633125e-05, |
| "loss": 0.4726, |
| "mean_token_accuracy": 0.8829923868179321, |
| "num_tokens": 19919174.0, |
| "step": 426 |
| }, |
| { |
| "epoch": 5.405063291139241, |
| "grad_norm": 0.6109516024589539, |
| "learning_rate": 2.6448505429952917e-05, |
| "loss": 0.4907, |
| "mean_token_accuracy": 0.8786324262619019, |
| "num_tokens": 19963492.0, |
| "step": 427 |
| }, |
| { |
| "epoch": 5.417721518987342, |
| "grad_norm": 0.5848973393440247, |
| "learning_rate": 2.605267112551154e-05, |
| "loss": 0.5069, |
| "mean_token_accuracy": 0.8753526210784912, |
| "num_tokens": 20011058.0, |
| "step": 428 |
| }, |
| { |
| "epoch": 5.430379746835443, |
| "grad_norm": 0.590811014175415, |
| "learning_rate": 2.5659377158538012e-05, |
| "loss": 0.499, |
| "mean_token_accuracy": 0.8782621622085571, |
| "num_tokens": 20058905.0, |
| "step": 429 |
| }, |
| { |
| "epoch": 5.443037974683544, |
| "grad_norm": 0.6152106523513794, |
| "learning_rate": 2.5268637039992293e-05, |
| "loss": 0.4988, |
| "mean_token_accuracy": 0.875298023223877, |
| "num_tokens": 20105945.0, |
| "step": 430 |
| }, |
| { |
| "epoch": 5.455696202531645, |
| "grad_norm": 0.592876136302948, |
| "learning_rate": 2.488046419310114e-05, |
| "loss": 0.4965, |
| "mean_token_accuracy": 0.877647340297699, |
| "num_tokens": 20153462.0, |
| "step": 431 |
| }, |
| { |
| "epoch": 5.468354430379747, |
| "grad_norm": 0.6070770025253296, |
| "learning_rate": 2.4494871952896947e-05, |
| "loss": 0.4933, |
| "mean_token_accuracy": 0.8780992031097412, |
| "num_tokens": 20197529.0, |
| "step": 432 |
| }, |
| { |
| "epoch": 5.481012658227848, |
| "grad_norm": 0.5933142900466919, |
| "learning_rate": 2.411187356575969e-05, |
| "loss": 0.4813, |
| "mean_token_accuracy": 0.880434513092041, |
| "num_tokens": 20241594.0, |
| "step": 433 |
| }, |
| { |
| "epoch": 5.493670886075949, |
| "grad_norm": 0.5929135084152222, |
| "learning_rate": 2.3731482188961818e-05, |
| "loss": 0.4783, |
| "mean_token_accuracy": 0.8830586671829224, |
| "num_tokens": 20288083.0, |
| "step": 434 |
| }, |
| { |
| "epoch": 5.506329113924051, |
| "grad_norm": 0.5733610391616821, |
| "learning_rate": 2.335371089021623e-05, |
| "loss": 0.49, |
| "mean_token_accuracy": 0.8810379505157471, |
| "num_tokens": 20337667.0, |
| "step": 435 |
| }, |
| { |
| "epoch": 5.518987341772152, |
| "grad_norm": 0.5939366221427917, |
| "learning_rate": 2.297857264722756e-05, |
| "loss": 0.4756, |
| "mean_token_accuracy": 0.8813409209251404, |
| "num_tokens": 20385161.0, |
| "step": 436 |
| }, |
| { |
| "epoch": 5.531645569620253, |
| "grad_norm": 0.5886082649230957, |
| "learning_rate": 2.260608034724595e-05, |
| "loss": 0.5091, |
| "mean_token_accuracy": 0.8750845789909363, |
| "num_tokens": 20432529.0, |
| "step": 437 |
| }, |
| { |
| "epoch": 5.544303797468355, |
| "grad_norm": 0.6086618900299072, |
| "learning_rate": 2.2236246786624792e-05, |
| "loss": 0.4902, |
| "mean_token_accuracy": 0.8768316507339478, |
| "num_tokens": 20476679.0, |
| "step": 438 |
| }, |
| { |
| "epoch": 5.556962025316456, |
| "grad_norm": 0.5850755572319031, |
| "learning_rate": 2.1869084670380835e-05, |
| "loss": 0.5056, |
| "mean_token_accuracy": 0.8765684962272644, |
| "num_tokens": 20524559.0, |
| "step": 439 |
| }, |
| { |
| "epoch": 5.569620253164557, |
| "grad_norm": 0.5923234224319458, |
| "learning_rate": 2.150460661175768e-05, |
| "loss": 0.4736, |
| "mean_token_accuracy": 0.8819867372512817, |
| "num_tokens": 20568152.0, |
| "step": 440 |
| }, |
| { |
| "epoch": 5.582278481012658, |
| "grad_norm": 0.5886726975440979, |
| "learning_rate": 2.114282513179281e-05, |
| "loss": 0.4752, |
| "mean_token_accuracy": 0.8854075074195862, |
| "num_tokens": 20613760.0, |
| "step": 441 |
| }, |
| { |
| "epoch": 5.594936708860759, |
| "grad_norm": 0.6090703010559082, |
| "learning_rate": 2.0783752658887066e-05, |
| "loss": 0.4786, |
| "mean_token_accuracy": 0.8821261525154114, |
| "num_tokens": 20658957.0, |
| "step": 442 |
| }, |
| { |
| "epoch": 5.6075949367088604, |
| "grad_norm": 0.6041176915168762, |
| "learning_rate": 2.0427401528377953e-05, |
| "loss": 0.4982, |
| "mean_token_accuracy": 0.8764042258262634, |
| "num_tokens": 20704330.0, |
| "step": 443 |
| }, |
| { |
| "epoch": 5.620253164556962, |
| "grad_norm": 0.60368812084198, |
| "learning_rate": 2.0073783982115723e-05, |
| "loss": 0.5062, |
| "mean_token_accuracy": 0.8757708668708801, |
| "num_tokens": 20752555.0, |
| "step": 444 |
| }, |
| { |
| "epoch": 5.632911392405063, |
| "grad_norm": 0.5774247050285339, |
| "learning_rate": 1.9722912168042897e-05, |
| "loss": 0.511, |
| "mean_token_accuracy": 0.8744285106658936, |
| "num_tokens": 20805115.0, |
| "step": 445 |
| }, |
| { |
| "epoch": 5.6455696202531644, |
| "grad_norm": 0.6094748973846436, |
| "learning_rate": 1.937479813977703e-05, |
| "loss": 0.4879, |
| "mean_token_accuracy": 0.8806090950965881, |
| "num_tokens": 20849571.0, |
| "step": 446 |
| }, |
| { |
| "epoch": 5.658227848101266, |
| "grad_norm": 0.6145944595336914, |
| "learning_rate": 1.9029453856196376e-05, |
| "loss": 0.5112, |
| "mean_token_accuracy": 0.8738813400268555, |
| "num_tokens": 20896678.0, |
| "step": 447 |
| }, |
| { |
| "epoch": 5.670886075949367, |
| "grad_norm": 0.5843153595924377, |
| "learning_rate": 1.868689118102931e-05, |
| "loss": 0.4848, |
| "mean_token_accuracy": 0.8810961246490479, |
| "num_tokens": 20942796.0, |
| "step": 448 |
| }, |
| { |
| "epoch": 5.6835443037974684, |
| "grad_norm": 0.5841859579086304, |
| "learning_rate": 1.8347121882446717e-05, |
| "loss": 0.4932, |
| "mean_token_accuracy": 0.8793487548828125, |
| "num_tokens": 20989971.0, |
| "step": 449 |
| }, |
| { |
| "epoch": 5.69620253164557, |
| "grad_norm": 0.606610894203186, |
| "learning_rate": 1.8010157632657543e-05, |
| "loss": 0.4786, |
| "mean_token_accuracy": 0.8826842904090881, |
| "num_tokens": 21037258.0, |
| "step": 450 |
| }, |
| { |
| "epoch": 5.708860759493671, |
| "grad_norm": 0.6054370999336243, |
| "learning_rate": 1.7676010007508092e-05, |
| "loss": 0.4914, |
| "mean_token_accuracy": 0.8785582184791565, |
| "num_tokens": 21082183.0, |
| "step": 451 |
| }, |
| { |
| "epoch": 5.7215189873417724, |
| "grad_norm": 0.6061049699783325, |
| "learning_rate": 1.7344690486084137e-05, |
| "loss": 0.5013, |
| "mean_token_accuracy": 0.8739482760429382, |
| "num_tokens": 21126697.0, |
| "step": 452 |
| }, |
| { |
| "epoch": 5.734177215189874, |
| "grad_norm": 0.5808444023132324, |
| "learning_rate": 1.701621045031666e-05, |
| "loss": 0.5065, |
| "mean_token_accuracy": 0.8762862086296082, |
| "num_tokens": 21177006.0, |
| "step": 453 |
| }, |
| { |
| "epoch": 5.746835443037975, |
| "grad_norm": 0.5869651436805725, |
| "learning_rate": 1.6690581184590858e-05, |
| "loss": 0.5022, |
| "mean_token_accuracy": 0.8760119080543518, |
| "num_tokens": 21224010.0, |
| "step": 454 |
| }, |
| { |
| "epoch": 5.759493670886076, |
| "grad_norm": 0.5848543047904968, |
| "learning_rate": 1.636781387535843e-05, |
| "loss": 0.5056, |
| "mean_token_accuracy": 0.8729737401008606, |
| "num_tokens": 21273056.0, |
| "step": 455 |
| }, |
| { |
| "epoch": 5.772151898734177, |
| "grad_norm": 0.6035214066505432, |
| "learning_rate": 1.604791961075336e-05, |
| "loss": 0.4964, |
| "mean_token_accuracy": 0.8771805167198181, |
| "num_tokens": 21318121.0, |
| "step": 456 |
| }, |
| { |
| "epoch": 5.784810126582278, |
| "grad_norm": 0.587157666683197, |
| "learning_rate": 1.5730909380210945e-05, |
| "loss": 0.485, |
| "mean_token_accuracy": 0.8795527815818787, |
| "num_tokens": 21366754.0, |
| "step": 457 |
| }, |
| { |
| "epoch": 5.7974683544303796, |
| "grad_norm": 0.5755473971366882, |
| "learning_rate": 1.5416794074090258e-05, |
| "loss": 0.495, |
| "mean_token_accuracy": 0.8767243027687073, |
| "num_tokens": 21415895.0, |
| "step": 458 |
| }, |
| { |
| "epoch": 5.810126582278481, |
| "grad_norm": 0.5992995500564575, |
| "learning_rate": 1.5105584483300162e-05, |
| "loss": 0.462, |
| "mean_token_accuracy": 0.88564532995224, |
| "num_tokens": 21461554.0, |
| "step": 459 |
| }, |
| { |
| "epoch": 5.822784810126582, |
| "grad_norm": 0.6188696622848511, |
| "learning_rate": 1.479729129892835e-05, |
| "loss": 0.4892, |
| "mean_token_accuracy": 0.8776053190231323, |
| "num_tokens": 21506718.0, |
| "step": 460 |
| }, |
| { |
| "epoch": 5.8354430379746836, |
| "grad_norm": 0.6524665951728821, |
| "learning_rate": 1.4491925111874383e-05, |
| "loss": 0.4889, |
| "mean_token_accuracy": 0.8804559111595154, |
| "num_tokens": 21551527.0, |
| "step": 461 |
| }, |
| { |
| "epoch": 5.848101265822785, |
| "grad_norm": 0.6141889095306396, |
| "learning_rate": 1.4189496412485592e-05, |
| "loss": 0.4781, |
| "mean_token_accuracy": 0.8806585073471069, |
| "num_tokens": 21597694.0, |
| "step": 462 |
| }, |
| { |
| "epoch": 5.860759493670886, |
| "grad_norm": 0.6022236943244934, |
| "learning_rate": 1.3890015590196803e-05, |
| "loss": 0.4957, |
| "mean_token_accuracy": 0.8784832954406738, |
| "num_tokens": 21644912.0, |
| "step": 463 |
| }, |
| { |
| "epoch": 5.8734177215189876, |
| "grad_norm": 0.5849525332450867, |
| "learning_rate": 1.3593492933173512e-05, |
| "loss": 0.4981, |
| "mean_token_accuracy": 0.8747273683547974, |
| "num_tokens": 21694492.0, |
| "step": 464 |
| }, |
| { |
| "epoch": 5.886075949367089, |
| "grad_norm": 0.5798141360282898, |
| "learning_rate": 1.3299938627958297e-05, |
| "loss": 0.5031, |
| "mean_token_accuracy": 0.8752538561820984, |
| "num_tokens": 21745772.0, |
| "step": 465 |
| }, |
| { |
| "epoch": 5.89873417721519, |
| "grad_norm": 0.6097593903541565, |
| "learning_rate": 1.300936275912098e-05, |
| "loss": 0.4789, |
| "mean_token_accuracy": 0.8802154660224915, |
| "num_tokens": 21790391.0, |
| "step": 466 |
| }, |
| { |
| "epoch": 5.911392405063291, |
| "grad_norm": 0.6151306629180908, |
| "learning_rate": 1.2721775308912132e-05, |
| "loss": 0.5194, |
| "mean_token_accuracy": 0.8713752031326294, |
| "num_tokens": 21837009.0, |
| "step": 467 |
| }, |
| { |
| "epoch": 5.924050632911392, |
| "grad_norm": 0.5922465324401855, |
| "learning_rate": 1.2437186156920167e-05, |
| "loss": 0.5141, |
| "mean_token_accuracy": 0.8723000288009644, |
| "num_tokens": 21884990.0, |
| "step": 468 |
| }, |
| { |
| "epoch": 5.936708860759493, |
| "grad_norm": 0.5962823033332825, |
| "learning_rate": 1.2155605079732046e-05, |
| "loss": 0.5089, |
| "mean_token_accuracy": 0.8751126527786255, |
| "num_tokens": 21931648.0, |
| "step": 469 |
| }, |
| { |
| "epoch": 5.949367088607595, |
| "grad_norm": 0.6032353639602661, |
| "learning_rate": 1.1877041750597173e-05, |
| "loss": 0.4964, |
| "mean_token_accuracy": 0.8769810795783997, |
| "num_tokens": 21978656.0, |
| "step": 470 |
| }, |
| { |
| "epoch": 5.962025316455696, |
| "grad_norm": 0.6158297657966614, |
| "learning_rate": 1.160150573909532e-05, |
| "loss": 0.5099, |
| "mean_token_accuracy": 0.8746172189712524, |
| "num_tokens": 22026071.0, |
| "step": 471 |
| }, |
| { |
| "epoch": 5.974683544303797, |
| "grad_norm": 0.5986502766609192, |
| "learning_rate": 1.132900651080785e-05, |
| "loss": 0.4691, |
| "mean_token_accuracy": 0.8836339712142944, |
| "num_tokens": 22070263.0, |
| "step": 472 |
| }, |
| { |
| "epoch": 5.987341772151899, |
| "grad_norm": 0.6113969087600708, |
| "learning_rate": 1.1059553426992365e-05, |
| "loss": 0.5074, |
| "mean_token_accuracy": 0.8743844032287598, |
| "num_tokens": 22117638.0, |
| "step": 473 |
| }, |
| { |
| "epoch": 6.0, |
| "grad_norm": 0.5078223347663879, |
| "learning_rate": 1.0793155744261351e-05, |
| "loss": 0.4089, |
| "mean_token_accuracy": 0.9015847444534302, |
| "num_tokens": 22162756.0, |
| "step": 474 |
| }, |
| { |
| "epoch": 6.012658227848101, |
| "grad_norm": 0.5180269479751587, |
| "learning_rate": 1.0529822614264018e-05, |
| "loss": 0.4232, |
| "mean_token_accuracy": 0.8996778726577759, |
| "num_tokens": 22210317.0, |
| "step": 475 |
| }, |
| { |
| "epoch": 6.025316455696203, |
| "grad_norm": 0.521119236946106, |
| "learning_rate": 1.026956308337199e-05, |
| "loss": 0.4206, |
| "mean_token_accuracy": 0.9003894925117493, |
| "num_tokens": 22257364.0, |
| "step": 476 |
| }, |
| { |
| "epoch": 6.037974683544304, |
| "grad_norm": 0.5258929133415222, |
| "learning_rate": 1.0012386092368475e-05, |
| "loss": 0.3874, |
| "mean_token_accuracy": 0.9093874096870422, |
| "num_tokens": 22302190.0, |
| "step": 477 |
| }, |
| { |
| "epoch": 6.050632911392405, |
| "grad_norm": 0.5309813618659973, |
| "learning_rate": 9.75830047614117e-06, |
| "loss": 0.4006, |
| "mean_token_accuracy": 0.9050379395484924, |
| "num_tokens": 22347967.0, |
| "step": 478 |
| }, |
| { |
| "epoch": 6.063291139240507, |
| "grad_norm": 0.5413678288459778, |
| "learning_rate": 9.507314963378745e-06, |
| "loss": 0.3956, |
| "mean_token_accuracy": 0.905818521976471, |
| "num_tokens": 22393369.0, |
| "step": 479 |
| }, |
| { |
| "epoch": 6.075949367088608, |
| "grad_norm": 0.5256166458129883, |
| "learning_rate": 9.259438176270962e-06, |
| "loss": 0.3977, |
| "mean_token_accuracy": 0.9056070446968079, |
| "num_tokens": 22441212.0, |
| "step": 480 |
| }, |
| { |
| "epoch": 6.0886075949367084, |
| "grad_norm": 0.5342482328414917, |
| "learning_rate": 9.014678630212469e-06, |
| "loss": 0.3903, |
| "mean_token_accuracy": 0.9074738025665283, |
| "num_tokens": 22489792.0, |
| "step": 481 |
| }, |
| { |
| "epoch": 6.10126582278481, |
| "grad_norm": 0.5547141432762146, |
| "learning_rate": 8.773044733510338e-06, |
| "loss": 0.3841, |
| "mean_token_accuracy": 0.9071083068847656, |
| "num_tokens": 22537589.0, |
| "step": 482 |
| }, |
| { |
| "epoch": 6.113924050632911, |
| "grad_norm": 0.6087285280227661, |
| "learning_rate": 8.534544787095078e-06, |
| "loss": 0.3873, |
| "mean_token_accuracy": 0.9074901342391968, |
| "num_tokens": 22583540.0, |
| "step": 483 |
| }, |
| { |
| "epoch": 6.1265822784810124, |
| "grad_norm": 0.6063216328620911, |
| "learning_rate": 8.299186984235585e-06, |
| "loss": 0.3916, |
| "mean_token_accuracy": 0.9041749238967896, |
| "num_tokens": 22630982.0, |
| "step": 484 |
| }, |
| { |
| "epoch": 6.139240506329114, |
| "grad_norm": 0.613871693611145, |
| "learning_rate": 8.06697941025768e-06, |
| "loss": 0.3752, |
| "mean_token_accuracy": 0.9080203175544739, |
| "num_tokens": 22675795.0, |
| "step": 485 |
| }, |
| { |
| "epoch": 6.151898734177215, |
| "grad_norm": 0.6383016705513, |
| "learning_rate": 7.837930042266262e-06, |
| "loss": 0.4072, |
| "mean_token_accuracy": 0.9005741477012634, |
| "num_tokens": 22724800.0, |
| "step": 486 |
| }, |
| { |
| "epoch": 6.1645569620253164, |
| "grad_norm": 0.6214612126350403, |
| "learning_rate": 7.612046748871327e-06, |
| "loss": 0.3898, |
| "mean_token_accuracy": 0.9051695466041565, |
| "num_tokens": 22772528.0, |
| "step": 487 |
| }, |
| { |
| "epoch": 6.177215189873418, |
| "grad_norm": 0.6447484493255615, |
| "learning_rate": 7.389337289917652e-06, |
| "loss": 0.4098, |
| "mean_token_accuracy": 0.9014731049537659, |
| "num_tokens": 22820518.0, |
| "step": 488 |
| }, |
| { |
| "epoch": 6.189873417721519, |
| "grad_norm": 0.6162357330322266, |
| "learning_rate": 7.1698093162182125e-06, |
| "loss": 0.3847, |
| "mean_token_accuracy": 0.9040086269378662, |
| "num_tokens": 22866857.0, |
| "step": 489 |
| }, |
| { |
| "epoch": 6.2025316455696204, |
| "grad_norm": 0.5872465968132019, |
| "learning_rate": 6.953470369291348e-06, |
| "loss": 0.3906, |
| "mean_token_accuracy": 0.9052353501319885, |
| "num_tokens": 22915399.0, |
| "step": 490 |
| }, |
| { |
| "epoch": 6.215189873417722, |
| "grad_norm": 0.5958002209663391, |
| "learning_rate": 6.74032788110166e-06, |
| "loss": 0.3833, |
| "mean_token_accuracy": 0.9080662727355957, |
| "num_tokens": 22961333.0, |
| "step": 491 |
| }, |
| { |
| "epoch": 6.227848101265823, |
| "grad_norm": 0.5847265124320984, |
| "learning_rate": 6.530389173804807e-06, |
| "loss": 0.388, |
| "mean_token_accuracy": 0.9040992259979248, |
| "num_tokens": 23007601.0, |
| "step": 492 |
| }, |
| { |
| "epoch": 6.2405063291139244, |
| "grad_norm": 0.5710330605506897, |
| "learning_rate": 6.323661459495811e-06, |
| "loss": 0.3927, |
| "mean_token_accuracy": 0.9061951637268066, |
| "num_tokens": 23057268.0, |
| "step": 493 |
| }, |
| { |
| "epoch": 6.253164556962025, |
| "grad_norm": 0.5893294811248779, |
| "learning_rate": 6.1201518399613635e-06, |
| "loss": 0.3649, |
| "mean_token_accuracy": 0.9110230207443237, |
| "num_tokens": 23101467.0, |
| "step": 494 |
| }, |
| { |
| "epoch": 6.265822784810126, |
| "grad_norm": 0.5623788833618164, |
| "learning_rate": 5.919867306435934e-06, |
| "loss": 0.3651, |
| "mean_token_accuracy": 0.9124348163604736, |
| "num_tokens": 23146389.0, |
| "step": 495 |
| }, |
| { |
| "epoch": 6.2784810126582276, |
| "grad_norm": 0.557794451713562, |
| "learning_rate": 5.722814739361459e-06, |
| "loss": 0.3735, |
| "mean_token_accuracy": 0.9109086394309998, |
| "num_tokens": 23192664.0, |
| "step": 496 |
| }, |
| { |
| "epoch": 6.291139240506329, |
| "grad_norm": 0.5795067548751831, |
| "learning_rate": 5.529000908151105e-06, |
| "loss": 0.3955, |
| "mean_token_accuracy": 0.9051991701126099, |
| "num_tokens": 23238466.0, |
| "step": 497 |
| }, |
| { |
| "epoch": 6.30379746835443, |
| "grad_norm": 0.5689795017242432, |
| "learning_rate": 5.338432470956589e-06, |
| "loss": 0.3903, |
| "mean_token_accuracy": 0.9060965776443481, |
| "num_tokens": 23287016.0, |
| "step": 498 |
| }, |
| { |
| "epoch": 6.3164556962025316, |
| "grad_norm": 0.5454722046852112, |
| "learning_rate": 5.151115974439569e-06, |
| "loss": 0.3707, |
| "mean_token_accuracy": 0.9100461602210999, |
| "num_tokens": 23334093.0, |
| "step": 499 |
| }, |
| { |
| "epoch": 6.329113924050633, |
| "grad_norm": 0.5693135261535645, |
| "learning_rate": 4.967057853546653e-06, |
| "loss": 0.3775, |
| "mean_token_accuracy": 0.9082093238830566, |
| "num_tokens": 23379118.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 6.341772151898734, |
| "grad_norm": 0.5589075684547424, |
| "learning_rate": 4.786264431288423e-06, |
| "loss": 0.3701, |
| "mean_token_accuracy": 0.9106748104095459, |
| "num_tokens": 23423089.0, |
| "step": 501 |
| }, |
| { |
| "epoch": 6.3544303797468356, |
| "grad_norm": 0.5521835684776306, |
| "learning_rate": 4.608741918522097e-06, |
| "loss": 0.3806, |
| "mean_token_accuracy": 0.9093685746192932, |
| "num_tokens": 23469649.0, |
| "step": 502 |
| }, |
| { |
| "epoch": 6.367088607594937, |
| "grad_norm": 0.5633716583251953, |
| "learning_rate": 4.434496413738332e-06, |
| "loss": 0.392, |
| "mean_token_accuracy": 0.9065303802490234, |
| "num_tokens": 23516862.0, |
| "step": 503 |
| }, |
| { |
| "epoch": 6.379746835443038, |
| "grad_norm": 0.5469903945922852, |
| "learning_rate": 4.263533902851535e-06, |
| "loss": 0.3696, |
| "mean_token_accuracy": 0.9113619923591614, |
| "num_tokens": 23563520.0, |
| "step": 504 |
| }, |
| { |
| "epoch": 6.3924050632911396, |
| "grad_norm": 0.5530360341072083, |
| "learning_rate": 4.095860258994388e-06, |
| "loss": 0.4062, |
| "mean_token_accuracy": 0.9027206897735596, |
| "num_tokens": 23612505.0, |
| "step": 505 |
| }, |
| { |
| "epoch": 6.405063291139241, |
| "grad_norm": 0.5586188435554504, |
| "learning_rate": 3.931481242315993e-06, |
| "loss": 0.3604, |
| "mean_token_accuracy": 0.9130181670188904, |
| "num_tokens": 23658981.0, |
| "step": 506 |
| }, |
| { |
| "epoch": 6.417721518987342, |
| "grad_norm": 0.5679466724395752, |
| "learning_rate": 3.770402499783976e-06, |
| "loss": 0.3913, |
| "mean_token_accuracy": 0.9053800106048584, |
| "num_tokens": 23704807.0, |
| "step": 507 |
| }, |
| { |
| "epoch": 6.430379746835443, |
| "grad_norm": 0.5666420459747314, |
| "learning_rate": 3.6126295649906216e-06, |
| "loss": 0.3983, |
| "mean_token_accuracy": 0.9038554430007935, |
| "num_tokens": 23752518.0, |
| "step": 508 |
| }, |
| { |
| "epoch": 6.443037974683544, |
| "grad_norm": 0.5628715753555298, |
| "learning_rate": 3.458167857962613e-06, |
| "loss": 0.3987, |
| "mean_token_accuracy": 0.9056045413017273, |
| "num_tokens": 23799205.0, |
| "step": 509 |
| }, |
| { |
| "epoch": 6.455696202531645, |
| "grad_norm": 0.5618675947189331, |
| "learning_rate": 3.3070226849749366e-06, |
| "loss": 0.372, |
| "mean_token_accuracy": 0.9113752841949463, |
| "num_tokens": 23845114.0, |
| "step": 510 |
| }, |
| { |
| "epoch": 6.468354430379747, |
| "grad_norm": 0.5676432847976685, |
| "learning_rate": 3.159199238368593e-06, |
| "loss": 0.3799, |
| "mean_token_accuracy": 0.9109406471252441, |
| "num_tokens": 23891720.0, |
| "step": 511 |
| }, |
| { |
| "epoch": 6.481012658227848, |
| "grad_norm": 0.5845745205879211, |
| "learning_rate": 3.0147025963721433e-06, |
| "loss": 0.4173, |
| "mean_token_accuracy": 0.9012231826782227, |
| "num_tokens": 23938465.0, |
| "step": 512 |
| }, |
| { |
| "epoch": 6.493670886075949, |
| "grad_norm": 0.5692048668861389, |
| "learning_rate": 2.8735377229273998e-06, |
| "loss": 0.3965, |
| "mean_token_accuracy": 0.9037320613861084, |
| "num_tokens": 23987403.0, |
| "step": 513 |
| }, |
| { |
| "epoch": 6.506329113924051, |
| "grad_norm": 0.5562811493873596, |
| "learning_rate": 2.735709467518699e-06, |
| "loss": 0.3817, |
| "mean_token_accuracy": 0.9068973064422607, |
| "num_tokens": 24034877.0, |
| "step": 514 |
| }, |
| { |
| "epoch": 6.518987341772152, |
| "grad_norm": 0.5730811357498169, |
| "learning_rate": 2.6012225650064893e-06, |
| "loss": 0.39, |
| "mean_token_accuracy": 0.9057947993278503, |
| "num_tokens": 24082104.0, |
| "step": 515 |
| }, |
| { |
| "epoch": 6.531645569620253, |
| "grad_norm": 0.5873252153396606, |
| "learning_rate": 2.470081635464594e-06, |
| "loss": 0.4219, |
| "mean_token_accuracy": 0.8977401256561279, |
| "num_tokens": 24129958.0, |
| "step": 516 |
| }, |
| { |
| "epoch": 6.544303797468355, |
| "grad_norm": 0.5700328350067139, |
| "learning_rate": 2.342291184021461e-06, |
| "loss": 0.3936, |
| "mean_token_accuracy": 0.9058045744895935, |
| "num_tokens": 24176606.0, |
| "step": 517 |
| }, |
| { |
| "epoch": 6.556962025316456, |
| "grad_norm": 0.5592919588088989, |
| "learning_rate": 2.2178556007054872e-06, |
| "loss": 0.3819, |
| "mean_token_accuracy": 0.9092505574226379, |
| "num_tokens": 24224494.0, |
| "step": 518 |
| }, |
| { |
| "epoch": 6.569620253164557, |
| "grad_norm": 0.5832672119140625, |
| "learning_rate": 2.0967791602941154e-06, |
| "loss": 0.3858, |
| "mean_token_accuracy": 0.9063412547111511, |
| "num_tokens": 24271142.0, |
| "step": 519 |
| }, |
| { |
| "epoch": 6.582278481012658, |
| "grad_norm": 0.5810838937759399, |
| "learning_rate": 1.979066022167042e-06, |
| "loss": 0.385, |
| "mean_token_accuracy": 0.9060366153717041, |
| "num_tokens": 24318948.0, |
| "step": 520 |
| }, |
| { |
| "epoch": 6.594936708860759, |
| "grad_norm": 0.6128122806549072, |
| "learning_rate": 1.8647202301633194e-06, |
| "loss": 0.39, |
| "mean_token_accuracy": 0.9060620665550232, |
| "num_tokens": 24362743.0, |
| "step": 521 |
| }, |
| { |
| "epoch": 6.6075949367088604, |
| "grad_norm": 0.5534291863441467, |
| "learning_rate": 1.7537457124423895e-06, |
| "loss": 0.3817, |
| "mean_token_accuracy": 0.9087843298912048, |
| "num_tokens": 24412031.0, |
| "step": 522 |
| }, |
| { |
| "epoch": 6.620253164556962, |
| "grad_norm": 0.5778301954269409, |
| "learning_rate": 1.6461462813492034e-06, |
| "loss": 0.4057, |
| "mean_token_accuracy": 0.9008567929267883, |
| "num_tokens": 24459713.0, |
| "step": 523 |
| }, |
| { |
| "epoch": 6.632911392405063, |
| "grad_norm": 0.5713034868240356, |
| "learning_rate": 1.5419256332832255e-06, |
| "loss": 0.3706, |
| "mean_token_accuracy": 0.9108288288116455, |
| "num_tokens": 24505913.0, |
| "step": 524 |
| }, |
| { |
| "epoch": 6.6455696202531644, |
| "grad_norm": 0.5820364952087402, |
| "learning_rate": 1.4410873485714238e-06, |
| "loss": 0.3786, |
| "mean_token_accuracy": 0.9070352911949158, |
| "num_tokens": 24550467.0, |
| "step": 525 |
| }, |
| { |
| "epoch": 6.658227848101266, |
| "grad_norm": 0.5694465637207031, |
| "learning_rate": 1.3436348913453578e-06, |
| "loss": 0.391, |
| "mean_token_accuracy": 0.9062048196792603, |
| "num_tokens": 24598945.0, |
| "step": 526 |
| }, |
| { |
| "epoch": 6.670886075949367, |
| "grad_norm": 0.5639371871948242, |
| "learning_rate": 1.249571609422029e-06, |
| "loss": 0.3754, |
| "mean_token_accuracy": 0.9100679755210876, |
| "num_tokens": 24646089.0, |
| "step": 527 |
| }, |
| { |
| "epoch": 6.6835443037974684, |
| "grad_norm": 0.5671195387840271, |
| "learning_rate": 1.158900734189039e-06, |
| "loss": 0.3881, |
| "mean_token_accuracy": 0.9070022702217102, |
| "num_tokens": 24692595.0, |
| "step": 528 |
| }, |
| { |
| "epoch": 6.69620253164557, |
| "grad_norm": 0.5708573460578918, |
| "learning_rate": 1.0716253804934795e-06, |
| "loss": 0.4032, |
| "mean_token_accuracy": 0.9024674892425537, |
| "num_tokens": 24741494.0, |
| "step": 529 |
| }, |
| { |
| "epoch": 6.708860759493671, |
| "grad_norm": 0.5634827017784119, |
| "learning_rate": 9.877485465349058e-07, |
| "loss": 0.3845, |
| "mean_token_accuracy": 0.9086854457855225, |
| "num_tokens": 24787520.0, |
| "step": 530 |
| }, |
| { |
| "epoch": 6.7215189873417724, |
| "grad_norm": 0.5839213132858276, |
| "learning_rate": 9.072731137624413e-07, |
| "loss": 0.3967, |
| "mean_token_accuracy": 0.9044073820114136, |
| "num_tokens": 24834324.0, |
| "step": 531 |
| }, |
| { |
| "epoch": 6.734177215189874, |
| "grad_norm": 0.5715585350990295, |
| "learning_rate": 8.3020184677568e-07, |
| "loss": 0.3823, |
| "mean_token_accuracy": 0.9075259566307068, |
| "num_tokens": 24881558.0, |
| "step": 532 |
| }, |
| { |
| "epoch": 6.746835443037975, |
| "grad_norm": 0.5677687525749207, |
| "learning_rate": 7.56537393229817e-07, |
| "loss": 0.3884, |
| "mean_token_accuracy": 0.9045724868774414, |
| "num_tokens": 24929386.0, |
| "step": 533 |
| }, |
| { |
| "epoch": 6.759493670886076, |
| "grad_norm": 0.5910177826881409, |
| "learning_rate": 6.862822837445881e-07, |
| "loss": 0.3795, |
| "mean_token_accuracy": 0.9077647924423218, |
| "num_tokens": 24975723.0, |
| "step": 534 |
| }, |
| { |
| "epoch": 6.772151898734177, |
| "grad_norm": 0.5636204481124878, |
| "learning_rate": 6.194389318173954e-07, |
| "loss": 0.3844, |
| "mean_token_accuracy": 0.9066954255104065, |
| "num_tokens": 25022655.0, |
| "step": 535 |
| }, |
| { |
| "epoch": 6.784810126582278, |
| "grad_norm": 0.5545103549957275, |
| "learning_rate": 5.560096337404397e-07, |
| "loss": 0.392, |
| "mean_token_accuracy": 0.9055996537208557, |
| "num_tokens": 25072115.0, |
| "step": 536 |
| }, |
| { |
| "epoch": 6.7974683544303796, |
| "grad_norm": 0.5688847303390503, |
| "learning_rate": 4.959965685216949e-07, |
| "loss": 0.4038, |
| "mean_token_accuracy": 0.9030274748802185, |
| "num_tokens": 25118852.0, |
| "step": 537 |
| }, |
| { |
| "epoch": 6.810126582278481, |
| "grad_norm": 0.5681838989257812, |
| "learning_rate": 4.3940179781019055e-07, |
| "loss": 0.3654, |
| "mean_token_accuracy": 0.9127160906791687, |
| "num_tokens": 25163403.0, |
| "step": 538 |
| }, |
| { |
| "epoch": 6.822784810126582, |
| "grad_norm": 0.5705924034118652, |
| "learning_rate": 3.8622726582514537e-07, |
| "loss": 0.41, |
| "mean_token_accuracy": 0.904007613658905, |
| "num_tokens": 25210752.0, |
| "step": 539 |
| }, |
| { |
| "epoch": 6.8354430379746836, |
| "grad_norm": 0.570173978805542, |
| "learning_rate": 3.364747992891215e-07, |
| "loss": 0.3828, |
| "mean_token_accuracy": 0.9091429710388184, |
| "num_tokens": 25256206.0, |
| "step": 540 |
| }, |
| { |
| "epoch": 6.848101265822785, |
| "grad_norm": 0.575129508972168, |
| "learning_rate": 2.901461073653633e-07, |
| "loss": 0.3892, |
| "mean_token_accuracy": 0.9063740372657776, |
| "num_tokens": 25301877.0, |
| "step": 541 |
| }, |
| { |
| "epoch": 6.860759493670886, |
| "grad_norm": 0.5604121088981628, |
| "learning_rate": 2.472427815989886e-07, |
| "loss": 0.3715, |
| "mean_token_accuracy": 0.9102283716201782, |
| "num_tokens": 25348136.0, |
| "step": 542 |
| }, |
| { |
| "epoch": 6.8734177215189876, |
| "grad_norm": 0.5795130729675293, |
| "learning_rate": 2.0776629586239936e-07, |
| "loss": 0.3988, |
| "mean_token_accuracy": 0.90403151512146, |
| "num_tokens": 25395403.0, |
| "step": 543 |
| }, |
| { |
| "epoch": 6.886075949367089, |
| "grad_norm": 0.5694568157196045, |
| "learning_rate": 1.7171800630458868e-07, |
| "loss": 0.3567, |
| "mean_token_accuracy": 0.915683925151825, |
| "num_tokens": 25439053.0, |
| "step": 544 |
| }, |
| { |
| "epoch": 6.89873417721519, |
| "grad_norm": 0.556625247001648, |
| "learning_rate": 1.3909915130457808e-07, |
| "loss": 0.3759, |
| "mean_token_accuracy": 0.9094910621643066, |
| "num_tokens": 25484781.0, |
| "step": 545 |
| }, |
| { |
| "epoch": 6.911392405063291, |
| "grad_norm": 0.5877848267555237, |
| "learning_rate": 1.0991085142886271e-07, |
| "loss": 0.3996, |
| "mean_token_accuracy": 0.9032759070396423, |
| "num_tokens": 25529901.0, |
| "step": 546 |
| }, |
| { |
| "epoch": 6.924050632911392, |
| "grad_norm": 0.5745137929916382, |
| "learning_rate": 8.41541093929199e-08, |
| "loss": 0.3932, |
| "mean_token_accuracy": 0.9050623774528503, |
| "num_tokens": 25578302.0, |
| "step": 547 |
| }, |
| { |
| "epoch": 6.936708860759493, |
| "grad_norm": 0.5791630148887634, |
| "learning_rate": 6.182981002679223e-08, |
| "loss": 0.3789, |
| "mean_token_accuracy": 0.907834529876709, |
| "num_tokens": 25623589.0, |
| "step": 548 |
| }, |
| { |
| "epoch": 6.949367088607595, |
| "grad_norm": 0.6007780432701111, |
| "learning_rate": 4.293872024463408e-08, |
| "loss": 0.4255, |
| "mean_token_accuracy": 0.8964483737945557, |
| "num_tokens": 25671040.0, |
| "step": 549 |
| }, |
| { |
| "epoch": 6.962025316455696, |
| "grad_norm": 0.5847962498664856, |
| "learning_rate": 2.7481489018410523e-08, |
| "loss": 0.3983, |
| "mean_token_accuracy": 0.9039490222930908, |
| "num_tokens": 25718204.0, |
| "step": 550 |
| }, |
| { |
| "epoch": 6.974683544303797, |
| "grad_norm": 0.5613832473754883, |
| "learning_rate": 1.545864735558178e-08, |
| "loss": 0.375, |
| "mean_token_accuracy": 0.9110968708992004, |
| "num_tokens": 25764993.0, |
| "step": 551 |
| }, |
| { |
| "epoch": 6.987341772151899, |
| "grad_norm": 0.5971652269363403, |
| "learning_rate": 6.8706082808955855e-09, |
| "loss": 0.3968, |
| "mean_token_accuracy": 0.9042324423789978, |
| "num_tokens": 25810208.0, |
| "step": 552 |
| }, |
| { |
| "epoch": 7.0, |
| "grad_norm": 0.5324912667274475, |
| "learning_rate": 1.7176668221208225e-09, |
| "loss": 0.3848, |
| "mean_token_accuracy": 0.9090686440467834, |
| "num_tokens": 25859276.0, |
| "step": 553 |
| }, |
| { |
| "epoch": 7.0, |
| "step": 553, |
| "total_flos": 1.6654859065779814e+18, |
| "train_loss": 1.0050470797752602, |
| "train_runtime": 3322.7101, |
| "train_samples_per_second": 10.534, |
| "train_steps_per_second": 0.166 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 553, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 7, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.6654859065779814e+18, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|