| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 5.0, |
| "eval_steps": 500, |
| "global_step": 395, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012658227848101266, |
| "grad_norm": 1.497319221496582, |
| "learning_rate": 0.0, |
| "loss": 0.9641, |
| "mean_token_accuracy": 0.8309550285339355, |
| "num_tokens": 30618.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.02531645569620253, |
| "grad_norm": 1.6209511756896973, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 1.0149, |
| "mean_token_accuracy": 0.8291102051734924, |
| "num_tokens": 57834.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.0379746835443038, |
| "grad_norm": 1.4961398839950562, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 1.0358, |
| "mean_token_accuracy": 0.8215629458427429, |
| "num_tokens": 83683.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.05063291139240506, |
| "grad_norm": 1.0754140615463257, |
| "learning_rate": 5e-05, |
| "loss": 0.9624, |
| "mean_token_accuracy": 0.8206241130828857, |
| "num_tokens": 109319.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06329113924050633, |
| "grad_norm": 1.3018057346343994, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 0.8462, |
| "mean_token_accuracy": 0.831474781036377, |
| "num_tokens": 130905.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.0759493670886076, |
| "grad_norm": 0.5650571584701538, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 0.7473, |
| "mean_token_accuracy": 0.83799809217453, |
| "num_tokens": 161660.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08860759493670886, |
| "grad_norm": 0.6237565279006958, |
| "learning_rate": 0.0001, |
| "loss": 0.6972, |
| "mean_token_accuracy": 0.8451058864593506, |
| "num_tokens": 191893.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10126582278481013, |
| "grad_norm": 0.5601367950439453, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 0.6946, |
| "mean_token_accuracy": 0.852936863899231, |
| "num_tokens": 219163.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11392405063291139, |
| "grad_norm": 0.42522192001342773, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 0.6029, |
| "mean_token_accuracy": 0.8602243661880493, |
| "num_tokens": 249175.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12658227848101267, |
| "grad_norm": 0.8065161108970642, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.6507, |
| "mean_token_accuracy": 0.8582913875579834, |
| "num_tokens": 269887.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.13924050632911392, |
| "grad_norm": 0.3548448979854584, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 0.5643, |
| "mean_token_accuracy": 0.869491696357727, |
| "num_tokens": 297750.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.1518987341772152, |
| "grad_norm": 0.43577635288238525, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 0.623, |
| "mean_token_accuracy": 0.8579869866371155, |
| "num_tokens": 323030.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16455696202531644, |
| "grad_norm": 0.34569233655929565, |
| "learning_rate": 0.0002, |
| "loss": 0.5558, |
| "mean_token_accuracy": 0.8676020503044128, |
| "num_tokens": 353170.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17721518987341772, |
| "grad_norm": 0.2973344624042511, |
| "learning_rate": 0.0001999966358932628, |
| "loss": 0.5502, |
| "mean_token_accuracy": 0.8723801970481873, |
| "num_tokens": 381576.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.189873417721519, |
| "grad_norm": 0.6846588850021362, |
| "learning_rate": 0.00019998654379939533, |
| "loss": 0.5728, |
| "mean_token_accuracy": 0.8665502667427063, |
| "num_tokens": 409703.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20253164556962025, |
| "grad_norm": 0.29646769165992737, |
| "learning_rate": 0.00019996972439741538, |
| "loss": 0.5858, |
| "mean_token_accuracy": 0.865411102771759, |
| "num_tokens": 438811.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21518987341772153, |
| "grad_norm": 0.288542777299881, |
| "learning_rate": 0.0001999461788189681, |
| "loss": 0.5725, |
| "mean_token_accuracy": 0.866082489490509, |
| "num_tokens": 468774.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22784810126582278, |
| "grad_norm": 0.2656330466270447, |
| "learning_rate": 0.00019991590864825028, |
| "loss": 0.5151, |
| "mean_token_accuracy": 0.8826677799224854, |
| "num_tokens": 492753.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24050632911392406, |
| "grad_norm": 0.27023324370384216, |
| "learning_rate": 0.00019987891592190366, |
| "loss": 0.5078, |
| "mean_token_accuracy": 0.8805520534515381, |
| "num_tokens": 523031.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25316455696202533, |
| "grad_norm": 0.25212258100509644, |
| "learning_rate": 0.00019983520312887785, |
| "loss": 0.5289, |
| "mean_token_accuracy": 0.8810333013534546, |
| "num_tokens": 552515.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.26582278481012656, |
| "grad_norm": 0.24047309160232544, |
| "learning_rate": 0.00019978477321026282, |
| "loss": 0.5344, |
| "mean_token_accuracy": 0.8764937520027161, |
| "num_tokens": 583290.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.27848101265822783, |
| "grad_norm": 0.27291324734687805, |
| "learning_rate": 0.0001997276295590912, |
| "loss": 0.4812, |
| "mean_token_accuracy": 0.8868094682693481, |
| "num_tokens": 603285.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2911392405063291, |
| "grad_norm": 0.23373258113861084, |
| "learning_rate": 0.00019966377602010984, |
| "loss": 0.5465, |
| "mean_token_accuracy": 0.8753286004066467, |
| "num_tokens": 637583.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3037974683544304, |
| "grad_norm": 0.23137561976909637, |
| "learning_rate": 0.0001995932168895211, |
| "loss": 0.5222, |
| "mean_token_accuracy": 0.8756207823753357, |
| "num_tokens": 668657.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.31645569620253167, |
| "grad_norm": 0.24308426678180695, |
| "learning_rate": 0.00019951595691469396, |
| "loss": 0.5396, |
| "mean_token_accuracy": 0.8727737069129944, |
| "num_tokens": 695335.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.3291139240506329, |
| "grad_norm": 0.22916540503501892, |
| "learning_rate": 0.00019943200129384444, |
| "loss": 0.5382, |
| "mean_token_accuracy": 0.8756353855133057, |
| "num_tokens": 723727.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34177215189873417, |
| "grad_norm": 0.24699705839157104, |
| "learning_rate": 0.0001993413556756859, |
| "loss": 0.476, |
| "mean_token_accuracy": 0.8846983313560486, |
| "num_tokens": 751154.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35443037974683544, |
| "grad_norm": 0.21457427740097046, |
| "learning_rate": 0.0001992440261590491, |
| "loss": 0.5159, |
| "mean_token_accuracy": 0.8788135647773743, |
| "num_tokens": 783078.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.3670886075949367, |
| "grad_norm": 0.2982902526855469, |
| "learning_rate": 0.00019914001929247167, |
| "loss": 0.5296, |
| "mean_token_accuracy": 0.8727933168411255, |
| "num_tokens": 802685.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.379746835443038, |
| "grad_norm": 0.2390463650226593, |
| "learning_rate": 0.0001990293420737576, |
| "loss": 0.5509, |
| "mean_token_accuracy": 0.8691502213478088, |
| "num_tokens": 826425.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.3924050632911392, |
| "grad_norm": 0.2494283765554428, |
| "learning_rate": 0.00019891200194950643, |
| "loss": 0.5748, |
| "mean_token_accuracy": 0.8628107905387878, |
| "num_tokens": 851265.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.4050632911392405, |
| "grad_norm": 0.23986820876598358, |
| "learning_rate": 0.00019878800681461222, |
| "loss": 0.5099, |
| "mean_token_accuracy": 0.8775585889816284, |
| "num_tokens": 878297.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4177215189873418, |
| "grad_norm": 0.24641895294189453, |
| "learning_rate": 0.00019865736501173238, |
| "loss": 0.473, |
| "mean_token_accuracy": 0.8891056180000305, |
| "num_tokens": 899381.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43037974683544306, |
| "grad_norm": 0.20981378853321075, |
| "learning_rate": 0.00019852008533072625, |
| "loss": 0.5352, |
| "mean_token_accuracy": 0.8746247887611389, |
| "num_tokens": 930759.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.4430379746835443, |
| "grad_norm": 0.23973393440246582, |
| "learning_rate": 0.00019837617700806383, |
| "loss": 0.5283, |
| "mean_token_accuracy": 0.874847948551178, |
| "num_tokens": 957135.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.45569620253164556, |
| "grad_norm": 0.2420441061258316, |
| "learning_rate": 0.00019822564972620427, |
| "loss": 0.5032, |
| "mean_token_accuracy": 0.8739088773727417, |
| "num_tokens": 981142.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.46835443037974683, |
| "grad_norm": 0.2016650289297104, |
| "learning_rate": 0.0001980685136129445, |
| "loss": 0.5553, |
| "mean_token_accuracy": 0.8701525330543518, |
| "num_tokens": 1009855.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4810126582278481, |
| "grad_norm": 0.213796928524971, |
| "learning_rate": 0.00019790477924073755, |
| "loss": 0.562, |
| "mean_token_accuracy": 0.8700422048568726, |
| "num_tokens": 1035989.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4936708860759494, |
| "grad_norm": 0.22555865347385406, |
| "learning_rate": 0.00019773445762598163, |
| "loss": 0.487, |
| "mean_token_accuracy": 0.8849612474441528, |
| "num_tokens": 1063409.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5063291139240507, |
| "grad_norm": 0.2065822184085846, |
| "learning_rate": 0.00019755756022827846, |
| "loss": 0.542, |
| "mean_token_accuracy": 0.8749595880508423, |
| "num_tokens": 1094423.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5189873417721519, |
| "grad_norm": 0.22671450674533844, |
| "learning_rate": 0.00019737409894966267, |
| "loss": 0.5801, |
| "mean_token_accuracy": 0.868348240852356, |
| "num_tokens": 1119067.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.5316455696202531, |
| "grad_norm": 0.20396192371845245, |
| "learning_rate": 0.00019718408613380074, |
| "loss": 0.508, |
| "mean_token_accuracy": 0.8748582601547241, |
| "num_tokens": 1147347.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5443037974683544, |
| "grad_norm": 0.20259220898151398, |
| "learning_rate": 0.00019698753456516048, |
| "loss": 0.4897, |
| "mean_token_accuracy": 0.8824638724327087, |
| "num_tokens": 1174458.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5569620253164557, |
| "grad_norm": 0.2087836116552353, |
| "learning_rate": 0.00019678445746815107, |
| "loss": 0.4807, |
| "mean_token_accuracy": 0.8824238777160645, |
| "num_tokens": 1202708.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.569620253164557, |
| "grad_norm": 0.1992674618959427, |
| "learning_rate": 0.00019657486850623306, |
| "loss": 0.4824, |
| "mean_token_accuracy": 0.8790597915649414, |
| "num_tokens": 1226511.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5822784810126582, |
| "grad_norm": 0.1843205988407135, |
| "learning_rate": 0.00019635878178099928, |
| "loss": 0.4737, |
| "mean_token_accuracy": 0.8844873905181885, |
| "num_tokens": 1254823.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5949367088607594, |
| "grad_norm": 0.21726590394973755, |
| "learning_rate": 0.0001961362118312259, |
| "loss": 0.5116, |
| "mean_token_accuracy": 0.8761377334594727, |
| "num_tokens": 1280157.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6075949367088608, |
| "grad_norm": 0.18547309935092926, |
| "learning_rate": 0.0001959071736318942, |
| "loss": 0.5088, |
| "mean_token_accuracy": 0.877997636795044, |
| "num_tokens": 1311204.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.620253164556962, |
| "grad_norm": 0.17424975335597992, |
| "learning_rate": 0.00019567168259318325, |
| "loss": 0.4827, |
| "mean_token_accuracy": 0.8858836889266968, |
| "num_tokens": 1338924.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6329113924050633, |
| "grad_norm": 0.2047286480665207, |
| "learning_rate": 0.00019542975455943281, |
| "loss": 0.5123, |
| "mean_token_accuracy": 0.8828940987586975, |
| "num_tokens": 1364640.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6455696202531646, |
| "grad_norm": 0.2273840606212616, |
| "learning_rate": 0.00019518140580807744, |
| "loss": 0.5769, |
| "mean_token_accuracy": 0.8684936165809631, |
| "num_tokens": 1386817.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6582278481012658, |
| "grad_norm": 0.19929328560829163, |
| "learning_rate": 0.00019492665304855132, |
| "loss": 0.5269, |
| "mean_token_accuracy": 0.8812709450721741, |
| "num_tokens": 1417598.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6708860759493671, |
| "grad_norm": 0.18103498220443726, |
| "learning_rate": 0.0001946655134211639, |
| "loss": 0.5201, |
| "mean_token_accuracy": 0.8795331120491028, |
| "num_tokens": 1452103.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6835443037974683, |
| "grad_norm": 0.20823192596435547, |
| "learning_rate": 0.0001943980044959468, |
| "loss": 0.4376, |
| "mean_token_accuracy": 0.8970240354537964, |
| "num_tokens": 1476260.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.6962025316455697, |
| "grad_norm": 0.2124900221824646, |
| "learning_rate": 0.0001941241442714716, |
| "loss": 0.4992, |
| "mean_token_accuracy": 0.8834120035171509, |
| "num_tokens": 1505761.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7088607594936709, |
| "grad_norm": 0.19194459915161133, |
| "learning_rate": 0.0001938439511736388, |
| "loss": 0.5092, |
| "mean_token_accuracy": 0.8822512626647949, |
| "num_tokens": 1535906.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7215189873417721, |
| "grad_norm": 0.1868598908185959, |
| "learning_rate": 0.0001935574440544381, |
| "loss": 0.5125, |
| "mean_token_accuracy": 0.8755715489387512, |
| "num_tokens": 1569652.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7341772151898734, |
| "grad_norm": 0.21098805963993073, |
| "learning_rate": 0.0001932646421906802, |
| "loss": 0.5394, |
| "mean_token_accuracy": 0.8751370906829834, |
| "num_tokens": 1596153.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7468354430379747, |
| "grad_norm": 0.2013338804244995, |
| "learning_rate": 0.00019296556528269952, |
| "loss": 0.5081, |
| "mean_token_accuracy": 0.8786186575889587, |
| "num_tokens": 1624508.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.759493670886076, |
| "grad_norm": 0.20497922599315643, |
| "learning_rate": 0.00019266023345302887, |
| "loss": 0.4502, |
| "mean_token_accuracy": 0.8902367353439331, |
| "num_tokens": 1653507.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7721518987341772, |
| "grad_norm": 0.21349601447582245, |
| "learning_rate": 0.00019234866724504555, |
| "loss": 0.5481, |
| "mean_token_accuracy": 0.8724722266197205, |
| "num_tokens": 1682796.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7848101265822784, |
| "grad_norm": 0.2057465761899948, |
| "learning_rate": 0.00019203088762158915, |
| "loss": 0.5103, |
| "mean_token_accuracy": 0.8791164755821228, |
| "num_tokens": 1710159.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.7974683544303798, |
| "grad_norm": 0.20737606287002563, |
| "learning_rate": 0.00019170691596355114, |
| "loss": 0.5126, |
| "mean_token_accuracy": 0.8805774450302124, |
| "num_tokens": 1739246.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.810126582278481, |
| "grad_norm": 0.1765468269586563, |
| "learning_rate": 0.00019137677406843619, |
| "loss": 0.4658, |
| "mean_token_accuracy": 0.8891183733940125, |
| "num_tokens": 1770785.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8227848101265823, |
| "grad_norm": 0.18958942592144012, |
| "learning_rate": 0.00019104048414889587, |
| "loss": 0.4893, |
| "mean_token_accuracy": 0.8855167031288147, |
| "num_tokens": 1800635.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8354430379746836, |
| "grad_norm": 0.19879435002803802, |
| "learning_rate": 0.00019069806883123387, |
| "loss": 0.4883, |
| "mean_token_accuracy": 0.8844217658042908, |
| "num_tokens": 1829104.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8481012658227848, |
| "grad_norm": 0.19173026084899902, |
| "learning_rate": 0.00019034955115388363, |
| "loss": 0.549, |
| "mean_token_accuracy": 0.8704302906990051, |
| "num_tokens": 1858519.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8607594936708861, |
| "grad_norm": 0.19198986887931824, |
| "learning_rate": 0.00018999495456585854, |
| "loss": 0.4972, |
| "mean_token_accuracy": 0.8800837993621826, |
| "num_tokens": 1882458.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8734177215189873, |
| "grad_norm": 0.17567826807498932, |
| "learning_rate": 0.00018963430292517398, |
| "loss": 0.4852, |
| "mean_token_accuracy": 0.8849237561225891, |
| "num_tokens": 1914075.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.8860759493670886, |
| "grad_norm": 0.20886963605880737, |
| "learning_rate": 0.00018926762049724228, |
| "loss": 0.5113, |
| "mean_token_accuracy": 0.8759188652038574, |
| "num_tokens": 1941347.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.8987341772151899, |
| "grad_norm": 0.2045935094356537, |
| "learning_rate": 0.00018889493195323997, |
| "loss": 0.5075, |
| "mean_token_accuracy": 0.8776924014091492, |
| "num_tokens": 1969128.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9113924050632911, |
| "grad_norm": 0.19722214341163635, |
| "learning_rate": 0.00018851626236844786, |
| "loss": 0.5154, |
| "mean_token_accuracy": 0.8768007159233093, |
| "num_tokens": 1995848.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9240506329113924, |
| "grad_norm": 0.21611221134662628, |
| "learning_rate": 0.00018813163722056396, |
| "loss": 0.4651, |
| "mean_token_accuracy": 0.8872132897377014, |
| "num_tokens": 2021243.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9367088607594937, |
| "grad_norm": 0.2026682049036026, |
| "learning_rate": 0.0001877410823879893, |
| "loss": 0.4772, |
| "mean_token_accuracy": 0.8879674077033997, |
| "num_tokens": 2048558.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9493670886075949, |
| "grad_norm": 0.21699966490268707, |
| "learning_rate": 0.0001873446241480868, |
| "loss": 0.5288, |
| "mean_token_accuracy": 0.8744093179702759, |
| "num_tokens": 2078250.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9620253164556962, |
| "grad_norm": 0.20321376621723175, |
| "learning_rate": 0.00018694228917541313, |
| "loss": 0.5249, |
| "mean_token_accuracy": 0.8785193562507629, |
| "num_tokens": 2107652.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9746835443037974, |
| "grad_norm": 0.23255208134651184, |
| "learning_rate": 0.00018653410453992413, |
| "loss": 0.5065, |
| "mean_token_accuracy": 0.8786671757698059, |
| "num_tokens": 2134576.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9873417721518988, |
| "grad_norm": 0.19896215200424194, |
| "learning_rate": 0.0001861200977051535, |
| "loss": 0.4681, |
| "mean_token_accuracy": 0.8856458067893982, |
| "num_tokens": 2162186.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.19284109771251678, |
| "learning_rate": 0.0001857002965263648, |
| "loss": 0.4793, |
| "mean_token_accuracy": 0.8867379426956177, |
| "num_tokens": 2191333.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0126582278481013, |
| "grad_norm": 0.19497530162334442, |
| "learning_rate": 0.00018527472924867756, |
| "loss": 0.4209, |
| "mean_token_accuracy": 0.8986303210258484, |
| "num_tokens": 2218703.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0253164556962024, |
| "grad_norm": 0.21513301134109497, |
| "learning_rate": 0.00018484342450516671, |
| "loss": 0.5105, |
| "mean_token_accuracy": 0.8765804767608643, |
| "num_tokens": 2239963.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0379746835443038, |
| "grad_norm": 0.1873137354850769, |
| "learning_rate": 0.0001844064113149361, |
| "loss": 0.4353, |
| "mean_token_accuracy": 0.8936419486999512, |
| "num_tokens": 2267331.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0506329113924051, |
| "grad_norm": 0.22090038657188416, |
| "learning_rate": 0.0001839637190811661, |
| "loss": 0.4297, |
| "mean_token_accuracy": 0.8943843245506287, |
| "num_tokens": 2296955.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0632911392405062, |
| "grad_norm": 0.2521970570087433, |
| "learning_rate": 0.00018351537758913518, |
| "loss": 0.4325, |
| "mean_token_accuracy": 0.8930135369300842, |
| "num_tokens": 2321452.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0759493670886076, |
| "grad_norm": 0.21923896670341492, |
| "learning_rate": 0.00018306141700421606, |
| "loss": 0.4213, |
| "mean_token_accuracy": 0.8969642519950867, |
| "num_tokens": 2350603.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.0886075949367089, |
| "grad_norm": 0.22946420311927795, |
| "learning_rate": 0.000182601867869846, |
| "loss": 0.4009, |
| "mean_token_accuracy": 0.8988001942634583, |
| "num_tokens": 2374254.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1012658227848102, |
| "grad_norm": 0.20290835201740265, |
| "learning_rate": 0.00018213676110547176, |
| "loss": 0.4228, |
| "mean_token_accuracy": 0.8960235118865967, |
| "num_tokens": 2406633.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1139240506329113, |
| "grad_norm": 0.1907222718000412, |
| "learning_rate": 0.0001816661280044693, |
| "loss": 0.4115, |
| "mean_token_accuracy": 0.9003381729125977, |
| "num_tokens": 2437451.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.1265822784810127, |
| "grad_norm": 0.20857387781143188, |
| "learning_rate": 0.00018119000023203837, |
| "loss": 0.4526, |
| "mean_token_accuracy": 0.8939969539642334, |
| "num_tokens": 2470165.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.139240506329114, |
| "grad_norm": 0.2178468257188797, |
| "learning_rate": 0.0001807084098230719, |
| "loss": 0.4361, |
| "mean_token_accuracy": 0.892597496509552, |
| "num_tokens": 2496774.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1518987341772151, |
| "grad_norm": 0.1978338062763214, |
| "learning_rate": 0.0001802213891800007, |
| "loss": 0.4079, |
| "mean_token_accuracy": 0.89795982837677, |
| "num_tokens": 2527620.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1645569620253164, |
| "grad_norm": 0.23382915556430817, |
| "learning_rate": 0.00017972897107061328, |
| "loss": 0.4385, |
| "mean_token_accuracy": 0.8920117616653442, |
| "num_tokens": 2551131.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.1772151898734178, |
| "grad_norm": 0.24582549929618835, |
| "learning_rate": 0.00017923118862585123, |
| "loss": 0.4494, |
| "mean_token_accuracy": 0.892306387424469, |
| "num_tokens": 2574604.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.189873417721519, |
| "grad_norm": 0.21195554733276367, |
| "learning_rate": 0.00017872807533758007, |
| "loss": 0.4428, |
| "mean_token_accuracy": 0.8914760947227478, |
| "num_tokens": 2605675.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2025316455696202, |
| "grad_norm": 0.2021542638540268, |
| "learning_rate": 0.00017821966505633587, |
| "loss": 0.4294, |
| "mean_token_accuracy": 0.8925318121910095, |
| "num_tokens": 2633403.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.2151898734177216, |
| "grad_norm": 0.19734586775302887, |
| "learning_rate": 0.00017770599198904763, |
| "loss": 0.4105, |
| "mean_token_accuracy": 0.8953525424003601, |
| "num_tokens": 2664753.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2278481012658227, |
| "grad_norm": 0.19101551175117493, |
| "learning_rate": 0.00017718709069673594, |
| "loss": 0.4008, |
| "mean_token_accuracy": 0.9017804861068726, |
| "num_tokens": 2695707.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.240506329113924, |
| "grad_norm": 0.22164419293403625, |
| "learning_rate": 0.00017666299609218745, |
| "loss": 0.4233, |
| "mean_token_accuracy": 0.8975086212158203, |
| "num_tokens": 2721861.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2531645569620253, |
| "grad_norm": 0.21174238622188568, |
| "learning_rate": 0.00017613374343760594, |
| "loss": 0.4644, |
| "mean_token_accuracy": 0.8886749744415283, |
| "num_tokens": 2749457.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.2658227848101267, |
| "grad_norm": 0.22876623272895813, |
| "learning_rate": 0.00017559936834223982, |
| "loss": 0.4407, |
| "mean_token_accuracy": 0.8907697200775146, |
| "num_tokens": 2773269.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2784810126582278, |
| "grad_norm": 0.19537781178951263, |
| "learning_rate": 0.0001750599067599863, |
| "loss": 0.3998, |
| "mean_token_accuracy": 0.9017773866653442, |
| "num_tokens": 2800170.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2911392405063291, |
| "grad_norm": 0.21778103709220886, |
| "learning_rate": 0.00017451539498697225, |
| "loss": 0.3569, |
| "mean_token_accuracy": 0.9102327227592468, |
| "num_tokens": 2824597.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.3037974683544304, |
| "grad_norm": 0.21380816400051117, |
| "learning_rate": 0.0001739658696591121, |
| "loss": 0.4263, |
| "mean_token_accuracy": 0.8967190980911255, |
| "num_tokens": 2855354.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3164556962025316, |
| "grad_norm": 0.21955636143684387, |
| "learning_rate": 0.00017341136774964307, |
| "loss": 0.4062, |
| "mean_token_accuracy": 0.8979187607765198, |
| "num_tokens": 2881652.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3291139240506329, |
| "grad_norm": 0.2105690985918045, |
| "learning_rate": 0.0001728519265666373, |
| "loss": 0.4, |
| "mean_token_accuracy": 0.8993932008743286, |
| "num_tokens": 2909567.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3417721518987342, |
| "grad_norm": 0.20753523707389832, |
| "learning_rate": 0.00017228758375049185, |
| "loss": 0.4455, |
| "mean_token_accuracy": 0.8925303220748901, |
| "num_tokens": 2933889.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.3544303797468356, |
| "grad_norm": 0.2187478095293045, |
| "learning_rate": 0.00017171837727139613, |
| "loss": 0.4434, |
| "mean_token_accuracy": 0.8895025849342346, |
| "num_tokens": 2962017.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3670886075949367, |
| "grad_norm": 0.22173349559307098, |
| "learning_rate": 0.0001711443454267772, |
| "loss": 0.4333, |
| "mean_token_accuracy": 0.8912394046783447, |
| "num_tokens": 2991862.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.379746835443038, |
| "grad_norm": 0.22389379143714905, |
| "learning_rate": 0.00017056552683872292, |
| "loss": 0.4185, |
| "mean_token_accuracy": 0.8991497755050659, |
| "num_tokens": 3017449.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.3924050632911391, |
| "grad_norm": 0.270313024520874, |
| "learning_rate": 0.00016998196045138353, |
| "loss": 0.4902, |
| "mean_token_accuracy": 0.8868701457977295, |
| "num_tokens": 3041070.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4050632911392404, |
| "grad_norm": 0.20855283737182617, |
| "learning_rate": 0.00016939368552835137, |
| "loss": 0.3887, |
| "mean_token_accuracy": 0.9015379548072815, |
| "num_tokens": 3070069.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4177215189873418, |
| "grad_norm": 0.20110635459423065, |
| "learning_rate": 0.00016880074165001905, |
| "loss": 0.4372, |
| "mean_token_accuracy": 0.8943763971328735, |
| "num_tokens": 3099047.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4303797468354431, |
| "grad_norm": 0.21372906863689423, |
| "learning_rate": 0.0001682031687109165, |
| "loss": 0.42, |
| "mean_token_accuracy": 0.8982757925987244, |
| "num_tokens": 3125732.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4430379746835442, |
| "grad_norm": 0.20921871066093445, |
| "learning_rate": 0.00016760100691702674, |
| "loss": 0.4196, |
| "mean_token_accuracy": 0.8972339034080505, |
| "num_tokens": 3154862.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4556962025316456, |
| "grad_norm": 0.1881207674741745, |
| "learning_rate": 0.0001669942967830807, |
| "loss": 0.4093, |
| "mean_token_accuracy": 0.9019440412521362, |
| "num_tokens": 3184195.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4683544303797469, |
| "grad_norm": 0.213323712348938, |
| "learning_rate": 0.00016638307912983136, |
| "loss": 0.4138, |
| "mean_token_accuracy": 0.9011819362640381, |
| "num_tokens": 3211248.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.481012658227848, |
| "grad_norm": 0.20287197828292847, |
| "learning_rate": 0.00016576739508130726, |
| "loss": 0.3756, |
| "mean_token_accuracy": 0.9048148393630981, |
| "num_tokens": 3239205.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4936708860759493, |
| "grad_norm": 0.20273637771606445, |
| "learning_rate": 0.0001651472860620455, |
| "loss": 0.3689, |
| "mean_token_accuracy": 0.9055525660514832, |
| "num_tokens": 3266914.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5063291139240507, |
| "grad_norm": 0.19134242832660675, |
| "learning_rate": 0.00016452279379430463, |
| "loss": 0.4183, |
| "mean_token_accuracy": 0.897467851638794, |
| "num_tokens": 3296676.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.518987341772152, |
| "grad_norm": 0.18769560754299164, |
| "learning_rate": 0.00016389396029525762, |
| "loss": 0.4204, |
| "mean_token_accuracy": 0.8977954983711243, |
| "num_tokens": 3325046.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5316455696202531, |
| "grad_norm": 0.20102067291736603, |
| "learning_rate": 0.0001632608278741646, |
| "loss": 0.4496, |
| "mean_token_accuracy": 0.8929321765899658, |
| "num_tokens": 3354624.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5443037974683544, |
| "grad_norm": 0.1878257691860199, |
| "learning_rate": 0.00016262343912952656, |
| "loss": 0.3981, |
| "mean_token_accuracy": 0.8984882831573486, |
| "num_tokens": 3383000.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5569620253164556, |
| "grad_norm": 0.20456744730472565, |
| "learning_rate": 0.0001619818369462188, |
| "loss": 0.4161, |
| "mean_token_accuracy": 0.8959950804710388, |
| "num_tokens": 3410630.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.5696202531645569, |
| "grad_norm": 0.2185913473367691, |
| "learning_rate": 0.0001613360644926059, |
| "loss": 0.4096, |
| "mean_token_accuracy": 0.9008986949920654, |
| "num_tokens": 3435063.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5822784810126582, |
| "grad_norm": 0.2265142947435379, |
| "learning_rate": 0.00016068616521763707, |
| "loss": 0.4471, |
| "mean_token_accuracy": 0.8928737640380859, |
| "num_tokens": 3460947.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5949367088607596, |
| "grad_norm": 0.19072851538658142, |
| "learning_rate": 0.00016003218284792298, |
| "loss": 0.3973, |
| "mean_token_accuracy": 0.90379399061203, |
| "num_tokens": 3490136.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.6075949367088609, |
| "grad_norm": 0.23255592584609985, |
| "learning_rate": 0.00015937416138479344, |
| "loss": 0.399, |
| "mean_token_accuracy": 0.8998273015022278, |
| "num_tokens": 3516255.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.620253164556962, |
| "grad_norm": 0.2036372721195221, |
| "learning_rate": 0.0001587121451013373, |
| "loss": 0.3952, |
| "mean_token_accuracy": 0.8992496728897095, |
| "num_tokens": 3548438.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6329113924050633, |
| "grad_norm": 0.23039649426937103, |
| "learning_rate": 0.0001580461785394233, |
| "loss": 0.4062, |
| "mean_token_accuracy": 0.8986396789550781, |
| "num_tokens": 3579451.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6455696202531644, |
| "grad_norm": 0.20787346363067627, |
| "learning_rate": 0.00015737630650670335, |
| "loss": 0.4023, |
| "mean_token_accuracy": 0.899288535118103, |
| "num_tokens": 3610296.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.6582278481012658, |
| "grad_norm": 0.23658980429172516, |
| "learning_rate": 0.00015670257407359792, |
| "loss": 0.446, |
| "mean_token_accuracy": 0.8890199661254883, |
| "num_tokens": 3638329.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6708860759493671, |
| "grad_norm": 0.191447913646698, |
| "learning_rate": 0.00015602502657026328, |
| "loss": 0.4013, |
| "mean_token_accuracy": 0.9007358551025391, |
| "num_tokens": 3671960.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6835443037974684, |
| "grad_norm": 0.22027570009231567, |
| "learning_rate": 0.00015534370958354186, |
| "loss": 0.4291, |
| "mean_token_accuracy": 0.8947672247886658, |
| "num_tokens": 3698033.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.6962025316455698, |
| "grad_norm": 0.2189820110797882, |
| "learning_rate": 0.00015465866895389495, |
| "loss": 0.4787, |
| "mean_token_accuracy": 0.8886910080909729, |
| "num_tokens": 3725049.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7088607594936709, |
| "grad_norm": 0.22296729683876038, |
| "learning_rate": 0.00015396995077231854, |
| "loss": 0.4155, |
| "mean_token_accuracy": 0.897777259349823, |
| "num_tokens": 3751477.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.721518987341772, |
| "grad_norm": 0.1950179785490036, |
| "learning_rate": 0.00015327760137724212, |
| "loss": 0.425, |
| "mean_token_accuracy": 0.8947750926017761, |
| "num_tokens": 3783178.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7341772151898733, |
| "grad_norm": 0.2167259156703949, |
| "learning_rate": 0.00015258166735141092, |
| "loss": 0.4632, |
| "mean_token_accuracy": 0.8899510502815247, |
| "num_tokens": 3812847.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7468354430379747, |
| "grad_norm": 0.23227916657924652, |
| "learning_rate": 0.0001518821955187519, |
| "loss": 0.4228, |
| "mean_token_accuracy": 0.8922276496887207, |
| "num_tokens": 3837704.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.759493670886076, |
| "grad_norm": 0.20364798605442047, |
| "learning_rate": 0.00015117923294122312, |
| "loss": 0.4357, |
| "mean_token_accuracy": 0.8921459913253784, |
| "num_tokens": 3870312.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7721518987341773, |
| "grad_norm": 0.22296567261219025, |
| "learning_rate": 0.0001504728269156475, |
| "loss": 0.4091, |
| "mean_token_accuracy": 0.9001960754394531, |
| "num_tokens": 3896387.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7848101265822784, |
| "grad_norm": 0.23284538090229034, |
| "learning_rate": 0.00014976302497053036, |
| "loss": 0.4685, |
| "mean_token_accuracy": 0.8888003826141357, |
| "num_tokens": 3922809.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.7974683544303798, |
| "grad_norm": 0.20585279166698456, |
| "learning_rate": 0.00014904987486286184, |
| "loss": 0.4155, |
| "mean_token_accuracy": 0.8993297219276428, |
| "num_tokens": 3954799.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.810126582278481, |
| "grad_norm": 0.2125055342912674, |
| "learning_rate": 0.00014833342457490361, |
| "loss": 0.424, |
| "mean_token_accuracy": 0.8967812061309814, |
| "num_tokens": 3985216.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8227848101265822, |
| "grad_norm": 0.22574758529663086, |
| "learning_rate": 0.00014761372231096047, |
| "loss": 0.4477, |
| "mean_token_accuracy": 0.8949366807937622, |
| "num_tokens": 4008190.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8354430379746836, |
| "grad_norm": 0.21060273051261902, |
| "learning_rate": 0.00014689081649413708, |
| "loss": 0.4216, |
| "mean_token_accuracy": 0.8979432582855225, |
| "num_tokens": 4033877.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8481012658227849, |
| "grad_norm": 0.22009049355983734, |
| "learning_rate": 0.00014616475576308005, |
| "loss": 0.4303, |
| "mean_token_accuracy": 0.894666314125061, |
| "num_tokens": 4058558.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8607594936708862, |
| "grad_norm": 0.2193581908941269, |
| "learning_rate": 0.00014543558896870531, |
| "loss": 0.4647, |
| "mean_token_accuracy": 0.8923094868659973, |
| "num_tokens": 4084446.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8734177215189873, |
| "grad_norm": 0.218804270029068, |
| "learning_rate": 0.0001447033651709114, |
| "loss": 0.425, |
| "mean_token_accuracy": 0.8992093801498413, |
| "num_tokens": 4108669.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.8860759493670884, |
| "grad_norm": 0.1919749528169632, |
| "learning_rate": 0.0001439681336352785, |
| "loss": 0.4495, |
| "mean_token_accuracy": 0.891620934009552, |
| "num_tokens": 4146434.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.8987341772151898, |
| "grad_norm": 0.19265611469745636, |
| "learning_rate": 0.00014322994382975386, |
| "loss": 0.3672, |
| "mean_token_accuracy": 0.9077484607696533, |
| "num_tokens": 4176633.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9113924050632911, |
| "grad_norm": 0.2111128568649292, |
| "learning_rate": 0.0001424888454213235, |
| "loss": 0.4511, |
| "mean_token_accuracy": 0.889907956123352, |
| "num_tokens": 4205046.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.9240506329113924, |
| "grad_norm": 0.22748497128486633, |
| "learning_rate": 0.0001417448882726703, |
| "loss": 0.3854, |
| "mean_token_accuracy": 0.90329909324646, |
| "num_tokens": 4230208.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9367088607594938, |
| "grad_norm": 0.23460358381271362, |
| "learning_rate": 0.00014099812243881948, |
| "loss": 0.4264, |
| "mean_token_accuracy": 0.8937097787857056, |
| "num_tokens": 4254357.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9493670886075949, |
| "grad_norm": 0.2445940524339676, |
| "learning_rate": 0.00014024859816377046, |
| "loss": 0.4507, |
| "mean_token_accuracy": 0.8903029561042786, |
| "num_tokens": 4278779.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9620253164556962, |
| "grad_norm": 0.2431238889694214, |
| "learning_rate": 0.00013949636587711644, |
| "loss": 0.4341, |
| "mean_token_accuracy": 0.89263516664505, |
| "num_tokens": 4303460.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.9746835443037973, |
| "grad_norm": 0.22417189180850983, |
| "learning_rate": 0.0001387414761906516, |
| "loss": 0.4369, |
| "mean_token_accuracy": 0.893901526927948, |
| "num_tokens": 4330744.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9873417721518987, |
| "grad_norm": 0.24654226005077362, |
| "learning_rate": 0.00013798397989496549, |
| "loss": 0.4348, |
| "mean_token_accuracy": 0.8898520469665527, |
| "num_tokens": 4354803.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.21234261989593506, |
| "learning_rate": 0.00013722392795602594, |
| "loss": 0.3543, |
| "mean_token_accuracy": 0.9114936590194702, |
| "num_tokens": 4380368.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0126582278481013, |
| "grad_norm": 0.27655863761901855, |
| "learning_rate": 0.0001364613715117499, |
| "loss": 0.3225, |
| "mean_token_accuracy": 0.918269693851471, |
| "num_tokens": 4400290.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0253164556962027, |
| "grad_norm": 0.2500605583190918, |
| "learning_rate": 0.00013569636186856288, |
| "loss": 0.3184, |
| "mean_token_accuracy": 0.9159533381462097, |
| "num_tokens": 4424186.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.037974683544304, |
| "grad_norm": 0.23898674547672272, |
| "learning_rate": 0.0001349289504979467, |
| "loss": 0.312, |
| "mean_token_accuracy": 0.9217621088027954, |
| "num_tokens": 4447359.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050632911392405, |
| "grad_norm": 0.26260843873023987, |
| "learning_rate": 0.0001341591890329766, |
| "loss": 0.3502, |
| "mean_token_accuracy": 0.9151948690414429, |
| "num_tokens": 4475393.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0632911392405062, |
| "grad_norm": 0.3176262080669403, |
| "learning_rate": 0.00013338712926484725, |
| "loss": 0.2907, |
| "mean_token_accuracy": 0.9248190522193909, |
| "num_tokens": 4504467.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0759493670886076, |
| "grad_norm": 0.3452271819114685, |
| "learning_rate": 0.00013261282313938795, |
| "loss": 0.3302, |
| "mean_token_accuracy": 0.9150597453117371, |
| "num_tokens": 4536683.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.088607594936709, |
| "grad_norm": 0.30614957213401794, |
| "learning_rate": 0.00013183632275356777, |
| "loss": 0.3393, |
| "mean_token_accuracy": 0.9161185026168823, |
| "num_tokens": 4563654.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1012658227848102, |
| "grad_norm": 0.24343803524971008, |
| "learning_rate": 0.00013105768035199034, |
| "loss": 0.2901, |
| "mean_token_accuracy": 0.924813449382782, |
| "num_tokens": 4590651.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1139240506329116, |
| "grad_norm": 0.2270330786705017, |
| "learning_rate": 0.0001302769483233786, |
| "loss": 0.3091, |
| "mean_token_accuracy": 0.9209712147712708, |
| "num_tokens": 4620122.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.1265822784810124, |
| "grad_norm": 0.2397693246603012, |
| "learning_rate": 0.00012949417919705007, |
| "loss": 0.3475, |
| "mean_token_accuracy": 0.9106589555740356, |
| "num_tokens": 4646333.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.1392405063291138, |
| "grad_norm": 0.24059844017028809, |
| "learning_rate": 0.00012870942563938264, |
| "loss": 0.323, |
| "mean_token_accuracy": 0.9175428152084351, |
| "num_tokens": 4673599.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.151898734177215, |
| "grad_norm": 0.2501348853111267, |
| "learning_rate": 0.0001279227404502709, |
| "loss": 0.3163, |
| "mean_token_accuracy": 0.9166937470436096, |
| "num_tokens": 4701380.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1645569620253164, |
| "grad_norm": 0.22692376375198364, |
| "learning_rate": 0.00012713417655957376, |
| "loss": 0.2759, |
| "mean_token_accuracy": 0.9288318753242493, |
| "num_tokens": 4726947.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.1772151898734178, |
| "grad_norm": 0.2650166451931, |
| "learning_rate": 0.00012634378702355313, |
| "loss": 0.2903, |
| "mean_token_accuracy": 0.9228612184524536, |
| "num_tokens": 4750190.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.189873417721519, |
| "grad_norm": 0.2699657678604126, |
| "learning_rate": 0.00012555162502130433, |
| "loss": 0.3415, |
| "mean_token_accuracy": 0.9156725406646729, |
| "num_tokens": 4780683.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2025316455696204, |
| "grad_norm": 0.27826425433158875, |
| "learning_rate": 0.00012475774385117786, |
| "loss": 0.2964, |
| "mean_token_accuracy": 0.9242163300514221, |
| "num_tokens": 4809170.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.2151898734177213, |
| "grad_norm": 0.2556692361831665, |
| "learning_rate": 0.00012396219692719363, |
| "loss": 0.2999, |
| "mean_token_accuracy": 0.9241935610771179, |
| "num_tokens": 4840234.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.2278481012658227, |
| "grad_norm": 0.2634039521217346, |
| "learning_rate": 0.000123165037775447, |
| "loss": 0.2831, |
| "mean_token_accuracy": 0.928834855556488, |
| "num_tokens": 4871212.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.240506329113924, |
| "grad_norm": 0.24299867451190948, |
| "learning_rate": 0.00012236632003050736, |
| "loss": 0.3104, |
| "mean_token_accuracy": 0.9202462434768677, |
| "num_tokens": 4899864.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.2531645569620253, |
| "grad_norm": 0.27710238099098206, |
| "learning_rate": 0.00012156609743180969, |
| "loss": 0.3277, |
| "mean_token_accuracy": 0.916947603225708, |
| "num_tokens": 4923660.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.2658227848101267, |
| "grad_norm": 0.26420897245407104, |
| "learning_rate": 0.0001207644238200387, |
| "loss": 0.3226, |
| "mean_token_accuracy": 0.9189229607582092, |
| "num_tokens": 4950316.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.278481012658228, |
| "grad_norm": 0.24535071849822998, |
| "learning_rate": 0.00011996135313350636, |
| "loss": 0.3358, |
| "mean_token_accuracy": 0.9146915674209595, |
| "num_tokens": 4976919.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.291139240506329, |
| "grad_norm": 0.2273595929145813, |
| "learning_rate": 0.0001191569394045228, |
| "loss": 0.3158, |
| "mean_token_accuracy": 0.9169893264770508, |
| "num_tokens": 5007461.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.3037974683544302, |
| "grad_norm": 0.2287990301847458, |
| "learning_rate": 0.00011835123675576092, |
| "loss": 0.3074, |
| "mean_token_accuracy": 0.9208506345748901, |
| "num_tokens": 5038138.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3164556962025316, |
| "grad_norm": 0.27022621035575867, |
| "learning_rate": 0.0001175442993966149, |
| "loss": 0.365, |
| "mean_token_accuracy": 0.9085253477096558, |
| "num_tokens": 5065368.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.329113924050633, |
| "grad_norm": 0.27093011140823364, |
| "learning_rate": 0.00011673618161955288, |
| "loss": 0.2812, |
| "mean_token_accuracy": 0.9275172352790833, |
| "num_tokens": 5093618.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.3417721518987342, |
| "grad_norm": 0.2677018642425537, |
| "learning_rate": 0.00011592693779646405, |
| "loss": 0.3154, |
| "mean_token_accuracy": 0.9172254800796509, |
| "num_tokens": 5122314.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.3544303797468356, |
| "grad_norm": 0.28765732049942017, |
| "learning_rate": 0.00011511662237500032, |
| "loss": 0.2979, |
| "mean_token_accuracy": 0.920109748840332, |
| "num_tokens": 5151906.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.367088607594937, |
| "grad_norm": 0.2899748384952545, |
| "learning_rate": 0.00011430528987491305, |
| "loss": 0.3114, |
| "mean_token_accuracy": 0.9213389754295349, |
| "num_tokens": 5183218.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.379746835443038, |
| "grad_norm": 0.2758501470088959, |
| "learning_rate": 0.00011349299488438485, |
| "loss": 0.3214, |
| "mean_token_accuracy": 0.9202250242233276, |
| "num_tokens": 5207099.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.392405063291139, |
| "grad_norm": 0.26853853464126587, |
| "learning_rate": 0.00011267979205635675, |
| "loss": 0.288, |
| "mean_token_accuracy": 0.9245320558547974, |
| "num_tokens": 5232114.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4050632911392404, |
| "grad_norm": 0.25736933946609497, |
| "learning_rate": 0.00011186573610485098, |
| "loss": 0.3346, |
| "mean_token_accuracy": 0.9166609644889832, |
| "num_tokens": 5261288.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4177215189873418, |
| "grad_norm": 0.2637197971343994, |
| "learning_rate": 0.00011105088180128976, |
| "loss": 0.3661, |
| "mean_token_accuracy": 0.9097849726676941, |
| "num_tokens": 5289906.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.430379746835443, |
| "grad_norm": 0.2588805854320526, |
| "learning_rate": 0.00011023528397081011, |
| "loss": 0.3093, |
| "mean_token_accuracy": 0.9212461709976196, |
| "num_tokens": 5317575.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.4430379746835444, |
| "grad_norm": 0.25420597195625305, |
| "learning_rate": 0.0001094189974885752, |
| "loss": 0.2949, |
| "mean_token_accuracy": 0.9249463677406311, |
| "num_tokens": 5344220.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4556962025316453, |
| "grad_norm": 0.23094050586223602, |
| "learning_rate": 0.00010860207727608214, |
| "loss": 0.2978, |
| "mean_token_accuracy": 0.9216447472572327, |
| "num_tokens": 5376994.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4683544303797467, |
| "grad_norm": 0.26487165689468384, |
| "learning_rate": 0.00010778457829746666, |
| "loss": 0.3375, |
| "mean_token_accuracy": 0.9163733124732971, |
| "num_tokens": 5406032.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.481012658227848, |
| "grad_norm": 0.26758190989494324, |
| "learning_rate": 0.00010696655555580524, |
| "loss": 0.3016, |
| "mean_token_accuracy": 0.9225262403488159, |
| "num_tokens": 5432079.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4936708860759493, |
| "grad_norm": 0.24040226638317108, |
| "learning_rate": 0.00010614806408941422, |
| "loss": 0.3005, |
| "mean_token_accuracy": 0.9199211001396179, |
| "num_tokens": 5460028.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5063291139240507, |
| "grad_norm": 0.24399694800376892, |
| "learning_rate": 0.00010532915896814672, |
| "loss": 0.3154, |
| "mean_token_accuracy": 0.9223917722702026, |
| "num_tokens": 5490630.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.518987341772152, |
| "grad_norm": 0.25092339515686035, |
| "learning_rate": 0.00010450989528968746, |
| "loss": 0.3155, |
| "mean_token_accuracy": 0.9183499217033386, |
| "num_tokens": 5520002.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.5316455696202533, |
| "grad_norm": 0.3188228905200958, |
| "learning_rate": 0.00010369032817584561, |
| "loss": 0.3576, |
| "mean_token_accuracy": 0.9120784401893616, |
| "num_tokens": 5543314.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5443037974683547, |
| "grad_norm": 0.25112369656562805, |
| "learning_rate": 0.00010287051276884618, |
| "loss": 0.3232, |
| "mean_token_accuracy": 0.9183758497238159, |
| "num_tokens": 5576922.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5569620253164556, |
| "grad_norm": 0.2742134630680084, |
| "learning_rate": 0.00010205050422761988, |
| "loss": 0.3443, |
| "mean_token_accuracy": 0.9113529920578003, |
| "num_tokens": 5604274.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.569620253164557, |
| "grad_norm": 0.26450711488723755, |
| "learning_rate": 0.00010123035772409184, |
| "loss": 0.3138, |
| "mean_token_accuracy": 0.9207383990287781, |
| "num_tokens": 5629962.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5822784810126582, |
| "grad_norm": 0.284280002117157, |
| "learning_rate": 0.0001004101284394696, |
| "loss": 0.3381, |
| "mean_token_accuracy": 0.914824903011322, |
| "num_tokens": 5657898.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5949367088607596, |
| "grad_norm": 0.25629135966300964, |
| "learning_rate": 9.958987156053045e-05, |
| "loss": 0.3072, |
| "mean_token_accuracy": 0.9197523593902588, |
| "num_tokens": 5684455.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.607594936708861, |
| "grad_norm": 0.2606535255908966, |
| "learning_rate": 9.87696422759082e-05, |
| "loss": 0.3119, |
| "mean_token_accuracy": 0.9206276535987854, |
| "num_tokens": 5712942.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.620253164556962, |
| "grad_norm": 0.3131278455257416, |
| "learning_rate": 9.794949577238013e-05, |
| "loss": 0.3396, |
| "mean_token_accuracy": 0.9145336151123047, |
| "num_tokens": 5736173.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.632911392405063, |
| "grad_norm": 0.28028929233551025, |
| "learning_rate": 9.712948723115383e-05, |
| "loss": 0.3235, |
| "mean_token_accuracy": 0.9198562502861023, |
| "num_tokens": 5764898.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6455696202531644, |
| "grad_norm": 0.3018859028816223, |
| "learning_rate": 9.630967182415442e-05, |
| "loss": 0.3416, |
| "mean_token_accuracy": 0.9144072532653809, |
| "num_tokens": 5788235.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.6582278481012658, |
| "grad_norm": 0.2701573371887207, |
| "learning_rate": 9.549010471031256e-05, |
| "loss": 0.3322, |
| "mean_token_accuracy": 0.9136073589324951, |
| "num_tokens": 5815593.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.670886075949367, |
| "grad_norm": 0.27918487787246704, |
| "learning_rate": 9.467084103185329e-05, |
| "loss": 0.2871, |
| "mean_token_accuracy": 0.9251144528388977, |
| "num_tokens": 5839026.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6835443037974684, |
| "grad_norm": 0.2541793882846832, |
| "learning_rate": 9.385193591058579e-05, |
| "loss": 0.3207, |
| "mean_token_accuracy": 0.9179412126541138, |
| "num_tokens": 5868447.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.6962025316455698, |
| "grad_norm": 0.284212201833725, |
| "learning_rate": 9.303344444419476e-05, |
| "loss": 0.3418, |
| "mean_token_accuracy": 0.9152814745903015, |
| "num_tokens": 5892154.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.708860759493671, |
| "grad_norm": 0.25230202078819275, |
| "learning_rate": 9.221542170253339e-05, |
| "loss": 0.324, |
| "mean_token_accuracy": 0.918138861656189, |
| "num_tokens": 5920803.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.721518987341772, |
| "grad_norm": 0.25568363070487976, |
| "learning_rate": 9.139792272391791e-05, |
| "loss": 0.3217, |
| "mean_token_accuracy": 0.9202106595039368, |
| "num_tokens": 5948590.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.7341772151898733, |
| "grad_norm": 0.27856069803237915, |
| "learning_rate": 9.058100251142483e-05, |
| "loss": 0.3423, |
| "mean_token_accuracy": 0.9158259034156799, |
| "num_tokens": 5975218.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7468354430379747, |
| "grad_norm": 0.28674831986427307, |
| "learning_rate": 8.976471602918991e-05, |
| "loss": 0.3211, |
| "mean_token_accuracy": 0.9169238209724426, |
| "num_tokens": 5999260.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.759493670886076, |
| "grad_norm": 0.2633654475212097, |
| "learning_rate": 8.894911819871026e-05, |
| "loss": 0.3001, |
| "mean_token_accuracy": 0.9245463013648987, |
| "num_tokens": 6025499.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.7721518987341773, |
| "grad_norm": 0.27216392755508423, |
| "learning_rate": 8.813426389514903e-05, |
| "loss": 0.3121, |
| "mean_token_accuracy": 0.9205847382545471, |
| "num_tokens": 6052447.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.7848101265822782, |
| "grad_norm": 0.27877405285835266, |
| "learning_rate": 8.732020794364326e-05, |
| "loss": 0.3115, |
| "mean_token_accuracy": 0.9189746379852295, |
| "num_tokens": 6077244.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.7974683544303796, |
| "grad_norm": 0.24932622909545898, |
| "learning_rate": 8.650700511561514e-05, |
| "loss": 0.3044, |
| "mean_token_accuracy": 0.9242026805877686, |
| "num_tokens": 6107784.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.810126582278481, |
| "grad_norm": 0.2901391088962555, |
| "learning_rate": 8.5694710125087e-05, |
| "loss": 0.3463, |
| "mean_token_accuracy": 0.913219153881073, |
| "num_tokens": 6131851.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8227848101265822, |
| "grad_norm": 0.25400716066360474, |
| "learning_rate": 8.488337762499972e-05, |
| "loss": 0.3237, |
| "mean_token_accuracy": 0.9190093874931335, |
| "num_tokens": 6162079.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.8354430379746836, |
| "grad_norm": 0.28880804777145386, |
| "learning_rate": 8.407306220353596e-05, |
| "loss": 0.2961, |
| "mean_token_accuracy": 0.9268283247947693, |
| "num_tokens": 6188779.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.848101265822785, |
| "grad_norm": 0.2607930600643158, |
| "learning_rate": 8.326381838044713e-05, |
| "loss": 0.2939, |
| "mean_token_accuracy": 0.9244282841682434, |
| "num_tokens": 6215255.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8607594936708862, |
| "grad_norm": 0.25856783986091614, |
| "learning_rate": 8.245570060338512e-05, |
| "loss": 0.3216, |
| "mean_token_accuracy": 0.9173731207847595, |
| "num_tokens": 6243276.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8734177215189876, |
| "grad_norm": 0.2345365434885025, |
| "learning_rate": 8.164876324423909e-05, |
| "loss": 0.2951, |
| "mean_token_accuracy": 0.9234026670455933, |
| "num_tokens": 6275456.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8860759493670884, |
| "grad_norm": 0.307713121175766, |
| "learning_rate": 8.084306059547722e-05, |
| "loss": 0.3493, |
| "mean_token_accuracy": 0.9130492806434631, |
| "num_tokens": 6298073.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.8987341772151898, |
| "grad_norm": 0.22503980994224548, |
| "learning_rate": 8.003864686649366e-05, |
| "loss": 0.2865, |
| "mean_token_accuracy": 0.9234779477119446, |
| "num_tokens": 6329788.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.911392405063291, |
| "grad_norm": 0.2680565118789673, |
| "learning_rate": 7.923557617996131e-05, |
| "loss": 0.3342, |
| "mean_token_accuracy": 0.912935733795166, |
| "num_tokens": 6355672.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9240506329113924, |
| "grad_norm": 0.24028684198856354, |
| "learning_rate": 7.843390256819034e-05, |
| "loss": 0.3245, |
| "mean_token_accuracy": 0.9167670607566833, |
| "num_tokens": 6388944.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9367088607594938, |
| "grad_norm": 0.2594313323497772, |
| "learning_rate": 7.763367996949267e-05, |
| "loss": 0.3122, |
| "mean_token_accuracy": 0.919628918170929, |
| "num_tokens": 6415311.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9493670886075947, |
| "grad_norm": 0.26911094784736633, |
| "learning_rate": 7.683496222455304e-05, |
| "loss": 0.2932, |
| "mean_token_accuracy": 0.9235373735427856, |
| "num_tokens": 6445612.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.962025316455696, |
| "grad_norm": 0.2445937991142273, |
| "learning_rate": 7.603780307280639e-05, |
| "loss": 0.3075, |
| "mean_token_accuracy": 0.921126127243042, |
| "num_tokens": 6477892.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.9746835443037973, |
| "grad_norm": 0.24366585910320282, |
| "learning_rate": 7.524225614882216e-05, |
| "loss": 0.3063, |
| "mean_token_accuracy": 0.9189066886901855, |
| "num_tokens": 6511103.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9873417721518987, |
| "grad_norm": 0.2565755248069763, |
| "learning_rate": 7.44483749786957e-05, |
| "loss": 0.3173, |
| "mean_token_accuracy": 0.9204142689704895, |
| "num_tokens": 6544188.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.2904413640499115, |
| "learning_rate": 7.365621297644686e-05, |
| "loss": 0.2312, |
| "mean_token_accuracy": 0.9368520975112915, |
| "num_tokens": 6563160.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0126582278481013, |
| "grad_norm": 0.27616387605667114, |
| "learning_rate": 7.286582344042625e-05, |
| "loss": 0.2444, |
| "mean_token_accuracy": 0.9391213059425354, |
| "num_tokens": 6592676.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0253164556962027, |
| "grad_norm": 0.22310671210289001, |
| "learning_rate": 7.207725954972913e-05, |
| "loss": 0.2059, |
| "mean_token_accuracy": 0.9484432339668274, |
| "num_tokens": 6622513.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.037974683544304, |
| "grad_norm": 0.23881305754184723, |
| "learning_rate": 7.129057436061739e-05, |
| "loss": 0.1847, |
| "mean_token_accuracy": 0.9508729577064514, |
| "num_tokens": 6648408.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050632911392405, |
| "grad_norm": 0.26994800567626953, |
| "learning_rate": 7.050582080294996e-05, |
| "loss": 0.2262, |
| "mean_token_accuracy": 0.9404712319374084, |
| "num_tokens": 6677248.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0632911392405062, |
| "grad_norm": 0.33617740869522095, |
| "learning_rate": 6.972305167662145e-05, |
| "loss": 0.2183, |
| "mean_token_accuracy": 0.9411532282829285, |
| "num_tokens": 6702632.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0759493670886076, |
| "grad_norm": 0.3962535560131073, |
| "learning_rate": 6.89423196480097e-05, |
| "loss": 0.235, |
| "mean_token_accuracy": 0.9364402890205383, |
| "num_tokens": 6723574.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.088607594936709, |
| "grad_norm": 0.3901783227920532, |
| "learning_rate": 6.816367724643224e-05, |
| "loss": 0.2112, |
| "mean_token_accuracy": 0.9436113834381104, |
| "num_tokens": 6753715.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1012658227848102, |
| "grad_norm": 0.42895060777664185, |
| "learning_rate": 6.738717686061206e-05, |
| "loss": 0.2142, |
| "mean_token_accuracy": 0.9432305097579956, |
| "num_tokens": 6782016.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1139240506329116, |
| "grad_norm": 0.3753194212913513, |
| "learning_rate": 6.661287073515275e-05, |
| "loss": 0.2079, |
| "mean_token_accuracy": 0.9462132453918457, |
| "num_tokens": 6810191.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.1265822784810124, |
| "grad_norm": 0.3014523386955261, |
| "learning_rate": 6.58408109670234e-05, |
| "loss": 0.1745, |
| "mean_token_accuracy": 0.9523671865463257, |
| "num_tokens": 6837946.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.1392405063291138, |
| "grad_norm": 0.2990639805793762, |
| "learning_rate": 6.507104950205336e-05, |
| "loss": 0.2133, |
| "mean_token_accuracy": 0.9442956447601318, |
| "num_tokens": 6865638.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.151898734177215, |
| "grad_norm": 0.2579714357852936, |
| "learning_rate": 6.430363813143716e-05, |
| "loss": 0.2133, |
| "mean_token_accuracy": 0.943679690361023, |
| "num_tokens": 6897449.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1645569620253164, |
| "grad_norm": 0.2432967573404312, |
| "learning_rate": 6.35386284882501e-05, |
| "loss": 0.2231, |
| "mean_token_accuracy": 0.9416444897651672, |
| "num_tokens": 6930569.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.1772151898734178, |
| "grad_norm": 0.27149054408073425, |
| "learning_rate": 6.277607204397408e-05, |
| "loss": 0.2242, |
| "mean_token_accuracy": 0.9404853582382202, |
| "num_tokens": 6960508.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.189873417721519, |
| "grad_norm": 0.26167789101600647, |
| "learning_rate": 6.201602010503454e-05, |
| "loss": 0.1878, |
| "mean_token_accuracy": 0.949936032295227, |
| "num_tokens": 6985580.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2025316455696204, |
| "grad_norm": 0.2881351113319397, |
| "learning_rate": 6.125852380934841e-05, |
| "loss": 0.209, |
| "mean_token_accuracy": 0.9419926404953003, |
| "num_tokens": 7010365.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.2151898734177213, |
| "grad_norm": 0.2717518210411072, |
| "learning_rate": 6.0503634122883556e-05, |
| "loss": 0.2127, |
| "mean_token_accuracy": 0.9436876177787781, |
| "num_tokens": 7042802.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.2278481012658227, |
| "grad_norm": 0.2932974100112915, |
| "learning_rate": 5.975140183622958e-05, |
| "loss": 0.2408, |
| "mean_token_accuracy": 0.936859130859375, |
| "num_tokens": 7071342.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.240506329113924, |
| "grad_norm": 0.3055175244808197, |
| "learning_rate": 5.900187756118055e-05, |
| "loss": 0.2171, |
| "mean_token_accuracy": 0.941013514995575, |
| "num_tokens": 7102091.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.2531645569620253, |
| "grad_norm": 0.3924141526222229, |
| "learning_rate": 5.8255111727329717e-05, |
| "loss": 0.2121, |
| "mean_token_accuracy": 0.9423477649688721, |
| "num_tokens": 7126161.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.2658227848101267, |
| "grad_norm": 0.3086543083190918, |
| "learning_rate": 5.751115457867653e-05, |
| "loss": 0.2009, |
| "mean_token_accuracy": 0.9472497701644897, |
| "num_tokens": 7159495.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.278481012658228, |
| "grad_norm": 0.3455684185028076, |
| "learning_rate": 5.6770056170246175e-05, |
| "loss": 0.2062, |
| "mean_token_accuracy": 0.9483978152275085, |
| "num_tokens": 7188395.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.291139240506329, |
| "grad_norm": 0.30978819727897644, |
| "learning_rate": 5.6031866364721554e-05, |
| "loss": 0.1889, |
| "mean_token_accuracy": 0.9461386203765869, |
| "num_tokens": 7217775.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.3037974683544302, |
| "grad_norm": 0.3556048572063446, |
| "learning_rate": 5.529663482908864e-05, |
| "loss": 0.2091, |
| "mean_token_accuracy": 0.9441432952880859, |
| "num_tokens": 7241453.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3164556962025316, |
| "grad_norm": 0.33020082116127014, |
| "learning_rate": 5.4564411031294695e-05, |
| "loss": 0.22, |
| "mean_token_accuracy": 0.9420092701911926, |
| "num_tokens": 7265038.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.329113924050633, |
| "grad_norm": 0.2814682424068451, |
| "learning_rate": 5.383524423691994e-05, |
| "loss": 0.2165, |
| "mean_token_accuracy": 0.9420244097709656, |
| "num_tokens": 7296598.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.3417721518987342, |
| "grad_norm": 0.30232468247413635, |
| "learning_rate": 5.310918350586291e-05, |
| "loss": 0.2237, |
| "mean_token_accuracy": 0.9408864974975586, |
| "num_tokens": 7323847.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.3544303797468356, |
| "grad_norm": 0.3444303870201111, |
| "learning_rate": 5.2386277689039565e-05, |
| "loss": 0.2359, |
| "mean_token_accuracy": 0.9386903643608093, |
| "num_tokens": 7349796.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.367088607594937, |
| "grad_norm": 0.27576106786727905, |
| "learning_rate": 5.1666575425096396e-05, |
| "loss": 0.2028, |
| "mean_token_accuracy": 0.9470149278640747, |
| "num_tokens": 7381869.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.379746835443038, |
| "grad_norm": 0.264581561088562, |
| "learning_rate": 5.095012513713815e-05, |
| "loss": 0.1836, |
| "mean_token_accuracy": 0.9481507539749146, |
| "num_tokens": 7410323.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.392405063291139, |
| "grad_norm": 0.2806169092655182, |
| "learning_rate": 5.023697502946969e-05, |
| "loss": 0.2211, |
| "mean_token_accuracy": 0.9417513608932495, |
| "num_tokens": 7443538.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4050632911392404, |
| "grad_norm": 0.3141394853591919, |
| "learning_rate": 4.9527173084352544e-05, |
| "loss": 0.2092, |
| "mean_token_accuracy": 0.9468376636505127, |
| "num_tokens": 7472062.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4177215189873418, |
| "grad_norm": 0.3401537537574768, |
| "learning_rate": 4.882076705877689e-05, |
| "loss": 0.2296, |
| "mean_token_accuracy": 0.9416146874427795, |
| "num_tokens": 7495214.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.430379746835443, |
| "grad_norm": 0.3027495741844177, |
| "learning_rate": 4.811780448124812e-05, |
| "loss": 0.1805, |
| "mean_token_accuracy": 0.9496809840202332, |
| "num_tokens": 7524273.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.4430379746835444, |
| "grad_norm": 0.31691181659698486, |
| "learning_rate": 4.741833264858909e-05, |
| "loss": 0.2165, |
| "mean_token_accuracy": 0.9446760416030884, |
| "num_tokens": 7550004.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4556962025316453, |
| "grad_norm": 0.349369615316391, |
| "learning_rate": 4.6722398622757935e-05, |
| "loss": 0.2351, |
| "mean_token_accuracy": 0.937907874584198, |
| "num_tokens": 7576577.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4683544303797467, |
| "grad_norm": 0.32902660965919495, |
| "learning_rate": 4.603004922768148e-05, |
| "loss": 0.2186, |
| "mean_token_accuracy": 0.9428966045379639, |
| "num_tokens": 7604888.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.481012658227848, |
| "grad_norm": 0.3392826020717621, |
| "learning_rate": 4.5341331046105064e-05, |
| "loss": 0.1997, |
| "mean_token_accuracy": 0.9449344277381897, |
| "num_tokens": 7632392.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4936708860759493, |
| "grad_norm": 0.31181755661964417, |
| "learning_rate": 4.465629041645819e-05, |
| "loss": 0.2147, |
| "mean_token_accuracy": 0.9431726336479187, |
| "num_tokens": 7660893.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5063291139240507, |
| "grad_norm": 0.3440548777580261, |
| "learning_rate": 4.397497342973676e-05, |
| "loss": 0.2351, |
| "mean_token_accuracy": 0.93739253282547, |
| "num_tokens": 7684804.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.518987341772152, |
| "grad_norm": 0.3588908016681671, |
| "learning_rate": 4.3297425926402115e-05, |
| "loss": 0.2077, |
| "mean_token_accuracy": 0.9441769123077393, |
| "num_tokens": 7707296.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.5316455696202533, |
| "grad_norm": 0.3143376111984253, |
| "learning_rate": 4.2623693493296644e-05, |
| "loss": 0.2178, |
| "mean_token_accuracy": 0.9430637955665588, |
| "num_tokens": 7734320.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5443037974683547, |
| "grad_norm": 0.3187249004840851, |
| "learning_rate": 4.1953821460576715e-05, |
| "loss": 0.2153, |
| "mean_token_accuracy": 0.9420468211174011, |
| "num_tokens": 7759594.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5569620253164556, |
| "grad_norm": 0.3404756486415863, |
| "learning_rate": 4.1287854898662705e-05, |
| "loss": 0.2191, |
| "mean_token_accuracy": 0.9429894089698792, |
| "num_tokens": 7784934.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.569620253164557, |
| "grad_norm": 0.2950340211391449, |
| "learning_rate": 4.0625838615206566e-05, |
| "loss": 0.1965, |
| "mean_token_accuracy": 0.9470370411872864, |
| "num_tokens": 7813905.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5822784810126582, |
| "grad_norm": 0.29675501585006714, |
| "learning_rate": 3.996781715207706e-05, |
| "loss": 0.1883, |
| "mean_token_accuracy": 0.9523015022277832, |
| "num_tokens": 7842733.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5949367088607596, |
| "grad_norm": 0.2913971245288849, |
| "learning_rate": 3.9313834782362926e-05, |
| "loss": 0.2062, |
| "mean_token_accuracy": 0.9438738226890564, |
| "num_tokens": 7870057.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.607594936708861, |
| "grad_norm": 0.3250754177570343, |
| "learning_rate": 3.866393550739416e-05, |
| "loss": 0.2152, |
| "mean_token_accuracy": 0.9438368678092957, |
| "num_tokens": 7899838.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.620253164556962, |
| "grad_norm": 0.3587188422679901, |
| "learning_rate": 3.801816305378124e-05, |
| "loss": 0.2133, |
| "mean_token_accuracy": 0.9447436928749084, |
| "num_tokens": 7927193.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.632911392405063, |
| "grad_norm": 0.3460696041584015, |
| "learning_rate": 3.737656087047347e-05, |
| "loss": 0.2206, |
| "mean_token_accuracy": 0.9417229294776917, |
| "num_tokens": 7954815.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6455696202531644, |
| "grad_norm": 0.3258835971355438, |
| "learning_rate": 3.673917212583538e-05, |
| "loss": 0.1926, |
| "mean_token_accuracy": 0.9482221007347107, |
| "num_tokens": 7981512.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.6582278481012658, |
| "grad_norm": 0.30438584089279175, |
| "learning_rate": 3.610603970474239e-05, |
| "loss": 0.188, |
| "mean_token_accuracy": 0.9465112090110779, |
| "num_tokens": 8009881.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.670886075949367, |
| "grad_norm": 0.32022497057914734, |
| "learning_rate": 3.547720620569539e-05, |
| "loss": 0.2302, |
| "mean_token_accuracy": 0.9406543970108032, |
| "num_tokens": 8036535.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6835443037974684, |
| "grad_norm": 0.31502029299736023, |
| "learning_rate": 3.485271393795453e-05, |
| "loss": 0.2027, |
| "mean_token_accuracy": 0.945996105670929, |
| "num_tokens": 8065708.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.6962025316455698, |
| "grad_norm": 0.33635619282722473, |
| "learning_rate": 3.4232604918692754e-05, |
| "loss": 0.186, |
| "mean_token_accuracy": 0.949739396572113, |
| "num_tokens": 8095895.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.708860759493671, |
| "grad_norm": 0.28580737113952637, |
| "learning_rate": 3.361692087016863e-05, |
| "loss": 0.2055, |
| "mean_token_accuracy": 0.9459794163703918, |
| "num_tokens": 8130668.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.721518987341772, |
| "grad_norm": 0.3191229999065399, |
| "learning_rate": 3.300570321691934e-05, |
| "loss": 0.2276, |
| "mean_token_accuracy": 0.9415168166160583, |
| "num_tokens": 8159424.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.7341772151898733, |
| "grad_norm": 0.3334013819694519, |
| "learning_rate": 3.2398993082973294e-05, |
| "loss": 0.2059, |
| "mean_token_accuracy": 0.9460656642913818, |
| "num_tokens": 8185223.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7468354430379747, |
| "grad_norm": 0.3282049298286438, |
| "learning_rate": 3.179683128908352e-05, |
| "loss": 0.1981, |
| "mean_token_accuracy": 0.9463132619857788, |
| "num_tokens": 8210526.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.759493670886076, |
| "grad_norm": 0.32919394969940186, |
| "learning_rate": 3.1199258349980966e-05, |
| "loss": 0.2027, |
| "mean_token_accuracy": 0.9434241056442261, |
| "num_tokens": 8234275.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.7721518987341773, |
| "grad_norm": 0.30664342641830444, |
| "learning_rate": 3.0606314471648643e-05, |
| "loss": 0.225, |
| "mean_token_accuracy": 0.9425418972969055, |
| "num_tokens": 8264065.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.7848101265822782, |
| "grad_norm": 0.3123731017112732, |
| "learning_rate": 3.0018039548616494e-05, |
| "loss": 0.2136, |
| "mean_token_accuracy": 0.9409631490707397, |
| "num_tokens": 8289774.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.7974683544303796, |
| "grad_norm": 0.28892743587493896, |
| "learning_rate": 2.943447316127712e-05, |
| "loss": 0.2149, |
| "mean_token_accuracy": 0.9433043599128723, |
| "num_tokens": 8318588.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.810126582278481, |
| "grad_norm": 0.3019264340400696, |
| "learning_rate": 2.8855654573222825e-05, |
| "loss": 0.1967, |
| "mean_token_accuracy": 0.9472973942756653, |
| "num_tokens": 8342370.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8227848101265822, |
| "grad_norm": 0.34315142035484314, |
| "learning_rate": 2.8281622728603864e-05, |
| "loss": 0.2246, |
| "mean_token_accuracy": 0.9393528699874878, |
| "num_tokens": 8368272.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.8354430379746836, |
| "grad_norm": 0.28530240058898926, |
| "learning_rate": 2.7712416249508177e-05, |
| "loss": 0.1843, |
| "mean_token_accuracy": 0.9489932060241699, |
| "num_tokens": 8393862.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.848101265822785, |
| "grad_norm": 0.29711446166038513, |
| "learning_rate": 2.714807343336273e-05, |
| "loss": 0.193, |
| "mean_token_accuracy": 0.9491274356842041, |
| "num_tokens": 8427677.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8607594936708862, |
| "grad_norm": 0.3001667261123657, |
| "learning_rate": 2.6588632250356948e-05, |
| "loss": 0.2135, |
| "mean_token_accuracy": 0.942951500415802, |
| "num_tokens": 8456804.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8734177215189876, |
| "grad_norm": 0.370648592710495, |
| "learning_rate": 2.6034130340887895e-05, |
| "loss": 0.228, |
| "mean_token_accuracy": 0.9391285181045532, |
| "num_tokens": 8479473.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8860759493670884, |
| "grad_norm": 0.29396143555641174, |
| "learning_rate": 2.5484605013027784e-05, |
| "loss": 0.1875, |
| "mean_token_accuracy": 0.9490495324134827, |
| "num_tokens": 8509311.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.8987341772151898, |
| "grad_norm": 0.3296216130256653, |
| "learning_rate": 2.4940093240013717e-05, |
| "loss": 0.218, |
| "mean_token_accuracy": 0.9419081807136536, |
| "num_tokens": 8532769.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.911392405063291, |
| "grad_norm": 0.32734474539756775, |
| "learning_rate": 2.4400631657760186e-05, |
| "loss": 0.2283, |
| "mean_token_accuracy": 0.9447795748710632, |
| "num_tokens": 8562007.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9240506329113924, |
| "grad_norm": 0.3589797616004944, |
| "learning_rate": 2.3866256562394083e-05, |
| "loss": 0.2069, |
| "mean_token_accuracy": 0.9477079510688782, |
| "num_tokens": 8588423.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9367088607594938, |
| "grad_norm": 0.34904512763023376, |
| "learning_rate": 2.333700390781256e-05, |
| "loss": 0.2378, |
| "mean_token_accuracy": 0.9371540546417236, |
| "num_tokens": 8612514.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9493670886075947, |
| "grad_norm": 0.3251732587814331, |
| "learning_rate": 2.2812909303264085e-05, |
| "loss": 0.2197, |
| "mean_token_accuracy": 0.9419779777526855, |
| "num_tokens": 8638999.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.962025316455696, |
| "grad_norm": 0.2840147912502289, |
| "learning_rate": 2.2294008010952382e-05, |
| "loss": 0.1916, |
| "mean_token_accuracy": 0.9481982588768005, |
| "num_tokens": 8668618.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.9746835443037973, |
| "grad_norm": 0.3017045557498932, |
| "learning_rate": 2.1780334943664162e-05, |
| "loss": 0.2325, |
| "mean_token_accuracy": 0.9411991238594055, |
| "num_tokens": 8697253.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9873417721518987, |
| "grad_norm": 0.3263002932071686, |
| "learning_rate": 2.127192466241994e-05, |
| "loss": 0.1968, |
| "mean_token_accuracy": 0.9472008347511292, |
| "num_tokens": 8725272.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.26912280917167664, |
| "learning_rate": 2.07688113741488e-05, |
| "loss": 0.1739, |
| "mean_token_accuracy": 0.9553947448730469, |
| "num_tokens": 8752149.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012658227848101, |
| "grad_norm": 0.2620762288570404, |
| "learning_rate": 2.0271028929386738e-05, |
| "loss": 0.1409, |
| "mean_token_accuracy": 0.9631852507591248, |
| "num_tokens": 8786873.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025316455696203, |
| "grad_norm": 0.27156445384025574, |
| "learning_rate": 1.977861081999931e-05, |
| "loss": 0.1425, |
| "mean_token_accuracy": 0.9618934392929077, |
| "num_tokens": 8813914.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.037974683544304, |
| "grad_norm": 0.2684096693992615, |
| "learning_rate": 1.92915901769281e-05, |
| "loss": 0.1517, |
| "mean_token_accuracy": 0.9602447748184204, |
| "num_tokens": 8843232.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050632911392405, |
| "grad_norm": 0.26625022292137146, |
| "learning_rate": 1.880999976796164e-05, |
| "loss": 0.1452, |
| "mean_token_accuracy": 0.9612977504730225, |
| "num_tokens": 8872054.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063291139240507, |
| "grad_norm": 0.24873296916484833, |
| "learning_rate": 1.8333871995530726e-05, |
| "loss": 0.1326, |
| "mean_token_accuracy": 0.9649026989936829, |
| "num_tokens": 8901408.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.075949367088608, |
| "grad_norm": 0.3573494851589203, |
| "learning_rate": 1.786323889452828e-05, |
| "loss": 0.1975, |
| "mean_token_accuracy": 0.951496958732605, |
| "num_tokens": 8925120.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.0886075949367084, |
| "grad_norm": 0.26980891823768616, |
| "learning_rate": 1.739813213015401e-05, |
| "loss": 0.1516, |
| "mean_token_accuracy": 0.9608834385871887, |
| "num_tokens": 8954072.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.10126582278481, |
| "grad_norm": 0.3037337362766266, |
| "learning_rate": 1.693858299578396e-05, |
| "loss": 0.1492, |
| "mean_token_accuracy": 0.9619460105895996, |
| "num_tokens": 8979521.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.113924050632911, |
| "grad_norm": 0.3206160068511963, |
| "learning_rate": 1.6484622410864835e-05, |
| "loss": 0.1544, |
| "mean_token_accuracy": 0.9592971205711365, |
| "num_tokens": 9009804.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.1265822784810124, |
| "grad_norm": 0.3352915942668915, |
| "learning_rate": 1.6036280918833924e-05, |
| "loss": 0.1324, |
| "mean_token_accuracy": 0.9634490609169006, |
| "num_tokens": 9039963.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.139240506329114, |
| "grad_norm": 0.33604586124420166, |
| "learning_rate": 1.5593588685063896e-05, |
| "loss": 0.1455, |
| "mean_token_accuracy": 0.9627248644828796, |
| "num_tokens": 9068491.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.151898734177215, |
| "grad_norm": 0.3599500060081482, |
| "learning_rate": 1.515657549483328e-05, |
| "loss": 0.1462, |
| "mean_token_accuracy": 0.9611698985099792, |
| "num_tokens": 9096729.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.1645569620253164, |
| "grad_norm": 0.33143875002861023, |
| "learning_rate": 1.4725270751322452e-05, |
| "loss": 0.1526, |
| "mean_token_accuracy": 0.959871232509613, |
| "num_tokens": 9125376.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.177215189873418, |
| "grad_norm": 0.3701411187648773, |
| "learning_rate": 1.4299703473635218e-05, |
| "loss": 0.1343, |
| "mean_token_accuracy": 0.9638819694519043, |
| "num_tokens": 9149943.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.189873417721519, |
| "grad_norm": 0.35997846722602844, |
| "learning_rate": 1.3879902294846536e-05, |
| "loss": 0.1559, |
| "mean_token_accuracy": 0.9590244293212891, |
| "num_tokens": 9175510.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.2025316455696204, |
| "grad_norm": 0.35657989978790283, |
| "learning_rate": 1.3465895460075873e-05, |
| "loss": 0.1433, |
| "mean_token_accuracy": 0.9618638753890991, |
| "num_tokens": 9200511.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.215189873417722, |
| "grad_norm": 0.3306591808795929, |
| "learning_rate": 1.3057710824586899e-05, |
| "loss": 0.1364, |
| "mean_token_accuracy": 0.9646348357200623, |
| "num_tokens": 9228399.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.227848101265823, |
| "grad_norm": 0.39021170139312744, |
| "learning_rate": 1.2655375851913232e-05, |
| "loss": 0.1356, |
| "mean_token_accuracy": 0.9625832438468933, |
| "num_tokens": 9255483.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.2405063291139244, |
| "grad_norm": 0.31789690256118774, |
| "learning_rate": 1.22589176120107e-05, |
| "loss": 0.1491, |
| "mean_token_accuracy": 0.9607197642326355, |
| "num_tokens": 9288668.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.253164556962025, |
| "grad_norm": 0.28493577241897583, |
| "learning_rate": 1.186836277943606e-05, |
| "loss": 0.1353, |
| "mean_token_accuracy": 0.963397204875946, |
| "num_tokens": 9320205.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.265822784810126, |
| "grad_norm": 0.2949843406677246, |
| "learning_rate": 1.1483737631552161e-05, |
| "loss": 0.1485, |
| "mean_token_accuracy": 0.9607917070388794, |
| "num_tokens": 9354726.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.2784810126582276, |
| "grad_norm": 0.3261242210865021, |
| "learning_rate": 1.1105068046760048e-05, |
| "loss": 0.1534, |
| "mean_token_accuracy": 0.9607728719711304, |
| "num_tokens": 9378753.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.291139240506329, |
| "grad_norm": 0.3109029531478882, |
| "learning_rate": 1.0732379502757717e-05, |
| "loss": 0.1334, |
| "mean_token_accuracy": 0.9623681902885437, |
| "num_tokens": 9405656.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.30379746835443, |
| "grad_norm": 0.33837878704071045, |
| "learning_rate": 1.036569707482602e-05, |
| "loss": 0.125, |
| "mean_token_accuracy": 0.9672681093215942, |
| "num_tokens": 9433155.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.3164556962025316, |
| "grad_norm": 0.3010624349117279, |
| "learning_rate": 1.0005045434141502e-05, |
| "loss": 0.1454, |
| "mean_token_accuracy": 0.9592652916908264, |
| "num_tokens": 9456467.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.329113924050633, |
| "grad_norm": 0.26326826214790344, |
| "learning_rate": 9.6504488461164e-06, |
| "loss": 0.1089, |
| "mean_token_accuracy": 0.9692077040672302, |
| "num_tokens": 9487188.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.341772151898734, |
| "grad_norm": 0.2840709686279297, |
| "learning_rate": 9.301931168766164e-06, |
| "loss": 0.1433, |
| "mean_token_accuracy": 0.9612064957618713, |
| "num_tokens": 9517721.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.3544303797468356, |
| "grad_norm": 0.3117605149745941, |
| "learning_rate": 8.959515851104117e-06, |
| "loss": 0.1452, |
| "mean_token_accuracy": 0.9629843235015869, |
| "num_tokens": 9545530.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.367088607594937, |
| "grad_norm": 0.2651097774505615, |
| "learning_rate": 8.623225931563805e-06, |
| "loss": 0.1381, |
| "mean_token_accuracy": 0.9643408060073853, |
| "num_tokens": 9576722.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.379746835443038, |
| "grad_norm": 0.326434850692749, |
| "learning_rate": 8.293084036448895e-06, |
| "loss": 0.146, |
| "mean_token_accuracy": 0.9589329957962036, |
| "num_tokens": 9600479.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3924050632911396, |
| "grad_norm": 0.28717437386512756, |
| "learning_rate": 7.96911237841088e-06, |
| "loss": 0.132, |
| "mean_token_accuracy": 0.9652442932128906, |
| "num_tokens": 9629977.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.405063291139241, |
| "grad_norm": 0.2908034026622772, |
| "learning_rate": 7.651332754954477e-06, |
| "loss": 0.1255, |
| "mean_token_accuracy": 0.967119038105011, |
| "num_tokens": 9652516.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.417721518987342, |
| "grad_norm": 0.3260648846626282, |
| "learning_rate": 7.3397665469711495e-06, |
| "loss": 0.1597, |
| "mean_token_accuracy": 0.9586137533187866, |
| "num_tokens": 9681406.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.430379746835443, |
| "grad_norm": 0.28147315979003906, |
| "learning_rate": 7.034434717300509e-06, |
| "loss": 0.1258, |
| "mean_token_accuracy": 0.9659237861633301, |
| "num_tokens": 9711667.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.443037974683544, |
| "grad_norm": 0.35376855731010437, |
| "learning_rate": 6.735357809319809e-06, |
| "loss": 0.1474, |
| "mean_token_accuracy": 0.9578174948692322, |
| "num_tokens": 9735722.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.455696202531645, |
| "grad_norm": 0.3055274784564972, |
| "learning_rate": 6.442555945561901e-06, |
| "loss": 0.1412, |
| "mean_token_accuracy": 0.9630998969078064, |
| "num_tokens": 9766897.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.468354430379747, |
| "grad_norm": 0.29014500975608826, |
| "learning_rate": 6.156048826361238e-06, |
| "loss": 0.1395, |
| "mean_token_accuracy": 0.9621520042419434, |
| "num_tokens": 9796738.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.481012658227848, |
| "grad_norm": 0.2847389280796051, |
| "learning_rate": 5.8758557285284125e-06, |
| "loss": 0.1216, |
| "mean_token_accuracy": 0.9675486087799072, |
| "num_tokens": 9831007.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.493670886075949, |
| "grad_norm": 0.37046611309051514, |
| "learning_rate": 5.6019955040531925e-06, |
| "loss": 0.1555, |
| "mean_token_accuracy": 0.958193838596344, |
| "num_tokens": 9854369.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.506329113924051, |
| "grad_norm": 0.30166560411453247, |
| "learning_rate": 5.334486578836118e-06, |
| "loss": 0.1436, |
| "mean_token_accuracy": 0.9620810151100159, |
| "num_tokens": 9881016.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.518987341772152, |
| "grad_norm": 0.3337922990322113, |
| "learning_rate": 5.073346951448699e-06, |
| "loss": 0.1313, |
| "mean_token_accuracy": 0.9661489129066467, |
| "num_tokens": 9905481.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.531645569620253, |
| "grad_norm": 0.2855200469493866, |
| "learning_rate": 4.818594191922576e-06, |
| "loss": 0.1381, |
| "mean_token_accuracy": 0.9621705412864685, |
| "num_tokens": 9933962.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.544303797468355, |
| "grad_norm": 0.2855769395828247, |
| "learning_rate": 4.5702454405672e-06, |
| "loss": 0.1284, |
| "mean_token_accuracy": 0.9656704068183899, |
| "num_tokens": 9962398.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.556962025316456, |
| "grad_norm": 0.3019951283931732, |
| "learning_rate": 4.328317406816751e-06, |
| "loss": 0.1282, |
| "mean_token_accuracy": 0.9652332067489624, |
| "num_tokens": 9988809.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.569620253164557, |
| "grad_norm": 0.336088627576828, |
| "learning_rate": 4.092826368105795e-06, |
| "loss": 0.1556, |
| "mean_token_accuracy": 0.9580214023590088, |
| "num_tokens": 10013052.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.582278481012658, |
| "grad_norm": 0.31958091259002686, |
| "learning_rate": 3.863788168774118e-06, |
| "loss": 0.1728, |
| "mean_token_accuracy": 0.9531184434890747, |
| "num_tokens": 10044173.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.594936708860759, |
| "grad_norm": 0.3252604603767395, |
| "learning_rate": 3.6412182190007082e-06, |
| "loss": 0.1478, |
| "mean_token_accuracy": 0.9624072909355164, |
| "num_tokens": 10073897.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.6075949367088604, |
| "grad_norm": 0.42186495661735535, |
| "learning_rate": 3.425131493766931e-06, |
| "loss": 0.1508, |
| "mean_token_accuracy": 0.9569892287254333, |
| "num_tokens": 10093398.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.620253164556962, |
| "grad_norm": 0.3029695451259613, |
| "learning_rate": 3.2155425318489584e-06, |
| "loss": 0.13, |
| "mean_token_accuracy": 0.9656196236610413, |
| "num_tokens": 10121414.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.632911392405063, |
| "grad_norm": 0.32184407114982605, |
| "learning_rate": 3.012465434839529e-06, |
| "loss": 0.1449, |
| "mean_token_accuracy": 0.9606809616088867, |
| "num_tokens": 10146148.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.6455696202531644, |
| "grad_norm": 0.36808857321739197, |
| "learning_rate": 2.8159138661992824e-06, |
| "loss": 0.143, |
| "mean_token_accuracy": 0.9619269967079163, |
| "num_tokens": 10172346.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.658227848101266, |
| "grad_norm": 0.3044672906398773, |
| "learning_rate": 2.6259010503373206e-06, |
| "loss": 0.129, |
| "mean_token_accuracy": 0.9652129411697388, |
| "num_tokens": 10199949.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.670886075949367, |
| "grad_norm": 0.3074134886264801, |
| "learning_rate": 2.4424397717215387e-06, |
| "loss": 0.1343, |
| "mean_token_accuracy": 0.9630903005599976, |
| "num_tokens": 10227648.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.6835443037974684, |
| "grad_norm": 0.2984522581100464, |
| "learning_rate": 2.2655423740183924e-06, |
| "loss": 0.1369, |
| "mean_token_accuracy": 0.9643847346305847, |
| "num_tokens": 10257643.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.69620253164557, |
| "grad_norm": 0.2795273959636688, |
| "learning_rate": 2.0952207592624505e-06, |
| "loss": 0.1318, |
| "mean_token_accuracy": 0.9641938805580139, |
| "num_tokens": 10289601.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.708860759493671, |
| "grad_norm": 0.31014949083328247, |
| "learning_rate": 1.9314863870555255e-06, |
| "loss": 0.1436, |
| "mean_token_accuracy": 0.9634020924568176, |
| "num_tokens": 10315978.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.7215189873417724, |
| "grad_norm": 0.32286179065704346, |
| "learning_rate": 1.7743502737957106e-06, |
| "loss": 0.1496, |
| "mean_token_accuracy": 0.9591047167778015, |
| "num_tokens": 10339052.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.734177215189874, |
| "grad_norm": 0.3142798840999603, |
| "learning_rate": 1.6238229919361858e-06, |
| "loss": 0.1329, |
| "mean_token_accuracy": 0.9642317295074463, |
| "num_tokens": 10364921.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.746835443037975, |
| "grad_norm": 0.3594357669353485, |
| "learning_rate": 1.4799146692737741e-06, |
| "loss": 0.1779, |
| "mean_token_accuracy": 0.9541767835617065, |
| "num_tokens": 10389274.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.759493670886076, |
| "grad_norm": 0.3242360055446625, |
| "learning_rate": 1.3426349882676325e-06, |
| "loss": 0.144, |
| "mean_token_accuracy": 0.9641324877738953, |
| "num_tokens": 10422432.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.772151898734177, |
| "grad_norm": 0.2857370972633362, |
| "learning_rate": 1.211993185387772e-06, |
| "loss": 0.1383, |
| "mean_token_accuracy": 0.9639822840690613, |
| "num_tokens": 10450510.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.784810126582278, |
| "grad_norm": 0.2964177131652832, |
| "learning_rate": 1.0879980504935772e-06, |
| "loss": 0.1262, |
| "mean_token_accuracy": 0.9655276536941528, |
| "num_tokens": 10480337.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.7974683544303796, |
| "grad_norm": 0.29852089285850525, |
| "learning_rate": 9.706579262424131e-07, |
| "loss": 0.1481, |
| "mean_token_accuracy": 0.9615073204040527, |
| "num_tokens": 10512485.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.810126582278481, |
| "grad_norm": 0.36380690336227417, |
| "learning_rate": 8.599807075283406e-07, |
| "loss": 0.1617, |
| "mean_token_accuracy": 0.9566697478294373, |
| "num_tokens": 10534289.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.822784810126582, |
| "grad_norm": 0.3195270895957947, |
| "learning_rate": 7.559738409508855e-07, |
| "loss": 0.1423, |
| "mean_token_accuracy": 0.960354745388031, |
| "num_tokens": 10559047.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.8354430379746836, |
| "grad_norm": 0.3309272229671478, |
| "learning_rate": 6.586443243140838e-07, |
| "loss": 0.142, |
| "mean_token_accuracy": 0.9632369875907898, |
| "num_tokens": 10584789.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.848101265822785, |
| "grad_norm": 0.33980849385261536, |
| "learning_rate": 5.679987061555703e-07, |
| "loss": 0.1221, |
| "mean_token_accuracy": 0.9658645391464233, |
| "num_tokens": 10612156.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.860759493670886, |
| "grad_norm": 0.3266946077346802, |
| "learning_rate": 4.840430853060518e-07, |
| "loss": 0.1485, |
| "mean_token_accuracy": 0.9566022753715515, |
| "num_tokens": 10634894.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8734177215189876, |
| "grad_norm": 0.2987641394138336, |
| "learning_rate": 4.0678311047890327e-07, |
| "loss": 0.1335, |
| "mean_token_accuracy": 0.9644708633422852, |
| "num_tokens": 10664089.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.886075949367089, |
| "grad_norm": 0.29495102167129517, |
| "learning_rate": 3.362239798901712e-07, |
| "loss": 0.1362, |
| "mean_token_accuracy": 0.9644386768341064, |
| "num_tokens": 10689602.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.89873417721519, |
| "grad_norm": 0.3115140497684479, |
| "learning_rate": 2.723704409087979e-07, |
| "loss": 0.1494, |
| "mean_token_accuracy": 0.9600952863693237, |
| "num_tokens": 10720314.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.911392405063291, |
| "grad_norm": 0.30226320028305054, |
| "learning_rate": 2.1522678973718847e-07, |
| "loss": 0.1272, |
| "mean_token_accuracy": 0.9658134579658508, |
| "num_tokens": 10748898.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.924050632911392, |
| "grad_norm": 0.31414154171943665, |
| "learning_rate": 1.6479687112217479e-07, |
| "loss": 0.1447, |
| "mean_token_accuracy": 0.9592844247817993, |
| "num_tokens": 10778533.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.936708860759493, |
| "grad_norm": 0.2912035584449768, |
| "learning_rate": 1.2108407809635624e-07, |
| "loss": 0.1309, |
| "mean_token_accuracy": 0.9652738571166992, |
| "num_tokens": 10805090.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.949367088607595, |
| "grad_norm": 0.2709757685661316, |
| "learning_rate": 8.40913517497377e-08, |
| "loss": 0.1277, |
| "mean_token_accuracy": 0.96564781665802, |
| "num_tokens": 10834730.0, |
| "step": 391 |
| }, |
| { |
| "epoch": 4.962025316455696, |
| "grad_norm": 0.3017437756061554, |
| "learning_rate": 5.382118103193223e-08, |
| "loss": 0.1397, |
| "mean_token_accuracy": 0.9620010256767273, |
| "num_tokens": 10862400.0, |
| "step": 392 |
| }, |
| { |
| "epoch": 4.974683544303797, |
| "grad_norm": 0.37488335371017456, |
| "learning_rate": 3.027560258465067e-08, |
| "loss": 0.1487, |
| "mean_token_accuracy": 0.9623703956604004, |
| "num_tokens": 10884840.0, |
| "step": 393 |
| }, |
| { |
| "epoch": 4.987341772151899, |
| "grad_norm": 0.2931729853153229, |
| "learning_rate": 1.345620060465569e-08, |
| "loss": 0.1334, |
| "mean_token_accuracy": 0.9638663530349731, |
| "num_tokens": 10915734.0, |
| "step": 394 |
| }, |
| { |
| "epoch": 5.0, |
| "grad_norm": 0.24923710525035858, |
| "learning_rate": 3.3641067372358612e-09, |
| "loss": 0.1168, |
| "mean_token_accuracy": 0.9699816107749939, |
| "num_tokens": 10947845.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 5.0, |
| "step": 395, |
| "total_flos": 1.1838649578050028e+18, |
| "train_loss": 0.32972808646250373, |
| "train_runtime": 2337.3269, |
| "train_samples_per_second": 10.696, |
| "train_steps_per_second": 0.169 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 395, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.1838649578050028e+18, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|