{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.0, "eval_steps": 500, "global_step": 395, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012658227848101266, "grad_norm": 1.497319221496582, "learning_rate": 0.0, "loss": 0.9641, "mean_token_accuracy": 0.8309550285339355, "num_tokens": 30618.0, "step": 1 }, { "epoch": 0.02531645569620253, "grad_norm": 1.6209511756896973, "learning_rate": 1.6666666666666667e-05, "loss": 1.0149, "mean_token_accuracy": 0.8291102051734924, "num_tokens": 57834.0, "step": 2 }, { "epoch": 0.0379746835443038, "grad_norm": 1.4961398839950562, "learning_rate": 3.3333333333333335e-05, "loss": 1.0358, "mean_token_accuracy": 0.8215629458427429, "num_tokens": 83683.0, "step": 3 }, { "epoch": 0.05063291139240506, "grad_norm": 1.0754140615463257, "learning_rate": 5e-05, "loss": 0.9624, "mean_token_accuracy": 0.8206241130828857, "num_tokens": 109319.0, "step": 4 }, { "epoch": 0.06329113924050633, "grad_norm": 1.3018057346343994, "learning_rate": 6.666666666666667e-05, "loss": 0.8462, "mean_token_accuracy": 0.831474781036377, "num_tokens": 130905.0, "step": 5 }, { "epoch": 0.0759493670886076, "grad_norm": 0.5650571584701538, "learning_rate": 8.333333333333334e-05, "loss": 0.7473, "mean_token_accuracy": 0.83799809217453, "num_tokens": 161660.0, "step": 6 }, { "epoch": 0.08860759493670886, "grad_norm": 0.6237565279006958, "learning_rate": 0.0001, "loss": 0.6972, "mean_token_accuracy": 0.8451058864593506, "num_tokens": 191893.0, "step": 7 }, { "epoch": 0.10126582278481013, "grad_norm": 0.5601367950439453, "learning_rate": 0.00011666666666666668, "loss": 0.6946, "mean_token_accuracy": 0.852936863899231, "num_tokens": 219163.0, "step": 8 }, { "epoch": 0.11392405063291139, "grad_norm": 0.42522192001342773, "learning_rate": 0.00013333333333333334, "loss": 0.6029, "mean_token_accuracy": 0.8602243661880493, "num_tokens": 249175.0, "step": 9 }, { "epoch": 0.12658227848101267, "grad_norm": 0.8065161108970642, "learning_rate": 0.00015000000000000001, "loss": 0.6507, "mean_token_accuracy": 0.8582913875579834, "num_tokens": 269887.0, "step": 10 }, { "epoch": 0.13924050632911392, "grad_norm": 0.3548448979854584, "learning_rate": 0.0001666666666666667, "loss": 0.5643, "mean_token_accuracy": 0.869491696357727, "num_tokens": 297750.0, "step": 11 }, { "epoch": 0.1518987341772152, "grad_norm": 0.43577635288238525, "learning_rate": 0.00018333333333333334, "loss": 0.623, "mean_token_accuracy": 0.8579869866371155, "num_tokens": 323030.0, "step": 12 }, { "epoch": 0.16455696202531644, "grad_norm": 0.34569233655929565, "learning_rate": 0.0002, "loss": 0.5558, "mean_token_accuracy": 0.8676020503044128, "num_tokens": 353170.0, "step": 13 }, { "epoch": 0.17721518987341772, "grad_norm": 0.2973344624042511, "learning_rate": 0.0001999966358932628, "loss": 0.5502, "mean_token_accuracy": 0.8723801970481873, "num_tokens": 381576.0, "step": 14 }, { "epoch": 0.189873417721519, "grad_norm": 0.6846588850021362, "learning_rate": 0.00019998654379939533, "loss": 0.5728, "mean_token_accuracy": 0.8665502667427063, "num_tokens": 409703.0, "step": 15 }, { "epoch": 0.20253164556962025, "grad_norm": 0.29646769165992737, "learning_rate": 0.00019996972439741538, "loss": 0.5858, "mean_token_accuracy": 0.865411102771759, "num_tokens": 438811.0, "step": 16 }, { "epoch": 0.21518987341772153, "grad_norm": 0.288542777299881, "learning_rate": 0.0001999461788189681, "loss": 0.5725, "mean_token_accuracy": 0.866082489490509, "num_tokens": 468774.0, "step": 17 }, { "epoch": 0.22784810126582278, "grad_norm": 0.2656330466270447, "learning_rate": 0.00019991590864825028, "loss": 0.5151, "mean_token_accuracy": 0.8826677799224854, "num_tokens": 492753.0, "step": 18 }, { "epoch": 0.24050632911392406, "grad_norm": 0.27023324370384216, "learning_rate": 0.00019987891592190366, "loss": 0.5078, "mean_token_accuracy": 0.8805520534515381, "num_tokens": 523031.0, "step": 19 }, { "epoch": 0.25316455696202533, "grad_norm": 0.25212258100509644, "learning_rate": 0.00019983520312887785, "loss": 0.5289, "mean_token_accuracy": 0.8810333013534546, "num_tokens": 552515.0, "step": 20 }, { "epoch": 0.26582278481012656, "grad_norm": 0.24047309160232544, "learning_rate": 0.00019978477321026282, "loss": 0.5344, "mean_token_accuracy": 0.8764937520027161, "num_tokens": 583290.0, "step": 21 }, { "epoch": 0.27848101265822783, "grad_norm": 0.27291324734687805, "learning_rate": 0.0001997276295590912, "loss": 0.4812, "mean_token_accuracy": 0.8868094682693481, "num_tokens": 603285.0, "step": 22 }, { "epoch": 0.2911392405063291, "grad_norm": 0.23373258113861084, "learning_rate": 0.00019966377602010984, "loss": 0.5465, "mean_token_accuracy": 0.8753286004066467, "num_tokens": 637583.0, "step": 23 }, { "epoch": 0.3037974683544304, "grad_norm": 0.23137561976909637, "learning_rate": 0.0001995932168895211, "loss": 0.5222, "mean_token_accuracy": 0.8756207823753357, "num_tokens": 668657.0, "step": 24 }, { "epoch": 0.31645569620253167, "grad_norm": 0.24308426678180695, "learning_rate": 0.00019951595691469396, "loss": 0.5396, "mean_token_accuracy": 0.8727737069129944, "num_tokens": 695335.0, "step": 25 }, { "epoch": 0.3291139240506329, "grad_norm": 0.22916540503501892, "learning_rate": 0.00019943200129384444, "loss": 0.5382, "mean_token_accuracy": 0.8756353855133057, "num_tokens": 723727.0, "step": 26 }, { "epoch": 0.34177215189873417, "grad_norm": 0.24699705839157104, "learning_rate": 0.0001993413556756859, "loss": 0.476, "mean_token_accuracy": 0.8846983313560486, "num_tokens": 751154.0, "step": 27 }, { "epoch": 0.35443037974683544, "grad_norm": 0.21457427740097046, "learning_rate": 0.0001992440261590491, "loss": 0.5159, "mean_token_accuracy": 0.8788135647773743, "num_tokens": 783078.0, "step": 28 }, { "epoch": 0.3670886075949367, "grad_norm": 0.2982902526855469, "learning_rate": 0.00019914001929247167, "loss": 0.5296, "mean_token_accuracy": 0.8727933168411255, "num_tokens": 802685.0, "step": 29 }, { "epoch": 0.379746835443038, "grad_norm": 0.2390463650226593, "learning_rate": 0.0001990293420737576, "loss": 0.5509, "mean_token_accuracy": 0.8691502213478088, "num_tokens": 826425.0, "step": 30 }, { "epoch": 0.3924050632911392, "grad_norm": 0.2494283765554428, "learning_rate": 0.00019891200194950643, "loss": 0.5748, "mean_token_accuracy": 0.8628107905387878, "num_tokens": 851265.0, "step": 31 }, { "epoch": 0.4050632911392405, "grad_norm": 0.23986820876598358, "learning_rate": 0.00019878800681461222, "loss": 0.5099, "mean_token_accuracy": 0.8775585889816284, "num_tokens": 878297.0, "step": 32 }, { "epoch": 0.4177215189873418, "grad_norm": 0.24641895294189453, "learning_rate": 0.00019865736501173238, "loss": 0.473, "mean_token_accuracy": 0.8891056180000305, "num_tokens": 899381.0, "step": 33 }, { "epoch": 0.43037974683544306, "grad_norm": 0.20981378853321075, "learning_rate": 0.00019852008533072625, "loss": 0.5352, "mean_token_accuracy": 0.8746247887611389, "num_tokens": 930759.0, "step": 34 }, { "epoch": 0.4430379746835443, "grad_norm": 0.23973393440246582, "learning_rate": 0.00019837617700806383, "loss": 0.5283, "mean_token_accuracy": 0.874847948551178, "num_tokens": 957135.0, "step": 35 }, { "epoch": 0.45569620253164556, "grad_norm": 0.2420441061258316, "learning_rate": 0.00019822564972620427, "loss": 0.5032, "mean_token_accuracy": 0.8739088773727417, "num_tokens": 981142.0, "step": 36 }, { "epoch": 0.46835443037974683, "grad_norm": 0.2016650289297104, "learning_rate": 0.0001980685136129445, "loss": 0.5553, "mean_token_accuracy": 0.8701525330543518, "num_tokens": 1009855.0, "step": 37 }, { "epoch": 0.4810126582278481, "grad_norm": 0.213796928524971, "learning_rate": 0.00019790477924073755, "loss": 0.562, "mean_token_accuracy": 0.8700422048568726, "num_tokens": 1035989.0, "step": 38 }, { "epoch": 0.4936708860759494, "grad_norm": 0.22555865347385406, "learning_rate": 0.00019773445762598163, "loss": 0.487, "mean_token_accuracy": 0.8849612474441528, "num_tokens": 1063409.0, "step": 39 }, { "epoch": 0.5063291139240507, "grad_norm": 0.2065822184085846, "learning_rate": 0.00019755756022827846, "loss": 0.542, "mean_token_accuracy": 0.8749595880508423, "num_tokens": 1094423.0, "step": 40 }, { "epoch": 0.5189873417721519, "grad_norm": 0.22671450674533844, "learning_rate": 0.00019737409894966267, "loss": 0.5801, "mean_token_accuracy": 0.868348240852356, "num_tokens": 1119067.0, "step": 41 }, { "epoch": 0.5316455696202531, "grad_norm": 0.20396192371845245, "learning_rate": 0.00019718408613380074, "loss": 0.508, "mean_token_accuracy": 0.8748582601547241, "num_tokens": 1147347.0, "step": 42 }, { "epoch": 0.5443037974683544, "grad_norm": 0.20259220898151398, "learning_rate": 0.00019698753456516048, "loss": 0.4897, "mean_token_accuracy": 0.8824638724327087, "num_tokens": 1174458.0, "step": 43 }, { "epoch": 0.5569620253164557, "grad_norm": 0.2087836116552353, "learning_rate": 0.00019678445746815107, "loss": 0.4807, "mean_token_accuracy": 0.8824238777160645, "num_tokens": 1202708.0, "step": 44 }, { "epoch": 0.569620253164557, "grad_norm": 0.1992674618959427, "learning_rate": 0.00019657486850623306, "loss": 0.4824, "mean_token_accuracy": 0.8790597915649414, "num_tokens": 1226511.0, "step": 45 }, { "epoch": 0.5822784810126582, "grad_norm": 0.1843205988407135, "learning_rate": 0.00019635878178099928, "loss": 0.4737, "mean_token_accuracy": 0.8844873905181885, "num_tokens": 1254823.0, "step": 46 }, { "epoch": 0.5949367088607594, "grad_norm": 0.21726590394973755, "learning_rate": 0.0001961362118312259, "loss": 0.5116, "mean_token_accuracy": 0.8761377334594727, "num_tokens": 1280157.0, "step": 47 }, { "epoch": 0.6075949367088608, "grad_norm": 0.18547309935092926, "learning_rate": 0.0001959071736318942, "loss": 0.5088, "mean_token_accuracy": 0.877997636795044, "num_tokens": 1311204.0, "step": 48 }, { "epoch": 0.620253164556962, "grad_norm": 0.17424975335597992, "learning_rate": 0.00019567168259318325, "loss": 0.4827, "mean_token_accuracy": 0.8858836889266968, "num_tokens": 1338924.0, "step": 49 }, { "epoch": 0.6329113924050633, "grad_norm": 0.2047286480665207, "learning_rate": 0.00019542975455943281, "loss": 0.5123, "mean_token_accuracy": 0.8828940987586975, "num_tokens": 1364640.0, "step": 50 }, { "epoch": 0.6455696202531646, "grad_norm": 0.2273840606212616, "learning_rate": 0.00019518140580807744, "loss": 0.5769, "mean_token_accuracy": 0.8684936165809631, "num_tokens": 1386817.0, "step": 51 }, { "epoch": 0.6582278481012658, "grad_norm": 0.19929328560829163, "learning_rate": 0.00019492665304855132, "loss": 0.5269, "mean_token_accuracy": 0.8812709450721741, "num_tokens": 1417598.0, "step": 52 }, { "epoch": 0.6708860759493671, "grad_norm": 0.18103498220443726, "learning_rate": 0.0001946655134211639, "loss": 0.5201, "mean_token_accuracy": 0.8795331120491028, "num_tokens": 1452103.0, "step": 53 }, { "epoch": 0.6835443037974683, "grad_norm": 0.20823192596435547, "learning_rate": 0.0001943980044959468, "loss": 0.4376, "mean_token_accuracy": 0.8970240354537964, "num_tokens": 1476260.0, "step": 54 }, { "epoch": 0.6962025316455697, "grad_norm": 0.2124900221824646, "learning_rate": 0.0001941241442714716, "loss": 0.4992, "mean_token_accuracy": 0.8834120035171509, "num_tokens": 1505761.0, "step": 55 }, { "epoch": 0.7088607594936709, "grad_norm": 0.19194459915161133, "learning_rate": 0.0001938439511736388, "loss": 0.5092, "mean_token_accuracy": 0.8822512626647949, "num_tokens": 1535906.0, "step": 56 }, { "epoch": 0.7215189873417721, "grad_norm": 0.1868598908185959, "learning_rate": 0.0001935574440544381, "loss": 0.5125, "mean_token_accuracy": 0.8755715489387512, "num_tokens": 1569652.0, "step": 57 }, { "epoch": 0.7341772151898734, "grad_norm": 0.21098805963993073, "learning_rate": 0.0001932646421906802, "loss": 0.5394, "mean_token_accuracy": 0.8751370906829834, "num_tokens": 1596153.0, "step": 58 }, { "epoch": 0.7468354430379747, "grad_norm": 0.2013338804244995, "learning_rate": 0.00019296556528269952, "loss": 0.5081, "mean_token_accuracy": 0.8786186575889587, "num_tokens": 1624508.0, "step": 59 }, { "epoch": 0.759493670886076, "grad_norm": 0.20497922599315643, "learning_rate": 0.00019266023345302887, "loss": 0.4502, "mean_token_accuracy": 0.8902367353439331, "num_tokens": 1653507.0, "step": 60 }, { "epoch": 0.7721518987341772, "grad_norm": 0.21349601447582245, "learning_rate": 0.00019234866724504555, "loss": 0.5481, "mean_token_accuracy": 0.8724722266197205, "num_tokens": 1682796.0, "step": 61 }, { "epoch": 0.7848101265822784, "grad_norm": 0.2057465761899948, "learning_rate": 0.00019203088762158915, "loss": 0.5103, "mean_token_accuracy": 0.8791164755821228, "num_tokens": 1710159.0, "step": 62 }, { "epoch": 0.7974683544303798, "grad_norm": 0.20737606287002563, "learning_rate": 0.00019170691596355114, "loss": 0.5126, "mean_token_accuracy": 0.8805774450302124, "num_tokens": 1739246.0, "step": 63 }, { "epoch": 0.810126582278481, "grad_norm": 0.1765468269586563, "learning_rate": 0.00019137677406843619, "loss": 0.4658, "mean_token_accuracy": 0.8891183733940125, "num_tokens": 1770785.0, "step": 64 }, { "epoch": 0.8227848101265823, "grad_norm": 0.18958942592144012, "learning_rate": 0.00019104048414889587, "loss": 0.4893, "mean_token_accuracy": 0.8855167031288147, "num_tokens": 1800635.0, "step": 65 }, { "epoch": 0.8354430379746836, "grad_norm": 0.19879435002803802, "learning_rate": 0.00019069806883123387, "loss": 0.4883, "mean_token_accuracy": 0.8844217658042908, "num_tokens": 1829104.0, "step": 66 }, { "epoch": 0.8481012658227848, "grad_norm": 0.19173026084899902, "learning_rate": 0.00019034955115388363, "loss": 0.549, "mean_token_accuracy": 0.8704302906990051, "num_tokens": 1858519.0, "step": 67 }, { "epoch": 0.8607594936708861, "grad_norm": 0.19198986887931824, "learning_rate": 0.00018999495456585854, "loss": 0.4972, "mean_token_accuracy": 0.8800837993621826, "num_tokens": 1882458.0, "step": 68 }, { "epoch": 0.8734177215189873, "grad_norm": 0.17567826807498932, "learning_rate": 0.00018963430292517398, "loss": 0.4852, "mean_token_accuracy": 0.8849237561225891, "num_tokens": 1914075.0, "step": 69 }, { "epoch": 0.8860759493670886, "grad_norm": 0.20886963605880737, "learning_rate": 0.00018926762049724228, "loss": 0.5113, "mean_token_accuracy": 0.8759188652038574, "num_tokens": 1941347.0, "step": 70 }, { "epoch": 0.8987341772151899, "grad_norm": 0.2045935094356537, "learning_rate": 0.00018889493195323997, "loss": 0.5075, "mean_token_accuracy": 0.8776924014091492, "num_tokens": 1969128.0, "step": 71 }, { "epoch": 0.9113924050632911, "grad_norm": 0.19722214341163635, "learning_rate": 0.00018851626236844786, "loss": 0.5154, "mean_token_accuracy": 0.8768007159233093, "num_tokens": 1995848.0, "step": 72 }, { "epoch": 0.9240506329113924, "grad_norm": 0.21611221134662628, "learning_rate": 0.00018813163722056396, "loss": 0.4651, "mean_token_accuracy": 0.8872132897377014, "num_tokens": 2021243.0, "step": 73 }, { "epoch": 0.9367088607594937, "grad_norm": 0.2026682049036026, "learning_rate": 0.0001877410823879893, "loss": 0.4772, "mean_token_accuracy": 0.8879674077033997, "num_tokens": 2048558.0, "step": 74 }, { "epoch": 0.9493670886075949, "grad_norm": 0.21699966490268707, "learning_rate": 0.0001873446241480868, "loss": 0.5288, "mean_token_accuracy": 0.8744093179702759, "num_tokens": 2078250.0, "step": 75 }, { "epoch": 0.9620253164556962, "grad_norm": 0.20321376621723175, "learning_rate": 0.00018694228917541313, "loss": 0.5249, "mean_token_accuracy": 0.8785193562507629, "num_tokens": 2107652.0, "step": 76 }, { "epoch": 0.9746835443037974, "grad_norm": 0.23255208134651184, "learning_rate": 0.00018653410453992413, "loss": 0.5065, "mean_token_accuracy": 0.8786671757698059, "num_tokens": 2134576.0, "step": 77 }, { "epoch": 0.9873417721518988, "grad_norm": 0.19896215200424194, "learning_rate": 0.0001861200977051535, "loss": 0.4681, "mean_token_accuracy": 0.8856458067893982, "num_tokens": 2162186.0, "step": 78 }, { "epoch": 1.0, "grad_norm": 0.19284109771251678, "learning_rate": 0.0001857002965263648, "loss": 0.4793, "mean_token_accuracy": 0.8867379426956177, "num_tokens": 2191333.0, "step": 79 }, { "epoch": 1.0126582278481013, "grad_norm": 0.19497530162334442, "learning_rate": 0.00018527472924867756, "loss": 0.4209, "mean_token_accuracy": 0.8986303210258484, "num_tokens": 2218703.0, "step": 80 }, { "epoch": 1.0253164556962024, "grad_norm": 0.21513301134109497, "learning_rate": 0.00018484342450516671, "loss": 0.5105, "mean_token_accuracy": 0.8765804767608643, "num_tokens": 2239963.0, "step": 81 }, { "epoch": 1.0379746835443038, "grad_norm": 0.1873137354850769, "learning_rate": 0.0001844064113149361, "loss": 0.4353, "mean_token_accuracy": 0.8936419486999512, "num_tokens": 2267331.0, "step": 82 }, { "epoch": 1.0506329113924051, "grad_norm": 0.22090038657188416, "learning_rate": 0.0001839637190811661, "loss": 0.4297, "mean_token_accuracy": 0.8943843245506287, "num_tokens": 2296955.0, "step": 83 }, { "epoch": 1.0632911392405062, "grad_norm": 0.2521970570087433, "learning_rate": 0.00018351537758913518, "loss": 0.4325, "mean_token_accuracy": 0.8930135369300842, "num_tokens": 2321452.0, "step": 84 }, { "epoch": 1.0759493670886076, "grad_norm": 0.21923896670341492, "learning_rate": 0.00018306141700421606, "loss": 0.4213, "mean_token_accuracy": 0.8969642519950867, "num_tokens": 2350603.0, "step": 85 }, { "epoch": 1.0886075949367089, "grad_norm": 0.22946420311927795, "learning_rate": 0.000182601867869846, "loss": 0.4009, "mean_token_accuracy": 0.8988001942634583, "num_tokens": 2374254.0, "step": 86 }, { "epoch": 1.1012658227848102, "grad_norm": 0.20290835201740265, "learning_rate": 0.00018213676110547176, "loss": 0.4228, "mean_token_accuracy": 0.8960235118865967, "num_tokens": 2406633.0, "step": 87 }, { "epoch": 1.1139240506329113, "grad_norm": 0.1907222718000412, "learning_rate": 0.0001816661280044693, "loss": 0.4115, "mean_token_accuracy": 0.9003381729125977, "num_tokens": 2437451.0, "step": 88 }, { "epoch": 1.1265822784810127, "grad_norm": 0.20857387781143188, "learning_rate": 0.00018119000023203837, "loss": 0.4526, "mean_token_accuracy": 0.8939969539642334, "num_tokens": 2470165.0, "step": 89 }, { "epoch": 1.139240506329114, "grad_norm": 0.2178468257188797, "learning_rate": 0.0001807084098230719, "loss": 0.4361, "mean_token_accuracy": 0.892597496509552, "num_tokens": 2496774.0, "step": 90 }, { "epoch": 1.1518987341772151, "grad_norm": 0.1978338062763214, "learning_rate": 0.0001802213891800007, "loss": 0.4079, "mean_token_accuracy": 0.89795982837677, "num_tokens": 2527620.0, "step": 91 }, { "epoch": 1.1645569620253164, "grad_norm": 0.23382915556430817, "learning_rate": 0.00017972897107061328, "loss": 0.4385, "mean_token_accuracy": 0.8920117616653442, "num_tokens": 2551131.0, "step": 92 }, { "epoch": 1.1772151898734178, "grad_norm": 0.24582549929618835, "learning_rate": 0.00017923118862585123, "loss": 0.4494, "mean_token_accuracy": 0.892306387424469, "num_tokens": 2574604.0, "step": 93 }, { "epoch": 1.189873417721519, "grad_norm": 0.21195554733276367, "learning_rate": 0.00017872807533758007, "loss": 0.4428, "mean_token_accuracy": 0.8914760947227478, "num_tokens": 2605675.0, "step": 94 }, { "epoch": 1.2025316455696202, "grad_norm": 0.2021542638540268, "learning_rate": 0.00017821966505633587, "loss": 0.4294, "mean_token_accuracy": 0.8925318121910095, "num_tokens": 2633403.0, "step": 95 }, { "epoch": 1.2151898734177216, "grad_norm": 0.19734586775302887, "learning_rate": 0.00017770599198904763, "loss": 0.4105, "mean_token_accuracy": 0.8953525424003601, "num_tokens": 2664753.0, "step": 96 }, { "epoch": 1.2278481012658227, "grad_norm": 0.19101551175117493, "learning_rate": 0.00017718709069673594, "loss": 0.4008, "mean_token_accuracy": 0.9017804861068726, "num_tokens": 2695707.0, "step": 97 }, { "epoch": 1.240506329113924, "grad_norm": 0.22164419293403625, "learning_rate": 0.00017666299609218745, "loss": 0.4233, "mean_token_accuracy": 0.8975086212158203, "num_tokens": 2721861.0, "step": 98 }, { "epoch": 1.2531645569620253, "grad_norm": 0.21174238622188568, "learning_rate": 0.00017613374343760594, "loss": 0.4644, "mean_token_accuracy": 0.8886749744415283, "num_tokens": 2749457.0, "step": 99 }, { "epoch": 1.2658227848101267, "grad_norm": 0.22876623272895813, "learning_rate": 0.00017559936834223982, "loss": 0.4407, "mean_token_accuracy": 0.8907697200775146, "num_tokens": 2773269.0, "step": 100 }, { "epoch": 1.2784810126582278, "grad_norm": 0.19537781178951263, "learning_rate": 0.0001750599067599863, "loss": 0.3998, "mean_token_accuracy": 0.9017773866653442, "num_tokens": 2800170.0, "step": 101 }, { "epoch": 1.2911392405063291, "grad_norm": 0.21778103709220886, "learning_rate": 0.00017451539498697225, "loss": 0.3569, "mean_token_accuracy": 0.9102327227592468, "num_tokens": 2824597.0, "step": 102 }, { "epoch": 1.3037974683544304, "grad_norm": 0.21380816400051117, "learning_rate": 0.0001739658696591121, "loss": 0.4263, "mean_token_accuracy": 0.8967190980911255, "num_tokens": 2855354.0, "step": 103 }, { "epoch": 1.3164556962025316, "grad_norm": 0.21955636143684387, "learning_rate": 0.00017341136774964307, "loss": 0.4062, "mean_token_accuracy": 0.8979187607765198, "num_tokens": 2881652.0, "step": 104 }, { "epoch": 1.3291139240506329, "grad_norm": 0.2105690985918045, "learning_rate": 0.0001728519265666373, "loss": 0.4, "mean_token_accuracy": 0.8993932008743286, "num_tokens": 2909567.0, "step": 105 }, { "epoch": 1.3417721518987342, "grad_norm": 0.20753523707389832, "learning_rate": 0.00017228758375049185, "loss": 0.4455, "mean_token_accuracy": 0.8925303220748901, "num_tokens": 2933889.0, "step": 106 }, { "epoch": 1.3544303797468356, "grad_norm": 0.2187478095293045, "learning_rate": 0.00017171837727139613, "loss": 0.4434, "mean_token_accuracy": 0.8895025849342346, "num_tokens": 2962017.0, "step": 107 }, { "epoch": 1.3670886075949367, "grad_norm": 0.22173349559307098, "learning_rate": 0.0001711443454267772, "loss": 0.4333, "mean_token_accuracy": 0.8912394046783447, "num_tokens": 2991862.0, "step": 108 }, { "epoch": 1.379746835443038, "grad_norm": 0.22389379143714905, "learning_rate": 0.00017056552683872292, "loss": 0.4185, "mean_token_accuracy": 0.8991497755050659, "num_tokens": 3017449.0, "step": 109 }, { "epoch": 1.3924050632911391, "grad_norm": 0.270313024520874, "learning_rate": 0.00016998196045138353, "loss": 0.4902, "mean_token_accuracy": 0.8868701457977295, "num_tokens": 3041070.0, "step": 110 }, { "epoch": 1.4050632911392404, "grad_norm": 0.20855283737182617, "learning_rate": 0.00016939368552835137, "loss": 0.3887, "mean_token_accuracy": 0.9015379548072815, "num_tokens": 3070069.0, "step": 111 }, { "epoch": 1.4177215189873418, "grad_norm": 0.20110635459423065, "learning_rate": 0.00016880074165001905, "loss": 0.4372, "mean_token_accuracy": 0.8943763971328735, "num_tokens": 3099047.0, "step": 112 }, { "epoch": 1.4303797468354431, "grad_norm": 0.21372906863689423, "learning_rate": 0.0001682031687109165, "loss": 0.42, "mean_token_accuracy": 0.8982757925987244, "num_tokens": 3125732.0, "step": 113 }, { "epoch": 1.4430379746835442, "grad_norm": 0.20921871066093445, "learning_rate": 0.00016760100691702674, "loss": 0.4196, "mean_token_accuracy": 0.8972339034080505, "num_tokens": 3154862.0, "step": 114 }, { "epoch": 1.4556962025316456, "grad_norm": 0.1881207674741745, "learning_rate": 0.0001669942967830807, "loss": 0.4093, "mean_token_accuracy": 0.9019440412521362, "num_tokens": 3184195.0, "step": 115 }, { "epoch": 1.4683544303797469, "grad_norm": 0.213323712348938, "learning_rate": 0.00016638307912983136, "loss": 0.4138, "mean_token_accuracy": 0.9011819362640381, "num_tokens": 3211248.0, "step": 116 }, { "epoch": 1.481012658227848, "grad_norm": 0.20287197828292847, "learning_rate": 0.00016576739508130726, "loss": 0.3756, "mean_token_accuracy": 0.9048148393630981, "num_tokens": 3239205.0, "step": 117 }, { "epoch": 1.4936708860759493, "grad_norm": 0.20273637771606445, "learning_rate": 0.0001651472860620455, "loss": 0.3689, "mean_token_accuracy": 0.9055525660514832, "num_tokens": 3266914.0, "step": 118 }, { "epoch": 1.5063291139240507, "grad_norm": 0.19134242832660675, "learning_rate": 0.00016452279379430463, "loss": 0.4183, "mean_token_accuracy": 0.897467851638794, "num_tokens": 3296676.0, "step": 119 }, { "epoch": 1.518987341772152, "grad_norm": 0.18769560754299164, "learning_rate": 0.00016389396029525762, "loss": 0.4204, "mean_token_accuracy": 0.8977954983711243, "num_tokens": 3325046.0, "step": 120 }, { "epoch": 1.5316455696202531, "grad_norm": 0.20102067291736603, "learning_rate": 0.0001632608278741646, "loss": 0.4496, "mean_token_accuracy": 0.8929321765899658, "num_tokens": 3354624.0, "step": 121 }, { "epoch": 1.5443037974683544, "grad_norm": 0.1878257691860199, "learning_rate": 0.00016262343912952656, "loss": 0.3981, "mean_token_accuracy": 0.8984882831573486, "num_tokens": 3383000.0, "step": 122 }, { "epoch": 1.5569620253164556, "grad_norm": 0.20456744730472565, "learning_rate": 0.0001619818369462188, "loss": 0.4161, "mean_token_accuracy": 0.8959950804710388, "num_tokens": 3410630.0, "step": 123 }, { "epoch": 1.5696202531645569, "grad_norm": 0.2185913473367691, "learning_rate": 0.0001613360644926059, "loss": 0.4096, "mean_token_accuracy": 0.9008986949920654, "num_tokens": 3435063.0, "step": 124 }, { "epoch": 1.5822784810126582, "grad_norm": 0.2265142947435379, "learning_rate": 0.00016068616521763707, "loss": 0.4471, "mean_token_accuracy": 0.8928737640380859, "num_tokens": 3460947.0, "step": 125 }, { "epoch": 1.5949367088607596, "grad_norm": 0.19072851538658142, "learning_rate": 0.00016003218284792298, "loss": 0.3973, "mean_token_accuracy": 0.90379399061203, "num_tokens": 3490136.0, "step": 126 }, { "epoch": 1.6075949367088609, "grad_norm": 0.23255592584609985, "learning_rate": 0.00015937416138479344, "loss": 0.399, "mean_token_accuracy": 0.8998273015022278, "num_tokens": 3516255.0, "step": 127 }, { "epoch": 1.620253164556962, "grad_norm": 0.2036372721195221, "learning_rate": 0.0001587121451013373, "loss": 0.3952, "mean_token_accuracy": 0.8992496728897095, "num_tokens": 3548438.0, "step": 128 }, { "epoch": 1.6329113924050633, "grad_norm": 0.23039649426937103, "learning_rate": 0.0001580461785394233, "loss": 0.4062, "mean_token_accuracy": 0.8986396789550781, "num_tokens": 3579451.0, "step": 129 }, { "epoch": 1.6455696202531644, "grad_norm": 0.20787346363067627, "learning_rate": 0.00015737630650670335, "loss": 0.4023, "mean_token_accuracy": 0.899288535118103, "num_tokens": 3610296.0, "step": 130 }, { "epoch": 1.6582278481012658, "grad_norm": 0.23658980429172516, "learning_rate": 0.00015670257407359792, "loss": 0.446, "mean_token_accuracy": 0.8890199661254883, "num_tokens": 3638329.0, "step": 131 }, { "epoch": 1.6708860759493671, "grad_norm": 0.191447913646698, "learning_rate": 0.00015602502657026328, "loss": 0.4013, "mean_token_accuracy": 0.9007358551025391, "num_tokens": 3671960.0, "step": 132 }, { "epoch": 1.6835443037974684, "grad_norm": 0.22027570009231567, "learning_rate": 0.00015534370958354186, "loss": 0.4291, "mean_token_accuracy": 0.8947672247886658, "num_tokens": 3698033.0, "step": 133 }, { "epoch": 1.6962025316455698, "grad_norm": 0.2189820110797882, "learning_rate": 0.00015465866895389495, "loss": 0.4787, "mean_token_accuracy": 0.8886910080909729, "num_tokens": 3725049.0, "step": 134 }, { "epoch": 1.7088607594936709, "grad_norm": 0.22296729683876038, "learning_rate": 0.00015396995077231854, "loss": 0.4155, "mean_token_accuracy": 0.897777259349823, "num_tokens": 3751477.0, "step": 135 }, { "epoch": 1.721518987341772, "grad_norm": 0.1950179785490036, "learning_rate": 0.00015327760137724212, "loss": 0.425, "mean_token_accuracy": 0.8947750926017761, "num_tokens": 3783178.0, "step": 136 }, { "epoch": 1.7341772151898733, "grad_norm": 0.2167259156703949, "learning_rate": 0.00015258166735141092, "loss": 0.4632, "mean_token_accuracy": 0.8899510502815247, "num_tokens": 3812847.0, "step": 137 }, { "epoch": 1.7468354430379747, "grad_norm": 0.23227916657924652, "learning_rate": 0.0001518821955187519, "loss": 0.4228, "mean_token_accuracy": 0.8922276496887207, "num_tokens": 3837704.0, "step": 138 }, { "epoch": 1.759493670886076, "grad_norm": 0.20364798605442047, "learning_rate": 0.00015117923294122312, "loss": 0.4357, "mean_token_accuracy": 0.8921459913253784, "num_tokens": 3870312.0, "step": 139 }, { "epoch": 1.7721518987341773, "grad_norm": 0.22296567261219025, "learning_rate": 0.0001504728269156475, "loss": 0.4091, "mean_token_accuracy": 0.9001960754394531, "num_tokens": 3896387.0, "step": 140 }, { "epoch": 1.7848101265822784, "grad_norm": 0.23284538090229034, "learning_rate": 0.00014976302497053036, "loss": 0.4685, "mean_token_accuracy": 0.8888003826141357, "num_tokens": 3922809.0, "step": 141 }, { "epoch": 1.7974683544303798, "grad_norm": 0.20585279166698456, "learning_rate": 0.00014904987486286184, "loss": 0.4155, "mean_token_accuracy": 0.8993297219276428, "num_tokens": 3954799.0, "step": 142 }, { "epoch": 1.810126582278481, "grad_norm": 0.2125055342912674, "learning_rate": 0.00014833342457490361, "loss": 0.424, "mean_token_accuracy": 0.8967812061309814, "num_tokens": 3985216.0, "step": 143 }, { "epoch": 1.8227848101265822, "grad_norm": 0.22574758529663086, "learning_rate": 0.00014761372231096047, "loss": 0.4477, "mean_token_accuracy": 0.8949366807937622, "num_tokens": 4008190.0, "step": 144 }, { "epoch": 1.8354430379746836, "grad_norm": 0.21060273051261902, "learning_rate": 0.00014689081649413708, "loss": 0.4216, "mean_token_accuracy": 0.8979432582855225, "num_tokens": 4033877.0, "step": 145 }, { "epoch": 1.8481012658227849, "grad_norm": 0.22009049355983734, "learning_rate": 0.00014616475576308005, "loss": 0.4303, "mean_token_accuracy": 0.894666314125061, "num_tokens": 4058558.0, "step": 146 }, { "epoch": 1.8607594936708862, "grad_norm": 0.2193581908941269, "learning_rate": 0.00014543558896870531, "loss": 0.4647, "mean_token_accuracy": 0.8923094868659973, "num_tokens": 4084446.0, "step": 147 }, { "epoch": 1.8734177215189873, "grad_norm": 0.218804270029068, "learning_rate": 0.0001447033651709114, "loss": 0.425, "mean_token_accuracy": 0.8992093801498413, "num_tokens": 4108669.0, "step": 148 }, { "epoch": 1.8860759493670884, "grad_norm": 0.1919749528169632, "learning_rate": 0.0001439681336352785, "loss": 0.4495, "mean_token_accuracy": 0.891620934009552, "num_tokens": 4146434.0, "step": 149 }, { "epoch": 1.8987341772151898, "grad_norm": 0.19265611469745636, "learning_rate": 0.00014322994382975386, "loss": 0.3672, "mean_token_accuracy": 0.9077484607696533, "num_tokens": 4176633.0, "step": 150 }, { "epoch": 1.9113924050632911, "grad_norm": 0.2111128568649292, "learning_rate": 0.0001424888454213235, "loss": 0.4511, "mean_token_accuracy": 0.889907956123352, "num_tokens": 4205046.0, "step": 151 }, { "epoch": 1.9240506329113924, "grad_norm": 0.22748497128486633, "learning_rate": 0.0001417448882726703, "loss": 0.3854, "mean_token_accuracy": 0.90329909324646, "num_tokens": 4230208.0, "step": 152 }, { "epoch": 1.9367088607594938, "grad_norm": 0.23460358381271362, "learning_rate": 0.00014099812243881948, "loss": 0.4264, "mean_token_accuracy": 0.8937097787857056, "num_tokens": 4254357.0, "step": 153 }, { "epoch": 1.9493670886075949, "grad_norm": 0.2445940524339676, "learning_rate": 0.00014024859816377046, "loss": 0.4507, "mean_token_accuracy": 0.8903029561042786, "num_tokens": 4278779.0, "step": 154 }, { "epoch": 1.9620253164556962, "grad_norm": 0.2431238889694214, "learning_rate": 0.00013949636587711644, "loss": 0.4341, "mean_token_accuracy": 0.89263516664505, "num_tokens": 4303460.0, "step": 155 }, { "epoch": 1.9746835443037973, "grad_norm": 0.22417189180850983, "learning_rate": 0.0001387414761906516, "loss": 0.4369, "mean_token_accuracy": 0.893901526927948, "num_tokens": 4330744.0, "step": 156 }, { "epoch": 1.9873417721518987, "grad_norm": 0.24654226005077362, "learning_rate": 0.00013798397989496549, "loss": 0.4348, "mean_token_accuracy": 0.8898520469665527, "num_tokens": 4354803.0, "step": 157 }, { "epoch": 2.0, "grad_norm": 0.21234261989593506, "learning_rate": 0.00013722392795602594, "loss": 0.3543, "mean_token_accuracy": 0.9114936590194702, "num_tokens": 4380368.0, "step": 158 }, { "epoch": 2.0126582278481013, "grad_norm": 0.27655863761901855, "learning_rate": 0.0001364613715117499, "loss": 0.3225, "mean_token_accuracy": 0.918269693851471, "num_tokens": 4400290.0, "step": 159 }, { "epoch": 2.0253164556962027, "grad_norm": 0.2500605583190918, "learning_rate": 0.00013569636186856288, "loss": 0.3184, "mean_token_accuracy": 0.9159533381462097, "num_tokens": 4424186.0, "step": 160 }, { "epoch": 2.037974683544304, "grad_norm": 0.23898674547672272, "learning_rate": 0.0001349289504979467, "loss": 0.312, "mean_token_accuracy": 0.9217621088027954, "num_tokens": 4447359.0, "step": 161 }, { "epoch": 2.050632911392405, "grad_norm": 0.26260843873023987, "learning_rate": 0.0001341591890329766, "loss": 0.3502, "mean_token_accuracy": 0.9151948690414429, "num_tokens": 4475393.0, "step": 162 }, { "epoch": 2.0632911392405062, "grad_norm": 0.3176262080669403, "learning_rate": 0.00013338712926484725, "loss": 0.2907, "mean_token_accuracy": 0.9248190522193909, "num_tokens": 4504467.0, "step": 163 }, { "epoch": 2.0759493670886076, "grad_norm": 0.3452271819114685, "learning_rate": 0.00013261282313938795, "loss": 0.3302, "mean_token_accuracy": 0.9150597453117371, "num_tokens": 4536683.0, "step": 164 }, { "epoch": 2.088607594936709, "grad_norm": 0.30614957213401794, "learning_rate": 0.00013183632275356777, "loss": 0.3393, "mean_token_accuracy": 0.9161185026168823, "num_tokens": 4563654.0, "step": 165 }, { "epoch": 2.1012658227848102, "grad_norm": 0.24343803524971008, "learning_rate": 0.00013105768035199034, "loss": 0.2901, "mean_token_accuracy": 0.924813449382782, "num_tokens": 4590651.0, "step": 166 }, { "epoch": 2.1139240506329116, "grad_norm": 0.2270330786705017, "learning_rate": 0.0001302769483233786, "loss": 0.3091, "mean_token_accuracy": 0.9209712147712708, "num_tokens": 4620122.0, "step": 167 }, { "epoch": 2.1265822784810124, "grad_norm": 0.2397693246603012, "learning_rate": 0.00012949417919705007, "loss": 0.3475, "mean_token_accuracy": 0.9106589555740356, "num_tokens": 4646333.0, "step": 168 }, { "epoch": 2.1392405063291138, "grad_norm": 0.24059844017028809, "learning_rate": 0.00012870942563938264, "loss": 0.323, "mean_token_accuracy": 0.9175428152084351, "num_tokens": 4673599.0, "step": 169 }, { "epoch": 2.151898734177215, "grad_norm": 0.2501348853111267, "learning_rate": 0.0001279227404502709, "loss": 0.3163, "mean_token_accuracy": 0.9166937470436096, "num_tokens": 4701380.0, "step": 170 }, { "epoch": 2.1645569620253164, "grad_norm": 0.22692376375198364, "learning_rate": 0.00012713417655957376, "loss": 0.2759, "mean_token_accuracy": 0.9288318753242493, "num_tokens": 4726947.0, "step": 171 }, { "epoch": 2.1772151898734178, "grad_norm": 0.2650166451931, "learning_rate": 0.00012634378702355313, "loss": 0.2903, "mean_token_accuracy": 0.9228612184524536, "num_tokens": 4750190.0, "step": 172 }, { "epoch": 2.189873417721519, "grad_norm": 0.2699657678604126, "learning_rate": 0.00012555162502130433, "loss": 0.3415, "mean_token_accuracy": 0.9156725406646729, "num_tokens": 4780683.0, "step": 173 }, { "epoch": 2.2025316455696204, "grad_norm": 0.27826425433158875, "learning_rate": 0.00012475774385117786, "loss": 0.2964, "mean_token_accuracy": 0.9242163300514221, "num_tokens": 4809170.0, "step": 174 }, { "epoch": 2.2151898734177213, "grad_norm": 0.2556692361831665, "learning_rate": 0.00012396219692719363, "loss": 0.2999, "mean_token_accuracy": 0.9241935610771179, "num_tokens": 4840234.0, "step": 175 }, { "epoch": 2.2278481012658227, "grad_norm": 0.2634039521217346, "learning_rate": 0.000123165037775447, "loss": 0.2831, "mean_token_accuracy": 0.928834855556488, "num_tokens": 4871212.0, "step": 176 }, { "epoch": 2.240506329113924, "grad_norm": 0.24299867451190948, "learning_rate": 0.00012236632003050736, "loss": 0.3104, "mean_token_accuracy": 0.9202462434768677, "num_tokens": 4899864.0, "step": 177 }, { "epoch": 2.2531645569620253, "grad_norm": 0.27710238099098206, "learning_rate": 0.00012156609743180969, "loss": 0.3277, "mean_token_accuracy": 0.916947603225708, "num_tokens": 4923660.0, "step": 178 }, { "epoch": 2.2658227848101267, "grad_norm": 0.26420897245407104, "learning_rate": 0.0001207644238200387, "loss": 0.3226, "mean_token_accuracy": 0.9189229607582092, "num_tokens": 4950316.0, "step": 179 }, { "epoch": 2.278481012658228, "grad_norm": 0.24535071849822998, "learning_rate": 0.00011996135313350636, "loss": 0.3358, "mean_token_accuracy": 0.9146915674209595, "num_tokens": 4976919.0, "step": 180 }, { "epoch": 2.291139240506329, "grad_norm": 0.2273595929145813, "learning_rate": 0.0001191569394045228, "loss": 0.3158, "mean_token_accuracy": 0.9169893264770508, "num_tokens": 5007461.0, "step": 181 }, { "epoch": 2.3037974683544302, "grad_norm": 0.2287990301847458, "learning_rate": 0.00011835123675576092, "loss": 0.3074, "mean_token_accuracy": 0.9208506345748901, "num_tokens": 5038138.0, "step": 182 }, { "epoch": 2.3164556962025316, "grad_norm": 0.27022621035575867, "learning_rate": 0.0001175442993966149, "loss": 0.365, "mean_token_accuracy": 0.9085253477096558, "num_tokens": 5065368.0, "step": 183 }, { "epoch": 2.329113924050633, "grad_norm": 0.27093011140823364, "learning_rate": 0.00011673618161955288, "loss": 0.2812, "mean_token_accuracy": 0.9275172352790833, "num_tokens": 5093618.0, "step": 184 }, { "epoch": 2.3417721518987342, "grad_norm": 0.2677018642425537, "learning_rate": 0.00011592693779646405, "loss": 0.3154, "mean_token_accuracy": 0.9172254800796509, "num_tokens": 5122314.0, "step": 185 }, { "epoch": 2.3544303797468356, "grad_norm": 0.28765732049942017, "learning_rate": 0.00011511662237500032, "loss": 0.2979, "mean_token_accuracy": 0.920109748840332, "num_tokens": 5151906.0, "step": 186 }, { "epoch": 2.367088607594937, "grad_norm": 0.2899748384952545, "learning_rate": 0.00011430528987491305, "loss": 0.3114, "mean_token_accuracy": 0.9213389754295349, "num_tokens": 5183218.0, "step": 187 }, { "epoch": 2.379746835443038, "grad_norm": 0.2758501470088959, "learning_rate": 0.00011349299488438485, "loss": 0.3214, "mean_token_accuracy": 0.9202250242233276, "num_tokens": 5207099.0, "step": 188 }, { "epoch": 2.392405063291139, "grad_norm": 0.26853853464126587, "learning_rate": 0.00011267979205635675, "loss": 0.288, "mean_token_accuracy": 0.9245320558547974, "num_tokens": 5232114.0, "step": 189 }, { "epoch": 2.4050632911392404, "grad_norm": 0.25736933946609497, "learning_rate": 0.00011186573610485098, "loss": 0.3346, "mean_token_accuracy": 0.9166609644889832, "num_tokens": 5261288.0, "step": 190 }, { "epoch": 2.4177215189873418, "grad_norm": 0.2637197971343994, "learning_rate": 0.00011105088180128976, "loss": 0.3661, "mean_token_accuracy": 0.9097849726676941, "num_tokens": 5289906.0, "step": 191 }, { "epoch": 2.430379746835443, "grad_norm": 0.2588805854320526, "learning_rate": 0.00011023528397081011, "loss": 0.3093, "mean_token_accuracy": 0.9212461709976196, "num_tokens": 5317575.0, "step": 192 }, { "epoch": 2.4430379746835444, "grad_norm": 0.25420597195625305, "learning_rate": 0.0001094189974885752, "loss": 0.2949, "mean_token_accuracy": 0.9249463677406311, "num_tokens": 5344220.0, "step": 193 }, { "epoch": 2.4556962025316453, "grad_norm": 0.23094050586223602, "learning_rate": 0.00010860207727608214, "loss": 0.2978, "mean_token_accuracy": 0.9216447472572327, "num_tokens": 5376994.0, "step": 194 }, { "epoch": 2.4683544303797467, "grad_norm": 0.26487165689468384, "learning_rate": 0.00010778457829746666, "loss": 0.3375, "mean_token_accuracy": 0.9163733124732971, "num_tokens": 5406032.0, "step": 195 }, { "epoch": 2.481012658227848, "grad_norm": 0.26758190989494324, "learning_rate": 0.00010696655555580524, "loss": 0.3016, "mean_token_accuracy": 0.9225262403488159, "num_tokens": 5432079.0, "step": 196 }, { "epoch": 2.4936708860759493, "grad_norm": 0.24040226638317108, "learning_rate": 0.00010614806408941422, "loss": 0.3005, "mean_token_accuracy": 0.9199211001396179, "num_tokens": 5460028.0, "step": 197 }, { "epoch": 2.5063291139240507, "grad_norm": 0.24399694800376892, "learning_rate": 0.00010532915896814672, "loss": 0.3154, "mean_token_accuracy": 0.9223917722702026, "num_tokens": 5490630.0, "step": 198 }, { "epoch": 2.518987341772152, "grad_norm": 0.25092339515686035, "learning_rate": 0.00010450989528968746, "loss": 0.3155, "mean_token_accuracy": 0.9183499217033386, "num_tokens": 5520002.0, "step": 199 }, { "epoch": 2.5316455696202533, "grad_norm": 0.3188228905200958, "learning_rate": 0.00010369032817584561, "loss": 0.3576, "mean_token_accuracy": 0.9120784401893616, "num_tokens": 5543314.0, "step": 200 }, { "epoch": 2.5443037974683547, "grad_norm": 0.25112369656562805, "learning_rate": 0.00010287051276884618, "loss": 0.3232, "mean_token_accuracy": 0.9183758497238159, "num_tokens": 5576922.0, "step": 201 }, { "epoch": 2.5569620253164556, "grad_norm": 0.2742134630680084, "learning_rate": 0.00010205050422761988, "loss": 0.3443, "mean_token_accuracy": 0.9113529920578003, "num_tokens": 5604274.0, "step": 202 }, { "epoch": 2.569620253164557, "grad_norm": 0.26450711488723755, "learning_rate": 0.00010123035772409184, "loss": 0.3138, "mean_token_accuracy": 0.9207383990287781, "num_tokens": 5629962.0, "step": 203 }, { "epoch": 2.5822784810126582, "grad_norm": 0.284280002117157, "learning_rate": 0.0001004101284394696, "loss": 0.3381, "mean_token_accuracy": 0.914824903011322, "num_tokens": 5657898.0, "step": 204 }, { "epoch": 2.5949367088607596, "grad_norm": 0.25629135966300964, "learning_rate": 9.958987156053045e-05, "loss": 0.3072, "mean_token_accuracy": 0.9197523593902588, "num_tokens": 5684455.0, "step": 205 }, { "epoch": 2.607594936708861, "grad_norm": 0.2606535255908966, "learning_rate": 9.87696422759082e-05, "loss": 0.3119, "mean_token_accuracy": 0.9206276535987854, "num_tokens": 5712942.0, "step": 206 }, { "epoch": 2.620253164556962, "grad_norm": 0.3131278455257416, "learning_rate": 9.794949577238013e-05, "loss": 0.3396, "mean_token_accuracy": 0.9145336151123047, "num_tokens": 5736173.0, "step": 207 }, { "epoch": 2.632911392405063, "grad_norm": 0.28028929233551025, "learning_rate": 9.712948723115383e-05, "loss": 0.3235, "mean_token_accuracy": 0.9198562502861023, "num_tokens": 5764898.0, "step": 208 }, { "epoch": 2.6455696202531644, "grad_norm": 0.3018859028816223, "learning_rate": 9.630967182415442e-05, "loss": 0.3416, "mean_token_accuracy": 0.9144072532653809, "num_tokens": 5788235.0, "step": 209 }, { "epoch": 2.6582278481012658, "grad_norm": 0.2701573371887207, "learning_rate": 9.549010471031256e-05, "loss": 0.3322, "mean_token_accuracy": 0.9136073589324951, "num_tokens": 5815593.0, "step": 210 }, { "epoch": 2.670886075949367, "grad_norm": 0.27918487787246704, "learning_rate": 9.467084103185329e-05, "loss": 0.2871, "mean_token_accuracy": 0.9251144528388977, "num_tokens": 5839026.0, "step": 211 }, { "epoch": 2.6835443037974684, "grad_norm": 0.2541793882846832, "learning_rate": 9.385193591058579e-05, "loss": 0.3207, "mean_token_accuracy": 0.9179412126541138, "num_tokens": 5868447.0, "step": 212 }, { "epoch": 2.6962025316455698, "grad_norm": 0.284212201833725, "learning_rate": 9.303344444419476e-05, "loss": 0.3418, "mean_token_accuracy": 0.9152814745903015, "num_tokens": 5892154.0, "step": 213 }, { "epoch": 2.708860759493671, "grad_norm": 0.25230202078819275, "learning_rate": 9.221542170253339e-05, "loss": 0.324, "mean_token_accuracy": 0.918138861656189, "num_tokens": 5920803.0, "step": 214 }, { "epoch": 2.721518987341772, "grad_norm": 0.25568363070487976, "learning_rate": 9.139792272391791e-05, "loss": 0.3217, "mean_token_accuracy": 0.9202106595039368, "num_tokens": 5948590.0, "step": 215 }, { "epoch": 2.7341772151898733, "grad_norm": 0.27856069803237915, "learning_rate": 9.058100251142483e-05, "loss": 0.3423, "mean_token_accuracy": 0.9158259034156799, "num_tokens": 5975218.0, "step": 216 }, { "epoch": 2.7468354430379747, "grad_norm": 0.28674831986427307, "learning_rate": 8.976471602918991e-05, "loss": 0.3211, "mean_token_accuracy": 0.9169238209724426, "num_tokens": 5999260.0, "step": 217 }, { "epoch": 2.759493670886076, "grad_norm": 0.2633654475212097, "learning_rate": 8.894911819871026e-05, "loss": 0.3001, "mean_token_accuracy": 0.9245463013648987, "num_tokens": 6025499.0, "step": 218 }, { "epoch": 2.7721518987341773, "grad_norm": 0.27216392755508423, "learning_rate": 8.813426389514903e-05, "loss": 0.3121, "mean_token_accuracy": 0.9205847382545471, "num_tokens": 6052447.0, "step": 219 }, { "epoch": 2.7848101265822782, "grad_norm": 0.27877405285835266, "learning_rate": 8.732020794364326e-05, "loss": 0.3115, "mean_token_accuracy": 0.9189746379852295, "num_tokens": 6077244.0, "step": 220 }, { "epoch": 2.7974683544303796, "grad_norm": 0.24932622909545898, "learning_rate": 8.650700511561514e-05, "loss": 0.3044, "mean_token_accuracy": 0.9242026805877686, "num_tokens": 6107784.0, "step": 221 }, { "epoch": 2.810126582278481, "grad_norm": 0.2901391088962555, "learning_rate": 8.5694710125087e-05, "loss": 0.3463, "mean_token_accuracy": 0.913219153881073, "num_tokens": 6131851.0, "step": 222 }, { "epoch": 2.8227848101265822, "grad_norm": 0.25400716066360474, "learning_rate": 8.488337762499972e-05, "loss": 0.3237, "mean_token_accuracy": 0.9190093874931335, "num_tokens": 6162079.0, "step": 223 }, { "epoch": 2.8354430379746836, "grad_norm": 0.28880804777145386, "learning_rate": 8.407306220353596e-05, "loss": 0.2961, "mean_token_accuracy": 0.9268283247947693, "num_tokens": 6188779.0, "step": 224 }, { "epoch": 2.848101265822785, "grad_norm": 0.2607930600643158, "learning_rate": 8.326381838044713e-05, "loss": 0.2939, "mean_token_accuracy": 0.9244282841682434, "num_tokens": 6215255.0, "step": 225 }, { "epoch": 2.8607594936708862, "grad_norm": 0.25856783986091614, "learning_rate": 8.245570060338512e-05, "loss": 0.3216, "mean_token_accuracy": 0.9173731207847595, "num_tokens": 6243276.0, "step": 226 }, { "epoch": 2.8734177215189876, "grad_norm": 0.2345365434885025, "learning_rate": 8.164876324423909e-05, "loss": 0.2951, "mean_token_accuracy": 0.9234026670455933, "num_tokens": 6275456.0, "step": 227 }, { "epoch": 2.8860759493670884, "grad_norm": 0.307713121175766, "learning_rate": 8.084306059547722e-05, "loss": 0.3493, "mean_token_accuracy": 0.9130492806434631, "num_tokens": 6298073.0, "step": 228 }, { "epoch": 2.8987341772151898, "grad_norm": 0.22503980994224548, "learning_rate": 8.003864686649366e-05, "loss": 0.2865, "mean_token_accuracy": 0.9234779477119446, "num_tokens": 6329788.0, "step": 229 }, { "epoch": 2.911392405063291, "grad_norm": 0.2680565118789673, "learning_rate": 7.923557617996131e-05, "loss": 0.3342, "mean_token_accuracy": 0.912935733795166, "num_tokens": 6355672.0, "step": 230 }, { "epoch": 2.9240506329113924, "grad_norm": 0.24028684198856354, "learning_rate": 7.843390256819034e-05, "loss": 0.3245, "mean_token_accuracy": 0.9167670607566833, "num_tokens": 6388944.0, "step": 231 }, { "epoch": 2.9367088607594938, "grad_norm": 0.2594313323497772, "learning_rate": 7.763367996949267e-05, "loss": 0.3122, "mean_token_accuracy": 0.919628918170929, "num_tokens": 6415311.0, "step": 232 }, { "epoch": 2.9493670886075947, "grad_norm": 0.26911094784736633, "learning_rate": 7.683496222455304e-05, "loss": 0.2932, "mean_token_accuracy": 0.9235373735427856, "num_tokens": 6445612.0, "step": 233 }, { "epoch": 2.962025316455696, "grad_norm": 0.2445937991142273, "learning_rate": 7.603780307280639e-05, "loss": 0.3075, "mean_token_accuracy": 0.921126127243042, "num_tokens": 6477892.0, "step": 234 }, { "epoch": 2.9746835443037973, "grad_norm": 0.24366585910320282, "learning_rate": 7.524225614882216e-05, "loss": 0.3063, "mean_token_accuracy": 0.9189066886901855, "num_tokens": 6511103.0, "step": 235 }, { "epoch": 2.9873417721518987, "grad_norm": 0.2565755248069763, "learning_rate": 7.44483749786957e-05, "loss": 0.3173, "mean_token_accuracy": 0.9204142689704895, "num_tokens": 6544188.0, "step": 236 }, { "epoch": 3.0, "grad_norm": 0.2904413640499115, "learning_rate": 7.365621297644686e-05, "loss": 0.2312, "mean_token_accuracy": 0.9368520975112915, "num_tokens": 6563160.0, "step": 237 }, { "epoch": 3.0126582278481013, "grad_norm": 0.27616387605667114, "learning_rate": 7.286582344042625e-05, "loss": 0.2444, "mean_token_accuracy": 0.9391213059425354, "num_tokens": 6592676.0, "step": 238 }, { "epoch": 3.0253164556962027, "grad_norm": 0.22310671210289001, "learning_rate": 7.207725954972913e-05, "loss": 0.2059, "mean_token_accuracy": 0.9484432339668274, "num_tokens": 6622513.0, "step": 239 }, { "epoch": 3.037974683544304, "grad_norm": 0.23881305754184723, "learning_rate": 7.129057436061739e-05, "loss": 0.1847, "mean_token_accuracy": 0.9508729577064514, "num_tokens": 6648408.0, "step": 240 }, { "epoch": 3.050632911392405, "grad_norm": 0.26994800567626953, "learning_rate": 7.050582080294996e-05, "loss": 0.2262, "mean_token_accuracy": 0.9404712319374084, "num_tokens": 6677248.0, "step": 241 }, { "epoch": 3.0632911392405062, "grad_norm": 0.33617740869522095, "learning_rate": 6.972305167662145e-05, "loss": 0.2183, "mean_token_accuracy": 0.9411532282829285, "num_tokens": 6702632.0, "step": 242 }, { "epoch": 3.0759493670886076, "grad_norm": 0.3962535560131073, "learning_rate": 6.89423196480097e-05, "loss": 0.235, "mean_token_accuracy": 0.9364402890205383, "num_tokens": 6723574.0, "step": 243 }, { "epoch": 3.088607594936709, "grad_norm": 0.3901783227920532, "learning_rate": 6.816367724643224e-05, "loss": 0.2112, "mean_token_accuracy": 0.9436113834381104, "num_tokens": 6753715.0, "step": 244 }, { "epoch": 3.1012658227848102, "grad_norm": 0.42895060777664185, "learning_rate": 6.738717686061206e-05, "loss": 0.2142, "mean_token_accuracy": 0.9432305097579956, "num_tokens": 6782016.0, "step": 245 }, { "epoch": 3.1139240506329116, "grad_norm": 0.3753194212913513, "learning_rate": 6.661287073515275e-05, "loss": 0.2079, "mean_token_accuracy": 0.9462132453918457, "num_tokens": 6810191.0, "step": 246 }, { "epoch": 3.1265822784810124, "grad_norm": 0.3014523386955261, "learning_rate": 6.58408109670234e-05, "loss": 0.1745, "mean_token_accuracy": 0.9523671865463257, "num_tokens": 6837946.0, "step": 247 }, { "epoch": 3.1392405063291138, "grad_norm": 0.2990639805793762, "learning_rate": 6.507104950205336e-05, "loss": 0.2133, "mean_token_accuracy": 0.9442956447601318, "num_tokens": 6865638.0, "step": 248 }, { "epoch": 3.151898734177215, "grad_norm": 0.2579714357852936, "learning_rate": 6.430363813143716e-05, "loss": 0.2133, "mean_token_accuracy": 0.943679690361023, "num_tokens": 6897449.0, "step": 249 }, { "epoch": 3.1645569620253164, "grad_norm": 0.2432967573404312, "learning_rate": 6.35386284882501e-05, "loss": 0.2231, "mean_token_accuracy": 0.9416444897651672, "num_tokens": 6930569.0, "step": 250 }, { "epoch": 3.1772151898734178, "grad_norm": 0.27149054408073425, "learning_rate": 6.277607204397408e-05, "loss": 0.2242, "mean_token_accuracy": 0.9404853582382202, "num_tokens": 6960508.0, "step": 251 }, { "epoch": 3.189873417721519, "grad_norm": 0.26167789101600647, "learning_rate": 6.201602010503454e-05, "loss": 0.1878, "mean_token_accuracy": 0.949936032295227, "num_tokens": 6985580.0, "step": 252 }, { "epoch": 3.2025316455696204, "grad_norm": 0.2881351113319397, "learning_rate": 6.125852380934841e-05, "loss": 0.209, "mean_token_accuracy": 0.9419926404953003, "num_tokens": 7010365.0, "step": 253 }, { "epoch": 3.2151898734177213, "grad_norm": 0.2717518210411072, "learning_rate": 6.0503634122883556e-05, "loss": 0.2127, "mean_token_accuracy": 0.9436876177787781, "num_tokens": 7042802.0, "step": 254 }, { "epoch": 3.2278481012658227, "grad_norm": 0.2932974100112915, "learning_rate": 5.975140183622958e-05, "loss": 0.2408, "mean_token_accuracy": 0.936859130859375, "num_tokens": 7071342.0, "step": 255 }, { "epoch": 3.240506329113924, "grad_norm": 0.3055175244808197, "learning_rate": 5.900187756118055e-05, "loss": 0.2171, "mean_token_accuracy": 0.941013514995575, "num_tokens": 7102091.0, "step": 256 }, { "epoch": 3.2531645569620253, "grad_norm": 0.3924141526222229, "learning_rate": 5.8255111727329717e-05, "loss": 0.2121, "mean_token_accuracy": 0.9423477649688721, "num_tokens": 7126161.0, "step": 257 }, { "epoch": 3.2658227848101267, "grad_norm": 0.3086543083190918, "learning_rate": 5.751115457867653e-05, "loss": 0.2009, "mean_token_accuracy": 0.9472497701644897, "num_tokens": 7159495.0, "step": 258 }, { "epoch": 3.278481012658228, "grad_norm": 0.3455684185028076, "learning_rate": 5.6770056170246175e-05, "loss": 0.2062, "mean_token_accuracy": 0.9483978152275085, "num_tokens": 7188395.0, "step": 259 }, { "epoch": 3.291139240506329, "grad_norm": 0.30978819727897644, "learning_rate": 5.6031866364721554e-05, "loss": 0.1889, "mean_token_accuracy": 0.9461386203765869, "num_tokens": 7217775.0, "step": 260 }, { "epoch": 3.3037974683544302, "grad_norm": 0.3556048572063446, "learning_rate": 5.529663482908864e-05, "loss": 0.2091, "mean_token_accuracy": 0.9441432952880859, "num_tokens": 7241453.0, "step": 261 }, { "epoch": 3.3164556962025316, "grad_norm": 0.33020082116127014, "learning_rate": 5.4564411031294695e-05, "loss": 0.22, "mean_token_accuracy": 0.9420092701911926, "num_tokens": 7265038.0, "step": 262 }, { "epoch": 3.329113924050633, "grad_norm": 0.2814682424068451, "learning_rate": 5.383524423691994e-05, "loss": 0.2165, "mean_token_accuracy": 0.9420244097709656, "num_tokens": 7296598.0, "step": 263 }, { "epoch": 3.3417721518987342, "grad_norm": 0.30232468247413635, "learning_rate": 5.310918350586291e-05, "loss": 0.2237, "mean_token_accuracy": 0.9408864974975586, "num_tokens": 7323847.0, "step": 264 }, { "epoch": 3.3544303797468356, "grad_norm": 0.3444303870201111, "learning_rate": 5.2386277689039565e-05, "loss": 0.2359, "mean_token_accuracy": 0.9386903643608093, "num_tokens": 7349796.0, "step": 265 }, { "epoch": 3.367088607594937, "grad_norm": 0.27576106786727905, "learning_rate": 5.1666575425096396e-05, "loss": 0.2028, "mean_token_accuracy": 0.9470149278640747, "num_tokens": 7381869.0, "step": 266 }, { "epoch": 3.379746835443038, "grad_norm": 0.264581561088562, "learning_rate": 5.095012513713815e-05, "loss": 0.1836, "mean_token_accuracy": 0.9481507539749146, "num_tokens": 7410323.0, "step": 267 }, { "epoch": 3.392405063291139, "grad_norm": 0.2806169092655182, "learning_rate": 5.023697502946969e-05, "loss": 0.2211, "mean_token_accuracy": 0.9417513608932495, "num_tokens": 7443538.0, "step": 268 }, { "epoch": 3.4050632911392404, "grad_norm": 0.3141394853591919, "learning_rate": 4.9527173084352544e-05, "loss": 0.2092, "mean_token_accuracy": 0.9468376636505127, "num_tokens": 7472062.0, "step": 269 }, { "epoch": 3.4177215189873418, "grad_norm": 0.3401537537574768, "learning_rate": 4.882076705877689e-05, "loss": 0.2296, "mean_token_accuracy": 0.9416146874427795, "num_tokens": 7495214.0, "step": 270 }, { "epoch": 3.430379746835443, "grad_norm": 0.3027495741844177, "learning_rate": 4.811780448124812e-05, "loss": 0.1805, "mean_token_accuracy": 0.9496809840202332, "num_tokens": 7524273.0, "step": 271 }, { "epoch": 3.4430379746835444, "grad_norm": 0.31691181659698486, "learning_rate": 4.741833264858909e-05, "loss": 0.2165, "mean_token_accuracy": 0.9446760416030884, "num_tokens": 7550004.0, "step": 272 }, { "epoch": 3.4556962025316453, "grad_norm": 0.349369615316391, "learning_rate": 4.6722398622757935e-05, "loss": 0.2351, "mean_token_accuracy": 0.937907874584198, "num_tokens": 7576577.0, "step": 273 }, { "epoch": 3.4683544303797467, "grad_norm": 0.32902660965919495, "learning_rate": 4.603004922768148e-05, "loss": 0.2186, "mean_token_accuracy": 0.9428966045379639, "num_tokens": 7604888.0, "step": 274 }, { "epoch": 3.481012658227848, "grad_norm": 0.3392826020717621, "learning_rate": 4.5341331046105064e-05, "loss": 0.1997, "mean_token_accuracy": 0.9449344277381897, "num_tokens": 7632392.0, "step": 275 }, { "epoch": 3.4936708860759493, "grad_norm": 0.31181755661964417, "learning_rate": 4.465629041645819e-05, "loss": 0.2147, "mean_token_accuracy": 0.9431726336479187, "num_tokens": 7660893.0, "step": 276 }, { "epoch": 3.5063291139240507, "grad_norm": 0.3440548777580261, "learning_rate": 4.397497342973676e-05, "loss": 0.2351, "mean_token_accuracy": 0.93739253282547, "num_tokens": 7684804.0, "step": 277 }, { "epoch": 3.518987341772152, "grad_norm": 0.3588908016681671, "learning_rate": 4.3297425926402115e-05, "loss": 0.2077, "mean_token_accuracy": 0.9441769123077393, "num_tokens": 7707296.0, "step": 278 }, { "epoch": 3.5316455696202533, "grad_norm": 0.3143376111984253, "learning_rate": 4.2623693493296644e-05, "loss": 0.2178, "mean_token_accuracy": 0.9430637955665588, "num_tokens": 7734320.0, "step": 279 }, { "epoch": 3.5443037974683547, "grad_norm": 0.3187249004840851, "learning_rate": 4.1953821460576715e-05, "loss": 0.2153, "mean_token_accuracy": 0.9420468211174011, "num_tokens": 7759594.0, "step": 280 }, { "epoch": 3.5569620253164556, "grad_norm": 0.3404756486415863, "learning_rate": 4.1287854898662705e-05, "loss": 0.2191, "mean_token_accuracy": 0.9429894089698792, "num_tokens": 7784934.0, "step": 281 }, { "epoch": 3.569620253164557, "grad_norm": 0.2950340211391449, "learning_rate": 4.0625838615206566e-05, "loss": 0.1965, "mean_token_accuracy": 0.9470370411872864, "num_tokens": 7813905.0, "step": 282 }, { "epoch": 3.5822784810126582, "grad_norm": 0.29675501585006714, "learning_rate": 3.996781715207706e-05, "loss": 0.1883, "mean_token_accuracy": 0.9523015022277832, "num_tokens": 7842733.0, "step": 283 }, { "epoch": 3.5949367088607596, "grad_norm": 0.2913971245288849, "learning_rate": 3.9313834782362926e-05, "loss": 0.2062, "mean_token_accuracy": 0.9438738226890564, "num_tokens": 7870057.0, "step": 284 }, { "epoch": 3.607594936708861, "grad_norm": 0.3250754177570343, "learning_rate": 3.866393550739416e-05, "loss": 0.2152, "mean_token_accuracy": 0.9438368678092957, "num_tokens": 7899838.0, "step": 285 }, { "epoch": 3.620253164556962, "grad_norm": 0.3587188422679901, "learning_rate": 3.801816305378124e-05, "loss": 0.2133, "mean_token_accuracy": 0.9447436928749084, "num_tokens": 7927193.0, "step": 286 }, { "epoch": 3.632911392405063, "grad_norm": 0.3460696041584015, "learning_rate": 3.737656087047347e-05, "loss": 0.2206, "mean_token_accuracy": 0.9417229294776917, "num_tokens": 7954815.0, "step": 287 }, { "epoch": 3.6455696202531644, "grad_norm": 0.3258835971355438, "learning_rate": 3.673917212583538e-05, "loss": 0.1926, "mean_token_accuracy": 0.9482221007347107, "num_tokens": 7981512.0, "step": 288 }, { "epoch": 3.6582278481012658, "grad_norm": 0.30438584089279175, "learning_rate": 3.610603970474239e-05, "loss": 0.188, "mean_token_accuracy": 0.9465112090110779, "num_tokens": 8009881.0, "step": 289 }, { "epoch": 3.670886075949367, "grad_norm": 0.32022497057914734, "learning_rate": 3.547720620569539e-05, "loss": 0.2302, "mean_token_accuracy": 0.9406543970108032, "num_tokens": 8036535.0, "step": 290 }, { "epoch": 3.6835443037974684, "grad_norm": 0.31502029299736023, "learning_rate": 3.485271393795453e-05, "loss": 0.2027, "mean_token_accuracy": 0.945996105670929, "num_tokens": 8065708.0, "step": 291 }, { "epoch": 3.6962025316455698, "grad_norm": 0.33635619282722473, "learning_rate": 3.4232604918692754e-05, "loss": 0.186, "mean_token_accuracy": 0.949739396572113, "num_tokens": 8095895.0, "step": 292 }, { "epoch": 3.708860759493671, "grad_norm": 0.28580737113952637, "learning_rate": 3.361692087016863e-05, "loss": 0.2055, "mean_token_accuracy": 0.9459794163703918, "num_tokens": 8130668.0, "step": 293 }, { "epoch": 3.721518987341772, "grad_norm": 0.3191229999065399, "learning_rate": 3.300570321691934e-05, "loss": 0.2276, "mean_token_accuracy": 0.9415168166160583, "num_tokens": 8159424.0, "step": 294 }, { "epoch": 3.7341772151898733, "grad_norm": 0.3334013819694519, "learning_rate": 3.2398993082973294e-05, "loss": 0.2059, "mean_token_accuracy": 0.9460656642913818, "num_tokens": 8185223.0, "step": 295 }, { "epoch": 3.7468354430379747, "grad_norm": 0.3282049298286438, "learning_rate": 3.179683128908352e-05, "loss": 0.1981, "mean_token_accuracy": 0.9463132619857788, "num_tokens": 8210526.0, "step": 296 }, { "epoch": 3.759493670886076, "grad_norm": 0.32919394969940186, "learning_rate": 3.1199258349980966e-05, "loss": 0.2027, "mean_token_accuracy": 0.9434241056442261, "num_tokens": 8234275.0, "step": 297 }, { "epoch": 3.7721518987341773, "grad_norm": 0.30664342641830444, "learning_rate": 3.0606314471648643e-05, "loss": 0.225, "mean_token_accuracy": 0.9425418972969055, "num_tokens": 8264065.0, "step": 298 }, { "epoch": 3.7848101265822782, "grad_norm": 0.3123731017112732, "learning_rate": 3.0018039548616494e-05, "loss": 0.2136, "mean_token_accuracy": 0.9409631490707397, "num_tokens": 8289774.0, "step": 299 }, { "epoch": 3.7974683544303796, "grad_norm": 0.28892743587493896, "learning_rate": 2.943447316127712e-05, "loss": 0.2149, "mean_token_accuracy": 0.9433043599128723, "num_tokens": 8318588.0, "step": 300 }, { "epoch": 3.810126582278481, "grad_norm": 0.3019264340400696, "learning_rate": 2.8855654573222825e-05, "loss": 0.1967, "mean_token_accuracy": 0.9472973942756653, "num_tokens": 8342370.0, "step": 301 }, { "epoch": 3.8227848101265822, "grad_norm": 0.34315142035484314, "learning_rate": 2.8281622728603864e-05, "loss": 0.2246, "mean_token_accuracy": 0.9393528699874878, "num_tokens": 8368272.0, "step": 302 }, { "epoch": 3.8354430379746836, "grad_norm": 0.28530240058898926, "learning_rate": 2.7712416249508177e-05, "loss": 0.1843, "mean_token_accuracy": 0.9489932060241699, "num_tokens": 8393862.0, "step": 303 }, { "epoch": 3.848101265822785, "grad_norm": 0.29711446166038513, "learning_rate": 2.714807343336273e-05, "loss": 0.193, "mean_token_accuracy": 0.9491274356842041, "num_tokens": 8427677.0, "step": 304 }, { "epoch": 3.8607594936708862, "grad_norm": 0.3001667261123657, "learning_rate": 2.6588632250356948e-05, "loss": 0.2135, "mean_token_accuracy": 0.942951500415802, "num_tokens": 8456804.0, "step": 305 }, { "epoch": 3.8734177215189876, "grad_norm": 0.370648592710495, "learning_rate": 2.6034130340887895e-05, "loss": 0.228, "mean_token_accuracy": 0.9391285181045532, "num_tokens": 8479473.0, "step": 306 }, { "epoch": 3.8860759493670884, "grad_norm": 0.29396143555641174, "learning_rate": 2.5484605013027784e-05, "loss": 0.1875, "mean_token_accuracy": 0.9490495324134827, "num_tokens": 8509311.0, "step": 307 }, { "epoch": 3.8987341772151898, "grad_norm": 0.3296216130256653, "learning_rate": 2.4940093240013717e-05, "loss": 0.218, "mean_token_accuracy": 0.9419081807136536, "num_tokens": 8532769.0, "step": 308 }, { "epoch": 3.911392405063291, "grad_norm": 0.32734474539756775, "learning_rate": 2.4400631657760186e-05, "loss": 0.2283, "mean_token_accuracy": 0.9447795748710632, "num_tokens": 8562007.0, "step": 309 }, { "epoch": 3.9240506329113924, "grad_norm": 0.3589797616004944, "learning_rate": 2.3866256562394083e-05, "loss": 0.2069, "mean_token_accuracy": 0.9477079510688782, "num_tokens": 8588423.0, "step": 310 }, { "epoch": 3.9367088607594938, "grad_norm": 0.34904512763023376, "learning_rate": 2.333700390781256e-05, "loss": 0.2378, "mean_token_accuracy": 0.9371540546417236, "num_tokens": 8612514.0, "step": 311 }, { "epoch": 3.9493670886075947, "grad_norm": 0.3251732587814331, "learning_rate": 2.2812909303264085e-05, "loss": 0.2197, "mean_token_accuracy": 0.9419779777526855, "num_tokens": 8638999.0, "step": 312 }, { "epoch": 3.962025316455696, "grad_norm": 0.2840147912502289, "learning_rate": 2.2294008010952382e-05, "loss": 0.1916, "mean_token_accuracy": 0.9481982588768005, "num_tokens": 8668618.0, "step": 313 }, { "epoch": 3.9746835443037973, "grad_norm": 0.3017045557498932, "learning_rate": 2.1780334943664162e-05, "loss": 0.2325, "mean_token_accuracy": 0.9411991238594055, "num_tokens": 8697253.0, "step": 314 }, { "epoch": 3.9873417721518987, "grad_norm": 0.3263002932071686, "learning_rate": 2.127192466241994e-05, "loss": 0.1968, "mean_token_accuracy": 0.9472008347511292, "num_tokens": 8725272.0, "step": 315 }, { "epoch": 4.0, "grad_norm": 0.26912280917167664, "learning_rate": 2.07688113741488e-05, "loss": 0.1739, "mean_token_accuracy": 0.9553947448730469, "num_tokens": 8752149.0, "step": 316 }, { "epoch": 4.012658227848101, "grad_norm": 0.2620762288570404, "learning_rate": 2.0271028929386738e-05, "loss": 0.1409, "mean_token_accuracy": 0.9631852507591248, "num_tokens": 8786873.0, "step": 317 }, { "epoch": 4.025316455696203, "grad_norm": 0.27156445384025574, "learning_rate": 1.977861081999931e-05, "loss": 0.1425, "mean_token_accuracy": 0.9618934392929077, "num_tokens": 8813914.0, "step": 318 }, { "epoch": 4.037974683544304, "grad_norm": 0.2684096693992615, "learning_rate": 1.92915901769281e-05, "loss": 0.1517, "mean_token_accuracy": 0.9602447748184204, "num_tokens": 8843232.0, "step": 319 }, { "epoch": 4.050632911392405, "grad_norm": 0.26625022292137146, "learning_rate": 1.880999976796164e-05, "loss": 0.1452, "mean_token_accuracy": 0.9612977504730225, "num_tokens": 8872054.0, "step": 320 }, { "epoch": 4.063291139240507, "grad_norm": 0.24873296916484833, "learning_rate": 1.8333871995530726e-05, "loss": 0.1326, "mean_token_accuracy": 0.9649026989936829, "num_tokens": 8901408.0, "step": 321 }, { "epoch": 4.075949367088608, "grad_norm": 0.3573494851589203, "learning_rate": 1.786323889452828e-05, "loss": 0.1975, "mean_token_accuracy": 0.951496958732605, "num_tokens": 8925120.0, "step": 322 }, { "epoch": 4.0886075949367084, "grad_norm": 0.26980891823768616, "learning_rate": 1.739813213015401e-05, "loss": 0.1516, "mean_token_accuracy": 0.9608834385871887, "num_tokens": 8954072.0, "step": 323 }, { "epoch": 4.10126582278481, "grad_norm": 0.3037337362766266, "learning_rate": 1.693858299578396e-05, "loss": 0.1492, "mean_token_accuracy": 0.9619460105895996, "num_tokens": 8979521.0, "step": 324 }, { "epoch": 4.113924050632911, "grad_norm": 0.3206160068511963, "learning_rate": 1.6484622410864835e-05, "loss": 0.1544, "mean_token_accuracy": 0.9592971205711365, "num_tokens": 9009804.0, "step": 325 }, { "epoch": 4.1265822784810124, "grad_norm": 0.3352915942668915, "learning_rate": 1.6036280918833924e-05, "loss": 0.1324, "mean_token_accuracy": 0.9634490609169006, "num_tokens": 9039963.0, "step": 326 }, { "epoch": 4.139240506329114, "grad_norm": 0.33604586124420166, "learning_rate": 1.5593588685063896e-05, "loss": 0.1455, "mean_token_accuracy": 0.9627248644828796, "num_tokens": 9068491.0, "step": 327 }, { "epoch": 4.151898734177215, "grad_norm": 0.3599500060081482, "learning_rate": 1.515657549483328e-05, "loss": 0.1462, "mean_token_accuracy": 0.9611698985099792, "num_tokens": 9096729.0, "step": 328 }, { "epoch": 4.1645569620253164, "grad_norm": 0.33143875002861023, "learning_rate": 1.4725270751322452e-05, "loss": 0.1526, "mean_token_accuracy": 0.959871232509613, "num_tokens": 9125376.0, "step": 329 }, { "epoch": 4.177215189873418, "grad_norm": 0.3701411187648773, "learning_rate": 1.4299703473635218e-05, "loss": 0.1343, "mean_token_accuracy": 0.9638819694519043, "num_tokens": 9149943.0, "step": 330 }, { "epoch": 4.189873417721519, "grad_norm": 0.35997846722602844, "learning_rate": 1.3879902294846536e-05, "loss": 0.1559, "mean_token_accuracy": 0.9590244293212891, "num_tokens": 9175510.0, "step": 331 }, { "epoch": 4.2025316455696204, "grad_norm": 0.35657989978790283, "learning_rate": 1.3465895460075873e-05, "loss": 0.1433, "mean_token_accuracy": 0.9618638753890991, "num_tokens": 9200511.0, "step": 332 }, { "epoch": 4.215189873417722, "grad_norm": 0.3306591808795929, "learning_rate": 1.3057710824586899e-05, "loss": 0.1364, "mean_token_accuracy": 0.9646348357200623, "num_tokens": 9228399.0, "step": 333 }, { "epoch": 4.227848101265823, "grad_norm": 0.39021170139312744, "learning_rate": 1.2655375851913232e-05, "loss": 0.1356, "mean_token_accuracy": 0.9625832438468933, "num_tokens": 9255483.0, "step": 334 }, { "epoch": 4.2405063291139244, "grad_norm": 0.31789690256118774, "learning_rate": 1.22589176120107e-05, "loss": 0.1491, "mean_token_accuracy": 0.9607197642326355, "num_tokens": 9288668.0, "step": 335 }, { "epoch": 4.253164556962025, "grad_norm": 0.28493577241897583, "learning_rate": 1.186836277943606e-05, "loss": 0.1353, "mean_token_accuracy": 0.963397204875946, "num_tokens": 9320205.0, "step": 336 }, { "epoch": 4.265822784810126, "grad_norm": 0.2949843406677246, "learning_rate": 1.1483737631552161e-05, "loss": 0.1485, "mean_token_accuracy": 0.9607917070388794, "num_tokens": 9354726.0, "step": 337 }, { "epoch": 4.2784810126582276, "grad_norm": 0.3261242210865021, "learning_rate": 1.1105068046760048e-05, "loss": 0.1534, "mean_token_accuracy": 0.9607728719711304, "num_tokens": 9378753.0, "step": 338 }, { "epoch": 4.291139240506329, "grad_norm": 0.3109029531478882, "learning_rate": 1.0732379502757717e-05, "loss": 0.1334, "mean_token_accuracy": 0.9623681902885437, "num_tokens": 9405656.0, "step": 339 }, { "epoch": 4.30379746835443, "grad_norm": 0.33837878704071045, "learning_rate": 1.036569707482602e-05, "loss": 0.125, "mean_token_accuracy": 0.9672681093215942, "num_tokens": 9433155.0, "step": 340 }, { "epoch": 4.3164556962025316, "grad_norm": 0.3010624349117279, "learning_rate": 1.0005045434141502e-05, "loss": 0.1454, "mean_token_accuracy": 0.9592652916908264, "num_tokens": 9456467.0, "step": 341 }, { "epoch": 4.329113924050633, "grad_norm": 0.26326826214790344, "learning_rate": 9.6504488461164e-06, "loss": 0.1089, "mean_token_accuracy": 0.9692077040672302, "num_tokens": 9487188.0, "step": 342 }, { "epoch": 4.341772151898734, "grad_norm": 0.2840709686279297, "learning_rate": 9.301931168766164e-06, "loss": 0.1433, "mean_token_accuracy": 0.9612064957618713, "num_tokens": 9517721.0, "step": 343 }, { "epoch": 4.3544303797468356, "grad_norm": 0.3117605149745941, "learning_rate": 8.959515851104117e-06, "loss": 0.1452, "mean_token_accuracy": 0.9629843235015869, "num_tokens": 9545530.0, "step": 344 }, { "epoch": 4.367088607594937, "grad_norm": 0.2651097774505615, "learning_rate": 8.623225931563805e-06, "loss": 0.1381, "mean_token_accuracy": 0.9643408060073853, "num_tokens": 9576722.0, "step": 345 }, { "epoch": 4.379746835443038, "grad_norm": 0.326434850692749, "learning_rate": 8.293084036448895e-06, "loss": 0.146, "mean_token_accuracy": 0.9589329957962036, "num_tokens": 9600479.0, "step": 346 }, { "epoch": 4.3924050632911396, "grad_norm": 0.28717437386512756, "learning_rate": 7.96911237841088e-06, "loss": 0.132, "mean_token_accuracy": 0.9652442932128906, "num_tokens": 9629977.0, "step": 347 }, { "epoch": 4.405063291139241, "grad_norm": 0.2908034026622772, "learning_rate": 7.651332754954477e-06, "loss": 0.1255, "mean_token_accuracy": 0.967119038105011, "num_tokens": 9652516.0, "step": 348 }, { "epoch": 4.417721518987342, "grad_norm": 0.3260648846626282, "learning_rate": 7.3397665469711495e-06, "loss": 0.1597, "mean_token_accuracy": 0.9586137533187866, "num_tokens": 9681406.0, "step": 349 }, { "epoch": 4.430379746835443, "grad_norm": 0.28147315979003906, "learning_rate": 7.034434717300509e-06, "loss": 0.1258, "mean_token_accuracy": 0.9659237861633301, "num_tokens": 9711667.0, "step": 350 }, { "epoch": 4.443037974683544, "grad_norm": 0.35376855731010437, "learning_rate": 6.735357809319809e-06, "loss": 0.1474, "mean_token_accuracy": 0.9578174948692322, "num_tokens": 9735722.0, "step": 351 }, { "epoch": 4.455696202531645, "grad_norm": 0.3055274784564972, "learning_rate": 6.442555945561901e-06, "loss": 0.1412, "mean_token_accuracy": 0.9630998969078064, "num_tokens": 9766897.0, "step": 352 }, { "epoch": 4.468354430379747, "grad_norm": 0.29014500975608826, "learning_rate": 6.156048826361238e-06, "loss": 0.1395, "mean_token_accuracy": 0.9621520042419434, "num_tokens": 9796738.0, "step": 353 }, { "epoch": 4.481012658227848, "grad_norm": 0.2847389280796051, "learning_rate": 5.8758557285284125e-06, "loss": 0.1216, "mean_token_accuracy": 0.9675486087799072, "num_tokens": 9831007.0, "step": 354 }, { "epoch": 4.493670886075949, "grad_norm": 0.37046611309051514, "learning_rate": 5.6019955040531925e-06, "loss": 0.1555, "mean_token_accuracy": 0.958193838596344, "num_tokens": 9854369.0, "step": 355 }, { "epoch": 4.506329113924051, "grad_norm": 0.30166560411453247, "learning_rate": 5.334486578836118e-06, "loss": 0.1436, "mean_token_accuracy": 0.9620810151100159, "num_tokens": 9881016.0, "step": 356 }, { "epoch": 4.518987341772152, "grad_norm": 0.3337922990322113, "learning_rate": 5.073346951448699e-06, "loss": 0.1313, "mean_token_accuracy": 0.9661489129066467, "num_tokens": 9905481.0, "step": 357 }, { "epoch": 4.531645569620253, "grad_norm": 0.2855200469493866, "learning_rate": 4.818594191922576e-06, "loss": 0.1381, "mean_token_accuracy": 0.9621705412864685, "num_tokens": 9933962.0, "step": 358 }, { "epoch": 4.544303797468355, "grad_norm": 0.2855769395828247, "learning_rate": 4.5702454405672e-06, "loss": 0.1284, "mean_token_accuracy": 0.9656704068183899, "num_tokens": 9962398.0, "step": 359 }, { "epoch": 4.556962025316456, "grad_norm": 0.3019951283931732, "learning_rate": 4.328317406816751e-06, "loss": 0.1282, "mean_token_accuracy": 0.9652332067489624, "num_tokens": 9988809.0, "step": 360 }, { "epoch": 4.569620253164557, "grad_norm": 0.336088627576828, "learning_rate": 4.092826368105795e-06, "loss": 0.1556, "mean_token_accuracy": 0.9580214023590088, "num_tokens": 10013052.0, "step": 361 }, { "epoch": 4.582278481012658, "grad_norm": 0.31958091259002686, "learning_rate": 3.863788168774118e-06, "loss": 0.1728, "mean_token_accuracy": 0.9531184434890747, "num_tokens": 10044173.0, "step": 362 }, { "epoch": 4.594936708860759, "grad_norm": 0.3252604603767395, "learning_rate": 3.6412182190007082e-06, "loss": 0.1478, "mean_token_accuracy": 0.9624072909355164, "num_tokens": 10073897.0, "step": 363 }, { "epoch": 4.6075949367088604, "grad_norm": 0.42186495661735535, "learning_rate": 3.425131493766931e-06, "loss": 0.1508, "mean_token_accuracy": 0.9569892287254333, "num_tokens": 10093398.0, "step": 364 }, { "epoch": 4.620253164556962, "grad_norm": 0.3029695451259613, "learning_rate": 3.2155425318489584e-06, "loss": 0.13, "mean_token_accuracy": 0.9656196236610413, "num_tokens": 10121414.0, "step": 365 }, { "epoch": 4.632911392405063, "grad_norm": 0.32184407114982605, "learning_rate": 3.012465434839529e-06, "loss": 0.1449, "mean_token_accuracy": 0.9606809616088867, "num_tokens": 10146148.0, "step": 366 }, { "epoch": 4.6455696202531644, "grad_norm": 0.36808857321739197, "learning_rate": 2.8159138661992824e-06, "loss": 0.143, "mean_token_accuracy": 0.9619269967079163, "num_tokens": 10172346.0, "step": 367 }, { "epoch": 4.658227848101266, "grad_norm": 0.3044672906398773, "learning_rate": 2.6259010503373206e-06, "loss": 0.129, "mean_token_accuracy": 0.9652129411697388, "num_tokens": 10199949.0, "step": 368 }, { "epoch": 4.670886075949367, "grad_norm": 0.3074134886264801, "learning_rate": 2.4424397717215387e-06, "loss": 0.1343, "mean_token_accuracy": 0.9630903005599976, "num_tokens": 10227648.0, "step": 369 }, { "epoch": 4.6835443037974684, "grad_norm": 0.2984522581100464, "learning_rate": 2.2655423740183924e-06, "loss": 0.1369, "mean_token_accuracy": 0.9643847346305847, "num_tokens": 10257643.0, "step": 370 }, { "epoch": 4.69620253164557, "grad_norm": 0.2795273959636688, "learning_rate": 2.0952207592624505e-06, "loss": 0.1318, "mean_token_accuracy": 0.9641938805580139, "num_tokens": 10289601.0, "step": 371 }, { "epoch": 4.708860759493671, "grad_norm": 0.31014949083328247, "learning_rate": 1.9314863870555255e-06, "loss": 0.1436, "mean_token_accuracy": 0.9634020924568176, "num_tokens": 10315978.0, "step": 372 }, { "epoch": 4.7215189873417724, "grad_norm": 0.32286179065704346, "learning_rate": 1.7743502737957106e-06, "loss": 0.1496, "mean_token_accuracy": 0.9591047167778015, "num_tokens": 10339052.0, "step": 373 }, { "epoch": 4.734177215189874, "grad_norm": 0.3142798840999603, "learning_rate": 1.6238229919361858e-06, "loss": 0.1329, "mean_token_accuracy": 0.9642317295074463, "num_tokens": 10364921.0, "step": 374 }, { "epoch": 4.746835443037975, "grad_norm": 0.3594357669353485, "learning_rate": 1.4799146692737741e-06, "loss": 0.1779, "mean_token_accuracy": 0.9541767835617065, "num_tokens": 10389274.0, "step": 375 }, { "epoch": 4.759493670886076, "grad_norm": 0.3242360055446625, "learning_rate": 1.3426349882676325e-06, "loss": 0.144, "mean_token_accuracy": 0.9641324877738953, "num_tokens": 10422432.0, "step": 376 }, { "epoch": 4.772151898734177, "grad_norm": 0.2857370972633362, "learning_rate": 1.211993185387772e-06, "loss": 0.1383, "mean_token_accuracy": 0.9639822840690613, "num_tokens": 10450510.0, "step": 377 }, { "epoch": 4.784810126582278, "grad_norm": 0.2964177131652832, "learning_rate": 1.0879980504935772e-06, "loss": 0.1262, "mean_token_accuracy": 0.9655276536941528, "num_tokens": 10480337.0, "step": 378 }, { "epoch": 4.7974683544303796, "grad_norm": 0.29852089285850525, "learning_rate": 9.706579262424131e-07, "loss": 0.1481, "mean_token_accuracy": 0.9615073204040527, "num_tokens": 10512485.0, "step": 379 }, { "epoch": 4.810126582278481, "grad_norm": 0.36380690336227417, "learning_rate": 8.599807075283406e-07, "loss": 0.1617, "mean_token_accuracy": 0.9566697478294373, "num_tokens": 10534289.0, "step": 380 }, { "epoch": 4.822784810126582, "grad_norm": 0.3195270895957947, "learning_rate": 7.559738409508855e-07, "loss": 0.1423, "mean_token_accuracy": 0.960354745388031, "num_tokens": 10559047.0, "step": 381 }, { "epoch": 4.8354430379746836, "grad_norm": 0.3309272229671478, "learning_rate": 6.586443243140838e-07, "loss": 0.142, "mean_token_accuracy": 0.9632369875907898, "num_tokens": 10584789.0, "step": 382 }, { "epoch": 4.848101265822785, "grad_norm": 0.33980849385261536, "learning_rate": 5.679987061555703e-07, "loss": 0.1221, "mean_token_accuracy": 0.9658645391464233, "num_tokens": 10612156.0, "step": 383 }, { "epoch": 4.860759493670886, "grad_norm": 0.3266946077346802, "learning_rate": 4.840430853060518e-07, "loss": 0.1485, "mean_token_accuracy": 0.9566022753715515, "num_tokens": 10634894.0, "step": 384 }, { "epoch": 4.8734177215189876, "grad_norm": 0.2987641394138336, "learning_rate": 4.0678311047890327e-07, "loss": 0.1335, "mean_token_accuracy": 0.9644708633422852, "num_tokens": 10664089.0, "step": 385 }, { "epoch": 4.886075949367089, "grad_norm": 0.29495102167129517, "learning_rate": 3.362239798901712e-07, "loss": 0.1362, "mean_token_accuracy": 0.9644386768341064, "num_tokens": 10689602.0, "step": 386 }, { "epoch": 4.89873417721519, "grad_norm": 0.3115140497684479, "learning_rate": 2.723704409087979e-07, "loss": 0.1494, "mean_token_accuracy": 0.9600952863693237, "num_tokens": 10720314.0, "step": 387 }, { "epoch": 4.911392405063291, "grad_norm": 0.30226320028305054, "learning_rate": 2.1522678973718847e-07, "loss": 0.1272, "mean_token_accuracy": 0.9658134579658508, "num_tokens": 10748898.0, "step": 388 }, { "epoch": 4.924050632911392, "grad_norm": 0.31414154171943665, "learning_rate": 1.6479687112217479e-07, "loss": 0.1447, "mean_token_accuracy": 0.9592844247817993, "num_tokens": 10778533.0, "step": 389 }, { "epoch": 4.936708860759493, "grad_norm": 0.2912035584449768, "learning_rate": 1.2108407809635624e-07, "loss": 0.1309, "mean_token_accuracy": 0.9652738571166992, "num_tokens": 10805090.0, "step": 390 }, { "epoch": 4.949367088607595, "grad_norm": 0.2709757685661316, "learning_rate": 8.40913517497377e-08, "loss": 0.1277, "mean_token_accuracy": 0.96564781665802, "num_tokens": 10834730.0, "step": 391 }, { "epoch": 4.962025316455696, "grad_norm": 0.3017437756061554, "learning_rate": 5.382118103193223e-08, "loss": 0.1397, "mean_token_accuracy": 0.9620010256767273, "num_tokens": 10862400.0, "step": 392 }, { "epoch": 4.974683544303797, "grad_norm": 0.37488335371017456, "learning_rate": 3.027560258465067e-08, "loss": 0.1487, "mean_token_accuracy": 0.9623703956604004, "num_tokens": 10884840.0, "step": 393 }, { "epoch": 4.987341772151899, "grad_norm": 0.2931729853153229, "learning_rate": 1.345620060465569e-08, "loss": 0.1334, "mean_token_accuracy": 0.9638663530349731, "num_tokens": 10915734.0, "step": 394 }, { "epoch": 5.0, "grad_norm": 0.24923710525035858, "learning_rate": 3.3641067372358612e-09, "loss": 0.1168, "mean_token_accuracy": 0.9699816107749939, "num_tokens": 10947845.0, "step": 395 }, { "epoch": 5.0, "step": 395, "total_flos": 1.1838649578050028e+18, "train_loss": 0.32972808646250373, "train_runtime": 2337.3269, "train_samples_per_second": 10.696, "train_steps_per_second": 0.169 } ], "logging_steps": 1.0, "max_steps": 395, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1838649578050028e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }