{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 237, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012658227848101266, "grad_norm": 3.3755528926849365, "learning_rate": 0.0, "loss": 1.5248, "mean_token_accuracy": 0.6810985803604126, "num_tokens": 20782.0, "step": 1 }, { "epoch": 0.02531645569620253, "grad_norm": 3.3469796180725098, "learning_rate": 2.5e-05, "loss": 1.5007, "mean_token_accuracy": 0.684084951877594, "num_tokens": 41801.0, "step": 2 }, { "epoch": 0.0379746835443038, "grad_norm": 1.97304368019104, "learning_rate": 5e-05, "loss": 1.4012, "mean_token_accuracy": 0.6956851482391357, "num_tokens": 62978.0, "step": 3 }, { "epoch": 0.05063291139240506, "grad_norm": 1.4511849880218506, "learning_rate": 7.500000000000001e-05, "loss": 1.2029, "mean_token_accuracy": 0.7223535776138306, "num_tokens": 85034.0, "step": 4 }, { "epoch": 0.06329113924050633, "grad_norm": 0.8851504921913147, "learning_rate": 0.0001, "loss": 1.0773, "mean_token_accuracy": 0.7364060282707214, "num_tokens": 107185.0, "step": 5 }, { "epoch": 0.0759493670886076, "grad_norm": 0.7546831965446472, "learning_rate": 0.000125, "loss": 0.9672, "mean_token_accuracy": 0.758962869644165, "num_tokens": 127806.0, "step": 6 }, { "epoch": 0.08860759493670886, "grad_norm": 1.457136869430542, "learning_rate": 0.00015000000000000001, "loss": 0.8743, "mean_token_accuracy": 0.7788419127464294, "num_tokens": 148231.0, "step": 7 }, { "epoch": 0.10126582278481013, "grad_norm": 1.194122076034546, "learning_rate": 0.000175, "loss": 0.7579, "mean_token_accuracy": 0.8078464269638062, "num_tokens": 169757.0, "step": 8 }, { "epoch": 0.11392405063291139, "grad_norm": 0.7309107184410095, "learning_rate": 0.0002, "loss": 0.6593, "mean_token_accuracy": 0.8331207633018494, "num_tokens": 190207.0, "step": 9 }, { "epoch": 0.12658227848101267, "grad_norm": 0.7755345106124878, "learning_rate": 0.00019999058994907564, "loss": 0.5264, "mean_token_accuracy": 0.8658320307731628, "num_tokens": 209441.0, "step": 10 }, { "epoch": 0.13924050632911392, "grad_norm": 0.6617028117179871, "learning_rate": 0.0001999623615672837, "loss": 0.5016, "mean_token_accuracy": 0.8747288584709167, "num_tokens": 229789.0, "step": 11 }, { "epoch": 0.1518987341772152, "grad_norm": 0.5665917992591858, "learning_rate": 0.00019991532016723439, "loss": 0.4617, "mean_token_accuracy": 0.8841381072998047, "num_tokens": 250645.0, "step": 12 }, { "epoch": 0.16455696202531644, "grad_norm": 0.47884827852249146, "learning_rate": 0.00019984947460216707, "loss": 0.4011, "mean_token_accuracy": 0.8991096615791321, "num_tokens": 271375.0, "step": 13 }, { "epoch": 0.17721518987341772, "grad_norm": 0.440388947725296, "learning_rate": 0.00019976483726428422, "loss": 0.3918, "mean_token_accuracy": 0.9046533703804016, "num_tokens": 292499.0, "step": 14 }, { "epoch": 0.189873417721519, "grad_norm": 0.5122181177139282, "learning_rate": 0.00019966142408241901, "loss": 0.4464, "mean_token_accuracy": 0.8897697329521179, "num_tokens": 313755.0, "step": 15 }, { "epoch": 0.20253164556962025, "grad_norm": 0.41976478695869446, "learning_rate": 0.00019953925451903756, "loss": 0.3145, "mean_token_accuracy": 0.9217761158943176, "num_tokens": 335462.0, "step": 16 }, { "epoch": 0.21518987341772153, "grad_norm": 0.4809647798538208, "learning_rate": 0.00019939835156657616, "loss": 0.372, "mean_token_accuracy": 0.9070643186569214, "num_tokens": 355712.0, "step": 17 }, { "epoch": 0.22784810126582278, "grad_norm": 0.44067713618278503, "learning_rate": 0.00019923874174311394, "loss": 0.308, "mean_token_accuracy": 0.9210803508758545, "num_tokens": 376658.0, "step": 18 }, { "epoch": 0.24050632911392406, "grad_norm": 0.3857305645942688, "learning_rate": 0.00019906045508738228, "loss": 0.3021, "mean_token_accuracy": 0.9239698648452759, "num_tokens": 396622.0, "step": 19 }, { "epoch": 0.25316455696202533, "grad_norm": 0.4351586699485779, "learning_rate": 0.00019886352515311134, "loss": 0.2879, "mean_token_accuracy": 0.9282914400100708, "num_tokens": 417604.0, "step": 20 }, { "epoch": 0.26582278481012656, "grad_norm": 0.3039501905441284, "learning_rate": 0.00019864798900271532, "loss": 0.2892, "mean_token_accuracy": 0.9262740015983582, "num_tokens": 438312.0, "step": 21 }, { "epoch": 0.27848101265822783, "grad_norm": 0.30652645230293274, "learning_rate": 0.00019841388720031727, "loss": 0.2586, "mean_token_accuracy": 0.9390592575073242, "num_tokens": 460742.0, "step": 22 }, { "epoch": 0.2911392405063291, "grad_norm": 0.27710649371147156, "learning_rate": 0.00019816126380411476, "loss": 0.2507, "mean_token_accuracy": 0.9424484968185425, "num_tokens": 481292.0, "step": 23 }, { "epoch": 0.3037974683544304, "grad_norm": 0.31043171882629395, "learning_rate": 0.00019789016635808837, "loss": 0.244, "mean_token_accuracy": 0.9382171034812927, "num_tokens": 502883.0, "step": 24 }, { "epoch": 0.31645569620253167, "grad_norm": 0.26763108372688293, "learning_rate": 0.00019760064588305345, "loss": 0.2112, "mean_token_accuracy": 0.9468953013420105, "num_tokens": 524527.0, "step": 25 }, { "epoch": 0.3291139240506329, "grad_norm": 0.271287202835083, "learning_rate": 0.0001972927568670583, "loss": 0.2468, "mean_token_accuracy": 0.9391064643859863, "num_tokens": 543460.0, "step": 26 }, { "epoch": 0.34177215189873417, "grad_norm": 0.20461638271808624, "learning_rate": 0.00019696655725512933, "loss": 0.194, "mean_token_accuracy": 0.9515607357025146, "num_tokens": 568256.0, "step": 27 }, { "epoch": 0.35443037974683544, "grad_norm": 0.268459290266037, "learning_rate": 0.00019662210843836574, "loss": 0.2181, "mean_token_accuracy": 0.9476127624511719, "num_tokens": 590291.0, "step": 28 }, { "epoch": 0.3670886075949367, "grad_norm": 0.3005685806274414, "learning_rate": 0.00019625947524238563, "loss": 0.2215, "mean_token_accuracy": 0.9442426562309265, "num_tokens": 613204.0, "step": 29 }, { "epoch": 0.379746835443038, "grad_norm": 0.22735565900802612, "learning_rate": 0.0001958787259151258, "loss": 0.211, "mean_token_accuracy": 0.9458523392677307, "num_tokens": 634063.0, "step": 30 }, { "epoch": 0.3924050632911392, "grad_norm": 0.2072056382894516, "learning_rate": 0.0001954799321139975, "loss": 0.2294, "mean_token_accuracy": 0.9439746141433716, "num_tokens": 654939.0, "step": 31 }, { "epoch": 0.4050632911392405, "grad_norm": 0.24833987653255463, "learning_rate": 0.00019506316889240027, "loss": 0.2311, "mean_token_accuracy": 0.9401175379753113, "num_tokens": 676779.0, "step": 32 }, { "epoch": 0.4177215189873418, "grad_norm": 0.21333575248718262, "learning_rate": 0.0001946285146855968, "loss": 0.2074, "mean_token_accuracy": 0.9479069113731384, "num_tokens": 698151.0, "step": 33 }, { "epoch": 0.43037974683544306, "grad_norm": 0.28180328011512756, "learning_rate": 0.00019417605129595157, "loss": 0.2039, "mean_token_accuracy": 0.9491313099861145, "num_tokens": 718994.0, "step": 34 }, { "epoch": 0.4430379746835443, "grad_norm": 0.20438188314437866, "learning_rate": 0.0001937058638775353, "loss": 0.1828, "mean_token_accuracy": 0.9527903199195862, "num_tokens": 740812.0, "step": 35 }, { "epoch": 0.45569620253164556, "grad_norm": 0.1980065107345581, "learning_rate": 0.00019321804092009906, "loss": 0.2165, "mean_token_accuracy": 0.9470421671867371, "num_tokens": 761685.0, "step": 36 }, { "epoch": 0.46835443037974683, "grad_norm": 0.21566878259181976, "learning_rate": 0.00019271267423242024, "loss": 0.2252, "mean_token_accuracy": 0.943629801273346, "num_tokens": 783640.0, "step": 37 }, { "epoch": 0.4810126582278481, "grad_norm": 0.2180386781692505, "learning_rate": 0.0001921898589250242, "loss": 0.2315, "mean_token_accuracy": 0.9406498670578003, "num_tokens": 803923.0, "step": 38 }, { "epoch": 0.4936708860759494, "grad_norm": 0.18960478901863098, "learning_rate": 0.00019164969339228422, "loss": 0.1903, "mean_token_accuracy": 0.9512442350387573, "num_tokens": 824723.0, "step": 39 }, { "epoch": 0.5063291139240507, "grad_norm": 0.24511095881462097, "learning_rate": 0.00019109227929390378, "loss": 0.2529, "mean_token_accuracy": 0.9372138381004333, "num_tokens": 845317.0, "step": 40 }, { "epoch": 0.5189873417721519, "grad_norm": 0.1957797110080719, "learning_rate": 0.00019051772153578389, "loss": 0.1883, "mean_token_accuracy": 0.9512593746185303, "num_tokens": 867416.0, "step": 41 }, { "epoch": 0.5316455696202531, "grad_norm": 0.2206275761127472, "learning_rate": 0.00018992612825027976, "loss": 0.2162, "mean_token_accuracy": 0.9448105692863464, "num_tokens": 886904.0, "step": 42 }, { "epoch": 0.5443037974683544, "grad_norm": 0.19612912833690643, "learning_rate": 0.00018931761077585035, "loss": 0.1981, "mean_token_accuracy": 0.9489004611968994, "num_tokens": 908886.0, "step": 43 }, { "epoch": 0.5569620253164557, "grad_norm": 0.22512373328208923, "learning_rate": 0.00018869228363610404, "loss": 0.2256, "mean_token_accuracy": 0.9439067840576172, "num_tokens": 929202.0, "step": 44 }, { "epoch": 0.569620253164557, "grad_norm": 0.2119680941104889, "learning_rate": 0.00018805026451824546, "loss": 0.1845, "mean_token_accuracy": 0.9552789926528931, "num_tokens": 949033.0, "step": 45 }, { "epoch": 0.5822784810126582, "grad_norm": 0.1732683926820755, "learning_rate": 0.00018739167425092644, "loss": 0.1919, "mean_token_accuracy": 0.9519040584564209, "num_tokens": 971365.0, "step": 46 }, { "epoch": 0.5949367088607594, "grad_norm": 0.18628673255443573, "learning_rate": 0.00018671663678150607, "loss": 0.1985, "mean_token_accuracy": 0.9494044780731201, "num_tokens": 990739.0, "step": 47 }, { "epoch": 0.6075949367088608, "grad_norm": 0.2027333527803421, "learning_rate": 0.0001860252791527236, "loss": 0.229, "mean_token_accuracy": 0.9417348504066467, "num_tokens": 1011450.0, "step": 48 }, { "epoch": 0.620253164556962, "grad_norm": 0.17826716601848602, "learning_rate": 0.00018531773147878895, "loss": 0.2044, "mean_token_accuracy": 0.9504271149635315, "num_tokens": 1031182.0, "step": 49 }, { "epoch": 0.6329113924050633, "grad_norm": 0.18673086166381836, "learning_rate": 0.00018459412692089494, "loss": 0.1769, "mean_token_accuracy": 0.9546067118644714, "num_tokens": 1054994.0, "step": 50 }, { "epoch": 0.6455696202531646, "grad_norm": 0.18725241720676422, "learning_rate": 0.00018385460166215638, "loss": 0.1853, "mean_token_accuracy": 0.9533385038375854, "num_tokens": 1075696.0, "step": 51 }, { "epoch": 0.6582278481012658, "grad_norm": 0.23499581217765808, "learning_rate": 0.00018309929488198012, "loss": 0.222, "mean_token_accuracy": 0.944871187210083, "num_tokens": 1098543.0, "step": 52 }, { "epoch": 0.6708860759493671, "grad_norm": 0.20952437818050385, "learning_rate": 0.00018232834872987147, "loss": 0.163, "mean_token_accuracy": 0.9581373333930969, "num_tokens": 1119652.0, "step": 53 }, { "epoch": 0.6835443037974683, "grad_norm": 0.342645525932312, "learning_rate": 0.0001815419082986815, "loss": 0.2146, "mean_token_accuracy": 0.948540985584259, "num_tokens": 1141306.0, "step": 54 }, { "epoch": 0.6962025316455697, "grad_norm": 0.18588639795780182, "learning_rate": 0.00018074012159730032, "loss": 0.1858, "mean_token_accuracy": 0.9529316425323486, "num_tokens": 1161171.0, "step": 55 }, { "epoch": 0.7088607594936709, "grad_norm": 0.18335570394992828, "learning_rate": 0.00017992313952280172, "loss": 0.1939, "mean_token_accuracy": 0.950637936592102, "num_tokens": 1181534.0, "step": 56 }, { "epoch": 0.7215189873417721, "grad_norm": 0.1759781688451767, "learning_rate": 0.00017909111583204422, "loss": 0.1681, "mean_token_accuracy": 0.9576790928840637, "num_tokens": 1201659.0, "step": 57 }, { "epoch": 0.7341772151898734, "grad_norm": 0.1828421950340271, "learning_rate": 0.0001782442071127338, "loss": 0.2227, "mean_token_accuracy": 0.9445362091064453, "num_tokens": 1222313.0, "step": 58 }, { "epoch": 0.7468354430379747, "grad_norm": 0.20731791853904724, "learning_rate": 0.00017738257275395404, "loss": 0.1615, "mean_token_accuracy": 0.9587121605873108, "num_tokens": 1242286.0, "step": 59 }, { "epoch": 0.759493670886076, "grad_norm": 0.1657421737909317, "learning_rate": 0.0001765063749161688, "loss": 0.1769, "mean_token_accuracy": 0.9534204006195068, "num_tokens": 1262874.0, "step": 60 }, { "epoch": 0.7721518987341772, "grad_norm": 0.17372827231884003, "learning_rate": 0.00017561577850070355, "loss": 0.1975, "mean_token_accuracy": 0.9501790404319763, "num_tokens": 1282769.0, "step": 61 }, { "epoch": 0.7848101265822784, "grad_norm": 0.2345019429922104, "learning_rate": 0.00017471095111871074, "loss": 0.2136, "mean_token_accuracy": 0.9452736377716064, "num_tokens": 1304139.0, "step": 62 }, { "epoch": 0.7974683544303798, "grad_norm": 0.18278631567955017, "learning_rate": 0.00017379206305962526, "loss": 0.2205, "mean_token_accuracy": 0.9442360997200012, "num_tokens": 1324467.0, "step": 63 }, { "epoch": 0.810126582278481, "grad_norm": 0.19478175044059753, "learning_rate": 0.00017285928725911562, "loss": 0.1677, "mean_token_accuracy": 0.957406759262085, "num_tokens": 1345262.0, "step": 64 }, { "epoch": 0.8227848101265823, "grad_norm": 0.16885536909103394, "learning_rate": 0.00017191279926653761, "loss": 0.1859, "mean_token_accuracy": 0.9530674815177917, "num_tokens": 1368700.0, "step": 65 }, { "epoch": 0.8354430379746836, "grad_norm": 0.20440581440925598, "learning_rate": 0.00017095277721189528, "loss": 0.1805, "mean_token_accuracy": 0.9521450400352478, "num_tokens": 1388344.0, "step": 66 }, { "epoch": 0.8481012658227848, "grad_norm": 0.19661499559879303, "learning_rate": 0.00016997940177231722, "loss": 0.1758, "mean_token_accuracy": 0.9565622806549072, "num_tokens": 1407723.0, "step": 67 }, { "epoch": 0.8607594936708861, "grad_norm": 0.18348322808742523, "learning_rate": 0.00016899285613805246, "loss": 0.172, "mean_token_accuracy": 0.9548096060752869, "num_tokens": 1427747.0, "step": 68 }, { "epoch": 0.8734177215189873, "grad_norm": 0.16349603235721588, "learning_rate": 0.00016799332597799413, "loss": 0.1429, "mean_token_accuracy": 0.9632624983787537, "num_tokens": 1446729.0, "step": 69 }, { "epoch": 0.8860759493670886, "grad_norm": 0.19582310318946838, "learning_rate": 0.0001669809994047364, "loss": 0.1768, "mean_token_accuracy": 0.9543310403823853, "num_tokens": 1466084.0, "step": 70 }, { "epoch": 0.8987341772151899, "grad_norm": 0.19498325884342194, "learning_rate": 0.00016595606693917142, "loss": 0.1891, "mean_token_accuracy": 0.954316258430481, "num_tokens": 1485783.0, "step": 71 }, { "epoch": 0.9113924050632911, "grad_norm": 0.16052420437335968, "learning_rate": 0.00016491872147463306, "loss": 0.1587, "mean_token_accuracy": 0.9606679677963257, "num_tokens": 1505907.0, "step": 72 }, { "epoch": 0.9240506329113924, "grad_norm": 0.16272246837615967, "learning_rate": 0.00016386915824059427, "loss": 0.1668, "mean_token_accuracy": 0.9579792618751526, "num_tokens": 1527389.0, "step": 73 }, { "epoch": 0.9367088607594937, "grad_norm": 0.16647444665431976, "learning_rate": 0.00016280757476592466, "loss": 0.1536, "mean_token_accuracy": 0.960762083530426, "num_tokens": 1547714.0, "step": 74 }, { "epoch": 0.9493670886075949, "grad_norm": 0.1784556359052658, "learning_rate": 0.00016173417084171536, "loss": 0.1924, "mean_token_accuracy": 0.9510428309440613, "num_tokens": 1567244.0, "step": 75 }, { "epoch": 0.9620253164556962, "grad_norm": 0.15793780982494354, "learning_rate": 0.0001606491484836782, "loss": 0.1757, "mean_token_accuracy": 0.954423725605011, "num_tokens": 1586726.0, "step": 76 }, { "epoch": 0.9746835443037974, "grad_norm": 0.1410311460494995, "learning_rate": 0.00015955271189412598, "loss": 0.1393, "mean_token_accuracy": 0.9642706513404846, "num_tokens": 1608089.0, "step": 77 }, { "epoch": 0.9873417721518988, "grad_norm": 0.2086767852306366, "learning_rate": 0.00015844506742354164, "loss": 0.2087, "mean_token_accuracy": 0.9479678869247437, "num_tokens": 1629313.0, "step": 78 }, { "epoch": 1.0, "grad_norm": 0.1745402216911316, "learning_rate": 0.00015732642353174259, "loss": 0.1402, "mean_token_accuracy": 0.9628644585609436, "num_tokens": 1649681.0, "step": 79 }, { "epoch": 1.0126582278481013, "grad_norm": 0.14212512969970703, "learning_rate": 0.00015619699074864864, "loss": 0.1281, "mean_token_accuracy": 0.9649726152420044, "num_tokens": 1668359.0, "step": 80 }, { "epoch": 1.0253164556962024, "grad_norm": 0.13101430237293243, "learning_rate": 0.00015505698163465986, "loss": 0.1189, "mean_token_accuracy": 0.9688678979873657, "num_tokens": 1689623.0, "step": 81 }, { "epoch": 1.0379746835443038, "grad_norm": 0.14908701181411743, "learning_rate": 0.00015390661074065256, "loss": 0.1313, "mean_token_accuracy": 0.9633692502975464, "num_tokens": 1710380.0, "step": 82 }, { "epoch": 1.0506329113924051, "grad_norm": 0.16834689676761627, "learning_rate": 0.00015274609456760073, "loss": 0.1236, "mean_token_accuracy": 0.9671345949172974, "num_tokens": 1731530.0, "step": 83 }, { "epoch": 1.0632911392405062, "grad_norm": 0.1714702993631363, "learning_rate": 0.00015157565152583002, "loss": 0.1343, "mean_token_accuracy": 0.9642593860626221, "num_tokens": 1751963.0, "step": 84 }, { "epoch": 1.0759493670886076, "grad_norm": 0.18395373225212097, "learning_rate": 0.00015039550189391298, "loss": 0.1179, "mean_token_accuracy": 0.96883624792099, "num_tokens": 1773398.0, "step": 85 }, { "epoch": 1.0886075949367089, "grad_norm": 0.18526509404182434, "learning_rate": 0.0001492058677772123, "loss": 0.1327, "mean_token_accuracy": 0.9650301337242126, "num_tokens": 1793851.0, "step": 86 }, { "epoch": 1.1012658227848102, "grad_norm": 0.1679631620645523, "learning_rate": 0.00014800697306608044, "loss": 0.1273, "mean_token_accuracy": 0.9668911099433899, "num_tokens": 1813668.0, "step": 87 }, { "epoch": 1.1139240506329113, "grad_norm": 0.15644878149032593, "learning_rate": 0.00014679904339372302, "loss": 0.1319, "mean_token_accuracy": 0.9673177599906921, "num_tokens": 1834875.0, "step": 88 }, { "epoch": 1.1265822784810127, "grad_norm": 0.18947693705558777, "learning_rate": 0.0001455823060937347, "loss": 0.1499, "mean_token_accuracy": 0.9611180424690247, "num_tokens": 1855797.0, "step": 89 }, { "epoch": 1.139240506329114, "grad_norm": 0.15163911879062653, "learning_rate": 0.00014435699015731448, "loss": 0.1419, "mean_token_accuracy": 0.9620731472969055, "num_tokens": 1875715.0, "step": 90 }, { "epoch": 1.1518987341772151, "grad_norm": 0.1474975049495697, "learning_rate": 0.00014312332619016965, "loss": 0.1245, "mean_token_accuracy": 0.9681270718574524, "num_tokens": 1895294.0, "step": 91 }, { "epoch": 1.1645569620253164, "grad_norm": 0.19832119345664978, "learning_rate": 0.00014188154636911524, "loss": 0.1472, "mean_token_accuracy": 0.9617631435394287, "num_tokens": 1916411.0, "step": 92 }, { "epoch": 1.1772151898734178, "grad_norm": 0.14573758840560913, "learning_rate": 0.00014063188439837832, "loss": 0.1152, "mean_token_accuracy": 0.9696823954582214, "num_tokens": 1939300.0, "step": 93 }, { "epoch": 1.189873417721519, "grad_norm": 0.17945419251918793, "learning_rate": 0.0001393745754656146, "loss": 0.1419, "mean_token_accuracy": 0.9620354175567627, "num_tokens": 1960647.0, "step": 94 }, { "epoch": 1.2025316455696202, "grad_norm": 0.2099403440952301, "learning_rate": 0.00013810985619764572, "loss": 0.1442, "mean_token_accuracy": 0.9616883397102356, "num_tokens": 1980470.0, "step": 95 }, { "epoch": 1.2151898734177216, "grad_norm": 0.14469695091247559, "learning_rate": 0.00013683796461592604, "loss": 0.1152, "mean_token_accuracy": 0.9697718620300293, "num_tokens": 2001177.0, "step": 96 }, { "epoch": 1.2278481012658227, "grad_norm": 0.1826285570859909, "learning_rate": 0.00013555914009174663, "loss": 0.149, "mean_token_accuracy": 0.9613690376281738, "num_tokens": 2021898.0, "step": 97 }, { "epoch": 1.240506329113924, "grad_norm": 0.18723325431346893, "learning_rate": 0.00013427362330118543, "loss": 0.1543, "mean_token_accuracy": 0.9578179121017456, "num_tokens": 2043061.0, "step": 98 }, { "epoch": 1.2531645569620253, "grad_norm": 0.16736926138401031, "learning_rate": 0.00013298165617981172, "loss": 0.121, "mean_token_accuracy": 0.9673892855644226, "num_tokens": 2064713.0, "step": 99 }, { "epoch": 1.2658227848101267, "grad_norm": 0.14512582123279572, "learning_rate": 0.0001316834818771535, "loss": 0.131, "mean_token_accuracy": 0.9658250212669373, "num_tokens": 2085728.0, "step": 100 }, { "epoch": 1.2784810126582278, "grad_norm": 0.1532108336687088, "learning_rate": 0.00013037934471093682, "loss": 0.105, "mean_token_accuracy": 0.9721629619598389, "num_tokens": 2105945.0, "step": 101 }, { "epoch": 1.2911392405063291, "grad_norm": 0.16162677109241486, "learning_rate": 0.00012906949012110456, "loss": 0.119, "mean_token_accuracy": 0.9679898619651794, "num_tokens": 2128127.0, "step": 102 }, { "epoch": 1.3037974683544304, "grad_norm": 0.15701304376125336, "learning_rate": 0.00012775416462362457, "loss": 0.1243, "mean_token_accuracy": 0.9664501547813416, "num_tokens": 2147744.0, "step": 103 }, { "epoch": 1.3164556962025316, "grad_norm": 0.19801859557628632, "learning_rate": 0.00012643361576409516, "loss": 0.1135, "mean_token_accuracy": 0.9700688719749451, "num_tokens": 2167119.0, "step": 104 }, { "epoch": 1.3291139240506329, "grad_norm": 0.14806534349918365, "learning_rate": 0.00012510809207115666, "loss": 0.1136, "mean_token_accuracy": 0.9694877862930298, "num_tokens": 2188912.0, "step": 105 }, { "epoch": 1.3417721518987342, "grad_norm": 0.17883673310279846, "learning_rate": 0.00012377784300971807, "loss": 0.1329, "mean_token_accuracy": 0.9641534090042114, "num_tokens": 2210568.0, "step": 106 }, { "epoch": 1.3544303797468356, "grad_norm": 0.19047731161117554, "learning_rate": 0.00012244311893400763, "loss": 0.1197, "mean_token_accuracy": 0.9685088396072388, "num_tokens": 2233051.0, "step": 107 }, { "epoch": 1.3670886075949367, "grad_norm": 0.1676148772239685, "learning_rate": 0.00012110417104045575, "loss": 0.119, "mean_token_accuracy": 0.9676389694213867, "num_tokens": 2255364.0, "step": 108 }, { "epoch": 1.379746835443038, "grad_norm": 0.14473366737365723, "learning_rate": 0.00011976125132041974, "loss": 0.1093, "mean_token_accuracy": 0.9687408804893494, "num_tokens": 2275998.0, "step": 109 }, { "epoch": 1.3924050632911391, "grad_norm": 0.1363905370235443, "learning_rate": 0.00011841461251275867, "loss": 0.1225, "mean_token_accuracy": 0.9674336910247803, "num_tokens": 2298877.0, "step": 110 }, { "epoch": 1.4050632911392404, "grad_norm": 0.15403813123703003, "learning_rate": 0.0001170645080562676, "loss": 0.1195, "mean_token_accuracy": 0.9666731357574463, "num_tokens": 2319495.0, "step": 111 }, { "epoch": 1.4177215189873418, "grad_norm": 0.12701380252838135, "learning_rate": 0.00011571119204198037, "loss": 0.1108, "mean_token_accuracy": 0.9725146293640137, "num_tokens": 2341789.0, "step": 112 }, { "epoch": 1.4303797468354431, "grad_norm": 0.15826545655727386, "learning_rate": 0.00011435491916534919, "loss": 0.1219, "mean_token_accuracy": 0.967819094657898, "num_tokens": 2360249.0, "step": 113 }, { "epoch": 1.4430379746835442, "grad_norm": 0.14779576659202576, "learning_rate": 0.00011299594467831078, "loss": 0.1067, "mean_token_accuracy": 0.9703106880187988, "num_tokens": 2379175.0, "step": 114 }, { "epoch": 1.4556962025316456, "grad_norm": 0.15034395456314087, "learning_rate": 0.00011163452434124773, "loss": 0.123, "mean_token_accuracy": 0.9687133431434631, "num_tokens": 2401389.0, "step": 115 }, { "epoch": 1.4683544303797469, "grad_norm": 0.1711132824420929, "learning_rate": 0.00011027091437485404, "loss": 0.1106, "mean_token_accuracy": 0.9697067141532898, "num_tokens": 2423207.0, "step": 116 }, { "epoch": 1.481012658227848, "grad_norm": 0.15965788066387177, "learning_rate": 0.00010890537141191417, "loss": 0.1188, "mean_token_accuracy": 0.966696560382843, "num_tokens": 2444470.0, "step": 117 }, { "epoch": 1.4936708860759493, "grad_norm": 0.1709423065185547, "learning_rate": 0.00010753815244900458, "loss": 0.1414, "mean_token_accuracy": 0.9635064005851746, "num_tokens": 2465798.0, "step": 118 }, { "epoch": 1.5063291139240507, "grad_norm": 0.16524891555309296, "learning_rate": 0.00010616951479812658, "loss": 0.1198, "mean_token_accuracy": 0.9672353863716125, "num_tokens": 2486494.0, "step": 119 }, { "epoch": 1.518987341772152, "grad_norm": 0.1784825325012207, "learning_rate": 0.00010479971603828, "loss": 0.122, "mean_token_accuracy": 0.9669795632362366, "num_tokens": 2507757.0, "step": 120 }, { "epoch": 1.5316455696202531, "grad_norm": 0.18025313317775726, "learning_rate": 0.00010342901396698659, "loss": 0.1217, "mean_token_accuracy": 0.9672725796699524, "num_tokens": 2528507.0, "step": 121 }, { "epoch": 1.5443037974683544, "grad_norm": 0.15038174390792847, "learning_rate": 0.00010205766655177215, "loss": 0.1047, "mean_token_accuracy": 0.9724980592727661, "num_tokens": 2550424.0, "step": 122 }, { "epoch": 1.5569620253164556, "grad_norm": 0.14482751488685608, "learning_rate": 0.00010068593188161697, "loss": 0.1171, "mean_token_accuracy": 0.9675801396369934, "num_tokens": 2569828.0, "step": 123 }, { "epoch": 1.5696202531645569, "grad_norm": 0.13739396631717682, "learning_rate": 9.931406811838308e-05, "loss": 0.1, "mean_token_accuracy": 0.973212718963623, "num_tokens": 2592776.0, "step": 124 }, { "epoch": 1.5822784810126582, "grad_norm": 0.15288740396499634, "learning_rate": 9.79423334482279e-05, "loss": 0.1221, "mean_token_accuracy": 0.9669612646102905, "num_tokens": 2612302.0, "step": 125 }, { "epoch": 1.5949367088607596, "grad_norm": 0.21149307489395142, "learning_rate": 9.657098603301346e-05, "loss": 0.1232, "mean_token_accuracy": 0.9651282429695129, "num_tokens": 2631780.0, "step": 126 }, { "epoch": 1.6075949367088609, "grad_norm": 0.1493978202342987, "learning_rate": 9.520028396172003e-05, "loss": 0.1189, "mean_token_accuracy": 0.9693233966827393, "num_tokens": 2652772.0, "step": 127 }, { "epoch": 1.620253164556962, "grad_norm": 0.13895590603351593, "learning_rate": 9.383048520187344e-05, "loss": 0.0915, "mean_token_accuracy": 0.9748296141624451, "num_tokens": 2674846.0, "step": 128 }, { "epoch": 1.6329113924050633, "grad_norm": 0.1659339815378189, "learning_rate": 9.246184755099545e-05, "loss": 0.1304, "mean_token_accuracy": 0.9650869369506836, "num_tokens": 2695504.0, "step": 129 }, { "epoch": 1.6455696202531644, "grad_norm": 0.18495714664459229, "learning_rate": 9.109462858808586e-05, "loss": 0.1345, "mean_token_accuracy": 0.9641679525375366, "num_tokens": 2716499.0, "step": 130 }, { "epoch": 1.6582278481012658, "grad_norm": 0.1656477451324463, "learning_rate": 8.972908562514598e-05, "loss": 0.1257, "mean_token_accuracy": 0.9681254029273987, "num_tokens": 2739528.0, "step": 131 }, { "epoch": 1.6708860759493671, "grad_norm": 0.17554399371147156, "learning_rate": 8.836547565875227e-05, "loss": 0.1418, "mean_token_accuracy": 0.961998462677002, "num_tokens": 2761749.0, "step": 132 }, { "epoch": 1.6835443037974684, "grad_norm": 0.15592941641807556, "learning_rate": 8.70040553216892e-05, "loss": 0.1148, "mean_token_accuracy": 0.9690976142883301, "num_tokens": 2781682.0, "step": 133 }, { "epoch": 1.6962025316455698, "grad_norm": 0.1496342271566391, "learning_rate": 8.564508083465079e-05, "loss": 0.1133, "mean_token_accuracy": 0.9688509702682495, "num_tokens": 2801554.0, "step": 134 }, { "epoch": 1.7088607594936709, "grad_norm": 0.2020542472600937, "learning_rate": 8.428880795801965e-05, "loss": 0.1479, "mean_token_accuracy": 0.9599217772483826, "num_tokens": 2821055.0, "step": 135 }, { "epoch": 1.721518987341772, "grad_norm": 0.176243856549263, "learning_rate": 8.293549194373243e-05, "loss": 0.1214, "mean_token_accuracy": 0.967559278011322, "num_tokens": 2841957.0, "step": 136 }, { "epoch": 1.7341772151898733, "grad_norm": 0.15299445390701294, "learning_rate": 8.158538748724139e-05, "loss": 0.1053, "mean_token_accuracy": 0.9709796905517578, "num_tokens": 2863661.0, "step": 137 }, { "epoch": 1.7468354430379747, "grad_norm": 0.1839250922203064, "learning_rate": 8.023874867958027e-05, "loss": 0.1235, "mean_token_accuracy": 0.967279851436615, "num_tokens": 2883621.0, "step": 138 }, { "epoch": 1.759493670886076, "grad_norm": 0.11831887066364288, "learning_rate": 7.889582895954427e-05, "loss": 0.0941, "mean_token_accuracy": 0.9745250344276428, "num_tokens": 2904529.0, "step": 139 }, { "epoch": 1.7721518987341773, "grad_norm": 0.1413291096687317, "learning_rate": 7.755688106599241e-05, "loss": 0.1114, "mean_token_accuracy": 0.968601405620575, "num_tokens": 2923097.0, "step": 140 }, { "epoch": 1.7848101265822784, "grad_norm": 0.1475374400615692, "learning_rate": 7.622215699028196e-05, "loss": 0.1143, "mean_token_accuracy": 0.9688102006912231, "num_tokens": 2942366.0, "step": 141 }, { "epoch": 1.7974683544303798, "grad_norm": 0.1440063714981079, "learning_rate": 7.489190792884338e-05, "loss": 0.1139, "mean_token_accuracy": 0.9701301455497742, "num_tokens": 2965095.0, "step": 142 }, { "epoch": 1.810126582278481, "grad_norm": 0.1474955677986145, "learning_rate": 7.356638423590485e-05, "loss": 0.1299, "mean_token_accuracy": 0.9650708436965942, "num_tokens": 2986402.0, "step": 143 }, { "epoch": 1.8227848101265822, "grad_norm": 0.13343898952007294, "learning_rate": 7.224583537637544e-05, "loss": 0.1, "mean_token_accuracy": 0.9724212288856506, "num_tokens": 3006844.0, "step": 144 }, { "epoch": 1.8354430379746836, "grad_norm": 0.1628241240978241, "learning_rate": 7.093050987889547e-05, "loss": 0.1064, "mean_token_accuracy": 0.9713687896728516, "num_tokens": 3027934.0, "step": 145 }, { "epoch": 1.8481012658227849, "grad_norm": 0.18010802567005157, "learning_rate": 6.96206552890632e-05, "loss": 0.1346, "mean_token_accuracy": 0.9642553329467773, "num_tokens": 3047973.0, "step": 146 }, { "epoch": 1.8607594936708862, "grad_norm": 0.1424276977777481, "learning_rate": 6.831651812284652e-05, "loss": 0.1023, "mean_token_accuracy": 0.9724918007850647, "num_tokens": 3068540.0, "step": 147 }, { "epoch": 1.8734177215189873, "grad_norm": 0.16791187226772308, "learning_rate": 6.701834382018832e-05, "loss": 0.1372, "mean_token_accuracy": 0.9635747075080872, "num_tokens": 3089551.0, "step": 148 }, { "epoch": 1.8860759493670884, "grad_norm": 0.15886037051677704, "learning_rate": 6.572637669881458e-05, "loss": 0.1203, "mean_token_accuracy": 0.9681239724159241, "num_tokens": 3109881.0, "step": 149 }, { "epoch": 1.8987341772151898, "grad_norm": 0.15515190362930298, "learning_rate": 6.444085990825338e-05, "loss": 0.1274, "mean_token_accuracy": 0.967353343963623, "num_tokens": 3129702.0, "step": 150 }, { "epoch": 1.9113924050632911, "grad_norm": 0.15266196429729462, "learning_rate": 6.316203538407397e-05, "loss": 0.1059, "mean_token_accuracy": 0.9698867797851562, "num_tokens": 3149724.0, "step": 151 }, { "epoch": 1.9240506329113924, "grad_norm": 0.15055519342422485, "learning_rate": 6.18901438023543e-05, "loss": 0.104, "mean_token_accuracy": 0.97203129529953, "num_tokens": 3170883.0, "step": 152 }, { "epoch": 1.9367088607594938, "grad_norm": 0.14458802342414856, "learning_rate": 6.0625424534385425e-05, "loss": 0.1089, "mean_token_accuracy": 0.9710777997970581, "num_tokens": 3192695.0, "step": 153 }, { "epoch": 1.9493670886075949, "grad_norm": 0.13979317247867584, "learning_rate": 5.936811560162169e-05, "loss": 0.0934, "mean_token_accuracy": 0.9752629995346069, "num_tokens": 3213578.0, "step": 154 }, { "epoch": 1.9620253164556962, "grad_norm": 0.16508439183235168, "learning_rate": 5.811845363088477e-05, "loss": 0.1063, "mean_token_accuracy": 0.9713494181632996, "num_tokens": 3235666.0, "step": 155 }, { "epoch": 1.9746835443037973, "grad_norm": 0.1382744163274765, "learning_rate": 5.687667380983037e-05, "loss": 0.1046, "mean_token_accuracy": 0.9724194407463074, "num_tokens": 3256433.0, "step": 156 }, { "epoch": 1.9873417721518987, "grad_norm": 0.15038706362247467, "learning_rate": 5.5643009842685554e-05, "loss": 0.1107, "mean_token_accuracy": 0.9704877138137817, "num_tokens": 3279030.0, "step": 157 }, { "epoch": 2.0, "grad_norm": 0.11997652798891068, "learning_rate": 5.4417693906265365e-05, "loss": 0.0832, "mean_token_accuracy": 0.9756409525871277, "num_tokens": 3297855.0, "step": 158 }, { "epoch": 2.0126582278481013, "grad_norm": 0.12818469107151031, "learning_rate": 5.3200956606277006e-05, "loss": 0.1002, "mean_token_accuracy": 0.9725956320762634, "num_tokens": 3319193.0, "step": 159 }, { "epoch": 2.0253164556962027, "grad_norm": 0.14221195876598358, "learning_rate": 5.199302693391959e-05, "loss": 0.1014, "mean_token_accuracy": 0.9717661142349243, "num_tokens": 3339658.0, "step": 160 }, { "epoch": 2.037974683544304, "grad_norm": 0.13688071072101593, "learning_rate": 5.0794132222787707e-05, "loss": 0.0942, "mean_token_accuracy": 0.9738968014717102, "num_tokens": 3361635.0, "step": 161 }, { "epoch": 2.050632911392405, "grad_norm": 0.11703404784202576, "learning_rate": 4.960449810608705e-05, "loss": 0.0804, "mean_token_accuracy": 0.9769234657287598, "num_tokens": 3382326.0, "step": 162 }, { "epoch": 2.0632911392405062, "grad_norm": 0.13432802259922028, "learning_rate": 4.8424348474170014e-05, "loss": 0.0857, "mean_token_accuracy": 0.9762054085731506, "num_tokens": 3403109.0, "step": 163 }, { "epoch": 2.0759493670886076, "grad_norm": 0.12041960656642914, "learning_rate": 4.725390543239929e-05, "loss": 0.073, "mean_token_accuracy": 0.978657066822052, "num_tokens": 3425616.0, "step": 164 }, { "epoch": 2.088607594936709, "grad_norm": 0.18753547966480255, "learning_rate": 4.609338925934743e-05, "loss": 0.0893, "mean_token_accuracy": 0.9740729928016663, "num_tokens": 3445852.0, "step": 165 }, { "epoch": 2.1012658227848102, "grad_norm": 0.17938809096813202, "learning_rate": 4.494301836534016e-05, "loss": 0.0875, "mean_token_accuracy": 0.9756035208702087, "num_tokens": 3465427.0, "step": 166 }, { "epoch": 2.1139240506329116, "grad_norm": 0.18644244968891144, "learning_rate": 4.380300925135138e-05, "loss": 0.0844, "mean_token_accuracy": 0.9756962060928345, "num_tokens": 3485529.0, "step": 167 }, { "epoch": 2.1265822784810124, "grad_norm": 0.17335088551044464, "learning_rate": 4.267357646825746e-05, "loss": 0.0814, "mean_token_accuracy": 0.9768072962760925, "num_tokens": 3506591.0, "step": 168 }, { "epoch": 2.1392405063291138, "grad_norm": 0.21782517433166504, "learning_rate": 4.1554932576458415e-05, "loss": 0.1137, "mean_token_accuracy": 0.9687607288360596, "num_tokens": 3527014.0, "step": 169 }, { "epoch": 2.151898734177215, "grad_norm": 0.20455828309059143, "learning_rate": 4.044728810587406e-05, "loss": 0.0962, "mean_token_accuracy": 0.9728721976280212, "num_tokens": 3548532.0, "step": 170 }, { "epoch": 2.1645569620253164, "grad_norm": 0.146736741065979, "learning_rate": 3.935085151632185e-05, "loss": 0.0808, "mean_token_accuracy": 0.978145182132721, "num_tokens": 3571337.0, "step": 171 }, { "epoch": 2.1772151898734178, "grad_norm": 0.1688258796930313, "learning_rate": 3.826582915828468e-05, "loss": 0.0881, "mean_token_accuracy": 0.9753274321556091, "num_tokens": 3593085.0, "step": 172 }, { "epoch": 2.189873417721519, "grad_norm": 0.13930419087409973, "learning_rate": 3.719242523407539e-05, "loss": 0.0803, "mean_token_accuracy": 0.9768635034561157, "num_tokens": 3611864.0, "step": 173 }, { "epoch": 2.2025316455696204, "grad_norm": 0.14071966707706451, "learning_rate": 3.613084175940578e-05, "loss": 0.0804, "mean_token_accuracy": 0.9770142436027527, "num_tokens": 3632767.0, "step": 174 }, { "epoch": 2.2151898734177213, "grad_norm": 0.1428343951702118, "learning_rate": 3.508127852536698e-05, "loss": 0.0797, "mean_token_accuracy": 0.9772024154663086, "num_tokens": 3652877.0, "step": 175 }, { "epoch": 2.2278481012658227, "grad_norm": 0.21315431594848633, "learning_rate": 3.4043933060828605e-05, "loss": 0.0888, "mean_token_accuracy": 0.9752591252326965, "num_tokens": 3673393.0, "step": 176 }, { "epoch": 2.240506329113924, "grad_norm": 0.13567057251930237, "learning_rate": 3.3019000595263574e-05, "loss": 0.0723, "mean_token_accuracy": 0.9791584610939026, "num_tokens": 3696248.0, "step": 177 }, { "epoch": 2.2531645569620253, "grad_norm": 0.11285153776407242, "learning_rate": 3.200667402200586e-05, "loss": 0.0714, "mean_token_accuracy": 0.9794472455978394, "num_tokens": 3716358.0, "step": 178 }, { "epoch": 2.2658227848101267, "grad_norm": 0.12942923605442047, "learning_rate": 3.100714386194757e-05, "loss": 0.07, "mean_token_accuracy": 0.9789379239082336, "num_tokens": 3736458.0, "step": 179 }, { "epoch": 2.278481012658228, "grad_norm": 0.16876453161239624, "learning_rate": 3.0020598227682795e-05, "loss": 0.0893, "mean_token_accuracy": 0.9735265970230103, "num_tokens": 3754389.0, "step": 180 }, { "epoch": 2.291139240506329, "grad_norm": 0.15007387101650238, "learning_rate": 2.904722278810471e-05, "loss": 0.077, "mean_token_accuracy": 0.9764189124107361, "num_tokens": 3775614.0, "step": 181 }, { "epoch": 2.3037974683544302, "grad_norm": 0.1313251107931137, "learning_rate": 2.8087200733462425e-05, "loss": 0.0736, "mean_token_accuracy": 0.978974461555481, "num_tokens": 3798222.0, "step": 182 }, { "epoch": 2.3164556962025316, "grad_norm": 0.12241403013467789, "learning_rate": 2.7140712740884376e-05, "loss": 0.0734, "mean_token_accuracy": 0.978549063205719, "num_tokens": 3819031.0, "step": 183 }, { "epoch": 2.329113924050633, "grad_norm": 0.13866658508777618, "learning_rate": 2.6207936940374767e-05, "loss": 0.0856, "mean_token_accuracy": 0.975257158279419, "num_tokens": 3841647.0, "step": 184 }, { "epoch": 2.3417721518987342, "grad_norm": 0.1442888230085373, "learning_rate": 2.5289048881289256e-05, "loss": 0.0747, "mean_token_accuracy": 0.9778075814247131, "num_tokens": 3861853.0, "step": 185 }, { "epoch": 2.3544303797468356, "grad_norm": 0.13721716403961182, "learning_rate": 2.4384221499296466e-05, "loss": 0.0769, "mean_token_accuracy": 0.9777352213859558, "num_tokens": 3881230.0, "step": 186 }, { "epoch": 2.367088607594937, "grad_norm": 0.1602994054555893, "learning_rate": 2.3493625083831217e-05, "loss": 0.0794, "mean_token_accuracy": 0.9766371846199036, "num_tokens": 3900641.0, "step": 187 }, { "epoch": 2.379746835443038, "grad_norm": 0.13312046229839325, "learning_rate": 2.2617427246045973e-05, "loss": 0.0815, "mean_token_accuracy": 0.976757824420929, "num_tokens": 3922863.0, "step": 188 }, { "epoch": 2.392405063291139, "grad_norm": 0.1182788833975792, "learning_rate": 2.1755792887266234e-05, "loss": 0.073, "mean_token_accuracy": 0.9789871573448181, "num_tokens": 3944628.0, "step": 189 }, { "epoch": 2.4050632911392404, "grad_norm": 0.126333549618721, "learning_rate": 2.0908884167955824e-05, "loss": 0.0751, "mean_token_accuracy": 0.9801375865936279, "num_tokens": 3967952.0, "step": 190 }, { "epoch": 2.4177215189873418, "grad_norm": 0.163629412651062, "learning_rate": 2.0076860477198313e-05, "loss": 0.0836, "mean_token_accuracy": 0.9764661192893982, "num_tokens": 3989177.0, "step": 191 }, { "epoch": 2.430379746835443, "grad_norm": 0.14649328589439392, "learning_rate": 1.9259878402699705e-05, "loss": 0.0758, "mean_token_accuracy": 0.9769569039344788, "num_tokens": 4009247.0, "step": 192 }, { "epoch": 2.4430379746835444, "grad_norm": 0.1750485897064209, "learning_rate": 1.8458091701318504e-05, "loss": 0.0977, "mean_token_accuracy": 0.9716680645942688, "num_tokens": 4030665.0, "step": 193 }, { "epoch": 2.4556962025316453, "grad_norm": 0.15362712740898132, "learning_rate": 1.7671651270128532e-05, "loss": 0.0803, "mean_token_accuracy": 0.9766944646835327, "num_tokens": 4050381.0, "step": 194 }, { "epoch": 2.4683544303797467, "grad_norm": 0.1784805804491043, "learning_rate": 1.69007051180199e-05, "loss": 0.0789, "mean_token_accuracy": 0.9765030145645142, "num_tokens": 4068575.0, "step": 195 }, { "epoch": 2.481012658227848, "grad_norm": 0.17262433469295502, "learning_rate": 1.6145398337843652e-05, "loss": 0.0809, "mean_token_accuracy": 0.9770630598068237, "num_tokens": 4088258.0, "step": 196 }, { "epoch": 2.4936708860759493, "grad_norm": 0.127259761095047, "learning_rate": 1.540587307910508e-05, "loss": 0.0676, "mean_token_accuracy": 0.9799794554710388, "num_tokens": 4109750.0, "step": 197 }, { "epoch": 2.5063291139240507, "grad_norm": 0.14667996764183044, "learning_rate": 1.4682268521211073e-05, "loss": 0.0805, "mean_token_accuracy": 0.9765044450759888, "num_tokens": 4130669.0, "step": 198 }, { "epoch": 2.518987341772152, "grad_norm": 0.1387241631746292, "learning_rate": 1.3974720847276412e-05, "loss": 0.0885, "mean_token_accuracy": 0.9746710062026978, "num_tokens": 4149960.0, "step": 199 }, { "epoch": 2.5316455696202533, "grad_norm": 0.14381346106529236, "learning_rate": 1.328336321849396e-05, "loss": 0.0777, "mean_token_accuracy": 0.9765580892562866, "num_tokens": 4171140.0, "step": 200 }, { "epoch": 2.5443037974683547, "grad_norm": 0.15454328060150146, "learning_rate": 1.2608325749073591e-05, "loss": 0.0775, "mean_token_accuracy": 0.9783006906509399, "num_tokens": 4191942.0, "step": 201 }, { "epoch": 2.5569620253164556, "grad_norm": 0.16802901029586792, "learning_rate": 1.1949735481754565e-05, "loss": 0.0872, "mean_token_accuracy": 0.9753664135932922, "num_tokens": 4212953.0, "step": 202 }, { "epoch": 2.569620253164557, "grad_norm": 0.14280477166175842, "learning_rate": 1.130771636389596e-05, "loss": 0.0766, "mean_token_accuracy": 0.9774961471557617, "num_tokens": 4235191.0, "step": 203 }, { "epoch": 2.5822784810126582, "grad_norm": 0.15136970579624176, "learning_rate": 1.0682389224149647e-05, "loss": 0.0761, "mean_token_accuracy": 0.9784093499183655, "num_tokens": 4256190.0, "step": 204 }, { "epoch": 2.5949367088607596, "grad_norm": 0.15056195855140686, "learning_rate": 1.0073871749720221e-05, "loss": 0.0715, "mean_token_accuracy": 0.9787655472755432, "num_tokens": 4278482.0, "step": 205 }, { "epoch": 2.607594936708861, "grad_norm": 0.1651993989944458, "learning_rate": 9.482278464216121e-06, "loss": 0.0838, "mean_token_accuracy": 0.9761291146278381, "num_tokens": 4299115.0, "step": 206 }, { "epoch": 2.620253164556962, "grad_norm": 0.16099077463150024, "learning_rate": 8.907720706096224e-06, "loss": 0.083, "mean_token_accuracy": 0.9754238724708557, "num_tokens": 4318995.0, "step": 207 }, { "epoch": 2.632911392405063, "grad_norm": 0.14827919006347656, "learning_rate": 8.350306607715774e-06, "loss": 0.0739, "mean_token_accuracy": 0.977802574634552, "num_tokens": 4340548.0, "step": 208 }, { "epoch": 2.6455696202531644, "grad_norm": 0.14395387470722198, "learning_rate": 7.810141074975818e-06, "loss": 0.0793, "mean_token_accuracy": 0.9785593748092651, "num_tokens": 4359548.0, "step": 209 }, { "epoch": 2.6582278481012658, "grad_norm": 0.15039250254631042, "learning_rate": 7.287325767579756e-06, "loss": 0.0775, "mean_token_accuracy": 0.9778735637664795, "num_tokens": 4378865.0, "step": 210 }, { "epoch": 2.670886075949367, "grad_norm": 0.1650187373161316, "learning_rate": 6.781959079900957e-06, "loss": 0.0838, "mean_token_accuracy": 0.9761627912521362, "num_tokens": 4399569.0, "step": 211 }, { "epoch": 2.6835443037974684, "grad_norm": 0.14305095374584198, "learning_rate": 6.2941361224647e-06, "loss": 0.0741, "mean_token_accuracy": 0.9784291982650757, "num_tokens": 4422488.0, "step": 212 }, { "epoch": 2.6962025316455698, "grad_norm": 0.15657547116279602, "learning_rate": 5.823948704048443e-06, "loss": 0.0767, "mean_token_accuracy": 0.9773022532463074, "num_tokens": 4443347.0, "step": 213 }, { "epoch": 2.708860759493671, "grad_norm": 0.14245574176311493, "learning_rate": 5.371485314403202e-06, "loss": 0.0772, "mean_token_accuracy": 0.9766822457313538, "num_tokens": 4465197.0, "step": 214 }, { "epoch": 2.721518987341772, "grad_norm": 0.16059687733650208, "learning_rate": 4.936831107599749e-06, "loss": 0.0868, "mean_token_accuracy": 0.9753717184066772, "num_tokens": 4486984.0, "step": 215 }, { "epoch": 2.7341772151898733, "grad_norm": 0.16994109749794006, "learning_rate": 4.5200678860024885e-06, "loss": 0.0907, "mean_token_accuracy": 0.9752695560455322, "num_tokens": 4506619.0, "step": 216 }, { "epoch": 2.7468354430379747, "grad_norm": 0.14966760575771332, "learning_rate": 4.121274084874194e-06, "loss": 0.086, "mean_token_accuracy": 0.9755901098251343, "num_tokens": 4527781.0, "step": 217 }, { "epoch": 2.759493670886076, "grad_norm": 0.16135965287685394, "learning_rate": 3.7405247576144054e-06, "loss": 0.0825, "mean_token_accuracy": 0.976494312286377, "num_tokens": 4547670.0, "step": 218 }, { "epoch": 2.7721518987341773, "grad_norm": 0.13386498391628265, "learning_rate": 3.3778915616342943e-06, "loss": 0.0773, "mean_token_accuracy": 0.9776089787483215, "num_tokens": 4570511.0, "step": 219 }, { "epoch": 2.7848101265822782, "grad_norm": 0.14860939979553223, "learning_rate": 3.0334427448706847e-06, "loss": 0.0818, "mean_token_accuracy": 0.9759284257888794, "num_tokens": 4590017.0, "step": 220 }, { "epoch": 2.7974683544303796, "grad_norm": 0.1305076777935028, "learning_rate": 2.707243132941717e-06, "loss": 0.0746, "mean_token_accuracy": 0.9780017733573914, "num_tokens": 4610219.0, "step": 221 }, { "epoch": 2.810126582278481, "grad_norm": 0.14003509283065796, "learning_rate": 2.3993541169465837e-06, "loss": 0.0841, "mean_token_accuracy": 0.9770644307136536, "num_tokens": 4631778.0, "step": 222 }, { "epoch": 2.8227848101265822, "grad_norm": 0.1698557734489441, "learning_rate": 2.1098336419116625e-06, "loss": 0.0776, "mean_token_accuracy": 0.9789777994155884, "num_tokens": 4654675.0, "step": 223 }, { "epoch": 2.8354430379746836, "grad_norm": 0.1640406996011734, "learning_rate": 1.838736195885238e-06, "loss": 0.0761, "mean_token_accuracy": 0.9789262413978577, "num_tokens": 4674669.0, "step": 224 }, { "epoch": 2.848101265822785, "grad_norm": 0.17419269680976868, "learning_rate": 1.5861127996827597e-06, "loss": 0.0812, "mean_token_accuracy": 0.9762682914733887, "num_tokens": 4695844.0, "step": 225 }, { "epoch": 2.8607594936708862, "grad_norm": 0.16612987220287323, "learning_rate": 1.3520109972846917e-06, "loss": 0.0801, "mean_token_accuracy": 0.9774113893508911, "num_tokens": 4715741.0, "step": 226 }, { "epoch": 2.8734177215189876, "grad_norm": 0.15979738533496857, "learning_rate": 1.1364748468886687e-06, "loss": 0.0888, "mean_token_accuracy": 0.9751821160316467, "num_tokens": 4736395.0, "step": 227 }, { "epoch": 2.8860759493670884, "grad_norm": 0.15005967020988464, "learning_rate": 9.395449126177291e-07, "loss": 0.0765, "mean_token_accuracy": 0.9786757826805115, "num_tokens": 4759250.0, "step": 228 }, { "epoch": 2.8987341772151898, "grad_norm": 0.13539956510066986, "learning_rate": 7.612582568860549e-07, "loss": 0.0776, "mean_token_accuracy": 0.9776937365531921, "num_tokens": 4779936.0, "step": 229 }, { "epoch": 2.911392405063291, "grad_norm": 0.15969063341617584, "learning_rate": 6.016484334238515e-07, "loss": 0.0913, "mean_token_accuracy": 0.9742149114608765, "num_tokens": 4800826.0, "step": 230 }, { "epoch": 2.9240506329113924, "grad_norm": 0.16468146443367004, "learning_rate": 4.607454809624434e-07, "loss": 0.0924, "mean_token_accuracy": 0.9755955338478088, "num_tokens": 4821501.0, "step": 231 }, { "epoch": 2.9367088607594938, "grad_norm": 0.13484787940979004, "learning_rate": 3.385759175809966e-07, "loss": 0.0782, "mean_token_accuracy": 0.9774335622787476, "num_tokens": 4841772.0, "step": 232 }, { "epoch": 2.9493670886075947, "grad_norm": 0.1467486321926117, "learning_rate": 2.3516273571577708e-07, "loss": 0.0817, "mean_token_accuracy": 0.9767971634864807, "num_tokens": 4865109.0, "step": 233 }, { "epoch": 2.962025316455696, "grad_norm": 0.18683797121047974, "learning_rate": 1.505253978329235e-07, "loss": 0.0899, "mean_token_accuracy": 0.975134551525116, "num_tokens": 4884678.0, "step": 234 }, { "epoch": 2.9746835443037973, "grad_norm": 0.15372681617736816, "learning_rate": 8.467983276563284e-08, "loss": 0.081, "mean_token_accuracy": 0.976805567741394, "num_tokens": 4906342.0, "step": 235 }, { "epoch": 2.9873417721518987, "grad_norm": 0.15492376685142517, "learning_rate": 3.763843271631373e-08, "loss": 0.0778, "mean_token_accuracy": 0.9773779511451721, "num_tokens": 4927138.0, "step": 236 }, { "epoch": 3.0, "grad_norm": 0.13269944489002228, "learning_rate": 9.410050924374415e-09, "loss": 0.076, "mean_token_accuracy": 0.9784287810325623, "num_tokens": 4948434.0, "step": 237 }, { "epoch": 3.0, "step": 237, "total_flos": 4.5754586889610854e+17, "train_loss": 0.17737930308917405, "train_runtime": 1187.0603, "train_samples_per_second": 12.636, "train_steps_per_second": 0.2 } ], "logging_steps": 1.0, "max_steps": 237, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.5754586889610854e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }