| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 3.0, |
| "eval_steps": 500, |
| "global_step": 237, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012658227848101266, |
| "grad_norm": 3.3755528926849365, |
| "learning_rate": 0.0, |
| "loss": 1.5248, |
| "mean_token_accuracy": 0.6810985803604126, |
| "num_tokens": 20782.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.02531645569620253, |
| "grad_norm": 3.3469796180725098, |
| "learning_rate": 2.5e-05, |
| "loss": 1.5007, |
| "mean_token_accuracy": 0.684084951877594, |
| "num_tokens": 41801.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.0379746835443038, |
| "grad_norm": 1.97304368019104, |
| "learning_rate": 5e-05, |
| "loss": 1.4012, |
| "mean_token_accuracy": 0.6956851482391357, |
| "num_tokens": 62978.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.05063291139240506, |
| "grad_norm": 1.4511849880218506, |
| "learning_rate": 7.500000000000001e-05, |
| "loss": 1.2029, |
| "mean_token_accuracy": 0.7223535776138306, |
| "num_tokens": 85034.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06329113924050633, |
| "grad_norm": 0.8851504921913147, |
| "learning_rate": 0.0001, |
| "loss": 1.0773, |
| "mean_token_accuracy": 0.7364060282707214, |
| "num_tokens": 107185.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.0759493670886076, |
| "grad_norm": 0.7546831965446472, |
| "learning_rate": 0.000125, |
| "loss": 0.9672, |
| "mean_token_accuracy": 0.758962869644165, |
| "num_tokens": 127806.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08860759493670886, |
| "grad_norm": 1.457136869430542, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.8743, |
| "mean_token_accuracy": 0.7788419127464294, |
| "num_tokens": 148231.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10126582278481013, |
| "grad_norm": 1.194122076034546, |
| "learning_rate": 0.000175, |
| "loss": 0.7579, |
| "mean_token_accuracy": 0.8078464269638062, |
| "num_tokens": 169757.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11392405063291139, |
| "grad_norm": 0.7309107184410095, |
| "learning_rate": 0.0002, |
| "loss": 0.6593, |
| "mean_token_accuracy": 0.8331207633018494, |
| "num_tokens": 190207.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12658227848101267, |
| "grad_norm": 0.7755345106124878, |
| "learning_rate": 0.00019999058994907564, |
| "loss": 0.5264, |
| "mean_token_accuracy": 0.8658320307731628, |
| "num_tokens": 209441.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.13924050632911392, |
| "grad_norm": 0.6617028117179871, |
| "learning_rate": 0.0001999623615672837, |
| "loss": 0.5016, |
| "mean_token_accuracy": 0.8747288584709167, |
| "num_tokens": 229789.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.1518987341772152, |
| "grad_norm": 0.5665917992591858, |
| "learning_rate": 0.00019991532016723439, |
| "loss": 0.4617, |
| "mean_token_accuracy": 0.8841381072998047, |
| "num_tokens": 250645.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16455696202531644, |
| "grad_norm": 0.47884827852249146, |
| "learning_rate": 0.00019984947460216707, |
| "loss": 0.4011, |
| "mean_token_accuracy": 0.8991096615791321, |
| "num_tokens": 271375.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17721518987341772, |
| "grad_norm": 0.440388947725296, |
| "learning_rate": 0.00019976483726428422, |
| "loss": 0.3918, |
| "mean_token_accuracy": 0.9046533703804016, |
| "num_tokens": 292499.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.189873417721519, |
| "grad_norm": 0.5122181177139282, |
| "learning_rate": 0.00019966142408241901, |
| "loss": 0.4464, |
| "mean_token_accuracy": 0.8897697329521179, |
| "num_tokens": 313755.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20253164556962025, |
| "grad_norm": 0.41976478695869446, |
| "learning_rate": 0.00019953925451903756, |
| "loss": 0.3145, |
| "mean_token_accuracy": 0.9217761158943176, |
| "num_tokens": 335462.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21518987341772153, |
| "grad_norm": 0.4809647798538208, |
| "learning_rate": 0.00019939835156657616, |
| "loss": 0.372, |
| "mean_token_accuracy": 0.9070643186569214, |
| "num_tokens": 355712.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22784810126582278, |
| "grad_norm": 0.44067713618278503, |
| "learning_rate": 0.00019923874174311394, |
| "loss": 0.308, |
| "mean_token_accuracy": 0.9210803508758545, |
| "num_tokens": 376658.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24050632911392406, |
| "grad_norm": 0.3857305645942688, |
| "learning_rate": 0.00019906045508738228, |
| "loss": 0.3021, |
| "mean_token_accuracy": 0.9239698648452759, |
| "num_tokens": 396622.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25316455696202533, |
| "grad_norm": 0.4351586699485779, |
| "learning_rate": 0.00019886352515311134, |
| "loss": 0.2879, |
| "mean_token_accuracy": 0.9282914400100708, |
| "num_tokens": 417604.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.26582278481012656, |
| "grad_norm": 0.3039501905441284, |
| "learning_rate": 0.00019864798900271532, |
| "loss": 0.2892, |
| "mean_token_accuracy": 0.9262740015983582, |
| "num_tokens": 438312.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.27848101265822783, |
| "grad_norm": 0.30652645230293274, |
| "learning_rate": 0.00019841388720031727, |
| "loss": 0.2586, |
| "mean_token_accuracy": 0.9390592575073242, |
| "num_tokens": 460742.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2911392405063291, |
| "grad_norm": 0.27710649371147156, |
| "learning_rate": 0.00019816126380411476, |
| "loss": 0.2507, |
| "mean_token_accuracy": 0.9424484968185425, |
| "num_tokens": 481292.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3037974683544304, |
| "grad_norm": 0.31043171882629395, |
| "learning_rate": 0.00019789016635808837, |
| "loss": 0.244, |
| "mean_token_accuracy": 0.9382171034812927, |
| "num_tokens": 502883.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.31645569620253167, |
| "grad_norm": 0.26763108372688293, |
| "learning_rate": 0.00019760064588305345, |
| "loss": 0.2112, |
| "mean_token_accuracy": 0.9468953013420105, |
| "num_tokens": 524527.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.3291139240506329, |
| "grad_norm": 0.271287202835083, |
| "learning_rate": 0.0001972927568670583, |
| "loss": 0.2468, |
| "mean_token_accuracy": 0.9391064643859863, |
| "num_tokens": 543460.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34177215189873417, |
| "grad_norm": 0.20461638271808624, |
| "learning_rate": 0.00019696655725512933, |
| "loss": 0.194, |
| "mean_token_accuracy": 0.9515607357025146, |
| "num_tokens": 568256.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35443037974683544, |
| "grad_norm": 0.268459290266037, |
| "learning_rate": 0.00019662210843836574, |
| "loss": 0.2181, |
| "mean_token_accuracy": 0.9476127624511719, |
| "num_tokens": 590291.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.3670886075949367, |
| "grad_norm": 0.3005685806274414, |
| "learning_rate": 0.00019625947524238563, |
| "loss": 0.2215, |
| "mean_token_accuracy": 0.9442426562309265, |
| "num_tokens": 613204.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.379746835443038, |
| "grad_norm": 0.22735565900802612, |
| "learning_rate": 0.0001958787259151258, |
| "loss": 0.211, |
| "mean_token_accuracy": 0.9458523392677307, |
| "num_tokens": 634063.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.3924050632911392, |
| "grad_norm": 0.2072056382894516, |
| "learning_rate": 0.0001954799321139975, |
| "loss": 0.2294, |
| "mean_token_accuracy": 0.9439746141433716, |
| "num_tokens": 654939.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.4050632911392405, |
| "grad_norm": 0.24833987653255463, |
| "learning_rate": 0.00019506316889240027, |
| "loss": 0.2311, |
| "mean_token_accuracy": 0.9401175379753113, |
| "num_tokens": 676779.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4177215189873418, |
| "grad_norm": 0.21333575248718262, |
| "learning_rate": 0.0001946285146855968, |
| "loss": 0.2074, |
| "mean_token_accuracy": 0.9479069113731384, |
| "num_tokens": 698151.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43037974683544306, |
| "grad_norm": 0.28180328011512756, |
| "learning_rate": 0.00019417605129595157, |
| "loss": 0.2039, |
| "mean_token_accuracy": 0.9491313099861145, |
| "num_tokens": 718994.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.4430379746835443, |
| "grad_norm": 0.20438188314437866, |
| "learning_rate": 0.0001937058638775353, |
| "loss": 0.1828, |
| "mean_token_accuracy": 0.9527903199195862, |
| "num_tokens": 740812.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.45569620253164556, |
| "grad_norm": 0.1980065107345581, |
| "learning_rate": 0.00019321804092009906, |
| "loss": 0.2165, |
| "mean_token_accuracy": 0.9470421671867371, |
| "num_tokens": 761685.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.46835443037974683, |
| "grad_norm": 0.21566878259181976, |
| "learning_rate": 0.00019271267423242024, |
| "loss": 0.2252, |
| "mean_token_accuracy": 0.943629801273346, |
| "num_tokens": 783640.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4810126582278481, |
| "grad_norm": 0.2180386781692505, |
| "learning_rate": 0.0001921898589250242, |
| "loss": 0.2315, |
| "mean_token_accuracy": 0.9406498670578003, |
| "num_tokens": 803923.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4936708860759494, |
| "grad_norm": 0.18960478901863098, |
| "learning_rate": 0.00019164969339228422, |
| "loss": 0.1903, |
| "mean_token_accuracy": 0.9512442350387573, |
| "num_tokens": 824723.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5063291139240507, |
| "grad_norm": 0.24511095881462097, |
| "learning_rate": 0.00019109227929390378, |
| "loss": 0.2529, |
| "mean_token_accuracy": 0.9372138381004333, |
| "num_tokens": 845317.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5189873417721519, |
| "grad_norm": 0.1957797110080719, |
| "learning_rate": 0.00019051772153578389, |
| "loss": 0.1883, |
| "mean_token_accuracy": 0.9512593746185303, |
| "num_tokens": 867416.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.5316455696202531, |
| "grad_norm": 0.2206275761127472, |
| "learning_rate": 0.00018992612825027976, |
| "loss": 0.2162, |
| "mean_token_accuracy": 0.9448105692863464, |
| "num_tokens": 886904.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5443037974683544, |
| "grad_norm": 0.19612912833690643, |
| "learning_rate": 0.00018931761077585035, |
| "loss": 0.1981, |
| "mean_token_accuracy": 0.9489004611968994, |
| "num_tokens": 908886.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5569620253164557, |
| "grad_norm": 0.22512373328208923, |
| "learning_rate": 0.00018869228363610404, |
| "loss": 0.2256, |
| "mean_token_accuracy": 0.9439067840576172, |
| "num_tokens": 929202.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.569620253164557, |
| "grad_norm": 0.2119680941104889, |
| "learning_rate": 0.00018805026451824546, |
| "loss": 0.1845, |
| "mean_token_accuracy": 0.9552789926528931, |
| "num_tokens": 949033.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5822784810126582, |
| "grad_norm": 0.1732683926820755, |
| "learning_rate": 0.00018739167425092644, |
| "loss": 0.1919, |
| "mean_token_accuracy": 0.9519040584564209, |
| "num_tokens": 971365.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5949367088607594, |
| "grad_norm": 0.18628673255443573, |
| "learning_rate": 0.00018671663678150607, |
| "loss": 0.1985, |
| "mean_token_accuracy": 0.9494044780731201, |
| "num_tokens": 990739.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6075949367088608, |
| "grad_norm": 0.2027333527803421, |
| "learning_rate": 0.0001860252791527236, |
| "loss": 0.229, |
| "mean_token_accuracy": 0.9417348504066467, |
| "num_tokens": 1011450.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.620253164556962, |
| "grad_norm": 0.17826716601848602, |
| "learning_rate": 0.00018531773147878895, |
| "loss": 0.2044, |
| "mean_token_accuracy": 0.9504271149635315, |
| "num_tokens": 1031182.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6329113924050633, |
| "grad_norm": 0.18673086166381836, |
| "learning_rate": 0.00018459412692089494, |
| "loss": 0.1769, |
| "mean_token_accuracy": 0.9546067118644714, |
| "num_tokens": 1054994.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6455696202531646, |
| "grad_norm": 0.18725241720676422, |
| "learning_rate": 0.00018385460166215638, |
| "loss": 0.1853, |
| "mean_token_accuracy": 0.9533385038375854, |
| "num_tokens": 1075696.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6582278481012658, |
| "grad_norm": 0.23499581217765808, |
| "learning_rate": 0.00018309929488198012, |
| "loss": 0.222, |
| "mean_token_accuracy": 0.944871187210083, |
| "num_tokens": 1098543.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6708860759493671, |
| "grad_norm": 0.20952437818050385, |
| "learning_rate": 0.00018232834872987147, |
| "loss": 0.163, |
| "mean_token_accuracy": 0.9581373333930969, |
| "num_tokens": 1119652.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6835443037974683, |
| "grad_norm": 0.342645525932312, |
| "learning_rate": 0.0001815419082986815, |
| "loss": 0.2146, |
| "mean_token_accuracy": 0.948540985584259, |
| "num_tokens": 1141306.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.6962025316455697, |
| "grad_norm": 0.18588639795780182, |
| "learning_rate": 0.00018074012159730032, |
| "loss": 0.1858, |
| "mean_token_accuracy": 0.9529316425323486, |
| "num_tokens": 1161171.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7088607594936709, |
| "grad_norm": 0.18335570394992828, |
| "learning_rate": 0.00017992313952280172, |
| "loss": 0.1939, |
| "mean_token_accuracy": 0.950637936592102, |
| "num_tokens": 1181534.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7215189873417721, |
| "grad_norm": 0.1759781688451767, |
| "learning_rate": 0.00017909111583204422, |
| "loss": 0.1681, |
| "mean_token_accuracy": 0.9576790928840637, |
| "num_tokens": 1201659.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7341772151898734, |
| "grad_norm": 0.1828421950340271, |
| "learning_rate": 0.0001782442071127338, |
| "loss": 0.2227, |
| "mean_token_accuracy": 0.9445362091064453, |
| "num_tokens": 1222313.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7468354430379747, |
| "grad_norm": 0.20731791853904724, |
| "learning_rate": 0.00017738257275395404, |
| "loss": 0.1615, |
| "mean_token_accuracy": 0.9587121605873108, |
| "num_tokens": 1242286.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.759493670886076, |
| "grad_norm": 0.1657421737909317, |
| "learning_rate": 0.0001765063749161688, |
| "loss": 0.1769, |
| "mean_token_accuracy": 0.9534204006195068, |
| "num_tokens": 1262874.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7721518987341772, |
| "grad_norm": 0.17372827231884003, |
| "learning_rate": 0.00017561577850070355, |
| "loss": 0.1975, |
| "mean_token_accuracy": 0.9501790404319763, |
| "num_tokens": 1282769.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7848101265822784, |
| "grad_norm": 0.2345019429922104, |
| "learning_rate": 0.00017471095111871074, |
| "loss": 0.2136, |
| "mean_token_accuracy": 0.9452736377716064, |
| "num_tokens": 1304139.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.7974683544303798, |
| "grad_norm": 0.18278631567955017, |
| "learning_rate": 0.00017379206305962526, |
| "loss": 0.2205, |
| "mean_token_accuracy": 0.9442360997200012, |
| "num_tokens": 1324467.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.810126582278481, |
| "grad_norm": 0.19478175044059753, |
| "learning_rate": 0.00017285928725911562, |
| "loss": 0.1677, |
| "mean_token_accuracy": 0.957406759262085, |
| "num_tokens": 1345262.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8227848101265823, |
| "grad_norm": 0.16885536909103394, |
| "learning_rate": 0.00017191279926653761, |
| "loss": 0.1859, |
| "mean_token_accuracy": 0.9530674815177917, |
| "num_tokens": 1368700.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8354430379746836, |
| "grad_norm": 0.20440581440925598, |
| "learning_rate": 0.00017095277721189528, |
| "loss": 0.1805, |
| "mean_token_accuracy": 0.9521450400352478, |
| "num_tokens": 1388344.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8481012658227848, |
| "grad_norm": 0.19661499559879303, |
| "learning_rate": 0.00016997940177231722, |
| "loss": 0.1758, |
| "mean_token_accuracy": 0.9565622806549072, |
| "num_tokens": 1407723.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8607594936708861, |
| "grad_norm": 0.18348322808742523, |
| "learning_rate": 0.00016899285613805246, |
| "loss": 0.172, |
| "mean_token_accuracy": 0.9548096060752869, |
| "num_tokens": 1427747.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8734177215189873, |
| "grad_norm": 0.16349603235721588, |
| "learning_rate": 0.00016799332597799413, |
| "loss": 0.1429, |
| "mean_token_accuracy": 0.9632624983787537, |
| "num_tokens": 1446729.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.8860759493670886, |
| "grad_norm": 0.19582310318946838, |
| "learning_rate": 0.0001669809994047364, |
| "loss": 0.1768, |
| "mean_token_accuracy": 0.9543310403823853, |
| "num_tokens": 1466084.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.8987341772151899, |
| "grad_norm": 0.19498325884342194, |
| "learning_rate": 0.00016595606693917142, |
| "loss": 0.1891, |
| "mean_token_accuracy": 0.954316258430481, |
| "num_tokens": 1485783.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9113924050632911, |
| "grad_norm": 0.16052420437335968, |
| "learning_rate": 0.00016491872147463306, |
| "loss": 0.1587, |
| "mean_token_accuracy": 0.9606679677963257, |
| "num_tokens": 1505907.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9240506329113924, |
| "grad_norm": 0.16272246837615967, |
| "learning_rate": 0.00016386915824059427, |
| "loss": 0.1668, |
| "mean_token_accuracy": 0.9579792618751526, |
| "num_tokens": 1527389.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9367088607594937, |
| "grad_norm": 0.16647444665431976, |
| "learning_rate": 0.00016280757476592466, |
| "loss": 0.1536, |
| "mean_token_accuracy": 0.960762083530426, |
| "num_tokens": 1547714.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9493670886075949, |
| "grad_norm": 0.1784556359052658, |
| "learning_rate": 0.00016173417084171536, |
| "loss": 0.1924, |
| "mean_token_accuracy": 0.9510428309440613, |
| "num_tokens": 1567244.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9620253164556962, |
| "grad_norm": 0.15793780982494354, |
| "learning_rate": 0.0001606491484836782, |
| "loss": 0.1757, |
| "mean_token_accuracy": 0.954423725605011, |
| "num_tokens": 1586726.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9746835443037974, |
| "grad_norm": 0.1410311460494995, |
| "learning_rate": 0.00015955271189412598, |
| "loss": 0.1393, |
| "mean_token_accuracy": 0.9642706513404846, |
| "num_tokens": 1608089.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9873417721518988, |
| "grad_norm": 0.2086767852306366, |
| "learning_rate": 0.00015844506742354164, |
| "loss": 0.2087, |
| "mean_token_accuracy": 0.9479678869247437, |
| "num_tokens": 1629313.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.1745402216911316, |
| "learning_rate": 0.00015732642353174259, |
| "loss": 0.1402, |
| "mean_token_accuracy": 0.9628644585609436, |
| "num_tokens": 1649681.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0126582278481013, |
| "grad_norm": 0.14212512969970703, |
| "learning_rate": 0.00015619699074864864, |
| "loss": 0.1281, |
| "mean_token_accuracy": 0.9649726152420044, |
| "num_tokens": 1668359.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0253164556962024, |
| "grad_norm": 0.13101430237293243, |
| "learning_rate": 0.00015505698163465986, |
| "loss": 0.1189, |
| "mean_token_accuracy": 0.9688678979873657, |
| "num_tokens": 1689623.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0379746835443038, |
| "grad_norm": 0.14908701181411743, |
| "learning_rate": 0.00015390661074065256, |
| "loss": 0.1313, |
| "mean_token_accuracy": 0.9633692502975464, |
| "num_tokens": 1710380.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0506329113924051, |
| "grad_norm": 0.16834689676761627, |
| "learning_rate": 0.00015274609456760073, |
| "loss": 0.1236, |
| "mean_token_accuracy": 0.9671345949172974, |
| "num_tokens": 1731530.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0632911392405062, |
| "grad_norm": 0.1714702993631363, |
| "learning_rate": 0.00015157565152583002, |
| "loss": 0.1343, |
| "mean_token_accuracy": 0.9642593860626221, |
| "num_tokens": 1751963.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0759493670886076, |
| "grad_norm": 0.18395373225212097, |
| "learning_rate": 0.00015039550189391298, |
| "loss": 0.1179, |
| "mean_token_accuracy": 0.96883624792099, |
| "num_tokens": 1773398.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.0886075949367089, |
| "grad_norm": 0.18526509404182434, |
| "learning_rate": 0.0001492058677772123, |
| "loss": 0.1327, |
| "mean_token_accuracy": 0.9650301337242126, |
| "num_tokens": 1793851.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1012658227848102, |
| "grad_norm": 0.1679631620645523, |
| "learning_rate": 0.00014800697306608044, |
| "loss": 0.1273, |
| "mean_token_accuracy": 0.9668911099433899, |
| "num_tokens": 1813668.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1139240506329113, |
| "grad_norm": 0.15644878149032593, |
| "learning_rate": 0.00014679904339372302, |
| "loss": 0.1319, |
| "mean_token_accuracy": 0.9673177599906921, |
| "num_tokens": 1834875.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.1265822784810127, |
| "grad_norm": 0.18947693705558777, |
| "learning_rate": 0.0001455823060937347, |
| "loss": 0.1499, |
| "mean_token_accuracy": 0.9611180424690247, |
| "num_tokens": 1855797.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.139240506329114, |
| "grad_norm": 0.15163911879062653, |
| "learning_rate": 0.00014435699015731448, |
| "loss": 0.1419, |
| "mean_token_accuracy": 0.9620731472969055, |
| "num_tokens": 1875715.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1518987341772151, |
| "grad_norm": 0.1474975049495697, |
| "learning_rate": 0.00014312332619016965, |
| "loss": 0.1245, |
| "mean_token_accuracy": 0.9681270718574524, |
| "num_tokens": 1895294.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1645569620253164, |
| "grad_norm": 0.19832119345664978, |
| "learning_rate": 0.00014188154636911524, |
| "loss": 0.1472, |
| "mean_token_accuracy": 0.9617631435394287, |
| "num_tokens": 1916411.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.1772151898734178, |
| "grad_norm": 0.14573758840560913, |
| "learning_rate": 0.00014063188439837832, |
| "loss": 0.1152, |
| "mean_token_accuracy": 0.9696823954582214, |
| "num_tokens": 1939300.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.189873417721519, |
| "grad_norm": 0.17945419251918793, |
| "learning_rate": 0.0001393745754656146, |
| "loss": 0.1419, |
| "mean_token_accuracy": 0.9620354175567627, |
| "num_tokens": 1960647.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2025316455696202, |
| "grad_norm": 0.2099403440952301, |
| "learning_rate": 0.00013810985619764572, |
| "loss": 0.1442, |
| "mean_token_accuracy": 0.9616883397102356, |
| "num_tokens": 1980470.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.2151898734177216, |
| "grad_norm": 0.14469695091247559, |
| "learning_rate": 0.00013683796461592604, |
| "loss": 0.1152, |
| "mean_token_accuracy": 0.9697718620300293, |
| "num_tokens": 2001177.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2278481012658227, |
| "grad_norm": 0.1826285570859909, |
| "learning_rate": 0.00013555914009174663, |
| "loss": 0.149, |
| "mean_token_accuracy": 0.9613690376281738, |
| "num_tokens": 2021898.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.240506329113924, |
| "grad_norm": 0.18723325431346893, |
| "learning_rate": 0.00013427362330118543, |
| "loss": 0.1543, |
| "mean_token_accuracy": 0.9578179121017456, |
| "num_tokens": 2043061.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2531645569620253, |
| "grad_norm": 0.16736926138401031, |
| "learning_rate": 0.00013298165617981172, |
| "loss": 0.121, |
| "mean_token_accuracy": 0.9673892855644226, |
| "num_tokens": 2064713.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.2658227848101267, |
| "grad_norm": 0.14512582123279572, |
| "learning_rate": 0.0001316834818771535, |
| "loss": 0.131, |
| "mean_token_accuracy": 0.9658250212669373, |
| "num_tokens": 2085728.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2784810126582278, |
| "grad_norm": 0.1532108336687088, |
| "learning_rate": 0.00013037934471093682, |
| "loss": 0.105, |
| "mean_token_accuracy": 0.9721629619598389, |
| "num_tokens": 2105945.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2911392405063291, |
| "grad_norm": 0.16162677109241486, |
| "learning_rate": 0.00012906949012110456, |
| "loss": 0.119, |
| "mean_token_accuracy": 0.9679898619651794, |
| "num_tokens": 2128127.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.3037974683544304, |
| "grad_norm": 0.15701304376125336, |
| "learning_rate": 0.00012775416462362457, |
| "loss": 0.1243, |
| "mean_token_accuracy": 0.9664501547813416, |
| "num_tokens": 2147744.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3164556962025316, |
| "grad_norm": 0.19801859557628632, |
| "learning_rate": 0.00012643361576409516, |
| "loss": 0.1135, |
| "mean_token_accuracy": 0.9700688719749451, |
| "num_tokens": 2167119.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3291139240506329, |
| "grad_norm": 0.14806534349918365, |
| "learning_rate": 0.00012510809207115666, |
| "loss": 0.1136, |
| "mean_token_accuracy": 0.9694877862930298, |
| "num_tokens": 2188912.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3417721518987342, |
| "grad_norm": 0.17883673310279846, |
| "learning_rate": 0.00012377784300971807, |
| "loss": 0.1329, |
| "mean_token_accuracy": 0.9641534090042114, |
| "num_tokens": 2210568.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.3544303797468356, |
| "grad_norm": 0.19047731161117554, |
| "learning_rate": 0.00012244311893400763, |
| "loss": 0.1197, |
| "mean_token_accuracy": 0.9685088396072388, |
| "num_tokens": 2233051.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3670886075949367, |
| "grad_norm": 0.1676148772239685, |
| "learning_rate": 0.00012110417104045575, |
| "loss": 0.119, |
| "mean_token_accuracy": 0.9676389694213867, |
| "num_tokens": 2255364.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.379746835443038, |
| "grad_norm": 0.14473366737365723, |
| "learning_rate": 0.00011976125132041974, |
| "loss": 0.1093, |
| "mean_token_accuracy": 0.9687408804893494, |
| "num_tokens": 2275998.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.3924050632911391, |
| "grad_norm": 0.1363905370235443, |
| "learning_rate": 0.00011841461251275867, |
| "loss": 0.1225, |
| "mean_token_accuracy": 0.9674336910247803, |
| "num_tokens": 2298877.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4050632911392404, |
| "grad_norm": 0.15403813123703003, |
| "learning_rate": 0.0001170645080562676, |
| "loss": 0.1195, |
| "mean_token_accuracy": 0.9666731357574463, |
| "num_tokens": 2319495.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4177215189873418, |
| "grad_norm": 0.12701380252838135, |
| "learning_rate": 0.00011571119204198037, |
| "loss": 0.1108, |
| "mean_token_accuracy": 0.9725146293640137, |
| "num_tokens": 2341789.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4303797468354431, |
| "grad_norm": 0.15826545655727386, |
| "learning_rate": 0.00011435491916534919, |
| "loss": 0.1219, |
| "mean_token_accuracy": 0.967819094657898, |
| "num_tokens": 2360249.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4430379746835442, |
| "grad_norm": 0.14779576659202576, |
| "learning_rate": 0.00011299594467831078, |
| "loss": 0.1067, |
| "mean_token_accuracy": 0.9703106880187988, |
| "num_tokens": 2379175.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4556962025316456, |
| "grad_norm": 0.15034395456314087, |
| "learning_rate": 0.00011163452434124773, |
| "loss": 0.123, |
| "mean_token_accuracy": 0.9687133431434631, |
| "num_tokens": 2401389.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4683544303797469, |
| "grad_norm": 0.1711132824420929, |
| "learning_rate": 0.00011027091437485404, |
| "loss": 0.1106, |
| "mean_token_accuracy": 0.9697067141532898, |
| "num_tokens": 2423207.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.481012658227848, |
| "grad_norm": 0.15965788066387177, |
| "learning_rate": 0.00010890537141191417, |
| "loss": 0.1188, |
| "mean_token_accuracy": 0.966696560382843, |
| "num_tokens": 2444470.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4936708860759493, |
| "grad_norm": 0.1709423065185547, |
| "learning_rate": 0.00010753815244900458, |
| "loss": 0.1414, |
| "mean_token_accuracy": 0.9635064005851746, |
| "num_tokens": 2465798.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5063291139240507, |
| "grad_norm": 0.16524891555309296, |
| "learning_rate": 0.00010616951479812658, |
| "loss": 0.1198, |
| "mean_token_accuracy": 0.9672353863716125, |
| "num_tokens": 2486494.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.518987341772152, |
| "grad_norm": 0.1784825325012207, |
| "learning_rate": 0.00010479971603828, |
| "loss": 0.122, |
| "mean_token_accuracy": 0.9669795632362366, |
| "num_tokens": 2507757.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5316455696202531, |
| "grad_norm": 0.18025313317775726, |
| "learning_rate": 0.00010342901396698659, |
| "loss": 0.1217, |
| "mean_token_accuracy": 0.9672725796699524, |
| "num_tokens": 2528507.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5443037974683544, |
| "grad_norm": 0.15038174390792847, |
| "learning_rate": 0.00010205766655177215, |
| "loss": 0.1047, |
| "mean_token_accuracy": 0.9724980592727661, |
| "num_tokens": 2550424.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5569620253164556, |
| "grad_norm": 0.14482751488685608, |
| "learning_rate": 0.00010068593188161697, |
| "loss": 0.1171, |
| "mean_token_accuracy": 0.9675801396369934, |
| "num_tokens": 2569828.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.5696202531645569, |
| "grad_norm": 0.13739396631717682, |
| "learning_rate": 9.931406811838308e-05, |
| "loss": 0.1, |
| "mean_token_accuracy": 0.973212718963623, |
| "num_tokens": 2592776.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5822784810126582, |
| "grad_norm": 0.15288740396499634, |
| "learning_rate": 9.79423334482279e-05, |
| "loss": 0.1221, |
| "mean_token_accuracy": 0.9669612646102905, |
| "num_tokens": 2612302.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5949367088607596, |
| "grad_norm": 0.21149307489395142, |
| "learning_rate": 9.657098603301346e-05, |
| "loss": 0.1232, |
| "mean_token_accuracy": 0.9651282429695129, |
| "num_tokens": 2631780.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.6075949367088609, |
| "grad_norm": 0.1493978202342987, |
| "learning_rate": 9.520028396172003e-05, |
| "loss": 0.1189, |
| "mean_token_accuracy": 0.9693233966827393, |
| "num_tokens": 2652772.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.620253164556962, |
| "grad_norm": 0.13895590603351593, |
| "learning_rate": 9.383048520187344e-05, |
| "loss": 0.0915, |
| "mean_token_accuracy": 0.9748296141624451, |
| "num_tokens": 2674846.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6329113924050633, |
| "grad_norm": 0.1659339815378189, |
| "learning_rate": 9.246184755099545e-05, |
| "loss": 0.1304, |
| "mean_token_accuracy": 0.9650869369506836, |
| "num_tokens": 2695504.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6455696202531644, |
| "grad_norm": 0.18495714664459229, |
| "learning_rate": 9.109462858808586e-05, |
| "loss": 0.1345, |
| "mean_token_accuracy": 0.9641679525375366, |
| "num_tokens": 2716499.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.6582278481012658, |
| "grad_norm": 0.1656477451324463, |
| "learning_rate": 8.972908562514598e-05, |
| "loss": 0.1257, |
| "mean_token_accuracy": 0.9681254029273987, |
| "num_tokens": 2739528.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6708860759493671, |
| "grad_norm": 0.17554399371147156, |
| "learning_rate": 8.836547565875227e-05, |
| "loss": 0.1418, |
| "mean_token_accuracy": 0.961998462677002, |
| "num_tokens": 2761749.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6835443037974684, |
| "grad_norm": 0.15592941641807556, |
| "learning_rate": 8.70040553216892e-05, |
| "loss": 0.1148, |
| "mean_token_accuracy": 0.9690976142883301, |
| "num_tokens": 2781682.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.6962025316455698, |
| "grad_norm": 0.1496342271566391, |
| "learning_rate": 8.564508083465079e-05, |
| "loss": 0.1133, |
| "mean_token_accuracy": 0.9688509702682495, |
| "num_tokens": 2801554.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7088607594936709, |
| "grad_norm": 0.2020542472600937, |
| "learning_rate": 8.428880795801965e-05, |
| "loss": 0.1479, |
| "mean_token_accuracy": 0.9599217772483826, |
| "num_tokens": 2821055.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.721518987341772, |
| "grad_norm": 0.176243856549263, |
| "learning_rate": 8.293549194373243e-05, |
| "loss": 0.1214, |
| "mean_token_accuracy": 0.967559278011322, |
| "num_tokens": 2841957.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7341772151898733, |
| "grad_norm": 0.15299445390701294, |
| "learning_rate": 8.158538748724139e-05, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.9709796905517578, |
| "num_tokens": 2863661.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7468354430379747, |
| "grad_norm": 0.1839250922203064, |
| "learning_rate": 8.023874867958027e-05, |
| "loss": 0.1235, |
| "mean_token_accuracy": 0.967279851436615, |
| "num_tokens": 2883621.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.759493670886076, |
| "grad_norm": 0.11831887066364288, |
| "learning_rate": 7.889582895954427e-05, |
| "loss": 0.0941, |
| "mean_token_accuracy": 0.9745250344276428, |
| "num_tokens": 2904529.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7721518987341773, |
| "grad_norm": 0.1413291096687317, |
| "learning_rate": 7.755688106599241e-05, |
| "loss": 0.1114, |
| "mean_token_accuracy": 0.968601405620575, |
| "num_tokens": 2923097.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7848101265822784, |
| "grad_norm": 0.1475374400615692, |
| "learning_rate": 7.622215699028196e-05, |
| "loss": 0.1143, |
| "mean_token_accuracy": 0.9688102006912231, |
| "num_tokens": 2942366.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.7974683544303798, |
| "grad_norm": 0.1440063714981079, |
| "learning_rate": 7.489190792884338e-05, |
| "loss": 0.1139, |
| "mean_token_accuracy": 0.9701301455497742, |
| "num_tokens": 2965095.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.810126582278481, |
| "grad_norm": 0.1474955677986145, |
| "learning_rate": 7.356638423590485e-05, |
| "loss": 0.1299, |
| "mean_token_accuracy": 0.9650708436965942, |
| "num_tokens": 2986402.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8227848101265822, |
| "grad_norm": 0.13343898952007294, |
| "learning_rate": 7.224583537637544e-05, |
| "loss": 0.1, |
| "mean_token_accuracy": 0.9724212288856506, |
| "num_tokens": 3006844.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8354430379746836, |
| "grad_norm": 0.1628241240978241, |
| "learning_rate": 7.093050987889547e-05, |
| "loss": 0.1064, |
| "mean_token_accuracy": 0.9713687896728516, |
| "num_tokens": 3027934.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8481012658227849, |
| "grad_norm": 0.18010802567005157, |
| "learning_rate": 6.96206552890632e-05, |
| "loss": 0.1346, |
| "mean_token_accuracy": 0.9642553329467773, |
| "num_tokens": 3047973.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8607594936708862, |
| "grad_norm": 0.1424276977777481, |
| "learning_rate": 6.831651812284652e-05, |
| "loss": 0.1023, |
| "mean_token_accuracy": 0.9724918007850647, |
| "num_tokens": 3068540.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8734177215189873, |
| "grad_norm": 0.16791187226772308, |
| "learning_rate": 6.701834382018832e-05, |
| "loss": 0.1372, |
| "mean_token_accuracy": 0.9635747075080872, |
| "num_tokens": 3089551.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.8860759493670884, |
| "grad_norm": 0.15886037051677704, |
| "learning_rate": 6.572637669881458e-05, |
| "loss": 0.1203, |
| "mean_token_accuracy": 0.9681239724159241, |
| "num_tokens": 3109881.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.8987341772151898, |
| "grad_norm": 0.15515190362930298, |
| "learning_rate": 6.444085990825338e-05, |
| "loss": 0.1274, |
| "mean_token_accuracy": 0.967353343963623, |
| "num_tokens": 3129702.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9113924050632911, |
| "grad_norm": 0.15266196429729462, |
| "learning_rate": 6.316203538407397e-05, |
| "loss": 0.1059, |
| "mean_token_accuracy": 0.9698867797851562, |
| "num_tokens": 3149724.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.9240506329113924, |
| "grad_norm": 0.15055519342422485, |
| "learning_rate": 6.18901438023543e-05, |
| "loss": 0.104, |
| "mean_token_accuracy": 0.97203129529953, |
| "num_tokens": 3170883.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9367088607594938, |
| "grad_norm": 0.14458802342414856, |
| "learning_rate": 6.0625424534385425e-05, |
| "loss": 0.1089, |
| "mean_token_accuracy": 0.9710777997970581, |
| "num_tokens": 3192695.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9493670886075949, |
| "grad_norm": 0.13979317247867584, |
| "learning_rate": 5.936811560162169e-05, |
| "loss": 0.0934, |
| "mean_token_accuracy": 0.9752629995346069, |
| "num_tokens": 3213578.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9620253164556962, |
| "grad_norm": 0.16508439183235168, |
| "learning_rate": 5.811845363088477e-05, |
| "loss": 0.1063, |
| "mean_token_accuracy": 0.9713494181632996, |
| "num_tokens": 3235666.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.9746835443037973, |
| "grad_norm": 0.1382744163274765, |
| "learning_rate": 5.687667380983037e-05, |
| "loss": 0.1046, |
| "mean_token_accuracy": 0.9724194407463074, |
| "num_tokens": 3256433.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9873417721518987, |
| "grad_norm": 0.15038706362247467, |
| "learning_rate": 5.5643009842685554e-05, |
| "loss": 0.1107, |
| "mean_token_accuracy": 0.9704877138137817, |
| "num_tokens": 3279030.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.11997652798891068, |
| "learning_rate": 5.4417693906265365e-05, |
| "loss": 0.0832, |
| "mean_token_accuracy": 0.9756409525871277, |
| "num_tokens": 3297855.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0126582278481013, |
| "grad_norm": 0.12818469107151031, |
| "learning_rate": 5.3200956606277006e-05, |
| "loss": 0.1002, |
| "mean_token_accuracy": 0.9725956320762634, |
| "num_tokens": 3319193.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0253164556962027, |
| "grad_norm": 0.14221195876598358, |
| "learning_rate": 5.199302693391959e-05, |
| "loss": 0.1014, |
| "mean_token_accuracy": 0.9717661142349243, |
| "num_tokens": 3339658.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.037974683544304, |
| "grad_norm": 0.13688071072101593, |
| "learning_rate": 5.0794132222787707e-05, |
| "loss": 0.0942, |
| "mean_token_accuracy": 0.9738968014717102, |
| "num_tokens": 3361635.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050632911392405, |
| "grad_norm": 0.11703404784202576, |
| "learning_rate": 4.960449810608705e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9769234657287598, |
| "num_tokens": 3382326.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0632911392405062, |
| "grad_norm": 0.13432802259922028, |
| "learning_rate": 4.8424348474170014e-05, |
| "loss": 0.0857, |
| "mean_token_accuracy": 0.9762054085731506, |
| "num_tokens": 3403109.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0759493670886076, |
| "grad_norm": 0.12041960656642914, |
| "learning_rate": 4.725390543239929e-05, |
| "loss": 0.073, |
| "mean_token_accuracy": 0.978657066822052, |
| "num_tokens": 3425616.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.088607594936709, |
| "grad_norm": 0.18753547966480255, |
| "learning_rate": 4.609338925934743e-05, |
| "loss": 0.0893, |
| "mean_token_accuracy": 0.9740729928016663, |
| "num_tokens": 3445852.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1012658227848102, |
| "grad_norm": 0.17938809096813202, |
| "learning_rate": 4.494301836534016e-05, |
| "loss": 0.0875, |
| "mean_token_accuracy": 0.9756035208702087, |
| "num_tokens": 3465427.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1139240506329116, |
| "grad_norm": 0.18644244968891144, |
| "learning_rate": 4.380300925135138e-05, |
| "loss": 0.0844, |
| "mean_token_accuracy": 0.9756962060928345, |
| "num_tokens": 3485529.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.1265822784810124, |
| "grad_norm": 0.17335088551044464, |
| "learning_rate": 4.267357646825746e-05, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9768072962760925, |
| "num_tokens": 3506591.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.1392405063291138, |
| "grad_norm": 0.21782517433166504, |
| "learning_rate": 4.1554932576458415e-05, |
| "loss": 0.1137, |
| "mean_token_accuracy": 0.9687607288360596, |
| "num_tokens": 3527014.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.151898734177215, |
| "grad_norm": 0.20455828309059143, |
| "learning_rate": 4.044728810587406e-05, |
| "loss": 0.0962, |
| "mean_token_accuracy": 0.9728721976280212, |
| "num_tokens": 3548532.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1645569620253164, |
| "grad_norm": 0.146736741065979, |
| "learning_rate": 3.935085151632185e-05, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.978145182132721, |
| "num_tokens": 3571337.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.1772151898734178, |
| "grad_norm": 0.1688258796930313, |
| "learning_rate": 3.826582915828468e-05, |
| "loss": 0.0881, |
| "mean_token_accuracy": 0.9753274321556091, |
| "num_tokens": 3593085.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.189873417721519, |
| "grad_norm": 0.13930419087409973, |
| "learning_rate": 3.719242523407539e-05, |
| "loss": 0.0803, |
| "mean_token_accuracy": 0.9768635034561157, |
| "num_tokens": 3611864.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2025316455696204, |
| "grad_norm": 0.14071966707706451, |
| "learning_rate": 3.613084175940578e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9770142436027527, |
| "num_tokens": 3632767.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.2151898734177213, |
| "grad_norm": 0.1428343951702118, |
| "learning_rate": 3.508127852536698e-05, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9772024154663086, |
| "num_tokens": 3652877.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.2278481012658227, |
| "grad_norm": 0.21315431594848633, |
| "learning_rate": 3.4043933060828605e-05, |
| "loss": 0.0888, |
| "mean_token_accuracy": 0.9752591252326965, |
| "num_tokens": 3673393.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.240506329113924, |
| "grad_norm": 0.13567057251930237, |
| "learning_rate": 3.3019000595263574e-05, |
| "loss": 0.0723, |
| "mean_token_accuracy": 0.9791584610939026, |
| "num_tokens": 3696248.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.2531645569620253, |
| "grad_norm": 0.11285153776407242, |
| "learning_rate": 3.200667402200586e-05, |
| "loss": 0.0714, |
| "mean_token_accuracy": 0.9794472455978394, |
| "num_tokens": 3716358.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.2658227848101267, |
| "grad_norm": 0.12942923605442047, |
| "learning_rate": 3.100714386194757e-05, |
| "loss": 0.07, |
| "mean_token_accuracy": 0.9789379239082336, |
| "num_tokens": 3736458.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.278481012658228, |
| "grad_norm": 0.16876453161239624, |
| "learning_rate": 3.0020598227682795e-05, |
| "loss": 0.0893, |
| "mean_token_accuracy": 0.9735265970230103, |
| "num_tokens": 3754389.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.291139240506329, |
| "grad_norm": 0.15007387101650238, |
| "learning_rate": 2.904722278810471e-05, |
| "loss": 0.077, |
| "mean_token_accuracy": 0.9764189124107361, |
| "num_tokens": 3775614.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.3037974683544302, |
| "grad_norm": 0.1313251107931137, |
| "learning_rate": 2.8087200733462425e-05, |
| "loss": 0.0736, |
| "mean_token_accuracy": 0.978974461555481, |
| "num_tokens": 3798222.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3164556962025316, |
| "grad_norm": 0.12241403013467789, |
| "learning_rate": 2.7140712740884376e-05, |
| "loss": 0.0734, |
| "mean_token_accuracy": 0.978549063205719, |
| "num_tokens": 3819031.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.329113924050633, |
| "grad_norm": 0.13866658508777618, |
| "learning_rate": 2.6207936940374767e-05, |
| "loss": 0.0856, |
| "mean_token_accuracy": 0.975257158279419, |
| "num_tokens": 3841647.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.3417721518987342, |
| "grad_norm": 0.1442888230085373, |
| "learning_rate": 2.5289048881289256e-05, |
| "loss": 0.0747, |
| "mean_token_accuracy": 0.9778075814247131, |
| "num_tokens": 3861853.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.3544303797468356, |
| "grad_norm": 0.13721716403961182, |
| "learning_rate": 2.4384221499296466e-05, |
| "loss": 0.0769, |
| "mean_token_accuracy": 0.9777352213859558, |
| "num_tokens": 3881230.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.367088607594937, |
| "grad_norm": 0.1602994054555893, |
| "learning_rate": 2.3493625083831217e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9766371846199036, |
| "num_tokens": 3900641.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.379746835443038, |
| "grad_norm": 0.13312046229839325, |
| "learning_rate": 2.2617427246045973e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.976757824420929, |
| "num_tokens": 3922863.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.392405063291139, |
| "grad_norm": 0.1182788833975792, |
| "learning_rate": 2.1755792887266234e-05, |
| "loss": 0.073, |
| "mean_token_accuracy": 0.9789871573448181, |
| "num_tokens": 3944628.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4050632911392404, |
| "grad_norm": 0.126333549618721, |
| "learning_rate": 2.0908884167955824e-05, |
| "loss": 0.0751, |
| "mean_token_accuracy": 0.9801375865936279, |
| "num_tokens": 3967952.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4177215189873418, |
| "grad_norm": 0.163629412651062, |
| "learning_rate": 2.0076860477198313e-05, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9764661192893982, |
| "num_tokens": 3989177.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.430379746835443, |
| "grad_norm": 0.14649328589439392, |
| "learning_rate": 1.9259878402699705e-05, |
| "loss": 0.0758, |
| "mean_token_accuracy": 0.9769569039344788, |
| "num_tokens": 4009247.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.4430379746835444, |
| "grad_norm": 0.1750485897064209, |
| "learning_rate": 1.8458091701318504e-05, |
| "loss": 0.0977, |
| "mean_token_accuracy": 0.9716680645942688, |
| "num_tokens": 4030665.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4556962025316453, |
| "grad_norm": 0.15362712740898132, |
| "learning_rate": 1.7671651270128532e-05, |
| "loss": 0.0803, |
| "mean_token_accuracy": 0.9766944646835327, |
| "num_tokens": 4050381.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4683544303797467, |
| "grad_norm": 0.1784805804491043, |
| "learning_rate": 1.69007051180199e-05, |
| "loss": 0.0789, |
| "mean_token_accuracy": 0.9765030145645142, |
| "num_tokens": 4068575.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.481012658227848, |
| "grad_norm": 0.17262433469295502, |
| "learning_rate": 1.6145398337843652e-05, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9770630598068237, |
| "num_tokens": 4088258.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4936708860759493, |
| "grad_norm": 0.127259761095047, |
| "learning_rate": 1.540587307910508e-05, |
| "loss": 0.0676, |
| "mean_token_accuracy": 0.9799794554710388, |
| "num_tokens": 4109750.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5063291139240507, |
| "grad_norm": 0.14667996764183044, |
| "learning_rate": 1.4682268521211073e-05, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9765044450759888, |
| "num_tokens": 4130669.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.518987341772152, |
| "grad_norm": 0.1387241631746292, |
| "learning_rate": 1.3974720847276412e-05, |
| "loss": 0.0885, |
| "mean_token_accuracy": 0.9746710062026978, |
| "num_tokens": 4149960.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.5316455696202533, |
| "grad_norm": 0.14381346106529236, |
| "learning_rate": 1.328336321849396e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9765580892562866, |
| "num_tokens": 4171140.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5443037974683547, |
| "grad_norm": 0.15454328060150146, |
| "learning_rate": 1.2608325749073591e-05, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9783006906509399, |
| "num_tokens": 4191942.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5569620253164556, |
| "grad_norm": 0.16802901029586792, |
| "learning_rate": 1.1949735481754565e-05, |
| "loss": 0.0872, |
| "mean_token_accuracy": 0.9753664135932922, |
| "num_tokens": 4212953.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.569620253164557, |
| "grad_norm": 0.14280477166175842, |
| "learning_rate": 1.130771636389596e-05, |
| "loss": 0.0766, |
| "mean_token_accuracy": 0.9774961471557617, |
| "num_tokens": 4235191.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5822784810126582, |
| "grad_norm": 0.15136970579624176, |
| "learning_rate": 1.0682389224149647e-05, |
| "loss": 0.0761, |
| "mean_token_accuracy": 0.9784093499183655, |
| "num_tokens": 4256190.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5949367088607596, |
| "grad_norm": 0.15056195855140686, |
| "learning_rate": 1.0073871749720221e-05, |
| "loss": 0.0715, |
| "mean_token_accuracy": 0.9787655472755432, |
| "num_tokens": 4278482.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.607594936708861, |
| "grad_norm": 0.1651993989944458, |
| "learning_rate": 9.482278464216121e-06, |
| "loss": 0.0838, |
| "mean_token_accuracy": 0.9761291146278381, |
| "num_tokens": 4299115.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.620253164556962, |
| "grad_norm": 0.16099077463150024, |
| "learning_rate": 8.907720706096224e-06, |
| "loss": 0.083, |
| "mean_token_accuracy": 0.9754238724708557, |
| "num_tokens": 4318995.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.632911392405063, |
| "grad_norm": 0.14827919006347656, |
| "learning_rate": 8.350306607715774e-06, |
| "loss": 0.0739, |
| "mean_token_accuracy": 0.977802574634552, |
| "num_tokens": 4340548.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6455696202531644, |
| "grad_norm": 0.14395387470722198, |
| "learning_rate": 7.810141074975818e-06, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9785593748092651, |
| "num_tokens": 4359548.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.6582278481012658, |
| "grad_norm": 0.15039250254631042, |
| "learning_rate": 7.287325767579756e-06, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9778735637664795, |
| "num_tokens": 4378865.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.670886075949367, |
| "grad_norm": 0.1650187373161316, |
| "learning_rate": 6.781959079900957e-06, |
| "loss": 0.0838, |
| "mean_token_accuracy": 0.9761627912521362, |
| "num_tokens": 4399569.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6835443037974684, |
| "grad_norm": 0.14305095374584198, |
| "learning_rate": 6.2941361224647e-06, |
| "loss": 0.0741, |
| "mean_token_accuracy": 0.9784291982650757, |
| "num_tokens": 4422488.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.6962025316455698, |
| "grad_norm": 0.15657547116279602, |
| "learning_rate": 5.823948704048443e-06, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9773022532463074, |
| "num_tokens": 4443347.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.708860759493671, |
| "grad_norm": 0.14245574176311493, |
| "learning_rate": 5.371485314403202e-06, |
| "loss": 0.0772, |
| "mean_token_accuracy": 0.9766822457313538, |
| "num_tokens": 4465197.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.721518987341772, |
| "grad_norm": 0.16059687733650208, |
| "learning_rate": 4.936831107599749e-06, |
| "loss": 0.0868, |
| "mean_token_accuracy": 0.9753717184066772, |
| "num_tokens": 4486984.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.7341772151898733, |
| "grad_norm": 0.16994109749794006, |
| "learning_rate": 4.5200678860024885e-06, |
| "loss": 0.0907, |
| "mean_token_accuracy": 0.9752695560455322, |
| "num_tokens": 4506619.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7468354430379747, |
| "grad_norm": 0.14966760575771332, |
| "learning_rate": 4.121274084874194e-06, |
| "loss": 0.086, |
| "mean_token_accuracy": 0.9755901098251343, |
| "num_tokens": 4527781.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.759493670886076, |
| "grad_norm": 0.16135965287685394, |
| "learning_rate": 3.7405247576144054e-06, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.976494312286377, |
| "num_tokens": 4547670.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.7721518987341773, |
| "grad_norm": 0.13386498391628265, |
| "learning_rate": 3.3778915616342943e-06, |
| "loss": 0.0773, |
| "mean_token_accuracy": 0.9776089787483215, |
| "num_tokens": 4570511.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.7848101265822782, |
| "grad_norm": 0.14860939979553223, |
| "learning_rate": 3.0334427448706847e-06, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.9759284257888794, |
| "num_tokens": 4590017.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.7974683544303796, |
| "grad_norm": 0.1305076777935028, |
| "learning_rate": 2.707243132941717e-06, |
| "loss": 0.0746, |
| "mean_token_accuracy": 0.9780017733573914, |
| "num_tokens": 4610219.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.810126582278481, |
| "grad_norm": 0.14003509283065796, |
| "learning_rate": 2.3993541169465837e-06, |
| "loss": 0.0841, |
| "mean_token_accuracy": 0.9770644307136536, |
| "num_tokens": 4631778.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8227848101265822, |
| "grad_norm": 0.1698557734489441, |
| "learning_rate": 2.1098336419116625e-06, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9789777994155884, |
| "num_tokens": 4654675.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.8354430379746836, |
| "grad_norm": 0.1640406996011734, |
| "learning_rate": 1.838736195885238e-06, |
| "loss": 0.0761, |
| "mean_token_accuracy": 0.9789262413978577, |
| "num_tokens": 4674669.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.848101265822785, |
| "grad_norm": 0.17419269680976868, |
| "learning_rate": 1.5861127996827597e-06, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9762682914733887, |
| "num_tokens": 4695844.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8607594936708862, |
| "grad_norm": 0.16612987220287323, |
| "learning_rate": 1.3520109972846917e-06, |
| "loss": 0.0801, |
| "mean_token_accuracy": 0.9774113893508911, |
| "num_tokens": 4715741.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8734177215189876, |
| "grad_norm": 0.15979738533496857, |
| "learning_rate": 1.1364748468886687e-06, |
| "loss": 0.0888, |
| "mean_token_accuracy": 0.9751821160316467, |
| "num_tokens": 4736395.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8860759493670884, |
| "grad_norm": 0.15005967020988464, |
| "learning_rate": 9.395449126177291e-07, |
| "loss": 0.0765, |
| "mean_token_accuracy": 0.9786757826805115, |
| "num_tokens": 4759250.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.8987341772151898, |
| "grad_norm": 0.13539956510066986, |
| "learning_rate": 7.612582568860549e-07, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9776937365531921, |
| "num_tokens": 4779936.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.911392405063291, |
| "grad_norm": 0.15969063341617584, |
| "learning_rate": 6.016484334238515e-07, |
| "loss": 0.0913, |
| "mean_token_accuracy": 0.9742149114608765, |
| "num_tokens": 4800826.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9240506329113924, |
| "grad_norm": 0.16468146443367004, |
| "learning_rate": 4.607454809624434e-07, |
| "loss": 0.0924, |
| "mean_token_accuracy": 0.9755955338478088, |
| "num_tokens": 4821501.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9367088607594938, |
| "grad_norm": 0.13484787940979004, |
| "learning_rate": 3.385759175809966e-07, |
| "loss": 0.0782, |
| "mean_token_accuracy": 0.9774335622787476, |
| "num_tokens": 4841772.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9493670886075947, |
| "grad_norm": 0.1467486321926117, |
| "learning_rate": 2.3516273571577708e-07, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.9767971634864807, |
| "num_tokens": 4865109.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.962025316455696, |
| "grad_norm": 0.18683797121047974, |
| "learning_rate": 1.505253978329235e-07, |
| "loss": 0.0899, |
| "mean_token_accuracy": 0.975134551525116, |
| "num_tokens": 4884678.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.9746835443037973, |
| "grad_norm": 0.15372681617736816, |
| "learning_rate": 8.467983276563284e-08, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.976805567741394, |
| "num_tokens": 4906342.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9873417721518987, |
| "grad_norm": 0.15492376685142517, |
| "learning_rate": 3.763843271631373e-08, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9773779511451721, |
| "num_tokens": 4927138.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.13269944489002228, |
| "learning_rate": 9.410050924374415e-09, |
| "loss": 0.076, |
| "mean_token_accuracy": 0.9784287810325623, |
| "num_tokens": 4948434.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0, |
| "step": 237, |
| "total_flos": 4.5754586889610854e+17, |
| "train_loss": 0.17737930308917405, |
| "train_runtime": 1187.0603, |
| "train_samples_per_second": 12.636, |
| "train_steps_per_second": 0.2 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 237, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 4.5754586889610854e+17, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|