| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 4.942675159235669, |
| "eval_steps": 500, |
| "global_step": 390, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 2.731952428817749, |
| "learning_rate": 0.0, |
| "loss": 1.1688, |
| "mean_token_accuracy": 0.809821754693985, |
| "num_tokens": 30618.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 2.9573097229003906, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 1.2048, |
| "mean_token_accuracy": 0.8096106648445129, |
| "num_tokens": 57834.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 2.3572206497192383, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 1.2344, |
| "mean_token_accuracy": 0.8015994131565094, |
| "num_tokens": 83683.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 1.6275570392608643, |
| "learning_rate": 5e-05, |
| "loss": 1.1427, |
| "mean_token_accuracy": 0.8016693592071533, |
| "num_tokens": 109319.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 1.5466352701187134, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 0.9917, |
| "mean_token_accuracy": 0.8147929906845093, |
| "num_tokens": 130905.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 0.7876960039138794, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 0.8381, |
| "mean_token_accuracy": 0.8273780345916748, |
| "num_tokens": 161660.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 0.666037917137146, |
| "learning_rate": 0.0001, |
| "loss": 0.7595, |
| "mean_token_accuracy": 0.8374767899513245, |
| "num_tokens": 191893.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 0.612377941608429, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 0.7383, |
| "mean_token_accuracy": 0.8415369987487793, |
| "num_tokens": 219163.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 0.5555623769760132, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 0.659, |
| "mean_token_accuracy": 0.8522799015045166, |
| "num_tokens": 249175.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 0.581606388092041, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.6833, |
| "mean_token_accuracy": 0.8534884452819824, |
| "num_tokens": 269887.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 0.36686646938323975, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 0.6006, |
| "mean_token_accuracy": 0.8640938997268677, |
| "num_tokens": 297750.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 0.4784420132637024, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 0.6608, |
| "mean_token_accuracy": 0.851963609457016, |
| "num_tokens": 323030.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 0.4178142845630646, |
| "learning_rate": 0.0002, |
| "loss": 0.5849, |
| "mean_token_accuracy": 0.8634214401245117, |
| "num_tokens": 353170.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 0.3077121078968048, |
| "learning_rate": 0.0001999965463076377, |
| "loss": 0.5771, |
| "mean_token_accuracy": 0.8672670423984528, |
| "num_tokens": 381576.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.3658709228038788, |
| "learning_rate": 0.00019998618546911056, |
| "loss": 0.5995, |
| "mean_token_accuracy": 0.8625359535217285, |
| "num_tokens": 409703.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.30979523062705994, |
| "learning_rate": 0.00019996891820008164, |
| "loss": 0.6, |
| "mean_token_accuracy": 0.8614856898784637, |
| "num_tokens": 438811.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 0.3065497875213623, |
| "learning_rate": 0.00019994474569326757, |
| "loss": 0.5938, |
| "mean_token_accuracy": 0.861987829208374, |
| "num_tokens": 468774.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.30102476477622986, |
| "learning_rate": 0.00019991366961835642, |
| "loss": 0.5299, |
| "mean_token_accuracy": 0.8783503472805023, |
| "num_tokens": 492753.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 0.2817172408103943, |
| "learning_rate": 0.00019987569212189224, |
| "loss": 0.5211, |
| "mean_token_accuracy": 0.8772054016590118, |
| "num_tokens": 523031.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.26896849274635315, |
| "learning_rate": 0.00019983081582712685, |
| "loss": 0.5437, |
| "mean_token_accuracy": 0.8750361204147339, |
| "num_tokens": 552515.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.2550504803657532, |
| "learning_rate": 0.0001997790438338385, |
| "loss": 0.5481, |
| "mean_token_accuracy": 0.8728193938732147, |
| "num_tokens": 583290.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.2866853177547455, |
| "learning_rate": 0.00019972037971811802, |
| "loss": 0.4961, |
| "mean_token_accuracy": 0.8841757476329803, |
| "num_tokens": 603285.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.25682392716407776, |
| "learning_rate": 0.00019965482753212156, |
| "loss": 0.559, |
| "mean_token_accuracy": 0.8713036179542542, |
| "num_tokens": 637583.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.24620702862739563, |
| "learning_rate": 0.0001995823918037908, |
| "loss": 0.5419, |
| "mean_token_accuracy": 0.8724701404571533, |
| "num_tokens": 668657.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.25744566321372986, |
| "learning_rate": 0.00019950307753654017, |
| "loss": 0.5587, |
| "mean_token_accuracy": 0.869242787361145, |
| "num_tokens": 695335.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.23623758554458618, |
| "learning_rate": 0.0001994168902089112, |
| "loss": 0.5589, |
| "mean_token_accuracy": 0.8748637139797211, |
| "num_tokens": 723727.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.25645118951797485, |
| "learning_rate": 0.00019932383577419432, |
| "loss": 0.5035, |
| "mean_token_accuracy": 0.8788127899169922, |
| "num_tokens": 751154.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.23220489919185638, |
| "learning_rate": 0.00019922392066001722, |
| "loss": 0.5386, |
| "mean_token_accuracy": 0.8756157159805298, |
| "num_tokens": 783078.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.2706703841686249, |
| "learning_rate": 0.0001991171517679013, |
| "loss": 0.538, |
| "mean_token_accuracy": 0.8703268766403198, |
| "num_tokens": 802685.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.23708438873291016, |
| "learning_rate": 0.00019900353647278466, |
| "loss": 0.5621, |
| "mean_token_accuracy": 0.86676886677742, |
| "num_tokens": 826425.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.2513059973716736, |
| "learning_rate": 0.00019888308262251285, |
| "loss": 0.5905, |
| "mean_token_accuracy": 0.8621217608451843, |
| "num_tokens": 851265.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.28542405366897583, |
| "learning_rate": 0.00019875579853729676, |
| "loss": 0.5255, |
| "mean_token_accuracy": 0.8751068413257599, |
| "num_tokens": 878297.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.24914482235908508, |
| "learning_rate": 0.00019862169300913785, |
| "loss": 0.489, |
| "mean_token_accuracy": 0.8854367136955261, |
| "num_tokens": 899381.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.20723982155323029, |
| "learning_rate": 0.00019848077530122083, |
| "loss": 0.5498, |
| "mean_token_accuracy": 0.8704783916473389, |
| "num_tokens": 930759.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.22724807262420654, |
| "learning_rate": 0.00019833305514727395, |
| "loss": 0.5522, |
| "mean_token_accuracy": 0.8706673681735992, |
| "num_tokens": 957135.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.24670973420143127, |
| "learning_rate": 0.0001981785427508966, |
| "loss": 0.5207, |
| "mean_token_accuracy": 0.8706326186656952, |
| "num_tokens": 981142.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.21167397499084473, |
| "learning_rate": 0.00019801724878485438, |
| "loss": 0.5588, |
| "mean_token_accuracy": 0.8660498857498169, |
| "num_tokens": 1009855.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.22114594280719757, |
| "learning_rate": 0.00019784918439034216, |
| "loss": 0.5789, |
| "mean_token_accuracy": 0.8654206991195679, |
| "num_tokens": 1035989.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.23111383616924286, |
| "learning_rate": 0.00019767436117621413, |
| "loss": 0.4989, |
| "mean_token_accuracy": 0.8822118937969208, |
| "num_tokens": 1063409.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.20834460854530334, |
| "learning_rate": 0.00019749279121818235, |
| "loss": 0.5529, |
| "mean_token_accuracy": 0.8721747994422913, |
| "num_tokens": 1094423.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.2471723109483719, |
| "learning_rate": 0.00019730448705798239, |
| "loss": 0.5971, |
| "mean_token_accuracy": 0.8657170534133911, |
| "num_tokens": 1119067.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.19489862024784088, |
| "learning_rate": 0.000197109461702507, |
| "loss": 0.5133, |
| "mean_token_accuracy": 0.8722980916500092, |
| "num_tokens": 1147347.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.18404309451580048, |
| "learning_rate": 0.0001969077286229078, |
| "loss": 0.4991, |
| "mean_token_accuracy": 0.8807591199874878, |
| "num_tokens": 1174458.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.21981379389762878, |
| "learning_rate": 0.00019669930175366472, |
| "loss": 0.5163, |
| "mean_token_accuracy": 0.8810671269893646, |
| "num_tokens": 1202708.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.19955477118492126, |
| "learning_rate": 0.00019648419549162348, |
| "loss": 0.5124, |
| "mean_token_accuracy": 0.8778521418571472, |
| "num_tokens": 1226511.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.20685520768165588, |
| "learning_rate": 0.0001962624246950012, |
| "loss": 0.4903, |
| "mean_token_accuracy": 0.8821050524711609, |
| "num_tokens": 1254823.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.21673081815242767, |
| "learning_rate": 0.00019603400468235998, |
| "loss": 0.524, |
| "mean_token_accuracy": 0.8739053308963776, |
| "num_tokens": 1280157.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.20037099719047546, |
| "learning_rate": 0.0001957989512315489, |
| "loss": 0.5243, |
| "mean_token_accuracy": 0.8742711842060089, |
| "num_tokens": 1311204.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.17604073882102966, |
| "learning_rate": 0.0001955572805786141, |
| "loss": 0.4874, |
| "mean_token_accuracy": 0.8826193511486053, |
| "num_tokens": 1338924.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.19787156581878662, |
| "learning_rate": 0.0001953090094166773, |
| "loss": 0.519, |
| "mean_token_accuracy": 0.8827911615371704, |
| "num_tokens": 1364640.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.23413977026939392, |
| "learning_rate": 0.0001950541548947829, |
| "loss": 0.5818, |
| "mean_token_accuracy": 0.865499883890152, |
| "num_tokens": 1386817.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.19605080783367157, |
| "learning_rate": 0.0001947927346167132, |
| "loss": 0.5408, |
| "mean_token_accuracy": 0.8805167376995087, |
| "num_tokens": 1417598.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.19370882213115692, |
| "learning_rate": 0.00019452476663977248, |
| "loss": 0.5277, |
| "mean_token_accuracy": 0.8767336308956146, |
| "num_tokens": 1452103.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.2124357670545578, |
| "learning_rate": 0.00019425026947353992, |
| "loss": 0.4488, |
| "mean_token_accuracy": 0.8942307233810425, |
| "num_tokens": 1476260.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.19639843702316284, |
| "learning_rate": 0.00019396926207859084, |
| "loss": 0.5053, |
| "mean_token_accuracy": 0.8811178207397461, |
| "num_tokens": 1505761.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.1861242651939392, |
| "learning_rate": 0.0001936817638651871, |
| "loss": 0.5098, |
| "mean_token_accuracy": 0.8793118894100189, |
| "num_tokens": 1535906.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.18348966538906097, |
| "learning_rate": 0.00019338779469193639, |
| "loss": 0.5253, |
| "mean_token_accuracy": 0.8732865154743195, |
| "num_tokens": 1569652.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.20582278072834015, |
| "learning_rate": 0.00019308737486442045, |
| "loss": 0.5484, |
| "mean_token_accuracy": 0.8730612993240356, |
| "num_tokens": 1596153.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.1865556836128235, |
| "learning_rate": 0.00019278052513379255, |
| "loss": 0.517, |
| "mean_token_accuracy": 0.8760738968849182, |
| "num_tokens": 1624508.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.23167841136455536, |
| "learning_rate": 0.00019246726669534415, |
| "loss": 0.4624, |
| "mean_token_accuracy": 0.886768102645874, |
| "num_tokens": 1653507.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.2016674131155014, |
| "learning_rate": 0.00019214762118704076, |
| "loss": 0.5536, |
| "mean_token_accuracy": 0.8673790991306305, |
| "num_tokens": 1682796.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.19925245642662048, |
| "learning_rate": 0.00019182161068802741, |
| "loss": 0.5173, |
| "mean_token_accuracy": 0.8760708868503571, |
| "num_tokens": 1710159.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.22986213862895966, |
| "learning_rate": 0.00019148925771710347, |
| "loss": 0.5277, |
| "mean_token_accuracy": 0.8781446814537048, |
| "num_tokens": 1739246.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.1752689927816391, |
| "learning_rate": 0.00019115058523116733, |
| "loss": 0.4663, |
| "mean_token_accuracy": 0.8877492845058441, |
| "num_tokens": 1770785.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.18831022083759308, |
| "learning_rate": 0.0001908056166236305, |
| "loss": 0.4976, |
| "mean_token_accuracy": 0.8858269155025482, |
| "num_tokens": 1800635.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.19960662722587585, |
| "learning_rate": 0.00019045437572280194, |
| "loss": 0.4967, |
| "mean_token_accuracy": 0.8812806904315948, |
| "num_tokens": 1829104.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.1994195133447647, |
| "learning_rate": 0.0001900968867902419, |
| "loss": 0.5614, |
| "mean_token_accuracy": 0.867830902338028, |
| "num_tokens": 1858519.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.20042599737644196, |
| "learning_rate": 0.00018973317451908642, |
| "loss": 0.5059, |
| "mean_token_accuracy": 0.877477616071701, |
| "num_tokens": 1882458.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.18692034482955933, |
| "learning_rate": 0.00018936326403234125, |
| "loss": 0.4931, |
| "mean_token_accuracy": 0.8819095194339752, |
| "num_tokens": 1914075.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.2646773159503937, |
| "learning_rate": 0.0001889871808811469, |
| "loss": 0.5257, |
| "mean_token_accuracy": 0.8753155171871185, |
| "num_tokens": 1941347.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.21669141948223114, |
| "learning_rate": 0.00018860495104301345, |
| "loss": 0.5334, |
| "mean_token_accuracy": 0.8770544230937958, |
| "num_tokens": 1969128.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.20509248971939087, |
| "learning_rate": 0.00018821660092002641, |
| "loss": 0.5268, |
| "mean_token_accuracy": 0.8741115033626556, |
| "num_tokens": 1995848.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.2039647400379181, |
| "learning_rate": 0.00018782215733702286, |
| "loss": 0.4668, |
| "mean_token_accuracy": 0.8840380907058716, |
| "num_tokens": 2021243.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.2123929262161255, |
| "learning_rate": 0.00018742164753973855, |
| "loss": 0.4872, |
| "mean_token_accuracy": 0.8842201232910156, |
| "num_tokens": 2048558.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.2204159051179886, |
| "learning_rate": 0.00018701509919292613, |
| "loss": 0.541, |
| "mean_token_accuracy": 0.8701495230197906, |
| "num_tokens": 2078250.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.2006702870130539, |
| "learning_rate": 0.00018660254037844388, |
| "loss": 0.5311, |
| "mean_token_accuracy": 0.8764555752277374, |
| "num_tokens": 2107652.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.20622111856937408, |
| "learning_rate": 0.0001861839995933164, |
| "loss": 0.5147, |
| "mean_token_accuracy": 0.8776688575744629, |
| "num_tokens": 2134576.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.20862704515457153, |
| "learning_rate": 0.00018575950574776595, |
| "loss": 0.4786, |
| "mean_token_accuracy": 0.8834514617919922, |
| "num_tokens": 2162186.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.20862704515457153, |
| "learning_rate": 0.00018532908816321558, |
| "loss": 0.4914, |
| "mean_token_accuracy": 0.8792589902877808, |
| "num_tokens": 2175983.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.36284950375556946, |
| "learning_rate": 0.00018489277657026375, |
| "loss": 0.43, |
| "mean_token_accuracy": 0.8981749415397644, |
| "num_tokens": 2203353.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.18358495831489563, |
| "learning_rate": 0.0001844506011066308, |
| "loss": 0.5233, |
| "mean_token_accuracy": 0.8746683299541473, |
| "num_tokens": 2224613.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.21040311455726624, |
| "learning_rate": 0.00018400259231507717, |
| "loss": 0.4447, |
| "mean_token_accuracy": 0.8906852006912231, |
| "num_tokens": 2251981.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.21265040338039398, |
| "learning_rate": 0.00018354878114129367, |
| "loss": 0.4362, |
| "mean_token_accuracy": 0.8928681313991547, |
| "num_tokens": 2281605.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.23001955449581146, |
| "learning_rate": 0.00018308919893176396, |
| "loss": 0.434, |
| "mean_token_accuracy": 0.8912529349327087, |
| "num_tokens": 2306102.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.2564128637313843, |
| "learning_rate": 0.0001826238774315995, |
| "loss": 0.4321, |
| "mean_token_accuracy": 0.8965701758861542, |
| "num_tokens": 2335253.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.2404835820198059, |
| "learning_rate": 0.00018215284878234642, |
| "loss": 0.4167, |
| "mean_token_accuracy": 0.8949294686317444, |
| "num_tokens": 2358904.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.18374451994895935, |
| "learning_rate": 0.00018167614551976567, |
| "loss": 0.4305, |
| "mean_token_accuracy": 0.8946235775947571, |
| "num_tokens": 2391283.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.1883268803358078, |
| "learning_rate": 0.00018119380057158568, |
| "loss": 0.4233, |
| "mean_token_accuracy": 0.89813432097435, |
| "num_tokens": 2422101.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.17908215522766113, |
| "learning_rate": 0.00018070584725522762, |
| "loss": 0.4617, |
| "mean_token_accuracy": 0.8903807699680328, |
| "num_tokens": 2454815.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.19653795659542084, |
| "learning_rate": 0.0001802123192755044, |
| "loss": 0.4367, |
| "mean_token_accuracy": 0.8922165334224701, |
| "num_tokens": 2481424.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.21111823618412018, |
| "learning_rate": 0.00017971325072229226, |
| "loss": 0.4174, |
| "mean_token_accuracy": 0.895957350730896, |
| "num_tokens": 2512270.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.1942635476589203, |
| "learning_rate": 0.00017920867606817625, |
| "loss": 0.4502, |
| "mean_token_accuracy": 0.8907138109207153, |
| "num_tokens": 2535781.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.261258065700531, |
| "learning_rate": 0.0001786986301660689, |
| "loss": 0.4638, |
| "mean_token_accuracy": 0.8896288275718689, |
| "num_tokens": 2559254.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.21905386447906494, |
| "learning_rate": 0.000178183148246803, |
| "loss": 0.4508, |
| "mean_token_accuracy": 0.8896691501140594, |
| "num_tokens": 2590325.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.2133377492427826, |
| "learning_rate": 0.00017766226591669785, |
| "loss": 0.4366, |
| "mean_token_accuracy": 0.8902366161346436, |
| "num_tokens": 2618053.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.2296481728553772, |
| "learning_rate": 0.0001771360191551, |
| "loss": 0.4278, |
| "mean_token_accuracy": 0.8949062824249268, |
| "num_tokens": 2649403.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.1748172491788864, |
| "learning_rate": 0.0001766044443118978, |
| "loss": 0.3914, |
| "mean_token_accuracy": 0.9003350138664246, |
| "num_tokens": 2680357.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.20810891687870026, |
| "learning_rate": 0.00017606757810501088, |
| "loss": 0.4308, |
| "mean_token_accuracy": 0.897574782371521, |
| "num_tokens": 2706511.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.21128255128860474, |
| "learning_rate": 0.0001755254576178535, |
| "loss": 0.4728, |
| "mean_token_accuracy": 0.8870101869106293, |
| "num_tokens": 2734107.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.24089288711547852, |
| "learning_rate": 0.00017497812029677344, |
| "loss": 0.4484, |
| "mean_token_accuracy": 0.889725536108017, |
| "num_tokens": 2757919.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.20210997760295868, |
| "learning_rate": 0.00017442560394846516, |
| "loss": 0.399, |
| "mean_token_accuracy": 0.8993033766746521, |
| "num_tokens": 2784820.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.2276032418012619, |
| "learning_rate": 0.0001738679467373586, |
| "loss": 0.3626, |
| "mean_token_accuracy": 0.9096324741840363, |
| "num_tokens": 2809247.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.22977371513843536, |
| "learning_rate": 0.00017330518718298264, |
| "loss": 0.4334, |
| "mean_token_accuracy": 0.895849198102951, |
| "num_tokens": 2840004.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.22106525301933289, |
| "learning_rate": 0.00017273736415730488, |
| "loss": 0.4166, |
| "mean_token_accuracy": 0.8970482349395752, |
| "num_tokens": 2866302.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.23758462071418762, |
| "learning_rate": 0.0001721645168820462, |
| "loss": 0.4115, |
| "mean_token_accuracy": 0.8981644213199615, |
| "num_tokens": 2894217.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.1981382668018341, |
| "learning_rate": 0.00017158668492597186, |
| "loss": 0.449, |
| "mean_token_accuracy": 0.8924685120582581, |
| "num_tokens": 2918539.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.2146390974521637, |
| "learning_rate": 0.00017100390820215804, |
| "loss": 0.4508, |
| "mean_token_accuracy": 0.8852833211421967, |
| "num_tokens": 2946667.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.24695628881454468, |
| "learning_rate": 0.00017041622696523518, |
| "loss": 0.4489, |
| "mean_token_accuracy": 0.890505313873291, |
| "num_tokens": 2976512.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.2295302450656891, |
| "learning_rate": 0.00016982368180860728, |
| "loss": 0.4247, |
| "mean_token_accuracy": 0.8994563519954681, |
| "num_tokens": 3002099.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.25571876764297485, |
| "learning_rate": 0.00016922631366164797, |
| "loss": 0.483, |
| "mean_token_accuracy": 0.8808054029941559, |
| "num_tokens": 3025720.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.2006886899471283, |
| "learning_rate": 0.0001686241637868734, |
| "loss": 0.4022, |
| "mean_token_accuracy": 0.899999737739563, |
| "num_tokens": 3054719.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.22816525399684906, |
| "learning_rate": 0.00016801727377709194, |
| "loss": 0.4429, |
| "mean_token_accuracy": 0.893610805273056, |
| "num_tokens": 3083697.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.20023752748966217, |
| "learning_rate": 0.00016740568555253155, |
| "loss": 0.4171, |
| "mean_token_accuracy": 0.8969627320766449, |
| "num_tokens": 3110382.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.2151436060667038, |
| "learning_rate": 0.00016678944135794374, |
| "loss": 0.4296, |
| "mean_token_accuracy": 0.8962332010269165, |
| "num_tokens": 3139512.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.21061868965625763, |
| "learning_rate": 0.00016616858375968595, |
| "loss": 0.416, |
| "mean_token_accuracy": 0.8994052708148956, |
| "num_tokens": 3168845.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.19060927629470825, |
| "learning_rate": 0.000165543155642781, |
| "loss": 0.4147, |
| "mean_token_accuracy": 0.9013650715351105, |
| "num_tokens": 3195898.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.2071344256401062, |
| "learning_rate": 0.0001649132002079552, |
| "loss": 0.3862, |
| "mean_token_accuracy": 0.9036861956119537, |
| "num_tokens": 3223855.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.20986929535865784, |
| "learning_rate": 0.00016427876096865394, |
| "loss": 0.3703, |
| "mean_token_accuracy": 0.9042750298976898, |
| "num_tokens": 3251564.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.18998707830905914, |
| "learning_rate": 0.00016363988174803638, |
| "loss": 0.4309, |
| "mean_token_accuracy": 0.8953231573104858, |
| "num_tokens": 3281326.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.20126497745513916, |
| "learning_rate": 0.00016299660667594814, |
| "loss": 0.4298, |
| "mean_token_accuracy": 0.8964099586009979, |
| "num_tokens": 3309696.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.20899806916713715, |
| "learning_rate": 0.00016234898018587337, |
| "loss": 0.4565, |
| "mean_token_accuracy": 0.890906423330307, |
| "num_tokens": 3339274.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.2075766921043396, |
| "learning_rate": 0.00016169704701186527, |
| "loss": 0.4058, |
| "mean_token_accuracy": 0.8975411057472229, |
| "num_tokens": 3367650.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.18813498318195343, |
| "learning_rate": 0.00016104085218545633, |
| "loss": 0.4145, |
| "mean_token_accuracy": 0.8943947851657867, |
| "num_tokens": 3395280.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.2107289433479309, |
| "learning_rate": 0.00016038044103254775, |
| "loss": 0.4139, |
| "mean_token_accuracy": 0.8994401693344116, |
| "num_tokens": 3419713.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.2302611917257309, |
| "learning_rate": 0.00015971585917027862, |
| "loss": 0.4669, |
| "mean_token_accuracy": 0.8907433152198792, |
| "num_tokens": 3445597.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.23754490911960602, |
| "learning_rate": 0.00015904715250387498, |
| "loss": 0.4066, |
| "mean_token_accuracy": 0.9026502966880798, |
| "num_tokens": 3474786.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.1973937302827835, |
| "learning_rate": 0.000158374367223479, |
| "loss": 0.3996, |
| "mean_token_accuracy": 0.8982687294483185, |
| "num_tokens": 3500905.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.2112189680337906, |
| "learning_rate": 0.0001576975498009583, |
| "loss": 0.4103, |
| "mean_token_accuracy": 0.8986146748065948, |
| "num_tokens": 3533088.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.20334266126155853, |
| "learning_rate": 0.0001570167469866962, |
| "loss": 0.4155, |
| "mean_token_accuracy": 0.8960614800453186, |
| "num_tokens": 3564101.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.23099584877490997, |
| "learning_rate": 0.0001563320058063622, |
| "loss": 0.4164, |
| "mean_token_accuracy": 0.8984293341636658, |
| "num_tokens": 3594946.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.21379804611206055, |
| "learning_rate": 0.00015564337355766412, |
| "loss": 0.4532, |
| "mean_token_accuracy": 0.8880736827850342, |
| "num_tokens": 3622979.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.1995055377483368, |
| "learning_rate": 0.0001549508978070806, |
| "loss": 0.4119, |
| "mean_token_accuracy": 0.8986586034297943, |
| "num_tokens": 3656610.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.18747873604297638, |
| "learning_rate": 0.00015425462638657595, |
| "loss": 0.4457, |
| "mean_token_accuracy": 0.8943086564540863, |
| "num_tokens": 3682683.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.22786714136600494, |
| "learning_rate": 0.00015355460739029586, |
| "loss": 0.488, |
| "mean_token_accuracy": 0.8869983851909637, |
| "num_tokens": 3709699.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.20793353021144867, |
| "learning_rate": 0.00015285088917124556, |
| "loss": 0.4209, |
| "mean_token_accuracy": 0.8953282237052917, |
| "num_tokens": 3736127.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.23483413457870483, |
| "learning_rate": 0.0001521435203379498, |
| "loss": 0.4475, |
| "mean_token_accuracy": 0.893291562795639, |
| "num_tokens": 3767828.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.1924842745065689, |
| "learning_rate": 0.00015143254975109538, |
| "loss": 0.4636, |
| "mean_token_accuracy": 0.8875114619731903, |
| "num_tokens": 3797497.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.22160354256629944, |
| "learning_rate": 0.0001507180265201559, |
| "loss": 0.4296, |
| "mean_token_accuracy": 0.890423446893692, |
| "num_tokens": 3822354.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.21033191680908203, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.4455, |
| "mean_token_accuracy": 0.8900648355484009, |
| "num_tokens": 3854962.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.2192336469888687, |
| "learning_rate": 0.00014927851978748178, |
| "loss": 0.4211, |
| "mean_token_accuracy": 0.8970896303653717, |
| "num_tokens": 3881037.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.20573553442955017, |
| "learning_rate": 0.00014855363571801523, |
| "loss": 0.4671, |
| "mean_token_accuracy": 0.8863770067691803, |
| "num_tokens": 3907459.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.22238121926784515, |
| "learning_rate": 0.00014782539786213183, |
| "loss": 0.4143, |
| "mean_token_accuracy": 0.897837221622467, |
| "num_tokens": 3939449.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.2159305065870285, |
| "learning_rate": 0.00014709385652202203, |
| "loss": 0.4186, |
| "mean_token_accuracy": 0.8961680829524994, |
| "num_tokens": 3969866.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.20582257211208344, |
| "learning_rate": 0.00014635906222806058, |
| "loss": 0.4537, |
| "mean_token_accuracy": 0.8933248817920685, |
| "num_tokens": 3992840.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.2202337086200714, |
| "learning_rate": 0.0001456210657353163, |
| "loss": 0.4291, |
| "mean_token_accuracy": 0.8948224484920502, |
| "num_tokens": 4018527.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.21440590918064117, |
| "learning_rate": 0.00014487991802004623, |
| "loss": 0.4368, |
| "mean_token_accuracy": 0.8931339383125305, |
| "num_tokens": 4043208.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.24883124232292175, |
| "learning_rate": 0.0001441356702761744, |
| "loss": 0.4568, |
| "mean_token_accuracy": 0.8917295932769775, |
| "num_tokens": 4069096.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.2184818983078003, |
| "learning_rate": 0.00014338837391175582, |
| "loss": 0.4184, |
| "mean_token_accuracy": 0.8986537158489227, |
| "num_tokens": 4093319.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.198222354054451, |
| "learning_rate": 0.0001426380805454254, |
| "loss": 0.4521, |
| "mean_token_accuracy": 0.8902782797813416, |
| "num_tokens": 4131084.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.19184260070323944, |
| "learning_rate": 0.0001418848420028325, |
| "loss": 0.3702, |
| "mean_token_accuracy": 0.9042331576347351, |
| "num_tokens": 4161283.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.20852942764759064, |
| "learning_rate": 0.00014112871031306119, |
| "loss": 0.4591, |
| "mean_token_accuracy": 0.8892327547073364, |
| "num_tokens": 4189696.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.2122785896062851, |
| "learning_rate": 0.00014036973770503624, |
| "loss": 0.4011, |
| "mean_token_accuracy": 0.9002106189727783, |
| "num_tokens": 4214858.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.24969106912612915, |
| "learning_rate": 0.0001396079766039157, |
| "loss": 0.4398, |
| "mean_token_accuracy": 0.8920584619045258, |
| "num_tokens": 4239007.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.2375272810459137, |
| "learning_rate": 0.00013884347962746948, |
| "loss": 0.4547, |
| "mean_token_accuracy": 0.8890532553195953, |
| "num_tokens": 4263429.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.26299113035202026, |
| "learning_rate": 0.00013807629958244498, |
| "loss": 0.4653, |
| "mean_token_accuracy": 0.8913359940052032, |
| "num_tokens": 4288110.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.23416920006275177, |
| "learning_rate": 0.0001373064894609194, |
| "loss": 0.4476, |
| "mean_token_accuracy": 0.893648236989975, |
| "num_tokens": 4315394.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.21231195330619812, |
| "learning_rate": 0.00013653410243663952, |
| "loss": 0.436, |
| "mean_token_accuracy": 0.887963205575943, |
| "num_tokens": 4339453.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.3712882995605469, |
| "learning_rate": 0.0001357591918613486, |
| "loss": 0.3925, |
| "mean_token_accuracy": 0.9056902527809143, |
| "num_tokens": 4351488.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.25778403878211975, |
| "learning_rate": 0.0001349818112611015, |
| "loss": 0.32, |
| "mean_token_accuracy": 0.9173864722251892, |
| "num_tokens": 4371410.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 0.23973894119262695, |
| "learning_rate": 0.00013420201433256689, |
| "loss": 0.3256, |
| "mean_token_accuracy": 0.915358692407608, |
| "num_tokens": 4395306.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.22796404361724854, |
| "learning_rate": 0.00013341985493931877, |
| "loss": 0.3154, |
| "mean_token_accuracy": 0.9181290864944458, |
| "num_tokens": 4418479.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.24940259754657745, |
| "learning_rate": 0.0001326353871081156, |
| "loss": 0.3561, |
| "mean_token_accuracy": 0.9136996567249298, |
| "num_tokens": 4446513.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.2551908493041992, |
| "learning_rate": 0.00013184866502516845, |
| "loss": 0.2875, |
| "mean_token_accuracy": 0.9239294826984406, |
| "num_tokens": 4475587.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.31779205799102783, |
| "learning_rate": 0.00013105974303239838, |
| "loss": 0.337, |
| "mean_token_accuracy": 0.9131913781166077, |
| "num_tokens": 4507803.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.3075869381427765, |
| "learning_rate": 0.0001302686756236826, |
| "loss": 0.3437, |
| "mean_token_accuracy": 0.9136849045753479, |
| "num_tokens": 4534774.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.27857956290245056, |
| "learning_rate": 0.00012947551744109043, |
| "loss": 0.2961, |
| "mean_token_accuracy": 0.9221843779087067, |
| "num_tokens": 4561771.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.24581745266914368, |
| "learning_rate": 0.00012868032327110904, |
| "loss": 0.3091, |
| "mean_token_accuracy": 0.9198079109191895, |
| "num_tokens": 4591242.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.26451313495635986, |
| "learning_rate": 0.00012788314804085903, |
| "loss": 0.3353, |
| "mean_token_accuracy": 0.9105002880096436, |
| "num_tokens": 4617453.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.25673994421958923, |
| "learning_rate": 0.00012708404681430053, |
| "loss": 0.3369, |
| "mean_token_accuracy": 0.9157171845436096, |
| "num_tokens": 4644719.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.24341438710689545, |
| "learning_rate": 0.00012628307478842953, |
| "loss": 0.3177, |
| "mean_token_accuracy": 0.9162335693836212, |
| "num_tokens": 4672500.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.24725079536437988, |
| "learning_rate": 0.0001254802872894655, |
| "loss": 0.2765, |
| "mean_token_accuracy": 0.9274137318134308, |
| "num_tokens": 4698067.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.25747695565223694, |
| "learning_rate": 0.00012467573976902935, |
| "loss": 0.2873, |
| "mean_token_accuracy": 0.9210238754749298, |
| "num_tokens": 4721310.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.26107609272003174, |
| "learning_rate": 0.0001238694878003138, |
| "loss": 0.3402, |
| "mean_token_accuracy": 0.9148900210857391, |
| "num_tokens": 4751803.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.2875032126903534, |
| "learning_rate": 0.00012306158707424403, |
| "loss": 0.2983, |
| "mean_token_accuracy": 0.9225635528564453, |
| "num_tokens": 4780290.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.2381308525800705, |
| "learning_rate": 0.00012225209339563145, |
| "loss": 0.2977, |
| "mean_token_accuracy": 0.9232416152954102, |
| "num_tokens": 4811354.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.26640740036964417, |
| "learning_rate": 0.00012144106267931876, |
| "loss": 0.2846, |
| "mean_token_accuracy": 0.9265687465667725, |
| "num_tokens": 4842332.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.24563997983932495, |
| "learning_rate": 0.00012062855094631778, |
| "loss": 0.3108, |
| "mean_token_accuracy": 0.9207164347171783, |
| "num_tokens": 4870984.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.27466630935668945, |
| "learning_rate": 0.00011981461431993977, |
| "loss": 0.3281, |
| "mean_token_accuracy": 0.9170567989349365, |
| "num_tokens": 4894780.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.2519949972629547, |
| "learning_rate": 0.00011899930902191902, |
| "loss": 0.3175, |
| "mean_token_accuracy": 0.9188465774059296, |
| "num_tokens": 4921436.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.26715734601020813, |
| "learning_rate": 0.00011818269136852909, |
| "loss": 0.3441, |
| "mean_token_accuracy": 0.9148562848567963, |
| "num_tokens": 4948039.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.23166969418525696, |
| "learning_rate": 0.00011736481776669306, |
| "loss": 0.319, |
| "mean_token_accuracy": 0.915693461894989, |
| "num_tokens": 4978581.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.2414565235376358, |
| "learning_rate": 0.00011654574471008713, |
| "loss": 0.3072, |
| "mean_token_accuracy": 0.9196109175682068, |
| "num_tokens": 5009258.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.2841672897338867, |
| "learning_rate": 0.00011572552877523854, |
| "loss": 0.3672, |
| "mean_token_accuracy": 0.9095753729343414, |
| "num_tokens": 5036488.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.26623329520225525, |
| "learning_rate": 0.00011490422661761744, |
| "loss": 0.2767, |
| "mean_token_accuracy": 0.9287644922733307, |
| "num_tokens": 5064738.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.28330451250076294, |
| "learning_rate": 0.00011408189496772368, |
| "loss": 0.3229, |
| "mean_token_accuracy": 0.9160982072353363, |
| "num_tokens": 5093434.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.2630554735660553, |
| "learning_rate": 0.00011325859062716795, |
| "loss": 0.3055, |
| "mean_token_accuracy": 0.9205747842788696, |
| "num_tokens": 5123026.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.2821624279022217, |
| "learning_rate": 0.00011243437046474853, |
| "loss": 0.3071, |
| "mean_token_accuracy": 0.9194858074188232, |
| "num_tokens": 5154338.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.28624358773231506, |
| "learning_rate": 0.00011160929141252303, |
| "loss": 0.3229, |
| "mean_token_accuracy": 0.917842447757721, |
| "num_tokens": 5178219.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.3025202453136444, |
| "learning_rate": 0.00011078341046187589, |
| "loss": 0.3013, |
| "mean_token_accuracy": 0.9202087819576263, |
| "num_tokens": 5203234.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.24336163699626923, |
| "learning_rate": 0.00010995678465958168, |
| "loss": 0.3285, |
| "mean_token_accuracy": 0.9186490774154663, |
| "num_tokens": 5232408.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.25561633706092834, |
| "learning_rate": 0.00010912947110386484, |
| "loss": 0.3698, |
| "mean_token_accuracy": 0.9088276028633118, |
| "num_tokens": 5261026.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.2555694282054901, |
| "learning_rate": 0.00010830152694045552, |
| "loss": 0.3148, |
| "mean_token_accuracy": 0.919522762298584, |
| "num_tokens": 5288695.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.24887681007385254, |
| "learning_rate": 0.00010747300935864243, |
| "loss": 0.2944, |
| "mean_token_accuracy": 0.9257466793060303, |
| "num_tokens": 5315340.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.23277120292186737, |
| "learning_rate": 0.00010664397558732244, |
| "loss": 0.2951, |
| "mean_token_accuracy": 0.9233549237251282, |
| "num_tokens": 5348114.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.273926705121994, |
| "learning_rate": 0.00010581448289104758, |
| "loss": 0.3484, |
| "mean_token_accuracy": 0.9133157134056091, |
| "num_tokens": 5377152.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.279252827167511, |
| "learning_rate": 0.00010498458856606972, |
| "loss": 0.3105, |
| "mean_token_accuracy": 0.9215060770511627, |
| "num_tokens": 5403199.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.23848757147789001, |
| "learning_rate": 0.00010415434993638269, |
| "loss": 0.3066, |
| "mean_token_accuracy": 0.9202364385128021, |
| "num_tokens": 5431148.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.25585582852363586, |
| "learning_rate": 0.00010332382434976266, |
| "loss": 0.314, |
| "mean_token_accuracy": 0.921753317117691, |
| "num_tokens": 5461750.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.25233033299446106, |
| "learning_rate": 0.0001024930691738073, |
| "loss": 0.3226, |
| "mean_token_accuracy": 0.9191461503505707, |
| "num_tokens": 5491122.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.3022018373012543, |
| "learning_rate": 0.00010166214179197264, |
| "loss": 0.3584, |
| "mean_token_accuracy": 0.911718875169754, |
| "num_tokens": 5514434.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.2553904950618744, |
| "learning_rate": 0.00010083109959960973, |
| "loss": 0.3342, |
| "mean_token_accuracy": 0.9178999066352844, |
| "num_tokens": 5548042.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.2905219495296478, |
| "learning_rate": 0.0001, |
| "loss": 0.3583, |
| "mean_token_accuracy": 0.9109853804111481, |
| "num_tokens": 5575394.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.255098432302475, |
| "learning_rate": 9.916890040039031e-05, |
| "loss": 0.3194, |
| "mean_token_accuracy": 0.9198348224163055, |
| "num_tokens": 5601082.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.2750662565231323, |
| "learning_rate": 9.833785820802739e-05, |
| "loss": 0.3325, |
| "mean_token_accuracy": 0.914797455072403, |
| "num_tokens": 5629018.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.2625913619995117, |
| "learning_rate": 9.750693082619273e-05, |
| "loss": 0.3198, |
| "mean_token_accuracy": 0.9208146929740906, |
| "num_tokens": 5655575.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.2661764621734619, |
| "learning_rate": 9.667617565023735e-05, |
| "loss": 0.3205, |
| "mean_token_accuracy": 0.9181171953678131, |
| "num_tokens": 5684062.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.27836722135543823, |
| "learning_rate": 9.584565006361734e-05, |
| "loss": 0.3373, |
| "mean_token_accuracy": 0.9147651493549347, |
| "num_tokens": 5707293.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.25967466831207275, |
| "learning_rate": 9.501541143393028e-05, |
| "loss": 0.3209, |
| "mean_token_accuracy": 0.9182553887367249, |
| "num_tokens": 5736018.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.300536185503006, |
| "learning_rate": 9.418551710895243e-05, |
| "loss": 0.3436, |
| "mean_token_accuracy": 0.9132080078125, |
| "num_tokens": 5759355.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.2817765176296234, |
| "learning_rate": 9.335602441267759e-05, |
| "loss": 0.3308, |
| "mean_token_accuracy": 0.9144207537174225, |
| "num_tokens": 5786713.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.27997687458992004, |
| "learning_rate": 9.252699064135758e-05, |
| "loss": 0.2886, |
| "mean_token_accuracy": 0.9254343807697296, |
| "num_tokens": 5810146.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.2512475848197937, |
| "learning_rate": 9.169847305954447e-05, |
| "loss": 0.3294, |
| "mean_token_accuracy": 0.9175789952278137, |
| "num_tokens": 5839567.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.2896527349948883, |
| "learning_rate": 9.087052889613518e-05, |
| "loss": 0.333, |
| "mean_token_accuracy": 0.9168034195899963, |
| "num_tokens": 5863274.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.24823246896266937, |
| "learning_rate": 9.004321534041835e-05, |
| "loss": 0.3175, |
| "mean_token_accuracy": 0.9179215729236603, |
| "num_tokens": 5891923.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.26605039834976196, |
| "learning_rate": 8.921658953812415e-05, |
| "loss": 0.325, |
| "mean_token_accuracy": 0.919013649225235, |
| "num_tokens": 5919710.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.28539609909057617, |
| "learning_rate": 8.839070858747697e-05, |
| "loss": 0.333, |
| "mean_token_accuracy": 0.9131192266941071, |
| "num_tokens": 5946338.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.27890920639038086, |
| "learning_rate": 8.756562953525152e-05, |
| "loss": 0.3211, |
| "mean_token_accuracy": 0.9164293110370636, |
| "num_tokens": 5970380.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.2748299837112427, |
| "learning_rate": 8.674140937283208e-05, |
| "loss": 0.2877, |
| "mean_token_accuracy": 0.9252252280712128, |
| "num_tokens": 5996619.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.26802513003349304, |
| "learning_rate": 8.591810503227635e-05, |
| "loss": 0.3117, |
| "mean_token_accuracy": 0.9208323955535889, |
| "num_tokens": 6023567.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.2869545817375183, |
| "learning_rate": 8.509577338238255e-05, |
| "loss": 0.3161, |
| "mean_token_accuracy": 0.9191421270370483, |
| "num_tokens": 6048364.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.27043092250823975, |
| "learning_rate": 8.427447122476148e-05, |
| "loss": 0.32, |
| "mean_token_accuracy": 0.9222770631313324, |
| "num_tokens": 6078904.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.2868477404117584, |
| "learning_rate": 8.345425528991288e-05, |
| "loss": 0.3534, |
| "mean_token_accuracy": 0.9121315777301788, |
| "num_tokens": 6102971.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.2407357096672058, |
| "learning_rate": 8.263518223330697e-05, |
| "loss": 0.3213, |
| "mean_token_accuracy": 0.9192101955413818, |
| "num_tokens": 6133199.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.2626263201236725, |
| "learning_rate": 8.181730863147093e-05, |
| "loss": 0.2971, |
| "mean_token_accuracy": 0.9247592687606812, |
| "num_tokens": 6159899.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.2626074552536011, |
| "learning_rate": 8.100069097808103e-05, |
| "loss": 0.2947, |
| "mean_token_accuracy": 0.9244669079780579, |
| "num_tokens": 6186375.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.2592032849788666, |
| "learning_rate": 8.018538568006027e-05, |
| "loss": 0.3211, |
| "mean_token_accuracy": 0.919723629951477, |
| "num_tokens": 6214396.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.24237875640392303, |
| "learning_rate": 7.937144905368226e-05, |
| "loss": 0.3019, |
| "mean_token_accuracy": 0.922019898891449, |
| "num_tokens": 6246576.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.2897930145263672, |
| "learning_rate": 7.855893732068125e-05, |
| "loss": 0.3562, |
| "mean_token_accuracy": 0.9106606543064117, |
| "num_tokens": 6269193.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.23334293067455292, |
| "learning_rate": 7.774790660436858e-05, |
| "loss": 0.2918, |
| "mean_token_accuracy": 0.923689991235733, |
| "num_tokens": 6300908.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.2914448380470276, |
| "learning_rate": 7.693841292575598e-05, |
| "loss": 0.3441, |
| "mean_token_accuracy": 0.9132694602012634, |
| "num_tokens": 6326792.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.24014908075332642, |
| "learning_rate": 7.613051219968623e-05, |
| "loss": 0.3196, |
| "mean_token_accuracy": 0.9171076416969299, |
| "num_tokens": 6360064.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.26138004660606384, |
| "learning_rate": 7.532426023097063e-05, |
| "loss": 0.3186, |
| "mean_token_accuracy": 0.91810542345047, |
| "num_tokens": 6386431.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.2643719017505646, |
| "learning_rate": 7.451971271053455e-05, |
| "loss": 0.2985, |
| "mean_token_accuracy": 0.9218295514583588, |
| "num_tokens": 6416732.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.24162565171718597, |
| "learning_rate": 7.371692521157048e-05, |
| "loss": 0.3065, |
| "mean_token_accuracy": 0.9209640920162201, |
| "num_tokens": 6449012.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.980891719745223, |
| "grad_norm": 0.2610671818256378, |
| "learning_rate": 7.291595318569951e-05, |
| "loss": 0.3162, |
| "mean_token_accuracy": 0.9178925156593323, |
| "num_tokens": 6482223.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9936305732484074, |
| "grad_norm": 0.24371646344661713, |
| "learning_rate": 7.211685195914097e-05, |
| "loss": 0.3032, |
| "mean_token_accuracy": 0.9201788902282715, |
| "num_tokens": 6515308.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.24371646344661713, |
| "learning_rate": 7.131967672889101e-05, |
| "loss": 0.2291, |
| "mean_token_accuracy": 0.9397472143173218, |
| "num_tokens": 6524518.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0127388535031847, |
| "grad_norm": 0.42819610238075256, |
| "learning_rate": 7.052448255890957e-05, |
| "loss": 0.2481, |
| "mean_token_accuracy": 0.9369410872459412, |
| "num_tokens": 6554034.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0254777070063694, |
| "grad_norm": 0.22651733458042145, |
| "learning_rate": 6.973132437631742e-05, |
| "loss": 0.1993, |
| "mean_token_accuracy": 0.9478741586208344, |
| "num_tokens": 6583871.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.038216560509554, |
| "grad_norm": 0.22783218324184418, |
| "learning_rate": 6.894025696760163e-05, |
| "loss": 0.1907, |
| "mean_token_accuracy": 0.9485516846179962, |
| "num_tokens": 6609766.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050955414012739, |
| "grad_norm": 0.24459128081798553, |
| "learning_rate": 6.815133497483157e-05, |
| "loss": 0.2249, |
| "mean_token_accuracy": 0.9421961307525635, |
| "num_tokens": 6638606.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0636942675159236, |
| "grad_norm": 0.26941463351249695, |
| "learning_rate": 6.736461289188445e-05, |
| "loss": 0.2244, |
| "mean_token_accuracy": 0.9397568106651306, |
| "num_tokens": 6663990.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0764331210191083, |
| "grad_norm": 0.31805625557899475, |
| "learning_rate": 6.658014506068126e-05, |
| "loss": 0.2348, |
| "mean_token_accuracy": 0.9378407299518585, |
| "num_tokens": 6684932.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.089171974522293, |
| "grad_norm": 0.3326071798801422, |
| "learning_rate": 6.579798566743314e-05, |
| "loss": 0.208, |
| "mean_token_accuracy": 0.9450594484806061, |
| "num_tokens": 6715073.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1019108280254777, |
| "grad_norm": 0.3544203042984009, |
| "learning_rate": 6.501818873889855e-05, |
| "loss": 0.197, |
| "mean_token_accuracy": 0.9472306370735168, |
| "num_tokens": 6743374.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1146496815286624, |
| "grad_norm": 0.4308759272098541, |
| "learning_rate": 6.424080813865138e-05, |
| "loss": 0.1947, |
| "mean_token_accuracy": 0.945770800113678, |
| "num_tokens": 6771549.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.127388535031847, |
| "grad_norm": 0.3265669345855713, |
| "learning_rate": 6.34658975633605e-05, |
| "loss": 0.171, |
| "mean_token_accuracy": 0.9553861618041992, |
| "num_tokens": 6799304.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.140127388535032, |
| "grad_norm": 0.3212307393550873, |
| "learning_rate": 6.269351053908061e-05, |
| "loss": 0.2043, |
| "mean_token_accuracy": 0.9439343512058258, |
| "num_tokens": 6826996.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.1528662420382165, |
| "grad_norm": 0.33451324701309204, |
| "learning_rate": 6.192370041755505e-05, |
| "loss": 0.2055, |
| "mean_token_accuracy": 0.9447910487651825, |
| "num_tokens": 6858807.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1656050955414012, |
| "grad_norm": 0.32139697670936584, |
| "learning_rate": 6.115652037253053e-05, |
| "loss": 0.2265, |
| "mean_token_accuracy": 0.9411024153232574, |
| "num_tokens": 6891927.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.178343949044586, |
| "grad_norm": 0.25394192337989807, |
| "learning_rate": 6.039202339608432e-05, |
| "loss": 0.2257, |
| "mean_token_accuracy": 0.941776305437088, |
| "num_tokens": 6921866.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.1910828025477707, |
| "grad_norm": 0.2920042872428894, |
| "learning_rate": 5.963026229496378e-05, |
| "loss": 0.1807, |
| "mean_token_accuracy": 0.9529874622821808, |
| "num_tokens": 6946938.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2038216560509554, |
| "grad_norm": 0.2611655592918396, |
| "learning_rate": 5.887128968693887e-05, |
| "loss": 0.2024, |
| "mean_token_accuracy": 0.942744642496109, |
| "num_tokens": 6971723.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.21656050955414, |
| "grad_norm": 0.3016382157802582, |
| "learning_rate": 5.8115157997167536e-05, |
| "loss": 0.2105, |
| "mean_token_accuracy": 0.944105714559555, |
| "num_tokens": 7004160.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.229299363057325, |
| "grad_norm": 0.27568382024765015, |
| "learning_rate": 5.736191945457463e-05, |
| "loss": 0.2475, |
| "mean_token_accuracy": 0.9371559321880341, |
| "num_tokens": 7032700.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.2420382165605095, |
| "grad_norm": 0.2987270951271057, |
| "learning_rate": 5.6611626088244194e-05, |
| "loss": 0.2239, |
| "mean_token_accuracy": 0.9423088431358337, |
| "num_tokens": 7063449.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.254777070063694, |
| "grad_norm": 0.30039167404174805, |
| "learning_rate": 5.58643297238256e-05, |
| "loss": 0.2109, |
| "mean_token_accuracy": 0.9426285624504089, |
| "num_tokens": 7087519.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.267515923566879, |
| "grad_norm": 0.26526811718940735, |
| "learning_rate": 5.5120081979953785e-05, |
| "loss": 0.2019, |
| "mean_token_accuracy": 0.9480101764202118, |
| "num_tokens": 7120853.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.2802547770700636, |
| "grad_norm": 0.29212793707847595, |
| "learning_rate": 5.43789342646837e-05, |
| "loss": 0.2, |
| "mean_token_accuracy": 0.943680614233017, |
| "num_tokens": 7149753.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.2929936305732483, |
| "grad_norm": 0.3073207437992096, |
| "learning_rate": 5.3640937771939436e-05, |
| "loss": 0.1831, |
| "mean_token_accuracy": 0.9496051073074341, |
| "num_tokens": 7179133.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.305732484076433, |
| "grad_norm": 0.3157687783241272, |
| "learning_rate": 5.290614347797802e-05, |
| "loss": 0.2113, |
| "mean_token_accuracy": 0.9447730183601379, |
| "num_tokens": 7202811.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3184713375796178, |
| "grad_norm": 0.33937543630599976, |
| "learning_rate": 5.217460213786821e-05, |
| "loss": 0.2181, |
| "mean_token_accuracy": 0.9423291087150574, |
| "num_tokens": 7226396.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.3312101910828025, |
| "grad_norm": 0.3266925513744354, |
| "learning_rate": 5.1446364281984774e-05, |
| "loss": 0.2075, |
| "mean_token_accuracy": 0.9435094892978668, |
| "num_tokens": 7257956.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.343949044585987, |
| "grad_norm": 0.3351779580116272, |
| "learning_rate": 5.072148021251821e-05, |
| "loss": 0.2209, |
| "mean_token_accuracy": 0.940418541431427, |
| "num_tokens": 7285205.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.356687898089172, |
| "grad_norm": 0.32669177651405334, |
| "learning_rate": 5.000000000000002e-05, |
| "loss": 0.2285, |
| "mean_token_accuracy": 0.9397756159305573, |
| "num_tokens": 7311154.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.3694267515923566, |
| "grad_norm": 0.30711665749549866, |
| "learning_rate": 4.92819734798441e-05, |
| "loss": 0.2024, |
| "mean_token_accuracy": 0.9481330215930939, |
| "num_tokens": 7343227.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.3821656050955413, |
| "grad_norm": 0.31600600481033325, |
| "learning_rate": 4.856745024890466e-05, |
| "loss": 0.1907, |
| "mean_token_accuracy": 0.9468717575073242, |
| "num_tokens": 7371681.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.394904458598726, |
| "grad_norm": 0.26683205366134644, |
| "learning_rate": 4.78564796620502e-05, |
| "loss": 0.2164, |
| "mean_token_accuracy": 0.9429590404033661, |
| "num_tokens": 7404896.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4076433121019107, |
| "grad_norm": 0.3237342834472656, |
| "learning_rate": 4.7149110828754464e-05, |
| "loss": 0.215, |
| "mean_token_accuracy": 0.9443815350532532, |
| "num_tokens": 7433420.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4203821656050954, |
| "grad_norm": 0.37115031480789185, |
| "learning_rate": 4.644539260970416e-05, |
| "loss": 0.2134, |
| "mean_token_accuracy": 0.9406436383724213, |
| "num_tokens": 7456572.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.43312101910828, |
| "grad_norm": 0.3020355999469757, |
| "learning_rate": 4.574537361342407e-05, |
| "loss": 0.1806, |
| "mean_token_accuracy": 0.9492580592632294, |
| "num_tokens": 7485631.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.445859872611465, |
| "grad_norm": 0.291256308555603, |
| "learning_rate": 4.50491021929194e-05, |
| "loss": 0.2131, |
| "mean_token_accuracy": 0.9445066750049591, |
| "num_tokens": 7511362.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4585987261146496, |
| "grad_norm": 0.33195558190345764, |
| "learning_rate": 4.435662644233594e-05, |
| "loss": 0.2254, |
| "mean_token_accuracy": 0.9385928213596344, |
| "num_tokens": 7537935.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4713375796178343, |
| "grad_norm": 0.31009262800216675, |
| "learning_rate": 4.3667994193637796e-05, |
| "loss": 0.2132, |
| "mean_token_accuracy": 0.9448133111000061, |
| "num_tokens": 7566246.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.484076433121019, |
| "grad_norm": 0.3261551856994629, |
| "learning_rate": 4.298325301330383e-05, |
| "loss": 0.1986, |
| "mean_token_accuracy": 0.9451175630092621, |
| "num_tokens": 7593750.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4968152866242037, |
| "grad_norm": 0.30474022030830383, |
| "learning_rate": 4.23024501990417e-05, |
| "loss": 0.2189, |
| "mean_token_accuracy": 0.9432675242424011, |
| "num_tokens": 7622251.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5095541401273884, |
| "grad_norm": 0.32641172409057617, |
| "learning_rate": 4.1625632776521037e-05, |
| "loss": 0.2424, |
| "mean_token_accuracy": 0.9352215826511383, |
| "num_tokens": 7646162.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.522292993630573, |
| "grad_norm": 0.36916500329971313, |
| "learning_rate": 4.095284749612503e-05, |
| "loss": 0.2124, |
| "mean_token_accuracy": 0.9441305100917816, |
| "num_tokens": 7668654.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.535031847133758, |
| "grad_norm": 0.3254569470882416, |
| "learning_rate": 4.028414082972141e-05, |
| "loss": 0.2257, |
| "mean_token_accuracy": 0.940665602684021, |
| "num_tokens": 7695678.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5477707006369426, |
| "grad_norm": 0.3033880293369293, |
| "learning_rate": 3.961955896745224e-05, |
| "loss": 0.2177, |
| "mean_token_accuracy": 0.9448119699954987, |
| "num_tokens": 7720952.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5605095541401273, |
| "grad_norm": 0.3547619581222534, |
| "learning_rate": 3.89591478145437e-05, |
| "loss": 0.217, |
| "mean_token_accuracy": 0.9433469474315643, |
| "num_tokens": 7746292.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.573248407643312, |
| "grad_norm": 0.2937956154346466, |
| "learning_rate": 3.8302952988134756e-05, |
| "loss": 0.214, |
| "mean_token_accuracy": 0.9453655481338501, |
| "num_tokens": 7775263.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5859872611464967, |
| "grad_norm": 0.2963101863861084, |
| "learning_rate": 3.7651019814126654e-05, |
| "loss": 0.1858, |
| "mean_token_accuracy": 0.950236588716507, |
| "num_tokens": 7804091.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5987261146496814, |
| "grad_norm": 0.2752476930618286, |
| "learning_rate": 3.7003393324051874e-05, |
| "loss": 0.2013, |
| "mean_token_accuracy": 0.9444670975208282, |
| "num_tokens": 7831415.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.611464968152866, |
| "grad_norm": 0.30236101150512695, |
| "learning_rate": 3.6360118251963645e-05, |
| "loss": 0.2146, |
| "mean_token_accuracy": 0.9440622627735138, |
| "num_tokens": 7861196.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.624203821656051, |
| "grad_norm": 0.3374358117580414, |
| "learning_rate": 3.5721239031346066e-05, |
| "loss": 0.2083, |
| "mean_token_accuracy": 0.945656806230545, |
| "num_tokens": 7888551.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.6369426751592355, |
| "grad_norm": 0.332331120967865, |
| "learning_rate": 3.508679979204481e-05, |
| "loss": 0.2274, |
| "mean_token_accuracy": 0.939465343952179, |
| "num_tokens": 7916173.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6496815286624202, |
| "grad_norm": 0.3092139661312103, |
| "learning_rate": 3.445684435721897e-05, |
| "loss": 0.1997, |
| "mean_token_accuracy": 0.9468453824520111, |
| "num_tokens": 7942870.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.662420382165605, |
| "grad_norm": 0.2880033552646637, |
| "learning_rate": 3.383141624031408e-05, |
| "loss": 0.1905, |
| "mean_token_accuracy": 0.9489818811416626, |
| "num_tokens": 7971239.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.6751592356687897, |
| "grad_norm": 0.3255373239517212, |
| "learning_rate": 3.3210558642056275e-05, |
| "loss": 0.2318, |
| "mean_token_accuracy": 0.9415358006954193, |
| "num_tokens": 7997893.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6878980891719744, |
| "grad_norm": 0.3434557318687439, |
| "learning_rate": 3.259431444746846e-05, |
| "loss": 0.2012, |
| "mean_token_accuracy": 0.946794331073761, |
| "num_tokens": 8027066.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.700636942675159, |
| "grad_norm": 0.28656280040740967, |
| "learning_rate": 3.198272622290804e-05, |
| "loss": 0.1882, |
| "mean_token_accuracy": 0.9503431022167206, |
| "num_tokens": 8057253.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.713375796178344, |
| "grad_norm": 0.30829906463623047, |
| "learning_rate": 3.137583621312665e-05, |
| "loss": 0.204, |
| "mean_token_accuracy": 0.9471130073070526, |
| "num_tokens": 8092026.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.7261146496815285, |
| "grad_norm": 0.2918407618999481, |
| "learning_rate": 3.077368633835205e-05, |
| "loss": 0.2311, |
| "mean_token_accuracy": 0.9399546384811401, |
| "num_tokens": 8120782.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.738853503184713, |
| "grad_norm": 0.3347460627555847, |
| "learning_rate": 3.0176318191392726e-05, |
| "loss": 0.1995, |
| "mean_token_accuracy": 0.9461638033390045, |
| "num_tokens": 8146581.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7515923566878984, |
| "grad_norm": 0.3317808508872986, |
| "learning_rate": 2.9583773034764826e-05, |
| "loss": 0.2002, |
| "mean_token_accuracy": 0.9467883110046387, |
| "num_tokens": 8171884.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.7643312101910826, |
| "grad_norm": 0.3350849747657776, |
| "learning_rate": 2.8996091797841973e-05, |
| "loss": 0.1985, |
| "mean_token_accuracy": 0.9433420896530151, |
| "num_tokens": 8195633.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.777070063694268, |
| "grad_norm": 0.30415278673171997, |
| "learning_rate": 2.8413315074028158e-05, |
| "loss": 0.2192, |
| "mean_token_accuracy": 0.9425555467605591, |
| "num_tokens": 8225423.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.789808917197452, |
| "grad_norm": 0.3231201171875, |
| "learning_rate": 2.7835483117953788e-05, |
| "loss": 0.2172, |
| "mean_token_accuracy": 0.9424301981925964, |
| "num_tokens": 8251132.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.802547770700637, |
| "grad_norm": 0.2972840964794159, |
| "learning_rate": 2.7262635842695127e-05, |
| "loss": 0.2058, |
| "mean_token_accuracy": 0.9453469514846802, |
| "num_tokens": 8279946.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.8152866242038215, |
| "grad_norm": 0.310139000415802, |
| "learning_rate": 2.669481281701739e-05, |
| "loss": 0.2107, |
| "mean_token_accuracy": 0.9437506794929504, |
| "num_tokens": 8303728.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8280254777070066, |
| "grad_norm": 0.3299463391304016, |
| "learning_rate": 2.6132053262641466e-05, |
| "loss": 0.2316, |
| "mean_token_accuracy": 0.9386799037456512, |
| "num_tokens": 8329630.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.840764331210191, |
| "grad_norm": 0.3343072831630707, |
| "learning_rate": 2.5574396051534832e-05, |
| "loss": 0.185, |
| "mean_token_accuracy": 0.9503215253353119, |
| "num_tokens": 8355220.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.853503184713376, |
| "grad_norm": 0.2927515208721161, |
| "learning_rate": 2.502187970322657e-05, |
| "loss": 0.1981, |
| "mean_token_accuracy": 0.948171466588974, |
| "num_tokens": 8389035.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8662420382165603, |
| "grad_norm": 0.31487882137298584, |
| "learning_rate": 2.4474542382146537e-05, |
| "loss": 0.2098, |
| "mean_token_accuracy": 0.9438025951385498, |
| "num_tokens": 8418162.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8789808917197455, |
| "grad_norm": 0.29079580307006836, |
| "learning_rate": 2.3932421894989167e-05, |
| "loss": 0.2286, |
| "mean_token_accuracy": 0.9384362697601318, |
| "num_tokens": 8440831.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8917197452229297, |
| "grad_norm": 0.352939635515213, |
| "learning_rate": 2.339555568810221e-05, |
| "loss": 0.1843, |
| "mean_token_accuracy": 0.9493797421455383, |
| "num_tokens": 8470669.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.904458598726115, |
| "grad_norm": 0.3093090355396271, |
| "learning_rate": 2.2863980844900036e-05, |
| "loss": 0.2185, |
| "mean_token_accuracy": 0.9417230188846588, |
| "num_tokens": 8494127.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.917197452229299, |
| "grad_norm": 0.33930864930152893, |
| "learning_rate": 2.2337734083302164e-05, |
| "loss": 0.2171, |
| "mean_token_accuracy": 0.9457297027111053, |
| "num_tokens": 8523365.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9299363057324843, |
| "grad_norm": 0.2833450436592102, |
| "learning_rate": 2.181685175319702e-05, |
| "loss": 0.1996, |
| "mean_token_accuracy": 0.9482668936252594, |
| "num_tokens": 8549781.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9426751592356686, |
| "grad_norm": 0.3223772346973419, |
| "learning_rate": 2.1301369833931117e-05, |
| "loss": 0.2388, |
| "mean_token_accuracy": 0.9379838705062866, |
| "num_tokens": 8573872.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9554140127388537, |
| "grad_norm": 0.35899412631988525, |
| "learning_rate": 2.079132393182378e-05, |
| "loss": 0.2086, |
| "mean_token_accuracy": 0.943289190530777, |
| "num_tokens": 8600357.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.968152866242038, |
| "grad_norm": 0.3071880638599396, |
| "learning_rate": 2.0286749277707782e-05, |
| "loss": 0.1928, |
| "mean_token_accuracy": 0.9484856128692627, |
| "num_tokens": 8629976.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.980891719745223, |
| "grad_norm": 0.3144143223762512, |
| "learning_rate": 1.9787680724495617e-05, |
| "loss": 0.2347, |
| "mean_token_accuracy": 0.9397814869880676, |
| "num_tokens": 8658611.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9936305732484074, |
| "grad_norm": 0.34338703751564026, |
| "learning_rate": 1.929415274477239e-05, |
| "loss": 0.1975, |
| "mean_token_accuracy": 0.9477995038032532, |
| "num_tokens": 8686630.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.46533268690109253, |
| "learning_rate": 1.880619942841435e-05, |
| "loss": 0.2113, |
| "mean_token_accuracy": 0.9439818263053894, |
| "num_tokens": 8699872.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012738853503185, |
| "grad_norm": 0.23810382187366486, |
| "learning_rate": 1.832385448023435e-05, |
| "loss": 0.144, |
| "mean_token_accuracy": 0.9630288481712341, |
| "num_tokens": 8734596.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025477707006369, |
| "grad_norm": 0.2706077992916107, |
| "learning_rate": 1.7847151217653624e-05, |
| "loss": 0.1504, |
| "mean_token_accuracy": 0.9619067907333374, |
| "num_tokens": 8761637.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.038216560509555, |
| "grad_norm": 0.26191478967666626, |
| "learning_rate": 1.7376122568400532e-05, |
| "loss": 0.1588, |
| "mean_token_accuracy": 0.9599383473396301, |
| "num_tokens": 8790955.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050955414012739, |
| "grad_norm": 0.26356980204582214, |
| "learning_rate": 1.6910801068236016e-05, |
| "loss": 0.1433, |
| "mean_token_accuracy": 0.9618352353572845, |
| "num_tokens": 8819777.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063694267515924, |
| "grad_norm": 0.24432717263698578, |
| "learning_rate": 1.6451218858706374e-05, |
| "loss": 0.138, |
| "mean_token_accuracy": 0.9636504054069519, |
| "num_tokens": 8849131.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.076433121019108, |
| "grad_norm": 0.33173316717147827, |
| "learning_rate": 1.5997407684922862e-05, |
| "loss": 0.1956, |
| "mean_token_accuracy": 0.9531349837779999, |
| "num_tokens": 8872843.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.089171974522293, |
| "grad_norm": 0.2538873851299286, |
| "learning_rate": 1.5549398893369216e-05, |
| "loss": 0.1502, |
| "mean_token_accuracy": 0.9617005288600922, |
| "num_tokens": 8901795.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.101910828025478, |
| "grad_norm": 0.2779563069343567, |
| "learning_rate": 1.5107223429736272e-05, |
| "loss": 0.1502, |
| "mean_token_accuracy": 0.96136873960495, |
| "num_tokens": 8927244.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.114649681528663, |
| "grad_norm": 0.2902298867702484, |
| "learning_rate": 1.467091183678444e-05, |
| "loss": 0.1549, |
| "mean_token_accuracy": 0.9591580033302307, |
| "num_tokens": 8957527.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.127388535031847, |
| "grad_norm": 0.2964951992034912, |
| "learning_rate": 1.4240494252234049e-05, |
| "loss": 0.1367, |
| "mean_token_accuracy": 0.9627481400966644, |
| "num_tokens": 8987686.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.140127388535032, |
| "grad_norm": 0.3314071297645569, |
| "learning_rate": 1.3816000406683604e-05, |
| "loss": 0.147, |
| "mean_token_accuracy": 0.9618198573589325, |
| "num_tokens": 9016214.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.1528662420382165, |
| "grad_norm": 0.31644365191459656, |
| "learning_rate": 1.339745962155613e-05, |
| "loss": 0.1463, |
| "mean_token_accuracy": 0.9603260159492493, |
| "num_tokens": 9044452.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.165605095541402, |
| "grad_norm": 0.34280964732170105, |
| "learning_rate": 1.2984900807073919e-05, |
| "loss": 0.1579, |
| "mean_token_accuracy": 0.9591144621372223, |
| "num_tokens": 9073099.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.178343949044586, |
| "grad_norm": 0.35573169589042664, |
| "learning_rate": 1.2578352460261456e-05, |
| "loss": 0.1341, |
| "mean_token_accuracy": 0.964358389377594, |
| "num_tokens": 9097666.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.191082802547771, |
| "grad_norm": 0.36377403140068054, |
| "learning_rate": 1.2177842662977135e-05, |
| "loss": 0.161, |
| "mean_token_accuracy": 0.9578590989112854, |
| "num_tokens": 9123233.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.203821656050955, |
| "grad_norm": 0.35682496428489685, |
| "learning_rate": 1.1783399079973578e-05, |
| "loss": 0.1432, |
| "mean_token_accuracy": 0.9622423648834229, |
| "num_tokens": 9148234.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.2165605095541405, |
| "grad_norm": 0.34052160382270813, |
| "learning_rate": 1.1395048956986575e-05, |
| "loss": 0.1403, |
| "mean_token_accuracy": 0.9617478549480438, |
| "num_tokens": 9176122.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.229299363057325, |
| "grad_norm": 0.3558754622936249, |
| "learning_rate": 1.1012819118853147e-05, |
| "loss": 0.1387, |
| "mean_token_accuracy": 0.9619651436805725, |
| "num_tokens": 9203206.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.24203821656051, |
| "grad_norm": 0.32240667939186096, |
| "learning_rate": 1.0636735967658784e-05, |
| "loss": 0.1485, |
| "mean_token_accuracy": 0.9607774615287781, |
| "num_tokens": 9236391.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.254777070063694, |
| "grad_norm": 0.3066593408584595, |
| "learning_rate": 1.0266825480913611e-05, |
| "loss": 0.1337, |
| "mean_token_accuracy": 0.9634624421596527, |
| "num_tokens": 9267928.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.267515923566879, |
| "grad_norm": 0.28590208292007446, |
| "learning_rate": 9.903113209758096e-06, |
| "loss": 0.1396, |
| "mean_token_accuracy": 0.9620433747768402, |
| "num_tokens": 9302449.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.280254777070064, |
| "grad_norm": 0.3486238420009613, |
| "learning_rate": 9.545624277198084e-06, |
| "loss": 0.1579, |
| "mean_token_accuracy": 0.9601101279258728, |
| "num_tokens": 9326476.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.292993630573249, |
| "grad_norm": 0.3066675066947937, |
| "learning_rate": 9.194383376369508e-06, |
| "loss": 0.1424, |
| "mean_token_accuracy": 0.9623628258705139, |
| "num_tokens": 9353379.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.305732484076433, |
| "grad_norm": 0.3062663972377777, |
| "learning_rate": 8.849414768832687e-06, |
| "loss": 0.1313, |
| "mean_token_accuracy": 0.9649600684642792, |
| "num_tokens": 9380878.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.318471337579618, |
| "grad_norm": 0.3205564022064209, |
| "learning_rate": 8.510742282896544e-06, |
| "loss": 0.146, |
| "mean_token_accuracy": 0.961448460817337, |
| "num_tokens": 9404190.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.3312101910828025, |
| "grad_norm": 0.2969525158405304, |
| "learning_rate": 8.178389311972612e-06, |
| "loss": 0.1142, |
| "mean_token_accuracy": 0.9698503613471985, |
| "num_tokens": 9434911.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.343949044585988, |
| "grad_norm": 0.2806640565395355, |
| "learning_rate": 7.852378812959227e-06, |
| "loss": 0.1437, |
| "mean_token_accuracy": 0.9614557027816772, |
| "num_tokens": 9465444.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.356687898089172, |
| "grad_norm": 0.31179293990135193, |
| "learning_rate": 7.532733304655848e-06, |
| "loss": 0.1435, |
| "mean_token_accuracy": 0.9619892239570618, |
| "num_tokens": 9493253.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.369426751592357, |
| "grad_norm": 0.27424463629722595, |
| "learning_rate": 7.219474866207465e-06, |
| "loss": 0.1367, |
| "mean_token_accuracy": 0.963774561882019, |
| "num_tokens": 9524445.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.382165605095541, |
| "grad_norm": 0.3105311691761017, |
| "learning_rate": 6.9126251355795864e-06, |
| "loss": 0.1372, |
| "mean_token_accuracy": 0.9609047770500183, |
| "num_tokens": 9548202.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3949044585987265, |
| "grad_norm": 0.2936761677265167, |
| "learning_rate": 6.612205308063646e-06, |
| "loss": 0.1329, |
| "mean_token_accuracy": 0.964224636554718, |
| "num_tokens": 9577700.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.407643312101911, |
| "grad_norm": 0.2974602282047272, |
| "learning_rate": 6.318236134812916e-06, |
| "loss": 0.1285, |
| "mean_token_accuracy": 0.965183287858963, |
| "num_tokens": 9600239.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.420382165605096, |
| "grad_norm": 0.32353323698043823, |
| "learning_rate": 6.030737921409169e-06, |
| "loss": 0.1621, |
| "mean_token_accuracy": 0.9579569697380066, |
| "num_tokens": 9629129.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.43312101910828, |
| "grad_norm": 0.2739459276199341, |
| "learning_rate": 5.749730526460073e-06, |
| "loss": 0.1322, |
| "mean_token_accuracy": 0.965122252702713, |
| "num_tokens": 9659390.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.445859872611465, |
| "grad_norm": 0.322262167930603, |
| "learning_rate": 5.475233360227516e-06, |
| "loss": 0.1382, |
| "mean_token_accuracy": 0.9616671204566956, |
| "num_tokens": 9683445.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.45859872611465, |
| "grad_norm": 0.29362499713897705, |
| "learning_rate": 5.20726538328683e-06, |
| "loss": 0.149, |
| "mean_token_accuracy": 0.9616740643978119, |
| "num_tokens": 9714620.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.471337579617835, |
| "grad_norm": 0.27419713139533997, |
| "learning_rate": 4.945845105217117e-06, |
| "loss": 0.1354, |
| "mean_token_accuracy": 0.963752031326294, |
| "num_tokens": 9744461.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.484076433121019, |
| "grad_norm": 0.26769745349884033, |
| "learning_rate": 4.6909905833226966e-06, |
| "loss": 0.1194, |
| "mean_token_accuracy": 0.9685969352722168, |
| "num_tokens": 9778730.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.496815286624204, |
| "grad_norm": 0.3312217593193054, |
| "learning_rate": 4.442719421385922e-06, |
| "loss": 0.1521, |
| "mean_token_accuracy": 0.9596065580844879, |
| "num_tokens": 9802092.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.509554140127388, |
| "grad_norm": 0.31302008032798767, |
| "learning_rate": 4.20104876845111e-06, |
| "loss": 0.1549, |
| "mean_token_accuracy": 0.9606733918190002, |
| "num_tokens": 9828739.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.522292993630574, |
| "grad_norm": 0.30936190485954285, |
| "learning_rate": 3.965995317640025e-06, |
| "loss": 0.1375, |
| "mean_token_accuracy": 0.9651446044445038, |
| "num_tokens": 9853204.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.535031847133758, |
| "grad_norm": 0.3037811517715454, |
| "learning_rate": 3.7375753049987973e-06, |
| "loss": 0.1407, |
| "mean_token_accuracy": 0.9609975516796112, |
| "num_tokens": 9881685.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.547770700636943, |
| "grad_norm": 0.3009647727012634, |
| "learning_rate": 3.515804508376508e-06, |
| "loss": 0.126, |
| "mean_token_accuracy": 0.9648471772670746, |
| "num_tokens": 9910121.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.560509554140127, |
| "grad_norm": 0.30609554052352905, |
| "learning_rate": 3.3006982463352766e-06, |
| "loss": 0.1354, |
| "mean_token_accuracy": 0.9628312587738037, |
| "num_tokens": 9936532.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.573248407643312, |
| "grad_norm": 0.3455513119697571, |
| "learning_rate": 3.092271377092215e-06, |
| "loss": 0.1545, |
| "mean_token_accuracy": 0.9557880163192749, |
| "num_tokens": 9960775.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.585987261146497, |
| "grad_norm": 0.29719001054763794, |
| "learning_rate": 2.8905382974930172e-06, |
| "loss": 0.1696, |
| "mean_token_accuracy": 0.9552532136440277, |
| "num_tokens": 9991896.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.598726114649682, |
| "grad_norm": 0.3069824278354645, |
| "learning_rate": 2.6955129420176196e-06, |
| "loss": 0.1465, |
| "mean_token_accuracy": 0.9637337028980255, |
| "num_tokens": 10021620.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.611464968152866, |
| "grad_norm": 0.36662521958351135, |
| "learning_rate": 2.5072087818176382e-06, |
| "loss": 0.1516, |
| "mean_token_accuracy": 0.9591758251190186, |
| "num_tokens": 10041121.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.624203821656051, |
| "grad_norm": 0.2813502252101898, |
| "learning_rate": 2.3256388237858807e-06, |
| "loss": 0.1292, |
| "mean_token_accuracy": 0.9643067419528961, |
| "num_tokens": 10069137.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.6369426751592355, |
| "grad_norm": 0.3128413259983063, |
| "learning_rate": 2.150815609657875e-06, |
| "loss": 0.147, |
| "mean_token_accuracy": 0.9592329561710358, |
| "num_tokens": 10093871.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.649681528662421, |
| "grad_norm": 0.31675484776496887, |
| "learning_rate": 1.9827512151456173e-06, |
| "loss": 0.1396, |
| "mean_token_accuracy": 0.9628662765026093, |
| "num_tokens": 10120069.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.662420382165605, |
| "grad_norm": 0.30800846219062805, |
| "learning_rate": 1.8214572491034198e-06, |
| "loss": 0.133, |
| "mean_token_accuracy": 0.9657087326049805, |
| "num_tokens": 10147672.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.67515923566879, |
| "grad_norm": 0.32580551505088806, |
| "learning_rate": 1.66694485272606e-06, |
| "loss": 0.1381, |
| "mean_token_accuracy": 0.9616196155548096, |
| "num_tokens": 10175371.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.687898089171974, |
| "grad_norm": 0.2909785807132721, |
| "learning_rate": 1.5192246987791981e-06, |
| "loss": 0.1384, |
| "mean_token_accuracy": 0.9626062214374542, |
| "num_tokens": 10205366.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.7006369426751595, |
| "grad_norm": 0.27137643098831177, |
| "learning_rate": 1.378306990862177e-06, |
| "loss": 0.1268, |
| "mean_token_accuracy": 0.9658531844615936, |
| "num_tokens": 10237324.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.713375796178344, |
| "grad_norm": 0.32333460450172424, |
| "learning_rate": 1.2442014627032316e-06, |
| "loss": 0.1413, |
| "mean_token_accuracy": 0.9629768431186676, |
| "num_tokens": 10263701.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.726114649681529, |
| "grad_norm": 0.334445983171463, |
| "learning_rate": 1.1169173774871478e-06, |
| "loss": 0.1552, |
| "mean_token_accuracy": 0.9588431119918823, |
| "num_tokens": 10286775.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.738853503184713, |
| "grad_norm": 0.30994829535484314, |
| "learning_rate": 9.964635272153633e-07, |
| "loss": 0.1297, |
| "mean_token_accuracy": 0.9650968909263611, |
| "num_tokens": 10312644.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.751592356687898, |
| "grad_norm": 0.3495871126651764, |
| "learning_rate": 8.828482320987319e-07, |
| "loss": 0.171, |
| "mean_token_accuracy": 0.9548489153385162, |
| "num_tokens": 10336997.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.764331210191083, |
| "grad_norm": 0.30105888843536377, |
| "learning_rate": 7.760793399827937e-07, |
| "loss": 0.1375, |
| "mean_token_accuracy": 0.964127242565155, |
| "num_tokens": 10370155.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.777070063694268, |
| "grad_norm": 0.27851420640945435, |
| "learning_rate": 6.761642258056978e-07, |
| "loss": 0.1331, |
| "mean_token_accuracy": 0.9646726548671722, |
| "num_tokens": 10398233.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.789808917197452, |
| "grad_norm": 0.26956307888031006, |
| "learning_rate": 5.831097910887873e-07, |
| "loss": 0.1226, |
| "mean_token_accuracy": 0.9662437736988068, |
| "num_tokens": 10428060.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.802547770700637, |
| "grad_norm": 0.28100118041038513, |
| "learning_rate": 4.969224634598591e-07, |
| "loss": 0.1506, |
| "mean_token_accuracy": 0.9616421461105347, |
| "num_tokens": 10460208.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.8152866242038215, |
| "grad_norm": 0.35656845569610596, |
| "learning_rate": 4.176081962092182e-07, |
| "loss": 0.1547, |
| "mean_token_accuracy": 0.9571482837200165, |
| "num_tokens": 10482012.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.828025477707007, |
| "grad_norm": 0.32229557633399963, |
| "learning_rate": 3.451724678784518e-07, |
| "loss": 0.1425, |
| "mean_token_accuracy": 0.9625223577022552, |
| "num_tokens": 10506770.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.840764331210191, |
| "grad_norm": 0.30760592222213745, |
| "learning_rate": 2.7962028188198706e-07, |
| "loss": 0.1328, |
| "mean_token_accuracy": 0.9646367728710175, |
| "num_tokens": 10532512.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.853503184713376, |
| "grad_norm": 0.308159202337265, |
| "learning_rate": 2.2095616616150115e-07, |
| "loss": 0.1267, |
| "mean_token_accuracy": 0.9646133780479431, |
| "num_tokens": 10559879.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.86624203821656, |
| "grad_norm": 0.33381935954093933, |
| "learning_rate": 1.6918417287318245e-07, |
| "loss": 0.1539, |
| "mean_token_accuracy": 0.9574156403541565, |
| "num_tokens": 10582617.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8789808917197455, |
| "grad_norm": 0.2868056297302246, |
| "learning_rate": 1.2430787810776555e-07, |
| "loss": 0.1306, |
| "mean_token_accuracy": 0.9653586149215698, |
| "num_tokens": 10611812.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.89171974522293, |
| "grad_norm": 0.3218814432621002, |
| "learning_rate": 8.633038164358454e-08, |
| "loss": 0.1353, |
| "mean_token_accuracy": 0.9647776186466217, |
| "num_tokens": 10637325.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.904458598726115, |
| "grad_norm": 0.288083016872406, |
| "learning_rate": 5.5254306732444025e-08, |
| "loss": 0.1447, |
| "mean_token_accuracy": 0.9615972638130188, |
| "num_tokens": 10668037.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.917197452229299, |
| "grad_norm": 0.3000580370426178, |
| "learning_rate": 3.1081799918375454e-08, |
| "loss": 0.1233, |
| "mean_token_accuracy": 0.9653524458408356, |
| "num_tokens": 10696621.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.929936305732484, |
| "grad_norm": 0.29908129572868347, |
| "learning_rate": 1.3814530889433296e-08, |
| "loss": 0.1424, |
| "mean_token_accuracy": 0.9596949517726898, |
| "num_tokens": 10726256.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "grad_norm": 0.3002137839794159, |
| "learning_rate": 3.453692362309635e-09, |
| "loss": 0.1325, |
| "mean_token_accuracy": 0.9654920101165771, |
| "num_tokens": 10752813.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "step": 390, |
| "total_flos": 1.1057949593084887e+18, |
| "train_loss": 0.3398277919070843, |
| "train_runtime": 2376.0061, |
| "train_samples_per_second": 10.522, |
| "train_steps_per_second": 0.164 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 390, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.1057949593084887e+18, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|