| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 4.942675159235669, |
| "eval_steps": 500, |
| "global_step": 390, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 11.702886581420898, |
| "learning_rate": 0.0, |
| "loss": 2.5032, |
| "mean_token_accuracy": 0.6595549285411835, |
| "num_tokens": 5956.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 12.431628227233887, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 2.4454, |
| "mean_token_accuracy": 0.6762347519397736, |
| "num_tokens": 11573.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 7.587985992431641, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 2.2487, |
| "mean_token_accuracy": 0.6618549227714539, |
| "num_tokens": 17442.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 4.835203647613525, |
| "learning_rate": 5e-05, |
| "loss": 1.8288, |
| "mean_token_accuracy": 0.6986225545406342, |
| "num_tokens": 23106.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 3.932021141052246, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 1.5574, |
| "mean_token_accuracy": 0.7071255147457123, |
| "num_tokens": 29007.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 1.9182102680206299, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 1.2577, |
| "mean_token_accuracy": 0.7433162331581116, |
| "num_tokens": 34759.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 2.122396469116211, |
| "learning_rate": 0.0001, |
| "loss": 1.1196, |
| "mean_token_accuracy": 0.7598712146282196, |
| "num_tokens": 40489.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 5.126816272735596, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 1.3309, |
| "mean_token_accuracy": 0.7411045134067535, |
| "num_tokens": 46322.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 4.019023895263672, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 1.1162, |
| "mean_token_accuracy": 0.7461560070514679, |
| "num_tokens": 52247.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 6.412837505340576, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 1.1145, |
| "mean_token_accuracy": 0.7526903450489044, |
| "num_tokens": 58040.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 1.8299505710601807, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 0.9589, |
| "mean_token_accuracy": 0.7813899219036102, |
| "num_tokens": 63781.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 0.8784621953964233, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 0.9002, |
| "mean_token_accuracy": 0.7872510552406311, |
| "num_tokens": 69548.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 0.6668952107429504, |
| "learning_rate": 0.0002, |
| "loss": 0.8018, |
| "mean_token_accuracy": 0.8026058673858643, |
| "num_tokens": 75372.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 0.6606842875480652, |
| "learning_rate": 0.0001999965463076377, |
| "loss": 0.7878, |
| "mean_token_accuracy": 0.8076357841491699, |
| "num_tokens": 81188.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.6952334642410278, |
| "learning_rate": 0.00019998618546911056, |
| "loss": 0.7102, |
| "mean_token_accuracy": 0.8217892348766327, |
| "num_tokens": 86949.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.6817119121551514, |
| "learning_rate": 0.00019996891820008164, |
| "loss": 0.7056, |
| "mean_token_accuracy": 0.8268627524375916, |
| "num_tokens": 92943.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 0.7418015003204346, |
| "learning_rate": 0.00019994474569326757, |
| "loss": 0.5142, |
| "mean_token_accuracy": 0.8664973080158234, |
| "num_tokens": 98677.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.9997584819793701, |
| "learning_rate": 0.00019991366961835642, |
| "loss": 0.4582, |
| "mean_token_accuracy": 0.8754754364490509, |
| "num_tokens": 104531.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 1.1314135789871216, |
| "learning_rate": 0.00019987569212189224, |
| "loss": 0.4308, |
| "mean_token_accuracy": 0.8855270445346832, |
| "num_tokens": 110386.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 1.1828103065490723, |
| "learning_rate": 0.00019983081582712685, |
| "loss": 0.3452, |
| "mean_token_accuracy": 0.9081635177135468, |
| "num_tokens": 116076.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.9598802924156189, |
| "learning_rate": 0.0001997790438338385, |
| "loss": 0.311, |
| "mean_token_accuracy": 0.9159912765026093, |
| "num_tokens": 121789.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.9245991110801697, |
| "learning_rate": 0.00019972037971811802, |
| "loss": 0.2722, |
| "mean_token_accuracy": 0.9285408556461334, |
| "num_tokens": 127688.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.7882480025291443, |
| "learning_rate": 0.00019965482753212156, |
| "loss": 0.2672, |
| "mean_token_accuracy": 0.9340283870697021, |
| "num_tokens": 133375.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.8053174614906311, |
| "learning_rate": 0.0001995823918037908, |
| "loss": 0.2154, |
| "mean_token_accuracy": 0.9449870884418488, |
| "num_tokens": 139058.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.6255679726600647, |
| "learning_rate": 0.00019950307753654017, |
| "loss": 0.2028, |
| "mean_token_accuracy": 0.9470508992671967, |
| "num_tokens": 144993.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.6230493783950806, |
| "learning_rate": 0.0001994168902089112, |
| "loss": 0.176, |
| "mean_token_accuracy": 0.9510246515274048, |
| "num_tokens": 150940.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.5672556161880493, |
| "learning_rate": 0.00019932383577419432, |
| "loss": 0.1795, |
| "mean_token_accuracy": 0.949940025806427, |
| "num_tokens": 156815.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.6387358903884888, |
| "learning_rate": 0.00019922392066001722, |
| "loss": 0.1889, |
| "mean_token_accuracy": 0.9488263130187988, |
| "num_tokens": 162604.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.7072544097900391, |
| "learning_rate": 0.0001991171517679013, |
| "loss": 0.1841, |
| "mean_token_accuracy": 0.9489785730838776, |
| "num_tokens": 168207.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.5900980830192566, |
| "learning_rate": 0.00019900353647278466, |
| "loss": 0.1691, |
| "mean_token_accuracy": 0.9533919394016266, |
| "num_tokens": 174104.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.617685854434967, |
| "learning_rate": 0.00019888308262251285, |
| "loss": 0.1735, |
| "mean_token_accuracy": 0.9471724629402161, |
| "num_tokens": 179715.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.4334038197994232, |
| "learning_rate": 0.00019875579853729676, |
| "loss": 0.1479, |
| "mean_token_accuracy": 0.9524288773536682, |
| "num_tokens": 185631.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.515620768070221, |
| "learning_rate": 0.00019862169300913785, |
| "loss": 0.1518, |
| "mean_token_accuracy": 0.9586804509162903, |
| "num_tokens": 191482.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.47444668412208557, |
| "learning_rate": 0.00019848077530122083, |
| "loss": 0.1477, |
| "mean_token_accuracy": 0.9550797045230865, |
| "num_tokens": 197391.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.39224231243133545, |
| "learning_rate": 0.00019833305514727395, |
| "loss": 0.1322, |
| "mean_token_accuracy": 0.9591817557811737, |
| "num_tokens": 203269.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.3317239582538605, |
| "learning_rate": 0.0001981785427508966, |
| "loss": 0.1402, |
| "mean_token_accuracy": 0.9549793004989624, |
| "num_tokens": 209069.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.3399812579154968, |
| "learning_rate": 0.00019801724878485438, |
| "loss": 0.1399, |
| "mean_token_accuracy": 0.9573641419410706, |
| "num_tokens": 214978.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.39519068598747253, |
| "learning_rate": 0.00019784918439034216, |
| "loss": 0.1351, |
| "mean_token_accuracy": 0.9593660831451416, |
| "num_tokens": 220924.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.4288669526576996, |
| "learning_rate": 0.00019767436117621413, |
| "loss": 0.1513, |
| "mean_token_accuracy": 0.9568993747234344, |
| "num_tokens": 226883.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.31919434666633606, |
| "learning_rate": 0.00019749279121818235, |
| "loss": 0.1318, |
| "mean_token_accuracy": 0.9599088132381439, |
| "num_tokens": 232744.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.38198190927505493, |
| "learning_rate": 0.00019730448705798239, |
| "loss": 0.1341, |
| "mean_token_accuracy": 0.9575787484645844, |
| "num_tokens": 238398.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.35228872299194336, |
| "learning_rate": 0.000197109461702507, |
| "loss": 0.1347, |
| "mean_token_accuracy": 0.958317756652832, |
| "num_tokens": 244014.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.40999364852905273, |
| "learning_rate": 0.0001969077286229078, |
| "loss": 0.1388, |
| "mean_token_accuracy": 0.9575117230415344, |
| "num_tokens": 249892.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.2757190465927124, |
| "learning_rate": 0.00019669930175366472, |
| "loss": 0.1166, |
| "mean_token_accuracy": 0.9629926383495331, |
| "num_tokens": 255604.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.25512728095054626, |
| "learning_rate": 0.00019648419549162348, |
| "loss": 0.1145, |
| "mean_token_accuracy": 0.9622745513916016, |
| "num_tokens": 261418.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.28370901942253113, |
| "learning_rate": 0.0001962624246950012, |
| "loss": 0.1164, |
| "mean_token_accuracy": 0.9658343195915222, |
| "num_tokens": 267305.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.322531133890152, |
| "learning_rate": 0.00019603400468235998, |
| "loss": 0.1141, |
| "mean_token_accuracy": 0.9636189937591553, |
| "num_tokens": 273256.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.3136317729949951, |
| "learning_rate": 0.0001957989512315489, |
| "loss": 0.1226, |
| "mean_token_accuracy": 0.9616194665431976, |
| "num_tokens": 279183.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.2895571291446686, |
| "learning_rate": 0.0001955572805786141, |
| "loss": 0.1139, |
| "mean_token_accuracy": 0.964866429567337, |
| "num_tokens": 284996.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.29423466324806213, |
| "learning_rate": 0.0001953090094166773, |
| "loss": 0.1133, |
| "mean_token_accuracy": 0.9634665548801422, |
| "num_tokens": 290748.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.2770592272281647, |
| "learning_rate": 0.0001950541548947829, |
| "loss": 0.1131, |
| "mean_token_accuracy": 0.9628041386604309, |
| "num_tokens": 296619.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.281352162361145, |
| "learning_rate": 0.0001947927346167132, |
| "loss": 0.1153, |
| "mean_token_accuracy": 0.9617563486099243, |
| "num_tokens": 302409.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.29630422592163086, |
| "learning_rate": 0.00019452476663977248, |
| "loss": 0.1079, |
| "mean_token_accuracy": 0.9655645489692688, |
| "num_tokens": 308254.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.2530810534954071, |
| "learning_rate": 0.00019425026947353992, |
| "loss": 0.1103, |
| "mean_token_accuracy": 0.9616009891033173, |
| "num_tokens": 314018.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.1982153207063675, |
| "learning_rate": 0.00019396926207859084, |
| "loss": 0.105, |
| "mean_token_accuracy": 0.9627484083175659, |
| "num_tokens": 319961.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.2126384824514389, |
| "learning_rate": 0.0001936817638651871, |
| "loss": 0.1025, |
| "mean_token_accuracy": 0.9655540585517883, |
| "num_tokens": 325625.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.2395949512720108, |
| "learning_rate": 0.00019338779469193639, |
| "loss": 0.1021, |
| "mean_token_accuracy": 0.9675817787647247, |
| "num_tokens": 331617.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.20850463211536407, |
| "learning_rate": 0.00019308737486442045, |
| "loss": 0.0955, |
| "mean_token_accuracy": 0.9671282768249512, |
| "num_tokens": 337583.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.25087860226631165, |
| "learning_rate": 0.00019278052513379255, |
| "loss": 0.1065, |
| "mean_token_accuracy": 0.9648370742797852, |
| "num_tokens": 343277.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.2028970867395401, |
| "learning_rate": 0.00019246726669534415, |
| "loss": 0.1025, |
| "mean_token_accuracy": 0.9668912291526794, |
| "num_tokens": 349050.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.24881428480148315, |
| "learning_rate": 0.00019214762118704076, |
| "loss": 0.0985, |
| "mean_token_accuracy": 0.9658752381801605, |
| "num_tokens": 355012.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.21099071204662323, |
| "learning_rate": 0.00019182161068802741, |
| "loss": 0.1012, |
| "mean_token_accuracy": 0.9665312170982361, |
| "num_tokens": 360813.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.19453655183315277, |
| "learning_rate": 0.00019148925771710347, |
| "loss": 0.1008, |
| "mean_token_accuracy": 0.9639951288700104, |
| "num_tokens": 366482.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.2190839648246765, |
| "learning_rate": 0.00019115058523116733, |
| "loss": 0.096, |
| "mean_token_accuracy": 0.9681192338466644, |
| "num_tokens": 372478.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.15556882321834564, |
| "learning_rate": 0.0001908056166236305, |
| "loss": 0.0982, |
| "mean_token_accuracy": 0.9662132263183594, |
| "num_tokens": 378248.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.3257988691329956, |
| "learning_rate": 0.00019045437572280194, |
| "loss": 0.0947, |
| "mean_token_accuracy": 0.9682586193084717, |
| "num_tokens": 384141.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.17047865688800812, |
| "learning_rate": 0.0001900968867902419, |
| "loss": 0.0992, |
| "mean_token_accuracy": 0.9660438597202301, |
| "num_tokens": 389956.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.16795243322849274, |
| "learning_rate": 0.00018973317451908642, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9670880436897278, |
| "num_tokens": 395734.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.1481715440750122, |
| "learning_rate": 0.00018936326403234125, |
| "loss": 0.0956, |
| "mean_token_accuracy": 0.9670087695121765, |
| "num_tokens": 401472.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.13327202200889587, |
| "learning_rate": 0.0001889871808811469, |
| "loss": 0.0936, |
| "mean_token_accuracy": 0.9669307768344879, |
| "num_tokens": 407183.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.24716301262378693, |
| "learning_rate": 0.00018860495104301345, |
| "loss": 0.0945, |
| "mean_token_accuracy": 0.9653833508491516, |
| "num_tokens": 412997.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.22395415604114532, |
| "learning_rate": 0.00018821660092002641, |
| "loss": 0.0935, |
| "mean_token_accuracy": 0.9652094542980194, |
| "num_tokens": 419036.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.15194346010684967, |
| "learning_rate": 0.00018782215733702286, |
| "loss": 0.0959, |
| "mean_token_accuracy": 0.9657859206199646, |
| "num_tokens": 424916.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.19927610456943512, |
| "learning_rate": 0.00018742164753973855, |
| "loss": 0.0937, |
| "mean_token_accuracy": 0.9679467082023621, |
| "num_tokens": 430814.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.15999707579612732, |
| "learning_rate": 0.00018701509919292613, |
| "loss": 0.0987, |
| "mean_token_accuracy": 0.9676094353199005, |
| "num_tokens": 436770.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.18620580434799194, |
| "learning_rate": 0.00018660254037844388, |
| "loss": 0.0938, |
| "mean_token_accuracy": 0.9678452014923096, |
| "num_tokens": 442556.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.16235262155532837, |
| "learning_rate": 0.0001861839995933164, |
| "loss": 0.0935, |
| "mean_token_accuracy": 0.9700812101364136, |
| "num_tokens": 448337.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.2433900237083435, |
| "learning_rate": 0.00018575950574776595, |
| "loss": 0.092, |
| "mean_token_accuracy": 0.9680770635604858, |
| "num_tokens": 454194.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.2433900237083435, |
| "learning_rate": 0.00018532908816321558, |
| "loss": 0.0839, |
| "mean_token_accuracy": 0.9679836630821228, |
| "num_tokens": 457162.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.21150463819503784, |
| "learning_rate": 0.00018489277657026375, |
| "loss": 0.0917, |
| "mean_token_accuracy": 0.9691027700901031, |
| "num_tokens": 463027.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.15208442509174347, |
| "learning_rate": 0.0001844506011066308, |
| "loss": 0.0885, |
| "mean_token_accuracy": 0.9692970216274261, |
| "num_tokens": 468763.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.14780759811401367, |
| "learning_rate": 0.00018400259231507717, |
| "loss": 0.0889, |
| "mean_token_accuracy": 0.9679381251335144, |
| "num_tokens": 474627.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.212229385972023, |
| "learning_rate": 0.00018354878114129367, |
| "loss": 0.0926, |
| "mean_token_accuracy": 0.9674556255340576, |
| "num_tokens": 480345.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.17746718227863312, |
| "learning_rate": 0.00018308919893176396, |
| "loss": 0.0888, |
| "mean_token_accuracy": 0.9679436087608337, |
| "num_tokens": 486219.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.1740456521511078, |
| "learning_rate": 0.0001826238774315995, |
| "loss": 0.0925, |
| "mean_token_accuracy": 0.9673227965831757, |
| "num_tokens": 492167.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.26816144585609436, |
| "learning_rate": 0.00018215284878234642, |
| "loss": 0.0872, |
| "mean_token_accuracy": 0.9701121747493744, |
| "num_tokens": 498143.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.11143972724676132, |
| "learning_rate": 0.00018167614551976567, |
| "loss": 0.0865, |
| "mean_token_accuracy": 0.9715863168239594, |
| "num_tokens": 504084.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.2850157916545868, |
| "learning_rate": 0.00018119380057158568, |
| "loss": 0.0945, |
| "mean_token_accuracy": 0.968919575214386, |
| "num_tokens": 509909.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.2241591215133667, |
| "learning_rate": 0.00018070584725522762, |
| "loss": 0.0853, |
| "mean_token_accuracy": 0.9705215394496918, |
| "num_tokens": 515873.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.118243508040905, |
| "learning_rate": 0.0001802123192755044, |
| "loss": 0.0886, |
| "mean_token_accuracy": 0.9700030982494354, |
| "num_tokens": 521831.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.16607417166233063, |
| "learning_rate": 0.00017971325072229226, |
| "loss": 0.0925, |
| "mean_token_accuracy": 0.966924250125885, |
| "num_tokens": 527549.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.12684203684329987, |
| "learning_rate": 0.00017920867606817625, |
| "loss": 0.0928, |
| "mean_token_accuracy": 0.9687173068523407, |
| "num_tokens": 533276.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.13812346756458282, |
| "learning_rate": 0.0001786986301660689, |
| "loss": 0.0846, |
| "mean_token_accuracy": 0.9694421291351318, |
| "num_tokens": 539329.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.09481852501630783, |
| "learning_rate": 0.000178183148246803, |
| "loss": 0.0885, |
| "mean_token_accuracy": 0.9687439501285553, |
| "num_tokens": 545024.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.10395218431949615, |
| "learning_rate": 0.00017766226591669785, |
| "loss": 0.0887, |
| "mean_token_accuracy": 0.9673281311988831, |
| "num_tokens": 550789.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.11677782982587814, |
| "learning_rate": 0.0001771360191551, |
| "loss": 0.0896, |
| "mean_token_accuracy": 0.9690899848937988, |
| "num_tokens": 556516.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.15753789246082306, |
| "learning_rate": 0.0001766044443118978, |
| "loss": 0.0875, |
| "mean_token_accuracy": 0.9690685272216797, |
| "num_tokens": 562401.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.10794474184513092, |
| "learning_rate": 0.00017606757810501088, |
| "loss": 0.0885, |
| "mean_token_accuracy": 0.966949075460434, |
| "num_tokens": 568179.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.09485042840242386, |
| "learning_rate": 0.0001755254576178535, |
| "loss": 0.0892, |
| "mean_token_accuracy": 0.9696577191352844, |
| "num_tokens": 573875.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.11549390852451324, |
| "learning_rate": 0.00017497812029677344, |
| "loss": 0.088, |
| "mean_token_accuracy": 0.9707211554050446, |
| "num_tokens": 579570.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.13922029733657837, |
| "learning_rate": 0.00017442560394846516, |
| "loss": 0.0871, |
| "mean_token_accuracy": 0.9688318371772766, |
| "num_tokens": 585316.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.15525391697883606, |
| "learning_rate": 0.0001738679467373586, |
| "loss": 0.0852, |
| "mean_token_accuracy": 0.9691618084907532, |
| "num_tokens": 591315.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.10010520368814468, |
| "learning_rate": 0.00017330518718298264, |
| "loss": 0.0877, |
| "mean_token_accuracy": 0.9675675928592682, |
| "num_tokens": 597174.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.11958754807710648, |
| "learning_rate": 0.00017273736415730488, |
| "loss": 0.0877, |
| "mean_token_accuracy": 0.9694679379463196, |
| "num_tokens": 602903.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.1415647715330124, |
| "learning_rate": 0.0001721645168820462, |
| "loss": 0.0896, |
| "mean_token_accuracy": 0.9691061079502106, |
| "num_tokens": 608732.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.10823409259319305, |
| "learning_rate": 0.00017158668492597186, |
| "loss": 0.0889, |
| "mean_token_accuracy": 0.9668814837932587, |
| "num_tokens": 614381.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.11169976741075516, |
| "learning_rate": 0.00017100390820215804, |
| "loss": 0.0826, |
| "mean_token_accuracy": 0.9673774540424347, |
| "num_tokens": 620269.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.1433805376291275, |
| "learning_rate": 0.00017041622696523518, |
| "loss": 0.0879, |
| "mean_token_accuracy": 0.9695559442043304, |
| "num_tokens": 626049.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.18322382867336273, |
| "learning_rate": 0.00016982368180860728, |
| "loss": 0.0859, |
| "mean_token_accuracy": 0.9673856794834137, |
| "num_tokens": 632069.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.12409456819295883, |
| "learning_rate": 0.00016922631366164797, |
| "loss": 0.0852, |
| "mean_token_accuracy": 0.9684251844882965, |
| "num_tokens": 637899.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.09225030243396759, |
| "learning_rate": 0.0001686241637868734, |
| "loss": 0.0832, |
| "mean_token_accuracy": 0.9704109132289886, |
| "num_tokens": 643848.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.1670381873846054, |
| "learning_rate": 0.00016801727377709194, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9704890549182892, |
| "num_tokens": 649805.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.09994162619113922, |
| "learning_rate": 0.00016740568555253155, |
| "loss": 0.0847, |
| "mean_token_accuracy": 0.9692024290561676, |
| "num_tokens": 655615.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.16063818335533142, |
| "learning_rate": 0.00016678944135794374, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.9709331393241882, |
| "num_tokens": 661700.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.08287379145622253, |
| "learning_rate": 0.00016616858375968595, |
| "loss": 0.082, |
| "mean_token_accuracy": 0.9694286584854126, |
| "num_tokens": 667652.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.08043123781681061, |
| "learning_rate": 0.000165543155642781, |
| "loss": 0.0827, |
| "mean_token_accuracy": 0.9707711637020111, |
| "num_tokens": 673568.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.21236298978328705, |
| "learning_rate": 0.0001649132002079552, |
| "loss": 0.0893, |
| "mean_token_accuracy": 0.967911422252655, |
| "num_tokens": 679207.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.08245056122541428, |
| "learning_rate": 0.00016427876096865394, |
| "loss": 0.0848, |
| "mean_token_accuracy": 0.9723709523677826, |
| "num_tokens": 685023.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.09426119178533554, |
| "learning_rate": 0.00016363988174803638, |
| "loss": 0.0841, |
| "mean_token_accuracy": 0.9704490005970001, |
| "num_tokens": 690769.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.18644003570079803, |
| "learning_rate": 0.00016299660667594814, |
| "loss": 0.0903, |
| "mean_token_accuracy": 0.9699574708938599, |
| "num_tokens": 696458.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.08607800304889679, |
| "learning_rate": 0.00016234898018587337, |
| "loss": 0.0837, |
| "mean_token_accuracy": 0.9700290560722351, |
| "num_tokens": 702302.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.09430722147226334, |
| "learning_rate": 0.00016169704701186527, |
| "loss": 0.085, |
| "mean_token_accuracy": 0.9681020677089691, |
| "num_tokens": 708041.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.08460421860218048, |
| "learning_rate": 0.00016104085218545633, |
| "loss": 0.0853, |
| "mean_token_accuracy": 0.9702745676040649, |
| "num_tokens": 713717.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.15609629452228546, |
| "learning_rate": 0.00016038044103254775, |
| "loss": 0.0841, |
| "mean_token_accuracy": 0.9687030613422394, |
| "num_tokens": 719470.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.09389069676399231, |
| "learning_rate": 0.00015971585917027862, |
| "loss": 0.0846, |
| "mean_token_accuracy": 0.9698879718780518, |
| "num_tokens": 725342.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.09632205218076706, |
| "learning_rate": 0.00015904715250387498, |
| "loss": 0.0867, |
| "mean_token_accuracy": 0.9693426489830017, |
| "num_tokens": 730916.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.08171916007995605, |
| "learning_rate": 0.000158374367223479, |
| "loss": 0.0848, |
| "mean_token_accuracy": 0.9710951149463654, |
| "num_tokens": 736655.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.08510521054267883, |
| "learning_rate": 0.0001576975498009583, |
| "loss": 0.0854, |
| "mean_token_accuracy": 0.9701623022556305, |
| "num_tokens": 742417.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.13480724394321442, |
| "learning_rate": 0.0001570167469866962, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9680794179439545, |
| "num_tokens": 748310.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.08283688873052597, |
| "learning_rate": 0.0001563320058063622, |
| "loss": 0.0845, |
| "mean_token_accuracy": 0.9698716402053833, |
| "num_tokens": 753983.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.08392301946878433, |
| "learning_rate": 0.00015564337355766412, |
| "loss": 0.0875, |
| "mean_token_accuracy": 0.9689998030662537, |
| "num_tokens": 759724.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.1573030650615692, |
| "learning_rate": 0.0001549508978070806, |
| "loss": 0.0867, |
| "mean_token_accuracy": 0.9682514369487762, |
| "num_tokens": 765331.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.08259446918964386, |
| "learning_rate": 0.00015425462638657595, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9699809551239014, |
| "num_tokens": 771258.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.07509376853704453, |
| "learning_rate": 0.00015355460739029586, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9709121584892273, |
| "num_tokens": 777200.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.08865094929933548, |
| "learning_rate": 0.00015285088917124556, |
| "loss": 0.082, |
| "mean_token_accuracy": 0.969213992357254, |
| "num_tokens": 783016.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.07362065464258194, |
| "learning_rate": 0.0001521435203379498, |
| "loss": 0.0806, |
| "mean_token_accuracy": 0.9707930982112885, |
| "num_tokens": 788866.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.07869767397642136, |
| "learning_rate": 0.00015143254975109538, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9704539179801941, |
| "num_tokens": 794784.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.08163165301084518, |
| "learning_rate": 0.0001507180265201559, |
| "loss": 0.083, |
| "mean_token_accuracy": 0.9703050553798676, |
| "num_tokens": 800539.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.08681312203407288, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.9712086617946625, |
| "num_tokens": 806576.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.06929908692836761, |
| "learning_rate": 0.00014927851978748178, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9684962332248688, |
| "num_tokens": 812258.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.07867726683616638, |
| "learning_rate": 0.00014855363571801523, |
| "loss": 0.0823, |
| "mean_token_accuracy": 0.9689460396766663, |
| "num_tokens": 818185.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.07411834597587585, |
| "learning_rate": 0.00014782539786213183, |
| "loss": 0.0848, |
| "mean_token_accuracy": 0.970024436712265, |
| "num_tokens": 824020.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.07753404974937439, |
| "learning_rate": 0.00014709385652202203, |
| "loss": 0.0806, |
| "mean_token_accuracy": 0.9706675112247467, |
| "num_tokens": 829948.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.07096187025308609, |
| "learning_rate": 0.00014635906222806058, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9710037112236023, |
| "num_tokens": 835875.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.07591943442821503, |
| "learning_rate": 0.0001456210657353163, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.970432847738266, |
| "num_tokens": 841722.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.07978185266256332, |
| "learning_rate": 0.00014487991802004623, |
| "loss": 0.0829, |
| "mean_token_accuracy": 0.9696160554885864, |
| "num_tokens": 847480.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.07600882649421692, |
| "learning_rate": 0.0001441356702761744, |
| "loss": 0.0852, |
| "mean_token_accuracy": 0.9686452448368073, |
| "num_tokens": 853223.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.08528134226799011, |
| "learning_rate": 0.00014338837391175582, |
| "loss": 0.0821, |
| "mean_token_accuracy": 0.969150722026825, |
| "num_tokens": 859154.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.07796002924442291, |
| "learning_rate": 0.0001426380805454254, |
| "loss": 0.0839, |
| "mean_token_accuracy": 0.9670197069644928, |
| "num_tokens": 864888.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.06374917924404144, |
| "learning_rate": 0.0001418848420028325, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.9701065123081207, |
| "num_tokens": 870644.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.06862544268369675, |
| "learning_rate": 0.00014112871031306119, |
| "loss": 0.0838, |
| "mean_token_accuracy": 0.9695531725883484, |
| "num_tokens": 876363.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.07496917247772217, |
| "learning_rate": 0.00014036973770503624, |
| "loss": 0.0865, |
| "mean_token_accuracy": 0.9700089395046234, |
| "num_tokens": 882064.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.07615385949611664, |
| "learning_rate": 0.0001396079766039157, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9710656702518463, |
| "num_tokens": 888176.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.07192222774028778, |
| "learning_rate": 0.00013884347962746948, |
| "loss": 0.083, |
| "mean_token_accuracy": 0.9697221219539642, |
| "num_tokens": 893889.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.07578443735837936, |
| "learning_rate": 0.00013807629958244498, |
| "loss": 0.084, |
| "mean_token_accuracy": 0.9704568088054657, |
| "num_tokens": 899571.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.07004435360431671, |
| "learning_rate": 0.0001373064894609194, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9704504013061523, |
| "num_tokens": 905660.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.07362619787454605, |
| "learning_rate": 0.00013653410243663952, |
| "loss": 0.0824, |
| "mean_token_accuracy": 0.9680611491203308, |
| "num_tokens": 911391.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.11275428533554077, |
| "learning_rate": 0.0001357591918613486, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9699540734291077, |
| "num_tokens": 914252.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.06643939763307571, |
| "learning_rate": 0.0001349818112611015, |
| "loss": 0.082, |
| "mean_token_accuracy": 0.9684470295906067, |
| "num_tokens": 919957.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 0.06806526333093643, |
| "learning_rate": 0.00013420201433256689, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9701605141162872, |
| "num_tokens": 925795.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.07850659638643265, |
| "learning_rate": 0.00013341985493931877, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9690955281257629, |
| "num_tokens": 931652.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.08378799259662628, |
| "learning_rate": 0.0001326353871081156, |
| "loss": 0.0832, |
| "mean_token_accuracy": 0.9697659015655518, |
| "num_tokens": 937440.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.07717715948820114, |
| "learning_rate": 0.00013184866502516845, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9703347980976105, |
| "num_tokens": 943405.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.07521849125623703, |
| "learning_rate": 0.00013105974303239838, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.9717486500740051, |
| "num_tokens": 949323.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.07702027261257172, |
| "learning_rate": 0.0001302686756236826, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9727192223072052, |
| "num_tokens": 955257.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.08259471505880356, |
| "learning_rate": 0.00012947551744109043, |
| "loss": 0.0849, |
| "mean_token_accuracy": 0.9688011109828949, |
| "num_tokens": 960995.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.0739479586482048, |
| "learning_rate": 0.00012868032327110904, |
| "loss": 0.0824, |
| "mean_token_accuracy": 0.969892680644989, |
| "num_tokens": 966672.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.07641750574111938, |
| "learning_rate": 0.00012788314804085903, |
| "loss": 0.0858, |
| "mean_token_accuracy": 0.9697946012020111, |
| "num_tokens": 972364.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.0725414827466011, |
| "learning_rate": 0.00012708404681430053, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.9705974459648132, |
| "num_tokens": 978178.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.07151193916797638, |
| "learning_rate": 0.00012628307478842953, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9706787467002869, |
| "num_tokens": 984046.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.07521957904100418, |
| "learning_rate": 0.0001254802872894655, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.9709869623184204, |
| "num_tokens": 989761.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.060880064964294434, |
| "learning_rate": 0.00012467573976902935, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9719542562961578, |
| "num_tokens": 995492.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.06429281830787659, |
| "learning_rate": 0.0001238694878003138, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.9716426134109497, |
| "num_tokens": 1001409.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.06350357830524445, |
| "learning_rate": 0.00012306158707424403, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9708206653594971, |
| "num_tokens": 1007230.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.07249215990304947, |
| "learning_rate": 0.00012225209339563145, |
| "loss": 0.0827, |
| "mean_token_accuracy": 0.9682056307792664, |
| "num_tokens": 1012954.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.0626291036605835, |
| "learning_rate": 0.00012144106267931876, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.970901608467102, |
| "num_tokens": 1018688.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.0756702721118927, |
| "learning_rate": 0.00012062855094631778, |
| "loss": 0.0835, |
| "mean_token_accuracy": 0.9696753025054932, |
| "num_tokens": 1024426.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.07612688839435577, |
| "learning_rate": 0.00011981461431993977, |
| "loss": 0.0844, |
| "mean_token_accuracy": 0.9688003659248352, |
| "num_tokens": 1030166.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.06982312351465225, |
| "learning_rate": 0.00011899930902191902, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.9691322147846222, |
| "num_tokens": 1035931.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.06827575713396072, |
| "learning_rate": 0.00011818269136852909, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.968558132648468, |
| "num_tokens": 1041751.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.0701732337474823, |
| "learning_rate": 0.00011736481776669306, |
| "loss": 0.08, |
| "mean_token_accuracy": 0.9714179337024689, |
| "num_tokens": 1047622.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.06068166717886925, |
| "learning_rate": 0.00011654574471008713, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.9697660803794861, |
| "num_tokens": 1053476.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.06006036698818207, |
| "learning_rate": 0.00011572552877523854, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9702647030353546, |
| "num_tokens": 1059492.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.08254722505807877, |
| "learning_rate": 0.00011490422661761744, |
| "loss": 0.0827, |
| "mean_token_accuracy": 0.9685249626636505, |
| "num_tokens": 1065309.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.06635136902332306, |
| "learning_rate": 0.00011408189496772368, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9697334468364716, |
| "num_tokens": 1071198.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.06728167831897736, |
| "learning_rate": 0.00011325859062716795, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9717288315296173, |
| "num_tokens": 1077067.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.07463246583938599, |
| "learning_rate": 0.00011243437046474853, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.9716354310512543, |
| "num_tokens": 1083052.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.08216842263936996, |
| "learning_rate": 0.00011160929141252303, |
| "loss": 0.0837, |
| "mean_token_accuracy": 0.9671932756900787, |
| "num_tokens": 1088937.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.06495602428913116, |
| "learning_rate": 0.00011078341046187589, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9711815714836121, |
| "num_tokens": 1094653.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.07960506528615952, |
| "learning_rate": 0.00010995678465958168, |
| "loss": 0.0835, |
| "mean_token_accuracy": 0.969552218914032, |
| "num_tokens": 1100430.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.062362972646951675, |
| "learning_rate": 0.00010912947110386484, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9699338972568512, |
| "num_tokens": 1106256.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.0681372880935669, |
| "learning_rate": 0.00010830152694045552, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9708313941955566, |
| "num_tokens": 1112215.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.06679756194353104, |
| "learning_rate": 0.00010747300935864243, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9696420729160309, |
| "num_tokens": 1118009.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.07661960273981094, |
| "learning_rate": 0.00010664397558732244, |
| "loss": 0.0822, |
| "mean_token_accuracy": 0.9715335965156555, |
| "num_tokens": 1123730.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.0642203763127327, |
| "learning_rate": 0.00010581448289104758, |
| "loss": 0.0827, |
| "mean_token_accuracy": 0.968016117811203, |
| "num_tokens": 1129518.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.07240530848503113, |
| "learning_rate": 0.00010498458856606972, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.9701722860336304, |
| "num_tokens": 1135449.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.06760862469673157, |
| "learning_rate": 0.00010415434993638269, |
| "loss": 0.0821, |
| "mean_token_accuracy": 0.9692021906375885, |
| "num_tokens": 1141197.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.06540956348180771, |
| "learning_rate": 0.00010332382434976266, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.9689615964889526, |
| "num_tokens": 1147124.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.07420117408037186, |
| "learning_rate": 0.0001024930691738073, |
| "loss": 0.0839, |
| "mean_token_accuracy": 0.9682944118976593, |
| "num_tokens": 1152771.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.061245448887348175, |
| "learning_rate": 0.00010166214179197264, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9693343043327332, |
| "num_tokens": 1158609.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.07398168742656708, |
| "learning_rate": 0.00010083109959960973, |
| "loss": 0.0836, |
| "mean_token_accuracy": 0.9690487086772919, |
| "num_tokens": 1164359.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.06130973622202873, |
| "learning_rate": 0.0001, |
| "loss": 0.0825, |
| "mean_token_accuracy": 0.9688800871372223, |
| "num_tokens": 1170050.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.059589143842458725, |
| "learning_rate": 9.916890040039031e-05, |
| "loss": 0.0822, |
| "mean_token_accuracy": 0.9665999114513397, |
| "num_tokens": 1175743.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.06661482155323029, |
| "learning_rate": 9.833785820802739e-05, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.9697706997394562, |
| "num_tokens": 1181691.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.05537959188222885, |
| "learning_rate": 9.750693082619273e-05, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9696797430515289, |
| "num_tokens": 1187528.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.06162695959210396, |
| "learning_rate": 9.667617565023735e-05, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9706624746322632, |
| "num_tokens": 1193495.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.06732062250375748, |
| "learning_rate": 9.584565006361734e-05, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.9701182544231415, |
| "num_tokens": 1199382.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.05625153332948685, |
| "learning_rate": 9.501541143393028e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9705232977867126, |
| "num_tokens": 1205213.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.07023126631975174, |
| "learning_rate": 9.418551710895243e-05, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9707081913948059, |
| "num_tokens": 1211149.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.06514835357666016, |
| "learning_rate": 9.335602441267759e-05, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9710925817489624, |
| "num_tokens": 1216886.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.059471771121025085, |
| "learning_rate": 9.252699064135758e-05, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9702471494674683, |
| "num_tokens": 1222701.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.06286533921957016, |
| "learning_rate": 9.169847305954447e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9719226360321045, |
| "num_tokens": 1228689.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.06742485612630844, |
| "learning_rate": 9.087052889613518e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9720667004585266, |
| "num_tokens": 1234695.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.06361982226371765, |
| "learning_rate": 9.004321534041835e-05, |
| "loss": 0.0831, |
| "mean_token_accuracy": 0.9710087776184082, |
| "num_tokens": 1240312.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.05879661440849304, |
| "learning_rate": 8.921658953812415e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9697242081165314, |
| "num_tokens": 1246211.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.0721222385764122, |
| "learning_rate": 8.839070858747697e-05, |
| "loss": 0.0828, |
| "mean_token_accuracy": 0.9670188128948212, |
| "num_tokens": 1251858.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.06966773420572281, |
| "learning_rate": 8.756562953525152e-05, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.9688356220722198, |
| "num_tokens": 1257762.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.07037881761789322, |
| "learning_rate": 8.674140937283208e-05, |
| "loss": 0.0803, |
| "mean_token_accuracy": 0.9705818891525269, |
| "num_tokens": 1263595.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.06910485774278641, |
| "learning_rate": 8.591810503227635e-05, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.9677394926548004, |
| "num_tokens": 1269366.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.06575801223516464, |
| "learning_rate": 8.509577338238255e-05, |
| "loss": 0.081, |
| "mean_token_accuracy": 0.9707579016685486, |
| "num_tokens": 1275141.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.06782017648220062, |
| "learning_rate": 8.427447122476148e-05, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9716315567493439, |
| "num_tokens": 1281059.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.06269742548465729, |
| "learning_rate": 8.345425528991288e-05, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9703017473220825, |
| "num_tokens": 1286948.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.06444042176008224, |
| "learning_rate": 8.263518223330697e-05, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.9698095917701721, |
| "num_tokens": 1292712.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.09271910041570663, |
| "learning_rate": 8.181730863147093e-05, |
| "loss": 0.0816, |
| "mean_token_accuracy": 0.9655384719371796, |
| "num_tokens": 1298468.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.060135409235954285, |
| "learning_rate": 8.100069097808103e-05, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9718931913375854, |
| "num_tokens": 1304438.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.06524819135665894, |
| "learning_rate": 8.018538568006027e-05, |
| "loss": 0.0807, |
| "mean_token_accuracy": 0.9684958159923553, |
| "num_tokens": 1310182.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.06421119719743729, |
| "learning_rate": 7.937144905368226e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.9699224829673767, |
| "num_tokens": 1316131.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.060645345598459244, |
| "learning_rate": 7.855893732068125e-05, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.969642162322998, |
| "num_tokens": 1322027.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.0872688964009285, |
| "learning_rate": 7.774790660436858e-05, |
| "loss": 0.0823, |
| "mean_token_accuracy": 0.968631237745285, |
| "num_tokens": 1327798.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.06461073458194733, |
| "learning_rate": 7.693841292575598e-05, |
| "loss": 0.0826, |
| "mean_token_accuracy": 0.9698716104030609, |
| "num_tokens": 1333471.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.056773390620946884, |
| "learning_rate": 7.613051219968623e-05, |
| "loss": 0.0768, |
| "mean_token_accuracy": 0.9718391001224518, |
| "num_tokens": 1339505.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.06603224575519562, |
| "learning_rate": 7.532426023097063e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9700065553188324, |
| "num_tokens": 1345269.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.0672716423869133, |
| "learning_rate": 7.451971271053455e-05, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9715771377086639, |
| "num_tokens": 1351110.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.07741643488407135, |
| "learning_rate": 7.371692521157048e-05, |
| "loss": 0.0831, |
| "mean_token_accuracy": 0.9681077897548676, |
| "num_tokens": 1356754.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.980891719745223, |
| "grad_norm": 0.06615743786096573, |
| "learning_rate": 7.291595318569951e-05, |
| "loss": 0.08, |
| "mean_token_accuracy": 0.9720337688922882, |
| "num_tokens": 1362541.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9936305732484074, |
| "grad_norm": 0.0631820484995842, |
| "learning_rate": 7.211685195914097e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.969734251499176, |
| "num_tokens": 1368478.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.0631820484995842, |
| "learning_rate": 7.131967672889101e-05, |
| "loss": 0.0829, |
| "mean_token_accuracy": 0.9699602127075195, |
| "num_tokens": 1371273.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0127388535031847, |
| "grad_norm": 0.12515003979206085, |
| "learning_rate": 7.052448255890957e-05, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9699683785438538, |
| "num_tokens": 1376910.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0254777070063694, |
| "grad_norm": 0.06320805847644806, |
| "learning_rate": 6.973132437631742e-05, |
| "loss": 0.0831, |
| "mean_token_accuracy": 0.9673981666564941, |
| "num_tokens": 1382588.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.038216560509554, |
| "grad_norm": 0.06302487105131149, |
| "learning_rate": 6.894025696760163e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.971070796251297, |
| "num_tokens": 1388544.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050955414012739, |
| "grad_norm": 0.06294956803321838, |
| "learning_rate": 6.815133497483157e-05, |
| "loss": 0.0759, |
| "mean_token_accuracy": 0.9699667692184448, |
| "num_tokens": 1394637.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0636942675159236, |
| "grad_norm": 0.06007220596075058, |
| "learning_rate": 6.736461289188445e-05, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9709272682666779, |
| "num_tokens": 1400617.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0764331210191083, |
| "grad_norm": 0.0644717738032341, |
| "learning_rate": 6.658014506068126e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9710936546325684, |
| "num_tokens": 1406526.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.089171974522293, |
| "grad_norm": 0.060126665979623795, |
| "learning_rate": 6.579798566743314e-05, |
| "loss": 0.0811, |
| "mean_token_accuracy": 0.9704807698726654, |
| "num_tokens": 1412184.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1019108280254777, |
| "grad_norm": 0.05887053534388542, |
| "learning_rate": 6.501818873889855e-05, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9728036522865295, |
| "num_tokens": 1418128.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1146496815286624, |
| "grad_norm": 0.05612581968307495, |
| "learning_rate": 6.424080813865138e-05, |
| "loss": 0.0814, |
| "mean_token_accuracy": 0.9696513116359711, |
| "num_tokens": 1423829.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.127388535031847, |
| "grad_norm": 0.06269162148237228, |
| "learning_rate": 6.34658975633605e-05, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.9693237543106079, |
| "num_tokens": 1429471.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.140127388535032, |
| "grad_norm": 0.06179108843207359, |
| "learning_rate": 6.269351053908061e-05, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9713320434093475, |
| "num_tokens": 1435123.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.1528662420382165, |
| "grad_norm": 0.05953584611415863, |
| "learning_rate": 6.192370041755505e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9720431268215179, |
| "num_tokens": 1441017.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1656050955414012, |
| "grad_norm": 0.05920351296663284, |
| "learning_rate": 6.115652037253053e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9707915484905243, |
| "num_tokens": 1446861.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.178343949044586, |
| "grad_norm": 0.06840499490499496, |
| "learning_rate": 6.039202339608432e-05, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.9717750549316406, |
| "num_tokens": 1452670.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.1910828025477707, |
| "grad_norm": 0.05971769243478775, |
| "learning_rate": 5.963026229496378e-05, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.9706140756607056, |
| "num_tokens": 1458452.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2038216560509554, |
| "grad_norm": 0.06719432771205902, |
| "learning_rate": 5.887128968693887e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9705943167209625, |
| "num_tokens": 1464333.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.21656050955414, |
| "grad_norm": 0.06789746135473251, |
| "learning_rate": 5.8115157997167536e-05, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9682629108428955, |
| "num_tokens": 1470164.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.229299363057325, |
| "grad_norm": 0.0646275132894516, |
| "learning_rate": 5.736191945457463e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9719286262989044, |
| "num_tokens": 1476106.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.2420382165605095, |
| "grad_norm": 0.06187563017010689, |
| "learning_rate": 5.6611626088244194e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9710664451122284, |
| "num_tokens": 1481980.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.254777070063694, |
| "grad_norm": 0.06890401989221573, |
| "learning_rate": 5.58643297238256e-05, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.9685621857643127, |
| "num_tokens": 1487801.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.267515923566879, |
| "grad_norm": 0.06694001704454422, |
| "learning_rate": 5.5120081979953785e-05, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9690047204494476, |
| "num_tokens": 1493525.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.2802547770700636, |
| "grad_norm": 0.0607277937233448, |
| "learning_rate": 5.43789342646837e-05, |
| "loss": 0.0788, |
| "mean_token_accuracy": 0.9698476493358612, |
| "num_tokens": 1499454.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.2929936305732483, |
| "grad_norm": 0.06306935101747513, |
| "learning_rate": 5.3640937771939436e-05, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.9711892902851105, |
| "num_tokens": 1505312.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.305732484076433, |
| "grad_norm": 0.07524839788675308, |
| "learning_rate": 5.290614347797802e-05, |
| "loss": 0.0817, |
| "mean_token_accuracy": 0.969828873872757, |
| "num_tokens": 1511011.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3184713375796178, |
| "grad_norm": 0.06218244507908821, |
| "learning_rate": 5.217460213786821e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.971624881029129, |
| "num_tokens": 1516884.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.3312101910828025, |
| "grad_norm": 0.07467464357614517, |
| "learning_rate": 5.1446364281984774e-05, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.969776451587677, |
| "num_tokens": 1522673.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.343949044585987, |
| "grad_norm": 0.05752575770020485, |
| "learning_rate": 5.072148021251821e-05, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9715888500213623, |
| "num_tokens": 1528694.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.356687898089172, |
| "grad_norm": 0.0617908351123333, |
| "learning_rate": 5.000000000000002e-05, |
| "loss": 0.0816, |
| "mean_token_accuracy": 0.9708900451660156, |
| "num_tokens": 1534358.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.3694267515923566, |
| "grad_norm": 0.05914432927966118, |
| "learning_rate": 4.92819734798441e-05, |
| "loss": 0.0773, |
| "mean_token_accuracy": 0.9710153937339783, |
| "num_tokens": 1540287.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.3821656050955413, |
| "grad_norm": 0.05921492725610733, |
| "learning_rate": 4.856745024890466e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9695830941200256, |
| "num_tokens": 1545974.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.394904458598726, |
| "grad_norm": 0.06628979742527008, |
| "learning_rate": 4.78564796620502e-05, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.9675322771072388, |
| "num_tokens": 1551832.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4076433121019107, |
| "grad_norm": 0.07890256494283676, |
| "learning_rate": 4.7149110828754464e-05, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.9691312909126282, |
| "num_tokens": 1557500.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4203821656050954, |
| "grad_norm": 0.06330595165491104, |
| "learning_rate": 4.644539260970416e-05, |
| "loss": 0.0804, |
| "mean_token_accuracy": 0.9696717262268066, |
| "num_tokens": 1563298.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.43312101910828, |
| "grad_norm": 0.06580579280853271, |
| "learning_rate": 4.574537361342407e-05, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.967890202999115, |
| "num_tokens": 1568999.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.445859872611465, |
| "grad_norm": 0.06915119290351868, |
| "learning_rate": 4.50491021929194e-05, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9705429673194885, |
| "num_tokens": 1574940.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4585987261146496, |
| "grad_norm": 0.07045170664787292, |
| "learning_rate": 4.435662644233594e-05, |
| "loss": 0.0811, |
| "mean_token_accuracy": 0.9662905633449554, |
| "num_tokens": 1580639.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4713375796178343, |
| "grad_norm": 0.062564916908741, |
| "learning_rate": 4.3667994193637796e-05, |
| "loss": 0.0801, |
| "mean_token_accuracy": 0.9690904021263123, |
| "num_tokens": 1586429.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.484076433121019, |
| "grad_norm": 0.06395804136991501, |
| "learning_rate": 4.298325301330383e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9688712358474731, |
| "num_tokens": 1592273.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4968152866242037, |
| "grad_norm": 0.062301404774188995, |
| "learning_rate": 4.23024501990417e-05, |
| "loss": 0.0815, |
| "mean_token_accuracy": 0.9681532680988312, |
| "num_tokens": 1597957.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5095541401273884, |
| "grad_norm": 0.0626181960105896, |
| "learning_rate": 4.1625632776521037e-05, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9706997573375702, |
| "num_tokens": 1603724.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.522292993630573, |
| "grad_norm": 0.05692123994231224, |
| "learning_rate": 4.095284749612503e-05, |
| "loss": 0.0794, |
| "mean_token_accuracy": 0.9695738852024078, |
| "num_tokens": 1609505.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.535031847133758, |
| "grad_norm": 0.06804097443819046, |
| "learning_rate": 4.028414082972141e-05, |
| "loss": 0.0829, |
| "mean_token_accuracy": 0.9673117399215698, |
| "num_tokens": 1615076.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5477707006369426, |
| "grad_norm": 0.058650195598602295, |
| "learning_rate": 3.961955896745224e-05, |
| "loss": 0.0759, |
| "mean_token_accuracy": 0.9718073904514313, |
| "num_tokens": 1621133.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5605095541401273, |
| "grad_norm": 0.05979275703430176, |
| "learning_rate": 3.89591478145437e-05, |
| "loss": 0.0816, |
| "mean_token_accuracy": 0.9686501324176788, |
| "num_tokens": 1626813.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.573248407643312, |
| "grad_norm": 0.06317468732595444, |
| "learning_rate": 3.8302952988134756e-05, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9697080850601196, |
| "num_tokens": 1632590.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5859872611464967, |
| "grad_norm": 0.0720604881644249, |
| "learning_rate": 3.7651019814126654e-05, |
| "loss": 0.0818, |
| "mean_token_accuracy": 0.9681734144687653, |
| "num_tokens": 1638215.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5987261146496814, |
| "grad_norm": 0.06027304753661156, |
| "learning_rate": 3.7003393324051874e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9694899618625641, |
| "num_tokens": 1644145.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.611464968152866, |
| "grad_norm": 0.06597089767456055, |
| "learning_rate": 3.6360118251963645e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9711305201053619, |
| "num_tokens": 1649962.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.624203821656051, |
| "grad_norm": 0.05844837427139282, |
| "learning_rate": 3.5721239031346066e-05, |
| "loss": 0.0783, |
| "mean_token_accuracy": 0.9709188640117645, |
| "num_tokens": 1655803.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.6369426751592355, |
| "grad_norm": 0.0590052530169487, |
| "learning_rate": 3.508679979204481e-05, |
| "loss": 0.0801, |
| "mean_token_accuracy": 0.9683609306812286, |
| "num_tokens": 1661598.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6496815286624202, |
| "grad_norm": 0.061401642858982086, |
| "learning_rate": 3.445684435721897e-05, |
| "loss": 0.076, |
| "mean_token_accuracy": 0.9688279926776886, |
| "num_tokens": 1667597.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.662420382165605, |
| "grad_norm": 0.06329475343227386, |
| "learning_rate": 3.383141624031408e-05, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9683489799499512, |
| "num_tokens": 1673442.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.6751592356687897, |
| "grad_norm": 0.059181585907936096, |
| "learning_rate": 3.3210558642056275e-05, |
| "loss": 0.0788, |
| "mean_token_accuracy": 0.9712333083152771, |
| "num_tokens": 1679281.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6878980891719744, |
| "grad_norm": 0.06536949425935745, |
| "learning_rate": 3.259431444746846e-05, |
| "loss": 0.0765, |
| "mean_token_accuracy": 0.9710779190063477, |
| "num_tokens": 1685323.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.700636942675159, |
| "grad_norm": 0.06547825783491135, |
| "learning_rate": 3.198272622290804e-05, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9710780680179596, |
| "num_tokens": 1691092.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.713375796178344, |
| "grad_norm": 0.05739077925682068, |
| "learning_rate": 3.137583621312665e-05, |
| "loss": 0.0801, |
| "mean_token_accuracy": 0.9698264896869659, |
| "num_tokens": 1696792.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.7261146496815285, |
| "grad_norm": 0.06391553580760956, |
| "learning_rate": 3.077368633835205e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.9698535203933716, |
| "num_tokens": 1702628.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.738853503184713, |
| "grad_norm": 0.06288064271211624, |
| "learning_rate": 3.0176318191392726e-05, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9702651500701904, |
| "num_tokens": 1708370.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7515923566878984, |
| "grad_norm": 0.06188668683171272, |
| "learning_rate": 2.9583773034764826e-05, |
| "loss": 0.0808, |
| "mean_token_accuracy": 0.9695869386196136, |
| "num_tokens": 1714054.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.7643312101910826, |
| "grad_norm": 0.06291300803422928, |
| "learning_rate": 2.8996091797841973e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9701660573482513, |
| "num_tokens": 1719950.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.777070063694268, |
| "grad_norm": 0.06500188261270523, |
| "learning_rate": 2.8413315074028158e-05, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9698123633861542, |
| "num_tokens": 1725681.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.789808917197452, |
| "grad_norm": 0.05530101805925369, |
| "learning_rate": 2.7835483117953788e-05, |
| "loss": 0.0753, |
| "mean_token_accuracy": 0.9717605412006378, |
| "num_tokens": 1731743.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.802547770700637, |
| "grad_norm": 0.05843547359108925, |
| "learning_rate": 2.7262635842695127e-05, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9675658047199249, |
| "num_tokens": 1737417.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.8152866242038215, |
| "grad_norm": 0.06355355679988861, |
| "learning_rate": 2.669481281701739e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.9698892831802368, |
| "num_tokens": 1743259.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8280254777070066, |
| "grad_norm": 0.06356390565633774, |
| "learning_rate": 2.6132053262641466e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.9720463454723358, |
| "num_tokens": 1749189.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.840764331210191, |
| "grad_norm": 0.05667181685566902, |
| "learning_rate": 2.5574396051534832e-05, |
| "loss": 0.0783, |
| "mean_token_accuracy": 0.9687053561210632, |
| "num_tokens": 1755036.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.853503184713376, |
| "grad_norm": 0.05982512980699539, |
| "learning_rate": 2.502187970322657e-05, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9688549339771271, |
| "num_tokens": 1760783.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8662420382165603, |
| "grad_norm": 0.06933721899986267, |
| "learning_rate": 2.4474542382146537e-05, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9714393317699432, |
| "num_tokens": 1766726.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8789808917197455, |
| "grad_norm": 0.05933714285492897, |
| "learning_rate": 2.3932421894989167e-05, |
| "loss": 0.0805, |
| "mean_token_accuracy": 0.9698410928249359, |
| "num_tokens": 1772461.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8917197452229297, |
| "grad_norm": 0.0652802586555481, |
| "learning_rate": 2.339555568810221e-05, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9679871499538422, |
| "num_tokens": 1778366.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.904458598726115, |
| "grad_norm": 0.056804459542036057, |
| "learning_rate": 2.2863980844900036e-05, |
| "loss": 0.0769, |
| "mean_token_accuracy": 0.9695643186569214, |
| "num_tokens": 1784312.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.917197452229299, |
| "grad_norm": 0.06611023098230362, |
| "learning_rate": 2.2337734083302164e-05, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9698533117771149, |
| "num_tokens": 1790222.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9299363057324843, |
| "grad_norm": 0.06188473105430603, |
| "learning_rate": 2.181685175319702e-05, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9717121124267578, |
| "num_tokens": 1796119.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9426751592356686, |
| "grad_norm": 0.07523812353610992, |
| "learning_rate": 2.1301369833931117e-05, |
| "loss": 0.0782, |
| "mean_token_accuracy": 0.9710706174373627, |
| "num_tokens": 1801956.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9554140127388537, |
| "grad_norm": 0.06925839930772781, |
| "learning_rate": 2.079132393182378e-05, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9701486229896545, |
| "num_tokens": 1807849.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.968152866242038, |
| "grad_norm": 0.060205671936273575, |
| "learning_rate": 2.0286749277707782e-05, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9711746573448181, |
| "num_tokens": 1813665.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.980891719745223, |
| "grad_norm": 0.05551603436470032, |
| "learning_rate": 1.9787680724495617e-05, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9699892699718475, |
| "num_tokens": 1819526.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9936305732484074, |
| "grad_norm": 0.05668932944536209, |
| "learning_rate": 1.929415274477239e-05, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9723762273788452, |
| "num_tokens": 1825422.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.10560295730829239, |
| "learning_rate": 1.880619942841435e-05, |
| "loss": 0.0813, |
| "mean_token_accuracy": 0.9703971147537231, |
| "num_tokens": 1828224.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012738853503185, |
| "grad_norm": 0.05985555797815323, |
| "learning_rate": 1.832385448023435e-05, |
| "loss": 0.075, |
| "mean_token_accuracy": 0.9709382057189941, |
| "num_tokens": 1834274.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025477707006369, |
| "grad_norm": 0.06078803911805153, |
| "learning_rate": 1.7847151217653624e-05, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9702737033367157, |
| "num_tokens": 1840021.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.038216560509555, |
| "grad_norm": 0.05563405156135559, |
| "learning_rate": 1.7376122568400532e-05, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.967924565076828, |
| "num_tokens": 1845728.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050955414012739, |
| "grad_norm": 0.05961964279413223, |
| "learning_rate": 1.6910801068236016e-05, |
| "loss": 0.0757, |
| "mean_token_accuracy": 0.9721821546554565, |
| "num_tokens": 1851756.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063694267515924, |
| "grad_norm": 0.05875060334801674, |
| "learning_rate": 1.6451218858706374e-05, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.9688915312290192, |
| "num_tokens": 1857580.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.076433121019108, |
| "grad_norm": 0.05704512819647789, |
| "learning_rate": 1.5997407684922862e-05, |
| "loss": 0.0773, |
| "mean_token_accuracy": 0.9704049527645111, |
| "num_tokens": 1863490.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.089171974522293, |
| "grad_norm": 0.05825570225715637, |
| "learning_rate": 1.5549398893369216e-05, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9705154597759247, |
| "num_tokens": 1869218.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.101910828025478, |
| "grad_norm": 0.06335911154747009, |
| "learning_rate": 1.5107223429736272e-05, |
| "loss": 0.0764, |
| "mean_token_accuracy": 0.9686422348022461, |
| "num_tokens": 1875203.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.114649681528663, |
| "grad_norm": 0.059776898473501205, |
| "learning_rate": 1.467091183678444e-05, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9711997509002686, |
| "num_tokens": 1881030.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.127388535031847, |
| "grad_norm": 0.06166277453303337, |
| "learning_rate": 1.4240494252234049e-05, |
| "loss": 0.0761, |
| "mean_token_accuracy": 0.971430629491806, |
| "num_tokens": 1887018.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.140127388535032, |
| "grad_norm": 0.05846632644534111, |
| "learning_rate": 1.3816000406683604e-05, |
| "loss": 0.0758, |
| "mean_token_accuracy": 0.9700314998626709, |
| "num_tokens": 1893015.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.1528662420382165, |
| "grad_norm": 0.05708112567663193, |
| "learning_rate": 1.339745962155613e-05, |
| "loss": 0.077, |
| "mean_token_accuracy": 0.9726677536964417, |
| "num_tokens": 1898894.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.165605095541402, |
| "grad_norm": 0.06049314886331558, |
| "learning_rate": 1.2984900807073919e-05, |
| "loss": 0.0788, |
| "mean_token_accuracy": 0.9703496098518372, |
| "num_tokens": 1904694.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.178343949044586, |
| "grad_norm": 0.05979952961206436, |
| "learning_rate": 1.2578352460261456e-05, |
| "loss": 0.0765, |
| "mean_token_accuracy": 0.9704856276512146, |
| "num_tokens": 1910650.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.191082802547771, |
| "grad_norm": 0.057836275547742844, |
| "learning_rate": 1.2177842662977135e-05, |
| "loss": 0.0772, |
| "mean_token_accuracy": 0.9702738225460052, |
| "num_tokens": 1916529.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.203821656050955, |
| "grad_norm": 0.0649733766913414, |
| "learning_rate": 1.1783399079973578e-05, |
| "loss": 0.0819, |
| "mean_token_accuracy": 0.9693669080734253, |
| "num_tokens": 1922109.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.2165605095541405, |
| "grad_norm": 0.06345295161008835, |
| "learning_rate": 1.1395048956986575e-05, |
| "loss": 0.0795, |
| "mean_token_accuracy": 0.9681398570537567, |
| "num_tokens": 1927853.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.229299363057325, |
| "grad_norm": 0.0727447047829628, |
| "learning_rate": 1.1012819118853147e-05, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9697018563747406, |
| "num_tokens": 1933687.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.24203821656051, |
| "grad_norm": 0.06956258416175842, |
| "learning_rate": 1.0636735967658784e-05, |
| "loss": 0.0772, |
| "mean_token_accuracy": 0.9701622724533081, |
| "num_tokens": 1939559.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.254777070063694, |
| "grad_norm": 0.059698961675167084, |
| "learning_rate": 1.0266825480913611e-05, |
| "loss": 0.0777, |
| "mean_token_accuracy": 0.970890462398529, |
| "num_tokens": 1945360.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.267515923566879, |
| "grad_norm": 0.06218119338154793, |
| "learning_rate": 9.903113209758096e-06, |
| "loss": 0.0798, |
| "mean_token_accuracy": 0.9710522294044495, |
| "num_tokens": 1951088.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.280254777070064, |
| "grad_norm": 0.06985397636890411, |
| "learning_rate": 9.545624277198084e-06, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9670553207397461, |
| "num_tokens": 1956950.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.292993630573249, |
| "grad_norm": 0.07117420434951782, |
| "learning_rate": 9.194383376369508e-06, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9684776067733765, |
| "num_tokens": 1962762.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.305732484076433, |
| "grad_norm": 0.06108011677861214, |
| "learning_rate": 8.849414768832687e-06, |
| "loss": 0.0755, |
| "mean_token_accuracy": 0.9709950089454651, |
| "num_tokens": 1968759.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.318471337579618, |
| "grad_norm": 0.06510091572999954, |
| "learning_rate": 8.510742282896544e-06, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.970602422952652, |
| "num_tokens": 1974572.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.3312101910828025, |
| "grad_norm": 0.0644499734044075, |
| "learning_rate": 8.178389311972612e-06, |
| "loss": 0.0778, |
| "mean_token_accuracy": 0.9694929718971252, |
| "num_tokens": 1980407.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.343949044585988, |
| "grad_norm": 0.058488596230745316, |
| "learning_rate": 7.852378812959227e-06, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9711317121982574, |
| "num_tokens": 1986119.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.356687898089172, |
| "grad_norm": 0.05837323144078255, |
| "learning_rate": 7.532733304655848e-06, |
| "loss": 0.0762, |
| "mean_token_accuracy": 0.9707688689231873, |
| "num_tokens": 1992089.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.369426751592357, |
| "grad_norm": 0.059929024428129196, |
| "learning_rate": 7.219474866207465e-06, |
| "loss": 0.0767, |
| "mean_token_accuracy": 0.9722721874713898, |
| "num_tokens": 1998032.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.382165605095541, |
| "grad_norm": 0.05968823283910751, |
| "learning_rate": 6.9126251355795864e-06, |
| "loss": 0.0783, |
| "mean_token_accuracy": 0.9689368605613708, |
| "num_tokens": 2003860.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3949044585987265, |
| "grad_norm": 0.05450170114636421, |
| "learning_rate": 6.612205308063646e-06, |
| "loss": 0.0785, |
| "mean_token_accuracy": 0.9694878160953522, |
| "num_tokens": 2009626.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.407643312101911, |
| "grad_norm": 0.05428183823823929, |
| "learning_rate": 6.318236134812916e-06, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.9704253375530243, |
| "num_tokens": 2015435.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.420382165605096, |
| "grad_norm": 0.05976434424519539, |
| "learning_rate": 6.030737921409169e-06, |
| "loss": 0.0783, |
| "mean_token_accuracy": 0.970320075750351, |
| "num_tokens": 2021227.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.43312101910828, |
| "grad_norm": 0.06043943390250206, |
| "learning_rate": 5.749730526460073e-06, |
| "loss": 0.0749, |
| "mean_token_accuracy": 0.9729211330413818, |
| "num_tokens": 2027234.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.445859872611465, |
| "grad_norm": 0.06649263948202133, |
| "learning_rate": 5.475233360227516e-06, |
| "loss": 0.0756, |
| "mean_token_accuracy": 0.9716574847698212, |
| "num_tokens": 2033228.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.45859872611465, |
| "grad_norm": 0.06697969883680344, |
| "learning_rate": 5.20726538328683e-06, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.9695867598056793, |
| "num_tokens": 2038987.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.471337579617835, |
| "grad_norm": 0.06180531159043312, |
| "learning_rate": 4.945845105217117e-06, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9703608751296997, |
| "num_tokens": 2044820.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.484076433121019, |
| "grad_norm": 0.05783803015947342, |
| "learning_rate": 4.6909905833226966e-06, |
| "loss": 0.0764, |
| "mean_token_accuracy": 0.970343828201294, |
| "num_tokens": 2050785.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.496815286624204, |
| "grad_norm": 0.060383569449186325, |
| "learning_rate": 4.442719421385922e-06, |
| "loss": 0.0775, |
| "mean_token_accuracy": 0.9695878624916077, |
| "num_tokens": 2056669.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.509554140127388, |
| "grad_norm": 0.06414959579706192, |
| "learning_rate": 4.20104876845111e-06, |
| "loss": 0.0766, |
| "mean_token_accuracy": 0.9721693992614746, |
| "num_tokens": 2062624.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.522292993630574, |
| "grad_norm": 0.06533105671405792, |
| "learning_rate": 3.965995317640025e-06, |
| "loss": 0.0799, |
| "mean_token_accuracy": 0.971125453710556, |
| "num_tokens": 2068300.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.535031847133758, |
| "grad_norm": 0.06648838520050049, |
| "learning_rate": 3.7375753049987973e-06, |
| "loss": 0.0806, |
| "mean_token_accuracy": 0.9695271253585815, |
| "num_tokens": 2074009.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.547770700636943, |
| "grad_norm": 0.058792997151613235, |
| "learning_rate": 3.515804508376508e-06, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9697879552841187, |
| "num_tokens": 2079834.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.560509554140127, |
| "grad_norm": 0.06607222557067871, |
| "learning_rate": 3.3006982463352766e-06, |
| "loss": 0.0781, |
| "mean_token_accuracy": 0.9716702103614807, |
| "num_tokens": 2085652.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.573248407643312, |
| "grad_norm": 0.06878670305013657, |
| "learning_rate": 3.092271377092215e-06, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9681178033351898, |
| "num_tokens": 2091301.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.585987261146497, |
| "grad_norm": 0.058448392897844315, |
| "learning_rate": 2.8905382974930172e-06, |
| "loss": 0.0768, |
| "mean_token_accuracy": 0.9709600508213043, |
| "num_tokens": 2097184.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.598726114649682, |
| "grad_norm": 0.06631723046302795, |
| "learning_rate": 2.6955129420176196e-06, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9696679413318634, |
| "num_tokens": 2102888.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.611464968152866, |
| "grad_norm": 0.0600939579308033, |
| "learning_rate": 2.5072087818176382e-06, |
| "loss": 0.079, |
| "mean_token_accuracy": 0.9714162647724152, |
| "num_tokens": 2108623.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.624203821656051, |
| "grad_norm": 0.06584436446428299, |
| "learning_rate": 2.3256388237858807e-06, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9710645079612732, |
| "num_tokens": 2114459.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.6369426751592355, |
| "grad_norm": 0.07528127729892731, |
| "learning_rate": 2.150815609657875e-06, |
| "loss": 0.0784, |
| "mean_token_accuracy": 0.9690390229225159, |
| "num_tokens": 2120272.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.649681528662421, |
| "grad_norm": 0.06594248861074448, |
| "learning_rate": 1.9827512151456173e-06, |
| "loss": 0.0796, |
| "mean_token_accuracy": 0.9691379368305206, |
| "num_tokens": 2126006.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.662420382165605, |
| "grad_norm": 0.06654694676399231, |
| "learning_rate": 1.8214572491034198e-06, |
| "loss": 0.0774, |
| "mean_token_accuracy": 0.9702095985412598, |
| "num_tokens": 2131911.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.67515923566879, |
| "grad_norm": 0.0618974044919014, |
| "learning_rate": 1.66694485272606e-06, |
| "loss": 0.0786, |
| "mean_token_accuracy": 0.9681550562381744, |
| "num_tokens": 2137688.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.687898089171974, |
| "grad_norm": 0.0657062903046608, |
| "learning_rate": 1.5192246987791981e-06, |
| "loss": 0.0802, |
| "mean_token_accuracy": 0.971093088388443, |
| "num_tokens": 2143366.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.7006369426751595, |
| "grad_norm": 0.06324117630720139, |
| "learning_rate": 1.378306990862177e-06, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9696191847324371, |
| "num_tokens": 2149061.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.713375796178344, |
| "grad_norm": 0.0632597953081131, |
| "learning_rate": 1.2442014627032316e-06, |
| "loss": 0.0792, |
| "mean_token_accuracy": 0.9695380628108978, |
| "num_tokens": 2154811.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.726114649681529, |
| "grad_norm": 0.06053202226758003, |
| "learning_rate": 1.1169173774871478e-06, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9680384993553162, |
| "num_tokens": 2160537.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.738853503184713, |
| "grad_norm": 0.0606355220079422, |
| "learning_rate": 9.964635272153633e-07, |
| "loss": 0.0791, |
| "mean_token_accuracy": 0.9689740240573883, |
| "num_tokens": 2166303.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.751592356687898, |
| "grad_norm": 0.06181586533784866, |
| "learning_rate": 8.828482320987319e-07, |
| "loss": 0.0766, |
| "mean_token_accuracy": 0.9720552563667297, |
| "num_tokens": 2172164.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.764331210191083, |
| "grad_norm": 0.05536742880940437, |
| "learning_rate": 7.760793399827937e-07, |
| "loss": 0.0793, |
| "mean_token_accuracy": 0.9690763354301453, |
| "num_tokens": 2177887.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.777070063694268, |
| "grad_norm": 0.06547785550355911, |
| "learning_rate": 6.761642258056978e-07, |
| "loss": 0.0809, |
| "mean_token_accuracy": 0.9702487289905548, |
| "num_tokens": 2183503.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.789808917197452, |
| "grad_norm": 0.05271998047828674, |
| "learning_rate": 5.831097910887873e-07, |
| "loss": 0.0758, |
| "mean_token_accuracy": 0.9729253947734833, |
| "num_tokens": 2189517.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.802547770700637, |
| "grad_norm": 0.06334082037210464, |
| "learning_rate": 4.969224634598591e-07, |
| "loss": 0.0812, |
| "mean_token_accuracy": 0.9676134288311005, |
| "num_tokens": 2195138.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.8152866242038215, |
| "grad_norm": 0.061048589646816254, |
| "learning_rate": 4.176081962092182e-07, |
| "loss": 0.0769, |
| "mean_token_accuracy": 0.9716890752315521, |
| "num_tokens": 2201076.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.828025477707007, |
| "grad_norm": 0.0601130872964859, |
| "learning_rate": 3.451724678784518e-07, |
| "loss": 0.0776, |
| "mean_token_accuracy": 0.9713118970394135, |
| "num_tokens": 2206957.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.840764331210191, |
| "grad_norm": 0.06541354209184647, |
| "learning_rate": 2.7962028188198706e-07, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9702816605567932, |
| "num_tokens": 2212811.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.853503184713376, |
| "grad_norm": 0.0606137290596962, |
| "learning_rate": 2.2095616616150115e-07, |
| "loss": 0.0771, |
| "mean_token_accuracy": 0.9705968499183655, |
| "num_tokens": 2218678.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.86624203821656, |
| "grad_norm": 0.055149566382169724, |
| "learning_rate": 1.6918417287318245e-07, |
| "loss": 0.0758, |
| "mean_token_accuracy": 0.9703577160835266, |
| "num_tokens": 2224646.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8789808917197455, |
| "grad_norm": 0.06124762445688248, |
| "learning_rate": 1.2430787810776555e-07, |
| "loss": 0.078, |
| "mean_token_accuracy": 0.9694724678993225, |
| "num_tokens": 2230443.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.89171974522293, |
| "grad_norm": 0.06068001314997673, |
| "learning_rate": 8.633038164358454e-08, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9697386026382446, |
| "num_tokens": 2236122.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.904458598726115, |
| "grad_norm": 0.062143564224243164, |
| "learning_rate": 5.5254306732444025e-08, |
| "loss": 0.0797, |
| "mean_token_accuracy": 0.9676413536071777, |
| "num_tokens": 2241814.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.917197452229299, |
| "grad_norm": 0.06379738450050354, |
| "learning_rate": 3.1081799918375454e-08, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9711249768733978, |
| "num_tokens": 2247663.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.929936305732484, |
| "grad_norm": 0.0583631657063961, |
| "learning_rate": 1.3814530889433296e-08, |
| "loss": 0.0779, |
| "mean_token_accuracy": 0.9712766408920288, |
| "num_tokens": 2253503.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "grad_norm": 0.06559808552265167, |
| "learning_rate": 3.453692362309635e-09, |
| "loss": 0.0803, |
| "mean_token_accuracy": 0.9672435522079468, |
| "num_tokens": 2259188.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "step": 390, |
| "total_flos": 1.3032179915292672e+17, |
| "train_loss": 0.14372745089423963, |
| "train_runtime": 625.5073, |
| "train_samples_per_second": 39.968, |
| "train_steps_per_second": 0.623 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 390, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.3032179915292672e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|