| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 4.942675159235669, |
| "eval_steps": 500, |
| "global_step": 390, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012738853503184714, |
| "grad_norm": 11.813681602478027, |
| "learning_rate": 0.0, |
| "loss": 3.94, |
| "mean_token_accuracy": 0.4029204398393631, |
| "num_tokens": 11165.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.025477707006369428, |
| "grad_norm": 11.436875343322754, |
| "learning_rate": 1.6666666666666667e-05, |
| "loss": 3.9572, |
| "mean_token_accuracy": 0.39499808847904205, |
| "num_tokens": 22924.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.03821656050955414, |
| "grad_norm": 8.69113540649414, |
| "learning_rate": 3.3333333333333335e-05, |
| "loss": 3.8591, |
| "mean_token_accuracy": 0.3971775621175766, |
| "num_tokens": 34380.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.050955414012738856, |
| "grad_norm": 7.380194187164307, |
| "learning_rate": 5e-05, |
| "loss": 3.4042, |
| "mean_token_accuracy": 0.44493603706359863, |
| "num_tokens": 46499.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06369426751592357, |
| "grad_norm": 8.607468605041504, |
| "learning_rate": 6.666666666666667e-05, |
| "loss": 3.0163, |
| "mean_token_accuracy": 0.49101829528808594, |
| "num_tokens": 58004.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.07643312101910828, |
| "grad_norm": 4.186850547790527, |
| "learning_rate": 8.333333333333334e-05, |
| "loss": 2.5104, |
| "mean_token_accuracy": 0.533274233341217, |
| "num_tokens": 69676.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08917197452229299, |
| "grad_norm": 2.4295248985290527, |
| "learning_rate": 0.0001, |
| "loss": 2.2517, |
| "mean_token_accuracy": 0.598511815071106, |
| "num_tokens": 80510.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10191082802547771, |
| "grad_norm": 1.6423780918121338, |
| "learning_rate": 0.00011666666666666668, |
| "loss": 1.9619, |
| "mean_token_accuracy": 0.6394112706184387, |
| "num_tokens": 92115.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11464968152866242, |
| "grad_norm": 1.0467219352722168, |
| "learning_rate": 0.00013333333333333334, |
| "loss": 1.8255, |
| "mean_token_accuracy": 0.6845534443855286, |
| "num_tokens": 103256.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12738853503184713, |
| "grad_norm": 4.404936790466309, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 1.9248, |
| "mean_token_accuracy": 0.6587593853473663, |
| "num_tokens": 115085.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.14012738853503184, |
| "grad_norm": 6.799125671386719, |
| "learning_rate": 0.0001666666666666667, |
| "loss": 1.9791, |
| "mean_token_accuracy": 0.6513285338878632, |
| "num_tokens": 126597.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.15286624203821655, |
| "grad_norm": 3.4010446071624756, |
| "learning_rate": 0.00018333333333333334, |
| "loss": 1.8728, |
| "mean_token_accuracy": 0.6652757525444031, |
| "num_tokens": 138225.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16560509554140126, |
| "grad_norm": 1.5734035968780518, |
| "learning_rate": 0.0002, |
| "loss": 1.8068, |
| "mean_token_accuracy": 0.6794665157794952, |
| "num_tokens": 149400.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17834394904458598, |
| "grad_norm": 1.5485444068908691, |
| "learning_rate": 0.0001999965463076377, |
| "loss": 1.7928, |
| "mean_token_accuracy": 0.6709170043468475, |
| "num_tokens": 161043.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.1910828025477707, |
| "grad_norm": 0.828037679195404, |
| "learning_rate": 0.00019998618546911056, |
| "loss": 1.6532, |
| "mean_token_accuracy": 0.6922715902328491, |
| "num_tokens": 172432.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20382165605095542, |
| "grad_norm": 0.7009934782981873, |
| "learning_rate": 0.00019996891820008164, |
| "loss": 1.7985, |
| "mean_token_accuracy": 0.6713660657405853, |
| "num_tokens": 184203.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21656050955414013, |
| "grad_norm": 1.1603612899780273, |
| "learning_rate": 0.00019994474569326757, |
| "loss": 1.7606, |
| "mean_token_accuracy": 0.6762242019176483, |
| "num_tokens": 196265.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22929936305732485, |
| "grad_norm": 0.962382435798645, |
| "learning_rate": 0.00019991366961835642, |
| "loss": 1.6288, |
| "mean_token_accuracy": 0.6989059448242188, |
| "num_tokens": 207637.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24203821656050956, |
| "grad_norm": 0.5055384039878845, |
| "learning_rate": 0.00019987569212189224, |
| "loss": 1.7028, |
| "mean_token_accuracy": 0.6899812519550323, |
| "num_tokens": 218753.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25477707006369427, |
| "grad_norm": 0.5950912237167358, |
| "learning_rate": 0.00019983081582712685, |
| "loss": 1.7121, |
| "mean_token_accuracy": 0.6890121698379517, |
| "num_tokens": 230421.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.267515923566879, |
| "grad_norm": 0.6283097267150879, |
| "learning_rate": 0.0001997790438338385, |
| "loss": 1.681, |
| "mean_token_accuracy": 0.6921544969081879, |
| "num_tokens": 241772.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.2802547770700637, |
| "grad_norm": 0.5913220643997192, |
| "learning_rate": 0.00019972037971811802, |
| "loss": 1.6502, |
| "mean_token_accuracy": 0.693426102399826, |
| "num_tokens": 252948.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2929936305732484, |
| "grad_norm": 0.518637478351593, |
| "learning_rate": 0.00019965482753212156, |
| "loss": 1.6008, |
| "mean_token_accuracy": 0.7004429697990417, |
| "num_tokens": 264329.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3057324840764331, |
| "grad_norm": 0.5006614923477173, |
| "learning_rate": 0.0001995823918037908, |
| "loss": 1.6546, |
| "mean_token_accuracy": 0.688925564289093, |
| "num_tokens": 275501.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.3184713375796178, |
| "grad_norm": 0.5350881218910217, |
| "learning_rate": 0.00019950307753654017, |
| "loss": 1.6752, |
| "mean_token_accuracy": 0.6899170279502869, |
| "num_tokens": 286871.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.33121019108280253, |
| "grad_norm": 0.561093270778656, |
| "learning_rate": 0.0001994168902089112, |
| "loss": 1.6996, |
| "mean_token_accuracy": 0.6881346106529236, |
| "num_tokens": 298281.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34394904458598724, |
| "grad_norm": 0.5889561772346497, |
| "learning_rate": 0.00019932383577419432, |
| "loss": 1.622, |
| "mean_token_accuracy": 0.6985092461109161, |
| "num_tokens": 309610.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35668789808917195, |
| "grad_norm": 0.5054478049278259, |
| "learning_rate": 0.00019922392066001722, |
| "loss": 1.527, |
| "mean_token_accuracy": 0.7128090262413025, |
| "num_tokens": 320475.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.36942675159235666, |
| "grad_norm": 0.45505490899086, |
| "learning_rate": 0.0001991171517679013, |
| "loss": 1.6711, |
| "mean_token_accuracy": 0.6802879571914673, |
| "num_tokens": 332574.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.3821656050955414, |
| "grad_norm": 0.4597756564617157, |
| "learning_rate": 0.00019900353647278466, |
| "loss": 1.6465, |
| "mean_token_accuracy": 0.6956342458724976, |
| "num_tokens": 344055.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.39490445859872614, |
| "grad_norm": 0.4669620394706726, |
| "learning_rate": 0.00019888308262251285, |
| "loss": 1.7753, |
| "mean_token_accuracy": 0.6748429834842682, |
| "num_tokens": 356104.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.40764331210191085, |
| "grad_norm": 0.5092836618423462, |
| "learning_rate": 0.00019875579853729676, |
| "loss": 1.6626, |
| "mean_token_accuracy": 0.6885224878787994, |
| "num_tokens": 367582.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.42038216560509556, |
| "grad_norm": 0.5049681067466736, |
| "learning_rate": 0.00019862169300913785, |
| "loss": 1.7015, |
| "mean_token_accuracy": 0.6897156834602356, |
| "num_tokens": 378963.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43312101910828027, |
| "grad_norm": 0.42530742287635803, |
| "learning_rate": 0.00019848077530122083, |
| "loss": 1.6259, |
| "mean_token_accuracy": 0.6956372559070587, |
| "num_tokens": 390443.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.445859872611465, |
| "grad_norm": 0.44630005955696106, |
| "learning_rate": 0.00019833305514727395, |
| "loss": 1.7379, |
| "mean_token_accuracy": 0.6813439428806305, |
| "num_tokens": 402077.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.4585987261146497, |
| "grad_norm": 0.4471743106842041, |
| "learning_rate": 0.0001981785427508966, |
| "loss": 1.6287, |
| "mean_token_accuracy": 0.7024159729480743, |
| "num_tokens": 413215.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.4713375796178344, |
| "grad_norm": 0.4929853081703186, |
| "learning_rate": 0.00019801724878485438, |
| "loss": 1.6782, |
| "mean_token_accuracy": 0.6950995922088623, |
| "num_tokens": 424372.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4840764331210191, |
| "grad_norm": 0.48214471340179443, |
| "learning_rate": 0.00019784918439034216, |
| "loss": 1.6782, |
| "mean_token_accuracy": 0.6879010498523712, |
| "num_tokens": 436262.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4968152866242038, |
| "grad_norm": 0.47833967208862305, |
| "learning_rate": 0.00019767436117621413, |
| "loss": 1.6337, |
| "mean_token_accuracy": 0.6964130401611328, |
| "num_tokens": 447409.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5095541401273885, |
| "grad_norm": 0.4244818389415741, |
| "learning_rate": 0.00019749279121818235, |
| "loss": 1.6183, |
| "mean_token_accuracy": 0.6930707097053528, |
| "num_tokens": 458986.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5222929936305732, |
| "grad_norm": 0.45180127024650574, |
| "learning_rate": 0.00019730448705798239, |
| "loss": 1.5659, |
| "mean_token_accuracy": 0.7079861462116241, |
| "num_tokens": 470110.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.535031847133758, |
| "grad_norm": 0.45527735352516174, |
| "learning_rate": 0.000197109461702507, |
| "loss": 1.6159, |
| "mean_token_accuracy": 0.6991088390350342, |
| "num_tokens": 481475.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5477707006369427, |
| "grad_norm": 0.45764127373695374, |
| "learning_rate": 0.0001969077286229078, |
| "loss": 1.6269, |
| "mean_token_accuracy": 0.6973654329776764, |
| "num_tokens": 492753.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5605095541401274, |
| "grad_norm": 0.4297986328601837, |
| "learning_rate": 0.00019669930175366472, |
| "loss": 1.6279, |
| "mean_token_accuracy": 0.7023066580295563, |
| "num_tokens": 504069.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.5732484076433121, |
| "grad_norm": 0.4261676073074341, |
| "learning_rate": 0.00019648419549162348, |
| "loss": 1.6793, |
| "mean_token_accuracy": 0.6909474432468414, |
| "num_tokens": 515873.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5859872611464968, |
| "grad_norm": 0.41780924797058105, |
| "learning_rate": 0.0001962624246950012, |
| "loss": 1.6673, |
| "mean_token_accuracy": 0.6905270516872406, |
| "num_tokens": 527285.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5987261146496815, |
| "grad_norm": 0.43963462114334106, |
| "learning_rate": 0.00019603400468235998, |
| "loss": 1.6227, |
| "mean_token_accuracy": 0.6965315937995911, |
| "num_tokens": 539008.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6114649681528662, |
| "grad_norm": 0.44278961420059204, |
| "learning_rate": 0.0001957989512315489, |
| "loss": 1.6946, |
| "mean_token_accuracy": 0.6851494014263153, |
| "num_tokens": 550975.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.6242038216560509, |
| "grad_norm": 0.4367414116859436, |
| "learning_rate": 0.0001955572805786141, |
| "loss": 1.551, |
| "mean_token_accuracy": 0.7053904235363007, |
| "num_tokens": 562174.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6369426751592356, |
| "grad_norm": 0.4308222830295563, |
| "learning_rate": 0.0001953090094166773, |
| "loss": 1.6367, |
| "mean_token_accuracy": 0.696260392665863, |
| "num_tokens": 573565.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6496815286624203, |
| "grad_norm": 0.40564271807670593, |
| "learning_rate": 0.0001950541548947829, |
| "loss": 1.5629, |
| "mean_token_accuracy": 0.7077935636043549, |
| "num_tokens": 584655.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6624203821656051, |
| "grad_norm": 0.4230608344078064, |
| "learning_rate": 0.0001947927346167132, |
| "loss": 1.5939, |
| "mean_token_accuracy": 0.7017802894115448, |
| "num_tokens": 595966.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6751592356687898, |
| "grad_norm": 0.4446469843387604, |
| "learning_rate": 0.00019452476663977248, |
| "loss": 1.6521, |
| "mean_token_accuracy": 0.6864060759544373, |
| "num_tokens": 607211.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6878980891719745, |
| "grad_norm": 0.4131290912628174, |
| "learning_rate": 0.00019425026947353992, |
| "loss": 1.5994, |
| "mean_token_accuracy": 0.7033936381340027, |
| "num_tokens": 618727.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.7006369426751592, |
| "grad_norm": 0.4125947058200836, |
| "learning_rate": 0.00019396926207859084, |
| "loss": 1.6097, |
| "mean_token_accuracy": 0.6973809897899628, |
| "num_tokens": 630397.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7133757961783439, |
| "grad_norm": 0.46308353543281555, |
| "learning_rate": 0.0001936817638651871, |
| "loss": 1.5858, |
| "mean_token_accuracy": 0.7046801447868347, |
| "num_tokens": 641671.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7261146496815286, |
| "grad_norm": 0.4365827739238739, |
| "learning_rate": 0.00019338779469193639, |
| "loss": 1.4953, |
| "mean_token_accuracy": 0.716479629278183, |
| "num_tokens": 652634.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7388535031847133, |
| "grad_norm": 0.42811375856399536, |
| "learning_rate": 0.00019308737486442045, |
| "loss": 1.6188, |
| "mean_token_accuracy": 0.689984530210495, |
| "num_tokens": 664179.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7515923566878981, |
| "grad_norm": 0.40652215480804443, |
| "learning_rate": 0.00019278052513379255, |
| "loss": 1.5611, |
| "mean_token_accuracy": 0.7099756896495819, |
| "num_tokens": 675385.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.7643312101910829, |
| "grad_norm": 0.41507890820503235, |
| "learning_rate": 0.00019246726669534415, |
| "loss": 1.5896, |
| "mean_token_accuracy": 0.7004136741161346, |
| "num_tokens": 686817.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7770700636942676, |
| "grad_norm": 0.40362510085105896, |
| "learning_rate": 0.00019214762118704076, |
| "loss": 1.5075, |
| "mean_token_accuracy": 0.713520348072052, |
| "num_tokens": 697815.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7898089171974523, |
| "grad_norm": 0.4158618748188019, |
| "learning_rate": 0.00019182161068802741, |
| "loss": 1.6064, |
| "mean_token_accuracy": 0.6974228620529175, |
| "num_tokens": 709534.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.802547770700637, |
| "grad_norm": 0.41324788331985474, |
| "learning_rate": 0.00019148925771710347, |
| "loss": 1.5955, |
| "mean_token_accuracy": 0.7052092254161835, |
| "num_tokens": 720860.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.8152866242038217, |
| "grad_norm": 0.41219326853752136, |
| "learning_rate": 0.00019115058523116733, |
| "loss": 1.5635, |
| "mean_token_accuracy": 0.7040189802646637, |
| "num_tokens": 732087.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8280254777070064, |
| "grad_norm": 0.4263417422771454, |
| "learning_rate": 0.0001908056166236305, |
| "loss": 1.5978, |
| "mean_token_accuracy": 0.6994457244873047, |
| "num_tokens": 743945.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8407643312101911, |
| "grad_norm": 0.4283595681190491, |
| "learning_rate": 0.00019045437572280194, |
| "loss": 1.5801, |
| "mean_token_accuracy": 0.7037738561630249, |
| "num_tokens": 755005.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8535031847133758, |
| "grad_norm": 0.4312443733215332, |
| "learning_rate": 0.0001900968867902419, |
| "loss": 1.5562, |
| "mean_token_accuracy": 0.7055492401123047, |
| "num_tokens": 766318.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8662420382165605, |
| "grad_norm": 0.4288251996040344, |
| "learning_rate": 0.00018973317451908642, |
| "loss": 1.5927, |
| "mean_token_accuracy": 0.7025676369667053, |
| "num_tokens": 777726.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8789808917197452, |
| "grad_norm": 0.4510301351547241, |
| "learning_rate": 0.00018936326403234125, |
| "loss": 1.5942, |
| "mean_token_accuracy": 0.7038309276103973, |
| "num_tokens": 788880.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.89171974522293, |
| "grad_norm": 0.4167572259902954, |
| "learning_rate": 0.0001889871808811469, |
| "loss": 1.592, |
| "mean_token_accuracy": 0.7017644345760345, |
| "num_tokens": 800546.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.9044585987261147, |
| "grad_norm": 0.42589858174324036, |
| "learning_rate": 0.00018860495104301345, |
| "loss": 1.5814, |
| "mean_token_accuracy": 0.7006197869777679, |
| "num_tokens": 812189.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9171974522292994, |
| "grad_norm": 0.42139700055122375, |
| "learning_rate": 0.00018821660092002641, |
| "loss": 1.6197, |
| "mean_token_accuracy": 0.6927924752235413, |
| "num_tokens": 823885.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9299363057324841, |
| "grad_norm": 0.418831467628479, |
| "learning_rate": 0.00018782215733702286, |
| "loss": 1.5616, |
| "mean_token_accuracy": 0.7053604423999786, |
| "num_tokens": 835303.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9426751592356688, |
| "grad_norm": 0.435104638338089, |
| "learning_rate": 0.00018742164753973855, |
| "loss": 1.5585, |
| "mean_token_accuracy": 0.7019418776035309, |
| "num_tokens": 847069.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9554140127388535, |
| "grad_norm": 0.42202192544937134, |
| "learning_rate": 0.00018701509919292613, |
| "loss": 1.5072, |
| "mean_token_accuracy": 0.7141622602939606, |
| "num_tokens": 858488.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9681528662420382, |
| "grad_norm": 0.4217613637447357, |
| "learning_rate": 0.00018660254037844388, |
| "loss": 1.5131, |
| "mean_token_accuracy": 0.7161562740802765, |
| "num_tokens": 869684.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9808917197452229, |
| "grad_norm": 0.43704110383987427, |
| "learning_rate": 0.0001861839995933164, |
| "loss": 1.5529, |
| "mean_token_accuracy": 0.7069125473499298, |
| "num_tokens": 880729.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9936305732484076, |
| "grad_norm": 0.44259169697761536, |
| "learning_rate": 0.00018575950574776595, |
| "loss": 1.5311, |
| "mean_token_accuracy": 0.7101023495197296, |
| "num_tokens": 891695.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.44259169697761536, |
| "learning_rate": 0.00018532908816321558, |
| "loss": 1.506, |
| "mean_token_accuracy": 0.7240927815437317, |
| "num_tokens": 897073.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0127388535031847, |
| "grad_norm": 0.6884306073188782, |
| "learning_rate": 0.00018489277657026375, |
| "loss": 1.3726, |
| "mean_token_accuracy": 0.7358191311359406, |
| "num_tokens": 908448.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0254777070063694, |
| "grad_norm": 0.4427263140678406, |
| "learning_rate": 0.0001844506011066308, |
| "loss": 1.2944, |
| "mean_token_accuracy": 0.7461474239826202, |
| "num_tokens": 919804.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0382165605095541, |
| "grad_norm": 0.3917786478996277, |
| "learning_rate": 0.00018400259231507717, |
| "loss": 1.3354, |
| "mean_token_accuracy": 0.7390774190425873, |
| "num_tokens": 931397.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0509554140127388, |
| "grad_norm": 0.48394888639450073, |
| "learning_rate": 0.00018354878114129367, |
| "loss": 1.4038, |
| "mean_token_accuracy": 0.7281314134597778, |
| "num_tokens": 942878.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0636942675159236, |
| "grad_norm": 0.6187575459480286, |
| "learning_rate": 0.00018308919893176396, |
| "loss": 1.4045, |
| "mean_token_accuracy": 0.7341133952140808, |
| "num_tokens": 954219.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0764331210191083, |
| "grad_norm": 0.4466276466846466, |
| "learning_rate": 0.0001826238774315995, |
| "loss": 1.2732, |
| "mean_token_accuracy": 0.7496218085289001, |
| "num_tokens": 965410.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.089171974522293, |
| "grad_norm": 0.4243098497390747, |
| "learning_rate": 0.00018215284878234642, |
| "loss": 1.2839, |
| "mean_token_accuracy": 0.7502768039703369, |
| "num_tokens": 976694.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1019108280254777, |
| "grad_norm": 0.4365736246109009, |
| "learning_rate": 0.00018167614551976567, |
| "loss": 1.3802, |
| "mean_token_accuracy": 0.728840172290802, |
| "num_tokens": 988106.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1146496815286624, |
| "grad_norm": 0.451364129781723, |
| "learning_rate": 0.00018119380057158568, |
| "loss": 1.4286, |
| "mean_token_accuracy": 0.7288292944431305, |
| "num_tokens": 999816.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.127388535031847, |
| "grad_norm": 0.4656635820865631, |
| "learning_rate": 0.00018070584725522762, |
| "loss": 1.2778, |
| "mean_token_accuracy": 0.7491357028484344, |
| "num_tokens": 1011401.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.1401273885350318, |
| "grad_norm": 0.4802230894565582, |
| "learning_rate": 0.0001802123192755044, |
| "loss": 1.3656, |
| "mean_token_accuracy": 0.7348462045192719, |
| "num_tokens": 1022628.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1528662420382165, |
| "grad_norm": 0.5307201743125916, |
| "learning_rate": 0.00017971325072229226, |
| "loss": 1.3325, |
| "mean_token_accuracy": 0.741118997335434, |
| "num_tokens": 1034112.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1656050955414012, |
| "grad_norm": 0.47191011905670166, |
| "learning_rate": 0.00017920867606817625, |
| "loss": 1.301, |
| "mean_token_accuracy": 0.743480771780014, |
| "num_tokens": 1045699.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.178343949044586, |
| "grad_norm": 0.5502749681472778, |
| "learning_rate": 0.0001786986301660689, |
| "loss": 1.2598, |
| "mean_token_accuracy": 0.7520148754119873, |
| "num_tokens": 1057016.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.1910828025477707, |
| "grad_norm": 0.515625536441803, |
| "learning_rate": 0.000178183148246803, |
| "loss": 1.328, |
| "mean_token_accuracy": 0.7424952387809753, |
| "num_tokens": 1068767.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2038216560509554, |
| "grad_norm": 0.48685798048973083, |
| "learning_rate": 0.00017766226591669785, |
| "loss": 1.2899, |
| "mean_token_accuracy": 0.7441545128822327, |
| "num_tokens": 1080338.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.21656050955414, |
| "grad_norm": 0.47837910056114197, |
| "learning_rate": 0.0001771360191551, |
| "loss": 1.2724, |
| "mean_token_accuracy": 0.7527591586112976, |
| "num_tokens": 1091596.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2292993630573248, |
| "grad_norm": 0.48874425888061523, |
| "learning_rate": 0.0001766044443118978, |
| "loss": 1.3635, |
| "mean_token_accuracy": 0.739961713552475, |
| "num_tokens": 1103173.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.2420382165605095, |
| "grad_norm": 0.5247374773025513, |
| "learning_rate": 0.00017606757810501088, |
| "loss": 1.3395, |
| "mean_token_accuracy": 0.741957426071167, |
| "num_tokens": 1114890.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2547770700636942, |
| "grad_norm": 0.5832791328430176, |
| "learning_rate": 0.0001755254576178535, |
| "loss": 1.2544, |
| "mean_token_accuracy": 0.7478911578655243, |
| "num_tokens": 1126503.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.267515923566879, |
| "grad_norm": 0.5302836894989014, |
| "learning_rate": 0.00017497812029677344, |
| "loss": 1.3321, |
| "mean_token_accuracy": 0.7417987883090973, |
| "num_tokens": 1138075.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2802547770700636, |
| "grad_norm": 0.5336406230926514, |
| "learning_rate": 0.00017442560394846516, |
| "loss": 1.3289, |
| "mean_token_accuracy": 0.7394116818904877, |
| "num_tokens": 1149604.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2929936305732483, |
| "grad_norm": 0.5343959331512451, |
| "learning_rate": 0.0001738679467373586, |
| "loss": 1.3892, |
| "mean_token_accuracy": 0.7278424799442291, |
| "num_tokens": 1161198.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.305732484076433, |
| "grad_norm": 0.48724669218063354, |
| "learning_rate": 0.00017330518718298264, |
| "loss": 1.3693, |
| "mean_token_accuracy": 0.7348725199699402, |
| "num_tokens": 1172445.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3184713375796178, |
| "grad_norm": 0.49938809871673584, |
| "learning_rate": 0.00017273736415730488, |
| "loss": 1.1558, |
| "mean_token_accuracy": 0.7661762535572052, |
| "num_tokens": 1183328.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3312101910828025, |
| "grad_norm": 0.5202611088752747, |
| "learning_rate": 0.0001721645168820462, |
| "loss": 1.3089, |
| "mean_token_accuracy": 0.7464346587657928, |
| "num_tokens": 1194762.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3439490445859872, |
| "grad_norm": 0.4691845178604126, |
| "learning_rate": 0.00017158668492597186, |
| "loss": 1.2651, |
| "mean_token_accuracy": 0.7560595870018005, |
| "num_tokens": 1206185.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.356687898089172, |
| "grad_norm": 0.5898153781890869, |
| "learning_rate": 0.00017100390820215804, |
| "loss": 1.3352, |
| "mean_token_accuracy": 0.7421607077121735, |
| "num_tokens": 1217884.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3694267515923566, |
| "grad_norm": 0.5989345908164978, |
| "learning_rate": 0.00017041622696523518, |
| "loss": 1.293, |
| "mean_token_accuracy": 0.7427842319011688, |
| "num_tokens": 1229627.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.3821656050955413, |
| "grad_norm": 0.5459556579589844, |
| "learning_rate": 0.00016982368180860728, |
| "loss": 1.2699, |
| "mean_token_accuracy": 0.7539608180522919, |
| "num_tokens": 1240446.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.394904458598726, |
| "grad_norm": 0.5110013484954834, |
| "learning_rate": 0.00016922631366164797, |
| "loss": 1.2265, |
| "mean_token_accuracy": 0.7581751644611359, |
| "num_tokens": 1251736.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4076433121019107, |
| "grad_norm": 0.5149105191230774, |
| "learning_rate": 0.0001686241637868734, |
| "loss": 1.2914, |
| "mean_token_accuracy": 0.7475982308387756, |
| "num_tokens": 1263064.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4203821656050954, |
| "grad_norm": 0.5403231382369995, |
| "learning_rate": 0.00016801727377709194, |
| "loss": 1.3544, |
| "mean_token_accuracy": 0.7387182414531708, |
| "num_tokens": 1274626.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4331210191082802, |
| "grad_norm": 0.5374177694320679, |
| "learning_rate": 0.00016740568555253155, |
| "loss": 1.3812, |
| "mean_token_accuracy": 0.7330702245235443, |
| "num_tokens": 1286160.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4458598726114649, |
| "grad_norm": 0.5692515969276428, |
| "learning_rate": 0.00016678944135794374, |
| "loss": 1.2552, |
| "mean_token_accuracy": 0.7510959506034851, |
| "num_tokens": 1297753.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4585987261146496, |
| "grad_norm": 0.5811614394187927, |
| "learning_rate": 0.00016616858375968595, |
| "loss": 1.3151, |
| "mean_token_accuracy": 0.7445010244846344, |
| "num_tokens": 1309224.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4713375796178343, |
| "grad_norm": 0.5055227875709534, |
| "learning_rate": 0.000165543155642781, |
| "loss": 1.2941, |
| "mean_token_accuracy": 0.7431842684745789, |
| "num_tokens": 1320675.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.484076433121019, |
| "grad_norm": 0.5303871631622314, |
| "learning_rate": 0.0001649132002079552, |
| "loss": 1.2285, |
| "mean_token_accuracy": 0.7622977197170258, |
| "num_tokens": 1332170.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4968152866242037, |
| "grad_norm": 0.5374083518981934, |
| "learning_rate": 0.00016427876096865394, |
| "loss": 1.3428, |
| "mean_token_accuracy": 0.737566739320755, |
| "num_tokens": 1343771.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5095541401273884, |
| "grad_norm": 0.5214208960533142, |
| "learning_rate": 0.00016363988174803638, |
| "loss": 1.3385, |
| "mean_token_accuracy": 0.7379772365093231, |
| "num_tokens": 1355513.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.5222929936305731, |
| "grad_norm": 0.5397446155548096, |
| "learning_rate": 0.00016299660667594814, |
| "loss": 1.3607, |
| "mean_token_accuracy": 0.7355678081512451, |
| "num_tokens": 1367049.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5350318471337578, |
| "grad_norm": 0.5425443053245544, |
| "learning_rate": 0.00016234898018587337, |
| "loss": 1.2629, |
| "mean_token_accuracy": 0.7543594241142273, |
| "num_tokens": 1378847.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5477707006369426, |
| "grad_norm": 0.5520007014274597, |
| "learning_rate": 0.00016169704701186527, |
| "loss": 1.2724, |
| "mean_token_accuracy": 0.7532472312450409, |
| "num_tokens": 1389763.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5605095541401273, |
| "grad_norm": 0.5824275612831116, |
| "learning_rate": 0.00016104085218545633, |
| "loss": 1.2198, |
| "mean_token_accuracy": 0.7577201426029205, |
| "num_tokens": 1401158.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.573248407643312, |
| "grad_norm": 0.5876901745796204, |
| "learning_rate": 0.00016038044103254775, |
| "loss": 1.2408, |
| "mean_token_accuracy": 0.7587076425552368, |
| "num_tokens": 1412660.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5859872611464967, |
| "grad_norm": 0.5918715000152588, |
| "learning_rate": 0.00015971585917027862, |
| "loss": 1.2162, |
| "mean_token_accuracy": 0.7641243636608124, |
| "num_tokens": 1424264.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5987261146496814, |
| "grad_norm": 0.5823501348495483, |
| "learning_rate": 0.00015904715250387498, |
| "loss": 1.3385, |
| "mean_token_accuracy": 0.7427915334701538, |
| "num_tokens": 1435491.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.611464968152866, |
| "grad_norm": 0.5465337634086609, |
| "learning_rate": 0.000158374367223479, |
| "loss": 1.2536, |
| "mean_token_accuracy": 0.75311678647995, |
| "num_tokens": 1446732.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.6242038216560508, |
| "grad_norm": 0.5304354429244995, |
| "learning_rate": 0.0001576975498009583, |
| "loss": 1.3174, |
| "mean_token_accuracy": 0.7409499287605286, |
| "num_tokens": 1458906.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6369426751592355, |
| "grad_norm": 0.5691857933998108, |
| "learning_rate": 0.0001570167469866962, |
| "loss": 1.198, |
| "mean_token_accuracy": 0.762933760881424, |
| "num_tokens": 1469994.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6496815286624202, |
| "grad_norm": 0.5394584536552429, |
| "learning_rate": 0.0001563320058063622, |
| "loss": 1.1342, |
| "mean_token_accuracy": 0.7737719714641571, |
| "num_tokens": 1480937.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.662420382165605, |
| "grad_norm": 0.5896454453468323, |
| "learning_rate": 0.00015564337355766412, |
| "loss": 1.2746, |
| "mean_token_accuracy": 0.7510493695735931, |
| "num_tokens": 1492634.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6751592356687897, |
| "grad_norm": 0.7059821486473083, |
| "learning_rate": 0.0001549508978070806, |
| "loss": 1.2601, |
| "mean_token_accuracy": 0.7549479901790619, |
| "num_tokens": 1503864.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6878980891719744, |
| "grad_norm": 0.6112148761749268, |
| "learning_rate": 0.00015425462638657595, |
| "loss": 1.2219, |
| "mean_token_accuracy": 0.7629634737968445, |
| "num_tokens": 1515227.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.700636942675159, |
| "grad_norm": 0.5340291857719421, |
| "learning_rate": 0.00015355460739029586, |
| "loss": 1.2629, |
| "mean_token_accuracy": 0.7527756989002228, |
| "num_tokens": 1526325.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7133757961783438, |
| "grad_norm": 0.5573921799659729, |
| "learning_rate": 0.00015285088917124556, |
| "loss": 1.2283, |
| "mean_token_accuracy": 0.7557610273361206, |
| "num_tokens": 1538100.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.7261146496815285, |
| "grad_norm": 0.5598011016845703, |
| "learning_rate": 0.0001521435203379498, |
| "loss": 1.2319, |
| "mean_token_accuracy": 0.7586540579795837, |
| "num_tokens": 1549283.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7388535031847132, |
| "grad_norm": 0.5623608827590942, |
| "learning_rate": 0.00015143254975109538, |
| "loss": 1.244, |
| "mean_token_accuracy": 0.7514355182647705, |
| "num_tokens": 1560870.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7515923566878981, |
| "grad_norm": 0.6442559361457825, |
| "learning_rate": 0.0001507180265201559, |
| "loss": 1.2266, |
| "mean_token_accuracy": 0.7599224150180817, |
| "num_tokens": 1572135.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.7643312101910829, |
| "grad_norm": 0.6532415151596069, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 1.2325, |
| "mean_token_accuracy": 0.7574326395988464, |
| "num_tokens": 1583354.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7770700636942676, |
| "grad_norm": 0.5669077634811401, |
| "learning_rate": 0.00014927851978748178, |
| "loss": 1.1529, |
| "mean_token_accuracy": 0.7701173722743988, |
| "num_tokens": 1594573.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7898089171974523, |
| "grad_norm": 0.5915366411209106, |
| "learning_rate": 0.00014855363571801523, |
| "loss": 1.2294, |
| "mean_token_accuracy": 0.7594274282455444, |
| "num_tokens": 1606088.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.802547770700637, |
| "grad_norm": 0.5871595144271851, |
| "learning_rate": 0.00014782539786213183, |
| "loss": 1.2237, |
| "mean_token_accuracy": 0.7613213658332825, |
| "num_tokens": 1617494.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.8152866242038217, |
| "grad_norm": 0.6008813977241516, |
| "learning_rate": 0.00014709385652202203, |
| "loss": 1.2681, |
| "mean_token_accuracy": 0.7480663061141968, |
| "num_tokens": 1629090.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8280254777070064, |
| "grad_norm": 0.5864359736442566, |
| "learning_rate": 0.00014635906222806058, |
| "loss": 1.3931, |
| "mean_token_accuracy": 0.7308617830276489, |
| "num_tokens": 1641022.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8407643312101911, |
| "grad_norm": 0.5753868818283081, |
| "learning_rate": 0.0001456210657353163, |
| "loss": 1.2897, |
| "mean_token_accuracy": 0.7492571473121643, |
| "num_tokens": 1652480.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8535031847133758, |
| "grad_norm": 0.56278395652771, |
| "learning_rate": 0.00014487991802004623, |
| "loss": 1.3571, |
| "mean_token_accuracy": 0.7386749386787415, |
| "num_tokens": 1664089.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8662420382165605, |
| "grad_norm": 0.5604442954063416, |
| "learning_rate": 0.0001441356702761744, |
| "loss": 1.2514, |
| "mean_token_accuracy": 0.7553944289684296, |
| "num_tokens": 1675743.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8789808917197452, |
| "grad_norm": 0.5632363557815552, |
| "learning_rate": 0.00014338837391175582, |
| "loss": 1.2507, |
| "mean_token_accuracy": 0.7600274682044983, |
| "num_tokens": 1686909.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.89171974522293, |
| "grad_norm": 0.5791776180267334, |
| "learning_rate": 0.0001426380805454254, |
| "loss": 1.2104, |
| "mean_token_accuracy": 0.7640622556209564, |
| "num_tokens": 1698422.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.9044585987261147, |
| "grad_norm": 0.6530908346176147, |
| "learning_rate": 0.0001418848420028325, |
| "loss": 1.2076, |
| "mean_token_accuracy": 0.7604132890701294, |
| "num_tokens": 1709941.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9171974522292994, |
| "grad_norm": 0.6085801720619202, |
| "learning_rate": 0.00014112871031306119, |
| "loss": 1.1941, |
| "mean_token_accuracy": 0.7641676366329193, |
| "num_tokens": 1721542.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.929936305732484, |
| "grad_norm": 0.5950492024421692, |
| "learning_rate": 0.00014036973770503624, |
| "loss": 1.1556, |
| "mean_token_accuracy": 0.7747359573841095, |
| "num_tokens": 1732791.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9426751592356688, |
| "grad_norm": 0.6125719547271729, |
| "learning_rate": 0.0001396079766039157, |
| "loss": 1.213, |
| "mean_token_accuracy": 0.7590784430503845, |
| "num_tokens": 1743896.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9554140127388535, |
| "grad_norm": 0.6058174967765808, |
| "learning_rate": 0.00013884347962746948, |
| "loss": 1.2966, |
| "mean_token_accuracy": 0.7463319599628448, |
| "num_tokens": 1755279.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9681528662420382, |
| "grad_norm": 0.6496732234954834, |
| "learning_rate": 0.00013807629958244498, |
| "loss": 1.2688, |
| "mean_token_accuracy": 0.7533035576343536, |
| "num_tokens": 1766674.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.980891719745223, |
| "grad_norm": 0.6245201230049133, |
| "learning_rate": 0.0001373064894609194, |
| "loss": 1.1952, |
| "mean_token_accuracy": 0.7725894451141357, |
| "num_tokens": 1777748.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9936305732484076, |
| "grad_norm": 0.5686454176902771, |
| "learning_rate": 0.00013653410243663952, |
| "loss": 1.1892, |
| "mean_token_accuracy": 0.7666130363941193, |
| "num_tokens": 1788830.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.8678678870201111, |
| "learning_rate": 0.0001357591918613486, |
| "loss": 0.9977, |
| "mean_token_accuracy": 0.7947548627853394, |
| "num_tokens": 1794124.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0127388535031847, |
| "grad_norm": 0.6076314449310303, |
| "learning_rate": 0.0001349818112611015, |
| "loss": 0.8866, |
| "mean_token_accuracy": 0.8160363137722015, |
| "num_tokens": 1805636.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0254777070063694, |
| "grad_norm": 1.3786406517028809, |
| "learning_rate": 0.00013420201433256689, |
| "loss": 0.9392, |
| "mean_token_accuracy": 0.8041114211082458, |
| "num_tokens": 1817299.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.038216560509554, |
| "grad_norm": 0.7676010131835938, |
| "learning_rate": 0.00013341985493931877, |
| "loss": 0.8758, |
| "mean_token_accuracy": 0.8184058368206024, |
| "num_tokens": 1828936.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050955414012739, |
| "grad_norm": 0.6482889652252197, |
| "learning_rate": 0.0001326353871081156, |
| "loss": 0.8553, |
| "mean_token_accuracy": 0.8191647529602051, |
| "num_tokens": 1840132.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0636942675159236, |
| "grad_norm": 0.663348913192749, |
| "learning_rate": 0.00013184866502516845, |
| "loss": 0.8636, |
| "mean_token_accuracy": 0.8212078213691711, |
| "num_tokens": 1851489.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0764331210191083, |
| "grad_norm": 0.6632069945335388, |
| "learning_rate": 0.00013105974303239838, |
| "loss": 0.8268, |
| "mean_token_accuracy": 0.8321124613285065, |
| "num_tokens": 1862876.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.089171974522293, |
| "grad_norm": 0.7184637784957886, |
| "learning_rate": 0.0001302686756236826, |
| "loss": 0.7524, |
| "mean_token_accuracy": 0.8431011736392975, |
| "num_tokens": 1874177.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1019108280254777, |
| "grad_norm": 0.7237757444381714, |
| "learning_rate": 0.00012947551744109043, |
| "loss": 0.8445, |
| "mean_token_accuracy": 0.8258463144302368, |
| "num_tokens": 1885524.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1146496815286624, |
| "grad_norm": 0.7234023809432983, |
| "learning_rate": 0.00012868032327110904, |
| "loss": 0.8428, |
| "mean_token_accuracy": 0.8247216641902924, |
| "num_tokens": 1897169.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.127388535031847, |
| "grad_norm": 0.635473906993866, |
| "learning_rate": 0.00012788314804085903, |
| "loss": 0.7116, |
| "mean_token_accuracy": 0.8497787714004517, |
| "num_tokens": 1908703.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.140127388535032, |
| "grad_norm": 0.7157398462295532, |
| "learning_rate": 0.00012708404681430053, |
| "loss": 0.8842, |
| "mean_token_accuracy": 0.819458395242691, |
| "num_tokens": 1919695.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.1528662420382165, |
| "grad_norm": 0.6592625379562378, |
| "learning_rate": 0.00012628307478842953, |
| "loss": 0.8329, |
| "mean_token_accuracy": 0.8234336376190186, |
| "num_tokens": 1930961.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1656050955414012, |
| "grad_norm": 0.6916066408157349, |
| "learning_rate": 0.0001254802872894655, |
| "loss": 0.8455, |
| "mean_token_accuracy": 0.8254802227020264, |
| "num_tokens": 1942462.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.178343949044586, |
| "grad_norm": 0.6964818239212036, |
| "learning_rate": 0.00012467573976902935, |
| "loss": 0.7841, |
| "mean_token_accuracy": 0.8403615355491638, |
| "num_tokens": 1953848.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.1910828025477707, |
| "grad_norm": 0.7194589972496033, |
| "learning_rate": 0.0001238694878003138, |
| "loss": 0.8526, |
| "mean_token_accuracy": 0.8252715766429901, |
| "num_tokens": 1965634.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2038216560509554, |
| "grad_norm": 0.701948344707489, |
| "learning_rate": 0.00012306158707424403, |
| "loss": 0.8153, |
| "mean_token_accuracy": 0.8318383991718292, |
| "num_tokens": 1977633.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.21656050955414, |
| "grad_norm": 0.7072458267211914, |
| "learning_rate": 0.00012225209339563145, |
| "loss": 0.8634, |
| "mean_token_accuracy": 0.8203523755073547, |
| "num_tokens": 1989375.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.229299363057325, |
| "grad_norm": 0.6985357999801636, |
| "learning_rate": 0.00012144106267931876, |
| "loss": 0.7991, |
| "mean_token_accuracy": 0.8354414403438568, |
| "num_tokens": 2000350.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.2420382165605095, |
| "grad_norm": 0.6818456649780273, |
| "learning_rate": 0.00012062855094631778, |
| "loss": 0.7757, |
| "mean_token_accuracy": 0.8414984047412872, |
| "num_tokens": 2011821.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.254777070063694, |
| "grad_norm": 0.7199962139129639, |
| "learning_rate": 0.00011981461431993977, |
| "loss": 0.8509, |
| "mean_token_accuracy": 0.822184681892395, |
| "num_tokens": 2023398.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.267515923566879, |
| "grad_norm": 0.7146344184875488, |
| "learning_rate": 0.00011899930902191902, |
| "loss": 0.8617, |
| "mean_token_accuracy": 0.8206455111503601, |
| "num_tokens": 2035102.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.2802547770700636, |
| "grad_norm": 0.6928791999816895, |
| "learning_rate": 0.00011818269136852909, |
| "loss": 0.8588, |
| "mean_token_accuracy": 0.8235190808773041, |
| "num_tokens": 2046897.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.2929936305732483, |
| "grad_norm": 0.6946797370910645, |
| "learning_rate": 0.00011736481776669306, |
| "loss": 0.7613, |
| "mean_token_accuracy": 0.8419605195522308, |
| "num_tokens": 2057980.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.305732484076433, |
| "grad_norm": 0.6941947937011719, |
| "learning_rate": 0.00011654574471008713, |
| "loss": 0.8329, |
| "mean_token_accuracy": 0.8272019922733307, |
| "num_tokens": 2069683.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3184713375796178, |
| "grad_norm": 0.721640408039093, |
| "learning_rate": 0.00011572552877523854, |
| "loss": 0.8323, |
| "mean_token_accuracy": 0.8270902931690216, |
| "num_tokens": 2081025.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.3312101910828025, |
| "grad_norm": 0.7347063422203064, |
| "learning_rate": 0.00011490422661761744, |
| "loss": 0.7598, |
| "mean_token_accuracy": 0.8433621525764465, |
| "num_tokens": 2092607.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.343949044585987, |
| "grad_norm": 0.7077701687812805, |
| "learning_rate": 0.00011408189496772368, |
| "loss": 0.7193, |
| "mean_token_accuracy": 0.8508957028388977, |
| "num_tokens": 2103628.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.356687898089172, |
| "grad_norm": 0.7507743239402771, |
| "learning_rate": 0.00011325859062716795, |
| "loss": 0.8103, |
| "mean_token_accuracy": 0.833824634552002, |
| "num_tokens": 2114651.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.3694267515923566, |
| "grad_norm": 0.7624699473381042, |
| "learning_rate": 0.00011243437046474853, |
| "loss": 0.8807, |
| "mean_token_accuracy": 0.8172626495361328, |
| "num_tokens": 2126430.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.3821656050955413, |
| "grad_norm": 0.6758994460105896, |
| "learning_rate": 0.00011160929141252303, |
| "loss": 0.7942, |
| "mean_token_accuracy": 0.8366638422012329, |
| "num_tokens": 2137274.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.394904458598726, |
| "grad_norm": 0.7404898405075073, |
| "learning_rate": 0.00011078341046187589, |
| "loss": 0.8795, |
| "mean_token_accuracy": 0.8165739476680756, |
| "num_tokens": 2148697.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4076433121019107, |
| "grad_norm": 0.7106494307518005, |
| "learning_rate": 0.00010995678465958168, |
| "loss": 0.8499, |
| "mean_token_accuracy": 0.8253895044326782, |
| "num_tokens": 2160613.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4203821656050954, |
| "grad_norm": 0.7398989796638489, |
| "learning_rate": 0.00010912947110386484, |
| "loss": 0.8027, |
| "mean_token_accuracy": 0.8303463160991669, |
| "num_tokens": 2172303.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.43312101910828, |
| "grad_norm": 0.6920222043991089, |
| "learning_rate": 0.00010830152694045552, |
| "loss": 0.7958, |
| "mean_token_accuracy": 0.8368369340896606, |
| "num_tokens": 2183712.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.445859872611465, |
| "grad_norm": 0.812565267086029, |
| "learning_rate": 0.00010747300935864243, |
| "loss": 0.8227, |
| "mean_token_accuracy": 0.8306939899921417, |
| "num_tokens": 2195201.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4585987261146496, |
| "grad_norm": 0.7273798584938049, |
| "learning_rate": 0.00010664397558732244, |
| "loss": 0.7187, |
| "mean_token_accuracy": 0.8475557863712311, |
| "num_tokens": 2206348.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4713375796178343, |
| "grad_norm": 0.7569606900215149, |
| "learning_rate": 0.00010581448289104758, |
| "loss": 0.883, |
| "mean_token_accuracy": 0.8176349401473999, |
| "num_tokens": 2218307.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.484076433121019, |
| "grad_norm": 0.6757321357727051, |
| "learning_rate": 0.00010498458856606972, |
| "loss": 0.7564, |
| "mean_token_accuracy": 0.8416674435138702, |
| "num_tokens": 2229766.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4968152866242037, |
| "grad_norm": 0.6368763446807861, |
| "learning_rate": 0.00010415434993638269, |
| "loss": 0.7013, |
| "mean_token_accuracy": 0.8532832860946655, |
| "num_tokens": 2240599.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5095541401273884, |
| "grad_norm": 0.6708154678344727, |
| "learning_rate": 0.00010332382434976266, |
| "loss": 0.7171, |
| "mean_token_accuracy": 0.852762907743454, |
| "num_tokens": 2252398.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.522292993630573, |
| "grad_norm": 0.7212777137756348, |
| "learning_rate": 0.0001024930691738073, |
| "loss": 0.7675, |
| "mean_token_accuracy": 0.8409071266651154, |
| "num_tokens": 2264039.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.535031847133758, |
| "grad_norm": 0.7390912175178528, |
| "learning_rate": 0.00010166214179197264, |
| "loss": 0.7952, |
| "mean_token_accuracy": 0.835366427898407, |
| "num_tokens": 2275605.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5477707006369426, |
| "grad_norm": 0.8875515460968018, |
| "learning_rate": 0.00010083109959960973, |
| "loss": 0.8717, |
| "mean_token_accuracy": 0.8222933113574982, |
| "num_tokens": 2287149.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5605095541401273, |
| "grad_norm": 0.7605893015861511, |
| "learning_rate": 0.0001, |
| "loss": 0.7994, |
| "mean_token_accuracy": 0.8412551879882812, |
| "num_tokens": 2298149.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.573248407643312, |
| "grad_norm": 0.682758629322052, |
| "learning_rate": 9.916890040039031e-05, |
| "loss": 0.8199, |
| "mean_token_accuracy": 0.831801027059555, |
| "num_tokens": 2309730.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5859872611464967, |
| "grad_norm": 0.6830790042877197, |
| "learning_rate": 9.833785820802739e-05, |
| "loss": 0.7099, |
| "mean_token_accuracy": 0.8521651327610016, |
| "num_tokens": 2320654.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5987261146496814, |
| "grad_norm": 0.694215714931488, |
| "learning_rate": 9.750693082619273e-05, |
| "loss": 0.7562, |
| "mean_token_accuracy": 0.8445379734039307, |
| "num_tokens": 2332220.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.611464968152866, |
| "grad_norm": 0.7123032808303833, |
| "learning_rate": 9.667617565023735e-05, |
| "loss": 0.754, |
| "mean_token_accuracy": 0.8447227776050568, |
| "num_tokens": 2343588.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.624203821656051, |
| "grad_norm": 0.7568661570549011, |
| "learning_rate": 9.584565006361734e-05, |
| "loss": 0.7913, |
| "mean_token_accuracy": 0.839029997587204, |
| "num_tokens": 2355041.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.6369426751592355, |
| "grad_norm": 0.8414303660392761, |
| "learning_rate": 9.501541143393028e-05, |
| "loss": 0.8121, |
| "mean_token_accuracy": 0.8275638222694397, |
| "num_tokens": 2366049.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6496815286624202, |
| "grad_norm": 0.7648023962974548, |
| "learning_rate": 9.418551710895243e-05, |
| "loss": 0.784, |
| "mean_token_accuracy": 0.8382553458213806, |
| "num_tokens": 2377894.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.662420382165605, |
| "grad_norm": 0.7028918862342834, |
| "learning_rate": 9.335602441267759e-05, |
| "loss": 0.7438, |
| "mean_token_accuracy": 0.8459280431270599, |
| "num_tokens": 2389701.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.6751592356687897, |
| "grad_norm": 0.7316209673881531, |
| "learning_rate": 9.252699064135758e-05, |
| "loss": 0.7426, |
| "mean_token_accuracy": 0.8471413552761078, |
| "num_tokens": 2400854.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6878980891719744, |
| "grad_norm": 0.7141792178153992, |
| "learning_rate": 9.169847305954447e-05, |
| "loss": 0.8257, |
| "mean_token_accuracy": 0.8294172883033752, |
| "num_tokens": 2412586.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.700636942675159, |
| "grad_norm": 0.7271824479103088, |
| "learning_rate": 9.087052889613518e-05, |
| "loss": 0.749, |
| "mean_token_accuracy": 0.8446075320243835, |
| "num_tokens": 2423882.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.713375796178344, |
| "grad_norm": 0.7202516794204712, |
| "learning_rate": 9.004321534041835e-05, |
| "loss": 0.6752, |
| "mean_token_accuracy": 0.8554234504699707, |
| "num_tokens": 2434645.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.7261146496815285, |
| "grad_norm": 0.754311740398407, |
| "learning_rate": 8.921658953812415e-05, |
| "loss": 0.7528, |
| "mean_token_accuracy": 0.84283846616745, |
| "num_tokens": 2445879.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.738853503184713, |
| "grad_norm": 0.7746644020080566, |
| "learning_rate": 8.839070858747697e-05, |
| "loss": 0.6854, |
| "mean_token_accuracy": 0.8581766784191132, |
| "num_tokens": 2457114.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7515923566878984, |
| "grad_norm": 0.78766930103302, |
| "learning_rate": 8.756562953525152e-05, |
| "loss": 0.7482, |
| "mean_token_accuracy": 0.8451160490512848, |
| "num_tokens": 2468624.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.7643312101910826, |
| "grad_norm": 0.7526237964630127, |
| "learning_rate": 8.674140937283208e-05, |
| "loss": 0.7625, |
| "mean_token_accuracy": 0.842221587896347, |
| "num_tokens": 2479981.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.777070063694268, |
| "grad_norm": 0.6812964677810669, |
| "learning_rate": 8.591810503227635e-05, |
| "loss": 0.6497, |
| "mean_token_accuracy": 0.8649884462356567, |
| "num_tokens": 2491405.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.789808917197452, |
| "grad_norm": 0.7079475522041321, |
| "learning_rate": 8.509577338238255e-05, |
| "loss": 0.7861, |
| "mean_token_accuracy": 0.8404203653335571, |
| "num_tokens": 2502813.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.802547770700637, |
| "grad_norm": 0.7311021685600281, |
| "learning_rate": 8.427447122476148e-05, |
| "loss": 0.7197, |
| "mean_token_accuracy": 0.8496346771717072, |
| "num_tokens": 2514190.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.8152866242038215, |
| "grad_norm": 0.7299697995185852, |
| "learning_rate": 8.345425528991288e-05, |
| "loss": 0.6534, |
| "mean_token_accuracy": 0.8644725978374481, |
| "num_tokens": 2525108.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8280254777070066, |
| "grad_norm": 0.7232358455657959, |
| "learning_rate": 8.263518223330697e-05, |
| "loss": 0.7367, |
| "mean_token_accuracy": 0.8454770445823669, |
| "num_tokens": 2536505.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.840764331210191, |
| "grad_norm": 0.7579157948493958, |
| "learning_rate": 8.181730863147093e-05, |
| "loss": 0.7802, |
| "mean_token_accuracy": 0.8421458303928375, |
| "num_tokens": 2548300.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.853503184713376, |
| "grad_norm": 0.7531870603561401, |
| "learning_rate": 8.100069097808103e-05, |
| "loss": 0.7668, |
| "mean_token_accuracy": 0.837373673915863, |
| "num_tokens": 2559823.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8662420382165603, |
| "grad_norm": 0.7980068325996399, |
| "learning_rate": 8.018538568006027e-05, |
| "loss": 0.7732, |
| "mean_token_accuracy": 0.8385846614837646, |
| "num_tokens": 2571347.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8789808917197455, |
| "grad_norm": 0.7262105345726013, |
| "learning_rate": 7.937144905368226e-05, |
| "loss": 0.6929, |
| "mean_token_accuracy": 0.8532972633838654, |
| "num_tokens": 2582905.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8917197452229297, |
| "grad_norm": 0.7458977699279785, |
| "learning_rate": 7.855893732068125e-05, |
| "loss": 0.8033, |
| "mean_token_accuracy": 0.832788497209549, |
| "num_tokens": 2594285.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.904458598726115, |
| "grad_norm": 0.7132753729820251, |
| "learning_rate": 7.774790660436858e-05, |
| "loss": 0.7282, |
| "mean_token_accuracy": 0.8512730598449707, |
| "num_tokens": 2605746.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.917197452229299, |
| "grad_norm": 0.7424162030220032, |
| "learning_rate": 7.693841292575598e-05, |
| "loss": 0.8419, |
| "mean_token_accuracy": 0.8298401832580566, |
| "num_tokens": 2617280.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9299363057324843, |
| "grad_norm": 0.7677499651908875, |
| "learning_rate": 7.613051219968623e-05, |
| "loss": 0.7698, |
| "mean_token_accuracy": 0.8419542610645294, |
| "num_tokens": 2629030.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9426751592356686, |
| "grad_norm": 0.7418862581253052, |
| "learning_rate": 7.532426023097063e-05, |
| "loss": 0.7345, |
| "mean_token_accuracy": 0.8459601104259491, |
| "num_tokens": 2640001.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9554140127388537, |
| "grad_norm": 0.7955715656280518, |
| "learning_rate": 7.451971271053455e-05, |
| "loss": 0.8412, |
| "mean_token_accuracy": 0.8234219551086426, |
| "num_tokens": 2651498.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.968152866242038, |
| "grad_norm": 0.7265613675117493, |
| "learning_rate": 7.371692521157048e-05, |
| "loss": 0.7409, |
| "mean_token_accuracy": 0.8501673936843872, |
| "num_tokens": 2662618.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.980891719745223, |
| "grad_norm": 0.7546766400337219, |
| "learning_rate": 7.291595318569951e-05, |
| "loss": 0.7734, |
| "mean_token_accuracy": 0.8381434679031372, |
| "num_tokens": 2674269.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9936305732484074, |
| "grad_norm": 0.8405062556266785, |
| "learning_rate": 7.211685195914097e-05, |
| "loss": 0.774, |
| "mean_token_accuracy": 0.8428973257541656, |
| "num_tokens": 2685723.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.8405062556266785, |
| "learning_rate": 7.131967672889101e-05, |
| "loss": 0.5548, |
| "mean_token_accuracy": 0.8830875754356384, |
| "num_tokens": 2691520.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0127388535031847, |
| "grad_norm": 1.0931280851364136, |
| "learning_rate": 7.052448255890957e-05, |
| "loss": 0.4378, |
| "mean_token_accuracy": 0.9112375974655151, |
| "num_tokens": 2702735.0, |
| "step": 238 |
| }, |
| { |
| "epoch": 3.0254777070063694, |
| "grad_norm": 0.6512832045555115, |
| "learning_rate": 6.973132437631742e-05, |
| "loss": 0.4315, |
| "mean_token_accuracy": 0.9114527404308319, |
| "num_tokens": 2714184.0, |
| "step": 239 |
| }, |
| { |
| "epoch": 3.038216560509554, |
| "grad_norm": 0.6910308003425598, |
| "learning_rate": 6.894025696760163e-05, |
| "loss": 0.4022, |
| "mean_token_accuracy": 0.9163219630718231, |
| "num_tokens": 2726186.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 3.050955414012739, |
| "grad_norm": 0.7762511968612671, |
| "learning_rate": 6.815133497483157e-05, |
| "loss": 0.4298, |
| "mean_token_accuracy": 0.9098988175392151, |
| "num_tokens": 2737492.0, |
| "step": 241 |
| }, |
| { |
| "epoch": 3.0636942675159236, |
| "grad_norm": 0.9614583849906921, |
| "learning_rate": 6.736461289188445e-05, |
| "loss": 0.4746, |
| "mean_token_accuracy": 0.8996783494949341, |
| "num_tokens": 2749284.0, |
| "step": 242 |
| }, |
| { |
| "epoch": 3.0764331210191083, |
| "grad_norm": 0.9811398386955261, |
| "learning_rate": 6.658014506068126e-05, |
| "loss": 0.4731, |
| "mean_token_accuracy": 0.9008384644985199, |
| "num_tokens": 2760625.0, |
| "step": 243 |
| }, |
| { |
| "epoch": 3.089171974522293, |
| "grad_norm": 0.7803757786750793, |
| "learning_rate": 6.579798566743314e-05, |
| "loss": 0.4739, |
| "mean_token_accuracy": 0.8986400067806244, |
| "num_tokens": 2772261.0, |
| "step": 244 |
| }, |
| { |
| "epoch": 3.1019108280254777, |
| "grad_norm": 0.6646518707275391, |
| "learning_rate": 6.501818873889855e-05, |
| "loss": 0.4418, |
| "mean_token_accuracy": 0.905548095703125, |
| "num_tokens": 2783770.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 3.1146496815286624, |
| "grad_norm": 0.7459288239479065, |
| "learning_rate": 6.424080813865138e-05, |
| "loss": 0.4235, |
| "mean_token_accuracy": 0.9139858484268188, |
| "num_tokens": 2794903.0, |
| "step": 246 |
| }, |
| { |
| "epoch": 3.127388535031847, |
| "grad_norm": 0.6252720355987549, |
| "learning_rate": 6.34658975633605e-05, |
| "loss": 0.3942, |
| "mean_token_accuracy": 0.9155459702014923, |
| "num_tokens": 2806179.0, |
| "step": 247 |
| }, |
| { |
| "epoch": 3.140127388535032, |
| "grad_norm": 0.686250627040863, |
| "learning_rate": 6.269351053908061e-05, |
| "loss": 0.3849, |
| "mean_token_accuracy": 0.9164520800113678, |
| "num_tokens": 2817415.0, |
| "step": 248 |
| }, |
| { |
| "epoch": 3.1528662420382165, |
| "grad_norm": 0.6929484009742737, |
| "learning_rate": 6.192370041755505e-05, |
| "loss": 0.3571, |
| "mean_token_accuracy": 0.9215479791164398, |
| "num_tokens": 2828929.0, |
| "step": 249 |
| }, |
| { |
| "epoch": 3.1656050955414012, |
| "grad_norm": 0.8024463653564453, |
| "learning_rate": 6.115652037253053e-05, |
| "loss": 0.4148, |
| "mean_token_accuracy": 0.9082026779651642, |
| "num_tokens": 2840532.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 3.178343949044586, |
| "grad_norm": 0.7858138680458069, |
| "learning_rate": 6.039202339608432e-05, |
| "loss": 0.3892, |
| "mean_token_accuracy": 0.9145569205284119, |
| "num_tokens": 2852314.0, |
| "step": 251 |
| }, |
| { |
| "epoch": 3.1910828025477707, |
| "grad_norm": 0.8003715872764587, |
| "learning_rate": 5.963026229496378e-05, |
| "loss": 0.4572, |
| "mean_token_accuracy": 0.9035838842391968, |
| "num_tokens": 2863849.0, |
| "step": 252 |
| }, |
| { |
| "epoch": 3.2038216560509554, |
| "grad_norm": 0.76338130235672, |
| "learning_rate": 5.887128968693887e-05, |
| "loss": 0.3811, |
| "mean_token_accuracy": 0.918819010257721, |
| "num_tokens": 2874972.0, |
| "step": 253 |
| }, |
| { |
| "epoch": 3.21656050955414, |
| "grad_norm": 0.7224725484848022, |
| "learning_rate": 5.8115157997167536e-05, |
| "loss": 0.4274, |
| "mean_token_accuracy": 0.908456951379776, |
| "num_tokens": 2886716.0, |
| "step": 254 |
| }, |
| { |
| "epoch": 3.229299363057325, |
| "grad_norm": 0.6986261606216431, |
| "learning_rate": 5.736191945457463e-05, |
| "loss": 0.3955, |
| "mean_token_accuracy": 0.9168632924556732, |
| "num_tokens": 2897985.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 3.2420382165605095, |
| "grad_norm": 0.6842857003211975, |
| "learning_rate": 5.6611626088244194e-05, |
| "loss": 0.4806, |
| "mean_token_accuracy": 0.8974257409572601, |
| "num_tokens": 2909541.0, |
| "step": 256 |
| }, |
| { |
| "epoch": 3.254777070063694, |
| "grad_norm": 0.740216076374054, |
| "learning_rate": 5.58643297238256e-05, |
| "loss": 0.4039, |
| "mean_token_accuracy": 0.9144846200942993, |
| "num_tokens": 2920862.0, |
| "step": 257 |
| }, |
| { |
| "epoch": 3.267515923566879, |
| "grad_norm": 0.7123299837112427, |
| "learning_rate": 5.5120081979953785e-05, |
| "loss": 0.3984, |
| "mean_token_accuracy": 0.914899617433548, |
| "num_tokens": 2931948.0, |
| "step": 258 |
| }, |
| { |
| "epoch": 3.2802547770700636, |
| "grad_norm": 0.7262259721755981, |
| "learning_rate": 5.43789342646837e-05, |
| "loss": 0.3992, |
| "mean_token_accuracy": 0.9135793447494507, |
| "num_tokens": 2943315.0, |
| "step": 259 |
| }, |
| { |
| "epoch": 3.2929936305732483, |
| "grad_norm": 0.7332592606544495, |
| "learning_rate": 5.3640937771939436e-05, |
| "loss": 0.4232, |
| "mean_token_accuracy": 0.9101269543170929, |
| "num_tokens": 2954251.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 3.305732484076433, |
| "grad_norm": 0.7521343231201172, |
| "learning_rate": 5.290614347797802e-05, |
| "loss": 0.4609, |
| "mean_token_accuracy": 0.8991831839084625, |
| "num_tokens": 2966119.0, |
| "step": 261 |
| }, |
| { |
| "epoch": 3.3184713375796178, |
| "grad_norm": 0.7670261263847351, |
| "learning_rate": 5.217460213786821e-05, |
| "loss": 0.3753, |
| "mean_token_accuracy": 0.9199231863021851, |
| "num_tokens": 2977756.0, |
| "step": 262 |
| }, |
| { |
| "epoch": 3.3312101910828025, |
| "grad_norm": 0.7183542251586914, |
| "learning_rate": 5.1446364281984774e-05, |
| "loss": 0.3887, |
| "mean_token_accuracy": 0.9179783165454865, |
| "num_tokens": 2989020.0, |
| "step": 263 |
| }, |
| { |
| "epoch": 3.343949044585987, |
| "grad_norm": 0.7223445773124695, |
| "learning_rate": 5.072148021251821e-05, |
| "loss": 0.3824, |
| "mean_token_accuracy": 0.9165781438350677, |
| "num_tokens": 3000498.0, |
| "step": 264 |
| }, |
| { |
| "epoch": 3.356687898089172, |
| "grad_norm": 0.7291591763496399, |
| "learning_rate": 5.000000000000002e-05, |
| "loss": 0.465, |
| "mean_token_accuracy": 0.8992412984371185, |
| "num_tokens": 3012283.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 3.3694267515923566, |
| "grad_norm": 0.7637300491333008, |
| "learning_rate": 4.92819734798441e-05, |
| "loss": 0.3856, |
| "mean_token_accuracy": 0.9171736836433411, |
| "num_tokens": 3023734.0, |
| "step": 266 |
| }, |
| { |
| "epoch": 3.3821656050955413, |
| "grad_norm": 0.7061458230018616, |
| "learning_rate": 4.856745024890466e-05, |
| "loss": 0.4057, |
| "mean_token_accuracy": 0.9132257997989655, |
| "num_tokens": 3035422.0, |
| "step": 267 |
| }, |
| { |
| "epoch": 3.394904458598726, |
| "grad_norm": 0.6533039808273315, |
| "learning_rate": 4.78564796620502e-05, |
| "loss": 0.3742, |
| "mean_token_accuracy": 0.9179588854312897, |
| "num_tokens": 3047227.0, |
| "step": 268 |
| }, |
| { |
| "epoch": 3.4076433121019107, |
| "grad_norm": 0.7290828227996826, |
| "learning_rate": 4.7149110828754464e-05, |
| "loss": 0.4523, |
| "mean_token_accuracy": 0.9024053812026978, |
| "num_tokens": 3058515.0, |
| "step": 269 |
| }, |
| { |
| "epoch": 3.4203821656050954, |
| "grad_norm": 0.7428059577941895, |
| "learning_rate": 4.644539260970416e-05, |
| "loss": 0.4019, |
| "mean_token_accuracy": 0.9147013127803802, |
| "num_tokens": 3070154.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 3.43312101910828, |
| "grad_norm": 0.7001674771308899, |
| "learning_rate": 4.574537361342407e-05, |
| "loss": 0.4468, |
| "mean_token_accuracy": 0.9073070287704468, |
| "num_tokens": 3081238.0, |
| "step": 271 |
| }, |
| { |
| "epoch": 3.445859872611465, |
| "grad_norm": 0.7086686491966248, |
| "learning_rate": 4.50491021929194e-05, |
| "loss": 0.3663, |
| "mean_token_accuracy": 0.9213272333145142, |
| "num_tokens": 3092931.0, |
| "step": 272 |
| }, |
| { |
| "epoch": 3.4585987261146496, |
| "grad_norm": 0.7113444805145264, |
| "learning_rate": 4.435662644233594e-05, |
| "loss": 0.3793, |
| "mean_token_accuracy": 0.9215837121009827, |
| "num_tokens": 3104621.0, |
| "step": 273 |
| }, |
| { |
| "epoch": 3.4713375796178343, |
| "grad_norm": 0.7607334852218628, |
| "learning_rate": 4.3667994193637796e-05, |
| "loss": 0.3682, |
| "mean_token_accuracy": 0.921149730682373, |
| "num_tokens": 3116470.0, |
| "step": 274 |
| }, |
| { |
| "epoch": 3.484076433121019, |
| "grad_norm": 0.7381239533424377, |
| "learning_rate": 4.298325301330383e-05, |
| "loss": 0.4207, |
| "mean_token_accuracy": 0.9124354124069214, |
| "num_tokens": 3127792.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 3.4968152866242037, |
| "grad_norm": 0.7434445023536682, |
| "learning_rate": 4.23024501990417e-05, |
| "loss": 0.3605, |
| "mean_token_accuracy": 0.92374187707901, |
| "num_tokens": 3139330.0, |
| "step": 276 |
| }, |
| { |
| "epoch": 3.5095541401273884, |
| "grad_norm": 0.7115570902824402, |
| "learning_rate": 4.1625632776521037e-05, |
| "loss": 0.3784, |
| "mean_token_accuracy": 0.9193529784679413, |
| "num_tokens": 3150599.0, |
| "step": 277 |
| }, |
| { |
| "epoch": 3.522292993630573, |
| "grad_norm": 0.7325626015663147, |
| "learning_rate": 4.095284749612503e-05, |
| "loss": 0.4521, |
| "mean_token_accuracy": 0.9044492542743683, |
| "num_tokens": 3161908.0, |
| "step": 278 |
| }, |
| { |
| "epoch": 3.535031847133758, |
| "grad_norm": 0.7054380178451538, |
| "learning_rate": 4.028414082972141e-05, |
| "loss": 0.3728, |
| "mean_token_accuracy": 0.9196057915687561, |
| "num_tokens": 3173218.0, |
| "step": 279 |
| }, |
| { |
| "epoch": 3.5477707006369426, |
| "grad_norm": 0.718416690826416, |
| "learning_rate": 3.961955896745224e-05, |
| "loss": 0.4101, |
| "mean_token_accuracy": 0.9115929007530212, |
| "num_tokens": 3184570.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 3.5605095541401273, |
| "grad_norm": 0.791922390460968, |
| "learning_rate": 3.89591478145437e-05, |
| "loss": 0.4161, |
| "mean_token_accuracy": 0.9134823977947235, |
| "num_tokens": 3196499.0, |
| "step": 281 |
| }, |
| { |
| "epoch": 3.573248407643312, |
| "grad_norm": 0.7314372658729553, |
| "learning_rate": 3.8302952988134756e-05, |
| "loss": 0.3959, |
| "mean_token_accuracy": 0.9104648232460022, |
| "num_tokens": 3207925.0, |
| "step": 282 |
| }, |
| { |
| "epoch": 3.5859872611464967, |
| "grad_norm": 0.6875584125518799, |
| "learning_rate": 3.7651019814126654e-05, |
| "loss": 0.3528, |
| "mean_token_accuracy": 0.9253743290901184, |
| "num_tokens": 3218971.0, |
| "step": 283 |
| }, |
| { |
| "epoch": 3.5987261146496814, |
| "grad_norm": 0.7326579093933105, |
| "learning_rate": 3.7003393324051874e-05, |
| "loss": 0.4021, |
| "mean_token_accuracy": 0.9128564596176147, |
| "num_tokens": 3230456.0, |
| "step": 284 |
| }, |
| { |
| "epoch": 3.611464968152866, |
| "grad_norm": 0.7286593914031982, |
| "learning_rate": 3.6360118251963645e-05, |
| "loss": 0.383, |
| "mean_token_accuracy": 0.917042464017868, |
| "num_tokens": 3241801.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 3.624203821656051, |
| "grad_norm": 0.7183976173400879, |
| "learning_rate": 3.5721239031346066e-05, |
| "loss": 0.4085, |
| "mean_token_accuracy": 0.9113990664482117, |
| "num_tokens": 3253004.0, |
| "step": 286 |
| }, |
| { |
| "epoch": 3.6369426751592355, |
| "grad_norm": 0.7951269745826721, |
| "learning_rate": 3.508679979204481e-05, |
| "loss": 0.4163, |
| "mean_token_accuracy": 0.9118180274963379, |
| "num_tokens": 3264403.0, |
| "step": 287 |
| }, |
| { |
| "epoch": 3.6496815286624202, |
| "grad_norm": 0.7571028470993042, |
| "learning_rate": 3.445684435721897e-05, |
| "loss": 0.4175, |
| "mean_token_accuracy": 0.9093326032161713, |
| "num_tokens": 3276391.0, |
| "step": 288 |
| }, |
| { |
| "epoch": 3.662420382165605, |
| "grad_norm": 0.7511271834373474, |
| "learning_rate": 3.383141624031408e-05, |
| "loss": 0.4207, |
| "mean_token_accuracy": 0.9097310900688171, |
| "num_tokens": 3287738.0, |
| "step": 289 |
| }, |
| { |
| "epoch": 3.6751592356687897, |
| "grad_norm": 0.7271094918251038, |
| "learning_rate": 3.3210558642056275e-05, |
| "loss": 0.3244, |
| "mean_token_accuracy": 0.9262686371803284, |
| "num_tokens": 3299143.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 3.6878980891719744, |
| "grad_norm": 0.6291069388389587, |
| "learning_rate": 3.259431444746846e-05, |
| "loss": 0.3689, |
| "mean_token_accuracy": 0.9212159514427185, |
| "num_tokens": 3310487.0, |
| "step": 291 |
| }, |
| { |
| "epoch": 3.700636942675159, |
| "grad_norm": 0.7592793703079224, |
| "learning_rate": 3.198272622290804e-05, |
| "loss": 0.3751, |
| "mean_token_accuracy": 0.9193132519721985, |
| "num_tokens": 3321796.0, |
| "step": 292 |
| }, |
| { |
| "epoch": 3.713375796178344, |
| "grad_norm": 0.717683732509613, |
| "learning_rate": 3.137583621312665e-05, |
| "loss": 0.4047, |
| "mean_token_accuracy": 0.9123214483261108, |
| "num_tokens": 3332604.0, |
| "step": 293 |
| }, |
| { |
| "epoch": 3.7261146496815285, |
| "grad_norm": 0.7711255550384521, |
| "learning_rate": 3.077368633835205e-05, |
| "loss": 0.3826, |
| "mean_token_accuracy": 0.9203261137008667, |
| "num_tokens": 3344007.0, |
| "step": 294 |
| }, |
| { |
| "epoch": 3.738853503184713, |
| "grad_norm": 0.7225829362869263, |
| "learning_rate": 3.0176318191392726e-05, |
| "loss": 0.4082, |
| "mean_token_accuracy": 0.9109752476215363, |
| "num_tokens": 3355090.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 3.7515923566878984, |
| "grad_norm": 0.7202189564704895, |
| "learning_rate": 2.9583773034764826e-05, |
| "loss": 0.3337, |
| "mean_token_accuracy": 0.9286851584911346, |
| "num_tokens": 3365904.0, |
| "step": 296 |
| }, |
| { |
| "epoch": 3.7643312101910826, |
| "grad_norm": 0.7087749242782593, |
| "learning_rate": 2.8996091797841973e-05, |
| "loss": 0.3724, |
| "mean_token_accuracy": 0.9182478785514832, |
| "num_tokens": 3377964.0, |
| "step": 297 |
| }, |
| { |
| "epoch": 3.777070063694268, |
| "grad_norm": 0.7725366353988647, |
| "learning_rate": 2.8413315074028158e-05, |
| "loss": 0.4251, |
| "mean_token_accuracy": 0.9080156087875366, |
| "num_tokens": 3389347.0, |
| "step": 298 |
| }, |
| { |
| "epoch": 3.789808917197452, |
| "grad_norm": 0.6942902207374573, |
| "learning_rate": 2.7835483117953788e-05, |
| "loss": 0.3589, |
| "mean_token_accuracy": 0.920698344707489, |
| "num_tokens": 3400439.0, |
| "step": 299 |
| }, |
| { |
| "epoch": 3.802547770700637, |
| "grad_norm": 0.8013036251068115, |
| "learning_rate": 2.7262635842695127e-05, |
| "loss": 0.4216, |
| "mean_token_accuracy": 0.9113393723964691, |
| "num_tokens": 3411639.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 3.8152866242038215, |
| "grad_norm": 0.6873416304588318, |
| "learning_rate": 2.669481281701739e-05, |
| "loss": 0.345, |
| "mean_token_accuracy": 0.9255788028240204, |
| "num_tokens": 3423172.0, |
| "step": 301 |
| }, |
| { |
| "epoch": 3.8280254777070066, |
| "grad_norm": 0.7055365443229675, |
| "learning_rate": 2.6132053262641466e-05, |
| "loss": 0.4195, |
| "mean_token_accuracy": 0.9090149402618408, |
| "num_tokens": 3434947.0, |
| "step": 302 |
| }, |
| { |
| "epoch": 3.840764331210191, |
| "grad_norm": 0.695279598236084, |
| "learning_rate": 2.5574396051534832e-05, |
| "loss": 0.3729, |
| "mean_token_accuracy": 0.9185731709003448, |
| "num_tokens": 3446512.0, |
| "step": 303 |
| }, |
| { |
| "epoch": 3.853503184713376, |
| "grad_norm": 0.6654506325721741, |
| "learning_rate": 2.502187970322657e-05, |
| "loss": 0.3817, |
| "mean_token_accuracy": 0.9183900356292725, |
| "num_tokens": 3458505.0, |
| "step": 304 |
| }, |
| { |
| "epoch": 3.8662420382165603, |
| "grad_norm": 0.6791413426399231, |
| "learning_rate": 2.4474542382146537e-05, |
| "loss": 0.3857, |
| "mean_token_accuracy": 0.9171143770217896, |
| "num_tokens": 3470163.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 3.8789808917197455, |
| "grad_norm": 0.6865147948265076, |
| "learning_rate": 2.3932421894989167e-05, |
| "loss": 0.3212, |
| "mean_token_accuracy": 0.929681807756424, |
| "num_tokens": 3481090.0, |
| "step": 306 |
| }, |
| { |
| "epoch": 3.8917197452229297, |
| "grad_norm": 0.7324571013450623, |
| "learning_rate": 2.339555568810221e-05, |
| "loss": 0.3889, |
| "mean_token_accuracy": 0.9164491891860962, |
| "num_tokens": 3491946.0, |
| "step": 307 |
| }, |
| { |
| "epoch": 3.904458598726115, |
| "grad_norm": 0.7851356267929077, |
| "learning_rate": 2.2863980844900036e-05, |
| "loss": 0.4214, |
| "mean_token_accuracy": 0.9069257974624634, |
| "num_tokens": 3502961.0, |
| "step": 308 |
| }, |
| { |
| "epoch": 3.917197452229299, |
| "grad_norm": 0.7185788154602051, |
| "learning_rate": 2.2337734083302164e-05, |
| "loss": 0.3563, |
| "mean_token_accuracy": 0.9213061332702637, |
| "num_tokens": 3514116.0, |
| "step": 309 |
| }, |
| { |
| "epoch": 3.9299363057324843, |
| "grad_norm": 0.6799073219299316, |
| "learning_rate": 2.181685175319702e-05, |
| "loss": 0.378, |
| "mean_token_accuracy": 0.9194752275943756, |
| "num_tokens": 3525855.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 3.9426751592356686, |
| "grad_norm": 0.6928824186325073, |
| "learning_rate": 2.1301369833931117e-05, |
| "loss": 0.3883, |
| "mean_token_accuracy": 0.9154934287071228, |
| "num_tokens": 3536972.0, |
| "step": 311 |
| }, |
| { |
| "epoch": 3.9554140127388537, |
| "grad_norm": 0.7100560665130615, |
| "learning_rate": 2.079132393182378e-05, |
| "loss": 0.3597, |
| "mean_token_accuracy": 0.9214137196540833, |
| "num_tokens": 3548281.0, |
| "step": 312 |
| }, |
| { |
| "epoch": 3.968152866242038, |
| "grad_norm": 0.7356792092323303, |
| "learning_rate": 2.0286749277707782e-05, |
| "loss": 0.3704, |
| "mean_token_accuracy": 0.9214728474617004, |
| "num_tokens": 3559528.0, |
| "step": 313 |
| }, |
| { |
| "epoch": 3.980891719745223, |
| "grad_norm": 0.7311772704124451, |
| "learning_rate": 1.9787680724495617e-05, |
| "loss": 0.4054, |
| "mean_token_accuracy": 0.9130307734012604, |
| "num_tokens": 3571410.0, |
| "step": 314 |
| }, |
| { |
| "epoch": 3.9936305732484074, |
| "grad_norm": 0.7273927330970764, |
| "learning_rate": 1.929415274477239e-05, |
| "loss": 0.3699, |
| "mean_token_accuracy": 0.9222646355628967, |
| "num_tokens": 3582989.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 4.0, |
| "grad_norm": 0.9767398834228516, |
| "learning_rate": 1.880619942841435e-05, |
| "loss": 0.2723, |
| "mean_token_accuracy": 0.9425185918807983, |
| "num_tokens": 3588675.0, |
| "step": 316 |
| }, |
| { |
| "epoch": 4.012738853503185, |
| "grad_norm": 0.6263962388038635, |
| "learning_rate": 1.832385448023435e-05, |
| "loss": 0.2918, |
| "mean_token_accuracy": 0.9413339197635651, |
| "num_tokens": 3600582.0, |
| "step": 317 |
| }, |
| { |
| "epoch": 4.025477707006369, |
| "grad_norm": 0.5037514567375183, |
| "learning_rate": 1.7847151217653624e-05, |
| "loss": 0.1918, |
| "mean_token_accuracy": 0.9609819948673248, |
| "num_tokens": 3612395.0, |
| "step": 318 |
| }, |
| { |
| "epoch": 4.038216560509555, |
| "grad_norm": 0.5700432658195496, |
| "learning_rate": 1.7376122568400532e-05, |
| "loss": 0.2232, |
| "mean_token_accuracy": 0.9543178379535675, |
| "num_tokens": 3623934.0, |
| "step": 319 |
| }, |
| { |
| "epoch": 4.050955414012739, |
| "grad_norm": 0.6004671454429626, |
| "learning_rate": 1.6910801068236016e-05, |
| "loss": 0.256, |
| "mean_token_accuracy": 0.9473693072795868, |
| "num_tokens": 3635141.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 4.063694267515924, |
| "grad_norm": 0.5617762804031372, |
| "learning_rate": 1.6451218858706374e-05, |
| "loss": 0.2451, |
| "mean_token_accuracy": 0.951095849275589, |
| "num_tokens": 3646412.0, |
| "step": 321 |
| }, |
| { |
| "epoch": 4.076433121019108, |
| "grad_norm": 0.533304750919342, |
| "learning_rate": 1.5997407684922862e-05, |
| "loss": 0.2242, |
| "mean_token_accuracy": 0.9530414640903473, |
| "num_tokens": 3658369.0, |
| "step": 322 |
| }, |
| { |
| "epoch": 4.089171974522293, |
| "grad_norm": 0.5561266541481018, |
| "learning_rate": 1.5549398893369216e-05, |
| "loss": 0.2114, |
| "mean_token_accuracy": 0.9571148455142975, |
| "num_tokens": 3669448.0, |
| "step": 323 |
| }, |
| { |
| "epoch": 4.101910828025478, |
| "grad_norm": 0.6145673990249634, |
| "learning_rate": 1.5107223429736272e-05, |
| "loss": 0.2246, |
| "mean_token_accuracy": 0.9528952240943909, |
| "num_tokens": 3681023.0, |
| "step": 324 |
| }, |
| { |
| "epoch": 4.114649681528663, |
| "grad_norm": 0.6063571572303772, |
| "learning_rate": 1.467091183678444e-05, |
| "loss": 0.2153, |
| "mean_token_accuracy": 0.9555847346782684, |
| "num_tokens": 3692657.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 4.127388535031847, |
| "grad_norm": 0.7087187170982361, |
| "learning_rate": 1.4240494252234049e-05, |
| "loss": 0.2393, |
| "mean_token_accuracy": 0.9499338865280151, |
| "num_tokens": 3704395.0, |
| "step": 326 |
| }, |
| { |
| "epoch": 4.140127388535032, |
| "grad_norm": 0.7192868590354919, |
| "learning_rate": 1.3816000406683604e-05, |
| "loss": 0.243, |
| "mean_token_accuracy": 0.9491298496723175, |
| "num_tokens": 3716489.0, |
| "step": 327 |
| }, |
| { |
| "epoch": 4.1528662420382165, |
| "grad_norm": 0.7291700839996338, |
| "learning_rate": 1.339745962155613e-05, |
| "loss": 0.2505, |
| "mean_token_accuracy": 0.9449942708015442, |
| "num_tokens": 3727830.0, |
| "step": 328 |
| }, |
| { |
| "epoch": 4.165605095541402, |
| "grad_norm": 0.7119983434677124, |
| "learning_rate": 1.2984900807073919e-05, |
| "loss": 0.223, |
| "mean_token_accuracy": 0.9517882168292999, |
| "num_tokens": 3739056.0, |
| "step": 329 |
| }, |
| { |
| "epoch": 4.178343949044586, |
| "grad_norm": 0.6926700472831726, |
| "learning_rate": 1.2578352460261456e-05, |
| "loss": 0.2585, |
| "mean_token_accuracy": 0.9477393925189972, |
| "num_tokens": 3750358.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 4.191082802547771, |
| "grad_norm": 0.7205728888511658, |
| "learning_rate": 1.2177842662977135e-05, |
| "loss": 0.2745, |
| "mean_token_accuracy": 0.942330002784729, |
| "num_tokens": 3761678.0, |
| "step": 331 |
| }, |
| { |
| "epoch": 4.203821656050955, |
| "grad_norm": 0.7079265713691711, |
| "learning_rate": 1.1783399079973578e-05, |
| "loss": 0.2745, |
| "mean_token_accuracy": 0.9428843557834625, |
| "num_tokens": 3772919.0, |
| "step": 332 |
| }, |
| { |
| "epoch": 4.2165605095541405, |
| "grad_norm": 0.6066899299621582, |
| "learning_rate": 1.1395048956986575e-05, |
| "loss": 0.2299, |
| "mean_token_accuracy": 0.9510907232761383, |
| "num_tokens": 3784964.0, |
| "step": 333 |
| }, |
| { |
| "epoch": 4.229299363057325, |
| "grad_norm": 0.6382308006286621, |
| "learning_rate": 1.1012819118853147e-05, |
| "loss": 0.2475, |
| "mean_token_accuracy": 0.9474037885665894, |
| "num_tokens": 3796759.0, |
| "step": 334 |
| }, |
| { |
| "epoch": 4.24203821656051, |
| "grad_norm": 0.5721100568771362, |
| "learning_rate": 1.0636735967658784e-05, |
| "loss": 0.2072, |
| "mean_token_accuracy": 0.9569090008735657, |
| "num_tokens": 3807780.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 4.254777070063694, |
| "grad_norm": 0.6053273677825928, |
| "learning_rate": 1.0266825480913611e-05, |
| "loss": 0.2476, |
| "mean_token_accuracy": 0.9472332894802094, |
| "num_tokens": 3818794.0, |
| "step": 336 |
| }, |
| { |
| "epoch": 4.267515923566879, |
| "grad_norm": 0.5573616623878479, |
| "learning_rate": 9.903113209758096e-06, |
| "loss": 0.2172, |
| "mean_token_accuracy": 0.9540870785713196, |
| "num_tokens": 3830160.0, |
| "step": 337 |
| }, |
| { |
| "epoch": 4.280254777070064, |
| "grad_norm": 0.574436604976654, |
| "learning_rate": 9.545624277198084e-06, |
| "loss": 0.2346, |
| "mean_token_accuracy": 0.9521960914134979, |
| "num_tokens": 3841632.0, |
| "step": 338 |
| }, |
| { |
| "epoch": 4.292993630573249, |
| "grad_norm": 0.5788965225219727, |
| "learning_rate": 9.194383376369508e-06, |
| "loss": 0.2325, |
| "mean_token_accuracy": 0.9513043165206909, |
| "num_tokens": 3852969.0, |
| "step": 339 |
| }, |
| { |
| "epoch": 4.305732484076433, |
| "grad_norm": 0.5369225740432739, |
| "learning_rate": 8.849414768832687e-06, |
| "loss": 0.2018, |
| "mean_token_accuracy": 0.9572807252407074, |
| "num_tokens": 3864175.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 4.318471337579618, |
| "grad_norm": 0.5755797624588013, |
| "learning_rate": 8.510742282896544e-06, |
| "loss": 0.2342, |
| "mean_token_accuracy": 0.9505596160888672, |
| "num_tokens": 3875709.0, |
| "step": 341 |
| }, |
| { |
| "epoch": 4.3312101910828025, |
| "grad_norm": 0.5512501001358032, |
| "learning_rate": 8.178389311972612e-06, |
| "loss": 0.2075, |
| "mean_token_accuracy": 0.9557295739650726, |
| "num_tokens": 3887256.0, |
| "step": 342 |
| }, |
| { |
| "epoch": 4.343949044585988, |
| "grad_norm": 0.623961329460144, |
| "learning_rate": 7.852378812959227e-06, |
| "loss": 0.2392, |
| "mean_token_accuracy": 0.9496417343616486, |
| "num_tokens": 3898876.0, |
| "step": 343 |
| }, |
| { |
| "epoch": 4.356687898089172, |
| "grad_norm": 0.5371074676513672, |
| "learning_rate": 7.532733304655848e-06, |
| "loss": 0.2156, |
| "mean_token_accuracy": 0.9538998603820801, |
| "num_tokens": 3910522.0, |
| "step": 344 |
| }, |
| { |
| "epoch": 4.369426751592357, |
| "grad_norm": 0.598827600479126, |
| "learning_rate": 7.219474866207465e-06, |
| "loss": 0.2291, |
| "mean_token_accuracy": 0.9503605365753174, |
| "num_tokens": 3921730.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 4.382165605095541, |
| "grad_norm": 0.5664372444152832, |
| "learning_rate": 6.9126251355795864e-06, |
| "loss": 0.2132, |
| "mean_token_accuracy": 0.9563162922859192, |
| "num_tokens": 3933613.0, |
| "step": 346 |
| }, |
| { |
| "epoch": 4.3949044585987265, |
| "grad_norm": 0.5948131680488586, |
| "learning_rate": 6.612205308063646e-06, |
| "loss": 0.2415, |
| "mean_token_accuracy": 0.9487094283103943, |
| "num_tokens": 3945095.0, |
| "step": 347 |
| }, |
| { |
| "epoch": 4.407643312101911, |
| "grad_norm": 0.5984826683998108, |
| "learning_rate": 6.318236134812916e-06, |
| "loss": 0.2335, |
| "mean_token_accuracy": 0.9525950253009796, |
| "num_tokens": 3956565.0, |
| "step": 348 |
| }, |
| { |
| "epoch": 4.420382165605096, |
| "grad_norm": 0.6437399387359619, |
| "learning_rate": 6.030737921409169e-06, |
| "loss": 0.2526, |
| "mean_token_accuracy": 0.9473262429237366, |
| "num_tokens": 3967950.0, |
| "step": 349 |
| }, |
| { |
| "epoch": 4.43312101910828, |
| "grad_norm": 0.6472037434577942, |
| "learning_rate": 5.749730526460073e-06, |
| "loss": 0.24, |
| "mean_token_accuracy": 0.9503650963306427, |
| "num_tokens": 3979520.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 4.445859872611465, |
| "grad_norm": 0.6440314650535583, |
| "learning_rate": 5.475233360227516e-06, |
| "loss": 0.2465, |
| "mean_token_accuracy": 0.9471862018108368, |
| "num_tokens": 3990605.0, |
| "step": 351 |
| }, |
| { |
| "epoch": 4.45859872611465, |
| "grad_norm": 0.614966094493866, |
| "learning_rate": 5.20726538328683e-06, |
| "loss": 0.2366, |
| "mean_token_accuracy": 0.950160413980484, |
| "num_tokens": 4001897.0, |
| "step": 352 |
| }, |
| { |
| "epoch": 4.471337579617835, |
| "grad_norm": 0.530875563621521, |
| "learning_rate": 4.945845105217117e-06, |
| "loss": 0.2054, |
| "mean_token_accuracy": 0.9580708742141724, |
| "num_tokens": 4013030.0, |
| "step": 353 |
| }, |
| { |
| "epoch": 4.484076433121019, |
| "grad_norm": 0.588732123374939, |
| "learning_rate": 4.6909905833226966e-06, |
| "loss": 0.2314, |
| "mean_token_accuracy": 0.9539461433887482, |
| "num_tokens": 4024717.0, |
| "step": 354 |
| }, |
| { |
| "epoch": 4.496815286624204, |
| "grad_norm": 0.6098395586013794, |
| "learning_rate": 4.442719421385922e-06, |
| "loss": 0.245, |
| "mean_token_accuracy": 0.9490169584751129, |
| "num_tokens": 4036521.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 4.509554140127388, |
| "grad_norm": 0.568778932094574, |
| "learning_rate": 4.20104876845111e-06, |
| "loss": 0.2115, |
| "mean_token_accuracy": 0.9555296897888184, |
| "num_tokens": 4048246.0, |
| "step": 356 |
| }, |
| { |
| "epoch": 4.522292993630574, |
| "grad_norm": 0.6375371217727661, |
| "learning_rate": 3.965995317640025e-06, |
| "loss": 0.2176, |
| "mean_token_accuracy": 0.9533799290657043, |
| "num_tokens": 4059468.0, |
| "step": 357 |
| }, |
| { |
| "epoch": 4.535031847133758, |
| "grad_norm": 0.6353257894515991, |
| "learning_rate": 3.7375753049987973e-06, |
| "loss": 0.2524, |
| "mean_token_accuracy": 0.9476073980331421, |
| "num_tokens": 4071007.0, |
| "step": 358 |
| }, |
| { |
| "epoch": 4.547770700636943, |
| "grad_norm": 0.6253010034561157, |
| "learning_rate": 3.515804508376508e-06, |
| "loss": 0.2244, |
| "mean_token_accuracy": 0.952837735414505, |
| "num_tokens": 4081959.0, |
| "step": 359 |
| }, |
| { |
| "epoch": 4.560509554140127, |
| "grad_norm": 0.6389527320861816, |
| "learning_rate": 3.3006982463352766e-06, |
| "loss": 0.2497, |
| "mean_token_accuracy": 0.9464636743068695, |
| "num_tokens": 4093354.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 4.573248407643312, |
| "grad_norm": 0.6158127188682556, |
| "learning_rate": 3.092271377092215e-06, |
| "loss": 0.2594, |
| "mean_token_accuracy": 0.9450841546058655, |
| "num_tokens": 4105174.0, |
| "step": 361 |
| }, |
| { |
| "epoch": 4.585987261146497, |
| "grad_norm": 0.5516409277915955, |
| "learning_rate": 2.8905382974930172e-06, |
| "loss": 0.2004, |
| "mean_token_accuracy": 0.9575099050998688, |
| "num_tokens": 4116576.0, |
| "step": 362 |
| }, |
| { |
| "epoch": 4.598726114649682, |
| "grad_norm": 0.5847783088684082, |
| "learning_rate": 2.6955129420176196e-06, |
| "loss": 0.2139, |
| "mean_token_accuracy": 0.9543090164661407, |
| "num_tokens": 4127873.0, |
| "step": 363 |
| }, |
| { |
| "epoch": 4.611464968152866, |
| "grad_norm": 0.6172647476196289, |
| "learning_rate": 2.5072087818176382e-06, |
| "loss": 0.2242, |
| "mean_token_accuracy": 0.9529656767845154, |
| "num_tokens": 4138888.0, |
| "step": 364 |
| }, |
| { |
| "epoch": 4.624203821656051, |
| "grad_norm": 0.6086074709892273, |
| "learning_rate": 2.3256388237858807e-06, |
| "loss": 0.2351, |
| "mean_token_accuracy": 0.9496529996395111, |
| "num_tokens": 4150232.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 4.6369426751592355, |
| "grad_norm": 0.7375149130821228, |
| "learning_rate": 2.150815609657875e-06, |
| "loss": 0.2848, |
| "mean_token_accuracy": 0.9394731223583221, |
| "num_tokens": 4161733.0, |
| "step": 366 |
| }, |
| { |
| "epoch": 4.649681528662421, |
| "grad_norm": 0.6453984379768372, |
| "learning_rate": 1.9827512151456173e-06, |
| "loss": 0.2661, |
| "mean_token_accuracy": 0.9441668093204498, |
| "num_tokens": 4173910.0, |
| "step": 367 |
| }, |
| { |
| "epoch": 4.662420382165605, |
| "grad_norm": 0.600554347038269, |
| "learning_rate": 1.8214572491034198e-06, |
| "loss": 0.2115, |
| "mean_token_accuracy": 0.9533166885375977, |
| "num_tokens": 4185377.0, |
| "step": 368 |
| }, |
| { |
| "epoch": 4.67515923566879, |
| "grad_norm": 0.5804630517959595, |
| "learning_rate": 1.66694485272606e-06, |
| "loss": 0.211, |
| "mean_token_accuracy": 0.954418271780014, |
| "num_tokens": 4196586.0, |
| "step": 369 |
| }, |
| { |
| "epoch": 4.687898089171974, |
| "grad_norm": 0.5770214200019836, |
| "learning_rate": 1.5192246987791981e-06, |
| "loss": 0.201, |
| "mean_token_accuracy": 0.958386242389679, |
| "num_tokens": 4207564.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 4.7006369426751595, |
| "grad_norm": 0.6551446914672852, |
| "learning_rate": 1.378306990862177e-06, |
| "loss": 0.2509, |
| "mean_token_accuracy": 0.94569331407547, |
| "num_tokens": 4218790.0, |
| "step": 371 |
| }, |
| { |
| "epoch": 4.713375796178344, |
| "grad_norm": 0.6654523015022278, |
| "learning_rate": 1.2442014627032316e-06, |
| "loss": 0.2399, |
| "mean_token_accuracy": 0.9496492147445679, |
| "num_tokens": 4230117.0, |
| "step": 372 |
| }, |
| { |
| "epoch": 4.726114649681529, |
| "grad_norm": 0.588997483253479, |
| "learning_rate": 1.1169173774871478e-06, |
| "loss": 0.2224, |
| "mean_token_accuracy": 0.9534730911254883, |
| "num_tokens": 4241547.0, |
| "step": 373 |
| }, |
| { |
| "epoch": 4.738853503184713, |
| "grad_norm": 0.5755416750907898, |
| "learning_rate": 9.964635272153633e-07, |
| "loss": 0.225, |
| "mean_token_accuracy": 0.9524531066417694, |
| "num_tokens": 4253164.0, |
| "step": 374 |
| }, |
| { |
| "epoch": 4.751592356687898, |
| "grad_norm": 0.6713494062423706, |
| "learning_rate": 8.828482320987319e-07, |
| "loss": 0.2571, |
| "mean_token_accuracy": 0.9453714489936829, |
| "num_tokens": 4264634.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 4.764331210191083, |
| "grad_norm": 0.615914523601532, |
| "learning_rate": 7.760793399827937e-07, |
| "loss": 0.2152, |
| "mean_token_accuracy": 0.9523234069347382, |
| "num_tokens": 4275920.0, |
| "step": 376 |
| }, |
| { |
| "epoch": 4.777070063694268, |
| "grad_norm": 0.5669645071029663, |
| "learning_rate": 6.761642258056978e-07, |
| "loss": 0.2017, |
| "mean_token_accuracy": 0.9563316702842712, |
| "num_tokens": 4287045.0, |
| "step": 377 |
| }, |
| { |
| "epoch": 4.789808917197452, |
| "grad_norm": 0.5885363817214966, |
| "learning_rate": 5.831097910887873e-07, |
| "loss": 0.2226, |
| "mean_token_accuracy": 0.9541411101818085, |
| "num_tokens": 4298056.0, |
| "step": 378 |
| }, |
| { |
| "epoch": 4.802547770700637, |
| "grad_norm": 0.640458881855011, |
| "learning_rate": 4.969224634598591e-07, |
| "loss": 0.2358, |
| "mean_token_accuracy": 0.9503754377365112, |
| "num_tokens": 4309058.0, |
| "step": 379 |
| }, |
| { |
| "epoch": 4.8152866242038215, |
| "grad_norm": 0.5789880752563477, |
| "learning_rate": 4.176081962092182e-07, |
| "loss": 0.2127, |
| "mean_token_accuracy": 0.954579770565033, |
| "num_tokens": 4320492.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 4.828025477707007, |
| "grad_norm": 0.5396387577056885, |
| "learning_rate": 3.451724678784518e-07, |
| "loss": 0.1879, |
| "mean_token_accuracy": 0.9586823284626007, |
| "num_tokens": 4331497.0, |
| "step": 381 |
| }, |
| { |
| "epoch": 4.840764331210191, |
| "grad_norm": 0.5952228307723999, |
| "learning_rate": 2.7962028188198706e-07, |
| "loss": 0.2195, |
| "mean_token_accuracy": 0.9526137411594391, |
| "num_tokens": 4343022.0, |
| "step": 382 |
| }, |
| { |
| "epoch": 4.853503184713376, |
| "grad_norm": 0.6236734986305237, |
| "learning_rate": 2.2095616616150115e-07, |
| "loss": 0.2427, |
| "mean_token_accuracy": 0.9495434165000916, |
| "num_tokens": 4354393.0, |
| "step": 383 |
| }, |
| { |
| "epoch": 4.86624203821656, |
| "grad_norm": 0.5874990820884705, |
| "learning_rate": 1.6918417287318245e-07, |
| "loss": 0.2105, |
| "mean_token_accuracy": 0.9567264318466187, |
| "num_tokens": 4365580.0, |
| "step": 384 |
| }, |
| { |
| "epoch": 4.8789808917197455, |
| "grad_norm": 0.5601053833961487, |
| "learning_rate": 1.2430787810776555e-07, |
| "loss": 0.2181, |
| "mean_token_accuracy": 0.9536438584327698, |
| "num_tokens": 4376649.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 4.89171974522293, |
| "grad_norm": 0.688409149646759, |
| "learning_rate": 8.633038164358454e-08, |
| "loss": 0.2478, |
| "mean_token_accuracy": 0.9468058943748474, |
| "num_tokens": 4388351.0, |
| "step": 386 |
| }, |
| { |
| "epoch": 4.904458598726115, |
| "grad_norm": 0.5797482132911682, |
| "learning_rate": 5.5254306732444025e-08, |
| "loss": 0.2045, |
| "mean_token_accuracy": 0.9557230472564697, |
| "num_tokens": 4400015.0, |
| "step": 387 |
| }, |
| { |
| "epoch": 4.917197452229299, |
| "grad_norm": 0.5975958704948425, |
| "learning_rate": 3.1081799918375454e-08, |
| "loss": 0.2184, |
| "mean_token_accuracy": 0.9523274600505829, |
| "num_tokens": 4411248.0, |
| "step": 388 |
| }, |
| { |
| "epoch": 4.929936305732484, |
| "grad_norm": 0.5998685359954834, |
| "learning_rate": 1.3814530889433296e-08, |
| "loss": 0.2088, |
| "mean_token_accuracy": 0.9564402997493744, |
| "num_tokens": 4422081.0, |
| "step": 389 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "grad_norm": 0.6222056746482849, |
| "learning_rate": 3.453692362309635e-09, |
| "loss": 0.2291, |
| "mean_token_accuracy": 0.9509786069393158, |
| "num_tokens": 4433867.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 4.942675159235669, |
| "step": 390, |
| "total_flos": 2.6684669817153126e+17, |
| "train_loss": 0.9054459434289198, |
| "train_runtime": 756.179, |
| "train_samples_per_second": 33.061, |
| "train_steps_per_second": 0.516 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 390, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.6684669817153126e+17, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|