| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 3.0, |
| "eval_steps": 500, |
| "global_step": 237, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.012658227848101266, |
| "grad_norm": 7.577828407287598, |
| "learning_rate": 0.0, |
| "loss": 1.9571, |
| "mean_token_accuracy": 0.6694959402084351, |
| "num_tokens": 7722.0, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.02531645569620253, |
| "grad_norm": 7.746953964233398, |
| "learning_rate": 2.5e-05, |
| "loss": 1.9398, |
| "mean_token_accuracy": 0.676712691783905, |
| "num_tokens": 15318.0, |
| "step": 2 |
| }, |
| { |
| "epoch": 0.0379746835443038, |
| "grad_norm": 4.52789831161499, |
| "learning_rate": 5e-05, |
| "loss": 1.7311, |
| "mean_token_accuracy": 0.6810978055000305, |
| "num_tokens": 23143.0, |
| "step": 3 |
| }, |
| { |
| "epoch": 0.05063291139240506, |
| "grad_norm": 2.9054675102233887, |
| "learning_rate": 7.500000000000001e-05, |
| "loss": 1.3154, |
| "mean_token_accuracy": 0.7156617045402527, |
| "num_tokens": 30786.0, |
| "step": 4 |
| }, |
| { |
| "epoch": 0.06329113924050633, |
| "grad_norm": 1.708419919013977, |
| "learning_rate": 0.0001, |
| "loss": 1.0543, |
| "mean_token_accuracy": 0.793462336063385, |
| "num_tokens": 38345.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.0759493670886076, |
| "grad_norm": 4.625662326812744, |
| "learning_rate": 0.000125, |
| "loss": 0.8803, |
| "mean_token_accuracy": 0.8147608041763306, |
| "num_tokens": 45956.0, |
| "step": 6 |
| }, |
| { |
| "epoch": 0.08860759493670886, |
| "grad_norm": 11.903258323669434, |
| "learning_rate": 0.00015000000000000001, |
| "loss": 0.8083, |
| "mean_token_accuracy": 0.8231238126754761, |
| "num_tokens": 53562.0, |
| "step": 7 |
| }, |
| { |
| "epoch": 0.10126582278481013, |
| "grad_norm": 7.953157901763916, |
| "learning_rate": 0.000175, |
| "loss": 0.7792, |
| "mean_token_accuracy": 0.8260988593101501, |
| "num_tokens": 60929.0, |
| "step": 8 |
| }, |
| { |
| "epoch": 0.11392405063291139, |
| "grad_norm": 3.9451382160186768, |
| "learning_rate": 0.0002, |
| "loss": 0.7858, |
| "mean_token_accuracy": 0.8231524229049683, |
| "num_tokens": 68327.0, |
| "step": 9 |
| }, |
| { |
| "epoch": 0.12658227848101267, |
| "grad_norm": 7.63812780380249, |
| "learning_rate": 0.00019999058994907564, |
| "loss": 0.8194, |
| "mean_token_accuracy": 0.8158359527587891, |
| "num_tokens": 75754.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.13924050632911392, |
| "grad_norm": 1.7502692937850952, |
| "learning_rate": 0.0001999623615672837, |
| "loss": 0.7591, |
| "mean_token_accuracy": 0.8333558440208435, |
| "num_tokens": 83217.0, |
| "step": 11 |
| }, |
| { |
| "epoch": 0.1518987341772152, |
| "grad_norm": 1.258649230003357, |
| "learning_rate": 0.00019991532016723439, |
| "loss": 0.7988, |
| "mean_token_accuracy": 0.8254917860031128, |
| "num_tokens": 90805.0, |
| "step": 12 |
| }, |
| { |
| "epoch": 0.16455696202531644, |
| "grad_norm": 0.4300090968608856, |
| "learning_rate": 0.00019984947460216707, |
| "loss": 0.7602, |
| "mean_token_accuracy": 0.8290643692016602, |
| "num_tokens": 98404.0, |
| "step": 13 |
| }, |
| { |
| "epoch": 0.17721518987341772, |
| "grad_norm": 6.66930627822876, |
| "learning_rate": 0.00019976483726428422, |
| "loss": 0.7419, |
| "mean_token_accuracy": 0.8308157324790955, |
| "num_tokens": 106081.0, |
| "step": 14 |
| }, |
| { |
| "epoch": 0.189873417721519, |
| "grad_norm": 0.6765839457511902, |
| "learning_rate": 0.00019966142408241901, |
| "loss": 0.8115, |
| "mean_token_accuracy": 0.8222697973251343, |
| "num_tokens": 113617.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.20253164556962025, |
| "grad_norm": 5.244386672973633, |
| "learning_rate": 0.00019953925451903756, |
| "loss": 0.7769, |
| "mean_token_accuracy": 0.8213022351264954, |
| "num_tokens": 121314.0, |
| "step": 16 |
| }, |
| { |
| "epoch": 0.21518987341772153, |
| "grad_norm": 0.5631109476089478, |
| "learning_rate": 0.00019939835156657616, |
| "loss": 0.7315, |
| "mean_token_accuracy": 0.8379343748092651, |
| "num_tokens": 128659.0, |
| "step": 17 |
| }, |
| { |
| "epoch": 0.22784810126582278, |
| "grad_norm": 0.5312209129333496, |
| "learning_rate": 0.00019923874174311394, |
| "loss": 0.7124, |
| "mean_token_accuracy": 0.835067868232727, |
| "num_tokens": 136314.0, |
| "step": 18 |
| }, |
| { |
| "epoch": 0.24050632911392406, |
| "grad_norm": 0.664734423160553, |
| "learning_rate": 0.00019906045508738228, |
| "loss": 0.7232, |
| "mean_token_accuracy": 0.8314966559410095, |
| "num_tokens": 144182.0, |
| "step": 19 |
| }, |
| { |
| "epoch": 0.25316455696202533, |
| "grad_norm": 0.4895744025707245, |
| "learning_rate": 0.00019886352515311134, |
| "loss": 0.783, |
| "mean_token_accuracy": 0.8221429586410522, |
| "num_tokens": 152095.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.26582278481012656, |
| "grad_norm": 0.7920514345169067, |
| "learning_rate": 0.00019864798900271532, |
| "loss": 0.7075, |
| "mean_token_accuracy": 0.8389923572540283, |
| "num_tokens": 159463.0, |
| "step": 21 |
| }, |
| { |
| "epoch": 0.27848101265822783, |
| "grad_norm": 0.8280817866325378, |
| "learning_rate": 0.00019841388720031727, |
| "loss": 0.6889, |
| "mean_token_accuracy": 0.8389334678649902, |
| "num_tokens": 166878.0, |
| "step": 22 |
| }, |
| { |
| "epoch": 0.2911392405063291, |
| "grad_norm": 0.38697078824043274, |
| "learning_rate": 0.00019816126380411476, |
| "loss": 0.673, |
| "mean_token_accuracy": 0.8453608155250549, |
| "num_tokens": 174314.0, |
| "step": 23 |
| }, |
| { |
| "epoch": 0.3037974683544304, |
| "grad_norm": 0.47077956795692444, |
| "learning_rate": 0.00019789016635808837, |
| "loss": 0.7354, |
| "mean_token_accuracy": 0.8276225328445435, |
| "num_tokens": 181966.0, |
| "step": 24 |
| }, |
| { |
| "epoch": 0.31645569620253167, |
| "grad_norm": 0.5773133039474487, |
| "learning_rate": 0.00019760064588305345, |
| "loss": 0.7412, |
| "mean_token_accuracy": 0.8243722915649414, |
| "num_tokens": 189637.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.3291139240506329, |
| "grad_norm": 0.5629377961158752, |
| "learning_rate": 0.0001972927568670583, |
| "loss": 0.6763, |
| "mean_token_accuracy": 0.8467550873756409, |
| "num_tokens": 196866.0, |
| "step": 26 |
| }, |
| { |
| "epoch": 0.34177215189873417, |
| "grad_norm": 0.4058995544910431, |
| "learning_rate": 0.00019696655725512933, |
| "loss": 0.7035, |
| "mean_token_accuracy": 0.8346715569496155, |
| "num_tokens": 204527.0, |
| "step": 27 |
| }, |
| { |
| "epoch": 0.35443037974683544, |
| "grad_norm": 0.3507729172706604, |
| "learning_rate": 0.00019662210843836574, |
| "loss": 0.7462, |
| "mean_token_accuracy": 0.8278258442878723, |
| "num_tokens": 212217.0, |
| "step": 28 |
| }, |
| { |
| "epoch": 0.3670886075949367, |
| "grad_norm": 0.49514463543891907, |
| "learning_rate": 0.00019625947524238563, |
| "loss": 0.6374, |
| "mean_token_accuracy": 0.8493860960006714, |
| "num_tokens": 219611.0, |
| "step": 29 |
| }, |
| { |
| "epoch": 0.379746835443038, |
| "grad_norm": 0.5946100950241089, |
| "learning_rate": 0.0001958787259151258, |
| "loss": 0.6899, |
| "mean_token_accuracy": 0.8388254046440125, |
| "num_tokens": 227201.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.3924050632911392, |
| "grad_norm": 0.5284402966499329, |
| "learning_rate": 0.0001954799321139975, |
| "loss": 0.6359, |
| "mean_token_accuracy": 0.849815845489502, |
| "num_tokens": 234596.0, |
| "step": 31 |
| }, |
| { |
| "epoch": 0.4050632911392405, |
| "grad_norm": 0.3717970848083496, |
| "learning_rate": 0.00019506316889240027, |
| "loss": 0.6561, |
| "mean_token_accuracy": 0.8414534330368042, |
| "num_tokens": 242008.0, |
| "step": 32 |
| }, |
| { |
| "epoch": 0.4177215189873418, |
| "grad_norm": 0.3561764061450958, |
| "learning_rate": 0.0001946285146855968, |
| "loss": 0.6832, |
| "mean_token_accuracy": 0.8376168012619019, |
| "num_tokens": 249776.0, |
| "step": 33 |
| }, |
| { |
| "epoch": 0.43037974683544306, |
| "grad_norm": 0.3912392854690552, |
| "learning_rate": 0.00019417605129595157, |
| "loss": 0.6688, |
| "mean_token_accuracy": 0.8432945609092712, |
| "num_tokens": 257319.0, |
| "step": 34 |
| }, |
| { |
| "epoch": 0.4430379746835443, |
| "grad_norm": 0.45518746972084045, |
| "learning_rate": 0.0001937058638775353, |
| "loss": 0.6252, |
| "mean_token_accuracy": 0.8525184392929077, |
| "num_tokens": 264828.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.45569620253164556, |
| "grad_norm": 0.4275685250759125, |
| "learning_rate": 0.00019321804092009906, |
| "loss": 0.6196, |
| "mean_token_accuracy": 0.8575549721717834, |
| "num_tokens": 272172.0, |
| "step": 36 |
| }, |
| { |
| "epoch": 0.46835443037974683, |
| "grad_norm": 0.36319318413734436, |
| "learning_rate": 0.00019271267423242024, |
| "loss": 0.6789, |
| "mean_token_accuracy": 0.8397783041000366, |
| "num_tokens": 279813.0, |
| "step": 37 |
| }, |
| { |
| "epoch": 0.4810126582278481, |
| "grad_norm": 0.43757617473602295, |
| "learning_rate": 0.0001921898589250242, |
| "loss": 0.6371, |
| "mean_token_accuracy": 0.8450391888618469, |
| "num_tokens": 287537.0, |
| "step": 38 |
| }, |
| { |
| "epoch": 0.4936708860759494, |
| "grad_norm": 0.39345020055770874, |
| "learning_rate": 0.00019164969339228422, |
| "loss": 0.6252, |
| "mean_token_accuracy": 0.8488776087760925, |
| "num_tokens": 295085.0, |
| "step": 39 |
| }, |
| { |
| "epoch": 0.5063291139240507, |
| "grad_norm": 0.39008787274360657, |
| "learning_rate": 0.00019109227929390378, |
| "loss": 0.6749, |
| "mean_token_accuracy": 0.840212881565094, |
| "num_tokens": 302853.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.5189873417721519, |
| "grad_norm": 0.40397143363952637, |
| "learning_rate": 0.00019051772153578389, |
| "loss": 0.6502, |
| "mean_token_accuracy": 0.843741774559021, |
| "num_tokens": 310507.0, |
| "step": 41 |
| }, |
| { |
| "epoch": 0.5316455696202531, |
| "grad_norm": 0.34576931595802307, |
| "learning_rate": 0.00018992612825027976, |
| "loss": 0.5663, |
| "mean_token_accuracy": 0.8624165654182434, |
| "num_tokens": 317912.0, |
| "step": 42 |
| }, |
| { |
| "epoch": 0.5443037974683544, |
| "grad_norm": 0.4292350113391876, |
| "learning_rate": 0.00018931761077585035, |
| "loss": 0.6421, |
| "mean_token_accuracy": 0.8521012663841248, |
| "num_tokens": 325400.0, |
| "step": 43 |
| }, |
| { |
| "epoch": 0.5569620253164557, |
| "grad_norm": 0.3893992602825165, |
| "learning_rate": 0.00018869228363610404, |
| "loss": 0.603, |
| "mean_token_accuracy": 0.8546313047409058, |
| "num_tokens": 333086.0, |
| "step": 44 |
| }, |
| { |
| "epoch": 0.569620253164557, |
| "grad_norm": 0.3626430928707123, |
| "learning_rate": 0.00018805026451824546, |
| "loss": 0.5504, |
| "mean_token_accuracy": 0.86698979139328, |
| "num_tokens": 340578.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.5822784810126582, |
| "grad_norm": 0.4151477515697479, |
| "learning_rate": 0.00018739167425092644, |
| "loss": 0.6749, |
| "mean_token_accuracy": 0.8368580341339111, |
| "num_tokens": 348586.0, |
| "step": 46 |
| }, |
| { |
| "epoch": 0.5949367088607594, |
| "grad_norm": 0.3864465653896332, |
| "learning_rate": 0.00018671663678150607, |
| "loss": 0.5704, |
| "mean_token_accuracy": 0.8640350699424744, |
| "num_tokens": 356174.0, |
| "step": 47 |
| }, |
| { |
| "epoch": 0.6075949367088608, |
| "grad_norm": 0.43347352743148804, |
| "learning_rate": 0.0001860252791527236, |
| "loss": 0.5495, |
| "mean_token_accuracy": 0.8597859144210815, |
| "num_tokens": 363805.0, |
| "step": 48 |
| }, |
| { |
| "epoch": 0.620253164556962, |
| "grad_norm": 0.4836398661136627, |
| "learning_rate": 0.00018531773147878895, |
| "loss": 0.6308, |
| "mean_token_accuracy": 0.8539444208145142, |
| "num_tokens": 371462.0, |
| "step": 49 |
| }, |
| { |
| "epoch": 0.6329113924050633, |
| "grad_norm": 0.4612779915332794, |
| "learning_rate": 0.00018459412692089494, |
| "loss": 0.5884, |
| "mean_token_accuracy": 0.8596022725105286, |
| "num_tokens": 379019.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.6455696202531646, |
| "grad_norm": 0.4270411431789398, |
| "learning_rate": 0.00018385460166215638, |
| "loss": 0.5495, |
| "mean_token_accuracy": 0.8687131404876709, |
| "num_tokens": 386380.0, |
| "step": 51 |
| }, |
| { |
| "epoch": 0.6582278481012658, |
| "grad_norm": 0.4124862849712372, |
| "learning_rate": 0.00018309929488198012, |
| "loss": 0.5931, |
| "mean_token_accuracy": 0.8600296378135681, |
| "num_tokens": 393867.0, |
| "step": 52 |
| }, |
| { |
| "epoch": 0.6708860759493671, |
| "grad_norm": 0.3761177361011505, |
| "learning_rate": 0.00018232834872987147, |
| "loss": 0.585, |
| "mean_token_accuracy": 0.863766610622406, |
| "num_tokens": 401609.0, |
| "step": 53 |
| }, |
| { |
| "epoch": 0.6835443037974683, |
| "grad_norm": 0.3798786699771881, |
| "learning_rate": 0.0001815419082986815, |
| "loss": 0.6038, |
| "mean_token_accuracy": 0.8549598455429077, |
| "num_tokens": 409264.0, |
| "step": 54 |
| }, |
| { |
| "epoch": 0.6962025316455697, |
| "grad_norm": 0.3858072757720947, |
| "learning_rate": 0.00018074012159730032, |
| "loss": 0.5424, |
| "mean_token_accuracy": 0.8691484928131104, |
| "num_tokens": 416527.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.7088607594936709, |
| "grad_norm": 0.39073118567466736, |
| "learning_rate": 0.00017992313952280172, |
| "loss": 0.506, |
| "mean_token_accuracy": 0.8774666786193848, |
| "num_tokens": 424091.0, |
| "step": 56 |
| }, |
| { |
| "epoch": 0.7215189873417721, |
| "grad_norm": 0.4660295844078064, |
| "learning_rate": 0.00017909111583204422, |
| "loss": 0.5728, |
| "mean_token_accuracy": 0.8573468327522278, |
| "num_tokens": 431859.0, |
| "step": 57 |
| }, |
| { |
| "epoch": 0.7341772151898734, |
| "grad_norm": 0.45270058512687683, |
| "learning_rate": 0.0001782442071127338, |
| "loss": 0.5809, |
| "mean_token_accuracy": 0.8605116009712219, |
| "num_tokens": 439429.0, |
| "step": 58 |
| }, |
| { |
| "epoch": 0.7468354430379747, |
| "grad_norm": 0.44151806831359863, |
| "learning_rate": 0.00017738257275395404, |
| "loss": 0.6342, |
| "mean_token_accuracy": 0.8478041291236877, |
| "num_tokens": 447417.0, |
| "step": 59 |
| }, |
| { |
| "epoch": 0.759493670886076, |
| "grad_norm": 0.40675118565559387, |
| "learning_rate": 0.0001765063749161688, |
| "loss": 0.5878, |
| "mean_token_accuracy": 0.8633121848106384, |
| "num_tokens": 455053.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.7721518987341772, |
| "grad_norm": 0.42426082491874695, |
| "learning_rate": 0.00017561577850070355, |
| "loss": 0.5056, |
| "mean_token_accuracy": 0.8747982978820801, |
| "num_tokens": 462553.0, |
| "step": 61 |
| }, |
| { |
| "epoch": 0.7848101265822784, |
| "grad_norm": 0.5047997832298279, |
| "learning_rate": 0.00017471095111871074, |
| "loss": 0.5386, |
| "mean_token_accuracy": 0.8677419424057007, |
| "num_tokens": 470057.0, |
| "step": 62 |
| }, |
| { |
| "epoch": 0.7974683544303798, |
| "grad_norm": 0.4321729242801666, |
| "learning_rate": 0.00017379206305962526, |
| "loss": 0.4742, |
| "mean_token_accuracy": 0.8855810165405273, |
| "num_tokens": 477410.0, |
| "step": 63 |
| }, |
| { |
| "epoch": 0.810126582278481, |
| "grad_norm": 0.43735846877098083, |
| "learning_rate": 0.00017285928725911562, |
| "loss": 0.5114, |
| "mean_token_accuracy": 0.8768270015716553, |
| "num_tokens": 485000.0, |
| "step": 64 |
| }, |
| { |
| "epoch": 0.8227848101265823, |
| "grad_norm": 0.4349932074546814, |
| "learning_rate": 0.00017191279926653761, |
| "loss": 0.4947, |
| "mean_token_accuracy": 0.8799254298210144, |
| "num_tokens": 492576.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.8354430379746836, |
| "grad_norm": 0.46583646535873413, |
| "learning_rate": 0.00017095277721189528, |
| "loss": 0.5472, |
| "mean_token_accuracy": 0.8641451001167297, |
| "num_tokens": 500413.0, |
| "step": 66 |
| }, |
| { |
| "epoch": 0.8481012658227848, |
| "grad_norm": 0.4772394597530365, |
| "learning_rate": 0.00016997940177231722, |
| "loss": 0.5716, |
| "mean_token_accuracy": 0.8625654578208923, |
| "num_tokens": 508117.0, |
| "step": 67 |
| }, |
| { |
| "epoch": 0.8607594936708861, |
| "grad_norm": 0.47736912965774536, |
| "learning_rate": 0.00016899285613805246, |
| "loss": 0.5048, |
| "mean_token_accuracy": 0.8752148151397705, |
| "num_tokens": 515746.0, |
| "step": 68 |
| }, |
| { |
| "epoch": 0.8734177215189873, |
| "grad_norm": 0.4343780279159546, |
| "learning_rate": 0.00016799332597799413, |
| "loss": 0.4687, |
| "mean_token_accuracy": 0.8839372396469116, |
| "num_tokens": 523013.0, |
| "step": 69 |
| }, |
| { |
| "epoch": 0.8860759493670886, |
| "grad_norm": 0.44280242919921875, |
| "learning_rate": 0.0001669809994047364, |
| "loss": 0.4772, |
| "mean_token_accuracy": 0.8798643946647644, |
| "num_tokens": 530452.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.8987341772151899, |
| "grad_norm": 0.4641714096069336, |
| "learning_rate": 0.00016595606693917142, |
| "loss": 0.4602, |
| "mean_token_accuracy": 0.8870418071746826, |
| "num_tokens": 537855.0, |
| "step": 71 |
| }, |
| { |
| "epoch": 0.9113924050632911, |
| "grad_norm": 0.48911163210868835, |
| "learning_rate": 0.00016491872147463306, |
| "loss": 0.5123, |
| "mean_token_accuracy": 0.8701679706573486, |
| "num_tokens": 545421.0, |
| "step": 72 |
| }, |
| { |
| "epoch": 0.9240506329113924, |
| "grad_norm": 0.43602073192596436, |
| "learning_rate": 0.00016386915824059427, |
| "loss": 0.4066, |
| "mean_token_accuracy": 0.8927801847457886, |
| "num_tokens": 552909.0, |
| "step": 73 |
| }, |
| { |
| "epoch": 0.9367088607594937, |
| "grad_norm": 0.48829028010368347, |
| "learning_rate": 0.00016280757476592466, |
| "loss": 0.4922, |
| "mean_token_accuracy": 0.8765687942504883, |
| "num_tokens": 560702.0, |
| "step": 74 |
| }, |
| { |
| "epoch": 0.9493670886075949, |
| "grad_norm": 0.47516176104545593, |
| "learning_rate": 0.00016173417084171536, |
| "loss": 0.4346, |
| "mean_token_accuracy": 0.8902259469032288, |
| "num_tokens": 568245.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.9620253164556962, |
| "grad_norm": 0.49728158116340637, |
| "learning_rate": 0.0001606491484836782, |
| "loss": 0.4271, |
| "mean_token_accuracy": 0.8917593955993652, |
| "num_tokens": 575857.0, |
| "step": 76 |
| }, |
| { |
| "epoch": 0.9746835443037974, |
| "grad_norm": 0.46857449412345886, |
| "learning_rate": 0.00015955271189412598, |
| "loss": 0.4059, |
| "mean_token_accuracy": 0.8973404169082642, |
| "num_tokens": 583441.0, |
| "step": 77 |
| }, |
| { |
| "epoch": 0.9873417721518988, |
| "grad_norm": 0.49021583795547485, |
| "learning_rate": 0.00015844506742354164, |
| "loss": 0.4636, |
| "mean_token_accuracy": 0.8833048343658447, |
| "num_tokens": 591106.0, |
| "step": 78 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 0.46990546584129333, |
| "learning_rate": 0.00015732642353174259, |
| "loss": 0.4786, |
| "mean_token_accuracy": 0.8784138560295105, |
| "num_tokens": 598786.0, |
| "step": 79 |
| }, |
| { |
| "epoch": 1.0126582278481013, |
| "grad_norm": 0.4664880633354187, |
| "learning_rate": 0.00015619699074864864, |
| "loss": 0.337, |
| "mean_token_accuracy": 0.9137563109397888, |
| "num_tokens": 606352.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 1.0253164556962024, |
| "grad_norm": 0.51947021484375, |
| "learning_rate": 0.00015505698163465986, |
| "loss": 0.325, |
| "mean_token_accuracy": 0.9177552461624146, |
| "num_tokens": 613918.0, |
| "step": 81 |
| }, |
| { |
| "epoch": 1.0379746835443038, |
| "grad_norm": 0.6177846193313599, |
| "learning_rate": 0.00015390661074065256, |
| "loss": 0.2845, |
| "mean_token_accuracy": 0.9252744317054749, |
| "num_tokens": 621543.0, |
| "step": 82 |
| }, |
| { |
| "epoch": 1.0506329113924051, |
| "grad_norm": 0.6303501725196838, |
| "learning_rate": 0.00015274609456760073, |
| "loss": 0.3447, |
| "mean_token_accuracy": 0.9104577898979187, |
| "num_tokens": 629056.0, |
| "step": 83 |
| }, |
| { |
| "epoch": 1.0632911392405062, |
| "grad_norm": 0.4975242018699646, |
| "learning_rate": 0.00015157565152583002, |
| "loss": 0.2811, |
| "mean_token_accuracy": 0.9240351915359497, |
| "num_tokens": 636505.0, |
| "step": 84 |
| }, |
| { |
| "epoch": 1.0759493670886076, |
| "grad_norm": 0.4337922930717468, |
| "learning_rate": 0.00015039550189391298, |
| "loss": 0.2779, |
| "mean_token_accuracy": 0.9240472912788391, |
| "num_tokens": 644100.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 1.0886075949367089, |
| "grad_norm": 0.4337831437587738, |
| "learning_rate": 0.0001492058677772123, |
| "loss": 0.2813, |
| "mean_token_accuracy": 0.9259702563285828, |
| "num_tokens": 651688.0, |
| "step": 86 |
| }, |
| { |
| "epoch": 1.1012658227848102, |
| "grad_norm": 0.5133988261222839, |
| "learning_rate": 0.00014800697306608044, |
| "loss": 0.3357, |
| "mean_token_accuracy": 0.9157242774963379, |
| "num_tokens": 659180.0, |
| "step": 87 |
| }, |
| { |
| "epoch": 1.1139240506329113, |
| "grad_norm": 0.5234411954879761, |
| "learning_rate": 0.00014679904339372302, |
| "loss": 0.3015, |
| "mean_token_accuracy": 0.9213018417358398, |
| "num_tokens": 666741.0, |
| "step": 88 |
| }, |
| { |
| "epoch": 1.1265822784810127, |
| "grad_norm": 0.48323073983192444, |
| "learning_rate": 0.0001455823060937347, |
| "loss": 0.2736, |
| "mean_token_accuracy": 0.9301171898841858, |
| "num_tokens": 674060.0, |
| "step": 89 |
| }, |
| { |
| "epoch": 1.139240506329114, |
| "grad_norm": 0.4819142520427704, |
| "learning_rate": 0.00014435699015731448, |
| "loss": 0.2829, |
| "mean_token_accuracy": 0.9262295365333557, |
| "num_tokens": 681566.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 1.1518987341772151, |
| "grad_norm": 0.48243483901023865, |
| "learning_rate": 0.00014312332619016965, |
| "loss": 0.3003, |
| "mean_token_accuracy": 0.9243434071540833, |
| "num_tokens": 689283.0, |
| "step": 91 |
| }, |
| { |
| "epoch": 1.1645569620253164, |
| "grad_norm": 0.4841754734516144, |
| "learning_rate": 0.00014188154636911524, |
| "loss": 0.2976, |
| "mean_token_accuracy": 0.9215511679649353, |
| "num_tokens": 697212.0, |
| "step": 92 |
| }, |
| { |
| "epoch": 1.1772151898734178, |
| "grad_norm": 0.4778158962726593, |
| "learning_rate": 0.00014063188439837832, |
| "loss": 0.2755, |
| "mean_token_accuracy": 0.9268808960914612, |
| "num_tokens": 704839.0, |
| "step": 93 |
| }, |
| { |
| "epoch": 1.189873417721519, |
| "grad_norm": 0.5948532223701477, |
| "learning_rate": 0.0001393745754656146, |
| "loss": 0.2929, |
| "mean_token_accuracy": 0.9211409687995911, |
| "num_tokens": 712055.0, |
| "step": 94 |
| }, |
| { |
| "epoch": 1.2025316455696202, |
| "grad_norm": 0.4850385785102844, |
| "learning_rate": 0.00013810985619764572, |
| "loss": 0.2911, |
| "mean_token_accuracy": 0.9238942861557007, |
| "num_tokens": 719648.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 1.2151898734177216, |
| "grad_norm": 0.46476173400878906, |
| "learning_rate": 0.00013683796461592604, |
| "loss": 0.2636, |
| "mean_token_accuracy": 0.930665910243988, |
| "num_tokens": 727010.0, |
| "step": 96 |
| }, |
| { |
| "epoch": 1.2278481012658227, |
| "grad_norm": 0.5223667025566101, |
| "learning_rate": 0.00013555914009174663, |
| "loss": 0.2572, |
| "mean_token_accuracy": 0.9288017153739929, |
| "num_tokens": 734518.0, |
| "step": 97 |
| }, |
| { |
| "epoch": 1.240506329113924, |
| "grad_norm": 0.4877527058124542, |
| "learning_rate": 0.00013427362330118543, |
| "loss": 0.2504, |
| "mean_token_accuracy": 0.9308496713638306, |
| "num_tokens": 742232.0, |
| "step": 98 |
| }, |
| { |
| "epoch": 1.2531645569620253, |
| "grad_norm": 0.6950773000717163, |
| "learning_rate": 0.00013298165617981172, |
| "loss": 0.3101, |
| "mean_token_accuracy": 0.9148434400558472, |
| "num_tokens": 749929.0, |
| "step": 99 |
| }, |
| { |
| "epoch": 1.2658227848101267, |
| "grad_norm": 0.44876712560653687, |
| "learning_rate": 0.0001316834818771535, |
| "loss": 0.2368, |
| "mean_token_accuracy": 0.9370440244674683, |
| "num_tokens": 757395.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 1.2784810126582278, |
| "grad_norm": 0.4970650374889374, |
| "learning_rate": 0.00013037934471093682, |
| "loss": 0.2759, |
| "mean_token_accuracy": 0.9289446473121643, |
| "num_tokens": 765115.0, |
| "step": 101 |
| }, |
| { |
| "epoch": 1.2911392405063291, |
| "grad_norm": 0.4088219404220581, |
| "learning_rate": 0.00012906949012110456, |
| "loss": 0.2565, |
| "mean_token_accuracy": 0.9364038109779358, |
| "num_tokens": 772648.0, |
| "step": 102 |
| }, |
| { |
| "epoch": 1.3037974683544304, |
| "grad_norm": 0.4770132303237915, |
| "learning_rate": 0.00012775416462362457, |
| "loss": 0.2995, |
| "mean_token_accuracy": 0.9228748083114624, |
| "num_tokens": 780323.0, |
| "step": 103 |
| }, |
| { |
| "epoch": 1.3164556962025316, |
| "grad_norm": 0.4587569832801819, |
| "learning_rate": 0.00012643361576409516, |
| "loss": 0.261, |
| "mean_token_accuracy": 0.9282762408256531, |
| "num_tokens": 787888.0, |
| "step": 104 |
| }, |
| { |
| "epoch": 1.3291139240506329, |
| "grad_norm": 0.46888846158981323, |
| "learning_rate": 0.00012510809207115666, |
| "loss": 0.2697, |
| "mean_token_accuracy": 0.9307641386985779, |
| "num_tokens": 795477.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 1.3417721518987342, |
| "grad_norm": 0.4652051627635956, |
| "learning_rate": 0.00012377784300971807, |
| "loss": 0.2347, |
| "mean_token_accuracy": 0.9410588145256042, |
| "num_tokens": 803040.0, |
| "step": 106 |
| }, |
| { |
| "epoch": 1.3544303797468356, |
| "grad_norm": 0.5084942579269409, |
| "learning_rate": 0.00012244311893400763, |
| "loss": 0.2555, |
| "mean_token_accuracy": 0.9363048672676086, |
| "num_tokens": 810687.0, |
| "step": 107 |
| }, |
| { |
| "epoch": 1.3670886075949367, |
| "grad_norm": 0.5197248458862305, |
| "learning_rate": 0.00012110417104045575, |
| "loss": 0.2333, |
| "mean_token_accuracy": 0.9379802942276001, |
| "num_tokens": 818168.0, |
| "step": 108 |
| }, |
| { |
| "epoch": 1.379746835443038, |
| "grad_norm": 0.5095017552375793, |
| "learning_rate": 0.00011976125132041974, |
| "loss": 0.2494, |
| "mean_token_accuracy": 0.9335058331489563, |
| "num_tokens": 825962.0, |
| "step": 109 |
| }, |
| { |
| "epoch": 1.3924050632911391, |
| "grad_norm": 0.4584541618824005, |
| "learning_rate": 0.00011841461251275867, |
| "loss": 0.2747, |
| "mean_token_accuracy": 0.9289917945861816, |
| "num_tokens": 833842.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 1.4050632911392404, |
| "grad_norm": 0.4197942018508911, |
| "learning_rate": 0.0001170645080562676, |
| "loss": 0.2425, |
| "mean_token_accuracy": 0.9401321411132812, |
| "num_tokens": 841172.0, |
| "step": 111 |
| }, |
| { |
| "epoch": 1.4177215189873418, |
| "grad_norm": 0.4704379439353943, |
| "learning_rate": 0.00011571119204198037, |
| "loss": 0.2348, |
| "mean_token_accuracy": 0.9371610283851624, |
| "num_tokens": 848795.0, |
| "step": 112 |
| }, |
| { |
| "epoch": 1.4303797468354431, |
| "grad_norm": 0.47736111283302307, |
| "learning_rate": 0.00011435491916534919, |
| "loss": 0.2604, |
| "mean_token_accuracy": 0.9346008896827698, |
| "num_tokens": 856275.0, |
| "step": 113 |
| }, |
| { |
| "epoch": 1.4430379746835442, |
| "grad_norm": 0.44608280062675476, |
| "learning_rate": 0.00011299594467831078, |
| "loss": 0.228, |
| "mean_token_accuracy": 0.9441589117050171, |
| "num_tokens": 863538.0, |
| "step": 114 |
| }, |
| { |
| "epoch": 1.4556962025316456, |
| "grad_norm": 0.4609827995300293, |
| "learning_rate": 0.00011163452434124773, |
| "loss": 0.2174, |
| "mean_token_accuracy": 0.9422593116760254, |
| "num_tokens": 871153.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 1.4683544303797469, |
| "grad_norm": 0.49709534645080566, |
| "learning_rate": 0.00011027091437485404, |
| "loss": 0.2661, |
| "mean_token_accuracy": 0.9356223344802856, |
| "num_tokens": 878673.0, |
| "step": 116 |
| }, |
| { |
| "epoch": 1.481012658227848, |
| "grad_norm": 0.5192921161651611, |
| "learning_rate": 0.00010890537141191417, |
| "loss": 0.2455, |
| "mean_token_accuracy": 0.9369285702705383, |
| "num_tokens": 886284.0, |
| "step": 117 |
| }, |
| { |
| "epoch": 1.4936708860759493, |
| "grad_norm": 0.4980919361114502, |
| "learning_rate": 0.00010753815244900458, |
| "loss": 0.2275, |
| "mean_token_accuracy": 0.9405483603477478, |
| "num_tokens": 893934.0, |
| "step": 118 |
| }, |
| { |
| "epoch": 1.5063291139240507, |
| "grad_norm": 0.5131703019142151, |
| "learning_rate": 0.00010616951479812658, |
| "loss": 0.2225, |
| "mean_token_accuracy": 0.9432948231697083, |
| "num_tokens": 901440.0, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.518987341772152, |
| "grad_norm": 0.4802223742008209, |
| "learning_rate": 0.00010479971603828, |
| "loss": 0.2342, |
| "mean_token_accuracy": 0.9367021322250366, |
| "num_tokens": 909024.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 1.5316455696202531, |
| "grad_norm": 0.45383986830711365, |
| "learning_rate": 0.00010342901396698659, |
| "loss": 0.1994, |
| "mean_token_accuracy": 0.949091911315918, |
| "num_tokens": 916356.0, |
| "step": 121 |
| }, |
| { |
| "epoch": 1.5443037974683544, |
| "grad_norm": 0.44705086946487427, |
| "learning_rate": 0.00010205766655177215, |
| "loss": 0.2427, |
| "mean_token_accuracy": 0.9395003914833069, |
| "num_tokens": 924106.0, |
| "step": 122 |
| }, |
| { |
| "epoch": 1.5569620253164556, |
| "grad_norm": 0.4181109368801117, |
| "learning_rate": 0.00010068593188161697, |
| "loss": 0.1947, |
| "mean_token_accuracy": 0.9488508105278015, |
| "num_tokens": 931697.0, |
| "step": 123 |
| }, |
| { |
| "epoch": 1.5696202531645569, |
| "grad_norm": 0.48091140389442444, |
| "learning_rate": 9.931406811838308e-05, |
| "loss": 0.2203, |
| "mean_token_accuracy": 0.9425989985466003, |
| "num_tokens": 939287.0, |
| "step": 124 |
| }, |
| { |
| "epoch": 1.5822784810126582, |
| "grad_norm": 0.5527205467224121, |
| "learning_rate": 9.79423334482279e-05, |
| "loss": 0.2429, |
| "mean_token_accuracy": 0.9346159100532532, |
| "num_tokens": 947044.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 1.5949367088607596, |
| "grad_norm": 0.4698488414287567, |
| "learning_rate": 9.657098603301346e-05, |
| "loss": 0.2084, |
| "mean_token_accuracy": 0.9460563659667969, |
| "num_tokens": 954449.0, |
| "step": 126 |
| }, |
| { |
| "epoch": 1.6075949367088609, |
| "grad_norm": 0.4221295416355133, |
| "learning_rate": 9.520028396172003e-05, |
| "loss": 0.1854, |
| "mean_token_accuracy": 0.9494868516921997, |
| "num_tokens": 962016.0, |
| "step": 127 |
| }, |
| { |
| "epoch": 1.620253164556962, |
| "grad_norm": 0.4718606472015381, |
| "learning_rate": 9.383048520187344e-05, |
| "loss": 0.2105, |
| "mean_token_accuracy": 0.9448257088661194, |
| "num_tokens": 969511.0, |
| "step": 128 |
| }, |
| { |
| "epoch": 1.6329113924050633, |
| "grad_norm": 0.4742836058139801, |
| "learning_rate": 9.246184755099545e-05, |
| "loss": 0.1948, |
| "mean_token_accuracy": 0.9457446932792664, |
| "num_tokens": 977095.0, |
| "step": 129 |
| }, |
| { |
| "epoch": 1.6455696202531644, |
| "grad_norm": 0.5384134650230408, |
| "learning_rate": 9.109462858808586e-05, |
| "loss": 0.2481, |
| "mean_token_accuracy": 0.9373098611831665, |
| "num_tokens": 984720.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 1.6582278481012658, |
| "grad_norm": 0.4646705090999603, |
| "learning_rate": 8.972908562514598e-05, |
| "loss": 0.2173, |
| "mean_token_accuracy": 0.9455537796020508, |
| "num_tokens": 992296.0, |
| "step": 131 |
| }, |
| { |
| "epoch": 1.6708860759493671, |
| "grad_norm": 0.449430376291275, |
| "learning_rate": 8.836547565875227e-05, |
| "loss": 0.2098, |
| "mean_token_accuracy": 0.9462523460388184, |
| "num_tokens": 999858.0, |
| "step": 132 |
| }, |
| { |
| "epoch": 1.6835443037974684, |
| "grad_norm": 0.4542527496814728, |
| "learning_rate": 8.70040553216892e-05, |
| "loss": 0.2089, |
| "mean_token_accuracy": 0.9469392895698547, |
| "num_tokens": 1007649.0, |
| "step": 133 |
| }, |
| { |
| "epoch": 1.6962025316455698, |
| "grad_norm": 0.3584607243537903, |
| "learning_rate": 8.564508083465079e-05, |
| "loss": 0.1621, |
| "mean_token_accuracy": 0.9558292031288147, |
| "num_tokens": 1015184.0, |
| "step": 134 |
| }, |
| { |
| "epoch": 1.7088607594936709, |
| "grad_norm": 0.43875524401664734, |
| "learning_rate": 8.428880795801965e-05, |
| "loss": 0.1803, |
| "mean_token_accuracy": 0.952750563621521, |
| "num_tokens": 1022592.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 1.721518987341772, |
| "grad_norm": 0.4122496545314789, |
| "learning_rate": 8.293549194373243e-05, |
| "loss": 0.1948, |
| "mean_token_accuracy": 0.9484121799468994, |
| "num_tokens": 1030119.0, |
| "step": 136 |
| }, |
| { |
| "epoch": 1.7341772151898733, |
| "grad_norm": 0.3599133789539337, |
| "learning_rate": 8.158538748724139e-05, |
| "loss": 0.1398, |
| "mean_token_accuracy": 0.9603773355484009, |
| "num_tokens": 1037603.0, |
| "step": 137 |
| }, |
| { |
| "epoch": 1.7468354430379747, |
| "grad_norm": 0.424468070268631, |
| "learning_rate": 8.023874867958027e-05, |
| "loss": 0.1822, |
| "mean_token_accuracy": 0.9513099193572998, |
| "num_tokens": 1045492.0, |
| "step": 138 |
| }, |
| { |
| "epoch": 1.759493670886076, |
| "grad_norm": 0.5632903575897217, |
| "learning_rate": 7.889582895954427e-05, |
| "loss": 0.2294, |
| "mean_token_accuracy": 0.941025972366333, |
| "num_tokens": 1052983.0, |
| "step": 139 |
| }, |
| { |
| "epoch": 1.7721518987341773, |
| "grad_norm": 0.42068415880203247, |
| "learning_rate": 7.755688106599241e-05, |
| "loss": 0.1866, |
| "mean_token_accuracy": 0.9484808444976807, |
| "num_tokens": 1060617.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 1.7848101265822784, |
| "grad_norm": 0.36526110768318176, |
| "learning_rate": 7.622215699028196e-05, |
| "loss": 0.163, |
| "mean_token_accuracy": 0.9539258480072021, |
| "num_tokens": 1068017.0, |
| "step": 141 |
| }, |
| { |
| "epoch": 1.7974683544303798, |
| "grad_norm": 0.45511889457702637, |
| "learning_rate": 7.489190792884338e-05, |
| "loss": 0.1854, |
| "mean_token_accuracy": 0.9514201283454895, |
| "num_tokens": 1075862.0, |
| "step": 142 |
| }, |
| { |
| "epoch": 1.810126582278481, |
| "grad_norm": 0.3653993010520935, |
| "learning_rate": 7.356638423590485e-05, |
| "loss": 0.1502, |
| "mean_token_accuracy": 0.9577220678329468, |
| "num_tokens": 1083424.0, |
| "step": 143 |
| }, |
| { |
| "epoch": 1.8227848101265822, |
| "grad_norm": 0.494686484336853, |
| "learning_rate": 7.224583537637544e-05, |
| "loss": 0.2014, |
| "mean_token_accuracy": 0.9472861886024475, |
| "num_tokens": 1091171.0, |
| "step": 144 |
| }, |
| { |
| "epoch": 1.8354430379746836, |
| "grad_norm": 0.4973593056201935, |
| "learning_rate": 7.093050987889547e-05, |
| "loss": 0.1619, |
| "mean_token_accuracy": 0.9606246948242188, |
| "num_tokens": 1098727.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 1.8481012658227849, |
| "grad_norm": 0.439903199672699, |
| "learning_rate": 6.96206552890632e-05, |
| "loss": 0.1495, |
| "mean_token_accuracy": 0.9583563208580017, |
| "num_tokens": 1106043.0, |
| "step": 146 |
| }, |
| { |
| "epoch": 1.8607594936708862, |
| "grad_norm": 0.41443145275115967, |
| "learning_rate": 6.831651812284652e-05, |
| "loss": 0.1627, |
| "mean_token_accuracy": 0.9576634764671326, |
| "num_tokens": 1113571.0, |
| "step": 147 |
| }, |
| { |
| "epoch": 1.8734177215189873, |
| "grad_norm": 0.41921186447143555, |
| "learning_rate": 6.701834382018832e-05, |
| "loss": 0.1768, |
| "mean_token_accuracy": 0.9537719488143921, |
| "num_tokens": 1121098.0, |
| "step": 148 |
| }, |
| { |
| "epoch": 1.8860759493670884, |
| "grad_norm": 0.4211632013320923, |
| "learning_rate": 6.572637669881458e-05, |
| "loss": 0.1552, |
| "mean_token_accuracy": 0.9575773477554321, |
| "num_tokens": 1128823.0, |
| "step": 149 |
| }, |
| { |
| "epoch": 1.8987341772151898, |
| "grad_norm": 0.365162193775177, |
| "learning_rate": 6.444085990825338e-05, |
| "loss": 0.1308, |
| "mean_token_accuracy": 0.9660908579826355, |
| "num_tokens": 1136702.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 1.9113924050632911, |
| "grad_norm": 0.6042749285697937, |
| "learning_rate": 6.316203538407397e-05, |
| "loss": 0.1883, |
| "mean_token_accuracy": 0.9514773488044739, |
| "num_tokens": 1144618.0, |
| "step": 151 |
| }, |
| { |
| "epoch": 1.9240506329113924, |
| "grad_norm": 0.504920482635498, |
| "learning_rate": 6.18901438023543e-05, |
| "loss": 0.1711, |
| "mean_token_accuracy": 0.9596337080001831, |
| "num_tokens": 1152436.0, |
| "step": 152 |
| }, |
| { |
| "epoch": 1.9367088607594938, |
| "grad_norm": 0.3634421229362488, |
| "learning_rate": 6.0625424534385425e-05, |
| "loss": 0.1232, |
| "mean_token_accuracy": 0.9661855101585388, |
| "num_tokens": 1159982.0, |
| "step": 153 |
| }, |
| { |
| "epoch": 1.9493670886075949, |
| "grad_norm": 0.43088358640670776, |
| "learning_rate": 5.936811560162169e-05, |
| "loss": 0.152, |
| "mean_token_accuracy": 0.9582157731056213, |
| "num_tokens": 1167489.0, |
| "step": 154 |
| }, |
| { |
| "epoch": 1.9620253164556962, |
| "grad_norm": 0.5033516883850098, |
| "learning_rate": 5.811845363088477e-05, |
| "loss": 0.1624, |
| "mean_token_accuracy": 0.956744372844696, |
| "num_tokens": 1174974.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 1.9746835443037973, |
| "grad_norm": 0.37854012846946716, |
| "learning_rate": 5.687667380983037e-05, |
| "loss": 0.1418, |
| "mean_token_accuracy": 0.9615023732185364, |
| "num_tokens": 1182493.0, |
| "step": 156 |
| }, |
| { |
| "epoch": 1.9873417721518987, |
| "grad_norm": 0.5239201188087463, |
| "learning_rate": 5.5643009842685554e-05, |
| "loss": 0.1954, |
| "mean_token_accuracy": 0.9525497555732727, |
| "num_tokens": 1189891.0, |
| "step": 157 |
| }, |
| { |
| "epoch": 2.0, |
| "grad_norm": 0.2560364007949829, |
| "learning_rate": 5.4417693906265365e-05, |
| "loss": 0.11, |
| "mean_token_accuracy": 0.9704713821411133, |
| "num_tokens": 1197507.0, |
| "step": 158 |
| }, |
| { |
| "epoch": 2.0126582278481013, |
| "grad_norm": 0.24716579914093018, |
| "learning_rate": 5.3200956606277006e-05, |
| "loss": 0.1053, |
| "mean_token_accuracy": 0.9706624150276184, |
| "num_tokens": 1205104.0, |
| "step": 159 |
| }, |
| { |
| "epoch": 2.0253164556962027, |
| "grad_norm": 0.2239724099636078, |
| "learning_rate": 5.199302693391959e-05, |
| "loss": 0.1069, |
| "mean_token_accuracy": 0.9724477529525757, |
| "num_tokens": 1212681.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 2.037974683544304, |
| "grad_norm": 0.32893016934394836, |
| "learning_rate": 5.0794132222787707e-05, |
| "loss": 0.1162, |
| "mean_token_accuracy": 0.970269501209259, |
| "num_tokens": 1219943.0, |
| "step": 161 |
| }, |
| { |
| "epoch": 2.050632911392405, |
| "grad_norm": 0.30835914611816406, |
| "learning_rate": 4.960449810608705e-05, |
| "loss": 0.1296, |
| "mean_token_accuracy": 0.9655404686927795, |
| "num_tokens": 1227436.0, |
| "step": 162 |
| }, |
| { |
| "epoch": 2.0632911392405062, |
| "grad_norm": 0.20363426208496094, |
| "learning_rate": 4.8424348474170014e-05, |
| "loss": 0.0901, |
| "mean_token_accuracy": 0.9714903235435486, |
| "num_tokens": 1234901.0, |
| "step": 163 |
| }, |
| { |
| "epoch": 2.0759493670886076, |
| "grad_norm": 0.2451593428850174, |
| "learning_rate": 4.725390543239929e-05, |
| "loss": 0.0913, |
| "mean_token_accuracy": 0.9731382727622986, |
| "num_tokens": 1242485.0, |
| "step": 164 |
| }, |
| { |
| "epoch": 2.088607594936709, |
| "grad_norm": 0.28893059492111206, |
| "learning_rate": 4.609338925934743e-05, |
| "loss": 0.1102, |
| "mean_token_accuracy": 0.9688106775283813, |
| "num_tokens": 1250276.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 2.1012658227848102, |
| "grad_norm": 0.38036951422691345, |
| "learning_rate": 4.494301836534016e-05, |
| "loss": 0.1068, |
| "mean_token_accuracy": 0.9714133739471436, |
| "num_tokens": 1257861.0, |
| "step": 166 |
| }, |
| { |
| "epoch": 2.1139240506329116, |
| "grad_norm": 0.3020472824573517, |
| "learning_rate": 4.380300925135138e-05, |
| "loss": 0.1045, |
| "mean_token_accuracy": 0.9713066816329956, |
| "num_tokens": 1265662.0, |
| "step": 167 |
| }, |
| { |
| "epoch": 2.1265822784810124, |
| "grad_norm": 0.33828258514404297, |
| "learning_rate": 4.267357646825746e-05, |
| "loss": 0.1028, |
| "mean_token_accuracy": 0.9701977968215942, |
| "num_tokens": 1273410.0, |
| "step": 168 |
| }, |
| { |
| "epoch": 2.1392405063291138, |
| "grad_norm": 0.3408215045928955, |
| "learning_rate": 4.1554932576458415e-05, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9716554880142212, |
| "num_tokens": 1280777.0, |
| "step": 169 |
| }, |
| { |
| "epoch": 2.151898734177215, |
| "grad_norm": 0.3681698143482208, |
| "learning_rate": 4.044728810587406e-05, |
| "loss": 0.1087, |
| "mean_token_accuracy": 0.969260036945343, |
| "num_tokens": 1288193.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 2.1645569620253164, |
| "grad_norm": 0.29635900259017944, |
| "learning_rate": 3.935085151632185e-05, |
| "loss": 0.0924, |
| "mean_token_accuracy": 0.9743622541427612, |
| "num_tokens": 1296058.0, |
| "step": 171 |
| }, |
| { |
| "epoch": 2.1772151898734178, |
| "grad_norm": 0.3427096903324127, |
| "learning_rate": 3.826582915828468e-05, |
| "loss": 0.1048, |
| "mean_token_accuracy": 0.9713760614395142, |
| "num_tokens": 1303738.0, |
| "step": 172 |
| }, |
| { |
| "epoch": 2.189873417721519, |
| "grad_norm": 0.2907073497772217, |
| "learning_rate": 3.719242523407539e-05, |
| "loss": 0.093, |
| "mean_token_accuracy": 0.9729946255683899, |
| "num_tokens": 1311282.0, |
| "step": 173 |
| }, |
| { |
| "epoch": 2.2025316455696204, |
| "grad_norm": 0.27637961506843567, |
| "learning_rate": 3.613084175940578e-05, |
| "loss": 0.0992, |
| "mean_token_accuracy": 0.9711666107177734, |
| "num_tokens": 1318872.0, |
| "step": 174 |
| }, |
| { |
| "epoch": 2.2151898734177213, |
| "grad_norm": 0.3511016070842743, |
| "learning_rate": 3.508127852536698e-05, |
| "loss": 0.1015, |
| "mean_token_accuracy": 0.9672537446022034, |
| "num_tokens": 1326204.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 2.2278481012658227, |
| "grad_norm": 0.27166008949279785, |
| "learning_rate": 3.4043933060828605e-05, |
| "loss": 0.0981, |
| "mean_token_accuracy": 0.9703683853149414, |
| "num_tokens": 1333760.0, |
| "step": 176 |
| }, |
| { |
| "epoch": 2.240506329113924, |
| "grad_norm": 0.2674514651298523, |
| "learning_rate": 3.3019000595263574e-05, |
| "loss": 0.1004, |
| "mean_token_accuracy": 0.9706788063049316, |
| "num_tokens": 1341293.0, |
| "step": 177 |
| }, |
| { |
| "epoch": 2.2531645569620253, |
| "grad_norm": 0.2489694356918335, |
| "learning_rate": 3.200667402200586e-05, |
| "loss": 0.1005, |
| "mean_token_accuracy": 0.9710597991943359, |
| "num_tokens": 1348717.0, |
| "step": 178 |
| }, |
| { |
| "epoch": 2.2658227848101267, |
| "grad_norm": 0.2744084894657135, |
| "learning_rate": 3.100714386194757e-05, |
| "loss": 0.1089, |
| "mean_token_accuracy": 0.9690406322479248, |
| "num_tokens": 1356307.0, |
| "step": 179 |
| }, |
| { |
| "epoch": 2.278481012658228, |
| "grad_norm": 0.3626236319541931, |
| "learning_rate": 3.0020598227682795e-05, |
| "loss": 0.107, |
| "mean_token_accuracy": 0.9673758745193481, |
| "num_tokens": 1364126.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 2.291139240506329, |
| "grad_norm": 0.2569406032562256, |
| "learning_rate": 2.904722278810471e-05, |
| "loss": 0.1014, |
| "mean_token_accuracy": 0.9709012508392334, |
| "num_tokens": 1371613.0, |
| "step": 181 |
| }, |
| { |
| "epoch": 2.3037974683544302, |
| "grad_norm": 0.3285917639732361, |
| "learning_rate": 2.8087200733462425e-05, |
| "loss": 0.1046, |
| "mean_token_accuracy": 0.9690940380096436, |
| "num_tokens": 1379216.0, |
| "step": 182 |
| }, |
| { |
| "epoch": 2.3164556962025316, |
| "grad_norm": 0.20964039862155914, |
| "learning_rate": 2.7140712740884376e-05, |
| "loss": 0.0985, |
| "mean_token_accuracy": 0.9698275923728943, |
| "num_tokens": 1386704.0, |
| "step": 183 |
| }, |
| { |
| "epoch": 2.329113924050633, |
| "grad_norm": 0.3338058292865753, |
| "learning_rate": 2.6207936940374767e-05, |
| "loss": 0.0947, |
| "mean_token_accuracy": 0.971538245677948, |
| "num_tokens": 1394322.0, |
| "step": 184 |
| }, |
| { |
| "epoch": 2.3417721518987342, |
| "grad_norm": 0.24734541773796082, |
| "learning_rate": 2.5289048881289256e-05, |
| "loss": 0.0899, |
| "mean_token_accuracy": 0.9753498435020447, |
| "num_tokens": 1402175.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 2.3544303797468356, |
| "grad_norm": 0.2708415985107422, |
| "learning_rate": 2.4384221499296466e-05, |
| "loss": 0.1001, |
| "mean_token_accuracy": 0.9718623161315918, |
| "num_tokens": 1409880.0, |
| "step": 186 |
| }, |
| { |
| "epoch": 2.367088607594937, |
| "grad_norm": 0.3055052161216736, |
| "learning_rate": 2.3493625083831217e-05, |
| "loss": 0.1024, |
| "mean_token_accuracy": 0.9690194129943848, |
| "num_tokens": 1417368.0, |
| "step": 187 |
| }, |
| { |
| "epoch": 2.379746835443038, |
| "grad_norm": 0.2778116464614868, |
| "learning_rate": 2.2617427246045973e-05, |
| "loss": 0.0987, |
| "mean_token_accuracy": 0.9698062539100647, |
| "num_tokens": 1424917.0, |
| "step": 188 |
| }, |
| { |
| "epoch": 2.392405063291139, |
| "grad_norm": 0.21404311060905457, |
| "learning_rate": 2.1755792887266234e-05, |
| "loss": 0.0975, |
| "mean_token_accuracy": 0.9730854034423828, |
| "num_tokens": 1432672.0, |
| "step": 189 |
| }, |
| { |
| "epoch": 2.4050632911392404, |
| "grad_norm": 0.22275599837303162, |
| "learning_rate": 2.0908884167955824e-05, |
| "loss": 0.0955, |
| "mean_token_accuracy": 0.9734768867492676, |
| "num_tokens": 1440352.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 2.4177215189873418, |
| "grad_norm": 0.3580118417739868, |
| "learning_rate": 2.0076860477198313e-05, |
| "loss": 0.0976, |
| "mean_token_accuracy": 0.9713793396949768, |
| "num_tokens": 1447963.0, |
| "step": 191 |
| }, |
| { |
| "epoch": 2.430379746835443, |
| "grad_norm": 0.2647789716720581, |
| "learning_rate": 1.9259878402699705e-05, |
| "loss": 0.0998, |
| "mean_token_accuracy": 0.9713677167892456, |
| "num_tokens": 1455536.0, |
| "step": 192 |
| }, |
| { |
| "epoch": 2.4430379746835444, |
| "grad_norm": 0.23201273381710052, |
| "learning_rate": 1.8458091701318504e-05, |
| "loss": 0.0961, |
| "mean_token_accuracy": 0.9719387888908386, |
| "num_tokens": 1463048.0, |
| "step": 193 |
| }, |
| { |
| "epoch": 2.4556962025316453, |
| "grad_norm": 0.2607119083404541, |
| "learning_rate": 1.7671651270128532e-05, |
| "loss": 0.0949, |
| "mean_token_accuracy": 0.9710144996643066, |
| "num_tokens": 1470564.0, |
| "step": 194 |
| }, |
| { |
| "epoch": 2.4683544303797467, |
| "grad_norm": 0.2727314531803131, |
| "learning_rate": 1.69007051180199e-05, |
| "loss": 0.0973, |
| "mean_token_accuracy": 0.9722861051559448, |
| "num_tokens": 1478458.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 2.481012658227848, |
| "grad_norm": 0.25747543573379517, |
| "learning_rate": 1.6145398337843652e-05, |
| "loss": 0.0913, |
| "mean_token_accuracy": 0.9718737602233887, |
| "num_tokens": 1486095.0, |
| "step": 196 |
| }, |
| { |
| "epoch": 2.4936708860759493, |
| "grad_norm": 0.28386300802230835, |
| "learning_rate": 1.540587307910508e-05, |
| "loss": 0.1082, |
| "mean_token_accuracy": 0.9686080813407898, |
| "num_tokens": 1493645.0, |
| "step": 197 |
| }, |
| { |
| "epoch": 2.5063291139240507, |
| "grad_norm": 0.2482428401708603, |
| "learning_rate": 1.4682268521211073e-05, |
| "loss": 0.0945, |
| "mean_token_accuracy": 0.9698053002357483, |
| "num_tokens": 1501260.0, |
| "step": 198 |
| }, |
| { |
| "epoch": 2.518987341772152, |
| "grad_norm": 0.29959413409233093, |
| "learning_rate": 1.3974720847276412e-05, |
| "loss": 0.1103, |
| "mean_token_accuracy": 0.9704062342643738, |
| "num_tokens": 1508758.0, |
| "step": 199 |
| }, |
| { |
| "epoch": 2.5316455696202533, |
| "grad_norm": 0.2617916762828827, |
| "learning_rate": 1.328336321849396e-05, |
| "loss": 0.0965, |
| "mean_token_accuracy": 0.972577691078186, |
| "num_tokens": 1516480.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 2.5443037974683547, |
| "grad_norm": 0.25122788548469543, |
| "learning_rate": 1.2608325749073591e-05, |
| "loss": 0.0989, |
| "mean_token_accuracy": 0.971817672252655, |
| "num_tokens": 1523960.0, |
| "step": 201 |
| }, |
| { |
| "epoch": 2.5569620253164556, |
| "grad_norm": 0.23365901410579681, |
| "learning_rate": 1.1949735481754565e-05, |
| "loss": 0.0911, |
| "mean_token_accuracy": 0.9739062786102295, |
| "num_tokens": 1531727.0, |
| "step": 202 |
| }, |
| { |
| "epoch": 2.569620253164557, |
| "grad_norm": 0.3107486963272095, |
| "learning_rate": 1.130771636389596e-05, |
| "loss": 0.1038, |
| "mean_token_accuracy": 0.9700414538383484, |
| "num_tokens": 1539268.0, |
| "step": 203 |
| }, |
| { |
| "epoch": 2.5822784810126582, |
| "grad_norm": 0.2310217171907425, |
| "learning_rate": 1.0682389224149647e-05, |
| "loss": 0.0948, |
| "mean_token_accuracy": 0.9715954065322876, |
| "num_tokens": 1546866.0, |
| "step": 204 |
| }, |
| { |
| "epoch": 2.5949367088607596, |
| "grad_norm": 0.20603010058403015, |
| "learning_rate": 1.0073871749720221e-05, |
| "loss": 0.0947, |
| "mean_token_accuracy": 0.9721407890319824, |
| "num_tokens": 1554432.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 2.607594936708861, |
| "grad_norm": 0.22616903483867645, |
| "learning_rate": 9.482278464216121e-06, |
| "loss": 0.0934, |
| "mean_token_accuracy": 0.9742143154144287, |
| "num_tokens": 1561942.0, |
| "step": 206 |
| }, |
| { |
| "epoch": 2.620253164556962, |
| "grad_norm": 0.29869943857192993, |
| "learning_rate": 8.907720706096224e-06, |
| "loss": 0.099, |
| "mean_token_accuracy": 0.9707894921302795, |
| "num_tokens": 1569606.0, |
| "step": 207 |
| }, |
| { |
| "epoch": 2.632911392405063, |
| "grad_norm": 0.18506982922554016, |
| "learning_rate": 8.350306607715774e-06, |
| "loss": 0.0967, |
| "mean_token_accuracy": 0.9730911254882812, |
| "num_tokens": 1576991.0, |
| "step": 208 |
| }, |
| { |
| "epoch": 2.6455696202531644, |
| "grad_norm": 0.3081600069999695, |
| "learning_rate": 7.810141074975818e-06, |
| "loss": 0.1021, |
| "mean_token_accuracy": 0.9701170921325684, |
| "num_tokens": 1584484.0, |
| "step": 209 |
| }, |
| { |
| "epoch": 2.6582278481012658, |
| "grad_norm": 0.27944669127464294, |
| "learning_rate": 7.287325767579756e-06, |
| "loss": 0.1081, |
| "mean_token_accuracy": 0.9698938727378845, |
| "num_tokens": 1592088.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 2.670886075949367, |
| "grad_norm": 0.1560535430908203, |
| "learning_rate": 6.781959079900957e-06, |
| "loss": 0.0884, |
| "mean_token_accuracy": 0.9742401242256165, |
| "num_tokens": 1599489.0, |
| "step": 211 |
| }, |
| { |
| "epoch": 2.6835443037974684, |
| "grad_norm": 0.2630186378955841, |
| "learning_rate": 6.2941361224647e-06, |
| "loss": 0.1012, |
| "mean_token_accuracy": 0.9717521667480469, |
| "num_tokens": 1607235.0, |
| "step": 212 |
| }, |
| { |
| "epoch": 2.6962025316455698, |
| "grad_norm": 0.20801326632499695, |
| "learning_rate": 5.823948704048443e-06, |
| "loss": 0.094, |
| "mean_token_accuracy": 0.9722370505332947, |
| "num_tokens": 1614791.0, |
| "step": 213 |
| }, |
| { |
| "epoch": 2.708860759493671, |
| "grad_norm": 0.23363713920116425, |
| "learning_rate": 5.371485314403202e-06, |
| "loss": 0.1017, |
| "mean_token_accuracy": 0.9724119901657104, |
| "num_tokens": 1622467.0, |
| "step": 214 |
| }, |
| { |
| "epoch": 2.721518987341772, |
| "grad_norm": 0.27849259972572327, |
| "learning_rate": 4.936831107599749e-06, |
| "loss": 0.106, |
| "mean_token_accuracy": 0.9699349999427795, |
| "num_tokens": 1629915.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 2.7341772151898733, |
| "grad_norm": 0.2073725014925003, |
| "learning_rate": 4.5200678860024885e-06, |
| "loss": 0.0941, |
| "mean_token_accuracy": 0.9706724882125854, |
| "num_tokens": 1637310.0, |
| "step": 216 |
| }, |
| { |
| "epoch": 2.7468354430379747, |
| "grad_norm": 0.2289542257785797, |
| "learning_rate": 4.121274084874194e-06, |
| "loss": 0.0926, |
| "mean_token_accuracy": 0.973173975944519, |
| "num_tokens": 1644904.0, |
| "step": 217 |
| }, |
| { |
| "epoch": 2.759493670886076, |
| "grad_norm": 0.2967240512371063, |
| "learning_rate": 3.7405247576144054e-06, |
| "loss": 0.0947, |
| "mean_token_accuracy": 0.9712704420089722, |
| "num_tokens": 1652556.0, |
| "step": 218 |
| }, |
| { |
| "epoch": 2.7721518987341773, |
| "grad_norm": 0.2061406522989273, |
| "learning_rate": 3.3778915616342943e-06, |
| "loss": 0.0921, |
| "mean_token_accuracy": 0.9731997847557068, |
| "num_tokens": 1660008.0, |
| "step": 219 |
| }, |
| { |
| "epoch": 2.7848101265822782, |
| "grad_norm": 0.20453591644763947, |
| "learning_rate": 3.0334427448706847e-06, |
| "loss": 0.0912, |
| "mean_token_accuracy": 0.9720537662506104, |
| "num_tokens": 1667658.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 2.7974683544303796, |
| "grad_norm": 0.23907408118247986, |
| "learning_rate": 2.707243132941717e-06, |
| "loss": 0.0965, |
| "mean_token_accuracy": 0.9735056757926941, |
| "num_tokens": 1675535.0, |
| "step": 221 |
| }, |
| { |
| "epoch": 2.810126582278481, |
| "grad_norm": 0.3273867070674896, |
| "learning_rate": 2.3993541169465837e-06, |
| "loss": 0.0951, |
| "mean_token_accuracy": 0.9698397517204285, |
| "num_tokens": 1683026.0, |
| "step": 222 |
| }, |
| { |
| "epoch": 2.8227848101265822, |
| "grad_norm": 0.2258942574262619, |
| "learning_rate": 2.1098336419116625e-06, |
| "loss": 0.0954, |
| "mean_token_accuracy": 0.9716787338256836, |
| "num_tokens": 1690399.0, |
| "step": 223 |
| }, |
| { |
| "epoch": 2.8354430379746836, |
| "grad_norm": 0.21475453674793243, |
| "learning_rate": 1.838736195885238e-06, |
| "loss": 0.0915, |
| "mean_token_accuracy": 0.9741595387458801, |
| "num_tokens": 1698048.0, |
| "step": 224 |
| }, |
| { |
| "epoch": 2.848101265822785, |
| "grad_norm": 0.2630147635936737, |
| "learning_rate": 1.5861127996827597e-06, |
| "loss": 0.0987, |
| "mean_token_accuracy": 0.9713319540023804, |
| "num_tokens": 1705507.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 2.8607594936708862, |
| "grad_norm": 0.24740326404571533, |
| "learning_rate": 1.3520109972846917e-06, |
| "loss": 0.0953, |
| "mean_token_accuracy": 0.9725081324577332, |
| "num_tokens": 1712955.0, |
| "step": 226 |
| }, |
| { |
| "epoch": 2.8734177215189876, |
| "grad_norm": 0.21480882167816162, |
| "learning_rate": 1.1364748468886687e-06, |
| "loss": 0.0936, |
| "mean_token_accuracy": 0.9725086092948914, |
| "num_tokens": 1720294.0, |
| "step": 227 |
| }, |
| { |
| "epoch": 2.8860759493670884, |
| "grad_norm": 0.17724719643592834, |
| "learning_rate": 9.395449126177291e-07, |
| "loss": 0.0865, |
| "mean_token_accuracy": 0.9737974405288696, |
| "num_tokens": 1728029.0, |
| "step": 228 |
| }, |
| { |
| "epoch": 2.8987341772151898, |
| "grad_norm": 0.1948229819536209, |
| "learning_rate": 7.612582568860549e-07, |
| "loss": 0.0908, |
| "mean_token_accuracy": 0.9719676375389099, |
| "num_tokens": 1735513.0, |
| "step": 229 |
| }, |
| { |
| "epoch": 2.911392405063291, |
| "grad_norm": 0.2432938814163208, |
| "learning_rate": 6.016484334238515e-07, |
| "loss": 0.0976, |
| "mean_token_accuracy": 0.9726666808128357, |
| "num_tokens": 1743077.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 2.9240506329113924, |
| "grad_norm": 0.334950715303421, |
| "learning_rate": 4.607454809624434e-07, |
| "loss": 0.1115, |
| "mean_token_accuracy": 0.9661816954612732, |
| "num_tokens": 1750770.0, |
| "step": 231 |
| }, |
| { |
| "epoch": 2.9367088607594938, |
| "grad_norm": 0.2737453281879425, |
| "learning_rate": 3.385759175809966e-07, |
| "loss": 0.0976, |
| "mean_token_accuracy": 0.9702790379524231, |
| "num_tokens": 1758539.0, |
| "step": 232 |
| }, |
| { |
| "epoch": 2.9493670886075947, |
| "grad_norm": 0.20212914049625397, |
| "learning_rate": 2.3516273571577708e-07, |
| "loss": 0.0922, |
| "mean_token_accuracy": 0.972845196723938, |
| "num_tokens": 1766005.0, |
| "step": 233 |
| }, |
| { |
| "epoch": 2.962025316455696, |
| "grad_norm": 0.28339385986328125, |
| "learning_rate": 1.505253978329235e-07, |
| "loss": 0.1017, |
| "mean_token_accuracy": 0.9697776436805725, |
| "num_tokens": 1773580.0, |
| "step": 234 |
| }, |
| { |
| "epoch": 2.9746835443037973, |
| "grad_norm": 0.18123164772987366, |
| "learning_rate": 8.467983276563284e-08, |
| "loss": 0.0896, |
| "mean_token_accuracy": 0.9740137457847595, |
| "num_tokens": 1781071.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 2.9873417721518987, |
| "grad_norm": 0.21046403050422668, |
| "learning_rate": 3.763843271631373e-08, |
| "loss": 0.0926, |
| "mean_token_accuracy": 0.9746376872062683, |
| "num_tokens": 1788587.0, |
| "step": 236 |
| }, |
| { |
| "epoch": 3.0, |
| "grad_norm": 0.22790654003620148, |
| "learning_rate": 9.410050924374415e-09, |
| "loss": 0.085, |
| "mean_token_accuracy": 0.9737589359283447, |
| "num_tokens": 1796044.0, |
| "step": 237 |
| }, |
| { |
| "epoch": 3.0, |
| "step": 237, |
| "total_flos": 1.1297352468712653e+17, |
| "train_loss": 0.33737788211067016, |
| "train_runtime": 357.577, |
| "train_samples_per_second": 41.949, |
| "train_steps_per_second": 0.663 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 237, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.1297352468712653e+17, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|