{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 237, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.012658227848101266, "grad_norm": 7.577828407287598, "learning_rate": 0.0, "loss": 1.9571, "mean_token_accuracy": 0.6694959402084351, "num_tokens": 7722.0, "step": 1 }, { "epoch": 0.02531645569620253, "grad_norm": 7.746953964233398, "learning_rate": 2.5e-05, "loss": 1.9398, "mean_token_accuracy": 0.676712691783905, "num_tokens": 15318.0, "step": 2 }, { "epoch": 0.0379746835443038, "grad_norm": 4.52789831161499, "learning_rate": 5e-05, "loss": 1.7311, "mean_token_accuracy": 0.6810978055000305, "num_tokens": 23143.0, "step": 3 }, { "epoch": 0.05063291139240506, "grad_norm": 2.9054675102233887, "learning_rate": 7.500000000000001e-05, "loss": 1.3154, "mean_token_accuracy": 0.7156617045402527, "num_tokens": 30786.0, "step": 4 }, { "epoch": 0.06329113924050633, "grad_norm": 1.708419919013977, "learning_rate": 0.0001, "loss": 1.0543, "mean_token_accuracy": 0.793462336063385, "num_tokens": 38345.0, "step": 5 }, { "epoch": 0.0759493670886076, "grad_norm": 4.625662326812744, "learning_rate": 0.000125, "loss": 0.8803, "mean_token_accuracy": 0.8147608041763306, "num_tokens": 45956.0, "step": 6 }, { "epoch": 0.08860759493670886, "grad_norm": 11.903258323669434, "learning_rate": 0.00015000000000000001, "loss": 0.8083, "mean_token_accuracy": 0.8231238126754761, "num_tokens": 53562.0, "step": 7 }, { "epoch": 0.10126582278481013, "grad_norm": 7.953157901763916, "learning_rate": 0.000175, "loss": 0.7792, "mean_token_accuracy": 0.8260988593101501, "num_tokens": 60929.0, "step": 8 }, { "epoch": 0.11392405063291139, "grad_norm": 3.9451382160186768, "learning_rate": 0.0002, "loss": 0.7858, "mean_token_accuracy": 0.8231524229049683, "num_tokens": 68327.0, "step": 9 }, { "epoch": 0.12658227848101267, "grad_norm": 7.63812780380249, "learning_rate": 0.00019999058994907564, "loss": 0.8194, "mean_token_accuracy": 0.8158359527587891, "num_tokens": 75754.0, "step": 10 }, { "epoch": 0.13924050632911392, "grad_norm": 1.7502692937850952, "learning_rate": 0.0001999623615672837, "loss": 0.7591, "mean_token_accuracy": 0.8333558440208435, "num_tokens": 83217.0, "step": 11 }, { "epoch": 0.1518987341772152, "grad_norm": 1.258649230003357, "learning_rate": 0.00019991532016723439, "loss": 0.7988, "mean_token_accuracy": 0.8254917860031128, "num_tokens": 90805.0, "step": 12 }, { "epoch": 0.16455696202531644, "grad_norm": 0.4300090968608856, "learning_rate": 0.00019984947460216707, "loss": 0.7602, "mean_token_accuracy": 0.8290643692016602, "num_tokens": 98404.0, "step": 13 }, { "epoch": 0.17721518987341772, "grad_norm": 6.66930627822876, "learning_rate": 0.00019976483726428422, "loss": 0.7419, "mean_token_accuracy": 0.8308157324790955, "num_tokens": 106081.0, "step": 14 }, { "epoch": 0.189873417721519, "grad_norm": 0.6765839457511902, "learning_rate": 0.00019966142408241901, "loss": 0.8115, "mean_token_accuracy": 0.8222697973251343, "num_tokens": 113617.0, "step": 15 }, { "epoch": 0.20253164556962025, "grad_norm": 5.244386672973633, "learning_rate": 0.00019953925451903756, "loss": 0.7769, "mean_token_accuracy": 0.8213022351264954, "num_tokens": 121314.0, "step": 16 }, { "epoch": 0.21518987341772153, "grad_norm": 0.5631109476089478, "learning_rate": 0.00019939835156657616, "loss": 0.7315, "mean_token_accuracy": 0.8379343748092651, "num_tokens": 128659.0, "step": 17 }, { "epoch": 0.22784810126582278, "grad_norm": 0.5312209129333496, "learning_rate": 0.00019923874174311394, "loss": 0.7124, "mean_token_accuracy": 0.835067868232727, "num_tokens": 136314.0, "step": 18 }, { "epoch": 0.24050632911392406, "grad_norm": 0.664734423160553, "learning_rate": 0.00019906045508738228, "loss": 0.7232, "mean_token_accuracy": 0.8314966559410095, "num_tokens": 144182.0, "step": 19 }, { "epoch": 0.25316455696202533, "grad_norm": 0.4895744025707245, "learning_rate": 0.00019886352515311134, "loss": 0.783, "mean_token_accuracy": 0.8221429586410522, "num_tokens": 152095.0, "step": 20 }, { "epoch": 0.26582278481012656, "grad_norm": 0.7920514345169067, "learning_rate": 0.00019864798900271532, "loss": 0.7075, "mean_token_accuracy": 0.8389923572540283, "num_tokens": 159463.0, "step": 21 }, { "epoch": 0.27848101265822783, "grad_norm": 0.8280817866325378, "learning_rate": 0.00019841388720031727, "loss": 0.6889, "mean_token_accuracy": 0.8389334678649902, "num_tokens": 166878.0, "step": 22 }, { "epoch": 0.2911392405063291, "grad_norm": 0.38697078824043274, "learning_rate": 0.00019816126380411476, "loss": 0.673, "mean_token_accuracy": 0.8453608155250549, "num_tokens": 174314.0, "step": 23 }, { "epoch": 0.3037974683544304, "grad_norm": 0.47077956795692444, "learning_rate": 0.00019789016635808837, "loss": 0.7354, "mean_token_accuracy": 0.8276225328445435, "num_tokens": 181966.0, "step": 24 }, { "epoch": 0.31645569620253167, "grad_norm": 0.5773133039474487, "learning_rate": 0.00019760064588305345, "loss": 0.7412, "mean_token_accuracy": 0.8243722915649414, "num_tokens": 189637.0, "step": 25 }, { "epoch": 0.3291139240506329, "grad_norm": 0.5629377961158752, "learning_rate": 0.0001972927568670583, "loss": 0.6763, "mean_token_accuracy": 0.8467550873756409, "num_tokens": 196866.0, "step": 26 }, { "epoch": 0.34177215189873417, "grad_norm": 0.4058995544910431, "learning_rate": 0.00019696655725512933, "loss": 0.7035, "mean_token_accuracy": 0.8346715569496155, "num_tokens": 204527.0, "step": 27 }, { "epoch": 0.35443037974683544, "grad_norm": 0.3507729172706604, "learning_rate": 0.00019662210843836574, "loss": 0.7462, "mean_token_accuracy": 0.8278258442878723, "num_tokens": 212217.0, "step": 28 }, { "epoch": 0.3670886075949367, "grad_norm": 0.49514463543891907, "learning_rate": 0.00019625947524238563, "loss": 0.6374, "mean_token_accuracy": 0.8493860960006714, "num_tokens": 219611.0, "step": 29 }, { "epoch": 0.379746835443038, "grad_norm": 0.5946100950241089, "learning_rate": 0.0001958787259151258, "loss": 0.6899, "mean_token_accuracy": 0.8388254046440125, "num_tokens": 227201.0, "step": 30 }, { "epoch": 0.3924050632911392, "grad_norm": 0.5284402966499329, "learning_rate": 0.0001954799321139975, "loss": 0.6359, "mean_token_accuracy": 0.849815845489502, "num_tokens": 234596.0, "step": 31 }, { "epoch": 0.4050632911392405, "grad_norm": 0.3717970848083496, "learning_rate": 0.00019506316889240027, "loss": 0.6561, "mean_token_accuracy": 0.8414534330368042, "num_tokens": 242008.0, "step": 32 }, { "epoch": 0.4177215189873418, "grad_norm": 0.3561764061450958, "learning_rate": 0.0001946285146855968, "loss": 0.6832, "mean_token_accuracy": 0.8376168012619019, "num_tokens": 249776.0, "step": 33 }, { "epoch": 0.43037974683544306, "grad_norm": 0.3912392854690552, "learning_rate": 0.00019417605129595157, "loss": 0.6688, "mean_token_accuracy": 0.8432945609092712, "num_tokens": 257319.0, "step": 34 }, { "epoch": 0.4430379746835443, "grad_norm": 0.45518746972084045, "learning_rate": 0.0001937058638775353, "loss": 0.6252, "mean_token_accuracy": 0.8525184392929077, "num_tokens": 264828.0, "step": 35 }, { "epoch": 0.45569620253164556, "grad_norm": 0.4275685250759125, "learning_rate": 0.00019321804092009906, "loss": 0.6196, "mean_token_accuracy": 0.8575549721717834, "num_tokens": 272172.0, "step": 36 }, { "epoch": 0.46835443037974683, "grad_norm": 0.36319318413734436, "learning_rate": 0.00019271267423242024, "loss": 0.6789, "mean_token_accuracy": 0.8397783041000366, "num_tokens": 279813.0, "step": 37 }, { "epoch": 0.4810126582278481, "grad_norm": 0.43757617473602295, "learning_rate": 0.0001921898589250242, "loss": 0.6371, "mean_token_accuracy": 0.8450391888618469, "num_tokens": 287537.0, "step": 38 }, { "epoch": 0.4936708860759494, "grad_norm": 0.39345020055770874, "learning_rate": 0.00019164969339228422, "loss": 0.6252, "mean_token_accuracy": 0.8488776087760925, "num_tokens": 295085.0, "step": 39 }, { "epoch": 0.5063291139240507, "grad_norm": 0.39008787274360657, "learning_rate": 0.00019109227929390378, "loss": 0.6749, "mean_token_accuracy": 0.840212881565094, "num_tokens": 302853.0, "step": 40 }, { "epoch": 0.5189873417721519, "grad_norm": 0.40397143363952637, "learning_rate": 0.00019051772153578389, "loss": 0.6502, "mean_token_accuracy": 0.843741774559021, "num_tokens": 310507.0, "step": 41 }, { "epoch": 0.5316455696202531, "grad_norm": 0.34576931595802307, "learning_rate": 0.00018992612825027976, "loss": 0.5663, "mean_token_accuracy": 0.8624165654182434, "num_tokens": 317912.0, "step": 42 }, { "epoch": 0.5443037974683544, "grad_norm": 0.4292350113391876, "learning_rate": 0.00018931761077585035, "loss": 0.6421, "mean_token_accuracy": 0.8521012663841248, "num_tokens": 325400.0, "step": 43 }, { "epoch": 0.5569620253164557, "grad_norm": 0.3893992602825165, "learning_rate": 0.00018869228363610404, "loss": 0.603, "mean_token_accuracy": 0.8546313047409058, "num_tokens": 333086.0, "step": 44 }, { "epoch": 0.569620253164557, "grad_norm": 0.3626430928707123, "learning_rate": 0.00018805026451824546, "loss": 0.5504, "mean_token_accuracy": 0.86698979139328, "num_tokens": 340578.0, "step": 45 }, { "epoch": 0.5822784810126582, "grad_norm": 0.4151477515697479, "learning_rate": 0.00018739167425092644, "loss": 0.6749, "mean_token_accuracy": 0.8368580341339111, "num_tokens": 348586.0, "step": 46 }, { "epoch": 0.5949367088607594, "grad_norm": 0.3864465653896332, "learning_rate": 0.00018671663678150607, "loss": 0.5704, "mean_token_accuracy": 0.8640350699424744, "num_tokens": 356174.0, "step": 47 }, { "epoch": 0.6075949367088608, "grad_norm": 0.43347352743148804, "learning_rate": 0.0001860252791527236, "loss": 0.5495, "mean_token_accuracy": 0.8597859144210815, "num_tokens": 363805.0, "step": 48 }, { "epoch": 0.620253164556962, "grad_norm": 0.4836398661136627, "learning_rate": 0.00018531773147878895, "loss": 0.6308, "mean_token_accuracy": 0.8539444208145142, "num_tokens": 371462.0, "step": 49 }, { "epoch": 0.6329113924050633, "grad_norm": 0.4612779915332794, "learning_rate": 0.00018459412692089494, "loss": 0.5884, "mean_token_accuracy": 0.8596022725105286, "num_tokens": 379019.0, "step": 50 }, { "epoch": 0.6455696202531646, "grad_norm": 0.4270411431789398, "learning_rate": 0.00018385460166215638, "loss": 0.5495, "mean_token_accuracy": 0.8687131404876709, "num_tokens": 386380.0, "step": 51 }, { "epoch": 0.6582278481012658, "grad_norm": 0.4124862849712372, "learning_rate": 0.00018309929488198012, "loss": 0.5931, "mean_token_accuracy": 0.8600296378135681, "num_tokens": 393867.0, "step": 52 }, { "epoch": 0.6708860759493671, "grad_norm": 0.3761177361011505, "learning_rate": 0.00018232834872987147, "loss": 0.585, "mean_token_accuracy": 0.863766610622406, "num_tokens": 401609.0, "step": 53 }, { "epoch": 0.6835443037974683, "grad_norm": 0.3798786699771881, "learning_rate": 0.0001815419082986815, "loss": 0.6038, "mean_token_accuracy": 0.8549598455429077, "num_tokens": 409264.0, "step": 54 }, { "epoch": 0.6962025316455697, "grad_norm": 0.3858072757720947, "learning_rate": 0.00018074012159730032, "loss": 0.5424, "mean_token_accuracy": 0.8691484928131104, "num_tokens": 416527.0, "step": 55 }, { "epoch": 0.7088607594936709, "grad_norm": 0.39073118567466736, "learning_rate": 0.00017992313952280172, "loss": 0.506, "mean_token_accuracy": 0.8774666786193848, "num_tokens": 424091.0, "step": 56 }, { "epoch": 0.7215189873417721, "grad_norm": 0.4660295844078064, "learning_rate": 0.00017909111583204422, "loss": 0.5728, "mean_token_accuracy": 0.8573468327522278, "num_tokens": 431859.0, "step": 57 }, { "epoch": 0.7341772151898734, "grad_norm": 0.45270058512687683, "learning_rate": 0.0001782442071127338, "loss": 0.5809, "mean_token_accuracy": 0.8605116009712219, "num_tokens": 439429.0, "step": 58 }, { "epoch": 0.7468354430379747, "grad_norm": 0.44151806831359863, "learning_rate": 0.00017738257275395404, "loss": 0.6342, "mean_token_accuracy": 0.8478041291236877, "num_tokens": 447417.0, "step": 59 }, { "epoch": 0.759493670886076, "grad_norm": 0.40675118565559387, "learning_rate": 0.0001765063749161688, "loss": 0.5878, "mean_token_accuracy": 0.8633121848106384, "num_tokens": 455053.0, "step": 60 }, { "epoch": 0.7721518987341772, "grad_norm": 0.42426082491874695, "learning_rate": 0.00017561577850070355, "loss": 0.5056, "mean_token_accuracy": 0.8747982978820801, "num_tokens": 462553.0, "step": 61 }, { "epoch": 0.7848101265822784, "grad_norm": 0.5047997832298279, "learning_rate": 0.00017471095111871074, "loss": 0.5386, "mean_token_accuracy": 0.8677419424057007, "num_tokens": 470057.0, "step": 62 }, { "epoch": 0.7974683544303798, "grad_norm": 0.4321729242801666, "learning_rate": 0.00017379206305962526, "loss": 0.4742, "mean_token_accuracy": 0.8855810165405273, "num_tokens": 477410.0, "step": 63 }, { "epoch": 0.810126582278481, "grad_norm": 0.43735846877098083, "learning_rate": 0.00017285928725911562, "loss": 0.5114, "mean_token_accuracy": 0.8768270015716553, "num_tokens": 485000.0, "step": 64 }, { "epoch": 0.8227848101265823, "grad_norm": 0.4349932074546814, "learning_rate": 0.00017191279926653761, "loss": 0.4947, "mean_token_accuracy": 0.8799254298210144, "num_tokens": 492576.0, "step": 65 }, { "epoch": 0.8354430379746836, "grad_norm": 0.46583646535873413, "learning_rate": 0.00017095277721189528, "loss": 0.5472, "mean_token_accuracy": 0.8641451001167297, "num_tokens": 500413.0, "step": 66 }, { "epoch": 0.8481012658227848, "grad_norm": 0.4772394597530365, "learning_rate": 0.00016997940177231722, "loss": 0.5716, "mean_token_accuracy": 0.8625654578208923, "num_tokens": 508117.0, "step": 67 }, { "epoch": 0.8607594936708861, "grad_norm": 0.47736912965774536, "learning_rate": 0.00016899285613805246, "loss": 0.5048, "mean_token_accuracy": 0.8752148151397705, "num_tokens": 515746.0, "step": 68 }, { "epoch": 0.8734177215189873, "grad_norm": 0.4343780279159546, "learning_rate": 0.00016799332597799413, "loss": 0.4687, "mean_token_accuracy": 0.8839372396469116, "num_tokens": 523013.0, "step": 69 }, { "epoch": 0.8860759493670886, "grad_norm": 0.44280242919921875, "learning_rate": 0.0001669809994047364, "loss": 0.4772, "mean_token_accuracy": 0.8798643946647644, "num_tokens": 530452.0, "step": 70 }, { "epoch": 0.8987341772151899, "grad_norm": 0.4641714096069336, "learning_rate": 0.00016595606693917142, "loss": 0.4602, "mean_token_accuracy": 0.8870418071746826, "num_tokens": 537855.0, "step": 71 }, { "epoch": 0.9113924050632911, "grad_norm": 0.48911163210868835, "learning_rate": 0.00016491872147463306, "loss": 0.5123, "mean_token_accuracy": 0.8701679706573486, "num_tokens": 545421.0, "step": 72 }, { "epoch": 0.9240506329113924, "grad_norm": 0.43602073192596436, "learning_rate": 0.00016386915824059427, "loss": 0.4066, "mean_token_accuracy": 0.8927801847457886, "num_tokens": 552909.0, "step": 73 }, { "epoch": 0.9367088607594937, "grad_norm": 0.48829028010368347, "learning_rate": 0.00016280757476592466, "loss": 0.4922, "mean_token_accuracy": 0.8765687942504883, "num_tokens": 560702.0, "step": 74 }, { "epoch": 0.9493670886075949, "grad_norm": 0.47516176104545593, "learning_rate": 0.00016173417084171536, "loss": 0.4346, "mean_token_accuracy": 0.8902259469032288, "num_tokens": 568245.0, "step": 75 }, { "epoch": 0.9620253164556962, "grad_norm": 0.49728158116340637, "learning_rate": 0.0001606491484836782, "loss": 0.4271, "mean_token_accuracy": 0.8917593955993652, "num_tokens": 575857.0, "step": 76 }, { "epoch": 0.9746835443037974, "grad_norm": 0.46857449412345886, "learning_rate": 0.00015955271189412598, "loss": 0.4059, "mean_token_accuracy": 0.8973404169082642, "num_tokens": 583441.0, "step": 77 }, { "epoch": 0.9873417721518988, "grad_norm": 0.49021583795547485, "learning_rate": 0.00015844506742354164, "loss": 0.4636, "mean_token_accuracy": 0.8833048343658447, "num_tokens": 591106.0, "step": 78 }, { "epoch": 1.0, "grad_norm": 0.46990546584129333, "learning_rate": 0.00015732642353174259, "loss": 0.4786, "mean_token_accuracy": 0.8784138560295105, "num_tokens": 598786.0, "step": 79 }, { "epoch": 1.0126582278481013, "grad_norm": 0.4664880633354187, "learning_rate": 0.00015619699074864864, "loss": 0.337, "mean_token_accuracy": 0.9137563109397888, "num_tokens": 606352.0, "step": 80 }, { "epoch": 1.0253164556962024, "grad_norm": 0.51947021484375, "learning_rate": 0.00015505698163465986, "loss": 0.325, "mean_token_accuracy": 0.9177552461624146, "num_tokens": 613918.0, "step": 81 }, { "epoch": 1.0379746835443038, "grad_norm": 0.6177846193313599, "learning_rate": 0.00015390661074065256, "loss": 0.2845, "mean_token_accuracy": 0.9252744317054749, "num_tokens": 621543.0, "step": 82 }, { "epoch": 1.0506329113924051, "grad_norm": 0.6303501725196838, "learning_rate": 0.00015274609456760073, "loss": 0.3447, "mean_token_accuracy": 0.9104577898979187, "num_tokens": 629056.0, "step": 83 }, { "epoch": 1.0632911392405062, "grad_norm": 0.4975242018699646, "learning_rate": 0.00015157565152583002, "loss": 0.2811, "mean_token_accuracy": 0.9240351915359497, "num_tokens": 636505.0, "step": 84 }, { "epoch": 1.0759493670886076, "grad_norm": 0.4337922930717468, "learning_rate": 0.00015039550189391298, "loss": 0.2779, "mean_token_accuracy": 0.9240472912788391, "num_tokens": 644100.0, "step": 85 }, { "epoch": 1.0886075949367089, "grad_norm": 0.4337831437587738, "learning_rate": 0.0001492058677772123, "loss": 0.2813, "mean_token_accuracy": 0.9259702563285828, "num_tokens": 651688.0, "step": 86 }, { "epoch": 1.1012658227848102, "grad_norm": 0.5133988261222839, "learning_rate": 0.00014800697306608044, "loss": 0.3357, "mean_token_accuracy": 0.9157242774963379, "num_tokens": 659180.0, "step": 87 }, { "epoch": 1.1139240506329113, "grad_norm": 0.5234411954879761, "learning_rate": 0.00014679904339372302, "loss": 0.3015, "mean_token_accuracy": 0.9213018417358398, "num_tokens": 666741.0, "step": 88 }, { "epoch": 1.1265822784810127, "grad_norm": 0.48323073983192444, "learning_rate": 0.0001455823060937347, "loss": 0.2736, "mean_token_accuracy": 0.9301171898841858, "num_tokens": 674060.0, "step": 89 }, { "epoch": 1.139240506329114, "grad_norm": 0.4819142520427704, "learning_rate": 0.00014435699015731448, "loss": 0.2829, "mean_token_accuracy": 0.9262295365333557, "num_tokens": 681566.0, "step": 90 }, { "epoch": 1.1518987341772151, "grad_norm": 0.48243483901023865, "learning_rate": 0.00014312332619016965, "loss": 0.3003, "mean_token_accuracy": 0.9243434071540833, "num_tokens": 689283.0, "step": 91 }, { "epoch": 1.1645569620253164, "grad_norm": 0.4841754734516144, "learning_rate": 0.00014188154636911524, "loss": 0.2976, "mean_token_accuracy": 0.9215511679649353, "num_tokens": 697212.0, "step": 92 }, { "epoch": 1.1772151898734178, "grad_norm": 0.4778158962726593, "learning_rate": 0.00014063188439837832, "loss": 0.2755, "mean_token_accuracy": 0.9268808960914612, "num_tokens": 704839.0, "step": 93 }, { "epoch": 1.189873417721519, "grad_norm": 0.5948532223701477, "learning_rate": 0.0001393745754656146, "loss": 0.2929, "mean_token_accuracy": 0.9211409687995911, "num_tokens": 712055.0, "step": 94 }, { "epoch": 1.2025316455696202, "grad_norm": 0.4850385785102844, "learning_rate": 0.00013810985619764572, "loss": 0.2911, "mean_token_accuracy": 0.9238942861557007, "num_tokens": 719648.0, "step": 95 }, { "epoch": 1.2151898734177216, "grad_norm": 0.46476173400878906, "learning_rate": 0.00013683796461592604, "loss": 0.2636, "mean_token_accuracy": 0.930665910243988, "num_tokens": 727010.0, "step": 96 }, { "epoch": 1.2278481012658227, "grad_norm": 0.5223667025566101, "learning_rate": 0.00013555914009174663, "loss": 0.2572, "mean_token_accuracy": 0.9288017153739929, "num_tokens": 734518.0, "step": 97 }, { "epoch": 1.240506329113924, "grad_norm": 0.4877527058124542, "learning_rate": 0.00013427362330118543, "loss": 0.2504, "mean_token_accuracy": 0.9308496713638306, "num_tokens": 742232.0, "step": 98 }, { "epoch": 1.2531645569620253, "grad_norm": 0.6950773000717163, "learning_rate": 0.00013298165617981172, "loss": 0.3101, "mean_token_accuracy": 0.9148434400558472, "num_tokens": 749929.0, "step": 99 }, { "epoch": 1.2658227848101267, "grad_norm": 0.44876712560653687, "learning_rate": 0.0001316834818771535, "loss": 0.2368, "mean_token_accuracy": 0.9370440244674683, "num_tokens": 757395.0, "step": 100 }, { "epoch": 1.2784810126582278, "grad_norm": 0.4970650374889374, "learning_rate": 0.00013037934471093682, "loss": 0.2759, "mean_token_accuracy": 0.9289446473121643, "num_tokens": 765115.0, "step": 101 }, { "epoch": 1.2911392405063291, "grad_norm": 0.4088219404220581, "learning_rate": 0.00012906949012110456, "loss": 0.2565, "mean_token_accuracy": 0.9364038109779358, "num_tokens": 772648.0, "step": 102 }, { "epoch": 1.3037974683544304, "grad_norm": 0.4770132303237915, "learning_rate": 0.00012775416462362457, "loss": 0.2995, "mean_token_accuracy": 0.9228748083114624, "num_tokens": 780323.0, "step": 103 }, { "epoch": 1.3164556962025316, "grad_norm": 0.4587569832801819, "learning_rate": 0.00012643361576409516, "loss": 0.261, "mean_token_accuracy": 0.9282762408256531, "num_tokens": 787888.0, "step": 104 }, { "epoch": 1.3291139240506329, "grad_norm": 0.46888846158981323, "learning_rate": 0.00012510809207115666, "loss": 0.2697, "mean_token_accuracy": 0.9307641386985779, "num_tokens": 795477.0, "step": 105 }, { "epoch": 1.3417721518987342, "grad_norm": 0.4652051627635956, "learning_rate": 0.00012377784300971807, "loss": 0.2347, "mean_token_accuracy": 0.9410588145256042, "num_tokens": 803040.0, "step": 106 }, { "epoch": 1.3544303797468356, "grad_norm": 0.5084942579269409, "learning_rate": 0.00012244311893400763, "loss": 0.2555, "mean_token_accuracy": 0.9363048672676086, "num_tokens": 810687.0, "step": 107 }, { "epoch": 1.3670886075949367, "grad_norm": 0.5197248458862305, "learning_rate": 0.00012110417104045575, "loss": 0.2333, "mean_token_accuracy": 0.9379802942276001, "num_tokens": 818168.0, "step": 108 }, { "epoch": 1.379746835443038, "grad_norm": 0.5095017552375793, "learning_rate": 0.00011976125132041974, "loss": 0.2494, "mean_token_accuracy": 0.9335058331489563, "num_tokens": 825962.0, "step": 109 }, { "epoch": 1.3924050632911391, "grad_norm": 0.4584541618824005, "learning_rate": 0.00011841461251275867, "loss": 0.2747, "mean_token_accuracy": 0.9289917945861816, "num_tokens": 833842.0, "step": 110 }, { "epoch": 1.4050632911392404, "grad_norm": 0.4197942018508911, "learning_rate": 0.0001170645080562676, "loss": 0.2425, "mean_token_accuracy": 0.9401321411132812, "num_tokens": 841172.0, "step": 111 }, { "epoch": 1.4177215189873418, "grad_norm": 0.4704379439353943, "learning_rate": 0.00011571119204198037, "loss": 0.2348, "mean_token_accuracy": 0.9371610283851624, "num_tokens": 848795.0, "step": 112 }, { "epoch": 1.4303797468354431, "grad_norm": 0.47736111283302307, "learning_rate": 0.00011435491916534919, "loss": 0.2604, "mean_token_accuracy": 0.9346008896827698, "num_tokens": 856275.0, "step": 113 }, { "epoch": 1.4430379746835442, "grad_norm": 0.44608280062675476, "learning_rate": 0.00011299594467831078, "loss": 0.228, "mean_token_accuracy": 0.9441589117050171, "num_tokens": 863538.0, "step": 114 }, { "epoch": 1.4556962025316456, "grad_norm": 0.4609827995300293, "learning_rate": 0.00011163452434124773, "loss": 0.2174, "mean_token_accuracy": 0.9422593116760254, "num_tokens": 871153.0, "step": 115 }, { "epoch": 1.4683544303797469, "grad_norm": 0.49709534645080566, "learning_rate": 0.00011027091437485404, "loss": 0.2661, "mean_token_accuracy": 0.9356223344802856, "num_tokens": 878673.0, "step": 116 }, { "epoch": 1.481012658227848, "grad_norm": 0.5192921161651611, "learning_rate": 0.00010890537141191417, "loss": 0.2455, "mean_token_accuracy": 0.9369285702705383, "num_tokens": 886284.0, "step": 117 }, { "epoch": 1.4936708860759493, "grad_norm": 0.4980919361114502, "learning_rate": 0.00010753815244900458, "loss": 0.2275, "mean_token_accuracy": 0.9405483603477478, "num_tokens": 893934.0, "step": 118 }, { "epoch": 1.5063291139240507, "grad_norm": 0.5131703019142151, "learning_rate": 0.00010616951479812658, "loss": 0.2225, "mean_token_accuracy": 0.9432948231697083, "num_tokens": 901440.0, "step": 119 }, { "epoch": 1.518987341772152, "grad_norm": 0.4802223742008209, "learning_rate": 0.00010479971603828, "loss": 0.2342, "mean_token_accuracy": 0.9367021322250366, "num_tokens": 909024.0, "step": 120 }, { "epoch": 1.5316455696202531, "grad_norm": 0.45383986830711365, "learning_rate": 0.00010342901396698659, "loss": 0.1994, "mean_token_accuracy": 0.949091911315918, "num_tokens": 916356.0, "step": 121 }, { "epoch": 1.5443037974683544, "grad_norm": 0.44705086946487427, "learning_rate": 0.00010205766655177215, "loss": 0.2427, "mean_token_accuracy": 0.9395003914833069, "num_tokens": 924106.0, "step": 122 }, { "epoch": 1.5569620253164556, "grad_norm": 0.4181109368801117, "learning_rate": 0.00010068593188161697, "loss": 0.1947, "mean_token_accuracy": 0.9488508105278015, "num_tokens": 931697.0, "step": 123 }, { "epoch": 1.5696202531645569, "grad_norm": 0.48091140389442444, "learning_rate": 9.931406811838308e-05, "loss": 0.2203, "mean_token_accuracy": 0.9425989985466003, "num_tokens": 939287.0, "step": 124 }, { "epoch": 1.5822784810126582, "grad_norm": 0.5527205467224121, "learning_rate": 9.79423334482279e-05, "loss": 0.2429, "mean_token_accuracy": 0.9346159100532532, "num_tokens": 947044.0, "step": 125 }, { "epoch": 1.5949367088607596, "grad_norm": 0.4698488414287567, "learning_rate": 9.657098603301346e-05, "loss": 0.2084, "mean_token_accuracy": 0.9460563659667969, "num_tokens": 954449.0, "step": 126 }, { "epoch": 1.6075949367088609, "grad_norm": 0.4221295416355133, "learning_rate": 9.520028396172003e-05, "loss": 0.1854, "mean_token_accuracy": 0.9494868516921997, "num_tokens": 962016.0, "step": 127 }, { "epoch": 1.620253164556962, "grad_norm": 0.4718606472015381, "learning_rate": 9.383048520187344e-05, "loss": 0.2105, "mean_token_accuracy": 0.9448257088661194, "num_tokens": 969511.0, "step": 128 }, { "epoch": 1.6329113924050633, "grad_norm": 0.4742836058139801, "learning_rate": 9.246184755099545e-05, "loss": 0.1948, "mean_token_accuracy": 0.9457446932792664, "num_tokens": 977095.0, "step": 129 }, { "epoch": 1.6455696202531644, "grad_norm": 0.5384134650230408, "learning_rate": 9.109462858808586e-05, "loss": 0.2481, "mean_token_accuracy": 0.9373098611831665, "num_tokens": 984720.0, "step": 130 }, { "epoch": 1.6582278481012658, "grad_norm": 0.4646705090999603, "learning_rate": 8.972908562514598e-05, "loss": 0.2173, "mean_token_accuracy": 0.9455537796020508, "num_tokens": 992296.0, "step": 131 }, { "epoch": 1.6708860759493671, "grad_norm": 0.449430376291275, "learning_rate": 8.836547565875227e-05, "loss": 0.2098, "mean_token_accuracy": 0.9462523460388184, "num_tokens": 999858.0, "step": 132 }, { "epoch": 1.6835443037974684, "grad_norm": 0.4542527496814728, "learning_rate": 8.70040553216892e-05, "loss": 0.2089, "mean_token_accuracy": 0.9469392895698547, "num_tokens": 1007649.0, "step": 133 }, { "epoch": 1.6962025316455698, "grad_norm": 0.3584607243537903, "learning_rate": 8.564508083465079e-05, "loss": 0.1621, "mean_token_accuracy": 0.9558292031288147, "num_tokens": 1015184.0, "step": 134 }, { "epoch": 1.7088607594936709, "grad_norm": 0.43875524401664734, "learning_rate": 8.428880795801965e-05, "loss": 0.1803, "mean_token_accuracy": 0.952750563621521, "num_tokens": 1022592.0, "step": 135 }, { "epoch": 1.721518987341772, "grad_norm": 0.4122496545314789, "learning_rate": 8.293549194373243e-05, "loss": 0.1948, "mean_token_accuracy": 0.9484121799468994, "num_tokens": 1030119.0, "step": 136 }, { "epoch": 1.7341772151898733, "grad_norm": 0.3599133789539337, "learning_rate": 8.158538748724139e-05, "loss": 0.1398, "mean_token_accuracy": 0.9603773355484009, "num_tokens": 1037603.0, "step": 137 }, { "epoch": 1.7468354430379747, "grad_norm": 0.424468070268631, "learning_rate": 8.023874867958027e-05, "loss": 0.1822, "mean_token_accuracy": 0.9513099193572998, "num_tokens": 1045492.0, "step": 138 }, { "epoch": 1.759493670886076, "grad_norm": 0.5632903575897217, "learning_rate": 7.889582895954427e-05, "loss": 0.2294, "mean_token_accuracy": 0.941025972366333, "num_tokens": 1052983.0, "step": 139 }, { "epoch": 1.7721518987341773, "grad_norm": 0.42068415880203247, "learning_rate": 7.755688106599241e-05, "loss": 0.1866, "mean_token_accuracy": 0.9484808444976807, "num_tokens": 1060617.0, "step": 140 }, { "epoch": 1.7848101265822784, "grad_norm": 0.36526110768318176, "learning_rate": 7.622215699028196e-05, "loss": 0.163, "mean_token_accuracy": 0.9539258480072021, "num_tokens": 1068017.0, "step": 141 }, { "epoch": 1.7974683544303798, "grad_norm": 0.45511889457702637, "learning_rate": 7.489190792884338e-05, "loss": 0.1854, "mean_token_accuracy": 0.9514201283454895, "num_tokens": 1075862.0, "step": 142 }, { "epoch": 1.810126582278481, "grad_norm": 0.3653993010520935, "learning_rate": 7.356638423590485e-05, "loss": 0.1502, "mean_token_accuracy": 0.9577220678329468, "num_tokens": 1083424.0, "step": 143 }, { "epoch": 1.8227848101265822, "grad_norm": 0.494686484336853, "learning_rate": 7.224583537637544e-05, "loss": 0.2014, "mean_token_accuracy": 0.9472861886024475, "num_tokens": 1091171.0, "step": 144 }, { "epoch": 1.8354430379746836, "grad_norm": 0.4973593056201935, "learning_rate": 7.093050987889547e-05, "loss": 0.1619, "mean_token_accuracy": 0.9606246948242188, "num_tokens": 1098727.0, "step": 145 }, { "epoch": 1.8481012658227849, "grad_norm": 0.439903199672699, "learning_rate": 6.96206552890632e-05, "loss": 0.1495, "mean_token_accuracy": 0.9583563208580017, "num_tokens": 1106043.0, "step": 146 }, { "epoch": 1.8607594936708862, "grad_norm": 0.41443145275115967, "learning_rate": 6.831651812284652e-05, "loss": 0.1627, "mean_token_accuracy": 0.9576634764671326, "num_tokens": 1113571.0, "step": 147 }, { "epoch": 1.8734177215189873, "grad_norm": 0.41921186447143555, "learning_rate": 6.701834382018832e-05, "loss": 0.1768, "mean_token_accuracy": 0.9537719488143921, "num_tokens": 1121098.0, "step": 148 }, { "epoch": 1.8860759493670884, "grad_norm": 0.4211632013320923, "learning_rate": 6.572637669881458e-05, "loss": 0.1552, "mean_token_accuracy": 0.9575773477554321, "num_tokens": 1128823.0, "step": 149 }, { "epoch": 1.8987341772151898, "grad_norm": 0.365162193775177, "learning_rate": 6.444085990825338e-05, "loss": 0.1308, "mean_token_accuracy": 0.9660908579826355, "num_tokens": 1136702.0, "step": 150 }, { "epoch": 1.9113924050632911, "grad_norm": 0.6042749285697937, "learning_rate": 6.316203538407397e-05, "loss": 0.1883, "mean_token_accuracy": 0.9514773488044739, "num_tokens": 1144618.0, "step": 151 }, { "epoch": 1.9240506329113924, "grad_norm": 0.504920482635498, "learning_rate": 6.18901438023543e-05, "loss": 0.1711, "mean_token_accuracy": 0.9596337080001831, "num_tokens": 1152436.0, "step": 152 }, { "epoch": 1.9367088607594938, "grad_norm": 0.3634421229362488, "learning_rate": 6.0625424534385425e-05, "loss": 0.1232, "mean_token_accuracy": 0.9661855101585388, "num_tokens": 1159982.0, "step": 153 }, { "epoch": 1.9493670886075949, "grad_norm": 0.43088358640670776, "learning_rate": 5.936811560162169e-05, "loss": 0.152, "mean_token_accuracy": 0.9582157731056213, "num_tokens": 1167489.0, "step": 154 }, { "epoch": 1.9620253164556962, "grad_norm": 0.5033516883850098, "learning_rate": 5.811845363088477e-05, "loss": 0.1624, "mean_token_accuracy": 0.956744372844696, "num_tokens": 1174974.0, "step": 155 }, { "epoch": 1.9746835443037973, "grad_norm": 0.37854012846946716, "learning_rate": 5.687667380983037e-05, "loss": 0.1418, "mean_token_accuracy": 0.9615023732185364, "num_tokens": 1182493.0, "step": 156 }, { "epoch": 1.9873417721518987, "grad_norm": 0.5239201188087463, "learning_rate": 5.5643009842685554e-05, "loss": 0.1954, "mean_token_accuracy": 0.9525497555732727, "num_tokens": 1189891.0, "step": 157 }, { "epoch": 2.0, "grad_norm": 0.2560364007949829, "learning_rate": 5.4417693906265365e-05, "loss": 0.11, "mean_token_accuracy": 0.9704713821411133, "num_tokens": 1197507.0, "step": 158 }, { "epoch": 2.0126582278481013, "grad_norm": 0.24716579914093018, "learning_rate": 5.3200956606277006e-05, "loss": 0.1053, "mean_token_accuracy": 0.9706624150276184, "num_tokens": 1205104.0, "step": 159 }, { "epoch": 2.0253164556962027, "grad_norm": 0.2239724099636078, "learning_rate": 5.199302693391959e-05, "loss": 0.1069, "mean_token_accuracy": 0.9724477529525757, "num_tokens": 1212681.0, "step": 160 }, { "epoch": 2.037974683544304, "grad_norm": 0.32893016934394836, "learning_rate": 5.0794132222787707e-05, "loss": 0.1162, "mean_token_accuracy": 0.970269501209259, "num_tokens": 1219943.0, "step": 161 }, { "epoch": 2.050632911392405, "grad_norm": 0.30835914611816406, "learning_rate": 4.960449810608705e-05, "loss": 0.1296, "mean_token_accuracy": 0.9655404686927795, "num_tokens": 1227436.0, "step": 162 }, { "epoch": 2.0632911392405062, "grad_norm": 0.20363426208496094, "learning_rate": 4.8424348474170014e-05, "loss": 0.0901, "mean_token_accuracy": 0.9714903235435486, "num_tokens": 1234901.0, "step": 163 }, { "epoch": 2.0759493670886076, "grad_norm": 0.2451593428850174, "learning_rate": 4.725390543239929e-05, "loss": 0.0913, "mean_token_accuracy": 0.9731382727622986, "num_tokens": 1242485.0, "step": 164 }, { "epoch": 2.088607594936709, "grad_norm": 0.28893059492111206, "learning_rate": 4.609338925934743e-05, "loss": 0.1102, "mean_token_accuracy": 0.9688106775283813, "num_tokens": 1250276.0, "step": 165 }, { "epoch": 2.1012658227848102, "grad_norm": 0.38036951422691345, "learning_rate": 4.494301836534016e-05, "loss": 0.1068, "mean_token_accuracy": 0.9714133739471436, "num_tokens": 1257861.0, "step": 166 }, { "epoch": 2.1139240506329116, "grad_norm": 0.3020472824573517, "learning_rate": 4.380300925135138e-05, "loss": 0.1045, "mean_token_accuracy": 0.9713066816329956, "num_tokens": 1265662.0, "step": 167 }, { "epoch": 2.1265822784810124, "grad_norm": 0.33828258514404297, "learning_rate": 4.267357646825746e-05, "loss": 0.1028, "mean_token_accuracy": 0.9701977968215942, "num_tokens": 1273410.0, "step": 168 }, { "epoch": 2.1392405063291138, "grad_norm": 0.3408215045928955, "learning_rate": 4.1554932576458415e-05, "loss": 0.1015, "mean_token_accuracy": 0.9716554880142212, "num_tokens": 1280777.0, "step": 169 }, { "epoch": 2.151898734177215, "grad_norm": 0.3681698143482208, "learning_rate": 4.044728810587406e-05, "loss": 0.1087, "mean_token_accuracy": 0.969260036945343, "num_tokens": 1288193.0, "step": 170 }, { "epoch": 2.1645569620253164, "grad_norm": 0.29635900259017944, "learning_rate": 3.935085151632185e-05, "loss": 0.0924, "mean_token_accuracy": 0.9743622541427612, "num_tokens": 1296058.0, "step": 171 }, { "epoch": 2.1772151898734178, "grad_norm": 0.3427096903324127, "learning_rate": 3.826582915828468e-05, "loss": 0.1048, "mean_token_accuracy": 0.9713760614395142, "num_tokens": 1303738.0, "step": 172 }, { "epoch": 2.189873417721519, "grad_norm": 0.2907073497772217, "learning_rate": 3.719242523407539e-05, "loss": 0.093, "mean_token_accuracy": 0.9729946255683899, "num_tokens": 1311282.0, "step": 173 }, { "epoch": 2.2025316455696204, "grad_norm": 0.27637961506843567, "learning_rate": 3.613084175940578e-05, "loss": 0.0992, "mean_token_accuracy": 0.9711666107177734, "num_tokens": 1318872.0, "step": 174 }, { "epoch": 2.2151898734177213, "grad_norm": 0.3511016070842743, "learning_rate": 3.508127852536698e-05, "loss": 0.1015, "mean_token_accuracy": 0.9672537446022034, "num_tokens": 1326204.0, "step": 175 }, { "epoch": 2.2278481012658227, "grad_norm": 0.27166008949279785, "learning_rate": 3.4043933060828605e-05, "loss": 0.0981, "mean_token_accuracy": 0.9703683853149414, "num_tokens": 1333760.0, "step": 176 }, { "epoch": 2.240506329113924, "grad_norm": 0.2674514651298523, "learning_rate": 3.3019000595263574e-05, "loss": 0.1004, "mean_token_accuracy": 0.9706788063049316, "num_tokens": 1341293.0, "step": 177 }, { "epoch": 2.2531645569620253, "grad_norm": 0.2489694356918335, "learning_rate": 3.200667402200586e-05, "loss": 0.1005, "mean_token_accuracy": 0.9710597991943359, "num_tokens": 1348717.0, "step": 178 }, { "epoch": 2.2658227848101267, "grad_norm": 0.2744084894657135, "learning_rate": 3.100714386194757e-05, "loss": 0.1089, "mean_token_accuracy": 0.9690406322479248, "num_tokens": 1356307.0, "step": 179 }, { "epoch": 2.278481012658228, "grad_norm": 0.3626236319541931, "learning_rate": 3.0020598227682795e-05, "loss": 0.107, "mean_token_accuracy": 0.9673758745193481, "num_tokens": 1364126.0, "step": 180 }, { "epoch": 2.291139240506329, "grad_norm": 0.2569406032562256, "learning_rate": 2.904722278810471e-05, "loss": 0.1014, "mean_token_accuracy": 0.9709012508392334, "num_tokens": 1371613.0, "step": 181 }, { "epoch": 2.3037974683544302, "grad_norm": 0.3285917639732361, "learning_rate": 2.8087200733462425e-05, "loss": 0.1046, "mean_token_accuracy": 0.9690940380096436, "num_tokens": 1379216.0, "step": 182 }, { "epoch": 2.3164556962025316, "grad_norm": 0.20964039862155914, "learning_rate": 2.7140712740884376e-05, "loss": 0.0985, "mean_token_accuracy": 0.9698275923728943, "num_tokens": 1386704.0, "step": 183 }, { "epoch": 2.329113924050633, "grad_norm": 0.3338058292865753, "learning_rate": 2.6207936940374767e-05, "loss": 0.0947, "mean_token_accuracy": 0.971538245677948, "num_tokens": 1394322.0, "step": 184 }, { "epoch": 2.3417721518987342, "grad_norm": 0.24734541773796082, "learning_rate": 2.5289048881289256e-05, "loss": 0.0899, "mean_token_accuracy": 0.9753498435020447, "num_tokens": 1402175.0, "step": 185 }, { "epoch": 2.3544303797468356, "grad_norm": 0.2708415985107422, "learning_rate": 2.4384221499296466e-05, "loss": 0.1001, "mean_token_accuracy": 0.9718623161315918, "num_tokens": 1409880.0, "step": 186 }, { "epoch": 2.367088607594937, "grad_norm": 0.3055052161216736, "learning_rate": 2.3493625083831217e-05, "loss": 0.1024, "mean_token_accuracy": 0.9690194129943848, "num_tokens": 1417368.0, "step": 187 }, { "epoch": 2.379746835443038, "grad_norm": 0.2778116464614868, "learning_rate": 2.2617427246045973e-05, "loss": 0.0987, "mean_token_accuracy": 0.9698062539100647, "num_tokens": 1424917.0, "step": 188 }, { "epoch": 2.392405063291139, "grad_norm": 0.21404311060905457, "learning_rate": 2.1755792887266234e-05, "loss": 0.0975, "mean_token_accuracy": 0.9730854034423828, "num_tokens": 1432672.0, "step": 189 }, { "epoch": 2.4050632911392404, "grad_norm": 0.22275599837303162, "learning_rate": 2.0908884167955824e-05, "loss": 0.0955, "mean_token_accuracy": 0.9734768867492676, "num_tokens": 1440352.0, "step": 190 }, { "epoch": 2.4177215189873418, "grad_norm": 0.3580118417739868, "learning_rate": 2.0076860477198313e-05, "loss": 0.0976, "mean_token_accuracy": 0.9713793396949768, "num_tokens": 1447963.0, "step": 191 }, { "epoch": 2.430379746835443, "grad_norm": 0.2647789716720581, "learning_rate": 1.9259878402699705e-05, "loss": 0.0998, "mean_token_accuracy": 0.9713677167892456, "num_tokens": 1455536.0, "step": 192 }, { "epoch": 2.4430379746835444, "grad_norm": 0.23201273381710052, "learning_rate": 1.8458091701318504e-05, "loss": 0.0961, "mean_token_accuracy": 0.9719387888908386, "num_tokens": 1463048.0, "step": 193 }, { "epoch": 2.4556962025316453, "grad_norm": 0.2607119083404541, "learning_rate": 1.7671651270128532e-05, "loss": 0.0949, "mean_token_accuracy": 0.9710144996643066, "num_tokens": 1470564.0, "step": 194 }, { "epoch": 2.4683544303797467, "grad_norm": 0.2727314531803131, "learning_rate": 1.69007051180199e-05, "loss": 0.0973, "mean_token_accuracy": 0.9722861051559448, "num_tokens": 1478458.0, "step": 195 }, { "epoch": 2.481012658227848, "grad_norm": 0.25747543573379517, "learning_rate": 1.6145398337843652e-05, "loss": 0.0913, "mean_token_accuracy": 0.9718737602233887, "num_tokens": 1486095.0, "step": 196 }, { "epoch": 2.4936708860759493, "grad_norm": 0.28386300802230835, "learning_rate": 1.540587307910508e-05, "loss": 0.1082, "mean_token_accuracy": 0.9686080813407898, "num_tokens": 1493645.0, "step": 197 }, { "epoch": 2.5063291139240507, "grad_norm": 0.2482428401708603, "learning_rate": 1.4682268521211073e-05, "loss": 0.0945, "mean_token_accuracy": 0.9698053002357483, "num_tokens": 1501260.0, "step": 198 }, { "epoch": 2.518987341772152, "grad_norm": 0.29959413409233093, "learning_rate": 1.3974720847276412e-05, "loss": 0.1103, "mean_token_accuracy": 0.9704062342643738, "num_tokens": 1508758.0, "step": 199 }, { "epoch": 2.5316455696202533, "grad_norm": 0.2617916762828827, "learning_rate": 1.328336321849396e-05, "loss": 0.0965, "mean_token_accuracy": 0.972577691078186, "num_tokens": 1516480.0, "step": 200 }, { "epoch": 2.5443037974683547, "grad_norm": 0.25122788548469543, "learning_rate": 1.2608325749073591e-05, "loss": 0.0989, "mean_token_accuracy": 0.971817672252655, "num_tokens": 1523960.0, "step": 201 }, { "epoch": 2.5569620253164556, "grad_norm": 0.23365901410579681, "learning_rate": 1.1949735481754565e-05, "loss": 0.0911, "mean_token_accuracy": 0.9739062786102295, "num_tokens": 1531727.0, "step": 202 }, { "epoch": 2.569620253164557, "grad_norm": 0.3107486963272095, "learning_rate": 1.130771636389596e-05, "loss": 0.1038, "mean_token_accuracy": 0.9700414538383484, "num_tokens": 1539268.0, "step": 203 }, { "epoch": 2.5822784810126582, "grad_norm": 0.2310217171907425, "learning_rate": 1.0682389224149647e-05, "loss": 0.0948, "mean_token_accuracy": 0.9715954065322876, "num_tokens": 1546866.0, "step": 204 }, { "epoch": 2.5949367088607596, "grad_norm": 0.20603010058403015, "learning_rate": 1.0073871749720221e-05, "loss": 0.0947, "mean_token_accuracy": 0.9721407890319824, "num_tokens": 1554432.0, "step": 205 }, { "epoch": 2.607594936708861, "grad_norm": 0.22616903483867645, "learning_rate": 9.482278464216121e-06, "loss": 0.0934, "mean_token_accuracy": 0.9742143154144287, "num_tokens": 1561942.0, "step": 206 }, { "epoch": 2.620253164556962, "grad_norm": 0.29869943857192993, "learning_rate": 8.907720706096224e-06, "loss": 0.099, "mean_token_accuracy": 0.9707894921302795, "num_tokens": 1569606.0, "step": 207 }, { "epoch": 2.632911392405063, "grad_norm": 0.18506982922554016, "learning_rate": 8.350306607715774e-06, "loss": 0.0967, "mean_token_accuracy": 0.9730911254882812, "num_tokens": 1576991.0, "step": 208 }, { "epoch": 2.6455696202531644, "grad_norm": 0.3081600069999695, "learning_rate": 7.810141074975818e-06, "loss": 0.1021, "mean_token_accuracy": 0.9701170921325684, "num_tokens": 1584484.0, "step": 209 }, { "epoch": 2.6582278481012658, "grad_norm": 0.27944669127464294, "learning_rate": 7.287325767579756e-06, "loss": 0.1081, "mean_token_accuracy": 0.9698938727378845, "num_tokens": 1592088.0, "step": 210 }, { "epoch": 2.670886075949367, "grad_norm": 0.1560535430908203, "learning_rate": 6.781959079900957e-06, "loss": 0.0884, "mean_token_accuracy": 0.9742401242256165, "num_tokens": 1599489.0, "step": 211 }, { "epoch": 2.6835443037974684, "grad_norm": 0.2630186378955841, "learning_rate": 6.2941361224647e-06, "loss": 0.1012, "mean_token_accuracy": 0.9717521667480469, "num_tokens": 1607235.0, "step": 212 }, { "epoch": 2.6962025316455698, "grad_norm": 0.20801326632499695, "learning_rate": 5.823948704048443e-06, "loss": 0.094, "mean_token_accuracy": 0.9722370505332947, "num_tokens": 1614791.0, "step": 213 }, { "epoch": 2.708860759493671, "grad_norm": 0.23363713920116425, "learning_rate": 5.371485314403202e-06, "loss": 0.1017, "mean_token_accuracy": 0.9724119901657104, "num_tokens": 1622467.0, "step": 214 }, { "epoch": 2.721518987341772, "grad_norm": 0.27849259972572327, "learning_rate": 4.936831107599749e-06, "loss": 0.106, "mean_token_accuracy": 0.9699349999427795, "num_tokens": 1629915.0, "step": 215 }, { "epoch": 2.7341772151898733, "grad_norm": 0.2073725014925003, "learning_rate": 4.5200678860024885e-06, "loss": 0.0941, "mean_token_accuracy": 0.9706724882125854, "num_tokens": 1637310.0, "step": 216 }, { "epoch": 2.7468354430379747, "grad_norm": 0.2289542257785797, "learning_rate": 4.121274084874194e-06, "loss": 0.0926, "mean_token_accuracy": 0.973173975944519, "num_tokens": 1644904.0, "step": 217 }, { "epoch": 2.759493670886076, "grad_norm": 0.2967240512371063, "learning_rate": 3.7405247576144054e-06, "loss": 0.0947, "mean_token_accuracy": 0.9712704420089722, "num_tokens": 1652556.0, "step": 218 }, { "epoch": 2.7721518987341773, "grad_norm": 0.2061406522989273, "learning_rate": 3.3778915616342943e-06, "loss": 0.0921, "mean_token_accuracy": 0.9731997847557068, "num_tokens": 1660008.0, "step": 219 }, { "epoch": 2.7848101265822782, "grad_norm": 0.20453591644763947, "learning_rate": 3.0334427448706847e-06, "loss": 0.0912, "mean_token_accuracy": 0.9720537662506104, "num_tokens": 1667658.0, "step": 220 }, { "epoch": 2.7974683544303796, "grad_norm": 0.23907408118247986, "learning_rate": 2.707243132941717e-06, "loss": 0.0965, "mean_token_accuracy": 0.9735056757926941, "num_tokens": 1675535.0, "step": 221 }, { "epoch": 2.810126582278481, "grad_norm": 0.3273867070674896, "learning_rate": 2.3993541169465837e-06, "loss": 0.0951, "mean_token_accuracy": 0.9698397517204285, "num_tokens": 1683026.0, "step": 222 }, { "epoch": 2.8227848101265822, "grad_norm": 0.2258942574262619, "learning_rate": 2.1098336419116625e-06, "loss": 0.0954, "mean_token_accuracy": 0.9716787338256836, "num_tokens": 1690399.0, "step": 223 }, { "epoch": 2.8354430379746836, "grad_norm": 0.21475453674793243, "learning_rate": 1.838736195885238e-06, "loss": 0.0915, "mean_token_accuracy": 0.9741595387458801, "num_tokens": 1698048.0, "step": 224 }, { "epoch": 2.848101265822785, "grad_norm": 0.2630147635936737, "learning_rate": 1.5861127996827597e-06, "loss": 0.0987, "mean_token_accuracy": 0.9713319540023804, "num_tokens": 1705507.0, "step": 225 }, { "epoch": 2.8607594936708862, "grad_norm": 0.24740326404571533, "learning_rate": 1.3520109972846917e-06, "loss": 0.0953, "mean_token_accuracy": 0.9725081324577332, "num_tokens": 1712955.0, "step": 226 }, { "epoch": 2.8734177215189876, "grad_norm": 0.21480882167816162, "learning_rate": 1.1364748468886687e-06, "loss": 0.0936, "mean_token_accuracy": 0.9725086092948914, "num_tokens": 1720294.0, "step": 227 }, { "epoch": 2.8860759493670884, "grad_norm": 0.17724719643592834, "learning_rate": 9.395449126177291e-07, "loss": 0.0865, "mean_token_accuracy": 0.9737974405288696, "num_tokens": 1728029.0, "step": 228 }, { "epoch": 2.8987341772151898, "grad_norm": 0.1948229819536209, "learning_rate": 7.612582568860549e-07, "loss": 0.0908, "mean_token_accuracy": 0.9719676375389099, "num_tokens": 1735513.0, "step": 229 }, { "epoch": 2.911392405063291, "grad_norm": 0.2432938814163208, "learning_rate": 6.016484334238515e-07, "loss": 0.0976, "mean_token_accuracy": 0.9726666808128357, "num_tokens": 1743077.0, "step": 230 }, { "epoch": 2.9240506329113924, "grad_norm": 0.334950715303421, "learning_rate": 4.607454809624434e-07, "loss": 0.1115, "mean_token_accuracy": 0.9661816954612732, "num_tokens": 1750770.0, "step": 231 }, { "epoch": 2.9367088607594938, "grad_norm": 0.2737453281879425, "learning_rate": 3.385759175809966e-07, "loss": 0.0976, "mean_token_accuracy": 0.9702790379524231, "num_tokens": 1758539.0, "step": 232 }, { "epoch": 2.9493670886075947, "grad_norm": 0.20212914049625397, "learning_rate": 2.3516273571577708e-07, "loss": 0.0922, "mean_token_accuracy": 0.972845196723938, "num_tokens": 1766005.0, "step": 233 }, { "epoch": 2.962025316455696, "grad_norm": 0.28339385986328125, "learning_rate": 1.505253978329235e-07, "loss": 0.1017, "mean_token_accuracy": 0.9697776436805725, "num_tokens": 1773580.0, "step": 234 }, { "epoch": 2.9746835443037973, "grad_norm": 0.18123164772987366, "learning_rate": 8.467983276563284e-08, "loss": 0.0896, "mean_token_accuracy": 0.9740137457847595, "num_tokens": 1781071.0, "step": 235 }, { "epoch": 2.9873417721518987, "grad_norm": 0.21046403050422668, "learning_rate": 3.763843271631373e-08, "loss": 0.0926, "mean_token_accuracy": 0.9746376872062683, "num_tokens": 1788587.0, "step": 236 }, { "epoch": 3.0, "grad_norm": 0.22790654003620148, "learning_rate": 9.410050924374415e-09, "loss": 0.085, "mean_token_accuracy": 0.9737589359283447, "num_tokens": 1796044.0, "step": 237 }, { "epoch": 3.0, "step": 237, "total_flos": 1.1297352468712653e+17, "train_loss": 0.33737788211067016, "train_runtime": 357.577, "train_samples_per_second": 41.949, "train_steps_per_second": 0.663 } ], "logging_steps": 1.0, "max_steps": 237, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.1297352468712653e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }