| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.0434227330779056, |
| "eval_steps": 500, |
| "global_step": 600, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.017028522775649212, |
| "grad_norm": 3.096078395843506, |
| "learning_rate": 0.0001988623435722412, |
| "loss": 2.9252, |
| "mean_token_accuracy": 0.5491172857582569, |
| "num_tokens": 4766.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.034057045551298425, |
| "grad_norm": 0.695277214050293, |
| "learning_rate": 0.00019772468714448238, |
| "loss": 0.924, |
| "mean_token_accuracy": 0.8361630752682686, |
| "num_tokens": 9556.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.05108556832694764, |
| "grad_norm": 0.541026771068573, |
| "learning_rate": 0.00019658703071672356, |
| "loss": 0.5477, |
| "mean_token_accuracy": 0.8945453137159347, |
| "num_tokens": 14116.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.06811409110259685, |
| "grad_norm": 0.5480035543441772, |
| "learning_rate": 0.00019544937428896475, |
| "loss": 0.5796, |
| "mean_token_accuracy": 0.8836526513099671, |
| "num_tokens": 18879.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.08514261387824607, |
| "grad_norm": 0.5408394932746887, |
| "learning_rate": 0.00019431171786120593, |
| "loss": 0.6289, |
| "mean_token_accuracy": 0.8782178282737731, |
| "num_tokens": 23699.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.10217113665389528, |
| "grad_norm": 0.583755612373352, |
| "learning_rate": 0.00019317406143344712, |
| "loss": 0.5507, |
| "mean_token_accuracy": 0.8905435591936112, |
| "num_tokens": 28425.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.11919965942954448, |
| "grad_norm": 0.5654754638671875, |
| "learning_rate": 0.0001920364050056883, |
| "loss": 0.5163, |
| "mean_token_accuracy": 0.8963450387120246, |
| "num_tokens": 33060.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.1362281822051937, |
| "grad_norm": 0.5462912321090698, |
| "learning_rate": 0.00019089874857792946, |
| "loss": 0.6819, |
| "mean_token_accuracy": 0.8708900690078736, |
| "num_tokens": 38017.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.1532567049808429, |
| "grad_norm": 0.45884689688682556, |
| "learning_rate": 0.00018976109215017067, |
| "loss": 0.5452, |
| "mean_token_accuracy": 0.8896441653370857, |
| "num_tokens": 42760.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.17028522775649213, |
| "grad_norm": 0.5886663198471069, |
| "learning_rate": 0.00018862343572241183, |
| "loss": 0.5337, |
| "mean_token_accuracy": 0.8954117730259895, |
| "num_tokens": 47455.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.18731375053214133, |
| "grad_norm": 0.5249215364456177, |
| "learning_rate": 0.00018748577929465302, |
| "loss": 0.4948, |
| "mean_token_accuracy": 0.9001417383551598, |
| "num_tokens": 52186.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.20434227330779056, |
| "grad_norm": 0.40858832001686096, |
| "learning_rate": 0.0001863481228668942, |
| "loss": 0.4616, |
| "mean_token_accuracy": 0.9116851478815079, |
| "num_tokens": 56765.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.22137079608343976, |
| "grad_norm": 0.4287504553794861, |
| "learning_rate": 0.0001852104664391354, |
| "loss": 0.5232, |
| "mean_token_accuracy": 0.895601749420166, |
| "num_tokens": 61436.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.23839931885908897, |
| "grad_norm": 0.5480343103408813, |
| "learning_rate": 0.00018407281001137657, |
| "loss": 0.5757, |
| "mean_token_accuracy": 0.8878508538007737, |
| "num_tokens": 66190.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.2554278416347382, |
| "grad_norm": 0.4539305567741394, |
| "learning_rate": 0.00018293515358361776, |
| "loss": 0.5136, |
| "mean_token_accuracy": 0.8946248903870583, |
| "num_tokens": 70888.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.2724563644103874, |
| "grad_norm": 0.5497062802314758, |
| "learning_rate": 0.00018179749715585894, |
| "loss": 0.4996, |
| "mean_token_accuracy": 0.9008801370859146, |
| "num_tokens": 75588.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.2894848871860366, |
| "grad_norm": 0.5979815721511841, |
| "learning_rate": 0.00018065984072810013, |
| "loss": 0.5454, |
| "mean_token_accuracy": 0.8904410973191261, |
| "num_tokens": 80394.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 0.3065134099616858, |
| "grad_norm": 0.44527795910835266, |
| "learning_rate": 0.0001795221843003413, |
| "loss": 0.4675, |
| "mean_token_accuracy": 0.9040657833218575, |
| "num_tokens": 85088.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.32354193273733506, |
| "grad_norm": 0.5105463862419128, |
| "learning_rate": 0.0001783845278725825, |
| "loss": 0.5391, |
| "mean_token_accuracy": 0.8978576123714447, |
| "num_tokens": 89799.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 0.34057045551298426, |
| "grad_norm": 0.5285545587539673, |
| "learning_rate": 0.00017724687144482368, |
| "loss": 0.5426, |
| "mean_token_accuracy": 0.890034094452858, |
| "num_tokens": 94573.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.35759897828863346, |
| "grad_norm": 0.5576184988021851, |
| "learning_rate": 0.00017610921501706487, |
| "loss": 0.5258, |
| "mean_token_accuracy": 0.8902270376682282, |
| "num_tokens": 99357.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 0.37462750106428266, |
| "grad_norm": 0.5248317718505859, |
| "learning_rate": 0.00017497155858930602, |
| "loss": 0.5373, |
| "mean_token_accuracy": 0.8933822825551033, |
| "num_tokens": 104092.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 0.39165602383993187, |
| "grad_norm": 0.45350518822669983, |
| "learning_rate": 0.00017383390216154724, |
| "loss": 0.5542, |
| "mean_token_accuracy": 0.8876873329281807, |
| "num_tokens": 108902.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 0.4086845466155811, |
| "grad_norm": 0.5155291557312012, |
| "learning_rate": 0.0001726962457337884, |
| "loss": 0.5019, |
| "mean_token_accuracy": 0.9029773235321045, |
| "num_tokens": 113571.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.4257130693912303, |
| "grad_norm": 0.5053763389587402, |
| "learning_rate": 0.0001715585893060296, |
| "loss": 0.5595, |
| "mean_token_accuracy": 0.8906429842114448, |
| "num_tokens": 118402.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 0.4427415921668795, |
| "grad_norm": 0.5493877530097961, |
| "learning_rate": 0.00017042093287827076, |
| "loss": 0.4821, |
| "mean_token_accuracy": 0.9028852418065071, |
| "num_tokens": 123147.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 0.45977011494252873, |
| "grad_norm": 0.426513135433197, |
| "learning_rate": 0.00016928327645051198, |
| "loss": 0.5311, |
| "mean_token_accuracy": 0.8920483842492104, |
| "num_tokens": 127878.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 0.47679863771817793, |
| "grad_norm": 0.5025385022163391, |
| "learning_rate": 0.00016814562002275313, |
| "loss": 0.4699, |
| "mean_token_accuracy": 0.9039205580949783, |
| "num_tokens": 132591.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.49382716049382713, |
| "grad_norm": 0.4677104651927948, |
| "learning_rate": 0.00016700796359499432, |
| "loss": 0.4876, |
| "mean_token_accuracy": 0.9038951709866524, |
| "num_tokens": 137221.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 0.5108556832694764, |
| "grad_norm": 0.5534231066703796, |
| "learning_rate": 0.0001658703071672355, |
| "loss": 0.4969, |
| "mean_token_accuracy": 0.897729343175888, |
| "num_tokens": 141981.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.5278842060451255, |
| "grad_norm": 0.4998553395271301, |
| "learning_rate": 0.0001647326507394767, |
| "loss": 0.5476, |
| "mean_token_accuracy": 0.8921540513634681, |
| "num_tokens": 146807.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 0.5449127288207748, |
| "grad_norm": 0.545978307723999, |
| "learning_rate": 0.00016359499431171787, |
| "loss": 0.4543, |
| "mean_token_accuracy": 0.9018902003765106, |
| "num_tokens": 151544.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.561941251596424, |
| "grad_norm": 0.5749042630195618, |
| "learning_rate": 0.00016245733788395906, |
| "loss": 0.5064, |
| "mean_token_accuracy": 0.8976296812295914, |
| "num_tokens": 156280.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 0.5789697743720732, |
| "grad_norm": 0.5217350125312805, |
| "learning_rate": 0.00016131968145620024, |
| "loss": 0.4741, |
| "mean_token_accuracy": 0.9045222416520119, |
| "num_tokens": 161011.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 0.5959982971477225, |
| "grad_norm": 0.5088939666748047, |
| "learning_rate": 0.00016018202502844143, |
| "loss": 0.4655, |
| "mean_token_accuracy": 0.9078934848308563, |
| "num_tokens": 165670.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 0.6130268199233716, |
| "grad_norm": 0.5888277292251587, |
| "learning_rate": 0.0001590443686006826, |
| "loss": 0.4692, |
| "mean_token_accuracy": 0.9044368535280227, |
| "num_tokens": 170377.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.6300553426990209, |
| "grad_norm": 0.6187074780464172, |
| "learning_rate": 0.0001579067121729238, |
| "loss": 0.5105, |
| "mean_token_accuracy": 0.8983473464846611, |
| "num_tokens": 175090.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 0.6470838654746701, |
| "grad_norm": 0.5764688849449158, |
| "learning_rate": 0.00015676905574516496, |
| "loss": 0.5022, |
| "mean_token_accuracy": 0.8986694201827049, |
| "num_tokens": 179933.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 0.6641123882503193, |
| "grad_norm": 0.5491649508476257, |
| "learning_rate": 0.00015563139931740617, |
| "loss": 0.5028, |
| "mean_token_accuracy": 0.8957466080784797, |
| "num_tokens": 184767.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 0.6811409110259685, |
| "grad_norm": 0.4836632311344147, |
| "learning_rate": 0.00015449374288964733, |
| "loss": 0.5325, |
| "mean_token_accuracy": 0.8894904315471649, |
| "num_tokens": 189624.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.6981694338016177, |
| "grad_norm": 0.4630073308944702, |
| "learning_rate": 0.00015335608646188854, |
| "loss": 0.4529, |
| "mean_token_accuracy": 0.9051140874624253, |
| "num_tokens": 194357.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 0.7151979565772669, |
| "grad_norm": 0.49463990330696106, |
| "learning_rate": 0.0001522184300341297, |
| "loss": 0.4165, |
| "mean_token_accuracy": 0.9074924409389495, |
| "num_tokens": 199038.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 0.7322264793529162, |
| "grad_norm": 0.5512949824333191, |
| "learning_rate": 0.00015108077360637088, |
| "loss": 0.4798, |
| "mean_token_accuracy": 0.9015959203243256, |
| "num_tokens": 203805.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 0.7492550021285653, |
| "grad_norm": 0.58586585521698, |
| "learning_rate": 0.00014994311717861207, |
| "loss": 0.5301, |
| "mean_token_accuracy": 0.8944625854492188, |
| "num_tokens": 208579.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.7662835249042146, |
| "grad_norm": 0.4895232319831848, |
| "learning_rate": 0.00014880546075085325, |
| "loss": 0.4694, |
| "mean_token_accuracy": 0.9098370909690857, |
| "num_tokens": 213237.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 0.7833120476798637, |
| "grad_norm": 0.5064729452133179, |
| "learning_rate": 0.00014766780432309444, |
| "loss": 0.5047, |
| "mean_token_accuracy": 0.8984142780303955, |
| "num_tokens": 217964.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 0.800340570455513, |
| "grad_norm": 0.5260823965072632, |
| "learning_rate": 0.00014653014789533562, |
| "loss": 0.5159, |
| "mean_token_accuracy": 0.8943046078085899, |
| "num_tokens": 222821.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 0.8173690932311622, |
| "grad_norm": 0.5452587604522705, |
| "learning_rate": 0.0001453924914675768, |
| "loss": 0.4438, |
| "mean_token_accuracy": 0.905141781270504, |
| "num_tokens": 227453.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.8343976160068114, |
| "grad_norm": 0.5265963077545166, |
| "learning_rate": 0.000144254835039818, |
| "loss": 0.472, |
| "mean_token_accuracy": 0.9038746282458305, |
| "num_tokens": 232153.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 0.8514261387824607, |
| "grad_norm": 0.655539333820343, |
| "learning_rate": 0.00014311717861205915, |
| "loss": 0.542, |
| "mean_token_accuracy": 0.8909124419093132, |
| "num_tokens": 236925.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.8684546615581098, |
| "grad_norm": 0.4830772578716278, |
| "learning_rate": 0.00014197952218430036, |
| "loss": 0.4432, |
| "mean_token_accuracy": 0.9110842600464821, |
| "num_tokens": 241546.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 0.885483184333759, |
| "grad_norm": 0.5120635032653809, |
| "learning_rate": 0.00014084186575654152, |
| "loss": 0.4758, |
| "mean_token_accuracy": 0.904394218325615, |
| "num_tokens": 246278.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.9025117071094083, |
| "grad_norm": 0.49142977595329285, |
| "learning_rate": 0.00013970420932878273, |
| "loss": 0.481, |
| "mean_token_accuracy": 0.8970154285430908, |
| "num_tokens": 251040.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 0.9195402298850575, |
| "grad_norm": 0.5381618738174438, |
| "learning_rate": 0.0001385665529010239, |
| "loss": 0.4988, |
| "mean_token_accuracy": 0.8992804601788521, |
| "num_tokens": 255781.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 0.9365687526607067, |
| "grad_norm": 0.5239886045455933, |
| "learning_rate": 0.0001374288964732651, |
| "loss": 0.4957, |
| "mean_token_accuracy": 0.9006548926234246, |
| "num_tokens": 260512.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 0.9535972754363559, |
| "grad_norm": 0.5325700640678406, |
| "learning_rate": 0.00013629124004550626, |
| "loss": 0.4876, |
| "mean_token_accuracy": 0.8976434960961341, |
| "num_tokens": 265234.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.9706257982120051, |
| "grad_norm": 0.52351975440979, |
| "learning_rate": 0.00013515358361774744, |
| "loss": 0.4408, |
| "mean_token_accuracy": 0.9042558416724205, |
| "num_tokens": 269939.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 0.9876543209876543, |
| "grad_norm": 0.5632317066192627, |
| "learning_rate": 0.00013401592718998863, |
| "loss": 0.4267, |
| "mean_token_accuracy": 0.9127328768372536, |
| "num_tokens": 274580.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 1.0046828437633035, |
| "grad_norm": 0.43729496002197266, |
| "learning_rate": 0.00013287827076222981, |
| "loss": 0.5103, |
| "mean_token_accuracy": 0.9010089665651322, |
| "num_tokens": 279321.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 1.0217113665389528, |
| "grad_norm": 0.45043033361434937, |
| "learning_rate": 0.000131740614334471, |
| "loss": 0.376, |
| "mean_token_accuracy": 0.9193378701806069, |
| "num_tokens": 284033.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 1.038739889314602, |
| "grad_norm": 0.6295264363288879, |
| "learning_rate": 0.00013060295790671218, |
| "loss": 0.3561, |
| "mean_token_accuracy": 0.9209762245416642, |
| "num_tokens": 288815.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 1.055768412090251, |
| "grad_norm": 0.5746341347694397, |
| "learning_rate": 0.00012946530147895337, |
| "loss": 0.361, |
| "mean_token_accuracy": 0.9210935369133949, |
| "num_tokens": 293454.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 1.0727969348659003, |
| "grad_norm": 0.5386441349983215, |
| "learning_rate": 0.00012832764505119455, |
| "loss": 0.3631, |
| "mean_token_accuracy": 0.923116135597229, |
| "num_tokens": 298136.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 1.0898254576415496, |
| "grad_norm": 0.637798547744751, |
| "learning_rate": 0.0001271899886234357, |
| "loss": 0.375, |
| "mean_token_accuracy": 0.9151263251900673, |
| "num_tokens": 302962.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 1.1068539804171988, |
| "grad_norm": 0.6014487147331238, |
| "learning_rate": 0.00012605233219567692, |
| "loss": 0.3584, |
| "mean_token_accuracy": 0.9245758667588234, |
| "num_tokens": 307661.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 1.123882503192848, |
| "grad_norm": 0.6004022359848022, |
| "learning_rate": 0.00012491467576791808, |
| "loss": 0.3569, |
| "mean_token_accuracy": 0.921052211523056, |
| "num_tokens": 312330.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 1.1409110259684971, |
| "grad_norm": 0.8666739463806152, |
| "learning_rate": 0.0001237770193401593, |
| "loss": 0.3778, |
| "mean_token_accuracy": 0.9176680579781532, |
| "num_tokens": 317107.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 1.1579395487441464, |
| "grad_norm": 0.5575281381607056, |
| "learning_rate": 0.00012263936291240045, |
| "loss": 0.3765, |
| "mean_token_accuracy": 0.9149453848600387, |
| "num_tokens": 321895.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 1.1749680715197957, |
| "grad_norm": 0.5432224273681641, |
| "learning_rate": 0.00012150170648464165, |
| "loss": 0.3546, |
| "mean_token_accuracy": 0.9211765006184578, |
| "num_tokens": 326592.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 1.191996594295445, |
| "grad_norm": 0.5993474721908569, |
| "learning_rate": 0.00012036405005688282, |
| "loss": 0.3721, |
| "mean_token_accuracy": 0.9195932745933533, |
| "num_tokens": 331391.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 1.2090251170710942, |
| "grad_norm": 0.6452960968017578, |
| "learning_rate": 0.000119226393629124, |
| "loss": 0.4292, |
| "mean_token_accuracy": 0.9088605523109436, |
| "num_tokens": 336238.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 1.2260536398467432, |
| "grad_norm": 0.5383236408233643, |
| "learning_rate": 0.00011808873720136519, |
| "loss": 0.3192, |
| "mean_token_accuracy": 0.9233780831098557, |
| "num_tokens": 340817.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 1.2430821626223925, |
| "grad_norm": 0.6566250324249268, |
| "learning_rate": 0.00011695108077360638, |
| "loss": 0.3617, |
| "mean_token_accuracy": 0.916201414167881, |
| "num_tokens": 345509.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 1.2601106853980417, |
| "grad_norm": 0.6461586952209473, |
| "learning_rate": 0.00011581342434584756, |
| "loss": 0.3971, |
| "mean_token_accuracy": 0.9110044553875923, |
| "num_tokens": 350303.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 1.277139208173691, |
| "grad_norm": 0.700552225112915, |
| "learning_rate": 0.00011467576791808873, |
| "loss": 0.3439, |
| "mean_token_accuracy": 0.9284276351332664, |
| "num_tokens": 354873.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 1.29416773094934, |
| "grad_norm": 0.6307278871536255, |
| "learning_rate": 0.00011353811149032993, |
| "loss": 0.3619, |
| "mean_token_accuracy": 0.9204769432544708, |
| "num_tokens": 359564.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 1.3111962537249893, |
| "grad_norm": 0.5559372901916504, |
| "learning_rate": 0.0001124004550625711, |
| "loss": 0.337, |
| "mean_token_accuracy": 0.9221480071544648, |
| "num_tokens": 364285.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 1.3282247765006385, |
| "grad_norm": 0.7321580648422241, |
| "learning_rate": 0.00011126279863481229, |
| "loss": 0.3864, |
| "mean_token_accuracy": 0.917863991856575, |
| "num_tokens": 369021.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 1.3452532992762878, |
| "grad_norm": 0.6482062339782715, |
| "learning_rate": 0.00011012514220705347, |
| "loss": 0.342, |
| "mean_token_accuracy": 0.9234487116336823, |
| "num_tokens": 373711.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 1.362281822051937, |
| "grad_norm": 0.7216457724571228, |
| "learning_rate": 0.00010898748577929466, |
| "loss": 0.3494, |
| "mean_token_accuracy": 0.9197908401489258, |
| "num_tokens": 378403.0, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.3793103448275863, |
| "grad_norm": 0.7166584730148315, |
| "learning_rate": 0.00010784982935153584, |
| "loss": 0.3768, |
| "mean_token_accuracy": 0.9174183040857316, |
| "num_tokens": 383100.0, |
| "step": 405 |
| }, |
| { |
| "epoch": 1.3963388676032356, |
| "grad_norm": 0.8020215630531311, |
| "learning_rate": 0.00010671217292377703, |
| "loss": 0.3772, |
| "mean_token_accuracy": 0.9173366680741311, |
| "num_tokens": 387930.0, |
| "step": 410 |
| }, |
| { |
| "epoch": 1.4133673903788846, |
| "grad_norm": 0.6404600143432617, |
| "learning_rate": 0.00010557451649601821, |
| "loss": 0.3345, |
| "mean_token_accuracy": 0.9267360553145408, |
| "num_tokens": 392624.0, |
| "step": 415 |
| }, |
| { |
| "epoch": 1.4303959131545338, |
| "grad_norm": 0.7745601534843445, |
| "learning_rate": 0.00010443686006825938, |
| "loss": 0.3762, |
| "mean_token_accuracy": 0.9124831840395927, |
| "num_tokens": 397405.0, |
| "step": 420 |
| }, |
| { |
| "epoch": 1.447424435930183, |
| "grad_norm": 0.6004043817520142, |
| "learning_rate": 0.00010329920364050057, |
| "loss": 0.402, |
| "mean_token_accuracy": 0.914434814453125, |
| "num_tokens": 402178.0, |
| "step": 425 |
| }, |
| { |
| "epoch": 1.4644529587058321, |
| "grad_norm": 0.6424717903137207, |
| "learning_rate": 0.00010216154721274175, |
| "loss": 0.3269, |
| "mean_token_accuracy": 0.9274717316031456, |
| "num_tokens": 406801.0, |
| "step": 430 |
| }, |
| { |
| "epoch": 1.4814814814814814, |
| "grad_norm": 0.7379339337348938, |
| "learning_rate": 0.00010102389078498294, |
| "loss": 0.3853, |
| "mean_token_accuracy": 0.9116453334689141, |
| "num_tokens": 411635.0, |
| "step": 435 |
| }, |
| { |
| "epoch": 1.4985100042571307, |
| "grad_norm": 0.6798533201217651, |
| "learning_rate": 9.988623435722412e-05, |
| "loss": 0.3442, |
| "mean_token_accuracy": 0.9197518125176429, |
| "num_tokens": 416372.0, |
| "step": 440 |
| }, |
| { |
| "epoch": 1.51553852703278, |
| "grad_norm": 0.5506631731987, |
| "learning_rate": 9.874857792946531e-05, |
| "loss": 0.3557, |
| "mean_token_accuracy": 0.9198912262916565, |
| "num_tokens": 421129.0, |
| "step": 445 |
| }, |
| { |
| "epoch": 1.5325670498084292, |
| "grad_norm": 32.163753509521484, |
| "learning_rate": 9.761092150170649e-05, |
| "loss": 0.2988, |
| "mean_token_accuracy": 0.9316724047064782, |
| "num_tokens": 425749.0, |
| "step": 450 |
| }, |
| { |
| "epoch": 1.5495955725840784, |
| "grad_norm": 0.6345335841178894, |
| "learning_rate": 9.647326507394768e-05, |
| "loss": 0.328, |
| "mean_token_accuracy": 0.925884073972702, |
| "num_tokens": 430356.0, |
| "step": 455 |
| }, |
| { |
| "epoch": 1.5666240953597277, |
| "grad_norm": 0.4996885657310486, |
| "learning_rate": 9.533560864618886e-05, |
| "loss": 0.3357, |
| "mean_token_accuracy": 0.9236923009157181, |
| "num_tokens": 435131.0, |
| "step": 460 |
| }, |
| { |
| "epoch": 1.5836526181353767, |
| "grad_norm": 0.7736502289772034, |
| "learning_rate": 9.419795221843003e-05, |
| "loss": 0.3363, |
| "mean_token_accuracy": 0.919234861433506, |
| "num_tokens": 439799.0, |
| "step": 465 |
| }, |
| { |
| "epoch": 1.600681140911026, |
| "grad_norm": 0.5958617925643921, |
| "learning_rate": 9.306029579067122e-05, |
| "loss": 0.3636, |
| "mean_token_accuracy": 0.92172020226717, |
| "num_tokens": 444514.0, |
| "step": 470 |
| }, |
| { |
| "epoch": 1.617709663686675, |
| "grad_norm": 0.7543319463729858, |
| "learning_rate": 9.19226393629124e-05, |
| "loss": 0.3993, |
| "mean_token_accuracy": 0.9095039024949074, |
| "num_tokens": 449453.0, |
| "step": 475 |
| }, |
| { |
| "epoch": 1.6347381864623243, |
| "grad_norm": 0.6482803225517273, |
| "learning_rate": 9.078498293515359e-05, |
| "loss": 0.3359, |
| "mean_token_accuracy": 0.924050772190094, |
| "num_tokens": 454144.0, |
| "step": 480 |
| }, |
| { |
| "epoch": 1.6517667092379735, |
| "grad_norm": 0.5878757834434509, |
| "learning_rate": 8.964732650739477e-05, |
| "loss": 0.3728, |
| "mean_token_accuracy": 0.9194103494286537, |
| "num_tokens": 458839.0, |
| "step": 485 |
| }, |
| { |
| "epoch": 1.6687952320136228, |
| "grad_norm": 0.8008145689964294, |
| "learning_rate": 8.850967007963596e-05, |
| "loss": 0.3973, |
| "mean_token_accuracy": 0.9146214991807937, |
| "num_tokens": 463633.0, |
| "step": 490 |
| }, |
| { |
| "epoch": 1.685823754789272, |
| "grad_norm": 0.6370537281036377, |
| "learning_rate": 8.737201365187714e-05, |
| "loss": 0.3528, |
| "mean_token_accuracy": 0.9191272169351578, |
| "num_tokens": 468319.0, |
| "step": 495 |
| }, |
| { |
| "epoch": 1.7028522775649213, |
| "grad_norm": 0.6956344842910767, |
| "learning_rate": 8.623435722411833e-05, |
| "loss": 0.3584, |
| "mean_token_accuracy": 0.9227298349142075, |
| "num_tokens": 473018.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.7198808003405706, |
| "grad_norm": 0.5346872806549072, |
| "learning_rate": 8.509670079635951e-05, |
| "loss": 0.3094, |
| "mean_token_accuracy": 0.9289079144597053, |
| "num_tokens": 477564.0, |
| "step": 505 |
| }, |
| { |
| "epoch": 1.7369093231162198, |
| "grad_norm": 0.6789258122444153, |
| "learning_rate": 8.395904436860069e-05, |
| "loss": 0.3999, |
| "mean_token_accuracy": 0.9171444311738014, |
| "num_tokens": 482329.0, |
| "step": 510 |
| }, |
| { |
| "epoch": 1.7539378458918689, |
| "grad_norm": 0.7325442433357239, |
| "learning_rate": 8.282138794084187e-05, |
| "loss": 0.3576, |
| "mean_token_accuracy": 0.919205529987812, |
| "num_tokens": 487073.0, |
| "step": 515 |
| }, |
| { |
| "epoch": 1.770966368667518, |
| "grad_norm": 0.6846973299980164, |
| "learning_rate": 8.168373151308306e-05, |
| "loss": 0.3547, |
| "mean_token_accuracy": 0.9206994399428368, |
| "num_tokens": 491796.0, |
| "step": 520 |
| }, |
| { |
| "epoch": 1.7879948914431671, |
| "grad_norm": 0.5631270408630371, |
| "learning_rate": 8.054607508532424e-05, |
| "loss": 0.3473, |
| "mean_token_accuracy": 0.9214297071099281, |
| "num_tokens": 496498.0, |
| "step": 525 |
| }, |
| { |
| "epoch": 1.8050234142188164, |
| "grad_norm": 0.6066986322402954, |
| "learning_rate": 7.940841865756543e-05, |
| "loss": 0.3774, |
| "mean_token_accuracy": 0.9192397773265839, |
| "num_tokens": 501235.0, |
| "step": 530 |
| }, |
| { |
| "epoch": 1.8220519369944657, |
| "grad_norm": 0.6359360218048096, |
| "learning_rate": 7.827076222980661e-05, |
| "loss": 0.324, |
| "mean_token_accuracy": 0.9266907840967178, |
| "num_tokens": 505887.0, |
| "step": 535 |
| }, |
| { |
| "epoch": 1.839080459770115, |
| "grad_norm": 0.836995005607605, |
| "learning_rate": 7.71331058020478e-05, |
| "loss": 0.3708, |
| "mean_token_accuracy": 0.915412899851799, |
| "num_tokens": 510670.0, |
| "step": 540 |
| }, |
| { |
| "epoch": 1.8561089825457642, |
| "grad_norm": 0.6547362208366394, |
| "learning_rate": 7.599544937428897e-05, |
| "loss": 0.394, |
| "mean_token_accuracy": 0.9127551719546318, |
| "num_tokens": 515432.0, |
| "step": 545 |
| }, |
| { |
| "epoch": 1.8731375053214134, |
| "grad_norm": 0.6609506607055664, |
| "learning_rate": 7.485779294653015e-05, |
| "loss": 0.4105, |
| "mean_token_accuracy": 0.910239189863205, |
| "num_tokens": 520330.0, |
| "step": 550 |
| }, |
| { |
| "epoch": 1.8901660280970627, |
| "grad_norm": 0.6680045127868652, |
| "learning_rate": 7.372013651877134e-05, |
| "loss": 0.3478, |
| "mean_token_accuracy": 0.9242256492376327, |
| "num_tokens": 524980.0, |
| "step": 555 |
| }, |
| { |
| "epoch": 1.907194550872712, |
| "grad_norm": 0.579949676990509, |
| "learning_rate": 7.258248009101252e-05, |
| "loss": 0.389, |
| "mean_token_accuracy": 0.9161396250128746, |
| "num_tokens": 529754.0, |
| "step": 560 |
| }, |
| { |
| "epoch": 1.924223073648361, |
| "grad_norm": 0.6184946298599243, |
| "learning_rate": 7.14448236632537e-05, |
| "loss": 0.3253, |
| "mean_token_accuracy": 0.924703124165535, |
| "num_tokens": 534525.0, |
| "step": 565 |
| }, |
| { |
| "epoch": 1.9412515964240102, |
| "grad_norm": 0.657850980758667, |
| "learning_rate": 7.030716723549489e-05, |
| "loss": 0.3926, |
| "mean_token_accuracy": 0.9116024389863014, |
| "num_tokens": 539435.0, |
| "step": 570 |
| }, |
| { |
| "epoch": 1.9582801191996593, |
| "grad_norm": 0.7310178875923157, |
| "learning_rate": 6.916951080773608e-05, |
| "loss": 0.4016, |
| "mean_token_accuracy": 0.9142703726887703, |
| "num_tokens": 544326.0, |
| "step": 575 |
| }, |
| { |
| "epoch": 1.9753086419753085, |
| "grad_norm": 0.7617822289466858, |
| "learning_rate": 6.803185437997726e-05, |
| "loss": 0.3878, |
| "mean_token_accuracy": 0.9160768195986748, |
| "num_tokens": 549062.0, |
| "step": 580 |
| }, |
| { |
| "epoch": 1.9923371647509578, |
| "grad_norm": 0.5839700102806091, |
| "learning_rate": 6.689419795221843e-05, |
| "loss": 0.3557, |
| "mean_token_accuracy": 0.9169671639800072, |
| "num_tokens": 553832.0, |
| "step": 585 |
| }, |
| { |
| "epoch": 2.009365687526607, |
| "grad_norm": 0.5534153580665588, |
| "learning_rate": 6.575654152445962e-05, |
| "loss": 0.3887, |
| "mean_token_accuracy": 0.9231562212109565, |
| "num_tokens": 558589.0, |
| "step": 590 |
| }, |
| { |
| "epoch": 2.0263942103022563, |
| "grad_norm": 0.5666193962097168, |
| "learning_rate": 6.46188850967008e-05, |
| "loss": 0.2234, |
| "mean_token_accuracy": 0.9479417443275452, |
| "num_tokens": 563291.0, |
| "step": 595 |
| }, |
| { |
| "epoch": 2.0434227330779056, |
| "grad_norm": 0.6161417961120605, |
| "learning_rate": 6.348122866894199e-05, |
| "loss": 0.2351, |
| "mean_token_accuracy": 0.9460513457655907, |
| "num_tokens": 568054.0, |
| "step": 600 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 879, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 200, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.423655553583309e+16, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|