{ "best_metric": null, "best_model_checkpoint": null, "epoch": 2.724563644103874, "eval_steps": 500, "global_step": 800, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.017028522775649212, "grad_norm": 3.096078395843506, "learning_rate": 0.0001988623435722412, "loss": 2.9252, "mean_token_accuracy": 0.5491172857582569, "num_tokens": 4766.0, "step": 5 }, { "epoch": 0.034057045551298425, "grad_norm": 0.695277214050293, "learning_rate": 0.00019772468714448238, "loss": 0.924, "mean_token_accuracy": 0.8361630752682686, "num_tokens": 9556.0, "step": 10 }, { "epoch": 0.05108556832694764, "grad_norm": 0.541026771068573, "learning_rate": 0.00019658703071672356, "loss": 0.5477, "mean_token_accuracy": 0.8945453137159347, "num_tokens": 14116.0, "step": 15 }, { "epoch": 0.06811409110259685, "grad_norm": 0.5480035543441772, "learning_rate": 0.00019544937428896475, "loss": 0.5796, "mean_token_accuracy": 0.8836526513099671, "num_tokens": 18879.0, "step": 20 }, { "epoch": 0.08514261387824607, "grad_norm": 0.5408394932746887, "learning_rate": 0.00019431171786120593, "loss": 0.6289, "mean_token_accuracy": 0.8782178282737731, "num_tokens": 23699.0, "step": 25 }, { "epoch": 0.10217113665389528, "grad_norm": 0.583755612373352, "learning_rate": 0.00019317406143344712, "loss": 0.5507, "mean_token_accuracy": 0.8905435591936112, "num_tokens": 28425.0, "step": 30 }, { "epoch": 0.11919965942954448, "grad_norm": 0.5654754638671875, "learning_rate": 0.0001920364050056883, "loss": 0.5163, "mean_token_accuracy": 0.8963450387120246, "num_tokens": 33060.0, "step": 35 }, { "epoch": 0.1362281822051937, "grad_norm": 0.5462912321090698, "learning_rate": 0.00019089874857792946, "loss": 0.6819, "mean_token_accuracy": 0.8708900690078736, "num_tokens": 38017.0, "step": 40 }, { "epoch": 0.1532567049808429, "grad_norm": 0.45884689688682556, "learning_rate": 0.00018976109215017067, "loss": 0.5452, "mean_token_accuracy": 0.8896441653370857, "num_tokens": 42760.0, "step": 45 }, { "epoch": 0.17028522775649213, "grad_norm": 0.5886663198471069, "learning_rate": 0.00018862343572241183, "loss": 0.5337, "mean_token_accuracy": 0.8954117730259895, "num_tokens": 47455.0, "step": 50 }, { "epoch": 0.18731375053214133, "grad_norm": 0.5249215364456177, "learning_rate": 0.00018748577929465302, "loss": 0.4948, "mean_token_accuracy": 0.9001417383551598, "num_tokens": 52186.0, "step": 55 }, { "epoch": 0.20434227330779056, "grad_norm": 0.40858832001686096, "learning_rate": 0.0001863481228668942, "loss": 0.4616, "mean_token_accuracy": 0.9116851478815079, "num_tokens": 56765.0, "step": 60 }, { "epoch": 0.22137079608343976, "grad_norm": 0.4287504553794861, "learning_rate": 0.0001852104664391354, "loss": 0.5232, "mean_token_accuracy": 0.895601749420166, "num_tokens": 61436.0, "step": 65 }, { "epoch": 0.23839931885908897, "grad_norm": 0.5480343103408813, "learning_rate": 0.00018407281001137657, "loss": 0.5757, "mean_token_accuracy": 0.8878508538007737, "num_tokens": 66190.0, "step": 70 }, { "epoch": 0.2554278416347382, "grad_norm": 0.4539305567741394, "learning_rate": 0.00018293515358361776, "loss": 0.5136, "mean_token_accuracy": 0.8946248903870583, "num_tokens": 70888.0, "step": 75 }, { "epoch": 0.2724563644103874, "grad_norm": 0.5497062802314758, "learning_rate": 0.00018179749715585894, "loss": 0.4996, "mean_token_accuracy": 0.9008801370859146, "num_tokens": 75588.0, "step": 80 }, { "epoch": 0.2894848871860366, "grad_norm": 0.5979815721511841, "learning_rate": 0.00018065984072810013, "loss": 0.5454, "mean_token_accuracy": 0.8904410973191261, "num_tokens": 80394.0, "step": 85 }, { "epoch": 0.3065134099616858, "grad_norm": 0.44527795910835266, "learning_rate": 0.0001795221843003413, "loss": 0.4675, "mean_token_accuracy": 0.9040657833218575, "num_tokens": 85088.0, "step": 90 }, { "epoch": 0.32354193273733506, "grad_norm": 0.5105463862419128, "learning_rate": 0.0001783845278725825, "loss": 0.5391, "mean_token_accuracy": 0.8978576123714447, "num_tokens": 89799.0, "step": 95 }, { "epoch": 0.34057045551298426, "grad_norm": 0.5285545587539673, "learning_rate": 0.00017724687144482368, "loss": 0.5426, "mean_token_accuracy": 0.890034094452858, "num_tokens": 94573.0, "step": 100 }, { "epoch": 0.35759897828863346, "grad_norm": 0.5576184988021851, "learning_rate": 0.00017610921501706487, "loss": 0.5258, "mean_token_accuracy": 0.8902270376682282, "num_tokens": 99357.0, "step": 105 }, { "epoch": 0.37462750106428266, "grad_norm": 0.5248317718505859, "learning_rate": 0.00017497155858930602, "loss": 0.5373, "mean_token_accuracy": 0.8933822825551033, "num_tokens": 104092.0, "step": 110 }, { "epoch": 0.39165602383993187, "grad_norm": 0.45350518822669983, "learning_rate": 0.00017383390216154724, "loss": 0.5542, "mean_token_accuracy": 0.8876873329281807, "num_tokens": 108902.0, "step": 115 }, { "epoch": 0.4086845466155811, "grad_norm": 0.5155291557312012, "learning_rate": 0.0001726962457337884, "loss": 0.5019, "mean_token_accuracy": 0.9029773235321045, "num_tokens": 113571.0, "step": 120 }, { "epoch": 0.4257130693912303, "grad_norm": 0.5053763389587402, "learning_rate": 0.0001715585893060296, "loss": 0.5595, "mean_token_accuracy": 0.8906429842114448, "num_tokens": 118402.0, "step": 125 }, { "epoch": 0.4427415921668795, "grad_norm": 0.5493877530097961, "learning_rate": 0.00017042093287827076, "loss": 0.4821, "mean_token_accuracy": 0.9028852418065071, "num_tokens": 123147.0, "step": 130 }, { "epoch": 0.45977011494252873, "grad_norm": 0.426513135433197, "learning_rate": 0.00016928327645051198, "loss": 0.5311, "mean_token_accuracy": 0.8920483842492104, "num_tokens": 127878.0, "step": 135 }, { "epoch": 0.47679863771817793, "grad_norm": 0.5025385022163391, "learning_rate": 0.00016814562002275313, "loss": 0.4699, "mean_token_accuracy": 0.9039205580949783, "num_tokens": 132591.0, "step": 140 }, { "epoch": 0.49382716049382713, "grad_norm": 0.4677104651927948, "learning_rate": 0.00016700796359499432, "loss": 0.4876, "mean_token_accuracy": 0.9038951709866524, "num_tokens": 137221.0, "step": 145 }, { "epoch": 0.5108556832694764, "grad_norm": 0.5534231066703796, "learning_rate": 0.0001658703071672355, "loss": 0.4969, "mean_token_accuracy": 0.897729343175888, "num_tokens": 141981.0, "step": 150 }, { "epoch": 0.5278842060451255, "grad_norm": 0.4998553395271301, "learning_rate": 0.0001647326507394767, "loss": 0.5476, "mean_token_accuracy": 0.8921540513634681, "num_tokens": 146807.0, "step": 155 }, { "epoch": 0.5449127288207748, "grad_norm": 0.545978307723999, "learning_rate": 0.00016359499431171787, "loss": 0.4543, "mean_token_accuracy": 0.9018902003765106, "num_tokens": 151544.0, "step": 160 }, { "epoch": 0.561941251596424, "grad_norm": 0.5749042630195618, "learning_rate": 0.00016245733788395906, "loss": 0.5064, "mean_token_accuracy": 0.8976296812295914, "num_tokens": 156280.0, "step": 165 }, { "epoch": 0.5789697743720732, "grad_norm": 0.5217350125312805, "learning_rate": 0.00016131968145620024, "loss": 0.4741, "mean_token_accuracy": 0.9045222416520119, "num_tokens": 161011.0, "step": 170 }, { "epoch": 0.5959982971477225, "grad_norm": 0.5088939666748047, "learning_rate": 0.00016018202502844143, "loss": 0.4655, "mean_token_accuracy": 0.9078934848308563, "num_tokens": 165670.0, "step": 175 }, { "epoch": 0.6130268199233716, "grad_norm": 0.5888277292251587, "learning_rate": 0.0001590443686006826, "loss": 0.4692, "mean_token_accuracy": 0.9044368535280227, "num_tokens": 170377.0, "step": 180 }, { "epoch": 0.6300553426990209, "grad_norm": 0.6187074780464172, "learning_rate": 0.0001579067121729238, "loss": 0.5105, "mean_token_accuracy": 0.8983473464846611, "num_tokens": 175090.0, "step": 185 }, { "epoch": 0.6470838654746701, "grad_norm": 0.5764688849449158, "learning_rate": 0.00015676905574516496, "loss": 0.5022, "mean_token_accuracy": 0.8986694201827049, "num_tokens": 179933.0, "step": 190 }, { "epoch": 0.6641123882503193, "grad_norm": 0.5491649508476257, "learning_rate": 0.00015563139931740617, "loss": 0.5028, "mean_token_accuracy": 0.8957466080784797, "num_tokens": 184767.0, "step": 195 }, { "epoch": 0.6811409110259685, "grad_norm": 0.4836632311344147, "learning_rate": 0.00015449374288964733, "loss": 0.5325, "mean_token_accuracy": 0.8894904315471649, "num_tokens": 189624.0, "step": 200 }, { "epoch": 0.6981694338016177, "grad_norm": 0.4630073308944702, "learning_rate": 0.00015335608646188854, "loss": 0.4529, "mean_token_accuracy": 0.9051140874624253, "num_tokens": 194357.0, "step": 205 }, { "epoch": 0.7151979565772669, "grad_norm": 0.49463990330696106, "learning_rate": 0.0001522184300341297, "loss": 0.4165, "mean_token_accuracy": 0.9074924409389495, "num_tokens": 199038.0, "step": 210 }, { "epoch": 0.7322264793529162, "grad_norm": 0.5512949824333191, "learning_rate": 0.00015108077360637088, "loss": 0.4798, "mean_token_accuracy": 0.9015959203243256, "num_tokens": 203805.0, "step": 215 }, { "epoch": 0.7492550021285653, "grad_norm": 0.58586585521698, "learning_rate": 0.00014994311717861207, "loss": 0.5301, "mean_token_accuracy": 0.8944625854492188, "num_tokens": 208579.0, "step": 220 }, { "epoch": 0.7662835249042146, "grad_norm": 0.4895232319831848, "learning_rate": 0.00014880546075085325, "loss": 0.4694, "mean_token_accuracy": 0.9098370909690857, "num_tokens": 213237.0, "step": 225 }, { "epoch": 0.7833120476798637, "grad_norm": 0.5064729452133179, "learning_rate": 0.00014766780432309444, "loss": 0.5047, "mean_token_accuracy": 0.8984142780303955, "num_tokens": 217964.0, "step": 230 }, { "epoch": 0.800340570455513, "grad_norm": 0.5260823965072632, "learning_rate": 0.00014653014789533562, "loss": 0.5159, "mean_token_accuracy": 0.8943046078085899, "num_tokens": 222821.0, "step": 235 }, { "epoch": 0.8173690932311622, "grad_norm": 0.5452587604522705, "learning_rate": 0.0001453924914675768, "loss": 0.4438, "mean_token_accuracy": 0.905141781270504, "num_tokens": 227453.0, "step": 240 }, { "epoch": 0.8343976160068114, "grad_norm": 0.5265963077545166, "learning_rate": 0.000144254835039818, "loss": 0.472, "mean_token_accuracy": 0.9038746282458305, "num_tokens": 232153.0, "step": 245 }, { "epoch": 0.8514261387824607, "grad_norm": 0.655539333820343, "learning_rate": 0.00014311717861205915, "loss": 0.542, "mean_token_accuracy": 0.8909124419093132, "num_tokens": 236925.0, "step": 250 }, { "epoch": 0.8684546615581098, "grad_norm": 0.4830772578716278, "learning_rate": 0.00014197952218430036, "loss": 0.4432, "mean_token_accuracy": 0.9110842600464821, "num_tokens": 241546.0, "step": 255 }, { "epoch": 0.885483184333759, "grad_norm": 0.5120635032653809, "learning_rate": 0.00014084186575654152, "loss": 0.4758, "mean_token_accuracy": 0.904394218325615, "num_tokens": 246278.0, "step": 260 }, { "epoch": 0.9025117071094083, "grad_norm": 0.49142977595329285, "learning_rate": 0.00013970420932878273, "loss": 0.481, "mean_token_accuracy": 0.8970154285430908, "num_tokens": 251040.0, "step": 265 }, { "epoch": 0.9195402298850575, "grad_norm": 0.5381618738174438, "learning_rate": 0.0001385665529010239, "loss": 0.4988, "mean_token_accuracy": 0.8992804601788521, "num_tokens": 255781.0, "step": 270 }, { "epoch": 0.9365687526607067, "grad_norm": 0.5239886045455933, "learning_rate": 0.0001374288964732651, "loss": 0.4957, "mean_token_accuracy": 0.9006548926234246, "num_tokens": 260512.0, "step": 275 }, { "epoch": 0.9535972754363559, "grad_norm": 0.5325700640678406, "learning_rate": 0.00013629124004550626, "loss": 0.4876, "mean_token_accuracy": 0.8976434960961341, "num_tokens": 265234.0, "step": 280 }, { "epoch": 0.9706257982120051, "grad_norm": 0.52351975440979, "learning_rate": 0.00013515358361774744, "loss": 0.4408, "mean_token_accuracy": 0.9042558416724205, "num_tokens": 269939.0, "step": 285 }, { "epoch": 0.9876543209876543, "grad_norm": 0.5632317066192627, "learning_rate": 0.00013401592718998863, "loss": 0.4267, "mean_token_accuracy": 0.9127328768372536, "num_tokens": 274580.0, "step": 290 }, { "epoch": 1.0046828437633035, "grad_norm": 0.43729496002197266, "learning_rate": 0.00013287827076222981, "loss": 0.5103, "mean_token_accuracy": 0.9010089665651322, "num_tokens": 279321.0, "step": 295 }, { "epoch": 1.0217113665389528, "grad_norm": 0.45043033361434937, "learning_rate": 0.000131740614334471, "loss": 0.376, "mean_token_accuracy": 0.9193378701806069, "num_tokens": 284033.0, "step": 300 }, { "epoch": 1.038739889314602, "grad_norm": 0.6295264363288879, "learning_rate": 0.00013060295790671218, "loss": 0.3561, "mean_token_accuracy": 0.9209762245416642, "num_tokens": 288815.0, "step": 305 }, { "epoch": 1.055768412090251, "grad_norm": 0.5746341347694397, "learning_rate": 0.00012946530147895337, "loss": 0.361, "mean_token_accuracy": 0.9210935369133949, "num_tokens": 293454.0, "step": 310 }, { "epoch": 1.0727969348659003, "grad_norm": 0.5386441349983215, "learning_rate": 0.00012832764505119455, "loss": 0.3631, "mean_token_accuracy": 0.923116135597229, "num_tokens": 298136.0, "step": 315 }, { "epoch": 1.0898254576415496, "grad_norm": 0.637798547744751, "learning_rate": 0.0001271899886234357, "loss": 0.375, "mean_token_accuracy": 0.9151263251900673, "num_tokens": 302962.0, "step": 320 }, { "epoch": 1.1068539804171988, "grad_norm": 0.6014487147331238, "learning_rate": 0.00012605233219567692, "loss": 0.3584, "mean_token_accuracy": 0.9245758667588234, "num_tokens": 307661.0, "step": 325 }, { "epoch": 1.123882503192848, "grad_norm": 0.6004022359848022, "learning_rate": 0.00012491467576791808, "loss": 0.3569, "mean_token_accuracy": 0.921052211523056, "num_tokens": 312330.0, "step": 330 }, { "epoch": 1.1409110259684971, "grad_norm": 0.8666739463806152, "learning_rate": 0.0001237770193401593, "loss": 0.3778, "mean_token_accuracy": 0.9176680579781532, "num_tokens": 317107.0, "step": 335 }, { "epoch": 1.1579395487441464, "grad_norm": 0.5575281381607056, "learning_rate": 0.00012263936291240045, "loss": 0.3765, "mean_token_accuracy": 0.9149453848600387, "num_tokens": 321895.0, "step": 340 }, { "epoch": 1.1749680715197957, "grad_norm": 0.5432224273681641, "learning_rate": 0.00012150170648464165, "loss": 0.3546, "mean_token_accuracy": 0.9211765006184578, "num_tokens": 326592.0, "step": 345 }, { "epoch": 1.191996594295445, "grad_norm": 0.5993474721908569, "learning_rate": 0.00012036405005688282, "loss": 0.3721, "mean_token_accuracy": 0.9195932745933533, "num_tokens": 331391.0, "step": 350 }, { "epoch": 1.2090251170710942, "grad_norm": 0.6452960968017578, "learning_rate": 0.000119226393629124, "loss": 0.4292, "mean_token_accuracy": 0.9088605523109436, "num_tokens": 336238.0, "step": 355 }, { "epoch": 1.2260536398467432, "grad_norm": 0.5383236408233643, "learning_rate": 0.00011808873720136519, "loss": 0.3192, "mean_token_accuracy": 0.9233780831098557, "num_tokens": 340817.0, "step": 360 }, { "epoch": 1.2430821626223925, "grad_norm": 0.6566250324249268, "learning_rate": 0.00011695108077360638, "loss": 0.3617, "mean_token_accuracy": 0.916201414167881, "num_tokens": 345509.0, "step": 365 }, { "epoch": 1.2601106853980417, "grad_norm": 0.6461586952209473, "learning_rate": 0.00011581342434584756, "loss": 0.3971, "mean_token_accuracy": 0.9110044553875923, "num_tokens": 350303.0, "step": 370 }, { "epoch": 1.277139208173691, "grad_norm": 0.700552225112915, "learning_rate": 0.00011467576791808873, "loss": 0.3439, "mean_token_accuracy": 0.9284276351332664, "num_tokens": 354873.0, "step": 375 }, { "epoch": 1.29416773094934, "grad_norm": 0.6307278871536255, "learning_rate": 0.00011353811149032993, "loss": 0.3619, "mean_token_accuracy": 0.9204769432544708, "num_tokens": 359564.0, "step": 380 }, { "epoch": 1.3111962537249893, "grad_norm": 0.5559372901916504, "learning_rate": 0.0001124004550625711, "loss": 0.337, "mean_token_accuracy": 0.9221480071544648, "num_tokens": 364285.0, "step": 385 }, { "epoch": 1.3282247765006385, "grad_norm": 0.7321580648422241, "learning_rate": 0.00011126279863481229, "loss": 0.3864, "mean_token_accuracy": 0.917863991856575, "num_tokens": 369021.0, "step": 390 }, { "epoch": 1.3452532992762878, "grad_norm": 0.6482062339782715, "learning_rate": 0.00011012514220705347, "loss": 0.342, "mean_token_accuracy": 0.9234487116336823, "num_tokens": 373711.0, "step": 395 }, { "epoch": 1.362281822051937, "grad_norm": 0.7216457724571228, "learning_rate": 0.00010898748577929466, "loss": 0.3494, "mean_token_accuracy": 0.9197908401489258, "num_tokens": 378403.0, "step": 400 }, { "epoch": 1.3793103448275863, "grad_norm": 0.7166584730148315, "learning_rate": 0.00010784982935153584, "loss": 0.3768, "mean_token_accuracy": 0.9174183040857316, "num_tokens": 383100.0, "step": 405 }, { "epoch": 1.3963388676032356, "grad_norm": 0.8020215630531311, "learning_rate": 0.00010671217292377703, "loss": 0.3772, "mean_token_accuracy": 0.9173366680741311, "num_tokens": 387930.0, "step": 410 }, { "epoch": 1.4133673903788846, "grad_norm": 0.6404600143432617, "learning_rate": 0.00010557451649601821, "loss": 0.3345, "mean_token_accuracy": 0.9267360553145408, "num_tokens": 392624.0, "step": 415 }, { "epoch": 1.4303959131545338, "grad_norm": 0.7745601534843445, "learning_rate": 0.00010443686006825938, "loss": 0.3762, "mean_token_accuracy": 0.9124831840395927, "num_tokens": 397405.0, "step": 420 }, { "epoch": 1.447424435930183, "grad_norm": 0.6004043817520142, "learning_rate": 0.00010329920364050057, "loss": 0.402, "mean_token_accuracy": 0.914434814453125, "num_tokens": 402178.0, "step": 425 }, { "epoch": 1.4644529587058321, "grad_norm": 0.6424717903137207, "learning_rate": 0.00010216154721274175, "loss": 0.3269, "mean_token_accuracy": 0.9274717316031456, "num_tokens": 406801.0, "step": 430 }, { "epoch": 1.4814814814814814, "grad_norm": 0.7379339337348938, "learning_rate": 0.00010102389078498294, "loss": 0.3853, "mean_token_accuracy": 0.9116453334689141, "num_tokens": 411635.0, "step": 435 }, { "epoch": 1.4985100042571307, "grad_norm": 0.6798533201217651, "learning_rate": 9.988623435722412e-05, "loss": 0.3442, "mean_token_accuracy": 0.9197518125176429, "num_tokens": 416372.0, "step": 440 }, { "epoch": 1.51553852703278, "grad_norm": 0.5506631731987, "learning_rate": 9.874857792946531e-05, "loss": 0.3557, "mean_token_accuracy": 0.9198912262916565, "num_tokens": 421129.0, "step": 445 }, { "epoch": 1.5325670498084292, "grad_norm": 32.163753509521484, "learning_rate": 9.761092150170649e-05, "loss": 0.2988, "mean_token_accuracy": 0.9316724047064782, "num_tokens": 425749.0, "step": 450 }, { "epoch": 1.5495955725840784, "grad_norm": 0.6345335841178894, "learning_rate": 9.647326507394768e-05, "loss": 0.328, "mean_token_accuracy": 0.925884073972702, "num_tokens": 430356.0, "step": 455 }, { "epoch": 1.5666240953597277, "grad_norm": 0.4996885657310486, "learning_rate": 9.533560864618886e-05, "loss": 0.3357, "mean_token_accuracy": 0.9236923009157181, "num_tokens": 435131.0, "step": 460 }, { "epoch": 1.5836526181353767, "grad_norm": 0.7736502289772034, "learning_rate": 9.419795221843003e-05, "loss": 0.3363, "mean_token_accuracy": 0.919234861433506, "num_tokens": 439799.0, "step": 465 }, { "epoch": 1.600681140911026, "grad_norm": 0.5958617925643921, "learning_rate": 9.306029579067122e-05, "loss": 0.3636, "mean_token_accuracy": 0.92172020226717, "num_tokens": 444514.0, "step": 470 }, { "epoch": 1.617709663686675, "grad_norm": 0.7543319463729858, "learning_rate": 9.19226393629124e-05, "loss": 0.3993, "mean_token_accuracy": 0.9095039024949074, "num_tokens": 449453.0, "step": 475 }, { "epoch": 1.6347381864623243, "grad_norm": 0.6482803225517273, "learning_rate": 9.078498293515359e-05, "loss": 0.3359, "mean_token_accuracy": 0.924050772190094, "num_tokens": 454144.0, "step": 480 }, { "epoch": 1.6517667092379735, "grad_norm": 0.5878757834434509, "learning_rate": 8.964732650739477e-05, "loss": 0.3728, "mean_token_accuracy": 0.9194103494286537, "num_tokens": 458839.0, "step": 485 }, { "epoch": 1.6687952320136228, "grad_norm": 0.8008145689964294, "learning_rate": 8.850967007963596e-05, "loss": 0.3973, "mean_token_accuracy": 0.9146214991807937, "num_tokens": 463633.0, "step": 490 }, { "epoch": 1.685823754789272, "grad_norm": 0.6370537281036377, "learning_rate": 8.737201365187714e-05, "loss": 0.3528, "mean_token_accuracy": 0.9191272169351578, "num_tokens": 468319.0, "step": 495 }, { "epoch": 1.7028522775649213, "grad_norm": 0.6956344842910767, "learning_rate": 8.623435722411833e-05, "loss": 0.3584, "mean_token_accuracy": 0.9227298349142075, "num_tokens": 473018.0, "step": 500 }, { "epoch": 1.7198808003405706, "grad_norm": 0.5346872806549072, "learning_rate": 8.509670079635951e-05, "loss": 0.3094, "mean_token_accuracy": 0.9289079144597053, "num_tokens": 477564.0, "step": 505 }, { "epoch": 1.7369093231162198, "grad_norm": 0.6789258122444153, "learning_rate": 8.395904436860069e-05, "loss": 0.3999, "mean_token_accuracy": 0.9171444311738014, "num_tokens": 482329.0, "step": 510 }, { "epoch": 1.7539378458918689, "grad_norm": 0.7325442433357239, "learning_rate": 8.282138794084187e-05, "loss": 0.3576, "mean_token_accuracy": 0.919205529987812, "num_tokens": 487073.0, "step": 515 }, { "epoch": 1.770966368667518, "grad_norm": 0.6846973299980164, "learning_rate": 8.168373151308306e-05, "loss": 0.3547, "mean_token_accuracy": 0.9206994399428368, "num_tokens": 491796.0, "step": 520 }, { "epoch": 1.7879948914431671, "grad_norm": 0.5631270408630371, "learning_rate": 8.054607508532424e-05, "loss": 0.3473, "mean_token_accuracy": 0.9214297071099281, "num_tokens": 496498.0, "step": 525 }, { "epoch": 1.8050234142188164, "grad_norm": 0.6066986322402954, "learning_rate": 7.940841865756543e-05, "loss": 0.3774, "mean_token_accuracy": 0.9192397773265839, "num_tokens": 501235.0, "step": 530 }, { "epoch": 1.8220519369944657, "grad_norm": 0.6359360218048096, "learning_rate": 7.827076222980661e-05, "loss": 0.324, "mean_token_accuracy": 0.9266907840967178, "num_tokens": 505887.0, "step": 535 }, { "epoch": 1.839080459770115, "grad_norm": 0.836995005607605, "learning_rate": 7.71331058020478e-05, "loss": 0.3708, "mean_token_accuracy": 0.915412899851799, "num_tokens": 510670.0, "step": 540 }, { "epoch": 1.8561089825457642, "grad_norm": 0.6547362208366394, "learning_rate": 7.599544937428897e-05, "loss": 0.394, "mean_token_accuracy": 0.9127551719546318, "num_tokens": 515432.0, "step": 545 }, { "epoch": 1.8731375053214134, "grad_norm": 0.6609506607055664, "learning_rate": 7.485779294653015e-05, "loss": 0.4105, "mean_token_accuracy": 0.910239189863205, "num_tokens": 520330.0, "step": 550 }, { "epoch": 1.8901660280970627, "grad_norm": 0.6680045127868652, "learning_rate": 7.372013651877134e-05, "loss": 0.3478, "mean_token_accuracy": 0.9242256492376327, "num_tokens": 524980.0, "step": 555 }, { "epoch": 1.907194550872712, "grad_norm": 0.579949676990509, "learning_rate": 7.258248009101252e-05, "loss": 0.389, "mean_token_accuracy": 0.9161396250128746, "num_tokens": 529754.0, "step": 560 }, { "epoch": 1.924223073648361, "grad_norm": 0.6184946298599243, "learning_rate": 7.14448236632537e-05, "loss": 0.3253, "mean_token_accuracy": 0.924703124165535, "num_tokens": 534525.0, "step": 565 }, { "epoch": 1.9412515964240102, "grad_norm": 0.657850980758667, "learning_rate": 7.030716723549489e-05, "loss": 0.3926, "mean_token_accuracy": 0.9116024389863014, "num_tokens": 539435.0, "step": 570 }, { "epoch": 1.9582801191996593, "grad_norm": 0.7310178875923157, "learning_rate": 6.916951080773608e-05, "loss": 0.4016, "mean_token_accuracy": 0.9142703726887703, "num_tokens": 544326.0, "step": 575 }, { "epoch": 1.9753086419753085, "grad_norm": 0.7617822289466858, "learning_rate": 6.803185437997726e-05, "loss": 0.3878, "mean_token_accuracy": 0.9160768195986748, "num_tokens": 549062.0, "step": 580 }, { "epoch": 1.9923371647509578, "grad_norm": 0.5839700102806091, "learning_rate": 6.689419795221843e-05, "loss": 0.3557, "mean_token_accuracy": 0.9169671639800072, "num_tokens": 553832.0, "step": 585 }, { "epoch": 2.009365687526607, "grad_norm": 0.5534153580665588, "learning_rate": 6.575654152445962e-05, "loss": 0.3887, "mean_token_accuracy": 0.9231562212109565, "num_tokens": 558589.0, "step": 590 }, { "epoch": 2.0263942103022563, "grad_norm": 0.5666193962097168, "learning_rate": 6.46188850967008e-05, "loss": 0.2234, "mean_token_accuracy": 0.9479417443275452, "num_tokens": 563291.0, "step": 595 }, { "epoch": 2.0434227330779056, "grad_norm": 0.6161417961120605, "learning_rate": 6.348122866894199e-05, "loss": 0.2351, "mean_token_accuracy": 0.9460513457655907, "num_tokens": 568054.0, "step": 600 }, { "epoch": 2.060451255853555, "grad_norm": 0.8185880184173584, "learning_rate": 6.234357224118317e-05, "loss": 0.2028, "mean_token_accuracy": 0.9509358927607536, "num_tokens": 572684.0, "step": 605 }, { "epoch": 2.077479778629204, "grad_norm": 0.6658746600151062, "learning_rate": 6.120591581342436e-05, "loss": 0.2188, "mean_token_accuracy": 0.949580205976963, "num_tokens": 577466.0, "step": 610 }, { "epoch": 2.0945083014048533, "grad_norm": 0.8151549696922302, "learning_rate": 6.0068259385665536e-05, "loss": 0.2381, "mean_token_accuracy": 0.9443762481212616, "num_tokens": 582301.0, "step": 615 }, { "epoch": 2.111536824180502, "grad_norm": 0.5441663861274719, "learning_rate": 5.8930602957906714e-05, "loss": 0.2159, "mean_token_accuracy": 0.9448505908250808, "num_tokens": 587032.0, "step": 620 }, { "epoch": 2.1285653469561514, "grad_norm": 0.6140492558479309, "learning_rate": 5.77929465301479e-05, "loss": 0.2298, "mean_token_accuracy": 0.9426965191960335, "num_tokens": 591780.0, "step": 625 }, { "epoch": 2.1455938697318007, "grad_norm": 0.7466714978218079, "learning_rate": 5.665529010238908e-05, "loss": 0.2421, "mean_token_accuracy": 0.9439867153763771, "num_tokens": 596536.0, "step": 630 }, { "epoch": 2.16262239250745, "grad_norm": 0.6266794204711914, "learning_rate": 5.551763367463026e-05, "loss": 0.2192, "mean_token_accuracy": 0.948202782869339, "num_tokens": 601092.0, "step": 635 }, { "epoch": 2.179650915283099, "grad_norm": 1.0131019353866577, "learning_rate": 5.437997724687145e-05, "loss": 0.217, "mean_token_accuracy": 0.9489307940006256, "num_tokens": 605806.0, "step": 640 }, { "epoch": 2.1966794380587484, "grad_norm": 0.7090656161308289, "learning_rate": 5.324232081911263e-05, "loss": 0.2162, "mean_token_accuracy": 0.9507017344236374, "num_tokens": 610609.0, "step": 645 }, { "epoch": 2.2137079608343977, "grad_norm": 0.8066163659095764, "learning_rate": 5.210466439135382e-05, "loss": 0.2557, "mean_token_accuracy": 0.9380737692117691, "num_tokens": 615357.0, "step": 650 }, { "epoch": 2.230736483610047, "grad_norm": 0.7409054040908813, "learning_rate": 5.0967007963594995e-05, "loss": 0.2409, "mean_token_accuracy": 0.9453119024634361, "num_tokens": 620139.0, "step": 655 }, { "epoch": 2.247765006385696, "grad_norm": 0.782002866268158, "learning_rate": 4.982935153583618e-05, "loss": 0.2433, "mean_token_accuracy": 0.9432441100478173, "num_tokens": 624815.0, "step": 660 }, { "epoch": 2.264793529161345, "grad_norm": 0.6300613284111023, "learning_rate": 4.8691695108077365e-05, "loss": 0.2643, "mean_token_accuracy": 0.9443272948265076, "num_tokens": 629544.0, "step": 665 }, { "epoch": 2.2818220519369943, "grad_norm": 0.6463762521743774, "learning_rate": 4.755403868031855e-05, "loss": 0.2027, "mean_token_accuracy": 0.9486809656023979, "num_tokens": 634156.0, "step": 670 }, { "epoch": 2.2988505747126435, "grad_norm": 0.6527837514877319, "learning_rate": 4.641638225255973e-05, "loss": 0.2131, "mean_token_accuracy": 0.9498034939169884, "num_tokens": 638784.0, "step": 675 }, { "epoch": 2.315879097488293, "grad_norm": 0.7105056047439575, "learning_rate": 4.527872582480091e-05, "loss": 0.2292, "mean_token_accuracy": 0.9485589876770973, "num_tokens": 643477.0, "step": 680 }, { "epoch": 2.332907620263942, "grad_norm": 0.7441533803939819, "learning_rate": 4.41410693970421e-05, "loss": 0.2386, "mean_token_accuracy": 0.9443776711821557, "num_tokens": 648285.0, "step": 685 }, { "epoch": 2.3499361430395913, "grad_norm": 0.9468763470649719, "learning_rate": 4.300341296928328e-05, "loss": 0.2555, "mean_token_accuracy": 0.9390515595674515, "num_tokens": 653168.0, "step": 690 }, { "epoch": 2.3669646658152406, "grad_norm": 0.6610742211341858, "learning_rate": 4.186575654152446e-05, "loss": 0.2506, "mean_token_accuracy": 0.9435861468315124, "num_tokens": 657863.0, "step": 695 }, { "epoch": 2.38399318859089, "grad_norm": 0.9869385957717896, "learning_rate": 4.0728100113765646e-05, "loss": 0.2387, "mean_token_accuracy": 0.9400592625141144, "num_tokens": 662727.0, "step": 700 }, { "epoch": 2.401021711366539, "grad_norm": 0.7145782113075256, "learning_rate": 3.959044368600683e-05, "loss": 0.222, "mean_token_accuracy": 0.9447844803333283, "num_tokens": 667411.0, "step": 705 }, { "epoch": 2.4180502341421883, "grad_norm": 0.793662965297699, "learning_rate": 3.8452787258248016e-05, "loss": 0.2749, "mean_token_accuracy": 0.9354437962174416, "num_tokens": 672370.0, "step": 710 }, { "epoch": 2.4350787569178376, "grad_norm": 0.6723162531852722, "learning_rate": 3.7315130830489194e-05, "loss": 0.2199, "mean_token_accuracy": 0.949055691063404, "num_tokens": 676945.0, "step": 715 }, { "epoch": 2.4521072796934864, "grad_norm": 0.7849971652030945, "learning_rate": 3.617747440273038e-05, "loss": 0.2349, "mean_token_accuracy": 0.9447068989276886, "num_tokens": 681628.0, "step": 720 }, { "epoch": 2.4691358024691357, "grad_norm": 0.7382046580314636, "learning_rate": 3.5039817974971564e-05, "loss": 0.2298, "mean_token_accuracy": 0.9459434017539025, "num_tokens": 686342.0, "step": 725 }, { "epoch": 2.486164325244785, "grad_norm": 0.8477870225906372, "learning_rate": 3.390216154721274e-05, "loss": 0.2226, "mean_token_accuracy": 0.9453668460249901, "num_tokens": 691011.0, "step": 730 }, { "epoch": 2.503192848020434, "grad_norm": 0.7759321928024292, "learning_rate": 3.276450511945393e-05, "loss": 0.2051, "mean_token_accuracy": 0.9518747553229332, "num_tokens": 695661.0, "step": 735 }, { "epoch": 2.5202213707960834, "grad_norm": 0.7729942798614502, "learning_rate": 3.162684869169511e-05, "loss": 0.2196, "mean_token_accuracy": 0.9440933063626289, "num_tokens": 700360.0, "step": 740 }, { "epoch": 2.5372498935717327, "grad_norm": 0.8978192806243896, "learning_rate": 3.0489192263936294e-05, "loss": 0.2259, "mean_token_accuracy": 0.9469935670495033, "num_tokens": 705254.0, "step": 745 }, { "epoch": 2.554278416347382, "grad_norm": 0.8663476705551147, "learning_rate": 2.9351535836177476e-05, "loss": 0.239, "mean_token_accuracy": 0.9402577832341195, "num_tokens": 709984.0, "step": 750 }, { "epoch": 2.571306939123031, "grad_norm": 0.7382346391677856, "learning_rate": 2.8213879408418657e-05, "loss": 0.2145, "mean_token_accuracy": 0.9489600315690041, "num_tokens": 714606.0, "step": 755 }, { "epoch": 2.58833546189868, "grad_norm": 0.7550341486930847, "learning_rate": 2.7076222980659842e-05, "loss": 0.2303, "mean_token_accuracy": 0.9455819338560104, "num_tokens": 719367.0, "step": 760 }, { "epoch": 2.6053639846743293, "grad_norm": 0.6596015095710754, "learning_rate": 2.5938566552901024e-05, "loss": 0.2133, "mean_token_accuracy": 0.9476204797625541, "num_tokens": 724055.0, "step": 765 }, { "epoch": 2.6223925074499785, "grad_norm": 0.9189562201499939, "learning_rate": 2.480091012514221e-05, "loss": 0.2355, "mean_token_accuracy": 0.9445128008723259, "num_tokens": 728885.0, "step": 770 }, { "epoch": 2.639421030225628, "grad_norm": 0.8011082410812378, "learning_rate": 2.366325369738339e-05, "loss": 0.2193, "mean_token_accuracy": 0.9496066018939018, "num_tokens": 733655.0, "step": 775 }, { "epoch": 2.656449553001277, "grad_norm": 0.8749405741691589, "learning_rate": 2.2525597269624575e-05, "loss": 0.2571, "mean_token_accuracy": 0.9410566672682762, "num_tokens": 738508.0, "step": 780 }, { "epoch": 2.6734780757769263, "grad_norm": 0.7753709554672241, "learning_rate": 2.138794084186576e-05, "loss": 0.2281, "mean_token_accuracy": 0.9464891225099563, "num_tokens": 743232.0, "step": 785 }, { "epoch": 2.6905065985525756, "grad_norm": 0.7801012992858887, "learning_rate": 2.025028441410694e-05, "loss": 0.2284, "mean_token_accuracy": 0.9456154644489289, "num_tokens": 747910.0, "step": 790 }, { "epoch": 2.707535121328225, "grad_norm": 1.0080945491790771, "learning_rate": 1.9112627986348127e-05, "loss": 0.2242, "mean_token_accuracy": 0.9471994698047638, "num_tokens": 752624.0, "step": 795 }, { "epoch": 2.724563644103874, "grad_norm": 0.6461349129676819, "learning_rate": 1.7974971558589308e-05, "loss": 0.2158, "mean_token_accuracy": 0.9480220451951027, "num_tokens": 757321.0, "step": 800 } ], "logging_steps": 5, "max_steps": 879, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.231180922051891e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }