{ "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0434227330779056, "eval_steps": 500, "global_step": 600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.017028522775649212, "grad_norm": 2.3286359310150146, "learning_rate": 0.0001988623435722412, "loss": 4.1641, "mean_token_accuracy": 0.3866006717085838, "num_tokens": 4326.0, "step": 5 }, { "epoch": 0.034057045551298425, "grad_norm": 1.4926602840423584, "learning_rate": 0.00019772468714448238, "loss": 2.0591, "mean_token_accuracy": 0.6790341928601265, "num_tokens": 8676.0, "step": 10 }, { "epoch": 0.05108556832694764, "grad_norm": 1.0835968255996704, "learning_rate": 0.00019658703071672356, "loss": 1.3145, "mean_token_accuracy": 0.8256841972470284, "num_tokens": 12796.0, "step": 15 }, { "epoch": 0.06811409110259685, "grad_norm": 0.7724414467811584, "learning_rate": 0.00019544937428896475, "loss": 1.3324, "mean_token_accuracy": 0.8117582932114601, "num_tokens": 17119.0, "step": 20 }, { "epoch": 0.08514261387824607, "grad_norm": 0.785762369632721, "learning_rate": 0.00019431171786120593, "loss": 1.3375, "mean_token_accuracy": 0.8029867172241211, "num_tokens": 21499.0, "step": 25 }, { "epoch": 0.10217113665389528, "grad_norm": 0.6702725291252136, "learning_rate": 0.00019317406143344712, "loss": 1.2159, "mean_token_accuracy": 0.8230627462267875, "num_tokens": 25785.0, "step": 30 }, { "epoch": 0.11919965942954448, "grad_norm": 0.6287369728088379, "learning_rate": 0.0001920364050056883, "loss": 1.1634, "mean_token_accuracy": 0.8315445825457572, "num_tokens": 29980.0, "step": 35 }, { "epoch": 0.1362281822051937, "grad_norm": 0.6573143005371094, "learning_rate": 0.00019089874857792946, "loss": 1.3762, "mean_token_accuracy": 0.7971536681056023, "num_tokens": 34497.0, "step": 40 }, { "epoch": 0.1532567049808429, "grad_norm": 0.6560688614845276, "learning_rate": 0.00018976109215017067, "loss": 1.1589, "mean_token_accuracy": 0.8251897826790809, "num_tokens": 38800.0, "step": 45 }, { "epoch": 0.17028522775649213, "grad_norm": 0.6654791831970215, "learning_rate": 0.00018862343572241183, "loss": 1.1498, "mean_token_accuracy": 0.8319168403744698, "num_tokens": 43055.0, "step": 50 }, { "epoch": 0.18731375053214133, "grad_norm": 0.7387417554855347, "learning_rate": 0.00018748577929465302, "loss": 1.1265, "mean_token_accuracy": 0.8290244281291962, "num_tokens": 47346.0, "step": 55 }, { "epoch": 0.20434227330779056, "grad_norm": 0.5795997977256775, "learning_rate": 0.0001863481228668942, "loss": 1.0046, "mean_token_accuracy": 0.8534704640507698, "num_tokens": 51485.0, "step": 60 }, { "epoch": 0.22137079608343976, "grad_norm": 0.6834130883216858, "learning_rate": 0.0001852104664391354, "loss": 1.113, "mean_token_accuracy": 0.8345914751291275, "num_tokens": 55716.0, "step": 65 }, { "epoch": 0.23839931885908897, "grad_norm": 0.7211284041404724, "learning_rate": 0.00018407281001137657, "loss": 1.2132, "mean_token_accuracy": 0.8207321017980576, "num_tokens": 60030.0, "step": 70 }, { "epoch": 0.2554278416347382, "grad_norm": 0.6312271356582642, "learning_rate": 0.00018293515358361776, "loss": 1.0987, "mean_token_accuracy": 0.8333725541830063, "num_tokens": 64288.0, "step": 75 }, { "epoch": 0.2724563644103874, "grad_norm": 0.7119404077529907, "learning_rate": 0.00018179749715585894, "loss": 1.0981, "mean_token_accuracy": 0.8323698997497558, "num_tokens": 68548.0, "step": 80 }, { "epoch": 0.2894848871860366, "grad_norm": 0.9000201225280762, "learning_rate": 0.00018065984072810013, "loss": 1.146, "mean_token_accuracy": 0.8253335595130921, "num_tokens": 72914.0, "step": 85 }, { "epoch": 0.3065134099616858, "grad_norm": 0.6050537824630737, "learning_rate": 0.0001795221843003413, "loss": 1.0111, "mean_token_accuracy": 0.842674246430397, "num_tokens": 77168.0, "step": 90 }, { "epoch": 0.32354193273733506, "grad_norm": 0.684512197971344, "learning_rate": 0.0001783845278725825, "loss": 1.1186, "mean_token_accuracy": 0.8351956441998482, "num_tokens": 81439.0, "step": 95 }, { "epoch": 0.34057045551298426, "grad_norm": 0.7323129773139954, "learning_rate": 0.00017724687144482368, "loss": 1.1287, "mean_token_accuracy": 0.8245970487594605, "num_tokens": 85773.0, "step": 100 }, { "epoch": 0.35759897828863346, "grad_norm": 0.7547741532325745, "learning_rate": 0.00017610921501706487, "loss": 1.0868, "mean_token_accuracy": 0.8298466548323631, "num_tokens": 90117.0, "step": 105 }, { "epoch": 0.37462750106428266, "grad_norm": 0.7113769054412842, "learning_rate": 0.00017497155858930602, "loss": 1.1214, "mean_token_accuracy": 0.8299670115113258, "num_tokens": 94412.0, "step": 110 }, { "epoch": 0.39165602383993187, "grad_norm": 0.7486220002174377, "learning_rate": 0.00017383390216154724, "loss": 1.1452, "mean_token_accuracy": 0.8283886179327965, "num_tokens": 98782.0, "step": 115 }, { "epoch": 0.4086845466155811, "grad_norm": 0.658633828163147, "learning_rate": 0.0001726962457337884, "loss": 1.0415, "mean_token_accuracy": 0.8431179687380791, "num_tokens": 103011.0, "step": 120 }, { "epoch": 0.4257130693912303, "grad_norm": 0.783794105052948, "learning_rate": 0.0001715585893060296, "loss": 1.1056, "mean_token_accuracy": 0.8254878520965576, "num_tokens": 107402.0, "step": 125 }, { "epoch": 0.4427415921668795, "grad_norm": 0.7954565286636353, "learning_rate": 0.00017042093287827076, "loss": 1.0518, "mean_token_accuracy": 0.8375606715679169, "num_tokens": 111707.0, "step": 130 }, { "epoch": 0.45977011494252873, "grad_norm": 0.6913949847221375, "learning_rate": 0.00016928327645051198, "loss": 1.1104, "mean_token_accuracy": 0.8326424166560173, "num_tokens": 115998.0, "step": 135 }, { "epoch": 0.47679863771817793, "grad_norm": 0.7918037176132202, "learning_rate": 0.00016814562002275313, "loss": 1.0495, "mean_token_accuracy": 0.8390962019562721, "num_tokens": 120271.0, "step": 140 }, { "epoch": 0.49382716049382713, "grad_norm": 0.7816826701164246, "learning_rate": 0.00016700796359499432, "loss": 1.0463, "mean_token_accuracy": 0.8433194428682327, "num_tokens": 124461.0, "step": 145 }, { "epoch": 0.5108556832694764, "grad_norm": 0.8069042563438416, "learning_rate": 0.0001658703071672355, "loss": 1.0664, "mean_token_accuracy": 0.8278923153877258, "num_tokens": 128781.0, "step": 150 }, { "epoch": 0.5278842060451255, "grad_norm": 1.0114731788635254, "learning_rate": 0.0001647326507394767, "loss": 1.1217, "mean_token_accuracy": 0.8267972275614739, "num_tokens": 133167.0, "step": 155 }, { "epoch": 0.5449127288207748, "grad_norm": 0.7900378704071045, "learning_rate": 0.00016359499431171787, "loss": 0.971, "mean_token_accuracy": 0.8421565622091294, "num_tokens": 137464.0, "step": 160 }, { "epoch": 0.561941251596424, "grad_norm": 0.8059927821159363, "learning_rate": 0.00016245733788395906, "loss": 1.0457, "mean_token_accuracy": 0.8381335601210594, "num_tokens": 141760.0, "step": 165 }, { "epoch": 0.5789697743720732, "grad_norm": 0.7589371800422668, "learning_rate": 0.00016131968145620024, "loss": 1.0208, "mean_token_accuracy": 0.8342296928167343, "num_tokens": 146051.0, "step": 170 }, { "epoch": 0.5959982971477225, "grad_norm": 0.692416250705719, "learning_rate": 0.00016018202502844143, "loss": 0.9837, "mean_token_accuracy": 0.8510025009512902, "num_tokens": 150270.0, "step": 175 }, { "epoch": 0.6130268199233716, "grad_norm": 0.6662923097610474, "learning_rate": 0.0001590443686006826, "loss": 0.9835, "mean_token_accuracy": 0.8463438332080842, "num_tokens": 154537.0, "step": 180 }, { "epoch": 0.6300553426990209, "grad_norm": 0.7452691793441772, "learning_rate": 0.0001579067121729238, "loss": 1.0496, "mean_token_accuracy": 0.8375737622380257, "num_tokens": 158810.0, "step": 185 }, { "epoch": 0.6470838654746701, "grad_norm": 0.809700608253479, "learning_rate": 0.00015676905574516496, "loss": 1.0595, "mean_token_accuracy": 0.8294038504362107, "num_tokens": 163213.0, "step": 190 }, { "epoch": 0.6641123882503193, "grad_norm": 0.7708745002746582, "learning_rate": 0.00015563139931740617, "loss": 1.0976, "mean_token_accuracy": 0.8289313957095146, "num_tokens": 167607.0, "step": 195 }, { "epoch": 0.6811409110259685, "grad_norm": 0.6482141613960266, "learning_rate": 0.00015449374288964733, "loss": 1.0701, "mean_token_accuracy": 0.8261386752128601, "num_tokens": 172024.0, "step": 200 }, { "epoch": 0.6981694338016177, "grad_norm": 0.7164883613586426, "learning_rate": 0.00015335608646188854, "loss": 0.9878, "mean_token_accuracy": 0.8418964132666588, "num_tokens": 176317.0, "step": 205 }, { "epoch": 0.7151979565772669, "grad_norm": 0.710343599319458, "learning_rate": 0.0001522184300341297, "loss": 0.9306, "mean_token_accuracy": 0.8468034327030182, "num_tokens": 180558.0, "step": 210 }, { "epoch": 0.7322264793529162, "grad_norm": 0.863784909248352, "learning_rate": 0.00015108077360637088, "loss": 1.0544, "mean_token_accuracy": 0.8359945684671402, "num_tokens": 184885.0, "step": 215 }, { "epoch": 0.7492550021285653, "grad_norm": 0.8381637930870056, "learning_rate": 0.00014994311717861207, "loss": 1.0522, "mean_token_accuracy": 0.836811026930809, "num_tokens": 189219.0, "step": 220 }, { "epoch": 0.7662835249042146, "grad_norm": 0.683501124382019, "learning_rate": 0.00014880546075085325, "loss": 0.9427, "mean_token_accuracy": 0.8544979348778725, "num_tokens": 193437.0, "step": 225 }, { "epoch": 0.7833120476798637, "grad_norm": 0.7609812617301941, "learning_rate": 0.00014766780432309444, "loss": 1.0048, "mean_token_accuracy": 0.8403829500079155, "num_tokens": 197724.0, "step": 230 }, { "epoch": 0.800340570455513, "grad_norm": 0.8223949074745178, "learning_rate": 0.00014653014789533562, "loss": 1.078, "mean_token_accuracy": 0.8296335831284523, "num_tokens": 202141.0, "step": 235 }, { "epoch": 0.8173690932311622, "grad_norm": 0.9807024002075195, "learning_rate": 0.0001453924914675768, "loss": 0.9295, "mean_token_accuracy": 0.8495418474078178, "num_tokens": 206333.0, "step": 240 }, { "epoch": 0.8343976160068114, "grad_norm": 0.7864217162132263, "learning_rate": 0.000144254835039818, "loss": 1.0326, "mean_token_accuracy": 0.8422158002853394, "num_tokens": 210593.0, "step": 245 }, { "epoch": 0.8514261387824607, "grad_norm": 0.8183476328849792, "learning_rate": 0.00014311717861205915, "loss": 1.0419, "mean_token_accuracy": 0.8332764700055122, "num_tokens": 214925.0, "step": 250 }, { "epoch": 0.8684546615581098, "grad_norm": 0.7906543612480164, "learning_rate": 0.00014197952218430036, "loss": 0.9278, "mean_token_accuracy": 0.8531344652175903, "num_tokens": 219106.0, "step": 255 }, { "epoch": 0.885483184333759, "grad_norm": 0.7864625453948975, "learning_rate": 0.00014084186575654152, "loss": 0.9764, "mean_token_accuracy": 0.8394758701324463, "num_tokens": 223398.0, "step": 260 }, { "epoch": 0.9025117071094083, "grad_norm": 0.7231821417808533, "learning_rate": 0.00013970420932878273, "loss": 1.0357, "mean_token_accuracy": 0.8368565306067467, "num_tokens": 227720.0, "step": 265 }, { "epoch": 0.9195402298850575, "grad_norm": 0.7288718223571777, "learning_rate": 0.0001385665529010239, "loss": 1.0178, "mean_token_accuracy": 0.842984040081501, "num_tokens": 232021.0, "step": 270 }, { "epoch": 0.9365687526607067, "grad_norm": 0.7466130256652832, "learning_rate": 0.0001374288964732651, "loss": 0.9974, "mean_token_accuracy": 0.8431279867887497, "num_tokens": 236312.0, "step": 275 }, { "epoch": 0.9535972754363559, "grad_norm": 0.7876543402671814, "learning_rate": 0.00013629124004550626, "loss": 1.0057, "mean_token_accuracy": 0.8389794036746026, "num_tokens": 240594.0, "step": 280 }, { "epoch": 0.9706257982120051, "grad_norm": 0.738293468952179, "learning_rate": 0.00013515358361774744, "loss": 0.9129, "mean_token_accuracy": 0.8528255730867386, "num_tokens": 244859.0, "step": 285 }, { "epoch": 0.9876543209876543, "grad_norm": 0.8145989775657654, "learning_rate": 0.00013401592718998863, "loss": 0.9188, "mean_token_accuracy": 0.8555046319961548, "num_tokens": 249060.0, "step": 290 }, { "epoch": 1.0046828437633035, "grad_norm": 0.693233072757721, "learning_rate": 0.00013287827076222981, "loss": 1.0648, "mean_token_accuracy": 0.8477524280548095, "num_tokens": 253361.0, "step": 295 }, { "epoch": 1.0217113665389528, "grad_norm": 0.8171095848083496, "learning_rate": 0.000131740614334471, "loss": 0.883, "mean_token_accuracy": 0.8561580404639244, "num_tokens": 257633.0, "step": 300 }, { "epoch": 1.038739889314602, "grad_norm": 0.7343988418579102, "learning_rate": 0.00013060295790671218, "loss": 0.8591, "mean_token_accuracy": 0.8583228841423989, "num_tokens": 261975.0, "step": 305 }, { "epoch": 1.055768412090251, "grad_norm": 0.6689726114273071, "learning_rate": 0.00012946530147895337, "loss": 0.8397, "mean_token_accuracy": 0.8668102487921715, "num_tokens": 266174.0, "step": 310 }, { "epoch": 1.0727969348659003, "grad_norm": 0.8284767270088196, "learning_rate": 0.00012832764505119455, "loss": 0.9108, "mean_token_accuracy": 0.8551412716507911, "num_tokens": 270416.0, "step": 315 }, { "epoch": 1.0898254576415496, "grad_norm": 0.7800877690315247, "learning_rate": 0.0001271899886234357, "loss": 0.923, "mean_token_accuracy": 0.8521544948220253, "num_tokens": 274802.0, "step": 320 }, { "epoch": 1.1068539804171988, "grad_norm": 0.803035318851471, "learning_rate": 0.00012605233219567692, "loss": 0.9009, "mean_token_accuracy": 0.8583568409085274, "num_tokens": 279061.0, "step": 325 }, { "epoch": 1.123882503192848, "grad_norm": 0.7928335666656494, "learning_rate": 0.00012491467576791808, "loss": 0.8677, "mean_token_accuracy": 0.860838033258915, "num_tokens": 283290.0, "step": 330 }, { "epoch": 1.1409110259684971, "grad_norm": 0.82757967710495, "learning_rate": 0.0001237770193401593, "loss": 0.9326, "mean_token_accuracy": 0.8526211172342301, "num_tokens": 287627.0, "step": 335 }, { "epoch": 1.1579395487441464, "grad_norm": 0.8021914958953857, "learning_rate": 0.00012263936291240045, "loss": 0.9066, "mean_token_accuracy": 0.8505649596452713, "num_tokens": 291975.0, "step": 340 }, { "epoch": 1.1749680715197957, "grad_norm": 0.7565475106239319, "learning_rate": 0.00012150170648464165, "loss": 0.8812, "mean_token_accuracy": 0.8562570214271545, "num_tokens": 296232.0, "step": 345 }, { "epoch": 1.191996594295445, "grad_norm": 0.8126978278160095, "learning_rate": 0.00012036405005688282, "loss": 0.905, "mean_token_accuracy": 0.8556828230619431, "num_tokens": 300591.0, "step": 350 }, { "epoch": 1.2090251170710942, "grad_norm": 0.8174765706062317, "learning_rate": 0.000119226393629124, "loss": 0.9861, "mean_token_accuracy": 0.8424012079834938, "num_tokens": 304998.0, "step": 355 }, { "epoch": 1.2260536398467432, "grad_norm": 0.8921035528182983, "learning_rate": 0.00011808873720136519, "loss": 0.7724, "mean_token_accuracy": 0.8735315829515458, "num_tokens": 309137.0, "step": 360 }, { "epoch": 1.2430821626223925, "grad_norm": 0.855992317199707, "learning_rate": 0.00011695108077360638, "loss": 0.8922, "mean_token_accuracy": 0.854039640724659, "num_tokens": 313389.0, "step": 365 }, { "epoch": 1.2601106853980417, "grad_norm": 0.9408860206604004, "learning_rate": 0.00011581342434584756, "loss": 0.9254, "mean_token_accuracy": 0.8507854476571083, "num_tokens": 317743.0, "step": 370 }, { "epoch": 1.277139208173691, "grad_norm": 0.7847197651863098, "learning_rate": 0.00011467576791808873, "loss": 0.8563, "mean_token_accuracy": 0.869862625002861, "num_tokens": 321873.0, "step": 375 }, { "epoch": 1.29416773094934, "grad_norm": 0.8556840419769287, "learning_rate": 0.00011353811149032993, "loss": 0.8489, "mean_token_accuracy": 0.8591933220624923, "num_tokens": 326124.0, "step": 380 }, { "epoch": 1.3111962537249893, "grad_norm": 0.8849514126777649, "learning_rate": 0.0001124004550625711, "loss": 0.8526, "mean_token_accuracy": 0.8600789621472359, "num_tokens": 330405.0, "step": 385 }, { "epoch": 1.3282247765006385, "grad_norm": 0.8099865913391113, "learning_rate": 0.00011126279863481229, "loss": 0.9309, "mean_token_accuracy": 0.8511071890592575, "num_tokens": 334701.0, "step": 390 }, { "epoch": 1.3452532992762878, "grad_norm": 0.8668401837348938, "learning_rate": 0.00011012514220705347, "loss": 0.8671, "mean_token_accuracy": 0.8605618432164193, "num_tokens": 338951.0, "step": 395 }, { "epoch": 1.362281822051937, "grad_norm": 0.8669872283935547, "learning_rate": 0.00010898748577929466, "loss": 0.8796, "mean_token_accuracy": 0.8592276558279991, "num_tokens": 343203.0, "step": 400 }, { "epoch": 1.3793103448275863, "grad_norm": 0.8468757271766663, "learning_rate": 0.00010784982935153584, "loss": 0.8941, "mean_token_accuracy": 0.8553030788898468, "num_tokens": 347460.0, "step": 405 }, { "epoch": 1.3963388676032356, "grad_norm": 0.8839651346206665, "learning_rate": 0.00010671217292377703, "loss": 0.913, "mean_token_accuracy": 0.8489826336503029, "num_tokens": 351850.0, "step": 410 }, { "epoch": 1.4133673903788846, "grad_norm": 0.8808367848396301, "learning_rate": 0.00010557451649601821, "loss": 0.8158, "mean_token_accuracy": 0.8628147393465042, "num_tokens": 356104.0, "step": 415 }, { "epoch": 1.4303959131545338, "grad_norm": 0.9303593039512634, "learning_rate": 0.00010443686006825938, "loss": 0.8737, "mean_token_accuracy": 0.8497098922729492, "num_tokens": 360445.0, "step": 420 }, { "epoch": 1.447424435930183, "grad_norm": 0.7914776802062988, "learning_rate": 0.00010329920364050057, "loss": 0.9168, "mean_token_accuracy": 0.8531492814421654, "num_tokens": 364778.0, "step": 425 }, { "epoch": 1.4644529587058321, "grad_norm": 0.8661580085754395, "learning_rate": 0.00010216154721274175, "loss": 0.8335, "mean_token_accuracy": 0.8674297228455543, "num_tokens": 368961.0, "step": 430 }, { "epoch": 1.4814814814814814, "grad_norm": 0.8548939228057861, "learning_rate": 0.00010102389078498294, "loss": 0.9314, "mean_token_accuracy": 0.8409372463822364, "num_tokens": 373355.0, "step": 435 }, { "epoch": 1.4985100042571307, "grad_norm": 0.8668932914733887, "learning_rate": 9.988623435722412e-05, "loss": 0.8482, "mean_token_accuracy": 0.8576690852642059, "num_tokens": 377652.0, "step": 440 }, { "epoch": 1.51553852703278, "grad_norm": 0.8412478566169739, "learning_rate": 9.874857792946531e-05, "loss": 0.8791, "mean_token_accuracy": 0.8531419888138772, "num_tokens": 381969.0, "step": 445 }, { "epoch": 1.5325670498084292, "grad_norm": 0.8298078179359436, "learning_rate": 9.761092150170649e-05, "loss": 0.7418, "mean_token_accuracy": 0.8757623940706253, "num_tokens": 386149.0, "step": 450 }, { "epoch": 1.5495955725840784, "grad_norm": 0.8505256772041321, "learning_rate": 9.647326507394768e-05, "loss": 0.8107, "mean_token_accuracy": 0.8660028412938118, "num_tokens": 390316.0, "step": 455 }, { "epoch": 1.5666240953597277, "grad_norm": 0.72185879945755, "learning_rate": 9.533560864618886e-05, "loss": 0.8601, "mean_token_accuracy": 0.8591737478971482, "num_tokens": 394651.0, "step": 460 }, { "epoch": 1.5836526181353767, "grad_norm": 1.0382378101348877, "learning_rate": 9.419795221843003e-05, "loss": 0.849, "mean_token_accuracy": 0.8591210901737213, "num_tokens": 398879.0, "step": 465 }, { "epoch": 1.600681140911026, "grad_norm": 0.7781236171722412, "learning_rate": 9.306029579067122e-05, "loss": 0.8587, "mean_token_accuracy": 0.8554968953132629, "num_tokens": 403154.0, "step": 470 }, { "epoch": 1.617709663686675, "grad_norm": 0.9941114187240601, "learning_rate": 9.19226393629124e-05, "loss": 1.0077, "mean_token_accuracy": 0.8324473947286606, "num_tokens": 407653.0, "step": 475 }, { "epoch": 1.6347381864623243, "grad_norm": 0.791912853717804, "learning_rate": 9.078498293515359e-05, "loss": 0.8211, "mean_token_accuracy": 0.8655396267771721, "num_tokens": 411904.0, "step": 480 }, { "epoch": 1.6517667092379735, "grad_norm": 0.8509976267814636, "learning_rate": 8.964732650739477e-05, "loss": 0.8895, "mean_token_accuracy": 0.8587504833936691, "num_tokens": 416159.0, "step": 485 }, { "epoch": 1.6687952320136228, "grad_norm": 1.0071176290512085, "learning_rate": 8.850967007963596e-05, "loss": 0.9112, "mean_token_accuracy": 0.8539686873555183, "num_tokens": 420513.0, "step": 490 }, { "epoch": 1.685823754789272, "grad_norm": 0.8273159861564636, "learning_rate": 8.737201365187714e-05, "loss": 0.8383, "mean_token_accuracy": 0.8577379778027534, "num_tokens": 424759.0, "step": 495 }, { "epoch": 1.7028522775649213, "grad_norm": 0.8064838647842407, "learning_rate": 8.623435722411833e-05, "loss": 0.8397, "mean_token_accuracy": 0.8636475175619125, "num_tokens": 429018.0, "step": 500 }, { "epoch": 1.7198808003405706, "grad_norm": 0.7176003456115723, "learning_rate": 8.509670079635951e-05, "loss": 0.7738, "mean_token_accuracy": 0.8699946105480194, "num_tokens": 433124.0, "step": 505 }, { "epoch": 1.7369093231162198, "grad_norm": 0.8316643834114075, "learning_rate": 8.395904436860069e-05, "loss": 0.9191, "mean_token_accuracy": 0.8493718564510345, "num_tokens": 437449.0, "step": 510 }, { "epoch": 1.7539378458918689, "grad_norm": 0.9423941373825073, "learning_rate": 8.282138794084187e-05, "loss": 0.8749, "mean_token_accuracy": 0.8558909714221954, "num_tokens": 441753.0, "step": 515 }, { "epoch": 1.770966368667518, "grad_norm": 0.8593487739562988, "learning_rate": 8.168373151308306e-05, "loss": 0.8463, "mean_token_accuracy": 0.857591399550438, "num_tokens": 446036.0, "step": 520 }, { "epoch": 1.7879948914431671, "grad_norm": 0.7944974303245544, "learning_rate": 8.054607508532424e-05, "loss": 0.8275, "mean_token_accuracy": 0.859096622467041, "num_tokens": 450298.0, "step": 525 }, { "epoch": 1.8050234142188164, "grad_norm": 0.7622503042221069, "learning_rate": 7.940841865756543e-05, "loss": 0.8846, "mean_token_accuracy": 0.8580268025398254, "num_tokens": 454595.0, "step": 530 }, { "epoch": 1.8220519369944657, "grad_norm": 0.8578078746795654, "learning_rate": 7.827076222980661e-05, "loss": 0.7674, "mean_token_accuracy": 0.8716912001371384, "num_tokens": 458807.0, "step": 535 }, { "epoch": 1.839080459770115, "grad_norm": 1.0383292436599731, "learning_rate": 7.71331058020478e-05, "loss": 0.9129, "mean_token_accuracy": 0.8489386543631554, "num_tokens": 463150.0, "step": 540 }, { "epoch": 1.8561089825457642, "grad_norm": 0.8726801872253418, "learning_rate": 7.599544937428897e-05, "loss": 0.877, "mean_token_accuracy": 0.8568779289722442, "num_tokens": 467472.0, "step": 545 }, { "epoch": 1.8731375053214134, "grad_norm": 0.9192221164703369, "learning_rate": 7.485779294653015e-05, "loss": 0.9341, "mean_token_accuracy": 0.8403045237064362, "num_tokens": 471930.0, "step": 550 }, { "epoch": 1.8901660280970627, "grad_norm": 0.8688830137252808, "learning_rate": 7.372013651877134e-05, "loss": 0.8244, "mean_token_accuracy": 0.8679932355880737, "num_tokens": 476140.0, "step": 555 }, { "epoch": 1.907194550872712, "grad_norm": 0.8286635279655457, "learning_rate": 7.258248009101252e-05, "loss": 0.8725, "mean_token_accuracy": 0.8549414992332458, "num_tokens": 480474.0, "step": 560 }, { "epoch": 1.924223073648361, "grad_norm": 0.789902925491333, "learning_rate": 7.14448236632537e-05, "loss": 0.8135, "mean_token_accuracy": 0.8649365425109863, "num_tokens": 484805.0, "step": 565 }, { "epoch": 1.9412515964240102, "grad_norm": 0.8496629595756531, "learning_rate": 7.030716723549489e-05, "loss": 0.9036, "mean_token_accuracy": 0.8460123494267464, "num_tokens": 489275.0, "step": 570 }, { "epoch": 1.9582801191996593, "grad_norm": 0.8411655426025391, "learning_rate": 6.916951080773608e-05, "loss": 0.9346, "mean_token_accuracy": 0.8429780200123786, "num_tokens": 493726.0, "step": 575 }, { "epoch": 1.9753086419753085, "grad_norm": 0.8502522706985474, "learning_rate": 6.803185437997726e-05, "loss": 0.8703, "mean_token_accuracy": 0.8595944106578827, "num_tokens": 498022.0, "step": 580 }, { "epoch": 1.9923371647509578, "grad_norm": 0.743918776512146, "learning_rate": 6.689419795221843e-05, "loss": 0.8815, "mean_token_accuracy": 0.851164074242115, "num_tokens": 502352.0, "step": 585 }, { "epoch": 2.009365687526607, "grad_norm": 0.7339876294136047, "learning_rate": 6.575654152445962e-05, "loss": 0.9297, "mean_token_accuracy": 0.8610147342085839, "num_tokens": 506669.0, "step": 590 }, { "epoch": 2.0263942103022563, "grad_norm": 0.903137743473053, "learning_rate": 6.46188850967008e-05, "loss": 0.7306, "mean_token_accuracy": 0.8799364000558854, "num_tokens": 510931.0, "step": 595 }, { "epoch": 2.0434227330779056, "grad_norm": 0.8741887807846069, "learning_rate": 6.348122866894199e-05, "loss": 0.777, "mean_token_accuracy": 0.8718036338686943, "num_tokens": 515254.0, "step": 600 } ], "logging_steps": 5, "max_steps": 879, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4829514093385728.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }