| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.724563644103874, |
| "eval_steps": 500, |
| "global_step": 800, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.017028522775649212, |
| "grad_norm": 2.3286359310150146, |
| "learning_rate": 0.0001988623435722412, |
| "loss": 4.1641, |
| "mean_token_accuracy": 0.3866006717085838, |
| "num_tokens": 4326.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.034057045551298425, |
| "grad_norm": 1.4926602840423584, |
| "learning_rate": 0.00019772468714448238, |
| "loss": 2.0591, |
| "mean_token_accuracy": 0.6790341928601265, |
| "num_tokens": 8676.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.05108556832694764, |
| "grad_norm": 1.0835968255996704, |
| "learning_rate": 0.00019658703071672356, |
| "loss": 1.3145, |
| "mean_token_accuracy": 0.8256841972470284, |
| "num_tokens": 12796.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.06811409110259685, |
| "grad_norm": 0.7724414467811584, |
| "learning_rate": 0.00019544937428896475, |
| "loss": 1.3324, |
| "mean_token_accuracy": 0.8117582932114601, |
| "num_tokens": 17119.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.08514261387824607, |
| "grad_norm": 0.785762369632721, |
| "learning_rate": 0.00019431171786120593, |
| "loss": 1.3375, |
| "mean_token_accuracy": 0.8029867172241211, |
| "num_tokens": 21499.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.10217113665389528, |
| "grad_norm": 0.6702725291252136, |
| "learning_rate": 0.00019317406143344712, |
| "loss": 1.2159, |
| "mean_token_accuracy": 0.8230627462267875, |
| "num_tokens": 25785.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.11919965942954448, |
| "grad_norm": 0.6287369728088379, |
| "learning_rate": 0.0001920364050056883, |
| "loss": 1.1634, |
| "mean_token_accuracy": 0.8315445825457572, |
| "num_tokens": 29980.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.1362281822051937, |
| "grad_norm": 0.6573143005371094, |
| "learning_rate": 0.00019089874857792946, |
| "loss": 1.3762, |
| "mean_token_accuracy": 0.7971536681056023, |
| "num_tokens": 34497.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.1532567049808429, |
| "grad_norm": 0.6560688614845276, |
| "learning_rate": 0.00018976109215017067, |
| "loss": 1.1589, |
| "mean_token_accuracy": 0.8251897826790809, |
| "num_tokens": 38800.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.17028522775649213, |
| "grad_norm": 0.6654791831970215, |
| "learning_rate": 0.00018862343572241183, |
| "loss": 1.1498, |
| "mean_token_accuracy": 0.8319168403744698, |
| "num_tokens": 43055.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.18731375053214133, |
| "grad_norm": 0.7387417554855347, |
| "learning_rate": 0.00018748577929465302, |
| "loss": 1.1265, |
| "mean_token_accuracy": 0.8290244281291962, |
| "num_tokens": 47346.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.20434227330779056, |
| "grad_norm": 0.5795997977256775, |
| "learning_rate": 0.0001863481228668942, |
| "loss": 1.0046, |
| "mean_token_accuracy": 0.8534704640507698, |
| "num_tokens": 51485.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.22137079608343976, |
| "grad_norm": 0.6834130883216858, |
| "learning_rate": 0.0001852104664391354, |
| "loss": 1.113, |
| "mean_token_accuracy": 0.8345914751291275, |
| "num_tokens": 55716.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.23839931885908897, |
| "grad_norm": 0.7211284041404724, |
| "learning_rate": 0.00018407281001137657, |
| "loss": 1.2132, |
| "mean_token_accuracy": 0.8207321017980576, |
| "num_tokens": 60030.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.2554278416347382, |
| "grad_norm": 0.6312271356582642, |
| "learning_rate": 0.00018293515358361776, |
| "loss": 1.0987, |
| "mean_token_accuracy": 0.8333725541830063, |
| "num_tokens": 64288.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.2724563644103874, |
| "grad_norm": 0.7119404077529907, |
| "learning_rate": 0.00018179749715585894, |
| "loss": 1.0981, |
| "mean_token_accuracy": 0.8323698997497558, |
| "num_tokens": 68548.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.2894848871860366, |
| "grad_norm": 0.9000201225280762, |
| "learning_rate": 0.00018065984072810013, |
| "loss": 1.146, |
| "mean_token_accuracy": 0.8253335595130921, |
| "num_tokens": 72914.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 0.3065134099616858, |
| "grad_norm": 0.6050537824630737, |
| "learning_rate": 0.0001795221843003413, |
| "loss": 1.0111, |
| "mean_token_accuracy": 0.842674246430397, |
| "num_tokens": 77168.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.32354193273733506, |
| "grad_norm": 0.684512197971344, |
| "learning_rate": 0.0001783845278725825, |
| "loss": 1.1186, |
| "mean_token_accuracy": 0.8351956441998482, |
| "num_tokens": 81439.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 0.34057045551298426, |
| "grad_norm": 0.7323129773139954, |
| "learning_rate": 0.00017724687144482368, |
| "loss": 1.1287, |
| "mean_token_accuracy": 0.8245970487594605, |
| "num_tokens": 85773.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.35759897828863346, |
| "grad_norm": 0.7547741532325745, |
| "learning_rate": 0.00017610921501706487, |
| "loss": 1.0868, |
| "mean_token_accuracy": 0.8298466548323631, |
| "num_tokens": 90117.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 0.37462750106428266, |
| "grad_norm": 0.7113769054412842, |
| "learning_rate": 0.00017497155858930602, |
| "loss": 1.1214, |
| "mean_token_accuracy": 0.8299670115113258, |
| "num_tokens": 94412.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 0.39165602383993187, |
| "grad_norm": 0.7486220002174377, |
| "learning_rate": 0.00017383390216154724, |
| "loss": 1.1452, |
| "mean_token_accuracy": 0.8283886179327965, |
| "num_tokens": 98782.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 0.4086845466155811, |
| "grad_norm": 0.658633828163147, |
| "learning_rate": 0.0001726962457337884, |
| "loss": 1.0415, |
| "mean_token_accuracy": 0.8431179687380791, |
| "num_tokens": 103011.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.4257130693912303, |
| "grad_norm": 0.783794105052948, |
| "learning_rate": 0.0001715585893060296, |
| "loss": 1.1056, |
| "mean_token_accuracy": 0.8254878520965576, |
| "num_tokens": 107402.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 0.4427415921668795, |
| "grad_norm": 0.7954565286636353, |
| "learning_rate": 0.00017042093287827076, |
| "loss": 1.0518, |
| "mean_token_accuracy": 0.8375606715679169, |
| "num_tokens": 111707.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 0.45977011494252873, |
| "grad_norm": 0.6913949847221375, |
| "learning_rate": 0.00016928327645051198, |
| "loss": 1.1104, |
| "mean_token_accuracy": 0.8326424166560173, |
| "num_tokens": 115998.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 0.47679863771817793, |
| "grad_norm": 0.7918037176132202, |
| "learning_rate": 0.00016814562002275313, |
| "loss": 1.0495, |
| "mean_token_accuracy": 0.8390962019562721, |
| "num_tokens": 120271.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.49382716049382713, |
| "grad_norm": 0.7816826701164246, |
| "learning_rate": 0.00016700796359499432, |
| "loss": 1.0463, |
| "mean_token_accuracy": 0.8433194428682327, |
| "num_tokens": 124461.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 0.5108556832694764, |
| "grad_norm": 0.8069042563438416, |
| "learning_rate": 0.0001658703071672355, |
| "loss": 1.0664, |
| "mean_token_accuracy": 0.8278923153877258, |
| "num_tokens": 128781.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.5278842060451255, |
| "grad_norm": 1.0114731788635254, |
| "learning_rate": 0.0001647326507394767, |
| "loss": 1.1217, |
| "mean_token_accuracy": 0.8267972275614739, |
| "num_tokens": 133167.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 0.5449127288207748, |
| "grad_norm": 0.7900378704071045, |
| "learning_rate": 0.00016359499431171787, |
| "loss": 0.971, |
| "mean_token_accuracy": 0.8421565622091294, |
| "num_tokens": 137464.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.561941251596424, |
| "grad_norm": 0.8059927821159363, |
| "learning_rate": 0.00016245733788395906, |
| "loss": 1.0457, |
| "mean_token_accuracy": 0.8381335601210594, |
| "num_tokens": 141760.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 0.5789697743720732, |
| "grad_norm": 0.7589371800422668, |
| "learning_rate": 0.00016131968145620024, |
| "loss": 1.0208, |
| "mean_token_accuracy": 0.8342296928167343, |
| "num_tokens": 146051.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 0.5959982971477225, |
| "grad_norm": 0.692416250705719, |
| "learning_rate": 0.00016018202502844143, |
| "loss": 0.9837, |
| "mean_token_accuracy": 0.8510025009512902, |
| "num_tokens": 150270.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 0.6130268199233716, |
| "grad_norm": 0.6662923097610474, |
| "learning_rate": 0.0001590443686006826, |
| "loss": 0.9835, |
| "mean_token_accuracy": 0.8463438332080842, |
| "num_tokens": 154537.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.6300553426990209, |
| "grad_norm": 0.7452691793441772, |
| "learning_rate": 0.0001579067121729238, |
| "loss": 1.0496, |
| "mean_token_accuracy": 0.8375737622380257, |
| "num_tokens": 158810.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 0.6470838654746701, |
| "grad_norm": 0.809700608253479, |
| "learning_rate": 0.00015676905574516496, |
| "loss": 1.0595, |
| "mean_token_accuracy": 0.8294038504362107, |
| "num_tokens": 163213.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 0.6641123882503193, |
| "grad_norm": 0.7708745002746582, |
| "learning_rate": 0.00015563139931740617, |
| "loss": 1.0976, |
| "mean_token_accuracy": 0.8289313957095146, |
| "num_tokens": 167607.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 0.6811409110259685, |
| "grad_norm": 0.6482141613960266, |
| "learning_rate": 0.00015449374288964733, |
| "loss": 1.0701, |
| "mean_token_accuracy": 0.8261386752128601, |
| "num_tokens": 172024.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.6981694338016177, |
| "grad_norm": 0.7164883613586426, |
| "learning_rate": 0.00015335608646188854, |
| "loss": 0.9878, |
| "mean_token_accuracy": 0.8418964132666588, |
| "num_tokens": 176317.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 0.7151979565772669, |
| "grad_norm": 0.710343599319458, |
| "learning_rate": 0.0001522184300341297, |
| "loss": 0.9306, |
| "mean_token_accuracy": 0.8468034327030182, |
| "num_tokens": 180558.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 0.7322264793529162, |
| "grad_norm": 0.863784909248352, |
| "learning_rate": 0.00015108077360637088, |
| "loss": 1.0544, |
| "mean_token_accuracy": 0.8359945684671402, |
| "num_tokens": 184885.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 0.7492550021285653, |
| "grad_norm": 0.8381637930870056, |
| "learning_rate": 0.00014994311717861207, |
| "loss": 1.0522, |
| "mean_token_accuracy": 0.836811026930809, |
| "num_tokens": 189219.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.7662835249042146, |
| "grad_norm": 0.683501124382019, |
| "learning_rate": 0.00014880546075085325, |
| "loss": 0.9427, |
| "mean_token_accuracy": 0.8544979348778725, |
| "num_tokens": 193437.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 0.7833120476798637, |
| "grad_norm": 0.7609812617301941, |
| "learning_rate": 0.00014766780432309444, |
| "loss": 1.0048, |
| "mean_token_accuracy": 0.8403829500079155, |
| "num_tokens": 197724.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 0.800340570455513, |
| "grad_norm": 0.8223949074745178, |
| "learning_rate": 0.00014653014789533562, |
| "loss": 1.078, |
| "mean_token_accuracy": 0.8296335831284523, |
| "num_tokens": 202141.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 0.8173690932311622, |
| "grad_norm": 0.9807024002075195, |
| "learning_rate": 0.0001453924914675768, |
| "loss": 0.9295, |
| "mean_token_accuracy": 0.8495418474078178, |
| "num_tokens": 206333.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.8343976160068114, |
| "grad_norm": 0.7864217162132263, |
| "learning_rate": 0.000144254835039818, |
| "loss": 1.0326, |
| "mean_token_accuracy": 0.8422158002853394, |
| "num_tokens": 210593.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 0.8514261387824607, |
| "grad_norm": 0.8183476328849792, |
| "learning_rate": 0.00014311717861205915, |
| "loss": 1.0419, |
| "mean_token_accuracy": 0.8332764700055122, |
| "num_tokens": 214925.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.8684546615581098, |
| "grad_norm": 0.7906543612480164, |
| "learning_rate": 0.00014197952218430036, |
| "loss": 0.9278, |
| "mean_token_accuracy": 0.8531344652175903, |
| "num_tokens": 219106.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 0.885483184333759, |
| "grad_norm": 0.7864625453948975, |
| "learning_rate": 0.00014084186575654152, |
| "loss": 0.9764, |
| "mean_token_accuracy": 0.8394758701324463, |
| "num_tokens": 223398.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.9025117071094083, |
| "grad_norm": 0.7231821417808533, |
| "learning_rate": 0.00013970420932878273, |
| "loss": 1.0357, |
| "mean_token_accuracy": 0.8368565306067467, |
| "num_tokens": 227720.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 0.9195402298850575, |
| "grad_norm": 0.7288718223571777, |
| "learning_rate": 0.0001385665529010239, |
| "loss": 1.0178, |
| "mean_token_accuracy": 0.842984040081501, |
| "num_tokens": 232021.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 0.9365687526607067, |
| "grad_norm": 0.7466130256652832, |
| "learning_rate": 0.0001374288964732651, |
| "loss": 0.9974, |
| "mean_token_accuracy": 0.8431279867887497, |
| "num_tokens": 236312.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 0.9535972754363559, |
| "grad_norm": 0.7876543402671814, |
| "learning_rate": 0.00013629124004550626, |
| "loss": 1.0057, |
| "mean_token_accuracy": 0.8389794036746026, |
| "num_tokens": 240594.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.9706257982120051, |
| "grad_norm": 0.738293468952179, |
| "learning_rate": 0.00013515358361774744, |
| "loss": 0.9129, |
| "mean_token_accuracy": 0.8528255730867386, |
| "num_tokens": 244859.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 0.9876543209876543, |
| "grad_norm": 0.8145989775657654, |
| "learning_rate": 0.00013401592718998863, |
| "loss": 0.9188, |
| "mean_token_accuracy": 0.8555046319961548, |
| "num_tokens": 249060.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 1.0046828437633035, |
| "grad_norm": 0.693233072757721, |
| "learning_rate": 0.00013287827076222981, |
| "loss": 1.0648, |
| "mean_token_accuracy": 0.8477524280548095, |
| "num_tokens": 253361.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 1.0217113665389528, |
| "grad_norm": 0.8171095848083496, |
| "learning_rate": 0.000131740614334471, |
| "loss": 0.883, |
| "mean_token_accuracy": 0.8561580404639244, |
| "num_tokens": 257633.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 1.038739889314602, |
| "grad_norm": 0.7343988418579102, |
| "learning_rate": 0.00013060295790671218, |
| "loss": 0.8591, |
| "mean_token_accuracy": 0.8583228841423989, |
| "num_tokens": 261975.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 1.055768412090251, |
| "grad_norm": 0.6689726114273071, |
| "learning_rate": 0.00012946530147895337, |
| "loss": 0.8397, |
| "mean_token_accuracy": 0.8668102487921715, |
| "num_tokens": 266174.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 1.0727969348659003, |
| "grad_norm": 0.8284767270088196, |
| "learning_rate": 0.00012832764505119455, |
| "loss": 0.9108, |
| "mean_token_accuracy": 0.8551412716507911, |
| "num_tokens": 270416.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 1.0898254576415496, |
| "grad_norm": 0.7800877690315247, |
| "learning_rate": 0.0001271899886234357, |
| "loss": 0.923, |
| "mean_token_accuracy": 0.8521544948220253, |
| "num_tokens": 274802.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 1.1068539804171988, |
| "grad_norm": 0.803035318851471, |
| "learning_rate": 0.00012605233219567692, |
| "loss": 0.9009, |
| "mean_token_accuracy": 0.8583568409085274, |
| "num_tokens": 279061.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 1.123882503192848, |
| "grad_norm": 0.7928335666656494, |
| "learning_rate": 0.00012491467576791808, |
| "loss": 0.8677, |
| "mean_token_accuracy": 0.860838033258915, |
| "num_tokens": 283290.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 1.1409110259684971, |
| "grad_norm": 0.82757967710495, |
| "learning_rate": 0.0001237770193401593, |
| "loss": 0.9326, |
| "mean_token_accuracy": 0.8526211172342301, |
| "num_tokens": 287627.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 1.1579395487441464, |
| "grad_norm": 0.8021914958953857, |
| "learning_rate": 0.00012263936291240045, |
| "loss": 0.9066, |
| "mean_token_accuracy": 0.8505649596452713, |
| "num_tokens": 291975.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 1.1749680715197957, |
| "grad_norm": 0.7565475106239319, |
| "learning_rate": 0.00012150170648464165, |
| "loss": 0.8812, |
| "mean_token_accuracy": 0.8562570214271545, |
| "num_tokens": 296232.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 1.191996594295445, |
| "grad_norm": 0.8126978278160095, |
| "learning_rate": 0.00012036405005688282, |
| "loss": 0.905, |
| "mean_token_accuracy": 0.8556828230619431, |
| "num_tokens": 300591.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 1.2090251170710942, |
| "grad_norm": 0.8174765706062317, |
| "learning_rate": 0.000119226393629124, |
| "loss": 0.9861, |
| "mean_token_accuracy": 0.8424012079834938, |
| "num_tokens": 304998.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 1.2260536398467432, |
| "grad_norm": 0.8921035528182983, |
| "learning_rate": 0.00011808873720136519, |
| "loss": 0.7724, |
| "mean_token_accuracy": 0.8735315829515458, |
| "num_tokens": 309137.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 1.2430821626223925, |
| "grad_norm": 0.855992317199707, |
| "learning_rate": 0.00011695108077360638, |
| "loss": 0.8922, |
| "mean_token_accuracy": 0.854039640724659, |
| "num_tokens": 313389.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 1.2601106853980417, |
| "grad_norm": 0.9408860206604004, |
| "learning_rate": 0.00011581342434584756, |
| "loss": 0.9254, |
| "mean_token_accuracy": 0.8507854476571083, |
| "num_tokens": 317743.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 1.277139208173691, |
| "grad_norm": 0.7847197651863098, |
| "learning_rate": 0.00011467576791808873, |
| "loss": 0.8563, |
| "mean_token_accuracy": 0.869862625002861, |
| "num_tokens": 321873.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 1.29416773094934, |
| "grad_norm": 0.8556840419769287, |
| "learning_rate": 0.00011353811149032993, |
| "loss": 0.8489, |
| "mean_token_accuracy": 0.8591933220624923, |
| "num_tokens": 326124.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 1.3111962537249893, |
| "grad_norm": 0.8849514126777649, |
| "learning_rate": 0.0001124004550625711, |
| "loss": 0.8526, |
| "mean_token_accuracy": 0.8600789621472359, |
| "num_tokens": 330405.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 1.3282247765006385, |
| "grad_norm": 0.8099865913391113, |
| "learning_rate": 0.00011126279863481229, |
| "loss": 0.9309, |
| "mean_token_accuracy": 0.8511071890592575, |
| "num_tokens": 334701.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 1.3452532992762878, |
| "grad_norm": 0.8668401837348938, |
| "learning_rate": 0.00011012514220705347, |
| "loss": 0.8671, |
| "mean_token_accuracy": 0.8605618432164193, |
| "num_tokens": 338951.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 1.362281822051937, |
| "grad_norm": 0.8669872283935547, |
| "learning_rate": 0.00010898748577929466, |
| "loss": 0.8796, |
| "mean_token_accuracy": 0.8592276558279991, |
| "num_tokens": 343203.0, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.3793103448275863, |
| "grad_norm": 0.8468757271766663, |
| "learning_rate": 0.00010784982935153584, |
| "loss": 0.8941, |
| "mean_token_accuracy": 0.8553030788898468, |
| "num_tokens": 347460.0, |
| "step": 405 |
| }, |
| { |
| "epoch": 1.3963388676032356, |
| "grad_norm": 0.8839651346206665, |
| "learning_rate": 0.00010671217292377703, |
| "loss": 0.913, |
| "mean_token_accuracy": 0.8489826336503029, |
| "num_tokens": 351850.0, |
| "step": 410 |
| }, |
| { |
| "epoch": 1.4133673903788846, |
| "grad_norm": 0.8808367848396301, |
| "learning_rate": 0.00010557451649601821, |
| "loss": 0.8158, |
| "mean_token_accuracy": 0.8628147393465042, |
| "num_tokens": 356104.0, |
| "step": 415 |
| }, |
| { |
| "epoch": 1.4303959131545338, |
| "grad_norm": 0.9303593039512634, |
| "learning_rate": 0.00010443686006825938, |
| "loss": 0.8737, |
| "mean_token_accuracy": 0.8497098922729492, |
| "num_tokens": 360445.0, |
| "step": 420 |
| }, |
| { |
| "epoch": 1.447424435930183, |
| "grad_norm": 0.7914776802062988, |
| "learning_rate": 0.00010329920364050057, |
| "loss": 0.9168, |
| "mean_token_accuracy": 0.8531492814421654, |
| "num_tokens": 364778.0, |
| "step": 425 |
| }, |
| { |
| "epoch": 1.4644529587058321, |
| "grad_norm": 0.8661580085754395, |
| "learning_rate": 0.00010216154721274175, |
| "loss": 0.8335, |
| "mean_token_accuracy": 0.8674297228455543, |
| "num_tokens": 368961.0, |
| "step": 430 |
| }, |
| { |
| "epoch": 1.4814814814814814, |
| "grad_norm": 0.8548939228057861, |
| "learning_rate": 0.00010102389078498294, |
| "loss": 0.9314, |
| "mean_token_accuracy": 0.8409372463822364, |
| "num_tokens": 373355.0, |
| "step": 435 |
| }, |
| { |
| "epoch": 1.4985100042571307, |
| "grad_norm": 0.8668932914733887, |
| "learning_rate": 9.988623435722412e-05, |
| "loss": 0.8482, |
| "mean_token_accuracy": 0.8576690852642059, |
| "num_tokens": 377652.0, |
| "step": 440 |
| }, |
| { |
| "epoch": 1.51553852703278, |
| "grad_norm": 0.8412478566169739, |
| "learning_rate": 9.874857792946531e-05, |
| "loss": 0.8791, |
| "mean_token_accuracy": 0.8531419888138772, |
| "num_tokens": 381969.0, |
| "step": 445 |
| }, |
| { |
| "epoch": 1.5325670498084292, |
| "grad_norm": 0.8298078179359436, |
| "learning_rate": 9.761092150170649e-05, |
| "loss": 0.7418, |
| "mean_token_accuracy": 0.8757623940706253, |
| "num_tokens": 386149.0, |
| "step": 450 |
| }, |
| { |
| "epoch": 1.5495955725840784, |
| "grad_norm": 0.8505256772041321, |
| "learning_rate": 9.647326507394768e-05, |
| "loss": 0.8107, |
| "mean_token_accuracy": 0.8660028412938118, |
| "num_tokens": 390316.0, |
| "step": 455 |
| }, |
| { |
| "epoch": 1.5666240953597277, |
| "grad_norm": 0.72185879945755, |
| "learning_rate": 9.533560864618886e-05, |
| "loss": 0.8601, |
| "mean_token_accuracy": 0.8591737478971482, |
| "num_tokens": 394651.0, |
| "step": 460 |
| }, |
| { |
| "epoch": 1.5836526181353767, |
| "grad_norm": 1.0382378101348877, |
| "learning_rate": 9.419795221843003e-05, |
| "loss": 0.849, |
| "mean_token_accuracy": 0.8591210901737213, |
| "num_tokens": 398879.0, |
| "step": 465 |
| }, |
| { |
| "epoch": 1.600681140911026, |
| "grad_norm": 0.7781236171722412, |
| "learning_rate": 9.306029579067122e-05, |
| "loss": 0.8587, |
| "mean_token_accuracy": 0.8554968953132629, |
| "num_tokens": 403154.0, |
| "step": 470 |
| }, |
| { |
| "epoch": 1.617709663686675, |
| "grad_norm": 0.9941114187240601, |
| "learning_rate": 9.19226393629124e-05, |
| "loss": 1.0077, |
| "mean_token_accuracy": 0.8324473947286606, |
| "num_tokens": 407653.0, |
| "step": 475 |
| }, |
| { |
| "epoch": 1.6347381864623243, |
| "grad_norm": 0.791912853717804, |
| "learning_rate": 9.078498293515359e-05, |
| "loss": 0.8211, |
| "mean_token_accuracy": 0.8655396267771721, |
| "num_tokens": 411904.0, |
| "step": 480 |
| }, |
| { |
| "epoch": 1.6517667092379735, |
| "grad_norm": 0.8509976267814636, |
| "learning_rate": 8.964732650739477e-05, |
| "loss": 0.8895, |
| "mean_token_accuracy": 0.8587504833936691, |
| "num_tokens": 416159.0, |
| "step": 485 |
| }, |
| { |
| "epoch": 1.6687952320136228, |
| "grad_norm": 1.0071176290512085, |
| "learning_rate": 8.850967007963596e-05, |
| "loss": 0.9112, |
| "mean_token_accuracy": 0.8539686873555183, |
| "num_tokens": 420513.0, |
| "step": 490 |
| }, |
| { |
| "epoch": 1.685823754789272, |
| "grad_norm": 0.8273159861564636, |
| "learning_rate": 8.737201365187714e-05, |
| "loss": 0.8383, |
| "mean_token_accuracy": 0.8577379778027534, |
| "num_tokens": 424759.0, |
| "step": 495 |
| }, |
| { |
| "epoch": 1.7028522775649213, |
| "grad_norm": 0.8064838647842407, |
| "learning_rate": 8.623435722411833e-05, |
| "loss": 0.8397, |
| "mean_token_accuracy": 0.8636475175619125, |
| "num_tokens": 429018.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.7198808003405706, |
| "grad_norm": 0.7176003456115723, |
| "learning_rate": 8.509670079635951e-05, |
| "loss": 0.7738, |
| "mean_token_accuracy": 0.8699946105480194, |
| "num_tokens": 433124.0, |
| "step": 505 |
| }, |
| { |
| "epoch": 1.7369093231162198, |
| "grad_norm": 0.8316643834114075, |
| "learning_rate": 8.395904436860069e-05, |
| "loss": 0.9191, |
| "mean_token_accuracy": 0.8493718564510345, |
| "num_tokens": 437449.0, |
| "step": 510 |
| }, |
| { |
| "epoch": 1.7539378458918689, |
| "grad_norm": 0.9423941373825073, |
| "learning_rate": 8.282138794084187e-05, |
| "loss": 0.8749, |
| "mean_token_accuracy": 0.8558909714221954, |
| "num_tokens": 441753.0, |
| "step": 515 |
| }, |
| { |
| "epoch": 1.770966368667518, |
| "grad_norm": 0.8593487739562988, |
| "learning_rate": 8.168373151308306e-05, |
| "loss": 0.8463, |
| "mean_token_accuracy": 0.857591399550438, |
| "num_tokens": 446036.0, |
| "step": 520 |
| }, |
| { |
| "epoch": 1.7879948914431671, |
| "grad_norm": 0.7944974303245544, |
| "learning_rate": 8.054607508532424e-05, |
| "loss": 0.8275, |
| "mean_token_accuracy": 0.859096622467041, |
| "num_tokens": 450298.0, |
| "step": 525 |
| }, |
| { |
| "epoch": 1.8050234142188164, |
| "grad_norm": 0.7622503042221069, |
| "learning_rate": 7.940841865756543e-05, |
| "loss": 0.8846, |
| "mean_token_accuracy": 0.8580268025398254, |
| "num_tokens": 454595.0, |
| "step": 530 |
| }, |
| { |
| "epoch": 1.8220519369944657, |
| "grad_norm": 0.8578078746795654, |
| "learning_rate": 7.827076222980661e-05, |
| "loss": 0.7674, |
| "mean_token_accuracy": 0.8716912001371384, |
| "num_tokens": 458807.0, |
| "step": 535 |
| }, |
| { |
| "epoch": 1.839080459770115, |
| "grad_norm": 1.0383292436599731, |
| "learning_rate": 7.71331058020478e-05, |
| "loss": 0.9129, |
| "mean_token_accuracy": 0.8489386543631554, |
| "num_tokens": 463150.0, |
| "step": 540 |
| }, |
| { |
| "epoch": 1.8561089825457642, |
| "grad_norm": 0.8726801872253418, |
| "learning_rate": 7.599544937428897e-05, |
| "loss": 0.877, |
| "mean_token_accuracy": 0.8568779289722442, |
| "num_tokens": 467472.0, |
| "step": 545 |
| }, |
| { |
| "epoch": 1.8731375053214134, |
| "grad_norm": 0.9192221164703369, |
| "learning_rate": 7.485779294653015e-05, |
| "loss": 0.9341, |
| "mean_token_accuracy": 0.8403045237064362, |
| "num_tokens": 471930.0, |
| "step": 550 |
| }, |
| { |
| "epoch": 1.8901660280970627, |
| "grad_norm": 0.8688830137252808, |
| "learning_rate": 7.372013651877134e-05, |
| "loss": 0.8244, |
| "mean_token_accuracy": 0.8679932355880737, |
| "num_tokens": 476140.0, |
| "step": 555 |
| }, |
| { |
| "epoch": 1.907194550872712, |
| "grad_norm": 0.8286635279655457, |
| "learning_rate": 7.258248009101252e-05, |
| "loss": 0.8725, |
| "mean_token_accuracy": 0.8549414992332458, |
| "num_tokens": 480474.0, |
| "step": 560 |
| }, |
| { |
| "epoch": 1.924223073648361, |
| "grad_norm": 0.789902925491333, |
| "learning_rate": 7.14448236632537e-05, |
| "loss": 0.8135, |
| "mean_token_accuracy": 0.8649365425109863, |
| "num_tokens": 484805.0, |
| "step": 565 |
| }, |
| { |
| "epoch": 1.9412515964240102, |
| "grad_norm": 0.8496629595756531, |
| "learning_rate": 7.030716723549489e-05, |
| "loss": 0.9036, |
| "mean_token_accuracy": 0.8460123494267464, |
| "num_tokens": 489275.0, |
| "step": 570 |
| }, |
| { |
| "epoch": 1.9582801191996593, |
| "grad_norm": 0.8411655426025391, |
| "learning_rate": 6.916951080773608e-05, |
| "loss": 0.9346, |
| "mean_token_accuracy": 0.8429780200123786, |
| "num_tokens": 493726.0, |
| "step": 575 |
| }, |
| { |
| "epoch": 1.9753086419753085, |
| "grad_norm": 0.8502522706985474, |
| "learning_rate": 6.803185437997726e-05, |
| "loss": 0.8703, |
| "mean_token_accuracy": 0.8595944106578827, |
| "num_tokens": 498022.0, |
| "step": 580 |
| }, |
| { |
| "epoch": 1.9923371647509578, |
| "grad_norm": 0.743918776512146, |
| "learning_rate": 6.689419795221843e-05, |
| "loss": 0.8815, |
| "mean_token_accuracy": 0.851164074242115, |
| "num_tokens": 502352.0, |
| "step": 585 |
| }, |
| { |
| "epoch": 2.009365687526607, |
| "grad_norm": 0.7339876294136047, |
| "learning_rate": 6.575654152445962e-05, |
| "loss": 0.9297, |
| "mean_token_accuracy": 0.8610147342085839, |
| "num_tokens": 506669.0, |
| "step": 590 |
| }, |
| { |
| "epoch": 2.0263942103022563, |
| "grad_norm": 0.903137743473053, |
| "learning_rate": 6.46188850967008e-05, |
| "loss": 0.7306, |
| "mean_token_accuracy": 0.8799364000558854, |
| "num_tokens": 510931.0, |
| "step": 595 |
| }, |
| { |
| "epoch": 2.0434227330779056, |
| "grad_norm": 0.8741887807846069, |
| "learning_rate": 6.348122866894199e-05, |
| "loss": 0.777, |
| "mean_token_accuracy": 0.8718036338686943, |
| "num_tokens": 515254.0, |
| "step": 600 |
| }, |
| { |
| "epoch": 2.060451255853555, |
| "grad_norm": 0.9856182932853699, |
| "learning_rate": 6.234357224118317e-05, |
| "loss": 0.6852, |
| "mean_token_accuracy": 0.8851086810231209, |
| "num_tokens": 519444.0, |
| "step": 605 |
| }, |
| { |
| "epoch": 2.077479778629204, |
| "grad_norm": 0.7548404335975647, |
| "learning_rate": 6.120591581342436e-05, |
| "loss": 0.7239, |
| "mean_token_accuracy": 0.8775098115205765, |
| "num_tokens": 523786.0, |
| "step": 610 |
| }, |
| { |
| "epoch": 2.0945083014048533, |
| "grad_norm": 1.0486595630645752, |
| "learning_rate": 6.0068259385665536e-05, |
| "loss": 0.7704, |
| "mean_token_accuracy": 0.8707917019724846, |
| "num_tokens": 528181.0, |
| "step": 615 |
| }, |
| { |
| "epoch": 2.111536824180502, |
| "grad_norm": 0.8551440238952637, |
| "learning_rate": 5.8930602957906714e-05, |
| "loss": 0.7298, |
| "mean_token_accuracy": 0.8771380126476288, |
| "num_tokens": 532472.0, |
| "step": 620 |
| }, |
| { |
| "epoch": 2.1285653469561514, |
| "grad_norm": 0.7993748784065247, |
| "learning_rate": 5.77929465301479e-05, |
| "loss": 0.7342, |
| "mean_token_accuracy": 0.8784463226795196, |
| "num_tokens": 536780.0, |
| "step": 625 |
| }, |
| { |
| "epoch": 2.1455938697318007, |
| "grad_norm": 0.9535342454910278, |
| "learning_rate": 5.665529010238908e-05, |
| "loss": 0.7448, |
| "mean_token_accuracy": 0.8769229754805565, |
| "num_tokens": 541096.0, |
| "step": 630 |
| }, |
| { |
| "epoch": 2.16262239250745, |
| "grad_norm": 0.8289098739624023, |
| "learning_rate": 5.551763367463026e-05, |
| "loss": 0.6921, |
| "mean_token_accuracy": 0.8816722989082336, |
| "num_tokens": 545212.0, |
| "step": 635 |
| }, |
| { |
| "epoch": 2.179650915283099, |
| "grad_norm": 1.0842015743255615, |
| "learning_rate": 5.437997724687145e-05, |
| "loss": 0.7519, |
| "mean_token_accuracy": 0.87905133664608, |
| "num_tokens": 549486.0, |
| "step": 640 |
| }, |
| { |
| "epoch": 2.1966794380587484, |
| "grad_norm": 0.9770705699920654, |
| "learning_rate": 5.324232081911263e-05, |
| "loss": 0.7565, |
| "mean_token_accuracy": 0.8737751096487045, |
| "num_tokens": 553849.0, |
| "step": 645 |
| }, |
| { |
| "epoch": 2.2137079608343977, |
| "grad_norm": 0.9087614417076111, |
| "learning_rate": 5.210466439135382e-05, |
| "loss": 0.7573, |
| "mean_token_accuracy": 0.8769190922379494, |
| "num_tokens": 558157.0, |
| "step": 650 |
| }, |
| { |
| "epoch": 2.230736483610047, |
| "grad_norm": 0.9485377073287964, |
| "learning_rate": 5.0967007963594995e-05, |
| "loss": 0.7951, |
| "mean_token_accuracy": 0.8717585399746894, |
| "num_tokens": 562499.0, |
| "step": 655 |
| }, |
| { |
| "epoch": 2.247765006385696, |
| "grad_norm": 0.901766300201416, |
| "learning_rate": 4.982935153583618e-05, |
| "loss": 0.7584, |
| "mean_token_accuracy": 0.8740618869662284, |
| "num_tokens": 566735.0, |
| "step": 660 |
| }, |
| { |
| "epoch": 2.264793529161345, |
| "grad_norm": 0.9577491879463196, |
| "learning_rate": 4.8691695108077365e-05, |
| "loss": 0.8409, |
| "mean_token_accuracy": 0.8705617383122444, |
| "num_tokens": 571024.0, |
| "step": 665 |
| }, |
| { |
| "epoch": 2.2818220519369943, |
| "grad_norm": 0.791725218296051, |
| "learning_rate": 4.755403868031855e-05, |
| "loss": 0.6348, |
| "mean_token_accuracy": 0.8875991255044937, |
| "num_tokens": 575196.0, |
| "step": 670 |
| }, |
| { |
| "epoch": 2.2988505747126435, |
| "grad_norm": 1.0129467248916626, |
| "learning_rate": 4.641638225255973e-05, |
| "loss": 0.7094, |
| "mean_token_accuracy": 0.8820217370986938, |
| "num_tokens": 579384.0, |
| "step": 675 |
| }, |
| { |
| "epoch": 2.315879097488293, |
| "grad_norm": 0.9562749266624451, |
| "learning_rate": 4.527872582480091e-05, |
| "loss": 0.7119, |
| "mean_token_accuracy": 0.8796836137771606, |
| "num_tokens": 583637.0, |
| "step": 680 |
| }, |
| { |
| "epoch": 2.332907620263942, |
| "grad_norm": 0.8766334056854248, |
| "learning_rate": 4.41410693970421e-05, |
| "loss": 0.779, |
| "mean_token_accuracy": 0.8700046718120575, |
| "num_tokens": 588005.0, |
| "step": 685 |
| }, |
| { |
| "epoch": 2.3499361430395913, |
| "grad_norm": 0.9728025794029236, |
| "learning_rate": 4.300341296928328e-05, |
| "loss": 0.8319, |
| "mean_token_accuracy": 0.8586345180869103, |
| "num_tokens": 592448.0, |
| "step": 690 |
| }, |
| { |
| "epoch": 2.3669646658152406, |
| "grad_norm": 1.0943338871002197, |
| "learning_rate": 4.186575654152446e-05, |
| "loss": 0.7845, |
| "mean_token_accuracy": 0.8698052436113357, |
| "num_tokens": 596703.0, |
| "step": 695 |
| }, |
| { |
| "epoch": 2.38399318859089, |
| "grad_norm": 1.1211864948272705, |
| "learning_rate": 4.0728100113765646e-05, |
| "loss": 0.7837, |
| "mean_token_accuracy": 0.8664575144648552, |
| "num_tokens": 601127.0, |
| "step": 700 |
| }, |
| { |
| "epoch": 2.401021711366539, |
| "grad_norm": 0.9164478182792664, |
| "learning_rate": 3.959044368600683e-05, |
| "loss": 0.708, |
| "mean_token_accuracy": 0.8818950295448303, |
| "num_tokens": 605371.0, |
| "step": 705 |
| }, |
| { |
| "epoch": 2.4180502341421883, |
| "grad_norm": 1.0944688320159912, |
| "learning_rate": 3.8452787258248016e-05, |
| "loss": 0.8541, |
| "mean_token_accuracy": 0.8556552082300186, |
| "num_tokens": 609890.0, |
| "step": 710 |
| }, |
| { |
| "epoch": 2.4350787569178376, |
| "grad_norm": 0.8398585319519043, |
| "learning_rate": 3.7315130830489194e-05, |
| "loss": 0.7117, |
| "mean_token_accuracy": 0.882653883099556, |
| "num_tokens": 614025.0, |
| "step": 715 |
| }, |
| { |
| "epoch": 2.4521072796934864, |
| "grad_norm": 0.9557759165763855, |
| "learning_rate": 3.617747440273038e-05, |
| "loss": 0.7401, |
| "mean_token_accuracy": 0.8780117958784104, |
| "num_tokens": 618268.0, |
| "step": 720 |
| }, |
| { |
| "epoch": 2.4691358024691357, |
| "grad_norm": 0.7890902757644653, |
| "learning_rate": 3.5039817974971564e-05, |
| "loss": 0.7193, |
| "mean_token_accuracy": 0.8795603841543198, |
| "num_tokens": 622542.0, |
| "step": 725 |
| }, |
| { |
| "epoch": 2.486164325244785, |
| "grad_norm": 1.0514216423034668, |
| "learning_rate": 3.390216154721274e-05, |
| "loss": 0.6987, |
| "mean_token_accuracy": 0.8816746294498443, |
| "num_tokens": 626771.0, |
| "step": 730 |
| }, |
| { |
| "epoch": 2.503192848020434, |
| "grad_norm": 1.0042310953140259, |
| "learning_rate": 3.276450511945393e-05, |
| "loss": 0.7099, |
| "mean_token_accuracy": 0.8860125571489335, |
| "num_tokens": 630981.0, |
| "step": 735 |
| }, |
| { |
| "epoch": 2.5202213707960834, |
| "grad_norm": 1.0508288145065308, |
| "learning_rate": 3.162684869169511e-05, |
| "loss": 0.7424, |
| "mean_token_accuracy": 0.8739517882466317, |
| "num_tokens": 635240.0, |
| "step": 740 |
| }, |
| { |
| "epoch": 2.5372498935717327, |
| "grad_norm": 1.0945532321929932, |
| "learning_rate": 3.0489192263936294e-05, |
| "loss": 0.8181, |
| "mean_token_accuracy": 0.8624349996447563, |
| "num_tokens": 639694.0, |
| "step": 745 |
| }, |
| { |
| "epoch": 2.554278416347382, |
| "grad_norm": 0.9198687076568604, |
| "learning_rate": 2.9351535836177476e-05, |
| "loss": 0.688, |
| "mean_token_accuracy": 0.880143529176712, |
| "num_tokens": 643984.0, |
| "step": 750 |
| }, |
| { |
| "epoch": 2.571306939123031, |
| "grad_norm": 1.0412315130233765, |
| "learning_rate": 2.8213879408418657e-05, |
| "loss": 0.6844, |
| "mean_token_accuracy": 0.8923282608389854, |
| "num_tokens": 648166.0, |
| "step": 755 |
| }, |
| { |
| "epoch": 2.58833546189868, |
| "grad_norm": 0.9161568284034729, |
| "learning_rate": 2.7076222980659842e-05, |
| "loss": 0.7436, |
| "mean_token_accuracy": 0.8677403450012207, |
| "num_tokens": 652487.0, |
| "step": 760 |
| }, |
| { |
| "epoch": 2.6053639846743293, |
| "grad_norm": 0.7734108567237854, |
| "learning_rate": 2.5938566552901024e-05, |
| "loss": 0.6938, |
| "mean_token_accuracy": 0.8824578642845153, |
| "num_tokens": 656735.0, |
| "step": 765 |
| }, |
| { |
| "epoch": 2.6223925074499785, |
| "grad_norm": 1.2506450414657593, |
| "learning_rate": 2.480091012514221e-05, |
| "loss": 0.7896, |
| "mean_token_accuracy": 0.8708192393183708, |
| "num_tokens": 661125.0, |
| "step": 770 |
| }, |
| { |
| "epoch": 2.639421030225628, |
| "grad_norm": 0.9822338223457336, |
| "learning_rate": 2.366325369738339e-05, |
| "loss": 0.7611, |
| "mean_token_accuracy": 0.8697439581155777, |
| "num_tokens": 665455.0, |
| "step": 775 |
| }, |
| { |
| "epoch": 2.656449553001277, |
| "grad_norm": 1.0660203695297241, |
| "learning_rate": 2.2525597269624575e-05, |
| "loss": 0.8025, |
| "mean_token_accuracy": 0.867020557820797, |
| "num_tokens": 669868.0, |
| "step": 780 |
| }, |
| { |
| "epoch": 2.6734780757769263, |
| "grad_norm": 1.049364686012268, |
| "learning_rate": 2.138794084186576e-05, |
| "loss": 0.7601, |
| "mean_token_accuracy": 0.8773441627621651, |
| "num_tokens": 674152.0, |
| "step": 785 |
| }, |
| { |
| "epoch": 2.6905065985525756, |
| "grad_norm": 0.9868401288986206, |
| "learning_rate": 2.025028441410694e-05, |
| "loss": 0.7507, |
| "mean_token_accuracy": 0.8820523858070374, |
| "num_tokens": 678390.0, |
| "step": 790 |
| }, |
| { |
| "epoch": 2.707535121328225, |
| "grad_norm": 0.9983195662498474, |
| "learning_rate": 1.9112627986348127e-05, |
| "loss": 0.7143, |
| "mean_token_accuracy": 0.8788602381944657, |
| "num_tokens": 682664.0, |
| "step": 795 |
| }, |
| { |
| "epoch": 2.724563644103874, |
| "grad_norm": 0.8293647170066833, |
| "learning_rate": 1.7974971558589308e-05, |
| "loss": 0.7131, |
| "mean_token_accuracy": 0.8797033429145813, |
| "num_tokens": 686921.0, |
| "step": 800 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 879, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 200, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 6438561661903872.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|