| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.724563644103874, |
| "eval_steps": 500, |
| "global_step": 800, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.017028522775649212, |
| "grad_norm": 6.522716999053955, |
| "learning_rate": 0.0001988623435722412, |
| "loss": 2.7211, |
| "mean_token_accuracy": 0.5789041496813297, |
| "num_tokens": 4727.0, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.034057045551298425, |
| "grad_norm": 1.0070050954818726, |
| "learning_rate": 0.00019772468714448238, |
| "loss": 0.9998, |
| "mean_token_accuracy": 0.8499793156981468, |
| "num_tokens": 9471.0, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.05108556832694764, |
| "grad_norm": 0.7373425960540771, |
| "learning_rate": 0.00019658703071672356, |
| "loss": 0.8303, |
| "mean_token_accuracy": 0.8681916877627373, |
| "num_tokens": 14013.0, |
| "step": 15 |
| }, |
| { |
| "epoch": 0.06811409110259685, |
| "grad_norm": 0.8468236327171326, |
| "learning_rate": 0.00019544937428896475, |
| "loss": 0.8404, |
| "mean_token_accuracy": 0.8622620105743408, |
| "num_tokens": 18725.0, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.08514261387824607, |
| "grad_norm": 0.8178804516792297, |
| "learning_rate": 0.00019431171786120593, |
| "loss": 0.9073, |
| "mean_token_accuracy": 0.8524447843432427, |
| "num_tokens": 23497.0, |
| "step": 25 |
| }, |
| { |
| "epoch": 0.10217113665389528, |
| "grad_norm": 0.890177309513092, |
| "learning_rate": 0.00019317406143344712, |
| "loss": 0.8029, |
| "mean_token_accuracy": 0.8642359614372254, |
| "num_tokens": 28192.0, |
| "step": 30 |
| }, |
| { |
| "epoch": 0.11919965942954448, |
| "grad_norm": 1.0545469522476196, |
| "learning_rate": 0.0001920364050056883, |
| "loss": 0.7458, |
| "mean_token_accuracy": 0.8732351213693619, |
| "num_tokens": 32805.0, |
| "step": 35 |
| }, |
| { |
| "epoch": 0.1362281822051937, |
| "grad_norm": 1.0384492874145508, |
| "learning_rate": 0.00019089874857792946, |
| "loss": 0.9235, |
| "mean_token_accuracy": 0.8408558666706085, |
| "num_tokens": 37714.0, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.1532567049808429, |
| "grad_norm": 0.6860374808311462, |
| "learning_rate": 0.00018976109215017067, |
| "loss": 0.7623, |
| "mean_token_accuracy": 0.8656536340713501, |
| "num_tokens": 42429.0, |
| "step": 45 |
| }, |
| { |
| "epoch": 0.17028522775649213, |
| "grad_norm": 0.7284501791000366, |
| "learning_rate": 0.00018862343572241183, |
| "loss": 0.7588, |
| "mean_token_accuracy": 0.8688850715756417, |
| "num_tokens": 47099.0, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.18731375053214133, |
| "grad_norm": 0.8899862170219421, |
| "learning_rate": 0.00018748577929465302, |
| "loss": 0.7065, |
| "mean_token_accuracy": 0.8717748820781708, |
| "num_tokens": 51795.0, |
| "step": 55 |
| }, |
| { |
| "epoch": 0.20434227330779056, |
| "grad_norm": 0.5350505709648132, |
| "learning_rate": 0.0001863481228668942, |
| "loss": 0.6696, |
| "mean_token_accuracy": 0.8851396456360817, |
| "num_tokens": 56369.0, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.22137079608343976, |
| "grad_norm": 0.6087013483047485, |
| "learning_rate": 0.0001852104664391354, |
| "loss": 0.7204, |
| "mean_token_accuracy": 0.8682332798838616, |
| "num_tokens": 61018.0, |
| "step": 65 |
| }, |
| { |
| "epoch": 0.23839931885908897, |
| "grad_norm": 0.7879019379615784, |
| "learning_rate": 0.00018407281001137657, |
| "loss": 0.7692, |
| "mean_token_accuracy": 0.8653983056545258, |
| "num_tokens": 65741.0, |
| "step": 70 |
| }, |
| { |
| "epoch": 0.2554278416347382, |
| "grad_norm": 0.6546444296836853, |
| "learning_rate": 0.00018293515358361776, |
| "loss": 0.7119, |
| "mean_token_accuracy": 0.8726310178637504, |
| "num_tokens": 70425.0, |
| "step": 75 |
| }, |
| { |
| "epoch": 0.2724563644103874, |
| "grad_norm": 0.770902156829834, |
| "learning_rate": 0.00018179749715585894, |
| "loss": 0.7035, |
| "mean_token_accuracy": 0.8711811751127243, |
| "num_tokens": 75101.0, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.2894848871860366, |
| "grad_norm": 0.8873187899589539, |
| "learning_rate": 0.00018065984072810013, |
| "loss": 0.7419, |
| "mean_token_accuracy": 0.8616803497076034, |
| "num_tokens": 79888.0, |
| "step": 85 |
| }, |
| { |
| "epoch": 0.3065134099616858, |
| "grad_norm": 0.7061370015144348, |
| "learning_rate": 0.0001795221843003413, |
| "loss": 0.66, |
| "mean_token_accuracy": 0.8744896531105042, |
| "num_tokens": 84562.0, |
| "step": 90 |
| }, |
| { |
| "epoch": 0.32354193273733506, |
| "grad_norm": 0.8232033252716064, |
| "learning_rate": 0.0001783845278725825, |
| "loss": 0.7403, |
| "mean_token_accuracy": 0.8659066379070282, |
| "num_tokens": 89238.0, |
| "step": 95 |
| }, |
| { |
| "epoch": 0.34057045551298426, |
| "grad_norm": 0.7313310503959656, |
| "learning_rate": 0.00017724687144482368, |
| "loss": 0.7157, |
| "mean_token_accuracy": 0.8661555901169777, |
| "num_tokens": 93987.0, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.35759897828863346, |
| "grad_norm": 0.7119390964508057, |
| "learning_rate": 0.00017610921501706487, |
| "loss": 0.7016, |
| "mean_token_accuracy": 0.8678551658987999, |
| "num_tokens": 98722.0, |
| "step": 105 |
| }, |
| { |
| "epoch": 0.37462750106428266, |
| "grad_norm": 0.7126006484031677, |
| "learning_rate": 0.00017497155858930602, |
| "loss": 0.7009, |
| "mean_token_accuracy": 0.867291408777237, |
| "num_tokens": 103439.0, |
| "step": 110 |
| }, |
| { |
| "epoch": 0.39165602383993187, |
| "grad_norm": 0.6158230304718018, |
| "learning_rate": 0.00017383390216154724, |
| "loss": 0.7236, |
| "mean_token_accuracy": 0.8636128515005111, |
| "num_tokens": 108209.0, |
| "step": 115 |
| }, |
| { |
| "epoch": 0.4086845466155811, |
| "grad_norm": 0.6498322486877441, |
| "learning_rate": 0.0001726962457337884, |
| "loss": 0.6813, |
| "mean_token_accuracy": 0.8757071048021317, |
| "num_tokens": 112855.0, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.4257130693912303, |
| "grad_norm": 0.6594287157058716, |
| "learning_rate": 0.0001715585893060296, |
| "loss": 0.7062, |
| "mean_token_accuracy": 0.8650311172008515, |
| "num_tokens": 117653.0, |
| "step": 125 |
| }, |
| { |
| "epoch": 0.4427415921668795, |
| "grad_norm": 0.7375237941741943, |
| "learning_rate": 0.00017042093287827076, |
| "loss": 0.6477, |
| "mean_token_accuracy": 0.8733970731496811, |
| "num_tokens": 122397.0, |
| "step": 130 |
| }, |
| { |
| "epoch": 0.45977011494252873, |
| "grad_norm": 0.5958442687988281, |
| "learning_rate": 0.00016928327645051198, |
| "loss": 0.691, |
| "mean_token_accuracy": 0.8681387722492218, |
| "num_tokens": 127136.0, |
| "step": 135 |
| }, |
| { |
| "epoch": 0.47679863771817793, |
| "grad_norm": 0.7407785654067993, |
| "learning_rate": 0.00016814562002275313, |
| "loss": 0.6477, |
| "mean_token_accuracy": 0.8752307429909706, |
| "num_tokens": 131833.0, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.49382716049382713, |
| "grad_norm": 0.8190199732780457, |
| "learning_rate": 0.00016700796359499432, |
| "loss": 0.6608, |
| "mean_token_accuracy": 0.8762851104140281, |
| "num_tokens": 136441.0, |
| "step": 145 |
| }, |
| { |
| "epoch": 0.5108556832694764, |
| "grad_norm": 0.7571837306022644, |
| "learning_rate": 0.0001658703071672355, |
| "loss": 0.673, |
| "mean_token_accuracy": 0.8691665843129158, |
| "num_tokens": 141186.0, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.5278842060451255, |
| "grad_norm": 0.6653426885604858, |
| "learning_rate": 0.0001647326507394767, |
| "loss": 0.7126, |
| "mean_token_accuracy": 0.8647830635309219, |
| "num_tokens": 145971.0, |
| "step": 155 |
| }, |
| { |
| "epoch": 0.5449127288207748, |
| "grad_norm": 0.7333567142486572, |
| "learning_rate": 0.00016359499431171787, |
| "loss": 0.6287, |
| "mean_token_accuracy": 0.878324082493782, |
| "num_tokens": 150669.0, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.561941251596424, |
| "grad_norm": 0.8214460015296936, |
| "learning_rate": 0.00016245733788395906, |
| "loss": 0.6608, |
| "mean_token_accuracy": 0.8729922890663147, |
| "num_tokens": 155374.0, |
| "step": 165 |
| }, |
| { |
| "epoch": 0.5789697743720732, |
| "grad_norm": 0.6251844167709351, |
| "learning_rate": 0.00016131968145620024, |
| "loss": 0.6556, |
| "mean_token_accuracy": 0.8770609870553017, |
| "num_tokens": 160068.0, |
| "step": 170 |
| }, |
| { |
| "epoch": 0.5959982971477225, |
| "grad_norm": 0.804166853427887, |
| "learning_rate": 0.00016018202502844143, |
| "loss": 0.6366, |
| "mean_token_accuracy": 0.8760894432663917, |
| "num_tokens": 164696.0, |
| "step": 175 |
| }, |
| { |
| "epoch": 0.6130268199233716, |
| "grad_norm": 0.7013877034187317, |
| "learning_rate": 0.0001590443686006826, |
| "loss": 0.6328, |
| "mean_token_accuracy": 0.8779815405607223, |
| "num_tokens": 169356.0, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.6300553426990209, |
| "grad_norm": 1.0623070001602173, |
| "learning_rate": 0.0001579067121729238, |
| "loss": 0.6734, |
| "mean_token_accuracy": 0.8710577815771103, |
| "num_tokens": 174041.0, |
| "step": 185 |
| }, |
| { |
| "epoch": 0.6470838654746701, |
| "grad_norm": 0.7858535647392273, |
| "learning_rate": 0.00015676905574516496, |
| "loss": 0.6775, |
| "mean_token_accuracy": 0.8692880481481552, |
| "num_tokens": 178858.0, |
| "step": 190 |
| }, |
| { |
| "epoch": 0.6641123882503193, |
| "grad_norm": 0.8943309187889099, |
| "learning_rate": 0.00015563139931740617, |
| "loss": 0.6874, |
| "mean_token_accuracy": 0.868885512650013, |
| "num_tokens": 183669.0, |
| "step": 195 |
| }, |
| { |
| "epoch": 0.6811409110259685, |
| "grad_norm": 0.5898745656013489, |
| "learning_rate": 0.00015449374288964733, |
| "loss": 0.6907, |
| "mean_token_accuracy": 0.8661940798163414, |
| "num_tokens": 188473.0, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.6981694338016177, |
| "grad_norm": 0.6333857774734497, |
| "learning_rate": 0.00015335608646188854, |
| "loss": 0.6129, |
| "mean_token_accuracy": 0.8817986205220223, |
| "num_tokens": 193171.0, |
| "step": 205 |
| }, |
| { |
| "epoch": 0.7151979565772669, |
| "grad_norm": 0.5913947820663452, |
| "learning_rate": 0.0001522184300341297, |
| "loss": 0.5896, |
| "mean_token_accuracy": 0.8822762459516525, |
| "num_tokens": 197817.0, |
| "step": 210 |
| }, |
| { |
| "epoch": 0.7322264793529162, |
| "grad_norm": 0.6990242004394531, |
| "learning_rate": 0.00015108077360637088, |
| "loss": 0.6512, |
| "mean_token_accuracy": 0.8739180400967598, |
| "num_tokens": 202556.0, |
| "step": 215 |
| }, |
| { |
| "epoch": 0.7492550021285653, |
| "grad_norm": 0.6869048476219177, |
| "learning_rate": 0.00014994311717861207, |
| "loss": 0.7025, |
| "mean_token_accuracy": 0.8662877783179284, |
| "num_tokens": 207294.0, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.7662835249042146, |
| "grad_norm": 0.5135166049003601, |
| "learning_rate": 0.00014880546075085325, |
| "loss": 0.6382, |
| "mean_token_accuracy": 0.8849207311868668, |
| "num_tokens": 211927.0, |
| "step": 225 |
| }, |
| { |
| "epoch": 0.7833120476798637, |
| "grad_norm": 0.6304216980934143, |
| "learning_rate": 0.00014766780432309444, |
| "loss": 0.6834, |
| "mean_token_accuracy": 0.8688049465417862, |
| "num_tokens": 216626.0, |
| "step": 230 |
| }, |
| { |
| "epoch": 0.800340570455513, |
| "grad_norm": 0.6879922151565552, |
| "learning_rate": 0.00014653014789533562, |
| "loss": 0.6902, |
| "mean_token_accuracy": 0.8655798360705376, |
| "num_tokens": 221432.0, |
| "step": 235 |
| }, |
| { |
| "epoch": 0.8173690932311622, |
| "grad_norm": 0.6433548331260681, |
| "learning_rate": 0.0001453924914675768, |
| "loss": 0.6129, |
| "mean_token_accuracy": 0.8795880794525146, |
| "num_tokens": 226022.0, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.8343976160068114, |
| "grad_norm": 0.7876724600791931, |
| "learning_rate": 0.000144254835039818, |
| "loss": 0.6441, |
| "mean_token_accuracy": 0.8729524433612823, |
| "num_tokens": 230692.0, |
| "step": 245 |
| }, |
| { |
| "epoch": 0.8514261387824607, |
| "grad_norm": 0.6494749188423157, |
| "learning_rate": 0.00014311717861205915, |
| "loss": 0.7033, |
| "mean_token_accuracy": 0.8632469072937965, |
| "num_tokens": 235400.0, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.8684546615581098, |
| "grad_norm": 0.6332300305366516, |
| "learning_rate": 0.00014197952218430036, |
| "loss": 0.5947, |
| "mean_token_accuracy": 0.8860528379678726, |
| "num_tokens": 239997.0, |
| "step": 255 |
| }, |
| { |
| "epoch": 0.885483184333759, |
| "grad_norm": 0.7144895195960999, |
| "learning_rate": 0.00014084186575654152, |
| "loss": 0.649, |
| "mean_token_accuracy": 0.8745664536952973, |
| "num_tokens": 244704.0, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.9025117071094083, |
| "grad_norm": 0.5460124015808105, |
| "learning_rate": 0.00013970420932878273, |
| "loss": 0.6622, |
| "mean_token_accuracy": 0.8692788198590279, |
| "num_tokens": 249428.0, |
| "step": 265 |
| }, |
| { |
| "epoch": 0.9195402298850575, |
| "grad_norm": 0.65619295835495, |
| "learning_rate": 0.0001385665529010239, |
| "loss": 0.657, |
| "mean_token_accuracy": 0.8737826406955719, |
| "num_tokens": 254150.0, |
| "step": 270 |
| }, |
| { |
| "epoch": 0.9365687526607067, |
| "grad_norm": 0.8474870324134827, |
| "learning_rate": 0.0001374288964732651, |
| "loss": 0.6607, |
| "mean_token_accuracy": 0.8756056800484657, |
| "num_tokens": 258826.0, |
| "step": 275 |
| }, |
| { |
| "epoch": 0.9535972754363559, |
| "grad_norm": 0.6054229736328125, |
| "learning_rate": 0.00013629124004550626, |
| "loss": 0.6526, |
| "mean_token_accuracy": 0.8718441724777222, |
| "num_tokens": 263524.0, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.9706257982120051, |
| "grad_norm": 0.6568702459335327, |
| "learning_rate": 0.00013515358361774744, |
| "loss": 0.6174, |
| "mean_token_accuracy": 0.881709736585617, |
| "num_tokens": 268179.0, |
| "step": 285 |
| }, |
| { |
| "epoch": 0.9876543209876543, |
| "grad_norm": 0.7518045902252197, |
| "learning_rate": 0.00013401592718998863, |
| "loss": 0.5896, |
| "mean_token_accuracy": 0.885109031200409, |
| "num_tokens": 272803.0, |
| "step": 290 |
| }, |
| { |
| "epoch": 1.0046828437633035, |
| "grad_norm": 0.5392197370529175, |
| "learning_rate": 0.00013287827076222981, |
| "loss": 0.6753, |
| "mean_token_accuracy": 0.8788385137915611, |
| "num_tokens": 277527.0, |
| "step": 295 |
| }, |
| { |
| "epoch": 1.0217113665389528, |
| "grad_norm": 0.5845906734466553, |
| "learning_rate": 0.000131740614334471, |
| "loss": 0.5237, |
| "mean_token_accuracy": 0.8938747227191925, |
| "num_tokens": 282199.0, |
| "step": 300 |
| }, |
| { |
| "epoch": 1.038739889314602, |
| "grad_norm": 0.6392928957939148, |
| "learning_rate": 0.00013060295790671218, |
| "loss": 0.4973, |
| "mean_token_accuracy": 0.8982622623443604, |
| "num_tokens": 286951.0, |
| "step": 305 |
| }, |
| { |
| "epoch": 1.055768412090251, |
| "grad_norm": 0.5399300456047058, |
| "learning_rate": 0.00012946530147895337, |
| "loss": 0.5076, |
| "mean_token_accuracy": 0.9008002370595932, |
| "num_tokens": 291569.0, |
| "step": 310 |
| }, |
| { |
| "epoch": 1.0727969348659003, |
| "grad_norm": 0.6236026883125305, |
| "learning_rate": 0.00012832764505119455, |
| "loss": 0.5084, |
| "mean_token_accuracy": 0.8972577184438706, |
| "num_tokens": 296230.0, |
| "step": 315 |
| }, |
| { |
| "epoch": 1.0898254576415496, |
| "grad_norm": 0.7385813593864441, |
| "learning_rate": 0.0001271899886234357, |
| "loss": 0.5062, |
| "mean_token_accuracy": 0.8956585437059402, |
| "num_tokens": 301029.0, |
| "step": 320 |
| }, |
| { |
| "epoch": 1.1068539804171988, |
| "grad_norm": 0.7647150754928589, |
| "learning_rate": 0.00012605233219567692, |
| "loss": 0.5078, |
| "mean_token_accuracy": 0.8982979074120522, |
| "num_tokens": 305696.0, |
| "step": 325 |
| }, |
| { |
| "epoch": 1.123882503192848, |
| "grad_norm": 0.6433872580528259, |
| "learning_rate": 0.00012491467576791808, |
| "loss": 0.5215, |
| "mean_token_accuracy": 0.8974734947085381, |
| "num_tokens": 310343.0, |
| "step": 330 |
| }, |
| { |
| "epoch": 1.1409110259684971, |
| "grad_norm": 0.6470033526420593, |
| "learning_rate": 0.0001237770193401593, |
| "loss": 0.5261, |
| "mean_token_accuracy": 0.8938129872083664, |
| "num_tokens": 315097.0, |
| "step": 335 |
| }, |
| { |
| "epoch": 1.1579395487441464, |
| "grad_norm": 0.6738846302032471, |
| "learning_rate": 0.00012263936291240045, |
| "loss": 0.5277, |
| "mean_token_accuracy": 0.8924461513757705, |
| "num_tokens": 319861.0, |
| "step": 340 |
| }, |
| { |
| "epoch": 1.1749680715197957, |
| "grad_norm": 0.6639145016670227, |
| "learning_rate": 0.00012150170648464165, |
| "loss": 0.5127, |
| "mean_token_accuracy": 0.8926685571670532, |
| "num_tokens": 324544.0, |
| "step": 345 |
| }, |
| { |
| "epoch": 1.191996594295445, |
| "grad_norm": 0.7034420371055603, |
| "learning_rate": 0.00012036405005688282, |
| "loss": 0.51, |
| "mean_token_accuracy": 0.8971043467521668, |
| "num_tokens": 329302.0, |
| "step": 350 |
| }, |
| { |
| "epoch": 1.2090251170710942, |
| "grad_norm": 0.6675500273704529, |
| "learning_rate": 0.000119226393629124, |
| "loss": 0.5738, |
| "mean_token_accuracy": 0.8855719327926636, |
| "num_tokens": 334103.0, |
| "step": 355 |
| }, |
| { |
| "epoch": 1.2260536398467432, |
| "grad_norm": 0.6019395589828491, |
| "learning_rate": 0.00011808873720136519, |
| "loss": 0.476, |
| "mean_token_accuracy": 0.8989460453391075, |
| "num_tokens": 338666.0, |
| "step": 360 |
| }, |
| { |
| "epoch": 1.2430821626223925, |
| "grad_norm": 0.6599250435829163, |
| "learning_rate": 0.00011695108077360638, |
| "loss": 0.5178, |
| "mean_token_accuracy": 0.8887226998805999, |
| "num_tokens": 343333.0, |
| "step": 365 |
| }, |
| { |
| "epoch": 1.2601106853980417, |
| "grad_norm": 0.7334213852882385, |
| "learning_rate": 0.00011581342434584756, |
| "loss": 0.5378, |
| "mean_token_accuracy": 0.8895460113883018, |
| "num_tokens": 348092.0, |
| "step": 370 |
| }, |
| { |
| "epoch": 1.277139208173691, |
| "grad_norm": 0.7423357963562012, |
| "learning_rate": 0.00011467576791808873, |
| "loss": 0.5012, |
| "mean_token_accuracy": 0.8994292929768563, |
| "num_tokens": 352661.0, |
| "step": 375 |
| }, |
| { |
| "epoch": 1.29416773094934, |
| "grad_norm": 0.857515811920166, |
| "learning_rate": 0.00011353811149032993, |
| "loss": 0.507, |
| "mean_token_accuracy": 0.8979884222149849, |
| "num_tokens": 357330.0, |
| "step": 380 |
| }, |
| { |
| "epoch": 1.3111962537249893, |
| "grad_norm": 0.5656803250312805, |
| "learning_rate": 0.0001124004550625711, |
| "loss": 0.5009, |
| "mean_token_accuracy": 0.8934224143624305, |
| "num_tokens": 362020.0, |
| "step": 385 |
| }, |
| { |
| "epoch": 1.3282247765006385, |
| "grad_norm": 0.6634964942932129, |
| "learning_rate": 0.00011126279863481229, |
| "loss": 0.5414, |
| "mean_token_accuracy": 0.8910330131649971, |
| "num_tokens": 366728.0, |
| "step": 390 |
| }, |
| { |
| "epoch": 1.3452532992762878, |
| "grad_norm": 0.7004157304763794, |
| "learning_rate": 0.00011012514220705347, |
| "loss": 0.4922, |
| "mean_token_accuracy": 0.8992783546447753, |
| "num_tokens": 371381.0, |
| "step": 395 |
| }, |
| { |
| "epoch": 1.362281822051937, |
| "grad_norm": 0.6225594282150269, |
| "learning_rate": 0.00010898748577929466, |
| "loss": 0.5084, |
| "mean_token_accuracy": 0.8956901535391808, |
| "num_tokens": 376043.0, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.3793103448275863, |
| "grad_norm": 0.8019647598266602, |
| "learning_rate": 0.00010784982935153584, |
| "loss": 0.5303, |
| "mean_token_accuracy": 0.8940754950046539, |
| "num_tokens": 380714.0, |
| "step": 405 |
| }, |
| { |
| "epoch": 1.3963388676032356, |
| "grad_norm": 0.8314201831817627, |
| "learning_rate": 0.00010671217292377703, |
| "loss": 0.5249, |
| "mean_token_accuracy": 0.8924115225672722, |
| "num_tokens": 385498.0, |
| "step": 410 |
| }, |
| { |
| "epoch": 1.4133673903788846, |
| "grad_norm": 0.6691393256187439, |
| "learning_rate": 0.00010557451649601821, |
| "loss": 0.4817, |
| "mean_token_accuracy": 0.89882483035326, |
| "num_tokens": 390179.0, |
| "step": 415 |
| }, |
| { |
| "epoch": 1.4303959131545338, |
| "grad_norm": 0.8554338216781616, |
| "learning_rate": 0.00010443686006825938, |
| "loss": 0.5191, |
| "mean_token_accuracy": 0.8876234069466591, |
| "num_tokens": 394930.0, |
| "step": 420 |
| }, |
| { |
| "epoch": 1.447424435930183, |
| "grad_norm": 0.696018636226654, |
| "learning_rate": 0.00010329920364050057, |
| "loss": 0.5386, |
| "mean_token_accuracy": 0.891503955423832, |
| "num_tokens": 399685.0, |
| "step": 425 |
| }, |
| { |
| "epoch": 1.4644529587058321, |
| "grad_norm": 0.7389529943466187, |
| "learning_rate": 0.00010216154721274175, |
| "loss": 0.4949, |
| "mean_token_accuracy": 0.9004919424653053, |
| "num_tokens": 404300.0, |
| "step": 430 |
| }, |
| { |
| "epoch": 1.4814814814814814, |
| "grad_norm": 1.0227491855621338, |
| "learning_rate": 0.00010102389078498294, |
| "loss": 0.54, |
| "mean_token_accuracy": 0.8893611416220665, |
| "num_tokens": 409079.0, |
| "step": 435 |
| }, |
| { |
| "epoch": 1.4985100042571307, |
| "grad_norm": 0.6526888012886047, |
| "learning_rate": 9.988623435722412e-05, |
| "loss": 0.4917, |
| "mean_token_accuracy": 0.8958082437515259, |
| "num_tokens": 413758.0, |
| "step": 440 |
| }, |
| { |
| "epoch": 1.51553852703278, |
| "grad_norm": 0.5875766277313232, |
| "learning_rate": 9.874857792946531e-05, |
| "loss": 0.4991, |
| "mean_token_accuracy": 0.8971148490905761, |
| "num_tokens": 418502.0, |
| "step": 445 |
| }, |
| { |
| "epoch": 1.5325670498084292, |
| "grad_norm": 0.6892980337142944, |
| "learning_rate": 9.761092150170649e-05, |
| "loss": 0.4551, |
| "mean_token_accuracy": 0.9068983420729637, |
| "num_tokens": 423099.0, |
| "step": 450 |
| }, |
| { |
| "epoch": 1.5495955725840784, |
| "grad_norm": 0.6264586448669434, |
| "learning_rate": 9.647326507394768e-05, |
| "loss": 0.468, |
| "mean_token_accuracy": 0.9043048679828644, |
| "num_tokens": 427701.0, |
| "step": 455 |
| }, |
| { |
| "epoch": 1.5666240953597277, |
| "grad_norm": 0.5398015379905701, |
| "learning_rate": 9.533560864618886e-05, |
| "loss": 0.4877, |
| "mean_token_accuracy": 0.8986729174852371, |
| "num_tokens": 432430.0, |
| "step": 460 |
| }, |
| { |
| "epoch": 1.5836526181353767, |
| "grad_norm": 0.827769935131073, |
| "learning_rate": 9.419795221843003e-05, |
| "loss": 0.4951, |
| "mean_token_accuracy": 0.9012611672282219, |
| "num_tokens": 437078.0, |
| "step": 465 |
| }, |
| { |
| "epoch": 1.600681140911026, |
| "grad_norm": 0.6888080835342407, |
| "learning_rate": 9.306029579067122e-05, |
| "loss": 0.5108, |
| "mean_token_accuracy": 0.8976602256298065, |
| "num_tokens": 441734.0, |
| "step": 470 |
| }, |
| { |
| "epoch": 1.617709663686675, |
| "grad_norm": 0.837681233882904, |
| "learning_rate": 9.19226393629124e-05, |
| "loss": 0.5377, |
| "mean_token_accuracy": 0.8850761532783509, |
| "num_tokens": 446637.0, |
| "step": 475 |
| }, |
| { |
| "epoch": 1.6347381864623243, |
| "grad_norm": 0.7211363315582275, |
| "learning_rate": 9.078498293515359e-05, |
| "loss": 0.5001, |
| "mean_token_accuracy": 0.898733913898468, |
| "num_tokens": 451301.0, |
| "step": 480 |
| }, |
| { |
| "epoch": 1.6517667092379735, |
| "grad_norm": 0.6663438081741333, |
| "learning_rate": 8.964732650739477e-05, |
| "loss": 0.5144, |
| "mean_token_accuracy": 0.8976200923323632, |
| "num_tokens": 455965.0, |
| "step": 485 |
| }, |
| { |
| "epoch": 1.6687952320136228, |
| "grad_norm": 0.8935639262199402, |
| "learning_rate": 8.850967007963596e-05, |
| "loss": 0.5331, |
| "mean_token_accuracy": 0.8960411131381989, |
| "num_tokens": 460716.0, |
| "step": 490 |
| }, |
| { |
| "epoch": 1.685823754789272, |
| "grad_norm": 0.7235546708106995, |
| "learning_rate": 8.737201365187714e-05, |
| "loss": 0.4831, |
| "mean_token_accuracy": 0.8972082689404488, |
| "num_tokens": 465370.0, |
| "step": 495 |
| }, |
| { |
| "epoch": 1.7028522775649213, |
| "grad_norm": 0.774000346660614, |
| "learning_rate": 8.623435722411833e-05, |
| "loss": 0.5186, |
| "mean_token_accuracy": 0.8950631290674209, |
| "num_tokens": 470043.0, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.7198808003405706, |
| "grad_norm": 0.5213722586631775, |
| "learning_rate": 8.509670079635951e-05, |
| "loss": 0.4567, |
| "mean_token_accuracy": 0.9016156733036041, |
| "num_tokens": 474573.0, |
| "step": 505 |
| }, |
| { |
| "epoch": 1.7369093231162198, |
| "grad_norm": 0.7278684377670288, |
| "learning_rate": 8.395904436860069e-05, |
| "loss": 0.5545, |
| "mean_token_accuracy": 0.8925162181258202, |
| "num_tokens": 479305.0, |
| "step": 510 |
| }, |
| { |
| "epoch": 1.7539378458918689, |
| "grad_norm": 0.7252481579780579, |
| "learning_rate": 8.282138794084187e-05, |
| "loss": 0.496, |
| "mean_token_accuracy": 0.8953201442956924, |
| "num_tokens": 484033.0, |
| "step": 515 |
| }, |
| { |
| "epoch": 1.770966368667518, |
| "grad_norm": 0.727513313293457, |
| "learning_rate": 8.168373151308306e-05, |
| "loss": 0.5033, |
| "mean_token_accuracy": 0.8998701125383377, |
| "num_tokens": 488727.0, |
| "step": 520 |
| }, |
| { |
| "epoch": 1.7879948914431671, |
| "grad_norm": 0.5375337600708008, |
| "learning_rate": 8.054607508532424e-05, |
| "loss": 0.4903, |
| "mean_token_accuracy": 0.8960629358887673, |
| "num_tokens": 493411.0, |
| "step": 525 |
| }, |
| { |
| "epoch": 1.8050234142188164, |
| "grad_norm": 0.5851954221725464, |
| "learning_rate": 7.940841865756543e-05, |
| "loss": 0.5139, |
| "mean_token_accuracy": 0.8972602248191833, |
| "num_tokens": 498098.0, |
| "step": 530 |
| }, |
| { |
| "epoch": 1.8220519369944657, |
| "grad_norm": 0.6942209005355835, |
| "learning_rate": 7.827076222980661e-05, |
| "loss": 0.4728, |
| "mean_token_accuracy": 0.9009919315576553, |
| "num_tokens": 502717.0, |
| "step": 535 |
| }, |
| { |
| "epoch": 1.839080459770115, |
| "grad_norm": 0.9342221021652222, |
| "learning_rate": 7.71331058020478e-05, |
| "loss": 0.5283, |
| "mean_token_accuracy": 0.8924958631396294, |
| "num_tokens": 507462.0, |
| "step": 540 |
| }, |
| { |
| "epoch": 1.8561089825457642, |
| "grad_norm": 0.7415278553962708, |
| "learning_rate": 7.599544937428897e-05, |
| "loss": 0.5394, |
| "mean_token_accuracy": 0.8913042590022087, |
| "num_tokens": 512202.0, |
| "step": 545 |
| }, |
| { |
| "epoch": 1.8731375053214134, |
| "grad_norm": 0.7223448157310486, |
| "learning_rate": 7.485779294653015e-05, |
| "loss": 0.5473, |
| "mean_token_accuracy": 0.8873603999614715, |
| "num_tokens": 517047.0, |
| "step": 550 |
| }, |
| { |
| "epoch": 1.8901660280970627, |
| "grad_norm": 0.6324387192726135, |
| "learning_rate": 7.372013651877134e-05, |
| "loss": 0.4986, |
| "mean_token_accuracy": 0.9018153563141823, |
| "num_tokens": 521653.0, |
| "step": 555 |
| }, |
| { |
| "epoch": 1.907194550872712, |
| "grad_norm": 0.6177689433097839, |
| "learning_rate": 7.258248009101252e-05, |
| "loss": 0.5242, |
| "mean_token_accuracy": 0.8907949879765511, |
| "num_tokens": 526387.0, |
| "step": 560 |
| }, |
| { |
| "epoch": 1.924223073648361, |
| "grad_norm": 0.6327561140060425, |
| "learning_rate": 7.14448236632537e-05, |
| "loss": 0.4725, |
| "mean_token_accuracy": 0.9006670027971267, |
| "num_tokens": 531113.0, |
| "step": 565 |
| }, |
| { |
| "epoch": 1.9412515964240102, |
| "grad_norm": 0.6829894781112671, |
| "learning_rate": 7.030716723549489e-05, |
| "loss": 0.5255, |
| "mean_token_accuracy": 0.8897917374968529, |
| "num_tokens": 535963.0, |
| "step": 570 |
| }, |
| { |
| "epoch": 1.9582801191996593, |
| "grad_norm": 0.7764301896095276, |
| "learning_rate": 6.916951080773608e-05, |
| "loss": 0.5636, |
| "mean_token_accuracy": 0.8877105817198754, |
| "num_tokens": 540801.0, |
| "step": 575 |
| }, |
| { |
| "epoch": 1.9753086419753085, |
| "grad_norm": 0.7201740741729736, |
| "learning_rate": 6.803185437997726e-05, |
| "loss": 0.5279, |
| "mean_token_accuracy": 0.8954470381140709, |
| "num_tokens": 545507.0, |
| "step": 580 |
| }, |
| { |
| "epoch": 1.9923371647509578, |
| "grad_norm": 0.6038010716438293, |
| "learning_rate": 6.689419795221843e-05, |
| "loss": 0.505, |
| "mean_token_accuracy": 0.8970827981829643, |
| "num_tokens": 550257.0, |
| "step": 585 |
| }, |
| { |
| "epoch": 2.009365687526607, |
| "grad_norm": 0.5724640488624573, |
| "learning_rate": 6.575654152445962e-05, |
| "loss": 0.5361, |
| "mean_token_accuracy": 0.9015150561928749, |
| "num_tokens": 554990.0, |
| "step": 590 |
| }, |
| { |
| "epoch": 2.0263942103022563, |
| "grad_norm": 0.5974262952804565, |
| "learning_rate": 6.46188850967008e-05, |
| "loss": 0.3674, |
| "mean_token_accuracy": 0.922430993616581, |
| "num_tokens": 559672.0, |
| "step": 595 |
| }, |
| { |
| "epoch": 2.0434227330779056, |
| "grad_norm": 0.6744574904441833, |
| "learning_rate": 6.348122866894199e-05, |
| "loss": 0.3751, |
| "mean_token_accuracy": 0.9247258752584457, |
| "num_tokens": 564411.0, |
| "step": 600 |
| }, |
| { |
| "epoch": 2.060451255853555, |
| "grad_norm": 0.7185547351837158, |
| "learning_rate": 6.234357224118317e-05, |
| "loss": 0.3416, |
| "mean_token_accuracy": 0.929543960094452, |
| "num_tokens": 569003.0, |
| "step": 605 |
| }, |
| { |
| "epoch": 2.077479778629204, |
| "grad_norm": 0.5838123559951782, |
| "learning_rate": 6.120591581342436e-05, |
| "loss": 0.3537, |
| "mean_token_accuracy": 0.930443874001503, |
| "num_tokens": 573739.0, |
| "step": 610 |
| }, |
| { |
| "epoch": 2.0945083014048533, |
| "grad_norm": 0.8568351864814758, |
| "learning_rate": 6.0068259385665536e-05, |
| "loss": 0.3784, |
| "mean_token_accuracy": 0.9205309540033341, |
| "num_tokens": 578528.0, |
| "step": 615 |
| }, |
| { |
| "epoch": 2.111536824180502, |
| "grad_norm": 0.5337037444114685, |
| "learning_rate": 5.8930602957906714e-05, |
| "loss": 0.3617, |
| "mean_token_accuracy": 0.9245797485113144, |
| "num_tokens": 583227.0, |
| "step": 620 |
| }, |
| { |
| "epoch": 2.1285653469561514, |
| "grad_norm": 0.5879887938499451, |
| "learning_rate": 5.77929465301479e-05, |
| "loss": 0.3707, |
| "mean_token_accuracy": 0.9202131152153015, |
| "num_tokens": 587936.0, |
| "step": 625 |
| }, |
| { |
| "epoch": 2.1455938697318007, |
| "grad_norm": 0.6099004149436951, |
| "learning_rate": 5.665529010238908e-05, |
| "loss": 0.3774, |
| "mean_token_accuracy": 0.9187414139509201, |
| "num_tokens": 592638.0, |
| "step": 630 |
| }, |
| { |
| "epoch": 2.16262239250745, |
| "grad_norm": 0.6386281251907349, |
| "learning_rate": 5.551763367463026e-05, |
| "loss": 0.3618, |
| "mean_token_accuracy": 0.9270586878061294, |
| "num_tokens": 597181.0, |
| "step": 635 |
| }, |
| { |
| "epoch": 2.179650915283099, |
| "grad_norm": 0.9021700024604797, |
| "learning_rate": 5.437997724687145e-05, |
| "loss": 0.3585, |
| "mean_token_accuracy": 0.9271015107631684, |
| "num_tokens": 601859.0, |
| "step": 640 |
| }, |
| { |
| "epoch": 2.1966794380587484, |
| "grad_norm": 0.881395697593689, |
| "learning_rate": 5.324232081911263e-05, |
| "loss": 0.3557, |
| "mean_token_accuracy": 0.9272178143262864, |
| "num_tokens": 606633.0, |
| "step": 645 |
| }, |
| { |
| "epoch": 2.2137079608343977, |
| "grad_norm": 0.8289951086044312, |
| "learning_rate": 5.210466439135382e-05, |
| "loss": 0.3761, |
| "mean_token_accuracy": 0.9222683504223823, |
| "num_tokens": 611341.0, |
| "step": 650 |
| }, |
| { |
| "epoch": 2.230736483610047, |
| "grad_norm": 0.7716552019119263, |
| "learning_rate": 5.0967007963594995e-05, |
| "loss": 0.3806, |
| "mean_token_accuracy": 0.9193105801939965, |
| "num_tokens": 616076.0, |
| "step": 655 |
| }, |
| { |
| "epoch": 2.247765006385696, |
| "grad_norm": 0.7260558605194092, |
| "learning_rate": 4.982935153583618e-05, |
| "loss": 0.3641, |
| "mean_token_accuracy": 0.9221750542521476, |
| "num_tokens": 620729.0, |
| "step": 660 |
| }, |
| { |
| "epoch": 2.264793529161345, |
| "grad_norm": 0.6313159465789795, |
| "learning_rate": 4.8691695108077365e-05, |
| "loss": 0.3923, |
| "mean_token_accuracy": 0.9229970827698708, |
| "num_tokens": 625451.0, |
| "step": 665 |
| }, |
| { |
| "epoch": 2.2818220519369943, |
| "grad_norm": 0.6566217541694641, |
| "learning_rate": 4.755403868031855e-05, |
| "loss": 0.3404, |
| "mean_token_accuracy": 0.9257871210575104, |
| "num_tokens": 630049.0, |
| "step": 670 |
| }, |
| { |
| "epoch": 2.2988505747126435, |
| "grad_norm": 0.8146483302116394, |
| "learning_rate": 4.641638225255973e-05, |
| "loss": 0.3499, |
| "mean_token_accuracy": 0.9254049748182297, |
| "num_tokens": 634646.0, |
| "step": 675 |
| }, |
| { |
| "epoch": 2.315879097488293, |
| "grad_norm": 0.8177068829536438, |
| "learning_rate": 4.527872582480091e-05, |
| "loss": 0.3662, |
| "mean_token_accuracy": 0.9220140025019645, |
| "num_tokens": 639328.0, |
| "step": 680 |
| }, |
| { |
| "epoch": 2.332907620263942, |
| "grad_norm": 0.7193973660469055, |
| "learning_rate": 4.41410693970421e-05, |
| "loss": 0.3861, |
| "mean_token_accuracy": 0.9194135531783104, |
| "num_tokens": 644122.0, |
| "step": 685 |
| }, |
| { |
| "epoch": 2.3499361430395913, |
| "grad_norm": 0.8300774693489075, |
| "learning_rate": 4.300341296928328e-05, |
| "loss": 0.3924, |
| "mean_token_accuracy": 0.9165543273091317, |
| "num_tokens": 648957.0, |
| "step": 690 |
| }, |
| { |
| "epoch": 2.3669646658152406, |
| "grad_norm": 0.6429705023765564, |
| "learning_rate": 4.186575654152446e-05, |
| "loss": 0.3749, |
| "mean_token_accuracy": 0.922352360188961, |
| "num_tokens": 653645.0, |
| "step": 695 |
| }, |
| { |
| "epoch": 2.38399318859089, |
| "grad_norm": 0.9316811561584473, |
| "learning_rate": 4.0728100113765646e-05, |
| "loss": 0.3731, |
| "mean_token_accuracy": 0.9198509395122528, |
| "num_tokens": 658472.0, |
| "step": 700 |
| }, |
| { |
| "epoch": 2.401021711366539, |
| "grad_norm": 0.6092661023139954, |
| "learning_rate": 3.959044368600683e-05, |
| "loss": 0.3614, |
| "mean_token_accuracy": 0.9218982830643654, |
| "num_tokens": 663118.0, |
| "step": 705 |
| }, |
| { |
| "epoch": 2.4180502341421883, |
| "grad_norm": 0.909447968006134, |
| "learning_rate": 3.8452787258248016e-05, |
| "loss": 0.407, |
| "mean_token_accuracy": 0.9137230664491653, |
| "num_tokens": 668024.0, |
| "step": 710 |
| }, |
| { |
| "epoch": 2.4350787569178376, |
| "grad_norm": 0.6452695727348328, |
| "learning_rate": 3.7315130830489194e-05, |
| "loss": 0.3642, |
| "mean_token_accuracy": 0.9242654070258141, |
| "num_tokens": 672593.0, |
| "step": 715 |
| }, |
| { |
| "epoch": 2.4521072796934864, |
| "grad_norm": 0.7429100275039673, |
| "learning_rate": 3.617747440273038e-05, |
| "loss": 0.3762, |
| "mean_token_accuracy": 0.9200442656874657, |
| "num_tokens": 677246.0, |
| "step": 720 |
| }, |
| { |
| "epoch": 2.4691358024691357, |
| "grad_norm": 0.6262103319168091, |
| "learning_rate": 3.5039817974971564e-05, |
| "loss": 0.3631, |
| "mean_token_accuracy": 0.9242240786552429, |
| "num_tokens": 681899.0, |
| "step": 725 |
| }, |
| { |
| "epoch": 2.486164325244785, |
| "grad_norm": 0.7170459032058716, |
| "learning_rate": 3.390216154721274e-05, |
| "loss": 0.3518, |
| "mean_token_accuracy": 0.9257205232977868, |
| "num_tokens": 686559.0, |
| "step": 730 |
| }, |
| { |
| "epoch": 2.503192848020434, |
| "grad_norm": 0.7899272441864014, |
| "learning_rate": 3.276450511945393e-05, |
| "loss": 0.3408, |
| "mean_token_accuracy": 0.927695432305336, |
| "num_tokens": 691193.0, |
| "step": 735 |
| }, |
| { |
| "epoch": 2.5202213707960834, |
| "grad_norm": 0.8176191449165344, |
| "learning_rate": 3.162684869169511e-05, |
| "loss": 0.3554, |
| "mean_token_accuracy": 0.9244274586439133, |
| "num_tokens": 695862.0, |
| "step": 740 |
| }, |
| { |
| "epoch": 2.5372498935717327, |
| "grad_norm": 0.9307223558425903, |
| "learning_rate": 3.0489192263936294e-05, |
| "loss": 0.3762, |
| "mean_token_accuracy": 0.9196016103029251, |
| "num_tokens": 700732.0, |
| "step": 745 |
| }, |
| { |
| "epoch": 2.554278416347382, |
| "grad_norm": 0.7519947290420532, |
| "learning_rate": 2.9351535836177476e-05, |
| "loss": 0.37, |
| "mean_token_accuracy": 0.9214758723974228, |
| "num_tokens": 705428.0, |
| "step": 750 |
| }, |
| { |
| "epoch": 2.571306939123031, |
| "grad_norm": 0.7623237371444702, |
| "learning_rate": 2.8213879408418657e-05, |
| "loss": 0.3496, |
| "mean_token_accuracy": 0.9245725467801094, |
| "num_tokens": 710035.0, |
| "step": 755 |
| }, |
| { |
| "epoch": 2.58833546189868, |
| "grad_norm": 0.6571420431137085, |
| "learning_rate": 2.7076222980659842e-05, |
| "loss": 0.3662, |
| "mean_token_accuracy": 0.9226716786623002, |
| "num_tokens": 714753.0, |
| "step": 760 |
| }, |
| { |
| "epoch": 2.6053639846743293, |
| "grad_norm": 0.6745423078536987, |
| "learning_rate": 2.5938566552901024e-05, |
| "loss": 0.3672, |
| "mean_token_accuracy": 0.9193284913897515, |
| "num_tokens": 719410.0, |
| "step": 765 |
| }, |
| { |
| "epoch": 2.6223925074499785, |
| "grad_norm": 0.9500595927238464, |
| "learning_rate": 2.480091012514221e-05, |
| "loss": 0.3729, |
| "mean_token_accuracy": 0.9209223091602325, |
| "num_tokens": 724210.0, |
| "step": 770 |
| }, |
| { |
| "epoch": 2.639421030225628, |
| "grad_norm": 0.6964495182037354, |
| "learning_rate": 2.366325369738339e-05, |
| "loss": 0.3505, |
| "mean_token_accuracy": 0.9281451672315597, |
| "num_tokens": 728969.0, |
| "step": 775 |
| }, |
| { |
| "epoch": 2.656449553001277, |
| "grad_norm": 0.868914008140564, |
| "learning_rate": 2.2525597269624575e-05, |
| "loss": 0.3709, |
| "mean_token_accuracy": 0.9212313622236252, |
| "num_tokens": 733797.0, |
| "step": 780 |
| }, |
| { |
| "epoch": 2.6734780757769263, |
| "grad_norm": 0.7551370859146118, |
| "learning_rate": 2.138794084186576e-05, |
| "loss": 0.367, |
| "mean_token_accuracy": 0.9220638558268547, |
| "num_tokens": 738487.0, |
| "step": 785 |
| }, |
| { |
| "epoch": 2.6905065985525756, |
| "grad_norm": 0.7959733009338379, |
| "learning_rate": 2.025028441410694e-05, |
| "loss": 0.3634, |
| "mean_token_accuracy": 0.9227283328771592, |
| "num_tokens": 743145.0, |
| "step": 790 |
| }, |
| { |
| "epoch": 2.707535121328225, |
| "grad_norm": 0.8846186399459839, |
| "learning_rate": 1.9112627986348127e-05, |
| "loss": 0.3595, |
| "mean_token_accuracy": 0.9253345713019371, |
| "num_tokens": 747814.0, |
| "step": 795 |
| }, |
| { |
| "epoch": 2.724563644103874, |
| "grad_norm": 0.6306168437004089, |
| "learning_rate": 1.7974971558589308e-05, |
| "loss": 0.3507, |
| "mean_token_accuracy": 0.924257718026638, |
| "num_tokens": 752477.0, |
| "step": 800 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 879, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 200, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 3.4073066251935744e+16, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|