{ "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0434227330779056, "eval_steps": 500, "global_step": 600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.017028522775649212, "grad_norm": 6.522716999053955, "learning_rate": 0.0001988623435722412, "loss": 2.7211, "mean_token_accuracy": 0.5789041496813297, "num_tokens": 4727.0, "step": 5 }, { "epoch": 0.034057045551298425, "grad_norm": 1.0070050954818726, "learning_rate": 0.00019772468714448238, "loss": 0.9998, "mean_token_accuracy": 0.8499793156981468, "num_tokens": 9471.0, "step": 10 }, { "epoch": 0.05108556832694764, "grad_norm": 0.7373425960540771, "learning_rate": 0.00019658703071672356, "loss": 0.8303, "mean_token_accuracy": 0.8681916877627373, "num_tokens": 14013.0, "step": 15 }, { "epoch": 0.06811409110259685, "grad_norm": 0.8468236327171326, "learning_rate": 0.00019544937428896475, "loss": 0.8404, "mean_token_accuracy": 0.8622620105743408, "num_tokens": 18725.0, "step": 20 }, { "epoch": 0.08514261387824607, "grad_norm": 0.8178804516792297, "learning_rate": 0.00019431171786120593, "loss": 0.9073, "mean_token_accuracy": 0.8524447843432427, "num_tokens": 23497.0, "step": 25 }, { "epoch": 0.10217113665389528, "grad_norm": 0.890177309513092, "learning_rate": 0.00019317406143344712, "loss": 0.8029, "mean_token_accuracy": 0.8642359614372254, "num_tokens": 28192.0, "step": 30 }, { "epoch": 0.11919965942954448, "grad_norm": 1.0545469522476196, "learning_rate": 0.0001920364050056883, "loss": 0.7458, "mean_token_accuracy": 0.8732351213693619, "num_tokens": 32805.0, "step": 35 }, { "epoch": 0.1362281822051937, "grad_norm": 1.0384492874145508, "learning_rate": 0.00019089874857792946, "loss": 0.9235, "mean_token_accuracy": 0.8408558666706085, "num_tokens": 37714.0, "step": 40 }, { "epoch": 0.1532567049808429, "grad_norm": 0.6860374808311462, "learning_rate": 0.00018976109215017067, "loss": 0.7623, "mean_token_accuracy": 0.8656536340713501, "num_tokens": 42429.0, "step": 45 }, { "epoch": 0.17028522775649213, "grad_norm": 0.7284501791000366, "learning_rate": 0.00018862343572241183, "loss": 0.7588, "mean_token_accuracy": 0.8688850715756417, "num_tokens": 47099.0, "step": 50 }, { "epoch": 0.18731375053214133, "grad_norm": 0.8899862170219421, "learning_rate": 0.00018748577929465302, "loss": 0.7065, "mean_token_accuracy": 0.8717748820781708, "num_tokens": 51795.0, "step": 55 }, { "epoch": 0.20434227330779056, "grad_norm": 0.5350505709648132, "learning_rate": 0.0001863481228668942, "loss": 0.6696, "mean_token_accuracy": 0.8851396456360817, "num_tokens": 56369.0, "step": 60 }, { "epoch": 0.22137079608343976, "grad_norm": 0.6087013483047485, "learning_rate": 0.0001852104664391354, "loss": 0.7204, "mean_token_accuracy": 0.8682332798838616, "num_tokens": 61018.0, "step": 65 }, { "epoch": 0.23839931885908897, "grad_norm": 0.7879019379615784, "learning_rate": 0.00018407281001137657, "loss": 0.7692, "mean_token_accuracy": 0.8653983056545258, "num_tokens": 65741.0, "step": 70 }, { "epoch": 0.2554278416347382, "grad_norm": 0.6546444296836853, "learning_rate": 0.00018293515358361776, "loss": 0.7119, "mean_token_accuracy": 0.8726310178637504, "num_tokens": 70425.0, "step": 75 }, { "epoch": 0.2724563644103874, "grad_norm": 0.770902156829834, "learning_rate": 0.00018179749715585894, "loss": 0.7035, "mean_token_accuracy": 0.8711811751127243, "num_tokens": 75101.0, "step": 80 }, { "epoch": 0.2894848871860366, "grad_norm": 0.8873187899589539, "learning_rate": 0.00018065984072810013, "loss": 0.7419, "mean_token_accuracy": 0.8616803497076034, "num_tokens": 79888.0, "step": 85 }, { "epoch": 0.3065134099616858, "grad_norm": 0.7061370015144348, "learning_rate": 0.0001795221843003413, "loss": 0.66, "mean_token_accuracy": 0.8744896531105042, "num_tokens": 84562.0, "step": 90 }, { "epoch": 0.32354193273733506, "grad_norm": 0.8232033252716064, "learning_rate": 0.0001783845278725825, "loss": 0.7403, "mean_token_accuracy": 0.8659066379070282, "num_tokens": 89238.0, "step": 95 }, { "epoch": 0.34057045551298426, "grad_norm": 0.7313310503959656, "learning_rate": 0.00017724687144482368, "loss": 0.7157, "mean_token_accuracy": 0.8661555901169777, "num_tokens": 93987.0, "step": 100 }, { "epoch": 0.35759897828863346, "grad_norm": 0.7119390964508057, "learning_rate": 0.00017610921501706487, "loss": 0.7016, "mean_token_accuracy": 0.8678551658987999, "num_tokens": 98722.0, "step": 105 }, { "epoch": 0.37462750106428266, "grad_norm": 0.7126006484031677, "learning_rate": 0.00017497155858930602, "loss": 0.7009, "mean_token_accuracy": 0.867291408777237, "num_tokens": 103439.0, "step": 110 }, { "epoch": 0.39165602383993187, "grad_norm": 0.6158230304718018, "learning_rate": 0.00017383390216154724, "loss": 0.7236, "mean_token_accuracy": 0.8636128515005111, "num_tokens": 108209.0, "step": 115 }, { "epoch": 0.4086845466155811, "grad_norm": 0.6498322486877441, "learning_rate": 0.0001726962457337884, "loss": 0.6813, "mean_token_accuracy": 0.8757071048021317, "num_tokens": 112855.0, "step": 120 }, { "epoch": 0.4257130693912303, "grad_norm": 0.6594287157058716, "learning_rate": 0.0001715585893060296, "loss": 0.7062, "mean_token_accuracy": 0.8650311172008515, "num_tokens": 117653.0, "step": 125 }, { "epoch": 0.4427415921668795, "grad_norm": 0.7375237941741943, "learning_rate": 0.00017042093287827076, "loss": 0.6477, "mean_token_accuracy": 0.8733970731496811, "num_tokens": 122397.0, "step": 130 }, { "epoch": 0.45977011494252873, "grad_norm": 0.5958442687988281, "learning_rate": 0.00016928327645051198, "loss": 0.691, "mean_token_accuracy": 0.8681387722492218, "num_tokens": 127136.0, "step": 135 }, { "epoch": 0.47679863771817793, "grad_norm": 0.7407785654067993, "learning_rate": 0.00016814562002275313, "loss": 0.6477, "mean_token_accuracy": 0.8752307429909706, "num_tokens": 131833.0, "step": 140 }, { "epoch": 0.49382716049382713, "grad_norm": 0.8190199732780457, "learning_rate": 0.00016700796359499432, "loss": 0.6608, "mean_token_accuracy": 0.8762851104140281, "num_tokens": 136441.0, "step": 145 }, { "epoch": 0.5108556832694764, "grad_norm": 0.7571837306022644, "learning_rate": 0.0001658703071672355, "loss": 0.673, "mean_token_accuracy": 0.8691665843129158, "num_tokens": 141186.0, "step": 150 }, { "epoch": 0.5278842060451255, "grad_norm": 0.6653426885604858, "learning_rate": 0.0001647326507394767, "loss": 0.7126, "mean_token_accuracy": 0.8647830635309219, "num_tokens": 145971.0, "step": 155 }, { "epoch": 0.5449127288207748, "grad_norm": 0.7333567142486572, "learning_rate": 0.00016359499431171787, "loss": 0.6287, "mean_token_accuracy": 0.878324082493782, "num_tokens": 150669.0, "step": 160 }, { "epoch": 0.561941251596424, "grad_norm": 0.8214460015296936, "learning_rate": 0.00016245733788395906, "loss": 0.6608, "mean_token_accuracy": 0.8729922890663147, "num_tokens": 155374.0, "step": 165 }, { "epoch": 0.5789697743720732, "grad_norm": 0.6251844167709351, "learning_rate": 0.00016131968145620024, "loss": 0.6556, "mean_token_accuracy": 0.8770609870553017, "num_tokens": 160068.0, "step": 170 }, { "epoch": 0.5959982971477225, "grad_norm": 0.804166853427887, "learning_rate": 0.00016018202502844143, "loss": 0.6366, "mean_token_accuracy": 0.8760894432663917, "num_tokens": 164696.0, "step": 175 }, { "epoch": 0.6130268199233716, "grad_norm": 0.7013877034187317, "learning_rate": 0.0001590443686006826, "loss": 0.6328, "mean_token_accuracy": 0.8779815405607223, "num_tokens": 169356.0, "step": 180 }, { "epoch": 0.6300553426990209, "grad_norm": 1.0623070001602173, "learning_rate": 0.0001579067121729238, "loss": 0.6734, "mean_token_accuracy": 0.8710577815771103, "num_tokens": 174041.0, "step": 185 }, { "epoch": 0.6470838654746701, "grad_norm": 0.7858535647392273, "learning_rate": 0.00015676905574516496, "loss": 0.6775, "mean_token_accuracy": 0.8692880481481552, "num_tokens": 178858.0, "step": 190 }, { "epoch": 0.6641123882503193, "grad_norm": 0.8943309187889099, "learning_rate": 0.00015563139931740617, "loss": 0.6874, "mean_token_accuracy": 0.868885512650013, "num_tokens": 183669.0, "step": 195 }, { "epoch": 0.6811409110259685, "grad_norm": 0.5898745656013489, "learning_rate": 0.00015449374288964733, "loss": 0.6907, "mean_token_accuracy": 0.8661940798163414, "num_tokens": 188473.0, "step": 200 }, { "epoch": 0.6981694338016177, "grad_norm": 0.6333857774734497, "learning_rate": 0.00015335608646188854, "loss": 0.6129, "mean_token_accuracy": 0.8817986205220223, "num_tokens": 193171.0, "step": 205 }, { "epoch": 0.7151979565772669, "grad_norm": 0.5913947820663452, "learning_rate": 0.0001522184300341297, "loss": 0.5896, "mean_token_accuracy": 0.8822762459516525, "num_tokens": 197817.0, "step": 210 }, { "epoch": 0.7322264793529162, "grad_norm": 0.6990242004394531, "learning_rate": 0.00015108077360637088, "loss": 0.6512, "mean_token_accuracy": 0.8739180400967598, "num_tokens": 202556.0, "step": 215 }, { "epoch": 0.7492550021285653, "grad_norm": 0.6869048476219177, "learning_rate": 0.00014994311717861207, "loss": 0.7025, "mean_token_accuracy": 0.8662877783179284, "num_tokens": 207294.0, "step": 220 }, { "epoch": 0.7662835249042146, "grad_norm": 0.5135166049003601, "learning_rate": 0.00014880546075085325, "loss": 0.6382, "mean_token_accuracy": 0.8849207311868668, "num_tokens": 211927.0, "step": 225 }, { "epoch": 0.7833120476798637, "grad_norm": 0.6304216980934143, "learning_rate": 0.00014766780432309444, "loss": 0.6834, "mean_token_accuracy": 0.8688049465417862, "num_tokens": 216626.0, "step": 230 }, { "epoch": 0.800340570455513, "grad_norm": 0.6879922151565552, "learning_rate": 0.00014653014789533562, "loss": 0.6902, "mean_token_accuracy": 0.8655798360705376, "num_tokens": 221432.0, "step": 235 }, { "epoch": 0.8173690932311622, "grad_norm": 0.6433548331260681, "learning_rate": 0.0001453924914675768, "loss": 0.6129, "mean_token_accuracy": 0.8795880794525146, "num_tokens": 226022.0, "step": 240 }, { "epoch": 0.8343976160068114, "grad_norm": 0.7876724600791931, "learning_rate": 0.000144254835039818, "loss": 0.6441, "mean_token_accuracy": 0.8729524433612823, "num_tokens": 230692.0, "step": 245 }, { "epoch": 0.8514261387824607, "grad_norm": 0.6494749188423157, "learning_rate": 0.00014311717861205915, "loss": 0.7033, "mean_token_accuracy": 0.8632469072937965, "num_tokens": 235400.0, "step": 250 }, { "epoch": 0.8684546615581098, "grad_norm": 0.6332300305366516, "learning_rate": 0.00014197952218430036, "loss": 0.5947, "mean_token_accuracy": 0.8860528379678726, "num_tokens": 239997.0, "step": 255 }, { "epoch": 0.885483184333759, "grad_norm": 0.7144895195960999, "learning_rate": 0.00014084186575654152, "loss": 0.649, "mean_token_accuracy": 0.8745664536952973, "num_tokens": 244704.0, "step": 260 }, { "epoch": 0.9025117071094083, "grad_norm": 0.5460124015808105, "learning_rate": 0.00013970420932878273, "loss": 0.6622, "mean_token_accuracy": 0.8692788198590279, "num_tokens": 249428.0, "step": 265 }, { "epoch": 0.9195402298850575, "grad_norm": 0.65619295835495, "learning_rate": 0.0001385665529010239, "loss": 0.657, "mean_token_accuracy": 0.8737826406955719, "num_tokens": 254150.0, "step": 270 }, { "epoch": 0.9365687526607067, "grad_norm": 0.8474870324134827, "learning_rate": 0.0001374288964732651, "loss": 0.6607, "mean_token_accuracy": 0.8756056800484657, "num_tokens": 258826.0, "step": 275 }, { "epoch": 0.9535972754363559, "grad_norm": 0.6054229736328125, "learning_rate": 0.00013629124004550626, "loss": 0.6526, "mean_token_accuracy": 0.8718441724777222, "num_tokens": 263524.0, "step": 280 }, { "epoch": 0.9706257982120051, "grad_norm": 0.6568702459335327, "learning_rate": 0.00013515358361774744, "loss": 0.6174, "mean_token_accuracy": 0.881709736585617, "num_tokens": 268179.0, "step": 285 }, { "epoch": 0.9876543209876543, "grad_norm": 0.7518045902252197, "learning_rate": 0.00013401592718998863, "loss": 0.5896, "mean_token_accuracy": 0.885109031200409, "num_tokens": 272803.0, "step": 290 }, { "epoch": 1.0046828437633035, "grad_norm": 0.5392197370529175, "learning_rate": 0.00013287827076222981, "loss": 0.6753, "mean_token_accuracy": 0.8788385137915611, "num_tokens": 277527.0, "step": 295 }, { "epoch": 1.0217113665389528, "grad_norm": 0.5845906734466553, "learning_rate": 0.000131740614334471, "loss": 0.5237, "mean_token_accuracy": 0.8938747227191925, "num_tokens": 282199.0, "step": 300 }, { "epoch": 1.038739889314602, "grad_norm": 0.6392928957939148, "learning_rate": 0.00013060295790671218, "loss": 0.4973, "mean_token_accuracy": 0.8982622623443604, "num_tokens": 286951.0, "step": 305 }, { "epoch": 1.055768412090251, "grad_norm": 0.5399300456047058, "learning_rate": 0.00012946530147895337, "loss": 0.5076, "mean_token_accuracy": 0.9008002370595932, "num_tokens": 291569.0, "step": 310 }, { "epoch": 1.0727969348659003, "grad_norm": 0.6236026883125305, "learning_rate": 0.00012832764505119455, "loss": 0.5084, "mean_token_accuracy": 0.8972577184438706, "num_tokens": 296230.0, "step": 315 }, { "epoch": 1.0898254576415496, "grad_norm": 0.7385813593864441, "learning_rate": 0.0001271899886234357, "loss": 0.5062, "mean_token_accuracy": 0.8956585437059402, "num_tokens": 301029.0, "step": 320 }, { "epoch": 1.1068539804171988, "grad_norm": 0.7647150754928589, "learning_rate": 0.00012605233219567692, "loss": 0.5078, "mean_token_accuracy": 0.8982979074120522, "num_tokens": 305696.0, "step": 325 }, { "epoch": 1.123882503192848, "grad_norm": 0.6433872580528259, "learning_rate": 0.00012491467576791808, "loss": 0.5215, "mean_token_accuracy": 0.8974734947085381, "num_tokens": 310343.0, "step": 330 }, { "epoch": 1.1409110259684971, "grad_norm": 0.6470033526420593, "learning_rate": 0.0001237770193401593, "loss": 0.5261, "mean_token_accuracy": 0.8938129872083664, "num_tokens": 315097.0, "step": 335 }, { "epoch": 1.1579395487441464, "grad_norm": 0.6738846302032471, "learning_rate": 0.00012263936291240045, "loss": 0.5277, "mean_token_accuracy": 0.8924461513757705, "num_tokens": 319861.0, "step": 340 }, { "epoch": 1.1749680715197957, "grad_norm": 0.6639145016670227, "learning_rate": 0.00012150170648464165, "loss": 0.5127, "mean_token_accuracy": 0.8926685571670532, "num_tokens": 324544.0, "step": 345 }, { "epoch": 1.191996594295445, "grad_norm": 0.7034420371055603, "learning_rate": 0.00012036405005688282, "loss": 0.51, "mean_token_accuracy": 0.8971043467521668, "num_tokens": 329302.0, "step": 350 }, { "epoch": 1.2090251170710942, "grad_norm": 0.6675500273704529, "learning_rate": 0.000119226393629124, "loss": 0.5738, "mean_token_accuracy": 0.8855719327926636, "num_tokens": 334103.0, "step": 355 }, { "epoch": 1.2260536398467432, "grad_norm": 0.6019395589828491, "learning_rate": 0.00011808873720136519, "loss": 0.476, "mean_token_accuracy": 0.8989460453391075, "num_tokens": 338666.0, "step": 360 }, { "epoch": 1.2430821626223925, "grad_norm": 0.6599250435829163, "learning_rate": 0.00011695108077360638, "loss": 0.5178, "mean_token_accuracy": 0.8887226998805999, "num_tokens": 343333.0, "step": 365 }, { "epoch": 1.2601106853980417, "grad_norm": 0.7334213852882385, "learning_rate": 0.00011581342434584756, "loss": 0.5378, "mean_token_accuracy": 0.8895460113883018, "num_tokens": 348092.0, "step": 370 }, { "epoch": 1.277139208173691, "grad_norm": 0.7423357963562012, "learning_rate": 0.00011467576791808873, "loss": 0.5012, "mean_token_accuracy": 0.8994292929768563, "num_tokens": 352661.0, "step": 375 }, { "epoch": 1.29416773094934, "grad_norm": 0.857515811920166, "learning_rate": 0.00011353811149032993, "loss": 0.507, "mean_token_accuracy": 0.8979884222149849, "num_tokens": 357330.0, "step": 380 }, { "epoch": 1.3111962537249893, "grad_norm": 0.5656803250312805, "learning_rate": 0.0001124004550625711, "loss": 0.5009, "mean_token_accuracy": 0.8934224143624305, "num_tokens": 362020.0, "step": 385 }, { "epoch": 1.3282247765006385, "grad_norm": 0.6634964942932129, "learning_rate": 0.00011126279863481229, "loss": 0.5414, "mean_token_accuracy": 0.8910330131649971, "num_tokens": 366728.0, "step": 390 }, { "epoch": 1.3452532992762878, "grad_norm": 0.7004157304763794, "learning_rate": 0.00011012514220705347, "loss": 0.4922, "mean_token_accuracy": 0.8992783546447753, "num_tokens": 371381.0, "step": 395 }, { "epoch": 1.362281822051937, "grad_norm": 0.6225594282150269, "learning_rate": 0.00010898748577929466, "loss": 0.5084, "mean_token_accuracy": 0.8956901535391808, "num_tokens": 376043.0, "step": 400 }, { "epoch": 1.3793103448275863, "grad_norm": 0.8019647598266602, "learning_rate": 0.00010784982935153584, "loss": 0.5303, "mean_token_accuracy": 0.8940754950046539, "num_tokens": 380714.0, "step": 405 }, { "epoch": 1.3963388676032356, "grad_norm": 0.8314201831817627, "learning_rate": 0.00010671217292377703, "loss": 0.5249, "mean_token_accuracy": 0.8924115225672722, "num_tokens": 385498.0, "step": 410 }, { "epoch": 1.4133673903788846, "grad_norm": 0.6691393256187439, "learning_rate": 0.00010557451649601821, "loss": 0.4817, "mean_token_accuracy": 0.89882483035326, "num_tokens": 390179.0, "step": 415 }, { "epoch": 1.4303959131545338, "grad_norm": 0.8554338216781616, "learning_rate": 0.00010443686006825938, "loss": 0.5191, "mean_token_accuracy": 0.8876234069466591, "num_tokens": 394930.0, "step": 420 }, { "epoch": 1.447424435930183, "grad_norm": 0.696018636226654, "learning_rate": 0.00010329920364050057, "loss": 0.5386, "mean_token_accuracy": 0.891503955423832, "num_tokens": 399685.0, "step": 425 }, { "epoch": 1.4644529587058321, "grad_norm": 0.7389529943466187, "learning_rate": 0.00010216154721274175, "loss": 0.4949, "mean_token_accuracy": 0.9004919424653053, "num_tokens": 404300.0, "step": 430 }, { "epoch": 1.4814814814814814, "grad_norm": 1.0227491855621338, "learning_rate": 0.00010102389078498294, "loss": 0.54, "mean_token_accuracy": 0.8893611416220665, "num_tokens": 409079.0, "step": 435 }, { "epoch": 1.4985100042571307, "grad_norm": 0.6526888012886047, "learning_rate": 9.988623435722412e-05, "loss": 0.4917, "mean_token_accuracy": 0.8958082437515259, "num_tokens": 413758.0, "step": 440 }, { "epoch": 1.51553852703278, "grad_norm": 0.5875766277313232, "learning_rate": 9.874857792946531e-05, "loss": 0.4991, "mean_token_accuracy": 0.8971148490905761, "num_tokens": 418502.0, "step": 445 }, { "epoch": 1.5325670498084292, "grad_norm": 0.6892980337142944, "learning_rate": 9.761092150170649e-05, "loss": 0.4551, "mean_token_accuracy": 0.9068983420729637, "num_tokens": 423099.0, "step": 450 }, { "epoch": 1.5495955725840784, "grad_norm": 0.6264586448669434, "learning_rate": 9.647326507394768e-05, "loss": 0.468, "mean_token_accuracy": 0.9043048679828644, "num_tokens": 427701.0, "step": 455 }, { "epoch": 1.5666240953597277, "grad_norm": 0.5398015379905701, "learning_rate": 9.533560864618886e-05, "loss": 0.4877, "mean_token_accuracy": 0.8986729174852371, "num_tokens": 432430.0, "step": 460 }, { "epoch": 1.5836526181353767, "grad_norm": 0.827769935131073, "learning_rate": 9.419795221843003e-05, "loss": 0.4951, "mean_token_accuracy": 0.9012611672282219, "num_tokens": 437078.0, "step": 465 }, { "epoch": 1.600681140911026, "grad_norm": 0.6888080835342407, "learning_rate": 9.306029579067122e-05, "loss": 0.5108, "mean_token_accuracy": 0.8976602256298065, "num_tokens": 441734.0, "step": 470 }, { "epoch": 1.617709663686675, "grad_norm": 0.837681233882904, "learning_rate": 9.19226393629124e-05, "loss": 0.5377, "mean_token_accuracy": 0.8850761532783509, "num_tokens": 446637.0, "step": 475 }, { "epoch": 1.6347381864623243, "grad_norm": 0.7211363315582275, "learning_rate": 9.078498293515359e-05, "loss": 0.5001, "mean_token_accuracy": 0.898733913898468, "num_tokens": 451301.0, "step": 480 }, { "epoch": 1.6517667092379735, "grad_norm": 0.6663438081741333, "learning_rate": 8.964732650739477e-05, "loss": 0.5144, "mean_token_accuracy": 0.8976200923323632, "num_tokens": 455965.0, "step": 485 }, { "epoch": 1.6687952320136228, "grad_norm": 0.8935639262199402, "learning_rate": 8.850967007963596e-05, "loss": 0.5331, "mean_token_accuracy": 0.8960411131381989, "num_tokens": 460716.0, "step": 490 }, { "epoch": 1.685823754789272, "grad_norm": 0.7235546708106995, "learning_rate": 8.737201365187714e-05, "loss": 0.4831, "mean_token_accuracy": 0.8972082689404488, "num_tokens": 465370.0, "step": 495 }, { "epoch": 1.7028522775649213, "grad_norm": 0.774000346660614, "learning_rate": 8.623435722411833e-05, "loss": 0.5186, "mean_token_accuracy": 0.8950631290674209, "num_tokens": 470043.0, "step": 500 }, { "epoch": 1.7198808003405706, "grad_norm": 0.5213722586631775, "learning_rate": 8.509670079635951e-05, "loss": 0.4567, "mean_token_accuracy": 0.9016156733036041, "num_tokens": 474573.0, "step": 505 }, { "epoch": 1.7369093231162198, "grad_norm": 0.7278684377670288, "learning_rate": 8.395904436860069e-05, "loss": 0.5545, "mean_token_accuracy": 0.8925162181258202, "num_tokens": 479305.0, "step": 510 }, { "epoch": 1.7539378458918689, "grad_norm": 0.7252481579780579, "learning_rate": 8.282138794084187e-05, "loss": 0.496, "mean_token_accuracy": 0.8953201442956924, "num_tokens": 484033.0, "step": 515 }, { "epoch": 1.770966368667518, "grad_norm": 0.727513313293457, "learning_rate": 8.168373151308306e-05, "loss": 0.5033, "mean_token_accuracy": 0.8998701125383377, "num_tokens": 488727.0, "step": 520 }, { "epoch": 1.7879948914431671, "grad_norm": 0.5375337600708008, "learning_rate": 8.054607508532424e-05, "loss": 0.4903, "mean_token_accuracy": 0.8960629358887673, "num_tokens": 493411.0, "step": 525 }, { "epoch": 1.8050234142188164, "grad_norm": 0.5851954221725464, "learning_rate": 7.940841865756543e-05, "loss": 0.5139, "mean_token_accuracy": 0.8972602248191833, "num_tokens": 498098.0, "step": 530 }, { "epoch": 1.8220519369944657, "grad_norm": 0.6942209005355835, "learning_rate": 7.827076222980661e-05, "loss": 0.4728, "mean_token_accuracy": 0.9009919315576553, "num_tokens": 502717.0, "step": 535 }, { "epoch": 1.839080459770115, "grad_norm": 0.9342221021652222, "learning_rate": 7.71331058020478e-05, "loss": 0.5283, "mean_token_accuracy": 0.8924958631396294, "num_tokens": 507462.0, "step": 540 }, { "epoch": 1.8561089825457642, "grad_norm": 0.7415278553962708, "learning_rate": 7.599544937428897e-05, "loss": 0.5394, "mean_token_accuracy": 0.8913042590022087, "num_tokens": 512202.0, "step": 545 }, { "epoch": 1.8731375053214134, "grad_norm": 0.7223448157310486, "learning_rate": 7.485779294653015e-05, "loss": 0.5473, "mean_token_accuracy": 0.8873603999614715, "num_tokens": 517047.0, "step": 550 }, { "epoch": 1.8901660280970627, "grad_norm": 0.6324387192726135, "learning_rate": 7.372013651877134e-05, "loss": 0.4986, "mean_token_accuracy": 0.9018153563141823, "num_tokens": 521653.0, "step": 555 }, { "epoch": 1.907194550872712, "grad_norm": 0.6177689433097839, "learning_rate": 7.258248009101252e-05, "loss": 0.5242, "mean_token_accuracy": 0.8907949879765511, "num_tokens": 526387.0, "step": 560 }, { "epoch": 1.924223073648361, "grad_norm": 0.6327561140060425, "learning_rate": 7.14448236632537e-05, "loss": 0.4725, "mean_token_accuracy": 0.9006670027971267, "num_tokens": 531113.0, "step": 565 }, { "epoch": 1.9412515964240102, "grad_norm": 0.6829894781112671, "learning_rate": 7.030716723549489e-05, "loss": 0.5255, "mean_token_accuracy": 0.8897917374968529, "num_tokens": 535963.0, "step": 570 }, { "epoch": 1.9582801191996593, "grad_norm": 0.7764301896095276, "learning_rate": 6.916951080773608e-05, "loss": 0.5636, "mean_token_accuracy": 0.8877105817198754, "num_tokens": 540801.0, "step": 575 }, { "epoch": 1.9753086419753085, "grad_norm": 0.7201740741729736, "learning_rate": 6.803185437997726e-05, "loss": 0.5279, "mean_token_accuracy": 0.8954470381140709, "num_tokens": 545507.0, "step": 580 }, { "epoch": 1.9923371647509578, "grad_norm": 0.6038010716438293, "learning_rate": 6.689419795221843e-05, "loss": 0.505, "mean_token_accuracy": 0.8970827981829643, "num_tokens": 550257.0, "step": 585 }, { "epoch": 2.009365687526607, "grad_norm": 0.5724640488624573, "learning_rate": 6.575654152445962e-05, "loss": 0.5361, "mean_token_accuracy": 0.9015150561928749, "num_tokens": 554990.0, "step": 590 }, { "epoch": 2.0263942103022563, "grad_norm": 0.5974262952804565, "learning_rate": 6.46188850967008e-05, "loss": 0.3674, "mean_token_accuracy": 0.922430993616581, "num_tokens": 559672.0, "step": 595 }, { "epoch": 2.0434227330779056, "grad_norm": 0.6744574904441833, "learning_rate": 6.348122866894199e-05, "loss": 0.3751, "mean_token_accuracy": 0.9247258752584457, "num_tokens": 564411.0, "step": 600 } ], "logging_steps": 5, "max_steps": 879, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.555721091318579e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }