{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.6811409110259685, "eval_steps": 500, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.017028522775649212, "grad_norm": 6.522716999053955, "learning_rate": 0.0001988623435722412, "loss": 2.7211, "mean_token_accuracy": 0.5789041496813297, "num_tokens": 4727.0, "step": 5 }, { "epoch": 0.034057045551298425, "grad_norm": 1.0070050954818726, "learning_rate": 0.00019772468714448238, "loss": 0.9998, "mean_token_accuracy": 0.8499793156981468, "num_tokens": 9471.0, "step": 10 }, { "epoch": 0.05108556832694764, "grad_norm": 0.7373425960540771, "learning_rate": 0.00019658703071672356, "loss": 0.8303, "mean_token_accuracy": 0.8681916877627373, "num_tokens": 14013.0, "step": 15 }, { "epoch": 0.06811409110259685, "grad_norm": 0.8468236327171326, "learning_rate": 0.00019544937428896475, "loss": 0.8404, "mean_token_accuracy": 0.8622620105743408, "num_tokens": 18725.0, "step": 20 }, { "epoch": 0.08514261387824607, "grad_norm": 0.8178804516792297, "learning_rate": 0.00019431171786120593, "loss": 0.9073, "mean_token_accuracy": 0.8524447843432427, "num_tokens": 23497.0, "step": 25 }, { "epoch": 0.10217113665389528, "grad_norm": 0.890177309513092, "learning_rate": 0.00019317406143344712, "loss": 0.8029, "mean_token_accuracy": 0.8642359614372254, "num_tokens": 28192.0, "step": 30 }, { "epoch": 0.11919965942954448, "grad_norm": 1.0545469522476196, "learning_rate": 0.0001920364050056883, "loss": 0.7458, "mean_token_accuracy": 0.8732351213693619, "num_tokens": 32805.0, "step": 35 }, { "epoch": 0.1362281822051937, "grad_norm": 1.0384492874145508, "learning_rate": 0.00019089874857792946, "loss": 0.9235, "mean_token_accuracy": 0.8408558666706085, "num_tokens": 37714.0, "step": 40 }, { "epoch": 0.1532567049808429, "grad_norm": 0.6860374808311462, "learning_rate": 0.00018976109215017067, "loss": 0.7623, "mean_token_accuracy": 0.8656536340713501, "num_tokens": 42429.0, "step": 45 }, { "epoch": 0.17028522775649213, "grad_norm": 0.7284501791000366, "learning_rate": 0.00018862343572241183, "loss": 0.7588, "mean_token_accuracy": 0.8688850715756417, "num_tokens": 47099.0, "step": 50 }, { "epoch": 0.18731375053214133, "grad_norm": 0.8899862170219421, "learning_rate": 0.00018748577929465302, "loss": 0.7065, "mean_token_accuracy": 0.8717748820781708, "num_tokens": 51795.0, "step": 55 }, { "epoch": 0.20434227330779056, "grad_norm": 0.5350505709648132, "learning_rate": 0.0001863481228668942, "loss": 0.6696, "mean_token_accuracy": 0.8851396456360817, "num_tokens": 56369.0, "step": 60 }, { "epoch": 0.22137079608343976, "grad_norm": 0.6087013483047485, "learning_rate": 0.0001852104664391354, "loss": 0.7204, "mean_token_accuracy": 0.8682332798838616, "num_tokens": 61018.0, "step": 65 }, { "epoch": 0.23839931885908897, "grad_norm": 0.7879019379615784, "learning_rate": 0.00018407281001137657, "loss": 0.7692, "mean_token_accuracy": 0.8653983056545258, "num_tokens": 65741.0, "step": 70 }, { "epoch": 0.2554278416347382, "grad_norm": 0.6546444296836853, "learning_rate": 0.00018293515358361776, "loss": 0.7119, "mean_token_accuracy": 0.8726310178637504, "num_tokens": 70425.0, "step": 75 }, { "epoch": 0.2724563644103874, "grad_norm": 0.770902156829834, "learning_rate": 0.00018179749715585894, "loss": 0.7035, "mean_token_accuracy": 0.8711811751127243, "num_tokens": 75101.0, "step": 80 }, { "epoch": 0.2894848871860366, "grad_norm": 0.8873187899589539, "learning_rate": 0.00018065984072810013, "loss": 0.7419, "mean_token_accuracy": 0.8616803497076034, "num_tokens": 79888.0, "step": 85 }, { "epoch": 0.3065134099616858, "grad_norm": 0.7061370015144348, "learning_rate": 0.0001795221843003413, "loss": 0.66, "mean_token_accuracy": 0.8744896531105042, "num_tokens": 84562.0, "step": 90 }, { "epoch": 0.32354193273733506, "grad_norm": 0.8232033252716064, "learning_rate": 0.0001783845278725825, "loss": 0.7403, "mean_token_accuracy": 0.8659066379070282, "num_tokens": 89238.0, "step": 95 }, { "epoch": 0.34057045551298426, "grad_norm": 0.7313310503959656, "learning_rate": 0.00017724687144482368, "loss": 0.7157, "mean_token_accuracy": 0.8661555901169777, "num_tokens": 93987.0, "step": 100 }, { "epoch": 0.35759897828863346, "grad_norm": 0.7119390964508057, "learning_rate": 0.00017610921501706487, "loss": 0.7016, "mean_token_accuracy": 0.8678551658987999, "num_tokens": 98722.0, "step": 105 }, { "epoch": 0.37462750106428266, "grad_norm": 0.7126006484031677, "learning_rate": 0.00017497155858930602, "loss": 0.7009, "mean_token_accuracy": 0.867291408777237, "num_tokens": 103439.0, "step": 110 }, { "epoch": 0.39165602383993187, "grad_norm": 0.6158230304718018, "learning_rate": 0.00017383390216154724, "loss": 0.7236, "mean_token_accuracy": 0.8636128515005111, "num_tokens": 108209.0, "step": 115 }, { "epoch": 0.4086845466155811, "grad_norm": 0.6498322486877441, "learning_rate": 0.0001726962457337884, "loss": 0.6813, "mean_token_accuracy": 0.8757071048021317, "num_tokens": 112855.0, "step": 120 }, { "epoch": 0.4257130693912303, "grad_norm": 0.6594287157058716, "learning_rate": 0.0001715585893060296, "loss": 0.7062, "mean_token_accuracy": 0.8650311172008515, "num_tokens": 117653.0, "step": 125 }, { "epoch": 0.4427415921668795, "grad_norm": 0.7375237941741943, "learning_rate": 0.00017042093287827076, "loss": 0.6477, "mean_token_accuracy": 0.8733970731496811, "num_tokens": 122397.0, "step": 130 }, { "epoch": 0.45977011494252873, "grad_norm": 0.5958442687988281, "learning_rate": 0.00016928327645051198, "loss": 0.691, "mean_token_accuracy": 0.8681387722492218, "num_tokens": 127136.0, "step": 135 }, { "epoch": 0.47679863771817793, "grad_norm": 0.7407785654067993, "learning_rate": 0.00016814562002275313, "loss": 0.6477, "mean_token_accuracy": 0.8752307429909706, "num_tokens": 131833.0, "step": 140 }, { "epoch": 0.49382716049382713, "grad_norm": 0.8190199732780457, "learning_rate": 0.00016700796359499432, "loss": 0.6608, "mean_token_accuracy": 0.8762851104140281, "num_tokens": 136441.0, "step": 145 }, { "epoch": 0.5108556832694764, "grad_norm": 0.7571837306022644, "learning_rate": 0.0001658703071672355, "loss": 0.673, "mean_token_accuracy": 0.8691665843129158, "num_tokens": 141186.0, "step": 150 }, { "epoch": 0.5278842060451255, "grad_norm": 0.6653426885604858, "learning_rate": 0.0001647326507394767, "loss": 0.7126, "mean_token_accuracy": 0.8647830635309219, "num_tokens": 145971.0, "step": 155 }, { "epoch": 0.5449127288207748, "grad_norm": 0.7333567142486572, "learning_rate": 0.00016359499431171787, "loss": 0.6287, "mean_token_accuracy": 0.878324082493782, "num_tokens": 150669.0, "step": 160 }, { "epoch": 0.561941251596424, "grad_norm": 0.8214460015296936, "learning_rate": 0.00016245733788395906, "loss": 0.6608, "mean_token_accuracy": 0.8729922890663147, "num_tokens": 155374.0, "step": 165 }, { "epoch": 0.5789697743720732, "grad_norm": 0.6251844167709351, "learning_rate": 0.00016131968145620024, "loss": 0.6556, "mean_token_accuracy": 0.8770609870553017, "num_tokens": 160068.0, "step": 170 }, { "epoch": 0.5959982971477225, "grad_norm": 0.804166853427887, "learning_rate": 0.00016018202502844143, "loss": 0.6366, "mean_token_accuracy": 0.8760894432663917, "num_tokens": 164696.0, "step": 175 }, { "epoch": 0.6130268199233716, "grad_norm": 0.7013877034187317, "learning_rate": 0.0001590443686006826, "loss": 0.6328, "mean_token_accuracy": 0.8779815405607223, "num_tokens": 169356.0, "step": 180 }, { "epoch": 0.6300553426990209, "grad_norm": 1.0623070001602173, "learning_rate": 0.0001579067121729238, "loss": 0.6734, "mean_token_accuracy": 0.8710577815771103, "num_tokens": 174041.0, "step": 185 }, { "epoch": 0.6470838654746701, "grad_norm": 0.7858535647392273, "learning_rate": 0.00015676905574516496, "loss": 0.6775, "mean_token_accuracy": 0.8692880481481552, "num_tokens": 178858.0, "step": 190 }, { "epoch": 0.6641123882503193, "grad_norm": 0.8943309187889099, "learning_rate": 0.00015563139931740617, "loss": 0.6874, "mean_token_accuracy": 0.868885512650013, "num_tokens": 183669.0, "step": 195 }, { "epoch": 0.6811409110259685, "grad_norm": 0.5898745656013489, "learning_rate": 0.00015449374288964733, "loss": 0.6907, "mean_token_accuracy": 0.8661940798163414, "num_tokens": 188473.0, "step": 200 } ], "logging_steps": 5, "max_steps": 879, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8534284789702656.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }