{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 40, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.33837890625, "epoch": 0.025559105431309903, "grad_norm": 1.3860907554626465, "learning_rate": 5e-06, "loss": 0.2356, "mean_token_accuracy": 0.9149995073676109, "num_tokens": 247547.0, "step": 1 }, { "entropy": 0.29833984375, "epoch": 0.051118210862619806, "grad_norm": 0.8139157295227051, "learning_rate": 5e-06, "loss": 0.2338, "mean_token_accuracy": 0.9106904715299606, "num_tokens": 503452.0, "step": 2 }, { "entropy": 0.22998046875, "epoch": 0.07667731629392971, "grad_norm": 1.3563913106918335, "learning_rate": 5e-06, "loss": 0.2274, "mean_token_accuracy": 0.9135542511940002, "num_tokens": 769219.0, "step": 3 }, { "entropy": 0.2330322265625, "epoch": 0.10223642172523961, "grad_norm": 0.9234383702278137, "learning_rate": 5e-06, "loss": 0.2279, "mean_token_accuracy": 0.9103917181491852, "num_tokens": 1009229.0, "step": 4 }, { "entropy": 0.23681640625, "epoch": 0.12779552715654952, "grad_norm": 1.1203982830047607, "learning_rate": 5e-06, "loss": 0.2201, "mean_token_accuracy": 0.9129249453544617, "num_tokens": 1285053.0, "step": 5 }, { "entropy": 0.24072265625, "epoch": 0.15335463258785942, "grad_norm": 0.8166515827178955, "learning_rate": 5e-06, "loss": 0.2196, "mean_token_accuracy": 0.913282960653305, "num_tokens": 1532662.0, "step": 6 }, { "entropy": 0.2420654296875, "epoch": 0.17891373801916932, "grad_norm": 0.7242934703826904, "learning_rate": 5e-06, "loss": 0.2184, "mean_token_accuracy": 0.9122176915407181, "num_tokens": 1810498.0, "step": 7 }, { "entropy": 0.239990234375, "epoch": 0.20447284345047922, "grad_norm": 0.769619882106781, "learning_rate": 5e-06, "loss": 0.2073, "mean_token_accuracy": 0.9168584048748016, "num_tokens": 2069798.0, "step": 8 }, { "entropy": 0.24951171875, "epoch": 0.23003194888178913, "grad_norm": 0.6781730055809021, "learning_rate": 5e-06, "loss": 0.2193, "mean_token_accuracy": 0.9128180220723152, "num_tokens": 2343103.0, "step": 9 }, { "entropy": 0.2413330078125, "epoch": 0.25559105431309903, "grad_norm": 0.6519078612327576, "learning_rate": 5e-06, "loss": 0.2049, "mean_token_accuracy": 0.918676108121872, "num_tokens": 2588530.0, "step": 10 }, { "entropy": 0.2454833984375, "epoch": 0.28115015974440893, "grad_norm": 0.6875287890434265, "learning_rate": 5e-06, "loss": 0.2042, "mean_token_accuracy": 0.9205483794212341, "num_tokens": 2908287.0, "step": 11 }, { "entropy": 0.237548828125, "epoch": 0.30670926517571884, "grad_norm": 0.6520001888275146, "learning_rate": 5e-06, "loss": 0.205, "mean_token_accuracy": 0.9174779504537582, "num_tokens": 3160245.0, "step": 12 }, { "entropy": 0.2342529296875, "epoch": 0.33226837060702874, "grad_norm": 0.6070258021354675, "learning_rate": 5e-06, "loss": 0.1905, "mean_token_accuracy": 0.9244447574019432, "num_tokens": 3424238.0, "step": 13 }, { "entropy": 0.2349853515625, "epoch": 0.35782747603833864, "grad_norm": 0.6514118313789368, "learning_rate": 5e-06, "loss": 0.2122, "mean_token_accuracy": 0.9166730865836143, "num_tokens": 3657473.0, "step": 14 }, { "entropy": 0.2254638671875, "epoch": 0.38338658146964855, "grad_norm": 0.6729201078414917, "learning_rate": 5e-06, "loss": 0.203, "mean_token_accuracy": 0.9220064431428909, "num_tokens": 3934192.0, "step": 15 }, { "entropy": 0.216796875, "epoch": 0.40894568690095845, "grad_norm": 0.6052552461624146, "learning_rate": 5e-06, "loss": 0.1861, "mean_token_accuracy": 0.9266253188252449, "num_tokens": 4174300.0, "step": 16 }, { "entropy": 0.2274169921875, "epoch": 0.43450479233226835, "grad_norm": 0.6148956418037415, "learning_rate": 5e-06, "loss": 0.1969, "mean_token_accuracy": 0.922677256166935, "num_tokens": 4443227.0, "step": 17 }, { "entropy": 0.2215576171875, "epoch": 0.46006389776357826, "grad_norm": 0.5809229016304016, "learning_rate": 5e-06, "loss": 0.1846, "mean_token_accuracy": 0.9283580705523491, "num_tokens": 4716762.0, "step": 18 }, { "entropy": 0.2388916015625, "epoch": 0.48562300319488816, "grad_norm": 0.6816635727882385, "learning_rate": 5e-06, "loss": 0.2156, "mean_token_accuracy": 0.9144621640443802, "num_tokens": 4963407.0, "step": 19 }, { "entropy": 0.228515625, "epoch": 0.5111821086261981, "grad_norm": 0.6315724849700928, "learning_rate": 5e-06, "loss": 0.2037, "mean_token_accuracy": 0.9192509204149246, "num_tokens": 5213864.0, "step": 20 }, { "entropy": 0.234619140625, "epoch": 0.536741214057508, "grad_norm": 0.5840864777565002, "learning_rate": 5e-06, "loss": 0.1997, "mean_token_accuracy": 0.920286513864994, "num_tokens": 5532478.0, "step": 21 }, { "entropy": 0.244384765625, "epoch": 0.5623003194888179, "grad_norm": 0.5714988708496094, "learning_rate": 5e-06, "loss": 0.2015, "mean_token_accuracy": 0.9200754836201668, "num_tokens": 5779266.0, "step": 22 }, { "entropy": 0.24267578125, "epoch": 0.5878594249201278, "grad_norm": 0.6089759469032288, "learning_rate": 5e-06, "loss": 0.1972, "mean_token_accuracy": 0.9218065664172173, "num_tokens": 6060432.0, "step": 23 }, { "entropy": 0.2325439453125, "epoch": 0.6134185303514377, "grad_norm": 0.5821586847305298, "learning_rate": 5e-06, "loss": 0.1843, "mean_token_accuracy": 0.9265915080904961, "num_tokens": 6301843.0, "step": 24 }, { "entropy": 0.2310791015625, "epoch": 0.6389776357827476, "grad_norm": 0.6131304502487183, "learning_rate": 5e-06, "loss": 0.1792, "mean_token_accuracy": 0.9284531474113464, "num_tokens": 6576585.0, "step": 25 }, { "entropy": 0.222412109375, "epoch": 0.6645367412140575, "grad_norm": 0.5503367781639099, "learning_rate": 5e-06, "loss": 0.1715, "mean_token_accuracy": 0.9328160658478737, "num_tokens": 6845186.0, "step": 26 }, { "entropy": 0.22998046875, "epoch": 0.6900958466453674, "grad_norm": 0.6361868381500244, "learning_rate": 5e-06, "loss": 0.1779, "mean_token_accuracy": 0.9286485612392426, "num_tokens": 7085348.0, "step": 27 }, { "entropy": 0.2066650390625, "epoch": 0.7156549520766773, "grad_norm": 0.7397343516349792, "learning_rate": 5e-06, "loss": 0.1923, "mean_token_accuracy": 0.9265264719724655, "num_tokens": 7399072.0, "step": 28 }, { "entropy": 0.218505859375, "epoch": 0.7412140575079872, "grad_norm": 0.6499117612838745, "learning_rate": 5e-06, "loss": 0.1824, "mean_token_accuracy": 0.9268042370676994, "num_tokens": 7643135.0, "step": 29 }, { "entropy": 0.2171630859375, "epoch": 0.7667731629392971, "grad_norm": 0.6052445769309998, "learning_rate": 5e-06, "loss": 0.1578, "mean_token_accuracy": 0.9388716816902161, "num_tokens": 7903421.0, "step": 30 }, { "entropy": 0.2227783203125, "epoch": 0.792332268370607, "grad_norm": 0.6016133427619934, "learning_rate": 5e-06, "loss": 0.1787, "mean_token_accuracy": 0.9274549633264542, "num_tokens": 8147609.0, "step": 31 }, { "entropy": 0.205078125, "epoch": 0.8178913738019169, "grad_norm": 0.5993157625198364, "learning_rate": 5e-06, "loss": 0.1415, "mean_token_accuracy": 0.9419146031141281, "num_tokens": 8430886.0, "step": 32 }, { "entropy": 0.2073974609375, "epoch": 0.8434504792332268, "grad_norm": 0.5889512896537781, "learning_rate": 5e-06, "loss": 0.1452, "mean_token_accuracy": 0.940593808889389, "num_tokens": 8708018.0, "step": 33 }, { "entropy": 0.2015380859375, "epoch": 0.8690095846645367, "grad_norm": 0.5472734570503235, "learning_rate": 5e-06, "loss": 0.1562, "mean_token_accuracy": 0.9391490146517754, "num_tokens": 8994205.0, "step": 34 }, { "entropy": 0.1910400390625, "epoch": 0.8945686900958466, "grad_norm": 0.6416247487068176, "learning_rate": 5e-06, "loss": 0.1542, "mean_token_accuracy": 0.9384341165423393, "num_tokens": 9269249.0, "step": 35 }, { "entropy": 0.2125244140625, "epoch": 0.9201277955271565, "grad_norm": 0.7481750845909119, "learning_rate": 5e-06, "loss": 0.1774, "mean_token_accuracy": 0.9291663020849228, "num_tokens": 9528037.0, "step": 36 }, { "entropy": 0.1834716796875, "epoch": 0.9456869009584664, "grad_norm": 0.5720862746238708, "learning_rate": 5e-06, "loss": 0.1326, "mean_token_accuracy": 0.9485453143715858, "num_tokens": 9862404.0, "step": 37 }, { "entropy": 0.2203369140625, "epoch": 0.9712460063897763, "grad_norm": 0.6076711416244507, "learning_rate": 5e-06, "loss": 0.1596, "mean_token_accuracy": 0.9337968751788139, "num_tokens": 10098985.0, "step": 38 }, { "entropy": 0.1817626953125, "epoch": 0.9968051118210862, "grad_norm": 0.5613975524902344, "learning_rate": 5e-06, "loss": 0.1129, "mean_token_accuracy": 0.9513632953166962, "num_tokens": 10388638.0, "step": 39 }, { "entropy": 0.216796875, "epoch": 1.0, "grad_norm": 1.4142874479293823, "learning_rate": 5e-06, "loss": 0.1869, "mean_token_accuracy": 0.9235668778419495, "num_tokens": 10415446.0, "step": 40 } ], "logging_steps": 1.0, "max_steps": 40, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 10000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 34104797593600.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }