| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 500, |
| "global_step": 40, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "entropy": 0.33837890625, |
| "epoch": 0.025559105431309903, |
| "grad_norm": 1.3860907554626465, |
| "learning_rate": 5e-06, |
| "loss": 0.2356, |
| "mean_token_accuracy": 0.9149995073676109, |
| "num_tokens": 247547.0, |
| "step": 1 |
| }, |
| { |
| "entropy": 0.29833984375, |
| "epoch": 0.051118210862619806, |
| "grad_norm": 0.8139157295227051, |
| "learning_rate": 5e-06, |
| "loss": 0.2338, |
| "mean_token_accuracy": 0.9106904715299606, |
| "num_tokens": 503452.0, |
| "step": 2 |
| }, |
| { |
| "entropy": 0.22998046875, |
| "epoch": 0.07667731629392971, |
| "grad_norm": 1.3563913106918335, |
| "learning_rate": 5e-06, |
| "loss": 0.2274, |
| "mean_token_accuracy": 0.9135542511940002, |
| "num_tokens": 769219.0, |
| "step": 3 |
| }, |
| { |
| "entropy": 0.2330322265625, |
| "epoch": 0.10223642172523961, |
| "grad_norm": 0.9234383702278137, |
| "learning_rate": 5e-06, |
| "loss": 0.2279, |
| "mean_token_accuracy": 0.9103917181491852, |
| "num_tokens": 1009229.0, |
| "step": 4 |
| }, |
| { |
| "entropy": 0.23681640625, |
| "epoch": 0.12779552715654952, |
| "grad_norm": 1.1203982830047607, |
| "learning_rate": 5e-06, |
| "loss": 0.2201, |
| "mean_token_accuracy": 0.9129249453544617, |
| "num_tokens": 1285053.0, |
| "step": 5 |
| }, |
| { |
| "entropy": 0.24072265625, |
| "epoch": 0.15335463258785942, |
| "grad_norm": 0.8166515827178955, |
| "learning_rate": 5e-06, |
| "loss": 0.2196, |
| "mean_token_accuracy": 0.913282960653305, |
| "num_tokens": 1532662.0, |
| "step": 6 |
| }, |
| { |
| "entropy": 0.2420654296875, |
| "epoch": 0.17891373801916932, |
| "grad_norm": 0.7242934703826904, |
| "learning_rate": 5e-06, |
| "loss": 0.2184, |
| "mean_token_accuracy": 0.9122176915407181, |
| "num_tokens": 1810498.0, |
| "step": 7 |
| }, |
| { |
| "entropy": 0.239990234375, |
| "epoch": 0.20447284345047922, |
| "grad_norm": 0.769619882106781, |
| "learning_rate": 5e-06, |
| "loss": 0.2073, |
| "mean_token_accuracy": 0.9168584048748016, |
| "num_tokens": 2069798.0, |
| "step": 8 |
| }, |
| { |
| "entropy": 0.24951171875, |
| "epoch": 0.23003194888178913, |
| "grad_norm": 0.6781730055809021, |
| "learning_rate": 5e-06, |
| "loss": 0.2193, |
| "mean_token_accuracy": 0.9128180220723152, |
| "num_tokens": 2343103.0, |
| "step": 9 |
| }, |
| { |
| "entropy": 0.2413330078125, |
| "epoch": 0.25559105431309903, |
| "grad_norm": 0.6519078612327576, |
| "learning_rate": 5e-06, |
| "loss": 0.2049, |
| "mean_token_accuracy": 0.918676108121872, |
| "num_tokens": 2588530.0, |
| "step": 10 |
| }, |
| { |
| "entropy": 0.2454833984375, |
| "epoch": 0.28115015974440893, |
| "grad_norm": 0.6875287890434265, |
| "learning_rate": 5e-06, |
| "loss": 0.2042, |
| "mean_token_accuracy": 0.9205483794212341, |
| "num_tokens": 2908287.0, |
| "step": 11 |
| }, |
| { |
| "entropy": 0.237548828125, |
| "epoch": 0.30670926517571884, |
| "grad_norm": 0.6520001888275146, |
| "learning_rate": 5e-06, |
| "loss": 0.205, |
| "mean_token_accuracy": 0.9174779504537582, |
| "num_tokens": 3160245.0, |
| "step": 12 |
| }, |
| { |
| "entropy": 0.2342529296875, |
| "epoch": 0.33226837060702874, |
| "grad_norm": 0.6070258021354675, |
| "learning_rate": 5e-06, |
| "loss": 0.1905, |
| "mean_token_accuracy": 0.9244447574019432, |
| "num_tokens": 3424238.0, |
| "step": 13 |
| }, |
| { |
| "entropy": 0.2349853515625, |
| "epoch": 0.35782747603833864, |
| "grad_norm": 0.6514118313789368, |
| "learning_rate": 5e-06, |
| "loss": 0.2122, |
| "mean_token_accuracy": 0.9166730865836143, |
| "num_tokens": 3657473.0, |
| "step": 14 |
| }, |
| { |
| "entropy": 0.2254638671875, |
| "epoch": 0.38338658146964855, |
| "grad_norm": 0.6729201078414917, |
| "learning_rate": 5e-06, |
| "loss": 0.203, |
| "mean_token_accuracy": 0.9220064431428909, |
| "num_tokens": 3934192.0, |
| "step": 15 |
| }, |
| { |
| "entropy": 0.216796875, |
| "epoch": 0.40894568690095845, |
| "grad_norm": 0.6052552461624146, |
| "learning_rate": 5e-06, |
| "loss": 0.1861, |
| "mean_token_accuracy": 0.9266253188252449, |
| "num_tokens": 4174300.0, |
| "step": 16 |
| }, |
| { |
| "entropy": 0.2274169921875, |
| "epoch": 0.43450479233226835, |
| "grad_norm": 0.6148956418037415, |
| "learning_rate": 5e-06, |
| "loss": 0.1969, |
| "mean_token_accuracy": 0.922677256166935, |
| "num_tokens": 4443227.0, |
| "step": 17 |
| }, |
| { |
| "entropy": 0.2215576171875, |
| "epoch": 0.46006389776357826, |
| "grad_norm": 0.5809229016304016, |
| "learning_rate": 5e-06, |
| "loss": 0.1846, |
| "mean_token_accuracy": 0.9283580705523491, |
| "num_tokens": 4716762.0, |
| "step": 18 |
| }, |
| { |
| "entropy": 0.2388916015625, |
| "epoch": 0.48562300319488816, |
| "grad_norm": 0.6816635727882385, |
| "learning_rate": 5e-06, |
| "loss": 0.2156, |
| "mean_token_accuracy": 0.9144621640443802, |
| "num_tokens": 4963407.0, |
| "step": 19 |
| }, |
| { |
| "entropy": 0.228515625, |
| "epoch": 0.5111821086261981, |
| "grad_norm": 0.6315724849700928, |
| "learning_rate": 5e-06, |
| "loss": 0.2037, |
| "mean_token_accuracy": 0.9192509204149246, |
| "num_tokens": 5213864.0, |
| "step": 20 |
| }, |
| { |
| "entropy": 0.234619140625, |
| "epoch": 0.536741214057508, |
| "grad_norm": 0.5840864777565002, |
| "learning_rate": 5e-06, |
| "loss": 0.1997, |
| "mean_token_accuracy": 0.920286513864994, |
| "num_tokens": 5532478.0, |
| "step": 21 |
| }, |
| { |
| "entropy": 0.244384765625, |
| "epoch": 0.5623003194888179, |
| "grad_norm": 0.5714988708496094, |
| "learning_rate": 5e-06, |
| "loss": 0.2015, |
| "mean_token_accuracy": 0.9200754836201668, |
| "num_tokens": 5779266.0, |
| "step": 22 |
| }, |
| { |
| "entropy": 0.24267578125, |
| "epoch": 0.5878594249201278, |
| "grad_norm": 0.6089759469032288, |
| "learning_rate": 5e-06, |
| "loss": 0.1972, |
| "mean_token_accuracy": 0.9218065664172173, |
| "num_tokens": 6060432.0, |
| "step": 23 |
| }, |
| { |
| "entropy": 0.2325439453125, |
| "epoch": 0.6134185303514377, |
| "grad_norm": 0.5821586847305298, |
| "learning_rate": 5e-06, |
| "loss": 0.1843, |
| "mean_token_accuracy": 0.9265915080904961, |
| "num_tokens": 6301843.0, |
| "step": 24 |
| }, |
| { |
| "entropy": 0.2310791015625, |
| "epoch": 0.6389776357827476, |
| "grad_norm": 0.6131304502487183, |
| "learning_rate": 5e-06, |
| "loss": 0.1792, |
| "mean_token_accuracy": 0.9284531474113464, |
| "num_tokens": 6576585.0, |
| "step": 25 |
| }, |
| { |
| "entropy": 0.222412109375, |
| "epoch": 0.6645367412140575, |
| "grad_norm": 0.5503367781639099, |
| "learning_rate": 5e-06, |
| "loss": 0.1715, |
| "mean_token_accuracy": 0.9328160658478737, |
| "num_tokens": 6845186.0, |
| "step": 26 |
| }, |
| { |
| "entropy": 0.22998046875, |
| "epoch": 0.6900958466453674, |
| "grad_norm": 0.6361868381500244, |
| "learning_rate": 5e-06, |
| "loss": 0.1779, |
| "mean_token_accuracy": 0.9286485612392426, |
| "num_tokens": 7085348.0, |
| "step": 27 |
| }, |
| { |
| "entropy": 0.2066650390625, |
| "epoch": 0.7156549520766773, |
| "grad_norm": 0.7397343516349792, |
| "learning_rate": 5e-06, |
| "loss": 0.1923, |
| "mean_token_accuracy": 0.9265264719724655, |
| "num_tokens": 7399072.0, |
| "step": 28 |
| }, |
| { |
| "entropy": 0.218505859375, |
| "epoch": 0.7412140575079872, |
| "grad_norm": 0.6499117612838745, |
| "learning_rate": 5e-06, |
| "loss": 0.1824, |
| "mean_token_accuracy": 0.9268042370676994, |
| "num_tokens": 7643135.0, |
| "step": 29 |
| }, |
| { |
| "entropy": 0.2171630859375, |
| "epoch": 0.7667731629392971, |
| "grad_norm": 0.6052445769309998, |
| "learning_rate": 5e-06, |
| "loss": 0.1578, |
| "mean_token_accuracy": 0.9388716816902161, |
| "num_tokens": 7903421.0, |
| "step": 30 |
| }, |
| { |
| "entropy": 0.2227783203125, |
| "epoch": 0.792332268370607, |
| "grad_norm": 0.6016133427619934, |
| "learning_rate": 5e-06, |
| "loss": 0.1787, |
| "mean_token_accuracy": 0.9274549633264542, |
| "num_tokens": 8147609.0, |
| "step": 31 |
| }, |
| { |
| "entropy": 0.205078125, |
| "epoch": 0.8178913738019169, |
| "grad_norm": 0.5993157625198364, |
| "learning_rate": 5e-06, |
| "loss": 0.1415, |
| "mean_token_accuracy": 0.9419146031141281, |
| "num_tokens": 8430886.0, |
| "step": 32 |
| }, |
| { |
| "entropy": 0.2073974609375, |
| "epoch": 0.8434504792332268, |
| "grad_norm": 0.5889512896537781, |
| "learning_rate": 5e-06, |
| "loss": 0.1452, |
| "mean_token_accuracy": 0.940593808889389, |
| "num_tokens": 8708018.0, |
| "step": 33 |
| }, |
| { |
| "entropy": 0.2015380859375, |
| "epoch": 0.8690095846645367, |
| "grad_norm": 0.5472734570503235, |
| "learning_rate": 5e-06, |
| "loss": 0.1562, |
| "mean_token_accuracy": 0.9391490146517754, |
| "num_tokens": 8994205.0, |
| "step": 34 |
| }, |
| { |
| "entropy": 0.1910400390625, |
| "epoch": 0.8945686900958466, |
| "grad_norm": 0.6416247487068176, |
| "learning_rate": 5e-06, |
| "loss": 0.1542, |
| "mean_token_accuracy": 0.9384341165423393, |
| "num_tokens": 9269249.0, |
| "step": 35 |
| }, |
| { |
| "entropy": 0.2125244140625, |
| "epoch": 0.9201277955271565, |
| "grad_norm": 0.7481750845909119, |
| "learning_rate": 5e-06, |
| "loss": 0.1774, |
| "mean_token_accuracy": 0.9291663020849228, |
| "num_tokens": 9528037.0, |
| "step": 36 |
| }, |
| { |
| "entropy": 0.1834716796875, |
| "epoch": 0.9456869009584664, |
| "grad_norm": 0.5720862746238708, |
| "learning_rate": 5e-06, |
| "loss": 0.1326, |
| "mean_token_accuracy": 0.9485453143715858, |
| "num_tokens": 9862404.0, |
| "step": 37 |
| }, |
| { |
| "entropy": 0.2203369140625, |
| "epoch": 0.9712460063897763, |
| "grad_norm": 0.6076711416244507, |
| "learning_rate": 5e-06, |
| "loss": 0.1596, |
| "mean_token_accuracy": 0.9337968751788139, |
| "num_tokens": 10098985.0, |
| "step": 38 |
| }, |
| { |
| "entropy": 0.1817626953125, |
| "epoch": 0.9968051118210862, |
| "grad_norm": 0.5613975524902344, |
| "learning_rate": 5e-06, |
| "loss": 0.1129, |
| "mean_token_accuracy": 0.9513632953166962, |
| "num_tokens": 10388638.0, |
| "step": 39 |
| }, |
| { |
| "entropy": 0.216796875, |
| "epoch": 1.0, |
| "grad_norm": 1.4142874479293823, |
| "learning_rate": 5e-06, |
| "loss": 0.1869, |
| "mean_token_accuracy": 0.9235668778419495, |
| "num_tokens": 10415446.0, |
| "step": 40 |
| } |
| ], |
| "logging_steps": 1.0, |
| "max_steps": 40, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 10000, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 34104797593600.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|