| { |
| "train_sec": 927.9, |
| "max_length": 2816, |
| "think": false, |
| "epochs": 3, |
| "lr": 5e-06, |
| "log_history": [ |
| { |
| "eval_loss": 0.33602747321128845, |
| "eval_runtime": 8.8236, |
| "eval_samples_per_second": 12.127, |
| "eval_steps_per_second": 12.127, |
| "eval_entropy": 0.3295369472737624, |
| "eval_num_tokens": 4799219.0, |
| "eval_mean_token_accuracy": 0.9163304918280272, |
| "epoch": 2.625514403292181, |
| "step": 160 |
| }, |
| { |
| "loss": 0.34753003120422366, |
| "grad_norm": 2.71875, |
| "learning_rate": 1.4733707847247814e-07, |
| "entropy": 0.33421541005373, |
| "num_tokens": 4950630.0, |
| "mean_token_accuracy": 0.9143238365650177, |
| "epoch": 2.707818930041152, |
| "step": 165 |
| }, |
| { |
| "loss": 0.36279208660125734, |
| "grad_norm": 2.65625, |
| "learning_rate": 8.035874876982957e-08, |
| "entropy": 0.35163953751325605, |
| "num_tokens": 5099094.0, |
| "mean_token_accuracy": 0.9107247442007065, |
| "epoch": 2.7901234567901234, |
| "step": 170 |
| }, |
| { |
| "loss": 0.3491449594497681, |
| "grad_norm": 2.65625, |
| "learning_rate": 3.331468007589489e-08, |
| "entropy": 0.3429010361433029, |
| "num_tokens": 5250072.0, |
| "mean_token_accuracy": 0.9129759073257446, |
| "epoch": 2.8724279835390947, |
| "step": 175 |
| }, |
| { |
| "loss": 0.3632668018341064, |
| "grad_norm": 2.828125, |
| "learning_rate": 6.592445855863883e-09, |
| "entropy": 0.35197630524635315, |
| "num_tokens": 5402349.0, |
| "mean_token_accuracy": 0.9110080420970916, |
| "epoch": 2.954732510288066, |
| "step": 180 |
| }, |
| { |
| "eval_loss": 0.3358902931213379, |
| "eval_runtime": 8.9103, |
| "eval_samples_per_second": 12.009, |
| "eval_steps_per_second": 12.009, |
| "eval_entropy": 0.3294877093807559, |
| "eval_num_tokens": 5402349.0, |
| "eval_mean_token_accuracy": 0.9162927815847308, |
| "epoch": 2.954732510288066, |
| "step": 180 |
| }, |
| { |
| "eval_loss": 0.3358490765094757, |
| "eval_runtime": 9.0019, |
| "eval_samples_per_second": 11.886, |
| "eval_steps_per_second": 11.886, |
| "eval_entropy": 0.3295578314600704, |
| "eval_num_tokens": 5483673.0, |
| "eval_mean_token_accuracy": 0.9165575621284057, |
| "epoch": 3.0, |
| "step": 183 |
| }, |
| { |
| "train_runtime": 925.9091, |
| "train_samples_per_second": 3.146, |
| "train_steps_per_second": 0.198, |
| "total_flos": 1.4492276975075328e+16, |
| "train_loss": 0.38517201207374613, |
| "epoch": 3.0, |
| "step": 183 |
| } |
| ] |
| } |