| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 15.0, |
| "global_step": 10485, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.72, |
| "learning_rate": 9.523128278493086e-05, |
| "loss": 4.851, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.43, |
| "learning_rate": 9.046256556986171e-05, |
| "loss": 2.0167, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.15, |
| "learning_rate": 8.569384835479256e-05, |
| "loss": 1.4395, |
| "step": 1500 |
| }, |
| { |
| "epoch": 2.86, |
| "learning_rate": 8.092513113972342e-05, |
| "loss": 1.2823, |
| "step": 2000 |
| }, |
| { |
| "epoch": 3.58, |
| "learning_rate": 7.615641392465427e-05, |
| "loss": 1.1926, |
| "step": 2500 |
| }, |
| { |
| "epoch": 4.29, |
| "learning_rate": 7.138769670958512e-05, |
| "loss": 1.1384, |
| "step": 3000 |
| }, |
| { |
| "epoch": 5.01, |
| "learning_rate": 6.661897949451598e-05, |
| "loss": 1.1166, |
| "step": 3500 |
| }, |
| { |
| "epoch": 5.72, |
| "learning_rate": 6.185026227944683e-05, |
| "loss": 1.0845, |
| "step": 4000 |
| }, |
| { |
| "epoch": 6.44, |
| "learning_rate": 5.7081545064377684e-05, |
| "loss": 1.0691, |
| "step": 4500 |
| }, |
| { |
| "epoch": 7.15, |
| "learning_rate": 5.2312827849308544e-05, |
| "loss": 1.0518, |
| "step": 5000 |
| }, |
| { |
| "epoch": 7.87, |
| "learning_rate": 4.754411063423939e-05, |
| "loss": 1.0392, |
| "step": 5500 |
| }, |
| { |
| "epoch": 8.58, |
| "learning_rate": 4.2775393419170244e-05, |
| "loss": 1.0297, |
| "step": 6000 |
| }, |
| { |
| "epoch": 9.3, |
| "learning_rate": 3.80066762041011e-05, |
| "loss": 1.0176, |
| "step": 6500 |
| }, |
| { |
| "epoch": 10.01, |
| "learning_rate": 3.323795898903195e-05, |
| "loss": 1.009, |
| "step": 7000 |
| }, |
| { |
| "epoch": 10.73, |
| "learning_rate": 2.8469241773962807e-05, |
| "loss": 1.0109, |
| "step": 7500 |
| }, |
| { |
| "epoch": 11.44, |
| "learning_rate": 2.3700524558893657e-05, |
| "loss": 0.9961, |
| "step": 8000 |
| }, |
| { |
| "epoch": 12.16, |
| "learning_rate": 1.8931807343824514e-05, |
| "loss": 1.0009, |
| "step": 8500 |
| }, |
| { |
| "epoch": 12.88, |
| "learning_rate": 1.4163090128755365e-05, |
| "loss": 0.9911, |
| "step": 9000 |
| }, |
| { |
| "epoch": 13.59, |
| "learning_rate": 9.394372913686218e-06, |
| "loss": 0.9915, |
| "step": 9500 |
| }, |
| { |
| "epoch": 14.31, |
| "learning_rate": 4.6256556986170724e-06, |
| "loss": 0.9892, |
| "step": 10000 |
| }, |
| { |
| "epoch": 15.0, |
| "step": 10485, |
| "total_flos": 9.340989595996652e+17, |
| "train_loss": 1.2998973404389083, |
| "train_runtime": 9771.4938, |
| "train_samples_per_second": 137.17, |
| "train_steps_per_second": 1.073 |
| } |
| ], |
| "max_steps": 10485, |
| "num_train_epochs": 15, |
| "total_flos": 9.340989595996652e+17, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|