| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 20.0, |
| "eval_steps": 500, |
| "global_step": 860, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 1.0, |
| "eval_loss": 0.45247510075569153, |
| "eval_runtime": 0.157, |
| "eval_samples_per_second": 191.091, |
| "eval_steps_per_second": 12.739, |
| "step": 43 |
| }, |
| { |
| "epoch": 2.0, |
| "eval_loss": 0.4867699444293976, |
| "eval_runtime": 0.156, |
| "eval_samples_per_second": 192.268, |
| "eval_steps_per_second": 12.818, |
| "step": 86 |
| }, |
| { |
| "epoch": 3.0, |
| "eval_loss": 0.48485469818115234, |
| "eval_runtime": 0.1559, |
| "eval_samples_per_second": 192.447, |
| "eval_steps_per_second": 12.83, |
| "step": 129 |
| }, |
| { |
| "epoch": 4.0, |
| "eval_loss": 0.7582117915153503, |
| "eval_runtime": 0.1559, |
| "eval_samples_per_second": 192.397, |
| "eval_steps_per_second": 12.826, |
| "step": 172 |
| }, |
| { |
| "epoch": 5.0, |
| "eval_loss": 0.7927761673927307, |
| "eval_runtime": 0.1557, |
| "eval_samples_per_second": 192.691, |
| "eval_steps_per_second": 12.846, |
| "step": 215 |
| }, |
| { |
| "epoch": 6.0, |
| "eval_loss": 0.7254356145858765, |
| "eval_runtime": 0.1559, |
| "eval_samples_per_second": 192.411, |
| "eval_steps_per_second": 12.827, |
| "step": 258 |
| }, |
| { |
| "epoch": 7.0, |
| "eval_loss": 0.7872496843338013, |
| "eval_runtime": 0.1557, |
| "eval_samples_per_second": 192.632, |
| "eval_steps_per_second": 12.842, |
| "step": 301 |
| }, |
| { |
| "epoch": 8.0, |
| "eval_loss": 0.8784911632537842, |
| "eval_runtime": 0.1559, |
| "eval_samples_per_second": 192.468, |
| "eval_steps_per_second": 12.831, |
| "step": 344 |
| }, |
| { |
| "epoch": 9.0, |
| "eval_loss": 0.8622080087661743, |
| "eval_runtime": 0.1558, |
| "eval_samples_per_second": 192.551, |
| "eval_steps_per_second": 12.837, |
| "step": 387 |
| }, |
| { |
| "epoch": 10.0, |
| "eval_loss": 0.9194027185440063, |
| "eval_runtime": 0.156, |
| "eval_samples_per_second": 192.324, |
| "eval_steps_per_second": 12.822, |
| "step": 430 |
| }, |
| { |
| "epoch": 11.0, |
| "eval_loss": 0.9297309517860413, |
| "eval_runtime": 0.1562, |
| "eval_samples_per_second": 192.12, |
| "eval_steps_per_second": 12.808, |
| "step": 473 |
| }, |
| { |
| "epoch": 11.627906976744185, |
| "grad_norm": 0.00010515031317481771, |
| "learning_rate": 2.0930232558139536e-05, |
| "loss": 0.0047, |
| "step": 500 |
| }, |
| { |
| "epoch": 12.0, |
| "eval_loss": 0.9377282857894897, |
| "eval_runtime": 0.1561, |
| "eval_samples_per_second": 192.125, |
| "eval_steps_per_second": 12.808, |
| "step": 516 |
| }, |
| { |
| "epoch": 13.0, |
| "eval_loss": 0.9441520571708679, |
| "eval_runtime": 0.1561, |
| "eval_samples_per_second": 192.157, |
| "eval_steps_per_second": 12.81, |
| "step": 559 |
| }, |
| { |
| "epoch": 14.0, |
| "eval_loss": 0.949636697769165, |
| "eval_runtime": 0.1558, |
| "eval_samples_per_second": 192.546, |
| "eval_steps_per_second": 12.836, |
| "step": 602 |
| }, |
| { |
| "epoch": 15.0, |
| "eval_loss": 0.9553152322769165, |
| "eval_runtime": 0.1561, |
| "eval_samples_per_second": 192.155, |
| "eval_steps_per_second": 12.81, |
| "step": 645 |
| }, |
| { |
| "epoch": 16.0, |
| "eval_loss": 0.9605836868286133, |
| "eval_runtime": 0.1561, |
| "eval_samples_per_second": 192.19, |
| "eval_steps_per_second": 12.813, |
| "step": 688 |
| }, |
| { |
| "epoch": 17.0, |
| "eval_loss": 0.963508665561676, |
| "eval_runtime": 0.156, |
| "eval_samples_per_second": 192.299, |
| "eval_steps_per_second": 12.82, |
| "step": 731 |
| }, |
| { |
| "epoch": 18.0, |
| "eval_loss": 0.9657307863235474, |
| "eval_runtime": 0.156, |
| "eval_samples_per_second": 192.301, |
| "eval_steps_per_second": 12.82, |
| "step": 774 |
| }, |
| { |
| "epoch": 19.0, |
| "eval_loss": 0.9671648740768433, |
| "eval_runtime": 0.1559, |
| "eval_samples_per_second": 192.426, |
| "eval_steps_per_second": 12.828, |
| "step": 817 |
| }, |
| { |
| "epoch": 20.0, |
| "eval_loss": 0.9676177501678467, |
| "eval_runtime": 0.1557, |
| "eval_samples_per_second": 192.622, |
| "eval_steps_per_second": 12.841, |
| "step": 860 |
| } |
| ], |
| "logging_steps": 500, |
| "max_steps": 860, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 20, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2214490013337600.0, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|