| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 100, |
| "global_step": 1000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": false, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.1, |
| "grad_norm": 11.13700008392334, |
| "learning_rate": 0.0003973800426880847, |
| "loss": 66.094375, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.1, |
| "eval_accuracy": 0.10251663405088063, |
| "eval_loss": 62.88532638549805, |
| "eval_runtime": 12.9078, |
| "eval_samples_per_second": 9.684, |
| "eval_steps_per_second": 1.24, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.2, |
| "grad_norm": 6.741835117340088, |
| "learning_rate": 0.0003762085737488283, |
| "loss": 62.0001123046875, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.2, |
| "eval_accuracy": 0.11803913894324854, |
| "eval_loss": 61.526912689208984, |
| "eval_runtime": 8.6535, |
| "eval_samples_per_second": 14.445, |
| "eval_steps_per_second": 1.849, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.3, |
| "grad_norm": 7.0108513832092285, |
| "learning_rate": 0.00033594217168615465, |
| "loss": 61.543701171875, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.3, |
| "eval_accuracy": 0.11293346379647749, |
| "eval_loss": 60.98686599731445, |
| "eval_runtime": 8.6635, |
| "eval_samples_per_second": 14.428, |
| "eval_steps_per_second": 1.847, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.4, |
| "grad_norm": 10.79574203491211, |
| "learning_rate": 0.00028094432596115747, |
| "loss": 61.318671875, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.4, |
| "eval_accuracy": 0.1016477495107632, |
| "eval_loss": 61.48467254638672, |
| "eval_runtime": 8.6224, |
| "eval_samples_per_second": 14.497, |
| "eval_steps_per_second": 1.856, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.5, |
| "grad_norm": 6.4634199142456055, |
| "learning_rate": 0.00021717490653764342, |
| "loss": 60.952919921875, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.5, |
| "eval_accuracy": 0.09600978473581213, |
| "eval_loss": 61.699729919433594, |
| "eval_runtime": 8.3835, |
| "eval_samples_per_second": 14.91, |
| "eval_steps_per_second": 1.909, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.6, |
| "grad_norm": 9.323127746582031, |
| "learning_rate": 0.00015154431949464275, |
| "loss": 60.478193359375, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.6, |
| "eval_accuracy": 0.122, |
| "eval_loss": 60.42253494262695, |
| "eval_runtime": 9.026, |
| "eval_samples_per_second": 13.849, |
| "eval_steps_per_second": 1.773, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.7, |
| "grad_norm": 9.785552978515625, |
| "learning_rate": 9.11646573017482e-05, |
| "loss": 60.1034619140625, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.7, |
| "eval_accuracy": 0.1186399217221135, |
| "eval_loss": 60.06114196777344, |
| "eval_runtime": 8.5914, |
| "eval_samples_per_second": 14.55, |
| "eval_steps_per_second": 1.862, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.8, |
| "grad_norm": 8.054394721984863, |
| "learning_rate": 4.2578993244549506e-05, |
| "loss": 59.673642578125, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.8, |
| "eval_accuracy": 0.13012133072407045, |
| "eval_loss": 59.73853302001953, |
| "eval_runtime": 8.4067, |
| "eval_samples_per_second": 14.869, |
| "eval_steps_per_second": 1.903, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.9, |
| "grad_norm": 8.334230422973633, |
| "learning_rate": 1.1052337907897503e-05, |
| "loss": 59.854453125, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.9, |
| "eval_accuracy": 0.12184931506849316, |
| "eval_loss": 59.623390197753906, |
| "eval_runtime": 8.5711, |
| "eval_samples_per_second": 14.584, |
| "eval_steps_per_second": 1.867, |
| "step": 900 |
| }, |
| { |
| "epoch": 1.0, |
| "grad_norm": 8.61923599243164, |
| "learning_rate": 1.093583978573065e-09, |
| "loss": 59.846630859375, |
| "step": 1000 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_accuracy": 0.123146771037182, |
| "eval_loss": 59.59795379638672, |
| "eval_runtime": 8.6863, |
| "eval_samples_per_second": 14.39, |
| "eval_steps_per_second": 1.842, |
| "step": 1000 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 1000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 9223372036854775807, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|