| { |
| "best_global_step": 500, |
| "best_metric": 0.23719677329063416, |
| "best_model_checkpoint": "bart-pristine-finetune/checkpoint-500", |
| "epoch": 0.6955312119631368, |
| "eval_steps": 500, |
| "global_step": 2000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.03477656059815684, |
| "grad_norm": 18.65494728088379, |
| "learning_rate": 9.900000000000002e-06, |
| "loss": 6.5893, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.06955312119631368, |
| "grad_norm": 15.10452938079834, |
| "learning_rate": 1.9900000000000003e-05, |
| "loss": 1.9811, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.10432968179447052, |
| "grad_norm": 1.449442744255066, |
| "learning_rate": 2.9900000000000002e-05, |
| "loss": 0.3884, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.13910624239262737, |
| "grad_norm": 0.8391104340553284, |
| "learning_rate": 3.99e-05, |
| "loss": 0.1479, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.1738828029907842, |
| "grad_norm": 0.8194042444229126, |
| "learning_rate": 4.99e-05, |
| "loss": 0.1068, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.1738828029907842, |
| "eval_gen_len": 20.974, |
| "eval_loss": 0.23719677329063416, |
| "eval_rouge1": 0.4651, |
| "eval_rouge2": 0.3753, |
| "eval_rougeL": 0.4611, |
| "eval_rougeLsum": 0.4615, |
| "eval_runtime": 131.8304, |
| "eval_samples_per_second": 36.737, |
| "eval_steps_per_second": 2.298, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.20865936358894105, |
| "grad_norm": 1.0611430406570435, |
| "learning_rate": 4.998169963441797e-05, |
| "loss": 0.0866, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.2434359241870979, |
| "grad_norm": 0.7572854161262512, |
| "learning_rate": 4.99260846907095e-05, |
| "loss": 0.0751, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.27821248478525473, |
| "grad_norm": 0.7568580508232117, |
| "learning_rate": 4.9833236376345854e-05, |
| "loss": 0.0673, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.3129890453834116, |
| "grad_norm": 0.7505958676338196, |
| "learning_rate": 4.970329338361449e-05, |
| "loss": 0.0568, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.3477656059815684, |
| "grad_norm": 0.47339868545532227, |
| "learning_rate": 4.9536449815025784e-05, |
| "loss": 0.0549, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.3477656059815684, |
| "eval_gen_len": 20.9787, |
| "eval_loss": 0.25489160418510437, |
| "eval_rouge1": 0.4699, |
| "eval_rouge2": 0.3828, |
| "eval_rougeL": 0.4652, |
| "eval_rougeLsum": 0.4655, |
| "eval_runtime": 132.5745, |
| "eval_samples_per_second": 36.53, |
| "eval_steps_per_second": 2.286, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.3825421665797253, |
| "grad_norm": 0.6434345245361328, |
| "learning_rate": 4.9332954893372166e-05, |
| "loss": 0.0509, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.4173187271778821, |
| "grad_norm": 0.6275453567504883, |
| "learning_rate": 4.909311258945123e-05, |
| "loss": 0.0498, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.45209528777603897, |
| "grad_norm": 0.4585914611816406, |
| "learning_rate": 4.881728116800898e-05, |
| "loss": 0.0462, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.4868718483741958, |
| "grad_norm": 0.5186077356338501, |
| "learning_rate": 4.8505872652581405e-05, |
| "loss": 0.0401, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.5216484089723527, |
| "grad_norm": 0.6465528011322021, |
| "learning_rate": 4.815935221003384e-05, |
| "loss": 0.0419, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.5216484089723527, |
| "eval_gen_len": 20.976, |
| "eval_loss": 0.25857001543045044, |
| "eval_rouge1": 0.4613, |
| "eval_rouge2": 0.3799, |
| "eval_rougeL": 0.457, |
| "eval_rougeLsum": 0.4573, |
| "eval_runtime": 132.433, |
| "eval_samples_per_second": 36.569, |
| "eval_steps_per_second": 2.288, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.5564249695705095, |
| "grad_norm": 0.5534175634384155, |
| "learning_rate": 4.77782374557173e-05, |
| "loss": 0.0362, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.5912015301686663, |
| "grad_norm": 0.6548935770988464, |
| "learning_rate": 4.7363097680279955e-05, |
| "loss": 0.0376, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.6259780907668232, |
| "grad_norm": 0.5545147657394409, |
| "learning_rate": 4.691455299928845e-05, |
| "loss": 0.0353, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.66075465136498, |
| "grad_norm": 0.5930569767951965, |
| "learning_rate": 4.6433273426929536e-05, |
| "loss": 0.0344, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.6955312119631368, |
| "grad_norm": 0.38679584860801697, |
| "learning_rate": 4.59199778751755e-05, |
| "loss": 0.03, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.6955312119631368, |
| "eval_gen_len": 20.9845, |
| "eval_loss": 0.25054243206977844, |
| "eval_rouge1": 0.4638, |
| "eval_rouge2": 0.3831, |
| "eval_rougeL": 0.4593, |
| "eval_rougeLsum": 0.4596, |
| "eval_runtime": 132.3868, |
| "eval_samples_per_second": 36.582, |
| "eval_steps_per_second": 2.289, |
| "step": 2000 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 8628, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "EarlyStoppingCallback": { |
| "args": { |
| "early_stopping_patience": 3, |
| "early_stopping_threshold": 0.0 |
| }, |
| "attributes": { |
| "early_stopping_patience_counter": 3 |
| } |
| }, |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2438945832960000.0, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|