| { |
| "best_global_step": 3000, |
| "best_metric": 0.029462991282343864, |
| "best_model_checkpoint": "bart-finetune/checkpoint-3000", |
| "epoch": 2.602169197396963, |
| "eval_steps": 500, |
| "global_step": 3000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.08676789587852494, |
| "grad_norm": 21.48098373413086, |
| "learning_rate": 9.900000000000002e-06, |
| "loss": 6.7932, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.1735357917570499, |
| "grad_norm": 15.391678810119629, |
| "learning_rate": 1.9900000000000003e-05, |
| "loss": 1.9607, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.2603036876355748, |
| "grad_norm": 1.106106162071228, |
| "learning_rate": 2.9900000000000002e-05, |
| "loss": 0.3208, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.3470715835140998, |
| "grad_norm": 0.49806028604507446, |
| "learning_rate": 3.99e-05, |
| "loss": 0.1053, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.43383947939262474, |
| "grad_norm": 0.6099858283996582, |
| "learning_rate": 4.99e-05, |
| "loss": 0.0796, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.43383947939262474, |
| "eval_gen_len": 20.9534, |
| "eval_loss": 0.07227330654859543, |
| "eval_rouge1": 0.5527, |
| "eval_rouge2": 0.48, |
| "eval_rougeL": 0.5514, |
| "eval_rougeLsum": 0.5512, |
| "eval_runtime": 138.4831, |
| "eval_samples_per_second": 36.105, |
| "eval_steps_per_second": 1.134, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.5206073752711496, |
| "grad_norm": 0.6509439945220947, |
| "learning_rate": 4.986202819587417e-05, |
| "loss": 0.067, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.6073752711496746, |
| "grad_norm": 0.500281035900116, |
| "learning_rate": 4.9444083154139556e-05, |
| "loss": 0.0619, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.6941431670281996, |
| "grad_norm": 0.4781886637210846, |
| "learning_rate": 4.8750857533072125e-05, |
| "loss": 0.0548, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.7809110629067245, |
| "grad_norm": 0.7466514706611633, |
| "learning_rate": 4.779015819330858e-05, |
| "loss": 0.05, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.8676789587852495, |
| "grad_norm": 0.35372403264045715, |
| "learning_rate": 4.657280418947031e-05, |
| "loss": 0.0457, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.8676789587852495, |
| "eval_gen_len": 20.9522, |
| "eval_loss": 0.04318917542695999, |
| "eval_rouge1": 0.5727, |
| "eval_rouge2": 0.507, |
| "eval_rougeL": 0.5719, |
| "eval_rougeLsum": 0.5717, |
| "eval_runtime": 137.86, |
| "eval_samples_per_second": 36.269, |
| "eval_steps_per_second": 1.139, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.9544468546637744, |
| "grad_norm": 0.3598574697971344, |
| "learning_rate": 4.5112504929814395e-05, |
| "loss": 0.0428, |
| "step": 1100 |
| }, |
| { |
| "epoch": 1.0407809110629067, |
| "grad_norm": 0.5030230283737183, |
| "learning_rate": 4.3425705785748786e-05, |
| "loss": 0.0391, |
| "step": 1200 |
| }, |
| { |
| "epoch": 1.1275488069414317, |
| "grad_norm": 0.29542213678359985, |
| "learning_rate": 4.1531402889902754e-05, |
| "loss": 0.0354, |
| "step": 1300 |
| }, |
| { |
| "epoch": 1.2143167028199566, |
| "grad_norm": 0.28244778513908386, |
| "learning_rate": 3.94509292084306e-05, |
| "loss": 0.033, |
| "step": 1400 |
| }, |
| { |
| "epoch": 1.3010845986984816, |
| "grad_norm": 0.34228453040122986, |
| "learning_rate": 3.72077142967266e-05, |
| "loss": 0.0328, |
| "step": 1500 |
| }, |
| { |
| "epoch": 1.3010845986984816, |
| "eval_gen_len": 20.9518, |
| "eval_loss": 0.03781509771943092, |
| "eval_rouge1": 0.5696, |
| "eval_rouge2": 0.5047, |
| "eval_rougeL": 0.5686, |
| "eval_rougeLsum": 0.5684, |
| "eval_runtime": 137.8154, |
| "eval_samples_per_second": 36.28, |
| "eval_steps_per_second": 1.139, |
| "step": 1500 |
| }, |
| { |
| "epoch": 1.3878524945770065, |
| "grad_norm": 0.24588140845298767, |
| "learning_rate": 3.4827020444096845e-05, |
| "loss": 0.0319, |
| "step": 1600 |
| }, |
| { |
| "epoch": 1.4746203904555315, |
| "grad_norm": 0.349103718996048, |
| "learning_rate": 3.233565817883292e-05, |
| "loss": 0.0326, |
| "step": 1700 |
| }, |
| { |
| "epoch": 1.5613882863340565, |
| "grad_norm": 0.3223339915275574, |
| "learning_rate": 2.9761684337568257e-05, |
| "loss": 0.0292, |
| "step": 1800 |
| }, |
| { |
| "epoch": 1.6481561822125812, |
| "grad_norm": 0.30051344633102417, |
| "learning_rate": 2.7134086099152762e-05, |
| "loss": 0.0283, |
| "step": 1900 |
| }, |
| { |
| "epoch": 1.7349240780911064, |
| "grad_norm": 0.2447238564491272, |
| "learning_rate": 2.4482454541343916e-05, |
| "loss": 0.0285, |
| "step": 2000 |
| }, |
| { |
| "epoch": 1.7349240780911064, |
| "eval_gen_len": 20.9532, |
| "eval_loss": 0.03255747631192207, |
| "eval_rouge1": 0.5758, |
| "eval_rouge2": 0.5137, |
| "eval_rougeL": 0.5751, |
| "eval_rougeLsum": 0.5749, |
| "eval_runtime": 138.1212, |
| "eval_samples_per_second": 36.2, |
| "eval_steps_per_second": 1.137, |
| "step": 2000 |
| }, |
| { |
| "epoch": 1.8216919739696311, |
| "grad_norm": 0.457000732421875, |
| "learning_rate": 2.1836651396603035e-05, |
| "loss": 0.0263, |
| "step": 2100 |
| }, |
| { |
| "epoch": 1.9084598698481563, |
| "grad_norm": 0.2774176001548767, |
| "learning_rate": 1.922647275987431e-05, |
| "loss": 0.0266, |
| "step": 2200 |
| }, |
| { |
| "epoch": 1.995227765726681, |
| "grad_norm": 0.4951108694076538, |
| "learning_rate": 1.668131353555037e-05, |
| "loss": 0.0257, |
| "step": 2300 |
| }, |
| { |
| "epoch": 2.0815618221258134, |
| "grad_norm": 0.20267550647258759, |
| "learning_rate": 1.4229836402503139e-05, |
| "loss": 0.0222, |
| "step": 2400 |
| }, |
| { |
| "epoch": 2.1683297180043386, |
| "grad_norm": 0.24006444215774536, |
| "learning_rate": 1.1899649025178486e-05, |
| "loss": 0.0219, |
| "step": 2500 |
| }, |
| { |
| "epoch": 2.1683297180043386, |
| "eval_gen_len": 20.9518, |
| "eval_loss": 0.030334332957863808, |
| "eval_rouge1": 0.5764, |
| "eval_rouge2": 0.5152, |
| "eval_rougeL": 0.5755, |
| "eval_rougeLsum": 0.5754, |
| "eval_runtime": 137.9642, |
| "eval_samples_per_second": 36.241, |
| "eval_steps_per_second": 1.138, |
| "step": 2500 |
| }, |
| { |
| "epoch": 2.2550976138828633, |
| "grad_norm": 0.39135313034057617, |
| "learning_rate": 9.716993145888406e-06, |
| "loss": 0.0198, |
| "step": 2600 |
| }, |
| { |
| "epoch": 2.341865509761388, |
| "grad_norm": 0.23596180975437164, |
| "learning_rate": 7.706449059632987e-06, |
| "loss": 0.0209, |
| "step": 2700 |
| }, |
| { |
| "epoch": 2.4286334056399133, |
| "grad_norm": 0.21738794445991516, |
| "learning_rate": 5.890658799551618e-06, |
| "loss": 0.0223, |
| "step": 2800 |
| }, |
| { |
| "epoch": 2.5154013015184384, |
| "grad_norm": 0.2256348580121994, |
| "learning_rate": 4.29007115039071e-06, |
| "loss": 0.0199, |
| "step": 2900 |
| }, |
| { |
| "epoch": 2.602169197396963, |
| "grad_norm": 0.2328837364912033, |
| "learning_rate": 2.9227113615554275e-06, |
| "loss": 0.0218, |
| "step": 3000 |
| }, |
| { |
| "epoch": 2.602169197396963, |
| "eval_gen_len": 20.9522, |
| "eval_loss": 0.029462991282343864, |
| "eval_rouge1": 0.5768, |
| "eval_rouge2": 0.5152, |
| "eval_rougeL": 0.5757, |
| "eval_rougeLsum": 0.5757, |
| "eval_runtime": 138.2266, |
| "eval_samples_per_second": 36.172, |
| "eval_steps_per_second": 1.136, |
| "step": 3000 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 3459, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "EarlyStoppingCallback": { |
| "args": { |
| "early_stopping_patience": 3, |
| "early_stopping_threshold": 0.0 |
| }, |
| "attributes": { |
| "early_stopping_patience_counter": 0 |
| } |
| }, |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 6170237616291840.0, |
| "train_batch_size": 32, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|