bart-finetune-v2 / checkpoint-3000 /trainer_state.json
de-slothbug's picture
End of full fine-tuning with BART
f11bfdd verified
Raw
History Blame Contribute Delete
8.45 kB
{
"best_global_step": 3000,
"best_metric": 0.029462991282343864,
"best_model_checkpoint": "bart-finetune/checkpoint-3000",
"epoch": 2.602169197396963,
"eval_steps": 500,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.08676789587852494,
"grad_norm": 21.48098373413086,
"learning_rate": 9.900000000000002e-06,
"loss": 6.7932,
"step": 100
},
{
"epoch": 0.1735357917570499,
"grad_norm": 15.391678810119629,
"learning_rate": 1.9900000000000003e-05,
"loss": 1.9607,
"step": 200
},
{
"epoch": 0.2603036876355748,
"grad_norm": 1.106106162071228,
"learning_rate": 2.9900000000000002e-05,
"loss": 0.3208,
"step": 300
},
{
"epoch": 0.3470715835140998,
"grad_norm": 0.49806028604507446,
"learning_rate": 3.99e-05,
"loss": 0.1053,
"step": 400
},
{
"epoch": 0.43383947939262474,
"grad_norm": 0.6099858283996582,
"learning_rate": 4.99e-05,
"loss": 0.0796,
"step": 500
},
{
"epoch": 0.43383947939262474,
"eval_gen_len": 20.9534,
"eval_loss": 0.07227330654859543,
"eval_rouge1": 0.5527,
"eval_rouge2": 0.48,
"eval_rougeL": 0.5514,
"eval_rougeLsum": 0.5512,
"eval_runtime": 138.4831,
"eval_samples_per_second": 36.105,
"eval_steps_per_second": 1.134,
"step": 500
},
{
"epoch": 0.5206073752711496,
"grad_norm": 0.6509439945220947,
"learning_rate": 4.986202819587417e-05,
"loss": 0.067,
"step": 600
},
{
"epoch": 0.6073752711496746,
"grad_norm": 0.500281035900116,
"learning_rate": 4.9444083154139556e-05,
"loss": 0.0619,
"step": 700
},
{
"epoch": 0.6941431670281996,
"grad_norm": 0.4781886637210846,
"learning_rate": 4.8750857533072125e-05,
"loss": 0.0548,
"step": 800
},
{
"epoch": 0.7809110629067245,
"grad_norm": 0.7466514706611633,
"learning_rate": 4.779015819330858e-05,
"loss": 0.05,
"step": 900
},
{
"epoch": 0.8676789587852495,
"grad_norm": 0.35372403264045715,
"learning_rate": 4.657280418947031e-05,
"loss": 0.0457,
"step": 1000
},
{
"epoch": 0.8676789587852495,
"eval_gen_len": 20.9522,
"eval_loss": 0.04318917542695999,
"eval_rouge1": 0.5727,
"eval_rouge2": 0.507,
"eval_rougeL": 0.5719,
"eval_rougeLsum": 0.5717,
"eval_runtime": 137.86,
"eval_samples_per_second": 36.269,
"eval_steps_per_second": 1.139,
"step": 1000
},
{
"epoch": 0.9544468546637744,
"grad_norm": 0.3598574697971344,
"learning_rate": 4.5112504929814395e-05,
"loss": 0.0428,
"step": 1100
},
{
"epoch": 1.0407809110629067,
"grad_norm": 0.5030230283737183,
"learning_rate": 4.3425705785748786e-05,
"loss": 0.0391,
"step": 1200
},
{
"epoch": 1.1275488069414317,
"grad_norm": 0.29542213678359985,
"learning_rate": 4.1531402889902754e-05,
"loss": 0.0354,
"step": 1300
},
{
"epoch": 1.2143167028199566,
"grad_norm": 0.28244778513908386,
"learning_rate": 3.94509292084306e-05,
"loss": 0.033,
"step": 1400
},
{
"epoch": 1.3010845986984816,
"grad_norm": 0.34228453040122986,
"learning_rate": 3.72077142967266e-05,
"loss": 0.0328,
"step": 1500
},
{
"epoch": 1.3010845986984816,
"eval_gen_len": 20.9518,
"eval_loss": 0.03781509771943092,
"eval_rouge1": 0.5696,
"eval_rouge2": 0.5047,
"eval_rougeL": 0.5686,
"eval_rougeLsum": 0.5684,
"eval_runtime": 137.8154,
"eval_samples_per_second": 36.28,
"eval_steps_per_second": 1.139,
"step": 1500
},
{
"epoch": 1.3878524945770065,
"grad_norm": 0.24588140845298767,
"learning_rate": 3.4827020444096845e-05,
"loss": 0.0319,
"step": 1600
},
{
"epoch": 1.4746203904555315,
"grad_norm": 0.349103718996048,
"learning_rate": 3.233565817883292e-05,
"loss": 0.0326,
"step": 1700
},
{
"epoch": 1.5613882863340565,
"grad_norm": 0.3223339915275574,
"learning_rate": 2.9761684337568257e-05,
"loss": 0.0292,
"step": 1800
},
{
"epoch": 1.6481561822125812,
"grad_norm": 0.30051344633102417,
"learning_rate": 2.7134086099152762e-05,
"loss": 0.0283,
"step": 1900
},
{
"epoch": 1.7349240780911064,
"grad_norm": 0.2447238564491272,
"learning_rate": 2.4482454541343916e-05,
"loss": 0.0285,
"step": 2000
},
{
"epoch": 1.7349240780911064,
"eval_gen_len": 20.9532,
"eval_loss": 0.03255747631192207,
"eval_rouge1": 0.5758,
"eval_rouge2": 0.5137,
"eval_rougeL": 0.5751,
"eval_rougeLsum": 0.5749,
"eval_runtime": 138.1212,
"eval_samples_per_second": 36.2,
"eval_steps_per_second": 1.137,
"step": 2000
},
{
"epoch": 1.8216919739696311,
"grad_norm": 0.457000732421875,
"learning_rate": 2.1836651396603035e-05,
"loss": 0.0263,
"step": 2100
},
{
"epoch": 1.9084598698481563,
"grad_norm": 0.2774176001548767,
"learning_rate": 1.922647275987431e-05,
"loss": 0.0266,
"step": 2200
},
{
"epoch": 1.995227765726681,
"grad_norm": 0.4951108694076538,
"learning_rate": 1.668131353555037e-05,
"loss": 0.0257,
"step": 2300
},
{
"epoch": 2.0815618221258134,
"grad_norm": 0.20267550647258759,
"learning_rate": 1.4229836402503139e-05,
"loss": 0.0222,
"step": 2400
},
{
"epoch": 2.1683297180043386,
"grad_norm": 0.24006444215774536,
"learning_rate": 1.1899649025178486e-05,
"loss": 0.0219,
"step": 2500
},
{
"epoch": 2.1683297180043386,
"eval_gen_len": 20.9518,
"eval_loss": 0.030334332957863808,
"eval_rouge1": 0.5764,
"eval_rouge2": 0.5152,
"eval_rougeL": 0.5755,
"eval_rougeLsum": 0.5754,
"eval_runtime": 137.9642,
"eval_samples_per_second": 36.241,
"eval_steps_per_second": 1.138,
"step": 2500
},
{
"epoch": 2.2550976138828633,
"grad_norm": 0.39135313034057617,
"learning_rate": 9.716993145888406e-06,
"loss": 0.0198,
"step": 2600
},
{
"epoch": 2.341865509761388,
"grad_norm": 0.23596180975437164,
"learning_rate": 7.706449059632987e-06,
"loss": 0.0209,
"step": 2700
},
{
"epoch": 2.4286334056399133,
"grad_norm": 0.21738794445991516,
"learning_rate": 5.890658799551618e-06,
"loss": 0.0223,
"step": 2800
},
{
"epoch": 2.5154013015184384,
"grad_norm": 0.2256348580121994,
"learning_rate": 4.29007115039071e-06,
"loss": 0.0199,
"step": 2900
},
{
"epoch": 2.602169197396963,
"grad_norm": 0.2328837364912033,
"learning_rate": 2.9227113615554275e-06,
"loss": 0.0218,
"step": 3000
},
{
"epoch": 2.602169197396963,
"eval_gen_len": 20.9522,
"eval_loss": 0.029462991282343864,
"eval_rouge1": 0.5768,
"eval_rouge2": 0.5152,
"eval_rougeL": 0.5757,
"eval_rougeLsum": 0.5757,
"eval_runtime": 138.2266,
"eval_samples_per_second": 36.172,
"eval_steps_per_second": 1.136,
"step": 3000
}
],
"logging_steps": 100,
"max_steps": 3459,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 6170237616291840.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}