bart-finetune-v3 / checkpoint-7254 /trainer_state.json
de-slothbug's picture
End of full fine-tuning with BART
8fa5ae0 verified
Raw
History Blame Contribute Delete
18.7 kB
{
"best_global_step": 7000,
"best_metric": 0.013348449021577835,
"best_model_checkpoint": "bart-finetune/checkpoint-7000",
"epoch": 3.0,
"eval_steps": 500,
"global_step": 7254,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.04136504653567735,
"grad_norm": 21.97728729248047,
"learning_rate": 9.900000000000002e-06,
"loss": 6.7599,
"step": 100
},
{
"epoch": 0.0827300930713547,
"grad_norm": 16.123279571533203,
"learning_rate": 1.9900000000000003e-05,
"loss": 1.9406,
"step": 200
},
{
"epoch": 0.12409513960703206,
"grad_norm": 0.9651572704315186,
"learning_rate": 2.9900000000000002e-05,
"loss": 0.3388,
"step": 300
},
{
"epoch": 0.1654601861427094,
"grad_norm": 0.7233644723892212,
"learning_rate": 3.99e-05,
"loss": 0.117,
"step": 400
},
{
"epoch": 0.20682523267838676,
"grad_norm": 0.5955630540847778,
"learning_rate": 4.99e-05,
"loss": 0.0828,
"step": 500
},
{
"epoch": 0.20682523267838676,
"eval_gen_len": 20.9478,
"eval_loss": 0.05528322979807854,
"eval_rouge1": 0.5717,
"eval_rouge2": 0.4998,
"eval_rougeL": 0.5685,
"eval_rougeLsum": 0.5684,
"eval_runtime": 466.4842,
"eval_samples_per_second": 36.85,
"eval_steps_per_second": 1.153,
"step": 500
},
{
"epoch": 0.2481902792140641,
"grad_norm": 0.576092004776001,
"learning_rate": 4.997349783897062e-05,
"loss": 0.0702,
"step": 600
},
{
"epoch": 0.28955532574974147,
"grad_norm": 0.6807641983032227,
"learning_rate": 4.989297538182027e-05,
"loss": 0.0613,
"step": 700
},
{
"epoch": 0.3309203722854188,
"grad_norm": 0.4327307939529419,
"learning_rate": 4.975860411128855e-05,
"loss": 0.0566,
"step": 800
},
{
"epoch": 0.37228541882109617,
"grad_norm": 0.46865856647491455,
"learning_rate": 4.9570674701083985e-05,
"loss": 0.0521,
"step": 900
},
{
"epoch": 0.4136504653567735,
"grad_norm": 0.5254637598991394,
"learning_rate": 4.9329593682590795e-05,
"loss": 0.0512,
"step": 1000
},
{
"epoch": 0.4136504653567735,
"eval_gen_len": 20.9414,
"eval_loss": 0.03401655703783035,
"eval_rouge1": 0.5814,
"eval_rouge2": 0.5152,
"eval_rougeL": 0.578,
"eval_rougeLsum": 0.5779,
"eval_runtime": 468.717,
"eval_samples_per_second": 36.675,
"eval_steps_per_second": 1.148,
"step": 1000
},
{
"epoch": 0.4550155118924509,
"grad_norm": 0.35161489248275757,
"learning_rate": 4.903588256545478e-05,
"loss": 0.0473,
"step": 1100
},
{
"epoch": 0.4963805584281282,
"grad_norm": 0.46844103932380676,
"learning_rate": 4.869017670944682e-05,
"loss": 0.0413,
"step": 1200
},
{
"epoch": 0.5377456049638056,
"grad_norm": 0.3853241503238678,
"learning_rate": 4.829322395004416e-05,
"loss": 0.0444,
"step": 1300
},
{
"epoch": 0.5791106514994829,
"grad_norm": 0.5410467386245728,
"learning_rate": 4.7845882980702864e-05,
"loss": 0.0397,
"step": 1400
},
{
"epoch": 0.6204756980351603,
"grad_norm": 0.4258374869823456,
"learning_rate": 4.734912149532076e-05,
"loss": 0.0405,
"step": 1500
},
{
"epoch": 0.6204756980351603,
"eval_gen_len": 20.939,
"eval_loss": 0.02671843394637108,
"eval_rouge1": 0.587,
"eval_rouge2": 0.5252,
"eval_rougeL": 0.5856,
"eval_rougeLsum": 0.5855,
"eval_runtime": 465.8947,
"eval_samples_per_second": 36.897,
"eval_steps_per_second": 1.155,
"step": 1500
},
{
"epoch": 0.6618407445708376,
"grad_norm": 0.4710790812969208,
"learning_rate": 4.6804014094909235e-05,
"loss": 0.0387,
"step": 1600
},
{
"epoch": 0.703205791106515,
"grad_norm": 0.4411327838897705,
"learning_rate": 4.6211739963002075e-05,
"loss": 0.0364,
"step": 1700
},
{
"epoch": 0.7445708376421923,
"grad_norm": 0.22456933557987213,
"learning_rate": 4.557358031483011e-05,
"loss": 0.0339,
"step": 1800
},
{
"epoch": 0.7859358841778697,
"grad_norm": 0.3356589078903198,
"learning_rate": 4.489091562577947e-05,
"loss": 0.0354,
"step": 1900
},
{
"epoch": 0.827300930713547,
"grad_norm": 0.4155788719654083,
"learning_rate": 4.4165222645128965e-05,
"loss": 0.0318,
"step": 2000
},
{
"epoch": 0.827300930713547,
"eval_gen_len": 20.9422,
"eval_loss": 0.02188122272491455,
"eval_rouge1": 0.5888,
"eval_rouge2": 0.5292,
"eval_rougeL": 0.5876,
"eval_rougeLsum": 0.5875,
"eval_runtime": 468.6851,
"eval_samples_per_second": 36.677,
"eval_steps_per_second": 1.148,
"step": 2000
},
{
"epoch": 0.8686659772492245,
"grad_norm": 0.24613259732723236,
"learning_rate": 4.339807120152655e-05,
"loss": 0.0308,
"step": 2100
},
{
"epoch": 0.9100310237849017,
"grad_norm": 0.263827383518219,
"learning_rate": 4.2591120807115226e-05,
"loss": 0.0313,
"step": 2200
},
{
"epoch": 0.9513960703205792,
"grad_norm": 0.1906682401895523,
"learning_rate": 4.1746117067654476e-05,
"loss": 0.0319,
"step": 2300
},
{
"epoch": 0.9927611168562565,
"grad_norm": 0.3021582365036011,
"learning_rate": 4.086488790640275e-05,
"loss": 0.0295,
"step": 2400
},
{
"epoch": 1.0339193381592555,
"grad_norm": 0.2295190691947937,
"learning_rate": 3.994933960992976e-05,
"loss": 0.0255,
"step": 2500
},
{
"epoch": 1.0339193381592555,
"eval_gen_len": 20.9452,
"eval_loss": 0.020114552229642868,
"eval_rouge1": 0.5887,
"eval_rouge2": 0.5295,
"eval_rougeL": 0.5872,
"eval_rougeLsum": 0.5871,
"eval_runtime": 468.6112,
"eval_samples_per_second": 36.683,
"eval_steps_per_second": 1.148,
"step": 2500
},
{
"epoch": 1.0752843846949327,
"grad_norm": 0.22013071179389954,
"learning_rate": 3.900145270441215e-05,
"loss": 0.0243,
"step": 2600
},
{
"epoch": 1.1166494312306101,
"grad_norm": 0.25927990674972534,
"learning_rate": 3.802327767133313e-05,
"loss": 0.0252,
"step": 2700
},
{
"epoch": 1.1580144777662875,
"grad_norm": 0.252655953168869,
"learning_rate": 3.701693051185375e-05,
"loss": 0.0238,
"step": 2800
},
{
"epoch": 1.199379524301965,
"grad_norm": 0.24934452772140503,
"learning_rate": 3.598458816945131e-05,
"loss": 0.022,
"step": 2900
},
{
"epoch": 1.2407445708376421,
"grad_norm": 0.36218950152397156,
"learning_rate": 3.492848382072639e-05,
"loss": 0.0235,
"step": 3000
},
{
"epoch": 1.2407445708376421,
"eval_gen_len": 20.9446,
"eval_loss": 0.01878739520907402,
"eval_rouge1": 0.5899,
"eval_rouge2": 0.5324,
"eval_rougeL": 0.5889,
"eval_rougeLsum": 0.5888,
"eval_runtime": 468.4075,
"eval_samples_per_second": 36.699,
"eval_steps_per_second": 1.149,
"step": 3000
},
{
"epoch": 1.2821096173733195,
"grad_norm": 0.36099350452423096,
"learning_rate": 3.3850902044565754e-05,
"loss": 0.0223,
"step": 3100
},
{
"epoch": 1.323474663908997,
"grad_norm": 0.4769928455352783,
"learning_rate": 3.2754173880111066e-05,
"loss": 0.0235,
"step": 3200
},
{
"epoch": 1.3648397104446741,
"grad_norm": 0.2278015911579132,
"learning_rate": 3.164067178422423e-05,
"loss": 0.0228,
"step": 3300
},
{
"epoch": 1.4062047569803515,
"grad_norm": 0.5187413692474365,
"learning_rate": 3.051280449935734e-05,
"loss": 0.0225,
"step": 3400
},
{
"epoch": 1.447569803516029,
"grad_norm": 0.23944765329360962,
"learning_rate": 2.9373011842929172e-05,
"loss": 0.0202,
"step": 3500
},
{
"epoch": 1.447569803516029,
"eval_gen_len": 20.945,
"eval_loss": 0.017148399725556374,
"eval_rouge1": 0.5898,
"eval_rouge2": 0.5328,
"eval_rougeL": 0.5888,
"eval_rougeLsum": 0.5887,
"eval_runtime": 467.061,
"eval_samples_per_second": 36.805,
"eval_steps_per_second": 1.152,
"step": 3500
},
{
"epoch": 1.4889348500517063,
"grad_norm": 0.241697296500206,
"learning_rate": 2.82237594294799e-05,
"loss": 0.0199,
"step": 3600
},
{
"epoch": 1.5302998965873837,
"grad_norm": 0.33813291788101196,
"learning_rate": 2.7067533337021116e-05,
"loss": 0.0217,
"step": 3700
},
{
"epoch": 1.5716649431230612,
"grad_norm": 0.2886863946914673,
"learning_rate": 2.5906834729119022e-05,
"loss": 0.0209,
"step": 3800
},
{
"epoch": 1.6130299896587383,
"grad_norm": 0.23123699426651,
"learning_rate": 2.474417444434436e-05,
"loss": 0.0196,
"step": 3900
},
{
"epoch": 1.6543950361944157,
"grad_norm": 0.4096597731113434,
"learning_rate": 2.3582067564793196e-05,
"loss": 0.0193,
"step": 4000
},
{
"epoch": 1.6543950361944157,
"eval_gen_len": 20.9429,
"eval_loss": 0.01633058860898018,
"eval_rouge1": 0.5902,
"eval_rouge2": 0.5338,
"eval_rougeL": 0.5895,
"eval_rougeLsum": 0.5894,
"eval_runtime": 466.345,
"eval_samples_per_second": 36.861,
"eval_steps_per_second": 1.154,
"step": 4000
},
{
"epoch": 1.695760082730093,
"grad_norm": 0.5514770150184631,
"learning_rate": 2.2423027975428094e-05,
"loss": 0.0199,
"step": 4100
},
{
"epoch": 1.7371251292657703,
"grad_norm": 0.22440214455127716,
"learning_rate": 2.1269562926008984e-05,
"loss": 0.0188,
"step": 4200
},
{
"epoch": 1.7784901758014477,
"grad_norm": 0.22310861945152283,
"learning_rate": 2.012416760737725e-05,
"loss": 0.019,
"step": 4300
},
{
"epoch": 1.8198552223371252,
"grad_norm": 0.18244564533233643,
"learning_rate": 1.8989319753826007e-05,
"loss": 0.0191,
"step": 4400
},
{
"epoch": 1.8612202688728026,
"grad_norm": 0.4828181862831116,
"learning_rate": 1.7867474283232483e-05,
"loss": 0.0193,
"step": 4500
},
{
"epoch": 1.8612202688728026,
"eval_gen_len": 20.9431,
"eval_loss": 0.01493143755942583,
"eval_rouge1": 0.5917,
"eval_rouge2": 0.536,
"eval_rougeL": 0.591,
"eval_rougeLsum": 0.5909,
"eval_runtime": 466.5761,
"eval_samples_per_second": 36.843,
"eval_steps_per_second": 1.153,
"step": 4500
},
{
"epoch": 1.90258531540848,
"grad_norm": 0.1634412705898285,
"learning_rate": 1.6761057986547202e-05,
"loss": 0.0203,
"step": 4600
},
{
"epoch": 1.9439503619441572,
"grad_norm": 0.23640815913677216,
"learning_rate": 1.5672464278127786e-05,
"loss": 0.0188,
"step": 4700
},
{
"epoch": 1.9853154084798346,
"grad_norm": 0.1703311949968338,
"learning_rate": 1.4604048018273314e-05,
"loss": 0.0174,
"step": 4800
},
{
"epoch": 2.0264736297828336,
"grad_norm": 0.22548532485961914,
"learning_rate": 1.3558120419159447e-05,
"loss": 0.0165,
"step": 4900
},
{
"epoch": 2.067838676318511,
"grad_norm": 0.43000370264053345,
"learning_rate": 1.2536944045193643e-05,
"loss": 0.0156,
"step": 5000
},
{
"epoch": 2.067838676318511,
"eval_gen_len": 20.9429,
"eval_loss": 0.014507623389363289,
"eval_rouge1": 0.5922,
"eval_rouge2": 0.5368,
"eval_rougeL": 0.5915,
"eval_rougeLsum": 0.5914,
"eval_runtime": 467.2748,
"eval_samples_per_second": 36.788,
"eval_steps_per_second": 1.151,
"step": 5000
},
{
"epoch": 2.109203722854188,
"grad_norm": 0.15023747086524963,
"learning_rate": 1.1542727918605989e-05,
"loss": 0.0131,
"step": 5100
},
{
"epoch": 2.1505687693898654,
"grad_norm": 0.17884424328804016,
"learning_rate": 1.0577622740863063e-05,
"loss": 0.0158,
"step": 5200
},
{
"epoch": 2.191933815925543,
"grad_norm": 0.19435808062553406,
"learning_rate": 9.643716240242118e-06,
"loss": 0.0153,
"step": 5300
},
{
"epoch": 2.2332988624612202,
"grad_norm": 0.1834651082754135,
"learning_rate": 8.743028655629697e-06,
"loss": 0.0159,
"step": 5400
},
{
"epoch": 2.2746639089968976,
"grad_norm": 0.2443581074476242,
"learning_rate": 7.877508366314107e-06,
"loss": 0.0149,
"step": 5500
},
{
"epoch": 2.2746639089968976,
"eval_gen_len": 20.9438,
"eval_loss": 0.013898308388888836,
"eval_rouge1": 0.5928,
"eval_rouge2": 0.5374,
"eval_rougeL": 0.592,
"eval_rougeLsum": 0.592,
"eval_runtime": 466.318,
"eval_samples_per_second": 36.863,
"eval_steps_per_second": 1.154,
"step": 5500
},
{
"epoch": 2.316028955532575,
"grad_norm": 0.26785939931869507,
"learning_rate": 7.049027677225647e-06,
"loss": 0.0126,
"step": 5600
},
{
"epoch": 2.3573940020682524,
"grad_norm": 0.12219066172838211,
"learning_rate": 6.259378768741817e-06,
"loss": 0.0157,
"step": 5700
},
{
"epoch": 2.39875904860393,
"grad_norm": 0.19022032618522644,
"learning_rate": 5.510269819819025e-06,
"loss": 0.0158,
"step": 5800
},
{
"epoch": 2.4401240951396073,
"grad_norm": 0.20378048717975616,
"learning_rate": 4.803321312837311e-06,
"loss": 0.0152,
"step": 5900
},
{
"epoch": 2.4814891416752842,
"grad_norm": 0.21728715300559998,
"learning_rate": 4.140062528151422e-06,
"loss": 0.0155,
"step": 6000
},
{
"epoch": 2.4814891416752842,
"eval_gen_len": 20.9443,
"eval_loss": 0.013674520887434483,
"eval_rouge1": 0.5926,
"eval_rouge2": 0.5373,
"eval_rougeL": 0.5918,
"eval_rougeLsum": 0.5917,
"eval_runtime": 466.5426,
"eval_samples_per_second": 36.846,
"eval_steps_per_second": 1.153,
"step": 6000
},
{
"epoch": 2.5228541882109616,
"grad_norm": 0.18222254514694214,
"learning_rate": 3.521928235931346e-06,
"loss": 0.0136,
"step": 6100
},
{
"epoch": 2.564219234746639,
"grad_norm": 0.23324991762638092,
"learning_rate": 2.9502555924485224e-06,
"loss": 0.0141,
"step": 6200
},
{
"epoch": 2.6055842812823165,
"grad_norm": 0.12946711480617523,
"learning_rate": 2.4262812475216946e-06,
"loss": 0.014,
"step": 6300
},
{
"epoch": 2.646949327817994,
"grad_norm": 0.24613253772258759,
"learning_rate": 1.9511386693797014e-06,
"loss": 0.0152,
"step": 6400
},
{
"epoch": 2.6883143743536713,
"grad_norm": 0.16041553020477295,
"learning_rate": 1.5258556927280287e-06,
"loss": 0.0142,
"step": 6500
},
{
"epoch": 2.6883143743536713,
"eval_gen_len": 20.9439,
"eval_loss": 0.013370907865464687,
"eval_rouge1": 0.593,
"eval_rouge2": 0.5377,
"eval_rougeL": 0.5923,
"eval_rougeLsum": 0.5922,
"eval_runtime": 465.8365,
"eval_samples_per_second": 36.901,
"eval_steps_per_second": 1.155,
"step": 6500
},
{
"epoch": 2.7296794208893482,
"grad_norm": 0.18015147745609283,
"learning_rate": 1.1513522953231464e-06,
"loss": 0.0127,
"step": 6600
},
{
"epoch": 2.7710444674250256,
"grad_norm": 0.1610741764307022,
"learning_rate": 8.284386078645151e-07,
"loss": 0.0131,
"step": 6700
},
{
"epoch": 2.812409513960703,
"grad_norm": 0.2159341424703598,
"learning_rate": 5.578131615091187e-07,
"loss": 0.0139,
"step": 6800
},
{
"epoch": 2.8537745604963805,
"grad_norm": 0.32548755407333374,
"learning_rate": 3.4006137679963855e-07,
"loss": 0.0141,
"step": 6900
},
{
"epoch": 2.895139607032058,
"grad_norm": 0.17154353857040405,
"learning_rate": 1.7565429727500472e-07,
"loss": 0.0146,
"step": 7000
},
{
"epoch": 2.895139607032058,
"eval_gen_len": 20.9438,
"eval_loss": 0.013348449021577835,
"eval_rouge1": 0.5928,
"eval_rouge2": 0.5377,
"eval_rougeL": 0.5921,
"eval_rougeLsum": 0.592,
"eval_runtime": 466.1991,
"eval_samples_per_second": 36.873,
"eval_steps_per_second": 1.154,
"step": 7000
},
{
"epoch": 2.9365046535677353,
"grad_norm": 0.16347846388816833,
"learning_rate": 6.494757050277689e-08,
"loss": 0.0135,
"step": 7100
},
{
"epoch": 2.9778697001034127,
"grad_norm": 0.1634788066148758,
"learning_rate": 8.180678737629289e-09,
"loss": 0.0126,
"step": 7200
}
],
"logging_steps": 100,
"max_steps": 7254,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.547569722875904e+16,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}