de-slothbug's picture
End of full fine-tuning with BART
94d1fe0 verified
Raw
History Blame Contribute Delete
22 kB
{
"best_global_step": 9000,
"best_metric": 0.009878098033368587,
"best_model_checkpoint": "bart-base-finetune/checkpoint-9000",
"epoch": 2.88,
"eval_steps": 500,
"global_step": 9000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.032,
"grad_norm": 3.6718413829803467,
"learning_rate": 9.900000000000002e-06,
"loss": 2.4853,
"step": 100
},
{
"epoch": 0.064,
"grad_norm": 2.339207649230957,
"learning_rate": 1.9900000000000003e-05,
"loss": 0.5438,
"step": 200
},
{
"epoch": 0.096,
"grad_norm": 1.8246095180511475,
"learning_rate": 2.9900000000000002e-05,
"loss": 0.3038,
"step": 300
},
{
"epoch": 0.128,
"grad_norm": 1.9325376749038696,
"learning_rate": 3.99e-05,
"loss": 0.2137,
"step": 400
},
{
"epoch": 0.16,
"grad_norm": 1.487189531326294,
"learning_rate": 4.99e-05,
"loss": 0.1689,
"step": 500
},
{
"epoch": 0.16,
"eval_gen_len": 20.9688,
"eval_loss": 0.10288307070732117,
"eval_rouge1": 0.4964,
"eval_rouge2": 0.4123,
"eval_rougeL": 0.4927,
"eval_rougeLsum": 0.4927,
"eval_runtime": 144.5729,
"eval_samples_per_second": 34.585,
"eval_steps_per_second": 2.165,
"step": 500
},
{
"epoch": 0.192,
"grad_norm": 0.9393866062164307,
"learning_rate": 4.998465033232545e-05,
"loss": 0.1361,
"step": 600
},
{
"epoch": 0.224,
"grad_norm": 1.4453977346420288,
"learning_rate": 4.9937998871479073e-05,
"loss": 0.1156,
"step": 700
},
{
"epoch": 0.256,
"grad_norm": 1.1997668743133545,
"learning_rate": 4.9860102500953126e-05,
"loss": 0.0988,
"step": 800
},
{
"epoch": 0.288,
"grad_norm": 1.3937125205993652,
"learning_rate": 4.975105881739415e-05,
"loss": 0.0889,
"step": 900
},
{
"epoch": 0.32,
"grad_norm": 1.3387874364852905,
"learning_rate": 4.961100444203071e-05,
"loss": 0.0793,
"step": 1000
},
{
"epoch": 0.32,
"eval_gen_len": 20.9698,
"eval_loss": 0.05177076905965805,
"eval_rouge1": 0.4988,
"eval_rouge2": 0.4239,
"eval_rougeL": 0.494,
"eval_rougeLsum": 0.494,
"eval_runtime": 144.6374,
"eval_samples_per_second": 34.569,
"eval_steps_per_second": 2.164,
"step": 1000
},
{
"epoch": 0.352,
"grad_norm": 1.226305365562439,
"learning_rate": 4.944011484950018e-05,
"loss": 0.0726,
"step": 1100
},
{
"epoch": 0.384,
"grad_norm": 1.3799694776535034,
"learning_rate": 4.9238604147995884e-05,
"loss": 0.0708,
"step": 1200
},
{
"epoch": 0.416,
"grad_norm": 1.0327191352844238,
"learning_rate": 4.900672481101019e-05,
"loss": 0.0675,
"step": 1300
},
{
"epoch": 0.448,
"grad_norm": 0.8962351083755493,
"learning_rate": 4.8744767361009594e-05,
"loss": 0.0604,
"step": 1400
},
{
"epoch": 0.48,
"grad_norm": 0.6496387720108032,
"learning_rate": 4.8453060005437934e-05,
"loss": 0.0568,
"step": 1500
},
{
"epoch": 0.48,
"eval_gen_len": 20.9742,
"eval_loss": 0.03353753313422203,
"eval_rouge1": 0.5059,
"eval_rouge2": 0.4356,
"eval_rougeL": 0.5032,
"eval_rougeLsum": 0.503,
"eval_runtime": 145.5239,
"eval_samples_per_second": 34.359,
"eval_steps_per_second": 2.151,
"step": 1500
},
{
"epoch": 0.512,
"grad_norm": 1.6739161014556885,
"learning_rate": 4.8131968225504245e-05,
"loss": 0.0539,
"step": 1600
},
{
"epoch": 0.544,
"grad_norm": 1.063624382019043,
"learning_rate": 4.778189431826991e-05,
"loss": 0.0502,
"step": 1700
},
{
"epoch": 0.576,
"grad_norm": 1.1451120376586914,
"learning_rate": 4.7403276892609224e-05,
"loss": 0.0477,
"step": 1800
},
{
"epoch": 0.608,
"grad_norm": 0.7193688750267029,
"learning_rate": 4.699659031967479e-05,
"loss": 0.0457,
"step": 1900
},
{
"epoch": 0.64,
"grad_norm": 0.9038898944854736,
"learning_rate": 4.656234413855613e-05,
"loss": 0.0434,
"step": 2000
},
{
"epoch": 0.64,
"eval_gen_len": 20.9714,
"eval_loss": 0.029211629182100296,
"eval_rouge1": 0.5076,
"eval_rouge2": 0.4388,
"eval_rougeL": 0.5055,
"eval_rougeLsum": 0.5054,
"eval_runtime": 145.669,
"eval_samples_per_second": 34.324,
"eval_steps_per_second": 2.149,
"step": 2000
},
{
"epoch": 0.672,
"grad_norm": 1.7222179174423218,
"learning_rate": 4.610108241787629e-05,
"loss": 0.0461,
"step": 2100
},
{
"epoch": 0.704,
"grad_norm": 0.6831910014152527,
"learning_rate": 4.561338307412629e-05,
"loss": 0.0438,
"step": 2200
},
{
"epoch": 0.736,
"grad_norm": 0.4437102675437927,
"learning_rate": 4.509985714759151e-05,
"loss": 0.0407,
"step": 2300
},
{
"epoch": 0.768,
"grad_norm": 0.6408787965774536,
"learning_rate": 4.456114803677696e-05,
"loss": 0.0377,
"step": 2400
},
{
"epoch": 0.8,
"grad_norm": 0.7488101124763489,
"learning_rate": 4.3997930692291056e-05,
"loss": 0.0372,
"step": 2500
},
{
"epoch": 0.8,
"eval_gen_len": 20.9734,
"eval_loss": 0.02469678223133087,
"eval_rouge1": 0.5089,
"eval_rouge2": 0.4398,
"eval_rougeL": 0.5063,
"eval_rougeLsum": 0.5061,
"eval_runtime": 145.4374,
"eval_samples_per_second": 34.379,
"eval_steps_per_second": 2.152,
"step": 2500
},
{
"epoch": 0.832,
"grad_norm": 0.3353654742240906,
"learning_rate": 4.341091077119753e-05,
"loss": 0.0367,
"step": 2600
},
{
"epoch": 0.864,
"grad_norm": 0.853186845779419,
"learning_rate": 4.2800823752895055e-05,
"loss": 0.0345,
"step": 2700
},
{
"epoch": 0.896,
"grad_norm": 0.7370714545249939,
"learning_rate": 4.2168434017632516e-05,
"loss": 0.038,
"step": 2800
},
{
"epoch": 0.928,
"grad_norm": 0.5349611639976501,
"learning_rate": 4.151453388881413e-05,
"loss": 0.0321,
"step": 2900
},
{
"epoch": 0.96,
"grad_norm": 0.7140136957168579,
"learning_rate": 4.083994264029462e-05,
"loss": 0.0347,
"step": 3000
},
{
"epoch": 0.96,
"eval_gen_len": 20.9754,
"eval_loss": 0.01928527094423771,
"eval_rouge1": 0.5082,
"eval_rouge2": 0.4406,
"eval_rougeL": 0.5057,
"eval_rougeLsum": 0.5055,
"eval_runtime": 145.567,
"eval_samples_per_second": 34.348,
"eval_steps_per_second": 2.15,
"step": 3000
},
{
"epoch": 0.992,
"grad_norm": 0.6110441088676453,
"learning_rate": 4.0145505469907984e-05,
"loss": 0.0325,
"step": 3100
},
{
"epoch": 1.024,
"grad_norm": 0.4845236539840698,
"learning_rate": 3.9432092440516075e-05,
"loss": 0.0276,
"step": 3200
},
{
"epoch": 1.056,
"grad_norm": 0.5893353819847107,
"learning_rate": 3.8700597389903664e-05,
"loss": 0.0262,
"step": 3300
},
{
"epoch": 1.088,
"grad_norm": 0.7486633658409119,
"learning_rate": 3.795193681088578e-05,
"loss": 0.0235,
"step": 3400
},
{
"epoch": 1.12,
"grad_norm": 0.886471688747406,
"learning_rate": 3.7187048703030597e-05,
"loss": 0.0235,
"step": 3500
},
{
"epoch": 1.12,
"eval_gen_len": 20.9758,
"eval_loss": 0.0190653745085001,
"eval_rouge1": 0.5087,
"eval_rouge2": 0.4431,
"eval_rougeL": 0.5072,
"eval_rougeLsum": 0.5071,
"eval_runtime": 145.2595,
"eval_samples_per_second": 34.421,
"eval_steps_per_second": 2.155,
"step": 3500
},
{
"epoch": 1.152,
"grad_norm": 1.1492247581481934,
"learning_rate": 3.640689139743628e-05,
"loss": 0.0234,
"step": 3600
},
{
"epoch": 1.184,
"grad_norm": 0.7707476019859314,
"learning_rate": 3.561244235603451e-05,
"loss": 0.0245,
"step": 3700
},
{
"epoch": 1.216,
"grad_norm": 0.8048288822174072,
"learning_rate": 3.4804696946924855e-05,
"loss": 0.0228,
"step": 3800
},
{
"epoch": 1.248,
"grad_norm": 0.7920108437538147,
"learning_rate": 3.398466719727445e-05,
"loss": 0.0227,
"step": 3900
},
{
"epoch": 1.28,
"grad_norm": 0.199005588889122,
"learning_rate": 3.3153380525345445e-05,
"loss": 0.0226,
"step": 4000
},
{
"epoch": 1.28,
"eval_gen_len": 20.975,
"eval_loss": 0.0172447320073843,
"eval_rouge1": 0.5091,
"eval_rouge2": 0.442,
"eval_rougeL": 0.5064,
"eval_rougeLsum": 0.5063,
"eval_runtime": 145.4831,
"eval_samples_per_second": 34.368,
"eval_steps_per_second": 2.151,
"step": 4000
},
{
"epoch": 1.312,
"grad_norm": 0.6734442114830017,
"learning_rate": 3.2311878453238966e-05,
"loss": 0.0207,
"step": 4100
},
{
"epoch": 1.3439999999999999,
"grad_norm": 0.5161114931106567,
"learning_rate": 3.146121530196824e-05,
"loss": 0.0216,
"step": 4200
},
{
"epoch": 1.376,
"grad_norm": 0.4449058175086975,
"learning_rate": 3.0602456870495973e-05,
"loss": 0.0197,
"step": 4300
},
{
"epoch": 1.408,
"grad_norm": 0.5729345083236694,
"learning_rate": 2.9736679100390947e-05,
"loss": 0.0208,
"step": 4400
},
{
"epoch": 1.44,
"grad_norm": 0.19021901488304138,
"learning_rate": 2.886496672777688e-05,
"loss": 0.0201,
"step": 4500
},
{
"epoch": 1.44,
"eval_gen_len": 20.9758,
"eval_loss": 0.014488083310425282,
"eval_rouge1": 0.5116,
"eval_rouge2": 0.4474,
"eval_rougeL": 0.5102,
"eval_rougeLsum": 0.5101,
"eval_runtime": 146.2423,
"eval_samples_per_second": 34.19,
"eval_steps_per_second": 2.14,
"step": 4500
},
{
"epoch": 1.472,
"grad_norm": 0.632882297039032,
"learning_rate": 2.7988411924262648e-05,
"loss": 0.0198,
"step": 4600
},
{
"epoch": 1.504,
"grad_norm": 0.37011951208114624,
"learning_rate": 2.71081129285564e-05,
"loss": 0.0205,
"step": 4700
},
{
"epoch": 1.536,
"grad_norm": 0.528691828250885,
"learning_rate": 2.622517267047835e-05,
"loss": 0.0204,
"step": 4800
},
{
"epoch": 1.568,
"grad_norm": 0.19730792939662933,
"learning_rate": 2.5340697389095973e-05,
"loss": 0.0193,
"step": 4900
},
{
"epoch": 1.6,
"grad_norm": 0.5517034530639648,
"learning_rate": 2.4455795246713044e-05,
"loss": 0.0164,
"step": 5000
},
{
"epoch": 1.6,
"eval_gen_len": 20.9766,
"eval_loss": 0.013988671824336052,
"eval_rouge1": 0.5114,
"eval_rouge2": 0.4467,
"eval_rougeL": 0.5099,
"eval_rougeLsum": 0.5098,
"eval_runtime": 145.249,
"eval_samples_per_second": 34.424,
"eval_steps_per_second": 2.155,
"step": 5000
},
{
"epoch": 1.6320000000000001,
"grad_norm": 0.6311265826225281,
"learning_rate": 2.3571574940449008e-05,
"loss": 0.0173,
"step": 5100
},
{
"epoch": 1.6640000000000001,
"grad_norm": 0.764806866645813,
"learning_rate": 2.2689144313148382e-05,
"loss": 0.0173,
"step": 5200
},
{
"epoch": 1.696,
"grad_norm": 1.1502550840377808,
"learning_rate": 2.180960896536036e-05,
"loss": 0.018,
"step": 5300
},
{
"epoch": 1.728,
"grad_norm": 0.21649418771266937,
"learning_rate": 2.0934070870127912e-05,
"loss": 0.0162,
"step": 5400
},
{
"epoch": 1.76,
"grad_norm": 0.3456017076969147,
"learning_rate": 2.0063626992321693e-05,
"loss": 0.017,
"step": 5500
},
{
"epoch": 1.76,
"eval_gen_len": 20.9772,
"eval_loss": 0.012542162090539932,
"eval_rouge1": 0.5119,
"eval_rouge2": 0.4484,
"eval_rougeL": 0.5108,
"eval_rougeLsum": 0.5106,
"eval_runtime": 144.5364,
"eval_samples_per_second": 34.593,
"eval_steps_per_second": 2.166,
"step": 5500
},
{
"epoch": 1.792,
"grad_norm": 0.5721284747123718,
"learning_rate": 1.919936791424879e-05,
"loss": 0.0176,
"step": 5600
},
{
"epoch": 1.8239999999999998,
"grad_norm": 0.26220762729644775,
"learning_rate": 1.834237646925815e-05,
"loss": 0.0152,
"step": 5700
},
{
"epoch": 1.8559999999999999,
"grad_norm": 0.271634966135025,
"learning_rate": 1.7493726385054743e-05,
"loss": 0.0152,
"step": 5800
},
{
"epoch": 1.888,
"grad_norm": 0.3826049566268921,
"learning_rate": 1.6654480938422208e-05,
"loss": 0.0151,
"step": 5900
},
{
"epoch": 1.92,
"grad_norm": 0.49469685554504395,
"learning_rate": 1.58256916230395e-05,
"loss": 0.0146,
"step": 6000
},
{
"epoch": 1.92,
"eval_gen_len": 20.976,
"eval_loss": 0.011809424497187138,
"eval_rouge1": 0.5115,
"eval_rouge2": 0.4481,
"eval_rougeL": 0.5103,
"eval_rougeLsum": 0.5101,
"eval_runtime": 144.9109,
"eval_samples_per_second": 34.504,
"eval_steps_per_second": 2.16,
"step": 6000
},
{
"epoch": 1.952,
"grad_norm": 0.6852744221687317,
"learning_rate": 1.5008396832060606e-05,
"loss": 0.0161,
"step": 6100
},
{
"epoch": 1.984,
"grad_norm": 0.27392491698265076,
"learning_rate": 1.4203620557108022e-05,
"loss": 0.0146,
"step": 6200
},
{
"epoch": 2.016,
"grad_norm": 0.6940794587135315,
"learning_rate": 1.3412371105309856e-05,
"loss": 0.0132,
"step": 6300
},
{
"epoch": 2.048,
"grad_norm": 0.2785722613334656,
"learning_rate": 1.2635639835988195e-05,
"loss": 0.0106,
"step": 6400
},
{
"epoch": 2.08,
"grad_norm": 0.1548278033733368,
"learning_rate": 1.1874399918581388e-05,
"loss": 0.0114,
"step": 6500
},
{
"epoch": 2.08,
"eval_gen_len": 20.9772,
"eval_loss": 0.010936998762190342,
"eval_rouge1": 0.5117,
"eval_rouge2": 0.4484,
"eval_rougeL": 0.5105,
"eval_rougeLsum": 0.5105,
"eval_runtime": 145.1325,
"eval_samples_per_second": 34.451,
"eval_steps_per_second": 2.157,
"step": 6500
},
{
"epoch": 2.112,
"grad_norm": 0.14601846039295197,
"learning_rate": 1.1129605113356508e-05,
"loss": 0.0111,
"step": 6600
},
{
"epoch": 2.144,
"grad_norm": 0.18163363635540009,
"learning_rate": 1.040218857643962e-05,
"loss": 0.0111,
"step": 6700
},
{
"epoch": 2.176,
"grad_norm": 0.2548365294933319,
"learning_rate": 9.693061690661118e-06,
"loss": 0.011,
"step": 6800
},
{
"epoch": 2.208,
"grad_norm": 0.21669094264507294,
"learning_rate": 9.00311292368079e-06,
"loss": 0.0111,
"step": 6900
},
{
"epoch": 2.24,
"grad_norm": 0.47503963112831116,
"learning_rate": 8.333206714823513e-06,
"loss": 0.0104,
"step": 7000
},
{
"epoch": 2.24,
"eval_gen_len": 20.9772,
"eval_loss": 0.01037654373794794,
"eval_rouge1": 0.5129,
"eval_rouge2": 0.4501,
"eval_rougeL": 0.5118,
"eval_rougeLsum": 0.5117,
"eval_runtime": 143.5577,
"eval_samples_per_second": 34.829,
"eval_steps_per_second": 2.18,
"step": 7000
},
{
"epoch": 2.2720000000000002,
"grad_norm": 0.7779979705810547,
"learning_rate": 7.684182392020015e-06,
"loss": 0.0109,
"step": 7100
},
{
"epoch": 2.304,
"grad_norm": 0.7133929133415222,
"learning_rate": 7.056853120209888e-06,
"loss": 0.0117,
"step": 7200
},
{
"epoch": 2.336,
"grad_norm": 0.5449277758598328,
"learning_rate": 6.45200488252426e-06,
"loss": 0.0097,
"step": 7300
},
{
"epoch": 2.368,
"grad_norm": 0.5456063747406006,
"learning_rate": 5.870395495524664e-06,
"loss": 0.0095,
"step": 7400
},
{
"epoch": 2.4,
"grad_norm": 0.21037012338638306,
"learning_rate": 5.312753659731909e-06,
"loss": 0.01,
"step": 7500
},
{
"epoch": 2.4,
"eval_gen_len": 20.9772,
"eval_loss": 0.010514349676668644,
"eval_rouge1": 0.5124,
"eval_rouge2": 0.4493,
"eval_rougeL": 0.5111,
"eval_rougeLsum": 0.5111,
"eval_runtime": 143.501,
"eval_samples_per_second": 34.843,
"eval_steps_per_second": 2.181,
"step": 7500
},
{
"epoch": 2.432,
"grad_norm": 0.5376931428909302,
"learning_rate": 4.779778046634537e-06,
"loss": 0.0114,
"step": 7600
},
{
"epoch": 2.464,
"grad_norm": 0.655579149723053,
"learning_rate": 4.272136423320786e-06,
"loss": 0.0099,
"step": 7700
},
{
"epoch": 2.496,
"grad_norm": 0.24749213457107544,
"learning_rate": 3.7904648158307465e-06,
"loss": 0.0088,
"step": 7800
},
{
"epoch": 2.528,
"grad_norm": 0.09235558658838272,
"learning_rate": 3.335366712277019e-06,
"loss": 0.0092,
"step": 7900
},
{
"epoch": 2.56,
"grad_norm": 0.4215800166130066,
"learning_rate": 2.907412306732288e-06,
"loss": 0.01,
"step": 8000
},
{
"epoch": 2.56,
"eval_gen_len": 20.9772,
"eval_loss": 0.009960692375898361,
"eval_rouge1": 0.5131,
"eval_rouge2": 0.4506,
"eval_rougeL": 0.5119,
"eval_rougeLsum": 0.5119,
"eval_runtime": 143.2943,
"eval_samples_per_second": 34.893,
"eval_steps_per_second": 2.184,
"step": 8000
},
{
"epoch": 2.592,
"grad_norm": 0.15820010006427765,
"learning_rate": 2.5071377848310595e-06,
"loss": 0.0092,
"step": 8100
},
{
"epoch": 2.624,
"grad_norm": 0.24991130828857422,
"learning_rate": 2.135044651980733e-06,
"loss": 0.0089,
"step": 8200
},
{
"epoch": 2.656,
"grad_norm": 0.5366423726081848,
"learning_rate": 1.7915991050236502e-06,
"loss": 0.0099,
"step": 8300
},
{
"epoch": 2.6879999999999997,
"grad_norm": 0.2854973375797272,
"learning_rate": 1.4772314481373838e-06,
"loss": 0.0096,
"step": 8400
},
{
"epoch": 2.7199999999999998,
"grad_norm": 0.24889616668224335,
"learning_rate": 1.1923355537050458e-06,
"loss": 0.0084,
"step": 8500
},
{
"epoch": 2.7199999999999998,
"eval_gen_len": 20.9772,
"eval_loss": 0.009925846941769123,
"eval_rouge1": 0.5132,
"eval_rouge2": 0.4505,
"eval_rougeL": 0.512,
"eval_rougeLsum": 0.5119,
"eval_runtime": 144.9695,
"eval_samples_per_second": 34.49,
"eval_steps_per_second": 2.159,
"step": 8500
},
{
"epoch": 2.752,
"grad_norm": 0.1662980318069458,
"learning_rate": 9.372683688311512e-07,
"loss": 0.0089,
"step": 8600
},
{
"epoch": 2.784,
"grad_norm": 0.3024541735649109,
"learning_rate": 7.1234946812129e-07,
"loss": 0.0096,
"step": 8700
},
{
"epoch": 2.816,
"grad_norm": 0.39870765805244446,
"learning_rate": 5.178606532859453e-07,
"loss": 0.0094,
"step": 8800
},
{
"epoch": 2.848,
"grad_norm": 0.2740815281867981,
"learning_rate": 3.540456000700909e-07,
"loss": 0.0103,
"step": 8900
},
{
"epoch": 2.88,
"grad_norm": 0.47213834524154663,
"learning_rate": 2.211095529509738e-07,
"loss": 0.0089,
"step": 9000
},
{
"epoch": 2.88,
"eval_gen_len": 20.9772,
"eval_loss": 0.009878098033368587,
"eval_rouge1": 0.5132,
"eval_rouge2": 0.4508,
"eval_rougeL": 0.5121,
"eval_rougeLsum": 0.512,
"eval_runtime": 143.3601,
"eval_samples_per_second": 34.877,
"eval_steps_per_second": 2.183,
"step": 9000
}
],
"logging_steps": 100,
"max_steps": 9375,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.154860858884096e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}