| { |
| "best_global_step": 7000, |
| "best_metric": 0.013348449021577835, |
| "best_model_checkpoint": "bart-finetune/checkpoint-7000", |
| "epoch": 3.0, |
| "eval_steps": 500, |
| "global_step": 7254, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.04136504653567735, |
| "grad_norm": 21.97728729248047, |
| "learning_rate": 9.900000000000002e-06, |
| "loss": 6.7599, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.0827300930713547, |
| "grad_norm": 16.123279571533203, |
| "learning_rate": 1.9900000000000003e-05, |
| "loss": 1.9406, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.12409513960703206, |
| "grad_norm": 0.9651572704315186, |
| "learning_rate": 2.9900000000000002e-05, |
| "loss": 0.3388, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.1654601861427094, |
| "grad_norm": 0.7233644723892212, |
| "learning_rate": 3.99e-05, |
| "loss": 0.117, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.20682523267838676, |
| "grad_norm": 0.5955630540847778, |
| "learning_rate": 4.99e-05, |
| "loss": 0.0828, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.20682523267838676, |
| "eval_gen_len": 20.9478, |
| "eval_loss": 0.05528322979807854, |
| "eval_rouge1": 0.5717, |
| "eval_rouge2": 0.4998, |
| "eval_rougeL": 0.5685, |
| "eval_rougeLsum": 0.5684, |
| "eval_runtime": 466.4842, |
| "eval_samples_per_second": 36.85, |
| "eval_steps_per_second": 1.153, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.2481902792140641, |
| "grad_norm": 0.576092004776001, |
| "learning_rate": 4.997349783897062e-05, |
| "loss": 0.0702, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.28955532574974147, |
| "grad_norm": 0.6807641983032227, |
| "learning_rate": 4.989297538182027e-05, |
| "loss": 0.0613, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.3309203722854188, |
| "grad_norm": 0.4327307939529419, |
| "learning_rate": 4.975860411128855e-05, |
| "loss": 0.0566, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.37228541882109617, |
| "grad_norm": 0.46865856647491455, |
| "learning_rate": 4.9570674701083985e-05, |
| "loss": 0.0521, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.4136504653567735, |
| "grad_norm": 0.5254637598991394, |
| "learning_rate": 4.9329593682590795e-05, |
| "loss": 0.0512, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.4136504653567735, |
| "eval_gen_len": 20.9414, |
| "eval_loss": 0.03401655703783035, |
| "eval_rouge1": 0.5814, |
| "eval_rouge2": 0.5152, |
| "eval_rougeL": 0.578, |
| "eval_rougeLsum": 0.5779, |
| "eval_runtime": 468.717, |
| "eval_samples_per_second": 36.675, |
| "eval_steps_per_second": 1.148, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.4550155118924509, |
| "grad_norm": 0.35161489248275757, |
| "learning_rate": 4.903588256545478e-05, |
| "loss": 0.0473, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.4963805584281282, |
| "grad_norm": 0.46844103932380676, |
| "learning_rate": 4.869017670944682e-05, |
| "loss": 0.0413, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.5377456049638056, |
| "grad_norm": 0.3853241503238678, |
| "learning_rate": 4.829322395004416e-05, |
| "loss": 0.0444, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.5791106514994829, |
| "grad_norm": 0.5410467386245728, |
| "learning_rate": 4.7845882980702864e-05, |
| "loss": 0.0397, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.6204756980351603, |
| "grad_norm": 0.4258374869823456, |
| "learning_rate": 4.734912149532076e-05, |
| "loss": 0.0405, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.6204756980351603, |
| "eval_gen_len": 20.939, |
| "eval_loss": 0.02671843394637108, |
| "eval_rouge1": 0.587, |
| "eval_rouge2": 0.5252, |
| "eval_rougeL": 0.5856, |
| "eval_rougeLsum": 0.5855, |
| "eval_runtime": 465.8947, |
| "eval_samples_per_second": 36.897, |
| "eval_steps_per_second": 1.155, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.6618407445708376, |
| "grad_norm": 0.4710790812969208, |
| "learning_rate": 4.6804014094909235e-05, |
| "loss": 0.0387, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.703205791106515, |
| "grad_norm": 0.4411327838897705, |
| "learning_rate": 4.6211739963002075e-05, |
| "loss": 0.0364, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.7445708376421923, |
| "grad_norm": 0.22456933557987213, |
| "learning_rate": 4.557358031483011e-05, |
| "loss": 0.0339, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.7859358841778697, |
| "grad_norm": 0.3356589078903198, |
| "learning_rate": 4.489091562577947e-05, |
| "loss": 0.0354, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.827300930713547, |
| "grad_norm": 0.4155788719654083, |
| "learning_rate": 4.4165222645128965e-05, |
| "loss": 0.0318, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.827300930713547, |
| "eval_gen_len": 20.9422, |
| "eval_loss": 0.02188122272491455, |
| "eval_rouge1": 0.5888, |
| "eval_rouge2": 0.5292, |
| "eval_rougeL": 0.5876, |
| "eval_rougeLsum": 0.5875, |
| "eval_runtime": 468.6851, |
| "eval_samples_per_second": 36.677, |
| "eval_steps_per_second": 1.148, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.8686659772492245, |
| "grad_norm": 0.24613259732723236, |
| "learning_rate": 4.339807120152655e-05, |
| "loss": 0.0308, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.9100310237849017, |
| "grad_norm": 0.263827383518219, |
| "learning_rate": 4.2591120807115226e-05, |
| "loss": 0.0313, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.9513960703205792, |
| "grad_norm": 0.1906682401895523, |
| "learning_rate": 4.1746117067654476e-05, |
| "loss": 0.0319, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.9927611168562565, |
| "grad_norm": 0.3021582365036011, |
| "learning_rate": 4.086488790640275e-05, |
| "loss": 0.0295, |
| "step": 2400 |
| }, |
| { |
| "epoch": 1.0339193381592555, |
| "grad_norm": 0.2295190691947937, |
| "learning_rate": 3.994933960992976e-05, |
| "loss": 0.0255, |
| "step": 2500 |
| }, |
| { |
| "epoch": 1.0339193381592555, |
| "eval_gen_len": 20.9452, |
| "eval_loss": 0.020114552229642868, |
| "eval_rouge1": 0.5887, |
| "eval_rouge2": 0.5295, |
| "eval_rougeL": 0.5872, |
| "eval_rougeLsum": 0.5871, |
| "eval_runtime": 468.6112, |
| "eval_samples_per_second": 36.683, |
| "eval_steps_per_second": 1.148, |
| "step": 2500 |
| }, |
| { |
| "epoch": 1.0752843846949327, |
| "grad_norm": 0.22013071179389954, |
| "learning_rate": 3.900145270441215e-05, |
| "loss": 0.0243, |
| "step": 2600 |
| }, |
| { |
| "epoch": 1.1166494312306101, |
| "grad_norm": 0.25927990674972534, |
| "learning_rate": 3.802327767133313e-05, |
| "loss": 0.0252, |
| "step": 2700 |
| }, |
| { |
| "epoch": 1.1580144777662875, |
| "grad_norm": 0.252655953168869, |
| "learning_rate": 3.701693051185375e-05, |
| "loss": 0.0238, |
| "step": 2800 |
| }, |
| { |
| "epoch": 1.199379524301965, |
| "grad_norm": 0.24934452772140503, |
| "learning_rate": 3.598458816945131e-05, |
| "loss": 0.022, |
| "step": 2900 |
| }, |
| { |
| "epoch": 1.2407445708376421, |
| "grad_norm": 0.36218950152397156, |
| "learning_rate": 3.492848382072639e-05, |
| "loss": 0.0235, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.2407445708376421, |
| "eval_gen_len": 20.9446, |
| "eval_loss": 0.01878739520907402, |
| "eval_rouge1": 0.5899, |
| "eval_rouge2": 0.5324, |
| "eval_rougeL": 0.5889, |
| "eval_rougeLsum": 0.5888, |
| "eval_runtime": 468.4075, |
| "eval_samples_per_second": 36.699, |
| "eval_steps_per_second": 1.149, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.2821096173733195, |
| "grad_norm": 0.36099350452423096, |
| "learning_rate": 3.3850902044565754e-05, |
| "loss": 0.0223, |
| "step": 3100 |
| }, |
| { |
| "epoch": 1.323474663908997, |
| "grad_norm": 0.4769928455352783, |
| "learning_rate": 3.2754173880111066e-05, |
| "loss": 0.0235, |
| "step": 3200 |
| }, |
| { |
| "epoch": 1.3648397104446741, |
| "grad_norm": 0.2278015911579132, |
| "learning_rate": 3.164067178422423e-05, |
| "loss": 0.0228, |
| "step": 3300 |
| }, |
| { |
| "epoch": 1.4062047569803515, |
| "grad_norm": 0.5187413692474365, |
| "learning_rate": 3.051280449935734e-05, |
| "loss": 0.0225, |
| "step": 3400 |
| }, |
| { |
| "epoch": 1.447569803516029, |
| "grad_norm": 0.23944765329360962, |
| "learning_rate": 2.9373011842929172e-05, |
| "loss": 0.0202, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.447569803516029, |
| "eval_gen_len": 20.945, |
| "eval_loss": 0.017148399725556374, |
| "eval_rouge1": 0.5898, |
| "eval_rouge2": 0.5328, |
| "eval_rougeL": 0.5888, |
| "eval_rougeLsum": 0.5887, |
| "eval_runtime": 467.061, |
| "eval_samples_per_second": 36.805, |
| "eval_steps_per_second": 1.152, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.4889348500517063, |
| "grad_norm": 0.241697296500206, |
| "learning_rate": 2.82237594294799e-05, |
| "loss": 0.0199, |
| "step": 3600 |
| }, |
| { |
| "epoch": 1.5302998965873837, |
| "grad_norm": 0.33813291788101196, |
| "learning_rate": 2.7067533337021116e-05, |
| "loss": 0.0217, |
| "step": 3700 |
| }, |
| { |
| "epoch": 1.5716649431230612, |
| "grad_norm": 0.2886863946914673, |
| "learning_rate": 2.5906834729119022e-05, |
| "loss": 0.0209, |
| "step": 3800 |
| }, |
| { |
| "epoch": 1.6130299896587383, |
| "grad_norm": 0.23123699426651, |
| "learning_rate": 2.474417444434436e-05, |
| "loss": 0.0196, |
| "step": 3900 |
| }, |
| { |
| "epoch": 1.6543950361944157, |
| "grad_norm": 0.4096597731113434, |
| "learning_rate": 2.3582067564793196e-05, |
| "loss": 0.0193, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.6543950361944157, |
| "eval_gen_len": 20.9429, |
| "eval_loss": 0.01633058860898018, |
| "eval_rouge1": 0.5902, |
| "eval_rouge2": 0.5338, |
| "eval_rougeL": 0.5895, |
| "eval_rougeLsum": 0.5894, |
| "eval_runtime": 466.345, |
| "eval_samples_per_second": 36.861, |
| "eval_steps_per_second": 1.154, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.695760082730093, |
| "grad_norm": 0.5514770150184631, |
| "learning_rate": 2.2423027975428094e-05, |
| "loss": 0.0199, |
| "step": 4100 |
| }, |
| { |
| "epoch": 1.7371251292657703, |
| "grad_norm": 0.22440214455127716, |
| "learning_rate": 2.1269562926008984e-05, |
| "loss": 0.0188, |
| "step": 4200 |
| }, |
| { |
| "epoch": 1.7784901758014477, |
| "grad_norm": 0.22310861945152283, |
| "learning_rate": 2.012416760737725e-05, |
| "loss": 0.019, |
| "step": 4300 |
| }, |
| { |
| "epoch": 1.8198552223371252, |
| "grad_norm": 0.18244564533233643, |
| "learning_rate": 1.8989319753826007e-05, |
| "loss": 0.0191, |
| "step": 4400 |
| }, |
| { |
| "epoch": 1.8612202688728026, |
| "grad_norm": 0.4828181862831116, |
| "learning_rate": 1.7867474283232483e-05, |
| "loss": 0.0193, |
| "step": 4500 |
| }, |
| { |
| "epoch": 1.8612202688728026, |
| "eval_gen_len": 20.9431, |
| "eval_loss": 0.01493143755942583, |
| "eval_rouge1": 0.5917, |
| "eval_rouge2": 0.536, |
| "eval_rougeL": 0.591, |
| "eval_rougeLsum": 0.5909, |
| "eval_runtime": 466.5761, |
| "eval_samples_per_second": 36.843, |
| "eval_steps_per_second": 1.153, |
| "step": 4500 |
| }, |
| { |
| "epoch": 1.90258531540848, |
| "grad_norm": 0.1634412705898285, |
| "learning_rate": 1.6761057986547202e-05, |
| "loss": 0.0203, |
| "step": 4600 |
| }, |
| { |
| "epoch": 1.9439503619441572, |
| "grad_norm": 0.23640815913677216, |
| "learning_rate": 1.5672464278127786e-05, |
| "loss": 0.0188, |
| "step": 4700 |
| }, |
| { |
| "epoch": 1.9853154084798346, |
| "grad_norm": 0.1703311949968338, |
| "learning_rate": 1.4604048018273314e-05, |
| "loss": 0.0174, |
| "step": 4800 |
| }, |
| { |
| "epoch": 2.0264736297828336, |
| "grad_norm": 0.22548532485961914, |
| "learning_rate": 1.3558120419159447e-05, |
| "loss": 0.0165, |
| "step": 4900 |
| }, |
| { |
| "epoch": 2.067838676318511, |
| "grad_norm": 0.43000370264053345, |
| "learning_rate": 1.2536944045193643e-05, |
| "loss": 0.0156, |
| "step": 5000 |
| }, |
| { |
| "epoch": 2.067838676318511, |
| "eval_gen_len": 20.9429, |
| "eval_loss": 0.014507623389363289, |
| "eval_rouge1": 0.5922, |
| "eval_rouge2": 0.5368, |
| "eval_rougeL": 0.5915, |
| "eval_rougeLsum": 0.5914, |
| "eval_runtime": 467.2748, |
| "eval_samples_per_second": 36.788, |
| "eval_steps_per_second": 1.151, |
| "step": 5000 |
| }, |
| { |
| "epoch": 2.109203722854188, |
| "grad_norm": 0.15023747086524963, |
| "learning_rate": 1.1542727918605989e-05, |
| "loss": 0.0131, |
| "step": 5100 |
| }, |
| { |
| "epoch": 2.1505687693898654, |
| "grad_norm": 0.17884424328804016, |
| "learning_rate": 1.0577622740863063e-05, |
| "loss": 0.0158, |
| "step": 5200 |
| }, |
| { |
| "epoch": 2.191933815925543, |
| "grad_norm": 0.19435808062553406, |
| "learning_rate": 9.643716240242118e-06, |
| "loss": 0.0153, |
| "step": 5300 |
| }, |
| { |
| "epoch": 2.2332988624612202, |
| "grad_norm": 0.1834651082754135, |
| "learning_rate": 8.743028655629697e-06, |
| "loss": 0.0159, |
| "step": 5400 |
| }, |
| { |
| "epoch": 2.2746639089968976, |
| "grad_norm": 0.2443581074476242, |
| "learning_rate": 7.877508366314107e-06, |
| "loss": 0.0149, |
| "step": 5500 |
| }, |
| { |
| "epoch": 2.2746639089968976, |
| "eval_gen_len": 20.9438, |
| "eval_loss": 0.013898308388888836, |
| "eval_rouge1": 0.5928, |
| "eval_rouge2": 0.5374, |
| "eval_rougeL": 0.592, |
| "eval_rougeLsum": 0.592, |
| "eval_runtime": 466.318, |
| "eval_samples_per_second": 36.863, |
| "eval_steps_per_second": 1.154, |
| "step": 5500 |
| }, |
| { |
| "epoch": 2.316028955532575, |
| "grad_norm": 0.26785939931869507, |
| "learning_rate": 7.049027677225647e-06, |
| "loss": 0.0126, |
| "step": 5600 |
| }, |
| { |
| "epoch": 2.3573940020682524, |
| "grad_norm": 0.12219066172838211, |
| "learning_rate": 6.259378768741817e-06, |
| "loss": 0.0157, |
| "step": 5700 |
| }, |
| { |
| "epoch": 2.39875904860393, |
| "grad_norm": 0.19022032618522644, |
| "learning_rate": 5.510269819819025e-06, |
| "loss": 0.0158, |
| "step": 5800 |
| }, |
| { |
| "epoch": 2.4401240951396073, |
| "grad_norm": 0.20378048717975616, |
| "learning_rate": 4.803321312837311e-06, |
| "loss": 0.0152, |
| "step": 5900 |
| }, |
| { |
| "epoch": 2.4814891416752842, |
| "grad_norm": 0.21728715300559998, |
| "learning_rate": 4.140062528151422e-06, |
| "loss": 0.0155, |
| "step": 6000 |
| }, |
| { |
| "epoch": 2.4814891416752842, |
| "eval_gen_len": 20.9443, |
| "eval_loss": 0.013674520887434483, |
| "eval_rouge1": 0.5926, |
| "eval_rouge2": 0.5373, |
| "eval_rougeL": 0.5918, |
| "eval_rougeLsum": 0.5917, |
| "eval_runtime": 466.5426, |
| "eval_samples_per_second": 36.846, |
| "eval_steps_per_second": 1.153, |
| "step": 6000 |
| }, |
| { |
| "epoch": 2.5228541882109616, |
| "grad_norm": 0.18222254514694214, |
| "learning_rate": 3.521928235931346e-06, |
| "loss": 0.0136, |
| "step": 6100 |
| }, |
| { |
| "epoch": 2.564219234746639, |
| "grad_norm": 0.23324991762638092, |
| "learning_rate": 2.9502555924485224e-06, |
| "loss": 0.0141, |
| "step": 6200 |
| }, |
| { |
| "epoch": 2.6055842812823165, |
| "grad_norm": 0.12946711480617523, |
| "learning_rate": 2.4262812475216946e-06, |
| "loss": 0.014, |
| "step": 6300 |
| }, |
| { |
| "epoch": 2.646949327817994, |
| "grad_norm": 0.24613253772258759, |
| "learning_rate": 1.9511386693797014e-06, |
| "loss": 0.0152, |
| "step": 6400 |
| }, |
| { |
| "epoch": 2.6883143743536713, |
| "grad_norm": 0.16041553020477295, |
| "learning_rate": 1.5258556927280287e-06, |
| "loss": 0.0142, |
| "step": 6500 |
| }, |
| { |
| "epoch": 2.6883143743536713, |
| "eval_gen_len": 20.9439, |
| "eval_loss": 0.013370907865464687, |
| "eval_rouge1": 0.593, |
| "eval_rouge2": 0.5377, |
| "eval_rougeL": 0.5923, |
| "eval_rougeLsum": 0.5922, |
| "eval_runtime": 465.8365, |
| "eval_samples_per_second": 36.901, |
| "eval_steps_per_second": 1.155, |
| "step": 6500 |
| }, |
| { |
| "epoch": 2.7296794208893482, |
| "grad_norm": 0.18015147745609283, |
| "learning_rate": 1.1513522953231464e-06, |
| "loss": 0.0127, |
| "step": 6600 |
| }, |
| { |
| "epoch": 2.7710444674250256, |
| "grad_norm": 0.1610741764307022, |
| "learning_rate": 8.284386078645151e-07, |
| "loss": 0.0131, |
| "step": 6700 |
| }, |
| { |
| "epoch": 2.812409513960703, |
| "grad_norm": 0.2159341424703598, |
| "learning_rate": 5.578131615091187e-07, |
| "loss": 0.0139, |
| "step": 6800 |
| }, |
| { |
| "epoch": 2.8537745604963805, |
| "grad_norm": 0.32548755407333374, |
| "learning_rate": 3.4006137679963855e-07, |
| "loss": 0.0141, |
| "step": 6900 |
| }, |
| { |
| "epoch": 2.895139607032058, |
| "grad_norm": 0.17154353857040405, |
| "learning_rate": 1.7565429727500472e-07, |
| "loss": 0.0146, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.895139607032058, |
| "eval_gen_len": 20.9438, |
| "eval_loss": 0.013348449021577835, |
| "eval_rouge1": 0.5928, |
| "eval_rouge2": 0.5377, |
| "eval_rougeL": 0.5921, |
| "eval_rougeLsum": 0.592, |
| "eval_runtime": 466.1991, |
| "eval_samples_per_second": 36.873, |
| "eval_steps_per_second": 1.154, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.9365046535677353, |
| "grad_norm": 0.16347846388816833, |
| "learning_rate": 6.494757050277689e-08, |
| "loss": 0.0135, |
| "step": 7100 |
| }, |
| { |
| "epoch": 2.9778697001034127, |
| "grad_norm": 0.1634788066148758, |
| "learning_rate": 8.180678737629289e-09, |
| "loss": 0.0126, |
| "step": 7200 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 7254, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "EarlyStoppingCallback": { |
| "args": { |
| "early_stopping_patience": 3, |
| "early_stopping_threshold": 0.0 |
| }, |
| "attributes": { |
| "early_stopping_patience_counter": 0 |
| } |
| }, |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.547569722875904e+16, |
| "train_batch_size": 32, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|