{ "best_global_step": 7000, "best_metric": 0.013348449021577835, "best_model_checkpoint": "bart-finetune/checkpoint-7000", "epoch": 3.0, "eval_steps": 500, "global_step": 7254, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04136504653567735, "grad_norm": 21.97728729248047, "learning_rate": 9.900000000000002e-06, "loss": 6.7599, "step": 100 }, { "epoch": 0.0827300930713547, "grad_norm": 16.123279571533203, "learning_rate": 1.9900000000000003e-05, "loss": 1.9406, "step": 200 }, { "epoch": 0.12409513960703206, "grad_norm": 0.9651572704315186, "learning_rate": 2.9900000000000002e-05, "loss": 0.3388, "step": 300 }, { "epoch": 0.1654601861427094, "grad_norm": 0.7233644723892212, "learning_rate": 3.99e-05, "loss": 0.117, "step": 400 }, { "epoch": 0.20682523267838676, "grad_norm": 0.5955630540847778, "learning_rate": 4.99e-05, "loss": 0.0828, "step": 500 }, { "epoch": 0.20682523267838676, "eval_gen_len": 20.9478, "eval_loss": 0.05528322979807854, "eval_rouge1": 0.5717, "eval_rouge2": 0.4998, "eval_rougeL": 0.5685, "eval_rougeLsum": 0.5684, "eval_runtime": 466.4842, "eval_samples_per_second": 36.85, "eval_steps_per_second": 1.153, "step": 500 }, { "epoch": 0.2481902792140641, "grad_norm": 0.576092004776001, "learning_rate": 4.997349783897062e-05, "loss": 0.0702, "step": 600 }, { "epoch": 0.28955532574974147, "grad_norm": 0.6807641983032227, "learning_rate": 4.989297538182027e-05, "loss": 0.0613, "step": 700 }, { "epoch": 0.3309203722854188, "grad_norm": 0.4327307939529419, "learning_rate": 4.975860411128855e-05, "loss": 0.0566, "step": 800 }, { "epoch": 0.37228541882109617, "grad_norm": 0.46865856647491455, "learning_rate": 4.9570674701083985e-05, "loss": 0.0521, "step": 900 }, { "epoch": 0.4136504653567735, "grad_norm": 0.5254637598991394, "learning_rate": 4.9329593682590795e-05, "loss": 0.0512, "step": 1000 }, { "epoch": 0.4136504653567735, "eval_gen_len": 20.9414, "eval_loss": 0.03401655703783035, "eval_rouge1": 0.5814, "eval_rouge2": 0.5152, "eval_rougeL": 0.578, "eval_rougeLsum": 0.5779, "eval_runtime": 468.717, "eval_samples_per_second": 36.675, "eval_steps_per_second": 1.148, "step": 1000 }, { "epoch": 0.4550155118924509, "grad_norm": 0.35161489248275757, "learning_rate": 4.903588256545478e-05, "loss": 0.0473, "step": 1100 }, { "epoch": 0.4963805584281282, "grad_norm": 0.46844103932380676, "learning_rate": 4.869017670944682e-05, "loss": 0.0413, "step": 1200 }, { "epoch": 0.5377456049638056, "grad_norm": 0.3853241503238678, "learning_rate": 4.829322395004416e-05, "loss": 0.0444, "step": 1300 }, { "epoch": 0.5791106514994829, "grad_norm": 0.5410467386245728, "learning_rate": 4.7845882980702864e-05, "loss": 0.0397, "step": 1400 }, { "epoch": 0.6204756980351603, "grad_norm": 0.4258374869823456, "learning_rate": 4.734912149532076e-05, "loss": 0.0405, "step": 1500 }, { "epoch": 0.6204756980351603, "eval_gen_len": 20.939, "eval_loss": 0.02671843394637108, "eval_rouge1": 0.587, "eval_rouge2": 0.5252, "eval_rougeL": 0.5856, "eval_rougeLsum": 0.5855, "eval_runtime": 465.8947, "eval_samples_per_second": 36.897, "eval_steps_per_second": 1.155, "step": 1500 }, { "epoch": 0.6618407445708376, "grad_norm": 0.4710790812969208, "learning_rate": 4.6804014094909235e-05, "loss": 0.0387, "step": 1600 }, { "epoch": 0.703205791106515, "grad_norm": 0.4411327838897705, "learning_rate": 4.6211739963002075e-05, "loss": 0.0364, "step": 1700 }, { "epoch": 0.7445708376421923, "grad_norm": 0.22456933557987213, "learning_rate": 4.557358031483011e-05, "loss": 0.0339, "step": 1800 }, { "epoch": 0.7859358841778697, "grad_norm": 0.3356589078903198, "learning_rate": 4.489091562577947e-05, "loss": 0.0354, "step": 1900 }, { "epoch": 0.827300930713547, "grad_norm": 0.4155788719654083, "learning_rate": 4.4165222645128965e-05, "loss": 0.0318, "step": 2000 }, { "epoch": 0.827300930713547, "eval_gen_len": 20.9422, "eval_loss": 0.02188122272491455, "eval_rouge1": 0.5888, "eval_rouge2": 0.5292, "eval_rougeL": 0.5876, "eval_rougeLsum": 0.5875, "eval_runtime": 468.6851, "eval_samples_per_second": 36.677, "eval_steps_per_second": 1.148, "step": 2000 }, { "epoch": 0.8686659772492245, "grad_norm": 0.24613259732723236, "learning_rate": 4.339807120152655e-05, "loss": 0.0308, "step": 2100 }, { "epoch": 0.9100310237849017, "grad_norm": 0.263827383518219, "learning_rate": 4.2591120807115226e-05, "loss": 0.0313, "step": 2200 }, { "epoch": 0.9513960703205792, "grad_norm": 0.1906682401895523, "learning_rate": 4.1746117067654476e-05, "loss": 0.0319, "step": 2300 }, { "epoch": 0.9927611168562565, "grad_norm": 0.3021582365036011, "learning_rate": 4.086488790640275e-05, "loss": 0.0295, "step": 2400 }, { "epoch": 1.0339193381592555, "grad_norm": 0.2295190691947937, "learning_rate": 3.994933960992976e-05, "loss": 0.0255, "step": 2500 }, { "epoch": 1.0339193381592555, "eval_gen_len": 20.9452, "eval_loss": 0.020114552229642868, "eval_rouge1": 0.5887, "eval_rouge2": 0.5295, "eval_rougeL": 0.5872, "eval_rougeLsum": 0.5871, "eval_runtime": 468.6112, "eval_samples_per_second": 36.683, "eval_steps_per_second": 1.148, "step": 2500 }, { "epoch": 1.0752843846949327, "grad_norm": 0.22013071179389954, "learning_rate": 3.900145270441215e-05, "loss": 0.0243, "step": 2600 }, { "epoch": 1.1166494312306101, "grad_norm": 0.25927990674972534, "learning_rate": 3.802327767133313e-05, "loss": 0.0252, "step": 2700 }, { "epoch": 1.1580144777662875, "grad_norm": 0.252655953168869, "learning_rate": 3.701693051185375e-05, "loss": 0.0238, "step": 2800 }, { "epoch": 1.199379524301965, "grad_norm": 0.24934452772140503, "learning_rate": 3.598458816945131e-05, "loss": 0.022, "step": 2900 }, { "epoch": 1.2407445708376421, "grad_norm": 0.36218950152397156, "learning_rate": 3.492848382072639e-05, "loss": 0.0235, "step": 3000 }, { "epoch": 1.2407445708376421, "eval_gen_len": 20.9446, "eval_loss": 0.01878739520907402, "eval_rouge1": 0.5899, "eval_rouge2": 0.5324, "eval_rougeL": 0.5889, "eval_rougeLsum": 0.5888, "eval_runtime": 468.4075, "eval_samples_per_second": 36.699, "eval_steps_per_second": 1.149, "step": 3000 }, { "epoch": 1.2821096173733195, "grad_norm": 0.36099350452423096, "learning_rate": 3.3850902044565754e-05, "loss": 0.0223, "step": 3100 }, { "epoch": 1.323474663908997, "grad_norm": 0.4769928455352783, "learning_rate": 3.2754173880111066e-05, "loss": 0.0235, "step": 3200 }, { "epoch": 1.3648397104446741, "grad_norm": 0.2278015911579132, "learning_rate": 3.164067178422423e-05, "loss": 0.0228, "step": 3300 }, { "epoch": 1.4062047569803515, "grad_norm": 0.5187413692474365, "learning_rate": 3.051280449935734e-05, "loss": 0.0225, "step": 3400 }, { "epoch": 1.447569803516029, "grad_norm": 0.23944765329360962, "learning_rate": 2.9373011842929172e-05, "loss": 0.0202, "step": 3500 }, { "epoch": 1.447569803516029, "eval_gen_len": 20.945, "eval_loss": 0.017148399725556374, "eval_rouge1": 0.5898, "eval_rouge2": 0.5328, "eval_rougeL": 0.5888, "eval_rougeLsum": 0.5887, "eval_runtime": 467.061, "eval_samples_per_second": 36.805, "eval_steps_per_second": 1.152, "step": 3500 }, { "epoch": 1.4889348500517063, "grad_norm": 0.241697296500206, "learning_rate": 2.82237594294799e-05, "loss": 0.0199, "step": 3600 }, { "epoch": 1.5302998965873837, "grad_norm": 0.33813291788101196, "learning_rate": 2.7067533337021116e-05, "loss": 0.0217, "step": 3700 }, { "epoch": 1.5716649431230612, "grad_norm": 0.2886863946914673, "learning_rate": 2.5906834729119022e-05, "loss": 0.0209, "step": 3800 }, { "epoch": 1.6130299896587383, "grad_norm": 0.23123699426651, "learning_rate": 2.474417444434436e-05, "loss": 0.0196, "step": 3900 }, { "epoch": 1.6543950361944157, "grad_norm": 0.4096597731113434, "learning_rate": 2.3582067564793196e-05, "loss": 0.0193, "step": 4000 }, { "epoch": 1.6543950361944157, "eval_gen_len": 20.9429, "eval_loss": 0.01633058860898018, "eval_rouge1": 0.5902, "eval_rouge2": 0.5338, "eval_rougeL": 0.5895, "eval_rougeLsum": 0.5894, "eval_runtime": 466.345, "eval_samples_per_second": 36.861, "eval_steps_per_second": 1.154, "step": 4000 }, { "epoch": 1.695760082730093, "grad_norm": 0.5514770150184631, "learning_rate": 2.2423027975428094e-05, "loss": 0.0199, "step": 4100 }, { "epoch": 1.7371251292657703, "grad_norm": 0.22440214455127716, "learning_rate": 2.1269562926008984e-05, "loss": 0.0188, "step": 4200 }, { "epoch": 1.7784901758014477, "grad_norm": 0.22310861945152283, "learning_rate": 2.012416760737725e-05, "loss": 0.019, "step": 4300 }, { "epoch": 1.8198552223371252, "grad_norm": 0.18244564533233643, "learning_rate": 1.8989319753826007e-05, "loss": 0.0191, "step": 4400 }, { "epoch": 1.8612202688728026, "grad_norm": 0.4828181862831116, "learning_rate": 1.7867474283232483e-05, "loss": 0.0193, "step": 4500 }, { "epoch": 1.8612202688728026, "eval_gen_len": 20.9431, "eval_loss": 0.01493143755942583, "eval_rouge1": 0.5917, "eval_rouge2": 0.536, "eval_rougeL": 0.591, "eval_rougeLsum": 0.5909, "eval_runtime": 466.5761, "eval_samples_per_second": 36.843, "eval_steps_per_second": 1.153, "step": 4500 }, { "epoch": 1.90258531540848, "grad_norm": 0.1634412705898285, "learning_rate": 1.6761057986547202e-05, "loss": 0.0203, "step": 4600 }, { "epoch": 1.9439503619441572, "grad_norm": 0.23640815913677216, "learning_rate": 1.5672464278127786e-05, "loss": 0.0188, "step": 4700 }, { "epoch": 1.9853154084798346, "grad_norm": 0.1703311949968338, "learning_rate": 1.4604048018273314e-05, "loss": 0.0174, "step": 4800 }, { "epoch": 2.0264736297828336, "grad_norm": 0.22548532485961914, "learning_rate": 1.3558120419159447e-05, "loss": 0.0165, "step": 4900 }, { "epoch": 2.067838676318511, "grad_norm": 0.43000370264053345, "learning_rate": 1.2536944045193643e-05, "loss": 0.0156, "step": 5000 }, { "epoch": 2.067838676318511, "eval_gen_len": 20.9429, "eval_loss": 0.014507623389363289, "eval_rouge1": 0.5922, "eval_rouge2": 0.5368, "eval_rougeL": 0.5915, "eval_rougeLsum": 0.5914, "eval_runtime": 467.2748, "eval_samples_per_second": 36.788, "eval_steps_per_second": 1.151, "step": 5000 }, { "epoch": 2.109203722854188, "grad_norm": 0.15023747086524963, "learning_rate": 1.1542727918605989e-05, "loss": 0.0131, "step": 5100 }, { "epoch": 2.1505687693898654, "grad_norm": 0.17884424328804016, "learning_rate": 1.0577622740863063e-05, "loss": 0.0158, "step": 5200 }, { "epoch": 2.191933815925543, "grad_norm": 0.19435808062553406, "learning_rate": 9.643716240242118e-06, "loss": 0.0153, "step": 5300 }, { "epoch": 2.2332988624612202, "grad_norm": 0.1834651082754135, "learning_rate": 8.743028655629697e-06, "loss": 0.0159, "step": 5400 }, { "epoch": 2.2746639089968976, "grad_norm": 0.2443581074476242, "learning_rate": 7.877508366314107e-06, "loss": 0.0149, "step": 5500 }, { "epoch": 2.2746639089968976, "eval_gen_len": 20.9438, "eval_loss": 0.013898308388888836, "eval_rouge1": 0.5928, "eval_rouge2": 0.5374, "eval_rougeL": 0.592, "eval_rougeLsum": 0.592, "eval_runtime": 466.318, "eval_samples_per_second": 36.863, "eval_steps_per_second": 1.154, "step": 5500 }, { "epoch": 2.316028955532575, "grad_norm": 0.26785939931869507, "learning_rate": 7.049027677225647e-06, "loss": 0.0126, "step": 5600 }, { "epoch": 2.3573940020682524, "grad_norm": 0.12219066172838211, "learning_rate": 6.259378768741817e-06, "loss": 0.0157, "step": 5700 }, { "epoch": 2.39875904860393, "grad_norm": 0.19022032618522644, "learning_rate": 5.510269819819025e-06, "loss": 0.0158, "step": 5800 }, { "epoch": 2.4401240951396073, "grad_norm": 0.20378048717975616, "learning_rate": 4.803321312837311e-06, "loss": 0.0152, "step": 5900 }, { "epoch": 2.4814891416752842, "grad_norm": 0.21728715300559998, "learning_rate": 4.140062528151422e-06, "loss": 0.0155, "step": 6000 }, { "epoch": 2.4814891416752842, "eval_gen_len": 20.9443, "eval_loss": 0.013674520887434483, "eval_rouge1": 0.5926, "eval_rouge2": 0.5373, "eval_rougeL": 0.5918, "eval_rougeLsum": 0.5917, "eval_runtime": 466.5426, "eval_samples_per_second": 36.846, "eval_steps_per_second": 1.153, "step": 6000 }, { "epoch": 2.5228541882109616, "grad_norm": 0.18222254514694214, "learning_rate": 3.521928235931346e-06, "loss": 0.0136, "step": 6100 }, { "epoch": 2.564219234746639, "grad_norm": 0.23324991762638092, "learning_rate": 2.9502555924485224e-06, "loss": 0.0141, "step": 6200 }, { "epoch": 2.6055842812823165, "grad_norm": 0.12946711480617523, "learning_rate": 2.4262812475216946e-06, "loss": 0.014, "step": 6300 }, { "epoch": 2.646949327817994, "grad_norm": 0.24613253772258759, "learning_rate": 1.9511386693797014e-06, "loss": 0.0152, "step": 6400 }, { "epoch": 2.6883143743536713, "grad_norm": 0.16041553020477295, "learning_rate": 1.5258556927280287e-06, "loss": 0.0142, "step": 6500 }, { "epoch": 2.6883143743536713, "eval_gen_len": 20.9439, "eval_loss": 0.013370907865464687, "eval_rouge1": 0.593, "eval_rouge2": 0.5377, "eval_rougeL": 0.5923, "eval_rougeLsum": 0.5922, "eval_runtime": 465.8365, "eval_samples_per_second": 36.901, "eval_steps_per_second": 1.155, "step": 6500 }, { "epoch": 2.7296794208893482, "grad_norm": 0.18015147745609283, "learning_rate": 1.1513522953231464e-06, "loss": 0.0127, "step": 6600 }, { "epoch": 2.7710444674250256, "grad_norm": 0.1610741764307022, "learning_rate": 8.284386078645151e-07, "loss": 0.0131, "step": 6700 }, { "epoch": 2.812409513960703, "grad_norm": 0.2159341424703598, "learning_rate": 5.578131615091187e-07, "loss": 0.0139, "step": 6800 }, { "epoch": 2.8537745604963805, "grad_norm": 0.32548755407333374, "learning_rate": 3.4006137679963855e-07, "loss": 0.0141, "step": 6900 }, { "epoch": 2.895139607032058, "grad_norm": 0.17154353857040405, "learning_rate": 1.7565429727500472e-07, "loss": 0.0146, "step": 7000 }, { "epoch": 2.895139607032058, "eval_gen_len": 20.9438, "eval_loss": 0.013348449021577835, "eval_rouge1": 0.5928, "eval_rouge2": 0.5377, "eval_rougeL": 0.5921, "eval_rougeLsum": 0.592, "eval_runtime": 466.1991, "eval_samples_per_second": 36.873, "eval_steps_per_second": 1.154, "step": 7000 }, { "epoch": 2.9365046535677353, "grad_norm": 0.16347846388816833, "learning_rate": 6.494757050277689e-08, "loss": 0.0135, "step": 7100 }, { "epoch": 2.9778697001034127, "grad_norm": 0.1634788066148758, "learning_rate": 8.180678737629289e-09, "loss": 0.0126, "step": 7200 } ], "logging_steps": 100, "max_steps": 7254, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.547569722875904e+16, "train_batch_size": 32, "trial_name": null, "trial_params": null }