| { |
| "best_global_step": 9000, |
| "best_metric": 0.009878098033368587, |
| "best_model_checkpoint": "bart-base-finetune/checkpoint-9000", |
| "epoch": 3.0, |
| "eval_steps": 500, |
| "global_step": 9375, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.032, |
| "grad_norm": 3.6718413829803467, |
| "learning_rate": 9.900000000000002e-06, |
| "loss": 2.4853, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.064, |
| "grad_norm": 2.339207649230957, |
| "learning_rate": 1.9900000000000003e-05, |
| "loss": 0.5438, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.096, |
| "grad_norm": 1.8246095180511475, |
| "learning_rate": 2.9900000000000002e-05, |
| "loss": 0.3038, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.128, |
| "grad_norm": 1.9325376749038696, |
| "learning_rate": 3.99e-05, |
| "loss": 0.2137, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.16, |
| "grad_norm": 1.487189531326294, |
| "learning_rate": 4.99e-05, |
| "loss": 0.1689, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.16, |
| "eval_gen_len": 20.9688, |
| "eval_loss": 0.10288307070732117, |
| "eval_rouge1": 0.4964, |
| "eval_rouge2": 0.4123, |
| "eval_rougeL": 0.4927, |
| "eval_rougeLsum": 0.4927, |
| "eval_runtime": 144.5729, |
| "eval_samples_per_second": 34.585, |
| "eval_steps_per_second": 2.165, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.192, |
| "grad_norm": 0.9393866062164307, |
| "learning_rate": 4.998465033232545e-05, |
| "loss": 0.1361, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.224, |
| "grad_norm": 1.4453977346420288, |
| "learning_rate": 4.9937998871479073e-05, |
| "loss": 0.1156, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.256, |
| "grad_norm": 1.1997668743133545, |
| "learning_rate": 4.9860102500953126e-05, |
| "loss": 0.0988, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.288, |
| "grad_norm": 1.3937125205993652, |
| "learning_rate": 4.975105881739415e-05, |
| "loss": 0.0889, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.32, |
| "grad_norm": 1.3387874364852905, |
| "learning_rate": 4.961100444203071e-05, |
| "loss": 0.0793, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.32, |
| "eval_gen_len": 20.9698, |
| "eval_loss": 0.05177076905965805, |
| "eval_rouge1": 0.4988, |
| "eval_rouge2": 0.4239, |
| "eval_rougeL": 0.494, |
| "eval_rougeLsum": 0.494, |
| "eval_runtime": 144.6374, |
| "eval_samples_per_second": 34.569, |
| "eval_steps_per_second": 2.164, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.352, |
| "grad_norm": 1.226305365562439, |
| "learning_rate": 4.944011484950018e-05, |
| "loss": 0.0726, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.384, |
| "grad_norm": 1.3799694776535034, |
| "learning_rate": 4.9238604147995884e-05, |
| "loss": 0.0708, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.416, |
| "grad_norm": 1.0327191352844238, |
| "learning_rate": 4.900672481101019e-05, |
| "loss": 0.0675, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.448, |
| "grad_norm": 0.8962351083755493, |
| "learning_rate": 4.8744767361009594e-05, |
| "loss": 0.0604, |
| "step": 1400 |
| }, |
| { |
| "epoch": 0.48, |
| "grad_norm": 0.6496387720108032, |
| "learning_rate": 4.8453060005437934e-05, |
| "loss": 0.0568, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.48, |
| "eval_gen_len": 20.9742, |
| "eval_loss": 0.03353753313422203, |
| "eval_rouge1": 0.5059, |
| "eval_rouge2": 0.4356, |
| "eval_rougeL": 0.5032, |
| "eval_rougeLsum": 0.503, |
| "eval_runtime": 145.5239, |
| "eval_samples_per_second": 34.359, |
| "eval_steps_per_second": 2.151, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.512, |
| "grad_norm": 1.6739161014556885, |
| "learning_rate": 4.8131968225504245e-05, |
| "loss": 0.0539, |
| "step": 1600 |
| }, |
| { |
| "epoch": 0.544, |
| "grad_norm": 1.063624382019043, |
| "learning_rate": 4.778189431826991e-05, |
| "loss": 0.0502, |
| "step": 1700 |
| }, |
| { |
| "epoch": 0.576, |
| "grad_norm": 1.1451120376586914, |
| "learning_rate": 4.7403276892609224e-05, |
| "loss": 0.0477, |
| "step": 1800 |
| }, |
| { |
| "epoch": 0.608, |
| "grad_norm": 0.7193688750267029, |
| "learning_rate": 4.699659031967479e-05, |
| "loss": 0.0457, |
| "step": 1900 |
| }, |
| { |
| "epoch": 0.64, |
| "grad_norm": 0.9038898944854736, |
| "learning_rate": 4.656234413855613e-05, |
| "loss": 0.0434, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.64, |
| "eval_gen_len": 20.9714, |
| "eval_loss": 0.029211629182100296, |
| "eval_rouge1": 0.5076, |
| "eval_rouge2": 0.4388, |
| "eval_rougeL": 0.5055, |
| "eval_rougeLsum": 0.5054, |
| "eval_runtime": 145.669, |
| "eval_samples_per_second": 34.324, |
| "eval_steps_per_second": 2.149, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.672, |
| "grad_norm": 1.7222179174423218, |
| "learning_rate": 4.610108241787629e-05, |
| "loss": 0.0461, |
| "step": 2100 |
| }, |
| { |
| "epoch": 0.704, |
| "grad_norm": 0.6831910014152527, |
| "learning_rate": 4.561338307412629e-05, |
| "loss": 0.0438, |
| "step": 2200 |
| }, |
| { |
| "epoch": 0.736, |
| "grad_norm": 0.4437102675437927, |
| "learning_rate": 4.509985714759151e-05, |
| "loss": 0.0407, |
| "step": 2300 |
| }, |
| { |
| "epoch": 0.768, |
| "grad_norm": 0.6408787965774536, |
| "learning_rate": 4.456114803677696e-05, |
| "loss": 0.0377, |
| "step": 2400 |
| }, |
| { |
| "epoch": 0.8, |
| "grad_norm": 0.7488101124763489, |
| "learning_rate": 4.3997930692291056e-05, |
| "loss": 0.0372, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.8, |
| "eval_gen_len": 20.9734, |
| "eval_loss": 0.02469678223133087, |
| "eval_rouge1": 0.5089, |
| "eval_rouge2": 0.4398, |
| "eval_rougeL": 0.5063, |
| "eval_rougeLsum": 0.5061, |
| "eval_runtime": 145.4374, |
| "eval_samples_per_second": 34.379, |
| "eval_steps_per_second": 2.152, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.832, |
| "grad_norm": 0.3353654742240906, |
| "learning_rate": 4.341091077119753e-05, |
| "loss": 0.0367, |
| "step": 2600 |
| }, |
| { |
| "epoch": 0.864, |
| "grad_norm": 0.853186845779419, |
| "learning_rate": 4.2800823752895055e-05, |
| "loss": 0.0345, |
| "step": 2700 |
| }, |
| { |
| "epoch": 0.896, |
| "grad_norm": 0.7370714545249939, |
| "learning_rate": 4.2168434017632516e-05, |
| "loss": 0.038, |
| "step": 2800 |
| }, |
| { |
| "epoch": 0.928, |
| "grad_norm": 0.5349611639976501, |
| "learning_rate": 4.151453388881413e-05, |
| "loss": 0.0321, |
| "step": 2900 |
| }, |
| { |
| "epoch": 0.96, |
| "grad_norm": 0.7140136957168579, |
| "learning_rate": 4.083994264029462e-05, |
| "loss": 0.0347, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.96, |
| "eval_gen_len": 20.9754, |
| "eval_loss": 0.01928527094423771, |
| "eval_rouge1": 0.5082, |
| "eval_rouge2": 0.4406, |
| "eval_rougeL": 0.5057, |
| "eval_rougeLsum": 0.5055, |
| "eval_runtime": 145.567, |
| "eval_samples_per_second": 34.348, |
| "eval_steps_per_second": 2.15, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.992, |
| "grad_norm": 0.6110441088676453, |
| "learning_rate": 4.0145505469907984e-05, |
| "loss": 0.0325, |
| "step": 3100 |
| }, |
| { |
| "epoch": 1.024, |
| "grad_norm": 0.4845236539840698, |
| "learning_rate": 3.9432092440516075e-05, |
| "loss": 0.0276, |
| "step": 3200 |
| }, |
| { |
| "epoch": 1.056, |
| "grad_norm": 0.5893353819847107, |
| "learning_rate": 3.8700597389903664e-05, |
| "loss": 0.0262, |
| "step": 3300 |
| }, |
| { |
| "epoch": 1.088, |
| "grad_norm": 0.7486633658409119, |
| "learning_rate": 3.795193681088578e-05, |
| "loss": 0.0235, |
| "step": 3400 |
| }, |
| { |
| "epoch": 1.12, |
| "grad_norm": 0.886471688747406, |
| "learning_rate": 3.7187048703030597e-05, |
| "loss": 0.0235, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.12, |
| "eval_gen_len": 20.9758, |
| "eval_loss": 0.0190653745085001, |
| "eval_rouge1": 0.5087, |
| "eval_rouge2": 0.4431, |
| "eval_rougeL": 0.5072, |
| "eval_rougeLsum": 0.5071, |
| "eval_runtime": 145.2595, |
| "eval_samples_per_second": 34.421, |
| "eval_steps_per_second": 2.155, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.152, |
| "grad_norm": 1.1492247581481934, |
| "learning_rate": 3.640689139743628e-05, |
| "loss": 0.0234, |
| "step": 3600 |
| }, |
| { |
| "epoch": 1.184, |
| "grad_norm": 0.7707476019859314, |
| "learning_rate": 3.561244235603451e-05, |
| "loss": 0.0245, |
| "step": 3700 |
| }, |
| { |
| "epoch": 1.216, |
| "grad_norm": 0.8048288822174072, |
| "learning_rate": 3.4804696946924855e-05, |
| "loss": 0.0228, |
| "step": 3800 |
| }, |
| { |
| "epoch": 1.248, |
| "grad_norm": 0.7920108437538147, |
| "learning_rate": 3.398466719727445e-05, |
| "loss": 0.0227, |
| "step": 3900 |
| }, |
| { |
| "epoch": 1.28, |
| "grad_norm": 0.199005588889122, |
| "learning_rate": 3.3153380525345445e-05, |
| "loss": 0.0226, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.28, |
| "eval_gen_len": 20.975, |
| "eval_loss": 0.0172447320073843, |
| "eval_rouge1": 0.5091, |
| "eval_rouge2": 0.442, |
| "eval_rougeL": 0.5064, |
| "eval_rougeLsum": 0.5063, |
| "eval_runtime": 145.4831, |
| "eval_samples_per_second": 34.368, |
| "eval_steps_per_second": 2.151, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.312, |
| "grad_norm": 0.6734442114830017, |
| "learning_rate": 3.2311878453238966e-05, |
| "loss": 0.0207, |
| "step": 4100 |
| }, |
| { |
| "epoch": 1.3439999999999999, |
| "grad_norm": 0.5161114931106567, |
| "learning_rate": 3.146121530196824e-05, |
| "loss": 0.0216, |
| "step": 4200 |
| }, |
| { |
| "epoch": 1.376, |
| "grad_norm": 0.4449058175086975, |
| "learning_rate": 3.0602456870495973e-05, |
| "loss": 0.0197, |
| "step": 4300 |
| }, |
| { |
| "epoch": 1.408, |
| "grad_norm": 0.5729345083236694, |
| "learning_rate": 2.9736679100390947e-05, |
| "loss": 0.0208, |
| "step": 4400 |
| }, |
| { |
| "epoch": 1.44, |
| "grad_norm": 0.19021901488304138, |
| "learning_rate": 2.886496672777688e-05, |
| "loss": 0.0201, |
| "step": 4500 |
| }, |
| { |
| "epoch": 1.44, |
| "eval_gen_len": 20.9758, |
| "eval_loss": 0.014488083310425282, |
| "eval_rouge1": 0.5116, |
| "eval_rouge2": 0.4474, |
| "eval_rougeL": 0.5102, |
| "eval_rougeLsum": 0.5101, |
| "eval_runtime": 146.2423, |
| "eval_samples_per_second": 34.19, |
| "eval_steps_per_second": 2.14, |
| "step": 4500 |
| }, |
| { |
| "epoch": 1.472, |
| "grad_norm": 0.632882297039032, |
| "learning_rate": 2.7988411924262648e-05, |
| "loss": 0.0198, |
| "step": 4600 |
| }, |
| { |
| "epoch": 1.504, |
| "grad_norm": 0.37011951208114624, |
| "learning_rate": 2.71081129285564e-05, |
| "loss": 0.0205, |
| "step": 4700 |
| }, |
| { |
| "epoch": 1.536, |
| "grad_norm": 0.528691828250885, |
| "learning_rate": 2.622517267047835e-05, |
| "loss": 0.0204, |
| "step": 4800 |
| }, |
| { |
| "epoch": 1.568, |
| "grad_norm": 0.19730792939662933, |
| "learning_rate": 2.5340697389095973e-05, |
| "loss": 0.0193, |
| "step": 4900 |
| }, |
| { |
| "epoch": 1.6, |
| "grad_norm": 0.5517034530639648, |
| "learning_rate": 2.4455795246713044e-05, |
| "loss": 0.0164, |
| "step": 5000 |
| }, |
| { |
| "epoch": 1.6, |
| "eval_gen_len": 20.9766, |
| "eval_loss": 0.013988671824336052, |
| "eval_rouge1": 0.5114, |
| "eval_rouge2": 0.4467, |
| "eval_rougeL": 0.5099, |
| "eval_rougeLsum": 0.5098, |
| "eval_runtime": 145.249, |
| "eval_samples_per_second": 34.424, |
| "eval_steps_per_second": 2.155, |
| "step": 5000 |
| }, |
| { |
| "epoch": 1.6320000000000001, |
| "grad_norm": 0.6311265826225281, |
| "learning_rate": 2.3571574940449008e-05, |
| "loss": 0.0173, |
| "step": 5100 |
| }, |
| { |
| "epoch": 1.6640000000000001, |
| "grad_norm": 0.764806866645813, |
| "learning_rate": 2.2689144313148382e-05, |
| "loss": 0.0173, |
| "step": 5200 |
| }, |
| { |
| "epoch": 1.696, |
| "grad_norm": 1.1502550840377808, |
| "learning_rate": 2.180960896536036e-05, |
| "loss": 0.018, |
| "step": 5300 |
| }, |
| { |
| "epoch": 1.728, |
| "grad_norm": 0.21649418771266937, |
| "learning_rate": 2.0934070870127912e-05, |
| "loss": 0.0162, |
| "step": 5400 |
| }, |
| { |
| "epoch": 1.76, |
| "grad_norm": 0.3456017076969147, |
| "learning_rate": 2.0063626992321693e-05, |
| "loss": 0.017, |
| "step": 5500 |
| }, |
| { |
| "epoch": 1.76, |
| "eval_gen_len": 20.9772, |
| "eval_loss": 0.012542162090539932, |
| "eval_rouge1": 0.5119, |
| "eval_rouge2": 0.4484, |
| "eval_rougeL": 0.5108, |
| "eval_rougeLsum": 0.5106, |
| "eval_runtime": 144.5364, |
| "eval_samples_per_second": 34.593, |
| "eval_steps_per_second": 2.166, |
| "step": 5500 |
| }, |
| { |
| "epoch": 1.792, |
| "grad_norm": 0.5721284747123718, |
| "learning_rate": 1.919936791424879e-05, |
| "loss": 0.0176, |
| "step": 5600 |
| }, |
| { |
| "epoch": 1.8239999999999998, |
| "grad_norm": 0.26220762729644775, |
| "learning_rate": 1.834237646925815e-05, |
| "loss": 0.0152, |
| "step": 5700 |
| }, |
| { |
| "epoch": 1.8559999999999999, |
| "grad_norm": 0.271634966135025, |
| "learning_rate": 1.7493726385054743e-05, |
| "loss": 0.0152, |
| "step": 5800 |
| }, |
| { |
| "epoch": 1.888, |
| "grad_norm": 0.3826049566268921, |
| "learning_rate": 1.6654480938422208e-05, |
| "loss": 0.0151, |
| "step": 5900 |
| }, |
| { |
| "epoch": 1.92, |
| "grad_norm": 0.49469685554504395, |
| "learning_rate": 1.58256916230395e-05, |
| "loss": 0.0146, |
| "step": 6000 |
| }, |
| { |
| "epoch": 1.92, |
| "eval_gen_len": 20.976, |
| "eval_loss": 0.011809424497187138, |
| "eval_rouge1": 0.5115, |
| "eval_rouge2": 0.4481, |
| "eval_rougeL": 0.5103, |
| "eval_rougeLsum": 0.5101, |
| "eval_runtime": 144.9109, |
| "eval_samples_per_second": 34.504, |
| "eval_steps_per_second": 2.16, |
| "step": 6000 |
| }, |
| { |
| "epoch": 1.952, |
| "grad_norm": 0.6852744221687317, |
| "learning_rate": 1.5008396832060606e-05, |
| "loss": 0.0161, |
| "step": 6100 |
| }, |
| { |
| "epoch": 1.984, |
| "grad_norm": 0.27392491698265076, |
| "learning_rate": 1.4203620557108022e-05, |
| "loss": 0.0146, |
| "step": 6200 |
| }, |
| { |
| "epoch": 2.016, |
| "grad_norm": 0.6940794587135315, |
| "learning_rate": 1.3412371105309856e-05, |
| "loss": 0.0132, |
| "step": 6300 |
| }, |
| { |
| "epoch": 2.048, |
| "grad_norm": 0.2785722613334656, |
| "learning_rate": 1.2635639835988195e-05, |
| "loss": 0.0106, |
| "step": 6400 |
| }, |
| { |
| "epoch": 2.08, |
| "grad_norm": 0.1548278033733368, |
| "learning_rate": 1.1874399918581388e-05, |
| "loss": 0.0114, |
| "step": 6500 |
| }, |
| { |
| "epoch": 2.08, |
| "eval_gen_len": 20.9772, |
| "eval_loss": 0.010936998762190342, |
| "eval_rouge1": 0.5117, |
| "eval_rouge2": 0.4484, |
| "eval_rougeL": 0.5105, |
| "eval_rougeLsum": 0.5105, |
| "eval_runtime": 145.1325, |
| "eval_samples_per_second": 34.451, |
| "eval_steps_per_second": 2.157, |
| "step": 6500 |
| }, |
| { |
| "epoch": 2.112, |
| "grad_norm": 0.14601846039295197, |
| "learning_rate": 1.1129605113356508e-05, |
| "loss": 0.0111, |
| "step": 6600 |
| }, |
| { |
| "epoch": 2.144, |
| "grad_norm": 0.18163363635540009, |
| "learning_rate": 1.040218857643962e-05, |
| "loss": 0.0111, |
| "step": 6700 |
| }, |
| { |
| "epoch": 2.176, |
| "grad_norm": 0.2548365294933319, |
| "learning_rate": 9.693061690661118e-06, |
| "loss": 0.011, |
| "step": 6800 |
| }, |
| { |
| "epoch": 2.208, |
| "grad_norm": 0.21669094264507294, |
| "learning_rate": 9.00311292368079e-06, |
| "loss": 0.0111, |
| "step": 6900 |
| }, |
| { |
| "epoch": 2.24, |
| "grad_norm": 0.47503963112831116, |
| "learning_rate": 8.333206714823513e-06, |
| "loss": 0.0104, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.24, |
| "eval_gen_len": 20.9772, |
| "eval_loss": 0.01037654373794794, |
| "eval_rouge1": 0.5129, |
| "eval_rouge2": 0.4501, |
| "eval_rougeL": 0.5118, |
| "eval_rougeLsum": 0.5117, |
| "eval_runtime": 143.5577, |
| "eval_samples_per_second": 34.829, |
| "eval_steps_per_second": 2.18, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.2720000000000002, |
| "grad_norm": 0.7779979705810547, |
| "learning_rate": 7.684182392020015e-06, |
| "loss": 0.0109, |
| "step": 7100 |
| }, |
| { |
| "epoch": 2.304, |
| "grad_norm": 0.7133929133415222, |
| "learning_rate": 7.056853120209888e-06, |
| "loss": 0.0117, |
| "step": 7200 |
| }, |
| { |
| "epoch": 2.336, |
| "grad_norm": 0.5449277758598328, |
| "learning_rate": 6.45200488252426e-06, |
| "loss": 0.0097, |
| "step": 7300 |
| }, |
| { |
| "epoch": 2.368, |
| "grad_norm": 0.5456063747406006, |
| "learning_rate": 5.870395495524664e-06, |
| "loss": 0.0095, |
| "step": 7400 |
| }, |
| { |
| "epoch": 2.4, |
| "grad_norm": 0.21037012338638306, |
| "learning_rate": 5.312753659731909e-06, |
| "loss": 0.01, |
| "step": 7500 |
| }, |
| { |
| "epoch": 2.4, |
| "eval_gen_len": 20.9772, |
| "eval_loss": 0.010514349676668644, |
| "eval_rouge1": 0.5124, |
| "eval_rouge2": 0.4493, |
| "eval_rougeL": 0.5111, |
| "eval_rougeLsum": 0.5111, |
| "eval_runtime": 143.501, |
| "eval_samples_per_second": 34.843, |
| "eval_steps_per_second": 2.181, |
| "step": 7500 |
| }, |
| { |
| "epoch": 2.432, |
| "grad_norm": 0.5376931428909302, |
| "learning_rate": 4.779778046634537e-06, |
| "loss": 0.0114, |
| "step": 7600 |
| }, |
| { |
| "epoch": 2.464, |
| "grad_norm": 0.655579149723053, |
| "learning_rate": 4.272136423320786e-06, |
| "loss": 0.0099, |
| "step": 7700 |
| }, |
| { |
| "epoch": 2.496, |
| "grad_norm": 0.24749213457107544, |
| "learning_rate": 3.7904648158307465e-06, |
| "loss": 0.0088, |
| "step": 7800 |
| }, |
| { |
| "epoch": 2.528, |
| "grad_norm": 0.09235558658838272, |
| "learning_rate": 3.335366712277019e-06, |
| "loss": 0.0092, |
| "step": 7900 |
| }, |
| { |
| "epoch": 2.56, |
| "grad_norm": 0.4215800166130066, |
| "learning_rate": 2.907412306732288e-06, |
| "loss": 0.01, |
| "step": 8000 |
| }, |
| { |
| "epoch": 2.56, |
| "eval_gen_len": 20.9772, |
| "eval_loss": 0.009960692375898361, |
| "eval_rouge1": 0.5131, |
| "eval_rouge2": 0.4506, |
| "eval_rougeL": 0.5119, |
| "eval_rougeLsum": 0.5119, |
| "eval_runtime": 143.2943, |
| "eval_samples_per_second": 34.893, |
| "eval_steps_per_second": 2.184, |
| "step": 8000 |
| }, |
| { |
| "epoch": 2.592, |
| "grad_norm": 0.15820010006427765, |
| "learning_rate": 2.5071377848310595e-06, |
| "loss": 0.0092, |
| "step": 8100 |
| }, |
| { |
| "epoch": 2.624, |
| "grad_norm": 0.24991130828857422, |
| "learning_rate": 2.135044651980733e-06, |
| "loss": 0.0089, |
| "step": 8200 |
| }, |
| { |
| "epoch": 2.656, |
| "grad_norm": 0.5366423726081848, |
| "learning_rate": 1.7915991050236502e-06, |
| "loss": 0.0099, |
| "step": 8300 |
| }, |
| { |
| "epoch": 2.6879999999999997, |
| "grad_norm": 0.2854973375797272, |
| "learning_rate": 1.4772314481373838e-06, |
| "loss": 0.0096, |
| "step": 8400 |
| }, |
| { |
| "epoch": 2.7199999999999998, |
| "grad_norm": 0.24889616668224335, |
| "learning_rate": 1.1923355537050458e-06, |
| "loss": 0.0084, |
| "step": 8500 |
| }, |
| { |
| "epoch": 2.7199999999999998, |
| "eval_gen_len": 20.9772, |
| "eval_loss": 0.009925846941769123, |
| "eval_rouge1": 0.5132, |
| "eval_rouge2": 0.4505, |
| "eval_rougeL": 0.512, |
| "eval_rougeLsum": 0.5119, |
| "eval_runtime": 144.9695, |
| "eval_samples_per_second": 34.49, |
| "eval_steps_per_second": 2.159, |
| "step": 8500 |
| }, |
| { |
| "epoch": 2.752, |
| "grad_norm": 0.1662980318069458, |
| "learning_rate": 9.372683688311512e-07, |
| "loss": 0.0089, |
| "step": 8600 |
| }, |
| { |
| "epoch": 2.784, |
| "grad_norm": 0.3024541735649109, |
| "learning_rate": 7.1234946812129e-07, |
| "loss": 0.0096, |
| "step": 8700 |
| }, |
| { |
| "epoch": 2.816, |
| "grad_norm": 0.39870765805244446, |
| "learning_rate": 5.178606532859453e-07, |
| "loss": 0.0094, |
| "step": 8800 |
| }, |
| { |
| "epoch": 2.848, |
| "grad_norm": 0.2740815281867981, |
| "learning_rate": 3.540456000700909e-07, |
| "loss": 0.0103, |
| "step": 8900 |
| }, |
| { |
| "epoch": 2.88, |
| "grad_norm": 0.47213834524154663, |
| "learning_rate": 2.211095529509738e-07, |
| "loss": 0.0089, |
| "step": 9000 |
| }, |
| { |
| "epoch": 2.88, |
| "eval_gen_len": 20.9772, |
| "eval_loss": 0.009878098033368587, |
| "eval_rouge1": 0.5132, |
| "eval_rouge2": 0.4508, |
| "eval_rougeL": 0.5121, |
| "eval_rougeLsum": 0.512, |
| "eval_runtime": 143.3601, |
| "eval_samples_per_second": 34.877, |
| "eval_steps_per_second": 2.183, |
| "step": 9000 |
| }, |
| { |
| "epoch": 2.912, |
| "grad_norm": 0.4264777898788452, |
| "learning_rate": 1.1921906798654513e-07, |
| "loss": 0.0098, |
| "step": 9100 |
| }, |
| { |
| "epoch": 2.944, |
| "grad_norm": 0.2921827435493469, |
| "learning_rate": 4.850180413679406e-08, |
| "loss": 0.0087, |
| "step": 9200 |
| }, |
| { |
| "epoch": 2.976, |
| "grad_norm": 0.5423845648765564, |
| "learning_rate": 9.046363319339945e-09, |
| "loss": 0.0096, |
| "step": 9300 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 9375, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "EarlyStoppingCallback": { |
| "args": { |
| "early_stopping_patience": 3, |
| "early_stopping_threshold": 0.0 |
| }, |
| "attributes": { |
| "early_stopping_patience_counter": 0 |
| } |
| }, |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.20259083829248e+16, |
| "train_batch_size": 16, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|