{ "best_global_step": 9000, "best_metric": 0.009878098033368587, "best_model_checkpoint": "bart-base-finetune/checkpoint-9000", "epoch": 2.88, "eval_steps": 500, "global_step": 9000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.032, "grad_norm": 3.6718413829803467, "learning_rate": 9.900000000000002e-06, "loss": 2.4853, "step": 100 }, { "epoch": 0.064, "grad_norm": 2.339207649230957, "learning_rate": 1.9900000000000003e-05, "loss": 0.5438, "step": 200 }, { "epoch": 0.096, "grad_norm": 1.8246095180511475, "learning_rate": 2.9900000000000002e-05, "loss": 0.3038, "step": 300 }, { "epoch": 0.128, "grad_norm": 1.9325376749038696, "learning_rate": 3.99e-05, "loss": 0.2137, "step": 400 }, { "epoch": 0.16, "grad_norm": 1.487189531326294, "learning_rate": 4.99e-05, "loss": 0.1689, "step": 500 }, { "epoch": 0.16, "eval_gen_len": 20.9688, "eval_loss": 0.10288307070732117, "eval_rouge1": 0.4964, "eval_rouge2": 0.4123, "eval_rougeL": 0.4927, "eval_rougeLsum": 0.4927, "eval_runtime": 144.5729, "eval_samples_per_second": 34.585, "eval_steps_per_second": 2.165, "step": 500 }, { "epoch": 0.192, "grad_norm": 0.9393866062164307, "learning_rate": 4.998465033232545e-05, "loss": 0.1361, "step": 600 }, { "epoch": 0.224, "grad_norm": 1.4453977346420288, "learning_rate": 4.9937998871479073e-05, "loss": 0.1156, "step": 700 }, { "epoch": 0.256, "grad_norm": 1.1997668743133545, "learning_rate": 4.9860102500953126e-05, "loss": 0.0988, "step": 800 }, { "epoch": 0.288, "grad_norm": 1.3937125205993652, "learning_rate": 4.975105881739415e-05, "loss": 0.0889, "step": 900 }, { "epoch": 0.32, "grad_norm": 1.3387874364852905, "learning_rate": 4.961100444203071e-05, "loss": 0.0793, "step": 1000 }, { "epoch": 0.32, "eval_gen_len": 20.9698, "eval_loss": 0.05177076905965805, "eval_rouge1": 0.4988, "eval_rouge2": 0.4239, "eval_rougeL": 0.494, "eval_rougeLsum": 0.494, "eval_runtime": 144.6374, "eval_samples_per_second": 34.569, "eval_steps_per_second": 2.164, "step": 1000 }, { "epoch": 0.352, "grad_norm": 1.226305365562439, "learning_rate": 4.944011484950018e-05, "loss": 0.0726, "step": 1100 }, { "epoch": 0.384, "grad_norm": 1.3799694776535034, "learning_rate": 4.9238604147995884e-05, "loss": 0.0708, "step": 1200 }, { "epoch": 0.416, "grad_norm": 1.0327191352844238, "learning_rate": 4.900672481101019e-05, "loss": 0.0675, "step": 1300 }, { "epoch": 0.448, "grad_norm": 0.8962351083755493, "learning_rate": 4.8744767361009594e-05, "loss": 0.0604, "step": 1400 }, { "epoch": 0.48, "grad_norm": 0.6496387720108032, "learning_rate": 4.8453060005437934e-05, "loss": 0.0568, "step": 1500 }, { "epoch": 0.48, "eval_gen_len": 20.9742, "eval_loss": 0.03353753313422203, "eval_rouge1": 0.5059, "eval_rouge2": 0.4356, "eval_rougeL": 0.5032, "eval_rougeLsum": 0.503, "eval_runtime": 145.5239, "eval_samples_per_second": 34.359, "eval_steps_per_second": 2.151, "step": 1500 }, { "epoch": 0.512, "grad_norm": 1.6739161014556885, "learning_rate": 4.8131968225504245e-05, "loss": 0.0539, "step": 1600 }, { "epoch": 0.544, "grad_norm": 1.063624382019043, "learning_rate": 4.778189431826991e-05, "loss": 0.0502, "step": 1700 }, { "epoch": 0.576, "grad_norm": 1.1451120376586914, "learning_rate": 4.7403276892609224e-05, "loss": 0.0477, "step": 1800 }, { "epoch": 0.608, "grad_norm": 0.7193688750267029, "learning_rate": 4.699659031967479e-05, "loss": 0.0457, "step": 1900 }, { "epoch": 0.64, "grad_norm": 0.9038898944854736, "learning_rate": 4.656234413855613e-05, "loss": 0.0434, "step": 2000 }, { "epoch": 0.64, "eval_gen_len": 20.9714, "eval_loss": 0.029211629182100296, "eval_rouge1": 0.5076, "eval_rouge2": 0.4388, "eval_rougeL": 0.5055, "eval_rougeLsum": 0.5054, "eval_runtime": 145.669, "eval_samples_per_second": 34.324, "eval_steps_per_second": 2.149, "step": 2000 }, { "epoch": 0.672, "grad_norm": 1.7222179174423218, "learning_rate": 4.610108241787629e-05, "loss": 0.0461, "step": 2100 }, { "epoch": 0.704, "grad_norm": 0.6831910014152527, "learning_rate": 4.561338307412629e-05, "loss": 0.0438, "step": 2200 }, { "epoch": 0.736, "grad_norm": 0.4437102675437927, "learning_rate": 4.509985714759151e-05, "loss": 0.0407, "step": 2300 }, { "epoch": 0.768, "grad_norm": 0.6408787965774536, "learning_rate": 4.456114803677696e-05, "loss": 0.0377, "step": 2400 }, { "epoch": 0.8, "grad_norm": 0.7488101124763489, "learning_rate": 4.3997930692291056e-05, "loss": 0.0372, "step": 2500 }, { "epoch": 0.8, "eval_gen_len": 20.9734, "eval_loss": 0.02469678223133087, "eval_rouge1": 0.5089, "eval_rouge2": 0.4398, "eval_rougeL": 0.5063, "eval_rougeLsum": 0.5061, "eval_runtime": 145.4374, "eval_samples_per_second": 34.379, "eval_steps_per_second": 2.152, "step": 2500 }, { "epoch": 0.832, "grad_norm": 0.3353654742240906, "learning_rate": 4.341091077119753e-05, "loss": 0.0367, "step": 2600 }, { "epoch": 0.864, "grad_norm": 0.853186845779419, "learning_rate": 4.2800823752895055e-05, "loss": 0.0345, "step": 2700 }, { "epoch": 0.896, "grad_norm": 0.7370714545249939, "learning_rate": 4.2168434017632516e-05, "loss": 0.038, "step": 2800 }, { "epoch": 0.928, "grad_norm": 0.5349611639976501, "learning_rate": 4.151453388881413e-05, "loss": 0.0321, "step": 2900 }, { "epoch": 0.96, "grad_norm": 0.7140136957168579, "learning_rate": 4.083994264029462e-05, "loss": 0.0347, "step": 3000 }, { "epoch": 0.96, "eval_gen_len": 20.9754, "eval_loss": 0.01928527094423771, "eval_rouge1": 0.5082, "eval_rouge2": 0.4406, "eval_rougeL": 0.5057, "eval_rougeLsum": 0.5055, "eval_runtime": 145.567, "eval_samples_per_second": 34.348, "eval_steps_per_second": 2.15, "step": 3000 }, { "epoch": 0.992, "grad_norm": 0.6110441088676453, "learning_rate": 4.0145505469907984e-05, "loss": 0.0325, "step": 3100 }, { "epoch": 1.024, "grad_norm": 0.4845236539840698, "learning_rate": 3.9432092440516075e-05, "loss": 0.0276, "step": 3200 }, { "epoch": 1.056, "grad_norm": 0.5893353819847107, "learning_rate": 3.8700597389903664e-05, "loss": 0.0262, "step": 3300 }, { "epoch": 1.088, "grad_norm": 0.7486633658409119, "learning_rate": 3.795193681088578e-05, "loss": 0.0235, "step": 3400 }, { "epoch": 1.12, "grad_norm": 0.886471688747406, "learning_rate": 3.7187048703030597e-05, "loss": 0.0235, "step": 3500 }, { "epoch": 1.12, "eval_gen_len": 20.9758, "eval_loss": 0.0190653745085001, "eval_rouge1": 0.5087, "eval_rouge2": 0.4431, "eval_rougeL": 0.5072, "eval_rougeLsum": 0.5071, "eval_runtime": 145.2595, "eval_samples_per_second": 34.421, "eval_steps_per_second": 2.155, "step": 3500 }, { "epoch": 1.152, "grad_norm": 1.1492247581481934, "learning_rate": 3.640689139743628e-05, "loss": 0.0234, "step": 3600 }, { "epoch": 1.184, "grad_norm": 0.7707476019859314, "learning_rate": 3.561244235603451e-05, "loss": 0.0245, "step": 3700 }, { "epoch": 1.216, "grad_norm": 0.8048288822174072, "learning_rate": 3.4804696946924855e-05, "loss": 0.0228, "step": 3800 }, { "epoch": 1.248, "grad_norm": 0.7920108437538147, "learning_rate": 3.398466719727445e-05, "loss": 0.0227, "step": 3900 }, { "epoch": 1.28, "grad_norm": 0.199005588889122, "learning_rate": 3.3153380525345445e-05, "loss": 0.0226, "step": 4000 }, { "epoch": 1.28, "eval_gen_len": 20.975, "eval_loss": 0.0172447320073843, "eval_rouge1": 0.5091, "eval_rouge2": 0.442, "eval_rougeL": 0.5064, "eval_rougeLsum": 0.5063, "eval_runtime": 145.4831, "eval_samples_per_second": 34.368, "eval_steps_per_second": 2.151, "step": 4000 }, { "epoch": 1.312, "grad_norm": 0.6734442114830017, "learning_rate": 3.2311878453238966e-05, "loss": 0.0207, "step": 4100 }, { "epoch": 1.3439999999999999, "grad_norm": 0.5161114931106567, "learning_rate": 3.146121530196824e-05, "loss": 0.0216, "step": 4200 }, { "epoch": 1.376, "grad_norm": 0.4449058175086975, "learning_rate": 3.0602456870495973e-05, "loss": 0.0197, "step": 4300 }, { "epoch": 1.408, "grad_norm": 0.5729345083236694, "learning_rate": 2.9736679100390947e-05, "loss": 0.0208, "step": 4400 }, { "epoch": 1.44, "grad_norm": 0.19021901488304138, "learning_rate": 2.886496672777688e-05, "loss": 0.0201, "step": 4500 }, { "epoch": 1.44, "eval_gen_len": 20.9758, "eval_loss": 0.014488083310425282, "eval_rouge1": 0.5116, "eval_rouge2": 0.4474, "eval_rougeL": 0.5102, "eval_rougeLsum": 0.5101, "eval_runtime": 146.2423, "eval_samples_per_second": 34.19, "eval_steps_per_second": 2.14, "step": 4500 }, { "epoch": 1.472, "grad_norm": 0.632882297039032, "learning_rate": 2.7988411924262648e-05, "loss": 0.0198, "step": 4600 }, { "epoch": 1.504, "grad_norm": 0.37011951208114624, "learning_rate": 2.71081129285564e-05, "loss": 0.0205, "step": 4700 }, { "epoch": 1.536, "grad_norm": 0.528691828250885, "learning_rate": 2.622517267047835e-05, "loss": 0.0204, "step": 4800 }, { "epoch": 1.568, "grad_norm": 0.19730792939662933, "learning_rate": 2.5340697389095973e-05, "loss": 0.0193, "step": 4900 }, { "epoch": 1.6, "grad_norm": 0.5517034530639648, "learning_rate": 2.4455795246713044e-05, "loss": 0.0164, "step": 5000 }, { "epoch": 1.6, "eval_gen_len": 20.9766, "eval_loss": 0.013988671824336052, "eval_rouge1": 0.5114, "eval_rouge2": 0.4467, "eval_rougeL": 0.5099, "eval_rougeLsum": 0.5098, "eval_runtime": 145.249, "eval_samples_per_second": 34.424, "eval_steps_per_second": 2.155, "step": 5000 }, { "epoch": 1.6320000000000001, "grad_norm": 0.6311265826225281, "learning_rate": 2.3571574940449008e-05, "loss": 0.0173, "step": 5100 }, { "epoch": 1.6640000000000001, "grad_norm": 0.764806866645813, "learning_rate": 2.2689144313148382e-05, "loss": 0.0173, "step": 5200 }, { "epoch": 1.696, "grad_norm": 1.1502550840377808, "learning_rate": 2.180960896536036e-05, "loss": 0.018, "step": 5300 }, { "epoch": 1.728, "grad_norm": 0.21649418771266937, "learning_rate": 2.0934070870127912e-05, "loss": 0.0162, "step": 5400 }, { "epoch": 1.76, "grad_norm": 0.3456017076969147, "learning_rate": 2.0063626992321693e-05, "loss": 0.017, "step": 5500 }, { "epoch": 1.76, "eval_gen_len": 20.9772, "eval_loss": 0.012542162090539932, "eval_rouge1": 0.5119, "eval_rouge2": 0.4484, "eval_rougeL": 0.5108, "eval_rougeLsum": 0.5106, "eval_runtime": 144.5364, "eval_samples_per_second": 34.593, "eval_steps_per_second": 2.166, "step": 5500 }, { "epoch": 1.792, "grad_norm": 0.5721284747123718, "learning_rate": 1.919936791424879e-05, "loss": 0.0176, "step": 5600 }, { "epoch": 1.8239999999999998, "grad_norm": 0.26220762729644775, "learning_rate": 1.834237646925815e-05, "loss": 0.0152, "step": 5700 }, { "epoch": 1.8559999999999999, "grad_norm": 0.271634966135025, "learning_rate": 1.7493726385054743e-05, "loss": 0.0152, "step": 5800 }, { "epoch": 1.888, "grad_norm": 0.3826049566268921, "learning_rate": 1.6654480938422208e-05, "loss": 0.0151, "step": 5900 }, { "epoch": 1.92, "grad_norm": 0.49469685554504395, "learning_rate": 1.58256916230395e-05, "loss": 0.0146, "step": 6000 }, { "epoch": 1.92, "eval_gen_len": 20.976, "eval_loss": 0.011809424497187138, "eval_rouge1": 0.5115, "eval_rouge2": 0.4481, "eval_rougeL": 0.5103, "eval_rougeLsum": 0.5101, "eval_runtime": 144.9109, "eval_samples_per_second": 34.504, "eval_steps_per_second": 2.16, "step": 6000 }, { "epoch": 1.952, "grad_norm": 0.6852744221687317, "learning_rate": 1.5008396832060606e-05, "loss": 0.0161, "step": 6100 }, { "epoch": 1.984, "grad_norm": 0.27392491698265076, "learning_rate": 1.4203620557108022e-05, "loss": 0.0146, "step": 6200 }, { "epoch": 2.016, "grad_norm": 0.6940794587135315, "learning_rate": 1.3412371105309856e-05, "loss": 0.0132, "step": 6300 }, { "epoch": 2.048, "grad_norm": 0.2785722613334656, "learning_rate": 1.2635639835988195e-05, "loss": 0.0106, "step": 6400 }, { "epoch": 2.08, "grad_norm": 0.1548278033733368, "learning_rate": 1.1874399918581388e-05, "loss": 0.0114, "step": 6500 }, { "epoch": 2.08, "eval_gen_len": 20.9772, "eval_loss": 0.010936998762190342, "eval_rouge1": 0.5117, "eval_rouge2": 0.4484, "eval_rougeL": 0.5105, "eval_rougeLsum": 0.5105, "eval_runtime": 145.1325, "eval_samples_per_second": 34.451, "eval_steps_per_second": 2.157, "step": 6500 }, { "epoch": 2.112, "grad_norm": 0.14601846039295197, "learning_rate": 1.1129605113356508e-05, "loss": 0.0111, "step": 6600 }, { "epoch": 2.144, "grad_norm": 0.18163363635540009, "learning_rate": 1.040218857643962e-05, "loss": 0.0111, "step": 6700 }, { "epoch": 2.176, "grad_norm": 0.2548365294933319, "learning_rate": 9.693061690661118e-06, "loss": 0.011, "step": 6800 }, { "epoch": 2.208, "grad_norm": 0.21669094264507294, "learning_rate": 9.00311292368079e-06, "loss": 0.0111, "step": 6900 }, { "epoch": 2.24, "grad_norm": 0.47503963112831116, "learning_rate": 8.333206714823513e-06, "loss": 0.0104, "step": 7000 }, { "epoch": 2.24, "eval_gen_len": 20.9772, "eval_loss": 0.01037654373794794, "eval_rouge1": 0.5129, "eval_rouge2": 0.4501, "eval_rougeL": 0.5118, "eval_rougeLsum": 0.5117, "eval_runtime": 143.5577, "eval_samples_per_second": 34.829, "eval_steps_per_second": 2.18, "step": 7000 }, { "epoch": 2.2720000000000002, "grad_norm": 0.7779979705810547, "learning_rate": 7.684182392020015e-06, "loss": 0.0109, "step": 7100 }, { "epoch": 2.304, "grad_norm": 0.7133929133415222, "learning_rate": 7.056853120209888e-06, "loss": 0.0117, "step": 7200 }, { "epoch": 2.336, "grad_norm": 0.5449277758598328, "learning_rate": 6.45200488252426e-06, "loss": 0.0097, "step": 7300 }, { "epoch": 2.368, "grad_norm": 0.5456063747406006, "learning_rate": 5.870395495524664e-06, "loss": 0.0095, "step": 7400 }, { "epoch": 2.4, "grad_norm": 0.21037012338638306, "learning_rate": 5.312753659731909e-06, "loss": 0.01, "step": 7500 }, { "epoch": 2.4, "eval_gen_len": 20.9772, "eval_loss": 0.010514349676668644, "eval_rouge1": 0.5124, "eval_rouge2": 0.4493, "eval_rougeL": 0.5111, "eval_rougeLsum": 0.5111, "eval_runtime": 143.501, "eval_samples_per_second": 34.843, "eval_steps_per_second": 2.181, "step": 7500 }, { "epoch": 2.432, "grad_norm": 0.5376931428909302, "learning_rate": 4.779778046634537e-06, "loss": 0.0114, "step": 7600 }, { "epoch": 2.464, "grad_norm": 0.655579149723053, "learning_rate": 4.272136423320786e-06, "loss": 0.0099, "step": 7700 }, { "epoch": 2.496, "grad_norm": 0.24749213457107544, "learning_rate": 3.7904648158307465e-06, "loss": 0.0088, "step": 7800 }, { "epoch": 2.528, "grad_norm": 0.09235558658838272, "learning_rate": 3.335366712277019e-06, "loss": 0.0092, "step": 7900 }, { "epoch": 2.56, "grad_norm": 0.4215800166130066, "learning_rate": 2.907412306732288e-06, "loss": 0.01, "step": 8000 }, { "epoch": 2.56, "eval_gen_len": 20.9772, "eval_loss": 0.009960692375898361, "eval_rouge1": 0.5131, "eval_rouge2": 0.4506, "eval_rougeL": 0.5119, "eval_rougeLsum": 0.5119, "eval_runtime": 143.2943, "eval_samples_per_second": 34.893, "eval_steps_per_second": 2.184, "step": 8000 }, { "epoch": 2.592, "grad_norm": 0.15820010006427765, "learning_rate": 2.5071377848310595e-06, "loss": 0.0092, "step": 8100 }, { "epoch": 2.624, "grad_norm": 0.24991130828857422, "learning_rate": 2.135044651980733e-06, "loss": 0.0089, "step": 8200 }, { "epoch": 2.656, "grad_norm": 0.5366423726081848, "learning_rate": 1.7915991050236502e-06, "loss": 0.0099, "step": 8300 }, { "epoch": 2.6879999999999997, "grad_norm": 0.2854973375797272, "learning_rate": 1.4772314481373838e-06, "loss": 0.0096, "step": 8400 }, { "epoch": 2.7199999999999998, "grad_norm": 0.24889616668224335, "learning_rate": 1.1923355537050458e-06, "loss": 0.0084, "step": 8500 }, { "epoch": 2.7199999999999998, "eval_gen_len": 20.9772, "eval_loss": 0.009925846941769123, "eval_rouge1": 0.5132, "eval_rouge2": 0.4505, "eval_rougeL": 0.512, "eval_rougeLsum": 0.5119, "eval_runtime": 144.9695, "eval_samples_per_second": 34.49, "eval_steps_per_second": 2.159, "step": 8500 }, { "epoch": 2.752, "grad_norm": 0.1662980318069458, "learning_rate": 9.372683688311512e-07, "loss": 0.0089, "step": 8600 }, { "epoch": 2.784, "grad_norm": 0.3024541735649109, "learning_rate": 7.1234946812129e-07, "loss": 0.0096, "step": 8700 }, { "epoch": 2.816, "grad_norm": 0.39870765805244446, "learning_rate": 5.178606532859453e-07, "loss": 0.0094, "step": 8800 }, { "epoch": 2.848, "grad_norm": 0.2740815281867981, "learning_rate": 3.540456000700909e-07, "loss": 0.0103, "step": 8900 }, { "epoch": 2.88, "grad_norm": 0.47213834524154663, "learning_rate": 2.211095529509738e-07, "loss": 0.0089, "step": 9000 }, { "epoch": 2.88, "eval_gen_len": 20.9772, "eval_loss": 0.009878098033368587, "eval_rouge1": 0.5132, "eval_rouge2": 0.4508, "eval_rougeL": 0.5121, "eval_rougeLsum": 0.512, "eval_runtime": 143.3601, "eval_samples_per_second": 34.877, "eval_steps_per_second": 2.183, "step": 9000 } ], "logging_steps": 100, "max_steps": 9375, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.154860858884096e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }