{ "best_global_step": 3000, "best_metric": 51.14, "best_model_checkpoint": "./bart-email-multitask-updated/checkpoint-3000", "epoch": 1.3807715543281263, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0172607232243031, "grad_norm": 3.8177006244659424, "learning_rate": 1.2250000000000001e-06, "loss": 0.4507, "step": 50 }, { "epoch": 0.0345214464486062, "grad_norm": Infinity, "learning_rate": 2.475e-06, "loss": 0.4331, "step": 100 }, { "epoch": 0.051782169672909294, "grad_norm": 2.9417564868927, "learning_rate": 3.7250000000000003e-06, "loss": 0.4042, "step": 150 }, { "epoch": 0.0690428928972124, "grad_norm": 2.8877062797546387, "learning_rate": 4.975000000000001e-06, "loss": 0.397, "step": 200 }, { "epoch": 0.08630361612151549, "grad_norm": 3.343304395675659, "learning_rate": 4.956203074722918e-06, "loss": 0.3892, "step": 250 }, { "epoch": 0.10356433934581859, "grad_norm": 3.0275661945343018, "learning_rate": 4.911512334644262e-06, "loss": 0.3891, "step": 300 }, { "epoch": 0.12082506257012168, "grad_norm": 3.045884847640991, "learning_rate": 4.866821594565607e-06, "loss": 0.3656, "step": 350 }, { "epoch": 0.1380857857944248, "grad_norm": 2.7904183864593506, "learning_rate": 4.82213085448695e-06, "loss": 0.365, "step": 400 }, { "epoch": 0.15534650901872787, "grad_norm": 3.6787497997283936, "learning_rate": 4.777440114408295e-06, "loss": 0.3594, "step": 450 }, { "epoch": 0.17260723224303098, "grad_norm": 3.1564106941223145, "learning_rate": 4.732749374329639e-06, "loss": 0.3719, "step": 500 }, { "epoch": 0.17260723224303098, "eval_gen_len": 55.68621291448517, "eval_loss": 0.5641192197799683, "eval_rouge1": 49.82, "eval_rouge2": 35.56, "eval_rougeL": 43.37, "eval_rougeLsum": 43.9, "eval_runtime": 5387.3225, "eval_samples_per_second": 1.064, "eval_steps_per_second": 0.266, "step": 500 }, { "epoch": 0.1898679554673341, "grad_norm": 3.0305216312408447, "learning_rate": 4.688058634250984e-06, "loss": 0.3849, "step": 550 }, { "epoch": 0.20712867869163717, "grad_norm": 3.079951524734497, "learning_rate": 4.643367894172328e-06, "loss": 0.3802, "step": 600 }, { "epoch": 0.22438940191594028, "grad_norm": 2.7168169021606445, "learning_rate": 4.598677154093672e-06, "loss": 0.3887, "step": 650 }, { "epoch": 0.24165012514024337, "grad_norm": 2.76423716545105, "learning_rate": 4.553986414015016e-06, "loss": 0.3825, "step": 700 }, { "epoch": 0.2589108483645465, "grad_norm": 4.16721248626709, "learning_rate": 4.509295673936361e-06, "loss": 0.3819, "step": 750 }, { "epoch": 0.2761715715888496, "grad_norm": 2.646681785583496, "learning_rate": 4.464604933857705e-06, "loss": 0.3813, "step": 800 }, { "epoch": 0.2934322948131527, "grad_norm": 3.4927141666412354, "learning_rate": 4.419914193779049e-06, "loss": 0.3793, "step": 850 }, { "epoch": 0.31069301803745575, "grad_norm": 2.364363193511963, "learning_rate": 4.375223453700393e-06, "loss": 0.3815, "step": 900 }, { "epoch": 0.32795374126175886, "grad_norm": 2.7475292682647705, "learning_rate": 4.330532713621738e-06, "loss": 0.3652, "step": 950 }, { "epoch": 0.34521446448606197, "grad_norm": 3.994381904602051, "learning_rate": 4.285841973543082e-06, "loss": 0.39, "step": 1000 }, { "epoch": 0.34521446448606197, "eval_gen_len": 53.06160558464224, "eval_loss": 0.5498749613761902, "eval_rouge1": 50.66, "eval_rouge2": 36.17, "eval_rougeL": 44.07, "eval_rougeLsum": 44.56, "eval_runtime": 5246.3152, "eval_samples_per_second": 1.092, "eval_steps_per_second": 0.273, "step": 1000 }, { "epoch": 0.3624751877103651, "grad_norm": 4.5150227546691895, "learning_rate": 4.241151233464427e-06, "loss": 0.4227, "step": 1050 }, { "epoch": 0.3797359109346682, "grad_norm": 2.6075778007507324, "learning_rate": 4.19646049338577e-06, "loss": 0.4255, "step": 1100 }, { "epoch": 0.39699663415897124, "grad_norm": 3.93216609954834, "learning_rate": 4.151769753307115e-06, "loss": 0.4192, "step": 1150 }, { "epoch": 0.41425735738327435, "grad_norm": 3.318143606185913, "learning_rate": 4.107079013228459e-06, "loss": 0.3984, "step": 1200 }, { "epoch": 0.43151808060757746, "grad_norm": 3.0835282802581787, "learning_rate": 4.062388273149804e-06, "loss": 0.4086, "step": 1250 }, { "epoch": 0.44877880383188057, "grad_norm": 2.782550811767578, "learning_rate": 4.017697533071148e-06, "loss": 0.4114, "step": 1300 }, { "epoch": 0.4660395270561837, "grad_norm": 3.2588839530944824, "learning_rate": 3.973006792992492e-06, "loss": 0.4304, "step": 1350 }, { "epoch": 0.48330025028048673, "grad_norm": 3.4788544178009033, "learning_rate": 3.928316052913836e-06, "loss": 0.4047, "step": 1400 }, { "epoch": 0.5005609735047899, "grad_norm": 3.0864784717559814, "learning_rate": 3.883625312835181e-06, "loss": 0.4185, "step": 1450 }, { "epoch": 0.517821696729093, "grad_norm": 2.8312442302703857, "learning_rate": 3.838934572756525e-06, "loss": 0.4325, "step": 1500 }, { "epoch": 0.517821696729093, "eval_gen_len": 54.41937172774869, "eval_loss": 0.5411620736122131, "eval_rouge1": 50.59, "eval_rouge2": 36.52, "eval_rougeL": 44.19, "eval_rougeLsum": 44.63, "eval_runtime": 5226.6165, "eval_samples_per_second": 1.096, "eval_steps_per_second": 0.274, "step": 1500 }, { "epoch": 0.535082419953396, "grad_norm": 3.31876540184021, "learning_rate": 3.7942438326778697e-06, "loss": 0.4191, "step": 1550 }, { "epoch": 0.5523431431776992, "grad_norm": 3.1453733444213867, "learning_rate": 3.7495530925992137e-06, "loss": 0.4591, "step": 1600 }, { "epoch": 0.5696038664020022, "grad_norm": 3.1156108379364014, "learning_rate": 3.7048623525205578e-06, "loss": 0.4243, "step": 1650 }, { "epoch": 0.5868645896263054, "grad_norm": 3.0627033710479736, "learning_rate": 3.6601716124419022e-06, "loss": 0.4518, "step": 1700 }, { "epoch": 0.6041253128506084, "grad_norm": 3.0280168056488037, "learning_rate": 3.6154808723632467e-06, "loss": 0.4467, "step": 1750 }, { "epoch": 0.6213860360749115, "grad_norm": 3.178391456604004, "learning_rate": 3.570790132284591e-06, "loss": 0.4411, "step": 1800 }, { "epoch": 0.6386467592992147, "grad_norm": 3.445444345474243, "learning_rate": 3.526099392205935e-06, "loss": 0.425, "step": 1850 }, { "epoch": 0.6559074825235177, "grad_norm": 2.4380524158477783, "learning_rate": 3.4814086521272793e-06, "loss": 0.4237, "step": 1900 }, { "epoch": 0.6731682057478209, "grad_norm": 3.591120958328247, "learning_rate": 3.4367179120486237e-06, "loss": 0.4465, "step": 1950 }, { "epoch": 0.6904289289721239, "grad_norm": 2.699303388595581, "learning_rate": 3.3920271719699682e-06, "loss": 0.4328, "step": 2000 }, { "epoch": 0.6904289289721239, "eval_gen_len": 54.16980802792321, "eval_loss": 0.5556456446647644, "eval_rouge1": 50.8, "eval_rouge2": 36.6, "eval_rougeL": 44.19, "eval_rougeLsum": 44.7, "eval_runtime": 5233.7113, "eval_samples_per_second": 1.095, "eval_steps_per_second": 0.274, "step": 2000 }, { "epoch": 0.707689652196427, "grad_norm": 5.292072772979736, "learning_rate": 3.3473364318913127e-06, "loss": 0.4216, "step": 2050 }, { "epoch": 0.7249503754207302, "grad_norm": 2.9521191120147705, "learning_rate": 3.3026456918126563e-06, "loss": 0.4332, "step": 2100 }, { "epoch": 0.7422110986450332, "grad_norm": 4.375521183013916, "learning_rate": 3.2579549517340008e-06, "loss": 0.4392, "step": 2150 }, { "epoch": 0.7594718218693364, "grad_norm": 3.5504395961761475, "learning_rate": 3.2132642116553453e-06, "loss": 0.432, "step": 2200 }, { "epoch": 0.7767325450936394, "grad_norm": 3.7240469455718994, "learning_rate": 3.1685734715766897e-06, "loss": 0.4278, "step": 2250 }, { "epoch": 0.7939932683179425, "grad_norm": 2.717268943786621, "learning_rate": 3.123882731498034e-06, "loss": 0.4145, "step": 2300 }, { "epoch": 0.8112539915422456, "grad_norm": 2.7192165851593018, "learning_rate": 3.079191991419378e-06, "loss": 0.4454, "step": 2350 }, { "epoch": 0.8285147147665487, "grad_norm": 4.111413955688477, "learning_rate": 3.0345012513407223e-06, "loss": 0.4188, "step": 2400 }, { "epoch": 0.8457754379908519, "grad_norm": 3.396127223968506, "learning_rate": 2.9898105112620668e-06, "loss": 0.4349, "step": 2450 }, { "epoch": 0.8630361612151549, "grad_norm": 2.503493309020996, "learning_rate": 2.9451197711834112e-06, "loss": 0.4133, "step": 2500 }, { "epoch": 0.8630361612151549, "eval_gen_len": 54.88080279232112, "eval_loss": 0.5358440279960632, "eval_rouge1": 50.67, "eval_rouge2": 36.36, "eval_rougeL": 44.02, "eval_rougeLsum": 44.56, "eval_runtime": 5344.428, "eval_samples_per_second": 1.072, "eval_steps_per_second": 0.268, "step": 2500 }, { "epoch": 0.880296884439458, "grad_norm": 2.877305746078491, "learning_rate": 2.9004290311047557e-06, "loss": 0.4369, "step": 2550 }, { "epoch": 0.8975576076637611, "grad_norm": 2.5334177017211914, "learning_rate": 2.8557382910260993e-06, "loss": 0.4371, "step": 2600 }, { "epoch": 0.9148183308880642, "grad_norm": 2.780935049057007, "learning_rate": 2.811047550947444e-06, "loss": 0.3965, "step": 2650 }, { "epoch": 0.9320790541123674, "grad_norm": 3.019552707672119, "learning_rate": 2.7663568108687883e-06, "loss": 0.4191, "step": 2700 }, { "epoch": 0.9493397773366704, "grad_norm": 3.7161452770233154, "learning_rate": 2.7216660707901327e-06, "loss": 0.4164, "step": 2750 }, { "epoch": 0.9666005005609735, "grad_norm": 2.9958629608154297, "learning_rate": 2.6769753307114764e-06, "loss": 0.4069, "step": 2800 }, { "epoch": 0.9838612237852766, "grad_norm": 2.9618115425109863, "learning_rate": 2.632284590632821e-06, "loss": 0.4302, "step": 2850 }, { "epoch": 1.0010356433934582, "grad_norm": 2.9072768688201904, "learning_rate": 2.5875938505541653e-06, "loss": 0.426, "step": 2900 }, { "epoch": 1.0182963666177614, "grad_norm": 3.2817041873931885, "learning_rate": 2.5429031104755098e-06, "loss": 0.3912, "step": 2950 }, { "epoch": 1.0355570898420643, "grad_norm": 2.7742252349853516, "learning_rate": 2.498212370396854e-06, "loss": 0.3576, "step": 3000 }, { "epoch": 1.0355570898420643, "eval_gen_len": 53.4542757417103, "eval_loss": 0.5370803475379944, "eval_rouge1": 51.14, "eval_rouge2": 36.78, "eval_rougeL": 44.59, "eval_rougeLsum": 45.09, "eval_runtime": 5216.1975, "eval_samples_per_second": 1.099, "eval_steps_per_second": 0.275, "step": 3000 }, { "epoch": 1.0528178130663675, "grad_norm": 2.5936224460601807, "learning_rate": 2.4535216303181983e-06, "loss": 0.3795, "step": 3050 }, { "epoch": 1.0700785362906706, "grad_norm": 2.727391481399536, "learning_rate": 2.4088308902395428e-06, "loss": 0.3797, "step": 3100 }, { "epoch": 1.0873392595149736, "grad_norm": 2.1693854331970215, "learning_rate": 2.364140150160887e-06, "loss": 0.3809, "step": 3150 }, { "epoch": 1.1045999827392767, "grad_norm": 3.9267098903656006, "learning_rate": 2.3194494100822313e-06, "loss": 0.3816, "step": 3200 }, { "epoch": 1.12186070596358, "grad_norm": 3.905186176300049, "learning_rate": 2.2747586700035753e-06, "loss": 0.3852, "step": 3250 }, { "epoch": 1.139121429187883, "grad_norm": 3.1914596557617188, "learning_rate": 2.23006792992492e-06, "loss": 0.3837, "step": 3300 }, { "epoch": 1.156382152412186, "grad_norm": 3.2150516510009766, "learning_rate": 2.185377189846264e-06, "loss": 0.3916, "step": 3350 }, { "epoch": 1.1736428756364892, "grad_norm": 3.4676005840301514, "learning_rate": 2.1406864497676083e-06, "loss": 0.3889, "step": 3400 }, { "epoch": 1.1909035988607923, "grad_norm": 3.015994071960449, "learning_rate": 2.095995709688953e-06, "loss": 0.3901, "step": 3450 }, { "epoch": 1.2081643220850953, "grad_norm": 3.504163980484009, "learning_rate": 2.051304969610297e-06, "loss": 0.3878, "step": 3500 }, { "epoch": 1.2081643220850953, "eval_gen_len": 54.42425828970332, "eval_loss": 0.5358798503875732, "eval_rouge1": 50.77, "eval_rouge2": 36.52, "eval_rougeL": 44.17, "eval_rougeLsum": 44.73, "eval_runtime": 5360.6563, "eval_samples_per_second": 1.069, "eval_steps_per_second": 0.267, "step": 3500 }, { "epoch": 1.2254250453093984, "grad_norm": 2.9530227184295654, "learning_rate": 2.0066142295316413e-06, "loss": 0.4127, "step": 3550 }, { "epoch": 1.2426857685337016, "grad_norm": 2.9822258949279785, "learning_rate": 1.9619234894529854e-06, "loss": 0.3785, "step": 3600 }, { "epoch": 1.2599464917580048, "grad_norm": 3.8967037200927734, "learning_rate": 1.91723274937433e-06, "loss": 0.4015, "step": 3650 }, { "epoch": 1.2772072149823077, "grad_norm": 2.652034044265747, "learning_rate": 1.872542009295674e-06, "loss": 0.3962, "step": 3700 }, { "epoch": 1.2944679382066109, "grad_norm": 2.3683066368103027, "learning_rate": 1.8278512692170184e-06, "loss": 0.3942, "step": 3750 }, { "epoch": 1.311728661430914, "grad_norm": 2.787900447845459, "learning_rate": 1.7831605291383628e-06, "loss": 0.3902, "step": 3800 }, { "epoch": 1.328989384655217, "grad_norm": 2.8084681034088135, "learning_rate": 1.7384697890597069e-06, "loss": 0.3971, "step": 3850 }, { "epoch": 1.3462501078795202, "grad_norm": 3.2413413524627686, "learning_rate": 1.6937790489810514e-06, "loss": 0.396, "step": 3900 }, { "epoch": 1.3635108311038233, "grad_norm": 2.3999781608581543, "learning_rate": 1.6490883089023956e-06, "loss": 0.3836, "step": 3950 }, { "epoch": 1.3807715543281263, "grad_norm": 3.1420865058898926, "learning_rate": 1.6043975688237399e-06, "loss": 0.3757, "step": 4000 }, { "epoch": 1.3807715543281263, "eval_gen_len": 54.231239092495635, "eval_loss": 0.5294080376625061, "eval_rouge1": 50.76, "eval_rouge2": 36.73, "eval_rougeL": 44.34, "eval_rougeLsum": 44.9, "eval_runtime": 5340.6521, "eval_samples_per_second": 1.073, "eval_steps_per_second": 0.268, "step": 4000 } ], "logging_steps": 50, "max_steps": 5794, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 2, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 2 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.373273785100206e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }