bart-email-multitask / last-checkpoint /trainer_state.json
rosypossyyyy's picture
Training in progress, step 4000, checkpoint
8551d0d verified
Raw
History Blame Contribute Delete
17.9 kB
Invalid JSON:Unexpected token 'I', ..."ad_norm": Infinity, "... is not valid JSON
{
"best_global_step": 3000,
"best_metric": 51.14,
"best_model_checkpoint": "./bart-email-multitask-updated/checkpoint-3000",
"epoch": 1.3807715543281263,
"eval_steps": 500,
"global_step": 4000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0172607232243031,
"grad_norm": 3.8177006244659424,
"learning_rate": 1.2250000000000001e-06,
"loss": 0.4507,
"step": 50
},
{
"epoch": 0.0345214464486062,
"grad_norm": Infinity,
"learning_rate": 2.475e-06,
"loss": 0.4331,
"step": 100
},
{
"epoch": 0.051782169672909294,
"grad_norm": 2.9417564868927,
"learning_rate": 3.7250000000000003e-06,
"loss": 0.4042,
"step": 150
},
{
"epoch": 0.0690428928972124,
"grad_norm": 2.8877062797546387,
"learning_rate": 4.975000000000001e-06,
"loss": 0.397,
"step": 200
},
{
"epoch": 0.08630361612151549,
"grad_norm": 3.343304395675659,
"learning_rate": 4.956203074722918e-06,
"loss": 0.3892,
"step": 250
},
{
"epoch": 0.10356433934581859,
"grad_norm": 3.0275661945343018,
"learning_rate": 4.911512334644262e-06,
"loss": 0.3891,
"step": 300
},
{
"epoch": 0.12082506257012168,
"grad_norm": 3.045884847640991,
"learning_rate": 4.866821594565607e-06,
"loss": 0.3656,
"step": 350
},
{
"epoch": 0.1380857857944248,
"grad_norm": 2.7904183864593506,
"learning_rate": 4.82213085448695e-06,
"loss": 0.365,
"step": 400
},
{
"epoch": 0.15534650901872787,
"grad_norm": 3.6787497997283936,
"learning_rate": 4.777440114408295e-06,
"loss": 0.3594,
"step": 450
},
{
"epoch": 0.17260723224303098,
"grad_norm": 3.1564106941223145,
"learning_rate": 4.732749374329639e-06,
"loss": 0.3719,
"step": 500
},
{
"epoch": 0.17260723224303098,
"eval_gen_len": 55.68621291448517,
"eval_loss": 0.5641192197799683,
"eval_rouge1": 49.82,
"eval_rouge2": 35.56,
"eval_rougeL": 43.37,
"eval_rougeLsum": 43.9,
"eval_runtime": 5387.3225,
"eval_samples_per_second": 1.064,
"eval_steps_per_second": 0.266,
"step": 500
},
{
"epoch": 0.1898679554673341,
"grad_norm": 3.0305216312408447,
"learning_rate": 4.688058634250984e-06,
"loss": 0.3849,
"step": 550
},
{
"epoch": 0.20712867869163717,
"grad_norm": 3.079951524734497,
"learning_rate": 4.643367894172328e-06,
"loss": 0.3802,
"step": 600
},
{
"epoch": 0.22438940191594028,
"grad_norm": 2.7168169021606445,
"learning_rate": 4.598677154093672e-06,
"loss": 0.3887,
"step": 650
},
{
"epoch": 0.24165012514024337,
"grad_norm": 2.76423716545105,
"learning_rate": 4.553986414015016e-06,
"loss": 0.3825,
"step": 700
},
{
"epoch": 0.2589108483645465,
"grad_norm": 4.16721248626709,
"learning_rate": 4.509295673936361e-06,
"loss": 0.3819,
"step": 750
},
{
"epoch": 0.2761715715888496,
"grad_norm": 2.646681785583496,
"learning_rate": 4.464604933857705e-06,
"loss": 0.3813,
"step": 800
},
{
"epoch": 0.2934322948131527,
"grad_norm": 3.4927141666412354,
"learning_rate": 4.419914193779049e-06,
"loss": 0.3793,
"step": 850
},
{
"epoch": 0.31069301803745575,
"grad_norm": 2.364363193511963,
"learning_rate": 4.375223453700393e-06,
"loss": 0.3815,
"step": 900
},
{
"epoch": 0.32795374126175886,
"grad_norm": 2.7475292682647705,
"learning_rate": 4.330532713621738e-06,
"loss": 0.3652,
"step": 950
},
{
"epoch": 0.34521446448606197,
"grad_norm": 3.994381904602051,
"learning_rate": 4.285841973543082e-06,
"loss": 0.39,
"step": 1000
},
{
"epoch": 0.34521446448606197,
"eval_gen_len": 53.06160558464224,
"eval_loss": 0.5498749613761902,
"eval_rouge1": 50.66,
"eval_rouge2": 36.17,
"eval_rougeL": 44.07,
"eval_rougeLsum": 44.56,
"eval_runtime": 5246.3152,
"eval_samples_per_second": 1.092,
"eval_steps_per_second": 0.273,
"step": 1000
},
{
"epoch": 0.3624751877103651,
"grad_norm": 4.5150227546691895,
"learning_rate": 4.241151233464427e-06,
"loss": 0.4227,
"step": 1050
},
{
"epoch": 0.3797359109346682,
"grad_norm": 2.6075778007507324,
"learning_rate": 4.19646049338577e-06,
"loss": 0.4255,
"step": 1100
},
{
"epoch": 0.39699663415897124,
"grad_norm": 3.93216609954834,
"learning_rate": 4.151769753307115e-06,
"loss": 0.4192,
"step": 1150
},
{
"epoch": 0.41425735738327435,
"grad_norm": 3.318143606185913,
"learning_rate": 4.107079013228459e-06,
"loss": 0.3984,
"step": 1200
},
{
"epoch": 0.43151808060757746,
"grad_norm": 3.0835282802581787,
"learning_rate": 4.062388273149804e-06,
"loss": 0.4086,
"step": 1250
},
{
"epoch": 0.44877880383188057,
"grad_norm": 2.782550811767578,
"learning_rate": 4.017697533071148e-06,
"loss": 0.4114,
"step": 1300
},
{
"epoch": 0.4660395270561837,
"grad_norm": 3.2588839530944824,
"learning_rate": 3.973006792992492e-06,
"loss": 0.4304,
"step": 1350
},
{
"epoch": 0.48330025028048673,
"grad_norm": 3.4788544178009033,
"learning_rate": 3.928316052913836e-06,
"loss": 0.4047,
"step": 1400
},
{
"epoch": 0.5005609735047899,
"grad_norm": 3.0864784717559814,
"learning_rate": 3.883625312835181e-06,
"loss": 0.4185,
"step": 1450
},
{
"epoch": 0.517821696729093,
"grad_norm": 2.8312442302703857,
"learning_rate": 3.838934572756525e-06,
"loss": 0.4325,
"step": 1500
},
{
"epoch": 0.517821696729093,
"eval_gen_len": 54.41937172774869,
"eval_loss": 0.5411620736122131,
"eval_rouge1": 50.59,
"eval_rouge2": 36.52,
"eval_rougeL": 44.19,
"eval_rougeLsum": 44.63,
"eval_runtime": 5226.6165,
"eval_samples_per_second": 1.096,
"eval_steps_per_second": 0.274,
"step": 1500
},
{
"epoch": 0.535082419953396,
"grad_norm": 3.31876540184021,
"learning_rate": 3.7942438326778697e-06,
"loss": 0.4191,
"step": 1550
},
{
"epoch": 0.5523431431776992,
"grad_norm": 3.1453733444213867,
"learning_rate": 3.7495530925992137e-06,
"loss": 0.4591,
"step": 1600
},
{
"epoch": 0.5696038664020022,
"grad_norm": 3.1156108379364014,
"learning_rate": 3.7048623525205578e-06,
"loss": 0.4243,
"step": 1650
},
{
"epoch": 0.5868645896263054,
"grad_norm": 3.0627033710479736,
"learning_rate": 3.6601716124419022e-06,
"loss": 0.4518,
"step": 1700
},
{
"epoch": 0.6041253128506084,
"grad_norm": 3.0280168056488037,
"learning_rate": 3.6154808723632467e-06,
"loss": 0.4467,
"step": 1750
},
{
"epoch": 0.6213860360749115,
"grad_norm": 3.178391456604004,
"learning_rate": 3.570790132284591e-06,
"loss": 0.4411,
"step": 1800
},
{
"epoch": 0.6386467592992147,
"grad_norm": 3.445444345474243,
"learning_rate": 3.526099392205935e-06,
"loss": 0.425,
"step": 1850
},
{
"epoch": 0.6559074825235177,
"grad_norm": 2.4380524158477783,
"learning_rate": 3.4814086521272793e-06,
"loss": 0.4237,
"step": 1900
},
{
"epoch": 0.6731682057478209,
"grad_norm": 3.591120958328247,
"learning_rate": 3.4367179120486237e-06,
"loss": 0.4465,
"step": 1950
},
{
"epoch": 0.6904289289721239,
"grad_norm": 2.699303388595581,
"learning_rate": 3.3920271719699682e-06,
"loss": 0.4328,
"step": 2000
},
{
"epoch": 0.6904289289721239,
"eval_gen_len": 54.16980802792321,
"eval_loss": 0.5556456446647644,
"eval_rouge1": 50.8,
"eval_rouge2": 36.6,
"eval_rougeL": 44.19,
"eval_rougeLsum": 44.7,
"eval_runtime": 5233.7113,
"eval_samples_per_second": 1.095,
"eval_steps_per_second": 0.274,
"step": 2000
},
{
"epoch": 0.707689652196427,
"grad_norm": 5.292072772979736,
"learning_rate": 3.3473364318913127e-06,
"loss": 0.4216,
"step": 2050
},
{
"epoch": 0.7249503754207302,
"grad_norm": 2.9521191120147705,
"learning_rate": 3.3026456918126563e-06,
"loss": 0.4332,
"step": 2100
},
{
"epoch": 0.7422110986450332,
"grad_norm": 4.375521183013916,
"learning_rate": 3.2579549517340008e-06,
"loss": 0.4392,
"step": 2150
},
{
"epoch": 0.7594718218693364,
"grad_norm": 3.5504395961761475,
"learning_rate": 3.2132642116553453e-06,
"loss": 0.432,
"step": 2200
},
{
"epoch": 0.7767325450936394,
"grad_norm": 3.7240469455718994,
"learning_rate": 3.1685734715766897e-06,
"loss": 0.4278,
"step": 2250
},
{
"epoch": 0.7939932683179425,
"grad_norm": 2.717268943786621,
"learning_rate": 3.123882731498034e-06,
"loss": 0.4145,
"step": 2300
},
{
"epoch": 0.8112539915422456,
"grad_norm": 2.7192165851593018,
"learning_rate": 3.079191991419378e-06,
"loss": 0.4454,
"step": 2350
},
{
"epoch": 0.8285147147665487,
"grad_norm": 4.111413955688477,
"learning_rate": 3.0345012513407223e-06,
"loss": 0.4188,
"step": 2400
},
{
"epoch": 0.8457754379908519,
"grad_norm": 3.396127223968506,
"learning_rate": 2.9898105112620668e-06,
"loss": 0.4349,
"step": 2450
},
{
"epoch": 0.8630361612151549,
"grad_norm": 2.503493309020996,
"learning_rate": 2.9451197711834112e-06,
"loss": 0.4133,
"step": 2500
},
{
"epoch": 0.8630361612151549,
"eval_gen_len": 54.88080279232112,
"eval_loss": 0.5358440279960632,
"eval_rouge1": 50.67,
"eval_rouge2": 36.36,
"eval_rougeL": 44.02,
"eval_rougeLsum": 44.56,
"eval_runtime": 5344.428,
"eval_samples_per_second": 1.072,
"eval_steps_per_second": 0.268,
"step": 2500
},
{
"epoch": 0.880296884439458,
"grad_norm": 2.877305746078491,
"learning_rate": 2.9004290311047557e-06,
"loss": 0.4369,
"step": 2550
},
{
"epoch": 0.8975576076637611,
"grad_norm": 2.5334177017211914,
"learning_rate": 2.8557382910260993e-06,
"loss": 0.4371,
"step": 2600
},
{
"epoch": 0.9148183308880642,
"grad_norm": 2.780935049057007,
"learning_rate": 2.811047550947444e-06,
"loss": 0.3965,
"step": 2650
},
{
"epoch": 0.9320790541123674,
"grad_norm": 3.019552707672119,
"learning_rate": 2.7663568108687883e-06,
"loss": 0.4191,
"step": 2700
},
{
"epoch": 0.9493397773366704,
"grad_norm": 3.7161452770233154,
"learning_rate": 2.7216660707901327e-06,
"loss": 0.4164,
"step": 2750
},
{
"epoch": 0.9666005005609735,
"grad_norm": 2.9958629608154297,
"learning_rate": 2.6769753307114764e-06,
"loss": 0.4069,
"step": 2800
},
{
"epoch": 0.9838612237852766,
"grad_norm": 2.9618115425109863,
"learning_rate": 2.632284590632821e-06,
"loss": 0.4302,
"step": 2850
},
{
"epoch": 1.0010356433934582,
"grad_norm": 2.9072768688201904,
"learning_rate": 2.5875938505541653e-06,
"loss": 0.426,
"step": 2900
},
{
"epoch": 1.0182963666177614,
"grad_norm": 3.2817041873931885,
"learning_rate": 2.5429031104755098e-06,
"loss": 0.3912,
"step": 2950
},
{
"epoch": 1.0355570898420643,
"grad_norm": 2.7742252349853516,
"learning_rate": 2.498212370396854e-06,
"loss": 0.3576,
"step": 3000
},
{
"epoch": 1.0355570898420643,
"eval_gen_len": 53.4542757417103,
"eval_loss": 0.5370803475379944,
"eval_rouge1": 51.14,
"eval_rouge2": 36.78,
"eval_rougeL": 44.59,
"eval_rougeLsum": 45.09,
"eval_runtime": 5216.1975,
"eval_samples_per_second": 1.099,
"eval_steps_per_second": 0.275,
"step": 3000
},
{
"epoch": 1.0528178130663675,
"grad_norm": 2.5936224460601807,
"learning_rate": 2.4535216303181983e-06,
"loss": 0.3795,
"step": 3050
},
{
"epoch": 1.0700785362906706,
"grad_norm": 2.727391481399536,
"learning_rate": 2.4088308902395428e-06,
"loss": 0.3797,
"step": 3100
},
{
"epoch": 1.0873392595149736,
"grad_norm": 2.1693854331970215,
"learning_rate": 2.364140150160887e-06,
"loss": 0.3809,
"step": 3150
},
{
"epoch": 1.1045999827392767,
"grad_norm": 3.9267098903656006,
"learning_rate": 2.3194494100822313e-06,
"loss": 0.3816,
"step": 3200
},
{
"epoch": 1.12186070596358,
"grad_norm": 3.905186176300049,
"learning_rate": 2.2747586700035753e-06,
"loss": 0.3852,
"step": 3250
},
{
"epoch": 1.139121429187883,
"grad_norm": 3.1914596557617188,
"learning_rate": 2.23006792992492e-06,
"loss": 0.3837,
"step": 3300
},
{
"epoch": 1.156382152412186,
"grad_norm": 3.2150516510009766,
"learning_rate": 2.185377189846264e-06,
"loss": 0.3916,
"step": 3350
},
{
"epoch": 1.1736428756364892,
"grad_norm": 3.4676005840301514,
"learning_rate": 2.1406864497676083e-06,
"loss": 0.3889,
"step": 3400
},
{
"epoch": 1.1909035988607923,
"grad_norm": 3.015994071960449,
"learning_rate": 2.095995709688953e-06,
"loss": 0.3901,
"step": 3450
},
{
"epoch": 1.2081643220850953,
"grad_norm": 3.504163980484009,
"learning_rate": 2.051304969610297e-06,
"loss": 0.3878,
"step": 3500
},
{
"epoch": 1.2081643220850953,
"eval_gen_len": 54.42425828970332,
"eval_loss": 0.5358798503875732,
"eval_rouge1": 50.77,
"eval_rouge2": 36.52,
"eval_rougeL": 44.17,
"eval_rougeLsum": 44.73,
"eval_runtime": 5360.6563,
"eval_samples_per_second": 1.069,
"eval_steps_per_second": 0.267,
"step": 3500
},
{
"epoch": 1.2254250453093984,
"grad_norm": 2.9530227184295654,
"learning_rate": 2.0066142295316413e-06,
"loss": 0.4127,
"step": 3550
},
{
"epoch": 1.2426857685337016,
"grad_norm": 2.9822258949279785,
"learning_rate": 1.9619234894529854e-06,
"loss": 0.3785,
"step": 3600
},
{
"epoch": 1.2599464917580048,
"grad_norm": 3.8967037200927734,
"learning_rate": 1.91723274937433e-06,
"loss": 0.4015,
"step": 3650
},
{
"epoch": 1.2772072149823077,
"grad_norm": 2.652034044265747,
"learning_rate": 1.872542009295674e-06,
"loss": 0.3962,
"step": 3700
},
{
"epoch": 1.2944679382066109,
"grad_norm": 2.3683066368103027,
"learning_rate": 1.8278512692170184e-06,
"loss": 0.3942,
"step": 3750
},
{
"epoch": 1.311728661430914,
"grad_norm": 2.787900447845459,
"learning_rate": 1.7831605291383628e-06,
"loss": 0.3902,
"step": 3800
},
{
"epoch": 1.328989384655217,
"grad_norm": 2.8084681034088135,
"learning_rate": 1.7384697890597069e-06,
"loss": 0.3971,
"step": 3850
},
{
"epoch": 1.3462501078795202,
"grad_norm": 3.2413413524627686,
"learning_rate": 1.6937790489810514e-06,
"loss": 0.396,
"step": 3900
},
{
"epoch": 1.3635108311038233,
"grad_norm": 2.3999781608581543,
"learning_rate": 1.6490883089023956e-06,
"loss": 0.3836,
"step": 3950
},
{
"epoch": 1.3807715543281263,
"grad_norm": 3.1420865058898926,
"learning_rate": 1.6043975688237399e-06,
"loss": 0.3757,
"step": 4000
},
{
"epoch": 1.3807715543281263,
"eval_gen_len": 54.231239092495635,
"eval_loss": 0.5294080376625061,
"eval_rouge1": 50.76,
"eval_rouge2": 36.73,
"eval_rougeL": 44.34,
"eval_rougeLsum": 44.9,
"eval_runtime": 5340.6521,
"eval_samples_per_second": 1.073,
"eval_steps_per_second": 0.268,
"step": 4000
}
],
"logging_steps": 50,
"max_steps": 5794,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 2,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 2
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.373273785100206e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}