ARBERT-base-submeter-classifier / trainer_state.json
NourFakih's picture
Complete ARBERT sub-meter training
e43edf4 verified
Raw
History Blame Contribute Delete
18.9 kB
{
"best_global_step": 17000,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 17346,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.08648274669203494,
"grad_norm": 25.747224807739258,
"learning_rate": 4.856162804104693e-05,
"loss": 1.2986,
"step": 500
},
{
"epoch": 0.08648274669203494,
"eval_accuracy": 0.765245945945946,
"eval_loss": 0.756655216217041,
"eval_macro_f1": 0.2987486877044399,
"eval_runtime": 418.3804,
"eval_samples_per_second": 884.363,
"eval_steps_per_second": 3.456,
"eval_weighted_f1": 0.7565798837380349,
"step": 500
},
{
"epoch": 0.17296549338406988,
"grad_norm": 7.156609535217285,
"learning_rate": 4.7120373573158074e-05,
"loss": 0.5963,
"step": 1000
},
{
"epoch": 0.17296549338406988,
"eval_accuracy": 0.8766405405405405,
"eval_loss": 0.40730020403862,
"eval_macro_f1": 0.4197539556932673,
"eval_runtime": 418.1054,
"eval_samples_per_second": 884.944,
"eval_steps_per_second": 3.458,
"eval_weighted_f1": 0.8676584583901654,
"step": 1000
},
{
"epoch": 0.25944824007610484,
"grad_norm": 6.3231658935546875,
"learning_rate": 4.567911910526923e-05,
"loss": 0.3789,
"step": 1500
},
{
"epoch": 0.25944824007610484,
"eval_accuracy": 0.9137351351351352,
"eval_loss": 0.2946445643901825,
"eval_macro_f1": 0.47816321808462303,
"eval_runtime": 418.8729,
"eval_samples_per_second": 883.323,
"eval_steps_per_second": 3.452,
"eval_weighted_f1": 0.9066607985127312,
"step": 1500
},
{
"epoch": 0.34593098676813977,
"grad_norm": 9.21304988861084,
"learning_rate": 4.423786463738038e-05,
"loss": 0.2838,
"step": 2000
},
{
"epoch": 0.34593098676813977,
"eval_accuracy": 0.9314702702702703,
"eval_loss": 0.23459294438362122,
"eval_macro_f1": 0.5072222949676094,
"eval_runtime": 418.1997,
"eval_samples_per_second": 884.745,
"eval_steps_per_second": 3.458,
"eval_weighted_f1": 0.9263247220377161,
"step": 2000
},
{
"epoch": 0.4324137334601747,
"grad_norm": 6.399903297424316,
"learning_rate": 4.279661016949153e-05,
"loss": 0.2401,
"step": 2500
},
{
"epoch": 0.4324137334601747,
"eval_accuracy": 0.9421918918918919,
"eval_loss": 0.20360097289085388,
"eval_macro_f1": 0.5251223211604551,
"eval_runtime": 418.9782,
"eval_samples_per_second": 883.101,
"eval_steps_per_second": 3.451,
"eval_weighted_f1": 0.9356836777939385,
"step": 2500
},
{
"epoch": 0.5188964801522097,
"grad_norm": 7.528863906860352,
"learning_rate": 4.135535570160268e-05,
"loss": 0.2168,
"step": 3000
},
{
"epoch": 0.5188964801522097,
"eval_accuracy": 0.947972972972973,
"eval_loss": 0.1820368617773056,
"eval_macro_f1": 0.5299222018041627,
"eval_runtime": 418.5666,
"eval_samples_per_second": 883.969,
"eval_steps_per_second": 3.455,
"eval_weighted_f1": 0.9417715175152749,
"step": 3000
},
{
"epoch": 0.6053792268442446,
"grad_norm": 3.640698194503784,
"learning_rate": 3.9914101233713826e-05,
"loss": 0.1955,
"step": 3500
},
{
"epoch": 0.6053792268442446,
"eval_accuracy": 0.9518621621621621,
"eval_loss": 0.17032282054424286,
"eval_macro_f1": 0.5375603114820035,
"eval_runtime": 418.6948,
"eval_samples_per_second": 883.699,
"eval_steps_per_second": 3.454,
"eval_weighted_f1": 0.9454971013709563,
"step": 3500
},
{
"epoch": 0.6918619735362795,
"grad_norm": 5.204596996307373,
"learning_rate": 3.847284676582498e-05,
"loss": 0.1782,
"step": 4000
},
{
"epoch": 0.6918619735362795,
"eval_accuracy": 0.9557081081081081,
"eval_loss": 0.15780550241470337,
"eval_macro_f1": 0.5498663380782979,
"eval_runtime": 418.4036,
"eval_samples_per_second": 884.314,
"eval_steps_per_second": 3.456,
"eval_weighted_f1": 0.9495774047836557,
"step": 4000
},
{
"epoch": 0.7783447202283145,
"grad_norm": 2.9452965259552,
"learning_rate": 3.7031592297936126e-05,
"loss": 0.1699,
"step": 4500
},
{
"epoch": 0.7783447202283145,
"eval_accuracy": 0.9571459459459459,
"eval_loss": 0.15344275534152985,
"eval_macro_f1": 0.5465995200000592,
"eval_runtime": 418.0876,
"eval_samples_per_second": 884.982,
"eval_steps_per_second": 3.459,
"eval_weighted_f1": 0.9507761247869798,
"step": 4500
},
{
"epoch": 0.8648274669203494,
"grad_norm": 5.704383850097656,
"learning_rate": 3.559033783004728e-05,
"loss": 0.1622,
"step": 5000
},
{
"epoch": 0.8648274669203494,
"eval_accuracy": 0.9585405405405405,
"eval_loss": 0.1496480107307434,
"eval_macro_f1": 0.5578920159472586,
"eval_runtime": 418.0713,
"eval_samples_per_second": 885.017,
"eval_steps_per_second": 3.459,
"eval_weighted_f1": 0.9523043519198916,
"step": 5000
},
{
"epoch": 0.9513102136123843,
"grad_norm": 3.2097666263580322,
"learning_rate": 3.4149083362158425e-05,
"loss": 0.1569,
"step": 5500
},
{
"epoch": 0.9513102136123843,
"eval_accuracy": 0.9602459459459459,
"eval_loss": 0.14497891068458557,
"eval_macro_f1": 0.5471822620722766,
"eval_runtime": 418.9758,
"eval_samples_per_second": 883.106,
"eval_steps_per_second": 3.451,
"eval_weighted_f1": 0.9536733224654437,
"step": 5500
},
{
"epoch": 1.0377064775577272,
"grad_norm": 4.706158638000488,
"learning_rate": 3.270782889426958e-05,
"loss": 0.1422,
"step": 6000
},
{
"epoch": 1.0377064775577272,
"eval_accuracy": 0.9593081081081081,
"eval_loss": 0.1468845158815384,
"eval_macro_f1": 0.5689795604124087,
"eval_runtime": 420.1108,
"eval_samples_per_second": 880.72,
"eval_steps_per_second": 3.442,
"eval_weighted_f1": 0.9533441467822756,
"step": 6000
},
{
"epoch": 1.1241892242497622,
"grad_norm": 3.167544364929199,
"learning_rate": 3.1266574426380724e-05,
"loss": 0.1251,
"step": 6500
},
{
"epoch": 1.1241892242497622,
"eval_accuracy": 0.9628189189189189,
"eval_loss": 0.13693760335445404,
"eval_macro_f1": 0.5800974551510764,
"eval_runtime": 420.0357,
"eval_samples_per_second": 880.877,
"eval_steps_per_second": 3.443,
"eval_weighted_f1": 0.9568010100001315,
"step": 6500
},
{
"epoch": 1.210671970941797,
"grad_norm": 2.2167930603027344,
"learning_rate": 2.982531995849187e-05,
"loss": 0.123,
"step": 7000
},
{
"epoch": 1.210671970941797,
"eval_accuracy": 0.9632054054054054,
"eval_loss": 0.1349489837884903,
"eval_macro_f1": 0.5686206184279916,
"eval_runtime": 419.1921,
"eval_samples_per_second": 882.65,
"eval_steps_per_second": 3.449,
"eval_weighted_f1": 0.9570982563798056,
"step": 7000
},
{
"epoch": 1.297154717633832,
"grad_norm": 3.8189609050750732,
"learning_rate": 2.8384065490603024e-05,
"loss": 0.1208,
"step": 7500
},
{
"epoch": 1.297154717633832,
"eval_accuracy": 0.963927027027027,
"eval_loss": 0.13370193541049957,
"eval_macro_f1": 0.5746596478621987,
"eval_runtime": 418.7013,
"eval_samples_per_second": 883.685,
"eval_steps_per_second": 3.454,
"eval_weighted_f1": 0.9576970198616988,
"step": 7500
},
{
"epoch": 1.3836374643258669,
"grad_norm": 4.8342461585998535,
"learning_rate": 2.694281102271417e-05,
"loss": 0.1188,
"step": 8000
},
{
"epoch": 1.3836374643258669,
"eval_accuracy": 0.964472972972973,
"eval_loss": 0.13066376745700836,
"eval_macro_f1": 0.5725448949887878,
"eval_runtime": 418.7971,
"eval_samples_per_second": 883.483,
"eval_steps_per_second": 3.453,
"eval_weighted_f1": 0.9581300625445718,
"step": 8000
},
{
"epoch": 1.470120211017902,
"grad_norm": 3.3662569522857666,
"learning_rate": 2.5501556554825323e-05,
"loss": 0.1201,
"step": 8500
},
{
"epoch": 1.470120211017902,
"eval_accuracy": 0.9651378378378378,
"eval_loss": 0.12952136993408203,
"eval_macro_f1": 0.5705480082509794,
"eval_runtime": 418.5068,
"eval_samples_per_second": 884.095,
"eval_steps_per_second": 3.455,
"eval_weighted_f1": 0.9587555599089429,
"step": 8500
},
{
"epoch": 1.556602957709937,
"grad_norm": 3.425612211227417,
"learning_rate": 2.406030208693647e-05,
"loss": 0.118,
"step": 9000
},
{
"epoch": 1.556602957709937,
"eval_accuracy": 0.965654054054054,
"eval_loss": 0.1270706057548523,
"eval_macro_f1": 0.5691587584053437,
"eval_runtime": 419.0634,
"eval_samples_per_second": 882.921,
"eval_steps_per_second": 3.451,
"eval_weighted_f1": 0.9593746302255395,
"step": 9000
},
{
"epoch": 1.6430857044019718,
"grad_norm": 1.4031856060028076,
"learning_rate": 2.261904761904762e-05,
"loss": 0.1167,
"step": 9500
},
{
"epoch": 1.6430857044019718,
"eval_accuracy": 0.9661621621621621,
"eval_loss": 0.125877246260643,
"eval_macro_f1": 0.5795209016258601,
"eval_runtime": 418.9995,
"eval_samples_per_second": 883.056,
"eval_steps_per_second": 3.451,
"eval_weighted_f1": 0.9600300931445321,
"step": 9500
},
{
"epoch": 1.7295684510940066,
"grad_norm": 2.918519973754883,
"learning_rate": 2.117779315115877e-05,
"loss": 0.1133,
"step": 10000
},
{
"epoch": 1.7295684510940066,
"eval_accuracy": 0.9670945945945946,
"eval_loss": 0.12201372534036636,
"eval_macro_f1": 0.5803247802424795,
"eval_runtime": 418.9179,
"eval_samples_per_second": 883.228,
"eval_steps_per_second": 3.452,
"eval_weighted_f1": 0.9608891715468071,
"step": 10000
},
{
"epoch": 1.8160511977860416,
"grad_norm": 2.741220712661743,
"learning_rate": 1.973653868326992e-05,
"loss": 0.1116,
"step": 10500
},
{
"epoch": 1.8160511977860416,
"eval_accuracy": 0.9673864864864865,
"eval_loss": 0.12097315490245819,
"eval_macro_f1": 0.5834823701825592,
"eval_runtime": 418.7157,
"eval_samples_per_second": 883.654,
"eval_steps_per_second": 3.453,
"eval_weighted_f1": 0.9612394940368674,
"step": 10500
},
{
"epoch": 1.9025339444780767,
"grad_norm": 2.6713507175445557,
"learning_rate": 1.8295284215381068e-05,
"loss": 0.1103,
"step": 11000
},
{
"epoch": 1.9025339444780767,
"eval_accuracy": 0.9684972972972973,
"eval_loss": 0.11646272242069244,
"eval_macro_f1": 0.5835802563966344,
"eval_runtime": 418.3811,
"eval_samples_per_second": 884.361,
"eval_steps_per_second": 3.456,
"eval_weighted_f1": 0.9622871010076606,
"step": 11000
},
{
"epoch": 1.9890166911701117,
"grad_norm": 2.58137845993042,
"learning_rate": 1.6854029747492218e-05,
"loss": 0.1093,
"step": 11500
},
{
"epoch": 1.9890166911701117,
"eval_accuracy": 0.9683432432432433,
"eval_loss": 0.11723459511995316,
"eval_macro_f1": 0.5835321485745915,
"eval_runtime": 419.3158,
"eval_samples_per_second": 882.39,
"eval_steps_per_second": 3.448,
"eval_weighted_f1": 0.9623140045622489,
"step": 11500
},
{
"epoch": 2.0754129551154543,
"grad_norm": 3.1163055896759033,
"learning_rate": 1.5412775279603368e-05,
"loss": 0.0899,
"step": 12000
},
{
"epoch": 2.0754129551154543,
"eval_accuracy": 0.9689324324324324,
"eval_loss": 0.11741844564676285,
"eval_macro_f1": 0.5972224837605217,
"eval_runtime": 419.245,
"eval_samples_per_second": 882.539,
"eval_steps_per_second": 3.449,
"eval_weighted_f1": 0.9632448268921581,
"step": 12000
},
{
"epoch": 2.1618957018074894,
"grad_norm": 2.067152738571167,
"learning_rate": 1.3971520811714517e-05,
"loss": 0.0851,
"step": 12500
},
{
"epoch": 2.1618957018074894,
"eval_accuracy": 0.9692378378378378,
"eval_loss": 0.11705382913351059,
"eval_macro_f1": 0.5857631212432319,
"eval_runtime": 419.6262,
"eval_samples_per_second": 881.737,
"eval_steps_per_second": 3.446,
"eval_weighted_f1": 0.9632093509253533,
"step": 12500
},
{
"epoch": 2.2483784484995244,
"grad_norm": 1.862592339515686,
"learning_rate": 1.2530266343825667e-05,
"loss": 0.0862,
"step": 13000
},
{
"epoch": 2.2483784484995244,
"eval_accuracy": 0.9688189189189189,
"eval_loss": 0.11716984957456589,
"eval_macro_f1": 0.590216690584949,
"eval_runtime": 418.913,
"eval_samples_per_second": 883.238,
"eval_steps_per_second": 3.452,
"eval_weighted_f1": 0.9634743085321129,
"step": 13000
},
{
"epoch": 2.3348611951915594,
"grad_norm": 2.883910655975342,
"learning_rate": 1.1089011875936815e-05,
"loss": 0.0835,
"step": 13500
},
{
"epoch": 2.3348611951915594,
"eval_accuracy": 0.9696405405405405,
"eval_loss": 0.11618903279304504,
"eval_macro_f1": 0.5970308633746413,
"eval_runtime": 418.887,
"eval_samples_per_second": 883.293,
"eval_steps_per_second": 3.452,
"eval_weighted_f1": 0.9638159327084403,
"step": 13500
},
{
"epoch": 2.421343941883594,
"grad_norm": 0.7860650420188904,
"learning_rate": 9.647757408047965e-06,
"loss": 0.0854,
"step": 14000
},
{
"epoch": 2.421343941883594,
"eval_accuracy": 0.9694459459459459,
"eval_loss": 0.1158711388707161,
"eval_macro_f1": 0.592536606494846,
"eval_runtime": 419.3296,
"eval_samples_per_second": 882.361,
"eval_steps_per_second": 3.448,
"eval_weighted_f1": 0.9638996969783739,
"step": 14000
},
{
"epoch": 2.507826688575629,
"grad_norm": 3.2249786853790283,
"learning_rate": 8.206502940159114e-06,
"loss": 0.0797,
"step": 14500
},
{
"epoch": 2.507826688575629,
"eval_accuracy": 0.9697621621621622,
"eval_loss": 0.11566793918609619,
"eval_macro_f1": 0.5934226559634111,
"eval_runtime": 420.7367,
"eval_samples_per_second": 879.41,
"eval_steps_per_second": 3.437,
"eval_weighted_f1": 0.964013311849684,
"step": 14500
},
{
"epoch": 2.594309435267664,
"grad_norm": 4.085644245147705,
"learning_rate": 6.765248472270265e-06,
"loss": 0.0819,
"step": 15000
},
{
"epoch": 2.594309435267664,
"eval_accuracy": 0.9698027027027027,
"eval_loss": 0.1152041032910347,
"eval_macro_f1": 0.6003991642644262,
"eval_runtime": 419.1122,
"eval_samples_per_second": 882.818,
"eval_steps_per_second": 3.45,
"eval_weighted_f1": 0.9643335590541979,
"step": 15000
},
{
"epoch": 2.680792181959699,
"grad_norm": 2.286464214324951,
"learning_rate": 5.323994004381414e-06,
"loss": 0.0813,
"step": 15500
},
{
"epoch": 2.680792181959699,
"eval_accuracy": 0.9702864864864865,
"eval_loss": 0.1135055348277092,
"eval_macro_f1": 0.5963674935323597,
"eval_runtime": 419.7981,
"eval_samples_per_second": 881.376,
"eval_steps_per_second": 3.445,
"eval_weighted_f1": 0.9645615895626319,
"step": 15500
},
{
"epoch": 2.7672749286517337,
"grad_norm": 2.7449326515197754,
"learning_rate": 3.882739536492564e-06,
"loss": 0.0792,
"step": 16000
},
{
"epoch": 2.7672749286517337,
"eval_accuracy": 0.9706054054054054,
"eval_loss": 0.1119714081287384,
"eval_macro_f1": 0.6000477857320852,
"eval_runtime": 419.5757,
"eval_samples_per_second": 881.843,
"eval_steps_per_second": 3.446,
"eval_weighted_f1": 0.9649497278700637,
"step": 16000
},
{
"epoch": 2.853757675343769,
"grad_norm": 1.0509530305862427,
"learning_rate": 2.441485068603713e-06,
"loss": 0.0786,
"step": 16500
},
{
"epoch": 2.853757675343769,
"eval_accuracy": 0.9707135135135135,
"eval_loss": 0.11158089339733124,
"eval_macro_f1": 0.6009545374695694,
"eval_runtime": 418.9418,
"eval_samples_per_second": 883.178,
"eval_steps_per_second": 3.452,
"eval_weighted_f1": 0.9653056586898462,
"step": 16500
},
{
"epoch": 2.940240422035804,
"grad_norm": 0.9345380663871765,
"learning_rate": 1.0002306007148624e-06,
"loss": 0.0789,
"step": 17000
},
{
"epoch": 2.940240422035804,
"eval_accuracy": 0.9708837837837838,
"eval_loss": 0.11126039922237396,
"eval_macro_f1": 0.6020869942813024,
"eval_runtime": 419.4331,
"eval_samples_per_second": 882.143,
"eval_steps_per_second": 3.448,
"eval_weighted_f1": 0.9654166847298334,
"step": 17000
},
{
"epoch": 3.0,
"step": 17346,
"total_flos": 7.302829698913882e+16,
"train_loss": 0.0,
"train_runtime": 0.0011,
"train_samples_per_second": 3968183378.26,
"train_steps_per_second": 15502748.175
}
],
"logging_steps": 500,
"max_steps": 17346,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.302829698913882e+16,
"train_batch_size": 128,
"trial_name": null,
"trial_params": null
}