roberta-base-bne_ft_70 / trainer_state.json
SeTo97's picture
Best F1=0.7795 (trial 10)
e932916 verified
Raw
History Blame Contribute Delete
8.83 kB
{
"best_global_step": 1400,
"best_metric": 0.7795431976166831,
"best_model_checkpoint": "./hpo_PlanTL-GOB-ES_roberta-base-bne/trial_10/checkpoint-1400",
"epoch": 10.447761194029852,
"eval_steps": 100,
"global_step": 1400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.746268656716418,
"grad_norm": 1.1734787225723267,
"learning_rate": 2.299839426139915e-06,
"loss": 0.6959,
"step": 100
},
{
"epoch": 0.746268656716418,
"eval_accuracy": 0.6081081081081081,
"eval_f1": 0.442484773258667,
"eval_loss": 0.6894811391830444,
"eval_precision": 0.4994814622763806,
"eval_recall": 0.4998257839721254,
"eval_runtime": 0.3253,
"eval_samples_per_second": 682.392,
"eval_steps_per_second": 21.517,
"step": 100
},
{
"epoch": 1.4925373134328357,
"grad_norm": 2.857347011566162,
"learning_rate": 4.41754964344502e-06,
"loss": 0.6866,
"step": 200
},
{
"epoch": 1.4925373134328357,
"eval_accuracy": 0.6936936936936937,
"eval_f1": 0.6659290077011596,
"eval_loss": 0.6791544556617737,
"eval_precision": 0.6693403028118241,
"eval_recall": 0.6636759581881533,
"eval_runtime": 0.3219,
"eval_samples_per_second": 689.684,
"eval_steps_per_second": 21.747,
"step": 200
},
{
"epoch": 2.2388059701492535,
"grad_norm": 5.069456100463867,
"learning_rate": 4.176060181986678e-06,
"loss": 0.6555,
"step": 300
},
{
"epoch": 2.2388059701492535,
"eval_accuracy": 0.6981981981981982,
"eval_f1": 0.5875093596605563,
"eval_loss": 0.5988879799842834,
"eval_precision": 0.7426395939086294,
"eval_recall": 0.6040940766550522,
"eval_runtime": 0.3255,
"eval_samples_per_second": 681.953,
"eval_steps_per_second": 21.503,
"step": 300
},
{
"epoch": 2.9850746268656714,
"grad_norm": 5.771562099456787,
"learning_rate": 3.9321314330388585e-06,
"loss": 0.5745,
"step": 400
},
{
"epoch": 2.9850746268656714,
"eval_accuracy": 0.7252252252252253,
"eval_f1": 0.637943480469481,
"eval_loss": 0.5637385249137878,
"eval_precision": 0.772757980070934,
"eval_recall": 0.6406794425087108,
"eval_runtime": 0.3245,
"eval_samples_per_second": 684.169,
"eval_steps_per_second": 21.573,
"step": 400
},
{
"epoch": 3.7313432835820897,
"grad_norm": 6.657003879547119,
"learning_rate": 3.6882026840910388e-06,
"loss": 0.5315,
"step": 500
},
{
"epoch": 3.7313432835820897,
"eval_accuracy": 0.7612612612612613,
"eval_f1": 0.724597991714065,
"eval_loss": 0.5057556629180908,
"eval_precision": 0.7563169387542893,
"eval_recall": 0.7147212543554007,
"eval_runtime": 0.3235,
"eval_samples_per_second": 686.192,
"eval_steps_per_second": 21.637,
"step": 500
},
{
"epoch": 4.477611940298507,
"grad_norm": 6.151370048522949,
"learning_rate": 3.4442739351432187e-06,
"loss": 0.4973,
"step": 600
},
{
"epoch": 4.477611940298507,
"eval_accuracy": 0.7747747747747747,
"eval_f1": 0.7448745058380069,
"eval_loss": 0.4851745069026947,
"eval_precision": 0.7674050632911392,
"eval_recall": 0.7355400696864112,
"eval_runtime": 0.3262,
"eval_samples_per_second": 680.614,
"eval_steps_per_second": 21.461,
"step": 600
},
{
"epoch": 5.223880597014926,
"grad_norm": 10.251242637634277,
"learning_rate": 3.2003451861953985e-06,
"loss": 0.4523,
"step": 700
},
{
"epoch": 5.223880597014926,
"eval_accuracy": 0.7567567567567568,
"eval_f1": 0.7204551814196436,
"eval_loss": 0.48035961389541626,
"eval_precision": 0.7493827160493827,
"eval_recall": 0.7111498257839721,
"eval_runtime": 0.3234,
"eval_samples_per_second": 686.473,
"eval_steps_per_second": 21.646,
"step": 700
},
{
"epoch": 5.970149253731344,
"grad_norm": 5.884487628936768,
"learning_rate": 2.9564164372475784e-06,
"loss": 0.4519,
"step": 800
},
{
"epoch": 5.970149253731344,
"eval_accuracy": 0.7612612612612613,
"eval_f1": 0.7444118605408928,
"eval_loss": 0.4888066351413727,
"eval_precision": 0.7438242177342463,
"eval_recall": 0.7450348432055749,
"eval_runtime": 0.3288,
"eval_samples_per_second": 675.222,
"eval_steps_per_second": 21.291,
"step": 800
},
{
"epoch": 6.7164179104477615,
"grad_norm": 5.6701226234436035,
"learning_rate": 2.7124876882997587e-06,
"loss": 0.4267,
"step": 900
},
{
"epoch": 6.7164179104477615,
"eval_accuracy": 0.7522522522522522,
"eval_f1": 0.7183715834390497,
"eval_loss": 0.470042884349823,
"eval_precision": 0.7407906558849955,
"eval_recall": 0.7101045296167248,
"eval_runtime": 0.3283,
"eval_samples_per_second": 676.253,
"eval_steps_per_second": 21.323,
"step": 900
},
{
"epoch": 7.462686567164179,
"grad_norm": 14.518937110900879,
"learning_rate": 2.4685589393519386e-06,
"loss": 0.4149,
"step": 1000
},
{
"epoch": 7.462686567164179,
"eval_accuracy": 0.7837837837837838,
"eval_f1": 0.7628205128205128,
"eval_loss": 0.47342488169670105,
"eval_precision": 0.7702702702702703,
"eval_recall": 0.7578397212543554,
"eval_runtime": 0.3222,
"eval_samples_per_second": 688.983,
"eval_steps_per_second": 21.725,
"step": 1000
},
{
"epoch": 8.208955223880597,
"grad_norm": 6.513219356536865,
"learning_rate": 2.2246301904041184e-06,
"loss": 0.3897,
"step": 1100
},
{
"epoch": 8.208955223880597,
"eval_accuracy": 0.7702702702702703,
"eval_f1": 0.7501489572989076,
"eval_loss": 0.4738766849040985,
"eval_precision": 0.7540976265114196,
"eval_recall": 0.7471254355400697,
"eval_runtime": 0.3272,
"eval_samples_per_second": 678.418,
"eval_steps_per_second": 21.392,
"step": 1100
},
{
"epoch": 8.955223880597014,
"grad_norm": 19.53132438659668,
"learning_rate": 1.9807014414562983e-06,
"loss": 0.3806,
"step": 1200
},
{
"epoch": 8.955223880597014,
"eval_accuracy": 0.7837837837837838,
"eval_f1": 0.759913482335977,
"eval_loss": 0.46905937790870667,
"eval_precision": 0.7727443609022557,
"eval_recall": 0.7527874564459931,
"eval_runtime": 0.3253,
"eval_samples_per_second": 682.365,
"eval_steps_per_second": 21.516,
"step": 1200
},
{
"epoch": 9.701492537313433,
"grad_norm": 12.14911937713623,
"learning_rate": 1.7367726925084784e-06,
"loss": 0.3609,
"step": 1300
},
{
"epoch": 9.701492537313433,
"eval_accuracy": 0.7837837837837838,
"eval_f1": 0.7679442508710801,
"eval_loss": 0.48617300391197205,
"eval_precision": 0.7679442508710801,
"eval_recall": 0.7679442508710801,
"eval_runtime": 0.3248,
"eval_samples_per_second": 683.448,
"eval_steps_per_second": 21.55,
"step": 1300
},
{
"epoch": 10.447761194029852,
"grad_norm": 15.257988929748535,
"learning_rate": 1.4928439435606583e-06,
"loss": 0.3456,
"step": 1400
},
{
"epoch": 10.447761194029852,
"eval_accuracy": 0.7972972972972973,
"eval_f1": 0.7795431976166831,
"eval_loss": 0.4786612093448639,
"eval_precision": 0.783922973578146,
"eval_recall": 0.7761324041811846,
"eval_runtime": 0.3278,
"eval_samples_per_second": 677.161,
"eval_steps_per_second": 21.352,
"step": 1400
}
],
"logging_steps": 100,
"max_steps": 2010,
"num_input_tokens_seen": 0,
"num_train_epochs": 15,
"save_steps": 100,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 4,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.17373841796096e+16,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}