Mardiyyah's picture
push model to hub
e518da8 verified
Raw
History Blame Contribute Delete
8.63 kB
{
"best_metric": 0.7626358851133038,
"best_model_checkpoint": "/nfs/production/literature/amina-mardiyyah/new_data/Ner_Pipeline/src/ner_pipeline/model_outputs/NER/CeLLaTe_3_Class_1.0/BiomedNLP_BiomedBERT_base_uncased_abstract_fulltext/BaseStrategy/StandardNerHead/BaseTrainer/no_data_aug/checkpoint-2367",
"epoch": 14.0,
"eval_steps": 100,
"global_step": 3682,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.0,
"grad_norm": 1.4862927198410034,
"learning_rate": 1.9204916458613406e-05,
"loss": 0.3707,
"step": 263
},
{
"epoch": 1.0,
"eval_accuracy": 0.9770208301605835,
"eval_loss": 0.079874187707901,
"eval_macro_f1": 0.5769987323644276,
"eval_micro_f1": 0.6010223298358892,
"eval_precision": 0.6219376391982183,
"eval_recall": 0.5814679854242581,
"eval_weighted_f1": 0.592280710950957,
"step": 263
},
{
"epoch": 2.0,
"grad_norm": 1.9079930782318115,
"learning_rate": 1.819473785289034e-05,
"loss": 0.0585,
"step": 526
},
{
"epoch": 2.0,
"eval_accuracy": 0.9815049833324873,
"eval_loss": 0.06179345026612282,
"eval_macro_f1": 0.7277089050124769,
"eval_micro_f1": 0.7309004988185875,
"eval_precision": 0.7372881355932204,
"eval_recall": 0.7246225923997918,
"eval_weighted_f1": 0.7313446348142951,
"step": 526
},
{
"epoch": 3.0,
"grad_norm": 1.0678396224975586,
"learning_rate": 1.7184559247167276e-05,
"loss": 0.0354,
"step": 789
},
{
"epoch": 3.0,
"eval_accuracy": 0.9818434099869706,
"eval_loss": 0.06418469548225403,
"eval_macro_f1": 0.7432720323562445,
"eval_micro_f1": 0.7453069507864029,
"eval_precision": 0.7268678871845621,
"eval_recall": 0.7647058823529411,
"eval_weighted_f1": 0.7451202973389662,
"step": 789
},
{
"epoch": 4.0,
"grad_norm": 0.2629636824131012,
"learning_rate": 1.617438064144421e-05,
"loss": 0.0257,
"step": 1052
},
{
"epoch": 4.0,
"eval_accuracy": 0.9822664433050747,
"eval_loss": 0.08105488121509552,
"eval_macro_f1": 0.7405963948143229,
"eval_micro_f1": 0.74696802646086,
"eval_precision": 0.7937902753368483,
"eval_recall": 0.7053617907339927,
"eval_weighted_f1": 0.7457498165560936,
"step": 1052
},
{
"epoch": 5.0,
"grad_norm": 0.4527699947357178,
"learning_rate": 1.5164202035721145e-05,
"loss": 0.0192,
"step": 1315
},
{
"epoch": 5.0,
"eval_accuracy": 0.9820633873123847,
"eval_loss": 0.07257022708654404,
"eval_macro_f1": 0.7412864283559636,
"eval_micro_f1": 0.7438540840602695,
"eval_precision": 0.7556390977443609,
"eval_recall": 0.7324310255075481,
"eval_weighted_f1": 0.7433335893250815,
"step": 1315
},
{
"epoch": 6.0,
"grad_norm": 0.020912302657961845,
"learning_rate": 1.415402342999808e-05,
"loss": 0.0145,
"step": 1578
},
{
"epoch": 6.0,
"eval_accuracy": 0.980760444692624,
"eval_loss": 0.08405586332082748,
"eval_macro_f1": 0.728176283051415,
"eval_micro_f1": 0.729506141890198,
"eval_precision": 0.7035783365570599,
"eval_recall": 0.7574180114523685,
"eval_weighted_f1": 0.731476982530679,
"step": 1578
},
{
"epoch": 7.0,
"grad_norm": 1.8371907472610474,
"learning_rate": 1.3143844824275017e-05,
"loss": 0.0108,
"step": 1841
},
{
"epoch": 7.0,
"eval_accuracy": 0.9824356566323164,
"eval_loss": 0.08958898484706879,
"eval_macro_f1": 0.7491220181673697,
"eval_micro_f1": 0.7561761546723953,
"eval_precision": 0.7809206877426511,
"eval_recall": 0.7329515877147319,
"eval_weighted_f1": 0.7535894817666166,
"step": 1841
},
{
"epoch": 8.0,
"grad_norm": 0.036153607070446014,
"learning_rate": 1.213366621855195e-05,
"loss": 0.0086,
"step": 2104
},
{
"epoch": 8.0,
"eval_accuracy": 0.982300285970523,
"eval_loss": 0.09140016883611679,
"eval_macro_f1": 0.7499882167101145,
"eval_micro_f1": 0.7507739938080494,
"eval_precision": 0.7442455242966752,
"eval_recall": 0.7574180114523685,
"eval_weighted_f1": 0.7510494149917656,
"step": 2104
},
{
"epoch": 9.0,
"grad_norm": 0.6101483106613159,
"learning_rate": 1.1123487612828885e-05,
"loss": 0.0071,
"step": 2367
},
{
"epoch": 9.0,
"eval_accuracy": 0.9829432966140413,
"eval_loss": 0.09278572350740433,
"eval_macro_f1": 0.7626358851133038,
"eval_micro_f1": 0.7671018276762401,
"eval_precision": 0.7695128339444736,
"eval_recall": 0.7647058823529411,
"eval_weighted_f1": 0.7667324717128587,
"step": 2367
},
{
"epoch": 10.0,
"grad_norm": 0.0035175979137420654,
"learning_rate": 1.011330900710582e-05,
"loss": 0.0061,
"step": 2630
},
{
"epoch": 10.0,
"eval_accuracy": 0.9821818366414539,
"eval_loss": 0.10011798143386841,
"eval_macro_f1": 0.7462770455304736,
"eval_micro_f1": 0.7468487394957983,
"eval_precision": 0.753577106518283,
"eval_recall": 0.7402394586153045,
"eval_weighted_f1": 0.7468672605156849,
"step": 2630
},
{
"epoch": 11.0,
"grad_norm": 0.0037437197752296925,
"learning_rate": 9.103130401382755e-06,
"loss": 0.0053,
"step": 2893
},
{
"epoch": 11.0,
"eval_accuracy": 0.9827910046195238,
"eval_loss": 0.09489310532808304,
"eval_macro_f1": 0.7580331495732254,
"eval_micro_f1": 0.7618042732788183,
"eval_precision": 0.772192513368984,
"eval_recall": 0.7516918271733473,
"eval_weighted_f1": 0.7611300880366612,
"step": 2893
},
{
"epoch": 12.0,
"grad_norm": 0.33181801438331604,
"learning_rate": 8.092951795659689e-06,
"loss": 0.0042,
"step": 3156
},
{
"epoch": 12.0,
"eval_accuracy": 0.9823172073032472,
"eval_loss": 0.10447186231613159,
"eval_macro_f1": 0.74837113461728,
"eval_micro_f1": 0.7483600104959328,
"eval_precision": 0.7544973544973544,
"eval_recall": 0.7423217074440396,
"eval_weighted_f1": 0.7490474113274579,
"step": 3156
},
{
"epoch": 13.0,
"grad_norm": 0.046197082847356796,
"learning_rate": 7.082773189936625e-06,
"loss": 0.0034,
"step": 3419
},
{
"epoch": 13.0,
"eval_accuracy": 0.9826894766231788,
"eval_loss": 0.11298680305480957,
"eval_macro_f1": 0.7570912941995157,
"eval_micro_f1": 0.7603565810173047,
"eval_precision": 0.7659799260433174,
"eval_recall": 0.7548152004164498,
"eval_weighted_f1": 0.7597214121014263,
"step": 3419
},
{
"epoch": 14.0,
"grad_norm": 0.02146022580564022,
"learning_rate": 6.072594584213559e-06,
"loss": 0.0032,
"step": 3682
},
{
"epoch": 14.0,
"eval_accuracy": 0.9819110953178672,
"eval_loss": 0.11282865703105927,
"eval_macro_f1": 0.7464972293717181,
"eval_micro_f1": 0.7470324452651016,
"eval_precision": 0.7572192513368984,
"eval_recall": 0.737116085372202,
"eval_weighted_f1": 0.7472486799694477,
"step": 3682
},
{
"epoch": 14.0,
"step": 3682,
"total_flos": 2981574659125788.0,
"train_loss": 0.040905012183057296,
"train_runtime": 941.9422,
"train_samples_per_second": 178.546,
"train_steps_per_second": 5.584
}
],
"logging_steps": 10,
"max_steps": 5260,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 100,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 5
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2981574659125788.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}