Mardiyyah's picture
push model to hub
80c0c2f verified
Raw
History Blame Contribute Delete
8.63 kB
{
"best_metric": 0.7634932999314054,
"best_model_checkpoint": "/nfs/production/literature/amina-mardiyyah/new_data/Ner_Pipeline/src/ner_pipeline/model_outputs/NER/CeLLaTe_3class_3.0/BiomedNLP_BiomedBERT_base_uncased_abstract_fulltext/BaseStrategy/StandardNerHead/BaseTrainer/no_data_aug/checkpoint-2367",
"epoch": 14.0,
"eval_steps": 100,
"global_step": 3682,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.0,
"grad_norm": 1.499980092048645,
"learning_rate": 1.9204916458613406e-05,
"loss": 0.3705,
"step": 263
},
{
"epoch": 1.0,
"eval_accuracy": 0.9767839315024451,
"eval_loss": 0.07922293245792389,
"eval_macro_f1": 0.5607172307233707,
"eval_micro_f1": 0.5859499733901011,
"eval_precision": 0.5993467610234078,
"eval_recall": 0.573138990109318,
"eval_weighted_f1": 0.5782964332062143,
"step": 263
},
{
"epoch": 2.0,
"grad_norm": 2.1381945610046387,
"learning_rate": 1.819473785289034e-05,
"loss": 0.0578,
"step": 526
},
{
"epoch": 2.0,
"eval_accuracy": 0.9811327140125556,
"eval_loss": 0.06325448304414749,
"eval_macro_f1": 0.7222045163630888,
"eval_micro_f1": 0.7245604688332445,
"eval_precision": 0.7419530823786143,
"eval_recall": 0.7079646017699115,
"eval_weighted_f1": 0.7252630809280266,
"step": 526
},
{
"epoch": 3.0,
"grad_norm": 0.9407679438591003,
"learning_rate": 1.7184559247167276e-05,
"loss": 0.0353,
"step": 789
},
{
"epoch": 3.0,
"eval_accuracy": 0.9814203766688664,
"eval_loss": 0.06546597182750702,
"eval_macro_f1": 0.741575956013186,
"eval_micro_f1": 0.7426545086119554,
"eval_precision": 0.7232363098174642,
"eval_recall": 0.7631441957313899,
"eval_weighted_f1": 0.7432513213762597,
"step": 789
},
{
"epoch": 4.0,
"grad_norm": 0.13222087919712067,
"learning_rate": 1.617438064144421e-05,
"loss": 0.0254,
"step": 1052
},
{
"epoch": 4.0,
"eval_accuracy": 0.9825879486268339,
"eval_loss": 0.08073774725198746,
"eval_macro_f1": 0.745150936861365,
"eval_micro_f1": 0.7519738633269806,
"eval_precision": 0.78824200913242,
"eval_recall": 0.7188964081207704,
"eval_weighted_f1": 0.750615720684395,
"step": 1052
},
{
"epoch": 5.0,
"grad_norm": 0.31658506393432617,
"learning_rate": 1.5164202035721145e-05,
"loss": 0.0185,
"step": 1315
},
{
"epoch": 5.0,
"eval_accuracy": 0.9817418819906256,
"eval_loss": 0.07392168790102005,
"eval_macro_f1": 0.7358482740999972,
"eval_micro_f1": 0.7386687386687387,
"eval_precision": 0.7350515463917526,
"eval_recall": 0.7423217074440396,
"eval_weighted_f1": 0.7391264972928957,
"step": 1315
},
{
"epoch": 6.0,
"grad_norm": 0.009997176006436348,
"learning_rate": 1.415402342999808e-05,
"loss": 0.0142,
"step": 1578
},
{
"epoch": 6.0,
"eval_accuracy": 0.9806081526981065,
"eval_loss": 0.08536450564861298,
"eval_macro_f1": 0.7261304660224934,
"eval_micro_f1": 0.7289386612369558,
"eval_precision": 0.7131474103585658,
"eval_recall": 0.7454450806871421,
"eval_weighted_f1": 0.7296431528943578,
"step": 1578
},
{
"epoch": 7.0,
"grad_norm": 0.22506612539291382,
"learning_rate": 1.3143844824275017e-05,
"loss": 0.0104,
"step": 1841
},
{
"epoch": 7.0,
"eval_accuracy": 0.9821141513105572,
"eval_loss": 0.08728903532028198,
"eval_macro_f1": 0.7474475075874389,
"eval_micro_f1": 0.7513988808952838,
"eval_precision": 0.769650655021834,
"eval_recall": 0.7339927121290994,
"eval_weighted_f1": 0.7506013649890978,
"step": 1841
},
{
"epoch": 8.0,
"grad_norm": 0.015740081667900085,
"learning_rate": 1.213366621855195e-05,
"loss": 0.0087,
"step": 2104
},
{
"epoch": 8.0,
"eval_accuracy": 0.9818772526524189,
"eval_loss": 0.09343691915273666,
"eval_macro_f1": 0.7403039355405312,
"eval_micro_f1": 0.7418275418275417,
"eval_precision": 0.7337067209775967,
"eval_recall": 0.7501301405517959,
"eval_weighted_f1": 0.7420549217599774,
"step": 2104
},
{
"epoch": 9.0,
"grad_norm": 0.6508826613426208,
"learning_rate": 1.1123487612828885e-05,
"loss": 0.007,
"step": 2367
},
{
"epoch": 9.0,
"eval_accuracy": 0.9828756112831447,
"eval_loss": 0.09423227608203888,
"eval_macro_f1": 0.7634932999314054,
"eval_micro_f1": 0.7683468268477408,
"eval_precision": 0.7709643605870021,
"eval_recall": 0.7657470067673087,
"eval_weighted_f1": 0.7676201589775575,
"step": 2367
},
{
"epoch": 10.0,
"grad_norm": 0.005056560505181551,
"learning_rate": 1.011330900710582e-05,
"loss": 0.0059,
"step": 2630
},
{
"epoch": 10.0,
"eval_accuracy": 0.9820295446469364,
"eval_loss": 0.10169301927089691,
"eval_macro_f1": 0.7401422549415057,
"eval_micro_f1": 0.7419871794871794,
"eval_precision": 0.761930883159627,
"eval_recall": 0.7230609057782404,
"eval_weighted_f1": 0.7416103645962767,
"step": 2630
},
{
"epoch": 11.0,
"grad_norm": 0.00294481567107141,
"learning_rate": 9.103130401382755e-06,
"loss": 0.005,
"step": 2893
},
{
"epoch": 11.0,
"eval_accuracy": 0.9826217912922822,
"eval_loss": 0.09840236604213715,
"eval_macro_f1": 0.751826679987133,
"eval_micro_f1": 0.7548761201897732,
"eval_precision": 0.7645488521089162,
"eval_recall": 0.7454450806871421,
"eval_weighted_f1": 0.7538770398780168,
"step": 2893
},
{
"epoch": 12.0,
"grad_norm": 0.4150006175041199,
"learning_rate": 8.092951795659689e-06,
"loss": 0.0041,
"step": 3156
},
{
"epoch": 12.0,
"eval_accuracy": 0.9817418819906256,
"eval_loss": 0.11176982522010803,
"eval_macro_f1": 0.7321679577133663,
"eval_micro_f1": 0.7333156075511832,
"eval_precision": 0.7494565217391305,
"eval_recall": 0.717855283706403,
"eval_weighted_f1": 0.7336935207710876,
"step": 3156
},
{
"epoch": 13.0,
"grad_norm": 0.03623787313699722,
"learning_rate": 7.082773189936625e-06,
"loss": 0.0033,
"step": 3419
},
{
"epoch": 13.0,
"eval_accuracy": 0.9824525779650405,
"eval_loss": 0.11363589018583298,
"eval_macro_f1": 0.7533031808473881,
"eval_micro_f1": 0.753934942287513,
"eval_precision": 0.7599153886832364,
"eval_recall": 0.7480478917230609,
"eval_weighted_f1": 0.7535596423761834,
"step": 3419
},
{
"epoch": 14.0,
"grad_norm": 0.0032901219092309475,
"learning_rate": 6.072594584213559e-06,
"loss": 0.0033,
"step": 3682
},
{
"epoch": 14.0,
"eval_accuracy": 0.9814372980015906,
"eval_loss": 0.11802394688129425,
"eval_macro_f1": 0.7351056070717171,
"eval_micro_f1": 0.7350697184951328,
"eval_precision": 0.7430851063829788,
"eval_recall": 0.7272254034357105,
"eval_weighted_f1": 0.7352935114270702,
"step": 3682
},
{
"epoch": 14.0,
"step": 3682,
"total_flos": 2981574659125788.0,
"train_loss": 0.040679274645918806,
"train_runtime": 972.0928,
"train_samples_per_second": 173.008,
"train_steps_per_second": 5.411
}
],
"logging_steps": 10,
"max_steps": 5260,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 100,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 5
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2981574659125788.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}