Mardiyyah's picture
push model to hub
7a11cf0 verified
Raw
History Blame Contribute Delete
10.2 kB
{
"best_metric": 0.7690176106066344,
"best_model_checkpoint": "/nfs/production/literature/amina-mardiyyah/new_data/Ner_Pipeline/src/ner_pipeline/model_outputs/NER/CeLLaTe_2class_3.0/BiomedNLP_BiomedBERT_base_uncased_abstract_fulltext/BaseStrategy/StandardNerHead/BaseTrainer/no_data_aug/checkpoint-3156",
"epoch": 17.0,
"eval_steps": 100,
"global_step": 4471,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.0,
"grad_norm": 0.4874640107154846,
"learning_rate": 1.9204916458613406e-05,
"loss": 0.2498,
"step": 263
},
{
"epoch": 1.0,
"eval_accuracy": 0.9791021540856558,
"eval_loss": 0.06367602199316025,
"eval_macro_f1": 0.7051325105699092,
"eval_micro_f1": 0.679162072767365,
"eval_precision": 0.6194067370537959,
"eval_recall": 0.7516778523489933,
"eval_weighted_f1": 0.6826862790437196,
"step": 263
},
{
"epoch": 2.0,
"grad_norm": 0.39417576789855957,
"learning_rate": 1.819473785289034e-05,
"loss": 0.0412,
"step": 526
},
{
"epoch": 2.0,
"eval_accuracy": 0.9823341286359714,
"eval_loss": 0.05681116133928299,
"eval_macro_f1": 0.7388216167170194,
"eval_micro_f1": 0.7260273972602739,
"eval_precision": 0.7412587412587412,
"eval_recall": 0.7114093959731543,
"eval_weighted_f1": 0.7268622245585138,
"step": 526
},
{
"epoch": 3.0,
"grad_norm": 0.560910701751709,
"learning_rate": 1.7184559247167276e-05,
"loss": 0.0268,
"step": 789
},
{
"epoch": 3.0,
"eval_accuracy": 0.9809465793525898,
"eval_loss": 0.06329979002475739,
"eval_macro_f1": 0.6973213377816299,
"eval_micro_f1": 0.6978349545026671,
"eval_precision": 0.7183462532299741,
"eval_recall": 0.6784624771201953,
"eval_weighted_f1": 0.6978022013246504,
"step": 789
},
{
"epoch": 4.0,
"grad_norm": 1.0401135683059692,
"learning_rate": 1.617438064144421e-05,
"loss": 0.0199,
"step": 1052
},
{
"epoch": 4.0,
"eval_accuracy": 0.9826217912922822,
"eval_loss": 0.06552828103303909,
"eval_macro_f1": 0.7463862968414334,
"eval_micro_f1": 0.7336027354678272,
"eval_precision": 0.7477820025348543,
"eval_recall": 0.7199511897498475,
"eval_weighted_f1": 0.734478234751404,
"step": 1052
},
{
"epoch": 5.0,
"grad_norm": 0.014341442845761776,
"learning_rate": 1.5164202035721145e-05,
"loss": 0.0148,
"step": 1315
},
{
"epoch": 5.0,
"eval_accuracy": 0.982807925952248,
"eval_loss": 0.07133356481790543,
"eval_macro_f1": 0.7405790983069599,
"eval_micro_f1": 0.735867135100607,
"eval_precision": 0.7721179624664879,
"eval_recall": 0.7028676021964613,
"eval_weighted_f1": 0.7358009778446118,
"step": 1315
},
{
"epoch": 6.0,
"grad_norm": 1.1025348901748657,
"learning_rate": 1.415402342999808e-05,
"loss": 0.0119,
"step": 1578
},
{
"epoch": 6.0,
"eval_accuracy": 0.9832986446012488,
"eval_loss": 0.07239474356174469,
"eval_macro_f1": 0.7569207643483478,
"eval_micro_f1": 0.7475998761226387,
"eval_precision": 0.759119496855346,
"eval_recall": 0.736424649176327,
"eval_weighted_f1": 0.7480015362933691,
"step": 1578
},
{
"epoch": 7.0,
"grad_norm": 0.00813271850347519,
"learning_rate": 1.3143844824275017e-05,
"loss": 0.0091,
"step": 1841
},
{
"epoch": 7.0,
"eval_accuracy": 0.9832648019358005,
"eval_loss": 0.08665457367897034,
"eval_macro_f1": 0.7613165486493574,
"eval_micro_f1": 0.7525445292620864,
"eval_precision": 0.786046511627907,
"eval_recall": 0.7217815741305674,
"eval_weighted_f1": 0.7526279112896425,
"step": 1841
},
{
"epoch": 8.0,
"grad_norm": 3.433748722076416,
"learning_rate": 1.213366621855195e-05,
"loss": 0.0069,
"step": 2104
},
{
"epoch": 8.0,
"eval_accuracy": 0.9836878352539046,
"eval_loss": 0.08179619163274765,
"eval_macro_f1": 0.7669616960561761,
"eval_micro_f1": 0.7573248407643314,
"eval_precision": 0.7921385742838108,
"eval_recall": 0.7254423428920074,
"eval_weighted_f1": 0.7572005227400528,
"step": 2104
},
{
"epoch": 9.0,
"grad_norm": 0.8720067739486694,
"learning_rate": 1.1123487612828885e-05,
"loss": 0.006,
"step": 2367
},
{
"epoch": 9.0,
"eval_accuracy": 0.9838232059156979,
"eval_loss": 0.08747601509094238,
"eval_macro_f1": 0.7586680369609096,
"eval_micro_f1": 0.7529339098208772,
"eval_precision": 0.7623514696685428,
"eval_recall": 0.7437461866992068,
"eval_weighted_f1": 0.7531373514071716,
"step": 2367
},
{
"epoch": 10.0,
"grad_norm": 0.005246210843324661,
"learning_rate": 1.011330900710582e-05,
"loss": 0.0048,
"step": 2630
},
{
"epoch": 10.0,
"eval_accuracy": 0.9830617459431105,
"eval_loss": 0.09191625565290451,
"eval_macro_f1": 0.7547479457747251,
"eval_micro_f1": 0.7470418931883595,
"eval_precision": 0.7849462365591398,
"eval_recall": 0.7126296522269676,
"eval_weighted_f1": 0.7470787667843956,
"step": 2630
},
{
"epoch": 11.0,
"grad_norm": 0.19008387625217438,
"learning_rate": 9.103130401382755e-06,
"loss": 0.0044,
"step": 2893
},
{
"epoch": 11.0,
"eval_accuracy": 0.983518621926663,
"eval_loss": 0.0941159650683403,
"eval_macro_f1": 0.7612877776429179,
"eval_micro_f1": 0.7492904446546832,
"eval_precision": 0.7754569190600522,
"eval_recall": 0.7248322147651006,
"eval_weighted_f1": 0.7496557430355677,
"step": 2893
},
{
"epoch": 12.0,
"grad_norm": 1.0327165126800537,
"learning_rate": 8.092951795659689e-06,
"loss": 0.0035,
"step": 3156
},
{
"epoch": 12.0,
"eval_accuracy": 0.9838232059156979,
"eval_loss": 0.09955383837223053,
"eval_macro_f1": 0.7690176106066344,
"eval_micro_f1": 0.7593516209476309,
"eval_precision": 0.7762906309751434,
"eval_recall": 0.7431360585723001,
"eval_weighted_f1": 0.75958648303036,
"step": 3156
},
{
"epoch": 13.0,
"grad_norm": 0.0016579892253503203,
"learning_rate": 7.082773189936625e-06,
"loss": 0.0029,
"step": 3419
},
{
"epoch": 13.0,
"eval_accuracy": 0.983214037937628,
"eval_loss": 0.0985361635684967,
"eval_macro_f1": 0.7596363271129749,
"eval_micro_f1": 0.7480122324159021,
"eval_precision": 0.7498467198038014,
"eval_recall": 0.7461866992068334,
"eval_weighted_f1": 0.7486848081615433,
"step": 3419
},
{
"epoch": 14.0,
"grad_norm": 0.0013956938637420535,
"learning_rate": 6.072594584213559e-06,
"loss": 0.0028,
"step": 3682
},
{
"epoch": 14.0,
"eval_accuracy": 0.9827233192886272,
"eval_loss": 0.10438687354326248,
"eval_macro_f1": 0.7329908010354084,
"eval_micro_f1": 0.7283676703645008,
"eval_precision": 0.7579155672823219,
"eval_recall": 0.7010372178157414,
"eval_weighted_f1": 0.7285444967116685,
"step": 3682
},
{
"epoch": 15.0,
"grad_norm": 0.0021703592501580715,
"learning_rate": 5.062415978490493e-06,
"loss": 0.0025,
"step": 3945
},
{
"epoch": 15.0,
"eval_accuracy": 0.9832309592703521,
"eval_loss": 0.10532698780298233,
"eval_macro_f1": 0.7517365744682953,
"eval_micro_f1": 0.7451713395638628,
"eval_precision": 0.7612985359643539,
"eval_recall": 0.7297132397803539,
"eval_weighted_f1": 0.7453936343949256,
"step": 3945
},
{
"epoch": 16.0,
"grad_norm": 0.0029041045345366,
"learning_rate": 4.052237372767428e-06,
"loss": 0.0024,
"step": 4208
},
{
"epoch": 16.0,
"eval_accuracy": 0.983417093930318,
"eval_loss": 0.10244439542293549,
"eval_macro_f1": 0.7516513841005974,
"eval_micro_f1": 0.7472256473489519,
"eval_precision": 0.7551401869158878,
"eval_recall": 0.7394752898108603,
"eval_weighted_f1": 0.7473810476845574,
"step": 4208
},
{
"epoch": 17.0,
"grad_norm": 0.0016073787119239569,
"learning_rate": 3.0420587670443634e-06,
"loss": 0.0021,
"step": 4471
},
{
"epoch": 17.0,
"eval_accuracy": 0.9831463526067313,
"eval_loss": 0.11277227848768234,
"eval_macro_f1": 0.7579227192038176,
"eval_micro_f1": 0.7464023025263831,
"eval_precision": 0.7842741935483871,
"eval_recall": 0.712019524100061,
"eval_weighted_f1": 0.7464933974624048,
"step": 4471
},
{
"epoch": 17.0,
"step": 4471,
"total_flos": 3620544913154910.0,
"train_loss": 0.024227162930981955,
"train_runtime": 1230.7135,
"train_samples_per_second": 136.652,
"train_steps_per_second": 4.274
}
],
"logging_steps": 10,
"max_steps": 5260,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 100,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 5
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3620544913154910.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}