{ "best_metric": 0.7690176106066344, "best_model_checkpoint": "/nfs/production/literature/amina-mardiyyah/new_data/Ner_Pipeline/src/ner_pipeline/model_outputs/NER/CeLLaTe_2class_3.0/BiomedNLP_BiomedBERT_base_uncased_abstract_fulltext/BaseStrategy/StandardNerHead/BaseTrainer/no_data_aug/checkpoint-3156", "epoch": 17.0, "eval_steps": 100, "global_step": 4471, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.0, "grad_norm": 0.4874640107154846, "learning_rate": 1.9204916458613406e-05, "loss": 0.2498, "step": 263 }, { "epoch": 1.0, "eval_accuracy": 0.9791021540856558, "eval_loss": 0.06367602199316025, "eval_macro_f1": 0.7051325105699092, "eval_micro_f1": 0.679162072767365, "eval_precision": 0.6194067370537959, "eval_recall": 0.7516778523489933, "eval_weighted_f1": 0.6826862790437196, "step": 263 }, { "epoch": 2.0, "grad_norm": 0.39417576789855957, "learning_rate": 1.819473785289034e-05, "loss": 0.0412, "step": 526 }, { "epoch": 2.0, "eval_accuracy": 0.9823341286359714, "eval_loss": 0.05681116133928299, "eval_macro_f1": 0.7388216167170194, "eval_micro_f1": 0.7260273972602739, "eval_precision": 0.7412587412587412, "eval_recall": 0.7114093959731543, "eval_weighted_f1": 0.7268622245585138, "step": 526 }, { "epoch": 3.0, "grad_norm": 0.560910701751709, "learning_rate": 1.7184559247167276e-05, "loss": 0.0268, "step": 789 }, { "epoch": 3.0, "eval_accuracy": 0.9809465793525898, "eval_loss": 0.06329979002475739, "eval_macro_f1": 0.6973213377816299, "eval_micro_f1": 0.6978349545026671, "eval_precision": 0.7183462532299741, "eval_recall": 0.6784624771201953, "eval_weighted_f1": 0.6978022013246504, "step": 789 }, { "epoch": 4.0, "grad_norm": 1.0401135683059692, "learning_rate": 1.617438064144421e-05, "loss": 0.0199, "step": 1052 }, { "epoch": 4.0, "eval_accuracy": 0.9826217912922822, "eval_loss": 0.06552828103303909, "eval_macro_f1": 0.7463862968414334, "eval_micro_f1": 0.7336027354678272, "eval_precision": 0.7477820025348543, "eval_recall": 0.7199511897498475, "eval_weighted_f1": 0.734478234751404, "step": 1052 }, { "epoch": 5.0, "grad_norm": 0.014341442845761776, "learning_rate": 1.5164202035721145e-05, "loss": 0.0148, "step": 1315 }, { "epoch": 5.0, "eval_accuracy": 0.982807925952248, "eval_loss": 0.07133356481790543, "eval_macro_f1": 0.7405790983069599, "eval_micro_f1": 0.735867135100607, "eval_precision": 0.7721179624664879, "eval_recall": 0.7028676021964613, "eval_weighted_f1": 0.7358009778446118, "step": 1315 }, { "epoch": 6.0, "grad_norm": 1.1025348901748657, "learning_rate": 1.415402342999808e-05, "loss": 0.0119, "step": 1578 }, { "epoch": 6.0, "eval_accuracy": 0.9832986446012488, "eval_loss": 0.07239474356174469, "eval_macro_f1": 0.7569207643483478, "eval_micro_f1": 0.7475998761226387, "eval_precision": 0.759119496855346, "eval_recall": 0.736424649176327, "eval_weighted_f1": 0.7480015362933691, "step": 1578 }, { "epoch": 7.0, "grad_norm": 0.00813271850347519, "learning_rate": 1.3143844824275017e-05, "loss": 0.0091, "step": 1841 }, { "epoch": 7.0, "eval_accuracy": 0.9832648019358005, "eval_loss": 0.08665457367897034, "eval_macro_f1": 0.7613165486493574, "eval_micro_f1": 0.7525445292620864, "eval_precision": 0.786046511627907, "eval_recall": 0.7217815741305674, "eval_weighted_f1": 0.7526279112896425, "step": 1841 }, { "epoch": 8.0, "grad_norm": 3.433748722076416, "learning_rate": 1.213366621855195e-05, "loss": 0.0069, "step": 2104 }, { "epoch": 8.0, "eval_accuracy": 0.9836878352539046, "eval_loss": 0.08179619163274765, "eval_macro_f1": 0.7669616960561761, "eval_micro_f1": 0.7573248407643314, "eval_precision": 0.7921385742838108, "eval_recall": 0.7254423428920074, "eval_weighted_f1": 0.7572005227400528, "step": 2104 }, { "epoch": 9.0, "grad_norm": 0.8720067739486694, "learning_rate": 1.1123487612828885e-05, "loss": 0.006, "step": 2367 }, { "epoch": 9.0, "eval_accuracy": 0.9838232059156979, "eval_loss": 0.08747601509094238, "eval_macro_f1": 0.7586680369609096, "eval_micro_f1": 0.7529339098208772, "eval_precision": 0.7623514696685428, "eval_recall": 0.7437461866992068, "eval_weighted_f1": 0.7531373514071716, "step": 2367 }, { "epoch": 10.0, "grad_norm": 0.005246210843324661, "learning_rate": 1.011330900710582e-05, "loss": 0.0048, "step": 2630 }, { "epoch": 10.0, "eval_accuracy": 0.9830617459431105, "eval_loss": 0.09191625565290451, "eval_macro_f1": 0.7547479457747251, "eval_micro_f1": 0.7470418931883595, "eval_precision": 0.7849462365591398, "eval_recall": 0.7126296522269676, "eval_weighted_f1": 0.7470787667843956, "step": 2630 }, { "epoch": 11.0, "grad_norm": 0.19008387625217438, "learning_rate": 9.103130401382755e-06, "loss": 0.0044, "step": 2893 }, { "epoch": 11.0, "eval_accuracy": 0.983518621926663, "eval_loss": 0.0941159650683403, "eval_macro_f1": 0.7612877776429179, "eval_micro_f1": 0.7492904446546832, "eval_precision": 0.7754569190600522, "eval_recall": 0.7248322147651006, "eval_weighted_f1": 0.7496557430355677, "step": 2893 }, { "epoch": 12.0, "grad_norm": 1.0327165126800537, "learning_rate": 8.092951795659689e-06, "loss": 0.0035, "step": 3156 }, { "epoch": 12.0, "eval_accuracy": 0.9838232059156979, "eval_loss": 0.09955383837223053, "eval_macro_f1": 0.7690176106066344, "eval_micro_f1": 0.7593516209476309, "eval_precision": 0.7762906309751434, "eval_recall": 0.7431360585723001, "eval_weighted_f1": 0.75958648303036, "step": 3156 }, { "epoch": 13.0, "grad_norm": 0.0016579892253503203, "learning_rate": 7.082773189936625e-06, "loss": 0.0029, "step": 3419 }, { "epoch": 13.0, "eval_accuracy": 0.983214037937628, "eval_loss": 0.0985361635684967, "eval_macro_f1": 0.7596363271129749, "eval_micro_f1": 0.7480122324159021, "eval_precision": 0.7498467198038014, "eval_recall": 0.7461866992068334, "eval_weighted_f1": 0.7486848081615433, "step": 3419 }, { "epoch": 14.0, "grad_norm": 0.0013956938637420535, "learning_rate": 6.072594584213559e-06, "loss": 0.0028, "step": 3682 }, { "epoch": 14.0, "eval_accuracy": 0.9827233192886272, "eval_loss": 0.10438687354326248, "eval_macro_f1": 0.7329908010354084, "eval_micro_f1": 0.7283676703645008, "eval_precision": 0.7579155672823219, "eval_recall": 0.7010372178157414, "eval_weighted_f1": 0.7285444967116685, "step": 3682 }, { "epoch": 15.0, "grad_norm": 0.0021703592501580715, "learning_rate": 5.062415978490493e-06, "loss": 0.0025, "step": 3945 }, { "epoch": 15.0, "eval_accuracy": 0.9832309592703521, "eval_loss": 0.10532698780298233, "eval_macro_f1": 0.7517365744682953, "eval_micro_f1": 0.7451713395638628, "eval_precision": 0.7612985359643539, "eval_recall": 0.7297132397803539, "eval_weighted_f1": 0.7453936343949256, "step": 3945 }, { "epoch": 16.0, "grad_norm": 0.0029041045345366, "learning_rate": 4.052237372767428e-06, "loss": 0.0024, "step": 4208 }, { "epoch": 16.0, "eval_accuracy": 0.983417093930318, "eval_loss": 0.10244439542293549, "eval_macro_f1": 0.7516513841005974, "eval_micro_f1": 0.7472256473489519, "eval_precision": 0.7551401869158878, "eval_recall": 0.7394752898108603, "eval_weighted_f1": 0.7473810476845574, "step": 4208 }, { "epoch": 17.0, "grad_norm": 0.0016073787119239569, "learning_rate": 3.0420587670443634e-06, "loss": 0.0021, "step": 4471 }, { "epoch": 17.0, "eval_accuracy": 0.9831463526067313, "eval_loss": 0.11277227848768234, "eval_macro_f1": 0.7579227192038176, "eval_micro_f1": 0.7464023025263831, "eval_precision": 0.7842741935483871, "eval_recall": 0.712019524100061, "eval_weighted_f1": 0.7464933974624048, "step": 4471 }, { "epoch": 17.0, "step": 4471, "total_flos": 3620544913154910.0, "train_loss": 0.024227162930981955, "train_runtime": 1230.7135, "train_samples_per_second": 136.652, "train_steps_per_second": 4.274 } ], "logging_steps": 10, "max_steps": 5260, "num_input_tokens_seen": 0, "num_train_epochs": 20, "save_steps": 100, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 5 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3620544913154910.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }