{ "best_global_step": 3824, "best_metric": 0.7665036674816625, "best_model_checkpoint": "./phobert-multitask/checkpoint-3824", "epoch": 8.0, "eval_steps": 500, "global_step": 3824, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.0, "grad_norm": 6.267406940460205, "learning_rate": 9.981598232331348e-06, "loss": 2.043239577544783, "step": 478 }, { "epoch": 1.0, "eval_accuracy_coarse": 0.7426650366748166, "eval_accuracy_fine": 0.628361858190709, "eval_f1_coarse_macro": 0.6502651710386934, "eval_f1_fine_macro": 0.605379593432809, "eval_f1_fine_weighted": 0.5995232314641942, "eval_loss": 1.3452860116958618, "eval_runtime": 18.5356, "eval_samples_per_second": 88.262, "eval_steps_per_second": 5.557, "step": 478 }, { "epoch": 2.0, "grad_norm": 24.215755462646484, "learning_rate": 9.33354666334534e-06, "loss": 1.203696534224634, "step": 956 }, { "epoch": 2.0, "eval_accuracy_coarse": 0.8135696821515892, "eval_accuracy_fine": 0.7408312958435208, "eval_f1_coarse_macro": 0.802456160930916, "eval_f1_fine_macro": 0.751035231453591, "eval_f1_fine_weighted": 0.744689454665699, "eval_loss": 1.0884628295898438, "eval_runtime": 18.5112, "eval_samples_per_second": 88.379, "eval_steps_per_second": 5.564, "step": 956 }, { "epoch": 3.0, "grad_norm": 0.8972363471984863, "learning_rate": 7.873177237961524e-06, "loss": 0.9721315774957505, "step": 1434 }, { "epoch": 3.0, "eval_accuracy_coarse": 0.8166259168704156, "eval_accuracy_fine": 0.7353300733496333, "eval_f1_coarse_macro": 0.7919295893473026, "eval_f1_fine_macro": 0.7394243754914572, "eval_f1_fine_weighted": 0.732021202826222, "eval_loss": 1.0886324644088745, "eval_runtime": 18.5493, "eval_samples_per_second": 88.197, "eval_steps_per_second": 5.553, "step": 1434 }, { "epoch": 4.0, "grad_norm": 0.9366881847381592, "learning_rate": 5.8742343630904545e-06, "loss": 0.8340984009299817, "step": 1912 }, { "epoch": 4.0, "eval_accuracy_coarse": 0.8257946210268948, "eval_accuracy_fine": 0.7524449877750611, "eval_f1_coarse_macro": 0.8115790760213039, "eval_f1_fine_macro": 0.7585230889291659, "eval_f1_fine_weighted": 0.7513882818781048, "eval_loss": 1.079779028892517, "eval_runtime": 18.5463, "eval_samples_per_second": 88.212, "eval_steps_per_second": 5.554, "step": 1912 }, { "epoch": 5.0, "grad_norm": 19.028635025024414, "learning_rate": 3.7114173594782087e-06, "loss": 0.7354573525145462, "step": 2390 }, { "epoch": 5.0, "eval_accuracy_coarse": 0.8257946210268948, "eval_accuracy_fine": 0.7579462102689487, "eval_f1_coarse_macro": 0.8118641202186286, "eval_f1_fine_macro": 0.7671818296330676, "eval_f1_fine_weighted": 0.7596953624722936, "eval_loss": 1.1095541715621948, "eval_runtime": 18.5366, "eval_samples_per_second": 88.258, "eval_steps_per_second": 5.557, "step": 2390 }, { "epoch": 6.0, "grad_norm": 0.5821412205696106, "learning_rate": 1.7901435466186506e-06, "loss": 0.6709438308013533, "step": 2868 }, { "epoch": 6.0, "eval_accuracy_coarse": 0.8221271393643031, "eval_accuracy_fine": 0.7646699266503667, "eval_f1_coarse_macro": 0.8110735990814336, "eval_f1_fine_macro": 0.7724096547525416, "eval_f1_fine_weighted": 0.7649762626590634, "eval_loss": 1.1057395935058594, "eval_runtime": 18.5515, "eval_samples_per_second": 88.187, "eval_steps_per_second": 5.552, "step": 2868 }, { "epoch": 7.0, "grad_norm": 6.050240516662598, "learning_rate": 4.705532775431976e-07, "loss": 0.6313777269179851, "step": 3346 }, { "epoch": 7.0, "eval_accuracy_coarse": 0.8227383863080685, "eval_accuracy_fine": 0.7652811735941321, "eval_f1_coarse_macro": 0.8124455379854854, "eval_f1_fine_macro": 0.7740002317386471, "eval_f1_fine_weighted": 0.7668867937841447, "eval_loss": 1.120171308517456, "eval_runtime": 18.6422, "eval_samples_per_second": 87.758, "eval_steps_per_second": 5.525, "step": 3346 }, { "epoch": 8.0, "grad_norm": 3.5955278873443604, "learning_rate": 2.0838688302715625e-12, "loss": 0.6137639129510983, "step": 3824 }, { "epoch": 8.0, "eval_accuracy_coarse": 0.8227383863080685, "eval_accuracy_fine": 0.7665036674816625, "eval_f1_coarse_macro": 0.8111588897237633, "eval_f1_fine_macro": 0.7752350873790258, "eval_f1_fine_weighted": 0.7681455373546499, "eval_loss": 1.12169349193573, "eval_runtime": 18.581, "eval_samples_per_second": 88.047, "eval_steps_per_second": 5.543, "step": 3824 } ], "logging_steps": 500, "max_steps": 3824, "num_input_tokens_seen": 0, "num_train_epochs": 8, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }