{ "best_global_step": 1400, "best_metric": 0.7795431976166831, "best_model_checkpoint": "./hpo_PlanTL-GOB-ES_roberta-base-bne/trial_10/checkpoint-1400", "epoch": 10.447761194029852, "eval_steps": 100, "global_step": 1400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.746268656716418, "grad_norm": 1.1734787225723267, "learning_rate": 2.299839426139915e-06, "loss": 0.6959, "step": 100 }, { "epoch": 0.746268656716418, "eval_accuracy": 0.6081081081081081, "eval_f1": 0.442484773258667, "eval_loss": 0.6894811391830444, "eval_precision": 0.4994814622763806, "eval_recall": 0.4998257839721254, "eval_runtime": 0.3253, "eval_samples_per_second": 682.392, "eval_steps_per_second": 21.517, "step": 100 }, { "epoch": 1.4925373134328357, "grad_norm": 2.857347011566162, "learning_rate": 4.41754964344502e-06, "loss": 0.6866, "step": 200 }, { "epoch": 1.4925373134328357, "eval_accuracy": 0.6936936936936937, "eval_f1": 0.6659290077011596, "eval_loss": 0.6791544556617737, "eval_precision": 0.6693403028118241, "eval_recall": 0.6636759581881533, "eval_runtime": 0.3219, "eval_samples_per_second": 689.684, "eval_steps_per_second": 21.747, "step": 200 }, { "epoch": 2.2388059701492535, "grad_norm": 5.069456100463867, "learning_rate": 4.176060181986678e-06, "loss": 0.6555, "step": 300 }, { "epoch": 2.2388059701492535, "eval_accuracy": 0.6981981981981982, "eval_f1": 0.5875093596605563, "eval_loss": 0.5988879799842834, "eval_precision": 0.7426395939086294, "eval_recall": 0.6040940766550522, "eval_runtime": 0.3255, "eval_samples_per_second": 681.953, "eval_steps_per_second": 21.503, "step": 300 }, { "epoch": 2.9850746268656714, "grad_norm": 5.771562099456787, "learning_rate": 3.9321314330388585e-06, "loss": 0.5745, "step": 400 }, { "epoch": 2.9850746268656714, "eval_accuracy": 0.7252252252252253, "eval_f1": 0.637943480469481, "eval_loss": 0.5637385249137878, "eval_precision": 0.772757980070934, "eval_recall": 0.6406794425087108, "eval_runtime": 0.3245, "eval_samples_per_second": 684.169, "eval_steps_per_second": 21.573, "step": 400 }, { "epoch": 3.7313432835820897, "grad_norm": 6.657003879547119, "learning_rate": 3.6882026840910388e-06, "loss": 0.5315, "step": 500 }, { "epoch": 3.7313432835820897, "eval_accuracy": 0.7612612612612613, "eval_f1": 0.724597991714065, "eval_loss": 0.5057556629180908, "eval_precision": 0.7563169387542893, "eval_recall": 0.7147212543554007, "eval_runtime": 0.3235, "eval_samples_per_second": 686.192, "eval_steps_per_second": 21.637, "step": 500 }, { "epoch": 4.477611940298507, "grad_norm": 6.151370048522949, "learning_rate": 3.4442739351432187e-06, "loss": 0.4973, "step": 600 }, { "epoch": 4.477611940298507, "eval_accuracy": 0.7747747747747747, "eval_f1": 0.7448745058380069, "eval_loss": 0.4851745069026947, "eval_precision": 0.7674050632911392, "eval_recall": 0.7355400696864112, "eval_runtime": 0.3262, "eval_samples_per_second": 680.614, "eval_steps_per_second": 21.461, "step": 600 }, { "epoch": 5.223880597014926, "grad_norm": 10.251242637634277, "learning_rate": 3.2003451861953985e-06, "loss": 0.4523, "step": 700 }, { "epoch": 5.223880597014926, "eval_accuracy": 0.7567567567567568, "eval_f1": 0.7204551814196436, "eval_loss": 0.48035961389541626, "eval_precision": 0.7493827160493827, "eval_recall": 0.7111498257839721, "eval_runtime": 0.3234, "eval_samples_per_second": 686.473, "eval_steps_per_second": 21.646, "step": 700 }, { "epoch": 5.970149253731344, "grad_norm": 5.884487628936768, "learning_rate": 2.9564164372475784e-06, "loss": 0.4519, "step": 800 }, { "epoch": 5.970149253731344, "eval_accuracy": 0.7612612612612613, "eval_f1": 0.7444118605408928, "eval_loss": 0.4888066351413727, "eval_precision": 0.7438242177342463, "eval_recall": 0.7450348432055749, "eval_runtime": 0.3288, "eval_samples_per_second": 675.222, "eval_steps_per_second": 21.291, "step": 800 }, { "epoch": 6.7164179104477615, "grad_norm": 5.6701226234436035, "learning_rate": 2.7124876882997587e-06, "loss": 0.4267, "step": 900 }, { "epoch": 6.7164179104477615, "eval_accuracy": 0.7522522522522522, "eval_f1": 0.7183715834390497, "eval_loss": 0.470042884349823, "eval_precision": 0.7407906558849955, "eval_recall": 0.7101045296167248, "eval_runtime": 0.3283, "eval_samples_per_second": 676.253, "eval_steps_per_second": 21.323, "step": 900 }, { "epoch": 7.462686567164179, "grad_norm": 14.518937110900879, "learning_rate": 2.4685589393519386e-06, "loss": 0.4149, "step": 1000 }, { "epoch": 7.462686567164179, "eval_accuracy": 0.7837837837837838, "eval_f1": 0.7628205128205128, "eval_loss": 0.47342488169670105, "eval_precision": 0.7702702702702703, "eval_recall": 0.7578397212543554, "eval_runtime": 0.3222, "eval_samples_per_second": 688.983, "eval_steps_per_second": 21.725, "step": 1000 }, { "epoch": 8.208955223880597, "grad_norm": 6.513219356536865, "learning_rate": 2.2246301904041184e-06, "loss": 0.3897, "step": 1100 }, { "epoch": 8.208955223880597, "eval_accuracy": 0.7702702702702703, "eval_f1": 0.7501489572989076, "eval_loss": 0.4738766849040985, "eval_precision": 0.7540976265114196, "eval_recall": 0.7471254355400697, "eval_runtime": 0.3272, "eval_samples_per_second": 678.418, "eval_steps_per_second": 21.392, "step": 1100 }, { "epoch": 8.955223880597014, "grad_norm": 19.53132438659668, "learning_rate": 1.9807014414562983e-06, "loss": 0.3806, "step": 1200 }, { "epoch": 8.955223880597014, "eval_accuracy": 0.7837837837837838, "eval_f1": 0.759913482335977, "eval_loss": 0.46905937790870667, "eval_precision": 0.7727443609022557, "eval_recall": 0.7527874564459931, "eval_runtime": 0.3253, "eval_samples_per_second": 682.365, "eval_steps_per_second": 21.516, "step": 1200 }, { "epoch": 9.701492537313433, "grad_norm": 12.14911937713623, "learning_rate": 1.7367726925084784e-06, "loss": 0.3609, "step": 1300 }, { "epoch": 9.701492537313433, "eval_accuracy": 0.7837837837837838, "eval_f1": 0.7679442508710801, "eval_loss": 0.48617300391197205, "eval_precision": 0.7679442508710801, "eval_recall": 0.7679442508710801, "eval_runtime": 0.3248, "eval_samples_per_second": 683.448, "eval_steps_per_second": 21.55, "step": 1300 }, { "epoch": 10.447761194029852, "grad_norm": 15.257988929748535, "learning_rate": 1.4928439435606583e-06, "loss": 0.3456, "step": 1400 }, { "epoch": 10.447761194029852, "eval_accuracy": 0.7972972972972973, "eval_f1": 0.7795431976166831, "eval_loss": 0.4786612093448639, "eval_precision": 0.783922973578146, "eval_recall": 0.7761324041811846, "eval_runtime": 0.3278, "eval_samples_per_second": 677.161, "eval_steps_per_second": 21.352, "step": 1400 } ], "logging_steps": 100, "max_steps": 2010, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 100, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 4, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.17373841796096e+16, "train_batch_size": 32, "trial_name": null, "trial_params": null }