{ "best_global_step": 2300, "best_metric": 0.8162891986062718, "best_model_checkpoint": "./hpo_microsoft_mdeberta-v3-base/trial_10/checkpoint-2300", "epoch": 4.307116104868914, "eval_steps": 100, "global_step": 2300, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.18726591760299627, "grad_norm": 3.1831746101379395, "learning_rate": 8.172021938371146e-07, "loss": 0.7259, "step": 100 }, { "epoch": 0.18726591760299627, "eval_accuracy": 0.36936936936936937, "eval_f1": 0.26973684210526316, "eval_loss": 0.7737258076667786, "eval_precision": 0.18468468468468469, "eval_recall": 0.5, "eval_runtime": 0.9378, "eval_samples_per_second": 236.735, "eval_steps_per_second": 29.859, "step": 100 }, { "epoch": 0.37453183520599254, "grad_norm": 10.540749549865723, "learning_rate": 1.6344043876742292e-06, "loss": 0.6787, "step": 200 }, { "epoch": 0.37453183520599254, "eval_accuracy": 0.6981981981981982, "eval_f1": 0.6232809057062533, "eval_loss": 0.6247357130050659, "eval_precision": 0.6922921439159143, "eval_recall": 0.6243031358885017, "eval_runtime": 0.9392, "eval_samples_per_second": 236.362, "eval_steps_per_second": 29.811, "step": 200 }, { "epoch": 0.5617977528089888, "grad_norm": 11.673765182495117, "learning_rate": 2.4433520138968275e-06, "loss": 0.6015, "step": 300 }, { "epoch": 0.5617977528089888, "eval_accuracy": 0.7207207207207207, "eval_f1": 0.687891156462585, "eval_loss": 0.5849120616912842, "eval_precision": 0.7001527883880825, "eval_recall": 0.6825783972125437, "eval_runtime": 0.9386, "eval_samples_per_second": 236.521, "eval_steps_per_second": 29.831, "step": 300 }, { "epoch": 0.7490636704119851, "grad_norm": 13.403273582458496, "learning_rate": 3.2688087753484585e-06, "loss": 0.5959, "step": 400 }, { "epoch": 0.7490636704119851, "eval_accuracy": 0.7342342342342343, "eval_f1": 0.6956996491880213, "eval_loss": 0.5658894181251526, "eval_precision": 0.7200386925974951, "eval_recall": 0.6882404181184669, "eval_runtime": 0.94, "eval_samples_per_second": 236.168, "eval_steps_per_second": 29.787, "step": 400 }, { "epoch": 0.9363295880149812, "grad_norm": 9.928894996643066, "learning_rate": 4.09426553680009e-06, "loss": 0.5559, "step": 500 }, { "epoch": 0.9363295880149812, "eval_accuracy": 0.7432432432432432, "eval_f1": 0.6940744143316491, "eval_loss": 0.5582005381584167, "eval_precision": 0.7438940488476092, "eval_recall": 0.6852787456445993, "eval_runtime": 0.9379, "eval_samples_per_second": 236.71, "eval_steps_per_second": 29.855, "step": 500 }, { "epoch": 1.1235955056179776, "grad_norm": 4.285970211029053, "learning_rate": 4.91972229825172e-06, "loss": 0.4909, "step": 600 }, { "epoch": 1.1235955056179776, "eval_accuracy": 0.7612612612612613, "eval_f1": 0.7155428764838141, "eval_loss": 0.5819087624549866, "eval_precision": 0.7693498452012384, "eval_recall": 0.7046167247386759, "eval_runtime": 0.9385, "eval_samples_per_second": 236.556, "eval_steps_per_second": 29.836, "step": 600 }, { "epoch": 1.3108614232209739, "grad_norm": 12.254231452941895, "learning_rate": 5.745179059703351e-06, "loss": 0.4816, "step": 700 }, { "epoch": 1.3108614232209739, "eval_accuracy": 0.7657657657657657, "eval_f1": 0.7445339470655927, "eval_loss": 0.5305711627006531, "eval_precision": 0.7493691420331651, "eval_recall": 0.74102787456446, "eval_runtime": 0.9437, "eval_samples_per_second": 235.245, "eval_steps_per_second": 29.671, "step": 700 }, { "epoch": 1.4981273408239701, "grad_norm": 12.296418190002441, "learning_rate": 6.570635821154982e-06, "loss": 0.4404, "step": 800 }, { "epoch": 1.4981273408239701, "eval_accuracy": 0.7702702702702703, "eval_f1": 0.7329402052128788, "eval_loss": 0.5971503257751465, "eval_precision": 0.7708133971291866, "eval_recall": 0.7218641114982578, "eval_runtime": 0.9362, "eval_samples_per_second": 237.123, "eval_steps_per_second": 29.907, "step": 800 }, { "epoch": 1.6853932584269664, "grad_norm": 32.506744384765625, "learning_rate": 7.396092582606613e-06, "loss": 0.4179, "step": 900 }, { "epoch": 1.6853932584269664, "eval_accuracy": 0.7567567567567568, "eval_f1": 0.75159552424368, "eval_loss": 0.6150170564651489, "eval_precision": 0.753411306042885, "eval_recall": 0.7717770034843205, "eval_runtime": 0.9387, "eval_samples_per_second": 236.485, "eval_steps_per_second": 29.827, "step": 900 }, { "epoch": 1.8726591760299627, "grad_norm": 21.407085418701172, "learning_rate": 7.76395084943973e-06, "loss": 0.4303, "step": 1000 }, { "epoch": 1.8726591760299627, "eval_accuracy": 0.7882882882882883, "eval_f1": 0.7721983276204616, "eval_loss": 0.5324995517730713, "eval_precision": 0.7729183083793012, "eval_recall": 0.7715156794425087, "eval_runtime": 0.9409, "eval_samples_per_second": 235.951, "eval_steps_per_second": 29.76, "step": 1000 }, { "epoch": 2.059925093632959, "grad_norm": 46.14255905151367, "learning_rate": 7.653274429633035e-06, "loss": 0.3717, "step": 1100 }, { "epoch": 2.059925093632959, "eval_accuracy": 0.7657657657657657, "eval_f1": 0.7614087301587301, "eval_loss": 0.7195941805839539, "eval_precision": 0.7646103896103896, "eval_recall": 0.7839721254355401, "eval_runtime": 0.9377, "eval_samples_per_second": 236.755, "eval_steps_per_second": 29.861, "step": 1100 }, { "epoch": 2.247191011235955, "grad_norm": 9.187861442565918, "learning_rate": 7.5425980098263385e-06, "loss": 0.3651, "step": 1200 }, { "epoch": 2.247191011235955, "eval_accuracy": 0.7702702702702703, "eval_f1": 0.7604265854123025, "eval_loss": 0.5944370627403259, "eval_precision": 0.7567757977621219, "eval_recall": 0.7698606271777004, "eval_runtime": 0.9386, "eval_samples_per_second": 236.528, "eval_steps_per_second": 29.832, "step": 1200 }, { "epoch": 2.4344569288389515, "grad_norm": 55.409934997558594, "learning_rate": 7.431921590019642e-06, "loss": 0.3586, "step": 1300 }, { "epoch": 2.4344569288389515, "eval_accuracy": 0.7792792792792793, "eval_f1": 0.7736532179196405, "eval_loss": 0.8182331919670105, "eval_precision": 0.7730158730158729, "eval_recall": 0.7921602787456445, "eval_runtime": 0.937, "eval_samples_per_second": 236.917, "eval_steps_per_second": 29.881, "step": 1300 }, { "epoch": 2.6217228464419478, "grad_norm": 4.450952053070068, "learning_rate": 7.321245170212946e-06, "loss": 0.3967, "step": 1400 }, { "epoch": 2.6217228464419478, "eval_accuracy": 0.7567567567567568, "eval_f1": 0.75159552424368, "eval_loss": 0.6650905013084412, "eval_precision": 0.753411306042885, "eval_recall": 0.7717770034843205, "eval_runtime": 0.938, "eval_samples_per_second": 236.671, "eval_steps_per_second": 29.85, "step": 1400 }, { "epoch": 2.808988764044944, "grad_norm": 0.43200916051864624, "learning_rate": 7.210568750406251e-06, "loss": 0.3031, "step": 1500 }, { "epoch": 2.808988764044944, "eval_accuracy": 0.7837837837837838, "eval_f1": 0.7667454688731284, "eval_loss": 0.6875036954879761, "eval_precision": 0.7682218309859155, "eval_recall": 0.7654181184668989, "eval_runtime": 0.9404, "eval_samples_per_second": 236.06, "eval_steps_per_second": 29.773, "step": 1500 }, { "epoch": 2.9962546816479403, "grad_norm": 53.977630615234375, "learning_rate": 7.099892330599554e-06, "loss": 0.3883, "step": 1600 }, { "epoch": 2.9962546816479403, "eval_accuracy": 0.7972972972972973, "eval_f1": 0.7795431976166831, "eval_loss": 0.7121178507804871, "eval_precision": 0.783922973578146, "eval_recall": 0.7761324041811846, "eval_runtime": 0.9404, "eval_samples_per_second": 236.067, "eval_steps_per_second": 29.774, "step": 1600 }, { "epoch": 3.1835205992509366, "grad_norm": 6.338677406311035, "learning_rate": 6.989215910792859e-06, "loss": 0.2718, "step": 1700 }, { "epoch": 3.1835205992509366, "eval_accuracy": 0.8018018018018018, "eval_f1": 0.7872822299651567, "eval_loss": 0.8387073278427124, "eval_precision": 0.7872822299651567, "eval_recall": 0.7872822299651567, "eval_runtime": 0.9424, "eval_samples_per_second": 235.568, "eval_steps_per_second": 29.711, "step": 1700 }, { "epoch": 3.370786516853933, "grad_norm": 0.23445236682891846, "learning_rate": 6.87964625518423e-06, "loss": 0.259, "step": 1800 }, { "epoch": 3.370786516853933, "eval_accuracy": 0.7792792792792793, "eval_f1": 0.7472759798341193, "eval_loss": 1.0221707820892334, "eval_precision": 0.7765502494654313, "eval_recall": 0.7365853658536585, "eval_runtime": 0.9403, "eval_samples_per_second": 236.09, "eval_steps_per_second": 29.777, "step": 1800 }, { "epoch": 3.558052434456929, "grad_norm": 5.759720325469971, "learning_rate": 6.768969835377533e-06, "loss": 0.2144, "step": 1900 }, { "epoch": 3.558052434456929, "eval_accuracy": 0.7837837837837838, "eval_f1": 0.7765288146967537, "eval_loss": 0.9993805885314941, "eval_precision": 0.7735245901639345, "eval_recall": 0.7906794425087107, "eval_runtime": 0.9382, "eval_samples_per_second": 236.633, "eval_steps_per_second": 29.846, "step": 1900 }, { "epoch": 3.7453183520599254, "grad_norm": 22.900344848632812, "learning_rate": 6.658293415570837e-06, "loss": 0.2209, "step": 2000 }, { "epoch": 3.7453183520599254, "eval_accuracy": 0.7792792792792793, "eval_f1": 0.7706756614314325, "eval_loss": 1.0168108940124512, "eval_precision": 0.7670515463917525, "eval_recall": 0.78205574912892, "eval_runtime": 0.9394, "eval_samples_per_second": 236.31, "eval_steps_per_second": 29.805, "step": 2000 }, { "epoch": 3.932584269662921, "grad_norm": 0.10348391532897949, "learning_rate": 6.54761699576414e-06, "loss": 0.2178, "step": 2100 }, { "epoch": 3.932584269662921, "eval_accuracy": 0.8198198198198198, "eval_f1": 0.8066202090592334, "eval_loss": 0.9587396383285522, "eval_precision": 0.8066202090592334, "eval_recall": 0.8066202090592334, "eval_runtime": 0.9442, "eval_samples_per_second": 235.117, "eval_steps_per_second": 29.654, "step": 2100 }, { "epoch": 4.119850187265918, "grad_norm": 0.5545433759689331, "learning_rate": 6.436940575957445e-06, "loss": 0.2408, "step": 2200 }, { "epoch": 4.119850187265918, "eval_accuracy": 0.8243243243243243, "eval_f1": 0.8145363408521302, "eval_loss": 0.9260944724082947, "eval_precision": 0.810636140914083, "eval_recall": 0.8202961672473867, "eval_runtime": 0.9409, "eval_samples_per_second": 235.953, "eval_steps_per_second": 29.76, "step": 2200 }, { "epoch": 4.307116104868914, "grad_norm": 0.34004443883895874, "learning_rate": 6.326264156150748e-06, "loss": 0.1416, "step": 2300 }, { "epoch": 4.307116104868914, "eval_accuracy": 0.8288288288288288, "eval_f1": 0.8162891986062718, "eval_loss": 1.0393856763839722, "eval_precision": 0.8162891986062718, "eval_recall": 0.8162891986062718, "eval_runtime": 0.9412, "eval_samples_per_second": 235.861, "eval_steps_per_second": 29.748, "step": 2300 } ], "logging_steps": 100, "max_steps": 8010, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 100, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 4, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4838172851429376.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }