| { |
| "best_global_step": 2300, |
| "best_metric": 0.8162891986062718, |
| "best_model_checkpoint": "./hpo_microsoft_mdeberta-v3-base/trial_10/checkpoint-2300", |
| "epoch": 4.307116104868914, |
| "eval_steps": 100, |
| "global_step": 2300, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.18726591760299627, |
| "grad_norm": 3.1831746101379395, |
| "learning_rate": 8.172021938371146e-07, |
| "loss": 0.7259, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.18726591760299627, |
| "eval_accuracy": 0.36936936936936937, |
| "eval_f1": 0.26973684210526316, |
| "eval_loss": 0.7737258076667786, |
| "eval_precision": 0.18468468468468469, |
| "eval_recall": 0.5, |
| "eval_runtime": 0.9378, |
| "eval_samples_per_second": 236.735, |
| "eval_steps_per_second": 29.859, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.37453183520599254, |
| "grad_norm": 10.540749549865723, |
| "learning_rate": 1.6344043876742292e-06, |
| "loss": 0.6787, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.37453183520599254, |
| "eval_accuracy": 0.6981981981981982, |
| "eval_f1": 0.6232809057062533, |
| "eval_loss": 0.6247357130050659, |
| "eval_precision": 0.6922921439159143, |
| "eval_recall": 0.6243031358885017, |
| "eval_runtime": 0.9392, |
| "eval_samples_per_second": 236.362, |
| "eval_steps_per_second": 29.811, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.5617977528089888, |
| "grad_norm": 11.673765182495117, |
| "learning_rate": 2.4433520138968275e-06, |
| "loss": 0.6015, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.5617977528089888, |
| "eval_accuracy": 0.7207207207207207, |
| "eval_f1": 0.687891156462585, |
| "eval_loss": 0.5849120616912842, |
| "eval_precision": 0.7001527883880825, |
| "eval_recall": 0.6825783972125437, |
| "eval_runtime": 0.9386, |
| "eval_samples_per_second": 236.521, |
| "eval_steps_per_second": 29.831, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.7490636704119851, |
| "grad_norm": 13.403273582458496, |
| "learning_rate": 3.2688087753484585e-06, |
| "loss": 0.5959, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.7490636704119851, |
| "eval_accuracy": 0.7342342342342343, |
| "eval_f1": 0.6956996491880213, |
| "eval_loss": 0.5658894181251526, |
| "eval_precision": 0.7200386925974951, |
| "eval_recall": 0.6882404181184669, |
| "eval_runtime": 0.94, |
| "eval_samples_per_second": 236.168, |
| "eval_steps_per_second": 29.787, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.9363295880149812, |
| "grad_norm": 9.928894996643066, |
| "learning_rate": 4.09426553680009e-06, |
| "loss": 0.5559, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.9363295880149812, |
| "eval_accuracy": 0.7432432432432432, |
| "eval_f1": 0.6940744143316491, |
| "eval_loss": 0.5582005381584167, |
| "eval_precision": 0.7438940488476092, |
| "eval_recall": 0.6852787456445993, |
| "eval_runtime": 0.9379, |
| "eval_samples_per_second": 236.71, |
| "eval_steps_per_second": 29.855, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.1235955056179776, |
| "grad_norm": 4.285970211029053, |
| "learning_rate": 4.91972229825172e-06, |
| "loss": 0.4909, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.1235955056179776, |
| "eval_accuracy": 0.7612612612612613, |
| "eval_f1": 0.7155428764838141, |
| "eval_loss": 0.5819087624549866, |
| "eval_precision": 0.7693498452012384, |
| "eval_recall": 0.7046167247386759, |
| "eval_runtime": 0.9385, |
| "eval_samples_per_second": 236.556, |
| "eval_steps_per_second": 29.836, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.3108614232209739, |
| "grad_norm": 12.254231452941895, |
| "learning_rate": 5.745179059703351e-06, |
| "loss": 0.4816, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.3108614232209739, |
| "eval_accuracy": 0.7657657657657657, |
| "eval_f1": 0.7445339470655927, |
| "eval_loss": 0.5305711627006531, |
| "eval_precision": 0.7493691420331651, |
| "eval_recall": 0.74102787456446, |
| "eval_runtime": 0.9437, |
| "eval_samples_per_second": 235.245, |
| "eval_steps_per_second": 29.671, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.4981273408239701, |
| "grad_norm": 12.296418190002441, |
| "learning_rate": 6.570635821154982e-06, |
| "loss": 0.4404, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.4981273408239701, |
| "eval_accuracy": 0.7702702702702703, |
| "eval_f1": 0.7329402052128788, |
| "eval_loss": 0.5971503257751465, |
| "eval_precision": 0.7708133971291866, |
| "eval_recall": 0.7218641114982578, |
| "eval_runtime": 0.9362, |
| "eval_samples_per_second": 237.123, |
| "eval_steps_per_second": 29.907, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.6853932584269664, |
| "grad_norm": 32.506744384765625, |
| "learning_rate": 7.396092582606613e-06, |
| "loss": 0.4179, |
| "step": 900 |
| }, |
| { |
| "epoch": 1.6853932584269664, |
| "eval_accuracy": 0.7567567567567568, |
| "eval_f1": 0.75159552424368, |
| "eval_loss": 0.6150170564651489, |
| "eval_precision": 0.753411306042885, |
| "eval_recall": 0.7717770034843205, |
| "eval_runtime": 0.9387, |
| "eval_samples_per_second": 236.485, |
| "eval_steps_per_second": 29.827, |
| "step": 900 |
| }, |
| { |
| "epoch": 1.8726591760299627, |
| "grad_norm": 21.407085418701172, |
| "learning_rate": 7.76395084943973e-06, |
| "loss": 0.4303, |
| "step": 1000 |
| }, |
| { |
| "epoch": 1.8726591760299627, |
| "eval_accuracy": 0.7882882882882883, |
| "eval_f1": 0.7721983276204616, |
| "eval_loss": 0.5324995517730713, |
| "eval_precision": 0.7729183083793012, |
| "eval_recall": 0.7715156794425087, |
| "eval_runtime": 0.9409, |
| "eval_samples_per_second": 235.951, |
| "eval_steps_per_second": 29.76, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.059925093632959, |
| "grad_norm": 46.14255905151367, |
| "learning_rate": 7.653274429633035e-06, |
| "loss": 0.3717, |
| "step": 1100 |
| }, |
| { |
| "epoch": 2.059925093632959, |
| "eval_accuracy": 0.7657657657657657, |
| "eval_f1": 0.7614087301587301, |
| "eval_loss": 0.7195941805839539, |
| "eval_precision": 0.7646103896103896, |
| "eval_recall": 0.7839721254355401, |
| "eval_runtime": 0.9377, |
| "eval_samples_per_second": 236.755, |
| "eval_steps_per_second": 29.861, |
| "step": 1100 |
| }, |
| { |
| "epoch": 2.247191011235955, |
| "grad_norm": 9.187861442565918, |
| "learning_rate": 7.5425980098263385e-06, |
| "loss": 0.3651, |
| "step": 1200 |
| }, |
| { |
| "epoch": 2.247191011235955, |
| "eval_accuracy": 0.7702702702702703, |
| "eval_f1": 0.7604265854123025, |
| "eval_loss": 0.5944370627403259, |
| "eval_precision": 0.7567757977621219, |
| "eval_recall": 0.7698606271777004, |
| "eval_runtime": 0.9386, |
| "eval_samples_per_second": 236.528, |
| "eval_steps_per_second": 29.832, |
| "step": 1200 |
| }, |
| { |
| "epoch": 2.4344569288389515, |
| "grad_norm": 55.409934997558594, |
| "learning_rate": 7.431921590019642e-06, |
| "loss": 0.3586, |
| "step": 1300 |
| }, |
| { |
| "epoch": 2.4344569288389515, |
| "eval_accuracy": 0.7792792792792793, |
| "eval_f1": 0.7736532179196405, |
| "eval_loss": 0.8182331919670105, |
| "eval_precision": 0.7730158730158729, |
| "eval_recall": 0.7921602787456445, |
| "eval_runtime": 0.937, |
| "eval_samples_per_second": 236.917, |
| "eval_steps_per_second": 29.881, |
| "step": 1300 |
| }, |
| { |
| "epoch": 2.6217228464419478, |
| "grad_norm": 4.450952053070068, |
| "learning_rate": 7.321245170212946e-06, |
| "loss": 0.3967, |
| "step": 1400 |
| }, |
| { |
| "epoch": 2.6217228464419478, |
| "eval_accuracy": 0.7567567567567568, |
| "eval_f1": 0.75159552424368, |
| "eval_loss": 0.6650905013084412, |
| "eval_precision": 0.753411306042885, |
| "eval_recall": 0.7717770034843205, |
| "eval_runtime": 0.938, |
| "eval_samples_per_second": 236.671, |
| "eval_steps_per_second": 29.85, |
| "step": 1400 |
| }, |
| { |
| "epoch": 2.808988764044944, |
| "grad_norm": 0.43200916051864624, |
| "learning_rate": 7.210568750406251e-06, |
| "loss": 0.3031, |
| "step": 1500 |
| }, |
| { |
| "epoch": 2.808988764044944, |
| "eval_accuracy": 0.7837837837837838, |
| "eval_f1": 0.7667454688731284, |
| "eval_loss": 0.6875036954879761, |
| "eval_precision": 0.7682218309859155, |
| "eval_recall": 0.7654181184668989, |
| "eval_runtime": 0.9404, |
| "eval_samples_per_second": 236.06, |
| "eval_steps_per_second": 29.773, |
| "step": 1500 |
| }, |
| { |
| "epoch": 2.9962546816479403, |
| "grad_norm": 53.977630615234375, |
| "learning_rate": 7.099892330599554e-06, |
| "loss": 0.3883, |
| "step": 1600 |
| }, |
| { |
| "epoch": 2.9962546816479403, |
| "eval_accuracy": 0.7972972972972973, |
| "eval_f1": 0.7795431976166831, |
| "eval_loss": 0.7121178507804871, |
| "eval_precision": 0.783922973578146, |
| "eval_recall": 0.7761324041811846, |
| "eval_runtime": 0.9404, |
| "eval_samples_per_second": 236.067, |
| "eval_steps_per_second": 29.774, |
| "step": 1600 |
| }, |
| { |
| "epoch": 3.1835205992509366, |
| "grad_norm": 6.338677406311035, |
| "learning_rate": 6.989215910792859e-06, |
| "loss": 0.2718, |
| "step": 1700 |
| }, |
| { |
| "epoch": 3.1835205992509366, |
| "eval_accuracy": 0.8018018018018018, |
| "eval_f1": 0.7872822299651567, |
| "eval_loss": 0.8387073278427124, |
| "eval_precision": 0.7872822299651567, |
| "eval_recall": 0.7872822299651567, |
| "eval_runtime": 0.9424, |
| "eval_samples_per_second": 235.568, |
| "eval_steps_per_second": 29.711, |
| "step": 1700 |
| }, |
| { |
| "epoch": 3.370786516853933, |
| "grad_norm": 0.23445236682891846, |
| "learning_rate": 6.87964625518423e-06, |
| "loss": 0.259, |
| "step": 1800 |
| }, |
| { |
| "epoch": 3.370786516853933, |
| "eval_accuracy": 0.7792792792792793, |
| "eval_f1": 0.7472759798341193, |
| "eval_loss": 1.0221707820892334, |
| "eval_precision": 0.7765502494654313, |
| "eval_recall": 0.7365853658536585, |
| "eval_runtime": 0.9403, |
| "eval_samples_per_second": 236.09, |
| "eval_steps_per_second": 29.777, |
| "step": 1800 |
| }, |
| { |
| "epoch": 3.558052434456929, |
| "grad_norm": 5.759720325469971, |
| "learning_rate": 6.768969835377533e-06, |
| "loss": 0.2144, |
| "step": 1900 |
| }, |
| { |
| "epoch": 3.558052434456929, |
| "eval_accuracy": 0.7837837837837838, |
| "eval_f1": 0.7765288146967537, |
| "eval_loss": 0.9993805885314941, |
| "eval_precision": 0.7735245901639345, |
| "eval_recall": 0.7906794425087107, |
| "eval_runtime": 0.9382, |
| "eval_samples_per_second": 236.633, |
| "eval_steps_per_second": 29.846, |
| "step": 1900 |
| }, |
| { |
| "epoch": 3.7453183520599254, |
| "grad_norm": 22.900344848632812, |
| "learning_rate": 6.658293415570837e-06, |
| "loss": 0.2209, |
| "step": 2000 |
| }, |
| { |
| "epoch": 3.7453183520599254, |
| "eval_accuracy": 0.7792792792792793, |
| "eval_f1": 0.7706756614314325, |
| "eval_loss": 1.0168108940124512, |
| "eval_precision": 0.7670515463917525, |
| "eval_recall": 0.78205574912892, |
| "eval_runtime": 0.9394, |
| "eval_samples_per_second": 236.31, |
| "eval_steps_per_second": 29.805, |
| "step": 2000 |
| }, |
| { |
| "epoch": 3.932584269662921, |
| "grad_norm": 0.10348391532897949, |
| "learning_rate": 6.54761699576414e-06, |
| "loss": 0.2178, |
| "step": 2100 |
| }, |
| { |
| "epoch": 3.932584269662921, |
| "eval_accuracy": 0.8198198198198198, |
| "eval_f1": 0.8066202090592334, |
| "eval_loss": 0.9587396383285522, |
| "eval_precision": 0.8066202090592334, |
| "eval_recall": 0.8066202090592334, |
| "eval_runtime": 0.9442, |
| "eval_samples_per_second": 235.117, |
| "eval_steps_per_second": 29.654, |
| "step": 2100 |
| }, |
| { |
| "epoch": 4.119850187265918, |
| "grad_norm": 0.5545433759689331, |
| "learning_rate": 6.436940575957445e-06, |
| "loss": 0.2408, |
| "step": 2200 |
| }, |
| { |
| "epoch": 4.119850187265918, |
| "eval_accuracy": 0.8243243243243243, |
| "eval_f1": 0.8145363408521302, |
| "eval_loss": 0.9260944724082947, |
| "eval_precision": 0.810636140914083, |
| "eval_recall": 0.8202961672473867, |
| "eval_runtime": 0.9409, |
| "eval_samples_per_second": 235.953, |
| "eval_steps_per_second": 29.76, |
| "step": 2200 |
| }, |
| { |
| "epoch": 4.307116104868914, |
| "grad_norm": 0.34004443883895874, |
| "learning_rate": 6.326264156150748e-06, |
| "loss": 0.1416, |
| "step": 2300 |
| }, |
| { |
| "epoch": 4.307116104868914, |
| "eval_accuracy": 0.8288288288288288, |
| "eval_f1": 0.8162891986062718, |
| "eval_loss": 1.0393856763839722, |
| "eval_precision": 0.8162891986062718, |
| "eval_recall": 0.8162891986062718, |
| "eval_runtime": 0.9412, |
| "eval_samples_per_second": 235.861, |
| "eval_steps_per_second": 29.748, |
| "step": 2300 |
| } |
| ], |
| "logging_steps": 100, |
| "max_steps": 8010, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 15, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "EarlyStoppingCallback": { |
| "args": { |
| "early_stopping_patience": 4, |
| "early_stopping_threshold": 0.0 |
| }, |
| "attributes": { |
| "early_stopping_patience_counter": 0 |
| } |
| }, |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 4838172851429376.0, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|