{ "best_global_step": 17000, "best_metric": 0.9708837837837838, "best_model_checkpoint": "/kaggle/working/arbert_submeter_training/checkpoints/checkpoint-17000", "epoch": 3.0, "eval_steps": 500, "global_step": 17346, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08648274669203494, "grad_norm": 25.747224807739258, "learning_rate": 4.856162804104693e-05, "loss": 1.2986, "step": 500 }, { "epoch": 0.08648274669203494, "eval_accuracy": 0.765245945945946, "eval_loss": 0.756655216217041, "eval_macro_f1": 0.2987486877044399, "eval_runtime": 418.3804, "eval_samples_per_second": 884.363, "eval_steps_per_second": 3.456, "eval_weighted_f1": 0.7565798837380349, "step": 500 }, { "epoch": 0.17296549338406988, "grad_norm": 7.156609535217285, "learning_rate": 4.7120373573158074e-05, "loss": 0.5963, "step": 1000 }, { "epoch": 0.17296549338406988, "eval_accuracy": 0.8766405405405405, "eval_loss": 0.40730020403862, "eval_macro_f1": 0.4197539556932673, "eval_runtime": 418.1054, "eval_samples_per_second": 884.944, "eval_steps_per_second": 3.458, "eval_weighted_f1": 0.8676584583901654, "step": 1000 }, { "epoch": 0.25944824007610484, "grad_norm": 6.3231658935546875, "learning_rate": 4.567911910526923e-05, "loss": 0.3789, "step": 1500 }, { "epoch": 0.25944824007610484, "eval_accuracy": 0.9137351351351352, "eval_loss": 0.2946445643901825, "eval_macro_f1": 0.47816321808462303, "eval_runtime": 418.8729, "eval_samples_per_second": 883.323, "eval_steps_per_second": 3.452, "eval_weighted_f1": 0.9066607985127312, "step": 1500 }, { "epoch": 0.34593098676813977, "grad_norm": 9.21304988861084, "learning_rate": 4.423786463738038e-05, "loss": 0.2838, "step": 2000 }, { "epoch": 0.34593098676813977, "eval_accuracy": 0.9314702702702703, "eval_loss": 0.23459294438362122, "eval_macro_f1": 0.5072222949676094, "eval_runtime": 418.1997, "eval_samples_per_second": 884.745, "eval_steps_per_second": 3.458, "eval_weighted_f1": 0.9263247220377161, "step": 2000 }, { "epoch": 0.4324137334601747, "grad_norm": 6.399903297424316, "learning_rate": 4.279661016949153e-05, "loss": 0.2401, "step": 2500 }, { "epoch": 0.4324137334601747, "eval_accuracy": 0.9421918918918919, "eval_loss": 0.20360097289085388, "eval_macro_f1": 0.5251223211604551, "eval_runtime": 418.9782, "eval_samples_per_second": 883.101, "eval_steps_per_second": 3.451, "eval_weighted_f1": 0.9356836777939385, "step": 2500 }, { "epoch": 0.5188964801522097, "grad_norm": 7.528863906860352, "learning_rate": 4.135535570160268e-05, "loss": 0.2168, "step": 3000 }, { "epoch": 0.5188964801522097, "eval_accuracy": 0.947972972972973, "eval_loss": 0.1820368617773056, "eval_macro_f1": 0.5299222018041627, "eval_runtime": 418.5666, "eval_samples_per_second": 883.969, "eval_steps_per_second": 3.455, "eval_weighted_f1": 0.9417715175152749, "step": 3000 }, { "epoch": 0.6053792268442446, "grad_norm": 3.640698194503784, "learning_rate": 3.9914101233713826e-05, "loss": 0.1955, "step": 3500 }, { "epoch": 0.6053792268442446, "eval_accuracy": 0.9518621621621621, "eval_loss": 0.17032282054424286, "eval_macro_f1": 0.5375603114820035, "eval_runtime": 418.6948, "eval_samples_per_second": 883.699, "eval_steps_per_second": 3.454, "eval_weighted_f1": 0.9454971013709563, "step": 3500 }, { "epoch": 0.6918619735362795, "grad_norm": 5.204596996307373, "learning_rate": 3.847284676582498e-05, "loss": 0.1782, "step": 4000 }, { "epoch": 0.6918619735362795, "eval_accuracy": 0.9557081081081081, "eval_loss": 0.15780550241470337, "eval_macro_f1": 0.5498663380782979, "eval_runtime": 418.4036, "eval_samples_per_second": 884.314, "eval_steps_per_second": 3.456, "eval_weighted_f1": 0.9495774047836557, "step": 4000 }, { "epoch": 0.7783447202283145, "grad_norm": 2.9452965259552, "learning_rate": 3.7031592297936126e-05, "loss": 0.1699, "step": 4500 }, { "epoch": 0.7783447202283145, "eval_accuracy": 0.9571459459459459, "eval_loss": 0.15344275534152985, "eval_macro_f1": 0.5465995200000592, "eval_runtime": 418.0876, "eval_samples_per_second": 884.982, "eval_steps_per_second": 3.459, "eval_weighted_f1": 0.9507761247869798, "step": 4500 }, { "epoch": 0.8648274669203494, "grad_norm": 5.704383850097656, "learning_rate": 3.559033783004728e-05, "loss": 0.1622, "step": 5000 }, { "epoch": 0.8648274669203494, "eval_accuracy": 0.9585405405405405, "eval_loss": 0.1496480107307434, "eval_macro_f1": 0.5578920159472586, "eval_runtime": 418.0713, "eval_samples_per_second": 885.017, "eval_steps_per_second": 3.459, "eval_weighted_f1": 0.9523043519198916, "step": 5000 }, { "epoch": 0.9513102136123843, "grad_norm": 3.2097666263580322, "learning_rate": 3.4149083362158425e-05, "loss": 0.1569, "step": 5500 }, { "epoch": 0.9513102136123843, "eval_accuracy": 0.9602459459459459, "eval_loss": 0.14497891068458557, "eval_macro_f1": 0.5471822620722766, "eval_runtime": 418.9758, "eval_samples_per_second": 883.106, "eval_steps_per_second": 3.451, "eval_weighted_f1": 0.9536733224654437, "step": 5500 }, { "epoch": 1.0377064775577272, "grad_norm": 4.706158638000488, "learning_rate": 3.270782889426958e-05, "loss": 0.1422, "step": 6000 }, { "epoch": 1.0377064775577272, "eval_accuracy": 0.9593081081081081, "eval_loss": 0.1468845158815384, "eval_macro_f1": 0.5689795604124087, "eval_runtime": 420.1108, "eval_samples_per_second": 880.72, "eval_steps_per_second": 3.442, "eval_weighted_f1": 0.9533441467822756, "step": 6000 }, { "epoch": 1.1241892242497622, "grad_norm": 3.167544364929199, "learning_rate": 3.1266574426380724e-05, "loss": 0.1251, "step": 6500 }, { "epoch": 1.1241892242497622, "eval_accuracy": 0.9628189189189189, "eval_loss": 0.13693760335445404, "eval_macro_f1": 0.5800974551510764, "eval_runtime": 420.0357, "eval_samples_per_second": 880.877, "eval_steps_per_second": 3.443, "eval_weighted_f1": 0.9568010100001315, "step": 6500 }, { "epoch": 1.210671970941797, "grad_norm": 2.2167930603027344, "learning_rate": 2.982531995849187e-05, "loss": 0.123, "step": 7000 }, { "epoch": 1.210671970941797, "eval_accuracy": 0.9632054054054054, "eval_loss": 0.1349489837884903, "eval_macro_f1": 0.5686206184279916, "eval_runtime": 419.1921, "eval_samples_per_second": 882.65, "eval_steps_per_second": 3.449, "eval_weighted_f1": 0.9570982563798056, "step": 7000 }, { "epoch": 1.297154717633832, "grad_norm": 3.8189609050750732, "learning_rate": 2.8384065490603024e-05, "loss": 0.1208, "step": 7500 }, { "epoch": 1.297154717633832, "eval_accuracy": 0.963927027027027, "eval_loss": 0.13370193541049957, "eval_macro_f1": 0.5746596478621987, "eval_runtime": 418.7013, "eval_samples_per_second": 883.685, "eval_steps_per_second": 3.454, "eval_weighted_f1": 0.9576970198616988, "step": 7500 }, { "epoch": 1.3836374643258669, "grad_norm": 4.8342461585998535, "learning_rate": 2.694281102271417e-05, "loss": 0.1188, "step": 8000 }, { "epoch": 1.3836374643258669, "eval_accuracy": 0.964472972972973, "eval_loss": 0.13066376745700836, "eval_macro_f1": 0.5725448949887878, "eval_runtime": 418.7971, "eval_samples_per_second": 883.483, "eval_steps_per_second": 3.453, "eval_weighted_f1": 0.9581300625445718, "step": 8000 }, { "epoch": 1.470120211017902, "grad_norm": 3.3662569522857666, "learning_rate": 2.5501556554825323e-05, "loss": 0.1201, "step": 8500 }, { "epoch": 1.470120211017902, "eval_accuracy": 0.9651378378378378, "eval_loss": 0.12952136993408203, "eval_macro_f1": 0.5705480082509794, "eval_runtime": 418.5068, "eval_samples_per_second": 884.095, "eval_steps_per_second": 3.455, "eval_weighted_f1": 0.9587555599089429, "step": 8500 }, { "epoch": 1.556602957709937, "grad_norm": 3.425612211227417, "learning_rate": 2.406030208693647e-05, "loss": 0.118, "step": 9000 }, { "epoch": 1.556602957709937, "eval_accuracy": 0.965654054054054, "eval_loss": 0.1270706057548523, "eval_macro_f1": 0.5691587584053437, "eval_runtime": 419.0634, "eval_samples_per_second": 882.921, "eval_steps_per_second": 3.451, "eval_weighted_f1": 0.9593746302255395, "step": 9000 }, { "epoch": 1.6430857044019718, "grad_norm": 1.4031856060028076, "learning_rate": 2.261904761904762e-05, "loss": 0.1167, "step": 9500 }, { "epoch": 1.6430857044019718, "eval_accuracy": 0.9661621621621621, "eval_loss": 0.125877246260643, "eval_macro_f1": 0.5795209016258601, "eval_runtime": 418.9995, "eval_samples_per_second": 883.056, "eval_steps_per_second": 3.451, "eval_weighted_f1": 0.9600300931445321, "step": 9500 }, { "epoch": 1.7295684510940066, "grad_norm": 2.918519973754883, "learning_rate": 2.117779315115877e-05, "loss": 0.1133, "step": 10000 }, { "epoch": 1.7295684510940066, "eval_accuracy": 0.9670945945945946, "eval_loss": 0.12201372534036636, "eval_macro_f1": 0.5803247802424795, "eval_runtime": 418.9179, "eval_samples_per_second": 883.228, "eval_steps_per_second": 3.452, "eval_weighted_f1": 0.9608891715468071, "step": 10000 }, { "epoch": 1.8160511977860416, "grad_norm": 2.741220712661743, "learning_rate": 1.973653868326992e-05, "loss": 0.1116, "step": 10500 }, { "epoch": 1.8160511977860416, "eval_accuracy": 0.9673864864864865, "eval_loss": 0.12097315490245819, "eval_macro_f1": 0.5834823701825592, "eval_runtime": 418.7157, "eval_samples_per_second": 883.654, "eval_steps_per_second": 3.453, "eval_weighted_f1": 0.9612394940368674, "step": 10500 }, { "epoch": 1.9025339444780767, "grad_norm": 2.6713507175445557, "learning_rate": 1.8295284215381068e-05, "loss": 0.1103, "step": 11000 }, { "epoch": 1.9025339444780767, "eval_accuracy": 0.9684972972972973, "eval_loss": 0.11646272242069244, "eval_macro_f1": 0.5835802563966344, "eval_runtime": 418.3811, "eval_samples_per_second": 884.361, "eval_steps_per_second": 3.456, "eval_weighted_f1": 0.9622871010076606, "step": 11000 }, { "epoch": 1.9890166911701117, "grad_norm": 2.58137845993042, "learning_rate": 1.6854029747492218e-05, "loss": 0.1093, "step": 11500 }, { "epoch": 1.9890166911701117, "eval_accuracy": 0.9683432432432433, "eval_loss": 0.11723459511995316, "eval_macro_f1": 0.5835321485745915, "eval_runtime": 419.3158, "eval_samples_per_second": 882.39, "eval_steps_per_second": 3.448, "eval_weighted_f1": 0.9623140045622489, "step": 11500 }, { "epoch": 2.0754129551154543, "grad_norm": 3.1163055896759033, "learning_rate": 1.5412775279603368e-05, "loss": 0.0899, "step": 12000 }, { "epoch": 2.0754129551154543, "eval_accuracy": 0.9689324324324324, "eval_loss": 0.11741844564676285, "eval_macro_f1": 0.5972224837605217, "eval_runtime": 419.245, "eval_samples_per_second": 882.539, "eval_steps_per_second": 3.449, "eval_weighted_f1": 0.9632448268921581, "step": 12000 }, { "epoch": 2.1618957018074894, "grad_norm": 2.067152738571167, "learning_rate": 1.3971520811714517e-05, "loss": 0.0851, "step": 12500 }, { "epoch": 2.1618957018074894, "eval_accuracy": 0.9692378378378378, "eval_loss": 0.11705382913351059, "eval_macro_f1": 0.5857631212432319, "eval_runtime": 419.6262, "eval_samples_per_second": 881.737, "eval_steps_per_second": 3.446, "eval_weighted_f1": 0.9632093509253533, "step": 12500 }, { "epoch": 2.2483784484995244, "grad_norm": 1.862592339515686, "learning_rate": 1.2530266343825667e-05, "loss": 0.0862, "step": 13000 }, { "epoch": 2.2483784484995244, "eval_accuracy": 0.9688189189189189, "eval_loss": 0.11716984957456589, "eval_macro_f1": 0.590216690584949, "eval_runtime": 418.913, "eval_samples_per_second": 883.238, "eval_steps_per_second": 3.452, "eval_weighted_f1": 0.9634743085321129, "step": 13000 }, { "epoch": 2.3348611951915594, "grad_norm": 2.883910655975342, "learning_rate": 1.1089011875936815e-05, "loss": 0.0835, "step": 13500 }, { "epoch": 2.3348611951915594, "eval_accuracy": 0.9696405405405405, "eval_loss": 0.11618903279304504, "eval_macro_f1": 0.5970308633746413, "eval_runtime": 418.887, "eval_samples_per_second": 883.293, "eval_steps_per_second": 3.452, "eval_weighted_f1": 0.9638159327084403, "step": 13500 }, { "epoch": 2.421343941883594, "grad_norm": 0.7860650420188904, "learning_rate": 9.647757408047965e-06, "loss": 0.0854, "step": 14000 }, { "epoch": 2.421343941883594, "eval_accuracy": 0.9694459459459459, "eval_loss": 0.1158711388707161, "eval_macro_f1": 0.592536606494846, "eval_runtime": 419.3296, "eval_samples_per_second": 882.361, "eval_steps_per_second": 3.448, "eval_weighted_f1": 0.9638996969783739, "step": 14000 }, { "epoch": 2.507826688575629, "grad_norm": 3.2249786853790283, "learning_rate": 8.206502940159114e-06, "loss": 0.0797, "step": 14500 }, { "epoch": 2.507826688575629, "eval_accuracy": 0.9697621621621622, "eval_loss": 0.11566793918609619, "eval_macro_f1": 0.5934226559634111, "eval_runtime": 420.7367, "eval_samples_per_second": 879.41, "eval_steps_per_second": 3.437, "eval_weighted_f1": 0.964013311849684, "step": 14500 }, { "epoch": 2.594309435267664, "grad_norm": 4.085644245147705, "learning_rate": 6.765248472270265e-06, "loss": 0.0819, "step": 15000 }, { "epoch": 2.594309435267664, "eval_accuracy": 0.9698027027027027, "eval_loss": 0.1152041032910347, "eval_macro_f1": 0.6003991642644262, "eval_runtime": 419.1122, "eval_samples_per_second": 882.818, "eval_steps_per_second": 3.45, "eval_weighted_f1": 0.9643335590541979, "step": 15000 }, { "epoch": 2.680792181959699, "grad_norm": 2.286464214324951, "learning_rate": 5.323994004381414e-06, "loss": 0.0813, "step": 15500 }, { "epoch": 2.680792181959699, "eval_accuracy": 0.9702864864864865, "eval_loss": 0.1135055348277092, "eval_macro_f1": 0.5963674935323597, "eval_runtime": 419.7981, "eval_samples_per_second": 881.376, "eval_steps_per_second": 3.445, "eval_weighted_f1": 0.9645615895626319, "step": 15500 }, { "epoch": 2.7672749286517337, "grad_norm": 2.7449326515197754, "learning_rate": 3.882739536492564e-06, "loss": 0.0792, "step": 16000 }, { "epoch": 2.7672749286517337, "eval_accuracy": 0.9706054054054054, "eval_loss": 0.1119714081287384, "eval_macro_f1": 0.6000477857320852, "eval_runtime": 419.5757, "eval_samples_per_second": 881.843, "eval_steps_per_second": 3.446, "eval_weighted_f1": 0.9649497278700637, "step": 16000 }, { "epoch": 2.853757675343769, "grad_norm": 1.0509530305862427, "learning_rate": 2.441485068603713e-06, "loss": 0.0786, "step": 16500 }, { "epoch": 2.853757675343769, "eval_accuracy": 0.9707135135135135, "eval_loss": 0.11158089339733124, "eval_macro_f1": 0.6009545374695694, "eval_runtime": 418.9418, "eval_samples_per_second": 883.178, "eval_steps_per_second": 3.452, "eval_weighted_f1": 0.9653056586898462, "step": 16500 }, { "epoch": 2.940240422035804, "grad_norm": 0.9345380663871765, "learning_rate": 1.0002306007148624e-06, "loss": 0.0789, "step": 17000 }, { "epoch": 2.940240422035804, "eval_accuracy": 0.9708837837837838, "eval_loss": 0.11126039922237396, "eval_macro_f1": 0.6020869942813024, "eval_runtime": 419.4331, "eval_samples_per_second": 882.143, "eval_steps_per_second": 3.448, "eval_weighted_f1": 0.9654166847298334, "step": 17000 } ], "logging_steps": 500, "max_steps": 17346, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.302829698913882e+16, "train_batch_size": 128, "trial_name": null, "trial_params": null }