Instructions to use Shaer-AI/ARBERT-base-submeter-classifier with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Shaer-AI/ARBERT-base-submeter-classifier with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="Shaer-AI/ARBERT-base-submeter-classifier")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("Shaer-AI/ARBERT-base-submeter-classifier") model = AutoModelForSequenceClassification.from_pretrained("Shaer-AI/ARBERT-base-submeter-classifier", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 17000, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 17346, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.08648274669203494, | |
| "grad_norm": 25.747224807739258, | |
| "learning_rate": 4.856162804104693e-05, | |
| "loss": 1.2986, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.08648274669203494, | |
| "eval_accuracy": 0.765245945945946, | |
| "eval_loss": 0.756655216217041, | |
| "eval_macro_f1": 0.2987486877044399, | |
| "eval_runtime": 418.3804, | |
| "eval_samples_per_second": 884.363, | |
| "eval_steps_per_second": 3.456, | |
| "eval_weighted_f1": 0.7565798837380349, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.17296549338406988, | |
| "grad_norm": 7.156609535217285, | |
| "learning_rate": 4.7120373573158074e-05, | |
| "loss": 0.5963, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.17296549338406988, | |
| "eval_accuracy": 0.8766405405405405, | |
| "eval_loss": 0.40730020403862, | |
| "eval_macro_f1": 0.4197539556932673, | |
| "eval_runtime": 418.1054, | |
| "eval_samples_per_second": 884.944, | |
| "eval_steps_per_second": 3.458, | |
| "eval_weighted_f1": 0.8676584583901654, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.25944824007610484, | |
| "grad_norm": 6.3231658935546875, | |
| "learning_rate": 4.567911910526923e-05, | |
| "loss": 0.3789, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.25944824007610484, | |
| "eval_accuracy": 0.9137351351351352, | |
| "eval_loss": 0.2946445643901825, | |
| "eval_macro_f1": 0.47816321808462303, | |
| "eval_runtime": 418.8729, | |
| "eval_samples_per_second": 883.323, | |
| "eval_steps_per_second": 3.452, | |
| "eval_weighted_f1": 0.9066607985127312, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.34593098676813977, | |
| "grad_norm": 9.21304988861084, | |
| "learning_rate": 4.423786463738038e-05, | |
| "loss": 0.2838, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.34593098676813977, | |
| "eval_accuracy": 0.9314702702702703, | |
| "eval_loss": 0.23459294438362122, | |
| "eval_macro_f1": 0.5072222949676094, | |
| "eval_runtime": 418.1997, | |
| "eval_samples_per_second": 884.745, | |
| "eval_steps_per_second": 3.458, | |
| "eval_weighted_f1": 0.9263247220377161, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.4324137334601747, | |
| "grad_norm": 6.399903297424316, | |
| "learning_rate": 4.279661016949153e-05, | |
| "loss": 0.2401, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.4324137334601747, | |
| "eval_accuracy": 0.9421918918918919, | |
| "eval_loss": 0.20360097289085388, | |
| "eval_macro_f1": 0.5251223211604551, | |
| "eval_runtime": 418.9782, | |
| "eval_samples_per_second": 883.101, | |
| "eval_steps_per_second": 3.451, | |
| "eval_weighted_f1": 0.9356836777939385, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.5188964801522097, | |
| "grad_norm": 7.528863906860352, | |
| "learning_rate": 4.135535570160268e-05, | |
| "loss": 0.2168, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.5188964801522097, | |
| "eval_accuracy": 0.947972972972973, | |
| "eval_loss": 0.1820368617773056, | |
| "eval_macro_f1": 0.5299222018041627, | |
| "eval_runtime": 418.5666, | |
| "eval_samples_per_second": 883.969, | |
| "eval_steps_per_second": 3.455, | |
| "eval_weighted_f1": 0.9417715175152749, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.6053792268442446, | |
| "grad_norm": 3.640698194503784, | |
| "learning_rate": 3.9914101233713826e-05, | |
| "loss": 0.1955, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.6053792268442446, | |
| "eval_accuracy": 0.9518621621621621, | |
| "eval_loss": 0.17032282054424286, | |
| "eval_macro_f1": 0.5375603114820035, | |
| "eval_runtime": 418.6948, | |
| "eval_samples_per_second": 883.699, | |
| "eval_steps_per_second": 3.454, | |
| "eval_weighted_f1": 0.9454971013709563, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.6918619735362795, | |
| "grad_norm": 5.204596996307373, | |
| "learning_rate": 3.847284676582498e-05, | |
| "loss": 0.1782, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.6918619735362795, | |
| "eval_accuracy": 0.9557081081081081, | |
| "eval_loss": 0.15780550241470337, | |
| "eval_macro_f1": 0.5498663380782979, | |
| "eval_runtime": 418.4036, | |
| "eval_samples_per_second": 884.314, | |
| "eval_steps_per_second": 3.456, | |
| "eval_weighted_f1": 0.9495774047836557, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.7783447202283145, | |
| "grad_norm": 2.9452965259552, | |
| "learning_rate": 3.7031592297936126e-05, | |
| "loss": 0.1699, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.7783447202283145, | |
| "eval_accuracy": 0.9571459459459459, | |
| "eval_loss": 0.15344275534152985, | |
| "eval_macro_f1": 0.5465995200000592, | |
| "eval_runtime": 418.0876, | |
| "eval_samples_per_second": 884.982, | |
| "eval_steps_per_second": 3.459, | |
| "eval_weighted_f1": 0.9507761247869798, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.8648274669203494, | |
| "grad_norm": 5.704383850097656, | |
| "learning_rate": 3.559033783004728e-05, | |
| "loss": 0.1622, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.8648274669203494, | |
| "eval_accuracy": 0.9585405405405405, | |
| "eval_loss": 0.1496480107307434, | |
| "eval_macro_f1": 0.5578920159472586, | |
| "eval_runtime": 418.0713, | |
| "eval_samples_per_second": 885.017, | |
| "eval_steps_per_second": 3.459, | |
| "eval_weighted_f1": 0.9523043519198916, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.9513102136123843, | |
| "grad_norm": 3.2097666263580322, | |
| "learning_rate": 3.4149083362158425e-05, | |
| "loss": 0.1569, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.9513102136123843, | |
| "eval_accuracy": 0.9602459459459459, | |
| "eval_loss": 0.14497891068458557, | |
| "eval_macro_f1": 0.5471822620722766, | |
| "eval_runtime": 418.9758, | |
| "eval_samples_per_second": 883.106, | |
| "eval_steps_per_second": 3.451, | |
| "eval_weighted_f1": 0.9536733224654437, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 1.0377064775577272, | |
| "grad_norm": 4.706158638000488, | |
| "learning_rate": 3.270782889426958e-05, | |
| "loss": 0.1422, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 1.0377064775577272, | |
| "eval_accuracy": 0.9593081081081081, | |
| "eval_loss": 0.1468845158815384, | |
| "eval_macro_f1": 0.5689795604124087, | |
| "eval_runtime": 420.1108, | |
| "eval_samples_per_second": 880.72, | |
| "eval_steps_per_second": 3.442, | |
| "eval_weighted_f1": 0.9533441467822756, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 1.1241892242497622, | |
| "grad_norm": 3.167544364929199, | |
| "learning_rate": 3.1266574426380724e-05, | |
| "loss": 0.1251, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 1.1241892242497622, | |
| "eval_accuracy": 0.9628189189189189, | |
| "eval_loss": 0.13693760335445404, | |
| "eval_macro_f1": 0.5800974551510764, | |
| "eval_runtime": 420.0357, | |
| "eval_samples_per_second": 880.877, | |
| "eval_steps_per_second": 3.443, | |
| "eval_weighted_f1": 0.9568010100001315, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 1.210671970941797, | |
| "grad_norm": 2.2167930603027344, | |
| "learning_rate": 2.982531995849187e-05, | |
| "loss": 0.123, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 1.210671970941797, | |
| "eval_accuracy": 0.9632054054054054, | |
| "eval_loss": 0.1349489837884903, | |
| "eval_macro_f1": 0.5686206184279916, | |
| "eval_runtime": 419.1921, | |
| "eval_samples_per_second": 882.65, | |
| "eval_steps_per_second": 3.449, | |
| "eval_weighted_f1": 0.9570982563798056, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 1.297154717633832, | |
| "grad_norm": 3.8189609050750732, | |
| "learning_rate": 2.8384065490603024e-05, | |
| "loss": 0.1208, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 1.297154717633832, | |
| "eval_accuracy": 0.963927027027027, | |
| "eval_loss": 0.13370193541049957, | |
| "eval_macro_f1": 0.5746596478621987, | |
| "eval_runtime": 418.7013, | |
| "eval_samples_per_second": 883.685, | |
| "eval_steps_per_second": 3.454, | |
| "eval_weighted_f1": 0.9576970198616988, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 1.3836374643258669, | |
| "grad_norm": 4.8342461585998535, | |
| "learning_rate": 2.694281102271417e-05, | |
| "loss": 0.1188, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 1.3836374643258669, | |
| "eval_accuracy": 0.964472972972973, | |
| "eval_loss": 0.13066376745700836, | |
| "eval_macro_f1": 0.5725448949887878, | |
| "eval_runtime": 418.7971, | |
| "eval_samples_per_second": 883.483, | |
| "eval_steps_per_second": 3.453, | |
| "eval_weighted_f1": 0.9581300625445718, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 1.470120211017902, | |
| "grad_norm": 3.3662569522857666, | |
| "learning_rate": 2.5501556554825323e-05, | |
| "loss": 0.1201, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 1.470120211017902, | |
| "eval_accuracy": 0.9651378378378378, | |
| "eval_loss": 0.12952136993408203, | |
| "eval_macro_f1": 0.5705480082509794, | |
| "eval_runtime": 418.5068, | |
| "eval_samples_per_second": 884.095, | |
| "eval_steps_per_second": 3.455, | |
| "eval_weighted_f1": 0.9587555599089429, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 1.556602957709937, | |
| "grad_norm": 3.425612211227417, | |
| "learning_rate": 2.406030208693647e-05, | |
| "loss": 0.118, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 1.556602957709937, | |
| "eval_accuracy": 0.965654054054054, | |
| "eval_loss": 0.1270706057548523, | |
| "eval_macro_f1": 0.5691587584053437, | |
| "eval_runtime": 419.0634, | |
| "eval_samples_per_second": 882.921, | |
| "eval_steps_per_second": 3.451, | |
| "eval_weighted_f1": 0.9593746302255395, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 1.6430857044019718, | |
| "grad_norm": 1.4031856060028076, | |
| "learning_rate": 2.261904761904762e-05, | |
| "loss": 0.1167, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 1.6430857044019718, | |
| "eval_accuracy": 0.9661621621621621, | |
| "eval_loss": 0.125877246260643, | |
| "eval_macro_f1": 0.5795209016258601, | |
| "eval_runtime": 418.9995, | |
| "eval_samples_per_second": 883.056, | |
| "eval_steps_per_second": 3.451, | |
| "eval_weighted_f1": 0.9600300931445321, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 1.7295684510940066, | |
| "grad_norm": 2.918519973754883, | |
| "learning_rate": 2.117779315115877e-05, | |
| "loss": 0.1133, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 1.7295684510940066, | |
| "eval_accuracy": 0.9670945945945946, | |
| "eval_loss": 0.12201372534036636, | |
| "eval_macro_f1": 0.5803247802424795, | |
| "eval_runtime": 418.9179, | |
| "eval_samples_per_second": 883.228, | |
| "eval_steps_per_second": 3.452, | |
| "eval_weighted_f1": 0.9608891715468071, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 1.8160511977860416, | |
| "grad_norm": 2.741220712661743, | |
| "learning_rate": 1.973653868326992e-05, | |
| "loss": 0.1116, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 1.8160511977860416, | |
| "eval_accuracy": 0.9673864864864865, | |
| "eval_loss": 0.12097315490245819, | |
| "eval_macro_f1": 0.5834823701825592, | |
| "eval_runtime": 418.7157, | |
| "eval_samples_per_second": 883.654, | |
| "eval_steps_per_second": 3.453, | |
| "eval_weighted_f1": 0.9612394940368674, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 1.9025339444780767, | |
| "grad_norm": 2.6713507175445557, | |
| "learning_rate": 1.8295284215381068e-05, | |
| "loss": 0.1103, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 1.9025339444780767, | |
| "eval_accuracy": 0.9684972972972973, | |
| "eval_loss": 0.11646272242069244, | |
| "eval_macro_f1": 0.5835802563966344, | |
| "eval_runtime": 418.3811, | |
| "eval_samples_per_second": 884.361, | |
| "eval_steps_per_second": 3.456, | |
| "eval_weighted_f1": 0.9622871010076606, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 1.9890166911701117, | |
| "grad_norm": 2.58137845993042, | |
| "learning_rate": 1.6854029747492218e-05, | |
| "loss": 0.1093, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 1.9890166911701117, | |
| "eval_accuracy": 0.9683432432432433, | |
| "eval_loss": 0.11723459511995316, | |
| "eval_macro_f1": 0.5835321485745915, | |
| "eval_runtime": 419.3158, | |
| "eval_samples_per_second": 882.39, | |
| "eval_steps_per_second": 3.448, | |
| "eval_weighted_f1": 0.9623140045622489, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 2.0754129551154543, | |
| "grad_norm": 3.1163055896759033, | |
| "learning_rate": 1.5412775279603368e-05, | |
| "loss": 0.0899, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 2.0754129551154543, | |
| "eval_accuracy": 0.9689324324324324, | |
| "eval_loss": 0.11741844564676285, | |
| "eval_macro_f1": 0.5972224837605217, | |
| "eval_runtime": 419.245, | |
| "eval_samples_per_second": 882.539, | |
| "eval_steps_per_second": 3.449, | |
| "eval_weighted_f1": 0.9632448268921581, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 2.1618957018074894, | |
| "grad_norm": 2.067152738571167, | |
| "learning_rate": 1.3971520811714517e-05, | |
| "loss": 0.0851, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 2.1618957018074894, | |
| "eval_accuracy": 0.9692378378378378, | |
| "eval_loss": 0.11705382913351059, | |
| "eval_macro_f1": 0.5857631212432319, | |
| "eval_runtime": 419.6262, | |
| "eval_samples_per_second": 881.737, | |
| "eval_steps_per_second": 3.446, | |
| "eval_weighted_f1": 0.9632093509253533, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 2.2483784484995244, | |
| "grad_norm": 1.862592339515686, | |
| "learning_rate": 1.2530266343825667e-05, | |
| "loss": 0.0862, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 2.2483784484995244, | |
| "eval_accuracy": 0.9688189189189189, | |
| "eval_loss": 0.11716984957456589, | |
| "eval_macro_f1": 0.590216690584949, | |
| "eval_runtime": 418.913, | |
| "eval_samples_per_second": 883.238, | |
| "eval_steps_per_second": 3.452, | |
| "eval_weighted_f1": 0.9634743085321129, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 2.3348611951915594, | |
| "grad_norm": 2.883910655975342, | |
| "learning_rate": 1.1089011875936815e-05, | |
| "loss": 0.0835, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 2.3348611951915594, | |
| "eval_accuracy": 0.9696405405405405, | |
| "eval_loss": 0.11618903279304504, | |
| "eval_macro_f1": 0.5970308633746413, | |
| "eval_runtime": 418.887, | |
| "eval_samples_per_second": 883.293, | |
| "eval_steps_per_second": 3.452, | |
| "eval_weighted_f1": 0.9638159327084403, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 2.421343941883594, | |
| "grad_norm": 0.7860650420188904, | |
| "learning_rate": 9.647757408047965e-06, | |
| "loss": 0.0854, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 2.421343941883594, | |
| "eval_accuracy": 0.9694459459459459, | |
| "eval_loss": 0.1158711388707161, | |
| "eval_macro_f1": 0.592536606494846, | |
| "eval_runtime": 419.3296, | |
| "eval_samples_per_second": 882.361, | |
| "eval_steps_per_second": 3.448, | |
| "eval_weighted_f1": 0.9638996969783739, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 2.507826688575629, | |
| "grad_norm": 3.2249786853790283, | |
| "learning_rate": 8.206502940159114e-06, | |
| "loss": 0.0797, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 2.507826688575629, | |
| "eval_accuracy": 0.9697621621621622, | |
| "eval_loss": 0.11566793918609619, | |
| "eval_macro_f1": 0.5934226559634111, | |
| "eval_runtime": 420.7367, | |
| "eval_samples_per_second": 879.41, | |
| "eval_steps_per_second": 3.437, | |
| "eval_weighted_f1": 0.964013311849684, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 2.594309435267664, | |
| "grad_norm": 4.085644245147705, | |
| "learning_rate": 6.765248472270265e-06, | |
| "loss": 0.0819, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 2.594309435267664, | |
| "eval_accuracy": 0.9698027027027027, | |
| "eval_loss": 0.1152041032910347, | |
| "eval_macro_f1": 0.6003991642644262, | |
| "eval_runtime": 419.1122, | |
| "eval_samples_per_second": 882.818, | |
| "eval_steps_per_second": 3.45, | |
| "eval_weighted_f1": 0.9643335590541979, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 2.680792181959699, | |
| "grad_norm": 2.286464214324951, | |
| "learning_rate": 5.323994004381414e-06, | |
| "loss": 0.0813, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 2.680792181959699, | |
| "eval_accuracy": 0.9702864864864865, | |
| "eval_loss": 0.1135055348277092, | |
| "eval_macro_f1": 0.5963674935323597, | |
| "eval_runtime": 419.7981, | |
| "eval_samples_per_second": 881.376, | |
| "eval_steps_per_second": 3.445, | |
| "eval_weighted_f1": 0.9645615895626319, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 2.7672749286517337, | |
| "grad_norm": 2.7449326515197754, | |
| "learning_rate": 3.882739536492564e-06, | |
| "loss": 0.0792, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 2.7672749286517337, | |
| "eval_accuracy": 0.9706054054054054, | |
| "eval_loss": 0.1119714081287384, | |
| "eval_macro_f1": 0.6000477857320852, | |
| "eval_runtime": 419.5757, | |
| "eval_samples_per_second": 881.843, | |
| "eval_steps_per_second": 3.446, | |
| "eval_weighted_f1": 0.9649497278700637, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 2.853757675343769, | |
| "grad_norm": 1.0509530305862427, | |
| "learning_rate": 2.441485068603713e-06, | |
| "loss": 0.0786, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 2.853757675343769, | |
| "eval_accuracy": 0.9707135135135135, | |
| "eval_loss": 0.11158089339733124, | |
| "eval_macro_f1": 0.6009545374695694, | |
| "eval_runtime": 418.9418, | |
| "eval_samples_per_second": 883.178, | |
| "eval_steps_per_second": 3.452, | |
| "eval_weighted_f1": 0.9653056586898462, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 2.940240422035804, | |
| "grad_norm": 0.9345380663871765, | |
| "learning_rate": 1.0002306007148624e-06, | |
| "loss": 0.0789, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 2.940240422035804, | |
| "eval_accuracy": 0.9708837837837838, | |
| "eval_loss": 0.11126039922237396, | |
| "eval_macro_f1": 0.6020869942813024, | |
| "eval_runtime": 419.4331, | |
| "eval_samples_per_second": 882.143, | |
| "eval_steps_per_second": 3.448, | |
| "eval_weighted_f1": 0.9654166847298334, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "step": 17346, | |
| "total_flos": 7.302829698913882e+16, | |
| "train_loss": 0.0, | |
| "train_runtime": 0.0011, | |
| "train_samples_per_second": 3968183378.26, | |
| "train_steps_per_second": 15502748.175 | |
| } | |
| ], | |
| "logging_steps": 500, | |
| "max_steps": 17346, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 7.302829698913882e+16, | |
| "train_batch_size": 128, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |