Instructions to use T0KII/MASRIBERTV4 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use T0KII/MASRIBERTV4 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("fill-mask", model="T0KII/MASRIBERTV4")# Load model directly from transformers import AutoTokenizer, AutoModelForMaskedLM tokenizer = AutoTokenizer.from_pretrained("T0KII/MASRIBERTV4") model = AutoModelForMaskedLM.from_pretrained("T0KII/MASRIBERTV4", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 22500, | |
| "best_metric": 1.4907582998275757, | |
| "best_model_checkpoint": "/kaggle/working/MASRIBERTV4_ckpts/checkpoint-22500", | |
| "epoch": 1.9648455854085687, | |
| "eval_steps": 500, | |
| "global_step": 23000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.02135748152577848, | |
| "grad_norm": 112.14698028564453, | |
| "learning_rate": 1.245e-06, | |
| "loss": 58.53020703125, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.04271496305155696, | |
| "grad_norm": 94.12735748291016, | |
| "learning_rate": 2.4950000000000003e-06, | |
| "loss": 49.33264453125, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.04271496305155696, | |
| "eval_loss": 5.498984336853027, | |
| "eval_runtime": 1927.5234, | |
| "eval_samples_per_second": 40.952, | |
| "eval_steps_per_second": 2.56, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.06407244457733544, | |
| "grad_norm": 90.2774658203125, | |
| "learning_rate": 3.7449999999999997e-06, | |
| "loss": 44.8349609375, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.08542992610311392, | |
| "grad_norm": 95.37772369384766, | |
| "learning_rate": 4.9950000000000005e-06, | |
| "loss": 42.08175390625, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.08542992610311392, | |
| "eval_loss": 4.845311641693115, | |
| "eval_runtime": 1929.6401, | |
| "eval_samples_per_second": 40.907, | |
| "eval_steps_per_second": 2.557, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.1067874076288924, | |
| "grad_norm": 86.53277587890625, | |
| "learning_rate": 6.245e-06, | |
| "loss": 40.29465234375, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.12814488915467087, | |
| "grad_norm": 93.83633422851562, | |
| "learning_rate": 7.495e-06, | |
| "loss": 38.960453125, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.12814488915467087, | |
| "eval_loss": 4.519171714782715, | |
| "eval_runtime": 1928.7805, | |
| "eval_samples_per_second": 40.925, | |
| "eval_steps_per_second": 2.558, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.14950237068044936, | |
| "grad_norm": 81.17627716064453, | |
| "learning_rate": 8.745e-06, | |
| "loss": 37.7989140625, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 0.17085985220622785, | |
| "grad_norm": 84.88935089111328, | |
| "learning_rate": 9.995e-06, | |
| "loss": 36.94516015625, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.17085985220622785, | |
| "eval_loss": 4.303403854370117, | |
| "eval_runtime": 1928.1902, | |
| "eval_samples_per_second": 40.938, | |
| "eval_steps_per_second": 2.559, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.19221733373200633, | |
| "grad_norm": 79.1358413696289, | |
| "learning_rate": 1.1245e-05, | |
| "loss": 36.1753828125, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 0.2135748152577848, | |
| "grad_norm": 85.23380279541016, | |
| "learning_rate": 1.2495000000000001e-05, | |
| "loss": 35.4720703125, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.2135748152577848, | |
| "eval_loss": 4.146875381469727, | |
| "eval_runtime": 1927.7742, | |
| "eval_samples_per_second": 40.947, | |
| "eval_steps_per_second": 2.559, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.23493229678356328, | |
| "grad_norm": 40.744110107421875, | |
| "learning_rate": 1.3725000000000002e-05, | |
| "loss": 17.465578125, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 0.25628977830934174, | |
| "grad_norm": 41.063385009765625, | |
| "learning_rate": 1.4975e-05, | |
| "loss": 17.180029296875, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.25628977830934174, | |
| "eval_loss": 2.0153398513793945, | |
| "eval_runtime": 791.0335, | |
| "eval_samples_per_second": 99.788, | |
| "eval_steps_per_second": 12.474, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.27764725983512023, | |
| "grad_norm": 43.8082275390625, | |
| "learning_rate": 1.6225e-05, | |
| "loss": 16.96137890625, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 0.2990047413608987, | |
| "grad_norm": 41.902591705322266, | |
| "learning_rate": 1.7475e-05, | |
| "loss": 16.6866015625, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.2990047413608987, | |
| "eval_loss": 1.964239239692688, | |
| "eval_runtime": 796.0599, | |
| "eval_samples_per_second": 99.158, | |
| "eval_steps_per_second": 12.395, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.3203622228866772, | |
| "grad_norm": 38.828636169433594, | |
| "learning_rate": 1.8725e-05, | |
| "loss": 16.456845703125, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 0.3417197044124557, | |
| "grad_norm": 43.49476623535156, | |
| "learning_rate": 1.9975e-05, | |
| "loss": 16.399064453125, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.3417197044124557, | |
| "eval_loss": 1.919270396232605, | |
| "eval_runtime": 795.0187, | |
| "eval_samples_per_second": 99.288, | |
| "eval_steps_per_second": 12.411, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.3630771859382342, | |
| "grad_norm": 41.28815460205078, | |
| "learning_rate": 2.1225e-05, | |
| "loss": 16.1804853515625, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 0.38443466746401267, | |
| "grad_norm": 39.76205062866211, | |
| "learning_rate": 2.2475e-05, | |
| "loss": 16.03432421875, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.38443466746401267, | |
| "eval_loss": 1.8889796733856201, | |
| "eval_runtime": 793.8887, | |
| "eval_samples_per_second": 99.43, | |
| "eval_steps_per_second": 12.429, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.4057921489897911, | |
| "grad_norm": 46.443695068359375, | |
| "learning_rate": 2.372e-05, | |
| "loss": 15.8476015625, | |
| "step": 4750 | |
| }, | |
| { | |
| "epoch": 0.4271496305155696, | |
| "grad_norm": 37.068084716796875, | |
| "learning_rate": 2.4970000000000003e-05, | |
| "loss": 15.7752314453125, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.4271496305155696, | |
| "eval_loss": 1.8540898561477661, | |
| "eval_runtime": 762.2328, | |
| "eval_samples_per_second": 103.559, | |
| "eval_steps_per_second": 12.945, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.4485071120413481, | |
| "grad_norm": 38.2252082824707, | |
| "learning_rate": 2.622e-05, | |
| "loss": 15.5765185546875, | |
| "step": 5250 | |
| }, | |
| { | |
| "epoch": 0.46986459356712656, | |
| "grad_norm": 41.708736419677734, | |
| "learning_rate": 2.7470000000000003e-05, | |
| "loss": 15.5412373046875, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.46986459356712656, | |
| "eval_loss": 1.8295842409133911, | |
| "eval_runtime": 763.2977, | |
| "eval_samples_per_second": 103.414, | |
| "eval_steps_per_second": 12.927, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.49122207509290505, | |
| "grad_norm": 41.928775787353516, | |
| "learning_rate": 2.8720000000000003e-05, | |
| "loss": 15.4088125, | |
| "step": 5750 | |
| }, | |
| { | |
| "epoch": 0.5125795566186835, | |
| "grad_norm": 38.48265075683594, | |
| "learning_rate": 2.9970000000000003e-05, | |
| "loss": 15.3675712890625, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.5125795566186835, | |
| "eval_loss": 1.803719401359558, | |
| "eval_runtime": 761.5931, | |
| "eval_samples_per_second": 103.646, | |
| "eval_steps_per_second": 12.956, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.533937038144462, | |
| "grad_norm": 40.2772331237793, | |
| "learning_rate": 3.122e-05, | |
| "loss": 15.1469111328125, | |
| "step": 6250 | |
| }, | |
| { | |
| "epoch": 0.5552945196702405, | |
| "grad_norm": 39.967647552490234, | |
| "learning_rate": 3.247e-05, | |
| "loss": 15.100412109375, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.5552945196702405, | |
| "eval_loss": 1.7818784713745117, | |
| "eval_runtime": 761.6584, | |
| "eval_samples_per_second": 103.637, | |
| "eval_steps_per_second": 12.955, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.576652001196019, | |
| "grad_norm": 38.99542999267578, | |
| "learning_rate": 3.3715000000000005e-05, | |
| "loss": 15.10202734375, | |
| "step": 6750 | |
| }, | |
| { | |
| "epoch": 0.5980094827217974, | |
| "grad_norm": 38.9607048034668, | |
| "learning_rate": 3.4965e-05, | |
| "loss": 14.957875, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.5980094827217974, | |
| "eval_loss": 1.7590579986572266, | |
| "eval_runtime": 763.6639, | |
| "eval_samples_per_second": 103.365, | |
| "eval_steps_per_second": 12.921, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.619366964247576, | |
| "grad_norm": 36.200218200683594, | |
| "learning_rate": 3.6215000000000005e-05, | |
| "loss": 14.8693701171875, | |
| "step": 7250 | |
| }, | |
| { | |
| "epoch": 0.6407244457733544, | |
| "grad_norm": 38.16975402832031, | |
| "learning_rate": 3.7465e-05, | |
| "loss": 14.82056640625, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.6407244457733544, | |
| "eval_loss": 1.7474839687347412, | |
| "eval_runtime": 761.4056, | |
| "eval_samples_per_second": 103.671, | |
| "eval_steps_per_second": 12.959, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.6620819272991328, | |
| "grad_norm": 35.05085372924805, | |
| "learning_rate": 3.8715000000000005e-05, | |
| "loss": 14.679634765625, | |
| "step": 7750 | |
| }, | |
| { | |
| "epoch": 0.6834394088249114, | |
| "grad_norm": 39.50191116333008, | |
| "learning_rate": 3.9965e-05, | |
| "loss": 14.5730966796875, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.6834394088249114, | |
| "eval_loss": 1.731168508529663, | |
| "eval_runtime": 762.2289, | |
| "eval_samples_per_second": 103.559, | |
| "eval_steps_per_second": 12.945, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.7047968903506898, | |
| "grad_norm": 39.16671371459961, | |
| "learning_rate": 4.1215000000000004e-05, | |
| "loss": 14.58540234375, | |
| "step": 8250 | |
| }, | |
| { | |
| "epoch": 0.7261543718764684, | |
| "grad_norm": 35.04971694946289, | |
| "learning_rate": 4.246500000000001e-05, | |
| "loss": 14.4853076171875, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.7261543718764684, | |
| "eval_loss": 1.7171440124511719, | |
| "eval_runtime": 761.2683, | |
| "eval_samples_per_second": 103.69, | |
| "eval_steps_per_second": 12.961, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.7475118534022468, | |
| "grad_norm": 38.985992431640625, | |
| "learning_rate": 4.371e-05, | |
| "loss": 14.4681435546875, | |
| "step": 8750 | |
| }, | |
| { | |
| "epoch": 0.7688693349280253, | |
| "grad_norm": 33.91847610473633, | |
| "learning_rate": 4.496e-05, | |
| "loss": 14.435607421875, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.7688693349280253, | |
| "eval_loss": 1.7089964151382446, | |
| "eval_runtime": 763.3649, | |
| "eval_samples_per_second": 103.405, | |
| "eval_steps_per_second": 12.926, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.7902268164538038, | |
| "grad_norm": 32.30923080444336, | |
| "learning_rate": 4.6210000000000006e-05, | |
| "loss": 14.4067099609375, | |
| "step": 9250 | |
| }, | |
| { | |
| "epoch": 0.8115842979795822, | |
| "grad_norm": 33.230995178222656, | |
| "learning_rate": 4.746e-05, | |
| "loss": 14.2340126953125, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.8115842979795822, | |
| "eval_loss": 1.6928783655166626, | |
| "eval_runtime": 762.4223, | |
| "eval_samples_per_second": 103.533, | |
| "eval_steps_per_second": 12.942, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.8329417795053607, | |
| "grad_norm": 32.932621002197266, | |
| "learning_rate": 4.871e-05, | |
| "loss": 14.249919921875, | |
| "step": 9750 | |
| }, | |
| { | |
| "epoch": 0.8542992610311392, | |
| "grad_norm": 35.00098419189453, | |
| "learning_rate": 4.996e-05, | |
| "loss": 14.2497333984375, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.8542992610311392, | |
| "eval_loss": 1.6808847188949585, | |
| "eval_runtime": 762.5948, | |
| "eval_samples_per_second": 103.51, | |
| "eval_steps_per_second": 12.939, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.8756567425569177, | |
| "grad_norm": 32.668888092041016, | |
| "learning_rate": 4.995984523333273e-05, | |
| "loss": 14.1917099609375, | |
| "step": 10250 | |
| }, | |
| { | |
| "epoch": 0.8970142240826962, | |
| "grad_norm": 30.99444580078125, | |
| "learning_rate": 4.98341665436926e-05, | |
| "loss": 14.165974609375, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.8970142240826962, | |
| "eval_loss": 1.6745405197143555, | |
| "eval_runtime": 763.1023, | |
| "eval_samples_per_second": 103.441, | |
| "eval_steps_per_second": 12.93, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.9183717056084747, | |
| "grad_norm": 33.60852813720703, | |
| "learning_rate": 4.962436288567254e-05, | |
| "loss": 14.04737109375, | |
| "step": 10750 | |
| }, | |
| { | |
| "epoch": 0.9397291871342531, | |
| "grad_norm": 33.550537109375, | |
| "learning_rate": 4.932946882574261e-05, | |
| "loss": 14.0403681640625, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 0.9397291871342531, | |
| "eval_loss": 1.6584335565567017, | |
| "eval_runtime": 762.2171, | |
| "eval_samples_per_second": 103.561, | |
| "eval_steps_per_second": 12.945, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 0.9610866686600316, | |
| "grad_norm": 31.017929077148438, | |
| "learning_rate": 4.895116801751093e-05, | |
| "loss": 14.0180439453125, | |
| "step": 11250 | |
| }, | |
| { | |
| "epoch": 0.9824441501858101, | |
| "grad_norm": 32.50554656982422, | |
| "learning_rate": 4.849075735901174e-05, | |
| "loss": 13.85398828125, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 0.9824441501858101, | |
| "eval_loss": 1.6473965644836426, | |
| "eval_runtime": 761.3432, | |
| "eval_samples_per_second": 103.68, | |
| "eval_steps_per_second": 12.96, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 1.003758916748537, | |
| "grad_norm": 32.66862106323242, | |
| "learning_rate": 4.7949815238831484e-05, | |
| "loss": 13.788498046875, | |
| "step": 11750 | |
| }, | |
| { | |
| "epoch": 1.0251163982743154, | |
| "grad_norm": 34.95535659790039, | |
| "learning_rate": 4.7330196125047005e-05, | |
| "loss": 13.7537568359375, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 1.0251163982743154, | |
| "eval_loss": 1.6361680030822754, | |
| "eval_runtime": 764.657, | |
| "eval_samples_per_second": 103.231, | |
| "eval_steps_per_second": 12.904, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 1.0464738798000939, | |
| "grad_norm": 30.21858787536621, | |
| "learning_rate": 4.663402420770275e-05, | |
| "loss": 13.7448203125, | |
| "step": 12250 | |
| }, | |
| { | |
| "epoch": 1.0678313613258725, | |
| "grad_norm": 31.970226287841797, | |
| "learning_rate": 4.5863686116622025e-05, | |
| "loss": 13.67769921875, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 1.0678313613258725, | |
| "eval_loss": 1.6223485469818115, | |
| "eval_runtime": 762.9231, | |
| "eval_samples_per_second": 103.465, | |
| "eval_steps_per_second": 12.933, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 1.089188842851651, | |
| "grad_norm": 30.448543548583984, | |
| "learning_rate": 4.502182273951718e-05, | |
| "loss": 13.6064111328125, | |
| "step": 12750 | |
| }, | |
| { | |
| "epoch": 1.1105463243774294, | |
| "grad_norm": 31.551868438720703, | |
| "learning_rate": 4.411132016844809e-05, | |
| "loss": 13.5927626953125, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 1.1105463243774294, | |
| "eval_loss": 1.6111470460891724, | |
| "eval_runtime": 662.8254, | |
| "eval_samples_per_second": 119.09, | |
| "eval_steps_per_second": 14.886, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 1.1319038059032078, | |
| "grad_norm": 32.45416259765625, | |
| "learning_rate": 4.313529980566635e-05, | |
| "loss": 13.48468359375, | |
| "step": 13250 | |
| }, | |
| { | |
| "epoch": 1.1532612874289865, | |
| "grad_norm": 31.863527297973633, | |
| "learning_rate": 4.209710766276471e-05, | |
| "loss": 13.452822265625, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 1.1532612874289865, | |
| "eval_loss": 1.6016285419464111, | |
| "eval_runtime": 661.1194, | |
| "eval_samples_per_second": 119.397, | |
| "eval_steps_per_second": 14.925, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 1.174618768954765, | |
| "grad_norm": 30.887378692626953, | |
| "learning_rate": 4.100030288981636e-05, | |
| "loss": 13.4295244140625, | |
| "step": 13750 | |
| }, | |
| { | |
| "epoch": 1.1959762504805433, | |
| "grad_norm": 31.169713973999023, | |
| "learning_rate": 3.984864557382888e-05, | |
| "loss": 13.3582939453125, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.1959762504805433, | |
| "eval_loss": 1.5926363468170166, | |
| "eval_runtime": 662.3077, | |
| "eval_samples_per_second": 119.183, | |
| "eval_steps_per_second": 14.898, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.2173337320063218, | |
| "grad_norm": 29.032123565673828, | |
| "learning_rate": 3.864608384834243e-05, | |
| "loss": 13.3545703125, | |
| "step": 14250 | |
| }, | |
| { | |
| "epoch": 1.2386912135321002, | |
| "grad_norm": 30.015254974365234, | |
| "learning_rate": 3.739674035836306e-05, | |
| "loss": 13.3128515625, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 1.2386912135321002, | |
| "eval_loss": 1.5796525478363037, | |
| "eval_runtime": 662.1395, | |
| "eval_samples_per_second": 119.214, | |
| "eval_steps_per_second": 14.902, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 1.2600486950578786, | |
| "grad_norm": 30.013505935668945, | |
| "learning_rate": 3.6110144329347815e-05, | |
| "loss": 13.2648798828125, | |
| "step": 14750 | |
| }, | |
| { | |
| "epoch": 1.2814061765836573, | |
| "grad_norm": 30.784208297729492, | |
| "learning_rate": 3.478037535477188e-05, | |
| "loss": 13.2260712890625, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.2814061765836573, | |
| "eval_loss": 1.5713889598846436, | |
| "eval_runtime": 662.045, | |
| "eval_samples_per_second": 119.231, | |
| "eval_steps_per_second": 14.904, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.3027636581094357, | |
| "grad_norm": 29.118173599243164, | |
| "learning_rate": 3.341707711117018e-05, | |
| "loss": 13.1651982421875, | |
| "step": 15250 | |
| }, | |
| { | |
| "epoch": 1.3241211396352142, | |
| "grad_norm": 31.14626693725586, | |
| "learning_rate": 3.2024923283540886e-05, | |
| "loss": 13.227046875, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 1.3241211396352142, | |
| "eval_loss": 1.5613423585891724, | |
| "eval_runtime": 662.4802, | |
| "eval_samples_per_second": 119.152, | |
| "eval_steps_per_second": 14.894, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 1.3454786211609928, | |
| "grad_norm": 28.750076293945312, | |
| "learning_rate": 3.060868648014479e-05, | |
| "loss": 13.0909404296875, | |
| "step": 15750 | |
| }, | |
| { | |
| "epoch": 1.3668361026867712, | |
| "grad_norm": 28.854137420654297, | |
| "learning_rate": 2.9173221870958793e-05, | |
| "loss": 13.083611328125, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.3668361026867712, | |
| "eval_loss": 1.556220531463623, | |
| "eval_runtime": 661.5946, | |
| "eval_samples_per_second": 119.312, | |
| "eval_steps_per_second": 14.914, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.3881935842125497, | |
| "grad_norm": 31.851211547851562, | |
| "learning_rate": 2.772345054308973e-05, | |
| "loss": 13.021517578125, | |
| "step": 16250 | |
| }, | |
| { | |
| "epoch": 1.4095510657383281, | |
| "grad_norm": 29.31368637084961, | |
| "learning_rate": 2.627019103801507e-05, | |
| "loss": 13.0297548828125, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 1.4095510657383281, | |
| "eval_loss": 1.5463231801986694, | |
| "eval_runtime": 661.3847, | |
| "eval_samples_per_second": 119.35, | |
| "eval_steps_per_second": 14.919, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 1.4309085472641065, | |
| "grad_norm": 29.341651916503906, | |
| "learning_rate": 2.4806756029750566e-05, | |
| "loss": 12.9520859375, | |
| "step": 16750 | |
| }, | |
| { | |
| "epoch": 1.452266028789885, | |
| "grad_norm": 31.251237869262695, | |
| "learning_rate": 2.334398350414455e-05, | |
| "loss": 12.9825966796875, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.452266028789885, | |
| "eval_loss": 1.5360182523727417, | |
| "eval_runtime": 661.9359, | |
| "eval_samples_per_second": 119.25, | |
| "eval_steps_per_second": 14.906, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.4736235103156636, | |
| "grad_norm": 30.922067642211914, | |
| "learning_rate": 2.1886888165822918e-05, | |
| "loss": 12.903462890625, | |
| "step": 17250 | |
| }, | |
| { | |
| "epoch": 1.494980991841442, | |
| "grad_norm": 30.14403533935547, | |
| "learning_rate": 2.044046525677002e-05, | |
| "loss": 12.9177880859375, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 1.494980991841442, | |
| "eval_loss": 1.5266560316085815, | |
| "eval_runtime": 662.8613, | |
| "eval_samples_per_second": 119.084, | |
| "eval_steps_per_second": 14.885, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 1.5163384733672205, | |
| "grad_norm": 31.758607864379883, | |
| "learning_rate": 1.9009673431544938e-05, | |
| "loss": 12.86377734375, | |
| "step": 17750 | |
| }, | |
| { | |
| "epoch": 1.5376959548929992, | |
| "grad_norm": 30.95867347717285, | |
| "learning_rate": 1.7599417757927578e-05, | |
| "loss": 12.821025390625, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.5376959548929992, | |
| "eval_loss": 1.5217604637145996, | |
| "eval_runtime": 660.6619, | |
| "eval_samples_per_second": 119.48, | |
| "eval_steps_per_second": 14.935, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.5590534364187776, | |
| "grad_norm": 30.812349319458008, | |
| "learning_rate": 1.6214532901271817e-05, | |
| "loss": 12.7918310546875, | |
| "step": 18250 | |
| }, | |
| { | |
| "epoch": 1.580410917944556, | |
| "grad_norm": 31.66985321044922, | |
| "learning_rate": 1.4859766550213754e-05, | |
| "loss": 12.7591337890625, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 1.580410917944556, | |
| "eval_loss": 1.5172350406646729, | |
| "eval_runtime": 661.9672, | |
| "eval_samples_per_second": 119.245, | |
| "eval_steps_per_second": 14.906, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 1.6017683994703344, | |
| "grad_norm": 30.236459732055664, | |
| "learning_rate": 1.3539763140555073e-05, | |
| "loss": 12.7556533203125, | |
| "step": 18750 | |
| }, | |
| { | |
| "epoch": 1.6231258809961129, | |
| "grad_norm": 31.713998794555664, | |
| "learning_rate": 1.2259047933119822e-05, | |
| "loss": 12.7103583984375, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 1.6231258809961129, | |
| "eval_loss": 1.5090234279632568, | |
| "eval_runtime": 660.882, | |
| "eval_samples_per_second": 119.44, | |
| "eval_steps_per_second": 14.93, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 1.6444833625218913, | |
| "grad_norm": 30.063196182250977, | |
| "learning_rate": 1.1022011500169055e-05, | |
| "loss": 12.6835615234375, | |
| "step": 19250 | |
| }, | |
| { | |
| "epoch": 1.6658408440476697, | |
| "grad_norm": 32.952205657958984, | |
| "learning_rate": 9.83289467355745e-06, | |
| "loss": 12.618287109375, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 1.6658408440476697, | |
| "eval_loss": 1.5055655241012573, | |
| "eval_runtime": 663.4281, | |
| "eval_samples_per_second": 118.982, | |
| "eval_steps_per_second": 14.873, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 1.6871983255734484, | |
| "grad_norm": 28.919445037841797, | |
| "learning_rate": 8.700213683961264e-06, | |
| "loss": 12.6425283203125, | |
| "step": 19750 | |
| }, | |
| { | |
| "epoch": 1.7085558070992268, | |
| "grad_norm": 30.94468879699707, | |
| "learning_rate": 7.618756381047296e-06, | |
| "loss": 12.5794033203125, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 1.7085558070992268, | |
| "eval_loss": 1.5013396739959717, | |
| "eval_runtime": 662.8883, | |
| "eval_samples_per_second": 119.079, | |
| "eval_steps_per_second": 14.885, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 1.7299132886250055, | |
| "grad_norm": 29.671031951904297, | |
| "learning_rate": 6.596885788475471e-06, | |
| "loss": 12.6140634765625, | |
| "step": 20250 | |
| }, | |
| { | |
| "epoch": 1.751270770150784, | |
| "grad_norm": 29.66603660583496, | |
| "learning_rate": 5.6381051024693405e-06, | |
| "loss": 12.59630859375, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 1.751270770150784, | |
| "eval_loss": 1.4975762367248535, | |
| "eval_runtime": 660.2172, | |
| "eval_samples_per_second": 119.561, | |
| "eval_steps_per_second": 14.945, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 1.7726282516765623, | |
| "grad_norm": 32.586578369140625, | |
| "learning_rate": 4.745701233233446e-06, | |
| "loss": 12.6129345703125, | |
| "step": 20750 | |
| }, | |
| { | |
| "epoch": 1.7939857332023408, | |
| "grad_norm": 31.325742721557617, | |
| "learning_rate": 3.922733536705156e-06, | |
| "loss": 12.5139658203125, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.7939857332023408, | |
| "eval_loss": 1.4922269582748413, | |
| "eval_runtime": 662.5754, | |
| "eval_samples_per_second": 119.135, | |
| "eval_steps_per_second": 14.892, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.8153432147281192, | |
| "grad_norm": 30.204561233520508, | |
| "learning_rate": 3.1720233264123627e-06, | |
| "loss": 12.5135751953125, | |
| "step": 21250 | |
| }, | |
| { | |
| "epoch": 1.8367006962538976, | |
| "grad_norm": 30.57643699645996, | |
| "learning_rate": 2.496144201392764e-06, | |
| "loss": 12.489501953125, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 1.8367006962538976, | |
| "eval_loss": 1.4932215213775635, | |
| "eval_runtime": 661.5906, | |
| "eval_samples_per_second": 119.312, | |
| "eval_steps_per_second": 14.914, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 1.858058177779676, | |
| "grad_norm": 29.63056182861328, | |
| "learning_rate": 1.8974132233326115e-06, | |
| "loss": 12.557375, | |
| "step": 21750 | |
| }, | |
| { | |
| "epoch": 1.8794156593054547, | |
| "grad_norm": 31.004108428955078, | |
| "learning_rate": 1.3778829731717153e-06, | |
| "loss": 12.4930595703125, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 1.8794156593054547, | |
| "eval_loss": 1.4914369583129883, | |
| "eval_runtime": 672.4142, | |
| "eval_samples_per_second": 117.392, | |
| "eval_steps_per_second": 14.674, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 1.9007731408312332, | |
| "grad_norm": 30.86151695251465, | |
| "learning_rate": 9.393345144063953e-07, | |
| "loss": 12.465453125, | |
| "step": 22250 | |
| }, | |
| { | |
| "epoch": 1.9221306223570118, | |
| "grad_norm": 30.976634979248047, | |
| "learning_rate": 5.845295167747261e-07, | |
| "loss": 12.568541015625, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 1.9221306223570118, | |
| "eval_loss": 1.4907582998275757, | |
| "eval_runtime": 672.7617, | |
| "eval_samples_per_second": 117.331, | |
| "eval_steps_per_second": 14.666, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 1.9434881038827903, | |
| "grad_norm": 29.964256286621094, | |
| "learning_rate": 3.1183530787943507e-07, | |
| "loss": 12.4957490234375, | |
| "step": 22750 | |
| }, | |
| { | |
| "epoch": 1.9648455854085687, | |
| "grad_norm": 30.462421417236328, | |
| "learning_rate": 1.2377753528518553e-07, | |
| "loss": 12.4823271484375, | |
| "step": 23000 | |
| }, | |
| { | |
| "epoch": 1.9648455854085687, | |
| "eval_loss": 1.4928914308547974, | |
| "eval_runtime": 673.6448, | |
| "eval_samples_per_second": 117.177, | |
| "eval_steps_per_second": 14.647, | |
| "step": 23000 | |
| } | |
| ], | |
| "logging_steps": 250, | |
| "max_steps": 23412, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 7.354757438293279e+17, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |