{ "best_global_step": 21000, "best_metric": 1.4922269582748413, "best_model_checkpoint": "/kaggle/working/MASRIBERTV4_ckpts/checkpoint-21000", "epoch": 1.7939857332023408, "eval_steps": 500, "global_step": 21000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02135748152577848, "grad_norm": 112.14698028564453, "learning_rate": 1.245e-06, "loss": 58.53020703125, "step": 250 }, { "epoch": 0.04271496305155696, "grad_norm": 94.12735748291016, "learning_rate": 2.4950000000000003e-06, "loss": 49.33264453125, "step": 500 }, { "epoch": 0.04271496305155696, "eval_loss": 5.498984336853027, "eval_runtime": 1927.5234, "eval_samples_per_second": 40.952, "eval_steps_per_second": 2.56, "step": 500 }, { "epoch": 0.06407244457733544, "grad_norm": 90.2774658203125, "learning_rate": 3.7449999999999997e-06, "loss": 44.8349609375, "step": 750 }, { "epoch": 0.08542992610311392, "grad_norm": 95.37772369384766, "learning_rate": 4.9950000000000005e-06, "loss": 42.08175390625, "step": 1000 }, { "epoch": 0.08542992610311392, "eval_loss": 4.845311641693115, "eval_runtime": 1929.6401, "eval_samples_per_second": 40.907, "eval_steps_per_second": 2.557, "step": 1000 }, { "epoch": 0.1067874076288924, "grad_norm": 86.53277587890625, "learning_rate": 6.245e-06, "loss": 40.29465234375, "step": 1250 }, { "epoch": 0.12814488915467087, "grad_norm": 93.83633422851562, "learning_rate": 7.495e-06, "loss": 38.960453125, "step": 1500 }, { "epoch": 0.12814488915467087, "eval_loss": 4.519171714782715, "eval_runtime": 1928.7805, "eval_samples_per_second": 40.925, "eval_steps_per_second": 2.558, "step": 1500 }, { "epoch": 0.14950237068044936, "grad_norm": 81.17627716064453, "learning_rate": 8.745e-06, "loss": 37.7989140625, "step": 1750 }, { "epoch": 0.17085985220622785, "grad_norm": 84.88935089111328, "learning_rate": 9.995e-06, "loss": 36.94516015625, "step": 2000 }, { "epoch": 0.17085985220622785, "eval_loss": 4.303403854370117, "eval_runtime": 1928.1902, "eval_samples_per_second": 40.938, "eval_steps_per_second": 2.559, "step": 2000 }, { "epoch": 0.19221733373200633, "grad_norm": 79.1358413696289, "learning_rate": 1.1245e-05, "loss": 36.1753828125, "step": 2250 }, { "epoch": 0.2135748152577848, "grad_norm": 85.23380279541016, "learning_rate": 1.2495000000000001e-05, "loss": 35.4720703125, "step": 2500 }, { "epoch": 0.2135748152577848, "eval_loss": 4.146875381469727, "eval_runtime": 1927.7742, "eval_samples_per_second": 40.947, "eval_steps_per_second": 2.559, "step": 2500 }, { "epoch": 0.23493229678356328, "grad_norm": 40.744110107421875, "learning_rate": 1.3725000000000002e-05, "loss": 17.465578125, "step": 2750 }, { "epoch": 0.25628977830934174, "grad_norm": 41.063385009765625, "learning_rate": 1.4975e-05, "loss": 17.180029296875, "step": 3000 }, { "epoch": 0.25628977830934174, "eval_loss": 2.0153398513793945, "eval_runtime": 791.0335, "eval_samples_per_second": 99.788, "eval_steps_per_second": 12.474, "step": 3000 }, { "epoch": 0.27764725983512023, "grad_norm": 43.8082275390625, "learning_rate": 1.6225e-05, "loss": 16.96137890625, "step": 3250 }, { "epoch": 0.2990047413608987, "grad_norm": 41.902591705322266, "learning_rate": 1.7475e-05, "loss": 16.6866015625, "step": 3500 }, { "epoch": 0.2990047413608987, "eval_loss": 1.964239239692688, "eval_runtime": 796.0599, "eval_samples_per_second": 99.158, "eval_steps_per_second": 12.395, "step": 3500 }, { "epoch": 0.3203622228866772, "grad_norm": 38.828636169433594, "learning_rate": 1.8725e-05, "loss": 16.456845703125, "step": 3750 }, { "epoch": 0.3417197044124557, "grad_norm": 43.49476623535156, "learning_rate": 1.9975e-05, "loss": 16.399064453125, "step": 4000 }, { "epoch": 0.3417197044124557, "eval_loss": 1.919270396232605, "eval_runtime": 795.0187, "eval_samples_per_second": 99.288, "eval_steps_per_second": 12.411, "step": 4000 }, { "epoch": 0.3630771859382342, "grad_norm": 41.28815460205078, "learning_rate": 2.1225e-05, "loss": 16.1804853515625, "step": 4250 }, { "epoch": 0.38443466746401267, "grad_norm": 39.76205062866211, "learning_rate": 2.2475e-05, "loss": 16.03432421875, "step": 4500 }, { "epoch": 0.38443466746401267, "eval_loss": 1.8889796733856201, "eval_runtime": 793.8887, "eval_samples_per_second": 99.43, "eval_steps_per_second": 12.429, "step": 4500 }, { "epoch": 0.4057921489897911, "grad_norm": 46.443695068359375, "learning_rate": 2.372e-05, "loss": 15.8476015625, "step": 4750 }, { "epoch": 0.4271496305155696, "grad_norm": 37.068084716796875, "learning_rate": 2.4970000000000003e-05, "loss": 15.7752314453125, "step": 5000 }, { "epoch": 0.4271496305155696, "eval_loss": 1.8540898561477661, "eval_runtime": 762.2328, "eval_samples_per_second": 103.559, "eval_steps_per_second": 12.945, "step": 5000 }, { "epoch": 0.4485071120413481, "grad_norm": 38.2252082824707, "learning_rate": 2.622e-05, "loss": 15.5765185546875, "step": 5250 }, { "epoch": 0.46986459356712656, "grad_norm": 41.708736419677734, "learning_rate": 2.7470000000000003e-05, "loss": 15.5412373046875, "step": 5500 }, { "epoch": 0.46986459356712656, "eval_loss": 1.8295842409133911, "eval_runtime": 763.2977, "eval_samples_per_second": 103.414, "eval_steps_per_second": 12.927, "step": 5500 }, { "epoch": 0.49122207509290505, "grad_norm": 41.928775787353516, "learning_rate": 2.8720000000000003e-05, "loss": 15.4088125, "step": 5750 }, { "epoch": 0.5125795566186835, "grad_norm": 38.48265075683594, "learning_rate": 2.9970000000000003e-05, "loss": 15.3675712890625, "step": 6000 }, { "epoch": 0.5125795566186835, "eval_loss": 1.803719401359558, "eval_runtime": 761.5931, "eval_samples_per_second": 103.646, "eval_steps_per_second": 12.956, "step": 6000 }, { "epoch": 0.533937038144462, "grad_norm": 40.2772331237793, "learning_rate": 3.122e-05, "loss": 15.1469111328125, "step": 6250 }, { "epoch": 0.5552945196702405, "grad_norm": 39.967647552490234, "learning_rate": 3.247e-05, "loss": 15.100412109375, "step": 6500 }, { "epoch": 0.5552945196702405, "eval_loss": 1.7818784713745117, "eval_runtime": 761.6584, "eval_samples_per_second": 103.637, "eval_steps_per_second": 12.955, "step": 6500 }, { "epoch": 0.576652001196019, "grad_norm": 38.99542999267578, "learning_rate": 3.3715000000000005e-05, "loss": 15.10202734375, "step": 6750 }, { "epoch": 0.5980094827217974, "grad_norm": 38.9607048034668, "learning_rate": 3.4965e-05, "loss": 14.957875, "step": 7000 }, { "epoch": 0.5980094827217974, "eval_loss": 1.7590579986572266, "eval_runtime": 763.6639, "eval_samples_per_second": 103.365, "eval_steps_per_second": 12.921, "step": 7000 }, { "epoch": 0.619366964247576, "grad_norm": 36.200218200683594, "learning_rate": 3.6215000000000005e-05, "loss": 14.8693701171875, "step": 7250 }, { "epoch": 0.6407244457733544, "grad_norm": 38.16975402832031, "learning_rate": 3.7465e-05, "loss": 14.82056640625, "step": 7500 }, { "epoch": 0.6407244457733544, "eval_loss": 1.7474839687347412, "eval_runtime": 761.4056, "eval_samples_per_second": 103.671, "eval_steps_per_second": 12.959, "step": 7500 }, { "epoch": 0.6620819272991328, "grad_norm": 35.05085372924805, "learning_rate": 3.8715000000000005e-05, "loss": 14.679634765625, "step": 7750 }, { "epoch": 0.6834394088249114, "grad_norm": 39.50191116333008, "learning_rate": 3.9965e-05, "loss": 14.5730966796875, "step": 8000 }, { "epoch": 0.6834394088249114, "eval_loss": 1.731168508529663, "eval_runtime": 762.2289, "eval_samples_per_second": 103.559, "eval_steps_per_second": 12.945, "step": 8000 }, { "epoch": 0.7047968903506898, "grad_norm": 39.16671371459961, "learning_rate": 4.1215000000000004e-05, "loss": 14.58540234375, "step": 8250 }, { "epoch": 0.7261543718764684, "grad_norm": 35.04971694946289, "learning_rate": 4.246500000000001e-05, "loss": 14.4853076171875, "step": 8500 }, { "epoch": 0.7261543718764684, "eval_loss": 1.7171440124511719, "eval_runtime": 761.2683, "eval_samples_per_second": 103.69, "eval_steps_per_second": 12.961, "step": 8500 }, { "epoch": 0.7475118534022468, "grad_norm": 38.985992431640625, "learning_rate": 4.371e-05, "loss": 14.4681435546875, "step": 8750 }, { "epoch": 0.7688693349280253, "grad_norm": 33.91847610473633, "learning_rate": 4.496e-05, "loss": 14.435607421875, "step": 9000 }, { "epoch": 0.7688693349280253, "eval_loss": 1.7089964151382446, "eval_runtime": 763.3649, "eval_samples_per_second": 103.405, "eval_steps_per_second": 12.926, "step": 9000 }, { "epoch": 0.7902268164538038, "grad_norm": 32.30923080444336, "learning_rate": 4.6210000000000006e-05, "loss": 14.4067099609375, "step": 9250 }, { "epoch": 0.8115842979795822, "grad_norm": 33.230995178222656, "learning_rate": 4.746e-05, "loss": 14.2340126953125, "step": 9500 }, { "epoch": 0.8115842979795822, "eval_loss": 1.6928783655166626, "eval_runtime": 762.4223, "eval_samples_per_second": 103.533, "eval_steps_per_second": 12.942, "step": 9500 }, { "epoch": 0.8329417795053607, "grad_norm": 32.932621002197266, "learning_rate": 4.871e-05, "loss": 14.249919921875, "step": 9750 }, { "epoch": 0.8542992610311392, "grad_norm": 35.00098419189453, "learning_rate": 4.996e-05, "loss": 14.2497333984375, "step": 10000 }, { "epoch": 0.8542992610311392, "eval_loss": 1.6808847188949585, "eval_runtime": 762.5948, "eval_samples_per_second": 103.51, "eval_steps_per_second": 12.939, "step": 10000 }, { "epoch": 0.8756567425569177, "grad_norm": 32.668888092041016, "learning_rate": 4.995984523333273e-05, "loss": 14.1917099609375, "step": 10250 }, { "epoch": 0.8970142240826962, "grad_norm": 30.99444580078125, "learning_rate": 4.98341665436926e-05, "loss": 14.165974609375, "step": 10500 }, { "epoch": 0.8970142240826962, "eval_loss": 1.6745405197143555, "eval_runtime": 763.1023, "eval_samples_per_second": 103.441, "eval_steps_per_second": 12.93, "step": 10500 }, { "epoch": 0.9183717056084747, "grad_norm": 33.60852813720703, "learning_rate": 4.962436288567254e-05, "loss": 14.04737109375, "step": 10750 }, { "epoch": 0.9397291871342531, "grad_norm": 33.550537109375, "learning_rate": 4.932946882574261e-05, "loss": 14.0403681640625, "step": 11000 }, { "epoch": 0.9397291871342531, "eval_loss": 1.6584335565567017, "eval_runtime": 762.2171, "eval_samples_per_second": 103.561, "eval_steps_per_second": 12.945, "step": 11000 }, { "epoch": 0.9610866686600316, "grad_norm": 31.017929077148438, "learning_rate": 4.895116801751093e-05, "loss": 14.0180439453125, "step": 11250 }, { "epoch": 0.9824441501858101, "grad_norm": 32.50554656982422, "learning_rate": 4.849075735901174e-05, "loss": 13.85398828125, "step": 11500 }, { "epoch": 0.9824441501858101, "eval_loss": 1.6473965644836426, "eval_runtime": 761.3432, "eval_samples_per_second": 103.68, "eval_steps_per_second": 12.96, "step": 11500 }, { "epoch": 1.003758916748537, "grad_norm": 32.66862106323242, "learning_rate": 4.7949815238831484e-05, "loss": 13.788498046875, "step": 11750 }, { "epoch": 1.0251163982743154, "grad_norm": 34.95535659790039, "learning_rate": 4.7330196125047005e-05, "loss": 13.7537568359375, "step": 12000 }, { "epoch": 1.0251163982743154, "eval_loss": 1.6361680030822754, "eval_runtime": 764.657, "eval_samples_per_second": 103.231, "eval_steps_per_second": 12.904, "step": 12000 }, { "epoch": 1.0464738798000939, "grad_norm": 30.21858787536621, "learning_rate": 4.663402420770275e-05, "loss": 13.7448203125, "step": 12250 }, { "epoch": 1.0678313613258725, "grad_norm": 31.970226287841797, "learning_rate": 4.5863686116622025e-05, "loss": 13.67769921875, "step": 12500 }, { "epoch": 1.0678313613258725, "eval_loss": 1.6223485469818115, "eval_runtime": 762.9231, "eval_samples_per_second": 103.465, "eval_steps_per_second": 12.933, "step": 12500 }, { "epoch": 1.089188842851651, "grad_norm": 30.448543548583984, "learning_rate": 4.502182273951718e-05, "loss": 13.6064111328125, "step": 12750 }, { "epoch": 1.1105463243774294, "grad_norm": 31.551868438720703, "learning_rate": 4.411132016844809e-05, "loss": 13.5927626953125, "step": 13000 }, { "epoch": 1.1105463243774294, "eval_loss": 1.6111470460891724, "eval_runtime": 662.8254, "eval_samples_per_second": 119.09, "eval_steps_per_second": 14.886, "step": 13000 }, { "epoch": 1.1319038059032078, "grad_norm": 32.45416259765625, "learning_rate": 4.313529980566635e-05, "loss": 13.48468359375, "step": 13250 }, { "epoch": 1.1532612874289865, "grad_norm": 31.863527297973633, "learning_rate": 4.209710766276471e-05, "loss": 13.452822265625, "step": 13500 }, { "epoch": 1.1532612874289865, "eval_loss": 1.6016285419464111, "eval_runtime": 661.1194, "eval_samples_per_second": 119.397, "eval_steps_per_second": 14.925, "step": 13500 }, { "epoch": 1.174618768954765, "grad_norm": 30.887378692626953, "learning_rate": 4.100030288981636e-05, "loss": 13.4295244140625, "step": 13750 }, { "epoch": 1.1959762504805433, "grad_norm": 31.169713973999023, "learning_rate": 3.984864557382888e-05, "loss": 13.3582939453125, "step": 14000 }, { "epoch": 1.1959762504805433, "eval_loss": 1.5926363468170166, "eval_runtime": 662.3077, "eval_samples_per_second": 119.183, "eval_steps_per_second": 14.898, "step": 14000 }, { "epoch": 1.2173337320063218, "grad_norm": 29.032123565673828, "learning_rate": 3.864608384834243e-05, "loss": 13.3545703125, "step": 14250 }, { "epoch": 1.2386912135321002, "grad_norm": 30.015254974365234, "learning_rate": 3.739674035836306e-05, "loss": 13.3128515625, "step": 14500 }, { "epoch": 1.2386912135321002, "eval_loss": 1.5796525478363037, "eval_runtime": 662.1395, "eval_samples_per_second": 119.214, "eval_steps_per_second": 14.902, "step": 14500 }, { "epoch": 1.2600486950578786, "grad_norm": 30.013505935668945, "learning_rate": 3.6110144329347815e-05, "loss": 13.2648798828125, "step": 14750 }, { "epoch": 1.2814061765836573, "grad_norm": 30.784208297729492, "learning_rate": 3.478037535477188e-05, "loss": 13.2260712890625, "step": 15000 }, { "epoch": 1.2814061765836573, "eval_loss": 1.5713889598846436, "eval_runtime": 662.045, "eval_samples_per_second": 119.231, "eval_steps_per_second": 14.904, "step": 15000 }, { "epoch": 1.3027636581094357, "grad_norm": 29.118173599243164, "learning_rate": 3.341707711117018e-05, "loss": 13.1651982421875, "step": 15250 }, { "epoch": 1.3241211396352142, "grad_norm": 31.14626693725586, "learning_rate": 3.2024923283540886e-05, "loss": 13.227046875, "step": 15500 }, { "epoch": 1.3241211396352142, "eval_loss": 1.5613423585891724, "eval_runtime": 662.4802, "eval_samples_per_second": 119.152, "eval_steps_per_second": 14.894, "step": 15500 }, { "epoch": 1.3454786211609928, "grad_norm": 28.750076293945312, "learning_rate": 3.060868648014479e-05, "loss": 13.0909404296875, "step": 15750 }, { "epoch": 1.3668361026867712, "grad_norm": 28.854137420654297, "learning_rate": 2.9173221870958793e-05, "loss": 13.083611328125, "step": 16000 }, { "epoch": 1.3668361026867712, "eval_loss": 1.556220531463623, "eval_runtime": 661.5946, "eval_samples_per_second": 119.312, "eval_steps_per_second": 14.914, "step": 16000 }, { "epoch": 1.3881935842125497, "grad_norm": 31.851211547851562, "learning_rate": 2.772345054308973e-05, "loss": 13.021517578125, "step": 16250 }, { "epoch": 1.4095510657383281, "grad_norm": 29.31368637084961, "learning_rate": 2.627019103801507e-05, "loss": 13.0297548828125, "step": 16500 }, { "epoch": 1.4095510657383281, "eval_loss": 1.5463231801986694, "eval_runtime": 661.3847, "eval_samples_per_second": 119.35, "eval_steps_per_second": 14.919, "step": 16500 }, { "epoch": 1.4309085472641065, "grad_norm": 29.341651916503906, "learning_rate": 2.4806756029750566e-05, "loss": 12.9520859375, "step": 16750 }, { "epoch": 1.452266028789885, "grad_norm": 31.251237869262695, "learning_rate": 2.334398350414455e-05, "loss": 12.9825966796875, "step": 17000 }, { "epoch": 1.452266028789885, "eval_loss": 1.5360182523727417, "eval_runtime": 661.9359, "eval_samples_per_second": 119.25, "eval_steps_per_second": 14.906, "step": 17000 }, { "epoch": 1.4736235103156636, "grad_norm": 30.922067642211914, "learning_rate": 2.1886888165822918e-05, "loss": 12.903462890625, "step": 17250 }, { "epoch": 1.494980991841442, "grad_norm": 30.14403533935547, "learning_rate": 2.044046525677002e-05, "loss": 12.9177880859375, "step": 17500 }, { "epoch": 1.494980991841442, "eval_loss": 1.5266560316085815, "eval_runtime": 662.8613, "eval_samples_per_second": 119.084, "eval_steps_per_second": 14.885, "step": 17500 }, { "epoch": 1.5163384733672205, "grad_norm": 31.758607864379883, "learning_rate": 1.9009673431544938e-05, "loss": 12.86377734375, "step": 17750 }, { "epoch": 1.5376959548929992, "grad_norm": 30.95867347717285, "learning_rate": 1.7599417757927578e-05, "loss": 12.821025390625, "step": 18000 }, { "epoch": 1.5376959548929992, "eval_loss": 1.5217604637145996, "eval_runtime": 660.6619, "eval_samples_per_second": 119.48, "eval_steps_per_second": 14.935, "step": 18000 }, { "epoch": 1.5590534364187776, "grad_norm": 30.812349319458008, "learning_rate": 1.6214532901271817e-05, "loss": 12.7918310546875, "step": 18250 }, { "epoch": 1.580410917944556, "grad_norm": 31.66985321044922, "learning_rate": 1.4859766550213754e-05, "loss": 12.7591337890625, "step": 18500 }, { "epoch": 1.580410917944556, "eval_loss": 1.5172350406646729, "eval_runtime": 661.9672, "eval_samples_per_second": 119.245, "eval_steps_per_second": 14.906, "step": 18500 }, { "epoch": 1.6017683994703344, "grad_norm": 30.236459732055664, "learning_rate": 1.3539763140555073e-05, "loss": 12.7556533203125, "step": 18750 }, { "epoch": 1.6231258809961129, "grad_norm": 31.713998794555664, "learning_rate": 1.2259047933119822e-05, "loss": 12.7103583984375, "step": 19000 }, { "epoch": 1.6231258809961129, "eval_loss": 1.5090234279632568, "eval_runtime": 660.882, "eval_samples_per_second": 119.44, "eval_steps_per_second": 14.93, "step": 19000 }, { "epoch": 1.6444833625218913, "grad_norm": 30.063196182250977, "learning_rate": 1.1022011500169055e-05, "loss": 12.6835615234375, "step": 19250 }, { "epoch": 1.6658408440476697, "grad_norm": 32.952205657958984, "learning_rate": 9.83289467355745e-06, "loss": 12.618287109375, "step": 19500 }, { "epoch": 1.6658408440476697, "eval_loss": 1.5055655241012573, "eval_runtime": 663.4281, "eval_samples_per_second": 118.982, "eval_steps_per_second": 14.873, "step": 19500 }, { "epoch": 1.6871983255734484, "grad_norm": 28.919445037841797, "learning_rate": 8.700213683961264e-06, "loss": 12.6425283203125, "step": 19750 }, { "epoch": 1.7085558070992268, "grad_norm": 30.94468879699707, "learning_rate": 7.618756381047296e-06, "loss": 12.5794033203125, "step": 20000 }, { "epoch": 1.7085558070992268, "eval_loss": 1.5013396739959717, "eval_runtime": 662.8883, "eval_samples_per_second": 119.079, "eval_steps_per_second": 14.885, "step": 20000 }, { "epoch": 1.7299132886250055, "grad_norm": 29.671031951904297, "learning_rate": 6.596885788475471e-06, "loss": 12.6140634765625, "step": 20250 }, { "epoch": 1.751270770150784, "grad_norm": 29.66603660583496, "learning_rate": 5.6381051024693405e-06, "loss": 12.59630859375, "step": 20500 }, { "epoch": 1.751270770150784, "eval_loss": 1.4975762367248535, "eval_runtime": 660.2172, "eval_samples_per_second": 119.561, "eval_steps_per_second": 14.945, "step": 20500 }, { "epoch": 1.7726282516765623, "grad_norm": 32.586578369140625, "learning_rate": 4.745701233233446e-06, "loss": 12.6129345703125, "step": 20750 }, { "epoch": 1.7939857332023408, "grad_norm": 31.325742721557617, "learning_rate": 3.922733536705156e-06, "loss": 12.5139658203125, "step": 21000 }, { "epoch": 1.7939857332023408, "eval_loss": 1.4922269582748413, "eval_runtime": 662.5754, "eval_samples_per_second": 119.135, "eval_steps_per_second": 14.892, "step": 21000 } ], "logging_steps": 250, "max_steps": 23412, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.715198975296799e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }