MASRIBERTV4 / checkpoint-21500 /trainer_state.json
T0KII's picture
Training in progress, step 21500, checkpoint
aadf452 verified
Raw
History Blame Contribute Delete
25.9 kB
{
"best_global_step": 21000,
"best_metric": 1.4922269582748413,
"best_model_checkpoint": "/kaggle/working/MASRIBERTV4_ckpts/checkpoint-21000",
"epoch": 1.8367006962538976,
"eval_steps": 500,
"global_step": 21500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02135748152577848,
"grad_norm": 112.14698028564453,
"learning_rate": 1.245e-06,
"loss": 58.53020703125,
"step": 250
},
{
"epoch": 0.04271496305155696,
"grad_norm": 94.12735748291016,
"learning_rate": 2.4950000000000003e-06,
"loss": 49.33264453125,
"step": 500
},
{
"epoch": 0.04271496305155696,
"eval_loss": 5.498984336853027,
"eval_runtime": 1927.5234,
"eval_samples_per_second": 40.952,
"eval_steps_per_second": 2.56,
"step": 500
},
{
"epoch": 0.06407244457733544,
"grad_norm": 90.2774658203125,
"learning_rate": 3.7449999999999997e-06,
"loss": 44.8349609375,
"step": 750
},
{
"epoch": 0.08542992610311392,
"grad_norm": 95.37772369384766,
"learning_rate": 4.9950000000000005e-06,
"loss": 42.08175390625,
"step": 1000
},
{
"epoch": 0.08542992610311392,
"eval_loss": 4.845311641693115,
"eval_runtime": 1929.6401,
"eval_samples_per_second": 40.907,
"eval_steps_per_second": 2.557,
"step": 1000
},
{
"epoch": 0.1067874076288924,
"grad_norm": 86.53277587890625,
"learning_rate": 6.245e-06,
"loss": 40.29465234375,
"step": 1250
},
{
"epoch": 0.12814488915467087,
"grad_norm": 93.83633422851562,
"learning_rate": 7.495e-06,
"loss": 38.960453125,
"step": 1500
},
{
"epoch": 0.12814488915467087,
"eval_loss": 4.519171714782715,
"eval_runtime": 1928.7805,
"eval_samples_per_second": 40.925,
"eval_steps_per_second": 2.558,
"step": 1500
},
{
"epoch": 0.14950237068044936,
"grad_norm": 81.17627716064453,
"learning_rate": 8.745e-06,
"loss": 37.7989140625,
"step": 1750
},
{
"epoch": 0.17085985220622785,
"grad_norm": 84.88935089111328,
"learning_rate": 9.995e-06,
"loss": 36.94516015625,
"step": 2000
},
{
"epoch": 0.17085985220622785,
"eval_loss": 4.303403854370117,
"eval_runtime": 1928.1902,
"eval_samples_per_second": 40.938,
"eval_steps_per_second": 2.559,
"step": 2000
},
{
"epoch": 0.19221733373200633,
"grad_norm": 79.1358413696289,
"learning_rate": 1.1245e-05,
"loss": 36.1753828125,
"step": 2250
},
{
"epoch": 0.2135748152577848,
"grad_norm": 85.23380279541016,
"learning_rate": 1.2495000000000001e-05,
"loss": 35.4720703125,
"step": 2500
},
{
"epoch": 0.2135748152577848,
"eval_loss": 4.146875381469727,
"eval_runtime": 1927.7742,
"eval_samples_per_second": 40.947,
"eval_steps_per_second": 2.559,
"step": 2500
},
{
"epoch": 0.23493229678356328,
"grad_norm": 40.744110107421875,
"learning_rate": 1.3725000000000002e-05,
"loss": 17.465578125,
"step": 2750
},
{
"epoch": 0.25628977830934174,
"grad_norm": 41.063385009765625,
"learning_rate": 1.4975e-05,
"loss": 17.180029296875,
"step": 3000
},
{
"epoch": 0.25628977830934174,
"eval_loss": 2.0153398513793945,
"eval_runtime": 791.0335,
"eval_samples_per_second": 99.788,
"eval_steps_per_second": 12.474,
"step": 3000
},
{
"epoch": 0.27764725983512023,
"grad_norm": 43.8082275390625,
"learning_rate": 1.6225e-05,
"loss": 16.96137890625,
"step": 3250
},
{
"epoch": 0.2990047413608987,
"grad_norm": 41.902591705322266,
"learning_rate": 1.7475e-05,
"loss": 16.6866015625,
"step": 3500
},
{
"epoch": 0.2990047413608987,
"eval_loss": 1.964239239692688,
"eval_runtime": 796.0599,
"eval_samples_per_second": 99.158,
"eval_steps_per_second": 12.395,
"step": 3500
},
{
"epoch": 0.3203622228866772,
"grad_norm": 38.828636169433594,
"learning_rate": 1.8725e-05,
"loss": 16.456845703125,
"step": 3750
},
{
"epoch": 0.3417197044124557,
"grad_norm": 43.49476623535156,
"learning_rate": 1.9975e-05,
"loss": 16.399064453125,
"step": 4000
},
{
"epoch": 0.3417197044124557,
"eval_loss": 1.919270396232605,
"eval_runtime": 795.0187,
"eval_samples_per_second": 99.288,
"eval_steps_per_second": 12.411,
"step": 4000
},
{
"epoch": 0.3630771859382342,
"grad_norm": 41.28815460205078,
"learning_rate": 2.1225e-05,
"loss": 16.1804853515625,
"step": 4250
},
{
"epoch": 0.38443466746401267,
"grad_norm": 39.76205062866211,
"learning_rate": 2.2475e-05,
"loss": 16.03432421875,
"step": 4500
},
{
"epoch": 0.38443466746401267,
"eval_loss": 1.8889796733856201,
"eval_runtime": 793.8887,
"eval_samples_per_second": 99.43,
"eval_steps_per_second": 12.429,
"step": 4500
},
{
"epoch": 0.4057921489897911,
"grad_norm": 46.443695068359375,
"learning_rate": 2.372e-05,
"loss": 15.8476015625,
"step": 4750
},
{
"epoch": 0.4271496305155696,
"grad_norm": 37.068084716796875,
"learning_rate": 2.4970000000000003e-05,
"loss": 15.7752314453125,
"step": 5000
},
{
"epoch": 0.4271496305155696,
"eval_loss": 1.8540898561477661,
"eval_runtime": 762.2328,
"eval_samples_per_second": 103.559,
"eval_steps_per_second": 12.945,
"step": 5000
},
{
"epoch": 0.4485071120413481,
"grad_norm": 38.2252082824707,
"learning_rate": 2.622e-05,
"loss": 15.5765185546875,
"step": 5250
},
{
"epoch": 0.46986459356712656,
"grad_norm": 41.708736419677734,
"learning_rate": 2.7470000000000003e-05,
"loss": 15.5412373046875,
"step": 5500
},
{
"epoch": 0.46986459356712656,
"eval_loss": 1.8295842409133911,
"eval_runtime": 763.2977,
"eval_samples_per_second": 103.414,
"eval_steps_per_second": 12.927,
"step": 5500
},
{
"epoch": 0.49122207509290505,
"grad_norm": 41.928775787353516,
"learning_rate": 2.8720000000000003e-05,
"loss": 15.4088125,
"step": 5750
},
{
"epoch": 0.5125795566186835,
"grad_norm": 38.48265075683594,
"learning_rate": 2.9970000000000003e-05,
"loss": 15.3675712890625,
"step": 6000
},
{
"epoch": 0.5125795566186835,
"eval_loss": 1.803719401359558,
"eval_runtime": 761.5931,
"eval_samples_per_second": 103.646,
"eval_steps_per_second": 12.956,
"step": 6000
},
{
"epoch": 0.533937038144462,
"grad_norm": 40.2772331237793,
"learning_rate": 3.122e-05,
"loss": 15.1469111328125,
"step": 6250
},
{
"epoch": 0.5552945196702405,
"grad_norm": 39.967647552490234,
"learning_rate": 3.247e-05,
"loss": 15.100412109375,
"step": 6500
},
{
"epoch": 0.5552945196702405,
"eval_loss": 1.7818784713745117,
"eval_runtime": 761.6584,
"eval_samples_per_second": 103.637,
"eval_steps_per_second": 12.955,
"step": 6500
},
{
"epoch": 0.576652001196019,
"grad_norm": 38.99542999267578,
"learning_rate": 3.3715000000000005e-05,
"loss": 15.10202734375,
"step": 6750
},
{
"epoch": 0.5980094827217974,
"grad_norm": 38.9607048034668,
"learning_rate": 3.4965e-05,
"loss": 14.957875,
"step": 7000
},
{
"epoch": 0.5980094827217974,
"eval_loss": 1.7590579986572266,
"eval_runtime": 763.6639,
"eval_samples_per_second": 103.365,
"eval_steps_per_second": 12.921,
"step": 7000
},
{
"epoch": 0.619366964247576,
"grad_norm": 36.200218200683594,
"learning_rate": 3.6215000000000005e-05,
"loss": 14.8693701171875,
"step": 7250
},
{
"epoch": 0.6407244457733544,
"grad_norm": 38.16975402832031,
"learning_rate": 3.7465e-05,
"loss": 14.82056640625,
"step": 7500
},
{
"epoch": 0.6407244457733544,
"eval_loss": 1.7474839687347412,
"eval_runtime": 761.4056,
"eval_samples_per_second": 103.671,
"eval_steps_per_second": 12.959,
"step": 7500
},
{
"epoch": 0.6620819272991328,
"grad_norm": 35.05085372924805,
"learning_rate": 3.8715000000000005e-05,
"loss": 14.679634765625,
"step": 7750
},
{
"epoch": 0.6834394088249114,
"grad_norm": 39.50191116333008,
"learning_rate": 3.9965e-05,
"loss": 14.5730966796875,
"step": 8000
},
{
"epoch": 0.6834394088249114,
"eval_loss": 1.731168508529663,
"eval_runtime": 762.2289,
"eval_samples_per_second": 103.559,
"eval_steps_per_second": 12.945,
"step": 8000
},
{
"epoch": 0.7047968903506898,
"grad_norm": 39.16671371459961,
"learning_rate": 4.1215000000000004e-05,
"loss": 14.58540234375,
"step": 8250
},
{
"epoch": 0.7261543718764684,
"grad_norm": 35.04971694946289,
"learning_rate": 4.246500000000001e-05,
"loss": 14.4853076171875,
"step": 8500
},
{
"epoch": 0.7261543718764684,
"eval_loss": 1.7171440124511719,
"eval_runtime": 761.2683,
"eval_samples_per_second": 103.69,
"eval_steps_per_second": 12.961,
"step": 8500
},
{
"epoch": 0.7475118534022468,
"grad_norm": 38.985992431640625,
"learning_rate": 4.371e-05,
"loss": 14.4681435546875,
"step": 8750
},
{
"epoch": 0.7688693349280253,
"grad_norm": 33.91847610473633,
"learning_rate": 4.496e-05,
"loss": 14.435607421875,
"step": 9000
},
{
"epoch": 0.7688693349280253,
"eval_loss": 1.7089964151382446,
"eval_runtime": 763.3649,
"eval_samples_per_second": 103.405,
"eval_steps_per_second": 12.926,
"step": 9000
},
{
"epoch": 0.7902268164538038,
"grad_norm": 32.30923080444336,
"learning_rate": 4.6210000000000006e-05,
"loss": 14.4067099609375,
"step": 9250
},
{
"epoch": 0.8115842979795822,
"grad_norm": 33.230995178222656,
"learning_rate": 4.746e-05,
"loss": 14.2340126953125,
"step": 9500
},
{
"epoch": 0.8115842979795822,
"eval_loss": 1.6928783655166626,
"eval_runtime": 762.4223,
"eval_samples_per_second": 103.533,
"eval_steps_per_second": 12.942,
"step": 9500
},
{
"epoch": 0.8329417795053607,
"grad_norm": 32.932621002197266,
"learning_rate": 4.871e-05,
"loss": 14.249919921875,
"step": 9750
},
{
"epoch": 0.8542992610311392,
"grad_norm": 35.00098419189453,
"learning_rate": 4.996e-05,
"loss": 14.2497333984375,
"step": 10000
},
{
"epoch": 0.8542992610311392,
"eval_loss": 1.6808847188949585,
"eval_runtime": 762.5948,
"eval_samples_per_second": 103.51,
"eval_steps_per_second": 12.939,
"step": 10000
},
{
"epoch": 0.8756567425569177,
"grad_norm": 32.668888092041016,
"learning_rate": 4.995984523333273e-05,
"loss": 14.1917099609375,
"step": 10250
},
{
"epoch": 0.8970142240826962,
"grad_norm": 30.99444580078125,
"learning_rate": 4.98341665436926e-05,
"loss": 14.165974609375,
"step": 10500
},
{
"epoch": 0.8970142240826962,
"eval_loss": 1.6745405197143555,
"eval_runtime": 763.1023,
"eval_samples_per_second": 103.441,
"eval_steps_per_second": 12.93,
"step": 10500
},
{
"epoch": 0.9183717056084747,
"grad_norm": 33.60852813720703,
"learning_rate": 4.962436288567254e-05,
"loss": 14.04737109375,
"step": 10750
},
{
"epoch": 0.9397291871342531,
"grad_norm": 33.550537109375,
"learning_rate": 4.932946882574261e-05,
"loss": 14.0403681640625,
"step": 11000
},
{
"epoch": 0.9397291871342531,
"eval_loss": 1.6584335565567017,
"eval_runtime": 762.2171,
"eval_samples_per_second": 103.561,
"eval_steps_per_second": 12.945,
"step": 11000
},
{
"epoch": 0.9610866686600316,
"grad_norm": 31.017929077148438,
"learning_rate": 4.895116801751093e-05,
"loss": 14.0180439453125,
"step": 11250
},
{
"epoch": 0.9824441501858101,
"grad_norm": 32.50554656982422,
"learning_rate": 4.849075735901174e-05,
"loss": 13.85398828125,
"step": 11500
},
{
"epoch": 0.9824441501858101,
"eval_loss": 1.6473965644836426,
"eval_runtime": 761.3432,
"eval_samples_per_second": 103.68,
"eval_steps_per_second": 12.96,
"step": 11500
},
{
"epoch": 1.003758916748537,
"grad_norm": 32.66862106323242,
"learning_rate": 4.7949815238831484e-05,
"loss": 13.788498046875,
"step": 11750
},
{
"epoch": 1.0251163982743154,
"grad_norm": 34.95535659790039,
"learning_rate": 4.7330196125047005e-05,
"loss": 13.7537568359375,
"step": 12000
},
{
"epoch": 1.0251163982743154,
"eval_loss": 1.6361680030822754,
"eval_runtime": 764.657,
"eval_samples_per_second": 103.231,
"eval_steps_per_second": 12.904,
"step": 12000
},
{
"epoch": 1.0464738798000939,
"grad_norm": 30.21858787536621,
"learning_rate": 4.663402420770275e-05,
"loss": 13.7448203125,
"step": 12250
},
{
"epoch": 1.0678313613258725,
"grad_norm": 31.970226287841797,
"learning_rate": 4.5863686116622025e-05,
"loss": 13.67769921875,
"step": 12500
},
{
"epoch": 1.0678313613258725,
"eval_loss": 1.6223485469818115,
"eval_runtime": 762.9231,
"eval_samples_per_second": 103.465,
"eval_steps_per_second": 12.933,
"step": 12500
},
{
"epoch": 1.089188842851651,
"grad_norm": 30.448543548583984,
"learning_rate": 4.502182273951718e-05,
"loss": 13.6064111328125,
"step": 12750
},
{
"epoch": 1.1105463243774294,
"grad_norm": 31.551868438720703,
"learning_rate": 4.411132016844809e-05,
"loss": 13.5927626953125,
"step": 13000
},
{
"epoch": 1.1105463243774294,
"eval_loss": 1.6111470460891724,
"eval_runtime": 662.8254,
"eval_samples_per_second": 119.09,
"eval_steps_per_second": 14.886,
"step": 13000
},
{
"epoch": 1.1319038059032078,
"grad_norm": 32.45416259765625,
"learning_rate": 4.313529980566635e-05,
"loss": 13.48468359375,
"step": 13250
},
{
"epoch": 1.1532612874289865,
"grad_norm": 31.863527297973633,
"learning_rate": 4.209710766276471e-05,
"loss": 13.452822265625,
"step": 13500
},
{
"epoch": 1.1532612874289865,
"eval_loss": 1.6016285419464111,
"eval_runtime": 661.1194,
"eval_samples_per_second": 119.397,
"eval_steps_per_second": 14.925,
"step": 13500
},
{
"epoch": 1.174618768954765,
"grad_norm": 30.887378692626953,
"learning_rate": 4.100030288981636e-05,
"loss": 13.4295244140625,
"step": 13750
},
{
"epoch": 1.1959762504805433,
"grad_norm": 31.169713973999023,
"learning_rate": 3.984864557382888e-05,
"loss": 13.3582939453125,
"step": 14000
},
{
"epoch": 1.1959762504805433,
"eval_loss": 1.5926363468170166,
"eval_runtime": 662.3077,
"eval_samples_per_second": 119.183,
"eval_steps_per_second": 14.898,
"step": 14000
},
{
"epoch": 1.2173337320063218,
"grad_norm": 29.032123565673828,
"learning_rate": 3.864608384834243e-05,
"loss": 13.3545703125,
"step": 14250
},
{
"epoch": 1.2386912135321002,
"grad_norm": 30.015254974365234,
"learning_rate": 3.739674035836306e-05,
"loss": 13.3128515625,
"step": 14500
},
{
"epoch": 1.2386912135321002,
"eval_loss": 1.5796525478363037,
"eval_runtime": 662.1395,
"eval_samples_per_second": 119.214,
"eval_steps_per_second": 14.902,
"step": 14500
},
{
"epoch": 1.2600486950578786,
"grad_norm": 30.013505935668945,
"learning_rate": 3.6110144329347815e-05,
"loss": 13.2648798828125,
"step": 14750
},
{
"epoch": 1.2814061765836573,
"grad_norm": 30.784208297729492,
"learning_rate": 3.478037535477188e-05,
"loss": 13.2260712890625,
"step": 15000
},
{
"epoch": 1.2814061765836573,
"eval_loss": 1.5713889598846436,
"eval_runtime": 662.045,
"eval_samples_per_second": 119.231,
"eval_steps_per_second": 14.904,
"step": 15000
},
{
"epoch": 1.3027636581094357,
"grad_norm": 29.118173599243164,
"learning_rate": 3.341707711117018e-05,
"loss": 13.1651982421875,
"step": 15250
},
{
"epoch": 1.3241211396352142,
"grad_norm": 31.14626693725586,
"learning_rate": 3.2024923283540886e-05,
"loss": 13.227046875,
"step": 15500
},
{
"epoch": 1.3241211396352142,
"eval_loss": 1.5613423585891724,
"eval_runtime": 662.4802,
"eval_samples_per_second": 119.152,
"eval_steps_per_second": 14.894,
"step": 15500
},
{
"epoch": 1.3454786211609928,
"grad_norm": 28.750076293945312,
"learning_rate": 3.060868648014479e-05,
"loss": 13.0909404296875,
"step": 15750
},
{
"epoch": 1.3668361026867712,
"grad_norm": 28.854137420654297,
"learning_rate": 2.9173221870958793e-05,
"loss": 13.083611328125,
"step": 16000
},
{
"epoch": 1.3668361026867712,
"eval_loss": 1.556220531463623,
"eval_runtime": 661.5946,
"eval_samples_per_second": 119.312,
"eval_steps_per_second": 14.914,
"step": 16000
},
{
"epoch": 1.3881935842125497,
"grad_norm": 31.851211547851562,
"learning_rate": 2.772345054308973e-05,
"loss": 13.021517578125,
"step": 16250
},
{
"epoch": 1.4095510657383281,
"grad_norm": 29.31368637084961,
"learning_rate": 2.627019103801507e-05,
"loss": 13.0297548828125,
"step": 16500
},
{
"epoch": 1.4095510657383281,
"eval_loss": 1.5463231801986694,
"eval_runtime": 661.3847,
"eval_samples_per_second": 119.35,
"eval_steps_per_second": 14.919,
"step": 16500
},
{
"epoch": 1.4309085472641065,
"grad_norm": 29.341651916503906,
"learning_rate": 2.4806756029750566e-05,
"loss": 12.9520859375,
"step": 16750
},
{
"epoch": 1.452266028789885,
"grad_norm": 31.251237869262695,
"learning_rate": 2.334398350414455e-05,
"loss": 12.9825966796875,
"step": 17000
},
{
"epoch": 1.452266028789885,
"eval_loss": 1.5360182523727417,
"eval_runtime": 661.9359,
"eval_samples_per_second": 119.25,
"eval_steps_per_second": 14.906,
"step": 17000
},
{
"epoch": 1.4736235103156636,
"grad_norm": 30.922067642211914,
"learning_rate": 2.1886888165822918e-05,
"loss": 12.903462890625,
"step": 17250
},
{
"epoch": 1.494980991841442,
"grad_norm": 30.14403533935547,
"learning_rate": 2.044046525677002e-05,
"loss": 12.9177880859375,
"step": 17500
},
{
"epoch": 1.494980991841442,
"eval_loss": 1.5266560316085815,
"eval_runtime": 662.8613,
"eval_samples_per_second": 119.084,
"eval_steps_per_second": 14.885,
"step": 17500
},
{
"epoch": 1.5163384733672205,
"grad_norm": 31.758607864379883,
"learning_rate": 1.9009673431544938e-05,
"loss": 12.86377734375,
"step": 17750
},
{
"epoch": 1.5376959548929992,
"grad_norm": 30.95867347717285,
"learning_rate": 1.7599417757927578e-05,
"loss": 12.821025390625,
"step": 18000
},
{
"epoch": 1.5376959548929992,
"eval_loss": 1.5217604637145996,
"eval_runtime": 660.6619,
"eval_samples_per_second": 119.48,
"eval_steps_per_second": 14.935,
"step": 18000
},
{
"epoch": 1.5590534364187776,
"grad_norm": 30.812349319458008,
"learning_rate": 1.6214532901271817e-05,
"loss": 12.7918310546875,
"step": 18250
},
{
"epoch": 1.580410917944556,
"grad_norm": 31.66985321044922,
"learning_rate": 1.4859766550213754e-05,
"loss": 12.7591337890625,
"step": 18500
},
{
"epoch": 1.580410917944556,
"eval_loss": 1.5172350406646729,
"eval_runtime": 661.9672,
"eval_samples_per_second": 119.245,
"eval_steps_per_second": 14.906,
"step": 18500
},
{
"epoch": 1.6017683994703344,
"grad_norm": 30.236459732055664,
"learning_rate": 1.3539763140555073e-05,
"loss": 12.7556533203125,
"step": 18750
},
{
"epoch": 1.6231258809961129,
"grad_norm": 31.713998794555664,
"learning_rate": 1.2259047933119822e-05,
"loss": 12.7103583984375,
"step": 19000
},
{
"epoch": 1.6231258809961129,
"eval_loss": 1.5090234279632568,
"eval_runtime": 660.882,
"eval_samples_per_second": 119.44,
"eval_steps_per_second": 14.93,
"step": 19000
},
{
"epoch": 1.6444833625218913,
"grad_norm": 30.063196182250977,
"learning_rate": 1.1022011500169055e-05,
"loss": 12.6835615234375,
"step": 19250
},
{
"epoch": 1.6658408440476697,
"grad_norm": 32.952205657958984,
"learning_rate": 9.83289467355745e-06,
"loss": 12.618287109375,
"step": 19500
},
{
"epoch": 1.6658408440476697,
"eval_loss": 1.5055655241012573,
"eval_runtime": 663.4281,
"eval_samples_per_second": 118.982,
"eval_steps_per_second": 14.873,
"step": 19500
},
{
"epoch": 1.6871983255734484,
"grad_norm": 28.919445037841797,
"learning_rate": 8.700213683961264e-06,
"loss": 12.6425283203125,
"step": 19750
},
{
"epoch": 1.7085558070992268,
"grad_norm": 30.94468879699707,
"learning_rate": 7.618756381047296e-06,
"loss": 12.5794033203125,
"step": 20000
},
{
"epoch": 1.7085558070992268,
"eval_loss": 1.5013396739959717,
"eval_runtime": 662.8883,
"eval_samples_per_second": 119.079,
"eval_steps_per_second": 14.885,
"step": 20000
},
{
"epoch": 1.7299132886250055,
"grad_norm": 29.671031951904297,
"learning_rate": 6.596885788475471e-06,
"loss": 12.6140634765625,
"step": 20250
},
{
"epoch": 1.751270770150784,
"grad_norm": 29.66603660583496,
"learning_rate": 5.6381051024693405e-06,
"loss": 12.59630859375,
"step": 20500
},
{
"epoch": 1.751270770150784,
"eval_loss": 1.4975762367248535,
"eval_runtime": 660.2172,
"eval_samples_per_second": 119.561,
"eval_steps_per_second": 14.945,
"step": 20500
},
{
"epoch": 1.7726282516765623,
"grad_norm": 32.586578369140625,
"learning_rate": 4.745701233233446e-06,
"loss": 12.6129345703125,
"step": 20750
},
{
"epoch": 1.7939857332023408,
"grad_norm": 31.325742721557617,
"learning_rate": 3.922733536705156e-06,
"loss": 12.5139658203125,
"step": 21000
},
{
"epoch": 1.7939857332023408,
"eval_loss": 1.4922269582748413,
"eval_runtime": 662.5754,
"eval_samples_per_second": 119.135,
"eval_steps_per_second": 14.892,
"step": 21000
},
{
"epoch": 1.8153432147281192,
"grad_norm": 30.204561233520508,
"learning_rate": 3.1720233264123627e-06,
"loss": 12.5135751953125,
"step": 21250
},
{
"epoch": 1.8367006962538976,
"grad_norm": 30.57643699645996,
"learning_rate": 2.496144201392764e-06,
"loss": 12.489501953125,
"step": 21500
},
{
"epoch": 1.8367006962538976,
"eval_loss": 1.4932215213775635,
"eval_runtime": 661.5906,
"eval_samples_per_second": 119.312,
"eval_steps_per_second": 14.914,
"step": 21500
}
],
"logging_steps": 250,
"max_steps": 23412,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 6.875088591045919e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}