sanigec-phase1 / trainer_state.json
oza75's picture
End of training
7e26492 verified
Raw
History Blame Contribute Delete
42 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 2500,
"global_step": 52682,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01898217573698297,
"grad_norm": 2.8858866691589355,
"learning_rate": 4.735843087630496e-05,
"loss": 6.00573583984375,
"step": 500
},
{
"epoch": 0.03796435147396594,
"grad_norm": 0.22312745451927185,
"learning_rate": 9.481176842771275e-05,
"loss": 1.7886568603515625,
"step": 1000
},
{
"epoch": 0.05694652721094892,
"grad_norm": 0.3883834183216095,
"learning_rate": 0.0001422651059791205,
"loss": 1.4103663330078124,
"step": 1500
},
{
"epoch": 0.07592870294793189,
"grad_norm": 0.28461548686027527,
"learning_rate": 0.0001897184435305283,
"loss": 1.2999722900390625,
"step": 2000
},
{
"epoch": 0.09491087868491487,
"grad_norm": 0.3026827871799469,
"learning_rate": 0.00023717178108193608,
"loss": 1.27368310546875,
"step": 2500
},
{
"epoch": 0.09491087868491487,
"eval_correction_accuracy": 0.9691768119898284,
"eval_detection_f1": 0.5029481803464545,
"eval_loss": 1.2979440689086914,
"eval_runtime": 60.3464,
"eval_samples_per_second": 371.886,
"eval_steps_per_second": 2.916,
"step": 2500
},
{
"epoch": 0.09491087868491487,
"eval_edit_f0_5": 0.8420576085111199,
"eval_edit_f0_5_m0": 0.8057950832842375,
"eval_edit_f0_5_m0.1": 0.8175929454030809,
"eval_edit_f0_5_m0.2": 0.8316255884796455,
"eval_edit_f0_5_m0.3": 0.8420576085111199,
"step": 2500
},
{
"epoch": 0.09491087868491487,
"eval_real_f0_5": 0.42910447761194037,
"eval_real_f0_5_m0": 0.3888400702987698,
"eval_real_f0_5_m0.1": 0.4028041825095057,
"eval_real_f0_5_m0.2": 0.4175050301810866,
"eval_real_f0_5_m0.3": 0.42910447761194037,
"step": 2500
},
{
"epoch": 0.11389305442189784,
"grad_norm": 0.27056726813316345,
"learning_rate": 0.00028462511863334386,
"loss": 1.2630726318359375,
"step": 3000
},
{
"epoch": 0.1328752301588808,
"grad_norm": 0.2008272260427475,
"learning_rate": 0.00029996551748314967,
"loss": 1.2586767578125,
"step": 3500
},
{
"epoch": 0.15185740589586377,
"grad_norm": 0.23608435690402985,
"learning_rate": 0.00029978808195120705,
"loss": 1.2485474853515626,
"step": 4000
},
{
"epoch": 0.17083958163284677,
"grad_norm": 0.17198926210403442,
"learning_rate": 0.00029945995039741313,
"loss": 1.2438245849609375,
"step": 4500
},
{
"epoch": 0.18982175736982973,
"grad_norm": 0.20551930367946625,
"learning_rate": 0.00029898145294228977,
"loss": 1.2398516845703125,
"step": 5000
},
{
"epoch": 0.18982175736982973,
"eval_correction_accuracy": 0.9716923312269569,
"eval_detection_f1": 0.5269904148108618,
"eval_loss": 1.2654461860656738,
"eval_runtime": 59.8792,
"eval_samples_per_second": 374.788,
"eval_steps_per_second": 2.939,
"step": 5000
},
{
"epoch": 0.18982175736982973,
"eval_edit_f0_5": 0.872664843158936,
"eval_edit_f0_5_m0": 0.8547840106743758,
"eval_edit_f0_5_m0.1": 0.8604271144418775,
"eval_edit_f0_5_m0.2": 0.8685822219678324,
"eval_edit_f0_5_m0.3": 0.872664843158936,
"step": 5000
},
{
"epoch": 0.18982175736982973,
"eval_real_f0_5": 0.46151439299123903,
"eval_real_f0_5_m0": 0.4191919191919192,
"eval_real_f0_5_m0.1": 0.4297297297297297,
"eval_real_f0_5_m0.2": 0.445906432748538,
"eval_real_f0_5_m0.3": 0.46151439299123903,
"step": 5000
},
{
"epoch": 0.2088039331068127,
"grad_norm": 0.20124033093452454,
"learning_rate": 0.00029835307098370265,
"loss": 1.2357362060546875,
"step": 5500
},
{
"epoch": 0.2277861088437957,
"grad_norm": 0.23115237057209015,
"learning_rate": 0.0002975754367125453,
"loss": 1.2375308837890624,
"step": 6000
},
{
"epoch": 0.24676828458077865,
"grad_norm": 0.1954943835735321,
"learning_rate": 0.00029664933247671615,
"loss": 1.2349964599609375,
"step": 6500
},
{
"epoch": 0.2657504603177616,
"grad_norm": 0.17400752007961273,
"learning_rate": 0.0002955756899940283,
"loss": 1.2303714599609374,
"step": 7000
},
{
"epoch": 0.2847326360547446,
"grad_norm": 0.17888489365577698,
"learning_rate": 0.00029435558941484435,
"loss": 1.2309805908203124,
"step": 7500
},
{
"epoch": 0.2847326360547446,
"eval_correction_accuracy": 0.9723985228660039,
"eval_detection_f1": 0.5397412768051171,
"eval_loss": 1.2546594142913818,
"eval_runtime": 60.3599,
"eval_samples_per_second": 371.803,
"eval_steps_per_second": 2.916,
"step": 7500
},
{
"epoch": 0.2847326360547446,
"eval_edit_f0_5": 0.8861485517636936,
"eval_edit_f0_5_m0": 0.8749653451621846,
"eval_edit_f0_5_m0.1": 0.8788065728226123,
"eval_edit_f0_5_m0.2": 0.8814529381764608,
"eval_edit_f0_5_m0.3": 0.8861485517636936,
"step": 7500
},
{
"epoch": 0.2847326360547446,
"eval_real_f0_5": 0.47371638141809297,
"eval_real_f0_5_m0": 0.4501055966209081,
"eval_real_f0_5_m0.1": 0.4613259668508288,
"eval_real_f0_5_m0.2": 0.47164351851851855,
"eval_real_f0_5_m0.3": 0.47371638141809297,
"step": 7500
},
{
"epoch": 0.30371481179172755,
"grad_norm": 0.1810256987810135,
"learning_rate": 0.0002929902582353787,
"loss": 1.227394775390625,
"step": 8000
},
{
"epoch": 0.32269698752871057,
"grad_norm": 0.18248461186885834,
"learning_rate": 0.00029148107006276056,
"loss": 1.22420361328125,
"step": 8500
},
{
"epoch": 0.34167916326569353,
"grad_norm": 0.1456211358308792,
"learning_rate": 0.0002898295432331011,
"loss": 1.22528125,
"step": 9000
},
{
"epoch": 0.3606613390026765,
"grad_norm": 0.1682305634021759,
"learning_rate": 0.0002880373392839537,
"loss": 1.2209486083984376,
"step": 9500
},
{
"epoch": 0.37964351473965946,
"grad_norm": 0.1455032080411911,
"learning_rate": 0.00028610626128270495,
"loss": 1.222905029296875,
"step": 10000
},
{
"epoch": 0.37964351473965946,
"eval_correction_accuracy": 0.9729365736386112,
"eval_detection_f1": 0.5878967328292231,
"eval_loss": 1.2507761716842651,
"eval_runtime": 60.7194,
"eval_samples_per_second": 369.602,
"eval_steps_per_second": 2.899,
"step": 10000
},
{
"epoch": 0.37964351473965946,
"eval_edit_f0_5": 0.8773855767606823,
"eval_edit_f0_5_m0": 0.8642143753752115,
"eval_edit_f0_5_m0.1": 0.871961638097338,
"eval_edit_f0_5_m0.2": 0.8739938939772413,
"eval_edit_f0_5_m0.3": 0.8773855767606823,
"step": 10000
},
{
"epoch": 0.37964351473965946,
"eval_real_f0_5": 0.43992027334851935,
"eval_real_f0_5_m0": 0.4214697406340058,
"eval_real_f0_5_m0.1": 0.42792792792792794,
"eval_real_f0_5_m0.2": 0.42728237791932056,
"eval_real_f0_5_m0.3": 0.43992027334851935,
"step": 10000
},
{
"epoch": 0.3986256904766424,
"grad_norm": 0.20864084362983704,
"learning_rate": 0.0002840382520125783,
"loss": 1.22280712890625,
"step": 10500
},
{
"epoch": 0.4176078662136254,
"grad_norm": 0.19003528356552124,
"learning_rate": 0.0002818353920180744,
"loss": 1.221659423828125,
"step": 11000
},
{
"epoch": 0.43659004195060835,
"grad_norm": 0.1750059872865677,
"learning_rate": 0.0002794998975118153,
"loss": 1.2191646728515626,
"step": 11500
},
{
"epoch": 0.4555722176875914,
"grad_norm": 0.13223567605018616,
"learning_rate": 0.00027703411814489855,
"loss": 1.216736328125,
"step": 12000
},
{
"epoch": 0.47455439342457434,
"grad_norm": 0.10733171552419662,
"learning_rate": 0.00027444053464300346,
"loss": 1.2142664794921876,
"step": 12500
},
{
"epoch": 0.47455439342457434,
"eval_correction_accuracy": 0.9733371445263059,
"eval_detection_f1": 0.5704304192239259,
"eval_loss": 1.2477121353149414,
"eval_runtime": 60.6105,
"eval_samples_per_second": 370.266,
"eval_steps_per_second": 2.904,
"step": 12500
},
{
"epoch": 0.47455439342457434,
"eval_edit_f0_5": 0.8926609218668673,
"eval_edit_f0_5_m0": 0.8845489496851842,
"eval_edit_f0_5_m0.1": 0.8883563574851988,
"eval_edit_f0_5_m0.2": 0.89086859688196,
"eval_edit_f0_5_m0.3": 0.8926609218668673,
"step": 12500
},
{
"epoch": 0.47455439342457434,
"eval_real_f0_5": 0.4787581699346405,
"eval_real_f0_5_m0": 0.43419633225458465,
"eval_real_f0_5_m0.1": 0.44776119402985065,
"eval_real_f0_5_m0.2": 0.46760391198044005,
"eval_real_f0_5_m0.3": 0.4787581699346405,
"step": 12500
},
{
"epoch": 0.4935365691615573,
"grad_norm": 0.1579447090625763,
"learning_rate": 0.0002717217563106287,
"loss": 1.21451904296875,
"step": 13000
},
{
"epoch": 0.5125187448985403,
"grad_norm": 0.13867036998271942,
"learning_rate": 0.00026888051840597135,
"loss": 1.2117508544921876,
"step": 13500
},
{
"epoch": 0.5315009206355232,
"grad_norm": 0.11431417614221573,
"learning_rate": 0.00026591967938908897,
"loss": 1.2146973876953124,
"step": 14000
},
{
"epoch": 0.5504830963725063,
"grad_norm": 0.14605163037776947,
"learning_rate": 0.00026284221804611323,
"loss": 1.211010498046875,
"step": 14500
},
{
"epoch": 0.5694652721094892,
"grad_norm": 0.13300460577011108,
"learning_rate": 0.0002596512304924075,
"loss": 1.2157716064453126,
"step": 15000
},
{
"epoch": 0.5694652721094892,
"eval_correction_accuracy": 0.9736186980555992,
"eval_detection_f1": 0.6009406304526895,
"eval_loss": 1.2431864738464355,
"eval_runtime": 60.2876,
"eval_samples_per_second": 372.249,
"eval_steps_per_second": 2.919,
"step": 15000
},
{
"epoch": 0.5694652721094892,
"eval_edit_f0_5": 0.8888329698596432,
"eval_edit_f0_5_m0": 0.8778231292517006,
"eval_edit_f0_5_m0.1": 0.8819654131210541,
"eval_edit_f0_5_m0.2": 0.8855925167432335,
"eval_edit_f0_5_m0.3": 0.8888329698596432,
"step": 15000
},
{
"epoch": 0.5694652721094892,
"eval_real_f0_5": 0.4537767756482525,
"eval_real_f0_5_m0": 0.4154693486590038,
"eval_real_f0_5_m0.1": 0.42251755265797397,
"eval_real_f0_5_m0.2": 0.4458512931034483,
"eval_real_f0_5_m0.3": 0.4537767756482525,
"step": 15000
},
{
"epoch": 0.5884474478464722,
"grad_norm": 0.16023032367229462,
"learning_rate": 0.0002563499270576846,
"loss": 1.21418017578125,
"step": 15500
},
{
"epoch": 0.6074296235834551,
"grad_norm": 0.14038224518299103,
"learning_rate": 0.0002529416290562178,
"loss": 1.2102242431640624,
"step": 16000
},
{
"epoch": 0.6264117993204381,
"grad_norm": 0.19150033593177795,
"learning_rate": 0.00024942976544539404,
"loss": 1.21311474609375,
"step": 16500
},
{
"epoch": 0.6453939750574211,
"grad_norm": 0.13594546914100647,
"learning_rate": 0.0002458178693759725,
"loss": 1.2101019287109376,
"step": 17000
},
{
"epoch": 0.664376150794404,
"grad_norm": 0.0971856564283371,
"learning_rate": 0.00024210957463751702,
"loss": 1.2085975341796875,
"step": 17500
},
{
"epoch": 0.664376150794404,
"eval_correction_accuracy": 0.9739441000853563,
"eval_detection_f1": 0.6041727242827385,
"eval_loss": 1.2378469705581665,
"eval_runtime": 60.7237,
"eval_samples_per_second": 369.575,
"eval_steps_per_second": 2.898,
"step": 17500
},
{
"epoch": 0.664376150794404,
"eval_edit_f0_5": 0.8950703830407717,
"eval_edit_f0_5_m0": 0.8823850308221047,
"eval_edit_f0_5_m0.1": 0.8891276795062545,
"eval_edit_f0_5_m0.2": 0.891679139641887,
"eval_edit_f0_5_m0.3": 0.8950703830407717,
"step": 17500
},
{
"epoch": 0.664376150794404,
"eval_real_f0_5": 0.45221843003412976,
"eval_real_f0_5_m0": 0.4207080504364695,
"eval_real_f0_5_m0.1": 0.4268916155419223,
"eval_real_f0_5_m0.2": 0.43951612903225806,
"eval_real_f0_5_m0.3": 0.45221843003412976,
"step": 17500
},
{
"epoch": 0.6833583265313871,
"grad_norm": 0.23436909914016724,
"learning_rate": 0.00023830861200258084,
"loss": 1.2103984375,
"step": 18000
},
{
"epoch": 0.70234050226837,
"grad_norm": 0.10302391648292542,
"learning_rate": 0.00023441880547331984,
"loss": 1.209429443359375,
"step": 18500
},
{
"epoch": 0.721322678005353,
"grad_norm": 0.16614890098571777,
"learning_rate": 0.00023044406843431085,
"loss": 1.210209228515625,
"step": 19000
},
{
"epoch": 0.7403048537423359,
"grad_norm": 0.12630845606327057,
"learning_rate": 0.00022638839971544675,
"loss": 1.2063096923828125,
"step": 19500
},
{
"epoch": 0.7592870294793189,
"grad_norm": 0.16276787221431732,
"learning_rate": 0.00022225587956886718,
"loss": 1.20748486328125,
"step": 20000
},
{
"epoch": 0.7592870294793189,
"eval_correction_accuracy": 0.974335110021822,
"eval_detection_f1": 0.6143125770798066,
"eval_loss": 1.234763264656067,
"eval_runtime": 60.5996,
"eval_samples_per_second": 370.332,
"eval_steps_per_second": 2.904,
"step": 20000
},
{
"epoch": 0.7592870294793189,
"eval_edit_f0_5": 0.9024403864410565,
"eval_edit_f0_5_m0": 0.8842469830618539,
"eval_edit_f0_5_m0.1": 0.8886223627541842,
"eval_edit_f0_5_m0.2": 0.8945219837810999,
"eval_edit_f0_5_m0.3": 0.9024403864410565,
"step": 20000
},
{
"epoch": 0.7592870294793189,
"eval_real_f0_5": 0.4630195599022005,
"eval_real_f0_5_m0": 0.44520547945205474,
"eval_real_f0_5_m0.1": 0.4467213114754099,
"eval_real_f0_5_m0.2": 0.4604503464203233,
"eval_real_f0_5_m0.3": 0.4630195599022005,
"step": 20000
},
{
"epoch": 0.7782692052163019,
"grad_norm": 0.16368603706359863,
"learning_rate": 0.0002180506655639742,
"loss": 1.20710107421875,
"step": 20500
},
{
"epoch": 0.7972513809532848,
"grad_norm": 0.1419440507888794,
"learning_rate": 0.00021377698840466171,
"loss": 1.207209716796875,
"step": 21000
},
{
"epoch": 0.8162335566902679,
"grad_norm": 0.2440534383058548,
"learning_rate": 0.00020943914767296716,
"loss": 1.203267333984375,
"step": 21500
},
{
"epoch": 0.8352157324272508,
"grad_norm": 0.11360731720924377,
"learning_rate": 0.00020504150750342767,
"loss": 1.2064322509765626,
"step": 22000
},
{
"epoch": 0.8541979081642338,
"grad_norm": 0.19054335355758667,
"learning_rate": 0.00020058849219249225,
"loss": 1.2044508056640626,
"step": 22500
},
{
"epoch": 0.8541979081642338,
"eval_correction_accuracy": 0.9746169932390887,
"eval_detection_f1": 0.6164803461954562,
"eval_loss": 1.2325071096420288,
"eval_runtime": 60.5986,
"eval_samples_per_second": 370.339,
"eval_steps_per_second": 2.904,
"step": 22500
},
{
"epoch": 0.8541979081642338,
"eval_edit_f0_5": 0.9041808921475346,
"eval_edit_f0_5_m0": 0.8936088786835056,
"eval_edit_f0_5_m0.1": 0.8979367262723521,
"eval_edit_f0_5_m0.2": 0.9006915629322267,
"eval_edit_f0_5_m0.3": 0.9041808921475346,
"step": 22500
},
{
"epoch": 0.8541979081642338,
"eval_real_f0_5": 0.43545659526493796,
"eval_real_f0_5_m0": 0.4005456349206349,
"eval_real_f0_5_m0.1": 0.4166666666666667,
"eval_real_f0_5_m0.2": 0.4315960912052117,
"eval_real_f0_5_m0.3": 0.43545659526493796,
"step": 22500
},
{
"epoch": 0.8731800839012167,
"grad_norm": 0.15163150429725647,
"learning_rate": 0.00019608458174740764,
"loss": 1.205394287109375,
"step": 23000
},
{
"epoch": 0.8921622596381997,
"grad_norm": 0.1204524040222168,
"learning_rate": 0.00019153430737905516,
"loss": 1.20386767578125,
"step": 23500
},
{
"epoch": 0.9111444353751827,
"grad_norm": 0.14975769817829132,
"learning_rate": 0.00018694224694327434,
"loss": 1.2036343994140626,
"step": 24000
},
{
"epoch": 0.9301266111121657,
"grad_norm": 0.09973002225160599,
"learning_rate": 0.0001823130203352581,
"loss": 1.202430419921875,
"step": 24500
},
{
"epoch": 0.9491087868491487,
"grad_norm": 0.12494324147701263,
"learning_rate": 0.00017765128484165446,
"loss": 1.203585205078125,
"step": 25000
},
{
"epoch": 0.9491087868491487,
"eval_correction_accuracy": 0.9748879967532328,
"eval_detection_f1": 0.6170252572497661,
"eval_loss": 1.2309163808822632,
"eval_runtime": 59.979,
"eval_samples_per_second": 374.164,
"eval_steps_per_second": 2.934,
"step": 25000
},
{
"epoch": 0.9491087868491487,
"eval_edit_f0_5": 0.9054563883101525,
"eval_edit_f0_5_m0": 0.8931397696883698,
"eval_edit_f0_5_m0.1": 0.8968065743753791,
"eval_edit_f0_5_m0.2": 0.9016347709646821,
"eval_edit_f0_5_m0.3": 0.9054563883101525,
"step": 25000
},
{
"epoch": 0.9491087868491487,
"eval_real_f0_5": 0.46703296703296693,
"eval_real_f0_5_m0": 0.43244626407369496,
"eval_real_f0_5_m0.1": 0.44786096256684493,
"eval_real_f0_5_m0.2": 0.45962199312714774,
"eval_real_f0_5_m0.3": 0.46703296703296693,
"step": 25000
},
{
"epoch": 0.9680909625861316,
"grad_norm": 0.14670301973819733,
"learning_rate": 0.00017296173045504914,
"loss": 1.2033277587890625,
"step": 25500
},
{
"epoch": 0.9870731383231146,
"grad_norm": 0.10602114349603653,
"learning_rate": 0.00016824907515554526,
"loss": 1.201916748046875,
"step": 26000
},
{
"epoch": 1.0060363318843606,
"grad_norm": 0.06282790750265121,
"learning_rate": 0.00016351806016418486,
"loss": 1.199654541015625,
"step": 26500
},
{
"epoch": 1.0250185076213436,
"grad_norm": 0.06489919126033783,
"learning_rate": 0.00015877344517298893,
"loss": 1.19592431640625,
"step": 27000
},
{
"epoch": 1.0440006833583266,
"grad_norm": 0.06663327664136887,
"learning_rate": 0.0001540200035564149,
"loss": 1.19781689453125,
"step": 27500
},
{
"epoch": 1.0440006833583266,
"eval_correction_accuracy": 0.9751896612489042,
"eval_detection_f1": 0.6337458056595326,
"eval_loss": 1.2278345823287964,
"eval_runtime": 60.4482,
"eval_samples_per_second": 371.26,
"eval_steps_per_second": 2.912,
"step": 27500
},
{
"epoch": 1.0440006833583266,
"eval_edit_f0_5": 0.9052714133661981,
"eval_edit_f0_5_m0": 0.8921670023406456,
"eval_edit_f0_5_m0.1": 0.896949711459192,
"eval_edit_f0_5_m0.2": 0.9007485444968119,
"eval_edit_f0_5_m0.3": 0.9052714133661981,
"step": 27500
},
{
"epoch": 1.0440006833583266,
"eval_real_f0_5": 0.47462941847206386,
"eval_real_f0_5_m0": 0.4401750972762646,
"eval_real_f0_5_m0.1": 0.46072895277207393,
"eval_real_f0_5_m0.2": 0.4667207792207792,
"eval_real_f0_5_m0.3": 0.47462941847206386,
"step": 27500
},
{
"epoch": 1.0629828590953094,
"grad_norm": 0.06707123667001724,
"learning_rate": 0.0001492625175690478,
"loss": 1.196161865234375,
"step": 28000
},
{
"epoch": 1.0819650348322924,
"grad_norm": 0.04345293343067169,
"learning_rate": 0.00014450577353435873,
"loss": 1.1952852783203125,
"step": 28500
},
{
"epoch": 1.1009472105692755,
"grad_norm": 0.03876705467700958,
"learning_rate": 0.00013975455702936845,
"loss": 1.19596826171875,
"step": 29000
},
{
"epoch": 1.1199293863062585,
"grad_norm": 0.054508332163095474,
"learning_rate": 0.00013501364807006326,
"loss": 1.1936068115234375,
"step": 29500
},
{
"epoch": 1.1389115620432415,
"grad_norm": 0.05647437274456024,
"learning_rate": 0.0001302878163024043,
"loss": 1.19433984375,
"step": 30000
},
{
"epoch": 1.1389115620432415,
"eval_correction_accuracy": 0.9752921942086351,
"eval_detection_f1": 0.6477482980155775,
"eval_loss": 1.2278577089309692,
"eval_runtime": 59.9225,
"eval_samples_per_second": 374.517,
"eval_steps_per_second": 2.937,
"step": 30000
},
{
"epoch": 1.1389115620432415,
"eval_edit_f0_5": 0.9029944709038156,
"eval_edit_f0_5_m0": 0.8870581982460802,
"eval_edit_f0_5_m0.1": 0.8917932478127851,
"eval_edit_f0_5_m0.2": 0.8975887293416418,
"eval_edit_f0_5_m0.3": 0.9029944709038156,
"step": 30000
},
{
"epoch": 1.1389115620432415,
"eval_real_f0_5": 0.46045785639958375,
"eval_real_f0_5_m0": 0.411169744942832,
"eval_real_f0_5_m0.1": 0.4227605118829982,
"eval_real_f0_5_m0.2": 0.4366602687140115,
"eval_real_f0_5_m0.3": 0.46045785639958375,
"step": 30000
},
{
"epoch": 1.1578937377802243,
"grad_norm": 0.08290459215641022,
"learning_rate": 0.00012558181620377085,
"loss": 1.196980224609375,
"step": 30500
},
{
"epoch": 1.1768759135172073,
"grad_norm": 0.03389839455485344,
"learning_rate": 0.00012090038229966375,
"loss": 1.19385400390625,
"step": 31000
},
{
"epoch": 1.1958580892541903,
"grad_norm": 0.03219689056277275,
"learning_rate": 0.0001162482244004811,
"loss": 1.1932216796875,
"step": 31500
},
{
"epoch": 1.2148402649911734,
"grad_norm": 0.03629528358578682,
"learning_rate": 0.00011163002286315993,
"loss": 1.1932420654296876,
"step": 32000
},
{
"epoch": 1.2338224407281562,
"grad_norm": 0.05208583176136017,
"learning_rate": 0.00010705042388244893,
"loss": 1.1948599853515625,
"step": 32500
},
{
"epoch": 1.2338224407281562,
"eval_correction_accuracy": 0.9756340806370627,
"eval_detection_f1": 0.6500135636133466,
"eval_loss": 1.2252331972122192,
"eval_runtime": 60.3519,
"eval_samples_per_second": 371.852,
"eval_steps_per_second": 2.916,
"step": 32500
},
{
"epoch": 1.2338224407281562,
"eval_edit_f0_5": 0.9102684230832827,
"eval_edit_f0_5_m0": 0.8981327019318732,
"eval_edit_f0_5_m0.1": 0.9021497806898794,
"eval_edit_f0_5_m0.2": 0.9072063717200373,
"eval_edit_f0_5_m0.3": 0.9102684230832827,
"step": 32500
},
{
"epoch": 1.2338224407281562,
"eval_real_f0_5": 0.4674586776859504,
"eval_real_f0_5_m0": 0.4159212880143113,
"eval_real_f0_5_m0.1": 0.4346804511278195,
"eval_real_f0_5_m0.2": 0.4519704433497537,
"eval_real_f0_5_m0.3": 0.4674586776859504,
"step": 32500
},
{
"epoch": 1.2528046164651392,
"grad_norm": 0.06928142160177231,
"learning_rate": 0.00010251403481655096,
"loss": 1.1938966064453125,
"step": 33000
},
{
"epoch": 1.2717867922021222,
"grad_norm": 0.05749162659049034,
"learning_rate": 9.80254195518373e-05,
"loss": 1.1921290283203125,
"step": 33500
},
{
"epoch": 1.2907689679391052,
"grad_norm": 0.04986289143562317,
"learning_rate": 9.358909391129737e-05,
"loss": 1.19255517578125,
"step": 34000
},
{
"epoch": 1.3097511436760882,
"grad_norm": 0.1535189300775528,
"learning_rate": 8.920952111134303e-05,
"loss": 1.19104052734375,
"step": 34500
},
{
"epoch": 1.328733319413071,
"grad_norm": 0.042191170156002045,
"learning_rate": 8.489110727153841e-05,
"loss": 1.191498779296875,
"step": 35000
},
{
"epoch": 1.328733319413071,
"eval_correction_accuracy": 0.9758862919367224,
"eval_detection_f1": 0.6438216536684808,
"eval_loss": 1.2241498231887817,
"eval_runtime": 59.6334,
"eval_samples_per_second": 376.333,
"eval_steps_per_second": 2.951,
"step": 35000
},
{
"epoch": 1.328733319413071,
"eval_edit_f0_5": 0.9100482181455414,
"eval_edit_f0_5_m0": 0.9021638917511796,
"eval_edit_f0_5_m0.1": 0.9037821317469846,
"eval_edit_f0_5_m0.2": 0.9073168050134681,
"eval_edit_f0_5_m0.3": 0.9100482181455414,
"step": 35000
},
{
"epoch": 1.328733319413071,
"eval_real_f0_5": 0.4544167610419026,
"eval_real_f0_5_m0": 0.4211689587426326,
"eval_real_f0_5_m0.1": 0.42387983706720966,
"eval_real_f0_5_m0.2": 0.4281914893617021,
"eval_real_f0_5_m0.3": 0.4544167610419026,
"step": 35000
},
{
"epoch": 1.347715495150054,
"grad_norm": 0.029605668038129807,
"learning_rate": 8.063819698177278e-05,
"loss": 1.192787841796875,
"step": 35500
},
{
"epoch": 1.366697670887037,
"grad_norm": 0.048531949520111084,
"learning_rate": 7.645506893133574e-05,
"loss": 1.190103759765625,
"step": 36000
},
{
"epoch": 1.38567984662402,
"grad_norm": 0.03906732425093651,
"learning_rate": 7.234593160429277e-05,
"loss": 1.18997265625,
"step": 36500
},
{
"epoch": 1.404662022361003,
"grad_norm": 0.03661827743053436,
"learning_rate": 6.831491904549145e-05,
"loss": 1.191602294921875,
"step": 37000
},
{
"epoch": 1.423644198097986,
"grad_norm": 0.043553389608860016,
"learning_rate": 6.436608670145828e-05,
"loss": 1.1902423095703125,
"step": 37500
},
{
"epoch": 1.423644198097986,
"eval_correction_accuracy": 0.9760330030848904,
"eval_detection_f1": 0.6487232574189096,
"eval_loss": 1.222518801689148,
"eval_runtime": 60.4683,
"eval_samples_per_second": 371.137,
"eval_steps_per_second": 2.911,
"step": 37500
},
{
"epoch": 1.423644198097986,
"eval_edit_f0_5": 0.9084162497938542,
"eval_edit_f0_5_m0": 0.8946242310778283,
"eval_edit_f0_5_m0.1": 0.9003717872730211,
"eval_edit_f0_5_m0.2": 0.9063674492074731,
"eval_edit_f0_5_m0.3": 0.9084162497938542,
"step": 37500
},
{
"epoch": 1.423644198097986,
"eval_real_f0_5": 0.44614147909967844,
"eval_real_f0_5_m0": 0.4033728350045579,
"eval_real_f0_5_m0.1": 0.4206963249516441,
"eval_real_f0_5_m0.2": 0.4333333333333333,
"eval_real_f0_5_m0.3": 0.44614147909967844,
"step": 37500
},
{
"epoch": 1.442626373834969,
"grad_norm": 0.045576661825180054,
"learning_rate": 6.050340734036973e-05,
"loss": 1.1904107666015624,
"step": 38000
},
{
"epoch": 1.461608549571952,
"grad_norm": 0.04765897989273071,
"learning_rate": 5.673076705520346e-05,
"loss": 1.1911429443359376,
"step": 38500
},
{
"epoch": 1.480590725308935,
"grad_norm": 0.10767372697591782,
"learning_rate": 5.3051961354089736e-05,
"loss": 1.1882059326171874,
"step": 39000
},
{
"epoch": 1.499572901045918,
"grad_norm": 0.036085955798625946,
"learning_rate": 4.94706913417966e-05,
"loss": 1.190911376953125,
"step": 39500
},
{
"epoch": 1.5185550767829008,
"grad_norm": 0.08071824908256531,
"learning_rate": 4.599055999619126e-05,
"loss": 1.1896280517578126,
"step": 40000
},
{
"epoch": 1.5185550767829008,
"eval_correction_accuracy": 0.976151361067345,
"eval_detection_f1": 0.6554347875581136,
"eval_loss": 1.2218546867370605,
"eval_runtime": 60.355,
"eval_samples_per_second": 371.833,
"eval_steps_per_second": 2.916,
"step": 40000
},
{
"epoch": 1.5185550767829008,
"eval_edit_f0_5": 0.910992458853966,
"eval_edit_f0_5_m0": 0.9010734128054373,
"eval_edit_f0_5_m0.1": 0.9040790831568084,
"eval_edit_f0_5_m0.2": 0.9071533963604569,
"eval_edit_f0_5_m0.3": 0.910992458853966,
"step": 40000
},
{
"epoch": 1.5185550767829008,
"eval_real_f0_5": 0.44711014176663033,
"eval_real_f0_5_m0": 0.4186210131332083,
"eval_real_f0_5_m0.1": 0.4342492639842983,
"eval_real_f0_5_m0.2": 0.4353493222106361,
"eval_real_f0_5_m0.3": 0.44711014176663033,
"step": 40000
},
{
"epoch": 1.5375372525198838,
"grad_norm": 0.030372846871614456,
"learning_rate": 4.2615068543422434e-05,
"loss": 1.19057763671875,
"step": 40500
},
{
"epoch": 1.5565194282568668,
"grad_norm": 0.03362102061510086,
"learning_rate": 3.934761293547178e-05,
"loss": 1.1867962646484376,
"step": 41000
},
{
"epoch": 1.5755016039938496,
"grad_norm": 0.057195816189050674,
"learning_rate": 3.619148043361715e-05,
"loss": 1.1873057861328125,
"step": 41500
},
{
"epoch": 1.5944837797308327,
"grad_norm": 0.03772829845547676,
"learning_rate": 3.314984630124587e-05,
"loss": 1.1879420166015624,
"step": 42000
},
{
"epoch": 1.6134659554678157,
"grad_norm": 0.1718292534351349,
"learning_rate": 3.022577060934427e-05,
"loss": 1.1901536865234374,
"step": 42500
},
{
"epoch": 1.6134659554678157,
"eval_correction_accuracy": 0.9762463112036875,
"eval_detection_f1": 0.6603370175756478,
"eval_loss": 1.2204469442367554,
"eval_runtime": 59.5936,
"eval_samples_per_second": 376.584,
"eval_steps_per_second": 2.953,
"step": 42500
},
{
"epoch": 1.6134659554678157,
"eval_edit_f0_5": 0.9098653476229733,
"eval_edit_f0_5_m0": 0.8979657559980677,
"eval_edit_f0_5_m0.1": 0.9045865598093898,
"eval_edit_f0_5_m0.2": 0.9075277034772642,
"eval_edit_f0_5_m0.3": 0.9098653476229733,
"step": 42500
},
{
"epoch": 1.6134659554678157,
"eval_real_f0_5": 0.44262720664589816,
"eval_real_f0_5_m0": 0.42281105990783413,
"eval_real_f0_5_m0.1": 0.4292809839167455,
"eval_real_f0_5_m0.2": 0.43297455968688847,
"eval_real_f0_5_m0.3": 0.44262720664589816,
"step": 42500
},
{
"epoch": 1.6324481312047987,
"grad_norm": 0.027738308534026146,
"learning_rate": 2.742219515787808e-05,
"loss": 1.186643798828125,
"step": 43000
},
{
"epoch": 1.6514303069417817,
"grad_norm": 0.03820585086941719,
"learning_rate": 2.4741940516161014e-05,
"loss": 1.1873551025390625,
"step": 43500
},
{
"epoch": 1.6704124826787647,
"grad_norm": 0.05109170451760292,
"learning_rate": 2.2187703185188212e-05,
"loss": 1.1882010498046875,
"step": 44000
},
{
"epoch": 1.6893946584157478,
"grad_norm": 0.04304545372724533,
"learning_rate": 1.9762052884790763e-05,
"loss": 1.18957080078125,
"step": 44500
},
{
"epoch": 1.7083768341527306,
"grad_norm": 0.05135943740606308,
"learning_rate": 1.7467429968339254e-05,
"loss": 1.1895230712890625,
"step": 45000
},
{
"epoch": 1.7083768341527306,
"eval_correction_accuracy": 0.9763739004493976,
"eval_detection_f1": 0.6614078220399721,
"eval_loss": 1.220071792602539,
"eval_runtime": 60.3321,
"eval_samples_per_second": 371.975,
"eval_steps_per_second": 2.917,
"step": 45000
},
{
"epoch": 1.7083768341527306,
"eval_edit_f0_5": 0.912360661138872,
"eval_edit_f0_5_m0": 0.9017536332922186,
"eval_edit_f0_5_m0.1": 0.9063933099541408,
"eval_edit_f0_5_m0.2": 0.9094366273700224,
"eval_edit_f0_5_m0.3": 0.912360661138872,
"step": 45000
},
{
"epoch": 1.7083768341527306,
"eval_real_f0_5": 0.44325313807531386,
"eval_real_f0_5_m0": 0.4201485608170845,
"eval_real_f0_5_m0.1": 0.42870905587668595,
"eval_real_f0_5_m0.2": 0.4367469879518072,
"eval_real_f0_5_m0.3": 0.44325313807531386,
"step": 45000
},
{
"epoch": 1.7273590098897136,
"grad_norm": 0.03698679432272911,
"learning_rate": 1.5306142967598462e-05,
"loss": 1.1872025146484375,
"step": 45500
},
{
"epoch": 1.7463411856266964,
"grad_norm": 0.043697986751794815,
"learning_rate": 1.3280366270202187e-05,
"loss": 1.1902381591796876,
"step": 46000
},
{
"epoch": 1.7653233613636794,
"grad_norm": 0.0478336326777935,
"learning_rate": 1.1392137932085692e-05,
"loss": 1.188957763671875,
"step": 46500
},
{
"epoch": 1.7843055371006624,
"grad_norm": 0.04866790026426315,
"learning_rate": 9.643357627076176e-06,
"loss": 1.188841064453125,
"step": 47000
},
{
"epoch": 1.8032877128376454,
"grad_norm": 0.08654382824897766,
"learning_rate": 8.035784735703915e-06,
"loss": 1.1869093017578125,
"step": 47500
},
{
"epoch": 1.8032877128376454,
"eval_correction_accuracy": 0.9764408271080002,
"eval_detection_f1": 0.6623505252062661,
"eval_loss": 1.2196118831634521,
"eval_runtime": 60.2937,
"eval_samples_per_second": 372.211,
"eval_steps_per_second": 2.919,
"step": 47500
},
{
"epoch": 1.8032877128376454,
"eval_edit_f0_5": 0.9131843391356872,
"eval_edit_f0_5_m0": 0.901242536711312,
"eval_edit_f0_5_m0.1": 0.9049602423324499,
"eval_edit_f0_5_m0.2": 0.9078295881168726,
"eval_edit_f0_5_m0.3": 0.9131843391356872,
"step": 47500
},
{
"epoch": 1.8032877128376454,
"eval_real_f0_5": 0.4527455121436114,
"eval_real_f0_5_m0": 0.4291393826005612,
"eval_real_f0_5_m0.1": 0.4339440694310511,
"eval_real_f0_5_m0.2": 0.4473161033797216,
"eval_real_f0_5_m0.3": 0.4527455121436114,
"step": 47500
},
{
"epoch": 1.8222698885746285,
"grad_norm": 0.07231193780899048,
"learning_rate": 6.571036575157384e-06,
"loss": 1.187695556640625,
"step": 48000
},
{
"epoch": 1.8412520643116115,
"grad_norm": 0.04208879545331001,
"learning_rate": 5.250586772162613e-06,
"loss": 1.1868779296875,
"step": 48500
},
{
"epoch": 1.8602342400485945,
"grad_norm": 0.08146563172340393,
"learning_rate": 4.07576378042419e-06,
"loss": 1.1862469482421876,
"step": 49000
},
{
"epoch": 1.8792164157855773,
"grad_norm": 0.035731397569179535,
"learning_rate": 3.047749544119016e-06,
"loss": 1.1868427734375,
"step": 49500
},
{
"epoch": 1.8981985915225603,
"grad_norm": 0.049494218081235886,
"learning_rate": 2.167578308787865e-06,
"loss": 1.18650390625,
"step": 50000
},
{
"epoch": 1.8981985915225603,
"eval_correction_accuracy": 0.9764698396496604,
"eval_detection_f1": 0.662213053912394,
"eval_loss": 1.219179391860962,
"eval_runtime": 60.3298,
"eval_samples_per_second": 371.989,
"eval_steps_per_second": 2.917,
"step": 50000
},
{
"epoch": 1.8981985915225603,
"eval_edit_f0_5": 0.9142088207832153,
"eval_edit_f0_5_m0": 0.904126540054877,
"eval_edit_f0_5_m0.1": 0.9078098748035337,
"eval_edit_f0_5_m0.2": 0.9097596861206475,
"eval_edit_f0_5_m0.3": 0.9142088207832153,
"step": 50000
},
{
"epoch": 1.8981985915225603,
"eval_real_f0_5": 0.44823906083244397,
"eval_real_f0_5_m0": 0.4280018761726078,
"eval_real_f0_5_m0.1": 0.43232177263969174,
"eval_real_f0_5_m0.2": 0.4433867735470942,
"eval_real_f0_5_m0.3": 0.44823906083244397,
"step": 50000
},
{
"epoch": 1.9171807672595433,
"grad_norm": 0.0926298126578331,
"learning_rate": 1.4361355808207353e-06,
"loss": 1.187315185546875,
"step": 50500
},
{
"epoch": 1.9361629429965261,
"grad_norm": 0.11386485397815704,
"learning_rate": 8.541572365829363e-07,
"loss": 1.1902998046875,
"step": 51000
},
{
"epoch": 1.9551451187335092,
"grad_norm": 0.048688311129808426,
"learning_rate": 4.2222878207828217e-07,
"loss": 1.1860992431640625,
"step": 51500
},
{
"epoch": 1.9741272944704922,
"grad_norm": 0.06769584864377975,
"learning_rate": 1.4078476389400295e-07,
"loss": 1.1888084716796874,
"step": 52000
},
{
"epoch": 1.9931094702074752,
"grad_norm": 0.07460489124059677,
"learning_rate": 1.0108332020136723e-08,
"loss": 1.18935546875,
"step": 52500
},
{
"epoch": 1.9931094702074752,
"eval_correction_accuracy": 0.9764662130819528,
"eval_detection_f1": 0.6630512720440745,
"eval_loss": 1.2193742990493774,
"eval_runtime": 60.8208,
"eval_samples_per_second": 368.986,
"eval_steps_per_second": 2.894,
"step": 52500
},
{
"epoch": 1.9931094702074752,
"eval_edit_f0_5": 0.9142088207832153,
"eval_edit_f0_5_m0": 0.9029758381316256,
"eval_edit_f0_5_m0.1": 0.9068269178712576,
"eval_edit_f0_5_m0.2": 0.9093632550792529,
"eval_edit_f0_5_m0.3": 0.9142088207832153,
"step": 52500
},
{
"epoch": 1.9931094702074752,
"eval_real_f0_5": 0.44435654008438813,
"eval_real_f0_5_m0": 0.4244186046511629,
"eval_real_f0_5_m0.1": 0.4325548141086749,
"eval_real_f0_5_m0.2": 0.441542288557214,
"eval_real_f0_5_m0.3": 0.44435654008438813,
"step": 52500
},
{
"epoch": 2.0,
"eval_correction_accuracy": 0.9764688505857402,
"eval_detection_f1": 0.6630633574310311,
"eval_loss": 1.2193818092346191,
"eval_runtime": 60.4207,
"eval_samples_per_second": 371.429,
"eval_steps_per_second": 2.913,
"step": 52682
},
{
"epoch": 2.0,
"eval_edit_f0_5": 0.9141350326869196,
"eval_edit_f0_5_m0": 0.9029758381316256,
"eval_edit_f0_5_m0.1": 0.9072940921644014,
"eval_edit_f0_5_m0.2": 0.9094374557534174,
"eval_edit_f0_5_m0.3": 0.9141350326869196,
"step": 52682
},
{
"epoch": 2.0,
"eval_real_f0_5": 0.4445554445554446,
"eval_real_f0_5_m0": 0.42520969245107176,
"eval_real_f0_5_m0.1": 0.4333333333333333,
"eval_real_f0_5_m0.2": 0.4445554445554446,
"eval_real_f0_5_m0.3": 0.44435654008438813,
"step": 52682
},
{
"epoch": 2.0,
"step": 52682,
"total_flos": 1.2253359357726764e+18,
"train_loss": 1.2582929586659106,
"train_runtime": 35190.4052,
"train_samples_per_second": 95.809,
"train_steps_per_second": 1.497
},
{
"epoch": 2.0,
"eval_correction_accuracy": 0.9764632458901922,
"eval_detection_f1": 0.6630996628137579,
"eval_loss": 1.2194472551345825,
"eval_runtime": 60.5158,
"eval_samples_per_second": 370.845,
"eval_steps_per_second": 2.908,
"step": 52682
},
{
"epoch": 2.0,
"eval_edit_f0_5": 0.9141350326869196,
"eval_edit_f0_5_m0": 0.9029758381316256,
"eval_edit_f0_5_m0.1": 0.9072940921644014,
"eval_edit_f0_5_m0.2": 0.9094374557534174,
"eval_edit_f0_5_m0.3": 0.9141350326869196,
"step": 52682
},
{
"epoch": 2.0,
"eval_real_f0_5": 0.4445554445554446,
"eval_real_f0_5_m0": 0.42520969245107176,
"eval_real_f0_5_m0.1": 0.4333333333333333,
"eval_real_f0_5_m0.2": 0.4445554445554446,
"eval_real_f0_5_m0.3": 0.44435654008438813,
"step": 52682
}
],
"logging_steps": 500,
"max_steps": 52682,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 2500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.2253359357726764e+18,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}