Instructions to use oza75/sanigec-phase1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use oza75/sanigec-phase1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="oza75/sanigec-phase1", trust_remote_code=True)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("oza75/sanigec-phase1", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.0, | |
| "eval_steps": 2500, | |
| "global_step": 52682, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.01898217573698297, | |
| "grad_norm": 2.8858866691589355, | |
| "learning_rate": 4.735843087630496e-05, | |
| "loss": 6.00573583984375, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.03796435147396594, | |
| "grad_norm": 0.22312745451927185, | |
| "learning_rate": 9.481176842771275e-05, | |
| "loss": 1.7886568603515625, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.05694652721094892, | |
| "grad_norm": 0.3883834183216095, | |
| "learning_rate": 0.0001422651059791205, | |
| "loss": 1.4103663330078124, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.07592870294793189, | |
| "grad_norm": 0.28461548686027527, | |
| "learning_rate": 0.0001897184435305283, | |
| "loss": 1.2999722900390625, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.09491087868491487, | |
| "grad_norm": 0.3026827871799469, | |
| "learning_rate": 0.00023717178108193608, | |
| "loss": 1.27368310546875, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.09491087868491487, | |
| "eval_correction_accuracy": 0.9691768119898284, | |
| "eval_detection_f1": 0.5029481803464545, | |
| "eval_loss": 1.2979440689086914, | |
| "eval_runtime": 60.3464, | |
| "eval_samples_per_second": 371.886, | |
| "eval_steps_per_second": 2.916, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.09491087868491487, | |
| "eval_edit_f0_5": 0.8420576085111199, | |
| "eval_edit_f0_5_m0": 0.8057950832842375, | |
| "eval_edit_f0_5_m0.1": 0.8175929454030809, | |
| "eval_edit_f0_5_m0.2": 0.8316255884796455, | |
| "eval_edit_f0_5_m0.3": 0.8420576085111199, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.09491087868491487, | |
| "eval_real_f0_5": 0.42910447761194037, | |
| "eval_real_f0_5_m0": 0.3888400702987698, | |
| "eval_real_f0_5_m0.1": 0.4028041825095057, | |
| "eval_real_f0_5_m0.2": 0.4175050301810866, | |
| "eval_real_f0_5_m0.3": 0.42910447761194037, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.11389305442189784, | |
| "grad_norm": 0.27056726813316345, | |
| "learning_rate": 0.00028462511863334386, | |
| "loss": 1.2630726318359375, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.1328752301588808, | |
| "grad_norm": 0.2008272260427475, | |
| "learning_rate": 0.00029996551748314967, | |
| "loss": 1.2586767578125, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.15185740589586377, | |
| "grad_norm": 0.23608435690402985, | |
| "learning_rate": 0.00029978808195120705, | |
| "loss": 1.2485474853515626, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.17083958163284677, | |
| "grad_norm": 0.17198926210403442, | |
| "learning_rate": 0.00029945995039741313, | |
| "loss": 1.2438245849609375, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.18982175736982973, | |
| "grad_norm": 0.20551930367946625, | |
| "learning_rate": 0.00029898145294228977, | |
| "loss": 1.2398516845703125, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.18982175736982973, | |
| "eval_correction_accuracy": 0.9716923312269569, | |
| "eval_detection_f1": 0.5269904148108618, | |
| "eval_loss": 1.2654461860656738, | |
| "eval_runtime": 59.8792, | |
| "eval_samples_per_second": 374.788, | |
| "eval_steps_per_second": 2.939, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.18982175736982973, | |
| "eval_edit_f0_5": 0.872664843158936, | |
| "eval_edit_f0_5_m0": 0.8547840106743758, | |
| "eval_edit_f0_5_m0.1": 0.8604271144418775, | |
| "eval_edit_f0_5_m0.2": 0.8685822219678324, | |
| "eval_edit_f0_5_m0.3": 0.872664843158936, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.18982175736982973, | |
| "eval_real_f0_5": 0.46151439299123903, | |
| "eval_real_f0_5_m0": 0.4191919191919192, | |
| "eval_real_f0_5_m0.1": 0.4297297297297297, | |
| "eval_real_f0_5_m0.2": 0.445906432748538, | |
| "eval_real_f0_5_m0.3": 0.46151439299123903, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.2088039331068127, | |
| "grad_norm": 0.20124033093452454, | |
| "learning_rate": 0.00029835307098370265, | |
| "loss": 1.2357362060546875, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.2277861088437957, | |
| "grad_norm": 0.23115237057209015, | |
| "learning_rate": 0.0002975754367125453, | |
| "loss": 1.2375308837890624, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.24676828458077865, | |
| "grad_norm": 0.1954943835735321, | |
| "learning_rate": 0.00029664933247671615, | |
| "loss": 1.2349964599609375, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.2657504603177616, | |
| "grad_norm": 0.17400752007961273, | |
| "learning_rate": 0.0002955756899940283, | |
| "loss": 1.2303714599609374, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.2847326360547446, | |
| "grad_norm": 0.17888489365577698, | |
| "learning_rate": 0.00029435558941484435, | |
| "loss": 1.2309805908203124, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.2847326360547446, | |
| "eval_correction_accuracy": 0.9723985228660039, | |
| "eval_detection_f1": 0.5397412768051171, | |
| "eval_loss": 1.2546594142913818, | |
| "eval_runtime": 60.3599, | |
| "eval_samples_per_second": 371.803, | |
| "eval_steps_per_second": 2.916, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.2847326360547446, | |
| "eval_edit_f0_5": 0.8861485517636936, | |
| "eval_edit_f0_5_m0": 0.8749653451621846, | |
| "eval_edit_f0_5_m0.1": 0.8788065728226123, | |
| "eval_edit_f0_5_m0.2": 0.8814529381764608, | |
| "eval_edit_f0_5_m0.3": 0.8861485517636936, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.2847326360547446, | |
| "eval_real_f0_5": 0.47371638141809297, | |
| "eval_real_f0_5_m0": 0.4501055966209081, | |
| "eval_real_f0_5_m0.1": 0.4613259668508288, | |
| "eval_real_f0_5_m0.2": 0.47164351851851855, | |
| "eval_real_f0_5_m0.3": 0.47371638141809297, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.30371481179172755, | |
| "grad_norm": 0.1810256987810135, | |
| "learning_rate": 0.0002929902582353787, | |
| "loss": 1.227394775390625, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.32269698752871057, | |
| "grad_norm": 0.18248461186885834, | |
| "learning_rate": 0.00029148107006276056, | |
| "loss": 1.22420361328125, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.34167916326569353, | |
| "grad_norm": 0.1456211358308792, | |
| "learning_rate": 0.0002898295432331011, | |
| "loss": 1.22528125, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.3606613390026765, | |
| "grad_norm": 0.1682305634021759, | |
| "learning_rate": 0.0002880373392839537, | |
| "loss": 1.2209486083984376, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.37964351473965946, | |
| "grad_norm": 0.1455032080411911, | |
| "learning_rate": 0.00028610626128270495, | |
| "loss": 1.222905029296875, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.37964351473965946, | |
| "eval_correction_accuracy": 0.9729365736386112, | |
| "eval_detection_f1": 0.5878967328292231, | |
| "eval_loss": 1.2507761716842651, | |
| "eval_runtime": 60.7194, | |
| "eval_samples_per_second": 369.602, | |
| "eval_steps_per_second": 2.899, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.37964351473965946, | |
| "eval_edit_f0_5": 0.8773855767606823, | |
| "eval_edit_f0_5_m0": 0.8642143753752115, | |
| "eval_edit_f0_5_m0.1": 0.871961638097338, | |
| "eval_edit_f0_5_m0.2": 0.8739938939772413, | |
| "eval_edit_f0_5_m0.3": 0.8773855767606823, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.37964351473965946, | |
| "eval_real_f0_5": 0.43992027334851935, | |
| "eval_real_f0_5_m0": 0.4214697406340058, | |
| "eval_real_f0_5_m0.1": 0.42792792792792794, | |
| "eval_real_f0_5_m0.2": 0.42728237791932056, | |
| "eval_real_f0_5_m0.3": 0.43992027334851935, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.3986256904766424, | |
| "grad_norm": 0.20864084362983704, | |
| "learning_rate": 0.0002840382520125783, | |
| "loss": 1.22280712890625, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.4176078662136254, | |
| "grad_norm": 0.19003528356552124, | |
| "learning_rate": 0.0002818353920180744, | |
| "loss": 1.221659423828125, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 0.43659004195060835, | |
| "grad_norm": 0.1750059872865677, | |
| "learning_rate": 0.0002794998975118153, | |
| "loss": 1.2191646728515626, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 0.4555722176875914, | |
| "grad_norm": 0.13223567605018616, | |
| "learning_rate": 0.00027703411814489855, | |
| "loss": 1.216736328125, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 0.47455439342457434, | |
| "grad_norm": 0.10733171552419662, | |
| "learning_rate": 0.00027444053464300346, | |
| "loss": 1.2142664794921876, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 0.47455439342457434, | |
| "eval_correction_accuracy": 0.9733371445263059, | |
| "eval_detection_f1": 0.5704304192239259, | |
| "eval_loss": 1.2477121353149414, | |
| "eval_runtime": 60.6105, | |
| "eval_samples_per_second": 370.266, | |
| "eval_steps_per_second": 2.904, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 0.47455439342457434, | |
| "eval_edit_f0_5": 0.8926609218668673, | |
| "eval_edit_f0_5_m0": 0.8845489496851842, | |
| "eval_edit_f0_5_m0.1": 0.8883563574851988, | |
| "eval_edit_f0_5_m0.2": 0.89086859688196, | |
| "eval_edit_f0_5_m0.3": 0.8926609218668673, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 0.47455439342457434, | |
| "eval_real_f0_5": 0.4787581699346405, | |
| "eval_real_f0_5_m0": 0.43419633225458465, | |
| "eval_real_f0_5_m0.1": 0.44776119402985065, | |
| "eval_real_f0_5_m0.2": 0.46760391198044005, | |
| "eval_real_f0_5_m0.3": 0.4787581699346405, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 0.4935365691615573, | |
| "grad_norm": 0.1579447090625763, | |
| "learning_rate": 0.0002717217563106287, | |
| "loss": 1.21451904296875, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 0.5125187448985403, | |
| "grad_norm": 0.13867036998271942, | |
| "learning_rate": 0.00026888051840597135, | |
| "loss": 1.2117508544921876, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 0.5315009206355232, | |
| "grad_norm": 0.11431417614221573, | |
| "learning_rate": 0.00026591967938908897, | |
| "loss": 1.2146973876953124, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 0.5504830963725063, | |
| "grad_norm": 0.14605163037776947, | |
| "learning_rate": 0.00026284221804611323, | |
| "loss": 1.211010498046875, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 0.5694652721094892, | |
| "grad_norm": 0.13300460577011108, | |
| "learning_rate": 0.0002596512304924075, | |
| "loss": 1.2157716064453126, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 0.5694652721094892, | |
| "eval_correction_accuracy": 0.9736186980555992, | |
| "eval_detection_f1": 0.6009406304526895, | |
| "eval_loss": 1.2431864738464355, | |
| "eval_runtime": 60.2876, | |
| "eval_samples_per_second": 372.249, | |
| "eval_steps_per_second": 2.919, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 0.5694652721094892, | |
| "eval_edit_f0_5": 0.8888329698596432, | |
| "eval_edit_f0_5_m0": 0.8778231292517006, | |
| "eval_edit_f0_5_m0.1": 0.8819654131210541, | |
| "eval_edit_f0_5_m0.2": 0.8855925167432335, | |
| "eval_edit_f0_5_m0.3": 0.8888329698596432, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 0.5694652721094892, | |
| "eval_real_f0_5": 0.4537767756482525, | |
| "eval_real_f0_5_m0": 0.4154693486590038, | |
| "eval_real_f0_5_m0.1": 0.42251755265797397, | |
| "eval_real_f0_5_m0.2": 0.4458512931034483, | |
| "eval_real_f0_5_m0.3": 0.4537767756482525, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 0.5884474478464722, | |
| "grad_norm": 0.16023032367229462, | |
| "learning_rate": 0.0002563499270576846, | |
| "loss": 1.21418017578125, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 0.6074296235834551, | |
| "grad_norm": 0.14038224518299103, | |
| "learning_rate": 0.0002529416290562178, | |
| "loss": 1.2102242431640624, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 0.6264117993204381, | |
| "grad_norm": 0.19150033593177795, | |
| "learning_rate": 0.00024942976544539404, | |
| "loss": 1.21311474609375, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 0.6453939750574211, | |
| "grad_norm": 0.13594546914100647, | |
| "learning_rate": 0.0002458178693759725, | |
| "loss": 1.2101019287109376, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 0.664376150794404, | |
| "grad_norm": 0.0971856564283371, | |
| "learning_rate": 0.00024210957463751702, | |
| "loss": 1.2085975341796875, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 0.664376150794404, | |
| "eval_correction_accuracy": 0.9739441000853563, | |
| "eval_detection_f1": 0.6041727242827385, | |
| "eval_loss": 1.2378469705581665, | |
| "eval_runtime": 60.7237, | |
| "eval_samples_per_second": 369.575, | |
| "eval_steps_per_second": 2.898, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 0.664376150794404, | |
| "eval_edit_f0_5": 0.8950703830407717, | |
| "eval_edit_f0_5_m0": 0.8823850308221047, | |
| "eval_edit_f0_5_m0.1": 0.8891276795062545, | |
| "eval_edit_f0_5_m0.2": 0.891679139641887, | |
| "eval_edit_f0_5_m0.3": 0.8950703830407717, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 0.664376150794404, | |
| "eval_real_f0_5": 0.45221843003412976, | |
| "eval_real_f0_5_m0": 0.4207080504364695, | |
| "eval_real_f0_5_m0.1": 0.4268916155419223, | |
| "eval_real_f0_5_m0.2": 0.43951612903225806, | |
| "eval_real_f0_5_m0.3": 0.45221843003412976, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 0.6833583265313871, | |
| "grad_norm": 0.23436909914016724, | |
| "learning_rate": 0.00023830861200258084, | |
| "loss": 1.2103984375, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 0.70234050226837, | |
| "grad_norm": 0.10302391648292542, | |
| "learning_rate": 0.00023441880547331984, | |
| "loss": 1.209429443359375, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 0.721322678005353, | |
| "grad_norm": 0.16614890098571777, | |
| "learning_rate": 0.00023044406843431085, | |
| "loss": 1.210209228515625, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 0.7403048537423359, | |
| "grad_norm": 0.12630845606327057, | |
| "learning_rate": 0.00022638839971544675, | |
| "loss": 1.2063096923828125, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 0.7592870294793189, | |
| "grad_norm": 0.16276787221431732, | |
| "learning_rate": 0.00022225587956886718, | |
| "loss": 1.20748486328125, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 0.7592870294793189, | |
| "eval_correction_accuracy": 0.974335110021822, | |
| "eval_detection_f1": 0.6143125770798066, | |
| "eval_loss": 1.234763264656067, | |
| "eval_runtime": 60.5996, | |
| "eval_samples_per_second": 370.332, | |
| "eval_steps_per_second": 2.904, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 0.7592870294793189, | |
| "eval_edit_f0_5": 0.9024403864410565, | |
| "eval_edit_f0_5_m0": 0.8842469830618539, | |
| "eval_edit_f0_5_m0.1": 0.8886223627541842, | |
| "eval_edit_f0_5_m0.2": 0.8945219837810999, | |
| "eval_edit_f0_5_m0.3": 0.9024403864410565, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 0.7592870294793189, | |
| "eval_real_f0_5": 0.4630195599022005, | |
| "eval_real_f0_5_m0": 0.44520547945205474, | |
| "eval_real_f0_5_m0.1": 0.4467213114754099, | |
| "eval_real_f0_5_m0.2": 0.4604503464203233, | |
| "eval_real_f0_5_m0.3": 0.4630195599022005, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 0.7782692052163019, | |
| "grad_norm": 0.16368603706359863, | |
| "learning_rate": 0.0002180506655639742, | |
| "loss": 1.20710107421875, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 0.7972513809532848, | |
| "grad_norm": 0.1419440507888794, | |
| "learning_rate": 0.00021377698840466171, | |
| "loss": 1.207209716796875, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 0.8162335566902679, | |
| "grad_norm": 0.2440534383058548, | |
| "learning_rate": 0.00020943914767296716, | |
| "loss": 1.203267333984375, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 0.8352157324272508, | |
| "grad_norm": 0.11360731720924377, | |
| "learning_rate": 0.00020504150750342767, | |
| "loss": 1.2064322509765626, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 0.8541979081642338, | |
| "grad_norm": 0.19054335355758667, | |
| "learning_rate": 0.00020058849219249225, | |
| "loss": 1.2044508056640626, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 0.8541979081642338, | |
| "eval_correction_accuracy": 0.9746169932390887, | |
| "eval_detection_f1": 0.6164803461954562, | |
| "eval_loss": 1.2325071096420288, | |
| "eval_runtime": 60.5986, | |
| "eval_samples_per_second": 370.339, | |
| "eval_steps_per_second": 2.904, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 0.8541979081642338, | |
| "eval_edit_f0_5": 0.9041808921475346, | |
| "eval_edit_f0_5_m0": 0.8936088786835056, | |
| "eval_edit_f0_5_m0.1": 0.8979367262723521, | |
| "eval_edit_f0_5_m0.2": 0.9006915629322267, | |
| "eval_edit_f0_5_m0.3": 0.9041808921475346, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 0.8541979081642338, | |
| "eval_real_f0_5": 0.43545659526493796, | |
| "eval_real_f0_5_m0": 0.4005456349206349, | |
| "eval_real_f0_5_m0.1": 0.4166666666666667, | |
| "eval_real_f0_5_m0.2": 0.4315960912052117, | |
| "eval_real_f0_5_m0.3": 0.43545659526493796, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 0.8731800839012167, | |
| "grad_norm": 0.15163150429725647, | |
| "learning_rate": 0.00019608458174740764, | |
| "loss": 1.205394287109375, | |
| "step": 23000 | |
| }, | |
| { | |
| "epoch": 0.8921622596381997, | |
| "grad_norm": 0.1204524040222168, | |
| "learning_rate": 0.00019153430737905516, | |
| "loss": 1.20386767578125, | |
| "step": 23500 | |
| }, | |
| { | |
| "epoch": 0.9111444353751827, | |
| "grad_norm": 0.14975769817829132, | |
| "learning_rate": 0.00018694224694327434, | |
| "loss": 1.2036343994140626, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 0.9301266111121657, | |
| "grad_norm": 0.09973002225160599, | |
| "learning_rate": 0.0001823130203352581, | |
| "loss": 1.202430419921875, | |
| "step": 24500 | |
| }, | |
| { | |
| "epoch": 0.9491087868491487, | |
| "grad_norm": 0.12494324147701263, | |
| "learning_rate": 0.00017765128484165446, | |
| "loss": 1.203585205078125, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 0.9491087868491487, | |
| "eval_correction_accuracy": 0.9748879967532328, | |
| "eval_detection_f1": 0.6170252572497661, | |
| "eval_loss": 1.2309163808822632, | |
| "eval_runtime": 59.979, | |
| "eval_samples_per_second": 374.164, | |
| "eval_steps_per_second": 2.934, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 0.9491087868491487, | |
| "eval_edit_f0_5": 0.9054563883101525, | |
| "eval_edit_f0_5_m0": 0.8931397696883698, | |
| "eval_edit_f0_5_m0.1": 0.8968065743753791, | |
| "eval_edit_f0_5_m0.2": 0.9016347709646821, | |
| "eval_edit_f0_5_m0.3": 0.9054563883101525, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 0.9491087868491487, | |
| "eval_real_f0_5": 0.46703296703296693, | |
| "eval_real_f0_5_m0": 0.43244626407369496, | |
| "eval_real_f0_5_m0.1": 0.44786096256684493, | |
| "eval_real_f0_5_m0.2": 0.45962199312714774, | |
| "eval_real_f0_5_m0.3": 0.46703296703296693, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 0.9680909625861316, | |
| "grad_norm": 0.14670301973819733, | |
| "learning_rate": 0.00017296173045504914, | |
| "loss": 1.2033277587890625, | |
| "step": 25500 | |
| }, | |
| { | |
| "epoch": 0.9870731383231146, | |
| "grad_norm": 0.10602114349603653, | |
| "learning_rate": 0.00016824907515554526, | |
| "loss": 1.201916748046875, | |
| "step": 26000 | |
| }, | |
| { | |
| "epoch": 1.0060363318843606, | |
| "grad_norm": 0.06282790750265121, | |
| "learning_rate": 0.00016351806016418486, | |
| "loss": 1.199654541015625, | |
| "step": 26500 | |
| }, | |
| { | |
| "epoch": 1.0250185076213436, | |
| "grad_norm": 0.06489919126033783, | |
| "learning_rate": 0.00015877344517298893, | |
| "loss": 1.19592431640625, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 1.0440006833583266, | |
| "grad_norm": 0.06663327664136887, | |
| "learning_rate": 0.0001540200035564149, | |
| "loss": 1.19781689453125, | |
| "step": 27500 | |
| }, | |
| { | |
| "epoch": 1.0440006833583266, | |
| "eval_correction_accuracy": 0.9751896612489042, | |
| "eval_detection_f1": 0.6337458056595326, | |
| "eval_loss": 1.2278345823287964, | |
| "eval_runtime": 60.4482, | |
| "eval_samples_per_second": 371.26, | |
| "eval_steps_per_second": 2.912, | |
| "step": 27500 | |
| }, | |
| { | |
| "epoch": 1.0440006833583266, | |
| "eval_edit_f0_5": 0.9052714133661981, | |
| "eval_edit_f0_5_m0": 0.8921670023406456, | |
| "eval_edit_f0_5_m0.1": 0.896949711459192, | |
| "eval_edit_f0_5_m0.2": 0.9007485444968119, | |
| "eval_edit_f0_5_m0.3": 0.9052714133661981, | |
| "step": 27500 | |
| }, | |
| { | |
| "epoch": 1.0440006833583266, | |
| "eval_real_f0_5": 0.47462941847206386, | |
| "eval_real_f0_5_m0": 0.4401750972762646, | |
| "eval_real_f0_5_m0.1": 0.46072895277207393, | |
| "eval_real_f0_5_m0.2": 0.4667207792207792, | |
| "eval_real_f0_5_m0.3": 0.47462941847206386, | |
| "step": 27500 | |
| }, | |
| { | |
| "epoch": 1.0629828590953094, | |
| "grad_norm": 0.06707123667001724, | |
| "learning_rate": 0.0001492625175690478, | |
| "loss": 1.196161865234375, | |
| "step": 28000 | |
| }, | |
| { | |
| "epoch": 1.0819650348322924, | |
| "grad_norm": 0.04345293343067169, | |
| "learning_rate": 0.00014450577353435873, | |
| "loss": 1.1952852783203125, | |
| "step": 28500 | |
| }, | |
| { | |
| "epoch": 1.1009472105692755, | |
| "grad_norm": 0.03876705467700958, | |
| "learning_rate": 0.00013975455702936845, | |
| "loss": 1.19596826171875, | |
| "step": 29000 | |
| }, | |
| { | |
| "epoch": 1.1199293863062585, | |
| "grad_norm": 0.054508332163095474, | |
| "learning_rate": 0.00013501364807006326, | |
| "loss": 1.1936068115234375, | |
| "step": 29500 | |
| }, | |
| { | |
| "epoch": 1.1389115620432415, | |
| "grad_norm": 0.05647437274456024, | |
| "learning_rate": 0.0001302878163024043, | |
| "loss": 1.19433984375, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 1.1389115620432415, | |
| "eval_correction_accuracy": 0.9752921942086351, | |
| "eval_detection_f1": 0.6477482980155775, | |
| "eval_loss": 1.2278577089309692, | |
| "eval_runtime": 59.9225, | |
| "eval_samples_per_second": 374.517, | |
| "eval_steps_per_second": 2.937, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 1.1389115620432415, | |
| "eval_edit_f0_5": 0.9029944709038156, | |
| "eval_edit_f0_5_m0": 0.8870581982460802, | |
| "eval_edit_f0_5_m0.1": 0.8917932478127851, | |
| "eval_edit_f0_5_m0.2": 0.8975887293416418, | |
| "eval_edit_f0_5_m0.3": 0.9029944709038156, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 1.1389115620432415, | |
| "eval_real_f0_5": 0.46045785639958375, | |
| "eval_real_f0_5_m0": 0.411169744942832, | |
| "eval_real_f0_5_m0.1": 0.4227605118829982, | |
| "eval_real_f0_5_m0.2": 0.4366602687140115, | |
| "eval_real_f0_5_m0.3": 0.46045785639958375, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 1.1578937377802243, | |
| "grad_norm": 0.08290459215641022, | |
| "learning_rate": 0.00012558181620377085, | |
| "loss": 1.196980224609375, | |
| "step": 30500 | |
| }, | |
| { | |
| "epoch": 1.1768759135172073, | |
| "grad_norm": 0.03389839455485344, | |
| "learning_rate": 0.00012090038229966375, | |
| "loss": 1.19385400390625, | |
| "step": 31000 | |
| }, | |
| { | |
| "epoch": 1.1958580892541903, | |
| "grad_norm": 0.03219689056277275, | |
| "learning_rate": 0.0001162482244004811, | |
| "loss": 1.1932216796875, | |
| "step": 31500 | |
| }, | |
| { | |
| "epoch": 1.2148402649911734, | |
| "grad_norm": 0.03629528358578682, | |
| "learning_rate": 0.00011163002286315993, | |
| "loss": 1.1932420654296876, | |
| "step": 32000 | |
| }, | |
| { | |
| "epoch": 1.2338224407281562, | |
| "grad_norm": 0.05208583176136017, | |
| "learning_rate": 0.00010705042388244893, | |
| "loss": 1.1948599853515625, | |
| "step": 32500 | |
| }, | |
| { | |
| "epoch": 1.2338224407281562, | |
| "eval_correction_accuracy": 0.9756340806370627, | |
| "eval_detection_f1": 0.6500135636133466, | |
| "eval_loss": 1.2252331972122192, | |
| "eval_runtime": 60.3519, | |
| "eval_samples_per_second": 371.852, | |
| "eval_steps_per_second": 2.916, | |
| "step": 32500 | |
| }, | |
| { | |
| "epoch": 1.2338224407281562, | |
| "eval_edit_f0_5": 0.9102684230832827, | |
| "eval_edit_f0_5_m0": 0.8981327019318732, | |
| "eval_edit_f0_5_m0.1": 0.9021497806898794, | |
| "eval_edit_f0_5_m0.2": 0.9072063717200373, | |
| "eval_edit_f0_5_m0.3": 0.9102684230832827, | |
| "step": 32500 | |
| }, | |
| { | |
| "epoch": 1.2338224407281562, | |
| "eval_real_f0_5": 0.4674586776859504, | |
| "eval_real_f0_5_m0": 0.4159212880143113, | |
| "eval_real_f0_5_m0.1": 0.4346804511278195, | |
| "eval_real_f0_5_m0.2": 0.4519704433497537, | |
| "eval_real_f0_5_m0.3": 0.4674586776859504, | |
| "step": 32500 | |
| }, | |
| { | |
| "epoch": 1.2528046164651392, | |
| "grad_norm": 0.06928142160177231, | |
| "learning_rate": 0.00010251403481655096, | |
| "loss": 1.1938966064453125, | |
| "step": 33000 | |
| }, | |
| { | |
| "epoch": 1.2717867922021222, | |
| "grad_norm": 0.05749162659049034, | |
| "learning_rate": 9.80254195518373e-05, | |
| "loss": 1.1921290283203125, | |
| "step": 33500 | |
| }, | |
| { | |
| "epoch": 1.2907689679391052, | |
| "grad_norm": 0.04986289143562317, | |
| "learning_rate": 9.358909391129737e-05, | |
| "loss": 1.19255517578125, | |
| "step": 34000 | |
| }, | |
| { | |
| "epoch": 1.3097511436760882, | |
| "grad_norm": 0.1535189300775528, | |
| "learning_rate": 8.920952111134303e-05, | |
| "loss": 1.19104052734375, | |
| "step": 34500 | |
| }, | |
| { | |
| "epoch": 1.328733319413071, | |
| "grad_norm": 0.042191170156002045, | |
| "learning_rate": 8.489110727153841e-05, | |
| "loss": 1.191498779296875, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 1.328733319413071, | |
| "eval_correction_accuracy": 0.9758862919367224, | |
| "eval_detection_f1": 0.6438216536684808, | |
| "eval_loss": 1.2241498231887817, | |
| "eval_runtime": 59.6334, | |
| "eval_samples_per_second": 376.333, | |
| "eval_steps_per_second": 2.951, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 1.328733319413071, | |
| "eval_edit_f0_5": 0.9100482181455414, | |
| "eval_edit_f0_5_m0": 0.9021638917511796, | |
| "eval_edit_f0_5_m0.1": 0.9037821317469846, | |
| "eval_edit_f0_5_m0.2": 0.9073168050134681, | |
| "eval_edit_f0_5_m0.3": 0.9100482181455414, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 1.328733319413071, | |
| "eval_real_f0_5": 0.4544167610419026, | |
| "eval_real_f0_5_m0": 0.4211689587426326, | |
| "eval_real_f0_5_m0.1": 0.42387983706720966, | |
| "eval_real_f0_5_m0.2": 0.4281914893617021, | |
| "eval_real_f0_5_m0.3": 0.4544167610419026, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 1.347715495150054, | |
| "grad_norm": 0.029605668038129807, | |
| "learning_rate": 8.063819698177278e-05, | |
| "loss": 1.192787841796875, | |
| "step": 35500 | |
| }, | |
| { | |
| "epoch": 1.366697670887037, | |
| "grad_norm": 0.048531949520111084, | |
| "learning_rate": 7.645506893133574e-05, | |
| "loss": 1.190103759765625, | |
| "step": 36000 | |
| }, | |
| { | |
| "epoch": 1.38567984662402, | |
| "grad_norm": 0.03906732425093651, | |
| "learning_rate": 7.234593160429277e-05, | |
| "loss": 1.18997265625, | |
| "step": 36500 | |
| }, | |
| { | |
| "epoch": 1.404662022361003, | |
| "grad_norm": 0.03661827743053436, | |
| "learning_rate": 6.831491904549145e-05, | |
| "loss": 1.191602294921875, | |
| "step": 37000 | |
| }, | |
| { | |
| "epoch": 1.423644198097986, | |
| "grad_norm": 0.043553389608860016, | |
| "learning_rate": 6.436608670145828e-05, | |
| "loss": 1.1902423095703125, | |
| "step": 37500 | |
| }, | |
| { | |
| "epoch": 1.423644198097986, | |
| "eval_correction_accuracy": 0.9760330030848904, | |
| "eval_detection_f1": 0.6487232574189096, | |
| "eval_loss": 1.222518801689148, | |
| "eval_runtime": 60.4683, | |
| "eval_samples_per_second": 371.137, | |
| "eval_steps_per_second": 2.911, | |
| "step": 37500 | |
| }, | |
| { | |
| "epoch": 1.423644198097986, | |
| "eval_edit_f0_5": 0.9084162497938542, | |
| "eval_edit_f0_5_m0": 0.8946242310778283, | |
| "eval_edit_f0_5_m0.1": 0.9003717872730211, | |
| "eval_edit_f0_5_m0.2": 0.9063674492074731, | |
| "eval_edit_f0_5_m0.3": 0.9084162497938542, | |
| "step": 37500 | |
| }, | |
| { | |
| "epoch": 1.423644198097986, | |
| "eval_real_f0_5": 0.44614147909967844, | |
| "eval_real_f0_5_m0": 0.4033728350045579, | |
| "eval_real_f0_5_m0.1": 0.4206963249516441, | |
| "eval_real_f0_5_m0.2": 0.4333333333333333, | |
| "eval_real_f0_5_m0.3": 0.44614147909967844, | |
| "step": 37500 | |
| }, | |
| { | |
| "epoch": 1.442626373834969, | |
| "grad_norm": 0.045576661825180054, | |
| "learning_rate": 6.050340734036973e-05, | |
| "loss": 1.1904107666015624, | |
| "step": 38000 | |
| }, | |
| { | |
| "epoch": 1.461608549571952, | |
| "grad_norm": 0.04765897989273071, | |
| "learning_rate": 5.673076705520346e-05, | |
| "loss": 1.1911429443359376, | |
| "step": 38500 | |
| }, | |
| { | |
| "epoch": 1.480590725308935, | |
| "grad_norm": 0.10767372697591782, | |
| "learning_rate": 5.3051961354089736e-05, | |
| "loss": 1.1882059326171874, | |
| "step": 39000 | |
| }, | |
| { | |
| "epoch": 1.499572901045918, | |
| "grad_norm": 0.036085955798625946, | |
| "learning_rate": 4.94706913417966e-05, | |
| "loss": 1.190911376953125, | |
| "step": 39500 | |
| }, | |
| { | |
| "epoch": 1.5185550767829008, | |
| "grad_norm": 0.08071824908256531, | |
| "learning_rate": 4.599055999619126e-05, | |
| "loss": 1.1896280517578126, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 1.5185550767829008, | |
| "eval_correction_accuracy": 0.976151361067345, | |
| "eval_detection_f1": 0.6554347875581136, | |
| "eval_loss": 1.2218546867370605, | |
| "eval_runtime": 60.355, | |
| "eval_samples_per_second": 371.833, | |
| "eval_steps_per_second": 2.916, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 1.5185550767829008, | |
| "eval_edit_f0_5": 0.910992458853966, | |
| "eval_edit_f0_5_m0": 0.9010734128054373, | |
| "eval_edit_f0_5_m0.1": 0.9040790831568084, | |
| "eval_edit_f0_5_m0.2": 0.9071533963604569, | |
| "eval_edit_f0_5_m0.3": 0.910992458853966, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 1.5185550767829008, | |
| "eval_real_f0_5": 0.44711014176663033, | |
| "eval_real_f0_5_m0": 0.4186210131332083, | |
| "eval_real_f0_5_m0.1": 0.4342492639842983, | |
| "eval_real_f0_5_m0.2": 0.4353493222106361, | |
| "eval_real_f0_5_m0.3": 0.44711014176663033, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 1.5375372525198838, | |
| "grad_norm": 0.030372846871614456, | |
| "learning_rate": 4.2615068543422434e-05, | |
| "loss": 1.19057763671875, | |
| "step": 40500 | |
| }, | |
| { | |
| "epoch": 1.5565194282568668, | |
| "grad_norm": 0.03362102061510086, | |
| "learning_rate": 3.934761293547178e-05, | |
| "loss": 1.1867962646484376, | |
| "step": 41000 | |
| }, | |
| { | |
| "epoch": 1.5755016039938496, | |
| "grad_norm": 0.057195816189050674, | |
| "learning_rate": 3.619148043361715e-05, | |
| "loss": 1.1873057861328125, | |
| "step": 41500 | |
| }, | |
| { | |
| "epoch": 1.5944837797308327, | |
| "grad_norm": 0.03772829845547676, | |
| "learning_rate": 3.314984630124587e-05, | |
| "loss": 1.1879420166015624, | |
| "step": 42000 | |
| }, | |
| { | |
| "epoch": 1.6134659554678157, | |
| "grad_norm": 0.1718292534351349, | |
| "learning_rate": 3.022577060934427e-05, | |
| "loss": 1.1901536865234374, | |
| "step": 42500 | |
| }, | |
| { | |
| "epoch": 1.6134659554678157, | |
| "eval_correction_accuracy": 0.9762463112036875, | |
| "eval_detection_f1": 0.6603370175756478, | |
| "eval_loss": 1.2204469442367554, | |
| "eval_runtime": 59.5936, | |
| "eval_samples_per_second": 376.584, | |
| "eval_steps_per_second": 2.953, | |
| "step": 42500 | |
| }, | |
| { | |
| "epoch": 1.6134659554678157, | |
| "eval_edit_f0_5": 0.9098653476229733, | |
| "eval_edit_f0_5_m0": 0.8979657559980677, | |
| "eval_edit_f0_5_m0.1": 0.9045865598093898, | |
| "eval_edit_f0_5_m0.2": 0.9075277034772642, | |
| "eval_edit_f0_5_m0.3": 0.9098653476229733, | |
| "step": 42500 | |
| }, | |
| { | |
| "epoch": 1.6134659554678157, | |
| "eval_real_f0_5": 0.44262720664589816, | |
| "eval_real_f0_5_m0": 0.42281105990783413, | |
| "eval_real_f0_5_m0.1": 0.4292809839167455, | |
| "eval_real_f0_5_m0.2": 0.43297455968688847, | |
| "eval_real_f0_5_m0.3": 0.44262720664589816, | |
| "step": 42500 | |
| }, | |
| { | |
| "epoch": 1.6324481312047987, | |
| "grad_norm": 0.027738308534026146, | |
| "learning_rate": 2.742219515787808e-05, | |
| "loss": 1.186643798828125, | |
| "step": 43000 | |
| }, | |
| { | |
| "epoch": 1.6514303069417817, | |
| "grad_norm": 0.03820585086941719, | |
| "learning_rate": 2.4741940516161014e-05, | |
| "loss": 1.1873551025390625, | |
| "step": 43500 | |
| }, | |
| { | |
| "epoch": 1.6704124826787647, | |
| "grad_norm": 0.05109170451760292, | |
| "learning_rate": 2.2187703185188212e-05, | |
| "loss": 1.1882010498046875, | |
| "step": 44000 | |
| }, | |
| { | |
| "epoch": 1.6893946584157478, | |
| "grad_norm": 0.04304545372724533, | |
| "learning_rate": 1.9762052884790763e-05, | |
| "loss": 1.18957080078125, | |
| "step": 44500 | |
| }, | |
| { | |
| "epoch": 1.7083768341527306, | |
| "grad_norm": 0.05135943740606308, | |
| "learning_rate": 1.7467429968339254e-05, | |
| "loss": 1.1895230712890625, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 1.7083768341527306, | |
| "eval_correction_accuracy": 0.9763739004493976, | |
| "eval_detection_f1": 0.6614078220399721, | |
| "eval_loss": 1.220071792602539, | |
| "eval_runtime": 60.3321, | |
| "eval_samples_per_second": 371.975, | |
| "eval_steps_per_second": 2.917, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 1.7083768341527306, | |
| "eval_edit_f0_5": 0.912360661138872, | |
| "eval_edit_f0_5_m0": 0.9017536332922186, | |
| "eval_edit_f0_5_m0.1": 0.9063933099541408, | |
| "eval_edit_f0_5_m0.2": 0.9094366273700224, | |
| "eval_edit_f0_5_m0.3": 0.912360661138872, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 1.7083768341527306, | |
| "eval_real_f0_5": 0.44325313807531386, | |
| "eval_real_f0_5_m0": 0.4201485608170845, | |
| "eval_real_f0_5_m0.1": 0.42870905587668595, | |
| "eval_real_f0_5_m0.2": 0.4367469879518072, | |
| "eval_real_f0_5_m0.3": 0.44325313807531386, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 1.7273590098897136, | |
| "grad_norm": 0.03698679432272911, | |
| "learning_rate": 1.5306142967598462e-05, | |
| "loss": 1.1872025146484375, | |
| "step": 45500 | |
| }, | |
| { | |
| "epoch": 1.7463411856266964, | |
| "grad_norm": 0.043697986751794815, | |
| "learning_rate": 1.3280366270202187e-05, | |
| "loss": 1.1902381591796876, | |
| "step": 46000 | |
| }, | |
| { | |
| "epoch": 1.7653233613636794, | |
| "grad_norm": 0.0478336326777935, | |
| "learning_rate": 1.1392137932085692e-05, | |
| "loss": 1.188957763671875, | |
| "step": 46500 | |
| }, | |
| { | |
| "epoch": 1.7843055371006624, | |
| "grad_norm": 0.04866790026426315, | |
| "learning_rate": 9.643357627076176e-06, | |
| "loss": 1.188841064453125, | |
| "step": 47000 | |
| }, | |
| { | |
| "epoch": 1.8032877128376454, | |
| "grad_norm": 0.08654382824897766, | |
| "learning_rate": 8.035784735703915e-06, | |
| "loss": 1.1869093017578125, | |
| "step": 47500 | |
| }, | |
| { | |
| "epoch": 1.8032877128376454, | |
| "eval_correction_accuracy": 0.9764408271080002, | |
| "eval_detection_f1": 0.6623505252062661, | |
| "eval_loss": 1.2196118831634521, | |
| "eval_runtime": 60.2937, | |
| "eval_samples_per_second": 372.211, | |
| "eval_steps_per_second": 2.919, | |
| "step": 47500 | |
| }, | |
| { | |
| "epoch": 1.8032877128376454, | |
| "eval_edit_f0_5": 0.9131843391356872, | |
| "eval_edit_f0_5_m0": 0.901242536711312, | |
| "eval_edit_f0_5_m0.1": 0.9049602423324499, | |
| "eval_edit_f0_5_m0.2": 0.9078295881168726, | |
| "eval_edit_f0_5_m0.3": 0.9131843391356872, | |
| "step": 47500 | |
| }, | |
| { | |
| "epoch": 1.8032877128376454, | |
| "eval_real_f0_5": 0.4527455121436114, | |
| "eval_real_f0_5_m0": 0.4291393826005612, | |
| "eval_real_f0_5_m0.1": 0.4339440694310511, | |
| "eval_real_f0_5_m0.2": 0.4473161033797216, | |
| "eval_real_f0_5_m0.3": 0.4527455121436114, | |
| "step": 47500 | |
| }, | |
| { | |
| "epoch": 1.8222698885746285, | |
| "grad_norm": 0.07231193780899048, | |
| "learning_rate": 6.571036575157384e-06, | |
| "loss": 1.187695556640625, | |
| "step": 48000 | |
| }, | |
| { | |
| "epoch": 1.8412520643116115, | |
| "grad_norm": 0.04208879545331001, | |
| "learning_rate": 5.250586772162613e-06, | |
| "loss": 1.1868779296875, | |
| "step": 48500 | |
| }, | |
| { | |
| "epoch": 1.8602342400485945, | |
| "grad_norm": 0.08146563172340393, | |
| "learning_rate": 4.07576378042419e-06, | |
| "loss": 1.1862469482421876, | |
| "step": 49000 | |
| }, | |
| { | |
| "epoch": 1.8792164157855773, | |
| "grad_norm": 0.035731397569179535, | |
| "learning_rate": 3.047749544119016e-06, | |
| "loss": 1.1868427734375, | |
| "step": 49500 | |
| }, | |
| { | |
| "epoch": 1.8981985915225603, | |
| "grad_norm": 0.049494218081235886, | |
| "learning_rate": 2.167578308787865e-06, | |
| "loss": 1.18650390625, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 1.8981985915225603, | |
| "eval_correction_accuracy": 0.9764698396496604, | |
| "eval_detection_f1": 0.662213053912394, | |
| "eval_loss": 1.219179391860962, | |
| "eval_runtime": 60.3298, | |
| "eval_samples_per_second": 371.989, | |
| "eval_steps_per_second": 2.917, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 1.8981985915225603, | |
| "eval_edit_f0_5": 0.9142088207832153, | |
| "eval_edit_f0_5_m0": 0.904126540054877, | |
| "eval_edit_f0_5_m0.1": 0.9078098748035337, | |
| "eval_edit_f0_5_m0.2": 0.9097596861206475, | |
| "eval_edit_f0_5_m0.3": 0.9142088207832153, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 1.8981985915225603, | |
| "eval_real_f0_5": 0.44823906083244397, | |
| "eval_real_f0_5_m0": 0.4280018761726078, | |
| "eval_real_f0_5_m0.1": 0.43232177263969174, | |
| "eval_real_f0_5_m0.2": 0.4433867735470942, | |
| "eval_real_f0_5_m0.3": 0.44823906083244397, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 1.9171807672595433, | |
| "grad_norm": 0.0926298126578331, | |
| "learning_rate": 1.4361355808207353e-06, | |
| "loss": 1.187315185546875, | |
| "step": 50500 | |
| }, | |
| { | |
| "epoch": 1.9361629429965261, | |
| "grad_norm": 0.11386485397815704, | |
| "learning_rate": 8.541572365829363e-07, | |
| "loss": 1.1902998046875, | |
| "step": 51000 | |
| }, | |
| { | |
| "epoch": 1.9551451187335092, | |
| "grad_norm": 0.048688311129808426, | |
| "learning_rate": 4.2222878207828217e-07, | |
| "loss": 1.1860992431640625, | |
| "step": 51500 | |
| }, | |
| { | |
| "epoch": 1.9741272944704922, | |
| "grad_norm": 0.06769584864377975, | |
| "learning_rate": 1.4078476389400295e-07, | |
| "loss": 1.1888084716796874, | |
| "step": 52000 | |
| }, | |
| { | |
| "epoch": 1.9931094702074752, | |
| "grad_norm": 0.07460489124059677, | |
| "learning_rate": 1.0108332020136723e-08, | |
| "loss": 1.18935546875, | |
| "step": 52500 | |
| }, | |
| { | |
| "epoch": 1.9931094702074752, | |
| "eval_correction_accuracy": 0.9764662130819528, | |
| "eval_detection_f1": 0.6630512720440745, | |
| "eval_loss": 1.2193742990493774, | |
| "eval_runtime": 60.8208, | |
| "eval_samples_per_second": 368.986, | |
| "eval_steps_per_second": 2.894, | |
| "step": 52500 | |
| }, | |
| { | |
| "epoch": 1.9931094702074752, | |
| "eval_edit_f0_5": 0.9142088207832153, | |
| "eval_edit_f0_5_m0": 0.9029758381316256, | |
| "eval_edit_f0_5_m0.1": 0.9068269178712576, | |
| "eval_edit_f0_5_m0.2": 0.9093632550792529, | |
| "eval_edit_f0_5_m0.3": 0.9142088207832153, | |
| "step": 52500 | |
| }, | |
| { | |
| "epoch": 1.9931094702074752, | |
| "eval_real_f0_5": 0.44435654008438813, | |
| "eval_real_f0_5_m0": 0.4244186046511629, | |
| "eval_real_f0_5_m0.1": 0.4325548141086749, | |
| "eval_real_f0_5_m0.2": 0.441542288557214, | |
| "eval_real_f0_5_m0.3": 0.44435654008438813, | |
| "step": 52500 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_correction_accuracy": 0.9764688505857402, | |
| "eval_detection_f1": 0.6630633574310311, | |
| "eval_loss": 1.2193818092346191, | |
| "eval_runtime": 60.4207, | |
| "eval_samples_per_second": 371.429, | |
| "eval_steps_per_second": 2.913, | |
| "step": 52682 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_edit_f0_5": 0.9141350326869196, | |
| "eval_edit_f0_5_m0": 0.9029758381316256, | |
| "eval_edit_f0_5_m0.1": 0.9072940921644014, | |
| "eval_edit_f0_5_m0.2": 0.9094374557534174, | |
| "eval_edit_f0_5_m0.3": 0.9141350326869196, | |
| "step": 52682 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_real_f0_5": 0.4445554445554446, | |
| "eval_real_f0_5_m0": 0.42520969245107176, | |
| "eval_real_f0_5_m0.1": 0.4333333333333333, | |
| "eval_real_f0_5_m0.2": 0.4445554445554446, | |
| "eval_real_f0_5_m0.3": 0.44435654008438813, | |
| "step": 52682 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "step": 52682, | |
| "total_flos": 1.2253359357726764e+18, | |
| "train_loss": 1.2582929586659106, | |
| "train_runtime": 35190.4052, | |
| "train_samples_per_second": 95.809, | |
| "train_steps_per_second": 1.497 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_correction_accuracy": 0.9764632458901922, | |
| "eval_detection_f1": 0.6630996628137579, | |
| "eval_loss": 1.2194472551345825, | |
| "eval_runtime": 60.5158, | |
| "eval_samples_per_second": 370.845, | |
| "eval_steps_per_second": 2.908, | |
| "step": 52682 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_edit_f0_5": 0.9141350326869196, | |
| "eval_edit_f0_5_m0": 0.9029758381316256, | |
| "eval_edit_f0_5_m0.1": 0.9072940921644014, | |
| "eval_edit_f0_5_m0.2": 0.9094374557534174, | |
| "eval_edit_f0_5_m0.3": 0.9141350326869196, | |
| "step": 52682 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_real_f0_5": 0.4445554445554446, | |
| "eval_real_f0_5_m0": 0.42520969245107176, | |
| "eval_real_f0_5_m0.1": 0.4333333333333333, | |
| "eval_real_f0_5_m0.2": 0.4445554445554446, | |
| "eval_real_f0_5_m0.3": 0.44435654008438813, | |
| "step": 52682 | |
| } | |
| ], | |
| "logging_steps": 500, | |
| "max_steps": 52682, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 2500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.2253359357726764e+18, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |