diff --git "a/checkpoints/latest/trainer_state.json" "b/checkpoints/latest/trainer_state.json" new file mode 100644--- /dev/null +++ "b/checkpoints/latest/trainer_state.json" @@ -0,0 +1,4454 @@ +{ + "best_metric": 0.9587281193044483, + "best_model_checkpoint": "outputs/TypePredictor/checkpoints/checkpoint-25000", + "epoch": 3.9994047382832654, + "eval_steps": 500, + "global_step": 25196, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "epoch": 0.007936822889797215, + "grad_norm": 50.20066833496094, + "learning_rate": 1.8253968253968257e-07, + "loss": 4.1606, + "step": 50 + }, + { + "epoch": 0.01587364577959443, + "grad_norm": 103.1044692993164, + "learning_rate": 3.80952380952381e-07, + "loss": 3.4782, + "step": 100 + }, + { + "epoch": 0.023810468669391644, + "grad_norm": 29.89408302307129, + "learning_rate": 5.793650793650794e-07, + "loss": 2.7518, + "step": 150 + }, + { + "epoch": 0.03174729155918886, + "grad_norm": 26.819448471069336, + "learning_rate": 7.738095238095239e-07, + "loss": 2.5176, + "step": 200 + }, + { + "epoch": 0.03968411444898607, + "grad_norm": 41.28379440307617, + "learning_rate": 9.722222222222224e-07, + "loss": 2.4074, + "step": 250 + }, + { + "epoch": 0.04762093733878329, + "grad_norm": 24.081151962280273, + "learning_rate": 1.1706349206349208e-06, + "loss": 2.2454, + "step": 300 + }, + { + "epoch": 0.0555577602285805, + "grad_norm": 27.1600341796875, + "learning_rate": 1.3690476190476193e-06, + "loss": 2.2193, + "step": 350 + }, + { + "epoch": 0.06349458311837772, + "grad_norm": 35.915611267089844, + "learning_rate": 1.5674603174603175e-06, + "loss": 2.0748, + "step": 400 + }, + { + "epoch": 0.07143140600817492, + "grad_norm": 25.79641342163086, + "learning_rate": 1.765873015873016e-06, + "loss": 1.9517, + "step": 450 + }, + { + "epoch": 0.07936822889797214, + "grad_norm": 32.5029182434082, + "learning_rate": 1.9642857142857144e-06, + "loss": 1.7744, + "step": 500 + }, + { + "epoch": 0.07936822889797214, + "eval_accuracy": 0.4996031746031746, + "eval_loss": 1.6034170389175415, + "eval_macro_f1": 0.16675213835131356, + "eval_macro_precision": 0.20112826287340668, + "eval_macro_recall": 0.1656798423386093, + "eval_micro_f1": 0.4996031746031746, + "eval_micro_precision": 0.4996031746031746, + "eval_micro_recall": 0.4996031746031746, + "eval_runtime": 50.3632, + "eval_samples_per_second": 250.183, + "eval_steps_per_second": 31.273, + "eval_weighted_f1": 0.4648136683073095, + "eval_weighted_precision": 0.4663299729027011, + "eval_weighted_recall": 0.4996031746031746, + "step": 500 + }, + { + "epoch": 0.08730505178776936, + "grad_norm": 32.64176940917969, + "learning_rate": 2.1626984126984128e-06, + "loss": 1.6452, + "step": 550 + }, + { + "epoch": 0.09524187467756658, + "grad_norm": 26.72295379638672, + "learning_rate": 2.361111111111111e-06, + "loss": 1.5402, + "step": 600 + }, + { + "epoch": 0.10317869756736378, + "grad_norm": 33.789302825927734, + "learning_rate": 2.5595238095238095e-06, + "loss": 1.4583, + "step": 650 + }, + { + "epoch": 0.111115520457161, + "grad_norm": 40.20470428466797, + "learning_rate": 2.7579365079365083e-06, + "loss": 1.338, + "step": 700 + }, + { + "epoch": 0.11905234334695822, + "grad_norm": 26.672527313232422, + "learning_rate": 2.9563492063492066e-06, + "loss": 1.2152, + "step": 750 + }, + { + "epoch": 0.12698916623675544, + "grad_norm": 26.061119079589844, + "learning_rate": 3.154761904761905e-06, + "loss": 1.1735, + "step": 800 + }, + { + "epoch": 0.13492598912655265, + "grad_norm": 49.5890007019043, + "learning_rate": 3.3531746031746034e-06, + "loss": 1.059, + "step": 850 + }, + { + "epoch": 0.14286281201634984, + "grad_norm": 34.52119827270508, + "learning_rate": 3.551587301587302e-06, + "loss": 0.9615, + "step": 900 + }, + { + "epoch": 0.15079963490614706, + "grad_norm": 41.126792907714844, + "learning_rate": 3.7500000000000005e-06, + "loss": 1.0047, + "step": 950 + }, + { + "epoch": 0.15873645779594428, + "grad_norm": 38.969017028808594, + "learning_rate": 3.9484126984126985e-06, + "loss": 0.8757, + "step": 1000 + }, + { + "epoch": 0.15873645779594428, + "eval_accuracy": 0.7561111111111111, + "eval_loss": 0.8336577415466309, + "eval_macro_f1": 0.3742962053337755, + "eval_macro_precision": 0.4440270170632841, + "eval_macro_recall": 0.36141326244744065, + "eval_micro_f1": 0.7561111111111111, + "eval_micro_precision": 0.7561111111111111, + "eval_micro_recall": 0.7561111111111111, + "eval_runtime": 50.358, + "eval_samples_per_second": 250.208, + "eval_steps_per_second": 31.276, + "eval_weighted_f1": 0.7347115811510523, + "eval_weighted_precision": 0.739827037528709, + "eval_weighted_recall": 0.7561111111111111, + "step": 1000 + }, + { + "epoch": 0.1666732806857415, + "grad_norm": 41.12884521484375, + "learning_rate": 4.146825396825397e-06, + "loss": 0.8476, + "step": 1050 + }, + { + "epoch": 0.17461010357553872, + "grad_norm": 20.529150009155273, + "learning_rate": 4.345238095238096e-06, + "loss": 0.799, + "step": 1100 + }, + { + "epoch": 0.18254692646533593, + "grad_norm": 31.87129783630371, + "learning_rate": 4.543650793650794e-06, + "loss": 0.8004, + "step": 1150 + }, + { + "epoch": 0.19048374935513315, + "grad_norm": 32.46973419189453, + "learning_rate": 4.742063492063492e-06, + "loss": 0.7508, + "step": 1200 + }, + { + "epoch": 0.19842057224493034, + "grad_norm": 23.948808670043945, + "learning_rate": 4.940476190476191e-06, + "loss": 0.6721, + "step": 1250 + }, + { + "epoch": 0.20635739513472756, + "grad_norm": 31.930994033813477, + "learning_rate": 5.138888888888889e-06, + "loss": 0.6309, + "step": 1300 + }, + { + "epoch": 0.21429421802452478, + "grad_norm": 22.865070343017578, + "learning_rate": 5.337301587301587e-06, + "loss": 0.6133, + "step": 1350 + }, + { + "epoch": 0.222231040914322, + "grad_norm": 27.975875854492188, + "learning_rate": 5.535714285714286e-06, + "loss": 0.6472, + "step": 1400 + }, + { + "epoch": 0.23016786380411922, + "grad_norm": 17.48501968383789, + "learning_rate": 5.734126984126984e-06, + "loss": 0.5141, + "step": 1450 + }, + { + "epoch": 0.23810468669391643, + "grad_norm": 8.121456146240234, + "learning_rate": 5.932539682539683e-06, + "loss": 0.6094, + "step": 1500 + }, + { + "epoch": 0.23810468669391643, + "eval_accuracy": 0.8311111111111111, + "eval_loss": 0.5750956535339355, + "eval_macro_f1": 0.5919220318807322, + "eval_macro_precision": 0.6615551279169473, + "eval_macro_recall": 0.5725095316587115, + "eval_micro_f1": 0.8311111111111111, + "eval_micro_precision": 0.8311111111111111, + "eval_micro_recall": 0.8311111111111111, + "eval_runtime": 50.1384, + "eval_samples_per_second": 251.304, + "eval_steps_per_second": 31.413, + "eval_weighted_f1": 0.8258660663106083, + "eval_weighted_precision": 0.8313369703842328, + "eval_weighted_recall": 0.8311111111111111, + "step": 1500 + }, + { + "epoch": 0.24604150958371365, + "grad_norm": 52.50892639160156, + "learning_rate": 6.130952380952382e-06, + "loss": 0.5746, + "step": 1550 + }, + { + "epoch": 0.25397833247351087, + "grad_norm": 21.188108444213867, + "learning_rate": 6.32936507936508e-06, + "loss": 0.6786, + "step": 1600 + }, + { + "epoch": 0.26191515536330806, + "grad_norm": 37.73038101196289, + "learning_rate": 6.5277777777777784e-06, + "loss": 0.5529, + "step": 1650 + }, + { + "epoch": 0.2698519782531053, + "grad_norm": 31.049955368041992, + "learning_rate": 6.726190476190477e-06, + "loss": 0.5307, + "step": 1700 + }, + { + "epoch": 0.2777888011429025, + "grad_norm": 13.330388069152832, + "learning_rate": 6.924603174603175e-06, + "loss": 0.5919, + "step": 1750 + }, + { + "epoch": 0.2857256240326997, + "grad_norm": 29.72938346862793, + "learning_rate": 7.123015873015874e-06, + "loss": 0.5222, + "step": 1800 + }, + { + "epoch": 0.29366244692249693, + "grad_norm": 20.42317008972168, + "learning_rate": 7.321428571428572e-06, + "loss": 0.4796, + "step": 1850 + }, + { + "epoch": 0.3015992698122941, + "grad_norm": 29.127174377441406, + "learning_rate": 7.519841269841271e-06, + "loss": 0.499, + "step": 1900 + }, + { + "epoch": 0.30953609270209137, + "grad_norm": 18.9819278717041, + "learning_rate": 7.718253968253969e-06, + "loss": 0.4897, + "step": 1950 + }, + { + "epoch": 0.31747291559188856, + "grad_norm": 34.057342529296875, + "learning_rate": 7.916666666666667e-06, + "loss": 0.4944, + "step": 2000 + }, + { + "epoch": 0.31747291559188856, + "eval_accuracy": 0.8685714285714285, + "eval_loss": 0.43678638339042664, + "eval_macro_f1": 0.704721130059806, + "eval_macro_precision": 0.8084736830738437, + "eval_macro_recall": 0.6569171685565485, + "eval_micro_f1": 0.8685714285714285, + "eval_micro_precision": 0.8685714285714285, + "eval_micro_recall": 0.8685714285714285, + "eval_runtime": 54.0525, + "eval_samples_per_second": 233.107, + "eval_steps_per_second": 29.138, + "eval_weighted_f1": 0.8650850638163624, + "eval_weighted_precision": 0.8704622381617023, + "eval_weighted_recall": 0.8685714285714285, + "step": 2000 + }, + { + "epoch": 0.3254097384816858, + "grad_norm": 32.23432159423828, + "learning_rate": 8.115079365079366e-06, + "loss": 0.4503, + "step": 2050 + }, + { + "epoch": 0.333346561371483, + "grad_norm": 19.20964813232422, + "learning_rate": 8.313492063492064e-06, + "loss": 0.4846, + "step": 2100 + }, + { + "epoch": 0.3412833842612802, + "grad_norm": 22.326303482055664, + "learning_rate": 8.511904761904762e-06, + "loss": 0.4545, + "step": 2150 + }, + { + "epoch": 0.34922020715107743, + "grad_norm": 39.84929275512695, + "learning_rate": 8.710317460317462e-06, + "loss": 0.4542, + "step": 2200 + }, + { + "epoch": 0.3571570300408746, + "grad_norm": 20.93601417541504, + "learning_rate": 8.90873015873016e-06, + "loss": 0.5178, + "step": 2250 + }, + { + "epoch": 0.36509385293067187, + "grad_norm": 8.917716979980469, + "learning_rate": 9.107142857142858e-06, + "loss": 0.3944, + "step": 2300 + }, + { + "epoch": 0.37303067582046906, + "grad_norm": 14.799666404724121, + "learning_rate": 9.305555555555557e-06, + "loss": 0.3669, + "step": 2350 + }, + { + "epoch": 0.3809674987102663, + "grad_norm": 25.97331428527832, + "learning_rate": 9.503968253968255e-06, + "loss": 0.3843, + "step": 2400 + }, + { + "epoch": 0.3889043216000635, + "grad_norm": 13.379817008972168, + "learning_rate": 9.702380952380953e-06, + "loss": 0.3901, + "step": 2450 + }, + { + "epoch": 0.3968411444898607, + "grad_norm": 18.588956832885742, + "learning_rate": 9.900793650793653e-06, + "loss": 0.3913, + "step": 2500 + }, + { + "epoch": 0.3968411444898607, + "eval_accuracy": 0.8876190476190476, + "eval_loss": 0.3863752782344818, + "eval_macro_f1": 0.7708534077145469, + "eval_macro_precision": 0.8424204092431431, + "eval_macro_recall": 0.7602036693520349, + "eval_micro_f1": 0.8876190476190476, + "eval_micro_precision": 0.8876190476190476, + "eval_micro_recall": 0.8876190476190476, + "eval_runtime": 58.1835, + "eval_samples_per_second": 216.556, + "eval_steps_per_second": 27.07, + "eval_weighted_f1": 0.8866826747603135, + "eval_weighted_precision": 0.894918351088462, + "eval_weighted_recall": 0.8876190476190476, + "step": 2500 + }, + { + "epoch": 0.40477796737965793, + "grad_norm": 26.919750213623047, + "learning_rate": 9.988975127888518e-06, + "loss": 0.3492, + "step": 2550 + }, + { + "epoch": 0.4127147902694551, + "grad_norm": 24.233909606933594, + "learning_rate": 9.96692538366555e-06, + "loss": 0.4253, + "step": 2600 + }, + { + "epoch": 0.42065161315925237, + "grad_norm": 8.280208587646484, + "learning_rate": 9.944875639442584e-06, + "loss": 0.3656, + "step": 2650 + }, + { + "epoch": 0.42858843604904956, + "grad_norm": 0.9590346813201904, + "learning_rate": 9.922825895219616e-06, + "loss": 0.4059, + "step": 2700 + }, + { + "epoch": 0.4365252589388468, + "grad_norm": 6.837221145629883, + "learning_rate": 9.90077615099665e-06, + "loss": 0.3804, + "step": 2750 + }, + { + "epoch": 0.444462081828644, + "grad_norm": 26.77887535095215, + "learning_rate": 9.878726406773682e-06, + "loss": 0.3876, + "step": 2800 + }, + { + "epoch": 0.4523989047184412, + "grad_norm": 1.809899091720581, + "learning_rate": 9.856676662550716e-06, + "loss": 0.3292, + "step": 2850 + }, + { + "epoch": 0.46033572760823843, + "grad_norm": 24.776517868041992, + "learning_rate": 9.83462691832775e-06, + "loss": 0.3909, + "step": 2900 + }, + { + "epoch": 0.4682725504980356, + "grad_norm": 33.20071792602539, + "learning_rate": 9.812577174104782e-06, + "loss": 0.3396, + "step": 2950 + }, + { + "epoch": 0.47620937338783287, + "grad_norm": 25.043102264404297, + "learning_rate": 9.790527429881814e-06, + "loss": 0.3553, + "step": 3000 + }, + { + "epoch": 0.47620937338783287, + "eval_accuracy": 0.9049206349206349, + "eval_loss": 0.3749255836009979, + "eval_macro_f1": 0.83146311466218, + "eval_macro_precision": 0.8822616279099216, + "eval_macro_recall": 0.8044703495421244, + "eval_micro_f1": 0.9049206349206349, + "eval_micro_precision": 0.9049206349206349, + "eval_micro_recall": 0.9049206349206349, + "eval_runtime": 51.2979, + "eval_samples_per_second": 245.624, + "eval_steps_per_second": 30.703, + "eval_weighted_f1": 0.9042368915226878, + "eval_weighted_precision": 0.9091398319969811, + "eval_weighted_recall": 0.9049206349206349, + "step": 3000 + }, + { + "epoch": 0.48414619627763006, + "grad_norm": 14.722782135009766, + "learning_rate": 9.768477685658848e-06, + "loss": 0.3143, + "step": 3050 + }, + { + "epoch": 0.4920830191674273, + "grad_norm": 14.118471145629883, + "learning_rate": 9.74642794143588e-06, + "loss": 0.398, + "step": 3100 + }, + { + "epoch": 0.5000198420572245, + "grad_norm": 12.885693550109863, + "learning_rate": 9.724378197212914e-06, + "loss": 0.278, + "step": 3150 + }, + { + "epoch": 0.5079566649470217, + "grad_norm": 11.429601669311523, + "learning_rate": 9.702328452989946e-06, + "loss": 0.3612, + "step": 3200 + }, + { + "epoch": 0.5158934878368189, + "grad_norm": 11.400711059570312, + "learning_rate": 9.68027870876698e-06, + "loss": 0.276, + "step": 3250 + }, + { + "epoch": 0.5238303107266161, + "grad_norm": 9.139787673950195, + "learning_rate": 9.658228964544012e-06, + "loss": 0.2994, + "step": 3300 + }, + { + "epoch": 0.5317671336164134, + "grad_norm": 22.870264053344727, + "learning_rate": 9.636179220321044e-06, + "loss": 0.3084, + "step": 3350 + }, + { + "epoch": 0.5397039565062106, + "grad_norm": 12.863465309143066, + "learning_rate": 9.61412947609808e-06, + "loss": 0.3557, + "step": 3400 + }, + { + "epoch": 0.5476407793960077, + "grad_norm": 22.37148094177246, + "learning_rate": 9.592079731875112e-06, + "loss": 0.3276, + "step": 3450 + }, + { + "epoch": 0.555577602285805, + "grad_norm": 11.454520225524902, + "learning_rate": 9.570029987652144e-06, + "loss": 0.308, + "step": 3500 + }, + { + "epoch": 0.555577602285805, + "eval_accuracy": 0.9016666666666666, + "eval_loss": 0.34068959951400757, + "eval_macro_f1": 0.852643844128256, + "eval_macro_precision": 0.8869002266347256, + "eval_macro_recall": 0.8344066000317897, + "eval_micro_f1": 0.9016666666666666, + "eval_micro_precision": 0.9016666666666666, + "eval_micro_recall": 0.9016666666666666, + "eval_runtime": 55.1712, + "eval_samples_per_second": 228.38, + "eval_steps_per_second": 28.547, + "eval_weighted_f1": 0.9056553567113477, + "eval_weighted_precision": 0.9166483950530401, + "eval_weighted_recall": 0.9016666666666666, + "step": 3500 + }, + { + "epoch": 0.5635144251756022, + "grad_norm": 10.13657283782959, + "learning_rate": 9.547980243429178e-06, + "loss": 0.2969, + "step": 3550 + }, + { + "epoch": 0.5714512480653994, + "grad_norm": 8.981364250183105, + "learning_rate": 9.52593049920621e-06, + "loss": 0.2571, + "step": 3600 + }, + { + "epoch": 0.5793880709551966, + "grad_norm": 16.016128540039062, + "learning_rate": 9.503880754983244e-06, + "loss": 0.3322, + "step": 3650 + }, + { + "epoch": 0.5873248938449939, + "grad_norm": 5.5154242515563965, + "learning_rate": 9.481831010760276e-06, + "loss": 0.3231, + "step": 3700 + }, + { + "epoch": 0.5952617167347911, + "grad_norm": 4.189787864685059, + "learning_rate": 9.45978126653731e-06, + "loss": 0.3301, + "step": 3750 + }, + { + "epoch": 0.6031985396245882, + "grad_norm": 9.305127143859863, + "learning_rate": 9.437731522314342e-06, + "loss": 0.2832, + "step": 3800 + }, + { + "epoch": 0.6111353625143855, + "grad_norm": 32.7320442199707, + "learning_rate": 9.415681778091374e-06, + "loss": 0.2736, + "step": 3850 + }, + { + "epoch": 0.6190721854041827, + "grad_norm": 12.206543922424316, + "learning_rate": 9.393632033868408e-06, + "loss": 0.2191, + "step": 3900 + }, + { + "epoch": 0.6270090082939799, + "grad_norm": 8.348316192626953, + "learning_rate": 9.371582289645441e-06, + "loss": 0.2834, + "step": 3950 + }, + { + "epoch": 0.6349458311837771, + "grad_norm": 12.099419593811035, + "learning_rate": 9.349532545422474e-06, + "loss": 0.2687, + "step": 4000 + }, + { + "epoch": 0.6349458311837771, + "eval_accuracy": 0.9234126984126985, + "eval_loss": 0.27018845081329346, + "eval_macro_f1": 0.8629184237562926, + "eval_macro_precision": 0.896103415544095, + "eval_macro_recall": 0.8427102453711095, + "eval_micro_f1": 0.9234126984126985, + "eval_micro_precision": 0.9234126984126985, + "eval_micro_recall": 0.9234126984126985, + "eval_runtime": 45.4117, + "eval_samples_per_second": 277.462, + "eval_steps_per_second": 34.683, + "eval_weighted_f1": 0.9225121978819937, + "eval_weighted_precision": 0.9237214610954837, + "eval_weighted_recall": 0.9234126984126985, + "step": 4000 + }, + { + "epoch": 0.6428826540735744, + "grad_norm": 6.140594959259033, + "learning_rate": 9.327482801199507e-06, + "loss": 0.2299, + "step": 4050 + }, + { + "epoch": 0.6508194769633716, + "grad_norm": 13.922382354736328, + "learning_rate": 9.30543305697654e-06, + "loss": 0.3092, + "step": 4100 + }, + { + "epoch": 0.6587562998531687, + "grad_norm": 21.830659866333008, + "learning_rate": 9.283383312753573e-06, + "loss": 0.2174, + "step": 4150 + }, + { + "epoch": 0.666693122742966, + "grad_norm": 5.917385101318359, + "learning_rate": 9.261333568530606e-06, + "loss": 0.3323, + "step": 4200 + }, + { + "epoch": 0.6746299456327632, + "grad_norm": 11.365561485290527, + "learning_rate": 9.23928382430764e-06, + "loss": 0.2597, + "step": 4250 + }, + { + "epoch": 0.6825667685225604, + "grad_norm": 9.686914443969727, + "learning_rate": 9.217234080084672e-06, + "loss": 0.2466, + "step": 4300 + }, + { + "epoch": 0.6905035914123576, + "grad_norm": 12.17849063873291, + "learning_rate": 9.195184335861704e-06, + "loss": 0.2752, + "step": 4350 + }, + { + "epoch": 0.6984404143021549, + "grad_norm": 16.642663955688477, + "learning_rate": 9.173134591638737e-06, + "loss": 0.2695, + "step": 4400 + }, + { + "epoch": 0.7063772371919521, + "grad_norm": 3.786797046661377, + "learning_rate": 9.151084847415771e-06, + "loss": 0.2697, + "step": 4450 + }, + { + "epoch": 0.7143140600817492, + "grad_norm": 13.046645164489746, + "learning_rate": 9.129035103192803e-06, + "loss": 0.3057, + "step": 4500 + }, + { + "epoch": 0.7143140600817492, + "eval_accuracy": 0.9284126984126985, + "eval_loss": 0.25139176845550537, + "eval_macro_f1": 0.8858543195103097, + "eval_macro_precision": 0.9001288293009205, + "eval_macro_recall": 0.8748161720063445, + "eval_micro_f1": 0.9284126984126985, + "eval_micro_precision": 0.9284126984126985, + "eval_micro_recall": 0.9284126984126985, + "eval_runtime": 65.3815, + "eval_samples_per_second": 192.715, + "eval_steps_per_second": 24.089, + "eval_weighted_f1": 0.9284553859947943, + "eval_weighted_precision": 0.9293969786750571, + "eval_weighted_recall": 0.9284126984126985, + "step": 4500 + }, + { + "epoch": 0.7222508829715465, + "grad_norm": 21.798290252685547, + "learning_rate": 9.106985358969837e-06, + "loss": 0.3534, + "step": 4550 + }, + { + "epoch": 0.7301877058613437, + "grad_norm": 1.7543187141418457, + "learning_rate": 9.08493561474687e-06, + "loss": 0.2373, + "step": 4600 + }, + { + "epoch": 0.7381245287511409, + "grad_norm": 17.317163467407227, + "learning_rate": 9.062885870523903e-06, + "loss": 0.2644, + "step": 4650 + }, + { + "epoch": 0.7460613516409381, + "grad_norm": 6.609444618225098, + "learning_rate": 9.040836126300935e-06, + "loss": 0.2586, + "step": 4700 + }, + { + "epoch": 0.7539981745307354, + "grad_norm": 6.7774176597595215, + "learning_rate": 9.01878638207797e-06, + "loss": 0.2228, + "step": 4750 + }, + { + "epoch": 0.7619349974205326, + "grad_norm": 2.356161117553711, + "learning_rate": 8.996736637855001e-06, + "loss": 0.2082, + "step": 4800 + }, + { + "epoch": 0.7698718203103297, + "grad_norm": 17.036968231201172, + "learning_rate": 8.974686893632034e-06, + "loss": 0.3077, + "step": 4850 + }, + { + "epoch": 0.777808643200127, + "grad_norm": 8.356477737426758, + "learning_rate": 8.952637149409067e-06, + "loss": 0.2918, + "step": 4900 + }, + { + "epoch": 0.7857454660899242, + "grad_norm": 2.3111681938171387, + "learning_rate": 8.930587405186101e-06, + "loss": 0.2871, + "step": 4950 + }, + { + "epoch": 0.7936822889797214, + "grad_norm": 9.850006103515625, + "learning_rate": 8.908537660963133e-06, + "loss": 0.2467, + "step": 5000 + }, + { + "epoch": 0.7936822889797214, + "eval_accuracy": 0.9337301587301587, + "eval_loss": 0.24514073133468628, + "eval_macro_f1": 0.8968955709213094, + "eval_macro_precision": 0.9239801593127872, + "eval_macro_recall": 0.8775447083795846, + "eval_micro_f1": 0.9337301587301587, + "eval_micro_precision": 0.9337301587301587, + "eval_micro_recall": 0.9337301587301587, + "eval_runtime": 55.1353, + "eval_samples_per_second": 228.529, + "eval_steps_per_second": 28.566, + "eval_weighted_f1": 0.9333867608778208, + "eval_weighted_precision": 0.9342365821570298, + "eval_weighted_recall": 0.9337301587301587, + "step": 5000 + }, + { + "epoch": 0.8016191118695186, + "grad_norm": 3.655590295791626, + "learning_rate": 8.886487916740166e-06, + "loss": 0.2314, + "step": 5050 + }, + { + "epoch": 0.8095559347593159, + "grad_norm": 1.2928906679153442, + "learning_rate": 8.8644381725172e-06, + "loss": 0.2448, + "step": 5100 + }, + { + "epoch": 0.8174927576491131, + "grad_norm": 1.8197067975997925, + "learning_rate": 8.842388428294233e-06, + "loss": 0.1976, + "step": 5150 + }, + { + "epoch": 0.8254295805389102, + "grad_norm": 0.5001784563064575, + "learning_rate": 8.820338684071265e-06, + "loss": 0.2934, + "step": 5200 + }, + { + "epoch": 0.8333664034287075, + "grad_norm": 1.4087576866149902, + "learning_rate": 8.7982889398483e-06, + "loss": 0.1564, + "step": 5250 + }, + { + "epoch": 0.8413032263185047, + "grad_norm": 16.14033317565918, + "learning_rate": 8.776239195625331e-06, + "loss": 0.2161, + "step": 5300 + }, + { + "epoch": 0.8492400492083019, + "grad_norm": 15.914708137512207, + "learning_rate": 8.754189451402363e-06, + "loss": 0.1935, + "step": 5350 + }, + { + "epoch": 0.8571768720980991, + "grad_norm": 0.31940773129463196, + "learning_rate": 8.732139707179397e-06, + "loss": 0.2073, + "step": 5400 + }, + { + "epoch": 0.8651136949878964, + "grad_norm": 15.5699462890625, + "learning_rate": 8.710089962956431e-06, + "loss": 0.2305, + "step": 5450 + }, + { + "epoch": 0.8730505178776936, + "grad_norm": 14.775138854980469, + "learning_rate": 8.688040218733463e-06, + "loss": 0.1914, + "step": 5500 + }, + { + "epoch": 0.8730505178776936, + "eval_accuracy": 0.9361904761904762, + "eval_loss": 0.2405300885438919, + "eval_macro_f1": 0.8852157589128977, + "eval_macro_precision": 0.8966852505493809, + "eval_macro_recall": 0.8879515092023682, + "eval_micro_f1": 0.9361904761904762, + "eval_micro_precision": 0.9361904761904762, + "eval_micro_recall": 0.9361904761904762, + "eval_runtime": 50.0976, + "eval_samples_per_second": 251.509, + "eval_steps_per_second": 31.439, + "eval_weighted_f1": 0.9373120231008413, + "eval_weighted_precision": 0.940336582906886, + "eval_weighted_recall": 0.9361904761904762, + "step": 5500 + }, + { + "epoch": 0.8809873407674907, + "grad_norm": 8.058653831481934, + "learning_rate": 8.665990474510495e-06, + "loss": 0.1996, + "step": 5550 + }, + { + "epoch": 0.888924163657288, + "grad_norm": 1.231372594833374, + "learning_rate": 8.64394073028753e-06, + "loss": 0.1763, + "step": 5600 + }, + { + "epoch": 0.8968609865470852, + "grad_norm": 25.968311309814453, + "learning_rate": 8.621890986064563e-06, + "loss": 0.219, + "step": 5650 + }, + { + "epoch": 0.9047978094368824, + "grad_norm": 23.313941955566406, + "learning_rate": 8.599841241841595e-06, + "loss": 0.2194, + "step": 5700 + }, + { + "epoch": 0.9127346323266796, + "grad_norm": 11.84118366241455, + "learning_rate": 8.577791497618629e-06, + "loss": 0.2463, + "step": 5750 + }, + { + "epoch": 0.9206714552164769, + "grad_norm": 18.897754669189453, + "learning_rate": 8.555741753395661e-06, + "loss": 0.2125, + "step": 5800 + }, + { + "epoch": 0.9286082781062741, + "grad_norm": 19.018964767456055, + "learning_rate": 8.533692009172693e-06, + "loss": 0.2493, + "step": 5850 + }, + { + "epoch": 0.9365451009960712, + "grad_norm": 2.0846264362335205, + "learning_rate": 8.511642264949727e-06, + "loss": 0.1844, + "step": 5900 + }, + { + "epoch": 0.9444819238858685, + "grad_norm": 10.483113288879395, + "learning_rate": 8.489592520726761e-06, + "loss": 0.2421, + "step": 5950 + }, + { + "epoch": 0.9524187467756657, + "grad_norm": 4.168255805969238, + "learning_rate": 8.467542776503793e-06, + "loss": 0.151, + "step": 6000 + }, + { + "epoch": 0.9524187467756657, + "eval_accuracy": 0.941984126984127, + "eval_loss": 0.2432594746351242, + "eval_macro_f1": 0.9103364146476316, + "eval_macro_precision": 0.9298312623198658, + "eval_macro_recall": 0.8954247781763811, + "eval_micro_f1": 0.941984126984127, + "eval_micro_precision": 0.941984126984127, + "eval_micro_recall": 0.941984126984127, + "eval_runtime": 49.9297, + "eval_samples_per_second": 252.355, + "eval_steps_per_second": 31.544, + "eval_weighted_f1": 0.9417305390461214, + "eval_weighted_precision": 0.9424591918065203, + "eval_weighted_recall": 0.941984126984127, + "step": 6000 + }, + { + "epoch": 0.9603555696654629, + "grad_norm": 16.349781036376953, + "learning_rate": 8.445493032280825e-06, + "loss": 0.2176, + "step": 6050 + }, + { + "epoch": 0.9682923925552601, + "grad_norm": 1.1434494256973267, + "learning_rate": 8.423443288057859e-06, + "loss": 0.2075, + "step": 6100 + }, + { + "epoch": 0.9762292154450574, + "grad_norm": 24.730289459228516, + "learning_rate": 8.401393543834893e-06, + "loss": 0.234, + "step": 6150 + }, + { + "epoch": 0.9841660383348546, + "grad_norm": 11.54680061340332, + "learning_rate": 8.379343799611925e-06, + "loss": 0.264, + "step": 6200 + }, + { + "epoch": 0.9921028612246517, + "grad_norm": 3.650730848312378, + "learning_rate": 8.357294055388959e-06, + "loss": 0.1762, + "step": 6250 + }, + { + "epoch": 1.0, + "grad_norm": 1.1564973592758179, + "learning_rate": 8.33568530605045e-06, + "loss": 0.1916, + "step": 6300 + }, + { + "epoch": 1.0079368228897971, + "grad_norm": 21.63304328918457, + "learning_rate": 8.313635561827483e-06, + "loss": 0.0975, + "step": 6350 + }, + { + "epoch": 1.0158736457795945, + "grad_norm": 23.74657440185547, + "learning_rate": 8.291585817604516e-06, + "loss": 0.1956, + "step": 6400 + }, + { + "epoch": 1.0238104686693916, + "grad_norm": 0.026358341798186302, + "learning_rate": 8.26953607338155e-06, + "loss": 0.124, + "step": 6450 + }, + { + "epoch": 1.0317472915591888, + "grad_norm": 0.22795121371746063, + "learning_rate": 8.247486329158582e-06, + "loss": 0.1537, + "step": 6500 + }, + { + "epoch": 1.0317472915591888, + "eval_accuracy": 0.9456349206349206, + "eval_loss": 0.22848264873027802, + "eval_macro_f1": 0.909507315203273, + "eval_macro_precision": 0.9296991239988623, + "eval_macro_recall": 0.8961337328597196, + "eval_micro_f1": 0.9456349206349206, + "eval_micro_precision": 0.9456349206349206, + "eval_micro_recall": 0.9456349206349206, + "eval_runtime": 48.6038, + "eval_samples_per_second": 259.239, + "eval_steps_per_second": 32.405, + "eval_weighted_f1": 0.9454117579717388, + "eval_weighted_precision": 0.9459939034429095, + "eval_weighted_recall": 0.9456349206349206, + "step": 6500 + }, + { + "epoch": 1.0396841144489861, + "grad_norm": 0.07601787894964218, + "learning_rate": 8.225436584935616e-06, + "loss": 0.179, + "step": 6550 + }, + { + "epoch": 1.0476209373387833, + "grad_norm": 0.028876453638076782, + "learning_rate": 8.203386840712648e-06, + "loss": 0.1539, + "step": 6600 + }, + { + "epoch": 1.0555577602285804, + "grad_norm": 1.7003881931304932, + "learning_rate": 8.18133709648968e-06, + "loss": 0.106, + "step": 6650 + }, + { + "epoch": 1.0634945831183777, + "grad_norm": 0.29444923996925354, + "learning_rate": 8.159287352266714e-06, + "loss": 0.1515, + "step": 6700 + }, + { + "epoch": 1.0714314060081749, + "grad_norm": 22.709447860717773, + "learning_rate": 8.137237608043748e-06, + "loss": 0.178, + "step": 6750 + }, + { + "epoch": 1.0793682288979722, + "grad_norm": 20.404773712158203, + "learning_rate": 8.11518786382078e-06, + "loss": 0.1122, + "step": 6800 + }, + { + "epoch": 1.0873050517877694, + "grad_norm": 4.415476322174072, + "learning_rate": 8.093138119597813e-06, + "loss": 0.0948, + "step": 6850 + }, + { + "epoch": 1.0952418746775665, + "grad_norm": 22.34918975830078, + "learning_rate": 8.071088375374846e-06, + "loss": 0.2517, + "step": 6900 + }, + { + "epoch": 1.1031786975673639, + "grad_norm": 16.816791534423828, + "learning_rate": 8.04903863115188e-06, + "loss": 0.1379, + "step": 6950 + }, + { + "epoch": 1.111115520457161, + "grad_norm": 12.884002685546875, + "learning_rate": 8.026988886928912e-06, + "loss": 0.1574, + "step": 7000 + }, + { + "epoch": 1.111115520457161, + "eval_accuracy": 0.9484126984126984, + "eval_loss": 0.20768418908119202, + "eval_macro_f1": 0.9125337197557731, + "eval_macro_precision": 0.9190348121850224, + "eval_macro_recall": 0.9113443135094732, + "eval_micro_f1": 0.9484126984126984, + "eval_micro_precision": 0.9484126984126984, + "eval_micro_recall": 0.9484126984126984, + "eval_runtime": 51.0028, + "eval_samples_per_second": 247.045, + "eval_steps_per_second": 30.881, + "eval_weighted_f1": 0.9481753539970462, + "eval_weighted_precision": 0.9487731067127975, + "eval_weighted_recall": 0.9484126984126984, + "step": 7000 + }, + { + "epoch": 1.1190523433469581, + "grad_norm": 1.1013977527618408, + "learning_rate": 8.004939142705944e-06, + "loss": 0.1002, + "step": 7050 + }, + { + "epoch": 1.1269891662367555, + "grad_norm": 26.22823143005371, + "learning_rate": 7.982889398482978e-06, + "loss": 0.1197, + "step": 7100 + }, + { + "epoch": 1.1349259891265526, + "grad_norm": 4.3102593421936035, + "learning_rate": 7.96083965426001e-06, + "loss": 0.1526, + "step": 7150 + }, + { + "epoch": 1.1428628120163498, + "grad_norm": 0.07969073206186295, + "learning_rate": 7.938789910037044e-06, + "loss": 0.1292, + "step": 7200 + }, + { + "epoch": 1.1507996349061471, + "grad_norm": 16.321470260620117, + "learning_rate": 7.916740165814078e-06, + "loss": 0.1533, + "step": 7250 + }, + { + "epoch": 1.1587364577959443, + "grad_norm": 48.117523193359375, + "learning_rate": 7.89469042159111e-06, + "loss": 0.0941, + "step": 7300 + }, + { + "epoch": 1.1666732806857416, + "grad_norm": 0.04194047302007675, + "learning_rate": 7.872640677368142e-06, + "loss": 0.1223, + "step": 7350 + }, + { + "epoch": 1.1746101035755387, + "grad_norm": 2.087705612182617, + "learning_rate": 7.850590933145176e-06, + "loss": 0.1968, + "step": 7400 + }, + { + "epoch": 1.1825469264653359, + "grad_norm": 1.1391172409057617, + "learning_rate": 7.82854118892221e-06, + "loss": 0.1461, + "step": 7450 + }, + { + "epoch": 1.1904837493551332, + "grad_norm": 0.41210365295410156, + "learning_rate": 7.806491444699242e-06, + "loss": 0.1406, + "step": 7500 + }, + { + "epoch": 1.1904837493551332, + "eval_accuracy": 0.9442857142857143, + "eval_loss": 0.2635294198989868, + "eval_macro_f1": 0.9057940212609807, + "eval_macro_precision": 0.911842211214998, + "eval_macro_recall": 0.9069588500794394, + "eval_micro_f1": 0.9442857142857143, + "eval_micro_precision": 0.9442857142857143, + "eval_micro_recall": 0.9442857142857143, + "eval_runtime": 53.2935, + "eval_samples_per_second": 236.427, + "eval_steps_per_second": 29.553, + "eval_weighted_f1": 0.9443844599149406, + "eval_weighted_precision": 0.945921955299144, + "eval_weighted_recall": 0.9442857142857143, + "step": 7500 + }, + { + "epoch": 1.1984205722449304, + "grad_norm": 1.8356152772903442, + "learning_rate": 7.784441700476274e-06, + "loss": 0.1513, + "step": 7550 + }, + { + "epoch": 1.2063573951347275, + "grad_norm": 2.8009727001190186, + "learning_rate": 7.762391956253308e-06, + "loss": 0.0998, + "step": 7600 + }, + { + "epoch": 1.2142942180245249, + "grad_norm": 0.1467098593711853, + "learning_rate": 7.74034221203034e-06, + "loss": 0.1355, + "step": 7650 + }, + { + "epoch": 1.222231040914322, + "grad_norm": 0.005296769086271524, + "learning_rate": 7.718292467807374e-06, + "loss": 0.144, + "step": 7700 + }, + { + "epoch": 1.2301678638041191, + "grad_norm": 20.8825626373291, + "learning_rate": 7.696242723584408e-06, + "loss": 0.1296, + "step": 7750 + }, + { + "epoch": 1.2381046866939165, + "grad_norm": 11.227338790893555, + "learning_rate": 7.67419297936144e-06, + "loss": 0.1395, + "step": 7800 + }, + { + "epoch": 1.2460415095837136, + "grad_norm": 0.8737878203392029, + "learning_rate": 7.652143235138472e-06, + "loss": 0.1257, + "step": 7850 + }, + { + "epoch": 1.253978332473511, + "grad_norm": 8.432129859924316, + "learning_rate": 7.630093490915506e-06, + "loss": 0.1778, + "step": 7900 + }, + { + "epoch": 1.2619151553633081, + "grad_norm": 18.125516891479492, + "learning_rate": 7.608043746692539e-06, + "loss": 0.1222, + "step": 7950 + }, + { + "epoch": 1.2698519782531053, + "grad_norm": 0.770737886428833, + "learning_rate": 7.585994002469572e-06, + "loss": 0.147, + "step": 8000 + }, + { + "epoch": 1.2698519782531053, + "eval_accuracy": 0.9494444444444444, + "eval_loss": 0.21279270946979523, + "eval_macro_f1": 0.9101912478331972, + "eval_macro_precision": 0.9273715052159579, + "eval_macro_recall": 0.901402436657646, + "eval_micro_f1": 0.9494444444444444, + "eval_micro_precision": 0.9494444444444444, + "eval_micro_recall": 0.9494444444444444, + "eval_runtime": 48.6141, + "eval_samples_per_second": 259.184, + "eval_steps_per_second": 32.398, + "eval_weighted_f1": 0.9491690418479931, + "eval_weighted_precision": 0.9504200289531454, + "eval_weighted_recall": 0.9494444444444444, + "step": 8000 + }, + { + "epoch": 1.2777888011429024, + "grad_norm": 2.4760684967041016, + "learning_rate": 7.563944258246605e-06, + "loss": 0.134, + "step": 8050 + }, + { + "epoch": 1.2857256240326997, + "grad_norm": 5.634617328643799, + "learning_rate": 7.541894514023638e-06, + "loss": 0.1468, + "step": 8100 + }, + { + "epoch": 1.2936624469224969, + "grad_norm": 9.858975410461426, + "learning_rate": 7.51984476980067e-06, + "loss": 0.1531, + "step": 8150 + }, + { + "epoch": 1.3015992698122942, + "grad_norm": 1.8135714530944824, + "learning_rate": 7.497795025577704e-06, + "loss": 0.1038, + "step": 8200 + }, + { + "epoch": 1.3095360927020914, + "grad_norm": 1.2420053482055664, + "learning_rate": 7.475745281354737e-06, + "loss": 0.1224, + "step": 8250 + }, + { + "epoch": 1.3174729155918885, + "grad_norm": 0.03956647962331772, + "learning_rate": 7.45369553713177e-06, + "loss": 0.1161, + "step": 8300 + }, + { + "epoch": 1.3254097384816859, + "grad_norm": 18.216032028198242, + "learning_rate": 7.4320867877932624e-06, + "loss": 0.1121, + "step": 8350 + }, + { + "epoch": 1.333346561371483, + "grad_norm": 15.097914695739746, + "learning_rate": 7.4100370435702954e-06, + "loss": 0.1237, + "step": 8400 + }, + { + "epoch": 1.3412833842612801, + "grad_norm": 0.09787029772996902, + "learning_rate": 7.3879872993473276e-06, + "loss": 0.1129, + "step": 8450 + }, + { + "epoch": 1.3492202071510775, + "grad_norm": 28.132888793945312, + "learning_rate": 7.365937555124361e-06, + "loss": 0.0994, + "step": 8500 + }, + { + "epoch": 1.3492202071510775, + "eval_accuracy": 0.9530952380952381, + "eval_loss": 0.21746815741062164, + "eval_macro_f1": 0.9156584913591659, + "eval_macro_precision": 0.9241711528138504, + "eval_macro_recall": 0.9152950181018766, + "eval_micro_f1": 0.9530952380952381, + "eval_micro_precision": 0.9530952380952381, + "eval_micro_recall": 0.9530952380952381, + "eval_runtime": 49.6088, + "eval_samples_per_second": 253.987, + "eval_steps_per_second": 31.748, + "eval_weighted_f1": 0.9528707065770654, + "eval_weighted_precision": 0.9533906189807044, + "eval_weighted_recall": 0.9530952380952381, + "step": 8500 + }, + { + "epoch": 1.3571570300408746, + "grad_norm": 0.09891881048679352, + "learning_rate": 7.343887810901394e-06, + "loss": 0.1426, + "step": 8550 + }, + { + "epoch": 1.3650938529306718, + "grad_norm": 0.06244092062115669, + "learning_rate": 7.321838066678427e-06, + "loss": 0.1188, + "step": 8600 + }, + { + "epoch": 1.3730306758204691, + "grad_norm": 9.950495719909668, + "learning_rate": 7.29978832245546e-06, + "loss": 0.1068, + "step": 8650 + }, + { + "epoch": 1.3809674987102663, + "grad_norm": 21.47039031982422, + "learning_rate": 7.2777385782324925e-06, + "loss": 0.1311, + "step": 8700 + }, + { + "epoch": 1.3889043216000636, + "grad_norm": 0.21059951186180115, + "learning_rate": 7.255688834009526e-06, + "loss": 0.1359, + "step": 8750 + }, + { + "epoch": 1.3968411444898607, + "grad_norm": 0.07483835518360138, + "learning_rate": 7.233639089786559e-06, + "loss": 0.1312, + "step": 8800 + }, + { + "epoch": 1.4047779673796579, + "grad_norm": 7.540125370025635, + "learning_rate": 7.211589345563592e-06, + "loss": 0.1883, + "step": 8850 + }, + { + "epoch": 1.412714790269455, + "grad_norm": 0.05421961471438408, + "learning_rate": 7.1895396013406245e-06, + "loss": 0.1313, + "step": 8900 + }, + { + "epoch": 1.4206516131592524, + "grad_norm": 25.743249893188477, + "learning_rate": 7.1674898571176575e-06, + "loss": 0.1866, + "step": 8950 + }, + { + "epoch": 1.4285884360490495, + "grad_norm": 15.702727317810059, + "learning_rate": 7.145440112894691e-06, + "loss": 0.1323, + "step": 9000 + }, + { + "epoch": 1.4285884360490495, + "eval_accuracy": 0.9544444444444444, + "eval_loss": 0.21344760060310364, + "eval_macro_f1": 0.9316646003398935, + "eval_macro_precision": 0.9481060096209216, + "eval_macro_recall": 0.9195331693514776, + "eval_micro_f1": 0.9544444444444444, + "eval_micro_precision": 0.9544444444444444, + "eval_micro_recall": 0.9544444444444444, + "eval_runtime": 49.9732, + "eval_samples_per_second": 252.135, + "eval_steps_per_second": 31.517, + "eval_weighted_f1": 0.9541756739346082, + "eval_weighted_precision": 0.9548010972085054, + "eval_weighted_recall": 0.9544444444444444, + "step": 9000 + }, + { + "epoch": 1.4365252589388469, + "grad_norm": 12.405553817749023, + "learning_rate": 7.123390368671724e-06, + "loss": 0.1462, + "step": 9050 + }, + { + "epoch": 1.444462081828644, + "grad_norm": 36.17345428466797, + "learning_rate": 7.101340624448757e-06, + "loss": 0.1289, + "step": 9100 + }, + { + "epoch": 1.4523989047184411, + "grad_norm": 21.679637908935547, + "learning_rate": 7.0792908802257894e-06, + "loss": 0.1316, + "step": 9150 + }, + { + "epoch": 1.4603357276082385, + "grad_norm": 13.572071075439453, + "learning_rate": 7.057241136002822e-06, + "loss": 0.1104, + "step": 9200 + }, + { + "epoch": 1.4682725504980356, + "grad_norm": 13.087688446044922, + "learning_rate": 7.035191391779856e-06, + "loss": 0.135, + "step": 9250 + }, + { + "epoch": 1.476209373387833, + "grad_norm": 0.5103034377098083, + "learning_rate": 7.013141647556889e-06, + "loss": 0.094, + "step": 9300 + }, + { + "epoch": 1.4841461962776301, + "grad_norm": 0.2972245514392853, + "learning_rate": 6.991091903333922e-06, + "loss": 0.1333, + "step": 9350 + }, + { + "epoch": 1.4920830191674272, + "grad_norm": 19.705307006835938, + "learning_rate": 6.969042159110954e-06, + "loss": 0.1014, + "step": 9400 + }, + { + "epoch": 1.5000198420572244, + "grad_norm": 17.829219818115234, + "learning_rate": 6.946992414887987e-06, + "loss": 0.0851, + "step": 9450 + }, + { + "epoch": 1.5079566649470217, + "grad_norm": 17.99626922607422, + "learning_rate": 6.924942670665021e-06, + "loss": 0.2011, + "step": 9500 + }, + { + "epoch": 1.5079566649470217, + "eval_accuracy": 0.9568253968253968, + "eval_loss": 0.19153176248073578, + "eval_macro_f1": 0.921610631007778, + "eval_macro_precision": 0.9404398497869574, + "eval_macro_recall": 0.905748060531071, + "eval_micro_f1": 0.9568253968253968, + "eval_micro_precision": 0.9568253968253968, + "eval_micro_recall": 0.9568253968253968, + "eval_runtime": 49.0787, + "eval_samples_per_second": 256.731, + "eval_steps_per_second": 32.091, + "eval_weighted_f1": 0.9566293314445607, + "eval_weighted_precision": 0.9568515996032587, + "eval_weighted_recall": 0.9568253968253968, + "step": 9500 + }, + { + "epoch": 1.5158934878368189, + "grad_norm": 3.1612911224365234, + "learning_rate": 6.902892926442054e-06, + "loss": 0.1468, + "step": 9550 + }, + { + "epoch": 1.5238303107266162, + "grad_norm": 1.6461035013198853, + "learning_rate": 6.880843182219087e-06, + "loss": 0.088, + "step": 9600 + }, + { + "epoch": 1.5317671336164134, + "grad_norm": 0.029310036450624466, + "learning_rate": 6.858793437996119e-06, + "loss": 0.0723, + "step": 9650 + }, + { + "epoch": 1.5397039565062105, + "grad_norm": 0.6573673486709595, + "learning_rate": 6.836743693773152e-06, + "loss": 0.131, + "step": 9700 + }, + { + "epoch": 1.5476407793960076, + "grad_norm": 0.0239870622754097, + "learning_rate": 6.814693949550186e-06, + "loss": 0.0713, + "step": 9750 + }, + { + "epoch": 1.555577602285805, + "grad_norm": 0.05512286350131035, + "learning_rate": 6.792644205327219e-06, + "loss": 0.1083, + "step": 9800 + }, + { + "epoch": 1.5635144251756024, + "grad_norm": 8.742629051208496, + "learning_rate": 6.770594461104252e-06, + "loss": 0.125, + "step": 9850 + }, + { + "epoch": 1.5714512480653995, + "grad_norm": 0.23801352083683014, + "learning_rate": 6.748544716881284e-06, + "loss": 0.1548, + "step": 9900 + }, + { + "epoch": 1.5793880709551966, + "grad_norm": 0.06436382979154587, + "learning_rate": 6.726494972658317e-06, + "loss": 0.1131, + "step": 9950 + }, + { + "epoch": 1.5873248938449938, + "grad_norm": 0.07321972399950027, + "learning_rate": 6.704445228435351e-06, + "loss": 0.1171, + "step": 10000 + }, + { + "epoch": 1.5873248938449938, + "eval_accuracy": 0.959920634920635, + "eval_loss": 0.19577036798000336, + "eval_macro_f1": 0.9235742546691592, + "eval_macro_precision": 0.9273628410860382, + "eval_macro_recall": 0.9271792802963574, + "eval_micro_f1": 0.959920634920635, + "eval_micro_precision": 0.959920634920635, + "eval_micro_recall": 0.959920634920635, + "eval_runtime": 60.9394, + "eval_samples_per_second": 206.763, + "eval_steps_per_second": 25.845, + "eval_weighted_f1": 0.9599028886198321, + "eval_weighted_precision": 0.960305322421165, + "eval_weighted_recall": 0.959920634920635, + "step": 10000 + }, + { + "epoch": 1.5952617167347911, + "grad_norm": 8.259378433227539, + "learning_rate": 6.682395484212384e-06, + "loss": 0.0956, + "step": 10050 + }, + { + "epoch": 1.6031985396245882, + "grad_norm": 0.8749714493751526, + "learning_rate": 6.660345739989417e-06, + "loss": 0.1274, + "step": 10100 + }, + { + "epoch": 1.6111353625143856, + "grad_norm": 3.652017116546631, + "learning_rate": 6.638295995766449e-06, + "loss": 0.1042, + "step": 10150 + }, + { + "epoch": 1.6190721854041827, + "grad_norm": 1.1253262758255005, + "learning_rate": 6.616246251543482e-06, + "loss": 0.0914, + "step": 10200 + }, + { + "epoch": 1.6270090082939799, + "grad_norm": 0.6077162623405457, + "learning_rate": 6.594196507320516e-06, + "loss": 0.1225, + "step": 10250 + }, + { + "epoch": 1.634945831183777, + "grad_norm": 0.008563055656850338, + "learning_rate": 6.572146763097549e-06, + "loss": 0.1171, + "step": 10300 + }, + { + "epoch": 1.6428826540735744, + "grad_norm": 2.094672441482544, + "learning_rate": 6.550097018874582e-06, + "loss": 0.0798, + "step": 10350 + }, + { + "epoch": 1.6508194769633717, + "grad_norm": 0.12600164115428925, + "learning_rate": 6.528047274651614e-06, + "loss": 0.1071, + "step": 10400 + }, + { + "epoch": 1.6587562998531689, + "grad_norm": 0.3863985240459442, + "learning_rate": 6.505997530428647e-06, + "loss": 0.1485, + "step": 10450 + }, + { + "epoch": 1.666693122742966, + "grad_norm": 0.005566800944507122, + "learning_rate": 6.483947786205681e-06, + "loss": 0.1567, + "step": 10500 + }, + { + "epoch": 1.666693122742966, + "eval_accuracy": 0.960952380952381, + "eval_loss": 0.17503954470157623, + "eval_macro_f1": 0.9170932665272469, + "eval_macro_precision": 0.9116456444630479, + "eval_macro_recall": 0.9260931287646225, + "eval_micro_f1": 0.960952380952381, + "eval_micro_precision": 0.960952380952381, + "eval_micro_recall": 0.960952380952381, + "eval_runtime": 45.8116, + "eval_samples_per_second": 275.04, + "eval_steps_per_second": 34.38, + "eval_weighted_f1": 0.9609014768411174, + "eval_weighted_precision": 0.9611475161993005, + "eval_weighted_recall": 0.960952380952381, + "step": 10500 + }, + { + "epoch": 1.6746299456327631, + "grad_norm": 17.83533477783203, + "learning_rate": 6.461898041982714e-06, + "loss": 0.112, + "step": 10550 + }, + { + "epoch": 1.6825667685225603, + "grad_norm": 0.016817472875118256, + "learning_rate": 6.439848297759746e-06, + "loss": 0.1179, + "step": 10600 + }, + { + "epoch": 1.6905035914123576, + "grad_norm": 0.0496453195810318, + "learning_rate": 6.417798553536779e-06, + "loss": 0.1354, + "step": 10650 + }, + { + "epoch": 1.698440414302155, + "grad_norm": 24.511754989624023, + "learning_rate": 6.395748809313812e-06, + "loss": 0.1083, + "step": 10700 + }, + { + "epoch": 1.7063772371919521, + "grad_norm": 0.014569321647286415, + "learning_rate": 6.373699065090846e-06, + "loss": 0.0928, + "step": 10750 + }, + { + "epoch": 1.7143140600817492, + "grad_norm": 7.14270544052124, + "learning_rate": 6.351649320867879e-06, + "loss": 0.1354, + "step": 10800 + }, + { + "epoch": 1.7222508829715464, + "grad_norm": 0.039672911167144775, + "learning_rate": 6.329599576644911e-06, + "loss": 0.0879, + "step": 10850 + }, + { + "epoch": 1.7301877058613437, + "grad_norm": 0.11405997723340988, + "learning_rate": 6.307549832421944e-06, + "loss": 0.1525, + "step": 10900 + }, + { + "epoch": 1.7381245287511409, + "grad_norm": 1.720201015472412, + "learning_rate": 6.285500088198977e-06, + "loss": 0.1257, + "step": 10950 + }, + { + "epoch": 1.7460613516409382, + "grad_norm": 21.198429107666016, + "learning_rate": 6.263891338860469e-06, + "loss": 0.0848, + "step": 11000 + }, + { + "epoch": 1.7460613516409382, + "eval_accuracy": 0.9624603174603175, + "eval_loss": 0.17708104848861694, + "eval_macro_f1": 0.9319695940105357, + "eval_macro_precision": 0.9462998611668713, + "eval_macro_recall": 0.9234620410796542, + "eval_micro_f1": 0.9624603174603175, + "eval_micro_precision": 0.9624603174603175, + "eval_micro_recall": 0.9624603174603175, + "eval_runtime": 45.9838, + "eval_samples_per_second": 274.009, + "eval_steps_per_second": 34.251, + "eval_weighted_f1": 0.9623559428261603, + "eval_weighted_precision": 0.962723564261779, + "eval_weighted_recall": 0.9624603174603175, + "step": 11000 + }, + { + "epoch": 1.7539981745307354, + "grad_norm": 19.329214096069336, + "learning_rate": 6.241841594637502e-06, + "loss": 0.0969, + "step": 11050 + }, + { + "epoch": 1.7619349974205325, + "grad_norm": 0.17044760286808014, + "learning_rate": 6.219791850414536e-06, + "loss": 0.1143, + "step": 11100 + }, + { + "epoch": 1.7698718203103296, + "grad_norm": 20.753198623657227, + "learning_rate": 6.197742106191568e-06, + "loss": 0.1619, + "step": 11150 + }, + { + "epoch": 1.777808643200127, + "grad_norm": 0.05526827648282051, + "learning_rate": 6.175692361968601e-06, + "loss": 0.1297, + "step": 11200 + }, + { + "epoch": 1.7857454660899243, + "grad_norm": 13.288789749145508, + "learning_rate": 6.153642617745634e-06, + "loss": 0.0892, + "step": 11250 + }, + { + "epoch": 1.7936822889797215, + "grad_norm": 50.681602478027344, + "learning_rate": 6.131592873522668e-06, + "loss": 0.1218, + "step": 11300 + }, + { + "epoch": 1.8016191118695186, + "grad_norm": 18.851547241210938, + "learning_rate": 6.109543129299701e-06, + "loss": 0.1046, + "step": 11350 + }, + { + "epoch": 1.8095559347593158, + "grad_norm": 20.649171829223633, + "learning_rate": 6.087493385076733e-06, + "loss": 0.1481, + "step": 11400 + }, + { + "epoch": 1.817492757649113, + "grad_norm": 17.76620101928711, + "learning_rate": 6.065443640853766e-06, + "loss": 0.0807, + "step": 11450 + }, + { + "epoch": 1.8254295805389102, + "grad_norm": 9.238646507263184, + "learning_rate": 6.043393896630799e-06, + "loss": 0.0973, + "step": 11500 + }, + { + "epoch": 1.8254295805389102, + "eval_accuracy": 0.9632539682539683, + "eval_loss": 0.17640231549739838, + "eval_macro_f1": 0.9383726570780089, + "eval_macro_precision": 0.9361695510382104, + "eval_macro_recall": 0.9420156784780935, + "eval_micro_f1": 0.9632539682539683, + "eval_micro_precision": 0.9632539682539683, + "eval_micro_recall": 0.9632539682539683, + "eval_runtime": 46.3964, + "eval_samples_per_second": 271.573, + "eval_steps_per_second": 33.947, + "eval_weighted_f1": 0.9633197036349216, + "eval_weighted_precision": 0.9636434749852494, + "eval_weighted_recall": 0.9632539682539683, + "step": 11500 + }, + { + "epoch": 1.8333664034287076, + "grad_norm": 0.8048087954521179, + "learning_rate": 6.021344152407833e-06, + "loss": 0.1329, + "step": 11550 + }, + { + "epoch": 1.8413032263185047, + "grad_norm": 0.3991595506668091, + "learning_rate": 5.999294408184866e-06, + "loss": 0.1303, + "step": 11600 + }, + { + "epoch": 1.8492400492083019, + "grad_norm": 0.10322093963623047, + "learning_rate": 5.977244663961898e-06, + "loss": 0.1261, + "step": 11650 + }, + { + "epoch": 1.857176872098099, + "grad_norm": 7.725561141967773, + "learning_rate": 5.955194919738931e-06, + "loss": 0.0816, + "step": 11700 + }, + { + "epoch": 1.8651136949878964, + "grad_norm": 5.625209331512451, + "learning_rate": 5.933145175515964e-06, + "loss": 0.0861, + "step": 11750 + }, + { + "epoch": 1.8730505178776937, + "grad_norm": 0.045761458575725555, + "learning_rate": 5.911095431292998e-06, + "loss": 0.0718, + "step": 11800 + }, + { + "epoch": 1.8809873407674909, + "grad_norm": 15.094813346862793, + "learning_rate": 5.889045687070031e-06, + "loss": 0.1316, + "step": 11850 + }, + { + "epoch": 1.888924163657288, + "grad_norm": 0.025717562064528465, + "learning_rate": 5.866995942847063e-06, + "loss": 0.12, + "step": 11900 + }, + { + "epoch": 1.8968609865470851, + "grad_norm": 22.716604232788086, + "learning_rate": 5.844946198624096e-06, + "loss": 0.1371, + "step": 11950 + }, + { + "epoch": 1.9047978094368823, + "grad_norm": 20.683067321777344, + "learning_rate": 5.822896454401129e-06, + "loss": 0.1331, + "step": 12000 + }, + { + "epoch": 1.9047978094368823, + "eval_accuracy": 0.9657142857142857, + "eval_loss": 0.16351820528507233, + "eval_macro_f1": 0.9426202066832035, + "eval_macro_precision": 0.9507506384547523, + "eval_macro_recall": 0.9366009019904619, + "eval_micro_f1": 0.9657142857142857, + "eval_micro_precision": 0.9657142857142857, + "eval_micro_recall": 0.9657142857142857, + "eval_runtime": 46.8483, + "eval_samples_per_second": 268.953, + "eval_steps_per_second": 33.619, + "eval_weighted_f1": 0.9656532805046822, + "eval_weighted_precision": 0.9659512006173707, + "eval_weighted_recall": 0.9657142857142857, + "step": 12000 + }, + { + "epoch": 1.9127346323266796, + "grad_norm": 0.001627567340619862, + "learning_rate": 5.800846710178163e-06, + "loss": 0.1079, + "step": 12050 + }, + { + "epoch": 1.920671455216477, + "grad_norm": 21.03553581237793, + "learning_rate": 5.778796965955196e-06, + "loss": 0.0558, + "step": 12100 + }, + { + "epoch": 1.928608278106274, + "grad_norm": 13.464014053344727, + "learning_rate": 5.756747221732228e-06, + "loss": 0.0959, + "step": 12150 + }, + { + "epoch": 1.9365451009960712, + "grad_norm": 17.52626609802246, + "learning_rate": 5.734697477509261e-06, + "loss": 0.0883, + "step": 12200 + }, + { + "epoch": 1.9444819238858684, + "grad_norm": 0.12921009957790375, + "learning_rate": 5.712647733286294e-06, + "loss": 0.0769, + "step": 12250 + }, + { + "epoch": 1.9524187467756657, + "grad_norm": 0.0050261239521205425, + "learning_rate": 5.690597989063328e-06, + "loss": 0.1439, + "step": 12300 + }, + { + "epoch": 1.9603555696654629, + "grad_norm": 18.023502349853516, + "learning_rate": 5.668548244840361e-06, + "loss": 0.0804, + "step": 12350 + }, + { + "epoch": 1.9682923925552602, + "grad_norm": 0.03103369101881981, + "learning_rate": 5.646498500617393e-06, + "loss": 0.0833, + "step": 12400 + }, + { + "epoch": 1.9762292154450574, + "grad_norm": 30.99793243408203, + "learning_rate": 5.624448756394426e-06, + "loss": 0.1744, + "step": 12450 + }, + { + "epoch": 1.9841660383348545, + "grad_norm": 0.04181884601712227, + "learning_rate": 5.602399012171459e-06, + "loss": 0.0629, + "step": 12500 + }, + { + "epoch": 1.9841660383348545, + "eval_accuracy": 0.9681746031746031, + "eval_loss": 0.1587391495704651, + "eval_macro_f1": 0.9466181342033713, + "eval_macro_precision": 0.947442786667393, + "eval_macro_recall": 0.9465717167703007, + "eval_micro_f1": 0.9681746031746031, + "eval_micro_precision": 0.9681746031746031, + "eval_micro_recall": 0.9681746031746031, + "eval_runtime": 66.4354, + "eval_samples_per_second": 189.658, + "eval_steps_per_second": 23.707, + "eval_weighted_f1": 0.9681650956489429, + "eval_weighted_precision": 0.9683707150909681, + "eval_weighted_recall": 0.9681746031746031, + "step": 12500 + }, + { + "epoch": 1.9921028612246516, + "grad_norm": 11.374281883239746, + "learning_rate": 5.580349267948493e-06, + "loss": 0.0867, + "step": 12550 + }, + { + "epoch": 2.0, + "grad_norm": 0.029758449643850327, + "learning_rate": 5.558299523725525e-06, + "loss": 0.109, + "step": 12600 + }, + { + "epoch": 2.007936822889797, + "grad_norm": 0.002391190268099308, + "learning_rate": 5.536249779502558e-06, + "loss": 0.0186, + "step": 12650 + }, + { + "epoch": 2.0158736457795943, + "grad_norm": 12.729046821594238, + "learning_rate": 5.514200035279591e-06, + "loss": 0.0258, + "step": 12700 + }, + { + "epoch": 2.023810468669392, + "grad_norm": 0.012360978871583939, + "learning_rate": 5.492150291056624e-06, + "loss": 0.0406, + "step": 12750 + }, + { + "epoch": 2.031747291559189, + "grad_norm": 2.931403160095215, + "learning_rate": 5.470100546833658e-06, + "loss": 0.0323, + "step": 12800 + }, + { + "epoch": 2.039684114448986, + "grad_norm": 0.34426018595695496, + "learning_rate": 5.44805080261069e-06, + "loss": 0.0493, + "step": 12850 + }, + { + "epoch": 2.0476209373387833, + "grad_norm": 1.6615216732025146, + "learning_rate": 5.426001058387723e-06, + "loss": 0.0227, + "step": 12900 + }, + { + "epoch": 2.0555577602285804, + "grad_norm": 17.994659423828125, + "learning_rate": 5.403951314164756e-06, + "loss": 0.0575, + "step": 12950 + }, + { + "epoch": 2.0634945831183775, + "grad_norm": 0.002307410817593336, + "learning_rate": 5.381901569941789e-06, + "loss": 0.0724, + "step": 13000 + }, + { + "epoch": 2.0634945831183775, + "eval_accuracy": 0.9689682539682539, + "eval_loss": 0.16660018265247345, + "eval_macro_f1": 0.9431082887845699, + "eval_macro_precision": 0.9435320164238983, + "eval_macro_recall": 0.9440342115841122, + "eval_micro_f1": 0.9689682539682539, + "eval_micro_precision": 0.9689682539682539, + "eval_micro_recall": 0.9689682539682539, + "eval_runtime": 55.6815, + "eval_samples_per_second": 226.287, + "eval_steps_per_second": 28.286, + "eval_weighted_f1": 0.9690350615547291, + "eval_weighted_precision": 0.9692930831154812, + "eval_weighted_recall": 0.9689682539682539, + "step": 13000 + }, + { + "epoch": 2.071431406008175, + "grad_norm": 1.1325668096542358, + "learning_rate": 5.359851825718823e-06, + "loss": 0.0317, + "step": 13050 + }, + { + "epoch": 2.0793682288979722, + "grad_norm": 10.751199722290039, + "learning_rate": 5.337802081495855e-06, + "loss": 0.0382, + "step": 13100 + }, + { + "epoch": 2.0873050517877694, + "grad_norm": 0.05518977344036102, + "learning_rate": 5.315752337272888e-06, + "loss": 0.032, + "step": 13150 + }, + { + "epoch": 2.0952418746775665, + "grad_norm": 0.05851821228861809, + "learning_rate": 5.293702593049921e-06, + "loss": 0.0347, + "step": 13200 + }, + { + "epoch": 2.1031786975673636, + "grad_norm": 0.0005113780498504639, + "learning_rate": 5.272093843711413e-06, + "loss": 0.0298, + "step": 13250 + }, + { + "epoch": 2.1111155204571608, + "grad_norm": 0.018820350989699364, + "learning_rate": 5.250044099488446e-06, + "loss": 0.0497, + "step": 13300 + }, + { + "epoch": 2.1190523433469584, + "grad_norm": 0.9959418177604675, + "learning_rate": 5.2279943552654785e-06, + "loss": 0.046, + "step": 13350 + }, + { + "epoch": 2.1269891662367555, + "grad_norm": 0.7051542401313782, + "learning_rate": 5.205944611042512e-06, + "loss": 0.04, + "step": 13400 + }, + { + "epoch": 2.1349259891265526, + "grad_norm": 0.0022753493394702673, + "learning_rate": 5.183894866819545e-06, + "loss": 0.0173, + "step": 13450 + }, + { + "epoch": 2.1428628120163498, + "grad_norm": 0.0039760335348546505, + "learning_rate": 5.161845122596578e-06, + "loss": 0.0582, + "step": 13500 + }, + { + "epoch": 2.1428628120163498, + "eval_accuracy": 0.9687301587301588, + "eval_loss": 0.18048988282680511, + "eval_macro_f1": 0.9422923846160581, + "eval_macro_precision": 0.9532870485294106, + "eval_macro_recall": 0.934424229646169, + "eval_micro_f1": 0.9687301587301588, + "eval_micro_precision": 0.9687301587301588, + "eval_micro_recall": 0.9687301587301588, + "eval_runtime": 48.6144, + "eval_samples_per_second": 259.182, + "eval_steps_per_second": 32.398, + "eval_weighted_f1": 0.9686287726395876, + "eval_weighted_precision": 0.9689670561915049, + "eval_weighted_recall": 0.9687301587301588, + "step": 13500 + }, + { + "epoch": 2.150799634906147, + "grad_norm": 0.096370629966259, + "learning_rate": 5.139795378373611e-06, + "loss": 0.0522, + "step": 13550 + }, + { + "epoch": 2.1587364577959445, + "grad_norm": 0.013626059517264366, + "learning_rate": 5.117745634150643e-06, + "loss": 0.0128, + "step": 13600 + }, + { + "epoch": 2.1666732806857416, + "grad_norm": 0.003456405596807599, + "learning_rate": 5.095695889927677e-06, + "loss": 0.0333, + "step": 13650 + }, + { + "epoch": 2.1746101035755387, + "grad_norm": 20.14434051513672, + "learning_rate": 5.07364614570471e-06, + "loss": 0.0572, + "step": 13700 + }, + { + "epoch": 2.182546926465336, + "grad_norm": 0.009079753421247005, + "learning_rate": 5.051596401481743e-06, + "loss": 0.0439, + "step": 13750 + }, + { + "epoch": 2.190483749355133, + "grad_norm": 0.017065979540348053, + "learning_rate": 5.029546657258776e-06, + "loss": 0.0405, + "step": 13800 + }, + { + "epoch": 2.19842057224493, + "grad_norm": 0.001399728120304644, + "learning_rate": 5.007496913035808e-06, + "loss": 0.0567, + "step": 13850 + }, + { + "epoch": 2.2063573951347277, + "grad_norm": 0.013922719284892082, + "learning_rate": 4.985447168812842e-06, + "loss": 0.0484, + "step": 13900 + }, + { + "epoch": 2.214294218024525, + "grad_norm": 0.0006722013931721449, + "learning_rate": 4.963397424589875e-06, + "loss": 0.0089, + "step": 13950 + }, + { + "epoch": 2.222231040914322, + "grad_norm": 16.31502342224121, + "learning_rate": 4.941347680366908e-06, + "loss": 0.0182, + "step": 14000 + }, + { + "epoch": 2.222231040914322, + "eval_accuracy": 0.9709523809523809, + "eval_loss": 0.17584019899368286, + "eval_macro_f1": 0.9548845957042732, + "eval_macro_precision": 0.9616225902344291, + "eval_macro_recall": 0.9490903584972133, + "eval_micro_f1": 0.9709523809523809, + "eval_micro_precision": 0.9709523809523809, + "eval_micro_recall": 0.9709523809523809, + "eval_runtime": 65.6446, + "eval_samples_per_second": 191.943, + "eval_steps_per_second": 23.993, + "eval_weighted_f1": 0.9709045086147281, + "eval_weighted_precision": 0.9709764613384323, + "eval_weighted_recall": 0.9709523809523809, + "step": 14000 + }, + { + "epoch": 2.230167863804119, + "grad_norm": 49.83951187133789, + "learning_rate": 4.919297936143941e-06, + "loss": 0.0383, + "step": 14050 + }, + { + "epoch": 2.2381046866939163, + "grad_norm": 0.010581075213849545, + "learning_rate": 4.897248191920974e-06, + "loss": 0.0527, + "step": 14100 + }, + { + "epoch": 2.246041509583714, + "grad_norm": 5.595621109008789, + "learning_rate": 4.875198447698007e-06, + "loss": 0.0361, + "step": 14150 + }, + { + "epoch": 2.253978332473511, + "grad_norm": 11.858242988586426, + "learning_rate": 4.85314870347504e-06, + "loss": 0.023, + "step": 14200 + }, + { + "epoch": 2.261915155363308, + "grad_norm": 28.24439239501953, + "learning_rate": 4.831098959252073e-06, + "loss": 0.029, + "step": 14250 + }, + { + "epoch": 2.2698519782531053, + "grad_norm": 0.001131124678067863, + "learning_rate": 4.809049215029106e-06, + "loss": 0.0522, + "step": 14300 + }, + { + "epoch": 2.2777888011429024, + "grad_norm": 14.565289497375488, + "learning_rate": 4.786999470806139e-06, + "loss": 0.0353, + "step": 14350 + }, + { + "epoch": 2.2857256240326995, + "grad_norm": 1.4213881492614746, + "learning_rate": 4.764949726583172e-06, + "loss": 0.0252, + "step": 14400 + }, + { + "epoch": 2.293662446922497, + "grad_norm": 0.011964501813054085, + "learning_rate": 4.742899982360205e-06, + "loss": 0.0572, + "step": 14450 + }, + { + "epoch": 2.3015992698122942, + "grad_norm": 12.1846342086792, + "learning_rate": 4.720850238137238e-06, + "loss": 0.0295, + "step": 14500 + }, + { + "epoch": 2.3015992698122942, + "eval_accuracy": 0.9695238095238096, + "eval_loss": 0.177631214261055, + "eval_macro_f1": 0.9506224965454739, + "eval_macro_precision": 0.9661964085054093, + "eval_macro_recall": 0.9377514378889877, + "eval_micro_f1": 0.9695238095238096, + "eval_micro_precision": 0.9695238095238096, + "eval_micro_recall": 0.9695238095238096, + "eval_runtime": 55.0712, + "eval_samples_per_second": 228.795, + "eval_steps_per_second": 28.599, + "eval_weighted_f1": 0.9694153409312327, + "eval_weighted_precision": 0.9696628969782775, + "eval_weighted_recall": 0.9695238095238096, + "step": 14500 + }, + { + "epoch": 2.3095360927020914, + "grad_norm": 0.0022249706089496613, + "learning_rate": 4.698800493914271e-06, + "loss": 0.051, + "step": 14550 + }, + { + "epoch": 2.3174729155918885, + "grad_norm": 0.13238926231861115, + "learning_rate": 4.676750749691304e-06, + "loss": 0.0247, + "step": 14600 + }, + { + "epoch": 2.3254097384816856, + "grad_norm": 0.06873074173927307, + "learning_rate": 4.654701005468337e-06, + "loss": 0.0406, + "step": 14650 + }, + { + "epoch": 2.333346561371483, + "grad_norm": 1.4111828804016113, + "learning_rate": 4.63265126124537e-06, + "loss": 0.0509, + "step": 14700 + }, + { + "epoch": 2.3412833842612804, + "grad_norm": 0.05572796240448952, + "learning_rate": 4.610601517022403e-06, + "loss": 0.0443, + "step": 14750 + }, + { + "epoch": 2.3492202071510775, + "grad_norm": 0.13843700289726257, + "learning_rate": 4.588551772799436e-06, + "loss": 0.0322, + "step": 14800 + }, + { + "epoch": 2.3571570300408746, + "grad_norm": 22.532489776611328, + "learning_rate": 4.566502028576469e-06, + "loss": 0.0404, + "step": 14850 + }, + { + "epoch": 2.3650938529306718, + "grad_norm": 0.40451693534851074, + "learning_rate": 4.544452284353502e-06, + "loss": 0.0384, + "step": 14900 + }, + { + "epoch": 2.373030675820469, + "grad_norm": 0.00039770189323462546, + "learning_rate": 4.522402540130535e-06, + "loss": 0.0446, + "step": 14950 + }, + { + "epoch": 2.3809674987102665, + "grad_norm": 0.19481758773326874, + "learning_rate": 4.500352795907568e-06, + "loss": 0.0105, + "step": 15000 + }, + { + "epoch": 2.3809674987102665, + "eval_accuracy": 0.97, + "eval_loss": 0.17878225445747375, + "eval_macro_f1": 0.952375532557884, + "eval_macro_precision": 0.9642924920360566, + "eval_macro_recall": 0.9429523998338022, + "eval_micro_f1": 0.97, + "eval_micro_precision": 0.97, + "eval_micro_recall": 0.97, + "eval_runtime": 51.0169, + "eval_samples_per_second": 246.977, + "eval_steps_per_second": 30.872, + "eval_weighted_f1": 0.9699429015929246, + "eval_weighted_precision": 0.9701562195790373, + "eval_weighted_recall": 0.97, + "step": 15000 + }, + { + "epoch": 2.3889043216000636, + "grad_norm": 0.19946858286857605, + "learning_rate": 4.478303051684601e-06, + "loss": 0.0317, + "step": 15050 + }, + { + "epoch": 2.3968411444898607, + "grad_norm": 0.13299234211444855, + "learning_rate": 4.456253307461634e-06, + "loss": 0.0504, + "step": 15100 + }, + { + "epoch": 2.404777967379658, + "grad_norm": 0.254424512386322, + "learning_rate": 4.434203563238667e-06, + "loss": 0.04, + "step": 15150 + }, + { + "epoch": 2.412714790269455, + "grad_norm": 35.3300666809082, + "learning_rate": 4.4121538190157e-06, + "loss": 0.05, + "step": 15200 + }, + { + "epoch": 2.4206516131592526, + "grad_norm": 0.015775412321090698, + "learning_rate": 4.390104074792733e-06, + "loss": 0.064, + "step": 15250 + }, + { + "epoch": 2.4285884360490497, + "grad_norm": 0.0011088565224781632, + "learning_rate": 4.368054330569766e-06, + "loss": 0.0429, + "step": 15300 + }, + { + "epoch": 2.436525258938847, + "grad_norm": 0.16335545480251312, + "learning_rate": 4.346004586346799e-06, + "loss": 0.0305, + "step": 15350 + }, + { + "epoch": 2.444462081828644, + "grad_norm": 0.9601665735244751, + "learning_rate": 4.323954842123832e-06, + "loss": 0.0174, + "step": 15400 + }, + { + "epoch": 2.452398904718441, + "grad_norm": 0.11341444402933121, + "learning_rate": 4.301905097900865e-06, + "loss": 0.0298, + "step": 15450 + }, + { + "epoch": 2.4603357276082383, + "grad_norm": 74.64165496826172, + "learning_rate": 4.279855353677898e-06, + "loss": 0.0212, + "step": 15500 + }, + { + "epoch": 2.4603357276082383, + "eval_accuracy": 0.9695238095238096, + "eval_loss": 0.17210516333580017, + "eval_macro_f1": 0.9462875984373381, + "eval_macro_precision": 0.9580763571099492, + "eval_macro_recall": 0.9378514622035224, + "eval_micro_f1": 0.9695238095238096, + "eval_micro_precision": 0.9695238095238096, + "eval_micro_recall": 0.9695238095238096, + "eval_runtime": 49.2932, + "eval_samples_per_second": 255.613, + "eval_steps_per_second": 31.952, + "eval_weighted_f1": 0.9694666934898747, + "eval_weighted_precision": 0.9696918541700538, + "eval_weighted_recall": 0.9695238095238096, + "step": 15500 + }, + { + "epoch": 2.4682725504980354, + "grad_norm": 2.2245137691497803, + "learning_rate": 4.257805609454931e-06, + "loss": 0.0631, + "step": 15550 + }, + { + "epoch": 2.476209373387833, + "grad_norm": 5.462784290313721, + "learning_rate": 4.235755865231964e-06, + "loss": 0.0206, + "step": 15600 + }, + { + "epoch": 2.48414619627763, + "grad_norm": 0.0205392986536026, + "learning_rate": 4.213706121008997e-06, + "loss": 0.0195, + "step": 15650 + }, + { + "epoch": 2.4920830191674272, + "grad_norm": 0.003773665986955166, + "learning_rate": 4.19165637678603e-06, + "loss": 0.0336, + "step": 15700 + }, + { + "epoch": 2.5000198420572244, + "grad_norm": 0.04200325533747673, + "learning_rate": 4.169606632563063e-06, + "loss": 0.0408, + "step": 15750 + }, + { + "epoch": 2.507956664947022, + "grad_norm": 23.36740493774414, + "learning_rate": 4.147556888340096e-06, + "loss": 0.0178, + "step": 15800 + }, + { + "epoch": 2.515893487836819, + "grad_norm": 19.962722778320312, + "learning_rate": 4.125507144117129e-06, + "loss": 0.0347, + "step": 15850 + }, + { + "epoch": 2.5238303107266162, + "grad_norm": 11.505073547363281, + "learning_rate": 4.103457399894162e-06, + "loss": 0.0125, + "step": 15900 + }, + { + "epoch": 2.5317671336164134, + "grad_norm": 45.94857406616211, + "learning_rate": 4.081407655671195e-06, + "loss": 0.0536, + "step": 15950 + }, + { + "epoch": 2.5397039565062105, + "grad_norm": 0.06325556337833405, + "learning_rate": 4.059357911448227e-06, + "loss": 0.0426, + "step": 16000 + }, + { + "epoch": 2.5397039565062105, + "eval_accuracy": 0.9714285714285714, + "eval_loss": 0.15938520431518555, + "eval_macro_f1": 0.951264365385694, + "eval_macro_precision": 0.9601219800413174, + "eval_macro_recall": 0.9443849087252134, + "eval_micro_f1": 0.9714285714285714, + "eval_micro_precision": 0.9714285714285714, + "eval_micro_recall": 0.9714285714285714, + "eval_runtime": 64.8873, + "eval_samples_per_second": 194.183, + "eval_steps_per_second": 24.273, + "eval_weighted_f1": 0.971362978431738, + "eval_weighted_precision": 0.9714994225414888, + "eval_weighted_recall": 0.9714285714285714, + "step": 16000 + }, + { + "epoch": 2.5476407793960076, + "grad_norm": 1.398796558380127, + "learning_rate": 4.037308167225261e-06, + "loss": 0.0193, + "step": 16050 + }, + { + "epoch": 2.5555776022858048, + "grad_norm": 0.5250974297523499, + "learning_rate": 4.015258423002294e-06, + "loss": 0.0216, + "step": 16100 + }, + { + "epoch": 2.5635144251756024, + "grad_norm": 0.027746569365262985, + "learning_rate": 3.993208678779327e-06, + "loss": 0.0255, + "step": 16150 + }, + { + "epoch": 2.5714512480653995, + "grad_norm": 0.02244049869477749, + "learning_rate": 3.97115893455636e-06, + "loss": 0.0382, + "step": 16200 + }, + { + "epoch": 2.5793880709551966, + "grad_norm": 0.029930179938673973, + "learning_rate": 3.949109190333392e-06, + "loss": 0.0241, + "step": 16250 + }, + { + "epoch": 2.5873248938449938, + "grad_norm": 2.274050712585449, + "learning_rate": 3.927059446110426e-06, + "loss": 0.042, + "step": 16300 + }, + { + "epoch": 2.5952617167347913, + "grad_norm": 0.0035721093881875277, + "learning_rate": 3.905009701887459e-06, + "loss": 0.0286, + "step": 16350 + }, + { + "epoch": 2.6031985396245885, + "grad_norm": 0.026004351675510406, + "learning_rate": 3.882959957664492e-06, + "loss": 0.0275, + "step": 16400 + }, + { + "epoch": 2.6111353625143856, + "grad_norm": 0.09917880594730377, + "learning_rate": 3.860910213441525e-06, + "loss": 0.0351, + "step": 16450 + }, + { + "epoch": 2.6190721854041827, + "grad_norm": 0.037691615521907806, + "learning_rate": 3.838860469218557e-06, + "loss": 0.0609, + "step": 16500 + }, + { + "epoch": 2.6190721854041827, + "eval_accuracy": 0.9723015873015873, + "eval_loss": 0.1643410474061966, + "eval_macro_f1": 0.9561822135615655, + "eval_macro_precision": 0.9665323672953172, + "eval_macro_recall": 0.947527505766003, + "eval_micro_f1": 0.9723015873015873, + "eval_micro_precision": 0.9723015873015873, + "eval_micro_recall": 0.9723015873015873, + "eval_runtime": 52.441, + "eval_samples_per_second": 240.27, + "eval_steps_per_second": 30.034, + "eval_weighted_f1": 0.9722751933392187, + "eval_weighted_precision": 0.9724025203500458, + "eval_weighted_recall": 0.9723015873015873, + "step": 16500 + }, + { + "epoch": 2.62700900829398, + "grad_norm": 0.0057956683449447155, + "learning_rate": 3.816810724995591e-06, + "loss": 0.0246, + "step": 16550 + }, + { + "epoch": 2.634945831183777, + "grad_norm": 0.0268319733440876, + "learning_rate": 3.794760980772623e-06, + "loss": 0.0188, + "step": 16600 + }, + { + "epoch": 2.642882654073574, + "grad_norm": 0.009871570393443108, + "learning_rate": 3.7727112365496566e-06, + "loss": 0.0171, + "step": 16650 + }, + { + "epoch": 2.6508194769633717, + "grad_norm": 0.0035246764309704304, + "learning_rate": 3.750661492326689e-06, + "loss": 0.0381, + "step": 16700 + }, + { + "epoch": 2.658756299853169, + "grad_norm": 0.0025346768088638783, + "learning_rate": 3.728611748103722e-06, + "loss": 0.0487, + "step": 16750 + }, + { + "epoch": 2.666693122742966, + "grad_norm": 23.958332061767578, + "learning_rate": 3.7065620038807556e-06, + "loss": 0.0326, + "step": 16800 + }, + { + "epoch": 2.674629945632763, + "grad_norm": 0.010150304064154625, + "learning_rate": 3.684512259657788e-06, + "loss": 0.0347, + "step": 16850 + }, + { + "epoch": 2.6825667685225603, + "grad_norm": 0.0012810941552743316, + "learning_rate": 3.6624625154348216e-06, + "loss": 0.0403, + "step": 16900 + }, + { + "epoch": 2.690503591412358, + "grad_norm": 24.288969039916992, + "learning_rate": 3.640412771211854e-06, + "loss": 0.013, + "step": 16950 + }, + { + "epoch": 2.698440414302155, + "grad_norm": 0.000993003137409687, + "learning_rate": 3.618363026988887e-06, + "loss": 0.0409, + "step": 17000 + }, + { + "epoch": 2.698440414302155, + "eval_accuracy": 0.973015873015873, + "eval_loss": 0.16805726289749146, + "eval_macro_f1": 0.9491028977586443, + "eval_macro_precision": 0.960433813735491, + "eval_macro_recall": 0.9406320914982489, + "eval_micro_f1": 0.973015873015873, + "eval_micro_precision": 0.973015873015873, + "eval_micro_recall": 0.973015873015873, + "eval_runtime": 50.2558, + "eval_samples_per_second": 250.717, + "eval_steps_per_second": 31.34, + "eval_weighted_f1": 0.9729576202329057, + "eval_weighted_precision": 0.9730875205196509, + "eval_weighted_recall": 0.973015873015873, + "step": 17000 + }, + { + "epoch": 2.706377237191952, + "grad_norm": 3.7704389095306396, + "learning_rate": 3.59631328276592e-06, + "loss": 0.0195, + "step": 17050 + }, + { + "epoch": 2.7143140600817492, + "grad_norm": 0.0006660755025222898, + "learning_rate": 3.574263538542953e-06, + "loss": 0.0353, + "step": 17100 + }, + { + "epoch": 2.7222508829715464, + "grad_norm": 0.3745381236076355, + "learning_rate": 3.5522137943199865e-06, + "loss": 0.0214, + "step": 17150 + }, + { + "epoch": 2.7301877058613435, + "grad_norm": 0.005227445159107447, + "learning_rate": 3.530164050097019e-06, + "loss": 0.0203, + "step": 17200 + }, + { + "epoch": 2.7381245287511407, + "grad_norm": 0.05709793046116829, + "learning_rate": 3.5085553007585115e-06, + "loss": 0.0289, + "step": 17250 + }, + { + "epoch": 2.7460613516409382, + "grad_norm": 0.3132238984107971, + "learning_rate": 3.4865055565355444e-06, + "loss": 0.0344, + "step": 17300 + }, + { + "epoch": 2.7539981745307354, + "grad_norm": 0.00023108968161977828, + "learning_rate": 3.464455812312578e-06, + "loss": 0.0299, + "step": 17350 + }, + { + "epoch": 2.7619349974205325, + "grad_norm": 0.0010186864528805017, + "learning_rate": 3.4424060680896104e-06, + "loss": 0.0156, + "step": 17400 + }, + { + "epoch": 2.7698718203103296, + "grad_norm": 0.4859501123428345, + "learning_rate": 3.420797318751103e-06, + "loss": 0.0178, + "step": 17450 + }, + { + "epoch": 2.777808643200127, + "grad_norm": 0.0007182751432992518, + "learning_rate": 3.398747574528136e-06, + "loss": 0.0526, + "step": 17500 + }, + { + "epoch": 2.777808643200127, + "eval_accuracy": 0.9734126984126984, + "eval_loss": 0.16671566665172577, + "eval_macro_f1": 0.9471381395941902, + "eval_macro_precision": 0.9549885122141759, + "eval_macro_recall": 0.9428154605456508, + "eval_micro_f1": 0.9734126984126984, + "eval_micro_precision": 0.9734126984126984, + "eval_micro_recall": 0.9734126984126984, + "eval_runtime": 64.8418, + "eval_samples_per_second": 194.319, + "eval_steps_per_second": 24.29, + "eval_weighted_f1": 0.9733825407985148, + "eval_weighted_precision": 0.973532406246267, + "eval_weighted_recall": 0.9734126984126984, + "step": 17500 + }, + { + "epoch": 2.7857454660899243, + "grad_norm": 0.03506314009428024, + "learning_rate": 3.3766978303051688e-06, + "loss": 0.0361, + "step": 17550 + }, + { + "epoch": 2.7936822889797215, + "grad_norm": 0.008137653581798077, + "learning_rate": 3.3546480860822018e-06, + "loss": 0.0407, + "step": 17600 + }, + { + "epoch": 2.8016191118695186, + "grad_norm": 3.514742136001587, + "learning_rate": 3.3325983418592343e-06, + "loss": 0.0298, + "step": 17650 + }, + { + "epoch": 2.8095559347593158, + "grad_norm": 0.0013472414575517178, + "learning_rate": 3.3105485976362678e-06, + "loss": 0.027, + "step": 17700 + }, + { + "epoch": 2.817492757649113, + "grad_norm": 0.00018067212658934295, + "learning_rate": 3.2884988534133007e-06, + "loss": 0.0243, + "step": 17750 + }, + { + "epoch": 2.82542958053891, + "grad_norm": 0.0013635717332363129, + "learning_rate": 3.2664491091903337e-06, + "loss": 0.0169, + "step": 17800 + }, + { + "epoch": 2.8333664034287076, + "grad_norm": 0.0013044564984738827, + "learning_rate": 3.2443993649673667e-06, + "loss": 0.0154, + "step": 17850 + }, + { + "epoch": 2.8413032263185047, + "grad_norm": 0.00033568262006156147, + "learning_rate": 3.2223496207443993e-06, + "loss": 0.0197, + "step": 17900 + }, + { + "epoch": 2.849240049208302, + "grad_norm": 0.00014405626279767603, + "learning_rate": 3.2002998765214327e-06, + "loss": 0.0181, + "step": 17950 + }, + { + "epoch": 2.857176872098099, + "grad_norm": 1.2447603940963745, + "learning_rate": 3.1782501322984653e-06, + "loss": 0.0657, + "step": 18000 + }, + { + "epoch": 2.857176872098099, + "eval_accuracy": 0.9738095238095238, + "eval_loss": 0.17004433274269104, + "eval_macro_f1": 0.9529234191380291, + "eval_macro_precision": 0.962677256883139, + "eval_macro_recall": 0.9454556144210745, + "eval_micro_f1": 0.9738095238095238, + "eval_micro_precision": 0.9738095238095238, + "eval_micro_recall": 0.9738095238095238, + "eval_runtime": 48.8808, + "eval_samples_per_second": 257.77, + "eval_steps_per_second": 32.221, + "eval_weighted_f1": 0.9737837762311287, + "eval_weighted_precision": 0.9739539079223564, + "eval_weighted_recall": 0.9738095238095238, + "step": 18000 + }, + { + "epoch": 2.8651136949878966, + "grad_norm": 0.04827316105365753, + "learning_rate": 3.1562003880754987e-06, + "loss": 0.0575, + "step": 18050 + }, + { + "epoch": 2.8730505178776937, + "grad_norm": 3.009031295776367, + "learning_rate": 3.1341506438525317e-06, + "loss": 0.009, + "step": 18100 + }, + { + "epoch": 2.880987340767491, + "grad_norm": 12.70515251159668, + "learning_rate": 3.1121008996295642e-06, + "loss": 0.0717, + "step": 18150 + }, + { + "epoch": 2.888924163657288, + "grad_norm": 0.008692610077559948, + "learning_rate": 3.0900511554065976e-06, + "loss": 0.0653, + "step": 18200 + }, + { + "epoch": 2.896860986547085, + "grad_norm": 0.0048131803050637245, + "learning_rate": 3.06800141118363e-06, + "loss": 0.0246, + "step": 18250 + }, + { + "epoch": 2.9047978094368823, + "grad_norm": 0.00026718704611994326, + "learning_rate": 3.0459516669606636e-06, + "loss": 0.0097, + "step": 18300 + }, + { + "epoch": 2.9127346323266794, + "grad_norm": 0.08372581005096436, + "learning_rate": 3.0239019227376966e-06, + "loss": 0.0618, + "step": 18350 + }, + { + "epoch": 2.920671455216477, + "grad_norm": 0.00336449034512043, + "learning_rate": 3.001852178514729e-06, + "loss": 0.0344, + "step": 18400 + }, + { + "epoch": 2.928608278106274, + "grad_norm": 0.0021333922632038593, + "learning_rate": 2.9798024342917626e-06, + "loss": 0.0296, + "step": 18450 + }, + { + "epoch": 2.9365451009960712, + "grad_norm": 0.002129336353391409, + "learning_rate": 2.957752690068795e-06, + "loss": 0.0056, + "step": 18500 + }, + { + "epoch": 2.9365451009960712, + "eval_accuracy": 0.975, + "eval_loss": 0.16028916835784912, + "eval_macro_f1": 0.9540199515604112, + "eval_macro_precision": 0.9647089557155375, + "eval_macro_recall": 0.945480105008737, + "eval_micro_f1": 0.975, + "eval_micro_precision": 0.975, + "eval_micro_recall": 0.975, + "eval_runtime": 60.6955, + "eval_samples_per_second": 207.594, + "eval_steps_per_second": 25.949, + "eval_weighted_f1": 0.9749518139909482, + "eval_weighted_precision": 0.9750584916764344, + "eval_weighted_recall": 0.975, + "step": 18500 + }, + { + "epoch": 2.9444819238858684, + "grad_norm": 0.045723918825387955, + "learning_rate": 2.9357029458458286e-06, + "loss": 0.0243, + "step": 18550 + }, + { + "epoch": 2.952418746775666, + "grad_norm": 0.007504200097173452, + "learning_rate": 2.9136532016228616e-06, + "loss": 0.0214, + "step": 18600 + }, + { + "epoch": 2.960355569665463, + "grad_norm": 0.0063537731766700745, + "learning_rate": 2.891603457399894e-06, + "loss": 0.0375, + "step": 18650 + }, + { + "epoch": 2.9682923925552602, + "grad_norm": 37.7386589050293, + "learning_rate": 2.8695537131769275e-06, + "loss": 0.0326, + "step": 18700 + }, + { + "epoch": 2.9762292154450574, + "grad_norm": 0.7210281491279602, + "learning_rate": 2.84750396895396e-06, + "loss": 0.0192, + "step": 18750 + }, + { + "epoch": 2.9841660383348545, + "grad_norm": 0.1253499835729599, + "learning_rate": 2.8254542247309935e-06, + "loss": 0.0159, + "step": 18800 + }, + { + "epoch": 2.9921028612246516, + "grad_norm": 0.18740814924240112, + "learning_rate": 2.803404480508026e-06, + "loss": 0.0409, + "step": 18850 + }, + { + "epoch": 3.0, + "grad_norm": 0.6921190023422241, + "learning_rate": 2.7813547362850595e-06, + "loss": 0.0461, + "step": 18900 + }, + { + "epoch": 3.007936822889797, + "grad_norm": 0.004000192042440176, + "learning_rate": 2.7593049920620925e-06, + "loss": 0.0103, + "step": 18950 + }, + { + "epoch": 3.0158736457795943, + "grad_norm": 0.00037790765054523945, + "learning_rate": 2.737255247839125e-06, + "loss": 0.0117, + "step": 19000 + }, + { + "epoch": 3.0158736457795943, + "eval_accuracy": 0.9762698412698413, + "eval_loss": 0.14878861606121063, + "eval_macro_f1": 0.954347658252044, + "eval_macro_precision": 0.9607715131633574, + "eval_macro_recall": 0.9501403976665715, + "eval_micro_f1": 0.9762698412698413, + "eval_micro_precision": 0.9762698412698413, + "eval_micro_recall": 0.9762698412698413, + "eval_runtime": 51.7414, + "eval_samples_per_second": 243.519, + "eval_steps_per_second": 30.44, + "eval_weighted_f1": 0.9762667198823463, + "eval_weighted_precision": 0.9764195140172701, + "eval_weighted_recall": 0.9762698412698413, + "step": 19000 + }, + { + "epoch": 3.023810468669392, + "grad_norm": 0.00037838733987882733, + "learning_rate": 2.7152055036161585e-06, + "loss": 0.0051, + "step": 19050 + }, + { + "epoch": 3.031747291559189, + "grad_norm": 0.00012900579895358533, + "learning_rate": 2.693155759393191e-06, + "loss": 0.0028, + "step": 19100 + }, + { + "epoch": 3.039684114448986, + "grad_norm": 0.0025370146613568068, + "learning_rate": 2.6711060151702244e-06, + "loss": 0.0027, + "step": 19150 + }, + { + "epoch": 3.0476209373387833, + "grad_norm": 17.906938552856445, + "learning_rate": 2.6490562709472574e-06, + "loss": 0.0147, + "step": 19200 + }, + { + "epoch": 3.0555577602285804, + "grad_norm": 0.26221588253974915, + "learning_rate": 2.62700652672429e-06, + "loss": 0.0066, + "step": 19250 + }, + { + "epoch": 3.0634945831183775, + "grad_norm": 0.0025780112482607365, + "learning_rate": 2.6049567825013234e-06, + "loss": 0.0063, + "step": 19300 + }, + { + "epoch": 3.071431406008175, + "grad_norm": 0.16827242076396942, + "learning_rate": 2.582907038278356e-06, + "loss": 0.0019, + "step": 19350 + }, + { + "epoch": 3.0793682288979722, + "grad_norm": 0.018481239676475525, + "learning_rate": 2.5608572940553894e-06, + "loss": 0.0049, + "step": 19400 + }, + { + "epoch": 3.0873050517877694, + "grad_norm": 0.004198388196527958, + "learning_rate": 2.5388075498324224e-06, + "loss": 0.0073, + "step": 19450 + }, + { + "epoch": 3.0952418746775665, + "grad_norm": 0.00025698720128275454, + "learning_rate": 2.516757805609455e-06, + "loss": 0.0059, + "step": 19500 + }, + { + "epoch": 3.0952418746775665, + "eval_accuracy": 0.9756349206349206, + "eval_loss": 0.16310656070709229, + "eval_macro_f1": 0.957125861216084, + "eval_macro_precision": 0.9727967123798239, + "eval_macro_recall": 0.9442922894357393, + "eval_micro_f1": 0.9756349206349206, + "eval_micro_precision": 0.9756349206349206, + "eval_micro_recall": 0.9756349206349206, + "eval_runtime": 47.4743, + "eval_samples_per_second": 265.407, + "eval_steps_per_second": 33.176, + "eval_weighted_f1": 0.9755432972728447, + "eval_weighted_precision": 0.9756807849259415, + "eval_weighted_recall": 0.9756349206349206, + "step": 19500 + }, + { + "epoch": 3.1031786975673636, + "grad_norm": 0.009408715181052685, + "learning_rate": 2.4947080613864884e-06, + "loss": 0.0273, + "step": 19550 + }, + { + "epoch": 3.1111155204571608, + "grad_norm": 0.01176052913069725, + "learning_rate": 2.472658317163521e-06, + "loss": 0.01, + "step": 19600 + }, + { + "epoch": 3.1190523433469584, + "grad_norm": 0.0038633132353425026, + "learning_rate": 2.450608572940554e-06, + "loss": 0.0061, + "step": 19650 + }, + { + "epoch": 3.1269891662367555, + "grad_norm": 0.04556519538164139, + "learning_rate": 2.428558828717587e-06, + "loss": 0.0003, + "step": 19700 + }, + { + "epoch": 3.1349259891265526, + "grad_norm": 0.036106646060943604, + "learning_rate": 2.4065090844946203e-06, + "loss": 0.0156, + "step": 19750 + }, + { + "epoch": 3.1428628120163498, + "grad_norm": 0.2732146680355072, + "learning_rate": 2.3844593402716533e-06, + "loss": 0.0124, + "step": 19800 + }, + { + "epoch": 3.150799634906147, + "grad_norm": 0.002729196799919009, + "learning_rate": 2.362409596048686e-06, + "loss": 0.0159, + "step": 19850 + }, + { + "epoch": 3.1587364577959445, + "grad_norm": 0.008584374561905861, + "learning_rate": 2.340359851825719e-06, + "loss": 0.0096, + "step": 19900 + }, + { + "epoch": 3.1666732806857416, + "grad_norm": 0.12530040740966797, + "learning_rate": 2.318310107602752e-06, + "loss": 0.0003, + "step": 19950 + }, + { + "epoch": 3.1746101035755387, + "grad_norm": 0.0008394561009481549, + "learning_rate": 2.296260363379785e-06, + "loss": 0.0027, + "step": 20000 + }, + { + "epoch": 3.1746101035755387, + "eval_accuracy": 0.9767460317460317, + "eval_loss": 0.16326671838760376, + "eval_macro_f1": 0.9567534320462188, + "eval_macro_precision": 0.9698508452291146, + "eval_macro_recall": 0.9464068389671931, + "eval_micro_f1": 0.9767460317460317, + "eval_micro_precision": 0.9767460317460317, + "eval_micro_recall": 0.9767460317460317, + "eval_runtime": 65.9869, + "eval_samples_per_second": 190.947, + "eval_steps_per_second": 23.868, + "eval_weighted_f1": 0.9766894759901187, + "eval_weighted_precision": 0.9767954117631042, + "eval_weighted_recall": 0.9767460317460317, + "step": 20000 + }, + { + "epoch": 3.182546926465336, + "grad_norm": 0.00108958943746984, + "learning_rate": 2.2742106191568183e-06, + "loss": 0.0141, + "step": 20050 + }, + { + "epoch": 3.190483749355133, + "grad_norm": 1.8105076551437378, + "learning_rate": 2.252160874933851e-06, + "loss": 0.0161, + "step": 20100 + }, + { + "epoch": 3.19842057224493, + "grad_norm": 0.03791620582342148, + "learning_rate": 2.230111130710884e-06, + "loss": 0.03, + "step": 20150 + }, + { + "epoch": 3.2063573951347277, + "grad_norm": 0.05852150917053223, + "learning_rate": 2.208061386487917e-06, + "loss": 0.0118, + "step": 20200 + }, + { + "epoch": 3.214294218024525, + "grad_norm": 32.71089553833008, + "learning_rate": 2.1860116422649498e-06, + "loss": 0.0126, + "step": 20250 + }, + { + "epoch": 3.222231040914322, + "grad_norm": 0.0013255997328087687, + "learning_rate": 2.1639618980419828e-06, + "loss": 0.0003, + "step": 20300 + }, + { + "epoch": 3.230167863804119, + "grad_norm": 0.002787817968055606, + "learning_rate": 2.1419121538190158e-06, + "loss": 0.0034, + "step": 20350 + }, + { + "epoch": 3.2381046866939163, + "grad_norm": 0.002626606961712241, + "learning_rate": 2.1198624095960488e-06, + "loss": 0.0014, + "step": 20400 + }, + { + "epoch": 3.246041509583714, + "grad_norm": 0.0015965308994054794, + "learning_rate": 2.0978126653730817e-06, + "loss": 0.0074, + "step": 20450 + }, + { + "epoch": 3.253978332473511, + "grad_norm": 0.00022477486345451325, + "learning_rate": 2.0757629211501147e-06, + "loss": 0.0016, + "step": 20500 + }, + { + "epoch": 3.253978332473511, + "eval_accuracy": 0.9761111111111112, + "eval_loss": 0.1650867611169815, + "eval_macro_f1": 0.955655463952606, + "eval_macro_precision": 0.9677917142854108, + "eval_macro_recall": 0.9461865102151874, + "eval_micro_f1": 0.9761111111111112, + "eval_micro_precision": 0.9761111111111112, + "eval_micro_recall": 0.9761111111111112, + "eval_runtime": 63.0368, + "eval_samples_per_second": 199.883, + "eval_steps_per_second": 24.985, + "eval_weighted_f1": 0.9760636712967664, + "eval_weighted_precision": 0.9761579320691899, + "eval_weighted_recall": 0.9761111111111112, + "step": 20500 + }, + { + "epoch": 3.261915155363308, + "grad_norm": 0.015780743211507797, + "learning_rate": 2.0537131769271477e-06, + "loss": 0.002, + "step": 20550 + }, + { + "epoch": 3.2698519782531053, + "grad_norm": 0.0010949111310765147, + "learning_rate": 2.031663432704181e-06, + "loss": 0.0001, + "step": 20600 + }, + { + "epoch": 3.2777888011429024, + "grad_norm": 0.018619557842612267, + "learning_rate": 2.0096136884812137e-06, + "loss": 0.0091, + "step": 20650 + }, + { + "epoch": 3.2857256240326995, + "grad_norm": 0.00012928845535498112, + "learning_rate": 1.9875639442582467e-06, + "loss": 0.0048, + "step": 20700 + }, + { + "epoch": 3.293662446922497, + "grad_norm": 0.0020417433697730303, + "learning_rate": 1.9655142000352797e-06, + "loss": 0.0032, + "step": 20750 + }, + { + "epoch": 3.3015992698122942, + "grad_norm": 0.003012231085449457, + "learning_rate": 1.9434644558123127e-06, + "loss": 0.0089, + "step": 20800 + }, + { + "epoch": 3.3095360927020914, + "grad_norm": 0.0012670076685026288, + "learning_rate": 1.9214147115893457e-06, + "loss": 0.0027, + "step": 20850 + }, + { + "epoch": 3.3174729155918885, + "grad_norm": 0.0011639808071777225, + "learning_rate": 1.8993649673663786e-06, + "loss": 0.0015, + "step": 20900 + }, + { + "epoch": 3.3254097384816856, + "grad_norm": 0.0014048466691747308, + "learning_rate": 1.8773152231434116e-06, + "loss": 0.0096, + "step": 20950 + }, + { + "epoch": 3.333346561371483, + "grad_norm": 9.100540161132812, + "learning_rate": 1.8552654789204446e-06, + "loss": 0.0197, + "step": 21000 + }, + { + "epoch": 3.333346561371483, + "eval_accuracy": 0.9763492063492063, + "eval_loss": 0.17093592882156372, + "eval_macro_f1": 0.956419648478896, + "eval_macro_precision": 0.9707661139733746, + "eval_macro_recall": 0.9448057653586319, + "eval_micro_f1": 0.9763492063492063, + "eval_micro_precision": 0.9763492063492063, + "eval_micro_recall": 0.9763492063492063, + "eval_runtime": 52.3722, + "eval_samples_per_second": 240.586, + "eval_steps_per_second": 30.073, + "eval_weighted_f1": 0.9762812381183971, + "eval_weighted_precision": 0.976400813243511, + "eval_weighted_recall": 0.9763492063492063, + "step": 21000 + }, + { + "epoch": 3.3412833842612804, + "grad_norm": 0.00045143740135245025, + "learning_rate": 1.8332157346974776e-06, + "loss": 0.0037, + "step": 21050 + }, + { + "epoch": 3.3492202071510775, + "grad_norm": 0.00014390982687473297, + "learning_rate": 1.8111659904745108e-06, + "loss": 0.0096, + "step": 21100 + }, + { + "epoch": 3.3571570300408746, + "grad_norm": 4.516872650128789e-05, + "learning_rate": 1.7891162462515436e-06, + "loss": 0.0104, + "step": 21150 + }, + { + "epoch": 3.3650938529306718, + "grad_norm": 0.020564353093504906, + "learning_rate": 1.7670665020285766e-06, + "loss": 0.001, + "step": 21200 + }, + { + "epoch": 3.373030675820469, + "grad_norm": 0.00030001444974914193, + "learning_rate": 1.7450167578056096e-06, + "loss": 0.0168, + "step": 21250 + }, + { + "epoch": 3.3809674987102665, + "grad_norm": 0.19772754609584808, + "learning_rate": 1.7229670135826426e-06, + "loss": 0.0002, + "step": 21300 + }, + { + "epoch": 3.3889043216000636, + "grad_norm": 0.01970568671822548, + "learning_rate": 1.7009172693596758e-06, + "loss": 0.0309, + "step": 21350 + }, + { + "epoch": 3.3968411444898607, + "grad_norm": 0.00025925575755536556, + "learning_rate": 1.6788675251367083e-06, + "loss": 0.0073, + "step": 21400 + }, + { + "epoch": 3.404777967379658, + "grad_norm": 0.004676587413996458, + "learning_rate": 1.657258775798201e-06, + "loss": 0.0052, + "step": 21450 + }, + { + "epoch": 3.412714790269455, + "grad_norm": 0.00010141974780708551, + "learning_rate": 1.635209031575234e-06, + "loss": 0.0079, + "step": 21500 + }, + { + "epoch": 3.412714790269455, + "eval_accuracy": 0.9769047619047619, + "eval_loss": 0.16325406730175018, + "eval_macro_f1": 0.9557812168870482, + "eval_macro_precision": 0.9696293003435598, + "eval_macro_recall": 0.9445357837826058, + "eval_micro_f1": 0.9769047619047619, + "eval_micro_precision": 0.9769047619047619, + "eval_micro_recall": 0.9769047619047619, + "eval_runtime": 48.9392, + "eval_samples_per_second": 257.462, + "eval_steps_per_second": 32.183, + "eval_weighted_f1": 0.9768367289110993, + "eval_weighted_precision": 0.9769254523389815, + "eval_weighted_recall": 0.9769047619047619, + "step": 21500 + }, + { + "epoch": 3.4206516131592526, + "grad_norm": 6.527017103508115e-05, + "learning_rate": 1.613159287352267e-06, + "loss": 0.0001, + "step": 21550 + }, + { + "epoch": 3.4285884360490497, + "grad_norm": 0.00797638576477766, + "learning_rate": 1.5911095431292997e-06, + "loss": 0.0023, + "step": 21600 + }, + { + "epoch": 3.436525258938847, + "grad_norm": 0.0008530872291885316, + "learning_rate": 1.5690597989063327e-06, + "loss": 0.0007, + "step": 21650 + }, + { + "epoch": 3.444462081828644, + "grad_norm": 0.00018081249436363578, + "learning_rate": 1.5470100546833659e-06, + "loss": 0.0109, + "step": 21700 + }, + { + "epoch": 3.452398904718441, + "grad_norm": 5.029146996093914e-05, + "learning_rate": 1.5249603104603989e-06, + "loss": 0.0041, + "step": 21750 + }, + { + "epoch": 3.4603357276082383, + "grad_norm": 0.002522735157981515, + "learning_rate": 1.5029105662374318e-06, + "loss": 0.0006, + "step": 21800 + }, + { + "epoch": 3.4682725504980354, + "grad_norm": 2.8557164114317857e-05, + "learning_rate": 1.4808608220144646e-06, + "loss": 0.0031, + "step": 21850 + }, + { + "epoch": 3.476209373387833, + "grad_norm": 0.003235569689422846, + "learning_rate": 1.4588110777914976e-06, + "loss": 0.0185, + "step": 21900 + }, + { + "epoch": 3.48414619627763, + "grad_norm": 0.011313154362142086, + "learning_rate": 1.4367613335685306e-06, + "loss": 0.0145, + "step": 21950 + }, + { + "epoch": 3.4920830191674272, + "grad_norm": 3.0896131647750735e-05, + "learning_rate": 1.4147115893455638e-06, + "loss": 0.0231, + "step": 22000 + }, + { + "epoch": 3.4920830191674272, + "eval_accuracy": 0.9756349206349206, + "eval_loss": 0.16351020336151123, + "eval_macro_f1": 0.9551717284616833, + "eval_macro_precision": 0.9681364681283637, + "eval_macro_recall": 0.945098492018414, + "eval_micro_f1": 0.9756349206349206, + "eval_micro_precision": 0.9756349206349206, + "eval_micro_recall": 0.9756349206349206, + "eval_runtime": 48.5537, + "eval_samples_per_second": 259.506, + "eval_steps_per_second": 32.438, + "eval_weighted_f1": 0.9755767607894801, + "eval_weighted_precision": 0.9756980555491296, + "eval_weighted_recall": 0.9756349206349206, + "step": 22000 + }, + { + "epoch": 3.5000198420572244, + "grad_norm": 0.0014016503700986505, + "learning_rate": 1.3926618451225968e-06, + "loss": 0.0175, + "step": 22050 + }, + { + "epoch": 3.507956664947022, + "grad_norm": 0.005145555827766657, + "learning_rate": 1.3706121008996296e-06, + "loss": 0.0075, + "step": 22100 + }, + { + "epoch": 3.515893487836819, + "grad_norm": 1.581344986334443e-05, + "learning_rate": 1.3485623566766626e-06, + "loss": 0.0004, + "step": 22150 + }, + { + "epoch": 3.5238303107266162, + "grad_norm": 7.287700282176957e-05, + "learning_rate": 1.3265126124536956e-06, + "loss": 0.0008, + "step": 22200 + }, + { + "epoch": 3.5317671336164134, + "grad_norm": 0.002235785825178027, + "learning_rate": 1.3044628682307288e-06, + "loss": 0.0077, + "step": 22250 + }, + { + "epoch": 3.5397039565062105, + "grad_norm": 0.00019435022841207683, + "learning_rate": 1.2824131240077617e-06, + "loss": 0.0026, + "step": 22300 + }, + { + "epoch": 3.5476407793960076, + "grad_norm": 0.008783644996583462, + "learning_rate": 1.2603633797847947e-06, + "loss": 0.0031, + "step": 22350 + }, + { + "epoch": 3.5555776022858048, + "grad_norm": 8.886044815881178e-05, + "learning_rate": 1.2383136355618277e-06, + "loss": 0.0021, + "step": 22400 + }, + { + "epoch": 3.5635144251756024, + "grad_norm": 0.0015128047671169043, + "learning_rate": 1.2162638913388605e-06, + "loss": 0.0126, + "step": 22450 + }, + { + "epoch": 3.5714512480653995, + "grad_norm": 0.0013680335832759738, + "learning_rate": 1.1942141471158935e-06, + "loss": 0.0076, + "step": 22500 + }, + { + "epoch": 3.5714512480653995, + "eval_accuracy": 0.9765873015873016, + "eval_loss": 0.16308797895908356, + "eval_macro_f1": 0.9559072153039692, + "eval_macro_precision": 0.9680547193198462, + "eval_macro_recall": 0.9463389894990366, + "eval_micro_f1": 0.9765873015873016, + "eval_micro_precision": 0.9765873015873016, + "eval_micro_recall": 0.9765873015873016, + "eval_runtime": 49.1975, + "eval_samples_per_second": 256.11, + "eval_steps_per_second": 32.014, + "eval_weighted_f1": 0.9765228546965284, + "eval_weighted_precision": 0.9766302422786851, + "eval_weighted_recall": 0.9765873015873016, + "step": 22500 + }, + { + "epoch": 3.5793880709551966, + "grad_norm": 0.03631841763854027, + "learning_rate": 1.1721644028929267e-06, + "loss": 0.0081, + "step": 22550 + }, + { + "epoch": 3.5873248938449938, + "grad_norm": 0.0012924810871481895, + "learning_rate": 1.1501146586699595e-06, + "loss": 0.0049, + "step": 22600 + }, + { + "epoch": 3.5952617167347913, + "grad_norm": 0.006269298959523439, + "learning_rate": 1.1280649144469925e-06, + "loss": 0.0075, + "step": 22650 + }, + { + "epoch": 3.6031985396245885, + "grad_norm": 0.0009378429385833442, + "learning_rate": 1.1060151702240254e-06, + "loss": 0.0086, + "step": 22700 + }, + { + "epoch": 3.6111353625143856, + "grad_norm": 0.032317861914634705, + "learning_rate": 1.0839654260010584e-06, + "loss": 0.0023, + "step": 22750 + }, + { + "epoch": 3.6190721854041827, + "grad_norm": 0.001633369131013751, + "learning_rate": 1.0619156817780914e-06, + "loss": 0.0002, + "step": 22800 + }, + { + "epoch": 3.62700900829398, + "grad_norm": 6.64698745822534e-05, + "learning_rate": 1.0398659375551244e-06, + "loss": 0.0111, + "step": 22850 + }, + { + "epoch": 3.634945831183777, + "grad_norm": 14.95582389831543, + "learning_rate": 1.0178161933321574e-06, + "loss": 0.0045, + "step": 22900 + }, + { + "epoch": 3.642882654073574, + "grad_norm": 0.0011493790661916137, + "learning_rate": 9.957664491091904e-07, + "loss": 0.0025, + "step": 22950 + }, + { + "epoch": 3.6508194769633717, + "grad_norm": 0.04192957282066345, + "learning_rate": 9.737167048862234e-07, + "loss": 0.0032, + "step": 23000 + }, + { + "epoch": 3.6508194769633717, + "eval_accuracy": 0.9774603174603175, + "eval_loss": 0.16377675533294678, + "eval_macro_f1": 0.9572334679389451, + "eval_macro_precision": 0.9700362196030153, + "eval_macro_recall": 0.9471315195900166, + "eval_micro_f1": 0.9774603174603175, + "eval_micro_precision": 0.9774603174603175, + "eval_micro_recall": 0.9774603174603175, + "eval_runtime": 64.2461, + "eval_samples_per_second": 196.121, + "eval_steps_per_second": 24.515, + "eval_weighted_f1": 0.9773904798618511, + "eval_weighted_precision": 0.9775254966358302, + "eval_weighted_recall": 0.9774603174603175, + "step": 23000 + }, + { + "epoch": 3.658756299853169, + "grad_norm": 0.0003047911450266838, + "learning_rate": 9.516669606632564e-07, + "loss": 0.0003, + "step": 23050 + }, + { + "epoch": 3.666693122742966, + "grad_norm": 0.14043422043323517, + "learning_rate": 9.296172164402894e-07, + "loss": 0.0115, + "step": 23100 + }, + { + "epoch": 3.674629945632763, + "grad_norm": 0.007793279364705086, + "learning_rate": 9.075674722173224e-07, + "loss": 0.01, + "step": 23150 + }, + { + "epoch": 3.6825667685225603, + "grad_norm": 0.15494094789028168, + "learning_rate": 8.855177279943554e-07, + "loss": 0.0003, + "step": 23200 + }, + { + "epoch": 3.690503591412358, + "grad_norm": 0.00017790609854273498, + "learning_rate": 8.634679837713883e-07, + "loss": 0.0004, + "step": 23250 + }, + { + "epoch": 3.698440414302155, + "grad_norm": 0.006829131860285997, + "learning_rate": 8.414182395484213e-07, + "loss": 0.011, + "step": 23300 + }, + { + "epoch": 3.706377237191952, + "grad_norm": 0.0003464875335339457, + "learning_rate": 8.193684953254542e-07, + "loss": 0.0092, + "step": 23350 + }, + { + "epoch": 3.7143140600817492, + "grad_norm": 0.0005877360817976296, + "learning_rate": 7.973187511024873e-07, + "loss": 0.0, + "step": 23400 + }, + { + "epoch": 3.7222508829715464, + "grad_norm": 0.0003003095625899732, + "learning_rate": 7.752690068795203e-07, + "loss": 0.0075, + "step": 23450 + }, + { + "epoch": 3.7301877058613435, + "grad_norm": 0.010633031837642193, + "learning_rate": 7.532192626565532e-07, + "loss": 0.004, + "step": 23500 + }, + { + "epoch": 3.7301877058613435, + "eval_accuracy": 0.9770634920634921, + "eval_loss": 0.16450679302215576, + "eval_macro_f1": 0.957808445275978, + "eval_macro_precision": 0.9706746434129168, + "eval_macro_recall": 0.9475056428847263, + "eval_micro_f1": 0.9770634920634921, + "eval_micro_precision": 0.9770634920634921, + "eval_micro_recall": 0.9770634920634921, + "eval_runtime": 48.1744, + "eval_samples_per_second": 261.55, + "eval_steps_per_second": 32.694, + "eval_weighted_f1": 0.9769934673940778, + "eval_weighted_precision": 0.9770703311250897, + "eval_weighted_recall": 0.9770634920634921, + "step": 23500 + }, + { + "epoch": 3.7381245287511407, + "grad_norm": 2.1199164390563965, + "learning_rate": 7.311695184335863e-07, + "loss": 0.0016, + "step": 23550 + }, + { + "epoch": 3.7460613516409382, + "grad_norm": 0.0003738963569048792, + "learning_rate": 7.095607690950785e-07, + "loss": 0.0131, + "step": 23600 + }, + { + "epoch": 3.7539981745307354, + "grad_norm": 6.239602953428403e-05, + "learning_rate": 6.875110248721116e-07, + "loss": 0.0167, + "step": 23650 + }, + { + "epoch": 3.7619349974205325, + "grad_norm": 0.0012471129884943366, + "learning_rate": 6.654612806491445e-07, + "loss": 0.0, + "step": 23700 + }, + { + "epoch": 3.7698718203103296, + "grad_norm": 0.00014138520054984838, + "learning_rate": 6.438525313106368e-07, + "loss": 0.0133, + "step": 23750 + }, + { + "epoch": 3.777808643200127, + "grad_norm": 0.00015882054867688566, + "learning_rate": 6.218027870876699e-07, + "loss": 0.0043, + "step": 23800 + }, + { + "epoch": 3.7857454660899243, + "grad_norm": 0.0001894296583486721, + "learning_rate": 5.997530428647029e-07, + "loss": 0.0172, + "step": 23850 + }, + { + "epoch": 3.7936822889797215, + "grad_norm": 0.0012666372349485755, + "learning_rate": 5.777032986417358e-07, + "loss": 0.0005, + "step": 23900 + }, + { + "epoch": 3.8016191118695186, + "grad_norm": 0.0015349318273365498, + "learning_rate": 5.556535544187688e-07, + "loss": 0.0022, + "step": 23950 + }, + { + "epoch": 3.8095559347593158, + "grad_norm": 0.00015529831580352038, + "learning_rate": 5.336038101958018e-07, + "loss": 0.0082, + "step": 24000 + }, + { + "epoch": 3.8095559347593158, + "eval_accuracy": 0.9775396825396825, + "eval_loss": 0.16624021530151367, + "eval_macro_f1": 0.9583518371874029, + "eval_macro_precision": 0.9715119738925228, + "eval_macro_recall": 0.947699963206565, + "eval_micro_f1": 0.9775396825396825, + "eval_micro_precision": 0.9775396825396825, + "eval_micro_recall": 0.9775396825396825, + "eval_runtime": 46.101, + "eval_samples_per_second": 273.313, + "eval_steps_per_second": 34.164, + "eval_weighted_f1": 0.9774702480661045, + "eval_weighted_precision": 0.9775614944397367, + "eval_weighted_recall": 0.9775396825396825, + "step": 24000 + }, + { + "epoch": 3.817492757649113, + "grad_norm": 0.00563812954351306, + "learning_rate": 5.115540659728347e-07, + "loss": 0.0135, + "step": 24050 + }, + { + "epoch": 3.82542958053891, + "grad_norm": 0.0018910864600911736, + "learning_rate": 4.895043217498677e-07, + "loss": 0.0105, + "step": 24100 + }, + { + "epoch": 3.8333664034287076, + "grad_norm": 0.00015920153236947954, + "learning_rate": 4.674545775269007e-07, + "loss": 0.0214, + "step": 24150 + }, + { + "epoch": 3.8413032263185047, + "grad_norm": 0.0004170116735622287, + "learning_rate": 4.454048333039337e-07, + "loss": 0.0073, + "step": 24200 + }, + { + "epoch": 3.849240049208302, + "grad_norm": 0.00018354528583586216, + "learning_rate": 4.2335508908096674e-07, + "loss": 0.0049, + "step": 24250 + }, + { + "epoch": 3.857176872098099, + "grad_norm": 1.992350697517395, + "learning_rate": 4.013053448579997e-07, + "loss": 0.0079, + "step": 24300 + }, + { + "epoch": 3.8651136949878966, + "grad_norm": 0.0027675540186464787, + "learning_rate": 3.7925560063503267e-07, + "loss": 0.0032, + "step": 24350 + }, + { + "epoch": 3.8730505178776937, + "grad_norm": 0.017909307032823563, + "learning_rate": 3.572058564120656e-07, + "loss": 0.0009, + "step": 24400 + }, + { + "epoch": 3.880987340767491, + "grad_norm": 0.0002593659737613052, + "learning_rate": 3.3515611218909865e-07, + "loss": 0.0089, + "step": 24450 + }, + { + "epoch": 3.888924163657288, + "grad_norm": 0.03440633788704872, + "learning_rate": 3.1310636796613164e-07, + "loss": 0.0087, + "step": 24500 + }, + { + "epoch": 3.888924163657288, + "eval_accuracy": 0.9776984126984127, + "eval_loss": 0.16271832585334778, + "eval_macro_f1": 0.9581437912558748, + "eval_macro_precision": 0.9706729136929291, + "eval_macro_recall": 0.9480541459491892, + "eval_micro_f1": 0.9776984126984127, + "eval_micro_precision": 0.9776984126984127, + "eval_micro_recall": 0.9776984126984127, + "eval_runtime": 46.9842, + "eval_samples_per_second": 268.175, + "eval_steps_per_second": 33.522, + "eval_weighted_f1": 0.9776414544812937, + "eval_weighted_precision": 0.9777223020348919, + "eval_weighted_recall": 0.9776984126984127, + "step": 24500 + }, + { + "epoch": 3.896860986547085, + "grad_norm": 0.00048743950901553035, + "learning_rate": 2.9105662374316457e-07, + "loss": 0.0001, + "step": 24550 + }, + { + "epoch": 3.9047978094368823, + "grad_norm": 5.859128475189209, + "learning_rate": 2.690068795201976e-07, + "loss": 0.0005, + "step": 24600 + }, + { + "epoch": 3.9127346323266794, + "grad_norm": 0.07823960483074188, + "learning_rate": 2.4695713529723055e-07, + "loss": 0.0095, + "step": 24650 + }, + { + "epoch": 3.920671455216477, + "grad_norm": 0.01893731579184532, + "learning_rate": 2.2490739107426357e-07, + "loss": 0.0035, + "step": 24700 + }, + { + "epoch": 3.928608278106274, + "grad_norm": 0.00017635202675592154, + "learning_rate": 2.0285764685129653e-07, + "loss": 0.0054, + "step": 24750 + }, + { + "epoch": 3.9365451009960712, + "grad_norm": 0.14684739708900452, + "learning_rate": 1.8080790262832955e-07, + "loss": 0.0006, + "step": 24800 + }, + { + "epoch": 3.9444819238858684, + "grad_norm": 4.845940202358179e-05, + "learning_rate": 1.587581584053625e-07, + "loss": 0.0008, + "step": 24850 + }, + { + "epoch": 3.952418746775666, + "grad_norm": 0.0005116136162541807, + "learning_rate": 1.367084141823955e-07, + "loss": 0.0004, + "step": 24900 + }, + { + "epoch": 3.960355569665463, + "grad_norm": 0.00017137936083599925, + "learning_rate": 1.1465866995942849e-07, + "loss": 0.0131, + "step": 24950 + }, + { + "epoch": 3.9682923925552602, + "grad_norm": 33.685508728027344, + "learning_rate": 9.260892573646146e-08, + "loss": 0.0025, + "step": 25000 + }, + { + "epoch": 3.9682923925552602, + "eval_accuracy": 0.9778571428571429, + "eval_loss": 0.16299165785312653, + "eval_macro_f1": 0.9587281193044483, + "eval_macro_precision": 0.9725024753902682, + "eval_macro_recall": 0.9475659044801065, + "eval_micro_f1": 0.9778571428571429, + "eval_micro_precision": 0.9778571428571429, + "eval_micro_recall": 0.9778571428571429, + "eval_runtime": 45.6663, + "eval_samples_per_second": 275.914, + "eval_steps_per_second": 34.489, + "eval_weighted_f1": 0.9777906938936711, + "eval_weighted_precision": 0.977879248064854, + "eval_weighted_recall": 0.9778571428571429, + "step": 25000 + }, + { + "epoch": 3.9762292154450574, + "grad_norm": 0.0008726433152332902, + "learning_rate": 7.055918151349445e-08, + "loss": 0.0029, + "step": 25050 + }, + { + "epoch": 3.9841660383348545, + "grad_norm": 0.005452016368508339, + "learning_rate": 4.850943729052743e-08, + "loss": 0.0051, + "step": 25100 + }, + { + "epoch": 3.9921028612246516, + "grad_norm": 2.1614205837249756, + "learning_rate": 2.645969306756042e-08, + "loss": 0.021, + "step": 25150 + } + ], + "logging_steps": 50, + "max_steps": 25196, + "num_input_tokens_seen": 0, + "num_train_epochs": 4, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +}