[ { "loss": 1.6348, "grad_norm": 12.6875, "learning_rate": 9.849246231155778e-07, "epoch": 0.25125628140703515, "step": 50 }, { "loss": 1.6242, "grad_norm": 13.625, "learning_rate": 1.989949748743719e-06, "epoch": 0.5025125628140703, "step": 100 }, { "loss": 1.6156, "grad_norm": 13.0, "learning_rate": 2.994974874371859e-06, "epoch": 0.7537688442211056, "step": 150 }, { "eval_loss": 1.6190789937973022, "eval_accuracy": 0.21059268600252207, "eval_top3": 0.6633039092055486, "eval_macro_f1": 0.2037528618679592, "eval_kappa": 0.03531167592000617, "eval_runtime": 64.558, "eval_samples_per_second": 12.284, "eval_steps_per_second": 0.387, "epoch": 1.0, "step": 199 }, { "loss": 1.6267, "grad_norm": 12.5625, "learning_rate": 4.000000000000001e-06, "epoch": 1.0050251256281406, "step": 200 }, { "loss": 1.6181, "grad_norm": 10.9375, "learning_rate": 5.005025125628141e-06, "epoch": 1.2562814070351758, "step": 250 }, { "loss": 1.5978, "grad_norm": 14.4375, "learning_rate": 6.010050251256282e-06, "epoch": 1.507537688442211, "step": 300 }, { "loss": 1.5929, "grad_norm": 11.125, "learning_rate": 7.015075376884422e-06, "epoch": 1.758793969849246, "step": 350 }, { "eval_loss": 1.5563229322433472, "eval_accuracy": 0.2938209331651955, "eval_top3": 0.7364438839848676, "eval_macro_f1": 0.26941324280219475, "eval_kappa": 0.11484951166035484, "eval_runtime": 1.348, "eval_samples_per_second": 588.28, "eval_steps_per_second": 18.546, "epoch": 2.0, "step": 398 }, { "loss": 1.5629, "grad_norm": 16.125, "learning_rate": 8.020100502512563e-06, "epoch": 2.0100502512562812, "step": 400 }, { "loss": 1.5411, "grad_norm": 12.125, "learning_rate": 9.025125628140704e-06, "epoch": 2.2613065326633164, "step": 450 }, { "loss": 1.5202, "grad_norm": 10.375, "learning_rate": 1.0030150753768846e-05, "epoch": 2.5125628140703515, "step": 500 }, { "loss": 1.4924, "grad_norm": 34.25, "learning_rate": 1.1035175879396986e-05, "epoch": 2.7638190954773867, "step": 550 }, { "eval_loss": 1.4240866899490356, "eval_accuracy": 0.46532156368221944, "eval_top3": 0.8348045397225725, "eval_macro_f1": 0.39144397784367796, "eval_kappa": 0.2981436602019366, "eval_runtime": 1.339, "eval_samples_per_second": 592.233, "eval_steps_per_second": 18.671, "epoch": 3.0, "step": 597 }, { "loss": 1.4388, "grad_norm": 12.375, "learning_rate": 1.2040201005025128e-05, "epoch": 3.0150753768844223, "step": 600 }, { "loss": 1.3922, "grad_norm": 10.125, "learning_rate": 1.3045226130653268e-05, "epoch": 3.2663316582914574, "step": 650 }, { "loss": 1.3391, "grad_norm": 13.0, "learning_rate": 1.4050251256281408e-05, "epoch": 3.5175879396984926, "step": 700 }, { "loss": 1.2838, "grad_norm": 11.625, "learning_rate": 1.5055276381909548e-05, "epoch": 3.7688442211055277, "step": 750 }, { "eval_loss": 1.202721118927002, "eval_accuracy": 0.5800756620428752, "eval_top3": 0.9205548549810845, "eval_macro_f1": 0.497103403115527, "eval_kappa": 0.4472502653133419, "eval_runtime": 1.337, "eval_samples_per_second": 593.118, "eval_steps_per_second": 18.699, "epoch": 4.0, "step": 796 }, { "loss": 1.2487, "grad_norm": 14.4375, "learning_rate": 1.606030150753769e-05, "epoch": 4.0201005025125625, "step": 800 }, { "loss": 1.1559, "grad_norm": 10.4375, "learning_rate": 1.706532663316583e-05, "epoch": 4.271356783919598, "step": 850 }, { "loss": 1.0407, "grad_norm": 20.25, "learning_rate": 1.8070351758793973e-05, "epoch": 4.522613065326633, "step": 900 }, { "loss": 0.9483, "grad_norm": 10.125, "learning_rate": 1.907537688442211e-05, "epoch": 4.773869346733669, "step": 950 }, { "eval_loss": 0.8165158629417419, "eval_accuracy": 0.7452711223203027, "eval_top3": 0.9672131147540983, "eval_macro_f1": 0.6978370232443252, "eval_kappa": 0.6680433777984089, "eval_runtime": 1.3351, "eval_samples_per_second": 593.948, "eval_steps_per_second": 18.725, "epoch": 5.0, "step": 995 }, { "loss": 0.8677, "grad_norm": 12.625, "learning_rate": 1.9999990154030625e-05, "epoch": 5.025125628140704, "step": 1000 }, { "loss": 0.7965, "grad_norm": 11.4375, "learning_rate": 1.9998205625451942e-05, "epoch": 5.276381909547739, "step": 1050 }, { "loss": 0.6202, "grad_norm": 10.5, "learning_rate": 1.9993344861920247e-05, "epoch": 5.527638190954773, "step": 1100 }, { "loss": 0.655, "grad_norm": 14.8125, "learning_rate": 1.9985409358988966e-05, "epoch": 5.778894472361809, "step": 1150 }, { "eval_loss": 0.5597819685935974, "eval_accuracy": 0.8007566204287516, "eval_top3": 0.9810844892812106, "eval_macro_f1": 0.7631654003718922, "eval_kappa": 0.7409659352859331, "eval_runtime": 1.388, "eval_samples_per_second": 571.326, "eval_steps_per_second": 18.012, "epoch": 6.0, "step": 1194 }, { "loss": 0.5711, "grad_norm": 14.375, "learning_rate": 1.9974401558243355e-05, "epoch": 6.030150753768845, "step": 1200 }, { "loss": 0.5362, "grad_norm": 13.25, "learning_rate": 1.9960324846549286e-05, "epoch": 6.28140703517588, "step": 1250 }, { "loss": 0.5104, "grad_norm": 12.9375, "learning_rate": 1.994318355501118e-05, "epoch": 6.532663316582915, "step": 1300 }, { "loss": 0.4477, "grad_norm": 12.0625, "learning_rate": 1.99229829576394e-05, "epoch": 6.78391959798995, "step": 1350 }, { "eval_loss": 0.46245822310447693, "eval_accuracy": 0.8310214375788146, "eval_top3": 0.987389659520807, "eval_macro_f1": 0.8040762608401479, "eval_kappa": 0.7808619761646, "eval_runtime": 1.334, "eval_samples_per_second": 594.453, "eval_steps_per_second": 18.741, "epoch": 7.0, "step": 1393 }, { "loss": 0.496, "grad_norm": 8.9375, "learning_rate": 1.9899729269727584e-05, "epoch": 7.035175879396985, "step": 1400 }, { "loss": 0.4427, "grad_norm": 8.5625, "learning_rate": 1.9873429645940293e-05, "epoch": 7.28643216080402, "step": 1450 }, { "loss": 0.4144, "grad_norm": 10.75, "learning_rate": 1.9844092178111703e-05, "epoch": 7.5376884422110555, "step": 1500 }, { "loss": 0.4074, "grad_norm": 11.0625, "learning_rate": 1.9811725892755905e-05, "epoch": 7.788944723618091, "step": 1550 }, { "eval_loss": 0.4191744029521942, "eval_accuracy": 0.8423707440100883, "eval_top3": 0.9886506935687264, "eval_macro_f1": 0.8179574437589323, "eval_kappa": 0.7955173694199191, "eval_runtime": 1.325, "eval_samples_per_second": 598.49, "eval_steps_per_second": 18.868, "epoch": 8.0, "step": 1592 }, { "loss": 0.402, "grad_norm": 11.875, "learning_rate": 1.9776340748289643e-05, "epoch": 8.040201005025125, "step": 1600 }, { "loss": 0.359, "grad_norm": 12.5, "learning_rate": 1.973794763196832e-05, "epoch": 8.291457286432161, "step": 1650 }, { "loss": 0.326, "grad_norm": 12.75, "learning_rate": 1.9696558356536224e-05, "epoch": 8.542713567839195, "step": 1700 }, { "loss": 0.3792, "grad_norm": 13.3125, "learning_rate": 1.9652185656591992e-05, "epoch": 8.793969849246231, "step": 1750 }, { "eval_loss": 0.39110326766967773, "eval_accuracy": 0.8537200504413619, "eval_top3": 0.9911727616645649, "eval_macro_f1": 0.8292392112258031, "eval_kappa": 0.8104571257842844, "eval_runtime": 1.37, "eval_samples_per_second": 578.832, "eval_steps_per_second": 18.248, "epoch": 9.0, "step": 1791 }, { "loss": 0.3652, "grad_norm": 12.0625, "learning_rate": 1.9604843184670462e-05, "epoch": 9.045226130653266, "step": 1800 }, { "loss": 0.3435, "grad_norm": 19.25, "learning_rate": 1.9554545507042047e-05, "epoch": 9.296482412060302, "step": 1850 }, { "loss": 0.3287, "grad_norm": 6.09375, "learning_rate": 1.950130809923104e-05, "epoch": 9.547738693467338, "step": 1900 }, { "loss": 0.2922, "grad_norm": 11.4375, "learning_rate": 1.9445147341254094e-05, "epoch": 9.798994974874372, "step": 1950 }, { "eval_loss": 0.3803386092185974, "eval_accuracy": 0.8511979823455234, "eval_top3": 0.9911727616645649, "eval_macro_f1": 0.8273026210900127, "eval_kappa": 0.8074331693865371, "eval_runtime": 1.391, "eval_samples_per_second": 570.092, "eval_steps_per_second": 17.973, "epoch": 10.0, "step": 1990 }, { "loss": 0.3334, "grad_norm": 10.8125, "learning_rate": 1.938608051258047e-05, "epoch": 10.050251256281408, "step": 2000 }, { "loss": 0.2973, "grad_norm": 12.0, "learning_rate": 1.932412578681548e-05, "epoch": 10.301507537688442, "step": 2050 }, { "loss": 0.2925, "grad_norm": 7.53125, "learning_rate": 1.9259302226108878e-05, "epoch": 10.552763819095478, "step": 2100 }, { "loss": 0.3054, "grad_norm": 44.0, "learning_rate": 1.9191629775289836e-05, "epoch": 10.804020100502512, "step": 2150 }, { "eval_loss": 0.36623987555503845, "eval_accuracy": 0.8638083228247163, "eval_top3": 0.9911727616645649, "eval_macro_f1": 0.8409607591489069, "eval_kappa": 0.823617727196901, "eval_runtime": 1.364, "eval_samples_per_second": 581.379, "eval_steps_per_second": 18.328, "epoch": 11.0, "step": 2189 }, { "loss": 0.2989, "grad_norm": 6.65625, "learning_rate": 1.912112925573035e-05, "epoch": 11.055276381909549, "step": 2200 }, { "loss": 0.2812, "grad_norm": 15.125, "learning_rate": 1.9047822358938933e-05, "epoch": 11.306532663316583, "step": 2250 }, { "loss": 0.2535, "grad_norm": 9.25, "learning_rate": 1.897173163988661e-05, "epoch": 11.557788944723619, "step": 2300 }, { "loss": 0.2797, "grad_norm": 22.0, "learning_rate": 1.8892880510067234e-05, "epoch": 11.809045226130653, "step": 2350 }, { "eval_loss": 0.3603597581386566, "eval_accuracy": 0.8688524590163934, "eval_top3": 0.9886506935687264, "eval_macro_f1": 0.8466482549906356, "eval_kappa": 0.8301133168401472, "eval_runtime": 1.368, "eval_samples_per_second": 579.678, "eval_steps_per_second": 18.275, "epoch": 12.0, "step": 2388 }, { "loss": 0.283, "grad_norm": 14.0625, "learning_rate": 1.881129323029427e-05, "epoch": 12.06030150753769, "step": 2400 }, { "loss": 0.2537, "grad_norm": 15.0, "learning_rate": 1.872699490323626e-05, "epoch": 12.311557788944723, "step": 2450 }, { "loss": 0.2988, "grad_norm": 14.25, "learning_rate": 1.8640011465693237e-05, "epoch": 12.56281407035176, "step": 2500 }, { "loss": 0.2403, "grad_norm": 8.3125, "learning_rate": 1.8550369680616584e-05, "epoch": 12.814070351758794, "step": 2550 }, { "eval_loss": 0.35605388879776, "eval_accuracy": 0.8738965952080706, "eval_top3": 0.9911727616645649, "eval_macro_f1": 0.8539434147627019, "eval_kappa": 0.8367116653351014, "eval_runtime": 1.361, "eval_samples_per_second": 582.66, "eval_steps_per_second": 18.369, "epoch": 13.0, "step": 2587 }, { "loss": 0.2475, "grad_norm": 15.5, "learning_rate": 1.8458097128874583e-05, "epoch": 13.06532663316583, "step": 2600 }, { "loss": 0.2492, "grad_norm": 5.5625, "learning_rate": 1.8363222200766406e-05, "epoch": 13.316582914572864, "step": 2650 }, { "loss": 0.2392, "grad_norm": 43.75, "learning_rate": 1.8265774087287016e-05, "epoch": 13.5678391959799, "step": 2700 }, { "loss": 0.2525, "grad_norm": 6.09375, "learning_rate": 1.816578277114571e-05, "epoch": 13.819095477386934, "step": 2750 }, { "eval_loss": 0.348567396402359, "eval_accuracy": 0.8764186633039092, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8541541677819424, "eval_kappa": 0.8398197730261395, "eval_runtime": 1.403, "eval_samples_per_second": 565.218, "eval_steps_per_second": 17.819, "epoch": 14.0, "step": 2786 }, { "loss": 0.2064, "grad_norm": 8.5, "learning_rate": 1.8063279017541086e-05, "epoch": 14.07035175879397, "step": 2800 }, { "loss": 0.2228, "grad_norm": 29.5, "learning_rate": 1.7958294364695254e-05, "epoch": 14.321608040201005, "step": 2850 }, { "loss": 0.23, "grad_norm": 9.5, "learning_rate": 1.7850861114150174e-05, "epoch": 14.57286432160804, "step": 2900 }, { "loss": 0.2341, "grad_norm": 18.75, "learning_rate": 1.7741012320829187e-05, "epoch": 14.824120603015075, "step": 2950 }, { "eval_loss": 0.3470554053783417, "eval_accuracy": 0.8764186633039092, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8554054945028179, "eval_kappa": 0.8397983100426509, "eval_runtime": 1.396, "eval_samples_per_second": 568.052, "eval_steps_per_second": 17.908, "epoch": 15.0, "step": 2985 }, { "loss": 0.2557, "grad_norm": 12.875, "learning_rate": 1.7628781782866696e-05, "epoch": 15.075376884422111, "step": 3000 }, { "loss": 0.2163, "grad_norm": 9.4375, "learning_rate": 1.751420403120922e-05, "epoch": 15.326633165829145, "step": 3050 }, { "loss": 0.2159, "grad_norm": 28.75, "learning_rate": 1.7397314318990933e-05, "epoch": 15.577889447236181, "step": 3100 }, { "loss": 0.2219, "grad_norm": 10.4375, "learning_rate": 1.7278148610687053e-05, "epoch": 15.829145728643216, "step": 3150 }, { "eval_loss": 0.3462725579738617, "eval_accuracy": 0.8764186633039092, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8554054945028179, "eval_kappa": 0.8397983100426509, "eval_runtime": 1.355, "eval_samples_per_second": 585.241, "eval_steps_per_second": 18.45, "epoch": 16.0, "step": 3184 }, { "loss": 0.2271, "grad_norm": 13.8125, "learning_rate": 1.7156743571048314e-05, "epoch": 16.08040201005025, "step": 3200 }, { "loss": 0.2162, "grad_norm": 11.125, "learning_rate": 1.703313655382002e-05, "epoch": 16.331658291457288, "step": 3250 }, { "loss": 0.2019, "grad_norm": 12.75, "learning_rate": 1.6907365590249083e-05, "epoch": 16.582914572864322, "step": 3300 }, { "loss": 0.1926, "grad_norm": 3.6875, "learning_rate": 1.6779469377382624e-05, "epoch": 16.834170854271356, "step": 3350 }, { "eval_loss": 0.34653961658477783, "eval_accuracy": 0.8751576292559899, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.853208113072801, "eval_kappa": 0.8382066236630051, "eval_runtime": 1.3501, "eval_samples_per_second": 587.384, "eval_steps_per_second": 18.518, "epoch": 17.0, "step": 3383 }, { "loss": 0.2128, "grad_norm": 16.5, "learning_rate": 1.6649487266161718e-05, "epoch": 17.08542713567839, "step": 3400 }, { "loss": 0.1929, "grad_norm": 10.5625, "learning_rate": 1.6517459249313926e-05, "epoch": 17.33668341708543, "step": 3450 }, { "loss": 0.2036, "grad_norm": 13.4375, "learning_rate": 1.638342594904843e-05, "epoch": 17.587939698492463, "step": 3500 }, { "loss": 0.1969, "grad_norm": 11.1875, "learning_rate": 1.6247428604557392e-05, "epoch": 17.839195979899497, "step": 3550 }, { "eval_loss": 0.3459188640117645, "eval_accuracy": 0.880201765447667, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8600443723197964, "eval_kappa": 0.8447552476373783, "eval_runtime": 1.344, "eval_samples_per_second": 590.028, "eval_steps_per_second": 18.601, "epoch": 18.0, "step": 3582 }, { "loss": 0.2207, "grad_norm": 18.125, "learning_rate": 1.610950905932756e-05, "epoch": 18.09045226130653, "step": 3600 }, { "loss": 0.2066, "grad_norm": 18.25, "learning_rate": 1.5969709748265933e-05, "epoch": 18.34170854271357, "step": 3650 }, { "loss": 0.1658, "grad_norm": 11.5625, "learning_rate": 1.58280736846434e-05, "epoch": 18.592964824120603, "step": 3700 }, { "loss": 0.2012, "grad_norm": 2.890625, "learning_rate": 1.5684644446860518e-05, "epoch": 18.844221105527637, "step": 3750 }, { "eval_loss": 0.3451780676841736, "eval_accuracy": 0.8751576292559899, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8549175688845306, "eval_kappa": 0.8383209115828104, "eval_runtime": 1.351, "eval_samples_per_second": 586.973, "eval_steps_per_second": 18.505, "epoch": 19.0, "step": 3781 }, { "loss": 0.2053, "grad_norm": 10.75, "learning_rate": 1.5539466165039338e-05, "epoch": 19.09547738693467, "step": 3800 }, { "loss": 0.1818, "grad_norm": 8.375, "learning_rate": 1.5392583507445508e-05, "epoch": 19.34673366834171, "step": 3850 }, { "loss": 0.2039, "grad_norm": 10.0625, "learning_rate": 1.524404166674482e-05, "epoch": 19.597989949748744, "step": 3900 }, { "loss": 0.1937, "grad_norm": 9.5, "learning_rate": 1.5093886346098372e-05, "epoch": 19.849246231155778, "step": 3950 }, { "eval_loss": 0.3440295159816742, "eval_accuracy": 0.880201765447667, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8590029071176492, "eval_kappa": 0.844723249362074, "eval_runtime": 1.345, "eval_samples_per_second": 589.592, "eval_steps_per_second": 18.587, "epoch": 20.0, "step": 3980 }, { "loss": 0.2018, "grad_norm": 17.375, "learning_rate": 1.4942163745100668e-05, "epoch": 20.100502512562816, "step": 4000 }, { "loss": 0.1673, "grad_norm": 7.625, "learning_rate": 1.4788920545565014e-05, "epoch": 20.35175879396985, "step": 4050 }, { "loss": 0.1789, "grad_norm": 20.75, "learning_rate": 1.4634203897160497e-05, "epoch": 20.603015075376884, "step": 4100 }, { "loss": 0.2001, "grad_norm": 3.453125, "learning_rate": 1.4478061402905048e-05, "epoch": 20.85427135678392, "step": 4150 }, { "eval_loss": 0.3432489037513733, "eval_accuracy": 0.8814627994955864, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8622259247649311, "eval_kappa": 0.8463894029254059, "eval_runtime": 1.365, "eval_samples_per_second": 580.952, "eval_steps_per_second": 18.315, "epoch": 21.0, "step": 4179 }, { "loss": 0.1866, "grad_norm": 3.546875, "learning_rate": 1.4320541104518992e-05, "epoch": 21.105527638190956, "step": 4200 }, { "loss": 0.184, "grad_norm": 15.375, "learning_rate": 1.4161691467643659e-05, "epoch": 21.35678391959799, "step": 4250 }, { "loss": 0.1923, "grad_norm": 8.25, "learning_rate": 1.400156136692951e-05, "epoch": 21.608040201005025, "step": 4300 }, { "loss": 0.1762, "grad_norm": 4.46875, "learning_rate": 1.3840200070998466e-05, "epoch": 21.85929648241206, "step": 4350 }, { "eval_loss": 0.34197643399238586, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8649545688082612, "eval_kappa": 0.8496555447709369, "eval_runtime": 1.366, "eval_samples_per_second": 580.527, "eval_steps_per_second": 18.302, "epoch": 22.0, "step": 4378 }, { "loss": 0.1991, "grad_norm": 13.625, "learning_rate": 1.3677657227285e-05, "epoch": 22.110552763819097, "step": 4400 }, { "loss": 0.2095, "grad_norm": 23.875, "learning_rate": 1.3513982846760669e-05, "epoch": 22.36180904522613, "step": 4450 }, { "loss": 0.1788, "grad_norm": 13.5, "learning_rate": 1.3349227288546815e-05, "epoch": 22.613065326633166, "step": 4500 }, { "loss": 0.1537, "grad_norm": 16.375, "learning_rate": 1.3183441244420129e-05, "epoch": 22.8643216080402, "step": 4550 }, { "eval_loss": 0.34272438287734985, "eval_accuracy": 0.880201765447667, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8598827006510683, "eval_kappa": 0.8447574870227686, "eval_runtime": 1.407, "eval_samples_per_second": 563.611, "eval_steps_per_second": 17.768, "epoch": 23.0, "step": 4577 }, { "loss": 0.1774, "grad_norm": 9.3125, "learning_rate": 1.3016675723215879e-05, "epoch": 23.115577889447238, "step": 4600 }, { "loss": 0.1776, "grad_norm": 7.78125, "learning_rate": 1.2848982035133555e-05, "epoch": 23.366834170854272, "step": 4650 }, { "loss": 0.1666, "grad_norm": 8.5625, "learning_rate": 1.2680411775949847e-05, "epoch": 23.618090452261306, "step": 4700 }, { "loss": 0.1787, "grad_norm": 8.0625, "learning_rate": 1.2511016811143697e-05, "epoch": 23.86934673366834, "step": 4750 }, { "eval_loss": 0.34232452511787415, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8619418239031577, "eval_kappa": 0.8479944267302592, "eval_runtime": 1.395, "eval_samples_per_second": 568.458, "eval_steps_per_second": 17.921, "epoch": 24.0, "step": 4776 }, { "loss": 0.1751, "grad_norm": 18.25, "learning_rate": 1.2340849259938404e-05, "epoch": 24.12060301507538, "step": 4800 }, { "loss": 0.1651, "grad_norm": 10.625, "learning_rate": 1.2169961479265653e-05, "epoch": 24.371859296482413, "step": 4850 }, { "loss": 0.1746, "grad_norm": 5.28125, "learning_rate": 1.1998406047656396e-05, "epoch": 24.623115577889447, "step": 4900 }, { "loss": 0.1905, "grad_norm": 12.5625, "learning_rate": 1.182623574906356e-05, "epoch": 24.87437185929648, "step": 4950 }, { "eval_loss": 0.34067824482917786, "eval_accuracy": 0.8852459016393442, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8661537754454564, "eval_kappa": 0.8512633637898235, "eval_runtime": 1.358, "eval_samples_per_second": 583.949, "eval_steps_per_second": 18.409, "epoch": 25.0, "step": 4975 }, { "loss": 0.1701, "grad_norm": 6.125, "learning_rate": 1.1653503556621553e-05, "epoch": 25.12562814070352, "step": 5000 }, { "loss": 0.1833, "grad_norm": 16.0, "learning_rate": 1.1480262616347544e-05, "epoch": 25.376884422110553, "step": 5050 }, { "loss": 0.167, "grad_norm": 6.3125, "learning_rate": 1.1306566230789593e-05, "epoch": 25.628140703517587, "step": 5100 }, { "loss": 0.167, "grad_norm": 25.75, "learning_rate": 1.1132467842626555e-05, "epoch": 25.87939698492462, "step": 5150 }, { "eval_loss": 0.34115472435951233, "eval_accuracy": 0.8852459016393442, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8661537754454564, "eval_kappa": 0.8512633637898235, "eval_runtime": 1.347, "eval_samples_per_second": 588.717, "eval_steps_per_second": 18.56, "epoch": 26.0, "step": 5174 }, { "loss": 0.1756, "grad_norm": 6.8125, "learning_rate": 1.0958021018224942e-05, "epoch": 26.13065326633166, "step": 5200 }, { "loss": 0.1735, "grad_norm": 4.59375, "learning_rate": 1.0783279431157668e-05, "epoch": 26.381909547738694, "step": 5250 }, { "loss": 0.1778, "grad_norm": 12.375, "learning_rate": 1.0608296845689843e-05, "epoch": 26.633165829145728, "step": 5300 }, { "loss": 0.1699, "grad_norm": 10.5, "learning_rate": 1.0433127100236655e-05, "epoch": 26.884422110552762, "step": 5350 }, { "eval_loss": 0.3404243290424347, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8649838454025487, "eval_kappa": 0.8496422211963331, "eval_runtime": 1.365, "eval_samples_per_second": 580.951, "eval_steps_per_second": 18.315, "epoch": 27.0, "step": 5373 }, { "loss": 0.1706, "grad_norm": 5.9375, "learning_rate": 1.0257824090798431e-05, "epoch": 27.1356783919598, "step": 5400 }, { "loss": 0.1549, "grad_norm": 4.5625, "learning_rate": 1.0082441754377996e-05, "epoch": 27.386934673366834, "step": 5450 }, { "loss": 0.1816, "grad_norm": 10.75, "learning_rate": 9.907034052385383e-06, "epoch": 27.63819095477387, "step": 5500 }, { "loss": 0.1777, "grad_norm": 14.0625, "learning_rate": 9.731654954035082e-06, "epoch": 27.889447236180903, "step": 5550 }, { "eval_loss": 0.3424096405506134, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.368, "eval_samples_per_second": 579.679, "eval_steps_per_second": 18.275, "epoch": 28.0, "step": 5572 }, { "loss": 0.1808, "grad_norm": 3.65625, "learning_rate": 9.556358419740852e-06, "epoch": 28.14070351758794, "step": 5600 }, { "loss": 0.1799, "grad_norm": 9.25, "learning_rate": 9.381198384513253e-06, "epoch": 28.391959798994975, "step": 5650 }, { "loss": 0.155, "grad_norm": 7.25, "learning_rate": 9.206228741364972e-06, "epoch": 28.64321608040201, "step": 5700 }, { "loss": 0.17, "grad_norm": 20.375, "learning_rate": 9.031503324729128e-06, "epoch": 28.894472361809044, "step": 5750 }, { "eval_loss": 0.3412993550300598, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8622758895354596, "eval_kappa": 0.8479787600258079, "eval_runtime": 1.356, "eval_samples_per_second": 584.808, "eval_steps_per_second": 18.437, "epoch": 29.0, "step": 5771 }, { "loss": 0.1891, "grad_norm": 13.625, "learning_rate": 8.857075893895537e-06, "epoch": 29.14572864321608, "step": 5800 }, { "loss": 0.1624, "grad_norm": 9.0625, "learning_rate": 8.683000116470117e-06, "epoch": 29.396984924623116, "step": 5850 }, { "loss": 0.1562, "grad_norm": 9.4375, "learning_rate": 8.509329551862535e-06, "epoch": 29.64824120603015, "step": 5900 }, { "loss": 0.1926, "grad_norm": 10.625, "learning_rate": 8.336117634807107e-06, "epoch": 29.899497487437188, "step": 5950 }, { "eval_loss": 0.3421500027179718, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.352, "eval_samples_per_second": 586.538, "eval_steps_per_second": 18.491, "epoch": 30.0, "step": 5970 }, { "loss": 0.1803, "grad_norm": 12.3125, "learning_rate": 8.163417658922048e-06, "epoch": 30.150753768844222, "step": 6000 }, { "loss": 0.1612, "grad_norm": 19.625, "learning_rate": 7.991282760312188e-06, "epoch": 30.402010050251256, "step": 6050 }, { "loss": 0.1568, "grad_norm": 8.125, "learning_rate": 7.819765901220113e-06, "epoch": 30.65326633165829, "step": 6100 }, { "loss": 0.1639, "grad_norm": 10.6875, "learning_rate": 7.648919853730804e-06, "epoch": 30.90452261306533, "step": 6150 }, { "eval_loss": 0.34186428785324097, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.391, "eval_samples_per_second": 570.094, "eval_steps_per_second": 17.973, "epoch": 31.0, "step": 6169 }, { "loss": 0.1836, "grad_norm": 15.1875, "learning_rate": 7.478797183534803e-06, "epoch": 31.155778894472363, "step": 6200 }, { "loss": 0.1477, "grad_norm": 13.8125, "learning_rate": 7.309450233754869e-06, "epoch": 31.407035175879397, "step": 6250 }, { "loss": 0.1907, "grad_norm": 12.875, "learning_rate": 7.140931108841094e-06, "epoch": 31.65829145728643, "step": 6300 }, { "loss": 0.1552, "grad_norm": 8.25, "learning_rate": 6.973291658539496e-06, "epoch": 31.90954773869347, "step": 6350 }, { "eval_loss": 0.3415157198905945, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.327, "eval_samples_per_second": 597.588, "eval_steps_per_second": 18.839, "epoch": 32.0, "step": 6368 }, { "loss": 0.1516, "grad_norm": 9.0625, "learning_rate": 6.806583461938956e-06, "epoch": 32.1608040201005, "step": 6400 }, { "loss": 0.187, "grad_norm": 4.09375, "learning_rate": 6.6408578116014025e-06, "epoch": 32.41206030150754, "step": 6450 }, { "loss": 0.1809, "grad_norm": 6.09375, "learning_rate": 6.4761656977802236e-06, "epoch": 32.663316582914575, "step": 6500 }, { "loss": 0.1543, "grad_norm": 28.75, "learning_rate": 6.312557792731619e-06, "epoch": 32.914572864321606, "step": 6550 }, { "eval_loss": 0.342151015996933, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.349, "eval_samples_per_second": 587.844, "eval_steps_per_second": 18.532, "epoch": 33.0, "step": 6567 }, { "loss": 0.1549, "grad_norm": 8.3125, "learning_rate": 6.150084435123842e-06, "epoch": 33.165829145728644, "step": 6600 }, { "loss": 0.1766, "grad_norm": 10.75, "learning_rate": 5.988795614549054e-06, "epoch": 33.41708542713568, "step": 6650 }, { "loss": 0.1597, "grad_norm": 5.9375, "learning_rate": 5.828740956142611e-06, "epoch": 33.66834170854271, "step": 6700 }, { "loss": 0.1688, "grad_norm": 6.59375, "learning_rate": 5.669969705314432e-06, "epoch": 33.91959798994975, "step": 6750 }, { "eval_loss": 0.3422100245952606, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.363, "eval_samples_per_second": 581.803, "eval_steps_per_second": 18.342, "epoch": 34.0, "step": 6766 }, { "loss": 0.1756, "grad_norm": 7.875, "learning_rate": 5.512530712597268e-06, "epoch": 34.17085427135678, "step": 6800 }, { "loss": 0.1617, "grad_norm": 5.34375, "learning_rate": 5.356472418616425e-06, "epoch": 34.42211055276382, "step": 6850 }, { "loss": 0.162, "grad_norm": 10.75, "learning_rate": 5.201842839185598e-06, "epoch": 34.67336683417086, "step": 6900 }, { "loss": 0.1638, "grad_norm": 3.078125, "learning_rate": 5.048689550533444e-06, "epoch": 34.92462311557789, "step": 6950 }, { "eval_loss": 0.34207883477211, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.365, "eval_samples_per_second": 580.953, "eval_steps_per_second": 18.315, "epoch": 35.0, "step": 6965 }, { "loss": 0.1858, "grad_norm": 21.625, "learning_rate": 4.897059674665391e-06, "epoch": 35.175879396984925, "step": 7000 }, { "loss": 0.1714, "grad_norm": 6.875, "learning_rate": 4.746999864865188e-06, "epoch": 35.42713567839196, "step": 7050 }, { "loss": 0.1725, "grad_norm": 6.5625, "learning_rate": 4.5985562913407015e-06, "epoch": 35.678391959798994, "step": 7100 }, { "loss": 0.1641, "grad_norm": 23.75, "learning_rate": 4.451774627018303e-06, "epoch": 35.92964824120603, "step": 7150 }, { "eval_loss": 0.34272658824920654, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.403, "eval_samples_per_second": 565.216, "eval_steps_per_second": 17.819, "epoch": 36.0, "step": 7164 }, { "loss": 0.1798, "grad_norm": 23.375, "learning_rate": 4.3067000334902985e-06, "epoch": 36.18090452261306, "step": 7200 }, { "loss": 0.1658, "grad_norm": 15.625, "learning_rate": 4.163377147119664e-06, "epoch": 36.4321608040201, "step": 7250 }, { "loss": 0.1755, "grad_norm": 5.0, "learning_rate": 4.0218500653063905e-06, "epoch": 36.68341708542714, "step": 7300 }, { "loss": 0.1623, "grad_norm": 5.5625, "learning_rate": 3.882162332919645e-06, "epoch": 36.93467336683417, "step": 7350 }, { "eval_loss": 0.3424283564090729, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.372, "eval_samples_per_second": 577.988, "eval_steps_per_second": 18.222, "epoch": 37.0, "step": 7363 }, { "loss": 0.1677, "grad_norm": 7.96875, "learning_rate": 3.744356928899939e-06, "epoch": 37.185929648241206, "step": 7400 }, { "loss": 0.1683, "grad_norm": 14.375, "learning_rate": 3.6084762530354487e-06, "epoch": 37.437185929648244, "step": 7450 }, { "loss": 0.1778, "grad_norm": 8.375, "learning_rate": 3.4745621129164676e-06, "epoch": 37.688442211055275, "step": 7500 }, { "loss": 0.1565, "grad_norm": 7.84375, "learning_rate": 3.3426557110721326e-06, "epoch": 37.93969849246231, "step": 7550 }, { "eval_loss": 0.3421717584133148, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.341, "eval_samples_per_second": 591.348, "eval_steps_per_second": 18.643, "epoch": 38.0, "step": 7562 }, { "loss": 0.1708, "grad_norm": 40.75, "learning_rate": 3.2127976322932596e-06, "epoch": 38.19095477386934, "step": 7600 }, { "loss": 0.1841, "grad_norm": 9.125, "learning_rate": 3.0850278311452797e-06, "epoch": 38.44221105527638, "step": 7650 }, { "loss": 0.1649, "grad_norm": 6.9375, "learning_rate": 2.9593856196750705e-06, "epoch": 38.69346733668342, "step": 7700 }, { "loss": 0.1606, "grad_norm": 22.125, "learning_rate": 2.8359096553154806e-06, "epoch": 38.94472361809045, "step": 7750 }, { "eval_loss": 0.34265828132629395, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.358, "eval_samples_per_second": 583.946, "eval_steps_per_second": 18.409, "epoch": 39.0, "step": 7761 }, { "loss": 0.176, "grad_norm": 12.875, "learning_rate": 2.7146379289912337e-06, "epoch": 39.19597989949749, "step": 7800 }, { "loss": 0.1633, "grad_norm": 5.71875, "learning_rate": 2.5956077534299715e-06, "epoch": 39.447236180904525, "step": 7850 }, { "loss": 0.1517, "grad_norm": 9.5, "learning_rate": 2.4788557516818935e-06, "epoch": 39.698492462311556, "step": 7900 }, { "loss": 0.1839, "grad_norm": 4.5625, "learning_rate": 2.3644178458516353e-06, "epoch": 39.949748743718594, "step": 7950 }, { "eval_loss": 0.3417166769504547, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.347, "eval_samples_per_second": 588.716, "eval_steps_per_second": 18.56, "epoch": 40.0, "step": 7960 }, { "loss": 0.1759, "grad_norm": 9.0625, "learning_rate": 2.252329246045787e-06, "epoch": 40.20100502512563, "step": 8000 }, { "loss": 0.1724, "grad_norm": 10.0625, "learning_rate": 2.142624439539516e-06, "epoch": 40.45226130653266, "step": 8050 }, { "loss": 0.1762, "grad_norm": 5.875, "learning_rate": 2.0353371801655564e-06, "epoch": 40.7035175879397, "step": 8100 }, { "loss": 0.1538, "grad_norm": 17.625, "learning_rate": 1.9305004779288673e-06, "epoch": 40.95477386934673, "step": 8150 }, { "eval_loss": 0.3423360288143158, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.323, "eval_samples_per_second": 599.394, "eval_steps_per_second": 18.896, "epoch": 41.0, "step": 8159 }, { "loss": 0.1696, "grad_norm": 11.875, "learning_rate": 1.8281465888501627e-06, "epoch": 41.20603015075377, "step": 8200 }, { "loss": 0.1642, "grad_norm": 12.875, "learning_rate": 1.7283070050414275e-06, "epoch": 41.45728643216081, "step": 8250 }, { "loss": 0.1711, "grad_norm": 5.75, "learning_rate": 1.6310124450164488e-06, "epoch": 41.70854271356784, "step": 8300 }, { "loss": 0.1544, "grad_norm": 11.25, "learning_rate": 1.5362928442394055e-06, "epoch": 41.959798994974875, "step": 8350 }, { "eval_loss": 0.34329381585121155, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.344, "eval_samples_per_second": 590.03, "eval_steps_per_second": 18.601, "epoch": 42.0, "step": 8358 }, { "loss": 0.1794, "grad_norm": 14.5, "learning_rate": 1.4441773459143405e-06, "epoch": 42.21105527638191, "step": 8400 }, { "loss": 0.146, "grad_norm": 7.28125, "learning_rate": 1.3546942920184303e-06, "epoch": 42.462311557788944, "step": 8450 }, { "loss": 0.1634, "grad_norm": 15.875, "learning_rate": 1.267871214581764e-06, "epoch": 42.71356783919598, "step": 8500 }, { "loss": 0.1804, "grad_norm": 10.25, "learning_rate": 1.1837348272163208e-06, "epoch": 42.96482412060301, "step": 8550 }, { "eval_loss": 0.3423879146575928, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.341, "eval_samples_per_second": 591.35, "eval_steps_per_second": 18.643, "epoch": 43.0, "step": 8557 }, { "loss": 0.162, "grad_norm": 18.375, "learning_rate": 1.1023110168967554e-06, "epoch": 43.21608040201005, "step": 8600 }, { "loss": 0.1698, "grad_norm": 106.0, "learning_rate": 1.0236248359955293e-06, "epoch": 43.46733668341709, "step": 8650 }, { "loss": 0.1629, "grad_norm": 16.875, "learning_rate": 9.477004945748414e-07, "epoch": 43.71859296482412, "step": 8700 }, { "loss": 0.1766, "grad_norm": 7.0, "learning_rate": 8.745613529376851e-07, "epoch": 43.969849246231156, "step": 8750 }, { "eval_loss": 0.34215831756591797, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.36, "eval_samples_per_second": 583.089, "eval_steps_per_second": 18.382, "epoch": 44.0, "step": 8756 }, { "loss": 0.158, "grad_norm": 6.1875, "learning_rate": 8.042299144404031e-07, "epoch": 44.221105527638194, "step": 8800 }, { "loss": 0.1792, "grad_norm": 3.859375, "learning_rate": 7.367278185688697e-07, "epoch": 44.472361809045225, "step": 8850 }, { "loss": 0.1887, "grad_norm": 5.71875, "learning_rate": 6.720758342804834e-07, "epoch": 44.72361809045226, "step": 8900 }, { "loss": 0.1489, "grad_norm": 21.25, "learning_rate": 6.10293853614008e-07, "epoch": 44.97487437185929, "step": 8950 }, { "eval_loss": 0.3427422344684601, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.31, "eval_samples_per_second": 605.344, "eval_steps_per_second": 19.084, "epoch": 45.0, "step": 8955 }, { "loss": 0.1917, "grad_norm": 8.5625, "learning_rate": 5.514008855692087e-07, "epoch": 45.22613065326633, "step": 9000 }, { "loss": 0.1846, "grad_norm": 4.875, "learning_rate": 4.954150502581923e-07, "epoch": 45.47738693467337, "step": 9050 }, { "loss": 0.1375, "grad_norm": 7.34375, "learning_rate": 4.4235357333022864e-07, "epoch": 45.7286432160804, "step": 9100 }, { "loss": 0.1672, "grad_norm": 11.6875, "learning_rate": 3.9223278067179404e-07, "epoch": 45.97989949748744, "step": 9150 }, { "eval_loss": 0.34274017810821533, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.335, "eval_samples_per_second": 594.008, "eval_steps_per_second": 18.727, "epoch": 46.0, "step": 9154 }, { "loss": 0.1705, "grad_norm": 3.21875, "learning_rate": 3.4506809338343495e-07, "epoch": 46.231155778894475, "step": 9200 }, { "loss": 0.1555, "grad_norm": 16.25, "learning_rate": 3.008740230350293e-07, "epoch": 46.482412060301506, "step": 9250 }, { "loss": 0.1823, "grad_norm": 14.375, "learning_rate": 2.596641672008837e-07, "epoch": 46.733668341708544, "step": 9300 }, { "loss": 0.1669, "grad_norm": 10.0, "learning_rate": 2.214512052760487e-07, "epoch": 46.984924623115575, "step": 9350 }, { "eval_loss": 0.3425142168998718, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.372, "eval_samples_per_second": 577.988, "eval_steps_per_second": 18.222, "epoch": 47.0, "step": 9353 }, { "loss": 0.1545, "grad_norm": 13.375, "learning_rate": 1.8624689457513945e-07, "epoch": 47.23618090452261, "step": 9400 }, { "loss": 0.1768, "grad_norm": 11.125, "learning_rate": 1.54062066714864e-07, "epoch": 47.48743718592965, "step": 9450 }, { "loss": 0.1526, "grad_norm": 3.765625, "learning_rate": 1.2490662428135569e-07, "epoch": 47.73869346733668, "step": 9500 }, { "loss": 0.179, "grad_norm": 20.0, "learning_rate": 9.87895377833692e-08, "epoch": 47.98994974874372, "step": 9550 }, { "eval_loss": 0.3430207669734955, "eval_accuracy": 0.8827238335435057, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8628805718895952, "eval_kappa": 0.8480078975136847, "eval_runtime": 1.3929, "eval_samples_per_second": 569.323, "eval_steps_per_second": 17.948, "epoch": 48.0, "step": 9552 }, { "loss": 0.1604, "grad_norm": 10.875, "learning_rate": 7.571884289224174e-08, "epoch": 48.24120603015076, "step": 9600 }, { "loss": 0.1837, "grad_norm": 33.0, "learning_rate": 5.5701637969486355e-08, "epoch": 48.49246231155779, "step": 9650 }, { "loss": 0.1591, "grad_norm": 5.5625, "learning_rate": 3.87440818827789e-08, "epoch": 48.743718592964825, "step": 9700 }, { "loss": 0.178, "grad_norm": 10.5, "learning_rate": 2.4851392111004956e-08, "epoch": 48.994974874371856, "step": 9750 }, { "eval_loss": 0.34273195266723633, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.438, "eval_samples_per_second": 551.459, "eval_steps_per_second": 17.385, "epoch": 49.0, "step": 9751 }, { "loss": 0.1834, "grad_norm": 11.5, "learning_rate": 1.4027843138954001e-08, "epoch": 49.246231155778894, "step": 9800 }, { "loss": 0.18, "grad_norm": 14.6875, "learning_rate": 6.276765142152475e-09, "epoch": 49.49748743718593, "step": 9850 }, { "loss": 0.1612, "grad_norm": 10.125, "learning_rate": 1.6005429622334423e-09, "epoch": 49.74874371859296, "step": 9900 }, { "loss": 0.1675, "grad_norm": 24.5, "learning_rate": 6.153731813007824e-13, "epoch": 50.0, "step": 9950 }, { "eval_loss": 0.34301358461380005, "eval_accuracy": 0.8839848675914249, "eval_top3": 0.9899117276166457, "eval_macro_f1": 0.8640505019325028, "eval_kappa": 0.8496288952600413, "eval_runtime": 1.334, "eval_samples_per_second": 594.454, "eval_steps_per_second": 18.741, "epoch": 50.0, "step": 9950 }, { "train_runtime": 1027.9074, "train_samples_per_second": 154.197, "train_steps_per_second": 9.68, "total_flos": 1.2418210759836672e+19, "train_loss": 0.335881779062089, "epoch": 50.0, "step": 9950 } ]