kritaphatson's picture
Upload folder using huggingface_hub
3ed7116 verified
Raw
History Blame Contribute Delete
48.7 kB
[
{
"loss": 1.6348,
"grad_norm": 12.6875,
"learning_rate": 9.849246231155778e-07,
"epoch": 0.25125628140703515,
"step": 50
},
{
"loss": 1.6242,
"grad_norm": 13.625,
"learning_rate": 1.989949748743719e-06,
"epoch": 0.5025125628140703,
"step": 100
},
{
"loss": 1.6156,
"grad_norm": 13.0,
"learning_rate": 2.994974874371859e-06,
"epoch": 0.7537688442211056,
"step": 150
},
{
"eval_loss": 1.6190789937973022,
"eval_accuracy": 0.21059268600252207,
"eval_top3": 0.6633039092055486,
"eval_macro_f1": 0.2037528618679592,
"eval_kappa": 0.03531167592000617,
"eval_runtime": 64.558,
"eval_samples_per_second": 12.284,
"eval_steps_per_second": 0.387,
"epoch": 1.0,
"step": 199
},
{
"loss": 1.6267,
"grad_norm": 12.5625,
"learning_rate": 4.000000000000001e-06,
"epoch": 1.0050251256281406,
"step": 200
},
{
"loss": 1.6181,
"grad_norm": 10.9375,
"learning_rate": 5.005025125628141e-06,
"epoch": 1.2562814070351758,
"step": 250
},
{
"loss": 1.5978,
"grad_norm": 14.4375,
"learning_rate": 6.010050251256282e-06,
"epoch": 1.507537688442211,
"step": 300
},
{
"loss": 1.5929,
"grad_norm": 11.125,
"learning_rate": 7.015075376884422e-06,
"epoch": 1.758793969849246,
"step": 350
},
{
"eval_loss": 1.5563229322433472,
"eval_accuracy": 0.2938209331651955,
"eval_top3": 0.7364438839848676,
"eval_macro_f1": 0.26941324280219475,
"eval_kappa": 0.11484951166035484,
"eval_runtime": 1.348,
"eval_samples_per_second": 588.28,
"eval_steps_per_second": 18.546,
"epoch": 2.0,
"step": 398
},
{
"loss": 1.5629,
"grad_norm": 16.125,
"learning_rate": 8.020100502512563e-06,
"epoch": 2.0100502512562812,
"step": 400
},
{
"loss": 1.5411,
"grad_norm": 12.125,
"learning_rate": 9.025125628140704e-06,
"epoch": 2.2613065326633164,
"step": 450
},
{
"loss": 1.5202,
"grad_norm": 10.375,
"learning_rate": 1.0030150753768846e-05,
"epoch": 2.5125628140703515,
"step": 500
},
{
"loss": 1.4924,
"grad_norm": 34.25,
"learning_rate": 1.1035175879396986e-05,
"epoch": 2.7638190954773867,
"step": 550
},
{
"eval_loss": 1.4240866899490356,
"eval_accuracy": 0.46532156368221944,
"eval_top3": 0.8348045397225725,
"eval_macro_f1": 0.39144397784367796,
"eval_kappa": 0.2981436602019366,
"eval_runtime": 1.339,
"eval_samples_per_second": 592.233,
"eval_steps_per_second": 18.671,
"epoch": 3.0,
"step": 597
},
{
"loss": 1.4388,
"grad_norm": 12.375,
"learning_rate": 1.2040201005025128e-05,
"epoch": 3.0150753768844223,
"step": 600
},
{
"loss": 1.3922,
"grad_norm": 10.125,
"learning_rate": 1.3045226130653268e-05,
"epoch": 3.2663316582914574,
"step": 650
},
{
"loss": 1.3391,
"grad_norm": 13.0,
"learning_rate": 1.4050251256281408e-05,
"epoch": 3.5175879396984926,
"step": 700
},
{
"loss": 1.2838,
"grad_norm": 11.625,
"learning_rate": 1.5055276381909548e-05,
"epoch": 3.7688442211055277,
"step": 750
},
{
"eval_loss": 1.202721118927002,
"eval_accuracy": 0.5800756620428752,
"eval_top3": 0.9205548549810845,
"eval_macro_f1": 0.497103403115527,
"eval_kappa": 0.4472502653133419,
"eval_runtime": 1.337,
"eval_samples_per_second": 593.118,
"eval_steps_per_second": 18.699,
"epoch": 4.0,
"step": 796
},
{
"loss": 1.2487,
"grad_norm": 14.4375,
"learning_rate": 1.606030150753769e-05,
"epoch": 4.0201005025125625,
"step": 800
},
{
"loss": 1.1559,
"grad_norm": 10.4375,
"learning_rate": 1.706532663316583e-05,
"epoch": 4.271356783919598,
"step": 850
},
{
"loss": 1.0407,
"grad_norm": 20.25,
"learning_rate": 1.8070351758793973e-05,
"epoch": 4.522613065326633,
"step": 900
},
{
"loss": 0.9483,
"grad_norm": 10.125,
"learning_rate": 1.907537688442211e-05,
"epoch": 4.773869346733669,
"step": 950
},
{
"eval_loss": 0.8165158629417419,
"eval_accuracy": 0.7452711223203027,
"eval_top3": 0.9672131147540983,
"eval_macro_f1": 0.6978370232443252,
"eval_kappa": 0.6680433777984089,
"eval_runtime": 1.3351,
"eval_samples_per_second": 593.948,
"eval_steps_per_second": 18.725,
"epoch": 5.0,
"step": 995
},
{
"loss": 0.8677,
"grad_norm": 12.625,
"learning_rate": 1.9999990154030625e-05,
"epoch": 5.025125628140704,
"step": 1000
},
{
"loss": 0.7965,
"grad_norm": 11.4375,
"learning_rate": 1.9998205625451942e-05,
"epoch": 5.276381909547739,
"step": 1050
},
{
"loss": 0.6202,
"grad_norm": 10.5,
"learning_rate": 1.9993344861920247e-05,
"epoch": 5.527638190954773,
"step": 1100
},
{
"loss": 0.655,
"grad_norm": 14.8125,
"learning_rate": 1.9985409358988966e-05,
"epoch": 5.778894472361809,
"step": 1150
},
{
"eval_loss": 0.5597819685935974,
"eval_accuracy": 0.8007566204287516,
"eval_top3": 0.9810844892812106,
"eval_macro_f1": 0.7631654003718922,
"eval_kappa": 0.7409659352859331,
"eval_runtime": 1.388,
"eval_samples_per_second": 571.326,
"eval_steps_per_second": 18.012,
"epoch": 6.0,
"step": 1194
},
{
"loss": 0.5711,
"grad_norm": 14.375,
"learning_rate": 1.9974401558243355e-05,
"epoch": 6.030150753768845,
"step": 1200
},
{
"loss": 0.5362,
"grad_norm": 13.25,
"learning_rate": 1.9960324846549286e-05,
"epoch": 6.28140703517588,
"step": 1250
},
{
"loss": 0.5104,
"grad_norm": 12.9375,
"learning_rate": 1.994318355501118e-05,
"epoch": 6.532663316582915,
"step": 1300
},
{
"loss": 0.4477,
"grad_norm": 12.0625,
"learning_rate": 1.99229829576394e-05,
"epoch": 6.78391959798995,
"step": 1350
},
{
"eval_loss": 0.46245822310447693,
"eval_accuracy": 0.8310214375788146,
"eval_top3": 0.987389659520807,
"eval_macro_f1": 0.8040762608401479,
"eval_kappa": 0.7808619761646,
"eval_runtime": 1.334,
"eval_samples_per_second": 594.453,
"eval_steps_per_second": 18.741,
"epoch": 7.0,
"step": 1393
},
{
"loss": 0.496,
"grad_norm": 8.9375,
"learning_rate": 1.9899729269727584e-05,
"epoch": 7.035175879396985,
"step": 1400
},
{
"loss": 0.4427,
"grad_norm": 8.5625,
"learning_rate": 1.9873429645940293e-05,
"epoch": 7.28643216080402,
"step": 1450
},
{
"loss": 0.4144,
"grad_norm": 10.75,
"learning_rate": 1.9844092178111703e-05,
"epoch": 7.5376884422110555,
"step": 1500
},
{
"loss": 0.4074,
"grad_norm": 11.0625,
"learning_rate": 1.9811725892755905e-05,
"epoch": 7.788944723618091,
"step": 1550
},
{
"eval_loss": 0.4191744029521942,
"eval_accuracy": 0.8423707440100883,
"eval_top3": 0.9886506935687264,
"eval_macro_f1": 0.8179574437589323,
"eval_kappa": 0.7955173694199191,
"eval_runtime": 1.325,
"eval_samples_per_second": 598.49,
"eval_steps_per_second": 18.868,
"epoch": 8.0,
"step": 1592
},
{
"loss": 0.402,
"grad_norm": 11.875,
"learning_rate": 1.9776340748289643e-05,
"epoch": 8.040201005025125,
"step": 1600
},
{
"loss": 0.359,
"grad_norm": 12.5,
"learning_rate": 1.973794763196832e-05,
"epoch": 8.291457286432161,
"step": 1650
},
{
"loss": 0.326,
"grad_norm": 12.75,
"learning_rate": 1.9696558356536224e-05,
"epoch": 8.542713567839195,
"step": 1700
},
{
"loss": 0.3792,
"grad_norm": 13.3125,
"learning_rate": 1.9652185656591992e-05,
"epoch": 8.793969849246231,
"step": 1750
},
{
"eval_loss": 0.39110326766967773,
"eval_accuracy": 0.8537200504413619,
"eval_top3": 0.9911727616645649,
"eval_macro_f1": 0.8292392112258031,
"eval_kappa": 0.8104571257842844,
"eval_runtime": 1.37,
"eval_samples_per_second": 578.832,
"eval_steps_per_second": 18.248,
"epoch": 9.0,
"step": 1791
},
{
"loss": 0.3652,
"grad_norm": 12.0625,
"learning_rate": 1.9604843184670462e-05,
"epoch": 9.045226130653266,
"step": 1800
},
{
"loss": 0.3435,
"grad_norm": 19.25,
"learning_rate": 1.9554545507042047e-05,
"epoch": 9.296482412060302,
"step": 1850
},
{
"loss": 0.3287,
"grad_norm": 6.09375,
"learning_rate": 1.950130809923104e-05,
"epoch": 9.547738693467338,
"step": 1900
},
{
"loss": 0.2922,
"grad_norm": 11.4375,
"learning_rate": 1.9445147341254094e-05,
"epoch": 9.798994974874372,
"step": 1950
},
{
"eval_loss": 0.3803386092185974,
"eval_accuracy": 0.8511979823455234,
"eval_top3": 0.9911727616645649,
"eval_macro_f1": 0.8273026210900127,
"eval_kappa": 0.8074331693865371,
"eval_runtime": 1.391,
"eval_samples_per_second": 570.092,
"eval_steps_per_second": 17.973,
"epoch": 10.0,
"step": 1990
},
{
"loss": 0.3334,
"grad_norm": 10.8125,
"learning_rate": 1.938608051258047e-05,
"epoch": 10.050251256281408,
"step": 2000
},
{
"loss": 0.2973,
"grad_norm": 12.0,
"learning_rate": 1.932412578681548e-05,
"epoch": 10.301507537688442,
"step": 2050
},
{
"loss": 0.2925,
"grad_norm": 7.53125,
"learning_rate": 1.9259302226108878e-05,
"epoch": 10.552763819095478,
"step": 2100
},
{
"loss": 0.3054,
"grad_norm": 44.0,
"learning_rate": 1.9191629775289836e-05,
"epoch": 10.804020100502512,
"step": 2150
},
{
"eval_loss": 0.36623987555503845,
"eval_accuracy": 0.8638083228247163,
"eval_top3": 0.9911727616645649,
"eval_macro_f1": 0.8409607591489069,
"eval_kappa": 0.823617727196901,
"eval_runtime": 1.364,
"eval_samples_per_second": 581.379,
"eval_steps_per_second": 18.328,
"epoch": 11.0,
"step": 2189
},
{
"loss": 0.2989,
"grad_norm": 6.65625,
"learning_rate": 1.912112925573035e-05,
"epoch": 11.055276381909549,
"step": 2200
},
{
"loss": 0.2812,
"grad_norm": 15.125,
"learning_rate": 1.9047822358938933e-05,
"epoch": 11.306532663316583,
"step": 2250
},
{
"loss": 0.2535,
"grad_norm": 9.25,
"learning_rate": 1.897173163988661e-05,
"epoch": 11.557788944723619,
"step": 2300
},
{
"loss": 0.2797,
"grad_norm": 22.0,
"learning_rate": 1.8892880510067234e-05,
"epoch": 11.809045226130653,
"step": 2350
},
{
"eval_loss": 0.3603597581386566,
"eval_accuracy": 0.8688524590163934,
"eval_top3": 0.9886506935687264,
"eval_macro_f1": 0.8466482549906356,
"eval_kappa": 0.8301133168401472,
"eval_runtime": 1.368,
"eval_samples_per_second": 579.678,
"eval_steps_per_second": 18.275,
"epoch": 12.0,
"step": 2388
},
{
"loss": 0.283,
"grad_norm": 14.0625,
"learning_rate": 1.881129323029427e-05,
"epoch": 12.06030150753769,
"step": 2400
},
{
"loss": 0.2537,
"grad_norm": 15.0,
"learning_rate": 1.872699490323626e-05,
"epoch": 12.311557788944723,
"step": 2450
},
{
"loss": 0.2988,
"grad_norm": 14.25,
"learning_rate": 1.8640011465693237e-05,
"epoch": 12.56281407035176,
"step": 2500
},
{
"loss": 0.2403,
"grad_norm": 8.3125,
"learning_rate": 1.8550369680616584e-05,
"epoch": 12.814070351758794,
"step": 2550
},
{
"eval_loss": 0.35605388879776,
"eval_accuracy": 0.8738965952080706,
"eval_top3": 0.9911727616645649,
"eval_macro_f1": 0.8539434147627019,
"eval_kappa": 0.8367116653351014,
"eval_runtime": 1.361,
"eval_samples_per_second": 582.66,
"eval_steps_per_second": 18.369,
"epoch": 13.0,
"step": 2587
},
{
"loss": 0.2475,
"grad_norm": 15.5,
"learning_rate": 1.8458097128874583e-05,
"epoch": 13.06532663316583,
"step": 2600
},
{
"loss": 0.2492,
"grad_norm": 5.5625,
"learning_rate": 1.8363222200766406e-05,
"epoch": 13.316582914572864,
"step": 2650
},
{
"loss": 0.2392,
"grad_norm": 43.75,
"learning_rate": 1.8265774087287016e-05,
"epoch": 13.5678391959799,
"step": 2700
},
{
"loss": 0.2525,
"grad_norm": 6.09375,
"learning_rate": 1.816578277114571e-05,
"epoch": 13.819095477386934,
"step": 2750
},
{
"eval_loss": 0.348567396402359,
"eval_accuracy": 0.8764186633039092,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8541541677819424,
"eval_kappa": 0.8398197730261395,
"eval_runtime": 1.403,
"eval_samples_per_second": 565.218,
"eval_steps_per_second": 17.819,
"epoch": 14.0,
"step": 2786
},
{
"loss": 0.2064,
"grad_norm": 8.5,
"learning_rate": 1.8063279017541086e-05,
"epoch": 14.07035175879397,
"step": 2800
},
{
"loss": 0.2228,
"grad_norm": 29.5,
"learning_rate": 1.7958294364695254e-05,
"epoch": 14.321608040201005,
"step": 2850
},
{
"loss": 0.23,
"grad_norm": 9.5,
"learning_rate": 1.7850861114150174e-05,
"epoch": 14.57286432160804,
"step": 2900
},
{
"loss": 0.2341,
"grad_norm": 18.75,
"learning_rate": 1.7741012320829187e-05,
"epoch": 14.824120603015075,
"step": 2950
},
{
"eval_loss": 0.3470554053783417,
"eval_accuracy": 0.8764186633039092,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8554054945028179,
"eval_kappa": 0.8397983100426509,
"eval_runtime": 1.396,
"eval_samples_per_second": 568.052,
"eval_steps_per_second": 17.908,
"epoch": 15.0,
"step": 2985
},
{
"loss": 0.2557,
"grad_norm": 12.875,
"learning_rate": 1.7628781782866696e-05,
"epoch": 15.075376884422111,
"step": 3000
},
{
"loss": 0.2163,
"grad_norm": 9.4375,
"learning_rate": 1.751420403120922e-05,
"epoch": 15.326633165829145,
"step": 3050
},
{
"loss": 0.2159,
"grad_norm": 28.75,
"learning_rate": 1.7397314318990933e-05,
"epoch": 15.577889447236181,
"step": 3100
},
{
"loss": 0.2219,
"grad_norm": 10.4375,
"learning_rate": 1.7278148610687053e-05,
"epoch": 15.829145728643216,
"step": 3150
},
{
"eval_loss": 0.3462725579738617,
"eval_accuracy": 0.8764186633039092,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8554054945028179,
"eval_kappa": 0.8397983100426509,
"eval_runtime": 1.355,
"eval_samples_per_second": 585.241,
"eval_steps_per_second": 18.45,
"epoch": 16.0,
"step": 3184
},
{
"loss": 0.2271,
"grad_norm": 13.8125,
"learning_rate": 1.7156743571048314e-05,
"epoch": 16.08040201005025,
"step": 3200
},
{
"loss": 0.2162,
"grad_norm": 11.125,
"learning_rate": 1.703313655382002e-05,
"epoch": 16.331658291457288,
"step": 3250
},
{
"loss": 0.2019,
"grad_norm": 12.75,
"learning_rate": 1.6907365590249083e-05,
"epoch": 16.582914572864322,
"step": 3300
},
{
"loss": 0.1926,
"grad_norm": 3.6875,
"learning_rate": 1.6779469377382624e-05,
"epoch": 16.834170854271356,
"step": 3350
},
{
"eval_loss": 0.34653961658477783,
"eval_accuracy": 0.8751576292559899,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.853208113072801,
"eval_kappa": 0.8382066236630051,
"eval_runtime": 1.3501,
"eval_samples_per_second": 587.384,
"eval_steps_per_second": 18.518,
"epoch": 17.0,
"step": 3383
},
{
"loss": 0.2128,
"grad_norm": 16.5,
"learning_rate": 1.6649487266161718e-05,
"epoch": 17.08542713567839,
"step": 3400
},
{
"loss": 0.1929,
"grad_norm": 10.5625,
"learning_rate": 1.6517459249313926e-05,
"epoch": 17.33668341708543,
"step": 3450
},
{
"loss": 0.2036,
"grad_norm": 13.4375,
"learning_rate": 1.638342594904843e-05,
"epoch": 17.587939698492463,
"step": 3500
},
{
"loss": 0.1969,
"grad_norm": 11.1875,
"learning_rate": 1.6247428604557392e-05,
"epoch": 17.839195979899497,
"step": 3550
},
{
"eval_loss": 0.3459188640117645,
"eval_accuracy": 0.880201765447667,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8600443723197964,
"eval_kappa": 0.8447552476373783,
"eval_runtime": 1.344,
"eval_samples_per_second": 590.028,
"eval_steps_per_second": 18.601,
"epoch": 18.0,
"step": 3582
},
{
"loss": 0.2207,
"grad_norm": 18.125,
"learning_rate": 1.610950905932756e-05,
"epoch": 18.09045226130653,
"step": 3600
},
{
"loss": 0.2066,
"grad_norm": 18.25,
"learning_rate": 1.5969709748265933e-05,
"epoch": 18.34170854271357,
"step": 3650
},
{
"loss": 0.1658,
"grad_norm": 11.5625,
"learning_rate": 1.58280736846434e-05,
"epoch": 18.592964824120603,
"step": 3700
},
{
"loss": 0.2012,
"grad_norm": 2.890625,
"learning_rate": 1.5684644446860518e-05,
"epoch": 18.844221105527637,
"step": 3750
},
{
"eval_loss": 0.3451780676841736,
"eval_accuracy": 0.8751576292559899,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8549175688845306,
"eval_kappa": 0.8383209115828104,
"eval_runtime": 1.351,
"eval_samples_per_second": 586.973,
"eval_steps_per_second": 18.505,
"epoch": 19.0,
"step": 3781
},
{
"loss": 0.2053,
"grad_norm": 10.75,
"learning_rate": 1.5539466165039338e-05,
"epoch": 19.09547738693467,
"step": 3800
},
{
"loss": 0.1818,
"grad_norm": 8.375,
"learning_rate": 1.5392583507445508e-05,
"epoch": 19.34673366834171,
"step": 3850
},
{
"loss": 0.2039,
"grad_norm": 10.0625,
"learning_rate": 1.524404166674482e-05,
"epoch": 19.597989949748744,
"step": 3900
},
{
"loss": 0.1937,
"grad_norm": 9.5,
"learning_rate": 1.5093886346098372e-05,
"epoch": 19.849246231155778,
"step": 3950
},
{
"eval_loss": 0.3440295159816742,
"eval_accuracy": 0.880201765447667,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8590029071176492,
"eval_kappa": 0.844723249362074,
"eval_runtime": 1.345,
"eval_samples_per_second": 589.592,
"eval_steps_per_second": 18.587,
"epoch": 20.0,
"step": 3980
},
{
"loss": 0.2018,
"grad_norm": 17.375,
"learning_rate": 1.4942163745100668e-05,
"epoch": 20.100502512562816,
"step": 4000
},
{
"loss": 0.1673,
"grad_norm": 7.625,
"learning_rate": 1.4788920545565014e-05,
"epoch": 20.35175879396985,
"step": 4050
},
{
"loss": 0.1789,
"grad_norm": 20.75,
"learning_rate": 1.4634203897160497e-05,
"epoch": 20.603015075376884,
"step": 4100
},
{
"loss": 0.2001,
"grad_norm": 3.453125,
"learning_rate": 1.4478061402905048e-05,
"epoch": 20.85427135678392,
"step": 4150
},
{
"eval_loss": 0.3432489037513733,
"eval_accuracy": 0.8814627994955864,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8622259247649311,
"eval_kappa": 0.8463894029254059,
"eval_runtime": 1.365,
"eval_samples_per_second": 580.952,
"eval_steps_per_second": 18.315,
"epoch": 21.0,
"step": 4179
},
{
"loss": 0.1866,
"grad_norm": 3.546875,
"learning_rate": 1.4320541104518992e-05,
"epoch": 21.105527638190956,
"step": 4200
},
{
"loss": 0.184,
"grad_norm": 15.375,
"learning_rate": 1.4161691467643659e-05,
"epoch": 21.35678391959799,
"step": 4250
},
{
"loss": 0.1923,
"grad_norm": 8.25,
"learning_rate": 1.400156136692951e-05,
"epoch": 21.608040201005025,
"step": 4300
},
{
"loss": 0.1762,
"grad_norm": 4.46875,
"learning_rate": 1.3840200070998466e-05,
"epoch": 21.85929648241206,
"step": 4350
},
{
"eval_loss": 0.34197643399238586,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8649545688082612,
"eval_kappa": 0.8496555447709369,
"eval_runtime": 1.366,
"eval_samples_per_second": 580.527,
"eval_steps_per_second": 18.302,
"epoch": 22.0,
"step": 4378
},
{
"loss": 0.1991,
"grad_norm": 13.625,
"learning_rate": 1.3677657227285e-05,
"epoch": 22.110552763819097,
"step": 4400
},
{
"loss": 0.2095,
"grad_norm": 23.875,
"learning_rate": 1.3513982846760669e-05,
"epoch": 22.36180904522613,
"step": 4450
},
{
"loss": 0.1788,
"grad_norm": 13.5,
"learning_rate": 1.3349227288546815e-05,
"epoch": 22.613065326633166,
"step": 4500
},
{
"loss": 0.1537,
"grad_norm": 16.375,
"learning_rate": 1.3183441244420129e-05,
"epoch": 22.8643216080402,
"step": 4550
},
{
"eval_loss": 0.34272438287734985,
"eval_accuracy": 0.880201765447667,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8598827006510683,
"eval_kappa": 0.8447574870227686,
"eval_runtime": 1.407,
"eval_samples_per_second": 563.611,
"eval_steps_per_second": 17.768,
"epoch": 23.0,
"step": 4577
},
{
"loss": 0.1774,
"grad_norm": 9.3125,
"learning_rate": 1.3016675723215879e-05,
"epoch": 23.115577889447238,
"step": 4600
},
{
"loss": 0.1776,
"grad_norm": 7.78125,
"learning_rate": 1.2848982035133555e-05,
"epoch": 23.366834170854272,
"step": 4650
},
{
"loss": 0.1666,
"grad_norm": 8.5625,
"learning_rate": 1.2680411775949847e-05,
"epoch": 23.618090452261306,
"step": 4700
},
{
"loss": 0.1787,
"grad_norm": 8.0625,
"learning_rate": 1.2511016811143697e-05,
"epoch": 23.86934673366834,
"step": 4750
},
{
"eval_loss": 0.34232452511787415,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8619418239031577,
"eval_kappa": 0.8479944267302592,
"eval_runtime": 1.395,
"eval_samples_per_second": 568.458,
"eval_steps_per_second": 17.921,
"epoch": 24.0,
"step": 4776
},
{
"loss": 0.1751,
"grad_norm": 18.25,
"learning_rate": 1.2340849259938404e-05,
"epoch": 24.12060301507538,
"step": 4800
},
{
"loss": 0.1651,
"grad_norm": 10.625,
"learning_rate": 1.2169961479265653e-05,
"epoch": 24.371859296482413,
"step": 4850
},
{
"loss": 0.1746,
"grad_norm": 5.28125,
"learning_rate": 1.1998406047656396e-05,
"epoch": 24.623115577889447,
"step": 4900
},
{
"loss": 0.1905,
"grad_norm": 12.5625,
"learning_rate": 1.182623574906356e-05,
"epoch": 24.87437185929648,
"step": 4950
},
{
"eval_loss": 0.34067824482917786,
"eval_accuracy": 0.8852459016393442,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8661537754454564,
"eval_kappa": 0.8512633637898235,
"eval_runtime": 1.358,
"eval_samples_per_second": 583.949,
"eval_steps_per_second": 18.409,
"epoch": 25.0,
"step": 4975
},
{
"loss": 0.1701,
"grad_norm": 6.125,
"learning_rate": 1.1653503556621553e-05,
"epoch": 25.12562814070352,
"step": 5000
},
{
"loss": 0.1833,
"grad_norm": 16.0,
"learning_rate": 1.1480262616347544e-05,
"epoch": 25.376884422110553,
"step": 5050
},
{
"loss": 0.167,
"grad_norm": 6.3125,
"learning_rate": 1.1306566230789593e-05,
"epoch": 25.628140703517587,
"step": 5100
},
{
"loss": 0.167,
"grad_norm": 25.75,
"learning_rate": 1.1132467842626555e-05,
"epoch": 25.87939698492462,
"step": 5150
},
{
"eval_loss": 0.34115472435951233,
"eval_accuracy": 0.8852459016393442,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8661537754454564,
"eval_kappa": 0.8512633637898235,
"eval_runtime": 1.347,
"eval_samples_per_second": 588.717,
"eval_steps_per_second": 18.56,
"epoch": 26.0,
"step": 5174
},
{
"loss": 0.1756,
"grad_norm": 6.8125,
"learning_rate": 1.0958021018224942e-05,
"epoch": 26.13065326633166,
"step": 5200
},
{
"loss": 0.1735,
"grad_norm": 4.59375,
"learning_rate": 1.0783279431157668e-05,
"epoch": 26.381909547738694,
"step": 5250
},
{
"loss": 0.1778,
"grad_norm": 12.375,
"learning_rate": 1.0608296845689843e-05,
"epoch": 26.633165829145728,
"step": 5300
},
{
"loss": 0.1699,
"grad_norm": 10.5,
"learning_rate": 1.0433127100236655e-05,
"epoch": 26.884422110552762,
"step": 5350
},
{
"eval_loss": 0.3404243290424347,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8649838454025487,
"eval_kappa": 0.8496422211963331,
"eval_runtime": 1.365,
"eval_samples_per_second": 580.951,
"eval_steps_per_second": 18.315,
"epoch": 27.0,
"step": 5373
},
{
"loss": 0.1706,
"grad_norm": 5.9375,
"learning_rate": 1.0257824090798431e-05,
"epoch": 27.1356783919598,
"step": 5400
},
{
"loss": 0.1549,
"grad_norm": 4.5625,
"learning_rate": 1.0082441754377996e-05,
"epoch": 27.386934673366834,
"step": 5450
},
{
"loss": 0.1816,
"grad_norm": 10.75,
"learning_rate": 9.907034052385383e-06,
"epoch": 27.63819095477387,
"step": 5500
},
{
"loss": 0.1777,
"grad_norm": 14.0625,
"learning_rate": 9.731654954035082e-06,
"epoch": 27.889447236180903,
"step": 5550
},
{
"eval_loss": 0.3424096405506134,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.368,
"eval_samples_per_second": 579.679,
"eval_steps_per_second": 18.275,
"epoch": 28.0,
"step": 5572
},
{
"loss": 0.1808,
"grad_norm": 3.65625,
"learning_rate": 9.556358419740852e-06,
"epoch": 28.14070351758794,
"step": 5600
},
{
"loss": 0.1799,
"grad_norm": 9.25,
"learning_rate": 9.381198384513253e-06,
"epoch": 28.391959798994975,
"step": 5650
},
{
"loss": 0.155,
"grad_norm": 7.25,
"learning_rate": 9.206228741364972e-06,
"epoch": 28.64321608040201,
"step": 5700
},
{
"loss": 0.17,
"grad_norm": 20.375,
"learning_rate": 9.031503324729128e-06,
"epoch": 28.894472361809044,
"step": 5750
},
{
"eval_loss": 0.3412993550300598,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8622758895354596,
"eval_kappa": 0.8479787600258079,
"eval_runtime": 1.356,
"eval_samples_per_second": 584.808,
"eval_steps_per_second": 18.437,
"epoch": 29.0,
"step": 5771
},
{
"loss": 0.1891,
"grad_norm": 13.625,
"learning_rate": 8.857075893895537e-06,
"epoch": 29.14572864321608,
"step": 5800
},
{
"loss": 0.1624,
"grad_norm": 9.0625,
"learning_rate": 8.683000116470117e-06,
"epoch": 29.396984924623116,
"step": 5850
},
{
"loss": 0.1562,
"grad_norm": 9.4375,
"learning_rate": 8.509329551862535e-06,
"epoch": 29.64824120603015,
"step": 5900
},
{
"loss": 0.1926,
"grad_norm": 10.625,
"learning_rate": 8.336117634807107e-06,
"epoch": 29.899497487437188,
"step": 5950
},
{
"eval_loss": 0.3421500027179718,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.352,
"eval_samples_per_second": 586.538,
"eval_steps_per_second": 18.491,
"epoch": 30.0,
"step": 5970
},
{
"loss": 0.1803,
"grad_norm": 12.3125,
"learning_rate": 8.163417658922048e-06,
"epoch": 30.150753768844222,
"step": 6000
},
{
"loss": 0.1612,
"grad_norm": 19.625,
"learning_rate": 7.991282760312188e-06,
"epoch": 30.402010050251256,
"step": 6050
},
{
"loss": 0.1568,
"grad_norm": 8.125,
"learning_rate": 7.819765901220113e-06,
"epoch": 30.65326633165829,
"step": 6100
},
{
"loss": 0.1639,
"grad_norm": 10.6875,
"learning_rate": 7.648919853730804e-06,
"epoch": 30.90452261306533,
"step": 6150
},
{
"eval_loss": 0.34186428785324097,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.391,
"eval_samples_per_second": 570.094,
"eval_steps_per_second": 17.973,
"epoch": 31.0,
"step": 6169
},
{
"loss": 0.1836,
"grad_norm": 15.1875,
"learning_rate": 7.478797183534803e-06,
"epoch": 31.155778894472363,
"step": 6200
},
{
"loss": 0.1477,
"grad_norm": 13.8125,
"learning_rate": 7.309450233754869e-06,
"epoch": 31.407035175879397,
"step": 6250
},
{
"loss": 0.1907,
"grad_norm": 12.875,
"learning_rate": 7.140931108841094e-06,
"epoch": 31.65829145728643,
"step": 6300
},
{
"loss": 0.1552,
"grad_norm": 8.25,
"learning_rate": 6.973291658539496e-06,
"epoch": 31.90954773869347,
"step": 6350
},
{
"eval_loss": 0.3415157198905945,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.327,
"eval_samples_per_second": 597.588,
"eval_steps_per_second": 18.839,
"epoch": 32.0,
"step": 6368
},
{
"loss": 0.1516,
"grad_norm": 9.0625,
"learning_rate": 6.806583461938956e-06,
"epoch": 32.1608040201005,
"step": 6400
},
{
"loss": 0.187,
"grad_norm": 4.09375,
"learning_rate": 6.6408578116014025e-06,
"epoch": 32.41206030150754,
"step": 6450
},
{
"loss": 0.1809,
"grad_norm": 6.09375,
"learning_rate": 6.4761656977802236e-06,
"epoch": 32.663316582914575,
"step": 6500
},
{
"loss": 0.1543,
"grad_norm": 28.75,
"learning_rate": 6.312557792731619e-06,
"epoch": 32.914572864321606,
"step": 6550
},
{
"eval_loss": 0.342151015996933,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.349,
"eval_samples_per_second": 587.844,
"eval_steps_per_second": 18.532,
"epoch": 33.0,
"step": 6567
},
{
"loss": 0.1549,
"grad_norm": 8.3125,
"learning_rate": 6.150084435123842e-06,
"epoch": 33.165829145728644,
"step": 6600
},
{
"loss": 0.1766,
"grad_norm": 10.75,
"learning_rate": 5.988795614549054e-06,
"epoch": 33.41708542713568,
"step": 6650
},
{
"loss": 0.1597,
"grad_norm": 5.9375,
"learning_rate": 5.828740956142611e-06,
"epoch": 33.66834170854271,
"step": 6700
},
{
"loss": 0.1688,
"grad_norm": 6.59375,
"learning_rate": 5.669969705314432e-06,
"epoch": 33.91959798994975,
"step": 6750
},
{
"eval_loss": 0.3422100245952606,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.363,
"eval_samples_per_second": 581.803,
"eval_steps_per_second": 18.342,
"epoch": 34.0,
"step": 6766
},
{
"loss": 0.1756,
"grad_norm": 7.875,
"learning_rate": 5.512530712597268e-06,
"epoch": 34.17085427135678,
"step": 6800
},
{
"loss": 0.1617,
"grad_norm": 5.34375,
"learning_rate": 5.356472418616425e-06,
"epoch": 34.42211055276382,
"step": 6850
},
{
"loss": 0.162,
"grad_norm": 10.75,
"learning_rate": 5.201842839185598e-06,
"epoch": 34.67336683417086,
"step": 6900
},
{
"loss": 0.1638,
"grad_norm": 3.078125,
"learning_rate": 5.048689550533444e-06,
"epoch": 34.92462311557789,
"step": 6950
},
{
"eval_loss": 0.34207883477211,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.365,
"eval_samples_per_second": 580.953,
"eval_steps_per_second": 18.315,
"epoch": 35.0,
"step": 6965
},
{
"loss": 0.1858,
"grad_norm": 21.625,
"learning_rate": 4.897059674665391e-06,
"epoch": 35.175879396984925,
"step": 7000
},
{
"loss": 0.1714,
"grad_norm": 6.875,
"learning_rate": 4.746999864865188e-06,
"epoch": 35.42713567839196,
"step": 7050
},
{
"loss": 0.1725,
"grad_norm": 6.5625,
"learning_rate": 4.5985562913407015e-06,
"epoch": 35.678391959798994,
"step": 7100
},
{
"loss": 0.1641,
"grad_norm": 23.75,
"learning_rate": 4.451774627018303e-06,
"epoch": 35.92964824120603,
"step": 7150
},
{
"eval_loss": 0.34272658824920654,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.403,
"eval_samples_per_second": 565.216,
"eval_steps_per_second": 17.819,
"epoch": 36.0,
"step": 7164
},
{
"loss": 0.1798,
"grad_norm": 23.375,
"learning_rate": 4.3067000334902985e-06,
"epoch": 36.18090452261306,
"step": 7200
},
{
"loss": 0.1658,
"grad_norm": 15.625,
"learning_rate": 4.163377147119664e-06,
"epoch": 36.4321608040201,
"step": 7250
},
{
"loss": 0.1755,
"grad_norm": 5.0,
"learning_rate": 4.0218500653063905e-06,
"epoch": 36.68341708542714,
"step": 7300
},
{
"loss": 0.1623,
"grad_norm": 5.5625,
"learning_rate": 3.882162332919645e-06,
"epoch": 36.93467336683417,
"step": 7350
},
{
"eval_loss": 0.3424283564090729,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.372,
"eval_samples_per_second": 577.988,
"eval_steps_per_second": 18.222,
"epoch": 37.0,
"step": 7363
},
{
"loss": 0.1677,
"grad_norm": 7.96875,
"learning_rate": 3.744356928899939e-06,
"epoch": 37.185929648241206,
"step": 7400
},
{
"loss": 0.1683,
"grad_norm": 14.375,
"learning_rate": 3.6084762530354487e-06,
"epoch": 37.437185929648244,
"step": 7450
},
{
"loss": 0.1778,
"grad_norm": 8.375,
"learning_rate": 3.4745621129164676e-06,
"epoch": 37.688442211055275,
"step": 7500
},
{
"loss": 0.1565,
"grad_norm": 7.84375,
"learning_rate": 3.3426557110721326e-06,
"epoch": 37.93969849246231,
"step": 7550
},
{
"eval_loss": 0.3421717584133148,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.341,
"eval_samples_per_second": 591.348,
"eval_steps_per_second": 18.643,
"epoch": 38.0,
"step": 7562
},
{
"loss": 0.1708,
"grad_norm": 40.75,
"learning_rate": 3.2127976322932596e-06,
"epoch": 38.19095477386934,
"step": 7600
},
{
"loss": 0.1841,
"grad_norm": 9.125,
"learning_rate": 3.0850278311452797e-06,
"epoch": 38.44221105527638,
"step": 7650
},
{
"loss": 0.1649,
"grad_norm": 6.9375,
"learning_rate": 2.9593856196750705e-06,
"epoch": 38.69346733668342,
"step": 7700
},
{
"loss": 0.1606,
"grad_norm": 22.125,
"learning_rate": 2.8359096553154806e-06,
"epoch": 38.94472361809045,
"step": 7750
},
{
"eval_loss": 0.34265828132629395,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.358,
"eval_samples_per_second": 583.946,
"eval_steps_per_second": 18.409,
"epoch": 39.0,
"step": 7761
},
{
"loss": 0.176,
"grad_norm": 12.875,
"learning_rate": 2.7146379289912337e-06,
"epoch": 39.19597989949749,
"step": 7800
},
{
"loss": 0.1633,
"grad_norm": 5.71875,
"learning_rate": 2.5956077534299715e-06,
"epoch": 39.447236180904525,
"step": 7850
},
{
"loss": 0.1517,
"grad_norm": 9.5,
"learning_rate": 2.4788557516818935e-06,
"epoch": 39.698492462311556,
"step": 7900
},
{
"loss": 0.1839,
"grad_norm": 4.5625,
"learning_rate": 2.3644178458516353e-06,
"epoch": 39.949748743718594,
"step": 7950
},
{
"eval_loss": 0.3417166769504547,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.347,
"eval_samples_per_second": 588.716,
"eval_steps_per_second": 18.56,
"epoch": 40.0,
"step": 7960
},
{
"loss": 0.1759,
"grad_norm": 9.0625,
"learning_rate": 2.252329246045787e-06,
"epoch": 40.20100502512563,
"step": 8000
},
{
"loss": 0.1724,
"grad_norm": 10.0625,
"learning_rate": 2.142624439539516e-06,
"epoch": 40.45226130653266,
"step": 8050
},
{
"loss": 0.1762,
"grad_norm": 5.875,
"learning_rate": 2.0353371801655564e-06,
"epoch": 40.7035175879397,
"step": 8100
},
{
"loss": 0.1538,
"grad_norm": 17.625,
"learning_rate": 1.9305004779288673e-06,
"epoch": 40.95477386934673,
"step": 8150
},
{
"eval_loss": 0.3423360288143158,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.323,
"eval_samples_per_second": 599.394,
"eval_steps_per_second": 18.896,
"epoch": 41.0,
"step": 8159
},
{
"loss": 0.1696,
"grad_norm": 11.875,
"learning_rate": 1.8281465888501627e-06,
"epoch": 41.20603015075377,
"step": 8200
},
{
"loss": 0.1642,
"grad_norm": 12.875,
"learning_rate": 1.7283070050414275e-06,
"epoch": 41.45728643216081,
"step": 8250
},
{
"loss": 0.1711,
"grad_norm": 5.75,
"learning_rate": 1.6310124450164488e-06,
"epoch": 41.70854271356784,
"step": 8300
},
{
"loss": 0.1544,
"grad_norm": 11.25,
"learning_rate": 1.5362928442394055e-06,
"epoch": 41.959798994974875,
"step": 8350
},
{
"eval_loss": 0.34329381585121155,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.344,
"eval_samples_per_second": 590.03,
"eval_steps_per_second": 18.601,
"epoch": 42.0,
"step": 8358
},
{
"loss": 0.1794,
"grad_norm": 14.5,
"learning_rate": 1.4441773459143405e-06,
"epoch": 42.21105527638191,
"step": 8400
},
{
"loss": 0.146,
"grad_norm": 7.28125,
"learning_rate": 1.3546942920184303e-06,
"epoch": 42.462311557788944,
"step": 8450
},
{
"loss": 0.1634,
"grad_norm": 15.875,
"learning_rate": 1.267871214581764e-06,
"epoch": 42.71356783919598,
"step": 8500
},
{
"loss": 0.1804,
"grad_norm": 10.25,
"learning_rate": 1.1837348272163208e-06,
"epoch": 42.96482412060301,
"step": 8550
},
{
"eval_loss": 0.3423879146575928,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.341,
"eval_samples_per_second": 591.35,
"eval_steps_per_second": 18.643,
"epoch": 43.0,
"step": 8557
},
{
"loss": 0.162,
"grad_norm": 18.375,
"learning_rate": 1.1023110168967554e-06,
"epoch": 43.21608040201005,
"step": 8600
},
{
"loss": 0.1698,
"grad_norm": 106.0,
"learning_rate": 1.0236248359955293e-06,
"epoch": 43.46733668341709,
"step": 8650
},
{
"loss": 0.1629,
"grad_norm": 16.875,
"learning_rate": 9.477004945748414e-07,
"epoch": 43.71859296482412,
"step": 8700
},
{
"loss": 0.1766,
"grad_norm": 7.0,
"learning_rate": 8.745613529376851e-07,
"epoch": 43.969849246231156,
"step": 8750
},
{
"eval_loss": 0.34215831756591797,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.36,
"eval_samples_per_second": 583.089,
"eval_steps_per_second": 18.382,
"epoch": 44.0,
"step": 8756
},
{
"loss": 0.158,
"grad_norm": 6.1875,
"learning_rate": 8.042299144404031e-07,
"epoch": 44.221105527638194,
"step": 8800
},
{
"loss": 0.1792,
"grad_norm": 3.859375,
"learning_rate": 7.367278185688697e-07,
"epoch": 44.472361809045225,
"step": 8850
},
{
"loss": 0.1887,
"grad_norm": 5.71875,
"learning_rate": 6.720758342804834e-07,
"epoch": 44.72361809045226,
"step": 8900
},
{
"loss": 0.1489,
"grad_norm": 21.25,
"learning_rate": 6.10293853614008e-07,
"epoch": 44.97487437185929,
"step": 8950
},
{
"eval_loss": 0.3427422344684601,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.31,
"eval_samples_per_second": 605.344,
"eval_steps_per_second": 19.084,
"epoch": 45.0,
"step": 8955
},
{
"loss": 0.1917,
"grad_norm": 8.5625,
"learning_rate": 5.514008855692087e-07,
"epoch": 45.22613065326633,
"step": 9000
},
{
"loss": 0.1846,
"grad_norm": 4.875,
"learning_rate": 4.954150502581923e-07,
"epoch": 45.47738693467337,
"step": 9050
},
{
"loss": 0.1375,
"grad_norm": 7.34375,
"learning_rate": 4.4235357333022864e-07,
"epoch": 45.7286432160804,
"step": 9100
},
{
"loss": 0.1672,
"grad_norm": 11.6875,
"learning_rate": 3.9223278067179404e-07,
"epoch": 45.97989949748744,
"step": 9150
},
{
"eval_loss": 0.34274017810821533,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.335,
"eval_samples_per_second": 594.008,
"eval_steps_per_second": 18.727,
"epoch": 46.0,
"step": 9154
},
{
"loss": 0.1705,
"grad_norm": 3.21875,
"learning_rate": 3.4506809338343495e-07,
"epoch": 46.231155778894475,
"step": 9200
},
{
"loss": 0.1555,
"grad_norm": 16.25,
"learning_rate": 3.008740230350293e-07,
"epoch": 46.482412060301506,
"step": 9250
},
{
"loss": 0.1823,
"grad_norm": 14.375,
"learning_rate": 2.596641672008837e-07,
"epoch": 46.733668341708544,
"step": 9300
},
{
"loss": 0.1669,
"grad_norm": 10.0,
"learning_rate": 2.214512052760487e-07,
"epoch": 46.984924623115575,
"step": 9350
},
{
"eval_loss": 0.3425142168998718,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.372,
"eval_samples_per_second": 577.988,
"eval_steps_per_second": 18.222,
"epoch": 47.0,
"step": 9353
},
{
"loss": 0.1545,
"grad_norm": 13.375,
"learning_rate": 1.8624689457513945e-07,
"epoch": 47.23618090452261,
"step": 9400
},
{
"loss": 0.1768,
"grad_norm": 11.125,
"learning_rate": 1.54062066714864e-07,
"epoch": 47.48743718592965,
"step": 9450
},
{
"loss": 0.1526,
"grad_norm": 3.765625,
"learning_rate": 1.2490662428135569e-07,
"epoch": 47.73869346733668,
"step": 9500
},
{
"loss": 0.179,
"grad_norm": 20.0,
"learning_rate": 9.87895377833692e-08,
"epoch": 47.98994974874372,
"step": 9550
},
{
"eval_loss": 0.3430207669734955,
"eval_accuracy": 0.8827238335435057,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8628805718895952,
"eval_kappa": 0.8480078975136847,
"eval_runtime": 1.3929,
"eval_samples_per_second": 569.323,
"eval_steps_per_second": 17.948,
"epoch": 48.0,
"step": 9552
},
{
"loss": 0.1604,
"grad_norm": 10.875,
"learning_rate": 7.571884289224174e-08,
"epoch": 48.24120603015076,
"step": 9600
},
{
"loss": 0.1837,
"grad_norm": 33.0,
"learning_rate": 5.5701637969486355e-08,
"epoch": 48.49246231155779,
"step": 9650
},
{
"loss": 0.1591,
"grad_norm": 5.5625,
"learning_rate": 3.87440818827789e-08,
"epoch": 48.743718592964825,
"step": 9700
},
{
"loss": 0.178,
"grad_norm": 10.5,
"learning_rate": 2.4851392111004956e-08,
"epoch": 48.994974874371856,
"step": 9750
},
{
"eval_loss": 0.34273195266723633,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.438,
"eval_samples_per_second": 551.459,
"eval_steps_per_second": 17.385,
"epoch": 49.0,
"step": 9751
},
{
"loss": 0.1834,
"grad_norm": 11.5,
"learning_rate": 1.4027843138954001e-08,
"epoch": 49.246231155778894,
"step": 9800
},
{
"loss": 0.18,
"grad_norm": 14.6875,
"learning_rate": 6.276765142152475e-09,
"epoch": 49.49748743718593,
"step": 9850
},
{
"loss": 0.1612,
"grad_norm": 10.125,
"learning_rate": 1.6005429622334423e-09,
"epoch": 49.74874371859296,
"step": 9900
},
{
"loss": 0.1675,
"grad_norm": 24.5,
"learning_rate": 6.153731813007824e-13,
"epoch": 50.0,
"step": 9950
},
{
"eval_loss": 0.34301358461380005,
"eval_accuracy": 0.8839848675914249,
"eval_top3": 0.9899117276166457,
"eval_macro_f1": 0.8640505019325028,
"eval_kappa": 0.8496288952600413,
"eval_runtime": 1.334,
"eval_samples_per_second": 594.454,
"eval_steps_per_second": 18.741,
"epoch": 50.0,
"step": 9950
},
{
"train_runtime": 1027.9074,
"train_samples_per_second": 154.197,
"train_steps_per_second": 9.68,
"total_flos": 1.2418210759836672e+19,
"train_loss": 0.335881779062089,
"epoch": 50.0,
"step": 9950
}
]