| [ | |
| { | |
| "loss": 1.6348, | |
| "grad_norm": 12.6875, | |
| "learning_rate": 9.849246231155778e-07, | |
| "epoch": 0.25125628140703515, | |
| "step": 50 | |
| }, | |
| { | |
| "loss": 1.6242, | |
| "grad_norm": 13.625, | |
| "learning_rate": 1.989949748743719e-06, | |
| "epoch": 0.5025125628140703, | |
| "step": 100 | |
| }, | |
| { | |
| "loss": 1.6156, | |
| "grad_norm": 13.0, | |
| "learning_rate": 2.994974874371859e-06, | |
| "epoch": 0.7537688442211056, | |
| "step": 150 | |
| }, | |
| { | |
| "eval_loss": 1.6190789937973022, | |
| "eval_accuracy": 0.21059268600252207, | |
| "eval_top3": 0.6633039092055486, | |
| "eval_macro_f1": 0.2037528618679592, | |
| "eval_kappa": 0.03531167592000617, | |
| "eval_runtime": 64.558, | |
| "eval_samples_per_second": 12.284, | |
| "eval_steps_per_second": 0.387, | |
| "epoch": 1.0, | |
| "step": 199 | |
| }, | |
| { | |
| "loss": 1.6267, | |
| "grad_norm": 12.5625, | |
| "learning_rate": 4.000000000000001e-06, | |
| "epoch": 1.0050251256281406, | |
| "step": 200 | |
| }, | |
| { | |
| "loss": 1.6181, | |
| "grad_norm": 10.9375, | |
| "learning_rate": 5.005025125628141e-06, | |
| "epoch": 1.2562814070351758, | |
| "step": 250 | |
| }, | |
| { | |
| "loss": 1.5978, | |
| "grad_norm": 14.4375, | |
| "learning_rate": 6.010050251256282e-06, | |
| "epoch": 1.507537688442211, | |
| "step": 300 | |
| }, | |
| { | |
| "loss": 1.5929, | |
| "grad_norm": 11.125, | |
| "learning_rate": 7.015075376884422e-06, | |
| "epoch": 1.758793969849246, | |
| "step": 350 | |
| }, | |
| { | |
| "eval_loss": 1.5563229322433472, | |
| "eval_accuracy": 0.2938209331651955, | |
| "eval_top3": 0.7364438839848676, | |
| "eval_macro_f1": 0.26941324280219475, | |
| "eval_kappa": 0.11484951166035484, | |
| "eval_runtime": 1.348, | |
| "eval_samples_per_second": 588.28, | |
| "eval_steps_per_second": 18.546, | |
| "epoch": 2.0, | |
| "step": 398 | |
| }, | |
| { | |
| "loss": 1.5629, | |
| "grad_norm": 16.125, | |
| "learning_rate": 8.020100502512563e-06, | |
| "epoch": 2.0100502512562812, | |
| "step": 400 | |
| }, | |
| { | |
| "loss": 1.5411, | |
| "grad_norm": 12.125, | |
| "learning_rate": 9.025125628140704e-06, | |
| "epoch": 2.2613065326633164, | |
| "step": 450 | |
| }, | |
| { | |
| "loss": 1.5202, | |
| "grad_norm": 10.375, | |
| "learning_rate": 1.0030150753768846e-05, | |
| "epoch": 2.5125628140703515, | |
| "step": 500 | |
| }, | |
| { | |
| "loss": 1.4924, | |
| "grad_norm": 34.25, | |
| "learning_rate": 1.1035175879396986e-05, | |
| "epoch": 2.7638190954773867, | |
| "step": 550 | |
| }, | |
| { | |
| "eval_loss": 1.4240866899490356, | |
| "eval_accuracy": 0.46532156368221944, | |
| "eval_top3": 0.8348045397225725, | |
| "eval_macro_f1": 0.39144397784367796, | |
| "eval_kappa": 0.2981436602019366, | |
| "eval_runtime": 1.339, | |
| "eval_samples_per_second": 592.233, | |
| "eval_steps_per_second": 18.671, | |
| "epoch": 3.0, | |
| "step": 597 | |
| }, | |
| { | |
| "loss": 1.4388, | |
| "grad_norm": 12.375, | |
| "learning_rate": 1.2040201005025128e-05, | |
| "epoch": 3.0150753768844223, | |
| "step": 600 | |
| }, | |
| { | |
| "loss": 1.3922, | |
| "grad_norm": 10.125, | |
| "learning_rate": 1.3045226130653268e-05, | |
| "epoch": 3.2663316582914574, | |
| "step": 650 | |
| }, | |
| { | |
| "loss": 1.3391, | |
| "grad_norm": 13.0, | |
| "learning_rate": 1.4050251256281408e-05, | |
| "epoch": 3.5175879396984926, | |
| "step": 700 | |
| }, | |
| { | |
| "loss": 1.2838, | |
| "grad_norm": 11.625, | |
| "learning_rate": 1.5055276381909548e-05, | |
| "epoch": 3.7688442211055277, | |
| "step": 750 | |
| }, | |
| { | |
| "eval_loss": 1.202721118927002, | |
| "eval_accuracy": 0.5800756620428752, | |
| "eval_top3": 0.9205548549810845, | |
| "eval_macro_f1": 0.497103403115527, | |
| "eval_kappa": 0.4472502653133419, | |
| "eval_runtime": 1.337, | |
| "eval_samples_per_second": 593.118, | |
| "eval_steps_per_second": 18.699, | |
| "epoch": 4.0, | |
| "step": 796 | |
| }, | |
| { | |
| "loss": 1.2487, | |
| "grad_norm": 14.4375, | |
| "learning_rate": 1.606030150753769e-05, | |
| "epoch": 4.0201005025125625, | |
| "step": 800 | |
| }, | |
| { | |
| "loss": 1.1559, | |
| "grad_norm": 10.4375, | |
| "learning_rate": 1.706532663316583e-05, | |
| "epoch": 4.271356783919598, | |
| "step": 850 | |
| }, | |
| { | |
| "loss": 1.0407, | |
| "grad_norm": 20.25, | |
| "learning_rate": 1.8070351758793973e-05, | |
| "epoch": 4.522613065326633, | |
| "step": 900 | |
| }, | |
| { | |
| "loss": 0.9483, | |
| "grad_norm": 10.125, | |
| "learning_rate": 1.907537688442211e-05, | |
| "epoch": 4.773869346733669, | |
| "step": 950 | |
| }, | |
| { | |
| "eval_loss": 0.8165158629417419, | |
| "eval_accuracy": 0.7452711223203027, | |
| "eval_top3": 0.9672131147540983, | |
| "eval_macro_f1": 0.6978370232443252, | |
| "eval_kappa": 0.6680433777984089, | |
| "eval_runtime": 1.3351, | |
| "eval_samples_per_second": 593.948, | |
| "eval_steps_per_second": 18.725, | |
| "epoch": 5.0, | |
| "step": 995 | |
| }, | |
| { | |
| "loss": 0.8677, | |
| "grad_norm": 12.625, | |
| "learning_rate": 1.9999990154030625e-05, | |
| "epoch": 5.025125628140704, | |
| "step": 1000 | |
| }, | |
| { | |
| "loss": 0.7965, | |
| "grad_norm": 11.4375, | |
| "learning_rate": 1.9998205625451942e-05, | |
| "epoch": 5.276381909547739, | |
| "step": 1050 | |
| }, | |
| { | |
| "loss": 0.6202, | |
| "grad_norm": 10.5, | |
| "learning_rate": 1.9993344861920247e-05, | |
| "epoch": 5.527638190954773, | |
| "step": 1100 | |
| }, | |
| { | |
| "loss": 0.655, | |
| "grad_norm": 14.8125, | |
| "learning_rate": 1.9985409358988966e-05, | |
| "epoch": 5.778894472361809, | |
| "step": 1150 | |
| }, | |
| { | |
| "eval_loss": 0.5597819685935974, | |
| "eval_accuracy": 0.8007566204287516, | |
| "eval_top3": 0.9810844892812106, | |
| "eval_macro_f1": 0.7631654003718922, | |
| "eval_kappa": 0.7409659352859331, | |
| "eval_runtime": 1.388, | |
| "eval_samples_per_second": 571.326, | |
| "eval_steps_per_second": 18.012, | |
| "epoch": 6.0, | |
| "step": 1194 | |
| }, | |
| { | |
| "loss": 0.5711, | |
| "grad_norm": 14.375, | |
| "learning_rate": 1.9974401558243355e-05, | |
| "epoch": 6.030150753768845, | |
| "step": 1200 | |
| }, | |
| { | |
| "loss": 0.5362, | |
| "grad_norm": 13.25, | |
| "learning_rate": 1.9960324846549286e-05, | |
| "epoch": 6.28140703517588, | |
| "step": 1250 | |
| }, | |
| { | |
| "loss": 0.5104, | |
| "grad_norm": 12.9375, | |
| "learning_rate": 1.994318355501118e-05, | |
| "epoch": 6.532663316582915, | |
| "step": 1300 | |
| }, | |
| { | |
| "loss": 0.4477, | |
| "grad_norm": 12.0625, | |
| "learning_rate": 1.99229829576394e-05, | |
| "epoch": 6.78391959798995, | |
| "step": 1350 | |
| }, | |
| { | |
| "eval_loss": 0.46245822310447693, | |
| "eval_accuracy": 0.8310214375788146, | |
| "eval_top3": 0.987389659520807, | |
| "eval_macro_f1": 0.8040762608401479, | |
| "eval_kappa": 0.7808619761646, | |
| "eval_runtime": 1.334, | |
| "eval_samples_per_second": 594.453, | |
| "eval_steps_per_second": 18.741, | |
| "epoch": 7.0, | |
| "step": 1393 | |
| }, | |
| { | |
| "loss": 0.496, | |
| "grad_norm": 8.9375, | |
| "learning_rate": 1.9899729269727584e-05, | |
| "epoch": 7.035175879396985, | |
| "step": 1400 | |
| }, | |
| { | |
| "loss": 0.4427, | |
| "grad_norm": 8.5625, | |
| "learning_rate": 1.9873429645940293e-05, | |
| "epoch": 7.28643216080402, | |
| "step": 1450 | |
| }, | |
| { | |
| "loss": 0.4144, | |
| "grad_norm": 10.75, | |
| "learning_rate": 1.9844092178111703e-05, | |
| "epoch": 7.5376884422110555, | |
| "step": 1500 | |
| }, | |
| { | |
| "loss": 0.4074, | |
| "grad_norm": 11.0625, | |
| "learning_rate": 1.9811725892755905e-05, | |
| "epoch": 7.788944723618091, | |
| "step": 1550 | |
| }, | |
| { | |
| "eval_loss": 0.4191744029521942, | |
| "eval_accuracy": 0.8423707440100883, | |
| "eval_top3": 0.9886506935687264, | |
| "eval_macro_f1": 0.8179574437589323, | |
| "eval_kappa": 0.7955173694199191, | |
| "eval_runtime": 1.325, | |
| "eval_samples_per_second": 598.49, | |
| "eval_steps_per_second": 18.868, | |
| "epoch": 8.0, | |
| "step": 1592 | |
| }, | |
| { | |
| "loss": 0.402, | |
| "grad_norm": 11.875, | |
| "learning_rate": 1.9776340748289643e-05, | |
| "epoch": 8.040201005025125, | |
| "step": 1600 | |
| }, | |
| { | |
| "loss": 0.359, | |
| "grad_norm": 12.5, | |
| "learning_rate": 1.973794763196832e-05, | |
| "epoch": 8.291457286432161, | |
| "step": 1650 | |
| }, | |
| { | |
| "loss": 0.326, | |
| "grad_norm": 12.75, | |
| "learning_rate": 1.9696558356536224e-05, | |
| "epoch": 8.542713567839195, | |
| "step": 1700 | |
| }, | |
| { | |
| "loss": 0.3792, | |
| "grad_norm": 13.3125, | |
| "learning_rate": 1.9652185656591992e-05, | |
| "epoch": 8.793969849246231, | |
| "step": 1750 | |
| }, | |
| { | |
| "eval_loss": 0.39110326766967773, | |
| "eval_accuracy": 0.8537200504413619, | |
| "eval_top3": 0.9911727616645649, | |
| "eval_macro_f1": 0.8292392112258031, | |
| "eval_kappa": 0.8104571257842844, | |
| "eval_runtime": 1.37, | |
| "eval_samples_per_second": 578.832, | |
| "eval_steps_per_second": 18.248, | |
| "epoch": 9.0, | |
| "step": 1791 | |
| }, | |
| { | |
| "loss": 0.3652, | |
| "grad_norm": 12.0625, | |
| "learning_rate": 1.9604843184670462e-05, | |
| "epoch": 9.045226130653266, | |
| "step": 1800 | |
| }, | |
| { | |
| "loss": 0.3435, | |
| "grad_norm": 19.25, | |
| "learning_rate": 1.9554545507042047e-05, | |
| "epoch": 9.296482412060302, | |
| "step": 1850 | |
| }, | |
| { | |
| "loss": 0.3287, | |
| "grad_norm": 6.09375, | |
| "learning_rate": 1.950130809923104e-05, | |
| "epoch": 9.547738693467338, | |
| "step": 1900 | |
| }, | |
| { | |
| "loss": 0.2922, | |
| "grad_norm": 11.4375, | |
| "learning_rate": 1.9445147341254094e-05, | |
| "epoch": 9.798994974874372, | |
| "step": 1950 | |
| }, | |
| { | |
| "eval_loss": 0.3803386092185974, | |
| "eval_accuracy": 0.8511979823455234, | |
| "eval_top3": 0.9911727616645649, | |
| "eval_macro_f1": 0.8273026210900127, | |
| "eval_kappa": 0.8074331693865371, | |
| "eval_runtime": 1.391, | |
| "eval_samples_per_second": 570.092, | |
| "eval_steps_per_second": 17.973, | |
| "epoch": 10.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "loss": 0.3334, | |
| "grad_norm": 10.8125, | |
| "learning_rate": 1.938608051258047e-05, | |
| "epoch": 10.050251256281408, | |
| "step": 2000 | |
| }, | |
| { | |
| "loss": 0.2973, | |
| "grad_norm": 12.0, | |
| "learning_rate": 1.932412578681548e-05, | |
| "epoch": 10.301507537688442, | |
| "step": 2050 | |
| }, | |
| { | |
| "loss": 0.2925, | |
| "grad_norm": 7.53125, | |
| "learning_rate": 1.9259302226108878e-05, | |
| "epoch": 10.552763819095478, | |
| "step": 2100 | |
| }, | |
| { | |
| "loss": 0.3054, | |
| "grad_norm": 44.0, | |
| "learning_rate": 1.9191629775289836e-05, | |
| "epoch": 10.804020100502512, | |
| "step": 2150 | |
| }, | |
| { | |
| "eval_loss": 0.36623987555503845, | |
| "eval_accuracy": 0.8638083228247163, | |
| "eval_top3": 0.9911727616645649, | |
| "eval_macro_f1": 0.8409607591489069, | |
| "eval_kappa": 0.823617727196901, | |
| "eval_runtime": 1.364, | |
| "eval_samples_per_second": 581.379, | |
| "eval_steps_per_second": 18.328, | |
| "epoch": 11.0, | |
| "step": 2189 | |
| }, | |
| { | |
| "loss": 0.2989, | |
| "grad_norm": 6.65625, | |
| "learning_rate": 1.912112925573035e-05, | |
| "epoch": 11.055276381909549, | |
| "step": 2200 | |
| }, | |
| { | |
| "loss": 0.2812, | |
| "grad_norm": 15.125, | |
| "learning_rate": 1.9047822358938933e-05, | |
| "epoch": 11.306532663316583, | |
| "step": 2250 | |
| }, | |
| { | |
| "loss": 0.2535, | |
| "grad_norm": 9.25, | |
| "learning_rate": 1.897173163988661e-05, | |
| "epoch": 11.557788944723619, | |
| "step": 2300 | |
| }, | |
| { | |
| "loss": 0.2797, | |
| "grad_norm": 22.0, | |
| "learning_rate": 1.8892880510067234e-05, | |
| "epoch": 11.809045226130653, | |
| "step": 2350 | |
| }, | |
| { | |
| "eval_loss": 0.3603597581386566, | |
| "eval_accuracy": 0.8688524590163934, | |
| "eval_top3": 0.9886506935687264, | |
| "eval_macro_f1": 0.8466482549906356, | |
| "eval_kappa": 0.8301133168401472, | |
| "eval_runtime": 1.368, | |
| "eval_samples_per_second": 579.678, | |
| "eval_steps_per_second": 18.275, | |
| "epoch": 12.0, | |
| "step": 2388 | |
| }, | |
| { | |
| "loss": 0.283, | |
| "grad_norm": 14.0625, | |
| "learning_rate": 1.881129323029427e-05, | |
| "epoch": 12.06030150753769, | |
| "step": 2400 | |
| }, | |
| { | |
| "loss": 0.2537, | |
| "grad_norm": 15.0, | |
| "learning_rate": 1.872699490323626e-05, | |
| "epoch": 12.311557788944723, | |
| "step": 2450 | |
| }, | |
| { | |
| "loss": 0.2988, | |
| "grad_norm": 14.25, | |
| "learning_rate": 1.8640011465693237e-05, | |
| "epoch": 12.56281407035176, | |
| "step": 2500 | |
| }, | |
| { | |
| "loss": 0.2403, | |
| "grad_norm": 8.3125, | |
| "learning_rate": 1.8550369680616584e-05, | |
| "epoch": 12.814070351758794, | |
| "step": 2550 | |
| }, | |
| { | |
| "eval_loss": 0.35605388879776, | |
| "eval_accuracy": 0.8738965952080706, | |
| "eval_top3": 0.9911727616645649, | |
| "eval_macro_f1": 0.8539434147627019, | |
| "eval_kappa": 0.8367116653351014, | |
| "eval_runtime": 1.361, | |
| "eval_samples_per_second": 582.66, | |
| "eval_steps_per_second": 18.369, | |
| "epoch": 13.0, | |
| "step": 2587 | |
| }, | |
| { | |
| "loss": 0.2475, | |
| "grad_norm": 15.5, | |
| "learning_rate": 1.8458097128874583e-05, | |
| "epoch": 13.06532663316583, | |
| "step": 2600 | |
| }, | |
| { | |
| "loss": 0.2492, | |
| "grad_norm": 5.5625, | |
| "learning_rate": 1.8363222200766406e-05, | |
| "epoch": 13.316582914572864, | |
| "step": 2650 | |
| }, | |
| { | |
| "loss": 0.2392, | |
| "grad_norm": 43.75, | |
| "learning_rate": 1.8265774087287016e-05, | |
| "epoch": 13.5678391959799, | |
| "step": 2700 | |
| }, | |
| { | |
| "loss": 0.2525, | |
| "grad_norm": 6.09375, | |
| "learning_rate": 1.816578277114571e-05, | |
| "epoch": 13.819095477386934, | |
| "step": 2750 | |
| }, | |
| { | |
| "eval_loss": 0.348567396402359, | |
| "eval_accuracy": 0.8764186633039092, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8541541677819424, | |
| "eval_kappa": 0.8398197730261395, | |
| "eval_runtime": 1.403, | |
| "eval_samples_per_second": 565.218, | |
| "eval_steps_per_second": 17.819, | |
| "epoch": 14.0, | |
| "step": 2786 | |
| }, | |
| { | |
| "loss": 0.2064, | |
| "grad_norm": 8.5, | |
| "learning_rate": 1.8063279017541086e-05, | |
| "epoch": 14.07035175879397, | |
| "step": 2800 | |
| }, | |
| { | |
| "loss": 0.2228, | |
| "grad_norm": 29.5, | |
| "learning_rate": 1.7958294364695254e-05, | |
| "epoch": 14.321608040201005, | |
| "step": 2850 | |
| }, | |
| { | |
| "loss": 0.23, | |
| "grad_norm": 9.5, | |
| "learning_rate": 1.7850861114150174e-05, | |
| "epoch": 14.57286432160804, | |
| "step": 2900 | |
| }, | |
| { | |
| "loss": 0.2341, | |
| "grad_norm": 18.75, | |
| "learning_rate": 1.7741012320829187e-05, | |
| "epoch": 14.824120603015075, | |
| "step": 2950 | |
| }, | |
| { | |
| "eval_loss": 0.3470554053783417, | |
| "eval_accuracy": 0.8764186633039092, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8554054945028179, | |
| "eval_kappa": 0.8397983100426509, | |
| "eval_runtime": 1.396, | |
| "eval_samples_per_second": 568.052, | |
| "eval_steps_per_second": 17.908, | |
| "epoch": 15.0, | |
| "step": 2985 | |
| }, | |
| { | |
| "loss": 0.2557, | |
| "grad_norm": 12.875, | |
| "learning_rate": 1.7628781782866696e-05, | |
| "epoch": 15.075376884422111, | |
| "step": 3000 | |
| }, | |
| { | |
| "loss": 0.2163, | |
| "grad_norm": 9.4375, | |
| "learning_rate": 1.751420403120922e-05, | |
| "epoch": 15.326633165829145, | |
| "step": 3050 | |
| }, | |
| { | |
| "loss": 0.2159, | |
| "grad_norm": 28.75, | |
| "learning_rate": 1.7397314318990933e-05, | |
| "epoch": 15.577889447236181, | |
| "step": 3100 | |
| }, | |
| { | |
| "loss": 0.2219, | |
| "grad_norm": 10.4375, | |
| "learning_rate": 1.7278148610687053e-05, | |
| "epoch": 15.829145728643216, | |
| "step": 3150 | |
| }, | |
| { | |
| "eval_loss": 0.3462725579738617, | |
| "eval_accuracy": 0.8764186633039092, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8554054945028179, | |
| "eval_kappa": 0.8397983100426509, | |
| "eval_runtime": 1.355, | |
| "eval_samples_per_second": 585.241, | |
| "eval_steps_per_second": 18.45, | |
| "epoch": 16.0, | |
| "step": 3184 | |
| }, | |
| { | |
| "loss": 0.2271, | |
| "grad_norm": 13.8125, | |
| "learning_rate": 1.7156743571048314e-05, | |
| "epoch": 16.08040201005025, | |
| "step": 3200 | |
| }, | |
| { | |
| "loss": 0.2162, | |
| "grad_norm": 11.125, | |
| "learning_rate": 1.703313655382002e-05, | |
| "epoch": 16.331658291457288, | |
| "step": 3250 | |
| }, | |
| { | |
| "loss": 0.2019, | |
| "grad_norm": 12.75, | |
| "learning_rate": 1.6907365590249083e-05, | |
| "epoch": 16.582914572864322, | |
| "step": 3300 | |
| }, | |
| { | |
| "loss": 0.1926, | |
| "grad_norm": 3.6875, | |
| "learning_rate": 1.6779469377382624e-05, | |
| "epoch": 16.834170854271356, | |
| "step": 3350 | |
| }, | |
| { | |
| "eval_loss": 0.34653961658477783, | |
| "eval_accuracy": 0.8751576292559899, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.853208113072801, | |
| "eval_kappa": 0.8382066236630051, | |
| "eval_runtime": 1.3501, | |
| "eval_samples_per_second": 587.384, | |
| "eval_steps_per_second": 18.518, | |
| "epoch": 17.0, | |
| "step": 3383 | |
| }, | |
| { | |
| "loss": 0.2128, | |
| "grad_norm": 16.5, | |
| "learning_rate": 1.6649487266161718e-05, | |
| "epoch": 17.08542713567839, | |
| "step": 3400 | |
| }, | |
| { | |
| "loss": 0.1929, | |
| "grad_norm": 10.5625, | |
| "learning_rate": 1.6517459249313926e-05, | |
| "epoch": 17.33668341708543, | |
| "step": 3450 | |
| }, | |
| { | |
| "loss": 0.2036, | |
| "grad_norm": 13.4375, | |
| "learning_rate": 1.638342594904843e-05, | |
| "epoch": 17.587939698492463, | |
| "step": 3500 | |
| }, | |
| { | |
| "loss": 0.1969, | |
| "grad_norm": 11.1875, | |
| "learning_rate": 1.6247428604557392e-05, | |
| "epoch": 17.839195979899497, | |
| "step": 3550 | |
| }, | |
| { | |
| "eval_loss": 0.3459188640117645, | |
| "eval_accuracy": 0.880201765447667, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8600443723197964, | |
| "eval_kappa": 0.8447552476373783, | |
| "eval_runtime": 1.344, | |
| "eval_samples_per_second": 590.028, | |
| "eval_steps_per_second": 18.601, | |
| "epoch": 18.0, | |
| "step": 3582 | |
| }, | |
| { | |
| "loss": 0.2207, | |
| "grad_norm": 18.125, | |
| "learning_rate": 1.610950905932756e-05, | |
| "epoch": 18.09045226130653, | |
| "step": 3600 | |
| }, | |
| { | |
| "loss": 0.2066, | |
| "grad_norm": 18.25, | |
| "learning_rate": 1.5969709748265933e-05, | |
| "epoch": 18.34170854271357, | |
| "step": 3650 | |
| }, | |
| { | |
| "loss": 0.1658, | |
| "grad_norm": 11.5625, | |
| "learning_rate": 1.58280736846434e-05, | |
| "epoch": 18.592964824120603, | |
| "step": 3700 | |
| }, | |
| { | |
| "loss": 0.2012, | |
| "grad_norm": 2.890625, | |
| "learning_rate": 1.5684644446860518e-05, | |
| "epoch": 18.844221105527637, | |
| "step": 3750 | |
| }, | |
| { | |
| "eval_loss": 0.3451780676841736, | |
| "eval_accuracy": 0.8751576292559899, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8549175688845306, | |
| "eval_kappa": 0.8383209115828104, | |
| "eval_runtime": 1.351, | |
| "eval_samples_per_second": 586.973, | |
| "eval_steps_per_second": 18.505, | |
| "epoch": 19.0, | |
| "step": 3781 | |
| }, | |
| { | |
| "loss": 0.2053, | |
| "grad_norm": 10.75, | |
| "learning_rate": 1.5539466165039338e-05, | |
| "epoch": 19.09547738693467, | |
| "step": 3800 | |
| }, | |
| { | |
| "loss": 0.1818, | |
| "grad_norm": 8.375, | |
| "learning_rate": 1.5392583507445508e-05, | |
| "epoch": 19.34673366834171, | |
| "step": 3850 | |
| }, | |
| { | |
| "loss": 0.2039, | |
| "grad_norm": 10.0625, | |
| "learning_rate": 1.524404166674482e-05, | |
| "epoch": 19.597989949748744, | |
| "step": 3900 | |
| }, | |
| { | |
| "loss": 0.1937, | |
| "grad_norm": 9.5, | |
| "learning_rate": 1.5093886346098372e-05, | |
| "epoch": 19.849246231155778, | |
| "step": 3950 | |
| }, | |
| { | |
| "eval_loss": 0.3440295159816742, | |
| "eval_accuracy": 0.880201765447667, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8590029071176492, | |
| "eval_kappa": 0.844723249362074, | |
| "eval_runtime": 1.345, | |
| "eval_samples_per_second": 589.592, | |
| "eval_steps_per_second": 18.587, | |
| "epoch": 20.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "loss": 0.2018, | |
| "grad_norm": 17.375, | |
| "learning_rate": 1.4942163745100668e-05, | |
| "epoch": 20.100502512562816, | |
| "step": 4000 | |
| }, | |
| { | |
| "loss": 0.1673, | |
| "grad_norm": 7.625, | |
| "learning_rate": 1.4788920545565014e-05, | |
| "epoch": 20.35175879396985, | |
| "step": 4050 | |
| }, | |
| { | |
| "loss": 0.1789, | |
| "grad_norm": 20.75, | |
| "learning_rate": 1.4634203897160497e-05, | |
| "epoch": 20.603015075376884, | |
| "step": 4100 | |
| }, | |
| { | |
| "loss": 0.2001, | |
| "grad_norm": 3.453125, | |
| "learning_rate": 1.4478061402905048e-05, | |
| "epoch": 20.85427135678392, | |
| "step": 4150 | |
| }, | |
| { | |
| "eval_loss": 0.3432489037513733, | |
| "eval_accuracy": 0.8814627994955864, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8622259247649311, | |
| "eval_kappa": 0.8463894029254059, | |
| "eval_runtime": 1.365, | |
| "eval_samples_per_second": 580.952, | |
| "eval_steps_per_second": 18.315, | |
| "epoch": 21.0, | |
| "step": 4179 | |
| }, | |
| { | |
| "loss": 0.1866, | |
| "grad_norm": 3.546875, | |
| "learning_rate": 1.4320541104518992e-05, | |
| "epoch": 21.105527638190956, | |
| "step": 4200 | |
| }, | |
| { | |
| "loss": 0.184, | |
| "grad_norm": 15.375, | |
| "learning_rate": 1.4161691467643659e-05, | |
| "epoch": 21.35678391959799, | |
| "step": 4250 | |
| }, | |
| { | |
| "loss": 0.1923, | |
| "grad_norm": 8.25, | |
| "learning_rate": 1.400156136692951e-05, | |
| "epoch": 21.608040201005025, | |
| "step": 4300 | |
| }, | |
| { | |
| "loss": 0.1762, | |
| "grad_norm": 4.46875, | |
| "learning_rate": 1.3840200070998466e-05, | |
| "epoch": 21.85929648241206, | |
| "step": 4350 | |
| }, | |
| { | |
| "eval_loss": 0.34197643399238586, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8649545688082612, | |
| "eval_kappa": 0.8496555447709369, | |
| "eval_runtime": 1.366, | |
| "eval_samples_per_second": 580.527, | |
| "eval_steps_per_second": 18.302, | |
| "epoch": 22.0, | |
| "step": 4378 | |
| }, | |
| { | |
| "loss": 0.1991, | |
| "grad_norm": 13.625, | |
| "learning_rate": 1.3677657227285e-05, | |
| "epoch": 22.110552763819097, | |
| "step": 4400 | |
| }, | |
| { | |
| "loss": 0.2095, | |
| "grad_norm": 23.875, | |
| "learning_rate": 1.3513982846760669e-05, | |
| "epoch": 22.36180904522613, | |
| "step": 4450 | |
| }, | |
| { | |
| "loss": 0.1788, | |
| "grad_norm": 13.5, | |
| "learning_rate": 1.3349227288546815e-05, | |
| "epoch": 22.613065326633166, | |
| "step": 4500 | |
| }, | |
| { | |
| "loss": 0.1537, | |
| "grad_norm": 16.375, | |
| "learning_rate": 1.3183441244420129e-05, | |
| "epoch": 22.8643216080402, | |
| "step": 4550 | |
| }, | |
| { | |
| "eval_loss": 0.34272438287734985, | |
| "eval_accuracy": 0.880201765447667, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8598827006510683, | |
| "eval_kappa": 0.8447574870227686, | |
| "eval_runtime": 1.407, | |
| "eval_samples_per_second": 563.611, | |
| "eval_steps_per_second": 17.768, | |
| "epoch": 23.0, | |
| "step": 4577 | |
| }, | |
| { | |
| "loss": 0.1774, | |
| "grad_norm": 9.3125, | |
| "learning_rate": 1.3016675723215879e-05, | |
| "epoch": 23.115577889447238, | |
| "step": 4600 | |
| }, | |
| { | |
| "loss": 0.1776, | |
| "grad_norm": 7.78125, | |
| "learning_rate": 1.2848982035133555e-05, | |
| "epoch": 23.366834170854272, | |
| "step": 4650 | |
| }, | |
| { | |
| "loss": 0.1666, | |
| "grad_norm": 8.5625, | |
| "learning_rate": 1.2680411775949847e-05, | |
| "epoch": 23.618090452261306, | |
| "step": 4700 | |
| }, | |
| { | |
| "loss": 0.1787, | |
| "grad_norm": 8.0625, | |
| "learning_rate": 1.2511016811143697e-05, | |
| "epoch": 23.86934673366834, | |
| "step": 4750 | |
| }, | |
| { | |
| "eval_loss": 0.34232452511787415, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8619418239031577, | |
| "eval_kappa": 0.8479944267302592, | |
| "eval_runtime": 1.395, | |
| "eval_samples_per_second": 568.458, | |
| "eval_steps_per_second": 17.921, | |
| "epoch": 24.0, | |
| "step": 4776 | |
| }, | |
| { | |
| "loss": 0.1751, | |
| "grad_norm": 18.25, | |
| "learning_rate": 1.2340849259938404e-05, | |
| "epoch": 24.12060301507538, | |
| "step": 4800 | |
| }, | |
| { | |
| "loss": 0.1651, | |
| "grad_norm": 10.625, | |
| "learning_rate": 1.2169961479265653e-05, | |
| "epoch": 24.371859296482413, | |
| "step": 4850 | |
| }, | |
| { | |
| "loss": 0.1746, | |
| "grad_norm": 5.28125, | |
| "learning_rate": 1.1998406047656396e-05, | |
| "epoch": 24.623115577889447, | |
| "step": 4900 | |
| }, | |
| { | |
| "loss": 0.1905, | |
| "grad_norm": 12.5625, | |
| "learning_rate": 1.182623574906356e-05, | |
| "epoch": 24.87437185929648, | |
| "step": 4950 | |
| }, | |
| { | |
| "eval_loss": 0.34067824482917786, | |
| "eval_accuracy": 0.8852459016393442, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8661537754454564, | |
| "eval_kappa": 0.8512633637898235, | |
| "eval_runtime": 1.358, | |
| "eval_samples_per_second": 583.949, | |
| "eval_steps_per_second": 18.409, | |
| "epoch": 25.0, | |
| "step": 4975 | |
| }, | |
| { | |
| "loss": 0.1701, | |
| "grad_norm": 6.125, | |
| "learning_rate": 1.1653503556621553e-05, | |
| "epoch": 25.12562814070352, | |
| "step": 5000 | |
| }, | |
| { | |
| "loss": 0.1833, | |
| "grad_norm": 16.0, | |
| "learning_rate": 1.1480262616347544e-05, | |
| "epoch": 25.376884422110553, | |
| "step": 5050 | |
| }, | |
| { | |
| "loss": 0.167, | |
| "grad_norm": 6.3125, | |
| "learning_rate": 1.1306566230789593e-05, | |
| "epoch": 25.628140703517587, | |
| "step": 5100 | |
| }, | |
| { | |
| "loss": 0.167, | |
| "grad_norm": 25.75, | |
| "learning_rate": 1.1132467842626555e-05, | |
| "epoch": 25.87939698492462, | |
| "step": 5150 | |
| }, | |
| { | |
| "eval_loss": 0.34115472435951233, | |
| "eval_accuracy": 0.8852459016393442, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8661537754454564, | |
| "eval_kappa": 0.8512633637898235, | |
| "eval_runtime": 1.347, | |
| "eval_samples_per_second": 588.717, | |
| "eval_steps_per_second": 18.56, | |
| "epoch": 26.0, | |
| "step": 5174 | |
| }, | |
| { | |
| "loss": 0.1756, | |
| "grad_norm": 6.8125, | |
| "learning_rate": 1.0958021018224942e-05, | |
| "epoch": 26.13065326633166, | |
| "step": 5200 | |
| }, | |
| { | |
| "loss": 0.1735, | |
| "grad_norm": 4.59375, | |
| "learning_rate": 1.0783279431157668e-05, | |
| "epoch": 26.381909547738694, | |
| "step": 5250 | |
| }, | |
| { | |
| "loss": 0.1778, | |
| "grad_norm": 12.375, | |
| "learning_rate": 1.0608296845689843e-05, | |
| "epoch": 26.633165829145728, | |
| "step": 5300 | |
| }, | |
| { | |
| "loss": 0.1699, | |
| "grad_norm": 10.5, | |
| "learning_rate": 1.0433127100236655e-05, | |
| "epoch": 26.884422110552762, | |
| "step": 5350 | |
| }, | |
| { | |
| "eval_loss": 0.3404243290424347, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8649838454025487, | |
| "eval_kappa": 0.8496422211963331, | |
| "eval_runtime": 1.365, | |
| "eval_samples_per_second": 580.951, | |
| "eval_steps_per_second": 18.315, | |
| "epoch": 27.0, | |
| "step": 5373 | |
| }, | |
| { | |
| "loss": 0.1706, | |
| "grad_norm": 5.9375, | |
| "learning_rate": 1.0257824090798431e-05, | |
| "epoch": 27.1356783919598, | |
| "step": 5400 | |
| }, | |
| { | |
| "loss": 0.1549, | |
| "grad_norm": 4.5625, | |
| "learning_rate": 1.0082441754377996e-05, | |
| "epoch": 27.386934673366834, | |
| "step": 5450 | |
| }, | |
| { | |
| "loss": 0.1816, | |
| "grad_norm": 10.75, | |
| "learning_rate": 9.907034052385383e-06, | |
| "epoch": 27.63819095477387, | |
| "step": 5500 | |
| }, | |
| { | |
| "loss": 0.1777, | |
| "grad_norm": 14.0625, | |
| "learning_rate": 9.731654954035082e-06, | |
| "epoch": 27.889447236180903, | |
| "step": 5550 | |
| }, | |
| { | |
| "eval_loss": 0.3424096405506134, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.368, | |
| "eval_samples_per_second": 579.679, | |
| "eval_steps_per_second": 18.275, | |
| "epoch": 28.0, | |
| "step": 5572 | |
| }, | |
| { | |
| "loss": 0.1808, | |
| "grad_norm": 3.65625, | |
| "learning_rate": 9.556358419740852e-06, | |
| "epoch": 28.14070351758794, | |
| "step": 5600 | |
| }, | |
| { | |
| "loss": 0.1799, | |
| "grad_norm": 9.25, | |
| "learning_rate": 9.381198384513253e-06, | |
| "epoch": 28.391959798994975, | |
| "step": 5650 | |
| }, | |
| { | |
| "loss": 0.155, | |
| "grad_norm": 7.25, | |
| "learning_rate": 9.206228741364972e-06, | |
| "epoch": 28.64321608040201, | |
| "step": 5700 | |
| }, | |
| { | |
| "loss": 0.17, | |
| "grad_norm": 20.375, | |
| "learning_rate": 9.031503324729128e-06, | |
| "epoch": 28.894472361809044, | |
| "step": 5750 | |
| }, | |
| { | |
| "eval_loss": 0.3412993550300598, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8622758895354596, | |
| "eval_kappa": 0.8479787600258079, | |
| "eval_runtime": 1.356, | |
| "eval_samples_per_second": 584.808, | |
| "eval_steps_per_second": 18.437, | |
| "epoch": 29.0, | |
| "step": 5771 | |
| }, | |
| { | |
| "loss": 0.1891, | |
| "grad_norm": 13.625, | |
| "learning_rate": 8.857075893895537e-06, | |
| "epoch": 29.14572864321608, | |
| "step": 5800 | |
| }, | |
| { | |
| "loss": 0.1624, | |
| "grad_norm": 9.0625, | |
| "learning_rate": 8.683000116470117e-06, | |
| "epoch": 29.396984924623116, | |
| "step": 5850 | |
| }, | |
| { | |
| "loss": 0.1562, | |
| "grad_norm": 9.4375, | |
| "learning_rate": 8.509329551862535e-06, | |
| "epoch": 29.64824120603015, | |
| "step": 5900 | |
| }, | |
| { | |
| "loss": 0.1926, | |
| "grad_norm": 10.625, | |
| "learning_rate": 8.336117634807107e-06, | |
| "epoch": 29.899497487437188, | |
| "step": 5950 | |
| }, | |
| { | |
| "eval_loss": 0.3421500027179718, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.352, | |
| "eval_samples_per_second": 586.538, | |
| "eval_steps_per_second": 18.491, | |
| "epoch": 30.0, | |
| "step": 5970 | |
| }, | |
| { | |
| "loss": 0.1803, | |
| "grad_norm": 12.3125, | |
| "learning_rate": 8.163417658922048e-06, | |
| "epoch": 30.150753768844222, | |
| "step": 6000 | |
| }, | |
| { | |
| "loss": 0.1612, | |
| "grad_norm": 19.625, | |
| "learning_rate": 7.991282760312188e-06, | |
| "epoch": 30.402010050251256, | |
| "step": 6050 | |
| }, | |
| { | |
| "loss": 0.1568, | |
| "grad_norm": 8.125, | |
| "learning_rate": 7.819765901220113e-06, | |
| "epoch": 30.65326633165829, | |
| "step": 6100 | |
| }, | |
| { | |
| "loss": 0.1639, | |
| "grad_norm": 10.6875, | |
| "learning_rate": 7.648919853730804e-06, | |
| "epoch": 30.90452261306533, | |
| "step": 6150 | |
| }, | |
| { | |
| "eval_loss": 0.34186428785324097, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.391, | |
| "eval_samples_per_second": 570.094, | |
| "eval_steps_per_second": 17.973, | |
| "epoch": 31.0, | |
| "step": 6169 | |
| }, | |
| { | |
| "loss": 0.1836, | |
| "grad_norm": 15.1875, | |
| "learning_rate": 7.478797183534803e-06, | |
| "epoch": 31.155778894472363, | |
| "step": 6200 | |
| }, | |
| { | |
| "loss": 0.1477, | |
| "grad_norm": 13.8125, | |
| "learning_rate": 7.309450233754869e-06, | |
| "epoch": 31.407035175879397, | |
| "step": 6250 | |
| }, | |
| { | |
| "loss": 0.1907, | |
| "grad_norm": 12.875, | |
| "learning_rate": 7.140931108841094e-06, | |
| "epoch": 31.65829145728643, | |
| "step": 6300 | |
| }, | |
| { | |
| "loss": 0.1552, | |
| "grad_norm": 8.25, | |
| "learning_rate": 6.973291658539496e-06, | |
| "epoch": 31.90954773869347, | |
| "step": 6350 | |
| }, | |
| { | |
| "eval_loss": 0.3415157198905945, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.327, | |
| "eval_samples_per_second": 597.588, | |
| "eval_steps_per_second": 18.839, | |
| "epoch": 32.0, | |
| "step": 6368 | |
| }, | |
| { | |
| "loss": 0.1516, | |
| "grad_norm": 9.0625, | |
| "learning_rate": 6.806583461938956e-06, | |
| "epoch": 32.1608040201005, | |
| "step": 6400 | |
| }, | |
| { | |
| "loss": 0.187, | |
| "grad_norm": 4.09375, | |
| "learning_rate": 6.6408578116014025e-06, | |
| "epoch": 32.41206030150754, | |
| "step": 6450 | |
| }, | |
| { | |
| "loss": 0.1809, | |
| "grad_norm": 6.09375, | |
| "learning_rate": 6.4761656977802236e-06, | |
| "epoch": 32.663316582914575, | |
| "step": 6500 | |
| }, | |
| { | |
| "loss": 0.1543, | |
| "grad_norm": 28.75, | |
| "learning_rate": 6.312557792731619e-06, | |
| "epoch": 32.914572864321606, | |
| "step": 6550 | |
| }, | |
| { | |
| "eval_loss": 0.342151015996933, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.349, | |
| "eval_samples_per_second": 587.844, | |
| "eval_steps_per_second": 18.532, | |
| "epoch": 33.0, | |
| "step": 6567 | |
| }, | |
| { | |
| "loss": 0.1549, | |
| "grad_norm": 8.3125, | |
| "learning_rate": 6.150084435123842e-06, | |
| "epoch": 33.165829145728644, | |
| "step": 6600 | |
| }, | |
| { | |
| "loss": 0.1766, | |
| "grad_norm": 10.75, | |
| "learning_rate": 5.988795614549054e-06, | |
| "epoch": 33.41708542713568, | |
| "step": 6650 | |
| }, | |
| { | |
| "loss": 0.1597, | |
| "grad_norm": 5.9375, | |
| "learning_rate": 5.828740956142611e-06, | |
| "epoch": 33.66834170854271, | |
| "step": 6700 | |
| }, | |
| { | |
| "loss": 0.1688, | |
| "grad_norm": 6.59375, | |
| "learning_rate": 5.669969705314432e-06, | |
| "epoch": 33.91959798994975, | |
| "step": 6750 | |
| }, | |
| { | |
| "eval_loss": 0.3422100245952606, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.363, | |
| "eval_samples_per_second": 581.803, | |
| "eval_steps_per_second": 18.342, | |
| "epoch": 34.0, | |
| "step": 6766 | |
| }, | |
| { | |
| "loss": 0.1756, | |
| "grad_norm": 7.875, | |
| "learning_rate": 5.512530712597268e-06, | |
| "epoch": 34.17085427135678, | |
| "step": 6800 | |
| }, | |
| { | |
| "loss": 0.1617, | |
| "grad_norm": 5.34375, | |
| "learning_rate": 5.356472418616425e-06, | |
| "epoch": 34.42211055276382, | |
| "step": 6850 | |
| }, | |
| { | |
| "loss": 0.162, | |
| "grad_norm": 10.75, | |
| "learning_rate": 5.201842839185598e-06, | |
| "epoch": 34.67336683417086, | |
| "step": 6900 | |
| }, | |
| { | |
| "loss": 0.1638, | |
| "grad_norm": 3.078125, | |
| "learning_rate": 5.048689550533444e-06, | |
| "epoch": 34.92462311557789, | |
| "step": 6950 | |
| }, | |
| { | |
| "eval_loss": 0.34207883477211, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.365, | |
| "eval_samples_per_second": 580.953, | |
| "eval_steps_per_second": 18.315, | |
| "epoch": 35.0, | |
| "step": 6965 | |
| }, | |
| { | |
| "loss": 0.1858, | |
| "grad_norm": 21.625, | |
| "learning_rate": 4.897059674665391e-06, | |
| "epoch": 35.175879396984925, | |
| "step": 7000 | |
| }, | |
| { | |
| "loss": 0.1714, | |
| "grad_norm": 6.875, | |
| "learning_rate": 4.746999864865188e-06, | |
| "epoch": 35.42713567839196, | |
| "step": 7050 | |
| }, | |
| { | |
| "loss": 0.1725, | |
| "grad_norm": 6.5625, | |
| "learning_rate": 4.5985562913407015e-06, | |
| "epoch": 35.678391959798994, | |
| "step": 7100 | |
| }, | |
| { | |
| "loss": 0.1641, | |
| "grad_norm": 23.75, | |
| "learning_rate": 4.451774627018303e-06, | |
| "epoch": 35.92964824120603, | |
| "step": 7150 | |
| }, | |
| { | |
| "eval_loss": 0.34272658824920654, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.403, | |
| "eval_samples_per_second": 565.216, | |
| "eval_steps_per_second": 17.819, | |
| "epoch": 36.0, | |
| "step": 7164 | |
| }, | |
| { | |
| "loss": 0.1798, | |
| "grad_norm": 23.375, | |
| "learning_rate": 4.3067000334902985e-06, | |
| "epoch": 36.18090452261306, | |
| "step": 7200 | |
| }, | |
| { | |
| "loss": 0.1658, | |
| "grad_norm": 15.625, | |
| "learning_rate": 4.163377147119664e-06, | |
| "epoch": 36.4321608040201, | |
| "step": 7250 | |
| }, | |
| { | |
| "loss": 0.1755, | |
| "grad_norm": 5.0, | |
| "learning_rate": 4.0218500653063905e-06, | |
| "epoch": 36.68341708542714, | |
| "step": 7300 | |
| }, | |
| { | |
| "loss": 0.1623, | |
| "grad_norm": 5.5625, | |
| "learning_rate": 3.882162332919645e-06, | |
| "epoch": 36.93467336683417, | |
| "step": 7350 | |
| }, | |
| { | |
| "eval_loss": 0.3424283564090729, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.372, | |
| "eval_samples_per_second": 577.988, | |
| "eval_steps_per_second": 18.222, | |
| "epoch": 37.0, | |
| "step": 7363 | |
| }, | |
| { | |
| "loss": 0.1677, | |
| "grad_norm": 7.96875, | |
| "learning_rate": 3.744356928899939e-06, | |
| "epoch": 37.185929648241206, | |
| "step": 7400 | |
| }, | |
| { | |
| "loss": 0.1683, | |
| "grad_norm": 14.375, | |
| "learning_rate": 3.6084762530354487e-06, | |
| "epoch": 37.437185929648244, | |
| "step": 7450 | |
| }, | |
| { | |
| "loss": 0.1778, | |
| "grad_norm": 8.375, | |
| "learning_rate": 3.4745621129164676e-06, | |
| "epoch": 37.688442211055275, | |
| "step": 7500 | |
| }, | |
| { | |
| "loss": 0.1565, | |
| "grad_norm": 7.84375, | |
| "learning_rate": 3.3426557110721326e-06, | |
| "epoch": 37.93969849246231, | |
| "step": 7550 | |
| }, | |
| { | |
| "eval_loss": 0.3421717584133148, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.341, | |
| "eval_samples_per_second": 591.348, | |
| "eval_steps_per_second": 18.643, | |
| "epoch": 38.0, | |
| "step": 7562 | |
| }, | |
| { | |
| "loss": 0.1708, | |
| "grad_norm": 40.75, | |
| "learning_rate": 3.2127976322932596e-06, | |
| "epoch": 38.19095477386934, | |
| "step": 7600 | |
| }, | |
| { | |
| "loss": 0.1841, | |
| "grad_norm": 9.125, | |
| "learning_rate": 3.0850278311452797e-06, | |
| "epoch": 38.44221105527638, | |
| "step": 7650 | |
| }, | |
| { | |
| "loss": 0.1649, | |
| "grad_norm": 6.9375, | |
| "learning_rate": 2.9593856196750705e-06, | |
| "epoch": 38.69346733668342, | |
| "step": 7700 | |
| }, | |
| { | |
| "loss": 0.1606, | |
| "grad_norm": 22.125, | |
| "learning_rate": 2.8359096553154806e-06, | |
| "epoch": 38.94472361809045, | |
| "step": 7750 | |
| }, | |
| { | |
| "eval_loss": 0.34265828132629395, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.358, | |
| "eval_samples_per_second": 583.946, | |
| "eval_steps_per_second": 18.409, | |
| "epoch": 39.0, | |
| "step": 7761 | |
| }, | |
| { | |
| "loss": 0.176, | |
| "grad_norm": 12.875, | |
| "learning_rate": 2.7146379289912337e-06, | |
| "epoch": 39.19597989949749, | |
| "step": 7800 | |
| }, | |
| { | |
| "loss": 0.1633, | |
| "grad_norm": 5.71875, | |
| "learning_rate": 2.5956077534299715e-06, | |
| "epoch": 39.447236180904525, | |
| "step": 7850 | |
| }, | |
| { | |
| "loss": 0.1517, | |
| "grad_norm": 9.5, | |
| "learning_rate": 2.4788557516818935e-06, | |
| "epoch": 39.698492462311556, | |
| "step": 7900 | |
| }, | |
| { | |
| "loss": 0.1839, | |
| "grad_norm": 4.5625, | |
| "learning_rate": 2.3644178458516353e-06, | |
| "epoch": 39.949748743718594, | |
| "step": 7950 | |
| }, | |
| { | |
| "eval_loss": 0.3417166769504547, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.347, | |
| "eval_samples_per_second": 588.716, | |
| "eval_steps_per_second": 18.56, | |
| "epoch": 40.0, | |
| "step": 7960 | |
| }, | |
| { | |
| "loss": 0.1759, | |
| "grad_norm": 9.0625, | |
| "learning_rate": 2.252329246045787e-06, | |
| "epoch": 40.20100502512563, | |
| "step": 8000 | |
| }, | |
| { | |
| "loss": 0.1724, | |
| "grad_norm": 10.0625, | |
| "learning_rate": 2.142624439539516e-06, | |
| "epoch": 40.45226130653266, | |
| "step": 8050 | |
| }, | |
| { | |
| "loss": 0.1762, | |
| "grad_norm": 5.875, | |
| "learning_rate": 2.0353371801655564e-06, | |
| "epoch": 40.7035175879397, | |
| "step": 8100 | |
| }, | |
| { | |
| "loss": 0.1538, | |
| "grad_norm": 17.625, | |
| "learning_rate": 1.9305004779288673e-06, | |
| "epoch": 40.95477386934673, | |
| "step": 8150 | |
| }, | |
| { | |
| "eval_loss": 0.3423360288143158, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.323, | |
| "eval_samples_per_second": 599.394, | |
| "eval_steps_per_second": 18.896, | |
| "epoch": 41.0, | |
| "step": 8159 | |
| }, | |
| { | |
| "loss": 0.1696, | |
| "grad_norm": 11.875, | |
| "learning_rate": 1.8281465888501627e-06, | |
| "epoch": 41.20603015075377, | |
| "step": 8200 | |
| }, | |
| { | |
| "loss": 0.1642, | |
| "grad_norm": 12.875, | |
| "learning_rate": 1.7283070050414275e-06, | |
| "epoch": 41.45728643216081, | |
| "step": 8250 | |
| }, | |
| { | |
| "loss": 0.1711, | |
| "grad_norm": 5.75, | |
| "learning_rate": 1.6310124450164488e-06, | |
| "epoch": 41.70854271356784, | |
| "step": 8300 | |
| }, | |
| { | |
| "loss": 0.1544, | |
| "grad_norm": 11.25, | |
| "learning_rate": 1.5362928442394055e-06, | |
| "epoch": 41.959798994974875, | |
| "step": 8350 | |
| }, | |
| { | |
| "eval_loss": 0.34329381585121155, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.344, | |
| "eval_samples_per_second": 590.03, | |
| "eval_steps_per_second": 18.601, | |
| "epoch": 42.0, | |
| "step": 8358 | |
| }, | |
| { | |
| "loss": 0.1794, | |
| "grad_norm": 14.5, | |
| "learning_rate": 1.4441773459143405e-06, | |
| "epoch": 42.21105527638191, | |
| "step": 8400 | |
| }, | |
| { | |
| "loss": 0.146, | |
| "grad_norm": 7.28125, | |
| "learning_rate": 1.3546942920184303e-06, | |
| "epoch": 42.462311557788944, | |
| "step": 8450 | |
| }, | |
| { | |
| "loss": 0.1634, | |
| "grad_norm": 15.875, | |
| "learning_rate": 1.267871214581764e-06, | |
| "epoch": 42.71356783919598, | |
| "step": 8500 | |
| }, | |
| { | |
| "loss": 0.1804, | |
| "grad_norm": 10.25, | |
| "learning_rate": 1.1837348272163208e-06, | |
| "epoch": 42.96482412060301, | |
| "step": 8550 | |
| }, | |
| { | |
| "eval_loss": 0.3423879146575928, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.341, | |
| "eval_samples_per_second": 591.35, | |
| "eval_steps_per_second": 18.643, | |
| "epoch": 43.0, | |
| "step": 8557 | |
| }, | |
| { | |
| "loss": 0.162, | |
| "grad_norm": 18.375, | |
| "learning_rate": 1.1023110168967554e-06, | |
| "epoch": 43.21608040201005, | |
| "step": 8600 | |
| }, | |
| { | |
| "loss": 0.1698, | |
| "grad_norm": 106.0, | |
| "learning_rate": 1.0236248359955293e-06, | |
| "epoch": 43.46733668341709, | |
| "step": 8650 | |
| }, | |
| { | |
| "loss": 0.1629, | |
| "grad_norm": 16.875, | |
| "learning_rate": 9.477004945748414e-07, | |
| "epoch": 43.71859296482412, | |
| "step": 8700 | |
| }, | |
| { | |
| "loss": 0.1766, | |
| "grad_norm": 7.0, | |
| "learning_rate": 8.745613529376851e-07, | |
| "epoch": 43.969849246231156, | |
| "step": 8750 | |
| }, | |
| { | |
| "eval_loss": 0.34215831756591797, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.36, | |
| "eval_samples_per_second": 583.089, | |
| "eval_steps_per_second": 18.382, | |
| "epoch": 44.0, | |
| "step": 8756 | |
| }, | |
| { | |
| "loss": 0.158, | |
| "grad_norm": 6.1875, | |
| "learning_rate": 8.042299144404031e-07, | |
| "epoch": 44.221105527638194, | |
| "step": 8800 | |
| }, | |
| { | |
| "loss": 0.1792, | |
| "grad_norm": 3.859375, | |
| "learning_rate": 7.367278185688697e-07, | |
| "epoch": 44.472361809045225, | |
| "step": 8850 | |
| }, | |
| { | |
| "loss": 0.1887, | |
| "grad_norm": 5.71875, | |
| "learning_rate": 6.720758342804834e-07, | |
| "epoch": 44.72361809045226, | |
| "step": 8900 | |
| }, | |
| { | |
| "loss": 0.1489, | |
| "grad_norm": 21.25, | |
| "learning_rate": 6.10293853614008e-07, | |
| "epoch": 44.97487437185929, | |
| "step": 8950 | |
| }, | |
| { | |
| "eval_loss": 0.3427422344684601, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.31, | |
| "eval_samples_per_second": 605.344, | |
| "eval_steps_per_second": 19.084, | |
| "epoch": 45.0, | |
| "step": 8955 | |
| }, | |
| { | |
| "loss": 0.1917, | |
| "grad_norm": 8.5625, | |
| "learning_rate": 5.514008855692087e-07, | |
| "epoch": 45.22613065326633, | |
| "step": 9000 | |
| }, | |
| { | |
| "loss": 0.1846, | |
| "grad_norm": 4.875, | |
| "learning_rate": 4.954150502581923e-07, | |
| "epoch": 45.47738693467337, | |
| "step": 9050 | |
| }, | |
| { | |
| "loss": 0.1375, | |
| "grad_norm": 7.34375, | |
| "learning_rate": 4.4235357333022864e-07, | |
| "epoch": 45.7286432160804, | |
| "step": 9100 | |
| }, | |
| { | |
| "loss": 0.1672, | |
| "grad_norm": 11.6875, | |
| "learning_rate": 3.9223278067179404e-07, | |
| "epoch": 45.97989949748744, | |
| "step": 9150 | |
| }, | |
| { | |
| "eval_loss": 0.34274017810821533, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.335, | |
| "eval_samples_per_second": 594.008, | |
| "eval_steps_per_second": 18.727, | |
| "epoch": 46.0, | |
| "step": 9154 | |
| }, | |
| { | |
| "loss": 0.1705, | |
| "grad_norm": 3.21875, | |
| "learning_rate": 3.4506809338343495e-07, | |
| "epoch": 46.231155778894475, | |
| "step": 9200 | |
| }, | |
| { | |
| "loss": 0.1555, | |
| "grad_norm": 16.25, | |
| "learning_rate": 3.008740230350293e-07, | |
| "epoch": 46.482412060301506, | |
| "step": 9250 | |
| }, | |
| { | |
| "loss": 0.1823, | |
| "grad_norm": 14.375, | |
| "learning_rate": 2.596641672008837e-07, | |
| "epoch": 46.733668341708544, | |
| "step": 9300 | |
| }, | |
| { | |
| "loss": 0.1669, | |
| "grad_norm": 10.0, | |
| "learning_rate": 2.214512052760487e-07, | |
| "epoch": 46.984924623115575, | |
| "step": 9350 | |
| }, | |
| { | |
| "eval_loss": 0.3425142168998718, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.372, | |
| "eval_samples_per_second": 577.988, | |
| "eval_steps_per_second": 18.222, | |
| "epoch": 47.0, | |
| "step": 9353 | |
| }, | |
| { | |
| "loss": 0.1545, | |
| "grad_norm": 13.375, | |
| "learning_rate": 1.8624689457513945e-07, | |
| "epoch": 47.23618090452261, | |
| "step": 9400 | |
| }, | |
| { | |
| "loss": 0.1768, | |
| "grad_norm": 11.125, | |
| "learning_rate": 1.54062066714864e-07, | |
| "epoch": 47.48743718592965, | |
| "step": 9450 | |
| }, | |
| { | |
| "loss": 0.1526, | |
| "grad_norm": 3.765625, | |
| "learning_rate": 1.2490662428135569e-07, | |
| "epoch": 47.73869346733668, | |
| "step": 9500 | |
| }, | |
| { | |
| "loss": 0.179, | |
| "grad_norm": 20.0, | |
| "learning_rate": 9.87895377833692e-08, | |
| "epoch": 47.98994974874372, | |
| "step": 9550 | |
| }, | |
| { | |
| "eval_loss": 0.3430207669734955, | |
| "eval_accuracy": 0.8827238335435057, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8628805718895952, | |
| "eval_kappa": 0.8480078975136847, | |
| "eval_runtime": 1.3929, | |
| "eval_samples_per_second": 569.323, | |
| "eval_steps_per_second": 17.948, | |
| "epoch": 48.0, | |
| "step": 9552 | |
| }, | |
| { | |
| "loss": 0.1604, | |
| "grad_norm": 10.875, | |
| "learning_rate": 7.571884289224174e-08, | |
| "epoch": 48.24120603015076, | |
| "step": 9600 | |
| }, | |
| { | |
| "loss": 0.1837, | |
| "grad_norm": 33.0, | |
| "learning_rate": 5.5701637969486355e-08, | |
| "epoch": 48.49246231155779, | |
| "step": 9650 | |
| }, | |
| { | |
| "loss": 0.1591, | |
| "grad_norm": 5.5625, | |
| "learning_rate": 3.87440818827789e-08, | |
| "epoch": 48.743718592964825, | |
| "step": 9700 | |
| }, | |
| { | |
| "loss": 0.178, | |
| "grad_norm": 10.5, | |
| "learning_rate": 2.4851392111004956e-08, | |
| "epoch": 48.994974874371856, | |
| "step": 9750 | |
| }, | |
| { | |
| "eval_loss": 0.34273195266723633, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.438, | |
| "eval_samples_per_second": 551.459, | |
| "eval_steps_per_second": 17.385, | |
| "epoch": 49.0, | |
| "step": 9751 | |
| }, | |
| { | |
| "loss": 0.1834, | |
| "grad_norm": 11.5, | |
| "learning_rate": 1.4027843138954001e-08, | |
| "epoch": 49.246231155778894, | |
| "step": 9800 | |
| }, | |
| { | |
| "loss": 0.18, | |
| "grad_norm": 14.6875, | |
| "learning_rate": 6.276765142152475e-09, | |
| "epoch": 49.49748743718593, | |
| "step": 9850 | |
| }, | |
| { | |
| "loss": 0.1612, | |
| "grad_norm": 10.125, | |
| "learning_rate": 1.6005429622334423e-09, | |
| "epoch": 49.74874371859296, | |
| "step": 9900 | |
| }, | |
| { | |
| "loss": 0.1675, | |
| "grad_norm": 24.5, | |
| "learning_rate": 6.153731813007824e-13, | |
| "epoch": 50.0, | |
| "step": 9950 | |
| }, | |
| { | |
| "eval_loss": 0.34301358461380005, | |
| "eval_accuracy": 0.8839848675914249, | |
| "eval_top3": 0.9899117276166457, | |
| "eval_macro_f1": 0.8640505019325028, | |
| "eval_kappa": 0.8496288952600413, | |
| "eval_runtime": 1.334, | |
| "eval_samples_per_second": 594.454, | |
| "eval_steps_per_second": 18.741, | |
| "epoch": 50.0, | |
| "step": 9950 | |
| }, | |
| { | |
| "train_runtime": 1027.9074, | |
| "train_samples_per_second": 154.197, | |
| "train_steps_per_second": 9.68, | |
| "total_flos": 1.2418210759836672e+19, | |
| "train_loss": 0.335881779062089, | |
| "epoch": 50.0, | |
| "step": 9950 | |
| } | |
| ] |