{ "best_global_step": 26970, "best_metric": 0.7815828323364258, "best_model_checkpoint": "emotion_stress_model_balanced/checkpoint-26970", "epoch": 15.0, "eval_steps": 500, "global_step": 26970, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.27808676307007785, "grad_norm": 1.7513720989227295, "learning_rate": 2.949962852897474e-06, "loss": 2.0324, "step": 500 }, { "epoch": 0.5561735261401557, "grad_norm": 1.5362915992736816, "learning_rate": 2.89424219910847e-06, "loss": 1.9445, "step": 1000 }, { "epoch": 0.8342602892102335, "grad_norm": 1.602758526802063, "learning_rate": 2.838521545319465e-06, "loss": 1.864, "step": 1500 }, { "epoch": 1.0, "eval_loss": 1.7139734029769897, "eval_runtime": 46.8601, "eval_samples_per_second": 801.705, "eval_steps_per_second": 100.213, "step": 1798 }, { "epoch": 1.1123470522803114, "grad_norm": 1.359454870223999, "learning_rate": 2.782800891530461e-06, "loss": 1.7878, "step": 2000 }, { "epoch": 1.3904338153503892, "grad_norm": 1.6392908096313477, "learning_rate": 2.727080237741456e-06, "loss": 1.7208, "step": 2500 }, { "epoch": 1.668520578420467, "grad_norm": 1.5447863340377808, "learning_rate": 2.6713595839524517e-06, "loss": 1.6523, "step": 3000 }, { "epoch": 1.946607341490545, "grad_norm": 1.3621774911880493, "learning_rate": 2.6156389301634473e-06, "loss": 1.5958, "step": 3500 }, { "epoch": 2.0, "eval_loss": 1.4455991983413696, "eval_runtime": 21.1788, "eval_samples_per_second": 1773.853, "eval_steps_per_second": 221.732, "step": 3596 }, { "epoch": 2.2246941045606228, "grad_norm": 1.2821935415267944, "learning_rate": 2.559918276374443e-06, "loss": 1.5441, "step": 4000 }, { "epoch": 2.5027808676307006, "grad_norm": 1.2539781332015991, "learning_rate": 2.5041976225854384e-06, "loss": 1.4902, "step": 4500 }, { "epoch": 2.7808676307007785, "grad_norm": 1.247044324874878, "learning_rate": 2.448476968796434e-06, "loss": 1.4496, "step": 5000 }, { "epoch": 3.0, "eval_loss": 1.2488250732421875, "eval_runtime": 21.3725, "eval_samples_per_second": 1757.774, "eval_steps_per_second": 219.722, "step": 5394 }, { "epoch": 3.0589543937708563, "grad_norm": 1.122979998588562, "learning_rate": 2.3927563150074296e-06, "loss": 1.4087, "step": 5500 }, { "epoch": 3.337041156840934, "grad_norm": 1.197558045387268, "learning_rate": 2.337035661218425e-06, "loss": 1.3679, "step": 6000 }, { "epoch": 3.6151279199110125, "grad_norm": 1.2191081047058105, "learning_rate": 2.2813150074294203e-06, "loss": 1.3373, "step": 6500 }, { "epoch": 3.89321468298109, "grad_norm": 1.0837751626968384, "learning_rate": 2.2255943536404163e-06, "loss": 1.3151, "step": 7000 }, { "epoch": 4.0, "eval_loss": 1.1083296537399292, "eval_runtime": 21.3785, "eval_samples_per_second": 1757.28, "eval_steps_per_second": 219.66, "step": 7192 }, { "epoch": 4.171301446051168, "grad_norm": 1.2327854633331299, "learning_rate": 2.1698736998514114e-06, "loss": 1.2756, "step": 7500 }, { "epoch": 4.4493882091212456, "grad_norm": 1.0573621988296509, "learning_rate": 2.1141530460624074e-06, "loss": 1.2522, "step": 8000 }, { "epoch": 4.727474972191324, "grad_norm": 1.0322808027267456, "learning_rate": 2.0584323922734026e-06, "loss": 1.2318, "step": 8500 }, { "epoch": 5.0, "eval_loss": 1.0092095136642456, "eval_runtime": 21.2558, "eval_samples_per_second": 1767.427, "eval_steps_per_second": 220.928, "step": 8990 }, { "epoch": 5.005561735261401, "grad_norm": 0.9742701649665833, "learning_rate": 2.002711738484398e-06, "loss": 1.2109, "step": 9000 }, { "epoch": 5.2836484983314795, "grad_norm": 0.923886239528656, "learning_rate": 1.9469910846953937e-06, "loss": 1.1863, "step": 9500 }, { "epoch": 5.561735261401557, "grad_norm": 0.8879143595695496, "learning_rate": 1.8912704309063893e-06, "loss": 1.1806, "step": 10000 }, { "epoch": 5.839822024471635, "grad_norm": 1.0213676691055298, "learning_rate": 1.835549777117385e-06, "loss": 1.1754, "step": 10500 }, { "epoch": 6.0, "eval_loss": 0.9406551122665405, "eval_runtime": 21.4277, "eval_samples_per_second": 1753.245, "eval_steps_per_second": 219.156, "step": 10788 }, { "epoch": 6.117908787541713, "grad_norm": 1.061405897140503, "learning_rate": 1.7798291233283805e-06, "loss": 1.1517, "step": 11000 }, { "epoch": 6.395995550611791, "grad_norm": 0.8349337577819824, "learning_rate": 1.7241084695393758e-06, "loss": 1.1448, "step": 11500 }, { "epoch": 6.674082313681868, "grad_norm": 1.023738980293274, "learning_rate": 1.6683878157503716e-06, "loss": 1.1415, "step": 12000 }, { "epoch": 6.952169076751947, "grad_norm": 0.9870001673698425, "learning_rate": 1.612667161961367e-06, "loss": 1.1213, "step": 12500 }, { "epoch": 7.0, "eval_loss": 0.8925299048423767, "eval_runtime": 21.5166, "eval_samples_per_second": 1745.999, "eval_steps_per_second": 218.25, "step": 12586 }, { "epoch": 7.230255839822025, "grad_norm": 1.0453287363052368, "learning_rate": 1.5569465081723627e-06, "loss": 1.1173, "step": 13000 }, { "epoch": 7.508342602892102, "grad_norm": 0.8402040004730225, "learning_rate": 1.5012258543833581e-06, "loss": 1.1053, "step": 13500 }, { "epoch": 7.78642936596218, "grad_norm": 0.9418850541114807, "learning_rate": 1.4455052005943537e-06, "loss": 1.1068, "step": 14000 }, { "epoch": 8.0, "eval_loss": 0.8576251268386841, "eval_runtime": 21.4862, "eval_samples_per_second": 1748.467, "eval_steps_per_second": 218.558, "step": 14384 }, { "epoch": 8.064516129032258, "grad_norm": 0.9174266457557678, "learning_rate": 1.3897845468053493e-06, "loss": 1.0912, "step": 14500 }, { "epoch": 8.342602892102336, "grad_norm": 0.8031694889068604, "learning_rate": 1.3340638930163446e-06, "loss": 1.0819, "step": 15000 }, { "epoch": 8.620689655172415, "grad_norm": 0.8880692720413208, "learning_rate": 1.2783432392273402e-06, "loss": 1.0889, "step": 15500 }, { "epoch": 8.898776418242491, "grad_norm": 0.8549273014068604, "learning_rate": 1.2226225854383358e-06, "loss": 1.0765, "step": 16000 }, { "epoch": 9.0, "eval_loss": 0.8325429558753967, "eval_runtime": 21.4809, "eval_samples_per_second": 1748.903, "eval_steps_per_second": 218.613, "step": 16182 }, { "epoch": 9.17686318131257, "grad_norm": 0.7732747197151184, "learning_rate": 1.1669019316493313e-06, "loss": 1.0792, "step": 16500 }, { "epoch": 9.454949944382648, "grad_norm": 0.8062688112258911, "learning_rate": 1.111181277860327e-06, "loss": 1.0736, "step": 17000 }, { "epoch": 9.733036707452726, "grad_norm": 0.873096227645874, "learning_rate": 1.0554606240713225e-06, "loss": 1.0707, "step": 17500 }, { "epoch": 10.0, "eval_loss": 0.8145096302032471, "eval_runtime": 21.1956, "eval_samples_per_second": 1772.441, "eval_steps_per_second": 221.555, "step": 17980 }, { "epoch": 10.011123470522802, "grad_norm": 0.7561053037643433, "learning_rate": 9.997399702823179e-07, "loss": 1.0761, "step": 18000 }, { "epoch": 10.28921023359288, "grad_norm": 0.770944356918335, "learning_rate": 9.440193164933135e-07, "loss": 1.0601, "step": 18500 }, { "epoch": 10.567296996662959, "grad_norm": 0.8369573354721069, "learning_rate": 8.882986627043091e-07, "loss": 1.0777, "step": 19000 }, { "epoch": 10.845383759733037, "grad_norm": 0.9367430210113525, "learning_rate": 8.325780089153047e-07, "loss": 1.0635, "step": 19500 }, { "epoch": 11.0, "eval_loss": 0.8015358448028564, "eval_runtime": 21.488, "eval_samples_per_second": 1748.322, "eval_steps_per_second": 218.54, "step": 19778 }, { "epoch": 11.123470522803114, "grad_norm": 0.765078604221344, "learning_rate": 7.768573551263003e-07, "loss": 1.0579, "step": 20000 }, { "epoch": 11.401557285873192, "grad_norm": 0.7660267949104309, "learning_rate": 7.211367013372957e-07, "loss": 1.0598, "step": 20500 }, { "epoch": 11.67964404894327, "grad_norm": 0.8136441111564636, "learning_rate": 6.654160475482912e-07, "loss": 1.0427, "step": 21000 }, { "epoch": 11.957730812013349, "grad_norm": 0.7501266598701477, "learning_rate": 6.096953937592868e-07, "loss": 1.0626, "step": 21500 }, { "epoch": 12.0, "eval_loss": 0.7923984527587891, "eval_runtime": 21.5573, "eval_samples_per_second": 1742.708, "eval_steps_per_second": 217.839, "step": 21576 }, { "epoch": 12.235817575083425, "grad_norm": 0.895750105381012, "learning_rate": 5.539747399702823e-07, "loss": 1.054, "step": 22000 }, { "epoch": 12.513904338153504, "grad_norm": 0.9563328623771667, "learning_rate": 4.982540861812778e-07, "loss": 1.0396, "step": 22500 }, { "epoch": 12.791991101223582, "grad_norm": 0.8842599391937256, "learning_rate": 4.4253343239227344e-07, "loss": 1.0475, "step": 23000 }, { "epoch": 13.0, "eval_loss": 0.786158561706543, "eval_runtime": 21.3873, "eval_samples_per_second": 1756.555, "eval_steps_per_second": 219.569, "step": 23374 }, { "epoch": 13.07007786429366, "grad_norm": 0.6965476870536804, "learning_rate": 3.86812778603269e-07, "loss": 1.0429, "step": 23500 }, { "epoch": 13.348164627363737, "grad_norm": 0.9398712515830994, "learning_rate": 3.310921248142645e-07, "loss": 1.0404, "step": 24000 }, { "epoch": 13.626251390433815, "grad_norm": 0.9795758128166199, "learning_rate": 2.7537147102526e-07, "loss": 1.0469, "step": 24500 }, { "epoch": 13.904338153503893, "grad_norm": 0.8730781674385071, "learning_rate": 2.1965081723625558e-07, "loss": 1.0361, "step": 25000 }, { "epoch": 14.0, "eval_loss": 0.7827068567276001, "eval_runtime": 21.4998, "eval_samples_per_second": 1747.363, "eval_steps_per_second": 218.42, "step": 25172 }, { "epoch": 14.182424916573972, "grad_norm": 0.9993116855621338, "learning_rate": 1.6393016344725113e-07, "loss": 1.0525, "step": 25500 }, { "epoch": 14.46051167964405, "grad_norm": 0.9638302326202393, "learning_rate": 1.0820950965824665e-07, "loss": 1.05, "step": 26000 }, { "epoch": 14.738598442714126, "grad_norm": 0.8064911961555481, "learning_rate": 5.24888558692422e-08, "loss": 1.0457, "step": 26500 }, { "epoch": 15.0, "eval_loss": 0.7815828323364258, "eval_runtime": 21.1724, "eval_samples_per_second": 1774.387, "eval_steps_per_second": 221.798, "step": 26970 } ], "logging_steps": 500, "max_steps": 26970, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6.687298365324853e+19, "train_batch_size": 32, "trial_name": null, "trial_params": null }