| { |
| "best_global_step": 26970, |
| "best_metric": 0.7815828323364258, |
| "best_model_checkpoint": "emotion_stress_model_balanced/checkpoint-26970", |
| "epoch": 15.0, |
| "eval_steps": 500, |
| "global_step": 26970, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.27808676307007785, |
| "grad_norm": 1.7513720989227295, |
| "learning_rate": 2.949962852897474e-06, |
| "loss": 2.0324, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.5561735261401557, |
| "grad_norm": 1.5362915992736816, |
| "learning_rate": 2.89424219910847e-06, |
| "loss": 1.9445, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.8342602892102335, |
| "grad_norm": 1.602758526802063, |
| "learning_rate": 2.838521545319465e-06, |
| "loss": 1.864, |
| "step": 1500 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_loss": 1.7139734029769897, |
| "eval_runtime": 46.8601, |
| "eval_samples_per_second": 801.705, |
| "eval_steps_per_second": 100.213, |
| "step": 1798 |
| }, |
| { |
| "epoch": 1.1123470522803114, |
| "grad_norm": 1.359454870223999, |
| "learning_rate": 2.782800891530461e-06, |
| "loss": 1.7878, |
| "step": 2000 |
| }, |
| { |
| "epoch": 1.3904338153503892, |
| "grad_norm": 1.6392908096313477, |
| "learning_rate": 2.727080237741456e-06, |
| "loss": 1.7208, |
| "step": 2500 |
| }, |
| { |
| "epoch": 1.668520578420467, |
| "grad_norm": 1.5447863340377808, |
| "learning_rate": 2.6713595839524517e-06, |
| "loss": 1.6523, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.946607341490545, |
| "grad_norm": 1.3621774911880493, |
| "learning_rate": 2.6156389301634473e-06, |
| "loss": 1.5958, |
| "step": 3500 |
| }, |
| { |
| "epoch": 2.0, |
| "eval_loss": 1.4455991983413696, |
| "eval_runtime": 21.1788, |
| "eval_samples_per_second": 1773.853, |
| "eval_steps_per_second": 221.732, |
| "step": 3596 |
| }, |
| { |
| "epoch": 2.2246941045606228, |
| "grad_norm": 1.2821935415267944, |
| "learning_rate": 2.559918276374443e-06, |
| "loss": 1.5441, |
| "step": 4000 |
| }, |
| { |
| "epoch": 2.5027808676307006, |
| "grad_norm": 1.2539781332015991, |
| "learning_rate": 2.5041976225854384e-06, |
| "loss": 1.4902, |
| "step": 4500 |
| }, |
| { |
| "epoch": 2.7808676307007785, |
| "grad_norm": 1.247044324874878, |
| "learning_rate": 2.448476968796434e-06, |
| "loss": 1.4496, |
| "step": 5000 |
| }, |
| { |
| "epoch": 3.0, |
| "eval_loss": 1.2488250732421875, |
| "eval_runtime": 21.3725, |
| "eval_samples_per_second": 1757.774, |
| "eval_steps_per_second": 219.722, |
| "step": 5394 |
| }, |
| { |
| "epoch": 3.0589543937708563, |
| "grad_norm": 1.122979998588562, |
| "learning_rate": 2.3927563150074296e-06, |
| "loss": 1.4087, |
| "step": 5500 |
| }, |
| { |
| "epoch": 3.337041156840934, |
| "grad_norm": 1.197558045387268, |
| "learning_rate": 2.337035661218425e-06, |
| "loss": 1.3679, |
| "step": 6000 |
| }, |
| { |
| "epoch": 3.6151279199110125, |
| "grad_norm": 1.2191081047058105, |
| "learning_rate": 2.2813150074294203e-06, |
| "loss": 1.3373, |
| "step": 6500 |
| }, |
| { |
| "epoch": 3.89321468298109, |
| "grad_norm": 1.0837751626968384, |
| "learning_rate": 2.2255943536404163e-06, |
| "loss": 1.3151, |
| "step": 7000 |
| }, |
| { |
| "epoch": 4.0, |
| "eval_loss": 1.1083296537399292, |
| "eval_runtime": 21.3785, |
| "eval_samples_per_second": 1757.28, |
| "eval_steps_per_second": 219.66, |
| "step": 7192 |
| }, |
| { |
| "epoch": 4.171301446051168, |
| "grad_norm": 1.2327854633331299, |
| "learning_rate": 2.1698736998514114e-06, |
| "loss": 1.2756, |
| "step": 7500 |
| }, |
| { |
| "epoch": 4.4493882091212456, |
| "grad_norm": 1.0573621988296509, |
| "learning_rate": 2.1141530460624074e-06, |
| "loss": 1.2522, |
| "step": 8000 |
| }, |
| { |
| "epoch": 4.727474972191324, |
| "grad_norm": 1.0322808027267456, |
| "learning_rate": 2.0584323922734026e-06, |
| "loss": 1.2318, |
| "step": 8500 |
| }, |
| { |
| "epoch": 5.0, |
| "eval_loss": 1.0092095136642456, |
| "eval_runtime": 21.2558, |
| "eval_samples_per_second": 1767.427, |
| "eval_steps_per_second": 220.928, |
| "step": 8990 |
| }, |
| { |
| "epoch": 5.005561735261401, |
| "grad_norm": 0.9742701649665833, |
| "learning_rate": 2.002711738484398e-06, |
| "loss": 1.2109, |
| "step": 9000 |
| }, |
| { |
| "epoch": 5.2836484983314795, |
| "grad_norm": 0.923886239528656, |
| "learning_rate": 1.9469910846953937e-06, |
| "loss": 1.1863, |
| "step": 9500 |
| }, |
| { |
| "epoch": 5.561735261401557, |
| "grad_norm": 0.8879143595695496, |
| "learning_rate": 1.8912704309063893e-06, |
| "loss": 1.1806, |
| "step": 10000 |
| }, |
| { |
| "epoch": 5.839822024471635, |
| "grad_norm": 1.0213676691055298, |
| "learning_rate": 1.835549777117385e-06, |
| "loss": 1.1754, |
| "step": 10500 |
| }, |
| { |
| "epoch": 6.0, |
| "eval_loss": 0.9406551122665405, |
| "eval_runtime": 21.4277, |
| "eval_samples_per_second": 1753.245, |
| "eval_steps_per_second": 219.156, |
| "step": 10788 |
| }, |
| { |
| "epoch": 6.117908787541713, |
| "grad_norm": 1.061405897140503, |
| "learning_rate": 1.7798291233283805e-06, |
| "loss": 1.1517, |
| "step": 11000 |
| }, |
| { |
| "epoch": 6.395995550611791, |
| "grad_norm": 0.8349337577819824, |
| "learning_rate": 1.7241084695393758e-06, |
| "loss": 1.1448, |
| "step": 11500 |
| }, |
| { |
| "epoch": 6.674082313681868, |
| "grad_norm": 1.023738980293274, |
| "learning_rate": 1.6683878157503716e-06, |
| "loss": 1.1415, |
| "step": 12000 |
| }, |
| { |
| "epoch": 6.952169076751947, |
| "grad_norm": 0.9870001673698425, |
| "learning_rate": 1.612667161961367e-06, |
| "loss": 1.1213, |
| "step": 12500 |
| }, |
| { |
| "epoch": 7.0, |
| "eval_loss": 0.8925299048423767, |
| "eval_runtime": 21.5166, |
| "eval_samples_per_second": 1745.999, |
| "eval_steps_per_second": 218.25, |
| "step": 12586 |
| }, |
| { |
| "epoch": 7.230255839822025, |
| "grad_norm": 1.0453287363052368, |
| "learning_rate": 1.5569465081723627e-06, |
| "loss": 1.1173, |
| "step": 13000 |
| }, |
| { |
| "epoch": 7.508342602892102, |
| "grad_norm": 0.8402040004730225, |
| "learning_rate": 1.5012258543833581e-06, |
| "loss": 1.1053, |
| "step": 13500 |
| }, |
| { |
| "epoch": 7.78642936596218, |
| "grad_norm": 0.9418850541114807, |
| "learning_rate": 1.4455052005943537e-06, |
| "loss": 1.1068, |
| "step": 14000 |
| }, |
| { |
| "epoch": 8.0, |
| "eval_loss": 0.8576251268386841, |
| "eval_runtime": 21.4862, |
| "eval_samples_per_second": 1748.467, |
| "eval_steps_per_second": 218.558, |
| "step": 14384 |
| }, |
| { |
| "epoch": 8.064516129032258, |
| "grad_norm": 0.9174266457557678, |
| "learning_rate": 1.3897845468053493e-06, |
| "loss": 1.0912, |
| "step": 14500 |
| }, |
| { |
| "epoch": 8.342602892102336, |
| "grad_norm": 0.8031694889068604, |
| "learning_rate": 1.3340638930163446e-06, |
| "loss": 1.0819, |
| "step": 15000 |
| }, |
| { |
| "epoch": 8.620689655172415, |
| "grad_norm": 0.8880692720413208, |
| "learning_rate": 1.2783432392273402e-06, |
| "loss": 1.0889, |
| "step": 15500 |
| }, |
| { |
| "epoch": 8.898776418242491, |
| "grad_norm": 0.8549273014068604, |
| "learning_rate": 1.2226225854383358e-06, |
| "loss": 1.0765, |
| "step": 16000 |
| }, |
| { |
| "epoch": 9.0, |
| "eval_loss": 0.8325429558753967, |
| "eval_runtime": 21.4809, |
| "eval_samples_per_second": 1748.903, |
| "eval_steps_per_second": 218.613, |
| "step": 16182 |
| }, |
| { |
| "epoch": 9.17686318131257, |
| "grad_norm": 0.7732747197151184, |
| "learning_rate": 1.1669019316493313e-06, |
| "loss": 1.0792, |
| "step": 16500 |
| }, |
| { |
| "epoch": 9.454949944382648, |
| "grad_norm": 0.8062688112258911, |
| "learning_rate": 1.111181277860327e-06, |
| "loss": 1.0736, |
| "step": 17000 |
| }, |
| { |
| "epoch": 9.733036707452726, |
| "grad_norm": 0.873096227645874, |
| "learning_rate": 1.0554606240713225e-06, |
| "loss": 1.0707, |
| "step": 17500 |
| }, |
| { |
| "epoch": 10.0, |
| "eval_loss": 0.8145096302032471, |
| "eval_runtime": 21.1956, |
| "eval_samples_per_second": 1772.441, |
| "eval_steps_per_second": 221.555, |
| "step": 17980 |
| }, |
| { |
| "epoch": 10.011123470522802, |
| "grad_norm": 0.7561053037643433, |
| "learning_rate": 9.997399702823179e-07, |
| "loss": 1.0761, |
| "step": 18000 |
| }, |
| { |
| "epoch": 10.28921023359288, |
| "grad_norm": 0.770944356918335, |
| "learning_rate": 9.440193164933135e-07, |
| "loss": 1.0601, |
| "step": 18500 |
| }, |
| { |
| "epoch": 10.567296996662959, |
| "grad_norm": 0.8369573354721069, |
| "learning_rate": 8.882986627043091e-07, |
| "loss": 1.0777, |
| "step": 19000 |
| }, |
| { |
| "epoch": 10.845383759733037, |
| "grad_norm": 0.9367430210113525, |
| "learning_rate": 8.325780089153047e-07, |
| "loss": 1.0635, |
| "step": 19500 |
| }, |
| { |
| "epoch": 11.0, |
| "eval_loss": 0.8015358448028564, |
| "eval_runtime": 21.488, |
| "eval_samples_per_second": 1748.322, |
| "eval_steps_per_second": 218.54, |
| "step": 19778 |
| }, |
| { |
| "epoch": 11.123470522803114, |
| "grad_norm": 0.765078604221344, |
| "learning_rate": 7.768573551263003e-07, |
| "loss": 1.0579, |
| "step": 20000 |
| }, |
| { |
| "epoch": 11.401557285873192, |
| "grad_norm": 0.7660267949104309, |
| "learning_rate": 7.211367013372957e-07, |
| "loss": 1.0598, |
| "step": 20500 |
| }, |
| { |
| "epoch": 11.67964404894327, |
| "grad_norm": 0.8136441111564636, |
| "learning_rate": 6.654160475482912e-07, |
| "loss": 1.0427, |
| "step": 21000 |
| }, |
| { |
| "epoch": 11.957730812013349, |
| "grad_norm": 0.7501266598701477, |
| "learning_rate": 6.096953937592868e-07, |
| "loss": 1.0626, |
| "step": 21500 |
| }, |
| { |
| "epoch": 12.0, |
| "eval_loss": 0.7923984527587891, |
| "eval_runtime": 21.5573, |
| "eval_samples_per_second": 1742.708, |
| "eval_steps_per_second": 217.839, |
| "step": 21576 |
| }, |
| { |
| "epoch": 12.235817575083425, |
| "grad_norm": 0.895750105381012, |
| "learning_rate": 5.539747399702823e-07, |
| "loss": 1.054, |
| "step": 22000 |
| }, |
| { |
| "epoch": 12.513904338153504, |
| "grad_norm": 0.9563328623771667, |
| "learning_rate": 4.982540861812778e-07, |
| "loss": 1.0396, |
| "step": 22500 |
| }, |
| { |
| "epoch": 12.791991101223582, |
| "grad_norm": 0.8842599391937256, |
| "learning_rate": 4.4253343239227344e-07, |
| "loss": 1.0475, |
| "step": 23000 |
| }, |
| { |
| "epoch": 13.0, |
| "eval_loss": 0.786158561706543, |
| "eval_runtime": 21.3873, |
| "eval_samples_per_second": 1756.555, |
| "eval_steps_per_second": 219.569, |
| "step": 23374 |
| }, |
| { |
| "epoch": 13.07007786429366, |
| "grad_norm": 0.6965476870536804, |
| "learning_rate": 3.86812778603269e-07, |
| "loss": 1.0429, |
| "step": 23500 |
| }, |
| { |
| "epoch": 13.348164627363737, |
| "grad_norm": 0.9398712515830994, |
| "learning_rate": 3.310921248142645e-07, |
| "loss": 1.0404, |
| "step": 24000 |
| }, |
| { |
| "epoch": 13.626251390433815, |
| "grad_norm": 0.9795758128166199, |
| "learning_rate": 2.7537147102526e-07, |
| "loss": 1.0469, |
| "step": 24500 |
| }, |
| { |
| "epoch": 13.904338153503893, |
| "grad_norm": 0.8730781674385071, |
| "learning_rate": 2.1965081723625558e-07, |
| "loss": 1.0361, |
| "step": 25000 |
| }, |
| { |
| "epoch": 14.0, |
| "eval_loss": 0.7827068567276001, |
| "eval_runtime": 21.4998, |
| "eval_samples_per_second": 1747.363, |
| "eval_steps_per_second": 218.42, |
| "step": 25172 |
| }, |
| { |
| "epoch": 14.182424916573972, |
| "grad_norm": 0.9993116855621338, |
| "learning_rate": 1.6393016344725113e-07, |
| "loss": 1.0525, |
| "step": 25500 |
| }, |
| { |
| "epoch": 14.46051167964405, |
| "grad_norm": 0.9638302326202393, |
| "learning_rate": 1.0820950965824665e-07, |
| "loss": 1.05, |
| "step": 26000 |
| }, |
| { |
| "epoch": 14.738598442714126, |
| "grad_norm": 0.8064911961555481, |
| "learning_rate": 5.24888558692422e-08, |
| "loss": 1.0457, |
| "step": 26500 |
| }, |
| { |
| "epoch": 15.0, |
| "eval_loss": 0.7815828323364258, |
| "eval_runtime": 21.1724, |
| "eval_samples_per_second": 1774.387, |
| "eval_steps_per_second": 221.798, |
| "step": 26970 |
| } |
| ], |
| "logging_steps": 500, |
| "max_steps": 26970, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 15, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 6.687298365324853e+19, |
| "train_batch_size": 32, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|