| { |
| "best_global_step": 1000, |
| "best_metric": 0.2766864597797394, |
| "best_model_checkpoint": "/data/model_checkpoints/checkpoint-1000", |
| "epoch": 0.8942544153811759, |
| "eval_steps": 100, |
| "global_step": 1000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.0447127207690588, |
| "grad_norm": 203.0, |
| "learning_rate": 2.1894548704200177e-06, |
| "loss": 6.45140380859375, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.0894254415381176, |
| "grad_norm": 62.5, |
| "learning_rate": 4.423592493297587e-06, |
| "loss": 2.8122402954101564, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.0894254415381176, |
| "eval_loss": 1.1310627460479736, |
| "eval_runtime": 30.6359, |
| "eval_samples_per_second": 32.478, |
| "eval_steps_per_second": 16.255, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.1341381623071764, |
| "grad_norm": 67.0, |
| "learning_rate": 6.6577301161751565e-06, |
| "loss": 0.8708096313476562, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.1788508830762352, |
| "grad_norm": 56.75, |
| "learning_rate": 8.891867739052725e-06, |
| "loss": 0.5381386947631835, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.1788508830762352, |
| "eval_loss": 0.4545099437236786, |
| "eval_runtime": 30.5557, |
| "eval_samples_per_second": 32.564, |
| "eval_steps_per_second": 16.298, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.22356360384529397, |
| "grad_norm": 50.75, |
| "learning_rate": 1.1126005361930296e-05, |
| "loss": 0.41018287658691405, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.2682763246143528, |
| "grad_norm": 42.0, |
| "learning_rate": 1.3360142984807863e-05, |
| "loss": 0.3585561370849609, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.2682763246143528, |
| "eval_loss": 0.3562505543231964, |
| "eval_runtime": 30.6312, |
| "eval_samples_per_second": 32.483, |
| "eval_steps_per_second": 16.258, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.3129890453834116, |
| "grad_norm": 37.75, |
| "learning_rate": 1.5594280607685434e-05, |
| "loss": 0.3467108154296875, |
| "step": 350 |
| }, |
| { |
| "epoch": 0.3577017661524704, |
| "grad_norm": 25.25, |
| "learning_rate": 1.7828418230563005e-05, |
| "loss": 0.33910282135009767, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.3577017661524704, |
| "eval_loss": 0.3491951823234558, |
| "eval_runtime": 30.5449, |
| "eval_samples_per_second": 32.575, |
| "eval_steps_per_second": 16.304, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.4024144869215292, |
| "grad_norm": 30.25, |
| "learning_rate": 2.0062555853440572e-05, |
| "loss": 0.35506061553955076, |
| "step": 450 |
| }, |
| { |
| "epoch": 0.44712720769058795, |
| "grad_norm": 41.0, |
| "learning_rate": 2.2296693476318143e-05, |
| "loss": 0.3203820037841797, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.44712720769058795, |
| "eval_loss": 0.33218100666999817, |
| "eval_runtime": 30.4848, |
| "eval_samples_per_second": 32.639, |
| "eval_steps_per_second": 16.336, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.49183992845964675, |
| "grad_norm": 23.625, |
| "learning_rate": 2.453083109919571e-05, |
| "loss": 0.30755191802978515, |
| "step": 550 |
| }, |
| { |
| "epoch": 0.5365526492287056, |
| "grad_norm": 20.5, |
| "learning_rate": 2.676496872207328e-05, |
| "loss": 0.30894683837890624, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.5365526492287056, |
| "eval_loss": 0.30529576539993286, |
| "eval_runtime": 30.4934, |
| "eval_samples_per_second": 32.63, |
| "eval_steps_per_second": 16.331, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.5812653699977643, |
| "grad_norm": 31.125, |
| "learning_rate": 2.899910634495085e-05, |
| "loss": 0.30126373291015623, |
| "step": 650 |
| }, |
| { |
| "epoch": 0.6259780907668232, |
| "grad_norm": 20.0, |
| "learning_rate": 3.123324396782842e-05, |
| "loss": 0.34950965881347656, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.6259780907668232, |
| "eval_loss": 0.3235093951225281, |
| "eval_runtime": 30.5199, |
| "eval_samples_per_second": 32.602, |
| "eval_steps_per_second": 16.317, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.670690811535882, |
| "grad_norm": 18.125, |
| "learning_rate": 3.346738159070599e-05, |
| "loss": 0.31941865921020507, |
| "step": 750 |
| }, |
| { |
| "epoch": 0.7154035323049408, |
| "grad_norm": 21.75, |
| "learning_rate": 3.5701519213583554e-05, |
| "loss": 0.2860032844543457, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.7154035323049408, |
| "eval_loss": 0.27899640798568726, |
| "eval_runtime": 30.3648, |
| "eval_samples_per_second": 32.768, |
| "eval_steps_per_second": 16.401, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.7601162530739995, |
| "grad_norm": 11.625, |
| "learning_rate": 3.7935656836461125e-05, |
| "loss": 0.2760417366027832, |
| "step": 850 |
| }, |
| { |
| "epoch": 0.8048289738430584, |
| "grad_norm": 17.25, |
| "learning_rate": 4.01697944593387e-05, |
| "loss": 0.24729475021362304, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.8048289738430584, |
| "eval_loss": 0.29079964756965637, |
| "eval_runtime": 30.3913, |
| "eval_samples_per_second": 32.74, |
| "eval_steps_per_second": 16.386, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.8495416946121171, |
| "grad_norm": 15.6875, |
| "learning_rate": 4.240393208221627e-05, |
| "loss": 0.2624860382080078, |
| "step": 950 |
| }, |
| { |
| "epoch": 0.8942544153811759, |
| "grad_norm": 42.75, |
| "learning_rate": 4.463806970509384e-05, |
| "loss": 0.27374263763427736, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.8942544153811759, |
| "eval_loss": 0.2766864597797394, |
| "eval_runtime": 30.3793, |
| "eval_samples_per_second": 32.753, |
| "eval_steps_per_second": 16.393, |
| "step": 1000 |
| } |
| ], |
| "logging_steps": 50, |
| "max_steps": 11190, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 10, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.980791074558669e+16, |
| "train_batch_size": 2, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|