{ "best_global_step": 1000, "best_metric": 0.2766864597797394, "best_model_checkpoint": "/data/model_checkpoints/checkpoint-1000", "epoch": 0.8942544153811759, "eval_steps": 100, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0447127207690588, "grad_norm": 203.0, "learning_rate": 2.1894548704200177e-06, "loss": 6.45140380859375, "step": 50 }, { "epoch": 0.0894254415381176, "grad_norm": 62.5, "learning_rate": 4.423592493297587e-06, "loss": 2.8122402954101564, "step": 100 }, { "epoch": 0.0894254415381176, "eval_loss": 1.1310627460479736, "eval_runtime": 30.6359, "eval_samples_per_second": 32.478, "eval_steps_per_second": 16.255, "step": 100 }, { "epoch": 0.1341381623071764, "grad_norm": 67.0, "learning_rate": 6.6577301161751565e-06, "loss": 0.8708096313476562, "step": 150 }, { "epoch": 0.1788508830762352, "grad_norm": 56.75, "learning_rate": 8.891867739052725e-06, "loss": 0.5381386947631835, "step": 200 }, { "epoch": 0.1788508830762352, "eval_loss": 0.4545099437236786, "eval_runtime": 30.5557, "eval_samples_per_second": 32.564, "eval_steps_per_second": 16.298, "step": 200 }, { "epoch": 0.22356360384529397, "grad_norm": 50.75, "learning_rate": 1.1126005361930296e-05, "loss": 0.41018287658691405, "step": 250 }, { "epoch": 0.2682763246143528, "grad_norm": 42.0, "learning_rate": 1.3360142984807863e-05, "loss": 0.3585561370849609, "step": 300 }, { "epoch": 0.2682763246143528, "eval_loss": 0.3562505543231964, "eval_runtime": 30.6312, "eval_samples_per_second": 32.483, "eval_steps_per_second": 16.258, "step": 300 }, { "epoch": 0.3129890453834116, "grad_norm": 37.75, "learning_rate": 1.5594280607685434e-05, "loss": 0.3467108154296875, "step": 350 }, { "epoch": 0.3577017661524704, "grad_norm": 25.25, "learning_rate": 1.7828418230563005e-05, "loss": 0.33910282135009767, "step": 400 }, { "epoch": 0.3577017661524704, "eval_loss": 0.3491951823234558, "eval_runtime": 30.5449, "eval_samples_per_second": 32.575, "eval_steps_per_second": 16.304, "step": 400 }, { "epoch": 0.4024144869215292, "grad_norm": 30.25, "learning_rate": 2.0062555853440572e-05, "loss": 0.35506061553955076, "step": 450 }, { "epoch": 0.44712720769058795, "grad_norm": 41.0, "learning_rate": 2.2296693476318143e-05, "loss": 0.3203820037841797, "step": 500 }, { "epoch": 0.44712720769058795, "eval_loss": 0.33218100666999817, "eval_runtime": 30.4848, "eval_samples_per_second": 32.639, "eval_steps_per_second": 16.336, "step": 500 }, { "epoch": 0.49183992845964675, "grad_norm": 23.625, "learning_rate": 2.453083109919571e-05, "loss": 0.30755191802978515, "step": 550 }, { "epoch": 0.5365526492287056, "grad_norm": 20.5, "learning_rate": 2.676496872207328e-05, "loss": 0.30894683837890624, "step": 600 }, { "epoch": 0.5365526492287056, "eval_loss": 0.30529576539993286, "eval_runtime": 30.4934, "eval_samples_per_second": 32.63, "eval_steps_per_second": 16.331, "step": 600 }, { "epoch": 0.5812653699977643, "grad_norm": 31.125, "learning_rate": 2.899910634495085e-05, "loss": 0.30126373291015623, "step": 650 }, { "epoch": 0.6259780907668232, "grad_norm": 20.0, "learning_rate": 3.123324396782842e-05, "loss": 0.34950965881347656, "step": 700 }, { "epoch": 0.6259780907668232, "eval_loss": 0.3235093951225281, "eval_runtime": 30.5199, "eval_samples_per_second": 32.602, "eval_steps_per_second": 16.317, "step": 700 }, { "epoch": 0.670690811535882, "grad_norm": 18.125, "learning_rate": 3.346738159070599e-05, "loss": 0.31941865921020507, "step": 750 }, { "epoch": 0.7154035323049408, "grad_norm": 21.75, "learning_rate": 3.5701519213583554e-05, "loss": 0.2860032844543457, "step": 800 }, { "epoch": 0.7154035323049408, "eval_loss": 0.27899640798568726, "eval_runtime": 30.3648, "eval_samples_per_second": 32.768, "eval_steps_per_second": 16.401, "step": 800 }, { "epoch": 0.7601162530739995, "grad_norm": 11.625, "learning_rate": 3.7935656836461125e-05, "loss": 0.2760417366027832, "step": 850 }, { "epoch": 0.8048289738430584, "grad_norm": 17.25, "learning_rate": 4.01697944593387e-05, "loss": 0.24729475021362304, "step": 900 }, { "epoch": 0.8048289738430584, "eval_loss": 0.29079964756965637, "eval_runtime": 30.3913, "eval_samples_per_second": 32.74, "eval_steps_per_second": 16.386, "step": 900 }, { "epoch": 0.8495416946121171, "grad_norm": 15.6875, "learning_rate": 4.240393208221627e-05, "loss": 0.2624860382080078, "step": 950 }, { "epoch": 0.8942544153811759, "grad_norm": 42.75, "learning_rate": 4.463806970509384e-05, "loss": 0.27374263763427736, "step": 1000 }, { "epoch": 0.8942544153811759, "eval_loss": 0.2766864597797394, "eval_runtime": 30.3793, "eval_samples_per_second": 32.753, "eval_steps_per_second": 16.393, "step": 1000 } ], "logging_steps": 50, "max_steps": 11190, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.980791074558669e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }