| { |
| "best_global_step": 3000, |
| "best_metric": 1.5481228828430176, |
| "best_model_checkpoint": "./models/checkpoint-3000", |
| "epoch": 3.0, |
| "eval_steps": 500, |
| "global_step": 9405, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.1595150741745095, |
| "grad_norm": 6.21875, |
| "learning_rate": 4.73471557682084e-05, |
| "loss": 1.6533, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.1595150741745095, |
| "eval_loss": 1.670200228691101, |
| "eval_runtime": 1.8707, |
| "eval_samples_per_second": 53.457, |
| "eval_steps_per_second": 13.364, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.319030148349019, |
| "grad_norm": 6.5, |
| "learning_rate": 4.468899521531101e-05, |
| "loss": 1.5746, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.319030148349019, |
| "eval_loss": 1.6311461925506592, |
| "eval_runtime": 1.8699, |
| "eval_samples_per_second": 53.48, |
| "eval_steps_per_second": 13.37, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.4785452225235285, |
| "grad_norm": 6.90625, |
| "learning_rate": 4.203083466241361e-05, |
| "loss": 1.5591, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.4785452225235285, |
| "eval_loss": 1.6131033897399902, |
| "eval_runtime": 1.8703, |
| "eval_samples_per_second": 53.466, |
| "eval_steps_per_second": 13.367, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.638060296698038, |
| "grad_norm": 6.0, |
| "learning_rate": 3.9372674109516216e-05, |
| "loss": 1.5301, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.638060296698038, |
| "eval_loss": 1.582728624343872, |
| "eval_runtime": 1.8741, |
| "eval_samples_per_second": 53.358, |
| "eval_steps_per_second": 13.34, |
| "step": 2000 |
| }, |
| { |
| "epoch": 0.7975753708725475, |
| "grad_norm": 6.09375, |
| "learning_rate": 3.671451355661882e-05, |
| "loss": 1.5222, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.7975753708725475, |
| "eval_loss": 1.5706853866577148, |
| "eval_runtime": 1.8744, |
| "eval_samples_per_second": 53.351, |
| "eval_steps_per_second": 13.338, |
| "step": 2500 |
| }, |
| { |
| "epoch": 0.957090445047057, |
| "grad_norm": 6.1875, |
| "learning_rate": 3.405635300372142e-05, |
| "loss": 1.4987, |
| "step": 3000 |
| }, |
| { |
| "epoch": 0.957090445047057, |
| "eval_loss": 1.5481228828430176, |
| "eval_runtime": 1.875, |
| "eval_samples_per_second": 53.335, |
| "eval_steps_per_second": 13.334, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.116446004147392, |
| "grad_norm": 6.21875, |
| "learning_rate": 3.1398192450824035e-05, |
| "loss": 1.3145, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.116446004147392, |
| "eval_loss": 1.565281629562378, |
| "eval_runtime": 1.8772, |
| "eval_samples_per_second": 53.272, |
| "eval_steps_per_second": 13.318, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.2759610783219015, |
| "grad_norm": 7.28125, |
| "learning_rate": 2.8740031897926635e-05, |
| "loss": 1.2554, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.2759610783219015, |
| "eval_loss": 1.5643690824508667, |
| "eval_runtime": 1.8766, |
| "eval_samples_per_second": 53.287, |
| "eval_steps_per_second": 13.322, |
| "step": 4000 |
| }, |
| { |
| "epoch": 1.435476152496411, |
| "grad_norm": 7.0, |
| "learning_rate": 2.608187134502924e-05, |
| "loss": 1.2597, |
| "step": 4500 |
| }, |
| { |
| "epoch": 1.435476152496411, |
| "eval_loss": 1.562727451324463, |
| "eval_runtime": 1.8896, |
| "eval_samples_per_second": 52.92, |
| "eval_steps_per_second": 13.23, |
| "step": 4500 |
| }, |
| { |
| "epoch": 1.5949912266709205, |
| "grad_norm": 6.84375, |
| "learning_rate": 2.3423710792131844e-05, |
| "loss": 1.2496, |
| "step": 5000 |
| }, |
| { |
| "epoch": 1.5949912266709205, |
| "eval_loss": 1.560770869255066, |
| "eval_runtime": 1.8771, |
| "eval_samples_per_second": 53.273, |
| "eval_steps_per_second": 13.318, |
| "step": 5000 |
| }, |
| { |
| "epoch": 1.75450630084543, |
| "grad_norm": 6.90625, |
| "learning_rate": 2.076555023923445e-05, |
| "loss": 1.2422, |
| "step": 5500 |
| }, |
| { |
| "epoch": 1.75450630084543, |
| "eval_loss": 1.5582979917526245, |
| "eval_runtime": 1.8771, |
| "eval_samples_per_second": 53.274, |
| "eval_steps_per_second": 13.319, |
| "step": 5500 |
| }, |
| { |
| "epoch": 1.9140213750199395, |
| "grad_norm": 7.4375, |
| "learning_rate": 1.8107389686337057e-05, |
| "loss": 1.2432, |
| "step": 6000 |
| }, |
| { |
| "epoch": 1.9140213750199395, |
| "eval_loss": 1.5532492399215698, |
| "eval_runtime": 1.8789, |
| "eval_samples_per_second": 53.222, |
| "eval_steps_per_second": 13.306, |
| "step": 6000 |
| }, |
| { |
| "epoch": 2.0733769341202746, |
| "grad_norm": 7.5, |
| "learning_rate": 1.544922913343966e-05, |
| "loss": 1.1977, |
| "step": 6500 |
| }, |
| { |
| "epoch": 2.0733769341202746, |
| "eval_loss": 1.5878651142120361, |
| "eval_runtime": 1.8781, |
| "eval_samples_per_second": 53.244, |
| "eval_steps_per_second": 13.311, |
| "step": 6500 |
| }, |
| { |
| "epoch": 2.232892008294784, |
| "grad_norm": 7.53125, |
| "learning_rate": 1.2791068580542265e-05, |
| "loss": 1.15, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.232892008294784, |
| "eval_loss": 1.5915130376815796, |
| "eval_runtime": 1.8844, |
| "eval_samples_per_second": 53.068, |
| "eval_steps_per_second": 13.267, |
| "step": 7000 |
| }, |
| { |
| "epoch": 2.392407082469293, |
| "grad_norm": 7.6875, |
| "learning_rate": 1.0132908027644871e-05, |
| "loss": 1.1389, |
| "step": 7500 |
| }, |
| { |
| "epoch": 2.392407082469293, |
| "eval_loss": 1.5931323766708374, |
| "eval_runtime": 1.8778, |
| "eval_samples_per_second": 53.255, |
| "eval_steps_per_second": 13.314, |
| "step": 7500 |
| }, |
| { |
| "epoch": 2.551922156643803, |
| "grad_norm": 7.4375, |
| "learning_rate": 7.474747474747475e-06, |
| "loss": 1.1464, |
| "step": 8000 |
| }, |
| { |
| "epoch": 2.551922156643803, |
| "eval_loss": 1.5903747081756592, |
| "eval_runtime": 1.8791, |
| "eval_samples_per_second": 53.216, |
| "eval_steps_per_second": 13.304, |
| "step": 8000 |
| }, |
| { |
| "epoch": 2.711437230818312, |
| "grad_norm": 7.46875, |
| "learning_rate": 4.816586921850081e-06, |
| "loss": 1.1446, |
| "step": 8500 |
| }, |
| { |
| "epoch": 2.711437230818312, |
| "eval_loss": 1.590154767036438, |
| "eval_runtime": 1.8787, |
| "eval_samples_per_second": 53.23, |
| "eval_steps_per_second": 13.307, |
| "step": 8500 |
| }, |
| { |
| "epoch": 2.870952304992822, |
| "grad_norm": 8.125, |
| "learning_rate": 2.158426368952685e-06, |
| "loss": 1.1444, |
| "step": 9000 |
| }, |
| { |
| "epoch": 2.870952304992822, |
| "eval_loss": 1.5894922018051147, |
| "eval_runtime": 1.8789, |
| "eval_samples_per_second": 53.221, |
| "eval_steps_per_second": 13.305, |
| "step": 9000 |
| } |
| ], |
| "logging_steps": 500, |
| "max_steps": 9405, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 2.035763059359744e+17, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|