{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0491228070175438, "eval_steps": 30, "global_step": 150, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.07017543859649122, "grad_norm": 0.4250744879245758, "learning_rate": 0.00019962469712828614, "loss": 0.6094220161437989, "step": 10 }, { "epoch": 0.14035087719298245, "grad_norm": 0.30426689982414246, "learning_rate": 0.00019543482507085482, "loss": 0.5189157009124756, "step": 20 }, { "epoch": 0.21052631578947367, "grad_norm": 0.3195377588272095, "learning_rate": 0.00018678252666130013, "loss": 0.4654271602630615, "step": 30 }, { "epoch": 0.21052631578947367, "eval_loss": 0.4821685254573822, "eval_runtime": 26.1957, "eval_samples_per_second": 9.162, "eval_steps_per_second": 2.29, "step": 30 }, { "epoch": 0.2807017543859649, "grad_norm": 0.2729398012161255, "learning_rate": 0.00017407237375691392, "loss": 0.5165626049041748, "step": 40 }, { "epoch": 0.3508771929824561, "grad_norm": 0.34597083926200867, "learning_rate": 0.0001578986789811849, "loss": 0.5297622203826904, "step": 50 }, { "epoch": 0.42105263157894735, "grad_norm": 0.3952707350254059, "learning_rate": 0.00013901770632605547, "loss": 0.5074038982391358, "step": 60 }, { "epoch": 0.42105263157894735, "eval_loss": 0.47542476654052734, "eval_runtime": 25.7324, "eval_samples_per_second": 9.327, "eval_steps_per_second": 2.332, "step": 60 }, { "epoch": 0.49122807017543857, "grad_norm": 0.2613320052623749, "learning_rate": 0.00011831230908818563, "loss": 0.5146247386932373, "step": 70 }, { "epoch": 0.5614035087719298, "grad_norm": 0.2839556932449341, "learning_rate": 9.675064863002196e-05, "loss": 0.44298686981201174, "step": 80 }, { "epoch": 0.631578947368421, "grad_norm": 0.3424423635005951, "learning_rate": 7.534092423052381e-05, "loss": 0.44837327003479005, "step": 90 }, { "epoch": 0.631578947368421, "eval_loss": 0.472128301858902, "eval_runtime": 25.8951, "eval_samples_per_second": 9.268, "eval_steps_per_second": 2.317, "step": 90 }, { "epoch": 0.7017543859649122, "grad_norm": 0.2950887680053711, "learning_rate": 5.5084230807412126e-05, "loss": 0.4572721481323242, "step": 100 }, { "epoch": 0.7719298245614035, "grad_norm": 0.3997437059879303, "learning_rate": 3.6927748831453836e-05, "loss": 0.4888507843017578, "step": 110 }, { "epoch": 0.8421052631578947, "grad_norm": 0.30841732025146484, "learning_rate": 2.1720455220364444e-05, "loss": 0.4997568130493164, "step": 120 }, { "epoch": 0.8421052631578947, "eval_loss": 0.46787339448928833, "eval_runtime": 25.8471, "eval_samples_per_second": 9.285, "eval_steps_per_second": 2.321, "step": 120 }, { "epoch": 0.9122807017543859, "grad_norm": 0.31729358434677124, "learning_rate": 1.0173426121705576e-05, "loss": 0.45314512252807615, "step": 130 }, { "epoch": 0.9824561403508771, "grad_norm": 0.3034511208534241, "learning_rate": 2.826587782529444e-06, "loss": 0.41479806900024413, "step": 140 }, { "epoch": 1.0491228070175438, "grad_norm": 0.3052826523780823, "learning_rate": 2.347019815158724e-08, "loss": 0.45969629287719727, "step": 150 }, { "epoch": 1.0491228070175438, "eval_loss": 0.46667739748954773, "eval_runtime": 25.8488, "eval_samples_per_second": 9.285, "eval_steps_per_second": 2.321, "step": 150 } ], "logging_steps": 10, "max_steps": 150, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 30, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9766840338321408.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }