{ "best_global_step": 6000, "best_metric": 0.25916826725006104, "best_model_checkpoint": "siglip2-image-classification/checkpoint-6000", "epoch": 4.0, "eval_steps": 500, "global_step": 6000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.3333333333333333, "grad_norm": 3.479196786880493, "learning_rate": 0.00018490756302521008, "loss": 0.5047473754882813, "step": 500 }, { "epoch": 0.6666666666666666, "grad_norm": 4.285048007965088, "learning_rate": 0.00016810084033613447, "loss": 0.42015097045898436, "step": 1000 }, { "epoch": 1.0, "grad_norm": 2.655521869659424, "learning_rate": 0.00015129411764705882, "loss": 0.38898434448242186, "step": 1500 }, { "epoch": 1.0, "eval_accuracy": 0.8312134754211069, "eval_loss": 0.37709423899650574, "eval_model_preparation_time": 0.0019, "eval_runtime": 283.3202, "eval_samples_per_second": 112.943, "eval_steps_per_second": 14.118, "step": 1500 }, { "epoch": 1.3333333333333333, "grad_norm": 1.3074887990951538, "learning_rate": 0.0001344873949579832, "loss": 0.3693521728515625, "step": 2000 }, { "epoch": 1.6666666666666665, "grad_norm": 1.2879441976547241, "learning_rate": 0.00011768067226890757, "loss": 0.3484758605957031, "step": 2500 }, { "epoch": 2.0, "grad_norm": 1.5275274515151978, "learning_rate": 0.00010087394957983194, "loss": 0.34061029052734376, "step": 3000 }, { "epoch": 2.0, "eval_accuracy": 0.8569642801337541, "eval_loss": 0.3550371527671814, "eval_model_preparation_time": 0.0019, "eval_runtime": 282.8579, "eval_samples_per_second": 113.127, "eval_steps_per_second": 14.141, "step": 3000 }, { "epoch": 2.3333333333333335, "grad_norm": 4.5269551277160645, "learning_rate": 8.406722689075631e-05, "loss": 0.31870977783203125, "step": 3500 }, { "epoch": 2.6666666666666665, "grad_norm": 1.9202643632888794, "learning_rate": 6.726050420168067e-05, "loss": 0.30601947021484377, "step": 4000 }, { "epoch": 3.0, "grad_norm": 2.203441858291626, "learning_rate": 5.045378151260505e-05, "loss": 0.2938027648925781, "step": 4500 }, { "epoch": 3.0, "eval_accuracy": 0.8811525360167505, "eval_loss": 0.2799703776836395, "eval_model_preparation_time": 0.0019, "eval_runtime": 287.094, "eval_samples_per_second": 111.458, "eval_steps_per_second": 13.933, "step": 4500 }, { "epoch": 3.3333333333333335, "grad_norm": 3.2569119930267334, "learning_rate": 3.364705882352941e-05, "loss": 0.2793130798339844, "step": 5000 }, { "epoch": 3.6666666666666665, "grad_norm": 3.2401018142700195, "learning_rate": 1.6840336134453782e-05, "loss": 0.26365960693359375, "step": 5500 }, { "epoch": 4.0, "grad_norm": 1.6921696662902832, "learning_rate": 3.3613445378151266e-08, "loss": 0.2508096923828125, "step": 6000 }, { "epoch": 4.0, "eval_accuracy": 0.8935591737241789, "eval_loss": 0.25916826725006104, "eval_model_preparation_time": 0.0019, "eval_runtime": 286.6404, "eval_samples_per_second": 111.635, "eval_steps_per_second": 13.955, "step": 6000 } ], "logging_steps": 500, "max_steps": 6000, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.6080385153725334e+19, "train_batch_size": 32, "trial_name": null, "trial_params": null }