checkpoint-9405 / trainer_state.json
MMEX's picture
Upload folder using huggingface_hub
448a272 verified
Raw
History Blame Contribute Delete
7.58 kB
{
"best_global_step": 3000,
"best_metric": 1.5481228828430176,
"best_model_checkpoint": "./models/checkpoint-3000",
"epoch": 3.0,
"eval_steps": 500,
"global_step": 9405,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.1595150741745095,
"grad_norm": 6.21875,
"learning_rate": 4.73471557682084e-05,
"loss": 1.6533,
"step": 500
},
{
"epoch": 0.1595150741745095,
"eval_loss": 1.670200228691101,
"eval_runtime": 1.8707,
"eval_samples_per_second": 53.457,
"eval_steps_per_second": 13.364,
"step": 500
},
{
"epoch": 0.319030148349019,
"grad_norm": 6.5,
"learning_rate": 4.468899521531101e-05,
"loss": 1.5746,
"step": 1000
},
{
"epoch": 0.319030148349019,
"eval_loss": 1.6311461925506592,
"eval_runtime": 1.8699,
"eval_samples_per_second": 53.48,
"eval_steps_per_second": 13.37,
"step": 1000
},
{
"epoch": 0.4785452225235285,
"grad_norm": 6.90625,
"learning_rate": 4.203083466241361e-05,
"loss": 1.5591,
"step": 1500
},
{
"epoch": 0.4785452225235285,
"eval_loss": 1.6131033897399902,
"eval_runtime": 1.8703,
"eval_samples_per_second": 53.466,
"eval_steps_per_second": 13.367,
"step": 1500
},
{
"epoch": 0.638060296698038,
"grad_norm": 6.0,
"learning_rate": 3.9372674109516216e-05,
"loss": 1.5301,
"step": 2000
},
{
"epoch": 0.638060296698038,
"eval_loss": 1.582728624343872,
"eval_runtime": 1.8741,
"eval_samples_per_second": 53.358,
"eval_steps_per_second": 13.34,
"step": 2000
},
{
"epoch": 0.7975753708725475,
"grad_norm": 6.09375,
"learning_rate": 3.671451355661882e-05,
"loss": 1.5222,
"step": 2500
},
{
"epoch": 0.7975753708725475,
"eval_loss": 1.5706853866577148,
"eval_runtime": 1.8744,
"eval_samples_per_second": 53.351,
"eval_steps_per_second": 13.338,
"step": 2500
},
{
"epoch": 0.957090445047057,
"grad_norm": 6.1875,
"learning_rate": 3.405635300372142e-05,
"loss": 1.4987,
"step": 3000
},
{
"epoch": 0.957090445047057,
"eval_loss": 1.5481228828430176,
"eval_runtime": 1.875,
"eval_samples_per_second": 53.335,
"eval_steps_per_second": 13.334,
"step": 3000
},
{
"epoch": 1.116446004147392,
"grad_norm": 6.21875,
"learning_rate": 3.1398192450824035e-05,
"loss": 1.3145,
"step": 3500
},
{
"epoch": 1.116446004147392,
"eval_loss": 1.565281629562378,
"eval_runtime": 1.8772,
"eval_samples_per_second": 53.272,
"eval_steps_per_second": 13.318,
"step": 3500
},
{
"epoch": 1.2759610783219015,
"grad_norm": 7.28125,
"learning_rate": 2.8740031897926635e-05,
"loss": 1.2554,
"step": 4000
},
{
"epoch": 1.2759610783219015,
"eval_loss": 1.5643690824508667,
"eval_runtime": 1.8766,
"eval_samples_per_second": 53.287,
"eval_steps_per_second": 13.322,
"step": 4000
},
{
"epoch": 1.435476152496411,
"grad_norm": 7.0,
"learning_rate": 2.608187134502924e-05,
"loss": 1.2597,
"step": 4500
},
{
"epoch": 1.435476152496411,
"eval_loss": 1.562727451324463,
"eval_runtime": 1.8896,
"eval_samples_per_second": 52.92,
"eval_steps_per_second": 13.23,
"step": 4500
},
{
"epoch": 1.5949912266709205,
"grad_norm": 6.84375,
"learning_rate": 2.3423710792131844e-05,
"loss": 1.2496,
"step": 5000
},
{
"epoch": 1.5949912266709205,
"eval_loss": 1.560770869255066,
"eval_runtime": 1.8771,
"eval_samples_per_second": 53.273,
"eval_steps_per_second": 13.318,
"step": 5000
},
{
"epoch": 1.75450630084543,
"grad_norm": 6.90625,
"learning_rate": 2.076555023923445e-05,
"loss": 1.2422,
"step": 5500
},
{
"epoch": 1.75450630084543,
"eval_loss": 1.5582979917526245,
"eval_runtime": 1.8771,
"eval_samples_per_second": 53.274,
"eval_steps_per_second": 13.319,
"step": 5500
},
{
"epoch": 1.9140213750199395,
"grad_norm": 7.4375,
"learning_rate": 1.8107389686337057e-05,
"loss": 1.2432,
"step": 6000
},
{
"epoch": 1.9140213750199395,
"eval_loss": 1.5532492399215698,
"eval_runtime": 1.8789,
"eval_samples_per_second": 53.222,
"eval_steps_per_second": 13.306,
"step": 6000
},
{
"epoch": 2.0733769341202746,
"grad_norm": 7.5,
"learning_rate": 1.544922913343966e-05,
"loss": 1.1977,
"step": 6500
},
{
"epoch": 2.0733769341202746,
"eval_loss": 1.5878651142120361,
"eval_runtime": 1.8781,
"eval_samples_per_second": 53.244,
"eval_steps_per_second": 13.311,
"step": 6500
},
{
"epoch": 2.232892008294784,
"grad_norm": 7.53125,
"learning_rate": 1.2791068580542265e-05,
"loss": 1.15,
"step": 7000
},
{
"epoch": 2.232892008294784,
"eval_loss": 1.5915130376815796,
"eval_runtime": 1.8844,
"eval_samples_per_second": 53.068,
"eval_steps_per_second": 13.267,
"step": 7000
},
{
"epoch": 2.392407082469293,
"grad_norm": 7.6875,
"learning_rate": 1.0132908027644871e-05,
"loss": 1.1389,
"step": 7500
},
{
"epoch": 2.392407082469293,
"eval_loss": 1.5931323766708374,
"eval_runtime": 1.8778,
"eval_samples_per_second": 53.255,
"eval_steps_per_second": 13.314,
"step": 7500
},
{
"epoch": 2.551922156643803,
"grad_norm": 7.4375,
"learning_rate": 7.474747474747475e-06,
"loss": 1.1464,
"step": 8000
},
{
"epoch": 2.551922156643803,
"eval_loss": 1.5903747081756592,
"eval_runtime": 1.8791,
"eval_samples_per_second": 53.216,
"eval_steps_per_second": 13.304,
"step": 8000
},
{
"epoch": 2.711437230818312,
"grad_norm": 7.46875,
"learning_rate": 4.816586921850081e-06,
"loss": 1.1446,
"step": 8500
},
{
"epoch": 2.711437230818312,
"eval_loss": 1.590154767036438,
"eval_runtime": 1.8787,
"eval_samples_per_second": 53.23,
"eval_steps_per_second": 13.307,
"step": 8500
},
{
"epoch": 2.870952304992822,
"grad_norm": 8.125,
"learning_rate": 2.158426368952685e-06,
"loss": 1.1444,
"step": 9000
},
{
"epoch": 2.870952304992822,
"eval_loss": 1.5894922018051147,
"eval_runtime": 1.8789,
"eval_samples_per_second": 53.221,
"eval_steps_per_second": 13.305,
"step": 9000
}
],
"logging_steps": 500,
"max_steps": 9405,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.035763059359744e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}