Safetensors
mt5
mt5-small-arg-eng / trainer_state.json
sfrenda's picture
Upload folder using huggingface_hub
8031724 verified
Raw
History Blame Contribute Delete
7.57 kB
{
"best_global_step": 1250,
"best_metric": 2.6514861583709717,
"best_model_checkpoint": "/users/sf4003/sharedscratch/lectures/athnlp/mt5-model-arg-eng_parallel-translation/checkpoint-1250",
"epoch": 25.0,
"eval_steps": 500,
"global_step": 1250,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.0,
"eval_loss": 5.835180759429932,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8793,
"eval_samples_per_second": 106.42,
"eval_steps_per_second": 53.21,
"step": 50
},
{
"epoch": 2.0,
"eval_loss": 4.068732738494873,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.886,
"eval_samples_per_second": 106.046,
"eval_steps_per_second": 53.023,
"step": 100
},
{
"epoch": 3.0,
"eval_loss": 3.460021734237671,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8699,
"eval_samples_per_second": 106.96,
"eval_steps_per_second": 53.48,
"step": 150
},
{
"epoch": 4.0,
"eval_loss": 3.172445297241211,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8859,
"eval_samples_per_second": 106.053,
"eval_steps_per_second": 53.026,
"step": 200
},
{
"epoch": 5.0,
"eval_loss": 2.9968864917755127,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8727,
"eval_samples_per_second": 106.798,
"eval_steps_per_second": 53.399,
"step": 250
},
{
"epoch": 6.0,
"eval_loss": 2.915433406829834,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8737,
"eval_samples_per_second": 106.742,
"eval_steps_per_second": 53.371,
"step": 300
},
{
"epoch": 7.0,
"eval_loss": 2.8528802394866943,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8696,
"eval_samples_per_second": 106.973,
"eval_steps_per_second": 53.486,
"step": 350
},
{
"epoch": 8.0,
"eval_loss": 2.8033382892608643,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8631,
"eval_samples_per_second": 107.347,
"eval_steps_per_second": 53.674,
"step": 400
},
{
"epoch": 9.0,
"eval_loss": 2.7748770713806152,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8606,
"eval_samples_per_second": 107.494,
"eval_steps_per_second": 53.747,
"step": 450
},
{
"epoch": 10.0,
"grad_norm": 24.606786727905273,
"learning_rate": 8.004e-05,
"loss": 43.7401875,
"step": 500
},
{
"epoch": 10.0,
"eval_loss": 2.753805637359619,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8401,
"eval_samples_per_second": 108.691,
"eval_steps_per_second": 54.345,
"step": 500
},
{
"epoch": 11.0,
"eval_loss": 2.736203670501709,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8629,
"eval_samples_per_second": 107.36,
"eval_steps_per_second": 53.68,
"step": 550
},
{
"epoch": 12.0,
"eval_loss": 2.7296948432922363,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8608,
"eval_samples_per_second": 107.482,
"eval_steps_per_second": 53.741,
"step": 600
},
{
"epoch": 13.0,
"eval_loss": 2.708575963973999,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8603,
"eval_samples_per_second": 107.509,
"eval_steps_per_second": 53.754,
"step": 650
},
{
"epoch": 14.0,
"eval_loss": 2.7046337127685547,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8571,
"eval_samples_per_second": 107.693,
"eval_steps_per_second": 53.847,
"step": 700
},
{
"epoch": 15.0,
"eval_loss": 2.696824312210083,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8638,
"eval_samples_per_second": 107.308,
"eval_steps_per_second": 53.654,
"step": 750
},
{
"epoch": 16.0,
"eval_loss": 2.685243844985962,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8603,
"eval_samples_per_second": 107.511,
"eval_steps_per_second": 53.756,
"step": 800
},
{
"epoch": 17.0,
"eval_loss": 2.6752429008483887,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8649,
"eval_samples_per_second": 107.246,
"eval_steps_per_second": 53.623,
"step": 850
},
{
"epoch": 18.0,
"eval_loss": 2.6729724407196045,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8652,
"eval_samples_per_second": 107.227,
"eval_steps_per_second": 53.613,
"step": 900
},
{
"epoch": 19.0,
"eval_loss": 2.6718413829803467,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8659,
"eval_samples_per_second": 107.189,
"eval_steps_per_second": 53.595,
"step": 950
},
{
"epoch": 20.0,
"grad_norm": 25.384899139404297,
"learning_rate": 6.004000000000001e-05,
"loss": 24.35806640625,
"step": 1000
},
{
"epoch": 20.0,
"eval_loss": 2.6660306453704834,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.842,
"eval_samples_per_second": 108.579,
"eval_steps_per_second": 54.289,
"step": 1000
},
{
"epoch": 21.0,
"eval_loss": 2.6635730266571045,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8577,
"eval_samples_per_second": 107.66,
"eval_steps_per_second": 53.83,
"step": 1050
},
{
"epoch": 22.0,
"eval_loss": 2.655503273010254,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8572,
"eval_samples_per_second": 107.688,
"eval_steps_per_second": 53.844,
"step": 1100
},
{
"epoch": 23.0,
"eval_loss": 2.654468297958374,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8529,
"eval_samples_per_second": 107.94,
"eval_steps_per_second": 53.97,
"step": 1150
},
{
"epoch": 24.0,
"eval_loss": 2.654360294342041,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8554,
"eval_samples_per_second": 107.793,
"eval_steps_per_second": 53.896,
"step": 1200
},
{
"epoch": 25.0,
"eval_loss": 2.6514861583709717,
"eval_model_preparation_time": 0.0024,
"eval_runtime": 1.8573,
"eval_samples_per_second": 107.682,
"eval_steps_per_second": 53.841,
"step": 1250
}
],
"logging_steps": 500,
"max_steps": 2500,
"num_input_tokens_seen": 0,
"num_train_epochs": 50,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1277763903866880.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}