Cortex_A_0.5 / checkpoints /checkpoint-16 /trainer_state.json
PRATYUSH-BHARDWAJ's picture
SFT checkpoint step 16
1d17104 verified
Raw
History Blame Contribute Delete
2.51 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.2782608695652174,
"eval_steps": 4,
"global_step": 16,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.017391304347826087,
"grad_norm": NaN,
"learning_rate": 0.0,
"loss": 2.5696372985839844,
"num_input_tokens_seen": 1494,
"num_tokens": 1494.0,
"step": 1,
"train_runtime": 42.4619,
"train_tokens_per_second": 35.185
},
{
"epoch": 0.06956521739130435,
"eval_loss": 5.31978178024292,
"eval_num_tokens": 4980.0,
"eval_runtime": 28.7144,
"eval_samples_per_second": 1.045,
"eval_steps_per_second": 0.279,
"num_input_tokens_seen": 4980,
"step": 4
},
{
"epoch": 0.1391304347826087,
"eval_loss": 5.31978178024292,
"eval_num_tokens": 9004.0,
"eval_runtime": 3.4006,
"eval_samples_per_second": 8.822,
"eval_steps_per_second": 2.353,
"num_input_tokens_seen": 9004,
"step": 8
},
{
"epoch": 0.17391304347826086,
"grad_norm": 28.1390438079834,
"learning_rate": 0.0,
"loss": 2.5477417839898004,
"num_input_tokens_seen": 11145,
"num_tokens": 11145.0,
"step": 10,
"train_runtime": 146.4448,
"train_tokens_per_second": 76.104
},
{
"epoch": 0.20869565217391303,
"eval_loss": 1.7850792407989502,
"eval_num_tokens": 13293.0,
"eval_runtime": 3.4816,
"eval_samples_per_second": 8.617,
"eval_steps_per_second": 2.298,
"num_input_tokens_seen": 13293,
"step": 12
},
{
"epoch": 0.2782608695652174,
"eval_loss": 0.5965744256973267,
"eval_num_tokens": 17742.0,
"eval_runtime": 3.4391,
"eval_samples_per_second": 8.723,
"eval_steps_per_second": 2.326,
"num_input_tokens_seen": 17742,
"step": 16
}
],
"logging_steps": 10,
"max_steps": 58,
"num_input_tokens_seen": 17742,
"num_train_epochs": 1,
"save_steps": 8,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 98232564711424.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}