Cortex_A_0.5 / checkpoints /checkpoint-32 /trainer_state.json
PRATYUSH-BHARDWAJ's picture
SFT checkpoint step 32
ff43960 verified
Raw
History Blame Contribute Delete
4.29 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN, "... is not valid JSON
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.5565217391304348,
"eval_steps": 4,
"global_step": 32,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.017391304347826087,
"grad_norm": NaN,
"learning_rate": 0.0,
"loss": 2.5696372985839844,
"num_input_tokens_seen": 1494,
"num_tokens": 1494.0,
"step": 1,
"train_runtime": 42.4619,
"train_tokens_per_second": 35.185
},
{
"epoch": 0.06956521739130435,
"eval_loss": 5.31978178024292,
"eval_num_tokens": 4980.0,
"eval_runtime": 28.7144,
"eval_samples_per_second": 1.045,
"eval_steps_per_second": 0.279,
"num_input_tokens_seen": 4980,
"step": 4
},
{
"epoch": 0.1391304347826087,
"eval_loss": 5.31978178024292,
"eval_num_tokens": 9004.0,
"eval_runtime": 3.4006,
"eval_samples_per_second": 8.822,
"eval_steps_per_second": 2.353,
"num_input_tokens_seen": 9004,
"step": 8
},
{
"epoch": 0.17391304347826086,
"grad_norm": 28.1390438079834,
"learning_rate": 0.0,
"loss": 2.5477417839898004,
"num_input_tokens_seen": 11145,
"num_tokens": 11145.0,
"step": 10,
"train_runtime": 146.4448,
"train_tokens_per_second": 76.104
},
{
"epoch": 0.20869565217391303,
"eval_loss": 1.7850792407989502,
"eval_num_tokens": 13293.0,
"eval_runtime": 3.4816,
"eval_samples_per_second": 8.617,
"eval_steps_per_second": 2.298,
"num_input_tokens_seen": 13293,
"step": 12
},
{
"epoch": 0.2782608695652174,
"eval_loss": 0.5965744256973267,
"eval_num_tokens": 17742.0,
"eval_runtime": 3.4391,
"eval_samples_per_second": 8.723,
"eval_steps_per_second": 2.326,
"num_input_tokens_seen": 17742,
"step": 16
},
{
"epoch": 0.34782608695652173,
"grad_norm": 6.518080711364746,
"learning_rate": 0.0001425726650926814,
"loss": 0.7919160842895507,
"num_input_tokens_seen": 20264,
"num_tokens": 20264.0,
"step": 20,
"train_runtime": 241.9804,
"train_tokens_per_second": 83.742
},
{
"epoch": 0.34782608695652173,
"eval_loss": 0.6307523250579834,
"eval_num_tokens": 20264.0,
"eval_runtime": 3.512,
"eval_samples_per_second": 8.542,
"eval_steps_per_second": 2.278,
"num_input_tokens_seen": 20264,
"step": 20
},
{
"epoch": 0.41739130434782606,
"eval_loss": 0.3135659396648407,
"eval_num_tokens": 24990.0,
"eval_runtime": 3.4341,
"eval_samples_per_second": 8.736,
"eval_steps_per_second": 2.33,
"num_input_tokens_seen": 24990,
"step": 24
},
{
"epoch": 0.48695652173913045,
"eval_loss": 0.4761301875114441,
"eval_num_tokens": 28628.0,
"eval_runtime": 3.4198,
"eval_samples_per_second": 8.772,
"eval_steps_per_second": 2.339,
"num_input_tokens_seen": 28628,
"step": 28
},
{
"epoch": 0.5217391304347826,
"grad_norm": 3.650630235671997,
"learning_rate": 0.00011490240573865023,
"loss": 0.22239422798156738,
"num_input_tokens_seen": 30604,
"num_tokens": 30604.0,
"step": 30,
"train_runtime": 326.8185,
"train_tokens_per_second": 93.642
},
{
"epoch": 0.5565217391304348,
"eval_loss": 0.2599254846572876,
"eval_num_tokens": 33017.0,
"eval_runtime": 3.409,
"eval_samples_per_second": 8.8,
"eval_steps_per_second": 2.347,
"num_input_tokens_seen": 33017,
"step": 32
}
],
"logging_steps": 10,
"max_steps": 58,
"num_input_tokens_seen": 33017,
"num_train_epochs": 1,
"save_steps": 8,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 182806031368192.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}