DataBench / doab /trainer_state.json
Harley-ml's picture
Upload 3 files
77160ff verified
Raw
History Blame Contribute Delete
5.97 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 2428,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0411946446961895,
"grad_norm": 0.6597224473953247,
"learning_rate": 0.003,
"loss": 6.157908325195312,
"step": 100
},
{
"epoch": 0.082389289392379,
"grad_norm": 0.6448944211006165,
"learning_rate": 0.003,
"loss": 4.372836303710938,
"step": 200
},
{
"epoch": 0.12358393408856849,
"grad_norm": 0.6967822909355164,
"learning_rate": 0.003,
"loss": 3.6461520385742188,
"step": 300
},
{
"epoch": 0.164778578784758,
"grad_norm": 0.41282591223716736,
"learning_rate": 0.003,
"loss": 3.4010238647460938,
"step": 400
},
{
"epoch": 0.2059732234809475,
"grad_norm": 0.3191543221473694,
"learning_rate": 0.003,
"loss": 3.2758245849609375,
"step": 500
},
{
"epoch": 0.2059732234809475,
"eval_loss": 3.237875461578369,
"eval_runtime": 8.2925,
"eval_samples_per_second": 387.096,
"eval_steps_per_second": 48.477,
"step": 500
},
{
"epoch": 0.24716786817713698,
"grad_norm": 0.3816635310649872,
"learning_rate": 0.003,
"loss": 3.1946185302734373,
"step": 600
},
{
"epoch": 0.2883625128733265,
"grad_norm": 0.4032311737537384,
"learning_rate": 0.003,
"loss": 3.121783447265625,
"step": 700
},
{
"epoch": 0.329557157569516,
"grad_norm": 0.30259284377098083,
"learning_rate": 0.003,
"loss": 3.067249450683594,
"step": 800
},
{
"epoch": 0.3707518022657055,
"grad_norm": 0.2819083034992218,
"learning_rate": 0.003,
"loss": 3.027862854003906,
"step": 900
},
{
"epoch": 0.411946446961895,
"grad_norm": 0.2758381962776184,
"learning_rate": 0.003,
"loss": 2.99330078125,
"step": 1000
},
{
"epoch": 0.411946446961895,
"eval_loss": 2.9818687438964844,
"eval_runtime": 8.8898,
"eval_samples_per_second": 361.088,
"eval_steps_per_second": 45.22,
"step": 1000
},
{
"epoch": 0.45314109165808447,
"grad_norm": 0.2729312479496002,
"learning_rate": 0.003,
"loss": 2.961981201171875,
"step": 1100
},
{
"epoch": 0.49433573635427397,
"grad_norm": 0.2777229845523834,
"learning_rate": 0.003,
"loss": 2.935169982910156,
"step": 1200
},
{
"epoch": 0.5355303810504635,
"grad_norm": 0.24782100319862366,
"learning_rate": 0.003,
"loss": 2.91510009765625,
"step": 1300
},
{
"epoch": 0.576725025746653,
"grad_norm": 0.23335237801074982,
"learning_rate": 0.003,
"loss": 2.8987603759765626,
"step": 1400
},
{
"epoch": 0.6179196704428425,
"grad_norm": 0.3017883896827698,
"learning_rate": 0.003,
"loss": 2.8854364013671874,
"step": 1500
},
{
"epoch": 0.6179196704428425,
"eval_loss": 2.8901753425598145,
"eval_runtime": 9.372,
"eval_samples_per_second": 342.508,
"eval_steps_per_second": 42.894,
"step": 1500
},
{
"epoch": 0.659114315139032,
"grad_norm": 0.27505359053611755,
"learning_rate": 0.003,
"loss": 2.8680685424804686,
"step": 1600
},
{
"epoch": 0.7003089598352215,
"grad_norm": 0.28313618898391724,
"learning_rate": 0.003,
"loss": 2.8546218872070312,
"step": 1700
},
{
"epoch": 0.741503604531411,
"grad_norm": 0.2307853400707245,
"learning_rate": 0.003,
"loss": 2.8439126586914063,
"step": 1800
},
{
"epoch": 0.7826982492276005,
"grad_norm": 0.24696213006973267,
"learning_rate": 0.003,
"loss": 2.8371237182617186,
"step": 1900
},
{
"epoch": 0.82389289392379,
"grad_norm": 0.29832541942596436,
"learning_rate": 0.002899325557098001,
"loss": 2.82598876953125,
"step": 2000
},
{
"epoch": 0.82389289392379,
"eval_loss": 2.8335654735565186,
"eval_runtime": 7.8752,
"eval_samples_per_second": 407.609,
"eval_steps_per_second": 51.046,
"step": 2000
},
{
"epoch": 0.8650875386199794,
"grad_norm": 0.21801859140396118,
"learning_rate": 0.0022915870802995226,
"loss": 2.809080810546875,
"step": 2100
},
{
"epoch": 0.9062821833161689,
"grad_norm": 0.18502108752727509,
"learning_rate": 0.0013644373889485982,
"loss": 2.78666015625,
"step": 2200
},
{
"epoch": 0.9474768280123584,
"grad_norm": 0.18302616477012634,
"learning_rate": 0.0004919882091667163,
"loss": 2.760544738769531,
"step": 2300
},
{
"epoch": 0.9886714727085479,
"grad_norm": 0.13551127910614014,
"learning_rate": 2.6279207952956684e-05,
"loss": 2.7378546142578126,
"step": 2400
},
{
"epoch": 1.0,
"eval_loss": 2.7432973384857178,
"eval_runtime": 8.3832,
"eval_samples_per_second": 382.911,
"eval_steps_per_second": 47.953,
"step": 2428
}
],
"logging_steps": 100,
"max_steps": 2428,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4331665489920000.0,
"train_batch_size": 400,
"trial_name": null,
"trial_params": null
}