DataBench / eot-2004-raw /trainer_state.json
Harley-ml's picture
Upload 3 files
3fb2833 verified
Raw
History Blame Contribute Delete
5.99 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 2428,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0411946446961895,
"grad_norm": 0.5167902112007141,
"learning_rate": 0.003,
"loss": 5.962776489257813,
"step": 100
},
{
"epoch": 0.082389289392379,
"grad_norm": 0.6578283905982971,
"learning_rate": 0.003,
"loss": 4.3772125244140625,
"step": 200
},
{
"epoch": 0.12358393408856849,
"grad_norm": 0.7207351326942444,
"learning_rate": 0.003,
"loss": 3.604791564941406,
"step": 300
},
{
"epoch": 0.164778578784758,
"grad_norm": 0.49143338203430176,
"learning_rate": 0.003,
"loss": 3.2285305786132814,
"step": 400
},
{
"epoch": 0.2059732234809475,
"grad_norm": 0.5450193881988525,
"learning_rate": 0.003,
"loss": 2.997611083984375,
"step": 500
},
{
"epoch": 0.2059732234809475,
"eval_loss": 2.9541826248168945,
"eval_runtime": 8.7168,
"eval_samples_per_second": 368.256,
"eval_steps_per_second": 46.118,
"step": 500
},
{
"epoch": 0.24716786817713698,
"grad_norm": 0.3710590600967407,
"learning_rate": 0.003,
"loss": 2.8572198486328126,
"step": 600
},
{
"epoch": 0.2883625128733265,
"grad_norm": 0.43497762084007263,
"learning_rate": 0.003,
"loss": 2.7712442016601564,
"step": 700
},
{
"epoch": 0.329557157569516,
"grad_norm": 0.44306352734565735,
"learning_rate": 0.003,
"loss": 2.7086080932617187,
"step": 800
},
{
"epoch": 0.3707518022657055,
"grad_norm": 0.39232972264289856,
"learning_rate": 0.003,
"loss": 2.6619219970703125,
"step": 900
},
{
"epoch": 0.411946446961895,
"grad_norm": 0.34500154852867126,
"learning_rate": 0.003,
"loss": 2.6315206909179687,
"step": 1000
},
{
"epoch": 0.411946446961895,
"eval_loss": 2.648106813430786,
"eval_runtime": 7.4182,
"eval_samples_per_second": 432.722,
"eval_steps_per_second": 54.191,
"step": 1000
},
{
"epoch": 0.45314109165808447,
"grad_norm": 0.3188333213329315,
"learning_rate": 0.003,
"loss": 2.6055862426757814,
"step": 1100
},
{
"epoch": 0.49433573635427397,
"grad_norm": 0.29628098011016846,
"learning_rate": 0.003,
"loss": 2.5831158447265623,
"step": 1200
},
{
"epoch": 0.5355303810504635,
"grad_norm": 0.2794441282749176,
"learning_rate": 0.003,
"loss": 2.567415771484375,
"step": 1300
},
{
"epoch": 0.576725025746653,
"grad_norm": 0.2878789007663727,
"learning_rate": 0.003,
"loss": 2.5535826110839843,
"step": 1400
},
{
"epoch": 0.6179196704428425,
"grad_norm": 0.3040012717247009,
"learning_rate": 0.003,
"loss": 2.5389122009277343,
"step": 1500
},
{
"epoch": 0.6179196704428425,
"eval_loss": 2.558194637298584,
"eval_runtime": 8.0558,
"eval_samples_per_second": 398.469,
"eval_steps_per_second": 49.902,
"step": 1500
},
{
"epoch": 0.659114315139032,
"grad_norm": 0.2754426598548889,
"learning_rate": 0.003,
"loss": 2.5258233642578123,
"step": 1600
},
{
"epoch": 0.7003089598352215,
"grad_norm": 0.2642139196395874,
"learning_rate": 0.003,
"loss": 2.5123500061035156,
"step": 1700
},
{
"epoch": 0.741503604531411,
"grad_norm": 0.31137749552726746,
"learning_rate": 0.003,
"loss": 2.5001824951171874,
"step": 1800
},
{
"epoch": 0.7826982492276005,
"grad_norm": 0.2772506773471832,
"learning_rate": 0.003,
"loss": 2.4918637084960937,
"step": 1900
},
{
"epoch": 0.82389289392379,
"grad_norm": 0.26965758204460144,
"learning_rate": 0.002899325557098001,
"loss": 2.4782290649414063,
"step": 2000
},
{
"epoch": 0.82389289392379,
"eval_loss": 2.5082216262817383,
"eval_runtime": 8.1628,
"eval_samples_per_second": 393.246,
"eval_steps_per_second": 49.248,
"step": 2000
},
{
"epoch": 0.8650875386199794,
"grad_norm": 0.23774883151054382,
"learning_rate": 0.0022915870802995226,
"loss": 2.467481842041016,
"step": 2100
},
{
"epoch": 0.9062821833161689,
"grad_norm": 0.2045634537935257,
"learning_rate": 0.0013644373889485982,
"loss": 2.442911834716797,
"step": 2200
},
{
"epoch": 0.9474768280123584,
"grad_norm": 0.20750091969966888,
"learning_rate": 0.0004919882091667163,
"loss": 2.410100555419922,
"step": 2300
},
{
"epoch": 0.9886714727085479,
"grad_norm": 0.15250912308692932,
"learning_rate": 2.6279207952956684e-05,
"loss": 2.3908013916015625,
"step": 2400
},
{
"epoch": 1.0,
"eval_loss": 2.4129438400268555,
"eval_runtime": 8.274,
"eval_samples_per_second": 387.961,
"eval_steps_per_second": 48.586,
"step": 2428
}
],
"logging_steps": 100,
"max_steps": 2428,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4331665489920000.0,
"train_batch_size": 400,
"trial_name": null,
"trial_params": null
}